📝 한줄 요약
기존 숏폼을 그대로 copy해 보려는 목적.
클로드코드로 기존 I2V(Image-to-Video) 방식의 한계였던 '앵글 불일치'를 Antigravity>Gemini를 통해 V2V(Video-to-Video) 방식으로 진행해보고, 1-Take 바이럴 영상을 완벽하게 카피해보려는 파이프라인을 구축해 보려고 함
📊 Before vs. After 비교
항목
Claude 방식 (Before)
Gemini 방식 (After)
개선 효과
핵심 기법
I2V (이미지 → 영상)
V2V (영상 → 영상 Edit)
일관성 혁명
사용 모델
Hailuo 2.3 / Wan
Kling O1 Edit (fal.ai)
최신 추론형 모델 활용
앵글/배경
컷마다 미세하게 변화 (어색함)
원본 구도/배경 100% 보존
완벽한 1-Take 구현
캐릭터 제어
프롬프트 상상력에 의존
레퍼런스 이미지 정밀 매핑
캐릭터 정체성 강화
제작 난이도
스토리보드/콘티 작업 필수
레퍼런스 영상만 있으면 가능
제작 효율성 극대화
😫 기존 방식의 한계 (Before: I2V)
카메라 제어 불능: "고정 앵글"을 명시해도 AI가 멋대로 패닝하거나 줌을 하여 캐릭터가 화면 밖으로 나가는 현상 발생.
캐릭터 붕괴: 씬이 바뀔 때마다 고양이와 코기의 외형(무늬, 크기)이 미묘하게 달라져 몰입도가 떨어짐.
생성 비용 낭비: 원하는 동작이 나올 때까지 수차례 재생성(Gacha)을 반복하며 비용($3.36+) 발생.
🚀 새로운 접근 (After: V2V Reconstruction)
원본 영상 가이드: 실제 바이럴 영상(12초)을 가이드로 사용하여 물리적 움직임과 카메라 구도를 고정.
Kling O1 Edit 활용:
elements파라미터를 통해 '나비(고양이)'와 '뭉치(코기)' 레퍼런스 이미지를 원본 인물에 1:1로 매핑하여 교체.결과: 배경은 그대로인데 캐릭터만 AI 동물로 바뀐, 자연스러운 1-Take 영상 확보 성공.
⚠️ 새로운 기술적 도전 (New Troubleshooting)
V2V로 '일관성'은 잡았지만, 고도화를 위해 해결해야 할 2가지 숙제가 남았습니다.
Ghost Phone (잔상 현상):
AI가 휴대폰을 침대 배경의 일부로 인식하여, 캐릭터가 폰을 가져간 뒤에도 침대에 폰 잔상이 남는 문제.
해결: 해당 구간만 클린 플레이트로 덮는 포스트 마스킹(Post-Masking) 도입.
10초의 벽 (서사 누락):
Kling V2V 모델의 생성 제한(10초)으로 인해 12초 원본의 결말(반전 장면)이 잘림.
해결: 영상을 7초 + 5초로 분할 생성 후
ffmpeg로 정교하게 이어 붙이는 2-Stage 파생 전략 수립.
💡 결론: V2V가 영상 카피하는 데에는 성능이 짱.
단순히 "이미지를 움직이는 것(I2V)"과 "기존의 움직임을 유지하며 스타일을 바꾸는 것(V2V)"은 결과물의 차원이 다른 듯. 특히 1-Take 바이럴 영상 재현에서는 V2V가 압도적인 효율과 품질을 보여주는 듯.
Next Step: 잔상 제거 마스킹 작업 및 분할 생성 스크립트 실행으로 최종 12초 완성본 제작 예정.