[Gemini] 숏폼 드라마 생성 시스템 만들기 - V2V 방식 시행착오

📝 한줄 요약

기존 숏폼을 그대로 copy해 보려는 목적.

클로드코드로 기존 I2V(Image-to-Video) 방식의 한계였던 '앵글 불일치'를 Antigravity>Gemini를 통해 V2V(Video-to-Video) 방식으로 진행해보고, 1-Take 바이럴 영상을 완벽하게 카피해보려는 파이프라인을 구축해 보려고 함


📊 Before vs. After 비교

항목

Claude 방식 (Before)

Gemini 방식 (After)

개선 효과

핵심 기법

I2V (이미지 → 영상)

V2V (영상 → 영상 Edit)

일관성 혁명

사용 모델

Hailuo 2.3 / Wan

Kling O1 Edit (fal.ai)

최신 추론형 모델 활용

앵글/배경

컷마다 미세하게 변화 (어색함)

원본 구도/배경 100% 보존

완벽한 1-Take 구현

캐릭터 제어

프롬프트 상상력에 의존

레퍼런스 이미지 정밀 매핑

캐릭터 정체성 강화

제작 난이도

스토리보드/콘티 작업 필수

레퍼런스 영상만 있으면 가능

제작 효율성 극대화


😫 기존 방식의 한계 (Before: I2V)

  • 카메라 제어 불능: "고정 앵글"을 명시해도 AI가 멋대로 패닝하거나 줌을 하여 캐릭터가 화면 밖으로 나가는 현상 발생.

  • 캐릭터 붕괴: 씬이 바뀔 때마다 고양이와 코기의 외형(무늬, 크기)이 미묘하게 달라져 몰입도가 떨어짐.

  • 생성 비용 낭비: 원하는 동작이 나올 때까지 수차례 재생성(Gacha)을 반복하며 비용($3.36+) 발생.

🚀 새로운 접근 (After: V2V Reconstruction)

  • 원본 영상 가이드: 실제 바이럴 영상(12초)을 가이드로 사용하여 물리적 움직임과 카메라 구도를 고정.

  • Kling O1 Edit 활용: elements 파라미터를 통해 '나비(고양이)'와 '뭉치(코기)' 레퍼런스 이미지를 원본 인물에 1:1로 매핑하여 교체.

  • 결과: 배경은 그대로인데 캐릭터만 AI 동물로 바뀐, 자연스러운 1-Take 영상 확보 성공.


⚠️ 새로운 기술적 도전 (New Troubleshooting)

V2V로 '일관성'은 잡았지만, 고도화를 위해 해결해야 할 2가지 숙제가 남았습니다.

  1. Ghost Phone (잔상 현상):

  • AI가 휴대폰을 침대 배경의 일부로 인식하여, 캐릭터가 폰을 가져간 뒤에도 침대에 폰 잔상이 남는 문제.

  • 해결: 해당 구간만 클린 플레이트로 덮는 포스트 마스킹(Post-Masking) 도입.

  1. 10초의 벽 (서사 누락):

  • Kling V2V 모델의 생성 제한(10초)으로 인해 12초 원본의 결말(반전 장면)이 잘림.

  • 해결: 영상을 7초 + 5초로 분할 생성ffmpeg로 정교하게 이어 붙이는 2-Stage 파생 전략 수립.


💡 결론: V2V가 영상 카피하는 데에는 성능이 짱.

단순히 "이미지를 움직이는 것(I2V)"과 "기존의 움직임을 유지하며 스타일을 바꾸는 것(V2V)"은 결과물의 차원이 다른 듯. 특히 1-Take 바이럴 영상 재현에서는 V2V가 압도적인 효율과 품질을 보여주는 듯.

Next Step: 잔상 제거 마스킹 작업 및 분할 생성 스크립트 실행으로 최종 12초 완성본 제작 예정.

밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.