안티그래비티와 클로드코드로 왕과사는남자 뮤비를 만들어 보았습니다.

AI로 뮤직비디오를 만들다 — 72시간, $34로 완성한 5분 9초 MV 제작기

영화 《왕과 사는 남자》의 감동을 Suno AI + Imagen 4.0 + Veo 3.0 + Claude Code로 재탄생시킨 풀 파이프라인 기록

긴글 안좋아 하시는 분은 아래 링크에서 시각화한 자료로 보셔도 됩니다.

ai cloud 4 이미지 10월

https://wangsanim-presentation.vercel.app/


TL;DR

항목

수치

제작 기간

72시간 (3일)

러닝타임

5:09

총 비용

~$34

AI 이미지

80+ 장 (Imagen 4.0)

AI 영상 클립

60개 (Veo 3.0)

씬 구성

13씬

시행착오

7개 (솔직하게 다 공개)


왜 이 프로젝트를 시작했나

2026년 3월, 영화 《왕과 사는 남자》를 보고 큰 감동을 받았습니다.

단종과 엄흥도 — 왕과 신하가 아닌, 사람과 사람으로 만난 두 남자의 이야기. 이 감동을 음악과 영상으로 표현하고 싶었습니다.

문제는 저는 영상 전문가도, 일러스트레이터도, 작곡가도 아니라는 점이었습니다. 하지만 2026년의 AI 도구들을 조합하면?

  • Suno AI로 작곡

  • Imagen 4.0으로 그림

  • Veo 3.0으로 영상

  • Claude Code로 오케스트레이션

결과: 72시간, $34로 5분 9초 뮤직비디오 완성.


7단계 AI 제작 파이프라인

Phase 1: 원작 분석 ──→ Phase 2: AI 작곡 (Suno AI)
                              │
                              ▼
Phase 3: 스토리보드 (Antigravity + Grok)
                              │
                              ▼
Phase 4: AI 이미지 생성 (Imagen 4.0) ──→ Phase 5: AI 영상 클립 (Veo 3.0)
                                                          │
                                                          ▼
                              Phase 6: ffmpeg 편집 ──→ Phase 7: 자막 & 최종 출력

핵심 원칙: 음원 먼저, 씬 나중. 음원의 에너지 프로파일이 씬 분할의 근거가 됩니다.


72시간의 여정

DAY 1 — 3월 20일: 기획 & 레퍼런스 (12시간)

20:33 — 원작 분석 시작. 줄거리, 캐릭터, 테마를 12KB 문서로 정리. 핵심 모티프 4개 도출:

  • 강 (유배→죽음)

  • 줄 (뗏목→활줄)

  • 밥상 (거부→소속)

  • 이름 (왕→인간)

20:59 — Suno AI로 음원 4종 생성. “강을건너다 5번스타일” (5:09, D단조, 6/8박) 최종 선택. 대금+가야금+스트링스의 서정적 발라드.

21:30 — YouTube 김만오 리뷰(183만뷰) 분석. 댓글 200개 감성 분석으로 “밥상”, “한”, “정” 키워드 도출 → 가사 모티프 결정.

22:50~23:57 — 프로덕션 패키지 v4 → v5 → v6 진화.

🔴 시행착오 #1: v4에서 11씬으로 기획했으나, 음원 에너지 분석 후 에너지 변화점이 더 많아 13씬으로 재조정. 음원 없이 씬을 나눈 것이 문제.


DAY 2 — 3월 21일: 이미지 & 영상 생성 (24시간)

00:13 — 스토리보드 v7 최종 확정. 13씬 완전 명세 — 씬별 타임코드, 카메라, 조명, hex 컬러, 감정 곡선, 전환 지시.

03:16~07:30 — 이미지 생성 본격 시작:

  • Imagen 4.0: 57장 (메인) — “Korean historical sageuk webtoon/manhwa illustration style”

  • Codex: 66장 (비교용)

  • 총 비용: ~$4

04:26~06:32 — Kling AI 영상 테스트… 실패.

🔴 시행착오 #3: 5건 테스트 후 스타일 불일치 확인. 2시간 낭비. 1~2컷만 비교하면 30분이면 충분했다. → Veo 3.0으로 전환.

12:28~ — Veo 3.0 영상 클립 배치 생성 시작. 총 60개 클립.

🔴 시행착오 #4: 순차 1개씩 제출하여 9개에 3시간+ 소요. Veo 3.0은 동시 3~4개 가능한데 몰랐다.

🔴 시행착오 #5: Rate Limit 재시도 [30, 60, 120]초 — 30초는 거의 항상 429 에러. 실제 쿨다운은 60~90초 필요.


DAY 3 — 3월 22일: 편집 & 완성 (24시간)

04:20 — 가사 v2 (김이나 스타일): 단어 수 15% 감소, 은유 밀도 2배.

20:41최종 MV 인코딩 완료! “0.왕사님 뮤비.mp4” (306MB, 5:09, 1280×720 24fps)

23:36 — ffmpeg로 41개 클립 연결 + 음원 합성.


POST-PRODUCTION — 3월 30일 ~ 4월 7일

3/31 — 스토리보드 v7 대비 불일치 구간 식별. 핵심 5씬 보강 계획 수립.

4/1MV v5 최종본 완성 (148MB). SRT 가사 자막 3종, 썸네일 7종, 유튜브 업로드 패키지 완성.

4/7MV2 “벗” 기획안 작성. 엄흥도 시점, 10씬, 2.39:1 시네마스코프.


13씬 스토리보드

#

씬 제목

시간

감정

01

전주 — 대금 독주

0:00-0:10

고요

02

“나는 이제 어디로”

0:10-0:30

상실

03

“이 산골에 왕은 없다”

0:30-0:52

공포, 고립

04

“절벽 끝에 서서”

0:52-1:04

절망→구원

05

“밥 한 술에 벽이 무너지고”

1:04-1:20

돌파

06

“왕이 아닌 내가 되어”

1:20-1:50

환희→용기

07

“태산아, 이리 와 앉아라”

2:00-2:30

평화, 소속

08

“더 이상 나로 인해”

2:30-2:48

불안, 예감

09

“너를 살릴 거짓을”

2:48-3:14

비장한 희생

10

“태산이 짠 활줄을”

3:14-3:38

체념, 사의

11

“전하… 이제 강을 건널 때입니다”

3:38-4:08

수용

12

“왕이었던 소년이”

4:08-4:44

절대 클라이맥스

13

“따뜻한 데로 갑시다”

4:44-5:09

카타르시스


7가지 시행착오와 교훈

1. 음원 없이 씬 분할

  • 문제: 11씬 → 음원 분석 후 13씬으로 재조정

  • 교훈: 음원 확보 → librosa 에너지 분석 → 자동 씬 분할

2. 레퍼런스 과잉 추출

  • 문제: 500+장 추출, 실사용 ~30장 (활용률 6%)

  • 교훈: 씬당 3~5장 타겟팅 + 콘택트 시트로 필터링

3. Kling AI 2시간 낭비

  • 문제: 부적합한 도구로 5건 테스트

  • 교훈: 동일 이미지 1장으로 3종 도구 비교 (30분)

4. 순차 1개씩 클립 생성

  • 문제: 9개 클립에 3시간+

  • 교훈: Veo 3.0은 동시 3~4개 가능. 배치 제출 + 90초 간격

5. Rate Limit 쿨다운 부족

  • 문제: [30, 60, 120]초 → 30초는 거의 항상 실패

  • 교훈: [60, 90, 120]초 + 3회 실패 시 fal.ai 폴백

6. 이미지 3번에 나눠 생성

  • 문제: 57장 → 9장 → 3장 (3일에 걸쳐 분산)

  • 교훈: prompts.json 완성 후 한 번에 일괄 생성

7. 최종 버전 혼동

  • 문제: 306MB vs 97MB 두 파일, 어느 것이 최종인지 불명확

  • 교훈: FINAL_{프로젝트명}_v{N}.mp4 명명 규칙


비용 분석

도구

수량

단가

비용

Suno AI (작곡)

4곡

~$0.50

~$2

Imagen 4.0 (이미지)

80장

$0.04

$3.20

Codex (비교용)

66장

~$0.01

~$0.66

Veo 3.0 (영상)

60클립

$0.50

$30

fal.ai (폴백)

~3클립

$0.10

~$0.30

ffmpeg / Claude Code

전 과정

$0

합계

~$34

비용의 88%가 Veo 3.0 영상 클립. 최적화하면 ~$20까지 줄일 수 있습니다.


실제 vs 최적화 워크플로우

항목

실제 (첫 시도)

최적화 (교훈 반영)

절감

총 소요

72시간

~12시간

-83%

씬 분할

수동 → 재조정

에너지 분석 자동

-75%

레퍼런스

500+장

씬당 3~5장

-83%

도구 테스트

2시간

30분

-75%

이미지 생성

3일 분산

1회 일괄

-91%

영상 생성

순차 1개씩

배치 3~4개

-85%

비용

~$34

~$20

-41%


3가지 핵심 원칙

1. 음원 먼저, 씬 나중

에너지 프로파일이 씬 분할의 근거. librosa RMS 분석으로 자동화 가능.

2. 한 번에 확정, 한 번에 생성

prompts.json 완성 → --dry-run으로 목록 확인 → 한 번에 생성.

3. 1장 테스트, N장 실행

도구 비교는 1장으로. 본 작업은 배치로.


다음 프로젝트: MV2 “벗”

같은 세계, 다른 시선.

MV1 “강을 건너다”

MV2 “벗”

시점

단종 (왕)

엄흥도 (벗)

감정

절망→회복→희생

걱정→교감→이별

구조

13씬 시간순

10씬 3-트랙 교차

비율

16:9

2.39:1 시네마스코프

러닝타임

5:09

3:10

예상 비용

$34

~$14


마무리

이 프로젝트가 증명한 것:

AI 도구의 조합으로 전문가가 아닌 사람도 감동적인 뮤직비디오를 만들 수 있습니다.

물론 완벽하지는 않습니다. 캐릭터 일관성, Rate Limit, 버전 관리 등 수많은 시행착오가 있었습니다. 하지만 72시간, $34로 5분 9초의 뮤직비디오를 만들어낸 것 자체가 2026년 AI 크리에이티브 도구의 가능성을 보여줍니다.

다음에는 12시간, $20으로 만들 수 있을 것입니다. 시행착오에서 배웠으니까요.

“나으리… 차갑지요. 이제 나갑시다. 따뜻한 데로 갑시다.”


크레딧

  • 원작: 영화 《왕과 사는 남자》 (2026, 장항준 감독)

  • 음원: Suno AI

  • 이미지: Google Imagen 4.0

  • 영상: Google Veo 3.0, SeedAnce, fal.ai

  • 오케스트레이션: Claude Code (Opus 4.6)

📽️ 눈물 참을 자신 있는 분만 시청 부탁드립니다.

https://youtu.be/lDmsLCnjWNk

밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.