쇼츠 광고 만들기 with Claude

고양이, 세제를 팔다 — 자연어 요청 15번으로 광고 쇼츠 완성

지난 주말, 재미있는 실험을 하나 했다. 브리티시 숏헤어 고양이가 세제를 파는 광고 영상을 만들어보고 싶었다. 영상 편집을 배운 적은 없다. 결론부터 말하면, 약 1시간 반 만에 자막·나레이션·음악까지 들어간 18초짜리 광고가 완성됐다. 그리고 그 시간 동안 내가 한 일은 자연어로 요청한 것 15번과 클릭 몇 번이 전부다.

결과물: https://youtube.com/shorts/JF30oJIgtxA?feature=share

시작은 두루뭉술한 한 문장이었다

내가 AI(Claude)에게 처음 던진 말은 정리된 기획서가 아니었다. 거의 이대로였다.

"새로운 영상을 제작하려고 해. 쓸 거는 Claude, Grok 이미지 생성, VREW 자막·나레이션. 여기에 뭘 더 해야 진짜 광고처럼 멋지게 만들 수 있을까? 브리티시 숏헤어 고양이가 주인공이고, 실제 세제 같은 걸 파는 광고 영상을 만들고 싶어. 스토리하고 실사 이미지하고 음악하고, 나레이션 등 광고 쇼츠를 만들어보고 싶어."

돌아온 것은 두 가지였다. 첫째, 내 도구 목록의 빈틈 분석 — "이미지를 영상으로 만들 모션 도구와 음악이 빠져 있는데, 모션은 이미 쓰고 있는 Grok 안에 있고 음악은 Suno를 쓰면 된다." 둘째, 몇 가지 선택지였다. 영상 길이는? 톤은? 브랜드는 실제 제품을 쓸 건가? 나는 클릭 세 번으로 답했다. 15초 세로형, B급 유머, 가상 브랜드.


그러자 AI가 브랜드를 만들어 왔다. 이름은 '뽀득냥'. 슬로건은 이거였다.

"털 빼고 다 지웁니다."

배우 캐스팅부터 오디션이었다

"좋아, 일단 만들어보는 순서로 진행해보자"라고 하자 작업이 시작됐다. 첫 단계는 주인공 캐스팅. 여기서 재미있는 제안이 나왔다. 5개 컷을 바로 만드는 게 아니라, 가장 단순한 구도로 고양이 후보 4마리를 먼저 뽑아 '오디션'을 보자는 것이다. 무표정한가, 정장 핏이 자연스러운가, 실사 질감인가, 브리티시 숏헤어 특유의 구리빛 눈인가 — 심사 기준도 네 가지로 정해져 있었다.

나는 "니가 진행해봐"라고 위임했다. 그러자 AI가 내 Chrome 브라우저를 직접 조작하기 시작했다. Grok에 접속해 화질 모드와 9:16 비율을 설정하고, 프롬프트를 입력하고, 생성된 후보 4마리를 심사평과 함께 가져왔다. 나는 추천받은 4번 후보를 승인했다. 정장을 입고 세상 진지한 표정으로 앉아 있는, 완벽한 '기업 임원' 인상의 고양이였다.

4:1 오디션을 통과한 공식 배우. 무표정, 정장 핏, 구리빛 눈 — 심사 기준 4개를 모두 통과했다.

같은 배우가 모든 컷에

같은 프롬프트를 복사해 붙여넣는 게 아니라, 공식 배우 이미지를 열어놓고 "이 고양이 그대로, 장면만 사무실 문 앞으로"라는 식으로 편집 생성하는 방식이다. 이 방법으로 문을 박차고 등장하는 히어로 컷, 회의실에서 제품을 내미는 컷, 빛나는 셔츠 옆에서 흐뭇하게 눈을 감은 컷까지 — 다섯 컷 전부 같은 고양이가 유지됐다.

음악은 데이터로 골랐다

음악은 Suno로 만들었다. "진지한 오케스트라로 시작했다가 갑자기 코믹하게 반전되는 20초 광고 음악" — 이 콘셉트로 2곡이 나왔다. 흥미로웠던 건 선곡 과정이다. AI가 두 곡의 초당 음량 파형을 분석하더니, "B번 곡은 21초에 소리가 뚝 끊겼다가 22초에 최대 타격이 온다. 이 타이밍이 슬로건 등장 순간과 정확히 맞물린다"며 추천해 왔다. 음악을 귀가 아니라 데이터로 고를 수 있다는 걸 처음 알았다. 물론 최종 선택은 내 귀로 했다.

참고로 이 단계에서 내가 기여한 것은 캡차(사람 확인) 퍼즐을 푼 것이다.

조립, 그리고 보이지 않는 손

재료가 다 모이자 AI가 클라우드 작업 환경에서 조립을 시작했다. 컷당 3.5초 트림, 컷별 자막(한글 폰트, 검정 외곽선), 마지막 컷의 "뽀득냥®" 로고 오버레이, 원본 효과음과 음악의 볼륨 밸런스, 끝의 페이드아웃까지. 그리고 조립본의 프레임을 다시 뽑아 자막이 깨지지 않았는지 스스로 검수했다.

나레이션은 VREW 웹 버전에서 입혔는데, 실패다. 음악만 들어갔다.

얼룩 사고 → 히어로 등장 → 제품 프레젠테이션 → 비포/애프터 → 로고샷. 다섯 컷 전부 같은 배우다.

마지막 내보내기에서 내가 한 일은 저장 버튼을 누른 것이다. Windows의 저장 창은 AI 눈에 보이지 않는 영역이라, 이것도 사람 몫이었다.

검수도 감이 아니라 측정

"저장 완료했어, 최종본 검수해줘"라고 하자 검수 리포트가 왔다. 길이 18.0초, 해상도 720×1280 정상. 프레임 5장 추출로 자막·로고 렌더링 확인. 음성 대역 에너지가 나레이션 넣기 전보다 +2.7dB 상승 — 나레이션이 정상 믹싱됐다는 뜻이다. 최대 음량 -1.1dB로 소리 깨짐 없음. 영상 품질을 이렇게 수치로 검증받아본 것도 처음이다.

이 실험에서 배운 네 가지

1. 다운로드는 조용히 실패한다. 클립 5개를 받았는데 2개가 임시파일로 숨어 있었다. AI가 파일 개수·크기·파일 헤더까지 검증해 찾아내 복구했다. "됐겠지"가 아니라 확인이 기본이라는 것

2. AI가 못 하는 일은 명확히 정해져 있다. 캡차 풀기, OS 저장 창 클릭, 그리고 취향 판단. 이번 프로젝트에서 사람이 반드시 필요했던 일은 이 셋뿐이었다. 거꾸로 말하면, 나머지 전부는 위임이 가능하다는 뜻이다. 그렇다고 이렇게 하다가는...

3. 일관성은 프롬프트가 아니라 참조에서 나온다. 같은 설명문을 반복하는 것보다 확정된 이미지를 편집하는 쪽이 캐릭터 유지에 압도적으로 유리했다.

4. 과정 전체가 자산이 된다. 작업이 끝난 뒤 이 워크플로우 전체 — 프롬프트 템플릿, 캐릭터 일관성 기법, 시행착오와 해법까지 — 를 재사용 가능한 '스킬'로 저장했다. 다음 영상은 이 스킬을 업그레이드 하는 것을 ...


2
2개의 답글
밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.