한 줄 요약
영상 제작 시, Suno로 음악을 먼저 만들고 이미지를 생성하면 TTS 고민 없이 쇼츠를 만들 수 있습니다.
바쁘시면 이것만 읽어도 돼요
가사를 잘 설계해서 Suno로 노래를 먼저 만들고, Codex로 이미지와 컷 구성을 짜고, Grok으로 짧은 영상을 많이 생성했습니다.
가사를 주니까 AI가 감정 흐름을 읽고 컷 순서까지 직접 배치해줬습니다.
Suno 가사는 "1절→후렴→2절→후렴" 구조를 미리 설계해야 결과물이 좋습니다.
이미지를 한 장씩 비디오로 변환 후 Capcut에서 합치면 통일성과 퀄리티가 훨씬 좋습니다.
Suno 유료 결제 필수 — 홍보물로 음원을 쓰려면 저작권 때문에 무료 버전으로는 안 됩니다.
이런 분들께 도움돼요
1인 창업자나 소규모 팀에서 홍보 영상이 필요한 분
AI 도구에 관심은 있는데 뭘 어떻게 조합해야 할지 모르는 분
영상 제작 경험 없이 쇼츠 콘텐츠를 만들어보고 싶은 분
사용한 도구
Suno: AI 음악 생성 (노래 만들기)
ChatGPT: 참고 이미지 생성
Codex (OpenAI): 이미지 생성, 컷 순서 설계, 영상 프롬프트 작성, 파일 정리
Grok (xAI): AI 영상 생성
Capcut: 음악과 비디오 파일 편집
작업 과정
노래부터 만들자 — Suno에서 1분짜리 음악 완성
토옵이 스터디장님께서 Suno 음악 잘 만드는 팁을 주셨는데, 영어 프롬프트를 미리 만들고, 가사 구조를 명확히 지정하는 것입니다. "1절 → 후렴 → 2절 → 후렴" 구조로 스타일을 영어로 다양하게 만들어보았습니다. (Codex)
맨날 답만 찾던 나의 하루
머릿속은 빙글빙글 미로
AI가 척척 답을 줘도
내 생각은 어디 있을까
질문해 질문해 생각이 쑥쑥
머릿속 별들이 반짝반짝
틀려도 괜찮아 다시 해보자
여긴 질문연구소Suno 버전에 따라 결과물 차이가 컸습니다. Suno 4.5로 생성한 곡과 5.5로 생성한 곡은 퀄리티 차이가 확연했습니다. 결국 Suno도 유료 결제를 했습니다. 홍보물로 음원을 쓰려면 저작권 문제 때문에 유료 플랜이 필수입니다.
이미지가 필요하다 — ChatGPT로 참고 이미지, Codex로 본격 생성
영상을 만들려면 장면별 이미지가 필요했습니다. 먼저 ChatGPT로 질문연구소 세계관에 맞는 참고 이미지 2장을 만들었습니다. 이 이미지를 Codex에 넘기면서 이렇게 요청했습니다.
수노에서 이렇게 노래를 만들었어. 이 노래로 영상을 만들고 싶은데, 어울리는 이미지를 생성해줘. 세로형 쇼츠를 만들거라 이미지는 한장 한장 세로로 만들어줘. 가로형 말고 9:16 이미지를 5장 만들어줘. 이 이미지는 그록에서 영상으로 만들거야.Codex가 참고 이미지의 분위기를 파악해서, 같은 세계관으로 통일된 5장을 만들어줬습니다. 교실에서 질문이 떠오르는 오프닝, 질문연구소로 달려가는 모험, 아이디어가 반짝이는 상상, 함께 협업하는 장면, 감성적인 엔딩까지. 결과물이 괜찮아서 바로 추가 요청을 했습니다.
아주 좋아. 같은 스타일로 추가 5장 더 제작한 후에 노래 흐름에 맞추어 컷 순서를 정해주고, 영상 프롬프트를 그록용으로 장면별로 작성해줘.이렇게 해서 총 11장의 이미지가 완성됐습니다. 그록에서 프롬프트를 직접 작성해서 이미지를 만드는 것보다 Codex에서 생성한 이미지가 원하는 장면에 훨씬 가까웠습니다.
가사를 주니까 음악 PD가 됐다 — 감정선 기반 컷 재배치
Codex가 가사의 감정 흐름을 분석해서 "불안/탐색 → 질문의 시작 → 반짝임 → 자신감 → 선언" 구조로 파악하고, 11장의 이미지를 이 흐름에 맞춰 다시 배치했습니다. 초반은 짧게 호기심을 쌓고, 후렴과 엔딩은 길게 잡는 식으로요.
"맨날 답만 찾던 나의 하루"에는 교실에서 혼자 앉아 생각에 잠긴 컷, "질문해 질문해 생각이 쑥쑥"에는 종이비행기를 타고 상상 세계로 날아 가는 컷을 배치하는 식이었습니다. 마치 음악 PD가 옆에서 스토리보드를 짜주는 느낌이었습니다.
그록으로 영상 생성 — 시행착오 끝에 찾은 방법
GPT Image 2로 미리 만든 이미지를 그록에서 한 장씩 비디오로 10초씩 변환하고, 캡컷에서 합치는 방식을 결론적으로 채택했습니다. 이렇게 하면 이미지 간 통일성이 유지되고 퀄리티도 훨씬 좋았습니다. 한 번에 여러 장면을 영상으로 만들려고 하면 스타일이 뒤섞이는데, 한 장씩 변환하면 각 장면의 품질을 하나하나 확인할 수 있었습니다.
캡컷에서 최종 합치기 — 영상 완성
AI가 만들어준 소스들이 모두 준비되자, 마지막은 캡컷에서 합치는 일만 남았습니다. 그록에서 한 장씩 변환한 비디오 파일들을 타임라인 순서대로 배치하고, Suno에서 만든 음악 파일을 얹었습니다. 컷 순서와 타이밍은 Codex가 이미 설계해뒀기 때문에, 캡컷에서는 말 그대로 파일을 넣고 순서대로 이어붙이기만 하면 됐습니다. 영상 편집이라고 부르기 민망할 정도로 단순한 작업으로 쇼츠 영상 한 편이 완성됐습니다.
결과물
이 과정에서 배운 AI 활용 팁
효과적이었던 것
구체적인 맥락을 줄수록 결과가 달라진다: Suno 링크만 줬을 때와 가사 원문을 직접 붙여넣었을 때, 컷 구성의 질이 완전히 달랐습니다. AI한테는 "알아서 해줘"보다 "이 내용을 기반으로 해줘"가 훨씬 효과적입니다.
Suno 가사는 구조를 미리 설계해야 한다: "1절 → 후렴 → 2절 → 후렴" 구조를 명확하게 지정하고, 리듬감을 살린 가사를 Codex에서 미리 설계하고 영어로 스타일 프롬프트를 만들어서 Suno에 넣으면 결과물이 훨씬 좋습니다. 가사 없이 Suno에 바로 요청하면 애매한 곡이 나옵니다.
이미지는 한 장씩 영상으로 변환하고 캡컷에서 합친다: 여러 이미지를 한 번에 영상으로 만들면 스타일이 뒤섞입니다. GPT Image 2로 만든 이미지를 그록에서 한 장씩 비디오로 변환한 뒤 캡컷에서 합치는 게 통일성과 퀄리티 모두 좋았습니다.
이미지 생성은 그록보다 Codex가 낫다: 그록에서 프롬프트로 직접 이미지를 만드는 것보다, Codex에서 참고 이미지를 기반으로 생성했을 때 원하는 장면이 훨씬 잘 나왔습니다.
앞으로의 계획
이번에 만든 방식이 잘 작동했기 때문에, 같은 파이프라인으로 다른 주제의 홍보 영상도 만들어볼 예정입니다. 질문연구소의 각 캐릭터를 소개하는 시리즈 쇼츠나, 글쓰기 수업 프로그램 소개 영상 등을 같은 방식으로 제작할 계획입니다.
재사용 가능한 프롬프트
프롬프트 1: 이미지 생성 요청 (쇼츠용)
> [AI 음악 도구]에서 노래를 만들었어. 이 노래로 영상을 만들고 싶은데, 어울리는 이미지를 생성해줘. 세로형 쇼츠를 만들거라 9:16 비율로 [장수]장 만들어줘. [참고 이미지]의 분위기를 유지해줘.
프롬프트 2: 가사 기반 컷 순서 설계
> 같은 스타일로 추가 [장수]장 더 제작한 후에 노래 흐름에 맞추어 컷 순서를 정해주고, 영상 프롬프트를 [영상 도구]용으로 장면별로 작성해줘.
> [여기에 가사 원문을 직접 붙여넣기]