AI 영상 제작: 아이디어에서 제작 파이프라인까지
어린이 엘리베이터 안전송 기획의 교훈
AI 영상 제작을 시작할 때 가장 어려운 점은 프롬프트를 잘 쓰는 것이 아니었습니다.
오히려 더 어려웠던 것은 어떤 순서로 무엇을 결정해야 하는지, 그리고 이미지·영상·음악을 어떻게 하나의 제작 흐름으로 연결할지였습니다.
이번에는 어린이를 위한 엘리베이터 안전교육 동요를 기반으로, 마루와 루미라는 캐릭터가 등장하는 약 1분 분량의 AI 애니메이션을 기획하고 제작하는 과정을 진행했습니다.
단순히 “영상 하나를 만들어보자”는 수준에서 시작했지만, 작업을 이어가면서 자연스럽게 다음과 같은 제작 체계가 만들어졌습니다.
작품 방향 설정 → 서술형 시나리오 → 스토리보드 → SHOT 분리 → 이미지 생성 → Google Flow 영상화 → 편집 및 음악 싱크
이 글에서는 실제 작업 순서와 시행착오, 그리고 AI 영상 제작에서 특히 중요했던 판단들을 정리해보겠습니다.
영상의 핵심 방향 정리
처음부터 장면이나 프롬프트를 만들지 않고, 작품이 시청자에게 어떤 감정과 경험을 줄 것인지부터 정리했습니다.
이번 영상의 기본 아이디어는 다음과 같았습니다.
주제: 어린이를 위한 엘리베이터 안전약속
주인공: 흰색 강아지 마루와 회색 줄무늬 고양이 루미
배경: 백화점 전망용 엘리베이터
핵심 감정: 호기심과 교훈
전체 분위기: 밝고 재미있는 어린이 안전교육
주요 관전 포인트: 안전수칙을 지키지 않는 장면과 올바른 행동으로 바뀌는 과정
이를 바탕으로 작품 방향을 다음과 같이 정리했습니다.
항목
내용
핵심 감정
호기심을 느끼다가 위험 행동을 보고 ‘아차’ 하는 교훈을 얻는 감정
핵심 경험
마루와 루미를 따라 엘리베이터 안전수칙을 체험하듯 배우는 영상
장르
어린이 안전교육 뮤직비디오형 3D 애니메이션
핵심 콘셉트
마루와 루미가 잘못된 행동을 경험하고 올바른 안전약속을 배우는 이야기
관전 포인트
위험 행동과 올바른 행동의 비교, 캐릭터의 표정과 반응 변화
이 단계를 먼저 진행하니 이후 시나리오와 스토리보드의 방향이 흔들리지 않았습니다.
동요 길이에 맞춘 시나리오 설계
첨부한 엘리베이터 안전송의 길이는 약 1분 정도였습니다.
일반적인 영상 시나리오처럼 긴 이야기를 쓰기보다는, 나중에 AI 영상툴이 이해할 수 있도록 다음 요소를 중심으로 작성했습니다.
장소
캐릭터 행동
행동의 원인과 결과
표정과 감정 변화
카메라 구도
다음 장면으로 연결되는 종료 이미지
전체 흐름은 다음과 같이 구성했습니다.
도입
백화점 전망용 엘리베이터에 도착한 마루와 루미가 안전 지킴이 포즈를 취합니다.
위험 행동
마루가 문에 기대거나 엘리베이터 안에서 뛰려 합니다.
위험 발견
루미가 이를 발견하고 큰 손동작으로 멈추게 합니다.
비상 상황
엘리베이터가 멈추자 두 캐릭터가 놀라지만, 숨을 고르고 비상벨을 누릅니다.
안전 행동
승강기 고유번호를 확인하고, 화재 상황에서는 엘리베이터 대신 계단으로 이동합니다.
결말
마루와 루미가 안전 지킴이 배지를 얻고 자신감 있게 포즈를 취합니다.
여기서 중요한 원칙은 모든 장면을 다음 구조로 단순화한 것이었습니다.
잘못된 행동 → 위험 신호 → 행동 중지 → 올바른 행동
이 구조는 어린이에게도 이해하기 쉽고, AI 영상툴에도 비교적 명확하게 전달됩니다.
1분 영상을 16개의 SHOT으로 분리
처음에는 약 15초 단위의 큰 CUT으로 구성했지만, 실제 AI 영상 제작을 위해서는 더 짧은 SHOT 단위가 필요했습니다.
그래서 약 1분의 영상을 총 16개 SHOT으로 나눴습니다.
SHOT
주요 장면
SH01
백화점 아트리움과 전망용 엘리베이터 등장
SH02
마루와 루미의 안전 지킴이 포즈
SH03
엘리베이터 탑승
SH04
문에 기대지 않기
SH05
상승 중 신난 마루
SH06
엘리베이터 안에서 뛰지 않기
SH07
내리기 전 멈추기
SH08
바닥 높이 확인하기
SH09
갑자기 멈춘 엘리베이터
SH10
당황하지 않고 숨 고르기
SH11
비상벨 누르기
SH12
침착하게 기다리기
SH13
승강기 고유번호 확인하기
SH14
안전하게 내리기
SH15
불이 나면 계단 이용하기
SH16
안전 지킴이 완성
이렇게 나누니 각 SHOT마다 한 가지 행동만 넣을 수 있었습니다.
AI 영상 생성에서는 한 장면 안에 여러 행동을 넣을수록 결과가 불안정해집니다. 예를 들어 한 SHOT 안에서 캐릭터가 뛰고, 문이 열리고, 넘어지고, 다시 일어나는 장면까지 모두 지시하면 동작이 섞이거나 생략될 가능성이 높습니다.
따라서 이번 작업에서는 다음 원칙을 유지했습니다.
한 SHOT에는 하나의 핵심 행동만 넣는다.
4×4 스토리보드 제작
16개의 SHOT을 한눈에 보기 위해 4×4 형태의 스토리보드 카드로 구성했습니다.
스토리보드에는 다음 요소를 포함했습니다.
SHOT 번호
시작 및 종료 시간
장면 이미지
장면 설명
안전수칙
한 화면에 전체 흐름이 보이니 몇 가지 문제가 바로 드러났습니다.
캐릭터 위치가 장면마다 달라지는 문제
엘리베이터 내부 구조가 바뀌는 문제
일부 장면에서 마 루와 루미의 역할이 뒤바뀌는 문제
장면 설명과 이미지의 동작이 일치하지 않는 문제
스토리보드는 단순한 그림 모음이 아니라, 영상 전체의 연속성을 검토하는 도구라는 점을 확인할 수 있었습니다.
이미지 수정 과정의 시행착오
스토리보드가 완성된 뒤 숫자와 글자를 제거해달라고 요청했습니다.
원했던 것은 기존 4×4 스토리보드에서 다음 요소만 지우는 것이었습니다.
SH01~SH16 번호
시간 표시
장면 설명 문구
상단 제목
하지만 이미지 편집 요청이 정확하게 전달되지 않아, 기존 이미지에서 글자만 지운 것이 아니라 전혀 다른 캐릭터와 장면으로 새로운 스토리보드가 생성되는 문제가 발생했습니다.
이 경험을 통해 이미지 편집 프롬프트에서는 다음과 같이 매우 구체적으로 지시해야 한다는 점을 배웠습니다.
첨부한 원본 이미지를 수정한다.
캐릭터, 배경, 구도, 소품, 조명, 4×4 패널 배치를 모두 그대로 유지한다.
이미지 안의 모든 숫자와 글자만 제거한다.
새로운 캐릭터나 장면을 생성하지 않는다.
빈 공간은 주변 배경과 동일하게 자연스럽게 복원한다.
특히 “글자를 지워달라”는 요청만으로는 AI가 편집이 아닌 재생성으로 해석할 수 있습니다.
따라서 이미지 편집에서는 반드시 다음 세 요소를 함께 적는 것이 좋습니다.
무엇을 유지할 것인가
무엇만 제거할 것인가
무엇을 새로 만들면 안 되는가
Google Flow용 프롬프트 작성
SHOT별 이미지를 만든 뒤 Google Flow에서 영 상으로 생성하기 위한 프롬프트를 작성했습니다.
일반적인 텍스트 투 비디오 프롬프트라면 캐릭터 외형과 배경을 자세히 설명해야 하지만, 이미 완성된 스토리보드 이미지를 시작 프레임으로 사용하는 경우에는 접근 방식이 달라야 했습니다.
이미지에 캐릭터와 배경이 있기 때문에 다음 항목을 중심으로 작성했습니다.
원본 이미지 유지
한 가지 행동
카메라 방향
동작 완료 시점
금지 요소
예를 들어 비상벨을 누르는 SH11은 다음과 같이 구성했습니다.
루미가 엘리베이터 조작반의 비상벨 버튼을 손가락으로 가리킨다. 마루가 버튼을 확인한 뒤 검지손가락으로 비상벨 버튼을 한 번 정확하게 누른다. 버튼을 누르는 순간 버튼 둘레의 불빛이 켜진다. 마루는 손을 버튼에서 떼고 루미를 바라본다. 루미는 고개를 끄덕인다. 카메라는 조작반 쪽으로 천천히 전진하며 손과 버튼을 크게 보여준다.
그리고 다음과 같은 금지 요소를 추가했습니다.
여러 버튼 누르기, 손가락 변형, 버튼 위치 변경, 숫자 새로 생성, 조작반 형태 변화 금지.
이 금지 요소가 의외로 중요했습니다. AI는 지시한 행동뿐만 아니라 장면을 그럴듯하게 만들기 위해 임의의 요소를 추가하기도 하기 때문입니다.
엘리베이터 장면의 물리적 순서 명확화
엘리베이터 영상에서 특히 중요한 문제가 있었습니다.
AI가 엘리베이터의 운행 상태와 문 움직임을 현실적으로 이해하지 못하면 다음과 같은 오류가 발생할 수 있습니다.
엘리베이터가 움직이는 중에 문이 열림
캐릭터가 문을 통과함
문이 캐릭터의 몸과 겹침
정지 전에 캐릭터가 내림
따라서 프롬프트 안에서 순서를 명확하게 지정했습니다.
엘리베이터가 층에 완전히 정지한다.
정지한 뒤 문이 열린다.
문이 완전히 열린 뒤 캐릭터가 바닥 높이를 확인한다.
확인 후 한 걸음씩 내린다.
또는 상승 장면에서는 다음과 같이 작성했습니다.
엘리베이터 문이 완전히 닫힌 상태에서 상승한다.
운행 중에는 문이 열리지 않는다.
이처럼 AI 영상에서는 현실에서 당연한 동작도 명시해야 합니다.
영상 길이 조정의 한계
스토리보드에서는 SHOT별로 3초, 4초, 5초처럼 길이를 다르게 정했습니다.
하지만 Google Flow에서 영상을 생성하니 SH01이 계속 8초로 생성되었습니다.
처음에는 프롬프트에 “4초 영상”이라고 적으면 해결될 것이라 생각했지만, 실제로는 그렇지 않았습니다.
Flow의 영상 길이는 프롬프트보다 현재 선택한 모델과 생성 방식의 영향을 받았습니다.
또한 설정 화면 하단에 보이는 x1, x2, x3, x4가 영상 길이로 오해되기 쉬웠습니다.
실제로 이 숫자는 영상 길이가 아니라 한 번에 생성할 결과물의 개수였습니다.
x1: 영상 후보 1개
x2: 영상 후보 2개
x3: 영상 후보 3개
x4: 영상 후보 4개
x4를 선택하면 같은 프롬프트로 4개의 영상 후보가 생성되고, 그만큼 크레딧도 더 많이 사용됩니다.
즉, x4는 4초 영상이 아니라 4개 생성이라는 의미였습니다.
편집 프로그램에서 최종 길이 조정
Flow에서 8초 영상이 생성되더라도, 최종 영상에서는 필요한 3초 또는 4초 구간만 사용하면 됩니다.
이때 프롬프트를 다음과 같이 구성하면 편집이 쉬워집니다.
주요 행동은 영상 시작과 동시에 진행한다.
처음 2초 안에 핵심 행동을 완료한다.
이후에는 완성된 자세를 유지한다.
같은 동작을 반복하지 않는다.
영상 후반에 새로운 행동을 시작하지 않는다.
예를 들어 SH02가 최종적으로 3초만 필요하다면, 8초로 생성하더라도 처음 2초 안에 안전 지킴이 포즈를 완성하도록 합니다.
이후 CapCut에서 필요한 구간만 잘라 사용했습니다.
이번 작업을 통해 다음과 같이 역할을 구분하는 것이 가장 현실적이라는 결론을 얻었습니다.
Google Flow는 움직임과 장면을 만드는 도구
편집 프로그램은 시간과 음악 싱크를 맞추는 도구
음악 타임라인 우선 배치
이번 영상은 동요의 가사 흐름에 맞춰야 했습니다.
따라서 영상을 모두 만든 뒤 음악을 붙이는 방식보다, 먼저 음악을 편집 프로그램에 넣고 SHOT을 배치하는 방식이 효율적이었습니다.
작업 순서는 다음과 같습니다.
안전송을 편집 프로그램에 넣습니다.
가사와 박자에 맞춰 SHOT 시작 시간을 표시합니다.
Flow에서 생성한 영상을 각 구간에 배치합니다.
필요한 길이만큼 클립을 자릅니다.
중요한 행동이 가사와 맞도록 클립 시작 위치를 조정합니다.
마지막으로 자막과 효과음을 추가합니다.
이 방식은 특히 노래 기반 영상에서 매우 중요했습니다.
중요한 교훈
프롬프트보다 제작 순서가 중요
좋은 프롬프트 하나로 영상을 완성할 수 있을 것이라 생각했지만, 실제로는 단계별 구조가 더 중요했습니다.
방향 설정
시나리오
스토리보드
SHOT 분리
이미지 생성
영상 생성
편집
이 순서가 있어야 수정도 체계적으로 할 수 있었습니다.
AI 영상은 한 장면에 한 행동이 안정적
복잡한 행동을 한 번에 넣으면 캐릭터가 뒤섞이거나 움직임이 생략되었습니다.
한 SHOT에 하나의 행동만 배치하는 것이 결과가 가장 안정적이었습니다.
유지 조건과 금지 조건의 중요성
AI는 지시하지 않은 부분을 임의로 바꾸기도 합니다.
따라서 다음을 반복적으로 명시해야 했습니다.
캐릭터 외형 유지
의상 유지
배경 구조 유지
카메라 방향 유지
새로운 캐릭터 추가 금지
글자 생성 금지
문과 캐릭터 겹침 금지
영상 길이는 편집에서 통제
Flow에서 SHOT별 길이를 정확히 맞추려 하기보다, 충분한 길이로 생성하고 필요한 부분을 편집하는 것이 훨씬 효율적이었습니다.
안전교육 영상의 ‘아차’ 순간
어린이 대상 영상에서는 실제 손 끼임이나 추락 장면을 보여주기보다, 위험 직전에 행동을 멈추고 올바른 행동으로 전환하는 방식이 적절했습니다.
이 방식은 공포감을 줄이면서도 안전수칙의 필요성을 전달할 수 있었습니다.
AI 영상 제작 흐름 구축
작품 방향 설정
핵심 감정, 경험, 장르, 콘셉트, 관전 포인트 결정
AI 영상툴 친화형 시나리오 작성
장소, 행동, 감정, 카메라, 원인과 결과를 명확하게 설계
스토리보드 제작
전체 흐름과 장면 연속성 검토
SHOT 단위 분리
한 SHOT에 하나의 행동 배치
이미지 생성
캐릭터와 배경 일관성 확보
Google Flow 영상 생성
시작 이미지와 동작 중심 프롬프트 사용
편집
음악 싱크, 정확한 길이, 자막과 효과음 조정
마무리
처음에는 어린이 엘리베이터 안전송에 맞는 짧은 AI 영상을 만들려고 시작했습니다.
AI에이전트를 구성하여 전체 파이프 라인을 자동화하고자 하는 다른 프로젝트와 별개로 서툴고 엉성하더라도 완성본 영상 하나를 온전히 제작해 보고자 시도했습니다.
그러다 보니, 역시나 안전송의 가사와 샷별로 제작된 영상의 내용이 다소 불일치 하기도 하고, 중간에 마루의 이미지가 조금 변형이 되기도 하는 등 만족스럽지 않은 결과로 제작되었습니다.
그러나, 이렇게 한번 전체 과정을 진행해 본것으로 큰 배움이 있었으며, Suno, Capcut등 스터디 시간에 배운 내용들을 이해하고 익힐 수 있었습니다.
이번 과정에서 가장 크게 느낀 점은 다음과 같습니다.
AI 영상 제작의 핵심은 한 번에 완벽한 결과를 얻는 것이 아니라, 수정 가능한 단위 로 작업을 나누는 것입니다.
앞으로는 이 사례를 도움 삼아 별개를 진행하는 AI에이전트들의 설계과 제작에 참고하고 보다 효율적인 파이프라인을 구축할 수 있도록 템플릿화하는 등 SHOT별 프롬프트, 이미지 승인, 영상 재생성, 검수 의견 관리까지 연결할 계획입니다.
AI 영상 제작을 처음 시작하는 분이라면, 긴 영상을 한 번에 만들려고 하기보다 먼저 1분 이내의 짧은 영상으로 이 제작 흐름을 경험해보시는 것을 추천드립니다.
끝으로, 수준 낮은 영상이지만 제 사례를 공유하고자 공개합니다. ㅋㅋ
완성본 영상 : https://youtu.be/hOA5Mrh9_rk