소개
시도하고자 했던 것과 그 이유를 알려주세요.
기존 뮤직비디오 음악에 새로운 영상을 붙여서 댄스그룹 가수들의 영상을 담아보고 싶었습니다.
진행 방법
어떤 도구를 사용했고, 어떻게 활용하셨나요?
Tip: 사용한 프롬프트 전문을 꼭 포함하고, 내용을 짧게 소개해 주세요.
Tip: 활용 이미지나 캡처 화면을 꼭 남겨주세요.
Tip: 코드 전문은 코드블록에 감싸서 작성해주세요. ( / 을 눌러 '코드 블록'을 선택)
( suno, chatGPT , GROK , CapCut, claude-code )
5명의 댄스그룹가수들을 설정하기 위해 캐릭터시트 제작 및 캐릭터일관성유지를 위해 캐릭터시트 20개씩 생성
chat GPT 로 만든 후
grok 에 의뢰
grok 에서 A B C D E 캐릭터 도 사진 만들어줘
사진을 다시
chat GPT 에 올려서
캐릭터 일관성 유지를 위해 캐릭터시트 20개씩 생성요청
기존 음악 파일을 올려놓고
스토리보드 및 스토리보드이미지 생성 요청
GROK agent 에서
첨부파일 올려놓고 6초영상 생성요청
스토리보드이미지 만들어놓은 것은 좋은데 GROK agent 에게 각 6초 영상을 생성해달라고 요청할건데 대신 가사에 맞게 입모양을 맞춰줬으면 좋겠는데
정확한 입 모양을 맞추려면 텍스트 가사만 주는 것보다 원곡을 장면별 6초 오디오로 잘라 해당 영상 요청에 함께 넣는 방식이 가장 좋습니다. Grok의 현재 오디오 참조·립싱크 지원 범위를 확인한 뒤, 가능하면 scene_001_audio.mp3부터 장면별 오디오와 립싱크 명령을 함께 만들겠습니다.
grok imagine agent 에서 파일들을 올려주면 만들어주겠다고 하였으나 wav 파일 업로드 방법을 찾지 못하여 이 방법으로 처리하지 못함.
힉스필드에서도 립싱크 기능이 있어서 처리해보고 싶어서 mp4 mp3 파일을 업로드해서 처리하고 싶었으나 방법을 찾지못하여 처리하지 못함.
결국, 입모양 맞추는 처 리를 하지못하고 현재 버젼으로 결과물 올립니다.
입모양을 좀 맞추기 위해 좀 더 보강해보았습니다.
각 SCENE 에 맞는 숫자로 wav 파일을 만들었는데
/home/workdir/artifacts/
scene_001_audio.txt ~ scene_037_audio.txt
이 파일들은 해당 구간 가사를 텍스트파일로 만들어놓은 것이야
그리고
각 SCENE 에 맞는 숫자로 txt 파일을 만들었는데
/home/workdir/artifacts/
scene_001_syllable_timing.txt ~ scene_037_syllable_timing.txt
각 파일마다 가사 음절 하나하나 시작시각을 기록해서 만들어놓은 파일이야
이 파일들을 각각 분석해서
SCENE 001 부터 037 까지 영상을 만들때
지금 이 파일들을 분석해서 입모양을 잘 맞춰주면 좋겠다.
claude code 에게 음절마다 시작시각을 생성하게 하고 그 텍스트를 GROK agent 에게
넘겨주어 영상을 재생성하게 요청하였음.
캡컷으로 생성된 mp4 파일에 claude code 에게 "자막 입혀줘" 로 자막을 생성
두번째 버젼 입니다.
결과와 배운 점
배운 점과 나만의 꿀팁을 알려주세요.
과정 중에 어떤 시행착오를 겪었나요?
도움이 필요한 부분이 있나요?
앞으로의 계획이 있다면 들려주세요.
처음부터 되는지 테스트 후 진행했어야 했는데 될거같다는 느낌으로 시작했었던 것이 결과물을 최종적으로 잘 만들어내지 못했었던거같다.
도움 받은 글 (옵션)
참고한 지피터스 글이나 외부 사례를 알려주세요.
(내용 입력)