SunoV3, Udio 등 훌륭한 music llm 서비스들이 나왔고,
만족하였으나, 아쉬운 부분 몇가지 있었다.
4분짜리 verse chorus 구성(coherent한 구성)은 힘들다는 것.
Chorus 부분이 사람 노래처럼 멋지게 하이라이트를 치지 못한다는 것.
직접 모델 하나 가지고 트레이닝 하면 어떨 결과가 나올지 궁금해서 진행해보았다.
욕심 같아서는 verse 모델, chorus 모델용으로 동일 모델을 다른 dataset chunk로 훈련시키고, 메인 모델로 verse, chorus를 받아서 연결? 시키는 컨셉을 상상해보았으나,
여력상 그냥 verse 부분만 training 해봄. 이것만 하는데도, 처음해서 그런지 엄청난 시행착오와 시간을 소비하게 된다.
0) 모델 선택
suno-bark, musicGen 중에 데모 소리로는 musicGen이 더 좋아보여 선정.
(뒤늦게 musicLM 더 좋아보여서 이거 선택 할걸 아쉽다)
1) data 준비
Youtube에서 발라드 긴거 하나 선정.
https://www.youtube.com/watch?v=-sTA2LkPwmU
wav 만 뽑아내기
4K YouTube to MP3 라는 프로그램을 다운받는다.
https://www.4kdownload.com/products/youtubetomp3-72
다른 인터넷 무료 서비스들은 유료 내지 않으면, 긴 비디오는 안됨.
무료 서비스들은 바이러스와 광고가 50개 뜸.
4K YouTube to MP3 가 가장 좋다. 하루에 6개 영상까지 무료.
3시간이 넘는 wav에 여러곡이 들어있다.
트랙별로 자르기.
손노가다는 가능도 하지만, 불가능으로 여기는게 낫다.
구글링에 비슷한 질문들이 많이 있는데, audacity 를 사용하라는 의견이 몇개씩 보여서,
Audacity 다운받아 설치한다.
https://www.audacityteam.org/
추출한 wav를 로딩하고,
ctrl+A 전체선택후,
사운드 레이블로 가서,