📝 한줄 요약
캡컷에서 자막을 한 줄씩 직접 넣다가, Claude Code와 함께
“이 영상에 자막 넣어줘” 한 마디면 끝나는 자동 자막 도구를 만들었습니다.
지금은 플러그인 형태로 공유까지 하고 있습니다.
바쁘다면 이것만 읽어도 됩니다
캡컷 자막 수작업(영상마다 수십 줄) → AI 자동 생성
노래 영상 가사 66줄을 음성에 맞춰 자동 싱크
후렴 구간 인식 누락 문제를 “빈 구간 재인식” 방식으로 해결
복잡한 작업 흐름을 하나의 “스킬”로 패키징
GitHub로 공유해 누구나 설치 한 번이면 사용 가능(macOS)
AI가 화면을 직접 보지 못해도 “스스로 검증하는 구조”를 만들 수 있다는 걸 경험
🎯 이런 분들께 도움 됩니다
캡컷으로 교육·유튜브·SNS 영상을 만들면서
자막 작업에 지친 비개발자·크리에이터AI 도구로
반복 업무를 자동화하고 싶은 분
😫 문제 상황 (Before)
영상 편집을 하면서 가장 하기 싫었던 작업이 자막 입력이었습니다.
캡컷에서 자막을 한 줄씩 넣는 작업은 시간이 오래 걸렸고,
유료 자막 기능을 결제할까 고민하던 중
Claude Code로 자막 자동화를 시도하는 영상을 발견했습니다.
https://youtu.be/hIkEOSygniM?si=RtkLrBMpRm56dWgH
“정말 될까?” 싶었지만, 저도 직접 시도해보기로 했습니다.
🛠️ 사용한 도구
도구: Claude Code
모델: Claude Opus
음성인식: faster-whisper (로컬 실행)
영상 음성을 외부 서버로 보내지 않고,
내 컴퓨터 안에서만 처리하는 방식을 사용했습니다.
덕분에 영상 파일이 외부로 유출될 걱정 없이 작업할 수 있었습니다.
🔧 작업 과정
1. 캡컷 프로젝트 구조부터 분석
처음에는 이렇게 요청했습니다.
캡컷 편집을 자동으로 해주는 캡컷 에이전트를 만들고 싶어.
특히 자막 작업을 자동으로 하고 싶어.
자막을 잘 만드는 기능을 넣어줘.
흥미로웠던 건, AI가 곧바로 코드를 짜지 않았다는 점입니다.
대신 먼저:
캡컷 프로젝트가 어떻게 저장되는지
자막 데이터 구조가 어떻게 생겼는지
파일을 직접 수정할 수 있는지
부터 분석했습니다.
그리고 핵심을 발견했습니다.
캡컷 프로젝트는 사실 하나의 파일에 저장되고,
자막은 “텍스트 + 스타일”과 “타이밍 정보”로 분리되어 관리된다.
제가 예전에 만들었던 프로젝트 파일까지 직접 분석하면서 구조를 확인했습니다.
결론은 명확했습니다.
캡컷 GUI를 거치지 않아도,
프로젝트 파일을 직접 생성하면 자막 전체를 자동 생성할 수 있다.
이 순간,
“어? 이거 진짜 되겠는데?” 싶었습니다.
2. AI가 먼저 선택지를 정리해줬다
바로 개발을 시작하기보다,
AI가 먼저 중요한 선택지를 정리해줬습니다.
좋았던 점은,
제가 무엇을 결정해야 하는지도 몰랐는데
AI가 갈림길을 먼저 보여줬다는 점입니다.
AI가 제안한 선택지
자막 텍스트는 어디서 가져올까?
대본이 있으면 정렬
없으면 음성 자동 인식
음성인식 엔진은 무엇을 사용할까?
로컬 실행 방식(영상 외부 유출 없음)
첫 테스트 영상은 무엇으로 할까?
3분 38초짜리 노래 영상
덕분에 저는 “선택”만 하면 됐습니다.
3. 첫 자막 생성 — 문제의 연속
가사 66줄을 통째로 넣었습니다.
AI 는 [Verse], [Chorus] 같은 구조 표시는 자동으로 제거하고,
실제로 부르는 문장만 자막으로 사용했습니다.
하지만 노래 영상이라 문제도 많았습니다.
문제 1. 음성인식이 2단어만 듣고 멈춤
반주가 있는 노래를
AI가 “사람 목소리가 아니다”라고 잘못 판단한 것이 원인이었습니다.
AI가 설정값을 수정하자 바로 정상 동작했습니다.
문제 2. 중간 2분 구간을 통째로 건너뜀
긴 오디오를 한 번에 처리하다 보니
중간에 인식 누락이 생긴 것이었습니다.
해결 방법은 간단했습니다.
긴 영상을 30초 단위로 잘라 처리
이렇게 바꾸자 누락 문제가 사라졌습니다.
이 과정에서 인상 깊었던 점은,
AI가 단순히 오류를 출력하는 수준이 아니라
원인을 추론하고
가설을 세우고
처리 방식을 바꿔가며
스스로 해결해나갔다는 점입니다.
4. 가장 극적인 순간 — 후렴이 통째로 사라졌다
자막이 완성된 뒤,
캡컷에서 직접 확인해보니 특정 구간부터 자막이 어긋나 있었습니다.
그래서 이렇게 요청했습니다.
00:54:05부터 자막이 맞지 않아.
01:18:00부터 다시 맞아.
자막 완성하면 캡컷에서 직접 검수하고,
틀린 부분 다시 고쳐서 완성하는 스킬로 다시 만들어야 해.
일단 잘못된 자막 수정부터 해줘.
AI는 문제를 분석했고,
결국 원인을 찾아냈습니다.
노래 후렴 구간 전체를 음성인식이 통째로 놓쳤던 것
기준 타임라인이 사라지면서,
뒤 자막들이 전부 밀려버린 것이었습니다.
여기서 정말 좋았던 해결 방식이 나왔습니다.
전체를 다시 인식하지 않고,
“비어 있는 구간만 다시 추출해서 재인식”
하도록 만든 것입니다.
그 결과,
놓쳤던 후렴 구간이 복원되었고
66줄 전체가 정확하게 음성에 맞춰졌습니다.
5. “AI는 화면을 못 보는데 어떻게 검수하지?”
제가 원했던 기능 중 하나는:
“캡컷에서 직접 검수하고 틀린 부분 수정하기”
였습니다.
하지만 현실적인 문제가 있었습니다.
AI는 캡컷 화면을 실제로 볼 수 없습니다.
그래서 접근 방식을 바꿨습니다.
“눈으로 보는 검수” 대신,
각 자막이 표시되는 시간에
실제 음성이 얼마나 일치하는지를 점수로 평가
하도록 만든 것입니다.
즉,
AI가 스스로 품질 점수를 계산하게 만든 것입니다.
이번 영상 결과:
평균 점수: 0.81
총 66줄 중 65줄 정상 판정
https://www.youtube.com/watch?v=QI7n1OjRc0w
6. 모든 과정이 한 줄로 줄어든 순간
여기까지 만들고 보니 내부적으로는 꽤 복잡했습니다.
오디오 추출
음성 인식
가사 정렬
자동 검수
캡컷 드래프트 생성
하지만 AI가 이 전체 흐름을 하나의 “스킬”로 묶어주었습니다.
결국 다음부터는 이렇게만 하면 됩니다.
이 영상에 자막 넣어줘
(+ 대본이나 가사가 있으면 같이)
복잡했던 전체 작업 흐름이
“한 줄 명령”으로 줄어든 순간이 가장 짜릿했습니다.
🤝 같이 쓰고 싶어서 GitHub로 공유
이 작업을 하다 보니,
같이 영상 공부하는 스터디원들이 떠올랐습니다.
그래서 이런 요청도 해봤습니다.
좋아. 자막 자동화 성공했어.
같이 영상 공부하는 스터디원들에게 이 스킬을 공유하고 싶은데,
어떻게 하면 돼?
클로드 스킬 만들어서 공유하는 것을 하고 싶어.
AI는:
컴퓨터마다 다른 경로 자동 처리
개인 정보 제거
템플릿 정리
설치 자동화
까지 전부 처리해주었습니다.
그리고 GitHub에 공개 가능한 형태로 패키징했습니다.
특히 인상 깊었던 건,
AI가 “스터디원 입장”에서 직접 설치 테스트까지 진행했다는 점입니다.
직접 설치해서 다른 스터디원처럼 시도해봐
완전히 새로운 환경에서 직접 설치하고 실행하면서,
“내 개발 환경 없이도 동작하는가?”
를 검증했습니다.
덕분에 “나만 되는 코드”가 아니라
실제로 공유 가능한 도구가 되었습니다.
🚀 두 번째 영상은 정말 한 줄로 끝났다
도구가 완성된 뒤,
다른 영상에 바로 적용해봤습니다.
글쌤은 고양.mov 파일에 자막 넣어줘.
(+ 자막 대본)
결과는 놀라웠습니다.
33초 영상
자막 7줄
평균 점수 0.92
7줄 모두 정상 판정
처음의 시행착오가 거짓말처럼,
이제는 정말 “한 줄”이면 끝났습니다.
https://youtube.com/shorts/zvMbCPhN7X4?si=LwONI_0py8YZw3zt
✅ 결과 (After)
Before vs After
항목
Before
After
자막 입력
캡컷에서 직접 입력
대본 붙여넣으면 자동 생성
타이밍 조정
줄마다 수동 조절
음성 기반 자동 싱크
노래 영상 작업
긴 수작업
명령 한 줄
검수
전체 수동 확인
문제 구간 자동 탐지
공유
사실상 어려움
설치 한 번으로 사용 가능
📦 결과물
노래 영상 자막 66줄 자동 생성
후렴 구간 어긋남 자동 수정
재사용 가능한 자막 자동화 스킬 제작
두 번째 영상 적용 성공
33초 영상
자막 7줄
평균 점수 0.92
💡 이번 작업에서 배운 AI 활용 팁
효과적이었던 방법
1. “왜 안 돼?”보다 “증상”을 정확히 말하기
예를 들어:
“00:54초부터 자막이 안 맞아”
처럼 구체적인 시각을 알려주니
AI가 원인을 훨씬 정확하게 분석했습니다.
2. AI에게 “스스로 검증하는 방법”을 시키기
AI가 화면을 직접 보지 못해도,
스스로 품질을 점수화하도록 만들 수 있었습니다.
덕 분에 사람이 일일이 확인하지 않아도
문제 구간만 빠르게 찾을 수 있었습니다.
3. AI가 갈림길을 물어볼 때 선택만 해도 된다
무엇을 결정해야 할지 몰라도 괜찮았습니다.
AI가 선택지를 먼저 제시해주면
사용자는 고르기만 해도 작업이 진행됩니다.
⚠️ 이렇게 하면 실패하기 쉽다
1. “내 컴퓨터에서 됨”과 “공유 가능한 도구”를 같게 생각하기
내 환경에서 동작하는 것과
다른 사람 컴퓨터에서도 되는 것은 완전히 다릅니다.
공유하려면 반드시:
“다른 사람 컴퓨터에서도 설치만으로 실행되게 해줘”
라고 명확하게 요청해야 합니다.
2. “잘 되지?” 수준에서 검증 끝내기
대신 이렇게 요청하는 게 훨씬 좋았습니다.
“새 환경에서 직접 설치해서 테스트해봐”
이 과정을 거치면
공유 전에 문제를 대부분 잡아낼 수 있었습니다.
🌍 다른 업무에도 적용할 수 있을까?
이번 작업의 핵심은:
반복되는 수작업의 구조를 AI가 분석하게 하고,
그 흐름을 하나의 명령으로 묶는 것
이었습니다.
이 방식은 영상 자막뿐 아니라:
반복 문서 정리
데이터 분류
양식 입력
자료 정리
콘텐츠 제작
처럼 “매번 비슷하게 반복되는 작업”이라면
어디든 적용할 수 있다고 느꼈습니다.
🚀 앞으로의 계획
캡컷 편집 자동화 확장
컷 편집
효과 삽입
썸네일 제작
AI 교육송 제작 파이프라인 구축
글쓰기·문해력 교육송 제작
자막 자동화를 기본 단계로 포함
스터디원 공유 및 사용 가이드 정리
📋 재사용 가능한 프롬프트
프롬프트 1 — 자동화 도구 만들기 시작할 때
[내가 반복적으로 하는 작업]을 자동으로 해주는 도구를 만들고 싶어.
바로 코드 짜지 말고,
먼저 이 작업의 데이터/파일 구조가 어떻게 저장되고 동작하는지 분석해서
자동화가 가능한지부터 알려줘.
그리고 방향을 정할 때 내가 결정해야 할 갈림길이 있으면
선택지 형태로 먼저 물어봐 줘.
프롬프트 2 — 결과가 어긋났을 때
[몇 시 몇 분]부터 결과가 맞지 않아.
[몇 시 몇 분]부터 다시 맞아.
원인을 진단하고,
임시방편 말고 근본 원인을 해결해줘.
프롬프트 3 — 화면을 못 보는 AI에게 검수시키기
네가 화면을 직접 볼 수 없으니,
[결과물]이 제대로 되었는지
스스로 점수로 검증하는 방법을 만들어줘.
의심스러운 부분은 따로 표시해줘.
프롬프트 4 — 남에게 공유할 수 있는 도구로 만들기
이 도구를 다른 사람에게 공유하고 싶어.
내 컴퓨터에만 있는 경로나 개인 정보,
내 개 인 파일에 의존하는 부분을 전부 찾아서 제거하고,
다른 사람 컴퓨터에서도
설치만으로 작동하는지 직접 시뮬레이션해서 검증해줘.