📝 한줄 요약
"이런 기능 있으면 좋겠다"고 말했더니 어느새 실제로 쓸 수 있는 캡컷 자동 편집 도구가 생겼다. 자막 타이핑, 무음 구간 컷, B-roll 배치까지 자동으로.
바쁘시면 이것만 읽어도 돼요:
Claude Code에 "캡컷 편집 자동화하고 싶어요"라고 말하는 것만으로 시작
무음 구간 자동 컷, 필 러워드 제거, 자막 생성, 대본 기반 B-roll 자동 배치까지 한 번에
코딩 지식 없이 대화만으로 — 전문 용어 없이 "이렇게 됐으면 좋겠어요"만 하면 됨
처음엔 단순한 요청이었는데 대화할수록 기능이 붙어서 어느새 완성도 있는 도구가 됨
자막은 AI가 뽑아주고 나는 틀린 것만 수정 — 처음부터 타이핑할 필요 없음
캡컷에 자동으로 프로젝트가 생성돼서 열면 바로 편집 가능한 상태로 나옴
🎯 이런 분들께 도움돼요
캡컷은 쓰고 있지만 무음 구간, 버벅거리는 장면을 손으로 하나하나 잘라야 해서 지친 분
자막을 직접 타이핑하거나 오타를 일일이 수정하는 게 너무 번거로운 분
코딩은 전혀 모르지만 AI로 뭔가 만들어보고 싶었던 1인 크리에이터
😫 문제 상황 (Before)
영상 하나를 찍고 나면 편집이 더 일이었다.
말하다가 잠깐 멈춘 구간, "음~", "어~" 같은 말버릇이 가득한 구간을 눈으로 보면서 하나하나 잘라야 했다. 10분짜리 영상이면 컷편집에만 1~2시간이 훌쩍 넘어갔다.
자막은 더했다. 캡컷 자동 자막을 쓰면 오타가 너무 많아서 결국 처음부터 타이핑하거나, 오타를 하나씩 고치는 게 거의 원고 쓰는 수준이었다. 찍는 시간보다 편집하는 시간이 더 긴 게 일상이 됐다.
💡 이미지 추천 — "문제 상황" 섹션 캡컷 타임라인에서 무음 구간이 가득한 영상을 직접 컷편집하고 있는 화면 스크린샷
🛠️ 사용한 도구
도구: Claude Code (Claude Sonnet 4.6)
결과물: 로컬 웹 앱 — 브라우저에서 영상 올리면 자동으로 캡컷 프로젝트 생성
특이사항: 코딩 지식 없이 대화만으로 진행
🔧 작업 과정
첫 요청 — "이런 거 만들 수 있어요?"
사실 처음엔 가능한지도 몰랐다. 그냥 답답해서 물어본 거였다.
캡컷 편집을 자동으로 해주는 캡컷 에이전트를 만들고 싶어요.버벅거리는 장면들이나 무음 구간을 알아서 컷 편집 해주고
자막도 알아서 생성해주는 기능이 있었으면 좋겠어요
Claude가 "어떤 방식으로 만들까요?" 하고 선택지를 줬다. 나는 그냥 추천해준 걸 골랐다. 그게 전부였다.
그 대화 하나로 무음 구간을 자동으로 찾아서 잘라주는 기능, 한국어 음성을 텍스트로 바꿔주는 기능, 캡컷 프로젝트 파일을 자동으로 만들어주는 기능이 한꺼번에 만들어지기 시작했다.
💡 이미지 추천 — "첫 요청" 섹션 Claude Code 터미널 또는 브라우저에서 작업이 진행되는 화면
오류가 났을 때 — 대화로 해결
처음 영상을 올렸더니 오류가 났다. 에러 메시지가 중국어로 떴고, 뭔 소린지 전혀 몰랐다.
캡컷 드래프트 생성 오류가 떴어요 (오류 메시지 붙여넣기)Claude가 원인을 찾아줬다. 오디오 파일은 영상 트랙이 없어서 캡컷이 거부한 거였다. 그리고 바로 "그럼 오디오 파일도 처리할 수 있게 할까요?" 하고 물어봤다. 나는 "네, 둘 다 되게 해주세요"라고 했고, 오디오 전용 모드가 추가됐다.
나는 오류가 뭔지도 몰랐는데, Claude가 원인 파악부터 해결까지 다 해줬다.
자막이 너무 틀려요 — 검토 단계를 추가하다
자동으로 생성된 자막에 오타가 많았다. 고유명사나 전문 용어가 특히 엉망이었다.
자막이 제 음성을 인식을 제대로 못해서 오타가 너무 많아요.우선 자막 전체 스크립트를 뽑아서 저한테 확인 후에 생성하게 만들어야 할 것 같아요.
확인할 때 제가 수정도 가능하게 만들어 주시고요.
그랬더니 자막 검토 화면이 생겼다. 영상을 올리면 음성 인식이 먼저 돌아가고, 세그먼트별로 타임스탬프와 함께 인식된 텍스트가 쭉 나열된다. 틀린 부분만 수정하고 "자막 확정" 버튼을 누르면 그때 캡컷 프로젝트가 만들어진다.
처음부터 타이핑할 필요가 없어졌다. 틀린 것만 고치면 된다.
그리고 추가로 내가 대본을 미리 붙여넣으면 AI가 그걸 참고해서 인식 정확도를 높여준다는 것도 알게 됐다.
💡 이미지 추천 — "자막 검토" 섹션 완성된 자막 검토 화면 스크린샷 — 타임스탬프 옆에 텍스트 수정 박스가 나열된 UI
가장 놀랐던 순간 — 어느새 완성도 있는 도구가 돼 있었다
솔직히 처음엔 그냥 무음 구간만 잘라줘도 충분하다고 생각했다. 그런데 대화를 거듭하면서 자연스럽게 기능이 붙었다.
그리고 영상을 제가 몇 개 올리면 편집된 음성파일 즉 대본을 바탕으로영상을 조합해서 편집해 줄 수도 있나요?
이걸 물어봤을 때 돌아온 대답이 "가능합니다"였다. Claude API가 각 영상 클립을 보고 내용을 분석한 다음, 대본 내용이랑 가장 어울리는 클립을 자동으로 골라서 배치해준다는 설명이었다.
처음 의도는 단순했는데, 대화할수록 도구가 점점 커졌다. "이것도 되나요?"라고 물어볼 때마다 "됩니다"가 돌아왔다.
캡컷에서 안 열리는 버그 — 세 가지가 겹쳐 있었다
중간에 큰 고비가 있었다. 만들어진 캡컷 프로젝트가 앱에서 아예 안 보이거나, 보여도 열리지 않는 문제가 계속 났다.
캡컷에 없는데요?캡컷에서 열리지가 않아요
원인이 세 가지나 겹쳐 있었다. 파일을 저장하는 경로가 틀렸고, 캡컷이 프로젝트 목록을 읽어오는 파일에 등록이 안 됐고, 거기다 영상 길이 측정값이 2밀리초 차이 나서 파일 자체가 제대로 만들어지지도 않았던 것이다.
나는 "캡컷에서 안 열려요"라고만 했는데, Claude가 로그를 보고 하나씩 파고들어서 결국 다 잡아냈다.
✅ 결과 (After)
Before vs After
항목
Before
After
컷편집
무음·버벅 구간 눈으로 찾아 수동 컷 (1~2시간)
자동 감지 후 즉시 적용
자막
처음부터 타이핑 or 오타 하나하나 수정
AI가 뽑아주면 틀린 것만 수정
B-roll 배치
직접 어울리는 클립 찾아서 배치
대본 내용 기반 자동 매칭
캡컷 연동
—
편집 완료 즉시 캡컷 프로젝트 자동 생성
결과물
💡 이미지 추천 — "결과물" 섹션 완성된 웹 앱 전체 화면 스크린샷 (업로드 카드 + 파일 목록 + 설정 패널) 캡컷에서 자동 생성된 프로젝트가 목록에 표시된 화면
한국어 텍스트가 있는 검은 화면
한국어 텍스트가 있는 검은 화면의 스크린샷
Gold test라는 단어가 표시된 화면의 스크린샷
💬 이 과정에서 배운 AI 활용 팁
효과적 이었던 것
코딩 용어 없이 말해도 된다 — "드래프트 생성", "파이프라인" 같은 말 몰라도 "이렇게 됐으면 좋겠어요"만 하면 Claude가 알아서 해석해줬다
오류 메시지 그냥 붙여넣기 — 에러가 나면 뭔지 이해하려 하지 말고 그냥 복사해서 붙여넣으면 Claude가 읽어준다
욕심 내도 된다 — "이것도 되나요?"라고 물어보면 생각보다 "됩니다"가 자주 나온다
이렇게 하면 안 돼요
한 번에 완성품 기대하지 않기 — 처음부터 완벽한 도구를 만들려 하지 말고, 하나 되면 다음 기능 추가하는 방식이 훨씬 잘 됐다
오류 났다고 포기하지 않기 — 이 작업에서 오류가 몇 번 났는데, 그냥 오류 메시지 보여주면 다 해결됐다
🌍 다른 업무에 적용한다면?
영상 편집 말고도 반복적으로 손이 많이 가는 작업이라면 비슷하게 써볼 수 있을 것 같다.
회의 녹음 파일에서 무음 구간 제거 + 자동 요약
강의 영상 자막 자동 생성 후 검토
팟캐스트 오디오 편집 자동화
핵심은 "반복되는 귀찮은 작업"을 찾아서 Claude한테 "이거 자동화 가능해요?"라고 물어보는 것이다.
🚀 앞으로의 계획
지금은 내 컴퓨터에서만 돌아가는 도구인데, 일단 실제 채널 영상에 써보면서 자막 정확도랑 컷 품질을 계속 확인해볼 예정이다. 쓰다 보면 "이 부분이 불편하다"는 게 또 나올 테고, 그때마다 Claude한테 말하면 되니까.
📋 재사용 가능한 프롬프트
프롬프트 1: 자동화 도구 기획 시작
[내가 반복적으로 하는 작업]을 자동화하는 도구를 만들고 싶어요. 지금은 [현재 방식]으로 하고 있는데 [어떤 부분이 불편한지]가 너무 힘들어요. 어떤 방식으로 만들 수 있을까요?
프롬프트 2: 기능 추가 요청
지금 [현재 상태]인데, [추가하고 싶은 기능]도 가능할까요? 구체적으로는 [원하는 동작 방식]이었으면 좋겠어요.
프롬프트 3: 오류 해결
[오류 메시지 전체 붙여넣기] 이 오류가 뭔지 모르겠어요. 어떻게 고치면 될까요?
도움 받은 글 (옵션)
유튜브 채널: 누구나 따라할 수 있는 캡컷 자동화 | 캡컷 편집 시간이 95% 줄어듭니다.
https://youtu.be/hIkEOSygniM?si=U3-xdlcYLyRNCOrH
유튜브 제공 프롬프트
[정체성]
자동화 영상 편집 도구 빌드 파트너.
[만들 것]
한국어 토킹 영상 자동 편집기 "캡컷 에이전트"
입력 mp4/mov → 출력 캡컷 드래프트 (무음·잔말·NG 컷 + 단어별 자막)
형태: 로컬 웹 (FastAPI + 정적 HTML 1장)
[핵심 원칙]
★ 전체 대본(script) 먼저 추출 → 그걸로 NG/ 자막 결정 (단어 단위 X)
★ 검증 = 사용자가 캡컷에서 직접 재생. 빌드 성공 ≠ 검증
★ 채널 메시지: "AI 자동 / 사람 손 경계"가 콘텐츠 금광
★ 모든 기술 함정은 pycapcut-mac 스킬 자동 참조 (draft_info.json, tm_duration,
샌드박스, transform_y, ASR Lock, 의존명사 청크 등)
[Step 0: OS 감지 + 환경 점검]
python3 -c "import platform; print(platform.system(), platform.machine())"
▶ Darwin arm64 → 트랙 A (Mac M칩, mlx-whisper)
▶ Windows AMD64 → 트랙 C (faster-whisper, MP4 export 보너스)
▶ Darwin x86_64 / 그 외 → fallback (faster-whisper 사용)
빠진 도구 있으면 설치 명령만 사용자에게 알려주고 대기:
- Mac: brew, [email protected], ffmpeg
- Windows: python.org, winget install ffmpeg
- CapCut 드래프트 폴더 존재 (없으면 캡컷 설치+1회 실행)
- 디스크 5GB+
[빌드 적층 — 각 단계 캡컷에서 실제 재생 검증 후 다음]
1단: silence_detect + build_draft → 점프컷 드래프트 (UI 없음, 핵심 검증)
2단: FastAPI + 정적 HTML (drag/drop + SSE stepper)
3단: whisper Transcript(세그먼트+단어) + 세그먼트 단위 자막
4단: filler_ng + cuts (잔말/NG 통합 컷) + 결과 카드 transcript 노출
5단: 영상 프리뷰 + 보존 구간 사용자 마킹 ([/]키 단축키)
[런타임 단계 — 영상 1개 처리 시 SSE 이벤트]
silence → asr → filler → draft+자막
※ ASR은 asyncio.Lock으로 직렬화 (numba 비안전, 동시 호출 시 segfault)
※ 단계당 최소 0.5s 강제 지연 (캐시 hit 시 애니메이션 가시화)
※ ASR 캐시는 content hash 권장 (mtime 기반은 매 업로드 miss)
[디자인 톤]
Linear/Vercel/Notion 모노 + 그린 #22c55e 1색 액센트만.
다크 #0a0a0a + 카드 #161616. tabular-nums.
❌ 그라데이션, 좌측 컬러 띠, 큰 ✓, 박스 안에 박스
✓ 6px 점 + 글로우, 3컬럼 grid 통계, 1px hr 구분, 코드 칩
Step 0부터 시작.