# AI와 함께 "음성·영상 받아쓰기 프로그램"을 직접 만들어 본 후기
## 왜 만들었나
회의 녹음이나 강의 영상을 다시 들으면서 일일이 타이핑하는 게 너무 번거로웠습니다.
유료 받아쓰기 서비스도 있지만, **파일을 외부 서버에 올리는 게 찜찜**하기도 했고요.
"내 PC 안에서, 인터넷 없이, 무료로 돌아가는 받아쓰기 프로그램"을 목표로 잡았습니다.
코딩은 잘 모르지만, AI(코딩 도우미)에게 차근차근 요청해서 완성했습니다.
## 어떤 프로그램인가
- 음성 파일(mp3, wav, m4a 등)과 동영상 파일(mp4, mkv, mov 등)의 **말소리를 텍스트로 변환**
- 변환 결과는 **TXT 파일**로 저장
- **여러 파일을 한 번에** 골라 자동으로 차례차례 처리(일괄 처리)
- 파일을 창에 **끌어다 놓기(드래그 앤 드롭)**만 하면 추가됨
- 변환 도중 **"중지" 버튼**으로 안전하게 멈출 수 있음 (멈춘 시점까지는 저장)
- 한국어·영어·일본어·중국어 + 자동 언어 감지
화면은 복잡하지 않게, 파일 목록 / 옵션(모델·언어) / 시작·중지 버튼 / 진행 상황만 두었습니다.
## 어떤 기술을 썼나
- **언어:** 파이썬(Python)
- **음성 인식:** `faster-whisper` — OpenAI Whisper 모델을 PC에서 더 빠르고 가볍게 돌려주는 라이브러리
- **화면(GUI):** 파이썬 기본 내장 `tkinter` (별도 설치 불필요)
- **드래그 앤 드롭:** `tkinterdnd2`
핵심은 "**클라우드가 아니라 내 컴퓨터에서** 처리"라는 점입니다.
처음 한 번만 음성인식 모델(AI 두뇌 파일)을 내려받고, 그 다음부터는 인터넷 없이도 동작합니다.
## 만들면서 배운 점 / 막혔던 부분
가장 크게 막혔던 건 **설치 과정의 라이브러리 충돌**이었습니다.
- 최신 버전 라이브러리(`av`, `ctranslate2`)가 Windows에서 DLL 오류
(`side-by-side configuration` 메시지)를 내면서 실행이 안 됨
- 원인을 하나씩 좁혀가며 **검증된 안정 버전으로 낮춰서** 해결
- 추가로 `setuptools` 최신 버전에서 `pkg_resources`가 사라져 생긴 오류도
버전을 맞춰서 해결
> 교훈: "최신 = 항상 좋음"은 아니다. 특히 Windows에서는 **검증된 버전 조합을 고정**해 두는 게 안전하다.
> 그래서 설치 목록(requirements.txt)에 동작 확인된 버전을 적어 두었습니다.
## 모델 크기 선택 팁
| 모델 | 정확도 | 속도 | 다운로드 |
|------|--------|------|----------|
| small | 좋음(권장) | 보통 | 약 500MB |
| medium | 더 좋음 | 느림 | 약 1.5GB |
| large-v3 | 최고 | 매우 느림 | 약 3GB |
- 짧은 파일이나 테스트는 **small**로 충분
- 정확도가 더 필요하면 medium → large-v3 순으로 올리면 됨
- GPU(그래픽카드)가 없으면 큰 모델은 꽤 느리니, 긴 영상은 **자리 비울 때 돌려두기**를 추천
## 만들고 나서
타이핑으로 30분 걸리던 회의록 정리가, 파일만 끌어다 놓으면 끝나는 작업이 됐습니다.
무엇보다 **파일이 밖으로 안 나가니 마음이 편합니다.**
코딩을 깊게 몰라도, "이런 게 필요하다 → 이렇게 바꿔달라"를 단계적으로 요청하니
원하는 도구를 직접 가질 수 있었습니다. 비슷한 고민이 있다면 한번 시도해 보길 권합니다.
---
*※ 이 글은 개인 PC에서 만든 개인용 도구에 대한 사용 후기입니다.*