📝 한줄 요약
AI가 만든 요약을 검사하는 장치를 붙여놨는데, 알고 보니 그게 요약의 품질이 아니라 영상 진행자의 말투를 재고 있었습니다. 검사 기준을 바꾸자 그동안 탈락하던 자료가 되살아나 위키가 두 배 가까이 늘었습니다.
바쁘시면 이것만 읽어도 돼요:
유튜브 전사를 정리해 개인 위키로 쌓는 도구에 검색 기능을 붙이고, 검증 장치 두 개를 고쳤습니다
자료 8편 중 5편이 탈락했는데, 원인은 요약이 부실해서가 아니라 검사 기준이 잘못 설계돼서였습니다
점잖은 발표체 영상은 0.75점, 편하게 말하는 강의는 0.05점을 받았습니다. 요약 품질은 후자가 더 좋았는데도요
검사 기준을 세 가지 대안으로 직접 재보고 가장 나은 것을 골랐습니다. 두 개는 실측해보니 효과가 없어서 버렸습니다
구현을 맡긴 AI가 "이 조건은 논리적으로 통과할 수 없다"며 작업을 거절했고, 확인해보니 제 지시가 틀렸습니다
되돌릴 지점 없이 일하고 있었다는 걸 뒤늦게 발견하고 기준점부터 만들었습니다
🎯 이런 분들께 도움돼요
AI에게 일을 시켜봤지만 "결과물을 어떻게 믿을지"에서 막히는 분
AI가 만든 것을 검사하는 장치를 붙였는데 잘 작동하는지 확신이 없는 분
자료가 쌓이기만 하고 정리가 안 되는 분
😫 문제 상황 (Before)
지난 편에서 유튜브 전사를 자동으로 정리해 개인 위키로 쌓는 도구를 만들었습니다. 전사 파일을 넣으면 주제를 분류하고, 정리 노트를 쓰고, 원문을 제대로 인용했는지 검사한 뒤 위키 페이지로 올려주는 흐름이었죠.
그때 계획에 이렇게 적어뒀습니다. "다음으로 검색 기능을 붙이거나, 쌓인 위키 위에서 질문에 답하는 에이전트로 확장할 예정."
이번엔 그 검색을 붙이려고 앉았습니다. 그런데 시작하자마자 벽에 부딪혔어요. 검색할 게 없었습니다. 위키에 노트 한 건, 페이지 세 건이 전부였거든요. 이 상태로 검색을 만들면 "잘 되네요"라고 말할 수는 있어도 그게 정말 잘 되는 건지 알 방법이 없습니다.
🛠️ 사용한 도구
도구: Claude Code (설계·검증), Codex CLI (구현)
모델: Claude Opus 5 / GPT-5.6
특이사항: 설계와 검증은 Claude가, 실제 코드 작성은 Codex가 맡는 분업. 만든 쪽과 검사하는 쪽을 다른 프로그램으로 분리해 자기 채점을 막는 구조입니다
🔧 작업 과정
검색을 만들려는데 검색할 게 없었다
먼저 재료부터 채워야 했습니다. 다행히 집에 있는 맥미니가 유튜브 전사를 계속 모으고 있어서, 거기서 8편을 가져왔습니다.
고를 때 한 가지를 신경 썼습니다. 한 채널에서만 뽑으면 안 된다는 점이요. 정리된 위키 페이지는 서로 링크로 연결되는데, 주제가 한 곳에 몰리면 링크가 얽히지 않습니다. 그러면 나중에 "끊어진 링크 찾기" 같은 기능을 만들어도 검사할 대상 자체가 없어져요.
그래서 뇌과학 강의 3편, 투자 2편, 학습법 2편, 사주명리 1편으로 흩뿌리되, 각 묶음 안에서는 주제가 이어지게 골랐습니다. 뇌과학 3편은 기억·세포·단백질로 서로 닿아 있는 식으로요.
8편을 파이프라인에 통과시키는 데 34분이 걸렸습니다. 결과를 보니 3편만 통과하고 5편이 탈락했습니다.
8편 중 5편이 탈락했다
탈락 사유는 전부 같았습니다. "커버리지 부족". 정리 노트가 원문을 충분히 다루지 못했다는 뜻입니다.
이상했던 건 점수 분포였어요.
통과: 0.40 0.50 0.75
탈락: 0.05 0.15 0.15 0.25 0.30가장 낮은 0.05점을 받은 건 15,147자짜리 강의였습니다. 이 프로젝트에서 가장 길고 내용이 조밀한 자료요. 반대로 0.75점을 받은 건 4,185자짜리 짧은 영상이었고요.
긴 자료일수록 점수가 낮았습니다. 뭔가 이상하다는 생각이 들어서 검사기를 열어봤습니다.
'하기'가 217번 나왔다
검사 방식은 이랬습니다. 원문에서 가장 자주 나오는 단어 20개를 뽑고, 그게 요약에 얼마나 등장하는지 세는 겁니다. 전제는 단순합니다. 자주 나오는 말이 곧 핵심일 테니까요.
0.05점을 받은 강의에서 그 20개를 실제로 뽑아 봤습니다.
하기(217) 이게(43) 돼요(36) 다음에(35) 거예요(35) 있어요(29)
그러면(27) 하면(26) 이렇게(22) 어떻게(21) 이거(21) 그럼(20)
요거(20) 바로(20) 요게(16) 뭐냐면(16) 아미노산(15) 이제(14)
이빨(13) 다시(12)20개 중 내용어는 '아미노산'과 '이빨' 둘뿐입니다. 나머지 열여덟은 강의하시는 분의 말버릇이에요.
1위인 '하기'는 더 황당했습니다. 원문을 찾아보니 이렇게 되어 있었습니다.
좋은 던짐하다 하기 하기 하기 하기 하기 하기 하기 하기...음성을 글로 옮기는 프로그램이 무음이나 잡음을 잘못 알아들은 겁니다. 그게 217번 반복돼서 1위를 차지했고요.
그런데 정작 이 강의의 요약은 이렇게 쓰여 있었습니다.
"진핵세포 단백질 합성 과정 중 rRNA 가공과 리보솜 소단위체·대단위체 조립, tRNA의 구조·성숙 과정을 설명한 뒤, 유전암호(코돈)표를 쉽게 암기하는 방법을 다루고…"
요약은 훌륭합니다. 전문 용어를 정확히 잡았어요. 그런데 '요거'와 '뭐냐면'을 안 썼다는 이유로 0.05점을 받았습니다.
그제서야 0.75점의 정체도 알았습니다. 그 영상은 "~습니다" 체로 또박또박 발표하는 형식이라 자주 나오는 말이 '포토리딩', '공인', '지도자' 같은 내용어였던 겁니다.
검사기가 재고 있던 건 요약의 품질이 아니라 영상의 말투였습니다.