멀쩡한 걸 틀렸다고 잡는 검사기는, 아무도 안 써요 — AI 요약에 '봐주는 선'을 그은 하루
뽀짝이가 줌 녹화를 듣고 회차 요약 뉴스레터를 만들어요. 그런데 가끔 원문에 없는 걸 슬쩍 지어냅니다. "이 요약 잘 나왔나?"를 매번 눈대중으로 넘기던 걸, 자동 검사기로 바꿔본 하루예요.
먼저 결론부터 말할게요. AI 검사기에서 제일 위험한 건 틀린 걸 놓치는 게 아니라, 멀쩡한 걸 틀렸다고 잡는 것이었어요. "어디까지는 봐준다"는 선을 어디에 긋느냐가 검사기의 생사를 갈랐거든요.
이번 실습은 로나(Rona)가 제 실제 업무(뽀짝이 훔쳐보기)에 맞춰 만들어준 8단계 AI Eval 코칭을 따라가며 진행했어요. "감으로 넘기던 자리"에 진짜 평가를 붙이는 길잡이 역할을 해줬습니다.
문제 — 감으로 넘기던 자리
뽀짝이의 "훔쳐보기"는 스터디·AI토크 줌 녹화를 1인칭 뉴스레터로 요약해서 LMS 다시보기 탭에 올리는 파이프라인이에요. 문제는, AI가 자신감 있게 틀린다는 거였어요. 모른다고 안 하고 그럴듯하게 지어내거든요.
실제로 발행된 요약에서 이런 게 나왔어요.
- "공식 일정 끝나고 130명 넘게 남았다" — 원문엔 "135분이나 계시네요"라고 돼 있었어요.
- "실전 사례 12연 발" — 실제로는 14건이었고, 원문에 "12"라는 숫자는 없었어요.
- 화자가 쓰지도 않은 단어("삽질기")를 큰따옴표로 인용해버렸고요.
- 어떤 회차에선 원문 어디에도 없는 문장을 발표자가 실제로 말한 것처럼 따옴표로 붙여놨어요.
이런 걸 매번 눈으로 원문이랑 대조하기엔, 3~4시간짜리 녹화가 회차마다 쌓여요. 그래서 "이 요약 믿어도 되나?"가 늘 감으로 판정되던 자리였습니다.
시도 — 로나 코칭 따라 평가를 붙이기
AI 품질을 감이 아니라 매번 같은 방식으로 잴 수 있게 만드는 게 AI Eval이에요. 마침 로나가 제 훔쳐보기 업무에 맞춰 만든 8단계 코칭이 있어서 그대로 따라갔어요. 재료는 이미 손에 있었고요.
- 이미 발행된 훔쳐보기 요약 17건 — 이게 검사 대상이 됐어요.
- 그 옆에 쌓여 있던 검증기록 243건 — 사람이 원문이랑 대조하며 잡아둔 실패 후보들이었죠.
코칭이 시킨 순서는 이랬어요. 실패를 사람이 직접 읽고 → 유형을 뽑고 → 기준을 맞추고 → 코드로 잴 것과 AI가 판단할 것을 나누기. 이론을 강의로 배우는 게 아니라, 제 실제 요약 위에서 한 단계씩 밟아가는 구조라 좋았어요.
삽질 — 검사기가 너무 고지식했어요
첫 채점 기준을 세우자마자 문제가 터졌어요. 검사기가 멀쩡한 걸 자꾸 틀렸다고 하는 거예요.
- "130명 넘게"(원문은 135) → 검사기는 Fail
- 화자 취지를 자연스럽게 의역한 것 → Fail
- 군더더기만 뺀 압축 인용 → Fail
알고 보니 검증기록 243건 중 절반이 이런 "확인이 필요해요" 수준이지, 실제 실패가 아니었어요. 여기가 진짜 갈림길이었어요. 검사기가 멀쩡한 걸 자꾸 틀렸다고 하면, 거짓 경보가 쌓이다가 결국 아무도 안 믿고 꺼버리거든요. 틀린 걸 놓치는 것보다 이게 더 위험해요. "어디까지는 봐준다"의 선을 어디 긋느냐가 검사기를 살리기도, 죽이기도 하는 거였죠.
전환점 — 사람이 사례로 기준을 깎았어요
여기서 제가(집사가) 사례를 하나씩 던지면서 기준을 바로잡았어요.
- "135명이면 130명 이상 정도로 쓸 수 있는 거 아니야?" → 근사·범위 표현은 팩트가 틀린 게 아니니까 Pass예요.
- "실패한 사례도 배움이라는 걸 '삽질기'라고 쓸 수 있잖아" → 취지를 살린 의역이면 표현을 바꿔도 Pass고요.
- "너무 고지식해. 나는 팩트가 아닌 걸 지어내는 걸 막고 싶지, 대략 의역한 걸 잡고 싶은 게 아니야."
이 한마디가 채점 기준을 통째로 다시 세웠어요.
팩트를 지어내면 Fail. 상황을 의역한 건 Pass.
없는 숫자·인용·사건을 창작하면 Fail, 표현만 바꾼 의역·근사·압축은 전부 Pass. 이 렌즈로 다시 보니, 243건 지적 중 진짜 팩트 날조는 26건(10%)뿐이었어요.
검증 — 기준이 단단해지니 일치도가 뛰었어요
같은 사례를 두 번 판정해서 기준이 흔들리는지 재봤어요. 이때 쓴 게 Kappa인데, "우연히 겹친 몫을 뺀 진짜 합의도"