내 AI 판정 시스템에 평가를 붙였다가, "버그"인 줄 알았던 게 내가 만든 설계였음을 깨달은 이야기
지피터스에서는 웨비나가 끝나면 참가자들이 SNS에 후기를 올리고, 그 인증을 확인해 리워드를 드립니다. 저는 이 확인 작업을, 이미지를 읽는 AI에게 맡겨 두었어요. 매주 웨비나마다 조용히 돌아가는, 손이 많이 가던 일을 덜어준 고마운 자동화였습니다.
그런데 문득 이런 생각이 들었어요. 이 AI, 실제로 얼마나 잘하고 있는 거지?
돌려보면 그럴듯한 판정을 내놓으니 "잘 되나 보다" 하고 넘어갔을 뿐, 한 번도 진지하게 성적표를 매겨본 적이 없었습니다. 이번에 그 "잘 되는 것 같다"를 숫자로 바꿔보기로 했고, 그 과정에서 예상과 전혀 다른 걸 배웠습니다.
🎯 마침 이번주 사내 주제가 'AI 평가'였다
저희 팀은 매주 사내에서 '로나'라는 프로젝트를 돌립니다. 매번 주제가 바뀌는데, 이번주 주제가 바로 AI Evaluation(AI 평가) — "내가 만든 AI 기능에 평가를 제대로 붙여보자"였어요.
주제를 받고 바로 정했습니다. 남의 예제 말고, 내 진짜 판정 시스템을 대상으로 삼자. 마침 지난 웨비나 세 번 분량의 실제 판정 기록이 그대로 남아 있었고, 각 건마다 "사람이 최종적으로 어떻게 결론 냈는지"까지 붙어 있었거든요. 채점 기준이 될 정답이 이미 있는 셈이라, 평가 재료로는 더할 나위 없었습니다.
🛠️ AI를 평가한다는 건, 감을 숫자로 바꾸는 순서다
AI 기능에는 함정이 하나 있습니다. 자신 있게 틀린다는 것. 사람이 짠 일반 프로그램은 2 더하기 2가 틀리면 바로 티가 나지만, AI는 같은 걸 봐도 매번 조금씩 다르게 판단하고 "좋은 답"의 정답이 하나로 고정되지 않습니다. 그래서 예시 두세 개가 잘 나오는 걸 보고 배포하면, 다른 케이스가 조용히 망가져도 모릅니다.
그래서 거창한 도구 없이, 순서대로 밟았습니다. 이 순서 자체가 저한테는 계속 작 은 깨달음을 줬어요.
먼저 "좋은 판정이란 무엇인가"를 확인 가능한 3줄로 못 박았습니다. 여기서 첫 번째 깨달음이 왔어요. "자연스럽다", "괜찮다" 같은 말은 채점할 수가 없습니다. 제 경우 제일 중요한 한 줄은 "정당하게 후기를 쓴 참가자를 부정으로 오해하지 않는다"였어요. 리워드를 놓치면 그게 곧 고객 불만이니까요. 목표를 이렇게 Pass/Fail로 답할 수 있게 바꾸지 않으면, 뒤의 모든 측정이 허공에 뜹니다.
그다음 실제 판정 기록을 한 줄씩 직접 읽었습니다. 여기서 두 번째 깨달음. 통계를 돌리거나 AI에게 "왜 틀렸어?"라고 묻고 싶은 유혹이 컸는데, 그러면 안 되더라고요. AI에게 물으면 그럴듯한 이유를 지어내고, 미리 만든 분류표에 끼워 맞추면 진짜 반복되는 문제는 안 보입니다. 사람이 맨눈으로 먼저 읽는 것 — 이게 평가의 진짜 출발점이었습니다.
🔍 읽다 보니 드러난 진실 (그리고 아하 모먼트)
기록을 하나하나 읽다 보니, 눈에 걸리는 숫자가 나왔습니다. AI가 "이거 의심스럽다"고 찍은 게 쉰두 건이었는데, 그중 사람이 다시 봐서 되살린 게 쉰한 건. 열 번 의심하면 아홉 번 반은 뒤집힌 겁니다.
처음엔 아찔했어요. "내 AI가 이렇게 헛발질을 하고 있었나?"
그런데 그 쉰한 건을 계속 읽다 보니 공통점이 보였습니다. 대부분 이런 경우였어요. 참가자가 후기는 멀쩡히 올렸는데, 폼에 캡처를 첨부할 때 실수로 줌 화면이나 발표 슬라이드를 넣은 겁니다. 이미지만 보면 "후기가 아니네?" 싶지만, 본인이 올린 SNS 링크를 열어보면 진짜 후기가 있는 거죠.