배경
논문을 쓰면 인용이 정확한지 일일이 원문과 대조해야 한다. 내가 인용한 수십 개 문장을 선행연구 논문과 하나씩 맞춰보는 작업인데, 시간도 오래 걸리고 눈으로는 놓치기 쉽다.
그래서 이 검증을 AI로 한다. 1차로 클로드(Claude), 2차로 코덱스(Codex·ChatGPT) 에게 "이 인용이 원문과 맞는지 확인해줘"라며 교차검증을 시켰다. 두 AI 모두 "다 맞다"고 통과시켰다.
과정
1주차 AI 검수 스터디에 참가를 한 다음에, 다른 방식으로 해보기로 했다.
찜찜해서 3차로 한 번 더, 이번엔 방식을 바꿔서 돌렸다. 그랬더니 앞의 두 AI가 통과시킨 문장에서 오류가 5개나 나왔다.
예를 들어 내 논문엔 인용한 연구를 "마카오의 한 카지노 호텔 방문객 500명"이라 썼는데, 원문을 열어보니 "네 개의 카지노 호텔"이었다. 숫자가 틀린 사실 오류. 앞선 두 AI는 이걸 그냥 넘겼다.
처음엔 "3차가 더 좋은 모델(FABLE5)이라서 잡았나?" 싶었다. 확인하려고 작은 실험을 했다. 2차에서 오류를 하나도 못 잡은 바로 그 코덱스에게, 모델은 그대로 두고 딱 하나만 바꿨다 — 내가 시키는 말투.
2차 때: "이 문장이 원문과 맞는지 확인해줘." 실험 때: "이 문장에서 틀린 데를 찾아서 공격해봐. 변호하고, 공격하고, 판정해."
결과
같은 코덱스, 같은 논문, 같은 원문. 질문만 '확인'에서 '공격'으로 바꿨더니:
"확인해줘" → 오류 0개
"공격해봐" → 오류 2개
더 확실히 하려고 모델 2종 × 프롬프트 2종으로 교차 실험까지 했다. 결론은 명확했다. 오류를 잡은 건 '더 똑똑한 모델'이 아니라 '공격하라는 프롬프트'였다. 모델을 바꿔도 "확인해"로는 못 잡았고, 같은 모델도 "공격해"로 바꾸니 잡기 시작했다.
배운 점
AI 결과물 검수 1주차 강의 기반.
AI가 오류를 못 잡는 건 AI가 멍청해서가 아니라, 우리가 "맞는지 확인해"라고만 물어서다.
"맞지?"라고 물으면 → AI는 맞는 근거를 찾는다 (변호사 모드)
"틀린 데 찾아봐"라고 물으면 → AI는 틀린 데를 판다 (검사 모드)
검증은 변호가 아니라 반대신문이어야 한다.