같은 AI, 질문만 바꿨더니 — 모델보다 프롬프트가 중요했던 순간

배경

논문을 쓰면 인용이 정확한지 일일이 원문과 대조해야 한다. 내가 인용한 수십 개 문장을 선행연구 논문과 하나씩 맞춰보는 작업인데, 시간도 오래 걸리고 눈으로는 놓치기 쉽다.

그래서 이 검증을 AI로 한다. 1차로 클로드(Claude), 2차로 코덱스(Codex·ChatGPT) 에게 "이 인용이 원문과 맞는지 확인해줘"라며 교차검증을 시켰다. 두 AI 모두 "다 맞다"고 통과시켰다.

과정

1주차 AI 검수 스터디에 참가를 한 다음에, 다른 방식으로 해보기로 했다.

찜찜해서 3차로 한 번 더, 이번엔 방식을 바꿔서 돌렸다. 그랬더니 앞의 두 AI가 통과시킨 문장에서 오류가 5개나 나왔다.

예를 들어 내 논문엔 인용한 연구를 "마카오의 카지노 호텔 방문객 500명"이라 썼는데, 원문을 열어보니 "네 개의 카지노 호텔"이었다. 숫자가 틀린 사실 오류. 앞선 두 AI는 이걸 그냥 넘겼다.

처음엔 "3차가 더 좋은 모델(FABLE5)이라서 잡았나?" 싶었다. 확인하려고 작은 실험을 했다. 2차에서 오류를 하나도 못 잡은 바로 그 코덱스에게, 모델은 그대로 두고 딱 하나만 바꿨다 — 내가 시키는 말투.

2차 때: "이 문장이 원문과 맞는지 확인해줘." 실험 때: "이 문장에서 틀린 데를 찾아서 공격해봐. 변호하고, 공격하고, 판정해."

결과

같은 코덱스, 같은 논문, 같은 원문. 질문만 '확인'에서 '공격'으로 바꿨더니:

  • "확인해줘" → 오류 0개

  • "공격해봐" → 오류 2개

더 확실히 하려고 모델 2종 × 프롬프트 2종으로 교차 실험까지 했다. 결론은 명확했다. 오류를 잡은 건 '더 똑똑한 모델'이 아니라 '공격하라는 프롬프트'였다. 모델을 바꿔도 "확인해"로는 못 잡았고, 같은 모델도 "공격해"로 바꾸니 잡기 시작했다.

배운 점

AI 결과물 검수 1주차 강의 기반.

AI가 오류를 못 잡는 건 AI가 멍청해서가 아니라, 우리가 "맞는지 확인해"라고만 물어서다.

  • "맞지?"라고 물으면 → AI는 맞는 근거를 찾는다 (변호사 모드)

  • "틀린 데 찾아봐"라고 물으면 → AI는 틀린 데를 판다 (검사 모드)

검증은 변호가 아니라 반대신문이어야 한다.

5
2개의 답글
밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.