수집·판정·재검증의 역할 분리 구조 — 자기채점을 프롬프트가 아니라 구조로 차단하기

시도하고자 했던 것

대량 리서치(사례글 수천 건, 영상 자막 수만 자)를 에이전트에게 시키면서 검수 품질을 지키려니, 문제는 모델 성능이 아니라 역할 구조였습니다. 한 에이전트가 수집→요약→판정을 다 하면, 자기가 가져온 것을 자기가 승인하는 구조가 됩니다. 그래서 역할을 셋으로 쪼갰습니다.

진행 방법 — 3역 분리

1) 수집 워커 (하위 모델, 병렬)

기계적 수집·스크리닝·자막 정독은 저렴한 하위 모델 서브에이전트에게 병렬로 맡깁니다. 핵심 제약: 수집 워커는 판정 권한이 없습니다. 산출물은 전부 [요약] 등급으로 격리되고, "어느 파일 몇 줄에서 봤다"는 위치 정보를 반드시 붙입니다. 프롬프트에도 못 박습니다 — "발언을 창작하지 말고, 안 나온 내용은 '언급 없음'으로 써라."

2) 판정자 (상위 모델, 기준 문서 지참)

판정은 기준 문서(근거등급 계약, 승격 규칙)를 든 상위 모델이 합니다. 수집물이 [요약]에서 [검증]으로 올라가려면 판정자가 원문 위치를 직접 대조해야 합니다. 요약을 믿고 승격하는 것 금지 — 요약은 후보 목록이지 근거가 아닙니다.

3) 재검증자 (독립 재검색)

사실 주장을 verified로 올릴 때는 세 번째 역할이 붙습니다. 이때의 지시가 중요합니다: "캡처된 원문을 다시 읽지 말고, 출처를 새로 검색해서 대조하라." 같은 텍스트를 재독하면 원문의 오류를 그대로 통과시키기 때문입니다. 실제로 이 재검색이 유튜버 발언과 실측(공식 저장소 수치)의 25% 차이를 잡아냈습니다.

결과와 배운 점

결과

  • 최근 대형 작업 기준: 수집·정독은 하위 모델 6갈래 병렬(영상 2시간짜리 자막 2편도 각각 위임), 판정·종합은 상위 모델 1개. 비용은 내려가고 판정 일관성은 올라갔습니다.

  • "요약만 보고 승격 금지" 규칙 덕에, 수집 워커의 오독(자동자막 오인식 포함)이 판정 단계에서 세 번 걸러졌습니다.

시행착오

  1. 역할 분리의 최초 실패는 프롬프트였습니다. 수집 워커에게 "중요한 것을 골라와"라고 시켰더니 판정을 하기 시작했습니다. "고르지 말고 전 구간을 다뤄라, 판단이 필요한 항목은 그대로 인용하라"로 바꾸니 해결됐습니다. 역할은 모델 배치가 아니라 권한 문구로 갈립니다.

  2. 위임하면 등급이 자동으로 낮아진다는 걸 받아들여야 합니다. 하위 모델 산출물은 아무리 좋아도 [요약]입니다. 이걸 아까워서 [검증]처럼 쓰기 시작하면 분리가 무의미해집니다.

  3. 재검증자에게 원문 접근을 주지 않는 게 오히려 낫습니다. 원문이 손에 있으면 재독의 유혹이 생깁니다. "새로 검색하라"는 지시와 함께 출처 식별자(URL, 저장소명)만 줍니다.

꿀팁

  • 3역을 항상 다 돌릴 필요는 없습니다. 저희 기준: 내부 참고용이면 수집+판정, 사업 문서(제안서·백로그)에 들어갈 수치면 반드시 재검증까지. 문서의 목적지가 검수 강도를 정합니다.

  • 수집 워커 산출물에 라인 번호를 강제하면 판정자의 대조 비용이 절반으로 줄어듭니다.

도움이 필요한 부분

  • 판정자와 재검증자를 서로 다른 벤더 모델로 두는 교차검수까지 가야 하는지 고민입니다. 같은 벤더 분리만으로 충분했던/부족했던 경험이 있으신가요?

  • OT에서 소개된 멀티 LLM 에이전트 팀(마스터-워커 소켓 통신)에 이 3역을 얹는 구조가 궁금합니다 — 3~4주차 기대하고 있습니다.

도움 받은 글

  • 1주차 OT — 멀티 에이전트 상호 검수, 인간 합치도 개념

  • 도도치 이야기 002 — "도도치가 만든 걸 도도치가 귀엽다고 판정하면 자기채점" — 이 문장이 3역 분리의 출발점이었습니다

  • 22기 딥리서치 사례글 — 독립 재검색 게이트의 원류

4
1개의 답글
밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.