시도하고자 했던 것
대량 리서치(사례글 수천 건, 영상 자막 수만 자)를 에이전트에게 시키면서 검수 품질을 지키려니, 문제는 모델 성능이 아니라 역할 구조였습니다. 한 에이전트가 수집→요약→판정을 다 하면, 자기가 가져온 것을 자기가 승인하는 구조가 됩니다. 그래서 역할을 셋으로 쪼갰습 니다.
진행 방법 — 3역 분리
1) 수집 워커 (하위 모델, 병렬)
기계적 수집·스크리닝·자막 정독은 저렴한 하위 모델 서브에이전트에게 병렬로 맡깁니다. 핵심 제약: 수집 워커는 판정 권한이 없습니다. 산출물은 전부 [요약] 등급으로 격리되고, "어느 파일 몇 줄에서 봤다"는 위치 정보를 반드시 붙입니다. 프롬프트에도 못 박습니다 — "발언을 창작하지 말고, 안 나온 내용은 '언급 없음'으로 써라."
2) 판정자 (상위 모델, 기준 문서 지참)
판정은 기준 문서(근거등급 계약, 승격 규칙)를 든 상위 모델이 합니다. 수집물이 [요약]에서 [검증]으로 올라가려면 판정자가 원문 위치를 직접 대조해야 합니다. 요약을 믿고 승격하는 것 금지 — 요약은 후보 목록이지 근거가 아닙니다.
3) 재검증자 (독립 재검색)
사실 주장을 verified로 올릴 때는 세 번째 역할이 붙습니다. 이때의 지시가 중요합니다: "캡처된 원문을 다시 읽지 말고, 출처를 새로 검색해서 대조하라." 같은 텍스트를 재독하면 원문의 오류를 그대로 통과시키기 때문입니다. 실제로 이 재검색이 유튜버 발언과 실측(공식 저장소 수치)의 25% 차이를 잡아냈습니다.
결과와 배운 점
결과
최근 대형 작업 기준: 수집·정독은 하위 모델 6갈래 병렬(영상 2시간짜리 자막 2편도 각각 위임), 판정·종합은 상위 모델 1개. 비용은 내려가고 판정 일관성은 올라갔습니다.
"요약만 보고 승격 금지" 규칙 덕에, 수집 워커의 오독(자동자막 오인식 포함)이 판정 단계에서 세 번 걸러졌습니다.
시 행착오
역할 분리의 최초 실패는 프롬프트였습니다. 수집 워커에게 "중요한 것을 골라와"라고 시켰더니 판정을 하기 시작했습니다. "고르지 말고 전 구간을 다뤄라, 판단이 필요한 항목은 그대로 인용하라"로 바꾸니 해결됐습니다. 역할은 모델 배치가 아니라 권한 문구로 갈립니다.
위임하면 등급이 자동으로 낮아진다는 걸 받아들여야 합니다. 하위 모델 산출물은 아무리 좋아도 [요약]입니다. 이걸 아까워서 [검증]처럼 쓰기 시작하면 분리가 무의미해집니다.
재검증자에게 원문 접근을 주지 않는 게 오히려 낫습니다. 원문이 손에 있으면 재독의 유혹이 생깁니다. "새로 검색하라"는 지시와 함께 출처 식별자(URL, 저장소명)만 줍니다.
꿀팁
3역을 항상 다 돌릴 필요는 없습니다. 저희 기준: 내부 참고용이면 수집+판정, 사업 문서(제안서·백로그)에 들어갈 수치면 반드시 재검증까지. 문서의 목적지가 검수 강도를 정합니다.
수집 워커 산출물에 라인 번호를 강제하면 판정자의 대조 비용이 절반으로 줄어듭니다.
도움이 필요한 부분
판정자와 재검증자를 서로 다른 벤더 모델로 두는 교차검수까지 가야 하는지 고민입니다. 같은 벤더 분리만으로 충분했던/부족했던 경험이 있으신가요?
OT에서 소개된 멀티 LLM 에이전트 팀(마스터-워커 소켓 통신)에 이 3역을 얹는 구조가 궁금합니다 — 3~4주차 기대하고 있습니다.
도움 받은 글
1주차 OT — 멀티 에이전트 상호 검수, 인간 합치도 개념
도도치 이야기 002 — "도도치가 만든 걸 도도치가 귀엽다고 판정하면 자기채점" — 이 문장이 3역 분리의 출발점이었습니다
22기 딥리서치 사례글 — 독립 재검색 게이트의 원류