arXiv 논문 reviewer 검토해보기

클로드 코드 토큰을 거의 소모해서 많은 작업을 하지 못했는데요, arXiv 논문 reviewer라는 걸 알게 되어 한 번 검토해봤습니다. https://arxiv.org/html/2608.00005



## 한줄 요약

직접 쓴 설계 문서를 로컬에 받아둔 오픈소스 레포arXiv 논문 두 기준으로 교차 검증했더니, 제 주장에 실측 근거가 붙고 제가 못 보던 리스크 하나가 통째로 드러났습니다. 실제로 입력한 프롬프트는 두 줄이었습니다.

## 소개: 시도하고자 했던 것과 그 이유

### 문제 상황 (Before)

설문 문항을 분석해서 마인드맵으로 만들어주는 도구를 만들고 있습니다. 그런데 같은 문서를 다시 분석하면 분류가 조금씩 달라지는 현상을 계속 봤어요.

문제는 다음 단계였습니다. 분석 결과를 DB에 영구 저장하는 설계를 하려니, 흔들리는 분류를 그대로 박아 넣는 꼴이 되더라고요. 한 번 저장되면 그 뒤의 모든 작업(진단·권고안·개선안)이 그 분류를 믿고 돌아가는데, 정작 그 분류가 매번 다르게 나오는 겁니다.

### 시작하게 된 계기

플랜 문서는 이미 다 써놨습니다. 검증 항목도 8개 넣었고요. 그런데 다시 읽어보니 8개가 전부 "코드가 안 깨진다"만 확인하는 검사였어요. 정작 흔들리는 그 분류가 쓸 만한지를 재는 항목은 하나도 없었습니다.

어떤 지표를 써야 할지 몰라서 계속 미뤄뒀는데, 문득 제 워크스페이스에 이미 답이 될 만한 자료가 있다는 게 떠올랐습니다. 지식관리 오픈소스 레포를 받아만 두고 안 읽고 있었거든요.

---

논문(RubricReviewer — 루브릭 기반 자동 논문심사 프레임워크)을 직접 읽고, 이미 나와 있던 제안과 한 줄씩 대조해보라 시켜봤습니다.

---

### 막혔던 순간과 해결

문제 1 - 내 문서끼리 서로 다른 말을 하고 있었음

결과물 저장 경로가 명령어 문서와 템플릿 문서에 서로 다르게 적혀 있는 걸 발견했습니다. 몇 달째 모르고 있었어요.

해결: 규칙에 맞는 쪽으로 통일. 곁다리로 걸린 건데 이게 제일 실질적인 수확일지도 모르겠습니다.

문제 2 — 논문 수치를 그대로 쓰려다 제동이 걸림

"recall 80.5% 이상 통과" 같은 걸 그대로 기준으로 삼으려 했는데, 이런 지적을 받았습니다.

> 논문은 12,000편 규모 골드 데이터로 낸 수치입니다. 당신의 테스트 데이터는 8문항입니다. 가져올 것은 지표의 정의이지 통과 기준선이 아닙니다.

---

## 결과와 배운 점

### Before vs After

| 항목 | Before | After |

| -------------- | ----------------------------- | ------------------------------------------------------------ |

| 검증 항목 성격 | 8개 전부 "코드가 안 깨지는가" | 3층으로 분리 — 결정론 검사 / 규칙표 대조 / LLM 품질 판정 |

| 분류 재현성 | 측정 방법 없음 | Δcat(재분석 시 분류 분포 변화량)으로 수치화 |

| 정답 대비 채점 | 없음 | STRICT(정확 일치) / LENIENT(같은 상위 분류면 정답) 이중 채점 |

| 보안 축 | 항목 자체가 없었음 | 프롬프트 인젝션 검증 1건 추가 |

| 제안의 근거 | "이렇게 하는 게 좋아 보인다" | 논문 ablation 실측 + OSS 설계 원칙 |

### 정리된 반영 항목:

1. 분류 체계를 3층 구조로 (공통 고정 / 문서별 생성 / 기존 자산에서 마이닝)

2. 평가 지표 4개 추가 (`Δcat`, STRICT/LENIENT, Recall, 생성 개수)

3. 프롬프트 인젝션 테스트 케이스 1건

1
밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.