비개발자가 Hermes Agent로 자동루프 리서치 v0.2를 만든 사례

소개

저는 가상자산, 스테이블코인, RWA, STO, Travel Rule 같은 규제·사업 주제를 계속 추적해야 합니다.

처음에는 Hermes Agent에게 단순히 이렇게 요청했습니다.

text
스테이블코인 규제 최신 동향 조사해줘.

하지만 이 방식은 한계가 있었습니다.

- 매번 검색 기준이 달라질 수 있음
- 공식 출처와 뉴스가 섞임
- 기존 위키에 있는 내용인지 구분하기 어려움
- 조사 과정과 판단 근거가 남지 않음
- 좋은 리포트인지 평가 기준이 없음

그래서 Hermes를 단순 챗봇이 아니라, 반복 가능한 리서치 업무를 수행하는 개인 리서치 에이전트처럼 써보기로 했습니다.

참고한 아이디어는 Andrej Karpathy의 autoresearch 프로젝트입니다. 
원본은 AI가 머신러닝 실험을 반복하는 구조인데, 저는 이것을 규제 리서치 업무에 맞게 바꿨습니다.

| 원본 Autoresearch | 제 업무 적용 |
|---|---|
| AI가 코드 수정 | AI가 리서치 후보 리포트 작성 |
| 실험 반복 | 규제 자료 조사 반복 |
| 성능 지표 평가 | 출처 신뢰도·새로움·사업성 평가 |
| 실험 로그 | 리서치 실행 로그 |
| 좋은 결과 유지 | 승인된 리포트만 위키 반영 |

목표는 완전 자동화가 아니라 다음 구조였습니다.

text
자료 검색
→ 기존 위키와 비교
→ 후보 리포트 작성
→ 평가 점수 부여
→ 사람 승인 후 최종 반영

---

진행 방법

Hermes Agent와 기존 Agent-wiki를 활용해 Autoresearch 작업 공간을 만들었습니다.

현재 v0.2 구조는 아래와 같습니다.

text
Agent-wiki/autoresearch/
  README.md
  research_program.md
  evaluator.md
  promotion_workflow.md

  templates/
    candidate_report_template.md
    idea_template.md
    run_log_template.md
    manual_runner_prompt.md

  runs/
  candidates/
  sources/
  approved/
  rejected/

각 파일과 폴더의 역할은 다음과 같습니다.

| 항목 | 역할 |
|---|---|
| research_program.md | Hermes가 따라야 할 리서치 운영 매뉴얼 |
| evaluator.md | 후보 리포트 평가 기준 |
| promotion_workflow.md | 승인 후 위키 반영 절차 |
| templates/ | 반복 실행용 템플릿 |
| runs/ | 각 리서치 실행 로그 |
| candidates/ | 후보 리포트 |
| sources/ | 출처 목록 |
| approved/ | 승인된 자료 |
| rejected/ | 폐기 또는 보류 자료 |

핵심 원칙은 하나였습니다.

text
AI가 만든 리포트는 최종 지식이 아니다.
사람이 승인해야만 위키에 반영한다.

---

Autoresearch v0.2 실행 흐름

v0.2에서 만든 수동 실행 흐름은 다음과 같습니다.

text
Steve request
→ 리서치 아이디어 3~5개 생성
→ 가장 좋은 아이디어 선택
→ 공식 출처 우선 검색
→ 기존 Agent-wiki / RAG와 비교
→ 후보 리포트 작성
→ evaluator.md 기준 점수화
→ runs/에 실행 로그 저장
→ Slack으로 결과 보고
→ 승인 전까지 최종 wiki 반영 금지


기존 방식이 단순히:

text
질문 → 검색 → 답변

이었다면, v0.2는:

text
요청 → 아이디어 선택 → 조사 → 비교 → 후보 작성 → 평가 → 로그 저장 → 승인 대기


로 바뀐 셈입니다.

---

실제 테스트: 미국 스테이블코인 규제

테스트 주제로는 미국 스테이블코인 규제 / GENIUS Act를 사용했습니다.

요청은 간단했습니다.

text
미국 스테이블코인 규제로 테스트부탁해

Hermes는 이 요청을 Autoresearch run으로 처리했습니다.

생성된 실행 폴더는 다음과 같습니다.

text
runs/2026-06-11-us-stablecoin-genius-act/

그 안에는 다음 파일이 생성됐습니다.

| 파일 | 내용 |
|---|---|
| idea_candidates.md | 리서치 아이디어 후보 |
| selected_idea.md | 선택된 아이디어 |
| run.md | 실행 로그 |
| evaluation.md | 평가 결과 |

후보 리포트와 출처 목록도 따로 저장했습니다.

text
candidates/2026-06-11-us-stablecoin-genius-act.md
sources/2026-06-11-us-stablecoin-genius-act-sources.md

선택된 아이디어는 다음이었습니다.

text
GENIUS Act enacted framework and implementation status

이유는 미국 payment stablecoin 규제의 기준점을 먼저 잡아야, 이후 issuer DD, AML/sanctions, reserve monitoring 같은 세부 주제로 확장할 수 있기 때문입니다.

---

평가 기준

후보 리포트는 evaluator.md 기준으로 25점 만점 평가를 했습니다.

| 항목 | 점수 |
|---|---:|
| 출처 신뢰도 | 5 |
| 새로움 | 4 |
| 규제 / 리스크 중요도 | 5 |
| 사업 / 제품 관련성 | 5 |
| 실행 가능성 | 4 |
| 총점 | 23 / 25 |

결과는 다음과 같았습니다.

text
Strong candidate for approval

다만 최종 위키에는 바로 반영하지 않았습니다.

현재 상태는 다음입니다.

text
candidate only.
No final wiki ingest performed.

즉, Hermes가 리서치 후보를 만들고 평가까지 했지만, 최종 반영은 사람 승인 후에만 하도록 했습니다.

---

배운 점

1. AI에게 “답”보다 “절차”를 줘야 한다

단순 요청:

text
미국 스테이블코인 규제 조사해줘.

보다 더 좋은 요청은:

text
미국 스테이블코인 규제로 Autoresearch run 해줘.
공식 출처를 우선 검색하고,
기존 wiki와 비교하고,
후보 리포트와 평가 점수를 남겨줘.

였습니다. 이렇게 하니 결과가 단발성 답변이 아니라, 재사용 가능한 작업 기록으로 남았습니다.

---

2. 후보와 최종 지식을 분리해야 한다

AI가 만든 문서를 바로 최종 위키에 넣으면 위험합니다.

그래서 구조를 나눴습니다.

text
candidates/ → 검토 대상
approved/   → 승인된 자료
rejected/   → 폐기 자료

이 분리가 매우 중요했습니다.

---

3. 평가 기준이 있어야 품질이 안정된다

AI 리서치는 그럴듯하지만 틀릴 수 있습니다.

그래서 다음 항목을 강제로 확인했습니다.

- 공식 출처가 있는가?
- 출처 링크가 있는가?
- 기존 위키와 비교했는가?
- 새 내용인가?
- 사업적으로 쓸모가 있는가?
- 리스크와 caveat가 있는가?
- 너무 단정적으로 말하지 않는가?

이 기준이 있으니 결과물을 감으로 판단하지 않고, 일정하게 검토할 수 있었습니다.

---

앞으로의 계획

현재 v0.2는 수동 Autoresearch loop입니다.

아직 하지 않은 것은 다음입니다.

text
- cron 자동화
- 자동 wiki ingest
- RAG rebuild 자동화
- slash command 추가

이것들은 일부러 하지 않았습니다.  처음부터 자동화하면 품질 관리가 어려울 수 있기 때문입니다.
---

결론

이번 작업을 통해 Hermes를 단순 챗봇이 아니라, 개인 리서치 에이전트처럼 활용할 수 있다는 가능성을 확인했습니다. 핵심은 AI에게 “알아서 조사해줘”라고 하는 것이 아니라, 다음을 정해주는 것이었습니다.

text
무엇을 조사할지
어떤 출처를 우선할지
기존 지식과 어떻게 비교할지
어떤 기준으로 평가할지
언제 사람이 승인할지
text
자동 검색
→ 자동 정리
→ 자동 평가
→ 사람 승인
→ 최종 지식 반영

이 구조가 앞으로 제가 규제 리서치와 사업 아이디어를 축적하는 기본 방식이 될 수 있을 것 같습니다.

2
1개의 답글
밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.