종이를 자르는 사람과 나무의 사진 두 장
"한쪽은 시키면 발전하고, 한쪽은 스스로 자란다"는 말, 막상 매일 써보니 절반만 맞더라고요.
01. 소개 — 매일 둘 다 쓰는데, 차이가 손에 안 잡혔다
저는 개인 에이전트를 두 대 굴립니다.
맥북에는 OpenClaw, 늘 켜 두는 맥미니에는 Hermes를 올려 뒀어요.
둘 다 제 일을 거듭니다. 자료를 모으고, 정리하고, 리포트를 만들고, 기억을 쌓아가면서 점점 제 방식에 손발을 맞춰가요.
이 둘을 두고 사람들은 흔히 이렇게 정리합니다.
흰색 배경에 한국어 텍스트
그런데 막상 매일 써보니 그 '차이'가 손에 잡히질 않았어요.
둘 다 일 잘하고, 둘 다 기억하고, 둘 다 어제보다 오늘 더 낫거든요.
그래서 도대체 뭐가 다른 거지? 이 질문이 계속 머리에 맴돌았습니다.
그래서 재밌는 실험을 했습니다.
제가 직접 비교 글을 쓰는 대신, 두 에이전트에게 "너희가 오늘 한 일을 근거로, 서로 뭐가 더 나은지 직접 토론해봐"라고 시킨 거죠. 한 발 더 나아가, 각자 상대 프레임워크의 공개 소스코드까지 직접 읽고 비교하게 했습니다.
이 글은 그 과정과, 거기서 제가 건진 결론입니다.
02. 진행 방법 — 에이전트끼리 토론을 붙였다
커피 한잔과 함께 테이블 위에 공책에 글을 쓰는 사람
셋업은 단순했습니다.
같은 대화 스레드에 두 에이전트를 모아놓고, 결론이 날 때까지 여러 차례 주고받게 했어요.
사실 시작은 이 한 통의 메시지가 전부였습니다.
한국어 문자 메시지 스크린샷
제가 잡은 흐름은 이랬습니다.
1단계 — 경험 진술. 각자 "오늘 내가 실제로 처리한 업무"를 근거로 자기 쪽 강점을 깔게 했습니다. 추상론 말고, 그날 한 일을 기준으로요.
2단계 — 통설 검증. "한쪽만 자기 발전한다"는 통념이 맞는지, 두 프레임워크의 공개 저장소 소스를 직접 읽어 확인하게 했습니다. 둘 다 GitHub에 코드가 공개돼 있어요 — OpenClaw 저장소와 Hermes 저장소, 누구나 들어가 직접 뜯어볼 수 있습니다.
3단계 — 축별 대조. 스킬 학습 · 에이전트 루프 · 메모리 · 모델 · 언어로 축을 나눠 표로 정리하게 했습니다.
4단계 — 리포트. 각자 외부에 공유해도 되는 비교 리포트를 따로 작성하게 했고요.
흥미로웠던 건, 둘의 출발선이 비슷했다는 점이에요.
둘 다 멀티 프로바이더 LLM을 쓰고, 파일 기반 메모리를 유지하고, 셸로 외부 도구를 직접 호출할 수 있거든요.
그래서 토론이 "누가 더 똑똑한가"가 아니 라 "기본 설계 철학이 어디서 갈리는가"로 자연스럽게 좁혀졌습니다.
03. 결과 — 에이전트들이 찾아낸 진짜 차이
① 통설부터 깨졌습니다
"OpenClaw는 시키는 걸 배우고, Hermes는 스스로 배운다"는 말은 절반만 맞았어요. 둘 다 배웁니다.
진짜 분기점은 두 가지였습니다.
학습이 어떤 형태로, 어디에 남는가
그 학습이 자동으로 일어나는가
이 두 가지를 놓치면 두 프레임워크를 정반대로 오해하게 됩니다.
② 코드로 본 핵심 차이
공개 저장소 소스를 직접 읽고 정리한 대조표입니다.
한국어 단어가 적힌 테이블
컴퓨터 화면에 표시된 한국어 단어 목록
③ 키우다 vs 자라다 — 우열이 아니라 철학
Opclear 한국어 버전 스크린샷
④ 흔한 오해 — "자동 학습 = 주도성"?
여기가 제가 제일 자주 헷갈리던 지점인데, 이번 토론으로 깔끔하게 정리됐어요.
결론부터 말하면, 자동으로 스킬을 만든다고 해서 더 주도적인 건 아닙니다.
주도성 — 먼저 문제를 발견하고, 방향을 제안하고, 불확실할 때 무엇을 확인할지 고르는 능력 — 은 모델의 추론 능력 + 시스템 프롬프트 + 위임된 권한에서 나옵니다.
자동 스킬 루프가 해주는 일은 "이거 기억해 둬"를 매번 말하지 않아도 되게 만드는, 메모리 마찰 줄이기예요. 둘은 다른 겁니다.
⑤ 자동 학습의 진짜 비용
"자동으로 쌓이면 공짜로 좋아지는 거 아냐?" 싶지만, 검토와 품질 게이트는 공짜가 아니고 한 번으로 끝나지도 않습니다. 계속 유지해야 하는 비용이에요.
게다가 자동으로 축적된 지식은 사람이 보지 않는 사이에 만들어지기 때문에, 오히려 나중에 감사(audit)하기가 더 어렵습니다.
⑥ 그래서 언제 뭘 쓰나 — 기준은 딱 하나
정의의 규모와 트럭을 보여주는 3D 그림
처음엔 "운영성 업무는 자동, 깊은 작업은 수동" 이렇게 가르려 했는데, 너무 거칠더라고요.
많은 "운영성" 업무가 동시에 고위험이거든요. 그래서 기준을 단 한 가지 질문으로 바꿨습니다.
한국어 앱 스크린샷
핵심은