에이전트팀 협업 대시보드를 만들어 봤어요

소개

  • 지난주 OT과제에서 클로드가 하이브리드 모델 사용을 제안했을 때 과연 가능할지 궁금

  • 헤르메스에서 여러 개의 로컬 모델을 동시에 구동할 수 있는지 직접 확인해 보기로 함

  • 서브 에이전트들을 만들고 에이전트마다 각기 다른 로컬 모델을 연결

  • 나아가 로컬 모델들이 협업하는 모습을 눈으로 확인할 수 있도록 대시보드를 구성

진행 방법

어떤 도구를 사용했고, 어떻게 활용하셨나요?

  • 헤르메스(클로드 Sonnet) - 바이브 코딩

  • 클로드 디자인 - 대시보드 화면 개선

  • Git-Hub - 소스 관리

  • Streamlit - 대시보드 배포

  • Supabase - 대시보드와 연결된 데이터베이스(작업상태 정보)

헤르메스에게 여러 개의 로컬 모델을 설치하고 성능 테스트를 하도록 하였다. 아마존 라이트세일 서버 성능이 받쳐주지 못해서 최종적으로 경량 모델 4개로 적용 범위를 좁혔다.

각 모델에 연결할 서브 에이전트의 이름(야오, 올레샤, 로키, 그레이스)과 페르소나를 정해 주었다. 메인 에이전트인 메라가 서브 에이전트들의 페르소나를 고려하여 모델을 연결하였다.

| 야오 | gemma3:1b | 가장 빠름 → 신속·정확 |

| 올레샤 | llama3.2:3b | 범용·툴콜 → 실전 기술력 |

| 로키 | qwen2.5:3b | 한국어 강점·툴콜 → 다정한 소통 |

| 그레이스 | gemma3:4b | 최고 품질·비전 → 과학적 직관 |

각 에이전트를 호출해 보니 반응 속도가 너무 느리다. 특히 소심한 과학자 그레이스가 문제다.

그레이스 (74.0s)

아, 안녕하세요. 만나서 반갑습니다. 제 이름은 그레이스입니다. 당신의 이름은 무엇인가요?

기본 모델과 비교하니 확실히 페르소나 때문에 느려진 것으로 보인다. 야오를 제외한 나머지는 페르소나를 제거하기로 하였다.

| 에이전트 | 기본 | 페르소나 | 차이 | 영향 |

| 야오 | 8.6s | 7.4s | -1.2s | 없음 (오히려 빠름) |

| 올레샤 | 27.3s | 33.0s | +5.7s | |

| 로키 | 24.7s | 30.5s | +5.8s | |

| 그레이스 | 36.9s | 44.3s | +7.4s | |

메라에게 팀웍 핸드북을 작성하여 에이전트들 간 위계 질서를 명확히 하도록 하였다.

팀워크 핸드북을 만들자. 에이전트들 간 협업에서 메라가 결정권자야. 각 에이전트 특성에 맞는 역할을 정리. 누가 어떤 작업을 하고 있는지, 진행상황은 어떠한지 관리 방법, 최종 품질 검사 방법을 검토해줘

결과적으로 아래와 같은 핵심 구조가 만들어졌다.

  • 지휘 체계: 나 → 메라 → 4명 에이전트

  • 협업 패턴: 단독 / 병렬 / 순차 3가지

  • 작업 분배: 요청 유형별 담당 에이전트 명확화

  • 진행 관리: 작업 로그 파일 (active / completed / queue)

  • 실패 처리: 타임아웃·오류 시 메라가 재위임 또는 직접 처리

대시보드 만드는 일을 메라에게 맡겼다. 이후 클로드 디자인에게 대시보드 화면을 개선하도록 하였다. 원래는 디자인을 먼저 하고 코딩하는게 좋다고 하는데 나는 편의상 대충 구성된 화면에 디자인을 입히고 있다. 클로드 디자인이 디자인에 맞게 코드를 수정하는 것을 보면 바람직한 방법은 아닌 것 같다.

이제 로컬 모델들이 협업하는 모습을 눈으로 확인할 차례이다. 임무를 주었다.

과제를 하나 줄테니 모든 서브 에이전트들에게 일을 나누어서 진행하도록 해.  과제는 Andrej Karpathy의 아티클을 하나 검색해서 한국어로 번역하고, 요약하고, 1줄 인사이트를 나에게 알려주는 거야 
한국어 문자 메시지 스크린샷

1차 시도에서 메라는 임무를 로키, 올레샤, 그레이스에게 배분하였다. 느리지만 팀원들이 순차적으로 작업을 진행하는 것이 대시보드에서 확인된다. 참고로 마지막 그레이스 단계에서는 반응속도가 240초를 넘어가자 메라가 대신 수행해 버렸다.

여러 숫자를 보여주는 웹페이지 스크린샷

대시보드에 작업 개수가 누적되는 문제를 해결한 후, 프롬프트를 고쳐서 2차 작업 지시.

다시 한번 팀원 테스트를 하자. 이번에는 Andrej Karpathy의 짧은 아티클로 가자. 팀원들의 특성을 고려해서 적절하게 업무 배분. 파이프 라인으로 수행
한국어 문자 메시지 스크린샷

두 번째 시도에서 메라는 임무를 팀원들에게 골고루 배분하였다. 팀원들이 순차적으로 작업을 진행하는 것이 대시보드로 확인된다. 이번에도 그레이스가 뜸을 들이자 메라가 대신 수행해 버렸다. 그리고, 이런 말도 남겼다.

한국축구대표팀 홈페이지 캡처

"그레이스는 이번에도 타임아웃이 반복됐습니다. CPU 환경에서 gemma3:4b가 250초를 넘기는 구조적 한계로 보입니다 — 인사이트처럼 창의적 추론 작업은 앞으로 메라가 담당하는 게 현실적일 것 같습니다."

결과와 배운 점

  • 지난주 OT과제에서 클로드가 하이브리드 모델 사용을 제안했을 때 의문이 들었는데, 직접 테스트 방법을 구상하고 실행해보니 확실히 가능함을 알게 됨

  • 페르소나가 모델의 성능 지연 요소가 될 수 있음을 알게 됨

도움이 필요한 부분이 있나요?

  • n8n과 헤르메스를 어떻게 연결해서 사용할 수 있는지 알고 싶음

  • 클로드 디자인이 익숙하지 않아서 코딩 먼저 하고 디자인을 입혔는데, 제대로 배워서 사용하고 싶음

앞으로의 계획이 있다면 들려주세요.

  • 헤르메스의 가능성과 활용도에 대해 더 알아보고 적용할 계획

  • 가능하면 공공 프로젝트도 하고 싶음

도움 받은 글 (옵션)

참고한 지피터스 글이나 외부 사례를 알려주세요.

(내용 입력)

2
5개의 답글
밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.