Hermes + 텔레그램 + Gemma 4 연동기 - kyung님 사례를 적용해보다

참고: 아무튼 로컬모델 1주차 kyung님의 글을 읽고 와 이거 대박이다 해봐야겠다하고 적용해본 후기입니다.


LM Studio에 Gemma 4 E4B를 올려두고, Hermes 에이전트까지 연결해 둔 상태였습니다.
이제 텔레그램에서 폰으로 바로 물어보면 되겠다 — 그게 목표였어요.

그런데 Windows + Hermes + LM Studio + 텔레그램 조합은 생각보다 함정이 많았습니다.


1. 사용한 모델과 환경

항목

내용

모델

Google Gemma 4 E4B (google/gemma-4-e4b)

실행

LM Studio (로컬 서버, http://127.0.0.1:1234)

에이전트

Hermes AI Agent

메신저

Telegram (@BotFather 봇)

PC

RTX 3070 (VRAM 8GB), RAM 32GB, Windows 11

도움

Claude (설정·트러블슈팅 대화)

처음에는 Python으로 bot.py를 직접 만들어 LM Studio에 붙이는 방법도 시도했지만, 결국 Hermes Gateway + 텔레그램 조합으로 갔습니다.



2. Python 봇 시도 — Qwen3.5 thinking 함정

처음 속이기 시도를 할때 e4b모델보다 큰 Qwen3.5-9B를 썼습니다. 텔레그램 봇은 "⏳ 생각 중..."에서 멈췄고:

telegram.error.BadRequest: Message text is empty

LM Studio 로그:

"content": ""
"reasoning_content": "Thinking Process: ..."
"finish_reason": "length"

원인: Qwen3.5는 thinking 모드로 먼저 긴 사고를 하고, content는 비어 있는 채 토큰이 소진됨.

시도한 해결:

  • MAX_TOKENS 늘리기

  • 메시지에 /no_think 붙이기

  • reasoning_content를 읽도록 bot.py 수정

RTX 3070 8GB + 9B 모델 + thinking 조합은 속도·안정성 모두 한계가 있어 아 우선 e4b로 속도를 끌어 올려놓고 생각해야겠다 라는 생각이 들었습니다.


3. Hermes + 텔레그램 — kyung님의 1주차 글처럼 설정하기

config.yaml을 이렇게 맞췄습니다.

3-1. Hermes에는 64K라고 말하기

model:
  default: google/gemma-4-e4b
  provider: lmstudio
  base_url: http://127.0.0.1:1234/v1
  context_length: 65536
  max_tokens: 2048

3-2. memory 끄기 (토큰 절약)

memory:
  memory_enabled: false
  user_profile_enabled: false

3-3. toolsets 비우기

gpters 글처럼 tool schema만 11K 토큰을 먹을 수 있어서, 플랫폼별 toolsets를 비웠습니다.

platform_toolsets:
  cli: []
  telegram: []
  discord: []
  whatsapp: []
  slack: []

3-4. compression 끄기 + context engine

Gemma E4B는 context window가 작아 compression 모델 요구에 걸릴 수 있습니다.

compression:
  enabled: false

context:
  engine: truncate   # compressor → truncate

3-5. agent 설정

agent:
  tool_use_enforcement: none
  reasoning_effort: ''

핵심 원리 (kyung님 1주차 글과 동일):

"짧은 메시지"가 "짧은 요청"은 아니다.
Hermes는 system prompt + memory + tool schema + 세션 정보가 붙으면 실제 토큰이 훨씬 커진다.


4. Gateway 재시작 및 설명

설정을 다하고 나면 게이트 웨이를 재시작해야합니다. 혹시몰라 게이트웨이 관련 사용설명

내용 첨부합니다.

A-1. Gateway 로그 확인

type C:\Users\bjkim\AppData\Local\hermes\logs\gateway.log

A-2. 자주 나오는 오류 원인

로그

의미

해결방법

No messaging platforms enabled

.env 텔레그램 설정 무시됨

# TELEGRAM_BOT_TOKEN=# 제거

python-telegram-bot not installed

Hermes venv에 패키지 없음

venv의 python.exe -m pip install ...

The token was rejected

토큰 만료/노출

BotFather에서 Revoke 후 재발급

n_keep: 13851 >= n_ctx: 2048

LM Studio context가 2048로 로드됨

LM Studio에서 Context Length 조정

A-3. Gateway 명령어 (Windows)

hermes gateway run
hermes gateway restart
hermes gateway status

(hermes gateway telegram 은 invalid choice — run / restart 사용)

A-4. python-telegram-bot 설치방법 (Hermes 전용 venv)

C:\Users\bjkim\AppData\Local\hermes\hermes-agent\venv\Scripts\python.exe -m ensurepip
C:\Users\bjkim\AppData\Local\hermes\hermes-agent\venv\Scripts\python.exe -m pip install "python-telegram-bot[ext]"
hermes gateway restart

성공 로그:

INFO gateway.platforms.telegram: [Telegram] Connected to Telegram (polling mode)
INFO gateway.run: Gateway running with 1 platform(s)

6. LM Studio — "속이기" + 속도 튜닝

kyung님 1주차 글 + 튜닝법 합성으로 같이:

레이어

설정

Hermes config.yaml

context_length: 65536 유지

LM Studio 실제 로드

Context Length 4096

GPU Offload

슬라이더 최대 (38 → max)

Offload KV Cache to GPU Memory

ON

Hermes는 64K인 줄 알고 동작하고, LM Studio는 4K로 빠르게 처리하는 "속이기" 구조입니다.

속도 Before / After (LM Studio 로그 기준)

Before

After

생성 속도

~17 t/s

~74 t/s

총 처리 시간

~17초

~9초

prompt eval

~1452 tokens/s

체감으로도 확실히 빨라졌습니다.

이게 어느정도냐면 예전 GPT-4o 속도입니다......

토큰 생성 속도 비교

모델

속도

내 로컬 (지금)

74 t/s

Claude Sonnet

80~100 t/s

GPT-4o

60~80 t/s

Claude Haiku

150~200 t/s

GPT-4o mini

100~150 t/s

다만 품질이 떨어지지요.....ㅜㅜ

Gemma 4 E4B ≈ 과거 클라우드 모델

시기

모델

비교

2023년 초

GPT-3.5 터보 초기버전

비슷한 수준

2023년

Claude 2 초기

약간 낮음

2022년

GPT-3 davinci

비슷하거나 약간 위

그래도 3.5나왔을때도 신세계였습니다.....

재부팅 후 설정 유지

  • LM Studio: 설정 변경 후 「변경 사항을 적용하려면 다시 불러오세요」 클릭 → 프리셋 저장

  • Hermes 자동 시작

  • LM Studio: Start server on launch 옵션


7. 빠른 대답 !!

텔레그램에서 Hermes 봇에 안녕을 보내면:

  1. Gateway가 메시지 수신

  2. LM Studio Gemma 4 E4B가 응답 생성

  3. 텔레그램으로 스트리밍 답변

연결 성공 기준: gateway.log[Telegram] Connected + 텔레그램에서 실제 답변 수신.


8. 마무리 !!

  1. Windows에서는 Linux 가이드를 그대로 쓰지 말 것notepad, py -m pip, hermes gateway run이 정답에 가깝다.

  2. Qwen thinking 모델은 content가 비어 올 수 있다/no_think 또는 Gemma처럼 thinking 없는 모델 검토.

  3. gpters kyung님 1주차 글의 원리가 Hermes 속도의 핵심 — memory off, toolsets [], compression off, context truncate, LM Studio Context 4096.

  4. GPU Offload + KV Cache GPU — RTX 3070 8GB에서 Gemma E4B 기준 17 t/s → 74 t/s 체감 개선.

  5. 품질 vs 속도 — 생성 속도는 GPT-4o급(60~80 t/s)에 가깝지만, 답변 품질은 2023년 초 GPT-3.5 터보 수준 정도로 보면 된다. 무료·로컬·프라이버시가 trade-off.


📋 재사용 프롬프트

Hermes 텔레그램 연결 안 될 때

Windows에서 Hermes + LM Studio + Gemma 4 쓰는 중이야. hermes gateway.log에 아래 메시지가 나와. 원인과 순서대로 해결법 알려줘. [로그 붙여넣기]

gpters 1주차처럼 config 최적화

Hermes config.yaml이야. gpters 「아무튼 로컬모델 1주차」 글처럼 memory 끄기, toolsets 비우기, compression 끄기, context truncate 설정 어디를 어떻게 바꿔야 하는지 알려줘. [config.yaml 일부 붙여넣기]

LM Studio 속도 튜닝

RTX 3070 8GB, Gemma 4 E4B, Hermes context_length 65536 유지한 채 LM Studio에서 Context Length 4096 + GPU Offload max + KV Cache GPU 설정 순서와 주의점 알려줘.


2
3개의 답글
밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.