참고: 아무튼 로컬모델 1주차 kyung님의 글을 읽고 와 이거 대박이다 해봐야겠다하고 적용해본 후기입니다.
LM Studio에 Gemma 4 E4B를 올려두고, Hermes 에이전트까지 연결해 둔 상태였습니다.
이제 텔레그램에서 폰으로 바로 물어보면 되겠다 — 그게 목표였어요.
그런데 Windows + Hermes + LM Studio + 텔레그램 조합은 생각보다 함정이 많았습니다.
1. 사용한 모델과 환경
항목
내용
모델
Google Gemma 4 E4B (google/gemma-4-e4b)
실행
LM Studio (로컬 서버, http://127.0.0.1:1234)
에이전트
Hermes AI Agent
메신저
Telegram (@BotFather 봇)
PC
RTX 3070 (VRAM 8GB), RAM 32GB, Windows 11
도움
Claude (설정·트러블슈팅 대화)
처음에는 Python으로 bot.py를 직접 만들어 LM Studio에 붙이는 방법도 시도했지만, 결국 Hermes Gateway + 텔레그램 조합으로 갔습니다.
2. Python 봇 시도 — Qwen3.5 thinking 함정
처음 속이기 시도를 할때 e4b모델보다 큰 Qwen3.5-9B를 썼습니다. 텔레그램 봇은 "⏳ 생각 중..."에 서 멈췄고:
telegram.error.BadRequest: Message text is emptyLM Studio 로그:
"content": ""
"reasoning_content": "Thinking Process: ..."
"finish_reason": "length"원인: Qwen3.5는 thinking 모드로 먼저 긴 사고를 하고, content는 비어 있는 채 토큰이 소진됨.
시도한 해결:
MAX_TOKENS늘리기메시지에
/no_think붙이기reasoning_content를 읽도록bot.py수정
RTX 3070 8GB + 9B 모델 + thinking 조합은 속도·안정성 모두 한계가 있어 아 우선 e4b로 속도를 끌어 올려놓고 생각해야겠다 라는 생각이 들었습니다.
3. Hermes + 텔레그램 — kyung님의 1주차 글처럼 설정하기
config.yaml을 이렇게 맞췄습니다.
3-1. Hermes에는 64K라고 말하기
model:
default: google/gemma-4-e4b
provider: lmstudio
base_url: http://127.0.0.1:1234/v1
context_length: 65536
max_tokens: 20483-2. memory 끄기 (토큰 절약)
memory:
memory_enabled: false
user_profile_enabled: false3-3. toolsets 비우기
gpters 글처럼 tool schema만 11K 토큰을 먹을 수 있어서, 플랫폼별 toolsets를 비웠습니다.
platform_toolsets:
cli: []
telegram: []
discord: []
whatsapp: []
slack: []3-4. compression 끄기 + context engine
Gemma E4B는 context window가 작아 compression 모델 요구에 걸릴 수 있습니다.
compression:
enabled: false
context:
engine: truncate # compressor → truncate3-5. agent 설정
agent:
tool_use_enforcement: none
reasoning_effort: ''핵심 원리 (kyung님 1주차 글과 동일):
"짧은 메시지"가 "짧은 요청"은 아니다.
Hermes는 system prompt + memory + tool schema + 세션 정보가 붙으면 실제 토큰이 훨씬 커진다.
4. Gateway 재시작 및 설명
설정을 다하고 나면 게이트 웨이를 재시작해야합니다. 혹시몰라 게이트웨이 관련 사용설명
내용 첨부합니다.
A-1. Gateway 로그 확인
type C:\Users\bjkim\AppData\Local\hermes\logs\gateway.logA-2. 자주 나오는 오류 원인
로그
의미
해결방법
No messaging platforms enabled
.env 텔레그램 설정 무시됨
# TELEGRAM_BOT_TOKEN= → # 제거
python-telegram-bot not installed
Hermes venv에 패키지 없음
venv의 python.exe -m pip install ...
The token was rejected
토큰 만료/노출
BotFather에서 Revoke 후 재발급
n_keep: 13851 >= n_ctx: 2048
LM Studio context가 2048로 로드됨
LM Studio에서 Context Length 조정
A-3. Gateway 명령어 (Windows)
hermes gateway run
hermes gateway restart
hermes gateway status(hermes gateway telegram 은 invalid choice — run / restart 사용)
A-4. python-telegram-bot 설치방법 (Hermes 전용 venv)
C:\Users\bjkim\AppData\Local\hermes\hermes-agent\venv\Scripts\python.exe -m ensurepip
C:\Users\bjkim\AppData\Local\hermes\hermes-agent\venv\Scripts\python.exe -m pip install "python-telegram-bot[ext]"
hermes gateway restart성공 로그:
INFO gateway.platforms.telegram: [Telegram] Connected to Telegram (polling mode)
INFO gateway.run: Gateway running with 1 platform(s)6. LM Studio — "속이기" + 속도 튜닝
kyung님 1주차 글 + 튜닝법 합성으로 같이:
레이어
설정
Hermes config.yaml
context_length: 65536 유지
LM Studio 실제 로드
Context Length 4096
GPU Offload
슬라이더 최대 (38 → max)
Offload KV Cache to GPU Memory
ON
Hermes는 64K인 줄 알고 동작하고, LM Studio는 4K로 빠르게 처리하는 "속이기" 구조입니다.
속도 Before / After (LM Studio 로그 기준)
Before
After
생성 속도
~17 t/s
~74 t/s
총 처리 시간
~17초
~9초
prompt eval
—
~1452 tokens/s
체감으로도 확실히 빨라졌습니다.
이게 어느정도냐면 예전 GPT-4o 속도입니다......
토큰 생성 속도 비교
모델
속도
내 로컬 (지금)
74 t/s
Claude Sonnet
80~100 t/s
GPT-4o
60~80 t/s
Claude Haiku
150~200 t/s
GPT-4o mini
100~150 t/s
다만 품질이 떨어지지요.....ㅜㅜ
Gemma 4 E4B ≈ 과거 클라우드 모델
시기
모델
비교
2023년 초
GPT-3.5 터보 초기버전
비슷한 수준
2023년
Claude 2 초기
약간 낮음
2022년
GPT-3 davinci
비슷하거나 약간 위
그래도 3.5나왔을때도 신세계였습니다.....
재부팅 후 설정 유지
LM Studio: 설정 변경 후 「변경 사항을 적용하려면 다시 불러오세요」 클릭 → 프리셋 저장
Hermes 자동 시작
LM Studio: Start server on launch 옵션
7. 빠른 대답 !!
텔레그램에서 Hermes 봇에 안녕을 보내면:
Gateway가 메시지 수신
LM Studio Gemma 4 E4B가 응답 생성
텔레그램으로 스트리밍 답변
연결 성공 기준: gateway.log에 [Telegram] Connected + 텔레그램에서 실제 답변 수신.
8. 마무리 !!
Windows에서는 Linux 가이드를 그대로 쓰지 말 것 —
notepad,py -m pip,hermes gateway run이 정답에 가깝다.Qwen thinking 모델은
content가 비어 올 수 있다 —/no_think또는 Gemma처럼 thinking 없는 모델 검토.gpters kyung님 1주차 글의 원리가 Hermes 속도의 핵심 — memory off, toolsets
[], compression off, contexttruncate, LM Studio Context 4096.GPU Offload + KV Cache GPU — RTX 3070 8GB에서 Gemma E4B 기준 17 t/s → 74 t/s 체감 개선.
품질 vs 속도 — 생성 속도는 GPT-4o급(60~80 t/s)에 가깝지만, 답변 품질은 2023년 초 GPT-3.5 터보 수준 정도로 보면 된다. 무료·로컬·프라이버시가 trade-off.
📋 재사용 프롬프트
Hermes 텔레그램 연결 안 될 때
Windows에서 Hermes + LM Studio + Gemma 4 쓰는 중이야.
hermes gateway.log에 아래 메시지가 나와. 원인과 순서대로 해결법 알려줘. [로그 붙여넣기]
gpters 1주차처럼 config 최적화
Hermes config.yaml이야. gpters 「아무튼 로컬모델 1주차」 글처럼 memory 끄기, toolsets 비우기, compression 끄기, context truncate 설정 어디를 어떻게 바꿔야 하는지 알려줘. [config.yaml 일부 붙여넣기]
LM Studio 속도 튜닝
RTX 3070 8GB, Gemma 4 E4B, Hermes context_length 65536 유지한 채 LM Studio에서 Context Length 4096 + GPU Offload max + KV Cache GPU 설정 순서와 주의점 알려줘.