LM Studio Gemma 4 구동기 최적 셋팅값 찾기 — 반응속도 비교 고찰

📝 한줄 요약

Hermes와 Gemma 4 연결은 성공했지만, 유튜브·블로그의 고사양 PC 설정을 그대로 따라 하니 너무 느려서 못 쓰겠다는 편견이 있었습니다. LM Studio 설정을 하나씩 조정하고 작업 관리자로 메모리를 확인한 결과, 메모리 75% 이하를 유지할 때 가장 빠른 반응 속도를 얻을 수 있었습니다. 목적은 로컬llm 어디까지 돌려볼수 있나였습니다. 모든 값이 맥스라면 당연 추론성능까지 최고치겟지만 각자의 pc의 한계가 있기때문입니다. 적절함을 찾아보자!! 입니다.

바쁘시면 이것만 읽어도 돼요:

  • PC 사양마다 LM Studio 최적값이 다르다 — 남의 설정을 그대로 복붙하면 안 된다

  • 비교한 항목: CPU 스레드, Context Length, GPU Offload, CPU Thread Pool, 작업 관리자 메모리

  • GPU Offload를 너무 높이면 연결은 되다가도 응답 중 끊기거나 느려진다

  • 윈도우 순정 상태에서 메모리 75~80%를 넘으면 체감 속도가 눈에 띄게 떨어진다

  • 메모리 75% 이하를 목표로 맞추면 가장 안정적이고 빠른 응답이 나온다

  • 설정은 한 번에 여러 개 바꾸지 말고, 하나씩 바꿔가며 비교할 것


🎯 이런 분들께 도움돼요

  • LM Studio + Hermes 연결은 됐는데, Gemma 4가 너무 느려서 실사용이 어려운 분

  • 고사양 PC가 아니어도 로컬 AI를 써보고 싶은 분

  • 유튜브·블로그 설정을 따라 했는데 "로컬 AI는 원래 이렇게 느린가?" 하고 포기하려는 분


😫 문제 상황 (Before)

앞선 글에서 LM Studio + Hermes + Gemma 4 연결 문제는 해결했다. .env 설정을 맞추고 나니 드디어 대화가 시작됐다. 그런데 속도가 문제였습니다.

인터넷이나 유튜브에서 "LM Studio 최적 설정"을 검색하면, 대부분 사양 좋은 PC 기준으로 설명되어 있었기 때문에... 저의 컴하곤 맞지 않았습니다. 아래는 저의 머신 사양입니다.

VMware 대시보드의 스크린샷

설정값 세팅을 위해 처음에는 gemma e4b모델로 시작하였습니다.

GPU Offload를 높게, Context Length를 길게 — 고사양 환경에서는 고민이 적겟지만 저사양은 어렵습니다 최적을 찾아야합니다.

문제는 연결이 아니라, 내 PC 사양에 맞지 않는 설정값. PC마다 RAM, GPU, CPU가 다르기 때문에, 남의 최적값이 내 최적값이 될 수 없기에 찾아야 하는 것!!!!.


🛠️ 사용한 도구

  • 로컬 AI 런타임: LM Studio

  • AI 모델: Google Gemma 4 E4B, 26B A4B

  • AI 에이전트: Hermes AI Agent

  • 모니터링: Windows 작업 관리자 (메모리 사용률 확인)

  • 운영체제: Windows 11 (윈도우 설정은 건드리지 않은 순정 상태)


🔧 작업 과정

출발점 — "연결은 됐는데, 왜 이렇게 느리지?"

Hermes 연결 후 첫 대화를 시도했을 때, 응답이 오기까지 시간이 길었습니다.

  1. 첫번째 셋팅

모델 매개변수의 한국어 버전 스크린샷
한국어로 된 문자 메시지의 스크린샷
한국어가 지원되는 Windows 10 컴퓨터의 스크린샷

메모리 사용량은 44%로 여유가 있었으나 설정의 문제인지 값을 조정하기로 했습니다. 34.98초는 작은모델인데도 너무한거 아니오!!!!


비교한 설정 항목

LM Studio 설정은 한곳에 모여 있지 않고, 여러 메뉴에 흩어져 있었습니다. 이번에 비교·조정한 항목은 아래와 같습니다.

설정 위치

항목

비교 목적

Model Parameters

CPU 스레드

CPU 처리 속도와 안정성

Developer → Context and Offload

Context Length (컨텍스트 길이)

대화 기억 범위 vs 메모리 사용량

Developer → Context and Offload

GPU Offload

GPU·RAM 분담 비율

Developer → Advanced

CPU Thread Pool size

내부 스레드 처리 효율

Windows 작업 관리자

메모리 사용률

실제 리소스 여유 확인

  1. 두번째 셋팅

모델 매개변수의 한국어 버전 스크린샷
한국어로 된 문자 메시지의 스크린샷

엄청나게 빨라졌습니다. 근데 여러 값(cpu,gpu,풀사이즈)을 동시에 바꿨더니, 뭐가 효과인지 구분이 안 되는.... 그래서 한 번에 하나씩 바꾸고, 같은 질문을 Hermes에 보내 반응 속도를 비교하는 방식으로 전환했습니다.

  1. 세번째 셋팅

모델 매개변수의 한국어 버전 스크린샷
한국어로 된 문자 메시지의 스크린샷

이번에는 CPU항목만건드렸습니다. 추론속도에서 살짝 빨라지는 효과가 있었습니다.

결론적으로 메모리가 여유가 있을 경우에 GPU 오프로딩이 높을스록 속도의 체감이 커지는 것으로 보입니다.

이렇게 1차적으로 e4b는 가용메모리 내에서 최적으로 되는걸확인한후

26B로 넘어갔습니다. 26B에서는 gpu 오프로딩 맥스치가 아래와 같은데

Adobe Acrobat 설정 스크린샷

  1. 26B 1차 셋팅

한국어 버전의 Windows 10 스크린샷

컴퓨터 터지기 직전입니다.... 너무 오래걸려서 중지시켰습니다.

  1. 2차셋팅

이번에는 CPU설정을 줄여보기로 했습니다.

모델 매개변수의 한국어 버전 스크린샷

와 장족의 발전입니다. 이젠 나오기라도 합니다... 생각추론이 4분대이긴 하지만.... 갈길이 멉니다..

  1. 3차 셋팅 GPU를 줄여보자

    모델 매개변수의 한국어 버전 스크린샷

드디어 유의미한 기록이 나왔습니다. GPU를 확 줄여서 레이어를 없애니 속도가 확 증가하였습니다. 8까지 내린이유는 그냥 단순히 제 vram이 8이라서... 내렸습니다. 여기서 하나를 알게 되었습니다..

GPU Offload — "높을수록 좋은 게 아니다!!"

가장 먼저 체감이 컸던 건 GPU Offload였습니다.

처음에는 높은 값(예: 30 컴퓨터 gpu vram마다 다른걸로 알고 있습니다)으로 설정했는데, GPU Offload를 높이면 빠를 줄 알았는데 오히려 연결이 끊기거나 응답이 더 불안정해져서 Gemma 4는 멀티모달 모델이라 메모리를 많이 먹는 건가? 라는 생각이 들었습니다.

GPU Offload를 점진적으로 낮추니, 연결 안정성이 개선된겁니다. 자신의 컴퓨터 사양에 따라서 고성능 다다익VRAM GPU가 아니라면GPU에 무리하게 올리면 오히려 역효과가 날 수 있다는 사실입니다. 물온 gpu를 올리면 그만큼 llm의 성능이 좋은퍼포먼스가 나오겟지만 각자 pc에서 돌아갈수 있는 한계가 있기때문입니다.

핵심 깨달음 : GPU Offload는 "높을수록 좋다"가 아니라, 내 GPU·RAM 여유에 맞는 적정값을 찾는 것.

  1. 4차셋팅 cpu들 셋팅 값을 올려보자


한국어 문자 메시지 스크린샷

추론에 있어서 미미한 속도 이득이 있긴했습니다. 1단계만 올렸을뿐인데..

  1. 5차셋팅 CPU 스레드만 올려보자

파라미터의 cpu 스레드값을 올리니 유의미하게 빨라졌습니다.

그래서 이번엔 추론시 쓰는 스래드 풀사이즈를 늘려봤습니다.

  1. 6차셋팅 스레드 풀사이즈 증가

모델 매개변수의 한국어 버전 스크린샷

cpu스레드를 7로 설정한것은 나름대로 제 cpu가 8코어+4코어다보니 p코어가 8개인데 7개는 여기쓰고 1개는 윈도우에 쓴다?? 이런느낌으로 설정했습니다. 근데 신기하게도 이렇게 맞췄을때

한국어 텍스트가 있는 창의 스크린샷

메모리가 윈도우 느려지기 직전으로 맞춰진 느낌이었습니다.

  1. 7차세팅 cpu최적같은데 여기서 gpu오프로드를 올린다면???

한국어가 지원되는 컴퓨터 스크린샷

역시 이상황에서 80%가까히 찍으니 다시 느려집니다.


CPU 스레드 & Thread Pool — 숨은 변수

Model Parameters의 CPU 스레드Developer → Advanced의 CPU Thread Pool size도 함께 비교를 해봤습니다.

GPU Offload만 조정할 때와, CPU 관련 값까지 맞췄을 때 체감 속도 차이가 있었고 GPU만 신경 쓰고 CPU 쪽을 기본값으로 두면, 전체 처리 흐름이 균형을 잃을 수 있었습니다.

다만 이 값들도 PC마다 다르기 때문에, "이 숫자가 정답"이라고 단정하기보다 내 CPU 코어 수와 RAM 여유에 맞게 하나씩 조정하는 방식이 맞는거 같습니다.


결정적 발견 — "메모리 75%가 기준선이었다"

윈도우 설정은 건드리지 않은 순정 상태에서, 작업 관리자의 메모리 사용률을 기준으로 저는 보았습니다.

모리 사용률

체감

75% 이하

가장 빠르고 안정적인 반응 속도

75~80%

눈에 띄게 느려지기 시작

80% 이상

응답 지연, 불안정해짐

GPU Offload, Context Length, CPU 스레드, Thread Pool — 이 값들을 조정하는 진짜 목적은 결국 메모리 여유를 확보하는 것으로 생각됩니다. LM Studio 설정값 자체보다, 작업 관리자에서 메모리 75% 이하를 유지할 수 있는 조합을 찾는 게 핵심인거 같습니다. 단!! 레지스트리나 오버클럭을 했다면 얘기가 달라질거 같습니다.


시행착오 — "남의 설정 ≠ 내 설정"

가장 답답했던 순간은, 검색해서 나온 설정을 적용했을 때 "분명히 잘 돌아간다"고 한 PC와 내 PC의 차이를 체감할 때입니다. 이 문제때문에 많은 사람들이 로컬LLM을 포기하지 않을까 생각듭니다.

  • 내 PC: 블로그, 커뮤니티 그 설정을 그대로 쓰면 메모리 과부하 → 느려짐 → "로컬 AI 못 쓰겠다"는 편견

하지만 한 번에 여러 값을 바꾸지 않고, 하나씩 조정 + 작업 관리자 확인으로 전환한 뒤부터는 방향이 잡혔습니다. 저도 고성능 gpu를 써서 gpu 최대로 땡겨서 최고 퍼포먼스로 쓰고싶습니다..ㅠ.ㅠ


✅ 결과 (After)

Before vs After

항목

Before

After

설정 방식

유튜브·블로그 설정 그대로 복붙

내 PC 기준으로 하나씩 비교·조정

체감 속도

너무 느려서 실사용 어려움

메모리 75% 이하 유지 시 안정적·빠른 응답

연결 안정성

GPU Offload 과다 시 끊김 발생

적정 Offload + 메모리 여유로 안정화

마인드셋

"로컬 AI는 고사양 PC만 가능"

"내 사양에 맞는 조합을 찾으면 충분히 쓸 만하다"

산출물

없음

다른 사람도 참고할 수 있는 튜닝 기준 확보

결과물

  • 내 PC 사양에 맞는 LM Studio + Gemma 4 설정 조합 확립

  • Hermes 연결 후 일상적으로 쓸 만한 반응 속도 확보

  • 메모리 75% 이하라는 실용적인 기준선 정리

  • 다음 단계인 Hermes 최적화 사용 후기 작성 준비 완료


💬 이 과정에서 배운 AI·로컬 AI 활용 팁

효과적이었던 것

  1. 작업 관리자를 열어두고 셋팅하기 — LM Studio 설정값보다 실제 메모리 사용률이 더 정확한 기준

  2. 설정은 하나씩만 바꾸기 — GPU Offload, Context Length, CPU 스레드, Thread Pool을 동시에 바꾸면 원인 파악 불가

  3. 메모리 75% 이하를 목표로 잡기 — 75~80%를 넘으면 체감 속도가 떨어지기 시작

  4. 연결 문제와 속도 문제를 분리하기 — Hermes .env 설정(연결)과 LM Studio 튜닝(속도)은 다른 단계

이렇게 하면 안 돼요

  1. 유튜브·블로그 설정을 그대로 복붙하지 말 것 — 대부분 고사양 PC 기준이라 내 PC에 맞지 않을 수 있음. 하지만 중급기 그래픽카드로도 돌릴수 있다고 생각함!!!!!

  2. GPU Offload를 무조건 높게 잡지 말 것 — Gemma 4처럼 메모리를 많이 쓰는 모델은 과도한 Offload가 역효과. VRAM이 높다면 12g이상 올리면 좋아지겟지만 4g 8g는 터짐.

  3. "느리면 로컬 AI가 안 되는 거다"고 포기하지 말 것 — 설정 조합 문제일 가능성이 큼

  4. 윈도우까지 건드리지 말고 LM Studio 설정부터 조정할 것 — 순정 윈도우 상태에서도 충분히 튜닝 가능


🌍 다른 상황에 적용한다면?

이번에 찾은 「메모리 75% 이하 = 반응 속도 최적」 기준은 Gemma 4 E4B + Hermes 조합에만 해당하지 않습니다. 우리도!!! 26b할수 있습니다.

  • 다른 로컬 모델(Llama, Qwen 등)을 LM Studio에서 돌릴 때도 동일

  • 다른 AI 에이전트(Open WebUI, Continue 등)를 연결할 때도 메모리 여유가 속도의 핵심

  • 디스틸(경량) 버전 vs 본체 모델 비교할 때도, 작업 관리자 메모리를 기준으로 판단 가능

PC 사양이 다르면 GPU Offload나 Context Length의 구체적 숫자는 달라진다. 하지만 「메모리 여유를 확보하라」는 원칙은 공통입니다.


🚀 앞으로의 계획

LM Studio에서 적절한 설정값을 찾았으니, 다음 단계는 Hermes에서의 최적화 사용 후기를 작성하는 것입니다.

  • Hermes 에이전트 기능을 실제 업무·일상에 어떻게 활용하는지

  • LM Studio 튜닝 후 Hermes 사용 시 체감 차이

  • (이후) E4B 디스틸 버전, 26b Gemma 모델, Hermes + Obsidian 로컬 활용 사례글


📋 재사용 가능한 프롬프트

프롬프트 1: LM Studio 속도 튜닝 시작

LM Studio에서 [모델명]을 Hermes와 연결해서 쓰고 있는데 응답이 너무 느려. 내 PC 사양: [RAM 용량], [GPU 모델], [CPU 코어 수] GPU Offload, Context Length, CPU 스레드, Thread Pool 중 어떤 순서로 하나씩 조정하면 좋을지 알려줘. 작업 관리자 메모리 사용률 기준으로 설명해줘.

프롬프트 2: 설정값 비교 기록 요청

LM Studio 설정을 바꿔가며 테스트 중이야. [설정 항목]: [이전 값] → [변경 값] 작업 관리자 메모리: [XX]% Hermes 응답 속도 체감: [빠름/보통/느림] 이 결과를 해석하고 다음에 바꿔볼 설정을 추천해줘.

프롬프트 3: 고사양 PC 설정이 안 맞을 때

유튜브에서 본 LM Studio 최적 설정을 따라 했는데 내 PC에서는 너무 느리거나 연결이 끊겨. 고사양 PC 기준 설정과 일반 PC에서 조정해야 할 포인트를 GPU Offload, Context Length, 메모리 기준으로 비교해서 알려줘.

2
2개의 답글
밀어주고 끌어주는

온·오프라인 AI 스터디

AI로 어디까지 할 수 있는지
직접 확인하실 분만 신청하세요.