처음에는 단순히 “로컬봇이 좀 느린가?” 정도로 생각했습니다.
문자 메시지 그룹의 스크린샷
로컬 모델을 연결했다는 사실만으로도 기뻤습니다.
그런데 너무 느립니다.
hi하고 대답을 들으려면 42분이 걸렸습니다.
문제가 있다는 생각이 들어 살펴보기로 했습니다.
우선 간단하게 제 모델을 소개합니다.
1. 사용한 모델과 환경
모델 크기: qwen/qwen3-4b-2507
실행 환경: LM Studio
목표: 로컬에서 가볍게 대화형 봇 운 영
문제 상황: 짧은 요청에도 지연시간이 지나치게 큼
제가 능력치뿜뿜이라면 로그를 봤겠지만
로그는 봐도 무슨말인지 모르겠어서... ^, ^
먼저 확인한 것은 이런 것들 입니다.
2. 처음 확인한 것들
2-1. Processing Prompt
모델 로딩을 보여주는 화면의 스크린샷
지연시간동안 prompt processing이라는 시간을 거칩니다.(0%가 100%가 되어야 대답을 들을 수 있음 ㅎㅎ.)
2-2. context_length
prompt processing이 100% 되면 그 이후는 대답을 곧 잘합니다. 하지만, 어느순간 또 대답을 안합니다.(Still working...)
이때 발견한 것은 lmstudio에서 4096으로 돌아가 있다라는 것입니다.(이건 제가 모델 로드 당시 context_length: 64000로 늘려 놓았던 것입니다.)
콘텐츠 및 오프로드 설정의 스크린샷
다시 context_length: 64000로 늘리고 다시 서버를 올립니다. 그리고 prompt processing가 100%가 되길 기다려야 합니다.
ㅎ
ㅎㅎㅎㅎㅎㅎ
ram 16GB 노트북에도 로컬LLM을 돌린다고 하는데,,, 64GB로 나름 어깨를 세운 제 PC에게 너무 가혹하다는 생각이 들어 포기가 안됐습니다 ㅠㅠㅠㅠㅠㅡㅡㅡㅜ 때문에 시작하였습니다.
3. 해줘~.
GPT5.5봇에게 물어봣습니다.