한국어 프롬프트, 영어보다 토큰이 정말 2~3배 들까? 27개 언어로 재보고 알게 된 API 비용 아끼는 법

"한국어로 프롬프트를 쓰면 영어보다 토큰이 2~3배 든다"는 얘기를 자주 들었는데, 직접 재본 적은 없었습니다. API 비용과 바로 연결되는 문제라서 같은 프롬프트를 27개 언어로 옮겨 OpenAI 토크나이저로 토큰 수를 세봤습니다.

결론부터 말하면 지금 기준으로 한국어는 영어의 1.44배입니다. "2~3배"는 GPT-4 시절 토크나이저 기준의 숫자였습니다.

진행 방법

  • 영어로 34토큰인 평범한 고객 응대 프롬프트를 준비했습니다.

  • 27개 언어로 번역한 뒤 js-tiktoken으로 두 가지 토크나이저에서 셌습니다.

  • o200k_base: GPT-4o 이후 현재 OpenAI 모델

  • cl100k_base: GPT-4 / GPT-3.5 시절 (비교용)

import tiktoken
enc = tiktoken.get_encoding("o200k_base")
print(len(enc.encode("한국어 프롬프트")))

결과

언어

현재 (o200k)

예전 GPT-4 (cl100k)

영어

1.00배

1.00배

중국어(간체)

1.03배

1.53배

한국어

1.44배

2.50배

일본어

1.79배

2.21배

체코어

2.00배

2.59배

  • 한국어는 2.50배 → 1.44배로 크게 줄었습니다. 같은 프롬프트면 예전보다 토큰이 40% 넘게 적습니다.

  • 예전엔 일본어가 한국어보다 쌌는데, 지금은 일본어(1.79배)가 더 비쌉니다.

  • 가장 비싼 언어는 아시아 언어가 아니라 체코어(2.00배)였습니다.

입력 100만 토큰당 $2인 모델에 이 프롬프트를 100만 번 보내면 영어 $68, 한국어 $98입니다. 답변도 한국어로 받으면 단가가 더 비싼 출력 토큰에도 같은 배수가 붙습니다.

배운 점: API 비용 아끼는 팁

  1. 시스템 프롬프트·고정 지시문은 영어로. 매 요청마다 반복되는 부분이라 효과가 가장 큽니다. 사용자 입력만 한국어로 둡니다.

  2. 중간 단계는 영어나 JSON으로. 분류·추출·도구 호출은 영어로 처리하고, 사용자에게 보여줄 최종 답변만 한국어로 받습니다.

  3. 과한 존댓말 줄이기. "~해 주시면 감사하겠습니다"보다 "~해 주세요"가 토큰이 적고 지시 효과는 같습니다.

  4. 공백·빈 줄 정리. 문서에서 복사한 텍스트엔 불필요한 공백이 많습니다.

  5. 프롬프트 캐시 활용. 고정된 앞부분을 캐시하면 입력 단가가 크게 떨어집니다.

한계

  • 프롬프트 하나로 잰 결과라 문장에 따라 0.1~0.2배 정도 차이가 날 수 있습니다.

  • Claude, Gemini는 토크나이저가 달라 이 숫자가 그대로 맞지는 않습니다.

참고

여러분이 쓰는 실제 프롬프트에서는 한국어가 영어의 몇 배쯤 나오는지 궁금합니다.