GPT-5.6, 벤치마크 1위인데 실전 코딩은 Fable이 낫다는 후기가 나온 이유

Photo by Milad Fakurian on Unsplash

GPT-5.6이 7월 10일 일반 공개되면서 벤치마크 순위표를 새로 썼습니다. Agents' Last Exam에서 Sol이 53.6점으로 신기록을 세웠고, Claude Fable 5를 13점 넘게 앞섰습니다. 숫자만 보면 "이제 Fable 시대는 끝났나" 싶습니다. 그런데 모델을 직접 써본 개발자들의 후기는 조금 다릅니다. "벤치마크는 1위지만, 복잡한 코딩에서는 여전히 Fable이 낫다"는 반응이 나옵니다. 벤치마크와 실사용 사이의 이 간극을 가격표까지 얹어서 정리했습니다.

비교 요약

GPT-5.6은 벤치마크 성능에서 Fable 5를 앞서지만, 실사용 코딩 경험에서는 우열이 갈립니다. 대신 하위 티어인 Luna와 Terra가 Fable 5를 훨씬 낮은 비용으로 대체할 수 있다는 점이 실질적인 승부처입니다. 결론부터 말하면, 최상위 성능 하나만 보고 Sol을 고르기보다 작업 성격과 비용을 함께 따지는 편이 유리합니다.

Sol, Terra, Luna 세 티어의 스펙과 가격을 표 하나로 먼저 정리한 내용이 필요하시면 GPT-5.6 총정리 글을 참고하시면 됩니다. 이 글은 그 뒤를 이어, "그래서 어떤 티어를 실제로 써야 하는가"에 초점을 맞춥니다.

벤치마크에서는 GPT-5.6이 앞선다

먼저 공개된 수치를 그대로 보겠습니다. GPT-5.6은 단일 모델이 아니라 성격이 다른 세 티어로 나뉩니다. 플래그십 Sol, 균형형 Terra, 경량형 Luna입니다.

벤치마크GPT-5.6 Sol비교Agents' Last Exam (55개 직무 장기 워크플로우)53.6 (신기록)Fable 5 대비 +13.1점SWE-Bench Pro (실전 코드 수정)약 64.6%—Terminal-Bench 2.188.8% (Ultra 모드 91.9%)—

Agents' Last Exam은 55개 전문 분야의 장기 실무 워크플로우를 평가하는 시험입니다. 여러 단계를 거치는 작업을 얼마나 끝까지 끌고 가는지를 봅니다. 여기서 Sol이 세운 53.6점은 이전 최고 기록을 크게 넘어섰고, adaptive reasoning을 켠 Fable 5보다 13.1점 높았습니다.

숫자만 놓고 보면 명확한 우위입니다. 특히 장기 에이전트 작업, 즉 여러 도구를 번갈아 호출하며 오래 돌아가는 워크플로우에서 Sol의 강점이 두드러집니다.

실사용 후기에서는 이야기가 달라진다

문제는 벤치마크 점수가 실제 작업 만족도로 곧장 이어지지 않는다는 점입니다. AI 도구를 오래 추적해 온 개발자 Simon Willison은 Sol을 직접 써본 뒤 이렇게 적었습니다.

"분명히 매우 유능하다. 하지만 지금까지 복잡한 코딩 작업에서 Fable보다 낫다고 느껴지지는 않았다."

벤치마크 1위 모델을 두고 나온 반응치고는 미지근합니다. 여기서 갈리는 지점이 있습니다. 장기 에이전트 워크플로우에서는 Sol이 앞서지만, 사람이 직접 붙어서 하는 복잡한 코딩 세션에서는 체감 차이가 뚜렷하지 않았다는 겁니다.

여기에 더 근본적인 지적도 있습니다. Willison은 코딩 벤치마크 수치 자체를 조심해서 봐야 한다고 짚습니다. OpenAI조차 SWE-Bench Pro의 측정 방식을 비판한 적이 있어서, 공개된 코딩 우위 수치가 실제보다 부풀려졌을 여지가 있다는 것입니다. 벤치마크 점수가 높다고 해서 "내 코드베이스에서도 그만큼 낫다"고 단정하기 어렵다는 뜻입니다.

Photo by Ibrahim Rifath on Unsplash

진짜 승부처는 가성비다

성능 논쟁보다 실무에서 더 크게 갈리는 건 비용입니다. GPT-5.6 세 티어의 가격은 다음과 같습니다(100만 토큰 기준).

티어입력출력성격Sol$5$30플래그십, 장기 에이전트 강세Terra$2.50$15균형형Luna$1$6최저가·최속

Willison이 실사용 관점에서 진짜 주목한 건 Sol이 아니라 Luna와 Terra였습니다. 그의 평가에 따르면 이 두 하위 모델이 Claude Fable 5를 "약 16분의 1 비용"으로 능가합니다. 최상위 성능은 아니어도, 상당수 실무 작업에서 충분한 품질을 훨씬 싼값에 낸다는 겁니다.

이 대목이 실전 판단의 핵심입니다. 대부분의 반복 작업, 분류, 요약, 초안 생성은 플래그십 모델까지 필요하지 않습니다. 그런 작업에 Sol을 쓰는 건 비용 낭비에 가깝습니다. Luna나 Terra로 내려도 결과물 품질이 크게 떨어지지 않는다면, 같은 예산으로 처리량을 몇 배 늘릴 수 있습니다.

한 가지 함정도 짚어야 합니다. 토큰 단가만으로 모델을 비교하면 오해가 생깁니다. 모델마다 같은 작업을 처리할 때 소비하는 추론 토큰(reasoning token)의 양이 다르기 때문입니다. 표에 적힌 단가가 싸도, 답을 내기까지 토큰을 많이 태우는 모델이라면 실제 청구액은 더 나올 수 있습니다. 가격은 반드시 "작업 한 건당 총비용"으로 환산해서 비교해야 합니다.

GPT-5.6 Sol의 강점

  • 장기 에이전트 워크플로우에서 벤치마크 최상위 성능
  • max, ultra 두 가지 신규 추론 모드로 난이도 높은 작업 대응
  • Programmatic Tool Calling, Multi-agent 같은 신규 API 기능
  • 100만 토큰대 컨텍스트에서 attention drift를 줄이는 long-context 최적화

Claude Fable 5가 여전히 나은 지점

  • 사람이 직접 붙어서 하는 복잡한 코딩 세션의 체감 품질
  • 벤치마크 수치에 가려지지 않는 실사용 안정감
  • 이미 Fable 기반 워크플로우를 구축한 경우의 전환 비용 절감

이런 분에게 추천

  • GPT-5.6 Sol: 여러 도구를 오래 돌리는 장기 에이전트 자동화, 벤치마크로 성능을 입증해야 하는 환경
  • GPT-5.6 Luna / Terra: 반복 작업 대량 처리, 비용을 최우선으로 두는 실무. Fable 5를 저비용으로 대체하고 싶은 경우
  • Claude Fable 5: 사람이 붙는 복잡한 코딩 세션, 이미 Fable 워크플로우가 안정적으로 돌아가는 경우

인사이트

이번 GPT-5.6 후기에서 읽어야 할 진짜 신호는 "1위가 바뀌었다"가 아닙니다. 벤치마크 1위 모델과 실사용 만족도가 어긋나기 시작했다는 점입니다. 모델 성능이 상향 평준화되면서, 이제는 "가장 강한 모델"보다 "이 작업에 딱 맞는 모델"을 고르는 안목이 비용을 가릅니다.

한국 실무 환경에서는 이 흐름이 특히 중요합니다. API 비용은 환율까지 얹혀 체감이 큰데, 습관적으로 최상위 모델을 기본값으로 두는 경우가 많습니다. Luna와 Terra가 Fable을 16분의 1 비용으로 대체할 수 있다는 후기는, 지금 쓰는 워크플로우의 어느 단계에서 굳이 플래그십이 필요 없는지 다시 점검해 보라는 신호로 읽힙니다. 요약, 분류, 초안처럼 "정답이 하나로 좁혀지는 작업"부터 하위 티어로 내려보고 품질을 실측하면, 같은 예산으로 처리량을 몇 배 늘릴 여지가 생깁니다.

벤치마크는 출발점이지 결론이 아닙니다. 점수표 대신 내 작업 한 건당 총비용과 결과물 품질을 직접 재보는 것, 그게 모델이 매달 바뀌는 시대에 흔들리지 않는 판단 기준입니다.

자주 묻는 질문

GPT-5.6은 Fable 5보다 무조건 나은가요?

벤치마크 점수에서는 GPT-5.6 Sol이 Fable 5를 앞섭니다. 하지만 복잡한 코딩 작업의 실사용 후기에서는 Fable 5가 여전히 낫다는 평가가 있습니다. 작업 성격에 따라 우열이 갈리므로 무조건 낫다고 보기는 어렵습니다.

GPT-5.6 티어 중 가성비가 가장 좋은 건 무엇인가요?

Luna와 Terra입니다. Luna는 100만 토큰당 입력 $1, 출력 $6으로 가장 저렴하고, 개발자 후기 기준 Fable 5를 약 16분의 1 비용으로 대체할 수 있다는 평가가 있습니다. 다만 토큰 단가만이 아니라 작업 한 건당 총비용으로 비교해야 정확합니다.

GPT-5.6은 언제 어디서 쓸 수 있나요?

6월 26일 정부 협의를 거친 약 20개 기관 대상 제한 프리뷰로 먼저 공개된 뒤, 7월 10일 ChatGPT, Codex, API에서 일반 공개됐습니다. 세 티어(Sol, Terra, Luna) 모두 이용할 수 있습니다.


원문: Simon Willison, "The new GPT-5.6 family: Luna, Terra, Sol" · 벤치마크 참고: Vellum, Artificial Analysis