코딩 잘하는 AI 순위 실측: 1위는 클로드, 챗지피티(GPT)는 11위예요

코딩 잘하는 AI 순위를 열어봤다가 좀 놀랐어요. 상위 10위 안에 GPT가 한 개도 없더라고요. 1위는 클로드(Claude) 계열이고, 중국 모델이 다섯 자리를 차지하고 있었어요.

사람들이 직접 투표해서 매긴 아레나(Arena)의 웹 개발 부문 순위인데, 9월 2일 기준 640,806표에 모델 124개가 올라와 있어요.

순위를 그대로 보여드리고, 이게 뭘 뜻하는지도 알려드릴게요!

아레나 웹 개발 부문 상위 11위. 1위는 claude-fable-5.1-max, 챗지피티는 11위에 처음 나온다

이런 순위는 봐도 "그래서 나는 뭘 써야 하나"가 남죠. 지피터스는 그걸 각자 써보고 나누는 곳이에요. 24기 AI 스터디 둘러보기 ->

코딩 AI 순위 상위 10위

점수는 대결 투표로 매겨진 값이라 높을수록 이긴 횟수가 많다는 뜻이에요.

저는 지피터스에서 마케팅을 맡고 있는 강지인이에요. 클로드 코드(Claude Code)와 코덱스로 매일 일하며 모델을 자주 갈아끼우는데, 그래서 이 순위를 볼 때 조심할 점도 같이 적었어요.

  • 1위 claude-fable-5.1-max (앤트로픽 페이블 5.1): 1765점
  • 2위 qwen3.8-max-0902 (알리바바): 1688점
  • 3위 claude-opus-5-max (앤트로픽): 1687점
  • 4위 kimi-k3-max (문샷): 1674점
  • 5위 qwen3.8-max (알리바바): 1669점
  • 6위 claude-opus-5-high (앤트로픽): 1661점
  • 7위 grok-4.6-high (스페이스엑스AI): 1629점
  • 8위 claude-fable-5 (앤트로픽): 1628점
  • 9위 hy4-preview (텐센트): 1626점
  • 10위 qwen3.8-flash-next (알리바바): 1622점

1위와 2위 사이가 77점 벌어져 있고, 2위부터 10위까지는 66점 안에 다 들어가요. 1위만 떨어져 있는 모양새죠.

그런데 이 표는 그대로 믿으면 안 돼요. 2·5·7·9·10위에 Preliminary 배지가 붙어 있어요. 표본이 모자라 잠정이라는 뜻이고, 상위 10위의 절반이 여기 해당해요.

투표 수를 보면 더 분명해져요.

  • 1위 claude-fable-5.1-max: 1,106표
  • 3위 claude-opus-5-max: 10,583표
  • 6위 claude-opus-5-high: 10,530표
  • 11위 gpt-5.6-sol-xhigh: 10,813표

1위가 표를 제일 적게 받았어요. 3위나 11위의 10분의 1이고요. Rank Spread 열은 순위가 흔들릴 범위인데, 2위는 2에서 5, 7위는 7에서 13이라 13위까지 밀릴 수 있어요. 그러니 "1위가 압도적"보다 표가 더 쌓여봐야 안다 쪽이 맞아요.

GPT는 11위가 최고예요

상위 30위 안에 GPT는 딱 하나, 11위 gpt-5.6-sol-xhigh(1616점)뿐이에요. 1위와 149점 차이고요. 제미나이(Gemini)도 15위 gemini-3.7-flash-high(1587점)가 최고고, 19·27위에 하나씩 더 있어요.

챗지피티를 매일 쓰시는 분껜 의외일 수 있어요. 다만 "GPT가 코딩을 못한다"는 뜻이 아니에요. 웹 개발 한 분야에서 사람이 둘을 놓고 고른 결과라, 글쓰기나 데이터 분석은 순서가 다를 수 있어요.

진짜 눈에 띄는 건 중국 모델이에요

상위 10위를 회사별로 세어보면 이래요.

  • 앤트로픽(Anthropic) 4개: 1위, 3위, 6위, 8위
  • 중국 5개: 알리바바 3개(2위, 5위, 10위), 문샷 1개(4위), 텐센트 1개(9위)
  • 스페이스엑스AI 1개: 7위
  • 오픈AI 0개

절반이 중국 모델이에요. 알리바바 qwen3.8 계열은 맥스, 27B, 플래시까지 골고루 올라와 있고, 12·13위 glm-5.3(Z.ai)까지 세면 더 늘어나요.

작년만 해도 순위표는 미국 회사들 차지였죠. 한 해 만에 그림이 바뀐 셈이에요.

값도 같이 보시면 재미있어요. 100만 토큰 기준 1위 페이블 5.1 맥스는 입력 10달러에 출력 50달러, 2위 큐원은 2달러에 6달러예요. 점수는 77점 차인데 값은 다섯에서 여덟 배 차이고요. 10위 큐원 플래시는 0.16달러까지 내려가요.

11위에서 30위, 여기가 더 재미있어요

20위대를 보면 앤트로픽 구형 모델이 줄줄이 있어요.

  • 20위 claude-opus-4-8-high: 1563점
  • 21·22위 claude-opus-4-7 계열: 각 1557점
  • 24위 claude-opus-4-6-high: 1546점
  • 26·29위 claude-opus-4-8과 4-6: 1540점, 1536점

한 회사 모델이 상위권과 20위대에 동시에 깔려 있어요. 세대교체로 옛 모델이 밀려난 자리인데, 1위 1765점과 29위 1536점 차이가 229점이에요.

여기서 실용적인 게 나와요. 소넷(Sonnet) 5가 28위(1537점)예요. 많이들 기본으로 쓰는데 웹 개발에선 이 자리고, 3위 오퍼스 5 맥스와 150점 차이예요. 코딩이 안 풀릴 때 프롬프트를 고치기 전에 모델부터 올려보는 게 빠를 수 있어요.

중간 순위엔 처음 보는 이름도 많아요. 17·18위 딥시크 v4, 25·30위 메타 뮤즈 스파크, 12·13위 Z.ai의 glm-5.3 계열이요.

이 코딩 AI 순위를 어떻게 읽으면 좋을까요

숫자를 그대로 믿기보다 이렇게 보세요.

사람 투표라는 걸 기억하세요. 정답이 있는 시험이 아니라 두 결과물을 놓고 사람이 고른 거예요. 그래서 보기 좋은 쪽이 유리합니다. 겉은 멀쩡한데 안이 엉망인 코드가 이길 수도 있어요.

웹 개발 부문이라는 것도요. 백엔드나 데이터 처리가 주업이면 이 표만 보고 정하시면 안 돼요.

같은 모델도 설정에 따라 갈려요. claude-opus-5-max가 3위, claude-opus-5-high가 6위예요. 추론 강도만 다른데 26점 차이고요.

그리고 순위는 계속 뒤집혀요. 1위 페이블 5.1도 나온 지 며칠 안 됐어요. 이 글도 9월 3일 기준으로 봐주세요.

정리하면

  • 1위는 claude-fable-5.1-max 1765점. 다만 1,106표뿐이라 흔들릴 수 있어요
  • 상위 10위에 GPT는 없어요. 30위 안에서도 11위 하나뿐이고, 제미나이는 15위가 최고예요
  • 상위 10위의 절반이 중국 모델이고, 그중 다섯은 Preliminary(잠정)예요
  • 값 차이도 큽니다. 1위는 출력 100만 토큰에 50달러, 2위는 6달러예요

같이 보면 좋은 글

저라면 이 표를 "뭘 써야 한다"가 아니라 아직 안 써본 게 뭔지 찾는 데 쓸 것 같아요. 하나씩 붙여보며 내 일에 맞는 걸 찾는 게, 남의 순위표를 따르는 것보다 나아요.

이 중에 써보신 모델 있으면 지피터스에 후기 남겨주세요. 순위표에 안 나오는 게 거기서 나오거든요!


확인일: 2026년 9월 3일

출처

1