코딩 잘하는 AI 순위를 열어봤다가 좀 놀랐어요. 상위 10위 안에 GPT가 한 개도 없더라고요. 1 위는 클로드(Claude) 계열이고, 중국 모델이 다섯 자리를 차지하고 있었어요.
사람들이 직접 투표해서 매긴 아레나(Arena)의 웹 개발 부문 순위인데, 9월 2일 기준 640,806표에 모델 124개가 올라와 있어요.
순위를 그대로 보여드리고, 이게 뭘 뜻하는지도 알려드릴게요!
아레나 웹 개발 부문 상위 11위. 1위는 claude-fable-5.1-max, 챗지피티는 11위에 처음 나온다
이런 순위는 봐도 "그래서 나는 뭘 써야 하나"가 남죠. 지피터스는 그걸 각자 써보고 나누는 곳이에요. 24기 AI 스터디 둘러보기 ->
코딩 AI 순위 상위 10위
점수는 대결 투표로 매겨진 값이라 높을수록 이긴 횟수가 많다는 뜻이에요.
저는 지피터스에서 마케팅을 맡고 있는 강지인이에요. 클로드 코드(Claude Code)와 코덱스로 매일 일하며 모델을 자주 갈아끼우는데, 그래서 이 순위를 볼 때 조심할 점도 같이 적었어요.
- 1위 claude-fable-5.1-max (앤트로픽 페이블 5.1): 1765점
- 2위 qwen3.8-max-0902 (알리바바): 1688점
- 3위 claude-opus-5-max (앤트로픽): 1687점
- 4위 kimi-k3-max (문샷): 1674점
- 5위 qwen3.8-max (알리바바): 1669점
- 6위 claude-opus-5-high (앤트로픽): 1661점
- 7위 grok-4.6-high (스페이스엑스AI): 1629점
- 8위 claude-fable-5 (앤트로픽): 1628점
- 9위 hy4-preview (텐센트): 1626점
- 10위 qwen3.8-flash-next (알리바바): 1622점
1위와 2위 사이가 77점 벌어져 있고, 2위부터 10위까지는 66점 안에 다 들어가요. 1위만 떨어져 있는 모양새죠.
그런데 이 표는 그대로 믿으면 안 돼요. 2·5·7·9·10위에 Preliminary 배지가 붙어 있어요. 표본이 모자라 잠정이라는 뜻이고, 상위 10위의 절반이 여기 해당해요.
투표 수를 보면 더 분명해져요.
- 1위 claude-fable-5.1-max: 1,106표
- 3위 claude-opus-5-max: 10,583표
- 6위 claude-opus-5-high: 10,530표
- 11위 gpt-5.6-sol-xhigh: 10,813표
1위가 표를 제일 적게 받았어요. 3위나 11위의 10분의 1이고요. Rank Spread 열은 순위가 흔들릴 범위인데, 2위는 2에서 5, 7위는 7에서 13이라 13위까지 밀릴 수 있어요. 그러니 "1위가 압도적"보다 표가 더 쌓여봐야 안다 쪽이 맞아요.
GPT는 11위가 최고예요
상위 30위 안에 GPT는 딱 하나, 11위 gpt-5.6-sol-xhigh(1616점)뿐이에요. 1위와 149점 차이고요. 제미나이(Gemini)도 15위 gemini-3.7-flash-high(1587점)가 최고고, 19·27위에 하나씩 더 있어요.
챗지피티를 매일 쓰시는 분껜 의외일 수 있어요. 다만 "GPT가 코딩을 못한다"는 뜻이 아니에요. 웹 개발 한 분야에서 사람이 둘을 놓고 고른 결과라, 글쓰기나 데이터 분석은 순서가 다를 수 있어요.
진짜 눈에 띄는 건 중국 모델이 에요
상위 10위를 회사별로 세어보면 이래요.
- 앤트로픽(Anthropic) 4개: 1위, 3위, 6위, 8위
- 중국 5개: 알리바바 3개(2위, 5위, 10위), 문샷 1개(4위), 텐센트 1개(9위)
- 스페이스엑스AI 1개: 7위
- 오픈AI 0개
절반이 중국 모델이에요. 알리바바 qwen3.8 계열은 맥스, 27B, 플래시까지 골고루 올라와 있고, 12·13위 glm-5.3(Z.ai)까지 세면 더 늘어나요.
작년만 해도 순위표는 미국 회사들 차지였죠. 한 해 만에 그림이 바뀐 셈이에요.
값도 같이 보시면 재미있어요. 100만 토큰 기준 1위 페이블 5.1 맥스는 입력 10달러에 출력 50달러, 2위 큐원은 2달러에 6달러예요. 점수는 77점 차인데 값은 다섯에서 여덟 배 차이고요. 10위 큐원 플래시는 0.16달러까지 내려가요.
11위에서 30위, 여기가 더 재미있어요
20위대를 보면 앤트로픽 구형 모델이 줄줄이 있어요.
- 20위 claude-opus-4-8-high: 1563점
- 21·22위 claude-opus-4-7 계열: 각 1557점
- 24위 claude-opus-4-6-high: 1546점
- 26·29위 claude-opus-4-8과 4-6: 1540점, 1536점
한 회사 모델이 상위권과 20위대에 동시에 깔려 있어요. 세대교체로 옛 모델이 밀려난 자리인데, 1위 1765점과 29위 1536점 차이가 229점이에요.
여기서 실용적인 게 나와요. 소넷(Sonnet) 5가 28위(1537점)예요. 많이들 기본으로 쓰는데 웹 개발에선 이 자리고, 3위 오퍼스 5 맥스와 150점 차이예요. 코딩이 안 풀릴 때 프롬프트를 고치기 전에 모델부터 올려보는 게 빠를 수 있어요.
중간 순위엔 처음 보는 이름도 많아요. 17·18위 딥시크 v4, 25·30위 메타 뮤즈 스파크, 12·13위 Z.ai의 glm-5.3 계열이요.
이 코딩 AI 순위를 어떻게 읽으면 좋을까요
숫자를 그대로 믿기보다 이렇게 보세요.
사람 투표라는 걸 기억하세요. 정답이 있는 시험이 아니라 두 결과물을 놓고 사람이 고른 거예요. 그래서 보기 좋은 쪽이 유리합니다. 겉은 멀쩡한데 안이 엉망인 코드가 이길 수도 있어요.
웹 개발 부문이라는 것도요. 백엔드나 데이터 처리가 주업이면 이 표만 보고 정하시면 안 돼요.
같은 모델도 설정에 따라 갈려요. claude-opus-5-max가 3위, claude-opus-5-high가 6위예요. 추론 강도만 다른데 26점 차이고요.
그리고 순위는 계속 뒤집혀요. 1위 페이블 5.1도 나온 지 며칠 안 됐어요. 이 글도 9월 3일 기준으로 봐주세요.
정리하면
- 1위는 claude-fable-5.1-max 1765점. 다만 1,106표뿐이라 흔들릴 수 있어요
- 상위 10위에 GPT는 없어요. 30위 안에서도 11위 하나뿐이고, 제미나이는 15위가 최고예요
- 상위 10위의 절반이 중국 모델이고, 그중 다섯은
Preliminary(잠정)예요 - 값 차이도 큽니다. 1위는 출력 100만 토큰에 50달러, 2위는 6달러예요
같이 보면 좋은 글
- 페이블 5.1 총정리: 1위 한 모델이 뭐가 달라졌는지
- 클로드 Opus 5 vs Fable 5 완벽 비교: 1위와 3위를 나란히 놓고 본 글
- jcode 정리: 점수만으로 도구를 못 고르는 이유
저라면 이 표를 "뭘 써야 한다"가 아니라 아직 안 써본 게 뭔지 찾는 데 쓸 것 같아요. 하나씩 붙여보며 내 일에 맞는 걸 찾는 게, 남의 순위표를 따르는 것보다 나아요.
이 중에 써보신 모델 있으면 지피터스에 후기 남겨주세요. 순위표에 안 나오는 게 거기서 나오거든요!
확인일: 2026년 9월 3일
출처
- Arena 웹 개발 부문 리더보드 (2026년 9월 2일 기준, 640,806표, 모델 124개)