Anthropic이 2026년 6월 30일 Claude Sonnet 5를 공개했습니다. 핵심 메시지는 하나입니다. "Opus 4.8의 성능에 근접하는데, 가격은 절반이다." 그동안 에이전트 작업에서 가장 앞서던 건 Opus 계열이었고, Sonnet 계열은 한 체급 아래로 여겨졌습니다. Sonnet 5는 이 격차를 좁히면서, 모델 선택의 계산법 자체를 바꾸고 있습니다.
이 글에서는 Sonnet 5와 Opus 4.8을 벤치마크·가격·effort 레벨 세 축으로 비교하고, "내 작업에는 뭘 써야 하나"에 대한 실전 선택 기준을 정리합니다.

비교 요약
Sonnet 5는 대부분의 에이전트 벤치마크에서 Opus 4.8과 몇 포인트 차이 안으로 붙었고, 지식 노동 벤치마크에서는 오히려 근소하게 앞섰습니다. 반면 깊은 코딩·올림피아드 수학·컴퓨터 조작 같은 최고 난이도 영역에서는 Opus 4.8이 여전히 우위입니다. 가격은 Sonnet 5가 절반 수준이라, "충분히 좋으면서 훨씬 싼" 선택지가 새로 생겼다고 보면 됩니다.
벤치마크 비교
아래는 Anthropic이 공개한 주요 평가 점수입니다. Sonnet 4.6은 직전 세대 Sonnet으로, 세대 간 개선폭을 함께 보기 위해 넣었습니다.
정리하면 세 가지 패턴이 보입니다.
첫째, 지식 노동에서는 Sonnet 5가 Opus 4.8을 살짝 앞섰습니다(1,618 vs 1,615). 문서 작성, 리서치, 분석 같은 일반 업무에서는 더 이상 Opus를 고를 이유가 약해졌다는 뜻입니다.
둘째, 에이전트·컴퓨터 조작은 근접했지만 아직 Opus가 앞섭니다(OSWorld 81.2 vs 83.4). 브라우저·터미널을 오래 돌리는 자동화에서는 Opus가 조금 더 안정적입니다.
셋째, 깊은 코딩과 수학은 격차가 큽니다(SWE-bench Pro 63.2 vs 69.2, USAMO 79.5 vs 96.7). 복잡한 리팩터링이나 어려운 문제 풀이에서는 Opus 4.8이 확실히 우위입니다.
가격 비교 — 여기서 판이 갈립니다
이 비교의 핵심은 성능이 아니라 가격입니다.
Sonnet 5의 소개 가격은 8월 31일까지 입력 $2 / 출력 $10이고, 이후 정가는 입력 $3 / 출력 $15로 오릅니다. Opus 4.8은 입력 $5 / 출력 $25입니다. 즉 정가 기준으로도 출력 토큰이 Opus의 60% 수준, 소개 가격 기준으로는 40% 수준입니다.
한 가지 주의할 점이 있습니다. Sonnet 5는 새 토크나이저(tokenizer)를 씁니다. 같은 텍스트라도 콘텐츠 종류에 따라 토큰이 약 1.0~1.35배 더 잡힐 수 있습니다. Anthropic은 소개 가격을 이 차이를 감안해 "대체로 비용 중립"이 되도록 책정했다고 밝혔습니다. 그래도 실제 청구서를 볼 때는 토큰 수 증가분을 함께 계산하는 게 안전합니다.

Photo by Getty Images on Unsplash
effort 레벨 — Sonnet 5가 더 넓은 선택지를 제공합니다
두 모델을 단순히 "Sonnet은 싸고 약함, Opus는 비싸고 강함"으로 나누면 실제 사용 판단을 놓칩니다. 핵심 변수는 effort 레벨입니다.
Anthropic이 공개한 비용-성능 곡선을 보면, Sonnet 5는 Sonnet 4.6을 전 구간에서 완전히 앞서고(strict improvement), Opus 4.8보다 훨씬 넓은 비용-성능 조합을 제공합니다.
- 중간(medium) effort: 비용 효율이 크게 개선됩니다. 같은 값을 쓰면서 더 나은 결과를 얻거나, 같은 결과를 더 싸게 얻습니다.
- 높은(high/xhigh) effort: 일부 작업에서는 Opus 4.8 수준까지 성능이 올라갑니다. 다만 이 구간에서는 토큰을 많이 써서, Opus와 비슷한 품질을 내려다 오히려 비용이 더 들 수도 있습니다.
즉 Sonnet 5와 Opus 4.8 사이에서 effort 레벨을 조절하면, 작업마다 비용과 성능의 균형점을 직접 맞출 수 있습니다. 이 "다이얼"이 Sonnet 5의 진짜 무기입니다.
Sonnet 5의 강점
- 가성비: 지식 노동·중간 난이도 에이전트 작업에서 Opus에 근접하는 성능을, 절반 가격에 제공합니다.
- 넓은 비용-성능 범위: effort 레벨로 medium~xhigh를 오가며 상황별로 최적점을 고를 수 있습니다.
- 안전성 개선: Sonnet 4.6 대비 악의적 요청 거부·프롬프트 인젝션 저항이 좋아졌고, 환각(hallucination)과 아부성 응답(sycophancy) 비율도 낮아졌습니다.
- 기본 모델 채택: Free·Pro 플랜의 기본 모델로 들어가, 별도 설정 없이 바로 쓰게 됩니다.
Opus 4.8의 강점
- 최고 난이도 코딩: SWE-bench Pro 69.2%로, 복잡한 리팩터링·대규모 코드베이스 작업에서 앞섭니다.
- 어려운 추론·수학: USAMO 96.7%처럼 난이도 높은 문제 풀이에서 격차가 큽니다.
- 장시간 에이전트 안정성: 컴퓨터 조작·오래 도는 자동화에서 조금 더 신뢰도가 높습니다.
- 정렬·사이버 안전: 오정렬 행동 비율이 가장 낮은 축이고, 보안 작업에 필요한 완화된 가드레일도 Opus 쪽을 권장합니다.
이런 분에게 추천
- Sonnet 5: 문서·리서치·분석 같은 지식 노동, 중간 난이도 코딩, 에이전트를 대량으로 돌려 비용이 곧 규모의 문제인 팀. "충분히 좋으면 된다"가 기준인 대부분의 실무.
- Opus 4.8: 복잡한 코드 리팩터링, 어려운 수학·추론, 장시간 자율 에이전트, 사이버 보안 작업. 마지막 몇 %의 정확도가 비용보다 중요한 작업.
인사이트
이번 발표에서 진짜 중요한 건 "Sonnet 5가 Opus를 이겼다/졌다"가 아니라, 모델 선택이 이분법에서 다이얼로 바뀌었다는 점입니다. 예전에는 "Sonnet이냐 Opus냐"를 먼저 정하고 시작했다면, 이제는 "Sonnet 5를 어느 effort 레벨로 돌릴까"가 먼저 오고, 그걸로 안 되는 작업만 Opus로 올리는 순서가 자연스러워집니다. 기본값을 싼 쪽에 두고, 필요할 때만 비싼 쪽으로 승격하는 구조입니다.
한국의 팀 단위 운영 관점에서 보면 이 변화는 곧 비용 구조의 재설계로 이어집니다. 코인베이스가 AI 지출을 통제가 아니라 "기본값·라우팅"으로 절반 줄였던 것과 같은 맥락입니다. 에이전트를 많이 돌리는 조직일수록, "일단 전부 Opus"에서 "기본은 Sonnet 5 medium, 어려운 작업만 라우팅으로 Opus"로 바꾸는 것만으로 지출이 크게 달라질 수 있습니다. 모델 하나를 고르는 문제가 아니라, 작업 난이도에 따라 모델과 effort를 자동으로 배분하는 라우팅 설계의 문제로 넘어간 셈입니다.
한 가지 덧붙이면, 토크나이저 변경으로 같은 텍스트의 토큰 수가 늘 수 있다는 점은 실제 비용 비교에서 놓치기 쉬운 함정입니다. "출력 단가가 60%니까 40% 절감"이라는 단순 계산 대신, 자기 팀의 실제 프롬프트로 토큰 수를 재보고 판단하는 걸 권합니다.