3줄 요약

  • Sonnet 5.5는 토큰 단가가 Opus 5.5의 절반이지만 Artificial Analysis가 지금까지 재본 것 중 토큰을 가장 많이 써서, Max에서는 작업당 7.60달러로 Opus 5.98달러보다 비쌈
  • 점수를 맞춰 보면 Opus가 이길 수 있는데, Opus 5.5 Xhigh는 Sonnet Max와 같은 56점을 3.46달러에 내고 Artificial Analysis는 Sonnet의 High(47점, 1.08달러)를 가장 경쟁력 있는 설정으로 봄
  • 그래도 나는 Sonnet을 High로 시작하고 내 작업에서 통과 작업 하나당 비용을 재볼 것임

Sonnet 5와 같은 2달러·10달러, Opus 5.5의 절반

  • Anthropic은 9월 28일 Claude Sonnet 5.5를 내놓았고 Claude 5.5 패밀리의 두 번째 모델이라고 소개함 (Anthropic)
  • Haiku 5.5는 아직 "앞으로 몇 주 안에" 나온다고만 되어 있음
  • 토큰 단가는 그대로라서 절약이 있다면 작업당 토큰이 줄어서 생긴 것임
100만 토큰당 가격 Sonnet 5.5 Opus 5.5
입력 $2 $4
출력 $10 $20
캐시 읽기 $0.20 $0.20
캐시 쓰기 $2.50 $5

출처: Anthropic, Cost and speed 표, 2026년 9월 29일 확인

  • Anthropic은 자체 테스트에서 작업당 비용이 Sonnet 5보다 최대 30% 적다고 함
  • Artificial Analysis는 Max 기준 작업당 7.60달러가 Sonnet 5보다 약 50% 높다고 함 (Artificial Analysis)
  • 두 쪽은 측정 조건이 달라서 같은 조건으로 맞춘 비교는 못 찾았음
  • Anthropic 페이지에 인용된 고객 결과는 Box의 전체 토큰 12% 감소부터 Balyasny의 답변당 12.1만 토큰 대 49.7만 토큰(비공개 금융 작업 세트)까지 폭이 큼
  • 배치 처리는 50%, 캐싱은 최대 90% 절약이고 미국 내 전용 추론은 1.1배 가격임 (Anthropic)
  • 컨텍스트 1M 토큰, 최대 출력 128K는 출시 전 유출본이 Sonnet 5에서 그대로 옮겨 적었던 숫자와 같음 (모델 개요, 출시 전에 쓴 글)

토큰 단가는 절반인데 토큰은 60% 더 씀

  • Artificial Analysis 지능 지수에서 Max의 Sonnet 5.5는 56점, Max의 Opus 5.5는 58점임
  • Sonnet 5.5는 지수 작업 하나당 출력 토큰을 약 19.3만 개 썼고, 지금까지 잰 것 중 가장 많으며 Max의 Opus 5.5보다 약 60%, Max의 GPT-6 Astra보다 약 7배 많음
  • 토큰 단가가 절반인 모델이 작업당 7.60달러로 Opus의 5.98달러보다 비싸진 이유가 이것임
  • 단가 할인은 늘어난 토큰값에 대부분 상쇄됨
effort Sonnet 5.5 점수 / 작업당 비용 Opus 5.5 점수 / 작업당 비용
Low 36 / $0.41 42 / $0.55
Medium 41 / $0.59 51 / $1.34
High 47 / $1.08 54 / $1.82
Xhigh 52 / $2.74 56 / $3.46
Max 56 / $7.60 58 / $5.98

출처: Artificial Analysis 지능 지수 v4.3.2, 기본 폴백 켜짐, Sonnet 5.5·Opus 5.5 릴리스 페이지, 2026년 9월 29일 확인. 비용은 지수 평가 10개 전체의 가중 평균이며 코딩만의 값이 아님

  • 같은 effort 이름끼리 비교하면 Max만 빼고 전부 Sonnet이 쌈
  • 점수를 맞춰 보면 Opus Medium(51점, 1.34달러)이 Sonnet Xhigh(52점, 2.74달러)와 비슷하고, Opus Xhigh는 Sonnet Max와 같은 56점인데 3.46달러 대 7.60달러임
  • 이 두 비교는 공개된 숫자로 내가 계산한 것이고, Opus 비용은 각각 Sonnet의 약 49%, 46%임
  • Artificial Analysis는 Sonnet 5.5가 점수 대비 비용 최적선 밖에 있고, High가 가장 경쟁력 있는 설정이며 같은 작업당 비용에서 GPT-6 Sol에 근소하게 뒤진다고 함
  • 다만 구조화 출력 버그가 있었다고 Anthropic이 밝힌 출시 전 빌드로 잰 것이고, 평가를 다시 돌릴 예정이라고 함

문서에서 확인되는 건 retry가 아니라 토큰임

  • 내 불만은 점수가 무한 retry로 끌어올려진 것 같다는 것이고, Artificial Analysis 벤치에서 Sonnet의 작업당 비용이 토큰 단가는 절반인데도 Opus보다 높게 나오기 때문임
  • 무한 retry를 적은 자료는 못 찾았고, Anthropic은 Max effort 5회 시행 평균이고 Artificial Analysis 코딩 에이전트 벤치는 작업당 3회 시도의 pass@1 평균임
  • 자료에 실제로 남아 있는 건 토큰 사용량이고, retry 없이도 같은 청구서가 나옴
  • Anthropic의 대표 표는 작업당 비용이 가장 큰 Max effort 기준임
벤치마크 (Sonnet 5.5는 Max) Sonnet 5.5 Sonnet 5 Opus 5.5
Terminal-Bench 4.0 70.6% 10.3% 66.4% (Xhigh)
FrontierCode 1.1 Main 46.2% 42.4% 54.4%
CursorBench 4.0 55.5% 34.1% 57.8%
GDPval-AA v2.1, Elo 1844 1449 1846

출처: Anthropic, 시스템 카드. CursorBench는 Cursor, GDPval-AA는 Artificial Analysis, FrontierCode는 Cognition이 실행했고 Sonnet 5·Opus 5.5 설정은 Anthropic 표기 그대로임

  • Artificial Analysis가 직접 돌린 Terminal-Bench 4.0에서는 Max의 Sonnet 5.5가 64%, Opus 5.5가 60%이고 같은 모델에 Anthropic이 낸 70.6%보다 낮음
  • Anthropic의 Terminal-Bench 4.0에서 Opus 5.5를 4.2점 앞선 결과는 표준오차가 Sonnet 약 ±2.5점, Opus 약 ±2.6점이라 단정하기 어려움
  • Sonnet 5의 10.3%는 Anthropic이 제시한 숫자이고, 시스템 카드 Terminal-Bench 항목에는 Sonnet 5가 아예 없음
  • Artificial Analysis 코딩 에이전트 지수의 Sonnet 5.5 수치는 못 읽어서 위 비용표는 코딩만이 아니라 지수 전체 기준임

Max가 Xhigh한테 졌고, High는 Max보다 7.7점 낮음

왼쪽은 Sonnet 5.5와 Opus 5.5의 effort별 Artificial Analysis 점수 대 작업당 비용, 오른쪽은 Sonnet 5.5의 CursorBench 4.0이 Medium 39.2%에서 Max 55.5%로 오르는 막대

출처: Artificial Analysis 릴리스 페이지, Anthropic 시스템 카드 8.8절(CursorBench는 Cursor 실행). 차트는 HSL 제작

  • FrontierCode에서 Sonnet 5.5는 Xhigh 52.1%, Max 46.2%로 Max가 더 낮음
  • Anthropic 각주에 따르면 Max에서 Claude Code의 코드 리뷰 스킬이 더 자주 돌아 리뷰가 여러 서브에이전트로 쪼개졌고, Cognition이 살펴본 두 건에서 타임아웃이나 작업 범위 밖 수정이 나왔음
  • 리뷰어를 너무 많이 불러서 한 단계 아래 설정에 진 것임
  • CursorBench 4.0은 Medium 39.2%, High 47.8%, Xhigh 53.1%, Max 55.5%여서 High는 Max보다 7.7점 낮음
  • 그래도 Sonnet 5의 최고 기록 34.1%는 크게 넘음

High를 쓰는 이유는 벤치가 아니라 체감임

  • 추론을 High 정도로 잡으니 가성비가 좋았음
  • 써보니 개인적으로 만족스러움
  • 어디까지나 써본 인상이고 측정한 결과는 아님
  • Artificial Analysis 숫자도 이와 어긋나지 않는데 High를 Sonnet의 가장 경쟁력 있는 설정으로 꼽았기 때문임
  • 다만 Opus Medium은 지수 작업당 0.26달러만 더 내면 4점 높음(51점 대 47점)
  • Anthropic 문서도 API에서는 High를 기본값으로 두고, 명세가 분명한 에이전트 코딩은 Medium을 권하며 Claude Code와 Claude 앱의 기본값도 Medium임 (마이그레이션 가이드)
  • Anthropic은 Sonnet 5.5를 범위가 분명한 일상 작업, 버그 수정, 문서 작성용으로, Opus 5.5를 판단이 필요한 복잡한 작업용으로 구분함

갈아탈 때 걸리는 설정들

  • 마이그레이션 가이드는 Sonnet 5.5에서 400 오류가 나는 설정 다섯 가지를 적어 둠: thinking 예산, 샘플링 파라미터, 어시스턴트 프리필, 도구 강제 선택, thinking: {"type": "disabled"}
  • 사전 thinking을 끄려면 between_tools를 쓰는데 Low·Medium·High에서만 되고 Xhigh·Max에서는 400 오류가 남
  • 위험도가 높은 사이버보안 작업은 눈에 보이게 Sonnet 5로 넘어가고, Anthropic의 Terminal-Bench 실행에서는 요청의 1.2%가 대체 모델 답변이었음
  • 보존된 thinking이 만든 계정에 묶여서 Claude Code에서 세션 중간에 계정을 바꾸면 영향이 있음
  • effort 단계가 다시 보정돼서 같은 단계라도 Sonnet 5와 같은 양을 생각한다는 보장은 없음

내 작업으로 직접 재보기

effort 내가 시작할 곳 근거
Medium 명세가 분명한 에이전트 코딩, 지연에 민감한 채팅 Claude Code·앱 기본값
High 어렵거나 긴 작업, 일반 API 사용 Claude API 기본값, Artificial Analysis가 꼽은 Sonnet의 최적 설정
Xhigh, Max 추가 통과분이 토큰값을 할 때만 Max는 지수 작업당 7.60달러였고 FrontierCode에서 Xhigh에 짐
  • 정답을 이미 아는 실제 작업 20개를 고름
  • Sonnet은 Medium과 High로, 비교용으로 Opus는 Medium으로 돌림
  • 통과한 결과 수와 실행마다 쓴 출력 토큰을 기록함
  • 모델별 토큰 단가로 계산한 비용을 통과 작업 수로 나눔
  • 그 값이 가장 낮은 모델과 설정을 고르고, 리더보드가 Max라고 해도 따라가지 않음

커뮤니티 반응

  • r/ClaudeCode에선 Max의 작업당 비용이 Opus보다 높다는 지적과 Medium·High도 보고 판단해야 한다는 반론이 함께 나옴 (Reddit)
  • r/ClaudeAI의 한 사용자는 개인 코딩 작업 10개를 High에서 각 3회 돌려 두 모델 모두 Claude Code에서 30/30을 통과했고 시도당 API 비용은 Sonnet 약 $0.15, Opus 약 $0.36이었다고 보고했지만 시험이 이미 포화됐다고 밝힘 (Reddit)
  • r/ClaudeAI의 다른 글쓴이는 직접 테스트하지 않았다고 밝히면서 과한 코드 리뷰 서브에이전트 때문에 FrontierCode에서 Max가 Xhigh에 졌다는 Anthropic 각주를 짚음 (Reddit)

Q&A 또 궁금한 것은?

  • Q. Sonnet 5.5가 Opus 5.5보다 작업당 쌈?
    • 같은 effort 이름끼리는 대체로 싸지만 Artificial Analysis는 Max에서 7.60달러 대 5.98달러로 재었고 Opus Xhigh가 3.46달러로 Sonnet Max와 같은 점수를 냄
    • 차이는 Max에서 Sonnet이 출력 토큰을 약 60% 더 쓴 데서 옴
  • Q. 벤치마크 점수가 retry로 부풀려진 거 맞음?
    • 그렇다고 적은 자료는 못 찾았고, Anthropic은 5회 시행 평균, Artificial Analysis 코딩 에이전트 벤치는 3회 시도의 pass@1 평균임
    • Cursor와 Cognition의 실행 방식까지는 못 봤으니 Anthropic과 Artificial Analysis가 공개한 범위만 확인한 것임
  • Q. Sonnet 5.5가 Opus 5.5를 대체함?
    • Anthropic은 복잡하고 열린 작업은 Opus 5.5가 분명히 더 강하다고 함
    • Max 기준으로 GDPval-AA는 1844점 대 1846점으로 거의 같지만 FrontierCode는 46.2% 대 54.4%로 뒤짐
  • Q. Claude Code에서는 어떤 effort가 좋음?
    • Anthropic 안내는 명세가 분명하면 Medium, 어렵거나 긴 작업은 High이고 기본값은 Medium임
  • Q. 쓰던 Sonnet 5 코드가 그대로 돌아감?
    • thinking: {"type": "disabled"}나 기본값이 아닌 샘플링 값을 보내면 둘 다 400 오류가 나서 안 됨