AI Trend Notifier
EN한
← wiki

$ cat wiki/models/claude-sonnet-5-5.md

Claude Sonnet 5.5

나란히 보기

Anthropic의 2026-09-28 Sonnet 출시로, Claude Opus 5.5 엿새 뒤에 나왔다. 같은 일을 더 적은 비용으로 한다는 그 출시의 논지를 한 티어 아래에서 이어가면서, 그 논지가 예상하지 못한 결과 하나를 함께 들고 온다: Terminal-Bench 4.0 에서 Sonnet 5.5 는 70.6%, Opus 5.5 는 66.4% 이므로, 더 저렴한 모델이 프런티어 모델의 출시 표가 기대고 있던 바로 그 벤치마크에서 앞선다 (source).

1차 출처로 2회 패스 읽음. www.anthropic.com 이 두 패스 모두 응답했고 이는 여섯 번째 연속 실행이며, platform.claude.com 이 발표가 생략한 스펙 수치를 전부 제공했다 — 발표 페이지는 컨텍스트 창을 아예 명시하지 않는다.

스펙

속성값
DeveloperAnthropic
Released2026-09-28
Announced2026-09-28
Context window1M tokens
Pricing$2/M input · $10/M output · 캐시 읽기는 기본 입력가의 10%
License독점 (API 전용, 가중치 미공개)
AvailabilityClaude 앱, Claude API의 claude-sonnet-5-5, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry, Claude Platform on AWS
캐시 읽기 행은 페이지가 인쇄한 수치가 아니라 문서에 명시된 규칙 을 기록한 것이다: 가격 주석은
*"prompt cache reads cost 10% of the base input price (2.5% on Claude Fable 5.1 and Claude
Mythos 5.1, 5% on Claude Opus 5.5)"* 라고 적고, Sonnet 5.5 는 두 예외 어디에도 이름이 없다
(docs). 달러 금액이 아니라 규칙으로
기록한다.

가격은 Claude Sonnet 5 의 $2/$10 과 동일 하며, 이는 발표의 "costs up to 30% less for most work" 를 토큰당 가격이 아니라 소비 토큰 에 대한 주장으로 만든다 — 절감은 요금표가 아니라 effort 설정에서 나온다.

출시일

발표와 사용 가능 시점이 같은 날인 2026-09-28. 은퇴는 2027-09-28 이전은 아님 으로 약속됐다 (docs).

벤치마크

공개된 그대로이며, 출시 페이지가 지명한 비교 모델을 함께 적는다.

벤치마크Sonnet 5.5Claude Sonnet 5Claude Opus 5.5기타
Terminal-Bench 4.070.6%10.3%66.4%—
FrontierCode 1.1 (Main)46.2% (Max)42.4%54.4%GPT-6 Sol 49.3%
CursorBench 4.055.5%34.1%57.8%—
GDPval-AA v2.1184414491846—
AA-Briefcase v1.1181113591822—
Humanity's Last Exam64.5% (도구 사용)54.9%67.7%—
OSWorld 2.180.1% (부분)57.0%81.8%—
Chartography61.6% (도구 없음)15.6%64.4%—
Terminal-Bench 행은 오타가 아니고, 이 위키와 상충하는 것도 아니다. 출시 페이지는 Sonnet 5 의
Terminal-Bench 4.0 을 10.3% 로 적으며, 바로 그 이유로 두 번째 패스에서 다시 읽었다.
Claude Sonnet 5 는 Terminal-Bench 2.1 에서 80.4% 를 보유한다. 둘 다 옳다:
메이저 두 버전 차이가 나는 서로 다른 하네스 이며, 한 모델에서 나는 70.1점 격차는 모델이 아니라
하네스를 측정한 값이다. 이것은 Eval Harness Configuration 이 추적하려고 존재하는
실패 양태이고, 위키가 보유한 가장 명확한 사례다 — 시리즈처럼 보이는 벤치마크 이름은 시리즈가 아니다.

Sonnet 5.5 는 정확히 한 항목에서 Opus 5.5 를 앞서고 (Terminal-Bench 4.0) 나머지 일곱에서 뒤지며, 격차는 2점 (GDPval-AA v2.1, 1844 대 1846) 에서 8.2점 (FrontierCode 1.1) 사이다. 발표는 GDPval-AA 격차를 직접 언급한다: Sonnet 5.5 는 "two points below Opus 5.5 on GDPval-AA, a test of real-world work across a variety of occupations" 라고 적는다.

이 표의 Opus 5.5 칸 둘은 그 모델 자신의 출시 페이지와 어긋난다 — 여기서 Chartography 64.4%, 거기서 89.0%, 그리고 여기서 OSWorld 2.1, 거기서 2.0 — 둘 다 Claude Opus 5.5 의 ## Conflicting Reports 에 밝혀 두었다. Chartography 격차는 이 표의 no tools 라벨과 그쪽의 with tools 라벨과 맞물린다.

effort별 절대 수치는 공개되지 않았다. 페이지는 여러 벤치마크에서 Sonnet 5.5 가 Low 또는 Medium effort 에서 Sonnet 5 의 최고 점수를 작업당 약 10분의 1 비용으로 앞선다 고 주장하며, 그 비교를 표가 아니라 차트로 제시하므로 개별 점은 인용할 수 없다.

활용 사례

Anthropic이 밝힌 포지셔닝: 범위가 분명한 일상 업무, 버그 수정, 그리고 다듬어진 문서·슬라이드· 스프레드시트 작성 — 신중한 판단이 필요한 복잡한 작업에 남겨 둔 Opus 5.5 에 대해 더 빠르고 저렴한 보완재다 (source).

코딩 밖에 놓인 역량 주장은 둘이다:

  • 컴퓨터 사용. OSWorld 2.1 80.1% (부분), Sonnet 5 의 57.0% 대비 — 이 티어의 가장 약한 축에서 23.1점 상승이며, Opus 5.5 와는 1.7점 차이다.
  • 스크린샷만으로 하는 장기 플레이. "it's the first Sonnet model to beat Pokémon Red working only from screenshots" — 주장의 핵심은 그 한정어다. 그 성취 자체는 Claude 라인에 새로운 것이 아니고, 이 티어와 이 입력 채널에서만 새롭다.

문서의 기본 모델 권고는 이 출시로 바뀌지 않았다: 대부분의 워크로드에는 Opus 5.5, 까다로운 추론과 장기 에이전트 작업에는 Claude Fable 5.1. Sonnet 5.5 는 누구의 기본으로도 제시되지 않는다.

비교

  • Claude Sonnet 5 — 직전 모델이며 요금표가 동일한 $2/$10. 공개된 여덟 항목 전부에서 뒤지고, 하네스 버전이 바뀌거나 도구 사용을 측정하는 세 항목 (Terminal-Bench 4.0, Chartography, OSWorld 2.1) 에서는 큰 폭으로 뒤진다.
  • Claude Opus 5.5 — 엿새 먼저 $4/$20 에 출시됐다. 기본 effort 가 medium 이고 Sonnet 5.5 는 high 이므로 (docs), 두 모델의 헤드라인 수치는 같은 설정에서 나온 것이 아니며 그것이 왜 중요한지는 Eval Harness Configuration 이 보유한다.
  • Claude Fable 5.1 — 라인의 추론·장기 작업 모델로 남아 있다. 캐시 읽기가 기본 입력가의 2.5% 로, Sonnet 5.5 의 10% 와 다르다.

소스

Referenced by

Sources