$ cat wiki/models/claude-sonnet-5-5.md
Claude Sonnet 5.5
나란히 보기
- GPT-6 Sol
- MiMo-V2.6-Pro
- Grok 4.7
- Ternary Bonsai 2 27B
- Fugu Max
- Kimi K2.8 Preview
- DeepSeek V4.1-Flash
- K2 Horizon
- Muse Spark 1.3
- Hy4 preview
- GLM-5.3-Flash
- Granite 4.2
- Ling-3.0-tiny
- Laguna S 2.1
- Inkling
- LongCat-2.0
- MiniMax M3
- Claude Opus 5.5
- GPT-6 Luna
- Gemini 3.8 Live
- Fugu Ultra v2
- GPT-Image-2.5 Flare
- GPT-Image-2.5 Sunburst
- Astra
- Gemini 3.8 Flash
- Claude Fable 5.1
- GLM-5.3
- Qwen 3.8 27B
- DeepSeek V4-Pro-0813
- Gemini 3.7 Flash
- Muse Glimmer
- Grok 4.6
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Claude Opus 5
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- Kimi K3
- GPT-5.6 Sol
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Gemini 3.5 Flash
- Grok Build
- Muse Spark
Anthropic의 2026-09-28 Sonnet 출시로, Claude Opus 5.5 엿새 뒤에 나왔다. 같은 일을 더 적은 비용으로 한다는 그 출시의 논지를 한 티어 아래에서 이어가면서, 그 논지가 예상하지 못한 결과 하나를 함께 들고 온다: Terminal-Bench 4.0 에서 Sonnet 5.5 는 70.6%, Opus 5.5 는 66.4% 이므로, 더 저렴한 모델이 프런티어 모델의 출시 표가 기대고 있던 바로 그 벤치마크에서 앞선다 (source).
1차 출처로 2회 패스 읽음. www.anthropic.com 이 두 패스 모두 응답했고 이는 여섯 번째 연속
실행이며, platform.claude.com 이 발표가 생략한 스펙 수치를 전부 제공했다 — 발표 페이지는
컨텍스트 창을 아예 명시하지 않는다.
스펙
| 속성 | 값 |
|---|---|
| Developer | Anthropic |
| Released | 2026-09-28 |
| Announced | 2026-09-28 |
| Context window | 1M tokens |
| Pricing | $2/M input · $10/M output · 캐시 읽기는 기본 입력가의 10% |
| License | 독점 (API 전용, 가중치 미공개) |
| Availability | Claude 앱, Claude API의 claude-sonnet-5-5, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry, Claude Platform on AWS |
| 캐시 읽기 행은 페이지가 인쇄한 수치가 아니라 문서에 명시된 규칙 을 기록한 것이다: 가격 주석은 | |
| *"prompt cache reads cost 10% of the base input price (2.5% on Claude Fable 5.1 and Claude | |
| Mythos 5.1, 5% on Claude Opus 5.5)"* 라고 적고, Sonnet 5.5 는 두 예외 어디에도 이름이 없다 | |
| (docs). 달러 금액이 아니라 규칙으로 | |
| 기록한다. |
가격은 Claude Sonnet 5 의 $2/$10 과 동일 하며, 이는 발표의 "costs up to 30% less for most work" 를 토큰당 가격이 아니라 소비 토큰 에 대한 주장으로 만든다 — 절감은 요금표가 아니라 effort 설정에서 나온다.
출시일
발표와 사용 가능 시점이 같은 날인 2026-09-28. 은퇴는 2027-09-28 이전은 아님 으로 약속됐다 (docs).
벤치마크
공개된 그대로이며, 출시 페이지가 지명한 비교 모델을 함께 적는다.
| 벤치마크 | Sonnet 5.5 | Claude Sonnet 5 | Claude Opus 5.5 | 기타 |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 70.6% | 10.3% | 66.4% | — |
| FrontierCode 1.1 (Main) | 46.2% (Max) | 42.4% | 54.4% | GPT-6 Sol 49.3% |
| CursorBench 4.0 | 55.5% | 34.1% | 57.8% | — |
| GDPval-AA v2.1 | 1844 | 1449 | 1846 | — |
| AA-Briefcase v1.1 | 1811 | 1359 | 1822 | — |
| Humanity's Last Exam | 64.5% (도구 사용) | 54.9% | 67.7% | — |
| OSWorld 2.1 | 80.1% (부분) | 57.0% | 81.8% | — |
| Chartography | 61.6% (도구 없음) | 15.6% | 64.4% | — |
| Terminal-Bench 행은 오타가 아니고, 이 위키와 상충하는 것도 아니다. 출시 페이지는 Sonnet 5 의 | ||||
| Terminal-Bench 4.0 을 10.3% 로 적으며, 바로 그 이유로 두 번째 패스에서 다시 읽었다. | ||||
| Claude Sonnet 5 는 Terminal-Bench 2.1 에서 80.4% 를 보유한다. 둘 다 옳다: | ||||
| 메이저 두 버전 차이가 나는 서로 다른 하네스 이며, 한 모델에서 나는 70.1점 격차는 모델이 아니라 | ||||
| 하네스를 측정한 값이다. 이것은 Eval Harness Configuration 이 추적하려고 존재하는 | ||||
| 실패 양태이고, 위키가 보유한 가장 명확한 사례다 — 시리즈처럼 보이는 벤치마크 이름은 시리즈가 아니다. |
Sonnet 5.5 는 정확히 한 항목에서 Opus 5.5 를 앞서고 (Terminal-Bench 4.0) 나머지 일곱에서 뒤지며, 격차는 2점 (GDPval-AA v2.1, 1844 대 1846) 에서 8.2점 (FrontierCode 1.1) 사이다. 발표는 GDPval-AA 격차를 직접 언급한다: Sonnet 5.5 는 "two points below Opus 5.5 on GDPval-AA, a test of real-world work across a variety of occupations" 라고 적는다.
이 표의 Opus 5.5 칸 둘은 그 모델 자신의 출시 페이지와 어긋난다 — 여기서 Chartography 64.4%, 거기서 89.0%, 그리고 여기서 OSWorld 2.1, 거기서 2.0 — 둘 다 Claude Opus 5.5 의 ## Conflicting Reports 에 밝혀 두었다. Chartography 격차는 이 표의 no tools 라벨과 그쪽의 with tools 라벨과 맞물린다.
effort별 절대 수치는 공개되지 않았다. 페이지는 여러 벤치마크에서 Sonnet 5.5 가 Low 또는 Medium effort 에서 Sonnet 5 의 최고 점수를 작업당 약 10분의 1 비용으로 앞선다 고 주장하며, 그 비교를 표가 아니라 차트로 제시하므로 개별 점은 인용할 수 없다.
활용 사례
Anthropic이 밝힌 포지셔닝: 범위가 분명한 일상 업무, 버그 수정, 그리고 다듬어진 문서·슬라이드· 스프레드시트 작성 — 신중한 판단이 필요한 복잡한 작업에 남겨 둔 Opus 5.5 에 대해 더 빠르고 저렴한 보완재다 (source).
코딩 밖에 놓인 역량 주장은 둘이다:
- 컴퓨터 사용. OSWorld 2.1 80.1% (부분), Sonnet 5 의 57.0% 대비 — 이 티어의 가장 약한 축에서 23.1점 상승이며, Opus 5.5 와는 1.7점 차이다.
- 스크린샷만으로 하는 장기 플레이. "it's the first Sonnet model to beat Pokémon Red working only from screenshots" — 주장의 핵심은 그 한정어다. 그 성취 자체는 Claude 라인에 새로운 것이 아니고, 이 티어와 이 입력 채널에서만 새롭다.
문서의 기본 모델 권고는 이 출시로 바뀌지 않았다: 대부분의 워크로드에는 Opus 5.5, 까다로운 추론과 장기 에이전트 작업에는 Claude Fable 5.1. Sonnet 5.5 는 누구의 기본으로도 제시되지 않는다.
비교
- Claude Sonnet 5 — 직전 모델이며 요금표가 동일한 $2/$10. 공개된 여덟 항목 전부에서 뒤지고, 하네스 버전이 바뀌거나 도구 사용을 측정하는 세 항목 (Terminal-Bench 4.0, Chartography, OSWorld 2.1) 에서는 큰 폭으로 뒤진다.
- Claude Opus 5.5 — 엿새 먼저 $4/$20 에 출시됐다. 기본 effort 가
medium이고 Sonnet 5.5 는high이므로 (docs), 두 모델의 헤드라인 수치는 같은 설정에서 나온 것이 아니며 그것이 왜 중요한지는 Eval Harness Configuration 이 보유한다. - Claude Fable 5.1 — 라인의 추론·장기 작업 모델로 남아 있다. 캐시 읽기가 기본 입력가의 2.5% 로, Sonnet 5.5 의 10% 와 다르다.
소스
- Introducing Claude Sonnet 5.5 (snapshot)
- Claude models overview — 컨텍스트 창, 최대 출력, 가격, 모델 ID, 컷오프, 기본 effort, 은퇴 시점