$ cat wiki/models/claude-opus-5-5.md
Claude Opus 5.5
나란히 보기
- GPT-6 Sol
- MiMo-V2.6-Pro
- Ternary Bonsai 2 27B
- Fugu Max
- Kimi K2.8 Preview
- DeepSeek V4.1-Flash
- K2 Horizon
- Gemini 3.8 Flash
- Muse Spark 1.3
- Hy4 preview
- GLM-5.3-Flash
- Granite 4.2
- Grok 4.6
- Laguna S 2.1
- Inkling
- LongCat-2.0
- MiniMax M3
- GPT-6 Luna
- Fugu Ultra v2
- GPT-Image-2.5 Flare
- GPT-Image-2.5 Sunburst
- Astra
- Claude Fable 5.1
- GLM-5.3
- Qwen 3.8 27B
- DeepSeek V4-Pro-0813
- Gemini 3.7 Flash
- Muse Glimmer
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Claude Opus 5
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- Kimi K3
- GPT-5.6 Sol
- Grok 4.5
- Claude Sonnet 5
- GLM-5.2
- Gemini 3.5 Flash
- Grok Build
- Muse Spark
Anthropic이 2026-09-22에 내놓은 Opus 라인의 릴리스이자, 이 위키에서 발표의 중심이 더 많은 일을 하는 것이 아니라 같은 일을 더 싸게 하는 것에 놓인 첫 모델이다. Anthropic은 이 모델이 대부분의 작업에서 Claude Fable 5.1 수준으로 동작하면서 Claude Opus 5보다 약 40% 낮은 비용이라고 설명하며, 문서는 이제 이 모델을 기본 출발점으로 권하고 Fable 5.1은 "까다로운 추론과 긴 호흡의 에이전트 작업"에 남겨둔다 (source).
이번 릴리스를 가격 한 줄 이상으로 만드는 것은 두 가지다. 출시 표가 SWE-bench 계열을 통째로 버렸고 — 대표 코딩 수치가 전부 Terminal-Bench 4.0, FrontierCode v1.1, CursorBench 4.0이다 — 모델이 preserved thinking이라는 명시적 증류 방지 장치와 함께 나왔다. 후자는 추론 흔적을 Anthropic이 이제 드러내는 대상이 아니라 지키는 대상으로 다룬다는 뜻이다.
이 페이지는 1차 출처를 직접 읽었다. 2026-09-23 실행에서 www.anthropic.com과
platform.claude.com이 클라우드 샌드박스에서 정상 응답했다. 2026-09-01과 2026-09-22
실행은 둘 다 www.anthropic.com을 EGRESS_BLOCKED로 기록했다.
스펙
| 속성 | 값 |
|---|---|
| Developer | Anthropic |
| Released | 2026-09-22 |
| Announced | 2026-09-22 |
| Context window | 1M tokens |
| Pricing | $4/M input · $20/M output · 캐시 읽기 $0.20/M · 캐시 쓰기 $5/M |
| License | 독점 (API 전용, 가중치 미공개) |
| Availability | Claude 앱, Claude Code, Claude API의 claude-opus-5-5, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry |
| Catalogue id | unknown |
| 이 스키마에 자리가 없는 항목들은 행을 새로 만들지 않고 여기에 기록한다 | |
| (source). | |
최대 출력 128K 토큰(Message Batches API에서는 output-300k-2026-03-24 베타 헤더와 | |
함께 300k), 적응형 사고 항상 켜짐에 기본 effort는 medium, **학습 및 신뢰 | |
| 지식 컷오프 Jun 2026**, 은퇴 시점은 2027-09-22보다 이르지 않음. fast mode는 | |
| $8/M input · $40/M output으로 따로 매겨진다. |
Catalogue id는 비어 있는 것이 아니라 unknown이다. scripts/spec-check.py는 슬러그를
정확히 일치시키는데, OpenRouter가 이 모델을 claude-opus-5-5 슬러그로 닿는 이름으로
서빙하는지는 이 샌드박스에서 확인하지 못했다 — openrouter.ai가 차단되어 있기
때문이다. 매일 도는 spec-check Action이 그 답을 줄 것이다.
출시일
2026-09-22, 같은 날 전 플랫폼에서 이용 가능. 발표와 문서가 날짜에 대해 일치한다.
벤치마크
Anthropic의 출시 표와, 함께 공개한 두 비교 열 (source):
| 벤치마크 | Opus 5.5 | Fable 5.1 | Opus 5 |
|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% |
| GDPval-AA v2.1 | 1846 Elo | 1735 | 1708 |
| AutomationBench | 40.0% | 31.4% | 26.9% |
| Humanity's Last Exam | 67.7% | 65.6% | 63.6% |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% |
| OSWorld 2.0 | 81.8% partial | 80.7% | 74.0% |
| Chartography | 89.0% with tools | 88.4% | 83.4% |
| 표 자체가 주는 주의사항이 셋 있다. **SWE-bench 계열 결과가 하나도 대표로 실리지 | |||
| 않았다** — 코딩 주장은 전적으로 Terminal-Bench 4.0, FrontierCode v1.1, CursorBench | |||
| 4.0에 기대고 있고, 그래서 이 위키의 다른 페이지들이 들고 있는 SWE-bench·DeepSWE | |||
| 수치와 비교할 수 없다. 특히 같은 날 공개된 GPT-6 Sol의 DeepSWE v1.1 수치와 | |||
| 맞댈 수 없다. **OSWorld 2.0에는 "partial", Chartography에는 "with tools"가 붙어 | |||
| 있고**, 둘 다 Anthropic이 직접 단 단서이므로 그대로 둔다. **어느 행에도 effort 수준이 | |||
적혀 있지 않다.** 이 모델의 기본 effort는 medium이고 Fable 5.1은 high이므로, 비교 | |||
| 열이 주체 열과 같은 설정이 아닐 수 있는데 읽은 어느 자료도 이에 대해 말하지 않는다. |
표에서 격차가 가장 큰 행은 Terminal-Bench-Science 0.1이다. **Opus 5의 29.0%에 대해 58.7%**로, 두 배를 약간 넘는다.
활용 사례
Anthropic이 지목하는 대상은 긴 호흡의 에이전트형 코딩과 지식 작업이다. 문서는 이를 라우팅 규칙으로 구체화한다. 대부분의 워크로드는 여기서 시작하고, Claude Fable 5.1로는 Opus 5.5를 더 높은 effort로 평가해도 부족할 때만 옮겨가라는 것이다 (source).
활용 사례에 붙은 비용 주장은 실제 워크로드에서 40% 절감이며, Anthropic이 밝힌 메커니즘은 토큰당 가격만이 아니다. Opus 5.5가 같은 작업을 더 적은 토큰으로 끝내고 출력을 30% 이상 빠르게 생성한다는 것이다. 이것은 토큰 경제에 관한 주장이고, 이번 실행에서 읽은 어느 자료도 이를 독립적으로 측정하지 않았다.
Preserved thinking은 이번 릴리스의 또 다른 기능적 변화다. Anthropic은 이를 "API 사용자가 Claude의 추론을 끌어내려고 이전 컨텍스트를 편집하는 것을 막는" 증류 방지 장치로 설명한다. 이는 역량 제한을 대표 기능으로 내세운 것으로, Claude Fable 5의 게이팅 등급이나 이 위키의 Open-Weights Policy Fight 논쟁과 같은 수순을 가중치가 아니라 추론 흔적에 적용한 셈이다.
안전 게이팅: 생물학과 사이버보안 세이프가드는 제한된 작업에서 Claude Opus 4.8로 폴백하며, 전체 접근에는 검증 프로그램이 필요하다. 모델은 zero data retention으로 제공되고 EU AI Act에 따른 워터마킹 조치를 포함한다.
비교
- Claude Fable 5.1 — Anthropic이 지목한 성능 동급. 공개된 아홉 행 모두에서 Opus 5.5가 앞서면서 가격은 $10/$50 대비 $4/$20으로, 입력과 출력 양쪽에서 2.5배 차이다. 그런데도 Anthropic은 까다로운 추론과 긴 호흡의 에이전트 작업을 여전히 Fable 5.1로 보내므로, 표와 안내가 서로 다른 방향을 가리킨다. 안내 쪽이 더 구체적인 주장이므로 그대로 기록한다.
- Claude Opus 5 — 직전 모델이며 이제 Anthropic이 "Legacy models (still available)"로 분류한다. 입력과 출력에서 20% 저렴하고 캐시 읽기에서 60% 저렴하다 ($0.50/M 대비 $0.20/M).
- GPT-6 Sol과 GPT-6 Luna — OpenAI가 같은 날 공개했다. Sol은 Opus 5.5의 $4/$20에 대해 $2/$10이며, DeepSWE v1.1에서 Fable 5보다 작업당 비용이 약 80% 낮다고 주장한다. 두 출시는 공유하는 벤치마크가 하나도 없으므로 공급사 자료만으로는 직접 비교가 불가능하다. Eval Harness Configuration 참조.
소스
- Introducing Claude Opus 5.5 (snapshot)
- Claude models overview — 컨텍스트 윈도우, 최대 출력, 모델 ID, 컷오프, 은퇴 시점