$ cat wiki/models/claude-opus-5.md
Claude Opus 5
나란히 보기
- Qwen 3.8 27B
- DeepSeek V4-Pro-0813
- Gemini 3.7 Flash
- Muse Glimmer
- Grok 4.6
- Laguna S 2.1
- Kimi K3
- Inkling
- GPT-5.6 Sol
- LongCat-2.0
- GLM-5.2
- MiniMax M3
- Muse Spark 1.2
- Qwen 3.8 Max
- DeepSeek V4-Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.6 Flash
- DeepSeek V4
- Grok 4.5
- Claude Sonnet 5
- Claude Fable 5
- Claude Opus 4.8
- Gemini 3.5 Flash
- Grok Build
- Muse Spark
스펙
| 속성 | 값 |
|---|---|
| Developer | Anthropic |
| Released | 2026-07-24 |
| Announced | 2026-07-24 |
| Context window | 1M 토큰 |
| Pricing | $5/M input · $25/M output (표준); $10/M · $50/M (Fast mode, 연구 프리뷰) |
| License | proprietary |
| Availability | Claude.ai, API (claude-opus-5), Bedrock (anthropic.claude-opus-53), Vertex AI, Microsoft Foundry, Claude Code, Cowork |
| 추가 사양: |
- 최대 출력 (동기): 128k 토큰
- 최대 출력 (Batch API + 베타 헤더): 300k 토큰
- 지식 컷오프: 2026년 5월
- 토크나이저: 신규 토크나이저 (Opus 4.7에서 도입); 동일 텍스트가 4.7 이전 모델보다 ~30% 더 많은 토큰 생성
출시일
2026년 7월 24일. Anthropic 역사상 가장 광범위한 동시 멀티 플랫폼 출시: Claude API, Claude.ai (모든 유료 티어), Claude Code, Cowork, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry 모두 0일차에 이용 가능.
"Claude Honeycomb EAP" Cursor 유출 (7월 8일)의 모델로 확인됨 — xhigh 노력 수준이 그 유출에서 언급된 "추가 높은 노력 모드"와 일치. 연속적인 Fable 5 구독 연장 (7월 7일, 12일, 19일까지)은 Opus 5 출시 전 테스트를 완료하는 동안 Anthropic이 포지션을 유지한 것.
벤치마크
| 벤치마크 | Opus 5 | Fable 5 | Opus 4.8 | 비고 |
|---|---|---|---|---|
| Frontier-Bench v0.1 (에이전트 터미널 코딩) | 43.3% | 33.7% | ~21.1% | Opus 5가 ~10pp 앞섬 |
| ARC-AGI-3 (신규 문제 해결) | 30.2% | n/t | — | GPT-5.6 Sol (7.8%) 대비 ~4× |
| SWE-bench Pro | 79.2% | 80.0% | 69.2% | Fable 5와 0.8pp 차이 |
| SWE-bench Verified | 96% | 95% | — | BenchLM 리더보드 #1 |
| GDPval-AA v2 (지식 업무 Elo) | 1,861 | 1,747 | — | GPT-5.6 Sol 대비: 1,736 |
| CursorBench 3.2 (최대 노력) | Fable 5와 0.5% 이내 | — | — | |
| BenchLM 전체 | 85.88/100 (#1) | — | — | 215개 모델 중 |
| 핵심 헤드라인: Frontier-Bench는 실제 에이전트 엔지니어링 작업의 가장 근접한 공개 대리 지표. Opus 5는 절반 비용에 Fable 5를 ~10 퍼센트 포인트 앞섬. |
ARC-AGI-3 — 이 30.2% 는 ARC Prize 가 자사의 표준화된 하네스에서 검증한 값이다. 2026-07-29 OpenAI 는 GPT-5.6 Sol (and Terra, Luna) 이 같은 공개 과제 집합에서 Responses API 의 retained reasoning 과 compaction 을 켠 채 38.3% 를 냈다고 보고했다 — 같은 모델이 공식 하네스에서는 7.8% 였다. Opus 5 가 상태 보존에 해당하는 설정으로 측정되었는지를 밝힌 자료는 없으므로 38.3% 와 30.2% 는 비교할 수 없고 어느 수치도 다른 모델에 대한 증거가 되지 않는다. Eval Harness Configuration 을 보라 (source).
2026-08-16 리더보드 — 1위이되, 격차가 자기 오차 막대보다 작다
LMArena 주간 스냅숏은 상위 세 자리를 모두 Anthropic 에 놓고, 지표는 이 리더보드 자신의 신뢰구간이 붙은 백분율 — Elo 가 아니다 (source):
| 순위 | 모델 | 점수 | ± | 2026-08-09 |
|---|---|---|---|---|
| 1 | Claude Opus 5 (High) | 12.19% | ±1.45% | 11.99% (#1) |
| 2 | Claude Fable 5 (High) | 12.01% | ±2.57% | 11.66% (#2) |
| 3 | Claude Opus 5 (Max) | 11.95% | ±1.71% | 11.19% (#3) |
| 이 순서는 측정된 차이가 아니다. 1위와 3위는 0.24pp 차이인데 구간은 각각 ±1.45 와 | ||||
| ±1.71 이고, 2위의 구간은 그 자체로 ±2.57 이다. 셋이 크게 겹치므로 "LMArena 에서 Opus 5 가 | ||||
| Fable 5 를 앞선다" 는 이 스냅숏이 뒷받침하지 않는 진술이고, 뒷받침되는 것은 상위 셋이 | ||||
| 구별되지 않는다는 것뿐이다. 이는 Eval Harness Configuration 이 하네스 없는 | ||||
| 수치에 적용하는 것과 같은 규율이다 — 순위를 삼켜 버리는 구간은 순위가 아니다. |
같은 주의 다른 움직임 둘, 두 스냅숏 사이에 출시된 모델이 없는데도:
- 상위 셋이 모두 올랐다 (+0.20, +0.35, +0.76pp). 릴리스 없이 움직이는 보드는 역량 변화가 아니라 자기 투표 구성을 재고 있는 것이다.
- Claude Sonnet 5 가 상위 10 을 벗어났다 — 08-09 에 7.46% ±2.15% 로 9위였고 08-16 에는 없으며, GPT 5.5 (High) 가 7.73% 로 그 자리를 가져갔다. 서버에서 렌더되는 것은 상위 10뿐이므로 이것은 보이는 표에서의 이탈을 기록한 것이지 점수가 아니다 (source).
- LMArena 가 자기 변형 라벨을 바꿨다:
Claude Opus 4.8 (Thinking)→Claude Opus 4.8 (High), Opus 4.7 도 같다. 같은 모델을 발행자가 다시 이름 붙인 것이며, 이후 이 스냅숏들을 diff 할 때 새 항목으로 읽지 않도록 기록해 둔다.
같은 날짜의 Artificial Analysis 는 다른 지표이고 다른 그림을 준다. Opus 5 는 max
(작업당 $2.34) 와 xhigh ($1.80) 양쪽에서 최상위 Intelligence Index 63 을 지키며 —
2026-08-09 과 같다 — Claude Fable 5 (with fallback) 는 $3.14 에 62, Opus 5 의 high
는 $1.23 에 61 이다
(source).
달라진 것은 그 주변의 동등성 가격이다. Grok 4.6 이 같은 표에 작업당
$0.84 에 61 로 들어온다 — high 의 Opus 5 및 max 의 OpenAI GPT-5.6 Sol 과 같은 지수를,
Opus 5 max 의 측정된 비용의 약 삼분의 일 에 낸다. Artificial Analysis Intelligence Index
는 그 발행자가 자기 벤치마크 묶음으로 만든 복합 점수이지 정확도가 아니며,
Cost per Task USD 는 그들이 측정한 작업 하나의 비용이지 토큰 단가가 아니다.
이 수치들을 표가 아니라 산문으로 둔 것은 의도적이다. claim-check.py 는 표 행을 그것이
인용하는 스냅숏과 (행 라벨, 열 머리글) 로 대조하는데 라벨에서 괄호 안 텍스트를 지운다.
그래서 Claude Opus 5 (…) 의 모든 노력 변형이 하나의 키로 뭉개지고, 스냅숏이 마지막에 싣는
행과 비교된다. 여기서 변형별 표는 거짓 불일치를 만들었다 — 61 이 (low) 행의 52 와 대조됐다 —
페이지의 모든 수치가 맞는데도 그랬다. lint-2026-W33 (운영 기록, 미발행) 에 기록해 둔다.
주요 신규 기능
- 노력 토글:
effort파라미터 —low,high,xhigh값. Claude API와 Claude Code에서high가 기본값. 적응형 사고는 Opus 5, Fable 5, Opus 4.8에서 항상 켜져 있음 — 명시적thinking.type: "enabled"불필요. - Fast mode (연구 프리뷰): ~2.5× 더 빠른 출력, MTok당 $10/$50. Claude Code에서
/fast로 토글 가능. Claude API 전용 — Batch API, Bedrock, Vertex에서는 이용 불가. - Dynamic workflows (연구 프리뷰): Claude Code가 작업을 계획하고 독립적 접근법, 적대적 반박, 반복적 수렴으로 수백 개의 병렬 서브에이전트를 파견.
- 128k 출력 / 300k Batch: Opus 라인에서 가장 큰 표준 출력 창.
- Claude Max의 기본 모델; Claude Pro에서 이용 가능한 가장 강력한 모델.
활용 사례
- 에이전트 코딩 및 장기 소프트웨어 엔지니어링 작업
- 신규 문제 해결 및 다단계 추론
- 대규모 지식 업무 및 연구
- 컴퓨터 사용 (자율 데스크톱 및 브라우저 제어)
- 다학제적 추론 (대부분 기업/에이전트 워크플로우에서 Fable 5 대체 권장)
비교
Claude Opus 4.8 대비 ($5/$25 표준, SWE-bench Pro 69.2%)
토큰당 동일 가격, 동일 컨텍스트 창. Opus 5 제공:
- SWE-bench Pro +10pp(79.2% 대 69.2%)
- Frontier-Bench 점수 Opus 4.8의 약 2×
- 지식 업무 및 소프트웨어 엔지니어링에서 ~2× 성능 (Anthropic 주장)
- 최대 출력 128k vs. 32k
Opus 4.8은 이제 레거시 모델로 분류됨; Anthropic이 마이그레이션 가이드를 발표함.
Claude Fable 5 대비 ($10/$50 표준, SWE-bench Pro 80.0%)
Opus 5는 토큰당 절반 비용 (표준 티어)이며:
- Frontier-Bench에서 Fable 5 능가 (43.3% vs. 33.7%)
- ARC-AGI-3에서 Fable 5 능가 (30.2% vs. n/t)
- GDPval-AA v2에서 Fable 5 능가 (1,861 vs. 1,747 Elo)
- SWE-bench Verified에서 Fable 5 능가 (96% vs. 95%)
- SWE-bench Pro에서 Fable 5에 0.8pp 뒤짐 (79.2% vs. 80.0%)
- 최대 노력 CursorBench 3.2에서 Fable 5와 0.5% 이내
Fable 5는 최고 기능 시나리오 (사이버보안: Mythos 5 선두)에서 우위 유지; Opus 5는 대부분 기업/에이전트 코딩 작업의 권장 기본값으로 포지셔닝됨.
상충 보고
- Anthropic 이 Fable 5 의 SWE-bench Pro 를 두 수치로 발표했고, 이 건은 해소되지 않았다. 2026-06-09 Fable 5 출시 발표는 80.3% 를 적고 있고(source), 2026-07-24 Opus 5 출시 발표는 비교표에서 Fable 5 를 80.0% 로 적는다(source). 둘 다 Anthropic 자신의 발표이므로 스키마의 "공식 발표가 3자 보도를 이긴다" 규칙으로는 우열을 가릴 수 없고, 어느 쪽도 벤치마크를 다시 돌렸다고 말하지 않는다. 따라서 각 페이지는 자기가 다루는 발표의 수치를 싣고, 양쪽 모두 이 메모를 단다. 임의로 합치지 말 것 — 나중 발표가 앞선 수치를 다르게 적은 것과 정정은 다르며, 어떤 출처도 정정이라 말하지 않았다.
Referenced by
Sources
- sources/evals/lmarena-2026-08-16.md
- sources/evals/artificial-analysis-2026-08-16.md
- sources/blogs/openai-2026-07-29-arc-agi-3-two-settings.md
- sources/blogs/anthropic-2026-07-24-claude-opus-5.md
- https://www.anthropic.com/news/claude-opus-5
- https://www-cdn.anthropic.com/c5fbac3f0b1280a933ebd26d3cb8bb9f5bdeaf48/Claude%20Opus%205%20System%20Card.pdf
- https://platform.claude.com/docs/en/about-claude/models/overview
- https://platform.claude.com/docs/en/about-claude/pricing