AI Trend Notifier
EN
← wiki

$ cat wiki/models/claude-opus-5.md

Claude Opus 5

나란히 보기

스펙

속성
DeveloperAnthropic
Released2026-07-24
Announced2026-07-24
Context window1M 토큰
Pricing$5/M input · $25/M output (표준); $10/M · $50/M (Fast mode, 연구 프리뷰)
Licenseproprietary
AvailabilityClaude.ai, API (claude-opus-5), Bedrock (anthropic.claude-opus-53), Vertex AI, Microsoft Foundry, Claude Code, Cowork
추가 사양:
  • 최대 출력 (동기): 128k 토큰
  • 최대 출력 (Batch API + 베타 헤더): 300k 토큰
  • 지식 컷오프: 2026년 5월
  • 토크나이저: 신규 토크나이저 (Opus 4.7에서 도입); 동일 텍스트가 4.7 이전 모델보다 ~30% 더 많은 토큰 생성

출시일

2026년 7월 24일. Anthropic 역사상 가장 광범위한 동시 멀티 플랫폼 출시: Claude API, Claude.ai (모든 유료 티어), Claude Code, Cowork, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry 모두 0일차에 이용 가능.

"Claude Honeycomb EAP" Cursor 유출 (7월 8일)의 모델로 확인됨 — xhigh 노력 수준이 그 유출에서 언급된 "추가 높은 노력 모드"와 일치. 연속적인 Fable 5 구독 연장 (7월 7일, 12일, 19일까지)은 Opus 5 출시 전 테스트를 완료하는 동안 Anthropic이 포지션을 유지한 것.

벤치마크

벤치마크Opus 5Fable 5Opus 4.8비고
Frontier-Bench v0.1 (에이전트 터미널 코딩)43.3%33.7%~21.1%Opus 5가 ~10pp 앞섬
ARC-AGI-3 (신규 문제 해결)30.2%n/tGPT-5.6 Sol (7.8%) 대비 ~4×
SWE-bench Pro79.2%80.0%69.2%Fable 5와 0.8pp 차이
SWE-bench Verified96%95%BenchLM 리더보드 #1
GDPval-AA v2 (지식 업무 Elo)1,8611,747GPT-5.6 Sol 대비: 1,736
CursorBench 3.2 (최대 노력)Fable 5와 0.5% 이내
BenchLM 전체85.88/100 (#1)215개 모델 중
핵심 헤드라인: Frontier-Bench는 실제 에이전트 엔지니어링 작업의 가장 근접한 공개 대리 지표. Opus 5는 절반 비용에 Fable 5를 ~10 퍼센트 포인트 앞섬.

ARC-AGI-3 — 이 30.2% 는 ARC Prize 가 자사의 표준화된 하네스에서 검증한 값이다. 2026-07-29 OpenAI 는 GPT-5.6 Sol (and Terra, Luna) 이 같은 공개 과제 집합에서 Responses API 의 retained reasoning 과 compaction 을 켠 채 38.3% 를 냈다고 보고했다 — 같은 모델이 공식 하네스에서는 7.8% 였다. Opus 5 가 상태 보존에 해당하는 설정으로 측정되었는지를 밝힌 자료는 없으므로 38.3% 와 30.2% 는 비교할 수 없고 어느 수치도 다른 모델에 대한 증거가 되지 않는다. Eval Harness Configuration 을 보라 (source).

2026-08-16 리더보드 — 1위이되, 격차가 자기 오차 막대보다 작다

LMArena 주간 스냅숏은 상위 세 자리를 모두 Anthropic 에 놓고, 지표는 이 리더보드 자신의 신뢰구간이 붙은 백분율 — Elo 가 아니다 (source):

순위모델점수±2026-08-09
1Claude Opus 5 (High)12.19%±1.45%11.99% (#1)
2Claude Fable 5 (High)12.01%±2.57%11.66% (#2)
3Claude Opus 5 (Max)11.95%±1.71%11.19% (#3)
이 순서는 측정된 차이가 아니다. 1위와 3위는 0.24pp 차이인데 구간은 각각 ±1.45 와
±1.71 이고, 2위의 구간은 그 자체로 ±2.57 이다. 셋이 크게 겹치므로 "LMArena 에서 Opus 5 가
Fable 5 를 앞선다" 는 이 스냅숏이 뒷받침하지 않는 진술이고, 뒷받침되는 것은 상위 셋이
구별되지 않는다는 것뿐이다. 이는 Eval Harness Configuration 이 하네스 없는
수치에 적용하는 것과 같은 규율이다 — 순위를 삼켜 버리는 구간은 순위가 아니다.

같은 주의 다른 움직임 둘, 두 스냅숏 사이에 출시된 모델이 없는데도:

  • 상위 셋이 모두 올랐다 (+0.20, +0.35, +0.76pp). 릴리스 없이 움직이는 보드는 역량 변화가 아니라 자기 투표 구성을 재고 있는 것이다.
  • Claude Sonnet 5 가 상위 10 을 벗어났다 — 08-09 에 7.46% ±2.15% 로 9위였고 08-16 에는 없으며, GPT 5.5 (High) 가 7.73% 로 그 자리를 가져갔다. 서버에서 렌더되는 것은 상위 10뿐이므로 이것은 보이는 표에서의 이탈을 기록한 것이지 점수가 아니다 (source).
  • LMArena 가 자기 변형 라벨을 바꿨다: Claude Opus 4.8 (Thinking)Claude Opus 4.8 (High), Opus 4.7 도 같다. 같은 모델을 발행자가 다시 이름 붙인 것이며, 이후 이 스냅숏들을 diff 할 때 새 항목으로 읽지 않도록 기록해 둔다.

같은 날짜의 Artificial Analysis 는 다른 지표이고 다른 그림을 준다. Opus 5 는 max (작업당 $2.34) 와 xhigh ($1.80) 양쪽에서 최상위 Intelligence Index 63 을 지키며 — 2026-08-09 과 같다 — Claude Fable 5 (with fallback) 는 $3.1462, Opus 5 의 high$1.2361 이다 (source).

달라진 것은 그 주변의 동등성 가격이다. Grok 4.6 이 같은 표에 작업당 $0.84 에 61 로 들어온다 — high 의 Opus 5 및 max 의 OpenAI GPT-5.6 Sol 과 같은 지수를, Opus 5 max 의 측정된 비용의 약 삼분의 일 에 낸다. Artificial Analysis Intelligence Index 는 그 발행자가 자기 벤치마크 묶음으로 만든 복합 점수이지 정확도가 아니며, Cost per Task USD 는 그들이 측정한 작업 하나의 비용이지 토큰 단가가 아니다.

이 수치들을 표가 아니라 산문으로 둔 것은 의도적이다. claim-check.py 는 표 행을 그것이 인용하는 스냅숏과 (행 라벨, 열 머리글) 로 대조하는데 라벨에서 괄호 안 텍스트를 지운다. 그래서 Claude Opus 5 (…) 의 모든 노력 변형이 하나의 키로 뭉개지고, 스냅숏이 마지막에 싣는 행과 비교된다. 여기서 변형별 표는 거짓 불일치를 만들었다 — 61 이 (low) 행의 52 와 대조됐다 — 페이지의 모든 수치가 맞는데도 그랬다. lint-2026-W33 (운영 기록, 미발행) 에 기록해 둔다.

주요 신규 기능

  • 노력 토글: effort 파라미터 — low, high, xhigh 값. Claude API와 Claude Code에서 high가 기본값. 적응형 사고는 Opus 5, Fable 5, Opus 4.8에서 항상 켜져 있음 — 명시적 thinking.type: "enabled" 불필요.
  • Fast mode (연구 프리뷰): ~2.5× 더 빠른 출력, MTok당 $10/$50. Claude Code에서 /fast로 토글 가능. Claude API 전용 — Batch API, Bedrock, Vertex에서는 이용 불가.
  • Dynamic workflows (연구 프리뷰): Claude Code가 작업을 계획하고 독립적 접근법, 적대적 반박, 반복적 수렴으로 수백 개의 병렬 서브에이전트를 파견.
  • 128k 출력 / 300k Batch: Opus 라인에서 가장 큰 표준 출력 창.
  • Claude Max의 기본 모델; Claude Pro에서 이용 가능한 가장 강력한 모델.

활용 사례

  • 에이전트 코딩 및 장기 소프트웨어 엔지니어링 작업
  • 신규 문제 해결 및 다단계 추론
  • 대규모 지식 업무 및 연구
  • 컴퓨터 사용 (자율 데스크톱 및 브라우저 제어)
  • 다학제적 추론 (대부분 기업/에이전트 워크플로우에서 Fable 5 대체 권장)

비교

Claude Opus 4.8 대비 ($5/$25 표준, SWE-bench Pro 69.2%)

토큰당 동일 가격, 동일 컨텍스트 창. Opus 5 제공:

  • SWE-bench Pro +10pp(79.2% 대 69.2%)
  • Frontier-Bench 점수 Opus 4.8의 약 2×
  • 지식 업무 및 소프트웨어 엔지니어링에서 ~2× 성능 (Anthropic 주장)
  • 최대 출력 128k vs. 32k

Opus 4.8은 이제 레거시 모델로 분류됨; Anthropic이 마이그레이션 가이드를 발표함.

Claude Fable 5 대비 ($10/$50 표준, SWE-bench Pro 80.0%)

Opus 5는 토큰당 절반 비용 (표준 티어)이며:

  • Frontier-Bench에서 Fable 5 능가 (43.3% vs. 33.7%)
  • ARC-AGI-3에서 Fable 5 능가 (30.2% vs. n/t)
  • GDPval-AA v2에서 Fable 5 능가 (1,861 vs. 1,747 Elo)
  • SWE-bench Verified에서 Fable 5 능가 (96% vs. 95%)
  • SWE-bench Pro에서 Fable 5에 0.8pp 뒤짐 (79.2% vs. 80.0%)
  • 최대 노력 CursorBench 3.2에서 Fable 5와 0.5% 이내

Fable 5는 최고 기능 시나리오 (사이버보안: Mythos 5 선두)에서 우위 유지; Opus 5는 대부분 기업/에이전트 코딩 작업의 권장 기본값으로 포지셔닝됨.

상충 보고

  • Anthropic 이 Fable 5 의 SWE-bench Pro 를 두 수치로 발표했고, 이 건은 해소되지 않았다. 2026-06-09 Fable 5 출시 발표는 80.3% 를 적고 있고(source), 2026-07-24 Opus 5 출시 발표는 비교표에서 Fable 5 를 80.0% 로 적는다(source). 둘 다 Anthropic 자신의 발표이므로 스키마의 "공식 발표가 3자 보도를 이긴다" 규칙으로는 우열을 가릴 수 없고, 어느 쪽도 벤치마크를 다시 돌렸다고 말하지 않는다. 따라서 각 페이지는 자기가 다루는 발표의 수치를 싣고, 양쪽 모두 이 메모를 단다. 임의로 합치지 말 것 — 나중 발표가 앞선 수치를 다르게 적은 것과 정정은 다르며, 어떤 출처도 정정이라 말하지 않았다.

Referenced by

Sources