Anthropicが2026年7月24日に公開したOpus系列のフラッグシップ。Artificial Analysisインテリジェンス指数で61を記録して首位に立ちながら、価格はOpus 4.8と同じ100万トークンあたり$5/$25に据え置かれた。コンテキスト長100万トークン、SWE-bench Verified 96.0%。
パラメータ
非公開
コンテキスト長
1M
ライセンス
プロプライエタリ
リリース日
2026-07-24
ベンチマーク性能
AA インテリジェンス指数
—
LMArena Elo
—
Human-Like Evaluation
64.7
ARC-AGI-2
90.4
SWE-bench Verified
96.0
GPQA Diamond
93.2
MMLU-Pro
—
LiveCodeBench
—
AIME 2025
—
MATH-500
—
API料金
入力料金(1Mトークンあたり)
$5
出力料金(1Mトークンあたり)
$25
課金モード: standard
強み
- •Opus 4.8と同額のまま性能が向上($5/$25)
- •自己検証がネイティブに動作し、長時間のエージェント作業に強い
- •知識労働と科学(化学・タンパク質)で大きくリード
弱み
- •Anthropic自身がFable 5より総合的に優れているわけではないと明記
- •DeepSWE v1.1でGPT-5.6 Solに劣後、法務・セキュリティはMythos 5が上
- •冗長で遅く、旧プロンプト資産と相性が悪い(拡張思考の破壊的変更あり)
活用例
- •長時間のエージェント型コーディングと大規模リファクタリング
- •再現困難なバグの根本原因分析
- •専門的な知識労働・ディープリサーチ
深度分析
Artificial Analysis インテリジェンス指数
61
max effort で総合1位。Claude Fable 5 は60、GPT-5.6 Sol は59
SWE-bench Verified
96.0%
Anthropic公表値。vals.ai の独立計測では97.0%
SWE-bench Pro
79.2%
SWE-bench Multilingual は89.5%、DeepSWE v1.1 は68.8%でGPT-5.6 Solに劣後
ARC-AGI-2
90.4%
ARC-AGI-1 は97.5%、ARC-AGI-3 は30.2%で次点モデルの約4倍
入力/出力価格
$5 / $25 (100万トークン)
Opus 4.8と同額。Fable 5($10/$50)の半額
コンテキスト長
100万トークン
最大出力12.8万トークン、Batch APIベータでは30万。知識カットオフは2026年5月
強み
- ・Artificial Analysis インテリジェンス指数で61を記録して首位に立ちながら、価格はOpus 4.8と同じ100万トークンあたり$5/$25に据え置かれた。値上げなしの性能向上であり、Claude Fable 5のおよそ半額。
- ・自己検証がネイティブに動作する。指示しなくても自分の出力を検証し、長時間のエージェント型コーディングを測るFrontier-Bench v0.1では43.3%と、Opus 4.8の18.7%を2倍以上上回った。
- ・知識労働と科学分野が特に強い。GDPval-AA v2で1,861 Elo(Fable 5とGPT-5.6 Solを100 Elo以上引き離す)、有機化学でOpus 4.8比+10.2ポイント、タンパク質関連タスクで+7.7ポイント。
弱み
- ・Anthropic自身のシステムカードが「Opus 5は総合的にClaude Fable 5より高性能なわけではない」と明記している。指数首位はあくまで複合スコアであり、全タスクでの制覇ではない。
- ・DeepSWE v1.1ではGPT-5.6 Solに約4ポイント差で敗北し、サイバーセキュリティと法務領域ではMythos 5に及ばないとAnthropic自身が認めている。
- ・APIの破壊的変更がある。拡張思考がデフォルト有効となり、effortがxhighまたはmaxの場合は無効化できない(無効化リクエストはHTTP 400を返す)。またOpus 4.7/4.8向けに調整したプロンプト、特に「作業を検証せよ」系の指示は過剰検証を招き、かえって出力品質を落とす。
競合比較
| Model | Arena | SWE | GPQA | Price |
|---|---|---|---|---|
| Claude Fable 5 | 60(AA指数) | 80.3%(SWE-bench Pro) | 92.6% | $10/$50 (100万トークン) |
| GPT-5.6 Sol | 59(AA指数) | 64.6%(SWE-bench Pro) | 94.6% | $5/$30 (100万トークン) |
| Claude Opus 4.8 | N/A | 18.7%(Frontier-Bench v0.1) | N/A | $5/$25 (100万トークン) |
Claude Opus 5は、Anthropicが2026年7月24日に公開したOpus系列のフラッグシップモデルである。Mythos 5、Fable 5、Sonnet 5に続き、2か月足らずで4本目のClaude 5系リリースとなった。訴求点は生の性能ではなく価格対性能で、Anthropicは「Claude Fable 5のフロンティア知能に半額で迫る」と表現している。実際のAPI価格は入力100万トークンあたり$5、出力$25で、これはOpus 4.8と全く同額、Fable 5の$10/$50に対しては半額にあたる。モデルIDはclaude-opus-5、コンテキスト長は100万トークン、最大出力は12.8万トークン。Claude API、Claude.ai、Claude Code、Claude Cowork で同日提供が始まり、Claude Maxの既定モデル、Claude Proの最上位選択肢となっている。
第三者検証も初日から追随した。7月24日、Artificial Analysisはインテリジェンス指数61(同社が計測した全モデル中の最高値)とエージェント指数55.3の双方でOpus 5を1位に置き、コーディング指数でも78で同率首位とした。Anthropic公表のベンチマークも強気で、SWE-bench Verified 96.0%、SWE-bench Pro 79.2%、SWE-bench Multilingual 89.5%、ARC-AGI-2 90.4%、ARC-AGI-1 97.5%、GPQA Diamond 93.2%、OSWorld 2.0 70.6%、BrowseComp 90.8%、IMO 2026は42点満点。特筆すべきは Frontier-Bench v0.1(43.3%、Opus 4.8は18.7%)と ARC-AGI-3(30.2%、GPT-5.6 Solは7.8%)の2つで、いずれも「最初のアプローチが失敗した後も作業を続けられるか」を測る指標である。
ただし注意点がある。Anthropicは Opus 5を自社最高性能モデルとは呼んでいない。システムカードには「Opus 5は、一般提供モデルの中で最も高性能なClaude Fable 5より総合的に優れているわけではない」と明記され、モデルが数日にわたり自律実行するような作業には引き続きFable 5を推奨している。両立する主張であり、Fable 5が名目上の天井、Opus 5は独立系複合指数で首位かつ半額という位置づけになる。多くのチームにとってルーティング判断は単純で、日常業務の既定をOpus 5にし、本当に難しい仕事だけFable 5に回せばよい。
出典
分析生成日: 2026-08-11