Anthropicプロプライエタリ

Claude Opus 5

このモデルを比較

Anthropicが2026年7月24日に公開したOpus系列のフラッグシップ。Artificial Analysisインテリジェンス指数で61を記録して首位に立ちながら、価格はOpus 4.8と同じ100万トークンあたり$5/$25に据え置かれた。コンテキスト長100万トークン、SWE-bench Verified 96.0%。

シェア:XはてブLINE

パラメータ

非公開

コンテキスト長

1M

ライセンス

プロプライエタリ

リリース日

2026-07-24

ベンチマーク性能

AA インテリジェンス指数

LMArena Elo

Human-Like Evaluation

64.7

ARC-AGI-2

90.4

SWE-bench Verified

96.0

GPQA Diamond

93.2

MMLU-Pro

LiveCodeBench

AIME 2025

MATH-500

API料金

入力料金(1Mトークンあたり)

$5

出力料金(1Mトークンあたり)

$25

課金モード: standard

強み

  • Opus 4.8と同額のまま性能が向上($5/$25)
  • 自己検証がネイティブに動作し、長時間のエージェント作業に強い
  • 知識労働と科学(化学・タンパク質)で大きくリード

弱み

  • Anthropic自身がFable 5より総合的に優れているわけではないと明記
  • DeepSWE v1.1でGPT-5.6 Solに劣後、法務・セキュリティはMythos 5が上
  • 冗長で遅く、旧プロンプト資産と相性が悪い(拡張思考の破壊的変更あり)

活用例

  • 長時間のエージェント型コーディングと大規模リファクタリング
  • 再現困難なバグの根本原因分析
  • 専門的な知識労働・ディープリサーチ

深度分析

Artificial Analysis インテリジェンス指数

61

max effort で総合1位。Claude Fable 5 は60、GPT-5.6 Sol は59

SWE-bench Verified

96.0%

Anthropic公表値。vals.ai の独立計測では97.0%

SWE-bench Pro

79.2%

SWE-bench Multilingual は89.5%、DeepSWE v1.1 は68.8%でGPT-5.6 Solに劣後

ARC-AGI-2

90.4%

ARC-AGI-1 は97.5%、ARC-AGI-3 は30.2%で次点モデルの約4倍

入力/出力価格

$5 / $25 (100万トークン)

Opus 4.8と同額。Fable 5($10/$50)の半額

コンテキスト長

100万トークン

最大出力12.8万トークン、Batch APIベータでは30万。知識カットオフは2026年5月

強み

  • Artificial Analysis インテリジェンス指数で61を記録して首位に立ちながら、価格はOpus 4.8と同じ100万トークンあたり$5/$25に据え置かれた。値上げなしの性能向上であり、Claude Fable 5のおよそ半額。
  • 自己検証がネイティブに動作する。指示しなくても自分の出力を検証し、長時間のエージェント型コーディングを測るFrontier-Bench v0.1では43.3%と、Opus 4.8の18.7%を2倍以上上回った。
  • 知識労働と科学分野が特に強い。GDPval-AA v2で1,861 Elo(Fable 5とGPT-5.6 Solを100 Elo以上引き離す)、有機化学でOpus 4.8比+10.2ポイント、タンパク質関連タスクで+7.7ポイント。

弱み

  • Anthropic自身のシステムカードが「Opus 5は総合的にClaude Fable 5より高性能なわけではない」と明記している。指数首位はあくまで複合スコアであり、全タスクでの制覇ではない。
  • DeepSWE v1.1ではGPT-5.6 Solに約4ポイント差で敗北し、サイバーセキュリティと法務領域ではMythos 5に及ばないとAnthropic自身が認めている。
  • APIの破壊的変更がある。拡張思考がデフォルト有効となり、effortがxhighまたはmaxの場合は無効化できない(無効化リクエストはHTTP 400を返す)。またOpus 4.7/4.8向けに調整したプロンプト、特に「作業を検証せよ」系の指示は過剰検証を招き、かえって出力品質を落とす。

競合比較

ModelArenaSWEGPQAPrice
Claude Fable 560(AA指数)80.3%(SWE-bench Pro)92.6%$10/$50 (100万トークン)
GPT-5.6 Sol59(AA指数)64.6%(SWE-bench Pro)94.6%$5/$30 (100万トークン)
Claude Opus 4.8N/A18.7%(Frontier-Bench v0.1)N/A$5/$25 (100万トークン)

Claude Opus 5は、Anthropicが2026年7月24日に公開したOpus系列のフラッグシップモデルである。Mythos 5、Fable 5、Sonnet 5に続き、2か月足らずで4本目のClaude 5系リリースとなった。訴求点は生の性能ではなく価格対性能で、Anthropicは「Claude Fable 5のフロンティア知能に半額で迫る」と表現している。実際のAPI価格は入力100万トークンあたり$5、出力$25で、これはOpus 4.8と全く同額、Fable 5の$10/$50に対しては半額にあたる。モデルIDはclaude-opus-5、コンテキスト長は100万トークン、最大出力は12.8万トークン。Claude API、Claude.ai、Claude Code、Claude Cowork で同日提供が始まり、Claude Maxの既定モデル、Claude Proの最上位選択肢となっている。

第三者検証も初日から追随した。7月24日、Artificial Analysisはインテリジェンス指数61(同社が計測した全モデル中の最高値)とエージェント指数55.3の双方でOpus 5を1位に置き、コーディング指数でも78で同率首位とした。Anthropic公表のベンチマークも強気で、SWE-bench Verified 96.0%、SWE-bench Pro 79.2%、SWE-bench Multilingual 89.5%、ARC-AGI-2 90.4%、ARC-AGI-1 97.5%、GPQA Diamond 93.2%、OSWorld 2.0 70.6%、BrowseComp 90.8%、IMO 2026は42点満点。特筆すべきは Frontier-Bench v0.1(43.3%、Opus 4.8は18.7%)と ARC-AGI-3(30.2%、GPT-5.6 Solは7.8%)の2つで、いずれも「最初のアプローチが失敗した後も作業を続けられるか」を測る指標である。

ただし注意点がある。Anthropicは Opus 5を自社最高性能モデルとは呼んでいない。システムカードには「Opus 5は、一般提供モデルの中で最も高性能なClaude Fable 5より総合的に優れているわけではない」と明記され、モデルが数日にわたり自律実行するような作業には引き続きFable 5を推奨している。両立する主張であり、Fable 5が名目上の天井、Opus 5は独立系複合指数で首位かつ半額という位置づけになる。多くのチームにとってルーティング判断は単純で、日常業務の既定をOpus 5にし、本当に難しい仕事だけFable 5に回せばよい。

分析生成日: 2026-08-11