Anthropic開発の最新基盤モデル。前世代から大幅に改善された性能と効率性を実現。
パラメータ
非公開
コンテキスト長
1M
ライセンス
プロプライエタリ
リリース日
2026-05-28
日本語性能
多言語対応モデルのうち、日本語処理に優れた性能を持つモデル。
API料金
入力料金(1Mトークンあたり)
$5
出力料金(1Mトークンあたり)
$
課金モード: standard
強み
弱み
活用例
深度分析
Arena Elo
1477
BenchLM 総合;コーディングサブセットでは 1537
SWE-bench Pro
69.2%
業界最高水準;GPT-5.5: 58.6%、Gemini 3.1 Pro: 54.2%
SWE-bench Verified
88.6%
Opus 4.7 の 87.6% から向上
GDPval-AA
1,890 Elo
GPT-5.5 に対して 67% の暗黙的勝率
Intelligence Index
61.4
リリース時に #1;Opus 4.7 から +4.1
入力 / 出力価格
$5 / $25 per 1M
Opus 4.7 から変更なし;ファストモード $10/$50
強み
- ・SWE-bench Pro 69.2% を達成し、GPT-5.5 や Gemini 3.1 Pro を大幅に引き離した、業界最高水準のエージェントコーディング性能
- ・コード欠陥を見逃す割合が約4分の1に減少し、長期的なエージェントワークフローでの信頼性が向上
- ・1M トークンでの最強の長コンテキスト推論能力(GraphWalks BFS 68.1% vs GPT-5.5 の 45.4%)とナレッジワーク Elo のトップ(GDPval-AA 1,890)
弱み
- ・GPT-5.5 はターミナルベースの DevOps コーディング(Terminal-Bench 78.2% vs 74.6%)で依然リードしており、エージェントタスクでのターン数も約30%少ない
- ・プロンプトインジェクション耐性が約2.3%から約7%の攻撃成功率に後退しており、敵対的環境では懸念材料
- ・高いトークン消費量と出力価格($25/M)のため、コスト感度の高い大量ワークロードでは Gemini 3.1 Pro($12/M出力)に比べ割高
競合比較
| Model | Arena | GPQA | Price |
|---|---|---|---|
| GPT-5.5 (xhigh) | ~1480* | ~92%* | $25/$30 |
| Gemini 3.1 Pro | ~1460* | ~92%* | $2/$12 |
| Claude Fable 5 | N/A | N/A | $10/$50 |
Claude Opus 4.8 は、2026年5月28日にリリースされた Anthropic の Opus 4 シリーズの漸進的かつ実質的なアップグレードです。Opus 4.7 をベースに、エージェントコーディング(SWE-bench Pro: 64.3%→69.2%)、ナレッジワーク(GDPval-AA: 1,753→1,890 Elo)、科学的推論(Humanity's Last Exam 約3ポイント向上)で有意義な改善を実現し、従来の $5/$25 の価格設定と 1M トークンのコンテキストウィンドウを維持しています。発売時に Artificial Analysis Intelligence Index で 61.4 を記録し、GPT-5.5 を 1.2 ポイント上回って #1 の座を獲得しました。
ベンチマーク数値を超えて、本リリースで最も重要な改善は行動面にあります。Opus 4.8 は前身モデルと比較してコード欠陥を見逃す確率が約4分の1に減少しており、初期テスターからはより優れた判断力、不適切な計画に対するより適切なフィードバック、エージェントワークフローにおける強力な自己修正機能が一貫して報告されています。また、Dynamic Workflows(Claude Code で最大1,000個の並列サブエージェントを可能にする研究プレビュー)、Effort Control(推論の深さを5段階で調整)、$10/$50 の価格で 2.5 倍のスループットを提供する新 Fast Mode を導入しています。Anthropic は Opus 4.8 を、さらに要求の厳しいタスクをより高価格で処理する新発表の Fable 5 および Mythos クラスモデルの下に位置する、信頼性の高いプロダクションティアとして位置づけています。
モデルの主な弱点は、競合が構造的優位性を維持している領域にあります。GPT-5.5 はターミナルベースのコーディングタスクでリードし、エージェントベンチマークでより高いターン効率を達成しており、Gemini 3.1 Pro はコスト感度の高いワークロードで出力トークンが約2倍安価です。また、プロンプトインジェクション耐性は前のバージョンから後退しています。クリエイティブライティングは改善というより横ばいです。にもかかわらず、エージェントコーディングパイプライン、コードレビューオートメーション、長コンテキスト分析ツールを構築するチームにとって、Opus 4.8 は 2026年半ば時点で最強のメインストリームティアオプションです。
出典
- Introducing Claude Opus 4.8 — Anthropic
- Claude Opus 4.8 Takes the Lead on the Artificial Analysis Intelligence Index
- Claude Opus 4.8 Benchmark Scores & Evals — BenchmarkList
- Claude Opus 4.8 Benchmarks, Pricing & Speed — BenchLM.ai
- Claude Opus 4.8 Review: Better At What It's Good At — Tech Yahoo
- 5 Biggest Upgrades: Claude Opus 4.8 vs 4.7 — Android Authority
- Claude Opus 4.8 Review: Reliability Over Raw Scores — Awesome Agents
- Claude Opus 4.8 Review — AI Panel Verdict — TopReviewed.ai
- Claude Opus 4.8 vs Opus 4.7: What Actually Changed — Contra Collective
- Claude Opus 4.8 Benchmarks, Scores, Rankings — AllThings.how
分析生成日: 2026-07-17