Anthropicプロプライエタリ

Claude Opus 4.8

このモデルを比較

Anthropic開発の最新基盤モデル。前世代から大幅に改善された性能と効率性を実現。

シェア:XはてブLINE

パラメータ

非公開

コンテキスト長

1M

ライセンス

プロプライエタリ

リリース日

2026-05-28

日本語性能

高品質日本語

多言語対応モデルのうち、日本語処理に優れた性能を持つモデル。

API料金

入力料金(1Mトークンあたり)

$5

出力料金(1Mトークンあたり)

$

課金モード: standard

強み

    弱み

      活用例

        深度分析

        Arena Elo

        1477

        BenchLM 総合;コーディングサブセットでは 1537

        SWE-bench Pro

        69.2%

        業界最高水準;GPT-5.5: 58.6%、Gemini 3.1 Pro: 54.2%

        SWE-bench Verified

        88.6%

        Opus 4.7 の 87.6% から向上

        GDPval-AA

        1,890 Elo

        GPT-5.5 に対して 67% の暗黙的勝率

        Intelligence Index

        61.4

        リリース時に #1;Opus 4.7 から +4.1

        入力 / 出力価格

        $5 / $25 per 1M

        Opus 4.7 から変更なし;ファストモード $10/$50

        強み

        • SWE-bench Pro 69.2% を達成し、GPT-5.5 や Gemini 3.1 Pro を大幅に引き離した、業界最高水準のエージェントコーディング性能
        • コード欠陥を見逃す割合が約4分の1に減少し、長期的なエージェントワークフローでの信頼性が向上
        • 1M トークンでの最強の長コンテキスト推論能力(GraphWalks BFS 68.1% vs GPT-5.5 の 45.4%)とナレッジワーク Elo のトップ(GDPval-AA 1,890)

        弱み

        • GPT-5.5 はターミナルベースの DevOps コーディング(Terminal-Bench 78.2% vs 74.6%)で依然リードしており、エージェントタスクでのターン数も約30%少ない
        • プロンプトインジェクション耐性が約2.3%から約7%の攻撃成功率に後退しており、敵対的環境では懸念材料
        • 高いトークン消費量と出力価格($25/M)のため、コスト感度の高い大量ワークロードでは Gemini 3.1 Pro($12/M出力)に比べ割高

        競合比較

        ModelArenaGPQAPrice
        GPT-5.5 (xhigh)~1480*~92%*$25/$30
        Gemini 3.1 Pro~1460*~92%*$2/$12
        Claude Fable 5N/AN/A$10/$50

        Claude Opus 4.8 は、2026年5月28日にリリースされた Anthropic の Opus 4 シリーズの漸進的かつ実質的なアップグレードです。Opus 4.7 をベースに、エージェントコーディング(SWE-bench Pro: 64.3%→69.2%)、ナレッジワーク(GDPval-AA: 1,753→1,890 Elo)、科学的推論(Humanity's Last Exam 約3ポイント向上)で有意義な改善を実現し、従来の $5/$25 の価格設定と 1M トークンのコンテキストウィンドウを維持しています。発売時に Artificial Analysis Intelligence Index で 61.4 を記録し、GPT-5.5 を 1.2 ポイント上回って #1 の座を獲得しました。

        ベンチマーク数値を超えて、本リリースで最も重要な改善は行動面にあります。Opus 4.8 は前身モデルと比較してコード欠陥を見逃す確率が約4分の1に減少しており、初期テスターからはより優れた判断力、不適切な計画に対するより適切なフィードバック、エージェントワークフローにおける強力な自己修正機能が一貫して報告されています。また、Dynamic Workflows(Claude Code で最大1,000個の並列サブエージェントを可能にする研究プレビュー)、Effort Control(推論の深さを5段階で調整)、$10/$50 の価格で 2.5 倍のスループットを提供する新 Fast Mode を導入しています。Anthropic は Opus 4.8 を、さらに要求の厳しいタスクをより高価格で処理する新発表の Fable 5 および Mythos クラスモデルの下に位置する、信頼性の高いプロダクションティアとして位置づけています。

        モデルの主な弱点は、競合が構造的優位性を維持している領域にあります。GPT-5.5 はターミナルベースのコーディングタスクでリードし、エージェントベンチマークでより高いターン効率を達成しており、Gemini 3.1 Pro はコスト感度の高いワークロードで出力トークンが約2倍安価です。また、プロンプトインジェクション耐性は前のバージョンから後退しています。クリエイティブライティングは改善というより横ばいです。にもかかわらず、エージェントコーディングパイプライン、コードレビューオートメーション、長コンテキスト分析ツールを構築するチームにとって、Opus 4.8 は 2026年半ば時点で最強のメインストリームティアオプションです。

        分析生成日: 2026-07-17