OpenAI開発の最高品質基盤モデル。最高の出力品質と推論能力を提供。GPT-5.6 Solの前身。
パラメータ
非公開
コンテキスト長
1000K
ライセンス
プロプライエタリ
リリース日
2026-04-23
日本語性能
多言語対応モデルのうち、日本語処理に優れた性能を持つモデル。
API料金
入力料金(1Mトークンあたり)
$30
出力料金(1Mトークンあたり)
$
課金モード: standard
強み
弱み
活用例
深度分析
Arena Elo
N/A
BenchLMの公開リーダーボードから除外 — 安全にランク付けするのに十分な非生成ベンチマークのカバレッジがない
BrowseComp
90.1%
深いウェブ調査でクラス最高。ベースのGPT-5.5 (84.4%) から+5.7ポイント
GPQA Diamond
~94%
大学院レベルの科学的推論(pricepertoken.com経由、TopReviewedが引用)
SWE-Bench Verified
82.6–89%
矛盾する情報源:LLMReferenceは82.6(ベースと同率)、TopReviewedは約89%と主張
Input Price
$30/1M
ベースGPT-5.5($5/1M)の6倍。出力は$180/1M — キャッシュ入力の割引なし
Context Window
1.05M tokens
ベースGPT-5.5と同様。最大出力128Kトークン。272Kトークンを超える長コンテキストには追加料金
強み
- ・OpenAIラインナップで、困難な推論・数学・調査に最高品質の回答を提供 — BrowseComp 90.1%、FrontierMath T4 39.6%
- ・レガシーのo3-deep-researchおよびo4-mini-deep-researchモデルの単純な代替エンドポイント
- ・より深い熟考により、医療・法律・金融など高リスクタスクで自信を持って間違った回答を減少させる
弱み
- ・6倍の出力コストプレミアム($180/1M)、キャッシュ入力割引なし、別途公開されたベンチマークが乏しい(コーディング、コンピューター利用、長コンテキストの行はOpenAIによって空白)
- ・ストリーミング非対応 — 長いリクエストはバックグラウンドモードのポーリングが必要で、インタラクティブなアプリケーションやレイテンシーが重要な用途には不向き
- ・ベースGPT-5.5と比較してツール機能が制限:apply_patch、コンピューター利用、スキル、ツール検索がなく、エージェントコーディングワークフローが限定される
競合比較
| Model | Arena | SWE | GPQA | Price |
|---|---|---|---|---|
| Claude Opus 4.7 (Anthropic) | N/A | SWE-Bench Verified 87.6%、Pro 64.3% | 94.2% | $5/$25 |
| Claude Fable 5 (Anthropic, suspended) | N/A | SWE-Bench Pro 80.3% | 別途非公開 | $10/$50 |
| GPT-5.5 base (OpenAI) | N/A | SWE-Bench Verified 82.6%、Pro 58.6% | 93.6% | $5/$30 |
GPT-5.5 ProはOpenAIのプレミアム推論層であり、ベースのGPT-5.5と同時に2026年4月23日にリリースされました。これは別個のモデルや異なるアーキテクチャではなく、推論努力が上位層(中/高/x高)に固定された同一のGPT-5.5の重みであり、回答前に複数の推論経路を探索する並列テスト時計算をデプロイしています。これにより、OpenAIが販売する最高品質の回答となり、6倍の出力コストプレミアム(ベースの$5/$30に対し$30/$180)が設定されています。このPro層は、レガシーのo3-deep-researchおよびo4-mini-deep-researchモデルを正式に置き換え、深層研究チームに単一でよりクリーンなエンドポイントを提供します。
モデルの公開ベンチマークは強力ではあるものの、範囲が限られています。BrowseComp(90.1%)、FrontierMath Tier 4(39.6%)、GPQA Diamond(約94%)では、Proはベースと比べて意味のある向上を見せています。しかし、OpenAIはコーディング(SWE-Bench Pro)、コンピューター利用(OSWorld-Verified)、サイバーセキュリティ、長コンテキストの行を公開された評価表で完全に空白のままにしました。これが最も重要な警告です:6倍の価格プレミアムは主にブラウジングと数学の利得に依存しており、最も求められるエージェントやコーディングのベンチマークにはPro固有の数値が一切公表されていません。複数の独立したアナリスト(techsy.io、TopReviewed、BenchLM)がこのギャップを明確に指摘しています。BenchLMは、十分な非生成ベンチマークのカバレッジがないため、GPT-5.5 Proをその公開リーダーボードから完全に除外しました。
ポジショニングの観点では、GPT-5.5 Proは狭いニッチを占めています:ほとんどのプロダクショントラフィックがGPT-5.4 miniまたはベースのGPT-5.5に留まるモデルルーターのエスカレーション層です。その存在意義は、フロンティア数学/科学研究、深層の多段階ウェブ調査、規制された領域の分析的合成、そして単一の熟考された回答が複数の安価な呼び出しプラスアナリストレビューに代わるあらゆるワークフローにあります。日常の作業(起草、コードレビュー、要約、標準的なチャット)については、DataCamp、FluxHire、TopReviewedにわたるコンセンサスは、6倍のプレミアムは90%以上のユースケースでは正当化されないということです。
出典
- GPT-5.5 Pro vs Fable 5: Benchmarks & What's Unpublished — Techsy.io
- GPT-5.5-Pro — Benchmarks, Specs & Release Date — AIReleaseTracker
- GPT-5.5 Pro Benchmarks 2026 — BenchLM.ai
- GPT-5.5 Pro Review — TopReviewed.ai
- Claude Opus 4.7 vs GPT-5.5 vs GPT-5.5 Pro — FluxHire.AI
- GPT-5.5 vs GPT-5.5 Pro: Benchmarks & Pricing — LLMReference
- GPT-5.5 Pro · Models · VerdictPal
- gpt-5.5-pro-2026-04-23 — model deep-dive · Tokonomix
- OpenAI GPT-5 and GPT-5.5 — ChatForest Review
- GPT-5.5 vs GPT-5.5 Pro — OpenTools.ai
分析生成日: 2026-07-17