アリババ開発の最新エージェント特化モデル。高度なエージェントワークフローと推論能力を実現。
パラメータ
非公開
コンテキスト長
ライセンス
プロプライエタリ
リリース日
2026-05-20
日本語性能
多言語対応モデルのうち、日本語処理に優れた性能を持つモデル。
API料金
入力料金(1Mトークンあたり)
$2.5
出力料金(1Mトークンあたり)
$
課金モード: standard
強み
弱み
活用例
深度分析
Artificial Analysis Intelligence Index
56.6
218+ランクモデル中総合#5位、中国モデルとして最高スコア。Qwen3.6 Max Previewに対し+4.8ポイント
Arena AI Elo
~1,489 (#14 overall)
数学#7位、エキスパートプロンプト#9位、ソフトウェア&IT #9位。WebDev Arenaでは1,541 Eloで#4位
SWE-Bench Verified
80.4%
SWE-Bench Pro: 60.6%、SWE Multilingual: 78.3%。国産モデルの中でトップ
GPQA Diamond
92.4%
博士レベルの推論能力。Claude Opus 4.6(91.3%)を上回り、GPT-5.5(93.6%)を下回る
入力/出力単価
$2.50 / $7.50 per 1M tokens
キャッシュ入力: $0.25/1M(90%割引)。Claude Opus 4.7価格の約半分
コンテキストウィンドウ
1M tokens
Qwen3.6 Max Previewの256Kから4倍に拡大。最大出力は64K〜66Kトークン
強み
- ・フロンティアモデルの中で最高のコストパフォーマンス比 — 複数のベンチマークでClaude Opus 4.6と同等または上回りながら、出力コストは約3分の1
- ・1Mトークンコンテキストと1,000回以上のツール呼び出しによる35時間自律実行の実績により、卓越した長時間エージェント能力を実現
- ・業界最高レベルの幻覚抑制能力:AA-Omniscienceでの幻覚率は22.9%(フロンティアモデル中最低)。GPQA Diamond(92.4%)とHMMT(97.1%)のスコアも堅調
弱み
- ・テキストのみ対応でビジョン機能が完全に欠如 — 画像理解、UIスクリーンショット、コンピュータ利用エージェントを要するワークフローには一切対応不可
- ・推論モードでの冗長な出力によりベンチマークで約97Mトークンを生成(中央値は26M)。レイテンシ(思考処理に10〜45秒のオーバーヘッド)とタスク単位のAPIコストが大幅に増大
- ・オープンウエイト未公開。プロプライエタリAPI専用のため、以前のQwenリリースと比較してローカルデプロイ、ファインチューニング、オフライン利用が制限される
競合比較
| Model | Arena | SWE | GPQA | Price |
|---|---|---|---|---|
| GPT-5.5 (OpenAI) | ~1,550+ | N/A(公開済み) | 93.6% | $5.00/$30.00 |
| Claude Opus 4.7 (Anthropic) | トップ5 | 64.3%(Pro) | ~91–92% | $5.00/$25.00 |
| Gemini 3.1 Pro Preview (Google) | トップ10 | N/A | N/A | N/A(プレビュー) |
| Gemini 3.5 Flash (Google) | トップ10 | N/A | N/A | $1.50/$9.00 |
| DeepSeek V4 Pro | Qwen3.7-Maxを下回る | N/A | N/A | $1.74/$3.48 |
Qwen3.7-Max-Previewは、2026年5月20〜21日に杭州で開催されたAlibaba Cloud Summitにて発表されたAlibabaのフラッグシップ・プロプライエタリ推論モデルである。汎用チャットアシスタントではなく「エージェント基盤」として位置づけられ、長時間自律コーディング、科学推論、オフィスワークフロー自動化をターゲットとしている。Artificial Analysis Intelligence Indexで56.6ポイント(総合#5位)を記録し、同リーダーボードにおける中国モデル最高スコアとなった。1Mトークンコンテキストウィンドウ(前世代の4倍)、GPQA Diamond 92.4%、SWE-Bench Verified 80.4%を達成し、AlibabaのカスタムZhenwu M890アクセラレータを用いた内部テストでは35時間の自律コーディングランを実証した。
本モデルは市場で独自のポジションを占めている。Claude Opus 4.7やGemini 3.1 Pro Previewに迫る知性を持ちながら、入力トークンは約半額、出力トークンは約3分の1のコストを実現している。積極的なプロンプトキャッシング(キャッシュ入力$0.25/1M、90%割引)により、数百ターンにわたって長いコンテキストを再読み込みするエージェントワークフローに特に魅力的である。OpenAIとAnthropicの両API仕様をネイティブサポートし、Claude Codeなどのツールへのドロップイン統合が可能である。ただし、テキストのみ対応(ビジョンなし)、冗長な推論トレースによるトークンコスト増大、高い棄却率(AA-Omniscienceでの試行率48%)による幻覚率低下と知識検索タスクでの有用性制限という課題がある。
Alibabaの今回のリリースは、トップティアではクローズドウエイト・収益創出モデルへの戦略的シフトを示すものであり、下位ティアではオープンウエイトを維持する方針を発表している(27B denseと35B MoEモデルが発表されたが、リリース日は未定)。Qwen3.6からQwen3.7への1ヶ月サイクルは、開発ペースの加速を示している。エンジニアリングチームにとって、Qwen3.7-Maxはテキスト専用のエージェント・コーディングワークロードにおいて最強のコスト最適化フロンティアオプションであるが、ビジョン機能、絶対的なピーク知性、低レイテンシのチャットが必要なチームは他の選択肢を検討すべきである。
出典
- Alibaba's Latest Proprietary Model, Qwen3.7-Max, Challenges U.S. Rivals — The Batch (DeepLearning.AI)
- Qwen 3.7 Max Preview: Benchmarks, Rankings & Open Weights — Bytepith
- Qwen Introduces Qwen3.7-Max: A Reasoning Agent Model With a 1M-Token Context Window — MarkTechPost
- Qwen3.7-Max Performance Benchmarks: Terminal Bench Leader, SWE Scores & 35-Hour T-Head PPU Run — TheRouter.ai
- Qwen3.7-Max Review 2026: Benchmarks, Pricing, Verdict — FelloAI
- How to Use Qwen3.7-Max: Qwen Chat, Pricing & Benchmarks — 7minAI
- Qwen 3.6 Max (preview) vs Qwen3.7 Max: Benchmarks, Pricing, Speed — BenchLM.ai
- Qwen 3.7 Max Review: The $2.50 Model That's Beating Claude Opus 4.6 at Half the Price — MEFAI
- Qwen3.6 Max Preview vs Qwen3.7 Max: Pricing, Benchmarks & API Compared — OminiGate
- 阿里云千问大模型 Qwen3.7-Max-Preview 首发亮相 Arena AI — IT之家
- Qwen3.7 Official Blog Post — Qwen (Alibaba)
分析生成日: 2026-07-17