アリババプロプライエタリ

Qwen3.7-Max-Preview

このモデルを比較

アリババ開発の最新エージェント特化モデル。高度なエージェントワークフローと推論能力を実現。

シェア:XはてブLINE

パラメータ

非公開

コンテキスト長

ライセンス

プロプライエタリ

リリース日

2026-05-20

日本語性能

高品質日本語

多言語対応モデルのうち、日本語処理に優れた性能を持つモデル。

API料金

入力料金(1Mトークンあたり)

$2.5

出力料金(1Mトークンあたり)

$

課金モード: standard

強み

    弱み

      活用例

        深度分析

        Artificial Analysis Intelligence Index

        56.6

        218+ランクモデル中総合#5位、中国モデルとして最高スコア。Qwen3.6 Max Previewに対し+4.8ポイント

        Arena AI Elo

        ~1,489 (#14 overall)

        数学#7位、エキスパートプロンプト#9位、ソフトウェア&IT #9位。WebDev Arenaでは1,541 Eloで#4位

        SWE-Bench Verified

        80.4%

        SWE-Bench Pro: 60.6%、SWE Multilingual: 78.3%。国産モデルの中でトップ

        GPQA Diamond

        92.4%

        博士レベルの推論能力。Claude Opus 4.6(91.3%)を上回り、GPT-5.5(93.6%)を下回る

        入力/出力単価

        $2.50 / $7.50 per 1M tokens

        キャッシュ入力: $0.25/1M(90%割引)。Claude Opus 4.7価格の約半分

        コンテキストウィンドウ

        1M tokens

        Qwen3.6 Max Previewの256Kから4倍に拡大。最大出力は64K〜66Kトークン

        強み

        • フロンティアモデルの中で最高のコストパフォーマンス比 — 複数のベンチマークでClaude Opus 4.6と同等または上回りながら、出力コストは約3分の1
        • 1Mトークンコンテキストと1,000回以上のツール呼び出しによる35時間自律実行の実績により、卓越した長時間エージェント能力を実現
        • 業界最高レベルの幻覚抑制能力:AA-Omniscienceでの幻覚率は22.9%(フロンティアモデル中最低)。GPQA Diamond(92.4%)とHMMT(97.1%)のスコアも堅調

        弱み

        • テキストのみ対応でビジョン機能が完全に欠如 — 画像理解、UIスクリーンショット、コンピュータ利用エージェントを要するワークフローには一切対応不可
        • 推論モードでの冗長な出力によりベンチマークで約97Mトークンを生成(中央値は26M)。レイテンシ(思考処理に10〜45秒のオーバーヘッド)とタスク単位のAPIコストが大幅に増大
        • オープンウエイト未公開。プロプライエタリAPI専用のため、以前のQwenリリースと比較してローカルデプロイ、ファインチューニング、オフライン利用が制限される

        競合比較

        ModelArenaSWEGPQAPrice
        GPT-5.5 (OpenAI)~1,550+N/A(公開済み)93.6%$5.00/$30.00
        Claude Opus 4.7 (Anthropic)トップ564.3%(Pro)~91–92%$5.00/$25.00
        Gemini 3.1 Pro Preview (Google)トップ10N/AN/AN/A(プレビュー)
        Gemini 3.5 Flash (Google)トップ10N/AN/A$1.50/$9.00
        DeepSeek V4 ProQwen3.7-Maxを下回るN/AN/A$1.74/$3.48

        Qwen3.7-Max-Previewは、2026年5月20〜21日に杭州で開催されたAlibaba Cloud Summitにて発表されたAlibabaのフラッグシップ・プロプライエタリ推論モデルである。汎用チャットアシスタントではなく「エージェント基盤」として位置づけられ、長時間自律コーディング、科学推論、オフィスワークフロー自動化をターゲットとしている。Artificial Analysis Intelligence Indexで56.6ポイント(総合#5位)を記録し、同リーダーボードにおける中国モデル最高スコアとなった。1Mトークンコンテキストウィンドウ(前世代の4倍)、GPQA Diamond 92.4%、SWE-Bench Verified 80.4%を達成し、AlibabaのカスタムZhenwu M890アクセラレータを用いた内部テストでは35時間の自律コーディングランを実証した。

        本モデルは市場で独自のポジションを占めている。Claude Opus 4.7Gemini 3.1 Pro Previewに迫る知性を持ちながら、入力トークンは約半額、出力トークンは約3分の1のコストを実現している。積極的なプロンプトキャッシング(キャッシュ入力$0.25/1M、90%割引)により、数百ターンにわたって長いコンテキストを再読み込みするエージェントワークフローに特に魅力的である。OpenAIとAnthropicの両API仕様をネイティブサポートし、Claude Codeなどのツールへのドロップイン統合が可能である。ただし、テキストのみ対応(ビジョンなし)、冗長な推論トレースによるトークンコスト増大、高い棄却率(AA-Omniscienceでの試行率48%)による幻覚率低下と知識検索タスクでの有用性制限という課題がある。

        Alibabaの今回のリリースは、トップティアではクローズドウエイト・収益創出モデルへの戦略的シフトを示すものであり、下位ティアではオープンウエイトを維持する方針を発表している(27B denseと35B MoEモデルが発表されたが、リリース日は未定)。Qwen3.6からQwen3.7への1ヶ月サイクルは、開発ペースの加速を示している。エンジニアリングチームにとって、Qwen3.7-Maxはテキスト専用のエージェント・コーディングワークロードにおいて最強のコスト最適化フロンティアオプションであるが、ビジョン機能、絶対的なピーク知性、低レイテンシのチャットが必要なチームは他の選択肢を検討すべきである。

        分析生成日: 2026-07-17