Moonshot AIオープンソース

Kimi K2.6

このモデルを比較

Moonshot AI開発の最新高性能モデル。K2.5の改良版で更高的性能を実現。

シェア:XはてブLINE

パラメータ

1

コンテキスト長

256K

ライセンス

https://huggingface.co/moonshotai/Kimi-K2-Base/raw/main/LICENSE

リリース日

2026-04-20

日本語性能

🌐多言語対応

一般的な多言語対応モデル。基本的な日本語処理は可能だが、特化モデルには劣る。

API料金

入力料金(1Mトークンあたり)

$0.95

出力料金(1Mトークンあたり)

$

課金モード: standard

強み

    弱み

      活用例

        深度分析

        Arena Elo

        1462

        Coding sub-arena 1514; BenchLM #24全体、#11検証済

        SWE-Bench Pro

        58.6%

        #1 — GPT-5.4(57.7%)とClaude Opus 4.6(53.4%)を上回る

        SWE-Bench Verified

        80.2%

        Claude 80.8%・Gemini 80.6%と実質互角

        DeepSearchQA (F1)

        92.5%

        Claude 91.3%・GPT-5.4 78.6%をリード

        入力価格(公式API)

        $0.60/100万

        Claude Opus 4.6の$5の約8倍安

        アーキテクチャ

        1T params (32B active)

        MoE、256K文脈、オープンウェイト(Modified MIT)

        強み

        • 最高クラスのオープンウェイト・コーディングモデル。入力$0.60/100万でSWE-Bench Pro全フロンティアをリード
        • 卓越したエージェント・長時間実行。300のサブエージェント群、13時間自律コーディング実演、最強のDeepSearchQAとHLE-tools
        • 完全オープンソース(Modified MIT)、MoonViT経由でネイティブ動画/画像入力、8×H100+INT4で展開可能

        弱み

        • 純推論でGPT-5.4・Gemini 3.1 Proに劣る(HLE no-tools 34.7%対44.4%、AIME 96.4%対99.2%)
        • エコシステムと文書が中国発信優先。英語圏企業向けサポート・コンプライアンスはOpenAI/Anthropicより未成熟
        • 冗長な出力(知能指数評価で約1.6億トークン、中央値の4倍)が本番コストを膨らませ解析崩れを起こす場合も

        競合比較

        ModelGPQAPrice
        GPT-5.4 (xhigh)92.8%~$5/~$15
        Claude Opus 4.6 (max effort)91.3%$5/$25
        Gemini 3.1 Pro (thinking high)94.3%N/A

        Kimi K2.6は2026年4月20日、Moonshot AIが公開した中核的オープンウェイトのコーディング・エージェントモデル。1兆パラメータのMoEでトークンあたり32Bのみを活性化し、密集32B相当の推論コストでフロンティア級性能を出す。実世界のソフトウェア工学を最も表すSWE-Bench Pro(58.6%)でGPT-5.4やClaude Opus 4.6を含む全比較モデルをリードし、Moonshot公式APIでClaude Opus 4.6の約8倍安い($0.60対$5/100万入力)。設計哲学は純推論の天井より実践的・長時間実行に置く。Agent Swarmで並列300サブエージェントまで水平スケールし、実稼働で数日間の自律運用を実証、Zig等のニッチ言語含むプログラミング言語で強い汎化。ツール使用と多段検索を要するエージェントベンチ(HLE tools 54.0%、DeepSearchQA 92.5%)で全独占モデルを上回る。256K文脈、MoonViT経由のネイティブマルチモーダル入力、Modified MITの完全オープンソースでインフラ統制を必要とするチームに独自の地位。トレードオフは明確: 純推論なし(GPQA 90.5%対Gemini 94.3%、AIME 96.4%対99.2%、HLE no-tools 34.7%対44.4%)で独占モデルが意味のあるリードを保つ。実稼働AI構築には多モデルスタックの実行エンジンとして理解すべき。

        分析生成日: 2026-09-05