ランキング一覧に戻る

コーディング能力ランキング

SWE-bench Verified、LiveCodeBench、SWE-bench Pro、Aider-Polyglot によるプログラミング能力評価。

960 件のモデル

#モデル名開発元オープンソース
1Claude Fable 5Anthropic95.080.0クローズド
2Claude Mythos PreviewAnthropic93.977.882.0クローズド
3Claude Opus 4.8Anthropic88.669.2クローズド
4Opus 4.7Anthropic87.664.369.4クローズド
5Claude Sonnet 5Anthropic85.263.2クローズド
6Claude Sonnet 4.5Anthropic82.059.043.6クローズド
7Opus 4.5Anthropic80.987.059.3クローズド
8Gemini 3.1 Pro PreviewGoogle DeepMind80.691.754.268.5クローズド
9DeepSeek-V4-ProDeepSeek80.693.567.9クローズド
10Qwen3.7-Max-Previewアリババ80.491.660.669.7クローズド
11Kimi K2.6Moonshot AI80.289.658.666.7クローズド
12Claude Sonnet 4Anthropic80.247.142.7クローズド
13GPT-5.2OpenAI80.089.455.6クローズド
14Claude Sonnet 4.6Anthropic79.659.1クローズド
15DeepSeek-V4-FlashDeepSeek79.091.656.6クローズド
16Qwen 3.6 Plus Previewアリババ78.887.156.661.6クローズド
17Qwen3.6-Max-Previewアリババ78.887.165.4クローズド
18Hy3テンセントAI研究所78.057.9クローズド
19InklingThinking Machines Lab77.654.3クローズド
20Muse SparkMeta AI77.452.459.0クローズド
21Qwen3.6-27Bアリババ77.283.953.559.3クローズド
22GPT-5.1-Codex-MaxOpenAI76.8クローズド
23Claude 4.5 Opus (high reasoning)76.8クローズド
24Doubao Seed 2.0 Pro字节跳动Seed团队76.546.955.8クローズド
25Qwen3.5-397B-A17Bアリババ76.483.650.952.5クローズド
26GPT-5.1OpenAI76.386.850.847.6クローズド
27Gemini 3.0 Pro (Preview 11-2025)Google DeepMind76.292.054.2クローズド
28MiniMax M2.5MiniMax75.855.451.7クローズド
29Gemini 3 Flash (high reasoning)75.8クローズド
30Claude Opus 4.6Anthropic75.676.065.4クローズド

ベンチマークについて

SWE-bench Verified
実践的ソフトウェア開発タスク — 実際のバグ修正能力を測定
LiveCodeBench
リアルタイムコーディングベンチマーク — 最新のプログラミング問題への対応能力を測定
SWE-bench Pro
プロフェッショナルSWEベンチマーク — より複雑なソフトウェア開発タスクを測定
Aider-Polyglot
多言語コーディングアシスタントベンチマーク — 複数プログラミング言語のコーディング能力を測定