ランキング一覧に戻る

汎用性能ランキング

MMLU-Pro、LMArena Elo による総合的な性能評価。

960 件のモデル

#モデル名開発元オープンソース
1OpenAI o1OpenAI91.0クローズド
2Gemini 3.0 Pro (Preview 11-2025)Google DeepMind90.0クローズド
3Opus 4.5Anthropic90.0クローズド
4Qwen3.7-Max-Previewアリババ89.6クローズド
5Qwen 3.6 Plus Previewアリババ88.5クローズド
6Qwen3.6-Max-Previewアリババ88.5クローズド
7Claude Sonnet 4.5Anthropic88.0クローズド
8M2.1MiniMax88.0クローズド
9Opus 4.1Anthropic88.0クローズド
10Qwen3.5-397B-A17Bアリババ87.8クローズド
11Hunyuan-T1テンセントAI研究所87.2クローズド
12DeepSeek-V4-ProDeepSeek87.1クローズド
13Grok 4xAI87.0クローズド
14Doubao Seed 2.0 Pro字节跳动Seed团队87.0クローズド
15DeepSeek-V4-FlashDeepSeek86.2クローズド
16Qwen3.6-27Bアリババ86.2クローズド
17Qwen3.5-27Bアリババ86.1クローズド
18GPT-4.5OpenAI86.1クローズド
19Gemini 2.5-ProGoogle DeepMind86.0クローズド
20Qwen3-Max-Thinkingアリババ85.7クローズド
21OpenAI o3OpenAI85.6クローズド
22Gemma 4 31BGoogle DeepMind85.2クローズド
23Qwen3.6-35B-A3Bアリババ85.2クローズド
24DeepSeek-V3.1 TerminusDeepSeek85.0クローズド
25DeepSeek V3.2-ExpDeepSeek85.0クローズド
26DeepSeek-R1-0528DeepSeek85.0クローズド
27DeepSeek-V3.1DeepSeek85.0クローズド
28Claude Opus 4Anthropic85.0クローズド
29Claude Mythos PreviewAnthropicクローズド
30Muse Spark 1.1Meta AIクローズド

ベンチマークについて

MMLU-Pro
Massive Multitask Language Understanding Pro — 幅広い知識分野の理解能力を測定
LMArena Elo
LMArena(旧Chatbot Arena)のEloレーティング — ユーザー匿名盲テストによる総合評価