ランキング一覧に戻る

推論能力ランキング

HLE、ARC-AGI-2、GPQA Diamond による推論・思考能力評価。

960 件のモデル

#モデル名開発元オープンソース
1Claude Mythos PreviewAnthropic64.794.6クローズド
2Muse Spark 1.1Meta AI62.1クローズド
3Claude Fable 5Anthropic59.0クローズド
4GPT-5.4 ProOpenAI58.783.394.4クローズド
5Muse SparkMeta AI58.042.589.5クローズド
6Claude Opus 4.8Anthropic57.993.6クローズド
7Claude Sonnet 5Anthropic57.4クローズド
8GPT-5.5 ProOpenAI57.284.6クローズド
9Kimi K3Moonshot AI56.093.5クローズド
10GLM-5.2Zhipu AI54.791.2クローズド
11Opus 4.7Anthropic54.775.894.2クローズド
12Kimi K2.6Moonshot AI54.090.5クローズド
13Qwen3.7-Max-Previewアリババ53.592.4クローズド
14Hy3テンセントAI研究所53.290.4クローズド
15Claude Opus 4.6Anthropic53.066.391.3クローズド
16GLM 5.1Zhipu AI52.3クローズド
17GPT-5.5OpenAI52.285.093.6クローズド
18GPT-5.4OpenAI52.177.192.8クローズド
19Gemini 3.1 Pro PreviewGoogle DeepMind51.477.194.3クローズド
20Kimi K2 ThinkingMoonshot AI51.0クローズド
21Qwen 3.6 Plus Previewアリババ50.690.4クローズド
22GLM-5Zhipu AI50.44.9クローズド
23Kimi K2.5Moonshot AI50.211.8クローズド
24Qwen3.6-Max-Previewアリババ50.290.4クローズド
25GPT-5.2 ProOpenAI50.054.293.2クローズド
26Qwen3-Max-Thinkingアリババ49.8クローズド
27Claude Sonnet 4.6Anthropic49.058.389.9クローズド
28Qwen3.5-27Bアリババ48.5クローズド
29Gemini 3 Deep Think - 2620Google DeepMind48.484.6クローズド
30Qwen3.5-397B-A17Bアリババ48.388.4クローズド

ベンチマークについて

HLE
総合知能テスト — 人間レベルの推論能力を測定
ARC-AGI-2
抽象的推論ベンチマーク — 新規パターンの汎化能力を測定
GPQA Diamond
Graduate-Level Google-Proof Q&A — 大学院レベルの科学的推論能力を測定