本文へ移動
10/7(水) 12:09
あとで読む

AIモデルランキング

数学、論理、初見のルールで、新しい問題を考え抜けるかを見ます。10/4(日) 08:05 更新

推論ランキング

48 モデル · 5 評価 · 2 機関

推論

TOP 30推論の高い順 · 列見出しで並べ替え
列見出しで並べ替えられる、上位 30 モデルのランキング
モデル
1gpt-6.1-solopenaiコーディング 不明 · 推論 98.7 · 知識 95.4評価 5/5 · 敏感不明 / 不明98.7
2GPT-6 AstraOpenAIコーディング 87.8 · 推論 98.5 · 知識 96.9評価 5/5 · 敏感$10.00 / $50.0098.5
3Claude Opus 5.5Anthropicコーディング 不明 · 推論 97.2 · 知識 91.5評価 4/5 · 敏感$4.00 / $20.0097.2
4Claude Fable 5.1Anthropicコーディング 92.2 · 推論 95.5 · 知識 不明評価 5/5 · 敏感$10.00 / $50.0095.5
5GPT-5.6 SolOpenAIコーディング 86.7 · 推論 94.2 · 知識 88.9評価 5/5 · 敏感$4.00 / $20.0094.2
6claude-sonnet-5.5anthropicコーディング 不明 · 推論 92.8 · 知識 52.3評価 4/5 · 敏感不明 / 不明92.8
7Claude Opus 5Anthropicコーディング 90.1 · 推論 89.5 · 知識 77.2評価 5/5 · 敏感$5.00 / $25.0089.5
8Claude Fable 5Anthropicコーディング 87.5 · 推論 88.3 · 知識 88.5評価 5/5 · 敏感$10.00 / $50.0088.3
9GPT-6 SolOpenAIコーディング 不明 · 推論 87.7 · 知識 79.2評価 4/5 · 敏感$2.00 / $10.0087.7
10GPT-5.6 TerraOpenAIコーディング 77.1 · 推論 87.1 · 知識 43.9評価 5/5 · 敏感$2.00 / $12.0087.1
11GPT-5.5OpenAIコーディング 70.0 · 推論 84.4 · 知識 80.6評価 5/5 · 敏感$5.00 / $30.0084.4
12Claude Opus 4.8Anthropicコーディング 59.3 · 推論 79.4 · 知識 63.6評価 5/5 · 敏感$5.00 / $25.0079.4
13Muse Spark 1.3Metaコーディング 不明 · 推論 79.3 · 知識 不明評価 5/5 · 敏感$1.25 / $4.2579.3
14Gemini 3.7 FlashGoogleコーディング 70.4 · 推論 76.5 · 知識 88.9評価 5/5 · 敏感$0.75 / $3.7576.5
15Grok 4.6xAIコーディング 67.8 · 推論 75.5 · 知識 56.9評価 5/5 · 敏感$2.00 / $6.0075.5
16DeepSeek V4 Pro 0813DeepSeekコーディング 42.9 · 推論 74.1 · 知識 64.0評価 5/5 · 敏感$1.34 / $4.0374.1
17Gemini 3.8 FlashGoogleコーディング 86.6 · 推論 74.1 · 知識 90.2評価 5/5 · 敏感$0.75 / $3.7574.1
18GPT-5.6 LunaOpenAIコーディング 58.5 · 推論 72.3 · 知識 39.9評価 5/5 · 敏感$0.20 / $1.2072.3
19Qwen3.8 MaxAlibabaコーディング 59.2 · 推論 71.8 · 知識 48.8評価 5/5 · 敏感$1.79 / $5.3771.8
20Claude Sonnet 5Anthropicコーディング 55.8 · 推論 70.8 · 知識 16.4評価 5/5 · 敏感$2.00 / $10.0070.8
21Claude Opus 4.7Anthropicコーディング 不明 · 推論 67.9 · 知識 59.0評価 5/5 · 敏感$5.00 / $25.0067.9
22GPT-5.2 2025-12-11OpenAIコーディング 不明 · 推論 63.9 · 知識 29.8評価 5/5 · 敏感$1.75 / $14.0063.9
23Kimi K3Moonshot AIコーディング 76.8 · 推論 62.4 · 知識 60.7評価 5/5 · 敏感$2.98 / $14.9262.4
24Grok 4.7xAIコーディング 不明 · 推論 62.2 · 知識 70.7評価 5/5 · 敏感$2.00 / $6.0062.2
25Grok 4.5xAIコーディング 40.9 · 推論 61.0 · 知識 55.7評価 4/5 · 敏感$2.00 / $6.0061.0
26Claude Opus 4.6Anthropicコーディング 不明 · 推論 59.2 · 知識 48.6評価 5/5 · 敏感$5.00 / $25.0059.2
27Gemini 3.1 Pro PreviewGoogleコーディング 14.6 · 推論 57.1 · 知識 94.6評価 5/5 · 敏感$2.00 / $12.0057.1
28GLM-5.3Z.aiコーディング 82.3 · 推論 55.4 · 知識 39.2評価 5/5 · 敏感$1.40 / $4.4055.4
29DeepSeek V4 Flash 0731DeepSeekコーディング 18.2 · 推論 50.1 · 知識 21.5評価 5/5 · 敏感$0.45 / $1.3450.1
30Gemini 3.6 FlashGoogleコーディング 37.5 · 推論 47.7 · 知識 86.3評価 5/5 · 敏感$0.75 / $3.7547.7

総合は正答率ではなく、複数の評価に共通する証拠から求めた指数です。同点でも証拠の順に並べます。

価格は各社の公式サイトの API 定価、100 万トークンあたり。米ドルで表示しています。公開重みのみで API 定価がないモデルは「不明」。キャッシュ価格は含みません。

評価「12/14」は、14 の公開評価のうち 12 に成績があること。未測は 0 点にせず、空欄のまま指数を出します。

このランキングの読み方

複数の公開評価を合わせた順位です。モデルごとに評価の対象範囲は異なります。価格は順位に影響しません。未測は 0 点になりません。指数は正答率ではありません。

計算方法 →

価格について

各社の公式サイトに掲載の API 定価を、100 万トークンあたりで表示します。円表示は換算日の為替で計算し、キャッシュ書き込み・保存・サブスクリプション料金は含みません。人民元建ての定価は、算出時の為替(10/2(金))で米ドルにそろえています。