本文へ移動
10/7(水) 11:08
あとで読む

AIモデルランキング

さまざまな能力の実際の評価を集め、総合力の高いモデルを探せます。10/4(日) 08:05 更新

総合ランキング

81 モデル · 19 評価 · 8 機関

総合

TOP 30総合の高い順 · 列見出しで並べ替え
列見出しで並べ替えられる、上位 30 モデルのランキング
モデル
1Claude Opus 5.5Anthropicコーディング 不明 · 推論 97.2 · 知識 91.5評価 15/19 · 蓄積中$4.00 / $20.0087.2
2Claude Fable 5.1Anthropicコーディング 92.2 · 推論 95.5 · 知識 不明評価 17/19 · 蓄積中$10.00 / $50.0085.6
3GPT-6 AstraOpenAIコーディング 87.8 · 推論 98.5 · 知識 96.9評価 19/19 · 敏感$10.00 / $50.0085.5
4Claude Fable 5Anthropicコーディング 87.5 · 推論 88.3 · 知識 88.5評価 19/19 · 敏感$10.00 / $50.0085.1
5Gemini 3.7 FlashGoogleコーディング 70.4 · 推論 76.5 · 知識 88.9評価 17/19 · 敏感$0.75 / $3.7581.2
6gpt-6.1-solopenaiコーディング 不明 · 推論 98.7 · 知識 95.4評価 15/19 · 敏感不明 / 不明81.0
7Claude Opus 5Anthropicコーディング 90.1 · 推論 89.5 · 知識 77.2評価 19/19 · 敏感$5.00 / $25.0080.0
8Muse Spark 1.3Metaコーディング 不明 · 推論 79.3 · 知識 不明評価 15/19 · 敏感$1.25 / $4.2577.1
9Gemini 3.8 FlashGoogleコーディング 86.6 · 推論 74.1 · 知識 90.2評価 19/19 · 敏感$0.75 / $3.7576.8
10GPT-5.6 SolOpenAIコーディング 86.7 · 推論 94.2 · 知識 88.9評価 19/19 · 敏感$4.00 / $20.0075.7
11claude-sonnet-5.5anthropicコーディング 不明 · 推論 92.8 · 知識 52.3評価 14/19 · 敏感不明 / 不明73.7
12GPT-5.5OpenAIコーディング 70.0 · 推論 84.4 · 知識 80.6評価 18/19 · 敏感$5.00 / $30.0073.0
13GPT-6 SolOpenAIコーディング 不明 · 推論 87.7 · 知識 79.2評価 15/19 · 敏感$2.00 / $10.0071.8
14Kimi K3Moonshot AIコーディング 76.8 · 推論 62.4 · 知識 60.7評価 18/19 · 敏感$2.98 / $14.9271.2
15Qwen3.8 MaxAlibabaコーディング 59.2 · 推論 71.8 · 知識 48.8評価 17/19 · 敏感$1.79 / $5.3770.7
16Claude Opus 4.7Anthropicコーディング 不明 · 推論 67.9 · 知識 59.0評価 17/19 · 敏感$5.00 / $25.0070.2
17Muse Spark 1.2Metaコーディング 44.9 · 推論 不明 · 知識 不明評価 13/19 · 敏感$1.25 / $4.2568.9
18Claude Opus 4.8Anthropicコーディング 59.3 · 推論 79.4 · 知識 63.6評価 19/19 · 敏感$5.00 / $25.0067.4
19Qwen3.8 Max 0902Alibabaコーディング 不明 · 推論 不明 · 知識 53.8評価 7/19 · 敏感$1.79 / $5.3766.9
20GLM-5.3Z.aiコーディング 82.3 · 推論 55.4 · 知識 39.2評価 18/19 · 敏感$1.40 / $4.4065.7
21Claude Opus 4.6Anthropicコーディング 不明 · 推論 59.2 · 知識 48.6評価 16/19 · 敏感$5.00 / $25.0065.0
22Muse Spark 1.1Metaコーディング 45.3 · 推論 不明 · 知識 不明評価 13/19 · 敏感$1.25 / $4.2561.1
23Gemini 3 Pro PreviewGoogleコーディング 不明 · 推論 不明 · 知識 不明評価 8/19 · 敏感不明 / 不明60.5
24Gemini 3.6 FlashGoogleコーディング 37.5 · 推論 47.7 · 知識 86.3評価 17/19 · 敏感$0.75 / $3.7559.6
25Gemini 3.5 FlashGoogleコーディング 27.7 · 推論 42.4 · 知識 85.2評価 17/19 · 敏感$1.50 / $9.0058.3
26Grok 4.6xAIコーディング 67.8 · 推論 75.5 · 知識 56.9評価 17/19 · 敏感$2.00 / $6.0057.6
27GPT-5.4OpenAIコーディング 39.8 · 推論 不明 · 知識 不明評価 11/19 · 敏感$2.50 / $15.0057.4
28DeepSeek V4.1 FlashDeepSeekコーディング 87.1 · 推論 不明 · 知識 不明評価 11/19 · 敏感$0.30 / $1.2054.6
29GPT-5.6 TerraOpenAIコーディング 77.1 · 推論 87.1 · 知識 43.9評価 19/19 · 敏感$2.00 / $12.0054.2
30DeepSeek V4 Pro 0813DeepSeekコーディング 42.9 · 推論 74.1 · 知識 64.0評価 15/19 · 敏感$1.34 / $4.0352.5

総合は正答率ではなく、複数の評価に共通する証拠から求めた指数です。同点でも証拠の順に並べます。

価格は各社の公式サイトの API 定価、100 万トークンあたり。米ドルで表示しています。公開重みのみで API 定価がないモデルは「不明」。キャッシュ価格は含みません。

評価「12/14」は、14 の公開評価のうち 12 に成績があること。未測は 0 点にせず、空欄のまま指数を出します。

このランキングの読み方

複数の公開評価を合わせた順位です。モデルごとに評価の対象範囲は異なります。価格は順位に影響しません。未測は 0 点になりません。指数は正答率ではありません。

計算方法 →

価格について

各社の公式サイトに掲載の API 定価を、100 万トークンあたりで表示します。円表示は換算日の為替で計算し、キャッシュ書き込み・保存・サブスクリプション料金は含みません。人民元建ての定価は、算出時の為替(10/2(金))で米ドルにそろえています。