本文へ移動
10/7(水) 12:09
あとで読む

AIモデルランキング

コードを書くことからリポジトリの修正まで、ソフトウェアを作り切れるかを見ます。10/4(日) 08:05 更新

コーディングランキング

34 モデル · 3 評価 · 3 機関

コーディング

TOP 30コーディングの高い順 · 列見出しで並べ替え
列見出しで並べ替えられる、上位 30 モデルのランキング
モデル
1Claude Fable 5.1Anthropicコーディング 92.2 · 推論 95.5 · 知識 不明評価 2/3 · 敏感$10.00 / $50.0092.2
2Claude Opus 5Anthropicコーディング 90.1 · 推論 89.5 · 知識 77.2評価 3/3 · 充分$5.00 / $25.0090.1
3GPT-6 AstraOpenAIコーディング 87.8 · 推論 98.5 · 知識 96.9評価 3/3 · 敏感$10.00 / $50.0087.8
4Claude Fable 5Anthropicコーディング 87.5 · 推論 88.3 · 知識 88.5評価 3/3 · 敏感$10.00 / $50.0087.5
5DeepSeek V4.1 FlashDeepSeekコーディング 87.1 · 推論 不明 · 知識 不明評価 2/3 · 敏感$0.30 / $1.2087.1
6GPT-5.6 SolOpenAIコーディング 86.7 · 推論 94.2 · 知識 88.9評価 3/3 · 敏感$4.00 / $20.0086.7
7Gemini 3.8 FlashGoogleコーディング 86.6 · 推論 74.1 · 知識 90.2評価 3/3 · 敏感$0.75 / $3.7586.6
8GLM-5.3Z.aiコーディング 82.3 · 推論 55.4 · 知識 39.2評価 3/3 · 充分$1.40 / $4.4082.3
9GPT-5.6 TerraOpenAIコーディング 77.1 · 推論 87.1 · 知識 43.9評価 3/3 · 敏感$2.00 / $12.0077.1
10Kimi K3Moonshot AIコーディング 76.8 · 推論 62.4 · 知識 60.7評価 3/3 · 敏感$2.98 / $14.9276.8
11Gemini 3.7 FlashGoogleコーディング 70.4 · 推論 76.5 · 知識 88.9評価 2/3 · 敏感$0.75 / $3.7570.4
12GPT-5.5OpenAIコーディング 70.0 · 推論 84.4 · 知識 80.6評価 2/3 · 敏感$5.00 / $30.0070.0
13Grok 4.6xAIコーディング 67.8 · 推論 75.5 · 知識 56.9評価 3/3 · 敏感$2.00 / $6.0067.8
14GLM-5.3 FlashZ.aiコーディング 63.2 · 推論 20.1 · 知識 不明評価 3/3 · 敏感$0.12 / $0.4263.2
15Claude Opus 4.8Anthropicコーディング 59.3 · 推論 79.4 · 知識 63.6評価 3/3 · 敏感$5.00 / $25.0059.3
16Qwen3.8 MaxAlibabaコーディング 59.2 · 推論 71.8 · 知識 48.8評価 3/3 · 敏感$1.79 / $5.3759.2
17GPT-5.6 LunaOpenAIコーディング 58.5 · 推論 72.3 · 知識 39.9評価 3/3 · 敏感$0.20 / $1.2058.5
18Claude Sonnet 5Anthropicコーディング 55.8 · 推論 70.8 · 知識 16.4評価 3/3 · 敏感$2.00 / $10.0055.8
19Qwen3.8 27 BAlibabaコーディング 49.1 · 推論 不明 · 知識 不明評価 2/3 · 敏感$0.45 / $1.7949.1
20Muse Spark 1.1Metaコーディング 45.3 · 推論 不明 · 知識 不明評価 2/3 · 敏感$1.25 / $4.2545.3
21Muse Spark 1.2Metaコーディング 44.9 · 推論 不明 · 知識 不明評価 2/3 · 敏感$1.25 / $4.2544.9
22DeepSeek V4 Pro 0813DeepSeekコーディング 42.9 · 推論 74.1 · 知識 64.0評価 2/3 · 敏感$1.34 / $4.0342.9
23DeepSeek V4 Pro PreviewDeepSeekコーディング 42.7 · 推論 38.1 · 知識 48.8評価 2/3 · 敏感$0.43 / $0.8742.7
24Grok 4.5xAIコーディング 40.9 · 推論 61.0 · 知識 55.7評価 3/3 · 敏感$2.00 / $6.0040.9
25GPT-5.4OpenAIコーディング 39.8 · 推論 不明 · 知識 不明評価 2/3 · 敏感$2.50 / $15.0039.8
26DeepSeek V4 Flash PreviewDeepSeekコーディング 39.3 · 推論 不明 · 知識 不明評価 2/3 · 敏感$0.14 / $0.2839.3
27Gemini 3.6 FlashGoogleコーディング 37.5 · 推論 47.7 · 知識 86.3評価 2/3 · 敏感$0.75 / $3.7537.5
28GLM-5.2Z.aiコーディング 36.5 · 推論 34.0 · 知識 23.8評価 2/3 · 敏感$1.19 / $4.1836.5
29Gemini 3.5 FlashGoogleコーディング 27.7 · 推論 42.4 · 知識 85.2評価 2/3 · 敏感$1.50 / $9.0027.7
30Claude Sonnet 4.6Anthropicコーディング 20.3 · 推論 34.5 · 知識 14.0評価 2/3 · 敏感$3.00 / $15.0020.3

総合は正答率ではなく、複数の評価に共通する証拠から求めた指数です。同点でも証拠の順に並べます。

価格は各社の公式サイトの API 定価、100 万トークンあたり。米ドルで表示しています。公開重みのみで API 定価がないモデルは「不明」。キャッシュ価格は含みません。

評価「12/14」は、14 の公開評価のうち 12 に成績があること。未測は 0 点にせず、空欄のまま指数を出します。

このランキングの読み方

複数の公開評価を合わせた順位です。モデルごとに評価の対象範囲は異なります。価格は順位に影響しません。未測は 0 点になりません。指数は正答率ではありません。

計算方法 →

価格について

各社の公式サイトに掲載の API 定価を、100 万トークンあたりで表示します。円表示は換算日の為替で計算し、キャッシュ書き込み・保存・サブスクリプション料金は含みません。人民元建ての定価は、算出時の為替(10/2(金))で米ドルにそろえています。