本文へ移動
10/7(水) 12:09
あとで読む

AIモデルランキング

事実についての質問と大学院レベルの科学知識で、知識と回答の正確さを見ます。10/4(日) 08:05 更新

知識ランキング

68 モデル · 2 評価 · 1 機関

知識

TOP 30知識の高い順 · 列見出しで並べ替え
列見出しで並べ替えられる、上位 30 モデルのランキング
モデル
1GPT-6 AstraOpenAIコーディング 87.8 · 推論 98.5 · 知識 96.9評価 2/2 · 敏感$10.00 / $50.0096.9
2gpt-6.1-solopenaiコーディング 不明 · 推論 98.7 · 知識 95.4評価 2/2 · 敏感不明 / 不明95.4
3Gemini 3.1 Pro PreviewGoogleコーディング 14.6 · 推論 57.1 · 知識 94.6評価 2/2 · 敏感$2.00 / $12.0094.6
4Claude Opus 5.5Anthropicコーディング 不明 · 推論 97.2 · 知識 91.5評価 2/2 · 敏感$4.00 / $20.0091.5
5Gemini 3.8 FlashGoogleコーディング 86.6 · 推論 74.1 · 知識 90.2評価 2/2 · 敏感$0.75 / $3.7590.2
6Gemini 3.7 FlashGoogleコーディング 70.4 · 推論 76.5 · 知識 88.9評価 2/2 · 敏感$0.75 / $3.7588.9
7GPT-5.6 SolOpenAIコーディング 86.7 · 推論 94.2 · 知識 88.9評価 2/2 · 敏感$4.00 / $20.0088.9
8Claude Fable 5Anthropicコーディング 87.5 · 推論 88.3 · 知識 88.5評価 2/2 · 敏感$10.00 / $50.0088.5
9Gemini 3.6 FlashGoogleコーディング 37.5 · 推論 47.7 · 知識 86.3評価 2/2 · 敏感$0.75 / $3.7586.3
10Gemini 3.5 FlashGoogleコーディング 27.7 · 推論 42.4 · 知識 85.2評価 2/2 · 敏感$1.50 / $9.0085.2
11Gemini 3 Flash PreviewGoogleコーディング 不明 · 推論 不明 · 知識 84.4評価 2/2 · 敏感$0.50 / $3.0084.4
12GPT-5.5OpenAIコーディング 70.0 · 推論 84.4 · 知識 80.6評価 2/2 · 敏感$5.00 / $30.0080.6
13GPT-6 SolOpenAIコーディング 不明 · 推論 87.7 · 知識 79.2評価 2/2 · 敏感$2.00 / $10.0079.2
14Claude Opus 5Anthropicコーディング 90.1 · 推論 89.5 · 知識 77.2評価 2/2 · 敏感$5.00 / $25.0077.2
15Grok 4.7xAIコーディング 不明 · 推論 62.2 · 知識 70.7評価 2/2 · 敏感$2.00 / $6.0070.7
16Qwen3.7 MaxAlibabaコーディング 不明 · 推論 38.5 · 知識 68.6評価 2/2 · 敏感$1.79 / $5.3768.6
17DeepSeek V4 Pro 0813DeepSeekコーディング 42.9 · 推論 74.1 · 知識 64.0評価 2/2 · 敏感$1.34 / $4.0364.0
18Claude Opus 4.8Anthropicコーディング 59.3 · 推論 79.4 · 知識 63.6評価 2/2 · 敏感$5.00 / $25.0063.6
19Kimi K3Moonshot AIコーディング 76.8 · 推論 62.4 · 知識 60.7評価 2/2 · 敏感$2.98 / $14.9260.7
20Qwen3.6 Max PreviewAlibabaコーディング 不明 · 推論 不明 · 知識 60.6評価 2/2 · 敏感$1.34 / $8.0560.6
21Claude Opus 4.7Anthropicコーディング 不明 · 推論 67.9 · 知識 59.0評価 2/2 · 敏感$5.00 / $25.0059.0
22Grok 4.6xAIコーディング 67.8 · 推論 75.5 · 知識 56.9評価 2/2 · 敏感$2.00 / $6.0056.9
23GPT-5 2025-08-07OpenAIコーディング 不明 · 推論 不明 · 知識 56.2評価 2/2 · 敏感$1.25 / $10.0056.2
24Grok 4.5xAIコーディング 40.9 · 推論 61.0 · 知識 55.7評価 2/2 · 敏感$2.00 / $6.0055.7
25o3 2025-04-16OpenAIコーディング 不明 · 推論 不明 · 知識 54.8評価 2/2 · 敏感$2.00 / $8.0054.8
26Qwen3.8 Max 0902Alibabaコーディング 不明 · 推論 不明 · 知識 53.8評価 2/2 · 敏感$1.79 / $5.3753.8
27GPT-5.1 2025-11-13OpenAIコーディング 不明 · 推論 不明 · 知識 53.2評価 2/2 · 敏感$1.25 / $10.0053.2
28Qwen3 Max 2025-09-23Alibabaコーディング 不明 · 推論 不明 · 知識 52.5評価 2/2 · 敏感$0.89 / $3.5852.5
29claude-sonnet-5.5anthropicコーディング 不明 · 推論 92.8 · 知識 52.3評価 2/2 · 敏感不明 / 不明52.3
30GPT-5.4 Pro 2026-03-05OpenAIコーディング 不明 · 推論 不明 · 知識 50.5評価 2/2 · 敏感$30.00 / $180.0050.5

総合は正答率ではなく、複数の評価に共通する証拠から求めた指数です。同点でも証拠の順に並べます。

価格は各社の公式サイトの API 定価、100 万トークンあたり。米ドルで表示しています。公開重みのみで API 定価がないモデルは「不明」。キャッシュ価格は含みません。

評価「12/14」は、14 の公開評価のうち 12 に成績があること。未測は 0 点にせず、空欄のまま指数を出します。

このランキングの読み方

現在の知識ランキングは、同じ機関の Epoch による 2 つの評価を使っています。価格は順位に影響しません。未測は 0 点になりません。指数は正答率ではありません。

計算方法 →

価格について

各社の公式サイトに掲載の API 定価を、100 万トークンあたりで表示します。円表示は換算日の為替で計算し、キャッシュ書き込み・保存・サブスクリプション料金は含みません。人民元建ての定価は、算出時の為替(10/2(金))で米ドルにそろえています。