本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

SimpleQA Verified

Epoch AI / 知識 · 短い質問での事実の正確さ

公式の評価
Karu News での扱い順位に反映
証拠の予算4%
元データの時刻9/30(水) 07:00
直近の同期10/7(水) 08:05

何を、どう測るか

Epoch が自ら回し直した mean_score だけを使い、固定した推論段階を用います。ECI や Best score の集計列は読み取りません。

この証拠の使い方

正式に採点します。同じ問題ファミリーは固定の予算を共有します。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1gpt-6-astra_maxOpenAI75.6%Max 推論
2gpt-6.1-sol_maxopenai73.9%Max 推論
3gemini-3.1-pro-preview_highGoogle73.5%High 推論
4claude-opus-5-5_maxAnthropic72.2%Max 推論
5claude-fable-5-1_maxAnthropic70.8%Max 推論
6claude-fable-5_xhighAnthropic70.7%xHigh 推論
7gpt-5.6-sol_maxOpenAI69.7%Max 推論
7gemini-3.8-flash_highGoogle69.7%High 推論
9gemini-3.7-flash_highGoogle69.2%High 推論
10gemini-3-flash-preview_highGoogle66.8%High 推論
11gemini-3.5-flash_highGoogle66.2%High 推論
11gemini-3.6-flash_highGoogle66.2%High 推論
13gpt-5.5_xhighOpenAI63.0%xHigh 推論
14gpt-6-sol_maxOpenAI60.7%Max 推論
15muse-spark-1.2_xhighMeta60.3%xHigh 推論
16claude-opus-5_maxAnthropic59.9%Max 推論
17muse-spark-1.1Meta57.8%出典のデフォルト構成
18grok-4.7_xhighxAI56.0%xHigh 推論
19qwen3.7-maxAlibaba55.8%出典のデフォルト構成
20claude-opus-4-8_maxAnthropic53.0%Max 推論
21deepseek-v4-pro-0813_maxDeepSeek52.9%Max 推論
22qwen3.6-max-previewAlibaba52.0%出典のデフォルト構成
23claude-opus-4-7_xhighAnthropic51.7%xHigh 推論
24kimi-k3_maxMoonshot AI50.6%Max 推論
25gpt-5-2025-08-07_highOpenAI50.1%High 推論
26o3-2025-04-16_highOpenAI49.4%High 推論
28grok-4.6_xhighxAI48.9%xHigh 推論
29qwen3-max-2025-09-23Alibaba48.7%出典のデフォルト構成
30grok-4.5_highxAI48.3%High 推論
31gpt-5.1-2025-11-13_highOpenAI48.0%High 推論
評価の限界と、データの帰属

正式に採点します。同じ問題ファミリーは固定の予算を共有します。

データのライセンス:CC BY 4.0 · Epoch AI が自ら評価したデータです。

成績は Epoch AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。