本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

GPQA Diamond

Epoch AI / 知識 · 大学院レベルの物理、化学、生物の知識

公式の評価
Karu News での扱い順位に反映
証拠の予算2%
元データの時刻9/30(水) 07:00
直近の同期10/7(水) 08:05

何を、どう測るか

Epoch が自ら回し直した mean_score だけを使い、推論段階と標準誤差を残します。198 問の科学知識の問題には推論が必要ですが、世界の知識のすべてを代表するものではありません。

この証拠の使い方

正式に採点します。同じ問題ファミリーは固定の予算を共有します。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1gpt-6-astra_maxOpenAI95.8%Max 推論
2claude-sonnet-5-5_maxanthropic95.6%Max 推論
3gpt-6.1-sol_maxopenai95.4%Max 推論
3gemini-3.8-flash_highGoogle95.4%High 推論
5gemini-3.7-flash_highGoogle94.8%High 推論
6gpt-5.4-pro-2026-03-05_xhighOpenAI94.6%xHigh 推論
7gemini-3.1-pro-preview_highGoogle94.4%High 推論
8gpt-6-sol_maxOpenAI94.3%Max 推論
9gemini-3.6-flash_highGoogle94.1%High 推論
14claude-opus-5_maxAnthropic93.9%Max 推論
15gpt-5.6-sol_maxOpenAI93.5%Max 推論
16grok-4.5_highxAI93.4%High 推論
17gpt-5.6-terra_maxOpenAI93.3%Max 推論
18gpt-5.4-2026-03-05_xhighOpenAI93.3%xHigh 推論
19grok-4.6_xhighxAI93.2%xHigh 推論
20kimi-k3_maxMoonshot AI93.1%Max 推論
22gemini-3.5-flash_highGoogle92.8%High 推論
23grok-4.7_xhighxAI92.7%xHigh 推論
24qwen3.8-max_xhighAlibaba92.7%xHigh 推論
25gemini-3-pro-previewGoogle92.6%出典のデフォルト構成
26qwen3.8-max-0902_xhighAlibaba92.3%xHigh 推論
28glm-5.2_maxZ.ai91.9%Max 推論
29deepseek-v4-pro-0813_maxDeepSeek91.7%Max 推論
30gpt-5.6-luna_maxOpenAI91.6%Max 推論
31gpt-5.2-2025-12-11_xhighOpenAI91.4%xHigh 推論
32claude-opus-4-8_maxAnthropic91.0%Max 推論
32deepseek-v4-flash-0731_maxDeepSeek91.0%Max 推論
34MiniMax-M3MiniMax90.9%出典のデフォルト構成
34qwen3.7-maxAlibaba90.9%出典のデフォルト構成
34glm-5.3_maxZ.ai90.9%Max 推論
評価の限界と、データの帰属

正式に採点します。同じ問題ファミリーは固定の予算を共有します。

データのライセンス:CC BY 4.0 · Epoch AI が自ら評価したデータです。

成績は Epoch AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。