評価のソース公式の評価
GPQA Diamond
Epoch AI / 知識 · 大学院レベルの物理、化学、生物の知識
Karu News での扱い順位に反映
証拠の予算2%
元データの時刻9/30(水) 07:00
直近の同期10/7(水) 08:05
何を、どう測るか
Epoch が自ら回し直した mean_score だけを使い、推論段階と標準誤差を残します。198 問の科学知識の問題には推論が必要ですが、世界の知識のすべてを代表するものではありません。
この証拠の使い方
正式に採点します。同じ問題ファミリーは固定の予算を共有します。
評価の成績
固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。
| 元の順位 | 元の型番 | 元の成績 | 代表の設定 |
|---|---|---|---|
| 1 | gpt-6-astra_maxOpenAI | 95.8% | Max 推論 |
| 2 | claude-sonnet-5-5_maxanthropic | 95.6% | Max 推論 |
| 3 | gpt-6.1-sol_maxopenai | 95.4% | Max 推論 |
| 3 | gemini-3.8-flash_highGoogle | 95.4% | High 推論 |
| 5 | gemini-3.7-flash_highGoogle | 94.8% | High 推論 |
| 6 | gpt-5.4-pro-2026-03-05_xhighOpenAI | 94.6% | xHigh 推論 |
| 7 | gemini-3.1-pro-preview_highGoogle | 94.4% | High 推論 |
| 8 | gpt-6-sol_maxOpenAI | 94.3% | Max 推論 |
| 9 | gemini-3.6-flash_highGoogle | 94.1% | High 推論 |
| 14 | claude-opus-5_maxAnthropic | 93.9% | Max 推論 |
| 15 | gpt-5.6-sol_maxOpenAI | 93.5% | Max 推論 |
| 16 | grok-4.5_highxAI | 93.4% | High 推論 |
| 17 | gpt-5.6-terra_maxOpenAI | 93.3% | Max 推論 |
| 18 | gpt-5.4-2026-03-05_xhighOpenAI | 93.3% | xHigh 推論 |
| 19 | grok-4.6_xhighxAI | 93.2% | xHigh 推論 |
| 20 | kimi-k3_maxMoonshot AI | 93.1% | Max 推論 |
| 22 | gemini-3.5-flash_highGoogle | 92.8% | High 推論 |
| 23 | grok-4.7_xhighxAI | 92.7% | xHigh 推論 |
| 24 | qwen3.8-max_xhighAlibaba | 92.7% | xHigh 推論 |
| 25 | gemini-3-pro-previewGoogle | 92.6% | 出典のデフォルト構成 |
| 26 | qwen3.8-max-0902_xhighAlibaba | 92.3% | xHigh 推論 |
| 28 | glm-5.2_maxZ.ai | 91.9% | Max 推論 |
| 29 | deepseek-v4-pro-0813_maxDeepSeek | 91.7% | Max 推論 |
| 30 | gpt-5.6-luna_maxOpenAI | 91.6% | Max 推論 |
| 31 | gpt-5.2-2025-12-11_xhighOpenAI | 91.4% | xHigh 推論 |
| 32 | claude-opus-4-8_maxAnthropic | 91.0% | Max 推論 |
| 32 | deepseek-v4-flash-0731_maxDeepSeek | 91.0% | Max 推論 |
| 34 | MiniMax-M3MiniMax | 90.9% | 出典のデフォルト構成 |
| 34 | qwen3.7-maxAlibaba | 90.9% | 出典のデフォルト構成 |
| 34 | glm-5.3_maxZ.ai | 90.9% | Max 推論 |
評価の限界と、データの帰属
正式に採点します。同じ問題ファミリーは固定の予算を共有します。
データのライセンス:CC BY 4.0 · Epoch AI が自ら評価したデータです。
成績は Epoch AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。