本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

FrontierMath v2 · Tier 4

Epoch AI / 推論 · さらに難しい数学の研究問題

公式の評価
Karu News での扱い順位に反映
証拠の予算1.2%
元データの時刻9/30(水) 07:00
直近の同期10/7(水) 08:05

何を、どう測るか

Tier 4 を独立して保存し、Tiers 1–3 と数学の証拠予算を共有します。標本誤差を残します。

この証拠の使い方

正式に採点します。同じ問題ファミリーは固定の予算を共有します。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1gpt-6.1-sol_maxopenai100.0%Max 推論
2gpt-6-astra_maxOpenAI97.6%Max 推論
6claude-opus-5-5_maxAnthropic95.0%Max 推論
7claude-fable-5_maxAnthropic90.2%Max 推論
8gpt-6-sol_maxOpenAI90.0%Max 推論
9claude-fable-5-1_maxAnthropic87.8%Max 推論
11gpt-5.6-sol_maxOpenAI82.9%Max 推論
13claude-sonnet-5-5_maxanthropic80.5%Max 推論
15gpt-5.5-pro_xhighOpenAI78.0%xHigh 推論
17claude-opus-5_maxAnthropic73.2%Max 推論
18gpt-5.5_xhighOpenAI72.5%xHigh 推論
19gpt-5.6-terra_maxOpenAI70.7%Max 推論
20gpt-5.6-luna_maxOpenAI61.0%Max 推論
21gpt-5.4-pro-2026-03-05_xhighOpenAI58.5%xHigh 推論
22claude-opus-4-8_maxAnthropic56.1%Max 推論
22gpt-6-luna_maxOpenAI56.1%Max 推論
24gpt-5.4-2026-03-05_xhighOpenAI49.0%xHigh 推論
25qwen3.8-max_xhighAlibaba46.3%xHigh 推論
25muse-spark-1.3_maxMeta46.3%Max 推論
27gpt-5.2-pro-2025-12-11_xhighOpenAI46.0%xHigh 推論
29kimi-k3_maxMoonshot AI39.0%Max 推論
30gemini-3.7-flash_highGoogle36.6%High 推論
31qwen3.7-maxAlibaba34.1%出典のデフォルト構成
31qwen3.8-max-0902_xhighAlibaba34.1%xHigh 推論
33grok-4.6_xhighxAI31.7%xHigh 推論
33claude-opus-4-7_maxAnthropic31.7%Max 推論
35gpt-5.2-2025-12-11_xhighOpenAI31.7%xHigh 推論
36glm-5.3_maxZ.ai29.3%Max 推論
36claude-sonnet-5_maxAnthropic29.3%Max 推論
36glm-5.2_maxZ.ai29.3%Max 推論
評価の限界と、データの帰属

正式に採点します。同じ問題ファミリーは固定の予算を共有します。

データのライセンス:CC BY 4.0 · Epoch AI が自ら評価したデータです。

成績は Epoch AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。