本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

FrontierMath v2 · Tiers 1–3

Epoch AI / 推論 · 研究レベルの数学的推論

公式の評価
Karu News での扱い順位に反映
証拠の予算3.6%
元データの時刻9/30(水) 07:00
直近の同期10/7(水) 08:05

何を、どう測るか

v2 の Tiers 1–3 だけを使います。旧版の問題と Tier 4 は、同じ指標に混ぜません。

この証拠の使い方

正式に採点します。同じ問題ファミリーは固定の予算を共有します。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1gpt-6-astra_maxOpenAI93.7%Max 推論
1gpt-6.1-sol_maxopenai93.7%Max 推論
3claude-opus-5-5_maxAnthropic91.2%Max 推論
4claude-fable-5-1_maxAnthropic90.2%Max 推論
5gpt-6-sol_maxOpenAI89.8%Max 推論
6gpt-5.6-sol_maxOpenAI89.1%Max 推論
7claude-sonnet-5-5_maxanthropic88.8%Max 推論
8gpt-5.5-pro_xhighOpenAI87.7%xHigh 推論
9claude-fable-5_maxAnthropic87.0%Max 推論
10gpt-5.6-terra_maxOpenAI86.0%Max 推論
11claude-opus-5_maxAnthropic85.6%Max 推論
12gpt-5.5_xhighOpenAI85.3%xHigh 推論
13gpt-5.4-pro-2026-03-05_xhighOpenAI82.5%xHigh 推論
14gpt-5.6-luna_maxOpenAI82.1%Max 推論
15claude-opus-4-8_maxAnthropic80.0%Max 推論
16gpt-6-luna_maxOpenAI78.9%Max 推論
17gpt-5.4-2026-03-05_xhighOpenAI78.6%xHigh 推論
18qwen3.8-max_xhighAlibaba74.7%xHigh 推論
20muse-spark-1.3_maxMeta74.0%Max 推論
21gpt-5.2-pro-2025-12-11_xhighOpenAI74.0%xHigh 推論
22kimi-k3_maxMoonshot AI72.2%Max 推論
23gemini-3.7-flash_highGoogle71.6%High 推論
24claude-opus-4-7_maxAnthropic70.2%Max 推論
25glm-5.3_maxZ.ai68.8%Max 推論
26gemini-3.8-flash_highGoogle68.4%High 推論
27gpt-5.2-2025-12-11_xhighOpenAI67.4%xHigh 推論
28grok-4.6_xhighxAI66.0%xHigh 推論
28claude-opus-4-6_maxAnthropic66.0%Max 推論
30claude-sonnet-5_maxAnthropic65.6%Max 推論
30qwen3.8-max-0902_xhighAlibaba65.6%xHigh 推論
評価の限界と、データの帰属

正式に採点します。同じ問題ファミリーは固定の予算を共有します。

データのライセンス:CC BY 4.0 · Epoch AI が自ら評価したデータです。

成績は Epoch AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。