本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

Mystery Game Puzzles

Epoch AI / 推論 · 見知らぬルールから、正しい行動を導く

公式の評価
Karu News での扱い順位に反映
証拠の予算1.2%
元データの時刻9/30(水) 07:00
直近の同期10/7(水) 08:05

何を、どう測るか

Epoch の標準プロトコルの mean_score だけを使います。問題が非公開であるという制約は、明確に残します。

この証拠の使い方

正式に採点します。同じ問題ファミリーは固定の予算を共有します。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1gpt-6-astra_maxOpenAI84.0%Max 推論
2gpt-6.1-sol_maxopenai80.0%Max 推論
3claude-opus-5-5_maxAnthropic71.0%Max 推論
4claude-sonnet-5-5_maxanthropic65.0%Max 推論
5claude-opus-5_maxAnthropic59.0%Max 推論
6claude-fable-5-1_maxAnthropic58.0%Max 推論
6gpt-5.6-sol_maxOpenAI58.0%Max 推論
8gpt-6-sol_maxOpenAI56.0%Max 推論
8gpt-5.5_xhighOpenAI56.0%xHigh 推論
10claude-fable-5_maxAnthropic52.0%Max 推論
12gemini-3.8-flash_highGoogle47.0%High 推論
13deepseek-v4-pro-0813_maxDeepSeek43.0%Max 推論
14qwen3.8-max_xhighAlibaba38.0%xHigh 推論
15gpt-5.4-2026-03-05_xhighOpenAI37.0%xHigh 推論
15gemini-3.7-flash_highGoogle37.0%High 推論
18claude-opus-4-8_maxAnthropic36.0%Max 推論
19claude-sonnet-5_maxAnthropic35.0%Max 推論
19gpt-5.6-terra_maxOpenAI35.0%Max 推論
21gemini-3.1-pro-preview_highGoogle34.0%High 推論
21grok-4.6_xhighxAI34.0%xHigh 推論
21deepseek-v4-flash-0731_maxDeepSeek34.0%Max 推論
24glm-5.3_maxZ.ai33.0%Max 推論
26gemini-3.5-flash_highGoogle32.0%High 推論
26qwen3.7-maxAlibaba32.0%出典のデフォルト構成
30gemini-3.6-flash_highGoogle30.0%High 推論
31o3-2025-04-16_highOpenAI29.0%High 推論
31grok-4.7_xhighxAI29.0%xHigh 推論
34claude-opus-4-7_maxAnthropic28.0%Max 推論
38kimi-k3_maxMoonshot AI26.0%Max 推論
42muse-spark-1.3_maxMeta25.0%Max 推論
評価の限界と、データの帰属

正式に採点します。同じ問題ファミリーは固定の予算を共有します。

データのライセンス:CC BY 4.0 · Epoch AI が自ら評価したデータです。

成績は Epoch AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。