本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

MirrorCode

Epoch AI / コーディング · 長時間のソフトウェア再現

公式の評価
Karu News での扱い参考のみ
証拠の予算点数に使いません
元データの時刻9/23(水) 01:42
直近の同期10/7(水) 08:05

何を、どう測るか

公開済みのデータは少数の型番だけで、実行時間も非常に長いです。サンプルと実行条件が足りず、分類の合意を作れません。

この証拠の使い方

参考のみで、総合と分類のスコアには入れません。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1claude-opus-5-5_maxAnthropic77.4%Max 推論
2claude-fable-5-1_highAnthropic73.3%High 推論
3claude-fable-5_highAnthropic63.9%High 推論
4gpt-6-astra_highOpenAI46.7%High 推論
5claude-opus-4-7_highAnthropic31.1%High 推論
6gpt-5.6-sol_highOpenAI20.0%High 推論
7gpt-5.4-2026-03-05_highOpenAI15.6%High 推論
8gpt-5.5_highOpenAI10.0%High 推論
9gemini-3.1-pro-preview_highGoogle8.9%High 推論
評価の限界と、データの帰属

参考のみで、総合と分類のスコアには入れません。

データのライセンス:CC BY 4.0 · Epoch AI が自ら評価したデータです。

成績は Epoch AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。