評価のソース公式の評価
MirrorCode
Epoch AI / コーディング · 長時間のソフトウェア再現
Karu News での扱い参考のみ
証拠の予算点数に使いません
元データの時刻9/23(水) 01:42
直近の同期10/7(水) 08:05
何を、どう測るか
公開済みのデータは少数の型番だけで、実行時間も非常に長いです。サンプルと実行条件が足りず、分類の合意を作れません。
この証拠の使い方
参考のみで、総合と分類のスコアには入れません。
評価の成績
固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。
| 元の順位 | 元の型番 | 元の成績 | 代表の設定 |
|---|---|---|---|
| 1 | claude-opus-5-5_maxAnthropic | 77.4% | Max 推論 |
| 2 | claude-fable-5-1_highAnthropic | 73.3% | High 推論 |
| 3 | claude-fable-5_highAnthropic | 63.9% | High 推論 |
| 4 | gpt-6-astra_highOpenAI | 46.7% | High 推論 |
| 5 | claude-opus-4-7_highAnthropic | 31.1% | High 推論 |
| 6 | gpt-5.6-sol_highOpenAI | 20.0% | High 推論 |
| 7 | gpt-5.4-2026-03-05_highOpenAI | 15.6% | High 推論 |
| 8 | gpt-5.5_highOpenAI | 10.0% | High 推論 |
| 9 | gemini-3.1-pro-preview_highGoogle | 8.9% | High 推論 |
評価の限界と、データの帰属
参考のみで、総合と分類のスコアには入れません。
データのライセンス:CC BY 4.0 · Epoch AI が自ら評価したデータです。
成績は Epoch AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。