順位の付け方
複数の公開評価をまとめて、順位の裏にある証拠と方法を説明します。
0〜100
共通の証拠で、はっきりした順に。
複数の公開評価をまとめ、全体の順位の中で、すでに分かっている成績との食い違いをできるだけ少なくします。総合と 4 つのカテゴリは、どれも上位 30 位までを表示します。
総合の指数は、元の順位を支える証拠の差を 0〜100 に直したものです。比べやすくするためで、正答率でも、実力差のパーセントでもありません。支持が近いときは同点になることがありますが、順位は証拠の全体で決まります。
- 01
同じモデルかどうかを確かめる
各社のランキングにある名前とバージョンをそろえます。同じモデルの推論レベル違いは、代表の設定を 1 つだけ選びます。選び方はあらかじめ決めてあり、最高点は選びません。匿名のテスト用コード名と、他のモデルを混ぜて解いた成績は除きます。正式に公開された Preview 版は参加できます。
- 02
実際に測られたモデル同士を比べる
比べるのは、同じ評価の中の実際の成績だけです。両方に公開された誤差があるときは、誤差の範囲に収まる小さな差を、ほぼ引き分けとして扱います。測られていなければ、その比較は行いません。
- 03
票の重みを先に決め、共通の意見をまとめる
評価ごとに、あらかじめ決めた予算を使います。総合ランキングには、3 つ以上の評価機関、3 つの証拠の系統、3 つの専門分野の裏づけが必要です。同じソースを重ねて取得したり、表示を切り分けたりしても、票は増えません。
- 04
食い違いのいちばん少ない順位を探す
評価ごとに意見が食い違うことがあります。共通の証拠に逆らう票がいちばん少なくなる並びを選び、表示する指数は別に計算します。未測を 0 点で埋めたり、公開されていない成績を推測したりはしません。
総合の評価、人間の盲検、専門の評価を、いっしょに見る。
総合の評価が 30%、人間の盲検が 10%、各専門の評価が合わせて 60% です。新しい評価は、公開された説明の中の重なりを確かめてから、対応する枠の中で配分します。足りない枠は、他の評価に回しません。
- 総合評価30%AA Index
- 人間の盲検比較10%Arena Text · Arena 創作ブラインド投票
- コーディングとデザイン12%Arena WebDev · DeepSWE v1.1 · TapTap Maker · LiveBench · コーディング総合
- 文章と表現9%LiveBench · 言語と指示 · Creative Writing v3 · Longform Writing
- 数学と推論12%LiveBench · 推論と数学 · FrontierMath v2 · Tiers 1–3 · FrontierMath v2 · Tier 4 · Chess Puzzles · Mystery Game Puzzles
- 知識と事実6%SimpleQA Verified · GPQA Diamond
- 視覚理解6%Arena Vision
- ツールと業務6%APEX-Agents 1.1 · τ³-Banking
- 中国語と多言語6%AA 多言語
- 業界の専門タスク3%Vals Finance Agent
コーディング、推論、知識、業務は、それぞれ実際の評価を探し、カテゴリごとに別に計算します。画像の理解と多言語の証拠は、これまで通り総合に使います。カテゴリの名前を変えても、同じ成績の票は増えません。総合の点数は、カテゴリの点数の平均ではありません。カテゴリは、有効な評価が 2 つ以上、比べられる型番が 5 つ以上あるときに表示します。知識はいま Epoch の 2 つの評価が支えていて、同じ機関であることの限界を明記しています。創作の好みやウェブ開発などの証拠は総合に使い、最初の版では、美的感覚や文章のランキングは別に作りません。
よくある質問
証拠の少ないモデルも、載ることがありますか。
「敏感」とは、どういう意味ですか。
上位のモデルは、1 対 1 の比較で必ず勝っていますか。
使った感触と順位が違うときは、どう考えればよいですか。
新しいモデルは、いつ載りますか。
あるランキングが一時的に開けないと、どうなりますか。
総合の指数は、専門の評価と二重に数えていませんか。
価格や速度は、順位に影響しますか。
計算の詳細と、いまの版を見る
方法の版:2026.09-public-consensus-v15。重みつきの不完全な Kemeny 順位づけを使います。両方が参加したモデルの組ごとに、支持の差 M を合計し、逆向きになった支持の差の合計が最小になる並びを求めます。整数最適化が最適な状態と目的の上下限を返し、検証を通った結果だけを正式に公開します。
両方に明確な標準誤差があるときは、支持の差を 2Φ(点差 / 合成標準誤差) − 1 とし、共分散は 0 とします。それ以外の比較は、元の成績の向きだけを使います。誤差が分からないことは誤差 0 ではなく、小さな点差を順序として扱うことは限界のままです。票の重みはモデルの組に対して決めるため、多くの型番をカバーするソースほど、比較の場所を多く使います。名目上の予算を、最終順位への正確な寄与率とは読まないでください。
表示する指数は、元の順位を保ちます。隣り合うモデルの先後を 1 組ずつ入れ替え、他のモデルの並べ替えを許したうえで、増える逆向きの支持の最小値を計算します。元の順位に沿ってこの非負の差を足し、固定の参照グループを基準に sigmoid で 0〜100 に写します。別の並びも同じく最適なときは間隔を 0 のまま残し、表示は小数第 1 位までで、最低の点差は設けません。指数は逆向きの並べ替えには使いません。入るモデルの集合、参照の型番、証拠が変わると、指数も変わります。点差は、実際の能力の距離ではありません。同じ費用の解は型番 ID の順で固定し、整数最適化には HiGHS ソルバー(highs 1.15.3)を使い、誤差の換算の正規分布関数は SciPy の norm.cdf と同じアルゴリズムです。ソース、規約、参加の資格、各回の計算の入力には、版を残します。共通の証拠のつながりに入っていないときは、成分をまたいだ見せかけの精密な順序は出しません。
固定の参照型番:claude-fable-5、gpt-5-6-sol、kimi-k-3、qwen-3-8-max、gpt-5-4、claude-opus-4-8、claude-sonnet-5、grok-4-5、gemini-3-5-flash、glm-5-2、claude-sonnet-4-6、qwen-3-7-max、kimi-k-2-6、deepseek-v-4-pro、qwen-3-6-plus、minimax-m-3、gpt-5-4-mini、grok-4-3。参照グループは指数の尺度に使うもので、どの会社が何位になるべきかを決めるものではありません。カテゴリの違う指数は、そのままは比べられません。