本文へ移動
10/7(水) 12:09
あとで読む
AIモデルランキングへ戻る

順位の付け方

複数の公開評価をまとめて、順位の裏にある証拠と方法を説明します。

0〜100

共通の証拠で、はっきりした順に。

複数の公開評価をまとめ、全体の順位の中で、すでに分かっている成績との食い違いをできるだけ少なくします。総合と 4 つのカテゴリは、どれも上位 30 位までを表示します。

総合の指数は、元の順位を支える証拠の差を 0〜100 に直したものです。比べやすくするためで、正答率でも、実力差のパーセントでもありません。支持が近いときは同点になることがありますが、順位は証拠の全体で決まります。

  1. 01

    同じモデルかどうかを確かめる

    各社のランキングにある名前とバージョンをそろえます。同じモデルの推論レベル違いは、代表の設定を 1 つだけ選びます。選び方はあらかじめ決めてあり、最高点は選びません。匿名のテスト用コード名と、他のモデルを混ぜて解いた成績は除きます。正式に公開された Preview 版は参加できます。

  2. 02

    実際に測られたモデル同士を比べる

    比べるのは、同じ評価の中の実際の成績だけです。両方に公開された誤差があるときは、誤差の範囲に収まる小さな差を、ほぼ引き分けとして扱います。測られていなければ、その比較は行いません。

  3. 03

    票の重みを先に決め、共通の意見をまとめる

    評価ごとに、あらかじめ決めた予算を使います。総合ランキングには、3 つ以上の評価機関、3 つの証拠の系統、3 つの専門分野の裏づけが必要です。同じソースを重ねて取得したり、表示を切り分けたりしても、票は増えません。

  4. 04

    食い違いのいちばん少ない順位を探す

    評価ごとに意見が食い違うことがあります。共通の証拠に逆らう票がいちばん少なくなる並びを選び、表示する指数は別に計算します。未測を 0 点で埋めたり、公開されていない成績を推測したりはしません。

総合の評価、人間の盲検、専門の評価を、いっしょに見る。

総合の評価が 30%、人間の盲検が 10%、各専門の評価が合わせて 60% です。新しい評価は、公開された説明の中の重なりを確かめてから、対応する枠の中で配分します。足りない枠は、他の評価に回しません。

  • 総合評価30%AA Index
  • 人間の盲検比較10%Arena Text · Arena 創作ブラインド投票
  • コーディングとデザイン12%Arena WebDev · DeepSWE v1.1 · TapTap Maker · LiveBench · コーディング総合
  • 文章と表現9%LiveBench · 言語と指示 · Creative Writing v3 · Longform Writing
  • 数学と推論12%LiveBench · 推論と数学 · FrontierMath v2 · Tiers 1–3 · FrontierMath v2 · Tier 4 · Chess Puzzles · Mystery Game Puzzles
  • 知識と事実6%SimpleQA Verified · GPQA Diamond
  • 視覚理解6%Arena Vision
  • ツールと業務6%APEX-Agents 1.1 · τ³-Banking
  • 中国語と多言語6%AA 多言語
  • 業界の専門タスク3%Vals Finance Agent

コーディング、推論、知識、業務は、それぞれ実際の評価を探し、カテゴリごとに別に計算します。画像の理解と多言語の証拠は、これまで通り総合に使います。カテゴリの名前を変えても、同じ成績の票は増えません。総合の点数は、カテゴリの点数の平均ではありません。カテゴリは、有効な評価が 2 つ以上、比べられる型番が 5 つ以上あるときに表示します。知識はいま Epoch の 2 つの評価が支えていて、同じ機関であることの限界を明記しています。創作の好みやウェブ開発などの証拠は総合に使い、最初の版では、美的感覚や文章のランキングは別に作りません。

よくある質問

証拠の少ないモデルも、載ることがありますか。
評価の数と実力は別のものです。総合ランキングには、3 つ以上の機関と、分野をまたぐ証拠が必要です。多くのカテゴリは 2 機関を求め、知識は同じ機関の 2 つの評価を使うことを明記しています。未測は 0 点にしませんが、偏りが残る場合があります。
「敏感」とは、どういう意味ですか。
評価や機関を 1 つ外す、1 つの重みを上下 20% 動かす、誤差の扱いを変える。こうしたとき、順位の範囲が 3 位以上動く、ある比べ方で評価の資格を失う、または比較が終わっていない場合に、「敏感」と表示します。詳細ページの範囲は 95% 信頼区間ではなく、まだ公開されていない成績も含みません。
上位のモデルは、1 対 1 の比較で必ず勝っていますか。
必ずではありません。A が B に勝ち、B が C に勝ち、C が A に勝つことがあります。全体の順位は、こうした食い違いを見比べて決めます。離れた順位では、1 対 1 の比較と食い違うことがあります。数学的に最適とは、いまの規則で食い違いの合計がいちばん少ないという意味で、実際の仕事での実力の順序を証明したものではありません。
使った感触と順位が違うときは、どう考えればよいですか。
ランキングは公開された評価を集めたもので、その証拠が支える総合力を表しています。実際の使い心地は、製品のバージョン、推論のレベル、ツール環境、長い作業での安定性にも左右されます。新しい評価で古い順位を確かめ直しています。点数が近いときは、1 位や 2 位の差を、はっきりした強さの違いと読まないでください。
新しいモデルは、いつ載りますか。
Karu News は 1 日に 4 回、上流の結果を確認します。順位に使えるのは、評価の運営者が実際に新しいモデルの成績を公開したときだけです。ページの更新、価格の変更、こちらの取得の時刻は、再評価に数えません。
あるランキングが一時的に開けないと、どうなりますか。
有効なソースのスナップショットは、そのまま使えます。同じ評価バージョンの中で、一時的に行が抜けたときは、直近 7 日以内に確認済みの記録を最大でそのまま引き継ぎます。公開ランキングに残っている有効な成績は、数値が長く変わらないだけでは消しません。公式が取り下げたり、訂正したり、版を替えたりしたときは、その分を無効にするか差し替えます。過去の最高点は残しません。計算全体が失敗したときは、前回の有効なランキングと、その時刻を残します。
総合の指数は、専門の評価と二重に数えていませんか。
公開された問題集と方法の説明から重なりを確かめ、関連するソースの合計の割合を抑えています。確認できない関連は、限界として残ります。いま AA の指数は 30% です。Arena の全体テキストと創作の専門は、もとの 10% の人間の好みの枠を共有し、5% ずつです。この 2 つには重なる投票があるため、独立した 2 つの評価とは見せず、同じ証拠の系統として数えます。
価格や速度は、順位に影響しますか。
どちらも影響しません。価格は API の使用コストを知るための情報で、100 万トークンあたりに統一して表示し、各社の公式ページを出典として残します。サブスクリプションの料金ではありません。
計算の詳細と、いまの版を見る

方法の版:2026.09-public-consensus-v15。重みつきの不完全な Kemeny 順位づけを使います。両方が参加したモデルの組ごとに、支持の差 M を合計し、逆向きになった支持の差の合計が最小になる並びを求めます。整数最適化が最適な状態と目的の上下限を返し、検証を通った結果だけを正式に公開します。

両方に明確な標準誤差があるときは、支持の差を 2Φ(点差 / 合成標準誤差) − 1 とし、共分散は 0 とします。それ以外の比較は、元の成績の向きだけを使います。誤差が分からないことは誤差 0 ではなく、小さな点差を順序として扱うことは限界のままです。票の重みはモデルの組に対して決めるため、多くの型番をカバーするソースほど、比較の場所を多く使います。名目上の予算を、最終順位への正確な寄与率とは読まないでください。

表示する指数は、元の順位を保ちます。隣り合うモデルの先後を 1 組ずつ入れ替え、他のモデルの並べ替えを許したうえで、増える逆向きの支持の最小値を計算します。元の順位に沿ってこの非負の差を足し、固定の参照グループを基準に sigmoid で 0〜100 に写します。別の並びも同じく最適なときは間隔を 0 のまま残し、表示は小数第 1 位までで、最低の点差は設けません。指数は逆向きの並べ替えには使いません。入るモデルの集合、参照の型番、証拠が変わると、指数も変わります。点差は、実際の能力の距離ではありません。同じ費用の解は型番 ID の順で固定し、整数最適化には HiGHS ソルバー(highs 1.15.3)を使い、誤差の換算の正規分布関数は SciPy の norm.cdf と同じアルゴリズムです。ソース、規約、参加の資格、各回の計算の入力には、版を残します。共通の証拠のつながりに入っていないときは、成分をまたいだ見せかけの精密な順序は出しません。

固定の参照型番:claude-fable-5、gpt-5-6-sol、kimi-k-3、qwen-3-8-max、gpt-5-4、claude-opus-4-8、claude-sonnet-5、grok-4-5、gemini-3-5-flash、glm-5-2、claude-sonnet-4-6、qwen-3-7-max、kimi-k-2-6、deepseek-v-4-pro、qwen-3-6-plus、minimax-m-3、gpt-5-4-mini、grok-4-3。参照グループは指数の尺度に使うもので、どの会社が何位になるべきかを決めるものではありません。カテゴリの違う指数は、そのままは比べられません。

評価のソースを見る →