AIモデルランキングへ戻る
評価のソース
それぞれの評価が何を測り、どう更新され、順位に使われるかを、ここで確かめられます。
20今回、順位に使った評価69確かめたソースと専門の評価
順位の付け方 総合評価と使い心地
17能力をまたぐ総合テストと、人によるブラインド投票です。
- 順位に反映AA Index複数の最新評価を同じ環境で回し直し、ひとつの総合能力スコアにまとめます。価格は参考で、総合点には入れません。Artificial Analysis証拠の予算 30%
- 他の評価と照合LiveBench問題を入れ替え続け、答えは自動で照合できます。問題が変わってもモデルが崩れないかを見ます。LiveBench
- 順位に反映Arena Text人が匿名で回答を二つずつ比べ、どちらが読みたいかを見ます。選択式問題では見えない、全体的な使い心地を補います。LMArena証拠の予算 5%
- 順位に反映Arena WebDev同じく人によるブラインド投票で、ウェブページが使えるか、納品できるかを比べます。LMArena証拠の予算 2.4%
- 順位に反映LiveBench · 言語と指示Language と IF の 2 項目の平均で、それぞれ 50% を占めます。LiveBench証拠の予算 3%
- 順位に反映Arena 創作ブラインド投票人が物語、詩、その他の創作表現にブラインド投票し、作品が読者を引きつけるかを見ます。LMArena証拠の予算 5%
- 観察中Design Arena · ビジュアルデザイン人がウェブページ、画面、図表、スライドのデザイン作品にブラインド投票します。Design Arena / Intelligence
- 観察中EQ-Bench 4 · 感情と対人理解複数ターンのやり取りで、相手の感情、言外の要望、コミュニケーションの好みの違いを読み取れるかを見ます。EQ-Bench
- 観察中Short-Story · 短編小説決まった人物、筋、文体の要求を、1 本の完結した短編小説に自然に書き込みます。Lech Mazur
- 観察中ToneBench · 文体と脚本指定した書き手の文体で動画の脚本を書き、冒頭、構成、表現、語りのテンポを見ます。Towards AI
- 観察中TubeLab · 動画脚本異なる動画チャンネル向けに脚本を書き、物語の組み立て、文体、テンポ、明快さを比べます。TubeLab
- 観察中NC Bench · 書き手のワークフロー書き手のリライト、続き書き、要約、翻訳、創作アイデアの整理を助けます。Novelcrafter
- 観察中OpenVibeEval · ウェブ作品ウェブ作品、アクセシビリティ、ブラインド投票の好みを対照し、ツールごとのデザイン表現を見ます。OpenVibeEval
- 観察中SVGBench · ベクター画像ブラインド投票同じプロンプトで SVG にブラインド投票し、見た目の明快さと図形の表現を見ます。SVGBench
- 観察中Rapidata SVG人がモデルの生成したベクター画像を比べ、見た目の好みを直接評価します。Rapidata
- 順位に反映Creative Writing v3短編の創作と表現EQ-Bench証拠の予算 3.6%
- 順位に反映Longform Writing長編物語の一貫性と完結度EQ-Bench証拠の予算 2.4%
コーディング
13コードを書くことからリポジトリを直すことまで、モデルがソフトウェアを作り上げられるかを見ます。
- 順位に反映DeepSWE v1.1統一したコーディングアシスタント環境でリポジトリを直し、不具合を修正します。比べるのは、コードを書くモデルそのものです。DataCurve証拠の予算 3.6%
- 順位に反映TapTap Maker実際のゲームエンジン上で、Lua で動く機能を書きます。スコアはエンジンの実行で判定し、別のモデルによる採点は使いません。TapTap Maker証拠の予算 3.6%
- 順位に反映LiveBench · コーディング総合Coding と Agentic Coding の 2 項目の平均で、それぞれ 50% を占めます。LiveBench証拠の予算 2.4%
- 観察中Hyper-τ-bench業務資料をもとに、実際に動くカスタマーサービスのエージェントを構築し、テストします。Sierra
- 観察中SWE-rebench実際のリポジトリの課題を集め続け、複数のプログラミング言語でモデルのソフトウェア修正力を比べます。Nebius
- 観察中LHTB長い時間ターミナルを使い続け、複雑なエンジニアリングとツールのタスクをこなします。Tencent HY / Lehigh ほか
- 参考のみTerminal-Bench 4モデルを異なる Agent と組み合わせたターミナルタスクの元の成績を残し、クロスチェックに使います。Harbor / Terminal-Bench
- 参考のみMirrorCode長時間のソフトウェア再現Epoch AI
- 観察中Code Migrationソフトウェアの移行とインターフェースの改修Vals AI
- 観察中ProgramBench完全なプログラムの実装と納品Vals AI
- 観察中FrontierCode実際のリポジトリのタスクにおける品質、テスト、変更範囲Cognition
- 観察中FrontierSWE v2長時間動くエンジニアリングの実装と研究タスクProximal Labs
- 観察中WeirdML見知らぬデータで機械学習の解決策を実装するWeirdML
推論
11数学、論理、見知らぬルールを通じて、モデルが新しい問題を考え抜けるかを見ます。
- 順位に反映LiveBench · 推論と数学Reasoning と Mathematics の 2 項目の平均で、それぞれ 50% を占めます。LiveBench証拠の予算 4.2%
- 観察中SimpleBench日常の常識と論理の問題で、問題の中の実際の制約を見抜けるかを確かめます。SimpleBench
- 順位に反映FrontierMath v2 · Tiers 1–3研究レベルの数学的推論Epoch AI証拠の予算 3.6%
- 順位に反映FrontierMath v2 · Tier 4さらに難しい数学の研究問題Epoch AI証拠の予算 1.2%
- 順位に反映Chess Puzzles文字で表した盤面から、正しい指し手を探すEpoch AI証拠の予算 1.8%
- 順位に反映Mystery Game Puzzles見知らぬルールから、正しい行動を導くEpoch AI証拠の予算 1.2%
- 観察中MathArena · ArXivLeanLean で数学の証明を検証するMathArena / ETH Zurich
- 観察中MathArena · BrokenArXiv数学の証明の誤りを見つけて直すMathArena / ETH Zurich
- 観察中MathArena · ArXivMath最近の数学論文から作った新しい問題MathArena / ETH Zurich
- 観察中ARC-AGI-2見知らぬルールから学び、一般化するARC Prize
- 観察中ARC-AGI-3見知らぬルールから学び、一般化するARC Prize
知識
5事実についての質問と、大学院レベルの科学知識で、知識の習得と回答の正確さを見ます。
- 観察中FACTS Parametric検索ツールを使わずに世界の事実についての質問に答え、モデル自身の知識の正確さを確かめます。Google DeepMind / Kaggle
- 観察中Humanity’s Last Exam分野をまたぐ、難度の高い学術知識と推論CAIS / Scale AI
- 観察中BullshitBench · 誤った前提問題の中の誤った前提を見抜き、モデルが誤りに沿ってでたらめを続けないかを見ます。Peter Gostev / BullshitBench
- 順位に反映SimpleQA Verified短い質問での事実の正確さEpoch AI証拠の予算 4%
- 順位に反映GPQA Diamond大学院レベルの物理、化学、生物の知識Epoch AI証拠の予算 2%
専門業務
19金融分析、法律相談、銀行業務で、専門的なタスクをやり遂げられるかを見ます。
- 順位に反映APEX-Agents 1.1投資銀行、コンサルティング、法務での長いタスクで、モデルがアシスタントとして 1 つの仕事を最後までやり切れるかを見ます。Mercor証拠の予算 4%
- 順位に反映Vals Finance Agent金融アナリストの日常業務の問題で、調査レポートやモデリングのような仕事がどれだけできるかを見ます。Vals AI証拠の予算 3%
- 観察中OfficeQA Pro大量の実際の財務文書から、検索、計算、回答を行う。Databricks
- 観察中Harvey Legal Agent Benchmark法務資料を処理し、Word、Excel、スライドなどのレビューできるファイルを納品します。Vals AI / Harvey
- 観察中MCP Atlas実際の MCP サービスで資料を検索し、文書とデータベースを操作して、ソフトウェアをまたぐタスクをこなします。Scale AI
- 観察中FinanceBenchmark金融の価格付け、資本の計算、リスク管理のタスクをこなし、数値とコードの実行結果で検証します。FinanceBenchmark
- 観察中PRBench · Legal実際の法律業務での複雑な質問に答え、専門的な判断と論証の質を確かめます。Scale AI
- 観察中PRBench · Finance実際の金融判断の問題に答え、専門的な判断、導出、リスクの説明を確かめます。Scale AI
- 観察中SpreadsheetBench 2財務モデリング、ワークブックの修復、データの可視化まで、表計算の仕事をひととおりこなします。SpreadsheetBench / Renmin University / AfterQuery
- 観察中Vending-Bench 2店舗経営を 1 年間シミュレーションし、仕入れ、交渉、在庫、価格設定を行います。Andon Labs
- 結果待ちτ³-Banking統一したツール環境で銀行業務を処理し、ルールの理解、顧客とのやり取り、タスクの完了を確かめます。Sierra証拠の予算 2%
- 参考のみEBR-bench長いタスクで新しいルールを学び、記憶を使うEpoch AI
- 観察中Excel · EMB表の編集と Excel の事務作業Vals AI
- 観察中Legal Research法務の検索と論証Vals AI
- 観察中TaxAgentBench税務の専門的な質問Vals AI
- 観察中MedScribe臨床記録の整理と作成Vals AI
- 観察中BioMysteryBench生物学の研究に関する推論Vals AI
- 観察中AutomationBenchソフトウェアをまたいで、自動化された仕事をこなすZapier
- 観察中Terminal-Bench Scienceターミナルで研究タスクをこなすHarbor
視覚理解
2画像を理解する証拠は、引き続き総合ランキングに残します。画像を読み取ることとデザインの美しさは、別の能力です。
日本語と多言語
2言語の基礎を補う証拠です。英語の文章の出来を、日本語の力とはみなしません。
「観察中」は、データ、実行の条件、使ってよい範囲を確かめている段階で、総合とカテゴリの順位には使いません。同じ評価を重ねて取得したり、表示を切り分けたりしても、票は増えません。評価どうしの問題集の重なりは、これからも確かめます。