本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

Mercor APEX-Agents 1.1

Mercor / 専門業務 · 投資銀行、コンサルティング、法務での長いタスクで、モデルがアシスタントとして 1 つの仕事を最後までやり切れるかを見ます。

公式の評価
Karu News での扱い順位に反映
証拠の予算4%
元データの時刻9/8(火) 09:00
直近の同期10/6(火) 02:05

何を、どう測るか

1.1 データセットと公式の Loop 環境を固定し、Pass@1 とその誤差を使います。推論段階は、あらかじめ決めた優先順位で選びます。Mean Score は採点項目の平均達成度で、タスク完了率とは混ぜません。

この証拠の使い方

固定した 1.1 版の公式 Loop の Pass@1 で、ツールと事務の予算のうち 4% を単独で占めます。別の 2% は、統一環境の銀行業務タスクに使います。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1gemini-4-argongoogle82.2%High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
2claude-sonnet-5-5anthropic75.5%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
3claude-opus-5-5Anthropic73.5%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
4claude-fable-5.1Anthropic68.6%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
5gemini-3.7-flashGoogle67.8%High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
6claude-opus-5Anthropic65.8%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
7grok-4-6-xhighxAI65.3%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
8gpt-6-astra-maxOpenAI64.7%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
9gemini-3.8-flashGoogle64.3%High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
10claude-fable-5Anthropic63.6%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
11qwen-3-8-max-xhighAlibaba63.3%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
12gpt-6-1-solopenai60.0%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
14mimo-v2.6-proXiaomi59.5%完全なシステム · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
15muse-spark-1-3Meta58.6%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
16gpt-5.6-terra-maxOpenAI58.2%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
17glm-5-3Z.ai56.6%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
18grok-4-5xAI56.2%High 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
19deepseek-v4-flashDeepSeek55.3%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
20gpt-5.5-xhighOpenAI55.1%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
21grok-4.7xAI54.6%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
22claude-sonnet-5-maxAnthropic54.5%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
23gpt-6-solOpenAI54.3%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
24glm-5-3-flashZ.ai52.8%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
26responses/gpt-5.4OpenAI52.4%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
27gpt-5-6-sol-max-proOpenAI51.4%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
28kimi-k3Moonshot AI50.6%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
29claude-opus-4-7Anthropic49.2%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
30claude-opus-4-8Anthropic48.9%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
31qwen-3-8-27bAlibaba47.5%xHigh 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
32deepseek-v4-pro-08-13DeepSeek47.3%Max 推論 · loop_truncated_tools_agent · apex-agents:v1.1:loop_truncated_tools_agent
評価の限界と、データの帰属

投資銀行、コンサルティング、法務のタスクに限られます。元のページには型番ごとの評価日がなく、少数の実行が欠けた理由も公開されていません。このスコアを、あらゆる事務作業の信頼性として解釈してはいけません。

データのライセンス:公式が結果を公開しています。データとコードのライセンスは、ランキングの再配布の許諾を意味しません。

成績は Mercor が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。