本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

MCP Atlas

Scale AI / 専門業務 · 実際の MCP サービスで資料を検索し、文書とデータベースを操作して、ソフトウェアをまたぐタスクをこなします。

公式の評価
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません

何を、どう測るか

2026 年 4 月に調整した後の実行プロトコルと、100 回のツール呼び出しの予算を固定します。完全な 1,000 問と公開の 500 問は分けます。タスクの通過率だけを使い、回答条件のカバー率で二重に票を数えません。審判、再試行、ツールのバージョンは、成績のバッチに合わせて固定する必要があります。

この証拠の使い方

観察中:ソフトウェアをまたぐツール実行の証拠を補えます。安定した成績のエクスポート、実際の評価バッチ、再表示の範囲を確認する必要があり、現在は出典を収録するだけで、自動収集も採点もしていません。

評価の限界と、データの帰属

ウェブ上の古い方法の説明とリアルタイムの成績は、ずれている場合があります。公開の問題集のコードは、リアルタイムの成績のエクスポートではありません。Scale の他のランキングと同じ機関なので、独立した機関の数は増えません。

データのライセンス:公式の環境コードは MIT です。このライセンスは、ウェブ上のリアルタイムの成績を自動的にカバーせず、ランキングデータの再表示の範囲は確認が必要です。

成績は Scale AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。