評価のソース公式の評価
OfficeQA Pro
Databricks / 専門業務 · 大量の実際の財務文書から、検索、計算、回答を行う。
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません
何を、どう測るか
Pro は 133 問に固定し、Full の 246 問、Pro V2 の 90 問とは分けます。エンドツーエンドの検索と、答えのあるページを直接渡す条件は別物です。Claude Agent SDK、Codex SDK、Antigravity CLI の成績はそれぞれの実行システムのもので、統一した基礎モデルの評価とは混ぜられません。測っているのは文書の理解で、事務文書の成果物の品質を示すものではありません。
この証拠の使い方
観察中:公式は更新を続けていますが、現在は主に異なる製品の実行システムを比べており、元の集計プロトコルは確認が必要です。資料理解の参考として残し、異なるツールシステムの成績を基礎モデルにそのまま帰属させることはしません。
評価の限界と、データの帰属
コードと問題集のライセンスは、外部のすべての成績を自動的にカバーしません。新旧の問題集、エンドツーエンド、答えのページ直接提供の条件は混ぜられず、現在は成績を自動収集していません。
データのライセンス:コードは Apache 2.0 で、問題データは CC BY-SA 4.0 です。現在は、アクセス申請が必要な Hugging Face のデータセットに移っています。
成績は Databricks が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。