評価のソース公式の評価
FACTS Parametric
Google DeepMind / Kaggle / 知識 · 検索ツールを使わずに世界の事実についての質問に答え、モデル自身の知識の正確さを確かめます。
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません
何を、どう測るか
タスクのバージョンを固定した Score だけを考慮し、公開セット、非公開セット、信頼区間は検証用に残します。関連する 3 つのスコアで二重に票を数えることはできません。FACTS は AA v4.3 の 10 の基礎評価には入っていません。
この証拠の使い方
観察中:公式のプロトコルとライセンスは確認済みですが、問題数や完全性のマークが付いていません。一部の行は区間が大きく広く、総合スコアと公開・非公開セットの集計方法にも未確認の点があります。評価側の説明を待っており、異常な行を消して無理に接続することはせず、採点の予算も使いません。
評価の限界と、データの帰属
審判と評価の発起側がどちらも Google 由来なので、ほかの機関の証拠と合わせて見る必要があります。エクスポートには、一部の結果が同じ問題集を完了したかの説明がなく、部分的な結果を完全な評価として扱えません。区間から逆算した標本数は、公式に確認された事実ではありません。
データのライセンス:Apache 2.0 · 公式の benchmark と Score task のページに明記されています。Kaggle のドキュメントでは、公開ランキングをログイン不要の JSON でダウンロードできます。
成績は Google DeepMind / Kaggle が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。