本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

FACTS Parametric

Google DeepMind / Kaggle / 知識 · 検索ツールを使わずに世界の事実についての質問に答え、モデル自身の知識の正確さを確かめます。

公式の評価
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません

何を、どう測るか

タスクのバージョンを固定した Score だけを考慮し、公開セット、非公開セット、信頼区間は検証用に残します。関連する 3 つのスコアで二重に票を数えることはできません。FACTS は AA v4.3 の 10 の基礎評価には入っていません。

この証拠の使い方

観察中:公式のプロトコルとライセンスは確認済みですが、問題数や完全性のマークが付いていません。一部の行は区間が大きく広く、総合スコアと公開・非公開セットの集計方法にも未確認の点があります。評価側の説明を待っており、異常な行を消して無理に接続することはせず、採点の予算も使いません。

評価の限界と、データの帰属

審判と評価の発起側がどちらも Google 由来なので、ほかの機関の証拠と合わせて見る必要があります。エクスポートには、一部の結果が同じ問題集を完了したかの説明がなく、部分的な結果を完全な評価として扱えません。区間から逆算した標本数は、公式に確認された事実ではありません。

データのライセンス:Apache 2.0 · 公式の benchmark と Score task のページに明記されています。Kaggle のドキュメントでは、公開ランキングをログイン不要の JSON でダウンロードできます。

成績は Google DeepMind / Kaggle が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。