本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

BullshitBench v2

Peter Gostev / BullshitBench / 知識 · 問題の中の誤った前提を見抜き、モデルが誤りに沿ってでたらめを続けないかを見ます。

公式の評価
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません

何を、どう測るか

公式の既定である全試行のうち、誤りを明確に見抜いた割合を使い、回答した応答の平均スコアも残します。拒否の割合は監査用に残します。2 つの元の指標は、現在の総合や分類の票の重みには入れません。

この証拠の使い方

元の成績の参考:同じ公開データバージョンで、集計、問題集、構成、実行日を照合してから自動収集します。匿名の型番は公開されず、固定バージョンを確認できないローリングのインターフェースは、モデルの代表成績としません。現在は総合や分類のスコアに入れていません。

評価の限界と、データの帰属

すべて誤った前提の問題なので、一般的な知識の幅を代表しません。モデル審判と拒否の扱いが結果に影響します。ローリングエイリアスと匿名の型番は、先に身元の確認が必要です。

データのライセンス:MIT · Copyright (c) 2026 Peter Gostev。公式成績はリポジトリと一緒に公開されており、データ単独のライセンスの例外はありません。

成績は Peter Gostev / BullshitBench が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。