評価のソース公式の評価
BullshitBench v2
Peter Gostev / BullshitBench / 知識 · 問題の中の誤った前提を見抜き、モデルが誤りに沿ってでたらめを続けないかを見ます。
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません
何を、どう測るか
公式の既定である全試行のうち、誤りを明確に見抜いた割合を使い、回答した応答の平均スコアも残します。拒否の割合は監査用に残します。2 つの元の指標は、現在の総合や分類の票の重みには入れません。
この証拠の使い方
元の成績の参考:同じ公開データバージョンで、集計、問題集、構成、実行日を照合してから自動収集します。匿名の型番は公開されず、固定バージョンを確認できないローリングのインターフェースは、モデルの代表成績としません。現在は総合や分類のスコアに入れていません。
評価の限界と、データの帰属
すべて誤った前提の問題なので、一般的な知識の幅を代表しません。モデル審判と拒否の扱いが結果に影響します。ローリングエイリアスと匿名の型番は、先に身元の確認が必要です。
データのライセンス:MIT · Copyright (c) 2026 Peter Gostev。公式成績はリポジトリと一緒に公開されており、データ単独のライセンスの例外はありません。
成績は Peter Gostev / BullshitBench が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。