評価のソース公式の評価
SimpleBench
SimpleBench / 推論 · 日常の常識と論理の問題で、問題の中の実際の制約を見抜けるかを確かめます。
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません
何を、どう測るか
選択式と自由回答を区別し、AVG@5、温度、プロンプトのプロトコルを固定します。ランキングに加えた日を、問題ごとの評価時刻とはみなしません。
この証拠の使い方
候補の観察:新製品のカバーは早く、公式サイトの成績の再利用の範囲と、固定できるデータバージョンの説明を待っています。コードのライセンスは当てはめず、自動収集と採点はまだしていません。
評価の限界と、データの帰属
日常の常識問題には補う価値がありますが、問題の代表性と、選択式・自由回答の条件のどちらも解釈に影響します。
データのライセンス:サンプル問題と評価コードのリポジトリは MIT です。公式サイトが独自に公開する最新の成績スクリプトの再表示の範囲は、まだ確認できていません。
成績は SimpleBench が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。