評価のソース公式の評価
EQ-Bench 4 · 感情と対人理解
EQ-Bench · 複数ターンのやり取りで、相手の感情、言外の要望、コミュニケーションの好みの違いを読み取れるかを見ます。
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません
何を、どう測るか
120 の模擬人物と 16 ターンのロールプレイを、3 社のモデル審判が交代でブラインド評価します。Elo だけを使い、行動スタイルの traits は「高いほど良い」能力スコアとして扱いません。旧 v3 とは二重に票を数えません。
この証拠の使い方
観察中:公開データとライセンスは使えます。新しい評価回を待っており、分類の出典数を稼ぐために有効期限を延ばすことはしません。
評価の限界と、データの帰属
英語の模擬対話で、人の専門家による検証がまだありません。人の満足度や日本語での感情理解と同じとは言えません。現在の成績は 45 日の窓を超えています。
データのライセンス:MIT · EQ-bench-site README のメタデータの記載です。
成績は EQ-Bench が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。