本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

EQ-Bench 4 · 感情と対人理解

EQ-Bench · 複数ターンのやり取りで、相手の感情、言外の要望、コミュニケーションの好みの違いを読み取れるかを見ます。

公式の評価
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません

何を、どう測るか

120 の模擬人物と 16 ターンのロールプレイを、3 社のモデル審判が交代でブラインド評価します。Elo だけを使い、行動スタイルの traits は「高いほど良い」能力スコアとして扱いません。旧 v3 とは二重に票を数えません。

この証拠の使い方

観察中:公開データとライセンスは使えます。新しい評価回を待っており、分類の出典数を稼ぐために有効期限を延ばすことはしません。

評価の限界と、データの帰属

英語の模擬対話で、人の専門家による検証がまだありません。人の満足度や日本語での感情理解と同じとは言えません。現在の成績は 45 日の窓を超えています。

データのライセンス:MIT · EQ-bench-site README のメタデータの記載です。

成績は EQ-Bench が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。