評価のソース公式の評価
PRBench · Legal
Scale AI / 専門業務 · 実際の法律業務での複雑な質問に答え、専門的な判断と論証の質を確かめます。
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません
何を、どう測るか
Legal の完全な 500 問か Hard の 250 問のどちらかに固定し、検索ツール、推論段階、審判のバージョンをそろえます。その問題集の rubric の集計スコアを使い、完全セットと難問サブセットで二重に票を数えません。専門的な質疑応答を、完全なファイルの納品とは説明しません。
この証拠の使い方
観察中:法務の専門的な判断を補えます。先に問題集、ツールの条件、成績のバッチを確認し、現在は出典を収録するだけで、自動収集も採点もしていません。
評価の限界と、データの帰属
モデル審判が評価するので、審判の好みが残ります。同じ機関の法務と金融の専門項目は影響の範囲を共有し、2 つの独立した証拠とはできません。Word、Excel、スライドの制作力を直接測るものではありません。
データのライセンス:公式の問題集と評価コードは公開されています。そのライセンスはリアルタイムのランキングの成績を自動的にカバーせず、最新の成績の安定したエクスポートと再表示の範囲は確認が必要です。
成績は Scale AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。