本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

Humanity’s Last Exam

CAIS / Scale AI / 知識 · 分野をまたぐ、難度の高い学術知識と推論

公式の評価
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません

何を、どう測るか

問題集、ツールの条件、審判を固定し、HLE、HLE-Rolling、ツール付きの結果を別々に比べます。AA v4.3 にはすでに HLE が含まれているため、将来使える専門成績があっても、分類にだけ使い、総合ランキングでは二重に票を数えません。

この証拠の使い方

観察中:公式は一部の新製品を追加しましたが、元の成績には検証できる評価日がまだありません。Epoch の自己評価データのライセンスは当てはめず、すでにある AA の総合の証拠に再び加点することもしません。

評価の限界と、データの帰属

観察中:公式は一部の新製品を追加しましたが、元の成績には検証できる評価日がまだありません。Epoch の自己評価データのライセンスは当てはめず、すでにある AA の総合の証拠に再び加点することもしません。

データのライセンス:評価コードは MIT です。公式ランキングの成績の再表示の範囲は、まだ確認できていません。

成績は CAIS / Scale AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。