評価のソース公式の評価
Humanity’s Last Exam
CAIS / Scale AI / 知識 · 分野をまたぐ、難度の高い学術知識と推論
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません
何を、どう測るか
問題集、ツールの条件、審判を固定し、HLE、HLE-Rolling、ツール付きの結果を別々に比べます。AA v4.3 にはすでに HLE が含まれているため、将来使える専門成績があっても、分類にだけ使い、総合ランキングでは二重に票を数えません。
この証拠の使い方
観察中:公式は一部の新製品を追加しましたが、元の成績には検証できる評価日がまだありません。Epoch の自己評価データのライセンスは当てはめず、すでにある AA の総合の証拠に再び加点することもしません。
評価の限界と、データの帰属
観察中:公式は一部の新製品を追加しましたが、元の成績には検証できる評価日がまだありません。Epoch の自己評価データのライセンスは当てはめず、すでにある AA の総合の証拠に再び加点することもしません。
データのライセンス:評価コードは MIT です。公式ランキングの成績の再表示の範囲は、まだ確認できていません。
成績は CAIS / Scale AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。