本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

Long-Horizon Terminal-Bench

Tencent HY / Lehigh ほか / コーディング · 長い時間ターミナルを使い続け、複雑なエンジニアリングとツールのタスクをこなします。

公式の評価
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません

何を、どう測るか

90 分、2 時間、3 時間の予算を別々に比べます。修正の前後で採点プロトコルが異なるものは同じ並びにできず、異なる Agent の最良の結果を統一したモデルの成績とすることもできません。

この証拠の使い方

候補の観察:修正のプロトコルが明記された新しいバッチを待っています。現在の古いスコアは公開ランキングに自動で取り込まず、採点もしません。古い結果のすべてが不具合を利用したとは断定しません。

評価の限界と、データの帰属

公式が採点情報の漏えいを開示しています。現在の成績が、隔離した採点後の同じプロトコルのものであるとは証明できません。ほかの専門評価とタスクが一部重なっており、確認が必要です。

データのライセンス:Apache 2.0 · 公式 IntelligenceLab/LHTB-leaderboard の成績データセットです。クレジット表記と変更の説明を残します。

成績は Tencent HY / Lehigh ほか が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。