本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

SWE-rebench

Nebius / コーディング · 実際のリポジトリの課題を集め続け、複数のプログラミング言語でモデルのソフトウェア修正力を比べます。

公式の評価
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません

何を、どう測るか

タスクの窓、ReAct 環境、text/tools の対話プロトコルを固定し、複数回の実行の平均解決率と標準誤差を使います。完全な Agent 製品と基礎モデルを同じ対象として扱いません。

この証拠の使い方

候補の観察:実際のリポジトリのタスクは補う価値があります。検証できる実行日、安定した成績のプロトコル、再表示の範囲を待っており、自動収集と採点はまだ有効にしていません。

評価の限界と、データの帰属

ローリングの問題、実行環境、タスクの窓が比較のしやすさに影響します。サイトが最近メンテナンスされたことは、すべてのモデルを再テストしたことを意味しません。

データのライセンス:公式の Hugging Face の CC BY 4.0 データセットはタスクの問題集です。ウェブ上の最終成績の安定したエクスポートと再表示の範囲は、まだ確認できていません。

成績は Nebius が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。