本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

Hyper-τ-bench

Sierra / コーディング · 業務資料をもとに、実際に動くカスタマーサービスのエージェントを構築し、テストします。

公式の評価
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません

何を、どう測るか

エージェントの開発とデバッグを測るもので、カスタマーサービスを直接実行する τ³-Banking とは別です。開発ツール、実行時間、受け入れ環境を固定し、システムをまたいで最高成績を選ぶことはできません。

この証拠の使い方

観察中:コーディングと業務システム開発を補えます。先に元の成績、ライセンス、固定した実行条件を審査します。新しく公開されたからといって、自動では採点しません。

評価の限界と、データの帰属

観察中:コーディングと業務システム開発を補えます。先に元の成績、ライセンス、固定した実行条件を審査します。新しく公開されたからといって、自動では採点しません。

データのライセンス:ランキングデータの利用範囲を確認中です。

成績は Sierra が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。