評価のソース公式の評価
Hyper-τ-bench
Sierra / コーディング · 業務資料をもとに、実際に動くカスタマーサービスのエージェントを構築し、テストします。
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません
何を、どう測るか
エージェントの開発とデバッグを測るもので、カスタマーサービスを直接実行する τ³-Banking とは別です。開発ツール、実行時間、受け入れ環境を固定し、システムをまたいで最高成績を選ぶことはできません。
この証拠の使い方
観察中:コーディングと業務システム開発を補えます。先に元の成績、ライセンス、固定した実行条件を審査します。新しく公開されたからといって、自動では採点しません。
評価の限界と、データの帰属
観察中:コーディングと業務システム開発を補えます。先に元の成績、ライセンス、固定した実行条件を審査します。新しく公開されたからといって、自動では採点しません。
データのライセンス:ランキングデータの利用範囲を確認中です。
成績は Sierra が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。