評価のソース公式の評価
ToneBench · 文体と脚本
Towards AI · 指定した書き手の文体で動画の脚本を書き、冒頭、構成、表現、語りのテンポを見ます。
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません
何を、どう測るか
10 の実際の脚本タスクを複数回生成し、3 社の審判が評価します。同じタスク、rubric、審判、実行の指紋だけを比べます。混合モデルへのフォールバック行は除き、列ごとの最高成績から構成を選ぶことはしません。
この証拠の使い方
観察中:データ規約と当期のカバー範囲は良好です。成績の再表示の範囲を確認し、純粋なモデル構成であることを検証する必要があります。
評価の限界と、データの帰属
Towards AI の単一チャンネルの文体に偏っており、正確な題目と参考脚本は公開されていません。現在の 1 位は Fable 5 + Opus 4.8 のフォールバックを含むので、単一の型番の成績とは言えません。
データのライセンス:公開 JSON は読み取れますが、データの集計と再表示についての明確な条項は見つかっていません。
成績は Towards AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。