本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

ToneBench · 文体と脚本

Towards AI · 指定した書き手の文体で動画の脚本を書き、冒頭、構成、表現、語りのテンポを見ます。

公式の評価
Karu News での扱い観察中
証拠の予算点数に使いません
元データの時刻不明
直近の同期まだ集めていません

何を、どう測るか

10 の実際の脚本タスクを複数回生成し、3 社の審判が評価します。同じタスク、rubric、審判、実行の指紋だけを比べます。混合モデルへのフォールバック行は除き、列ごとの最高成績から構成を選ぶことはしません。

この証拠の使い方

観察中:データ規約と当期のカバー範囲は良好です。成績の再表示の範囲を確認し、純粋なモデル構成であることを検証する必要があります。

評価の限界と、データの帰属

Towards AI の単一チャンネルの文体に偏っており、正確な題目と参考脚本は公開されていません。現在の 1 位は Fable 5 + Opus 4.8 のフォールバックを含むので、単一の型番の成績とは言えません。

データのライセンス:公開 JSON は読み取れますが、データの集計と再表示についての明確な条項は見つかっていません。

成績は Towards AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。