評価のソース公式の評価
Arena Creative Writing
LMArena · 人が物語、詩、その他の創作表現にブラインド投票し、作品が読者を引きつけるかを見ます。
Karu News での扱い順位に反映
証拠の予算5%
元データの時刻10/2(金) 09:00
直近の同期10/7(水) 08:05
何を、どう測るか
公式データセット text_style_control の creative_writing 分類から、スタイル制御後の Bradley–Terry スコアと信頼区間を読み取ります。全体のテキストや職業的な文章の分類の成績は借りません。
この証拠の使い方
正式に採点します。もとの人の好み 10% から 5% を分け、全体のテキストには 5% を残します。予算の総量は増えません。Arena の他のタスクとは証拠ファミリーを共有します。
評価の成績
固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。
| 元の順位 | 元の型番 | 元の成績 | 代表の設定 |
|---|---|---|---|
| 1 | gemini-4-argon-highgoogle | 1,518.8 | High 推論 |
| 2 | claude-opus-5.5-highAnthropic | 1,516.3 | High 推論 |
| 3 | claude-fable-5-highAnthropic | 1,502.6 | High 推論 |
| 4 | claude-opus-4-6-highAnthropic | 1,500.8 | High 推論 |
| 5 | gemini-3.7-flash-highGoogle | 1,493.4 | High 推論 |
| 6 | claude-opus-4-7-highAnthropic | 1,489 | High 推論 |
| 7 | gemini-3.8-flash-highGoogle | 1,484.5 | High 推論 |
| 8 | gemini-3-proGoogle | 1,484.4 | 出典のデフォルト構成 |
| 10 | claude-fable-5.1-maxAnthropic | 1,481.8 | Max 推論 |
| 11 | gemini-3.1-pro-previewGoogle | 1,480.3 | 出典のデフォルト構成 |
| 14 | gemini-3.6-flash-highGoogle | 1,470.9 | High 推論 |
| 15 | claude-opus-5-maxAnthropic | 1,470.6 | Max 推論 |
| 16 | claude-opus-4-5-20251101-high-32kAnthropic | 1,469.5 | High 推論 · 32k |
| 17 | claude-opus-4-8-highAnthropic | 1,469.5 | High 推論 |
| 19 | gpt-5.6-sol-xhighOpenAI | 1,468.3 | xHigh 推論 |
| 20 | qwen3.8-maxAlibaba | 1,467.9 | 出典のデフォルト構成 |
| 21 | muse-sparkMeta | 1,465.5 | 出典のデフォルト構成 |
| 22 | gemini-3.5-flash-highGoogle | 1,463.9 | High 推論 |
| 24 | grok-4.20-beta1xAI | 1,463 | 出典のデフォルト構成 |
| 26 | kimi-k3-maxMoonshot AI | 1,460.2 | 出典のデフォルト構成 |
| 27 | gpt-6.1-sol-maxopenai | 1,459.7 | Max 推論 |
| 28 | muse-spark-1.3-maxMeta | 1,458.7 | Max 推論 |
| 29 | gemini-3-flashGoogle | 1,456.8 | 出典のデフォルト構成 |
| 30 | gpt-5.5-instantOpenAI | 1,456.4 | 出典のデフォルト構成 |
| 31 | muse-spark-1.2 (xHigh)Meta | 1,455.5 | xHigh 推論 |
| 32 | glm-5.2-maxZ.ai | 1,454.2 | 出典のデフォルト構成 |
| 34 | glm-5.3-maxZ.ai | 1,453.9 | 出典のデフォルト構成 |
| 35 | gpt-5.5-highOpenAI | 1,451.3 | High 推論 |
| 36 | grok-4.5xAI | 1,450.2 | 出典のデフォルト構成 |
| 37 | claude-sonnet-4-5-20250929-high-32kAnthropic | 1,450 | High 推論 · 32k |
評価の限界と、データの帰属
公開されたユーザーのプロンプトは分類器で振り分けたもので、すべてが長編小説や日本語の創作とは限りません。投票には個人の好みが含まれます。Arena の全体テキストと職業的な文章の分類とは重なりがあり、追加の独立機関としては数えません。
データのライセンス:CC BY 4.0 · Arena 公式の Hugging Face leaderboard-dataset です。クレジット表記と出典リンクを残し、集計で加えた変更を明記します。
成績は LMArena が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。