評価のソース公式の評価
Creative Writing v3
EQ-Bench · 短編の創作と表現
Karu News での扱い順位に反映
証拠の予算3.6%
元データの時刻9/24(木) 16:57
直近の同期10/7(水) 08:05
何を、どう測るか
公式 CSV はデータスクリプトに埋め込まれ、Elo を使います。勝敗は Sonnet 4.6 が判定し、スタイル、繰り返し率、rubric は二重に票を数えません。
この証拠の使い方
正式に採点します。2 つの文章ランキングを合わせて 6% を占め、問題数やモデル数で重みを増やしません。
評価の成績
固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。
| 元の順位 | 元の型番 | 元の成績 | 代表の設定 |
|---|---|---|---|
| 1 | gpt-6-astraOpenAI | 2,173.3 | 出典のデフォルト構成 |
| 2 | claude-fable-5-1Anthropic | 2,162 | 出典のデフォルト構成 |
| 3 | claude-opus-5Anthropic | 2,132.6 | 出典のデフォルト構成 |
| 4 | gpt-6-solOpenAI | 2,124.7 | 出典のデフォルト構成 |
| 5 | kimi-k3Moonshot AI | 2,082.3 | 出典のデフォルト構成 |
| 6 | GLM-5.3Z.ai | 2,075 | 出典のデフォルト構成 |
| 7 | claude-opus-5-5Anthropic | 2,050.1 | 出典のデフォルト構成 |
| 8 | grok-4.7xAI | 2,006.7 | 出典のデフォルト構成 |
| 9 | ox-alpha不明 | 1,971.7 | 出典のデフォルト構成 |
| 10 | gpt-5.6-solOpenAI | 1,971.6 | 出典のデフォルト構成 |
| 11 | claude-fable-5Anthropic | 1,943.1 | 出典のデフォルト構成 |
| 12 | aion-3.5aion-labs | 1,929.3 | 出典のデフォルト構成 |
| 13 | muse-spark-1.1Meta | 1,927.1 | 出典のデフォルト構成 |
| 14 | claude-opus-4-7Anthropic | 1,914.3 | 出典のデフォルト構成 |
| 15 | Altworld/Hemmingway-1不明 | 1,906.4 | 出典のデフォルト構成 |
| 16 | muse-spark-1.3Meta | 1,905.9 | 出典のデフォルト構成 |
| 17 | gpt-5.6-terraOpenAI | 1,854.9 | 出典のデフォルト構成 |
| 18 | gpt-5.5OpenAI | 1,843.9 | 出典のデフォルト構成 |
| 19 | Qwen/Qwen3.8-2.4T-A95BAlibaba | 1,842.5 | 出典のデフォルト構成 |
| 20 | muse-spark-1.2Meta | 1,840.4 | 出典のデフォルト構成 |
| 21 | claude-opus-4-8Anthropic | 1,839.8 | 出典のデフォルト構成 |
| 22 | gpt-5.4OpenAI | 1,839.7 | 出典のデフォルト構成 |
| 23 | gpt-5.6-lunaOpenAI | 1,828.7 | 出典のデフォルト構成 |
| 24 | claude-sonnet-4-6Anthropic | 1,810.4 | 出典のデフォルト構成 |
| 25 | claude-opus-4-6Anthropic | 1,809.1 | 出典のデフォルト構成 |
| 26 | meta-models/Muse-Glimmer-30BMeta | 1,798.3 | 出典のデフォルト構成 |
| 27 | claude-sonnet-5Anthropic | 1,794 | 出典のデフォルト構成 |
| 28 | space-bunny-alphastealth | 1,784.3 | 出典のデフォルト構成 |
| 29 | zai-org/GLM-5.2Z.ai | 1,756.5 | 出典のデフォルト構成 |
| 30 | gemini-3.8-flashGoogle | 1,747.9 | 出典のデフォルト構成 |
評価の限界と、データの帰属
英語の文章が中心で、モデル審判に依存します。同じ審判と関連するタスクは予算を共有し、日本語の文章力を示すものではありません。
データのライセンス:MIT · EQ-bench-site README のメタデータの記載です。
成績は EQ-Bench が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。