本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

Creative Writing v3

EQ-Bench · 短編の創作と表現

公式の評価
Karu News での扱い順位に反映
証拠の予算3.6%
元データの時刻9/24(木) 16:57
直近の同期10/7(水) 08:05

何を、どう測るか

公式 CSV はデータスクリプトに埋め込まれ、Elo を使います。勝敗は Sonnet 4.6 が判定し、スタイル、繰り返し率、rubric は二重に票を数えません。

この証拠の使い方

正式に採点します。2 つの文章ランキングを合わせて 6% を占め、問題数やモデル数で重みを増やしません。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1gpt-6-astraOpenAI2,173.3出典のデフォルト構成
2claude-fable-5-1Anthropic2,162出典のデフォルト構成
3claude-opus-5Anthropic2,132.6出典のデフォルト構成
4gpt-6-solOpenAI2,124.7出典のデフォルト構成
5kimi-k3Moonshot AI2,082.3出典のデフォルト構成
6GLM-5.3Z.ai2,075出典のデフォルト構成
7claude-opus-5-5Anthropic2,050.1出典のデフォルト構成
8grok-4.7xAI2,006.7出典のデフォルト構成
9ox-alpha不明1,971.7出典のデフォルト構成
10gpt-5.6-solOpenAI1,971.6出典のデフォルト構成
11claude-fable-5Anthropic1,943.1出典のデフォルト構成
12aion-3.5aion-labs1,929.3出典のデフォルト構成
13muse-spark-1.1Meta1,927.1出典のデフォルト構成
14claude-opus-4-7Anthropic1,914.3出典のデフォルト構成
15Altworld/Hemmingway-1不明1,906.4出典のデフォルト構成
16muse-spark-1.3Meta1,905.9出典のデフォルト構成
17gpt-5.6-terraOpenAI1,854.9出典のデフォルト構成
18gpt-5.5OpenAI1,843.9出典のデフォルト構成
19Qwen/Qwen3.8-2.4T-A95BAlibaba1,842.5出典のデフォルト構成
20muse-spark-1.2Meta1,840.4出典のデフォルト構成
21claude-opus-4-8Anthropic1,839.8出典のデフォルト構成
22gpt-5.4OpenAI1,839.7出典のデフォルト構成
23gpt-5.6-lunaOpenAI1,828.7出典のデフォルト構成
24claude-sonnet-4-6Anthropic1,810.4出典のデフォルト構成
25claude-opus-4-6Anthropic1,809.1出典のデフォルト構成
26meta-models/Muse-Glimmer-30BMeta1,798.3出典のデフォルト構成
27claude-sonnet-5Anthropic1,794出典のデフォルト構成
28space-bunny-alphastealth1,784.3出典のデフォルト構成
29zai-org/GLM-5.2Z.ai1,756.5出典のデフォルト構成
30gemini-3.8-flashGoogle1,747.9出典のデフォルト構成
評価の限界と、データの帰属

英語の文章が中心で、モデル審判に依存します。同じ審判と関連するタスクは予算を共有し、日本語の文章力を示すものではありません。

データのライセンス:MIT · EQ-bench-site README のメタデータの記載です。

成績は EQ-Bench が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。