本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

Longform Writing

EQ-Bench · 長編物語の一貫性と完結度

公式の評価
Karu News での扱い順位に反映
証拠の予算2.4%
元データの時刻9/24(木) 16:57
直近の同期10/7(水) 08:05

何を、どう測るか

overall_score_100 を使います。8 章の長文の筋と表現を採点し、審判の好みは制約として開示します。

この証拠の使い方

正式に採点します。2 つの文章ランキングを合わせて 6% を占め、問題数やモデル数で重みを増やしません。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1claude-opus-5Anthropic86.3出典のデフォルト構成
2claude-fable-5-1Anthropic85.3出典のデフォルト構成
3claude-opus-5-5Anthropic84.6出典のデフォルト構成
4grok-4.7xAI83出典のデフォルト構成
4claude-fable-5Anthropic83出典のデフォルト構成
6gpt-6-astraOpenAI82.8出典のデフォルト構成
6gpt-6-solOpenAI82.8出典のデフォルト構成
6muse-spark-1.3Meta82.8出典のデフォルト構成
9aion-3.5aion-labs82.1出典のデフォルト構成
10claude-opus-4-7Anthropic81.8出典のデフォルト構成
10GLM-5.3Z.ai81.8出典のデフォルト構成
12gpt-5.6-solOpenAI81.7出典のデフォルト構成
13muse-spark-1.2Meta81.5出典のデフォルト構成
14claude-opus-4-8Anthropic80.8出典のデフォルト構成
15claude-sonnet-4-6Anthropic79.9出典のデフォルト構成
15ox-alpha不明79.9出典のデフォルト構成
17kimi-k3Moonshot AI79.6出典のデフォルト構成
18moonshotai/Kimi-K2.6Moonshot AI78.5出典のデフォルト構成
19gpt-5.4OpenAI78.3出典のデフォルト構成
19claude-sonnet-5Anthropic78.3出典のデフォルト構成
21gpt-5.5OpenAI78.2出典のデフォルト構成
22gpt-5.6-terraOpenAI78出典のデフォルト構成
23zai-org/GLM-5.2Z.ai77.9出典のデフォルト構成
24claude-opus-4-6Anthropic77.7出典のデフォルト構成
25gemini-3.8-flashGoogle76.8出典のデフォルト構成
26deepseek-ai/DeepSeek-V4-ProDeepSeek75.6出典のデフォルト構成
27gpt-5.6-lunaOpenAI75.5出典のデフォルト構成
28moonshotai/Kimi-K2.5Moonshot AI74.9出典のデフォルト構成
29Altworld/Hemmingway-1不明74.2出典のデフォルト構成
30deepseek-v4.1-flashDeepSeek74出典のデフォルト構成
評価の限界と、データの帰属

英語の文章が中心で、モデル審判に依存します。同じ審判と関連するタスクは予算を共有し、日本語の文章力を示すものではありません。

データのライセンス:MIT · EQ-bench-site README のメタデータの記載です。

成績は EQ-Bench が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。