本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

LiveBench · 言語と指示

LiveBench · Language と IF の 2 項目の平均で、それぞれ 50% を占めます。

公式の評価
Karu News での扱い順位に反映
証拠の予算3%
元データの時刻9/30(水) 04:01
直近の同期10/7(水) 08:05

何を、どう測るか

Language と IF の分類成績を別々に計算し、それぞれ 50% で平均して、小数第 1 位まで残します。公式サイトで 1 つの分類だけを選んだときの成績とは異なります。Language は言語理解、IF は指示と書式の制約を測るもので、小説の文章力を評価するものではありません。

この証拠の使い方

総合ランキングの文章と表現の予算のうち 3% を残します。文学創作の文章分類には入れません。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1gemini-3.8-flash-highGoogle84.6%High 推論
2claude-fable-5-max-effortAnthropic83.2%Max 推論
3gemini-3.7-flash-highGoogle82.7%High 推論
4gpt-6-astra-maxOpenAI82.5%Max 推論
5gemini-3.1-pro-preview-highGoogle82.2%High 推論
6gpt-6.1-sol-maxopenai82.1%Max 推論
7claude-fable-5-1-max-effortAnthropic81.2%Max 推論
8muse-spark-1.3-xhighMeta80.4%xHigh 推論
9gemini-3.5-flash-highGoogle80.1%High 推論
11gpt-5.6-sol-maxOpenAI79.8%Max 推論
12gemini-3.6-flash-highGoogle79.6%High 推論
13gpt-5.5-xhighOpenAI79.0%xHigh 推論
14kimi-k3Moonshot AI78.4%出典のデフォルト構成
15grok-4.6xAI77.8%出典のデフォルト構成
16grok-4.7-xhighxAI77.7%xHigh 推論
17smaug-agenticAbacus.AI77.7%出典のデフォルト構成
18grok-4.5xAI77.2%出典のデフォルト構成
20gpt-6-sol-maxOpenAI76.9%Max 推論
21qwen3.7-maxAlibaba76.9%出典のデフォルト構成
22qwen3.8-maxAlibaba76.9%出典のデフォルト構成
23muse-spark-1.2-xhighMeta76.4%xHigh 推論
24gpt-5.4-xhighOpenAI76.4%xHigh 推論
26claude-opus-5-max-effortAnthropic76.2%Max 推論
27claude-opus-5-5-max-effortAnthropic76.0%Max 推論
28qwen3.8-flash-nextAlibaba75.9%出典のデフォルト構成
29claude-opus-4-8-max-effortAnthropic75.8%Max 推論
30deepseek-v4-flash-vision-expDeepSeek75.7%出典のデフォルト構成
31deepseek-v4.1-flash-maxDeepSeek75.6%出典のデフォルト構成
32smaug-miniAbacus.AI75.5%出典のデフォルト構成
33deepseek-v4-pro-0813DeepSeek74.9%出典のデフォルト構成
評価の限界と、データの帰属

2 項目の平均は組み合わせの成績で、Language 単独の成績として扱えません。公式ページで分類を切り替えたり、ファインチューニング済みモデルを含めたりすると、スコアと順位が変わります。運営に関わる Abacus.AI は Smaug モデルも開発しているため、同社だけの成績は独立した別の出典で補う必要があります。

データのライセンス:Apache 2.0

項目別の成績は LiveBench が公開したものです。Karu News は上の 2 分類を同じ重みで集計して順位を付けています。2 項目の平均と Karu News の総合スコアは尺度が異なるので、そのまま足せません。