本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

Arena Text Style-Controlled

LMArena · 人が匿名で回答を二つずつ比べ、どちらが読みたいかを見ます。選択式問題では見えない、全体的な使い心地を補います。

公式の評価
Karu News での扱い順位に反映
証拠の予算5%
元データの時刻10/2(金) 09:00
直近の同期10/7(水) 08:05

何を、どう測るか

公式が公開したスナップショットの Text Overall style-controlled の総合ランキングだけを使い、arena.ai のリアルタイムページは取得しません。

この証拠の使い方

人の好みの予算 10% を、全体 5% と創作 5% に分けます。Arena のコーディングと視覚の評価とは証拠ファミリーを共有します。新旧は公式の成績データの時刻で判断します。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1gemini-4-argon-highgoogle1,525.2High 推論
2claude-opus-4-6-highAnthropic1,504.7High 推論
3claude-fable-5-highAnthropic1,504.3High 推論
4claude-opus-5.5-highAnthropic1,503.7High 推論
5claude-opus-4-7-highAnthropic1,501.3High 推論
6claude-fable-5.1-maxAnthropic1,501.1Max 推論
8gemini-3.8-flash-highGoogle1,494.8High 推論
9muse-spark-1.3-maxMeta1,494.3Max 推論
11muse-spark-1.2 (xHigh)Meta1,493.5xHigh 推論
12muse-spark-1.1Meta1,491.3出典のデフォルト構成
14claude-opus-5-maxAnthropic1,489.5Max 推論
15muse-sparkMeta1,489.3出典のデフォルト構成
16kimi-k3-maxMoonshot AI1,488.4出典のデフォルト構成
17gemini-3.7-flash-highGoogle1,487.7High 推論
18gemini-3.1-pro-previewGoogle1,487出典のデフォルト構成
19gemini-3-proGoogle1,485.5出典のデフォルト構成
20gpt-5.6-sol-xhighOpenAI1,483.9xHigh 推論
21gpt-6.1-sol-maxopenai1,483.2Max 推論
22gemini-3.6-flash-highGoogle1,483High 推論
23qwen3.8-maxAlibaba1,481.6出典のデフォルト構成
24claude-opus-4-8-highAnthropic1,481.5High 推論
25gpt-5.5-highOpenAI1,481.4High 推論
26mimo-v2.6-proXiaomi1,480.1出典のデフォルト構成
27glm-5.3-maxZ.ai1,478.5出典のデフォルト構成
28gemini-3.5-flash-highGoogle1,477.4High 推論
29gpt-6-astra-maxOpenAI1,477.1Max 推論
32glm-5.2-maxZ.ai1,475.8出典のデフォルト構成
33gpt-5.2-chat-latest-20260210OpenAI1,475.7出典のデフォルト構成
34gpt-5.4-highOpenAI1,475.2High 推論
35qwen3.7-max-previewAlibaba1,474.9出典のデフォルト構成
評価の限界と、データの帰属

人の好みは、文体、ユーザーの構成、プロンプトの分布に左右されます。全体と創作の分類には重なった投票があり、もとの人の好みの予算を共有するので、独立した 2 機関とは数えません。

データのライセンス:CC BY 4.0

成績は LMArena が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。