評価のソース公式の評価
Arena Text Style-Controlled
LMArena · 人が匿名で回答を二つずつ比べ、どちらが読みたいかを見ます。選択式問題では見えない、全体的な使い心地を補います。
Karu News での扱い順位に反映
証拠の予算5%
元データの時刻10/2(金) 09:00
直近の同期10/7(水) 08:05
何を、どう測るか
公式が公開したスナップショットの Text Overall style-controlled の総合ランキングだけを使い、arena.ai のリアルタイムページは取得しません。
この証拠の使い方
人の好みの予算 10% を、全体 5% と創作 5% に分けます。Arena のコーディングと視覚の評価とは証拠ファミリーを共有します。新旧は公式の成績データの時刻で判断します。
評価の成績
固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。
| 元の順位 | 元の型番 | 元の成績 | 代表の設定 |
|---|---|---|---|
| 1 | gemini-4-argon-highgoogle | 1,525.2 | High 推論 |
| 2 | claude-opus-4-6-highAnthropic | 1,504.7 | High 推論 |
| 3 | claude-fable-5-highAnthropic | 1,504.3 | High 推論 |
| 4 | claude-opus-5.5-highAnthropic | 1,503.7 | High 推論 |
| 5 | claude-opus-4-7-highAnthropic | 1,501.3 | High 推論 |
| 6 | claude-fable-5.1-maxAnthropic | 1,501.1 | Max 推論 |
| 8 | gemini-3.8-flash-highGoogle | 1,494.8 | High 推論 |
| 9 | muse-spark-1.3-maxMeta | 1,494.3 | Max 推論 |
| 11 | muse-spark-1.2 (xHigh)Meta | 1,493.5 | xHigh 推論 |
| 12 | muse-spark-1.1Meta | 1,491.3 | 出典のデフォルト構成 |
| 14 | claude-opus-5-maxAnthropic | 1,489.5 | Max 推論 |
| 15 | muse-sparkMeta | 1,489.3 | 出典のデフォルト構成 |
| 16 | kimi-k3-maxMoonshot AI | 1,488.4 | 出典のデフォルト構成 |
| 17 | gemini-3.7-flash-highGoogle | 1,487.7 | High 推論 |
| 18 | gemini-3.1-pro-previewGoogle | 1,487 | 出典のデフォルト構成 |
| 19 | gemini-3-proGoogle | 1,485.5 | 出典のデフォルト構成 |
| 20 | gpt-5.6-sol-xhighOpenAI | 1,483.9 | xHigh 推論 |
| 21 | gpt-6.1-sol-maxopenai | 1,483.2 | Max 推論 |
| 22 | gemini-3.6-flash-highGoogle | 1,483 | High 推論 |
| 23 | qwen3.8-maxAlibaba | 1,481.6 | 出典のデフォルト構成 |
| 24 | claude-opus-4-8-highAnthropic | 1,481.5 | High 推論 |
| 25 | gpt-5.5-highOpenAI | 1,481.4 | High 推論 |
| 26 | mimo-v2.6-proXiaomi | 1,480.1 | 出典のデフォルト構成 |
| 27 | glm-5.3-maxZ.ai | 1,478.5 | 出典のデフォルト構成 |
| 28 | gemini-3.5-flash-highGoogle | 1,477.4 | High 推論 |
| 29 | gpt-6-astra-maxOpenAI | 1,477.1 | Max 推論 |
| 32 | glm-5.2-maxZ.ai | 1,475.8 | 出典のデフォルト構成 |
| 33 | gpt-5.2-chat-latest-20260210OpenAI | 1,475.7 | 出典のデフォルト構成 |
| 34 | gpt-5.4-highOpenAI | 1,475.2 | High 推論 |
| 35 | qwen3.7-max-previewAlibaba | 1,474.9 | 出典のデフォルト構成 |
評価の限界と、データの帰属
人の好みは、文体、ユーザーの構成、プロンプトの分布に左右されます。全体と創作の分類には重なった投票があり、もとの人の好みの予算を共有するので、独立した 2 機関とは数えません。
データのライセンス:CC BY 4.0
成績は LMArena が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。