評価のソース公式の評価
Arena Vision Style-Controlled
LMArena · 人が画像付きの回答にブラインド投票し、視覚理解の実際の使い心地を見ます。
Karu News での扱い順位に反映
証拠の予算6%
元データの時刻10/2(金) 09:00
直近の同期10/7(水) 08:05
何を、どう測るか
公式データセット vision_style_control の overall だけを読み取ります。画像生成と画像編集は含みません。
この証拠の使い方
視覚の予算のうち 6% です。人の好みの証拠であり、厳密な画像の正確さとは同じではありません。
評価の成績
固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。
| 元の順位 | 元の型番 | 元の成績 | 代表の設定 |
|---|---|---|---|
| 1 | claude-fable-5-highAnthropic | 1,308.8 | High 推論 |
| 2 | qwen3.8-maxAlibaba | 1,301.2 | 出典のデフォルト構成 |
| 3 | claude-opus-4-6-highAnthropic | 1,299.4 | High 推論 |
| 5 | claude-opus-4-7-highAnthropic | 1,297.7 | High 推論 |
| 6 | gemini-3.7-flash-highGoogle | 1,296 | High 推論 |
| 8 | muse-sparkMeta | 1,293.6 | 出典のデフォルト構成 |
| 9 | muse-spark-1.2 (xHigh)Meta | 1,292.8 | xHigh 推論 |
| 10 | gpt-6.1-sol-maxopenai | 1,290.6 | Max 推論 |
| 11 | gemini-3.8-flash-highGoogle | 1,290.3 | High 推論 |
| 12 | muse-spark-1.3-maxMeta | 1,290.2 | Max 推論 |
| 13 | gemini-3-proGoogle | 1,289.3 | 出典のデフォルト構成 |
| 14 | claude-opus-5-highAnthropic | 1,289 | High 推論 |
| 15 | claude-fable-5.1-maxAnthropic | 1,287.7 | Max 推論 |
| 17 | claude-opus-4-8-highAnthropic | 1,286.4 | High 推論 |
| 18 | gpt-5.6-sol-xhighOpenAI | 1,284.7 | xHigh 推論 |
| 20 | gpt-6-astra-maxOpenAI | 1,284.3 | Max 推論 |
| 21 | gemini-3.5-flash-highGoogle | 1,284.1 | High 推論 |
| 22 | gpt-5.4-highOpenAI | 1,283.8 | High 推論 |
| 23 | muse-spark-1.1Meta | 1,281.1 | 出典のデフォルト構成 |
| 24 | gpt-5.5-highOpenAI | 1,281 | High 推論 |
| 25 | gemini-3.6-flash-highGoogle | 1,279.7 | High 推論 |
| 27 | gemini-3.1-pro-previewGoogle | 1,279.3 | 出典のデフォルト構成 |
| 28 | grok-4.5xAI | 1,279 | 出典のデフォルト構成 |
| 30 | glm-5.3-flashZ.ai | 1,278.4 | 出典のデフォルト構成 |
| 31 | gpt-5.2-chat-latest-20260210OpenAI | 1,278 | 出典のデフォルト構成 |
| 32 | gpt-5.5-instantOpenAI | 1,276 | 出典のデフォルト構成 |
| 33 | claude-sonnet-4-6Anthropic | 1,275.2 | 出典のデフォルト構成 |
| 34 | gemini-3-flashGoogle | 1,272.9 | 出典のデフォルト構成 |
| 35 | claude-sonnet-5.5-xhighanthropic | 1,268.3 | xHigh 推論 |
| 36 | gpt-5.6-terra-xhighOpenAI | 1,268.2 | xHigh 推論 |
評価の限界と、データの帰属
人の好みは、文体、ユーザーの構成、プロンプトの分布に左右されます。全体と創作の分類には重なった投票があり、もとの人の好みの予算を共有するので、独立した 2 機関とは数えません。
データのライセンス:CC BY 4.0
成績は LMArena が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。