本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

Arena Vision Style-Controlled

LMArena · 人が画像付きの回答にブラインド投票し、視覚理解の実際の使い心地を見ます。

公式の評価
Karu News での扱い順位に反映
証拠の予算6%
元データの時刻10/2(金) 09:00
直近の同期10/7(水) 08:05

何を、どう測るか

公式データセット vision_style_control の overall だけを読み取ります。画像生成と画像編集は含みません。

この証拠の使い方

視覚の予算のうち 6% です。人の好みの証拠であり、厳密な画像の正確さとは同じではありません。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1claude-fable-5-highAnthropic1,308.8High 推論
2qwen3.8-maxAlibaba1,301.2出典のデフォルト構成
3claude-opus-4-6-highAnthropic1,299.4High 推論
5claude-opus-4-7-highAnthropic1,297.7High 推論
6gemini-3.7-flash-highGoogle1,296High 推論
8muse-sparkMeta1,293.6出典のデフォルト構成
9muse-spark-1.2 (xHigh)Meta1,292.8xHigh 推論
10gpt-6.1-sol-maxopenai1,290.6Max 推論
11gemini-3.8-flash-highGoogle1,290.3High 推論
12muse-spark-1.3-maxMeta1,290.2Max 推論
13gemini-3-proGoogle1,289.3出典のデフォルト構成
14claude-opus-5-highAnthropic1,289High 推論
15claude-fable-5.1-maxAnthropic1,287.7Max 推論
17claude-opus-4-8-highAnthropic1,286.4High 推論
18gpt-5.6-sol-xhighOpenAI1,284.7xHigh 推論
20gpt-6-astra-maxOpenAI1,284.3Max 推論
21gemini-3.5-flash-highGoogle1,284.1High 推論
22gpt-5.4-highOpenAI1,283.8High 推論
23muse-spark-1.1Meta1,281.1出典のデフォルト構成
24gpt-5.5-highOpenAI1,281High 推論
25gemini-3.6-flash-highGoogle1,279.7High 推論
27gemini-3.1-pro-previewGoogle1,279.3出典のデフォルト構成
28grok-4.5xAI1,279出典のデフォルト構成
30glm-5.3-flashZ.ai1,278.4出典のデフォルト構成
31gpt-5.2-chat-latest-20260210OpenAI1,278出典のデフォルト構成
32gpt-5.5-instantOpenAI1,276出典のデフォルト構成
33claude-sonnet-4-6Anthropic1,275.2出典のデフォルト構成
34gemini-3-flashGoogle1,272.9出典のデフォルト構成
35claude-sonnet-5.5-xhighanthropic1,268.3xHigh 推論
36gpt-5.6-terra-xhighOpenAI1,268.2xHigh 推論
評価の限界と、データの帰属

人の好みは、文体、ユーザーの構成、プロンプトの分布に左右されます。全体と創作の分類には重なった投票があり、もとの人の好みの予算を共有するので、独立した 2 機関とは数えません。

データのライセンス:CC BY 4.0

成績は LMArena が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。