評価のソース公式の評価
Arena WebDev
LMArena · 同じく人によるブラインド投票で、ウェブページが使えるか、納品できるかを比べます。
Karu News での扱い順位に反映
証拠の予算2.4%
元データの時刻10/1(木) 09:00
直近の同期10/7(水) 08:05
何を、どう測るか
公式が公開したスナップショットの WebDev 総合ランキングだけを使い、arena.ai のリアルタイムページは取得しません。Text とあわせて Arena ファミリーの 1 票になります。
この証拠の使い方
コーディングとデザインの予算のうち 2.4% です。美的な分類でウェブ作品の好みを測るもので、コードの正しさとは同じではありません。Arena の他のタスクとは証拠ファミリーを共有します。
評価の成績
固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。
| 元の順位 | 元の型番 | 元の成績 | 代表の設定 |
|---|---|---|---|
| 1 | claude-opus-5.5-maxAnthropic | 1,815.4 | Max 推論 |
| 2 | gpt-6-astra-maxOpenAI | 1,787.7 | Max 推論 |
| 3 | claude-sonnet-5.5-xhighanthropic | 1,786.3 | xHigh 推論 |
| 4 | gpt-6.1-sol-maxopenai | 1,757.8 | Max 推論 |
| 5 | claude-fable-5.1-maxAnthropic | 1,749.2 | Max 推論 |
| 7 | claude-opus-5-maxAnthropic | 1,695 | Max 推論 |
| 8 | gpt-6-sol-maxOpenAI | 1,689 | Max 推論 |
| 9 | gemini-4-argon-highgoogle | 1,679.5 | High 推論 |
| 10 | qwen3.8-maxAlibaba | 1,671.2 | 出典のデフォルト構成 |
| 11 | qwen3.8-max-0902Alibaba | 1,670 | 出典のデフォルト構成 |
| 13 | kimi-k3-maxMoonshot AI | 1,657.8 | 出典のデフォルト構成 |
| 14 | muse-spark-1.3-maxMeta | 1,656.6 | Max 推論 |
| 15 | grok-4.7-xhighxAI | 1,637.5 | xHigh 推論 |
| 16 | qwen3.8-flash-nextAlibaba | 1,637.5 | 出典のデフォルト構成 |
| 17 | hy4-previewTencent | 1,633.2 | 出典のデフォルト構成 |
| 18 | claude-fable-5-highAnthropic | 1,625.3 | High 推論 |
| 20 | glm-5.3-maxZ.ai | 1,623 | 出典のデフォルト構成 |
| 21 | deepseek-v4.1-flash-maxDeepSeek | 1,619.9 | 出典のデフォルト構成 |
| 22 | gpt-5.6-sol-xhigh (codex-harness)OpenAI | 1,619.8 | xHigh 推論 · codex-harness |
| 23 | grok-4.6-highxAI | 1,619.5 | High 推論 |
| 24 | mimo-v2.6-proXiaomi | 1,618.4 | 出典のデフォルト構成 |
| 25 | glm-5.3-flashZ.ai | 1,615.6 | 出典のデフォルト構成 |
| 26 | glm-5.2-maxZ.ai | 1,605 | 出典のデフォルト構成 |
| 27 | gemini-3.7-flash-highGoogle | 1,591.7 | High 推論 |
| 28 | qwen3.8-27bAlibaba | 1,591.2 | 出典のデフォルト構成 |
| 29 | gemini-3.8-flash-highGoogle | 1,582.7 | High 推論 |
| 30 | deepseek-v4-pro-high-20260813DeepSeek | 1,582.6 | 出典のデフォルト構成 |
| 31 | deepseek-v4-flash-highDeepSeek | 1,581 | 出典のデフォルト構成 |
| 32 | gpt-6-luna-maxOpenAI | 1,578.7 | Max 推論 |
| 33 | step-5-preview-highStepFun | 1,570.2 | 出典のデフォルト構成 |
評価の限界と、データの帰属
Text とは好みの構成概念に相関があります。
データのライセンス:CC BY 4.0
成績は LMArena が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。