本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

DeepSWE v1.1

DataCurve / コーディング · 統一したコーディングアシスタント環境でリポジトリを直し、不具合を修正します。比べるのは、コードを書くモデルそのものです。

公式の評価
Karu News での扱い順位に反映
証拠の予算3.6%
元データの時刻9/22(火) 15:27
直近の同期10/7(水) 08:05

何を、どう測るか

pass@1 だけを使います。統一した harness の中で、あらかじめ固定した推論段階の優先順位で代表構成を選びます。

この証拠の使い方

コーディングとデザインの予算のうち 3.6% です。管理されたシステムとバージョンを固定します。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
2gemini-3-8-flashGoogle73.8%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
3claude-opus-5Anthropic73.6%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
4gpt-6-astraOpenAI73.2%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
9gpt-5-6-solOpenAI72.7%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
13claude-fable-5Anthropic69.7%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
14gpt-5-6-terraOpenAI69.6%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
16glm-5-3Z.ai69.0%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
19kimi-k3Moonshot AI68.5%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
21gpt-5-6-lunaOpenAI67.2%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
22gpt-5-5OpenAI67.0%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
24grok-4-6xAI66.7%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
27gemini-3-7-flashGoogle65.3%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
30glm-5-3-flashZ.ai63.4%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
31deepseek-v4-proDeepSeek62.8%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
35claude-opus-4-8Anthropic59.0%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
37qwen3-8-maxAlibaba57.5%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
39muse-spark-1-2Meta54.9%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
42claude-sonnet-5Anthropic53.8%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
43grok-4-5xAI53.8%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46deepseek-v4-flashDeepSeek53.3%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
46muse-spark-1-1Meta53.3%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
48gpt-5-4OpenAI51.8%xHigh 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
53gemini-3-6-flashGoogle46.7%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
56glm-5-2Z.ai43.8%Max 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
61gemini-3-5-flashGoogle36.1%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
63kimi-k2-7-codeMoonshot AI30.5%完全なシステム · mini-swe-agent · deepswe-v1.1:mini-swe-agent
65claude-sonnet-4-6Anthropic29.9%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
68gemini-3-1-pro-previewGoogle11.7%High 推論 · mini-swe-agent · deepswe-v1.1:mini-swe-agent
評価の限界と、データの帰属

モデルと mini-swe-agent を合わせたシステムの成績です。大きなバージョン変更では、スナップショットを分けて扱う必要があります。

データのライセンス:公式が構造化された結果を公開しています。管理者だけが非公開で観察し、公開前にライセンスを再確認します。

成績は DataCurve が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。