評価のソース公式の評価
Terminal-Bench 4 · システム参考
Harbor / Terminal-Bench / コーディング · モデルを異なる Agent と組み合わせたターミナルタスクの元の成績を残し、クロスチェックに使います。
Karu News での扱い参考のみ
証拠の予算点数に使いません
元データの時刻10/7(水) 08:02
直近の同期10/7(水) 08:05
何を、どう測るか
Terminal-Bench 4.0 を固定し、モデル、Agent のバージョン、推論段階、実行回数を別々に残します。異なるツールのシステムを、統一したモデル条件として解釈しません。
この証拠の使い方
元の成績の参考:公式の提出一覧とデータバージョンを固定してから自動収集し、異なるシステム構成を 1 件ずつ残します。モデルの代表スコアは選びません。クロスチェック専用で、総合とコーディングのランキングには入れません。
評価の成績
以下は、モデルにさまざまなエージェントを組み合わせたシステムの成績です。実行条件が異なるため、参考としてご覧ください。1 項目につき最大 30 件の構成を表示し、匿名のテスト用モデルは表示しません。
| 元の順位 | 元の型番 | 元の成績 | 実行の設定 |
|---|---|---|---|
| 1 | claude-opus-5-5Anthropic | 64.8% | Claude Code 2.1.284 · max 推論 |
| 2 | claude-sonnet-5-5anthropic | 61.8% | Claude Code 2.1.284 · max 推論 |
| 3 | gpt-6.1-solopenai | 58.2% | Codex 0.159.0 · max 推論 |
| 4 | claude-fable-5-1Anthropic | 57.9% | Claude Code 2.1.257 · max 推論 |
| 5 | claude-opus-5Anthropic | 51.8% | Claude Code 2.1.231 · max 推論 |
| 6 | gpt-6-solOpenAI | 49.4% | Codex 0.159.0 · max 推論 |
| 7 | claude-fable-5Anthropic | 44.5% | Claude Code 2.1.231 · max 推論 |
| 8 | glm-5.3Z.ai | 41.8% | Claude Code 2.1.207 · max 推論 |
| 9 | gpt-5.6-solOpenAI | 37.3% | Codex 0.149.1 · max 推論 |
| 10 | glm-5.3-flashZ.ai | 35.8% | Claude Code 2.1.285 · 出典は推論レベルを報告していません |
| 11 | claude-opus-4-8Anthropic | 23.6% | Claude Code 2.1.231 · max 推論 |
| 12 | gpt-5.6-terraOpenAI | 21.5% | Codex 0.149.1 · max 推論 |
| 13 | grok-4.6xAI | 20.3% | Grok Build 1.0.5 · 出典は推論レベルを報告していません |
| 14 | gemini-3.8-flashGoogle | 19.1% | mini-SWE-agent 2.4.6 · high 推論 |
| 15 | gpt-5.6-lunaOpenAI | 17.3% | Codex 0.149.1 · max 推論 |
| 16 | gpt-6-lunaOpenAI | 16.4% | Codex 0.159.0 · max 推論 |
| 17 | claude-sonnet-5Anthropic | 12.4% | Claude Code 2.1.231 · max 推論 |
| 17 | grok-4.5xAI | 12.4% | Grok Build 1.0.5 · 出典は推論レベルを報告していません |
| 19 | gemini-3.7-flashGoogle | 11.2% | mini-SWE-agent 2.4.6 · high 推論 |
評価の限界と、データの帰属
モデルによって Claude Code、Codex、GrokBuild、mini-SWE などツールが異なります。AA v4.3 にはすでに Terminal-Bench v4 が含まれているので、総合の票の重みに再び加えてはいけません。
データのライセンス:Apache 2.0 · 公式 harbor-framework/terminal-bench リポジトリ内の成績の提出です。クレジット表記、プロトコル、変更の説明を残します。
成績は Harbor / Terminal-Bench が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。