本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

Terminal-Bench 4 · システム参考

Harbor / Terminal-Bench / コーディング · モデルを異なる Agent と組み合わせたターミナルタスクの元の成績を残し、クロスチェックに使います。

公式の評価
Karu News での扱い参考のみ
証拠の予算点数に使いません
元データの時刻10/7(水) 08:02
直近の同期10/7(水) 08:05

何を、どう測るか

Terminal-Bench 4.0 を固定し、モデル、Agent のバージョン、推論段階、実行回数を別々に残します。異なるツールのシステムを、統一したモデル条件として解釈しません。

この証拠の使い方

元の成績の参考:公式の提出一覧とデータバージョンを固定してから自動収集し、異なるシステム構成を 1 件ずつ残します。モデルの代表スコアは選びません。クロスチェック専用で、総合とコーディングのランキングには入れません。

評価の成績

以下は、モデルにさまざまなエージェントを組み合わせたシステムの成績です。実行条件が異なるため、参考としてご覧ください。1 項目につき最大 30 件の構成を表示し、匿名のテスト用モデルは表示しません。

元の順位元の型番元の成績実行の設定
1claude-opus-5-5Anthropic64.8%Claude Code 2.1.284 · max 推論
2claude-sonnet-5-5anthropic61.8%Claude Code 2.1.284 · max 推論
3gpt-6.1-solopenai58.2%Codex 0.159.0 · max 推論
4claude-fable-5-1Anthropic57.9%Claude Code 2.1.257 · max 推論
5claude-opus-5Anthropic51.8%Claude Code 2.1.231 · max 推論
6gpt-6-solOpenAI49.4%Codex 0.159.0 · max 推論
7claude-fable-5Anthropic44.5%Claude Code 2.1.231 · max 推論
8glm-5.3Z.ai41.8%Claude Code 2.1.207 · max 推論
9gpt-5.6-solOpenAI37.3%Codex 0.149.1 · max 推論
10glm-5.3-flashZ.ai35.8%Claude Code 2.1.285 · 出典は推論レベルを報告していません
11claude-opus-4-8Anthropic23.6%Claude Code 2.1.231 · max 推論
12gpt-5.6-terraOpenAI21.5%Codex 0.149.1 · max 推論
13grok-4.6xAI20.3%Grok Build 1.0.5 · 出典は推論レベルを報告していません
14gemini-3.8-flashGoogle19.1%mini-SWE-agent 2.4.6 · high 推論
15gpt-5.6-lunaOpenAI17.3%Codex 0.149.1 · max 推論
16gpt-6-lunaOpenAI16.4%Codex 0.159.0 · max 推論
17claude-sonnet-5Anthropic12.4%Claude Code 2.1.231 · max 推論
17grok-4.5xAI12.4%Grok Build 1.0.5 · 出典は推論レベルを報告していません
19gemini-3.7-flashGoogle11.2%mini-SWE-agent 2.4.6 · high 推論
評価の限界と、データの帰属

モデルによって Claude Code、Codex、GrokBuild、mini-SWE などツールが異なります。AA v4.3 にはすでに Terminal-Bench v4 が含まれているので、総合の票の重みに再び加えてはいけません。

データのライセンス:Apache 2.0 · 公式 harbor-framework/terminal-bench リポジトリ内の成績の提出です。クレジット表記、プロトコル、変更の説明を残します。

成績は Harbor / Terminal-Bench が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。