評価のソース公式の評価
TapTap Maker Benchmark
TapTap Maker / コーディング · 実際のゲームエンジン上で、Lua で動く機能を書きます。スコアはエンジンの実行で判定し、別のモデルによる採点は使いません。
Karu News での扱い順位に反映
証拠の予算3.6%
元データの時刻9/10(木) 09:00
直近の同期10/7(水) 08:05
何を、どう測るか
公式 main_board の L2 通過率だけを使います。コスト、速度、Held-out、分類別のスコアは再び票にしません。同じ基礎モデルは、固定した推論段階の優先順位で代表行を選び、選択にスコアは見ません。
この証拠の使い方
コーディングとデザインの予算のうち 3.6% です。エンジンと L2 指標を固定します。
評価の成績
固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。
| 元の順位 | 元の型番 | 元の成績 | 代表の設定 |
|---|---|---|---|
| 1 | claude-fable-5-1Anthropic | 90.5% | High 推論 |
| 2 | claude-fable-5Anthropic | 89.0% | High 推論 |
| 3 | gpt-6-astraOpenAI | 88.9% | xHigh 推論 |
| 4 | claude-opus-5Anthropic | 88.9% | xHigh 推論 |
| 6 | grok-4.6@xhighxAI | 87.3% | xHigh 推論 |
| 7 | gemini-3.8-flashGoogle | 86.8% | High 推論 |
| 8 | gpt-5.6-solOpenAI | 86.5% | xHigh 推論 |
| 11 | glm-5.3Z.ai | 83.6% | Max 推論 |
| 12 | qwen3.8-max-0902Alibaba | 83.3% | xHigh 推論 |
| 13 | claude-opus-4-8Anthropic | 82.8% | xHigh 推論 |
| 14 | qwen3.8-maxAlibaba | 82.5% | xHigh 推論 |
| 15 | deepseek-v4.1-flashDeepSeek | 82.5% | Max 推論 |
| 16 | qwen3.8-flashAlibaba | 82.5% | xHigh 推論 |
| 17 | gpt-5.6-terraOpenAI | 81.8% | xHigh 推論 |
| 18 | glm-5.3-flashZ.ai | 81.5% | Max 推論 |
| 19 | hy4-previewTencent | 81.0% | High 推論 |
| 20 | kimi-k3Moonshot AI | 79.7% | 出典のデフォルト構成 |
| 21 | grok-4.5xAI | 78.3% | High 推論 |
| 22 | doubao-seed-evolvingByteDance | 78.3% | High 推論 |
| 23 | gpt-5.6-lunaOpenAI | 77.8% | xHigh 推論 |
| 24 | deepseek-v4-proDeepSeek | 77.8% | 出典のデフォルト構成 |
| 25 | claude-sonnet-5Anthropic | 76.2% | xHigh 推論 |
| 27 | deepseek-v4-flashDeepSeek | 74.6% | Max 推論 |
| 28 | qwen3.8-27bAlibaba | 68.3% | xHigh 推論 |
| 29 | gemini-3.1-pro-previewGoogle | 64.7% | 出典のデフォルト構成 |
| 30 | MiniMax-M3MiniMax | 60.1% | 出典のデフォルト構成 |
| 31 | claude-haiku-4-5Anthropic | 43.6% | High 推論 |
評価の限界と、データの帰属
単一のエンジンと単一の言語なので、ほかの技術スタックには広げられません。モデルによって異なる agent で動かしている可能性があります。非公開の harness は問題ごとに再計算できません。
データのライセンス:公式が結果を公開しています。公開して再表示するときは公式のクレジット表記を残し、完全な再配布の許諾は易玩/TapTap の規約に従います。
成績は TapTap Maker が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。