本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

TapTap Maker Benchmark

TapTap Maker / コーディング · 実際のゲームエンジン上で、Lua で動く機能を書きます。スコアはエンジンの実行で判定し、別のモデルによる採点は使いません。

公式の評価
Karu News での扱い順位に反映
証拠の予算3.6%
元データの時刻9/10(木) 09:00
直近の同期10/7(水) 08:05

何を、どう測るか

公式 main_board の L2 通過率だけを使います。コスト、速度、Held-out、分類別のスコアは再び票にしません。同じ基礎モデルは、固定した推論段階の優先順位で代表行を選び、選択にスコアは見ません。

この証拠の使い方

コーディングとデザインの予算のうち 3.6% です。エンジンと L2 指標を固定します。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1claude-fable-5-1Anthropic90.5%High 推論
2claude-fable-5Anthropic89.0%High 推論
3gpt-6-astraOpenAI88.9%xHigh 推論
4claude-opus-5Anthropic88.9%xHigh 推論
6grok-4.6@xhighxAI87.3%xHigh 推論
7gemini-3.8-flashGoogle86.8%High 推論
8gpt-5.6-solOpenAI86.5%xHigh 推論
11glm-5.3Z.ai83.6%Max 推論
12qwen3.8-max-0902Alibaba83.3%xHigh 推論
13claude-opus-4-8Anthropic82.8%xHigh 推論
14qwen3.8-maxAlibaba82.5%xHigh 推論
15deepseek-v4.1-flashDeepSeek82.5%Max 推論
16qwen3.8-flashAlibaba82.5%xHigh 推論
17gpt-5.6-terraOpenAI81.8%xHigh 推論
18glm-5.3-flashZ.ai81.5%Max 推論
19hy4-previewTencent81.0%High 推論
20kimi-k3Moonshot AI79.7%出典のデフォルト構成
21grok-4.5xAI78.3%High 推論
22doubao-seed-evolvingByteDance78.3%High 推論
23gpt-5.6-lunaOpenAI77.8%xHigh 推論
24deepseek-v4-proDeepSeek77.8%出典のデフォルト構成
25claude-sonnet-5Anthropic76.2%xHigh 推論
27deepseek-v4-flashDeepSeek74.6%Max 推論
28qwen3.8-27bAlibaba68.3%xHigh 推論
29gemini-3.1-pro-previewGoogle64.7%出典のデフォルト構成
30MiniMax-M3MiniMax60.1%出典のデフォルト構成
31claude-haiku-4-5Anthropic43.6%High 推論
評価の限界と、データの帰属

単一のエンジンと単一の言語なので、ほかの技術スタックには広げられません。モデルによって異なる agent で動かしている可能性があります。非公開の harness は問題ごとに再計算できません。

データのライセンス:公式が結果を公開しています。公開して再表示するときは公式のクレジット表記を残し、完全な再配布の許諾は易玩/TapTap の規約に従います。

成績は TapTap Maker が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。