評価のソース公式の評価
Vals Finance Agent
Vals AI / 専門業務 · 金融アナリストの日常業務の問題で、調査レポートやモデリングのような仕事がどれだけできるかを見ます。
Karu News での扱い順位に反映
証拠の予算3%
元データの時刻10/1(木) 09:00
直近の同期10/3(土) 14:05
何を、どう測るか
Finance Agent v2 の公式 Overall の正解率だけを使います。
この証拠の使い方
業界別の専門タスクの予算のうち 3% です。現在は金融を直接測っており、すべての業界をカバーしたとは言いません。
評価の成績
固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。
| 元の順位 | 元の型番 | 元の成績 | 代表の設定 |
|---|---|---|---|
| 1 | google/gemini-4-argongoogle | 65.4% | High 推論 |
| 2 | google/gemini-3.8-flashGoogle | 61.4% | High 推論 |
| 3 | meta/muse_spark_1_2Meta | 60.6% | xHigh 推論 |
| 4 | meta/muse_spark_1_3_maxMeta | 60.0% | Max 推論 |
| 5 | google/gemini-3.7-flashGoogle | 59.0% | High 推論 |
| 7 | anthropic/claude-fable-5-1Anthropic | 58.9% | Max 推論 |
| 8 | anthropic/claude-opus-5Anthropic | 58.6% | Max 推論 |
| 9 | anthropic/claude-opus-5-5Anthropic | 58.6% | Max 推論 |
| 10 | anthropic/claude-sonnet-5-5anthropic | 58.1% | Max 推論 |
| 11 | google/gemini-3.5-flashGoogle | 57.9% | High 推論 |
| 12 | zai/glm-5.3-flashZ.ai | 57.9% | Max 推論 |
| 13 | xiaomi/mimo-v2.6-proXiaomi | 57.3% | 出典のデフォルト構成 |
| 14 | meta/muse_spark_1_1Meta | 57.2% | xHigh 推論 |
| 15 | anthropic/claude-fable-5Anthropic | 56.3% | Max 推論 |
| 16 | google/gemini-3.6-flashGoogle | 56.3% | High 推論 |
| 17 | xiaomi/mimo-v2.6-flashXiaomi | 56.3% | 出典のデフォルト構成 |
| 18 | zai/glm-5.3Z.ai | 55.8% | Max 推論 |
| 19 | tencent/hy4-previewTencent | 55.1% | 出典のデフォルト構成 |
| 20 | openai/gpt-5.6-lunaOpenAI | 55.0% | Max 推論 |
| 21 | ant/ling-3.0-flash-af-rc3Ant | 54.9% | 出典のデフォルト構成 |
| 22 | openai/gpt-5.6-terraOpenAI | 54.4% | Max 推論 |
| 23 | anthropic/claude-opus-4-8Anthropic | 53.9% | Max 推論 |
| 24 | anthropic/claude-sonnet-5Anthropic | 53.9% | Max 推論 |
| 25 | openai/gpt-5.6-solOpenAI | 53.8% | Max 推論 |
| 26 | grok/grok-4.6xAI | 53.7% | High 推論 |
| 27 | openai/gpt-6-astraOpenAI | 53.5% | Max 推論 |
| 28 | deepseek/deepseek-v4.1-flashDeepSeek | 53.5% | High 推論 |
| 29 | kimi/kimi-k3Moonshot AI | 53.1% | Max 推論 |
| 30 | grok/grok-4.7xAI | 52.3% | xHigh 推論 |
| 31 | openai/gpt-6.1-solopenai | 52.0% | Max 推論 |
評価の限界と、データの帰属
非公開の問題は、問題ごとに再計算できません。APEX と同じ事務タスクなので、予算を共有する必要があります。
データのライセンス:公式が結果を公開しています。公開して再表示するときは公式のクレジット表記を残し、完全な再配布の許諾は Vals の規約に従います。
成績は Vals AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。