本文へ移動
10/7(水) 13:08
あとで読む
評価のソース

Vals Finance Agent

Vals AI / 専門業務 · 金融アナリストの日常業務の問題で、調査レポートやモデリングのような仕事がどれだけできるかを見ます。

公式の評価
Karu News での扱い順位に反映
証拠の予算3%
元データの時刻10/1(木) 09:00
直近の同期10/3(土) 14:05

何を、どう測るか

Finance Agent v2 の公式 Overall の正解率だけを使います。

この証拠の使い方

業界別の専門タスクの予算のうち 3% です。現在は金融を直接測っており、すべての業界をカバーしたとは言いません。

評価の成績

固定のルールで、公開モデルごとに代表となる構成を 1 つ採用しています。匿名のテスト用モデルは表示せず、元のランキングの順位を保ち、1 項目につき最大 30 件です。

元の順位元の型番元の成績代表の設定
1google/gemini-4-argongoogle65.4%High 推論
2google/gemini-3.8-flashGoogle61.4%High 推論
3meta/muse_spark_1_2Meta60.6%xHigh 推論
4meta/muse_spark_1_3_maxMeta60.0%Max 推論
5google/gemini-3.7-flashGoogle59.0%High 推論
7anthropic/claude-fable-5-1Anthropic58.9%Max 推論
8anthropic/claude-opus-5Anthropic58.6%Max 推論
9anthropic/claude-opus-5-5Anthropic58.6%Max 推論
10anthropic/claude-sonnet-5-5anthropic58.1%Max 推論
11google/gemini-3.5-flashGoogle57.9%High 推論
12zai/glm-5.3-flashZ.ai57.9%Max 推論
13xiaomi/mimo-v2.6-proXiaomi57.3%出典のデフォルト構成
14meta/muse_spark_1_1Meta57.2%xHigh 推論
15anthropic/claude-fable-5Anthropic56.3%Max 推論
16google/gemini-3.6-flashGoogle56.3%High 推論
17xiaomi/mimo-v2.6-flashXiaomi56.3%出典のデフォルト構成
18zai/glm-5.3Z.ai55.8%Max 推論
19tencent/hy4-previewTencent55.1%出典のデフォルト構成
20openai/gpt-5.6-lunaOpenAI55.0%Max 推論
21ant/ling-3.0-flash-af-rc3Ant54.9%出典のデフォルト構成
22openai/gpt-5.6-terraOpenAI54.4%Max 推論
23anthropic/claude-opus-4-8Anthropic53.9%Max 推論
24anthropic/claude-sonnet-5Anthropic53.9%Max 推論
25openai/gpt-5.6-solOpenAI53.8%Max 推論
26grok/grok-4.6xAI53.7%High 推論
27openai/gpt-6-astraOpenAI53.5%Max 推論
28deepseek/deepseek-v4.1-flashDeepSeek53.5%High 推論
29kimi/kimi-k3Moonshot AI53.1%Max 推論
30grok/grok-4.7xAI52.3%xHigh 推論
31openai/gpt-6.1-solopenai52.0%Max 推論
評価の限界と、データの帰属

非公開の問題は、問題ごとに再計算できません。APEX と同じ事務タスクなので、予算を共有する必要があります。

データのライセンス:公式が結果を公開しています。公開して再表示するときは公式のクレジット表記を残し、完全な再配布の許諾は Vals の規約に従います。

成績は Vals AI が公表したものです。元のスコアと Karu News の総合スコアは尺度が異なるため、足し合わせられません。