#ベンチマーク
今日 1件10月7日(水)
· 1件10月6日(火)
· 1件10月4日(日)
· 1件10月2日(金)
· 16件ARC Evals、
METR に 改称し独立へ 移行 ARC Evals が METR に改称し独立しました。 Model Evaluation & Threat Research の略で、測定学にちなみます。 Beth Barnes 氏が引き続きチームを率います。
METRMETR、
LLM エージェント向けタスクを 募集 METR が自律 LLM エージェント評価用タスクを募集しています。 アイデアに 20 ドル、仕様に 200 ドルを支払います。 実装は人間の作業費の 3 倍を基本報酬とします。
METRUK AISI、
自動採点の 統計手法を 公開 英 AISI が自動採点の評価手法を公開しました。 ベイズ一般化線形モデルで採点者の偏りを同時に評価します。 統計モデルと再現ノートブックを GitHub で公開しています。
UK AI Security Institute BlogAISI、
能力 引き出しの 実験手順を 標準化 AISI が能力引き出し実験の手順を標準化しました。 引き出し技術で性能は学習計算量 5〜20 倍相当に向上します。 チェックリストで再現性と比較可能性を高めます。
UK AI Security Institute Blog国際ネットワーク、
エージェント試験を 実施 国際ネットワークがエージェント評価の共同試験を実施しました。 9 言語・約 1,500 タスクで安全性と詐欺リスクを検証しました。 英語の安全性は通過率約 40% で他言語よりやや高いです。
UK AI Security Institute BlogAISI、
AI エージェント評価の 記録を 分析 AISI が AI エージェント評価の記録を分析しました。 約 6,400 件の記録を調べ、失敗の原因を分類しました。 一部のエージェントは 30% の試行でタスクを放棄しました。
UK AI Security Institute BlogAISI、
現行 AI の 限界 8 点を 報告 AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
UK AI Security Institute Blog英国 AISI、
NeurIPS 2025 で 研究 10 本を 発表 英国 AISI が NeurIPS 2025 で研究 10 本を発表します。 悪意あるファインチューニングへの防御の限界を示します。 学習時の有害データ除去は事後防御の 10 倍有効です。
UK AI Security Institute Blog英 AISI、
2025年の 成果を 総括 英 AISI が 2025年の年間成果を総括しました。 30 超のフロンティアモデルをテストしました。 Google DeepMind と研究提携を開始しました。
UK AI Security Institute Blog国際 AI 評価ネットワーク、
評価の 共通課題を 整理 国際 AI 評価ネットワークが評価手法の合意点と未解決課題を整理しました。 評価は目的の明示と再現性の確保が必要です。 AI モデルでなく AI システムの評価方法は未解決です。
UK AI Security Institute BlogKimi、
検証ツール Vendor Verifier を 公開 Kimi が Kimi Vendor Verifier をオープンソース化しました。詳しくは出典へ。
Kimi(Moonshot AI)Blog
10月1日(木)
· 1件9月30日(水)
· 2件Apple、
エージェント基盤 SCLATE を 公開 Apple が継続学習エージェント向け基盤 SCLATE を公開しました。詳しくは出典へ。
Apple Machine Learning Research
9月29日(火)
· 1件Apple AI、
木構造の 伝達損失を 調査 Apple AI が木構造表現の往復精度を調査しました。 最良の組み合わせでも往復精度は 92.9% です。 生成側の失敗が全体の 73.6% 以上を占めます。
Apple Machine Learning Research
9月23日(水)
· 1件OpenAI、
MentalHealthBench を 公開 OpenAI が MentalHealthBench を公開しました。 メンタルヘルス会話での AI 応答を評価します。 専門家の知見を反映したベンチマークです。
OpenAI News
9月22日(火)
· 2件英 AISI、
EvalEval で 評価結果を 公開 英 AISI が EvalEval の基盤で評価結果を公開しました。 対象は HealthBench など 5 つのベンチマークです。 Claude Opus 4 系と GPT-5 系の 6 モデルを検証しました。
Hugging Face Blog
9月17日(木)
· 1件9月13日(日)
· 1件Epoch AI、
GPT-6 Astra を 事前評価 Epoch AI が GPT-6 Astra を事前評価しました。 Astra は ECI などで過去最高を記録しました。 FrontierMath Erdős では 68 問中 2 問を解きました。
Epoch AI(Substack)
9月2日(水)
· 1件Hugging Face、
監査手法 BenchMIRT 公開 Hugging Face がベンチマーク監査手法 BenchMIRT を公開しました。 BBQ や WMDP のスコアは安全性より一般推論と強く関連します。
Hugging Face Blog
9月1日(火)
· 1件8月31日(月)
· 1件8月28日(金)
· 1件8月27日(木)
· 1件8月21日(金)
· 1件8月15日(土)
· 1件Epoch AI、
ベンチマークの 9 つの 問い Epoch AI がベンチマークで解く 9 つの問いを提示しました。 AI が仕事全体を担えるかが最大の問いです。 ベンチマーク間のスコア相関の理由も問います。
Epoch AI(Substack)
8月13日(木)
· 1件Microsoft、
ベンチマーク MindTopo を 公開 Microsoft がベンチマーク MindTopo を公開しました。 静的認識より対話的な計画で性能が大きく低下します。 失敗は知覚より計画の段階で多く発生します。
Microsoft Research
8月11日(火)
· 1件Hugging Face、
ALTK-Evolve を 公開 Hugging Face が ALTK-Evolve を公開しました。 AppWorld で ACE より少ない Token で高い精度です。 DeepSeek-V3.2 では推論コストが ACE の約 40% です。
Hugging Face Blog
8月4日(火)
· 1件8月1日(土)
· 1件Epoch AI、
数学ベンチマークを 50 問に 拡大 Epoch AI が FrontierMath: Open Problems を 50 問に拡大しました。 未解決の研究数学の問題を集めたベンチマークです。 AI はこれまでに 3 問を解いています。
Epoch AI(Substack)