#ベンチマーク
今日 1件9月3日(木)
· 1件9月2日(水)
· 1件Hugging Face、
監査手法 BenchMIRT 公開 Hugging Face がベンチマーク監査手法 BenchMIRT を公開しました。 BBQ や WMDP のスコアは安全性より一般推論と強く関連します。
Hugging Face Blog
9月1日(火)
· 1件8月31日(月)
· 1件8月28日(金)
· 1件8月27日(木)
· 1件8月24日(月)
· 1件8月22日(土)
· 1件8月21日(金)
· 1件8月17日(月)
· 1件Import AI 469、
科学 AI と RSI を 特集 DiG-bench は 70 のゲームで発見能力を測ります。 Inherent が AI 科学者 Faraday を公開しました。
Import AI
8月15日(土)
· 1件Epoch AI、
ベンチマークの 9 つの 問い Epoch AI がベンチマークで解く 9 つの問いを提示しました。 AI が仕事全体を担えるかが最大の問いです。 ベンチマーク間のスコア相関の理由も問います。
Epoch AI(Substack)
8月13日(木)
· 1件Microsoft、
ベンチマーク MindTopo を 公開 Microsoft がベンチマーク MindTopo を公開しました。 静的認識より対話的な計画で性能が大きく低下します。 失敗は知覚より計画の段階で多く発生します。
Microsoft Research
8月11日(火)
· 1件Hugging Face、
ALTK-Evolve を 公開 Hugging Face が ALTK-Evolve を公開しました。 AppWorld で ACE より少ない Token で高い精度です。 DeepSeek-V3.2 では推論コストが ACE の約 40% です。
Hugging Face Blog
8月4日(火)
· 1件8月1日(土)
· 1件Epoch AI、
数学ベンチマークを 50 問に 拡大 Epoch AI が FrontierMath: Open Problems を 50 問に拡大しました。 未解決の研究数学の問題を集めたベンチマークです。 AI はこれまでに 3 問を解いています。
Epoch AI(Substack)
7月28日(火)
· 1件Unslop、
主要 AI モデルの 政治傾向を 調査 Unslop が主要 16 モデルの政治傾向を調査しました。 全モデルがリバタリアン左派に分類されました。 Grok 4.5 は実行の半数で経済右派に振れました。
The Register · AI + ML
7月23日(木)
· 2件7月22日(水)
· 1件7月21日(火)
· 2件Anthropic、
Claude Sonnet 5 を 公開 Anthropic が Claude Sonnet 5 を公開しました。 エージェント型コーディングの性能が向上しています。 期間限定の割引価格で提供されます。
Last Week in AI
7月17日(金)
· 2件7月15日(水)
· 1件Hugging Face、
音声 AI 評価の VoiceEQ を 公開 Hugging Face が音声 AI 評価の Real World VoiceEQ を公開しました。詳しくは出典へ。
Hugging Face Blog
7月9日(木)
· 1件Epoch AI、
ベンチマーク EBR-bench 公開 Epoch AI がベンチマーク EBR-bench を公開しました。 盤ゲーム Earthborne Rangers で経験からの学習を試します。 現時点で AI が経験から学ぶ証拠はほとんど見られません。
Epoch AI(Substack)
7月6日(月)
· 1件7月2日(木)
· 2件CyberAgent AI Lab、
INTERSPEECH 2026 に 4 本採択 CyberAgent AI Lab の 4 本の論文が INTERSPEECH 2026 に採択されました。 音声合成の転移学習では、元モデルの発音知識は寄与しません。 日本語の書記素音素変換では、最適な LLM が 0.52% 未満を達成しました。
CyberAgent AI Lab
7月1日(水)
· 1件6月27日(土)
· 1件6月26日(金)
· 1件6月18日(木)
· 1件Epoch AI、
AI 研究タスクの 分類を 公開 Epoch AI が AI 研究開発のタスク分類を公開しました。 研究ワークフローを 6分類、60 以上のタスクに分解しています。 各タスクは AI による自動化度を 0〜5 で評価しています。
Epoch AI(Substack)
6月15日(月)
· 1件Sequent、
アライメント研究組織を 設立 Sequent がアライメント研究の非営利組織を設立しました。 英国 AISI と Timaeus の人材が参加しています。 初期調達目標は 1 億〜1 億 5,000 万ドルです。
Import AI
6月13日(土)
· 1件Epoch AI、
FrontierMath v2 を 公開 Epoch AI が FrontierMath v2 を公開しました。 Claude Fable 5 が首位で、Tier 1〜3 は 87% です。 Tier 4 のスコアは 88% です。
Epoch AI(Substack)
6月12日(金)
· 2件6月8日(月)
· 2件Stockmark、
LLM 評価の 多様性を 分析 Stockmark が LLM-as-a-Judge の評価多様性を分析しました。 専門家同士でも細かいスコアは一致しにくいです。 評価者ごとに合わせた判定は一致度が高まります。
Stockmark Tech Blog
6月2日(火)
· 1件Epoch AI、
オープンと 閉鎖の 差を 分析 Epoch AI がオープンウェイトと閉鎖モデルの差を分析しました。 最も能力の高いオープンウェイトモデルは約 4 か月遅れています。 ハイパースケーラーの設備投資は GPT-4 公開後で 4 倍です。
Epoch AI(Substack)