#ベンチマーク
今日 1件7月23日(木)
· 1件7月22日(水)
· 1件7月21日(火)
· 1件7月17日(金)
· 2件7月15日(水)
· 1件Hugging Face、
音声 AI 評価の VoiceEQ を 公開 Hugging Face が音声 AI 評価の Real World VoiceEQ を公開しました。詳しくは出典へ。
Hugging Face Blog
7月9日(木)
· 1件Epoch AI、
ベンチマーク EBR-bench 公開 Epoch AI がベンチマーク EBR-bench を公開しました。 盤ゲーム Earthborne Rangers で経験からの学習を試します。 現時点で AI が経験から学ぶ証拠はほとんど見られません。
Epoch AI(Substack)
7月2日(木)
· 2件CyberAgent AI Lab、
INTERSPEECH 2026 に 4 本採択 CyberAgent AI Lab の 4 本の論文が INTERSPEECH 2026 に採択されました。 音声合成の転移学習では、元モデルの発音知識は寄与しません。 日本語の書記素音素変換では、最適な LLM が 0.52% 未満を達成しました。
CyberAgent AI Lab
7月1日(水)
· 1件6月27日(土)
· 1件6月26日(金)
· 1件6月18日(木)
· 1件Epoch AI、
AI 研究タスクの 分類を 公開 Epoch AI が AI 研究開発のタスク分類を公開しました。 研究ワークフローを 6分類、60 以上のタスクに分解しています。 各タスクは AI による自動化度を 0〜5 で評価しています。
Epoch AI(Substack)
6月13日(土)
· 1件Epoch AI、
FrontierMath v2 を 公開 Epoch AI が FrontierMath v2 を公開しました。 Claude Fable 5 が首位で、Tier 1〜3 は 87% です。 Tier 4 のスコアは 88% です。
Epoch AI(Substack)
6月12日(金)
· 2件6月8日(月)
· 2件Stockmark、
LLM 評価の 多様性を 分析 Stockmark が LLM-as-a-Judge の評価多様性を分析しました。 専門家同士でも細かいスコアは一致しにくいです。 評価者ごとに合わせた判定は一致度が高まります。
Stockmark Tech Blog
6月2日(火)
· 1件Epoch AI、
オープンと 閉鎖の 差を 分析 Epoch AI がオープンウェイトと閉鎖モデルの差を分析しました。 最も能力の高いオープンウェイトモデルは約 4 か月遅れています。 ハイパースケーラーの設備投資は GPT-4 公開後で 4 倍です。
Epoch AI(Substack)
5月13日(水)
· 1件5月12日(火)
· 1件Stockmark、
文書構造化ベンチマーク公開 Stockmark が OmniDocBench-JASyn を公開しました。 日本語文書画像に特化した構造化ベンチマークです。 7B モデルで Overall スコアが 64.66 から 88.31 に向上しました。
Stockmark Tech Blog
5月1日(金)
· 1件4月1日(水)
· 1件Google、
評価者数の 設計を 分析 Google が評価者数の設計を分析しました。 項目あたり 10 人超で信頼性が向上します。 約 1,000 件の注釈で再現性を確保できます。
Google Research
3月17日(火)
· 1件Google、
高温超 伝導で LLM を 評価 Google が高温超伝導の専門家問題で LLM を評価しました。 NotebookLM と独自 RAG が上位 2 つに入りました。 6 つの LLM に専門家が 67 問を出題し採点しました。
Google Research
3月13日(金)
· 1件SPEX、
LLM の 相互作用を 分析 SPEX が LLM の重要な相互作用を特定します。 ProxySPEX は約 10 倍少ないアブレーションで同等の性能です。 SPEX は数千特徴の入力でも忠実度を維持します。
Berkeley AI Research
3月5日(木)
· 1件ABEJA、
ロング文脈評価ベンチマーク公開 ABEJA がロングコンテキスト評価のベンチマークを公開しました。 GENIAC3 期の基盤モデル開発で使用したベンチマークを含みます。 MRCR は日本語版も作成し、公開しました。
ABEJA Tech Blog
2月13日(金)
· 1件2025年10月24日(金)
· 1件2025年8月12日(火)
· 1件METR、
科学コミュニケーションの 課題 METR が科学コミュニケーションの考え方を解説しました。 開発者生産性の研究では AI 利用時に開発者が遅くなりました。 見出しでは「AI が遅くする」と「期待のずれ」を重視しました。
METR
2024年10月9日(水)
· 1件2024年6月28日(金)
· 1件DeepSeek、
deepseek-chat を V2-0628 に 更新 DeepSeek が deepseek-chat を DeepSeek-V2-0628 に更新しました。詳しくは出典へ。
DeepSeek API Change Log