Stockmark、 文書構造化ベンチマーク公開
Stockmark が OmniDocBench-JASyn を公開しました。 日本語文書画像に特化した構造化ベンチマークです。 7B モデルで Overall スコアが 64.66 から 88.31 に向上しました。
Stockmark が OmniDocBench-JASyn を公開しました。 日本語文書画像に特化した構造化ベンチマークです。 7B モデルで Overall スコアが 64.66 から 88.31 に向上しました。
Google が評価者数の設計を分析しました。 項目あたり 10 人超で信頼性が向上します。 約 1,000 件の注釈で再現性を確保できます。
Google が高温超伝導の専門家問題で LLM を評価しました。 NotebookLM と独自 RAG が上位 2 つに入りました。 6 つの LLM に専門家が 67 問を出題し採点しました。
SPEX が LLM の重要な相互作用を特定します。 ProxySPEX は約 10 倍少ないアブレーションで同等の性能です。 SPEX は数千特徴の入力でも忠実度を維持します。
ABEJA がロングコンテキスト評価のベンチマークを公開しました。 GENIAC3 期の基盤モデル開発で使用したベンチマークを含みます。 MRCR は日本語版も作成し、公開しました。
Ethan Mollick が AI を面接で評価する方法を解説しました。 ベンチマークは公開や未校正などの問題を抱えます。 vibes による評価は個人向けで、標準化には不十分です。
Ethan Mollick 氏が AI エージェントの実務利用を分析しました。詳しくは出典へ。
METR が科学コミュニケーションの考え方を解説しました。 開発者生産性の研究では AI 利用時に開発者が遅くなりました。 見出しでは「AI が遅くする」と「期待のずれ」を重視しました。
DeepSeek が deepseek-chat を DeepSeek-V2-0628 に更新しました。詳しくは出典へ。