Import AI 469、 科学 AI と RSI を 特集
DiG-bench は 70 のゲームで発見能力を測ります。 Inherent が AI 科学者 Faraday を公開しました。
DiG-bench は 70 のゲームで発見能力を測ります。 Inherent が AI 科学者 Faraday を公開しました。
Google が体組成推定の PhotoScan を公開しました。 体脂肪率の誤差は 2.15 で、BIA センサーの 2.91 を下回ります。
Hugging Face が ICML 2026 の論文 2,226 本を再現しました。詳しくは出典へ。
Microsoft がベンチマーク MindTopo を公開しました。 静的認識より対話的な計画で性能が大きく低下します。 失敗は知覚より計画の段階で多く発生します。
Voxel51 が物理 AI のデータ課題を報告しました。 700 人超の調査でデータ問題が失敗の主因です。 成功チームはデータ作業に約 3 倍の時間をかけます。
Hugging Face が ALTK-Evolve を公開しました。 AppWorld で ACE より少ない Token で高い精度です。 DeepSeek-V3.2 では推論コストが ACE の約 40% です。
サイバーエージェントの論文が FOCS 2026 に採択されました。 大坂直人氏と国立情報学研究所の平原秀一准教授の共著です。 q-CSP 遷移問題の近似困難性が PSPACE 困難だと証明しました。
Ai2 が AI チューターの判断を測る TutorMoments を公開しました。詳しくは出典へ。
ABEJA が SensorLLM で人間行動認識を検証しました。 SensorLLM は Chronos でセンサーを埋め込み LLM に入力します。 異常検知は学習しておらずスパイクを指摘できません。
Epoch AI が FrontierMath: Open Problems を 50 問に拡大しました。 未解決の研究数学の問題を集めたベンチマークです。 AI はこれまでに 3 問を解いています。
Ai2 の infini-gram が AI 生成文の表現を追跡します。 AI 検出スコアだけでは出典の特定はできません。 AI 生成本は既存書籍の珍しい表現を多く含みます。
CyberAgent の研究員らが PPSN 2026 に論文採択されました。 シンボリック回帰の汎化性能を理論的に解析した内容です。 2026年8月29日からイタリア・トレントで発表します。
Unslop が主要 16 モデルの政治傾向を調査しました。 全モデルがリバタリアン左派に分類されました。 Grok 4.5 は実行の半数で経済右派に振れました。
Epoch と METR が長期的なプログラミング課題のベンチマーク MirrorCode を公開しました。詳しくは出典へ。
CyberAgent AI Lab の論文 2 本が ECCV 2026 に採択されました。 バンドル調整を安定化する新手法 CSS-BA を提案しました。 拡散モデル向けにリーマン計量を構築する手法を提案しました。
ABBEL が長期対話向けの学習手法を提案しました。 要約ではなく自然言語の信念状態を監督します。 CollabBench で全履歴モデルとの差を約 50% 縮めました。
CyberAgent AI Lab の論文が IROS 2026 に採択されました。 AI Lab からの採択は 3年連続です。 非言語行動を認識し自発的に接客するロボットの研究です。
DharmaOCR がポルトガル語 OCR で新モデルを上回りました。 ベンチマークは 0.925 で Mistral OCR4 は 0.798 です。 ファインチューニングと DPO の 2 段階で学習しています。
Google が拡散モデルの創造性の仕組みを解明しました。 創造性は学習時のスコア平滑化に由来します。 スコア平滑化が学習点間の補間を生み出します。