英 AISI、 Inspect Scout の 分析手順を 公開
英 AISI が Inspect Scout の分析手順を公開しました。詳しくは出典へ。
英 AISI が Inspect Scout の分析手順を公開しました。詳しくは出典へ。
英 AISI が Claude Mythos Preview のサイバー能力を評価しました。詳しくは出典へ。
Cohere が学習データの文化ファネルを分析しました。 560 万件超のサンプルで文化信号の減少を確認しました。 多言語化しても文化の割合は頭打ちです。
Graphite が AI の口癖 1.3 万件を分析しました。 Claude Opus 5.5 は「this matters」を人間の 116 倍使います。 GPT 系は人間の語彙分布から遠ざかっています。
Claude がファージから酵素システムを発見しました。 CRISPR に似た反復配列で、ゲノム編集への利用が期待されます。 アモデイ氏は医学研究の加速に期待を示しました。
CAIS が CheatBench を公開しました。 Google は Android Bench 2.0 も公開しました。 AI の不正と長期開発の実力を評価します。
Google が AI 設計タンパク質への透かし手法を開発しました。 バイオセキュリティ対策を目的としています。 人気の AI タンパク質設計ツールで機能します。
DeepMind がタンパク質向けの透かし技術 SynthID Bio を発表しました。詳しくは出典へ。
ABEJA が Nemotron 3 Nano に汎用・金融特化の SFT を実施しました。 金融特化モデルは Fin-Harness で 67.28 を記録しました。 NVIDIA 公開の事後学習済みモデルは 59.17 です。
Apple AI が条件付け手法の効果と流暢さを調査しました。 効率的なステアリング手法は流暢さを大きく損ないます。 指示チューニング済みモデルでは効果が低下します。
Apple が継続学習エージェント向け基盤 SCLATE を公開しました。詳しくは出典へ。
Google Research が Diffusion Controller を発表しました。詳しくは出典へ。
Microsoft Research が生物学向け AI 研究基盤 Quine を発表しました。詳しくは出典へ。
ProvenanceGuard は MCP エージェントの出典を検証します。 誤帰属した主張 139 件のうち 138 件を検出しました。 正しい出典の特定率は約 86% です。
Rustuna が制約付き最適化の API を実装しました。 TPE と NSGA-II が制約を考慮してサンプリングします。 Optuna のコードが import 文の変更だけで動作します。
Apple AI が木構造表現の往復精度を調査しました。 最良の組み合わせでも往復精度は 92.9% です。 生成側の失敗が全体の 73.6% 以上を占めます。
Apple が連合変分不等式の収束率を改善しました。 Local Extra SGD の保証をより厳密な解析で強化しました。 新手法 LIPPAX でクライアントドリフトを緩和します。