#論文・研究
今日 9件10月2日(金)
· 28件AISI、
AI エージェント評価の 記録を 分析 AISI が AI エージェント評価の記録を分析しました。 約 6,400 件の記録を調べ、失敗の原因を分類しました。 一部のエージェントは 30% の試行でタスクを放棄しました。
UK AI Security Institute BlogAISI、
現行 AI の 限界 8 点を 報告 AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
UK AI Security Institute Blog英国 AISI、
NeurIPS 2025 で 研究 10 本を 発表 英国 AISI が NeurIPS 2025 で研究 10 本を発表します。 悪意あるファインチューニングへの防御の限界を示します。 学習時の有害データ除去は事後防御の 10 倍有効です。
UK AI Security Institute Blog英 AISI、
Claude Mythos Preview の サイバー能力を 評価 英 AISI が Claude Mythos Preview のサイバー能力を評価しました。詳しくは出典へ。
UK AI Security Institute BlogCohere、
文化ファネルを 分析 Cohere が学習データの文化ファネルを分析しました。 560 万件超のサンプルで文化信号の減少を確認しました。 多言語化しても文化の割合は頭打ちです。
Cohere BlogGraphite、
AI の 口癖 1.3 万件を 分析 Graphite が AI の口癖 1.3 万件を分析しました。 Claude Opus 5.5 は「this matters」を人間の 116 倍使います。 GPT 系は人間の語彙分布から遠ざかっています。
TechCrunch · AIClaude、
未知の 酵素システムを 発見 Claude がファージから酵素システムを発見しました。 CRISPR に似た反復配列で、ゲノム編集への利用が期待されます。 アモデイ氏は医学研究の加速に期待を示しました。
Ledge.ai
10月1日(木)
· 7件Google、
AI タンパク質の 透かし 手法を 開発 Google が AI 設計タンパク質への透かし手法を開発しました。 バイオセキュリティ対策を目的としています。 人気の AI タンパク質設計ツールで機能します。
Ars Technica · AIDeepMind、
タンパク質向け透かし SynthID Bio を 発表 DeepMind がタンパク質向けの透かし技術 SynthID Bio を発表しました。詳しくは出典へ。
Google DeepMind
9月30日(水)
· 5件ABEJA、
Nemotron 3 Nano を 金融特化 SFT ABEJA が Nemotron 3 Nano に汎用・金融特化の SFT を実施しました。 金融特化モデルは Fin-Harness で 67.28 を記録しました。 NVIDIA 公開の事後学習済みモデルは 59.17 です。
ABEJA Tech BlogApple AI、
条件付けの 効果と 流暢さを 調査 Apple AI が条件付け手法の効果と流暢さを調査しました。 効率的なステアリング手法は流暢さを大きく損ないます。 指示チューニング済みモデルでは効果が低下します。
Apple Machine Learning ResearchApple、
エージェント基盤 SCLATE を 公開 Apple が継続学習エージェント向け基盤 SCLATE を公開しました。詳しくは出典へ。
Apple Machine Learning Research