#論文・研究
今日 6件10月7日(水)
· 6件Apple、
RISED で エージェント学習を 改善 Apple がエージェント学習手法 RISED を公開しました。 ルーブリックでデータ選択と自己蒸留を導きます。 複数環境で平均合格率が最高となりました。
Apple Machine Learning Research
10月6日(火)
· 6件Google、
エージェントの プライバシー報告 Google がエージェントのプライバシー報告書を公開しました。 50 人超の産学の専門家が CAPS ワークショップで議論しました。 文脈的完全性を拡張する方針を提唱しています。
Google ResearchQwen3.8 27B、
英単語の 足し算を 検証 Qwen3.8-27B-Q4_K_M の英単語足し算が検証されました。 推論無効時は数値正答率 23.57%、書式遵守は 96.17% です。 推論有効時は 169 件中 167 件で正解しました。
Simon WillisonApple、
個人センシングの 境界を 研究 Apple の研究チームが個人センシングの境界交渉を調査しました。 参加者は Wizard of Oz 方式で自分専用の機械学習を体験しました。 データの客観性など 4 つの境界が交渉されました。
Apple Machine Learning Research
10月5日(月)
· 1件10月4日(日)
· 4件10月3日(土)
· 5件Apple AI、
拡散モデルの 限界を 分析 Apple AI が拡散モデルの確信度の限界を分析しました。 位置ごとの分布は依存するトークン群を再現できません。 合成タスクで生成分布がノイズ床の 29 倍と測定しました。
Apple Machine Learning ResearchApple AI、
多言語音声の 識別を 改善 Apple AI が多言語音声モデルの言語識別を強化しました。 識別を事前学習の初期に導入すると効果が最大です。 音素識別の誤りは 11.6% から 10.4% に低下しました。
Apple Machine Learning Research
10月2日(金)
· 18件UK AISI、
自動採点の 統計手法を 公開 英 AISI が自動採点の評価手法を公開しました。 ベイズ一般化線形モデルで採点者の偏りを同時に評価します。 統計モデルと再現ノートブックを GitHub で公開しています。
UK AI Security Institute BlogAISI、
白箱制御の 研究を 公開 AISI が白箱制御チームを立ち上げました。 白箱制御はモデル内部の活性化を監視・改変します。 Llama-3.1-8B ではサンドバッギング検出が高精度でした。
UK AI Security Institute BlogAISI、
能力 引き出しの 実験手順を 標準化 AISI が能力引き出し実験の手順を標準化しました。 引き出し技術で性能は学習計算量 5〜20 倍相当に向上します。 チェックリストで再現性と比較可能性を高めます。
UK AI Security Institute Blog国際ネットワーク、
エージェント試験を 実施 国際ネットワークがエージェント評価の共同試験を実施しました。 9 言語・約 1,500 タスクで安全性と詐欺リスクを検証しました。 英語の安全性は通過率約 40% で他言語よりやや高いです。
UK AI Security Institute BlogAISI、
AI エージェント評価の 記録を 分析 AISI が AI エージェント評価の記録を分析しました。 約 6,400 件の記録を調べ、失敗の原因を分類しました。 一部のエージェントは 30% の試行でタスクを放棄しました。
UK AI Security Institute BlogAISI、
現行 AI の 限界 8 点を 報告 AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
UK AI Security Institute Blog英国 AISI、
NeurIPS 2025 で 研究 10 本を 発表 英国 AISI が NeurIPS 2025 で研究 10 本を発表します。 悪意あるファインチューニングへの防御の限界を示します。 学習時の有害データ除去は事後防御の 10 倍有効です。
UK AI Security Institute Blog