#安全性・アライメント
今日 1件10月7日(水)
· 1件10月6日(火)
· 1件Google、
エージェントの プライバシー報告 Google がエージェントのプライバシー報告書を公開しました。 50 人超の産学の専門家が CAPS ワークショップで議論しました。 文脈的完全性を拡張する方針を提唱しています。
Google Research
10月5日(月)
· 1件10月4日(日)
· 1件10月2日(金)
· 26件AISI、
白箱制御の 研究を 公開 AISI が白箱制御チームを立ち上げました。 白箱制御はモデル内部の活性化を監視・改変します。 Llama-3.1-8B ではサンドバッギング検出が高精度でした。
UK AI Security Institute BlogAISI、
能力 引き出しの 実験手順を 標準化 AISI が能力引き出し実験の手順を標準化しました。 引き出し技術で性能は学習計算量 5〜20 倍相当に向上します。 チェックリストで再現性と比較可能性を高めます。
UK AI Security Institute Blog国際ネットワーク、
エージェント試験を 実施 国際ネットワークがエージェント評価の共同試験を実施しました。 9 言語・約 1,500 タスクで安全性と詐欺リスクを検証しました。 英語の安全性は通過率約 40% で他言語よりやや高いです。
UK AI Security Institute BlogAISI、
AI エージェント評価の 記録を 分析 AISI が AI エージェント評価の記録を分析しました。 約 6,400 件の記録を調べ、失敗の原因を分類しました。 一部のエージェントは 30% の試行でタスクを放棄しました。
UK AI Security Institute BlogAISI、
現行 AI の 限界 8 点を 報告 AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
UK AI Security Institute Blog英国 AISI、
NeurIPS 2025 で 研究 10 本を 発表 英国 AISI が NeurIPS 2025 で研究 10 本を発表します。 悪意あるファインチューニングへの防御の限界を示します。 学習時の有害データ除去は事後防御の 10 倍有効です。
UK AI Security Institute Blog英 AISI、
Inspect Scout の 分析手順を 公開 英 AISI が Inspect Scout の分析手順を公開しました。詳しくは出典へ。
UK AI Security Institute Blog英 AISI、
Claude Mythos Preview の サイバー能力を 評価 英 AISI が Claude Mythos Preview のサイバー能力を評価しました。詳しくは出典へ。
UK AI Security Institute BlogCohere、
文化ファネルを 分析 Cohere が学習データの文化ファネルを分析しました。 560 万件超のサンプルで文化信号の減少を確認しました。 多言語化しても文化の割合は頭打ちです。
Cohere Blog
10月1日(木)
· 1件Google、
AI タンパク質の 透かし 手法を 開発 Google が AI 設計タンパク質への透かし手法を開発しました。 バイオセキュリティ対策を目的としています。 人気の AI タンパク質設計ツールで機能します。
Ars Technica · AI
9月28日(月)
· 1件9月23日(水)
· 1件OpenAI、
MentalHealthBench を 公開 OpenAI が MentalHealthBench を公開しました。 メンタルヘルス会話での AI 応答を評価します。 専門家の知見を反映したベンチマークです。
OpenAI News
9月18日(金)
· 1件Apple AI、
ステアリング手法 DSAS を 公開 Apple AI が活性化ステアリング手法 DSAS を公開しました。 不要な介入を抑え、有害性低減と性能維持の両立を改善します。 テキスト生成と画像拡散モデルの両方に適用できます。
Apple Machine Learning Research
9月17日(木)
· 2件Ai2、
Olmo 3 の 挙動を ゲームで 検証 学生が Olmo 3 の向社会的挙動をゲームで検証しました。 135 組の対比文で 15 の性質を評価します。
Allen Institute for AI (Ai2)
9月10日(木)
· 1件9月9日(水)
· 1件9月3日(木)
· 1件8月21日(金)
· 1件Georgia Tech、
Olmo で 社会推論を 追跡 Georgia Tech のチームが Olmo 3 で社会推論の起源を追跡しました。 Dolma 3 の 576 カテゴリから約 568 万文書を抽出しました。 社会推論は文学や対話的な文章の影響を強く受けました。
Allen Institute for AI (Ai2)