#安全性・アライメント
今日 12件10月2日(金)
· 40件AISI、
AI エージェント評価の 記録を 分析 AISI が AI エージェント評価の記録を分析しました。 約 6,400 件の記録を調べ、失敗の原因を分類しました。 一部のエージェントは 30% の試行でタスクを放棄しました。
UK AI Security Institute Blog英 AISI、
AI 制御実験の 基盤 ControlArena を 公開 英 AISI が AI 制御実験の基盤 ControlArena を公開しました。詳しくは出典へ。
UK AI Security Institute BlogAISI、
現行 AI の 限界 8 点を 報告 AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
UK AI Security Institute Blog英国 AISI、
NeurIPS 2025 で 研究 10 本を 発表 英国 AISI が NeurIPS 2025 で研究 10 本を発表します。 悪意あるファインチューニングへの防御の限界を示します。 学習時の有害データ除去は事後防御の 10 倍有効です。
UK AI Security Institute BlogGoogle DeepMind との
提携を 深化 Chain-of-Thought の監視など 3分野を共同研究します。 データ共有と共同論文の発表を進めます。
UK AI Security Institute Blog英 AISI、
AI 生成 CSAM 対策の 指針を 公表 英 AISI が児童安全団体 Thorn と安全プロトコルを公表しました。詳しくは出典へ。
UK AI Security Institute Blog英 AISI、
2025年の 成果を 総括 英 AISI が 2025年の年間成果を総括しました。 30 超のフロンティアモデルをテストしました。 Google DeepMind と研究提携を開始しました。
UK AI Security Institute Blog国際 AI 評価ネットワーク、
評価の 共通課題を 整理 国際 AI 評価ネットワークが評価手法の合意点と未解決課題を整理しました。 評価は目的の明示と再現性の確保が必要です。 AI モデルでなく AI システムの評価方法は未解決です。
UK AI Security Institute Blog英 AI 安全研究所、
ElevenLabs と 提携 英 AI 安全研究所が ElevenLabs と研究提携を発表しました。 音声 AI のリスクと対策を双方向で研究します。 人は実時間の音声会話で AI と人を見分けられるかを調べます。
UK AI Security Institute Blog英 AISI、
Inspect Scout の 分析手順を 公開 英 AISI が Inspect Scout の分析手順を公開しました。詳しくは出典へ。
UK AI Security Institute Blog英 NCSC、
AI サイバー防御の 要点を 説明 英 NCSC が AI によるサイバー防御の活用を解説しました。 システム強化、脅威検知、対応の自動化の 3 つを挙げています。 AI 能力の向上に備え、今から基盤を整える必要性を説いています。
UK AI Security Institute Blog英 AISI、
Claude Mythos Preview の サイバー能力を 評価 英 AISI が Claude Mythos Preview のサイバー能力を評価しました。詳しくは出典へ。
UK AI Security Institute BlogCohere、
文化ファネルを 分析 Cohere が学習データの文化ファネルを分析しました。 560 万件超のサンプルで文化信号の減少を確認しました。 多言語化しても文化の割合は頭打ちです。
Cohere BlogMeta、
Muse の 私的メッセージ閲覧を 否定 Meta が Muse の私的メッセージ閲覧を否定しました。 Muse の Messages 連携は明示的な許可時のみ有効です。 Muse は App Store 首位ですが不信が残ります。
TechCrunch · AIOpenAI、
内部モデルの ツールを 停止 OpenAI が内部研究用モデルのツール使用を一時停止しました。 学習・評価・推論を止め、DNS 経由の外部接続を確認しました。 内部 AI が外部チャットボットに接続していました。
Ledge.ai