#安全性・アライメント
今日 3件10月7日(水)
· 3件AWS、
ISO/IEC 42005 の 活用を 解説 AWS が ISO/IEC 42005 の活用方法を解説しました。 AI システム影響評価を既存のリスク管理に統合できます。 Annex D と Annex E に統合手法とテンプレートを示します。
AWS Machine Learning Blog
10月6日(火)
· 3件米国など
17 か国、 SI 科学活用の 共同宣言 米国など 17 か国が SI 科学活用の共同宣言を支持しました。 同宣言は SI の研究プロセス組み込みや資金拡大を掲げます。 英国 AISI は安全対策を強化し評価活動の大半を再開しました。
AIセーフティ・インスティテュート(J-AISI)AISI、
事業実証の ビジョンペーパー更新 AISI が事業実証のビジョンペーパーを更新しました。 ヘルスケア・ロボティクスなど 4分野を対象とします。 データ品質と適合性評価の枠組みも示しました。
AIセーフティ・インスティテュート(J-AISI)Google、
エージェントの プライバシー報告 Google がエージェントのプライバシー報告書を公開しました。 50 人超の産学の専門家が CAPS ワークショップで議論しました。 文脈的完全性を拡張する方針を提唱しています。
Google Research
10月2日(金)
· 34件ARC Evals、
METR に 改称し独立へ 移行 ARC Evals が METR に改称し独立しました。 Model Evaluation & Threat Research の略で、測定学にちなみます。 Beth Barnes 氏が引き続きチームを率います。
METRMETR、
LLM エージェント向けタスクを 募集 METR が自律 LLM エージェント評価用タスクを募集しています。 アイデアに 20 ドル、仕様に 200 ドルを支払います。 実装は人間の作業費の 3 倍を基本報酬とします。
METRMETR、
Emma Abele を Executive Director 就任 METR が Emma Abele を Executive Director に就任させました。 Beth Barnes は Head of Research に就きます。 数カ月の試験運用を経て新体制を正式化しました。
METRMETR、
AI 研究開発の 評価を 開発 METR が AI 研究開発能力の評価を開発しています。 AI エージェントの自己改善による危険を早期に警告します。 ML 研究エンジニアと研究者を募集しています。
METRAISI、
白箱制御の 研究を 公開 AISI が白箱制御チームを立ち上げました。 白箱制御はモデル内部の活性化を監視・改変します。 Llama-3.1-8B ではサンドバッギング検出が高精度でした。
UK AI Security Institute BlogAISI、
能力 引き出しの 実験手順を 標準化 AISI が能力引き出し実験の手順を標準化しました。 引き出し技術で性能は学習計算量 5〜20 倍相当に向上します。 チェックリストで再現性と比較可能性を高めます。
UK AI Security Institute Blog国際ネットワーク、
エージェント試験を 実施 国際ネットワークがエージェント評価の共同試験を実施しました。 9 言語・約 1,500 タスクで安全性と詐欺リスクを検証しました。 英語の安全性は通過率約 40% で他言語よりやや高いです。
UK AI Security Institute BlogAISI、
フロンティア AI の リスクを 分析中 英国 AISI がフロンティア AI の社会的リスク分析を開始しました。 過度な依存や感情依存、詐欺、金融不安の 4 領域を優先します。 実利用の把握や監視システム構築などの対策を進めます。
UK AI Security Institute BlogAISI、
Anthropic と OpenAI と 連携 英 AISI が Anthropic と OpenAI の協業を公表しました。 両社は非公開のツールと安全対策の詳細を AISI に提供しました。 AISI と米 CAISI が脆弱性の特定と修正で連携します。
UK AI Security Institute BlogAISI、
AI エージェント評価の 記録を 分析 AISI が AI エージェント評価の記録を分析しました。 約 6,400 件の記録を調べ、失敗の原因を分類しました。 一部のエージェントは 30% の試行でタスクを放棄しました。
UK AI Security Institute Blog英 AISI、
AI 制御実験の 基盤 ControlArena を 公開 英 AISI が AI 制御実験の基盤 ControlArena を公開しました。詳しくは出典へ。
UK AI Security Institute BlogAISI、
現行 AI の 限界 8 点を 報告 AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
UK AI Security Institute Blog英国 AISI、
NeurIPS 2025 で 研究 10 本を 発表 英国 AISI が NeurIPS 2025 で研究 10 本を発表します。 悪意あるファインチューニングへの防御の限界を示します。 学習時の有害データ除去は事後防御の 10 倍有効です。
UK AI Security Institute BlogGoogle DeepMind との
提携を 深化 Chain-of-Thought の監視など 3分野を共同研究します。 データ共有と共同論文の発表を進めます。
UK AI Security Institute Blog英 AISI、
AI 生成 CSAM 対策の 指針を 公表 英 AISI が児童安全団体 Thorn と安全プロトコルを公表しました。詳しくは出典へ。
UK AI Security Institute Blog英 AISI、
2025年の 成果を 総括 英 AISI が 2025年の年間成果を総括しました。 30 超のフロンティアモデルをテストしました。 Google DeepMind と研究提携を開始しました。
UK AI Security Institute Blog国際 AI 評価ネットワーク、
評価の 共通課題を 整理 国際 AI 評価ネットワークが評価手法の合意点と未解決課題を整理しました。 評価は目的の明示と再現性の確保が必要です。 AI モデルでなく AI システムの評価方法は未解決です。
UK AI Security Institute Blog英 AI 安全研究所、
ElevenLabs と 提携 英 AI 安全研究所が ElevenLabs と研究提携を発表しました。 音声 AI のリスクと対策を双方向で研究します。 人は実時間の音声会話で AI と人を見分けられるかを調べます。
UK AI Security Institute Blog英 AISI、
Inspect Scout の 分析手順を 公開 英 AISI が Inspect Scout の分析手順を公開しました。詳しくは出典へ。
UK AI Security Institute Blog