安全性・アライメント
AI の安全性とアライメントです。脱獄と防御、モデルの振る舞いの研究、安全性評価、ガバナンスの枠組みを追います。
新しい順
1–20本目 · 全 68本10月7日(水)
· 1件10月5日(月)
· 1件10月2日(金)
· 12件英 AISI、
AI 制御実験の 基盤 ControlArena を 公開 英 AISI が AI 制御実験の基盤 ControlArena を公開しました。詳しくは出典へ。
UK AI Security Institute Blog英 AISI、
AI 生成 CSAM 対策の 指針を 公表 英 AISI が児童安全団体 Thorn と安全プロトコルを公表しました。詳しくは出典へ。
UK AI Security Institute Blog英 AISI、
Claude Mythos Preview の サイバー能力を 評価 英 AISI が Claude Mythos Preview のサイバー能力を評価しました。詳しくは出典へ。
UK AI Security Institute Blog