安全性・アライメント
AI の安全性とアライメントです。脱獄と防御、モデルの振る舞いの研究、安全性評価、ガバナンスの枠組みを追います。
新しい順
21–40本目 · 全 68本10月1日(木)
· 3件9月30日(水)
· 4件9月29日(火)
· 3件9月28日(月)
· 2件9月24日(木)
· 1件Anthropic、
Opus 5.5 の カードを 公開 Anthropic が Claude Opus 5.5 のシステムカードを公開しました。詳しくは出典へ。
Don't Worry About the Vase(Zvi)