#安全性・アライメント
今日 3件7月17日(金)
· 2件7月16日(木)
· 2件7月14日(火)
· 1件7月10日(金)
· 1件Anthropic、
Dreams が Fable 5 に 対応 Anthropic の Dreams が Claude Fable 5 に対応しました。 研究プレビューの機能で、Claude Sonnet 5 も使えます。 CMEK の保全イベントの説明も拡充しました。
Claude Platform Release Notes
7月9日(木)
· 1件Epoch AI、
ベンチマーク EBR-bench 公開 Epoch AI がベンチマーク EBR-bench を公開しました。 盤ゲーム Earthborne Rangers で経験からの学習を試します。 現時点で AI が経験から学ぶ証拠はほとんど見られません。
Epoch AI(Substack)
7月7日(火)
· 1件7月2日(木)
· 1件6月26日(金)
· 1件6月18日(木)
· 1件英 AISI、
評価基盤の Playbook を 公開 英 AISI が Engineering Playbook を公開しました。詳しくは出典へ。
UK AI Security Institute Blog
6月17日(水)
· 1件6月13日(土)
· 1件Epoch AI、
FrontierMath v2 を 公開 Epoch AI が FrontierMath v2 を公開しました。 Claude Fable 5 が首位で、Tier 1〜3 は 87% です。 Tier 4 のスコアは 88% です。
Epoch AI(Substack)
6月12日(金)
· 1件6月11日(木)
· 1件Google、
機械学習の 忘却監査を 発表 Google が機械学習の忘却監査の新手法を発表しました。 f ダイバージェンスで局所的なデータ変化を検出します。 AISTATS 2026 で発表されました。
Google Research
6月10日(水)
· 1件6月8日(月)
· 1件5月28日(木)
· 1件5月21日(木)
· 1件5月16日(土)
· 1件5月13日(水)
· 1件5月8日(金)
· 1件METR、
Anthropic の R&D 評価を 批判 METR が Anthropic の R&D 自動化リスク評価を批判しました。 調査結果の分析と提示方法に重大な問題があると指摘します。 Opus 4.6 のリスクが非常に低いという結論自体には同意します。
METR
5月5日(火)
· 1件英 AISI、
Microsoft と 評価手法を 開発 英 AISI が Microsoft と提携しました。 高リスク AI 能力の評価手法を共同開発します。 会話 AI と利用者の相互作用も研究します。
UK AI Security Institute Blog
3月31日(火)
· 1件3月26日(木)
· 1件3月23日(月)
· 1件ABEJA、
エッジ VLM の 構造化出力を 検証 ABEJA がエッジ環境の VLM による構造化出力を検証しました。 Grammar 制約で JSON 形式を強制し、出力崩れを防ぎます。 Visual Prompt Injection への出力層の防御にもなります。
ABEJA Tech Blog
3月12日(木)
· 2件2月18日(水)
· 1件2025年12月9日(火)
· 1件2025年10月28日(火)
· 1件METR、
Anthropic の sabotage 報告を 検証 METR が Anthropic の sabotage リスク報告をレビューしました。 Claude Opus 4 と 4.1 の壊滅的 sabotage リスクは低いと結論しました。 Opus 4 が本能的な misaligned 推論をする可能性を指摘しました。
METR
2025年10月23日(木)
· 1件METR、
gpt-oss の 評価手法を 検証 METR が gpt-oss-120b の評価手法を検証しました。 悪意あるファインチューニング実験を対象としています。 17 件の提言のうち OpenAI は 9 件を採用しました。
METR
2025年6月27日(金)
· 1件METR、
AI リスク開示の 論点を 提示 METR がフロンティア AI のリスク開示の論点を示しました。 公開情報だけでは危険な能力を把握できないと指摘します。 3 か月ごとの外部チームによるリスク調査案を提示します。
METR
2025年3月11日(火)
· 1件METR、
可読で 忠実な 推論の 価値を 説明 METR が AI 推論の可読性と忠実性の価値を解説しました。 可読で忠実な推論は AI のミスや欺瞞の検出を容易にします。 OpenAI や Anthropic など 5 社が推論モデルを公開しました。
METR
2025年1月17日(金)
· 1件METR、
配備前テストだけでは 不十分 METR が配備前テスト偏重の AI 安全政策は不十分だと指摘しました。 モデル窃取や内部利用による壊滅的悪用は防げません。 危険能力の早期評価と重みの保護、透明性の強化を求めています。
METR