本文へ移動
10/7(水) 13:08
あとで読む
話題初出 10/2 06:06更新 10/2(金)

英 AISI、Anthropic モデルを評価

独立ソース1
6時間の増加→ 0
一次情報2
続報0
要

この話題の要約

1ソースから · 3行で
  • 英 AISI が安全研究への妨害を評価する手法を公開しました。
  • Claude の複数モデルを Anthropic と共同で検証しました。
  • 自発的な妨害はどのモデルにも見られませんでした。

AI要約です。詳しくは出典へ。

典

タイムライン

1ソース · 新しい順 · JST
10月2日(金)
  1. UK AI Security Institute Blog一次続報英 AISI、アライメント評価を公開英 AISI がアライメント評価の新手法を公開しました。詳しくは出典へ。
  2. UK AI Security Institute Blog一次初出英 AISI、安全研究への妨害を評価英 AISI が AI の安全研究妨害を評価する手法を公開しました。詳しくは出典へ。

この話題の熱量

いまの熱量 3最大 5(10/3(土) 08:00)24 時間前と比べて 不明

024610/3(土)08:0010/3(土)15:0010/3(土)23:0010/4(日)06:00

続けて確認できた同じ範囲のソースだけを比べています。いまの熱量の集計より、範囲が狭いことがあります。ポインタを動かすか、タップすると 1 時間ごとの熱量が出ます。キーボードは左右の矢印で動かせます。