#安全性・アライメント
今日 3件10月2日(金)
· 19件英 NCSC、
AI サイバー防御の 要点を 説明 英 NCSC が AI によるサイバー防御の活用を解説しました。 システム強化、脅威検知、対応の自動化の 3 つを挙げています。 AI 能力の向上に備え、今から基盤を整える必要性を説いています。
UK AI Security Institute Blog英 AISI、
Claude Mythos Preview の サイバー能力を 評価 英 AISI が Claude Mythos Preview のサイバー能力を評価しました。詳しくは出典へ。
UK AI Security Institute BlogCohere、
文化ファネルを 分析 Cohere が学習データの文化ファネルを分析しました。 560 万件超のサンプルで文化信号の減少を確認しました。 多言語化しても文化の割合は頭打ちです。
Cohere BlogAISI、
AI ロボティクスの 評価ガイドを 公開 AISI が AI ロボティクスの評価ガイドを公開しました。 物理・心理・社会の 3 類型でリスクを整理しています。 カフェ搬送など 2 例で確認観点を 9 項目に整理しました。
AIセーフティ・インスティテュート(J-AISI)AI 情報通、
9月14日 15時の 情報を 報告 Anthropic が Claude の悪用事例をまとめた報告書を公表しました。 Moonshot AI が Kimi のリクエストを Claude へ転送していました。
AIセーフティ・インスティテュート(J-AISI)AISI、
AI セーフティ評価 TF 総会を 開催 AISI が AI セーフティ評価タスクフォース総会を開催します。 評価環境の概要や今年度の活動内容を紹介します。 10月7日開催で参加費は無料、誰でも参加できます。
AIセーフティ・インスティテュート(J-AISI)国連、
AI 開発速度への 懸念を 公表 国連が AI 開発速度への懸念と国際協力を公表しました。 Microsoft AI が人間の管理を重視する指針の初稿を公表しました。
AIセーフティ・インスティテュート(J-AISI)国連、
AI 管理の 国際枠組みを 提言 国連が AI 管理の国際枠組みの必要性を示しました。 グテーレス事務総長は AI が統治能力を超えると警告しました。 生死を左右する判断を AI に委ねるべきでないと強調しました。
AIセーフティ・インスティテュート(J-AISI)
10月1日(木)
· 2件9月30日(水)
· 4件Anthropic、
AI 体験の 公開調査を 開始 Anthropic が AI 体験の聞き取り調査を始めました。 回答は公開を選べば誰でも読めます。 昨年 12月の調査には 81,000 人が参加しました。
Anthropic Research
9月29日(火)
· 3件欧州委員会、
著作権の 意見募集を 開始 欧州委員会が著作権環境の改善に向けた意見募集を始めました。 募集は 9月29日に始まり、11月3日に締め切られます。 創造性とイノベーションのための著作権の取り組みを準備します。
EU Digital Strategy(含 AI Office)OpenAI、
フロンティア AI 学習の 安全指針 OpenAI がフロンティア AI 学習の安全指針を公表しました。 技術的保護策と運用慣行、アライメントずれを対象にします。 初期段階のガイドラインです。
OpenAI News
9月28日(月)
· 1件9月24日(木)
· 1件Anthropic、
拒否応答の 課金を 再開 Anthropic が一部カテゴリの拒否応答で課金を再開します。 対象は bio、frontier_llm、reasoning_extraction です。 Compliance API の Activity Feed はファイル名を返しません。
Claude Platform Release Notes
9月23日(水)
· 3件OpenAI、
Daybreak を ウクライナ政府に 拡大 OpenAI が Daybreak をウクライナ政府に拡大しました。 民間インフラのサイバー防衛を支援します。 Daybreak はサイバー防御向けのプログラムです。
OpenAI NewsOpenAI、
MentalHealthBench を 公開 OpenAI が MentalHealthBench を公開しました。 メンタルヘルス会話での AI 応答を評価します。 専門家の知見を反映したベンチマークです。
OpenAI News
9月22日(火)
· 2件OpenAI、
第三者評価の 原則を 提示 OpenAI がフロンティアモデルの第三者評価の原則を示しました。 厳格で安全、独立した評価を重視します。 対象はフロンティアモデルと安全策です。
OpenAI News
9月21日(月)
· 3件OpenAI、
数学と AI の 諮問グループを 発足 OpenAI が数学と AI の諮問グループを設置しました。 独立した外部のグループが AI の成果を検証します。 新たな数学的結果のレビューと発信を支援します。
OpenAI NewsOpenAI、
AI 標準づくりの 方針を 提示 OpenAI が AI 標準づくりの方針を提示しました。 評価・報告・ガバナンスの国際協調を呼びかけます。 安全性の向上を目的としています。
OpenAI News
9月18日(金)
· 2件OpenAI、
豪州の 若者安全設計図を 説明 OpenAI が豪州の若者安全設計図を公表しました。 AI 体験の安全性を高める 6 本柱の指針です。 若者を保護しつつ力を引き出すことを目指します。
OpenAI NewsApple AI、
ステアリング手法 DSAS を 公開 Apple AI が活性化ステアリング手法 DSAS を公開しました。 不要な介入を抑え、有害性低減と性能維持の両立を改善します。 テキスト生成と画像拡散モデルの両方に適用できます。
Apple Machine Learning Research