新着
今日 23件10月2日(金)
· 40件ARC Evals、
METR に 改称し独立へ 移行 ARC Evals が METR に改称し独立しました。 Model Evaluation & Threat Research の略で、測定学にちなみます。 Beth Barnes 氏が引き続きチームを率います。
METRMETR、
LLM エージェント向けタスクを 募集 METR が自律 LLM エージェント評価用タスクを募集しています。 アイデアに 20 ドル、仕様に 200 ドルを支払います。 実装は人間の作業費の 3 倍を基本報酬とします。
METRMETR、
Emma Abele を Executive Director 就任 METR が Emma Abele を Executive Director に就任させました。 Beth Barnes は Head of Research に就きます。 数カ月の試験運用を経て新体制を正式化しました。
METRMETR、
AI 研究開発の 評価を 開発 METR が AI 研究開発能力の評価を開発しています。 AI エージェントの自己改善による危険を早期に警告します。 ML 研究エンジニアと研究者を募集しています。
METRUK AISI、
自動採点の 統計手法を 公開 英 AISI が自動採点の評価手法を公開しました。 ベイズ一般化線形モデルで採点者の偏りを同時に評価します。 統計モデルと再現ノートブックを GitHub で公開しています。
UK AI Security Institute BlogAISI、
白箱制御の 研究を 公開 AISI が白箱制御チームを立ち上げました。 白箱制御はモデル内部の活性化を監視・改変します。 Llama-3.1-8B ではサンドバッギング検出が高精度でした。
UK AI Security Institute BlogAISI、
能力 引き出しの 実験手順を 標準化 AISI が能力引き出し実験の手順を標準化しました。 引き出し技術で性能は学習計算量 5〜20 倍相当に向上します。 チェックリストで再現性と比較可能性を高めます。
UK AI Security Institute Blog国際ネットワーク、
エージェント試験を 実施 国際ネットワークがエージェント評価の共同試験を実施しました。 9 言語・約 1,500 タスクで安全性と詐欺リスクを検証しました。 英語の安全性は通過率約 40% で他言語よりやや高いです。
UK AI Security Institute BlogAISI、
フロンティア AI の リスクを 分析中 英国 AISI がフロンティア AI の社会的リスク分析を開始しました。 過度な依存や感情依存、詐欺、金融不安の 4 領域を優先します。 実利用の把握や監視システム構築などの対策を進めます。
UK AI Security Institute BlogAISI、
Anthropic と OpenAI と 連携 英 AISI が Anthropic と OpenAI の協業を公表しました。 両社は非公開のツールと安全対策の詳細を AISI に提供しました。 AISI と米 CAISI が脆弱性の特定と修正で連携します。
UK AI Security Institute BlogAISI、
AI エージェント評価の 記録を 分析 AISI が AI エージェント評価の記録を分析しました。 約 6,400 件の記録を調べ、失敗の原因を分類しました。 一部のエージェントは 30% の試行でタスクを放棄しました。
UK AI Security Institute Blog英 AISI、
AI 制御実験の 基盤 ControlArena を 公開 英 AISI が AI 制御実験の基盤 ControlArena を公開しました。詳しくは出典へ。
UK AI Security Institute BlogAISI、
現行 AI の 限界 8 点を 報告 AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
UK AI Security Institute Blog英国 AISI、
NeurIPS 2025 で 研究 10 本を 発表 英国 AISI が NeurIPS 2025 で研究 10 本を発表します。 悪意あるファインチューニングへの防御の限界を示します。 学習時の有害データ除去は事後防御の 10 倍有効です。
UK AI Security Institute BlogGoogle DeepMind との
提携を 深化 Chain-of-Thought の監視など 3分野を共同研究します。 データ共有と共同論文の発表を進めます。
UK AI Security Institute Blog英 AISI、
AI 生成 CSAM 対策の 指針を 公表 英 AISI が児童安全団体 Thorn と安全プロトコルを公表しました。詳しくは出典へ。
UK AI Security Institute Blog英 AISI、
2025年の 成果を 総括 英 AISI が 2025年の年間成果を総括しました。 30 超のフロンティアモデルをテストしました。 Google DeepMind と研究提携を開始しました。
UK AI Security Institute Blog国際 AI 評価ネットワーク、
評価の 共通課題を 整理 国際 AI 評価ネットワークが評価手法の合意点と未解決課題を整理しました。 評価は目的の明示と再現性の確保が必要です。 AI モデルでなく AI システムの評価方法は未解決です。
UK AI Security Institute Blog英 AI 安全研究所、
ElevenLabs と 提携 英 AI 安全研究所が ElevenLabs と研究提携を発表しました。 音声 AI のリスクと対策を双方向で研究します。 人は実時間の音声会話で AI と人を見分けられるかを調べます。
UK AI Security Institute Blog英 AISI、
Inspect Scout の 分析手順を 公開 英 AISI が Inspect Scout の分析手順を公開しました。詳しくは出典へ。
UK AI Security Institute Blog英 NCSC、
AI サイバー防御の 要点を 説明 英 NCSC が AI によるサイバー防御の活用を解説しました。 システム強化、脅威検知、対応の自動化の 3 つを挙げています。 AI 能力の向上に備え、今から基盤を整える必要性を説いています。
UK AI Security Institute Blog