OpenAI、 ChatGPT for iOS を 更新
OpenAI が ChatGPT for iOS を更新しました。 ホーム画面ウィジェットで最近のタスクを表示できます。 送信後もキーボードを開いたままにする設定を追加しました。
OpenAI が ChatGPT for iOS を更新しました。 ホーム画面ウィジェットで最近のタスクを表示できます。 送信後もキーボードを開いたままにする設定を追加しました。
Anthropic が Claude を約 3 倍高速化しました。 Web 版とデスクトップアプリの利用体験を改善しました。 Claude 自身が改善点を見つけ修正を重ねました。
トランプ米大統領が AI 各社の安全協定に署名しました。 協定は AI ラボの自主規制に委ねる内容です。 米軍が偽の AI 報告で中国船に接近しかけました。
Google がロボット分野で Android 型の戦略を進めています。 同氏の CEO 就任後、初の単独インタビューです。
AWS が AgentCore 上の 4 エージェント移行パターンを解説しました。 IaC 生成は 1 アプリ 3〜4 週間から数分に短縮されました。 MCP ツール経由で社内システムと接続します。
The Den が ChatGPT Work で業務時間を短縮しました。 補助金申請は 3日から 2時間になりました。 酒類免許の書類は 4日から 3時間になりました。
Trump と AI 企業が自主的な安全協定に署名しました。 協定は 4 層の管理と監査を求めますが、参加は任意です。 OpenAI の Developer Day で Sam Altman が Dots を発表しました。
Amazon Quick が Live Data in Apps を導入しました。 公開したアプリはデータセットを開くたびに照会します。 閲覧者の権限に応じた行だけが表示されます。
OpenAI が Codex CLI の v0.160.0 を公開しました。 エージェント司令センターに履歴ページングを追加しました。 Windows の PowerShell フォールバックを修正しました。
ARC Evals が METR に改称し独立しました。 Model Evaluation & Threat Research の略で、測定学にちなみます。 Beth Barnes 氏が引き続きチームを率います。
METR が自律 LLM エージェント評価用タスクを募集しています。 アイデアに 20 ドル、仕様に 200 ドルを支払います。 実装は人間の作業費の 3 倍を基本報酬とします。
METR が Emma Abele を Executive Director に就任させました。 Beth Barnes は Head of Research に就きます。 数カ月の試験運用を経て新体制を正式化しました。
METR が AI 研究開発能力の評価を開発しています。 AI エージェントの自己改善による危険を早期に警告します。 ML 研究エンジニアと研究者を募集しています。
英 AISI が自動採点の評価手法を公開しました。 ベイズ一般化線形モデルで採点者の偏りを同時に評価します。 統計モデルと再現ノートブックを GitHub で公開しています。
AISI が白箱制御チームを立ち上げました。 白箱制御はモデル内部の活性化を監視・改変します。 Llama-3.1-8B ではサンドバッギング検出が高精度でした。
AISI が能力引き出し実験の手順を標準化しました。 引き出し技術で性能は学習計算量 5〜20 倍相当に向上します。 チェックリストで再現性と比較可能性を高めます。
国際ネットワークがエージェント評価の共同試験を実施しました。 9 言語・約 1,500 タスクで安全性と詐欺リスクを検証しました。 英語の安全性は通過率約 40% で他言語よりやや高いです。
英国 AISI がフロンティア AI の社会的リスク分析を開始しました。 過度な依存や感情依存、詐欺、金融不安の 4 領域を優先します。 実利用の把握や監視システム構築などの対策を進めます。
英 AISI が Anthropic と OpenAI の協業を公表しました。 両社は非公開のツールと安全対策の詳細を AISI に提供しました。 AISI と米 CAISI が脆弱性の特定と修正で連携します。
AISI が AI エージェント評価の記録を分析しました。 約 6,400 件の記録を調べ、失敗の原因を分類しました。 一部のエージェントは 30% の試行でタスクを放棄しました。
英 AISI が AI 制御実験の基盤 ControlArena を公開しました。詳しくは出典へ。
AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
英国 AISI が NeurIPS 2025 で研究 10 本を発表します。 悪意あるファインチューニングへの防御の限界を示します。 学習時の有害データ除去は事後防御の 10 倍有効です。
Chain-of-Thought の監視など 3分野を共同研究します。 データ共有と共同論文の発表を進めます。