OpenAI、 Codex CLI v0.160.0 を 公開
OpenAI が Codex CLI の v0.160.0 を公開しました。 エージェント司令センターに履歴ページングを追加しました。 Windows の PowerShell フォールバックを修正しました。
OpenAI が Codex CLI の v0.160.0 を公開しました。 エージェント司令センターに履歴ページングを追加しました。 Windows の PowerShell フォールバックを修正しました。
METR が自律 LLM エージェント評価用タスクを募集しています。 アイデアに 20 ドル、仕様に 200 ドルを支払います。 実装は人間の作業費の 3 倍を基本報酬とします。
国際ネットワークがエージェント評価の共同試験を実施しました。 9 言語・約 1,500 タスクで安全性と詐欺リスクを検証しました。 英語の安全性は通過率約 40% で他言語よりやや高いです。
英国 AISI がフロンティア AI の社会的リスク分析を開始しました。 過度な依存や感情依存、詐欺、金融不安の 4 領域を優先します。 実利用の把握や監視システム構築などの対策を進めます。
AISI が AI エージェント評価の記録を分析しました。 約 6,400 件の記録を調べ、失敗の原因を分類しました。 一部のエージェントは 30% の試行でタスクを放棄しました。
英 AISI が AI 制御実験の基盤 ControlArena を公開しました。詳しくは出典へ。
英国 AISI が NeurIPS 2025 で研究 10 本を発表します。 悪意あるファインチューニングへの防御の限界を示します。 学習時の有害データ除去は事後防御の 10 倍有効です。
英 AISI が Inspect Scout の分析手順を公開しました。詳しくは出典へ。
英 NCSC が AI によるサイバー防御の活用を解説しました。 システム強化、脅威検知、対応の自動化の 3 つを挙げています。 AI 能力の向上に備え、今から基盤を整える必要性を説いています。
英 AISI が Claude Mythos Preview のサイバー能力を評価しました。詳しくは出典へ。
Cohere が North で資産管理の業務を自動化します。 North はエージェント型 AI プラットフォームです。 Automations で複数エージェントの業務を連携します。
NVIDIA NeMo Agent Toolkit に S3 Vectors の記憶層を実装します。 NAT は Strands Agents や LangChain に対応するオープンソースです。 S3 Vectors はインデックスあたり最大 20 億ベクトルを扱えます。
Anthropic が AI ネイティブな SDLC の手法を解説しました。 計画や設計、テスト、デプロイの各段階に AI を組み込みます。 人間の承認は規制対象や重要コードのレビューに残します。
Anthropic が Claude 向け Salesforce プラグインを公開しました。詳しくは出典へ。
Anthropic が Claude Code の Projects を刷新しました。詳しくは出典へ。
Balyasny が Claude Fable 5 の評価手法を公開しました。 数千の実務タスクで Fable は 89.4%、従来モデルは 86.1% です。 BAMAgent で数千のエージェントを稼働させます。
Anthropic が Claude Marketplace を公開しました。詳しくは出典へ。
Claude Marketplace が Snowflake と Vercel の購入に対応しました。 Anthropic へのコミット分をパートナー製品に充てられます。 CodeRabbit は Vercel の有料プランへ 1 週間で移行しました。
Anthropic が Claude Code の mods を公開しました。詳しくは出典へ。
Anthropic が Claude Code v2.1.287 を公開しました。 Claude Mods でプラグインが動作を拡張できます。 MCP の URL プロンプトと gh api に対応しました。
Kimi が Kimi Vendor Verifier をオープンソース化しました。詳しくは出典へ。
国連が AI 管理の国際枠組みの必要性を示しました。 グテーレス事務総長は AI が統治能力を超えると警告しました。 生死を左右する判断を AI に委ねるべきでないと強調しました。