OpenAI、 GPT-6.1 Sol を 新たに 公開
OpenAI が GPT-6.1 Sol を公開しました。 入力 100 万 Token あたり 2 ドル、出力 10 ドルです。 DeepSWE v1.1 で GPT-6 Sol を 6.4 点上回ります。
OpenAI が GPT-6.1 Sol を公開しました。 入力 100 万 Token あたり 2 ドル、出力 10 ドルです。 DeepSWE v1.1 で GPT-6 Sol を 6.4 点上回ります。
ARC Evals が METR に改称し独立しました。 Model Evaluation & Threat Research の略で、測定学にちなみます。 Beth Barnes 氏が引き続きチームを率います。
METR が自律 LLM エージェント評価用タスクを募集しています。 アイデアに 20 ドル、仕様に 200 ドルを支払います。 実装は人間の作業費の 3 倍を基本報酬とします。
英 AISI が 2025年の年間成果を総括しました。 30 超のフロンティアモデルをテストしました。 Google DeepMind と研究提携を開始しました。
国際 AI 評価ネットワークが評価手法の合意点と未解決課題を整理しました。 評価は目的の明示と再現性の確保が必要です。 AI モデルでなく AI システムの評価方法は未解決です。
SemiAnalysis が ClusterMAX 3.0 を公開しました。 77 社の neocloud を評価し、市場調査は 323 社に拡大しました。 Nebius が CoreWeave と並び Platinum 評価です。
Anthropic が Claude Code に Projects を導入しました。 1 つの会話から並列のクラウドセッションを起動できます。 スレッドはクラウドで実行され、ローカル対応は今後です。
Anthropic が Claude Sonnet 5 を公開しました。 エージェント型コーディングの性能が向上しています。 期間限定の割引価格で提供されます。