#ベンチマーク
今日 1件10月7日(水)
· 1件10月6日(火)
· 3件Qwen3.8 27B、
英単語の 足し算を 検証 Qwen3.8-27B-Q4_K_M の英単語足し算が検証されました。 推論無効時は数値正答率 23.57%、書式遵守は 96.17% です。 推論有効時は 169 件中 167 件で正解しました。
Simon Willison
10月4日(日)
· 1件10月3日(土)
· 2件OpenAI、
GPT-6.1 Sol を 新たに 公開 OpenAI が GPT-6.1 Sol を公開しました。 入力 100 万 Token あたり 2 ドル、出力 10 ドルです。 DeepSWE v1.1 で GPT-6 Sol を 6.4 点上回ります。
Latent Space
10月2日(金)
· 18件ARC Evals、
METR に 改称し独立へ 移行 ARC Evals が METR に改称し独立しました。 Model Evaluation & Threat Research の略で、測定学にちなみます。 Beth Barnes 氏が引き続きチームを率います。
METRMETR、
LLM エージェント向けタスクを 募集 METR が自律 LLM エージェント評価用タスクを募集しています。 アイデアに 20 ドル、仕様に 200 ドルを支払います。 実装は人間の作業費の 3 倍を基本報酬とします。
METRUK AISI、
自動採点の 統計手法を 公開 英 AISI が自動採点の評価手法を公開しました。 ベイズ一般化線形モデルで採点者の偏りを同時に評価します。 統計モデルと再現ノートブックを GitHub で公開しています。
UK AI Security Institute BlogAISI、
能力 引き出しの 実験手順を 標準化 AISI が能力引き出し実験の手順を標準化しました。 引き出し技術で性能は学習計算量 5〜20 倍相当に向上します。 チェックリストで再現性と比較可能性を高めます。
UK AI Security Institute Blog国際ネットワーク、
エージェント試験を 実施 国際ネットワークがエージェント評価の共同試験を実施しました。 9 言語・約 1,500 タスクで安全性と詐欺リスクを検証しました。 英語の安全性は通過率約 40% で他言語よりやや高いです。
UK AI Security Institute BlogAISI、
AI エージェント評価の 記録を 分析 AISI が AI エージェント評価の記録を分析しました。 約 6,400 件の記録を調べ、失敗の原因を分類しました。 一部のエージェントは 30% の試行でタスクを放棄しました。
UK AI Security Institute BlogAISI、
現行 AI の 限界 8 点を 報告 AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
UK AI Security Institute Blog英国 AISI、
NeurIPS 2025 で 研究 10 本を 発表 英国 AISI が NeurIPS 2025 で研究 10 本を発表します。 悪意あるファインチューニングへの防御の限界を示します。 学習時の有害データ除去は事後防御の 10 倍有効です。
UK AI Security Institute Blog英 AISI、
2025年の 成果を 総括 英 AISI が 2025年の年間成果を総括しました。 30 超のフロンティアモデルをテストしました。 Google DeepMind と研究提携を開始しました。
UK AI Security Institute Blog国際 AI 評価ネットワーク、
評価の 共通課題を 整理 国際 AI 評価ネットワークが評価手法の合意点と未解決課題を整理しました。 評価は目的の明示と再現性の確保が必要です。 AI モデルでなく AI システムの評価方法は未解決です。
UK AI Security Institute BlogKimi、
検証ツール Vendor Verifier を 公開 Kimi が Kimi Vendor Verifier をオープンソース化しました。詳しくは出典へ。
Kimi(Moonshot AI)BlogCAIS、
不正評価の CheatBench を 公開 CAIS が CheatBench を公開しました。 Google は Android Bench 2.0 も公開しました。 AI の不正と長期開発の実力を評価します。
Ledge.ai
10月1日(木)
· 2件9月30日(水)
· 2件Apple、
エージェント基盤 SCLATE を 公開 Apple が継続学習エージェント向け基盤 SCLATE を公開しました。詳しくは出典へ。
Apple Machine Learning Research
9月29日(火)
· 1件Apple AI、
木構造の 伝達損失を 調査 Apple AI が木構造表現の往復精度を調査しました。 最良の組み合わせでも往復精度は 92.9% です。 生成側の失敗が全体の 73.6% 以上を占めます。
Apple Machine Learning Research
9月26日(土)
· 1件9月24日(木)
· 1件SemiAnalysis、
ClusterMAX 3.0 を 公開 SemiAnalysis が ClusterMAX 3.0 を公開しました。 77 社の neocloud を評価し、市場調査は 323 社に拡大しました。 Nebius が CoreWeave と並び Platinum 評価です。
SemiAnalysis
9月23日(水)
· 1件OpenAI、
MentalHealthBench を 公開 OpenAI が MentalHealthBench を公開しました。 メンタルヘルス会話での AI 応答を評価します。 専門家の知見を反映したベンチマークです。
OpenAI News
9月22日(火)
· 2件英 AISI、
EvalEval で 評価結果を 公開 英 AISI が EvalEval の基盤で評価結果を公開しました。 対象は HealthBench など 5 つのベンチマークです。 Claude Opus 4 系と GPT-5 系の 6 モデルを検証しました。
Hugging Face Blog
9月18日(金)
· 1件Anthropic、
Claude Code に Projects を 導入 Anthropic が Claude Code に Projects を導入しました。 1 つの会話から並列のクラウドセッションを起動できます。 スレッドはクラウドで実行され、ローカル対応は今後です。
Latent Space
9月17日(木)
· 1件9月15日(火)
· 1件9月13日(日)
· 1件Epoch AI、
GPT-6 Astra を 事前評価 Epoch AI が GPT-6 Astra を事前評価しました。 Astra は ECI などで過去最高を記録しました。 FrontierMath Erdős では 68 問中 2 問を解きました。
Epoch AI(Substack)