Qwen3.8 27B、 英単語の 足し算を 検証
Qwen3.8-27B-Q4_K_M の英単語足し算が検証されました。 推論無効時は数値正答率 23.57%、書式遵守は 96.17% です。 推論有効時は 169 件中 167 件で正解しました。
Qwen3.8-27B-Q4_K_M の英単語足し算が検証されました。 推論無効時は数値正答率 23.57%、書式遵守は 96.17% です。 推論有効時は 169 件中 167 件で正解しました。
英 AISI が自動採点の評価手法を公開しました。 ベイズ一般化線形モデルで採点者の偏りを同時に評価します。 統計モデルと再現ノートブックを GitHub で公開しています。
AISI が能力引き出し実験の手順を標準化しました。 引き出し技術で性能は学習計算量 5〜20 倍相当に向上します。 チェックリストで再現性と比較可能性を高めます。
国際ネットワークがエージェント評価の共同試験を実施しました。 9 言語・約 1,500 タスクで安全性と詐欺リスクを検証しました。 英語の安全性は通過率約 40% で他言語よりやや高いです。
AISI が AI エージェント評価の記録を分析しました。 約 6,400 件の記録を調べ、失敗の原因を分類しました。 一部のエージェントは 30% の試行でタスクを放棄しました。
AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
英国 AISI が NeurIPS 2025 で研究 10 本を発表します。 悪意あるファインチューニングへの防御の限界を示します。 学習時の有害データ除去は事後防御の 10 倍有効です。
CAIS が CheatBench を公開しました。 Google は Android Bench 2.0 も公開しました。 AI の不正と長期開発の実力を評価します。
Apple が継続学習エージェント向け基盤 SCLATE を公開しました。詳しくは出典へ。
Apple AI が木構造表現の往復精度を調査しました。 最良の組み合わせでも往復精度は 92.9% です。 生成側の失敗が全体の 73.6% 以上を占めます。
OpenAI が MentalHealthBench を公開しました。 メンタルヘルス会話での AI 応答を評価します。 専門家の知見を反映したベンチマークです。
英 AISI が EvalEval の基盤で評価結果を公開しました。 対象は HealthBench など 5 つのベンチマークです。 Claude Opus 4 系と GPT-5 系の 6 モデルを検証しました。
Epoch AI が GPT-6 Astra を事前評価しました。 Astra は ECI などで過去最高を記録しました。 FrontierMath Erdős では 68 問中 2 問を解きました。
Hugging Face がベンチマーク監査手法 BenchMIRT を公開しました。 BBQ や WMDP のスコアは安全性より一般推論と強く関連します。
DiG-bench は 70 のゲームで発見能力を測ります。 Inherent が AI 科学者 Faraday を公開しました。
Microsoft がベンチマーク MindTopo を公開しました。 静的認識より対話的な計画で性能が大きく低下します。 失敗は知覚より計画の段階で多く発生します。
Hugging Face が ALTK-Evolve を公開しました。 AppWorld で ACE より少ない Token で高い精度です。 DeepSeek-V3.2 では推論コストが ACE の約 40% です。
Epoch AI が FrontierMath: Open Problems を 50 問に拡大しました。 未解決の研究数学の問題を集めたベンチマークです。 AI はこれまでに 3 問を解いています。
Unslop が主要 16 モデルの政治傾向を調査しました。 全モデルがリバタリアン左派に分類されました。 Grok 4.5 は実行の半数で経済右派に振れました。