#OpenAI
今日 3件10月7日(水)
· 3件10月5日(月)
· 1件10月2日(金)
· 5件Graphite、
AI の 口癖 1.3 万件を 分析 Graphite が AI の口癖 1.3 万件を分析しました。 Claude Opus 5.5 は「this matters」を人間の 116 倍使います。 GPT 系は人間の語彙分布から遠ざかっています。
TechCrunch · AI
9月29日(火)
· 1件9月28日(月)
· 1件9月23日(水)
· 1件OpenAI、
MentalHealthBench を 公開 OpenAI が MentalHealthBench を公開しました。 メンタルヘルス会話での AI 応答を評価します。 専門家の知見を反映したベンチマークです。
OpenAI News
9月22日(火)
· 1件英 AISI、
EvalEval で 評価結果を 公開 英 AISI が EvalEval の基盤で評価結果を公開しました。 対象は HealthBench など 5 つのベンチマークです。 Claude Opus 4 系と GPT-5 系の 6 モデルを検証しました。
Hugging Face Blog
9月13日(日)
· 1件Epoch AI、
GPT-6 Astra を 事前評価 Epoch AI が GPT-6 Astra を事前評価しました。 Astra は ECI などで過去最高を記録しました。 FrontierMath Erdős では 68 問中 2 問を解きました。
Epoch AI(Substack)
9月11日(金)
· 1件9月8日(火)
· 1件9月7日(月)
· 1件8月25日(火)
· 1件TU Delft、
LLM で 自動運転を 調整 TU Delft が LLM で走行スタイルを調整するシステムを開発しました。 「急いでいる」などの要望を速度や滑らかさの調整に変換します。 変更前に内容を説明し、乗客の確認を求める仕組みです。
IEEE Spectrum · AI
8月17日(月)
· 1件Import AI 469、
科学 AI と RSI を 特集 DiG-bench は 70 のゲームで発見能力を測ります。 Inherent が AI 科学者 Faraday を公開しました。
Import AI
8月12日(水)
· 1件8月1日(土)
· 1件Epoch AI、
数学ベンチマークを 50 問に 拡大 Epoch AI が FrontierMath: Open Problems を 50 問に拡大しました。 未解決の研究数学の問題を集めたベンチマークです。 AI はこれまでに 3 問を解いています。
Epoch AI(Substack)
7月28日(火)
· 1件Unslop、
主要 AI モデルの 政治傾向を 調査 Unslop が主要 16 モデルの政治傾向を調査しました。 全モデルがリバタリアン左派に分類されました。 Grok 4.5 は実行の半数で経済右派に振れました。
The Register · AI + ML
7月27日(月)
· 1件Import AI 466、
長期的コーディングと ロボット研究 Epoch と METR が長期的なプログラミング課題のベンチマーク MirrorCode を公開しました。詳しくは出典へ。
Import AI
7月17日(金)
· 1件7月9日(木)
· 1件Epoch AI、
ベンチマーク EBR-bench 公開 Epoch AI がベンチマーク EBR-bench を公開しました。 盤ゲーム Earthborne Rangers で経験からの学習を試します。 現時点で AI が経験から学ぶ証拠はほとんど見られません。
Epoch AI(Substack)
6月26日(金)
· 1件6月22日(月)
· 1件6月8日(月)
· 1件5月13日(水)
· 1件4月30日(木)
· 1件2025年10月23日(木)
· 1件METR、
gpt-oss の 評価手法を 検証 METR が gpt-oss-120b の評価手法を検証しました。 悪意あるファインチューニング実験を対象としています。 17 件の提言のうち OpenAI は 9 件を採用しました。
METR