#Anthropic
今日 0件10月5日(月)
· 1件10月4日(日)
· 2件10月3日(土)
· 1件10月2日(金)
· 12件英 AISI、
Claude Mythos Preview の サイバー能力を 評価 英 AISI が Claude Mythos Preview のサイバー能力を評価しました。詳しくは出典へ。
UK AI Security Institute BlogGraphite、
AI の 口癖 1.3 万件を 分析 Graphite が AI の口癖 1.3 万件を分析しました。 Claude Opus 5.5 は「this matters」を人間の 116 倍使います。 GPT 系は人間の語彙分布から遠ざかっています。
TechCrunch · AIClaude、
未知の 酵素システムを 発見 Claude がファージから酵素システムを発見しました。 CRISPR に似た反復配列で、ゲノム編集への利用が期待されます。 アモデイ氏は医学研究の加速に期待を示しました。
Ledge.ai
10月1日(木)
· 1件9月30日(水)
· 1件9月26日(土)
· 1件9月25日(金)
· 1件9月23日(水)
· 2件9月22日(火)
· 2件英 AISI、
EvalEval で 評価結果を 公開 英 AISI が EvalEval の基盤で評価結果を公開しました。 対象は HealthBench など 5 つのベンチマークです。 Claude Opus 4 系と GPT-5 系の 6 モデルを検証しました。
Hugging Face Blog
9月18日(金)
· 1件9月13日(日)
· 1件Epoch AI、
GPT-6 Astra を 事前評価 Epoch AI が GPT-6 Astra を事前評価しました。 Astra は ECI などで過去最高を記録しました。 FrontierMath Erdős では 68 問中 2 問を解きました。
Epoch AI(Substack)
9月11日(金)
· 1件9月10日(木)
· 1件9月5日(土)
· 1件8月17日(月)
· 1件Import AI 469、
科学 AI と RSI を 特集 DiG-bench は 70 のゲームで発見能力を測ります。 Inherent が AI 科学者 Faraday を公開しました。
Import AI
8月1日(土)
· 1件Epoch AI、
数学ベンチマークを 50 問に 拡大 Epoch AI が FrontierMath: Open Problems を 50 問に拡大しました。 未解決の研究数学の問題を集めたベンチマークです。 AI はこれまでに 3 問を解いています。
Epoch AI(Substack)
7月28日(火)
· 1件Unslop、
主要 AI モデルの 政治傾向を 調査 Unslop が主要 16 モデルの政治傾向を調査しました。 全モデルがリバタリアン左派に分類されました。 Grok 4.5 は実行の半数で経済右派に振れました。
The Register · AI + ML
7月27日(月)
· 1件Import AI 466、
長期的コーディングと ロボット研究 Epoch と METR が長期的なプログラミング課題のベンチマーク MirrorCode を公開しました。詳しくは出典へ。
Import AI
7月23日(木)
· 1件7月17日(金)
· 1件7月9日(木)
· 1件Epoch AI、
ベンチマーク EBR-bench 公開 Epoch AI がベンチマーク EBR-bench を公開しました。 盤ゲーム Earthborne Rangers で経験からの学習を試します。 現時点で AI が経験から学ぶ証拠はほとんど見られません。
Epoch AI(Substack)
6月27日(土)
· 1件6月22日(月)
· 1件6月13日(土)
· 1件Epoch AI、
FrontierMath v2 を 公開 Epoch AI が FrontierMath v2 を公開しました。 Claude Fable 5 が首位で、Tier 1〜3 は 87% です。 Tier 4 のスコアは 88% です。
Epoch AI(Substack)