#推論
今日 2件10月7日(水)
· 2件10月6日(火)
· 2件Qwen3.8 27B、
英単語の 足し算を 検証 Qwen3.8-27B-Q4_K_M の英単語足し算が検証されました。 推論無効時は数値正答率 23.57%、書式遵守は 96.17% です。 推論有効時は 169 件中 167 件で正解しました。
Simon Willison
10月2日(金)
· 5件AISI、
白箱制御の 研究を 公開 AISI が白箱制御チームを立ち上げました。 白箱制御はモデル内部の活性化を監視・改変します。 Llama-3.1-8B ではサンドバッギング検出が高精度でした。
UK AI Security Institute BlogAISI、
現行 AI の 限界 8 点を 報告 AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
UK AI Security Institute Blog
10月1日(木)
· 2件9月30日(水)
· 1件Apple AI、
条件付けの 効果と 流暢さを 調査 Apple AI が条件付け手法の効果と流暢さを調査しました。 効率的なステアリング手法は流暢さを大きく損ないます。 指示チューニング済みモデルでは効果が低下します。
Apple Machine Learning Research
9月29日(火)
· 3件Apple AI、
木構造の 伝達損失を 調査 Apple AI が木構造表現の往復精度を調査しました。 最良の組み合わせでも往復精度は 92.9% です。 生成側の失敗が全体の 73.6% 以上を占めます。
Apple Machine Learning Research
9月28日(月)
· 1件9月26日(土)
· 1件9月25日(金)
· 1件9月18日(金)
· 1件9月13日(日)
· 1件Epoch AI、
GPT-6 Astra を 事前評価 Epoch AI が GPT-6 Astra を事前評価しました。 Astra は ECI などで過去最高を記録しました。 FrontierMath Erdős では 68 問中 2 問を解きました。
Epoch AI(Substack)
9月12日(土)
· 1件Sakana AI、
世界モデル特集に 寄稿 Sakana AI の David Ha が世界モデル特集に寄稿しました。 特集は英国王立協会の科学誌に掲載されました。 現在の AI は因果を理解しているとは限りません。
Sakana AI
9月11日(金)
· 1件9月8日(火)
· 1件9月5日(土)
· 1件8月26日(水)
· 1件ABEJA、
YANS2026 の 参加を 報告 ABEJA が YANS2026 への参加を報告しました。 ゴールドスポンサーとしてブース出展と交流会を実施しました。 ブースで VLA の π0.5 のロボットアームを展示しました。
ABEJA Tech Blog
8月25日(火)
· 2件Multiverse、
4-bit 圧縮モデルの 復元手法 QAH を 公開 Multiverse Computing が圧縮モデルの復元手法 QAH を公開しました。詳しくは出典へ。
Hugging Face BlogTU Delft、
LLM で 自動運転を 調整 TU Delft が LLM で走行スタイルを調整するシステムを開発しました。 「急いでいる」などの要望を速度や滑らかさの調整に変換します。 変更前に内容を説明し、乗客の確認を求める仕組みです。
IEEE Spectrum · AI
8月24日(月)
· 2件Import AI 470、
SPADE と Hawkeye を 特集 METR の分析でサイバー分野の脆弱性報告が 2026年に急増しました。 数学では arXiv 投稿が一部で 12 か月以内に倍増しました。
Import AI
8月21日(金)
· 1件Georgia Tech、
Olmo で 社会推論を 追跡 Georgia Tech のチームが Olmo 3 で社会推論の起源を追跡しました。 Dolma 3 の 576 カテゴリから約 568 万文書を抽出しました。 社会推論は文学や対話的な文章の影響を強く受けました。
Allen Institute for AI (Ai2)
8月17日(月)
· 2件Import AI 469、
科学 AI と RSI を 特集 DiG-bench は 70 のゲームで発見能力を測ります。 Inherent が AI 科学者 Faraday を公開しました。
Import AI
8月13日(木)
· 1件Microsoft、
ベンチマーク MindTopo を 公開 Microsoft がベンチマーク MindTopo を公開しました。 静的認識より対話的な計画で性能が大きく低下します。 失敗は知覚より計画の段階で多く発生します。
Microsoft Research
8月12日(水)
· 2件7月31日(金)
· 1件7月29日(水)
· 1件7月2日(木)
· 1件6月25日(木)
· 1件6月24日(水)
· 1件CyberAgent AI Lab、
ICML 2026 で 6 本採択決定 CyberAgent AI Lab の 6 本の論文が ICML 2026 に採択されました。 採択は 7年連続で、うち 1 本が Oral に選出されました。 Oral は全投稿の 0.7% 程度の難関です。
CyberAgent AI Lab