新着
今日 6件4月16日(木)
· 1件4月14日(火)
· 1件4月9日(木)
· 2件Google、
ユーザー模擬データを 公開 Google がユーザー模擬データを公開しました。 会話は 4,000 件超、ターン数は約 15,000 です。 「Good」と「Bad」の 2 種のエージェントで反応を収集しました。
Google Research
4月3日(金)
· 1件Google Research、
LLM の 行動傾向の 評価枠組みを 公開 Google Research が LLM の行動傾向を評価する枠組みを公開しました。詳しくは出典へ。
Google Research
4月1日(水)
· 1件Google、
評価者数の 設計を 分析 Google が評価者数の設計を分析しました。 項目あたり 10 人超で信頼性が向上します。 約 1,000 件の注釈で再現性を確保できます。
Google Research
3月31日(火)
· 1件3月25日(水)
· 2件Google Research、
S2Vec を 公開 Google Research が S2Vec を公開しました。 都市環境の埋め込みを自己教師あり学習で生成します。 社会経済予測で画像ベース手法と同等の性能です。
Google Research
3月18日(水)
· 1件3月17日(火)
· 1件Google、
高温超 伝導で LLM を 評価 Google が高温超伝導の専門家問題で LLM を評価しました。 NotebookLM と独自 RAG が上位 2 つに入りました。 6 つの LLM に専門家が 67 問を出題し採点しました。
Google Research
3月13日(金)
· 1件SPEX、
LLM の 相互作用を 分析 SPEX が LLM の重要な相互作用を特定します。 ProxySPEX は約 10 倍少ないアブレーションで同等の性能です。 SPEX は数千特徴の入力でも忠実度を維持します。
Berkeley AI Research
3月12日(木)
· 3件3月5日(木)
· 1件ABEJA、
ロング文脈評価ベンチマーク公開 ABEJA がロングコンテキスト評価のベンチマークを公開しました。 GENIAC3 期の基盤モデル開発で使用したベンチマークを含みます。 MRCR は日本語版も作成し、公開しました。
ABEJA Tech Blog
3月2日(月)
· 1件Stockmark、
NLP2026 の 論文 5 本を 公開 Stockmark が NLP2026 で発表する論文を公開しました。 シーズとニーズを知識グラフで結ぶ手法を提案します。 専門家評価付きの製品アイデアデータセットも公開します。
Stockmark Tech Blog
2月13日(金)
· 1件1月30日(金)
· 1件Differential Transformer V2 が
登場 Hugging Face が Differential Transformer V2 を発表しました。 V2 は KV キャッシュを増やさずデコード速度を改善します。 V1 は推論速度が約 6〜12% 低下する課題がありました。
ABEJA Tech Blog
1月10日(土)
· 1件Berkeley、
画像設計の 情報指標を 発表 Berkeley が画像システムの情報量評価手法を発表しました。 相互情報量で解像度やノイズをまとめて評価します。 色写真や電波天文など 4 領域で有効性を確認しました。
Berkeley AI Research
2025年12月24日(水)
· 1件DeepSeek-R1 の
論文、 学習手法を 読み解く DeepSeek-R1 は DeepSeek-V3-Base をベースにしています。 少数の CoT データでファインチューニングします。 強化学習には GRPO とルールベース報酬を使います。
ABEJA Tech Blog
2025年12月9日(火)
· 1件2025年11月1日(土)
· 1件Berkeley、
TD 学習なしの RL を 解説 Berkeley の研究が TD 学習なしの RL を解説しました。 分割統治で Bellman 再帰を対数的に削減します。 ゴール条件付き RL で複雑なタスクに適用できます。
Berkeley AI Research
2025年10月28日(火)
· 1件METR、
Anthropic の sabotage 報告を 検証 METR が Anthropic の sabotage リスク報告をレビューしました。 Claude Opus 4 と 4.1 の壊滅的 sabotage リスクは低いと結論しました。 Opus 4 が本能的な misaligned 推論をする可能性を指摘しました。
METR
2025年10月23日(木)
· 1件METR、
gpt-oss の 評価手法を 検証 METR が gpt-oss-120b の評価手法を検証しました。 悪意あるファインチューニング実験を対象としています。 17 件の提言のうち OpenAI は 9 件を採用しました。
METR
2025年9月1日(月)
· 1件word2vec、
学習過程の 理論を 解明 word2vec の学習過程を説明する理論を証明しました。 学習は埋め込みのランクを段階的に増やす離散的な手順です。 最終的な埋め込みは PCA で与えられます。
Berkeley AI Research