Apple、 RISED で エージェント学習を 改善
Apple がエージェント学習手法 RISED を公開しました。 ルーブリックでデータ選択と自己蒸留を導きます。 複数環境で平均合格率が最高となりました。
Apple がエージェント学習手法 RISED を公開しました。 ルーブリックでデータ選択と自己蒸留を導きます。 複数環境で平均合格率が最高となりました。
Apple の研究チームが個人センシングの境界交渉を調査しました。 参加者は Wizard of Oz 方式で自分専用の機械学習を体験しました。 データの客観性など 4 つの境界が交渉されました。
Apple AI が多言語音声モデルの言語識別を強化しました。 識別を事前学習の初期に導入すると効果が最大です。 音素識別の誤りは 11.6% から 10.4% に低下しました。
英 AISI が自動採点の評価手法を公開しました。 ベイズ一般化線形モデルで採点者の偏りを同時に評価します。 統計モデルと再現ノートブックを GitHub で公開しています。
AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
Cohere が学習データの文化ファネルを分析しました。 560 万件超のサンプルで文化信号の減少を確認しました。 多言語化しても文化の割合は頭打ちです。
DeepMind がタンパク質向けの透かし技術 SynthID Bio を発表しました。詳しくは出典へ。
ABEJA が Nemotron 3 Nano に汎用・金融特化の SFT を実施しました。 金融特化モデルは Fin-Harness で 67.28 を記録しました。 NVIDIA 公開の事後学習済みモデルは 59.17 です。
Apple AI が条件付け手法の効果と流暢さを調査しました。 効率的なステアリング手法は流暢さを大きく損ないます。 指示チューニング済みモデルでは効果が低下します。
Apple が継続学習エージェント向け基盤 SCLATE を公開しました。詳しくは出典へ。
Microsoft Research が生物学向け AI 研究基盤 Quine を発表しました。詳しくは出典へ。
Rustuna が制約付き最適化の API を実装しました。 TPE と NSGA-II が制約を考慮してサンプリングします。 Optuna のコードが import 文の変更だけで動作します。
Apple AI が木構造表現の往復精度を調査しました。 最良の組み合わせでも往復精度は 92.9% です。 生成側の失敗が全体の 73.6% 以上を占めます。
Apple が連合変分不等式の収束率を改善しました。 Local Extra SGD の保証をより厳密な解析で強化しました。 新手法 LIPPAX でクライアントドリフトを緩和します。
Preferred Networks が分子構造の復元手法 CoTAR を公開しました。 原子の種類と座標から結合次数を推定します。 古典 MD の評価で 4 カテゴリ平均 94.0% の有効率です。
Apple が ASR の連合半教師あり学習の手法を改善しました。 クライアントごとのオンライン教師は全体教師と同等以上です。 サーバーはラベル付きデータで学習を続ける必要があります。
英 AISI が EvalEval の基盤で評価結果を公開しました。 対象は HealthBench など 5 つのベンチマークです。 Claude Opus 4 系と GPT-5 系の 6 モデルを検証しました。