UK AISI、 自動採点の 統計手法を 公開
英 AISI が自動採点の評価手法を公開しました。 ベイズ一般化線形モデルで採点者の偏りを同時に評価します。 統計モデルと再現ノートブックを GitHub で公開しています。
英 AISI が自動採点の評価手法を公開しました。 ベイズ一般化線形モデルで採点者の偏りを同時に評価します。 統計モデルと再現ノートブックを GitHub で公開しています。
AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
Cohere が University of Waterloo と提携しました。 AI 変革とチェンジマネジメントの証明書を支援します。 2026年秋開始で、就業体験と実践課題を含みます。
Cohere が学習データの文化ファネルを分析しました。 560 万件超のサンプルで文化信号の減少を確認しました。 多言語化しても文化の割合は頭打ちです。
uniopen が Amazon Nova 2 Lite を自社の審査基準に微調整しました。 737 件の会話ウィンドウで評価し、Macro F1 は 0.5852 です。 SageMaker AI で教師ありファインチューニングを行いました。
Amazon Payments がバンディットで転換率を改善しました。 Amazon SageMaker AI 上の文脈付きバンディットを採用しています。 7 週間の A/B テストで最終転換率が 1 桁台後半の相対改善です。
AI は適切な学習を繰り返して初めて活用可能に育ちます。 質の高いデータ、適切な課題設定、答えの検証の 3 つが要ります。 将棋や囲碁は棋譜が大量にあり AI 適用が進みました。
大企業の回答者の 65% が非エンジニアの開発を実施しています。 AI 生成コードの検証は未実施が 33.3% で最多です。 必要な施策の 1 位は品質チェックツール導入です。
DeepMind がタンパク質向けの透かし技術 SynthID Bio を発表しました。詳しくは出典へ。
ABEJA が Nemotron 3 Nano に汎用・金融特化の SFT を実施しました。 金融特化モデルは Fin-Harness で 67.28 を記録しました。 NVIDIA 公開の事後学習済みモデルは 59.17 です。
Apple AI が条件付け手法の効果と流暢さを調査しました。 効率的なステアリング手法は流暢さを大きく損ないます。 指示チューニング済みモデルでは効果が低下します。
Apple が継続学習エージェント向け基盤 SCLATE を公開しました。詳しくは出典へ。
Microsoft Research が生物学向け AI 研究基盤 Quine を発表しました。詳しくは出典へ。
Rustuna が制約付き最適化の API を実装しました。 TPE と NSGA-II が制約を考慮してサンプリングします。 Optuna のコードが import 文の変更だけで動作します。
Apple AI が木構造表現の往復精度を調査しました。 最良の組み合わせでも往復精度は 92.9% です。 生成側の失敗が全体の 73.6% 以上を占めます。
Microsoft がシンガポール研究拠点の 1年を報告しました。 医療向けマルチモーダル AI と診断エージェントを展開しています。 2026年2月に物流・輸送の AI 円卓会議を共催しました。
Amazon Textract のアダプター管理を自動化する手法です。 アダプター ID を Parameter Store に外部化し無停止で更新できます。 CloudFormation と Terraform のテンプレートを提供します。