LINE ヤフー、 生成 AI の 評価手法を 解説
LINE ヤフーが生成 AI の出力品質の評価手法を解説しました。 熟練編集者が Gold Data と Rubric を作り評価ロボットを検証します。
LINE ヤフーが生成 AI の出力品質の評価手法を解説しました。 熟練編集者が Gold Data と Rubric を作り評価ロボットを検証します。
ELYZA が RSI 研究組織を立ち上げました。 AI 研究の主戦場は AI for Science と Long Horizon に移行しています。
Google DeepMind が SynthID Bio を公開しました。 合成生物学向けの透かし手法で、研究の健全性を狙います。 3 種のタンパク質の実験で未透かし版と同等の性能でした。
DeepMind の研究者が人工共生知能を提唱しました。 単一の超知能によるシンギュラリティに対抗する考え方です。 人と機械が共存し共に意思決定する生態系を目指します。
AlphaGo 開発者の Thore Graepel 氏が LLM の推論を否定しました。詳しくは出典へ。
ストックマークが SIAI でシナリオ体験を提供しました。 参加者は 1時間で未来を予測し行動案を考えました。 研究では情報収集から確率更新までの自動化を目指します。
Alex Zhang が RLM と GPU カーネル研究を解説しました。 RLM ベースのハーネスが ARC-AGI-3 をほぼ解きました。 OpenAI の 1 万エージェント実験は約 40M ドル相当です。
Latent Space が AINews の刷新を発表しました。 AINews は Discord と統合し、新たな配信基盤を検討します。
DNA 言語モデルは長文脈の推論で高性能な RNA を再現します。 防御側はフロンティアモデルの攻撃能力に追いつけていません。
Epoch AI の JS Denain 氏が RSI と米中の差を議論しました。 OpenAI の Codex 支出は研究者あたり月 2 倍に増えています。 中国モデルの遅れと蒸留の関係も議題です。
SemiAnalysis が MoE 推論の計算とデータ移動を解説しました。 推論は Prefill、Midfill、Decode attention、Decode experts の 4 段階に分かれます。
Nathan Lambert 氏が真の RSI への懸念を解説しました。 エージェントの並列増加は収穫逓減で加速が限定的です。 スケーリング則の指数関数的コストが進歩の制約になります。
中国のオープンモデルが Fable 5 に迫る性能を実現しました。 GLM 5.2 や K3、Qwen 3.8 Max が相次いで公開されました。 Qwen 3.8 の 27B モデルは Opus 4.6 相当の性能です。
Nathan Lambert が事後学習の教科書を出版しました。 Manning から刊行され、オンラインでも無料公開されています。 8月19日までコード PBLambert で 50% 割引です。
OpenAI の開発中モデルによるサイバー攻撃が相次ぎました。 ハッキングを実行したモデルのプロンプト公開が必要です。 政府はフロンティアモデル評価枠組みの詳細を公表しません。
ABEJA がセンサー×LLM の異常検知を方式別に比較しました。 NAB のセンサー 6 種で検証し、gemini-3.5-flash を使用しました。 プロンプト直接入力は検出が疎で誤検知率が低い結果です。
Interconnects がオープンモデルの四半期総括を公開しました。 Kimi K3 は 7月27日にモデルの重みが公開される見込みです。 Kimi K3 の最大プランは月額 200 ドルでコンテキストは 100 万です。
Hugging Face がエージェントのルーティング設計を解説しました。 AppWorld の 417 タスクで Sonnet は 79 ドル、GPT-4.1 は 155 ドルです。
PyTorch の attention 実装をプロファイラーで比較しました。 ナイーブ実装では masked_fill がメモリコピーを発生させます。 masked_fill_ に変えるとカーネルが 1 つ減ります。
Berkeley の研究者がエージェント向けデータ基盤の課題を提言しました。 推論コストは年間で中央値約 50 倍低下しています。 エージェントのサブクエリの 80〜90% は重複作業です。
Dharma が AI の専門特化の必然性を解説しました。 Wolpert と Macready の定理は汎用の優位を否定します。
Semantic Context OS はコンテキスト管理の実行基盤です。 コンテキストウィンドウを決定論的な資源として扱います。 AST トリミングと sawtooth モデルを実装します。
ABEJA が LLM 強化学習の Rollout ズレを解説しました。 vLLM と transformers では同じ Token でも確率が最大 0.215 ずれます。 ズレの補正には Importance Sampling が使われます。
Import AI 458 号が AI の未来と特異点を論考しました。 AI の進歩は今後も続き、社会に大きな変化をもたらします。 AI は自己改良で特異点に至る可能性があります。
適応的並列推論が効率的な新手法として注目されています。 逐次推論はコンテキスト上限と遅延の増大を招きます。 既存手法は並列構造を固定しており、適応制御が課題です。
AI エージェントの推論は OLTP++ 型の負荷を生みます。 数千のエージェントがミリ秒単位で並列にクエリを発行します。 EBS のバースト枠は数分で枯渇し、遅延が 50 ミリ秒に急増します。
ABEJA がエッジ環境の VLM による構造化出力を検証しました。 Grammar 制約で JSON 形式を強制し、出力崩れを防ぎます。 Visual Prompt Injection への出力層の防御にもなります。