LINE ヤフー、 生成 AI の 評価手法を 解説
LINE ヤフーが生成 AI の出力品質の評価手法を解説しました。 熟練編集者が Gold Data と Rubric を作り評価ロボットを検証します。
LINE ヤフーが生成 AI の出力品質の評価手法を解説しました。 熟練編集者が Gold Data と Rubric を作り評価ロボットを検証します。
ELYZA が RSI 研究組織を立ち上げました。 AI 研究の主戦場は AI for Science と Long Horizon に移行しています。
Claude の Models API に thinking 無効化の指定が加わりました。 GET /v1/models で thinking 無効化に対応するか確認できます。 thinking: {type: "disabled"} で thinking をオフにできます。
各セッションは 50分で、専門家の知見と Q&A で構成されます。 会場はサンフランシスコの Moscone West、10月13日から 15日です。
Qwen3.8-27B-Q4_K_M の英単語足し算が検証されました。 推論無効時は数値正答率 23.57%、書式遵守は 96.17% です。 推論有効時は 169 件中 167 件で正解しました。
Google DeepMind が SynthID Bio を公開しました。 合成生物学向けの透かし手法で、研究の健全性を狙います。 3 種のタンパク質の実験で未透かし版と同等の性能でした。
DeepMind の研究者が人工共生知能を提唱しました。 単一の超知能によるシンギュラリティに対抗する考え方です。 人と機械が共存し共に意思決定する生態系を目指します。
Google が Gemini 4 Argon を発表しました。 出力上限は 100 万 Token です。 まずサイバー防御向けに限定提供します。
AlphaGo 開発者の Thore Graepel 氏が LLM の推論を否定しました。詳しくは出典へ。
ストックマークが SIAI でシナリオ体験を提供しました。 参加者は 1時間で未来を予測し行動案を考えました。 研究では情報収集から確率更新までの自動化を目指します。
Alex Zhang が RLM と GPU カーネル研究を解説しました。 RLM ベースのハーネスが ARC-AGI-3 をほぼ解きました。 OpenAI の 1 万エージェント実験は約 40M ドル相当です。
OpenAI が GPT-6 Astra Ultrafast を API で提供開始しました。詳しくは出典へ。
AISI が白箱制御チームを立ち上げました。 白箱制御はモデル内部の活性化を監視・改変します。 Llama-3.1-8B ではサンドバッギング検出が高精度でした。
AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
Balyasny が Claude Fable 5 の評価手法を公開しました。 数千の実務タスクで Fable は 89.4%、従来モデルは 86.1% です。 BAMAgent で数千のエージェントを稼働させます。
TypeSafe AI が判断特化モデル Jev を公開しました。 文章を生成せず、選択肢や確率を返します。 元 OpenAI 研究者が率いる企業です。
NVIDIA が AI ファクトリーの投資回収を最大化すると解説しました。 1 メガワットの AI ファクトリー建設費は約 6,000 万ドルです。 Vera Rubin NVL72 は GB300 NVL72 比で最大 30 倍の処理性能です。