LINE ヤフー、 生成 AI の 評価手法を 解説
LINE ヤフーが生成 AI の出力品質の評価手法を解説しました。 熟練編集者が Gold Data と Rubric を作り評価ロボットを検証します。
LINE ヤフーが生成 AI の出力品質の評価手法を解説しました。 熟練編集者が Gold Data と Rubric を作り評価ロボットを検証します。
Claude の Models API に thinking 無効化の指定が加わりました。 GET /v1/models で thinking 無効化に対応するか確認できます。 thinking: {type: "disabled"} で thinking をオフにできます。
ストックマークが SIAI でシナリオ体験を提供しました。 参加者は 1時間で未来を予測し行動案を考えました。 研究では情報収集から確率更新までの自動化を目指します。
OpenAI が GPT-6 Astra Ultrafast を API で提供開始しました。詳しくは出典へ。
AISI が白箱制御チームを立ち上げました。 白箱制御はモデル内部の活性化を監視・改変します。 Llama-3.1-8B ではサンドバッギング検出が高精度でした。
AISI が現行 AI システムの限界 8 点を報告しました。 検証が難しいタスクや長時間タスクで人に劣ります。
Balyasny が Claude Fable 5 の評価手法を公開しました。 数千の実務タスクで Fable は 89.4%、従来モデルは 86.1% です。 BAMAgent で数千のエージェントを稼働させます。
NVIDIA が AI ファクトリーの投資回収を最大化すると解説しました。 1 メガワットの AI ファクトリー建設費は約 6,000 万ドルです。 Vera Rubin NVL72 は GB300 NVL72 比で最大 30 倍の処理性能です。
Apple AI が条件付け手法の効果と流暢さを調査しました。 効率的なステアリング手法は流暢さを大きく損ないます。 指示チューニング済みモデルでは効果が低下します。
Apple AI が木構造表現の往復精度を調査しました。 最良の組み合わせでも往復精度は 92.9% です。 生成側の失敗が全体の 73.6% 以上を占めます。
xAI の Grok 4.7 が Amazon Bedrock で利用可能になりました。詳しくは出典へ。
ABEJA が DeepSeek-V4-Flash を Mac mini で動かしました。詳しくは出典へ。
Basis が GPT-6 Astra で税務処理を高速化しました。 50 タブの税務ワークブックを GPT-5.6 Sol の 2 倍速で処理します。 利用者の意図の理解が向上し、実務での信頼性が高まりました。
Anthropic が Claude Sonnet 5.5 を公開しました。詳しくは出典へ。
Sakana AI が日本スタートアップ大賞で受賞しました。 自然界の進化に着想を得た効率的な AI 開発手法が評価されました。 防衛分野では指揮統制システムに AI を活用しています。
Epoch AI が GPT-6 Astra を事前評価しました。 Astra は ECI などで過去最高を記録しました。 FrontierMath Erdős では 68 問中 2 問を解きました。
Sakana AI の David Ha が世界モデル特集に寄稿しました。 特集は英国王立協会の科学誌に掲載されました。 現在の AI は因果を理解しているとは限りません。
MIT の研究者が GPT-5.6 Sol と Codex で量子実験を自動実行します。 実験結果の分析と量子ビットの校正も自動で行います。 実験の様子を OpenAI が公開しました。