LINE ヤフー、 生成 AI の 評価手法を 解説
LINE ヤフーが生成 AI の出力品質の評価手法を解説しました。 熟練編集者が Gold Data と Rubric を作り評価ロボットを検証します。
LINE ヤフーが生成 AI の出力品質の評価手法を解説しました。 熟練編集者が Gold Data と Rubric を作り評価ロボットを検証します。
AWS が文脈対応アシスタントの構築方法を公開しました。 AgentCore memory で会話を永続的な知識として蓄積します。 Telegram と EventBridge から同じエージェントを呼び出します。
Datasette の OpenTelemetry トレースを Parseable で表示できます。 Parseable は OpenTelemetry 対応の可観測性ツールです。 Rust 実装は AGPL の単一バイナリで提供されます。
AI エージェント導入支援の内容と費用相場を解説しています。 PoC は 50 万円から、本番開発は 300 万〜500 万円です。 運用支援は月額 5 万円から提供されています。
SageMaker HyperPod の管理統制を 4 層で解説します。 組織・プロジェクト・クラスタ・ワークロードで制御します。
LLM のトークン単価は 8 割下がりました。 一方で企業の AI 請求額は増えています。 エージェント型は通常チャットの 4 倍のトークンを消費します。
Amazon Quick のユーザー権限を降格する手順です。 コンソールには Author から Reader への直接降格機能がありません。
LangChain と Amazon Bedrock でエージェント型検索を解説します。 標準検索は単一クエリで複数意図を平均化します。
エージェント型 AI の本番移行は平均 34% にとどまります。 データ分断が知識アクセスの最大の課題で、55% が挙げています。 本番移行率 61% の先行企業は意味理解の能力が高いです。
Simon Willison がサービスの予算上限既定化を提言しました。 AWS は 9月16日に月次支出上限の新機能を発表しました。 Google Cloud も 7月に Spend Caps を開始しました。
AWS が SageMaker AI の MTRL で検索エージェントを調整しました。 Qwen3.6-27B を BM25 とベクトル検索の 2 ツールで学習します。 報酬は検索品質に基づき、PPO や CISPO を選べます。
Amazon Quick とルールエンジンでリース照合を実現します。 法令適合の判定は AI を使わないルールエンジンが担います。 適合・違反・曖昧・読取不能の合計を全件と照合します。
世界の AI 投資は 2026年に 2.5 兆ドルへ達する見通しです。 データの量より AI 対応の可用性が重要だと指摘します。
NVIDIA NeMo Agent Toolkit に S3 Vectors の記憶層を実装します。 NAT は Strands Agents や LangChain に対応するオープンソースです。 S3 Vectors はインデックスあたり最大 20 億ベクトルを扱えます。
Amazon Payments がバンディットで転換率を改善しました。 Amazon SageMaker AI 上の文脈付きバンディットを採用しています。 7 週間の A/B テストで最終転換率が 1 桁台後半の相対改善です。
LINE ヤフーがサービス指向クラウドを開発しています。 Service Connect はサービス名で接続を一元管理します。 IP アドレス変更に追従し ACL を自動更新します。
HPE が AI を費用から資産に変える運用を解説します。 常時稼働のワークロードでは自社保有が経済的に有利になります。 需要・利用率・活用拡大の 3 点を判断基準に挙げます。
LINE ヤフーが Kafka アラートの初動調査 AI を開発しました。 固定クエリで基本 4 項目を取得し LLM が追加調査します。 設定変更や復旧操作は行いません。
LINE ヤフーが通知基盤に Decaton の Per-Key-Quota を導入しました。 通知 654,762 件を流量制限トピックへ退避させました。 処理時間に換算すると延べ約 4.2時間分です。
GitHub Copilot の canvas はチャット以外の操作画面です。 canvas はエージェントと双方向に通信できます。 Winget や SQLite の操作画面も作れます。
Cohere が AI 変革管理の考え方を解説しました。 AI は導入するツールでなく参加者として迎えるものです。 業務は検証可能・判断型・ハイブリッドに分けます。
米国防総省で AI 導入を巡る官僚機構の壁が議論されました。 Accenture の Berntsen 氏は U-2 偵察機の事例を教訓に挙げました。 技術導入には調達改革と意思決定の仕組み再設計が必要です。
SemiAnalysis が MoE 推論の計算とデータ移動を解説しました。 推論は Prefill、Midfill、Decode attention、Decode experts の 4 段階に分かれます。
Microsoft が自社の AI 変革で得た教訓を公開しました。 営業チームの成約率は 20% 向上しました。 一部のサプライチェーン工程は最大 75% 短縮しました。
CoolIT Systems が単相直接液冷の白書を公開しました。 AI アクセラレーターは 1,000 ワット超を放熱します。 冷板に水や水グリコールを循環させ熱を運び去ります。
LINE のチームが AI 設計成果物の受け取りを解説しました。 AI との質問を 1 ページの HTML にまとめ、論点に優先度を付けます。 進捗と決定事項を JSON の envelope で記録し、Git で管理します。
LINE ヤフーが広告表示の高速化を検証しました。 広告 KPI には絶対速度でなくページとの相対速度が影響します。 表示が遅い広告は高速化で CTR が有意に向上しました。
中国のオープンモデルが Fable 5 に迫る性能を実現しました。 GLM 5.2 や K3、Qwen 3.8 Max が相次いで公開されました。 Qwen 3.8 の 27B モデルは Opus 4.6 相当の性能です。
Microsoft が AI インフラの新指標「歩留まり」を提唱しました。 エージェント型タスクはチャットの 3,400 倍超の Token を使います。 AI の世界普及率は労働人口の 18% にとどまります。
Cohere が業務向け生成 AI の活用方法を解説しました。 知識検索や RAG、会話支援、コード生成などが主な用途です。 導入には業務上の実現性と技術要件の両面が課題です。
Cohere が FDE の依存を能力構築で解消する方針を示しました。 Deloitte の調査で AI パイロットの本番移行は 25% にとどまります。 FDE は顧客の技術環境で製品知識を生かして導入を支援します。
LINE ヤフーが商品パトロールの AI 活用事例を公開しました。 審査効率は AI フィルターで約 26 倍に向上しました。 人が全件を最終確認する限り業務時間は大きく減りません。
ABEJA が Cloud Composer 2 の Redis OOM 停止を復旧しました。 環境サイズを「小」から「中」に変更しました。 ワーカーのメモリ不足で kill された Celery タスクが原因です。