ELYZA、 RSI 研究組織を 立ち上げ
ELYZA が RSI 研究組織を立ち上げました。 AI 研究の主戦場は AI for Science と Long Horizon に移行しています。
ELYZA が RSI 研究組織を立ち上げました。 AI 研究の主戦場は AI for Science と Long Horizon に移行しています。
AWS が音声旅行コンシェルジュの構築方法を解説しました。 Amazon Bedrock AgentCore と Nova Sonic を使います。
NVIDIA が通信事業者向け Nemotron 3 LTM を公開しました。 300 億パラメータで通信タスクの精度を高めます。 AdaptKey が通信データセットでファインチューニングしました。
Alexa Plus が「lalala」を繰り返す不具合が発生しています。 複数種類の Echo で数週間にわたり報告されています。 Amazon は一部ユーザーへの影響と認め、修正を進めています。
Google が「Call for Me」を通話相手に拡大する可能性があります。 遅刻連絡など短文の伝言を通話で届ける用途を想定しています。
Splice の CEO が AI 製文書は会話を損なうと指摘しました。 社内文書は人が考え議論する土台だと述べました。
Sean Parker が Stability AI の再建を主導しています。 アーティストやプロデューサーに AI 利用を広めようとしています。 Napster 共同創業者で、Spotify の初期投資家でもあります。
Apple AI が多言語音声モデルの言語識別を強化しました。 識別を事前学習の初期に導入すると効果が最大です。 音素識別の誤りは 11.6% から 10.4% に低下しました。
英 AI 安全研究所が ElevenLabs と研究提携を発表しました。 音声 AI のリスクと対策を双方向で研究します。 人は実時間の音声会話で AI と人を見分けられるかを調べます。
Airbnb が AI 検索を今週公開しました。 エージェント対応でアプリの操作性を高めます。 Chesky 氏は AI 専用 OS の不在を指摘しました。
Legato が AI 補聴メガネ Legato Frames を発売しました。 価格は 999 ドルからで、中等度までの難聴者向けです。 眼鏡単体で処理し、レンズ込み 34 グラム、電池は 10〜12時間です。
MeetTwins が Google Meet に AI 代理出席します。 インドの開発者 Aditya Shinde 氏がベータ版を公開しました。 チャットに「/stop」と入力すると即退席します。
AWS が SageMaker AI で Qwen3-TTS の配信を解説しました。 vLLM-Omni DLC で双方向ストリーミングに対応します。 音声は 24 kHz PCM で順次返ります。
DeepMind が Gemini 3.8 Live with Live Avatar を発表しました。詳しくは出典へ。
Apple が ASR の連合半教師あり学習の手法を改善しました。 クライアントごとのオンライン教師は全体教師と同等以上です。 サーバーはラベル付きデータで学習を続ける必要があります。
Apple が音声エンコーダの蒸留手法を公開しました。 量子化前の潜在表現を教師信号に使います。 2.8 倍の圧縮で WER の悪化は 1.9% 以内です。
Google が音声合成モデル Gemini 3.8 Flash TTS を発表しました。詳しくは出典へ。
Ringg の AI エージェントが通話の最大 65% を解決します。 GPT-5.6 を使い音声やチャットなど多言語で対応します。 コストは GPT-4.1 比で 90% 削減です。
OpenAI が Codex CLI の v0.156.0 を公開しました。 音声会話が既定で有効になり、F8 で切り替えられます。 全画面 UI や利用状況ダッシュボードも追加されました。
Google が音声合成モデル Gemini 3.8 Flash TTS を一般提供しました。詳しくは出典へ。