#音声
今日 2件10月7日(水)
· 2件AWS、
音声旅行コンシェルジュを 構築 AWS が音声旅行コンシェルジュの構築方法を解説しました。 Amazon Bedrock AgentCore と Nova Sonic を使います。
AWS Machine Learning Blog
10月6日(火)
· 1件NVIDIA、
通信向け Nemotron 3 LTM を 公開 NVIDIA が通信事業者向け Nemotron 3 LTM を公開しました。 300 億パラメータで通信タスクの精度を高めます。 AdaptKey が通信データセットでファインチューニングしました。
NVIDIA Blog
10月3日(土)
· 2件Apple AI、
多言語音声の 識別を 改善 Apple AI が多言語音声モデルの言語識別を強化しました。 識別を事前学習の初期に導入すると効果が最大です。 音素識別の誤りは 11.6% から 10.4% に低下しました。
Apple Machine Learning Research
10月2日(金)
· 3件英 AI 安全研究所、
ElevenLabs と 提携 英 AI 安全研究所が ElevenLabs と研究提携を発表しました。 音声 AI のリスクと対策を双方向で研究します。 人は実時間の音声会話で AI と人を見分けられるかを調べます。
UK AI Security Institute Blog
9月30日(水)
· 1件9月29日(火)
· 1件SageMaker AI、
Qwen3-TTS を 配信 AWS が SageMaker AI で Qwen3-TTS の配信を解説しました。 vLLM-Omni DLC で双方向ストリーミングに対応します。 音声は 24 kHz PCM で順次返ります。
AWS Machine Learning Blog
9月25日(金)
· 1件DeepMind、
Gemini 3.8 Live を 発表 DeepMind が Gemini 3.8 Live with Live Avatar を発表しました。詳しくは出典へ。
Google DeepMind
9月24日(木)
· 4件Apple、
ASR の 連合半教師あり学習を 改善 Apple が ASR の連合半教師あり学習の手法を改善しました。 クライアントごとのオンライン教師は全体教師と同等以上です。 サーバーはラベル付きデータで学習を続ける必要があります。
Apple Machine Learning ResearchApple、
音声エンコーダ蒸留を 公開 Apple が音声エンコーダの蒸留手法を公開しました。 量子化前の潜在表現を教師信号に使います。 2.8 倍の圧縮で WER の悪化は 1.9% 以内です。
Apple Machine Learning ResearchGoogle、
Gemini 3.8 Flash TTS を 発表 Google が音声合成モデル Gemini 3.8 Flash TTS を発表しました。詳しくは出典へ。
Google Japan Blog
9月23日(水)
· 1件Ringg、
OpenAI で 通話の 65% を 解決 Ringg の AI エージェントが通話の最大 65% を解決します。 GPT-5.6 を使い音声やチャットなど多言語で対応します。 コストは GPT-4.1 比で 90% 削減です。
OpenAI News
9月22日(火)
· 2件OpenAI、
Codex CLI v0.156.0 を 公開 OpenAI が Codex CLI の v0.156.0 を公開しました。 音声会話が既定で有効になり、F8 で切り替えられます。 全画面 UI や利用状況ダッシュボードも追加されました。
OpenAI ChatGPT & Codex ChangelogGoogle、
Gemini 3.8 Flash TTS を 提供開始 Google が音声合成モデル Gemini 3.8 Flash TTS を一般提供しました。詳しくは出典へ。
Gemini API Changelog
9月17日(木)
· 1件OpenAI、
Codex CLI v0.155.0 を 公開 OpenAI が Codex CLI の v0.155.0 を公開しました。 /experimental で音声会話と文字起こしを試せます。 対応 Mac では MCP 要求に Touch ID 認証を使えます。
OpenAI ChatGPT & Codex Changelog
9月16日(水)
· 2件9月15日(火)
· 1件9月14日(月)
· 1件Kotoba Technologies、
音声 AI を 登壇 Kotoba Technologies の佐々木悠太氏が音声 AI を登壇解説します。 イベントは Agora.io と AWS が 9月17日に東京で共催します。
Kotoba Technologies · News
9月10日(木)
· 1件9月3日(木)
· 2件LINE ヤフー、
iOSDC Japan 2026 に 7 名登壇 LINE ヤフーが iOSDC Japan 2026 に 7 名登壇します。 同社はゴールドスポンサーを務めます。 登壇者は Foundation Models や Swift など 7 テーマを発表します。
LINEヤフー Tech Blog
9月2日(水)
· 1件8月28日(金)
· 1件8月27日(木)
· 1件8月26日(水)
· 1件Google、
音声認識モデル Gemini 3.5 Transcribe を 公開 Google が音声認識モデル Gemini 3.5 Transcribe を公開しました。詳しくは出典へ。
Gemini API Changelog
8月25日(火)
· 1件Mistral、
HUMAIN と 提携しサウジで 主権 AI Mistral が HUMAIN とサウジアラビアの主権 AI で提携しました。 サイバーセキュリティと音声が初期の重点分野です。 アラビア語に強いフロンティアモデルも開発予定です。
Mistral AI
8月21日(金)
· 1件8月18日(火)
· 1件ChatGPT、
iOS 版に Codex Remote 設定を 追加 ChatGPT の iOS 版に Codex Remote の起動設定が追加されました。 標準 MCP フォームとメッセージ承認の編集に対応しました。 音声は既存のタスク作成画面から使えます。
OpenAI ChatGPT & Codex Changelog
8月12日(水)
· 1件8月11日(火)
· 1件8月10日(月)
· 1件Kotoba、
Agentforce Voice の 音声提供 Kotoba の Koto が Agentforce Voice の日本語会話を支えます。詳しくは出典へ。
Kotoba Technologies · News
8月4日(火)
· 1件LINE、
LIFF で グループ通話を 構築 LINE の LIFF でグループビデオ通話を構築できます。 ウェブアプリとアプリサーバーの 2 つを用意します。 LINE Planet SDK で通話機能を実装します。
LINEヤフー Tech Blog
7月30日(木)
· 1件7月23日(木)
· 1件7月15日(水)
· 1件Hugging Face、
音声 AI 評価の VoiceEQ を 公開 Hugging Face が音声 AI 評価の Real World VoiceEQ を公開しました。詳しくは出典へ。
Hugging Face Blog