Apple AI、 多言語音声の 識別を 改善
Apple AI が多言語音声モデルの言語識別を強化しました。 識別を事前学習の初期に導入すると効果が最大です。 音素識別の誤りは 11.6% から 10.4% に低下しました。
Apple Machine Learning Research
Apple AI が多言語音声モデルの言語識別を強化しました。 識別を事前学習の初期に導入すると効果が最大です。 音素識別の誤りは 11.6% から 10.4% に低下しました。
Apple が ASR の連合半教師あり学習の手法を改善しました。 クライアントごとのオンライン教師は全体教師と同等以上です。 サーバーはラベル付きデータで学習を続ける必要があります。
Apple が音声エンコーダの蒸留手法を公開しました。 量子化前の潜在表現を教師信号に使います。 2.8 倍の圧縮で WER の悪化は 1.9% 以内です。
Hugging Face が音声 AI 評価の Real World VoiceEQ を公開しました。詳しくは出典へ。
CyberAgent AI Lab の 4 本の論文が INTERSPEECH 2026 に採択されました。 音声合成の転移学習では、元モデルの発音知識は寄与しません。 日本語の書記素音素変換では、最適な LLM が 0.52% 未満を達成しました。