
AlibabaのQwenチームは9月23日、音声モデル群「Qwen-Audio-3.1」を公開しました。従来のASR(音声認識)・TTS(音声合成)・Realtime(同時双方向対話)を更新し、新たに話者識別・タイムスタンプ・感情や環境音の認識まで行う「ASR-Next」と、言語モデルと拡散モデルを組み合わせて声・効果音・BGMを同時に生成する「TTS-Next」を加えた5モデル構成です。あわせて料金を大幅に引き下げ、TTSは約70%、Realtimeは約85%、ASRは最大95%の値下げとなりました。提供はQwen Cloud経由のAPIで、オープンウェイトではありません。
同じ日にGoogleも、100以上の言語・2,000以上の声と短い音声からの声の複製に対応した「Gemini 3.8 Flash TTS / Flash-Lite TTS」を出しており、音声AIは性能競争から価格とラインナップの競争に移りつつあります。以前紹介したGemini 3.8 Liveのような音声エージェントは、認識・推論・合成を何度も往復するため音声APIの単価がそのまま運用コストに効きます。今回の値下げは、講義動画の字幕付けや議事録作成、音声での対話型教材といった大学での利用にも現実的な選択肢を広げるものといえます。