千問の大規模モデルは2026年9月23日にQwen-Audio-3.1シリーズの音声大規模モデルをリリースし、理解、生成、インタラクション、創作にわたる完全な音声能力スタックを構築しました。このシリーズには、音声認識Qwen-Audio-3.1-ASR、音声理解ASR-Next、音声合成TTS、音声創作TTS-Next、リアルタイムインタラクションRealtimeが含まれており、APIはすべて千問AIプラットフォームに掲載されており、ASR-Next APIも近日中にリリース予定です。同時に全製品が価格引き下げられ、TTSは約70%、Realtimeは約85%、ASRは95%の価格引き下げとなっています。

能力面では、ASRは多言語・地方話の認識と文脈理解を強化し、ネイティブな転写と修正機能を追加し、自動的に語尾の無意味な言葉や繰り返し表現を取り除き、役割ごとの転写をサポートします。発話者ラベル、タイムスタンプ、テキストを統合して出力できます。一つのモデルで30言語と16種類の中国語地方話をサポートし、ストリーミング認識では最初の文字の応答時間が約160ミリ秒です。
ASR-Nextは次世代アーキテクチャに基づいており、音声中の文字から感情、環境音、機械音への音声理解を拡張し、音声の記述、イベントの位置決め、音声質問推論をサポートします。TTSは同じ音色で異なる言語の自然な移行をサポートし、指示によって感情や速度を制御できます。TTS-Nextは音声創作向けで、人声、サウンドエフェクト、環境音の統一生成をサポートし、複数のキャラクターの音色再現、細粒度のタイムスタンプおよび48kHz出力をサポートし、ポッドキャスト、オーディオブック、映画ゲームのシーンに対応しています。Realtimeはマルチテッチャー蒸留構造により、双方向のインタラクションを実現し、いつでも会話を打ち切ることができ、多言語のリアルタイム切り替え、感情理解、会話中にツールを呼び出すことができます。
実測において、ASRはオープンソースの地方話テストデータセットで平均CER4.55%、中国語地方話自前のデータセットで平均CER10.38%、地方話から標準中国語への変換で平均文句の精度は82.10%です。ASR-Flash-NextとASR-Flashは4つのテストデータセットで8つの指標においてそれぞれ5つ、3つの最優等を達成し、以前のFun-ASR連携システムよりも全体的に優れています。
現在、RealtimeはQoder、千問オフィスなどのエージェントおよび千問AIグラスなどのスマートハードウェアと組み合わせて運用されており、音声が人間と機械のインターフェースとして自然な入口となるトレンドを継続しています。
Qwen-Audio-3.1-ASR:
https://www.qianwenai.com/models/qwen-audio-3.1-asr-flash
Qwen-Audio-3.1-TTS:
https://www.qianwenai.com/models/qwen-audio-3.1-tts-flash
Qwen-Audio-3.1-TTS-Next:
https://www.qianwenai.com/models/qwen-audio-3.1-tts-next
Qwen-Audio-3.1-Realtime:
https://www.qianwenai.com/models/qwen-audio-3.1-realtime-plus
(Qwen-Audio-3.1-ASR-Next APIは近日中にリリース予定です)
VIP会員