最近、アリババは正式にQwen-Audio-3.0シリーズの音声モデルがQwen AIプラットフォームで全面的にリリースされたことを発表しました。今回のリリースされたモデルシリーズには、音声認識の大規模モデルであるQwen-Audio-3.0-ASR、音声合成の大規模モデルであるQwen-Audio-3.0-TTS、そしてリアルタイムの音声インタラクションを実現するモデルであるQwen-Audio-3.0-Realtimeが含まれます。

公式の紹介によると、このシリーズのモデルは、今年7月に世界の権威あるAI評価プラットフォームArtificial Analysisで開催された音声ランキングで優れた成績を収め、音声認識(ASR)、リアルタイムインタラクション(RealTime)および音声合成(TTS)の3つの主要な分野で世界一を獲得し、「グランドスラム」を達成しました。

QQ20260817-155736.jpg

機能面では、Qwen-Audio-3.0-ASRは複雑な文脈や専門分野の認識をサポートしており、Qwen-Audio-3.0-TTSは多言語と多方言に対応し、感情、トーン、リズムを正確に制御できます。また、Qwen-Audio-3.0-Realtimeはエンドツーエンドの音声理解と会話が可能で、いつでも中断して質問を追加したり、ツールを呼び出したりできます。現在、Qwen App、Qwen Office、Qoderなどの製品にすでに導入されています。