最近、アリババの通義千問チームは新世代のリアルタイム音声合成モデル「Qwen-Audio-3.0-TTS」を正式に発表しました。これにより、音声合成は「話せる」から「表現できる」へと進化しました。Plusバージョンは、世界的なランキングであるArtificial AnalysisのSpeech Arenaで世界第1位を獲得し、Gemini3.1TTSやElevenLabs v3などの主流モデルを上回る総合的なパフォーマンスを示しています。

今回のリリースには2つのバージョンが含まれています。Flash版はリアルタイムインタラクションを重視しており、最初のパケット遅延は約300msで、スマートアシスタントなど低遅延のシーンに適しています。Plus版は高品質な生成に焦点を当てており、自然さと声の再現度がより優れています。
コアな能力において4つの突破を達成:
第一に、多言語および方言のカバー範囲が向上し、16の言語をサポートします。Plusバージョンでは、すべての16言語における平均話者類似度が82.75%であり、業界トップです。また、20の中国語の地方言もサポートし、「地方言の特徴が弱まる」問題を回避し、母語話者の表現に近づけます。
第二に、自由なスタイルの自然言語指令をサポートしており、専門的なラベリングは不要です。「優しいカスタマーサービスのトーン」「販売番組のスタイル」などの自然言語で、正確な音声を生成できます。
第三に、細粒度のタグ制御をサポートしており、[gasp]、[angry]などの構造化タグが可能です。呼吸や笑いなどの非言語的な詳細を正確に調整でき、ゲームやオーディオブックなどのシーンに適しています。
第四に、複雑な音響のロバスト性が強化されており、参考となる音声に高いノイズや反響がある場合でも、雑音を自動的にフィルターし、声の質を保持することができます。合成品質は安定しています。
専用の音声ライブラリは、指示、方言、小語種などのさまざまな音声をカバーしており、48Kの高解像度音声出力をサポートします(予定は7月24日)。一度に生成できる最大テキスト長は3分間です。現在、このモデルはアリババクラウドの百煉プラットフォームで全面的に公開されており、開発者はアクセスして体験することができ、音声インタラクションの新たな可能性を探求することができます。

