アリババ・クイーンは9月23日に自社の音声スタックを一新しました。Qwen-Audio-3.1シリーズは5つのモデルを一気に公開し、音声認識から合成、リアルタイム対話、音声制作と理解に至るまで、「理解-生成-対話-創作」の完全な音声能力マトリクスを構築しました。同時に全製品の価格を大幅に引き下げました:TTSは約70%安くなり、Realtimeは約85%安くなり、ASRは95%も安くなりました。この一連の攻撃的な戦略の背後には明確なメッセージがあります:音声機能は今や隠す必要がなくなり、使用のハードルを地面に叩きつけることになりました。

認識の分野では、Qwen-Audio-3.1-ASRが新たな音声認識の大規模モデルとして登場しました。その最大の特徴は「文脈を理解する」という点です。新たに追加された原生転写整備機能により、口語表現や繰り返しを自動的に削除し、意味を再構成することで、出力される文章がより自然で論理的になります。役割別転写機能では、「誰がいつ何を言ったか」を正確に再現し、会議、インタビュー、対話分析のために構造化された記録を残します。このエンドツーエンドのソリューションは、話者ラベル、タイムスタンプ、テキストを統合して出力し、交互発言や短い中断、重なる音声を処理することができます。

image.png

耳のカバー範囲も広大です:一つのモデルで30種類の言語と16種類の中国方言を扱うことができます。業界用語、専門的な固有名詞、段階的なホットワードも認識でき、長時間の音声履歴に基づいて人名や用語を一致させます。最初の文字応答遅延は約160ミリ秒に抑えられ、話し始めながら転写することもスムーズです。実績もしっかりしています:公開されている方言データセットKeSpeechおよびWSYueの11のサブセットにおいて平均文字誤り率は4.55%、中国語の16の方言における内部テストでの平均文字誤り率は10.38%、温州語のような難しい方言でも大きな改善があり、方言から普通語への変換の平均文意文正確率は82.10%に達しています。

image.png

さらに進化したのは、次世代アーキテクチャを採用したQwen-Audio-3.1-ASR-Nextです。このモデルは、単に「音声の中の文字」を認識するだけでなく、「完全な音声情報」を理解できるようにしました。人物の感情、環境音、機械音を聞き分け、音声説明、イベント位置指定、音声質問回答の推論を行います。対話や背景音楽、環境音が混ざった音声を提示すると、字幕を出力するだけでなく、どの音声があるのか、関連するイベントがいつ発生したのか、そして全体の内容に関する質問にも答えられます。役割別ASRテストでは、ASR-Flash-NextとASR-Flashバージョンがそれぞれ8つの指標で5つと3つの最優秀を獲得し、これまでのFun-ASRレベルのシステムを圧倒しました。

音声合成の分野では、Qwen-Audio-3.1-TTSは単に「文字を正しく発音する」ことを目指すのではなく、本物の表現を目指しています。これは多言語および方言の合成をサポートしており、同じ音色で異なる言語を使用しても自然に移行できます。指示によって感情、語速、表現方法を制御し、音声を具体的な内容とシナリオに合わせることができます。

本当に驚きは、次世代アーキテクチャを採用したQwen-Audio-3.1-TTS-Nextです。このモデルは、音声創作を「単一の音声合成」から「一般的な音声生成システム」に昇格させています。以前は、一段の音声を作成するには、司会者、音効師、ミキサー、編集者が個別に作業し、後で結合していたのですが、現在ではテキスト、タイムスタンプ、参照音声を中心に、1つのモデルで人声、音効、環境音を統一して生成できます。複数の音色を再現し、複数回の対話をサポートし、連続したコンテンツ内で各キャラクターの音色が「変声」しないようにし、沈黙、相槌、同意、感情の変化を演じます。複数の音声を融合して生成し、素材の質、距離、空間の階層を示します。例えば、朗読ではナレーターと2人のキャラクターの会話を処理し、都市の雑音、夕風、アルミ缶の衝突音などを補完することで、会話が物語のシーンのように真実感を帯びるようにします。さらに専門性が高いのは、自然言語によるコントロールが可能であり、トーン、語速、ボリューム、音楽スタイル、伴奏を指定できるほか、細粒度のタイムスタンプ、音声再現、48kHzの出力をサポートし、対話の開始と終了、音声イベントのタイミングを正確に調整できます。これにより、ラジオ番組、朗読、映画、ゲーム、広告などに適応可能です。

リアルタイム対話の分野では、Qwen-Audio-3.1-Realtimeは認識、モデル、合成を単純に並べるのではなく、双方向通信を採用しています。ユーザーはいつでもインターフェースを挿入したり、中断したりできます。体験は人間同士の通話に近づいています。モデルが理解するのは文字だけではなく、その背後にある感情と意図です。あなたが低い調子で話していると、機械的に「私は理解しています」と言うのではなく、語速を遅くし、言葉を選んで返事をします。対話中に言語を切り替えると、文脈、トーン、テンポが途切れることなく続きます。不明瞭な情報に対しては無理に推測せず、高リスクな内容には境界を設けます。また、マルチティーチャー蒸留アーキテクチャに基づき、低遅延を維持しながら推論とセキュリティを向上させ、リアルタイムの対話の中で直接Agentツールを呼び出すことも可能です。API、知識ベース、業務システムを使って情報を検索し、実行し、結果を自然に対話に戻します。