ステップスターリーは9月15日に、新たなステップオーディオ3シリーズの音声大規模モデルを正式にリリースしました。今回のリリースには、ステップオーディオ3リアルタイム、ステップオーディオ3ASR、ステップオーディオ3TTS、ステップオーディオ3Genおよびステップオーディオ3ミュージックの5つの製品が含まれており、多数のモデルが権威ある評価ランキング「Artificial Analysis」で世界第1位を獲得しました。現在、この5つのモデルはすべてステップスターリーのオープンプラットフォームで利用可能となっており、それぞれが人間のような音声生成、完全なオーディオコンテンツ生成、リアルタイムの音声インタラクション、複雑な場面での音声理解および音楽創作という5つの主要な用途に対応しています。
リアルタイムインタラクション分野において、ステップオーディオ3リアルタイムは、全二重端末のネイティブなリアルタイム会話の実現を目指しています。このモデルは、「Artificial Analysis Conversational Dynamics」ランキングで総合得点98.9%を記録し、世界第1位となりました。また、音声推論の正確性では「Artificial Analysis Speech Reasoning」ランキングで99.7%を達成し、世界第1位となりました。このモデルは対話のテンポを正確に把握し、ユーザーの即時の中断や連続的なフィードバックを処理でき、意味、トーン、感情、副言語および環境音の統合的認識も可能です。さらに、推論と音声生成を並行して処理し、ツールコール(Tool Call)や長時間のタスクも非同期で実行できるため、音声会話がブロックされることはありません。
音声認識分野において、ステップオーディオ3ASRは高精度な音声認識と大規模言語モデルの知識推論能力を深く融合させ、従来の単なる音声からテキストへの変換を越えています。このモデルは中国語、英語、地方話、中英混合、長時間の音声および専門領域など多様なシナリオをサポートしており、医療、法務、金融、自動車およびプログラミングなどの専門分野で優れた性能を発揮します。特に、小さな声、早口、曖昧な連音、歌声、背景音楽などの複雑な入力環境にも対応可能です。非ストリーミング音声認識の単語誤り率(WER)はわずか1.7%で、世界第1位です。
音声生成分野において、ステップオーディオ3TTSはリアルタイムインタラクション向けの人間のような音声生成モデルです。このモデルは、音色の基盤、トーンの階層、リズムの動きおよび息継ぎの停止において、人間の自然な会話のパターンに完璧に一致しています。笑い、逡巡、口ごもり、繰り返し、修正などの副言語表現を再現するだけでなく、文脈に基づいて感情やトーンを自主的に調整できます。ストリーミング生成アーキテクチャを組み合わせることで、生成と再生を同時に実行することが可能です。
音声コンテンツの統合生成において、ステップオーディオ3Genは伝統的な音声制作・編集・ミキシングの長いプロセスを変革しました。ユーザーは自然言語による説明と参照音声のみで、一度に人声、効果音、環境音および背景音楽を統一して生成できます。モデルはキャラクターの音色、話し方、感情、地方話および笑いなどの副言語特徴を細密に制御でき、台詞、効果音および背景音楽の出現タイミングと順序を指定して、全体の音声デザインと時系列の編成に直接参加できます。
音楽創作分野において、ステップオーディオ3ミュージックはゼロから作成することに加え、ABC記譜法に基づく複数ラウンドのインタラクティブな創作もサポートしています。ユーザーは歌詞、無伴奏、参照曲または記譜法によって入力を行うことができ、自然言語によりスタイル、ボーカル、メロディー、ビート、楽器および感情を直接制御できます。モデルは曲の構造、セクション間のメロディーの展開およびエネルギーの変化を深くモデリングしており、特に無伴奏の音楽シーンにおいて、わずかな無伴奏の歌唱だけで和声、ビート、楽器および完全な編曲を自動的に補完することができ、本格的な音楽生産プロセスに深く浸透しています。
VIP会員