階躍星辰於9月15日正式發佈了全新的 StepAudio3系列語音大模型。本次發佈的模型矩陣包含StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen以及StepAudio3Music五款產品,並且多款模型在權威評測榜單 Artificial Analysis 中成功登頂全球第一。目前,這五款模型已在階躍星辰開放平臺全面上線,分別面向真人級語音生成、完整音頻內容生成、實時語音交互、複雜場景語音理解及音樂創作這五大核心應用場景。

在實時交互領域,StepAudio3Realtime致力於實現全雙工原生實時對話。它在 Artificial Analysis Conversational Dynamics 榜單中以98.9% 的綜合得分奪得全球第一,在語音推理準確率上以99.7% 位列 Artificial Analysis Speech Reasoning 榜單全球第一。該模型不僅能夠精準把握對話節奏、處理用戶的臨時打斷與連續反饋,還支持語義、語氣、情緒、副語言和環境聲音的綜合理解。此外,它支持推理與語音生成並行,工具調用(Tool Call)與長任務也能異步執行,確保語音會話不被阻塞。

image.png

在語音識別方面,StepAudio3ASR將高精度語音識別與大語言模型的知識推理能力深度融合,超越了傳統的單純聲音轉寫。它支持中文、英文、方言、中英混說、長音頻及專業領域等多種場景,在醫療、法律、金融、汽車和編程等專業領域表現優異,甚至能夠輕鬆應對低聲、快語速、含糊連讀、歌聲以及背景音樂等複雜輸入環境。其非流式語音識別準確性的詞錯誤率(WER)僅爲1.7%,並列全球第一

在語音生成方面,StepAudio3TTS是一款面向實時交互的真人級語音生成模型。它在音色基底、語調層次、節奏律動和氣口停頓上完美貼合人類自然口語模式,不僅能夠還原笑聲、遲疑、結巴、重複和改口等副語言表現,還能根據語義內容自主調整情緒語氣。配合流式生成架構,模型可以實現生成與播放的同步進行。

在音頻內容綜合生成上,StepAudio3Gen改變了傳統音頻需要多環節制作、剪輯和混音的冗長鏈路。用戶只需通過自然語言描述和參考音頻,就能一次性統一生成人聲、音效、環境音和背景音樂。模型支持對角色音色、說話方式、情緒、方言及笑聲等副語言特徵進行精細控制,並能指定對白、音效和背景音樂出現的時間與順序,直接參與整段內容的聲音設計和時序編排。

在音樂創作領域,StepAudio3Music不僅支持從零生成,還支持基於 ABC 記譜法控制的多輪交互創作。用戶可以通過歌詞、清唱、參考歌曲或記譜法進行輸入,並利用自然語言直接控制曲風、人聲、旋律、節奏、樂器和情緒。模型對歌曲結構、跨段落旋律發展及能量變化進行了深度建模,尤其在清唱配樂場景中,只需一段清唱即可自動補充和聲、節奏、樂器和完整編曲,真正深入到真實的音樂生產流程之中。