階躍星辰今日正式發佈StepAudio3系列模型,包括StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen和StepAudio3Music,五款模型均已上線階躍星辰開放平臺,其中多款模型在Artificial Analysis榜單中位列全球第一。該系列覆蓋真人級語音生成、完整音頻生成、實時語音交互、複雜語音理解及音樂創作等場景。

QQ20260915-162556.jpg

其中,StepAudio3Realtime支持原生全雙工實時對話,可同時理解語義、語氣、情緒、副語言及環境聲音,並支持推理與語音生成並行、Tool Call及長任務異步執行。在Artificial Analysis Conversational Dynamics榜單中綜合得分98.9%,位列全球第一;語音推理準確率99.7%,同樣排名全球第一

StepAudio3ASR融合語音識別與大模型上下文理解能力,支持中文、英文、方言、中英混說、長音頻及醫療、法律、金融等專業場景,WER僅1.7%,並列全球第一。StepAudio3TTS則強化音色、語調、節奏、停頓及笑聲、遲疑、結巴等副語言表現,支持流式生成,面向實時語音交互。

QQ20260915-162601.jpg

此外,StepAudio3Gen可統一生成角色人聲、音效、環境音和背景音樂,並支持多角色及聲音時序控制;StepAudio3Music支持歌曲創作、清唱配樂、翻唱及基於ABC記譜法的多輪創作,可通過自然語言控制曲風、旋律、節奏、樂器和情緒。整體來看,StepAudio3正將語音模型能力從單一識別或生成拓展至完整音頻內容生產與實時智能交互。