阿里千問在9月23日把自家語音棧整體翻了個新。Qwen-Audio-3.1系列一口氣放出五款模型,從識別、合成到實時交互再到音頻創作與理解,湊齊了一套覆蓋"理解—生成—交互—創作"的完整音頻能力矩陣,順手還把全線價格狠狠往下拽了一把:TTS直降約70%,Realtime降幅約85%,ASR更是砍掉95%。這套組合拳的潛臺詞很直白——語音能力不再藏着掖着,直接把使用門檻砸到地板上。
識別這條線,Qwen-Audio-3.1-ASR成了新一代語音識別大模型。它最見功夫的是"聽得懂上下文",新增的原生轉寫潤色能自動剝掉語氣詞、刪掉重複表達、重組語義,讓吐出來的文字更順、更有邏輯,而不是一堆 raw 轉錄。分角色轉寫則把"誰在什麼時候說了什麼"完整還原,給會議、訪談和對話分析留下可追溯的結構化記錄。這套端到端方案把說話人標籤、時間戳和文本聯合輸出,既能處理輪流發言,也能留住短插話和重疊語音,把每個人說的話掰清楚。

耳朵的覆蓋廣度也誇張:一套模型吃下30種語言和16種中文方言,行業詞、專業實體和分級熱詞都能識別,還會參考長音頻歷史上下文讓人名和術語保持一致。延遲上首字響應壓到約160毫秒,邊說邊轉寫不卡頓。成績單同樣硬:公開方言數據集KeSpeech和WSYue的11個子集上平均字錯誤率4.55%,中文16種方言內部測試平均字錯誤率10.38%、溫州話這類難啃的方言提升尤其明顯,方言翻普通話的平均語義句準率衝到82.10%。

更野的一步來自基於下代架構的Qwen-Audio-3.1-ASR-Next。它把識別對象從"語音裏的文字"擴成了"完整的音頻信息"——能聽懂人物情緒、環境聲和機械聲,完成聲音描述、事件定位和音頻問答推理。給一段混着對話、背景音樂和環境聲的音頻,它不光輸出字幕,還能告訴你裏面有哪些聲音、相關事件何時發生,並回答關於整段內容的提問。分角色ASR測試裏,ASR-Flash-Next和ASR-Flash版本分別在八項指標裏拿下五項和三項最優,全面壓過此前的Fun-ASR級聯繫統。
合成這邊,Qwen-Audio-3.1-TTS強調真實表達而非只求字音正確。它支持多語種與方言合成,同一音色跨語言時能自然遷移,讓你秒講數種語言,還能靠指令控制情緒、語速和表達方式,讓聲音貼合具體內容與場景。
真正的驚喜是下代架構的Qwen-Audio-3.1-TTS-Next,它把音頻創作從"單一人聲合成"升格成了"通用音頻生成系統"。過去做一段完整音頻,得主播、音效師、混音師、剪輯師分頭幹活再後期縫合;現在圍繞文本、時間戳和參考音頻,一個模型就能統一生成人聲、音效和環境音。它支持多人音色復刻與多輪對話,連續內容裏各角色音色不"變聲",還會演繹停頓、接話、附和和情緒轉折;多類聲音融合生成,呈現材質、遠近與空間層次——有聲書裏能同時處理旁白、兩角色對話,再補上城市低鳴、晚風和易拉罐碰撞聲,讓對話像真發生在故事場景裏。更專業的是它吃自然語言控制,能指定語氣、語速、音量、音樂風格與配器,支持細粒度時間戳、聲音復刻和48kHz輸出,對白起止和聲音事件節奏都能精準排布,餵飽播客、有聲書、影視、遊戲和廣告的需求。
實時交互這條線,Qwen-Audio-3.1-Realtime不再把識別、模型和合成簡單串糖葫蘆。它走全雙工,能同時說和聽,用戶隨時插話、打斷,體驗貼近真人通話。模型理解的不再只是文字,還有聲音背後的情緒與意圖——察覺你語氣低落,它不會機械回一句"我理解",而是放慢語速、調整措辭;對話裏切語言,上下文、語氣和節奏不斷檔;面對不確定信息少編、面對高風險內容守邊界。它還基於多教師蒸餾架構在保持低延遲的同時提升推理與安全,並能在實時對話裏直接調用Agent工具,連API、知識庫和業務系統去查、去執行,把結果自然帶回對話。
落地已經在路上。Qwen-Audio-3.1-Realtime正和Qoder、千問辦公等Agent,以及QwenNote、A2、Eva、千問AI眼鏡、樂奇AI眼鏡等硬件結合,讓用戶不必開電腦手機,直接動嘴發起任務、在對話裏追加條件或修改需求。從ASR的潤色與方言、到ASR-Next的泛音頻理解、TTS的跨語言音色、TTS-Next的完整音頻創作、再到Realtime的擬人共情與工具調用,千問這五款模型沿着五條清晰技術路徑同時推進,把"能聽懂、能創作、能聊天"打包成語音這一連接人、內容與AI的自然入口,而九成五的ASR降價,則把這道入口的門檻幾乎拆到了地平線以下。
VIP會員