千問當日正式發佈 Qwen-Audio-3.1 系列語音大模型。本次升級不僅對語音識別、語音合成和實時語音交互三大核心模型全面進化,還重磅推出全新的音頻創作模型 Qwen-Audio-3.1-TTS-Next 與音頻理解模型 Qwen-Audio-3.1-ASR-Next。五款新模型同時亮相,形成覆蓋“理解—生成—交互—創作”的完整音頻能力棧。爲進一步降低使用門檻,Qwen-Audio 全線語音模型價格均下調,其中 TTS 降約 70%、Realtime 降約 85%、ASR 降幅達 95%。

五款模型同發,ASR 價格直降 95%
Qwen-Audio-3.1-ASR 是新一代語音識別模型,新增原生轉寫潤色能力,可自動去除語氣詞與重複表達並重組語義;其分角色轉寫能完整呈現“誰在什麼時候說了什麼”,爲會議、訪談提供可追溯的結構化記錄。該模型一套支持 30 種語言與 16 種中文方言,支持行業詞與分級熱詞識別,並提供低延遲流式識別,首字響應約 160 毫秒。性能上,其在 KeSpeech 與 WSYue 的 11 個子集平均字錯誤率(CER)4.55%,中文方言內部測試集平均 CER 10.38%,AST 平均語義句準率 82.10%。
基於下代架構的 ASR-Next 則把處理對象從“語音中的文字”擴展爲“完整音頻信息”,可理解人物情緒、環境聲與機械聲,完成聲音描述、事件定位與音頻問答推理。在分角色 ASR 評測中,其 Flash-Next 與 Flash 版本分別取得五項和三項最優,全面優於此前的 Fun-ASR 級聯繫統。
語音合成方面,Qwen-Audio-3.1-TTS 支持多語種及方言合成,並讓同一音色在跨語言時自然遷移,可通過指令控制情緒、語速與表達方式。新一代 TTS-Next 更進一步,圍繞文本、時間戳與參考音頻統一生成人聲、音效與環境音,一次創作完整音頻內容,並支持 48kHz 輸出與細粒度時間戳控制,滿足播客、有聲書、影視和遊戲等需求。

從聽懂到創作,語音成 AI 自然入口
實時交互模型 Qwen-Audio-3.1-Realtime 採用全雙工架構,可同時說和聽、支持隨時插話打斷,並從識別文字升級爲理解情緒與交流意圖——識別到用戶語氣低落時會放慢語速、調整措辭。它還支持多語言實時切換,並在對話中調用 API、知識庫與業務系統工具完成任務;基於多教師蒸餾架構,在保持低延遲的同時強化了事實可靠性與安全邊界。
目前,Qwen-Audio-3.1-Realtime 正與 Qoder、千問辦公等 Agent,以及 QwenNote、A2、Eva、千問 AI 眼鏡、樂奇 AI 眼鏡等智能硬件結合。在這些場景中,用戶無需始終打開電腦或手機,即可通過語音直接發起任務,並在實時對話中追加條件、修改需求或瞭解執行情況。千問表示,Qwen-Audio 3.1 的升級並非單點指標優化,而是沿五條技術路徑推進,讓“能聽懂、能創作、能聊天”的語音成爲連接人、內容與 AI 的自然入口。
VIP會員