千問大模型9月23日發佈 Qwen-Audio-3.1系列語音大模型,形成覆蓋理解、生成、交互與創作的完整音頻能力棧。系列包含語音識別 Qwen-Audio-3.1-ASR、音頻理解 ASR-Next、語音合成 TTS、音頻創作 TTS-Next 與實時交互 Realtime,API 已上架千問 AI 平臺,ASR-Next API 即將上線。同期全線降價,TTS 降幅約70%,Realtime 約85%,ASR 達95%。

QQ20260923-152735.jpg

能力層面,ASR 增強多語種、方言識別與上下文理解,新增原生轉寫潤色,可自動去除語氣詞與重複表達,並支持端到端分角色轉寫,聯合輸出說話人標籤、時間戳與文本;一套模型支持30種語言和16種中文方言,流式識別首字響應約160毫秒。

ASR-Next 基於下代架構,把音頻理解從語音中的文字擴展至情緒、環境聲與機械聲,支持聲音描述、事件定位與音頻問答推理。TTS 支持同音色跨語言自然遷移,並以指令控制情緒與語速。TTS-Next 面向音頻創作,統一生成人聲、音效與環境音,支持多角色音色復刻、細粒度時間戳與48kHz 輸出,服務播客、有聲書與影視遊戲場景。Realtime 基於多教師蒸餾架構實現全雙工交互,可隨時插話打斷,支持多語言實時切換、情緒理解與對話中調用工具。

實測方面,ASR 在開源方言測試集平均 CER4.55%,中文方言自建集平均 CER10.38%,方言轉普通話平均語義句準率82.10%;ASR-Flash-Next 與 ASR-Flash 在四測試集八項指標中分獲五項、三項最優,全面優於此前的 Fun-ASR 級聯繫統。

目前 Realtime 正與 Qoder、千問辦公等 Agent 及千問 AI 眼鏡等智能硬件結合,延續語音成爲人機交互自然入口的趨勢。

  • Qwen-Audio-3.1-ASR:

https://www.qianwenai.com/models/qwen-audio-3.1-asr-flash

  • Qwen-Audio-3.1-TTS:

https://www.qianwenai.com/models/qwen-audio-3.1-tts-flash

  • Qwen-Audio-3.1-TTS-Next:

https://www.qianwenai.com/models/qwen-audio-3.1-tts-next

  • Qwen-Audio-3.1-Realtime:

https://www.qianwenai.com/models/qwen-audio-3.1-realtime-plus

(Qwen-Audio-3.1-ASR-Next API即將上線)