新一代同聲傳譯大模型 Qwen3.8-LiveTranslate,在翻譯質量、延遲、說話人識別和語音合成四個維度上全面升級。
該模型採用音頻-文本交織的 Interleave 架構,將流式理解、文本輸出與語音生成整合爲單條因果序列,字均延遲從上一代的2.8秒壓縮至2.3秒。

三大新增能力是本次升級的核心看點:實時說話人分離讓多人交替發言時每句話歸屬清晰,譯文語音還能穩定保留原說話人音色;原文譯文同幀同出實現雙語同步顯示,兼顧即時理解與原文覈對;長上下文消歧則通過跨輪關聯歷史語境,減少專有名詞和指代帶來的翻譯歧義。

模型採用 Hybrid MoE 的 Thinker–Talker 雙模塊設計,Thinker 負責理解與翻譯,Talker 負責合成保留原音色的譯文語音。在覆蓋14個語向的多說話人長音頻評測集 Omnilingua-MSpeaker 上,該模型在翻譯忠實度、流暢度、簡潔度及說話人分離錯誤率上均優於當前主流實時同傳系統。
目前模型已支持60種語言,API 同步上線千問 AI 平臺。團隊表示,下一步將聚焦端到端時延的極限壓縮、跨會話長期記憶以及更多語種覆蓋。
VIP會員