新一代同声传译大模型 Qwen3.8-LiveTranslate,在翻译质量、延迟、说话人识别和语音合成四个维度上全面升级。
该模型采用音频-文本交织的 Interleave 架构,将流式理解、文本输出与语音生成整合为单条因果序列,字均延迟从上一代的2.8秒压缩至2.3秒。

三大新增能力是本次升级的核心看点:实时说话人分离让多人交替发言时每句话归属清晰,译文语音还能稳定保留原说话人音色;原文译文同帧同出实现双语同步显示,兼顾即时理解与原文核对;长上下文消歧则通过跨轮关联历史语境,减少专有名词和指代带来的翻译歧义。

模型采用 Hybrid MoE 的 Thinker–Talker 双模块设计,Thinker 负责理解与翻译,Talker 负责合成保留原音色的译文语音。在覆盖14个语向的多说话人长音频评测集 Omnilingua-MSpeaker 上,该模型在翻译忠实度、流畅度、简洁度及说话人分离错误率上均优于当前主流实时同传系统。
目前模型已支持60种语言,API 同步上线千问 AI 平台。团队表示,下一步将聚焦端到端时延的极限压缩、跨会话长期记忆以及更多语种覆盖。
VIP会员