腾讯混元今天正式端出了新一代语音识别模型 Hy ASR3.0preview。它背靠最新一代大语言模型 Hy3的语言理解能力,把高精度语音识别和深度语义理解揉在了一起,在通用识别、上下文感知、多场景鲁棒性和方言覆盖这几个核心维度上全面抬升,能在更复杂的真实输入里给出准确、连贯、更贴近用户本意的转写结果——用官方的话说,是从"逐字转写、单点优化"进化到了"理解语境、兼容场景、一键直出"。

成绩单相当亮眼。在海外开源评测集上,Hy ASR3.0preview 把多个语种的词错误率(WER)都压到了3% 上下:中文普通话3.34%、英语2.62%、粤语3.12%。在腾讯自己的自建评测集上,无论是通用识别、方言识别、上下文理解、专词理解,还是高噪、耳语这类复杂声学场景,WER 同样维持在低位,在综合评测集上拿到了最低的错词率。

落到用户实际体感,这一版重点打磨了四件事。第一是通用识别更准,在通用语音、方言、中英混说等场景下进一步压低错字、漏字,也缓解了长音频里错误不断累积的老毛病。第二是更懂意图,模型结合上下文精准捕捉用户语境,能智能纠正同音词、消弭语义歧义。第三是更好适配专业场景,支持热词注入增强,让模型快速认出品牌名、产品名、人名和行业术语,直接降低业务接入和后续维护的成本。
