騰訊混元今天正式端出了新一代語音識別模型 Hy ASR3.0preview。它背靠最新一代大語言模型 Hy3的語言理解能力,把高精度語音識別和深度語義理解揉在了一起,在通用識別、上下文感知、多場景魯棒性和方言覆蓋這幾個核心維度上全面擡升,能在更復雜的真實輸入裏給出準確、連貫、更貼近用戶本意的轉寫結果——用官方的話說,是從"逐字轉寫、單點優化"進化到了"理解語境、兼容場景、一鍵直出"。

成績單相當亮眼。在海外開源評測集上,Hy ASR3.0preview 把多個語種的詞錯誤率(WER)都壓到了3% 上下:中文普通話3.34%、英語2.62%、粵語3.12%。在騰訊自己的自建評測集上,無論是通用識別、方言識別、上下文理解、專詞理解,還是高噪、耳語這類複雜聲學場景,WER 同樣維持在低位,在綜合評測集上拿到了最低的錯詞率。

落到用戶實際體感,這一版重點打磨了四件事。第一是通用識別更準,在通用語音、方言、中英混說等場景下進一步壓低錯字、漏字,也緩解了長音頻裏錯誤不斷累積的老毛病。第二是更懂意圖,模型結合上下文精準捕捉用戶語境,能智能糾正同音詞、消弭語義歧義。第三是更好適配專業場景,支持熱詞注入增強,讓模型快速認出品牌名、產品名、人名和行業術語,直接降低業務接入和後續維護的成本。
