今日,騰訊混元正式推出新一代語音識別模型Hy ASR3.0preview,首次將大語言模型Hy3的深度語義理解能力與高精度語音識別深度融合,推動語音識別從“逐字轉寫、單點優化”向“理解語境、兼容場景、一鍵直出”跨越。

據官方披露,新模型在多維度評測中表現亮眼:開源評測集上,中文普通話、英語、粵語的詞錯誤率(WER)分別低至3.34%、2.62%、3.12%,整體控制在3%左右;自建評測集覆蓋通用識別、10餘種方言、上下文語義理解、專業術語識別及高噪、耳語等複雜聲學場景,WER同樣保持行業領先水平。

QQ20260804-163907.jpg

技術層面,Hy ASR3.0preview的能力升級源於全鏈路優化:架構上採用兼顧效率與性能的MoE架構,基座升級爲Hy3大模型,同時自研無監督語音Encoder,依託數千萬小時級語音數據訓練,提升聲學特徵提取能力;預訓練階段實現語音Encoder與大語言模型聯合訓練,覆蓋多方言、多口音、多聲學環境的海量數據,通過多階段能力注入強化方言識別、上下文感知等特性;後訓練環節則構建了覆蓋20餘個方言小片區的SFT數據集,結合多階段強化學習,針對性解決複雜場景下的誤識別、漏識別問題。

目前,Hy ASR3.0preview已上線騰訊雲官網對外開放API,可廣泛應用於智能客服、內容理解、語音搜索等領域。騰訊旗下AI助手“元寶”已完成首發接入,用戶可通過語音輸入體驗方言識別、上下文智能糾錯、複雜環境穩定轉寫等功能,相關能力免費開放;WorkBuddy等產品也在陸續接入中。業內認爲,此次更新標誌着語音識別技術向“更懂用戶意圖”的方向邁出關鍵一步,將爲多場景語音交互體驗帶來顯著提升。