騰訊混元正式推出新一代語音識別模型 Hy ASR3.0 Preview,標誌着語音識別技術從"逐字轉寫"邁入"理解語境"的新階段。該模型基於最新一代大語言模型 Hy3 構建,融合高精度語音識別與深度語義理解能力,核心目標直指一個質變——讓 AI 不再只是聽清每個字,而是真正聽懂你說的話。

image.png

方言覆蓋十大片區,長音頻場景優勢突出

在識別廣度上,Hy ASR3.0 Preview 不要求標準普通話,方言識別覆蓋粵語、吳語等 10 大方言片區和 20 餘個二級小片區。開源評測集數據顯示,該模型多語種詞錯誤率(WER)控制在 3% 左右,其中中文普通話 3.34%、英語 2.62%、粵語 3.12%,整體準確度已接近行業天花板

結合 Hy3 的語言理解能力,模型能夠結合上下文語境精準捕捉用戶意圖,自動消除歧義並智能糾錯同音詞。在轉寫難度較高的會議紀要、訪談長音頻等場景中,這一"先理解再轉寫"的思路優勢尤爲明顯——傳統逐字聽寫遇到同音歧義往往束手無策,而 Hy ASR3.0 能根據語義邏輯自動選擇正確用詞。

MoE 架構打底,千萬小時級數據聯合訓練

技術層面,模型採用兼顧效率與性能的 MoE 架構,基座升級至 Hy3。混元團隊自研了無監督語音 Encoder,通過數千萬小時級無監督語音數據訓練,從複雜音頻中提取高質量聲學表徵——Encoder 負責"聽得好",Hy3 負責"理解對"。

在數據策略上,團隊對語音 Encoder 和大語言模型進行聯合訓練,引入數千萬小時級多來源語音數據,並通過多階段能力注入,使模型具備上下文感知、複雜場景適應和方言識別能力。後訓練環節則圍繞通用識別、上下文理解和複雜場景魯棒性構建高質量 SFT 方案,覆蓋上下文 Context、專業名詞、不同聲學環境及多樣人羣語音,並引入多階段強化學習針對複雜長尾場景持續優化。

目前,Hy ASR3.0 Preview 已上線騰訊雲官網對外開放 API,可廣泛應用於智能客服、內容理解和語音搜索等領域。騰訊旗下 AI 助手"元寶"已完成首發接入,用戶可通過語音輸入體驗方言識別、上下文智能糾錯和複雜環境穩定轉寫等功能且免費開放,WorkBuddy 等產品也在陸續接入中。當語音識別從"聽字"進化到"聽懂",人與 AI 的交互方式正在被重新定義。