近日,騰訊混元團隊公佈了一項最新的技術成果,成功將旗下主打端側的1.8B 翻譯模型壓縮至幾百兆大小,不僅翻譯質量幾乎沒有損失,並且已經成功落地嗶哩嗶哩(B站)的直播彈幕實時翻譯中,實現了從實驗室 Demo 到高併發真實業務場景的跨越。

作爲基底的 Hy-MT2-1.8B 模型原本屬於騰訊混元翻譯模型族,原生支持33個語種互譯。在同等尺寸中,其整體翻譯質量在 FLORES-200通用翻譯評測上已經優於多款商業翻譯 API。然而,由於1.8B 模型在傳統的 FP16精度下需要佔用高達3.3GB 的內存,即便降到4-bit 量化也仍需1GB 以上,無法滿足端側多任務併發的內存管理需求。爲此,騰訊推出了兩檔極低比特的量化方案。

image.png

第一檔是面向中高端設備的2-bit 模型。該方案採用了拉伸彈性量化(SEQ)技術,將參數量化至特定的離散數值,並結合量化感知蒸餾(QAD)手段,在將模型體積壓縮至574MB 的同時,實現了幾近無損的翻譯質量。

第二檔則是面向全系設備的1.25-bit 極低比特方案。該方案基於騰訊自研的 Sherry 稀疏高效三值量化技術,該技術此前已被頂級學術會議 ACL2026選爲 Oral。其核心策略是通過細粒度稀疏機制,使每4個參數中最重要的3個用特定數值存儲,其餘置零,平均每個參數僅佔用1.25-bit。配合專爲 CPU 設計的 STQ 內核,原始的3.3GB 模型被極致壓縮至440MB。

爲了讓極低 bit 模型擺脫對特定移動端 ARM 架構的依賴,英特爾團隊針對 x86生態進行了深度底座適配。通過對量化矩陣運算中的向量化、權重重排和 VNNI 指令融合環節進行優化,Hy-MT2的低比特量化格式在英特爾主流機型(包括最新第三代酷睿 Ultra 及酷睿處理器)上的 token 運行速率實現了顯著提升,成功將極低比特方案從移動端擴展至 PC 和邊緣設備。

在實際業務驗證方面,嗶哩嗶哩已將該極低比特模型正式接入直播彈幕實時翻譯。整套資源的下載大小約爲600MB,運行時內存佔用保持在500到700MB 之間,平均單條彈幕的翻譯耗時在500到800毫秒左右,在常規彈幕頻率下能夠做到流暢的實時翻譯,並能準確駕馭各類網絡流行語。這種在設備本地獨立運行的模式,既降低了雲端服務器的調用成本與帶寬開銷,也在全流程中避免了數據上傳,切實保障了用戶的隱私安全。