在當前大模型規模與服務需求持續增長的背景下,如何降低自迴歸解碼的高昂成本成爲了行業的一大痛點。爲此,騰訊技術團隊正式開源了統訓框架AngelSpec,旨在通過多方案協同與工作負載異構適配,全面提升大模型在真實場景中的推理吞吐量。

針對不同應用場景下文本特徵的差異,AngelSpec採取了差異化的訓練策略。對於高熵、開放式的多輪對話任務,系統採用輕量且穩定的多token預測機制(MTP),並結合訓練時測試(TTT)和端到端總變差損失,使其能夠有效適應自迴歸展開中的狀態分佈;而面對結構約束更強的代碼生成與數學推理任務,則通過專有的塊擴散模型進行強化,充分挖掘長跨度可預測序列的潛力。

image.png

在架構設計上,該框架提出了名爲 DFly 的創新塊擴散框架。它通過混合目標條件編碼骨幹與前序條件自迴歸頭,在保持高吞吐量並行生成的同時,大幅優化了目標特徵利用率與塊內依賴建模。此外,系統引入了動態驗證機制,可結合當前在線負載、硬件條件及前綴置信度,在運行時自適應調整驗證深度,從而在計算資源與吞吐效率之間實現平衡。

image.png

在 Hy3模型系列的系統測試中,搭載 DFly 的方案展現出顯著的性能優勢。在併發數從4到64的各項測試中,該方案均實現了最高的平均吞吐量,相比傳統的自迴歸解碼提升顯著,爲大模型的工程化落地與高效推理提供了堅實的開源工具支持。

項目地址:https://github.com/Tencent/AngelSpec

論文:https://arxiv.org/pdf/2607.25852