在當前大模型規模與服務需求持續增長的背景下,如何降低自迴歸解碼的高昂成本成爲了行業的一大痛點。爲此,騰訊技術團隊正式開源了統訓框架
針對不同應用場景下文本特徵的差異,

在架構設計上,該框架提出了名爲 DFly 的創新塊擴散框架。它通過混合目標條件編碼骨幹與前序條件自迴歸頭,在保持高吞吐量並行生成的同時,大幅優化了目標特徵利用率與塊內依賴建模。此外,系統引入了動態驗證機制,可結合當前在線負載、硬件條件及前綴置信度,在運行時自適應調整驗證深度,從而在計算資源與吞吐效率之間實現平衡。

在 Hy3模型系列的系統測試中,搭載 DFly 的方案展現出顯著的性能優勢。在併發數從4到64的各項測試中,該方案均實現了最高的平均吞吐量,相比傳統的自迴歸解碼提升顯著,爲大模型的工程化落地與高效推理提供了堅實的開源工具支持。
項目地址:https://github.com/Tencent/AngelSpec
論文:https://arxiv.org/pdf/2607.25852
