日前,Liquid AI 與 Hugging Face 正式發佈了 LFM2.5系列三款核心模型的 DSpark 草稿模型檢查點,包括 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 以及 LFM2.5-8B-A1B。通過引入全新的投機解碼路徑,該技術在完全不改變模型輸出質量的前提下,大幅提升了推理吞吐量。

核心性能提升與應用表現

在實際測試中,DSpark 草稿模型展現出了亮眼的加速效果。在 GPU 端,整體吞吐量最高可提升3.18倍;在端側設備上,最高提升幅度也能達到2.87倍。

特別是在端側智能體(Agent)推理場景中,LFM2.5-2.6B 的函數調用延遲平均降低了57%。以 M4Max MacBook Pro 作爲端側測試平臺時,其輸出速度最高可達每秒139個 token,這使得本地運行智能體應用的門檻大幅降低,用戶體驗甚至超越了部分專有云模型。

image.png

DSpark 的工作原理與架構設計

傳統的大語言模型推理階段主要受限於內存帶寬,絕大部分延遲來自於將模型權重從 DRAM 流式加載到 SRAM 的過程。投機解碼的出現正是爲了解決這一痛點,它利用一個輕量級的草稿模型快速生成候選 token,再由目標模型在單次前向傳播中對其進行統一驗證,從而將加載權重的成本有效分攤。

DSpark 在現有方法的基礎上進行了深度融合,主要包含三個核心組件:

  • 並行主幹網絡:採用類 DFlash 的風格,以目標模型的上下文特徵爲條件,在單次前向傳播中爲所有草稿 token 統一生成隱藏狀態。
  • 順序頭(Markov 頭):通過模擬相鄰 token 之間的馬爾可夫鏈增加依賴關係,從而有效提高了後續位置的接受率。
  • 置信度調度驗證器:負責預測每個 token 的存活概率,並在驗證成本高於節省成本時,自動剪除低置信度的後綴。

在模型訓練方面,該草稿模型採用了包含 SFT、聊天、代碼和函數調用在內的大規模且多樣化的數據混合。經過嚴格的消融實驗,最終確定的初始版本爲僅注意力(attention-only)架構,包含5層和9個塊,整體參數量控制在大約3億左右。

image.png

質量對齊與推理生態支持

由於投機解碼機制的特性,在貪心解碼下,草稿 token 只有在與目標模型分佈完全一致時纔會被接受,一旦被拒絕就會由目標模型自身的 token 取代。因此,生成的輸出序列在結構上與基線貪心解碼完全保持一致,各項基準測試的準確率沒有任何下降。

生態支持方面,DSpark 在發佈首日便實現了對主流推理框架的兼容:

  • SGLang:通過專門的集成與啓動配置,支持在加速器上運行。
  • llama.cpp:實現了官方構建支持,並可通過命令行加載相應的 GGUF 權重與草稿模型文件。

目前,相關的 Safetensors 和 GGUF 格式檢查點均已在 Hugging Face 平臺上開源,爲開發者在從雲端大規模加速器到端側邊緣設備的廣泛部署提供了強有力的支持。