大模型開源領域的創新節奏再次刷新紀錄。阿里通義千問團隊近日正式開源了全新多模態MoE模型Qwen3.8-Flash-Next,作爲Qwen4 架構的早期預覽版本,該模型在保持極低計算開銷的同時展現出了越級的性能表現。

在覈心架構與參數規模上,Qwen3.8-Flash-Next採用了高度稀疏的混合專家(MoE)設計。整個模型總參數量爲 1250 億,並額外搭配了 510 億參數的N-gram嵌入表以及 40 億參數的多token預測模塊,但每個token實際激活的參數量僅有 60 億。其整體擁有 48 層網絡結構,MoE層集成了 512 個專家並通過top- 10 進行路由分配。

技術創新方面,該模型集成了多項前沿升級。它引入了GDN與QSA混合注意力機制,兼顧了長文本處理任務的運行效率與信息檢索精度,將原生256K的上下文窗口通過YaRN技術成功擴展至1M。同時,通過引入 510 億參數的N-gram嵌入,幾乎不增加額外計算成本便大幅擴展了容量,且支持通過異步預取使其駐留於系統低速DRAM內存中;此外還採用了門控殘差連接(GR)以及微塊粒度選擇上下文的稀疏注意力設計。

在實際性能與成本表現上,該模型交出了亮眼答卷。受益於極致的稀疏化設計,其訓練成本僅爲上一代Qwen3.7-Plus的九分之一,但在代碼編寫與辦公等核心任務上的表現實現了顯著躍升。多方評測與最新報道確認,憑藉僅6B的激活參數,該模型在能力上成功擊敗了Claude Opus 4.6 Max等頂尖旗艦。

在生態部署與開源節奏上,SGLang在模型發佈首日便提供了Day- 0 級別的直接支持,開發者可以通過開源渠道獲取模型權重並在本地或集羣環境中高效部署。這一系列底層架構的創新與突破,不僅爲全球開源社區提供了前沿的技術探索樣本,也進一步推動了高性能AI大模型向低成本、高效率的規模化落地演進。