近日,阿里千問團隊正式發佈多模態MoE模型Qwen3.8-Flash,並同步開源下一代底層架構Qwen3.8-Flash-Next,該架構也是全新一代Qwen4系列模型的雛形。
Qwen3.8-Flash總參數量125B,額外搭載51B N-gram Embedding,但每token僅激活6B參數。模型原生支持26萬token上下文,藉助YaRN技術可擴展至100萬token。在成本上優勢顯著,訓練開銷僅爲前代Qwen3.7-Plus的九分之一,API定價每百萬Tokens輸入1元、輸出3元,目前已上線千問AI平臺,同步推出“千問辦公”功能。

架構層面,團隊完成四大核心升級。注意力模塊採用GDN+QSA混合架構,GDN負責壓縮歷史信息,QSA篩選關鍵上下文,百萬token場景下Prefill、Decode最高分別加速7.6倍、4.9倍;Gated Residual機制將殘差流拓展爲4條並行分支,依靠動態門控優化跨層信息傳遞,提升訓練穩定性;N-gram Embedding利用局部上下文查表擴充模型容量,新增51B參數幾乎不增加計算負擔;訓練環節採用Muon與AdamW混合優化策略,重新擬合Scaling Law,省去批次預熱流程。
多項基準測試顯示,依靠6B激活參數,基礎模型在14項評測中斬獲8項最優成績。微調版本在代碼、智能體、多模態任務上表現亮眼,SWE-bench Pro達到62.5分,CoWorkBench、Toolathlon等智能體榜單大幅領先同類模型。
目前Qwen3.8-Flash-Next權重已在Hugging Face、ModelScope開源,完整技術報告同步公開。千問團隊提前開放架構,希望藉助社區力量驗證創新方案,持續迭代技術,穩步推進Qwen4系列模型研發。
VIP會員