逐詞預測這個大模型時代的老套路,被上海人工智能實驗室與上海交通大學人工智能學院LUMIA Lab團隊撕開了一道口子。他們提出全新預訓練任務下一個概念預測(NCP),並順勢推出全球首個8.9B規模的離散隱空間基座模型NCP-ArchPreview,把訓練效率的賬本重新算了一遍。


這組數字相當刺眼。模型基於5.73T的Dolma- 3 語料預訓練,卻只用掉51.3%的Token預算就追平了OLMo-3-7B的最終預訓練Loss,等效收斂速度提升1. 95 倍,計算帕累託效率系統性提升1. 74 倍;到了下游任務上,綜合表現領先2. 45 分,其中GSM8K數學推理一口氣漲了近 6 分。也就是說,別人燒完一整箱算力纔夠到的位置,它半箱油就到了。


NCP-ArchPreview的骨架是一條三段式隱空間概念處理流水線。它先用乘積量化搭起一個超大的離散概念表徵空間,再通過可微的下一個概念預測、因果防泄漏反饋機制和分層殘差路由,實現對未來概念的顯式建模——不再是盯着下一個詞硬猜,而是先想清楚下一個概念長什麼樣。這種轉向隱空間概念預測的打法,從根本上打破了逐詞預測範式。


驚喜還不止於預訓練。團隊發現,只微調17M的隱空間參數就能超越LoRA,而且沒有遺忘的老毛病;訓練吞吐量上去了,顯存佔用也降下來。把這個概念表徵注入草稿模型後,推測解碼的平均接受長度提升4.17%,在代碼任務上更是漲到7.59%,爲推理加速開了條新路。技術報告裏團隊還大方分享了踩坑經驗與解決方案,構建了千億級代理指標篩選機制,並把包含全程階段性Checkpoint、評測框架在內的全部資產一併開源。對於想要在模型微調和推理加速上找新突破口的研究者來說,這套隱空間思路無疑是一份剛出爐的路線圖。