大模型真的存在不可告人的技術壁壘嗎?前不久從OpenAI空降騰訊的姚順雨曾直言“做大模型其實並沒有什麼祕密”。起初外界以爲這只是一句玩笑,但在騰訊混元4(Hy4preview)近期交出答卷後,這句話的含金量徹底顯現。

面對智譜、月之暗面、DeepSeek以及千問等強敵環伺的競爭格局,騰訊在短短四個月內完成了混元大語言與多模態部門的重組,並推出了770B參數規模、支持百萬上下文的混元4。細究其技術配置會發現,大模型所謂的獨家祕笈,早已在開源機制與頂尖人才的高速流動下被徹底解構。

image.png

從底層骨架來看,混元4在700B這一中大規模檔位上,直接對齊了國內此前由智譜GLM-5(744B)跑通並立住口碑的工程最優解。其主幹網絡的隱藏維度爲6144、78層、64個注意力頭,這些參數決定了Transformer網絡在深度、寬度和注意力並行結構上的統一選擇。對於急需突圍的騰訊而言,站在前人驗證過的共識底座上,避免了重複踩坑。

在覈心技術沿路遷移上,混元4的注意力模塊巧妙融合了多方開源成果。其主幹借鑑了DeepSeek在V3.2中開源的稀疏注意力機制(DSA),通過輕量級索引器在超長上下文中篩選Top-K Token,從而避免遍歷全部歷史。隨後,它又吸收了智譜團隊在IndexCache中驗證的跨層索引複用機制,允許相鄰Transformer層直接複用已有索引結果,最高可砍掉75%的索引器計算量,實現端到端性能提速。此外,在殘差側優化上,混元4放棄了複雜的mHC,轉而採用了源自微軟研究員謝天在社交平臺上公開討論的恆等超連接(iHC)方案。

技術接力的背後,是頂尖人才的深度流動。清華姚班畢業、曾擔任智譜GLM-5新模型架構及DSA負責人白雨石,已於數月前正式加入騰訊混元團隊,並出現在混元長上下文稀疏注意力論文的作者欄中。正是在這些天才研究員的推動下,隱性工程經驗完成了從一家企業到另一家企業的物理遷徙。

如今,任何能夠通過論文、代碼和實驗數據表達出來的技術優勢,其獨佔期都在急劇縮短。從頂會論文到開源代碼,再到社區熱議的討論帖,前沿架構的傳播路徑已徹底扁平化,大模型的行業護城河正被開源生態與人才流動迅速填平。