近日,騰訊混元多模態團隊經歷了一場深度的人事重組與戰略調整。原xAI多模態理解負責人藺旭東已正式加入騰訊混元,擔任多模態內容生成算法負責人。此次變動不僅伴隨着原多模態理解負責人胡瀚離職創業、前OpenAI研究員田永龍加入等一系列密集調整,更標誌着騰訊在多模態大模型研發路線上正發生深層次的路線重構。
回顧騰訊混元過去的多模態發展史,其技術版圖主要圍繞幾大核心產品展開。其中,文生視頻模型HunyuanVideo在2024年底首發即成爲全球最大開源視頻生成模型,隨後在2025年密集擴展了圖生視頻、定製化生成以及數字人驅動等能力。圖像生成方面,從早期的HunyuanImage到支持原生2K分辨率的2.1版本及800億參數的3.0版本,不斷向工業級演進。此外,專注於單體3D模型的Hy3D也在電商建模和產品設計中廣泛應用。在空間智能領域,騰訊還推出了全球首個開源、支持仿真的沉浸式3D世界生成模型Hy World1.0及其後續版本,深度契合了空間智能的研究方向。
然而,隨着騰訊將大語言模型部和多模態模型部合併成立“基礎模型部”並由姚順雨全面接管,騰訊的多模態研發思路正面臨深刻轉變。在當前的技術路線上,業界對於多模態與智能主線的關係存在不同看法。李飛飛旗下的World Labs等觀點認爲世界模型作爲空間智能的一部分是AGI的重要主線,而DeepSeek等則主張將視覺模態作爲服務於語言模型的工具,弱化獨立的3D或世界模型路線。
從姚順雨近期的戰略佈局與旗艦產品Hy3的落地來看,其更傾向於後者的技術路線。姚順雨在公開場合多次強調,AI下半場的競爭壁壘在於上下文與推理能力,而非單純的模型參數量。通過將多模態理解能力深度融合至基礎模型主線,優化工具調用穩定性與長上下文承接,騰訊正致力於提升模型在真實辦公、GUI Agent等產品落地中的理解與執行效率。藺旭東的加入,正是爲了通過提升多模態理解能力,進一步解決生成模型中前後不一致、缺乏空間穩定性等痛點。這場重組不僅折射出騰訊內部技術路線的交替,也展現了其在AGI下半場競爭中堅定靠攏主線、聚焦生產力落地的戰略決心。
VIP會員