Google DeepMind近日發佈新模型GenCeption,該模型基於預訓練視頻生成模型構建,用於解決深度估計、圖像分割、3D姿態估計等經典計算機視覺任務,並在多項基準測試中達到接近或超過當前領先水平。值得關注的是,GenCeption所需訓練數據規模遠低於傳統專用視覺模型。

當前計算機視覺領域仍以任務專用模型爲主,例如用於分割任務的Segment Anything、用於深度估計的Depth Anything等,不同任務通常採用獨立架構。DeepMind研究團隊認爲,大型文本到視頻模型在訓練過程中學習了場景空間結構、物體運動規律以及語言與視覺之間的關聯,可能具備成爲通用視覺基礎模型的潛力。

QQ20260720-091824.jpg

GenCeption基於阿里巴巴開源視頻模型Wan2.1開發,通過簡化架構實現一次前向傳播即可完成視覺任務預測。模型能夠根據文本提示,從同一段視頻中生成深度圖、表面法線、分割掩碼以及姿態估計結果,並通過可訓練模塊支持3D關鍵點等非圖像輸出任務。

在訓練數據方面,GenCeption主要使用包含7500個視頻的合成數據集,由800個人體模型結合200組動作序列,並通過Blender渲染生成。研究顯示,該模型在深度估計、表面法線預測、3D姿態識別以及語言引導分割等任務中均取得優異表現,訓練數據量僅爲部分現有模型的七分之一至五百分之一。

此外,GenCeption展現出較強泛化能力。儘管訓練數據主要來自單人合成人體視頻,但模型能夠處理真實世界中的多人場景、動物以及人形機器人等未見類別,並生成包含細節的視覺預測結果。

不過,研究團隊也指出,聯合訓練多個任務可能影響部分複雜任務性能,同時模型推理速度仍需優化。目前,大模型處理81幀視頻約需6至10秒。

GenCeption的發佈表明,視頻生成模型正在從內容生成工具向視覺理解基礎模型方向拓展。未來,如何讓生成式模型獲得更可靠的物理理解和現實反饋能力,仍是AI研究領域的重要挑戰。