谷歌 DeepMind 團隊近日推出了全新的 GenCeption 模型,嘗試將傳統的視頻生成 AI 逆向改造成能夠深度理解現實世界的視覺分析引擎。不同於以往分割與深度估計等任務各自獨立的格局,GenCeption 僅憑單一模型就能同時高效完成深度估計、圖像分割、3D 姿態估計等五項核心視覺任務。

該模型基於阿里巴巴開源的通義萬相 Wan2.1 框架進行訓練,在一次前向傳播中即可完成預測,大幅提升了處理速度。使用者只需通過簡單的文本提示輸入指令,模型就能精準輸出深度圖、分割掩碼及相機運動軌跡等豐富信息。
單人合成數據訓練,驚人泛化細節保留至髮絲
有趣的是,GenCeption 的訓練集僅包含約 7500 段由 Blender 渲染的單人合成視頻。然而,該模型展現出了極強的泛化能力,不僅能順暢處理真實世界中的多人視頻,還能輕鬆遷移至動物與機器人類別。
在實際測試中,小模型處理 81 幀視頻僅需約 6 秒,而 140 億參數的大模型也僅需 10 秒左右。其細節還原度甚至超越了訓練用的合成原圖,連貓的鬍鬚和單根髮絲邊緣都能清晰保留。
