近日,人工智能領域的先驅李飛飛攜 World Labs 的核心團隊做客 a16z,首次全面披露了其團隊最新研發的多模態世界模型 Atlas。與大語言模型預測下一個 token、視頻模型預測下一幀的邏輯不同,Atlas 將核心錨定在了“新視角預測”上,展現出顛覆傳統三維重建與內容生成的巨大潛力。
新視角預測:世界模型的全新核心原語
長期以來,大語言模型的核心在於預測下一個 token,而視頻生成模型則聚焦於預測下一幀。相比之下,Atlas 的精髓在於“新視角預測”。用戶只需向系統輸入場景的若干視角圖像或相關文字描述,模型便能精準輸出時空任意位置的畫面。
這一機制首次實現了“生成”與“重建”在同一個模型中的深度融合,能夠原生處理文字、圖像、視頻、3D 以及相機位姿等多模態數據。研發團隊認爲,新視角預測的重要地位完全可以與大語言模型的下一個 token 預測相提並論,極有可能是通往通用人工智能(AGI)的核心基礎原語之一。
打破傳統邊界:極低數據成本還原三維空間
在傳統的3D 重建領域,往往需要採集數百甚至上千張照片才能構建出一個完整的場景。而 Atlas 徹底改變了這一行業痛點,它將數據採集量大幅壓縮至區區幾張或幾十張。例如,僅憑三部 iPhone 拍攝的畫面,就能直接生成類似電影特效一般的子彈時間視頻。
這種突破源於 Atlas 對前一代模型 Marble 的迭代升級。早期的 Marble 模型由於採用高斯潑濺作爲輸出表示而面臨技術瓶頸,而 Atlas 則創新性地將新視角預測確立爲基本原語,有效解決了傳統3D 重建容易出現盲區、必須依賴生成技術進行盲區補全的難題,同時具備高度可擴展的空間上下文窗口。
廣泛的行業應用前景
隨着這一技術的不斷成熟,其應用落地場景正在向多個前沿方向迅速延伸:
首先是創意設計領域,Atlas 能夠爲創作者提供高度3D 一致的生成內容,大幅降低製作門檻與週期。其次在建築與施工行業,其高精度的空間還原與預測能力可深度服務於工程設計的各個環節。最後在機器人領域,它能大幅提升現實環境到仿真測試的轉化效率,有效緩解機器人訓練長期面臨的數據不足難題,未來還將無縫接入動態數據,進一步打通動作規劃能力。
目前,Atlas 已經具備了初步的動態處理能力。研發團隊透露,未來的演進方向將重點在動態效果、內容編輯以及人機交互等維度持續推進,最終目標是構建一個能夠讓普通用戶與3D 虛擬世界進行直觀交互的完整系統。
VIP會員