在人工智能領域備受矚目的“AI教母”李飛飛創辦的World Labs,於近日正式發佈了全球首個多模態世界模型——Atlas。該模型最大的突破在於,能夠以像素級的精確相機控制來生成圖像和視頻幀,並將其在三維空間中進行完美重建。
作爲一款從頭開始進行預訓練的全新模型,Atlas能夠無縫接受包括相機移動在內的多模態輸入,並將其轉化爲立體的三維視圖。通過在模型的空間上下文中精準定位多個輸入視圖,用戶可以生成具備絕對控制力的圖像和視頻幀,從而輕鬆實現宛如好萊塢大片般的“子彈時間”拍攝效果。此外,它還能從單張或多張輸入圖像中輸出明確的3D模型,在重建效果上超越了目前許多頂級的開源重建模型。

在具體的工作機制上,Atlas會根據用戶指定的任意攝像機位置和角度,生成一個或多個與原始內容及幾何形狀完美匹配的參考圖像,平滑地擴展畫面,並自主想象和填補輸入中看不見的場景細節。
官方介紹顯示,Atlas能夠全面勝任世界生成、重建和模擬等廣泛任務。首先在相機控制生成方面,它能夠通過像素精確的相機控制,從一張或多張圖像中輸出最長達1分鐘的1440p高清視頻。其次在空間重建方面,它不僅能從數十張輸入圖像中重建真實場景,還能從新穎視角生成圖像幀以及顯式三維輸出。此外,該模型還支持時空模擬功能,通過輸入視頻來建模空間與時間,重新構圖視頻以增強戲劇性視覺效果,併爲機器人的真實到模擬工作流程提供支持。同時,它也完全支持從文本生成圖像和360度全景,能夠精準跟隨複雜的提示詞、渲染文字並呈現各種多變的的視覺風格。
目前,World Labs官方表示已經有部分合作夥伴獲得了該模型的搶先體驗資格,並計劃在未來幾周內逐步向更廣泛的早期訪問者開放。
VIP會員