最近、人工知能分野の先駆者であるリー・フィーは、World Labsのコアチームとともにa16zを訪問し、初めてそのチームが最新に開発したマルチモーダル世界モデル「Atlas」を全面的に公開しました。大規模言語モデルが次のトークンを予測する、またはビデオモデルが次のフレームを予測するロジックとは異なり、Atlasは「新しい視点の予測」に焦点を当てており、従来の3D再構築とコンテンツ生成において画期的な可能性を示しています。
新しい視点の予測:世界モデルの新たな基本原語
長年にわたって、大規模言語モデルの核は次のトークンを予測することでしたが、ビデオ生成モデルは次のフレームを予測することに注力していました。それに対して、Atlasの核心は「新しい視点の予測」です。ユーザーはシーンのいくつかのビュー画像や関連するテキスト説明をシステムに入力するだけで、モデルは時空間の任意の位置の画像を正確に出力できます。
このメカニズムにより、「生成」と「再構築」が同じモデル内で完全に統合され、テキスト、画像、ビデオ、3D、カメラポーズなどのマルチモーダルデータをネイティブに処理できるようになりました。研究チームは、新しい視点の予測の重要性は大規模言語モデルの次のトークン予測と同等であり、汎用人工知能(AGI)への核心的な原語の一つである可能性が高いと考えています。
従来の境界を打ち破る:極めて少ないデータで3D空間を再現
従来の3D再構築分野では、一連のシーンを構築するために数百枚乃至数千枚の写真が必要でした。しかし、Atlasはこの業界の課題を完全に変革し、データ収集量をわずか数枚あるいは数十枚に大幅に圧縮しました。例えば、iPhoneで3枚撮影した映像でも、映画効果のようなスローモーション動画を直接生成できます。
この突破は、Atlasが前世代モデル「Marble」のアップグレードによって実現されました。初期のMarbleモデルは、出力表現としてガウススプラッタを使用していたため技術的限界に直面していましたが、Atlasは新規視点の予測を基本原語として革新的に採用し、従来の3D再構築で生じる盲点や生成技術による補完に頼らざるを得ない問題を効果的に解決しました。同時に、高い拡張性を持つ空間文脈窓も備えています。
広範な業界応用の可能性
この技術がさらに成熟していくにつれて、その応用シーンは多くの先端分野に急速に広がっています:
まず、クリエイティブデザイン分野では、Atlasは作成者に高精度な3D整合性を持つ生成コンテンツを提供し、制作のハードルと期間を大幅に低下させます。次に、建築および建設業界では、高精度な空間再現と予測能力がエンジニアリング設計の各段階に深く役立ちます。最後に、ロボット分野では、現実環境からシミュレーションテストへの変換効率を大幅に向上させ、ロボット訓練における長期的なデータ不足の問題を効果的に緩和します。今後は動的データとのシームレスな接続を通じて、アクションプランニング能力をさらに強化する予定です。
現在、Atlasはすでに初歩的な動的処理能力を備えています。研究チームによると、今後の進化方向は、動的効果、コンテンツ編集および人間機械インタラクションなどの側面で継続的に推進され、最終的な目標は、一般ユーザーが3D仮想世界と直感的にインタラクティブに操作できる完全なシステムを構築することです。
VIP会員