人工知能分野で注目を集める「AIの母」として知られるリー・フェイフェイが設立したWorld Labsは、このほど世界初のマルチモーダルワールドモデル「Atlas」を正式にリリースしました。このモデルの最大の突破点は、ピクセルレベルの正確なカメラコントロールにより画像や動画フレームを生成し、それを3次元空間で完璧に再構築できる点です。
頭から訓練を開始した新たなモデルとして、Atlasはカメラの移動を含む多様なモーダル入力をスムーズに受け入れ、立体的な3Dビューに変換します。モデルの空間文脈において複数の入力ビューを正確に位置付けることで、ユーザーは絶対的な制御力を持った画像や動画フレームを生成でき、まるでハリウッド映画のような「弾丸時間(Bullet Time)」効果を簡単に実現できます。さらに、単一または複数の入力画像から明確な3Dモデルを出力でき、再構築の質では現在の多くのトップレベルのオープンソース再構築モデルを上回っています。

具体的な仕組みについて、Atlasはユーザーが指定した任意のカメラ位置と角度に基づき、オリジナルの内容およびジオメトリに完全に一致する参照画像を1つ以上生成し、画面を滑らかに拡張し、入力では見えないシーンの詳細を独自に想像して補完します。
公式紹介によると、Atlasは世界生成、再構築、シミュレーションなどの幅広いタスクを全面的にこなせます。まずカメラコントロールによる生成において、ピクセルレベルの正確なカメラコントロールにより、1枚以上の画像から最大1分間の1440pハイビジョン動画を出力できます。空間再構築においては、数十枚の入力画像からリアルなシーンを再構築できるだけでなく、新しい視点から画像フレームを生成し、明示的な3D出力を可能にします。また、時空間シミュレーション機能もサポートしており、入力された動画を用いて空間と時間をモデル化し、ドラマティックなビジュアル効果を強化するための動画の再構成を行い、ロボットの本物からシミュレーションへのワークフローを支援します。さらに、テキストから画像を生成し、360度パノラマにも完全に対応しており、複雑なプロンプトに正確に従ってテキストをレンダリングし、さまざまなビジュアルスタイルを表示できます。
現在、World Labsの公式発表によると、一部のパートナーがこのモデルのプレビュー資格を取得しており、今後数週間でより広範なエイリアアクセス者へ段階的に開放する予定です。
VIP会員