xAIは動画生成モデル「Imagine Video1.5」に重大なアップグレードを実施し、画像リファレンス、音声リファレンス、テキストのみで動画を生成する機能およびネイティブ1080p出力の能力を追加しました。これにより、AI動画制作におけるキャラクターの一貫性、シーンの制御および映像品質がさらに向上しました。現在、テキストから動画への変換および1080p動画の生成機能は、Grok Imagineのウェブ版、iOS版、Android版で利用可能です。画像と音声リファレンスの機能は、アメリカ地域のSuperGrok HeavyおよびSuperGrok Plusユーザーに先行して提供されており、後日さらに多くのユーザーに拡大する予定です。

今回のアップデートにより、ユーザーはより柔軟な動画生成プロセスを提供されます。クリエイターは直接テキストの説明から動画を生成することもでき、参照画像をアップロードしてキャラクター、製品またはシーンを制御することもできます。また、キャラクターの画像と音声サンプルを組み合わせることで、AIが異なるカットで外見と声を一貫して保つことができます。xAIによると、Imagine Video1.5では一度に最大7つのビジュアルリファレンスをサポートしており、それぞれが人物の顔、製品の特徴または環境要素を固定し、より細かいコンテンツの制御が可能です。
マルチリファレンスモードでは、ユーザーはキャラクターのアイデンティティを保持しつつ背景を置き換えることもでき、シーンを変更せずにキャラクターを変更することもできます。あるいは、アクションのみを調整しながら全体的なビジュアル設定を維持することも可能です。音声リファレンス機能は、AI動画制作におけるキャラクターの一貫性問題をさらに解決し、同じキャラクターが複数のセグメントで安定した顔の特徴と声の表現を維持できるようにします。
開発者向けには、xAI APIはgrok-imagine-video-1.5モデルを通じて画像リファレンス、テキストから動画への変換およびネイティブ1080p動画生成の能力をサポートしています。開発者はAPIを使用して、ヒント、リファレンス画像のURL、動画の長さ、アスペクト比、解像度などのパラメータを入力することで動画生成を行うことができます。音声リファレンス機能はリクエスト方式を通じてアクセスする必要があります。
Imagine Video1.5は先月にリリースされ、xAIはこのバージョンが動きの表現、物理シミュレーションおよび音声生成において最適化されていると述べました。今回のアップグレードにより、モデルはアイデンティティ、シーン、製品の詳細に対するコントロール能力が強化され、AIによる動画生成は単なる画面の切り替えから、よりプロフェッショナルな映像制作プロセスに近いマルチモーダルな創作ツールへと進化しています。
