グーグルは、Gemini Omni 1.1 Flashという動画生成AIモデルを発表しました。このモデルは最大4K解像度の動画を出力できます。従来のOmni 1.1の標準720pと比較して、新モデルは速度とコストに明確なトレードオフを取っており、プロフェッショナルな完成品の制作シーンへと拡張されています。

image.png

シナリオのプレビューから4K完成品までのフルプロセス

特徴の一つはシーンの拡張です。既存の動画の終わりから後続の画像をスムーズに続きとして生成することができ、毎回10秒ごとのステップで段階的に拡張し、1本あたり最大40秒まで伸ばせます。最初と最後のフレームを指定する機能では、開始と終了の画面を指定することで、滑らかなトランジションとカメラワークを実現します。また、動画の参照機能では最長3秒のセグメントを導入でき、文脈やキャラクターの一貫性を正確に維持できます。

コスト構造は明確に分層されています。360pのプレビューは1秒あたり0.03ドルで、標準よりも最高60%早く、コストは三分之一に抑えられ、シナリオの反復に適しています。720p、1080p、4Kはそれぞれ1秒あたり0.1ドル、0.15ドル、0.3ドルです。グーグルは、動画生成を「プレビューが動作する」段階から「完成品として納品できる」段階へと進化させ、AIによる動画がプロトタイプと最終的な仕上げの間に連続した生産プロセスを持つようにしています。