ビットテクノロジーは正式にSeedance 2.5ビデオ生成モデルを発表し、一度のビデオ生成時間は15秒から30秒に倍増されました。このモデルは今後、ジーメイAIとドゥーパオプロフェッショナル版で順次リリースされ、APIサービスも近日中にボルカンアーカスに接続され、映画、広告、教育、工業製造、自動運転など多くのシーンで公開されます。

image.png

公式によると、Seedance 2.5は統一されたマルチモーダル音声・映像連合生成アーキテクチャを引き継ぎ、主な突破点は長編物語能力、マルチモーダル参照および編集能力の大幅な向上です。簡単に言うと、AIビデオは単なる断片的なコマではなく、起承転結のある完璧な作品を作成できます。

30秒以内に複数のカットを構成し、複数ラウンドでの延長が一貫性を保つ

公式が紹介した例では、歌手が一カットでステージへ登場するシーンが完全に物語の論理を示しています。カメラは赤い幕の隙間から暖色のバックステージのメイクルームへと進み、若い女性歌手がヘッドホンを整え、スタッフがステージへの案内をします。その後彼女は通路を通ってダンサーとやり取りし、マイクを受け取った後、最終的にステージに立つ——カメラが引いて体育館全体の全景を捉え、観客、ライトボード、フラッグ、歓声が一望されます。モデルは30秒以内に導入、展開、転機、結末などの論理的なカットを構成できます。

複数ラウンドでの延長機能も驚くべきもので、既存のビデオに基づいてさらに30秒を生成し、人物の主体、シーン、画面スタイル、音声やサウンドエフェクトの一貫性を保つことができます。公式の例では、男の子がサッカーを抱えて地下鉄の車両から走り出したり、男性が追いかけて男の子を最終的に捕まえるような連続的な動作が一気に描かれ、違和感がありません。

30枚の画像、10本の動画を同時に投入し、群像劇をストレスなく描写