7月23日、ドイツの人工知能スタートアップであるブラックフォレストラボ(Black Forest Labs)は、マルチモーダルベースモデル「Flux3」を正式に発表しました。これは生成型動画技術において重要な突破を意味しています。このモデルはSelf-Flowアーキテクチャに基づいて構築され、専用の画像、動画、音声および動作コーデッカーを備え、物理的およびデジタル環境の統一的な理解と生成を実現しています。

Flux3は、最初のネイティブな音声生成をサポートするモデルであり、一度に20秒間の音声と動画が同期したセグメントを出力でき、テキスト/画像/動画から動画への変換、キーフレームに基づくトランジション、多言語会話などの機能を含みます。720p解像度、10秒のセグメントでの初期テストでは、Flux3は強力な競争力を示し、Luma Ray3.2(93%の勝率)とRunway Gen-4.5(77%の勝率)を上回り、Seedance2.0やGemini Omni Flashなどのトップモデルとの比較でもわずかな優位性を維持しています。
さらに、同社はMimic Roboticsと協力して、ロボット分野向けの動画アクションモデル「Flux-mimic」を開発しました。これは現在、アウディ工場で生産作業のテストを行っています。BFLは段階的にリリースする戦略を採用しており、「Flux3Video」はすでに公開されています。「Flux3Image」とオープンソースの重みを持つ「Flux3Dev」も近日中に順次リリースされる予定です。単一モードの情報の制限を打破することで、Flux3はAIが感知と行動能力を持つ物理的世界「世界モデル」へと進化するのを加速させています。
