Black Forest Labs宣佈以Early Access方式上線推出FLUX3 多模態基礎模型,採用統一架構聯合學習圖像、視頻和音頻。該模型基於Self-Flow(自監督流匹配)學習框架擴展,同步訓練視頻、圖像和音頻,在FLUX. 1 和FLUX. 2 系列基礎上進一步擴展至多模態生成與理解任務。

性能全面碾壓,原生音頻同步輸出
FLUX3 可在單次生成中輸出最長 20 秒的視頻並附帶原生音頻,支持文生視頻、圖生視頻、視頻生視頻、輸入視頻與音頻續寫、關鍵幀轉視頻、多語言對話以及多鏡頭串聯等多種創作模式。在帶聲音的 10 秒720p視頻人工評測中,FLUX3 對比Grok Imagine Video勝率達69%,對比Seedance 2. 0 和Gemini Omni Flash勝率均爲52%,展現出全面領先優勢。
圖像能力全面,進軍機器人行爲預測
在圖像能力方面,官方稱FLUX3 可完成圖像生成與編輯,覆蓋多種風格、寬高比和分辨率。更值得關注的是,Black Forest Labs正與Mimic Robotics合作,研究將FLUX3 用作機器人行爲預測模型,將多模態AI能力從內容生成延伸到實體機器人領域。這一佈局意味着FLUX3 不僅是一個創作工具,更有望成爲連接數字世界與物理世界的通用多模態引擎。
