相關推薦
黑森林實驗室FLUX3 多模態模型登場:單次生成 20 秒音視頻,勝率碾壓Grok與Seedance
Black Forest Labs發佈FLUX3多模態基礎模型,採用統一架構聯合學習圖像、視頻和音頻。基於Self-Flow自監督流匹配框架,在FLUX系列基礎上擴展多模態生成與理解。支持文生視頻、圖生視頻,單次生成最長20秒視頻並原生輸出同步音頻,性能全面超越前代。
黑森林實驗室放出 Flux3:首個原生生成音頻的多模態基礎模型,20 秒音畫同步一次成型
黑森林實驗室發佈多模態模型Flux3,基於Self-Flow架構並集成圖像、視頻、音頻、動作編解碼器,實現物理與數字世界的統一理解與生成。其亮點是首次支持原生音頻生成,一次輸出20秒音視頻同步片段,能力涵蓋文本、圖像、視頻轉視頻等。
德國黑森林實驗室發佈Flux3 多模態模型:原生音頻生成, 20 秒音視頻同步輸出
德國黑森林實驗室發佈多模態基礎模型Flux3,基於Self-Flow架構及專用圖像、視頻、音頻、動作編解碼器,實現物理與數字環境的統一理解與生成。性能碾壓Luma、Runway,首次原生支持音頻生成,可一次性輸出20秒音視頻同步片段,並具備文本/圖像/視頻轉視頻、關鍵幀轉場和多語言對話等功能。
110 億參數塞進六類科學大腦:上智院開放"神珍"多模態模型,從蛋白質到氣象場一個模型全讀懂
7月20日,上海科學智能研究院發佈開放科學多模態基礎模型神珍(MKB),約110億參數,以一個統一模型同時處理DNA、RNA、蛋白質、小分子、地球系統與醫學影像六類科學數據,打破專用模型壁壘,兼具理解與生成能力。
Captions 發佈 Mirage Studio:快速生成具有真實情感和動作的虛擬角色視頻
Captions 正式推出其首款創新產品 Mirage Studio,這是一款基於全新多模態基礎模型 Mirage 開發的視頻生成工具,旨在爲創意團隊提供突破性的視頻製作解決方案。該產品以其高度逼真的虛擬角色生成能力和廣泛的應用潛力,標誌着人工智能在視頻內容創作領域的重大進步。Mirage Studio 的核心功能是能夠根據單張人物照片快速生成虛擬演員視頻。這些虛擬角色不僅在外貌上高度還原,還能呈現出細膩的面部表情,如皺眉、微笑、驚訝等,顯著增強了視頻的情感真實感和觀衆共鳴。此外,Mirage Stud
VIP會員