相关推荐
黑森林实验室FLUX3 多模态模型登场:单次生成 20 秒音视频,胜率碾压Grok与Seedance
Black Forest Labs发布FLUX3多模态基础模型,采用统一架构联合学习图像、视频和音频。基于Self-Flow自监督流匹配框架,在FLUX系列基础上扩展多模态生成与理解。支持文生视频、图生视频,单次生成最长20秒视频并原生输出同步音频,性能全面超越前代。
黑森林实验室放出 Flux3:首个原生生成音频的多模态基础模型,20 秒音画同步一次成型
黑森林实验室发布多模态模型Flux3,基于Self-Flow架构并集成图像、视频、音频、动作编解码器,实现物理与数字世界的统一理解与生成。其亮点是首次支持原生音频生成,一次输出20秒音视频同步片段,能力涵盖文本、图像、视频转视频等。
德国黑森林实验室发布Flux3 多模态模型:原生音频生成, 20 秒音视频同步输出
德国黑森林实验室发布多模态基础模型Flux3,基于Self-Flow架构及专用图像、视频、音频、动作编解码器,实现物理与数字环境的统一理解与生成。性能碾压Luma、Runway,首次原生支持音频生成,可一次性输出20秒音视频同步片段,并具备文本/图像/视频转视频、关键帧转场和多语言对话等功能。
110 亿参数塞进六类科学大脑:上智院开放"神珍"多模态模型,从蛋白质到气象场一个模型全读懂
7月20日,上海科学智能研究院发布开放科学多模态基础模型神珍(MKB),约110亿参数,以一个统一模型同时处理DNA、RNA、蛋白质、小分子、地球系统与医学影像六类科学数据,打破专用模型壁垒,兼具理解与生成能力。
Captions 发布 Mirage Studio:快速生成具有真实情感和动作的虚拟角色视频
Captions 正式推出其首款创新产品 Mirage Studio,这是一款基于全新多模态基础模型 Mirage 开发的视频生成工具,旨在为创意团队提供突破性的视频制作解决方案。该产品以其高度逼真的虚拟角色生成能力和广泛的应用潜力,标志着人工智能在视频内容创作领域的重大进步。Mirage Studio 的核心功能是能够根据单张人物照片快速生成虚拟演员视频。这些虚拟角色不仅在外貌上高度还原,还能呈现出细腻的面部表情,如皱眉、微笑、惊讶等,显著增强了视频的情感真实感和观众共鸣。此外,Mirage Stud
