阿里的EMO框架通过关注音频提示和面部动作之间的联系,增强了头部视频生成的真实度、自然度和表现力。EMO支持不同语言的歌曲和口语音频生成,可以让角色化身具有丰富的表情和动态。此外,EMO还能实现不同角色之间的联动,为视频生成带来更多可能性。
相关推荐
火山引擎Seedance2.5上线Draft模式:480P试错、1080P成片,成本最高省77%
火山引擎为Seedance2.5 API推出Draft样片模式,将视频生成分两阶段:先用480P低成本生成样片,供创作者检查场景、构图、动作、对白音效与运镜节奏,调整提示词和素材后,再基于样片ID生成1080P成片。模型关联提示词、参考素材及seed、比例、时长等参数二次推理,保证成片结构一致。
2026年9月23号 10:30
255.7k
Qwen4已投入训练,阿里公布10万亿参数模型演进路线
9月22日云栖大会杭州开幕,阿里公布大模型进展:Qwen4已投入训练,后续参数规模计划扩至5万亿至10万亿;递归自我改进进入训练、推理及芯片协同;多模态矩阵升级,11月发布新一代视频生成模型。刘大一恒称Scaling是迈向ASI的重要路径。
2026年9月22号 14:03
415.0k
阿里发布 Qwen3.8-Omni-Flash:原生全模态、百万上下文,音频成本砍掉 98%
阿里巴巴Qwen团队发布原生全模态模型Qwen3.8-Omni-Flash,支持文本、图像、音频、视频四类输入,上下文窗口达100万Token,29项基准较上代平均提升超25%。其最大变化在于处理方式:不再简单拼接语音、图像识别,而是从模型层原生融合多模态理解与AI智能体能力。
2026年9月18号 13:50
476.0k
阿里发布全新 Qoder:从 AI 编程工具升级为面向所有人的智能体工作台
阿里发布全新Qoder,将AI编程IDE升级为以Coding能力为核心底座的智能体工作台。用户用自然语言描述目标,即可由其理解上下文、制定计划、调用工具、执行并验证,全程可查看、调整或接管。该IDE全球发布一年累计用户超600万,服务超10万家企业。新版本背后是三重协作范式转移。
2026年8月28号 11:34
550.9k
直出4K分辨率!谷歌全新Gemini Omni 1.1 Flash视频模型重磅登场
谷歌发布视频生成AI模型Gemini Omni1.1 Flash,最高支持4K超高清输出,并在场景扩展、运镜控制与生成效率上全面升级,面向开发者和专业创作者。该模型主打多项功能亮点,用户可直接进行场景扩展等操作,推动多模态视频生成向更高清、更长时方向演进。
2026年8月28号 9:10
315.8k
VIP会员