相关推荐
首包延迟300ms、支持20种方言:通义千问Qwen-Audio-3.0-TTS正式开放
阿里通义千问发布新一代实时语音合成模型Qwen-Audio-3.0-TTS,实现从“能说话”到“会表达”的跨越。Plus版本在Artificial Analysis Speech Arena排名全球第一,超越Gemini3.1TTS等主流模型。双版本中Flash版主打低延迟实时交互(首包约300ms),Plus版专攻高质量自然度与音色还原。
2026年7月20号 17:01
184.6k
小米发布全链路语音大模型 MiMo-V2.5,TTS 可“一句话生成新音色”,ASR 开源支持方言与多语混说
小米发布MiMo-V2.5全链路语音模型系列,包括三款TTS模型和一款开源ASR模型,覆盖语音输入与输出。TTS模型能精准调度情绪、语气和角色身份,让声音可编程、可创作、可复刻,提升人机交互自然度,开启语音智能新纪元。
2026年4月24号 8:57
360.7k
英伟达收购 SchedMD 加强开源 AI 生态系统布局
英伟达收购AI软件公司SchedMD,强化开源技术布局,提升AI生态竞争力。公司以高速芯片闻名,同时积极提供多种开源AI模型,覆盖物理模拟、自动驾驶等领域,推动技术普及与创新。
2025年12月16号 8:54
192.9k
智谱多模态开源周圆满落幕:四项视频生成核心技术全面开放
智谱团队开源四项视频生成核心技术,包括GLM-4.6V视觉理解、AutoGLM设备控制、GLM-ASR语音识别和GLM-TTS语音合成模型,展示其在多模态领域的最新进展,为视频生成技术发展奠定基础。
2025年12月12号 10:44
216.5k
Qwen3-TTS 升级:多样化声音让语音合成更自然
Qwen3-TTS语音合成模型全面升级,支持多音色、多语种和多方言,显著提升语音自然度和稳定性。通过Qwen API可便捷访问,现提供超过49种高品质音色,覆盖不同性别、年龄和地域特征,满足多样化场景需求。
2025年12月11号 9:17
211.7k
