在成立周年之际,Fish Audio 正式推出其迄今最强大的生产级语音大模型 S2.1Pro。与针对脚本旁白的传统文本转语音(TTS)系统不同,该模型专为实时对话语音场景打造,目前已通过 Fish Audio API 上线,同时提供满足开发与测试需求的合理限额免费版本。

在技术性能方面,S2.1Pro 实现了约90毫秒的首帧音频播放延迟,可无缝支持自然顺畅的对话轮替;模型覆盖83种语言并采用统一的语音识别架构。在语音控制灵活性上,模型突破了预设情绪菜单的限制,允许直接在文本中嵌入自由格式的括号标签,精准实现耳语、紧张笑声等行内细粒度指令。
此外,S2.1Pro 原生支持多说话人对话生成,且仅需10至30秒的短参考样本即可完成高质量语音克隆,在无需额外微调的前提下精准复刻目标语调与说话风格。
S2.1Pro 的推出标志着语音 AI 正在从传统的脚本式合成向极低延迟、高拟真度交互的实时对话模式加速演进,为全球化智能语音交互落地提供了更低门槛与高可用度的算力基础设施。
