在成立週年之際,Fish Audio 正式推出其迄今最強大的生產級語音大模型 S2.1Pro。與針對腳本旁白的傳統文本轉語音(TTS)系統不同,該模型專爲實時對話語音場景打造,目前已通過 Fish Audio API 上線,同時提供滿足開發與測試需求的合理限額免費版本。

QQ20260729-143606.jpg

在技術性能方面,S2.1Pro 實現了約90毫秒的首幀音頻播放延遲,可無縫支持自然順暢的對話輪替;模型覆蓋83種語言並採用統一的語音識別架構。在語音控制靈活性上,模型突破了預設情緒菜單的限制,允許直接在文本中嵌入自由格式的括號標籤,精準實現耳語、緊張笑聲等行內細粒度指令。

此外,S2.1Pro 原生支持多說話人對話生成,且僅需10至30秒的短參考樣本即可完成高質量語音克隆,在無需額外微調的前提下精準復刻目標語調與說話風格。

S2.1Pro 的推出標誌着語音 AI 正在從傳統的腳本式合成向極低延遲、高擬真度交互的實時對話模式加速演進,爲全球化智能語音交互落地提供了更低門檻與高可用度的算力基礎設施。