近日,字節跳動正式推出音頻創作模型Seed Audio1.0,標誌着AI音頻生成技術從單一語音合成階段,邁入完整聲音場景創作的嶄新階段。該模型目前已上線火山方舟體驗中心,向創作者開放測試。
長期以來,影視級音頻內容生產依賴多模型分別生成人聲、音效與環境聲,再通過人工繁瑣拼接與混音,流程冗長且難以保證整體敘事一致性。Seed Audio1.0的核心突破在於,它並非簡單拼接素材,而是在統一框架下聯合建模多種音頻要素,端到端生成可服務於敘事的“完整聲音作品”。

據官方介紹,Seed Audio1.0具備三大核心能力。首先是精準的時空編排,支持以100毫秒的精度按時間線控制對白、音效的入場時機,完美適配視頻配音與廣告製作。其次是穩定的音色演繹,支持零樣本生成與長音頻延展,在保持角色音色一致性的同時,能自然呈現憤怒、喜悅等不同情緒,甚至允許同一音色演繹多個角色。第三是地道的多語種支持,覆蓋包括中文、英語、日語在內的20餘種語言,確保聲音在不同語種下都能符合本土的表達節奏與重音習慣。
評測數據顯示,該模型在九大類常見創作場景中的音頻可用率已超過90%,多語言生成的自然度MOS評分普遍達到4分以上(優秀水平)。

從“會說”到“會創作”,Seed Audio1.0的發佈降低了高質量音頻內容的製作門檻。未來,團隊計劃進一步融合視頻參考等多模態輸入,並探索可控翻譯技術,持續優化長音頻與分軌生成能力,助力創作者將腦海中的聲音構想高效轉化爲可聽見的作品。
項目主頁:
https://seed.bytedance.com/seedaudio1_0
體驗入口:
火山方舟體驗中心 - 登錄 - 選擇語音模型 - 語音合成 - Doubao-音頻生成-1.0
