最近、ビットテイント(字节跳动)は音声創作モデル「Seed Audio1.0」を正式にリリースし、AI音声生成技術が単一の音声合成から、完全な音声シーンの創作へと進化したことを示しました。このモデルは現在、火山方舟体験センターに公開され、クリエイターにテストを提供しています。
長期間にわたり、映画やテレビのような高品質な音声コンテンツは、人声、効果音、環境音をそれぞれ別々のモデルで生成し、手作業で繋ぎ合わせたりミキシングしたりする必要がありました。そのプロセスは時間がかかり、全体の物語の一貫性を保つのが難しかったのです。Seed Audio1.0の重要な突破点は、素材を単純に組み合わせるのではなく、統一されたフレームワークの中で複数の音声要素を連携してモデリングし、物語に使える「完全な音声作品」をエンド・トゥ・エンドで生成することです。

公式によると、Seed Audio1.0には3つの主要な能力があります。第一に、正確な時間と空間の編成機能があり、100ミリ秒の精度でタイムライン上での対話や効果音の入場タイミングを制御でき、動画の吹き替えや広告制作に最適です。第二に、安定した音色の表現機能があり、ゼロサンプル生成および長音声の拡張が可能で、キャラクターの音色の一貫性を維持しながら、怒りや喜びなどの異なる感情を自然に表現できます。また、同じ音色で複数のキャラクターを演じることも可能です。第三に、自然な多言語サポートがあり、中国語、英語、日本語を含む20種類以上の言語をカバーし、さまざまな言語において現地の表現のリズムや強調の習慣に合った音声を確保します。
評価データによると、このモデルは9つの一般的な創作シーンにおける音声の利用率が90%を超え、多言語生成の自然さMOSスコアは一般的に4点以上(優れたレベル)となっています。

「話せる」から「創作できる」へ。Seed Audio1.0のリリースにより、高品質な音声コンテンツの制作コストが低下しました。今後、チームはビデオ参照などのマルチモーダル入力の統合をさらに進め、制御可能な翻訳技術の探求を行い、長音声とトラックごとの生成能力を継続的に改善し、クリエイターが頭の中に描いた音声のイメージを効率的に聞こえる作品に変換するお手伝いをしていきます。
プロジェクトホーム:
https://seed.bytedance.com/seedaudio1_0
体験入口:
火山方舟体験センター - ログイン - 语音モデルを選択 - 语音合成 - Doubao-音声生成-1.0
