設立記念日を機に、Fish Audio はこれまでで最も強力なプロダクション用の音声大規模モデル S2.1Pro を正式にリリースしました。従来のスクリプトナレーション向けのテキストから音声への変換(TTS)システムとは異なり、このモデルはリアルタイムでの対話音声シーンに特化しており、現在 Fish Audio API で利用可能となっており、開発およびテストのニーズに応じた適正な制限付き無料バージョンも提供されています。

技術的なパフォーマンスにおいて、S2.1Pro は約90ミリ秒の最初のフレームの音声再生遅延を実現し、自然でスムーズな対話の入れ替わりをシームレスにサポートしています。モデルは83の言語をカバーし、統一された音声認識アーキテクチャを使用しています。音声コントロールの柔軟性において、モデルは事前に設定された感情メニューの制限を突破し、テキスト内に自由形式の括弧タグを直接埋め込むことが可能となり、会話中の細かい命令であるささやきや緊張した笑いなども正確に実現できます。
さらに、S2.1Pro はネイティブに複数の話し手による対話生成をサポートしており、わずか10〜30秒の短い参照サンプルで高品質な音声クローンが可能です。追加の微調整なしで、目標のトーンと話し方を正確に再現します。
S2.1Pro のリリースは、音声AIが従来のスクリプト式合成から極めて低い遅延と高い擬似度のリアルタイム対話モードへと急速に進化していることを示しており、グローバルなスマート音声インタラクションの実装のために、より低コストかつ高信頼性の計算インフラストラクチャを提供しています。
