バイトダンス Seed チームは、音声・動画・テキストを統一アーキテクチャでネイティブに統合した双方向大規模モデル「SeedRealtime」をリリースしました。「見ながら」「聞いながら」「話しながら」というリアルタイムでの自然なインタラクションが特徴です。この技術はすでに実験室の段階を過ぎており、豆包アプリで完全に展開され、音声と映像の双方向技術を規模化して実装する先駆けとなっています。

従来の連鎖型アプローチと比較して、SeedRealtime の最も重要な違いはアーキテクチャです。連鎖システムは通常「聞く—変換—考える—話す」のように段階的につながっており、感知と表現が異なるモジュールで行われるため、会話のテンポが乱れがちです。一方、SeedRealtime は音声と映像の認識と表現を統一されたエンドツーエンドモデルに組み込み、モデルが画面と音声の両方を受け取り、直接返答を生成します。このようなネイティブな統合による最も直接的な恩恵は、音声と映像の会話における話しのテンポの問題が半分に減少し、頻繁に起こっていた発言の重なりや突然の停止、または話題外の回答といった断絶感がなくなりました。
