快手エコマースのライブ配信技術チームは、リアルタイム字幕工程のフレームワークとして「Live Captioning Engineering」というものを構築しました。これにより、ライブ字幕の作成が「出る」ことから「リアルタイムで正確に出る」へと進化しました。最も直接的な数値は、パーソナリティの声が字幕として表示されるまでのエンドツーエンド遅延が、過去の1.5〜2秒から400〜500ミリ秒に短縮され、文字誤字率(CER)は7.81%から3.51%まで低下しています。また、このシステムは千万級の同時接続を支えています。これは、高同時接続・強リアルタイムが特徴のエコマースライブ配信シーンにおいて、初めて体系的に構築されたエンジニアリング手法です。
このフレームワークの核心は、字幕の配信を4つの段階に分けて行うことです。第一段階は音声認識(ASR)で、モデルがパーソナリティの音声ストリームをリアルタイムで文字に変換します。第二段階はPTS同期で、認識されたテキストと映像の時間スタンプを一致させ、字幕と画面の口元がずれないようにします。第三段階はカスケード配信で、認識結果をサービスルート経由で膨大な視聴者端末に送信します。第四段階は端末側のレンダリングで、ユーザーのスマートフォン上のプレイヤーが字幕を描画します。4つの段階をつなぎ合わせることで、「話す—字幕が出る」のループが完成し、どの段階でも遅れがあると視聴者の目に反映されます。
最も実力を問うのは、ストリーミング修正メカニズムです。ライブ音声は連続的であり、モデルは聞いていて修正を繰り返します。前の文の認識結果は、後半の文を聞いた時点で取り消されて再構成されることがあり、そのためシステムは「どの文、何回目の修正、時間をどの位置に配置するか」を区別できる必要があります。これはまさにsentenceId、revision、およびプレイヤーのタイムラインの3つの要素が存在する理由です。sentenceIdは一文を特定し、revisionはその文が何版目で修正されているかを示し、プレイヤーのタイムラインは修正後の字幕がどのフレームで更新されるべきかを決定します。これらが組み合わさることで、ちらつきや並列処理なしに、修正中の字幕を安定して画面に貼り付けることができます。高同時接続のリアルタイムAIシステムを構築したいチームにとって、この「ストリーミング、修正、同期」を詳しく説明したエンジニアリング経験は、単なる認識精度よりも参考になります。
VIP会員