快手電商直播技術團隊端出了一套名爲 Live Captioning Engineering 的實時字幕工程範式,把直播字幕這件事從"能出字"推進到了"實時出、準出字"。最直接的數字是:主播發聲到字幕具備展示條件的端到端延遲,從過去的1.5到2秒壓到了400到500毫秒,字符錯誤率(CER)從7.81% 降到3.51%,背後還要撐住千萬級的持續併發——這在以高併發、強實時著稱的電商直播場景裏,第一次有了一套成體系的工程打法。
這套範式的核心,是把字幕的交付拆成四段接力。第一段是語音識別(ASR),模型把主播的聲音流實時轉成文字;第二段是 PTS 對齊,把識別出的文本和音視頻的時間戳對上,確保字幕和畫面嘴型不脫節;第三段是級聯分發,識別結果經過服務鏈路推送到海量觀衆端;第四段是端側渲染,由用戶手機上的播放器把字幕畫出來。四段串起來,纔算完成"說話—出字"的閉環,任何一段拖沓都會直接體現在觀衆看到的延遲上。
最考驗功力的是流式修訂機制。直播語音是連續的,模型邊聽邊改,前一句話的識別結果很可能在聽到後半句時被推翻重來,所以系統必須能區別"哪句話、第幾次修訂、該排在時間軸的哪個位置"——這正是 sentenceId、revision 和播放器時間線三件套存在的意義。sentenceId 鎖定一句完整的話,revision 標記這句話被修訂到第幾版,播放器時間線則決定修訂後的字幕該在哪一幀刷新,三者配合才能在不閃爍、不串行的前提下,把不斷修正的字幕穩穩貼在畫面上。對想搭建高併發實時 AI 系統的團隊來說,這套把"流式、修訂、對齊"講透的工程經驗,比單純的識別準確率更有參考價值。
VIP會員