字節 Seed 團隊發佈了 SeedRealtime,一個用統一架構原生把音頻、視頻和文本揉在一起的全雙工大模型,主打"邊看、邊聽、邊說"的實時自然交互。它已經不在實驗室裏——這套能力已在豆包 App 全量上線,率先把音視頻全雙工技術推到了規模化落地的位置。

image.png

和傳統的級聯方案相比,SeedRealtime 最核心的差別在架構。級聯繫統通常是"聽—轉寫—想—說"逐段拼接,感知和表達分屬不同模塊,對話節奏容易打架;SeedRealtime 則把音視頻的感知與表達統一進同一個端到端模型,讓模型一手接住畫面和聲音、一手直接生成迴應。這種原生融合帶來的最直接收益,是音視頻對話裏的說話節奏問題減少了一半,不再頻繁出現搶話、停頓突兀或答非所問的割裂感。

更妙的是它在實時場景裏的"分寸感":能主動提醒、也能自然停頓,像真人對話那樣留出呼吸的間隙,而不是一股腦把話說完。對全模態智能助手而言,這等於給出了一條新路線——不再依賴把多個單模態模型用管道串起來,而是讓一個模型同時長着眼睛、耳朵和嘴巴。