多模態大語言模型正在成爲新一代 AI 的地基,但它的訓練系統卻被一個老問題卡了很久——算得快的,顯存撐不住;顯存省着的,速度又掉下去。小紅書 dots infra 團隊把這個兩難叫做多模態流水訓練的帕累託前沿,而現在他們把這個前沿撕開了一道口子。7月22日,團隊正式開源了名爲 BigMac 的流水並行訓練新範式,專門針對原生多模態場景,開源地址已掛在 GitHub 的 Dots-Infra 之下。
多模態模型從來不是一塊規整的 transformer。一個典型的 MLLM 由三塊拼成:把圖像、音頻轉成 embedding 的模態編碼器,在其上做推理的 LLM 主幹,以及把 LLM 輸出映射回圖像、語音等目標模態的生成器。這三塊形態差異巨大,把它們塞進同一條流水線,麻煩就來了。

業界此前通常兩條路:一條計算高效,把編碼器和生成器從 LLM 流水線裏摘出去單獨跑,好處是模態模塊的耗時波動不會在 LLM 流水線裏製造空泡,壞處是激活顯存會隨 microbatch 數量一路膨脹,生產規模下尤其昂貴;另一條顯存高效,把所有模塊塞進同一條流水線做首尾階段,激活生命週期短了、顯存低了,但只要某個編碼器或生成器慢一點,整條 LLM 流水線就得乾等,尾部空泡隨之而生。規模一大,這兩種設計的瓶頸都會暴露。
BigMac 的出發點樸素卻關鍵:調度的主幹,仍然應該是那條已經高度優化的 LLM 流水線。大規模 LLM 訓練早已依賴1F1B 或 interleaved1F1B 這類成熟 schedule,它們與生產級訓練棧深度綁定。BigMac 不替換它們,而是把 LLM schedule 當作底層時間線,再把編碼器和生成器的計算,插入到輸入已就緒、且不會打亂 LLM 執行順序的位置。團隊稱這種設計爲準依賴安全的嵌套流水線。
它帶來兩個性質:其一,編碼器與生成器的耗時波動不再沿 LLM 流水線一路傳導,LLM 仍按自己本該遵循的節奏推進;其二,模態激活顯存被算法層面壓到 O(1),編碼器不必爲所有 microbatch 保留激活直到流水線結束,生成器也不必拖着長長的激活尾巴。換句話說,BigMac 不是在顯存和空泡之間做交換,而是改寫了 schedule 的結構,讓這兩個目標不再非此即彼。

從能設計 schedule 到真正訓得起來,中間還隔着系統集成、接口定義和性能排查這一整套工程關卡,BigMac 正是衝着這些環節去的。它給了三件東西。第一是把全局 schedule 擺到明面上:運行時的 Scheduler 會生成一張覆蓋所有 pipeline rank、microbatch 和模塊類型的全局 operator 表,Executor 再把它拆成每個 rank 上的本地序列,分發給 Megatron Core 等 LLM 後端、模態 runtime 和通信後端。調度策略從此可見、可檢查,又對後端友好。
第二是對算法工程師無感的流水並行接口:工程師只需描述每個模塊生產什麼、消費什麼,剩下的 stage 劃分、activation 與 gradient 交接、跨設備通信全由 BigMac 在底層料理,讓一個在單卡上驗證過的多模態實驗,能更自然地擴展到流水並行。第三是一套理解 schedule 結構的 profiler、simulator 和可視化工具鏈,把一次訓練迭代拆回 operator 級別,看清每個 rank 在每個時間點究竟在算什麼、在哪裏空轉、哪條依賴卡住了後續;simulator 還能在花大錢啓動訓練前,先試不同的 PP 配置和 microbatch 組合,預估對空泡和吞吐的影響。
效果在兩類代表性負載上得到了驗證。MLLM-Understanding 用 Qwen3-30B-A3B 當主幹、配一個1.3B 的 ViT 編碼器,相比計算高效基線 Optimus,BigMac 提速1.08到1.1倍,相比顯存高效基線 Megatron-DistTrain 提速1.6到1.9倍;更關鍵的是顯存,隨着 per-GPU batch size 增大,BigMac 的峯值顯存保持平穩,而 Optimus 因爲要保留編碼器激活,顯存一路飆升並最終在更大 batch 下直接 OOM。MLLM-Generation 更復雜,加上了一個20B 的 MMDiT 生成器,差異被放大:Optimus 在所有測試 batch size 上全部 OOM,BigMac 則靠及時跑 generator backward、快速釋放生成器側激活躲過了這一劫,相比 Megatron-DistTrain 仍取得1.5到1.9倍加速,顯存依舊穩定。這正是嵌套流水線最值錢的場景——系統必須同時伺候編碼器和生成器的依賴,又沒法承受大量激活駐留或嚴重空泡。
目前,BigMac 已經作爲 dots 多模態模型訓練的核心組件之一,跑在了小紅書的生產環境裏。相關論文 BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training 已掛在 arXiv 上,團隊也同步放出了交互式 PP Profiler 的 trace 示例。對正在被多模態訓練顯存與速度兩頭夾擊的研究者和工程師來說,這份帶着生產驗證的開源,或許能省下不少重新造輪子的時間。
