大模型強化學習正奔向更大的GPU集羣和更厚的訓練數據,訓練效率已從一個配角升格爲頭等大事。騰訊混元團隊最新研究把目光投向了一個被忽視已久的老問題:當模型自己生成訓練數據、且rollout生成與訓練本身以不同節奏縮放時,批大小這門手藝該怎麼重做。
研究從經典的臨界批大小理論出發,把它重新推演到在線大語言模型強化學習這個新場景。結論很務實:在GRPO和PPO這兩類主流算法裏,只要在擴大批大小的有界範圍內重新調一調學習率,就能保住"每條響應"該學到的東西不被稀釋。也就是說,批大小不是越大越好、也不是一成不變,而是存在一個能調教清楚的甜蜜區間。
落到實打實的硬件賬單上,收益相當醒目。在固定硬件配置下,把批大小往上擴,PPO生成階段的吞吐量最高提升2.29倍;而測量到的最佳GRPO配置,用比此前少29%的時間就跑到了同一個驗證目標。對天天燒卡的訓練團隊來說,這意味着同樣一張集羣、同樣一個目標,要麼更快地交卷,要麼在單位時間裏吞吐更多——強化學習裏最貴的那部分生成開銷,被悄悄擠出了水分。
這項研究的意義在於,它給在線RL的規模化提供了一把可操作的旋鈕:模型在強化學習裏既是學生也是出題人,生成與訓練兩條流水線的縮放失配正是效率黑洞的源頭,而臨界批大小加學習率重調的組合,恰好補上了這道縫隙。當行業還在比誰的模型更大,騰訊混元先把刀磨向了怎麼讓已有的卡跑得更划算。
VIP會員