字節跳動 Seed 團隊與清華大學智能產業研究院(AIR)近日正式發佈了全新系統——CUDA Agent。這是一個專門用於訓練大型語言模型編寫高性能 GPU 內核的智能體強化學習系統,標誌着 AI 在底層代碼優化領域取得了重要進展。

在過去的 AI 開發中,前沿大模型雖然能夠生成語法正確的 CUDA 代碼,但往往因爲生成的代碼效率較低,在實際運行速度上難以超越傳統編譯器。以 KernelBench 基準測試爲例,基礎模型 Seed1.6 的任務通過率雖已達到 74.0%,但在運行速度上超越 torch.compile 的比例僅爲 27.2%,平均幾何速度反而落後於編譯器本身。

爲了突破這一瓶頸,CUDA Agent 將大模型置於一個真實的 CUDA 開發環境中,配備了性能分析工具、正確性校驗機制以及受權限保護的安全沙盒。系統通過近端策略優化(PPO)算法進行長達 150 步的深度訓練,最終使模型在 250 個任務的基準測試中,整體通過率飆升至 98.8%,且有 96.8% 的生成內核運行速度超越了傳統的 torch.compile。

在實際應用與開源規劃方面,儘管該系統的完整模型權重暫未公開,但研究團隊已面向公衆開放了包含 6000 個樣本的CUDA-Agent-Ops-6K數據集、相關的SKILL.md規範說明以及獎勵和熱身訓練配方。這一成果未來有望廣泛應用於 AI 基礎設施、大模型推理服務、自動駕駛以及量化交易等對延遲高度敏感的行業。