現代工業與前沿科研的每一次突破,背後都站着規模龐大的高性能計算軟件,而它們的底層往往壓着一個極度吃算力、又繞不開的核心計算模式——Stencil 模板計算。無論是天氣預報、地震勘探、電磁仿真還是材料模擬,本質都是用網格點鄰居的加權組合反覆刷新整張網格。這類計算訪存密集、被內存帶寬牢牢卡住脖子,往往吞掉整個應用大半的運行時間,它的快慢直接決定了一國關鍵工業與科研軟件的效率。
過去要把 Stencil 優化到硬件物理極限,只能靠極度稀缺的 HPC 專家。那些編譯器、代碼生成器和自動調優系統雖然能自動出碼、自動搜參,但優化算法本身仍要人設計和集成,換場景、換 Shape、換硬件就得重新手工接入,始終無法規模化。如今這個局面被撕開了一道缺口——面壁智能聯合 OpenBMB 開源社區發佈了全球首個支持 Stencil 自動研究、自動部署的 AI 優化系統 ForgeStencil,並直接開源。

據披露,ForgeStencil 僅用一週就完成了100多個真實工業和科學計算軟件的自動優化,把單應用優化時長壓縮到小時級,研發效率提升約100倍,而且能隨算力規模並行放大。這意味着 Stencil 優化第一次擺脫人力束縛,規模化成爲可能。
它最顛覆的地方在於雙 Agent 驅動、零人工介入。人類只需扔進待優化的應用源碼,從自動分析、定位熱點、鍛造 Kernel,到算子替換、正確性驗證、集成回原應用,全程沒有任何專家插手決策。系統由 Kernel Agent 與 App Agent 兩塊拼成:前者是算子鍛造的科學家,自主研究併合成高性能 Kernel,針對主流 Stencil 類型、多種 Shape 和精度要求,構建專用算子矩陣,把數學表達寫成逼近硬件極限的優雅代碼;後者是工程落地的實幹派,爲每個真實應用單獨鍛造方案,定位熱點、建立 GPU 基線、驗證集成,最後用應用自帶測例做端到端評測。
在算子對決中,ForgeStencil 拉來 Halide、Devito、EBISU、DRStencil、FlashFFTStencil 等知名框架同臺比拼:同精度 fp32下取得幾何平均2.35倍加速,混合精度 fp16讀寫再拿下額外1.95倍提速,即便在公認最難的變係數 Stencil 全 Shape 上,相比最優基線仍有1.34倍幾何平均加速。

更狠的是它扎進了真實工業場景,而非停在理想化 Benchmark。在主流科學軟件與權威基準上,約42% 的優化直接對應真實工業生產:hypre 結構化多重網格求解器庫加速3.86倍,minisweep 核反應堆中子學輸運加速5.78倍,gprMax 與 FDTD 電磁仿真加速2.47倍,RTM 逆時偏移油氣地震成像加速1.81倍,道達爾 minimod 地震 mini-app 加速1.22倍,QuantLib 債券定價加速1.82倍,非笛卡爾 MRI 重建加速2.45倍,數字乳腺斷層成像反投影加速1.63倍。石油公司、醫療設備、氣象部門的實際生產負載,它都直接啃了下來。
相比人類專家經驗鎖在自己腦子裏、難以共享,ForgeStencil 讓大量並行 Agent 共用一個知識庫,經驗實時互通,實現智能的集體同步進化。這是面壁智能繼5月 ForgeTrain 之後,基於 Forge Engineering 軟件工程範式交出的又一成果,從自動生成代碼邁向自動研究優化,從局部算子提速邁向真實應用部署。
短期看,存量工業軟件的自動優化能小時級拿到接近硬件極限的實現,靠算力節約和研發壓縮直接降本增效;長期看,當 CAE 仿真、地震成像、電磁與流體這些高端裝備、能源勘探、芯片設計的數字底座被自動化優化,國產製造業升級便踩下了加速鍵。目前 ForgeStencil 已在 GitHub 開源,面壁智能向 HPC 學者、工業軟件從業者和開源開發者發出共建邀請。
