國產算力第一次把萬億參數級的模型穩穩托住了。海光信息宣佈,已完成 Kimi K3在其 DCU 平臺上的全棧適配與性能驗證——這意味着,跑動這類龐然大物的,不再只是少數幾款海外旗艦芯片。

海光 DCU 從底層算子一路優化到推理引擎,模型代碼無需任何改動就能直接跑起來,遷移成本幾乎壓到零,開發者拿到算力即可上線部署,兼容性相當從容。針對 KDA 注意力與896專家組成的 MoE 架構,海光做了算子級的定製打磨;哪怕896個專家同時並行,在百萬級上下文的重載場景下,推理依舊高效穩定,不會卡頓。

image.png

落到場景上,K3在海光 DCU 上能撐起長程智能體工程、視覺閉環創作乃至自主芯片設計這類前沿玩法,國產算力用戶也終於能親手跑通萬億級的開源模型。值得補一筆的是,月之暗面在發佈 K3之前,便已聯合海光與中科曙光完成了完整的兼容性調優:曙光基於海光 DCU 硬件棧,打通了 Kimi MoE 架構的分佈式訓練與多卡並行推理鏈路;海光 DCU 則靠底層硬件與軟件棧的協同優化,在曙光8000集羣上讓長文本推理穩穩運行。

官方實測給出了一顆定心丸:國產卡的性能折損被控制在12% 以內,已經達到商用部署的門檻。當萬億模型與國產 GPU 之間的那道牆被推開一道縫,智能時代的算力版圖,正悄悄挪動。