7月24日,螞蟻百靈正式發佈新一代原生混合推理模型 Ling-3.0-Flash。該模型總參數量124B,單次計算激活5.1B。在大幅精簡體量與降低算力開銷的同時,Ling-3.0-Flash 在基礎推理、指令遵循及長文本處理等核心指標上,對標甚至超越了參數規模達其2至3倍的行業領先模型,展現出更高的“智效比”與落地性價比。據瞭解,該模型已上線OpenRouter,限時免費一週,之後將正式開源。

image.png

作爲該版本的重點,Ling-3.0-Flash 針對Agent的實際應用場景進行了深度打磨。模型擴展了超10000個真實交互訓練環境,並優化了複雜任務的自我糾錯與長程規劃機制。無論是在代碼編寫、複雜任務拆解,還是多源信息深度調研等場景中,Ling-3.0-Flash 均展現出更強的自主閉環交付能力,解決了傳統模型在大任務中容易“跑偏”或斷檔的難題。

據介紹,實現“小體量、高智能”的關鍵,源於模型底層計算架構的重新設計。Ling-3.0-Flash 放棄了單純堆砌參數的思路,從預訓練階段即採用混合注意力架構,以5:1的比例交替堆疊 KDA 線性注意力層與 MLA 層,讓模型在長上下文效率與模型能力之間實現更優平衡。

此外,Ling-3.0-Flash將上一代的 Lightning Attention 升級爲 KDA(Kimi Delta Attention),在 Delta Rule 的狀態更新中引入細粒度對角門控,讓模型在處理長文檔和代碼庫時能更精準地記住關鍵信息。同時,Ling-3.0-Flash進一步壓縮了單次計算的專家激活比例,每個 Token 的專家激活比例由前代的1/32進一步壓縮至1/64,並由此帶來了更高的“效率槓桿”。

image.png

爲了讓 AI Agent 運行更快、更穩,百靈還爲其匹配了配套的工程與協作架構。在響應速度上,通過引入集羣級分級緩存,避免了長對話和多輪交互中的重複計算,將長輸入下的首字響應延遲降低了60% 至80% 以上;在任務穩定性上,升級後的多智能體協同架構允許不同 Agent 分工協作、相互校驗,有效減少了單一模型的誤判風險,爲高頻線上服務與真實業務落地提供了支撐。