一份來自英美兩大 AI 安全機構的聯合評測,把月之暗面最新模型 Kimi K3的"另一面"攤在了陽光下。英國人工智能安全研究所(UK AISI)與美國人工智能標準與創新中心(CAISI)合力給這款模型做了一次攻擊性網絡任務體檢,結論是:它在漏洞利用開發和模擬網絡攻擊上大幅落後於美國領先的前沿模型,但優於同樣來自中國的智譜 GLM-5.2,在開放權重模型陣營裏仍立起了一根新標杆。更刺眼的是,Kimi K3的安全護欄幾乎沒能攔住漏洞利用的開發,模型在配合這類操作時沒遇到像樣的阻力。

這場"考試"用的第一份試卷,是卡內基梅隆大學開發的 ExploitBench 基準。它從2023年之後 Chrome V8引擎裏挖出41個真實漏洞,沿着軟件利用的推進過程一路打分。結果分差驚人:美國領先模型平均拿下76.2%,Kimi K3只有32.2%,GLM-5.2則以24.4% 墊在身後。更關鍵的是等級——41項任務裏,Kimi K3一項都沒摸到最高的"任意代碼執行"(ACE),而那正是最兇險的利用等級,因爲它意味着攻擊者能完全掌控目標系統;對面美國模型則在41項裏攻下了20項 ACE。值得補一句的是,英美機構在測試美國閉權重模型時關掉了系統級安全防護,只爲量出它們的最大本領,而那些防護在公開版本里是默認開着的。

image.png

第二份試卷叫"最後的倖存者"(TLO),模擬的是一次橫跨四個子網、約20臺主機的企業網絡攻擊,整條路徑32個步驟,研究機構說人類專家大概要啃20個小時。目前全球只有少數模型能真的通關,迄今四個公開可用的閉源權重模型過了這關,最強的十次嘗試裏成攻完成六到七次。Kimi K3平均走到第17步就卡住,美國領先模型能推到第28.5步,GLM-5.2只到第11步;它在十次嘗試裏有一回在1億 token 的限制內跑通了整條攻擊鏈,說明能力是有的,只是調不動、不穩定。機構下了句判斷:只要給到初始網絡訪問權限、再下一道指令,Kimi K3就能自主啃下規模較小、防禦薄弱又易攻的企業系統。需要提醒的是,TLO 沒算進主動防禦,並非完全貼近現實,但就在本週,OpenAI 模型試圖自主入侵 Hugging Face 的事剛被披露,對方雖用了開放權重模型,終究把攻擊擋了下來。

把時間軸拉長看,中國模型確實在追趕,卻始終落後一截。CAISI 用 Elo 評分體系追蹤了自2025年初以來中美模型的網絡能力,兩條趨勢線都在上揚,紅色的中國線與藍色的美國線之間卻一直有縫。Elo 提升400分意味着解決任務的概率漲十倍——這差距不是小數。英國機構此前把開源模型與美國系統的性能差估在四到七個月,2025年初還是六到十個月,最新結果正好落在這條規律裏。AISI 的警告很直白:開源模型日益增長的網絡能力,是一份"持續且不可逆的濫用風險",輕視不得。

最耐人尋味的一筆,落在測試結果和蒸餾指控的交叉點上。美國科學顧問邁克爾·克拉齊奧斯近期曾公開指控月之暗面,稱其把 Anthropic 的 Fable 模型最優輸出當訓練數據,給 Kimi K3"蒸餾"提質,還稱對方拿到了受美國出口管制的英偉達 GB300芯片。而通用基準成績漂亮、網絡安全得分卻塌了一截,恰好能用這套說法解釋:Kimi K3大概率主要吃的是 Claude 在通用知識、編程和智能體任務上的輸出;Anthropic 的安全分類器會專門掐掉高級攻擊性網絡查詢,於是這類樣本在蒸餾數據集裏佔比極低——模型因此能在標準榜上和西方對手叫板,卻沒學到更深的漏洞利用本事。AISI 的評測從側面撐起了這個解讀:它關掉美國模型上的系統級防護,恰恰暴露出那些幾乎無法通過公開接口觸達、因此基本喂不進蒸餾的網絡能力。一張考卷,量出的不只是一個分數,還有水面下那層沒說破的來歷。