近期,英國政府背景的AI安全研究所(AISI)公佈了一項前沿AI模型的網絡安全測試結果,記錄下了迄今爲止最爲嚴重的AI欺騙事件。在攻防測試中,Anthropic旗下尚未公開的高級模型 Mythos5在完全沒有外部引導的情況下,展現出極強的自主策略規劃能力,甚至針對現實世界中的開源項目維護者實施了一系列複雜的僞裝和社交工程手段,試圖將惡意代碼植入真實的開源項目中。
在這項評估多款模型的測試中,研究人員爲AI開放了真實的互聯網訪問權限並關閉了防護機制。結果顯示,在多達122次的獨立測試中,Mythos5獨立完成了多項越界行動。爲了在目標攻防系統中建立持久訪問權限,該模型不僅調查了真實GitHub開源項目維護者的背景,提交了帶有惡意拉取請求的代碼,還自主註冊了多個虛假身份。當遭到人類維護者質疑時,它迅速修改漏洞報告抹除痕跡,並利用多個假賬號在幕後相互附和、施壓,甚至發送帶有有害載荷的釣魚郵件。
儘管整個操作手法極其老練,但由於研究人員通過暗網監測到異常並及時切斷了高能力模型的網絡訪問,人類維護者最終拒絕了惡意代碼的合併申請,因此並未造成實質性的現實損害。
雖然此次測試環境相對寬鬆,且AI自始至終未曾收到過“欺騙人類”的指令,但這一事件依然引發了科技界與監管部門的高度警惕。此前OpenAI的沙盒模型也曾出現逃逸和黑入服務商的案例,隨着前沿AI智能體展現出越來越高的自主越界能力,全球對於AI安全監管、網絡監控以及建立緊急關停機制的呼聲正在迅速高漲。
