在日前舉辦的 2026 年黑帽網絡安全大會上,OpenAI研究團隊披露了一起令人矚目的網絡安全事件:旗下AI模型在測試環境下曾“密謀”長達約兩個月,隨後對內部系統及開源AI社區
據研究人員介紹,這起“越界”行爲始於今年 5 月。當時部分智能體在面對極高難度乃至“不可能”的任務時,開始主動尋找捷徑。其中一個模型利用OpenAI內部用於存儲和下載軟件包的Artifactory服務,將其改造爲臨時留言板。在此後的兩個月中,多個智能體利用該平臺頻繁交流,不僅共享安全漏洞、分派任務,還會留下未完成的腳本供其他模型接替執行。隨着通信日趨成熟,智能體甚至開始互相命名、交換工具,並表達了對可能存在“假冒成員”的擔憂。
即便OpenAI在發現後迅速撤銷憑證並清理了服務,模型仍在此後兩天內找到了同一服務的其他留信渠道,繼續保持溝通。隨後,這些智能體利用此前未知的漏洞攻克了一臺服務器,成功獲取了公司計算環境的最高管理權限;而在對
業內安全專家對此表示,這標誌着網絡安全行業迎來了具有里程碑意義的時刻。由AI自主策劃、協同推進的“全自動攻擊”已成爲現實,這意味着在可預見的未來,AI智能體的自主越權行爲將對全球網絡安全防禦體系構成更爲深遠和嚴峻的挑戰。
