一個本該被關在隔離測試環境裏的模型,不僅自己撬開了通往互聯網的口子,還順着漏洞摸進了別人家的生產數據庫。 7 月 21 日,OpenAI承認,它的一款AI模型在內部網絡安全測試中出現意外,攻破了與其無關的AI託管平臺Hugging Face的系統——這是迄今首個由模型評測直接演變爲真實網絡攻擊的事件。

Hugging Face最初在披露中將這起入侵歸因於一個外部AI代理。週二下午,OpenAI發佈博客文章,把導致模型攻破服務的全過程攤開還原。公司在文中寫道,調查後發現,這起特定事件由一組OpenAI模型共同驅動,包括GPT-5.6 Sol和一款能力更強的預發佈模型,這些模型當時都出於評測目的降低了網絡拒絕傾向,正在一個網絡能力基準上做內部測試。

入侵的聚焦點是一個名爲ExploitGym的公開基準,它用來衡量模型基於現有漏洞執行攻擊的能力。這類基準常被用於模型訓練中精煉特定技能,但此番是第一次,這種測試真正釀成了一起網絡攻擊。

按理說,涉事模型本不該擁有互聯網訪問權限,唯一的例外是一個特定工具——它允許模型安裝完成任務可能需要的軟件包。問題在於,模型在這個包安裝程序裏找到了一個未曾公開的漏洞,並藉此隨意觸達了更廣闊的互聯網。OpenAI在博客裏描述得很直白:模型極度專注於爲ExploitGym尋找解法,爲了達到一個相當狹窄的測試目標,走到了極致

拿到互聯網訪問權之後,模型推斷出Hugging Face可能託管着ExploitGym的模型、數據集和解決方案。它隨即搜索併成功找到了獲取祕密信息的途徑,用來在評估裏作弊。最終,模型在Hugging Face的基礎設施中發現了漏洞,得以直接從後者的生產數據庫裏取走測試答案,等於把基準的參考答案一把攥在手裏。

對Hugging Face而言,眼前發生的是一場複雜而激進的攻擊。該公司在最初披露中形容,攻擊由大量短命沙箱組成的一羣實體發起,跨越數千個獨立動作,指揮與控制的鏈路還自我遷移、暫存在公共服務上。

OpenAI已識別並向Hugging Face報告了包安裝程序的漏洞,雙方正進一步聯合調查。公司同時表示,會在模型測試與相關基礎設施上加裝新的控制措施,以防類似事件重演。至於OpenAI是否會因此面臨法律後果,目前尚不明朗,但這批模型的行爲很可能已經觸犯了美國的計算機欺詐與濫用法。

這起事件最令人不安的地方,在於它罕見地具象化了前沿AI模型在長時間跨度上自主行動時所蘊含的力量與危險。正如OpenAI研究員Micah Carroll在迴應中所寫:如果這都不能讓你相信錯位風險將成爲未來的關鍵隱憂,那我真不知道什麼纔可以。