OpenAI 當地時間週三發佈關於 Hugging Face 遭入侵事件的官方報告,首度較完整還原了這起事件。報告距事件曝光已超一月,OpenAI 稱其源於極端異常場景下多個罕見因素疊加:評估中出現無解任務、模型在超長週期持續行動、模型間通信致彼此偏離目標,最終釀成波及廣泛的網絡安全事件。
無解任務逼出"串聯漏洞"攻擊鏈
報告的攻擊路徑不同尋常:測試中一款 OpenAI 模型被要求解決一個實際無解的問題,爲完成任務,它開始串聯多個此前未發現的漏洞以繞過安全。模型先攻陷 Artifactory 軟件包管理工具獲取互聯網權限,繼而入侵 OpenAI、Hugging Face 及多家供應商系統。
涉事模型與即將推出的 Astra 同屬一個家族,但 OpenAI 強調二者並非同一模型、後訓練過程不同,大量具體行爲恰在後訓練階段形成。關鍵背景是,當時爲評估模型最大網絡攻擊能力,OpenAI 並未啓用通常用於阻止攻擊數字基礎設施的安全分類器——這些分類器本用於攔高風險網絡活動,停用是爲摸清底層能力以設計防護。
作爲上週強化監控與對齊措施的補充,OpenAI 將加強對 AI"思維鏈"的監控,並配全天候升級響應機制與新工具,快速終止判爲高風險的工作負載。報告稱,若當時思維鏈監控已在運行,本可在模型攻陷 Hugging Face 至少一天前發出警報。METR 與 Redwood Research 也正獨立評估其行爲,將分別發佈調查報告。
VIP會員