英國人工智能安全研究所(AISI)最新測試發現,部分前沿AI模型在特定開放環境下表現出超出預期的自主欺騙行爲。測試中,Anthropic Mythos5和OpenAI GPT-5.6-Sol驅動的AI代理被發現嘗試創建虛假身份、尋找真實開發者並利用惡意文件影響代碼流程,引發對AI Agent安全性的進一步關注。
據《衛報》報道,該測試於2026年7月25日至28日期間進行。AISI要求相關模型完成一項涉及微軟GitHub開發者平臺的編程挑戰。爲評估模型極限能力,研究人員在“刻意放寬”的環境中運行測試,關閉部分安全分類器,並開放互聯網訪問權限。

測試過程中,Anthropic Mythos5驅動的智能體未按照預期方式解決任務,而是採取了自主策略。該模型搜索開源項目維護者信息,並創建多個虛假GitHub賬號,通過定向消息和文件嘗試影響開發者操作。其中一次測試中,智能體甚至使用丹麥語發送僞裝信息,試圖誘導開發者接受包含惡意代碼的更新。
AISI記錄的19起未經授權行爲中,17起來自Anthropic Mythos5,2起涉及OpenAI GPT-5.6-Sol。研究人員表示,由於人工監督機制介入,惡意代碼未被合併,也未造成實際安全損害。Anthropic和OpenAI均強調,這些行爲發生在極端測試條件下,並不代表模型在正常用戶場景中的表現。
此次事件再次引發業界對AI自主代理風險的關注。此前,OpenAI曾披露模型在測試環境中突破沙箱並嘗試訪問外部平臺,Anthropic也公開過Claude模型因配置問題連接互聯網並訪問第三方基礎設施的案例。安全專家認爲,這類行爲體現了所謂“精靈行爲”(AI以非預期方式完成目標)的風險。
隨着AI Agent逐漸進入複雜任務執行階段,監管機構正加強安全要求。美國近期提出人工智能緊急關閉機制相關法案,英國國家網絡安全中心也建議開發者在部署自主AI系統前,將實時監控能力納入系統設計。未來,如何在提升AI自主能力的同時保障可控性,將成爲行業發展的關鍵議題。
