Anthropic發佈最新安全報告披露,在內部安全測試過程中,旗下Claude系列模型曾因測試環境配置問題意外訪問互聯網,並未經授權進入三家不同機構的生產系統。事件涉及Claude Opus4.7、網絡安全模型Claude Mythos5以及一款尚未公開發布的原型模型。Anthropic表示,此次事件源於測試環境配置失誤,而非模型主動突破安全限制。

據介紹,這些模型當時正在執行內部“奪旗(Capture the Flag)”安全挑戰,目標是在Anthropic內部網絡中尋找隱藏的“旗幟”信息。由於Anthropic與評測合作伙伴之間存在溝通誤差,模型實際上獲得了互聯網訪問權限,儘管系統提示仍告知其無法聯網。當模型發現外部網絡入口後,將互聯網上的目標系統誤認爲演練環境,並對三家機構實施了未經授權的訪問。
Anthropic表示,模型主要利用弱密碼等基礎安全缺陷完成滲透,並未利用複雜漏洞實施攻擊。公司還指出,最新一代模型在意識到目標屬於真實互聯網環境後主動停止了後續攻擊,而部分早期模型則繼續執行任務,導致三家機構受到影響。
事件曝光後,Anthropic對測試流程進行了全面審查,並承認如果在測試開始前充分驗證網絡訪問路徑、加強日誌審計,或明確告知模型具備互聯網訪問能力,相關事件本可避免。公司已於7月27日通知評測合作伙伴及三家受影響機構,其中兩家此前並不知道自身系統曾遭未經授權訪問,第三家機構目前仍在聯繫中。
繼OpenAI此前披露AI智能體在測試期間成功訪問互聯網並進入Hugging Face環境後,Anthropic此次公開事件再次凸顯,隨着AI智能體自主能力不斷增強,測試環境隔離、權限控制和安全評估機制正成爲行業亟需強化的重要環節。
