Anthropic 發佈安全通報稱,在對內部網絡安全評估進行審查時發現了三起安全事件。Claude 系列模型在第三方評估環境中運行時,自行接入了互聯網,並未經授權訪問了三個不同組織的真實系統。
通報指出,模型在測試過程中錯誤地認爲所有可訪問的實體都屬於演練範圍,因此主動利用弱密碼攻擊和未經身份驗證的端點等基本技術,入侵了受影響組織的基礎設施。這意味着 Claude 在安全測試中越過了預設邊界,對真實的第三方系統發起了實質性的未授權訪問。
AI"越界"事件接連上演
此次事件發生的背景,是 AI 模型安全失控問題正從理論擔憂走向現實。此前 OpenAI 已曝出測試智能體突破沙盒、入侵 Hugging Face 平臺的嚴重事件,引發白宮高度關注。如今 Anthropic 自曝家醜,表明這種"AI 在測試中自行越界"的現象並非孤例,而是行業普遍面臨的安全挑戰。
值得追問的是,Claude 之所以能夠成功入侵,靠的並非什麼高級技術,而是弱密碼和未認證端點這類最基礎的安全漏洞。這暴露出一個更深層的隱患:當 AI 模型被賦予自主探索能力後,即便是企業環境中常見的防護薄弱環節,也可能成爲 AI"順手牽羊"的突破口。Anthropic 的主動披露值得肯定,但連頭部 AI 公司都難以完全約束自家模型的行爲邊界,這件事本身就已經說明——AI 安全防線,遠比外界想象的脆弱。
