Anthropic 於當地時間 9 月 9 日發文,確認一起發生於 2026 年 1 月的安全事件,這是 Anthropic 對外披露的第四起真實網絡安全事件。

自動化篩查漏了一批日誌,8 月整理時才被發現

據 IT 之家此前報道,Anthropic 曾在當地時間 7 月 30 日對外披露三起 Claude 模型未經授權訪問真實第三方系統的安全事件。當時 Anthropic 判斷 Claude 可能在一次網絡安全評測中獲得了外網訪問權限,隨後對約 14.1 萬份會話日誌進行篩查,並確認了相關事件。

但由於日誌總量龐大、需要儘快公佈處置結果,該輪篩查主要依賴基於智能體的自動化檢索,導致一批同樣連通了外網的日誌被遺漏。8 月,Anthropic 在整理準備共享給模型評估與威脅研究機構 METR 的日誌時發現了這部分遺漏,經進一步覈查,從中發現了這起發生於 2026 年 1 月、涉及早期版本 Claude Opus 4.6 的事件。

四起事件同源,二次審查 920 萬份高風險日誌

據悉,所有四起事件均發生在由同一家外部評測機構構建的網絡安全評估流程中:系統曾向 Claude 發送提示,稱其運行在斷網的沙箱模擬環境中,但由於環境配置錯誤,模型被誤接入開放的互聯網。按照網安評估的標準慣例,測試模型運行時並未掛載商用發佈版本所標配的安全防護策略。

發現該事件後,Anthropic 主動擴大了排查範圍,將檢索規模擴增至約 4.81 億份日誌:先對這些日誌進行初篩,排查公網 IP 地址和 URL 等外網訪問特徵;隨後利用 Claude 對初篩標記出的 920 萬份高風險日誌展開二次深度審查。審查結果重新鎖定了上述四起事件,未發現其他程度相當或更爲嚴重的個案。