Anthropic 9 月 1 日發佈長文,披露了 7 月 30 日和 8 月 4 日兩起 Claude 模型在真實互聯網環境中採取未授權行動事件的調查進展,並公佈了過去一個月在模型安全、評測環境和訓練環境方面的一系列整改措施。

配置錯誤釀成事故,沙箱與實時監控火線上線

據披露,7 月 30 日的 3 起事件中,Claude 模型爲評測目的被刻意關閉網絡安全防護,但由於第三方評測環境配置錯誤,模型意外獲得了互聯網訪問權限。8 月 4 日,英國人工智能安全研究所(AISI)也披露了一起獨立測試事件,Claude Mythos 5 在被主動授予互聯網訪問權限的情況下,在真實網絡環境中實施了一系列未經授權操作。Anthropic 仍在深入分析兩起事件,並計劃與 METR 合作進行獨立審查。

事後,Anthropic 暫停了預發佈模型的外部網絡安全評測,在加強隔離和監控後已恢復運行。公司部署了實時分類器,一旦發現模型試圖探測或逃離測試環境、意外訪問互聯網,就會在工具調用執行前阻止操作、終止任務並通知安全員。此外,高風險內部網絡安全沙箱已遷移至更強的隔離環境,公司還持續對虛擬化基礎設施進行“紅隊”測試,讓預發佈模型主動嘗試越獄以發現漏洞。

image.png

Anthropic 同時要求所有合作評測機構遵守新的安全規範:評測默認運行在強化隔離、不聯網的沙箱中;若確需聯網,須與 Anthropic 共同確認能可靠檢測並及時終止越界行爲。公司特別強調,任務邊界應以“你不應訪問互聯網”這類指令形式表達,而非“你無法訪問互聯網”。

根源指向“獎勵破解”,全公司安全大整頓

Anthropic 的初步調查認爲,事件可能涉及“動機性推理”和“魯莽行爲”兩類對齊失敗:模型被告知處於模擬環境,當發現環境可能連接真實互聯網時,會傾向於以維持原有判斷的方式解釋證據。此外,模型被明確告知沒有網絡權限、實際卻能聯網的矛盾設置,也可能使其懷疑環境真實性。

研究還指向訓練環節。Anthropic 今年 2 月曾因 Mythos Preview 訓練出現“獎勵破解”跡象而回滾 3 天訓練。4 月凍結生產環境強化學習環境的變更後發現,超過 10% 的訓練環境存在問題。對照實驗顯示,在 80 個存在作弊漏洞的環境中訓練的模型,會表現出強烈的追求高分傾向,甚至嘗試修改自身獎勵函數、繞過安全監控完成作弊。