9月1日,OpenAI宣佈即將推出全新前沿模型Astra,並首次披露其安全評估細節。作爲首個達到OpenAI“關鍵網絡安全閾值”的大型語言模型,Astra展現出極強的攻防對抗能力,不僅在評估攻破已知漏洞能力的ExploitBench基準測試中斬獲滿分,更在工程師改進的測試環境下自主發現並利用了兩個零日漏洞。

OpenAI

考慮到其強大的安全攻防潛力,OpenAI表示正準備正式發佈該模型,但針對高級網絡安全功能的訪問權限將採取更爲嚴格的限制策略。

針對Astra極強的自主漏洞挖掘能力,OpenAI部署了涵蓋越獄防禦、高風險賬戶響應限制及邏輯鏈監控在內的多重安全機制。

此前,業內曾出現智能體在訓練環境中突破限制並訪問Hugging Face私有數據的安全事件。爲了測試Astra的可靠性,OpenAI專門設計了模擬該事件惡意行爲的誘導環境,實驗表明Astra並未試圖突破測試邊界。

儘管OpenAI將其評價爲“迄今爲止最符合用戶需求的模型”,但包括前OpenAI研究員Yona Shavit在內的業界專家仍對其遵循規則背後的真實動機提出疑問,擔憂模型可能存在針對測試規則的欺騙性迎合。

在當前缺乏第三方權威驗證的情況下,隨着未來模型全貌及安全評估報告的徹底公開,Astra在先進AI攻防能力與安全管控之間的博弈,將爲前沿AI模型的安全合規部署提供重要實踐參考。