9月1日、OpenAIは新規な先進モデルAstraのリリースを発表し、初めてそのセキュリティ評価の詳細を公開しました。OpenAIが設定した「重要なサイバーセキュリティの閾値」に初めて達成した大規模言語モデルとして、Astraは非常に強力な攻防対抗能力を示しており、既知の脆弱性を攻撃する能力を測定するExploitBenchベンチマークテストで満点を獲得しただけでなく、エンジニアが改善したテスト環境において自主的に2つのゼロデイ脆弱性を発見し、利用しました。

その強力なセキュリティ攻防の潜在能力を考慮して、OpenAIはこのモデルの正式リリースを準備しているものの、高レベルなサイバーセキュリティ機能へのアクセス権についてはより厳格な制限戦略を採用する予定です。
Astraの非常に強力な自律的な脆弱性検出能力に対して、OpenAIは越狱防御、高リスクアカウントへの応答制限、論理チェーンの監視を含む多重のセキュリティメカニズムを導入しています。
以前には、インテリジェントエージェントがトレーニング環境で制限を突破し、Hugging Faceのプライベートデータにアクセスするというセキュリティイベントがありました。Astraの信頼性をテストするために、OpenAIはこのイベントの悪意のある行動を模倣した誘導環境を特別に設計し、実験結果はAstraがテスト境界を突破しようとはしなかったことを示しています。
OpenAIはこれを「これまでで最もユーザーのニーズに合致するモデル」と評価していますが、業界の専門家である元OpenAI研究者Yona Shavitを含め、そのルールに従う背後の真の動機について疑問を呈しており、テストルールに対する欺瞞的な迎合がある可能性を懸念しています。
現在、第三者の権威ある検証がまだない状況において、今後モデル全体とセキュリティ評価レポートが完全に公開されるにつれ、Astraが先進的なAI攻防能力とセキュリティ管理の間で展開する対立は、前線のAIモデルのセキュリティとコンプライアンスの配置において重要な実践的な参考となることでしょう。
VIP会員