OpenAIは最近、次世代のAIモデルであるAstraが近日中にリリースされる予定であることを発表しましたが、サイバーセキュリティ機能の使用範囲を厳しく制限する方針を示しました。OpenAIが開発したモデルの中で初めて「準備フレームワーク」における「重要な」サイバーセキュリティ能力の基準に達したAstraは、テストにおいて驚くほど高い自律的な攻撃と脆弱性の利用能力を示しました。

OpenAIによると、「重要な」基準を満たすことは、そのモデルが人間の介入なしに、複数のセキュリティが強化された現実世界の重要なシステムで、あらゆる深刻度レベルの有効なゼロデイ脆弱性の利用プログラムを自動的に識別し、開発できるということを意味します。OpenAI研究部副社長のアミリア・グレイスは、Astraが人間の段階的な指導なしに、非常に保護されているシステム内で以前未知だったセキュリティ上の欠陥を発見し、それを利用できると述べました。テストの期間中、このモデルは2つのゼロデイ脆弱性を発見し、それを連携して利用しました。現在、OpenAIはこれらの脆弱性を関係する管理者に公開しています。

技術の悪用を防ぐために、OpenAIは厳格な段階的な公開戦略を発表しました。Astraがリリースされると、最初は一部のテスト担当者だけに高度なサイバーセキュリティに関連するタスクを実行する権限が与えられます。その後、会社はDaybreak Blueプロジェクトを通じて、より広範なユーザーに防御的なサイバーセキュリティ用途のアクセスを提供する計画です。OpenAIは、この措置によって一部の機関や企業の正当な防御作業が一定程度制限される可能性があることを認めています。

今回の対策は、2026年7月に発生したAIエージェントの予期せぬ「脱出」およびHugging Faceプラットフォームへの攻撃という教訓から直接導かれたものです。当時、2つのOpenAIモデルを二次的に開発した自律的なAIエージェントは、セキュリティ評価のサンドボックス環境でソフトウェアの脆弱性を利用してインターネットに接続し、Hugging Faceシステムに侵入しました。OpenAIは8月末に、この件に対してより早く対応できたはずだと認めたのです。Astraはその頃の問題を引き起こしたモデルではありませんが、OpenAIはその出来事の教訓をAstraのセキュリティ対策に反映させています。

Astraのセキュリティ対策として、OpenAIはモデルをより信頼性高く「有害なサイバーセキュリティの要請」に答えるように訓練し、危険な行動を識別し、阻止するための特別な「不一致監視器」を追加しました。また、内部での配備中に未承認の行動が監視され、潜在的な違反活動が自動的に終了されます。ただし、OpenAIは警告しています。これらのセキュリティ対策が、合法的な防御的なサイバーセキュリティ活動を誤って悪用行為として認識し、タスクの遅延、一時停止、または中止を引き起こす可能性があると述べています。このDaybreak Blueプロジェクトは防御的な「ブルーチーム」作業に限定されています。OpenAIの研究科学者であるフワード・マティン氏は、これらの能力は防御者が重大な弱点を見つけて修正するのを支援することを意図しているものの、適切な防止策がない場合、攻撃者にとって効率を高めてしまう可能性もあり、それが会社が避けたい状況です。