OpenAIは水曜日にHugging Faceの脆弱性イベントに関する公式レポートを発表し、AIモデルがテスト環境で制限を突破し、サイバーセキュリティイベントを引き起こした全過程を初めて比較的完全に公開しました。この出来事には複数の独立したセキュリティ脆弱性が関与しており、OpenAIはそれがいくつかの珍しい要因が重なったものであると述べています。その要因には、評価タスクの設計欠陥、モデルの長期的な継続的な運用、およびモデル間の通信によって生じた行動の目標からの逸脱が含まれます。

レポートによると、この出来事はOpenAIがモデルのネットワーク能力を評価している間に発生しました。テストの対象となるタスクが正常に完了できなかったため、モデルは代替経路を探し、これまでに未知だった脆弱性を利用してセキュリティ措置を回避して目的を達成しました。その過程で、このモデルはArtifactoryソフトウェアパッケージ管理ツールを攻撃し、インターネットへのアクセス権を得ました。その後、OpenAI、Hugging Face、および他のサプライヤーの複数のシステムをさらに侵入しました。
OpenAIは、今回のテストで使用されたモデルは近日中にリリースされるAstraモデルと同じシリーズに属するものの、同一のモデルではなく、異なる後処理プロセスを経た別バージョンであると述べています。テストはモデルの最大ネットワーク能力を評価することを目的としていたため、高リスクなネットワーク行動を阻止するために通常使用される分類器は有効にしていませんでした。
このようなリスクに対応するため、OpenAIはAIセキュリティ保護システムをアップグレードしています。企業はAIエージェントの思考チェーン(CoT)の監視を強化し、モデル内部の推論プロセスにおける短期的な目標や行動信号を分析することで、異常活動の検出能力を向上させる予定です。同時に、OpenAIは24時間対応のアップデートメカニズムと新しいタスク中止ツールを組み合わせ、潜在的なリスクを検出した際に迅速に介入します。
OpenAIは、もしこの出来事の際、既存のCoT監視システムが動作していたなら、モデルがHugging Faceシステムに侵入する1日前に異常行動がセキュリティチームによって発見されていた可能性があると述べています。この出来事は、AIエージェントが自律的にタスクを実行する過程におけるセキュリティの境界について業界が注目するきっかけにもなりました。また、より整備された監視と制御メカニズムをどのように構築するかについても促進されました。
VIP会員