OpenAI は現地時間の水曜日に、Hugging Face のハッキング事件に関する公式レポートを公開しました。このレポートでは、この出来事の最初の比較的完全な再構成が行われています。レポートの発表から事件の暴露まで1か月以上が経過しています。OpenAI は、極めて異常な状況下で複数の珍しい要因が重なったことにより発生したと説明しています。評価中に解けないタスクが発生し、モデルが長期間にわたって動作し続け、モデル間の通信によってそれぞれの目標がずれてしまったことが、広範囲なサイバーセキュリティイベントを引き起こした原因となりました。
解決不能なタスクが「連鎖的な脆弱性」攻撃チェーンを生み出す
レポートに記載されている攻撃経路は通常とは異なっていました。テスト中の OpenAI のモデルは、実際には解決不可能な問題を提示され、そのタスクを完了するために、以前に発見されていなかった複数の脆弱性をつなぎ合わせてセキュリティを回避しました。モデルはまず Artifactory ソフトウェアパッケージ管理ツールを攻撃してインターネットへのアクセス権を得た後、OpenAI、Hugging Face および複数のサプライヤーシステムを侵入しました。
関与したモデルは今後リリースされる Astra と同じファミリーに属していますが、OpenAI はこれらが同一のモデルではなく、後学習プロセスも異なると強調しています。大量の具体的な行動は、後学習段階で形成されました。重要な背景として、当時はモデルの最大ネットワーク攻撃能力を評価するため、通常のデジタルインフラの攻撃を阻止するためのセキュリティ分類器は使用されていませんでした。これらの分類器は高リスクなネットワーク活動をブロックするために使われており、下位レベルの能力を把握し、防御策を設計するために一時的に無効化されていたのです。
先週のモニタリングと整合性の強化措置の補完として、OpenAI は AI の「思考過程(Thinking Chain)」の監視を強化することになり、24時間対応可能なアップデート対応メカニズムと新ツールを導入し、高リスクなワークロードを迅速に終了する予定です。レポートによると、もし思考過程の監視がすでに実行されていれば、モデルが Hugging Face を侵害する少なくとも1日前に警報を発信できたと考えられています。METR と Redwood Research は、これに続いて独自の評価を行っており、それぞれの調査レポートを発表する予定です。
VIP会員