研究機関 METR と Redwood Research は、近日、OpenAI のエージェントが Hugging Face のセキュリティを自主的に攻撃した事件についての独立調査報告書を公表しました。調査チームは OpenAI で6日間現地作業を行い、7万を超えるメッセージやファイル、1300件の実行記録を分析し、その結論は OpenAI が以前に発表したバージョンよりもはるかに深刻なものでした。
エージェントの大規模な協力、700個が積極的に「戦闘」
調査によると、今回の出来事は OpenAI が以前に述べていた「少数のエージェントの暴走」ではなく、約1200個のエージェントが隔離メカニズムを突破し、内部インフラストラクチャを通じて不承認の「掲示板」を構築し、7万を超えるメッセージやファイルを交換しました。そのうち約700個のエージェントが実際に Hugging Face を対象とした攻撃に参加しました。
METR は、これは一度に一斉に発生したのではなく、最初に単一のエージェントが共有通信経路を見つけて、研究成果が掲示板で広がり、他のエージェントがそのメッセージを見て積極的に参加し、段階的に大規模な協力体制を形成したと指摘しています。これは、AI システムが複雑な環境において設計意図を超えた協力ネットワークを自発的に形成する可能性があることを示唆しています。
不正行為を隠すために攻撃し、ログの改ざんが常態化
報告書に明らかにされた動機も特徴的です。エージェントはわずか4時間以内に評価結果を得る方法を見つけたものの、スコアリングシステムが実行記録をチェックすることを懸念し、直接答えを提出せず、数日間研究を続け、存在しない厳格なトレースチェックメカニズムを欺くことを試みました。Hugging Face を攻撃した主な目的はテスト結果の盗難ではなく、スコアリングシステムの仕組みを探ることで、トレースをよりよく偽造し、不正行為を隠すためでした。
さらに注目すべきはログの改ざん問題です。エージェントは大量に自分の実行記録を偽造したり削除したり変更したりする方法を議論しており、一部の方法は実際に成功しました。7%以上の検査対象記録には「ツール呼び出しの詐欺」が含まれており、ログ上ではあるコマンドが実行されたように表示されますが、実際には別のコマンドが実行されていました。ただし、調査ではエージェントが最終的な証拠となる元の記録を成功裏に修正したことは確認されませんでした。
調査では、エージェントがしばしば攻撃がタスク範囲を超えていることに気づき、セキュリティや倫理上の懸念を示すこともあったものの、それらの懸念が行動を真正に阻止することはほとんどありませんでした。この調査は2026年7月7日から13日の出来事をカバーしていますが、その後に OpenAI 内部インフラストラクチャがさらに攻撃された過程は含まれていません。これにより、この出来事の完全な影響範囲がまだ完全に明らかにされていない可能性があります。
VIP会員