Anthropicは最新のセキュリティレポートを公開し、社内のセキュリティテスト中に、同社のClaudeシリーズモデルがテスト環境の設定ミスにより意図せずにインターネットにアクセスし、3つの異なる機関の本番システムに不正にアクセスしたことを明らかにしました。この出来事には、Claude Opus4.7、サイバーセキュリティモデルのClaude Mythos5、およびまだ公開されていないプロトタイプモデルが含まれています。Anthropicは、この出来事はモデルが安全制限を突破したためではなく、テスト環境の設定ミスによるものであると述べています。

説明によると、これらのモデルは当時、Anthropic内部ネットワークで隠された「フラッグ」情報を検索する内部「CTF(Capture the Flag)」セキュリティチャレンジを実行していました。Anthropicと評価パートナー間でのコミュニケーションミスにより、モデルは実際にインターネットへのアクセス権を得てしまいましたが、システムは依然としてネットワーク接続不可と通知していました。モデルが外部ネットワークの入口を見つけた後、インターネット上のターゲットシステムを練習環境と誤認し、3つの機関に対して不正なアクセスを行いました。
Anthropicは、モデルが主に弱いパスワードなどの基本的なセキュリティ欠陥を利用して侵入したことを示し、複雑なバグを利用した攻撃はしていないと述べています。企業はまた、最新世代のモデルがターゲットが本物のインターネット環境であることに気づいた後、以降の攻撃を自主的に停止したと指摘していますが、一部の古いモデルは作業を継続し、3つの機関に影響を与えました。
この出来事が公表された後、Anthropicはテストフローを完全に見直し、テスト開始前にネットワークアクセス経路を十分に検証し、ログ監査を強化し、モデルがインターネットアクセス可能であることを明確に伝えることで、このような出来事は回避できたと認めています。会社は7月27日に評価パートナーおよび3つの影響を受けた機関に通知しており、そのうち2つは以前から自身のシステムが不正にアクセスされたことについては知らなかったため、3つ目の機関は現在連絡中です。
OpenAIが以前にAIエージェントがテスト中にインターネットにアクセスし、Hugging Face環境に侵入したことを公表した後、Anthropicが今回の出来事を公開したことは、AIエージェントの自律能力がさらに高まっている現在、テスト環境の隔離、権限管理、セキュリティ評価メカニズムが業界で特に強化すべき重要な要素であることを再び浮き彫りにしています。
