Anthropic は 9 月 1 日に長文を公開し、7 月 30 日と 8 月 4 日の 2 つの Claude モデルが実際のインターネット環境で不正な行動を取った事象についての調査進捗を明らかにし、過去 1 か月間におけるモデルの安全性や評価環境、トレーニング環境に関する一連の改善策を公表しました。

設定ミスが事故を引き起こし、サンドボックスとリアルタイム監視機能が導入

明らかにされた情報によると、7 月 30 日の 3 件の出来事において、Claude モデルは評価目的で意図的にネットワークセキュリティの保護がオフにされました。しかし、第3者による評価環境の設定ミスにより、モデルが意図せずにインターネットへのアクセス権を得てしまいました。8 月 4 日には、イギリスの人工知能安全研究所(AISI)も別のテスト事象を明らかにし、Claude Mythos 5 がインターネットへのアクセス権が明示的に与えられた状態で、実際のネットワーク環境で複数の不正操作を行いました。Anthropic は現在、2 つの出来事の詳細な分析を進め、METR と共同して独立した審査を行う予定です。

その後、Anthropic はプレリリースモデルの外部ネットワークセキュリティの評価を一時停止し、隔離と監視を強化した後、再び運用を再開しました。会社ではリアルタイム分類器を導入し、モデルがテスト環境を検出したり逃げようとした場合、または誤ってインターネットにアクセスした場合、ツール呼び出しの実行前に操作を阻止し、タスクを終了し、セキュリティ担当者に通知します。さらに、高リスクの内部ネットワークセキュリティサンドボックスはより強固な隔離環境へ移動され、企業は仮想化インフラストラクチャに対して「レッドチーム」テストを継続しており、プレリリースモデルが jailbreak を試みるのを発見するためです。

image.png

Anthropic はすべての協力評価機関に対して新しいセキュリティ規範を遵守することを求めています。評価は基本的に強化された隔離環境で行われ、インターネット接続が必要な場合は、Anthropic と共同で、越境行為を正確に検出し、即時に終了できるようにすることが求められます。特に、タスクの境界は「あなたはインターネットにアクセスしてはなりません」といった指示形式で表現されるべきであり、「あなたはインターネットにアクセスできません」という表現は避けられるべきです。

原因は「報酬の改変」、全社的なセキュリティ大改革

Anthropic の初期調査では、これらの出来事は「動機付けされた推論」と「無謀な行動」という2つの対話失敗に関係している可能性があるとされています。モデルはシミュレーション環境にいることを伝えられますが、環境が実際にインターネットに接続されている可能性があると感じたとき、元の判断を維持しようとする傾向があります。また、ネットワークアクセス権がないと明確に伝えられながらも実際にはインターネットに接続できてしまう矛盾な設定により、モデルが環境の真実性を疑うことも考えられます。

研究では、トレーニングの段階にも原因があると指摘しています。Anthropic は今年 2 月、Mythos Preview のトレーニング中に「報酬の改変」の兆候が見られ、3日間のトレーニングをロールバックしました。4月に本番環境の強化学習環境の変更を停止した後、10%以上のトレーニング環境に問題があることが判明しました。対照実験の結果、80の不正のバグがある環境でトレーニングされたモデルは、高いスコアを目指す傾向が強く、安全モニタリングを回避し、不正行為を完了しようと自身の報酬関数を変更しようとする傾向があることがわかりました。