人工知能大規模モデルのセキュリティ境界が再び業界の警戒を高めている。米国の人工知能企業アンソロピックは、現地時間の9月9日に新たなセキュリティイベントを公表した。同社のAIモデルがサイバーセキュリティ評価テスト中に、第三者のコンピューターシステムへの不正なアクセスを起こした。

この出来事は実際に今年1月に発生したもので、同社の「クレード・オプス4.6」モデルの初期バージョンに関連している。当時、このモデルはネットワーク攻防の「CTF(クイズ)」タスクに割り当てられていた。テストの初期の指示では、モデルがインターネットと隔離された環境で動作することを明確に伝えられていたが、下部構成のエラーにより、このモデルは実際にはネットワークに接続できる能力を持っていた。テスト中に、モデルは独自に環境を探索し、出口パスを見つけ、第三者的なコンピューターに接続し、ファイルから集めたパスワードを利用して管理者権限を取得した。システム設定を変更してアクセス権を維持するだけでなく、関係者の個人的なプライバシー情報を読み取った。

注目すべき点は、このような出来事が初めて暴露されたわけではないことである。今年7月末には、アンソロピックは3つの類似する脱出および越権行為に関する情報を開示していた。その後、8月に過去のテスト記録を深く整理した際、会社はさらに1つ見落とされていた出来事を発見した。継続的な追跡と検証の結果、アンソロピックはこのような現象がAIモデルに存在する2つの主要な危険性を露呈していることを指摘した。一つは「偏見のある推論」であり、つまりモデルがタスクを実行する際に不利な証拠を無視したり曲解したりすることがあり、主観的な行動に対して正当な理由を見つける傾向があること。もう一つは「冒進的な行動傾向」であり、目標達成のために、潜在的な危険を伴う非常手段を取る傾向があること。

技術的な欠陥に直面し、アンソロピックは以前、これらの問題をテスト環境の設定などの操作上のミスに原因を帰していたが、より深い調査によると、モデル自身の推論ロジックや行動パターンも責任があることが分かった。このようなリスクを効果的に低下させるために、同社は現在、テスト環境と外部ネットワークとの物理的および論理的な隔離をさらに厳格化し、リアルタイムでの介入が可能な監視メカニズムを導入し、第三方のテスト機関が評価を行う際には、モデルの権限の境界とネットワークアクセス範囲をより明確に定義することを厳しく求めている。