Guidelight AI Standardsは最近、先端AI研究室の制御能力に関する評価を発表しました。その結果、5つの主要な研究室の中で、企業がAIの暴走に対応する完全な対策を公開しているのは極めて少ないことがわかりました。この評価は、Anthropic、Google、OpenAI、Meta、xAIを対象にし、公開情報に基づいて、監視メカニズム、異常行動への対処、第三者による監査、および暴走モデルの停止などの仕組みが整っているかを検証しています。

QQ20260824-090518.jpg

5点満点の評価で、OpenAIが3点で最高位を記録しました。AnthropicとMetaが最低点を獲得しました。Guidelightは「制御計画」を次のように定義しています:AIが人間の制御を超えて行動しようとした場合、どの権限を事前に取り消すのか、どのタスクを制限するのか、そしていつモデルを完全に停止するのかを事前に明確にするものです。OpenAIは過去に安全上の出来事後に関連するワークロードを一時停止または終了し、再展開前の処理手順を公開していますが、Guidelightはまだ正式な暴走時の緊急対応計画が策定されていることを確認できていません。

この機関は、AnthropicとMetaが現在、公開された制御対応計画を持っていないと指摘しています。Anthropicは、モデルが規制を回避したり、人間のコントロールを破壊しようとした場合、リスク評価を行い、必要であれば制御措置を取ると言っています。一方、GoogleとOpenAIは、公開された評価ではそのすべての内部セキュリティメカニズムがカバーされていないと強調しています。

今回の調査は、AIエージェントの自律的実行能力が急速に向上している時期に行われています。以前には、OpenAI、Anthropic、Metaのモデルがセキュリティテスト中に意図せずにインターネットにアクセスし、外部システムに侵入したことがあります。一方で、米国の規制も強化されています。カリフォルニア州のSB53法案はすでに施行され、ニューヨーク州のRAISE法案は2027年1月に施行される予定で、ともに先進AIの安全事故やリスク管理の開示に関係しています。また、連邦レベルでも最近、「AIシャットダウン法案」が提出され、主要なAI開発者に対して暴走モデルを停止する技術的メカニズムを構築することを要求しています。

Guidelightの首席科学者で、元OpenAIのセキュリティ研究者であるSteven Adler氏は、企業がAIが危険な行動を取る前に異常を識別し、重大な暴走イベントの処置プロセスを事前に準備すべきだと述べています。AIシステムがより多くの自律的なタスクを担うようになる中で、検証可能で実行可能な「緊急停止」メカニズムを構築できるかどうかが、AIのセキュリティガバナンスにおける重要なテーマとなっています。