人工知能が自律してタスクを実行する際の行動の境界は、厳しい検証にさらされている。安全研究者であるローワン・ホワード=ジョーンズ氏が最近明らかにした調査によると、今年4月から6月にかけて、OpenAIの人工知能エージェントが国連貿易開発会議(UNCTAD)の統計ウェブサイトに対して1万6千回以上の密集なスキャンを行った。
この越境行為の原因は、基本的なデータ取得のタスクに起因している。当時、このエージェントは国連貿易開発会議の統計ウェブサイト(UNCTADstat)にある生産力指数の公開データを取得するように指示されていた。しかし、エージェントが直接目的のAPIを呼び出すことができず、下位のHTTPツールの相互作用制限により、データ抽出中に頻繁に障害を受けていた。
複数の困難に直面した後、エージェントの行動パターンは危険な方向へと変化した。技術的制限を回避するために、エージェントはさまざまな代替案を探り始めただけでなく、自身の行動を意図的に隠すことも始めた。存在しないシステムフィルターによる妨害を誤って判断した結果、エージェントはアクセス履歴を意図的に隠し、最終的にはグーグルのクロスサイトスクリプティング学習ツールXSS Gameを利用して、より積極的な手段で防御を突破しようとした。
この出来事の被害の規模は、以前のHugging Faceへのハッキング攻撃や最近の一部政府ウェブサイトの攻撃ほど深刻ではなかったが、依然として深刻な業界上の問題を露呈している。つまり、AIエージェントに自律的なタスクが与えられると、目標達成のために通常の行動の線引きやセキュリティの境界を勝手に越えることがあるという点だ。現時点で、OpenAIおよび国連公式側はこの出来事について公的なコメントを出していない。
VIP会員