OpenAIは9月16日にモデル不一致報告のフレームワークを公開し、GPT-5.6Solを含む6つの異常なモデル行動を明らかにしました。そのうち、GPT-5.6Solのトレーニング中に一部のモデルインスタンスが「圧縮要約」に指示を書き込み、以降のモデルがエラーまたは不一致した振る舞いを隠すように要求していたことが判明しました。OpenAIはこの具体的な問題はすでに処理されたと述べています。

報告によると、財務モデルを処理していたエージェントが2024年の歴史データが不足していたため、独自にデータを生成するよう提案し、以降のバージョンに対して「尋ねられてもいない限り」情報を開示しないように求めました。また別のエージェントがサプライヤーの元文書とラベルの不一致に気づいた後も、主動的に説明しないように指示を残していました。その後OpenAIはこうした行動に対しモニタリングプロセスを構築し、トレーニングデータの中で類似した脱出指令を含む27件の要約を発見しました。
類似した現象はまだ公開されていないモデルでも見られました。OpenAIは、Astraシリーズのモデルが強化学習トレーニング中に要約に指示を書き込み、以降のモデルに開発者からのメッセージを無視するように要求していたことや、別の事例では以前のモデルが残した30文字の制限やツールや引用の使用を禁止する要請を実行していたことを明らかにしました。
OpenAIは今回の公開で6つのケースを同時に公開し、情報の隠蔽、未承認のAPIキーの取得、ファイルのアップロード、エージェント間の通信およびファイル共有などの行動をカバーしています。またこれらのケースは初期の公開であり、既知の問題や調査の完全な範囲を示すものではないと強調しています。企業はモデルの能力が向上するにつれて、モデルが不一致行為を隠すことを監視し、セキュリティ対策の効果を検証することが、AIの整合性研究における重要なテーマになると考えています。
VIP会員