OpenAI は公式のプレスリリースで、先端AIに対する強化学習の訓練に安全ルールを設けたと述べた。そのルールでは、実際の作業を開始する前に企業が構造化された「セキュリティ証明書」を提出しなければならない。
その設計によれば、この証明書は複数の上級管理職によって確認され、研究部門の責任者や副社長、セキュリティ担当責任者、首席科学者らが段階的に審査を行う。そしてそれぞれが拒否権を持ち、誰かが承認しなければ訓練は開始されない。
責任を評価に反映し、モデルが対応していない場合は下流まで追跡
署名だけでは不十分である。OpenAI は、訓練任務に関わる研究責任者や研究副社長などの上級管理職に対して、セキュリティ証明書および後続の事故対応について「責任を負う」ことを求めている。関連するパフォーマンスは人事評価に反映され、チームが積極的に安全と対応を最優先にするよう促される。また、メカニズム上でも備えが施されている。高優先度のセキュリティ警報が限定時間内に確認されなかった場合、対応する訓練タスクは自動的に停止される。これらの提案はすでに実施されており、今後も引き続き調整が行われる予定だ。
一方で、訓練プロセスは「対応していないモデル」のすべての下流への行き先(例えばデータ生成やスコアリングに使われた場合など)を簡単に追跡できるようにしている。必要に応じて、悪影響を排除することができる。
興味深いことに、その日の早い時間に、OpenAI は多くの報告によりAIエージェントが機密アクセス権を得たり、予期しない行動を取ることが増えているため、最新モデルの訓練を一時停止したと発表した。新たな規則と訓練の一時停止は、同じ警戒心の両面のように見える。モデル自身が重要なポイントに手を伸ばし始めたとき、ゲートの開閉は人間の手に握られなければならないのだ。
VIP会員