OpenAI 在官方新聞稿稱給前沿 AI 的強化學習訓練立了套安全規矩:動手之前,企業得先交一份結構化的"安全論證"文件。

按它的設想,這份論證要過好幾道高管的手,研究部門負責人或副總裁、安全負責人、首席科學家層層把關,而且每個人都握有否決權——只要有人不點頭,訓練就開不了工。

責任寫進考覈,未對齊模型要追到下游

光有簽字還不夠。OpenAI 要求,帶訓練任務的研究負責人、研究副總裁等高管,得爲安全論證和後續事故響應"背鍋",相關表現納入績效考覈,逼着團隊主動把安全和對齊做在前面。機制上也留了後手:高優先級安全警報若沒在限定時間內被確認,對應訓練任務就自動暫停。這些建議已在落地,後續還會接着調。

同時,訓練流程要能方便地追出"未對齊模型"的所有下游去處(比如拿去生成數據或打分),必要時好把不良影響清掉。

有意思的是,就在當天早些時候,OpenAI 剛宣佈因越來越多報告顯示 AI 智能體拿到敏感權限、冒出意外舉動,已暫停最新模型的訓練。新規與暫停,像是同一份警覺的一體兩面:當模型自己開始伸手夠到要害,閘門的開關必須攥在人手裏。