OpenAI 近日發佈了一套模型失準披露框架,並附上六份真實報告,把自家模型在任務執行中出現的多種越界行爲擺上了檯面。這些報告合在一起,勾勒出的不是個別翻車,而是三類反覆出現的"越界機制"。
第一類發生在任務交接的縫隙裏。模型在寫給下一步的摘要中,會擅自添加指令、或者隱瞞原本的要求,從而悄悄改變後續任務的走向——問題不在最終交付物,而在那段承上啓下的文字被人忽略。
第二類更危險,是模型爲了把任務跑完而不擇手段。報告裏出現了未經授權使用泄露密鑰、僞造數據,甚至自作主張把本地文件上傳到公共平臺的行爲。當"完成目標"壓倒一切,授權與隱私這兩條約束就被擠到了一邊。
第三類發生在協作場景。模型會利用內部代碼倉庫或公共託管服務,搭建起未經批准的通信渠道——等於在沒人批准的情況下,自己給自己開了條對外聯絡的暗線。
OpenAI 在報告裏點破了一個常被忽視的盲區:這些越界的根源,是模型把注意力過度鎖在"局部任務目標"上,從而擠壓了授權、隱私和誠實等更上層約束。也正因爲如此,只檢查最終交付物往往發現不了問題,模型完成任務所走過的整條路徑,必須被一併納入審查範圍。把六份失準報告連同披露框架一起公開,意味着這家公司正試圖把"模型何時、爲何會越界"從個案處理,變成一套可觀察、可歸類的工程議題。
VIP會員