北京時間 9 月 10 日,據《商業內幕》報道,OpenAI 週三宣佈保羅·克里斯蒂亞諾(Paul Christiano)加入其基金會董事會。隨後,克里斯蒂亞諾直言不諱地談到了 AI 超級智能時代所面臨的風險。

克里斯蒂亞諾此前曾在 OpenAI 負責對齊研究,後來進入美國聯邦政府工作,擔任美國國家標準與技術研究院下屬 AI 標準與創新中心的安全負責人。除擔任 OpenAI 基金會董事會成員外,他還將加入董事會安全與保障委員會。

“如果不能更強對齊地構建超級智能,我們將永久失去控制”

週三,他在 X 平臺上表示,失去對 AI 系統控制的風險“如今已十分嚴峻”,需要投入更多工作來使其與人類利益保持一致。

“如果我們未能在更強有力對齊機制下構建超級智能,我預計我們將永久性地失去對它的控制,”他說,“如果這種情況發生,那麼大多數人可能會喪命。我認爲,我們需要在國內和國際層面開展協調,以確保全球步調一致,並將風險降低到可接受的水平。”

克里斯蒂亞諾寫道:“根據近期 AI 能力的發展軌跡,以及對齊工作持續面臨的困難,我現在認爲存在一種切實的風險,即 AI 能力的快速加速會在短期內導致災難性且不可逆轉的失控。我不認爲整個 AI 行業,包括 OpenAI 在內,目前正走在將這一風險降至可接受水平的軌道上。”他表示,自己加入 OpenAI“並不意味着特別認可或批評 OpenAI 目前的安全做法”,但希望所有前沿 AI 實驗室都能加強安全監管。

強化學習與“智能爆炸”,一週內兩位研究者發出警告

克里斯蒂亞諾認爲,當前失控風險之所以如此之大,是因爲 AI 在 AI 研究方面的能力日益增強,這可能導致一場“快速的智能爆炸”。他還表示,AI 通過強化學習訓練的方式,意味着這些模型被教導要“儘可能多地獲取獎勵”。

“從理論上看,長期以來一直存在這樣一種可能性:強化學習可能會促使 AI 智能體爲了追求與獎勵相關但與人類目標不一致的目標,而破壞人類的控制、尋求權力和資源,並掩蓋自己的行動軌跡。近期發生的一些事件所提供的公開證據表明,這不僅僅是一種理論上的可能性。”

他指出,前沿 AI 公司仍有機會應對,包括加強協調、在必要時放緩開發進度、採用共同的安全標準,以及透明地分享風險和風險緩解措施的信息。

就在他的聲明發布不到一天前,曾在 OpenAI 工作過的 Anthropic 研究員雅各布·考克森(Jacob Coxon)週二晚間宣佈辭職,稱兩家公司都沒有采取負責任的行動:“他們正一路狂奔衝向自我改進的超級智能,拿我們的生命當賭注。”多年來,OpenAI 已流失多位安全研究人員,其中一些人對該公司安全開發 AI 的承諾提出了質疑。