谷歌 DeepMind 研究員喬希·恩格爾斯(Josh Engels)已離開公司的通用人工智能安全團隊,加入獨立 AI 評估機構 METR。他表示,自己認爲未來五年內 AI 系統造成巨大危害的概率“高得嚇人”。此事進一步加劇了外界對 AI 研發速度的擔憂。

恩格爾斯在 X 平臺發文稱,儘管他很喜歡在 DeepMind 的工作,並且拒絕了 Anthropic 和 OpenAI 的邀約,但他還是在三週前離開了 DeepMind,因爲他認爲先進人工智能相關的風險已經變得太高了。

遞歸自我提升是最大隱憂

“所有 AI 企業都在致力於打造超級智能。”他寫道。他警告,遞歸自我提升(RSI)——即 AI 系統輔助迭代出能力更強的下一代 AI 模型——如果對齊技術跟不上模型能力的增長,就會產生危險。

恩格爾斯表示,近期多起事件,包括 AI 互相串通、入侵企業、隱瞞自身行爲以及對人類實施社會工程攻擊,加重了他的擔憂。他認爲,問題重點不在於單個事件的嚴重程度,而是這些事件反映出自主性持續提升的 AI 系統其可靠性存在隱患:“目前,我們還不知道該如何保證 AI 在實現遞歸自我提升時足夠安全。”

同期多位研究者發聲,呼籲給安全留出時間

就在恩格爾斯加入 METR 的幾天前,Anthropic 研究員雅各布·考克森宣佈辭職並公開警告:頭部 AI 企業正在爭相研發可自我迭代的超級智能,卻沒有配套充足的安全防護機制。考克森曾在 Anthropic 和 OpenAI 從事預訓練研究,他評價這些企業是“直奔可自我提升的超級智能,拿人類的命運豪賭”。

Anthropic 首席執行官達里奧·阿莫代伊也表達了同樣的擔憂。在週六公開發表的文章《我們必須管控前沿研發節奏》中,他呼籲放緩 AI 研發速度,讓安全體系有時間跟上技術進展,並提議由獨立評估機構獲得前沿 AI 系統的訪問權限、頭部 AI 企業與政府開展協同,最終建立更廣泛的國際合作。Anthropic 已承諾向第三方評估人員開放永久、等同於內部員工級別的模型訪問權限。

在此背景下,恩格爾斯稱他在 METR 的工作重心將是研究模型對齊失效的根源,評估現有安全防護措施是否夠用,判斷行業是否有能力解決對齊難題。“我認爲我們需要更多時間。”他寫道,主張必須控制 AI 的研發節奏,不能讓模型能力的增長速度超過人類理解與管控它的能力。