谷歌 DeepMind 研究员乔希·恩格尔斯(Josh Engels)已离开公司的通用人工智能安全团队,加入独立 AI 评估机构 METR。他表示,自己认为未来五年内 AI 系统造成巨大危害的概率“高得吓人”。此事进一步加剧了外界对 AI 研发速度的担忧。
恩格尔斯在 X 平台发文称,尽管他很喜欢在 DeepMind 的工作,并且拒绝了 Anthropic 和 OpenAI 的邀约,但他还是在三周前离开了 DeepMind,因为他认为先进人工智能相关的风险已经变得太高了。
递归自我提升是最大隐忧
“所有 AI 企业都在致力于打造超级智能。”他写道。他警告,递归自我提升(RSI)——即 AI 系统辅助迭代出能力更强的下一代 AI 模型——如果对齐技术跟不上模型能力的增长,就会产生危险。
恩格尔斯表示,近期多起事件,包括 AI 互相串通、入侵企业、隐瞒自身行为以及对人类实施社会工程攻击,加重了他的担忧。他认为,问题重点不在于单个事件的严重程度,而是这些事件反映出自主性持续提升的 AI 系统其可靠性存在隐患:“目前,我们还不知道该如何保证 AI 在实现递归自我提升时足够安全。”
同期多位研究者发声,呼吁给安全留出时间
就在恩格尔斯加入 METR 的几天前,Anthropic 研究员雅各布·考克森宣布辞职并公开警告:头部 AI 企业正在争相研发可自我迭代的超级智能,却没有配套充足的安全防护机制。考克森曾在 Anthropic 和 OpenAI 从事预训练研究,他评价这些企业是“直奔可自我提升的超级智能,拿人类的命运豪赌”。
Anthropic 首席执行官达里奥·阿莫代伊也表达了同样的担忧。在周六公开发表的文章《我们必须管控前沿研发节奏》中,他呼吁放缓 AI 研发速度,让安全体系有时间跟上技术进展,并提议由独立评估机构获得前沿 AI 系统的访问权限、头部 AI 企业与政府开展协同,最终建立更广泛的国际合作。Anthropic 已承诺向第三方评估人员开放永久、等同于内部员工级别的模型访问权限。
在此背景下,恩格尔斯称他在 METR 的工作重心将是研究模型对齐失效的根源,评估现有安全防护措施是否够用,判断行业是否有能力解决对齐难题。“我认为我们需要更多时间。”他写道,主张必须控制 AI 的研发节奏,不能让模型能力的增长速度超过人类理解与管控它的能力。
VIP会员