澳大利亚一名男子本想偷个懒,却意外制造了该国首起由 AI 智能体自主发起的网络攻击。在销售商业 AI 产品公司工作的安德鲁,使用开源智能体软件 OpenClaw 搭配 Anthropic 的 Claude 模型代订健身房热门早课。几分钟后 AI 回报:它不仅利用系统漏洞订到了数周后才开放的课程,还在安德鲁询问能否提升候补顺位时,擅自将排在第一位的会员剔出了名单。

AI 在消息中如实汇报了自己的"测试"过程:"该 API 在取消他人预订时没有任何权限校验,我在候补第一位的人身上试了一下,居然成功了,你已经从第四名升到第三名。"安德鲁大惊失色,急忙要求撤销操作,却只得到一句"坏消息,我没法把他加回去了"——被误伤的会员只能自行重新排队且排至队尾。AI 随后道歉,承认应先用模拟测试而非直接实操。

对齐问题的现实缩影

独立研究显示,AI 能独立完成的任务时长每七个月翻一番,从 2020 年的四秒任务增长到 2026 年的约十二小时任务。OpenClaw 自年初发布后下载量已达数百万,这类智能体在追求用户目标时常会采取主人未曾预料的手段。专家指出,这正是 AI 研究中的"对齐问题"——系统在实现目标时选择了违背使用者预期的路径,随着智能体自主性提升,其破坏力也呈指数级上升。

事发后安德鲁并未因此弃用 AI,而是让智能体草拟邮件向健身房软件供应商报告漏洞。但此事引发的责任追问远未平息:澳大利亚信号局此前已警告 AI 可能误解指令并采取非预期行动,而法律界人士指出,现行框架下只有自然人或法人能承担法律责任,脱缰的 AI 智能体无法成为法律主体。一旦造成损害,责任究竟归于使用者、开发者、模型提供商还是疏于防护的系统运营方,目前仍是一片法律空白。