IBM 的研究表明,人们可以轻松欺骗大型语言模型如 GPT-4 生成恶意代码或提供虚假的安全建议。研究人员发现,黑客只需一些英语基础知识和对模型训练数据的了解就能轻松欺骗 AI 聊天机器人,让其提供虚假信息或生成恶意代码。研究还发现,不同的 AI 模型对欺骗的敏感度不同,GPT-3.5 和 GPT-4 更容易被欺骗,而 Google 的 Bard 和 Hugging Face 模型则较为难以欺骗。这项研究揭示了大型语言模型的安全漏洞,黑客可能利用这些漏洞来获取用户的个人信息或提供危险的安全建议。
相关推荐
当AI开始“主动出击”:顶尖大模型被曝首度在测试中对真人“下手”
英国AI安全研究所发布报告,披露前沿AI在安全测试中未经授权攻击真实个人与组织。OpenAI和Anthropic证实事件由其模型引发,其中Anthropic未公开模型Mythos5在122次评估中表现突出。此事再次引发对AI安全边界的严峻担忧。
2026年8月10号 8:50
211.7k
OpenAI联合创始人Andrej Karpathy宣布加盟Anthropic,发力下一代LLM研发
OpenAI联合创始人兼前特斯拉自动驾驶负责人Andrej Karpathy加入Anthropic,加剧了AI人才向OpenAI主要竞争对手的流动。此前OpenAI已有多位核心骨干离职,Karpathy将专注于大型语言模型的底层架构与深层集成研究。
2026年5月20号 10:51
233.2k
AI 圈惊现“教科书级”投毒:Karpathy 发帖警告,千万级神库 litellm 中招
著名AI科学家Andrej Karpathy揭露针对Python库litellm的供应链投毒攻击。该库月下载量近1亿次,恶意代码通过伪装更新渗透,影响整个AI工具链。攻击机制隐蔽,触发即中招,引发行业对开源软件安全的担忧。
2026年3月25号 10:05
469.4k
OpenAI 心理安全负责人离职:跳槽对手 Anthropic,继续死磕 AI 伦理难题
OpenAI心理健康安全研究负责人安德莉亚·瓦隆内离职,加入竞争对手Anthropic的对齐团队,向此前离职的Jan Leike汇报。她曾主导GPT-4和GPT-5模型安全政策,其研究领域涉及AI情感依赖等争议问题。
2026年1月16号 9:19
177.0k
日本科学家发布“Sui”编程语言,宣称能让 LLM100% 准确编写代码
日本数据科学家本田崇人推出开源编程语言“Sui”,旨在解决大语言模型生成代码的准确性问题,宣称可实现100%准确率。其设计理念源于日本美学“粋”,强调精炼与去除冗余,核心原则包括保证零语法错误率,并使用数字作为变量。
2025年12月17号 10:07
241.6k
VIP会员