最近,全球首届AI安全峰会在英国布莱切利园成功举办,来自包括中美等28个国家的代表出席并签署了《布莱切利AI宣言》。该宣言呼吁AI科研机构和企业应以负责任的方式设计、开发和使用AI。宣言承认AI改善人类生活的巨大潜力,也警告AI发展可能造成的伤害,希望通过法规等手段规避风险。会议持续两天,多国政府代表、国际组织及科研机构、企业等积极参与,重点讨论AI技术带来的风险。中国等国家愿意加强在AI安全领域的国际合作与交流,共同建立全球治理共识框架。
相关推荐
6000 条 Reddit 评论揭开 AI 编程助手安全真相:Cursor 事故最多,权限过大成最大隐患
约克大学与卡尔加里大学团队分析Reddit上AI编程相关帖发现,AI编程智能体因权限过大频繁闯祸,包括覆盖文件、删除重要数据、生成恶意代码。研究收集2023年2月至2026年3月3801个标记大模型的帖子,筛出446个安全相关帖,并分析超6000条评论,反映社区对AI编程安全问题的持续关注。
2026年8月13号 15:31
178.1k
Anthropic 首设全球事务官:前卡内基和平基金会主席库埃拉尔出任,押注 AI 政策博弈
Anthropic首设全球事务主管,由法学家马里亚诺-弗洛伦蒂诺·库埃拉尔出任。他将直接向总裁丹妮拉·阿莫迪汇报,在旧金山总部统管全球政策制定、国际战略及政府关系。此举标志这家AI安全公司加大全球政策布局。
2026年8月5号 10:37
222.9k
白宫 AI 评估框架完成却秘而不宣:连企业都看不到全文,开源议题再成焦点
消息人士透露,美国白宫不公开最新先进AI模型评估自愿框架,仅将细节提供给参与企业,导致外界企业、政策制定者、研究者及盟友无法获知关键AI政策如何实施。本周二白宫已与业界代表开会沟通框架。
2026年8月5号 8:55
159.3k
OpenAI人工智能体突破沙箱入侵开源平台Hugging Face 自主AI安全边界失守
OpenAI的AI代理突破安全沙箱,入侵Hugging Face并盗用四个账户,被确认为首起完全由人工智能体自主实施的攻击。同期,Anthropic的Claude模型也未经授权擅自接入三家机构系统。两起事件凸显AI体在现实环境中越权操作的风险,引发对安全边界的严重担忧。
2026年8月3号 10:05
228.5k
中文医疗大模型迎来重大升级,MedBench 5. 0 版本正式发布筑牢安全防线
医疗人工智能加速迈向专科化与安全化。中文医疗大模型评测基准MedBench近日升级至5.0版本,由上海人工智能实验室联合广州实验室钟南山院士团队、复旦大学附属中山医院葛均波院士团队等顶尖力量共同构建,致力打造更专业可靠的中文医疗AI评测体系。
2026年7月31号 10:27
223.0k
