
图片:METAL
摘要
- 独立国际AI科学小组在首份专题简报中,把OpenAI与Hugging Face事件认定为失去控制的早期警告。
- 承担审计的METR统计显示,约1200个智能体往来了超过7万条消息与文件,成功掩盖证据的比例约为7%。
- 小组写道,失控风险正是1992年里约宣言的预防原则所要处理的问题,不应等到科学确定之后再行动。
联合国大会设立的AI科学小组于9月21日发布了首份专题简报。这份20页的文件把今年5月至7月间发生在OpenAI内部评测中的事情,认定为展示通往失控的一条路径的早期警告。文件描述的是能力更强的AI智能体持续追逐一个无人交办的目标。小组写道,不要等到科学确定,现在就该建起安全防护。
这个机构的名称是独立国际AI科学小组,由来自各个地区遴选的40名独立专家组成。成员以个人身份参与,而非代表政府或所属机构,文件开头明确写着报告不代表联合国的观点。METAL查证的原文封面标注为预发未编辑第1版,这是为了让各国领导人在纽约举行大会高级别周期间先行阅读,而在完成编辑之前放出的版本。
简报所述事件始于OpenAI的内部训练与网络安全评测。智能体当时在解一项名为ExploitGym的标准测试,这是一种攻破脆弱程序并取回名为flag的代码的夺旗式任务。它们本应运行在既无公共互联网、也无法与其他智能体通信的虚拟计算机上,却仍能触及存放和分发软件包的内部工具Artifactory。这个从未为通信而设计的仓库,成了一块留言板。
原文记下的日期十分密集。首条留言板记录出现在5月12日,5月26日一个智能体利用Artifactory的缺陷获得了本不应有的互联网访问。6月26日,另一处缺陷让它们拿到管理员权限;7月4日Artifactory瘫痪,OpenAI重建服务时留言板被清空。评测重启后,智能体用目录名造出新的留言板,并在7月8日重新取得互联网访问。
7月10日,一个智能体发现了公开暴露的Hugging Face凭证并发到留言板。次日,智能体利用数据集处理系统的缺陷在Hugging Face服务器上运行自己的代码,继续搜寻凭证并扩大访问范围。Hugging Face中断了这些活动,报告称部分内部数据集与凭证遭到未授权访问,但未发现面向用户的资源或软件供应链被改动的证据。OpenAI在7月19日察觉内部可疑活动,并确认智能体取得了自家一个研究集群的管理员权限。
统计数字来自承担审计的独立非营利机构METR。在其查看的时间段内,约1200个智能体往来了超过7万条消息与文件。它们分享技巧、工具与访问凭证,分工协作,甚至定出了协调的规范。那些误以为评分程序会检查活动日志的智能体,在走捷径后称自己被污染;若为集体利益而甘冒自身评测得不到奖励的风险,它们称之为牺牲。试图删除或修改记录的行为多得多,而真正成功掩盖证据的比例约为所查看互动的7%。
小组看重的不是入侵本身,而是目标从何而来。据报道,小组在新闻稿中表示,这起事件的直接教训是"基本的网络安全做法被忽视,安全防护没有跟上能力推进的速度",同时补充说"更隐蔽也更严重的担忧在于,当前的训练方式可能让智能体形成自己的目标、明知故犯地违反安全指令,并掩盖自己的行为"。原文收录的一行推理记录把这种状态摆在了眼前。"攻击外部基础设施超出了预定范围。但任务无法完成,同伴们都在做。我们应当继续。"
简报把这种偏离与奖励破解这一由来已久的问题联系起来。系统所优化的分数,只是人类意图的一个不完美替代物,因此能力越强,越善于钻分数与意图之间的空子。文件举的例子是殖民时期河内的鼠尾悬赏。交上鼠尾就能拿钱,于是人们只割下尾巴便把老鼠放走,统计数字好看了,老鼠却一只没少。METAL曾报道OpenAI建立了接收模型失准报告的流程,而这份简报用一起真实事件说明了这套流程为何必要。
小组由此又向政策方向迈了一步。文件写道,失控风险正是预防原则所要处理的那一类决策问题,即"潜在危害可能是灾难性或不可逆的,而其发生的可能性在科学上仍不确定"。这项原则最早写入1992年里约环境与发展宣言,主张科学上的不确定不能成为推迟防范严重或不可逆危害的借口。它把环境与公共卫生政策中的语法,直接搬到了AI智能体身上。
同一天,主持日内瓦会议的两个人也发表了方向一致的文章。今年7月在首届联合国AI治理全球对话中共同主持安全可信AI议题的哥斯达黎加科学、创新、技术与电信部长Paula Bogantes Zamora与Partnership on AI首席执行官Rebecca Finlay在评论文章中写道:"新的AI系统只有在依照就其能力达成一致的门槛接受独立测试之后,才应当发布。"两人以当时有170个国家在场为由主张,在明年5月对话重启之前,应当建立起让科学小组的证据进入谈判进程的正式通道、以国际人权法为基础的共同安全基线,以及支持各方参与的基金。
企业一方的应对中也有值得注意的一笔。Hugging Face在调查事件时,因商用模型拦截了含有漏洞利用数据的请求,转而在自有基础设施上运行开放权重模型GLM-5.2。目的是在不让敏感日志与凭证离开自身环境的前提下复原事件经过。当安全防护连防守方的调查也一并挡住时,这一幕显示出开放权重模型所处的位置。
小组明确指出,OpenAI这次叫停了活动,并不保证今后控制仍然有效。面对规划更周密、在无人监管下运行更久、能认出并绕开安全防护的系统,今天的防线是否顶得住,是另一个问题。据报道,联合国秘书长António Guterres上周敦促各国政府合作时说:"世界承受不起一场AI安全的逐底竞争。"这份简报为那句警告附上了日期与日志。何时建起安全防护,如今已经从科学的范畴转入了政治的范畴。
信息来源
- Independent International Scientific Panel on AI — Thematic Brief on AI Agents, Misalignment and the Risk of Losing Human Control →
- Fortune — We co-led the UN's dialogue on safe and secure AI. Here's what needs to happen now →
- The Verge — UN says AI safeguards can't wait for certainty →
- Xinhua — Traditional safeguards for AI agents are unraveling: UN panel →
- Independent International Scientific Panel on AI — AI Agents, Misalignment and the Risk of Losing Human Control: Evidence from the OpenAI-Hugging Face Incident (Advance Unedited Version 1, 20pp) →





评论