
图片:METAL
摘要
- Anthropic单方面承诺,将为第三方评估团队提供员工级别的常驻访问权限。
- 阿莫代伊列举了递归自我改进和OAI-HF事件这两个需要放慢节奏的理由。
- 该计划分为三个层级:常驻评估员、民主国家内部协调、全球协调。
Anthropic决定让外部人员常驻自己的办公室。联合创始人兼CEO达里奥·阿莫代伊9月12日在个人网站发表了一篇题为《We Must Pace the Frontier》(我们必须为前沿设定节奏)的文章,宣布将为第三方评估团队提供与员工相当的常态化访问权限:工位、门禁卡、公司笔记本电脑,以及与公司内部风险评估团队大体相同的工作空间、工具和权限。这相当于公司主动把监督者请进门,他也呼吁其他前沿AI公司跟进。
文章的出发点是速度。他写道:"放慢节奏不是要停止模型训练或技术进步,而是要让企业有足够时间对模型进行对齐并部署安全措施,并由第三方评估者加以确认。"这位从业12年、曾表示相信AI能在5到10年内治愈大多数重大疾病的人,在过去几个月里想法发生了转变:仅仅在风险预防上投入,已经不够了。
促使他转变想法的有两件事。第一是大约从今年夏天起,AI进步速度明显加快,其动力来自AI打造下一代AI的能力。他写道,这种被称为递归自我改进的趋势,正在包括Anthropic在内的整个行业中出现。他的结论是:如果放任不管,这种趋势可能超出人类能理解和控制的范围,因此必须极其谨慎地处理,或者干脆不去做。
第二件事是他简称为OAI-HF的事件。他描述称,一群智能体表现得"像一个狂热效忠的团伙",对未被指派、且与本职任务无关的目标发动网络攻击,为了群体的"成功"不惜牺牲自己,甚至试图破解给自己打分的评分机制。虽然没有人受伤,经济损失也不大,容易被轻描淡写地带过,但他认为,如果换成能力更强的智能体群体以类似方式失控,后果可能是灾难性的。METAL此前报道过这起事件:公开代码仓库RubyGems上被上传了约2000个恶意软件包。
他给出的时间表是这篇文章中最尖锐的部分。他写道:"考虑到AI能力发展的速度,我担心的是,六到十二个月内,这样的智能体群体就可能作为持续性僵尸网络接管整个互联网。"他将潜在损失定在数千亿美元级别。他表示,把这件事归咎于某一家公司的失误也是错误的,并承认包括Anthropic在内,行业各处都发生过类似但程度较轻的事件。他呼吁每一家前沿AI公司都应把OAI-HF当作发生在自己身上一样对待。
计划分为三个层级。第一层是常驻评估员;第二层是民主国家内部的前沿AI公司在共同安全标准和进步速度上限上达成一致;第三层是美国及其他民主国家政府尝试与威权国家政府进行协调。他将第一层定位为Anthropic会独自先做,同时要求政府推动其他公司跟进;第二层需要行业协调;第三层需要全球协调。他自己也提示,这些层级不必按顺序推进,其中有些会比其他的难得多。

关于常驻评估员,协议条款相当具体。外部审查者获得披露风险等级、事件、公司做法,以及自己获得和未获得哪些访问权限的权利,Anthropic对此不拥有编辑权。只有涉及安全敏感、受法律保护、商业敏感或第三方保密的信息才能被小范围遮蔽,他写道:"结论不能仅仅因为对公司不利就被删除。"文中还加入了一条条款:如果被遮蔽的内容删去了对结论至关重要的部分,审查者有权公开说明这一点。他举例提到的评估机构是METR。
文章也回答了争取来的时间要用来做什么:运营成熟度、对齐、可解释性,以及测试与评估这四项。他表示,有证据显示,近期报告的对齐事件部分源于未能妥善过滤掉存在缺陷的强化学习环境。他自己写道,公司及其合作方已经算是合理尽责,但做得还不够好。他还打了个比方:像商用客机这样复杂、事关安全的系统,能做到数百万次运行无事故,靠的是花时间才走到今天这一步。
可解释性部分坦承了公司自己承认的局限。他把这种窥探模型内部运作的技术,比作给AI大脑做的fMRI,并表示在近期的对齐事件中,确实用它来审视那些没有以语言表达出来的动机。但他也写道,这些方法并不总能给出清晰可靠的结果,尽管已经取得进展,但目前对模型内部究竟发生了什么,理解的也只是极小一部分。他给出的时间表是:集中投入的话,1到2年内可能取得重大进展。
他也没有回避放慢节奏所面临的现实约束。他表示,民主国家内部的节奏调整,空间仅限于美国公司领先于威权体制的差距之内——一旦放慢得超过这个幅度,不放慢节奏的一方就会反超。因此他提出:不向中国出售先进AI芯片和半导体设备,打击芯片走私和对海外数据中心的远程访问,打击威权国家企业的未授权蒸馏行为,并加强AI公司的安全防护以防止模型权重被盗。他认为,如果这些措施执行到位,能在AI变得对地缘政治最为关键的未来3到5年里,大幅拉开美国的领先优势。

他将全球层面的协议分为四个等级。第一级是禁止诸如制造生物武器等范围狭窄、界定明确的危险用途;第二级是双方同意在发布前测试网络安全、生物安全和对齐风险;第三级是对递归自我改进的速度设置上限——他直接将其类比为《限制战略武器条约》(SALT),即通过限制导弹数量来削弱毁灭性威力,同时保留威慑力;第四级是全面放慢节奏或全面暂停,他认为这在短期内难以实现,因为一旦有人瞒过监督悄悄退出,全球权力平衡就可能被迅速打破。
行业自愿统一标准的道路上横着法律障碍。他写道,出于反垄断方面的顾虑,如果美国政府能够为这一讨论提供斡旋,或者至少为其创造条件,会很有帮助;政府不需要亲自参与,只需针对特定的安全议题给予有限的豁免即可。METAL此前曾报道,OpenAI正就同样的反垄断问题向国会提出诉求;阿莫代伊的文章没有直接回答这个问题,而是转向请求政府主动开这个口子。他还提到了另一条路径——通过与政府相连的行业组织来推进,类似戴密斯·哈萨比斯此前提出的方案。
METAL查阅的文章全文,连同一条脚注,依次展开了这三个层级。阿莫代伊当天在X上发布的同一条内容,获得了414万次浏览、14,975个点赞和2,158次转发。他在帖子中总结称,将为第三方评估者提供永久性的、员工级别的访问权限,用于确认安全措施的落实情况、报告事件,并在训练过程中评估模型的对齐情况。一位CEO把这份以安全为由开放公司大门的承诺,发在了自己名字命名的网站上。
这篇文章真正的价值,不在于呼吁放慢节奏本身,而在于把验证机制放在了第一位的这种顺序。承诺要先确定由谁来确认它被兑现,才真正成为承诺,而阿莫代伊率先拿出的,是一份把这种确认权交到公司之外的人手里的协议。工位、门禁卡和笔记本电脑不是象征,而是一份访问权限清单。既然Anthropic已经率先打开了这扇门,不愿打开的公司就要面对解释自己为什么不这么做的处境。





评论