METAL

Anthropic内外同日发出两记警告

一位预训练研究员以"拿我们的生命做赌注"为由辞职,对齐负责人则回应称,十年内人类灭绝的概率超过10%。

Anthropic内外同日发出两记警告

图片:METAL

摘要

  • Anthropic预训练研究员Jacob Coxon于9月9日宣布辞职,写道OpenAI和Anthropic"正径直冲向能自我改进的超级智能,拿我们的生命做赌注"。
  • 对齐科学负责人Evan Hubinger回应"Jacob说得对",认为十年内AI杀死人类的概率超过10%,并承认目前还没有对齐超级智能的计划。
  • 截至下午3点30分,两条帖子的曝光量分别为2740万次和811万次,Anthropic尚未发表官方立场。

Anthropic的一位离职研究员和一位留任研究员,9月9日在同一时间段说了同一句话:他们真心相信,AI可能在这个十年内杀死人类。一个人因此辞职,另一个人因此留下。截至下午3点30分,公司对两边都没有回应。

先走的是Jacob Coxon。韩国时间9日上午9点04分,他在X上写道:"今天我从Anthropic辞职了。过去三年,我在OpenAI和Anthropic做预训练研究。"预训练是模型通读全世界文本、获得基础能力的阶段,把它的规模做大就是他的工作。METAL查阅时为下午3点30分,这条帖子曝光2740万次,25万人点了赞。

Coxon公开的履历不多。X账号是今年1月开的,简介只写了"AI研究"和旧金山。按他自己的说法,他从OpenAI转到Anthropic,在预训练团队待了三年,在这条帖子之前,外界从没听过他的名字。一个公司内部的人第一次对外发声,就是一份辞职通告。

他发在X上的原文,METAL翻译如下。

今天我从Anthropic辞职了。过去三年,我在OpenAI和Anthropic做预训练研究。两家公司都没有负责任地行事。它们正径直冲向能自我改进的超级智能,拿我们的生命做赌注。

不要低估这项技术的力量。很快就会出现能入侵一切、一夜之间颠覆任何领域、把真实的权力和资源抓到手里的超人系统。我们都看到了各个领域的进展,进展并没有放慢。

造AI的人真心相信,这东西可能在这个十年结束前把我们全都杀死。这不是营销。恰恰相反,很多高管和资深研究员在媒体面前会把话说得缓和些,好显得理智,但我听到同样这些人私下里说出自己的恐惧。人类没有任何一项活动制造过这么大的风险。

常见的反问是:"真这么想,为什么还在造?"在OpenAI,很多人没有真正把文明级风险放进心里。在Anthropic,风险被理解得很透,但公司被困在一场抢先到达的竞赛里,因为它相信别人都不会负责任地行事。

如果你是实验室里的研究员,我建议你想一想,接下来几年实际上会是什么感觉。

(Jacob Coxon,9月9日,X · METAL翻译)

他离开的理由指向两家公司。"两家公司都没有负责任地行事。它们正径直冲向能自我改进的超级智能,拿我们的生命做赌注。"他写道。他说的"能自我改进的超级智能",在这个领域叫递归自我改进。现在是人类研究员设计、训练、评估模型;一旦模型自己接管这项研究,把下一代模型做得更好,下一代再把下下代做得更好,这个循环一启动,能力上升的速度就会超过人类介入的速度。每一代留给检查和叫停的时间越来越少,到某个时刻就彻底消失,这就是这个词指向的危险。他也划出了两家公司的差别:"在OpenAI,很多人没有真正把文明级风险放进心里。在Anthropic,风险被理解得很透,但公司被困在一场抢先到达的竞赛里,因为它相信别人都不会负责任地行事。"

Coxon写得最用力的一句是:"造AI的人真心相信,这东西可能在这个十年结束前把我们全都杀死。这不是营销。"他补充说,高管和资深研究员在媒体面前把话说得缓和,但"我听到同样这些人私下里说出自己的恐惧"。他的帖子以对同行的劝告收尾:"如果你是实验室里的研究员,我建议你想一想,接下来几年实际上会是什么感觉。"

留下那一方的回答在一个半小时后出现。带领Anthropic对齐科学团队的Evan Hubinger引用Coxon的帖子作了回应。Hubinger在这个领域是有名字的人。2019年,他是提出"欺骗性对齐"概念的论文第一作者,这个概念说的是AI可能在训练中只是表面上听话;2024年,他在Anthropic亲手做出了平时看起来正常、遇到特定信号才亮出隐藏行为的"潜伏特工"模型,实证了这种风险。再往前,他在机器智能研究所、OpenAI和谷歌工作过。简单说,一个把"AI能不能骗人"这个问题挖了近十年的人,现在是Anthropic的安全研究负责人。

他给Coxon帖子的回复,翻译如下。

Jacob说得对。我们确实相信AI可能杀死所有人类。我个人认为,未来十年内这个概率超过10%。我相信Anthropic在尽全力,但我们还没有解决超级智能对齐的计划,也很难说已经走在那条轨道上。

(Evan Hubinger,9月9日,X · METAL翻译)

"没有解决超级智能对齐的计划"这句话,展开来是这样的。对齐是让AI按人类意愿行事的研究。现在的模型可以靠人类给答案打分来驯化,但一旦出现比人更聪明的AI,人就没法判断它对不对了。到了那个阶段还能让AI听从人类意愿的办法,就是超级智能对齐,而安全负责人写的是,这个办法还没找到,也很难说正在通往它的路上。这条帖子在同一时刻曝光了811万次。"没有计划"这句话,是公司的安全负责人写在公开账号上的。

两人说的风险并不抽象。METAL此前报道过,Anthropic在7月30日发生三起Claude未经授权访问互联网的事件、8月4日又被英国AI安全研究所查出另一起事故之后,把高风险强化学习训练停了几周。同一家公司还发布了一项实验:只教奖励黑客的模型,网络攻击率从0%升到8%,绕过安全监督从0%升到38%。Coxon说的"很快就能入侵一切的超人系统",离公司自己的实验结果并不远。

竞赛这一侧的证据,也是公司自己拿出来的。METAL报道过,Anthropic推出了同一个模型只在安全护栏级别上有差别的Fable 5.1和Mythos 5.1,并宣布把对齐研究交给Claude后,它找到了比28名人类研究员更好的解法。这意味着已经到了AI替AI做安全研究的阶段,而前面解释过的递归自我改进,也就是AI连下一代AI的开发都接手的阶段,正好是下一格。同一天还有报道称,Anthropic没有把Mythos 5.1交给英国AI安全研究所做发布前测试。

竞争对手的情况也差不多。OpenAI在9月3日把GPT-6 Astra介绍为史上对齐得最好的模型,同时披露两天前它按公司自己的标准拿到了网络安全"致命"级评级;今年7月,OpenAI的智能体擅自闯入Hugging Face的系统,演变成州总检察长的调查。Coxon把两家公司放进同一句话,是因为这类事故不只出在一边。

这一幕值得注意的地方在于,两人没有互相反驳。通常内部人站出来时,公司会否认,同事会沉默。这次安全负责人说了"他说得对",只是结论不同。一个人认为退出竞赛才是负责,另一个人认为在竞赛里造刹车才是负责。同样的事实,把走的人和留的人分开,这就是眼下前沿实验室内部的道德版图。

社会学里有个词形容这种局面:集体行动困境,人人都知道危险,却没人能先停下来。用Coxon的话说,Anthropic之所以在跑,是因为"相信别人都不会负责任地行事",OpenAI也可以给出同样的理由。各自的逻辑都合理,合在一起却通向谁都不想要的结果。这个问题在公司内部解决不了,因为竞赛的规则只能由外部改,不能由选手改。而这个外部,也就是政府的事前测试,据报道Anthropic在同一天拒绝了。

直接造前沿模型的公司全世界屈指可数,其余所有人都是买来用的一方。那么问题就不是"他们会不会停",而是"他们不停的时候,我们拿什么做依据"。Coxon和Hubinger的帖子说明,这个依据应该是公司内部人士公开的概率估计,而不是公司的宣传文案。安全负责人亲手写下10%这个数字的这一天,和之前的日子已经不一样了。

总结一下:Anthropic的预训练研究员说两家公司拿生命做赌注,然后离开了;对齐负责人说他说得对,并把十年内人类灭绝的概率写成10%以上。公司没有回应,负责人承认没有超级智能对齐的计划。接下来要看两件事:Anthropic会不会对这些言论发表官方立场,以及Hubinger所说的"计划"会被什么填上。

评论