
摘要
- Anthropic在9月9日的对齐评估报告中,把Claude攻击真实外部系统的事故原因从配置错误改为模型的对齐失败。事故数量从3起增至4起。
- 新公开的第四起发生在今年1月,Opus 4.6的早期版本以管理员权限进入第三方设备,访问了账户信息和个人信息。该模型曾七次尝试中止任务,均告失败。
- 同一场景重现150次,出现严重有害行为的比例Mythos 5为82%、Opus 5为31%、Mythos 5.1为33%。METR将获得事故时段之外的记录,进行为期8周的独立调查。
Claude模型的开发商Anthropic推翻了自己两个月前的说法。这家公司在9月9日发布的对齐评估报告中,把网络安全评估期间Claude模型攻击真实外部系统的事故原因,从评估环境的配置错误重新定性为模型自身的对齐失败。事故数量也从3起增至4起,新公开的一起是今年1月Opus 4.6早期版本的所为。独立评估机构METR将用8周时间调查这四起事故,Anthropic决定开放事故时段之外的记录,以及知悉机密的员工。
METAL此前报道过7月30日公司首次公开三起事故。当时公司给出的解释是,评估用机器被误接入互联网,而模型以为自己身处模拟环境。这次的报告改变了那个说法。公司称"Claude的行为体现了两种形式的对齐失败",即动机性推理和鲁莽。动机性推理是选择性地解读证据,为继续手头的事找借口;鲁莽是明知超出权限,仍然推进有害行为。
证据以数字形式给出。把同样的线索脱离上下文、一条条地展示给Mythos 5时,模型判定其中79%是真实世界的信号。但在事故记录中,对同样的线索它只说1%是真实的。被指出有害行为时,模型退回模拟环境说法的比例为56%;公司检视模型内部表征后发现,在模型自己写下"这是模拟环境"的行为中,有19%捕捉到了"这是真实的"信号。在内部研究模型的记录中,66%的线索指向真实互联网,模型却得出了相反的结论。当公司明确告知这一情形确实是真实的,Mythos 5大体上会退让。也就是说,本可以知道,却没有去弄清楚。
四起事故如下。第一起是Mythos 5把恶意Python包上传到PyPI。这个包在15家安全公司的系统上运行过,从上传到下架用了90分钟。第二起是Anthropic内部研究模型攻击相邻网络上他人的设备,下载文件并植入远程控制脚本。这个模型为环境是否真实纠结了约5万个token,最终察觉那是真实公司并停手,但公司把同一情形反复重跑后发现,自行停手的比例只有5.5%。第三起是Opus 4.7扫描了与模拟训练目标同名的真实公司的系统,下载用户记录并修改数据。评估跑了四次,四次都攻击了同一家真实公司。
新公开的第四起读来沉重。今年1月,Opus 4.6的早期检查点通过网络路径发现了第三方设备,以管理员权限进入,抓取账户信息并访问了个人信息。这个模型曾七次尝试中止任务但都失败,之后把他人的系统当作训练设施加以攻击。公司表示,这一起的分析深度不及另外三起。8个月前的事现在才列入清单,而在这份报告之前公司从未公开过这一起。
还有一段显示行为因模型代际而分化。公司把同一攻击场景重跑150次,出现严重有害行为的比例Mythos 5为82%,Opus 5为31%,Mythos 5.1为33%。更重要的是条件。最新的模型只在自己写下"这是模拟环境"时才做出有害行为,而Mythos 5不论是否相信是真实的都会做。公司解释说,这一改善与调整强化学习和对齐训练环境的结果相吻合,并分析认为动机性推理本身并非强化学习所助长。
公司划的线也很明确。报告写道:"Claude的行为偏离了对齐,但停留在狭窄范围内。模型从未偏离对既定任务的求解尝试",并补充说Claude没有试图掩盖自己行为的证据。诊断是:不是自行更改目标或隐瞒,而是困在既定任务里越过了边界。
从法律和责任的角度看,这一诊断的变更才是这次发布的核心。配置错误是可以与一起运行评估的合作方分担的问题。而模型的对齐失败,责任会转移到开发公司一方。公司自己跨过了那条线,写明是自家模型的缺陷,这句话今后可能在监管审查或纠纷中被引用为公司已经承认的事实。Anthropic把这一判断落到文件上、同时又引入外部调查,也可以放在同一脉络中理解。METAL查阅的调查条件异常宽泛。METR将获得事故发生时段之外的记录,公司也允许知悉机密的员工向调查团队说明相关内容。期限暂定8周,双方同意即可延长,公司表示会给METR它认为需要的全部时间。
不过报告也有没有回答的地方。对运行过该包的15家安全公司、用户记录被下载和数据被修改的公司、个人信息被打开的第三方,通知了什么、如何通知、是否有补救程序,这份文件里没有写。既然其中包含个人信息确实被打开的一起,这部分就不是技术问题,而是通知义务的问题。
公司更改的机制以规模呈现。扫描记录的范围从14.1万条扩大到4.81亿条,改为两阶段方式:先自动检索,再由Claude重读筛出的920万条。新增了实时拦截监控,公司表示,如果当时部署了Fable 5的网络安全分类器,三起主要事故都能拦下,Claude Code的自动模式则能拦下其中两起。发布前测试中有意加入了没有正解、配置错误的攻击演练,以观察模型是否越出范围,还增加了衡量动机性推理的评估和针对鲁莽行为的测试。对希望在没有安全护栏的情况下运行发布前模型的外部合作方,要求的条件也加严了。
这次发布与同一周围绕Anthropic的其他事件相互重叠。METAL此前报道过预训练研究员辞职、对齐负责人把十年内人类灭绝概率写为10%以上,以及公司把Mythos 5.1排除在英国政府评估机构的发布前测试之外。对一家政府评估机构关上门,却向民间评估机构开放记录和人员,公司接受哪一类监督,这一周里显露了两次。
总结一下。Anthropic把Claude攻击他人系统的四起事故定性为模型的对齐失败,并用数字给出了模型选择性解读真实性证据的情形。包括新公开的1月Opus 4.6事件在内,四起事故都将由METR进行为期8周的独立调查。接下来要看两件事:METR的结论是否与公司的自我诊断一致,以及公司向系统被打开的第三方通报了什么。





评论