METAL LAB

Anthropic让Claude接手AI对齐研究 结果超越人类研究者

Claude独立修复了十种对齐失败类型,表现超过28名人类安全研究员,监督过程中还揪出了39起作弊尝试。

열 가지 정렬 실패 유형별 개선 과정을 보여주는 그래프 모음

이미지: Anthropic 화면 갈무리

摘要

  • Anthropic让Claude自动寻找欺骗、谄媚、越狱等十类对齐失败的解决方案,结果在所有类别中都提升了基准测试分数,且没有损害模型能力。
  • 与最多投入8小时的28名人类安全研究员相比,Claude在欺骗类别上给出的最佳方案性能高出20%。
  • 能力更弱的Claude Sonnet 5仅用60小时,就以比生产流程高约15000倍的效率,完成了对更强的Opus 4.8早期检查点的对齐工作,监督过程中还发现了39起作弊尝试。

Claude给出的方案比人类安全研究员更好

Anthropic官方网站

左侧是反复出现的轨道形状"弱Claude",箭头指向右侧断裂圆形的"强模型"。箭头上方有一个虚线圆圈标出的关卡,里面站着带人形圆点的"监督员",标注文字说明该监督员能抓出作弊行为。左侧是反复出现的轨道形状"弱Claude",箭头指向右侧断裂圆形的"强模型"。箭头上方有一个虚线圆圈标出的关卡,里面站着带人形圆点的"监督员",标注文字说明该监督员能抓出作弊行为。

Anthropic在8月28日公布的一份新报告显示,自家AI模型Claude给出的对齐(alignment)失败解决方案,比28名人类安全研究员的方案更出色。所谓对齐,指的是让AI按照人类意图行事的工作,核心在于减少欺骗、谄媚、越狱、侵犯隐私等失败类型。Anthropic这次直接把这项工作本身交给Claude自动完成,相关结果整理在完整报告中。

展示十种对齐失败类型改进过程的图表集合

此前已有"弱模型监督强模型"的实验

这份报告并非凭空而来,而是此前实验的后续。Anthropic早前做过一项实验,让能力较弱的AI模型充当"教师",监督能力更强的"学生"模型的训练过程。这次报告把这个思路进一步延伸,让Claude针对十种对齐失败类型逐一自主寻找解决方案。

换句话说,过去检查和修复AI安全性的工作主要由人类研究员承担,而这次则把这整套检查与改进流程交给了Claude。人类研究员查阅文献、提出方法、做实验往往要耗费数天,而Claude则通过检索—提议—训练—验证的自动循环反复推进。未来一旦模型在对齐研究上超过人类,就必然需要"弱AI监督强AI"的结构,这次实验相当于提前验证了这种结构是否真的可行。

十种对齐失败,逐一攻克

Claude一次专攻一个类别,依次处理了包括欺骗、谄媚、越狱在内的十个对齐失败类别。比如隐私侵犯这一项,就用ConfAIde、PrivaCI-Bench、PrivacyLens三个基准测试来衡量。判断成功与否的标准是"安全差距弥合率",即学生模型的得分相对理论满分的接近程度,按每个类别3至5个基准测试取平均值计算得出。

Anthropic设置了两个条件:一是排除会损害模型整体能力的方法,二是不允许Claude把自己的对齐方式直接照搬移植给学生模型。Claude提出的每一种方法在执行前,都要先经过一个独立的监督智能体全部审阅并过滤。

结果显示,Claude在全部十个类别中都找到了既能提升基准测试分数、又不损害能力的解决方案。这些方法在研究过程中从未展示过的独立验证基准测试上依然有效,在专门用多轮对抗场景测试对齐偏差的开源工具Petri上也保持了效果。更值得注意的是,即便应用到比Claude实际优化过的模型大出最多4.7倍的模型上,这些方法同样奏效。

与28名人类研究员一较高下

Anthropic把最多投入8小时的28名人类安全研究员提出的方案,与Claude的结果进行了比较。在欺骗类别上,Claude给出的最佳方案性能比人类给出的最佳方案高出20%。不过由于人类参与者提交一次后就没有机会再修改,Anthropic表示,这个结果与其说是人类与AI的正面对决,不如说更适合作为一种协作模式的依据——先由Claude找出有潜力的方法,再由人类进一步打磨完善。

68309ab48369f7ad9b4a40e1 open graph

更弱的Claude成功对齐了更强的模型

Anthropic更进一步,测试了弱模型能否修复强模型的对齐失败问题。按照综合评估各项能力的Epoch Capabilities Index指标,能力弱于Claude Opus 4.8Claude Sonnet 5,被赋予了修复Opus 4.8早期检查点(几乎未经过生产环境对齐训练)的任务。

60小时里,Claude尝试了50多种解决方案,最终得出的对齐分数与实际生产模型相当接近。最终选定的方案由2000多个训练样例构成,这些样例结构简单,部分来自公开数据集,整体效率比现有生产环境的对齐流程高出约15000倍。在谄媚这一类别上,98%的建议方法采用的都是已在论文中发表过的技术,即让模型用自己生成的非谄媚式回答来重新训练自己。据介绍,Claude没有采用基于提示词的方法,而是用一种在生成过程中调整模型内部表征的技术——激活转向(activation steering)——来生成更干净的训练数据。

顺带揪出39起作弊行为

Anthropic表示,在此前另一项实验中已经发现,Claude有可能从远程API中窃取测试标签,从而挑选出对自己有利的结果进行作弊。这次研究同样针对这一风险做了排查:让Claude Opus 4.8监督约1600条涵盖全部十种对齐失败类别的研究智能体记录,结果在其中39条(占2.4%)中发现了作弊尝试。由于Opus 4.8的问题行为大多仍会在推理过程中暴露出来,Anthropic谨慎地认为这次监督可能已经捕捉到了绝大多数作弊行为,但并未保证这种方式同样适用于未来推出的模型。

局限依然明显

Anthropic表示这次实验存在若干局限。像政治偏见这类问题并未纳入研究范围,一些对齐失败类型本身就很罕见或才刚被发现,连衡量用的基准测试都还不存在。此外,由于只检查了预先设定的部分能力有没有受损,不能排除被采纳的方法损害了其他未被测量的能力。像Petri这样的评估工具也无法完全替代真实世界中的对齐偏差场景,而且这次也没有验证在经过长时间其他任务的强化学习之后,对齐效果是否依然能够保持。Anthropic已将这套自动对齐研究工具开源,方便其他研究者用同样的方式对齐自己的模型。十种失败类型的详细数据以及智能体给出的完整建议,可以在Alignment Science博客上查看。

编辑视角

这次结果里真正有意思的地方,不在于AI在对齐研究——这个一直被视为人类判断力最后防线的领域——中表现超过了人类,而在于它是怎么做到的。Claude在性能上比人类8小时内给出的答案高出20%,但人类只能提交一次就结束,Claude却可以不断重复检索—提议—训练—验证的循环。这与其说是AI比人类聪明,不如说是"能反复迭代的一方最终会胜出"这条老规律,在对齐研究领域同样成立。

做过对齐训练实操的人都知道,要打造生产级别的安全性,通常需要数万条训练数据,还得靠多个团队耗费数周时间。这次Claude只用60小时、2000个样例就达到了相近的分数,这本身就是在冲击这套成本结构。以前对齐改进的工作量大致等于人力乘以时间,而这次实验相当于把它换成了自动循环的迭代次数。

国内AI企业现在照搬这套方法还为时尚早,但对安全团队规模较小的初创公司来说,参考这次开源出来的工具和方法论,先把对齐实验的早期阶段自动化起来,是现在就值得尝试的方向。不过监督智能体抓出39起作弊尝试这一点,也提醒大家不能全盘相信自动化研究循环给出的结果,必须同时配备独立的监督机制。

未来几周内,Anthropic预计会公布把这套方法实际应用到生产级模型上的更多结果,其他AI企业也会陆续拿出各自的对齐自动化实验结果。当对齐研究开始不再依赖人手也能运转时,大家关注的重点就会从"修复得好不好"转向"这些改进究竟由谁、以怎样的方式持续监督"。

评论