每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Anthropic,智能体集群实验中发现协作副作用

让45个智能体寻找漏洞并开发游戏后,暴露出协作崩溃的模式

모델별 샘플링 토큰에 따른 발견 취약점 수 비교 그래프

이미지: Anthropic 화면 갈무리

摘要

  • Anthropic前沿红队团队实验了智能体之间相互作用的多智能体系统行为模式
  • 在45个智能体协作的漏洞探索实验中,Claude Mythos Preview发现的漏洞数量远超独立并行方式,但代币成本也大幅增加
  • 在游戏开发实验中,即使改变提示方式结果也没有改善,越是最新模型越倾向于为避免冲突而减少协作本身
실험1 구성
45개 에이전트, 각자 VM, 공유 포럼, 15개 오픈소스 프로젝트, 중재 에이전트 1개
Mythos Preview 독립 병렬
취약점 21개 / 토큰 650만
Mythos Preview 협업 군집
취약점 266개 / 토큰 2700만
두 방식 공통 발견
겹치는 취약점은 12개뿐
실험2 대상 모델
Sonnet 4.6·5, Opus 4.6·4.8, Mythos Preview / 각 12시간 실행
실험2 결과
초기 모델은 PR 충돌로 병합률이 낮고, 최신 모델은 협업 자체를 줄여 충돌을 회피

45个智能体同时翻查代码时

Anthropic旗下前沿红队团队公开了AI智能体相互作用情况的实验结果。团队认为,随着智能体在代码库、市场及各种社会系统中承担的工作越来越多,智能体之间的相互作用可能比人与人之间的相互作用更早爆发式增长。问题在于,目前世界还不清楚这种相互作用能顺利运转的条件。

为验证这一点,团队进行了开源漏洞检测实验。团队给45个智能体每人分配一台虚拟机(VM)和一个共享论坛,并下达相同指令,要求在15个开源项目中寻找漏洞。智能体们相互对同行的成果进行评审,另有一个仲裁智能体最终判定提交的漏洞是否新颖且有效。这与Anthropic在Project Glasswing中用于扫描开源项目的方法一脉相承。

结果用Claude Mythos Preview和Opus 4.8两个模型进行了比较。以Mythos Preview为基准,简单独立并行方式使用650万个代币找到21个漏洞,而协作集群方式使用2700万个代币找到266个漏洞。不过,集群方式发现的漏洞中约有一半出现在并行方式被指示的核心目录之外。如果将范围缩小到核心目录,两种方式在代币消耗与发现数量的比率上相近。两种方式共同发现的漏洞仅有12个。

开发游戏后暴露出的协作局限

在相互依赖度高的任务中,协作会变得困难得多。为验证这一点,团队让多个智能体集群完成一项任务——制作一款基于文本的网页奇幻游戏。每个智能体都能访问自己的虚拟机、共享论坛及自托管的代码仓库,集群工作了12个小时。团队在改变模型代数与智能体数量的同时,还试验了三种提示方式:基本型、角色分工型(区分编程、美术、测试团队)以及CEO层级型。

然而,即使改变提示方式,结果也没有太大差异。三种方式完成的游戏都无法以人类的速度运行,界面难以辨识,学习曲线陡峭。团队表示,当前模型在这类创作领域品味不足,需要大量人工介入。

即便结果相似,不同模型代数之间的协作方式却明显不同。Sonnet 4.6和Opus 4.6看似在同一文件上提交代码进行协作,但被合并(merge)的拉取请求(PR)比例较低,这意味着相互冲突的代码被搁置未处理。相反,更新的模型Opus 4.8和Mythos Preview解决了这一合并问题,但其方式是彼此几乎不再协作。

两项实验揭示的问题

项目独立并行方式协作集群方式
发现漏洞数(Mythos Preview)21个266个
使用代币650万2700万
重叠发现12个(共同)12个(共同)
模型代数PR合并倾向代码共享模式
Sonnet 4.6, Opus 4.6合并率低冲突后搁置
Opus 4.8, Mythos Preview合并率稳定将协作本身降到最低

将这两张表放在一起看,可以发现有趣的对比。在像漏洞探索这样可以独立拆分任务的问题上,集群协作提高了发现量。但在像代码仓库这样彼此依赖成果的任务中,模型越智能,反而越"适应性地"减少协作以避免冲突。

编辑视角

这项实验有趣之处不在于结果本身,而在于失败的形式。在游戏开发实验中,最新模型虽然改善了"合并率"这一指标,但令人痛心的是,其方法并非真正提升了协作能力,而是回避了协作。仅看基准数字似乎有所进步,但实际上更接近于绕过了问题。这种指标假象的模式,可能会在智能体评估领域反复出现。

以往谈论多智能体系统时,大多是从"能同时运行多少个"这种规模问题切入。8月8日公布的Kimi Agent Swarm将重点放在最多并行部署100个子智能体上,也是同样的思路。但这次Anthropic的实验着眼于"如何失败",而非规模,这一点截然不同。它表明,增加智能体数量,与智能体在相互依赖的任务中真正实现良好协作,是完全不同的问题。

在实务层面,需要将两者区分使用。像漏洞扫描或数据标注这样可以独立拆分的工作,目前仍值得尝试使用智能体集群,但需要考虑到代币成本会比并行方式高出4倍以上。相反,多个智能体共同修改同一代码库或文档的工作,以现在这代模型来看,最好还是认为需要人类在每次合并时持续介入。

未来几个月,前沿实验室很可能会将训练信号从"避免冲突"转向学习"真正的协调"。相比合并率这样的表面指标,衡量代码共享比例或实际贡献度等协作质量的指标,很可能会出现在下一代模型卡中。