
이미지: METAL LAB 생성
摘要
- NVIDIA研究团队给Claude Opus 5套上自研harness AVO,在ARC-AGI-3基准测试中拿到100%的分数
- 同一模型在没有harness的情况下运行时得分只有30%,但这已是所有受测模型中的最高分
- OpenAI此前也曾在同一基准测试中仅调整两项harness设置就把分数提高了三倍,但仍未达到100%
- 실험 모델
- Claude Opus 5 (앤스로픽 개발)
- 커스텀 하네스 적용 시 ARC-AGI-3 점수
- 100%
- 하네스 없이 나온 원래 점수
- 30% (테스트 모델 중 최고치)
- 오픈AI 모델의 원래 점수
- 10% 미만
- 오픈AI, 설정 2개 조정 후 점수
- 3배 상승, 100%는 미도달
- 엔비디아 자체 하네스 명칭
- Agentic Variation Operators (AVO)
- 발표자
- 아델 엘 할라크, 엔비디아 AI 부문 제품담당 부사장
- 하네스가 비용에 미치는 영향(데이터브릭스 7월 연구)
- 같은 모델도 하네스에 따라 비용 최대 2배 차이
开着同一个AI模型不变,只换了外壳,得分就从30分跃升到100分。这是NVIDIA研究团队在当地时间21日公布的实验结果。原样使用Anthropic的Claude Opus 5时,在交互式推理基准测试ARC-AGI-3中得分为30%,这已是受测模型中的最高分。但给这个模型套上NVIDIA自研的软件外壳后,得分升到了100%。ARC-AGI-3是一套没有任何提示、需要自行摸索规则的2D游戏集,NVIDIA相当于像人类一样把它全部通关了。
什么是Harness
Harness是包裹AI模型的软件骨架。它决定模型能使用哪些工具、如何记住此前的对话或工作内容、在卡壳时按什么规则决定下一步行动。据原文报道,模型本身相当于智能体的"大脑",而harness则是让这个大脑真正动手动脚去干活的骨架。这套骨架的作用在需要连续数天做出多次判断、无法一两天内完成的长周期任务(long-horizon task)中尤为突出。NVIDIA公布的研究指出,在这类长周期任务中,harness设计对结果的影响比模型选择更大。
NVIDIA的AVO与监督者
NVIDIA打造的这套harness名为Agentic Variation Operators,简称AVO。它不仅精细调优了内存管理,还额外加装了一个扮演"监督者"角色的组件,用于在智能体不断在死路里打转或重复走过的路径时予以纠正。副总裁El Halak向TechCrunch解释道:"监督智能体就像CEO一样,会不时地推一把智能体。"监督组件本身并非全新概念,但据NVIDIA方面介绍,目前大多数开发者使用的Claude Code、Codex、Hermes等harness大都以单层结构运行,并不含这层监督机制。需要说明的是,AVO并非NVIDIA新推出的商业产品。NVIDIA以Nemo品牌公开了构建harness所需的多种组件,其中一部分是商用的,一部分则以开源形式发布。
OpenAI也曾遇到同样的问题
在ARC-AGI-3测试中,OpenAI的模型得分不到10%,成绩不佳。OpenAI自己也对这一结果感到困惑,于上个月展开了自主实验。OpenAI公布的自测结果显示,仅调整两项harness设置,得分就翻了三倍。不过没有一个模型达到NVIDIA所实现的100%。NVIDIA认为,这一差距源于是否存在监督层。此前微软去年4月曾用文档编辑等长周期任务测试19个大型语言模型,结果显示即便是排名靠前的顶尖模型,交出的成果也都漏洞百出。此外还有报告称,在没有监督、让智能体长时间独自运行的情况下,曾出现整个删除用户文件或数据库、甚至为达成目标而串通作弊或实施黑客攻击等案例。
Harness也决定成本
得出这一结论的不止NVIDIA一家。Databricks去年7月公布的研究显示,harness不仅左右性能,也左右成本。Databricks首席执行官Ali Ghodsi向TechCrunch表示:"即便选择同一个模型,只要harness不同,成本就会出现巨大差异。用错harness的话,成本可能翻倍。"这意味着,在断定某个模型"贵"或"便宜"之前,首先要看它是搭配在哪种harness上运行的。NVIDIA以这些结果为依据主张,与其由个别公司封闭把持harness,不如以开源方式公开,这样才能提升整个生态系统的准确率。El Halak还表示,OpenAI近期放慢模型训练速度,也与模型引发的安全事故不无关系,并补充道:"能够统管harness、基础设施与运行时整体的开放智能体技术栈,是推动生态系统安全向前发展所必需的。"
Harness标准化的动向已经在云计算行业初见端倪。亚马逊去年8月正式推出自家的AWS Bedrock AgentCore harness,并将其以开源连接器的形式接入n8n等自动化工具,便是代表性案例。
编辑视角
这项实验之所以有意思,关键就在于所选的基准测试本身。ARC-AGI-3在业内一直被传是"专为针对OpenAI而设计"的基准测试。它是一套没有任何提示、需要自行摸索规则的2D游戏,设计初衷就是让仅靠统计模式匹配能力的语言模型难以突破,而OpenAI的模型在这里的确交出了不到10%的惨淡成绩。如今在这个基准测试上,NVIDIA不仅拿下了满分,用的还是竞争对手Anthropic的模型——这说明NVIDIA无需亲自下场打聊天机器人大战,也能搅动整个牌局。NVIDIA本来就不卖模型,卖的是"铲子",也就是芯片和harness这类基础设施。无论上面装的是Opus、GPT还是Gemini,只要能让任何模型都跑得顺畅的骨架掌握在自己手里,最终握有话语权的就是这一方——这才是这场实验真正想传达的信息。
过去一两年间,关于智能体性能的争论,焦点始终落在"哪个模型更聪明"上。这次的结果改写了这个问题本身。如果同一个模型仅仅换了harness,得分就能拉开三倍以上的差距,那么企业过去花在比较模型订阅费用上的大量时间,恐怕都用错了地方。对于国内正打算引入智能体的企业而言,眼下比起"该用哪个模型",先弄清楚"内存管理和监督层该怎么搭",从实务角度看反而更划算。尤其是打算把长周期任务自动化的团队,如果只挂一个没有监督组件的单层harness,指望智能体能自行妥善处理,如今这种做法已经站不住脚了。
预计未来数月内,Anthropic、OpenAI、Google阵营也会陆续推出自带监督层的harness。比较harness规格说明书,而非仅仅比较模型卡片,将成为智能体落地实务的新标准。




评论