
摘要
- GPT-6 Astra在ARC-AGI-3测试中,标准测试框架下得分62.7%,而OpenAI一同提交的供应商适配器测试框架下得分高达99.9%。
- 这个适配器能把模型内部的推理状态保留到下一次请求。在相同的167款游戏中,速度快了3.66倍,消耗的Token也少了49%。
- Claude Opus 5单独测试时只有30.16%,但套上NVIDIA AVO和AWS Strands脚手架后,分别拿下100分和99.95分。
9月2日提交给ARC Prize的GPT-6 Astra成绩单上,同一个模型出现了两个分数:标准测试框架下是62.71%,供应商适配器测试框架下则是99.95%。模型权重一样,题目一样,游戏也一样,分数却相差了37个百分点。OpenAI的Greg Brockman就此评论说,ARC-AGI-3现在已经饱和了。
我们昨天已经报道过Astra发布本身。今天要看的,是发布之后跟着出现的这些数字。先说结论:这次成绩的主角不是模型,而是包裹在模型外面的那层外壳。
测试框架带来的37个百分点差距
ARC-AGI-3和前两代性质不同。它不是那种一次性写出答案的考试,而是把模型丢进一个完全不知道规则的游戏里,看它需要多少步才能摸清规则并通关。因此,模型在每一步里能带着多少之前摸索出的信息继续走,就决定了最终得分。
测试框架就是负责管理这种"携带"的外部程序。ARC Prize的标准测试框架被设计成能统一套用在任何公司的模型上,所以它只会把模型自己挑出来记下的笔记传递到下一步。相比之下,OpenAI一并提交的供应商适配器测试框架,会把模型内部完整的推理状态原封不动地保留到下一次请求,对话变长时就压缩后再拼接起来。
打个考场的比方就容易理解了。标准测试框架每做完一道题就会收走答题卡,只允许考生带着手写的一张便条进入下一题。供应商适配器则让考生把解上一题时脑子里搭建好的整个思路原样带进下一题。同一个人考同一场试,分数出现差异也就不奇怪了。

效果不仅体现在分数上。据ARC Prize测算,在两种测试框架都能通关的167款游戏中,适配器一方的速度快了3.66倍,消耗的Token也少了49%。就连成本也发生了逆转:按最高推理设置计算,标准测试框架花费26,098美元,适配器则只要17,332美元。
成本这件事值得多说一句。ARC Prize也把人类参赛者的基准换算成了金额,算上时间报酬,人类玩一局游戏的成本是12.78美元。Astra在最高设置下花费的26,098美元和17,332美元,是跑完整套测试的总费用,两者不能简单类比,但有一点没有变:就目前而言,解这套题最便宜的办法依然是找人来做。
Opus 5的30.2%,讲的是同一个故事
并排列在Astra成绩单上的Claude Opus 5的30.16%,如今被各方拿来做比较。Opus 5在7月24日提交时曾是ARC-AGI-3的最高分,比它之前的纪录——GPT-5.6 Sol的7.8%——足足高出了近四倍。
但同一个Opus 5,套上不同外壳的纪录其实已经出现过两次。据The New Stack报道,NVIDIA在8月用自家智能体系统AVO包裹Opus 5,在183个关卡中拿到了相对人类行动效率100.00的成绩。AWS也用Strands智能体在同样的183个关卡中拿到99.95分,一次连续运行8小时,消耗Token费用830美元,期间智能体自己写出了734个用于各游戏解析器和模拟器的Python脚本。在25款游戏里,有10款直接复用了之前写好的脚本。

赤手空拳只有30%,套上外壳就变成100%。这个差距上个月已经被Opus 5证明过一次,而这次Astra在自己的成绩单里,一次性把同样的差距摆在了眼前。AWS团队写道,基准测试的分数量的从来不是模型的极限,而是测试框架的缺失。
Astra真正做对了什么
撇开外壳的话题,Astra身上确实还留下了一些属于自己的东西。ARC Prize记录到,Astra在解题时会用自己发明的简化符号来记录游戏状态。这不是从训练数据里搬来的现成记法,而是针对每款游戏临时创造的速记法,ARC Prize将其形容为一种自发涌现的速记,而非编程语言。
行动效率也很突出。在全部关卡中,Astra有96.0%的比例用比人类基准更少的步数通关,平均每个关卡少用了51.7%的动作。人类基准是让大约500名普通参与者玩同样的游戏得出的数值。在前几代测试中,Astra在ARC-AGI-1上拿到97.5%,在ARC-AGI-2上拿到95.0%。
ARC Prize同时也划清了界线:让这套测试趋于饱和,并不等于证明实现了AGI;ARC-AGI-3的规则是确定性且封闭的,无法替代现实世界的复杂程度。
标准测试框架下的62.71%本身也是一项纪录
很容易被适配器的争论盖过去,但在所有模型都站在同一起跑线的标准测试框架下,Astra也拿到了62.71%。这比7月24日提交的Opus 5的30.16%高出一倍还多,和更早之前GPT-5.6 Sol的7.8%相比则是八倍。与前几代不同的是,即便调低推理设置,成绩也不会急剧下滑:最高设置62.71%之下,XHigh是59.34%,High是54.82%,曲线相对平缓。
在通用指标上,变化就小得多了。在Artificial Analysis智能指数上,Astra以61.2分,只是勉强超过了GPT-5.6 Sol的60.9分。价格为每百万Token输入10美元、输出50美元,和Claude Fable处于同一水平。
综合指标原地踏步,却唯独在交互式测试中大幅跃升,正是这次结果引发不同解读的原因。Epoch AI的Greg Burnham将其形容为一个时代的结束,同时也是另一个时代的开始。
编辑视角
这份成绩单里最有价值的一行,不是99.95%本身,而是它和62.71%被并排列在一起这件事。ARC Prize既没有隐藏OpenAI提交的适配器结果,也没有用它取代标准结果,而是两者都照实公布。正因如此,我们才第一次能在同一张表里,把模型本身的能力和外壳带来的能力区分开来。
长期关注基准测试的人,应该对这种局面并不陌生。这和编程测试里同一个模型接上智能体循环后分数飙升、数学测试里多次采样再投票后分数飙升,本质上是同一回事。不同的是,这一次外壳是模型公司自己做出来并提交的,其他公司的模型没能用上这个外壳。The New Stack指出,被拿来比较的几个模型是在不同设置下测出来的,这个批评是站得住脚的。
对国内团队而言,这个教训相当实际:该重新审视一下,花在挑选模型上的时间和花在搭建外围系统上的时间,分配是否合理。在AWS的案例里,真正带来高分的不是更大的模型,而是把记录导出成文件、重新调用自己写过的代码、卡住时能介入的那套机制。830美元、8小时,这个规模是大多数团队都能在内部复现的。
读基准测试表格的方式,也该借这个机会改一改了。往后每个分数旁边,都必须注明是用哪种测试框架测出来的,没有这个信息的数字不能拿来比较。Astra确实是一个强大的模型,这一点没有疑问。而这次的99.95%,除了证明它的实力之外,也同时证明了让这份实力发挥到底的那套装置,分量有多重。





评论