每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

AI 术语词典A报道中常见的技术词

ARC-AGI-3

一项测试:不给AI任何规则说明,让它自己摸索着玩2D游戏,以此衡量它能靠自主判断持续解决问题多久。

简单来说

ARC-AGI-3把一个2D游戏丢给AI,不附带任何说明书,要求它自己摸索出规则并通关。就像人第一次遇到一款新的街机游戏时,只能靠按按钮反复试错来摸清规则一样,AI也必须通过试错找出游戏逻辑才能得分。

这项测试特别之处在于,它考察的不是AI能不能答对一道题,而是AI能否在长达数天、涉及多个步骤的连续判断中保持稳定不乱。正因如此,同一个AI模型,只要包裹它的软件框架不同,得分就可能天差地别。曾有实验显示,模型本身没变,仅仅更换外部框架,分数就从30多分跃升到100分。

也就是说,ARC-AGI-3不仅检验AI模型本身有多聪明,更揭示了如何运行和管理这个模型,对其实际解决问题的能力有多大影响。

在报道中是这样出现的

文章1提到一个案例:"直接使用Claude Opus 5时,在ARC-AGI-3上只拿到30%的成绩……但套上一层软件外壳后,分数提升到了100%。"这里容易产生的误解是,以为分数提升是因为模型本身变聪明了,但实际上是因为更换了包裹模型的运行框架(harness)。文章2提到,NVIDIA的新框架NOOA与SWE-bench Verified、CyberGym L1一起,用ARC-AGI-3进行了评估。

相关词条

出现过这个词的报道

浏览全部词条