ARC-AGI-3
一项测试:不给AI任何规则说明,让它自己摸索着玩2D游戏,以此衡量它能靠自主判断持续解决问题多久。
简单来说
ARC-AGI-3把一个2D游戏丢给AI,不附带任何说明书,要求它自己摸索出规则并通关。就像人第一次遇到一款新的街机游戏时,只能靠按按钮反复试错来摸清规则一样,AI也必须通过试错找出游戏逻辑才能得分。
这项测试特别之处在于,它考察的不是AI能不能答对一道题,而是AI能否在长达数天、涉及多个步骤的连续判断中保持稳定不乱。正因如此,同一个AI模型,只要包裹它的软件框架不同,得分就可能天差地别。曾有实验显示,模型本身没变,仅仅更换外部框架,分数就从30多分跃升到100分。
也就是说,ARC-AGI-3不仅检验AI模型本身有多聪明,更揭示了如何运行和管理这个模型,对其实际解决问题的能力有多大影响。