RHAE Best@1
一种评分标准,只对AI智能体单次尝试的表现打分,并剔除因执行环境出错而导致的无效尝试,而非智能体本身推理失败的情况。
简单来说
RHAE Best@1是一种评分方式,把AI智能体针对某个问题只尝试一次所得的分数直接算作最终成绩。这有点像跳水比赛裁判只根据选手的实际动作打分——如果跳板突然断裂导致选手摔倒,这不会算作选手的失误,而是让选手重新跳一次。这项指标也是同样的道理:它把智能体真正没能解出问题的情况,和因调用工具时程序中断而导致尝试本身作废的情况区分开来分别计算。
这项指标登上新闻,是因为同一套测试题的分数从30%跃升到了95.5%。负责实际推理的模型本身没有变,只是包裹模型、负责处理工具调用和错误恢复的执行环境被更换了,分数却翻了三倍还多。在旧的执行环境下,很多模型本来判断正确、却因为程序中途中断而被记录为失败的情况屡见不鲜,而RHAE Best@1正是为了过滤掉这类噪音、让数字更接近模型真实能力而设立的评分标准。
所以看这个数字时,需要同时确认两点:用的是哪套测试题,以及为这套测试题打分的执行环境是什么。这个案例说明,只要更换执行环境,同一个模型也可能得出完全不同的分数。
在报道中是这样出现的
文章报道称"ARC-AGI-3的RHAE Best@1指标从30%升至95.5%"。这里容易产生的误解是,以为模型本身变聪明了。但按照Prime Intellect的说明,真正改变的是包裹模型的执行环境,而RHAE Best@1所展示的,正是更换执行环境后,那些原本被误判为失败的尝试大幅减少的结果。
