grader
代替人工给AI答案打分、判断对错和质量高低的另一个AI模型。
简单来说
grader是代替人工为AI的回答打分的另一个AI。可以把它想象成考试:学生(被评估的AI)作答后,需要有老师来判定答案对不对、这份答案值多少分。当这个老师的角色由AI模型而不是人来担任时,这个负责打分的AI就叫做grader。
为什么要用AI代替人工打分呢?如今评估AI模型往往需要审阅成千上万道题目和回答,人工一一阅读评分实在太耗时。于是打分这件事本身就交给了另一个AI,再把结果汇总成最终得分(指数)。
这里有一个重要的陷阱:换掉打分者,同一份答案也可能得到不同的分数。就像同一张考卷,换成评分更严格的老师来判卷,分数就会不一样。所以当评测机构宣布升级了grader模型时,升级前后的分数就很难直接放在一起比较了。
在报道中是这样出现的
文章提到,"用于打分的grader模型升级"是这次指数改版的核心变化之一。常被误解的是,这条消息并不意味着某个AI模型的实力变好或变差了。改变的是打分的一方,而不是被打分的AI模型本身的能力。不过由于打分标准发生了变化,改版前后的分数也就很难用同一个尺度来比较。
