Elo rating
让两个对象一对一较量,根据胜负结果调整分数,从而衡量相对实力的排名评分体系
简单来说
Elo rating最初是为了给国际象棋选手的实力打分而设计的一种算法。它不是给出一个绝对分数,而是让两名选手对战,只根据谁赢谁输来调整排名。战胜强手,分数会大幅上升;输给弱手,分数则会大幅下降。
AI行业把这种方法直接搬来评估产出结果。比如让两个AI代理各自完成同一项任务,评审者只需要把两份结果放在一起,选出哪一份更好,而不用给任一结果打绝对分。把这个过程重复几百次,就能给那些没有标准答案的任务(比如视频剪辑、3D建模这类难以简单判断对错的成果)排出名次。
和有标准答案的考试不同,Elo rating是一种相对评价,它展示的不是「这个代理的实力是多少分」,而是「这个代理是否比另一个代理更好」。因此,在评估没有固定正确答案的复杂实际任务时,这种方法尤其有用。
在报道中是这样出现的
Meta AI发布的评估框架WildArtifactBench,会让代理的产出结果两两对战,据此计算胜率和Elo rating。和常见的误解不同,这种方式不是像考试那样对照标准答案打分,而是通过与另一个代理的产出结果相比较,判定哪一方相对更好。
