Benchmark
AI模型们一起参加的标准化考试。「哪个模型更聪明」这类报道里的分数,依据都来自这里。
简单来说
基准测试(Benchmark)是AI模型们在同样条件下一起参加的标准化考试。就像用高考分数比较考生一样,让模型们做同一套题来进行比较。「哪个模型更聪明」这类报道里引用的数字,全都来自这里。
科目也是五花八门。综合常识(MMLU)、博士级科学(GPQA)、数学竞赛(AIME)、实战编程(SWE-bench)——新模型发布资料里柱状图上那些看不懂的字母组合,都是考试的名字。
阅读时要注意两点。第一,公布的分数大多是「自我评测」——由公司在对自己有利的条件下测出来的数值,可能与第三方验证结果不同。第二,考试考得好,和实际干活干得好,是两件事。「基准测试污染」的争议也不少见——题目泄露,导致分数虚高而实力并未真正提升。所以与其纠结几分的差距,更准确的做法是看「用的是哪个考试、谁测的」。
在报道中是这样出现的
「新模型宣称在主要基准测试全线超越竞争对手」——用「宣称」这个措辞,正是因为上面提到的自我评测问题。METAL的基准测试专栏里可以看到各项考试的详细说明。
亲手试一试
- 搜索「LMArena」(Chatbot Arena)并进入该网站——这是一个盲测对比平台,隐去模型名称,把两个AI的回答并排展示出来。
- 随便提出一个问题,为更好的回答投票。投票后会公开这些回答分别来自哪个模型。
- 数百万次这样的投票积累起来,就形成了「Arena排名」——通过它可以亲自确认,考试分数(基准测试)和人们的实际感受(Arena)有时并不一致。
