MMLU-Pro
一种用更难的题目来测试AI模型在多领域知识与推理能力的基准考试。
简单来说
MMLU-Pro是用来衡量AI模型实力的一种「试卷」。它把数学、法律、医学、工程等多个科目的题目混在一起出题,再根据模型答对的题数打分。就像人靠考取资格证来证明实力一样,AI公司在推出新模型时,也常常拿这类考试成绩来说「我们的模型有多聪明」。
名字里的Pro表示这份试卷比原来的版本做得更难。以前的考试只有4个选项,靠瞎猜也有一定概率蒙对;而这份试卷把选项增加到10个,题目本身也改得更容易混淆,必须真正理解才能答对。因此,它被用来弥补旧版考试中模型之间分数差距拉不开的局限。
不过,考试分数并不能说明能力的全部。有些模型可能是把考题提前混进了训练数据里「背」下来的,也可能存在考试成绩好但实际工作表现差的情况。所以比起只看一个分数,同时参考多项测试结果会更可靠。
