BenchMIRT
一种统计审计方法,用来检验AI基准测试实际衡量的能力是否与其宣称的一致
简单来说
基准审计方法论(BenchMIRT)是一种验证方法,用来深入探究给AI打分的题库是否真的在衡量它所宣称的能力。这里的"题库"指的是为了给AI的性能或安全性打分而制作的标准化问题集,也就是所谓的基准测试(benchmark)。
打个比方,体检项目里有一项叫"压力指数",但后来才发现它实际上一直只是在测血压。如果一道题被标注为衡量安全性,但实际上同时也在衡量模型对上下文的理解能力,也就是推理能力,那么只看这个分数就断定"这个AI很安全"是很危险的。
这种审计方法借用了检测人类性格或智力时使用的统计技术,反向追溯每一道题究竟与某种隐藏的潜在特质有多大关联。它的特点在于,即使事先不告知这道题是为了衡量哪种能力而设计的,仅凭作答结果就能自动区分出两种以上不同的特质。
在报道中是这样出现的
文章中通常这样使用:"艾伦人工智能研究所通过BenchMIRT揭示,安全基准BBQ实际上衡量的是推理能力。"容易被误解的一点是,BenchMIRT并不是创建新的测试题目来重新评估AI。它只是一个事后审计工具,用来核查现有测试分数究竟反映了什么,而不是对AI本身进行重新测试的程序。
亲手试一试
- 在模型分发平台Hugging Face上搜索BenchMIRT合集。
- 找到你感兴趣的题库(例如BBQ、MATH),查看其在安全轴和推理轴上的相关性得分。
- 比较相关性得分是否在与原本意图(例如衡量安全性)不同的轴上更高。
- 如果需要运行代码,可以下载一并公开的GitHub仓库,将同样的流程应用到其他基准测试上。
