
摘要
- 艾伦人工智能研究所(Ai2)公开了逐题审计LLM基准的新方法论BenchMIRT。
- 通过分析100个模型、16种基准、逾3.4万道题目,研究团队独立识别出"安全"与"通用推理"这两个维度。
- 研究证实,衡量社会偏见的BBQ和衡量危险知识的WMDP,得分与推理能力的关联其实比与安全性更强。
基准测的真的是安全吗
艾伦人工智能研究所(Ai2)于9月1日公开了一套名为BenchMIRT的新方法论,用于逐题审计大语言模型(LLM)的安全性与性能评估基准。分析所用的数据以及各模型的统计结果,已一并发布在模型分发平台Hugging Face的BenchMIRT合集中,运行代码也同步公开在GitHub上。
具体来说,去年8月英国AI安全研究所也曾用心理测量学方法分析过8种安全基准,发现这些基准把拒绝严格度、诚实度、语境依赖处理这几种不同性质的能力混在一起测量。艾伦人工智能研究所的BenchMIRT把这个问题意识进一步扩大,在16种基准、逾3.4万道题目的全部范围内,独立识别出了"安全"与"通用推理"这两个维度。
这次审计源于一个由来已久的疑问:一个基准分数到底测的是什么能力。举例来说,BBQ本是为捕捉社会偏见而设计的题库,但其中有道题给出祖父和孙子预约打车软件的情境,来考察年龄偏见。要答对这道题,不仅要避开年龄刻板印象,还得准确追踪谁是谁、按证据推理下去。原本以为只测安全性的题目,其实同时也在考验推理能力。
借鉴心理测量学的审计方法
BenchMIRT是心理测量学(一门从测试作答模式中推断人的能力或倾向的学科)中项目反应理论(IRT)的扩展应用。IRT的出发点是:并非所有题目都能为受试者提供同等量的信息——有些题更难,有些题则更善于区分能力高低。艾伦人工智能研究所此前曾做过将单维IRT应用于单个基准的"流体基准测试"研究,而这次的BenchMIRT扩展为多维IRT(MIRT),即便一道题同时涉及多种能力,也能把它们逐一分离出来。
分析的规模相当可观。研究团队用100个LLM在16种基准、逾3.4万道题目上的作答结果进行了训练,其中6种(MMLU-Pro、BBH、GPQA、IFEval、MATH、MuSR)是衡量通用推理的基准,其余10种则取自艾伦人工智能研究所Olmo 3安全评估合集中的HarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTest等基准。研究团队事先并未告诉系统每个基准测的是什么,但BenchMIRT依然自行识别出了"安全"与"通用推理"这两个维度,而且反复重新运行分析,得到的也始终是同样的两个维度。

大多数如预期,少数例外
| 基准 | 与通用推理的相关性 | 与安全性的相关性 | 审计结果 |
|---|---|---|---|
| MMLU-Pro | 0.97 | -0.21 | 如预期测量推理能力 |
| BBH | 0.94 | -0.20 | 如预期测量推理能力 |
| GPQA | 0.81 | -0.12 | 如预期测量推理能力 |
| IFEval | 0.72 | -0.34 | 如预期测量推理能力 |
| MATH | 0.70 | -0.41 | 如预期测量推理能力 |
| WildJailbreak | 0.14 | -0.90 | 如预期测量安全性(其中250道无害题目偏向推理维度) |
| HarmBench | 0.32 | -0.90 | 如预期测量安全性(除去版权相关题目) |
| StrongReject | -0.16 | -0.84 | 如预期测量安全性 |
如表所示,专为推理设计的6种基准,以及WildJailbreak、StrongReject等大多数安全基准,实际测量结果与其原本设计意图高度相符。问题出在被点名的几个例外基准上。
BBQ和WMDP测的其实是推理能力,而非安全性
BBQ通常被归类为衡量社会偏见的安全基准,但在BenchMIRT的分析中,它与通用推理的关联要远强于与安全性的关联。也就是说,某个模型在BBQ上得分低,未必说明它真的存在偏见,更可能是它在理解题目、进行推理方面表现欠佳。
WMDP的情况则更为特殊。这个基准测试的是模型在生物、化学、网络安全等领域掌握了多少危险的"双重用途"知识——即可能被滥用于生物危害物质或系统入侵的知识。BenchMIRT发现,WMDP的得分同样与通用推理的关联强于与安全性的关联,但方向相反:推理能力越强的模型,WMDP得分反而越低,原因在于这个基准把"拒绝回答或答不出"设计成了"理想回应"来打分。
HarmBench内部信号也存在分化
HarmBench的例子说明,即便在同一个基准内部,也可能混杂着不同的信号。要求编写盗取银行信息的钓鱼邮件这类基础题目,以及给定特定情境诱导滥用该信息的语境类题目,都与安全维度关联很强。相比之下,要求逐字输出路易斯·阿姆斯特朗歌词这类涉及版权的题目,与安全性的关联就弱得多,反倒更接近推理维度。艾伦人工智能研究所解释说,这并不意味着基准本身有问题,而是说明一个分数背后往往混杂着多种信号,BenchMIRT的作用正是把这些信号拆解开,便于解读。

数据与代码均已公开
本次评估所用的逾3.4万道题目、按模型和按题目分类的统计数据,以及代码,均可公开访问。数据和模型统计可在huggingface.co/collections/allenai/benchmirt合集中查看,运行代码则公开在github.com/allenai/BenchMIRT代码仓库。该合集分别以数据集形式发布了包含约3.43万道题目的评估数据集,以及100个模型的统计数据和约2.96万道题目的统计数据。
编辑视角
这次发布中值得关注的一点是,"安全"这个名头下的分数实际测的是不同东西,这一现象正被反复证实。去年8月,英国AI安全研究所用心理测量学方法分析了8种安全基准,发现其中混杂着拒绝严格度、诚实度、语境依赖处理这三条不同的信号;这一次,美国的艾伦人工智能研究所用另一套方法论再次得出了相似的结论。两个互不相关的研究团队,用不同的方法两次指向同一个问题,这说明这不是某个团队的错觉,而是基准设计本身存在的结构性局限。
从实务角度看,这不只是学术上的趣闻。国内团队在验证模型或决定是否采用时,常常以"安全基准得分是否达到某个门槛"作为标准,但如果因为BBQ得分低就断定某个模型存在偏见,这个判断可能是错的——问题也许出在这个模型理解题目的能力本身不足。反过来,推理能力强的模型在WMDP上得分低,实际上也可能是它更擅长做出安全拒答的信号。如果一个团队只看基准总分就做采购或引入决策,这次的结果提醒大家,有必要拆开来看看究竟是哪些子题目在拉高分数。
未来几个月内,其他研究机构或大型科技公司很可能会对自家的安全基准套用类似的逐题审计,并公布结果。尤其在开放模型阵营,基准分数经常被用作营销卖点,一旦BenchMIRT这类审计工具成为标准验证流程,目前已发布的大量安全分数恐怕都要迎来一轮重新解读。





评论