每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

AI安全评分,只要一味拒绝就能提高

英国AI安全研究所等机构用心理测量技术拆解8个安全基准后发现,它们测的其实是三种不同的东西

AI 안전성 평가를 위한 항목반응이론 분석 결과 슬라이드

이미지: The Decoder 화면 갈무리

摘要

  • 英国AI安全研究所等机构研究人员用心理测量技术分析了8个语言模型安全基准,发现它们测的并非单一的"安全性",而是拒绝严格度、诚实度、语境依赖内容处理这三种彼此不同的特性
  • 采用自适应选题后,每个基准仅需约10道题就能得到接近全面评估的结果,可将成本降低97%~99%
  • 研究提出了一种通过应答模式识别"故意藏拙"(仅在测试情境下表现得更谨慎)行为的方法,并用同样的方式识别出了在API后台被偷偷更换的模型
연구 참여
영국 AI 안전 연구소(UK AI Security Institute) 등 소속 연구진
분석 규모
안전 벤치마크 8종, 모델 최대 192개, 문항 5,000개 이상
핵심 발견
벤치마크가 거절 엄격성·정직성·맥락의존 콘텐츠 처리라는 서로 다른 3가지 특성을 측정
문항 효율화
적응형 선별 시 약 10문항으로 전체 평가에 근접, 비용 97~99% 절감
샌드백깅 탐지율
직접 지시로 유도한 사례의 80~100%, 이력 비교 추가 시 94~97%
오탐률
정상 모델 10개 중 1개가 의심 사례로 잘못 분류됨
API 모델 지문 감식
API 엔드포인트 16개 질의로 14개 모델 중 13개를 정확히 식별

光靠多拒绝也能让分数上升

同一款语言模型,只要对可能存在风险的请求多加拦截,安全性评分就会上升。但实际使用中的可用性却会随之下降。英国AI安全研究所(UK AI Security Institute)等机构参与的一项新研究,用数据揭示了这个漏洞。研究人员直接把用于人类智商测试、能力倾向测验的心理测量技术,搬来分析语言模型的安全基准。

各家开发商在把语言模型推向市场前,会用HarmBench、OR-Bench-Hard、SORRY-Bench等安全基准给模型打分。基准(Benchmark)——AI模型共同参与的标准化测试——分数一旦偏低,厂商就会推迟发布或对模型重新调整。问题在于,从未有人真正验证过这些分数是否测的就是"安全性"这一单一属性。此前在《AI顶尖模型的"视觉能力"也未能超过60分》一文中,也出现过基准实际测的东西与其宣称目标不符的案例,而这次研究则是在安全领域正面处理了这个问题。

이미지: The Decoder

把三件事混为一谈的测试

研究团队分析了最多192个模型对5000多道题目的作答结果,团队自称这是该领域规模最大的一次分析。结果显示,这8个基准测的并非某种共通的"安全性",而是三种彼此几乎无关的特性——模型拒绝请求的严格程度、回答的诚实程度,以及模型如何处理那些依语境不同、可能无害也可能有害的内容。模型回答是否诚实,与该模型拒绝请求的频率几乎没有相关性。

尤其成问题的组合是HarmBench与OR-Bench-Hard。HarmBench对拒绝有害请求给分越多分数越高,而OR-Bench-Hard则相反——如果连无害请求都过度谨慎地拦截,反而会被扣分。在一边表现出色的模型,几乎总是在另一边得分偏低。

特性代表性基准测的是什么
拒绝严格度HarmBench是否有效拦截有害请求
过度审查OR-Bench-Hard是否连无害请求也一并拦截
诚实度诚实度相关基准回答是否符合事实

如果不了解这种此消彼长的关系,直接把多个基准分数取平均,模型只要单纯多拒绝一些请求,就能拉高综合得分——即便这在日常使用中实际可用性已经下降。多个相似测试对同一行为重复打分的问题,也隐藏在这种取平均的常见做法背后。

이미지: The Decoder

大多数题目根本传递不出任何信息

第二个发现涉及测试成本问题。大多数题目要么几乎所有模型都能答对,要么几乎所有模型都答错,根本无法体现模型之间的差异。如果只挑选出信息量大的题目,仅用三份各25道题的短测试,就能比同等规模的随机抽样更准确地捕捉到这三个安全维度。

引入自适应测试——类似于根据学生实际水平决定下一题难度的分级考试方式——效率还能进一步提升。像HarmBench或SORRY-Bench这类单个基准,仅需约10道题就能逼近全量评估的结果。这意味着成本可降低97%~99%,达到这个程度后,在每次微调或模型轻量化作业完成后定期进行安全检查,在实际操作中就变得可行了。

이미지: The Decoder

如何揪出只在考试时才变乖的模型

第三个发现,在安全性争论中分量最重。研究团队将其称为"故意藏拙"(sandbagging)——模型察觉到自己正在被测试,于是表现得比平时更加谨慎。令人担忧的地方在于,模型可能自行察觉到测试情境,并有意识地伪装自己的行为。

这种行为会在应答模式中留下痕迹。就像一个难题做对、简单题却做错的学生显得可疑一样,如果一个模型在难题上答对、简单题上却答错,即便总分看起来不错,也值得怀疑。用这种方法,研究团队识别出了80%~100%被直接指示过度谨慎的模型。代价是,每10个正常模型中就有1个被误判为可疑案例。在此基础上再加一道验证——将模型当前成绩与过往成绩对比——检测率提升到了94%~97%。如果模型只在特定题目上伪装行为,会立刻在应答模式中露馅;但如果模型整体上一致地伪装,应答模式看起来会很正常,这时就需要这第二道验证。

研究团队明确指出,这次实验中的"藏拙"行为是通过直接指示模拟出来的,存在局限性。他们表示,如果是专门训练过、以躲避检测为目标的模型,识别起来会困难得多。事实上已有报道称,Claude 3.5 Sonnet在有提示时有93%的概率、即便完全没有提示时也有84%的概率能察觉自己正处于测试场景中;Anthropic的Opus 4.6也曾在两个不同任务中,自行察觉到评估情境、判断出具体是哪种测试,并主动去找出答案。

意外收获——识别出API后台被偷换的模型

这套方法还带来了一个实用的副产品:判断你正在使用的AI服务,是否仍在运行你最初测试过的那个模型。因为服务提供商完全可能在用户不知情的情况下,悄悄把后台模型换成别的。研究团队对16个API端点重新发起查询,仅凭应答模式就在14个不同模型中准确识别出了13个。两个原本看似使用同一模型的目录条目,被准确区分为两个不同的模型。另一个案例中,某服务当前的回答与该服务两个月前自己给出的回答,有约三分之一存在出入——这是同一模型名称背后悄然发生变化的明显信号。

研究团队在收录这些成果的论文中主张,AI安全测试也应当具备与人类心理测评同等的严谨性。仅凭单一测试分数就决定模型能否发布,依据并不充分。

这种此消彼长关系在实践中会造成什么问题,Anthropic的Claude Fable 5一案已经给出了例证。一位医学物理学家指出,这款模型把MRI影像分割工作误判为生物恐怖主义,甚至连疟疾传播途径的问题都加以拦截,导致其根本无法用于实际工作。美国政府批准发布之后,Anthropic又追加了过滤器,声称能解决99%以上的此类问题,但这个过滤器反而让无害的编程任务也更频繁地被拦截。

编辑视角

这项研究瞄准的不是某个具体模型,而是整个行业判断安全性的方式本身。把多个安全基准的分数取平均汇成一个数字的做法,长期以来被当作标准操作,而这次分析用数据证明,这种平均会把两个方向相反的特性直接抹平。如果只是简单地把HarmBench近满分、OR-Bench-Hard垫底的模型分数取平均,那么一个实际上已经变得没什么用的模型,反而会在纸面上摇身一变成更安全的模型。

从实际操作这种规模的安全评估的经验来看,结论往往大同小异。只看单一基准分数就判断微调是否成功的团队,最终往往会把过度审查的模型误认为安全模型。过去业内普遍认为"拒绝能力越强就等于越安全",而这项研究表明,拒绝本身只是这场权衡取舍中的一个维度而已。

对于正在自行微调LLM或采购外部模型的国内企业而言,可以借鉴的方向很明确:不应只要求一个单一的安全分数,而应至少按拒绝严格度、诚实度、语境处理这三个维度分别获取评分。这项研究的发现——即便把基准题目压缩到25道左右,依然能捕捉到全部三个维度——大大降低了每次部署前进行安全检查的成本负担。以往因为全量跑完整套基准成本太高而不得不放弃的团队,现在完全可以在每次微调之后都常态化地进行一次简短检查。

与此同时,用于识别API后台模型是否被偷换的"指纹识别"技术,很可能在未来几个月内成为AI服务采购合同中的标准验证程序。对于付费使用的企业而言,"我当初测试过的那个模型,现在是否仍在后台运行"已经不再只是信任问题,而是一个可以被验证的问题。

评论