
이미지: Google DeepMind Blog · METAL LAB 편집
摘要
- 谷歌DeepMind联合新加坡人工智能安全研究所、OpenMined、AVERI和MLCommons,针对Gemini Flash Lite进行了全球首个双盲(double-blind)AI评估试点。
- 借助谷歌云的机密计算技术"Confidential Space",评估机构无法看到模型权重,谷歌也无法看到评估机构出的试题,双方信息都经过加密隔离。
- 谷歌DeepMind解释说,以往的基准测试评估要么由评估方公开试题、让模型有可能提前"背题",要么由模型提供方交出权重、承担知识产权外泄的风险,二者只能选其一。
如果模型提前看过试卷
一个提前看过考题的学生,即便拿满分也毫无意义。AI模型评估也面临同样的问题。如果模型在训练过程中已经接触过基准测试题目,那么它的得分就无法真实反映其实际能力。这种现象被称为"基准测试污染"(benchmark contamination),随着AI模型规模和复杂度不断提升,想要发现这个问题也变得越来越困难。
谷歌DeepMind于8月27日在官方博客宣布,已试点开展了全球首个双盲(double-blind)方式的AI评估。这次试点评估由威廉·艾萨克(William Isaac)、索尔·梅辛(Saul Messing)、克里斯蒂安·拉姆(Christian Lum)等谷歌DeepMind研究人员共同介绍。这次接受测试的并非旗舰级大模型,而是轻量级模型Gemini Flash Lite。
为什么此前只能二选一
一直以来,外部机构想要评估AI模型,只能在两种方式中选择一种。如果评估机构把试题交给模型提供方,就存在模型提前学习这些题目、从而拉高分数的风险;反过来,如果模型提供方把模型权重本身交给评估机构,就得承担知识产权外泄的风险。此前业界一直靠不留日志的操作规范或合同层面的保密条款来防止试题泄露,但谷歌DeepMind表示,这次是首次把加密技术也结合进来。
| 方式 | 评估题目是否暴露 | 模型权重是否暴露 | 遗留风险 |
|---|---|---|---|
| 公开试题型(以往) | 暴露 | 不暴露 | 模型学习试题、拉高分数 |
| 共享权重型(以往) | 不暴露 | 暴露 | 知识产权外泄 |
| 双盲(本次试点) | 不暴露 | 不暴露 | 仅相互确认加密后的结果 |
在加密"盒子"里完成的测试
谷歌此次试点使用了谷歌云机密计算(Confidential Computing)产品组合中的"Confidential Space"。在这个环境中,评估机构看不到Gemini Flash Lite的权重,谷歌也看不到评估机构出的试题。双方的数据都只存在于一个加密的"盒子"内部,盒子外部只会输出结果值。谷歌云将这种方式称为隐私保护环境。
参与这次试点的还有新加坡人工智能安全研究所(Singapore AI Safety Institute)、OpenMined、AVERI,以及MLCommons。谷歌DeepMind表示,为了发现仅靠内部评估可能遗漏的盲区,公司一直在与民间团体及各国AI安全与安保研究机构等外部合作伙伴保持合作。具体方法论和结果详见另行公布的技术报告。
为何在网络安全和政府评估领域愈发重要
谷歌DeepMind表示,这种基于加密技术的评估方式,在网络安全相关测试或政府机构主导的评估等敏感度较高的领域将变得尤为重要。这意味着,在不损害数据主权或安全的前提下,独立机构也能对前沿模型进行严格验证。政策制定者、研究人员和企业都需要能够如实信任AI基准测试分数,但谷歌DeepMind认为,此前一直缺乏支撑这种信任的技术手段。
编辑视角
这次试点之所以重要,是因为基准测试污染的争议早已成为现实。8月10日,一篇论文声称还原了Claude、GPT系列模型的隐藏推理令牌,发现这些模型在应对AIME题目时表现出"提前背过答案"般的反应,这一说法在社区迅速传开。在人们已经普遍怀疑基准测试分数可信度的背景下,谷歌DeepMind拿出了用加密技术从源头上消除这种质疑的方法。
不过值得注意的是,这次接受测试的Gemini Flash Lite是一款轻量级模型。如果要扩展到旗舰级大模型,计算成本和验证流程势必会复杂得多。这种方式要真正成为行业标准,还需要OpenAI、Anthropic等其他开发商也愿意把自家模型的权重放进这种加密环境中——而这并不单纯是技术问题,更牵涉到信任与竞争层面的考量。
对国内企业和研究机构在引进AI模型时也有明确的参考意义:与其只盯着某一个基准测试分数来选模型,不如去追问这个分数是在什么条件下产生的。如果这个分数没有经过污染检测,那么在实际业务中应用时,就得为可能达不到预期性能的情况留有余地。
未来几个月值得关注的,是其他AI实验室是否会自行尝试类似的加密评估体系。等到谷歌DeepMind把这种方式扩展到旗舰级模型的那一刻,围绕基准测试分数可信度的问题,才算真正有了答案。




评论