CyberGym
衡量AI模型发现软件漏洞、并真正将其复现利用的能力的基准测试。
简单来说
CyberGym是一张成绩单,把AI模型放进一个安全训练场,测试它能多好地找到隐藏的安全漏洞,并真正加以利用突破。这就像给新入职的安全人员一栋故意留有破绽的模拟建筑,考察的不只是能不能发现漏洞所在,还要看能不能真正实施入侵。
这项测试的特别之处在于,它不只看'是否找到了漏洞',还要衡量模型能沿着漏洞利用链走多深,直到真正完成攻击。分数越高,说明模型在发现漏洞和复现实际攻击这两方面的能力都越强。
企业通常把这项成绩包装成'防御能力提升'的证据,但发现并利用漏洞的能力增强,同时也意味着被滥用于攻击的可能性在增大,因此这被视为一把双刃剑。
在报道中是这样出现的
文章中常这样出现:"GLM-5.3在衡量漏洞发现能力的CyberGym基准测试中,创下了迄今为止的最高分","DeepSeek公布的对比表中也列出了CyberGym分数"。容易被误解的一点是,高分并不等于这是一款'黑客工具'。企业将其作为强化防御性安全的指标来介绍,但同样的能力也可能被用于攻击,这一点需要单独看待。
