
图片:METAL
摘要
- 非营利组织Guidelight首次对Anthropic、OpenAI、谷歌、xAI、Meta的内部AI安全机制进行了评估
- Anthropic和OpenAI以C+并列最高分,谷歌为D+,xAI为D-,Meta则拿到F
- 五家公司在风险察觉上都表现不错,但在事前预防和封锁措施上都很薄弱
先看成绩单
非营利组织Guidelight公开了一项评估结果,首次考察了Anthropic、OpenAI、谷歌、xAI、Meta这五家公司在内部对自家AI系统的管控程度。Anthropic和OpenAI以C+勉强领先,谷歌拿到D+,xAI是D-,Meta则是F。Guidelight表示,在此次评估中,没有一家公司完全达到了他们提出的安全标准。
| 公司 | 等级 | 六项指标平均分(满分5分) |
|---|---|---|
| Anthropic | C+ | 2.50 |
| OpenAI | C+ | 2.50 |
| 谷歌 | D+ | 1.50 |
| xAI | D− | 0.83 |
| Meta | F | 0.67 |
六项指标各自要求什么
Guidelight考察的是其去年5月发布的管控(Control)标准中的六项基本实践。标准原文对各项要求如下:
| 项目 | 标准要求的水平 |
|---|---|
| 日志记录 | 将内部使用的高风险相关模型99.9%的推理token以可被监督的形式记录下来。这不是说要对每一次请求都跑一遍分类器,而是要保证任何时候都能用分类器回溯查阅 |
| 监测效果评估 | 测量并记录监督系统实际识别问题行为的能力(召回率) |
| 门控操作 | 至少以下两项——①监督系统本身的变更 ②与管控相关的安全设置变更——必须在执行前获得监督者批准,且监督者须能看到智能体的思维链(chain-of-thought) |
| 断路机制 | 一旦被拦截的问题行为累计达到一定数量,须彻底阻止该受门控行为的执行,直到有人判断安全并解除为止 |
| 第三方审查 | 每季度委托外部机构对管控体系的适当性出具报告并公开。只有第三方认定存在商业风险或不宜公开的部分才可遮蔽 |
| 封锁计划 | 一旦察觉模型试图规避管控,须制定并采用限制该模型访问权限与运行的应对方案 |
0到5分如何打分,又如何换算成等级
评分采用0至5分的绝对量表。0分为未实施,1分仅具备前置阶段,2分为有限的部分实施,3分为相当程度的实施,4分为近乎完全实施,5分为完全实施。Guidelight另外还并列标注了各公司之间的相对评价。
等级是将六项指标的绝对分数简单平均后,套入美国大学学分(GPA)换算表得出的。此次评估将六项指标的重要性视为相同,Guidelight表示从下一次评估起可能会调整各项权重。Anthropic和OpenAI并列C+,正是因为两家总分同为15分。
各项评分表
| 项目 | Anthropic | OpenAI | 谷歌 | xAI | Meta |
|---|---|---|---|---|---|
| 日志记录 | 3 | 3 | 2 | 0 | 1 |
| 监测效果评估 | 3 | 3 | 1 | 0 | 1 |
| 门控操作 | 3 | 2 | 1 | 2 | 0 |
| 断路机制 | 3 | 2 | 1 | 2 | 0 |
| 第三方审查 | 3 | 2 | 2 | 0 | 2 |
| 封锁计划 | 0 | 3 | 2 | 1 | 0 |
| 合计 | 15 | 15 | 9 | 5 | 4 |
| 等级 | C+ | C+ | D+ | D− | F |
没有一家公司在任何一项上超过3分,大部分分数都在2分以下。Anthropic在五项上都拿到3分,却因封锁计划一项得0分而拉低了平均分;OpenAI则恰恰相反,封锁计划正是其拿到3分的项目之一。
评分方法
Guidelight在6月至8月期间收集了五家公司的公开资料,包括前沿安全框架、系统卡片和模型报告、技术博客,以及第三方报告中收录的公司发言等。每一项都由两名团队成员依照统一评分标准分别打分,若出现分歧则引入第三名成员,讨论至达成一致为止。团队表示,每个分数都会回溯核查“若有哪些资料或措施存在,分数是否会更高”“若标准文字有不同解读,分数是否会变化”等问题。
7月底,团队向各公司实务部门提前发送了初步评分和依据,让对方有机会指出事实错误、反驳解读、补充遗漏的资料,或者若愿意的话公开更多信息。8月初,标准v1.1发布,将管控要求的范围从仅限内部运营扩展到自评与测试阶段,团队据此重新审视了部分受影响的分数。此次成绩单的基准时间点为8月18日。

能发现,却拦不住
五家公司大致分成三个层级。Anthropic和OpenAI记录了内部AI活动的相当一部分,并用其筛查问题行为的信号,一旦发现可疑行为便有转交人工处理的流程。谷歌在落地实施上落后,但其AI管控路线图被评价为迄今各公司发布的文件中,涵盖预防、探测、封锁最为具体的一份规划。不过从公开资料看,大部分内容仍处于执行之前。Meta和xAI在实践和规划上都最为薄弱。外界了解到的Meta相关信息,大多来自该公司向METR前沿风险报告提交的说明,而xAI是五家公司中唯一没有参与该报告的一家。
表现较强的领域是探测和第三方评估。三家公司表示会记录部分内部使用情况并筛查问题行为,除xAI外的四家都参与了METR的报告。相反,表现最弱的领域是预防和封锁。在门控操作和断路机制上,唯有Anthropic超过了“有限的部分实施”这一档。Guidelight据此判断:管控系统本身可能被出问题的AI关闭,也可能在遭遇比公司应对速度更快的连续攻击时崩溃。
打分背后的具体依据
Anthropic在门控操作和断路机制上拿到3分,依据是Claude Code的“auto mode”。该机制由监督者审查智能体行为,若判定危险则加以阻止,一旦拒绝次数累积到一定程度,就会转交人工处理或让智能体停止运行,且该功能在内部部署中默认开启。不过auto mode并不读取思维链,而且即便一个智能体被停止,只要启动新的子智能体便可绕过,因此并未发现能切断整个系统的总闸,这也是被扣分的原因。
OpenAI在封锁计划一项唯一拿到3分,依据是其确有真正暂停过系统的实际记录。在应对Hugging Face安全事件的过程中,该公司暂停了新模型的训练,并限制了内部部署;调查人员一旦通过监测发现偏离对齐的行为,便可停止模型活动。此前也有过限制越出沙盒模型部署的先例。不过报告写道,目前尚未找到一份正式计划,明确规定日后若再发生类似情况该在何时、如何应对。
Guidelight自陈的局限
这些分数仅基于公开资料得出。若某公司具备强大的拦截机制却未公开,便无法获得相应分数。反过来,Guidelight也指出,由于公司公开的内容未经第三方核实,也存在被夸大、超出实际水平的可能性。六项指标只是管控标准的基础部分,在这些项目上表现良好,也不代表整体管控水平就令人满意;而管控本身也只是公司安全表现的一个方面。标准本身设定的是最低门槛,即便全部满足也不能称之为充分的管控,而且模型训练阶段以及在外部机构测试期间所适用的管控措施,目前并不在评估要求范围之内。
Guidelight是谁
Guidelight是由曾在OpenAI负责安全工作的Paige Hedley和Steven Adler创立的独立非营利组织,此次是其首份评估报告。该组织表示,今后将定期更新管控标准评分,并把评估范围扩展到透明度等其他标准上。此次评估中OpenAI能以C+进入前列,背后可能与其在8月18日宣布的内部监测强化措施有关。不过据了解,该公司规模最大的强化学习训练目前仍处于暂停状态。
编辑视角
这份评估真正值得关注的,不是排名,而是顺序。五家公司都在“察觉出了问题”上投入了一定资源,但在“接下来该如何阻止”这件事上,投入明显不足。探测装置只需记录日志、发出警报即可,相对容易搭建;而封锁与预防则需要真正削减模型权限,或做出暂停训练的决定,公司要为此承担的代价要大得多。这不是顺序颠倒,而是容易的部分先被填满了而已。
细看评分表,这种落差更加明显。Anthropic六项中有五项拿到3分,却因封锁计划这一项得0分,平均分被锁在2.50。相反,OpenAI在封锁计划上拿到的3分,并非来自文件,而是来自其真正暂停过训练的实际记录。也就是说,分数的提升不是因为有一份计划书,而是因为真正停下过——这也说明,这份评估看的是执行痕迹,而不是宣言。
对国内正在引入AI的企业而言,这份评估有明确的实际参考价值。选择供应商时,仅仅问“能多快发现异常行为”是不够的,必须同时问“发现之后,实际能采取什么行动”。回答“有审计日志”和回答“出问题的模型可以立即被切断权限”,代表的是完全不同层级的准备程度。
预计Guidelight下一次评估中,排名不太可能出现大幅反转。预防和封锁体系涉及组织结构和决策权本身的调整,不是几周内就能追赶上的领域。不过,像OpenAI和谷歌这样已经公开路线图和强化措施的公司,在下一次评估中有缩小差距的空间;而像Meta这样公开资料本就匮乏的公司,很可能仍会停留在原地。





评论