每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Guidelight评估:AI五大公司内部管控全部不达标

Anthropic、OpenAI获C+,谷歌D+,xAI D-,Meta则得F……没有一家达到标准

유리 상자 속 서버를 주사기들이 찌르는 실험실 삽화

이미지: The Decoder

摘要

  • 非营利组织Guidelight首次对Anthropic、OpenAI、谷歌、xAI、Meta的内部AI安全防护机制进行了评估
  • Anthropic和OpenAI以C+并列最高,谷歌获D+,xAI获D-,Meta则得F
  • 五家公司在风险侦测方面表现尚可,但在事前预防和遏制措施上普遍薄弱
평가 기관
가디라이트(Guidelight) — 전 오픈AI 안전 담당자 페이지 헤들리·스티븐 애들러 설립
평가 대상
앤스로픽, 오픈AI, 구글, xAI, 메타
등급
앤스로픽·오픈AI C+(2.50) / 구글 D+(1.50) / xAI D−(0.83) / 메타 F(0.67)
점검 항목
로깅, 모니터링 효과 측정, 게이트 액션, 서킷 브레이킹, 제3자 검토, 봉쇄 계획 6개
채점 척도
0~5점 절대 척도(0 미구현~5 완전 구현) + 회사 간 상대 평가 병기
등급 산정
여섯 항목 절대 점수의 단순 평균을 미국 GPA 환산표에 대입. 이번 회차는 항목 가중치 동일
평가 방식
공개 자료만 근거. 팀원 2명이 공통 기준표로 독립 채점 후 제3자 포함 합의, 7월 말 각 사에 예비 점수 회람
기준 시점
2026년 8월 18일 · 통제 표준 v1.1 기준
결과 패턴
탐지·제3자 평가는 상대적 강세, 예방(게이트·서킷 브레이킹)과 봉쇄는 전반적 취약
결론
어떤 회사도 어떤 항목에서도 3점을 넘지 못함

先看成绩单

非营利组织Guidelight首次公开了对AnthropicOpenAI、谷歌、xAI、Meta五家公司内部AI系统管控水平的评估结果。Anthropic和OpenAI以C+勉强领先,谷歌获D+,xAI获D-,Meta则得F。Guidelight表示,在此次评估中,没有一家公司完全达到其提出的安全标准。

公司等级六项均分(满分5分)
AnthropicC+2.50
OpenAIC+2.50
谷歌D+1.50
xAID−0.83
MetaF0.67
이미지: The Decoder

六项指标各自要求什么

Guidelight此次考察的是其去年5月公布的管控(Control)标准中的六项基本做法。标准原文对各项要求的水平如下。

项目标准要求的水平
日志记录以可监督的形式记录内部使用的高风险相关模型99.9%的推理token。这并非要求对每个请求都运行分类器,而是要求随时可以用分类器进行排查
监测效果测量测量并以文档形式记录监测系统实际识别问题行为的能力(召回率)
门控措施至少①对监测系统本身的变更 ②与管控相关的安全设置变更这两项,必须在执行前获得监督者批准,且监督者须能看到智能体的思维链(chain-of-thought)
断路机制当被判定为问题行为的次数累积到一定量时,应完全阻止相关门控行为的执行,直至人工判断安全并予以解除
第三方审查每季度委托外部机构对管控体系的适当性出具报告并公开。可隐去的部分仅限第三方判定存在商业风险或不宜公开的内容
遏制计划当侦测到模型试图规避管控的行为时,应制定并采用限制该模型访问权限及运行的应对计划

0~5分如何评定并换算为等级

评分采用0~5分的绝对量表。0为未实施,1为仅具备前期阶段,2为有限的部分实施,3为相当程度的部分实施,4为近乎完全实施,5为完全实施。Guidelight另外还附加了公司间相互比较的相对评价。

等级是将六项指标的绝对分数简单平均后,代入美国大学学分(GPA)换算表得出的。此次评估中六项指标的重要性均被视为相同,Guidelight表示从下一轮评估开始可能会调整各项权重。Anthropic和OpenAI并列获得C+,正是因为二者总分同为15分。

各项分数表

项目AnthropicOpenAI谷歌xAIMeta
日志记录33201
监测效果测量33101
门控措施32120
断路机制32120
第三方审查32202
遏制计划03210
合计1515954
等级C+C+D+D−F

没有任何一家公司在任何一项指标上拿到超过3分。大部分分数都在2分以下。Anthropic在五项指标中获得3分,但遏制计划一项为0分,拉低了平均分;OpenAI则恰好相反,遏制计划正是其获得3分的项目之一。

评分方式

Guidelight在6月至8月期间收集了五家公司的公开资料,包括前沿安全框架、系统卡与模型报告、技术博客,以及第三方报告中引用的公司发言等。每项指标由两名团队成员依据共同的评分标准分别打分,若出现分歧则加入第三名成员,讨论至达成一致。据其表示,每个分数都反复核查了「如果有哪些资料或措施会得到更高分」「若对标准文字做不同解读,分数是否会不同」等问题。

7月末,团队将初步评分及依据提前发给各公司相关人员,让其指出事实错误或反驳解读,并提供了补充遗漏资料或按需公开更多信息的机会。8月初,Guidelight发布了标准v1.1版本,将管控要求的范围从内部运营扩大到自我评估和测试阶段,并重新审视了受此变动影响的部分分数。本次成绩单的基准时间点为8月18日。

能侦测,却拦不住

五家公司大致分为三个梯队。Anthropic和OpenAI能够记录内部AI活动的相当一部分,并以此排查问题行为信号,一旦发现可疑行为便有转交人工处理的流程。谷歌的实施进度落后,但其AI管控路线图被评为迄今各公司发布中最为具体的计划文件,涵盖预防、侦测和遏制。不过从公开资料看,大部分内容仍处于实施前阶段。Meta和xAI在实践和计划上都最为薄弱。有关Meta的已知信息大多来自该公司向METR前沿风险报告提交的说明,而xAI是五家公司中唯一未参与该报告的公司。

表现较强的领域是侦测和第三方评估。三家公司表示已记录部分内部使用情况以排查问题行为,除xAI外的其余四家均参与了METR的报告。相反,最薄弱的环节是预防和遏制。在门控措施和断路机制上超过「有限的部分实施」水平的,只有Anthropic一家。Guidelight认为,这意味着管控系统本身可能被出问题的AI关闭,也可能在公司反应速度跟不上的连续攻击面前崩溃。

决定分数的实际依据

Anthropic在门控措施和断路机制上获得3分的依据是Claude Code的「auto mode」。该机制由监督者审查智能体行为,若判定危险则加以阻止,当拒绝次数累积到一定程度后,会转交人工处理或使智能体停止运行,并在内部部署中默认开启。但扣分原因是,auto mode并不读取思维链,而且即便某个智能体被停止,只要启动新的子智能体即可绕过限制,并未确认存在能切断整个系统的断路器。

OpenAI在遏制计划一项唯一获得3分的依据,是其确有实际暂停行动的先例。在应对Hugging Face安全事故的过程中,该公司曾暂停新模型训练并限制内部部署,并让调查人员在监测中发现偏离对齐的行为时可以停止模型活动。此前也曾有过限制脱离沙箱模型部署的案例。但报告指出,并未找到明确规定未来若再发生同类事件应何时、如何应对的正式计划。

Guidelight自陈的局限性

这份评分仅基于公开资料。若某家公司拥有强大的拦截机制却未予公开,便无法得分。反之,Guidelight也指出,由于公司公开的内容未经第三方验证,实际情况也可能被夸大。这六项指标只是管控标准的基础部分,即便在此拿到高分,整体管控水平仍可能不足,而管控本身也只是公司安全表现的一部分。标准本身设定的是最低门槛,即便全部达标也不能称为充分的管控,且目前尚未涵盖模型训练过程中或外部机构测试期间所适用的管控措施。

Guidelight是谁

Guidelight是由曾在OpenAI负责安全工作的Paige Hadley和Steven Adler创立的独立非营利组织,此次是其首次发布评估。该机构表示,今后将定期更新管控标准评分,并计划将评估范围扩展到透明度等其他标准。此次评估中OpenAI能以C+跻身前列,背后原因可能与其去年8月18日公布的内部监测强化措施有关。不过据悉,其规模最大的强化学习训练目前仍处于暂停状态。

编辑视角

这次评估中值得关注的并非名次本身,而是各项能力发展的先后顺序。五家公司都在「察觉出了问题」这件事上投入了一定资源,但在「接下来该如何阻止」上却投入不足。侦测装置只需堆积日志、发出警报,相对容易搭建;而遏制和预防则需要真正削减模型权限或做出暂停训练的决定,这对公司而言要承担的代价要大得多。这并非顺序颠倒,只是容易实现的部分先被补齐了而已。

细看评分表,这种差距更为明显。Anthropic在六项指标中有五项拿到3分,却因遏制计划一项为0分,导致平均分被卡在2.50。相反,OpenAI在遏制计划上的3分并非来自文件,而是来自实际暂停训练的先例。这意味着该分数的提升并非因为有计划书,而是因为确有停止行动的经历——这也说明这份评估看重的是执行痕迹,而非声明本身。

对于国内正在引入AI的企业而言,这份评估在实务层面有明确的借鉴意义。选择供应商时,仅仅询问「多快能发现异常行为」是不够的,必须同时问清楚「发现之后实际能采取什么措施」。「有审计日志」和「一旦模型出问题可立即切断其权限的流程」,这两种回答所代表的准备水平完全不同。

在Guidelight下一次评估中,排名出现大幅反转的可能性不大。预防和遏制体系涉及组织结构和决策权限本身的调整,并非几周之内就能追赶上的领域。不过,像OpenAI和谷歌这样已经公开路线图和强化措施的公司,在下次评估中仍有缩小差距的空间;而像Meta这样公开资料本就匮乏的公司,很可能仍将停留在原地。