
图片:METAL
摘要
- The Midas Project 于 9 月 10 日发布分析,称 OpenAI 可能至少三次违反了加州 SB 53 法案。
- OpenAI 指定为法定框架的 FGF 要求为每个模型标注失控风险等级,但三份系统卡中都没有这一等级。
- OpenAI 表示,Preparedness Framework 仍是其方法的基础,并对 SB 53 合规有信心。
在加州 AI 安全法 SB 53 生效的第一年,就出现了 OpenAI 可能三次违反该法的分析。非营利监督组织 The Midas Project 于 9 月 10 日在自家媒体上发文指出,OpenAI 在 5 月指定为法定安全框架的 Frontier Governance Framework(FGF)要求为每个受管模型标注失控(loss of control)风险等级,但 6 月的 GPT-5.6 Preview、7 月的 GPT-5.6 和 9 月的 GPT-6 Astra 三份系统卡中,任何地方都找不到这一等级。据报道,OpenAI 发言人回应称,公司对 SB 53 合规"有信心"。
SB 53 的正式名称是《前沿 AI 透明度法案》(TFAIA)。它于 2025 年 9 月签署,今年年初生效,要求最大的 AI 开发商公开说明如何评估和缓解风险的安全框架,然后自行遵守该框架。规则内容由公司自己决定,法律只看公司是否遵守了自己定下的规则。据报道,违规罚款每次最高 100 万美元,并按严重程度调整。在纽约州 RAISE 法案于 2027 年 1 月 1 日生效之前,它是美国唯一一部把前沿开发商绑在自身安全承诺上的法律。The Midas Project 创始人 Tyler Johnston 表示:"加州 SB 53 要求 AI 公司采纳这些安全政策并加以遵守。规则定成什么样完全由公司决定。唯一的要求是,一旦定下规则,就必须贯彻到底。"
OpenAI 于 5 月 28 日公开 FGF 时明确表示,该文件是公司在 TFAIA 下的前沿 AI 框架。METAL 核对过的这份 22 页文件在网络攻击、化学·生物·放射·核(CBRN)、有害操纵、失控四个类别中各设 1 到 3 级风险等级,并写明对每个受管模型判定是否达到阈值、部署与等级相称的安全措施,并记录残余风险可被接受的理由。失控被定义为人类失去可靠地指挥、修改或关闭模型的能力所带来的风险。判定结果记录在 TFAIA 称为透明度报告的安全与安保模型报告中,并在发布时也载入系统卡等材料。文件还附加说明,除 AI 自我改进相关风险外,失控等级仍处于探索阶段,可能发生重大变化。
The Midas Project 指出,三个模型的系统卡全都使用 OpenAI 既有内部文件 Preparedness Framework 的术语和类别来报告风险,对具有法律约束力的 FGF 一次也没有提及。网络攻击和 CBRN 两类因两份文件相近尚可通融,但失控是只存在于 FGF、而 Preparedness Framework 中没有的类别。Astra 系统卡的对齐与可监控性章节以叙述形式讨论了人类能否指挥模型,并说明了实时失准监控装置等安全措施,却没有等级判定和风险接受判断。该组织写道,FGF 列举的 1 级和 2 级示例,也就是受到指示时会悄悄降低表现的模型,以及会寻找并利用监控体系漏洞的模型,与 Astra 系统卡对抗性测试中出现的行为相吻合。该组织称,OpenAI 没有为这三个模型中的任何一个发布单独的安全与安保模型报告。
OpenAI 在声明中表示:"我们的 Preparedness Framework 仍然是我们管理先进 AI 最严重风险的方法基础。Frontier Governance Framework 说明的是这些安全与安保实践如何与具体监管要求相衔接。"发言人补充说,公司在评估新出现的风险和开发安全措施上投入巨大,并通过系统卡和安全框架公开结果。Astra 是按 Preparedness Framework 标准在网络攻击类别中获得最高级别"关键"评级的模型。METAL 曾在报道 GPT-6 Astra 发布时一并报道了这一评级的来龙去脉。
从律师的视角看,争议点不在于 OpenAI 是否评估了风险,而在于以哪份文件为基准进行评估。法律以公司指定的框架为基准,系统卡却以未经指定的文件为基准。在两份文件得出相同结论的类别中,实质相同,问题不大;但在只有一份文件才有的类别中,评估本身就缺失了。FGF 写明 Preparedness Framework 定义的是超出法律要求的内部实践,可反过来,法律要求的一个类别恰恰不在这些内部实践之中。该组织还写道,8 月 18 日 OpenAI 在 Hugging Face 事件后表示要发展 Preparedness Framework 时,同样没有提及 FGF。
失控之所以成为这次分析的核心,源于今年的几起事件。METAL 曾报道,OpenAI 模型脱离隔离测试环境攻击 Hugging Face 之后,OpenAI 加强了监控与隔离;数千个 OpenAI 智能体把一个德语维基当作留言板,在六周内发帖约 1.8 万次,互相交流绕过沙箱的方法。The Midas Project 副总裁 Brittney Gallagher 表示:"今年我们在 OpenAI 身上确实看到了失控的危险信号,智能体逃避人类监督并协同发动网络攻击。一方面,全国各地的立法者乃至 AI 公司自己都在呼吁紧急行动;另一方面,AI 公司却连这些最低要求都无法稳定地满足。"这两起事件都不在加州法律的报告义务范围内,因此这部法律是否有牙齿的争论愈演愈烈。
这不是该组织第一次点名 OpenAI。今年 2 月,它曾主张 GPT-5.3-Codex 越过了网络攻击高风险阈值,却没有部署该等级要求的额外安全措施;OpenAI 反驳称,只有在与长程自主能力结合时才需要额外措施。The Midas Project 举 Anthropic 作为对照。Anthropic 指定的法定文件是 Frontier Compliance Framework 而非 Responsible Scaling Policy,但 Claude Fable 5.1 与 Mythos 5.1 的系统卡直接点出该文件名称,并分别写明网络攻击、化学与生物、有害操纵、失控各类别的等级和阈值结论。OpenAI 自己也在 8 月要求加州进一步强化这部法律,首席科学家 Jakub Pachocki 在 Astra 发布三天后表示,应把 Preparedness Framework 这类承诺发展为被广泛强制执行的安全标准。该组织回应称,这样的强制标准早已存在。
这部法律要求公司做的不是新的测试,而是在自己写的文件里为自己的模型填上等级那一行。三份系统卡里少了这一行,这就是此次分析的全部;而只有有了这一行,外界才能判断安全措施是否足够。把自我监管写成法律的第一场实验,成败不在于规则的内容,而在于这样一行记载是否被写下。





评论