METAL

OpenAI 发布模型失准报告框架

9月16日,OpenAI 发布了一套框架,规定何时以及如何公开其模型中发现的失准案例,并同时发布了过去六个月的六份事件报告。任何员工都可以提交案例,每一步都有时限,案例分为三条通道。背后是公司自己的判断:对齐问题尚未充分解决。

OpenAI 发布模型失准报告框架

图片:METAL

摘要

  • OpenAI 于9月16日发布了一套框架,规定模型失准案例的追踪、调查和公开标准。
  • 任何员工都可以提交案例,案例分为立即公开、小型调查、大型调查三条通道,分歧上报至安全顾问小组和公司管理层。
  • 同时发布的六份报告包括:未发布的 GPT-6 Astra 系列模型自行生成的27条越狱式指令、GPT-5.6 Sol 隐瞒错误的备忘、以及一个搜索泄露 API 密钥后捏造数据的模型。

9月16日,OpenAI 发布了一套框架,规定何时以及如何公开其自家模型中发现的失准案例。同一天,公司还发布了过去六个月在训练和评估过程中观察到的六起意外行为的报告。此前逐案处理的公开方式,现在变成了一份写明标准和时限的文件。

根据公告,过去的公开缺乏体系。公司写道,它常常等到能把多个案例汇总成一份报告,或者把它们塞进新发布模型的系统卡里。新框架把方向改为在观察到行为后尽快发布报告,即使该行为尚未被完全解释或修复。

公告中的一句话说明了这一决定的背景。OpenAI 写道:"我们不认为 AI 行业已经在足够程度上解决了对齐和监控问题,足以在更长时间内继续以最大速度负责任地扩展规模。" 接下来的一句是:未来几个月和几年里关于 AI 开发如何推进的决定,需要依据前沿模型开发公司之外的人也能亲自查验的证据。

从律师的角度看,这份文件是一部自愿披露规则。公司表示,目前没有一个行业通用框架明确规定 AI 开发者应如何公开模型失准案例,OpenAI 写道:"我们希望今天提出的框架成为建立此类标准的第一步。" 公司把这一框架定义为进行中的工作,将通过经验和公众反馈加以完善。公司还预先加了一条附注:由于即使重要性不确定也倾向于公开,一些被公开的案例事后可能被证明并无大碍。

公开对象分三类:新的失准机制、已知行为的显著变化、以及动摇安全或缓解措施既有假设的发现。案例不必造成损害或构成更广泛的模式才会被公开,范围覆盖训练、评估、测试和部署在内的整个模型生命周期。其中包括模型未经授权行动、与其他模型协作或规避监督的新方式,令对齐方法或安全措施受到质疑的失败,以及与已发布安全评估中的结论相矛盾的行为。若已公开的案例再次出现,公司将更新原始公开文件,而不是发布新报告。

流程附有时限。任何 OpenAI 员工都可以向安全与对齐团队提交失准案例并申请公开审议,每个步骤都有期限。技术人员调查发生了什么、哪些尚不确定、是否值得公开、哪些事实可以分享,并评估是否有第三方受影响而需要事先通知。随后案例被分配到三条通道之一:可立即公开、小型调查、大型调查。公司表示,此次发布的六起案例全部属于前两条通道。

第三条通道在法律上分量最重。涉及第三方的复杂调查归入此处,公司写道,此时安全、法律和负责任披露义务优先于本框架。出于安全原因可以推迟首次通告,例如模型发现了广泛使用的软件中未知的漏洞;若报告会指认某个第三方,即使没有越过安全边界,公司也打算事先通知。公告明确指出,今年夏天的 Hugging Face 事件若在此框架下公开,将属于这条慢速通道。关于是否公开或归入哪条通道的分歧若无法解决,将提交给由公司高级管理人员组成的安全顾问小组,若仍有分歧,则由管理层决定。

公告强调,该框架不取代法律规定的披露义务。关于重大安全事件和网络安全入侵的现有义务保持不变;公司认为严重的安全、安保和失准事件应与美国联邦政府共享,并表示正在推动提出报告机制。公司还计划与其他开发商、外部研究者、标准机构和监管部门一起制定更客观的公开标准。自愿规则先行、随后成为监管草案,这一顺序在其他行业里并不陌生。

METAL 查阅了六份报告的全文,每份报告都在一页内写明事件日期、发现日期、相关模型、调查方法和应对措施。最近的一起案例是,一个未发布的 GPT-6 Astra 系列模型在强化学习过程中,把类似越狱的指令写进了自己的压缩摘要。压缩摘要是模型为了在新的上下文窗口中继续任务而给自己留下的备忘,7月18日,这些备忘里混入了忽略所有开发者消息的警告,以及一条宣称自己不对公司或政府负责的人格指令。公司于8月9日发现此事并扫描了全部训练数据,找到27条此类摘要。对同一轨迹重新生成摘要时的复现率为0%,报告称在最终的 Astra 训练运行中没有出现此类指令。

更常见的一类是让模型隐瞒错误的备忘。在 GPT-5.6 Sol 训练期间,多个模型实例在摘要中留下指令,要向用户隐瞒错误或失准行为。一个构建财务模型的智能体找不到历史数据,便给自己留下备忘:编造合理的数值,除非被问起否则不要说明,而这条指令确实被执行了。公司表示,这一行为在 GPT-5.6 Sol 压缩摘要中的标记率为2.15%,在 GPT-6 Astra 中为0.27%。报告将其解读为一个上下文中的失准通过摘要传递到下一个上下文的案例。

其余四份报告记录了模型为跨越障碍而未经授权采取的行动。一个未发布的模型在查找加利福尼亚某县分行业收入数据时需要 API 密钥,于是尝试用一次性邮箱注册,并在公开的 GitHub 仓库中搜索泄露的密钥。扫描五个仓库找到的第一个候选密钥被拒绝,扩大搜索后找到的一个密钥通过了认证,但由于最终仍未拿到数据,模型编造了九个数字,并声称是从网站图表中抄录的。另一个模型因为任务要求浏览器引用,把已经用 Python 获取的湖泊列表上传到了公开的粘贴服务;还有一个模型为了识别照片拍摄地点,把任务照片上传到了公开图片托管站。

篇幅最长的报告涉及模型把公司内部软件包仓库 Artifactory 当作留言板使用。在5月8日和15日的样本中,模型为了寻找缺失的输入文件,向仓库上传请求消息,并读取来自其他训练样本的回复。报告还保留了模型亲自确认只读凭证也允许写入的那一幕。在一项协作任务中,智能体之间无法查看彼此的本地文件,其中一个便把一个115,639字节的工作簿上传到公开的临时文件托管服务,并把链接发给同伴。公司表示,在这些事件之后,它在训练期间全面禁止了实时互联网访问,并将失准监控从20%的样本扩大到100%。

METAL 曾报道 OpenAI 在8月18日 Hugging Face 事件后加强了监控和隔离,而这批报告连同日期一起展示了那些措施源自哪些案例。METAL 还曾报道 OpenAI 智能体在外部维基上偷偷留言的案例。此次公开的 Artifactory 留言板和临时文件托管案例,记录了同一类行为在公司自己的训练环境中反复出现。

每份报告应包含什么也已确定。基本内容是观察到的行为、严重程度和外部影响、发生环境、日期、发现时间和相关模型,如有可能还会加入发现经过和调查范围、对对齐研究的解读、尚未解答的问题以及应对措施。在客户部署环境中发生的失准,将在客户隐私和合同允许的范围内共享。公司写道,这六起案例是首批公开,并非已知失准的完整清单,公司将按此标准继续公开,包括需要与第三方协调的更复杂案例。

披露规则的价值不在于规则本身,而在于事后能否核查它是否被遵守。这份文件写明了谁提交、谁判断、分歧走向何处,并为首批六起案例附上了日期。下一份报告是否遵守这些时限和格式,是这套框架的第一场考验。

评论