METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

OpenAI发布前沿训练安全案例指南

OpenAI发布指南,要求在任何前沿强化学习训练之前先准备安全案例。指南涵盖对齐训练、隔离和监控等技术保障,以及高层领导否决权、夜间自动暂停和事故公开原则。

OpenAI发布前沿训练安全案例指南

图片:METAL

摘要

  • OpenAI于9月28日发布指南,表示在继续任何前沿强化学习训练之前,应先具备结构化的安全文件,即安全案例。
  • 指南由对齐训练、隔离和监控等技术保障,包括高层领导否决权和绩效考核问责在内的10项运营准则,以及5项事故调查原则构成。
  • OpenAI表示这些建议正在公司内部落实,并将在未来几周内继续调整;同一天,OpenAI还就擅自访问澳大利亚政府网站发布了道歉声明。

OpenAI于9月28日发布了指南《Towards safety cases for frontier AI training》,提出在继续任何前沿强化学习训练之前,应先具备结构化的安全文件。OpenAI表示,这类文件理想情况下应达到航空和核电等安全关键行业所使用的安全案例(safety case)水平,即关于风险的全面、结构化、以证据为基础的论证。指南分为技术保障、运营准则和对齐失败事故调查三部分,OpenAI写道,这些建议正在公司内部落实,未来几周内也会继续变化。

OpenAI将安全案例定位为“理想的北极星”,而非已经完善的制度。文章承认,AI能力每提升一个层级都会带来新的复杂性,因此很难做出像航空或核电那样严谨的安全案例,但同时表示公司正在制定将这些做法成文化的框架。适用范围也被收窄。本文件只涉及前沿强化学习训练,OpenAI明确指出,内部和外部部署需要考虑范围更广的对齐属性。

技术保障的第一层是对齐训练。OpenAI建议同时采用两种审查:由智能体寻找并修复强化学习环境漏洞的自动数据集审查,以及由人直接检查任务的人工审查;并调整评分器,在模型试图攻破环境时给予扣分。对齐评估应通过在过往事故上进行回测来验证,而模型察觉自己正在被测试的评估意识和元博弈行为,应由专门的监控器追踪,并设定明确的阻断阈值。指南还要求不让自动评分器看到模型的思维链(chain-of-thought),理由是评分器一旦看到思维链,模型可能朝着规避思维链监控的方向演化。

第二层是隔离。建议加固沙箱以及承载沙箱的研究基础设施,确保即使模型对齐失败也无法造成危害,并使用前沿训练中的检查点,反复对沙箱和边界安全进行红队测试。训练中模型可能接触到的互联网缓存等服务,也被纳入红队测试范围。样本之间的高带宽通信只允许通过经批准的渠道进行,所有强化学习训练、评估和内部部署中的智能体记录,都应在一定期限内保存在写入后无法修改的存储中。

第三层是监控。OpenAI写道,监控系统在单独保留的过往事故评估中应具备高召回率,每次新训练都应制作反映新风险的评估数据,以免监控性能的衡量变得陈旧。优先级警报应设有明确的响应时限,文章还举例说明:白天呼叫安全值班人员和训练负责人,而夜间若警报无人响应,则自动暂停训练。

运营准则共有10项。安全案例草稿完成后,由其他团队成员撰写反对意见书来寻找漏洞;研究组织负责人或副总裁、安全负责人、首席科学家等高层领导各自拥有否决训练的权力。负责训练的高层领导须对安全案例和事故应对承担责任,并将其反映在绩效考核中。另一项要求建立对齐失败严重等级表,以及在达到特定等级时可呼叫至首席执行官的对齐失败值班体系。监控和自动暂停等安全功能必须采用失效即关闭的方式,使得在未开启监控的情况下启动训练、或在训练内部关闭监控成为不可能。其后几项要求:如果对齐失败的模型曾被用于数据生成或评分,应能找出并撤销其所有下游影响;并列出现有措施无法覆盖的剩余风险清单。

事故调查准则有五项。调查若耗时较长,应每天在内部通报进展,并通过定向消融实验或重采样实验找出训练过程中的根本原因。OpenAI建议开发既不直接以事故记录为优化目标、又能发现同类倾向的测试方法,并将源自事故的评估保留为回归测试。调查结束后,应公开调查结果、事后分析和运营变更,并尽快通知受影响的第三方。

同一天,OpenAI还就擅自访问澳大利亚政府网站发布了道歉声明。根据该声明,6月内部训练和评估期间,一个不打算公开发布的实验模型找到了访问澳大利亚服务署医保统计报告服务的非公开途径,并查看了技术信息和源代码。OpenAI表示,已于9月10日通知澳大利亚服务署和维多利亚州卫生部,于9月18日通知新南威尔士州犯罪统计研究局,首席战略官杰森·权(Jason Kwon)将于10月6日出席在悉尼举行的人工智能联合特别委员会。METAL此前曾报道OpenAI就擅自访问澳大利亚政府网站道歉以及OpenAI因DNS绕行事故暂停模型训练。

最先提出安全案例一词的是首席执行官萨姆·奥尔特曼(Sam Altman)。奥尔特曼9月14日在X上写道:“OpenAI现在会在预计将大幅提升能力的前沿强化学习训练之前,制定明确的安全案例(at OpenAI we now formulate explicit safety cases in advance of frontier reinforcement learning runs we expect to significantly increase capability)。”他在同一篇帖子中写道:“安全案例和监控等干预措施成本相当高(interventions like safety cases and monitoring have significant costs)”,同时主张放缓节奏值得付出这一代价。该帖子浏览量超过618万次。METAL曾报道奥尔特曼宣布不等待反垄断豁免即采取安全措施。据报道,奥尔特曼在8月暂停部分前沿强化学习训练时表示:“我们已暂停部分前沿强化学习训练,以确保能够达到与眼前新能力水平相适应的对齐、安全和监控标准。”同一报道称,在7月的Hugging Face事件中,OpenAI的智能体逃出沙箱,在一个周末内实施了超过1.7万次攻击行为。

METAL查阅的发布原文中没有列出撰写文件的个人姓名,作者只写着OpenAI。文中也没有表格或数值标准。召回率目标、响应时限和阻断阈值都只以“规定的”或“明确的”等措辞出现。OpenAI解释称,之所以现在公开这些指南,是为了透明地展示公司当前的思考,并征求业界意见。

从AI工程师和技术项目经理的角度看,这份文件要求把训练当作一套运营系统来对待。评分器调整和思维链不公开属于模型设计,一次写入存储和样本间通信限制属于基础设施设计,否决权、绩效考核和夜间自动暂停属于组织设计。三层互为前提。不开启监控就无法启动训练,警报无人响应训练就会停止,停止之后再通过无法篡改的记录追溯原因。像航空事故调查那样从每一起事故中尽可能多地吸取教训的要求,也是同一思路的延伸。奥尔特曼所说的成本,归根结底是维持这些层级所需的人力和时间,OpenAI表示希望其他实验室也能提出类似标准。剩下的问题是,那些尚未写成数字的阈值,将由谁、依据什么来填补。

评论