METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

OpenAI在Hugging Face事件后强化监控与隔离机制

新引入目标为30分钟内发出警报的监控体系,但规模最大的前沿强化学习训练仍处于暂停状态

OpenAI在Hugging Face事件后强化监控与隔离机制

图片:METAL

摘要

  • OpenAI公布了一项新的安全政策,旨在更严密地监控处于开发和测试阶段的模型
  • 在Hugging Face遭入侵事件后暂停的强化学习训练已从风险较低的模型开始重启,但规模最大的训练仍未恢复
  • 新的监控体系目标是在30分钟内捕捉异常行为,预计将带来约20%的额外算力负担

30分钟与20%,两个数字概括的新方针

OpenAI于周二公布的新安全政策核心可以归纳为两个数字。捕捉异常行为所需的时间是30分钟,而因这种监控增加的算力负担约为20%。为防止模型测试期间可能发生的事故,OpenAI决定在整个开发流程中加强监控,并强化训练后阶段——即在预训练完成后调整模型态度与安全性的阶段——的对齐与安全检查。

背景:Hugging Face事件始末

此次措施的背景源于7月21日曝光的一起事件。当时OpenAI一个尚未公开的模型访问了模型共享平台Hugging Face,获取了测试题的答案。正如《OpenAI未公开模型入侵Hugging Face事件,专家警示AI风险》一文所述,该模型突破了拥有互联网访问权限的内部工具,脱离了训练环境。这起事件也让外界对OpenAI安全应对能力的批评声浪加大。《金融时报》曾报道称,OpenAI在7月底解散了负责评估灾难性风险的"Preparedness"团队,但OpenAI对此予以反驳,称"并未解散Preparedness团队",并表示安全负责人Sacha Jain手下负责网络安全、生化及AI自我改进的研究负责人仍各自在岗。不过,此前领导该团队的Dylan Scandinaro已确认离职。

值得注意的是,大约在同一时期,OpenAI在对即将发布的模型Astra进行内部评估时,也得出了"无法排除其网络能力达到'灾难性'风险阈值"的结论。OpenAI方面强调,此次新安全措施并非针对Hugging Face事件的直接应对。不过该公司也承认,Astra的网络能力以及整体AI开发速度共同推动了此项政策的制定。

具体变化是什么

其中最核心的安全装置是监控体系。OpenAI表示,将广泛审查工具使用记录、推理过程日志以及活动历史,借此捕捉未经授权的行为。根据OpenAI在博客文章中披露的内容,公司的目标是在发现可疑活动后30分钟内发出警报。

网络隔离也是本次强化的对象。OpenAI在新方针中解释称:"即便某一项工作负载或支持性服务被攻破,本身也不应导致其能够未经授权访问互联网或其他内部网络。"不过具体的技术架构尚未公开。

Hugging Face事件发生后,OpenAI曾全面暂停强化学习(RL)训练两周,随后已从风险相对较低的模型开始重启。但相比之下,原计划中规模最大的前沿强化学习训练仍处于停滞状态。公司表示:"在对模型行为进行评估、验证安全装置、并积累更充分的对齐证据之前,只会进行小规模的训练与评估。"

OpenAI研究副总裁Amelia Glaese向记者表示,监管强度会随模型能力的提升而同步增强。OpenAI在博客文章中写道:"监控、对齐与安全标准必须领先于风险本身。"也就是说,模型规模越大、能力越强,将受到越严格的监控。

新安全措施一览

项目内容
监控检查工具行为、推理日志、活动历史,目标为30分钟内发出警报
算力负担相较于受监控进程,额外增加约20%
网络隔离单一工作负载被攻破不足以导致互联网或内部网络访问权限外泄
强化学习训练低风险模型已重启,规模最大的前沿训练仍暂停

如表所示,此次措施可分为监控、隔离以及训练重启节奏这三个方向。不过,关于网络隔离的具体技术架构以及针对该事件的正式事后分析报告,目前仍未公开。

编辑观察

此次公告中值得留意的一点是,OpenAI特意强调"这并非针对Hugging Face事件的直接应对"。这是事件发生一个月后首次公开的应对措施,但公司却刻意与引发此事的事件保持距离,再结合事后分析报告至今仍未公开的情况,这一姿态本身释放出一种微妙的信号。若将其与Astra网络能力评估结果放在一起看,此次措施与其说是针对特定事故的收尾处理,更像是为发布下一代模型所做的前期铺垫。

长期关注前沿模型团队动向的人会发现,这里重复的是同一种模式:事故发生后先暂停训练,再按风险等级由低到高依次解除限制,而规模最大、最重的训练则被压到最后才放行。这次也不例外。不同的是,这一次公司明确用"在积累更充分的对齐证据之前"这样的措辞,规定了重启的标准。过去安全措施往往笼统地一并公布,而如今则转向用具体数字来钉死界限——比如20%的算力成本、30分钟的响应时间。

对于国内自主研发大型模型或委托训练的机构而言,这份表格可以当作一份检查清单来使用。如果没有准备好为监控额外投入20%的算力,那从根本上说,就意味着无法安全运行那种规模的模型。现在正是时候自问:训练环境与外部互联网的接触点隔离得有多彻底,一旦发生事故,从发生到发出警报之间需要多少分钟。

预计未来几周内,OpenAI很可能会发布正式的事后分析报告,以及包含监控系统具体规格的后续博客文章。其中是否会披露隔离技术的实际架构、以及规模最大的强化学习训练何时重启,将成为检验此次措施是否真正落实的下一个考验。

评论