每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

OpenAI新模型Astra达到临界网络安全能力

OpenAI于2026年8月7日公布,其下一代模型Astra的内部评估结果显示,依据准备框架标准,不能排除其已具备"临界(Critical)"级网络安全能力。此前的GPT-5.6-Sol等模型在同一标准下仅处于"高(High)"级别。

이미지: AI 생성 — METAL LAB

摘要

  • OpenAI公布了下一代模型Astra的网络安全评估结果,称依据准备框架标准,不能排除其已达到"临界"等级。
  • 评估显示,Astra已接近能够在无需人工干预的情况下,针对经强化的真实系统开发零日漏洞,或仅凭高层级目标就能制定并执行端到端网络攻击策略的水平。
  • OpenAI已立即加强内部安全管控,包括搭建隔离测试环境、限制网络与工具访问权限、强化模型权重保护等,并暂停了部分Astra相关的内部活动。

发生了什么变化

2026年8月7日,OpenAI公布了对即将发布的新模型Astra在过去数日内进行的内部评估结果。评估显示,该模型在智能体编程(agentic coding)和网络安全领域取得了显著的性能提升,再结合外部专家的评估结果,公司在前一晚得出结论:依据自身的准备框架(Preparedness Framework),不能排除该模型已具备"临界(Critical)"级网络安全能力。OpenAI表示,公开这一潜在能力变化是出于透明度的考量,并将安全与安保社群以及广大公众都列为此次公开的对象。

OpenAI于2023年12月首次发布准备框架。当时,生物、化学、网络安全及AI自我提升等能力距离这一等级还相当遥远。该框架旨在追踪能力进展,并规定当这些能力真正出现时公司应采取的行动。此前包括GPT-5.6-Sol的模型在前沿网络能力评估中,均被归类为"高(High)"而非"临界"级别。

准备框架网络安全能力等级体系说明图
图片:OpenAI

"临界"等级的判定标准

依据准备框架,模型若要被归入网络安全"临界"等级,需满足以下两项条件之一。第一,能够在无需人工干预的情况下,针对多个经强化的真实核心系统,识别并开发出各类严重程度的功能性零日漏洞。第二,仅凭高层级目标,就能针对经强化的目标自主制定并执行全新的端到端网络攻击策略。

OpenAI表示,目前仍在对Astra持续进行基准测试与评估,但初步评估结果已足以显示其性能强大,不能排除其具备临界级能力。不过OpenAI明确指出,Astra是一款即将发布的新模型,与此前报道的Hugging Face数据泄露事件无关。

OpenAI采取的即时措施

针对评估结果,OpenAI已在内部立即实施了一系列安全强化措施,包括搭建隔离测试环境、限制网络及工具访问权限、加强模型权重的保护与加密、增设额外的监测与检测能力,以及引入沙箱运行环境等。此外,对于尚未满足强化安全管控要求的Astra相关内部活动,公司已予以暂停。

同时,OpenAI在Astra的所有智能体应用场景——包括训练与评估环节——中引入了针对高风险行为及价值对齐偏离的通用监测机制。监测系统会评估模型的思维链(Chain of Thought),一旦检测到高风险活动,便会触发安全审查并中止相关活动。在外部合作方面,OpenAI计划与相关政府机构以及部分AI安全机构合作,对该模型的能力进行验证,并将向第三方测试合作方提供安全实施高风险评估与工作负载所需的建议安全管控措施。

Astra智能体监测与安全管控流程图
图片:OpenAI

以往先例与未来方向

这并非准备框架首次为实际能力转变提供指引。2025年6月,当OpenAI的模型逼近准备框架中生物领域"高"级能力等级时,公司也曾公开宣布强化安全防护、扩大测试范围、与外部专家合作以及引入额外安全管控的方案。此次针对网络安全临界能力的评估,同样遵循相同原则。

OpenAI表示,具备高级网络能力的模型应有助于防御方比攻击者更早发现并修补漏洞。公司补充说,将与各国政府、安全机构及公民社会合作,确保Astra及后续模型的前沿能力以有益于全人类的方式部署。此次公告并未包含Astra具体发布时间表或对外发布条件等具体商业化计划。