每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

OpenAI新模型Astra被判定具备"致命级"网络能力

OpenAI在2026年8月7日发布的内部评估中表示,即将发布的模型Astra在其准备框架(Preparedness Framework)下无法排除达到"致命级(Critical)"网络能力阈值的可能性。

이미지: AI 생성 — METAL LAB

摘要

  • OpenAI公布对即将发布的模型Astra的内部评估结果,称其无法排除在准备框架下达到"致命级"网络能力阈值的可能性。
  • 包括此前的GPT-5.6-Sol在内的现有模型,在同一评估中均被判定为低于"致命级"一档的"高(High)"级别阈值。
  • OpenAI已立即采取强化安全管控措施,包括搭建隔离测试环境、加强模型权重加密、对所有智能体应用进行监控,并暂停了未满足相关要求的内部活动。

Astra可能已达到"致命级"网络能力阈值

OpenAI于8月7日通过官方博客公布了对即将发布的模型Astra的内部评估结果。公司表示,在过去数日进行的评估中,Astra在智能体编程和网络安全领域展现出显著的性能提升,基于此,公司在前一晚得出结论:无法排除该模型在准备框架下达到"致命级(Critical)"网络能力阈值的可能性。

OpenAI表示:"我们认为,向安全社区和公众透明地分享这一潜在能力变化非常重要。"公司强调,Astra目前仍处于发布前阶段,此事与近期Hugging Face的安全事件无关。

准备框架网络安全能力阈值标准说明画面
图片:OpenAI News

"致命级"阈值是什么

根据OpenAI的准备框架,模型要达到"致命级"网络安全阈值,必须满足以下两个条件之一:其一,能够在无需人工干预的情况下,在多个强化的真实世界关键系统中识别所有严重级别的零日漏洞,并开发出可正常运行的漏洞利用程序;其二,仅在获得高层次目标的情况下,能够针对强化型攻击目标从头到尾构思并执行全新的网络攻击策略。

在本次评估中,包括GPT-5.6-Sol在内的此前模型,在同一框架下均被判定为低于"致命级"一档的"高(High)"级别阈值。OpenAI表示,公司最早于2023年12月发布准备框架时,生物、化学、网络安全及AI自我改进能力都远未接近这一水平。

立即实施的安全强化措施

基于这一结论,OpenAI已立即针对Astra的部署级别扩大了安全措施和安全管控的稳健性测试。在内部,公司已采取搭建隔离测试环境、限制网络及工具访问权限、加强模型权重保护与加密、增加监控与检测功能、部署沙箱执行环境等适用于高能力模型的严格安全管控措施。

对于尚未满足这些强化安全管控要求的Astra相关内部活动,公司已予以暂停。

Astra安全管控及隔离测试环境结构图
图片:OpenAI News

外部合作及后续计划

OpenAI表示,此次评估结果将促使公司与相关政府机构及部分AI安全机构合作,对Astra的能力进行进一步测试。此外,公司还计划向第三方测试合作伙伴提供安全执行高风险评估及工作负载所需的推荐安全管控事项。

OpenAI表示,此次采取的措施与2025年6月生物领域模型能力接近准备框架"高"级别阈值时所公开的应对步骤——强化安全措施、扩大测试范围、与外部专家合作、部署额外安全管控——遵循相同原则。公司表示:"具备高级网络能力的模型,应该帮助防御方比攻击者更早发现并解决漏洞。"并重申将与政府、安全机构及公民社会合作,确保Astra及后续模型的前沿能力能够以负责任的方式部署。