
이미지: OpenAI News
摘要
- OpenAI公开表示,其下一代模型Astra在内部评估中已接近"致命"级网络能力阈值。
- OpenAI正立即对Astra的后续开发实施更严格的安全管控,包括隔离测试环境、限制网络访问以及加密模型权重等。
- 公司计划与相关政府机构及AI安全机构合作,对该模型的能力进行进一步验证。
Astra首次被曝可能具备"致命"级网络能力
OpenAI是一家以"确保通用人工智能(AGI)造福全人类"为使命持续开展AI研究与开发的企业。其治理结构为非营利法人OpenAI Foundation统辖并监督营利法人OpenAI Group,两个组织共同推进这一使命。
2026年8月7日,OpenAI公开了近日针对尚未发布的模型Astra进行的内部评估结果。评估显示,Astra在代理式编程(agentic coding)和网络安全领域展现出显著的性能提升,综合专家评审结果后,公司得出结论:依照准备框架(Preparedness Framework)标准,无法排除该模型的网络能力被评为"致命(Critical)"级别的可能性。

什么是准备框架
OpenAI于2023年12月首次公布了准备框架。该框架旨在追踪模型在生物、化学、网络安全及AI自我提升等核心领域所达到的能力水平,并针对每一个能力临界点,提前设定公司应采取的应对措施。
该框架对"致命"级网络安全阈值设有具体标准:若模型能够在无需人类干预的情况下,针对多个真实核心系统识别并开发出各种严重程度的功能性零日漏洞利用,或仅凭高层次目标便能针对强化目标自主构建并执行全新的网络攻击策略,即被评为该等级。此前的模型GPT-5.6-Sol在同一标准下被评为"高(High)"级别,尚未达到"致命"阈值。OpenAI明确指出,Astra目前仍处于基准测试与评估阶段,与Hugging Face安全事件无关。
OpenAI立即采取的措施
得出上述结论后,OpenAI随即扩大了对自身安全防护和安全管控的强健性测试,以确保部署方式与该网络能力水平相匹配。在内部,公司同步推进了多项额外措施。
首先,公司引入了适用于高能力模型的强化安全管控,包括隔离测试环境、限制网络及工具访问权限、加强模型权重保护与加密、增加监控与检测能力,以及沙盒运行环境等。目前尚未满足上述强化要求的相关Astra内部活动已被暂停。此外,公司在Astra从训练到评估的所有代理式应用环节中,引入了针对风险行为及对齐偏离的通用监控机制。该监控系统会实时评估模型的思维链(Chain of Thought),一旦检测到高风险活动,即触发安全响应流程,对相关活动进行审查与中止。

在外部层面,公司计划与相关政府机构及部分AI安全机构合作,让其能够直接验证该模型的能力,同时还将向第三方测试合作方提供安全执行高风险评估及相关工作所需的推荐安全管控指南。
此前案例与本次公开的背景
OpenAI表示,这并非公司首次针对能力临界点做出应对。早在2025年6月,当自家模型在生物领域接近准备框架"高"级能力阈值时,公司就曾公开过强化安全防护、扩大测试范围、与外部专家合作以及引入额外安全管控等一系列程序。OpenAI说明,此次针对网络能力问题同样遵循相同原则。
公司通过本次发布强调了公开透明的重要性。OpenAI认为,网络能力有所提升的模型应当有助于防御方比攻击者更早发现并修复漏洞,并表示将与政府、安全机构及公民社会合作,努力确保Astra及后续模型的前沿能力能够以负责任的方式部署,造福全人类。目前,有关模型部署时间或商业化日程等具体计划尚未公开。



