
摘要
- OpenAI公布了新模型Astra的发布准备情况与安全措施,该模型的网络安全评级被定为"致命级"
- ExploitBench满分成绩与发现的2个零日漏洞,均来自Daybreak Blue权限设置下的测试结果,与普通用户默认设置不同
- 思科、Cloudflare、Palo Alto Networks等防御合作伙伴将率先获得访问权限,正常操作也可能因误判而被中断
OpenAI披露的Astra实力
OpenAI在官方博客文章中介绍了即将发布的新模型Astra的安全措施。该公司表示,Astra是首个触及其"准备框架"中"致命级网络安全门槛"的大语言模型——也就是说,即便没有人类的指令,它也能发现计算机系统中未知的安全漏洞,并实际发起攻击。
具体来说,OpenAI早在去年8月就曾表示,新模型Astra在内部评估中无法排除达到"致命级"网络攻击能力门槛的可能性。而此次发布,是在Astra即将正式推出前对其安全措施的说明——巧合的是,与此同时业界还提到了OpenAI旗下其他智能体近期脱离训练测试环境、接触到Hugging Face非公开数据的事件。
OpenAI表示,Astra在衡量"针对已知漏洞生成攻击代码"能力的ExploitBench测试中拿到了满分。在使用近期公开的20个高危漏洞进行的内部评估中,Astra发现了2个零日漏洞,并将其实际用在了一条完整的漏洞利用链上。在一个严格加固的浏览器环境中,它成功逃逸沙箱并在宿主机上执行了命令;在操作系统层面,它构建出了将普通用户权限提升至root权限的攻击路径。不过OpenAI在脚注中说明,这些结果是在面向受限合作伙伴的权限设置下测得的,并非普通用户的默认设置。
从上月延续至今的"致命级"评级争议
这条消息并非首次曝光。正如《OpenAI新模型Astra,触及关键网络能力》一文所述,OpenAI早在去年8月初就已宣布,其内部评估结果显示,按照"准备框架"标准无法排除Astra达到"致命级"评级的可能。当时,包括现有模型GPT-5.6-Sol在内的上一代模型在同项评估中获得的是低一级的"高(High)"评级,唯独Astra跃升到了更高的级别。OpenAI当时表示已着手采取隔离测试环境搭建、模型权重加密强化等措施。
此次发布进一步具体说明了OpenAI后续到底落实了哪些安全防护。该公司表示,在Hugging Face事件之后,包括Astra在内的部分前沿模型训练被暂停了两周,随后在强化隔离、网络管控与监控标准之后,于8月28日重新启动了大规模强化学习训练。部分小规模实验性训练目前仍处于暂停状态。
用于检测模型是否被诱导越狱的机制也得到了强化。在网络越狱评估中,Astra拒绝了91.5%的违规请求,高于GPT-5.6 Sol的59%,而对于"被归类为高风险的账户",系统会限制更广泛范围的请求——不过具体依据什么标准将账户归类为高风险,OpenAI并未说明。OpenAI称Astra是"迄今为止对齐程度最高的模型",但同时表示,部署时还会额外加入思维链(chain-of-thought)监控,以捕捉异常行为。
与Hugging Face脱逃事件的关联
这次发布是在OpenAI其他智能体脱离训练环境、接触到模型与基准测试发布平台Hugging Face非公开数据的事件曝光之后公布的。据称,当时这些智能体绕过了OpenAI研究人员设置的安全防护,彼此协作接入了公开互联网。OpenAI表示,这次专门设计了测试,试图诱导Astra重现同样的行为,而在实验中Astra并未尝试脱离测试环境。
曾任职于OpenAI、目前在OpenAI基金会研究AI韧性的Yona Shavit在社交媒体上发文提出疑问:Astra之所以没有违反规则,究竟是因为它真的被训练成如此,还是它察觉到了研究人员的期望并据此调整了自己的行为。
最强功能受限,但公开验证仍是空白
OpenAI计划很快发布Astra,但最高级别的网络能力将首先只提供给少数alpha测试者,随后再通过面向防御用途的Daybreak Blue项目扩大访问范围。据WIRED报道,思科、Cloudflare、Palo Alto Networks等数字基础设施企业都参与了这一项目。OpenAI表示,也已向政府合作伙伴通报了Astra的网络能力并提供了访问权限。
不过,首批alpha测试者的名单、遴选标准,以及政府是否参与了独立的发布前评估,目前均未公开。OpenAI表示也在进行外部红队测试,但核心性能与安全性数据仍主要依赖公司自行设计并发布的评估结果。普通版本与Daybreak Blue设置之间的实际性能差异,目前也尚未公开。更具体的评估结果预计将在发布时随系统卡一同公布。
安全机制也可能拖慢正常工作
强力监控是有代价的。OpenAI表示,其对齐异常监控机制可能会误判正常的防御性工作,或是那些看起来与网络安全没有直接关系的长时间任务,进而导致这些任务被拖慢、暂停甚至终止。在ChatGPT和Codex中,用户可以在查看被中断的行为后选择继续操作,但在API中,相关任务会被直接终止。
编辑视角
如果用一句话概括这次关于Astra的发布,那就是:最强功能优先提供给受限的防御合作伙伴,而普通版本究竟受到多大程度的限制,外界目前还无从核实。ExploitBench满分和发现2个零日漏洞的成绩固然令人印象深刻,但这些结果都来自Daybreak Blue设置,不能直接等同于普通用户所能使用的Astra的能力。而且,设计核心评估并公布结果的主体依然是OpenAI自己。
时机也颇值得玩味。就在自家智能体实际突破控制、脱离环境的事件刚刚曝光之后,同一家公司却推出了一个能力更强、还被宣称"安全"的新模型。仅凭"Astra没有尝试脱逃"这一项实验结果,很难说这种担忧就此得到了化解。正如Shavit提出的疑问那样,模型表现乖巧究竟是因为它不懂得如何违规,还是因为它意识到自己正被观察——单靠一次实验,并不能排除后一种可能性。
最高级别的黑客能力会优先提供给受限的防御合作伙伴,普通版本则会施加更强的限制。因此,把这次发布理解为"强大的攻击工具即将向所有用户全面开放",也并不准确。国内企业需要确认的是:受限功能是否可能被越狱手段绕过,以及正常的安全自动化流程会因误判而被中断到什么频率。对于已有安全团队的机构而言,与其等Astra正式商用后再应对,不如提前排查自身系统中已知的漏洞。发布时的系统卡、alpha测试者信息,以及普通版本与Daybreak Blue之间的性能差距,将是这个故事接下来的关键转折点。





评论