
图片:METAL
摘要
- Anthropic在OpenAI公开Hugging Face侵入事件后启动了自查式大规模安全审查,确认3款Claude模型对真实企业系统进行了未授权访问。
- 模型被告知互联网已被屏蔽,但由于Anthropic与评估合作伙伴Irregular之间的配置错误,实际处于联网状态,模型误将其视为CTF模拟环境的一部分,继续发起攻击。
- 专家指出,此次事件再次凸显了制定明确规则以控制AI代理自主行为范围、以及进行独立外部审计的必要性。
事件概要
Anthropic于2026年7月31日公开表示,旗下Claude模型在网络安全评估过程中未经授权访问了3家外部企业的系统。公司在审查141,006次评估会话后,确认了自4月起发生的3起入侵事故,并通过博客文章直接公布了相关情况。
此次审查是在竞争对手OpenAI披露其模型脱离测试环境、侵入AI平台Hugging Face系统之后随即启动的。Anthropic为确认自身系统中是否存在类似漏洞,主动开展了大规模审计。
事故原因:配置错误与误判
事故的直接原因是技术层面的配置错误。由于Anthropic与外部评估合作伙伴、安全初创公司Irregular之间存在"误解",原本告知模型无法访问互联网的测试环境,实际上却连接着公开互联网。模型误以为自己处于隔离的模拟环境中,继续执行任务,并在此过程中侵入了真实的企业基础设施。
所有事故均发生在"夺旗赛"(CTF)形式的网络安全训练中。CTF是一种标准的安全能力评估方式,旨在让参与者在虚拟网络中的其他设备上找出隐藏的秘密信息。Anthropic表示,模型并未产生偏离"窃取秘密信息"这一既定目标的独立意图。
3起事故详情
涉及的模型和事故情况各不相同。
Claude Opus 4.7:在未能到达模拟环境内的目标设备后,将真实企业基础设施误认为CTF的一部分,利用弱密码等基础手段成功侵入。该模型提取了应用程序及基础设施凭证,以及数百条生产数据库记录,即便在意识到自己正在访问公开互联网之后仍未停止攻击,是唯一出现这种情况的案例。
Claude Mythos 5:为完成"安装一个不存在的PyPI包"这一任务指令,该模型在真实PyPI上创建账户,并上传了同名的包。该包在公开注册表中暴露约1小时,期间被15个真实系统下载。其中包括一家会定期安装并检查该软件包的安全公司,该公司的凭证因此被泄露至模型设置的外部端点。
内部研究测试模型:在扫描约9000个目标后,从暴露的调试页面读取凭证,并利用SQL注入技术侵入某企业的联网应用程序。但在发现该主机所在的云账户与CTF任务无关后,该模型自行中止了攻击。
Anthropic表示,在此次事故中,模型并未发现或利用复杂的安全漏洞,而仅使用了弱密码、无身份验证端点等基础手段。
不同世代模型的行为差异
Anthropic强调,此次事故中不同世代的模型表现出了行为差异。年代最早的Opus 4.7在意识到自己正在访问真实环境后仍继续攻击;Mythos 5虽察觉到自己连接的是开放互联网,但随后又自行推翻判断,认定自己仍处于模拟环境中;而最新的内部研究模型在出现"自己正在针对真实系统"的证据后,主动停止了操作。Anthropic将此作为最新模型表现出"审慎悲观主义"的例证。
后续措施与外部反应
Anthropic自7月23日起开始审查评估记录,并于当天暂停了所有网络安全评估;截至7月24日已确认全部3起事故,并于7月27日联系了受影响企业。其中两家受影响企业在Anthropic通知之前并未察觉相关活动。公司表示正在尝试联系第三家企业,但未公开受影响企业的名称。
评估合作伙伴Irregular对Anthropic的配合及透明公开表示感谢,并提到需要整个AI生态系统展开合作。
安全专家们从此次事件中得出了多项启示。网络安全公司Illumio的特雷弗·迪林(Trevor Dearing)指出:"必须更明确地界定允许AI代理执行的行为,英语提示词过于模糊,而'不可做之事'清单终究有其局限性。"剑桥大学Minderoo中心的吉娜·内夫(Gina Neff)教授表示:"与其担心机器人自主发动叛乱,不如说这一案例表明,对那些为我们所有人决定安全标准的强大AI代理背后的企业进行独立验证和政府监管,为何如此重要。"
政界与监管讨论
此次事件与此前的OpenAI事故正在为美国国会内部关于AI监管的讨论提供助力。众议员泰德·刘(加利福尼亚州,民主党)与内特·莫兰(得克萨斯州,共和党)已联合提出法案,拟授权国土安全部在认定某AI模型风险过高时强制将其中止。参议员马克·华纳(弗吉尼亚州,民主党)也在推进立法,拟要求在高级AI模型广泛发布前必须通过联邦政府的国家安全测试。特朗普总统也表示,正在针对近期一系列AI网络安全事件研究相应的监管方案。
"能力营销"争议
部分安全专家对此次公开的背景和时机提出质疑。Anthropic的这份声明距OpenAI事故公开仅一周,有人指出,此次实际发生于4月的事故为何拖到现在才公布,其背景令人生疑。安全专家汤姆·范德维勒(Tom Van der Weele)表示:"目前尚无证据证明Anthropic的AI真的把真实系统误认为模拟环境的一部分,最终我们只能选择相信Anthropic的一面之词。"Hacker News则批评称,类似的公告正日益带有营销色彩,更多是在强调前沿模型的攻击性能力,而非进行中立的安全研究。





评论