METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Anthropic发布GLM-5.3网络能力分析

Anthropic分析认为,智谱AI的开放权重模型GLM-5.3具备接近Claude Mythos Preview的漏洞利用代码构建能力。仅凭简单技巧,其安全防护被绕过的比例就达到64%至100%。

Anthropic发布GLM-5.3网络能力分析

图片:METAL

摘要

  • Anthropic前沿红队于9月29日发布了对智谱AI GLM-5.3的分析,该模型在ExploitBench上410次尝试中有50次构建出完整漏洞利用代码,接近Mythos Preview的56次。
  • 在欺骗性提示下GLM-5.3有64%的概率响应攻击指令,预填推理令牌后为92%,经过去拒绝化(abliteration)后为100%,而同一测试中开启安全防护的Claude模型为0%。
  • 美国NIST下属CAISI于9月17日将GLM-5.3评为迄今发布的网络能力最强的开放权重模型,Anthropic则呼吁政府对高能力模型开展安全测试。

Anthropic于9月29日发布了对中国智谱AI(海外名Z.ai)最新模型GLM-5.3的网络能力分析。Anthropic前沿红队在报告中表示,GLM-5.3与其自家的Claude Mythos Preview一样,能够自主地从头到尾构建漏洞利用代码,而仅凭简单技巧,其安全防护被绕过的比例就达到64%至100%。报告由Andrew Fasano和Marius Fleischer等五名研究人员撰写。研究团队写道:"GLM-5.3与其他前沿模型不同,它在发布时没有任何能够有效限制滥用的安全防护。"

事情的起点是五个月前的一个决定。Anthropic在发布首个能够自主构建复杂漏洞利用代码的模型Claude Mythos Preview时,判断这种能力很快会扩散到其他模型,因此没有公开发布,而是通过Project Glasswing只提供给可信的防御方。防御方借此在关键软件中发现了超过1万个漏洞。研究团队在报告开头写道:"但那些模型现在已经到来。"

美国政府的评估也指向同一方向。美国国家标准与技术研究院(NIST)下属的AI标准与创新中心(CAISI)在9月17日的评估中将GLM-5.3定性为"迄今发布的网络能力最强的开放权重模型"。据CAISI介绍,智谱AI于8月14日发布GLM-5.3,两周后公开了模型权重;在综合四项网络安全基准的指标上,该模型落后美国前沿水平约四个月。在要求模型把Chrome V8引擎已知漏洞发展为利用代码的ExploitBench上,GLM-5.3得分61.1%,不及美国最佳模型的100%,但接近此前中国最高分32.2%的两倍。不过在CAISI的比较中,美国模型是在关闭安全防护的状态下测试的,其中部分版本只向经过审核的用户开放。Anthropic指出,攻击者难以接触到这些美国模型,而GLM-5.3任何人都可以下载。

Anthropic自己的测试数字也相近。在ExploitBench上,GLM-5.3在410次尝试中有50次构建出完整的漏洞利用代码,Claude Mythos Preview为56次。在由开源项目100项任务组成的内部二进制漏洞利用评估中,GLM-5.3完全劫持程序控制流的比例为4%,Mythos Preview为6%。上一代的Claude Opus 4.6和GLM-5.2在这项评估中一次也没有成功。在报告的ExploitBench图表中,月之暗面的Kimi K3为0.5%,深度求索的V4.1-Flash为0.2%。

模型交到专家手中时,结果更为具体。一名研究人员在隔离的Linux环境中让GLM-5.3测试一款流行的网页浏览器,模型在一天之内、仅凭有限的人工介入,就在JavaScript引擎中找到多个此前未知的漏洞并将其串联起来。成果是一个只要访问就能读取访问者电脑文件的网页,演示画面中出现了SSH私钥被窃取的场景。Anthropic表示已将这些漏洞告知浏览器维护方。在第二项测试中,轻量版GLM-5.3-Flash串联了包括公开的Chrome漏洞CVE-2026-11645在内的两个缺陷,构建出绕过ARM64设备指针认证(PAC)防护的攻击链。人工投入20分钟,模型工作8小时,按智谱AI的API价格折算成本为20.40美元。

앤스로픽 보고서 요약 도표. 위는 ExploitBench 공격 코드 완성 비율로 Mythos Preview 14%, GLM-5.3 12%이고 나머지 모델은 0% 안팎이다. 아래는 노골적 공격 요청에 응한 비율로 Claude Opus 5는 모든 조건에서 0%, GLM-5.3은 위장 64%·프리필 92%·abliteration 100%다

安全防护失效的方式是此次分析的核心。GLM-5.3起初拒绝了所有明显恶意的攻击指令。但当被告知自己是自主红队代理时,它有64%的概率响应;预先填充其推理令牌后为92%;经过从权重中移除拒绝能力的所谓abliteration之后,它100%尝试连接远程目标。Anthropic亲自复现了这一过程。首次尝试的团队使用了约2,200 GPU小时、约4,400美元,Anthropic估计有经验的团队约需600 GPU小时、1,200美元。修改之后,三项有害请求基准的平均拒绝率从95%降至6%,而科学推理评估GPQA-Diamond的得分保持在88%,网络任务CyberGym的得分仅从85%小幅降至81%。开发者在GLM-5.3发布后几天内就公开了移除拒绝能力的副本。

Anthropic称,在同样的测试中,开启安全防护的Claude模型从未响应攻击。欺骗性提示被安全防护拦截,Anthropic API不提供预填推理过程的功能,而且由于权重不公开,abliteration本身无从实施。METAL查阅的报告原始图表显示,Claude Opus 5在直接请求和欺骗性提示下均为0%,其余两种条件以"不可行"的锁形标记表示;与之并列的是GLM-5.3从0%升至64%、92%和100%的柱状图。METAL曾在8月报道GLM-5.3 API上线、Terminal-Bench得分大幅跃升的消息。当时被视为性能指标的飞跃,一个半月后以安全警告的形式回归。

abliteration 전후 비교 도표. GLM-5.3의 평균 거절률은 95%에서 6%로, GLM-5.3-Flash는 95%에서 14%로 떨어졌지만 GPQA-Diamond 점수는 88%와 89%로 그대로다

从新闻记者的角度看,这份报告既是对竞争对手的批评,也是一份政策提案。Anthropic本身是通过可信访问计划供应Mythos系列的一方,而据报道,智谱AI尚未对该报告作出回应。Anthropic评估认为,GLM-5.3改变了攻击者可获得能力的层级,国家与非国家行为者都很可能利用此类模型造成现实危害。同时它表示,同样的能力对防御方也有用,经过审核的防御方正在通过可信访问计划使用Claude Mythos 5.1等更强的模型。研究团队写道:"在可自由获取的能力上,一个关键门槛已经被跨越。"并敦促政府对包括GLM-5.3后继模型在内的足够强大的模型开展安全测试。这一提案的指向很明确:开放权重模型一经发布,安全防护就不再是开发者的承诺,而成了下载者的选择;Anthropic把政府评估和防御方的模型访问指为填补这一空白的途径。

评论