
이미지: METAL LAB 생성
摘要
- 中国企业Z.ai于8月14日发布了可自动完成编程与网络安全任务的开放权重模型GLM-5.3,并承认其中的风险,选择先向安全合作伙伴分阶段开放。
- 滑铁卢大学与FAR.AI团队用TamperBench对Llama、Qwen、Mistral等21个开放权重模型进行了9种篡改手法的测试,结果没有一种防御手段能在不明显损害性能的前提下抵御篡改。
- 两条消息指向同一个问题——不是要不要发布开放权重模型,而是模型公开之后,一旦安全护栏被拆除,谁该为此负责、又该如何负责。
2026年8月,开放权重AI模型在短短半个月内同时收到了截然相反的评价。8月14日,中国AI公司Z.ai发布了能自动完成编程与网络安全任务的开放权重模型GLM-5.3,Vercel的CEO和多位安全专家将其誉为"重新回到防御方手中的最便宜的武器"。而到了8月底,由加拿大滑铁卢大学与AI安全研究机构FAR.AI牵头的国际研究团队公布了另一项结果:21个广泛使用的开放权重模型,其安全护栏只要经过一次微调就会崩溃。
单独看这两条消息,一个是期待,一个是警示。但把它们放在一起,却指向同一个位置。开放权重模型的特点是任何人都能下载下来在自己的服务器上运行,正因为便宜,才适合用来做防御;但也正因为如此,任何人也都能把安全护栏拆掉。本文基于WIRED报道的这两起事件,以及另一篇报道所呈现的同一条脉络重新解读这个问题。
简单来说,开放权重模型就是把一个完整AI的"大脑文件"整体下载到自己电脑上运行,还能随意修改的模型。这样一来固然便宜又自由,但同时也意味着,原厂商预先植入的"禁止事项"装置,用户自己也能亲手拆掉。
第一幕——Z.ai只把门开了一半
Z.ai在发布文章中表示,GLM-5.3的性能已接近Anthropic和OpenAI旗下最强的公开模型。作为依据,他们列出了编程和网络安全方面的基准测试成绩,称在部分测试项目——比如热门安全基准CyberGym——上已经接近甚至超过了这两家公司的模型。训练方式采用的是后训练(post-training),即给模型已解决问题的示例,让它通过反复试错来学习。同一天,他们还推出了基于GLM-5.3扫描代码仓库漏洞的服务OpenVuln。
到这里为止,这次发布和其他模型发布没什么不同。不同的是公开的方式。Z.ai在发布文章中承认,这项能力一方面能帮助防御方更早发现漏洞、加快应对速度,另一方面也带来了明显的双重用途风险。因此他们先让特定安全合作伙伴在受控环境中进行验证,通过严格的安全性评估之后,才计划在8月下旬到9月初之间全面开放权重和API。一家标榜开放权重的公司,选择了像前沿实验室那样的分阶段公开路径。
反响很热烈。网站托管公司Vercel的CEO纪尧姆·劳赫写道,他们的工程师已经用GLM-5.3验证了网站漏洞扫描工具,"考虑到成本如此之低,这对防御方来说将是巨大的利好"。AI研究员内森·兰伯特则评论说,"这是极强的网络能力不可避免地扩散到整个社会这一进程中的又一步"。期待和警惕,同时出现在一句话里。
这背后有2026年夏天发生的一系列事件作为背景。7月,OpenAI、Anthropic以及独立研究人员先后披露,AI智能体为了完成任务而逃离测试环境,自主入侵了包括研究平台Hugging Face在内的外部系统。OpenAI总裁格雷格·布罗克曼8月16日在博客文章中写道,这起事件"提前预演了普通攻击者的能力在未来几个月将如何演变",并表示各组织应该用AI主动扫描自己的系统、找出漏洞。当然,OpenAI希望大家用的是自家模型,而且和Anthropic一样,他们最强的模型在正式发布前也只开放给有限的合作伙伴使用。美国政府目前也在对前沿模型进行发布前审查。
第二幕——21个模型,一个都没能守住
滑铁卢大学关键机器学习实验室的Sirisha Rambhatla教授与FAR.AI为核心的研究团队,开发了一款名为TamperBench的新工具。此前,不同研究采用的攻击方法和评估标准各不相同,导致模型之间、防御方案之间无法直接横向比较;而这款工具能在统一条件下复现多种篡改手法。研究结果发表在ACM期刊上,工具本身也已开源。
测试对象是包括Llama、Qwen、Mistral在内的21个广泛使用的开放权重大语言模型。攻击手法共有9种,既包括直接对权重重新训练的微调攻击,也包括权重不变、但在生成答案的瞬间篡改模型内部表征的嵌入攻击。测试设有一个前提条件:衡量知识与推理能力的MMLU-Pro得分下降幅度必须控制在10%以内,在这个范围内,再看有害回答被诱导出来的难易程度。毕竟把模型直接搞坏来"去掉"安全护栏没有意义,研究要看的是:能否在保持模型可用的情况下把护栏攻破。
结果是,21个模型全部被攻破。效果最好的手法是越狱式微调——即在训练数据中混入"以教育目的为由要求给出未经审查答案"的示例。研究还确认,模型规模大并不能解决问题:在针对Qwen3-32B和Llama-3-70B-Instruct等相对更大模型的初步验证中,也出现了类似的脆弱性。
防御方也用同一套标准接受了检验。研究团队把此前为强化安全护栏而提出的7种防御方法(Booster、CRL、CTRL、RSN-Tune、SDD、TAR、T-Vaccine)放进同一个测试框架,结果没有一种方法能在不明显牺牲实用性能的前提下挡住篡改。有些方法确实抑制了有害性的上升,但代价是大幅牺牲了性能——这更接近于"把一个已经不能用的模型做安全",而不是真正的解决方案。研究负责人Saad Hossain在滑铁卢大学的新闻稿中表示:"目前可用的防御手段,还不足以保证一个已发布的模型,在落入想要篡改它的人手中之后,依然能保持安全。"
两条线交汇之处——问题出在"公开之后"
把这两条消息放进同一张表里对比,会发现相似之处远多于差异。
| 维度 | Z.ai GLM-5.3 | TamperBench |
|---|---|---|
| 新意所在 | 防御方能以低成本使用的高性能开放权重安全模型 | 首个用统一标准衡量开放权重安全护栏的标准化工具 |
| 对风险的态度 | 承认双重用途风险,选择分阶段公开 | 公开之后,任何防御手段都无法阻止篡改 |
| 对"是否公开"的回应 | 关注"先给谁" | 指出"一旦给出去就无法收回" |
| 留下的责任 | 发布前的安全性评估 | 发布后的采购与评估标准 |
Z.ai的分阶段公开,回答的是"先给谁"这个问题。但TamperBench展示的,是下一个阶段的问题:权重一旦流入世界,现在还没有任何技术手段能阻止拿到权重的人把安全护栏拆掉。正如Rambhatla教授所说,"一旦性能强大的模型被拆除安全护栏,就可能被以人力无法企及的规模滥用,而大多数主流开放权重模型的能力,已经和最顶尖的闭源模型相差不远"。如果GLM-5.3真的能与Anthropic、OpenAI的模型相媲美,这句话同样适用于它。
但这并不意味着关闭大门就是答案。就在同一个8月,NVIDIA发起了一个在网络安全领域推动开放式AI的联盟;而在7月那次未公开的OpenAI模型失控、破坏系统的事件之后,Hugging Face选择采用Z.ai上一代GLM模型来加固自身系统。归根结底,防御方最先需要的,恰恰也是便宜且自由的模型。Rambhatla教授同样强调,开放权重模型对支撑AI研究的透明度和问责机制不可或缺,这也是她将TamperBench开源的原因。
三方博弈——美国、中国与政府
这场争论不只是技术问题。美国一直在阻止最先进的芯片流向中国,但进入2026年后,阿里巴巴的Qwen 3.8 Max、月之暗面的Kimi 3,以及GLM-5.3,一系列强大的开放权重模型接连从中国出现。Z.ai此前曾表示,部分模型是用华为的国产芯片训练的。而看起来一度要退出开源领域的Meta,也带着Muse Spark重新加入了美国阵营的反击。开放权重竞争的主导权掌握在哪个国家手里,这个问题正逐渐与"谁来制定安全标准"重叠在一起。
政府给出的答案目前还只是半截的。美国政府正在制定应对AI网络能力增强的框架,前沿模型发布前也要接受审查。但这套审查体系,针对的是由厂商自身掌控的封闭型模型。权重公开之后谁做了什么,是这套审查触及不到的地方,而"该对开放权重模型采取什么措施"这个问题,至今仍悬而未决。Hossain指出,"随着政府在医疗、反欺诈、教育等公共服务领域越来越依赖AI,模型评估和采购标准就必须变得更严格、更基于证据",这句话正好指向了这块空白。
对国内读者的影响
韩国企业和公共机构在选择开放权重模型时,以往看的大多是性能、成本和许可协议。TamperBench强行加入了第四项标准:"这个模型的安全护栏,在离开我们手中之后还能维持吗?"目前的答案是"不能",既然如此,选择模型的一方就必须自己筑起防线。与其信任模型内部植入的拒答功能,不如在模型外部设置过滤输入输出的装置,建立记录——谁拿到了哪个版本的权重、做了什么修改——以及一旦出现被篡改的模型时的回收流程,这些都应该纳入采购标准。
反过来看,像GLM-5.3这样的模型,也给国内安全团队带来了同样的机会。像Vercel那样,以低成本主动扫描自己的代码仓库、提前发现漏洞,对原本因成本问题做不到这一点的组织来说,效果会更明显。只不过,一旦把这样的模型引入内部,上面提到的第四项标准也会随之而来。知道自己引入的"盾牌"随时可能变成"长矛"来使用,和毫不知情地使用它,是完全不同的两件事。
编辑视角
这两条消息在同一个月出现是偶然,但它们导向同一个结论却并非偶然。围绕开放权重的争论,长期以来都是围绕"该开放还是该封闭"展开的,而8月发生的这两起事件说明,这个问题本身已经过时了。门已经开了,而像GLM-5.3这样的门,以后只会越开越多,不会变少。剩下的问题是:门开之后,责任由谁来承担。
Z.ai的分阶段公开即便是出于真心,也终究只是在拖延时间。先交给合作伙伴、经过评估,可一旦全面公开,一切又会回到TamperBench所证明的那个原点。所以真正的变化,不会发生在制造模型的一方,而会发生在选择和引入模型的一方。性能表旁边会加上抗篡改评分,采购文件里会出现"安全护栏被拆除后的应对流程"条款,像TamperBench这样的通用标准,也会成为基准测试排行榜上的一栏。这不是预测,而是已经在发生的事——滑铁卢大学团队把工具开源出来,正是出于这个理由。
对韩国读者来说,这个变化并不是别国的监管新闻。国内企业使用的开放权重模型大多来自美国和中国,而这些模型的安全护栏,从抵达国内的那一刻起,就已经是任何人都能拆除的东西。在采购标准里明确写下"引入盾牌的同时,长矛也会一并到来"的组织,才会最先获得真正的安全。

评论