
이미지: X — 모델·오픈소스 화면 갈무리
摘要
- Z.ai公开了GLM-5.3 API,基础模型与GLM-5.2相同,仅通过后训练就提升了性能
- Terminal-Bench 3.0得分从4.6升至28.3,CyberGym漏洞发现基准测试创下历史最高纪录
- 价格与GLM-5.2保持一致,通过官方API和合作伙伴模型网关提供
- 공개일
- 2026년 8월 18일, API 라이브
- 베이스 모델
- GLM-5.2와 동일, 사후훈련만으로 개선
- Terminal-Bench 3.0
- 4.6 → 28.3
- DeepSWE v1.1
- 46.2 → 66.9
- Agents' Last Exam (CLI)
- 23.8 → 28.5
- 취약점 익스플로잇 벤치마크
- GLM-5.2 대비 2배 이상 점수
- 컨텍스트/출력
- 1M 토큰 입력, 최대 128K 토큰 출력
- 가격
- GLM-5.2와 동일
4.6到28.3,数字先说话
衡量模型在真实终端环境中完成任务能力的Terminal-Bench 3.0得分从4.6升至28.3,涨幅超过六倍。Z.ai(智谱)8月18日通过官方X账号宣布,GLM-5.3 API已正式上线。官方说明称,此次针对编程、防御性网络安全、长周期智能体任务三大方向进行了强化。
与GLM-5.2同体,但训练不同
GLM-5.3并非从零打造的新模型。其基础模型与6月16日公开的GLM-5.2完全相同,只是在此基础上额外加入了后训练(post-training)——即对已完成的模型用实战任务重新训练打磨的阶段。尽管如此,效果并不小。在Z.ai自有代码基准测试中,相较GLM-5.2性能提升了50%,官方表示在开源模型中,该模型在Terminal-Bench 3.0和Agents' Last Exam(CLI)测试中取得了最高成绩。
GLM系列近几周在多个方向上不断扩张。8月11日,Z.ai的编程工具ZCode用户数突破100万,GLM Coding Plan全体用户的使用限额随之重置,当时就已预告将推出增强长周期任务能力的更新。此次GLM-5.3的成绩单可以看作是这一预告的具体落地。一天后的8月12日,Mistral宣布将在欧洲算力联盟平台上引入GLM-5.2作为第三方开源模型。这意味着GLM系列已不仅限于自有服务,也正逐渐成为其他平台的默认选项之一。
编程能力提升的方式——把环境做得更贴近实战
Z.ai表示,此次改进的核心在于"环境扩展"。如果说以往的编程基准测试还停留在短小练习题的水平,那么GLM-5.3的训练则直接引入了熟练工程师需要花费数天才能完成的实务级任务。例如在ML基础设施任务中,模型被赋予与真实工程师完全相同的工作环境——计算集群、存储、内部文档、代码库、实验结果一应俱全,要求其诊断训练堆栈的瓶颈并应用优化,在保持准确性的同时完成可衡量的速度提升。
由于这类任务环境无法靠人工逐一搭建,Z.ai表示已构建了一套自动化流水线,可将真实工作模式转换为具有多阶段依赖关系和隐藏状态的长周期运行环境。另有独立的评审智能体会亲自尝试解决每项任务,以验证其是否真正可解;没有标准答案的合成验证器必须通过oracle检验、零动作检验、未解决状态检验后,才能作为可信的奖励信号使用。此外还沿用了GLM-5.2中引入的SAO(含压缩)强化学习策略,以确保不仅在短任务中,在长周期任务中性能提升也能得以保持。
网络安全领域出乎意料地快速提升
随着后训练规模扩大,网络安全领域的提升超出了预期。GLM-5.3在衡量漏洞发现能力的CyberGym基准测试中,创下了迄今为止所有模型中的最高成绩。更值得关注的是,漏洞利用(实际攻击复现)链条追踪得越深入,与GLM-5.2的差距就越大,相关基准得分超过了GLM-5.2的两倍以上。Z.ai将其定位为防御性安全用途,但发现漏洞与实际实施攻破的能力同步增长,也意味着攻防两方面的能力正在一同成长。
| 基准测试 | GLM-5.2 | GLM-5.3 |
|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 |
| DeepSWE v1.1 | 46.2 | 66.9 |
| Agents' Last Exam (CLI) | 23.8 | 28.5 |
如何使用
GLM-5.3可通过两种方式使用。一是直接调用API,二是通过订阅制的GLM Coding Plan接入编程智能体。
通过API接入的情况——Z.ai支持三种协议。
| 协议 | 基础URL |
|---|---|
| OpenAI Chat Completion | api.z.ai/api/coding/paas/v4 |
| OpenAI Response | api.z.ai/api/v1 |
| Anthropic Message | api.z.ai/api/anthropic |
若此前已将调用设置为thinking.type: "disabled"的用户,必须将其改为enabled,并将reasoning_effort设为low,同时将模型ID改为glm-5.3。因为从GLM-5.3开始,已完全取消关闭推理的选项。推理强度分为low(轻量)、high(增强)、max(深度)三档,默认值为max。复杂编程任务建议使用max。
通过GLM Coding Plan接入的情况——可直接连接到所需的编程智能体使用。新的计费体系改为基于积分的定量制,包括周末在内的非高峰时段调用只消耗标准积分的50%。若曾使用过GLM Coding Plan(包括已过期的订阅),目前只能通过兼容OpenAI Chat Completion的协议访问模型API。
谁可以使用——官方API只需申请API密钥并注册支付方式即可开放使用,无需另行排队;GLM Coding Plan则可通过个人或团队套餐订阅使用。同时也公开了通过合作伙伴模型网关的接入方式。
可以尝试哪些应用——例如,可以将整个诊断遗留代码库性能瓶颈并完成优化的任务全权交给模型处理,或让企业内部安全团队将其接入漏洞扫描自动化流水线,加快发现环节的速度。得益于1M token的上下文长度,也可以一次性输入大型代码仓库整体并交由其审查。
编辑视角
此次发布中真正值得关注的一点,是"未改变基础模型"这句话。没有从零重新训练新模型,而是在同一副"身体"上仅增加后训练,就将基准测试成绩提升了近六倍,这释放出一个信号:如今开源阵营的竞争,已经从基础模型规模之争,转向"能将再训练环境做得多贴近实战"之争。Z.ai所描述的环境合成流水线——将真实工作模式自动转化为可执行任务,并由评审智能体进行验证的结构——与OpenAI或Anthropic此前在非公开场合采用的方式并无太大差异。不同之处在于,Z.ai将这套方法应用于开放权重模型,并公开了成绩单。
从将同量级开源编程模型投入实际业务的经验来看,基准测试上出现数倍提升,通常只有两种可能:要么是真正提升了完成长周期任务的能力,要么是基准测试本身针对该模型系列进行了重新设计。像Terminal-Bench 3.0这样版本更新的基准测试,后一种可能性也必须始终纳入考虑。尽管如此,DeepSWE和CyberGym这类性质迥异的基准测试成绩同步提升,很难用巧合来解释。
对国内开发团队而言,实务层面的启示很明确。价格与GLM-5.2保持一致而性能却提升,意味着已经在编程智能体中使用GLM系列的团队,只需更换模型ID即可免费获得升级。不过,由于完全取消了关闭推理的选项,若此前在对延迟敏感的实时响应流水线中使用GLM,则应先切换至low模式,再重新测量响应速度。对于关注网络安全性能提升的安全团队而言,即便前提是仅用于防御目的,也需要一并评估其被滥用为攻击模拟工具的可能性。
预计未来几周内,像Mistral这样通过网关引入GLM的平台,很可能出现从GLM-5.2转向5.3的动向。既然价格保持不变,那么转换的理由只会增加,而不会减少。



