
이미지: Z.ai 공식 블로그
摘要
- Z.ai于8月26日以MIT许可证发布了GLM-5系列首款原生多模态模型GLM-5.3-Flash。上周在OpenRouter和OpenCode上使用量登顶的匿名模型Ox Alpha,正是这款模型。
- 该模型总参数320B,每个token仅激活18B,以每任务0.045美元的成本拿下Artificial Analysis智能指数57分。API定价为输入0.15美元、输出0.50美元,但到9月9日前打五折。
- 一周内43万亿token的全部流量都由中国产AI芯片集群提供服务,Z.ai宣称其单token成本已接近主流英伟达GPU水平。
- 발표
- 2026년 8월 26일 · Z.ai 공식 블로그
- 모델
- GLM-5.3-Flash · GLM-5 시리즈 첫 네이티브 멀티모달
- 규모
- 전체 320B · 활성 18B · 컨텍스트 100만 토큰
- 라이선스
- MIT (Hugging Face 가중치 공개)
- 가격
- 입력 $0.15 · 출력 $0.50 /100만 토큰 (9월 9일까지 50% 할인)
- 스텔스 성적
- OpenCode 주간 43조 토큰 1위 · 순사용자 49.7만 명
上周在开发者圈子里被称为"身份不明的免费模型"、一度登上使用量榜首的Ox Alpha,真面目终于揭晓了。它就是中国AI企业Z.ai(智谱)于8月26日发布的新AI模型GLM-5.3-Flash。Z.ai在官方博客中用一句话介绍了这款模型:"以Flash的价格,享受前沿级智能(Frontier Intelligence, Flash Cost)"。
用数字概括这次发布就是这样:GLM-5.3-Flash总参数达3200亿(320B),但生成一个token时只激活180亿(18B),在独立评测机构Artificial Analysis的综合智能指数上拿到57分,每任务成本仅0.045美元。权重以不设条件、允许修改和商用的MIT许可证形式发布在Hugging Face上,并且官方还表示过去一周该模型的全部流量都不是由英伟达GPU、而是由中国产AI芯片提供服务的。就算这些术语听起来陌生也没关系,下面会逐一拆解。
先隐姓埋名冲上榜首
这次发布中最戏剧性的部分在于发布方式。Z.ai从8月20日起,在模型中转平台OpenRouter和编程工具OpenCode上以"Ox Alpha"这个名字免费上线了这款模型,没有透露开发商、国籍或规模。开发者在完全不知道这是谁家产品的情况下,只能凭性能做判断。
结果相当惊人。据OpenCode统计数据显示,Ox Alpha一周内处理了43万亿个token,登上使用量榜首。排名第二的DeepSeek系模型(deepseek-v4-flash)为22万亿个,排名第十的GPT-5.6系模型(gpt-5.6-luna)为8270亿个,与第二名的差距接近两倍。这段时间内,净用户数达到49.7万人,完成的编程会话达1285万次。
围绕其身份的推理战也异常火热。Reddit和X上,有人根据分词器(模型拆分文字的方式)分析推测这是GLM系列,也有人反驳称是微软的未公开模型。正在推进收购OpenRouter的Stripe CEO帕特里克·科里森留下"印象非常深刻"的评价,进一步引发关注。METAL LAB也在23日发布了分析文章,指出token分解结果与GLM-5.2的60项特征完全一致,而这一推测最终得到证实。彭博社报道确认了Z.ai就是开发商,几小时后官方博客随即上线。
也就是说,这次发布顺序是:先抹去品牌与国籍带来的成见,靠实际使用数据接受检验,等到已经嵌入开发者工具生态之后,才公开身份。
320B中只激活18B——参数拆解
参数是AI模型通过学习积累下来的知识量化数字。通常参数越多模型越聪明,但运行成本也随之增加。GLM-5.3-Flash在这里采用了"专家混合(MoE)"结构:把3200亿参数分成多个专家小组,每生成一个词就只挑选与之相关的专家、激活其中180亿。可以想象一家医院总共有3200名医生,但每位病人只需要见18名相关专科医生就够了——知识总量做大,但每次实际运算量保持精简。
这款模型也是GLM-5系列首款原生多模态模型,意味着它不只是读文字,还能用同一个模型处理图像和视频。这让它可以在做出网页后,直接"看"渲染出来的画面进行修改。它的上下文长度——也就是一次能记住并处理的信息量——达到100万token,相当于能一次性读入十本长篇小说并针对内容提问。
许可证是MIT,属于开源许可证中限制最宽松的一类:任何人都可以下载权重、自由修改、接入自己的服务甚至用来盈利。据介绍,训练数据规模达30万亿token的多模态数据。
性能逼近Claude Opus 4.8
Z.ai公布的基准测试成绩,清楚展示了这款模型的定位。基准测试可以理解为让不同模型做同一份"试卷"进行打分的标准化测试。
| 基准测试 | 测量内容 | GLM-5.3-Flash | GLM-5.2(前代) | Claude Opus 4.8 | GPT-5.6 Terra |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 在终端环境完成服务器配置与调试的完整流程 | 84.3 | 81.0 | 85.0 | 87.4 |
| DeepSWE v1.1 | 用未公开代码仓库任务评估实战编程能力 | 63.4 | 46.2 | 58.0 | 69.6 |
| AutomationBench v1.0.6 | 执行办公自动化任务 | 48.8 | 26.2 | 41.0 | 37.2 |
| GDPval-AA v2 | 覆盖44个职业的真实工作任务(由Artificial Analysis评测) | 1773 | 1504 | 1582 | 1571 |
DeepSWE使用从未公开过的代码仓库任务进行测试,以降低模型"提前背过答案"(训练数据污染)的可能性,是一项含金量较高的编程基准。在这项测试中,GLM-5.3-Flash拿到63.4分,超过了Claude Opus 4.8的58.0分。在衡量真实职业任务的GDPval-AA测试中,它在对比对象中得分最高;办公自动化得分也几乎是前代的两倍。不过与顶尖模型的差距依然明显——在Terminal Bench和DeepSWE上,它都不敌GPT-5.6 Terra。
Z.ai自己的编程评测中还有一个有意思的细节。在基于Claude Code运行的Z.ai Code Bench测试中,把思考量(effort)调到最大的GLM-5.3-Flash拿到29.0分,几乎追平了Claude Opus 4.8的29.5分。但要拿到这个分数,它每道任务要输出接近14万个token,而Opus 4.8的水平在12万个左右;更高一级的Claude Fable 5则用11万多个token就拿到了39.5分,明显更高。简单说,这是一种用"更便宜的模型思考更久"的方式去逼近昂贵模型答案的路径——由于单价本身极低,即便思考更久,总成本依然划算得多。
需要指出的是,以上大部分数据来自Z.ai自身评测。但独立机构的数据也指向同一个方向。在Artificial Analysis综合智能指数(汇总编程、数学、推理等能力的综合评分)上,GLM-5.3-Flash拿到57分——按Z.ai的说法,这个分数段此前一直是单任务成本高出约10倍的模型才能达到的水准。首图中的图表正体现了这一点:同为57分左右的阿里巴巴Qwen3.8 Max位于图表右侧(高价区),而GLM-5.3-Flash则独自落在左下方(低价区)。

价格——9月9日前是半价
API价格按每百万token计算,输入0.15美元,输出0.50美元。token是模型计数文字的单位,大致可以理解为中文一个字对应1~2个token左右。重复提问时可复用的缓存输入价格为0.03美元。根据Z.ai官方价目表,目前作为上市促销,全部价位段都打五折:输入0.075美元、输出0.25美元、缓存输入0.015美元,优惠将在新加坡时间9月9日零点结束。
对比一下会更有感觉:两周前发布的高阶模型GLM-5.3的API价格为输入1.40美元、输出4.40美元,也就是说即便按原价算,GLM-5.3-Flash也只有其约十分之一的价格。对于Z.ai编程订阅(GLM Coding Plan)用户,该模型的用量额度也调整为GLM-5.3的三倍。

为什么能做到这么便宜——拆解架构
价格能降到这个程度,秘诀在于架构设计。与自家参数总量相近的GLM-4.5(355B)相比,激活参数从32B降到18B,层数(模型堆叠计算的层级)从92层减半到45层。也就是说,不再往深处堆叠,而是走"浅而宽"的路线,同时压低每次激活的运算量。
关键在于降低注意力机制的开销。注意力是模型阅读文本时,把每个词与其他所有词两两比较、建立关联的计算过程,文本越长,开销就呈指数级增长——面对100万token的文档,这种开销根本承受不起。GLM-5.3-Flash通过混合两种注意力机制解决了这个问题:线性(linear)注意力把过去的上下文压缩成一份固定大小的"摘要笔记"随身携带;稀疏(sparse)注意力则借助索引器,只挑出当下需要的那部分内容查看。打个比方,这不是每次都把整本书重新读一遍,而是带着摘要笔记走,需要时再靠索引翻到对应页面。此外还叠加了一种叫IndexPool的压缩技巧,把索引用到的4个键压缩合并成一个。
结果是,在100万token的上下文中,相比高阶模型GLM-5.3,注意力计算量减少到三分之一(3.0倍),KV缓存减少到约四分之一(4.4倍)。KV缓存是模型在对话过程中为避免重复计算前文而暂存在内存里的临时记忆,在长上下文场景下,它正是吃掉GPU内存的主要元凶。这两个数字降下来,意味着同样的硬件能承载更多用户,而这直接转化成了价格优势。

"全部由中国芯片提供服务"才是真正的新闻点
Z.ai表示,过去一周涌向Ox Alpha的全部流量,都是由中国产AI芯片集群提供服务的。据介绍,他们在数万颗中国产加速芯片上,基于开源推理框架SGLang搭建了自研推理引擎,并把图像/视频编码、预填充(读取问题的阶段)和解码(逐个token生成答案的阶段)分别拆给不同的服务器集群处理——类似厨房里切配、烹饪、上菜由不同团队分工完成。
中国产芯片在内存容量和带宽上普遍不及英伟达GPU,要处理100万token的上下文,必须弥补这一短板。Z.ai介绍称,他们采用了将权重和缓存压缩到8比特以下存储的量化技术(降低数字精度以减小容量的方法),以及把模型拆分、分摊到多颗芯片上运行的层拆分方案来应对。据称,这样一来在同样硬件上,端到端性能相比初期提升了3倍,单token成本已经达到与主流英伟达GPU相近的水平。不过需要指出,这一成本说法目前仅是企业单方面的说法。
还有一个值得关注的细节:这次优化工作是由基于GLM-5.3的基础设施智能体协助完成的。也就是说,模型自己参与编写内核(操控芯片的底层代码)、寻找瓶颈,并对运行自身的系统进行了调优。业内一直有种说法,认为英伟达真正的护城河与其说是芯片本身,不如说是十几年积累下来的CUDA软件生态系统——如今,弥补这道差距的工作已经开始由模型而非人力来承担。模型越强,国产芯片的软件生态改善得越快,进而让模型运行成本更低,这形成了一个自我强化的反馈循环。
同一天,英伟达要交成绩单
从市场角度看,这次发布触及了两个层面。首先是价格。当市场上出现了以每任务0.045美元就能获得57分智能水平的选项,企业把反复执行的任务交给单任务成本1~2美元级前沿模型的理由就减少了。把难题交给闭源顶尖模型、把重复性工作交给廉价开源模型的分工模式已经在企业间逐渐成型,这和最近Claude Fable涨价后开发者开始把部分任务分流给GLM的动向方向完全一致。
其次是芯片。2025年1月DeepSeek震动市场,靠的是训练成本远低于预期这一事实,而这次则出现了"推理(实际运行模型的环节)也能用中国芯片完成"的说法。如果说训练成本压低了模型价格,那么推理芯片的替代,则可能牵动英伟达需求本身的转移。
巧合的是,英伟达当天美股收盘后将公布2027财年第二季度财报。公司给出的指引显示营收预计在910亿美元左右,而这一预测中,面向中国的数据中心算力营收被直接计为零。一边是要在剔除中国市场的情况下证明自身增长的英伟达,一边是宣称"不靠英伟达也能做出前沿级推理"的中国模型厂商,两者在同一天各自交出了答案。
当然,这一切还有待验证。在免费开放阶段接住43万亿token的流量,和转为付费后能否以同样速度持续承受这一负荷,是两回事。免费促销结束的9月9日之后,处理能力和响应速度能否维持,将是检验这一说法的第一道试金石。
编辑视角
这次发布最本质的地方,在于它把发布顺序颠倒了过来。如果一开始就摆明这是中国模型,恐怕一半开发者连试都不会试,但这个无名模型却在一周内吞下了43万亿token的流量。先靠性能接受检验、再公开国籍身份的这套顺序,某种程度上也是一场实验——证明了围绕中国AI的固有成见,在真实使用面前有多么不堪一击。
而比模型参数本身更值得记住的,是那句话:"全部由中国芯片提供服务,单token成本已达英伟达级别。"虽然目前仍只是企业单方面的说法,但如果方向属实,这就不只是一场模型价格战,而是关乎整个算力格局的故事——这意味着,由模型自己弥补软件差距的反馈循环已经开始运转。这也是为什么,9月9日免费期结束后的流量走势图,值得持续关注。




评论