METAL

DeepSeek 收起 1.6 万亿模型 换上 5520 亿

一个月前才推出的 V4-Pro,将从 9 月 14 日起把请求全部交给新模型。骨干只有三分之一大,却把 KV 缓存压到每个 token 890 字节,在编码智能体评测上压过了 Opus 5。

DeepSeek 收起 1.6 万亿模型 换上 5520 亿

图片:METAL

摘要

  • DeepSeek 以 MIT 许可开放权重发布 V4.1-Flash,并决定收起一个月前推出的 1.6 万亿参数旗舰 V4-Pro。从 9 月 14 日起,发往 V4-Pro 的请求全部由新模型处理。
  • 骨干为 5520 亿参数,只有三分之一大,却把 KV 缓存压到每个 token 890 字节。这是上一代的四分之一,依据是把 40 层拆成 20 层编码器和 20 层解码器的结构。
  • 在 Terminal-Bench 2.1 上以 90.6 超过 Opus 5 的 89.1,但 Terminal-Bench 4.0 只有 31.2,远低于 Opus 5 的 51.8。在衡量已存知识的评测上,它甚至低于 V4-Pro。

做 AI 模型的 DeepSeek 以 MIT 许可发布了新模型 V4.1-Flash,同时决定收起一个月前正式推出的旗舰 V4-Pro。V4-Pro 的骨干参数是 1.6 万亿,新模型是 5520 亿,约为三分之一。公司把权重和技术报告一起传到了 Hugging Face 模型卡,并在 API 文档里写明,从 9 月 14 日北京时间中午起,所有发往 V4-Pro 的请求都会转给新模型。

技术报告的标题就道出了这个模型的身份:把 KV 缓存压缩推到极限。KV 缓存是模型用来记住先前读过内容的临时存储,上下文越长越吃内存,因而直接左右成本和速度。DeepSeek 表示已把这块存储压到每个 token 890 字节,约为上一代 V4-Flash 的四分之一,与第一代 V1 相比是四百三十七分之一。

压下去的办法在于把模型切成两段。公司把这个结构称作因果编码器解码器,把 40 层拆成前面 20 层编码器和后面 20 层解码器。公司写道:"解码器的全局 KV 缓存不再来自各解码器层自身的隐藏状态,而是从最终编码器隐藏状态投影而来。"也就是说,不再每一层各自堆记忆,而是由后半段接过前半段整理好的东西来用。

딥시크가 공개한 막대그래프. Terminal-Bench 3.0, DeepSWE v1.1, CyberGym, Automation-Bench 네 평가에서 DeepSeek-V4.1-Flash와 Kimi-K3, GLM-5.3, Opus5, GPT5.6-Sol의 점수를 비교한다.

METAL 核实过的这份 51 页技术报告,写清楚了把 KV 缓存压下去的实际装置。那是公司称为 CSA2 的压缩稀疏注意力,报告说它分为三种静态指派的模式。Full 模式重新生成全局 KV,并完成挑选参照哪些 token 的索引。Reindex 模式沿用前面某层的全局 KV,但用自己的索引器查询重新打分,只重新选出要参照的 token。Reuse 模式把全局 KV 和 Top-K 索引一并复用,直接跑稀疏注意力。公司写道,三种模式下每一层都各自保有自己的全局 Q 和 SWA KV。40 层之中只有编码器最前面两层用滑动窗口注意力,其余全是 CSA2。

省下来的部分究竟落在哪里,报告也做了区分。890 字节的全局 KV 缓存始终驻留在 HBM 里,这是 V4-Flash 的约四分之一。在此之上,一项名为 SWA Bounded Replay 的部署优化,把常驻在 SSD 或主机内存里的 KV 缓存压到 V4-Flash 的约八分之一。这个八分之一是两件事相乘的结果:常驻缓存不再存放 SWA KV,体积几乎减半;剩下的全局 KV 又被压缩到四分之一。在上一代的部署里,SWA KV 几乎占了常驻缓存容量的一半。

这个设计带来的差别体现在激活参数量上。读入输入的阶段每个 token 只点亮 80 亿个,生成答案的阶段只点亮 160 亿个。公司解释说,这种不对称大幅提升了输入量大的智能体任务的成本效率。上下文可接到 100 万 token,图像也从一开始就和文本一起训练,可以直接处理。

算力这一侧还挂了两个扩展装置。Engram 是为把记忆从计算中剥离出来而做的条件记忆模块,1960 亿参数均分在两个模块里。思路是遇到重复出现的模式时用查表来处理,而不是每次都靠神经网络重算。DSpark 属于投机解码。它的草稿生成器由三个 Transformer 块构成,用 128 token 的滑动窗口,一次前向就并行算出五个位置的草稿,同时由一个置信度头预测每个位置的接受概率。调度器再把这些估计与实测吞吐曲线结合,为每个请求临机决定验证长度。

딥시크가 공개한 막대그래프. 토큰당 글로벌 KV 캐시 크기가 V1 389,120바이트에서 V3.2 48,068바이트, V4-Flash 3,514바이트를 거쳐 V4.1-Flash 890바이트로 줄어든 과정을 보여 준다.

在 METAL 核实过的模型卡对比表里,新模型领先的位置集中在智能体这一侧。处理终端任务的 Terminal-Bench 2.1 上录得 90.6,越过了 Claude Opus 5 的 89.1 和 GPT-5.6 Sol 的 88.8。代码修改任务 DeepSWE v1.1 为 74.2,与 Opus 5 的 74.0 几乎持平;衡量业务自动化的 AutomationBench 为 54.8,领先 Opus 5 的 50.3。Codeforces 评分 3471,高于 V4-Pro 的 3348。

同一张表里也照写了输掉的位置。需要多步推进的 Terminal-Bench 4.0 只有 31.2,比 Opus 5 的 51.8 低了 20 多分;汇集专家级难题的 HLE 为 36.8,与 Opus 5 的 56.3 差距明显。衡量模型自身所含知识的 SimpleQA-Verified 为 42.3,甚至低于 V4-Pro 的 55.2。骨干只有三分之一,在背下来的知识上大模型自然占优。

模型卡里还有一张表,告诉你这些数字该怎么读。它把同一个模型装进八种不同的智能体外壳去跑 DeepSWE v1.1,分数从 65.6 一直散到 74.2。DeepSeek 在发布中用的 74.2 是 mini-SWE 的口径,换成 Claude Code 跑则是 69.8。METAL 曾报道过 DeepSeek 为对标 Claude Code 新组建了一支 harness 团队,而那支团队做的自研外壳 DSH Minimal 在 Terminal-Bench 2.1 上跑出 90.6,高于 Claude Code 的 88.0。

딥시크가 공개한 V4.1-Flash 전체 구조도. 40개 층이 20층 인과 인코더와 20층 디코더로 나뉘고 CSA2의 Full·Reindex·Reuse 모드와 SWA, MoE, Engram, DSpark, 계층적 희소 인덱서가 배치돼 있다.

性能提升的来源,公司归到数据而不是算法。后训练照搬了监督学习、强化学习、同策略蒸馏这套标准顺序,算法没有动。取而代之的是大规模自动合成智能体任务与执行环境,分阶段扩充数据、任务和 rollout。预训练用了 45 万亿 token 的多模态数据,稀疏注意力先在 6.4 万 token 长度上训练,到 34 万亿 token 处再扩到 100 万 token。

收起 V4-Pro 的时间表连日期都写好了。从 9 月 14 日北京时间中午起,发往 deepseek-v4-pro 的请求全部由新模型处理,计费也按新模型标准。公司写道:"V4.1 Flash 在性能、成本、速度和总耗时上全面超越了 V4-Pro。"METAL 曾报道过 V4-Pro 以三档可调推理强度正式发布,如今这个旗舰只坐了一个月就要让位。

概括起来,DeepSeek 用三分之一大小的模型替掉了自家旗舰,并把依据放在 KV 缓存压缩上。在智能体任务上,它有多处领先顶级模型的位置,但在长推理和已存知识上差距仍在。接下来要看的有两点:9 月 14 日的切换在使用一侧会不会出现性能下滑,以及面对因外壳不同而相差 8 分以上的智能体分数,业界会拿什么标准去比较。

评论