每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

DeepSeek V4 Pro GA基准跑分泄露 逼近开源第一梯队

在Terminal Bench、HLE等智能体评测中与Kimi-K3、GLM-5.2并驾齐驱

DeepSeek V4 모델과 다른 AI 모델들의 벤치마크 성능 비교표

이미지: X — 뉴스 앰프 화면 갈무리

摘要

  • DeepSeek-V4-Pro-0813的GA基准跑分在X上泄露,在智能体相关评测中表现强劲
  • 在Terminal Bench 2.1中获得87.9分,超过Opus-4.8(85.0分),但略逊于Kimi-K3(88.3分)
  • 此次以价格竞争力为卖点的GA版本,与8月12日公布的低价资费表相呼应,展现出开源阵营正在加速追赶
모델명
DeepSeek-V4-Pro-0813 (GA)
Terminal Bench 2.1
87.9점 (Kimi-K3 88.3 / Opus-4.8 85.0)
HLE (with tools)
60.0점 (Opus-4.8 57.9)
비교 대상
GLM-5.2, Kimi-K3, Opus-4.8
유출 경로
X 계정 Chubby(@kimmonismus)

基准跑分先流出了

DeepSeek-V4-Pro-0813正式版(GA)的基准跑分表在正式发布前就通过X(原Twitter)率先流传开来。新闻账号Chubby分享的表格中列出了10项智能体相关评测的分数,其中在Terminal Bench 2.1中获得87.9分,超过了Opus-4.8的85.0分。不过相较于开源竞品Kimi-K3的88.3分仍略有落后。包含工具使用的HLE(Humanity's Last Exam)得分为60.0分,高于Opus-4.8的57.9分。Chubby指出:"算不上多差的升级,但拿来对比的不是Opus 5而是4.8,这点有些遗憾。"

这是什么意思

DeepSeek自今年4月首次公开V4系列以来,历经预览阶段,此次终于迎来正式版。此前8月12日,该模型的API资费表已公布,以缓存未命中为基准,每百万输入token价格为0.435美元,输出为0.87美元。同日发布的一篇对比报道显示,相比Grok 4.6(输入2美元/输出6美元)、Claude Opus 5(5美元/25美元)、GPT-5.6 Sol(5美元/30美元),DeepSeek的定价明显更低。也就是说,此次泄露的基准跑分表明,单从性能来看该模型已可与最前沿模型一较高下,而其定价却远低于对手,这才是此次结果的真正背景。

智能体基准测试测量的不是简单的问答能力,而是编写代码、操作终端、自主完成多步骤任务的能力,代表性项目包括Toolathlon-Verified、DSBench-FullStack等。在这一领域,DeepSeek达到了与Kimi-K3、GLM-5.2等开源第一梯队模型相近的水平,这不仅意味着与闭源模型的差距在缩小,也说明开源阵营内部的竞争同样愈发激烈。

那么这会带来什么变化

此次基准对比的对象并非最新版Opus 5,而是上一代的Opus 4.8,这一点被指出是本次跑分的局限性。尽管如此,以低价格搭配良好智能体性能的模型正不断增多的趋势是明确的。Together AI于8月11日开始支持DeepSeek V4 Flash 0731的微调,也与这一趋势相呼应。对开发者而言,这意味着除了顶级闭源模型之外,又多了一个可用高性价比开源模型搭建智能体工作流的选项。