每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

DeepSeek V4-Pro正式发布,推理强度可调节为三档

以专家模式亮相的V4-Pro在Terminal Bench中超越Opus-4.8

V4 Pro 기능 소개와 벤치마크 성능 비교표를 보여주는 화면

이미지: X — 뉴스 앰프 화면 갈무리

摘要

  • DeepSeek通过应用和网页端的"专家模式"以及API正式发布了DeepSeek-V4-Pro
  • 可将推理强度调节为低、高、最高三档,并一键支持面向Codex的OpenAI Responses API
  • 在Terminal Bench 2.1中获得87.9分,超过Opus-4.8(85.0),但略微落后于Kimi-K3(88.3)
모델명
DeepSeek-V4-Pro-0813 (GA)
공개일
2026년 8월 13일
공개 경로
DeepSeek Chat '익스퍼트 모드', API
신규 기능
추론 강도 3단계(낮음/높음/최대) 조절, OpenAI Responses API 네이티브 지원
Terminal Bench 2.1
87.9점 (Kimi-K3 88.3 / Opus-4.8 85.0)
HLE(with tools)
60.0점 (Opus-4.8 57.9)
개발사
딥시크

基准测试泄露一天后正式发布

8月12日在X平台流传的基准测试数据,一天后被证实属实。DeepSeek于8月13日正式发布DeepSeek-V4-Pro,用户可通过DeepSeek Chat应用及网页端的"专家模式(Expert Mode)"以及API直接使用。此前泄露时流传的基准测试数值也原样出现在了官方发布材料中。

有何变化

此次更新的核心在于用户可以根据具体情况选择推理强度。V4-Pro与V4-Flash均支持低(low)、高(high)、最高(max)三个档位。DeepSeek建议,简单任务用低档,日常代理任务用高档,复杂问题用最高档。推理时间越长,准确率越高,但响应时间和成本也随之增加——这一权衡的选择权交给了用户。

另一个变化是原生支持OpenAI的Responses API。官方表示已针对OpenAI的编程工具Codex进行了优化,并支持一键配置。此前使用API的用户模型名称保持不变,无需另行迁移,只需参考API文档即可。

从基准测试看其定位

DeepSeek公布的对比表中,除自家模型外还列出了GLM-5.2、Kimi-K3、Opus-4.8、Fable 5。在代理型任务中表现尤为突出。

基准测试V4-Pro-0813V4-Flash-0731GLM-5.2Kimi-K3Opus-4.8
Terminal Bench 2.187.9 bar:8882.7 bar:8381.0 bar:8188.3 bar:8885.0 bar:85
HLE (with tools)60.0 bar:6051.5 bar:5254.7 bar:5556.0 bar:5657.9 bar:58
Cybergym83.3 bar:8376.7 bar:77-80.0 bar:8078.3 bar:78
DeepSWE62.7 bar:6354.4 bar:5446.2 bar:4667.5 bar:6858.0 bar:58

Terminal Bench 2.1是衡量代理在终端环境中完成任务能力的指标。V4-Pro在该项目以及Cybergym、HLE(with tools)中均超过了Opus-4.8,但在大多数项目上略逊于Kimi-K3。

如何使用

①起点是DeepSeek Chat应用或网站。登录后在模式选择菜单中选择"专家模式",即可连接到V4-Pro。

②据悉,在对话框输入问题前可从低、高、最高中选择推理强度。简单问题或信息检索选用低档可获得更快响应,代码编写或多步骤任务选用高档,复杂数学问题或需要长时间推理的任务则调至最高档。

③此前使用API的开发者可沿用原有模型名称,并在相关文档中查看新参数的设置方法。使用OpenAI Codex的开发者可通过Responses API一键配置,减少了对接流程。

④应用示例方面,若让编程代理在终端依次执行多条命令,设置为高档模式可在速度与准确率之间取得平衡。而重复性的文档摘要或简短问答,使用低档模式可节省成本。

价格竞争的延续

据8月12日公布的价目表,Grok 4.6的定价为每百万token输入2美元、输出6美元,而DeepSeek-V4-Pro GA的定价据悉比这更低。相比之下,Claude Opus 5(输入5美元/输出25美元)、GPT-5.6 Sol(输入5美元/输出30美元)的价差明显。此次正式发布,标志着开源阵营在基准测试表现与低价策略并举的追赶态势又向前迈进了一步。

由此带来的变化

用户现在可以用同一个模型,根据任务难度自行调节成本与速度。对于使用编程代理的开发者而言,Codex对接流程有所简化,在基于终端的自动化任务中,性能也已提升至与顶尖模型相近的水平。低价格搭配顶尖基准测试表现的趋势,通过此次正式发布再次得到印证。