DeepSeek V4 Pro 正式版评测:性能、API 价格与成本分析

基于官方资料评测 DeepSeek V4 Pro 正式版,覆盖 Agent 基准、1M 上下文、API 兼容边界、当前与即将生效的峰谷价格、成本算例和 Modelflare 可用性。

DeepSeek 于 2026 年 8 月 13 日发布 DeepSeek-V4-Pro GA 正式版。托管 API 当前显示的版本是 DeepSeek-V4-Pro-0813,稳定 API 模型 ID 仍为 deepseek-v4-pro。本次更新提供 100 万 Token 上下文、最高 384,000 Token 输出、原生 Responses API 支持,并将在发布后不久启用新的计价时段。

我们的结论是:对于高难度编程、仓库级任务和长时间运行的 Agent,V4 Pro 值得进入生产评估候选。DeepSeek 公布的结果显示,它在困难 Agent 基准上持续领先 V4 Flash,但 Pro 不应成为所有请求的默认经济选择。新价格生效后,其官方输入与输出价格大约是 Flash 的 3 倍,而账号并发上限只有 Flash 的五分之一。

本文严格区分当前 API 事实、DeepSeek 自行公布的基准成绩、我们的分析,以及 Modelflare 当前可用性。我们没有独立复现 DeepSeek 的基准分数。下列易变规格与价格核验于 2026 年 8 月 14 日。

DeepSeek V4 Pro 正式版评测:百万 Token 上下文与 Agent 工具编排

DeepSeek V4 Pro 正式版核心信息

项目 当前官方信息
GA 正式发布日期 2026 年 8 月 13 日
稳定 API 模型 ID deepseek-v4-pro
托管模型版本 DeepSeek-V4-Pro-0813
上下文窗口 1,000,000 Token
最大输出 384,000 Token
思考模式 支持,且默认启用
推理强度 GA 公告:low、high、max;兼容性差异见下文
官方 API 格式 Chat Completions、Responses API、Anthropic Messages 兼容 API
文档列出的能力 JSON 输出、工具调用、自动上下文缓存、前缀续写、非思考模式下的 FIM
官方账号并发 500 个并发请求

100 万 Token 是容量上限,不是质量承诺。检索准确率、延迟、缓存复用、输出长度、客户端超时和无关上下文比例,仍会决定一个长请求是否真正有用。

与 V4 预览版相比有哪些变化

4 月的预览版首次带来了 V4 系列及其开放权重架构。8 月 GA 是一次托管产品更新,实际变化主要有三项:

  • DeepSeek 表示 Agent 能力显著增强,尤其是接近生产环境的编程与自动化任务;
  • 官方 API 原生支持 OpenAI Responses 格式,并加入面向 Codex 的兼容适配;
  • DeepSeek 宣布从 2026 年 8 月 16 日 16:00 UTC 起启用峰谷 API 价格。

稳定请求模型仍是 deepseek-v4-pro,现有客户端无需迁移模型名。价格页面显示的当前托管版本为 DeepSeek-V4-Pro-0813

不要直接把可下载的预览版 checkpoint 视为与托管 GA 版本逐比特一致。DeepSeek 当前公开的 V4 模型卡仍描述预览版系列,并未把 checkpoint 标成 0813。因此,自托管版本与官方 API 版本必须分别评估。

基准评测分析:Pro 相比 Flash 提升在哪里

DeepSeek 公布了以下 V4 Pro GA 结果。对比列采用 DeepSeek 7 月 31 日公布的 V4 Flash 更新版分数,差值为绝对分数差。

基准 V4 Pro GA V4 Flash 0731 Pro 差值
Terminal Bench 2.1 87.9 82.7 +5.2
NL2Repo 61.5 54.2 +7.3
Cybergym 83.3 76.7 +6.6
DeepSWE 62.7 54.4 +8.3
Toolathlon-Verified 74.1 70.3 +3.8
Agents' Last Exam 25.7 25.2 +0.5
AutomationBench(公开集) 31.8 25.1 +6.7
DSBench-FullStack 71.1 68.7 +2.4
DSBench-Hard 67.2 59.6 +7.6

DeepSeek 还公布了 V4 Pro GA 的 HLE 成绩:不使用工具为 42.7,使用工具为 60.0。

相比单个最高分,更值得关注的是整体分布。最大的绝对提升出现在仓库级工作、困难软件工程任务和自动化;在 Agents' Last Exam 上差距很小,在广泛工具使用上则为中等提升。这更支持分层路由策略:只有当更高成功率的价值超过纯 Token 效率时才使用 Pro,而分类、摘要、预处理、初步分流和简单子 Agent 继续使用 Flash。

这些是供应商自报结果,不是 Modelflare 独立基准。Agent 的框架、工具权限、推理强度、采样参数、时间限制与评分规则都会显著影响结果。生产决策应在两个模型上回放同一组不含隐私数据的任务,并比较“每个成功任务的成本”,而不只比较 Token 或榜单名次。

架构与 1M 上下文应该怎样理解

DeepSeek 的公开 V4 模型卡将 Pro 系列描述为混合专家模型,总参数量 1.6 万亿,每个 Token 激活 490 亿参数。文档还介绍了结合 Compressed Sparse Attention 与 Heavily Compressed Attention 的混合注意力、Manifold-Constrained Hyper-Connections、Muon 优化器,以及超过 32 万亿 Token 的预训练。

DeepSeek 表示,在 1M Token 上下文下,V4 Pro 的单 Token 推理 FLOPs 是 V3.2 的 27%,KV Cache 需求是 V3.2 的 10%。这些是模型发布方给出的架构层主张,并不表示任何 100 万 Token 请求都会同样快、便宜,或在所有位置保持相同准确率。

真实长上下文工作应当:

  • 把稳定指令和可复用仓库材料放在前部,让前缀缓存有机会命中;
  • 跟踪 prompt_cache_hit_tokensprompt_cache_miss_tokens,不要主观假定已命中;
  • 在过期工具轨迹和重复文件占满窗口前进行压缩;
  • 按应用真实文档深度和 Token 位置测试检索;
  • 为推理、工具结果和最终答案保留空间,不要用输入填满整个窗口。

DeepSeek 的磁盘缓存默认启用,但只按 best-effort 工作。它匹配可复用前缀,构建可能需要数秒,无使用后通常会在数小时到数天内清理。只要前部内容发生变化,重复请求就可能失去大部分成本优势。

API 兼容性:原生支持不等于完全相同

接口 DeepSeek 官方支持 重要边界
Chat Completions 支持 思考模式工具循环必须保留 reasoning_content
Responses API 支持 无状态;多个 OpenAI 字段会被忽略或不支持
Anthropic 兼容 API 支持 部分字段被忽略;不支持图片与文档内容
FIM 补全 Beta 只支持非思考模式,并使用 beta 端点

官方 Responses 层支持文本、函数调用、服务端网页搜索,以及为 Codex 兼容提供的 apply_patch 自定义工具。它不支持 previous_response_id、conversation、响应存储、后台模式、service_tier 或 OpenAI 管理的 Prompt Cache Key。不支持的字段往往会被静默忽略,因此 HTTP 200 不能证明语义一致。Responses 客户端必须自行携带历史,并根据事件类型判断结束,而不是等待 Chat Completions 风格的 [DONE]

Chat Completions 还有一个重要的工具循环边界:思考模式与工具同时使用时,后续请求必须回传 Assistant 的 reasoning_content。DeepSeek 文档明确说明,丢失该字段会返回 400。网关和 SDK 适配器必须用完整的多轮工具循环验证,不能只测一次文本请求。

GA 公告表示支持 low、high 和 max 三档推理强度,但当前详细思考指南与 API Reference 又写明,有效值是 highmax,其中 lowmedium 会映射为 highxhigh 会映射为 max。在 DeepSeek 统一文档或实测证明 low 具有独立行为之前,不要基于“low 能降低成本”的假设编预算。

DeepSeek 官方 API 价格:当前与即将生效的价格

下表价格均为每 100 万 Token 的美元价格。当前固定价会继续有效到 2026 年 8 月 16 日 16:00 UTC;新价格在北京时间 8 月 17 日 00:00 生效。

计价时段 缓存命中输入 缓存未命中输入 输出
8 月 14 日核验的当前价 $0.003625 $0.435 $0.87
新谷时价格 $0.022 $0.66 $1.98
新峰时价格 $0.044 $1.32 $3.96

新价格下的峰时为 UTC 01:00–04:00 和 06:00–10:00,其余时间均为谷时;谷时价格为峰时的一半。

这次调整并不是把今天的价格简单地按时段做 2 倍区分。与当前固定价相比,新谷时的缓存输入约为 6.07 倍,未缓存输入约为 1.52 倍,输出约为 2.28 倍;新峰时再按谷时价格翻倍。缓存仍然很有价值,但发布初期极低的缓存输入价格变化最大。

成本算例

只计算 Token 的公式是:

成本 = 缓存命中 Token × 命中单价 + 缓存未命中 Token × 未命中单价 + 输出 Token × 输出单价

下列示例不包含独立的网络、订阅、工具服务或支付成本。工具型 Agent 可能产生多次模型调用,因此应计算完整任务,而不是只看第一次请求。

工作负载 DeepSeek 当前价 新谷时价 新峰时价 Modelflare 8 月 14 日快照
100K 未缓存输入 + 10K 输出 $0.0522 $0.0858 $0.1716 $0.0540
90K 缓存 + 10K 未缓存输入 + 10K 输出 $0.0134 $0.0284 $0.0568 $0.0138
900K 缓存 + 100K 未缓存输入 + 20K 输出 $0.0642 $0.1254 $0.2508 $0.0663

第二、三行说明 Prompt 结构会直接影响成本。巨大的稳定前缀可以显著降价,但前提是真正命中缓存。对账时应以 API usage 字段为准。

DeepSeek V4 Pro 与 V4 Flash:如何选择性价比

按当前官方价格,Pro 的未缓存输入与输出约为 Flash 的 3.11 倍,缓存输入仅为 1.29 倍。新价格生效后,Pro 的未缓存输入与输出为 Flash 的 3 倍,缓存输入约为 3.14 倍。官方账号并发上限则是 Pro 500、Flash 2,500。

因此可以建立清晰的运行规则:

  • 困难仓库修改、长周期 Agent、安全分析、复杂工具协同,以及一次失败代价很高的任务,选择 V4 Pro;
  • 简单 Agent、并行 Worker、预处理、抽取、摘要和吞吐敏感流量,选择 V4 Flash;
  • 根据观测到的任务难度与每个成功任务成本进行路由,不把 Pro 设为所有请求的默认值;
  • 调价后重新评估,因为缓存型 Pro 工作负载的经济性会明显变化。

如果 Pro 能避免重试或人工修复,3 倍 Token 单价仍可能更便宜;反过来,5 分的基准优势也不足以证明应把确定性或简单任务送到大模型。需要测量成功率、总耗时、重试后的总 Token、工具失败和审核修正时间。

Modelflare 上的 DeepSeek V4 Pro 价格与可用性

我们在 2026 年 8 月 14 日核验了 Modelflare 实时价格目录。目录列出 deepseek-v4-pro 和固定别名 deepseek-v4-pro-0813,二者位于 deepseek-stable 分组,每 100 万 Token 的基础价格如下:

Modelflare 价格快照 价格
缓存命中输入 $0.0037
缓存未命中输入 $0.45
输出 $0.90

该快照的缓存命中价比 DeepSeek 当前价格约高 2.07%,缓存未命中与输出价格约高 3.45%。本文没有替 Modelflare 承诺这些价格在 DeepSeek 峰谷调价后保持不变。生产决策始终应以实时价格页和请求用量记录为准。

当前公开目录把 Modelflare 路由标记为 OpenAI 兼容的 Chat Completions。虽然 DeepSeek 自有端点已支持 Responses 与 Anthropic 格式,但上游支持并不意味着每一条网关路由自动兼容。请只使用实时价格页明确列出的协议。

export MODELFLARE_API_KEY="your-api-key"

curl https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer ${MODELFLARE_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Review this migration plan and identify rollback risks."}
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high"
  }'

通用客户端配置可参考 OpenAI 兼容 API 指南;账务和缓存 Token 解读可参考 AI API 成本追踪

生产评估清单

  1. 若路由提供固定版本,评估期间使用 deepseek-v4-pro-0813,再决定稳定别名是否满足变更控制要求。
  2. 在 Pro 与 Flash 上回放同一组不含隐私数据的固定任务,并保持工具、权限、超时和停止规则一致。
  3. 同时测试 highmax;在当前 API 行为证明差异前,把 low 视为与 high 等价。
  4. 完成一整套多轮工具循环,确认 reasoning_content、工具 ID、参数和结果能穿过所有适配层。
  5. Responses 客户端必须逐项测试必需字段,因为不支持的参数可能被静默忽略。
  6. 记录缓存命中输入、未命中输入、输出、推理 Token、延迟、重试和每个成功任务成本。
  7. 用真实深度的长 Prompt 测试,不要从一次短请求推断 100 万 Token 的检索质量。
  8. 在账号并发上限以下做负载测试,并用有界退避处理 429。
  9. 批准预算前同时建模当前价格和 8 月 16/17 日生效的峰谷价格。
  10. 保留 Flash 或其他模型作为可用性与成本回退;可参考 可靠 AI API 路由

最终结论

DeepSeek V4 Pro GA 是一次有实质内容的 Agent 更新,不只是预览版改名。官方分数的优势主要集中在仓库推理、高难度编程和自动化,新 Responses 接口也让它更适合现代编程 Agent。1M 上下文与自动缓存很有价值,但应用必须保持稳定前缀并核实真实命中。

最大的保留意见是经济性:发布后的 Pro 在多数 Token 类别上约为 Flash 的 3 倍,而且并发更低。它更适合充当困难、高价值任务的升级层,而不是每条 Prompt 的默认模型。更合理的生产架构通常会把简单任务交给 Flash,仅把困难或失败任务提升到 Pro。

Modelflare 8 月 14 日价格快照接近 DeepSeek 当前固定价,并且当前为 V4 Pro 提供 Chat Completions。DeepSeek 新价格生效后需要重新检查实时页面;旧文章或缓存的价格截图都不能作为账单真相。

来源与核验日期

官方规格、价格时段、Modelflare 可用性和实时价格均核验于 2026 年 8 月 14 日。