DeepSeek V4 Pro 正式版评测:性能、API 价格与成本分析
基于官方资料评测 DeepSeek V4 Pro 正式版,覆盖 Agent 基准、1M 上下文、API 兼容边界、当前与即将生效的峰谷价格、成本算例和 Modelflare 可用性。
DeepSeek 于 2026 年 8 月 13 日发布 DeepSeek-V4-Pro GA 正式版。托管 API 当前显示的版本是 DeepSeek-V4-Pro-0813,稳定 API 模型 ID 仍为 deepseek-v4-pro。本次更新提供 100 万 Token 上下文、最高 384,000 Token 输出、原生 Responses API 支持,并将在发布后不久启用新的计价时段。
我们的结论是:对于高难度编程、仓库级任务和长时间运行的 Agent,V4 Pro 值得进入生产评估候选。DeepSeek 公布的结果显示,它在困难 Agent 基准上持续领先 V4 Flash,但 Pro 不应成为所有请求的默认经济选择。新价格生效后,其官方输入与输出价格大约是 Flash 的 3 倍,而账号并发上限只有 Flash 的五分之一。
本文严格区分当前 API 事实、DeepSeek 自行公布的基准成绩、我们的分析,以及 Modelflare 当前可用性。我们没有独立复现 DeepSeek 的基准分数。下列易变规格与价格核验于 2026 年 8 月 14 日。
DeepSeek V4 Pro 正式版核心信息
| 项目 | 当前官方信息 |
|---|---|
| GA 正式发布日期 | 2026 年 8 月 13 日 |
| 稳定 API 模型 ID | deepseek-v4-pro |
| 托管模型版本 | DeepSeek-V4-Pro-0813 |
| 上下文窗口 | 1,000,000 Token |
| 最大输出 | 384,000 Token |
| 思考模式 | 支持,且默认启用 |
| 推理强度 | GA 公告:low、high、max;兼容性差异见下文 |
| 官方 API 格式 | Chat Completions、Responses API、Anthropic Messages 兼容 API |
| 文档列出的能力 | JSON 输出、工具调用、自动上下文缓存、前缀续写、非思考模式下的 FIM |
| 官方账号并发 | 500 个并发请求 |
100 万 Token 是容量上限,不是质量承诺。检索准确率、延迟、缓存复用、输出长度、客户端超时和无关上下文比例,仍会决定一个长请求是否真正有用。
与 V4 预览版相比有哪些变化
4 月的预览版首次带来了 V4 系列及其开放权重架构。8 月 GA 是一次托管产品更新,实际变化主要有三项:
- DeepSeek 表示 Agent 能力显著增强,尤其是接近生产环境的编程与自动化任务;
- 官方 API 原生支持 OpenAI Responses 格式,并加入面向 Codex 的兼容适配;
- DeepSeek 宣布从 2026 年 8 月 16 日 16:00 UTC 起启用峰谷 API 价格。
稳定请求模型仍是 deepseek-v4-pro,现有客户端无需迁移模型名。价格页面显示的当前托管版本为 DeepSeek-V4-Pro-0813。
不要直接把可下载的预览版 checkpoint 视为与托管 GA 版本逐比特一致。DeepSeek 当前公开的 V4 模型卡仍描述预览版系列,并未把 checkpoint 标成 0813。因此,自托管版本与官方 API 版本必须分别评估。
基准评测分析:Pro 相比 Flash 提升在哪里
DeepSeek 公布了以下 V4 Pro GA 结果。对比列采用 DeepSeek 7 月 31 日公布的 V4 Flash 更新版分数,差值为绝对分数差。
| 基准 | V4 Pro GA | V4 Flash 0731 | Pro 差值 |
|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | 82.7 | +5.2 |
| NL2Repo | 61.5 | 54.2 | +7.3 |
| Cybergym | 83.3 | 76.7 | +6.6 |
| DeepSWE | 62.7 | 54.4 | +8.3 |
| Toolathlon-Verified | 74.1 | 70.3 | +3.8 |
| Agents' Last Exam | 25.7 | 25.2 | +0.5 |
| AutomationBench(公开集) | 31.8 | 25.1 | +6.7 |
| DSBench-FullStack | 71.1 | 68.7 | +2.4 |
| DSBench-Hard | 67.2 | 59.6 | +7.6 |
DeepSeek 还公布了 V4 Pro GA 的 HLE 成绩:不使用工具为 42.7,使用工具为 60.0。
相比单个最高分,更值得关注的是整体分布。最大的绝对提升出现在仓库级工作、困难软件工程任务和自动化;在 Agents' Last Exam 上差距很小,在广泛工具使用上则为中等提升。这更支持分层路由策略:只有当更高成功率的价值超过纯 Token 效率时才使用 Pro,而分类、摘要、预处理、初步分流和简单子 Agent 继续使用 Flash。
这些是供应商自报结果,不是 Modelflare 独立基准。Agent 的框架、工具权限、推理强度、采样参数、时间限制与评分规则都会显著影响结果。生产决策应在两个模型上回放同一组不含隐私数据的任务,并比较“每个成功任务的成本”,而不只比较 Token 或榜单名次。
架构与 1M 上下文应该怎样理解
DeepSeek 的公开 V4 模型卡将 Pro 系列描述为混合专家模型,总参数量 1.6 万亿,每个 Token 激活 490 亿参数。文档还介绍了结合 Compressed Sparse Attention 与 Heavily Compressed Attention 的混合注意力、Manifold-Constrained Hyper-Connections、Muon 优化器,以及超过 32 万亿 Token 的预训练。
DeepSeek 表示,在 1M Token 上下文下,V4 Pro 的单 Token 推理 FLOPs 是 V3.2 的 27%,KV Cache 需求是 V3.2 的 10%。这些是模型发布方给出的架构层主张,并不表示任何 100 万 Token 请求都会同样快、便宜,或在所有位置保持相同准确率。
真实长上下文工作应当:
- 把稳定指令和可复用仓库材料放在前部,让前缀缓存有机会命中;
- 跟踪
prompt_cache_hit_tokens和prompt_cache_miss_tokens,不要主观假定已命中; - 在过期工具轨迹和重复文件占满窗口前进行压缩;
- 按应用真实文档深度和 Token 位置测试检索;
- 为推理、工具结果和最终答案保留空间,不要用输入填满整个窗口。
DeepSeek 的磁盘缓存默认启用,但只按 best-effort 工作。它匹配可复用前缀,构建可能需要数秒,无使用后通常会在数小时到数天内清理。只要前部内容发生变化,重复请求就可能失去大部分成本优势。
API 兼容性:原生支持不等于完全相同
| 接口 | DeepSeek 官方支持 | 重要边界 |
|---|---|---|
| Chat Completions | 支持 | 思考模式工具循环必须保留 reasoning_content |
| Responses API | 支持 | 无状态;多个 OpenAI 字段会被忽略或不支持 |
| Anthropic 兼容 API | 支持 | 部分字段被忽略;不支持图片与文档内容 |
| FIM 补全 | Beta | 只支持非思考模式,并使用 beta 端点 |
官方 Responses 层支持文本、函数调用、服务端网页搜索,以及为 Codex 兼容提供的 apply_patch 自定义工具。它不支持 previous_response_id、conversation、响应存储、后台模式、service_tier 或 OpenAI 管理的 Prompt Cache Key。不支持的字段往往会被静默忽略,因此 HTTP 200 不能证明语义一致。Responses 客户端必须自行携带历史,并根据事件类型判断结束,而不是等待 Chat Completions 风格的 [DONE]。
Chat Completions 还有一个重要的工具循环边界:思考模式与工具同时使用时,后续请求必须回传 Assistant 的 reasoning_content。DeepSeek 文档明确说明,丢失该字段会返回 400。网关和 SDK 适配器必须用完整的多轮工具循环验证,不能只测一次文本请求。
GA 公告表示支持 low、high 和 max 三档推理强度,但当前详细思考指南与 API Reference 又写明,有效值是 high 与 max,其中 low、medium 会映射为 high,xhigh 会映射为 max。在 DeepSeek 统一文档或实测证明 low 具有独立行为之前,不要基于“low 能降低成本”的假设编预算。
DeepSeek 官方 API 价格:当前与即将生效的价格
下表价格均为每 100 万 Token 的美元价格。当前固定价会继续有效到 2026 年 8 月 16 日 16:00 UTC;新价格在北京时间 8 月 17 日 00:00 生效。
| 计价时段 | 缓存命中输入 | 缓存未命中输入 | 输出 |
|---|---|---|---|
| 8 月 14 日核验的当前价 | $0.003625 | $0.435 | $0.87 |
| 新谷时价格 | $0.022 | $0.66 | $1.98 |
| 新峰时价格 | $0.044 | $1.32 | $3.96 |
新价格下的峰时为 UTC 01:00–04:00 和 06:00–10:00,其余时间均为谷时;谷时价格为峰时的一半。
这次调整并不是把今天的价格简单地按时段做 2 倍区分。与当前固定价相比,新谷时的缓存输入约为 6.07 倍,未缓存输入约为 1.52 倍,输出约为 2.28 倍;新峰时再按谷时价格翻倍。缓存仍然很有价值,但发布初期极低的缓存输入价格变化最大。
成本算例
只计算 Token 的公式是:
成本 = 缓存命中 Token × 命中单价 + 缓存未命中 Token × 未命中单价 + 输出 Token × 输出单价
下列示例不包含独立的网络、订阅、工具服务或支付成本。工具型 Agent 可能产生多次模型调用,因此应计算完整任务,而不是只看第一次请求。
| 工作负载 | DeepSeek 当前价 | 新谷时价 | 新峰时价 | Modelflare 8 月 14 日快照 |
|---|---|---|---|---|
| 100K 未缓存输入 + 10K 输出 | $0.0522 | $0.0858 | $0.1716 | $0.0540 |
| 90K 缓存 + 10K 未缓存输入 + 10K 输出 | $0.0134 | $0.0284 | $0.0568 | $0.0138 |
| 900K 缓存 + 100K 未缓存输入 + 20K 输出 | $0.0642 | $0.1254 | $0.2508 | $0.0663 |
第二、三行说明 Prompt 结构会直接影响成本。巨大的稳定前缀可以显著降价,但前提是真正命中缓存。对账时应以 API usage 字段为准。
DeepSeek V4 Pro 与 V4 Flash:如何选择性价比
按当前官方价格,Pro 的未缓存输入与输出约为 Flash 的 3.11 倍,缓存输入仅为 1.29 倍。新价格生效后,Pro 的未缓存输入与输出为 Flash 的 3 倍,缓存输入约为 3.14 倍。官方账号并发上限则是 Pro 500、Flash 2,500。
因此可以建立清晰的运行规则:
- 困难仓库修改、长周期 Agent、安全分析、复杂工具协同,以及一次失败代价很高的任务,选择 V4 Pro;
- 简单 Agent、并行 Worker、预处理、抽取、摘要和吞吐敏感流量,选择 V4 Flash;
- 根据观测到的任务难度与每个成功任务成本进行路由,不把 Pro 设为所有请求的默认值;
- 调价后重新评估,因为缓存型 Pro 工作负载的经济性会明显变化。
如果 Pro 能避免重试或人工修复,3 倍 Token 单价仍可能更便宜;反过来,5 分的基准优势也不足以证明应把确定性或简单任务送到大模型。需要测量成功率、总耗时、重试后的总 Token、工具失败和审核修正时间。
Modelflare 上的 DeepSeek V4 Pro 价格与可用性
我们在 2026 年 8 月 14 日核验了 Modelflare 实时价格目录。目录列出 deepseek-v4-pro 和固定别名 deepseek-v4-pro-0813,二者位于 deepseek-stable 分组,每 100 万 Token 的基础价格如下:
| Modelflare 价格快照 | 价格 |
|---|---|
| 缓存命中输入 | $0.0037 |
| 缓存未命中输入 | $0.45 |
| 输出 | $0.90 |
该快照的缓存命中价比 DeepSeek 当前价格约高 2.07%,缓存未命中与输出价格约高 3.45%。本文没有替 Modelflare 承诺这些价格在 DeepSeek 峰谷调价后保持不变。生产决策始终应以实时价格页和请求用量记录为准。
当前公开目录把 Modelflare 路由标记为 OpenAI 兼容的 Chat Completions。虽然 DeepSeek 自有端点已支持 Responses 与 Anthropic 格式,但上游支持并不意味着每一条网关路由自动兼容。请只使用实时价格页明确列出的协议。
export MODELFLARE_API_KEY="your-api-key"
curl https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer ${MODELFLARE_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "Review this migration plan and identify rollback risks."}
],
"thinking": {"type": "enabled"},
"reasoning_effort": "high"
}'
通用客户端配置可参考 OpenAI 兼容 API 指南;账务和缓存 Token 解读可参考 AI API 成本追踪。
生产评估清单
- 若路由提供固定版本,评估期间使用
deepseek-v4-pro-0813,再决定稳定别名是否满足变更控制要求。 - 在 Pro 与 Flash 上回放同一组不含隐私数据的固定任务,并保持工具、权限、超时和停止规则一致。
- 同时测试
high与max;在当前 API 行为证明差异前,把low视为与high等价。 - 完成一整套多轮工具循环,确认
reasoning_content、工具 ID、参数和结果能穿过所有适配层。 - Responses 客户端必须逐项测试必需字段,因为不支持的参数可能被静默忽略。
- 记录缓存命中输入、未命中输入、输出、推理 Token、延迟、重试和每个成功任务成本。
- 用真实深度的长 Prompt 测试,不要从一次短请求推断 100 万 Token 的检索质量。
- 在账号并发上限以下做负载测试,并用有界退避处理 429。
- 批准预算前同时建模当前价格和 8 月 16/17 日生效的峰谷价格。
- 保留 Flash 或其他模型作为可用性与成本回退;可参考 可靠 AI API 路由。
最终结论
DeepSeek V4 Pro GA 是一次有实质内容的 Agent 更新,不只是预览版改名。官方分数的优势主要集中在仓库推理、高难度编程和自动化,新 Responses 接口也让它更适合现代编程 Agent。1M 上下文与自动缓存很有价值,但应用必须保持稳定前缀并核实真实命中。
最大的保留意见是经济性:发布后的 Pro 在多数 Token 类别上约为 Flash 的 3 倍,而且并发更低。它更适合充当困难、高价值任务的升级层,而不是每条 Prompt 的默认模型。更合理的生产架构通常会把简单任务交给 Flash,仅把困难或失败任务提升到 Pro。
Modelflare 8 月 14 日价格快照接近 DeepSeek 当前固定价,并且当前为 V4 Pro 提供 Chat Completions。DeepSeek 新价格生效后需要重新检查实时页面;旧文章或缓存的价格截图都不能作为账单真相。
来源与核验日期
- DeepSeek:V4 Pro GA 正式发布
- DeepSeek API 模型与价格
- DeepSeek API 更新记录
- DeepSeek 思考模式
- DeepSeek Responses API 兼容说明
- DeepSeek Anthropic API 兼容说明
- DeepSeek 上下文缓存
- DeepSeek 限速与隔离
- DeepSeek V4 Pro 模型卡与开放权重
官方规格、价格时段、Modelflare 可用性和实时价格均核验于 2026 年 8 月 14 日。