DeepSeek V4 Pro 正式版評測:效能、API 價格與成本分析

依官方資料評測 DeepSeek V4 Pro 正式版,涵蓋 Agent 基準、1M 上下文、API 相容邊界、目前與即將生效的峰谷價格、成本範例及 Modelflare 可用性。

DeepSeek 於 2026 年 8 月 13 日發布 DeepSeek-V4-Pro GA 正式版。託管 API 目前顯示的版本是 DeepSeek-V4-Pro-0813,穩定 API 模型 ID 仍為 deepseek-v4-pro。本次更新提供 100 萬 Token 上下文、最高 384,000 Token 輸出、原生 Responses API 支援,並將在發布後不久啟用新的計價時段。

我們的結論是:對於高難度程式設計、儲存庫級任務和長時間執行的 Agent,V4 Pro 值得進入正式環境評估候選。DeepSeek 公布的結果顯示,它在困難 Agent 基準上持續領先 V4 Flash,但 Pro 不應成為所有請求的預設經濟選擇。新價格生效後,其官方輸入與輸出價格大約是 Flash 的 3 倍,而帳號並發上限只有 Flash 的五分之一。

本文嚴格區分目前 API 事實、DeepSeek 自行公布的基準成績、我們的分析,以及 Modelflare 目前可用性。我們沒有獨立重現 DeepSeek 的基準分數。下列易變規格與價格核驗於 2026 年 8 月 14 日。

DeepSeek V4 Pro 正式版評測:百萬 Token 上下文與 Agent 工具編排

DeepSeek V4 Pro 正式版核心資訊

項目 目前官方資訊
GA 正式發布日期 2026 年 8 月 13 日
穩定 API 模型 ID deepseek-v4-pro
託管模型版本 DeepSeek-V4-Pro-0813
上下文視窗 1,000,000 Token
最大輸出 384,000 Token
思考模式 支援,且預設啟用
推理強度 GA 公告:low、high、max;相容性差異見下文
官方 API 格式 Chat Completions、Responses API、Anthropic Messages 相容 API
文件列出的能力 JSON 輸出、工具呼叫、自動上下文快取、前綴續寫、非思考模式下的 FIM
官方帳號並發 500 個並發請求

100 萬 Token 是容量上限,不是品質承諾。檢索準確率、延遲、快取重用、輸出長度、客戶端逾時和無關上下文比例,仍會決定一個長請求是否真正有用。

與 V4 預覽版相比有哪些變化

4 月的預覽版首次帶來 V4 系列及其開放權重架構。8 月 GA 是一次託管產品更新,實際變化主要有三項:

  • DeepSeek 表示 Agent 能力顯著增強,尤其是接近正式環境的程式設計與自動化任務;
  • 官方 API 原生支援 OpenAI Responses 格式,並加入面向 Codex 的相容適配;
  • DeepSeek 宣布從 2026 年 8 月 16 日 16:00 UTC 起啟用峰谷 API 價格。

穩定請求模型仍是 deepseek-v4-pro,現有客戶端無須遷移模型名稱。價格頁面顯示的目前託管版本為 DeepSeek-V4-Pro-0813

不要直接把可下載的預覽版 checkpoint 視為與託管 GA 版本逐位元一致。DeepSeek 目前公開的 V4 模型卡仍描述預覽版系列,並未把 checkpoint 標成 0813。因此,自行託管版本與官方 API 版本必須分別評估。

基準評測分析:Pro 相比 Flash 提升在哪裡

DeepSeek 公布了以下 V4 Pro GA 結果。比較欄採用 DeepSeek 7 月 31 日公布的 V4 Flash 更新版分數,差值為絕對分數差。

基準 V4 Pro GA V4 Flash 0731 Pro 差值
Terminal Bench 2.1 87.9 82.7 +5.2
NL2Repo 61.5 54.2 +7.3
Cybergym 83.3 76.7 +6.6
DeepSWE 62.7 54.4 +8.3
Toolathlon-Verified 74.1 70.3 +3.8
Agents' Last Exam 25.7 25.2 +0.5
AutomationBench(公開集) 31.8 25.1 +6.7
DSBench-FullStack 71.1 68.7 +2.4
DSBench-Hard 67.2 59.6 +7.6

DeepSeek 還公布了 V4 Pro GA 的 HLE 成績:不使用工具為 42.7,使用工具為 60.0。

相比單一最高分,更值得關注的是整體分布。最大的絕對提升出現在儲存庫級工作、困難軟體工程任務和自動化;在 Agents' Last Exam 上差距很小,在廣泛工具使用上則為中等提升。這更支援分層路由策略:只有當更高成功率的價值超過純 Token 效率時才使用 Pro,而分類、摘要、預處理、初步分流和簡單子 Agent 繼續使用 Flash。

這些是供應商自報結果,不是 Modelflare 獨立基準。Agent 的框架、工具權限、推理強度、取樣參數、時間限制與評分規則都會顯著影響結果。正式環境決策應在兩個模型上重播同一組不含隱私資料的任務,並比較「每個成功任務的成本」,而不只比較 Token 或排行榜名次。

架構與 1M 上下文應該怎樣理解

DeepSeek 的公開 V4 模型卡將 Pro 系列描述為混合專家模型,總參數量 1.6 兆,每個 Token 啟用 490 億參數。文件還介紹了結合 Compressed Sparse Attention 與 Heavily Compressed Attention 的混合注意力、Manifold-Constrained Hyper-Connections、Muon 最佳化器,以及超過 32 兆 Token 的預訓練。

DeepSeek 表示,在 1M Token 上下文下,V4 Pro 的單 Token 推理 FLOPs 是 V3.2 的 27%,KV Cache 需求是 V3.2 的 10%。這些是模型發布方提供的架構層主張,並不表示任何 100 萬 Token 請求都會同樣快、便宜,或在所有位置保持相同準確率。

真實長上下文工作應當:

  • 把穩定指令和可重用儲存庫材料放在前部,讓前綴快取有機會命中;
  • 追蹤 prompt_cache_hit_tokensprompt_cache_miss_tokens,不要主觀假定已命中;
  • 在過期工具軌跡和重複檔案占滿視窗前進行壓縮;
  • 按應用真實文件深度和 Token 位置測試檢索;
  • 為推理、工具結果和最終答案保留空間,不要用輸入填滿整個視窗。

DeepSeek 的磁碟快取預設啟用,但只按 best-effort 運作。它比對可重用前綴,建立可能需要數秒,無使用後通常會在數小時到數天內清理。只要前部內容發生變化,重複請求就可能失去大部分成本優勢。

API 相容性:原生支援不等於完全相同

介面 DeepSeek 官方支援 重要邊界
Chat Completions 支援 思考模式工具循環必須保留 reasoning_content
Responses API 支援 無狀態;多個 OpenAI 欄位會被忽略或不支援
Anthropic 相容 API 支援 部分欄位被忽略;不支援圖片與文件內容
FIM 補全 Beta 只支援非思考模式,並使用 beta 端點

官方 Responses 層支援文字、函式呼叫、伺服器端網頁搜尋,以及為 Codex 相容提供的 apply_patch 自訂工具。它不支援 previous_response_id、conversation、回應儲存、背景模式、service_tier 或 OpenAI 管理的 Prompt Cache Key。不支援的欄位通常會被靜默忽略,因此 HTTP 200 不能證明語意一致。Responses 客戶端必須自行攜帶歷史,並依事件類型判斷結束,而不是等待 Chat Completions 風格的 [DONE]

Chat Completions 還有一個重要的工具循環邊界:思考模式與工具同時使用時,後續請求必須回傳 Assistant 的 reasoning_content。DeepSeek 文件明確說明,遺失該欄位會回傳 400。閘道與 SDK 適配器必須以完整的多輪工具循環驗證,不能只測一次文字請求。

GA 公告表示支援 low、high 和 max 三檔推理強度,但目前詳細思考指南與 API Reference 又寫明,有效值是 highmax,其中 lowmedium 會映射為 highxhigh 會映射為 max。在 DeepSeek 統一文件或實測證明 low 具有獨立行為之前,不要基於「low 能降低成本」的假設編列預算。

DeepSeek 官方 API 價格:目前與即將生效的價格

下表價格均為每 100 萬 Token 的美元價格。目前固定價會繼續有效到 2026 年 8 月 16 日 16:00 UTC;新價格在北京時間 8 月 17 日 00:00 生效。

計價時段 快取命中輸入 快取未命中輸入 輸出
8 月 14 日核驗的目前價格 $0.003625 $0.435 $0.87
新離峰價格 $0.022 $0.66 $1.98
新尖峰價格 $0.044 $1.32 $3.96

新價格下的尖峰時段為 UTC 01:00–04:00 和 06:00–10:00,其餘時間均為離峰;離峰價格為尖峰的一半。

這次調整並不是把今天的價格簡單按時段做 2 倍區分。與目前固定價相比,新離峰的快取輸入約為 6.07 倍,未快取輸入約為 1.52 倍,輸出約為 2.28 倍;新尖峰再按離峰價格加倍。快取仍然很有價值,但發布初期極低的快取輸入價格變化最大。

成本範例

只計算 Token 的公式是:

成本 = 快取命中 Token × 命中單價 + 快取未命中 Token × 未命中單價 + 輸出 Token × 輸出單價

下列範例不包含獨立的網路、訂閱、工具服務或付款成本。工具型 Agent 可能產生多次模型呼叫,因此應計算完整任務,而不是只看第一次請求。

工作負載 DeepSeek 目前價格 新離峰價格 新尖峰價格 Modelflare 8 月 14 日快照
100K 未快取輸入 + 10K 輸出 $0.0522 $0.0858 $0.1716 $0.0540
90K 快取 + 10K 未快取輸入 + 10K 輸出 $0.0134 $0.0284 $0.0568 $0.0138
900K 快取 + 100K 未快取輸入 + 20K 輸出 $0.0642 $0.1254 $0.2508 $0.0663

第二、三列說明 Prompt 結構會直接影響成本。巨大的穩定前綴可以顯著降價,但前提是真正命中快取。對帳時應以 API usage 欄位為準。

DeepSeek V4 Pro 與 V4 Flash:如何選擇性價比

按目前官方價格,Pro 的未快取輸入與輸出約為 Flash 的 3.11 倍,快取輸入僅為 1.29 倍。新價格生效後,Pro 的未快取輸入與輸出為 Flash 的 3 倍,快取輸入約為 3.14 倍。官方帳號並發上限則是 Pro 500、Flash 2,500。

因此可以建立清楚的執行規則:

  • 困難儲存庫修改、長週期 Agent、安全分析、複雜工具協作,以及一次失敗代價很高的任務,選擇 V4 Pro;
  • 簡單 Agent、並行 Worker、預處理、擷取、摘要和吞吐量敏感流量,選擇 V4 Flash;
  • 根據觀測到的任務難度與每個成功任務成本進行路由,不把 Pro 設為所有請求的預設值;
  • 調價後重新評估,因為快取型 Pro 工作負載的經濟性會明顯變化。

如果 Pro 能避免重試或人工修復,3 倍 Token 單價仍可能更便宜;反過來,5 分的基準優勢也不足以證明應把確定性或簡單任務送到較大模型。需要測量成功率、總耗時、重試後的總 Token、工具失敗和審核修正時間。

Modelflare 上的 DeepSeek V4 Pro 價格與可用性

我們在 2026 年 8 月 14 日核驗了 Modelflare 即時價格目錄。目錄列出 deepseek-v4-pro 和固定別名 deepseek-v4-pro-0813,兩者位於 deepseek-stable 分組,每 100 萬 Token 的基礎價格如下:

Modelflare 價格快照 價格
快取命中輸入 $0.0037
快取未命中輸入 $0.45
輸出 $0.90

該快照的快取命中價比 DeepSeek 目前價格約高 2.07%,快取未命中與輸出價格約高 3.45%。本文沒有替 Modelflare 承諾這些價格在 DeepSeek 峰谷調價後保持不變。正式環境決策始終應以即時價格頁和請求用量記錄為準。

目前公開目錄把 Modelflare 路由標記為 OpenAI 相容的 Chat Completions。雖然 DeepSeek 自有端點已支援 Responses 與 Anthropic 格式,但上游支援並不代表每一條閘道路由自動相容。請只使用即時價格頁明確列出的協定。

export MODELFLARE_API_KEY="your-api-key"

curl https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer ${MODELFLARE_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Review this migration plan and identify rollback risks."}
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high"
  }'

通用客戶端設定可參考 OpenAI 相容 API 指南;帳務和快取 Token 解讀可參考 AI API 成本追蹤

正式環境評估清單

  1. 若路由提供固定版本,評估期間使用 deepseek-v4-pro-0813,再決定穩定別名是否滿足變更控制要求。
  2. 在 Pro 與 Flash 上重播同一組不含隱私資料的固定任務,並保持工具、權限、逾時和停止規則一致。
  3. 同時測試 highmax;在目前 API 行為證明差異前,把 low 視為與 high 等價。
  4. 完成一整套多輪工具循環,確認 reasoning_content、工具 ID、參數和結果能穿過所有適配層。
  5. Responses 客戶端必須逐項測試必要欄位,因為不支援的參數可能被靜默忽略。
  6. 記錄快取命中輸入、未命中輸入、輸出、推理 Token、延遲、重試和每個成功任務成本。
  7. 用真實深度的長 Prompt 測試,不要從一次短請求推斷 100 萬 Token 的檢索品質。
  8. 在帳號並發上限以下做負載測試,並以有界退避處理 429。
  9. 核准預算前同時建模目前價格和 8 月 16/17 日生效的峰谷價格。
  10. 保留 Flash 或其他模型作為可用性與成本回退;可參考 可靠 AI API 路由

最終結論

DeepSeek V4 Pro GA 是一次有實質內容的 Agent 更新,不只是預覽版改名。官方分數的優勢主要集中在儲存庫推理、高難度程式設計和自動化,新 Responses 介面也讓它更適合現代程式設計 Agent。1M 上下文與自動快取很有價值,但應用必須保持穩定前綴並核實真實命中。

最大的保留意見是經濟性:發布後的 Pro 在多數 Token 類別上約為 Flash 的 3 倍,而且並發更低。它更適合充當困難、高價值任務的升級層,而不是每條 Prompt 的預設模型。更合理的正式環境架構通常會把簡單任務交給 Flash,僅把困難或失敗任務提升到 Pro。

Modelflare 8 月 14 日價格快照接近 DeepSeek 目前固定價,並且目前為 V4 Pro 提供 Chat Completions。DeepSeek 新價格生效後需要重新檢查即時頁面;舊文章或快取的價格截圖都不能作為帳單真相。

來源與核驗日期

官方規格、價格時段、Modelflare 可用性和即時價格均核驗於 2026 年 8 月 14 日。