DeepSeek V4 Flash 上線:規格、能力與 Modelflare 設定指南

深入了解 DeepSeek-V4-Flash-0731 的 284B/13B MoE、1M 上下文、思考參數、Modelflare 即時價格與 Chat Completions/Responses 設定。

DeepSeek 已於 2026 年 7 月 31 日將 deepseek-v4-flash 更新為正式 API 公開測試版本 DeepSeek-V4-Flash-0731。呼叫 ID 沒有改變,但這次更新不只是更名:官方表示模型沿用預覽版的架構與規模,主要透過新的後訓練提升 Coding Agent 與工具使用能力,並原生支援 Responses API。

如果你的文字工作負載需要兼顧推理、長上下文、吞吐量與成本,V4 Flash 是比 V4 Pro 更偏向高吞吐與日常 Agent 任務的選擇。以下會明確區分三類資訊:DeepSeek 官方公布的規格、Modelflare 目前開放的協定與價格,以及仍需以實際工作負載驗證的行為。

核心規格

項目 DeepSeek V4 Flash
Modelflare 模型 ID deepseek-v4-flash
目前官方 API 版本 DeepSeek-V4-Flash-0731
架構 Mixture-of-Experts(MoE)
總參數量 284B
每個 Token 啟用參數量 13B
上下文長度 1M tokens
最大輸出 384K tokens
思考模式 預設啟用,預設 effort 為 high
可選推理強度 lowhighmaxxhigh 目前對應到 high
官方 API 功能 JSON Output、Tool Calls、Responses API、Chat Prefix Completion;FIM 僅支援非思考模式
主要輸入與輸出 文字輸入、文字輸出;不可據此推論支援影像輸入

真正值得注意的不是 284B 總參數本身,而是 13B 啟用參數與 1M 上下文的組合。MoE 路由每次只啟用部分專家參數,目標是在保留模型容量的同時控制單一 Token 的推理成本。DeepSeek 技術報告也說明了針對長上下文效率設計的注意力機制;這些架構優勢能否實際降低延遲,仍取決於提示長度、推理強度、上游負載與輸出規模。

0731 版本更新了什麼

DeepSeek 將 0731 描述為重新進行後訓練、但沒有改變架構或模型規模的版本。官方公布的 Agent 評測包括 Terminal Bench 2.1 的 82.7 分與 Toolathlon Verified 的 70.3 分,並表示 V4 Flash 的 Agent 能力已大幅超越先前的 V4 Pro Preview。

這些數字適合用來理解版本方向,不應直接視為生產 SLA。DeepSeek 的公開 Code Agent 評測使用特定 Harness、max effort、top_p=0.95temperature=1.0,部分資料集也屬於內部評測。實際選型時應固定模型 ID、客戶端、工具、逾時設定與任務樣本,再記錄成功率、首次輸出時間、總延遲、Token 用量與返工輪次。

如何選擇思考參數

V4 Flash 預設啟用思考模式,預設推理強度為 high。可以從以下策略開始:

  • 摘要、分類與格式轉換:先使用 low,再量測品質;
  • 程式碼修改、複雜分析與多步驟工具:從 high 開始;
  • 少量高難度任務:再評估 max,並明確保留延遲與推理 Token 預算;
  • 只需要快速直接回答:設定 thinking.type=disabled,不要依賴已停用的 deepseek-chat 舊別名。

在思考模式中,即使接受 temperaturetop_ppresence_penaltyfrequency_penalty,這些參數也不會生效。使用工具的多輪對話還必須在工具呼叫所在回合保留並回傳 reasoning_content;遺漏時,上游可能回傳 400。如果客戶端無法正確維護該欄位,應先用不含工具的請求驗證基本鏈路。

Modelflare 目前的開放方式

截至 2026 年 8 月 4 日,Modelflare 公開目錄為 deepseek-v4-flash 標示了 Chat Completions 與 Responses 兩種入口。DeepSeek 上游也提供 Anthropic 相容格式,但這不代表 Modelflare 目前已為此模型開放相同入口;請以模型與價格頁面顯示的協定為準。

目前公開價格快照如下,單位皆為美元/百萬 tokens:

可用群組 輸入 輸出 快取命中輸入 說明
deepseek-award $0.105 $0.21 $0.0021 僅供具備該群組資格的 API Key 使用
deepseek-stable $0.15 $0.30 $0.003 穩定群組

價格、群組資格與支援協定都可能調整。應用程式不應把這份快照寫死成長期計費契約;上線前請重新檢查即時目錄,並在用量記錄中確認實際群組、Token 與費用。

Chat Completions 設定

先將 Modelflare API Key 放入環境變數:

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

接著呼叫標準公開 Base URL:

curl -N -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {"role": "system", "content": "You are a careful coding assistant."},
      {"role": "user", "content": "Review this migration plan and list the rollback risks."}
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high",
    "stream": true
  }'

若 OpenAI SDK 沒有直接提供 thinking,請透過 SDK 的 extra_body 傳入。模型專用欄位應維持原始 JSON,不要重新命名,也不要遺漏明確設定的 false

Responses API 設定

V4 Flash 也可以透過 Modelflare 的 Responses 入口呼叫:

curl -N -sS https://modelflare.dev/v1/responses \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "input": "Inspect the proposed deployment sequence and identify unsafe assumptions.",
    "reasoning": {"effort": "high"},
    "stream": true
  }'

Chat Completions 與 Responses 是不同的 wire contract。同一模型同時出現在兩種入口,不代表事件類型、工具狀態、錯誤結構或續寫方式完全相同。正式上線前應分別驗證非串流、串流與工具呼叫。

建議的站內設定方案

  1. 每個應用程式建立獨立的 Modelflare API Key,並選擇確實包含 deepseek-v4-flash 的主要群組;
  2. 只有備援群組也支援相同模型與協定時,才將其加入有順序的 fallback;
  3. 一般文字任務從 low 或非思考模式開始,複雜 Agent 任務則從 high 開始;
  4. 客戶端逾時必須涵蓋長時間思考與長輸出,不要用單一短提示的耗時當成生產上限;
  5. 使用工具時保留模型回傳的完整 assistant 訊息,尤其是 reasoning_contenttool_calls
  6. 上線前以真實任務檢查成功率、首次輸出、總延遲、輸出 Token、所選群組與單次請求費用。

適合與不適合的情境

V4 Flash 適合高頻程式碼輔助、長文件分析、使用工具的 Agent、批次文字處理,以及需要在能力與成本之間取得平衡的應用。面對最困難的知識密集問題或長程自主任務,仍應以 V4 Pro 或其他旗艦模型作為對照;若需要影像輸入,則應選擇已明確公布且在 Modelflare 驗證過多模態協定的模型。

資料來源與更新時間

本文資料核對時間為 2026 年 8 月 4 日。模型快照、價格與協定支援都可能變動;生產設定應以呼叫當下的官方文件與 Modelflare 即時目錄為準。