DeepSeek V4.1 Flash 深度分析:架構、Modelflare 價格及與 OpenAI、Anthropic 的對比

基於一手資料拆解 DeepSeek V4.1 Flash 的架構、1M 上下文、384K 輸出、Agent 基準與 API 限制,並比較 OpenAI、Anthropic 模型及當前 Modelflare 上線狀態和價格。

DeepSeek V4.1 Flash 深度分析:架構、Modelflare 價格及與 OpenAI、Anthropic 的對比

DeepSeek V4.1 Flash 是一款面向長程 Agent 的低成本、開放權重、多模態模型。它於 2026 年 9 月 10 日釋出,擁有 100 萬 Token 上下文、最高 384K Token 輸出、極低的官方 API 價格,以及同時降低提示詞處理量與 KV Cache 壓力的架構。它最明確的優勢並非贏下所有基準,而是能以很低的單位成本處理長上下文 Agent 任務,同時在程式碼、終端、自動化和工具呼叫評測中保持競爭力。

這個結論有清晰邊界。下文的基準數字由 DeepSeek 釋出,Modelflare 沒有進行獨立複測。DeepSeek 自己也在報告中承認:面對最困難的推理和邊界問題,V4.1 Flash 與最大型閉源模型之間仍有差距。DeepSeek 第一方 API 的正確模型 ID 是 deepseek-flash。DeepSeek V4.1 Flash 目前已經在 Modelflare 上線,版本化模型 ID 為 deepseek-v4.1-flash-0910,可在公開 deepseek-stable 分組使用 Chat Completions 與 Responses。

最後核驗:2026-09-10 UTC。價格、別名和目錄狀態都可能變化。

直接結論:DeepSeek V4.1 Flash 是什麼

DeepSeek 釋出公告將 DeepSeek V4.1 Flash 定義為此前 Flash 產品線的生產替代型號,官方端點使用 deepseek-flash。舊名稱 deepseek-v4-flashdeepseek-v4-flash-vision-exp 暫時仍可在 DeepSeek API 中使用,並會按 Flash 價格路由到 V4.1 Flash。DeepSeek 還宣佈,從 2026 年 9 月 14 日 04:00 UTC 起,deepseek-v4-pro 請求也會暫時路由到 V4.1 Flash,直至後續 V4.1 Pro 釋出。

這項遷移策略只屬於 DeepSeek 自有 API。Modelflare 使用明確標記釋出日期的 deepseek-v4.1-flash-0910,沒有把此前的 deepseek-v4-flash 條目靜默改名。Modelflare Owner 已確認上線,公網與源站價格目錄也在 2026-09-10 15:21 UTC 同時出現新模型。客戶端應使用各自服務商展示的精確 ID,不能假設第一方別名會在所有閘道器中原樣生效。

這款模型的實際身份由五部分組成:圖像與文字輸入、文字輸出、552B 參數的 MoE 主幹、額外 196B 參數的 Engram 條件記憶,以及提示詞預填充每 Token 啟用 8B 參數、解碼每 Token 啟用 16B 參數的不對稱計算。最後一點最關鍵:對輸入很長、頻繁重新預填充的 Agent,它應當比同等規模的對稱 Decoder-only 路徑消耗更少預填充算力。

核心規格一覽

下列資料來自官方釋出公告模型卡技術報告。“主幹參數”和“Engram 參數”描述兩類不同儲存,也都不等於每個 Token 的實際啟用計算量。

專案 DeepSeek V4.1 Flash
官方 API ID deepseek-flash
Modelflare 模型 ID deepseek-v4.1-flash-0910
模型型別 多模態混合專家 Transformer
輸入 / 輸出 文字與圖像輸入;文字輸出
Transformer 結構 40 層:20 層因果編碼器 + 20 層解碼器
參數儲存 552B 主幹 + 196B Engram 條件記憶
啟用參數 預填充每 Token 8B;解碼每 Token 16B
上下文 / 最大輸出 1M / 384K Token
預訓練 45T 多模態語料 Token;純文字與多模態 Token 比例 7:1
主要注意力與快取設計 CED + CSA2 + FP4 全域性 KV;FP8 區域性 SWA KV
全域性 KV 佔用 DeepSeek 報告為每 Token 890 位元組
公開推理檔位 low = 50、high = 75、max = 100,對應內部 effort 標尺
官方 API 併發上限 2,500 個併發請求
許可證 MIT 模型權重許可證

384K 的輸出上限是本文所列當前 OpenAI、Anthropic 對比模型 128K 上限的三倍。上限並不等於建議用量:超長輸出會增加延遲、費用和內容漂移的空間。對長程 Agent,更有意義的問題是經過多次工具呼叫後,模型能否保留要求並透過真實驗收。

為什麼這套架構適合長程 Agent

工具型 Agent 會不斷把觀察、命令結果和修改加入歷史。每一輪都可能再次執行提示詞預填充、在不斷增長的上下文上做注意力計算、儲存 KV,並生成新輸出。DeepSeek V4.1 Flash 分別處理這些成本,而不是只依靠縮小模型。

Agent 成本 V4.1 Flash 機制 預期效果
重複處理長提示詞 Causal Encoder-Decoder(CED) 按 DeepSeek 分析,長序列的漸近預填充工作量接近減半
在 HBM 儲存全域性歷史 CSA2 跨層複用 + FP4 減少重複全域性 KV 條目及單條目位元組數
持久儲存區域性注意力狀態 SWA Bounded Replay 重建有限區域性視窗,避免儲存每層完整區域性快取
記憶穩定 Token 模式 Engram 把條件式 n-gram 記憶放入稀疏訪問表
生成 Token DSpark 推測解碼 並行草擬多個位置,並依據置信度和系統負載決定驗證長度
理解圖像 DeepSeek-ViT + 投影器 把視覺輸入轉成從預訓練階段就與文字共同處理的嵌入

這些機制主要改善服務成本和吞吐,並不會自動證明推理更強。模型質量還取決於資料、後訓練、Agent 框架和實際購買的推理 effort。

CED:先減少預填充計算,再談快取

技術報告把 40 層 Transformer 拆成 20 層因果編碼器和 20 層解碼器。前兩層只使用 128 Token 滑動視窗,其他層把區域性滑動視窗注意力與壓縮後的全域性上下文結合起來。

在全域性注意力路徑上,解碼器不會在每一層都獨立構建完整 KV 歷史,而是從編碼器最終隱藏狀態投影全域性 Key 和 Value;區域性滑動視窗狀態仍然按層保留。DeepSeek 估算,長序列預填充的主導計算項因此從所有 Token 經過全部 L 層,變為全域性上下文主要經過約 L/2 層,再加上受視窗大小限制的區域性計算,整體接近減半。

這也解釋了 8B/16B 的啟用差異:提示詞 Token 在預填充階段約啟用 8B 主幹參數,新生成 Token 在解碼階段約啟用 16B。超長文件、短答案的任務獲益更大;輸出數十萬 Token 的任務仍然要支付完整解碼成本。CED 降低的是賬單前半段,不會讓生成免費。

CSA2、FP4 與 SWA Bounded Replay:快取到底省在哪裡

Compressed Sparse Attention 2 同時沿序列、層和精度三個維度壓縮快取。每個 CSA2 層會靜態分配為三種模式之一。Full 計算主 KV、Indexer Key 和新的 Top-K 位置;Reindex 複用主 KV 與 Indexer Key,但使用自己的 Query 重新評分;Reuse 同時複用共享 KV 和此前選出的稀疏位置。每一層仍保留自己的 Query 與區域性滑動視窗 KV。

解碼器第一個 Full 層選擇 Top-512 條目並建立候選池,後續 Reindex 層再從縮小後的池中選擇各自的 Top-512。全域性主 KV 使用約四位的 E2M1 表示,每 16 個通道配置一個 E4M3 Scale;對量化更敏感的區域性 SWA Cache 則繼續使用 FP8。

快取層 精度 / 生命週期 報告結果 不代表什麼
執行時全域性 KV FP4,駐留 HBM 每 Token 890 位元組;約為 V4 Flash 的 1/4,比 V1 小約 437 倍 所有邊界輸入都能完美選中稀疏位置
執行時區域性 SWA KV FP8 保留每層 128 Token 區域性視窗 任意併發下都可忽略記憶體佔用
持久全域性 KV DeepSeek 部署設計中的主機記憶體或 SSD 可複用的長生命週期全域性狀態 公開 API 承諾固定保留時間
持久區域性 SWA 狀態 透過 Bounded Replay 重建 相同序列長度下,總持久快取約為 V4 Flash 的 1/8 被丟棄區域性狀態可以完全無損還原

報告描述的部署系統會讓全域性持久 KV 至少儲存 72 小時,並使用分散式短生命週期 SWA Pool;但公開上下文快取指南稱快取建立是自動且盡力而為,構建可能需要數秒,條目通常會在數小時到數天後清除。生產客戶端應以公開契約為準,透過命中和未命中 Token 欄位做預算,不要把 72 小時當成 API 保證。

DeepSeek 也明確指出兩個魯棒性邊界:CSA2 可能選錯稀疏位置,Bounded Replay 對被移除的區域性狀態只做近似重建。已有評測未發現系統性退化,但極端上下文與快取恢復邊界仍需繼續壓力測試。

Engram、DSpark 與多模態路徑

Engram 把一部分記憶能力從密集模型計算中拆出。V4.1 Flash 在從零計數的第 1 層和第 14 層放置兩個條件記憶模組,總計 196B 參數。每個模組使用長度為二、三、四的 Token n-gram、八個雜湊頭、上下文門控,以及透過 RDMA 從主機記憶體預取。它們是儲存參數,並不是每個 Token 都會額外啟用 196B 參數。

DSpark 是單獨訓練的推測解碼器。三個 Transformer Block 檢視 128 Token 滑動視窗,並在一次前向過程中並行提出五個位置。輕量依賴頭刻畫草稿 Token 之間的關係,置信度頭估計草稿字首透過驗證的機率;排程器再結合這些機率與實測引擎吞吐,在當前負載下選擇驗證長度。這樣可以提升系統 Token 吞吐,同時仍由主幹模型完成最終驗證。

視覺路徑使用單獨訓練的 DeepSeek-ViT 和二維旋轉位置編碼。3×3 Pixel Unshuffle 會在進入語言模型前把視覺 Token 數量縮小九倍。報告配置中的視覺編碼器有 32 層、1,024 隱藏維度和 16 個注意力頭。在較早的約 47B 圖文對比學習之後,其自迴歸訓練階段會把圖像縮放到 544×544 至 1,344×1,344 範圍。

預訓練與後訓練

DeepSeek 報告了 45T 預訓練 Token,多模態資料從語言模型預訓練階段就被納入。純文字和多模態流水線在去重與重疊替換後,以 7:1 Token 比例合併。稀疏注意力從 64K 序列長度直接開始訓練,沒有先做密集註意力熱身;到 34T Token 時再把上下文擴充套件到 1M。

階段 已公開細節 意義
視覺對比預訓練 約 47B 圖文對,低解析度階段 在語言整合前學習廣泛視覺表示
視覺自迴歸微調 236B Token,包含描述、圖表、OCR 等資料 加強細粒度視覺與文件理解
LLM 預訓練 45T Token;多模態資料從一開始加入 避免把視覺僅當作後期提示詞介面卡
上下文訓練 從 64K 開始稀疏注意力;34T Token 時擴充套件到 1M 直接訓練部署時所用注意力模式,而非訓練後才轉換
後訓練 SFT、強化學習與 On-policy Distillation 對齊推理、工具和 Agent 行為

技術報告沒有把後訓練描述為新的演算法突破,而是把提升歸因於合成任務與環境、資料過濾、可驗證獎勵,以及架構和資料規模。比較“模型架構”時必須分清:CED 和 CSA2 主要解釋效率,最終 Agent 成績來自訓練、資料和 Scaffold 的整體組合。

推理 effort:質量提升有明確 Token 賬單

DeepSeek 內部提供 1 到 100 的連續 effort 標尺,公開 API 把 lowhighmax 分別對映為 50、75、100。相容輸入中,minimallow 會對映到 low;mediumhighxhigh 對映到 high;maxultra 對映到 max。思考模式預設使用 high。

在 DeepSeek 公佈的掃描結果中,effort 從 25 提高到 100 後,八項推理評測平均成績從 67.1% 升到 76.3%,DeepSWE 從 66.0% 升到 74.2%,Terminal-Bench 2.1 從 82.4% 升到 90.6%,輸出 Token 則增加約 2.5 倍。60–80 區間以不到最高檔一半的 Token 預算獲得了大部分質量;最後升到 100,會讓 Agent 軌跡增長 1.6–1.8 倍,而提升已經較小。

這是 V4.1 Flash 最實用的控制項之一。分類、抽取和可重試探索可從 low 開始;日常程式碼與研究用 high;只有當重試或遺漏邊界的代價高於額外 Token 時,才使用 max。以上只是起點,最終應測量每個驗收透過任務的成本。

思考模式中,temperature、presence penalty、frequency penalty 會被忽略,top_p 最低為 0.95。配合工具時,客戶端必須把上一條 Assistant 訊息的完整 reasoning_content 與工具結果一同傳回;遺漏會得到 400 錯誤。相比照搬熟悉的 OpenAI 參數,這條狀態規則更影響接入是否穩定。

與 OpenAI、Anthropic 的基準對比

下表摘錄自 DeepSeek 技術報告表 3,所有模型均使用報告中的 Max 檔位。DeepSeek 對部分評測使用了不同的指定或官方 Scaffold;程式碼任務使用 1M 上下文的 DeepSeek Harness,視覺 Agent 任務使用 512K 上下文的 Claude Code。這些是廠商報告證據,不是獨立橫評,也不是生產 SLA。

評測 V4 Flash V4 Pro V4.1 Flash GPT-5.6 Sol Claude Opus 5
GPQA Diamond,Pass@1 89.9 92.4 90.9 94.1 93.4
Terminal-Bench 2.1,Pass@1 82.7 87.9 90.6 88.8 89.1
Terminal-Bench 3.0,Pass@1 7.6 11.8 30.0 34.4 43.3
Terminal-Bench 4.0,Pass@1 7.0 12.4 31.2 39.9 51.8
DeepSWE v1.1,Resolved 54.4 62.7 74.2 73.0 74.0
CyberGym,Pass@1 76.7 83.3 88.1 84.5
HLE with tools,Pass@1 51.5 60.0 63.9 63.6
AutomationBench,Pass@1 37.7 43.2 54.8 45.8 50.3
Agents' Last Exam,Pass@1 25.2 25.7 31.8 26.7 28.6
Chartography with tools,Pass@1 78.9 79.9 84.0

最可靠的解讀應當具體到任務:V4.1 Flash 在 Agent 專案上相對 V4 Flash 提升明顯,並在 DeepSWE、Terminal-Bench 2.1、自動化和工具版 HLE 上與 GPT-5.6 Sol、Claude Opus 5 競爭;它沒有領先 GPQA、更新的 Terminal-Bench 3/4 或 Chartography。報告自身也提醒:常見任務接近,不代表最難推理和邊界情形已經達到前沿閉源模型水平。

分數表沒有加入 GPT-6 Astra 和 Claude Fable 5.1,因為 V4.1 報告沒有提供同一行、同一設定下的對應資料。把兩個供應商各自發布頁上的成績拼在一起,會製造不存在的統一 Harness。團隊應在相同倉庫任務、工具、超時、網路策略和驗收檢查下測試所有候選模型。

API 相容面很廣,但語義並不相同

官方服務同時提供 OpenAI Chat CompletionsOpenAI ResponsesAnthropic 相容 API。這能降低遷移成本,但“相容”描述的是請求形狀,不代表生命週期語義完全一致。

介面表面 DeepSeek V4.1 Flash 行為 遷移影響
Chat Completions 支援流式、JSON 輸出、函式呼叫;非思考模式支援 Prefix/FIM 現有 OpenAI 客戶端通常最容易從這裡開始
Responses 無狀態;支援函式與圖像 應用需要自行持久化完整會話
Responses 狀態欄位 不支援或忽略 previous_response_id、conversation、store、background、context management 返回 200 不證明這些功能真的生效
託管工具 忽略 Web Search、File Search、Code Interpreter、Computer Use、MCP 等內建工具;Custom Tool 支援有限 在應用側執行工具,並逐個驗證請求欄位
推理摘要 不支援 Summary 與加密推理內容 不要依賴 OpenAI 風格的推理交接欄位
Anthropic 格式 接受 Anthropic Messages 形狀 仍需保留 DeepSeek 的推理和工具狀態規則,不能假設等同 Claude
視覺輸入 使用者輸入與工具輸出都可包含圖像 必須檢查載荷大小、detail 模式和圖像數量

DeepSeek Responses 指南還列出 metadata、Prompt Template、truncation、service tier、safety identifier、Prompt Cache Key/Retention、stream options 等被忽略欄位。靜默忽略尤其危險:Schema 被接受,可能掩蓋功能並未執行。應用應該為每項依賴能力準備相容性請求。OpenAI 相容 API 指南解釋了為什麼端點形狀與能力驗證必須分開。

OpenAI 當前模型擁有更完整的原生 Responses 託管工具和狀態能力;Anthropic 原生 API 也有成熟的 Thinking Block 與工具契約。DeepSeek 的優勢是同一模型覆蓋三種常見介面方言,代價是它只覆蓋兩家原生功能的較小交集。

視覺限制與圖像成本

官方視覺指南支援透過 Base64、外部 URL 或 Files API 輸入 JPEG、PNG、GIF、WebP。圖像會自動向約 1,300×1,300 調整,每張圖最多使用 1,024 個輸入 Token。low detail 使用 512×512 檢視,highoriginal 保留更多細節,auto 當前等同 original。

限制項 官方數值
請求體 48 MiB
Base64 或外部 URL 圖像 每張 32 MiB
File ID 引用圖像 每張 64 MiB
單請求圖像數 600
圖像總位元組數 不使用 File ID 時 64 MiB;使用時 200 MiB
圖像長邊 8,192 px;傳送 15 張及以上時為 4,096 px
視覺 Token 上限 處理後每張最多 1,024 Token

若一張圖實際使用滿 1,024 個視覺 Token,並按公開輸入 Token 價格計費,其未快取輸入約為低峰 $0.0001536高峰 $0.0003072,尚未包含文字和輸出。這個算式適合做規模估算,實際費用仍會受到縮放、快取和視覺 Token 用量影響。圖像越多,也會擠佔原本可用於文字或工具歷史的上下文。

V4.1 Flash 適合文件截圖、圖表、OCR 和視覺 Agent 觀察,但它不是圖像生成模型。需要返回畫素時,應選擇專門的生圖模型和端點。

官方 API 價格全面對比

DeepSeek 價格頁的新價格自 9 月 10 日 04:00 UTC 生效。工作日高峰為 01:00–04:00 與 06:00–10:00 UTC;其他工作日時段和週末按低峰價。DeepSeek 上下文快取自動執行,因此“快取輸入”指賬單報告命中,不是一個可以強制命中的參數。

OpenAI 價格來自其當前模型對比頁,Anthropic 價格來自官方定價頁。單位均為 USD / 100 萬 Token。Anthropic 還會收取 Cache Write 費用;因為本表只比較新輸入、快取讀取和輸出,所以沒有列入寫入價格。

模型 上下文 / 最大輸出 新輸入或未命中 快取讀取 輸出
DeepSeek V4.1 Flash,低峰 1M / 384K $0.15 $0.003 $0.60
DeepSeek V4.1 Flash,高峰 1M / 384K $0.30 $0.006 $1.20
Modelflare 上的 DeepSeek V4.1 Flash 模型上限 1M / 384K $0.193548 $0.003871 $0.774194
GPT-5.6 Luna 1.05M / 128K $0.20 $0.02 $1.20
GPT-5.6 Terra 1.05M / 128K $2.00 $0.20 $12.00
GPT-5.6 Sol 1.05M / 128K $4.00 $0.40 $20.00
GPT-6 Astra 1.05M / 128K $10.00 $1.00 $50.00
Claude Sonnet 5 1M / 128K $2.00 $0.20 $10.00
Claude Opus 5 1M / 128K $5.00 $0.50 $25.00
Claude Fable 5.1 1M / 128K $10.00 $0.25 $50.00

價格不等於價值。不同分詞器處理同一文字可能產生不同 Token 數;Anthropic 也提示較新 Tokenizer 在部分工作負載中可能多產生約 30% Token。不同模型還可能需要不同輸出長度、重試和人工修復。正確指標是每個驗收透過任務的成本,而不是只尋找輸入單價最低的一行。

Modelflare 當前公開目錄只展示一檔價格,數值位於 DeepSeek 兩個時段之間:相當於第一方高峰價的約 64.5%,即高峰時低約 35.5%;相對 DeepSeek 低峰價則高約 29.0%。目前列出的閘道器費率沒有時間段調整;能夠穩定安排到 DeepSeek 低峰視窗的彈性任務,第一方 API 仍可能更便宜。

當輸入上下文超過 272K 時,OpenAI 會把整個請求切換到更高費率:輸入與快取輸入為 2 倍,輸出為 1.5 倍。下面的長上下文算例必須應用這個邊界。DeepSeek 使用時間視窗;所引 Anthropic 百萬上下文模型價格表沒有同樣的 272K 分檔。

兩個可復算的成本場景

場景 A 是一次包含 100K 未快取輸入與 10K 輸出的請求,公式為 0.1 × 輸入價 + 0.01 × 輸出價。它不含快取讀取、工具、重試、稅費或供應商附加專案。

模型 場景 A 費用
DeepSeek V4.1 Flash,低峰 $0.021
Modelflare 上的 DeepSeek V4.1 Flash $0.0271
GPT-5.6 Luna $0.032
DeepSeek V4.1 Flash,高峰 $0.042
Claude Sonnet 5 $0.300
GPT-5.6 Terra $0.320
GPT-5.6 Sol $0.600
Claude Opus 5 $0.750
GPT-6 Astra / Claude Fable 5.1 $1.500

場景 B 是一次已有熱快取請求的邊際費用:900K 快取輸入、100K 新輸入和 20K 輸出,刻意排除此前建立快取的請求。公式為 0.9 × 快取讀取價 + 0.1 × 輸入價 + 0.02 × 輸出價。輸入上下文總量為 100 萬 Token,因此 OpenAI 各行對整個請求應用長上下文倍率。

模型 場景 B 邊際費用
DeepSeek V4.1 Flash,低峰 $0.0297
Modelflare 上的 DeepSeek V4.1 Flash $0.0383
DeepSeek V4.1 Flash,高峰 $0.0594
GPT-5.6 Luna $0.1120
Claude Sonnet 5 $0.5800
GPT-5.6 Terra $1.1200
Claude Opus 5 $1.4500
GPT-5.6 Sol $2.1200
Claude Fable 5.1 $2.2250
GPT-6 Astra $5.3000

這些對比固定了 Token 數量,並不聲稱質量相同。DeepSeek 快取是盡力而為,Anthropic 建立快取則有單獨的寫入價格和有效期。公平測試應記錄快取命中/未命中 Token、全部嘗試、包含計費推理在內的總輸出、耗時、驗收率和人工修正分鐘數。用量成本追蹤指南提供了對應核算框架。

開放權重不代表自託管規模很小

Hugging Face 模型倉庫採用 MIT 許可證,並給出了 vLLM 與 SGLang 服務路徑。本文核驗的快照包含 48 個 Safetensor 分片,在 Commit dba1be0a40aa45a94ad051997016db3960a90277 下共有約 510.3 GB Git LFS 檔案。這個數字只是下載檔案快照,不是實測視訊記憶體佔用。

整個系統仍包括 552B 主幹、196B 主機定址 Engram 記憶、專家路由、FP4/FP8 快取路徑、RDMA 預取和持久 KV 儲存。DeepSeek 在釋出公告中邀請計劃使用 2,000 張 GPU 加儲存叢集做大規模部署的團隊與其聯絡。這個例子體現完整服務系統的規模,並不是所有部署的最低硬體要求。較小研究部署可以嘗試量化或其他並行方式,但不能從官方 API 低價反推出自託管也同樣簡單。

開放權重讓團隊獲得 Checkpoint 訪問權、可檢查性和部署策略控制權,卻不會自動復現 DeepSeek 的 Kernel Fusion、快取層級、DSpark 排程、Batching 或公開 API 延遲。自託管方案必須以實測吞吐、故障恢復、閒置容量、儲存頻寬和運維人力做完整比較。

DeepSeek V4.1 Flash 已在 Modelflare 上線

DeepSeek V4.1 Flash 目前已經在 Modelflare 上線。Owner 確認的釋出狀態,也能在 Modelflare 公開價格目錄和源站目錄交叉核驗。2026-09-10 15:21 UTC,兩個入口都已展示新的 deepseek-v4.1-flash-0910 記錄;生產配置同時顯示 deepseek-stable Ability 已啟用,且啟用路由明確公佈同一個模型。

Modelflare 專案 當前上線值
請求使用的模型 ID deepseek-v4.1-flash-0910
可用狀態 已進入公開目錄並啟用生產路由分組
公開分組 deepseek-stable
輸入價 $0.193548 / 100 萬 Token
快取輸入價 $0.003871 / 100 萬 Token
輸出價 $0.774194 / 100 萬 Token
端點型別 /v1/chat/completions/v1/responses

這些價格由實時條目的 $0.322580645 基礎輸入係數、0.6 公開分組倍率、0.02 快取倍率和 4 倍輸出倍率推導。代入上面兩個工作負載,Modelflare 費用分別約為 $0.0271$0.0383。當前模型 ID 和費率以實時 DeepSeek V4.1 Flash 價格頁為準。

證據層級仍需分開。公開目錄和啟用的生產路由足以確認產品已經上線,Owner 也已明確確認。截至 15:30 UTC,生產記錄中已有 6 次使用精確新 ID 的 Chat Completions 完成呼叫,合計 216 個輸入 Token、173 個輸出 Token。這證明鑑權後的 Chat Completions 能完成分發併產生計費用量,但首發樣本仍不足以測量延遲或可用率,也不能單獨證明該路由的 Responses 與多模態行為。團隊遷移自己的生產負載前,仍應在精確端點執行小型驗收請求。

DeepSeek V4.1 Flash 真正佔優的場景

當長輸入、頻繁工具輪次和預算同時重要時,V4.1 Flash 的優勢最連貫:架構降低預填充與快取壓力,API 價格把這些節省變成極低公開費率,384K 輸出上限為長補丁和報告保留空間,開放 Checkpoint 又留下自託管路徑。

工作負載 V4.1 Flash 為什麼值得測試 應測量什麼
程式碼倉庫 Agent 廠商公佈的 DeepSWE 與終端成績強,Token 價格低 驗收透過修改、測試透過率、重試和修復時間
長篇研究綜合 1M 輸入、低價快取命中、384K 輸出 引用準確度、要求保留度和總輸出量
視覺文件 Agent 原生圖像輸入、OCR/圖表訓練、常見 Agent API 欄位準確度、裁剪/detail 敏感性、視覺 Token 用量
高併發自動化 高峰與低峰價格都低;併發上限 2,500 請求 排隊時間、429 比例、工具失敗和每成功任務成本
可控部署 MIT Checkpoint 與已記錄的 vLLM/SGLang 路徑 硬體利用率、快取/儲存頻寬和運維成本

因此最可信的生產定位是高成本效率的長上下文 Agent,而不是“全領域最強模型”。如果它一次就完成並透過驗收,而更小的便宜模型需要多輪修復,V4.1 的結果成本更低;如果前沿閉源模型能阻止一次昂貴失敗,更高 Token 價格仍可能更經濟。

什麼時候 OpenAI 或 Anthropic 更穩妥

當應用依賴完整 Responses 生態、託管狀態、內建工具,或某項會被 DeepSeek 忽略的 OpenAI 專屬契約時,應選擇 OpenAI 模型。GPT-5.6 Luna 是短且未快取工作負載中價格最接近的競爭者;Terra、Sol、Astra 用更高公開價格提供不同能力層級與原生平臺功能。

當 Claude 原生工具/思考契約、快取控制,或團隊在最難 Agent 工作上的實測結果比 Token 標價更重要時,應選擇 Anthropic。在 DeepSeek 自己的表格中,Claude Opus 5 領先 Terminal-Bench 3/4 和 Chartography;Claude Fable 5.1 定位於最難長程工作,但新輸入和輸出單價都明顯更高。

涉及安全關鍵或高成本動作時,應根據已評估的失敗模式與許可權邊界選擇路由,不能依據品牌或平均基準。路由指南說明如何區分可重試任務、Fallback 和帶副作用的動作。

生產接入檢查清單

  1. 第一方 API 使用 deepseek-flash,閘道器自有對映另行記錄。
  2. 先以 high 建立基線,再在同一組驗收任務上測 low 和 max;不要把不同供應商同名檔位當成相同算力。
  3. 思考模式呼叫工具時,按要求完整回傳 reasoning_content
  4. 審計所有依賴的 Responses 欄位;被拒絕和被靜默忽略需要不同處理。
  5. 記錄快取命中/未命中、輸出/推理 Token、重試、延遲和最終驗收結果。
  6. 用實測命中率設計快取經濟模型,不依賴固定保留時間假設。
  7. 傳送多模態請求前,限制圖像位元組、數量、尺寸與 detail 模式。
  8. 應用側授權、工具冪等和輸出校驗應獨立於模型能力。
  9. 上線前重新核對時間段價格、模型別名和併發上限。
  10. 在精確目標路由發起真實鑑權請求;模型目錄或 HTTP 200 本身不是能力證明。

常見問題

DeepSeek V4.1 Flash 比 GPT-6 Astra 或 Claude Fable 5.1 強嗎? 不能做全域性結論。V4.1 Flash 在價格和開放權重上優勢巨大,廠商公佈的 Agent 成績也很強;DeepSeek 自己承認,最大型閉源模型在最難推理和邊界情形仍然領先。V4.1 報告中也沒有同一 Harness 下的 Astra/Fable 對比。

DeepSeek V4.1 Flash 到底有多少參數? 報告列出 552B 主幹參數和 196B Engram 參數。預填充每 Token 約啟用 8B 主幹參數,解碼每 Token 約啟用 16B。只說“總計 552B”會漏掉 Engram;說“啟用 748B”同樣錯誤。

上下文和輸出上限是多少? 官方上限為 100 萬上下文 Token、最高 384K 輸出 Token。圖像嵌入、文字、工具歷史與推理都會佔用相應預算。

為什麼叫 Flash? 設計重點是降低服務成本:預填充/解碼不對稱啟用、壓縮稀疏注意力、FP4 全域性 KV、有限持久重放和推測解碼。“Flash”並不承諾任何提示詞和排隊狀態下延遲都最低。

公開快取會保留 72 小時嗎? 不應這樣假設。技術報告描述的部署架構至少保留 72 小時;公開 API 文件只承諾自動、盡力而為,並稱條目通常在數小時到數天後清理。

Responses API 可以完全無改動替換 OpenAI 嗎? 不能。基本請求、函式與圖像可用,但它是無狀態介面,多個狀態欄位、託管工具和推理摘要不受支援或會被忽略。必須針對所依賴功能逐項驗證。

它可以生成圖像嗎? 它能理解圖像輸入並返回文字,但不是圖像生成模型。

Modelflare 已經提供 DeepSeek V4.1 Flash 了嗎? 已經提供。請在 deepseek-stable 分組使用 deepseek-v4.1-flash-0910,支援 Chat Completions 與 Responses。它是 Modelflare 的版本化 ID,與 DeepSeek 第一方 deepseek-flash 屬於不同服務契約。

來源、方法與更新記錄

本文優先使用 DeepSeek 釋出公告技術報告API 價格思考模式ResponsesAnthropic 相容介面視覺指南快取指南。對比價格來自 OpenAI 官方模型頁Anthropic 官方定價頁。Modelflare 狀態來自公開價格目錄

基準表是 DeepSeek 廠商報告,不是 Modelflare 獨立測試;價格場景是可復算數學比較,不代表質量等價或真實賬單。本文沒有把不同供應商、不同 Harness 的分數強行拼接。無文字主圖是 AI 生成的原創編輯插圖,不是模型能力樣張。

2026-09-10 更新: 首次釋出日調研,記錄第一方模型 ID、已生效的峰谷價格、9 月 14 日別名遷移公告、當前 API 限制、技術報告架構與基準。同日後續更新補充 Modelflare 已用 deepseek-v4.1-flash-0910 上線、實時閘道器價格和兩組閘道器成本。實施前應重新核驗所有可能變化的資訊。