DeepSeek V4.1 Flash 深度分析:架構、Modelflare 價格及與 OpenAI、Anthropic 的對比
基於一手資料拆解 DeepSeek V4.1 Flash 的架構、1M 上下文、384K 輸出、Agent 基準與 API 限制,並比較 OpenAI、Anthropic 模型及當前 Modelflare 上線狀態和價格。

DeepSeek V4.1 Flash 是一款面向長程 Agent 的低成本、開放權重、多模態模型。它於 2026 年 9 月 10 日釋出,擁有 100 萬 Token 上下文、最高 384K Token 輸出、極低的官方 API 價格,以及同時降低提示詞處理量與 KV Cache 壓力的架構。它最明確的優勢並非贏下所有基準,而是能以很低的單位成本處理長上下文 Agent 任務,同時在程式碼、終端、自動化和工具呼叫評測中保持競爭力。
這個結論有清晰邊界。下文的基準數字由 DeepSeek 釋出,Modelflare 沒有進行獨立複測。DeepSeek 自己也在報告中承認:面對最困難的推理和邊界問題,V4.1 Flash 與最大型閉源模型之間仍有差距。DeepSeek 第一方 API 的正確模型 ID 是 deepseek-flash。DeepSeek V4.1 Flash 目前已經在 Modelflare 上線,版本化模型 ID 為 deepseek-v4.1-flash-0910,可在公開 deepseek-stable 分組使用 Chat Completions 與 Responses。
最後核驗:2026-09-10 UTC。價格、別名和目錄狀態都可能變化。
直接結論:DeepSeek V4.1 Flash 是什麼
DeepSeek 釋出公告將 DeepSeek V4.1 Flash 定義為此前 Flash 產品線的生產替代型號,官方端點使用 deepseek-flash。舊名稱 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 暫時仍可在 DeepSeek API 中使用,並會按 Flash 價格路由到 V4.1 Flash。DeepSeek 還宣佈,從 2026 年 9 月 14 日 04:00 UTC 起,deepseek-v4-pro 請求也會暫時路由到 V4.1 Flash,直至後續 V4.1 Pro 釋出。
這項遷移策略只屬於 DeepSeek 自有 API。Modelflare 使用明確標記釋出日期的 deepseek-v4.1-flash-0910,沒有把此前的 deepseek-v4-flash 條目靜默改名。Modelflare Owner 已確認上線,公網與源站價格目錄也在 2026-09-10 15:21 UTC 同時出現新模型。客戶端應使用各自服務商展示的精確 ID,不能假設第一方別名會在所有閘道器中原樣生效。
這款模型的實際身份由五部分組成:圖像與文字輸入、文字輸出、552B 參數的 MoE 主幹、額外 196B 參數的 Engram 條件記憶,以及提示詞預填充每 Token 啟用 8B 參數、解碼每 Token 啟用 16B 參數的不對稱計算。最後一點最關鍵:對輸入很長、頻繁重新預填充的 Agent,它應當比同等規模的對稱 Decoder-only 路徑消耗更少預填充算力。
核心規格一覽
下列資料來自官方釋出公告、模型卡和技術報告。“主幹參數”和“Engram 參數”描述兩類不同儲存,也都不等於每個 Token 的實際啟用計算量。
| 專案 | DeepSeek V4.1 Flash |
|---|---|
| 官方 API ID | deepseek-flash |
| Modelflare 模型 ID | deepseek-v4.1-flash-0910 |
| 模型型別 | 多模態混合專家 Transformer |
| 輸入 / 輸出 | 文字與圖像輸入;文字輸出 |
| Transformer 結構 | 40 層:20 層因果編碼器 + 20 層解碼器 |
| 參數儲存 | 552B 主幹 + 196B Engram 條件記憶 |
| 啟用參數 | 預填充每 Token 8B;解碼每 Token 16B |
| 上下文 / 最大輸出 | 1M / 384K Token |
| 預訓練 | 45T 多模態語料 Token;純文字與多模態 Token 比例 7:1 |
| 主要注意力與快取設計 | CED + CSA2 + FP4 全域性 KV;FP8 區域性 SWA KV |
| 全域性 KV 佔用 | DeepSeek 報告為每 Token 890 位元組 |
| 公開推理檔位 | low = 50、high = 75、max = 100,對應內部 effort 標尺 |
| 官方 API 併發上限 | 2,500 個併發請求 |
| 許可證 | MIT 模型權重許可證 |
384K 的輸出上限是本文所列當前 OpenAI、Anthropic 對比模型 128K 上限的三倍。上限並不等於建議用量:超長輸出會增加延遲、費用和內容漂移的空間。對長程 Agent,更有意義的問題是經過多次工具呼叫後,模型能否保留要求並透過真實驗收。
為什麼這套架構適合長程 Agent
工具型 Agent 會不斷把觀察、命令結果和修改加入歷史。每一輪都可能再次執行提示詞預填充、在不斷增長的上下文上做注意力計算、儲存 KV,並生成新輸出。DeepSeek V4.1 Flash 分別處理這些成本,而不是只依靠縮小模型。
| Agent 成本 | V4.1 Flash 機制 | 預期效果 |
|---|---|---|
| 重複處理長提示詞 | Causal Encoder-Decoder(CED) | 按 DeepSeek 分析,長序列的漸近預填充工作量接近減半 |
| 在 HBM 儲存全域性歷史 | CSA2 跨層複用 + FP4 | 減少重複全域性 KV 條目及單條目位元組數 |
| 持久儲存區域性注意力狀態 | SWA Bounded Replay | 重建有限區域性視窗,避免儲存每層完整區域性快取 |
| 記憶穩定 Token 模式 | Engram | 把條件式 n-gram 記憶放入稀疏訪問表 |
| 生成 Token | DSpark 推測解碼 | 並行草擬多個位置,並依據置信度和系統負載決定驗證長度 |
| 理解圖像 | DeepSeek-ViT + 投影器 | 把視覺輸入轉成從預訓練階段就與文字共同處理的嵌入 |
這些機制主要改善服務成本和吞吐,並不會自動證明推理更強。模型質量還取決於資料、後訓練、Agent 框架和實際購買的推理 effort。
CED:先減少預填充計算,再談快取
技術報告把 40 層 Transformer 拆成 20 層因果編碼器和 20 層解碼器。前兩層只使用 128 Token 滑動視窗,其他層把區域性滑動視窗注意力與壓縮後的全域性上下文結合起來。
在全域性注意力路徑上,解碼器不會在每一層都獨立構建完整 KV 歷史,而是從編碼器最終隱藏狀態投影全域性 Key 和 Value;區域性滑動視窗狀態仍然按層保留。DeepSeek 估算,長序列預填充的主導計算項因此從所有 Token 經過全部 L 層,變為全域性上下文主要經過約 L/2 層,再加上受視窗大小限制的區域性計算,整體接近減半。
這也解釋了 8B/16B 的啟用差異:提示詞 Token 在預填充階段約啟用 8B 主幹參數,新生成 Token 在解碼階段約啟用 16B。超長文件、短答案的任務獲益更大;輸出數十萬 Token 的任務仍然要支付完整解碼成本。CED 降低的是賬單前半段,不會讓生成免費。
CSA2、FP4 與 SWA Bounded Replay:快取到底省在哪裡
Compressed Sparse Attention 2 同時沿序列、層和精度三個維度壓縮快取。每個 CSA2 層會靜態分配為三種模式之一。Full 計算主 KV、Indexer Key 和新的 Top-K 位置;Reindex 複用主 KV 與 Indexer Key,但使用自己的 Query 重新評分;Reuse 同時複用共享 KV 和此前選出的稀疏位置。每一層仍保留自己的 Query 與區域性滑動視窗 KV。
解碼器第一個 Full 層選擇 Top-512 條目並建立候選池,後續 Reindex 層再從縮小後的池中選擇各自的 Top-512。全域性主 KV 使用約四位的 E2M1 表示,每 16 個通道配置一個 E4M3 Scale;對量化更敏感的區域性 SWA Cache 則繼續使用 FP8。
| 快取層 | 精度 / 生命週期 | 報告結果 | 不代表什麼 |
|---|---|---|---|
| 執行時全域性 KV | FP4,駐留 HBM | 每 Token 890 位元組;約為 V4 Flash 的 1/4,比 V1 小約 437 倍 | 所有邊界輸入都能完美選中稀疏位置 |
| 執行時區域性 SWA KV | FP8 | 保留每層 128 Token 區域性視窗 | 任意併發下都可忽略記憶體佔用 |
| 持久全域性 KV | DeepSeek 部署設計中的主機記憶體或 SSD | 可複用的長生命週期全域性狀態 | 公開 API 承諾固定保留時間 |
| 持久區域性 SWA 狀態 | 透過 Bounded Replay 重建 | 相同序列長度下,總持久快取約為 V4 Flash 的 1/8 | 被丟棄區域性狀態可以完全無損還原 |
報告描述的部署系統會讓全域性持久 KV 至少儲存 72 小時,並使用分散式短生命週期 SWA Pool;但公開上下文快取指南稱快取建立是自動且盡力而為,構建可能需要數秒,條目通常會在數小時到數天後清除。生產客戶端應以公開契約為準,透過命中和未命中 Token 欄位做預算,不要把 72 小時當成 API 保證。
DeepSeek 也明確指出兩個魯棒性邊界:CSA2 可能選錯稀疏位置,Bounded Replay 對被移除的區域性狀態只做近似重建。已有評測未發現系統性退化,但極端上下文與快取恢復邊界仍需繼續壓力測試。
Engram、DSpark 與多模態路徑
Engram 把一部分記憶能力從密集模型計算中拆出。V4.1 Flash 在從零計數的第 1 層和第 14 層放置兩個條件記憶模組,總計 196B 參數。每個模組使用長度為二、三、四的 Token n-gram、八個雜湊頭、上下文門控,以及透過 RDMA 從主機記憶體預取。它們是儲存參數,並不是每個 Token 都會額外啟用 196B 參數。
DSpark 是單獨訓練的推測解碼器。三個 Transformer Block 檢視 128 Token 滑動視窗,並在一次前向過程中並行提出五個位置。輕量依賴頭刻畫草稿 Token 之間的關係,置信度頭估計草稿字首透過驗證的機率;排程器再結合這些機率與實測引擎吞吐,在當前負載下選擇驗證長度。這樣可以提升系統 Token 吞吐,同時仍由主幹模型完成最終驗證。
視覺路徑使用單獨訓練的 DeepSeek-ViT 和二維旋轉位置編碼。3×3 Pixel Unshuffle 會在進入語言模型前把視覺 Token 數量縮小九倍。報告配置中的視覺編碼器有 32 層、1,024 隱藏維度和 16 個注意力頭。在較早的約 47B 圖文對比學習之後,其自迴歸訓練階段會把圖像縮放到 544×544 至 1,344×1,344 範圍。
預訓練與後訓練
DeepSeek 報告了 45T 預訓練 Token,多模態資料從語言模型預訓練階段就被納入。純文字和多模態流水線在去重與重疊替換後,以 7:1 Token 比例合併。稀疏注意力從 64K 序列長度直接開始訓練,沒有先做密集註意力熱身;到 34T Token 時再把上下文擴充套件到 1M。
| 階段 | 已公開細節 | 意義 |
|---|---|---|
| 視覺對比預訓練 | 約 47B 圖文對,低解析度階段 | 在語言整合前學習廣泛視覺表示 |
| 視覺自迴歸微調 | 236B Token,包含描述、圖表、OCR 等資料 | 加強細粒度視覺與文件理解 |
| LLM 預訓練 | 45T Token;多模態資料從一開始加入 | 避免把視覺僅當作後期提示詞介面卡 |
| 上下文訓練 | 從 64K 開始稀疏注意力;34T Token 時擴充套件到 1M | 直接訓練部署時所用注意力模式,而非訓練後才轉換 |
| 後訓練 | SFT、強化學習與 On-policy Distillation | 對齊推理、工具和 Agent 行為 |
技術報告沒有把後訓練描述為新的演算法突破,而是把提升歸因於合成任務與環境、資料過濾、可驗證獎勵,以及架構和資料規模。比較“模型架構”時必須分清:CED 和 CSA2 主要解釋效率,最終 Agent 成績來自訓練、資料和 Scaffold 的整體組合。
推理 effort:質量提升有明確 Token 賬單
DeepSeek 內部提供 1 到 100 的連續 effort 標尺,公開 API 把 low、high、max 分別對映為 50、75、100。相容輸入中,minimal 與 low 會對映到 low;medium、high、xhigh 對映到 high;max、ultra 對映到 max。思考模式預設使用 high。
在 DeepSeek 公佈的掃描結果中,effort 從 25 提高到 100 後,八項推理評測平均成績從 67.1% 升到 76.3%,DeepSWE 從 66.0% 升到 74.2%,Terminal-Bench 2.1 從 82.4% 升到 90.6%,輸出 Token 則增加約 2.5 倍。60–80 區間以不到最高檔一半的 Token 預算獲得了大部分質量;最後升到 100,會讓 Agent 軌跡增長 1.6–1.8 倍,而提升已經較小。
這是 V4.1 Flash 最實用的控制項之一。分類、抽取和可重試探索可從 low 開始;日常程式碼與研究用 high;只有當重試或遺漏邊界的代價高於額外 Token 時,才使用 max。以上只是起點,最終應測量每個驗收透過任務的成本。
在思考模式中,temperature、presence penalty、frequency penalty 會被忽略,top_p 最低為 0.95。配合工具時,客戶端必須把上一條 Assistant 訊息的完整 reasoning_content 與工具結果一同傳回;遺漏會得到 400 錯誤。相比照搬熟悉的 OpenAI 參數,這條狀態規則更影響接入是否穩定。
與 OpenAI、Anthropic 的基準對比
下表摘錄自 DeepSeek 技術報告表 3,所有模型均使用報告中的 Max 檔位。DeepSeek 對部分評測使用了不同的指定或官方 Scaffold;程式碼任務使用 1M 上下文的 DeepSeek Harness,視覺 Agent 任務使用 512K 上下文的 Claude Code。這些是廠商報告證據,不是獨立橫評,也不是生產 SLA。
| 評測 | V4 Flash | V4 Pro | V4.1 Flash | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|---|
| GPQA Diamond,Pass@1 | 89.9 | 92.4 | 90.9 | 94.1 | 93.4 |
| Terminal-Bench 2.1,Pass@1 | 82.7 | 87.9 | 90.6 | 88.8 | 89.1 |
| Terminal-Bench 3.0,Pass@1 | 7.6 | 11.8 | 30.0 | 34.4 | 43.3 |
| Terminal-Bench 4.0,Pass@1 | 7.0 | 12.4 | 31.2 | 39.9 | 51.8 |
| DeepSWE v1.1,Resolved | 54.4 | 62.7 | 74.2 | 73.0 | 74.0 |
| CyberGym,Pass@1 | 76.7 | 83.3 | 88.1 | 84.5 | — |
| HLE with tools,Pass@1 | 51.5 | 60.0 | 63.9 | — | 63.6 |
| AutomationBench,Pass@1 | 37.7 | 43.2 | 54.8 | 45.8 | 50.3 |
| Agents' Last Exam,Pass@1 | 25.2 | 25.7 | 31.8 | 26.7 | 28.6 |
| Chartography with tools,Pass@1 | — | — | 78.9 | 79.9 | 84.0 |
最可靠的解讀應當具體到任務:V4.1 Flash 在 Agent 專案上相對 V4 Flash 提升明顯,並在 DeepSWE、Terminal-Bench 2.1、自動化和工具版 HLE 上與 GPT-5.6 Sol、Claude Opus 5 競爭;它沒有領先 GPQA、更新的 Terminal-Bench 3/4 或 Chartography。報告自身也提醒:常見任務接近,不代表最難推理和邊界情形已經達到前沿閉源模型水平。
分數表沒有加入 GPT-6 Astra 和 Claude Fable 5.1,因為 V4.1 報告沒有提供同一行、同一設定下的對應資料。把兩個供應商各自發布頁上的成績拼在一起,會製造不存在的統一 Harness。團隊應在相同倉庫任務、工具、超時、網路策略和驗收檢查下測試所有候選模型。
API 相容面很廣,但語義並不相同
官方服務同時提供 OpenAI Chat Completions、OpenAI Responses和 Anthropic 相容 API。這能降低遷移成本,但“相容”描述的是請求形狀,不代表生命週期語義完全一致。
| 介面表面 | DeepSeek V4.1 Flash 行為 | 遷移影響 |
|---|---|---|
| Chat Completions | 支援流式、JSON 輸出、函式呼叫;非思考模式支援 Prefix/FIM | 現有 OpenAI 客戶端通常最容易從這裡開始 |
| Responses | 無狀態;支援函式與圖像 | 應用需要自行持久化完整會話 |
| Responses 狀態欄位 | 不支援或忽略 previous_response_id、conversation、store、background、context management |
返回 200 不證明這些功能真的生效 |
| 託管工具 | 忽略 Web Search、File Search、Code Interpreter、Computer Use、MCP 等內建工具;Custom Tool 支援有限 | 在應用側執行工具,並逐個驗證請求欄位 |
| 推理摘要 | 不支援 Summary 與加密推理內容 | 不要依賴 OpenAI 風格的推理交接欄位 |
| Anthropic 格式 | 接受 Anthropic Messages 形狀 | 仍需保留 DeepSeek 的推理和工具狀態規則,不能假設等同 Claude |
| 視覺輸入 | 使用者輸入與工具輸出都可包含圖像 | 必須檢查載荷大小、detail 模式和圖像數量 |
DeepSeek Responses 指南還列出 metadata、Prompt Template、truncation、service tier、safety identifier、Prompt Cache Key/Retention、stream options 等被忽略欄位。靜默忽略尤其危險:Schema 被接受,可能掩蓋功能並未執行。應用應該為每項依賴能力準備相容性請求。OpenAI 相容 API 指南解釋了為什麼端點形狀與能力驗證必須分開。
OpenAI 當前模型擁有更完整的原生 Responses 託管工具和狀態能力;Anthropic 原生 API 也有成熟的 Thinking Block 與工具契約。DeepSeek 的優勢是同一模型覆蓋三種常見介面方言,代價是它只覆蓋兩家原生功能的較小交集。
視覺限制與圖像成本
官方視覺指南支援透過 Base64、外部 URL 或 Files API 輸入 JPEG、PNG、GIF、WebP。圖像會自動向約 1,300×1,300 調整,每張圖最多使用 1,024 個輸入 Token。low detail 使用 512×512 檢視,high 與 original 保留更多細節,auto 當前等同 original。
| 限制項 | 官方數值 |
|---|---|
| 請求體 | 48 MiB |
| Base64 或外部 URL 圖像 | 每張 32 MiB |
| File ID 引用圖像 | 每張 64 MiB |
| 單請求圖像數 | 600 |
| 圖像總位元組數 | 不使用 File ID 時 64 MiB;使用時 200 MiB |
| 圖像長邊 | 8,192 px;傳送 15 張及以上時為 4,096 px |
| 視覺 Token 上限 | 處理後每張最多 1,024 Token |
若一張圖實際使用滿 1,024 個視覺 Token,並按公開輸入 Token 價格計費,其未快取輸入約為低峰 $0.0001536 或高峰 $0.0003072,尚未包含文字和輸出。這個算式適合做規模估算,實際費用仍會受到縮放、快取和視覺 Token 用量影響。圖像越多,也會擠佔原本可用於文字或工具歷史的上下文。
V4.1 Flash 適合文件截圖、圖表、OCR 和視覺 Agent 觀察,但它不是圖像生成模型。需要返回畫素時,應選擇專門的生圖模型和端點。
官方 API 價格全面對比
DeepSeek 價格頁的新價格自 9 月 10 日 04:00 UTC 生效。工作日高峰為 01:00–04:00 與 06:00–10:00 UTC;其他工作日時段和週末按低峰價。DeepSeek 上下文快取自動執行,因此“快取輸入”指賬單報告命中,不是一個可以強制命中的參數。
OpenAI 價格來自其當前模型對比頁,Anthropic 價格來自官方定價頁。單位均為 USD / 100 萬 Token。Anthropic 還會收取 Cache Write 費用;因為本表只比較新輸入、快取讀取和輸出,所以沒有列入寫入價格。
| 模型 | 上下文 / 最大輸出 | 新輸入或未命中 | 快取讀取 | 輸出 |
|---|---|---|---|---|
| DeepSeek V4.1 Flash,低峰 | 1M / 384K | $0.15 | $0.003 | $0.60 |
| DeepSeek V4.1 Flash,高峰 | 1M / 384K | $0.30 | $0.006 | $1.20 |
| Modelflare 上的 DeepSeek V4.1 Flash | 模型上限 1M / 384K | $0.193548 | $0.003871 | $0.774194 |
| GPT-5.6 Luna | 1.05M / 128K | $0.20 | $0.02 | $1.20 |
| GPT-5.6 Terra | 1.05M / 128K | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Sol | 1.05M / 128K | $4.00 | $0.40 | $20.00 |
| GPT-6 Astra | 1.05M / 128K | $10.00 | $1.00 | $50.00 |
| Claude Sonnet 5 | 1M / 128K | $2.00 | $0.20 | $10.00 |
| Claude Opus 5 | 1M / 128K | $5.00 | $0.50 | $25.00 |
| Claude Fable 5.1 | 1M / 128K | $10.00 | $0.25 | $50.00 |
價格不等於價值。不同分詞器處理同一文字可能產生不同 Token 數;Anthropic 也提示較新 Tokenizer 在部分工作負載中可能多產生約 30% Token。不同模型還可能需要不同輸出長度、重試和人工修復。正確指標是每個驗收透過任務的成本,而不是只尋找輸入單價最低的一行。
Modelflare 當前公開目錄只展示一檔價格,數值位於 DeepSeek 兩個時段之間:相當於第一方高峰價的約 64.5%,即高峰時低約 35.5%;相對 DeepSeek 低峰價則高約 29.0%。目前列出的閘道器費率沒有時間段調整;能夠穩定安排到 DeepSeek 低峰視窗的彈性任務,第一方 API 仍可能更便宜。
當輸入上下文超過 272K 時,OpenAI 會把整個請求切換到更高費率:輸入與快取輸入為 2 倍,輸出為 1.5 倍。下面的長上下文算例必須應用這個邊界。DeepSeek 使用時間視窗;所引 Anthropic 百萬上下文模型價格表沒有同樣的 272K 分檔。
兩個可復算的成本場景
場景 A 是一次包含 100K 未快取輸入與 10K 輸出的請求,公式為 0.1 × 輸入價 + 0.01 × 輸出價。它不含快取讀取、工具、重試、稅費或供應商附加專案。
| 模型 | 場景 A 費用 |
|---|---|
| DeepSeek V4.1 Flash,低峰 | $0.021 |
| Modelflare 上的 DeepSeek V4.1 Flash | $0.0271 |
| GPT-5.6 Luna | $0.032 |
| DeepSeek V4.1 Flash,高峰 | $0.042 |
| Claude Sonnet 5 | $0.300 |
| GPT-5.6 Terra | $0.320 |
| GPT-5.6 Sol | $0.600 |
| Claude Opus 5 | $0.750 |
| GPT-6 Astra / Claude Fable 5.1 | $1.500 |
場景 B 是一次已有熱快取請求的邊際費用:900K 快取輸入、100K 新輸入和 20K 輸出,刻意排除此前建立快取的請求。公式為 0.9 × 快取讀取價 + 0.1 × 輸入價 + 0.02 × 輸出價。輸入上下文總量為 100 萬 Token,因此 OpenAI 各行對整個請求應用長上下文倍率。
| 模型 | 場景 B 邊際費用 |
|---|---|
| DeepSeek V4.1 Flash,低峰 | $0.0297 |
| Modelflare 上的 DeepSeek V4.1 Flash | $0.0383 |
| DeepSeek V4.1 Flash,高峰 | $0.0594 |
| GPT-5.6 Luna | $0.1120 |
| Claude Sonnet 5 | $0.5800 |
| GPT-5.6 Terra | $1.1200 |
| Claude Opus 5 | $1.4500 |
| GPT-5.6 Sol | $2.1200 |
| Claude Fable 5.1 | $2.2250 |
| GPT-6 Astra | $5.3000 |
這些對比固定了 Token 數量,並不聲稱質量相同。DeepSeek 快取是盡力而為,Anthropic 建立快取則有單獨的寫入價格和有效期。公平測試應記錄快取命中/未命中 Token、全部嘗試、包含計費推理在內的總輸出、耗時、驗收率和人工修正分鐘數。用量成本追蹤指南提供了對應核算框架。
開放權重不代表自託管規模很小
Hugging Face 模型倉庫採用 MIT 許可證,並給出了 vLLM 與 SGLang 服務路徑。本文核驗的快照包含 48 個 Safetensor 分片,在 Commit dba1be0a40aa45a94ad051997016db3960a90277 下共有約 510.3 GB Git LFS 檔案。這個數字只是下載檔案快照,不是實測視訊記憶體佔用。
整個系統仍包括 552B 主幹、196B 主機定址 Engram 記憶、專家路由、FP4/FP8 快取路徑、RDMA 預取和持久 KV 儲存。DeepSeek 在釋出公告中邀請計劃使用 2,000 張 GPU 加儲存叢集做大規模部署的團隊與其聯絡。這個例子體現完整服務系統的規模,並不是所有部署的最低硬體要求。較小研究部署可以嘗試量化或其他並行方式,但不能從官方 API 低價反推出自託管也同樣簡單。
開放權重讓團隊獲得 Checkpoint 訪問權、可檢查性和部署策略控制權,卻不會自動復現 DeepSeek 的 Kernel Fusion、快取層級、DSpark 排程、Batching 或公開 API 延遲。自託管方案必須以實測吞吐、故障恢復、閒置容量、儲存頻寬和運維人力做完整比較。
DeepSeek V4.1 Flash 已在 Modelflare 上線
DeepSeek V4.1 Flash 目前已經在 Modelflare 上線。Owner 確認的釋出狀態,也能在 Modelflare 公開價格目錄和源站目錄交叉核驗。2026-09-10 15:21 UTC,兩個入口都已展示新的 deepseek-v4.1-flash-0910 記錄;生產配置同時顯示 deepseek-stable Ability 已啟用,且啟用路由明確公佈同一個模型。
| Modelflare 專案 | 當前上線值 |
|---|---|
| 請求使用的模型 ID | deepseek-v4.1-flash-0910 |
| 可用狀態 | 已進入公開目錄並啟用生產路由分組 |
| 公開分組 | deepseek-stable |
| 輸入價 | $0.193548 / 100 萬 Token |
| 快取輸入價 | $0.003871 / 100 萬 Token |
| 輸出價 | $0.774194 / 100 萬 Token |
| 端點型別 | /v1/chat/completions 與 /v1/responses |
這些價格由實時條目的 $0.322580645 基礎輸入係數、0.6 公開分組倍率、0.02 快取倍率和 4 倍輸出倍率推導。代入上面兩個工作負載,Modelflare 費用分別約為 $0.0271 與 $0.0383。當前模型 ID 和費率以實時 DeepSeek V4.1 Flash 價格頁為準。
證據層級仍需分開。公開目錄和啟用的生產路由足以確認產品已經上線,Owner 也已明確確認。截至 15:30 UTC,生產記錄中已有 6 次使用精確新 ID 的 Chat Completions 完成呼叫,合計 216 個輸入 Token、173 個輸出 Token。這證明鑑權後的 Chat Completions 能完成分發併產生計費用量,但首發樣本仍不足以測量延遲或可用率,也不能單獨證明該路由的 Responses 與多模態行為。團隊遷移自己的生產負載前,仍應在精確端點執行小型驗收請求。
DeepSeek V4.1 Flash 真正佔優的場景
當長輸入、頻繁工具輪次和預算同時重要時,V4.1 Flash 的優勢最連貫:架構降低預填充與快取壓力,API 價格把這些節省變成極低公開費率,384K 輸出上限為長補丁和報告保留空間,開放 Checkpoint 又留下自託管路徑。
| 工作負載 | V4.1 Flash 為什麼值得測試 | 應測量什麼 |
|---|---|---|
| 程式碼倉庫 Agent | 廠商公佈的 DeepSWE 與終端成績強,Token 價格低 | 驗收透過修改、測試透過率、重試和修復時間 |
| 長篇研究綜合 | 1M 輸入、低價快取命中、384K 輸出 | 引用準確度、要求保留度和總輸出量 |
| 視覺文件 Agent | 原生圖像輸入、OCR/圖表訓練、常見 Agent API | 欄位準確度、裁剪/detail 敏感性、視覺 Token 用量 |
| 高併發自動化 | 高峰與低峰價格都低;併發上限 2,500 請求 | 排隊時間、429 比例、工具失敗和每成功任務成本 |
| 可控部署 | MIT Checkpoint 與已記錄的 vLLM/SGLang 路徑 | 硬體利用率、快取/儲存頻寬和運維成本 |
因此最可信的生產定位是高成本效率的長上下文 Agent,而不是“全領域最強模型”。如果它一次就完成並透過驗收,而更小的便宜模型需要多輪修復,V4.1 的結果成本更低;如果前沿閉源模型能阻止一次昂貴失敗,更高 Token 價格仍可能更經濟。
什麼時候 OpenAI 或 Anthropic 更穩妥
當應用依賴完整 Responses 生態、託管狀態、內建工具,或某項會被 DeepSeek 忽略的 OpenAI 專屬契約時,應選擇 OpenAI 模型。GPT-5.6 Luna 是短且未快取工作負載中價格最接近的競爭者;Terra、Sol、Astra 用更高公開價格提供不同能力層級與原生平臺功能。
當 Claude 原生工具/思考契約、快取控制,或團隊在最難 Agent 工作上的實測結果比 Token 標價更重要時,應選擇 Anthropic。在 DeepSeek 自己的表格中,Claude Opus 5 領先 Terminal-Bench 3/4 和 Chartography;Claude Fable 5.1 定位於最難長程工作,但新輸入和輸出單價都明顯更高。
涉及安全關鍵或高成本動作時,應根據已評估的失敗模式與許可權邊界選擇路由,不能依據品牌或平均基準。路由指南說明如何區分可重試任務、Fallback 和帶副作用的動作。
生產接入檢查清單
- 第一方 API 使用
deepseek-flash,閘道器自有對映另行記錄。 - 先以 high 建立基線,再在同一組驗收任務上測 low 和 max;不要把不同供應商同名檔位當成相同算力。
- 思考模式呼叫工具時,按要求完整回傳
reasoning_content。 - 審計所有依賴的 Responses 欄位;被拒絕和被靜默忽略需要不同處理。
- 記錄快取命中/未命中、輸出/推理 Token、重試、延遲和最終驗收結果。
- 用實測命中率設計快取經濟模型,不依賴固定保留時間假設。
- 傳送多模態請求前,限制圖像位元組、數量、尺寸與 detail 模式。
- 應用側授權、工具冪等和輸出校驗應獨立於模型能力。
- 上線前重新核對時間段價格、模型別名和併發上限。
- 在精確目標路由發起真實鑑權請求;模型目錄或 HTTP 200 本身不是能力證明。
常見問題
DeepSeek V4.1 Flash 比 GPT-6 Astra 或 Claude Fable 5.1 強嗎? 不能做全域性結論。V4.1 Flash 在價格和開放權重上優勢巨大,廠商公佈的 Agent 成績也很強;DeepSeek 自己承認,最大型閉源模型在最難推理和邊界情形仍然領先。V4.1 報告中也沒有同一 Harness 下的 Astra/Fable 對比。
DeepSeek V4.1 Flash 到底有多少參數? 報告列出 552B 主幹參數和 196B Engram 參數。預填充每 Token 約啟用 8B 主幹參數,解碼每 Token 約啟用 16B。只說“總計 552B”會漏掉 Engram;說“啟用 748B”同樣錯誤。
上下文和輸出上限是多少? 官方上限為 100 萬上下文 Token、最高 384K 輸出 Token。圖像嵌入、文字、工具歷史與推理都會佔用相應預算。
為什麼叫 Flash? 設計重點是降低服務成本:預填充/解碼不對稱啟用、壓縮稀疏注意力、FP4 全域性 KV、有限持久重放和推測解碼。“Flash”並不承諾任何提示詞和排隊狀態下延遲都最低。
公開快取會保留 72 小時嗎? 不應這樣假設。技術報告描述的部署架構至少保留 72 小時;公開 API 文件只承諾自動、盡力而為,並稱條目通常在數小時到數天後清理。
Responses API 可以完全無改動替換 OpenAI 嗎? 不能。基本請求、函式與圖像可用,但它是無狀態介面,多個狀態欄位、託管工具和推理摘要不受支援或會被忽略。必須針對所依賴功能逐項驗證。
它可以生成圖像嗎? 它能理解圖像輸入並返回文字,但不是圖像生成模型。
Modelflare 已經提供 DeepSeek V4.1 Flash 了嗎? 已經提供。請在 deepseek-stable 分組使用 deepseek-v4.1-flash-0910,支援 Chat Completions 與 Responses。它是 Modelflare 的版本化 ID,與 DeepSeek 第一方 deepseek-flash 屬於不同服務契約。
來源、方法與更新記錄
本文優先使用 DeepSeek 釋出公告、技術報告、API 價格、思考模式、Responses、Anthropic 相容介面、視覺指南和快取指南。對比價格來自 OpenAI 官方模型頁與 Anthropic 官方定價頁。Modelflare 狀態來自公開價格目錄。
基準表是 DeepSeek 廠商報告,不是 Modelflare 獨立測試;價格場景是可復算數學比較,不代表質量等價或真實賬單。本文沒有把不同供應商、不同 Harness 的分數強行拼接。無文字主圖是 AI 生成的原創編輯插圖,不是模型能力樣張。
2026-09-10 更新: 首次釋出日調研,記錄第一方模型 ID、已生效的峰谷價格、9 月 14 日別名遷移公告、當前 API 限制、技術報告架構與基準。同日後續更新補充 Modelflare 已用 deepseek-v4.1-flash-0910 上線、實時閘道器價格和兩組閘道器成本。實施前應重新核驗所有可能變化的資訊。