DeepSeek V4 Flash Vision Exp 深度評測:價格、限制與模型比較

依官方資料分析 DeepSeek V4 Flash Vision Exp,涵蓋圖片 Token 成本、API 限制、Agent 基準、與 Gemini 3.7 Flash 和 Claude Opus 4.8 的比較,以及 Modelflare 目前價格、群組與可用性。

DeepSeek 於 2026 年 8 月 21 日發布 DeepSeek V4 Flash Vision Exp,準確的 API 模型 ID 是 deepseek-v4-flash-vision-exp。它接受文字與圖片輸入、輸出文字,Token 單價則與 V4 Flash 相同。

真正值得注意的是圖片計費方式。DeepSeek 會在推論前縮放每張圖片,並把用量限制在最多 384 個輸入 Token。對持續讀取畫面的 Agent 而言,成本非常低;代價也很明確:大圖會被壓到約 800×800 像素的總量級,因此低價不能等同於完整保留高解析度細節。

這是實驗模型,不是所有視覺工作負載的無條件正式環境替代品。本文分開呈現 DeepSeek 官方規格、廠商公布的基準、可重算的成本,以及 Modelflare 目前的實際可用性。易變資訊核驗於 2026 年 8 月 22 日

DeepSeek V4 Flash Vision Exp 核心規格

項目 官方資訊
發布日期 2026 年 8 月 21 日
狀態 實驗性 API 模型
模型 ID deepseek-v4-flash-vision-exp
輸入與輸出 文字、圖片輸入;文字輸出
Context Window 1M Token
最大輸出 384K Token
思考模式 支援思考與非思考模式;文件標示預設啟用思考
圖片格式 JPEG、PNG、GIF、WebP
API 格式 Chat Completions、Responses API、Anthropic 相容 Messages
單圖 Token 上限 自動縮放後最多 384 個輸入 Token
並行上限 2,500
FIM Completion 不支援

DeepSeek 未公布參數總量、啟用參數、專家數、訓練資料規模或此次版本的架構變化。沒有第一方來源的精確數字都只是推測。

相較 V4 Flash,真正增加了什麼

DeepSeek 表示,Vision Exp 在純文字 Agent、推理和世界知識方面與正式版 V4 Flash 持平。核心變化是原生視覺理解:螢幕截圖、文件圖片、圖表與一般照片現在可直接進入同一個 Agent 工具迴圈,不必先交給另一個視覺模型轉成描述。

官方首發資料列出以下成績:

評測 DeepSeek 公布分數
Terminal Bench 2.1 83.9
NL2Repo 57.7
DeepSWE 59.3
DSBench-Hard 63.6
AutomationBench 公開集 25.7
ApexBench Pass@1 36.5
Agents' Last Exam 27.3
Chartography 64.3
ZeroBench Pass@5 35.0

DeepSeek 也表示其多模態 Agent 能力接近 Claude Opus 4.8。這是廠商陳述,不是 Modelflare 的獨立測試。表格混合了純文字 Agent 與需要視覺的任務;官方說明公開程式碼 Agent 測試採用 DeepSeek Harness minimal 模式、max effort、top_p=0.95temperature=1.0。應用這些分數挑選要回放的工作負載,而不是把它們當作通用排名。

官方價格與單張圖片的實際成本

DeepSeek 價格頁採美元峰谷計價。尖峰時段為 UTC 01:00–04:00 與 06:00–10:00,其他時間為離峰。

計費項目 離峰價 / 百萬 Token 尖峰價 / 百萬 Token
快取輸入 $0.007 $0.014
未快取輸入 $0.22 $0.44
輸出 $0.66 $1.32
單圖達 384 Token 上限時的輸入成本 $0.00008448 $0.00016896

最後一列是 384 × 輸入單價 ÷ 1,000,000 的計算結果,不是另一項圖片費用。較小圖片可能使用更少 Token;文字輸入與生成輸出仍另外計費。

自動縮放同時解釋了低價與限制。總像素低於約 384×384 的圖片會等比例放大;較大的圖片會等比例縮小到接近 800×800 的總像素量。因此 2000×2000 和 5000×5000 圖片都可能觸及相同的 384 Token 上限。費用下降了,但細小文字、密集圖表標籤與精確畫面座標可能在縮放時消失。

與 Gemini 3.7 Flash、Claude Opus 4.8 的價格比較

三款模型解決的是不同層次的多模態需求。下表採用各廠商直接 API 的標準費率,不含工具、快取儲存、重試或閘道折扣。

模型 發布狀態 輸入範圍 Context / 最大輸出 未快取輸入 輸出 主要取捨
DeepSeek V4 Flash Vision Exp 實驗版 文字、圖片 1M / 384K 離峰 $0.22;尖峰 $0.44 離峰 $0.66;尖峰 $1.32 費率最低且單圖 384 Token 封頂,但圖片縮放明顯
Gemini 3.7 Flash GA 文字、圖片、影片、音訊、PDF 1M / 64K 2026-12-31 前 $0.75 2026-12-31 前 $3.75 模態與內建工具較完整,但價格較高且優惠會到期
Claude Opus 4.8 GA 文字、圖片、PDF 1M / 128K $5.00 $25.00 高解析度視覺與成熟 Computer Use,成本屬高階區間

以 100K 未快取輸入加 10K 輸出的純文字任務為例:

  • DeepSeek 離峰約 $0.0286,尖峰約 $0.0572
  • Gemini 3.7 Flash 依首發優惠約 $0.1125
  • Claude Opus 4.8 約 $0.75

在此算例中,DeepSeek 尖峰費用比 Gemini 低約 49%,離峰低約 75%;相較 Claude,尖峰低約 92%,離峰低約 96%。這些百分比比較帳單,不代表輸出品質。

圖片費用差距更大,但解析度也不同。Anthropic 文件顯示,Opus 4.8 處理一張 1000×1000 圖片需要 1,296 個視覺 Token,約 $0.00648;DeepSeek 每張圖片最多為尖峰 $0.00016896、離峰 $0.00008448,輸入費用約低 38 至 77 倍。不過 DeepSeek 會把圖片壓向 800×800 像素預算,而 Opus 保留較多細節,不能把價差直接解讀為同品質下的效率差。

若一次處理 100 張一百萬像素圖片,加上 100K 文字輸入和 10K 輸出,DeepSeek 最多約 **$0.0370(離峰)**或 $0.0741(尖峰)。依 Anthropic 公布的一百萬像素圖片 1,296 Token 計算,Opus 4.8 的 Token 帳單約 $1.398。這不是品質等價測試,而是說明低成本視覺初篩與高解析度檢查應視為不同工作負載。

各模型適合的工作負載

適合受控測試 DeepSeek V4 Flash Vision Exp:大量截圖、一般文件、圖表、類 OCR 擷取,以及工具迴圈中的視覺觀察;重點是降低每個成功任務的成本,而不是保留每一個來源像素。

適合 Gemini 3.7 Flash:單一流程需要圖片、影片、音訊與 PDF,或依賴 Google Search Grounding、程式碼執行、File Search、URL Context 與預覽版 Computer Use。Gemini 3.7 Flash 已 GA,而 DeepSeek 視覺端點明確為實驗版。

適合 Claude Opus 4.8:密集文件、細小 UI 元素、Computer Use 與長時間瀏覽器 Agent,且任務價值足以承擔較高成本。Anthropic 高解析度視覺可保留最長邊 2,576 像素與最多 4,784 個視覺 Token,因此不能只用單圖價格與 DeepSeek 橫向比較。

實際系統可採分層路由:先由低價模型分類、擷取與分流,只把模糊或細節敏感的圖片升級到高解析度模型。仍須量測第二次呼叫、延遲與升級比例;若多數圖片最後都升級,雙模型流程不會自動更便宜。

圖片輸入方式與限制

DeepSeek Vision 指南提供三種方式:

  1. 以 base64 內嵌本機圖片;
  2. 傳入可公開存取的 HTTP 或 HTTPS URL;
  3. 先上傳到 Files API,再重複使用 file_id
邊界 限制
內嵌請求本文 48 MiB
單張 base64 或 URL 圖片 32 MiB
單張 Files API 圖片 64 MiB
單次請求圖片數量 600
不含 file_id 的圖片總量 64 MiB
包含 file_id 後的圖片總量 200 MiB
圖片最長邊 8,192 px;15 張以上降為 4,096 px
外部 URL 最長 8,192 字元,60 秒內完成下載

detail: "low" 會先縮至 512×512,適合低細節 OCR 或分類。highoriginal 和目前的 auto 會在常規自動縮放前保留原圖。Chat Completions 只允許 user 訊息攜帶圖片;Responses API 還允許 developer 訊息與工具輸出攜帶圖片,但 systemassistant 圖片會出錯。

透過 Modelflare 呼叫 Responses API

Modelflare 已列出準確模型 ID 與 Responses API 路由。請使用分配至 deepseek-stable 群組的 API Key:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MODELFLARE_API_KEY"],
    base_url="https://modelflare.dev/v1",
)

response = client.responses.create(
    model="deepseek-v4-flash-vision-exp",
    input=[
        {
            "role": "user",
            "content": [
                {
                    "type": "input_text",
                    "text": "讀取這張儀表板,列出三個異常及各自可見的證據。",
                },
                {
                    "type": "input_image",
                    "image_url": "https://example.com/dashboard.png",
                    "detail": "low",
                },
            ],
        }
    ],
)

print(response.output_text)

私有圖片應使用 base64 或 Files API,不要把憑證、私有物件 URL 或個人資料寫入日誌。DeepSeek 的 Responses 實作是無狀態的,不支援 previous_response_id、conversation 與 store。Function Calling 和 Web Search 可用,但內建 Computer Use、Code Interpreter、File Search 與 MCP 會被忽略。

實驗視覺模型的正式環境檢查

  1. 固定準確 ID deepseek-v4-flash-vision-exp,不要把 deepseek-v4-flash 當作視覺別名。
  2. 以不含隱私的真實測試集涵蓋小字、密集表格、圖表、截圖、旋轉圖片和對抗內容。
  3. 比較 detail: "low" 與預設設定的任務成功率、延遲和輸入費用,不要只看視覺觀感。
  4. 若客戶端使用多個協定,分別驗證 Chat Completions、Responses 與 Messages。
  5. 測試結構化輸出、工具呼叫關聯、串流、取消、拒絕與損壞圖片處理。
  6. 重複使用私有圖片時採 Files API,並定義保留和刪除流程。
  7. 記錄圖片數量、尺寸、輸入 Token、快取 Token、輸出 Token、重試、延遲、路由與最終費用。
  8. 在實驗模型通過真實流量門檻前,為細節敏感或關鍵工作保留 GA 回退模型。

HTTP 200 只證明一次請求完成,不證明截圖讀取正確、工具呼叫已授權,也不證明低價路徑降低了每個成功任務的成本。

DeepSeek V4 Flash Vision Exp 在 Modelflare 的價格

目前已可使用。在 2026 年 8 月 22 日稍後的正式環境複核中,Modelflare 公開模型與價格目錄已列出準確 ID deepseek-v4-flash-vision-exp,開放 deepseek-stable 群組,並支援 OpenAI 相容的 Chat Completions 與 Responses API。

公開目錄以官方尖峰參考價設定:輸入 $0.44、輸出 $1.32、快取輸入 $0.014 / 百萬 Token,再套用 deepseek-stable 的 0.9x 群組倍率:

Modelflare 群組 輸入 快取輸入 輸出 單圖達 384 Token 時的最大未快取輸入成本
deepseek-stable $0.396 / 1M $0.0126 / 1M $1.188 / 1M $0.000152064

依此價格,100K 未快取文字輸入加 10K 輸出約為 $0.05148。100 張皆達 384 Token 上限的圖片,加 100K 文字輸入與 10K 輸出,最多約 $0.06669,不含重試或其他請求。

不要把 0.9x 群組價視為 DeepSeek 直連的離峰價。Modelflare 是對本站設定的參考價套用群組倍率,不會隨 DeepSeek 廠商峰谷時段自動切換。群組權限、價格與路由可能變動,應以即時價格頁及完成請求紀錄為準。

結論

DeepSeek V4 Flash Vision Exp 的吸引力來自視覺 Agent 的成本結構:每張圖片最多 384 Token,且沿用 V4 Flash 費率。對截圖初篩、文件擷取、圖表閱讀與高頻視覺工具迴圈,差異可能很實際。

384 Token 上限也是警示標籤。縮圖可能抹去 Computer Use 和密集文件最需要的細節;端點仍是實驗版;首發基準也由 DeepSeek 自行公布。合理定位是「值得驗證的低成本視覺工作節點」,而不是「單一模型取代所有多模態方案」。

官方來源與更新紀錄

第一方來源:

更新紀錄:

  • **2026 年 8 月 22 日:**首次發布。已核對官方發布狀態、規格、圖片處理、限制、協定支援、峰谷價格、競品費率、成本試算與 Modelflare 公開目錄可用性。
  • **2026 年 8 月 22 日稍後:**準確模型已在 Modelflare 上線,新增 deepseek-stable 0.9x 價格、本站成本試算、支援路由及 Modelflare Responses API 範例。