DeepSeek V4 Flash Vision Exp 深度評測:價格、限制與模型比較
依官方資料分析 DeepSeek V4 Flash Vision Exp,涵蓋圖片 Token 成本、API 限制、Agent 基準、與 Gemini 3.7 Flash 和 Claude Opus 4.8 的比較,以及 Modelflare 目前價格、群組與可用性。
DeepSeek 於 2026 年 8 月 21 日發布 DeepSeek V4 Flash Vision Exp,準確的 API 模型 ID 是 deepseek-v4-flash-vision-exp。它接受文字與圖片輸入、輸出文字,Token 單價則與 V4 Flash 相同。
真正值得注意的是圖片計費方式。DeepSeek 會在推論前縮放每張圖片,並把用量限制在最多 384 個輸入 Token。對持續讀取畫面的 Agent 而言,成本非常低;代價也很明確:大圖會被壓到約 800×800 像素的總量級,因此低價不能等同於完整保留高解析度細節。
這是實驗模型,不是所有視覺工作負載的無條件正式環境替代品。本文分開呈現 DeepSeek 官方規格、廠商公布的基準、可重算的成本,以及 Modelflare 目前的實際可用性。易變資訊核驗於 2026 年 8 月 22 日。
DeepSeek V4 Flash Vision Exp 核心規格
| 項目 | 官方資訊 |
|---|---|
| 發布日期 | 2026 年 8 月 21 日 |
| 狀態 | 實驗性 API 模型 |
| 模型 ID | deepseek-v4-flash-vision-exp |
| 輸入與輸出 | 文字、圖片輸入;文字輸出 |
| Context Window | 1M Token |
| 最大輸出 | 384K Token |
| 思考模式 | 支援思考與非思考模式;文件標示預設啟用思考 |
| 圖片格式 | JPEG、PNG、GIF、WebP |
| API 格式 | Chat Completions、Responses API、Anthropic 相容 Messages |
| 單圖 Token 上限 | 自動縮放後最多 384 個輸入 Token |
| 並行上限 | 2,500 |
| FIM Completion | 不支援 |
DeepSeek 未公布參數總量、啟用參數、專家數、訓練資料規模或此次版本的架構變化。沒有第一方來源的精確數字都只是推測。
相較 V4 Flash,真正增加了什麼
DeepSeek 表示,Vision Exp 在純文字 Agent、推理和世界知識方面與正式版 V4 Flash 持平。核心變化是原生視覺理解:螢幕截圖、文件圖片、圖表與一般照片現在可直接進入同一個 Agent 工具迴圈,不必先交給另一個視覺模型轉成描述。
官方首發資料列出以下成績:
| 評測 | DeepSeek 公布分數 |
|---|---|
| Terminal Bench 2.1 | 83.9 |
| NL2Repo | 57.7 |
| DeepSWE | 59.3 |
| DSBench-Hard | 63.6 |
| AutomationBench 公開集 | 25.7 |
| ApexBench Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| Chartography | 64.3 |
| ZeroBench Pass@5 | 35.0 |
DeepSeek 也表示其多模態 Agent 能力接近 Claude Opus 4.8。這是廠商陳述,不是 Modelflare 的獨立測試。表格混合了純文字 Agent 與需要視覺的任務;官方說明公開程式碼 Agent 測試採用 DeepSeek Harness minimal 模式、max effort、top_p=0.95 與 temperature=1.0。應用這些分數挑選要回放的工作負載,而不是把它們當作通用排名。
官方價格與單張圖片的實際成本
DeepSeek 價格頁採美元峰谷計價。尖峰時段為 UTC 01:00–04:00 與 06:00–10:00,其他時間為離峰。
| 計費項目 | 離峰價 / 百萬 Token | 尖峰價 / 百萬 Token |
|---|---|---|
| 快取輸入 | $0.007 | $0.014 |
| 未快取輸入 | $0.22 | $0.44 |
| 輸出 | $0.66 | $1.32 |
| 單圖達 384 Token 上限時的輸入成本 | $0.00008448 | $0.00016896 |
最後一列是 384 × 輸入單價 ÷ 1,000,000 的計算結果,不是另一項圖片費用。較小圖片可能使用更少 Token;文字輸入與生成輸出仍另外計費。
自動縮放同時解釋了低價與限制。總像素低於約 384×384 的圖片會等比例放大;較大的圖片會等比例縮小到接近 800×800 的總像素量。因此 2000×2000 和 5000×5000 圖片都可能觸及相同的 384 Token 上限。費用下降了,但細小文字、密集圖表標籤與精確畫面座標可能在縮放時消失。
與 Gemini 3.7 Flash、Claude Opus 4.8 的價格比較
三款模型解決的是不同層次的多模態需求。下表採用各廠商直接 API 的標準費率,不含工具、快取儲存、重試或閘道折扣。
| 模型 | 發布狀態 | 輸入範圍 | Context / 最大輸出 | 未快取輸入 | 輸出 | 主要取捨 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Flash Vision Exp | 實驗版 | 文字、圖片 | 1M / 384K | 離峰 $0.22;尖峰 $0.44 | 離峰 $0.66;尖峰 $1.32 | 費率最低且單圖 384 Token 封頂,但圖片縮放明顯 |
| Gemini 3.7 Flash | GA | 文字、圖片、影片、音訊、PDF | 1M / 64K | 2026-12-31 前 $0.75 | 2026-12-31 前 $3.75 | 模態與內建工具較完整,但價格較高且優惠會到期 |
| Claude Opus 4.8 | GA | 文字、圖片、PDF | 1M / 128K | $5.00 | $25.00 | 高解析度視覺與成熟 Computer Use,成本屬高階區間 |
以 100K 未快取輸入加 10K 輸出的純文字任務為例:
- DeepSeek 離峰約 $0.0286,尖峰約 $0.0572;
- Gemini 3.7 Flash 依首發優惠約 $0.1125;
- Claude Opus 4.8 約 $0.75。
在此算例中,DeepSeek 尖峰費用比 Gemini 低約 49%,離峰低約 75%;相較 Claude,尖峰低約 92%,離峰低約 96%。這些百分比比較帳單,不代表輸出品質。
圖片費用差距更大,但解析度也不同。Anthropic 文件顯示,Opus 4.8 處理一張 1000×1000 圖片需要 1,296 個視覺 Token,約 $0.00648;DeepSeek 每張圖片最多為尖峰 $0.00016896、離峰 $0.00008448,輸入費用約低 38 至 77 倍。不過 DeepSeek 會把圖片壓向 800×800 像素預算,而 Opus 保留較多細節,不能把價差直接解讀為同品質下的效率差。
若一次處理 100 張一百萬像素圖片,加上 100K 文字輸入和 10K 輸出,DeepSeek 最多約 **$0.0370(離峰)**或 $0.0741(尖峰)。依 Anthropic 公布的一百萬像素圖片 1,296 Token 計算,Opus 4.8 的 Token 帳單約 $1.398。這不是品質等價測試,而是說明低成本視覺初篩與高解析度檢查應視為不同工作負載。
各模型適合的工作負載
適合受控測試 DeepSeek V4 Flash Vision Exp:大量截圖、一般文件、圖表、類 OCR 擷取,以及工具迴圈中的視覺觀察;重點是降低每個成功任務的成本,而不是保留每一個來源像素。
適合 Gemini 3.7 Flash:單一流程需要圖片、影片、音訊與 PDF,或依賴 Google Search Grounding、程式碼執行、File Search、URL Context 與預覽版 Computer Use。Gemini 3.7 Flash 已 GA,而 DeepSeek 視覺端點明確為實驗版。
適合 Claude Opus 4.8:密集文件、細小 UI 元素、Computer Use 與長時間瀏覽器 Agent,且任務價值足以承擔較高成本。Anthropic 高解析度視覺可保留最長邊 2,576 像素與最多 4,784 個視覺 Token,因此不能只用單圖價格與 DeepSeek 橫向比較。
實際系統可採分層路由:先由低價模型分類、擷取與分流,只把模糊或細節敏感的圖片升級到高解析度模型。仍須量測第二次呼叫、延遲與升級比例;若多數圖片最後都升級,雙模型流程不會自動更便宜。
圖片輸入方式與限制
DeepSeek Vision 指南提供三種方式:
- 以 base64 內嵌本機圖片;
- 傳入可公開存取的 HTTP 或 HTTPS URL;
- 先上傳到 Files API,再重複使用
file_id。
| 邊界 | 限制 |
|---|---|
| 內嵌請求本文 | 48 MiB |
| 單張 base64 或 URL 圖片 | 32 MiB |
| 單張 Files API 圖片 | 64 MiB |
| 單次請求圖片數量 | 600 |
不含 file_id 的圖片總量 |
64 MiB |
包含 file_id 後的圖片總量 |
200 MiB |
| 圖片最長邊 | 8,192 px;15 張以上降為 4,096 px |
| 外部 URL | 最長 8,192 字元,60 秒內完成下載 |
detail: "low" 會先縮至 512×512,適合低細節 OCR 或分類。high、original 和目前的 auto 會在常規自動縮放前保留原圖。Chat Completions 只允許 user 訊息攜帶圖片;Responses API 還允許 developer 訊息與工具輸出攜帶圖片,但 system 或 assistant 圖片會出錯。
透過 Modelflare 呼叫 Responses API
Modelflare 已列出準確模型 ID 與 Responses API 路由。請使用分配至 deepseek-stable 群組的 API Key:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODELFLARE_API_KEY"],
base_url="https://modelflare.dev/v1",
)
response = client.responses.create(
model="deepseek-v4-flash-vision-exp",
input=[
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "讀取這張儀表板,列出三個異常及各自可見的證據。",
},
{
"type": "input_image",
"image_url": "https://example.com/dashboard.png",
"detail": "low",
},
],
}
],
)
print(response.output_text)
私有圖片應使用 base64 或 Files API,不要把憑證、私有物件 URL 或個人資料寫入日誌。DeepSeek 的 Responses 實作是無狀態的,不支援 previous_response_id、conversation 與 store。Function Calling 和 Web Search 可用,但內建 Computer Use、Code Interpreter、File Search 與 MCP 會被忽略。
實驗視覺模型的正式環境檢查
- 固定準確 ID
deepseek-v4-flash-vision-exp,不要把deepseek-v4-flash當作視覺別名。 - 以不含隱私的真實測試集涵蓋小字、密集表格、圖表、截圖、旋轉圖片和對抗內容。
- 比較
detail: "low"與預設設定的任務成功率、延遲和輸入費用,不要只看視覺觀感。 - 若客戶端使用多個協定,分別驗證 Chat Completions、Responses 與 Messages。
- 測試結構化輸出、工具呼叫關聯、串流、取消、拒絕與損壞圖片處理。
- 重複使用私有圖片時採 Files API,並定義保留和刪除流程。
- 記錄圖片數量、尺寸、輸入 Token、快取 Token、輸出 Token、重試、延遲、路由與最終費用。
- 在實驗模型通過真實流量門檻前,為細節敏感或關鍵工作保留 GA 回退模型。
HTTP 200 只證明一次請求完成,不證明截圖讀取正確、工具呼叫已授權,也不證明低價路徑降低了每個成功任務的成本。
DeepSeek V4 Flash Vision Exp 在 Modelflare 的價格
目前已可使用。在 2026 年 8 月 22 日稍後的正式環境複核中,Modelflare 公開模型與價格目錄已列出準確 ID deepseek-v4-flash-vision-exp,開放 deepseek-stable 群組,並支援 OpenAI 相容的 Chat Completions 與 Responses API。
公開目錄以官方尖峰參考價設定:輸入 $0.44、輸出 $1.32、快取輸入 $0.014 / 百萬 Token,再套用 deepseek-stable 的 0.9x 群組倍率:
| Modelflare 群組 | 輸入 | 快取輸入 | 輸出 | 單圖達 384 Token 時的最大未快取輸入成本 |
|---|---|---|---|---|
deepseek-stable |
$0.396 / 1M | $0.0126 / 1M | $1.188 / 1M | $0.000152064 |
依此價格,100K 未快取文字輸入加 10K 輸出約為 $0.05148。100 張皆達 384 Token 上限的圖片,加 100K 文字輸入與 10K 輸出,最多約 $0.06669,不含重試或其他請求。
不要把 0.9x 群組價視為 DeepSeek 直連的離峰價。Modelflare 是對本站設定的參考價套用群組倍率,不會隨 DeepSeek 廠商峰谷時段自動切換。群組權限、價格與路由可能變動,應以即時價格頁及完成請求紀錄為準。
結論
DeepSeek V4 Flash Vision Exp 的吸引力來自視覺 Agent 的成本結構:每張圖片最多 384 Token,且沿用 V4 Flash 費率。對截圖初篩、文件擷取、圖表閱讀與高頻視覺工具迴圈,差異可能很實際。
384 Token 上限也是警示標籤。縮圖可能抹去 Computer Use 和密集文件最需要的細節;端點仍是實驗版;首發基準也由 DeepSeek 自行公布。合理定位是「值得驗證的低成本視覺工作節點」,而不是「單一模型取代所有多模態方案」。
官方來源與更新紀錄
第一方來源:
- DeepSeek API 更新日誌:V4 Flash Vision Exp
- DeepSeek Vision 指南
- DeepSeek 模型與價格
- DeepSeek Responses API 指南
- Google:Gemini 3.7 Flash 模型頁
- Google:Gemini API 價格
- Anthropic:Claude 模型總覽
- Anthropic:視覺 Token 與圖片限制
更新紀錄:
- **2026 年 8 月 22 日:**首次發布。已核對官方發布狀態、規格、圖片處理、限制、協定支援、峰谷價格、競品費率、成本試算與 Modelflare 公開目錄可用性。
- **2026 年 8 月 22 日稍後:**準確模型已在 Modelflare 上線,新增
deepseek-stable0.9x 價格、本站成本試算、支援路由及 Modelflare Responses API 範例。