DeepSeek V4 Flash Vision Exp 深度评测:价格、限制与模型对比

基于官方资料分析 DeepSeek V4 Flash Vision Exp,覆盖图片 Token 成本、API 限制、Agent 基准、与 Gemini 3.7 Flash 和 Claude Opus 4.8 的对比,以及 Modelflare 当前价格、分组与可用性。

DeepSeek 于 2026 年 8 月 21 日发布 DeepSeek V4 Flash Vision Exp,准确 API 模型 ID 为 deepseek-v4-flash-vision-exp。它支持文本与图片输入、文本输出,Token 单价与 V4 Flash 保持一致。

真正值得关注的是图片计费方式。DeepSeek 会在推理前缩放图片,并把单张图片控制在最多 384 个输入 Token。对需要连续读取截图的 Agent 来说,这个价格很有吸引力;但它也构成最明确的限制:大图会被压到约 800×800 像素的总量级,低成本不等于完整保留高分辨率细节。

这是实验模型,不应该被当成所有视觉任务的无条件生产替代。本文严格区分 DeepSeek 官方规格、厂商发布的基准、可复算的成本,以及 Modelflare 当前真实可用性。易变信息核验于 2026 年 8 月 22 日

DeepSeek V4 Flash Vision Exp 核心规格

项目 官方信息
发布日期 2026 年 8 月 21 日
状态 实验性 API 模型
模型 ID deepseek-v4-flash-vision-exp
输入与输出 文本、图片输入;文本输出
上下文窗口 1M Token
最大输出 384K Token
思考模式 支持思考与非思考模式;文档标注默认启用思考
图片格式 JPEG、PNG、GIF、WebP
API 格式 Chat Completions、Responses API、Anthropic 兼容 Messages
单图 Token 上限 自动缩放后最多 384 个输入 Token
并发上限 2,500
FIM 补全 不支持

DeepSeek 没有披露参数总量、激活参数、专家数量、训练数据规模或此次版本的架构变化。没有一手来源的精确参数数字都只能算猜测。

相比 V4 Flash 真正增加了什么

DeepSeek 表示,Vision Exp 在纯文本 Agent、推理和世界知识方面与正式版 V4 Flash 持平。核心变化是原生视觉理解:截图、文档图片、图表和普通照片可以直接进入同一条 Agent 工具链,不必先用另一个视觉模型生成文字描述。

官方首发表给出了以下成绩:

评测 DeepSeek 公布分数
Terminal Bench 2.1 83.9
NL2Repo 57.7
DeepSWE 59.3
DSBench-Hard 63.6
AutomationBench 公共集 25.7
ApexBench Pass@1 36.5
Agents' Last Exam 27.3
Chartography 64.3
ZeroBench Pass@5 35.0

DeepSeek 还称其多模态 Agent 能力已接近 Claude Opus 4.8。这是厂商结论,不是 Modelflare 的独立测试。表中混合了文本 Agent 与依赖视觉的任务;官方说明,公开代码 Agent 测试使用 DeepSeek Harness minimal 模式、max effort、top_p=0.95temperature=1.0。这些分数适合用于选择要回放的任务,不适合作为通用排名。

官方价格与单张图片的真实成本

DeepSeek 价格页当前采用美元峰谷计价。高峰时段为 UTC 01:00–04:00 和 06:00–10:00,其余时间为低谷。

计费项 低谷价 / 百万 Token 高峰价 / 百万 Token
缓存输入 $0.007 $0.014
未缓存输入 $0.22 $0.44
输出 $0.66 $1.32
单图达到 384 Token 上限时的输入成本 $0.00008448 $0.00016896

最后一行是按 384 × 输入单价 ÷ 1,000,000 得出的成本,不是额外的图片套餐价。较小图片可能消耗更少;文字输入和模型输出仍会另外计费。

自动缩放同时解释了便宜与限制。总像素低于约 384×384 的图片会按比例放大;更大的图片会按比例缩到约 800×800 的总像素规模。因此 2000×2000 与 5000×5000 图片最终都可能达到同一个 384 Token 上限。账单下降了,但细小文字、密集图表标注和精确屏幕坐标也可能在缩放中消失。

与 Gemini 3.7 Flash、Claude Opus 4.8 的价格对比

这三款模型解决的是不同层次的多模态问题。下表使用厂商直接 API 的标准价格,不包含工具、缓存存储、重试或网关折扣。

模型 发布状态 输入范围 上下文 / 最大输出 未缓存输入 输出 主要取舍
DeepSeek V4 Flash Vision Exp 实验版 文本、图片 1M / 384K 低谷 $0.22;高峰 $0.44 低谷 $0.66;高峰 $1.32 单价最低、单图 384 Token 封顶,但缩图明显
Gemini 3.7 Flash GA 文本、图片、视频、音频、PDF 1M / 64K 2026-12-31 前 $0.75 2026-12-31 前 $3.75 模态和内置工具更全,但价格更高且优惠会到期
Claude Opus 4.8 GA 文本、图片、PDF 1M / 128K $5.00 $25.00 高分辨率视觉与成熟 Computer Use,价格属于高端档

以 100K 未缓存输入加 10K 输出的纯文本任务为例:

  • DeepSeek 低谷约 $0.0286,高峰约 $0.0572
  • Gemini 3.7 Flash 按首发优惠价约 $0.1125
  • Claude Opus 4.8 约 $0.75

在这个算例中,DeepSeek 高峰价比 Gemini 低约 49%,低谷价低约 75%;相对 Claude,高峰低约 92%,低谷低约 96%。这些百分比比较的是账单,不是回答质量。

图片成本差距更大,但分辨率也不同。Anthropic 文档中,Opus 4.8 处理一张 1000×1000 图片需要 1,296 个视觉 Token,成本约 $0.00648;DeepSeek 单图上限是高峰 $0.00016896、低谷 $0.00008448,输入成本大约低 38 到 77 倍。不过 DeepSeek 会把图片压向 800×800 像素预算,而 Opus 能保留更多细节,不能把价格差直接解释成同质量下的效率差。

再看一个批量算例:100 张一百万像素图片,加 100K 文字输入和 10K 输出,在 DeepSeek 上最多约 **$0.0370(低谷)**或 $0.0741(高峰)。按 Anthropic 公布的一百万像素图片 1,296 Token 计算,Opus 4.8 的同等 Token 账单约 $1.398。这仍然不是质量等价测试,它说明“低成本视觉初筛”与“高分辨率细查”应该被拆成两类工作负载。

什么任务更适合哪一个模型

适合受控测试 DeepSeek V4 Flash Vision Exp 的场景:大量截图、普通文档、图表、类似 OCR 的提取,以及工具循环中的视觉观察;目标是降低成功任务成本,而不是保留每个源像素。

适合 Gemini 3.7 Flash 的场景:同一工作流需要同时处理图片、视频、音频和 PDF,或者依赖 Google 搜索 Grounding、代码执行、File Search、URL Context 与预览版 Computer Use。Gemini 3.7 Flash 是 GA,DeepSeek 视觉端点则明确标注为实验版。

适合 Claude Opus 4.8 的场景:密集文档、细小 UI 元素、Computer Use 和长时间浏览器 Agent,且业务价值足以承担更高单价。Anthropic 的高分辨率视觉可保留最长边 2,576 像素、最多 4,784 个视觉 Token,这也是它不能与 DeepSeek 单图价格直接横比的原因。

实际系统可以分层:先让低价模型完成分类、提取和路由,只把模糊或细节敏感的图片升级到高分辨率模型。但必须测量二次调用、延迟与升级比例;如果大多数图片最终都要升级,双模型管线并不会自动省钱。

图片输入方式与限制

DeepSeek 视觉指南支持三种输入:

  1. 本地图片用 base64 内联;
  2. 提供可公开访问的 HTTP 或 HTTPS URL;
  3. 先上传到 Files API,再复用 file_id
边界 限制
内联请求体 48 MiB
单张 base64 或 URL 图片 32 MiB
单张 Files API 图片 64 MiB
单请求图片数量 600
不含 file_id 的图片总量 64 MiB
包含 file_id 后的图片总量 200 MiB
图片最长边 8,192 px;15 张及以上时降至 4,096 px
外部 URL 最长 8,192 字符,下载须在 60 秒内完成

detail: "low" 会先把图片压到 512×512,适合低细节 OCR 或分类。highoriginal 和目前的 auto 会在常规自动缩放前保留原图。Chat Completions 只允许在 user 消息中放图片;Responses API 还允许 developer 消息与工具输出携带图片,但 systemassistant 图片会返回错误。

通过 Modelflare 调用 Responses API

Modelflare 已列出准确模型 ID 与 Responses API 路由。请使用分配到 deepseek-stable 分组的 API Key:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MODELFLARE_API_KEY"],
    base_url="https://modelflare.dev/v1",
)

response = client.responses.create(
    model="deepseek-v4-flash-vision-exp",
    input=[
        {
            "role": "user",
            "content": [
                {
                    "type": "input_text",
                    "text": "读取这张仪表盘,返回三个异常及每个异常在图中可见的证据。",
                },
                {
                    "type": "input_image",
                    "image_url": "https://example.com/dashboard.png",
                    "detail": "low",
                },
            ],
        }
    ],
)

print(response.output_text)

私有图片应改用 base64 或 Files API,不要把凭据、私有对象 URL 或个人信息写入日志。DeepSeek 的 Responses 实现是无状态的,不支持 previous_response_id、conversation 与 store。函数调用和 Web Search 可用,但内置 Computer Use、Code Interpreter、File Search 与 MCP 会被忽略。

实验视觉模型的生产检查清单

  1. 固定准确 ID deepseek-v4-flash-vision-exp,不要把 deepseek-v4-flash 当成视觉别名。
  2. 用不含隐私的真实测试集覆盖小字、密集表格、图表、截图、旋转图片和对抗内容。
  3. 分别测试 detail: "low" 与默认设置的任务成功率、延迟和输入账单,而不是只看图片观感。
  4. 如果客户端使用多个协议,要分别验证 Chat Completions、Responses 与 Messages。
  5. 验证结构化输出、工具调用关联、流式、取消、拒绝和损坏图片处理。
  6. 重复使用私有图片时走 Files API,并明确文件保留与删除流程。
  7. 记录图片数量、尺寸、输入 Token、缓存 Token、输出 Token、重试、延迟、路由和最终费用。
  8. 在实验模型通过真实流量门槛前,为细节敏感和关键业务保留 GA 回退模型。

HTTP 200 只说明一次请求完成,不能证明截图读对、工具调用经过授权,也不能证明低价路径真的降低了每个成功任务的成本。

DeepSeek V4 Flash Vision Exp 在 Modelflare 的价格

已经可以使用。在 2026 年 8 月 22 日稍后的生产复核中,Modelflare 公共模型与价格目录已列出准确 ID deepseek-v4-flash-vision-exp,开放 deepseek-stable 分组,并支持 OpenAI 兼容的 Chat Completions 与 Responses API。

公开目录以官方高峰参考价配置:输入 $0.44、输出 $1.32、缓存输入 $0.014 / 百万 Token,再应用 deepseek-stable 的 0.9x 分组倍率:

Modelflare 分组 输入 缓存输入 输出 单图达到 384 Token 时的最大未缓存输入成本
deepseek-stable $0.396 / 1M $0.0126 / 1M $1.188 / 1M $0.000152064

按该价格,100K 未缓存文字输入加 10K 输出约为 $0.05148。100 张均达到 384 Token 上限的图片,加 100K 文字输入和 10K 输出,最多约 $0.06669,不含重试或其他请求。

不要把 0.9x 分组价理解成 DeepSeek 直连的低谷时段价格。Modelflare 是对本站配置的参考价应用分组倍率,不会随 DeepSeek 厂商的峰谷时段自动切换。分组权限、价格和路由都可能变化,应以实时价格页与完成请求记录为当前真相。

结论

DeepSeek V4 Flash Vision Exp 的价值在于改变视觉 Agent 的成本结构:单张图片最多 384 Token,并沿用 V4 Flash 单价。对截图初筛、文档提取、图表阅读和高频视觉工具循环,这个差异可能非常实际。

384 Token 上限也正是警示。缩图可能抹掉 Computer Use 和密集文档最需要的细节;端点仍是实验版;发布基准也来自 DeepSeek 自己。更合理的定位是“值得实测的低成本视觉工作节点”,而不是“一个模型替代所有多模态方案”。

官方来源与更新记录

一手来源:

更新记录:

  • **2026 年 8 月 22 日:**首次发布。已核对官方发布状态、规格、图片处理规则、限制、协议支持、峰谷价格、竞品价格、成本算例与 Modelflare 公共目录可用性。
  • **2026 年 8 月 22 日稍后:**准确模型已上线 Modelflare,补充 deepseek-stable 0.9x 价格、本站成本算例、支持路由与 Modelflare Responses API 示例。