DeepSeek V4 Flash Vision Exp 深度评测:价格、限制与模型对比
基于官方资料分析 DeepSeek V4 Flash Vision Exp,覆盖图片 Token 成本、API 限制、Agent 基准、与 Gemini 3.7 Flash 和 Claude Opus 4.8 的对比,以及 Modelflare 当前价格、分组与可用性。
DeepSeek 于 2026 年 8 月 21 日发布 DeepSeek V4 Flash Vision Exp,准确 API 模型 ID 为 deepseek-v4-flash-vision-exp。它支持文本与图片输入、文本输出,Token 单价与 V4 Flash 保持一致。
真正值得关注的是图片计费方式。DeepSeek 会在推理前缩放图片,并把单张图片控制在最多 384 个输入 Token。对需要连续读取截图的 Agent 来说,这个价格很有吸引力;但它也构成最明确的限制:大图会被压到约 800×800 像素的总量级,低成本不等于完整保留高分辨率细节。
这是实验模型,不应该被当成所有视觉任务的无条件生产替代。本文严格区分 DeepSeek 官方规格、厂商发布的基准、可复算的成本,以及 Modelflare 当前真实可用性。易变信息核验于 2026 年 8 月 22 日。
DeepSeek V4 Flash Vision Exp 核心规格
| 项目 | 官方信息 |
|---|---|
| 发布日期 | 2026 年 8 月 21 日 |
| 状态 | 实验性 API 模型 |
| 模型 ID | deepseek-v4-flash-vision-exp |
| 输入与输出 | 文本、图片输入;文本输出 |
| 上下文窗口 | 1M Token |
| 最大输出 | 384K Token |
| 思考模式 | 支持思考与非思考模式;文档标注默认启用思考 |
| 图片格式 | JPEG、PNG、GIF、WebP |
| API 格式 | Chat Completions、Responses API、Anthropic 兼容 Messages |
| 单图 Token 上限 | 自动缩放后最多 384 个输入 Token |
| 并发上限 | 2,500 |
| FIM 补全 | 不支持 |
DeepSeek 没有披露参数总量、激活参数、专家数量、训练数据规模或此次版本的架构变化。没有一手来源的精确参数数字都只能算猜测。
相比 V4 Flash 真正增加了什么
DeepSeek 表示,Vision Exp 在纯文本 Agent、推理和世界知识方面与正式版 V4 Flash 持平。核心变化是原生视觉理解:截图、文档图片、图表和普通照片可以直接进入同一条 Agent 工具链,不必先用另一个视觉模型生成文字描述。
官方首发表给出了以下成绩:
| 评测 | DeepSeek 公布分数 |
|---|---|
| Terminal Bench 2.1 | 83.9 |
| NL2Repo | 57.7 |
| DeepSWE | 59.3 |
| DSBench-Hard | 63.6 |
| AutomationBench 公共集 | 25.7 |
| ApexBench Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| Chartography | 64.3 |
| ZeroBench Pass@5 | 35.0 |
DeepSeek 还称其多模态 Agent 能力已接近 Claude Opus 4.8。这是厂商结论,不是 Modelflare 的独立测试。表中混合了文本 Agent 与依赖视觉的任务;官方说明,公开代码 Agent 测试使用 DeepSeek Harness minimal 模式、max effort、top_p=0.95 和 temperature=1.0。这些分数适合用于选择要回放的任务,不适合作为通用排名。
官方价格与单张图片的真实成本
DeepSeek 价格页当前采用美元峰谷计价。高峰时段为 UTC 01:00–04:00 和 06:00–10:00,其余时间为低谷。
| 计费项 | 低谷价 / 百万 Token | 高峰价 / 百万 Token |
|---|---|---|
| 缓存输入 | $0.007 | $0.014 |
| 未缓存输入 | $0.22 | $0.44 |
| 输出 | $0.66 | $1.32 |
| 单图达到 384 Token 上限时的输入成本 | $0.00008448 | $0.00016896 |
最后一行是按 384 × 输入单价 ÷ 1,000,000 得出的成本,不是额外的图片套餐价。较小图片可能消耗更少;文字输入和模型输出仍会另外计费。
自动缩放同时解释了便宜与限制。总像素低于约 384×384 的图片会按比例放大;更大的图片会按比例缩到约 800×800 的总像素规模。因此 2000×2000 与 5000×5000 图片最终都可能达到同一个 384 Token 上限。账单下降了,但细小文字、密集图表标注和精确屏幕坐标也可能在缩放中消失。
与 Gemini 3.7 Flash、Claude Opus 4.8 的价格对比
这三款模型解决的是不同层次的多模态问题。下表使用厂商直接 API 的标准价格,不包含工具、缓存存储、重试或网关折扣。
| 模型 | 发布状态 | 输入范围 | 上下文 / 最大输出 | 未缓存输入 | 输出 | 主要取舍 |
|---|---|---|---|---|---|---|
| DeepSeek V4 Flash Vision Exp | 实验版 | 文本、图片 | 1M / 384K | 低谷 $0.22;高峰 $0.44 | 低谷 $0.66;高峰 $1.32 | 单价最低、单图 384 Token 封顶,但缩图明显 |
| Gemini 3.7 Flash | GA | 文本、图片、视频、音频、PDF | 1M / 64K | 2026-12-31 前 $0.75 | 2026-12-31 前 $3.75 | 模态和内置工具更全,但价格更高且优惠会到期 |
| Claude Opus 4.8 | GA | 文本、图片、PDF | 1M / 128K | $5.00 | $25.00 | 高分辨率视觉与成熟 Computer Use,价格属于高端档 |
以 100K 未缓存输入加 10K 输出的纯文本任务为例:
- DeepSeek 低谷约 $0.0286,高峰约 $0.0572;
- Gemini 3.7 Flash 按首发优惠价约 $0.1125;
- Claude Opus 4.8 约 $0.75。
在这个算例中,DeepSeek 高峰价比 Gemini 低约 49%,低谷价低约 75%;相对 Claude,高峰低约 92%,低谷低约 96%。这些百分比比较的是账单,不是回答质量。
图片成本差距更大,但分辨率也不同。Anthropic 文档中,Opus 4.8 处理一张 1000×1000 图片需要 1,296 个视觉 Token,成本约 $0.00648;DeepSeek 单图上限是高峰 $0.00016896、低谷 $0.00008448,输入成本大约低 38 到 77 倍。不过 DeepSeek 会把图片压向 800×800 像素预算,而 Opus 能保留更多细节,不能把价格差直接解释成同质量下的效率差。
再看一个批量算例:100 张一百万像素图片,加 100K 文字输入和 10K 输出,在 DeepSeek 上最多约 **$0.0370(低谷)**或 $0.0741(高峰)。按 Anthropic 公布的一百万像素图片 1,296 Token 计算,Opus 4.8 的同等 Token 账单约 $1.398。这仍然不是质量等价测试,它说明“低成本视觉初筛”与“高分辨率细查”应该被拆成两类工作负载。
什么任务更适合哪一个模型
适合受控测试 DeepSeek V4 Flash Vision Exp 的场景:大量截图、普通文档、图表、类似 OCR 的提取,以及工具循环中的视觉观察;目标是降低成功任务成本,而不是保留每个源像素。
适合 Gemini 3.7 Flash 的场景:同一工作流需要同时处理图片、视频、音频和 PDF,或者依赖 Google 搜索 Grounding、代码执行、File Search、URL Context 与预览版 Computer Use。Gemini 3.7 Flash 是 GA,DeepSeek 视觉端点则明确标注为实验版。
适合 Claude Opus 4.8 的场景:密集文档、细小 UI 元素、Computer Use 和长时间浏览器 Agent,且业务价值足以承担更高单价。Anthropic 的高分辨率视觉可保留最长边 2,576 像素、最多 4,784 个视觉 Token,这也是它不能与 DeepSeek 单图价格直接横比的原因。
实际系统可以分层:先让低价模型完成分类、提取和路由,只把模糊或细节敏感的图片升级到高分辨率模型。但必须测量二次调用、延迟与升级比例;如果大多数图片最终都要升级,双模型管线并不会自动省钱。
图片输入方式与限制
DeepSeek 视觉指南支持三种输入:
- 本地图片用 base64 内联;
- 提供可公开访问的 HTTP 或 HTTPS URL;
- 先上传到 Files API,再复用
file_id。
| 边界 | 限制 |
|---|---|
| 内联请求体 | 48 MiB |
| 单张 base64 或 URL 图片 | 32 MiB |
| 单张 Files API 图片 | 64 MiB |
| 单请求图片数量 | 600 |
不含 file_id 的图片总量 |
64 MiB |
包含 file_id 后的图片总量 |
200 MiB |
| 图片最长边 | 8,192 px;15 张及以上时降至 4,096 px |
| 外部 URL | 最长 8,192 字符,下载须在 60 秒内完成 |
detail: "low" 会先把图片压到 512×512,适合低细节 OCR 或分类。high、original 和目前的 auto 会在常规自动缩放前保留原图。Chat Completions 只允许在 user 消息中放图片;Responses API 还允许 developer 消息与工具输出携带图片,但 system 或 assistant 图片会返回错误。
通过 Modelflare 调用 Responses API
Modelflare 已列出准确模型 ID 与 Responses API 路由。请使用分配到 deepseek-stable 分组的 API Key:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODELFLARE_API_KEY"],
base_url="https://modelflare.dev/v1",
)
response = client.responses.create(
model="deepseek-v4-flash-vision-exp",
input=[
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "读取这张仪表盘,返回三个异常及每个异常在图中可见的证据。",
},
{
"type": "input_image",
"image_url": "https://example.com/dashboard.png",
"detail": "low",
},
],
}
],
)
print(response.output_text)
私有图片应改用 base64 或 Files API,不要把凭据、私有对象 URL 或个人信息写入日志。DeepSeek 的 Responses 实现是无状态的,不支持 previous_response_id、conversation 与 store。函数调用和 Web Search 可用,但内置 Computer Use、Code Interpreter、File Search 与 MCP 会被忽略。
实验视觉模型的生产检查清单
- 固定准确 ID
deepseek-v4-flash-vision-exp,不要把deepseek-v4-flash当成视觉别名。 - 用不含隐私的真实测试集覆盖小字、密集表格、图表、截图、旋转图片和对抗内容。
- 分别测试
detail: "low"与默认设置的任务成功率、延迟和输入账单,而不是只看图片观感。 - 如果客户端使用多个协议,要分别验证 Chat Completions、Responses 与 Messages。
- 验证结构化输出、工具调用关联、流式、取消、拒绝和损坏图片处理。
- 重复使用私有图片时走 Files API,并明确文件保留与删除流程。
- 记录图片数量、尺寸、输入 Token、缓存 Token、输出 Token、重试、延迟、路由和最终费用。
- 在实验模型通过真实流量门槛前,为细节敏感和关键业务保留 GA 回退模型。
HTTP 200 只说明一次请求完成,不能证明截图读对、工具调用经过授权,也不能证明低价路径真的降低了每个成功任务的成本。
DeepSeek V4 Flash Vision Exp 在 Modelflare 的价格
已经可以使用。在 2026 年 8 月 22 日稍后的生产复核中,Modelflare 公共模型与价格目录已列出准确 ID deepseek-v4-flash-vision-exp,开放 deepseek-stable 分组,并支持 OpenAI 兼容的 Chat Completions 与 Responses API。
公开目录以官方高峰参考价配置:输入 $0.44、输出 $1.32、缓存输入 $0.014 / 百万 Token,再应用 deepseek-stable 的 0.9x 分组倍率:
| Modelflare 分组 | 输入 | 缓存输入 | 输出 | 单图达到 384 Token 时的最大未缓存输入成本 |
|---|---|---|---|---|
deepseek-stable |
$0.396 / 1M | $0.0126 / 1M | $1.188 / 1M | $0.000152064 |
按该价格,100K 未缓存文字输入加 10K 输出约为 $0.05148。100 张均达到 384 Token 上限的图片,加 100K 文字输入和 10K 输出,最多约 $0.06669,不含重试或其他请求。
不要把 0.9x 分组价理解成 DeepSeek 直连的低谷时段价格。Modelflare 是对本站配置的参考价应用分组倍率,不会随 DeepSeek 厂商的峰谷时段自动切换。分组权限、价格和路由都可能变化,应以实时价格页与完成请求记录为当前真相。
结论
DeepSeek V4 Flash Vision Exp 的价值在于改变视觉 Agent 的成本结构:单张图片最多 384 Token,并沿用 V4 Flash 单价。对截图初筛、文档提取、图表阅读和高频视觉工具循环,这个差异可能非常实际。
384 Token 上限也正是警示。缩图可能抹掉 Computer Use 和密集文档最需要的细节;端点仍是实验版;发布基准也来自 DeepSeek 自己。更合理的定位是“值得实测的低成本视觉工作节点”,而不是“一个模型替代所有多模态方案”。
官方来源与更新记录
一手来源:
- DeepSeek API 更新日志:V4 Flash Vision Exp
- DeepSeek Vision 指南
- DeepSeek 模型与价格
- DeepSeek Responses API 指南
- Google:Gemini 3.7 Flash 模型页
- Google:Gemini API 价格
- Anthropic:Claude 模型总览
- Anthropic:视觉 Token 与图片限制
更新记录:
- **2026 年 8 月 22 日:**首次发布。已核对官方发布状态、规格、图片处理规则、限制、协议支持、峰谷价格、竞品价格、成本算例与 Modelflare 公共目录可用性。
- **2026 年 8 月 22 日稍后:**准确模型已上线 Modelflare,补充
deepseek-stable0.9x 价格、本站成本算例、支持路由与 Modelflare Responses API 示例。