DeepSeek V4 Flash 上线:参数、能力与 Modelflare 配置指南

详解 DeepSeek-V4-Flash-0731 的 284B/13B MoE、1M 上下文、思考参数、Modelflare 当前价格及 Chat Completions/Responses 配置。

DeepSeek 已在 2026 年 7 月 31 日把 deepseek-v4-flash 更新为正式 API 公测版本 DeepSeek-V4-Flash-0731。调用 ID 没有变化,但这次更新不只是改名:官方说明它沿用预览版的模型架构与规模,重点通过新的后训练提升 Coding Agent 与工具使用能力,并原生支持 Responses API。

如果你需要一个兼顾推理、长上下文、生成速度和成本的文本模型,V4 Flash 是比 V4 Pro 更偏向高吞吐与日常 Agent 工作负载的选择。下面只区分三类事实:DeepSeek 官方公布的规格、Modelflare 当前开放的协议与价格,以及仍需在你的真实工作负载中验证的行为。

核心参数一览

项目 DeepSeek V4 Flash
Modelflare 模型 ID deepseek-v4-flash
当前官方 API 版本 DeepSeek-V4-Flash-0731
架构 Mixture-of-Experts(MoE)
总参数量 284B
单 Token 激活参数 13B
上下文长度 1M tokens
最大输出 384K tokens
思考模式 默认开启,默认 effort 为 high
可选推理强度 lowhighmaxxhigh 当前映射为 high
官方 API 能力 JSON Output、Tool Calls、Responses API、Chat Prefix Completion;FIM 仅支持非思考模式
主要输入输出 文本输入、文本输出;不要据此推断图像输入能力

这里最值得关注的不是 284B 总参数本身,而是 13B 激活参数与 1M 上下文的组合。MoE 每次只激活部分专家参数,目标是在保留模型容量的同时控制单 Token 推理成本。DeepSeek 的技术报告还说明,V4 使用面向长上下文效率的新注意力设计;这类架构优势最终能否转化为更低延迟,仍取决于输入长度、推理强度、上游负载和输出规模。

这次 0731 更新了什么

DeepSeek 将 0731 描述为只做了重新后训练、没有改变模型架构和规模的版本。官方公布的 Agent 评测包括 Terminal Bench 2.1 为 82.7、Toolathlon Verified 为 70.3,并强调 V4 Flash 的 Agent 能力已经明显超过早期 V4 Pro Preview。

这些数字适合用来理解发布方向,不应直接当作你的生产 SLA。官方 Code Agent 结果使用了特定 Harness、max effort、top_p=0.95temperature=1.0;其中部分数据集还是内部评测。真实选型仍应固定模型 ID、客户端、工具集、超时与任务样本,记录成功率、首输出时间、总耗时、Token 和返工次数。

思考模式与参数怎么选

V4 Flash 默认开启思考模式,默认推理强度为 high。常见配置可以这样分:

  • 摘要、分类、格式转换等短任务:先试 low,观察质量是否满足要求;
  • 代码修改、复杂分析和多步工具任务:从 high 开始;
  • 少量高难任务:再评估 max,同时为更长延迟和更多推理 Token 留出预算;
  • 明确只需要快速直答:通过 thinking.type=disabled 关闭思考,而不是依赖旧的 deepseek-chat 别名。

思考模式下,temperaturetop_ppresence_penaltyfrequency_penalty 即使被接受也不会生效。带工具的多轮对话还要保留并回传同一轮的 reasoning_content;遗漏后,上游可能返回 400。如果客户端无法正确维护该字段,先使用不带工具的请求验证基础链路。

Modelflare 当前开放方式

截至 2026 年 8 月 4 日,Modelflare 的公开目录为 deepseek-v4-flash 标记了 Chat Completions 与 Responses 两类入口。DeepSeek 官方同时提供 Anthropic 格式,并不代表本站当前也为这个模型开放同一入口;请以模型与价格页面显示的协议为准。

当前公开价格快照如下,单位均为美元/百万 tokens:

可用分组 输入 输出 缓存命中输入 说明
deepseek-award $0.105 $0.21 $0.0021 仅对具备该分组权限的 API Key 可用
deepseek-stable $0.15 $0.30 $0.003 稳定分组

价格、分组权限和开放协议可能调整。应用不应把这张快照写死为长期计费依据;上线前请重新检查实时目录,并在用量日志中核对实际分组、Token 与费用。

Chat Completions 配置

先把 Modelflare API Key 放进环境变量:

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

使用标准公开 Base URL 调用:

curl -N -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {"role": "system", "content": "You are a careful coding assistant."},
      {"role": "user", "content": "Review this migration plan and list the rollback risks."}
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high",
    "stream": true
  }'

如果 OpenAI SDK 没有直接暴露 thinking,把它放到 SDK 的 extra_body 中。模型专有字段应作为原始 JSON 透传;不要在客户端重新命名或把显式的 false 丢掉。

Responses API 配置

V4 Flash 当前也可以走 Modelflare 的 Responses 入口:

curl -N -sS https://modelflare.dev/v1/responses \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-flash",
    "input": "Inspect the proposed deployment sequence and identify unsafe assumptions.",
    "reasoning": {"effort": "high"},
    "stream": true
  }'

Chat Completions 与 Responses 是不同的 Wire Contract。不能因为同一个模型同时出现在两个入口,就假设事件类型、工具状态、错误结构或续写方式完全相同。生产接入时应分别验证非流式、流式和工具调用。

推荐的平台内配置方案

  1. 为每个应用创建独立 Modelflare API Key,选择确实包含 deepseek-v4-flash 的主分组;
  2. 只有回退分组也支持同一模型和同一协议时,才把它加入有序回退;
  3. 普通文本任务默认从 low 或非思考模式开始,复杂 Agent 任务从 high 开始;
  4. 客户端超时要覆盖长思考与长输出,不要用一条短提示词的耗时作为生产上限;
  5. 使用工具时保留模型返回的完整 assistant 消息,尤其是 reasoning_contenttool_calls
  6. 上线前用真实任务检查成功率、首输出、总耗时、输出 Token、所选分组与单请求费用。

适合与不适合的场景

V4 Flash 适合高频代码辅助、长文档分析、带工具的 Agent、批量文本处理,以及希望在能力与成本之间取得平衡的应用。对于最难的知识密集型问题或长程自主任务,仍应把 V4 Pro 或其他旗舰模型作为对照;对于视觉输入,则应选择已经明确公布并在本站验证了多模态协议的模型。

资料来源与更新时间

本文核对时间为 2026 年 8 月 4 日。模型快照、价格与协议支持都可能变化,生产配置应以调用时的官方文档和 Modelflare 实时目录为准。