DeepSeek V4.1 Flash 深度分析:架构、Modelflare 价格及与 OpenAI、Anthropic 的对比
基于一手资料拆解 DeepSeek V4.1 Flash 的架构、1M 上下文、384K 输出、Agent 基准与 API 限制,并比较 OpenAI、Anthropic 模型及当前 Modelflare 上线状态和价格。

DeepSeek V4.1 Flash 是一款面向长程 Agent 的低成本、开放权重、多模态模型。它于 2026 年 9 月 10 日发布,拥有 100 万 Token 上下文、最高 384K Token 输出、极低的官方 API 价格,以及同时降低提示词处理量与 KV Cache 压力的架构。它最明确的优势并非赢下所有基准,而是能以很低的单位成本处理长上下文 Agent 任务,同时在代码、终端、自动化和工具调用评测中保持竞争力。
这个结论有清晰边界。下文的基准数字由 DeepSeek 发布,Modelflare 没有进行独立复测。DeepSeek 自己也在报告中承认:面对最困难的推理和边界问题,V4.1 Flash 与最大型闭源模型之间仍有差距。DeepSeek 第一方 API 的正确模型 ID 是 deepseek-flash。DeepSeek V4.1 Flash 目前已经在 Modelflare 上线,版本化模型 ID 为 deepseek-v4.1-flash-0910,可在公开 deepseek-stable 分组使用 Chat Completions 与 Responses。
最后核验:2026-09-10 UTC。价格、别名和目录状态都可能变化。
直接结论:DeepSeek V4.1 Flash 是什么
DeepSeek 发布公告将 DeepSeek V4.1 Flash 定义为此前 Flash 产品线的生产替代型号,官方端点使用 deepseek-flash。旧名称 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp 暂时仍可在 DeepSeek API 中使用,并会按 Flash 价格路由到 V4.1 Flash。DeepSeek 还宣布,从 2026 年 9 月 14 日 04:00 UTC 起,deepseek-v4-pro 请求也会暂时路由到 V4.1 Flash,直至后续 V4.1 Pro 发布。
这项迁移策略只属于 DeepSeek 自有 API。Modelflare 使用明确标记发布日期的 deepseek-v4.1-flash-0910,没有把此前的 deepseek-v4-flash 条目静默改名。Modelflare Owner 已确认上线,公网与源站价格目录也在 2026-09-10 15:21 UTC 同时出现新模型。客户端应使用各自服务商展示的精确 ID,不能假设第一方别名会在所有网关中原样生效。
这款模型的实际身份由五部分组成:图像与文本输入、文本输出、552B 参数的 MoE 主干、额外 196B 参数的 Engram 条件记忆,以及提示词预填充每 Token 激活 8B 参数、解码每 Token 激活 16B 参数的不对称计算。最后一点最关键:对输入很长、频繁重新预填充的 Agent,它应当比同等规模的对称 Decoder-only 路径消耗更少预填充算力。
核心规格一览
下列数据来自官方发布公告、模型卡和技术报告。“主干参数”和“Engram 参数”描述两类不同存储,也都不等于每个 Token 的实际激活计算量。
| 项目 | DeepSeek V4.1 Flash |
|---|---|
| 官方 API ID | deepseek-flash |
| Modelflare 模型 ID | deepseek-v4.1-flash-0910 |
| 模型类型 | 多模态混合专家 Transformer |
| 输入 / 输出 | 文本与图像输入;文本输出 |
| Transformer 结构 | 40 层:20 层因果编码器 + 20 层解码器 |
| 参数存储 | 552B 主干 + 196B Engram 条件记忆 |
| 激活参数 | 预填充每 Token 8B;解码每 Token 16B |
| 上下文 / 最大输出 | 1M / 384K Token |
| 预训练 | 45T 多模态语料 Token;纯文本与多模态 Token 比例 7:1 |
| 主要注意力与缓存设计 | CED + CSA2 + FP4 全局 KV;FP8 局部 SWA KV |
| 全局 KV 占用 | DeepSeek 报告为每 Token 890 字节 |
| 公开推理档位 | low = 50、high = 75、max = 100,对应内部 effort 标尺 |
| 官方 API 并发上限 | 2,500 个并发请求 |
| 许可证 | MIT 模型权重许可证 |
384K 的输出上限是本文所列当前 OpenAI、Anthropic 对比模型 128K 上限的三倍。上限并不等于建议用量:超长输出会增加延迟、费用和内容漂移的空间。对长程 Agent,更有意义的问题是经过多次工具调用后,模型能否保留要求并通过真实验收。
为什么这套架构适合长程 Agent
工具型 Agent 会不断把观察、命令结果和修改加入历史。每一轮都可能再次执行提示词预填充、在不断增长的上下文上做注意力计算、保存 KV,并生成新输出。DeepSeek V4.1 Flash 分别处理这些成本,而不是只依靠缩小模型。
| Agent 成本 | V4.1 Flash 机制 | 预期效果 |
|---|---|---|
| 重复处理长提示词 | Causal Encoder-Decoder(CED) | 按 DeepSeek 分析,长序列的渐近预填充工作量接近减半 |
| 在 HBM 保存全局历史 | CSA2 跨层复用 + FP4 | 减少重复全局 KV 条目及单条目字节数 |
| 持久保存局部注意力状态 | SWA Bounded Replay | 重建有限局部窗口,避免存储每层完整局部缓存 |
| 记忆稳定 Token 模式 | Engram | 把条件式 n-gram 记忆放入稀疏访问表 |
| 生成 Token | DSpark 推测解码 | 并行草拟多个位置,并依据置信度和系统负载决定验证长度 |
| 理解图像 | DeepSeek-ViT + 投影器 | 把视觉输入转成从预训练阶段就与文本共同处理的嵌入 |
这些机制主要改善服务成本和吞吐,并不会自动证明推理更强。模型质量还取决于数据、后训练、Agent 框架和实际购买的推理 effort。
CED:先减少预填充计算,再谈缓存
技术报告把 40 层 Transformer 拆成 20 层因果编码器和 20 层解码器。前两层只使用 128 Token 滑动窗口,其他层把局部滑动窗口注意力与压缩后的全局上下文结合起来。
在全局注意力路径上,解码器不会在每一层都独立构建完整 KV 历史,而是从编码器最终隐藏状态投影全局 Key 和 Value;局部滑动窗口状态仍然按层保留。DeepSeek 估算,长序列预填充的主导计算项因此从所有 Token 经过全部 L 层,变为全局上下文主要经过约 L/2 层,再加上受窗口大小限制的局部计算,整体接近减半。
这也解释了 8B/16B 的激活差异:提示词 Token 在预填充阶段约激活 8B 主干参数,新生成 Token 在解码阶段约激活 16B。超长文档、短答案的任务获益更大;输出数十万 Token 的任务仍然要支付完整解码成本。CED 降低的是账单前半段,不会让生成免费。
CSA2、FP4 与 SWA Bounded Replay:缓存到底省在哪里
Compressed Sparse Attention 2 同时沿序列、层和精度三个维度压缩缓存。每个 CSA2 层会静态分配为三种模式之一。Full 计算主 KV、Indexer Key 和新的 Top-K 位置;Reindex 复用主 KV 与 Indexer Key,但使用自己的 Query 重新评分;Reuse 同时复用共享 KV 和此前选出的稀疏位置。每一层仍保留自己的 Query 与局部滑动窗口 KV。
解码器第一个 Full 层选择 Top-512 条目并建立候选池,后续 Reindex 层再从缩小后的池中选择各自的 Top-512。全局主 KV 使用约四位的 E2M1 表示,每 16 个通道配置一个 E4M3 Scale;对量化更敏感的局部 SWA Cache 则继续使用 FP8。
| 缓存层 | 精度 / 生命周期 | 报告结果 | 不代表什么 |
|---|---|---|---|
| 运行时全局 KV | FP4,驻留 HBM | 每 Token 890 字节;约为 V4 Flash 的 1/4,比 V1 小约 437 倍 | 所有边界输入都能完美选中稀疏位置 |
| 运行时局部 SWA KV | FP8 | 保留每层 128 Token 局部窗口 | 任意并发下都可忽略内存占用 |
| 持久全局 KV | DeepSeek 部署设计中的主机内存或 SSD | 可复用的长生命周期全局状态 | 公开 API 承诺固定保留时间 |
| 持久局部 SWA 状态 | 通过 Bounded Replay 重建 | 相同序列长度下,总持久缓存约为 V4 Flash 的 1/8 | 被丢弃局部状态可以完全无损还原 |
报告描述的部署系统会让全局持久 KV 至少保存 72 小时,并使用分布式短生命周期 SWA Pool;但公开上下文缓存指南称缓存创建是自动且尽力而为,构建可能需要数秒,条目通常会在数小时到数天后清除。生产客户端应以公开契约为准,通过命中和未命中 Token 字段做预算,不要把 72 小时当成 API 保证。
DeepSeek 也明确指出两个鲁棒性边界:CSA2 可能选错稀疏位置,Bounded Replay 对被移除的局部状态只做近似重建。已有评测未发现系统性退化,但极端上下文与缓存恢复边界仍需继续压力测试。
Engram、DSpark 与多模态路径
Engram 把一部分记忆能力从密集模型计算中拆出。V4.1 Flash 在从零计数的第 1 层和第 14 层放置两个条件记忆模块,总计 196B 参数。每个模块使用长度为二、三、四的 Token n-gram、八个哈希头、上下文门控,以及通过 RDMA 从主机内存预取。它们是存储参数,并不是每个 Token 都会额外激活 196B 参数。
DSpark 是单独训练的推测解码器。三个 Transformer Block 查看 128 Token 滑动窗口,并在一次前向过程中并行提出五个位置。轻量依赖头刻画草稿 Token 之间的关系,置信度头估计草稿前缀通过验证的概率;调度器再结合这些概率与实测引擎吞吐,在当前负载下选择验证长度。这样可以提升系统 Token 吞吐,同时仍由主干模型完成最终验证。
视觉路径使用单独训练的 DeepSeek-ViT 和二维旋转位置编码。3×3 Pixel Unshuffle 会在进入语言模型前把视觉 Token 数量缩小九倍。报告配置中的视觉编码器有 32 层、1,024 隐藏维度和 16 个注意力头。在较早的约 47B 图文对比学习之后,其自回归训练阶段会把图像缩放到 544×544 至 1,344×1,344 范围。
预训练与后训练
DeepSeek 报告了 45T 预训练 Token,多模态数据从语言模型预训练阶段就被纳入。纯文本和多模态流水线在去重与重叠替换后,以 7:1 Token 比例合并。稀疏注意力从 64K 序列长度直接开始训练,没有先做密集注意力热身;到 34T Token 时再把上下文扩展到 1M。
| 阶段 | 已公开细节 | 意义 |
|---|---|---|
| 视觉对比预训练 | 约 47B 图文对,低分辨率阶段 | 在语言集成前学习广泛视觉表示 |
| 视觉自回归微调 | 236B Token,包含描述、图表、OCR 等数据 | 加强细粒度视觉与文档理解 |
| LLM 预训练 | 45T Token;多模态数据从一开始加入 | 避免把视觉仅当作后期提示词适配器 |
| 上下文训练 | 从 64K 开始稀疏注意力;34T Token 时扩展到 1M | 直接训练部署时所用注意力模式,而非训练后才转换 |
| 后训练 | SFT、强化学习与 On-policy Distillation | 对齐推理、工具和 Agent 行为 |
技术报告没有把后训练描述为新的算法突破,而是把提升归因于合成任务与环境、数据过滤、可验证奖励,以及架构和数据规模。比较“模型架构”时必须分清:CED 和 CSA2 主要解释效率,最终 Agent 成绩来自训练、数据和 Scaffold 的整体组合。
推理 effort:质量提升有明确 Token 账单
DeepSeek 内部提供 1 到 100 的连续 effort 标尺,公开 API 把 low、high、max 分别映射为 50、75、100。兼容输入中,minimal 与 low 会映射到 low;medium、high、xhigh 映射到 high;max、ultra 映射到 max。思考模式默认使用 high。
在 DeepSeek 公布的扫描结果中,effort 从 25 提高到 100 后,八项推理评测平均成绩从 67.1% 升到 76.3%,DeepSWE 从 66.0% 升到 74.2%,Terminal-Bench 2.1 从 82.4% 升到 90.6%,输出 Token 则增加约 2.5 倍。60–80 区间以不到最高档一半的 Token 预算获得了大部分质量;最后升到 100,会让 Agent 轨迹增长 1.6–1.8 倍,而提升已经较小。
这是 V4.1 Flash 最实用的控制项之一。分类、抽取和可重试探索可从 low 开始;日常代码与研究用 high;只有当重试或遗漏边界的代价高于额外 Token 时,才使用 max。以上只是起点,最终应测量每个验收通过任务的成本。
在思考模式中,temperature、presence penalty、frequency penalty 会被忽略,top_p 最低为 0.95。配合工具时,客户端必须把上一条 Assistant 消息的完整 reasoning_content 与工具结果一同传回;遗漏会得到 400 错误。相比照搬熟悉的 OpenAI 参数,这条状态规则更影响接入是否稳定。
与 OpenAI、Anthropic 的基准对比
下表摘录自 DeepSeek 技术报告表 3,所有模型均使用报告中的 Max 档位。DeepSeek 对部分评测使用了不同的指定或官方 Scaffold;代码任务使用 1M 上下文的 DeepSeek Harness,视觉 Agent 任务使用 512K 上下文的 Claude Code。这些是厂商报告证据,不是独立横评,也不是生产 SLA。
| 评测 | V4 Flash | V4 Pro | V4.1 Flash | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|---|
| GPQA Diamond,Pass@1 | 89.9 | 92.4 | 90.9 | 94.1 | 93.4 |
| Terminal-Bench 2.1,Pass@1 | 82.7 | 87.9 | 90.6 | 88.8 | 89.1 |
| Terminal-Bench 3.0,Pass@1 | 7.6 | 11.8 | 30.0 | 34.4 | 43.3 |
| Terminal-Bench 4.0,Pass@1 | 7.0 | 12.4 | 31.2 | 39.9 | 51.8 |
| DeepSWE v1.1,Resolved | 54.4 | 62.7 | 74.2 | 73.0 | 74.0 |
| CyberGym,Pass@1 | 76.7 | 83.3 | 88.1 | 84.5 | — |
| HLE with tools,Pass@1 | 51.5 | 60.0 | 63.9 | — | 63.6 |
| AutomationBench,Pass@1 | 37.7 | 43.2 | 54.8 | 45.8 | 50.3 |
| Agents' Last Exam,Pass@1 | 25.2 | 25.7 | 31.8 | 26.7 | 28.6 |
| Chartography with tools,Pass@1 | — | — | 78.9 | 79.9 | 84.0 |
最可靠的解读应当具体到任务:V4.1 Flash 在 Agent 项目上相对 V4 Flash 提升明显,并在 DeepSWE、Terminal-Bench 2.1、自动化和工具版 HLE 上与 GPT-5.6 Sol、Claude Opus 5 竞争;它没有领先 GPQA、更新的 Terminal-Bench 3/4 或 Chartography。报告自身也提醒:常见任务接近,不代表最难推理和边界情形已经达到前沿闭源模型水平。
分数表没有加入 GPT-6 Astra 和 Claude Fable 5.1,因为 V4.1 报告没有提供同一行、同一设置下的对应数据。把两个供应商各自发布页上的成绩拼在一起,会制造不存在的统一 Harness。团队应在相同仓库任务、工具、超时、网络策略和验收检查下测试所有候选模型。
API 兼容面很广,但语义并不相同
官方服务同时提供 OpenAI Chat Completions、OpenAI Responses和 Anthropic 兼容 API。这能降低迁移成本,但“兼容”描述的是请求形状,不代表生命周期语义完全一致。
| 接口表面 | DeepSeek V4.1 Flash 行为 | 迁移影响 |
|---|---|---|
| Chat Completions | 支持流式、JSON 输出、函数调用;非思考模式支持 Prefix/FIM | 现有 OpenAI 客户端通常最容易从这里开始 |
| Responses | 无状态;支持函数与图像 | 应用需要自行持久化完整会话 |
| Responses 状态字段 | 不支持或忽略 previous_response_id、conversation、store、background、context management |
返回 200 不证明这些功能真的生效 |
| 托管工具 | 忽略 Web Search、File Search、Code Interpreter、Computer Use、MCP 等内置工具;Custom Tool 支持有限 | 在应用侧执行工具,并逐个验证请求字段 |
| 推理摘要 | 不支持 Summary 与加密推理内容 | 不要依赖 OpenAI 风格的推理交接字段 |
| Anthropic 格式 | 接受 Anthropic Messages 形状 | 仍需保留 DeepSeek 的推理和工具状态规则,不能假设等同 Claude |
| 视觉输入 | 用户输入与工具输出都可包含图像 | 必须检查载荷大小、detail 模式和图像数量 |
DeepSeek Responses 指南还列出 metadata、Prompt Template、truncation、service tier、safety identifier、Prompt Cache Key/Retention、stream options 等被忽略字段。静默忽略尤其危险:Schema 被接受,可能掩盖功能并未执行。应用应该为每项依赖能力准备兼容性请求。OpenAI 兼容 API 指南解释了为什么端点形状与能力验证必须分开。
OpenAI 当前模型拥有更完整的原生 Responses 托管工具和状态能力;Anthropic 原生 API 也有成熟的 Thinking Block 与工具契约。DeepSeek 的优势是同一模型覆盖三种常见接口方言,代价是它只覆盖两家原生功能的较小交集。
视觉限制与图像成本
官方视觉指南支持通过 Base64、外部 URL 或 Files API 输入 JPEG、PNG、GIF、WebP。图像会自动向约 1,300×1,300 调整,每张图最多使用 1,024 个输入 Token。low detail 使用 512×512 视图,high 与 original 保留更多细节,auto 当前等同 original。
| 限制项 | 官方数值 |
|---|---|
| 请求体 | 48 MiB |
| Base64 或外部 URL 图像 | 每张 32 MiB |
| File ID 引用图像 | 每张 64 MiB |
| 单请求图像数 | 600 |
| 图像总字节数 | 不使用 File ID 时 64 MiB;使用时 200 MiB |
| 图像长边 | 8,192 px;发送 15 张及以上时为 4,096 px |
| 视觉 Token 上限 | 处理后每张最多 1,024 Token |
若一张图实际使用满 1,024 个视觉 Token,并按公开输入 Token 价格计费,其未缓存输入约为低峰 $0.0001536 或高峰 $0.0003072,尚未包含文字和输出。这个算式适合做规模估算,实际费用仍会受到缩放、缓存和视觉 Token 用量影响。图像越多,也会挤占原本可用于文字或工具历史的上下文。
V4.1 Flash 适合文档截图、图表、OCR 和视觉 Agent 观察,但它不是图像生成模型。需要返回像素时,应选择专门的生图模型和端点。
官方 API 价格全面对比
DeepSeek 价格页的新价格自 9 月 10 日 04:00 UTC 生效。工作日高峰为 01:00–04:00 与 06:00–10:00 UTC;其他工作日时段和周末按低峰价。DeepSeek 上下文缓存自动运行,因此“缓存输入”指账单报告命中,不是一个可以强制命中的参数。
OpenAI 价格来自其当前模型对比页,Anthropic 价格来自官方定价页。单位均为 USD / 100 万 Token。Anthropic 还会收取 Cache Write 费用;因为本表只比较新输入、缓存读取和输出,所以没有列入写入价格。
| 模型 | 上下文 / 最大输出 | 新输入或未命中 | 缓存读取 | 输出 |
|---|---|---|---|---|
| DeepSeek V4.1 Flash,低峰 | 1M / 384K | $0.15 | $0.003 | $0.60 |
| DeepSeek V4.1 Flash,高峰 | 1M / 384K | $0.30 | $0.006 | $1.20 |
| Modelflare 上的 DeepSeek V4.1 Flash | 模型上限 1M / 384K | $0.193548 | $0.003871 | $0.774194 |
| GPT-5.6 Luna | 1.05M / 128K | $0.20 | $0.02 | $1.20 |
| GPT-5.6 Terra | 1.05M / 128K | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Sol | 1.05M / 128K | $4.00 | $0.40 | $20.00 |
| GPT-6 Astra | 1.05M / 128K | $10.00 | $1.00 | $50.00 |
| Claude Sonnet 5 | 1M / 128K | $2.00 | $0.20 | $10.00 |
| Claude Opus 5 | 1M / 128K | $5.00 | $0.50 | $25.00 |
| Claude Fable 5.1 | 1M / 128K | $10.00 | $0.25 | $50.00 |
价格不等于价值。不同分词器处理同一文本可能产生不同 Token 数;Anthropic 也提示较新 Tokenizer 在部分工作负载中可能多产生约 30% Token。不同模型还可能需要不同输出长度、重试和人工修复。正确指标是每个验收通过任务的成本,而不是只寻找输入单价最低的一行。
Modelflare 当前公开目录只展示一档价格,数值位于 DeepSeek 两个时段之间:相当于第一方高峰价的约 64.5%,即高峰时低约 35.5%;相对 DeepSeek 低峰价则高约 29.0%。目前列出的网关费率没有时间段调整;能够稳定安排到 DeepSeek 低峰窗口的弹性任务,第一方 API 仍可能更便宜。
当输入上下文超过 272K 时,OpenAI 会把整个请求切换到更高费率:输入与缓存输入为 2 倍,输出为 1.5 倍。下面的长上下文算例必须应用这个边界。DeepSeek 使用时间窗口;所引 Anthropic 百万上下文模型价格表没有同样的 272K 分档。
两个可复算的成本场景
场景 A 是一次包含 100K 未缓存输入与 10K 输出的请求,公式为 0.1 × 输入价 + 0.01 × 输出价。它不含缓存读取、工具、重试、税费或供应商附加项目。
| 模型 | 场景 A 费用 |
|---|---|
| DeepSeek V4.1 Flash,低峰 | $0.021 |
| Modelflare 上的 DeepSeek V4.1 Flash | $0.0271 |
| GPT-5.6 Luna | $0.032 |
| DeepSeek V4.1 Flash,高峰 | $0.042 |
| Claude Sonnet 5 | $0.300 |
| GPT-5.6 Terra | $0.320 |
| GPT-5.6 Sol | $0.600 |
| Claude Opus 5 | $0.750 |
| GPT-6 Astra / Claude Fable 5.1 | $1.500 |
场景 B 是一次已有热缓存请求的边际费用:900K 缓存输入、100K 新输入和 20K 输出,刻意排除此前建立缓存的请求。公式为 0.9 × 缓存读取价 + 0.1 × 输入价 + 0.02 × 输出价。输入上下文总量为 100 万 Token,因此 OpenAI 各行对整个请求应用长上下文倍率。
| 模型 | 场景 B 边际费用 |
|---|---|
| DeepSeek V4.1 Flash,低峰 | $0.0297 |
| Modelflare 上的 DeepSeek V4.1 Flash | $0.0383 |
| DeepSeek V4.1 Flash,高峰 | $0.0594 |
| GPT-5.6 Luna | $0.1120 |
| Claude Sonnet 5 | $0.5800 |
| GPT-5.6 Terra | $1.1200 |
| Claude Opus 5 | $1.4500 |
| GPT-5.6 Sol | $2.1200 |
| Claude Fable 5.1 | $2.2250 |
| GPT-6 Astra | $5.3000 |
这些对比固定了 Token 数量,并不声称质量相同。DeepSeek 缓存是尽力而为,Anthropic 建立缓存则有单独的写入价格和有效期。公平测试应记录缓存命中/未命中 Token、全部尝试、包含计费推理在内的总输出、耗时、验收率和人工修正分钟数。用量成本追踪指南提供了对应核算框架。
开放权重不代表自托管规模很小
Hugging Face 模型仓库采用 MIT 许可证,并给出了 vLLM 与 SGLang 服务路径。本文核验的快照包含 48 个 Safetensor 分片,在 Commit dba1be0a40aa45a94ad051997016db3960a90277 下共有约 510.3 GB Git LFS 文件。这个数字只是下载文件快照,不是实测显存占用。
整个系统仍包括 552B 主干、196B 主机寻址 Engram 记忆、专家路由、FP4/FP8 缓存路径、RDMA 预取和持久 KV 存储。DeepSeek 在发布公告中邀请计划使用 2,000 张 GPU 加存储集群做大规模部署的团队与其联系。这个例子体现完整服务系统的规模,并不是所有部署的最低硬件要求。较小研究部署可以尝试量化或其他并行方式,但不能从官方 API 低价反推出自托管也同样简单。
开放权重让团队获得 Checkpoint 访问权、可检查性和部署策略控制权,却不会自动复现 DeepSeek 的 Kernel Fusion、缓存层级、DSpark 调度、Batching 或公开 API 延迟。自托管方案必须以实测吞吐、故障恢复、闲置容量、存储带宽和运维人力做完整比较。
DeepSeek V4.1 Flash 已在 Modelflare 上线
DeepSeek V4.1 Flash 目前已经在 Modelflare 上线。Owner 确认的发布状态,也能在 Modelflare 公开价格目录和源站目录交叉核验。2026-09-10 15:21 UTC,两个入口都已展示新的 deepseek-v4.1-flash-0910 记录;生产配置同时显示 deepseek-stable Ability 已启用,且启用路由明确公布同一个模型。
| Modelflare 项目 | 当前上线值 |
|---|---|
| 请求使用的模型 ID | deepseek-v4.1-flash-0910 |
| 可用状态 | 已进入公开目录并启用生产路由分组 |
| 公开分组 | deepseek-stable |
| 输入价 | $0.193548 / 100 万 Token |
| 缓存输入价 | $0.003871 / 100 万 Token |
| 输出价 | $0.774194 / 100 万 Token |
| 端点类型 | /v1/chat/completions 与 /v1/responses |
这些价格由实时条目的 $0.322580645 基础输入系数、0.6 公开分组倍率、0.02 缓存倍率和 4 倍输出倍率推导。代入上面两个工作负载,Modelflare 费用分别约为 $0.0271 与 $0.0383。当前模型 ID 和费率以实时 DeepSeek V4.1 Flash 价格页为准。
证据层级仍需分开。公开目录和启用的生产路由足以确认产品已经上线,Owner 也已明确确认。截至 15:30 UTC,生产记录中已有 6 次使用精确新 ID 的 Chat Completions 完成调用,合计 216 个输入 Token、173 个输出 Token。这证明鉴权后的 Chat Completions 能完成分发并产生计费用量,但首发样本仍不足以测量延迟或可用率,也不能单独证明该路由的 Responses 与多模态行为。团队迁移自己的生产负载前,仍应在精确端点执行小型验收请求。
DeepSeek V4.1 Flash 真正占优的场景
当长输入、频繁工具轮次和预算同时重要时,V4.1 Flash 的优势最连贯:架构降低预填充与缓存压力,API 价格把这些节省变成极低公开费率,384K 输出上限为长补丁和报告保留空间,开放 Checkpoint 又留下自托管路径。
| 工作负载 | V4.1 Flash 为什么值得测试 | 应测量什么 |
|---|---|---|
| 代码仓库 Agent | 厂商公布的 DeepSWE 与终端成绩强,Token 价格低 | 验收通过修改、测试通过率、重试和修复时间 |
| 长篇研究综合 | 1M 输入、低价缓存命中、384K 输出 | 引用准确度、要求保留度和总输出量 |
| 视觉文档 Agent | 原生图像输入、OCR/图表训练、常见 Agent API | 字段准确度、裁剪/detail 敏感性、视觉 Token 用量 |
| 高并发自动化 | 高峰与低峰价格都低;并发上限 2,500 请求 | 排队时间、429 比例、工具失败和每成功任务成本 |
| 可控部署 | MIT Checkpoint 与已记录的 vLLM/SGLang 路径 | 硬件利用率、缓存/存储带宽和运维成本 |
因此最可信的生产定位是高成本效率的长上下文 Agent,而不是“全领域最强模型”。如果它一次就完成并通过验收,而更小的便宜模型需要多轮修复,V4.1 的结果成本更低;如果前沿闭源模型能阻止一次昂贵失败,更高 Token 价格仍可能更经济。
什么时候 OpenAI 或 Anthropic 更稳妥
当应用依赖完整 Responses 生态、托管状态、内置工具,或某项会被 DeepSeek 忽略的 OpenAI 专属契约时,应选择 OpenAI 模型。GPT-5.6 Luna 是短且未缓存工作负载中价格最接近的竞争者;Terra、Sol、Astra 用更高公开价格提供不同能力层级与原生平台功能。
当 Claude 原生工具/思考契约、缓存控制,或团队在最难 Agent 工作上的实测结果比 Token 标价更重要时,应选择 Anthropic。在 DeepSeek 自己的表格中,Claude Opus 5 领先 Terminal-Bench 3/4 和 Chartography;Claude Fable 5.1 定位于最难长程工作,但新输入和输出单价都明显更高。
涉及安全关键或高成本动作时,应根据已评估的失败模式与权限边界选择路由,不能依据品牌或平均基准。路由指南说明如何区分可重试任务、Fallback 和带副作用的动作。
生产接入检查清单
- 第一方 API 使用
deepseek-flash,网关自有映射另行记录。 - 先以 high 建立基线,再在同一组验收任务上测 low 和 max;不要把不同供应商同名档位当成相同算力。
- 思考模式调用工具时,按要求完整回传
reasoning_content。 - 审计所有依赖的 Responses 字段;被拒绝和被静默忽略需要不同处理。
- 记录缓存命中/未命中、输出/推理 Token、重试、延迟和最终验收结果。
- 用实测命中率设计缓存经济模型,不依赖固定保留时间假设。
- 发送多模态请求前,限制图像字节、数量、尺寸与 detail 模式。
- 应用侧授权、工具幂等和输出校验应独立于模型能力。
- 上线前重新核对时间段价格、模型别名和并发上限。
- 在精确目标路由发起真实鉴权请求;模型目录或 HTTP 200 本身不是能力证明。
常见问题
DeepSeek V4.1 Flash 比 GPT-6 Astra 或 Claude Fable 5.1 强吗? 不能做全局结论。V4.1 Flash 在价格和开放权重上优势巨大,厂商公布的 Agent 成绩也很强;DeepSeek 自己承认,最大型闭源模型在最难推理和边界情形仍然领先。V4.1 报告中也没有同一 Harness 下的 Astra/Fable 对比。
DeepSeek V4.1 Flash 到底有多少参数? 报告列出 552B 主干参数和 196B Engram 参数。预填充每 Token 约激活 8B 主干参数,解码每 Token 约激活 16B。只说“总计 552B”会漏掉 Engram;说“激活 748B”同样错误。
上下文和输出上限是多少? 官方上限为 100 万上下文 Token、最高 384K 输出 Token。图像嵌入、文本、工具历史与推理都会占用相应预算。
为什么叫 Flash? 设计重点是降低服务成本:预填充/解码不对称激活、压缩稀疏注意力、FP4 全局 KV、有限持久重放和推测解码。“Flash”并不承诺任何提示词和排队状态下延迟都最低。
公开缓存会保留 72 小时吗? 不应这样假设。技术报告描述的部署架构至少保留 72 小时;公开 API 文档只承诺自动、尽力而为,并称条目通常在数小时到数天后清理。
Responses API 可以完全无改动替换 OpenAI 吗? 不能。基本请求、函数与图像可用,但它是无状态接口,多个状态字段、托管工具和推理摘要不受支持或会被忽略。必须针对所依赖功能逐项验证。
它可以生成图像吗? 它能理解图像输入并返回文本,但不是图像生成模型。
Modelflare 已经提供 DeepSeek V4.1 Flash 了吗? 已经提供。请在 deepseek-stable 分组使用 deepseek-v4.1-flash-0910,支持 Chat Completions 与 Responses。它是 Modelflare 的版本化 ID,与 DeepSeek 第一方 deepseek-flash 属于不同服务契约。
来源、方法与更新记录
本文优先使用 DeepSeek 发布公告、技术报告、API 价格、思考模式、Responses、Anthropic 兼容接口、视觉指南和缓存指南。对比价格来自 OpenAI 官方模型页与 Anthropic 官方定价页。Modelflare 状态来自公开价格目录。
基准表是 DeepSeek 厂商报告,不是 Modelflare 独立测试;价格场景是可复算数学比较,不代表质量等价或真实账单。本文没有把不同供应商、不同 Harness 的分数强行拼接。无文字主图是 AI 生成的原创编辑插图,不是模型能力样张。
2026-09-10 更新: 首次发布日调研,记录第一方模型 ID、已生效的峰谷价格、9 月 14 日别名迁移公告、当前 API 限制、技术报告架构与基准。同日后续更新补充 Modelflare 已用 deepseek-v4.1-flash-0910 上线、实时网关价格和两组网关成本。实施前应重新核验所有可能变化的信息。