Qwen3.8-Max 正式发布:2.4T MoE 参数、能力与 Modelflare 配置
详解 Qwen3.8-Max 的 2.4T/95B MoE、1M 多模态上下文、推理参数、Modelflare 当前价格及推荐上线配置。
Qwen 团队于 2026 年 8 月 3 日正式发布 Qwen3.8-Max。它不是容易混淆的旧型号 Qwen3-8B,也不再只是 7 月份的 qwen3.8-max-preview:当前官方 API 模型 ID 已经是 qwen3.8-max,Modelflare 也使用同一个 ID。
这是 Qwen 当前规模最大的 Max 旗舰模型,重点面向 Coding、专业工作流、长程 Agent 与原生多模态任务。官方同时宣布会在下一周发布 Qwen3.8-Max 与 Qwen3.8-27B 的开放权重;在权重仓库和许可证真正公开前,准确说法仍是“已宣布即将开放权重”,而不是已经可以本地部署。
核心参数一览
| 项目 | Qwen3.8-Max |
|---|---|
| Modelflare 模型 ID | qwen3.8-max |
| 架构 | Mixture-of-Experts(MoE) |
| 总参数量 | 2.4T |
| 单 Token 激活参数 | 95B |
| 上下文长度 | 1M tokens |
| 最大非思考输入 | 991K tokens |
| 最大思考模式输入 | 983K tokens |
| 最大输出 | 131K tokens |
| 最大推理 Token | 262K tokens |
| 输入模态 | 文本、图像、视频 |
| 输出模态 | 文本 |
| 推理强度 | low、medium、xhigh;默认 xhigh |
| 官方能力 | Prefix Completion、Function Calling、Context Cache、Structured Outputs、Batch 与 Responses 内置工具 |
2.4T 是模型总参数量,不等于每生成一个 Token 都会运行 2.4T 参数。官方发布文档给出的激活参数是 95B,更适合用来理解 MoE 推理时实际参与计算的规模。上下文同样不能简单理解为“每次都应该塞满 1M tokens”:输入越长、推理预算越大,延迟、缓存策略和费用越需要单独设计。
Qwen3.8-Max 重点提升什么
Qwen 将这次发布定位为 Coding 与 Cowork 的整体升级,重点强调三类能力:
- 从空目录开始执行多日软件工程任务,而不是只生成单个函数;
- 在研究、数据分析、Office、设计等专业工作中组织多步骤交付物;
- 把图像与视频理解放进规划、执行和校验闭环,而不只是做一次静态识别。
官方展示了持续 10 天以上的自主编码、数百轮芯片设计优化等案例。这些是供应商提供的系统级演示,会同时受到 Harness、工具、环境、提示词和评审方法影响,不能据此推导你的应用也会自动得到同样结果。对生产选型更有价值的做法,是用自己的仓库、文档、工具权限和验收标准做固定样本评测。
推理参数怎么选
Qwen3.8-Max 支持 reasoning_effort:
low:适合短问答、轻量代码解释和成本敏感任务;medium:适合作为日常开发、分析和多步骤任务的起点;xhigh:用于高难推理、长程 Agent 和复杂专业任务,默认值也是xhigh。
官方说明 preserve_thinking 默认开启,以便多轮工作继续使用此前的推理状态。客户端如果自行重建消息历史,应保留上游返回的推理字段与工具状态,不要只拼接最终文本。模型的最大推理预算达到 262K tokens,但“上限可用”不等于“默认应该用满”;应通过任务成功率与单位成本决定 effort。
Modelflare 当前开放方式
截至 2026 年 8 月 4 日,Modelflare 的公开目录为 qwen3.8-max 标记了以下协议:
- OpenAI Chat Completions;
- OpenAI Responses;
- Anthropic Messages 兼容入口。
协议标记只说明本站存在对应路由,不证明 QwenCloud 的每个供应商私有能力都会自动透传。特别是官方列出的 web_search、code_interpreter、web_extractor、t2i_search 与 i2i_search 属于 QwenCloud Responses 的内置工具。除非已经针对本站目标路由完成真实请求验证,否则应优先使用客户端定义的 Function Calling,并把内置工具视为待验证能力。
当前 qwen-award 分组的公开价格快照如下,单位均为美元/百万 tokens:
| 计费项 | 价格 |
|---|---|
| 输入 | $1.239 |
| 输出 | $3.71 |
| 缓存读取 | $0.161 |
| 显式缓存创建 | $1.547 |
| 1 小时显式缓存创建 | $2.4752 |
该分组只对具备相应权限的 API Key 可用。价格、分组资格与协议范围可能变化,请以模型与价格实时页面和单请求用量日志为准。
推荐的 Chat Completions 配置
把 Modelflare API Key 放进环境变量:
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
从文本请求开始验证基础链路:
curl -N -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Design a safe rollout plan for this service and include validation and rollback gates."
}
],
"reasoning_effort": "medium",
"stream": true
}'
先使用 medium 建立质量、延迟和费用基线,再只把确实需要更深推理的任务提升到 xhigh。不要因为默认值是 xhigh 就让所有批量请求使用最高推理预算。
多模态请求怎么落地
官方模型接受文本、图像和视频输入,但多模态内容格式会受到具体协议与上游实现影响。建议分三步上线:
- 先用纯文本请求验证鉴权、模型权限、流式响应和计费;
- 再用一张固定测试图片验证输入格式、大小限制和输出;
- 最后才加入长视频、工具调用或多轮视觉反馈,并记录失败重试是否会重复产生费用。
不要把图片 URL、Base64、文件上传和供应商对象存储当成同一种协议。你的客户端实际使用哪种内容块,就应针对哪种内容块做端到端验证。
推荐的平台内配置方案
- 每个应用使用独立 API Key,并确认其主分组确实列出
qwen3.8-max; - 普通开发与分析从
medium开始,短任务可降到low,高难长程任务再升到xhigh; - 长上下文任务先做切片与缓存设计,不要默认把整个知识库塞进单次 1M 上下文;
- Chat Completions、Responses 与 Anthropic 入口分别做 Wire Contract 验证,不能仅凭模型 ID 推断行为一致;
- 供应商内置工具在本站完成真实验证前,不写进生产依赖;
- 用固定任务集比较成功率、首输出、总耗时、推理 Token、缓存命中和单请求费用;
- 为预览版迁移到正式版的应用重新跑回归样本,不要假设同一系列名称意味着输出完全稳定。
适合与不适合的场景
Qwen3.8-Max 适合复杂软件工程、多步骤专业工作流、长文档与视频理解、需要多模态反馈的 Agent,以及希望用一个模型统一推理与工具编排的团队。对于高吞吐、低延迟的简单文本任务,它可能不是最经济的默认选择;此时应与 Qwen Flash、DeepSeek V4 Flash 或其他轻量模型做同样输入下的成本和延迟比较。
资料来源与更新时间
- Qwen3.8-Max 官方发布文章:发布日期、95B 激活参数、Coding/Cowork 案例与开放权重计划;
- QwenCloud Qwen3.8-Max 模型页:上下文、输入输出上限、模态、官方功能与价格;
- Modelflare 模型与价格:本站实时分组、协议与价格。
本文核对时间为 2026 年 8 月 4 日。开放权重状态、模型快照、价格和协议支持都可能变化,生产配置应以调用时的官方模型页、权重仓库许可证和 Modelflare 实时目录为准。