Qwen3.8-Max 正式发布:2.4T MoE 参数、能力与 Modelflare 配置

详解 Qwen3.8-Max 的 2.4T/95B MoE、1M 多模态上下文、推理参数、Modelflare 当前价格及推荐上线配置。

Qwen 团队于 2026 年 8 月 3 日正式发布 Qwen3.8-Max。它不是容易混淆的旧型号 Qwen3-8B,也不再只是 7 月份的 qwen3.8-max-preview:当前官方 API 模型 ID 已经是 qwen3.8-max,Modelflare 也使用同一个 ID。

这是 Qwen 当前规模最大的 Max 旗舰模型,重点面向 Coding、专业工作流、长程 Agent 与原生多模态任务。官方同时宣布会在下一周发布 Qwen3.8-Max 与 Qwen3.8-27B 的开放权重;在权重仓库和许可证真正公开前,准确说法仍是“已宣布即将开放权重”,而不是已经可以本地部署。

核心参数一览

项目 Qwen3.8-Max
Modelflare 模型 ID qwen3.8-max
架构 Mixture-of-Experts(MoE)
总参数量 2.4T
单 Token 激活参数 95B
上下文长度 1M tokens
最大非思考输入 991K tokens
最大思考模式输入 983K tokens
最大输出 131K tokens
最大推理 Token 262K tokens
输入模态 文本、图像、视频
输出模态 文本
推理强度 lowmediumxhigh;默认 xhigh
官方能力 Prefix Completion、Function Calling、Context Cache、Structured Outputs、Batch 与 Responses 内置工具

2.4T 是模型总参数量,不等于每生成一个 Token 都会运行 2.4T 参数。官方发布文档给出的激活参数是 95B,更适合用来理解 MoE 推理时实际参与计算的规模。上下文同样不能简单理解为“每次都应该塞满 1M tokens”:输入越长、推理预算越大,延迟、缓存策略和费用越需要单独设计。

Qwen3.8-Max 重点提升什么

Qwen 将这次发布定位为 Coding 与 Cowork 的整体升级,重点强调三类能力:

  • 从空目录开始执行多日软件工程任务,而不是只生成单个函数;
  • 在研究、数据分析、Office、设计等专业工作中组织多步骤交付物;
  • 把图像与视频理解放进规划、执行和校验闭环,而不只是做一次静态识别。

官方展示了持续 10 天以上的自主编码、数百轮芯片设计优化等案例。这些是供应商提供的系统级演示,会同时受到 Harness、工具、环境、提示词和评审方法影响,不能据此推导你的应用也会自动得到同样结果。对生产选型更有价值的做法,是用自己的仓库、文档、工具权限和验收标准做固定样本评测。

推理参数怎么选

Qwen3.8-Max 支持 reasoning_effort

  • low:适合短问答、轻量代码解释和成本敏感任务;
  • medium:适合作为日常开发、分析和多步骤任务的起点;
  • xhigh:用于高难推理、长程 Agent 和复杂专业任务,默认值也是 xhigh

官方说明 preserve_thinking 默认开启,以便多轮工作继续使用此前的推理状态。客户端如果自行重建消息历史,应保留上游返回的推理字段与工具状态,不要只拼接最终文本。模型的最大推理预算达到 262K tokens,但“上限可用”不等于“默认应该用满”;应通过任务成功率与单位成本决定 effort。

Modelflare 当前开放方式

截至 2026 年 8 月 4 日,Modelflare 的公开目录为 qwen3.8-max 标记了以下协议:

  • OpenAI Chat Completions;
  • OpenAI Responses;
  • Anthropic Messages 兼容入口。

协议标记只说明本站存在对应路由,不证明 QwenCloud 的每个供应商私有能力都会自动透传。特别是官方列出的 web_searchcode_interpreterweb_extractort2i_searchi2i_search 属于 QwenCloud Responses 的内置工具。除非已经针对本站目标路由完成真实请求验证,否则应优先使用客户端定义的 Function Calling,并把内置工具视为待验证能力。

当前 qwen-award 分组的公开价格快照如下,单位均为美元/百万 tokens:

计费项 价格
输入 $1.239
输出 $3.71
缓存读取 $0.161
显式缓存创建 $1.547
1 小时显式缓存创建 $2.4752

该分组只对具备相应权限的 API Key 可用。价格、分组资格与协议范围可能变化,请以模型与价格实时页面和单请求用量日志为准。

推荐的 Chat Completions 配置

把 Modelflare API Key 放进环境变量:

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

从文本请求开始验证基础链路:

curl -N -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Design a safe rollout plan for this service and include validation and rollback gates."
      }
    ],
    "reasoning_effort": "medium",
    "stream": true
  }'

先使用 medium 建立质量、延迟和费用基线,再只把确实需要更深推理的任务提升到 xhigh。不要因为默认值是 xhigh 就让所有批量请求使用最高推理预算。

多模态请求怎么落地

官方模型接受文本、图像和视频输入,但多模态内容格式会受到具体协议与上游实现影响。建议分三步上线:

  1. 先用纯文本请求验证鉴权、模型权限、流式响应和计费;
  2. 再用一张固定测试图片验证输入格式、大小限制和输出;
  3. 最后才加入长视频、工具调用或多轮视觉反馈,并记录失败重试是否会重复产生费用。

不要把图片 URL、Base64、文件上传和供应商对象存储当成同一种协议。你的客户端实际使用哪种内容块,就应针对哪种内容块做端到端验证。

推荐的平台内配置方案

  1. 每个应用使用独立 API Key,并确认其主分组确实列出 qwen3.8-max
  2. 普通开发与分析从 medium 开始,短任务可降到 low,高难长程任务再升到 xhigh
  3. 长上下文任务先做切片与缓存设计,不要默认把整个知识库塞进单次 1M 上下文;
  4. Chat Completions、Responses 与 Anthropic 入口分别做 Wire Contract 验证,不能仅凭模型 ID 推断行为一致;
  5. 供应商内置工具在本站完成真实验证前,不写进生产依赖;
  6. 用固定任务集比较成功率、首输出、总耗时、推理 Token、缓存命中和单请求费用;
  7. 为预览版迁移到正式版的应用重新跑回归样本,不要假设同一系列名称意味着输出完全稳定。

适合与不适合的场景

Qwen3.8-Max 适合复杂软件工程、多步骤专业工作流、长文档与视频理解、需要多模态反馈的 Agent,以及希望用一个模型统一推理与工具编排的团队。对于高吞吐、低延迟的简单文本任务,它可能不是最经济的默认选择;此时应与 Qwen Flash、DeepSeek V4 Flash 或其他轻量模型做同样输入下的成本和延迟比较。

资料来源与更新时间

本文核对时间为 2026 年 8 月 4 日。开放权重状态、模型快照、价格和协议支持都可能变化,生产配置应以调用时的官方模型页、权重仓库许可证和 Modelflare 实时目录为准。