GLM-5.3、Kimi K3 与 Qwen3.8-Max:能力、价格与 API 接入指南
基于一手资料核验 GLM-5.3、Kimi K3 与 Qwen3.8-Max 的能力,整理 Modelflare 当前价格、模型分组、Chat Completions、Responses、Anthropic Messages 接入示例与生产检查。
Modelflare 现已通过统一兼容网关开放 glm-5.3、kimi-k3 与 qwen3.8-max。本文介绍三款模型各自适合的工作、当前美元价格快照、三种请求契约,以及从创建 API Key 到生产探测的稳妥接入路径。
下文会把模型厂商的一手资料与 Modelflare 目录事实分开。厂商声称的能力不自动等于网关已暴露的能力;请始终检查实时模型条目,并测试客户端实际使用的端点。
会变化的模型可用性、分组倍率与价格核验于 2026 年 8 月 29 日。此日期之后请以 Modelflare 定价页为准。
三款模型一览
| 模型 ID | 适合作为起点的工作 | 一手资料中的能力 | 上下文与推理 |
|---|---|---|---|
| glm-5.3 | 复杂编程与长程 Agent 任务 | 智谱将 GLM-5.3 定位于困难编程和更长的 Agent 任务;其 API 保持思考开启 | 思考始终开启;文档列出 low、high、max,默认 max |
| kimi-k3 | 长上下文编程与知识工作 | 月之暗面文档强调原生视觉理解,以及端到端长程工作 | 最长 1M 上下文;思考始终开启;low、high、max,默认 max |
| qwen3.8-max | 专业工作流与长程 Agent | 通义文档列出总参数 2.4T、激活参数 95B 的 MoE,并覆盖编程、视觉输入和工具工作流 | 1M 上下文;支持文本、图片、视频输入和文本输出;部分工具取决于地区与端点 |
可查阅GLM-5.3 发布说明、Kimi 模型选择文档和 Qwen3.8-Max 参考中的厂商原文。厂商基准是其自行报告的结果,不是 Modelflare 的保证。
按工作负载选择
- 当任务需要持续规划、困难代码修改或更长的 Agent 循环,并且预算允许始终开启推理时,选择 glm-5.3。
- 当请求的核心是超大上下文、视觉理解或端到端知识工作循环时,选择 kimi-k3。
- 当需要 1M Token 窗口、多模态输入、结构化工具流程或专业自动化时,选择 qwen3.8-max。
这些只是起点,不构成统一排名。请用隐私安全的自有任务样本回放,并衡量成功任务成本、重试、延迟和审核时间。大上下文限制是上限,不代表每个位置都同样有用或快速。
Modelflare 价格快照
以下为当前公开 Modelflare 分组的 每 100 万 Token 美元价格。分组倍率为 0.8x,与公告所称“官价 × 0.8”一致。
| 模型 | 分组 | 输入 | 输出 | 缓存命中输入 |
|---|---|---|---|---|
| glm-5.3 | glm-stable | $1.12 | $3.52 | 约 $0.21 |
| kimi-k3 | kimi-stable | $2.40 | $12.00 | $0.24 |
| qwen3.8-max | qwen-stable | $1.60 | $4.80 | $0.20 |
数值依据实时目录中的输入价格、补全倍率、缓存倍率和分组倍率计算,并为便于阅读进行四舍五入。若定价页单独展示缓存写入价格,请以该字段计算缓存创建,不要用缓存读取价格反推。
当前三个分组都显示 rpm: 0,表示目录没有配置平台侧固定的分组 RPM 上限;这并不取消上游、账户、网络或安全控制。价格和可用性会变化,请用实时定价页与用量记录对账。
一个网关,三种 API 契约
截至本次快照,Modelflare 目录将三个模型 ID 都标记为支持以下公开格式:
| 契约 | 端点 | 认证 | 适合场景 |
|---|---|---|---|
| OpenAI Chat Completions | POST /v1/chat/completions | Authorization: Bearer | 现有聊天客户端与广泛 SDK 兼容 |
| OpenAI Responses | POST /v1/responses | Authorization: Bearer | 消费 Responses 条目和事件的客户端 |
| Anthropic Messages 兼容 | POST /v1/messages | x-api-key 或 Bearer,并带 anthropic-version | Anthropic 形状的客户端和消息流 |
共享的 OpenAI 兼容 Base URL 是 https://modelflare.dev/v1。Anthropic SDK 通常把 https://modelflare.dev 作为 Base URL,再追加 /v1/messages。端点可用不等于功能完全一致;请分别验证流式事件、工具、结构化输出、多模态输入和推理控制。
通过 Modelflare 接入
- 在 API Keys 中创建或更新 Key,并授予包含目标模型的分组:glm-stable、kimi-stable 或 qwen-stable。
- 把 Key 放在环境变量中,不要写入版本库、浏览器存储或支持工单。
- 用同一个 Key 确认 /v1/models 返回,再使用准确模型 ID 发送一个小型非流式请求。
- 在迁移 Agent 或面向用户的工作负载前,单独测试流式契约。
Chat Completions
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "用三条要点总结迁移风险。"}],
"stream": false
}'
Responses API
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"input": "返回一份数据库安全迁移的简短检查清单。",
"stream": false
}'
Anthropic Messages
curl -sS https://modelflare.dev/v1/messages \
-H "x-api-key: $MODELFLARE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"max_tokens": 256,
"messages": [{"role": "user", "content": "列出前三项发布检查。"}]
}'
示例刻意使用纯文本和 stream: false。只有客户端能够处理对应契约的事件格式后再启用流式。显式 0 和 false 有语义时必须保留;没有核对契约前,不要把某款模型的厂商字段复制给另一款。
生产前核验
- 用同一个 Key 列出模型,确认准确 ID 和分组可见。
- 针对应用实际调用的端点,各运行一次非流式和流式探测。
- 如果工作负载使用工具、结构化输出、图片、视频或推理控制,请在目标模型上逐项测试;一次文本成功不能证明这些能力。
- 从用量记录保存请求状态、所选分组、输入/输出/缓存 Token、延迟、重试和最终扣费。
- 限制应用侧重试次数,并区分临时容量响应与终止性的模型或策略错误。
- 大量调用前重新查看实时定价页;页面和用量记录优先于复制的表格。
常见问题
这些价格是永久的吗? 不是。这是带日期的目录快照,实时定价页才是准确信息源。
rpm: 0 是不是代表流量无限? 不是。它只表示分组没有配置平台侧 RPM 上限;供应商、账户、网络和安全限制仍可能生效。
同一个 payload 能发给三种协议吗? 不能。保留模型 ID,但要根据所选契约调整包体、认证、响应解析和流式处理。
哪些模型有文档证明支持 1M 上下文? Kimi K3 和 Qwen3.8-Max 的一手参考中有明确说明。本文不对 GLM-5.3 作 1M 声明。
来源与更新
- 智谱:GLM-5.3
- Kimi API 模型选择
- 阿里云 Model Studio:Qwen3.8-Max
- Modelflare 实时定价
- Modelflare Qwen3.8-Max 深度指南
- OpenAI 兼容 API 指南
- Responses API 与 Chat Completions 对比
更新记录: 2026 年 8 月 29 日——首次发布;一手能力页面、Modelflare 分组、端点标记和价格均于当日核验。