Grok 4.6 正式发布:API、价格、500K 上下文与开发者指南
基于官方资料核验 Grok 4.6 的准确模型 ID、500K 上下文、Token 价格、推理档位、API 示例、发布基准与生产迁移清单。
xAI 于 2026 年 8 月 12 日发布 Grok 4.6。官方开发者指南列出的 API 模型 ID 是 grok-4.6,上下文窗口为 500,000 Token,支持文本与图片输入、文本输出,并提供 low、medium、high(默认)和 xhigh 四档推理强度。
对开发者而言,值得关注的不只是发布基准。Grok 4.6 同时支持 Responses API 与 Chat Completions;当 Prompt 达到 200,000 Token 时会进入长上下文计价;长时间运行的 Agent 还需要明确设置缓存亲和性并管理上下文。
本文会严格区分 xAI 官方规格、供应商自行发布的基准结果,以及 Modelflare 当前的模型可用性。价格和可用性可能变化,下列时效性信息核验于 2026 年 8 月 13 日。
Grok 4.6 核心规格
| 项目 | 官方信息 |
|---|---|
| 发布日期 | 2026 年 8 月 12 日 |
| API 模型 ID | grok-4.6 |
| 上下文窗口 | 500,000 Token |
| 知识截止日期 | 2026 年 2 月 1 日 |
| 模态 | 文本与图片输入;文本输出 |
| 文本输出限制 | xAI 标注为没有固定的文本输出上限 |
| 推理强度 | low、medium、high(默认)、xhigh |
| API 格式 | Responses API、Chat Completions |
| 文档列出的能力 | 函数调用、结构化输出、网页搜索、X 搜索、代码执行 |
“没有固定的文本输出上限”是模型页面的说明,并不代表任意 SDK、网关、账号或单次请求都能无限输出。客户端超时、账号限额、路由策略和可用上下文仍然有效。
相比 Grok 4.5 有什么变化
xAI 将 Grok 4.6 定位为一次增量式前沿模型更新,重点提升长时间运行的 Agent,以及更复杂的交互与视觉任务。官方发布文介绍了更长的补充训练、重新生成的监督微调轨迹,以及覆盖知识工作、编程、网页开发、内核优化和 CAD 的 Agent 强化学习。
实际迁移时值得评估的变化包括:
- 推理强度在 low、medium、high 之外新增
xhigh; - xAI 声称模型在多步骤研究、跨代码库工作和迭代式应用构建中具有更好的连续性;
- 模型支持图片与文本输入,并输出文本;
- 500K 上下文级别和标准 $2 输入 / $6 输出的起始价格不变,但 Grok 4.6 的缓存输入当前为每百万 Token $0.50,而 Grok 4.5 为 $0.30;
- xAI 建议长 Agent 循环使用会话级缓存亲和性与上下文压缩。
这些变化意味着应该进行受控迁移,而不是直接无条件替换 Grok 4.5。请在自己的工作负载上比较成功任务完成率、延迟、总 Token、工具调用次数和成本。
Grok 4.6 API 价格
xAI 价格页面当前列出的标准美元价格如下,单位均为每百万 Token:
| Prompt 大小 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| 低于 200K Prompt Token | $2.00 | $0.50 | $6.00 |
| 达到或超过 200K Prompt Token | $4.00 | $1.00 | $12.00 |
xAI 表示,一旦 Prompt 达到 200K Token,该请求中的全部 Token 都按长上下文价格计算。三个例子可以直观看出这个边界:
- 100K 输入加 5K 输出,按短上下文标准价格约为 $0.23。
- 如果 100K 输入全部命中缓存,同样的输出约为 $0.08。
- 220K 输入加 10K 输出跨过计价边界,按所列长上下文价格约为 $1.00。
以上示例不包含服务端工具。xAI 当前对网页搜索、X 搜索和代码执行另外收取每 1,000 次 $5。发布文还提到一个按标准价格两倍计费的快速版本。制定预算前,请在 xAI 控制台确认准确模型、服务等级、地区可用性和实时价格。
如需完整的成本方法,可阅读如何计算 LLM Token 成本和AI API 成本追踪。
通过 Responses 或 Chat Completions 调用 Grok 4.6
下列请求使用 xAI 官方 API 端点,因为本文是模型发布指南,不代表该模型已经在所有网关中启用。
Responses API:
export XAI_API_KEY="<YOUR_XAI_API_KEY>"
curl -sS https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6",
"input": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps.",
"prompt_cache_key": "grok-46-migration-review"
}'
Chat Completions:
curl -sS https://api.x.ai/v1/chat/completions \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-H "x-grok-conv-id: grok-46-migration-review" \
-d '{
"model": "grok-4.6",
"messages": [
{
"role": "user",
"content": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps."
}
]
}'
Responses 使用 prompt_cache_key,Chat Completions 使用 x-grok-conv-id 请求头,以提高同一会话的缓存亲和性。请把这些标识当作运维元数据:在单一会话内保持稳定,不写入密钥或个人数据,也不要让无关用户共用同一个值。
如果你还在选择两种传输格式,可以阅读 Responses API 与 Chat Completions 对比。
Prompt 缓存与长 Agent 循环
500K 上下文窗口代表容量,不代表目标。每一轮都发送完整历史会增加延迟,也可能使整个请求进入长上下文价格档位。
对于持续运行的工作流:
- 把稳定指令和可复用上下文放在 Prompt 开头;
- 每个会话使用稳定的缓存亲和性标识;
- 分开记录缓存命中与未命中的输入量;
- 在 Prompt 接近 200K Token 前压缩或总结旧轮次;
- 保留仍然权威的工具结果,删除重复的传输噪音;
- 明确指定推理强度,并比较任务成功率,而不是默认 xhigh 一定更好;
- 按成功任务记录状态、延迟、输入、缓存输入、输出、工具调用和总成本。
上下文压缩会改变模型看到的信息。必须用原始状态核验摘要,并保留权威 ID、约束、已作出的决定和尚未解决的错误。
正确理解发布基准
xAI 在发布公告中给出了以下 Grok 4.6 High 结果:
| 评测 | xAI 公布的 Grok 4.6 分数 |
|---|---|
| Artificial Analysis Intelligence Index | 61 |
| GDPVal-AA v2 | 1753 |
| CursorBench v3.2 | 69.9% |
| DeepSWE v1.1 | 65.9% |
| FrontierCode v1.1 Extended | 61.3% |
| APEX-Agents | 57.5% |
这些是供应商发布的首发结果,并非 Modelflare 独立测试。评测工具、推理设置、工具权限、时间限制和评分版本都会影响可比性。可以用这张表筛选值得实测的工作负载,但不能将其解读为通用质量排名或生产效果保证。
生产迁移检查清单
在把生产流量切到 Grok 4.6 之前:
- 使用准确的
grok-4.6模型 ID,并拒绝静默别名替换; - 确认目标账号、地区、API 格式和服务等级已启用该模型;
- 使用固定且不含隐私数据的评测集同时回放 Grok 4.5 与 Grok 4.6;
- 根据业务实际使用范围,分别测试文本输入、图片输入、函数调用、结构化输出、流式传输、拒绝路径与取消;
- 比较 low、medium、high、xhigh 的成功任务成本与延迟;
- 分别测试刚低于和刚高于 200K Prompt 边界的请求;
- 核验缓存命中、上下文压缩、工具调用次数、重试行为和重复副作用保护;
- 保留回滚路由,并记录每个请求最终使用的模型、路由、用量、延迟和费用。
HTTP 200 只证明某一次请求完成,并不能证明功能完全兼容、延迟稳定、工具行为正确或成本可接受。路由级检查可参考 OpenAI 兼容 API 符合性测试和可靠的 AI API 路由。
Grok 4.6 在 Modelflare 可用吗
可以使用。在 2026 年 8 月 13 日的生产复核中,Modelflare 公共模型与价格目录已列出准确模型 ID grok-4.6,可选 grok-award 与 grok-stable 分组;目录显示支持 OpenAI 兼容的 Chat Completions 和 Responses API 路由。
当时页面显示的分组倍率为:grok-award 0.03x、grok-stable 0.06x。分组权限、路由、价格和可用性都可能变化。由于 xAI 还对长上下文使用单独价格档位,不要把一个宣传倍率或短上下文示例直接套用到所有请求。应以实时价格页面和已完成请求的费用记录为当前真相。
请创建或更新 API Key 并选择可用分组,使用准确的 grok-4.6 ID,先完成一次真实但不含敏感信息的请求,再迁移生产流量。目录上架证明公开配置已经存在,但不等于 Modelflare 独立质量测试,也不保证每一个 API Key 都有权限。
官方来源与更新记录
主要来源:
更新记录:
- 2026 年 8 月 13 日: 首次发布。已核验官方规格、价格、API 格式、发布基准和 Modelflare 模型目录可用性。