Grok 4.6 正式发布:API、价格、500K 上下文与开发者指南

基于官方资料核验 Grok 4.6 的准确模型 ID、500K 上下文、Token 价格、推理档位、API 示例、发布基准与生产迁移清单。

xAI 于 2026 年 8 月 12 日发布 Grok 4.6官方开发者指南列出的 API 模型 ID 是 grok-4.6,上下文窗口为 500,000 Token,支持文本与图片输入、文本输出,并提供 low、medium、high(默认)和 xhigh 四档推理强度。

对开发者而言,值得关注的不只是发布基准。Grok 4.6 同时支持 Responses API 与 Chat Completions;当 Prompt 达到 200,000 Token 时会进入长上下文计价;长时间运行的 Agent 还需要明确设置缓存亲和性并管理上下文。

本文会严格区分 xAI 官方规格、供应商自行发布的基准结果,以及 Modelflare 当前的模型可用性。价格和可用性可能变化,下列时效性信息核验于 2026 年 8 月 13 日。

Grok 4.6 核心规格

项目 官方信息
发布日期 2026 年 8 月 12 日
API 模型 ID grok-4.6
上下文窗口 500,000 Token
知识截止日期 2026 年 2 月 1 日
模态 文本与图片输入;文本输出
文本输出限制 xAI 标注为没有固定的文本输出上限
推理强度 low、medium、high(默认)、xhigh
API 格式 Responses API、Chat Completions
文档列出的能力 函数调用、结构化输出、网页搜索、X 搜索、代码执行

“没有固定的文本输出上限”是模型页面的说明,并不代表任意 SDK、网关、账号或单次请求都能无限输出。客户端超时、账号限额、路由策略和可用上下文仍然有效。

相比 Grok 4.5 有什么变化

xAI 将 Grok 4.6 定位为一次增量式前沿模型更新,重点提升长时间运行的 Agent,以及更复杂的交互与视觉任务。官方发布文介绍了更长的补充训练、重新生成的监督微调轨迹,以及覆盖知识工作、编程、网页开发、内核优化和 CAD 的 Agent 强化学习。

实际迁移时值得评估的变化包括:

  • 推理强度在 low、medium、high 之外新增 xhigh
  • xAI 声称模型在多步骤研究、跨代码库工作和迭代式应用构建中具有更好的连续性;
  • 模型支持图片与文本输入,并输出文本;
  • 500K 上下文级别和标准 $2 输入 / $6 输出的起始价格不变,但 Grok 4.6 的缓存输入当前为每百万 Token $0.50,而 Grok 4.5 为 $0.30;
  • xAI 建议长 Agent 循环使用会话级缓存亲和性与上下文压缩。

这些变化意味着应该进行受控迁移,而不是直接无条件替换 Grok 4.5。请在自己的工作负载上比较成功任务完成率、延迟、总 Token、工具调用次数和成本。

Grok 4.6 API 价格

xAI 价格页面当前列出的标准美元价格如下,单位均为每百万 Token:

Prompt 大小 输入 缓存输入 输出
低于 200K Prompt Token $2.00 $0.50 $6.00
达到或超过 200K Prompt Token $4.00 $1.00 $12.00

xAI 表示,一旦 Prompt 达到 200K Token,该请求中的全部 Token 都按长上下文价格计算。三个例子可以直观看出这个边界:

  • 100K 输入加 5K 输出,按短上下文标准价格约为 $0.23
  • 如果 100K 输入全部命中缓存,同样的输出约为 $0.08
  • 220K 输入加 10K 输出跨过计价边界,按所列长上下文价格约为 $1.00

以上示例不包含服务端工具。xAI 当前对网页搜索、X 搜索和代码执行另外收取每 1,000 次 $5。发布文还提到一个按标准价格两倍计费的快速版本。制定预算前,请在 xAI 控制台确认准确模型、服务等级、地区可用性和实时价格。

如需完整的成本方法,可阅读如何计算 LLM Token 成本AI API 成本追踪

通过 Responses 或 Chat Completions 调用 Grok 4.6

下列请求使用 xAI 官方 API 端点,因为本文是模型发布指南,不代表该模型已经在所有网关中启用。

Responses API:

export XAI_API_KEY="<YOUR_XAI_API_KEY>"

curl -sS https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.6",
    "input": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps.",
    "prompt_cache_key": "grok-46-migration-review"
  }'

Chat Completions:

curl -sS https://api.x.ai/v1/chat/completions \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -H "x-grok-conv-id: grok-46-migration-review" \
  -d '{
    "model": "grok-4.6",
    "messages": [
      {
        "role": "user",
        "content": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps."
      }
    ]
  }'

Responses 使用 prompt_cache_key,Chat Completions 使用 x-grok-conv-id 请求头,以提高同一会话的缓存亲和性。请把这些标识当作运维元数据:在单一会话内保持稳定,不写入密钥或个人数据,也不要让无关用户共用同一个值。

如果你还在选择两种传输格式,可以阅读 Responses API 与 Chat Completions 对比

Prompt 缓存与长 Agent 循环

500K 上下文窗口代表容量,不代表目标。每一轮都发送完整历史会增加延迟,也可能使整个请求进入长上下文价格档位。

对于持续运行的工作流:

  1. 把稳定指令和可复用上下文放在 Prompt 开头;
  2. 每个会话使用稳定的缓存亲和性标识;
  3. 分开记录缓存命中与未命中的输入量;
  4. 在 Prompt 接近 200K Token 前压缩或总结旧轮次;
  5. 保留仍然权威的工具结果,删除重复的传输噪音;
  6. 明确指定推理强度,并比较任务成功率,而不是默认 xhigh 一定更好;
  7. 按成功任务记录状态、延迟、输入、缓存输入、输出、工具调用和总成本。

上下文压缩会改变模型看到的信息。必须用原始状态核验摘要,并保留权威 ID、约束、已作出的决定和尚未解决的错误。

正确理解发布基准

xAI 在发布公告中给出了以下 Grok 4.6 High 结果:

评测 xAI 公布的 Grok 4.6 分数
Artificial Analysis Intelligence Index 61
GDPVal-AA v2 1753
CursorBench v3.2 69.9%
DeepSWE v1.1 65.9%
FrontierCode v1.1 Extended 61.3%
APEX-Agents 57.5%

这些是供应商发布的首发结果,并非 Modelflare 独立测试。评测工具、推理设置、工具权限、时间限制和评分版本都会影响可比性。可以用这张表筛选值得实测的工作负载,但不能将其解读为通用质量排名或生产效果保证。

生产迁移检查清单

在把生产流量切到 Grok 4.6 之前:

  1. 使用准确的 grok-4.6 模型 ID,并拒绝静默别名替换;
  2. 确认目标账号、地区、API 格式和服务等级已启用该模型;
  3. 使用固定且不含隐私数据的评测集同时回放 Grok 4.5 与 Grok 4.6;
  4. 根据业务实际使用范围,分别测试文本输入、图片输入、函数调用、结构化输出、流式传输、拒绝路径与取消;
  5. 比较 low、medium、high、xhigh 的成功任务成本与延迟;
  6. 分别测试刚低于和刚高于 200K Prompt 边界的请求;
  7. 核验缓存命中、上下文压缩、工具调用次数、重试行为和重复副作用保护;
  8. 保留回滚路由,并记录每个请求最终使用的模型、路由、用量、延迟和费用。

HTTP 200 只证明某一次请求完成,并不能证明功能完全兼容、延迟稳定、工具行为正确或成本可接受。路由级检查可参考 OpenAI 兼容 API 符合性测试可靠的 AI API 路由

Grok 4.6 在 Modelflare 可用吗

可以使用。在 2026 年 8 月 13 日的生产复核中,Modelflare 公共模型与价格目录已列出准确模型 ID grok-4.6,可选 grok-awardgrok-stable 分组;目录显示支持 OpenAI 兼容的 Chat Completions 和 Responses API 路由。

当时页面显示的分组倍率为:grok-award 0.03x、grok-stable 0.06x。分组权限、路由、价格和可用性都可能变化。由于 xAI 还对长上下文使用单独价格档位,不要把一个宣传倍率或短上下文示例直接套用到所有请求。应以实时价格页面和已完成请求的费用记录为当前真相。

请创建或更新 API Key 并选择可用分组,使用准确的 grok-4.6 ID,先完成一次真实但不含敏感信息的请求,再迁移生产流量。目录上架证明公开配置已经存在,但不等于 Modelflare 独立质量测试,也不保证每一个 API Key 都有权限。

官方来源与更新记录

主要来源:

更新记录:

  • 2026 年 8 月 13 日: 首次发布。已核验官方规格、价格、API 格式、发布基准和 Modelflare 模型目录可用性。