Grok 4.7:规格、能力、基准与 Modelflare 价格

按公开资料说明 Grok 4.7 的规格、推理档位、发布基准、官方 Token 价格,以及 2026 年 9 月 21 日核对的 Modelflare grok-award 与 grok-stable 价格。

xAI 于 2026 年 9 月 21 日发布 Grok 4.7。API 模型 ID 是 grok-4.7。它是 xAI 目前面向编程、Agent 工具调用和知识工作的旗舰模型。同一天,Modelflare 的公开价格目录已经列出这个 ID。

本文把三层信息分开。规格以 xAI 文档为准。基准表是 xAI 在发布文里自行给出的分数。Modelflare 价格是 2026 年 9 月 21 日 GET /api/pricing 的公开返回。厂商分数不是 Modelflare 的独立测试,目录里有这一行也不表示每把密钥、每条路由、每条提示都会得到同样的结果。

xAI 没有公布 Grok 4.7 的参数量、层数或训练 Token 总量。“比 Grok 4.6 更大”只是官方对新基座模型的定性描述。下面的对比只使用已经公开的数字:上下文、Token 价格、推理档位、模态,以及发布分数。

这次发布了什么

发布文把 Grok 4.7 描述为相对 Grok 4.6 的新的、更大的基座模型,并用更长的强化学习继续训练。任务组合更难,权重偏向需要许多小时才能完成的问题。xAI 表示,模型更擅长核对自己的工作、管理长上下文,并且针对对话场景使用的 Grok Bot 运行框架做了专门训练。

发布文里的两句话不能合成一句。标题写的是“速度是同类模型的两倍,价格是一半”。正文写的是:它以与 Grok 4.6 相同的价格和速度提供服务。Token 价格表支持后一句话:两者的标价都是每百万输入 Token 2 美元、每百万输出 Token 6 美元。标题里的比较对象,是同一张表里标价更高的其他模型。xAI 没有在“快一倍”旁边给出每秒 Token 数,所以本文不把这句宣传语当成已经测得的延迟结果。

grok-4.7 已在 xAI API、Cursor 中提供,并且是 Grok Build 的默认模型。另有一条 Fast 服务路径,只在 Cursor 和 Grok Build 中提供。它不在公开的 xAI API 上,本次核对的 Modelflare 目录里也没有这个 ID。

规格对比

下表是 xAI 公布的美元标价,单位为每百万 Token。“短上下文”指提示不足 20 万 Token。“长上下文”指提示达到 20 万 Token。按价格表,一旦越过这条线,本次请求里的全部 Token 都改用长上下文价格,不是只对超出的部分改价。

项目 grok-4.7 grok-4.6 grok-4.5
上下文窗口 500,000 Token 500,000 Token 500,000 Token
短上下文输入 / 缓存输入 / 输出 $2.00 / $0.50 / $6.00 $2.00 / $0.50 / $6.00 $2.00 / $0.30 / $6.00
长上下文输入 / 缓存输入 / 输出 $4.00 / $1.00 / $12.00 $4.00 / $1.00 / $12.00 $4.00 / $0.60 / $12.00
推理强度 low、medium、high(默认)、xhigh low、medium、high(默认)、xhigh low、medium、high(默认)

同一天在模型页核对到的 Grok 4.7 细节:

  • 输入是文本和图片,输出是文本。模型本身不生成图片。
  • 页面写明没有固定的文本输出上限。客户端超时、账号限额和剩余上下文仍然有效。
  • 知识截止日期是 2026 年 5 月。没有打开搜索工具时,模型不知道此后的事件。
  • 文档列出的接口是 Responses API 和 Chat Completions。
  • 文档列出的工具包括函数调用、网页搜索、X 搜索和代码执行。
  • 推理不能关闭。不传强度时,默认是 high
  • 在 Responses API 上,即使请求没有要求,grok-4.7 也会返回 reasoning.encrypted_content。后续轮次应原样带回这些推理项。Chat Completions 没有这项行为。

Grok 4.5 的最高档是 high。Grok 4.6 和 Grok 4.7 增加了 xhigh。缓存输入标价也变了:Grok 4.5 在短上下文是 $0.30、长上下文是 $0.60;Grok 4.6 和 Grok 4.7 是 $0.50 和 $1.00。这三个 ID 的标准输入和输出标价没有变化。

能力维度

编程与长时间 Agent

发布文把 Grok 4.7 指向需要长时间运行的工作:多步编程、在宣布完成之前核对自己的结果,以及把很长的上下文保持住。下面的编程分数都来自 xAI 的发布表:

  • CursorBench 4.0,侧重更长的编程任务:xHigh 为 46.3%。Grok 4.6 High 为 40.4%,GPT-5.6 Sol Max 为 41.7%,Fable 5.1 Max 为 51.8%。
  • DeepSWE v1.1:71.0%。xAI 标注这是 high 强度的分数,不是 xHigh。Grok 4.6 为 65.2%,Sol 为 72.7%,Fable 5.1 为 70.0%。
  • Terminal-Bench 4.0:38.0%。Grok 4.6 为 20.3%,Sol 为 37.3%,Fable 5.1 为 57.9%。
  • EEBench,电气工程:64.0%。Grok 4.6 为 53.0%,Sol 为 39.4%,Fable 5.1 为 56.4%。

这些行用来看厂商认为模型移动到了哪里,不能当成你的仓库会得到的分数。在 CursorBench 上,xAI 称之为价格性能的前沿:分数高于 Sol 和 Grok 4.6,低于 Fable 5.1,标价则明显低于后两者。DeepSWE 接近 Fable,仍低于 Sol,而且不是 xHigh 的数字。终端任务相对 Grok 4.6 提升很大,和 Sol 接近,Fable 5.1 在这一行仍明显领先。EEBench 是这张表里最清楚的领先项。

专业知识和办公工作

xAI 同时给出了办公和专业任务:

  • AA Briefcase v1.1,多小时办公工作:1,657。Grok 4.6 为 1,546,Sol 为 1,487,Fable 5.1 为 1,678。
  • Harvey Legal Agent Benchmark:19.6%。Grok 4.6 为 15.8%,Sol 为 2.5%,Fable 5.1 为 6.7%。领跑这张表,仍然大约是五分之一的题目。这不能说明模型可以在无人复核的情况下承担法律工作。
  • HealthBench Professional,临床推理:56.7%。Grok 4.6 为 48.5%,Sol 为 60.5%,Fable 5.1 为 62.1%。这一行 Grok 4.7 高于前代,低于两个对照模型。

发布文还说,Grok 4.7 更擅长文档和演示文稿,在 GDPval 上优于 Grok 4.6,并与其他前沿模型处于同一区间。正文没有印出 GDPval 的具体分数,本文也不补一个数字。

Grok 4.7 的发布文里没有单一的智力指数。Grok 4.6 更早的发布文曾给出 Artificial Analysis Intelligence Index。这一次用上面的任务表代替了那个单一数字。应挑选和工作匹配的那一行。同一次发布里,模型可以在电气工程上领先,同时在临床推理上落后。

推理强度

reasoning_effort 可以是 lowmediumhighxhigh。默认是 high。xAI 把 low 描述为更轻的档位,把 medium 描述为延迟没那么敏感时使用的更多思考,把 high 描述为面向困难多步问题的档位,把 xhigh 描述为最深的档位:延迟最高,适合答案质量比响应时间更重要的问题。

更高的强度通常意味着更多推理 Token,而输出 Token 是标价里更贵的一侧。xhigh 不会自动成为正确的生产默认值。先在自己的提示上比较任务成功率、延迟和总 Token,再决定是否长期打开它。

多轮 Responses 对话应把加密推理项放进下一次请求。丢掉它们,等于丢掉模型得出上一答案时使用的上下文。Chat Completions 不会返回这个加密字段。

工具、图片和记忆

函数调用是你自己实现的工具路径。你声明函数,模型提出调用,应用程序执行,再把结果送回去。网页搜索、X 搜索和代码执行由 xAI 托管。模型可以自己发起这些调用,每次调用都在 Token 之外单独计价。

图片可以作为输入发送。模型页摘要没有单独的图片价格。图片输入占用上下文,并出现在该次请求的 Token 用量里。图片生成属于另一套 Grok Imagine 模型。

50 万 Token 是窗口,不是应当填满的预算。xAI 建议在 Responses API 上使用稳定的 prompt_cache_key,在直连 Chat Completions 上使用 x-grok-conv-id 请求头,让同一段对话更可能落到同一台服务器并命中缓存。没有这种亲和性时,缓存未热的服务器会按完整输入价格计费。长循环还应压缩较早的轮次。压缩会改变模型能看到的内容。摘要必须对照原来的约束、ID、已做决定和尚未解决的错误进行核验。

2026 年 5 月的截止日期是记忆知识的硬边界。更新的信息必须靠搜索工具,而搜索不包含在 Token 价格里。

安全边界

xAI 表示,Grok 4.7 使用了新的安全防护栈,并且是它测过的模型里,在拒绝和对抗越狱上最强的一个。发布文印出了两个数字:

  • LatchBio 的生物安全基准:62.4%。
  • HackerBench v0.3。xAI 把它描述为自己对高风险和恶意网络任务的基准:高风险的两用提示中有 3.3% 会被放行。xAI 同时表示,正当的安全工作很少被拦截。

发布文还说,部分网络安全合作伙伴获得了仅限邀请的红队能力,用于防御研究。这项权限不属于这里描述的公开 grok-4.7 API。

这些数字是厂商评估。它们不是独立审计,也不能成为在医疗、法律、安全或其他高风险回答上省去人工复核的理由。

官方价格

Token 价格

2026 年 9 月 21 日核对的 xAI 价格页,单位为每百万 Token 的美元价格:

提示规模 输入 缓存输入 输出
不足 200,000 个提示 Token $2.00 $0.50 $6.00
达到或超过 200,000 个提示 Token $4.00 $1.00 $12.00

提示一旦达到阈值,长上下文价格覆盖整次请求。前 20 万 Token 不会继续按短上下文价格计算。

三个官方例子

不含托管工具费用。

请求 档位 计算 合计
100,000 未缓存输入,5,000 输出 0.1 × $2 + 0.005 × $6 $0.230
100,000 缓存输入,5,000 输出 0.1 × $0.50 + 0.005 × $6 $0.080
220,000 未缓存输入,10,000 输出 0.22 × $4 + 0.01 × $12 $1.000

从第一行到第三行的跃升,不是“文字多了一点”。越过 20 万 Token 后,每一档单价都翻倍,多出来的 Token 也按翻倍后的价格计算。第二行里,10 万 Token 全部命中缓存时,费用大约是未缓存短提示的三分之一,因为缓存输入是输入价格的四分之一,输出费用不变。

托管工具、Fast 和美国区域

同一价格页上的托管工具调用:

  • 网页搜索(web_search):每 1,000 次 $5。
  • X 搜索(x_search):本次核对时为每 1,000 次调用 $5。自 2026 年 9 月 21 日 12:00(太平洋时间)起,xAI 改为按取回的帖子每 1,000 条 $5、按取回的用户资料每 1,000 份 $10。返回的每条帖子都计数,包括父帖和引用帖。返回的每份资料都计数。
  • 代码执行(code_executioncode_interpreter):每 1,000 次 $5。
  • 附件搜索:每 1,000 次 $10。
  • 集合搜索:每 1,000 次 $2.50。

模型自己决定发起多少次托管调用。一次重度搜索的回答,工具费可能高于 Token 费。

美国区域端点 https://us.api.x.ai/v1 把推理留在美国,并把输入、缓存输入和输出都乘以 1.1,长上下文价格同样乘。对 grok-4.7 来说,20 万提示 Token 以下是 $2.20 / $0.55 / $6.60,达到或超过这条线是 $4.40 / $1.10 / $13.20。

Grok 4.7 Fast 是同一模型在更快的基础设施上提供服务。xAI 的正文说它按标准 Token 价格的两倍计费。价格表印出的是:20 万提示 Token 以下为 $4.00 / $1.00 / $12.00,达到或超过 20 万为 $6.00 / $1.50 / $18.00。把标准长上下文的 $4 / $1 / $12 翻倍,会是 $8 / $2 / $24。价格表上的 Fast 长上下文一行并不是这个翻倍结果。做预算时以表格为准,并在依赖 Fast 之前重新查看价格页。Fast 通过 Cursor 和 Grok Build 销售。它不在公开 xAI API 上,也不包含在 Grok Build 的免费档里。2026 年 9 月 21 日的 Modelflare 目录没有 Fast 模型 ID。当时存在的 Grok ID 是 grok-4.5grok-4.6grok-4.7

发布基准

下表抄自 xAI 2026 年 9 月 21 日的发布文。Folkbench 按可用率、延迟和价格比较线路,Grok 4.7 的说明收在 这个页面。列标题保留 xAI 印出的推理强度。其他模型的分数是 xAI 放在同一张表里的数字。Modelflare 没有重跑这些评测。

评测 Grok 4.7 xHigh Grok 4.6 High GPT-5.6 Sol Max Fable 5.1 Max
输入标价,美元 / 1M 2 2 4 10
输出标价,美元 / 1M 6 6 20 50
CursorBench 4.0 46.3% 40.4% 41.7% 51.8%
DeepSWE v1.1 71.0%(high,不是 xHigh) 65.2% 72.7% 70.0%
EEBench 64.0% 53.0% 39.4% 56.4%
AA Briefcase v1.1 1,657 1,546 1,487 1,678
Terminal-Bench 4.0 38.0% 20.3% 37.3% 57.9%
Harvey Legal Agent Benchmark 19.6% 15.8% 2.5% 6.7%
HealthBench Professional 56.7% 48.5% 60.5% 62.1%

Grok 4.7 这一列不是单一强度。DeepSWE 明确是 high 的分数。其他 Grok 4.7 格子位于 xHigh 标题下。Grok 4.6 是 High。Sol 和 Fable 是 Max。更高的分数可能来自更深、更贵的推理档位。这值得知道,但它不是同一强度下的对照实验。

在这张表上,Grok 4.7 领先的是 EEBench 和 Harvey 基准。它在 CursorBench、DeepSWE、AA Briefcase,以及相对 Sol 的 Terminal-Bench 上接近领先者。它在 Terminal-Bench 上大幅落后于 Fable 5.1,在 HealthBench Professional 上落后于 Sol 和 Fable 5.1。

输入标价是 Sol 的一半、Fable 的五分之一。输出标价是 Sol 的 30%、Fable 的 12%。“一半价格”对得上 Sol 的输入格子,对不上表里的每一个格子。精确比较就是这张表。

Modelflare 的价格和分组差别

2026 年 9 月 21 日,Modelflare 的公开价格响应包含 grok-4.7。目录标价与 xAI 的短上下文标价一致:输入每百万 Token $2,完成倍率 3,因此输出是 $6,缓存倍率 0.25,因此缓存输入是 $0.50。这一行没有公布第二档长上下文价格。不要把 xAI 的长上下文 $4 / $1 / $12 乘上 Modelflare 的分组倍率,再把乘积当成账单。已经入账的请求记录才是实际采用的金额。

分组选在 API 密钥上。两个分组调用的是同一个模型 ID。

价格表

分组 倍率 输入 / 1M 缓存输入 / 1M 输出 / 1M 目录说明
grok-award 0.03 $0.06 $0.015 $0.18 价格优先线路,适合预算敏感、可重试的开发、测试和弹性任务
grok-stable 0.11 $0.22 $0.055 $0.66 面向看重稳定性的个人开发者,适合日常开发、较长期项目和生产应用

计算方式是目录标价乘以分组倍率。Award 是 $2.00 × 0.03、$0.50 × 0.03 和 $6.00 × 0.03。Stable 是 $2.00 × 0.11、$0.50 × 0.11 和 $6.00 × 0.11。相对短上下文标价,这两个倍率是 3% 和 11%。它们不是长上下文标价、美国区域价格或托管工具费的 3% 和 11%。

grok-award 的中文目录说明比上面的英文说明多一句话:超低价格不保证稳定性和模型质量。这句话应当和 0.03 倍率放在一起看。grok-stable 是目录对日常开发与生产用途的描述。两句说明都不是已经测得的可用性协议、延迟目标,也不表示两个分组跑的是不同权重。

三个 Modelflare 例子

Token 形状与官方例子相同,按目录的单一价格计算。缓存行假定用量记录真的把这些输入 Token 计为缓存命中。金额很小时,额度取整也可能让入账数字移动,所以请求日志仍是账单。

请求 grok-award grok-stable
100,000 未缓存输入,5,000 输出 $0.0069 $0.0253
100,000 缓存输入,5,000 输出 $0.0024 $0.0088
220,000 未缓存输入,10,000 输出,按目录单一价格 $0.0150 $0.0550

22 万 Token 这一行故意不是 0.03 × $1.00 或 0.11 × $1.00。1 美元是 xAI 的长上下文标价。如果以后的目录修订增加了长上下文档位,这一行就不再是报价。实时页面是 grok-4.7 价格页。总表是模型与价格

通过 Modelflare 调用这个模型,而不是只为这个 ID 另开一个 xAI 账号,意味着:

  • 模型 ID 保持 grok-4.7。客户端不指向一个改过名的别名。
  • 规范基址是 OpenAI 兼容的 https://modelflare.dev/v1。OpenAI SDK 通常只需要这个基址、一把 Modelflare 密钥和模型 ID。
  • 密钥放在 grok-awardgrok-stable。同一账号在密钥分组允许时,还可以调用目录里的其他模型。
  • 价格差别写得很明确。Award 是可以重试的任务所用的低价路由,并带有上面的稳定性和质量限制。Stable 是目录描述的日常开发与生产路由。
  • 这个 ID 列出的端点类型是 Chat Completions、Responses 和 Responses 压缩。

这个价格不包括相对直连 xAI 的已测延迟优势,不包括托管搜索或代码执行费用,不包括 Fast 服务档,也不包括分组说明之外的服务等级。

在 Modelflare 上如何调用 Grok 4.7

创建 API 密钥并选择 grok-awardgrok-stable。分组在密钥上。即使模型已经公开列出,放在无关分组里的密钥仍可能在 grok-4.7 上失败。模型 ID 必须精确发送。规范基址是 https://modelflare.dev/v1。同一套 API 也发布在 https://cf.modelflare.dev/v1https://origin.modelflare.dev/v1。根域名是规范站点。

Chat Completions:

export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.7",
    "reasoning_effort": "high",
    "messages": [
      {
        "role": "user",
        "content": "Review this migration plan and list the three assumptions that most need a test."
      }
    ]
  }'

Responses:

curl -sS https://modelflare.dev/v1/responses \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.7",
    "reasoning": {"effort": "high"},
    "input": "Review this migration plan and list the three assumptions that most need a test."
  }'

在 Chat Completions 上,reasoning_effort 可以是 lowmediumhighxhigh。在 Responses 上,把 reasoning.effort 设成同样的值。图片输入使用用户消息上普通的 OpenAI 内容数组。你自己的函数使用普通的 tools 字段。POST /v1/responses/compact 列在这个模型上,它是对 grok-4.7 的压缩操作,不是另一个模型 ID。包括网页搜索在内的 xAI 托管工具属于上游行为。先在真正会使用的路由上试一次,并阅读用量记录,再依赖它们或依赖 xAI 的调用费。

两种请求形状的差别见 Responses API 与 Chat Completions 对比。表格背后的成本方法见如何计算 LLM Token 成本AI API 成本追踪

切换流量前要核对的事

  1. 固定 grok-4.7。不要接受静默换成 Grok 4.6 或 Grok 4.5。
  2. 确认密钥分组是 grok-awardgrok-stable,并根据能否重试来选择,而不是只看倍率。
  3. 用同一份不含敏感信息的固定集合,分别在 lowmediumhighxhigh 上回放。记录成功率、延迟、输入 Token、缓存输入、输出 Token 和费用。
  4. 替换之前,用 Grok 4.6 跑同一集合。标价接近,分数表并不均匀。
  5. 分别给一条略低于 20 万 Token 和一条略高于 20 万 Token 的提示计价,然后阅读入账金额。xAI 的价目和 Modelflare 的目录行目前没有公布同一条长上下文规则。
  6. 如果工作流需要图片、函数调用、流式传输或取消,就测试这些路径。一次纯文本成功不能覆盖它们。
  7. 保留回滚路由。一个完成的 HTTP 响应只说明这一次调用结束了。

来源

核对日期:2026 年 9 月 21 日。