Grok 4.7:規格、能力、基準與 Modelflare 價格
依公開資料說明 Grok 4.7 的規格、推理檔位、發布基準、官方 Token 價格,以及 2026 年 9 月 21 日核對的 Modelflare grok-award 與 grok-stable 價格。
xAI 於 2026 年 9 月 21 日發布 Grok 4.7。API 模型 ID 是 grok-4.7。它是 xAI 目前面向程式設計、Agent 工具呼叫和知識工作的旗艦模型。同一天,Modelflare 的公開價格目錄已經列出這個 ID。
本文把三層資訊分開。規格以 xAI 文件為準。基準表是 xAI 在發布文裡自行給出的分數。Modelflare 價格是 2026 年 9 月 21 日 GET /api/pricing 的公開返回。廠商分數不是 Modelflare 的獨立測試,目錄裡有這一行也不表示每把金鑰、每條路由、每條提示都會得到同樣的結果。
xAI 沒有公佈 Grok 4.7 的參數量、層數或訓練 Token 總量。“比 Grok 4.6 更大”只是官方對新基座模型的定性描述。下面的對比只使用已經公開的數字:上下文、Token 價格、推理檔位、模態,以及發布分數。
這次發布了什麼
發布文把 Grok 4.7 描述為相對 Grok 4.6 的新的、更大的基座模型,並用更長的強化學習繼續訓練。任務組合更難,權重偏向需要許多小時才能完成的問題。xAI 表示,模型更擅長核對自己的工作、管理長上下文,並且針對對話場景使用的 Grok Bot 執行框架做了專門訓練。
發布文裡的兩句話不能合成一句。標題寫的是“速度是同類模型的兩倍,價格是一半”。正文寫的是:它以與 Grok 4.6 相同的價格和速度提供服務。Token 價格表支援後一句話:兩者的標價都是每百萬輸入 Token 2 美元、每百萬輸出 Token 6 美元。標題裡的比較對象,是同一張表裡標價更高的其他模型。xAI 沒有在“快一倍”旁邊給出每秒 Token 數,所以本文不把這句宣傳語當成已經測得的延遲結果。
grok-4.7 已在 xAI API、Cursor 中提供,並且是 Grok Build 的預設模型。另有一條 Fast 服務路徑,只在 Cursor 和 Grok Build 中提供。它不在公開的 xAI API 上,本次核對的 Modelflare 目錄裡也沒有這個 ID。
規格對比
下表是 xAI 公佈的美元標價,單位為每百萬 Token。“短上下文”指提示不足 20 萬 Token。“長上下文”指提示達到 20 萬 Token。按價格表,一旦越過這條線,本次請求裡的全部 Token 都改用長上下文價格,不是只對超出的部分改價。
| 項目 | grok-4.7 | grok-4.6 | grok-4.5 |
|---|---|---|---|
| 上下文視窗 | 500,000 Token | 500,000 Token | 500,000 Token |
| 短上下文輸入 / 快取輸入 / 輸出 | $2.00 / $0.50 / $6.00 | $2.00 / $0.50 / $6.00 | $2.00 / $0.30 / $6.00 |
| 長上下文輸入 / 快取輸入 / 輸出 | $4.00 / $1.00 / $12.00 | $4.00 / $1.00 / $12.00 | $4.00 / $0.60 / $12.00 |
| 推理強度 | low、medium、high(預設)、xhigh | low、medium、high(預設)、xhigh | low、medium、high(預設) |
同一天在模型頁核對到的 Grok 4.7 細節:
- 輸入是文字和圖片,輸出是文字。模型本身不生成圖片。
- 頁面寫明沒有固定的文字輸出上限。用戶端超時、帳號限額和剩餘上下文仍然有效。
- 知識截止日期是 2026 年 5 月。沒有開啟搜尋工具時,模型不知道此後的事件。
- 文件列出的介面是 Responses API 和 Chat Completions。
- 文件列出的工具包括函式呼叫、網頁搜尋、X 搜尋和程式碼執行。
- 推理不能關閉。不傳強度時,預設是
high。 - 在 Responses API 上,即使請求沒有要求,
grok-4.7也會返回reasoning.encrypted_content。後續輪次應原樣帶回這些推理項。Chat Completions 沒有這項行為。
Grok 4.5 的最高檔是 high。Grok 4.6 和 Grok 4.7 增加了 xhigh。快取輸入標價也變了:Grok 4.5 在短上下文是 $0.30、長上下文是 $0.60;Grok 4.6 和 Grok 4.7 是 $0.50 和 $1.00。這三個 ID 的標準輸入和輸出標價沒有變化。
能力維度
程式設計與長時間 Agent
發布文把 Grok 4.7 指向需要長時間執行的工作:多步程式設計、在宣佈完成之前核對自己的結果,以及把很長的上下文保持住。下面的程式設計分數都來自 xAI 的發布表:
- CursorBench 4.0,側重更長的程式設計任務:xHigh 為 46.3%。Grok 4.6 High 為 40.4%,GPT-5.6 Sol Max 為 41.7%,Fable 5.1 Max 為 51.8%。
- DeepSWE v1.1:71.0%。xAI 標註這是 high 強度的分數,不是 xHigh。Grok 4.6 為 65.2%,Sol 為 72.7%,Fable 5.1 為 70.0%。
- Terminal-Bench 4.0:38.0%。Grok 4.6 為 20.3%,Sol 為 37.3%,Fable 5.1 為 57.9%。
- EEBench,電氣工程:64.0%。Grok 4.6 為 53.0%,Sol 為 39.4%,Fable 5.1 為 56.4%。
這些行用來看廠商認為模型移動到了哪裡,不能當成你的倉庫會得到的分數。在 CursorBench 上,xAI 稱之為價格效能的前沿:分數高於 Sol 和 Grok 4.6,低於 Fable 5.1,標價則明顯低於後兩者。DeepSWE 接近 Fable,仍低於 Sol,而且不是 xHigh 的數字。終端任務相對 Grok 4.6 提升很大,和 Sol 接近,Fable 5.1 在這一行仍明顯領先。EEBench 是這張表裡最清楚的領先項。
專業知識和辦公工作
xAI 同時給出了辦公和專業任務:
- AA Briefcase v1.1,多小時辦公工作:1,657。Grok 4.6 為 1,546,Sol 為 1,487,Fable 5.1 為 1,678。
- Harvey Legal Agent Benchmark:19.6%。Grok 4.6 為 15.8%,Sol 為 2.5%,Fable 5.1 為 6.7%。領跑這張表,仍然大約是五分之一的題目。這不能說明模型可以在無人複核的情況下承擔法律工作。
- HealthBench Professional,臨床推理:56.7%。Grok 4.6 為 48.5%,Sol 為 60.5%,Fable 5.1 為 62.1%。這一行 Grok 4.7 高於前代,低於兩個對照模型。
發布文還說,Grok 4.7 更擅長文件和簡報,在 GDPval 上優於 Grok 4.6,並與其他前沿模型處於同一區間。正文沒有印出 GDPval 的具體分數,本文也不補一個數字。
Grok 4.7 的發布文裡沒有單一的智力指數。Grok 4.6 更早的發布文曾給出 Artificial Analysis Intelligence Index。這一次用上面的任務表代替了那個單一數字。應挑選和工作匹配的那一行。同一次發布裡,模型可以在電氣工程上領先,同時在臨床推理上落後。
推理強度
reasoning_effort 可以是 low、medium、high 和 xhigh。預設是 high。xAI 把 low 描述為更輕的檔位,把 medium 描述為延遲沒那麼敏感時使用的更多思考,把 high 描述為面向困難多步問題的檔位,把 xhigh 描述為最深的檔位:延遲最高,適合答案品質比響應時間更重要的問題。
更高的強度通常意味著更多推理 Token,而輸出 Token 是標價裡更貴的一側。xhigh 不會自動成為正確的生產預設值。先在自己的提示上比較任務成功率、延遲和總 Token,再決定是否長期開啟它。
多輪 Responses 對話應把加密推理項放進下一次請求。丟掉它們,等於丟掉模型得出上一答案時使用的上下文。Chat Completions 不會返回這個加密欄位。
工具、圖片和記憶
函式呼叫是你自己實現的工具路徑。你宣告函式,模型提出呼叫,應用程式執行,再把結果送回去。網頁搜尋、X 搜尋和程式碼執行由 xAI 託管。模型可以自己發起這些呼叫,每次呼叫都在 Token 之外單獨計價。
圖片可以作為輸入傳送。模型頁摘要沒有單獨的圖片價格。圖片輸入佔用上下文,並出現在該次請求的 Token 用量裡。圖片生成屬於另一套 Grok Imagine 模型。
50 萬 Token 是視窗,不是應當填滿的預算。xAI 建議在 Responses API 上使用穩定的 prompt_cache_key,在直連 Chat Completions 上使用 x-grok-conv-id 請求標頭,讓同一段對話更可能落到同一臺伺服器並命中快取。沒有這種親和性時,快取未熱的伺服器會按完整輸入價格計費。長迴圈還應壓縮較早的輪次。壓縮會改變模型能看到的內容。摘要必須對照原來的約束、ID、已做決定和尚未解決的錯誤進行核驗。
2026 年 5 月的截止日期是記憶知識的硬邊界。更新的資訊必須靠搜尋工具,而搜尋不包含在 Token 價格裡。
安全邊界
xAI 表示,Grok 4.7 使用了新的安全防護棧,並且是它測過的模型裡,在拒絕和對抗越獄上最強的一個。發布文印出了兩個數字:
- LatchBio 的生物安全基準:62.4%。
- HackerBench v0.3。xAI 把它描述為自己對高風險和惡意網路任務的基準:高風險的兩用提示中有 3.3% 會被放行。xAI 同時表示,正當的安全工作很少被攔截。
發布文還說,部分網路安全合作伙伴獲得了僅限邀請的紅隊能力,用於防禦研究。這項權限不屬於這裡描述的公開 grok-4.7 API。
這些數字是廠商評估。它們不是獨立審計,也不能成為在醫療、法律、安全或其他高風險回答上省去人工複核的理由。
官方價格
Token 價格
2026 年 9 月 21 日核對的 xAI 價格頁,單位為每百萬 Token 的美元價格:
| 提示規模 | 輸入 | 快取輸入 | 輸出 |
|---|---|---|---|
| 不足 200,000 個提示 Token | $2.00 | $0.50 | $6.00 |
| 達到或超過 200,000 個提示 Token | $4.00 | $1.00 | $12.00 |
提示一旦達到閾值,長上下文價格覆蓋整次請求。前 20 萬 Token 不會繼續按短上下文價格計算。
三個官方例子
不含託管工具費用。
| 請求 | 檔位 | 計算 | 合計 |
|---|---|---|---|
| 100,000 未快取輸入,5,000 輸出 | 短 | 0.1 × $2 + 0.005 × $6 | $0.230 |
| 100,000 快取輸入,5,000 輸出 | 短 | 0.1 × $0.50 + 0.005 × $6 | $0.080 |
| 220,000 未快取輸入,10,000 輸出 | 長 | 0.22 × $4 + 0.01 × $12 | $1.000 |
從第一行到第三行的躍升,不是“文字多了一點”。越過 20 萬 Token 後,每一檔單價都翻倍,多出來的 Token 也按翻倍後的價格計算。第二行裡,10 萬 Token 全部命中快取時,費用大約是未快取短提示的三分之一,因為快取輸入是輸入價格的四分之一,輸出費用不變。
託管工具、Fast 和美國區域
同一價格頁上的託管工具呼叫:
- 網頁搜尋(
web_search):每 1,000 次 $5。 - X 搜尋(
x_search):本次核對時為每 1,000 次呼叫 $5。自 2026 年 9 月 21 日 12:00(太平洋時間)起,xAI 改為按取回的帖子每 1,000 條 $5、按取回的使用者資料每 1,000 份 $10。返回的每條帖子都計數,包括父帖和引用帖。返回的每份資料都計數。 - 程式碼執行(
code_execution和code_interpreter):每 1,000 次 $5。 - 附件搜尋:每 1,000 次 $10。
- 集合搜尋:每 1,000 次 $2.50。
模型自己決定發起多少次託管呼叫。一次重度搜索的回答,工具費可能高於 Token 費。
美國區域端點 https://us.api.x.ai/v1 把推理留在美國,並把輸入、快取輸入和輸出都乘以 1.1,長上下文價格同樣乘。對 grok-4.7 來說,20 萬提示 Token 以下是 $2.20 / $0.55 / $6.60,達到或超過這條線是 $4.40 / $1.10 / $13.20。
Grok 4.7 Fast 是同一模型在更快的基礎設施上提供服務。xAI 的正文說它按標準 Token 價格的兩倍計費。價格表印出的是:20 萬提示 Token 以下為 $4.00 / $1.00 / $12.00,達到或超過 20 萬為 $6.00 / $1.50 / $18.00。把標準長上下文的 $4 / $1 / $12 翻倍,會是 $8 / $2 / $24。價格表上的 Fast 長上下文一行並不是這個翻倍結果。做預算時以表格為準,並在依賴 Fast 之前重新檢視價格頁。Fast 透過 Cursor 和 Grok Build 銷售。它不在公開 xAI API 上,也不包含在 Grok Build 的免費檔裡。2026 年 9 月 21 日的 Modelflare 目錄沒有 Fast 模型 ID。當時存在的 Grok ID 是 grok-4.5、grok-4.6 和 grok-4.7。
發布基準
下表抄自 xAI 2026 年 9 月 21 日的發布文。Folkbench 按可用率、延遲和價格比較線路,Grok 4.7 的說明收在 這個頁面。列標題保留 xAI 印出的推理強度。其他模型的分數是 xAI 放在同一張表裡的數字。Modelflare 沒有重跑這些評測。
| 評測 | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| 輸入標價,美元 / 1M | 2 | 2 | 4 | 10 |
| 輸出標價,美元 / 1M | 6 | 6 | 20 | 50 |
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%(high,不是 xHigh) | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
Grok 4.7 這一列不是單一強度。DeepSWE 明確是 high 的分數。其他 Grok 4.7 格子位於 xHigh 標題下。Grok 4.6 是 High。Sol 和 Fable 是 Max。更高的分數可能來自更深、更貴的推理檔位。這值得知道,但它不是同一強度下的對照實驗。
在這張表上,Grok 4.7 領先的是 EEBench 和 Harvey 基準。它在 CursorBench、DeepSWE、AA Briefcase,以及相對 Sol 的 Terminal-Bench 上接近領先者。它在 Terminal-Bench 上大幅落後於 Fable 5.1,在 HealthBench Professional 上落後於 Sol 和 Fable 5.1。
輸入標價是 Sol 的一半、Fable 的五分之一。輸出標價是 Sol 的 30%、Fable 的 12%。“一半價格”對得上 Sol 的輸入格子,對不上表裡的每一個格子。精確比較就是這張表。
Modelflare 的價格和群組差別
2026 年 9 月 21 日,Modelflare 的公開價格響應包含 grok-4.7。目錄標價與 xAI 的短上下文標價一致:輸入每百萬 Token $2,完成倍率 3,因此輸出是 $6,快取倍率 0.25,因此快取輸入是 $0.50。這一行沒有公佈第二檔長上下文價格。不要把 xAI 的長上下文 $4 / $1 / $12 乘上 Modelflare 的群組倍率,再把乘積當成帳單。已經入帳的請求記錄才是實際採用的金額。
群組選在 API 金鑰上。兩個群組呼叫的是同一個模型 ID。
價格表
| 群組 | 倍率 | 輸入 / 1M | 快取輸入 / 1M | 輸出 / 1M | 目錄說明 |
|---|---|---|---|---|---|
grok-award |
0.03 | $0.06 | $0.015 | $0.18 | 價格優先線路,適合預算敏感、可重試的開發、測試和彈性任務 |
grok-stable |
0.11 | $0.22 | $0.055 | $0.66 | 面向看重穩定性的個人開發者,適合日常開發、較長期專案和生產應用 |
計算方式是目錄標價乘以群組倍率。Award 是 $2.00 × 0.03、$0.50 × 0.03 和 $6.00 × 0.03。Stable 是 $2.00 × 0.11、$0.50 × 0.11 和 $6.00 × 0.11。相對短上下文標價,這兩個倍率是 3% 和 11%。它們不是長上下文標價、美國區域價格或託管工具費的 3% 和 11%。
grok-award 的中文目錄說明比上面的英文說明多一句話:超低價格不保證穩定性和模型品質。這句話應當和 0.03 倍率放在一起看。grok-stable 是目錄對日常開發與生產用途的描述。兩句說明都不是已經測得的可用性協議、延遲目標,也不表示兩個群組跑的是不同權重。
三個 Modelflare 例子
Token 形狀與官方例子相同,按目錄的單一價格計算。快取行假定用量記錄真的把這些輸入 Token 計為快取命中。金額很小時,額度取整也可能讓入帳數字移動,所以請求日誌仍是帳單。
| 請求 | grok-award | grok-stable |
|---|---|---|
| 100,000 未快取輸入,5,000 輸出 | $0.0069 | $0.0253 |
| 100,000 快取輸入,5,000 輸出 | $0.0024 | $0.0088 |
| 220,000 未快取輸入,10,000 輸出,按目錄單一價格 | $0.0150 | $0.0550 |
22 萬 Token 這一行故意不是 0.03 × $1.00 或 0.11 × $1.00。1 美元是 xAI 的長上下文標價。如果以後的目錄修訂增加了長上下文件位,這一行就不再是報價。實時頁面是 grok-4.7 價格頁。總表是模型與價格。
透過 Modelflare 呼叫這個模型,而不是只為這個 ID 另開一個 xAI 帳號,意味著:
- 模型 ID 保持
grok-4.7。用戶端不指向一個改過名的別名。 - 規範基址是 OpenAI 相容的
https://modelflare.dev/v1。OpenAI SDK 通常只需要這個基址、一把 Modelflare 金鑰和模型 ID。 - 金鑰放在
grok-award或grok-stable。同一帳號在金鑰群組允許時,還可以呼叫目錄裡的其他模型。 - 價格差別寫得很明確。Award 是可以重試的任務所用的低價路由,並帶有上面的穩定性和品質限制。Stable 是目錄描述的日常開發與生產路由。
- 這個 ID 列出的端點型別是 Chat Completions、Responses 和 Responses 壓縮。
這個價格不包括相對直連 xAI 的已測延遲優勢,不包括託管搜尋或程式碼執行費用,不包括 Fast 服務檔位,也不包括群組說明之外的服務等級。
在 Modelflare 上如何呼叫 Grok 4.7
建立 API 金鑰並選擇 grok-award 或 grok-stable。群組在金鑰上。即使模型已經公開列出,放在無關群組裡的金鑰仍可能在 grok-4.7 上失敗。模型 ID 必須精確傳送。規範基址是 https://modelflare.dev/v1。同一套 API 也發布在 https://cf.modelflare.dev/v1 和 https://origin.modelflare.dev/v1。根域名是規範站點。
Chat Completions:
export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.7",
"reasoning_effort": "high",
"messages": [
{
"role": "user",
"content": "Review this migration plan and list the three assumptions that most need a test."
}
]
}'
Responses:
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.7",
"reasoning": {"effort": "high"},
"input": "Review this migration plan and list the three assumptions that most need a test."
}'
在 Chat Completions 上,reasoning_effort 可以是 low、medium、high 和 xhigh。在 Responses 上,把 reasoning.effort 設成同樣的值。圖片輸入使用使用者訊息上普通的 OpenAI 內容陣列。你自己的函式使用普通的 tools 欄位。POST /v1/responses/compact 列在這個模型上,它是對 grok-4.7 的壓縮操作,不是另一個模型 ID。包括網頁搜尋在內的 xAI 託管工具屬於上游行為。先在真正會使用的路由上試一次,並閱讀用量記錄,再依賴它們或依賴 xAI 的呼叫費。
兩種請求形狀的差別見 Responses API 與 Chat Completions 對比。表格背後的成本方法見如何計算 LLM Token 成本和 AI API 成本追蹤。
切換流量前要核對的事
- 固定
grok-4.7。不要接受靜默換成 Grok 4.6 或 Grok 4.5。 - 確認金鑰群組是
grok-award或grok-stable,並根據能否重試來選擇,而不是只看倍率。 - 用同一份不含敏感資訊的固定集合,分別在
low、medium、high和xhigh上回放。記錄成功率、延遲、輸入 Token、快取輸入、輸出 Token 和費用。 - 替換之前,用 Grok 4.6 跑同一集合。標價接近,分數表並不均勻。
- 分別給一條略低於 20 萬 Token 和一條略高於 20 萬 Token 的提示計價,然後閱讀入帳金額。xAI 的價目和 Modelflare 的目錄行目前沒有公佈同一條長上下文規則。
- 如果工作流需要圖片、函式呼叫、流式傳輸或取消,就測試這些路徑。一次純文字成功不能覆蓋它們。
- 保留回滾路由。一個完成的 HTTP 響應只說明這一次呼叫結束了。
來源
核對日期:2026 年 9 月 21 日。
- Introducing Grok 4.7
- Grok 4.7 開發者指南
- xAI 模型與價格
- xAI API 價格
- xAI 更新日誌
- 推理強度
- Modelflare 公開價格目錄,
GET https://modelflare.dev/api/pricing,模型grok-4.7 - 此前的指南:Grok 4.6 API、價格與 500K 上下文