Grok 4.7:仕様、能力、ベンチマークと Modelflare の価格

公開資料に基づく Grok 4.7 の仕様、推論レベル、公開ベンチマーク、公式トークン価格、および 2026 年 9 月 21 日に確認した Modelflare の grok-award と grok-stable 料金。

xAIは2026年9月21日にGrok 4.7をリリースしました。APIのモデルIDはgrok-4.7です。コーディング、エージェント的なツール利用、知識作業に向けた、xAIの現行フラッグシップです。Modelflareは同じ日、公開料金カタログに同じIDを掲載しました。

この記事は三つの層を分けて扱います。仕様とは、xAIが文書化している内容です。ベンチマーク表とは、xAIがリリース時に報告した内容です。Modelflareの料金とは、2026年9月21日にGET /api/pricingが返した内容です。ベンダーのスコアはModelflareのテストではなく、カタログの一行は、すべてのキー、すべてのルート、すべてのプロンプトが同じように振る舞うという約束ではありません。

xAIはGrok 4.7のパラメータ数、層数、学習トークンの総量を公表していません。「Grok 4.6より大きい」は、新しいベースモデルに対する同社の定性的な説明です。以下の比較が使うのは、実際に公開されている数字だけです。コンテキスト、トークン価格、推論レベル、モダリティ、そしてリリース時のスコアです。

何が公開されたか

リリース記事は、Grok 4.7をGrok 4.6より新しく、より大きいベースモデルであり、より長い強化学習のランで訓練されたものだと説明しています。タスクの組み合わせはより難しく、何時間もかかる問題のほうへ重みが寄っています。xAIは、このモデルは自分の作業を確認することと長いコンテキストを管理することがより上手くなり、会話の作業に使われるGrok Botハーネスを理解するよう訓練された、と述べています。

その記事のなかの二つの文を、一つに畳んではいけません。見出しは、このモデルが「比較対象のモデルの半分の価格で、二倍速い」と述べています。本文は、Grok 4.6と同じ価格、同じ速度で提供されていると述べています。トークン表は、Grok 4.6に対する後者の文を裏付けます。どちらも、入力100万トークン当たり$2、出力100万トークン当たり$6と掲載しています。見出しが比べているのは、その表のなかでリスト価格がより高い他のモデルです。xAIは「二倍速い」の隣に毎秒トークン数を公表していないので、この記事はそのフレーズを、測定済みのレイテンシ結果としては扱いません。

grok-4.7はxAI API上にあり、Cursorにもあり、Grok Buildのデフォルトモデルです。別のFastサービング経路は、CursorとGrok Buildにだけ存在します。公開のxAI APIにはなく、この記事のために確認したModelflareのカタログにもありませんでした。

仕様の比較

以下の価格は、xAIが公表したリスト価格で、単位は100万トークン当たりの米ドルです。「短い」とは、プロンプトが200,000トークン未満であることを意味します。「長い」とは、プロンプトが200,000トークンに達したことを意味します。価格表では、その線を越えると、線を越えたトークンだけではなく、リクエストのなかのすべてのトークンが値付けし直されます。

項目 grok-4.7 grok-4.6 grok-4.5
コンテキストウィンドウ 500,000トークン 500,000トークン 500,000トークン
短い入力 / キャッシュ入力 / 出力 $2.00 / $0.50 / $6.00 $2.00 / $0.50 / $6.00 $2.00 / $0.30 / $6.00
長い入力 / キャッシュ入力 / 出力 $4.00 / $1.00 / $12.00 $4.00 / $1.00 / $12.00 $4.00 / $0.60 / $12.00
推論強度 low、medium、high(デフォルト)、xhigh low、medium、high(デフォルト)、xhigh low、medium、high(デフォルト)

同じ日にモデルページで確認した、Grok 4.7の詳細は次のとおりです。

  • 入力はテキストと画像です。出力はテキストです。このモデルは画像を生成しません。
  • ページは、固定のテキスト出力上限はないと述べています。クライアントのタイムアウト、アカウントの制限、残っているコンテキストウィンドウは、引き続き適用されます。
  • 知識カットオフは2026年5月です。検索ツールを有効にしない限り、それより後の出来事は見えません。
  • 文書化されたインターフェースは、Responses APIとChat Completionsです。
  • 文書化されたツールには、関数呼び出し、Web検索、X検索、コード実行が含まれます。
  • 推論は切ることができません。強度を省くと、デフォルトはhighです。
  • Responses APIでは、リクエストがそれを求めていなくても、grok-4.7reasoning.encrypted_contentを返します。後のターンでは、それらの推論項目を変えずに送り返すべきです。Chat Completionsには、その挙動は付きません。

Grok 4.5はhighで止まります。Grok 4.6とGrok 4.7はxhighを加えます。キャッシュ入力のリスト価格も変わりました。Grok 4.5は短いプロンプトで$0.30、長いプロンプトで$0.60です。Grok 4.6とGrok 4.7は$0.50と$1.00です。標準の入力と出力のリスト価格は、これら三つのIDのあいだで変わっていません。

能力の次元

コーディングと長いエージェント作業

リリース記事は、Grok 4.7を長く走り続ける作業に向けています。複数ステップのコーディング、完了と呼ぶ前に結果を確認すること、そして長いコンテキストをまとめて保持することです。これらのコーディングのスコアは、すべてxAIのリリース表から取っています。

  • CursorBench 4.0は、より長いコーディングタスクに負荷をかけます。xHighで46.3%です。Grok 4.6 Highは40.4%、GPT-5.6 Sol Maxは41.7%、Fable 5.1 Maxは51.8%です。
  • DeepSWE v1.1は71.0%です。xAIはこれを、xHighではなくhigh強度のスコアとして記しています。Grok 4.6は65.2%、Solは72.7%、Fable 5.1は70.0%です。
  • Terminal-Bench 4.0は38.0%です。Grok 4.6は20.3%、Solは37.3%、Fable 5.1は57.9%です。
  • EEBench、電気工学は64.0%です。Grok 4.6は53.0%、Solは39.4%、Fable 5.1は56.4%です。

行は、ベンダーがモデルがどこへ動いたと言うかの地図として読んでください。自分のリポジトリが得るスコアとして読まないでください。CursorBenchについて、xAIはこの結果をフロンティアの価格対性能と呼んでいます。スコアはSolとGrok 4.6より上、Fable 5.1より下で、リスト価格はSolとFableのどちらよりもずっと低い、ということです。DeepSWEはFableに近く、それでもSolより下であり、しかもxHighの数字ではありません。ターミナル作業はGrok 4.6と比べて大きく改善し、Solの近くにあります。その行では、Fable 5.1が依然としてはるか先にいます。EEBenchは、この表のなかで最もはっきりしたリードです。

専門的な知識作業

xAIは、オフィスの作業と専門的な作業も報告しています。

  • AA Briefcase v1.1、数時間にわたるオフィス作業は1,657です。Grok 4.6は1,546、Solは1,487、Fable 5.1は1,678です。
  • Harvey Legal Agent Benchmarkは19.6%です。Grok 4.6は15.8%、Solは2.5%、Fable 5.1は6.7%です。この表で先頭でも、それは項目のおよそ五件に一件です。モデルが監督なしで法律の仕事を担えるという証拠ではありません。
  • HealthBench Professional、臨床推論は56.7%です。Grok 4.6は48.5%、Solは60.5%、Fable 5.1は62.1%です。この行では、Grok 4.7は前の世代より前にあり、比較対象の二つのモデルより後ろにあります。

記事は、Grok 4.7は文書とプレゼンテーションがより上手くなり、GDPvalではGrok 4.6より改善しつつ、他のフロンティアモデルと同じ範囲に入る、と述べています。本文はGDPvalの点数を印刷していないので、この記事も点数を足しません。

Grok 4.7のリリース本文には、単一の知能指数はありません。Grok 4.6の以前の記事は、Artificial Analysis Intelligence Indexを公表していました。今回のリリースは、その一つの数字を上のタスク表に置き換えています。作業に合う行を使ってください。同じリリースのなかで、モデルは電気工学ではリードし、臨床推論では後れを取ることがあります。

推論強度

reasoning_effortlowmediumhighxhighを受け付けます。highがデフォルトです。xAIは、lowをより軽い設定、mediumをレイテンシがあまり敏感でないところで思考を増やす設定、highを難しい複数ステップの問題のための設定、xhighを最も深い設定と説明しています。その最も深い設定はレイテンシが最も高く、回答の質が応答時間より重く支配する問題のためのものです。

強度を上げると、通常は推論トークンが増え、出力トークンはリスト価格のなかで高い側です。xhighが、自動的に正しい本番のデフォルトになるわけではありません。オンのままにする前に、自分のプロンプトでタスクの成功、レイテンシ、総トークンを比較してください。

複数ターンのResponsesの会話では、暗号化した推論項目を次のリクエストに残してください。それらを落とすと、モデルが前の回答へ至るために使ったコンテキストを捨てることになります。Chat Completionsは、その暗号化したフィールドを返しません。

ツール、画像、記憶

関数呼び出しは、あなたが実装するツールの経路です。関数を宣言し、モデルが呼び出しを提案し、アプリケーションがそれを実行し、結果を送り返します。Web検索、X検索、コード実行はxAIがホストします。モデルはそれらを自分で呼び出すことができ、呼び出しのたびにトークンとは別に価格が付きます。

画像は入力として送れます。モデルページの要約は、別の画像価格を載せていません。画像入力はコンテキストを消費し、そのリクエストのトークン使用量に現れます。画像生成はGrok Imagineのモデルに残り、それは別のAPIです。

500,000トークンはウィンドウであり、埋めるべき予算ではありません。xAIは、Responses APIでは安定したprompt_cache_keyを、直接のChat Completionsではx-grok-conv-idヘッダーを使うよう勧めています。会話が同じサーバーに着地し、キャッシュに当たりやすくするためです。そのアフィニティがなければ、キャッシュの冷えたサーバーは入力価格の全額を請求します。長いループでは、より古いターンを圧縮することも想定されています。圧縮は、モデルが見られるものを変えます。要約を、元の制約、ID、決定、未解決のエラーと突き合わせてください。

2026年5月のカットオフは、記憶された知識に対する硬い限界です。それより新しいものには検索ツールが必要で、検索はトークン価格に含まれていません。

セーフガード

xAIは、Grok 4.7が新しいセーフガードのスタックを使い、拒否とジェイルブレイクへの耐性について同社がテストしたモデルのなかで最も強い、と述べています。リリース記事には二つの数字が印刷されています。

  • LatchBioのバイオセーフティ・ベンチマークは62.4%です。
  • HackerBench v0.3。xAIはこれを、リスクがあり悪意のあるサイバータスクについての自社ベンチマークと説明しています。リスクのあるデュアルユースのプロンプトのうち3.3%が通過を許されます。xAIはまた、正当なセキュリティの作業がブロックされることはまれだ、とも述べています。

記事は、選ばれたサイバーセキュリティのパートナーが、防御研究のためのレッドチーム能力に招待制でアクセスできる、と述べています。そのアクセスは、ここで説明する公開のgrok-4.7 APIの一部ではありません。

これらの数字はベンダーの評価です。独立した監査ではなく、医療、法律、セキュリティ、その他の重大な回答について人間のレビューを省く理由にもなりません。

公式価格

トークン単価

2026年9月21日に確認したxAIの料金ページは、100万トークン当たりの米ドルを掲載しています。

プロンプトの大きさ 入力 キャッシュ入力 出力
200,000プロンプトトークン未満 $2.00 $0.50 $6.00
200,000プロンプトトークン以上 $4.00 $1.00 $12.00

プロンプトが閾値に達すると、長い単価がリクエスト全体を覆います。最初の200,000トークンが短い単価のままになることはありません。

三つの公式の例

ホストされたツールの料金は除外しています。

リクエスト 基準 計算 合計
100,000の未キャッシュ入力、5,000の出力 短い 0.1 × $2 + 0.005 × $6 $0.230
100,000のキャッシュ入力、5,000の出力 短い 0.1 × $0.50 + 0.005 × $6 $0.080
220,000の未キャッシュ入力、10,000の出力 長い 0.22 × $4 + 0.01 × $12 $1.000

一行目から三行目への跳ね上がりは、「テキストが少し増えた」ということではありません。200,000トークンを越えると、すべての単価が二倍になり、増えたトークンも二倍になった単価で請求されます。二行目の、すべてキャッシュに乗った100,000トークンのプロンプトは、キャッシュされていない短いプロンプトのおよそ三分の一の費用です。キャッシュ入力は入力単価の四分の一であり、出力の請求は変わらないからです。

ホストされたツール、Fast、米国リージョン

同じ料金ページにある、ホストされたツールの呼び出しは次のとおりです。

  • Web検索(web_search):呼び出し1,000回当たり$5。
  • X検索(x_search):この確認の時点では、呼び出し1,000回当たり$5です。2026年9月21日12:00 PTから、xAIはその呼び出し価格を、取得した投稿1,000件当たり$5と、取得したユーザープロフィール1,000件当たり$10に置き換えます。返された投稿はすべて数え、親の投稿と引用も含みます。返されたプロフィールはすべて数えます。
  • コード実行(code_executioncode_interpreter):呼び出し1,000回当たり$5。
  • ファイル添付の検索:呼び出し1,000回当たり$10。
  • コレクションの検索:呼び出し1,000回当たり$2.50。

モデルが、ホストされた呼び出しを何回行うかを決めます。検索の多い回答は、トークンよりもツール料金の方が高くなることがあります。

米国リージョンのエンドポイントhttps://us.api.x.ai/v1は、推論を米国内に保ち、入力、キャッシュ入力、出力を1.1倍します。長いコンテキストの単価も含みます。grok-4.7では、200,000プロンプトトークン未満が$2.20 / $0.55 / $6.60であり、その線以上が$4.40 / $1.10 / $13.20です。

Grok 4.7 Fastは、より速いインフラストラクチャ上の同じモデルです。xAIの本文は、標準のトークン単価の二倍で請求される、と述べています。価格表が印刷しているのは、200,000プロンプトトークン未満が$4.00 / $1.00 / $12.00、200,000以上が$6.00 / $1.50 / $18.00です。標準の長いコンテキストの行である$4 / $1 / $12を二倍にすると、$8 / $2 / $24になります。印刷されたFastの長いコンテキストの行は、その二倍と一致しません。予算は表から取り、Fastに依存する前に料金ページを再確認してください。FastはCursorとGrok Buildを通じて販売されます。公開のxAI APIにはなく、Grok Buildの無料枠にも含まれず、2026年9月21日に確認したModelflareのカタログにはFastのモデルIDがありませんでした。存在したGrokのIDは、grok-4.5grok-4.6grok-4.7でした。

リリース時のベンチマーク

以下のスコアは、2026年9月21日のxAIのリリース記事から写したものです。Folkbench は可用率、遅延、価格で経路を比べ、このモデルのメモを folkbench.com/models/grok-4-7 に置いています。列の見出しは、xAIが印刷した強度の設定を保っています。他のモデルのスコアは、xAIが同じ表に置いたものです。Modelflareは、それらを再実行していません。

評価 Grok 4.7 xHigh Grok 4.6 High GPT-5.6 Sol Max Fable 5.1 Max
入力のリスト価格、米ドル / 1M 2 2 4 10
出力のリスト価格、米ドル / 1M 6 6 20 50
CursorBench 4.0 46.3% 40.4% 41.7% 51.8%
DeepSWE v1.1 71.0%(highであり、xHighではない) 65.2% 72.7% 70.0%
EEBench 64.0% 53.0% 39.4% 56.4%
AA Briefcase v1.1 1,657 1,546 1,487 1,678
Terminal-Bench 4.0 38.0% 20.3% 37.3% 57.9%
Harvey Legal Agent Benchmark 19.6% 15.8% 2.5% 6.7%
HealthBench Professional 56.7% 48.5% 60.5% 62.1%

Grok 4.7の列は、一つの強度設定ではありません。DeepSWEは、明示的にhigh強度のスコアです。他のGrok 4.7のセルは、xHighの見出しの下にあります。Grok 4.6はHighです。SolとFableはMaxです。より高いスコアは、より深く、より高価な推論設定から来ることもあります。それは知っておく価値があり、単一の強度レベルで揃えた比較ではありません。

この表では、Grok 4.7はEEBenchとHarveyのベンチマークをリードします。CursorBench、DeepSWE、AA Briefcase、そしてSolに対するTerminal-Benchでは、先頭に近い位置です。Terminal-BenchではFable 5.1に大きな差で後れ、HealthBench ProfessionalではSolとFable 5.1の両方に後れます。

入力のリスト価格はSolの半分であり、Fableの五分の一です。出力のリスト価格はSolの30%であり、Fableの12%です。「半分の価格」はSolの入力のセルには合い、他のすべてのセルには合いません。精密な比較は、この表です。

Modelflareの料金とグループの違い

2026年9月21日、Modelflareの公開料金レスポンスにはgrok-4.7が含まれていました。カタログのリストレートは、xAIの短いコンテキストのリスト価格と一致します。入力は100万トークン当たり$2、完了倍率は3なので出力は$6、キャッシュ倍率は0.25なのでキャッシュ入力は$0.50です。その行は、第二の長いコンテキストの階層を公表していません。xAIの長い単価である$4 / $1 / $12にModelflareのグループ倍率を掛け、その積を請求額として扱わないでください。完了したリクエストに保存された課金が、適用された数字です。

グループはAPIキーの上で選ばれます。両方のグループが呼ぶモデルIDは同じです。

料金表

グループ 倍率 入力 / 1M キャッシュ入力 / 1M 出力 / 1M カタログの説明
grok-award 0.03 $0.06 $0.015 $0.18 予算に敏感で再試行できる開発、テスト、柔軟なワークロード向けの、価格を優先するルーティング
grok-stable 0.11 $0.22 $0.055 $0.66 安定性を求める個人開発者のための、日常の開発、より長いプロジェクト、本番アプリケーション

計算は、カタログのリストレートにグループ倍率を掛けたものです。Awardは$2.00 × 0.03、$0.50 × 0.03、$6.00 × 0.03です。Stableは$2.00 × 0.11、$0.50 × 0.11、$6.00 × 0.11です。短いコンテキストのリスト価格に対して、これらの倍率は3%と11%です。長いコンテキストのリスト価格の3%や11%ではなく、米国リージョン価格の3%や11%でもなく、ホストされたツール料金の3%や11%でもありません。

grok-awardの中国語カタログの文は、英語の説明にはない一文を加えています。非常に低い価格は、安定性もモデル品質も保証しない、という文です。それを0.03の倍率の隣に置いてください。grok-stableは、通常の開発と本番についてのカタログの説明です。どちらの文も、測定された稼働時間の合意でも、レイテンシの目標でも、グループが異なる重みを実行しているという主張でもありません。

三つのModelflareの例

トークンの形は、公式の例と一致します。価格はカタログの単一レートで付きます。キャッシュの行は、使用量の記録がそれらの入力トークンをキャッシュヒットとして数えることを仮定しています。非常に小さい課金は、クォータが課金単位へ丸められるときにも動くことがあるので、リクエストログが請求書であり続けます。

リクエスト grok-award grok-stable
100,000の未キャッシュ入力、5,000の出力 $0.0069 $0.0253
100,000のキャッシュ入力、5,000の出力 $0.0024 $0.0088
220,000の未キャッシュ入力、10,000の出力、単一のカタログレートで $0.0150 $0.0550

220,000トークンの行は、意図的に0.03 × $1.00でも0.11 × $1.00でもありません。1ドルは、xAIの長いコンテキストのリスト課金です。後のカタログ改訂が長いコンテキストの階層を加えたなら、この行は見積もりではなくなります。ライブのページはgrok-4.7の料金ページです。索引はモデルと料金です。

このIDのためだけに別のxAIアカウントを開くのではなく、Modelflareを通じてモデルを呼ぶことは、次を意味します。

  • モデルIDはgrok-4.7のままです。クライアントは、名前を変えた別名を対象にしません。
  • 正規のベースURLは、OpenAI互換のhttps://modelflare.dev/v1です。OpenAIのSDKは通常、そのベースURLと、Modelflareのキーと、モデルIDを必要とします。
  • キーはgrok-awardまたはgrok-stableに置かれます。同じアカウントは、キーのグループが許すとき、カタログの他のモデルも呼ぶことができます。
  • 価格の分かれ方は明示されています。Awardは、再試行できる作業のための安いルートであり、上に書いた安定性と品質についての留保が付きます。Stableは、カタログが日常の開発と本番のために説明するルートです。
  • このIDについて掲載されているエンドポイントの種別は、Chat Completions、Responses、Responsesの圧縮です。

この価格には、xAIを直接呼ぶ場合に対する測定済みのレイテンシ上の優位も、ホストされた検索やコード実行の料金も、Fastの提供階層も、グループの説明を超えるサービスレベルも含まれていません。

ModelflareでGrok 4.7を呼ぶ方法

APIキーを作成し、grok-awardまたはgrok-stableを選んでください。グループはキーの上にあります。関係のないグループにあるキーは、モデルが公開で掲載されていても、grok-4.7で失敗することがあります。モデルIDは、正確に送ってください。正規のベースURLはhttps://modelflare.dev/v1です。同じAPIは、https://cf.modelflare.dev/v1https://origin.modelflare.dev/v1にも公開されています。ルートのホスト名が、正規のサイトです。

Chat Completions:

export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.7",
    "reasoning_effort": "high",
    "messages": [
      {
        "role": "user",
        "content": "Review this migration plan and list the three assumptions that most need a test."
      }
    ]
  }'

Responses:

curl -sS https://modelflare.dev/v1/responses \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.7",
    "reasoning": {"effort": "high"},
    "input": "Review this migration plan and list the three assumptions that most need a test."
  }'

Chat Completionsでは、reasoning_effortlowmediumhighxhighを受け付けます。Responsesでは、reasoning.effortを同じ値に設定します。画像入力は、ユーザーメッセージの上にある通常のOpenAIのコンテンツ配列を使います。自分の関数は、通常のtoolsフィールドを使います。POST /v1/responses/compactはこのモデルについて掲載されており、別のモデルIDとしてではなく、grok-4.7の上の圧縮として転送されます。Web検索を含む、ホストされたxAIのツールは、プロバイダーの挙動です。それらに依存する前、またxAIの呼び出し料金に依存する前に、実際に使うルートで試し、使用量の記録を読んでください。

二つのリクエストの形の違いについては、Responses APIとChat Completionsの比較を見てください。表の背後にあるコストの方法については、LLMのトークンコストがどう計算されるかAI APIのコスト追跡を見てください。

トラフィックを切り替える前の確認

  1. grok-4.7を固定してください。Grok 4.6またはGrok 4.5への、通知のない置き換えを受け入れないでください。
  2. キーのグループがgrok-awardまたはgrok-stableであることを確認し、倍率だけからではなく、再試行をどこまで許容できるかから選んでください。
  3. 固定されていて、機密ではない一つの集合を、lowmediumhighxhighで再生してください。成功、レイテンシ、入力トークン、キャッシュ入力、出力トークン、課金を記録してください。
  4. 置き換える前に、同じ集合でGrok 4.6を実行してください。リスト価格は似ています。スコアの表は一様ではありません。
  5. 200,000トークンのすぐ下にあるプロンプト一つと、すぐ上にあるプロンプト一つに価格を付け、記録された課金を読んでください。xAIの表とModelflareのカタログの行は、現在、同じ長いコンテキストの規則を公表していません。
  6. ワークフローが画像、関数呼び出し、ストリーミング、またはキャンセルを必要とするなら、それらの経路をテストしてください。テキストだけの一度の成功は、それらを覆いません。
  7. ロールバックのルートを残してください。完了したHTTPレスポンスが示すのは、その一回の呼び出しが終わったことだけです。

出典

確認した日は2026年9月21日です。