Grok 4.7 : spécifications, capacités, benchmarks et tarifs Modelflare
Guide sourcé de Grok 4.7 : spécification publiée, niveaux de raisonnement, benchmarks de lancement, prix officiels des jetons et tarifs Modelflare grok-award et grok-stable vérifiés le 21 septembre 2026.
xAI a publié Grok 4.7 le 21 septembre 2026. L’ID de modèle de l’API est grok-4.7. C’est le modèle phare actuel de xAI pour la programmation, l’usage d’outils par des agents et le travail de connaissance. Le même jour, Modelflare a inscrit ce même ID dans le catalogue public de tarifs.
Cet article tient trois couches séparées. La spécification est ce que xAI documente. Le tableau de référence est ce que xAI a déclaré au lancement. Les prix Modelflare sont ce que GET /api/pricing a renvoyé le 21 septembre 2026. Un score du fournisseur n’est pas un test Modelflare, et une ligne de catalogue n’est pas une promesse que chaque clé, chaque route ou chaque prompt se comportera de la même façon.
xAI n’a pas publié de nombre de paramètres, de nombre de couches ni de total de tokens d’entraînement pour Grok 4.7. « Plus grand que Grok 4.6 » est la description qualitative que l’entreprise donne du nouveau modèle de base. La comparaison ci-dessous utilise les chiffres réellement publics : contexte, prix des tokens, niveaux de raisonnement, modalités et scores de lancement.
Ce qui a été publié
La publication de lancement décrit Grok 4.7 comme un modèle de base nouveau et plus grand que Grok 4.6, entraîné par une passe d’apprentissage par renforcement plus longue. Le mélange de tâches est plus difficile et pondéré vers des problèmes qui prennent de nombreuses heures. xAI dit que le modèle vérifie mieux son propre travail, qu’il gère mieux un long contexte, et qu’il a été entraîné pour comprendre le harness Grok Bot utilisé pour le travail conversationnel.
Deux phrases de cette publication ne doivent pas être fondues en une seule. Le titre dit que le modèle est « deux fois plus rapide, à la moitié du prix des modèles comparables ». Le corps dit qu’il est servi au même prix et à la même vitesse que Grok 4.6. Le tableau des tokens appuie la seconde phrase face à Grok 4.6 : les deux affichent $2 par million de tokens d’entrée et $6 par million de tokens de sortie. Le titre compare avec d’autres modèles de ce tableau, dont les prix catalogue sont plus élevés. xAI ne publie pas de nombre de tokens par seconde à côté de « deux fois plus rapide », donc cet article ne traite pas cette formule comme un résultat de latence mesuré.
grok-4.7 est sur l’API xAI, dans Cursor, et c’est le modèle par défaut de Grok Build. Un chemin de desserte Fast distinct n’existe que dans Cursor et Grok Build. Il n’est pas sur l’API publique de xAI, et il n’était pas dans le catalogue Modelflare vérifié pour cet article.
Comparaison des spécifications
Les prix ci-dessous sont les prix catalogue publiés par xAI, en USD par million de tokens. « Court » désigne un prompt sous 200,000 tokens. « Long » désigne un prompt qui a atteint 200,000 tokens. Dans le tableau de prix, franchir cette ligne retarife chaque token de la requête, et pas seulement les tokens au-delà de la ligne.
| Élément | grok-4.7 | grok-4.6 | grok-4.5 |
|---|---|---|---|
| Fenêtre de contexte | 500,000 tokens | 500,000 tokens | 500,000 tokens |
| Entrée courte / entrée en cache / sortie | $2.00 / $0.50 / $6.00 | $2.00 / $0.50 / $6.00 | $2.00 / $0.30 / $6.00 |
| Entrée longue / entrée en cache / sortie | $4.00 / $1.00 / $12.00 | $4.00 / $1.00 / $12.00 | $4.00 / $0.60 / $12.00 |
| Effort de raisonnement | low, medium, high (par défaut), xhigh | low, medium, high (par défaut), xhigh | low, medium, high (par défaut) |
Détails de Grok 4.7 vérifiés le même jour sur la page du modèle :
- Les entrées sont du texte et des images. La sortie est du texte. Le modèle ne génère pas d’images.
- La page n’indique aucune limite fixe de sortie texte. Les délais d’attente du client, les limites de compte et la fenêtre de contexte restante s’appliquent toujours.
- La date de coupure des connaissances est mai 2026. Les événements ultérieurs restent invisibles tant qu’un outil de recherche n’est pas activé.
- Les interfaces documentées sont la Responses API et Chat Completions.
- Les outils documentés comprennent l’appel de fonctions, la recherche web, la recherche X et l’exécution de code.
- Le raisonnement ne peut pas être désactivé. Si vous omettez l’effort, la valeur par défaut est
high. - Sur la Responses API,
grok-4.7renvoiereasoning.encrypted_contentmême lorsque la requête ne le demande pas. Les tours suivants doivent renvoyer ces éléments de raisonnement inchangés. Chat Completions n’acquiert pas ce comportement.
Grok 4.5 s’arrête à high. Grok 4.6 et Grok 4.7 ajoutent xhigh. Le prix catalogue de l’entrée en cache a aussi bougé : Grok 4.5 est à $0.30 sur les prompts courts et à $0.60 sur les prompts longs ; Grok 4.6 et Grok 4.7 sont à $0.50 et $1.00. Les prix catalogue de l’entrée et de la sortie standard sont inchangés pour ces trois ID.
Dimensions de capacité
Programmation et travail d’agent de longue durée
La publication de lancement destine Grok 4.7 au travail qui dure longtemps : programmation en plusieurs étapes, vérification d’un résultat avant de le déclarer terminé, et maintien d’un long contexte. Tous ces scores de programmation viennent du tableau de lancement de xAI :
- CursorBench 4.0, qui sollicite des tâches de programmation plus longues : 46.3% en xHigh. Grok 4.6 High est à 40.4%, GPT-5.6 Sol Max à 41.7% et Fable 5.1 Max à 51.8%.
- DeepSWE v1.1 : 71.0%, indiqué par xAI comme un score d’effort high et non xHigh. Grok 4.6 est à 65.2%, Sol à 72.7% et Fable 5.1 à 70.0%.
- Terminal-Bench 4.0 : 38.0%. Grok 4.6 est à 20.3%, Sol à 37.3% et Fable 5.1 à 57.9%.
- EEBench, génie électrique : 64.0%. Grok 4.6 est à 53.0%, Sol à 39.4% et Fable 5.1 à 56.4%.
Lisez les lignes comme une carte des endroits où le fournisseur dit que le modèle a bougé, et non comme le score que votre dépôt obtiendra. Sur CursorBench, xAI qualifie le résultat de rapport prix-performance de frontière : le score est au-dessus de Sol et de Grok 4.6, en dessous de Fable 5.1, à un prix catalogue bien plus bas que celui de Sol ou de Fable. DeepSWE est proche de Fable et reste sous Sol, et ce n’est pas un chiffre xHigh. Le travail en terminal s’est nettement amélioré par rapport à Grok 4.6 et se situe près de Sol, tandis que Fable 5.1 reste largement devant sur cette ligne. EEBench est l’avance la plus nette du tableau.
Travail de connaissance professionnel
xAI rapporte aussi des tâches de bureau et des tâches professionnelles :
- AA Briefcase v1.1, travail de bureau de plusieurs heures : 1,657. Grok 4.6 est à 1,546, Sol à 1,487 et Fable 5.1 à 1,678.
- Harvey Legal Agent Benchmark : 19.6%. Grok 4.6 est à 15.8%, Sol à 2.5% et Fable 5.1 à 6.7%. Mener ce tableau signifie encore environ un élément sur cinq. Ce n’est pas la preuve que le modèle peut porter un travail juridique sans supervision.
- HealthBench Professional, raisonnement clinique : 56.7%. Grok 4.6 est à 48.5%, Sol à 60.5% et Fable 5.1 à 62.1%. Sur cette ligne, Grok 4.7 est devant son prédécesseur et derrière les deux modèles de comparaison.
La publication dit que Grok 4.7 est meilleur pour les documents et les présentations, et qu’il progresse par rapport à Grok 4.6 sur GDPval tout en se situant dans la même plage que d’autres modèles de frontière. La prose n’imprime pas les valeurs ponctuelles de GDPval, donc cet article n’en fournit aucune.
Il n’y a pas d’indice d’intelligence unique dans le texte de lancement de Grok 4.7. La publication antérieure de Grok 4.6 avait publié un Artificial Analysis Intelligence Index. Ce lancement remplace ce nombre unique par le tableau de tâches ci-dessus. Utilisez la ligne qui correspond au travail. Un modèle peut mener le génie électrique et rester en retrait sur le raisonnement clinique dans la même version.
Effort de raisonnement
reasoning_effort accepte low, medium, high et xhigh. high est la valeur par défaut. xAI décrit low comme le réglage le plus léger, medium comme davantage de réflexion là où la latence est moins sensible, high comme le réglage pour les problèmes difficiles en plusieurs étapes, et xhigh comme le réglage le plus profond, avec la latence la plus élevée, pour les problèmes où la qualité de la réponse l’emporte sur le temps de réponse.
Plus d’effort signifie en général plus de tokens de raisonnement, et les tokens de sortie sont le côté cher du prix catalogue. xhigh n’est pas automatiquement le bon défaut de production. Comparez la réussite de la tâche, la latence et le total de tokens sur vos propres prompts avant de le laisser activé.
Pour une conversation Responses à plusieurs tours, conservez les éléments de raisonnement chiffrés dans la requête suivante. Les abandonner écarte le contexte que le modèle a utilisé pour atteindre la réponse précédente. Chat Completions ne renvoie pas ce champ chiffré.
Outils, images et mémoire
L’appel de fonctions est le chemin d’outil que vous implémentez. Vous déclarez la fonction, le modèle propose un appel, votre application l’exécute et vous renvoyez le résultat. La recherche web, la recherche X et l’exécution de code sont hébergées par xAI. Le modèle peut les appeler de lui-même, et chaque invocation est tarifée séparément des tokens.
Les images peuvent être envoyées en entrée. Le résumé de la page du modèle ne liste pas de prix d’image distinct. Les entrées image consomment du contexte et apparaissent dans l’usage de tokens de la requête. La génération d’images reste sur les modèles Grok Imagine, qui relèvent d’une API différente.
Cinq cent mille tokens constituent la fenêtre, pas un budget à remplir. xAI recommande une prompt_cache_key stable sur la Responses API, et l’en-tête x-grok-conv-id sur les Chat Completions directs, afin qu’une conversation ait plus de chances d’atterrir sur le même serveur et de toucher le cache. Sans cette affinité, un serveur au cache froid facture le prix d’entrée complet. Les longues boucles sont aussi censées compacter les tours plus anciens. La compaction change ce que le modèle peut voir. Vérifiez le résumé contre les contraintes d’origine, les ID, les décisions et les erreurs ouvertes.
La coupure de mai 2026 est une limite dure sur la connaissance mémorisée. Tout ce qui est plus récent exige un outil de recherche, et la recherche n’est pas incluse dans le prix des tokens.
Protections
xAI indique que Grok 4.7 utilise une nouvelle pile de protections et que c’est le modèle le plus fort qu’il ait testé sur les refus et la résistance aux jailbreaks. Deux chiffres sont imprimés dans la publication de lancement :
- Le benchmark de biosécurité de LatchBio : 62.4%.
- HackerBench v0.3, que xAI décrit comme son benchmark de tâches cyber risquées et malveillantes : 3.3% des prompts à double usage risqués sont laissés passer. xAI dit aussi que le travail de sécurité légitime est rarement bloqué.
La publication dit que des partenaires de cybersécurité sélectionnés ont un accès sur invitation à des capacités d’équipe rouge pour la recherche défensive. Cet accès ne fait pas partie de l’API publique grok-4.7 décrite ici.
Ces chiffres sont des évaluations du fournisseur. Ils ne constituent pas un audit indépendant, et ils ne sont pas une raison d’omettre la revue humaine sur les réponses médicales, juridiques, de sécurité ou autres à enjeu élevé.
Prix officiels
Tarifs par token
La page de prix xAI, vérifiée le 21 septembre 2026, indique des USD par million de tokens :
| Taille du prompt | Entrée | Entrée en cache | Sortie |
|---|---|---|---|
| Sous 200,000 tokens de prompt | $2.00 | $0.50 | $6.00 |
| À 200,000 tokens de prompt ou au-dessus | $4.00 | $1.00 | $12.00 |
Le tarif long couvre toute la requête dès que le prompt atteint le seuil. Les premiers 200,000 tokens ne conservent pas le tarif court.
Trois exemples officiels
Les frais d’outils hébergés sont exclus.
| Requête | Base | Arithmétique | Total |
|---|---|---|---|
| 100,000 d’entrée non cachée, 5,000 de sortie | Court | 0.1 × $2 + 0.005 × $6 | $0.230 |
| 100,000 d’entrée en cache, 5,000 de sortie | Court | 0.1 × $0.50 + 0.005 × $6 | $0.080 |
| 220,000 d’entrée non cachée, 10,000 de sortie | Long | 0.22 × $4 + 0.01 × $12 | $1.000 |
Le saut de la première ligne à la troisième n’est pas « un peu plus de texte ». Franchir 200,000 tokens double chaque tarif, et les tokens supplémentaires sont facturés au tarif doublé. Un prompt de 100,000 tokens entièrement en cache, sur la deuxième ligne, coûte environ un tiers du prompt court non caché, parce que l’entrée en cache vaut un quart du tarif d’entrée et que le coût de sortie ne change pas.
Outils hébergés, Fast et la région des États-Unis
Invocations d’outils hébergés sur la même page de prix :
- Recherche web (
web_search) : $5 pour 1,000 appels. - Recherche X (
x_search) : $5 pour 1,000 appels au moment de cette vérification. À partir du 21 septembre 2026 à 12:00 PT, xAI remplace ce prix par appel par $5 pour 1,000 publications récupérées et $10 pour 1,000 profils d’utilisateur récupérés. Chaque publication renvoyée compte, y compris les parents et les citations. Chaque profil renvoyé compte. - Exécution de code (
code_executionetcode_interpreter) : $5 pour 1,000 appels. - Recherche dans les pièces jointes : $10 pour 1,000 appels.
- Recherche dans les collections : $2.50 pour 1,000 appels.
Le modèle choisit combien d’appels hébergés effectuer. Une réponse riche en recherches peut coûter plus en frais d’outils qu’en tokens.
Le point de terminaison régional des États-Unis https://us.api.x.ai/v1 maintient l’inférence aux États-Unis et multiplie l’entrée, l’entrée en cache et la sortie par 1.1, tarifs de long contexte compris. Pour grok-4.7, cela donne $2.20 / $0.55 / $6.60 sous 200,000 tokens de prompt, et $4.40 / $1.10 / $13.20 à cette ligne ou au-dessus.
Grok 4.7 Fast est le même modèle sur une infrastructure plus rapide. La prose de xAI dit qu’il est facturé au double des tarifs standard par token. Le tableau de prix imprime $4.00 / $1.00 / $12.00 sous 200,000 tokens de prompt, et $6.00 / $1.50 / $18.00 à 200,000 ou au-dessus. Doubler la ligne standard de long contexte de $4 / $1 / $12 donnerait $8 / $2 / $24. La ligne Fast de long contexte imprimée ne correspond pas à ce doublement. Budgétez à partir du tableau, et revérifiez la page de prix avant de vous appuyer sur Fast. Fast est vendu via Cursor et Grok Build. Il n’est pas sur l’API publique de xAI, il n’est pas inclus dans le palier gratuit de Grok Build, et le catalogue Modelflare vérifié le 21 septembre 2026 ne contenait aucun ID de modèle Fast. Les ID Grok présents étaient grok-4.5, grok-4.6 et grok-4.7.
Benchmarks de lancement
Les scores ci-dessous sont copiés de la publication de lancement de xAI du 21 septembre 2026. Folkbench compare les routes selon la disponibilité, la latence et le prix, et garde ses notes sur ce modèle à folkbench.com/models/grok-4-7. Les en-têtes de colonne conservent le réglage d’effort imprimé par xAI. Les scores des autres modèles sont ceux que xAI a placés dans le même tableau. Modelflare ne les a pas relancés.
| Évaluation | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| Prix catalogue d’entrée, USD / 1M | 2 | 2 | 4 | 10 |
| Prix catalogue de sortie, USD / 1M | 6 | 6 | 20 | 50 |
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0% (high, pas xHigh) | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
La colonne Grok 4.7 n’est pas un seul réglage d’effort. DeepSWE est explicitement un score d’effort high. Les autres cellules de Grok 4.7 se trouvent sous l’en-tête xHigh. Grok 4.6 est High. Sol et Fable sont Max. Un score plus élevé peut venir d’un réglage de raisonnement plus profond et plus cher. Cela mérite d’être su, et ce n’est pas une comparaison appariée à un seul niveau d’effort.
Sur ce tableau, Grok 4.7 mène EEBench et le benchmark Harvey. Il est proche des leaders sur CursorBench, DeepSWE, AA Briefcase, et sur Terminal-Bench face à Sol. Il reste loin derrière Fable 5.1 sur Terminal-Bench, et il reste derrière Sol et Fable 5.1 sur HealthBench Professional.
Le prix catalogue d’entrée est la moitié de celui de Sol et le cinquième de celui de Fable. Le prix catalogue de sortie est 30% de celui de Sol et 12% de celui de Fable. « La moitié du prix » correspond à la cellule d’entrée de Sol et ne correspond pas à chaque autre cellule. Le tableau est la comparaison précise.
Prix Modelflare et différences entre les groupes
Le 21 septembre 2026, la réponse publique de tarifs de Modelflare incluait grok-4.7. Le tarif catalogue correspond au prix catalogue de contexte court de xAI : entrée à $2 par million de tokens, un ratio de complétion de 3 donc la sortie est $6, et un ratio de cache de 0.25 donc l’entrée en cache est $0.50. Cette ligne ne publie pas un second palier de long contexte. Ne multipliez pas le tarif long de xAI de $4 / $1 / $12 par un ratio de groupe Modelflare pour traiter le produit comme la facture. Le montant enregistré sur la requête terminée est le chiffre qui a été appliqué.
Le groupe se choisit sur la clé d’API. Les deux groupes appellent le même ID de modèle.
Tableau des prix
| Groupe | Ratio | Entrée / 1M | Entrée en cache / 1M | Sortie / 1M | Description du catalogue |
|---|---|---|---|---|---|
grok-award |
0.03 | $0.06 | $0.015 | $0.18 | Routage prioritaire au prix pour le développement, les tests et les charges flexibles, sensibles au budget et rejouables |
grok-stable |
0.11 | $0.22 | $0.055 | $0.66 | Développement quotidien, projets plus longs et applications de production pour les développeurs individuels qui veulent de la stabilité |
L’arithmétique est le tarif catalogue multiplié par le ratio de groupe. Award est $2.00 × 0.03, $0.50 × 0.03 et $6.00 × 0.03. Stable est $2.00 × 0.11, $0.50 × 0.11 et $6.00 × 0.11. Face au prix catalogue de contexte court, ces ratios sont 3% et 11%. Ils ne sont pas 3% ou 11% du prix catalogue de long contexte, du prix régional des États-Unis, ni des frais d’outils hébergés.
Le texte chinois du catalogue pour grok-award ajoute une phrase que la description anglaise n’a pas : le prix très bas ne garantit ni la stabilité ni la qualité du modèle. Gardez-la à côté du ratio 0.03. grok-stable est la description du catalogue pour le développement ordinaire et la production. Aucune des deux phrases n’est un accord de disponibilité mesuré, une cible de latence, ni l’affirmation que les groupes exécutent des poids différents.
Trois exemples Modelflare
Les formes de tokens correspondent aux exemples officiels. Elles sont tarifées au tarif unique du catalogue. Les lignes en cache supposent que l’enregistrement d’usage compte ces tokens d’entrée comme des succès de cache. Les montants très petits peuvent aussi bouger lorsque le quota est arrondi à l’unité de facturation, donc le journal de la requête reste la facture.
| Requête | grok-award | grok-stable |
|---|---|---|
| 100,000 d’entrée non cachée, 5,000 de sortie | $0.0069 | $0.0253 |
| 100,000 d’entrée en cache, 5,000 de sortie | $0.0024 | $0.0088 |
| 220,000 d’entrée non cachée, 10,000 de sortie, au tarif unique du catalogue | $0.0150 | $0.0550 |
La ligne de 220,000 tokens n’est volontairement pas 0.03 × $1.00 ni 0.11 × $1.00. Un dollar est le montant catalogue de long contexte de xAI. Si une révision ultérieure du catalogue ajoute un palier de long contexte, cette ligne cesse d’être le devis. La page en direct est la page de prix de grok-4.7. L’index est Modèles et prix.
Appeler le modèle via Modelflare, plutôt que d’ouvrir un compte xAI séparé uniquement pour cet ID, signifie :
- L’ID de modèle reste
grok-4.7. Le client ne vise pas un alias renommé. - L’URL de base canonique est l’URL compatible OpenAI
https://modelflare.dev/v1. Un SDK OpenAI a en général besoin de cette URL de base, d’une clé Modelflare et de l’ID de modèle. - La clé est placée dans
grok-awardougrok-stable. Le même compte peut appeler d’autres modèles du catalogue lorsque le groupe de la clé les autorise. - L’écart de prix est explicite. Award est la route bon marché pour le travail que vous pouvez rejouer, avec la réserve de stabilité et de qualité ci-dessus. Stable est la route que le catalogue décrit pour le développement quotidien et la production.
- Les types de points de terminaison listés pour cet ID sont Chat Completions, Responses et la compaction Responses.
Ce prix n’inclut pas un avantage de latence mesuré par rapport à un appel direct à xAI, ni les frais de recherche hébergée ou d’exécution de code, ni le palier de desserte Fast, ni un niveau de service au-delà de la description du groupe.
Comment appeler Grok 4.7 sur Modelflare
Créez une clé d’API et sélectionnez grok-award ou grok-stable. Le groupe vit sur la clé. Une clé d’un groupe sans rapport peut échouer sur grok-4.7 même si le modèle est listé publiquement. Envoyez l’ID de modèle exactement. L’URL de base canonique est https://modelflare.dev/v1. La même API est aussi publiée sur https://cf.modelflare.dev/v1 et https://origin.modelflare.dev/v1. Le nom d’hôte racine est le site canonique.
Chat Completions :
export MODELFLARE_API_KEY="YOUR_MODELFLARE_API_KEY"
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.7",
"reasoning_effort": "high",
"messages": [
{
"role": "user",
"content": "Review this migration plan and list the three assumptions that most need a test."
}
]
}'
Responses :
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.7",
"reasoning": {"effort": "high"},
"input": "Review this migration plan and list the three assumptions that most need a test."
}'
Sur Chat Completions, reasoning_effort accepte low, medium, high et xhigh. Sur Responses, réglez reasoning.effort sur les mêmes valeurs. L’entrée image utilise le tableau de contenu OpenAI ordinaire sur un message utilisateur. Vos propres fonctions utilisent le champ tools ordinaire. POST /v1/responses/compact est listé pour ce modèle et est transmis comme compaction sur grok-4.7, et non comme un autre ID de modèle. Les outils hébergés de xAI, recherche web comprise, sont un comportement du fournisseur. Essayez-les sur la route que vous utiliserez vraiment, et lisez l’enregistrement d’usage, avant d’en dépendre ou de dépendre des frais d’invocation de xAI.
Pour la différence entre les deux formes de requête, voir Responses API face à Chat Completions. Pour la méthode de coût derrière les tableaux, voir comment le coût en tokens d’un LLM est calculé et suivi du coût d’une API d’IA.
Vérifications avant de basculer le trafic
- Épinglez
grok-4.7. N’acceptez pas une substitution silencieuse par Grok 4.6 ou Grok 4.5. - Confirmez que le groupe de la clé est
grok-awardougrok-stable, et choisissez-le selon la tolérance au rejeu plutôt que selon le ratio seul. - Rejouez un ensemble fixe et non sensible en
low,medium,highetxhigh. Notez la réussite, la latence, les tokens d’entrée, l’entrée en cache, les tokens de sortie et le montant. - Lancez Grok 4.6 sur ce même ensemble avant de le remplacer. Le prix catalogue est proche. Le tableau de scores n’est pas uniforme.
- Tarifez un prompt juste sous 200,000 tokens et un autre juste au-dessus, puis lisez le montant enregistré. La grille xAI et la ligne du catalogue Modelflare ne publient pas actuellement la même règle de long contexte.
- Si le flux de travail a besoin d’images, d’appels de fonctions, de diffusion en continu ou d’annulation, testez ces chemins. Une seule réussite en texte seul ne les couvre pas.
- Conservez une route de repli. Une réponse HTTP terminée montre seulement qu’un appel s’est achevé.
Sources
Vérifié le 21 septembre 2026.
- Présentation de Grok 4.7
- Guide du développeur Grok 4.7
- Modèles et tarifs xAI
- Tarifs de l’API xAI
- Notes de version xAI
- Effort de raisonnement
- Catalogue public de tarifs Modelflare,
GET https://modelflare.dev/api/pricing, modèlegrok-4.7 - Guide antérieur : API Grok 4.6, tarifs et contexte de 500K