Sortie de Grok 4.6 : API, tarifs, contexte 500K et guide
Guide vérifié de Grok 4.6 : identifiant exact, contexte 500K, tarifs des jetons, niveaux de raisonnement, exemples d’API, benchmarks et migration.
xAI a publié Grok 4.6 le 12 août 2026. Le guide développeur officiel indique l’identifiant API grok-4.6, une fenêtre de contexte de 500 000 jetons, l’entrée texte et image, la sortie texte et quatre niveaux de raisonnement : low, medium, high (par défaut) et xhigh.
Pour les développeurs, les informations essentielles ne se limitent pas aux benchmarks de lancement. Grok 4.6 fonctionne avec Responses API et Chat Completions, passe au tarif de contexte long à 200 000 jetons de prompt et exige une gestion volontaire de l’affinité de cache et du contexte pour les agents de longue durée.
Ce guide distingue les spécifications officielles de xAI, les benchmarks publiés par le fournisseur et la disponibilité actuelle chez Modelflare. Les tarifs et la disponibilité peuvent changer ; toutes les données volatiles ont été vérifiées le 13 août 2026.
Grok 4.6 en bref
| Propriété | Valeur officielle |
|---|---|
| Date de sortie | 12 août 2026 |
| Identifiant du modèle API | grok-4.6 |
| Fenêtre de contexte | 500 000 jetons |
| Date de coupure des connaissances | 1er février 2026 |
| Modalités | Entrée texte et image ; sortie texte |
| Limite de sortie texte | xAI n’indique aucune limite fixe |
| Effort de raisonnement | low, medium, high (par défaut), xhigh |
| Formats d’API | Responses API et Chat Completions |
| Capacités documentées | Appel de fonctions, sorties structurées, recherche Web, recherche X et exécution de code |
« Aucune limite fixe de sortie texte » est la description de la page du modèle, pas la promesse que chaque SDK, passerelle, compte ou requête peut produire un texte illimité. Les délais du client, limites de compte, politiques de route et le contexte disponible restent applicables.
Ce qui change par rapport à Grok 4.5
xAI présente Grok 4.6 comme une mise à jour incrémentale de son modèle frontier, axée sur les agents de longue durée et les travaux interactifs et visuels plus ambitieux. L’annonce officielle décrit un entraînement complémentaire plus long, des trajectoires de fine-tuning supervisé régénérées et un apprentissage par renforcement agentique pour le travail intellectuel, le code, le développement Web, l’optimisation de noyaux et la CAO.
Les changements pratiques à évaluer sont les suivants :
xhighrejoint les niveaux low, medium et high ;- xAI rapporte une meilleure continuité pour la recherche en plusieurs étapes, le travail à l’échelle d’un dépôt et la création itérative d’applications ;
- le modèle accepte les images et le texte et renvoie du texte ;
- la classe de contexte 500K et les tarifs de départ de $2 en entrée et $6 en sortie restent identiques, mais l’entrée en cache de Grok 4.6 coûte $0,50 par million contre les $0,30 actuellement affichés pour Grok 4.5 ;
- xAI recommande une affinité de cache par conversation et la compaction du contexte pour les longues boucles d’agents.
Ces changements justifient une migration contrôlée, pas le remplacement aveugle de Grok 4.5. Comparez la réussite des tâches, la latence, le total de jetons, les appels d’outils et les coûts sur votre propre charge.
Tarifs de l’API Grok 4.6
La page tarifaire de xAI affiche les tarifs standards suivants en dollars par million de jetons :
| Taille du prompt | Entrée | Entrée en cache | Sortie |
|---|---|---|---|
| Moins de 200K jetons de prompt | $2.00 | $0.50 | $6.00 |
| 200K jetons de prompt ou plus | $4.00 | $1.00 | $12.00 |
Dès que le prompt atteint 200K jetons, xAI indique que les tarifs de contexte long s’appliquent à tous les jetons de la requête. Trois calculs illustrent ce seuil :
- 100K en entrée plus 5K en sortie coûtent environ $0.23 au tarif standard de contexte court.
- Si les 100K jetons d’entrée proviennent du cache, la même sortie coûte environ $0.08.
- 220K en entrée plus 10K en sortie dépassent le seuil et coûtent environ $1.00 au tarif de contexte long affiché.
Ces exemples n’incluent pas les outils côté serveur. xAI facture actuellement $5 pour 1 000 appels de recherche Web, recherche X ou exécution de code, en plus des jetons. L’annonce mentionne aussi une variante rapide au double du tarif standard. Avant de budgéter, confirmez dans la console xAI le modèle exact, le niveau de service, la région et le prix actuel.
Pour une méthode plus générale, consultez Calculer le coût des jetons LLM et Suivre le coût d’une API d’IA.
Appeler Grok 4.6 avec Responses ou Chat Completions
Les requêtes suivantes utilisent l’endpoint officiel de xAI, car cet article est un guide de sortie et non l’affirmation que le modèle est déjà actif sur toutes les passerelles.
Responses API :
export XAI_API_KEY="<YOUR_XAI_API_KEY>"
curl -sS https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6",
"input": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps.",
"prompt_cache_key": "grok-46-migration-review"
}'
Chat Completions :
curl -sS https://api.x.ai/v1/chat/completions \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-H "x-grok-conv-id: grok-46-migration-review" \
-d '{
"model": "grok-4.6",
"messages": [
{
"role": "user",
"content": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps."
}
]
}'
Utilisez prompt_cache_key avec Responses ou l’en-tête x-grok-conv-id avec Chat Completions afin d’améliorer l’affinité de cache d’une conversation. Traitez ces valeurs comme des métadonnées opérationnelles : stables dans une conversation, sans secret ni donnée personnelle, et jamais partagées entre utilisateurs sans rapport.
Pour choisir entre les deux formats, lisez Responses API ou Chat Completions.
Cache du prompt et longues boucles d’agents
La fenêtre de 500K représente une capacité, pas un objectif. Renvoyer tout l’historique à chaque tour augmente la latence et peut faire passer l’ensemble de la requête au tarif de contexte long.
Pour les workflows durables :
- placez les instructions stables et le contexte réutilisable au début du prompt ;
- utilisez une clé d’affinité de cache stable par conversation ;
- mesurez séparément l’entrée en cache et hors cache ;
- compactez ou résumez les anciens tours avant d’approcher 200K jetons ;
- conservez les résultats d’outils encore fiables et retirez le bruit de transport dupliqué ;
- fixez le niveau de raisonnement et comparez la réussite par tâche au lieu de supposer que xhigh est toujours meilleur ;
- enregistrez statut, latence, entrée, entrée en cache, sortie, appels d’outils et coût total par tâche réussie.
La compaction change les informations vues par le modèle. Validez les résumés par rapport à l’état d’origine et conservez les identifiants, contraintes, décisions et erreurs non résolues qui font autorité.
Interpréter correctement les benchmarks de lancement
xAI a publié les résultats suivants pour Grok 4.6 High dans son annonce :
| Évaluation | Score de Grok 4.6 publié par xAI |
|---|---|
| Artificial Analysis Intelligence Index | 61 |
| GDPVal-AA v2 | 1753 |
| CursorBench v3.2 | 69.9% |
| DeepSWE v1.1 | 65.9% |
| FrontierCode v1.1 Extended | 61.3% |
| APEX-Agents | 57.5% |
Il s’agit de résultats de lancement publiés par le fournisseur, et non de tests indépendants de Modelflare. Le banc d’essai, le niveau de raisonnement, l’accès aux outils, les délais et la version de notation influencent la comparaison. Utilisez ce tableau pour choisir des charges à tester, pas comme classement universel ni garantie de production.
Liste de contrôle pour la migration en production
Avant d’acheminer du trafic de production vers Grok 4.6 :
- utilisez l’identifiant exact
grok-4.6et refusez les substitutions silencieuses d’alias ; - confirmez que le modèle est actif pour le compte, la région, le format d’API et le niveau de service visés ;
- rejouez un jeu d’évaluation fixe et respectueux de la confidentialité sur Grok 4.5 et Grok 4.6 ;
- testez séparément texte, images, appel de fonctions, sorties structurées, streaming, refus et annulation selon votre usage ;
- comparez low, medium, high et xhigh par coût et latence de tâche réussie ;
- testez juste en dessous et juste au-dessus du seuil de 200K ;
- vérifiez les cache hits, la compaction, le nombre d’outils, les nouvelles tentatives et la protection contre les effets en double ;
- conservez une route de rollback et journalisez modèle final, route, usage, latence et coût de chaque requête.
Un HTTP 200 prouve seulement qu’une requête s’est terminée. Il ne prouve ni la parité fonctionnelle, ni une latence stable, ni le bon comportement des outils, ni un coût acceptable. Pour les tests de route, utilisez les Tests de conformité d’API compatibles OpenAI et le Routage fiable des API d’IA.
Grok 4.6 est-il disponible sur Modelflare ?
Oui. Lors de la vérification en production du 13 août 2026, le catalogue public Modèles et tarifs de Modelflare affichait l’identifiant exact grok-4.6 dans les groupes grok-award et grok-stable. Le catalogue indique la prise en charge des routes Chat Completions et Responses API compatibles OpenAI.
Les multiplicateurs affichés étaient 0,03x pour grok-award et 0,06x pour grok-stable. L’accès aux groupes, les routes, les tarifs et la disponibilité peuvent évoluer. xAI appliquant aussi un tarif distinct pour le contexte long, n’étendez pas un multiplicateur promotionnel ou un exemple de contexte court à toutes les requêtes. La page de tarifs en direct et le coût enregistré de la requête terminée font foi.
Créez ou mettez à jour une API Key avec un groupe éligible, utilisez l’identifiant exact grok-4.6 et terminez une requête réelle sans données sensibles avant de déplacer le trafic de production. Le catalogue confirme la configuration publique, mais ne constitue ni un benchmark indépendant de Modelflare ni une garantie d’accès pour chaque API Key.
Sources officielles et journal des mises à jour
Sources primaires :
- xAI : Introducing Grok 4.6
- Guide développeur xAI : Grok 4.6
- Page du modèle xAI : grok-4.6
- Tarifs de l’API xAI
- Notes de version xAI
Journal des mises à jour :
- 13 août 2026 : Première publication. Spécifications, tarifs, formats d’API, benchmarks de lancement et disponibilité dans le catalogue Modelflare vérifiés.