Grok 4.6 veröffentlicht: API, Preise, 500K Kontext und Leitfaden
Faktengeprüfter Leitfaden zu Grok 4.6 mit exakter Modell-ID, 500K-Kontext, Tokenpreisen, Reasoning-Stufen, API-Beispielen, Benchmarks und Migrationscheckliste.
xAI veröffentlichte Grok 4.6 am 12. August 2026. Der offizielle Entwicklerleitfaden nennt die API-Modell-ID grok-4.6, ein Kontextfenster mit 500.000 Tokens, Text- und Bildeingabe, Textausgabe und vier Reasoning-Stufen: low, medium, high (Standard) und xhigh.
Für Entwickler sind nicht nur die Launch-Benchmarks relevant. Grok 4.6 unterstützt Responses API und Chat Completions, wechselt bei 200.000 Prompt-Tokens in die Langkontext-Preisstaffel und benötigt für lang laufende Agenten eine gezielte Cache-Affinität und Kontextverwaltung.
Dieser Leitfaden trennt offizielle xAI-Spezifikationen von anbieterseitig veröffentlichten Benchmark-Aussagen und der aktuellen Verfügbarkeit bei Modelflare. Preise und Verfügbarkeit können sich ändern; alle zeitabhängigen Angaben wurden am 13. August 2026 geprüft.
Grok 4.6 auf einen Blick
| Eigenschaft | Offizieller Wert |
|---|---|
| Veröffentlichungsdatum | 12. August 2026 |
| API-Modell-ID | grok-4.6 |
| Kontextfenster | 500.000 Tokens |
| Wissensstichtag | 1. Februar 2026 |
| Modalitäten | Text- und Bildeingabe; Textausgabe |
| Textausgabelimit | xAI nennt kein festes Textausgabelimit |
| Reasoning-Aufwand | low, medium, high (Standard), xhigh |
| API-Formate | Responses API und Chat Completions |
| Dokumentierte Fähigkeiten | Function Calling, strukturierte Ausgaben, Websuche, X-Suche und Codeausführung |
„Kein festes Textausgabelimit“ ist die Beschreibung auf der Modellseite, keine Zusage unbegrenzter Ausgabe für jedes SDK, Gateway, Konto oder jede Anfrage. Client-Timeouts, Kontolimits, Routenrichtlinien und der verfügbare Kontext gelten weiterhin.
Änderungen gegenüber Grok 4.5
xAI positioniert Grok 4.6 als inkrementelle Aktualisierung seines Frontier-Modells mit Schwerpunkt auf lang laufenden Agenten sowie anspruchsvolleren interaktiven und visuellen Aufgaben. Die offizielle Ankündigung beschreibt längeres ergänzendes Training, neu erzeugte SFT-Trajektorien und agentisches Reinforcement Learning für Wissensarbeit, Programmierung, Webentwicklung, Kernel-Optimierung und CAD.
In der Praxis sollten Sie folgende Änderungen bewerten:
xhighergänzt die Stufen low, medium und high;- xAI berichtet von besserer Kontinuität bei mehrstufiger Recherche, Arbeit über ganze Codebasen und iterativer Anwendungsentwicklung;
- das Modell nimmt Bilder und Text entgegen und gibt Text aus;
- die 500K-Kontextklasse und die Standard-Einstiegspreise von $2 für Eingabe und $6 für Ausgabe bleiben, aber gecachte Eingabe kostet bei Grok 4.6 $0,50 pro Million statt der derzeit für Grok 4.5 gelisteten $0,30;
- xAI empfiehlt Cache-Affinität je Konversation und Kontextkomprimierung für lange Agentenschleifen.
Das sind Gründe für eine kontrollierte Migration, nicht für einen blinden Austausch von Grok 4.5. Vergleichen Sie erfolgreiche Aufgaben, Latenz, Gesamttokens, Tool-Aufrufe und Kosten mit Ihrer eigenen Arbeitslast.
Preise der Grok-4.6-API
Die Preisseite von xAI listet folgende Standardpreise in US-Dollar pro Million Tokens:
| Prompt-Größe | Eingabe | Gecachte Eingabe | Ausgabe |
|---|---|---|---|
| Unter 200K Prompt-Tokens | $2.00 | $0.50 | $6.00 |
| Ab 200K Prompt-Tokens | $4.00 | $1.00 | $12.00 |
Sobald der Prompt 200K Tokens erreicht, gelten laut xAI die Langkontextpreise für alle Tokens der Anfrage. Drei kurze Rechnungen zeigen die Auswirkung:
- 100K Eingabe plus 5K Ausgabe kosten zum Standardpreis für kurzen Kontext ungefähr $0.23.
- Werden alle 100K Eingabetokens aus dem Cache bedient, kostet dieselbe Ausgabe ungefähr $0.08.
- 220K Eingabe plus 10K Ausgabe überschreiten die Schwelle und kosten nach den gelisteten Langkontextpreisen ungefähr $1.00.
Serverseitige Tools sind darin nicht enthalten. xAI berechnet aktuell zusätzlich zu den Tokens $5 pro 1.000 Aufrufe für Websuche, X-Suche oder Codeausführung. Die Ankündigung erwähnt außerdem eine schnelle Variante zum doppelten Standardpreis. Prüfen Sie vor der Budgetierung in der xAI-Konsole das genaue Modell, Service-Tier, die regionale Verfügbarkeit und den aktuellen Preis.
Eine allgemeinere Kostenmethode finden Sie unter LLM-Tokenkosten berechnen und KI-API-Kosten verfolgen.
Grok 4.6 über Responses oder Chat Completions aufrufen
Die folgenden Anfragen verwenden den offiziellen xAI-Endpunkt. Dieser Artikel ist ein Release-Leitfaden und behauptet nicht, dass das Modell bereits in jedem Gateway aktiviert ist.
Responses API:
export XAI_API_KEY="<YOUR_XAI_API_KEY>"
curl -sS https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6",
"input": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps.",
"prompt_cache_key": "grok-46-migration-review"
}'
Chat Completions:
curl -sS https://api.x.ai/v1/chat/completions \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-H "x-grok-conv-id: grok-46-migration-review" \
-d '{
"model": "grok-4.6",
"messages": [
{
"role": "user",
"content": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps."
}
]
}'
Verwenden Sie bei Responses prompt_cache_key oder bei Chat Completions den Header x-grok-conv-id, um die Cache-Affinität einer Konversation zu verbessern. Behandeln Sie diese Werte als Betriebsmetadaten: innerhalb einer Konversation stabil, ohne Geheimnisse oder personenbezogene Daten und nicht gemeinsam für unverbundene Nutzer.
Wenn Sie zwischen den Formaten wählen, lesen Sie Responses API oder Chat Completions.
Prompt-Caching und lange Agentenschleifen
Das 500K-Kontextfenster ist eine Kapazität, kein Ziel. Die vollständige Historie in jeder Runde zu senden erhöht die Latenz und kann die gesamte Anfrage in die Langkontext-Preisstaffel verschieben.
Für länger laufende Workflows:
- stabile Anweisungen und wiederverwendbaren Kontext an den Anfang des Prompts setzen;
- je Konversation einen stabilen Cache-Affinitätsschlüssel verwenden;
- gecachte und nicht gecachte Eingabe getrennt messen;
- ältere Runden komprimieren oder zusammenfassen, bevor sich der Prompt 200K Tokens nähert;
- weiterhin maßgebliche Tool-Ergebnisse behalten und doppeltes Transport-Rauschen entfernen;
- eine Reasoning-Stufe festlegen und den Aufgabenerfolg vergleichen, statt xhigh immer als besser anzunehmen;
- Status, Latenz, Eingabe, gecachte Eingabe, Ausgabe, Tool-Aufrufe und Gesamtkosten je erfolgreicher Aufgabe erfassen.
Kontextkomprimierung verändert die Informationen, die das Modell sieht. Prüfen Sie Zusammenfassungen gegen den Originalzustand und bewahren Sie maßgebliche IDs, Einschränkungen, Entscheidungen und ungelöste Fehler.
Launch-Benchmarks richtig einordnen
xAI veröffentlichte in der Ankündigung folgende Ergebnisse für Grok 4.6 High:
| Bewertung | Von xAI veröffentlichter Grok-4.6-Wert |
|---|---|
| Artificial Analysis Intelligence Index | 61 |
| GDPVal-AA v2 | 1753 |
| CursorBench v3.2 | 69.9% |
| DeepSWE v1.1 | 65.9% |
| FrontierCode v1.1 Extended | 61.3% |
| APEX-Agents | 57.5% |
Dies sind vom Anbieter veröffentlichte Launch-Ergebnisse, keine unabhängigen Modelflare-Tests. Test-Harness, Reasoning-Einstellung, Tool-Zugriff, Zeitlimit und Bewertungsversion beeinflussen die Vergleichbarkeit. Nutzen Sie die Tabelle zur Auswahl eigener Tests, nicht als universelles Qualitätsranking oder Produktionsgarantie.
Checkliste für die Produktionsmigration
Bevor Sie Produktionstraffic zu Grok 4.6 leiten:
- die exakte Modell-ID
grok-4.6verwenden und stille Alias-Ersetzungen ablehnen; - Aktivierung für das vorgesehene Konto, die Region, das API-Format und Service-Tier bestätigen;
- einen festen, datenschutzgerechten Evaluationssatz auf Grok 4.5 und Grok 4.6 wiederholen;
- je nach Anwendung Text, Bilder, Function Calling, strukturierte Ausgaben, Streaming, Ablehnungen und Abbruch getrennt testen;
- low, medium, high und xhigh nach Kosten und Latenz je erfolgreicher Aufgabe vergleichen;
- Anfragen knapp unter und über der 200K-Schwelle prüfen;
- Cache-Treffer, Komprimierung, Tool-Anzahl, Wiederholungen und Schutz vor doppelten Nebenwirkungen verifizieren;
- eine Rollback-Route behalten und finales Modell, Route, Nutzung, Latenz und Kosten je Anfrage protokollieren.
HTTP 200 beweist nur, dass eine Anfrage beendet wurde. Es beweist weder Funktionsgleichheit noch stabile Latenz, korrektes Tool-Verhalten oder akzeptable Kosten. Nutzen Sie für Routentests Konformitätstests für OpenAI-kompatible APIs und Zuverlässiges KI-API-Routing.
Ist Grok 4.6 bei Modelflare verfügbar?
Ja. Bei der Produktionsprüfung am 13. August 2026 führte Modelflares öffentlicher Katalog Modelle und Preise die exakte ID grok-4.6 in den Gruppen grok-award und grok-stable. Der Katalog weist OpenAI-kompatible Chat-Completions- und Responses-API-Routen aus.
Zum Prüfzeitpunkt wurden 0,03x für grok-award und 0,06x für grok-stable angezeigt. Gruppenzugriff, Routen, Preise und Verfügbarkeit können sich ändern. Da xAI außerdem eine eigene Langkontext-Preisstaffel nutzt, darf ein Werbemultiplikator oder Kurzkontext-Beispiel nicht auf alle Anfragen übertragen werden. Maßgeblich sind die Live-Preisseite und die Kostenaufzeichnung der abgeschlossenen Anfrage.
Erstellen oder aktualisieren Sie einen API Key mit berechtigter Gruppe, verwenden Sie die exakte ID grok-4.6 und schließen Sie eine echte, nicht sensible Anfrage ab, bevor Sie Produktionstraffic verschieben. Der Katalog bestätigt die öffentliche Konfiguration, ist aber weder ein unabhängiger Modelflare-Benchmark noch eine Zugriffsgarantie für jeden API Key.
Offizielle Quellen und Änderungsprotokoll
Primärquellen:
- xAI: Introducing Grok 4.6
- xAI-Entwicklerleitfaden: Grok 4.6
- xAI-Modellseite: grok-4.6
- xAI-API-Preise
- xAI-Release Notes
Änderungsprotokoll:
- 13. August 2026: Erstveröffentlichung. Offizielle Spezifikationen, Preise, API-Formate, Launch-Benchmarks und Modelflare-Katalogverfügbarkeit geprüft.