Lanzamiento de Grok 4.6: API, precios, contexto de 500K y guía
Guía verificada de Grok 4.6 con el ID exacto, contexto de 500K, precios por token, niveles de razonamiento, ejemplos de API, benchmarks y lista de migración.
xAI lanzó Grok 4.6 el 12 de agosto de 2026. La guía oficial para desarrolladores indica el modelo API grok-4.6, con una ventana de contexto de 500.000 tokens, entrada de texto e imágenes, salida de texto y cuatro niveles de esfuerzo de razonamiento: low, medium, high (predeterminado) y xhigh.
Para los desarrolladores, los datos más importantes no son solo los benchmarks del lanzamiento. Grok 4.6 funciona con Responses API y Chat Completions, cambia a precios de contexto largo al alcanzar 200.000 tokens de prompt y exige gestionar de forma deliberada la afinidad de caché y el contexto en agentes de larga duración.
Esta guía separa las especificaciones oficiales de xAI de los benchmarks publicados por el proveedor y de la disponibilidad actual en Modelflare. Los precios y la disponibilidad pueden cambiar; los datos variables se comprobaron el 13 de agosto de 2026.
Grok 4.6 de un vistazo
| Propiedad | Valor oficial |
|---|---|
| Fecha de lanzamiento | 12 de agosto de 2026 |
| ID del modelo API | grok-4.6 |
| Ventana de contexto | 500.000 tokens |
| Fecha límite de conocimiento | 1 de febrero de 2026 |
| Modalidades | Entrada de texto e imagen; salida de texto |
| Límite de salida de texto | xAI indica que no hay un límite fijo |
| Esfuerzo de razonamiento | low, medium, high (predeterminado), xhigh |
| Formatos API | Responses API y Chat Completions |
| Capacidades documentadas | Function calling, salidas estructuradas, búsqueda web, búsqueda en X y ejecución de código |
“Sin límite fijo de salida de texto” es la descripción de la página del modelo, no una promesa de que cualquier SDK, gateway, cuenta o petición pueda devolver texto ilimitado. Siguen aplicándose los tiempos de espera del cliente, los límites de la cuenta, la política de la ruta y el contexto disponible.
Qué cambia respecto a Grok 4.5
xAI presenta Grok 4.6 como una actualización incremental de su modelo frontier centrada en agentes de larga duración y trabajos interactivos y visuales más ambiciosos. El anuncio oficial describe un entrenamiento complementario más largo, trayectorias de ajuste supervisado regeneradas y aprendizaje por refuerzo agéntico en trabajo intelectual, programación, desarrollo web, optimización de kernels y CAD.
Los cambios prácticos que conviene evaluar son:
xhighse añade a los niveles low, medium y high;- xAI declara una mejor continuidad en investigación de varios pasos, trabajo sobre bases de código y creación iterativa de aplicaciones;
- el modelo acepta imágenes además de texto y devuelve texto;
- se mantienen la clase de contexto de 500K y los precios iniciales de $2 por entrada y $6 por salida, pero la entrada en caché de Grok 4.6 cuesta $0,50 por millón frente a los $0,30 actualmente listados para Grok 4.5;
- xAI recomienda afinidad de caché por conversación y compactación de contexto para bucles largos de agentes.
Son motivos para ejecutar una migración controlada, no para sustituir Grok 4.5 a ciegas. Compara la finalización de tareas, la latencia, los tokens totales, las llamadas a herramientas y el coste en tu propia carga.
Precios de la API de Grok 4.6
La página de precios de xAI publica los siguientes precios estándar en dólares por millón de tokens:
| Tamaño del prompt | Entrada | Entrada en caché | Salida |
|---|---|---|---|
| Menos de 200K tokens de prompt | $2.00 | $0.50 | $6.00 |
| 200K tokens de prompt o más | $4.00 | $1.00 | $12.00 |
Cuando el prompt alcanza 200K tokens, xAI indica que las tarifas de contexto largo se aplican a todos los tokens de la petición. Tres cálculos muestran el efecto:
- 100K de entrada y 5K de salida cuestan aproximadamente $0.23 con la tarifa estándar de contexto corto.
- Si los 100K tokens de entrada se sirven desde caché, la misma salida cuesta aproximadamente $0.08.
- 220K de entrada y 10K de salida superan el umbral y cuestan aproximadamente $1.00 con la tarifa publicada de contexto largo.
Estos ejemplos no incluyen herramientas del servidor. xAI cobra actualmente $5 por 1.000 llamadas de búsqueda web, búsqueda en X o ejecución de código, además de los tokens. El anuncio también menciona una variante rápida al doble del precio estándar. Confirma en la consola de xAI el modelo exacto, el nivel de servicio, la región y el precio vigente antes de presupuestar.
Para un método de costes más general, consulta Cómo calcular el coste de tokens LLM y Seguimiento del coste de API de IA.
Llamar a Grok 4.6 con Responses o Chat Completions
Las siguientes peticiones usan el endpoint oficial de xAI porque este artículo es una guía del lanzamiento, no una afirmación de que el modelo ya esté activo en todos los gateways.
Responses API:
export XAI_API_KEY="<YOUR_XAI_API_KEY>"
curl -sS https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6",
"input": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps.",
"prompt_cache_key": "grok-46-migration-review"
}'
Chat Completions:
curl -sS https://api.x.ai/v1/chat/completions \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-H "x-grok-conv-id: grok-46-migration-review" \
-d '{
"model": "grok-4.6",
"messages": [
{
"role": "user",
"content": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps."
}
]
}'
Usa prompt_cache_key con Responses o la cabecera x-grok-conv-id con Chat Completions para mejorar la afinidad de caché de una conversación. Trata estos valores como metadatos operativos: mantenlos estables en una conversación, no incluyas secretos ni datos personales y no reutilices un valor entre usuarios no relacionados.
Si estás eligiendo formato, consulta Responses API frente a Chat Completions.
Caché del prompt y bucles largos de agentes
La ventana de 500K es una capacidad, no un objetivo. Enviar todo el historial en cada turno aumenta la latencia y puede hacer que toda la petición entre en la tarifa de contexto largo.
Para flujos sostenidos:
- coloca las instrucciones estables y el contexto reutilizable al principio del prompt;
- usa una clave de afinidad de caché estable por conversación;
- mide por separado la entrada en caché y sin caché;
- compacta o resume los turnos antiguos antes de acercarte a 200K tokens;
- conserva los resultados de herramientas que sigan siendo válidos y elimina el ruido de transporte duplicado;
- fija un nivel de razonamiento y compara el éxito por tarea en vez de asumir que xhigh siempre es mejor;
- registra estado, latencia, entrada, entrada en caché, salida, llamadas a herramientas y coste total por tarea exitosa.
La compactación cambia la información que ve el modelo. Valida los resúmenes frente al estado original y conserva los ID, restricciones, decisiones y errores pendientes que sean autoritativos.
Cómo interpretar los benchmarks del lanzamiento
xAI publicó los siguientes resultados de Grok 4.6 High en su anuncio:
| Evaluación | Puntuación de Grok 4.6 publicada por xAI |
|---|---|
| Artificial Analysis Intelligence Index | 61 |
| GDPVal-AA v2 | 1753 |
| CursorBench v3.2 | 69.9% |
| DeepSWE v1.1 | 65.9% |
| FrontierCode v1.1 Extended | 61.3% |
| APEX-Agents | 57.5% |
Son resultados publicados por el proveedor, no pruebas independientes de Modelflare. El entorno de evaluación, el nivel de razonamiento, el acceso a herramientas, el límite de tiempo y la versión de puntuación afectan a la comparación. Usa la tabla para elegir cargas que merecen una prueba, no como clasificación universal ni como garantía de producción.
Lista de comprobación para migrar a producción
Antes de dirigir tráfico de producción a Grok 4.6:
- usa el ID exacto
grok-4.6y rechaza sustituciones silenciosas por alias; - confirma que el modelo está habilitado para la cuenta, región, formato API y nivel de servicio previstos;
- reproduce un conjunto fijo y seguro para la privacidad en Grok 4.5 y Grok 4.6;
- prueba por separado texto, imágenes, function calling, salidas estructuradas, streaming, rechazos y cancelación según el uso de tu aplicación;
- compara low, medium, high y xhigh por coste y latencia de tarea exitosa;
- prueba peticiones justo por debajo y por encima del umbral de 200K;
- verifica aciertos de caché, compactación, número de herramientas, reintentos y protección contra efectos duplicados;
- conserva una ruta de rollback y registra modelo, ruta, uso, latencia y cargo final de cada petición.
Un HTTP 200 solo demuestra que una petición terminó. No demuestra paridad funcional, latencia estable, herramientas correctas ni coste aceptable. Para pruebas por ruta, usa Pruebas de conformidad de API compatibles con OpenAI y Enrutamiento fiable de API de IA.
¿Está Grok 4.6 disponible en Modelflare?
Sí. En la comprobación de producción del 13 de agosto de 2026, el catálogo público de Modelos y precios de Modelflare mostraba el ID exacto grok-4.6 en los grupos grok-award y grok-stable. El catálogo indica compatibilidad con rutas OpenAI de Chat Completions y Responses API.
Los multiplicadores mostrados eran 0,03x para grok-award y 0,06x para grok-stable. El acceso a grupos, las rutas, los precios y la disponibilidad pueden cambiar. Como xAI también aplica una tarifa separada de contexto largo, no extiendas un multiplicador promocional o un ejemplo de contexto corto a todas las peticiones. La página de precios en vivo y el coste registrado de cada petición completada son la referencia actual.
Crea o actualiza una API Key con un grupo elegible, usa el ID exacto grok-4.6 y completa una petición real sin datos sensibles antes de mover tráfico de producción. El catálogo confirma la configuración pública, pero no es un benchmark independiente de Modelflare ni garantiza acceso a todas las API Keys.
Fuentes oficiales y registro de cambios
Fuentes primarias:
- xAI: Introducing Grok 4.6
- Guía de desarrollo de xAI: Grok 4.6
- Página del modelo xAI: grok-4.6
- Precios de la API de xAI
- Notas de la versión de xAI
Registro de cambios:
- 13 de agosto de 2026: Publicación inicial. Se comprobaron especificaciones, precios, formatos API, benchmarks del lanzamiento y disponibilidad en el catálogo de Modelflare.