Grok 4.6 lançado: API, preços, contexto de 500K e guia
Guia verificado do Grok 4.6 com ID exato, contexto de 500K, preços por token, níveis de raciocínio, exemplos de API, benchmarks e lista de migração.
A xAI lançou o Grok 4.6 em 12 de agosto de 2026. O guia oficial para developers indica o modelo API grok-4.6, com janela de contexto de 500.000 tokens, entrada de texto e imagem, saída de texto e quatro níveis de esforço de raciocínio: low, medium, high (predefinido) e xhigh.
Para developers, os detalhes mais importantes não são apenas os benchmarks de lançamento. O Grok 4.6 funciona com Responses API e Chat Completions, muda para o preço de contexto longo ao atingir 200.000 tokens de prompt e exige afinidade de cache e gestão de contexto deliberadas em agentes de longa duração.
Este guia separa as especificações oficiais da xAI dos benchmarks publicados pelo fornecedor e da disponibilidade atual na Modelflare. Preços e disponibilidade podem mudar; todos os dados voláteis abaixo foram verificados em 13 de agosto de 2026.
Grok 4.6 em resumo
| Propriedade | Valor oficial |
|---|---|
| Data de lançamento | 12 de agosto de 2026 |
| ID do modelo API | grok-4.6 |
| Janela de contexto | 500.000 tokens |
| Limite de conhecimento | 1 de fevereiro de 2026 |
| Modalidades | Entrada de texto e imagem; saída de texto |
| Limite da saída de texto | A xAI indica que não existe limite fixo |
| Esforço de raciocínio | low, medium, high (predefinido), xhigh |
| Formatos da API | Responses API e Chat Completions |
| Capacidades documentadas | Function calling, resultados estruturados, pesquisa web, pesquisa no X e execução de código |
“Sem limite fixo de saída de texto” é a descrição da página do modelo, não uma promessa de que qualquer SDK, gateway, conta ou pedido pode devolver texto ilimitado. Continuam a aplicar-se os tempos limite do cliente, os limites da conta, a política da rota e o contexto disponível.
O que mudou desde o Grok 4.5
A xAI posiciona o Grok 4.6 como uma atualização incremental do seu modelo frontier focada em agentes de longa duração e trabalhos interativos e visuais mais ambiciosos. O anúncio oficial descreve treino suplementar mais longo, trajetórias de ajuste supervisionado regeneradas e reinforcement learning agêntico em trabalho intelectual, programação, desenvolvimento web, otimização de kernels e CAD.
As alterações práticas a avaliar são:
xhighjunta-se aos níveis low, medium e high;- a xAI relata melhor continuidade em investigação de vários passos, trabalho em bases de código e criação iterativa de aplicações;
- o modelo aceita imagens e texto e devolve texto;
- a classe de contexto de 500K e os preços iniciais de $2 por entrada e $6 por saída mantêm-se, mas a entrada em cache do Grok 4.6 custa $0,50 por milhão, contra os $0,30 atualmente indicados para o Grok 4.5;
- a xAI recomenda afinidade de cache por conversa e compactação de contexto para ciclos longos de agentes.
Estas alterações justificam uma migração controlada, não a substituição cega do Grok 4.5. Compare conclusão de tarefas, latência, total de tokens, chamadas de ferramentas e custos no seu próprio workload.
Preços da API do Grok 4.6
A página de preços da xAI indica os seguintes preços padrão em dólares por milhão de tokens:
| Tamanho do prompt | Entrada | Entrada em cache | Saída |
|---|---|---|---|
| Menos de 200K tokens de prompt | $2.00 | $0.50 | $6.00 |
| 200K tokens de prompt ou mais | $4.00 | $1.00 | $12.00 |
Quando o prompt atinge 200K tokens, a xAI afirma que as tarifas de contexto longo se aplicam a todos os tokens do pedido. Três cálculos tornam o limite concreto:
- 100K de entrada mais 5K de saída custam cerca de $0.23 nas tarifas padrão de contexto curto.
- Se todos os 100K tokens de entrada vierem da cache, a mesma saída custa cerca de $0.08.
- 220K de entrada mais 10K de saída ultrapassam o limite e custam cerca de $1.00 nas tarifas publicadas de contexto longo.
Estes exemplos não incluem ferramentas do servidor. A xAI cobra atualmente $5 por 1.000 chamadas de pesquisa web, pesquisa no X ou execução de código, além dos tokens. O anúncio também refere uma variante rápida ao dobro do preço padrão. Confirme na consola xAI o modelo exato, o nível de serviço, a região e o preço atual antes de orçamentar.
Para um método de custos mais geral, consulte Como calcular o custo de tokens LLM e Acompanhamento de custos da API de IA.
Chamar o Grok 4.6 com Responses ou Chat Completions
Os pedidos seguintes usam o endpoint oficial da xAI porque este artigo é um guia de lançamento, não uma afirmação de que o modelo já está ativo em todos os gateways.
Responses API:
export XAI_API_KEY="<YOUR_XAI_API_KEY>"
curl -sS https://api.x.ai/v1/responses \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "grok-4.6",
"input": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps.",
"prompt_cache_key": "grok-46-migration-review"
}'
Chat Completions:
curl -sS https://api.x.ai/v1/chat/completions \
-H "Authorization: Bearer $XAI_API_KEY" \
-H "Content-Type: application/json" \
-H "x-grok-conv-id: grok-46-migration-review" \
-d '{
"model": "grok-4.6",
"messages": [
{
"role": "user",
"content": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps."
}
]
}'
Use prompt_cache_key com Responses ou o cabeçalho x-grok-conv-id com Chat Completions para melhorar a afinidade de cache de uma conversa. Trate estes valores como metadados operacionais: mantenha-os estáveis numa conversa, não inclua segredos nem dados pessoais e não reutilize um valor entre utilizadores sem relação.
Se estiver a escolher o formato, consulte Responses API vs Chat Completions.
Cache de prompt e ciclos longos de agentes
A janela de contexto de 500K é capacidade, não um objetivo. Enviar todo o histórico a cada turno aumenta a latência e pode colocar o pedido inteiro na tarifa de contexto longo.
Para fluxos de trabalho sustentados:
- coloque instruções estáveis e contexto reutilizável no início do prompt;
- use uma chave de afinidade de cache estável por conversa;
- meça separadamente a entrada em cache e sem cache;
- compacte ou resuma turnos antigos antes de o prompt se aproximar de 200K tokens;
- mantenha resultados de ferramentas ainda autoritativos e elimine ruído de transporte duplicado;
- defina o nível de raciocínio e compare o sucesso por tarefa, em vez de assumir que xhigh é sempre melhor;
- registe estado, latência, entrada, entrada em cache, saída, chamadas de ferramentas e custo total por tarefa concluída.
A compactação altera a informação que o modelo vê. Valide os resumos contra o estado original e preserve identificadores, restrições, decisões e erros não resolvidos que sejam autoritativos.
Como interpretar os benchmarks de lançamento
A xAI publicou no anúncio os seguintes resultados do Grok 4.6 High:
| Avaliação | Pontuação do Grok 4.6 publicada pela xAI |
|---|---|
| Artificial Analysis Intelligence Index | 61 |
| GDPVal-AA v2 | 1753 |
| CursorBench v3.2 | 69.9% |
| DeepSWE v1.1 | 65.9% |
| FrontierCode v1.1 Extended | 61.3% |
| APEX-Agents | 57.5% |
São resultados publicados pelo fornecedor, não testes independentes da Modelflare. O ambiente de avaliação, o nível de raciocínio, o acesso a ferramentas, o limite de tempo e a versão da pontuação afetam a comparação. Use a tabela para escolher workloads a testar, não como classificação universal nem garantia de produção.
Lista de verificação para migração para produção
Antes de encaminhar tráfego de produção para o Grok 4.6:
- use o ID exato
grok-4.6e rejeite substituições silenciosas por aliases; - confirme que o modelo está ativo para a conta, região, formato de API e nível de serviço pretendidos;
- reproduza um conjunto de avaliação fixo e sem dados privados no Grok 4.5 e no Grok 4.6;
- teste separadamente texto, imagens, function calling, resultados estruturados, streaming, recusas e cancelamento conforme o uso da aplicação;
- compare low, medium, high e xhigh pelo custo e latência de cada tarefa concluída;
- teste pedidos imediatamente abaixo e acima do limite de 200K;
- verifique cache hits, compactação, número de ferramentas, retries e proteção contra efeitos duplicados;
- mantenha uma rota de rollback e registe modelo, rota, utilização, latência e cobrança final de cada pedido.
Um HTTP 200 apenas prova que um pedido terminou. Não prova paridade funcional, latência estável, ferramentas corretas ou custo aceitável. Para testes por rota, use Testes de conformidade de API compatíveis com OpenAI e Encaminhamento fiável de API de IA.
O Grok 4.6 está disponível na Modelflare?
Sim. Na verificação de produção de 13 de agosto de 2026, o catálogo público de Modelos e preços da Modelflare apresentava o ID exato grok-4.6 nos grupos grok-award e grok-stable. O catálogo indica suporte para rotas OpenAI-compatible de Chat Completions e Responses API.
Os multiplicadores apresentados eram 0,03x para grok-award e 0,06x para grok-stable. Acesso a grupos, rotas, preços e disponibilidade podem mudar. Como a xAI também aplica uma tarifa separada de contexto longo, não aplique um multiplicador promocional ou um exemplo de contexto curto a todos os pedidos. A página de preços em tempo real e o custo registado do pedido concluído são a referência atual.
Crie ou atualize uma API Key com um grupo elegível, use o ID exato grok-4.6 e conclua um pedido real sem dados sensíveis antes de mover tráfego de produção. A listagem confirma a configuração pública, mas não é um benchmark independente da Modelflare nem garante acesso a todas as API Keys.
Fontes oficiais e registo de alterações
Fontes primárias:
- xAI: Introducing Grok 4.6
- Guia para developers da xAI: Grok 4.6
- Página do modelo xAI: grok-4.6
- Preços da API xAI
- Notas de lançamento da xAI
Registo de alterações:
- 13 de agosto de 2026: Publicação inicial. Foram verificados especificações, preços, formatos API, benchmarks de lançamento e disponibilidade no catálogo da Modelflare.