GLM-5.3, Kimi K3 e Qwen3.8-Max: recursos, preços e API
Guia verificado de GLM-5.3, Kimi K3 e Qwen3.8-Max com recursos de fontes primárias, preços e grupos da Modelflare, exemplos de Chat Completions, Responses, Anthropic Messages e controles de produção.
A Modelflare já disponibiliza glm-5.3, kimi-k3 e qwen3.8-max por meio de um único gateway compatível. Este guia de lançamento explica os melhores usos de cada modelo, o retrato atual dos preços em USD, os três contratos de requisição e um caminho seguro da criação da API Key à prova em produção.
O texto separa a documentação primária dos fornecedores dos fatos do catálogo da Modelflare. Uma capacidade anunciada pelo fornecedor não é automaticamente uma função exposta pelo gateway: confira a linha atual do modelo e teste o endpoint usado pelo cliente.
Disponibilidade, grupos e preços sujeitos a mudança foram verificados em 29 de agosto de 2026. Depois dessa data, a fonte válida é a página de preços da Modelflare.
Três modelos em resumo
| ID do modelo | Bom ponto de partida | Notas de capacidade primária | Contexto e raciocínio |
|---|---|---|---|
| glm-5.3 | Código complexo e agentes de longa duração | A Z.ai posiciona o GLM-5.3 para código difícil e tarefas de agente mais longas; o pensamento permanece ativo na API | Pensamento sempre ativo; níveis documentados low, high e max, padrão max |
| kimi-k3 | Código com contexto longo e trabalho de conhecimento | A Kimi documenta compreensão visual nativa e trabalho completo de longo horizonte | Até 1M de contexto; pensamento sempre ativo; low, high e max, padrão max |
| qwen3.8-max | Fluxos profissionais e agentes prolongados | A Qwen documenta um MoE com 2,4T totais / 95B ativos, código, entrada visual e fluxos orientados a ferramentas | Contexto de 1M; entrada de texto, imagem e vídeo; saída de texto; algumas ferramentas dependem da região e do endpoint |
Consulte o anúncio do GLM-5.3, o guia de seleção de modelos da Kimi e a referência do Qwen3.8-Max para a redação atual dos fornecedores. Os benchmarks são relatados por eles e não são garantia da Modelflare.
Escolha por carga de trabalho
- Escolha glm-5.3 para planejamento sustentado, mudanças de código difíceis ou ciclos longos de agente, quando o raciocínio contínuo couber no orçamento.
- Escolha kimi-k3 quando contexto muito grande, compreensão visual ou um fluxo completo de trabalho de conhecimento for essencial.
- Escolha qwen3.8-max quando uma janela de 1M tokens, entrada multimodal, ferramentas estruturadas ou automação profissional forem importantes.
São pontos de partida, não um ranking universal. Reexecute uma amostra sem dados sensíveis das suas tarefas e meça custo por tarefa concluída, tentativas, latência e tempo de revisão. Um limite amplo de contexto é um teto, não uma promessa de igual utilidade ou velocidade em toda posição.
Retrato de preços da Modelflare
Os valores abaixo são USD por 1 milhão de tokens para os grupos públicos atuais. O multiplicador do grupo é 0.8x, conforme a fórmula “preço oficial × 0.8” do anúncio.
| Modelo | Grupo | Entrada | Saída | Entrada em cache |
|---|---|---|---|---|
| glm-5.3 | glm-stable | $1.12 | $3.52 | cerca de $0.21 |
| kimi-k3 | kimi-stable | $2.40 | $12.00 | $0.24 |
| qwen3.8-max | qwen-stable | $1.60 | $4.80 | $0.20 |
Os valores usam preço de entrada, razão de conclusão, razão de cache e multiplicador do grupo no catálogo ao vivo, com arredondamento para leitura. Se a página tiver um campo separado de escrita de cache, use esse campo para criar cache; não o deduza do preço de leitura.
Os três grupos mostram rpm: 0, ou seja, não há limite RPM fixo de grupo configurado no lado da plataforma. Isso não remove controles do fornecedor, da conta, da rede ou de segurança. Preços e disponibilidade mudam; confronte a página de preços ao vivo com o registro de uso.
Um gateway, três contratos de API
Neste retrato, o catálogo da Modelflare marca os três IDs para estes formatos públicos:
| Contrato | Endpoint | Autenticação | Uso indicado |
|---|---|---|---|
| OpenAI Chat Completions | POST /v1/chat/completions | Authorization: Bearer | Clientes de chat existentes e SDKs compatíveis |
| OpenAI Responses | POST /v1/responses | Authorization: Bearer | Clientes que consomem itens e eventos de Responses |
| Compatível com Anthropic Messages | POST /v1/messages | x-api-key ou Bearer mais anthropic-version | Clientes no formato Anthropic e fluxos de mensagens |
A URL base compatível com OpenAI é https://modelflare.dev/v1. SDKs Anthropic normalmente usam https://modelflare.dev como base e acrescentam /v1/messages. A disponibilidade do endpoint não significa paridade de recursos: valide separadamente eventos de streaming, ferramentas, saída estruturada, entrada multimodal e controles de raciocínio.
Conecte pela Modelflare
- Em API Keys, crie ou atualize uma chave e conceda o grupo que contém o modelo: glm-stable, kimi-stable ou qwen-stable.
- Mantenha a chave em uma variável de ambiente. Não a coloque no repositório, no armazenamento do navegador ou em um chamado.
- Confirme a resposta autenticada de /v1/models e envie uma requisição pequena sem streaming com o ID exato.
- Teste streaming como contrato separado antes de mover um agente ou tráfego de usuários.
Chat Completions
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "Resuma os riscos da migração em três pontos."}],
"stream": false
}'
Responses API
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"input": "Retorne uma lista curta para uma migração segura de banco de dados.",
"stream": false
}'
Anthropic Messages
curl -sS https://modelflare.dev/v1/messages \
-H "x-api-key: $MODELFLARE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Liste as três primeiras verificações do rollout."}]
}'
Os exemplos usam propositalmente texto simples e stream: false. Ative streaming somente quando o cliente tratar o formato de eventos desse contrato. Preserve valores explícitos 0 e false quando tiverem significado, e não copie um campo específico do fornecedor entre modelos sem verificar o contrato.
Verifique antes da produção
- Liste modelos com a mesma chave e confirme o ID e o grupo exatos.
- Faça uma prova sem streaming e outra com streaming no endpoint realmente usado pela aplicação.
- Se a carga usa ferramentas, saída estruturada, imagens, vídeo ou controles de raciocínio, teste cada função no modelo escolhido; uma resposta textual não prova as demais.
- Registre status, grupo escolhido, tokens de entrada/saída/cache, latência, tentativas e cobrança final no registro de uso.
- Limite as tentativas da aplicação e diferencie pressão temporária de capacidade de um erro final de modelo ou política.
- Consulte novamente o preço ao vivo antes de grande volume; a página e o registro de uso prevalecem sobre uma tabela copiada.
Perguntas frequentes
Esses preços são permanentes? Não. É um retrato datado do catálogo; a página de preços ao vivo é a fonte oficial.
rpm: 0 significa tráfego ilimitado? Não. Significa apenas que não existe teto RPM configurado para o grupo na plataforma. Limites do fornecedor, da conta, da rede e de segurança continuam possíveis.
O mesmo payload serve para os três protocolos? Não. Mantenha o ID do modelo, mas adapte envelope, autenticação, parser de resposta e tratamento de streaming ao contrato selecionado.
Quais modelos documentam contexto de 1M? Kimi K3 e Qwen3.8-Max indicam 1M nas referências primárias ligadas. Esta página não afirma 1M para o GLM-5.3.
Fontes e atualização
- Z.ai: GLM-5.3
- Seleção de modelos da API Kimi
- Alibaba Cloud Model Studio: Qwen3.8-Max
- Preços ao vivo da Modelflare
- Guia aprofundado do Qwen3.8-Max na Modelflare
- Guia da API compatível com OpenAI
- Responses API e Chat Completions
Registro de atualização: 29 de agosto de 2026 — primeira versão; páginas primárias, grupos da Modelflare, marcações de endpoint e preços foram verificados nesse dia.