GLM-5.3, Kimi K3 y Qwen3.8-Max: capacidades, precios y API
Guía verificada de GLM-5.3, Kimi K3 y Qwen3.8-Max con capacidades de primera mano, precios y grupos de Modelflare, ejemplos de Chat Completions, Responses y Anthropic Messages, y controles de producción.
Modelflare ya ofrece glm-5.3, kimi-k3 y qwen3.8-max mediante una única pasarela compatible. Esta guía de lanzamiento explica para qué sirve cada modelo, la instantánea actual de precios en USD, los tres contratos de solicitud disponibles y un camino seguro desde la creación de una API Key hasta una prueba de producción.
El texto separa la documentación de primera mano de los hechos del catálogo de Modelflare. Una capacidad anunciada por un proveedor no se convierte automáticamente en una función expuesta por la pasarela: comprueba siempre la fila actual del modelo y prueba el endpoint que usa tu cliente.
La disponibilidad, los grupos y los precios que pueden cambiar se comprobaron el 29 de agosto de 2026. Después de esa fecha, la fuente válida es la página de precios de Modelflare.
Tres modelos de un vistazo
| ID del modelo | Buen punto de partida | Notas de capacidad de primera mano | Contexto y razonamiento |
|---|---|---|---|
| glm-5.3 | Código complejo y agentes de horizonte largo | Z.ai orienta GLM-5.3 a código difícil y tareas de agente más largas; su API mantiene el pensamiento activado | El pensamiento siempre está activo; niveles documentados low, high y max, con max predeterminado |
| kimi-k3 | Código con mucho contexto y trabajo de conocimiento | Kimi documenta comprensión visual nativa y trabajo completo de horizonte largo | Hasta 1M de contexto; pensamiento siempre activo; niveles low, high y max, por defecto max |
| qwen3.8-max | Flujos profesionales y agentes prolongados | Qwen documenta un MoE de 2.4T totales / 95B activos, con código, entrada visual y flujos orientados a herramientas | Contexto de 1M; entrada de texto, imagen y vídeo; salida de texto; algunas herramientas dependen de la región y el endpoint |
Consulta el anuncio de GLM-5.3, la guía de modelos de Kimi y la referencia de Qwen3.8-Max para leer la redacción actual de cada proveedor. Sus cifras de benchmark son reportadas por ellos y no constituyen una garantía de Modelflare.
Elegir según la carga de trabajo
- Elige glm-5.3 cuando necesites planificación sostenida, cambios de código difíciles o un ciclo de agente largo, y puedas presupuestar el razonamiento permanente.
- Elige kimi-k3 cuando el contexto muy grande, la comprensión visual o un flujo completo de trabajo de conocimiento sea central.
- Elige qwen3.8-max cuando importen una ventana de 1M tokens, entrada multimodal, herramientas estructuradas o automatización profesional.
Son puntos de partida, no una clasificación universal. Reproduce una muestra de tus tareas sin datos sensibles y mide el coste por tarea exitosa, los reintentos, la latencia y el tiempo de revisión. Un límite de contexto grande es un techo, no una promesa de igual utilidad o velocidad en todas las posiciones.
Instantánea de precios de Modelflare
Los valores siguientes son USD por 1 millón de tokens para los grupos públicos actuales. El multiplicador de grupo es 0.8x, de acuerdo con la fórmula “precio oficial × 0.8” del anuncio.
| Modelo | Grupo | Entrada | Salida | Entrada en caché |
|---|---|---|---|---|
| glm-5.3 | glm-stable | $1.12 | $3.52 | aprox. $0.21 |
| kimi-k3 | kimi-stable | $2.40 | $12.00 | $0.24 |
| qwen3.8-max | qwen-stable | $1.60 | $4.80 | $0.20 |
Los valores se calculan con el precio de entrada, el multiplicador de completado, el multiplicador de caché y el multiplicador de grupo del catálogo vivo, y se redondean para facilitar la lectura. Si la página muestra un campo separado para escribir caché, usa ese campo para crear caché; no lo deduzcas del precio de lectura.
Los tres grupos muestran ahora rpm: 0: el catálogo no tiene configurado un límite RPM fijo a nivel de grupo en la plataforma. Esto no elimina los controles del proveedor, de la cuenta, de la red o de seguridad. Los precios y la disponibilidad cambian; reconcilia siempre con la página de precios en vivo y el registro de uso.
Una pasarela, tres contratos de API
En esta instantánea, el catálogo de Modelflare marca los tres IDs para estos formatos públicos:
| Contrato | Endpoint | Autenticación | Uso habitual |
|---|---|---|---|
| OpenAI Chat Completions | POST /v1/chat/completions | Authorization: Bearer | Clientes de chat existentes y SDK compatibles |
| OpenAI Responses | POST /v1/responses | Authorization: Bearer | Clientes que consumen elementos y eventos de Responses |
| Compatible con Anthropic Messages | POST /v1/messages | x-api-key o Bearer más anthropic-version | Clientes con forma Anthropic y flujos de mensajes |
La URL base compatible con OpenAI es https://modelflare.dev/v1. Los SDK de Anthropic suelen usar https://modelflare.dev como base y añadir /v1/messages. Que un endpoint esté disponible no implica paridad de funciones: valida por separado eventos de streaming, herramientas, salida estructurada, entrada multimodal y controles de razonamiento.
Conectar mediante Modelflare
- En API Keys, crea o actualiza una clave y concédele el grupo que contiene el modelo: glm-stable, kimi-stable o qwen-stable.
- Guarda la clave en una variable de entorno. No la pongas en el repositorio, en el almacenamiento del navegador ni en un ticket.
- Confirma la respuesta autenticada de /v1/models y envía una solicitud pequeña sin streaming con el ID exacto.
- Prueba el streaming como contrato separado antes de mover un agente o tráfico de usuarios.
Chat Completions
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "Resume los riesgos de migración en tres puntos."}],
"stream": false
}'
Responses API
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"input": "Devuelve una lista breve para una migración segura de base de datos.",
"stream": false
}'
Anthropic Messages
curl -sS https://modelflare.dev/v1/messages \
-H "x-api-key: $MODELFLARE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Enumera las tres primeras comprobaciones del despliegue."}]
}'
Los ejemplos usan deliberadamente texto plano y stream: false. Activa streaming solo cuando el cliente maneje el formato de eventos de ese contrato. Conserva los valores explícitos 0 y false cuando tengan significado, y no copies un campo específico del proveedor entre modelos sin revisar su contrato.
Verificar antes de producción
- Lista los modelos con la misma clave y confirma que el ID y el grupo exactos sean visibles.
- Ejecuta una prueba sin streaming y otra con streaming en el endpoint real de la aplicación.
- Si usas herramientas, salida estructurada, imágenes, vídeo o controles de razonamiento, prueba cada función en el modelo elegido; una respuesta de texto correcta no demuestra lo demás.
- Registra estado, grupo seleccionado, tokens de entrada/salida/caché, latencia, reintentos y cargo final en el registro de uso.
- Limita los reintentos de la aplicación y distingue una respuesta temporal de capacidad de un error terminal de modelo o de política.
- Vuelve a consultar los precios en vivo antes de lanzar mucho tráfico; la página y el registro tienen prioridad sobre una tabla copiada.
Preguntas frecuentes
¿Estos precios son permanentes? No. Es una instantánea fechada; la página de precios en vivo es la fuente de verdad.
¿rpm: 0 significa tráfico ilimitado? No. Solo indica que el grupo no tiene un techo RPM configurado en la plataforma. Siguen vigentes los límites del proveedor, la cuenta, la red y la seguridad.
¿Se puede enviar el mismo payload a los tres protocolos? No. Conserva el ID, pero adapta el sobre, la autenticación, el parser de respuesta y el manejador de streaming al contrato elegido.
¿Qué modelos documentan una ventana de 1M? Kimi K3 y Qwen3.8-Max la indican en las referencias de primera mano enlazadas. Esta página no afirma una ventana de 1M para GLM-5.3.
Fuentes y actualización
- Z.ai: GLM-5.3
- Selección de modelos de la API de Kimi
- Alibaba Cloud Model Studio: Qwen3.8-Max
- Precios en vivo de Modelflare
- Guía detallada de Qwen3.8-Max en Modelflare
- Guía de API compatible con OpenAI
- Responses API frente a Chat Completions
Registro de actualización: 29 de agosto de 2026 — guía inicial; las páginas de capacidades, grupos de Modelflare, indicadores de endpoint y precios se comprobaron ese día.