Qwen3.8-Max: especificaciones 2.4T y configuración en Modelflare

Guía práctica de Qwen3.8-Max: arquitectura MoE 2.4T/95B, contexto multimodal de 1M tokens, controles de razonamiento, precios actuales y configuración recomendada.

El equipo de Qwen publicó oficialmente Qwen3.8-Max el 3 de agosto de 2026. No es el modelo anterior Qwen3-8B, con el que puede confundirse, ni se limita ya a la versión de julio qwen3.8-max-preview: el ID oficial actual de la API es qwen3.8-max, el mismo que utiliza Modelflare.

Se trata del modelo insignia Max de mayor tamaño de Qwen hasta la fecha, orientado a programación, flujos de trabajo profesionales, agentes de larga duración y tareas multimodales nativas. Qwen también anunció que los pesos abiertos de Qwen3.8-Max y Qwen3.8-27B llegarían la semana siguiente. Hasta que se publiquen realmente los repositorios y sus licencias, la descripción precisa es «pesos abiertos anunciados», no «ya disponible para despliegue local».

Especificaciones principales

Elemento Qwen3.8-Max
ID del modelo en Modelflare qwen3.8-max
Arquitectura Mixture-of-Experts (MoE)
Parámetros totales 2.4T
Parámetros activados por Token 95B
Longitud de contexto 1M tokens
Entrada máxima sin razonamiento 991K tokens
Entrada máxima con razonamiento 983K tokens
Salida máxima 131K tokens
Token máximos de razonamiento 262K tokens
Modalidades de entrada Texto, imagen y vídeo
Modalidad de salida Texto
Intensidad de razonamiento low, medium o xhigh; valor predeterminado xhigh
Funciones oficiales Prefix Completion, Function Calling, Context Cache, Structured Outputs, Batch y herramientas integradas de Responses

La cifra 2.4T corresponde al tamaño total del modelo, no a los parámetros que se ejecutan para generar cada Token. La publicación oficial indica 95B parámetros activados, una medida más útil para entender el cálculo que interviene realmente en la inferencia MoE. Un contexto de 1M tokens tampoco significa que cada solicitud deba llenarlo: a medida que aumentan la entrada y el presupuesto de razonamiento, la latencia, el caché y el coste requieren un diseño específico.

Qué persigue Qwen3.8-Max

Qwen presenta esta versión como una actualización amplia para programación y Cowork, con énfasis en tres tipos de trabajo:

  • Completar un proyecto de software de varios días desde un directorio vacío, en lugar de generar funciones aisladas.
  • Organizar entregables de varias etapas para investigación, análisis de datos, Office, diseño y otros flujos profesionales.
  • Usar la comprensión de imágenes y vídeo durante la planificación, la ejecución y la verificación, no solo como reconocimiento estático puntual.

Qwen muestra demostraciones del proveedor que incluyen más de diez días de programación autónoma y cientos de iteraciones de optimización de diseño de chips. Son casos a nivel de sistema condicionados por el Harness, las herramientas, el entorno, los prompts y el método de evaluación. No garantizan el mismo resultado en tu aplicación. La selección para producción debe usar tus propios repositorios, documentos, permisos de herramientas y criterios de aceptación en un conjunto fijo de muestras.

Cómo elegir la intensidad de razonamiento

Qwen3.8-Max admite reasoning_effort:

  • low para respuestas cortas, explicaciones ligeras de código y tareas sensibles al coste.
  • medium como punto de partida para desarrollo diario, análisis y tareas de varios pasos.
  • xhigh para razonamiento difícil, agentes de larga duración y trabajo profesional complejo; también es el valor predeterminado.

Qwen indica que preserve_thinking está activo por defecto, de modo que el trabajo de varios turnos puede continuar desde el estado de razonamiento anterior. Si el cliente reconstruye manualmente el historial, debe conservar los campos de razonamiento y el estado de las herramientas devueltos por el proveedor, no concatenar solo el texto final. El modelo permite hasta 262K tokens de razonamiento, pero un máximo disponible no es un valor predeterminado recomendado. Elige el effort según la tasa de éxito de las tareas y el coste unitario.

Disponibilidad actual en Modelflare

A 4 de agosto de 2026, Modelflare muestra qwen3.8-max para:

  • OpenAI Chat Completions;
  • OpenAI Responses;
  • una ruta compatible con Anthropic Messages.

Una etiqueta de protocolo demuestra que la ruta existe, no que todas las funciones privadas de QwenCloud se reenvíen automáticamente. QwenCloud enumera web_search, code_interpreter, web_extractor, t2i_search e i2i_search como herramientas integradas de Responses. Hasta validar cada una mediante la ruta exacta de Modelflare, prioriza Function Calling definido por el cliente y considera estas herramientas como no verificadas.

La instantánea pública actual del grupo qwen-award se muestra a continuación, en dólares por 1 millón de tokens:

Concepto de facturación Precio
Entrada $1.239
Salida $3.71
Lectura de caché $0.161
Creación explícita de caché $1.547
Creación explícita de caché durante una hora $2.4752

El grupo solo está disponible para API Keys que cumplan los requisitos. Los precios, la elegibilidad y los protocolos pueden cambiar; utiliza Modelos y precios y los registros de uso por solicitud como fuentes en tiempo real.

Configuración recomendada de Chat Completions

Guarda primero la Modelflare API Key en una variable de entorno:

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

Empieza con una solicitud de texto para validar la ruta básica:

curl -N -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Design a safe rollout plan for this service and include validation and rollback gates."
      }
    ],
    "reasoning_effort": "medium",
    "stream": true
  }'

Usa medium para establecer una referencia de calidad, latencia y coste, y eleva a xhigh solo las tareas que realmente necesiten más razonamiento. Que el valor predeterminado del upstream sea xhigh no justifica asignar el máximo presupuesto de razonamiento a cada solicitud por lotes.

Cómo desplegar la entrada multimodal

El modelo oficial acepta texto, imágenes y vídeo, pero los formatos multimodales varían según el protocolo y la implementación del upstream. Despliégalo en tres etapas:

  1. Valida autenticación, acceso al modelo, streaming y facturación solo con texto.
  2. Usa una imagen de prueba fija para validar el formato del contenido, los límites de tamaño y la salida.
  3. Añade después vídeo largo, herramientas o interacción visual de varios turnos, y comprueba si los reintentos duplican trabajo facturable.

No trates las URL de imágenes, los payloads Base64, la carga de archivos y el almacenamiento de objetos del proveedor como protocolos intercambiables. Prueba de extremo a extremo el bloque de contenido exacto que enviará el cliente.

Configuración recomendada en la plataforma

  1. Utiliza una API Key distinta por aplicación y confirma que su grupo principal incluye realmente qwen3.8-max.
  2. Empieza el desarrollo y el análisis diarios con medium, reduce tareas cortas a low y reserva xhigh para trabajos difíciles de larga duración.
  3. Diseña segmentación y caché para tareas de contexto largo, en lugar de introducir toda la base de conocimiento en cada contexto de 1M tokens.
  4. Valida por separado los wire contracts de Chat Completions, Responses y Anthropic.
  5. No hagas depender producción de las herramientas integradas del proveedor hasta que superen una solicitud real por la ruta objetivo de Modelflare.
  6. Compara tasa de éxito, primera salida, latencia total, Token de razonamiento, aciertos de caché y coste por solicitud con un conjunto fijo de tareas.
  7. Repite las muestras de regresión al pasar de preview al modelo definitivo; no supongas que el nombre de la familia garantiza una salida idéntica.

Casos adecuados y casos que requieren comparación

Qwen3.8-Max encaja en ingeniería de software compleja, flujos profesionales de varios pasos, comprensión de documentos largos y vídeo, agentes con feedback multimodal y equipos que quieren unificar razonamiento y orquestación en un modelo insignia. Puede no ser la opción predeterminada más económica para transformaciones de texto simples que requieren alto throughput y baja latencia. Compáralo con Qwen Flash, DeepSeek V4 Flash u otro modelo más pequeño usando las mismas entradas.

Fuentes y fecha de verificación

Este artículo se verificó el 4 de agosto de 2026. El estado de los pesos abiertos, las versiones del modelo, los precios y los protocolos pueden cambiar; para producción, utiliza la página oficial del modelo, la licencia del repositorio de pesos y el catálogo en tiempo real de Modelflare disponibles al realizar la llamada.