Qwen3.8-Max: MoE 2.4T e configuração na Modelflare
Guia prático do Qwen3.8-Max: MoE 2.4T/95B, contexto multimodal de 1M tokens, controles de raciocínio, preços atuais e configuração recomendada.
A equipe Qwen lançou oficialmente o Qwen3.8-Max em 3 de agosto de 2026. Ele não é o antigo Qwen3-8B, com o qual pode ser confundido, nem está mais limitado ao qwen3.8-max-preview de julho: o ID oficial atual da API é qwen3.8-max, o mesmo usado pela Modelflare.
Esse é o maior modelo flagship Max atual da Qwen, voltado para programação, workflows profissionais, Agents de longa duração e tarefas multimodais nativas. A Qwen também anunciou que os open weights do Qwen3.8-Max e do Qwen3.8-27B chegariam na semana seguinte. Até que os repositórios e as licenças sejam publicados de fato, a descrição precisa é “open weights anunciados”, e não “já disponível para implantação local”.
Especificações principais
| Item | Qwen3.8-Max |
|---|---|
| ID do modelo na Modelflare | qwen3.8-max |
| Arquitetura | Mixture-of-Experts (MoE) |
| Parâmetros totais | 2.4T |
| Parâmetros ativados por Token | 95B |
| Tamanho do contexto | 1M tokens |
| Entrada máxima sem raciocínio | 991K tokens |
| Entrada máxima com raciocínio | 983K tokens |
| Saída máxima | 131K tokens |
| Máximo de Token de raciocínio | 262K tokens |
| Modalidades de entrada | Texto, imagem e vídeo |
| Modalidade de saída | Texto |
| Intensidade de raciocínio | low, medium ou xhigh; padrão xhigh |
| Recursos oficiais | Prefix Completion, Function Calling, Context Cache, Structured Outputs, Batch e ferramentas integradas do Responses |
O valor 2.4T representa o tamanho total do modelo, não os parâmetros executados para gerar cada Token. O anúncio oficial informa 95B parâmetros ativados, uma medida mais útil para entender a computação realmente envolvida na inferência MoE. Um contexto de 1M tokens também não significa que toda requisição deva preenchê-lo: conforme a entrada e o orçamento de raciocínio aumentam, latência, cache e custo exigem planejamento específico.
O que o Qwen3.8-Max busca resolver
A Qwen apresenta o lançamento como uma atualização ampla para programação e Cowork, destacando três tipos de trabalho:
- Concluir um projeto de software de vários dias partindo de um diretório vazio, em vez de gerar funções isoladas.
- Organizar entregáveis em várias etapas para pesquisa, análise de dados, Office, design e outros workflows profissionais.
- Usar compreensão de imagem e vídeo ao longo do planejamento, da execução e da verificação, e não apenas em um reconhecimento estático pontual.
A Qwen mostra demonstrações do provedor que incluem mais de dez dias de programação autônoma e centenas de iterações de otimização de design de chips. São exemplos no nível do sistema, afetados pelo Harness, ferramentas, ambiente, prompts e método de avaliação. Eles não garantem o mesmo resultado na sua aplicação. A seleção para produção deve usar seus próprios repositórios, documentos, permissões de ferramentas e critérios de aceitação em um conjunto fixo de amostras.
Como escolher a intensidade de raciocínio
O Qwen3.8-Max aceita reasoning_effort:
lowpara respostas curtas, explicações leves de código e tarefas sensíveis a custo.mediumcomo ponto de partida para desenvolvimento diário, análise e tarefas em várias etapas.xhighpara raciocínio difícil, Agents de longa duração e trabalho profissional complexo; esse também é o padrão.
A Qwen informa que preserve_thinking fica ativo por padrão para que trabalhos em vários turnos continuem do estado de raciocínio anterior. Se o cliente reconstruir o histórico manualmente, deve preservar os campos de raciocínio e o estado das ferramentas retornados pelo provedor, e não concatenar apenas o texto final. O modelo permite até 262K tokens de raciocínio, mas um máximo disponível não é um padrão recomendado. Escolha o effort com base no sucesso das tarefas e no custo unitário.
Disponibilidade atual na Modelflare
Em 4 de agosto de 2026, a Modelflare lista qwen3.8-max para:
- OpenAI Chat Completions;
- OpenAI Responses;
- uma rota compatível com Anthropic Messages.
Uma indicação de protocolo prova que a rota existe, não que todos os recursos privados da QwenCloud sejam encaminhados automaticamente. A QwenCloud lista web_search, code_interpreter, web_extractor, t2i_search e i2i_search como ferramentas integradas do Responses. Até que cada uma seja verificada pela rota exata da Modelflare, priorize Function Calling definido pelo cliente e trate as ferramentas integradas como não verificadas.
O snapshot público atual do grupo qwen-award aparece abaixo, em dólares por 1 milhão de tokens:
| Item de cobrança | Preço |
|---|---|
| Entrada | $1.239 |
| Saída | $3.71 |
| Leitura de cache | $0.161 |
| Criação explícita de cache | $1.547 |
| Criação explícita de cache por uma hora | $2.4752 |
O grupo está disponível somente para API Keys qualificadas. Preços, elegibilidade e protocolos podem mudar; use Modelos e preços e os registros de uso por requisição como fontes em tempo real.
Configuração recomendada de Chat Completions
Primeiro, armazene a Modelflare API Key em uma variável de ambiente:
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
Comece com uma requisição de texto para validar a rota básica:
curl -N -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Design a safe rollout plan for this service and include validation and rollback gates."
}
],
"reasoning_effort": "medium",
"stream": true
}'
Use medium para estabelecer uma referência de qualidade, latência e custo, e eleve para xhigh somente as tarefas que realmente precisam de mais raciocínio. O padrão xhigh do upstream não é motivo para dar o orçamento máximo de raciocínio a toda requisição em lote.
Como implantar entrada multimodal
O modelo oficial aceita texto, imagens e vídeo, mas os formatos multimodais variam conforme o protocolo e a implementação do upstream. Faça a implantação em três etapas:
- Valide autenticação, acesso ao modelo, streaming e cobrança somente com texto.
- Use uma imagem de teste fixa para validar o formato do conteúdo, os limites de tamanho e a saída.
- Adicione depois vídeo longo, ferramentas ou feedback visual em vários turnos, verificando se novas tentativas duplicam trabalho cobrável.
Não trate URLs de imagem, payloads Base64, upload de arquivos e armazenamento de objetos do provedor como protocolos intercambiáveis. Teste de ponta a ponta exatamente o bloco de conteúdo que o cliente enviará.
Configuração recomendada na plataforma
- Use uma API Key separada por aplicação e confirme que o grupo principal realmente lista
qwen3.8-max. - Comece desenvolvimento e análise cotidianos com
medium, reduza tarefas curtas paralowe reservexhighpara trabalhos difíceis de longa duração. - Planeje segmentação e cache para tarefas de contexto longo, em vez de enviar toda a base de conhecimento em cada contexto de 1M tokens.
- Valide separadamente os wire contracts de Chat Completions, Responses e Anthropic.
- Não transforme as ferramentas integradas do provedor em dependência de produção até que passem por uma requisição real na rota alvo da Modelflare.
- Compare taxa de sucesso, primeira saída, latência total, Token de raciocínio, acertos de cache e custo por requisição com um conjunto fixo de tarefas.
- Execute novamente as amostras de regressão ao migrar da preview para o modelo definitivo; não presuma que o nome da família garante saída idêntica.
Onde o modelo se encaixa
O Qwen3.8-Max é adequado para engenharia de software complexa, workflows profissionais em várias etapas, compreensão de documentos longos e vídeo, Agents com feedback multimodal e equipes que querem unificar raciocínio e orquestração em um modelo flagship. Ele pode não ser o padrão mais econômico para transformações de texto simples com alto throughput e baixa latência. Compare-o com Qwen Flash, DeepSeek V4 Flash ou outro modelo menor usando as mesmas entradas.
Fontes e data de verificação
- Lançamento oficial do Qwen3.8-Max: data de lançamento, 95B parâmetros ativados, demonstrações Coding/Cowork e plano de open weights.
- Página do Qwen3.8-Max na QwenCloud: contexto, limites de entrada e saída, modalidades, recursos oficiais e preços.
- Modelos e preços da Modelflare: grupos, protocolos e preços atuais da plataforma.
Este artigo foi verificado em 4 de agosto de 2026. O estado dos open weights, snapshots do modelo, preços e protocolos aceitos podem mudar; em produção, use a página oficial do modelo, a licença do repositório de weights e o catálogo em tempo real da Modelflare disponíveis no momento da chamada.