Qwen3.8-Max : MoE 2.4T et configuration Modelflare

Guide pratique de Qwen3.8-Max : MoE 2.4T/95B, contexte multimodal de 1M tokens, réglages de raisonnement, tarifs actuels et configuration conseillée.

L’équipe Qwen a officiellement publié Qwen3.8-Max le 3 août 2026. Il ne s’agit pas de l’ancien modèle Qwen3-8B, avec lequel il peut être confondu, et il ne se limite plus à la preview de juillet qwen3.8-max-preview : l’ID officiel actuel de l’API est qwen3.8-max, également utilisé par Modelflare.

Qwen3.8-Max est actuellement le plus grand modèle phare Max de Qwen. Il vise le développement, les workflows professionnels, les Agents de longue durée et les tâches multimodales natives. Qwen a également annoncé que les open weights de Qwen3.8-Max et Qwen3.8-27B arriveraient la semaine suivante. Tant que les dépôts et leurs licences ne sont pas réellement publiés, la formulation exacte reste « open weights annoncés », pas « déjà disponible pour un déploiement local ».

Spécifications principales

Élément Qwen3.8-Max
ID du modèle sur Modelflare qwen3.8-max
Architecture Mixture-of-Experts (MoE)
Paramètres totaux 2.4T
Paramètres activés par Token 95B
Longueur de contexte 1M tokens
Entrée maximale sans raisonnement 991K tokens
Entrée maximale avec raisonnement 983K tokens
Sortie maximale 131K tokens
Token de raisonnement maximaux 262K tokens
Modalités d’entrée Texte, image et vidéo
Modalité de sortie Texte
Intensité du raisonnement low, medium ou xhigh ; valeur par défaut xhigh
Fonctions officielles Prefix Completion, Function Calling, Context Cache, Structured Outputs, Batch et outils Responses intégrés

Le chiffre 2.4T représente la taille totale du modèle, pas les paramètres exécutés pour générer chaque Token. L’annonce officielle indique 95B paramètres activés, une mesure plus utile pour comprendre le calcul réellement impliqué dans l’inférence MoE. Un contexte de 1M tokens ne signifie pas non plus que chaque requête doit le remplir : plus l’entrée et le budget de raisonnement augmentent, plus la latence, le cache et le coût nécessitent une conception dédiée.

Ce que vise Qwen3.8-Max

Qwen positionne cette version comme une mise à niveau générale pour le développement et Cowork, en mettant l’accent sur trois types de travail :

  • mener un projet logiciel de plusieurs jours depuis un répertoire vide, au lieu de générer des fonctions isolées ;
  • organiser des livrables en plusieurs étapes pour la recherche, l’analyse de données, Office, le design et d’autres workflows professionnels ;
  • exploiter la compréhension des images et des vidéos pendant la planification, l’exécution et la vérification, et pas seulement pour une reconnaissance statique ponctuelle.

Qwen présente des démonstrations fournisseur comprenant plus de dix jours de développement autonome et des centaines d’itérations d’optimisation de conception de puces. Ces cas au niveau système dépendent du Harness, des outils, de l’environnement, des prompts et de la méthode d’évaluation. Ils ne garantissent pas le même résultat dans votre application. La sélection pour la production doit employer vos propres dépôts, documents, autorisations d’outils et critères d’acceptation sur un ensemble fixe d’échantillons.

Choisir l’intensité du raisonnement

Qwen3.8-Max prend en charge reasoning_effort :

  • low pour les réponses courtes, les explications de code simples et les tâches sensibles au coût ;
  • medium comme point de départ pour le développement quotidien, l’analyse et les tâches en plusieurs étapes ;
  • xhigh pour le raisonnement difficile, les Agents de longue durée et le travail professionnel complexe ; c’est également la valeur par défaut.

Qwen indique que preserve_thinking est activé par défaut afin que le travail en plusieurs tours puisse reprendre l’état de raisonnement précédent. Si le client reconstruit lui-même l’historique, il doit conserver les champs de raisonnement et l’état des outils renvoyés par le fournisseur, et non concaténer uniquement le texte final. Le modèle autorise jusqu’à 262K tokens de raisonnement, mais un maximum disponible n’est pas une valeur par défaut recommandée. Choisissez l’effort selon le taux de réussite des tâches et le coût unitaire.

Disponibilité actuelle sur Modelflare

Au 4 août 2026, Modelflare répertorie qwen3.8-max pour :

  • OpenAI Chat Completions ;
  • OpenAI Responses ;
  • une route compatible Anthropic Messages.

Une indication de protocole prouve que la route existe, pas que toutes les fonctions privées de QwenCloud sont automatiquement transmises. QwenCloud répertorie web_search, code_interpreter, web_extractor, t2i_search et i2i_search comme outils intégrés de Responses. Tant que chaque fonction n’a pas été testée via la route Modelflare exacte, privilégiez le Function Calling défini par le client et considérez les outils intégrés comme non vérifiés.

Le snapshot public actuel du groupe qwen-award est présenté ci-dessous, en dollars par million de tokens :

Élément facturé Prix
Entrée $1.239
Sortie $3.71
Lecture du cache $0.161
Création explicite du cache $1.547
Création explicite du cache pour une heure $2.4752

Le groupe est réservé aux API Keys éligibles. Les prix, l’éligibilité et les protocoles peuvent évoluer ; utilisez Modèles et tarifs et les journaux d’usage par requête comme sources en temps réel.

Configuration Chat Completions recommandée

Stockez d’abord la Modelflare API Key dans une variable d’environnement :

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

Commencez par une requête texte pour valider la route de base :

curl -N -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Design a safe rollout plan for this service and include validation and rollback gates."
      }
    ],
    "reasoning_effort": "medium",
    "stream": true
  }'

Utilisez medium pour établir une référence de qualité, de latence et de coût, puis passez à xhigh uniquement les tâches qui nécessitent réellement davantage de raisonnement. Le fait que l’upstream utilise xhigh par défaut ne justifie pas d’attribuer le budget maximal de raisonnement à chaque requête par lots.

Déployer l’entrée multimodale

Le modèle officiel accepte le texte, les images et la vidéo, mais les formats multimodaux varient selon le protocole et l’implémentation upstream. Procédez en trois étapes :

  1. Validez l’authentification, l’accès au modèle, le streaming et la facturation avec du texte uniquement.
  2. Utilisez une image de test fixe pour vérifier le format du contenu, les limites de taille et la sortie.
  3. Ajoutez ensuite les vidéos longues, les outils ou les retours visuels en plusieurs tours, en contrôlant si les retries dupliquent du travail facturable.

Ne traitez pas les URL d’image, les payloads Base64, les uploads de fichiers et le stockage d’objets du fournisseur comme des protocoles interchangeables. Testez de bout en bout le bloc de contenu exact que le client enverra.

Configuration recommandée sur la plateforme

  1. Utilisez une API Key distincte par application et confirmez que son groupe principal répertorie réellement qwen3.8-max.
  2. Commencez le développement et l’analyse quotidiens avec medium, réduisez les tâches courtes à low et réservez xhigh aux travaux difficiles de longue durée.
  3. Concevez le découpage et le cache pour les tâches à contexte long, plutôt que de placer toute la base de connaissances dans chaque contexte de 1M tokens.
  4. Validez séparément les wire contracts de Chat Completions, Responses et Anthropic.
  5. Ne faites pas des outils intégrés du fournisseur une dépendance de production avant qu’ils réussissent une requête réelle par la route Modelflare cible.
  6. Comparez le taux de réussite, la première sortie, la latence totale, les Token de raisonnement, les accès au cache et le coût par requête sur un ensemble fixe de tâches.
  7. Rejouez les échantillons de régression lors du passage de la preview au modèle définitif ; ne supposez pas qu’un nom de famille garantit une sortie identique.

Cas d’usage adaptés et points de comparaison

Qwen3.8-Max convient à l’ingénierie logicielle complexe, aux workflows professionnels en plusieurs étapes, à la compréhension de documents longs et de vidéos, aux Agents avec retour multimodal et aux équipes qui souhaitent unifier raisonnement et orchestration dans un modèle phare. Il peut ne pas être le choix par défaut le plus économique pour des transformations de texte simples exigeant un débit élevé et une faible latence. Comparez-le à Qwen Flash, DeepSeek V4 Flash ou à un autre modèle plus petit avec les mêmes entrées.

Sources et date de vérification

Cet article a été vérifié le 4 août 2026. L’état des open weights, les snapshots du modèle, les prix et les protocoles peuvent évoluer ; en production, utilisez la page officielle du modèle, la licence du dépôt de weights et le catalogue Modelflare disponibles au moment de l’appel.