Qwen3.8-Max : MoE 2.4T et configuration Modelflare
Guide pratique de Qwen3.8-Max : MoE 2.4T/95B, contexte multimodal de 1M tokens, réglages de raisonnement, tarifs actuels et configuration conseillée.
L’équipe Qwen a officiellement publié Qwen3.8-Max le 3 août 2026. Il ne s’agit pas de l’ancien modèle Qwen3-8B, avec lequel il peut être confondu, et il ne se limite plus à la preview de juillet qwen3.8-max-preview : l’ID officiel actuel de l’API est qwen3.8-max, également utilisé par Modelflare.
Qwen3.8-Max est actuellement le plus grand modèle phare Max de Qwen. Il vise le développement, les workflows professionnels, les Agents de longue durée et les tâches multimodales natives. Qwen a également annoncé que les open weights de Qwen3.8-Max et Qwen3.8-27B arriveraient la semaine suivante. Tant que les dépôts et leurs licences ne sont pas réellement publiés, la formulation exacte reste « open weights annoncés », pas « déjà disponible pour un déploiement local ».
Spécifications principales
| Élément | Qwen3.8-Max |
|---|---|
| ID du modèle sur Modelflare | qwen3.8-max |
| Architecture | Mixture-of-Experts (MoE) |
| Paramètres totaux | 2.4T |
| Paramètres activés par Token | 95B |
| Longueur de contexte | 1M tokens |
| Entrée maximale sans raisonnement | 991K tokens |
| Entrée maximale avec raisonnement | 983K tokens |
| Sortie maximale | 131K tokens |
| Token de raisonnement maximaux | 262K tokens |
| Modalités d’entrée | Texte, image et vidéo |
| Modalité de sortie | Texte |
| Intensité du raisonnement | low, medium ou xhigh ; valeur par défaut xhigh |
| Fonctions officielles | Prefix Completion, Function Calling, Context Cache, Structured Outputs, Batch et outils Responses intégrés |
Le chiffre 2.4T représente la taille totale du modèle, pas les paramètres exécutés pour générer chaque Token. L’annonce officielle indique 95B paramètres activés, une mesure plus utile pour comprendre le calcul réellement impliqué dans l’inférence MoE. Un contexte de 1M tokens ne signifie pas non plus que chaque requête doit le remplir : plus l’entrée et le budget de raisonnement augmentent, plus la latence, le cache et le coût nécessitent une conception dédiée.
Ce que vise Qwen3.8-Max
Qwen positionne cette version comme une mise à niveau générale pour le développement et Cowork, en mettant l’accent sur trois types de travail :
- mener un projet logiciel de plusieurs jours depuis un répertoire vide, au lieu de générer des fonctions isolées ;
- organiser des livrables en plusieurs étapes pour la recherche, l’analyse de données, Office, le design et d’autres workflows professionnels ;
- exploiter la compréhension des images et des vidéos pendant la planification, l’exécution et la vérification, et pas seulement pour une reconnaissance statique ponctuelle.
Qwen présente des démonstrations fournisseur comprenant plus de dix jours de développement autonome et des centaines d’itérations d’optimisation de conception de puces. Ces cas au niveau système dépendent du Harness, des outils, de l’environnement, des prompts et de la méthode d’évaluation. Ils ne garantissent pas le même résultat dans votre application. La sélection pour la production doit employer vos propres dépôts, documents, autorisations d’outils et critères d’acceptation sur un ensemble fixe d’échantillons.
Choisir l’intensité du raisonnement
Qwen3.8-Max prend en charge reasoning_effort :
lowpour les réponses courtes, les explications de code simples et les tâches sensibles au coût ;mediumcomme point de départ pour le développement quotidien, l’analyse et les tâches en plusieurs étapes ;xhighpour le raisonnement difficile, les Agents de longue durée et le travail professionnel complexe ; c’est également la valeur par défaut.
Qwen indique que preserve_thinking est activé par défaut afin que le travail en plusieurs tours puisse reprendre l’état de raisonnement précédent. Si le client reconstruit lui-même l’historique, il doit conserver les champs de raisonnement et l’état des outils renvoyés par le fournisseur, et non concaténer uniquement le texte final. Le modèle autorise jusqu’à 262K tokens de raisonnement, mais un maximum disponible n’est pas une valeur par défaut recommandée. Choisissez l’effort selon le taux de réussite des tâches et le coût unitaire.
Disponibilité actuelle sur Modelflare
Au 4 août 2026, Modelflare répertorie qwen3.8-max pour :
- OpenAI Chat Completions ;
- OpenAI Responses ;
- une route compatible Anthropic Messages.
Une indication de protocole prouve que la route existe, pas que toutes les fonctions privées de QwenCloud sont automatiquement transmises. QwenCloud répertorie web_search, code_interpreter, web_extractor, t2i_search et i2i_search comme outils intégrés de Responses. Tant que chaque fonction n’a pas été testée via la route Modelflare exacte, privilégiez le Function Calling défini par le client et considérez les outils intégrés comme non vérifiés.
Le snapshot public actuel du groupe qwen-award est présenté ci-dessous, en dollars par million de tokens :
| Élément facturé | Prix |
|---|---|
| Entrée | $1.239 |
| Sortie | $3.71 |
| Lecture du cache | $0.161 |
| Création explicite du cache | $1.547 |
| Création explicite du cache pour une heure | $2.4752 |
Le groupe est réservé aux API Keys éligibles. Les prix, l’éligibilité et les protocoles peuvent évoluer ; utilisez Modèles et tarifs et les journaux d’usage par requête comme sources en temps réel.
Configuration Chat Completions recommandée
Stockez d’abord la Modelflare API Key dans une variable d’environnement :
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
Commencez par une requête texte pour valider la route de base :
curl -N -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Design a safe rollout plan for this service and include validation and rollback gates."
}
],
"reasoning_effort": "medium",
"stream": true
}'
Utilisez medium pour établir une référence de qualité, de latence et de coût, puis passez à xhigh uniquement les tâches qui nécessitent réellement davantage de raisonnement. Le fait que l’upstream utilise xhigh par défaut ne justifie pas d’attribuer le budget maximal de raisonnement à chaque requête par lots.
Déployer l’entrée multimodale
Le modèle officiel accepte le texte, les images et la vidéo, mais les formats multimodaux varient selon le protocole et l’implémentation upstream. Procédez en trois étapes :
- Validez l’authentification, l’accès au modèle, le streaming et la facturation avec du texte uniquement.
- Utilisez une image de test fixe pour vérifier le format du contenu, les limites de taille et la sortie.
- Ajoutez ensuite les vidéos longues, les outils ou les retours visuels en plusieurs tours, en contrôlant si les retries dupliquent du travail facturable.
Ne traitez pas les URL d’image, les payloads Base64, les uploads de fichiers et le stockage d’objets du fournisseur comme des protocoles interchangeables. Testez de bout en bout le bloc de contenu exact que le client enverra.
Configuration recommandée sur la plateforme
- Utilisez une API Key distincte par application et confirmez que son groupe principal répertorie réellement
qwen3.8-max. - Commencez le développement et l’analyse quotidiens avec
medium, réduisez les tâches courtes àlowet réservezxhighaux travaux difficiles de longue durée. - Concevez le découpage et le cache pour les tâches à contexte long, plutôt que de placer toute la base de connaissances dans chaque contexte de 1M tokens.
- Validez séparément les wire contracts de Chat Completions, Responses et Anthropic.
- Ne faites pas des outils intégrés du fournisseur une dépendance de production avant qu’ils réussissent une requête réelle par la route Modelflare cible.
- Comparez le taux de réussite, la première sortie, la latence totale, les Token de raisonnement, les accès au cache et le coût par requête sur un ensemble fixe de tâches.
- Rejouez les échantillons de régression lors du passage de la preview au modèle définitif ; ne supposez pas qu’un nom de famille garantit une sortie identique.
Cas d’usage adaptés et points de comparaison
Qwen3.8-Max convient à l’ingénierie logicielle complexe, aux workflows professionnels en plusieurs étapes, à la compréhension de documents longs et de vidéos, aux Agents avec retour multimodal et aux équipes qui souhaitent unifier raisonnement et orchestration dans un modèle phare. Il peut ne pas être le choix par défaut le plus économique pour des transformations de texte simples exigeant un débit élevé et une faible latence. Comparez-le à Qwen Flash, DeepSeek V4 Flash ou à un autre modèle plus petit avec les mêmes entrées.
Sources et date de vérification
- Publication officielle de Qwen3.8-Max : date de sortie, 95B paramètres activés, démonstrations Coding/Cowork et projet d’open weights.
- Page QwenCloud de Qwen3.8-Max : contexte, limites d’entrée et de sortie, modalités, fonctions officielles et tarifs.
- Modèles et tarifs Modelflare : groupes, protocoles et prix actuels de la plateforme.
Cet article a été vérifié le 4 août 2026. L’état des open weights, les snapshots du modèle, les prix et les protocoles peuvent évoluer ; en production, utilisez la page officielle du modèle, la licence du dépôt de weights et le catalogue Modelflare disponibles au moment de l’appel.