GLM-5.3, Kimi K3 et Qwen3.8-Max : capacités, tarifs et API

Guide vérifié de GLM-5.3, Kimi K3 et Qwen3.8-Max : sources primaires, tarifs et groupes Modelflare, exemples Chat Completions, Responses, Anthropic Messages et contrôles de production.

Modelflare expose désormais glm-5.3, kimi-k3 et qwen3.8-max derrière une passerelle compatible unique. Ce guide de lancement présente les usages adaptés à chaque modèle, l’instantané actuel des tarifs en USD, les trois contrats de requête et un parcours sûr de la création de la clé API au test en production.

Le contenu distingue les sources de première main des fournisseurs et les faits du catalogue Modelflare. Une capacité annoncée par un fournisseur n’est pas automatiquement une fonction exposée par la passerelle : vérifiez toujours la fiche de modèle et l’endpoint réellement utilisé par votre client.

La disponibilité, les groupes et les tarifs susceptibles d’évoluer ont été vérifiés le 29 août 2026. Après cette date, consultez la page des tarifs Modelflare.

Trois modèles en bref

ID du modèle Bon point de départ Notes de capacité de première main Contexte et raisonnement
glm-5.3 Programmation complexe et agents de longue durée Z.ai positionne GLM-5.3 pour le code difficile et les tâches d’agent longues ; la réflexion reste activée dans l’API Réflexion toujours active ; niveaux documentés low, high et max, avec max par défaut
kimi-k3 Code à grand contexte et travail de connaissance Kimi documente la compréhension visuelle native et le travail de bout en bout sur un horizon long Jusqu’à 1M de contexte ; réflexion toujours active ; niveaux low, high, max, défaut max
qwen3.8-max Workflows professionnels et agents prolongés Qwen documente un MoE de 2,4T au total / 95B actifs, avec code, entrée visuelle et workflows orientés outils Contexte 1M ; entrées texte, image et vidéo ; sortie texte ; certains outils dépendent de la région et de l’endpoint

Lisez l’annonce GLM-5.3, le guide de sélection des modèles Kimi et la référence Qwen3.8-Max pour le texte à jour des fournisseurs. Leurs benchmarks sont déclarés par les fournisseurs et ne constituent pas une garantie Modelflare.

Choisir selon la charge

  • Choisissez glm-5.3 pour une planification soutenue, des changements de code difficiles ou une boucle d’agent longue, si la réflexion permanente est budgétée.
  • Choisissez kimi-k3 si un contexte très vaste, la compréhension visuelle ou un parcours complet de travail documentaire est central.
  • Choisissez qwen3.8-max si une fenêtre de 1M tokens, les entrées multimodales, les outils structurés ou l’automatisation professionnelle comptent.

Ce sont des points de départ, pas un classement universel. Rejouez un échantillon de tâches anonymisées et mesurez le coût par tâche réussie, les reprises, la latence et le temps de revue. Une grande limite de contexte est un plafond, pas une promesse d’utilité ou de vitesse uniforme.

Instantané des tarifs Modelflare

Les montants ci-dessous sont en USD par million de tokens pour les groupes publics actuels. Le multiplicateur de groupe est 0.8x, conformément à la formule « prix officiel × 0.8 » de l’annonce.

Modèle Groupe Entrée Sortie Entrée en cache
glm-5.3 glm-stable $1.12 $3.52 environ $0.21
kimi-k3 kimi-stable $2.40 $12.00 $0.24
qwen3.8-max qwen-stable $1.60 $4.80 $0.20

Les montants utilisent le prix d’entrée, le ratio de complétion, le ratio de cache et le multiplicateur de groupe du catalogue en direct, puis sont arrondis. Si la page affiche un champ d’écriture du cache distinct, utilisez-le pour créer le cache ; ne le déduisez pas du tarif de lecture.

Les trois groupes affichent actuellement rpm: 0 : aucun plafond RPM fixe au niveau du groupe n’est configuré sur la plateforme. Les limites du fournisseur, du compte, du réseau et de la sécurité restent applicables. Les tarifs et la disponibilité évoluent ; rapprochez la page de tarifs en direct du relevé d’utilisation.

Une passerelle, trois contrats API

Dans cet instantané, le catalogue Modelflare marque les trois IDs pour ces formats publics :

Contrat Endpoint Authentification Usage
OpenAI Chat Completions POST /v1/chat/completions Authorization: Bearer Clients de chat existants et SDK compatibles
OpenAI Responses POST /v1/responses Authorization: Bearer Clients qui consomment éléments et événements Responses
Compatible Anthropic Messages POST /v1/messages x-api-key ou Bearer avec anthropic-version Clients de forme Anthropic et flux de messages

L’URL de base compatible OpenAI est https://modelflare.dev/v1. Les SDK Anthropic utilisent généralement https://modelflare.dev comme base et ajoutent /v1/messages. La disponibilité d’un endpoint ne prouve pas la parité fonctionnelle : testez séparément événements de streaming, outils, sortie structurée, entrée multimodale et contrôles de raisonnement.

Se connecter via Modelflare

  1. Dans API Keys, créez ou mettez à jour une clé et accordez-lui le groupe contenant le modèle : glm-stable, kimi-stable ou qwen-stable.
  2. Gardez la clé dans une variable d’environnement. Ne la mettez ni dans le dépôt, ni dans le stockage du navigateur, ni dans un ticket.
  3. Confirmez la réponse authentifiée de /v1/models, puis envoyez une petite requête non-streaming avec l’ID exact.
  4. Testez le streaming comme un contrat distinct avant de déplacer un agent ou du trafic utilisateur.

Chat Completions

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "Résume les risques de migration en trois points."}],
    "stream": false
  }'

Responses API

curl -sS https://modelflare.dev/v1/responses \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "input": "Retourne une courte checklist pour une migration de base de données sûre.",
    "stream": false
  }'

Anthropic Messages

curl -sS https://modelflare.dev/v1/messages \
  -H "x-api-key: $MODELFLARE_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "Énumère les trois premières vérifications de déploiement."}]
  }'

Les exemples utilisent volontairement du texte simple et stream: false. Activez le streaming seulement lorsque le client sait traiter les événements du contrat choisi. Conservez les valeurs explicites 0 et false lorsqu’elles ont un sens et ne copiez pas un champ fournisseur d’un modèle à l’autre sans vérifier son contrat.

Vérifier avant la production

  1. Listez les modèles avec la même clé et confirmez l’ID et le groupe exacts.
  2. Exécutez un test non-streaming et un test streaming sur l’endpoint réellement appelé par l’application.
  3. Si la charge utilise outils, sortie structurée, images, vidéo ou contrôles de raisonnement, testez chaque fonction sur le modèle choisi ; une réponse texte ne suffit pas.
  4. Enregistrez statut, groupe choisi, tokens d’entrée/sortie/cache, latence, reprises et montant final dans le relevé d’utilisation.
  5. Bornez les reprises côté application et distinguez une capacité temporaire d’une erreur terminale de modèle ou de politique.
  6. Revérifiez les tarifs en direct avant un lancement à fort volume ; la page et le relevé priment sur une table copiée.

FAQ

Ces tarifs sont-ils permanents ? Non. Il s’agit d’un instantané daté ; la page de tarifs en direct fait foi.

rpm: 0 veut-il dire trafic illimité ? Non. Le groupe n’a simplement pas de plafond RPM configuré sur la plateforme. Les limites fournisseur, compte, réseau et sécurité peuvent toujours s’appliquer.

Le même payload peut-il être envoyé aux trois protocoles ? Non. Gardez l’ID, mais adaptez enveloppe, authentification, parseur de réponse et gestionnaire de streaming au contrat choisi.

Quels modèles documentent un contexte 1M ? Kimi K3 et Qwen3.8-Max l’indiquent dans les références primaires liées. Cette page ne revendique pas 1M pour GLM-5.3.

Sources et fraîcheur

Journal de mise à jour : 29 août 2026 — première version ; pages de capacités, groupes Modelflare, marqueurs d’endpoint et tarifs vérifiés ce jour-là.