Test de DeepSeek V4 Pro GA : benchmarks, tarifs API et coûts

Analyse vérifiée de DeepSeek V4 Pro GA : benchmarks d’agents, contexte 1M, compatibilité API, tarifs actuels et heures pleines/creuses, coûts calculés et disponibilité sur Modelflare.

DeepSeek a publié DeepSeek-V4-Pro GA le 13 août 2026. L’API hébergée identifie désormais cette version comme DeepSeek-V4-Pro-0813, tandis que l’identifiant stable du modèle reste deepseek-v4-pro. Elle apporte une fenêtre de contexte d’un million de tokens, jusqu’à 384 000 tokens en sortie, la prise en charge native de Responses API et une nouvelle grille tarifaire qui entre en vigueur peu après le lancement.

Notre verdict : V4 Pro mérite une évaluation en production pour la programmation difficile, le travail à l’échelle d’un dépôt et les agents de longue durée. DeepSeek annonce des progrès réguliers face à V4 Flash sur des benchmarks d’agents exigeants, mais Pro n’est pas le choix économique par défaut pour chaque requête. Une fois la nouvelle grille appliquée, ses prix officiels d’entrée et de sortie seront environ trois fois ceux de Flash, avec une limite de concurrence par compte cinq fois plus faible.

Cette analyse distingue les faits actuels de l’API, les résultats de benchmark publiés par DeepSeek, notre analyse et la disponibilité actuelle sur Modelflare. Nous n’avons pas reproduit indépendamment les scores de DeepSeek. Les caractéristiques et tarifs susceptibles d’évoluer ont été vérifiés le 14 août 2026.

Test de DeepSeek V4 Pro : contexte d’un million de tokens et orchestration d’outils

DeepSeek V4 Pro GA en bref

Élément Informations officielles actuelles
Date de disponibilité générale 13 août 2026
Identifiant stable du modèle API deepseek-v4-pro
Version hébergée DeepSeek-V4-Pro-0813
Fenêtre de contexte 1 000 000 de tokens
Sortie maximale 384 000 tokens
Mode de raisonnement Pris en charge et activé par défaut
Effort de raisonnement Annonce GA : low, high, max ; voir la note de compatibilité
Formats API officiels Chat Completions, Responses API, API compatible avec Anthropic Messages
Fonctions documentées Sortie JSON, appels d’outils, cache automatique du contexte, complétion par préfixe, FIM sans raisonnement
Concurrence officielle par compte 500 requêtes simultanées

La limite d’un million de tokens est un plafond de capacité, pas une garantie de qualité. La précision de récupération, la latence, la réutilisation du cache, la longueur de sortie, les délais d’attente du client et la quantité de contexte inutile déterminent encore l’utilité d’une longue requête.

Ce qui change depuis la préversion V4

La préversion d’avril a présenté la famille V4 et son architecture à poids ouverts. La mise à jour GA d’août est une évolution du produit hébergé avec trois changements pratiques :

  • DeepSeek affirme que les performances des agents ont nettement progressé, surtout pour les tâches de programmation et d’automatisation proches de la production ;
  • l’API officielle prend désormais en charge nativement le format OpenAI Responses et inclut une compatibilité orientée Codex ;
  • DeepSeek a annoncé des prix API en heures pleines et creuses applicables à partir du 16 août 2026 à 16:00 UTC.

Le modèle stable demandé reste deepseek-v4-pro : les clients existants n’ont pas à migrer le nom du modèle. La page tarifaire expose la version hébergée actuelle sous le nom DeepSeek-V4-Pro-0813.

Ne considérez pas automatiquement le checkpoint téléchargeable de la préversion comme identique bit à bit à la version GA hébergée. La fiche publique V4 de DeepSeek décrit toujours la famille de préversion et ne marque pas le checkpoint 0813. Les déploiements autohébergés et ceux de l’API officielle doivent donc être évalués séparément.

Analyse des benchmarks : où Pro progresse face à Flash

DeepSeek a publié les résultats suivants pour V4 Pro GA. La colonne de comparaison utilise les valeurs de la mise à jour V4 Flash du 31 juillet, et l’écart est une différence absolue de score.

Benchmark V4 Pro GA V4 Flash 0731 Écart Pro
Terminal Bench 2.1 87.9 82.7 +5.2
NL2Repo 61.5 54.2 +7.3
Cybergym 83.3 76.7 +6.6
DeepSWE 62.7 54.4 +8.3
Toolathlon-Verified 74.1 70.3 +3.8
Agents' Last Exam 25.7 25.2 +0.5
AutomationBench (Public) 31.8 25.1 +6.7
DSBench-FullStack 71.1 68.7 +2.4
DSBench-Hard 67.2 59.6 +7.6

DeepSeek annonce également des scores HLE de 42.7 sans outils et de 60.0 avec outils pour V4 Pro GA.

La tendance compte davantage qu’un score vedette isolé. Les gains absolus les plus élevés concernent le travail sur dépôt, les tâches difficiles d’ingénierie logicielle et l’automatisation. L’écart est bien plus faible sur Agents' Last Exam et modéré sur l’usage général d’outils. Cela plaide pour un routage : réserver Pro aux tâches où une meilleure probabilité de réussite vaut davantage que l’efficacité brute en tokens, et conserver Flash pour la classification, le résumé, le triage et les sous-agents simples à fort volume.

Il s’agit de résultats déclarés par le fournisseur, et non d’un benchmark indépendant de Modelflare. Les harnesses, autorisations d’outils, efforts de raisonnement, paramètres d’échantillonnage, limites de temps et règles de notation peuvent modifier sensiblement les résultats. Une décision de production doit rejouer les mêmes tâches respectueuses de la confidentialité sur les deux modèles et mesurer le coût par tâche réussie, pas seulement les tokens ou le classement.

Architecture et promesse d’un contexte de 1M

La fiche publique V4 de DeepSeek décrit la famille Pro comme un modèle Mixture-of-Experts comportant 1 600 milliards de paramètres au total et 49 milliards de paramètres activés. Elle documente une attention hybride combinant Compressed Sparse Attention et Heavily Compressed Attention, des Manifold-Constrained Hyper-Connections, l’optimiseur Muon et un préentraînement sur plus de 32 000 milliards de tokens.

DeepSeek affirme qu’avec un contexte de 1M tokens, V4 Pro utilise 27 % des FLOPs d’inférence pour un token et 10 % du cache KV requis par V3.2. Ce sont des affirmations architecturales de l’éditeur du modèle ; elles ne signifient pas qu’une requête d’un million de tokens sera rapide, peu coûteuse ou aussi précise à chaque position.

Pour un véritable usage en contexte long :

  • placez les instructions stables et le contenu réutilisable du dépôt au début afin de favoriser le cache de préfixe ;
  • suivez prompt_cache_hit_tokens et prompt_cache_miss_tokens au lieu de supposer un hit ;
  • compactez les anciennes traces d’outils et les fichiers dupliqués avant qu’ils ne consomment le budget de contexte ;
  • testez la récupération à la profondeur de document et à la position de token réellement utilisées par votre application ;
  • réservez de la place au raisonnement, aux résultats des outils et à la réponse finale au lieu de remplir toute la fenêtre d’entrée.

Le cache disque de DeepSeek est automatique et best effort. Il associe les préfixes réutilisables, peut prendre quelques secondes à construire et est généralement supprimé après plusieurs heures ou jours d’inactivité. Une requête répétée dont le début change peut perdre l’essentiel du bénéfice économique.

Compatibilité API : native ne signifie pas identique

Interface Prise en charge officielle DeepSeek Limite importante
Chat Completions Prise en charge Les boucles d’outils avec raisonnement doivent conserver reasoning_content
Responses API Prise en charge Sans état ; plusieurs champs OpenAI sont ignorés ou non pris en charge
API compatible Anthropic Prise en charge Certains champs sont ignorés ; les images et documents ne sont pas pris en charge
Complétion FIM Bêta Uniquement sans raisonnement et via le endpoint bêta

La couche Responses officielle prend en charge le texte, les appels de fonction, la recherche web côté serveur et l’outil personnalisé apply_patch utilisé pour la compatibilité avec Codex. Elle ne prend pas en charge previous_response_id, les conversations, les réponses stockées, le mode background, service_tier ou les clés de cache de prompt gérées par OpenAI. Les champs non pris en charge sont souvent ignorés silencieusement : un HTTP 200 ne prouve donc pas l’équivalence sémantique. Les clients Responses doivent conserver leur propre historique et examiner les types d’événements, plutôt que d’attendre le marqueur [DONE] de Chat Completions.

Une autre limite importante concerne la boucle d’outils de Chat Completions : quand le mode de raisonnement et les outils sont utilisés ensemble, le reasoning_content de l’assistant doit être renvoyé dans les requêtes suivantes. DeepSeek documente une erreur 400 si ce champ est perdu. Les passerelles et adaptateurs SDK doivent être testés avec une boucle complète d’outils en plusieurs tours, et non avec un seul prompt texte.

L’annonce GA indique que les niveaux low, high et max sont disponibles. Toutefois, le guide détaillé actuel et la référence API précisent que high et max sont les valeurs effectives, que low et medium sont mappés vers high, et que xhigh est mappé vers max. Tant que DeepSeek n’a pas harmonisé ces documents ou qu’un test en direct n’a pas prouvé un comportement low distinct, ne budgétez pas une réduction de coût supposée liée à un faible effort.

Tarifs officiels de l’API DeepSeek : actuels et à venir

Tous les prix ci-dessous sont en dollars US par million de tokens. Les tarifs fixes actuels restent affichés jusqu’à l’entrée en vigueur de la nouvelle grille le 16 août 2026 à 16:00 UTC, soit le 17 août à 00:00 à Pékin.

Période tarifaire Entrée en cache Entrée hors cache Sortie
Tarif actuel vérifié le 14 août $0.003625 $0.435 $0.87
Nouveau tarif heures creuses $0.022 $0.66 $1.98
Nouveau tarif heures pleines $0.044 $1.32 $3.96

Dans la prochaine grille, les heures pleines sont 01:00–04:00 et 06:00–10:00 UTC. Toutes les autres heures sont creuses, avec des tarifs égaux à la moitié des prix pleins.

Cette transition n’est pas un simple découpage horaire à 2× des prix actuels. Par rapport au tarif fixe actuel, le nouveau tarif creux est environ 6,07× plus élevé pour l’entrée en cache, 1,52× pour l’entrée hors cache et 2,28× pour la sortie. Le tarif plein double ces nouvelles valeurs creuses. Réutiliser le cache reste avantageux, mais le prix de lancement exceptionnellement bas de l’entrée en cache est celui qui évolue le plus.

Exemples de coûts calculés

La formule du coût des seuls tokens est :

coût = tokens_cache_hit × tarif_cache_hit + tokens_cache_miss × tarif_cache_miss + tokens_sortie × tarif_sortie

Les exemples suivants excluent tout coût distinct de réseau, d’abonnement, de service d’outils ou de paiement. Un agent utilisant des outils peut provoquer plusieurs appels au modèle : calculez la tâche complète, pas seulement la première requête.

Charge de travail DeepSeek actuel Nouveau heures creuses Nouveau heures pleines Modelflare au 14 août
100K d’entrée hors cache + 10K de sortie $0.0522 $0.0858 $0.1716 $0.0540
90K en cache + 10K hors cache en entrée + 10K de sortie $0.0134 $0.0284 $0.0568 $0.0138
900K en cache + 100K hors cache en entrée + 20K de sortie $0.0642 $0.1254 $0.2508 $0.0663

Les deuxième et troisième lignes montrent pourquoi la structure du prompt compte. Un grand préfixe stable peut réduire fortement le coût, mais seulement après un véritable hit de cache. Les champs d’usage de l’API constituent la source de vérité pour la réconciliation.

DeepSeek V4 Pro face à V4 Flash : choix prix-performance

Aux tarifs officiels actuels, Pro coûte environ 3,11× Flash pour l’entrée hors cache et la sortie, mais seulement 1,29× pour l’entrée en cache. Après le début de la nouvelle grille, Pro coûte 3× Flash pour l’entrée hors cache et la sortie, et environ 3,14× pour l’entrée en cache. La concurrence officielle par compte est de 500 pour Pro contre 2 500 pour Flash.

Cela conduit à une règle d’exploitation claire :

  • choisissez V4 Pro pour les modifications difficiles de dépôts, les agents de longue durée, l’analyse de sécurité, la coordination complexe d’outils et les tâches où un échec coûte cher ;
  • choisissez V4 Flash pour les agents simples, les workers parallèles, le prétraitement, l’extraction, le résumé et le trafic sensible au débit ;
  • routez selon la difficulté observée et le coût par tâche réussie, au lieu de faire de Pro la valeur par défaut universelle ;
  • réévaluez après la transition tarifaire, car l’économie des charges Pro en cache change sensiblement.

Un prix au token 3× supérieur peut rester moins cher si Pro évite des relances ou une correction humaine. Inversement, cinq points d’avance sur un benchmark ne justifient pas d’envoyer un travail déterministe ou trivial au grand modèle. Mesurez le taux de réussite, le temps total, tous les tokens des nouvelles tentatives, les échecs d’outils et le temps de correction du réviseur.

Prix et disponibilité de DeepSeek V4 Pro sur Modelflare

Le catalogue tarifaire en direct de Modelflare a été vérifié le 14 août 2026. Il référence deepseek-v4-pro et l’alias épinglé deepseek-v4-pro-0813 dans le groupe deepseek-stable, aux tarifs de base suivants par million de tokens :

Tarif Modelflare vérifié Prix
Entrée en cache $0.0037
Entrée hors cache $0.45
Sortie $0.90

Ces tarifs sont environ 2,07 % au-dessus du tarif actuel de DeepSeek pour l’entrée en cache et 3,45 % au-dessus des tarifs d’entrée hors cache et de sortie. Cet article ne promet pas qu’ils resteront inchangés après le passage de DeepSeek aux heures pleines et creuses. Pour toute décision de production, utilisez toujours la page tarifaire en direct et l’enregistrement d’usage de la requête.

Les métadonnées actuelles du catalogue public marquent la route Modelflare comme Chat Completions compatible OpenAI. Même si le endpoint de DeepSeek accepte désormais Responses et les formats Anthropic, le support du fournisseur ne rend pas automatiquement compatible chaque route d’une passerelle. Utilisez le protocole exact indiqué sur la page tarifaire en direct.

export MODELFLARE_API_KEY="your-api-key"

curl https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer ${MODELFLARE_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Review this migration plan and identify rollback risks."}
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high"
  }'

Pour la configuration générale du client, consultez le guide de l’API compatible OpenAI. Pour la comptabilité et l’interprétation des tokens mis en cache, consultez le suivi des coûts d’API d’IA.

Liste de contrôle pour l’évaluation en production

  1. Épinglez deepseek-v4-pro-0813 pendant l’évaluation si la route le propose, puis décidez si l’alias stable convient à votre contrôle des changements.
  2. Rejouez un ensemble fixe de tâches respectueuses de la confidentialité sur Pro et Flash avec les mêmes outils, autorisations, délais et règles d’arrêt.
  3. Testez high et max ; considérez low comme équivalent à high jusqu’à ce que le comportement actuel de l’API prouve le contraire.
  4. Terminez une boucle d’outils en plusieurs tours et vérifiez que reasoning_content, les identifiants d’outils, les arguments et les résultats traversent chaque adaptateur.
  5. Pour les clients Responses, testez explicitement chaque champ requis, car les paramètres non pris en charge peuvent être ignorés silencieusement.
  6. Enregistrez l’entrée en cache, l’entrée hors cache, la sortie, les tokens de raisonnement, la latence, les nouvelles tentatives et le coût par tâche réussie.
  7. Testez de longs prompts à des profondeurs réalistes ; ne déduisez pas la qualité de récupération à un million de tokens d’une requête courte.
  8. Testez la charge sous la limite de concurrence du compte et gérez les réponses 429 avec un backoff borné.
  9. Modélisez le tarif actuel et la grille heures pleines/creuses des 16/17 août avant d’approuver un budget.
  10. Conservez Flash ou un autre modèle de repli pour la disponibilité et la maîtrise des coûts ; consultez le routage fiable des API d’IA.

Verdict final

DeepSeek V4 Pro GA est une version importante axée sur les agents, pas seulement une préversion renommée. La tendance des scores officiels est la plus forte sur le raisonnement à l’échelle des dépôts, la programmation difficile et l’automatisation, tandis que la nouvelle interface Responses facilite son utilisation par les agents de programmation modernes. Le contexte de 1M et le cache automatique sont utiles, mais uniquement si les applications conservent des préfixes stables et vérifient les hits réels.

La principale réserve est économique : après le lancement, Pro coûte environ trois fois Flash dans la plupart des catégories de tokens et offre moins de concurrence. Il doit servir de niveau d’escalade pour les travaux difficiles et à forte valeur, plutôt que de valeur par défaut pour chaque prompt. Une bonne architecture de production orientera généralement les travaux simples vers Flash et ne promouvra vers Pro que les tâches difficiles ou échouées.

Le tarif Modelflare du 14 août est proche du tarif fixe actuel de DeepSeek et expose actuellement Chat Completions pour V4 Pro. Vérifiez à nouveau la page en direct lorsque la nouvelle grille DeepSeek commence ; ni un vieil article ni une capture tarifaire mise en cache ne doivent servir de vérité de facturation.

Sources et date de vérification

Les spécifications officielles, grilles tarifaires, disponibilités Modelflare et prix en direct ont été vérifiés le 14 août 2026.