DeepSeek V4 Flash Vision Exp : test, tarifs, limites et comparaison

Analyse vérifiée de DeepSeek V4 Flash Vision Exp : coût des images, limites API, benchmarks, comparaison avec Gemini 3.7 Flash et Claude Opus 4.8, et tarifs et disponibilité actuels sur Modelflare.

DeepSeek a lancé DeepSeek V4 Flash Vision Exp le 21 août 2026. L’identifiant API exact est deepseek-v4-flash-vision-exp. Le modèle accepte du texte et des images, renvoie du texte et conserve les mêmes tarifs par token que V4 Flash.

Ce dernier point est l’essentiel. DeepSeek redimensionne chaque image avant l’inférence et limite son coût à 384 tokens d’entrée. Les boucles d’agents qui lisent beaucoup de captures deviennent très économiques. Le compromis est tout aussi net : une grande image est ramenée vers un budget d’environ 800×800 pixels. Un faible coût ne signifie donc pas une fidélité visuelle pleine résolution.

Il s’agit d’un modèle expérimental, pas d’un remplacement automatique pour toute charge visuelle en production. Cette analyse sépare les spécifications officielles, les benchmarks publiés par DeepSeek, les calculs reproductibles et la disponibilité réelle sur Modelflare. Les informations volatiles ont été vérifiées le 22 août 2026.

DeepSeek V4 Flash Vision Exp en bref

Propriété Valeur officielle
Date de sortie 21 août 2026
Statut Modèle API expérimental
Identifiant deepseek-v4-flash-vision-exp
Entrée et sortie Texte et image en entrée ; texte en sortie
Fenêtre de contexte 1M tokens
Sortie maximale 384K tokens
Raisonnement Modes avec et sans thinking ; thinking est le défaut documenté
Formats d’image JPEG, PNG, GIF, WebP
Formats API Chat Completions, Responses API, Messages compatible Anthropic
Plafond image 384 tokens d’entrée après redimensionnement
Limite de concurrence 2 500
FIM Completion Non pris en charge

DeepSeek n’a communiqué ni le nombre de paramètres, ni les paramètres actifs, le nombre d’experts, la taille du corpus ou les changements d’architecture. Toute valeur précise sans source primaire reste spéculative.

Ce qui change vraiment par rapport à V4 Flash

DeepSeek indique que Vision Exp est au niveau de V4 Flash officiel pour les agents purement textuels, le raisonnement et les connaissances générales. La nouveauté est la compréhension visuelle native : captures d’écran, images de documents, graphiques et photographies rejoignent directement la même boucle d’outils, sans modèle séparé chargé de produire une description.

La publication donne les résultats suivants :

Évaluation Score publié par DeepSeek
Terminal Bench 2.1 83.9
NL2Repo 57.7
DeepSWE 59.3
DSBench-Hard 63.6
AutomationBench, jeu public 25.7
ApexBench, Pass@1 36.5
Agents' Last Exam 27.3
Chartography 64.3
ZeroBench, Pass@5 35.0

DeepSeek affirme aussi que les performances d’agent multimodal approchent Claude Opus 4.8. C’est une déclaration du fournisseur, pas un test indépendant de Modelflare. Les lignes mélangent tâches textuelles et tâches nécessitant la vision. Pour ses tests publics d’agents de code, DeepSeek précise Harness en mode minimal, effort max, top_p=0.95 et temperature=1.0. Ces scores servent à sélectionner des cas à rejouer, pas à construire un classement universel.

Tarifs officiels et coût réel d’une image

La page de tarification DeepSeek indique des dollars par million de tokens. Les heures pleines sont 01:00–04:00 et 06:00–10:00 UTC ; les autres heures sont creuses.

Mesure Heures creuses Heures pleines
Entrée en cache $0.007 $0.014
Entrée hors cache $0.22 $0.44
Sortie $0.66 $1.32
Coût d’entrée maximal pour une image de 384 tokens $0.00008448 $0.00016896

La dernière ligne est le calcul 384 × tarif d’entrée ÷ 1 000 000, pas un forfait image distinct. Une image plus petite peut consommer moins. Le texte d’entrée et la sortie générée sont facturés en plus.

Le redimensionnement explique le prix comme la limite. Les images inférieures à environ 384×384 pixels sont agrandies proportionnellement. Les plus grandes sont réduites vers une surface proche de 800×800. Ainsi, 2000×2000 et 5000×5000 peuvent atteindre le même plafond de 384 tokens. La facture baisse, mais les petits caractères, les légendes denses et les coordonnées précises peuvent disparaître.

Comparaison avec Gemini 3.7 Flash et Claude Opus 4.8

Les trois modèles couvrent des besoins multimodaux différents. Le tableau utilise les tarifs standards des API directes, hors outils, stockage de cache, nouvelles tentatives et réductions de passerelle.

Modèle Statut Entrées Contexte / sortie max. Entrée hors cache Sortie Compromis principal
DeepSeek V4 Flash Vision Exp Expérimental Texte, image 1M / 384K $0.22 creux ; $0.44 plein $0.66 creux ; $1.32 plein Tarifs minimaux et plafond de 384 tokens ; redimensionnement agressif
Gemini 3.7 Flash GA Texte, image, vidéo, audio, PDF 1M / 64K $0.75 jusqu’au 31-12-2026 $3.75 jusqu’au 31-12-2026 Plus de modalités et d’outils ; prix supérieur puis hausse annoncée
Claude Opus 4.8 GA Texte, image, PDF 1M / 128K $5.00 $25.00 Vision haute résolution et Computer Use mature ; tarif premium

Pour 100K tokens d’entrée hors cache et 10K de sortie, sans image :

  • DeepSeek coûte environ $0.0286 en heures creuses ou $0.0572 en heures pleines.
  • Gemini 3.7 Flash coûte $0.1125 au tarif de lancement.
  • Claude Opus 4.8 coûte $0.75.

Dans cet exemple, DeepSeek est environ 49 % moins cher que Gemini en heures pleines et 75 % moins cher en heures creuses. Face à Claude, l’écart est de 92 % à 96 %. Ces pourcentages comparent des factures, pas la qualité.

L’écart augmente avec les images, mais la résolution change aussi. Anthropic documente 1 296 tokens visuels pour une image 1000×1000 sur Opus 4.8, soit environ $0.00648. DeepSeek plafonne toute image à $0.00016896 en heures pleines ou $0.00008448 en heures creuses : 38 à 77 fois moins. DeepSeek réduit toutefois l’image vers 800×800, alors qu’Opus préserve davantage de détails.

Un lot de 100 images d’un mégapixel, 100K tokens de texte et 10K de sortie coûte au maximum $0.0370 en heures creuses ou $0.0741 en heures pleines chez DeepSeek. Avec les 1 296 tokens par image documentés par Anthropic, la facture de tokens atteint $1.398 sur Opus 4.8. Ce n’est pas un test à qualité équivalente ; il distingue le tri visuel économique de l’inspection haute résolution.

Quel modèle pour quelle charge

Testez DeepSeek V4 Flash Vision Exp de manière contrôlée pour de nombreuses captures, des documents ordinaires, des graphiques, une extraction proche de l’OCR et des observations visuelles dans des boucles d’outils, lorsque le coût par tâche réussie prime sur la conservation de chaque pixel.

Choisissez Gemini 3.7 Flash pour une multimodalité plus large si un même flux doit traiter image, vidéo, audio et PDF, ou dépend de Search Grounding, de l’exécution de code, de File Search, d’URL Context ou de Computer Use en preview. Gemini est GA ; le modèle visuel DeepSeek reste expérimental.

Choisissez Claude Opus 4.8 pour les agents visuels haute résolution lorsque des documents denses, de petits éléments d’interface, Computer Use et de longues tâches navigateur justifient le prix. Anthropic conserve jusqu’à 2 576 pixels sur le côté long et 4 784 tokens visuels ; comparer uniquement le prix par image n’est donc pas équivalent.

Une architecture par niveaux est possible : un modèle peu coûteux classe et extrait d’abord, puis seuls les cas ambigus ou sensibles aux détails passent au modèle haute résolution. Mesurez le second appel, la latence et le taux d’escalade ; si presque tout est escaladé, deux modèles ne réduisent pas automatiquement la facture.

Méthodes d’envoi et limites

Le guide Vision de DeepSeek accepte :

  1. du base64 intégré pour un fichier local ;
  2. une URL HTTP ou HTTPS publique ;
  3. un file_id réutilisable de la Files API.
Limite Valeur
Corps intégré 48 MiB
Image base64 ou URL 32 MiB
Image via Files API 64 MiB
Images par requête 600
Total sans file_id 64 MiB
Total avec file_id 200 MiB
Côté maximal 8 192 px ; 4 096 px à partir de 15 images
URL externe 8 192 caractères et téléchargement sous 60 secondes

detail: "low" impose 512×512 et convient à l’OCR ou à la classification peu détaillée. high, original et actuellement auto conservent l’original avant la règle normale. Chat Completions n’autorise les images que dans user. Responses les accepte aussi dans developer et les sorties d’outils, mais les refuse dans system et assistant.

Exemple Responses API via Modelflare

Modelflare publie désormais l’ID exact et la route Responses API. Utilisez une clé affectée au groupe deepseek-stable :

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MODELFLARE_API_KEY"],
    base_url="https://modelflare.dev/v1",
)

response = client.responses.create(
    model="deepseek-v4-flash-vision-exp",
    input=[
        {
            "role": "user",
            "content": [
                {
                    "type": "input_text",
                    "text": "Lisez ce tableau de bord. Retournez les trois anomalies et la preuve visible pour chacune.",
                },
                {
                    "type": "input_image",
                    "image_url": "https://example.com/dashboard.png",
                    "detail": "low",
                },
            ],
        }
    ],
)

print(response.output_text)

Pour une image privée, utilisez base64 ou Files API. Ne journalisez pas d’identifiants, d’URL privées ou de données personnelles. L’implémentation Responses de DeepSeek est sans état : previous_response_id, les conversations et store ne sont pas pris en charge. Function Calling et Web Search fonctionnent ; Computer Use, Code Interpreter, File Search et MCP intégrés sont ignorés.

Checklist de production

  1. Épinglez deepseek-v4-flash-vision-exp ; ne considérez pas deepseek-v4-flash comme un alias visuel.
  2. Constituez un jeu sans données privées avec petits textes, tableaux denses, graphiques, captures, rotations et contenu adversarial.
  3. Comparez detail: "low" au défaut selon le succès, la latence et les tokens facturés.
  4. Validez séparément Chat Completions, Responses et Messages si plusieurs protocoles sont utilisés.
  5. Testez sortie structurée, corrélation des outils, streaming, annulation, refus et images invalides.
  6. Réutilisez les images privées via Files API et définissez conservation et suppression.
  7. Journalisez nombre, dimensions, tokens d’entrée, de cache et de sortie, tentatives, latence, route et coût final.
  8. Gardez un fallback GA pour les tâches critiques ou sensibles aux détails jusqu’à un seuil réel validé.

Un HTTP 200 prouve seulement qu’une requête s’est terminée, pas que la capture a été correctement lue, que chaque outil était autorisé ou que le coût par tâche réussie a baissé.

Tarif de DeepSeek V4 Flash Vision Exp sur Modelflare

Le modèle est disponible. Lors d’un contrôle de production ultérieur le 22 août 2026, le catalogue public Modèles et tarifs listait l’ID exact deepseek-v4-flash-vision-exp dans le groupe deepseek-stable, avec des routes compatibles OpenAI pour Chat Completions et Responses API.

Le catalogue prend comme référence les tarifs officiels en heures pleines — $0.44 en entrée, $1.32 en sortie et $0.014 en entrée cache par million — puis applique le multiplicateur 0.9x de deepseek-stable :

Groupe Modelflare Entrée Entrée cache Sortie Coût d’entrée hors cache maximal pour une image de 384 tokens
deepseek-stable $0.396 / 1M $0.0126 / 1M $1.188 / 1M $0.000152064

À ces tarifs, 100K tokens de texte hors cache et 10K de sortie coûtent environ $0.05148. Cent images au plafond de 384 tokens, 100K tokens de texte et 10K de sortie coûtent au maximum $0.06669, avant nouvelles tentatives ou autres requêtes.

Le prix de groupe 0.9x n’est pas le tarif heures creuses direct de DeepSeek. Modelflare applique le multiplicateur à ses prix de référence configurés et ne bascule pas automatiquement selon les fenêtres du fournisseur. Groupe, routes et tarifs peuvent changer ; la page en direct et l’enregistrement de la requête terminée font foi.

Conclusion

DeepSeek V4 Flash Vision Exp change l’économie des agents visuels : chaque image est plafonnée à 384 tokens au tarif V4 Flash. Pour le tri de captures, l’extraction de documents, la lecture de graphiques et les boucles visuelles à fort volume, l’écart peut être important.

Ce même plafond est l’avertissement. Le redimensionnement peut supprimer les détails requis par Computer Use et les documents denses ; l’endpoint est expérimental ; les benchmarks viennent du fournisseur. Évaluez-le comme un opérateur visuel économique, pas comme la preuve qu’un modèle remplace toute la pile multimodale.

Sources officielles et historique

Sources primaires :

Historique :

  • 22 août 2026 : première publication. Statut, spécifications, traitement d’image, limites, protocoles, tarifs horaires, concurrents, calculs et catalogue Modelflare vérifiés.
  • Plus tard le 22 août 2026 : mise à jour après l’activation de l’ID exact sur Modelflare. Ajout des tarifs 0.9x de deepseek-stable, des calculs, des routes prises en charge et d’un exemple Responses API via Modelflare.