DeepSeek V4 Flash Vision Exp: análisis, precios, límites y comparación
Análisis verificado de DeepSeek V4 Flash Vision Exp: coste de imágenes, límites API, benchmarks, comparación con Gemini 3.7 Flash y Claude Opus 4.8, y precios y disponibilidad actuales en Modelflare.
DeepSeek lanzó DeepSeek V4 Flash Vision Exp el 21 de agosto de 2026. Su identificador API exacto es deepseek-v4-flash-vision-exp. Acepta texto e imágenes, produce texto y conserva las mismas tarifas por token que V4 Flash.
Ese último punto es la noticia importante. DeepSeek redimensiona cada imagen antes de la inferencia y limita su consumo a 384 tokens de entrada. El coste es muy bajo para agentes que leen capturas de forma repetida. La contrapartida también es clara: una imagen grande se reduce a un presupuesto cercano a 800×800 píxeles, por lo que bajo coste no significa fidelidad visual a resolución completa.
Es un modelo experimental, no un sustituto automático para toda carga visual en producción. Este análisis separa especificaciones oficiales, benchmarks publicados por DeepSeek, cálculos reproducibles y disponibilidad real en Modelflare. Los datos variables se comprobaron el 22 de agosto de 2026.
DeepSeek V4 Flash Vision Exp de un vistazo
| Propiedad | Valor oficial |
|---|---|
| Fecha de lanzamiento | 21 de agosto de 2026 |
| Estado | Modelo API experimental |
| ID del modelo | deepseek-v4-flash-vision-exp |
| Entrada y salida | Texto e imagen de entrada; texto de salida |
| Ventana de contexto | 1M tokens |
| Salida máxima | 384K tokens |
| Razonamiento | Modos con y sin razonamiento; el modo con razonamiento es el predeterminado documentado |
| Formatos de imagen | JPEG, PNG, GIF, WebP |
| Formatos API | Chat Completions, Responses API y Messages compatible con Anthropic |
| Tope por imagen | 384 tokens de entrada tras el redimensionado |
| Límite de concurrencia | 2.500 |
| FIM Completion | No compatible |
DeepSeek no ha publicado el número de parámetros, parámetros activos, expertos, tamaño del corpus ni cambios de arquitectura. Cualquier cifra precisa sin fuente primaria es especulación.
Qué cambia realmente frente a V4 Flash
DeepSeek afirma que Vision Exp iguala al V4 Flash oficial en agentes de texto, razonamiento y conocimiento general. La novedad es la comprensión visual nativa: capturas, documentos escaneados, gráficos y fotografías pueden entrar en el mismo bucle de herramientas sin un modelo separado que genere una descripción previa.
La tabla de lanzamiento publica estos resultados:
| Evaluación | Puntuación publicada por DeepSeek |
|---|---|
| Terminal Bench 2.1 | 83.9 |
| NL2Repo | 57.7 |
| DeepSWE | 59.3 |
| DSBench-Hard | 63.6 |
| AutomationBench, conjunto público | 25.7 |
| ApexBench, Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| Chartography | 64.3 |
| ZeroBench, Pass@5 | 35.0 |
DeepSeek también dice que su rendimiento como agente multimodal se aproxima a Claude Opus 4.8. Es una afirmación del proveedor, no una prueba independiente de Modelflare. Las filas mezclan tareas de texto y tareas que requieren visión. La nota de lanzamiento indica DeepSeek Harness en modo minimal, esfuerzo max, top_p=0.95 y temperature=1.0 para sus pruebas públicas de agentes de código. La tabla sirve para elegir qué casos repetir, no para establecer un ranking universal.
Precio oficial y coste real de una imagen
La página de precios de DeepSeek publica tarifas en dólares por millón de tokens. Las horas punta son 01:00–04:00 y 06:00–10:00 UTC; el resto es horario valle.
| Medidor | Valle | Punta |
|---|---|---|
| Entrada en caché | $0.007 | $0.014 |
| Entrada sin caché | $0.22 | $0.44 |
| Salida | $0.66 | $1.32 |
| Coste máximo de entrada para una imagen de 384 tokens | $0.00008448 | $0.00016896 |
La última fila es un cálculo —384 × tarifa de entrada ÷ 1.000.000—, no un cargo adicional por imagen. Una imagen menor puede usar menos tokens. El texto de entrada y la salida generada se facturan aparte.
El redimensionado explica tanto el precio como la limitación. Las imágenes por debajo de unos 384×384 píxeles se amplían conservando la proporción. Las mayores se reducen hacia un total parecido a 800×800. Por eso una imagen de 2000×2000 y otra de 5000×5000 pueden alcanzar el mismo tope de 384 tokens. La factura baja, pero el texto diminuto, las etiquetas densas y las coordenadas precisas pueden desaparecer.
Comparación con Gemini 3.7 Flash y Claude Opus 4.8
Los tres modelos resuelven versiones distintas del problema multimodal. La tabla usa precios estándar de las API directas y no incluye herramientas, almacenamiento de caché, reintentos ni descuentos de gateway.
| Modelo | Estado | Entradas | Contexto / salida máx. | Entrada sin caché | Salida | Principal compromiso |
|---|---|---|---|---|---|---|
| DeepSeek V4 Flash Vision Exp | Experimental | Texto, imagen | 1M / 384K | $0.22 valle; $0.44 punta | $0.66 valle; $1.32 punta | Tarifas mínimas y tope de 384 tokens por imagen; redimensionado agresivo |
| Gemini 3.7 Flash | GA | Texto, imagen, vídeo, audio, PDF | 1M / 64K | $0.75 hasta 31-12-2026 | $3.75 hasta 31-12-2026 | Más modalidades y herramientas; mayor precio y aumento posterior |
| Claude Opus 4.8 | GA | Texto, imagen, PDF | 1M / 128K | $5.00 | $25.00 | Visión de alta resolución y Computer Use maduro; coste premium |
Para 100K tokens de entrada sin caché y 10K de salida, sin imágenes:
- DeepSeek cuesta $0.0286 en valle o $0.0572 en punta.
- Gemini 3.7 Flash cuesta $0.1125 con su tarifa introductoria.
- Claude Opus 4.8 cuesta $0.75.
En este ejemplo, DeepSeek es aproximadamente un 49% más barato que Gemini en punta y un 75% en valle. Frente a Claude, la diferencia es del 92% al 96%. Son porcentajes de factura, no de calidad.
Con imágenes, la diferencia crece, pero cambia la resolución. Anthropic documenta 1.296 tokens visuales para una imagen de 1000×1000 en Opus 4.8, unos $0.00648. DeepSeek limita cualquier imagen a $0.00016896 en punta y $0.00008448 en valle: entre 38 y 77 veces menos. Sin embargo, DeepSeek la reduce hacia 800×800, mientras Opus conserva más detalle.
Un lote de 100 imágenes de un megapíxel, 100K tokens de texto y 10K de salida cuesta como máximo $0.0370 en valle o $0.0741 en punta con DeepSeek. Aplicando los 1.296 tokens por imagen documentados por Anthropic, el coste de tokens en Opus 4.8 sería $1.398. No es una prueba de calidad equivalente; muestra que el triaje visual barato y la inspección de alta resolución son cargas diferentes.
Qué modelo encaja en cada carga
Prueba DeepSeek V4 Flash Vision Exp de forma controlada para muchas capturas, documentos normales, gráficos, extracción tipo OCR y observaciones visuales dentro de un bucle de herramientas, cuando importa más el coste por tarea correcta que conservar cada píxel.
Elige Gemini 3.7 Flash para multimodalidad amplia si un flujo debe procesar imagen, vídeo, audio y PDF, o depende de Search Grounding, ejecución de código, File Search, URL Context o Computer Use en vista previa. Gemini es GA; el endpoint visual de DeepSeek es experimental.
Elige Claude Opus 4.8 para agentes visuales de alta resolución cuando documentos densos, elementos pequeños de interfaz, Computer Use y tareas largas en navegador justifican el precio. Anthropic admite hasta 2.576 píxeles en el lado largo y 4.784 tokens visuales, por lo que comparar solo el coste por imagen no es equivalente.
También es posible enrutar por niveles: un primer paso barato clasifica y extrae, y un modelo de alta resolución recibe solo los casos ambiguos. Hay que medir la segunda llamada, la latencia y la tasa de escalado; si casi todo escala, la arquitectura de dos modelos no ahorra por sí sola.
Formas de enviar imágenes y límites
La guía de visión de DeepSeek admite:
- base64 en línea para un archivo local;
- una URL pública HTTP o HTTPS;
- un
file_idreutilizable de Files API.
| Límite | Valor |
|---|---|
| Cuerpo con datos en línea | 48 MiB |
| Imagen base64 o URL | 32 MiB |
| Imagen mediante Files API | 64 MiB |
| Imágenes por solicitud | 600 |
Total sin file_id |
64 MiB |
Total incluyendo file_id |
200 MiB |
| Lado máximo | 8.192 px; 4.096 px con 15 imágenes o más |
| URL externa | 8.192 caracteres y descarga en 60 segundos |
detail: "low" fuerza 512×512 y conviene para OCR o clasificación con poco detalle. high, original y, actualmente, auto conservan el original antes del redimensionado normal. Chat Completions solo admite imágenes en mensajes user; Responses también las admite en mensajes developer y salidas de herramientas, pero las rechaza en system o assistant.
Ejemplo de Responses API mediante Modelflare
Modelflare ya publica el ID exacto y la ruta Responses API. Usa una clave asignada al grupo deepseek-stable:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODELFLARE_API_KEY"],
base_url="https://modelflare.dev/v1",
)
response = client.responses.create(
model="deepseek-v4-flash-vision-exp",
input=[
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Lee este panel. Devuelve las tres anomalías y la evidencia visible de cada una.",
},
{
"type": "input_image",
"image_url": "https://example.com/dashboard.png",
"detail": "low",
},
],
}
],
)
print(response.output_text)
Para imágenes privadas, usa base64 o Files API. No registres credenciales, URLs privadas ni datos personales. La implementación Responses de DeepSeek es sin estado: no admite previous_response_id, conversaciones ni store. Admite llamadas a funciones y búsqueda web, mientras que Computer Use, Code Interpreter, File Search y MCP integrados se ignoran.
Lista de control para producción
- Fija el ID exacto
deepseek-v4-flash-vision-exp; no tratesdeepseek-v4-flashcomo alias visual. - Crea un conjunto seguro con texto pequeño, tablas densas, gráficos, capturas, rotaciones y contenido adversarial.
- Compara
detail: "low"con el valor predeterminado por éxito, latencia y tokens facturados. - Valida Chat Completions, Responses y Messages por separado si usas varios protocolos.
- Prueba salida estructurada, correlación de herramientas, streaming, cancelación, rechazos e imágenes dañadas.
- Usa IDs de Files API para imágenes privadas repetidas y define retención y borrado.
- Registra cantidad, dimensiones, tokens de entrada, caché y salida, reintentos, latencia, ruta y cargo final.
- Mantén un fallback GA para tareas críticas o sensibles al detalle hasta superar un umbral de tráfico real.
Un HTTP 200 solo demuestra que una solicitud terminó. No demuestra que la captura se leyó bien, que cada herramienta estaba autorizada ni que bajó el coste por tarea correcta.
Precio de DeepSeek V4 Flash Vision Exp en Modelflare
Sí está disponible. En una comprobación de producción posterior del 22 de agosto de 2026, el catálogo público de Modelos y precios de Modelflare ya incluía el ID exacto deepseek-v4-flash-vision-exp, dentro del grupo deepseek-stable, con rutas OpenAI compatibles para Chat Completions y Responses API.
El catálogo configura como referencia los precios punta oficiales —$0.44 de entrada, $1.32 de salida y $0.014 de entrada en caché por millón— y aplica el multiplicador 0.9x de deepseek-stable:
| Grupo de Modelflare | Entrada | Entrada en caché | Salida | Coste máximo de entrada sin caché para una imagen de 384 tokens |
|---|---|---|---|---|
deepseek-stable |
$0.396 / 1M | $0.0126 / 1M | $1.188 / 1M | $0.000152064 |
Con estas tarifas, 100K tokens de texto sin caché y 10K de salida cuestan unos $0.05148. Cien imágenes en el tope de 384 tokens, 100K tokens de texto y 10K de salida cuestan como máximo $0.06669, antes de reintentos u otras solicitudes.
No confundas el precio 0.9x con el horario valle directo de DeepSeek. Modelflare aplica el multiplicador a sus precios de referencia configurados y no cambia automáticamente con las franjas punta y valle del proveedor. El grupo, las rutas y los precios pueden cambiar; consulta la página en vivo y el registro de la solicitud completada.
Conclusión
DeepSeek V4 Flash Vision Exp cambia la economía de los agentes visuales: cada imagen se limita a 384 tokens y usa la tarifa de V4 Flash. Para triaje de capturas, extracción de documentos, lectura de gráficos y bucles visuales de gran volumen, la diferencia puede ser material.
El mismo límite es la advertencia. El redimensionado puede borrar el detalle que requieren Computer Use y documentos densos; el endpoint es experimental; y los benchmarks son del proveedor. Conviene evaluarlo como trabajador visual de bajo coste, no como prueba de que un único modelo sustituye toda la pila multimodal.
Fuentes oficiales y registro
Fuentes primarias:
- Registro de cambios de DeepSeek
- Guía Vision de DeepSeek
- Modelos y precios de DeepSeek
- Guía Responses API de DeepSeek
- Google: Gemini 3.7 Flash
- Google: precios de Gemini API
- Anthropic: resumen de modelos Claude
- Anthropic: tokens visuales y límites
Registro:
- 22 de agosto de 2026: publicación inicial. Se verificaron estado, especificaciones, procesamiento de imágenes, límites, protocolos, precios punta/valle, competidores, cálculos y catálogo de Modelflare.
- Más tarde, el 22 de agosto de 2026: actualizado tras la activación del ID exacto en Modelflare. Se añadieron los precios 0.9x de
deepseek-stable, cálculos, rutas compatibles y un ejemplo de Responses API mediante Modelflare.