DeepSeek V4 Pro GA: análisis, benchmarks, precios API y costes

Análisis verificado de DeepSeek V4 Pro GA con benchmarks de agentes, contexto de 1M, compatibilidad API, precios actuales y por franjas, costes calculados y disponibilidad en Modelflare.

DeepSeek lanzó DeepSeek-V4-Pro GA el 13 de agosto de 2026. La API alojada identifica ahora la versión como DeepSeek-V4-Pro-0813, mientras que el ID de modelo estable de la API sigue siendo deepseek-v4-pro. Ofrece una ventana de contexto de un millón de tokens, hasta 384.000 tokens de salida, compatibilidad nativa con Responses API y un nuevo esquema de precios que comienza poco después del lanzamiento.

Nuestro veredicto: V4 Pro merece una evaluación en producción para programación difícil, trabajo a escala de repositorio y agentes de larga duración. DeepSeek informa de mejoras consistentes frente a V4 Flash en benchmarks exigentes de agentes, pero Pro no es la opción económica predeterminada para todas las solicitudes. Tras la entrada en vigor del nuevo esquema, sus precios oficiales de entrada y salida son aproximadamente tres veces los de Flash y su límite de concurrencia por cuenta es cinco veces menor.

Este análisis separa los datos actuales de la API, los resultados de benchmark publicados por DeepSeek, nuestro análisis y la disponibilidad actual en Modelflare. No reproducimos de forma independiente las puntuaciones de DeepSeek. Las especificaciones y los precios variables se comprobaron el 14 de agosto de 2026.

Análisis de DeepSeek V4 Pro: contexto de un millón de tokens y orquestación de herramientas

DeepSeek V4 Pro GA de un vistazo

Elemento Información oficial actual
Fecha de disponibilidad general 13 de agosto de 2026
ID estable del modelo API deepseek-v4-pro
Versión alojada DeepSeek-V4-Pro-0813
Ventana de contexto 1.000.000 de tokens
Salida máxima 384.000 tokens
Modo de razonamiento Compatible y activado de forma predeterminada
Esfuerzo de razonamiento Anuncio GA: low, high y max; consulte la nota de compatibilidad
Formatos API oficiales Chat Completions, Responses API y API compatible con Anthropic Messages
Funciones documentadas Salida JSON, llamadas a herramientas, caché automática de contexto, finalización por prefijo y FIM sin razonamiento
Concurrencia oficial por cuenta 500 solicitudes simultáneas

El límite de un millón de tokens es un techo de capacidad, no una garantía de calidad. La precisión de recuperación, la latencia, la reutilización de caché, la longitud de salida, los tiempos de espera del cliente y la cantidad de contexto irrelevante siguen determinando si una solicitud larga resulta útil.

Qué cambió desde la vista previa de V4

La versión preliminar de abril presentó la familia V4 y su arquitectura de pesos abiertos. La actualización GA de agosto es una actualización del producto alojado con tres cambios prácticos:

  • DeepSeek afirma que el rendimiento de los agentes mejoró de forma considerable, sobre todo en tareas de programación y automatización similares a producción;
  • la API oficial admite ahora de forma nativa el formato OpenAI Responses e incluye compatibilidad orientada a Codex;
  • DeepSeek anunció precios de API para horas punta y valle que entran en vigor a las 16:00 UTC del 16 de agosto de 2026.

El modelo estable de las solicitudes sigue siendo deepseek-v4-pro, por lo que los clientes existentes no necesitan migrar el nombre del modelo. La página de precios muestra la versión alojada actual como DeepSeek-V4-Pro-0813.

No dé por hecho que el checkpoint preliminar descargable sea idéntico bit a bit a la versión GA alojada. La ficha pública del modelo V4 de DeepSeek todavía describe la familia preliminar y no etiqueta el checkpoint como 0813. Por tanto, los despliegues autohospedados y los de la API oficial requieren evaluaciones separadas.

Análisis de benchmarks: dónde Pro supera a Flash

DeepSeek publicó los siguientes resultados de V4 Pro GA. La columna comparativa usa los valores de la actualización V4 Flash del 31 de julio de DeepSeek y la diferencia es absoluta.

Benchmark V4 Pro GA V4 Flash 0731 Diferencia de Pro
Terminal Bench 2.1 87.9 82.7 +5.2
NL2Repo 61.5 54.2 +7.3
Cybergym 83.3 76.7 +6.6
DeepSWE 62.7 54.4 +8.3
Toolathlon-Verified 74.1 70.3 +3.8
Agents' Last Exam 25.7 25.2 +0.5
AutomationBench (Public) 31.8 25.1 +6.7
DSBench-FullStack 71.1 68.7 +2.4
DSBench-Hard 67.2 59.6 +7.6

DeepSeek también comunica puntuaciones HLE de 42.7 sin herramientas y 60.0 con herramientas para V4 Pro GA.

El patrón importa más que una sola cifra destacada. Las mayores mejoras absolutas aparecen en trabajo con repositorios, tareas difíciles de ingeniería de software y automatización. La brecha es mucho menor en Agents' Last Exam y moderada en el uso general de herramientas. Esto respalda una estrategia de enrutamiento: reservar Pro para tareas donde una mayor probabilidad de éxito vale más que la eficiencia bruta de tokens y mantener Flash para clasificación, resumen, triaje y subagentes sencillos de gran volumen.

Son resultados comunicados por el proveedor, no un benchmark independiente de Modelflare. Los entornos de prueba, permisos de herramientas, esfuerzo de razonamiento, parámetros de muestreo, límites de tiempo y reglas de puntuación pueden cambiar materialmente los resultados. Una decisión de producción debe reproducir las mismas tareas seguras para la privacidad en ambos modelos y medir el coste por tarea completada, no solo tokens o posición en un benchmark.

Arquitectura y la afirmación de contexto de 1M

La ficha pública de V4 describe la familia Pro como un modelo Mixture-of-Experts con 1,6 billones de parámetros totales y 49.000 millones de parámetros activados. Documenta un diseño de atención híbrida que combina Compressed Sparse Attention y Heavily Compressed Attention, Manifold-Constrained Hyper-Connections, el optimizador Muon y preentrenamiento con más de 32 billones de tokens.

DeepSeek afirma que, con un contexto de 1M tokens, V4 Pro utiliza el 27 % de los FLOPs de inferencia de un solo token y el 10 % de la caché KV que requiere V3.2. Son afirmaciones arquitectónicas del editor del modelo; no significan que una solicitud de un millón de tokens vaya a ser rápida, barata o igual de precisa en todas las posiciones.

Para trabajo real con contexto largo:

  • coloque las instrucciones estables y el material reutilizable del repositorio al principio para aprovechar la caché de prefijos;
  • controle prompt_cache_hit_tokens y prompt_cache_miss_tokens en lugar de suponer un acierto;
  • compacte trazas de herramientas obsoletas y archivos duplicados antes de que consuman el presupuesto de contexto;
  • pruebe la recuperación a la profundidad documental y posición de token reales de su aplicación;
  • reserve espacio para el razonamiento, los resultados de herramientas y la respuesta final en vez de llenar toda la ventana con entrada.

La caché en disco de DeepSeek es automática y de mejor esfuerzo. Compara prefijos reutilizables, puede tardar segundos en construirse y suele borrarse tras horas o días de inactividad. Una solicitud repetida con cambios al principio puede perder casi todo el beneficio económico.

Compatibilidad de API: nativo no significa idéntico

Superficie Compatibilidad oficial de DeepSeek Límite importante
Chat Completions Compatible Los bucles de herramientas con razonamiento deben conservar reasoning_content
Responses API Compatible Sin estado; varios campos de OpenAI se ignoran o no se admiten
API compatible con Anthropic Compatible Algunos campos se ignoran; no admite contenido de imagen ni documento
Finalización FIM Beta Solo sin razonamiento y mediante el endpoint beta

La capa Responses oficial admite texto, llamadas a funciones, búsqueda web del servidor y la herramienta personalizada apply_patch usada para la compatibilidad con Codex. No admite previous_response_id, conversaciones, respuestas almacenadas, modo background, service_tier ni claves de caché de prompts administradas por OpenAI. Los campos no compatibles suelen ignorarse silenciosamente, por lo que un HTTP 200 no demuestra paridad semántica. Los clientes de Responses deben conservar su propio historial e inspeccionar los tipos de evento en vez de esperar el marcador [DONE] de Chat Completions.

Existe otro límite importante en el bucle de herramientas de Chat Completions: al usar razonamiento y herramientas juntos, el reasoning_content del asistente debe devolverse en solicitudes posteriores. DeepSeek documenta un error 400 si se pierde este campo. Las pasarelas y adaptadores SDK deben probarse con un bucle completo de herramientas de varios turnos, no con un único prompt de texto.

El anuncio GA indica que están disponibles los esfuerzos low, high y max. Sin embargo, la guía detallada de razonamiento y la referencia API actuales dicen que high y max son los valores efectivos, que low y medium se asignan a high y que xhigh se asigna a max. Hasta que DeepSeek armonice esos documentos o una prueba en vivo demuestre un comportamiento low distinto, no presupueste una reducción de costes por un supuesto esfuerzo bajo.

Precios de la API oficial de DeepSeek: actuales y próximos

Todos los precios siguientes están en USD por millón de tokens. Los precios fijos actuales siguen publicados hasta que el nuevo esquema entre en vigor a las 16:00 UTC del 16 de agosto de 2026, es decir, a las 00:00 del 17 de agosto en Pekín.

Periodo de precio Entrada con caché Entrada sin caché Salida
Precio actual comprobado el 14 de agosto $0.003625 $0.435 $0.87
Nuevo precio valle $0.022 $0.66 $1.98
Nuevo precio punta $0.044 $1.32 $3.96

En el próximo esquema, las horas punta son 01:00–04:00 y 06:00–10:00 UTC. El resto son horas valle, cuyos precios son la mitad de los de punta.

La transición no es una simple división horaria de 2× respecto a los precios actuales. Frente a la tarifa fija actual, el nuevo precio valle es unas 6,07× mayor para entrada en caché, 1,52× para entrada sin caché y 2,28× para salida. El precio punta duplica esos nuevos valores valle. Reutilizar la caché sigue siendo valioso, pero el precio excepcionalmente bajo de entrada en caché de la etapa de lanzamiento es el que más cambia.

Ejemplos de costes calculados

La fórmula del coste exclusivo de tokens es:

coste = tokens_cache_hit × tarifa_cache_hit + tokens_cache_miss × tarifa_cache_miss + tokens_salida × tarifa_salida

Los ejemplos siguientes excluyen costes independientes de red, suscripción, servicios de herramientas o pagos. Un agente que usa herramientas puede generar varias llamadas al modelo; calcule la tarea completa, no solo la primera solicitud.

Carga de trabajo DeepSeek actual Nuevo valle Nuevo punta Modelflare al 14 de agosto
Entrada 100K sin caché + salida 10K $0.0522 $0.0858 $0.1716 $0.0540
Entrada 90K en caché + 10K sin caché + salida 10K $0.0134 $0.0284 $0.0568 $0.0138
Entrada 900K en caché + 100K sin caché + salida 20K $0.0642 $0.1254 $0.2508 $0.0663

La segunda y tercera filas muestran por qué importa la estructura del prompt. Un prefijo estable grande puede reducir mucho el coste, pero solo después de un acierto real de caché. Los campos de uso de la API son la fuente de verdad para la conciliación.

DeepSeek V4 Pro frente a V4 Flash: elección precio-rendimiento

Con las tarifas oficiales actuales, Pro cuesta unas 3,11× veces Flash para entrada sin caché y salida, pero solo 1,29× para entrada con caché. Tras comenzar el nuevo esquema, Pro cuesta 3× Flash para entrada sin caché y salida y alrededor de 3,14× para entrada con caché. La concurrencia oficial por cuenta es 500 para Pro frente a 2.500 para Flash.

Esto produce una regla operativa clara:

  • elija V4 Pro para cambios difíciles en repositorios, agentes de largo horizonte, análisis de seguridad, coordinación compleja de herramientas y tareas donde un intento fallido resulte caro;
  • elija V4 Flash para agentes sencillos, trabajadores paralelos, preprocesamiento, extracción, resumen y tráfico sensible al rendimiento;
  • enrute según la dificultad observada y el coste por tarea completada, en vez de convertir Pro en el valor predeterminado universal;
  • reevalúe después del cambio de precios porque la economía de las cargas Pro con caché cambia de forma sustancial.

Un precio por token 3× mayor todavía puede resultar más barato si Pro evita reintentos o reparación humana. A la inversa, cinco puntos más en un benchmark no justifican enviar trabajo determinista o trivial al modelo mayor. Mida la tasa de finalización, el tiempo total, todos los tokens de los reintentos, los fallos de herramientas y el tiempo de corrección del revisor.

Precio y disponibilidad de DeepSeek V4 Pro en Modelflare

El catálogo de precios en vivo de Modelflare se comprobó el 14 de agosto de 2026. Incluye deepseek-v4-pro y el alias fijado deepseek-v4-pro-0813 en el grupo deepseek-stable, con estos precios base por millón de tokens:

Precio de Modelflare al comprobarlo Tarifa
Entrada con caché $0.0037
Entrada sin caché $0.45
Salida $0.90

Esas tarifas son aproximadamente un 2,07 % superiores al precio actual de DeepSeek para entrada con caché y un 3,45 % superiores para entrada sin caché y salida. Modelflare no promete en este artículo que estos precios permanezcan iguales tras la transición de DeepSeek a horas punta y valle. Para una decisión de producción, use siempre la página de precios en vivo y el registro de uso de la solicitud.

Los metadatos actuales del catálogo público marcan la ruta de Modelflare como Chat Completions compatible con OpenAI. Aunque el endpoint propio de DeepSeek admite ahora Responses y formatos de Anthropic, la compatibilidad del proveedor no hace compatible automáticamente cada ruta de una pasarela. Use el protocolo exacto indicado en la página de precios en vivo.

export MODELFLARE_API_KEY="your-api-key"

curl https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer ${MODELFLARE_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Review this migration plan and identify rollback risks."}
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high"
  }'

Para la configuración general del cliente, consulte la guía de API compatible con OpenAI. Para interpretar la contabilidad y los tokens de caché, consulte seguimiento de costes de API de IA.

Lista de comprobación para producción

  1. Fije deepseek-v4-pro-0813 durante la evaluación si la ruta lo ofrece y decida después si el alias estable resulta aceptable para el control de cambios.
  2. Reproduzca un conjunto fijo de tareas seguras para la privacidad en Pro y Flash con las mismas herramientas, permisos, tiempo de espera y reglas de parada.
  3. Pruebe high y max; trate low como equivalente a high hasta que el comportamiento actual de la API demuestre lo contrario.
  4. Complete un bucle de herramientas de varios turnos y verifique que reasoning_content, los ID de herramientas, argumentos y resultados sobreviven a todos los adaptadores.
  5. En clientes Responses, pruebe explícitamente cada campo necesario porque los parámetros no compatibles pueden ignorarse silenciosamente.
  6. Registre entrada con caché, entrada sin caché, salida, tokens de razonamiento, latencia, reintentos y coste por tarea completada.
  7. Pruebe prompts largos a profundidades realistas; no deduzca la calidad de recuperación a un millón de tokens a partir de una solicitud corta.
  8. Pruebe carga por debajo del límite de concurrencia de la cuenta y gestione respuestas 429 con espera exponencial acotada.
  9. Modele tanto el precio actual como el esquema punta/valle del 16/17 de agosto antes de aprobar un presupuesto.
  10. Mantenga Flash u otro modelo como alternativa para disponibilidad y control de costes; consulte enrutamiento fiable de API de IA.

Veredicto final

DeepSeek V4 Pro GA es una versión centrada en agentes significativa, no solo una vista previa renombrada. El patrón de puntuaciones oficiales es más fuerte en razonamiento sobre repositorios, programación difícil y automatización, mientras que la nueva superficie Responses la hace más práctica para agentes de programación modernos. Su contexto de 1M y la caché automática son útiles, pero solo cuando las aplicaciones conservan prefijos estables y verifican aciertos reales de caché.

La principal reserva es económica: el precio de Pro posterior al lanzamiento es aproximadamente tres veces el de Flash en la mayoría de categorías de tokens, con menor concurrencia. Debería ser el nivel de escalado para trabajo difícil y de alto valor, no el valor predeterminado de cada prompt. La mejor arquitectura de producción normalmente enrutará el trabajo sencillo a Flash y promoverá solo las tareas difíciles o fallidas a Pro.

La tarifa de Modelflare del 14 de agosto está cerca del precio fijo actual de DeepSeek y actualmente expone Chat Completions para V4 Pro. Vuelva a consultar la página en vivo cuando comience el nuevo esquema de DeepSeek; ni un artículo antiguo ni una captura de precios en caché deben tratarse como verdad de facturación.

Fuentes y fecha de verificación

Las especificaciones oficiales, los esquemas de precios, la disponibilidad en Modelflare y los precios en vivo se comprobaron el 14 de agosto de 2026.