DeepSeek V4.1 Flash a fondo: arquitectura, precio en Modelflare y rivales

Un análisis con fuentes de DeepSeek V4.1 Flash: arquitectura, contexto de 1M, salida de 384K, bancos de pruebas de Agent, límites de la API, comparación con OpenAI y Anthropic, y la disponibilidad y el precio actuales en Modelflare.

DeepSeek V4.1 Flash a fondo: arquitectura, precio en Modelflare y rivales

DeepSeek V4.1 Flash es un modelo multimodal, de pesos abiertos y de bajo coste, hecho para bucles largos de Agent. Publicado el 10 de septiembre de 2026, combina una ventana de contexto de un millón de tokens, hasta 384K tokens de salida, una API oficial inusualmente barata y una arquitectura que reduce el procesado del prompt y la presión de la caché KV. Su ventaja más clara no es ganar todos los bancos de pruebas. Es la cantidad de trabajo de Agent con contexto largo que puede intentar por dólar, sin dejar de ser competitivo en evaluaciones de código, terminal, automatización y uso de herramientas.

Esa conclusión necesita límites. Los números de banco de pruebas de abajo los publicó DeepSeek, y Modelflare no los reprodujo de forma independiente. El propio informe de DeepSeek dice que el modelo aún va por detrás de los sistemas cerrados más grandes en el razonamiento más difícil y en los casos límite. El ID correcto del modelo en la API de primera parte es deepseek-flash. DeepSeek V4.1 Flash ya está en Modelflare bajo el ID de modelo versionado deepseek-v4.1-flash-0910, con Chat Completions y Responses en el grupo público deepseek-stable.

Última verificación: 2026-09-10 UTC. Los precios, los alias y el estado del catálogo pueden cambiar.

La respuesta directa: qué es DeepSeek V4.1 Flash

El aviso de publicación de DeepSeek define DeepSeek V4.1 Flash como el sustituto de producción de la línea Flash anterior. El extremo oficial acepta deepseek-flash. Los nombres heredados deepseek-v4-flash y deepseek-v4-flash-vision-exp los acepta de forma temporal DeepSeek y se enrutan a V4.1 Flash a tarifas Flash. A partir del 14 de septiembre de 2026 a las 04:00 UTC, DeepSeek dice que las peticiones de deepseek-v4-pro también se enrutarán a V4.1 Flash hasta una publicación posterior de V4.1 Pro.

Esta política de migración pertenece a la API propia de DeepSeek. Modelflare usa el ID con sello explícito de publicación deepseek-v4.1-flash-0910, en vez de reetiquetar en silencio la entrada anterior deepseek-v4-flash. El operador de Modelflare confirmó el lanzamiento, y el modelo apareció en los catálogos de precios público y de origen a las 2026-09-10 15:21 UTC. Los clientes deberían usar el ID exacto que muestra su proveedor, en vez de suponer que un alias de primera parte funciona igual a través de cada pasarela.

La identidad práctica del modelo tiene cinco partes: entrada multimodal de imagen y texto; salida de texto; un tronco MoE de 552B parámetros; una memoria Engram adicional de 196B parámetros; y una activación asimétrica de 8B parámetros por token de prompt frente a 16B por token decodificado. El último punto es el centro: las cargas de Agent pesadas en entrada deberían gastar menos cómputo en el prefill repetido que un diseño solo decodificador y simétrico de escala parecida.

Especificaciones de un vistazo

Los valores siguientes vienen de la publicación oficial, la ficha del modelo y el informe técnico. «Parámetros del tronco» y «parámetros de Engram» describen almacenes distintos; ningún número equivale al cómputo activo por token.

Concepto DeepSeek V4.1 Flash
ID de la API oficial deepseek-flash
ID de modelo en Modelflare deepseek-v4.1-flash-0910
Clase de modelo Transformer multimodal Mixture-of-Experts
Entrada / salida Texto e imágenes de entrada; texto de salida
Disposición del Transformer 40 capas: codificador causal de 20 capas + decodificador de 20 capas
Almacenes de parámetros tronco de 552B + memoria condicional Engram de 196B
Parámetros activos 8B por token de prefill; 16B por token de decodificación
Contexto / salida máxima 1M / 384K tokens
Preentrenamiento 45T tokens de corpus multimodal; proporción 7:1 de tokens de solo texto frente a multimodales
Diseño principal de atención y caché CED + CSA2 + KV global FP4; KV local SWA FP8
Huella de KV global 890 bytes por token, según informa DeepSeek
Preajustes públicos de razonamiento low = 50, high = 75, max = 100 en la escala interna de effort
Límite de concurrencia de la API oficial 2,500 peticiones concurrentes
Licencia licencia MIT del checkpoint

El techo de salida de 384K es tres veces el máximo de 128K publicado para los modelos actuales de comparación de OpenAI y Anthropic en este artículo. Es un límite, no una recomendación: una salida muy larga aumenta la latencia, el coste y la superficie de deriva. Para los Agent largos, la pregunta más útil es si el modelo puede retener los requisitos y pasar comprobaciones reales de aceptación después de las llamadas a herramientas.

Por qué la arquitectura está hecha para bucles largos de Agent

Un Agent que usa herramientas añade una y otra vez observaciones, resultados de comandos y ediciones a su historial. Cada turno nuevo puede exigir prefill del prompt, atención sobre un contexto que crece, almacenamiento KV y salida nueva. DeepSeek V4.1 Flash ataca cada coste por separado, en vez de apoyarse en un solo modelo más pequeño.

Coste del Agent Mecanismo de V4.1 Flash Efecto pretendido
Reprocesar prompts largos Causal Encoder-Decoder (CED) Casi parte a la mitad el trabajo asintótico de prefill en secuencias largas, en el análisis de DeepSeek
Guardar el historial global en HBM reutilización entre capas de CSA2 + FP4 Reduce las entradas duplicadas de KV global y los bytes por entrada
Persistir el estado de atención local SWA Bounded Replay Reconstruye una ventana local acotada en vez de guardar la caché local completa de cada capa
Recordar patrones estables de tokens Engram Mueve la memoria condicional de n-gramas a tablas de acceso disperso
Producir tokens decodificación especulativa DSpark Esboza varias posiciones candidatas y elige una longitud de verificación según la confianza y la carga del sistema
Tratar imágenes DeepSeek-ViT + proyector Convierte las entradas visuales en incrustaciones procesadas junto con el texto desde el preentrenamiento

Estos mecanismos mejoran sobre todo la economía de servicio y el caudal. No demuestran por sí mismos un razonamiento mejor. La calidad del modelo también depende de los datos, del postentrenamiento, del harness del Agent y de cuánto effort de inferencia se compre.

CED: recorte el procesado del prompt antes de tocar la caché

El informe técnico parte 40 capas de Transformer en un codificador causal de 20 capas y un decodificador de 20 capas. Las dos primeras capas usan solo una ventana deslizante de 128 tokens. Las capas restantes combinan atención local de ventana deslizante con contexto global comprimido.

En la atención global, el decodificador no construye en cada capa un historial KV completo e independiente. Sus claves y valores globales se proyectan desde el estado oculto final del codificador. Los estados de ventana deslizante local siguen siendo propios de cada capa. DeepSeek estima la complejidad de prefill en secuencia larga en cerca de la mitad de la ruta correspondiente de todas las capas: el término dominante pasa de procesar cada token a través de todas las capas L a procesar el contexto global a través de unas L/2, más el trabajo acotado de la ventana local.

Eso explica el corte de activación 8B/16B. Los tokens del prompt activan unos 8B parámetros de tronco durante el prefill; los tokens recién generados activan unos 16B durante la decodificación. Las cargas con documentos enormes y respuestas cortas se benefician más que las cargas dominadas por cientos de miles de tokens generados. CED reduce la primera mitad de esa factura; no hace gratis la decodificación.

CSA2, FP4 y SWA Bounded Replay: el relato de la memoria

Compressed Sparse Attention 2 comprime la caché a lo largo de las dimensiones de secuencia, capa y precisión. A cada capa CSA2 se le asigna de forma estática uno de tres modos. Full calcula el KV principal, las claves del indexador y posiciones Top-K nuevas. Reindex reutiliza el KV principal y las claves del indexador, pero las vuelve a recorrer con su propia consulta. Reuse reutiliza a la vez el KV compartido y una selección dispersa anterior. Cada capa sigue teniendo su propia consulta y su KV de ventana deslizante local.

La primera capa Full del decodificador selecciona entradas Top-512 y construye un fondo de candidatos; las capas Reindex posteriores eligen sus posiciones Top-512 dentro de ese fondo reducido. El KV global principal usa una representación E2M1 de unos cuatro bits, con una escala E4M3 cada 16 canales. DeepSeek conserva FP8 para la caché SWA local, más sensible a la cuantización.

Capa de caché Precisión / vida Resultado informado Qué no garantiza
KV global en ejecución FP4, residente en HBM 890 bytes/token; cerca de 1/4 de V4 Flash y 437× más pequeño que V1 Selección dispersa perfecta en cada caso límite
KV SWA local en ejecución FP8 Conserva la ventana local de capa de 128 tokens Memoria despreciable con una concurrencia arbitraria
KV global persistente memoria del host o SSD en el diseño de despliegue de DeepSeek estado global reutilizable y de vida larga un periodo fijo de retención en la API pública
estado SWA local persistente reconstruido con Bounded Replay cerca de 1/8 de la huella total de caché persistente de V4 Flash a igual longitud de secuencia reproducción exacta de cada estado local descartado

El informe dice que su despliegue conserva el KV persistente global al menos 72 horas y usa un fondo SWA distribuido de vida corta. La guía pública de caché de contexto describe la creación de caché como automática y de mejor esfuerzo, dice que la construcción puede tardar segundos, y dice que las entradas en general se borran al cabo de horas o días. Los clientes de producción deberían tratar el contrato público como autoridad: inspeccionar los campos de tokens de acierto y de fallo, en vez de presupuestar en torno a un acierto garantizado de 72 horas.

DeepSeek señala él mismo dos límites de robustez: CSA2 puede elegir las posiciones dispersas equivocadas, y Bounded Replay aproxima el estado local descartado. Sus pruebas no hallaron degradación sistemática en los ajustes evaluados, pero los contextos extremos y los límites de reanudación de caché siguen siendo terreno para más pruebas de estrés.

Engram, DSpark y el camino multimodal

Engram separa parte de la memorización del cómputo denso del modelo. V4.1 Flash reparte 196B parámetros en dos módulos de memoria condicional, en las capas de índice cero 1 y 14. Cada uno usa n-gramas de tokens de longitudes dos, tres y cuatro, ocho cabezas hash, una compuerta atenta al contexto y precarga de memoria del host por RDMA. Son parámetros almacenados, no otros 196B parámetros activados en cada token.

DSpark es un decodificador especulativo entrenado aparte. Tres bloques Transformer miran a través de una ventana deslizante de 128 tokens y proponen cinco posiciones en paralelo. Una cabeza ligera de dependencia relaciona los tokens del borrador; una cabeza de confianza estima cuánto del borrador sobrevivirá a la verificación. El planificador usa esas probabilidades y el caudal medido del motor para elegir una longitud de verificación bajo la carga actual. Esto puede mejorar el caudal de tokens del sistema sin cambiar el papel de verificación final del tronco.

El camino visual usa un DeepSeek-ViT entrenado aparte, con codificación rotatoria de posición en 2D. Un paso de pixel-unshuffle 3×3 reduce nueve veces el recuento de tokens visuales antes de proyectarlos al modelo de lenguaje. El codificador de visión tiene 32 capas, tamaño oculto 1,024 y 16 cabezas de atención en la configuración informada. Su etapa de entrenamiento autorregresivo usa imágenes escaladas entre 544×544 y 1,344×1,344, después de una etapa contrastiva anterior sobre unos 47B pares de imagen y texto.

Entrenamiento y postentrenamiento

DeepSeek informa de 45T tokens de preentrenamiento, con datos multimodales integrados en el entrenamiento del modelo de lenguaje. Los conductos de solo texto y multimodal se funden en una proporción de tokens 7:1 después de sustituir solapes y de deduplicar. La atención dispersa se entrena desde cero con longitud de secuencia 64K, sin un calentamiento de atención densa; el contexto se extiende a 1M en el punto de 34T tokens.

Etapa Detalle publicado Por qué importa
Preentrenamiento contrastivo de visión unos 47B pares de imagen y texto, fase de baja resolución aprende representaciones visuales amplias antes de integrar el lenguaje
Ajuste autorregresivo de visión 236B tokens con descripciones, gráficos, OCR y datos relacionados añade comprensión visual y documental de grano fino
Preentrenamiento del LLM 45T tokens; datos multimodales incluidos desde el principio evita tratar la visión solo como un adaptador tardío de prompt
Entrenamiento de contexto atención dispersa desde 64K; extendida a 1M a los 34T tokens entrena el patrón de atención que se despliega, en vez de convertirlo solo después del entrenamiento
Postentrenamiento SFT, aprendizaje por refuerzo y destilación on-policy alinea el razonamiento, las herramientas y el comportamiento de Agent

El informe no afirma un algoritmo nuevo de postentrenamiento. Atribuye las ganancias a la creación sintética de tareas y de entornos, a un filtrado mejor de los datos, a recompensas verificables y a la escala de arquitectura y de datos. Esto importa al comparar afirmaciones de «arquitectura del modelo»: CED y CSA2 explican la eficiencia, mientras que el rendimiento observado del Agent es el producto de toda la pila de entrenamiento y de scaffold.

Effort de razonamiento: la calidad tiene una factura visible de tokens

DeepSeek expone un continuo interno de effort de 1 a 100 y asigna los preajustes públicos de la API low, high y max a 50, 75 y 100. Las entradas de compatibilidad asignan minimal y low a low; medium, high y xhigh a high; y max o ultra a max. El pensamiento toma high por defecto.

En el barrido que informa DeepSeek, subir el effort de 25 a 100 aumentó el resultado medio de ocho evaluaciones de razonamiento del 67.1% al 76.3%, DeepSWE del 66.0% al 74.2% y Terminal-Bench 2.1 del 82.4% al 90.6%. Los tokens de salida crecieron cerca de 2.5×. El intervalo 60–80 recogió la mayor parte de la calidad con menos de la mitad del presupuesto máximo de tokens; el paso final hasta 100 alargó las trayectorias de Agent en 1.6–1.8× a cambio de ganancias menores.

Este es uno de los controles más útiles del modelo. Utilice low para clasificación, extracción y exploración que se pueda reintentar; high para el código y la investigación normales; reserve max para tareas en las que otro intento, o un caso límite perdido, cuesta más que los tokens de más. Trate esto como hipótesis de partida y mida el coste de la tarea aceptada.

En el modo de pensamiento, se ignoran la temperatura y las penalizaciones de presencia y de frecuencia, y top_p tiene un mínimo de 0.95. Con herramientas, los clientes deben devolver el reasoning_content completo del mensaje del asistente junto con los resultados de las herramientas; omitirlo provoca una respuesta 400. Esa regla de estado importa más que copiar un conjunto familiar de parámetros de OpenAI.

Comparación de bancos de pruebas con OpenAI y Anthropic

Esta tabla reproduce resultados seleccionados de la tabla 3 del informe técnico de DeepSeek. Todos los modelos se muestran en el ajuste Max del informe. DeepSeek usó scaffolds exigidos u oficiales distintos en algunas evaluaciones, un contexto de DeepSeek Harness de 1M para el código, y un contexto de Claude Code de 512K para tareas de Agent visual. Los números son evidencia informada por el proveedor, no una prueba independiente cara a cara ni un SLA de producción.

Evaluación V4 Flash V4 Pro V4.1 Flash GPT-5.6 Sol Claude Opus 5
GPQA Diamond, Pass@1 89.9 92.4 90.9 94.1 93.4
Terminal-Bench 2.1, Pass@1 82.7 87.9 90.6 88.8 89.1
Terminal-Bench 3.0, Pass@1 7.6 11.8 30.0 34.4 43.3
Terminal-Bench 4.0, Pass@1 7.0 12.4 31.2 39.9 51.8
DeepSWE v1.1, resuelto 54.4 62.7 74.2 73.0 74.0
CyberGym, Pass@1 76.7 83.3 88.1 84.5
HLE con herramientas, Pass@1 51.5 60.0 63.9 63.6
AutomationBench, Pass@1 37.7 43.2 54.8 45.8 50.3
Agents' Last Exam, Pass@1 25.2 25.7 31.8 26.7 28.6
Chartography con herramientas, Pass@1 78.9 79.9 84.0

La lectura más sólida es concreta. V4.1 Flash da un paso grande respecto de V4 Flash en tareas de Agent, y compite con GPT-5.6 Sol y Claude Opus 5 en DeepSWE, Terminal-Bench 2.1, automatización y HLE con herramientas. No lidera GPQA, las versiones posteriores de Terminal-Bench ni Chartography. El propio informe advierte que una paridad cercana en las tareas comunes no significa paridad de frontera en el razonamiento más difícil y en los casos límite.

GPT-6 Astra y Claude Fable 5.1 quedan fuera de esta tabla de puntuaciones porque el informe de DeepSeek no publica para ellos los mismos datos de comparación fila a fila. Añadir puntuaciones de páginas sueltas de proveedores crearía un harness común que no existe. Los equipos deberían evaluar a todos los candidatos con las mismas tareas de repositorio, herramientas, tiempos de espera, política de red y comprobaciones de aceptación.

La compatibilidad de la API es amplia, pero no idéntica

El servicio oficial expone Chat Completions de OpenAI, Responses de OpenAI y una API compatible con Anthropic. Esa amplitud baja el trabajo de migración, pero la compatibilidad describe la forma de la petición, no una semántica idéntica del ciclo de vida.

Superficie Comportamiento de DeepSeek V4.1 Flash Consecuencia para la migración
Chat Completions transmisión, salida JSON, llamadas a funciones; prefix/FIM en modo sin pensamiento los clientes OpenAI ya existentes son el punto de partida más simple
Responses sin estado; se admiten funciones e imágenes persista usted mismo la conversación completa
Campos de estado de Responses no se admiten o se ignoran previous_response_id, las conversaciones, store, background y la gestión de contexto una respuesta 200 no prueba que esas funciones surtieran efecto
Herramientas alojadas se ignoran la búsqueda web, la búsqueda de ficheros, el intérprete de código, el computer use y los integrados de MCP; el soporte de herramienta a medida es limitado ejecute las herramientas en la aplicación y pruebe cada campo solicitado
Resúmenes de razonamiento no se admiten el resumen ni el contenido de razonamiento cifrado no dependa de campos de traspaso de razonamiento al estilo de OpenAI
Formato Anthropic se acepta la forma de mensaje de Anthropic conserve las reglas de razonamiento y de estado de herramientas de DeepSeek, en vez de suponer la semántica de Claude
Visión se aceptan imágenes en la entrada del usuario y en las salidas de herramientas valide el tamaño de la carga, el modo de detail y el número de imágenes

La guía de Responses de DeepSeek también lista campos ignorados, como metadatos, plantillas de prompt, truncado, nivel de servicio, identificador de seguridad, clave y retención de caché de prompt, y opciones de stream. Ignorar en silencio es un riesgo de compatibilidad: aceptar el esquema puede ocultar que el comportamiento no está. Construya una petición de conformidad para cada función de la que dependa su aplicación. La guía de la API compatible con OpenAI explica por qué la forma del extremo y la capacidad necesitan comprobaciones distintas.

Los modelos actuales de OpenAI ofrecen un ecosistema nativo más amplio de herramientas de Responses y funciones de estado gestionado. La API nativa de Anthropic tiene su propio contrato maduro de bloque de pensamiento y de uso de herramientas. La ventaja de DeepSeek es que un solo modelo acepta los tres dialectos habituales; su coste es que la intersección es más pequeña que la superficie nativa completa de cualquiera de los dos rivales.

Límites de visión y economía de la imagen

La guía oficial de visión admite JPEG, PNG, GIF y WebP mediante base64, URL externas o la Files API. Las imágenes se redimensionan solas hacia unos 1,300×1,300 y usan como máximo 1,024 tokens de entrada cada una. El detail low usa una vista de 512×512; high y original conservan más detalle; auto se comporta ahora como original.

Límite Valor oficial
Cuerpo de la petición 48 MiB
Imagen en línea o traída de fuera 32 MiB cada una
Imagen referida por ID de fichero 64 MiB cada una
Imágenes por petición 600
Bytes de imagen combinados 64 MiB sin ID de fichero; 200 MiB con ID de fichero
Lado largo 8,192 px; 4,096 px al enviar 15 imágenes o más
Techo de tokens visuales 1,024 tokens por imagen después del procesado

En el máximo de 1,024 tokens visuales, una imagen sin caché aporta cerca de $0.0001536 en valle o $0.0003072 en punta a las tarifas de entrada publicadas, antes del texto que la acompaña y de la salida. Esta aritmética sirve para estimar la escala, pero el redimensionado, el comportamiento de la caché y el uso real de tokens visuales pueden cambiar el cargo. Más imágenes también consumen contexto que, si no, podría guardar texto o historial de herramientas.

V4.1 Flash sirve para capturas de documentos, gráficos, OCR y observaciones de un Agent visual. No es un modelo de generación de imágenes. Para imágenes generadas, utilice un modelo y un extremo pensados para devolver píxeles, no texto.

Precios de la API oficial, comparados

La página de precios de DeepSeek introdujo las tarifas siguientes a las 04:00 UTC del 10 de septiembre. Las ventanas de punta en días laborables son 01:00–04:00 y 06:00–10:00 UTC; el resto de las horas laborables y el fin de semana usan tarifas de valle. La caché de contexto de DeepSeek es automática, así que «entrada en caché» significa un acierto de caché informado, no una bandera de caché que lo fuerce.

Las tarifas de OpenAI vienen de su comparación actual de modelos; las de Anthropic vienen de su página de precios. Los valores son USD por un millón de tokens. Anthropic también cobra las escrituras de caché; aquí se omiten porque la tabla compara solo la entrada nueva, las lecturas de caché y la salida.

Modelo Contexto / salida máxima Entrada nueva o fallo Entrada en caché o leída Salida
DeepSeek V4.1 Flash, en valle 1M / 384K $0.15 $0.003 $0.60
DeepSeek V4.1 Flash, en punta 1M / 384K $0.30 $0.006 $1.20
DeepSeek V4.1 Flash en Modelflare límite del modelo 1M / 384K $0.193548 $0.003871 $0.774194
GPT-5.6 Luna 1.05M / 128K $0.20 $0.02 $1.20
GPT-5.6 Terra 1.05M / 128K $2.00 $0.20 $12.00
GPT-5.6 Sol 1.05M / 128K $4.00 $0.40 $20.00
GPT-6 Astra 1.05M / 128K $10.00 $1.00 $50.00
Claude Sonnet 5 1M / 128K $2.00 $0.20 $10.00
Claude Opus 5 1M / 128K $5.00 $0.50 $25.00
Claude Fable 5.1 1M / 128K $10.00 $0.25 $50.00

El precio no es valor por sí mismo. Tokenizadores distintos pueden facturar recuentos de tokens distintos para el mismo texto; Anthropic señala que una tokenización más nueva puede producir cerca de un 30% más de tokens en algunas cargas. Los modelos también pueden exigir longitudes de salida, reintentos y reparaciones humanas distintas. Compare el coste por tarea aceptada, no solo la fila con el número de entrada más pequeño.

El catálogo público actual de Modelflare expone una sola tarifa entre las dos bandas horarias de DeepSeek: es cerca del 64.5% de la tarifa de punta de primera parte, o un 35.5% más baja durante las ventanas de punta, mientras que está cerca de un 29.0% por encima de la tarifa de valle de DeepSeek. La tarifa de pasarela que se lista no tiene, por tanto, ajuste de banda horaria hoy; las cargas flexibles que puedan usar con fiabilidad la ventana de valle de DeepSeek aún pueden pagar menos por la API de primera parte.

OpenAI aplica tarifas más altas cuando el contexto de entrada pasa de 272K: la petición entera usa precios de 2× en la entrada y en la entrada en caché, y de 1.5× en la salida. Este límite importa en el escenario de contexto largo de abajo. DeepSeek usa ventanas de tiempo; los modelos listados de Anthropic de un millón de tokens no usan el mismo límite de 272K en la tabla de precios citada.

Dos escenarios de coste que se pueden volver a calcular

El escenario A es una petición con 100K de entrada sin caché y 10K de salida. La fórmula es 0.1 × input rate + 0.01 × output rate. Supone que no hay entrada en caché, ni herramientas, ni reintentos, ni impuestos, ni complementos propios del proveedor.

Modelo Coste del escenario A
DeepSeek V4.1 Flash, en valle $0.021
DeepSeek V4.1 Flash en Modelflare $0.0271
GPT-5.6 Luna $0.032
DeepSeek V4.1 Flash, en punta $0.042
Claude Sonnet 5 $0.300
GPT-5.6 Terra $0.320
GPT-5.6 Sol $0.600
Claude Opus 5 $0.750
GPT-6 Astra / Claude Fable 5.1 $1.500

El escenario B es el coste marginal de una petición con caché caliente, con 900K de entrada en caché, 100K de entrada nueva y 20K de salida. Excluye a propósito la petición anterior que creó la caché. Fórmula: 0.9 × cache-read rate + 0.1 × input rate + 0.02 × output rate. Se aplican los modificadores de contexto largo de la petición entera de OpenAI, porque el contexto de entrada suma un millón de tokens.

Modelo Coste marginal del escenario B
DeepSeek V4.1 Flash, en valle $0.0297
DeepSeek V4.1 Flash en Modelflare $0.0383
DeepSeek V4.1 Flash, en punta $0.0594
GPT-5.6 Luna $0.1120
Claude Sonnet 5 $0.5800
GPT-5.6 Terra $1.1200
Claude Opus 5 $1.4500
GPT-5.6 Sol $2.1200
Claude Fable 5.1 $2.2250
GPT-6 Astra $5.3000

La comparación mantiene iguales las cantidades de tokens; no afirma que la calidad sea igual. La caché de DeepSeek es de mejor esfuerzo, mientras que crear caché en Anthropic tiene su propio precio de escritura y su propia vida. Una prueba justa de la carga registra los tokens de acierto y de fallo de caché, todos los intentos, la salida total incluido el razonamiento facturable, el tiempo transcurrido, la tasa de aceptación y los minutos de corrección humana. La guía de seguimiento de costes aporta el marco de contabilidad.

Los pesos abiertos no hacen pequeño el autoalojamiento

La publicación en Hugging Face tiene licencia MIT y documenta caminos de servicio con vLLM y SGLang. En la instantánea comprobada para este artículo, el repositorio contenía 48 fragmentos safetensor y unos 510.3 GB de ficheros Git-LFS en el commit dba1be0a40aa45a94ad051997016db3960a90277. Ese recuento de bytes es un artefacto de descarga, no RAM de GPU medida.

El sistema sigue teniendo un tronco de 552B, memoria Engram de 196B direccionada por el host, enrutado de expertos, caminos de caché FP4/FP8, precarga por RDMA y almacenamiento KV persistente. La publicación de DeepSeek invita a contactar con la empresa a los equipos que planeen un despliegue a gran escala con 2,000 GPU más un clúster de almacenamiento. Ese ejemplo señala la escala del sistema completo de servicio; no es un mínimo declarado para cada despliegue. Los despliegues de investigación más pequeños pueden usar cuantización u otro paralelismo, pero no deberían deducirse de la economía de la API del proveedor.

Los pesos abiertos dan a los equipos acceso al checkpoint, posibilidad de inspección y control sobre la política de despliegue. No reproducen solos la fusión de kernels de DeepSeek, la jerarquía de caché, la planificación de DSpark, el batching ni la latencia de la API pública. Compare un plan de autoalojamiento con el caudal medido, la recuperación ante fallos, la capacidad ociosa, el ancho de banda de almacenamiento y el trabajo de operaciones.

DeepSeek V4.1 Flash en Modelflare

DeepSeek V4.1 Flash está en Modelflare. El lanzamiento confirmado por el operador se ve, de forma independiente, en el catálogo público de precios de Modelflare y en el catálogo de origen. A las 2026-09-10 15:21 UTC, los dos exponían el registro nuevo de deepseek-v4.1-flash-0910; la configuración de producción mostraba una ability deepseek-stable habilitada y una ruta habilitada que anunciaba el mismo modelo.

Concepto de Modelflare Valor en vivo
ID de modelo que hay que enviar deepseek-v4.1-flash-0910
Disponibilidad en vivo en el catálogo público y en el grupo de enrutado habilitado
Grupo público deepseek-stable
Precio de entrada $0.193548 / 1M tokens
Precio de entrada en caché $0.003871 / 1M tokens
Precio de salida $0.774194 / 1M tokens
Tipos de extremo /v1/chat/completions y /v1/responses

Los precios se derivan del coeficiente base de entrada $0.322580645 de la entrada en vivo, de la razón 0.6 del grupo público, de la razón de caché 0.02 y de la razón de completado 4×. Para las dos cargas calculadas de arriba, los costes de Modelflare son cerca de $0.0271 y $0.0383, respectivamente. Utilice la página de precios de DeepSeek V4.1 Flash en vivo para el ID de modelo y la tarifa de ahora.

Los niveles de evidencia siguen importando. El catálogo público y la ruta de producción habilitada establecen que el producto está disponible, y el operador confirmó el lanzamiento de forma explícita. A las 15:30 UTC, los registros de producción contenían seis llamadas completadas de Chat Completions bajo el ID exacto del modelo nuevo, con un total de 216 tokens de prompt y 173 tokens de completado. Eso verifica el despacho autenticado de Chat Completions y la salida facturable. Sigue siendo una muestra de lanzamiento demasiado pequeña para medir la latencia o la disponibilidad, y no demuestra por sí solo el comportamiento de Responses ni el multimodal por esta ruta. Los equipos deberían lanzar su propia petición pequeña de aceptación en el extremo exacto antes de mover trabajo de producción.

Dónde DeepSeek V4.1 Flash tiene una ventaja real

El modelo tiene una ventaja coherente cuando importan a la vez las entradas largas, los turnos frecuentes de herramientas y el presupuesto. La arquitectura reduce la presión de prefill y de caché; el precio de la API convierte ese ahorro en una tarifa pública inusualmente baja; el techo de salida de 384K deja margen para parches o informes largos; y el checkpoint mantiene abierto un camino de autoalojamiento.

Carga Por qué V4.1 Flash es un candidato fuerte Qué medir
Agent de repositorio resultados fuertes de DeepSWE y de terminal, informados por quien publica, a tarifas bajas de token cambios aceptados, tasa de pruebas superadas, reintentos y tiempo de reparación
Síntesis larga de investigación entrada de 1M, aciertos de caché baratos y salida de 384K corrección de las citas, retención de requisitos y salida total
Agent de documentos visuales imágenes nativas, entrenamiento de OCR y de gráficos, y API habituales de Agent exactitud de campos, sensibilidad al recorte y al detail, y uso de tokens visuales
Automatización de alto volumen precios bajos de punta y de valle; techo de concurrencia de 2,500 peticiones tiempo de cola, tasa de 429, fallos de herramientas y coste por éxito
Despliegue controlado checkpoint MIT y caminos documentados de vLLM y SGLang uso del hardware, ancho de banda de caché y de almacenamiento, y coste de operación

La afirmación de producción más sólida es, por tanto, agencia de contexto largo a un coste eficiente, no «el mejor modelo en conjunto». Si el modelo completa una tarea real en una ejecución aceptada allí donde un modelo pequeño más barato necesita varias reparaciones, V4.1 gana en el resultado. Si un modelo cerrado de frontera evita un fallo caro, su precio más alto por token aún puede salir a cuenta.

Dónde OpenAI o Anthropic sigue siendo la elección más segura

Elija un modelo de OpenAI cuando la aplicación dependa del ecosistema completo de Responses, del estado gestionado, de las herramientas alojadas, o de un contrato específico de OpenAI que DeepSeek ignora. GPT-5.6 Luna es un competidor de precio particularmente cercano en cargas más cortas y sin caché; Terra, Sol y Astra cambian precios de lista mucho más altos por tramos distintos de capacidad y por funciones nativas de la plataforma.

Elija un modelo de Anthropic cuando el contrato nativo de herramientas y de pensamiento de Claude, los controles de caché o el rendimiento medido en su trabajo de Agent más difícil importen más que el precio de lista del token. En la tabla propia de DeepSeek, Claude Opus 5 lidera Terminal-Bench 3/4 y Chartography; Claude Fable 5.1 se sitúa en el trabajo de horizonte más largo y más exigente, aunque es bastante más caro por token nuevo y por token de salida.

En acciones críticas para la seguridad, o caras, la elección de ruta debería basarse en modos de fallo ya evaluados y en límites de permiso, no en la marca ni en medias de banco de pruebas. Utilice la guía de enrutado para separar el trabajo que se puede reintentar, los fallback y las acciones con efectos laterales.

Lista de comprobación del despliegue

  1. Utilice deepseek-flash en la API de primera parte y registre aparte cualquier correspondencia propia de la pasarela.
  2. Empiece en high y mida luego low y max sobre el mismo conjunto de tareas aceptadas; no trate los nombres iguales de distintos proveedores como el mismo cómputo.
  3. Cuando se usen herramientas en modo de pensamiento, devuelva el reasoning_content completo, exactamente como se exige.
  4. Audite cada campo de Responses del que usted dependa; los parámetros rechazados y los ignorados en silencio piden un trato distinto.
  5. Registre los tokens de acierto y de fallo de caché, los tokens de salida y de razonamiento, los reintentos, la latencia y la aceptación final.
  6. Diseñe la economía de la caché en torno a los aciertos observados, y no en torno a una retención fija supuesta.
  7. Haga cumplir los límites de bytes, de número, de dimensión y de detail de la imagen antes de enviar peticiones multimodales.
  8. Mantenga la autorización del lado de la aplicación, la idempotencia de las herramientas y la validación de la salida al margen de la calidad del modelo.
  9. Vuelva a comprobar el precio por ventana de tiempo, los alias del modelo y los límites de concurrencia antes del lanzamiento.
  10. Lance una petición autenticada de verdad en la ruta exacta; un catálogo de modelos, o un HTTP 200, no prueban por sí solos la capacidad.

Preguntas frecuentes

¿Es DeepSeek V4.1 Flash mejor que GPT-6 Astra o que Claude Fable 5.1? No como afirmación universal. V4.1 Flash tiene una ventaja grande de precio y de pesos abiertos, y puntuaciones fuertes de Agent informadas por el proveedor. El propio DeepSeek dice que los modelos cerrados más grandes conservan ventaja en el razonamiento más difícil y en los casos límite. En el informe de V4.1 no hay una comparación de Astra y Fable con el mismo harness.

¿Cuántos parámetros tiene DeepSeek V4.1 Flash? El informe lista un tronco de 552B parámetros más 196B parámetros de Engram. Activa unos 8B parámetros de tronco por token de prefill y 16B por token decodificado. Decir solo «552B en total» omite Engram; decir «748B activos» también es incorrecto.

¿Cuáles son sus límites de contexto y de salida? Los límites oficiales son un millón de tokens de contexto y hasta 384K tokens de salida. Las incrustaciones de imagen, el texto, el historial de herramientas y el razonamiento consumen, todos, los presupuestos que les tocan.

¿Por qué se llama Flash? El diseño se centra en bajar el coste de servicio: activación asimétrica de prefill y de decodificación, atención dispersa comprimida, KV global en FP4, reproducción persistente acotada y decodificación especulativa. «Flash» no promete la latencia más baja para cada prompt ni para cada estado de la cola.

¿Dura la caché pública 72 horas? No lo suponga. El informe técnico describe un diseño de despliegue con persistencia del KV global de al menos 72 horas. La guía de la API pública llama a la caché de mejor esfuerzo y dice que las entradas en general se borran al cabo de horas o días. La facturación debería usar los campos observados de acierto y de fallo.

¿Es la API Responses un recambio directo de Responses de OpenAI? Acepta una forma conocida, pero no tiene estado e ignora varios campos de OpenAI y varias herramientas alojadas. Pruebe el contrato preciso de capacidad que usted necesite.

¿Puede generar imágenes? Entiende la entrada de imagen y devuelve texto. No es un modelo de generación de imágenes.

¿Puedo llamar hoy a V4.1 Flash a través de Modelflare? Sí. Utilice deepseek-v4.1-flash-0910 en el grupo deepseek-stable, con Chat Completions o Responses. Este es el ID con sello de publicación de Modelflare; el alias de primera parte deepseek-flash es un contrato de proveedor distinto.

Fuentes, método y registro de actualización

Este artículo da prioridad a las fuentes de primera parte y separa los hechos documentados, las evaluaciones que informa DeepSeek, los ejemplos calculados y el estado observado del catálogo de Modelflare. No se ejecutó un banco de pruebas independiente del modelo. La cuenta del coste se conserva en el artefacto fuente que acompaña al texto, y cada escenario declara su vector de tokens y lo que excluye. La portada, sin palabras, es una ilustración editorial generada por IA, en el estilo visual que Modelflare ya usa.

Referencias primarias: publicación de DeepSeek V4.1 Flash, informe técnico, ficha del modelo, precios, pensamiento, Responses, compatibilidad con Anthropic, visión, caché de contexto, comparación de modelos de OpenAI, precios de Anthropic y el catálogo público de Modelflare.

Actualización del 2026-09-10: revisión del día de la primera publicación. Registra el ID de modelo de primera parte, el precio vigente de punta y de valle, el aviso de migración de alias del 14 de septiembre, los límites actuales de la API, la arquitectura del informe técnico y los datos de banco de pruebas. Una actualización posterior del mismo día añade el lanzamiento confirmado en Modelflare bajo deepseek-v4.1-flash-0910, los precios en vivo de la pasarela y los costes de pasarela ya calculados. Vuelva a comprobar los hechos que pueden cambiar antes de llevarlo a la práctica.