DeepSeek V4.1 Flash em profundidade: arquitetura, preços na Modelflare e rivais
Uma análise apoiada nas fontes sobre o DeepSeek V4.1 Flash: arquitetura, contexto de 1M, saída de 384K, benchmarks de Agent, limites da API, comparação com a OpenAI e a Anthropic, e a disponibilidade e os preços atuais na Modelflare.

O DeepSeek V4.1 Flash é um modelo multimodal, de pesos abertos e de baixo custo, feito para ciclos longos de Agent. Lançado a 10 de setembro de 2026, junta uma janela de contexto de um milhão de tokens, até 384K tokens de saída, uma API oficial invulgarmente barata e uma arquitetura que reduz o processamento do prompt e a pressão da cache de KV. A vantagem mais clara não é ganhar todos os benchmarks. É a quantidade de trabalho de Agent em contexto longo que consegue tentar por dólar, mantendo-se competitivo em avaliações de programação, terminal, automação e uso de ferramentas.
Essa conclusão precisa de limites. Os números de benchmark abaixo foram publicados pela DeepSeek, não reproduzidos de forma independente pela Modelflare. O próprio relatório da DeepSeek diz que o modelo ainda fica atrás dos maiores sistemas fechados nos raciocínios mais difíceis e nos casos-limite. O ID correto do modelo na API de primeira parte é deepseek-flash. O DeepSeek V4.1 Flash já está em linha na Modelflare sob o ID de modelo versionado deepseek-v4.1-flash-0910, com Chat Completions e Responses no grupo público deepseek-stable.
Última verificação: 2026-09-10 UTC. Preços, aliases e o estado do catálogo podem mudar.
A resposta direta: o que é o DeepSeek V4.1 Flash
O anúncio de lançamento da DeepSeek define o DeepSeek V4.1 Flash como o substituto de produção da linha Flash anterior. O endpoint oficial aceita deepseek-flash. Os nomes antigos deepseek-v4-flash e deepseek-v4-flash-vision-exp são aceites temporariamente pela DeepSeek e encaminhados para o V4.1 Flash às tarifas Flash. A partir de 14 de setembro de 2026 às 04:00 UTC, a DeepSeek diz que os pedidos de deepseek-v4-pro também passam a ser encaminhados para o V4.1 Flash até um lançamento posterior do V4.1 Pro.
Esta política de migração pertence à API da própria DeepSeek. A Modelflare usa o ID com data de lançamento explícita deepseek-v4.1-flash-0910, em vez de reetiquetar em silêncio a entrada anterior deepseek-v4-flash. O operador da Modelflare confirmou o lançamento, e o modelo apareceu nos catálogos de preços público e de origem às 2026-09-10 15:21 UTC. Os clientes devem usar o ID exato mostrado pelo respetivo fornecedor, em vez de assumir que um alias de primeira parte funciona sem alteração em todos os gateways.
A identidade prática do modelo tem cinco partes: entrada multimodal de imagem e texto; saída de texto; um backbone MoE de 552B parâmetros; uma memória Engram adicional de 196B parâmetros; e ativação assimétrica de 8B parâmetros por token de prompt contra 16B por token descodificado. O último ponto é central: cargas de Agent pesadas em entrada devem gastar menos computação no pré-preenchimento repetido do que um desenho simétrico, só de descodificador, de escala parecida.
Especificações num relance
Os valores seguintes vêm do lançamento oficial, da ficha do modelo e do relatório técnico. «Parâmetros do backbone» e «parâmetros do Engram» descrevem armazéns diferentes; nenhum dos números é igual à computação ativa por token.
| Item | DeepSeek V4.1 Flash |
|---|---|
| ID oficial da API | deepseek-flash |
| ID do modelo na Modelflare | deepseek-v4.1-flash-0910 |
| Classe do modelo | Transformer multimodal de mistura de especialistas |
| Entrada / saída | Texto e imagens à entrada; texto à saída |
| Disposição do Transformer | 40 camadas: codificador causal de 20 camadas + descodificador de 20 camadas |
| Armazéns de parâmetros | backbone de 552B + memória condicional Engram de 196B |
| Parâmetros ativos | 8B por token de pré-preenchimento; 16B por token de descodificação |
| Contexto / saída máxima | 1M / 384K tokens |
| Pré-treino | 45T tokens de corpus multimodal; razão 7:1 de tokens só de texto para multimodais |
| Desenho principal de atenção/cache | CED + CSA2 + KV global em FP4; KV local de SWA em FP8 |
| Pegada de KV global | 890 bytes por token, segundo a DeepSeek |
| Predefinições públicas de raciocínio | low = 50, high = 75, max = 100 na escala interna de effort |
| Limite oficial de concorrência da API | 2,500 pedidos concorrentes |
| Licença | licença MIT do checkpoint |
O teto de saída de 384K é três vezes o máximo de 128K publicado para os modelos de comparação atuais da OpenAI e da Anthropic neste artigo. É um limite, não uma recomendação: uma saída muito longa aumenta a latência, o custo e a superfície para deriva. Para Agents longos, a pergunta mais útil é se o modelo consegue reter os requisitos e passar verificações reais de aceitação depois das chamadas de ferramentas.
Porque a arquitetura serve ciclos longos de Agent
Um Agent que usa ferramentas acrescenta, vezes sem conta, observações, resultados de comandos e edições à sua história. Cada volta nova pode exigir pré-preenchimento do prompt, atenção sobre um contexto que cresce, armazenamento de KV e saída nova. O DeepSeek V4.1 Flash ataca cada custo à parte, em vez de se apoiar num único modelo mais pequeno.
| Custo do Agent | Mecanismo do V4.1 Flash | Efeito pretendido |
|---|---|---|
| Voltar a processar prompts longos | Codificador-Descodificador Causal (CED) | Quase reduz a metade o trabalho assintótico de pré-preenchimento em sequências longas, na análise da DeepSeek |
| Manter a história global em HBM | reutilização entre camadas do CSA2 + FP4 | Reduz entradas de KV global duplicadas e os bytes por entrada |
| Persistir o estado de atenção local | SWA Bounded Replay | Reconstrói uma janela local limitada, em vez de guardar a cache local completa de cada camada |
| Recordar padrões estáveis de tokens | Engram | Move a memória condicional de n-gramas para tabelas de acesso esparso |
| Produzir tokens | descodificação especulativa DSpark | Rascunha várias posições candidatas e escolhe um comprimento de verificação com base na confiança e na carga do sistema |
| Tratar imagens | DeepSeek-ViT + projetor | Converte entradas visuais em embeddings processados com texto desde o pré-treino |
Estes mecanismos melhoram sobretudo o custo de servir e o débito de tokens. Não provam, por si, um raciocínio melhor. A qualidade do modelo também depende dos dados, do pós-treino, do harness do Agent e de quanto effort de inferência se compra.
CED: corte o processamento do prompt antes de tocar na cache
O relatório técnico divide 40 camadas de Transformer num codificador causal de 20 camadas e num descodificador de 20 camadas. As duas primeiras camadas usam só uma janela deslizante de 128 tokens. As restantes combinam atenção de janela deslizante local com contexto global comprimido.
Na atenção global, o descodificador não constrói, em cada camada, uma história de KV completa e independente. As chaves e os valores globais são projetados a partir do estado oculto final do codificador. Os estados de janela deslizante local continuam específicos da camada. A DeepSeek estima a complexidade do pré-preenchimento de sequências longas em cerca de metade do caminho correspondente por todas as camadas: o termo dominante muda de processar cada token por todas as L camadas para processar o contexto global por cerca de L/2, mais o trabalho limitado da janela local.
Isso explica a divisão de ativação 8B/16B. Os tokens do prompt ativam cerca de 8B parâmetros de backbone durante o pré-preenchimento; os tokens acabados de gerar ativam cerca de 16B durante a descodificação. Cargas com documentos enormes e respostas curtas beneficiam mais do que cargas dominadas por centenas de milhares de tokens gerados. O CED reduz a primeira metade dessa conta; não torna a descodificação gratuita.
CSA2, FP4 e SWA Bounded Replay: a história da memória
A Atenção Esparsa Comprimida 2 comprime a cache ao longo das dimensões de sequência, camada e precisão. Cada camada CSA2 é atribuída de forma estática a um de três modos. Full calcula o KV principal, as chaves do indexador e posições Top-K novas. Reindex reutiliza o KV principal e as chaves do indexador, mas volta a percorrê-las com a sua própria query. Reuse reutiliza o KV partilhado e uma seleção esparsa anterior. Cada camada continua a ter a sua própria query e o KV de janela deslizante local.
A primeira camada Full do descodificador seleciona entradas Top-512 e constrói um conjunto de candidatos; as camadas Reindex posteriores escolhem as suas posições Top-512 a partir desse conjunto reduzido. O KV global principal usa uma representação E2M1 de cerca de quatro bits, com uma escala E4M3 por 16 canais. A DeepSeek mantém FP8 para a cache SWA local, mais sensível à quantização.
| Camada de cache | Precisão / duração | Resultado reportado | O que não garante |
|---|---|---|---|
| KV global em tempo de execução | FP4, residente em HBM | 890 bytes/token; cerca de 1/4 do V4 Flash e 437× mais pequeno do que o V1 | Seleção esparsa perfeita em todos os casos-limite |
| KV local de SWA em tempo de execução | FP8 | Preserva a janela local da camada, de 128 tokens | Memória desprezável com concorrência arbitrária |
| KV global persistente | Memória de anfitrião ou SSD no desenho de implantação da DeepSeek | Estado global reutilizável e de vida longa | Um período fixo de retenção na API pública |
| Estado local de SWA persistente | Reconstruído com Bounded Replay | Cerca de 1/8 da pegada total de cache persistente do V4 Flash, com igual comprimento de sequência | Repetição exata de cada estado local descartado |
O relatório diz que a implantação mantém o KV persistente global durante pelo menos 72 horas e usa um conjunto SWA distribuído e de vida curta. O guia público de cache de contexto descreve a criação da cache como automática e de melhor esforço, diz que a construção pode levar segundos, e diz que as entradas são em geral apagadas ao fim de horas ou dias. Os clientes de produção devem tratar o contrato público como vinculativo: inspecionar os campos de tokens de acerto e de falha, em vez de orçamentar em torno de um acerto garantido de 72 horas.
A própria DeepSeek identifica duas fronteiras de robustez: o CSA2 pode selecionar as posições esparsas erradas, e o Bounded Replay aproxima o estado local descartado. Os testes não encontraram degradação sistemática nas configurações avaliadas, mas contextos extremos e fronteiras de retoma da cache continuam a ser áreas para mais testes de esforço.
Engram, DSpark e o caminho multimodal
O Engram separa parte da memorização da computação densa do modelo. O V4.1 Flash atribui 196B parâmetros a dois módulos de memória condicional nas camadas de índice zero 1 e 14. Cada um usa n-gramas de tokens de comprimentos dois, três e quatro, oito cabeças de hash, gating consciente do contexto e pré-busca da memória de anfitrião por RDMA. São parâmetros armazenados, não outros 196B parâmetros ativados em cada token.
O DSpark é um descodificador especulativo treinado à parte. Três blocos de Transformer olham através de uma janela deslizante de 128 tokens e propõem cinco posições em paralelo. Uma cabeça leve de dependência relaciona os tokens de rascunho; uma cabeça de confiança estima quanto do rascunho sobrevive à verificação. O escalonador usa essas probabilidades e o débito medido do motor para escolher um comprimento de verificação sob a carga atual. Isto pode melhorar o débito de tokens do sistema sem mudar o papel de verificação final do backbone.
O caminho visual usa um DeepSeek-ViT treinado à parte, com codificação rotativa de posição em 2D. Um passo de pixel-unshuffle 3×3 reduz nove vezes a contagem de tokens visuais antes da projeção para o modelo de linguagem. O codificador de visão tem 32 camadas, tamanho oculto de 1,024 e 16 cabeças de atenção na configuração reportada. A fase de treino autorregressivo usa imagens escaladas entre 544×544 e 1,344×1,344, depois de uma fase contrastiva anterior sobre cerca de 47B pares imagem-texto.
Treino e pós-treino
A DeepSeek reporta 45T tokens de pré-treino, com dados multimodais integrados no treino do modelo de linguagem. Os pipelines só de texto e os multimodais fundem-se numa razão de tokens de 7:1, depois da substituição de sobreposição e da desduplicação. A atenção esparsa é treinada de raiz com comprimento de sequência de 64K, sem aquecimento de atenção densa; o contexto estende-se a 1M no ponto dos 34T tokens.
| Fase | Detalhe publicado | Porque importa |
|---|---|---|
| Pré-treino contrastivo de visão | Cerca de 47B pares imagem-texto, fase de baixa resolução | Aprende representações visuais largas antes da integração com a linguagem |
| Afinação autorregressiva de visão | 236B tokens com legendas, gráficos, OCR e dados relacionados | Acrescenta compreensão visual e documental de grão fino |
| Pré-treino do LLM | 45T tokens; dados multimodais incluídos desde o início | Evita tratar a visão apenas como um adaptador tardio de prompt |
| Treino de contexto | Atenção esparsa desde 64K; estendida a 1M aos 34T tokens | Treina o padrão de atenção que se implanta, em vez de o converter só depois do treino |
| Pós-treino | SFT, aprendizagem por reforço e destilação on-policy | Alinha raciocínio, ferramentas e comportamento de Agent |
O relatório não reivindica um algoritmo novo de pós-treino. Atribui os ganhos à criação sintética de tarefas e de ambientes, a uma filtragem de dados melhor, a recompensas verificáveis e à escala da arquitetura e dos dados. Isto importa ao comparar afirmações de «arquitetura do modelo»: o CED e o CSA2 explicam a eficiência, enquanto o desempenho de Agent observado é o produto de toda a pilha de treino e de scaffold.
Effort de raciocínio: a qualidade tem uma conta de tokens à vista
A DeepSeek expõe um contínuo interno de effort de 1 a 100 e mapeia as predefinições públicas da API low, high e max para 50, 75 e 100. As entradas de compatibilidade mapeiam minimal e low para low; medium, high e xhigh para high; e max ou ultra para max. O pensamento tem high como predefinição.
No varrimento reportado pela DeepSeek, subir o effort de 25 para 100 aumentou o resultado médio em oito avaliações de raciocínio de 67.1% para 76.3%, o DeepSWE de 66.0% para 74.2%, e o Terminal-Bench 2.1 de 82.4% para 90.6%. Os tokens de saída cresceram cerca de 2.5×. O intervalo 60–80 captou a maior parte da qualidade com menos de metade do orçamento máximo de tokens; o movimento final até 100 alongou as trajetórias de Agent em 1.6–1.8×, para ganhos mais pequenos.
Este é um dos controlos mais úteis do modelo. Use low para classificação, extração e exploração que se possa repetir; high para programação e investigação normais; reserve max para tarefas em que outra tentativa, ou um caso-limite perdido, custa mais do que os tokens extra. Trate isto como hipóteses de partida e meça o custo por tarefa aceite.
No modo de pensamento, a temperature e as penalizações de presence e de frequency são ignoradas, e top_p tem um mínimo de 0.95. Com ferramentas, os clientes têm de devolver o reasoning_content completo da mensagem do assistente, juntamente com os resultados das ferramentas; omiti-lo provoca uma resposta 400. Essa regra de estado importa mais do que copiar um conjunto familiar de parâmetros da OpenAI.
Comparação de benchmarks com a OpenAI e a Anthropic
Esta tabela reproduz resultados selecionados da Tabela 3 do relatório técnico da DeepSeek. Todos os modelos aparecem na definição Max do relatório. A DeepSeek usou scaffolds exigidos ou oficiais diferentes em algumas avaliações, um contexto de DeepSeek Harness de 1M para programação, e um contexto de Claude Code de 512K para tarefas de Agent visual. Os números são evidência reportada pelo fornecedor, não um teste independente frente a frente, nem um SLA de produção.
| Avaliação | V4 Flash | V4 Pro | V4.1 Flash | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|---|
| GPQA Diamond, Pass@1 | 89.9 | 92.4 | 90.9 | 94.1 | 93.4 |
| Terminal-Bench 2.1, Pass@1 | 82.7 | 87.9 | 90.6 | 88.8 | 89.1 |
| Terminal-Bench 3.0, Pass@1 | 7.6 | 11.8 | 30.0 | 34.4 | 43.3 |
| Terminal-Bench 4.0, Pass@1 | 7.0 | 12.4 | 31.2 | 39.9 | 51.8 |
| DeepSWE v1.1, resolved | 54.4 | 62.7 | 74.2 | 73.0 | 74.0 |
| CyberGym, Pass@1 | 76.7 | 83.3 | 88.1 | 84.5 | — |
| HLE with tools, Pass@1 | 51.5 | 60.0 | 63.9 | — | 63.6 |
| AutomationBench, Pass@1 | 37.7 | 43.2 | 54.8 | 45.8 | 50.3 |
| Agents' Last Exam, Pass@1 | 25.2 | 25.7 | 31.8 | 26.7 | 28.6 |
| Chartography with tools, Pass@1 | — | — | 78.9 | 79.9 | 84.0 |
A leitura mais forte é específica. O V4.1 Flash dá um passo grande sobre o V4 Flash em tarefas de Agent e é competitivo com o GPT-5.6 Sol e o Claude Opus 5 no DeepSWE, no Terminal-Bench 2.1, na automação e no HLE com ferramentas. Não lidera o GPQA, as versões posteriores do Terminal-Bench nem o Chartography. O próprio relatório avisa que a quase paridade em tarefas comuns não significa paridade de fronteira nos raciocínios mais difíceis e nos casos-limite.
O GPT-6 Astra e o Claude Fable 5.1 ficam de fora desta tabela de pontuações porque o relatório da DeepSeek não publica, para eles, os mesmos dados de comparação linha a linha. Acrescentar pontuações de páginas separadas de fornecedores criaria um harness comum que não existe. As equipas devem avaliar todos os candidatos nas mesmas tarefas de repositório, com as mesmas ferramentas, tempos limite, política de rede e verificações de aceitação.
A compatibilidade de API é larga, mas não é idêntica
O serviço oficial expõe OpenAI Chat Completions, OpenAI Responses e uma API compatível com a Anthropic. Essa largura reduz o trabalho de migração, mas a compatibilidade descreve a forma do pedido, não uma semântica de ciclo de vida idêntica.
| Superfície | Comportamento do DeepSeek V4.1 Flash | Consequência na migração |
|---|---|---|
| Chat Completions | Streaming, saída JSON, chamadas de função; prefixo/FIM no modo sem pensamento | Os clientes OpenAI existentes são o ponto de partida mais simples |
| Responses | Sem estado; funções e imagens suportadas | Persista a conversa completa por sua conta |
| Campos de estado do Responses | previous_response_id, conversas, store, background e a gestão de contexto não são suportados ou são ignorados |
Uma resposta 200 não prova que essas funcionalidades tenham feito efeito |
| Ferramentas alojadas | Pesquisa na web, pesquisa de ficheiros, interpretador de código, computer use e os componentes integrados de MCP são ignorados; o suporte a ferramentas personalizadas é limitado | Execute as ferramentas na aplicação e teste cada campo pedido |
| Resumos de raciocínio | Summary e conteúdo de raciocínio cifrado não são suportados | Não dependa de campos de passagem de raciocínio ao estilo da OpenAI |
| Formato Anthropic | A forma de mensagem da Anthropic é aceite | Preserve as regras de raciocínio e de estado das ferramentas da DeepSeek, em vez de assumir a semântica do Claude |
| Visão | As imagens são aceites na entrada do utilizador e nas saídas das ferramentas | Valide o tamanho da carga, o modo de detail e a contagem de imagens |
O guia de Responses da DeepSeek também lista campos ignorados, como metadata, modelos de prompt, truncation, service tier, safety identifier, chave e retenção de cache de prompt, e opções de stream. Ignorar em silêncio é um risco de compatibilidade: aceitar o schema pode esconder comportamento em falta. Construa um pedido de conformidade para cada funcionalidade de que a aplicação depende. O guia da API compatível com a OpenAI explica porque a forma do endpoint e a capacidade precisam de verificações separadas.
Os modelos atuais da OpenAI oferecem um ecossistema nativo de ferramentas do Responses mais largo e funcionalidades de estado gerido. A API nativa da Anthropic tem o seu próprio contrato maduro de bloco de pensamento e de uso de ferramentas. A vantagem da DeepSeek é que um só modelo aceita os três dialetos comuns; o custo é que a interseção é mais pequena do que a superfície nativa completa de qualquer dos rivais.
Limites de visão e economia das imagens
O guia oficial de visão suporta JPEG, PNG, GIF e WebP por base64, URLs externas ou a Files API. As imagens são redimensionadas automaticamente para cerca de 1,300×1,300 e usam, no máximo, 1,024 tokens de entrada cada. O detail low usa uma vista de 512×512; high e original retêm mais detalhe; auto comporta-se hoje como original.
| Limite | Valor oficial |
|---|---|
| Corpo do pedido | 48 MiB |
| Imagem em linha ou obtida no exterior | 32 MiB cada |
| Imagem referida por ID de ficheiro | 64 MiB cada |
| Imagens por pedido | 600 |
| Bytes de imagem combinados | 64 MiB sem IDs de ficheiro; 200 MiB com IDs de ficheiro |
| Aresta longa | 8,192 px; 4,096 px ao enviar 15 ou mais imagens |
| Teto de tokens visuais | 1,024 tokens por imagem depois do processamento |
No máximo de 1,024 tokens visuais, uma imagem fora de cache contribui cerca de $0.0001536 fora de pico ou $0.0003072 em pico, às tarifas de entrada publicadas, antes do texto que a acompanha e da saída. Esta conta serve para estimativas de escala, mas o redimensionamento da imagem, o comportamento da cache e o uso real de tokens visuais podem mudar a cobrança. Mais imagens também consomem contexto que, de outro modo, poderia guardar texto ou história de ferramentas.
O V4.1 Flash serve para capturas de ecrã de documentos, gráficos, OCR e observações de Agent visual. Não é um modelo de geração de imagens. Para imagens geradas, use um modelo e um endpoint feitos para devolver pixéis, e não texto.
Comparação dos preços oficiais da API
A página de preços da DeepSeek introduziu as tarifas seguintes às 04:00 UTC de 10 de setembro. As janelas de pico em dias úteis são 01:00–04:00 e 06:00–10:00 UTC; os restantes horários de dias úteis e o fim de semana usam tarifas fora de pico. A cache de contexto da DeepSeek é automática, por isso «entrada em cache» quer dizer um acerto de cache reportado, não uma opção de cache que force esse acerto.
As tarifas da OpenAI vêm da comparação atual de modelos; as tarifas da Anthropic vêm da página de preços. Os valores são USD por um milhão de tokens. A Anthropic também cobra escritas de cache; ficam de fora aqui porque a tabela compara só entrada nova, leituras de cache e saída.
| Modelo | Contexto / saída máxima | Entrada nova ou em falha | Entrada em cache ou lida | Saída |
|---|---|---|---|---|
| DeepSeek V4.1 Flash, fora de pico | 1M / 384K | $0.15 | $0.003 | $0.60 |
| DeepSeek V4.1 Flash, pico | 1M / 384K | $0.30 | $0.006 | $1.20 |
| DeepSeek V4.1 Flash na Modelflare | limite do modelo 1M / 384K | $0.193548 | $0.003871 | $0.774194 |
| GPT-5.6 Luna | 1.05M / 128K | $0.20 | $0.02 | $1.20 |
| GPT-5.6 Terra | 1.05M / 128K | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Sol | 1.05M / 128K | $4.00 | $0.40 | $20.00 |
| GPT-6 Astra | 1.05M / 128K | $10.00 | $1.00 | $50.00 |
| Claude Sonnet 5 | 1M / 128K | $2.00 | $0.20 | $10.00 |
| Claude Opus 5 | 1M / 128K | $5.00 | $0.50 | $25.00 |
| Claude Fable 5.1 | 1M / 128K | $10.00 | $0.25 | $50.00 |
O preço não é valor por si. Tokenizadores diferentes podem faturar contagens de tokens diferentes para o mesmo texto; a Anthropic nota que uma tokenização mais recente pode produzir cerca de 30% mais tokens em algumas cargas. Os modelos também podem exigir comprimentos de saída, repetições e reparações humanas diferentes. Compare o custo por tarefa aceite, não só a linha com o número de entrada mais pequeno.
O catálogo público atual da Modelflare expõe uma tarifa entre as duas faixas horárias da DeepSeek: é cerca de 64.5% da tarifa de pico de primeira parte, ou 35.5% mais baixa nas janelas de pico, e fica cerca de 29.0% acima da tarifa fora de pico da DeepSeek. A tarifa de gateway listada não tem, portanto, ajuste de faixa horária hoje; cargas flexíveis que consigam usar de forma fiável a janela fora de pico da DeepSeek ainda podem pagar menos pela API de primeira parte.
A OpenAI aplica tarifas mais altas quando o contexto de entrada passa de 272K: o pedido inteiro usa preços de entrada e de entrada em cache a 2× e preços de saída a 1.5×. Esta fronteira importa no cenário de contexto longo abaixo. A DeepSeek usa janelas de tempo; os modelos de um milhão de tokens listados pela Anthropic não usam a mesma fronteira de 272K na tabela de preços citada.
Dois cenários de custo que se podem refazer
O cenário A é um pedido com 100K de entrada sem cache e 10K de saída. A fórmula é 0.1 × input rate + 0.01 × output rate. Assume que não há entrada em cache, ferramentas, repetições, impostos nem extras próprios do fornecedor.
| Modelo | Custo do cenário A |
|---|---|
| DeepSeek V4.1 Flash, fora de pico | $0.021 |
| DeepSeek V4.1 Flash na Modelflare | $0.0271 |
| GPT-5.6 Luna | $0.032 |
| DeepSeek V4.1 Flash, pico | $0.042 |
| Claude Sonnet 5 | $0.300 |
| GPT-5.6 Terra | $0.320 |
| GPT-5.6 Sol | $0.600 |
| Claude Opus 5 | $0.750 |
| GPT-6 Astra / Claude Fable 5.1 | $1.500 |
O cenário B é o custo marginal de um pedido com cache quente, com 900K de entrada em cache, 100K de entrada nova e 20K de saída. Exclui de propósito o pedido anterior que estabeleceu a cache. Fórmula: 0.9 × cache-read rate + 0.1 × input rate + 0.02 × output rate. Os modificadores de contexto longo da OpenAI, aplicados ao pedido inteiro, entram porque o contexto de entrada totaliza um milhão de tokens.
| Modelo | Custo marginal do cenário B |
|---|---|
| DeepSeek V4.1 Flash, fora de pico | $0.0297 |
| DeepSeek V4.1 Flash na Modelflare | $0.0383 |
| DeepSeek V4.1 Flash, pico | $0.0594 |
| GPT-5.6 Luna | $0.1120 |
| Claude Sonnet 5 | $0.5800 |
| GPT-5.6 Terra | $1.1200 |
| Claude Opus 5 | $1.4500 |
| GPT-5.6 Sol | $2.1200 |
| Claude Fable 5.1 | $2.2250 |
| GPT-6 Astra | $5.3000 |
A comparação mantém iguais as quantidades de tokens; não afirma qualidade igual. A cache da DeepSeek é de melhor esforço, enquanto a criação de cache da Anthropic tem preço de escrita e duração próprios. Um teste justo de carga regista os tokens de acerto e de falha de cache, todas as tentativas, a saída total incluindo o raciocínio faturável, o tempo decorrido, a taxa de aceitação e os minutos de correção humana. O guia de rastreio de custos dá o quadro de contas.
Pesos abertos não tornam o autoalojamento pequeno
O lançamento no Hugging Face tem licença MIT e documenta caminhos de serviço em vLLM e SGLang. No instantâneo verificado para este artigo, o repositório continha 48 fragmentos safetensor e cerca de 510.3 GB de ficheiros Git-LFS no commit dba1be0a40aa45a94ad051997016db3960a90277. Essa contagem de bytes é um artefacto de transferência, não RAM de GPU medida.
O sistema continua a ter um backbone de 552B, memória Engram de 196B endereçada no anfitrião, encaminhamento de especialistas, caminhos de cache FP4/FP8, pré-busca por RDMA e armazenamento de KV persistente. O lançamento da DeepSeek convida a contactar a empresa as equipas que planeiam uma implantação em grande escala com 2,000 GPUs mais um cluster de armazenamento. Esse exemplo sinaliza a escala do sistema de serviço completo; não é um mínimo declarado para cada implantação. Implantações de investigação mais pequenas podem usar quantização ou outro paralelismo, mas não se devem inferir da economia da API do fornecedor.
Os pesos abertos dão às equipas acesso ao checkpoint, possibilidade de inspeção e controlo da política de implantação. Não reproduzem automaticamente a fusão de kernels da DeepSeek, a hierarquia de cache, o escalonamento do DSpark, o batching nem a latência da API pública. Compare um plano de autoalojamento com o débito medido, a recuperação de falhas, a capacidade inativa, a largura de banda de armazenamento e o trabalho de operações.
O DeepSeek V4.1 Flash na Modelflare
O DeepSeek V4.1 Flash está em linha na Modelflare. O lançamento confirmado pelo operador vê-se, de forma independente, no catálogo público de preços da Modelflare e no catálogo de origem. Às 2026-09-10 15:21 UTC, ambos expunham o novo registo deepseek-v4.1-flash-0910; a configuração de produção mostrava uma ability deepseek-stable ativada e uma rota ativada a anunciar o mesmo modelo.
| Item da Modelflare | Valor em linha |
|---|---|
| ID de modelo a enviar | deepseek-v4.1-flash-0910 |
| Disponibilidade | Em linha no catálogo público e no grupo de encaminhamento ativado |
| Grupo público | deepseek-stable |
| Preço de entrada | $0.193548 / 1M tokens |
| Preço de entrada em cache | $0.003871 / 1M tokens |
| Preço de saída | $0.774194 / 1M tokens |
| Tipos de endpoint | /v1/chat/completions e /v1/responses |
Os preços derivam do coeficiente base de entrada de $0.322580645 da entrada em linha, da razão 0.6 do grupo público, da razão de cache 0.02 e da razão de conclusão 4×. Para as duas cargas calculadas acima, os custos na Modelflare são cerca de $0.0271 e $0.0383, respetivamente. Use a página de preços do DeepSeek V4.1 Flash em linha para o ID de modelo e a tarifa atuais.
Os níveis de evidência continuam a importar. O catálogo público e a rota de produção ativada estabelecem a disponibilidade do produto, e o operador confirmou o lançamento de forma explícita. Às 15:30 UTC, os registos de produção continham seis chamadas Chat Completions concluídas sob o ID exato do modelo novo, no total de 216 tokens de prompt e 173 tokens de conclusão. Isso verifica o despacho autenticado de Chat Completions e a saída faturável. Continua a ser uma amostra de lançamento pequena demais para medir latência ou disponibilidade, e não prova por si o comportamento de Responses ou multimodal nesta rota. As equipas devem fazer um pedido pequeno de aceitação no endpoint exato antes de passar trabalho de produção.
Onde o DeepSeek V4.1 Flash tem uma vantagem real
O modelo tem uma vantagem coerente quando importam ao mesmo tempo entradas longas, voltas frequentes de ferramentas e o orçamento. A arquitetura reduz a pressão de pré-preenchimento e de cache; o preço da API transforma essas poupanças numa tarifa pública invulgarmente baixa; o teto de saída de 384K deixa folga para patches ou relatórios longos; e o checkpoint mantém aberto um caminho de autoalojamento.
| Carga | Porque o V4.1 Flash é um candidato forte | O que medir |
|---|---|---|
| Agents de repositório | Resultados fortes de DeepSWE e de terminal reportados por quem publica, a tarifas de token baixas | Alterações aceites, taxa de testes passados, repetições e tempo de reparação |
| Síntese longa de investigação | Entrada de 1M, acertos de cache baratos e saída de 384K | Correção das citações, retenção dos requisitos e saída total |
| Agents de documentos visuais | Imagens nativas, treino de OCR e de gráficos, e APIs de Agent comuns | Exatidão dos campos, sensibilidade ao recorte e ao detail, e uso de tokens visuais |
| Automação de volume alto | Preços baixos de pico e fora de pico; teto de concorrência de 2,500 pedidos | Tempo de fila, taxa de 429, falhas de ferramentas e custo por sucesso |
| Implantação controlada | Checkpoint MIT e caminhos documentados de vLLM e SGLang | Utilização de hardware, largura de banda de cache e de armazenamento, e custo operacional |
A afirmação de produção mais forte é, portanto, Agent de contexto longo a custo eficiente, e não «o melhor modelo no geral». Se o modelo completa uma tarefa real numa execução aceite em que um modelo pequeno mais barato precisa de várias reparações, o V4.1 ganha no resultado. Se um modelo fechado de fronteira evita uma falha cara, o preço de token mais alto ainda pode ser económico.
Onde a OpenAI ou a Anthropic continua a escolha mais segura
Escolha um modelo da OpenAI quando a aplicação depende do ecossistema completo do Responses, de estado gerido, de ferramentas alojadas, ou de um contrato próprio da OpenAI que a DeepSeek ignora. O GPT-5.6 Luna é um concorrente de preço particularmente próximo para cargas mais curtas e sem cache; Terra, Sol e Astra trocam preços de tabela muito mais altos por patamares de capacidade diferentes e por funcionalidades nativas da plataforma.
Escolha um modelo da Anthropic quando o contrato nativo de ferramentas e de pensamento do Claude, os controlos de cache, ou o desempenho medido no trabalho de Agent mais difícil importam mais do que o preço de tabela do token. Na própria tabela da DeepSeek, o Claude Opus 5 lidera o Terminal-Bench 3/4 e o Chartography; o Claude Fable 5.1 está posicionado para o trabalho de horizonte mais longo e mais exigente, embora seja substancialmente mais caro por token novo e por token de saída.
Para ações críticas de segurança, ou caras, a escolha de rota deve assentar em modos de falha já avaliados e em fronteiras de permissão, não na marca nem em médias de benchmark. Use o guia de encaminhamento para separar trabalho que se pode repetir, fallbacks e ações com efeitos laterais.
Lista de verificação para a implantação
- Use
deepseek-flashna API de primeira parte e registe à parte qualquer mapeamento próprio do gateway. - Comece no effort high e depois meça low e max no mesmo conjunto de tarefas aceites; não trate nomes iguais entre fornecedores como a mesma computação.
- Quando há ferramentas no modo de pensamento, devolva o
reasoning_contentcompleto, exatamente como exigido. - Audite cada campo do Responses de que depende; parâmetros rejeitados e parâmetros ignorados em silêncio pedem tratamento diferente.
- Registe tokens de acerto e de falha de cache, tokens de saída e de raciocínio, repetições, latência e a aceitação final.
- Desenhe a economia da cache em torno dos acertos observados, não de uma retenção fixa assumida.
- Faça cumprir os limites de bytes, contagem, dimensão e detail das imagens antes de enviar pedidos multimodais.
- Mantenha a autorização do lado da aplicação, a idempotência das ferramentas e a validação da saída independentes da qualidade do modelo.
- Volte a verificar os preços por janela horária, os aliases de modelo e os limites de concorrência antes do lançamento.
- Faça um pedido autenticado real na rota exata; um catálogo de modelos, ou um HTTP 200, não prova capacidade por si.
Perguntas frequentes
O DeepSeek V4.1 Flash é melhor do que o GPT-6 Astra ou o Claude Fable 5.1? Não como afirmação universal. O V4.1 Flash tem uma grande vantagem de preço e de pesos abertos, e pontuações fortes de Agent reportadas pelo fornecedor. A própria DeepSeek diz que os maiores modelos fechados conservam vantagem nos raciocínios mais difíceis e nos casos-limite. O relatório V4.1 não traz uma comparação Astra/Fable no mesmo harness.
Quantos parâmetros tem o DeepSeek V4.1 Flash? O relatório lista um backbone de 552B parâmetros mais 196B parâmetros de Engram. Ativa cerca de 8B parâmetros de backbone por token de pré-preenchimento e 16B por token descodificado. Dizer só «552B no total» omite o Engram; dizer «748B ativos» também está errado.
Quais são os limites de contexto e de saída? Os limites oficiais são um milhão de tokens de contexto e até 384K tokens de saída. Os embeddings de imagem, o texto, a história de ferramentas e o raciocínio consomem todos os orçamentos que lhes cabem.
Porque se chama Flash? O desenho concentra-se num custo de serviço mais baixo: ativação assimétrica de pré-preenchimento e de descodificação, atenção esparsa comprimida, KV global em FP4, repetição persistente limitada e descodificação especulativa. «Flash» não promete a latência mais baixa para cada prompt ou cada estado da fila.
A cache pública dura 72 horas? Não assuma isso. O relatório técnico descreve um desenho de implantação com persistência de KV global de pelo menos 72 horas. O guia da API pública chama à cache melhor esforço e diz que as entradas são em geral apagadas ao fim de horas ou dias. A faturação deve usar os campos de acerto e de falha que se observam.
A API Responses substitui, sem alterações, o Responses da OpenAI? Aceita uma forma familiar, mas não tem estado e ignora vários campos da OpenAI e ferramentas alojadas. Teste o contrato exato de capacidade de que precisa.
Consegue gerar imagens? Percebe a entrada de imagem e devolve texto. Não é um modelo de geração de imagens.
Posso chamar hoje o V4.1 Flash através da Modelflare? Sim. Use deepseek-v4.1-flash-0910 no grupo deepseek-stable, com Chat Completions ou Responses. Este é o ID com marca de lançamento da Modelflare; o alias de primeira parte deepseek-flash é um contrato de fornecedor à parte.
Fontes, método e registo de atualizações
Este artigo dá prioridade a fontes de primeira parte e separa factos documentados, avaliações reportadas pela DeepSeek, exemplos calculados e o estado observado do catálogo da Modelflare. Não se correu nenhum benchmark independente do modelo. A matemática do custo fica preservada no artefacto de fonte que acompanha o artigo, e cada cenário declara o seu vetor de tokens e o que exclui. A capa sem palavras é uma ilustração editorial gerada por IA, no estilo visual já usado pela Modelflare.
Referências primárias: lançamento do DeepSeek V4.1 Flash, relatório técnico, ficha do modelo, preços, pensamento, Responses, compatibilidade com a Anthropic, visão, cache de contexto, comparação de modelos da OpenAI, preços da Anthropic e o catálogo público da Modelflare.
Atualização de 2026-09-10: revisão do dia da primeira publicação. Regista o ID de modelo de primeira parte, os preços de pico e fora de pico já em vigor, o aviso de migração de alias de 14 de setembro, os limites atuais da API, e a arquitetura e os dados de benchmark do relatório técnico. Uma atualização posterior, no mesmo dia, acrescenta o lançamento confirmado na Modelflare sob deepseek-v4.1-flash-0910, os preços em linha do gateway e os custos de gateway já calculados. Volte a verificar os factos que podem mudar antes de implementar.