DeepSeek V4 Pro GA: análise, benchmarks, preços da API e custos

Análise verificada do DeepSeek V4 Pro GA com benchmarks de agentes, contexto de 1M, compatibilidade de API, preços atuais e por horário, custos calculados e disponibilidade na Modelflare.

A DeepSeek lançou o DeepSeek-V4-Pro GA em 13 de agosto de 2026. A API hospedada agora identifica a versão como DeepSeek-V4-Pro-0813, enquanto o ID estável do modelo continua sendo deepseek-v4-pro. O modelo traz uma janela de contexto de um milhão de tokens, até 384.000 tokens de saída, suporte nativo à Responses API e uma nova tabela de preços que começa pouco depois do lançamento.

Nosso veredito: o V4 Pro merece uma avaliação em produção para programação difícil, trabalho em escala de repositório e agentes de longa duração. A DeepSeek relata ganhos consistentes sobre o V4 Flash em benchmarks exigentes de agentes, mas o Pro não é a opção econômica padrão para toda solicitação. Depois que a nova tabela entrar em vigor, seus preços oficiais de entrada e saída serão aproximadamente três vezes os do Flash, e o limite de concorrência por conta será cinco vezes menor.

Esta análise separa os fatos atuais da API, os resultados de benchmark publicados pela DeepSeek, nossa análise e a disponibilidade atual na Modelflare. Não reproduzimos de forma independente as pontuações da DeepSeek. Especificações e preços sujeitos a mudanças foram verificados em 14 de agosto de 2026.

Análise do DeepSeek V4 Pro: contexto de um milhão de tokens e orquestração de ferramentas

DeepSeek V4 Pro GA em resumo

Item Informação oficial atual
Data da versão GA 13 de agosto de 2026
ID estável do modelo na API deepseek-v4-pro
Versão hospedada do modelo DeepSeek-V4-Pro-0813
Janela de contexto 1.000.000 de tokens
Saída máxima 384.000 tokens
Modo de raciocínio Compatível e ativado por padrão
Esforço de raciocínio Anúncio GA: low, high e max; veja a nota de compatibilidade abaixo
Formatos oficiais da API Chat Completions, Responses API e API compatível com Anthropic Messages
Recursos documentados Saída JSON, chamadas de ferramentas, cache automático de contexto, conclusão por prefixo e FIM sem raciocínio
Concorrência oficial por conta 500 solicitações simultâneas

O limite de um milhão de tokens é um teto de capacidade, não uma garantia de qualidade. Precisão de recuperação, latência, reutilização de cache, tamanho da saída, timeouts do cliente e quantidade de contexto irrelevante ainda determinam se uma solicitação longa será útil.

O que mudou desde o preview do V4

O preview de abril apresentou a família V4 e sua arquitetura de pesos abertos. A atualização GA de agosto é uma atualização do produto hospedado com três mudanças práticas:

  • segundo a DeepSeek, o desempenho dos agentes melhorou bastante, sobretudo em tarefas de programação e automação próximas da produção;
  • a API oficial agora oferece suporte nativo ao formato OpenAI Responses e inclui compatibilidade voltada ao Codex;
  • a DeepSeek anunciou preços de pico e fora de pico para a API, válidos a partir de 16:00 UTC de 16 de agosto de 2026.

O modelo estável de solicitação continua sendo deepseek-v4-pro, portanto clientes existentes não precisam migrar o nome do modelo. A página de preços expõe a versão hospedada atual como DeepSeek-V4-Pro-0813.

Não considere automaticamente que o checkpoint de preview para download seja idêntico, bit a bit, à versão GA hospedada. O model card público do V4 ainda descreve a família de preview e não identifica o checkpoint como 0813. Implantações autohospedadas e pela API oficial precisam, portanto, de avaliações separadas.

Análise dos benchmarks: onde o Pro supera o Flash

A DeepSeek publicou os resultados abaixo para o V4 Pro GA. A coluna de comparação usa os valores da atualização V4 Flash de 31 de julho da DeepSeek, e o delta é a diferença absoluta de pontuação.

Benchmark V4 Pro GA V4 Flash 0731 Delta do Pro
Terminal Bench 2.1 87.9 82.7 +5.2
NL2Repo 61.5 54.2 +7.3
Cybergym 83.3 76.7 +6.6
DeepSWE 62.7 54.4 +8.3
Toolathlon-Verified 74.1 70.3 +3.8
Agents' Last Exam 25.7 25.2 +0.5
AutomationBench (Public) 31.8 25.1 +6.7
DSBench-FullStack 71.1 68.7 +2.4
DSBench-Hard 67.2 59.6 +7.6

A DeepSeek também informa pontuações HLE de 42.7 sem ferramentas e 60.0 com ferramentas para o V4 Pro GA.

O padrão importa mais do que uma única pontuação em destaque. Os maiores ganhos absolutos aparecem em trabalho com repositórios, tarefas difíceis de engenharia de software e automação. A diferença é muito menor no Agents' Last Exam e moderada no uso amplo de ferramentas. Isso favorece uma estratégia de roteamento: reservar o Pro para tarefas em que uma maior chance de conclusão vale mais do que a eficiência bruta de tokens e manter o Flash para classificação, resumo, triagem e subagentes mais simples em alto volume.

Esses resultados foram divulgados pelo provedor; não são um benchmark independente da Modelflare. Harnesses, permissões de ferramentas, esforço de raciocínio, configurações de amostragem, limites de tempo e regras de pontuação podem alterar materialmente os resultados. Uma decisão de produção deve repetir as mesmas tarefas seguras para a privacidade nos dois modelos e medir o custo por tarefa concluída, não apenas tokens ou posição no benchmark.

Arquitetura e a alegação de contexto de 1M

O model card público do V4 descreve a família Pro como um modelo Mixture-of-Experts com 1,6 trilhão de parâmetros totais e 49 bilhões de parâmetros ativados. Ele documenta um desenho híbrido de atenção que combina Compressed Sparse Attention e Heavily Compressed Attention, Manifold-Constrained Hyper-Connections, o otimizador Muon e pré-treinamento em mais de 32 trilhões de tokens.

A DeepSeek afirma que, com contexto de 1M tokens, o V4 Pro usa 27% dos FLOPs de inferência de token único e 10% do cache KV exigido pelo V3.2. São alegações de arquitetura do publicador do modelo; não significam que uma solicitação de um milhão de tokens será rápida, barata ou igualmente precisa em todas as posições.

Para trabalho real com contexto longo:

  • coloque instruções estáveis e material reutilizável do repositório no início para que o cache de prefixo possa ajudar;
  • acompanhe prompt_cache_hit_tokens e prompt_cache_miss_tokens em vez de presumir um acerto;
  • compacte rastros antigos de ferramentas e arquivos duplicados antes que consumam o orçamento de contexto;
  • teste a recuperação na profundidade de documento e posição de token realmente usadas pelo aplicativo;
  • reserve espaço para raciocínio, resultados das ferramentas e resposta final, em vez de preencher toda a janela com entrada.

O cache em disco da DeepSeek é automático e de melhor esforço. Ele encontra prefixos reutilizáveis, pode levar segundos para ser construído e costuma ser apagado após horas ou dias de inatividade. Uma solicitação repetida com alterações no início pode perder quase todo o benefício econômico.

Compatibilidade de API: nativo não significa idêntico

Interface Suporte oficial da DeepSeek Limite importante
Chat Completions Compatível Loops de ferramentas com raciocínio precisam preservar reasoning_content
Responses API Compatível Sem estado; vários campos da OpenAI são ignorados ou não suportados
API compatível com Anthropic Compatível Alguns campos são ignorados; conteúdo de imagem e documento não é suportado
Conclusão FIM Beta Apenas sem raciocínio e pelo endpoint beta

A camada oficial de Responses suporta texto, chamadas de função, pesquisa web no servidor e a ferramenta personalizada apply_patch usada para compatibilidade com Codex. Ela não suporta previous_response_id, conversas, respostas armazenadas, modo background, service_tier nem chaves de cache de prompt gerenciadas pela OpenAI. Campos não suportados muitas vezes são ignorados silenciosamente; por isso, HTTP 200 não comprova paridade semântica. Clientes de Responses precisam manter seu próprio histórico e inspecionar os tipos de evento, em vez de esperar o marcador [DONE] do Chat Completions.

Há outro limite importante no loop de ferramentas de Chat Completions: quando o modo de raciocínio e ferramentas são usados juntos, o reasoning_content do assistente precisa ser reenviado nas solicitações seguintes. A DeepSeek documenta um erro 400 quando esse campo se perde. Gateways e adaptadores de SDK devem ser testados com um loop completo de ferramentas em vários turnos, não com um único prompt de texto.

O anúncio GA diz que os esforços low, high e max estão disponíveis. Entretanto, o guia detalhado de raciocínio e a referência atual da API dizem que high e max são os valores efetivos, que low e medium são mapeados para high e que xhigh é mapeado para max. Até a DeepSeek alinhar esses documentos ou um teste ao vivo comprovar um comportamento low diferente, não monte um orçamento baseado numa suposta redução de custo com esforço baixo.

Preços da API oficial da DeepSeek: atuais e futuros

Todos os preços abaixo estão em USD por um milhão de tokens. Os preços fixos atuais continuam listados até a nova tabela entrar em vigor às 16:00 UTC de 16 de agosto de 2026, ou 00:00 de 17 de agosto no horário de Pequim.

Período de preço Entrada com cache Entrada sem cache Saída
Preço atual verificado em 14 de agosto $0.003625 $0.435 $0.87
Novo preço fora de pico $0.022 $0.66 $1.98
Novo preço de pico $0.044 $1.32 $3.96

Na nova tabela, os horários de pico são 01:00–04:00 e 06:00–10:00 UTC. Todos os demais horários são fora de pico, com preços equivalentes à metade das tarifas de pico.

A transição não é uma simples divisão por horário de 2× sobre os preços atuais. Em comparação com a tarifa fixa atual, o novo preço fora de pico é cerca de 6,07× maior para entrada em cache, 1,52× para entrada sem cache e 2,28× para saída. O preço de pico dobra esses novos valores fora de pico. Reutilizar o cache continua valioso, mas o preço excepcionalmente baixo da entrada em cache no lançamento é o que mais muda.

Exemplos calculados de custo

A fórmula do custo exclusivo de tokens é:

custo = tokens_cache_hit × tarifa_cache_hit + tokens_cache_miss × tarifa_cache_miss + tokens_saida × tarifa_saida

Os exemplos abaixo não incluem custos separados de rede, assinatura, serviços de ferramentas ou pagamento. Um agente que usa ferramentas pode gerar várias chamadas ao modelo; calcule a tarefa inteira, não apenas a primeira solicitação.

Carga de trabalho DeepSeek atual Novo fora de pico Novo pico Modelflare em 14 de agosto
100K de entrada sem cache + 10K de saída $0.0522 $0.0858 $0.1716 $0.0540
90K em cache + 10K sem cache de entrada + 10K de saída $0.0134 $0.0284 $0.0568 $0.0138
900K em cache + 100K sem cache de entrada + 20K de saída $0.0642 $0.1254 $0.2508 $0.0663

A segunda e a terceira linhas mostram por que a estrutura do prompt importa. Um prefixo estável grande pode reduzir muito o custo, mas apenas após um acerto real de cache. Os campos de uso da API são a fonte de verdade para a reconciliação.

DeepSeek V4 Pro versus V4 Flash: escolha de custo-benefício

Nas tarifas oficiais atuais, o Pro custa cerca de 3,11× o Flash para entrada sem cache e saída, mas apenas 1,29× para entrada em cache. Após o início da nova tabela, o Pro custa 3× o Flash para entrada sem cache e saída e cerca de 3,14× para entrada em cache. A concorrência oficial por conta é 500 no Pro e 2.500 no Flash.

Isso cria uma regra operacional clara:

  • escolha o V4 Pro para alterações difíceis em repositórios, agentes de horizonte longo, análise de segurança, coordenação complexa de ferramentas e tarefas em que uma tentativa fracassada seja cara;
  • escolha o V4 Flash para agentes mais simples, workers paralelos, pré-processamento, extração, resumo e tráfego sensível a throughput;
  • roteie pela dificuldade observada da tarefa e pelo custo por tarefa concluída, em vez de tornar o Pro o padrão universal;
  • reavalie após a transição de preços, pois a economia de cargas Pro com cache muda de forma relevante.

Um preço de token 3× maior ainda pode sair mais barato se o Pro evitar novas tentativas ou correção humana. Por outro lado, uma vantagem de cinco pontos em benchmark não justifica enviar trabalho determinístico ou trivial ao modelo maior. Meça taxa de conclusão, tempo total, tokens de todas as tentativas, falhas de ferramentas e tempo de correção do revisor.

Preço e disponibilidade do DeepSeek V4 Pro na Modelflare

O catálogo de preços ao vivo da Modelflare foi verificado em 14 de agosto de 2026. Ele lista deepseek-v4-pro e o alias fixado deepseek-v4-pro-0813 no grupo deepseek-stable com os seguintes preços-base por um milhão de tokens:

Preço da Modelflare no momento da verificação Tarifa
Entrada com cache $0.0037
Entrada sem cache $0.45
Saída $0.90

Essas tarifas estão cerca de 2,07% acima do preço atual da DeepSeek para entrada em cache e 3,45% acima das tarifas atuais de entrada sem cache e saída. Este artigo não promete que os preços da Modelflare permanecerão iguais após a transição da DeepSeek para pico e fora de pico. Para uma decisão de produção, use sempre a página de preços ao vivo e o registro de uso da solicitação.

Os metadados atuais do catálogo público marcam a rota da Modelflare como Chat Completions compatível com OpenAI. Embora o endpoint próprio da DeepSeek agora aceite Responses e formatos Anthropic, o suporte do provedor não torna automaticamente compatível cada rota de um gateway. Use o protocolo exato mostrado na página de preços ao vivo.

export MODELFLARE_API_KEY="your-api-key"

curl https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer ${MODELFLARE_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Review this migration plan and identify rollback risks."}
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high"
  }'

Para a configuração geral do cliente, consulte o guia da API compatível com OpenAI. Para contabilidade e interpretação de tokens em cache, consulte acompanhamento de custos de API de IA.

Checklist de avaliação para produção

  1. Fixe deepseek-v4-pro-0813 durante a avaliação, se a rota o oferecer, e depois decida se o alias estável é aceitável para o controle de mudanças.
  2. Reproduza um conjunto fixo e seguro para privacidade de tarefas no Pro e no Flash, com as mesmas ferramentas, permissões, timeout e regras de parada.
  3. Teste high e max; trate low como equivalente a high até que o comportamento atual da API comprove o contrário.
  4. Conclua um loop de ferramentas em vários turnos e verifique que reasoning_content, IDs de ferramentas, argumentos e resultados sobrevivam a todos os adaptadores.
  5. Em clientes Responses, teste explicitamente cada campo necessário, pois parâmetros não suportados podem ser ignorados silenciosamente.
  6. Registre entrada em cache, entrada sem cache, saída, tokens de raciocínio, latência, novas tentativas e custo por tarefa concluída.
  7. Teste prompts longos em profundidades realistas; não deduza a qualidade de recuperação em um milhão de tokens a partir de uma solicitação curta.
  8. Faça testes de carga abaixo do limite de concorrência da conta e trate respostas 429 com backoff limitado.
  9. Modele tanto o preço atual quanto a tabela de pico e fora de pico de 16/17 de agosto antes de aprovar um orçamento.
  10. Mantenha o Flash ou outro modelo como fallback para disponibilidade e controle de custos; consulte roteamento confiável de API de IA.

Veredito final

O DeepSeek V4 Pro GA é um lançamento relevante voltado a agentes, não apenas um preview renomeado. O padrão de pontuações oficiais é mais forte em raciocínio sobre repositórios, programação difícil e automação, enquanto a nova interface Responses o torna mais prático para agentes modernos de programação. O contexto de 1M e o cache automático são úteis, mas apenas quando os aplicativos preservam prefixos estáveis e confirmam acertos reais de cache.

A principal ressalva é econômica: o preço do Pro após o lançamento é aproximadamente três vezes o do Flash na maioria das categorias de tokens, com menor concorrência. Ele deve ser a camada de escalonamento para trabalhos difíceis e de alto valor, não o padrão de todo prompt. A melhor arquitetura de produção geralmente envia trabalho simples ao Flash e promove apenas tarefas difíceis ou fracassadas ao Pro.

O preço da Modelflare em 14 de agosto está próximo do preço fixo atual da DeepSeek e atualmente expõe Chat Completions para o V4 Pro. Consulte novamente a página ao vivo após o início da nova tabela da DeepSeek; nem um artigo antigo nem uma captura em cache devem ser tratados como verdade de faturamento.

Fontes e data de verificação

As especificações oficiais, tabelas de preços, disponibilidade na Modelflare e preços ao vivo foram verificados em 14 de agosto de 2026.