DeepSeek V4 Flash Vision Exp: análise, preços, limites e comparação

Análise verificada do DeepSeek V4 Flash Vision Exp com custo de imagens, limites da API, benchmarks, comparação com Gemini 3.7 Flash e Claude Opus 4.8 e preços e disponibilidade atuais na Modelflare.

A DeepSeek lançou o DeepSeek V4 Flash Vision Exp em 21 de agosto de 2026. O ID exato da API é deepseek-v4-flash-vision-exp. O modelo recebe texto e imagens, retorna texto e mantém os mesmos preços por token do V4 Flash.

Esse último ponto é a principal notícia. A DeepSeek redimensiona cada imagem antes da inferência e limita o consumo a 384 tokens de entrada. Isso torna loops de agentes com muitas capturas excepcionalmente baratos. A contrapartida é igualmente clara: uma imagem grande é reduzida para um orçamento próximo de 800×800 pixels; custo baixo não significa fidelidade visual em resolução total.

Trata-se de um modelo experimental, não de uma substituição automática para toda carga visual em produção. Esta análise separa especificações oficiais, benchmarks publicados pela DeepSeek, cálculos reproduzíveis e disponibilidade real na Modelflare. Os dados voláteis foram verificados em 22 de agosto de 2026.

DeepSeek V4 Flash Vision Exp em resumo

Propriedade Valor oficial
Lançamento 21 de agosto de 2026
Estado Modelo experimental de API
ID do modelo deepseek-v4-flash-vision-exp
Entrada e saída Texto e imagem de entrada; texto de saída
Janela de contexto 1M tokens
Saída máxima 384K tokens
Raciocínio Modos com e sem thinking; thinking é o padrão documentado
Formatos de imagem JPEG, PNG, GIF, WebP
Formatos de API Chat Completions, Responses API e Messages compatível com Anthropic
Teto por imagem 384 tokens de entrada após redimensionamento
Concorrência 2.500
FIM Completion Não suportado

A DeepSeek não divulgou número de parâmetros, parâmetros ativos, especialistas, corpus de treinamento ou mudanças de arquitetura. Qualquer número preciso sem fonte primária é especulação.

O que realmente muda em relação ao V4 Flash

Segundo a DeepSeek, o Vision Exp empata com o V4 Flash oficial em agentes de texto, raciocínio e conhecimento geral. A novidade é a compreensão visual nativa: capturas, imagens de documentos, gráficos e fotografias entram no mesmo loop de ferramentas sem um modelo separado para gerar uma descrição intermediária.

A tabela de lançamento traz estes resultados:

Avaliação Pontuação publicada pela DeepSeek
Terminal Bench 2.1 83.9
NL2Repo 57.7
DeepSWE 59.3
DSBench-Hard 63.6
AutomationBench, conjunto público 25.7
ApexBench, Pass@1 36.5
Agents' Last Exam 27.3
Chartography 64.3
ZeroBench, Pass@5 35.0

A empresa também afirma que o desempenho de agente multimodal se aproxima do Claude Opus 4.8. É uma afirmação do fornecedor, não um teste independente da Modelflare. As linhas misturam tarefas de texto e tarefas visuais. Para testes públicos de agentes de código, a nota informa DeepSeek Harness no modo minimal, esforço max, top_p=0.95 e temperature=1.0. Use os resultados para escolher casos de replay, não como ranking universal.

Preço oficial e custo real de uma imagem

A página de preços da DeepSeek informa dólares por milhão de tokens. Os horários de pico são 01:00–04:00 e 06:00–10:00 UTC; os demais são fora de pico.

Medidor Fora de pico Pico
Entrada em cache $0.007 $0.014
Entrada sem cache $0.22 $0.44
Saída $0.66 $1.32
Custo máximo de entrada para uma imagem de 384 tokens $0.00008448 $0.00016896

A última linha é o cálculo 384 × preço de entrada ÷ 1.000.000, e não uma tarifa separada por imagem. Imagens menores podem usar menos tokens. Texto de entrada e saída gerada são cobrados adicionalmente.

O redimensionamento explica o preço e o limite. Imagens abaixo de aproximadamente 384×384 são ampliadas proporcionalmente. Imagens maiores são reduzidas para uma área próxima de 800×800. Assim, 2000×2000 e 5000×5000 podem atingir o mesmo teto de 384 tokens. A conta cai, mas texto minúsculo, rótulos densos e coordenadas precisas podem desaparecer.

Comparação com Gemini 3.7 Flash e Claude Opus 4.8

Os três modelos tratam versões diferentes do problema multimodal. A tabela usa preços padrão das APIs diretas, sem ferramentas, armazenamento de cache, novas tentativas ou descontos de gateway.

Modelo Estado Entradas Contexto / saída máx. Entrada sem cache Saída Principal compromisso
DeepSeek V4 Flash Vision Exp Experimental Texto, imagem 1M / 384K $0.22 fora de pico; $0.44 pico $0.66 fora de pico; $1.32 pico Menor preço e teto de 384 tokens por imagem; redimensionamento agressivo
Gemini 3.7 Flash GA Texto, imagem, vídeo, áudio, PDF 1M / 64K $0.75 até 31/12/2026 $3.75 até 31/12/2026 Mais modalidades e ferramentas; preço maior e aumento posterior
Claude Opus 4.8 GA Texto, imagem, PDF 1M / 128K $5.00 $25.00 Visão de alta resolução e Computer Use maduro; custo premium

Para 100K tokens de entrada sem cache e 10K de saída, sem imagens:

  • DeepSeek custa cerca de $0.0286 fora de pico ou $0.0572 no pico.
  • Gemini 3.7 Flash custa $0.1125 no preço introdutório.
  • Claude Opus 4.8 custa $0.75.

Neste exemplo, DeepSeek é aproximadamente 49% mais barato que Gemini no pico e 75% fora de pico. Em relação ao Claude, a diferença é de 92% a 96%. São percentuais de conta, não de qualidade.

Com imagens, a diferença aumenta, mas a resolução também muda. A Anthropic documenta 1.296 tokens visuais para uma imagem 1000×1000 no Opus 4.8, cerca de $0.00648. A DeepSeek limita qualquer imagem a $0.00016896 no pico e $0.00008448 fora de pico: 38 a 77 vezes menos. Porém, a DeepSeek reduz a imagem para perto de 800×800, enquanto o Opus mantém mais detalhes.

Um lote com 100 imagens de um megapixel, 100K tokens de texto e 10K de saída custa no máximo $0.0370 fora de pico ou $0.0741 no pico na DeepSeek. Aplicando os 1.296 tokens por imagem da documentação da Anthropic, o custo no Opus 4.8 fica em $1.398. Não é um teste de qualidade equivalente; demonstra que triagem barata e inspeção em alta resolução são cargas distintas.

Qual modelo serve melhor a cada carga

Teste o DeepSeek V4 Flash Vision Exp de forma controlada para muitas capturas, documentos comuns, gráficos, extração semelhante a OCR e observações visuais em loops de ferramentas, quando o custo por tarefa correta importa mais do que preservar todos os pixels.

Escolha Gemini 3.7 Flash para multimodalidade ampla quando um fluxo precisa tratar imagem, vídeo, áudio e PDF ou depende de Search Grounding, execução de código, File Search, URL Context e Computer Use em preview. Gemini é GA; o endpoint visual da DeepSeek é experimental.

Escolha Claude Opus 4.8 para agentes visuais em alta resolução quando documentos densos, elementos pequenos de UI, Computer Use e longas tarefas de navegador justificam o valor. A Anthropic admite até 2.576 pixels no lado maior e 4.784 tokens visuais, por isso só comparar preço por imagem não é equivalente.

Uma arquitetura em camadas também é possível: um modelo barato classifica e extrai primeiro, e apenas casos ambíguos ou sensíveis a detalhes sobem para alta resolução. Meça a segunda chamada, a latência e a taxa de escalada; se quase tudo subir, dois modelos não economizam automaticamente.

Formas de enviar imagens e limites

O guia Vision da DeepSeek oferece:

  1. base64 inline para arquivo local;
  2. URL pública HTTP ou HTTPS;
  3. file_id reutilizável da Files API.
Limite Valor
Corpo inline 48 MiB
Imagem base64 ou URL 32 MiB
Imagem via Files API 64 MiB
Imagens por solicitação 600
Total sem file_id 64 MiB
Total incluindo file_id 200 MiB
Maior lado 8.192 px; 4.096 px com 15 imagens ou mais
URL externa 8.192 caracteres e download em 60 segundos

detail: "low" força 512×512 e serve para OCR ou classificação com pouco detalhe. high, original e, atualmente, auto mantêm o original antes da regra normal. Chat Completions aceita imagens apenas em mensagens user; Responses também aceita em developer e saídas de ferramentas, mas rejeita em system ou assistant.

Exemplo de Responses API pela Modelflare

A Modelflare agora lista o ID exato e a rota Responses API. Use uma chave atribuída ao grupo deepseek-stable:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MODELFLARE_API_KEY"],
    base_url="https://modelflare.dev/v1",
)

response = client.responses.create(
    model="deepseek-v4-flash-vision-exp",
    input=[
        {
            "role": "user",
            "content": [
                {
                    "type": "input_text",
                    "text": "Leia este painel. Retorne as três anomalias e a evidência visível de cada uma.",
                },
                {
                    "type": "input_image",
                    "image_url": "https://example.com/dashboard.png",
                    "detail": "low",
                },
            ],
        }
    ],
)

print(response.output_text)

Para imagens privadas, use base64 ou Files API em vez de URL pública. Não registre credenciais, URLs privadas ou dados pessoais. A implementação Responses da DeepSeek é stateless: não suporta previous_response_id, conversations ou store. Function Calling e Web Search funcionam; Computer Use, Code Interpreter, File Search e MCP integrados são ignorados.

Checklist de produção

  1. Fixe o ID deepseek-v4-flash-vision-exp; não trate deepseek-v4-flash como alias visual.
  2. Monte um conjunto seguro com texto pequeno, tabelas densas, gráficos, capturas, rotação e conteúdo adversarial.
  3. Compare detail: "low" e o padrão por sucesso, latência e tokens cobrados.
  4. Valide Chat Completions, Responses e Messages separadamente se usar vários protocolos.
  5. Teste saída estruturada, correlação de ferramentas, streaming, cancelamento, recusas e imagens inválidas.
  6. Use IDs da Files API para imagens privadas repetidas e defina retenção e exclusão.
  7. Registre quantidade, dimensões, tokens de entrada, cache e saída, tentativas, latência, rota e custo final.
  8. Mantenha fallback GA para tarefas críticas ou sensíveis a detalhes até atingir um limite de tráfego real.

HTTP 200 só prova que uma chamada terminou. Não prova que a captura foi lida corretamente, que as ferramentas foram autorizadas ou que o custo por tarefa bem-sucedida caiu.

Preço do DeepSeek V4 Flash Vision Exp na Modelflare

O modelo está disponível. Em uma verificação posterior de produção em 22 de agosto de 2026, o catálogo público de Modelos e preços já listava o ID exato deepseek-v4-flash-vision-exp no grupo deepseek-stable, com rotas compatíveis com OpenAI para Chat Completions e Responses API.

O catálogo usa como referência os preços oficiais de pico — $0.44 de entrada, $1.32 de saída e $0.014 de entrada em cache por milhão — e aplica o multiplicador 0.9x de deepseek-stable:

Grupo da Modelflare Entrada Entrada em cache Saída Custo máximo de entrada sem cache para uma imagem de 384 tokens
deepseek-stable $0.396 / 1M $0.0126 / 1M $1.188 / 1M $0.000152064

Nessas tarifas, 100K tokens de texto sem cache mais 10K de saída custam cerca de $0.05148. Cem imagens no teto de 384 tokens, 100K tokens de texto e 10K de saída custam no máximo $0.06669, antes de novas tentativas ou outras solicitações.

Não trate o preço 0.9x como o horário fora de pico direto da DeepSeek. A Modelflare aplica o multiplicador aos preços de referência configurados e não alterna automaticamente conforme os horários do fornecedor. Grupo, rotas e preços podem mudar; consulte a página ao vivo e o registro da solicitação concluída.

Conclusão

O DeepSeek V4 Flash Vision Exp muda a economia dos agentes visuais: cada imagem fica limitada a 384 tokens e usa a tarifa do V4 Flash. Para triagem de capturas, extração de documentos, leitura de gráficos e loops visuais em volume, a diferença pode ser relevante.

O mesmo limite é o aviso. O redimensionamento pode apagar detalhes exigidos por Computer Use e documentos densos; o endpoint é experimental; os benchmarks são do fornecedor. Avalie-o como trabalhador visual de baixo custo, não como prova de que um modelo substitui toda a pilha multimodal.

Fontes oficiais e registro

Fontes primárias:

Registro:

  • 22 de agosto de 2026: publicação inicial. Estado, especificações, processamento de imagens, limites, protocolos, preços por horário, concorrentes, cálculos e catálogo da Modelflare foram verificados.
  • Mais tarde em 22 de agosto de 2026: atualizado após a ativação do ID exato na Modelflare. Foram adicionados preços 0.9x de deepseek-stable, cálculos, rotas suportadas e um exemplo de Responses API pela Modelflare.