DeepSeek V4 Flash Vision Exp: análise, preços, limites e comparação
Análise verificada do DeepSeek V4 Flash Vision Exp com custo de imagens, limites da API, benchmarks, comparação com Gemini 3.7 Flash e Claude Opus 4.8 e preços e disponibilidade atuais na Modelflare.
A DeepSeek lançou o DeepSeek V4 Flash Vision Exp em 21 de agosto de 2026. O ID exato da API é deepseek-v4-flash-vision-exp. O modelo recebe texto e imagens, retorna texto e mantém os mesmos preços por token do V4 Flash.
Esse último ponto é a principal notícia. A DeepSeek redimensiona cada imagem antes da inferência e limita o consumo a 384 tokens de entrada. Isso torna loops de agentes com muitas capturas excepcionalmente baratos. A contrapartida é igualmente clara: uma imagem grande é reduzida para um orçamento próximo de 800×800 pixels; custo baixo não significa fidelidade visual em resolução total.
Trata-se de um modelo experimental, não de uma substituição automática para toda carga visual em produção. Esta análise separa especificações oficiais, benchmarks publicados pela DeepSeek, cálculos reproduzíveis e disponibilidade real na Modelflare. Os dados voláteis foram verificados em 22 de agosto de 2026.
DeepSeek V4 Flash Vision Exp em resumo
| Propriedade | Valor oficial |
|---|---|
| Lançamento | 21 de agosto de 2026 |
| Estado | Modelo experimental de API |
| ID do modelo | deepseek-v4-flash-vision-exp |
| Entrada e saída | Texto e imagem de entrada; texto de saída |
| Janela de contexto | 1M tokens |
| Saída máxima | 384K tokens |
| Raciocínio | Modos com e sem thinking; thinking é o padrão documentado |
| Formatos de imagem | JPEG, PNG, GIF, WebP |
| Formatos de API | Chat Completions, Responses API e Messages compatível com Anthropic |
| Teto por imagem | 384 tokens de entrada após redimensionamento |
| Concorrência | 2.500 |
| FIM Completion | Não suportado |
A DeepSeek não divulgou número de parâmetros, parâmetros ativos, especialistas, corpus de treinamento ou mudanças de arquitetura. Qualquer número preciso sem fonte primária é especulação.
O que realmente muda em relação ao V4 Flash
Segundo a DeepSeek, o Vision Exp empata com o V4 Flash oficial em agentes de texto, raciocínio e conhecimento geral. A novidade é a compreensão visual nativa: capturas, imagens de documentos, gráficos e fotografias entram no mesmo loop de ferramentas sem um modelo separado para gerar uma descrição intermediária.
A tabela de lançamento traz estes resultados:
| Avaliação | Pontuação publicada pela DeepSeek |
|---|---|
| Terminal Bench 2.1 | 83.9 |
| NL2Repo | 57.7 |
| DeepSWE | 59.3 |
| DSBench-Hard | 63.6 |
| AutomationBench, conjunto público | 25.7 |
| ApexBench, Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| Chartography | 64.3 |
| ZeroBench, Pass@5 | 35.0 |
A empresa também afirma que o desempenho de agente multimodal se aproxima do Claude Opus 4.8. É uma afirmação do fornecedor, não um teste independente da Modelflare. As linhas misturam tarefas de texto e tarefas visuais. Para testes públicos de agentes de código, a nota informa DeepSeek Harness no modo minimal, esforço max, top_p=0.95 e temperature=1.0. Use os resultados para escolher casos de replay, não como ranking universal.
Preço oficial e custo real de uma imagem
A página de preços da DeepSeek informa dólares por milhão de tokens. Os horários de pico são 01:00–04:00 e 06:00–10:00 UTC; os demais são fora de pico.
| Medidor | Fora de pico | Pico |
|---|---|---|
| Entrada em cache | $0.007 | $0.014 |
| Entrada sem cache | $0.22 | $0.44 |
| Saída | $0.66 | $1.32 |
| Custo máximo de entrada para uma imagem de 384 tokens | $0.00008448 | $0.00016896 |
A última linha é o cálculo 384 × preço de entrada ÷ 1.000.000, e não uma tarifa separada por imagem. Imagens menores podem usar menos tokens. Texto de entrada e saída gerada são cobrados adicionalmente.
O redimensionamento explica o preço e o limite. Imagens abaixo de aproximadamente 384×384 são ampliadas proporcionalmente. Imagens maiores são reduzidas para uma área próxima de 800×800. Assim, 2000×2000 e 5000×5000 podem atingir o mesmo teto de 384 tokens. A conta cai, mas texto minúsculo, rótulos densos e coordenadas precisas podem desaparecer.
Comparação com Gemini 3.7 Flash e Claude Opus 4.8
Os três modelos tratam versões diferentes do problema multimodal. A tabela usa preços padrão das APIs diretas, sem ferramentas, armazenamento de cache, novas tentativas ou descontos de gateway.
| Modelo | Estado | Entradas | Contexto / saída máx. | Entrada sem cache | Saída | Principal compromisso |
|---|---|---|---|---|---|---|
| DeepSeek V4 Flash Vision Exp | Experimental | Texto, imagem | 1M / 384K | $0.22 fora de pico; $0.44 pico | $0.66 fora de pico; $1.32 pico | Menor preço e teto de 384 tokens por imagem; redimensionamento agressivo |
| Gemini 3.7 Flash | GA | Texto, imagem, vídeo, áudio, PDF | 1M / 64K | $0.75 até 31/12/2026 | $3.75 até 31/12/2026 | Mais modalidades e ferramentas; preço maior e aumento posterior |
| Claude Opus 4.8 | GA | Texto, imagem, PDF | 1M / 128K | $5.00 | $25.00 | Visão de alta resolução e Computer Use maduro; custo premium |
Para 100K tokens de entrada sem cache e 10K de saída, sem imagens:
- DeepSeek custa cerca de $0.0286 fora de pico ou $0.0572 no pico.
- Gemini 3.7 Flash custa $0.1125 no preço introdutório.
- Claude Opus 4.8 custa $0.75.
Neste exemplo, DeepSeek é aproximadamente 49% mais barato que Gemini no pico e 75% fora de pico. Em relação ao Claude, a diferença é de 92% a 96%. São percentuais de conta, não de qualidade.
Com imagens, a diferença aumenta, mas a resolução também muda. A Anthropic documenta 1.296 tokens visuais para uma imagem 1000×1000 no Opus 4.8, cerca de $0.00648. A DeepSeek limita qualquer imagem a $0.00016896 no pico e $0.00008448 fora de pico: 38 a 77 vezes menos. Porém, a DeepSeek reduz a imagem para perto de 800×800, enquanto o Opus mantém mais detalhes.
Um lote com 100 imagens de um megapixel, 100K tokens de texto e 10K de saída custa no máximo $0.0370 fora de pico ou $0.0741 no pico na DeepSeek. Aplicando os 1.296 tokens por imagem da documentação da Anthropic, o custo no Opus 4.8 fica em $1.398. Não é um teste de qualidade equivalente; demonstra que triagem barata e inspeção em alta resolução são cargas distintas.
Qual modelo serve melhor a cada carga
Teste o DeepSeek V4 Flash Vision Exp de forma controlada para muitas capturas, documentos comuns, gráficos, extração semelhante a OCR e observações visuais em loops de ferramentas, quando o custo por tarefa correta importa mais do que preservar todos os pixels.
Escolha Gemini 3.7 Flash para multimodalidade ampla quando um fluxo precisa tratar imagem, vídeo, áudio e PDF ou depende de Search Grounding, execução de código, File Search, URL Context e Computer Use em preview. Gemini é GA; o endpoint visual da DeepSeek é experimental.
Escolha Claude Opus 4.8 para agentes visuais em alta resolução quando documentos densos, elementos pequenos de UI, Computer Use e longas tarefas de navegador justificam o valor. A Anthropic admite até 2.576 pixels no lado maior e 4.784 tokens visuais, por isso só comparar preço por imagem não é equivalente.
Uma arquitetura em camadas também é possível: um modelo barato classifica e extrai primeiro, e apenas casos ambíguos ou sensíveis a detalhes sobem para alta resolução. Meça a segunda chamada, a latência e a taxa de escalada; se quase tudo subir, dois modelos não economizam automaticamente.
Formas de enviar imagens e limites
O guia Vision da DeepSeek oferece:
- base64 inline para arquivo local;
- URL pública HTTP ou HTTPS;
file_idreutilizável da Files API.
| Limite | Valor |
|---|---|
| Corpo inline | 48 MiB |
| Imagem base64 ou URL | 32 MiB |
| Imagem via Files API | 64 MiB |
| Imagens por solicitação | 600 |
Total sem file_id |
64 MiB |
Total incluindo file_id |
200 MiB |
| Maior lado | 8.192 px; 4.096 px com 15 imagens ou mais |
| URL externa | 8.192 caracteres e download em 60 segundos |
detail: "low" força 512×512 e serve para OCR ou classificação com pouco detalhe. high, original e, atualmente, auto mantêm o original antes da regra normal. Chat Completions aceita imagens apenas em mensagens user; Responses também aceita em developer e saídas de ferramentas, mas rejeita em system ou assistant.
Exemplo de Responses API pela Modelflare
A Modelflare agora lista o ID exato e a rota Responses API. Use uma chave atribuída ao grupo deepseek-stable:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODELFLARE_API_KEY"],
base_url="https://modelflare.dev/v1",
)
response = client.responses.create(
model="deepseek-v4-flash-vision-exp",
input=[
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Leia este painel. Retorne as três anomalias e a evidência visível de cada uma.",
},
{
"type": "input_image",
"image_url": "https://example.com/dashboard.png",
"detail": "low",
},
],
}
],
)
print(response.output_text)
Para imagens privadas, use base64 ou Files API em vez de URL pública. Não registre credenciais, URLs privadas ou dados pessoais. A implementação Responses da DeepSeek é stateless: não suporta previous_response_id, conversations ou store. Function Calling e Web Search funcionam; Computer Use, Code Interpreter, File Search e MCP integrados são ignorados.
Checklist de produção
- Fixe o ID
deepseek-v4-flash-vision-exp; não tratedeepseek-v4-flashcomo alias visual. - Monte um conjunto seguro com texto pequeno, tabelas densas, gráficos, capturas, rotação e conteúdo adversarial.
- Compare
detail: "low"e o padrão por sucesso, latência e tokens cobrados. - Valide Chat Completions, Responses e Messages separadamente se usar vários protocolos.
- Teste saída estruturada, correlação de ferramentas, streaming, cancelamento, recusas e imagens inválidas.
- Use IDs da Files API para imagens privadas repetidas e defina retenção e exclusão.
- Registre quantidade, dimensões, tokens de entrada, cache e saída, tentativas, latência, rota e custo final.
- Mantenha fallback GA para tarefas críticas ou sensíveis a detalhes até atingir um limite de tráfego real.
HTTP 200 só prova que uma chamada terminou. Não prova que a captura foi lida corretamente, que as ferramentas foram autorizadas ou que o custo por tarefa bem-sucedida caiu.
Preço do DeepSeek V4 Flash Vision Exp na Modelflare
O modelo está disponível. Em uma verificação posterior de produção em 22 de agosto de 2026, o catálogo público de Modelos e preços já listava o ID exato deepseek-v4-flash-vision-exp no grupo deepseek-stable, com rotas compatíveis com OpenAI para Chat Completions e Responses API.
O catálogo usa como referência os preços oficiais de pico — $0.44 de entrada, $1.32 de saída e $0.014 de entrada em cache por milhão — e aplica o multiplicador 0.9x de deepseek-stable:
| Grupo da Modelflare | Entrada | Entrada em cache | Saída | Custo máximo de entrada sem cache para uma imagem de 384 tokens |
|---|---|---|---|---|
deepseek-stable |
$0.396 / 1M | $0.0126 / 1M | $1.188 / 1M | $0.000152064 |
Nessas tarifas, 100K tokens de texto sem cache mais 10K de saída custam cerca de $0.05148. Cem imagens no teto de 384 tokens, 100K tokens de texto e 10K de saída custam no máximo $0.06669, antes de novas tentativas ou outras solicitações.
Não trate o preço 0.9x como o horário fora de pico direto da DeepSeek. A Modelflare aplica o multiplicador aos preços de referência configurados e não alterna automaticamente conforme os horários do fornecedor. Grupo, rotas e preços podem mudar; consulte a página ao vivo e o registro da solicitação concluída.
Conclusão
O DeepSeek V4 Flash Vision Exp muda a economia dos agentes visuais: cada imagem fica limitada a 384 tokens e usa a tarifa do V4 Flash. Para triagem de capturas, extração de documentos, leitura de gráficos e loops visuais em volume, a diferença pode ser relevante.
O mesmo limite é o aviso. O redimensionamento pode apagar detalhes exigidos por Computer Use e documentos densos; o endpoint é experimental; os benchmarks são do fornecedor. Avalie-o como trabalhador visual de baixo custo, não como prova de que um modelo substitui toda a pilha multimodal.
Fontes oficiais e registro
Fontes primárias:
- Change log da DeepSeek
- Guia Vision da DeepSeek
- Modelos e preços da DeepSeek
- Responses API da DeepSeek
- Google: Gemini 3.7 Flash
- Google: preços da Gemini API
- Anthropic: visão geral dos modelos Claude
- Anthropic: tokens visuais e limites
Registro:
- 22 de agosto de 2026: publicação inicial. Estado, especificações, processamento de imagens, limites, protocolos, preços por horário, concorrentes, cálculos e catálogo da Modelflare foram verificados.
- Mais tarde em 22 de agosto de 2026: atualizado após a ativação do ID exato na Modelflare. Foram adicionados preços 0.9x de
deepseek-stable, cálculos, rotas suportadas e um exemplo de Responses API pela Modelflare.