Gemini 3.7 Flash: especificações, benchmarks, preços e comparação
Análise verificada do Gemini 3.7 Flash com contexto de 1M, saída de 64K, recursos, preços oficiais, comparação com 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra e Muse Spark 1.2 e guia de migração.
O Google lançou o Gemini 3.7 Flash em 13 de agosto de 2026, apenas três semanas depois do Gemini 3.6 Flash. O modelo está disponível em GA com o ID estável gemini-3.7-flash e é apresentado como o Flash mais capaz do Google para programação, agentes, raciocínio multimodal e execução confiável em várias etapas.
A novidade não é uma janela maior nem uma contagem de parâmetros divulgada. O Gemini 3.7 Flash mantém a classe de 1M tokens de entrada e 64K de saída do 3.6 Flash, mas o Google relata ganhos importantes em código, ferramentas, trabalho de conhecimento, documentos e uso do computador. O preço introdutório também permanece igual.
Esta análise separa especificações oficiais, benchmarks publicados pelo Google, preço temporário e disponibilidade atual na Modelflare. Os dados voláteis foram verificados em 15 de agosto de 2026.
Gemini 3.7 Flash em resumo
| Propriedade | Valor oficial |
|---|---|
| Lançamento | 13 de agosto de 2026 |
| Estado da API | Disponibilidade geral; ID estável |
| ID do modelo | gemini-3.7-flash |
| Base | Gemini 3.6 Flash com melhorias algorítmicas |
| Entradas | Texto, imagem, vídeo, áudio e PDF |
| Saída | Texto |
| Entrada máxima | 1.048.576 tokens |
| Saída máxima | 65.536 tokens |
| Níveis de pensamento | low, medium e high; medium é o padrão documentado |
| Corte de conhecimento | Março de 2026; alguns domínios podem ficar em janeiro de 2025 |
| Número de parâmetros | Não divulgado |
| Última atualização documentada | Agosto de 2026 |
Há suporte a cache de contexto, execução de código, Computer Use em preview, busca de arquivos, function calling, grounding com Google Maps e Search, saídas estruturadas, thinking e URL Context. Batch, Flex e Priority também estão disponíveis. Geração de áudio, geração de imagem e Live API não são suportadas.
O que mudou de fato em relação ao Gemini 3.6 Flash
O Gemini 3.7 Flash é uma evolução do 3.6 Flash, não uma nova classe de contexto ou modalidade. O Google atribui os ganhos a melhorias algorítmicas na base de raciocínio e ao feedback de desenvolvedores em produção.
As mudanças práticas se concentram em:
- maior precisão na primeira tentativa em código e engenharia de software;
- melhor fidelidade ao transformar screenshots, imagens ou design systems em interfaces;
- planejamento, ferramentas, recuperação de obstáculos e esclarecimento de intenção mais confiáveis;
- melhor raciocínio sobre documentos complexos de finanças, direito e biociências;
- avanços em contexto longo e uso do computador por agentes;
- o mesmo preço Standard introdutório do 3.6 Flash até 31 de dezembro de 2026.
Portanto, no lançamento, o 3.7 não é um substituto mais caro para o 3.6. A decisão de migrar é principalmente sobre comportamento, latência e compatibilidade, não sobre um prêmio por token.
Preços oficiais da API
Os preços abaixo são do plano pago em dólares. Tokens são cobrados por milhão; armazenamento de cache, por milhão de tokens por hora.
| Modalidade | Medida | Até 31 dez 2026 | A partir de 1 jan 2027 |
|---|---|---|---|
| Standard | Entrada | $0.75 | $1.50 |
| Standard | Saída, incluindo tokens de pensamento | $3.75 | $7.50 |
| Standard | Entrada em cache | $0.075 | $0.15 |
| Standard | Armazenamento de cache por hora | $0.50 | $1.00 |
| Batch | Entrada | $0.375 | $0.75 |
| Batch | Saída, incluindo tokens de pensamento | $1.875 | $3.75 |
| Batch | Entrada em cache | $0.0375 | $0.075 |
| Flex | Entrada | $0.375 | $0.75 |
| Flex | Saída, incluindo tokens de pensamento | $1.875 | $3.75 |
| Flex | Entrada em cache | $0.0375 | $0.075 |
| Priority | Entrada | $1.35 | $2.70 |
| Priority | Saída, incluindo tokens de pensamento | $6.75 | $13.50 |
| Priority | Entrada em cache | $0.135 | $0.27 |
O Google Search Grounding inclui 5.000 buscas grátis por mês compartilhadas entre modelos Gemini 3.x; depois custa $14 por 1.000 solicitações. O Google Maps Grounding compartilha 5.000 prompts e aplica o mesmo valor por 1.000 consultas.
Na tarifa Standard introdutória, 100K tokens de entrada e 10K de saída custam cerca de $0.1125, sem cache, ferramentas, armazenamento ou novas tentativas. Um milhão de tokens em cache mais 100K de saída custa cerca de $0.45, sem armazenamento. Os dois exemplos dobram após o período promocional.
Comparação horizontal completa de benchmarks
O model card de agosto de 2026 compara Gemini 3.7 Flash, Gemini 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra e Muse Spark 1.2. Valores maiores são melhores em todas as linhas; o traço indica resultado não publicado.
| Benchmark | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra | Muse Spark 1.2 |
|---|---|---|---|---|---|
| Artificial Analysis Intelligence Index | 56 | 52 | 55 | 57 | 57 |
| FrontierCode 1.1 Main | 43.6% | 34.4% | 42.7% | 41.3% | — |
| DeepSWE v1.1 | 65.3% | 48.6% | 53.8% | 69.6% | 54.9% |
| Code Arena, WebDev Elo | 1588 | 1538 | 1541 | 1523 | 1535 |
| Terminal-bench 2.1 | 85.8% | 78.0% | 80.4% | 87.4% | 82.9% |
| Terminal-bench 3.0 | 14.9% | 5.4% | 14.6% | 20.8% | — |
| AutomationBench, conjunto privado | 30.4% | 17.0% | 10.7% | 23.6% | — |
| GDPVal-AA v2, Elo | 1525 | 1422 | 1598 | 1578 | 1628 |
| Harvey LAB-AA | 90.7% | 85.1% | 90.1% | 85.2% | — |
| GDP.pdf | 34.0% | 22.0% | 28.0% | 24.7% | 16.0% |
| CharXiv Reasoning, sem ferramentas | 84.5% | 85.2% | 77.0% | 85.9% | — |
| CharXiv Reasoning, com ferramentas | 88.7% | 89.4% | 88.3% | — | — |
| LVBench | 85.4% | 84.2% | 68.5% | 78.9% | — |
| GDM-MRCR v2, média de 128K | 97.0% | 91.8% | 81.5% | 93.5% | — |
| OSWorld 2.0 | 47.9% | 33.8% | — | 50.2% | — |
| Agent's Last Exam | 26.3% | 24.2% | 33.3% | 28.0% | — |
| HLE-Verified | 53.6% | 51.2% | 31.0% | 51.1% | — |
| BioMysteryBench, solucionável por humanos | 87.1% | 80.6% | 87.5% | 83.8% | — |
| BioMysteryBench, difícil para humanos | 43.5% | 41.2% | 34.1% | 49.4% | — |
| LABBench2 | 82.1% | 76.1% | 80.1% | 81.2% | — |
Os números são úteis, mas não formam um torneio independente com condições idênticas. O Google diz que resultados Gemini usam em geral pass@1 e amostragem padrão. Resultados não Gemini são informados pelos provedores salvo indicação contrária, com preferência pelo maior nível de raciocínio. Vários testes foram executados internamente, com diferenças de harness, ferramentas, agregação e até quadros de vídeo.
Análise de capacidade e desempenho
Contra o Gemini 3.6 Flash, o salto é amplo: FrontierCode sobe 9,2 pontos percentuais; DeepSWE, 16,7; AutomationBench, 13,4; GDP.pdf, 12; OSWorld, 14,1. Code Arena ganha 50 Elo e o GDM-MRCR passa de 91,8% para 97,0%.
A comparação entre famílias exige mais nuance:
- Gemini 3.7 Flash lidera FrontierCode, Code Arena, AutomationBench, Harvey LAB-AA, GDP.pdf, LVBench, GDM-MRCR, HLE-Verified e LABBench2.
- GPT-5.6 Terra permanece à frente em DeepSWE, ambas as versões de Terminal-bench, CharXiv sem ferramentas, OSWorld e BioMysteryBench difícil.
- Claude Sonnet 5 lidera Agent's Last Exam e vence por pouco o BioMysteryBench solucionável.
- Muse Spark 1.2 lidera GDPVal-AA e empata no Artificial Analysis, mas tem muitas linhas sem resultado.
- Gemini 3.7 não supera 3.6 em tudo: CharXiv cai 0,7 ponto com e sem ferramentas.
Na prática, 3.7 Flash é muito equilibrado para o preço de lançamento. É um forte candidato padrão para agentes de código, navegador e desktop, documentos longos, análise multimodal e trabalho de conhecimento em volume. GPT-5.6 Terra ainda merece teste direto em engenharia prolongada e terminal; Claude Sonnet 5 segue competitivo em desktop; Muse Spark é forte em conhecimento, mas a comparação publicada é incompleta.
Parâmetros, contexto e multimodalidade
O Google não revelou contagem total ou ativa de parâmetros, número de especialistas, detalhes de arquitetura, tamanho do corpus ou computação de treino. O model card só afirma que o 3.7 Flash se baseia no 3.6 Flash com melhorias algorítmicas. Qualquer número exato apresentado como fato seria especulação.
O contrato de API é o que o desenvolvedor pode usar:
- 1.048.576 tokens de entrada e 65.536 de saída;
- texto, imagem, vídeo, áudio e PDF na entrada; texto na saída;
- níveis low, medium e high; minimal retorna erro;
- funções, saída estruturada, Search, Maps, código, busca de arquivos, URL Context, cache e Computer Use em preview;
- sem Live API, geração de áudio ou de imagem.
Uma janela de 1M é capacidade, não meta. Prompts longos ainda elevam latência e custo; melhor recuperação não substitui preservar estado autoritativo, compactar histórico repetido e verificar efeitos colaterais de ferramentas.
Como chamar o Gemini 3.7 Flash
O guia do Google usa a Interactions API e documenta medium como padrão:
export GEMINI_API_KEY="<YOUR_GEMINI_API_KEY>"
curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-X POST \
-d '{
"model": "gemini-3.7-flash",
"input": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary.",
"generation_config": {
"thinking_level": "medium"
}
}'
A Modelflare expõe o ID exato por Chat Completions compatível com OpenAI:
export MODELFLARE_API_KEY="<YOUR_MODELFLARE_API_KEY>"
curl "https://origin.modelflare.dev/v1/chat/completions" \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [
{
"role": "user",
"content": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary."
}
]
}'
Os exemplos usam protocolos diferentes. Nem toda ferramenta nativa do Google ou campo de Interactions está automaticamente disponível em um adaptador OpenAI.
Migração e notas de produção
O guia do Google pede remover temperature, top_p e top_k, trocar thinking_budget pelo enum textual thinking_level e retirar candidate_count. Fluxos Interactions em várias rodadas devem usar previous_interaction_id no servidor.
Antes de substituir um modelo:
- fixe gemini-3.7-flash e rejeite troca silenciosa de alias;
- reproduza um conjunto fixo e seguro de tarefas no modelo atual e no 3.7;
- compare low, medium e high por custo de tarefa concluída e tempo total;
- teste streaming, saída estruturada, funções, multimodalidade, cancelamento e recusas separadamente;
- preserve thought signatures e campos de correlação exigidos pelo protocolo;
- verifique cache, tentativas, timeout e proteção contra efeitos duplicados;
- registre modelo, rota, entrada, cache, saída, ferramentas, latência e cobrança;
- mantenha uma rota de retorno até o tráfego real atingir o limite de aceitação.
HTTP 200 prova apenas que uma solicitação terminou. Não prova paridade de protocolo, latência estável, ferramentas corretas ou menor custo por tarefa concluída.
Gemini 3.7 Flash na Modelflare
Na verificação de produção de 15 de agosto de 2026, o catálogo público de Modelos e preços da Modelflare listava gemini-3.7-flash em gemini-stable. O catálogo indicava generateContent nativo do Gemini e Chat Completions OpenAI, mas não uma rota Responses.
O multiplicador exibido era 0.15x. A promoção do Google, o preço de referência configurado na Modelflare, o acesso ao grupo e a cobrança final são fatos separados e podem mudar de forma independente. Use a página ao vivo e uma solicitação não sensível concluída como fonte atual.
Em produção, crie ou atualize uma chave elegível, use o ID exato e valide os recursos de protocolo realmente usados antes de mover tráfego.
Conclusão
O Gemini 3.7 Flash é uma evolução substancial do 3.6 Flash pelo mesmo preço temporário. Seu melhor argumento é a amplitude: código de produção, web, agentes com ferramentas, documentos complexos, entradas multimodais, contexto longo e Computer Use avançam sem preço premium.
Ele não vence todos os benchmarks, a contagem de parâmetros é desconhecida e o desconto termina em 2026. A escolha correta é compará-lo ao modelo que já executa tarefas reais e decidir por conclusão, latência, novas tentativas e custo total, não por um índice isolado.
Fontes oficiais e registro
Fontes primárias:
- Google: Introducing Gemini 3.7 Flash
- Google AI: página do Gemini 3.7 Flash
- Google AI: guia do modelo mais recente e migração
- Google AI: preços da Gemini API
- Google DeepMind: model card do Gemini 3.7 Flash
- Google DeepMind: metodologia de avaliação
Registro:
- 15 de agosto de 2026: publicação inicial. Especificações, capacidades, metodologia, preços, migração e disponibilidade na Modelflare foram verificadas.