Gemini 3.7 Flash: especificaciones, benchmarks, precios y comparación

Análisis verificado de Gemini 3.7 Flash con contexto de 1M, salida de 64K, capacidades, precios oficiales, comparación con 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra y Muse Spark 1.2, y guía de migración.

Google presentó Gemini 3.7 Flash el 13 de agosto de 2026, solo tres semanas después de Gemini 3.6 Flash. Está disponible de forma general con el ID estable gemini-3.7-flash y Google lo sitúa como su modelo Flash más capaz para programación, agentes, razonamiento multimodal y ejecución fiable de varios pasos.

La novedad no es una ventana de contexto mayor ni un número de parámetros revelado. Gemini 3.7 Flash conserva la clase de 1M de entrada y 64K de salida de 3.6 Flash, pero Google publica mejoras importantes en código, herramientas, trabajo de conocimiento, documentos y uso del ordenador. El precio introductorio por token tampoco cambia frente a 3.6 Flash.

Este análisis separa las especificaciones oficiales, los resultados publicados por Google, el precio temporal de lanzamiento y la disponibilidad actual en Modelflare. Los datos variables se comprobaron el 15 de agosto de 2026.

Gemini 3.7 Flash de un vistazo

Propiedad Valor oficial
Fecha de lanzamiento 13 de agosto de 2026
Estado de la API Disponibilidad general; ID estable
ID del modelo gemini-3.7-flash
Base Gemini 3.6 Flash con mejoras algorítmicas
Modalidades de entrada Texto, imagen, vídeo, audio y PDF
Modalidad de salida Texto
Entrada máxima 1.048.576 tokens
Salida máxima 65.536 tokens
Niveles de razonamiento low, medium y high; medium es el valor predeterminado documentado
Corte de conocimiento Marzo de 2026; algunos dominios pueden quedar en enero de 2025
Número de parámetros No revelado
Última actualización documentada Agosto de 2026

Admite caché de contexto, ejecución de código, Computer Use en vista previa, búsqueda de archivos, llamadas a funciones, grounding con Google Maps y Search, salidas estructuradas, thinking y contexto de URL. También ofrece Batch, Flex y Priority. No admite generación de audio, generación de imágenes ni Live API.

Qué cambia realmente frente a Gemini 3.6 Flash

Gemini 3.7 Flash es una iteración de 3.6 Flash, no una nueva clase de contexto o modalidades. Google atribuye la mejora a cambios algorítmicos en la base de razonamiento y a comentarios de desarrolladores en producción.

Los cambios prácticos se concentran en:

  • mayor precisión al primer intento en generación de código e ingeniería de software;
  • mejor fidelidad al diseño al convertir capturas, imágenes o sistemas de diseño en interfaces web;
  • planificación, uso de herramientas, recuperación ante obstáculos y aclaración de intención más fiables;
  • mejor razonamiento sobre documentos complejos de finanzas, derecho y biociencias;
  • avances en contexto largo y uso del ordenador por agentes;
  • el mismo precio introductorio Standard que Gemini 3.6 Flash hasta el 31 de diciembre de 2026.

Este último punto importa: durante el lanzamiento, 3.7 no es un reemplazo más caro de 3.6. La migración depende sobre todo del comportamiento, la latencia y la compatibilidad, no de una prima por token.

Precios oficiales de la API

Los precios siguientes corresponden al nivel de pago en dólares estadounidenses. Los tokens se cobran por millón y el almacenamiento de caché por millón de tokens y hora.

Modalidad Concepto Hasta el 31 dic 2026 Desde el 1 ene 2027
Standard Entrada $0.75 $1.50
Standard Salida, incluidos tokens de razonamiento $3.75 $7.50
Standard Entrada en caché $0.075 $0.15
Standard Almacenamiento de caché por hora $0.50 $1.00
Batch Entrada $0.375 $0.75
Batch Salida, incluidos tokens de razonamiento $1.875 $3.75
Batch Entrada en caché $0.0375 $0.075
Flex Entrada $0.375 $0.75
Flex Salida, incluidos tokens de razonamiento $1.875 $3.75
Flex Entrada en caché $0.0375 $0.075
Priority Entrada $1.35 $2.70
Priority Salida, incluidos tokens de razonamiento $6.75 $13.50
Priority Entrada en caché $0.135 $0.27

Google Search Grounding incluye 5.000 búsquedas gratuitas al mes compartidas entre los modelos Gemini 3.x; después cuesta $14 por 1.000 solicitudes. Google Maps Grounding comparte una franquicia de 5.000 prompts y aplica el mismo precio de $14 por 1.000 consultas.

Con la tarifa Standard introductoria, 100K tokens de entrada y 10K de salida cuestan unos $0.1125, sin caché, herramientas, almacenamiento ni reintentos. Un millón de tokens en caché y 100K de salida cuestan unos $0.45, sin almacenamiento. Ambos ejemplos se duplican al terminar la promoción.

Comparación horizontal completa de benchmarks

La ficha de modelo de Google de agosto de 2026 compara Gemini 3.7 Flash con Gemini 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra y Muse Spark 1.2. Un valor mayor es mejor en todas las filas; el guion indica que no se publicó un resultado.

Benchmark Gemini 3.7 Flash Gemini 3.6 Flash Claude Sonnet 5 GPT-5.6 Terra Muse Spark 1.2
Artificial Analysis Intelligence Index 56 52 55 57 57
FrontierCode 1.1 Main 43.6% 34.4% 42.7% 41.3%
DeepSWE v1.1 65.3% 48.6% 53.8% 69.6% 54.9%
Code Arena, WebDev Elo 1588 1538 1541 1523 1535
Terminal-bench 2.1 85.8% 78.0% 80.4% 87.4% 82.9%
Terminal-bench 3.0 14.9% 5.4% 14.6% 20.8%
AutomationBench, conjunto privado 30.4% 17.0% 10.7% 23.6%
GDPVal-AA v2, Elo 1525 1422 1598 1578 1628
Harvey LAB-AA 90.7% 85.1% 90.1% 85.2%
GDP.pdf 34.0% 22.0% 28.0% 24.7% 16.0%
CharXiv Reasoning, sin herramientas 84.5% 85.2% 77.0% 85.9%
CharXiv Reasoning, con herramientas 88.7% 89.4% 88.3%
LVBench 85.4% 84.2% 68.5% 78.9%
GDM-MRCR v2, media de 128K 97.0% 91.8% 81.5% 93.5%
OSWorld 2.0 47.9% 33.8% 50.2%
Agent's Last Exam 26.3% 24.2% 33.3% 28.0%
HLE-Verified 53.6% 51.2% 31.0% 51.1%
BioMysteryBench, resoluble por humanos 87.1% 80.6% 87.5% 83.8%
BioMysteryBench, difícil para humanos 43.5% 41.2% 34.1% 49.4%
LABBench2 82.1% 76.1% 80.1% 81.2%

Las cifras son útiles, pero no forman un torneo independiente con condiciones idénticas. Google indica que los resultados de Gemini suelen ser pass@1 con muestreo predeterminado. Los resultados ajenos a Gemini son comunicados por sus proveedores salvo indicación contraria y se prefiere el nivel máximo de razonamiento. Varias pruebas se ejecutaron internamente y difieren en harness, herramientas, agregación e incluso número de fotogramas de vídeo.

Análisis de capacidad y rendimiento

Frente a Gemini 3.6 Flash, la mejora es amplia: FrontierCode sube 9,2 puntos porcentuales; DeepSWE, 16,7; AutomationBench, 13,4; GDP.pdf, 12; OSWorld, 14,1; Code Arena gana 50 puntos Elo y GDM-MRCR de contexto largo pasa del 91,8% al 97,0%.

La comparación con otras familias es más matizada:

  • Gemini 3.7 Flash lidera la tabla publicada en FrontierCode, Code Arena, AutomationBench, Harvey LAB-AA, GDP.pdf, LVBench, GDM-MRCR, HLE-Verified y LABBench2.
  • GPT-5.6 Terra sigue por delante en DeepSWE, ambas pruebas Terminal-bench, CharXiv sin herramientas, OSWorld y la división difícil de BioMysteryBench.
  • Claude Sonnet 5 lidera Agent's Last Exam y supera por poco la división resoluble de BioMysteryBench.
  • Muse Spark 1.2 lidera GDPVal-AA y empata con GPT-5.6 Terra en Artificial Analysis, aunque tiene muchas filas sin datos.
  • Gemini 3.7 no supera siempre a 3.6: CharXiv baja 0,7 puntos tanto con herramientas como sin ellas.

La lectura práctica es que 3.7 Flash resulta muy equilibrado para su precio de lanzamiento. Es un candidato sólido para agentes de código, flujos de navegador o escritorio, documentos largos, análisis multimodal y trabajo de conocimiento a gran escala. GPT-5.6 Terra merece una prueba directa para ingeniería de software prolongada y agentes de terminal; Claude Sonnet 5 sigue siendo competitivo en escritorio; Muse Spark destaca en trabajo de conocimiento, pero su superficie comparativa está incompleta.

Parámetros, contexto y multimodalidad

Google no ha revelado el número total o activo de parámetros, la cantidad de expertos, detalles de arquitectura, tamaño del corpus ni cómputo de entrenamiento. La ficha oficial solo afirma que Gemini 3.7 Flash se basa en Gemini 3.6 Flash con mejoras algorítmicas. Cualquier cifra exacta presentada como hecho sería especulativa.

Los parámetros en los que un desarrollador sí puede confiar son los del contrato de API:

  • 1.048.576 tokens de entrada y 65.536 de salida;
  • texto, imagen, vídeo, audio y PDF como entrada; texto como salida;
  • niveles low, medium y high; minimal devuelve un error;
  • funciones, salida estructurada, Search, Maps, código, búsqueda de archivos, URL Context, caché y Computer Use en vista previa;
  • sin Live API, generación de audio ni generación de imágenes.

Una ventana de 1M es capacidad, no un objetivo. Los prompts largos siguen elevando latencia y coste; una mejor recuperación tampoco sustituye conservar el estado autoritativo, compactar historial repetido y verificar efectos secundarios de herramientas.

Cómo llamar a Gemini 3.7 Flash

La guía de lanzamiento de Google usa la Interactions API y documenta medium como nivel predeterminado:

export GEMINI_API_KEY="<YOUR_GEMINI_API_KEY>"

curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "model": "gemini-3.7-flash",
    "input": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary.",
    "generation_config": {
      "thinking_level": "medium"
    }
  }'

Modelflare expone actualmente el ID exacto mediante Chat Completions compatible con OpenAI:

export MODELFLARE_API_KEY="<YOUR_MODELFLARE_API_KEY>"

curl "https://origin.modelflare.dev/v1/chat/completions" \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [
      {
        "role": "user",
        "content": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary."
      }
    ]
  }'

Los ejemplos usan protocolos distintos. No se debe suponer que todas las herramientas nativas de Google o los campos de Interactions estén disponibles mediante un adaptador compatible con OpenAI.

Migración y notas de producción

La guía de migración de Google pide eliminar temperature, top_p y top_k, sustituir thinking_budget por el enum de texto thinking_level y retirar candidate_count. Los flujos Interactions multivuelta deben usar previous_interaction_id en el servidor.

Antes de sustituir un modelo:

  1. fija el ID exacto gemini-3.7-flash y rechaza sustituciones silenciosas;
  2. reproduce un conjunto fijo y seguro de tareas sobre el modelo actual y 3.7;
  3. compara low, medium y high por coste de tarea resuelta y tiempo total;
  4. prueba por separado streaming, salida estructurada, funciones, multimodalidad, cancelación y rechazos;
  5. conserva las firmas de pensamiento y campos de correlación exigidos por la API elegida;
  6. verifica caché, reintentos, timeouts y protección frente a efectos duplicados;
  7. registra modelo, ruta, entrada, caché, salida, herramientas, latencia y cargo final;
  8. conserva una ruta de reversión hasta superar el umbral con tráfico real.

Un HTTP 200 solo demuestra que una solicitud terminó. No demuestra paridad de protocolo, latencia estable, herramientas correctas ni menor coste por tarea resuelta.

Gemini 3.7 Flash en Modelflare

En la comprobación de producción del 15 de agosto de 2026, el catálogo público de Modelos y precios de Modelflare incluía gemini-3.7-flash en el grupo gemini-stable. Indicaba compatibilidad con generateContent nativo de Gemini y Chat Completions compatible con OpenAI, pero no una ruta Responses.

El multiplicador mostrado era 0.15x. El precio promocional de Google, el precio de referencia configurado en Modelflare, el acceso al grupo y el cargo final son datos independientes que pueden cambiar por separado. La página en vivo y una solicitud no sensible completada son la fuente vigente.

Para producción, crea o actualiza una clave con acceso al grupo, usa el ID exacto y valida las funciones de protocolo que utiliza tu aplicación antes de mover tráfico.

Conclusión

Gemini 3.7 Flash es una mejora sustancial sobre 3.6 Flash con el mismo precio temporal. Su argumento principal es la amplitud: código de producción, desarrollo web, agentes con herramientas, documentos complejos, entradas multimodales, contexto largo y uso del ordenador avanzan sin pasar a un nivel de precio premium.

No gana todas las pruebas, su número de parámetros sigue sin conocerse y el descuento termina al cierre de 2026. Lo razonable es enfrentar 3.7 Flash al modelo que ya resuelve las tareas reales y decidir por tasa de finalización, latencia, reintentos y coste total, no por un único índice.

Fuentes oficiales y registro de actualización

Fuentes primarias:

Registro:

  • 15 de agosto de 2026: publicación inicial. Se comprobaron especificaciones, capacidades, metodología, precios, migración y disponibilidad en Modelflare.