Gemini 3.7 Flash : spécifications, benchmarks, tarifs et comparaison

Analyse vérifiée de Gemini 3.7 Flash : contexte 1M, sortie 64K, capacités, tarifs officiels, comparaison avec 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra et Muse Spark 1.2, et migration.

Google a lancé Gemini 3.7 Flash le 13 août 2026, trois semaines seulement après Gemini 3.6 Flash. Le modèle est disponible en GA sous l'identifiant stable gemini-3.7-flash et présenté comme le Flash le plus performant de Google pour le code, les agents, le raisonnement multimodal et l'exécution fiable en plusieurs étapes.

La nouveauté n'est ni une fenêtre de contexte plus grande ni un nombre de paramètres publié. Gemini 3.7 Flash conserve la classe 1M en entrée et 64K en sortie de 3.6 Flash, mais Google annonce des gains importants en programmation, outils, travail intellectuel, documents et utilisation d'ordinateur. Le tarif de lancement reste également identique.

Cette analyse sépare les spécifications officielles, les benchmarks publiés par Google, le tarif temporaire et la disponibilité actuelle chez Modelflare. Les données susceptibles d'évoluer ont été vérifiées le 15 août 2026.

Gemini 3.7 Flash en bref

Propriété Valeur officielle
Date de sortie 13 août 2026
État de l'API Disponibilité générale ; ID stable
ID du modèle gemini-3.7-flash
Base Gemini 3.6 Flash avec améliorations algorithmiques
Modalités d'entrée Texte, image, vidéo, audio et PDF
Modalité de sortie Texte
Entrée maximale 1 048 576 jetons
Sortie maximale 65 536 jetons
Niveaux de raisonnement low, medium, high ; medium est la valeur documentée par défaut
Date de coupure des connaissances Mars 2026 ; certains domaines peuvent rester limités à janvier 2025
Nombre de paramètres Non communiqué
Dernière mise à jour documentée Août 2026

Le modèle prend en charge le cache de contexte, l'exécution de code, Computer Use en preview, la recherche de fichiers, les appels de fonctions, Google Maps et Search Grounding, les sorties structurées, le thinking et URL Context. Batch, Flex et Priority sont disponibles. La génération audio, la génération d'images et la Live API ne le sont pas.

Ce qui change réellement depuis Gemini 3.6 Flash

Gemini 3.7 Flash est une évolution de 3.6 Flash, pas une nouvelle classe de contexte ou de modalités. Google attribue les progrès à des améliorations algorithmiques de la base de raisonnement et aux retours de développeurs en production.

Les changements pratiques portent sur :

  • une meilleure précision au premier essai pour le code et l'ingénierie logicielle ;
  • une fidélité accrue aux captures, images et design systems pour le développement web ;
  • une planification, des outils, une récupération après blocage et une clarification d'intention plus fiables ;
  • un meilleur raisonnement sur des documents complexes en finance, droit et biosciences ;
  • de meilleurs résultats en contexte long et en utilisation agentique d'ordinateur ;
  • le même tarif Standard de lancement que 3.6 Flash jusqu'au 31 décembre 2026.

Au lancement, 3.7 n'est donc pas un remplacement plus cher de 3.6. La migration se décide surtout sur le comportement, la latence et la compatibilité, pas sur une prime par jeton.

Tarifs officiels de l'API

Les montants suivants concernent l'offre payante en dollars. Les jetons sont facturés par million et le stockage du cache par million de jetons et par heure.

Mode Mesure Jusqu'au 31 déc. 2026 Dès le 1 janv. 2027
Standard Entrée $0.75 $1.50
Standard Sortie, jetons de raisonnement inclus $3.75 $7.50
Standard Entrée en cache $0.075 $0.15
Standard Stockage du cache par heure $0.50 $1.00
Batch Entrée $0.375 $0.75
Batch Sortie, jetons de raisonnement inclus $1.875 $3.75
Batch Entrée en cache $0.0375 $0.075
Flex Entrée $0.375 $0.75
Flex Sortie, jetons de raisonnement inclus $1.875 $3.75
Flex Entrée en cache $0.0375 $0.075
Priority Entrée $1.35 $2.70
Priority Sortie, jetons de raisonnement inclus $6.75 $13.50
Priority Entrée en cache $0.135 $0.27

Google Search Grounding comprend 5 000 recherches gratuites par mois partagées entre les modèles Gemini 3.x, puis coûte $14 pour 1 000 requêtes. Google Maps Grounding partage 5 000 prompts gratuits et applique ensuite le même tarif.

Au tarif Standard de lancement, 100K jetons d'entrée et 10K de sortie coûtent environ $0.1125, hors cache, outils, stockage et relances. Un million de jetons en cache plus 100K en sortie coûte environ $0.45, hors stockage. Les deux exemples doublent après la période promotionnelle.

Comparaison horizontale complète des benchmarks

La fiche modèle de Google d'août 2026 compare Gemini 3.7 Flash à Gemini 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra et Muse Spark 1.2. Une valeur supérieure est meilleure dans chaque ligne ; un tiret indique un résultat non publié.

Benchmark Gemini 3.7 Flash Gemini 3.6 Flash Claude Sonnet 5 GPT-5.6 Terra Muse Spark 1.2
Artificial Analysis Intelligence Index 56 52 55 57 57
FrontierCode 1.1 Main 43.6% 34.4% 42.7% 41.3%
DeepSWE v1.1 65.3% 48.6% 53.8% 69.6% 54.9%
Code Arena, WebDev Elo 1588 1538 1541 1523 1535
Terminal-bench 2.1 85.8% 78.0% 80.4% 87.4% 82.9%
Terminal-bench 3.0 14.9% 5.4% 14.6% 20.8%
AutomationBench, jeu privé 30.4% 17.0% 10.7% 23.6%
GDPVal-AA v2, Elo 1525 1422 1598 1578 1628
Harvey LAB-AA 90.7% 85.1% 90.1% 85.2%
GDP.pdf 34.0% 22.0% 28.0% 24.7% 16.0%
CharXiv Reasoning, sans outils 84.5% 85.2% 77.0% 85.9%
CharXiv Reasoning, avec outils 88.7% 89.4% 88.3%
LVBench 85.4% 84.2% 68.5% 78.9%
GDM-MRCR v2, moyenne 128K 97.0% 91.8% 81.5% 93.5%
OSWorld 2.0 47.9% 33.8% 50.2%
Agent's Last Exam 26.3% 24.2% 33.3% 28.0%
HLE-Verified 53.6% 51.2% 31.0% 51.1%
BioMysteryBench, résoluble par l'humain 87.1% 80.6% 87.5% 83.8%
BioMysteryBench, difficile pour l'humain 43.5% 41.2% 34.1% 49.4%
LABBench2 82.1% 76.1% 80.1% 81.2%

Ces chiffres sont utiles sans constituer un tournoi indépendant aux conditions identiques. Google indique que les scores Gemini sont généralement en pass@1 avec échantillonnage par défaut. Les résultats non Gemini sont déclarés par leurs fournisseurs sauf mention contraire, avec le niveau de raisonnement maximal privilégié. Plusieurs tests sont internes et diffèrent par leur harness, leurs outils, leur agrégation et même leur nombre d'images vidéo.

Analyse des capacités et des performances

Face à Gemini 3.6 Flash, le gain est large : FrontierCode progresse de 9,2 points, DeepSWE de 16,7, AutomationBench de 13,4, GDP.pdf de 12 et OSWorld de 14,1. Code Arena gagne 50 Elo et GDM-MRCR passe de 91,8% à 97,0%.

La comparaison entre familles est plus nuancée :

  • Gemini 3.7 Flash mène FrontierCode, Code Arena, AutomationBench, Harvey LAB-AA, GDP.pdf, LVBench, GDM-MRCR, HLE-Verified et LABBench2.
  • GPT-5.6 Terra reste devant sur DeepSWE, les deux Terminal-bench, CharXiv sans outils, OSWorld et le volet difficile de BioMysteryBench.
  • Claude Sonnet 5 mène Agent's Last Exam et devance légèrement le volet résoluble de BioMysteryBench.
  • Muse Spark 1.2 mène GDPVal-AA et partage la tête de l'Artificial Analysis, mais de nombreuses lignes manquent.
  • Gemini 3.7 ne bat pas toujours 3.6 : CharXiv recule de 0,7 point avec et sans outils.

En pratique, 3.7 Flash est très équilibré à son prix de lancement. C'est un bon candidat par défaut pour les agents de code, les workflows navigateur ou bureau, les documents longs, l'analyse multimodale et le travail intellectuel à volume élevé. GPT-5.6 Terra mérite un test direct pour l'ingénierie longue et le terminal ; Claude Sonnet 5 reste compétitif sur le bureau ; Muse Spark est fort en travail intellectuel mais sa comparaison est incomplète.

Paramètres, contexte et multimodalité

Google ne publie ni le nombre total ou actif de paramètres, ni le nombre d'experts, l'architecture, la taille du corpus ou le calcul d'entraînement. La fiche officielle précise seulement que 3.7 Flash repose sur 3.6 Flash avec des améliorations algorithmiques. Tout chiffre exact présenté comme un fait serait spéculatif.

Le contrat API fournit les paramètres fiables :

  • 1 048 576 jetons en entrée et 65 536 en sortie ;
  • texte, image, vidéo, audio et PDF en entrée, texte en sortie ;
  • low, medium et high ; minimal renvoie une erreur ;
  • fonctions, sortie structurée, Search, Maps, code, recherche de fichiers, URL Context, cache et Computer Use en preview ;
  • pas de Live API, de génération audio ni d'image.

Une fenêtre de 1M représente une capacité, pas une cible. Les prompts longs augmentent toujours latence et coût ; une meilleure récupération ne remplace pas la conservation de l'état de référence, la compression de l'historique et la vérification des effets de bord.

Appeler Gemini 3.7 Flash

Le guide Google utilise l'API Interactions et documente medium comme niveau par défaut :

export GEMINI_API_KEY="<YOUR_GEMINI_API_KEY>"

curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "model": "gemini-3.7-flash",
    "input": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary.",
    "generation_config": {
      "thinking_level": "medium"
    }
  }'

Modelflare expose actuellement l'ID exact via Chat Completions compatible OpenAI :

export MODELFLARE_API_KEY="<YOUR_MODELFLARE_API_KEY>"

curl "https://origin.modelflare.dev/v1/chat/completions" \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [
      {
        "role": "user",
        "content": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary."
      }
    ]
  }'

Les deux exemples utilisent des protocoles différents. Les outils natifs Google et les champs Interactions ne sont pas tous automatiquement disponibles via un adaptateur OpenAI.

Migration et production

Le guide Google demande de retirer temperature, top_p et top_k, de remplacer thinking_budget par l'énumération thinking_level et de supprimer candidate_count. Les dialogues Interactions en plusieurs tours doivent utiliser previous_interaction_id côté serveur.

Avant de remplacer un modèle :

  1. épinglez gemini-3.7-flash et refusez toute substitution silencieuse ;
  2. rejouez un jeu fixe et non sensible sur le modèle actuel et 3.7 ;
  3. comparez low, medium et high par coût de tâche réussie et durée totale ;
  4. testez séparément streaming, sortie structurée, fonctions, multimodal, annulation et refus ;
  5. conservez les signatures de pensée et identifiants de corrélation exigés ;
  6. vérifiez cache, relances, timeouts et protection contre les effets dupliqués ;
  7. journalisez modèle, route, entrée, cache, sortie, outils, latence et montant ;
  8. gardez une route de repli jusqu'à validation par le trafic réel.

Un HTTP 200 prouve uniquement qu'une requête s'est terminée, pas la parité de protocole, une latence stable, des outils corrects ou un coût inférieur par tâche réussie.

Gemini 3.7 Flash sur Modelflare

Lors du contrôle de production du 15 août 2026, le catalogue public Modèles et tarifs de Modelflare listait gemini-3.7-flash dans gemini-stable. Il indiquait generateContent natif Gemini et Chat Completions compatible OpenAI, mais pas de route Responses.

Le multiplicateur affiché était 0.15x. Le tarif promotionnel Google, le prix de référence configuré sur Modelflare, l'accès au groupe et le montant final sont des faits distincts susceptibles d'évoluer séparément. La page en direct et une requête non sensible terminée font foi.

En production, créez ou mettez à jour une clé éligible, utilisez l'ID exact et validez les fonctions de protocole réellement utilisées avant de déplacer le trafic.

Conclusion

Gemini 3.7 Flash améliore réellement 3.6 Flash au même prix temporaire. Son avantage est sa polyvalence : code de production, web, agents à outils, documents complexes, entrées multimodales, contexte long et Computer Use progressent sans tarif premium.

Il ne gagne pas tous les benchmarks, son nombre de paramètres reste inconnu et la remise s'arrête fin 2026. Le bon choix consiste à le comparer au modèle qui traite déjà les tâches réelles, puis à décider selon le taux de réussite, la latence, les relances et le coût total plutôt qu'un indice unique.

Sources officielles et mise à jour

Sources primaires :

Mise à jour :

  • 15 août 2026 : première publication. Spécifications, capacités, méthode, tarifs, migration et disponibilité Modelflare vérifiés.