Gemini 3.7 Flash: Spezifikationen, Benchmarks, Preise und Vergleich

Faktengeprüfte Analyse von Gemini 3.7 Flash mit 1M-Kontext, 64K-Ausgabe, Fähigkeiten, offiziellen Preisen, Vergleich mit 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra und Muse Spark 1.2 sowie Migration.

Google veröffentlichte Gemini 3.7 Flash am 13. August 2026, nur drei Wochen nach Gemini 3.6 Flash. Das Modell ist unter der stabilen ID gemini-3.7-flash allgemein verfügbar und wird als Googles leistungsfähigstes Flash-Modell für Coding, Agenten, multimodales Reasoning und zuverlässige mehrstufige Ausführung positioniert.

Neu sind weder ein größeres Kontextfenster noch eine veröffentlichte Parameterzahl. Gemini 3.7 Flash bleibt in der Klasse mit 1M Eingabe- und 64K Ausgabetokens, erzielt laut Google aber deutliche Fortschritte bei Code, Werkzeugnutzung, Wissensarbeit, Dokumentverständnis und Computer Use. Der Einführungspreis entspricht weiterhin dem von 3.6 Flash.

Diese Analyse trennt offizielle Spezifikationen, von Google veröffentlichte Benchmarks, den befristeten Einführungspreis und die aktuelle Modelflare-Verfügbarkeit. Veränderliche Angaben wurden am 15. August 2026 geprüft.

Gemini 3.7 Flash im Überblick

Eigenschaft Offizielle Angabe
Veröffentlichung 13. August 2026
API-Status Allgemein verfügbar; stabile Modell-ID
Modell-ID gemini-3.7-flash
Grundlage Gemini 3.6 Flash mit algorithmischen Verbesserungen
Eingabemodalitäten Text, Bild, Video, Audio und PDF
Ausgabemodalität Text
Maximale Eingabe 1.048.576 Tokens
Maximale Ausgabe 65.536 Tokens
Thinking-Stufen low, medium, high; medium ist dokumentierter Standard
Wissensstand März 2026; einzelne Bereiche können auf Januar 2025 begrenzt sein
Parameterzahl Nicht veröffentlicht
Letztes dokumentiertes Update August 2026

Unterstützt werden Kontext-Caching, Codeausführung, Computer Use als Preview, Dateisuche, Function Calling, Grounding mit Google Maps und Search, strukturierte Ausgaben, Thinking und URL Context. Batch, Flex und Priority stehen ebenfalls bereit. Audio- und Bilderzeugung sowie die Live API werden nicht unterstützt.

Was sich gegenüber Gemini 3.6 Flash tatsächlich ändert

Gemini 3.7 Flash ist eine Weiterentwicklung von 3.6 Flash und keine neue Kontext- oder Modalitätsklasse. Google führt die Fortschritte auf algorithmische Verbesserungen der Reasoning-Grundlage und Feedback aus produktiven Anwendungen zurück.

Die praktischen Änderungen:

  • höhere Treffergenauigkeit im ersten Versuch bei Code und Software Engineering;
  • bessere Designtreue beim Umsetzen von Screenshots, Bildern oder Designsystemen;
  • zuverlässigere Planung, Tool-Aufrufe, Hindernisbehandlung und Klärung der Absicht;
  • stärkeres Reasoning über komplexe Finanz-, Rechts- und Biowissenschaftsdokumente;
  • bessere Langkontextleistung und agentische Computerbedienung;
  • derselbe Standard-Einführungspreis wie 3.6 Flash bis zum 31. Dezember 2026.

Damit ist 3.7 zum Start kein teurerer Ersatz für 3.6. Die Migration sollte vor allem Verhalten, Latenz und Kompatibilität bewerten, nicht einen Token-Aufpreis.

Offizielle API-Preise

Die folgenden Preise gelten für den bezahlten Tarif in US-Dollar. Tokenpreise beziehen sich auf eine Million Tokens, Cache-Speicher auf eine Million Tokens pro Stunde.

Modus Messgröße Bis 31. Dez. 2026 Ab 1. Jan. 2027
Standard Eingabe $0.75 $1.50
Standard Ausgabe einschließlich Thinking-Tokens $3.75 $7.50
Standard Gecachte Eingabe $0.075 $0.15
Standard Cache-Speicher pro Stunde $0.50 $1.00
Batch Eingabe $0.375 $0.75
Batch Ausgabe einschließlich Thinking-Tokens $1.875 $3.75
Batch Gecachte Eingabe $0.0375 $0.075
Flex Eingabe $0.375 $0.75
Flex Ausgabe einschließlich Thinking-Tokens $1.875 $3.75
Flex Gecachte Eingabe $0.0375 $0.075
Priority Eingabe $1.35 $2.70
Priority Ausgabe einschließlich Thinking-Tokens $6.75 $13.50
Priority Gecachte Eingabe $0.135 $0.27

Google Search Grounding umfasst monatlich 5.000 kostenlose Suchanfragen, die sich alle Gemini-3.x-Modelle teilen; danach kosten 1.000 Anfragen $14. Für Google Maps Grounding gilt ein gemeinsames Kontingent von 5.000 Prompts und anschließend derselbe Preis.

Zum Standard-Einführungspreis kosten 100K Eingabe- plus 10K Ausgabetokens etwa $0.1125, ohne Cache, Tools, Speicher oder Wiederholungen. Eine Million gecachte Eingabetokens plus 100K Ausgabe kosten rund $0.45, ohne Speicherkosten. Nach Ende der Einführung verdoppeln sich beide Beispiele.

Vollständiger horizontaler Benchmark-Vergleich

Googles Modellkarte vom August 2026 vergleicht Gemini 3.7 Flash mit Gemini 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra und Muse Spark 1.2. In allen Zeilen ist ein höherer Wert besser; ein Strich bedeutet, dass kein Ergebnis veröffentlicht wurde.

Benchmark Gemini 3.7 Flash Gemini 3.6 Flash Claude Sonnet 5 GPT-5.6 Terra Muse Spark 1.2
Artificial Analysis Intelligence Index 56 52 55 57 57
FrontierCode 1.1 Main 43.6% 34.4% 42.7% 41.3%
DeepSWE v1.1 65.3% 48.6% 53.8% 69.6% 54.9%
Code Arena, WebDev Elo 1588 1538 1541 1523 1535
Terminal-bench 2.1 85.8% 78.0% 80.4% 87.4% 82.9%
Terminal-bench 3.0 14.9% 5.4% 14.6% 20.8%
AutomationBench, privater Satz 30.4% 17.0% 10.7% 23.6%
GDPVal-AA v2, Elo 1525 1422 1598 1578 1628
Harvey LAB-AA 90.7% 85.1% 90.1% 85.2%
GDP.pdf 34.0% 22.0% 28.0% 24.7% 16.0%
CharXiv Reasoning, ohne Tools 84.5% 85.2% 77.0% 85.9%
CharXiv Reasoning, mit Tools 88.7% 89.4% 88.3%
LVBench 85.4% 84.2% 68.5% 78.9%
GDM-MRCR v2, 128K-Mittel 97.0% 91.8% 81.5% 93.5%
OSWorld 2.0 47.9% 33.8% 50.2%
Agent's Last Exam 26.3% 24.2% 33.3% 28.0%
HLE-Verified 53.6% 51.2% 31.0% 51.1%
BioMysteryBench, menschlich lösbar 87.1% 80.6% 87.5% 83.8%
BioMysteryBench, menschlich schwierig 43.5% 41.2% 34.1% 49.4%
LABBench2 82.1% 76.1% 80.1% 81.2%

Diese Zahlen sind nützlich, bilden aber kein vollständig unabhängiges Turnier unter gleichen Bedingungen. Google nennt für Gemini meist pass@1 mit Standard-Sampling. Ergebnisse anderer Anbieter sind, sofern nicht anders vermerkt, selbst berichtet; bevorzugt wird die höchste verfügbare Reasoning-Stufe. Mehrere Tests wurden intern ausgeführt, wobei Harness, Tools, Aggregation und sogar die Video-Framezahl variieren.

Analyse von Fähigkeiten und Leistung

Gegenüber Gemini 3.6 Flash ist der Sprung breit: FrontierCode steigt um 9,2 Prozentpunkte, DeepSWE um 16,7, AutomationBench um 13,4, GDP.pdf um 12 und OSWorld um 14,1 Punkte. Code Arena gewinnt 50 Elo, GDM-MRCR steigt von 91,8% auf 97,0%.

Der Vergleich mit anderen Modellfamilien ist differenzierter:

  • Gemini 3.7 Flash führt bei FrontierCode, Code Arena, AutomationBench, Harvey LAB-AA, GDP.pdf, LVBench, GDM-MRCR, HLE-Verified und LABBench2.
  • GPT-5.6 Terra liegt vorn bei DeepSWE, beiden Terminal-bench-Versionen, CharXiv ohne Tools, OSWorld und dem schwierigen BioMysteryBench-Teil.
  • Claude Sonnet 5 führt bei Agent's Last Exam und knapp beim menschlich lösbaren BioMysteryBench-Teil.
  • Muse Spark 1.2 führt bei GDPVal-AA und teilt sich den Artificial-Analysis-Spitzenwert, hat aber viele nicht gemeldete Ergebnisse.
  • Gemini 3.7 schlägt 3.6 nicht überall: CharXiv liegt mit und ohne Tools jeweils 0,7 Punkte niedriger.

Praktisch ist 3.7 Flash für seinen Einführungspreis ungewöhnlich ausgewogen. Es eignet sich als Standardkandidat für Coding-Agenten, Browser- und Desktopabläufe, lange Dokumente, multimodale Analyse und skalierte Wissensarbeit. GPT-5.6 Terra sollte für langfristiges Software Engineering und Terminalagenten direkt getestet werden; Claude Sonnet 5 bleibt bei Desktopagenten konkurrenzfähig; Muse Spark zeigt starke Wissensarbeit, aber ein unvollständiges Vergleichsbild.

Parameter, Kontext und Multimodalität

Google nennt weder Gesamt- oder aktive Parameterzahl noch Expertenzahl, Architekturdetails, Korpusgröße oder Trainingsrechenleistung. Die offizielle Karte sagt lediglich, dass 3.7 Flash auf 3.6 Flash basiert und algorithmisch verbessert wurde. Jede konkrete Parameterzahl wäre Spekulation.

Verlässlich ist der API-Vertrag:

  • 1.048.576 Eingabe- und 65.536 Ausgabetokens;
  • Text, Bild, Video, Audio und PDF als Eingabe, Text als Ausgabe;
  • low, medium und high; minimal erzeugt einen Fehler;
  • Function Calling, strukturierte Ausgabe, Search, Maps, Codeausführung, Dateisuche, URL Context, Caching und Computer Use als Preview;
  • keine Live API, Audio- oder Bilderzeugung.

Ein 1M-Kontext ist Kapazität, kein Zielwert. Lange Prompts erhöhen weiterhin Latenz und Kosten; bessere Retrieval-Leistung ersetzt weder verbindlichen Zustand noch History-Kompaktierung und Prüfung von Tool-Nebenwirkungen.

Gemini 3.7 Flash aufrufen

Googles Startleitfaden nutzt die Interactions API und dokumentiert medium als Standard:

export GEMINI_API_KEY="<YOUR_GEMINI_API_KEY>"

curl "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -X POST \
  -d '{
    "model": "gemini-3.7-flash",
    "input": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary.",
    "generation_config": {
      "thinking_level": "medium"
    }
  }'

Modelflare stellt die exakte ID derzeit über OpenAI-kompatible Chat Completions bereit:

export MODELFLARE_API_KEY="<YOUR_MODELFLARE_API_KEY>"

curl "https://origin.modelflare.dev/v1/chat/completions" \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [
      {
        "role": "user",
        "content": "Review this retrying payment workflow for race conditions and propose a safe transaction boundary."
      }
    ]
  }'

Die Beispiele verwenden unterschiedliche Protokolle. Nicht jedes Google-native Tool und nicht jedes Interactions-Feld ist automatisch über einen OpenAI-kompatiblen Adapter verfügbar.

Migration und Produktionshinweise

Google verlangt, temperature, top_p und top_k zu entfernen, thinking_budget durch thinking_level zu ersetzen und das nicht unterstützte candidate_count zu löschen. Mehrstufige Interactions-Dialoge sollen serverseitig previous_interaction_id verwenden.

Vor einem Modellwechsel:

  1. die exakte ID gemini-3.7-flash festlegen und stille Alias-Ersetzung ablehnen;
  2. einen festen, datenschutzsicheren Aufgabensatz mit bisherigem Modell und 3.7 wiederholen;
  3. low, medium und high nach Kosten erfolgreicher Aufgaben und Gesamtdauer vergleichen;
  4. Streaming, strukturierte Ausgabe, Funktionen, Multimodalität, Abbruch und Ablehnung getrennt testen;
  5. Thought Signatures und Korrelationsfelder des gewählten Protokolls erhalten;
  6. Cache, Wiederholungen, Timeouts und Schutz vor doppelten Nebenwirkungen prüfen;
  7. Modell, Route, Eingabe, Cache, Ausgabe, Tools, Latenz und Endpreis protokollieren;
  8. eine Rückfallroute behalten, bis echter Traffic die Akzeptanzgrenze erreicht.

HTTP 200 beweist nur den Abschluss einer Anfrage, nicht Protokollparität, stabile Latenz, korrekte Tools oder geringere Kosten je erfolgreicher Aufgabe.

Gemini 3.7 Flash bei Modelflare

Bei der Produktionsprüfung am 15. August 2026 führte der öffentliche Modelflare-Katalog Modelle und Preise die genaue ID gemini-3.7-flash in gemini-stable. Aufgeführt waren Gemini-natives generateContent und OpenAI-kompatible Chat Completions, aber keine Responses-Route.

Der angezeigte Gruppenmultiplikator lag bei 0.15x. Googles Aktionstarif, der in Modelflare konfigurierte Referenzpreis, Gruppenzugriff und Endabrechnung sind getrennte Fakten und können unabhängig variieren. Maßgeblich sind die Live-Preisseite und eine abgeschlossene, nicht vertrauliche Anfrage.

Für Produktion sollte ein berechtigter Key mit exakter Modell-ID verwendet und jede tatsächlich benötigte Protokollfunktion geprüft werden, bevor Traffic verschoben wird.

Fazit

Gemini 3.7 Flash ist ein substanzielles Upgrade von 3.6 Flash zum gleichen befristeten Preis. Seine Stärke ist die Breite: Produktionscode, Webentwicklung, Tool-Agenten, komplexe Dokumente, multimodale Eingaben, Langkontext und Computer Use verbessern sich ohne Premiumpreis.

Es gewinnt nicht jeden Benchmark, die Parameterzahl bleibt unbekannt und der Rabatt endet 2026. Sinnvoll ist ein Vergleich mit dem bisher eingesetzten Modell anhand realer Aufgaben, Abschlussrate, Latenz, Wiederholungen und Gesamtkosten statt eines einzigen Indexwerts.

Offizielle Quellen und Aktualisierung

Primärquellen:

Aktualisierung:

  • 15. August 2026: Erstveröffentlichung. Spezifikationen, Fähigkeiten, Methodik, Preise, Migration und Modelflare-Verfügbarkeit wurden geprüft.