DeepSeek V4.1 Flash im Detail: Architektur, Preise bei Modelflare und Rivalen
Eine quellenbasierte Analyse von DeepSeek V4.1 Flash zu Architektur, Kontext von 1M, Ausgabe von 384K, Agent-Benchmarks, API-Grenzen, dem Vergleich mit OpenAI und Anthropic sowie der aktuellen Verfügbarkeit und den Preisen auf Modelflare.

DeepSeek V4.1 Flash ist ein günstiges multimodales Modell mit offenen Gewichten, gebaut für lange Agent-Schleifen. Veröffentlicht am September 10, 2026, verbindet es ein Kontextfenster von einer Million Token, bis zu 384K Ausgabe-Token, eine ungewöhnlich günstige offizielle API und eine Architektur, die die Verarbeitung von Prompts und den Druck auf den KV-Cache senkt. Sein klarster Vorteil ist nicht, dass es jeden Benchmark gewinnt. Er ist die Menge an Agent-Arbeit mit langem Kontext, die es pro Dollar versuchen kann, und dabei bei Bewertungen zu Code, Terminal, Automatisierung und Werkzeugnutzung wettbewerbsfähig bleibt.
Dieses Fazit braucht Grenzen. Die Benchmark-Zahlen unten hat DeepSeek veröffentlicht, nicht unabhängig von Modelflare nachgemessen. DeepSeeks eigener Bericht sagt, das Modell liege bei den härtesten Reasoning-Fällen und Randfällen weiter hinter den größten geschlossenen Systemen. Die richtige Modell-ID der Erstanbieter-API ist deepseek-flash. DeepSeek V4.1 Flash ist auf Modelflare unter der versionierten Modell-ID deepseek-v4.1-flash-0910 live, mit Chat Completions und Responses in der öffentlichen Gruppe deepseek-stable.
Zuletzt geprüft: 2026-09-10 UTC. Preise, Aliase und Katalogstatus können sich ändern.
Die direkte Antwort: was DeepSeek V4.1 Flash ist
Die Veröffentlichung von DeepSeek definiert DeepSeek V4.1 Flash als den Produktionsersatz für die frühere Flash-Linie. Der offizielle Endpunkt nimmt deepseek-flash an. Die alten Namen deepseek-v4-flash und deepseek-v4-flash-vision-exp nimmt DeepSeek vorübergehend an und leitet sie zu Flash-Preisen an V4.1 Flash. Ab September 14, 2026 at 04:00 UTC sagt DeepSeek, Anfragen für deepseek-v4-pro werden ebenfalls an V4.1 Flash geleitet, bis eine spätere Veröffentlichung von V4.1 Pro kommt.
Diese Migrationsregel gehört zur eigenen API von DeepSeek. Modelflare benutzt die ausdrücklich mit dem Veröffentlichungsdatum gestempelte ID deepseek-v4.1-flash-0910, statt den früheren Eintrag deepseek-v4-flash still umzubenennen. Der Betreiber von Modelflare hat den Start bestätigt, und das Modell erschien um 2026-09-10 15:21 UTC sowohl im öffentlichen als auch im Origin-Preiskatalog. Clients sollten die genaue ID verwenden, die ihr Anbieter anzeigt, statt anzunehmen, ein Alias des Erstanbieters wirke unverändert durch jedes Gateway.
Die praktische Identität des Modells hat fünf Teile: multimodale Eingabe aus Bild und Text; Textausgabe; ein MoE-Rückgrat mit 552B Parametern; ein zusätzlicher Engram-Speicher mit 196B Parametern; und eine unsymmetrische Aktivierung von 8B Parametern pro Prompt-Token gegen 16B pro decodiertem Token. Der letzte Punkt ist der Kern: Eingabelastige Agent-Arbeit sollte beim wiederholten Prefill weniger Rechenleistung verbrauchen als ein symmetrischer Nur-Decoder-Entwurf ähnlicher Größe.
Die Spezifikation auf einen Blick
Die folgenden Werte stammen aus der offiziellen Veröffentlichung, der Modellkarte und dem technischen Bericht. „Rückgrat-Parameter“ und „Engram-Parameter“ beschreiben verschiedene Speicher; keine der Zahlen ist die aktive Rechnung pro Token.
| Punkt | DeepSeek V4.1 Flash |
|---|---|
| Offizielle API-ID | deepseek-flash |
| Modelflare-Modell-ID | deepseek-v4.1-flash-0910 |
| Modellklasse | Multimodaler Mixture-of-Experts-Transformer |
| Eingabe / Ausgabe | Text und Bilder hinein; Text hinaus |
| Transformer-Aufbau | 40 Schichten: kausaler Encoder mit 20 Schichten + Decoder mit 20 Schichten |
| Parameterspeicher | Rückgrat 552B + bedingter Engram-Speicher 196B |
| Aktive Parameter | 8B pro Prefill-Token; 16B pro Decode-Token |
| Kontext / maximale Ausgabe | 1M / 384K Token |
| Vortraining | 45T Token eines multimodalen Korpus; Verhältnis nur Text zu multimodal 7:1 |
| Hauptentwurf für Aufmerksamkeit und Cache | CED + CSA2 + globales KV in FP4; lokales SWA-KV in FP8 |
| Globaler KV-Fußabdruck | 890 Byte pro Token, von DeepSeek berichtet |
| Öffentliche Reasoning-Voreinstellungen | low = 50, high = 75, max = 100 auf der internen Effort-Skala |
| Offizielle Grenze der API-Nebenläufigkeit | 2,500 gleichzeitige Anfragen |
| Lizenz | MIT-Lizenz für den Checkpoint |
Die Ausgabeobergrenze von 384K ist das Dreifache des Maximums von 128K, das für die aktuellen Vergleichsmodelle von OpenAI und Anthropic in diesem Artikel veröffentlicht ist. Sie ist eine Grenze, keine Empfehlung: sehr lange Ausgabe erhöht Latenz, Kosten und die Fläche für Drift. Für lange Agents ist die nützlichere Frage, ob das Modell Anforderungen behalten und nach Werkzeugaufrufen echte Abnahmen bestehen kann.
Warum die Architektur für lange Agent-Schleifen gebaut ist
Ein Agent, der Werkzeuge benutzt, fügt seiner Historie wiederholt Beobachtungen, Befehlsergebnisse und Änderungen hinzu. Jede neue Runde kann Prefill des Prompts verlangen, Aufmerksamkeit über einen wachsenden Kontext, KV-Speicher und neue Ausgabe. DeepSeek V4.1 Flash greift jede Kostenart getrennt an, statt sich auf ein einziges kleineres Modell zu verlassen.
| Agent-Kosten | Mechanismus von V4.1 Flash | Beabsichtigte Wirkung |
|---|---|---|
| Lange Prompts erneut verarbeiten | Causal Encoder-Decoder (CED) | Halbiert in der Analyse von DeepSeek die asymptotische Prefill-Arbeit langer Sequenzen nahezu |
| Globale Historie im HBM halten | Wiederverwendung über Schichten bei CSA2 + FP4 | Verringert doppelte globale KV-Einträge und Byte pro Eintrag |
| Lokalen Aufmerksamkeitszustand behalten | SWA Bounded Replay | Baut ein begrenztes lokales Fenster neu auf, statt den vollen lokalen Cache jeder Schicht zu speichern |
| Stabile Token-Muster abrufen | Engram | Legt bedingten n-Gramm-Speicher in dünn zugegriffene Tabellen |
| Token erzeugen | Spekulatives Decoding mit DSpark | Entwirft mehrere Kandidatenpositionen und wählt eine Verifikationslänge nach Konfidenz und Systemlast |
| Bilder behandeln | DeepSeek-ViT + Projektor | Wandelt visuelle Eingaben in Einbettungen, die vom Vortraining an zusammen mit Text verarbeitet werden |
Diese Mechanismen verbessern vor allem die Ökonomie des Betriebs und den Durchsatz. Sie beweisen für sich nicht besseres Reasoning. Die Qualität des Modells hängt auch von Daten, Nachtraining, dem Agent-Harness und davon ab, wie viel Inferenz-Effort gekauft wird.
CED: die Prompt-Verarbeitung schneiden, bevor der Cache angefasst wird
Der technische Bericht teilt 40 Transformer-Schichten in einen kausalen Encoder mit 20 Schichten und einen Decoder mit 20 Schichten. Die ersten zwei Schichten benutzen nur ein gleitendes Fenster von 128 Token. Die übrigen Schichten verbinden lokale Aufmerksamkeit im gleitenden Fenster mit komprimiertem globalem Kontext.
Bei globaler Aufmerksamkeit baut der Decoder nicht auf jeder Schicht eine eigene volle KV-Historie. Seine globalen Keys und Values werden aus dem letzten verborgenen Zustand des Encoders projiziert. Zustände des lokalen gleitenden Fensters bleiben schichtspezifisch. DeepSeek schätzt die Prefill-Komplexität langer Sequenzen auf etwa die Hälfte des entsprechenden Weges durch alle Schichten: der dominante Term wechselt vom Verarbeiten jedes Tokens durch alle L Schichten zum Verarbeiten des globalen Kontexts durch etwa L/2, plus begrenzter Arbeit im lokalen Fenster.
Das erklärt die Aktivierungsteilung 8B/16B. Prompt-Token aktivieren beim Prefill etwa 8B Rückgrat-Parameter; neu erzeugte Token aktivieren beim Decode etwa 16B. Arbeit mit riesigen Dokumenten und kurzen Antworten profitiert mehr als Arbeit, die von Hunderttausenden erzeugter Token bestimmt wird. CED senkt die erste Hälfte dieser Rechnung; es macht das Decoding nicht kostenlos.
CSA2, FP4 und SWA Bounded Replay: die Geschichte des Speichers
Compressed Sparse Attention 2 komprimiert den Cache entlang von Sequenz, Schicht und Genauigkeit. Jede CSA2-Schicht wird statisch einer von drei Modi zugewiesen. Full berechnet das Haupt-KV, Indexer-Keys und frische Top-K-Positionen. Reindex benutzt Haupt-KV und Indexer-Keys wieder, tastet sie aber mit der eigenen Query neu ab. Reuse benutzt sowohl das geteilte KV als auch eine frühere dünne Auswahl wieder. Jede Schicht hat immer noch die eigene Query und das KV des lokalen gleitenden Fensters.
Die erste Full-Schicht des Decoders wählt Top-512-Einträge und baut einen Kandidatenpool; spätere Reindex-Schichten wählen ihre Top-512-Positionen aus diesem verkleinerten Pool. Das globale Haupt-KV benutzt eine Darstellung E2M1 von etwa vier Bit, mit einer Skala E4M3 je 16 Kanäle. DeepSeek behält FP8 für den gegenüber Quantisierung empfindlicheren lokalen SWA-Cache.
| Cache-Schicht | Genauigkeit / Lebensdauer | Berichtetes Ergebnis | Was es nicht garantiert |
|---|---|---|---|
| Globales KV zur Laufzeit | FP4, resident im HBM | 890 Byte/Token; etwa 1/4 von V4 Flash und 437× kleiner als V1 | Perfekte dünne Auswahl bei jedem Randfall |
| Lokales SWA-KV zur Laufzeit | FP8 | Bewahrt das schichtlokale Fenster von 128 Token | Vernachlässigbarer Speicher bei beliebiger Nebenläufigkeit |
| Dauerhaftes globales KV | Host-Speicher oder SSD im Betrieb von DeepSeek | Langlebiger wiederverwendbarer globaler Zustand | Eine feste Aufbewahrungszeit an der öffentlichen API |
| Dauerhafter lokaler SWA-Zustand | Mit Bounded Replay neu aufgebaut | Etwa 1/8 des gesamten dauerhaften Cache-Fußabdrucks von V4 Flash bei gleicher Sequenzlänge | Genaue Wiederholung jedes verworfenen lokalen Zustands |
Der Bericht sagt, sein Betrieb behalte globales dauerhaftes KV mindestens 72 Stunden und benutze einen verteilten kurzlebigen SWA-Pool. Der öffentliche Leitfaden zum Kontext-Cache beschreibt das Anlegen des Cache als automatisch und nach bestem Bemühen, sagt, der Aufbau könne Sekunden dauern, und sagt, Einträge würden im Allgemeinen nach Stunden oder Tagen gelöscht. Produktions-Clients sollten den öffentlichen Vertrag als maßgeblich behandeln: Treffer- und Fehl-Token-Felder ansehen, statt um einen garantierten Treffer von 72 Stunden herum zu rechnen.
DeepSeek nennt selbst zwei Grenzen der Robustheit: CSA2 kann die falschen dünnen Positionen wählen, und Bounded Replay nähert verworfenen lokalen Zustand nur an. Seine Tests fanden in den bewerteten Einstellungen keine systematische Verschlechterung, aber extreme Kontexte und Grenzen beim Wiederaufnehmen des Cache bleiben Gebiete für weitere Belastungstests.
Engram, DSpark und der multimodale Weg
Engram trennt einiges Auswendiglernen von dichter Modellrechnung. V4.1 Flash legt 196B Parameter auf zwei Module bedingten Speichers an den nullindizierten Schichten 1 und 14. Jedes benutzt Token-n-Gramme der Längen zwei, drei und vier, acht Hash-Köpfe, kontextbewusstes Gating und Prefetch aus dem Host-Speicher über RDMA. Das sind gespeicherte Parameter, nicht weitere 196B Parameter, die für jedes Token aktiviert werden.
DSpark ist ein getrennt trainierter spekulativer Decoder. Drei Transformer-Blöcke sehen durch ein gleitendes Fenster von 128 Token und schlagen fünf Positionen parallel vor. Ein leichter Abhängigkeit-Kopf setzt Entwurfs-Token zueinander in Beziehung; ein Konfidenz-Kopf schätzt, wie viel vom Entwurf die Verifikation übersteht. Der Planer benutzt diese Wahrscheinlichkeiten und den gemessenen Durchsatz der Engine, um unter der aktuellen Last eine Verifikationslänge zu wählen. Das kann den Token-Durchsatz des Systems verbessern, ohne die letzte Verifikationsrolle des Rückgrats zu ändern.
Der visuelle Weg benutzt ein getrennt trainiertes DeepSeek-ViT mit zweidimensionaler rotatorischer Positionskodierung. Ein Pixel-Unshuffle von 3×3 verringert die Zahl der visuellen Token vor der Projektion in das Sprachmodell auf ein Neuntel. Der Vision-Encoder hat in der berichteten Konfiguration 32 Schichten, eine verborgene Größe von 1,024 und 16 Aufmerksamkeitsköpfe. Seine autoregressive Trainingsstufe benutzt Bilder, die zwischen 544×544 und 1,344×1,344 skaliert sind, nach einer früheren kontrastiven Stufe über etwa 47B Bild-Text-Paare.
Training und Nachtraining
DeepSeek berichtet 45T Vortrainings-Token, wobei multimodale Daten in das Training des Sprachmodells eingebunden sind. Pipelines nur für Text und multimodale Pipelines werden nach Überlappungsersatz und Deduplizierung im Token-Verhältnis 7:1 zusammengeführt. Dünne Aufmerksamkeit wird von Anfang an bei einer Sequenzlänge von 64K trainiert, ohne Aufwärmen mit dichter Aufmerksamkeit; der Kontext geht am Punkt von 34T Token auf 1M.
| Stufe | Veröffentlichtes Detail | Warum es zählt |
|---|---|---|
| Kontrastives Vortraining der Sicht | Etwa 47B Bild-Text-Paare, Phase niedriger Auflösung | Lernt breite visuelle Darstellungen vor der Einbindung der Sprache |
| Autoregressives Tuning der Sicht | 236B Token mit Bildunterschriften, Diagrammen, OCR und verwandten Daten | Fügt feinkörniges visuelles und dokumentarisches Verstehen hinzu |
| Vortraining des LLM | 45T Token; multimodale Daten von Anfang an dabei | Vermeidet, Sicht nur als späten Prompt-Adapter zu behandeln |
| Kontexttraining | Dünne Aufmerksamkeit ab 64K; bei 34T Token auf 1M erweitert | Trainiert das ausgelieferte Aufmerksamkeitsmuster, statt es erst nach dem Training umzuwandeln |
| Nachtraining | SFT, Verstärkungslernen und On-Policy-Distillation | Richtet Reasoning, Werkzeuge und Agent-Verhalten aus |
Der Bericht beansprucht keinen neuen Algorithmus für das Nachtraining. Er schreibt die Gewinne der Erzeugung synthetischer Aufgaben und Umgebungen zu, besserer Datenfilterung, überprüfbaren Belohnungen und der Größe von Architektur und Daten. Das zählt, wenn Behauptungen über „Modellarchitektur“ verglichen werden: CED und CSA2 erklären die Effizienz, während die beobachtete Agent-Leistung das Produkt des ganzen Stapels aus Training und Scaffold ist.
Reasoning-Effort: Qualität hat eine sichtbare Token-Rechnung
DeepSeek legt ein internes Effort-Kontinuum von 1 bis 100 offen und bildet die öffentlichen API-Voreinstellungen low, high und max auf 50, 75 und 100 ab. Kompatibilitätseingaben bilden minimal und low auf low ab; medium, high und xhigh auf high; und max oder ultra auf max. Thinking steht standardmäßig auf high.
In dem von DeepSeek berichteten Durchlauf hob Effort von 25 auf 100 das Durchschnittsergebnis über acht Reasoning-Bewertungen von 67.1% auf 76.3%, DeepSWE von 66.0% auf 74.2% und Terminal-Bench 2.1 von 82.4% auf 90.6%. Die Ausgabe-Token wuchsen um etwa 2.5×. Der Bereich 60–80 fing den größten Teil der Qualität bei weniger als der Hälfte des maximalen Token-Budgets ein; der letzte Schritt auf 100 verlängerte Agent-Trajektorien um 1.6–1.8× für kleinere Gewinne.
Das ist eine der nützlichsten Steuerungen des Modells. Nutzen Sie low für Klassifikation, Extraktion und Erkundung, die sich wiederholen lässt; high für gewöhnliches Programmieren und Recherche; reservieren Sie max für Aufgaben, bei denen ein weiterer Versuch oder ein verpasster Randfall mehr kostet als die zusätzlichen Token. Behandeln Sie das als Anfangshypothesen und messen Sie die Kosten je angenommener Aufgabe.
Im Thinking-Modus werden Temperature und Presence- sowie Frequency-Strafen ignoriert, und top_p hat ein Minimum von 0.95. Mit Werkzeugen müssen Clients das vollständige reasoning_content aus der Assistant-Nachricht zusammen mit den Werkzeugergebnissen zurückgeben; es wegzulassen, ergibt eine Antwort 400. Diese Zustandsregel ist wichtiger, als einen vertrauten Parametersatz von OpenAI zu kopieren.
Benchmark-Vergleich mit OpenAI und Anthropic
Diese Tabelle gibt ausgewählte Ergebnisse aus Tabelle 3 des technischen Berichts von DeepSeek wieder. Alle Modelle stehen auf der Max-Einstellung des Berichts. DeepSeek hat für manche Bewertungen verschiedene verlangte oder offizielle Scaffolds benutzt, einen DeepSeek-Harness-Kontext von 1M für Code und einen Claude-Code-Kontext von 512K für visuelle Agent-Aufgaben. Die Zahlen sind vom Anbieter berichtete Belege, kein unabhängiger Direktvergleich und kein Produktions-SLA.
| Prüfung | V4 Flash | V4 Pro | V4.1 Flash | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|---|
| GPQA Diamond, Pass@1 | 89.9 | 92.4 | 90.9 | 94.1 | 93.4 |
| Terminal-Bench 2.1, Pass@1 | 82.7 | 87.9 | 90.6 | 88.8 | 89.1 |
| Terminal-Bench 3.0, Pass@1 | 7.6 | 11.8 | 30.0 | 34.4 | 43.3 |
| Terminal-Bench 4.0, Pass@1 | 7.0 | 12.4 | 31.2 | 39.9 | 51.8 |
| DeepSWE v1.1, resolved | 54.4 | 62.7 | 74.2 | 73.0 | 74.0 |
| CyberGym, Pass@1 | 76.7 | 83.3 | 88.1 | 84.5 | — |
| HLE with tools, Pass@1 | 51.5 | 60.0 | 63.9 | — | 63.6 |
| AutomationBench, Pass@1 | 37.7 | 43.2 | 54.8 | 45.8 | 50.3 |
| Agents' Last Exam, Pass@1 | 25.2 | 25.7 | 31.8 | 26.7 | 28.6 |
| Chartography with tools, Pass@1 | — | — | 78.9 | 79.9 | 84.0 |
Die stärkste Lesart ist konkret. V4.1 Flash macht bei Agent-Aufgaben einen großen Schritt über V4 Flash und ist mit GPT-5.6 Sol und Claude Opus 5 bei DeepSWE, Terminal-Bench 2.1, Automatisierung und HLE mit Werkzeugen wettbewerbsfähig. Es führt nicht bei GPQA, späteren Terminal-Bench-Versionen oder Chartography. Der Bericht selbst warnt, dass nahe Parität bei gewöhnlichen Aufgaben nicht Frontier-Parität bei den härtesten Reasoning-Fällen und Randfällen heißt.
GPT-6 Astra und Claude Fable 5.1 fehlen in dieser Punktetabelle, weil der Bericht von DeepSeek für sie nicht dieselben Vergleichsdaten Zeile für Zeile veröffentlicht. Punktzahlen von getrennten Anbieterseiten hinzuzufügen, würde ein falsches gemeinsames Harness erzeugen. Teams sollten alle Kandidaten an denselben Repository-Aufgaben, Werkzeugen, Zeitlimits, derselben Netzregel und denselben Abnahmeprüfungen bewerten.
Die API-Kompatibilität ist breit, aber nicht identisch
Der offizielle Dienst legt OpenAI Chat Completions, OpenAI Responses und eine mit Anthropic kompatible API offen. Diese Breite senkt die Migrationsarbeit, aber Kompatibilität beschreibt die Form der Anfrage, nicht identische Semantik des Lebenszyklus.
| Oberfläche | Verhalten von DeepSeek V4.1 Flash | Folge für die Migration |
|---|---|---|
| Chat Completions | Streaming, JSON-Ausgabe, Funktionsaufrufe; Prefix/FIM im Modus ohne Thinking | Bestehende Clients von OpenAI sind der einfachste Anfang |
| Responses | Zustandslos; Funktionen und Bilder werden unterstützt | Speichern Sie die volle Unterhaltung selbst |
| Zustandsfelder von Responses | previous_response_id, Unterhaltungen, store, Hintergrund und Kontextverwaltung werden nicht unterstützt oder ignoriert |
Eine Antwort 200 beweist nicht, dass diese Funktionen gegriffen haben |
| Gehostete Werkzeuge | Web Search, File Search, Code Interpreter, Computer Use und eingebaute MCP-Werkzeuge werden ignoriert; die Unterstützung für Custom Tool ist begrenzt | Führen Sie Werkzeuge in der Anwendung aus und prüfen Sie jedes verlangte Feld |
| Reasoning-Zusammenfassungen | Summary und verschlüsselte Reasoning-Inhalte werden nicht unterstützt | Verlassen Sie sich nicht auf Übergabefelder im Stil von OpenAI |
| Format von Anthropic | Die Nachrichtenform von Anthropic wird angenommen | Bewahren Sie die Reasoning- und Werkzeugzustandsregeln von DeepSeek, statt Semantik von Claude anzunehmen |
| Sicht | Bilder werden in der Nutzereingabe und in Werkzeugausgaben angenommen | Prüfen Sie Nutzlastgröße, Detail-Modus und Bildzahl |
Der Responses-Leitfaden von DeepSeek listet auch ignorierte Felder wie Metadata, Prompt-Vorlagen, Truncation, Service Tier, Safety Identifier, Prompt-Cache-Key und Retention sowie Stream-Optionen. Stilles Ignorieren ist eine Kompatibilitätsgefahr: dass ein Schema angenommen wird, kann fehlendes Verhalten verdecken. Bauen Sie für jede Fähigkeit, von der Ihre Anwendung abhängt, eine Konformitätsanfrage. Der Leitfaden zur mit OpenAI kompatiblen API erklärt, warum Form des Endpunkts und Fähigkeit getrennte Prüfungen brauchen.
Die aktuellen Modelle von OpenAI bieten ein breiteres natives Responses-Werkzeugökosystem und verwaltete Zustandsfunktionen. Die native API von Anthropic hat einen eigenen reifen Vertrag für Thinking-Blöcke und Werkzeugnutzung. Der Vorteil von DeepSeek ist, dass ein Modell alle drei üblichen Dialekte annimmt; sein Preis ist, dass die Schnittmenge kleiner ist als die volle native Oberfläche jedes der Rivalen.
Grenzen der Sicht und Ökonomie der Bilder
Der offizielle Leitfaden zur Sicht unterstützt JPEG, PNG, GIF und WebP über Base64, externe URLs oder die Files API. Bilder werden automatisch in Richtung von grob 1,300×1,300 verkleinert und benutzen höchstens 1,024 Eingabe-Token je Bild. Detail low benutzt eine Ansicht von 512×512; high und original behalten mehr Detail; auto verhält sich derzeit wie original.
| Grenze | Offizieller Wert |
|---|---|
| Anfragekörper | 48 MiB |
| Eingebettetes oder von außen geholtes Bild | je 32 MiB |
| Per Datei-ID verwiesenes Bild | je 64 MiB |
| Bilder pro Anfrage | 600 |
| Bild-Byte zusammen | 64 MiB ohne Datei-IDs; 200 MiB mit Datei-IDs |
| Lange Kante | 8,192 px; 4,096 px, wenn 15 oder mehr Bilder gesendet werden |
| Obergrenze visueller Token | 1,024 Token pro Bild nach der Verarbeitung |
Bei den maximalen 1,024 visuellen Token trägt ein nicht gecachtes Bild etwa $0.0001536 Nebenzeit oder $0.0003072 Spitze zu den veröffentlichten Eingabepreisen bei, vor begleitendem Text und Ausgabe. Diese Rechnung ist für Größenschätzungen nützlich, aber das Verkleinern von Bildern, das Cache-Verhalten und der tatsächliche Verbrauch visueller Token können die Gebühr ändern. Mehr Bilder verbrauchen auch Kontext, der sonst Text oder Werkzeughistorie halten könnte.
V4.1 Flash eignet sich für Dokument-Screenshots, Diagramme, OCR und visuelle Beobachtungen eines Agent. Es ist kein Modell zur Bilderzeugung. Für erzeugte Bilder benutzen Sie ein Modell und einen Endpunkt, die dafür gebaut sind, Pixel zurückzugeben statt Text.
Vergleich der offiziellen API-Preise
Die Preisseite von DeepSeek hat die folgenden Sätze um 04:00 UTC am September 10 eingeführt. Spitzenfenster an Werktagen sind 01:00–04:00 und 06:00–10:00 UTC; alle anderen Werktagszeiten und das Wochenende nutzen Nebenzeitsätze. Der Kontext-Cache von DeepSeek ist automatisch, also heißt „gecachte Eingabe“ einen berichteten Cache-Treffer, nicht ein Cache-Flag, das einen erzwingt.
Die Sätze von OpenAI kommen aus seinem aktuellen Modellvergleich; die Sätze von Anthropic kommen von seiner Preisseite. Die Werte sind USD pro eine Million Token. Anthropic berechnet auch Cache-Schreibvorgänge; sie sind hier weggelassen, weil die Tabelle nur neue Eingabe, Cache-Lesevorgänge und Ausgabe vergleicht.
| Modell | Kontext / maximale Ausgabe | Neue oder verfehlte Eingabe | Gecachte / gelesene Eingabe | Ausgabe |
|---|---|---|---|---|
| DeepSeek V4.1 Flash, Nebenzeit | 1M / 384K | $0.15 | $0.003 | $0.60 |
| DeepSeek V4.1 Flash, Spitze | 1M / 384K | $0.30 | $0.006 | $1.20 |
| DeepSeek V4.1 Flash auf Modelflare | Modellgrenze 1M / 384K | $0.193548 | $0.003871 | $0.774194 |
| GPT-5.6 Luna | 1.05M / 128K | $0.20 | $0.02 | $1.20 |
| GPT-5.6 Terra | 1.05M / 128K | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Sol | 1.05M / 128K | $4.00 | $0.40 | $20.00 |
| GPT-6 Astra | 1.05M / 128K | $10.00 | $1.00 | $50.00 |
| Claude Sonnet 5 | 1M / 128K | $2.00 | $0.20 | $10.00 |
| Claude Opus 5 | 1M / 128K | $5.00 | $0.50 | $25.00 |
| Claude Fable 5.1 | 1M / 128K | $10.00 | $0.25 | $50.00 |
Preis ist für sich nicht Wert. Verschiedene Tokenizer können für denselben Text verschiedene Token-Zahlen berechnen; Anthropic merkt an, dass neuere Tokenisierung bei mancher Arbeit grob 30% mehr Token erzeugen kann. Modelle können auch verschiedene Ausgabelängen, Wiederholungen und menschliche Reparaturen brauchen. Vergleichen Sie die Kosten je angenommener Aufgabe, nicht nur die Zeile mit der kleinsten Eingabezahl.
Der aktuelle öffentliche Katalog von Modelflare zeigt einen Satz zwischen den zwei Zeitbändern von DeepSeek: er liegt bei etwa 64.5% des Erstanbieter-Spitzensatzes, oder 35.5% niedriger in Spitzenfenstern, während er etwa 29.0% über dem Nebenzeitsatz von DeepSeek liegt. Der aufgeführte Gateway-Tarif hat heute also keine Anpassung nach Zeitband; flexible Arbeit, die das Nebenzeitfenster von DeepSeek verlässlich nutzen kann, kann über die Erstanbieter-API immer noch weniger zahlen.
OpenAI wendet höhere Sätze an, wenn der Eingabekontext 272K überschreitet: die ganze Anfrage benutzt 2× Preise für Eingabe und gecachte Eingabe und 1.5× Preise für die Ausgabe. Diese Grenze zählt im Szenario mit langem Kontext unten. DeepSeek benutzt Zeitfenster; die aufgeführten Modelle von Anthropic mit einer Million Token benutzen in der zitierten Preistabelle nicht dieselbe Grenze von 272K.
Zwei nachrechenbare Kostenszenarien
Szenario A ist eine Anfrage mit 100K nicht gecachter Eingabe und 10K Ausgabe. Die Formel ist 0.1 × input rate + 0.01 × output rate. Sie nimmt keine gecachte Eingabe, keine Werkzeuge, keine Wiederholungen, keine Steuern und keine anbieterspezifischen Zuschläge an.
| Modell | Kosten in Szenario A |
|---|---|
| DeepSeek V4.1 Flash, Nebenzeit | $0.021 |
| DeepSeek V4.1 Flash auf Modelflare | $0.0271 |
| GPT-5.6 Luna | $0.032 |
| DeepSeek V4.1 Flash, Spitze | $0.042 |
| Claude Sonnet 5 | $0.300 |
| GPT-5.6 Terra | $0.320 |
| GPT-5.6 Sol | $0.600 |
| Claude Opus 5 | $0.750 |
| GPT-6 Astra / Claude Fable 5.1 | $1.500 |
Szenario B sind die Grenzkosten einer Anfrage mit warmem Cache, mit 900K gecachter Eingabe, 100K neuer Eingabe und 20K Ausgabe. Es schließt absichtlich die frühere Anfrage aus, die den Cache angelegt hat. Formel: 0.9 × cache-read rate + 0.1 × input rate + 0.02 × output rate. Die Modifikatoren von OpenAI für langen Kontext der ganzen Anfrage werden angewandt, weil der Eingabekontext zusammen eine Million Token beträgt.
| Modell | Grenzkosten in Szenario B |
|---|---|
| DeepSeek V4.1 Flash, Nebenzeit | $0.0297 |
| DeepSeek V4.1 Flash auf Modelflare | $0.0383 |
| DeepSeek V4.1 Flash, Spitze | $0.0594 |
| GPT-5.6 Luna | $0.1120 |
| Claude Sonnet 5 | $0.5800 |
| GPT-5.6 Terra | $1.1200 |
| Claude Opus 5 | $1.4500 |
| GPT-5.6 Sol | $2.1200 |
| Claude Fable 5.1 | $2.2250 |
| GPT-6 Astra | $5.3000 |
Der Vergleich hält die Token-Mengen gleich; er behauptet nicht gleiche Qualität. Der Cache von DeepSeek ist nach bestem Bemühen, während das Anlegen eines Cache bei Anthropic einen eigenen Schreibpreis und eine eigene Lebensdauer hat. Ein fairer Test der Arbeit zeichnet Cache-Treffer und Cache-Fehl-Token auf, alle Versuche, die gesamte Ausgabe einschließlich berechenbarem Reasoning, die vergangene Zeit, die Annahmerate und die Minuten menschlicher Korrektur. Der Leitfaden zur Kostennachverfolgung gibt den Rahmen der Buchführung.
Offene Gewichte machen Selbsthosting nicht klein
Die Veröffentlichung auf Hugging Face steht unter MIT-Lizenz und dokumentiert Betriebswege mit vLLM und SGLang. In dem für diesen Artikel geprüften Schnappschuss enthielt das Repository 48 Safetensor-Shards und etwa 510.3 GB Git-LFS-Dateien beim Commit dba1be0a40aa45a94ad051997016db3960a90277. Diese Byte-Zahl ist ein Download-Artefakt, nicht gemessener GPU-Speicher.
Das System hat immer noch ein Rückgrat von 552B, Engram-Speicher von 196B mit Host-Adresse, Experten-Routing, Cache-Wege in FP4/FP8, RDMA-Prefetch und dauerhaften KV-Speicher. Die Veröffentlichung von DeepSeek lädt Teams, die einen großen Betrieb mit 2,000 GPUs plus einem Speichercluster planen, ein, das Unternehmen zu kontaktieren. Dieses Beispiel zeigt die Größe des vollständigen Serving-Systems; es ist kein genanntes Minimum für jede Bereitstellung. Kleinere Forschungsbetriebe können Quantisierung oder andere Parallelität benutzen, aber sie sollten nicht aus der API-Ökonomie des Anbieters geschlossen werden.
Offene Gewichte geben Teams Zugang zum Checkpoint, Prüfbarkeit und Kontrolle über die Betriebsregel. Sie bilden nicht automatisch DeepSeeks Kernel-Fusion, Cache-Hierarchie, DSpark-Planung, Batching oder die Latenz der öffentlichen API nach. Vergleichen Sie einen Plan zum Selbsthosting mit gemessenem Durchsatz, Wiederherstellung nach Ausfall, ungenutzter Kapazität, Speicherbandbreite und Betriebsarbeit.
DeepSeek V4.1 Flash auf Modelflare
DeepSeek V4.1 Flash ist auf Modelflare live. Der vom Betreiber bestätigte Start ist unabhängig im öffentlichen Preiskatalog von Modelflare und im Origin-Katalog sichtbar. Um 2026-09-10 15:21 UTC haben beide den neuen Eintrag deepseek-v4.1-flash-0910 gezeigt; die Produktionskonfiguration zeigte eine eingeschaltete Fähigkeit deepseek-stable und eine eingeschaltete Route, die dasselbe Modell ankündigt.
| Punkt bei Modelflare | Live-Wert |
|---|---|
| Zu sendende Modell-ID | deepseek-v4.1-flash-0910 |
| Verfügbarkeit | Live im öffentlichen Katalog und in der eingeschalteten Routing-Gruppe |
| Öffentliche Gruppe | deepseek-stable |
| Eingabepreis | $0.193548 / 1M Token |
| Preis gecachter Eingabe | $0.003871 / 1M Token |
| Ausgabepreis | $0.774194 / 1M Token |
| Endpunktarten | /v1/chat/completions und /v1/responses |
Die Preise werden aus dem Basis-Eingabekoeffizienten $0.322580645 des Live-Eintrags abgeleitet, dem öffentlichen Gruppenverhältnis 0.6, dem Cache-Verhältnis 0.02 und dem Completion-Verhältnis 4×. Für die zwei oben durchgerechneten Arbeiten kostet Modelflare etwa $0.0271 beziehungsweise $0.0383. Nutzen Sie die live Preisseite von DeepSeek V4.1 Flash für die aktuelle Modell-ID und den Tarif.
Beweisstufen zählen immer noch. Der öffentliche Katalog und die eingeschaltete Produktionsroute belegen die Verfügbarkeit des Produkts, und der Betreiber hat den Start ausdrücklich bestätigt. Bis 15:30 UTC enthielten die Produktionsaufzeichnungen sechs abgeschlossene Chat-Completions-Aufrufe unter der genauen neuen Modell-ID, zusammen 216 Prompt-Token und 173 Completion-Token. Das prüft die authentisierte Zustellung von Chat Completions und berechenbare Ausgabe. Es ist immer noch eine zu kleine Startprobe, um Latenz oder Verfügbarkeit zu messen, und es beweist nicht unabhängig Responses oder multimodales Verhalten über diese Route. Teams sollten eine eigene kleine Abnahmeanfrage am genauen Endpunkt ausführen, bevor sie Produktionsarbeit verlegen.
Wo DeepSeek V4.1 Flash einen echten Vorteil hat
Das Modell hat einen zusammenhängenden Vorteil, wenn lange Eingaben, häufige Werkzeugrunden und das Budget alle zählen. Die Architektur senkt Prefill- und Cache-Druck; der API-Preis macht aus diesen Ersparnissen einen ungewöhnlich niedrigen öffentlichen Tarif; die Ausgabeobergrenze von 384K lässt Raum für lange Patches oder Berichte; und der Checkpoint hält einen Weg zum Selbsthosting offen.
| Arbeit | Warum V4.1 Flash ein starker Kandidat ist | Was zu messen ist |
|---|---|---|
| Repository-Agents | Starke vom Herausgeber berichtete Ergebnisse bei DeepSWE und am Terminal, bei niedrigen Token-Sätzen | Angenommene Änderungen, Test-Bestehensrate, Wiederholungen und Reparaturzeit |
| Lange Forschungssynthese | Eingabe 1M, billige Cache-Treffer und Ausgabe 384K | Richtigkeit der Zitate, Behalten der Anforderungen und gesamte Ausgabe |
| Visuelle Dokument-Agents | Native Bilder, Training für OCR und Diagramme und übliche Agent-APIs | Feldgenauigkeit, Empfindlichkeit von Ausschnitt und Detail und Verbrauch visueller Token |
| Automatisierung in hohem Volumen | Niedrige Preise in Spitze und Nebenzeit; Obergrenze von 2,500 gleichzeitigen Anfragen | Wartezeit in der Schlange, Rate 429, Werkzeugfehler und Kosten je Erfolg |
| Kontrollierter Betrieb | MIT-Checkpoint und dokumentierte Wege mit vLLM/SGLang | Hardware-Auslastung, Bandbreite von Cache und Speicher und Betriebskosten |
Die stärkste Produktionsbehauptung ist daher kosteneffiziente Handlungsfähigkeit bei langem Kontext, nicht „insgesamt bestes Modell“. Wenn das Modell eine echte Aufgabe in einem angenommenen Lauf abschließt, wo ein billigeres kleines Modell mehrere Reparaturen braucht, gewinnt V4.1 beim Ergebnis. Wenn ein geschlossenes Frontier-Modell einen teuren Ausfall verhindert, kann sein höherer Token-Preis immer noch wirtschaftlich sein.
Wo OpenAI oder Anthropic die sicherere Wahl bleibt
Wählen Sie ein Modell von OpenAI, wenn die Anwendung vom vollen Responses-Ökosystem abhängt, von verwaltetem Zustand, gehosteten Werkzeugen oder einem Vertrag, der spezifisch für OpenAI ist und den DeepSeek ignoriert. GPT-5.6 Luna ist ein besonders naher Preisrivale für kürzere, nicht gecachte Arbeit; Terra, Sol und Astra tauschen viel höhere Listenpreise gegen andere Fähigkeitsstufen und native Plattformfunktionen.
Wählen Sie ein Modell von Anthropic, wenn der native Werkzeug- und Thinking-Vertrag von Claude, die Cache-Steuerung oder die gemessene Leistung bei Ihrer härtesten Agent-Arbeit mehr zählt als der Listenpreis der Token. In DeepSeeks eigener Tabelle führt Claude Opus 5 bei Terminal-Bench 3/4 und Chartography; Claude Fable 5.1 ist für die anspruchsvollste Arbeit mit langem Horizont gesetzt, obwohl es pro neuem Token und pro Ausgabe-Token wesentlich teurer ist.
Bei sicherheitskritischen oder teuren Handlungen sollte die Wahl der Route auf bewerteten Ausfallarten und Rechtegrenzen beruhen, nicht auf Marke oder Benchmark-Durchschnitten. Nutzen Sie den Routing-Leitfaden, um wiederholbare Arbeit, Fallbacks und Handlungen mit Nebenwirkung zu trennen.
Checkliste für den Betrieb
- Benutzen Sie
deepseek-flashfür die Erstanbieter-API und zeichnen Sie jede gateway-spezifische Abbildung getrennt auf. - Beginnen Sie bei high Effort, dann messen Sie low und max an derselben Menge angenommener Aufgaben; bilden Sie Namen über Anbieter nicht als gleiche Rechenleistung ab.
- Wenn Werkzeuge im Thinking-Modus benutzt werden, geben Sie das volle
reasoning_contentgenau wie verlangt zurück. - Prüfen Sie jedes Responses-Feld, von dem Sie abhängen; abgelehnte und still ignorierte Parameter brauchen verschiedene Behandlung.
- Zeichnen Sie Cache-Treffer- und Cache-Fehl-Token auf, Ausgabe- und Reasoning-Token, Wiederholungen, Latenz und die endgültige Annahme.
- Entwerfen Sie die Cache-Ökonomie um beobachtete Treffer, nicht um eine Annahme fester Aufbewahrung.
- Erzwingen Sie Grenzen für Bild-Byte, Zahl, Abmessung und Detail, bevor Sie multimodale Anfragen senden.
- Halten Sie Autorisierung auf der Anwendungsseite, Idempotenz der Werkzeuge und Prüfung der Ausgabe unabhängig von der Modellqualität.
- Prüfen Sie Preise nach Zeitfenster, Modell-Aliase und Nebenläufigkeitsgrenzen vor dem Start erneut.
- Führen Sie eine echte authentisierte Anfrage auf der genauen Route aus; ein Modellkatalog oder HTTP 200 allein ist kein Beweis der Fähigkeit.
Häufig gestellte Fragen
Ist DeepSeek V4.1 Flash besser als GPT-6 Astra oder Claude Fable 5.1? Nicht als allgemeine Behauptung. V4.1 Flash hat einen großen Vorteil bei Preis und offenen Gewichten und starke vom Anbieter berichtete Agent-Punktzahlen. DeepSeek selbst sagt, die größten geschlossenen Modelle behielten einen Vorsprung bei den härtesten Reasoning-Fällen und Randfällen. Im Bericht zu V4.1 gibt es keinen Vergleich von Astra und Fable auf demselben Harness.
Wie viele Parameter hat DeepSeek V4.1 Flash? Der Bericht listet ein Rückgrat mit 552B Parametern plus 196B Engram-Parameter. Es aktiviert etwa 8B Rückgrat-Parameter pro Prefill-Token und 16B pro decodiertem Token. Nur „552B insgesamt“ zu sagen, lässt Engram weg; „748B aktiv“ zu sagen, ist auch falsch.
Was sind seine Grenzen für Kontext und Ausgabe? Die offiziellen Grenzen sind eine Million Kontext-Token und bis zu 384K Ausgabe-Token. Bildeinbettungen, Text, Werkzeughistorie und Reasoning verbrauchen alle die betreffenden Budgets.
Warum heißt es Flash? Der Entwurf zielt auf niedrigere Betriebskosten: unsymmetrische Aktivierung von Prefill und Decode, komprimierte dünne Aufmerksamkeit, globales KV in FP4, begrenzte dauerhafte Wiederholung und spekulatives Decoding. „Flash“ verspricht nicht die niedrigste Latenz für jeden Prompt oder jeden Zustand der Schlange.
Dauert der öffentliche Cache 72 Stunden? Nehmen Sie das nicht an. Der technische Bericht beschreibt einen Betriebsentwurf mit mindestens 72 Stunden dauerhaftem globalem KV. Der öffentliche API-Leitfaden nennt Caching nach bestem Bemühen und sagt, Einträge würden im Allgemeinen nach Stunden oder Tagen gelöscht. Die Abrechnung sollte beobachtete Treffer- und Fehlfelder benutzen.
Ist die Responses API ein Austausch ohne Änderung für OpenAI Responses? Sie nimmt eine vertraute Form an, aber sie ist zustandslos und ignoriert mehrere Felder und gehostete Werkzeuge von OpenAI. Prüfen Sie den genauen Fähigkeitsvertrag, den Sie brauchen.
Kann es Bilder erzeugen? Es versteht Bildeingabe und gibt Text zurück. Es ist kein Modell zur Bilderzeugung.
Kann ich V4.1 Flash heute über Modelflare aufrufen? Ja. Benutzen Sie deepseek-v4.1-flash-0910 in der Gruppe deepseek-stable mit Chat Completions oder Responses. Das ist die mit dem Veröffentlichungsdatum gestempelte ID von Modelflare; der Alias deepseek-flash des Erstanbieters ist ein getrennter Anbietervertrag.
Quellen, Methode und Änderungslog
Dieser Artikel stellt Quellen des Erstanbieters voran und trennt dokumentierte Fakten, von DeepSeek berichtete Bewertungen, gerechnete Beispiele und den beobachteten Katalogzustand von Modelflare. Es wurde kein unabhängiger Modell-Benchmark ausgeführt. Die Kostenrechnung liegt im begleitenden Quellartefakt, und jedes Szenario nennt seinen Token-Vektor und die Ausschlüsse. Das wortlose Titelbild ist eine von KI erzeugte redaktionelle Illustration im bestehenden visuellen Stil von Modelflare.
Primäre Verweise: Veröffentlichung von DeepSeek V4.1 Flash, technischer Bericht, Modellkarte, Preise, Thinking, Responses, Kompatibilität mit Anthropic, Sicht, Kontext-Cache, Modellvergleich von OpenAI, Preise von Anthropic und der öffentliche Katalog von Modelflare.
2026-09-10 update: Prüfung am ersten Veröffentlichungstag. Sie zeichnet die Modell-ID des Erstanbieters auf, die wirksamen Preise in Spitze und Nebenzeit, die Mitteilung zur Alias-Migration am September 14, die aktuellen API-Grenzen, Architektur und Benchmark-Daten aus dem technischen Bericht. Eine spätere Aktualisierung am selben Tag fügt den bestätigten Start auf Modelflare unter deepseek-v4.1-flash-0910 hinzu, live Gateway-Preise und durchgerechnete Gateway-Kosten. Prüfen Sie veränderliche Fakten vor der Umsetzung erneut.