DeepSeek V4.1 Flash im Detail: Architektur, Preise bei Modelflare und Rivalen

Eine quellenbasierte Analyse von DeepSeek V4.1 Flash zu Architektur, Kontext von 1M, Ausgabe von 384K, Agent-Benchmarks, API-Grenzen, dem Vergleich mit OpenAI und Anthropic sowie der aktuellen Verfügbarkeit und den Preisen auf Modelflare.

DeepSeek V4.1 Flash im Detail: Architektur, Preise bei Modelflare und Rivalen

DeepSeek V4.1 Flash ist ein günstiges multimodales Modell mit offenen Gewichten, gebaut für lange Agent-Schleifen. Veröffentlicht am September 10, 2026, verbindet es ein Kontextfenster von einer Million Token, bis zu 384K Ausgabe-Token, eine ungewöhnlich günstige offizielle API und eine Architektur, die die Verarbeitung von Prompts und den Druck auf den KV-Cache senkt. Sein klarster Vorteil ist nicht, dass es jeden Benchmark gewinnt. Er ist die Menge an Agent-Arbeit mit langem Kontext, die es pro Dollar versuchen kann, und dabei bei Bewertungen zu Code, Terminal, Automatisierung und Werkzeugnutzung wettbewerbsfähig bleibt.

Dieses Fazit braucht Grenzen. Die Benchmark-Zahlen unten hat DeepSeek veröffentlicht, nicht unabhängig von Modelflare nachgemessen. DeepSeeks eigener Bericht sagt, das Modell liege bei den härtesten Reasoning-Fällen und Randfällen weiter hinter den größten geschlossenen Systemen. Die richtige Modell-ID der Erstanbieter-API ist deepseek-flash. DeepSeek V4.1 Flash ist auf Modelflare unter der versionierten Modell-ID deepseek-v4.1-flash-0910 live, mit Chat Completions und Responses in der öffentlichen Gruppe deepseek-stable.

Zuletzt geprüft: 2026-09-10 UTC. Preise, Aliase und Katalogstatus können sich ändern.

Die direkte Antwort: was DeepSeek V4.1 Flash ist

Die Veröffentlichung von DeepSeek definiert DeepSeek V4.1 Flash als den Produktionsersatz für die frühere Flash-Linie. Der offizielle Endpunkt nimmt deepseek-flash an. Die alten Namen deepseek-v4-flash und deepseek-v4-flash-vision-exp nimmt DeepSeek vorübergehend an und leitet sie zu Flash-Preisen an V4.1 Flash. Ab September 14, 2026 at 04:00 UTC sagt DeepSeek, Anfragen für deepseek-v4-pro werden ebenfalls an V4.1 Flash geleitet, bis eine spätere Veröffentlichung von V4.1 Pro kommt.

Diese Migrationsregel gehört zur eigenen API von DeepSeek. Modelflare benutzt die ausdrücklich mit dem Veröffentlichungsdatum gestempelte ID deepseek-v4.1-flash-0910, statt den früheren Eintrag deepseek-v4-flash still umzubenennen. Der Betreiber von Modelflare hat den Start bestätigt, und das Modell erschien um 2026-09-10 15:21 UTC sowohl im öffentlichen als auch im Origin-Preiskatalog. Clients sollten die genaue ID verwenden, die ihr Anbieter anzeigt, statt anzunehmen, ein Alias des Erstanbieters wirke unverändert durch jedes Gateway.

Die praktische Identität des Modells hat fünf Teile: multimodale Eingabe aus Bild und Text; Textausgabe; ein MoE-Rückgrat mit 552B Parametern; ein zusätzlicher Engram-Speicher mit 196B Parametern; und eine unsymmetrische Aktivierung von 8B Parametern pro Prompt-Token gegen 16B pro decodiertem Token. Der letzte Punkt ist der Kern: Eingabelastige Agent-Arbeit sollte beim wiederholten Prefill weniger Rechenleistung verbrauchen als ein symmetrischer Nur-Decoder-Entwurf ähnlicher Größe.

Die Spezifikation auf einen Blick

Die folgenden Werte stammen aus der offiziellen Veröffentlichung, der Modellkarte und dem technischen Bericht. „Rückgrat-Parameter“ und „Engram-Parameter“ beschreiben verschiedene Speicher; keine der Zahlen ist die aktive Rechnung pro Token.

Punkt DeepSeek V4.1 Flash
Offizielle API-ID deepseek-flash
Modelflare-Modell-ID deepseek-v4.1-flash-0910
Modellklasse Multimodaler Mixture-of-Experts-Transformer
Eingabe / Ausgabe Text und Bilder hinein; Text hinaus
Transformer-Aufbau 40 Schichten: kausaler Encoder mit 20 Schichten + Decoder mit 20 Schichten
Parameterspeicher Rückgrat 552B + bedingter Engram-Speicher 196B
Aktive Parameter 8B pro Prefill-Token; 16B pro Decode-Token
Kontext / maximale Ausgabe 1M / 384K Token
Vortraining 45T Token eines multimodalen Korpus; Verhältnis nur Text zu multimodal 7:1
Hauptentwurf für Aufmerksamkeit und Cache CED + CSA2 + globales KV in FP4; lokales SWA-KV in FP8
Globaler KV-Fußabdruck 890 Byte pro Token, von DeepSeek berichtet
Öffentliche Reasoning-Voreinstellungen low = 50, high = 75, max = 100 auf der internen Effort-Skala
Offizielle Grenze der API-Nebenläufigkeit 2,500 gleichzeitige Anfragen
Lizenz MIT-Lizenz für den Checkpoint

Die Ausgabeobergrenze von 384K ist das Dreifache des Maximums von 128K, das für die aktuellen Vergleichsmodelle von OpenAI und Anthropic in diesem Artikel veröffentlicht ist. Sie ist eine Grenze, keine Empfehlung: sehr lange Ausgabe erhöht Latenz, Kosten und die Fläche für Drift. Für lange Agents ist die nützlichere Frage, ob das Modell Anforderungen behalten und nach Werkzeugaufrufen echte Abnahmen bestehen kann.

Warum die Architektur für lange Agent-Schleifen gebaut ist

Ein Agent, der Werkzeuge benutzt, fügt seiner Historie wiederholt Beobachtungen, Befehlsergebnisse und Änderungen hinzu. Jede neue Runde kann Prefill des Prompts verlangen, Aufmerksamkeit über einen wachsenden Kontext, KV-Speicher und neue Ausgabe. DeepSeek V4.1 Flash greift jede Kostenart getrennt an, statt sich auf ein einziges kleineres Modell zu verlassen.

Agent-Kosten Mechanismus von V4.1 Flash Beabsichtigte Wirkung
Lange Prompts erneut verarbeiten Causal Encoder-Decoder (CED) Halbiert in der Analyse von DeepSeek die asymptotische Prefill-Arbeit langer Sequenzen nahezu
Globale Historie im HBM halten Wiederverwendung über Schichten bei CSA2 + FP4 Verringert doppelte globale KV-Einträge und Byte pro Eintrag
Lokalen Aufmerksamkeitszustand behalten SWA Bounded Replay Baut ein begrenztes lokales Fenster neu auf, statt den vollen lokalen Cache jeder Schicht zu speichern
Stabile Token-Muster abrufen Engram Legt bedingten n-Gramm-Speicher in dünn zugegriffene Tabellen
Token erzeugen Spekulatives Decoding mit DSpark Entwirft mehrere Kandidatenpositionen und wählt eine Verifikationslänge nach Konfidenz und Systemlast
Bilder behandeln DeepSeek-ViT + Projektor Wandelt visuelle Eingaben in Einbettungen, die vom Vortraining an zusammen mit Text verarbeitet werden

Diese Mechanismen verbessern vor allem die Ökonomie des Betriebs und den Durchsatz. Sie beweisen für sich nicht besseres Reasoning. Die Qualität des Modells hängt auch von Daten, Nachtraining, dem Agent-Harness und davon ab, wie viel Inferenz-Effort gekauft wird.

CED: die Prompt-Verarbeitung schneiden, bevor der Cache angefasst wird

Der technische Bericht teilt 40 Transformer-Schichten in einen kausalen Encoder mit 20 Schichten und einen Decoder mit 20 Schichten. Die ersten zwei Schichten benutzen nur ein gleitendes Fenster von 128 Token. Die übrigen Schichten verbinden lokale Aufmerksamkeit im gleitenden Fenster mit komprimiertem globalem Kontext.

Bei globaler Aufmerksamkeit baut der Decoder nicht auf jeder Schicht eine eigene volle KV-Historie. Seine globalen Keys und Values werden aus dem letzten verborgenen Zustand des Encoders projiziert. Zustände des lokalen gleitenden Fensters bleiben schichtspezifisch. DeepSeek schätzt die Prefill-Komplexität langer Sequenzen auf etwa die Hälfte des entsprechenden Weges durch alle Schichten: der dominante Term wechselt vom Verarbeiten jedes Tokens durch alle L Schichten zum Verarbeiten des globalen Kontexts durch etwa L/2, plus begrenzter Arbeit im lokalen Fenster.

Das erklärt die Aktivierungsteilung 8B/16B. Prompt-Token aktivieren beim Prefill etwa 8B Rückgrat-Parameter; neu erzeugte Token aktivieren beim Decode etwa 16B. Arbeit mit riesigen Dokumenten und kurzen Antworten profitiert mehr als Arbeit, die von Hunderttausenden erzeugter Token bestimmt wird. CED senkt die erste Hälfte dieser Rechnung; es macht das Decoding nicht kostenlos.

CSA2, FP4 und SWA Bounded Replay: die Geschichte des Speichers

Compressed Sparse Attention 2 komprimiert den Cache entlang von Sequenz, Schicht und Genauigkeit. Jede CSA2-Schicht wird statisch einer von drei Modi zugewiesen. Full berechnet das Haupt-KV, Indexer-Keys und frische Top-K-Positionen. Reindex benutzt Haupt-KV und Indexer-Keys wieder, tastet sie aber mit der eigenen Query neu ab. Reuse benutzt sowohl das geteilte KV als auch eine frühere dünne Auswahl wieder. Jede Schicht hat immer noch die eigene Query und das KV des lokalen gleitenden Fensters.

Die erste Full-Schicht des Decoders wählt Top-512-Einträge und baut einen Kandidatenpool; spätere Reindex-Schichten wählen ihre Top-512-Positionen aus diesem verkleinerten Pool. Das globale Haupt-KV benutzt eine Darstellung E2M1 von etwa vier Bit, mit einer Skala E4M3 je 16 Kanäle. DeepSeek behält FP8 für den gegenüber Quantisierung empfindlicheren lokalen SWA-Cache.

Cache-Schicht Genauigkeit / Lebensdauer Berichtetes Ergebnis Was es nicht garantiert
Globales KV zur Laufzeit FP4, resident im HBM 890 Byte/Token; etwa 1/4 von V4 Flash und 437× kleiner als V1 Perfekte dünne Auswahl bei jedem Randfall
Lokales SWA-KV zur Laufzeit FP8 Bewahrt das schichtlokale Fenster von 128 Token Vernachlässigbarer Speicher bei beliebiger Nebenläufigkeit
Dauerhaftes globales KV Host-Speicher oder SSD im Betrieb von DeepSeek Langlebiger wiederverwendbarer globaler Zustand Eine feste Aufbewahrungszeit an der öffentlichen API
Dauerhafter lokaler SWA-Zustand Mit Bounded Replay neu aufgebaut Etwa 1/8 des gesamten dauerhaften Cache-Fußabdrucks von V4 Flash bei gleicher Sequenzlänge Genaue Wiederholung jedes verworfenen lokalen Zustands

Der Bericht sagt, sein Betrieb behalte globales dauerhaftes KV mindestens 72 Stunden und benutze einen verteilten kurzlebigen SWA-Pool. Der öffentliche Leitfaden zum Kontext-Cache beschreibt das Anlegen des Cache als automatisch und nach bestem Bemühen, sagt, der Aufbau könne Sekunden dauern, und sagt, Einträge würden im Allgemeinen nach Stunden oder Tagen gelöscht. Produktions-Clients sollten den öffentlichen Vertrag als maßgeblich behandeln: Treffer- und Fehl-Token-Felder ansehen, statt um einen garantierten Treffer von 72 Stunden herum zu rechnen.

DeepSeek nennt selbst zwei Grenzen der Robustheit: CSA2 kann die falschen dünnen Positionen wählen, und Bounded Replay nähert verworfenen lokalen Zustand nur an. Seine Tests fanden in den bewerteten Einstellungen keine systematische Verschlechterung, aber extreme Kontexte und Grenzen beim Wiederaufnehmen des Cache bleiben Gebiete für weitere Belastungstests.

Engram, DSpark und der multimodale Weg

Engram trennt einiges Auswendiglernen von dichter Modellrechnung. V4.1 Flash legt 196B Parameter auf zwei Module bedingten Speichers an den nullindizierten Schichten 1 und 14. Jedes benutzt Token-n-Gramme der Längen zwei, drei und vier, acht Hash-Köpfe, kontextbewusstes Gating und Prefetch aus dem Host-Speicher über RDMA. Das sind gespeicherte Parameter, nicht weitere 196B Parameter, die für jedes Token aktiviert werden.

DSpark ist ein getrennt trainierter spekulativer Decoder. Drei Transformer-Blöcke sehen durch ein gleitendes Fenster von 128 Token und schlagen fünf Positionen parallel vor. Ein leichter Abhängigkeit-Kopf setzt Entwurfs-Token zueinander in Beziehung; ein Konfidenz-Kopf schätzt, wie viel vom Entwurf die Verifikation übersteht. Der Planer benutzt diese Wahrscheinlichkeiten und den gemessenen Durchsatz der Engine, um unter der aktuellen Last eine Verifikationslänge zu wählen. Das kann den Token-Durchsatz des Systems verbessern, ohne die letzte Verifikationsrolle des Rückgrats zu ändern.

Der visuelle Weg benutzt ein getrennt trainiertes DeepSeek-ViT mit zweidimensionaler rotatorischer Positionskodierung. Ein Pixel-Unshuffle von 3×3 verringert die Zahl der visuellen Token vor der Projektion in das Sprachmodell auf ein Neuntel. Der Vision-Encoder hat in der berichteten Konfiguration 32 Schichten, eine verborgene Größe von 1,024 und 16 Aufmerksamkeitsköpfe. Seine autoregressive Trainingsstufe benutzt Bilder, die zwischen 544×544 und 1,344×1,344 skaliert sind, nach einer früheren kontrastiven Stufe über etwa 47B Bild-Text-Paare.

Training und Nachtraining

DeepSeek berichtet 45T Vortrainings-Token, wobei multimodale Daten in das Training des Sprachmodells eingebunden sind. Pipelines nur für Text und multimodale Pipelines werden nach Überlappungsersatz und Deduplizierung im Token-Verhältnis 7:1 zusammengeführt. Dünne Aufmerksamkeit wird von Anfang an bei einer Sequenzlänge von 64K trainiert, ohne Aufwärmen mit dichter Aufmerksamkeit; der Kontext geht am Punkt von 34T Token auf 1M.

Stufe Veröffentlichtes Detail Warum es zählt
Kontrastives Vortraining der Sicht Etwa 47B Bild-Text-Paare, Phase niedriger Auflösung Lernt breite visuelle Darstellungen vor der Einbindung der Sprache
Autoregressives Tuning der Sicht 236B Token mit Bildunterschriften, Diagrammen, OCR und verwandten Daten Fügt feinkörniges visuelles und dokumentarisches Verstehen hinzu
Vortraining des LLM 45T Token; multimodale Daten von Anfang an dabei Vermeidet, Sicht nur als späten Prompt-Adapter zu behandeln
Kontexttraining Dünne Aufmerksamkeit ab 64K; bei 34T Token auf 1M erweitert Trainiert das ausgelieferte Aufmerksamkeitsmuster, statt es erst nach dem Training umzuwandeln
Nachtraining SFT, Verstärkungslernen und On-Policy-Distillation Richtet Reasoning, Werkzeuge und Agent-Verhalten aus

Der Bericht beansprucht keinen neuen Algorithmus für das Nachtraining. Er schreibt die Gewinne der Erzeugung synthetischer Aufgaben und Umgebungen zu, besserer Datenfilterung, überprüfbaren Belohnungen und der Größe von Architektur und Daten. Das zählt, wenn Behauptungen über „Modellarchitektur“ verglichen werden: CED und CSA2 erklären die Effizienz, während die beobachtete Agent-Leistung das Produkt des ganzen Stapels aus Training und Scaffold ist.

Reasoning-Effort: Qualität hat eine sichtbare Token-Rechnung

DeepSeek legt ein internes Effort-Kontinuum von 1 bis 100 offen und bildet die öffentlichen API-Voreinstellungen low, high und max auf 50, 75 und 100 ab. Kompatibilitätseingaben bilden minimal und low auf low ab; medium, high und xhigh auf high; und max oder ultra auf max. Thinking steht standardmäßig auf high.

In dem von DeepSeek berichteten Durchlauf hob Effort von 25 auf 100 das Durchschnittsergebnis über acht Reasoning-Bewertungen von 67.1% auf 76.3%, DeepSWE von 66.0% auf 74.2% und Terminal-Bench 2.1 von 82.4% auf 90.6%. Die Ausgabe-Token wuchsen um etwa 2.5×. Der Bereich 60–80 fing den größten Teil der Qualität bei weniger als der Hälfte des maximalen Token-Budgets ein; der letzte Schritt auf 100 verlängerte Agent-Trajektorien um 1.6–1.8× für kleinere Gewinne.

Das ist eine der nützlichsten Steuerungen des Modells. Nutzen Sie low für Klassifikation, Extraktion und Erkundung, die sich wiederholen lässt; high für gewöhnliches Programmieren und Recherche; reservieren Sie max für Aufgaben, bei denen ein weiterer Versuch oder ein verpasster Randfall mehr kostet als die zusätzlichen Token. Behandeln Sie das als Anfangshypothesen und messen Sie die Kosten je angenommener Aufgabe.

Im Thinking-Modus werden Temperature und Presence- sowie Frequency-Strafen ignoriert, und top_p hat ein Minimum von 0.95. Mit Werkzeugen müssen Clients das vollständige reasoning_content aus der Assistant-Nachricht zusammen mit den Werkzeugergebnissen zurückgeben; es wegzulassen, ergibt eine Antwort 400. Diese Zustandsregel ist wichtiger, als einen vertrauten Parametersatz von OpenAI zu kopieren.

Benchmark-Vergleich mit OpenAI und Anthropic

Diese Tabelle gibt ausgewählte Ergebnisse aus Tabelle 3 des technischen Berichts von DeepSeek wieder. Alle Modelle stehen auf der Max-Einstellung des Berichts. DeepSeek hat für manche Bewertungen verschiedene verlangte oder offizielle Scaffolds benutzt, einen DeepSeek-Harness-Kontext von 1M für Code und einen Claude-Code-Kontext von 512K für visuelle Agent-Aufgaben. Die Zahlen sind vom Anbieter berichtete Belege, kein unabhängiger Direktvergleich und kein Produktions-SLA.

Prüfung V4 Flash V4 Pro V4.1 Flash GPT-5.6 Sol Claude Opus 5
GPQA Diamond, Pass@1 89.9 92.4 90.9 94.1 93.4
Terminal-Bench 2.1, Pass@1 82.7 87.9 90.6 88.8 89.1
Terminal-Bench 3.0, Pass@1 7.6 11.8 30.0 34.4 43.3
Terminal-Bench 4.0, Pass@1 7.0 12.4 31.2 39.9 51.8
DeepSWE v1.1, resolved 54.4 62.7 74.2 73.0 74.0
CyberGym, Pass@1 76.7 83.3 88.1 84.5
HLE with tools, Pass@1 51.5 60.0 63.9 63.6
AutomationBench, Pass@1 37.7 43.2 54.8 45.8 50.3
Agents' Last Exam, Pass@1 25.2 25.7 31.8 26.7 28.6
Chartography with tools, Pass@1 78.9 79.9 84.0

Die stärkste Lesart ist konkret. V4.1 Flash macht bei Agent-Aufgaben einen großen Schritt über V4 Flash und ist mit GPT-5.6 Sol und Claude Opus 5 bei DeepSWE, Terminal-Bench 2.1, Automatisierung und HLE mit Werkzeugen wettbewerbsfähig. Es führt nicht bei GPQA, späteren Terminal-Bench-Versionen oder Chartography. Der Bericht selbst warnt, dass nahe Parität bei gewöhnlichen Aufgaben nicht Frontier-Parität bei den härtesten Reasoning-Fällen und Randfällen heißt.

GPT-6 Astra und Claude Fable 5.1 fehlen in dieser Punktetabelle, weil der Bericht von DeepSeek für sie nicht dieselben Vergleichsdaten Zeile für Zeile veröffentlicht. Punktzahlen von getrennten Anbieterseiten hinzuzufügen, würde ein falsches gemeinsames Harness erzeugen. Teams sollten alle Kandidaten an denselben Repository-Aufgaben, Werkzeugen, Zeitlimits, derselben Netzregel und denselben Abnahmeprüfungen bewerten.

Die API-Kompatibilität ist breit, aber nicht identisch

Der offizielle Dienst legt OpenAI Chat Completions, OpenAI Responses und eine mit Anthropic kompatible API offen. Diese Breite senkt die Migrationsarbeit, aber Kompatibilität beschreibt die Form der Anfrage, nicht identische Semantik des Lebenszyklus.

Oberfläche Verhalten von DeepSeek V4.1 Flash Folge für die Migration
Chat Completions Streaming, JSON-Ausgabe, Funktionsaufrufe; Prefix/FIM im Modus ohne Thinking Bestehende Clients von OpenAI sind der einfachste Anfang
Responses Zustandslos; Funktionen und Bilder werden unterstützt Speichern Sie die volle Unterhaltung selbst
Zustandsfelder von Responses previous_response_id, Unterhaltungen, store, Hintergrund und Kontextverwaltung werden nicht unterstützt oder ignoriert Eine Antwort 200 beweist nicht, dass diese Funktionen gegriffen haben
Gehostete Werkzeuge Web Search, File Search, Code Interpreter, Computer Use und eingebaute MCP-Werkzeuge werden ignoriert; die Unterstützung für Custom Tool ist begrenzt Führen Sie Werkzeuge in der Anwendung aus und prüfen Sie jedes verlangte Feld
Reasoning-Zusammenfassungen Summary und verschlüsselte Reasoning-Inhalte werden nicht unterstützt Verlassen Sie sich nicht auf Übergabefelder im Stil von OpenAI
Format von Anthropic Die Nachrichtenform von Anthropic wird angenommen Bewahren Sie die Reasoning- und Werkzeugzustandsregeln von DeepSeek, statt Semantik von Claude anzunehmen
Sicht Bilder werden in der Nutzereingabe und in Werkzeugausgaben angenommen Prüfen Sie Nutzlastgröße, Detail-Modus und Bildzahl

Der Responses-Leitfaden von DeepSeek listet auch ignorierte Felder wie Metadata, Prompt-Vorlagen, Truncation, Service Tier, Safety Identifier, Prompt-Cache-Key und Retention sowie Stream-Optionen. Stilles Ignorieren ist eine Kompatibilitätsgefahr: dass ein Schema angenommen wird, kann fehlendes Verhalten verdecken. Bauen Sie für jede Fähigkeit, von der Ihre Anwendung abhängt, eine Konformitätsanfrage. Der Leitfaden zur mit OpenAI kompatiblen API erklärt, warum Form des Endpunkts und Fähigkeit getrennte Prüfungen brauchen.

Die aktuellen Modelle von OpenAI bieten ein breiteres natives Responses-Werkzeugökosystem und verwaltete Zustandsfunktionen. Die native API von Anthropic hat einen eigenen reifen Vertrag für Thinking-Blöcke und Werkzeugnutzung. Der Vorteil von DeepSeek ist, dass ein Modell alle drei üblichen Dialekte annimmt; sein Preis ist, dass die Schnittmenge kleiner ist als die volle native Oberfläche jedes der Rivalen.

Grenzen der Sicht und Ökonomie der Bilder

Der offizielle Leitfaden zur Sicht unterstützt JPEG, PNG, GIF und WebP über Base64, externe URLs oder die Files API. Bilder werden automatisch in Richtung von grob 1,300×1,300 verkleinert und benutzen höchstens 1,024 Eingabe-Token je Bild. Detail low benutzt eine Ansicht von 512×512; high und original behalten mehr Detail; auto verhält sich derzeit wie original.

Grenze Offizieller Wert
Anfragekörper 48 MiB
Eingebettetes oder von außen geholtes Bild je 32 MiB
Per Datei-ID verwiesenes Bild je 64 MiB
Bilder pro Anfrage 600
Bild-Byte zusammen 64 MiB ohne Datei-IDs; 200 MiB mit Datei-IDs
Lange Kante 8,192 px; 4,096 px, wenn 15 oder mehr Bilder gesendet werden
Obergrenze visueller Token 1,024 Token pro Bild nach der Verarbeitung

Bei den maximalen 1,024 visuellen Token trägt ein nicht gecachtes Bild etwa $0.0001536 Nebenzeit oder $0.0003072 Spitze zu den veröffentlichten Eingabepreisen bei, vor begleitendem Text und Ausgabe. Diese Rechnung ist für Größenschätzungen nützlich, aber das Verkleinern von Bildern, das Cache-Verhalten und der tatsächliche Verbrauch visueller Token können die Gebühr ändern. Mehr Bilder verbrauchen auch Kontext, der sonst Text oder Werkzeughistorie halten könnte.

V4.1 Flash eignet sich für Dokument-Screenshots, Diagramme, OCR und visuelle Beobachtungen eines Agent. Es ist kein Modell zur Bilderzeugung. Für erzeugte Bilder benutzen Sie ein Modell und einen Endpunkt, die dafür gebaut sind, Pixel zurückzugeben statt Text.

Vergleich der offiziellen API-Preise

Die Preisseite von DeepSeek hat die folgenden Sätze um 04:00 UTC am September 10 eingeführt. Spitzenfenster an Werktagen sind 01:00–04:00 und 06:00–10:00 UTC; alle anderen Werktagszeiten und das Wochenende nutzen Nebenzeitsätze. Der Kontext-Cache von DeepSeek ist automatisch, also heißt „gecachte Eingabe“ einen berichteten Cache-Treffer, nicht ein Cache-Flag, das einen erzwingt.

Die Sätze von OpenAI kommen aus seinem aktuellen Modellvergleich; die Sätze von Anthropic kommen von seiner Preisseite. Die Werte sind USD pro eine Million Token. Anthropic berechnet auch Cache-Schreibvorgänge; sie sind hier weggelassen, weil die Tabelle nur neue Eingabe, Cache-Lesevorgänge und Ausgabe vergleicht.

Modell Kontext / maximale Ausgabe Neue oder verfehlte Eingabe Gecachte / gelesene Eingabe Ausgabe
DeepSeek V4.1 Flash, Nebenzeit 1M / 384K $0.15 $0.003 $0.60
DeepSeek V4.1 Flash, Spitze 1M / 384K $0.30 $0.006 $1.20
DeepSeek V4.1 Flash auf Modelflare Modellgrenze 1M / 384K $0.193548 $0.003871 $0.774194
GPT-5.6 Luna 1.05M / 128K $0.20 $0.02 $1.20
GPT-5.6 Terra 1.05M / 128K $2.00 $0.20 $12.00
GPT-5.6 Sol 1.05M / 128K $4.00 $0.40 $20.00
GPT-6 Astra 1.05M / 128K $10.00 $1.00 $50.00
Claude Sonnet 5 1M / 128K $2.00 $0.20 $10.00
Claude Opus 5 1M / 128K $5.00 $0.50 $25.00
Claude Fable 5.1 1M / 128K $10.00 $0.25 $50.00

Preis ist für sich nicht Wert. Verschiedene Tokenizer können für denselben Text verschiedene Token-Zahlen berechnen; Anthropic merkt an, dass neuere Tokenisierung bei mancher Arbeit grob 30% mehr Token erzeugen kann. Modelle können auch verschiedene Ausgabelängen, Wiederholungen und menschliche Reparaturen brauchen. Vergleichen Sie die Kosten je angenommener Aufgabe, nicht nur die Zeile mit der kleinsten Eingabezahl.

Der aktuelle öffentliche Katalog von Modelflare zeigt einen Satz zwischen den zwei Zeitbändern von DeepSeek: er liegt bei etwa 64.5% des Erstanbieter-Spitzensatzes, oder 35.5% niedriger in Spitzenfenstern, während er etwa 29.0% über dem Nebenzeitsatz von DeepSeek liegt. Der aufgeführte Gateway-Tarif hat heute also keine Anpassung nach Zeitband; flexible Arbeit, die das Nebenzeitfenster von DeepSeek verlässlich nutzen kann, kann über die Erstanbieter-API immer noch weniger zahlen.

OpenAI wendet höhere Sätze an, wenn der Eingabekontext 272K überschreitet: die ganze Anfrage benutzt 2× Preise für Eingabe und gecachte Eingabe und 1.5× Preise für die Ausgabe. Diese Grenze zählt im Szenario mit langem Kontext unten. DeepSeek benutzt Zeitfenster; die aufgeführten Modelle von Anthropic mit einer Million Token benutzen in der zitierten Preistabelle nicht dieselbe Grenze von 272K.

Zwei nachrechenbare Kostenszenarien

Szenario A ist eine Anfrage mit 100K nicht gecachter Eingabe und 10K Ausgabe. Die Formel ist 0.1 × input rate + 0.01 × output rate. Sie nimmt keine gecachte Eingabe, keine Werkzeuge, keine Wiederholungen, keine Steuern und keine anbieterspezifischen Zuschläge an.

Modell Kosten in Szenario A
DeepSeek V4.1 Flash, Nebenzeit $0.021
DeepSeek V4.1 Flash auf Modelflare $0.0271
GPT-5.6 Luna $0.032
DeepSeek V4.1 Flash, Spitze $0.042
Claude Sonnet 5 $0.300
GPT-5.6 Terra $0.320
GPT-5.6 Sol $0.600
Claude Opus 5 $0.750
GPT-6 Astra / Claude Fable 5.1 $1.500

Szenario B sind die Grenzkosten einer Anfrage mit warmem Cache, mit 900K gecachter Eingabe, 100K neuer Eingabe und 20K Ausgabe. Es schließt absichtlich die frühere Anfrage aus, die den Cache angelegt hat. Formel: 0.9 × cache-read rate + 0.1 × input rate + 0.02 × output rate. Die Modifikatoren von OpenAI für langen Kontext der ganzen Anfrage werden angewandt, weil der Eingabekontext zusammen eine Million Token beträgt.

Modell Grenzkosten in Szenario B
DeepSeek V4.1 Flash, Nebenzeit $0.0297
DeepSeek V4.1 Flash auf Modelflare $0.0383
DeepSeek V4.1 Flash, Spitze $0.0594
GPT-5.6 Luna $0.1120
Claude Sonnet 5 $0.5800
GPT-5.6 Terra $1.1200
Claude Opus 5 $1.4500
GPT-5.6 Sol $2.1200
Claude Fable 5.1 $2.2250
GPT-6 Astra $5.3000

Der Vergleich hält die Token-Mengen gleich; er behauptet nicht gleiche Qualität. Der Cache von DeepSeek ist nach bestem Bemühen, während das Anlegen eines Cache bei Anthropic einen eigenen Schreibpreis und eine eigene Lebensdauer hat. Ein fairer Test der Arbeit zeichnet Cache-Treffer und Cache-Fehl-Token auf, alle Versuche, die gesamte Ausgabe einschließlich berechenbarem Reasoning, die vergangene Zeit, die Annahmerate und die Minuten menschlicher Korrektur. Der Leitfaden zur Kostennachverfolgung gibt den Rahmen der Buchführung.

Offene Gewichte machen Selbsthosting nicht klein

Die Veröffentlichung auf Hugging Face steht unter MIT-Lizenz und dokumentiert Betriebswege mit vLLM und SGLang. In dem für diesen Artikel geprüften Schnappschuss enthielt das Repository 48 Safetensor-Shards und etwa 510.3 GB Git-LFS-Dateien beim Commit dba1be0a40aa45a94ad051997016db3960a90277. Diese Byte-Zahl ist ein Download-Artefakt, nicht gemessener GPU-Speicher.

Das System hat immer noch ein Rückgrat von 552B, Engram-Speicher von 196B mit Host-Adresse, Experten-Routing, Cache-Wege in FP4/FP8, RDMA-Prefetch und dauerhaften KV-Speicher. Die Veröffentlichung von DeepSeek lädt Teams, die einen großen Betrieb mit 2,000 GPUs plus einem Speichercluster planen, ein, das Unternehmen zu kontaktieren. Dieses Beispiel zeigt die Größe des vollständigen Serving-Systems; es ist kein genanntes Minimum für jede Bereitstellung. Kleinere Forschungsbetriebe können Quantisierung oder andere Parallelität benutzen, aber sie sollten nicht aus der API-Ökonomie des Anbieters geschlossen werden.

Offene Gewichte geben Teams Zugang zum Checkpoint, Prüfbarkeit und Kontrolle über die Betriebsregel. Sie bilden nicht automatisch DeepSeeks Kernel-Fusion, Cache-Hierarchie, DSpark-Planung, Batching oder die Latenz der öffentlichen API nach. Vergleichen Sie einen Plan zum Selbsthosting mit gemessenem Durchsatz, Wiederherstellung nach Ausfall, ungenutzter Kapazität, Speicherbandbreite und Betriebsarbeit.

DeepSeek V4.1 Flash auf Modelflare

DeepSeek V4.1 Flash ist auf Modelflare live. Der vom Betreiber bestätigte Start ist unabhängig im öffentlichen Preiskatalog von Modelflare und im Origin-Katalog sichtbar. Um 2026-09-10 15:21 UTC haben beide den neuen Eintrag deepseek-v4.1-flash-0910 gezeigt; die Produktionskonfiguration zeigte eine eingeschaltete Fähigkeit deepseek-stable und eine eingeschaltete Route, die dasselbe Modell ankündigt.

Punkt bei Modelflare Live-Wert
Zu sendende Modell-ID deepseek-v4.1-flash-0910
Verfügbarkeit Live im öffentlichen Katalog und in der eingeschalteten Routing-Gruppe
Öffentliche Gruppe deepseek-stable
Eingabepreis $0.193548 / 1M Token
Preis gecachter Eingabe $0.003871 / 1M Token
Ausgabepreis $0.774194 / 1M Token
Endpunktarten /v1/chat/completions und /v1/responses

Die Preise werden aus dem Basis-Eingabekoeffizienten $0.322580645 des Live-Eintrags abgeleitet, dem öffentlichen Gruppenverhältnis 0.6, dem Cache-Verhältnis 0.02 und dem Completion-Verhältnis 4×. Für die zwei oben durchgerechneten Arbeiten kostet Modelflare etwa $0.0271 beziehungsweise $0.0383. Nutzen Sie die live Preisseite von DeepSeek V4.1 Flash für die aktuelle Modell-ID und den Tarif.

Beweisstufen zählen immer noch. Der öffentliche Katalog und die eingeschaltete Produktionsroute belegen die Verfügbarkeit des Produkts, und der Betreiber hat den Start ausdrücklich bestätigt. Bis 15:30 UTC enthielten die Produktionsaufzeichnungen sechs abgeschlossene Chat-Completions-Aufrufe unter der genauen neuen Modell-ID, zusammen 216 Prompt-Token und 173 Completion-Token. Das prüft die authentisierte Zustellung von Chat Completions und berechenbare Ausgabe. Es ist immer noch eine zu kleine Startprobe, um Latenz oder Verfügbarkeit zu messen, und es beweist nicht unabhängig Responses oder multimodales Verhalten über diese Route. Teams sollten eine eigene kleine Abnahmeanfrage am genauen Endpunkt ausführen, bevor sie Produktionsarbeit verlegen.

Wo DeepSeek V4.1 Flash einen echten Vorteil hat

Das Modell hat einen zusammenhängenden Vorteil, wenn lange Eingaben, häufige Werkzeugrunden und das Budget alle zählen. Die Architektur senkt Prefill- und Cache-Druck; der API-Preis macht aus diesen Ersparnissen einen ungewöhnlich niedrigen öffentlichen Tarif; die Ausgabeobergrenze von 384K lässt Raum für lange Patches oder Berichte; und der Checkpoint hält einen Weg zum Selbsthosting offen.

Arbeit Warum V4.1 Flash ein starker Kandidat ist Was zu messen ist
Repository-Agents Starke vom Herausgeber berichtete Ergebnisse bei DeepSWE und am Terminal, bei niedrigen Token-Sätzen Angenommene Änderungen, Test-Bestehensrate, Wiederholungen und Reparaturzeit
Lange Forschungssynthese Eingabe 1M, billige Cache-Treffer und Ausgabe 384K Richtigkeit der Zitate, Behalten der Anforderungen und gesamte Ausgabe
Visuelle Dokument-Agents Native Bilder, Training für OCR und Diagramme und übliche Agent-APIs Feldgenauigkeit, Empfindlichkeit von Ausschnitt und Detail und Verbrauch visueller Token
Automatisierung in hohem Volumen Niedrige Preise in Spitze und Nebenzeit; Obergrenze von 2,500 gleichzeitigen Anfragen Wartezeit in der Schlange, Rate 429, Werkzeugfehler und Kosten je Erfolg
Kontrollierter Betrieb MIT-Checkpoint und dokumentierte Wege mit vLLM/SGLang Hardware-Auslastung, Bandbreite von Cache und Speicher und Betriebskosten

Die stärkste Produktionsbehauptung ist daher kosteneffiziente Handlungsfähigkeit bei langem Kontext, nicht „insgesamt bestes Modell“. Wenn das Modell eine echte Aufgabe in einem angenommenen Lauf abschließt, wo ein billigeres kleines Modell mehrere Reparaturen braucht, gewinnt V4.1 beim Ergebnis. Wenn ein geschlossenes Frontier-Modell einen teuren Ausfall verhindert, kann sein höherer Token-Preis immer noch wirtschaftlich sein.

Wo OpenAI oder Anthropic die sicherere Wahl bleibt

Wählen Sie ein Modell von OpenAI, wenn die Anwendung vom vollen Responses-Ökosystem abhängt, von verwaltetem Zustand, gehosteten Werkzeugen oder einem Vertrag, der spezifisch für OpenAI ist und den DeepSeek ignoriert. GPT-5.6 Luna ist ein besonders naher Preisrivale für kürzere, nicht gecachte Arbeit; Terra, Sol und Astra tauschen viel höhere Listenpreise gegen andere Fähigkeitsstufen und native Plattformfunktionen.

Wählen Sie ein Modell von Anthropic, wenn der native Werkzeug- und Thinking-Vertrag von Claude, die Cache-Steuerung oder die gemessene Leistung bei Ihrer härtesten Agent-Arbeit mehr zählt als der Listenpreis der Token. In DeepSeeks eigener Tabelle führt Claude Opus 5 bei Terminal-Bench 3/4 und Chartography; Claude Fable 5.1 ist für die anspruchsvollste Arbeit mit langem Horizont gesetzt, obwohl es pro neuem Token und pro Ausgabe-Token wesentlich teurer ist.

Bei sicherheitskritischen oder teuren Handlungen sollte die Wahl der Route auf bewerteten Ausfallarten und Rechtegrenzen beruhen, nicht auf Marke oder Benchmark-Durchschnitten. Nutzen Sie den Routing-Leitfaden, um wiederholbare Arbeit, Fallbacks und Handlungen mit Nebenwirkung zu trennen.

Checkliste für den Betrieb

  1. Benutzen Sie deepseek-flash für die Erstanbieter-API und zeichnen Sie jede gateway-spezifische Abbildung getrennt auf.
  2. Beginnen Sie bei high Effort, dann messen Sie low und max an derselben Menge angenommener Aufgaben; bilden Sie Namen über Anbieter nicht als gleiche Rechenleistung ab.
  3. Wenn Werkzeuge im Thinking-Modus benutzt werden, geben Sie das volle reasoning_content genau wie verlangt zurück.
  4. Prüfen Sie jedes Responses-Feld, von dem Sie abhängen; abgelehnte und still ignorierte Parameter brauchen verschiedene Behandlung.
  5. Zeichnen Sie Cache-Treffer- und Cache-Fehl-Token auf, Ausgabe- und Reasoning-Token, Wiederholungen, Latenz und die endgültige Annahme.
  6. Entwerfen Sie die Cache-Ökonomie um beobachtete Treffer, nicht um eine Annahme fester Aufbewahrung.
  7. Erzwingen Sie Grenzen für Bild-Byte, Zahl, Abmessung und Detail, bevor Sie multimodale Anfragen senden.
  8. Halten Sie Autorisierung auf der Anwendungsseite, Idempotenz der Werkzeuge und Prüfung der Ausgabe unabhängig von der Modellqualität.
  9. Prüfen Sie Preise nach Zeitfenster, Modell-Aliase und Nebenläufigkeitsgrenzen vor dem Start erneut.
  10. Führen Sie eine echte authentisierte Anfrage auf der genauen Route aus; ein Modellkatalog oder HTTP 200 allein ist kein Beweis der Fähigkeit.

Häufig gestellte Fragen

Ist DeepSeek V4.1 Flash besser als GPT-6 Astra oder Claude Fable 5.1? Nicht als allgemeine Behauptung. V4.1 Flash hat einen großen Vorteil bei Preis und offenen Gewichten und starke vom Anbieter berichtete Agent-Punktzahlen. DeepSeek selbst sagt, die größten geschlossenen Modelle behielten einen Vorsprung bei den härtesten Reasoning-Fällen und Randfällen. Im Bericht zu V4.1 gibt es keinen Vergleich von Astra und Fable auf demselben Harness.

Wie viele Parameter hat DeepSeek V4.1 Flash? Der Bericht listet ein Rückgrat mit 552B Parametern plus 196B Engram-Parameter. Es aktiviert etwa 8B Rückgrat-Parameter pro Prefill-Token und 16B pro decodiertem Token. Nur „552B insgesamt“ zu sagen, lässt Engram weg; „748B aktiv“ zu sagen, ist auch falsch.

Was sind seine Grenzen für Kontext und Ausgabe? Die offiziellen Grenzen sind eine Million Kontext-Token und bis zu 384K Ausgabe-Token. Bildeinbettungen, Text, Werkzeughistorie und Reasoning verbrauchen alle die betreffenden Budgets.

Warum heißt es Flash? Der Entwurf zielt auf niedrigere Betriebskosten: unsymmetrische Aktivierung von Prefill und Decode, komprimierte dünne Aufmerksamkeit, globales KV in FP4, begrenzte dauerhafte Wiederholung und spekulatives Decoding. „Flash“ verspricht nicht die niedrigste Latenz für jeden Prompt oder jeden Zustand der Schlange.

Dauert der öffentliche Cache 72 Stunden? Nehmen Sie das nicht an. Der technische Bericht beschreibt einen Betriebsentwurf mit mindestens 72 Stunden dauerhaftem globalem KV. Der öffentliche API-Leitfaden nennt Caching nach bestem Bemühen und sagt, Einträge würden im Allgemeinen nach Stunden oder Tagen gelöscht. Die Abrechnung sollte beobachtete Treffer- und Fehlfelder benutzen.

Ist die Responses API ein Austausch ohne Änderung für OpenAI Responses? Sie nimmt eine vertraute Form an, aber sie ist zustandslos und ignoriert mehrere Felder und gehostete Werkzeuge von OpenAI. Prüfen Sie den genauen Fähigkeitsvertrag, den Sie brauchen.

Kann es Bilder erzeugen? Es versteht Bildeingabe und gibt Text zurück. Es ist kein Modell zur Bilderzeugung.

Kann ich V4.1 Flash heute über Modelflare aufrufen? Ja. Benutzen Sie deepseek-v4.1-flash-0910 in der Gruppe deepseek-stable mit Chat Completions oder Responses. Das ist die mit dem Veröffentlichungsdatum gestempelte ID von Modelflare; der Alias deepseek-flash des Erstanbieters ist ein getrennter Anbietervertrag.

Quellen, Methode und Änderungslog

Dieser Artikel stellt Quellen des Erstanbieters voran und trennt dokumentierte Fakten, von DeepSeek berichtete Bewertungen, gerechnete Beispiele und den beobachteten Katalogzustand von Modelflare. Es wurde kein unabhängiger Modell-Benchmark ausgeführt. Die Kostenrechnung liegt im begleitenden Quellartefakt, und jedes Szenario nennt seinen Token-Vektor und die Ausschlüsse. Das wortlose Titelbild ist eine von KI erzeugte redaktionelle Illustration im bestehenden visuellen Stil von Modelflare.

Primäre Verweise: Veröffentlichung von DeepSeek V4.1 Flash, technischer Bericht, Modellkarte, Preise, Thinking, Responses, Kompatibilität mit Anthropic, Sicht, Kontext-Cache, Modellvergleich von OpenAI, Preise von Anthropic und der öffentliche Katalog von Modelflare.

2026-09-10 update: Prüfung am ersten Veröffentlichungstag. Sie zeichnet die Modell-ID des Erstanbieters auf, die wirksamen Preise in Spitze und Nebenzeit, die Mitteilung zur Alias-Migration am September 14, die aktuellen API-Grenzen, Architektur und Benchmark-Daten aus dem technischen Bericht. Eine spätere Aktualisierung am selben Tag fügt den bestätigten Start auf Modelflare unter deepseek-v4.1-flash-0910 hinzu, live Gateway-Preise und durchgerechnete Gateway-Kosten. Prüfen Sie veränderliche Fakten vor der Umsetzung erneut.