DeepSeek V4 Pro GA im Test: Benchmarks, API-Preise und Kosten
Faktengeprüfte Analyse von DeepSeek V4 Pro GA mit Agent-Benchmarks, 1M-Kontext, API-Kompatibilität, aktuellen und zeitabhängigen Preisen, Kostenbeispielen und Modelflare-Verfügbarkeit.
DeepSeek veröffentlichte DeepSeek-V4-Pro GA am 13. August 2026. Die gehostete API bezeichnet die Version nun als DeepSeek-V4-Pro-0813, während die stabile API-Modell-ID deepseek-v4-pro bleibt. Das Modell bietet ein Kontextfenster mit einer Million Tokens, bis zu 384.000 Ausgabetokens, native Unterstützung für die Responses API und einen neuen Preisplan, der kurz nach dem Start beginnt.
Unser Urteil: V4 Pro verdient eine Produktionsevaluierung für anspruchsvolle Programmierung, Arbeit auf Repository-Ebene und lang laufende Agenten. DeepSeek meldet bei schwierigen Agent-Benchmarks durchgängige Verbesserungen gegenüber V4 Flash. Pro ist jedoch nicht für jede Anfrage die wirtschaftliche Standardwahl. Nach Beginn des neuen Preisplans liegen die offiziellen Ein- und Ausgabepreise ungefähr beim Dreifachen von Flash, während das Parallelitätslimit pro Konto nur ein Fünftel beträgt.
Dieser Test trennt aktuelle API-Fakten, von DeepSeek veröffentlichte Benchmark-Ergebnisse, unsere Analyse und die aktuelle Verfügbarkeit bei Modelflare. Wir haben DeepSeeks Benchmark-Werte nicht unabhängig reproduziert. Veränderliche Spezifikationen und Preise wurden am 14. August 2026 geprüft.
DeepSeek V4 Pro GA auf einen Blick
| Punkt | Aktuelle offizielle Information |
|---|---|
| GA-Datum | 13. August 2026 |
| Stabile API-Modell-ID | deepseek-v4-pro |
| Gehostete Modellversion | DeepSeek-V4-Pro-0813 |
| Kontextfenster | 1.000.000 Tokens |
| Maximale Ausgabe | 384.000 Tokens |
| Denkmodus | Unterstützt und standardmäßig aktiviert |
| Reasoning-Aufwand | GA-Ankündigung: low, high, max; siehe Kompatibilitätshinweis unten |
| Offizielle API-Formate | Chat Completions, Responses API, Anthropic-Messages-kompatible API |
| Dokumentierte Funktionen | JSON-Ausgabe, Tool-Aufrufe, automatisches Kontext-Caching, Präfix-Vervollständigung, FIM ohne Denkmodus |
| Offizielle Konto-Parallelität | 500 gleichzeitige Anfragen |
Das Limit von einer Million Tokens ist eine Kapazitätsgrenze, keine Qualitätsgarantie. Abrufgenauigkeit, Latenz, Cache-Wiederverwendung, Ausgabelänge, Client-Timeouts und die Menge irrelevanten Kontexts bestimmen weiterhin, ob eine lange Anfrage nützlich ist.
Was sich gegenüber der V4-Vorschau geändert hat
Die April-Vorschau führte die V4-Familie und ihre Open-Weight-Architektur ein. Das GA-Update im August ist ein Update des gehosteten Produkts mit drei praktischen Änderungen:
- Laut DeepSeek wurde die Agentenleistung deutlich verbessert, besonders bei produktionsnahen Programmier- und Automatisierungsaufgaben;
- die offizielle API unterstützt jetzt das OpenAI-Responses-Format nativ und enthält auf Codex ausgerichtete Kompatibilität;
- DeepSeek kündigte Peak- und Off-Peak-API-Preise an, die am 16. August 2026 um 16:00 UTC wirksam werden.
Das stabile Anfragemodell bleibt deepseek-v4-pro, sodass bestehende Clients den Modellnamen nicht migrieren müssen. Die Preisseite weist die aktuelle gehostete Version als DeepSeek-V4-Pro-0813 aus.
Das herunterladbare Vorschau-Checkpoint sollte nicht automatisch als bitgenau identisch mit der gehosteten GA-Version betrachtet werden. DeepSeeks öffentliche V4-Modellkarte beschreibt weiterhin die Vorschaufamilie und kennzeichnet das Checkpoint nicht als 0813. Selbst gehostete und offizielle API-Bereitstellungen müssen daher getrennt evaluiert werden.
Benchmark-Analyse: Wo Pro gegenüber Flash gewinnt
DeepSeek veröffentlichte die folgenden Ergebnisse für V4 Pro GA. Die Vergleichsspalte verwendet DeepSeeks Werte des V4-Flash-Updates vom 31. Juli; das Delta ist die absolute Punktedifferenz.
| Benchmark | V4 Pro GA | V4 Flash 0731 | Pro-Delta |
|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | 82.7 | +5.2 |
| NL2Repo | 61.5 | 54.2 | +7.3 |
| Cybergym | 83.3 | 76.7 | +6.6 |
| DeepSWE | 62.7 | 54.4 | +8.3 |
| Toolathlon-Verified | 74.1 | 70.3 | +3.8 |
| Agents' Last Exam | 25.7 | 25.2 | +0.5 |
| AutomationBench (Public) | 31.8 | 25.1 | +6.7 |
| DSBench-FullStack | 71.1 | 68.7 | +2.4 |
| DSBench-Hard | 67.2 | 59.6 | +7.6 |
Für V4 Pro GA meldet DeepSeek außerdem HLE-Werte von 42.7 ohne Tools und 60.0 mit Tools.
Das Muster ist wichtiger als ein einzelner Spitzenwert. Die größten absoluten Zuwächse zeigen sich bei Repository-Arbeit, schwierigen Softwareentwicklungsaufgaben und Automatisierung. Bei Agents' Last Exam ist der Abstand deutlich kleiner, beim breiten Tool-Einsatz moderat. Das spricht für eine Routing-Strategie: Pro für Aufgaben reservieren, bei denen eine höhere Abschlusswahrscheinlichkeit mehr zählt als reine Token-Effizienz, und Flash für Klassifizierung, Zusammenfassung, Triage und einfachere Subagenten mit hohem Volumen nutzen.
Dies sind vom Anbieter gemeldete Ergebnisse, kein unabhängiger Modelflare-Benchmark. Test-Harness, Tool-Berechtigungen, Reasoning-Aufwand, Sampling-Einstellungen, Zeitlimits und Bewertungsregeln können Agentenergebnisse wesentlich verändern. Eine Produktionsentscheidung sollte dieselben datenschutzsicheren Aufgaben auf beiden Modellen wiederholen und die Kosten pro erfolgreich erledigter Aufgabe messen, nicht nur Tokens oder Benchmark-Rang.
Architektur und die 1M-Kontextangabe
DeepSeeks öffentliche V4-Modellkarte beschreibt die Pro-Familie als Mixture-of-Experts-Modell mit insgesamt 1,6 Billionen Parametern und 49 Milliarden aktivierten Parametern. Dokumentiert sind ein hybrides Attention-Design aus Compressed Sparse Attention und Heavily Compressed Attention, Manifold-Constrained Hyper-Connections, der Muon-Optimierer und Vortraining mit mehr als 32 Billionen Tokens.
DeepSeek gibt an, dass V4 Pro bei 1M Tokens Kontext 27 % der Single-Token-Inferenz-FLOPs und 10 % des KV-Caches von V3.2 benötigt. Das sind Architekturangaben des Modellherstellers; sie bedeuten nicht, dass eine Anfrage mit einer Million Tokens schnell, günstig oder an jeder Position gleich genau ist.
Für echte Long-Context-Arbeit:
- stabile Anweisungen und wiederverwendbares Repository-Material an den Anfang stellen, damit Präfix-Caching helfen kann;
prompt_cache_hit_tokensundprompt_cache_miss_tokenserfassen, statt einen Treffer anzunehmen;- veraltete Tool-Traces und doppelte Dateien verdichten, bevor sie das Kontextbudget verbrauchen;
- den Abruf in der tatsächlichen Dokumenttiefe und Token-Position der Anwendung testen;
- Platz für Reasoning, Tool-Ergebnisse und die endgültige Antwort lassen, statt das gesamte Fenster mit Eingabe zu füllen.
DeepSeeks Festplatten-Cache arbeitet automatisch und nach Best-Effort. Er gleicht wiederverwendbare Präfixe ab, kann einige Sekunden zum Aufbau benötigen und wird normalerweise nach Stunden bis Tagen Inaktivität gelöscht. Ändert sich bei einer wiederholten Anfrage der frühe Inhalt, kann fast der gesamte wirtschaftliche Vorteil entfallen.
API-Kompatibilität: Nativ bedeutet nicht identisch
| Oberfläche | Offizielle DeepSeek-Unterstützung | Wichtige Grenze |
|---|---|---|
| Chat Completions | Unterstützt | Tool-Schleifen mit Denkmodus müssen reasoning_content erhalten |
| Responses API | Unterstützt | Zustandslos; mehrere OpenAI-Felder werden ignoriert oder nicht unterstützt |
| Anthropic-kompatible API | Unterstützt | Einige Felder werden ignoriert; Bild- und Dokumentinhalte werden nicht unterstützt |
| FIM-Vervollständigung | Beta | Nur ohne Denkmodus und über den Beta-Endpunkt |
Die offizielle Responses-Schicht unterstützt Text, Funktionsaufrufe, serverseitige Websuche und das für Codex-Kompatibilität verwendete benutzerdefinierte Tool apply_patch. Nicht unterstützt werden previous_response_id, Konversationen, gespeicherte Responses, Hintergrundmodus, service_tier oder von OpenAI verwaltete Prompt-Cache-Schlüssel. Nicht unterstützte Felder werden oft stillschweigend ignoriert; HTTP 200 beweist daher keine semantische Gleichheit. Responses-Clients müssen ihren Verlauf selbst führen und Ereignistypen auswerten, statt auf den Chat-Completions-Marker [DONE] zu warten.
Bei Chat Completions gibt es eine weitere wichtige Grenze für Tool-Schleifen: Werden Denkmodus und Tools gemeinsam verwendet, muss reasoning_content des Assistenten in nachfolgenden Anfragen zurückgegeben werden. DeepSeek dokumentiert einen Fehler 400, wenn dieses Feld verloren geht. Gateways und SDK-Adapter sollten mit einer vollständigen mehrstufigen Tool-Schleife getestet werden, nicht mit einem einzelnen Text-Prompt.
Die GA-Ankündigung nennt low, high und max als verfügbare Reasoning-Stufen. Der aktuelle ausführliche Thinking-Leitfaden und die API-Referenz sagen jedoch, dass high und max die wirksamen Werte sind, low und medium auf high sowie xhigh auf max abgebildet werden. Bis DeepSeek diese Dokumente angleicht oder ein Live-Test eigenständiges low-Verhalten beweist, sollte keine angenommene Kostenreduktion durch niedrigen Aufwand eingeplant werden.
Offizielle DeepSeek-API-Preise: aktuell und zukünftig
Alle folgenden Preise sind USD pro eine Million Tokens. Die aktuellen Festpreise gelten laut Preisseite bis zum Beginn des neuen Plans am 16. August 2026 um 16:00 UTC, entsprechend dem 17. August um 00:00 Uhr in Peking.
| Preiszeitraum | Cache-Treffer-Eingabe | Cache-Fehlzugriff-Eingabe | Ausgabe |
|---|---|---|---|
| Aktueller Preis, geprüft 14. Aug. | $0.003625 | $0.435 | $0.87 |
| Neuer Off-Peak-Preis | $0.022 | $0.66 | $1.98 |
| Neuer Peak-Preis | $0.044 | $1.32 | $3.96 |
Im kommenden Plan gelten 01:00–04:00 und 06:00–10:00 UTC als Peak-Zeiten. Alle übrigen Stunden sind Off-Peak; dort gelten die halben Peak-Preise.
Der Übergang ist keine einfache zeitabhängige 2×-Teilung der heutigen Preise. Gegenüber dem aktuellen Festpreis ist der neue Off-Peak-Preis etwa 6,07× höher für gecachte Eingabe, 1,52× für ungecachte Eingabe und 2,28× für Ausgabe. Der Peak-Preis verdoppelt diese neuen Off-Peak-Werte. Cache-Wiederverwendung bleibt wertvoll, doch der außergewöhnlich niedrige Einführungspreis für gecachte Eingabe verändert sich am stärksten.
Durchgerechnete Kostenbeispiele
Die reine Token-Kostenformel lautet:
Kosten = Cache_Hit_Tokens × Cache_Hit_Rate + Cache_Miss_Tokens × Cache_Miss_Rate + Ausgabe_Tokens × Ausgabe_Rate
Die folgenden Beispiele schließen gesonderte Netzwerk-, Abonnement-, Tool-Service- oder Zahlungskosten aus. Ein Tool-Agent kann mehrere Modellaufrufe erzeugen; berechnen Sie daher die gesamte Aufgabe und nicht nur die erste Anfrage.
| Arbeitslast | DeepSeek aktuell | Neu Off-Peak | Neu Peak | Modelflare, Stand 14. Aug. |
|---|---|---|---|---|
| 100K ungecachte Eingabe + 10K Ausgabe | $0.0522 | $0.0858 | $0.1716 | $0.0540 |
| 90K gecacht + 10K ungecachte Eingabe + 10K Ausgabe | $0.0134 | $0.0284 | $0.0568 | $0.0138 |
| 900K gecacht + 100K ungecachte Eingabe + 20K Ausgabe | $0.0642 | $0.1254 | $0.2508 | $0.0663 |
Die zweite und dritte Zeile zeigen, warum die Prompt-Struktur wichtig ist. Ein großes stabiles Präfix kann die Kosten stark senken, aber erst nach einem echten Cache-Treffer. Für die Abrechnung sind die Nutzungsfelder der API die maßgebliche Quelle.
DeepSeek V4 Pro vs. V4 Flash: Preis-Leistungs-Wahl
Zu den aktuellen offiziellen Raten kostet Pro für ungecachte Eingabe und Ausgabe etwa 3,11× so viel wie Flash, für gecachte Eingabe aber nur 1,29×. Nach Start des neuen Plans kostet Pro für ungecachte Eingabe und Ausgabe 3× und für gecachte Eingabe etwa 3,14× so viel wie Flash. Die offizielle Konto-Parallelität liegt bei 500 für Pro und 2.500 für Flash.
Daraus ergibt sich eine klare Betriebsregel:
- V4 Pro für schwierige Repository-Änderungen, lang laufende Agenten, Sicherheitsanalysen, komplexe Tool-Koordination und Aufgaben wählen, bei denen ein Fehlversuch teuer ist;
- V4 Flash für einfachere Agenten, parallele Worker, Vorverarbeitung, Extraktion, Zusammenfassung und durchsatzkritischen Traffic wählen;
- anhand beobachteter Aufgabenschwierigkeit und Kosten pro Erfolg routen, statt Pro zum universellen Standard zu machen;
- nach der Preisumstellung neu bewerten, da sich die Wirtschaftlichkeit gecachter Pro-Workloads wesentlich ändert.
Ein 3× höherer Token-Preis kann dennoch günstiger sein, wenn Pro Wiederholungen oder menschliche Nacharbeit vermeidet. Umgekehrt rechtfertigen fünf Benchmark-Punkte nicht, deterministische oder triviale Arbeit an das größere Modell zu senden. Messen Sie Abschlussquote, Laufzeit, Gesamttokens über Wiederholungen, Tool-Fehler und Korrekturzeit der Prüfer.
Preis und Verfügbarkeit von DeepSeek V4 Pro bei Modelflare
Der aktuelle Modelflare-Preiskatalog wurde am 14. August 2026 geprüft. Er führt deepseek-v4-pro und den festen Alias deepseek-v4-pro-0813 in der Gruppe deepseek-stable zu folgenden Grundpreisen pro eine Million Tokens:
| Modelflare-Preisstand | Preis |
|---|---|
| Cache-Treffer-Eingabe | $0.0037 |
| Cache-Fehlzugriff-Eingabe | $0.45 |
| Ausgabe | $0.90 |
Diese Raten liegen etwa 2,07 % über DeepSeeks aktuellem Preis für gecachte Eingabe und 3,45 % über den aktuellen Preisen für ungecachte Eingabe und Ausgabe. Dieser Artikel verspricht nicht, dass die Modelflare-Preise nach DeepSeeks Peak-/Off-Peak-Umstellung unverändert bleiben. Nutzen Sie für Produktionsentscheidungen immer die aktuelle Preisseite und den Nutzungsdatensatz der Anfrage.
Die aktuellen öffentlichen Katalogmetadaten kennzeichnen die Modelflare-Route als OpenAI-kompatible Chat Completions. Obwohl DeepSeeks eigener Endpunkt nun Responses- und Anthropic-Formate unterstützt, macht Anbieterunterstützung nicht automatisch jede Gateway-Route kompatibel. Verwenden Sie das exakt auf der Live-Preisseite ausgewiesene Protokoll.
export MODELFLARE_API_KEY="your-api-key"
curl https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer ${MODELFLARE_API_KEY}" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "Review this migration plan and identify rollback risks."}
],
"thinking": {"type": "enabled"},
"reasoning_effort": "high"
}'
Zur allgemeinen Client-Einrichtung lesen Sie den Leitfaden zur OpenAI-kompatiblen API. Zur Abrechnung und Interpretation von Cache-Tokens lesen Sie Kostenverfolgung für KI-APIs.
Checkliste für die Produktionsevaluierung
- Fixieren Sie während der Evaluierung
deepseek-v4-pro-0813, sofern die Route dies anbietet, und entscheiden Sie anschließend, ob der stabile Alias für Ihre Änderungskontrolle genügt. - Spielen Sie einen festen datenschutzsicheren Aufgabensatz auf Pro und Flash mit denselben Tools, Berechtigungen, Timeouts und Abbruchregeln ab.
- Testen Sie
highundmax; behandeln Sielowals gleichwertig zuhigh, bis aktuelles API-Verhalten etwas anderes belegt. - Schließen Sie eine mehrstufige Tool-Schleife ab und prüfen Sie, dass
reasoning_content, Tool-IDs, Argumente und Ergebnisse jeden Adapter überstehen. - Testen Sie bei Responses-Clients jedes benötigte Feld ausdrücklich, weil nicht unterstützte Parameter stillschweigend ignoriert werden können.
- Erfassen Sie gecachte Eingabe, ungecachte Eingabe, Ausgabe, Reasoning-Tokens, Latenz, Wiederholungen und Kosten pro erfolgreicher Aufgabe.
- Testen Sie lange Prompts in realistischer Tiefe; schließen Sie nicht von einer kurzen Anfrage auf die Abrufqualität bei einer Million Tokens.
- Führen Sie Lasttests unterhalb des Konto-Parallelitätslimits durch und behandeln Sie 429-Antworten mit begrenztem Backoff.
- Modellieren Sie sowohl den aktuellen Preis als auch den Peak-/Off-Peak-Plan vom 16./17. August, bevor Sie ein Budget freigeben.
- Halten Sie Flash oder ein Alternativmodell als Ausweichroute für Verfügbarkeit und Kostenkontrolle bereit; siehe zuverlässiges KI-API-Routing.
Abschließendes Urteil
DeepSeek V4 Pro GA ist eine bedeutende, auf Agenten ausgerichtete Veröffentlichung und nicht nur eine umbenannte Vorschau. Das offizielle Ergebnismuster ist am stärksten bei Repository-Reasoning, schwieriger Programmierung und Automatisierung. Die neue Responses-Oberfläche macht das Modell zugleich für moderne Coding-Agenten praktischer. Der 1M-Kontext und das automatische Caching sind nützlich, aber nur wenn Anwendungen stabile Präfixe bewahren und echte Cache-Treffer prüfen.
Der wichtigste Vorbehalt ist wirtschaftlich: Nach der Einführung kostet Pro in den meisten Token-Kategorien ungefähr das Dreifache von Flash und bietet weniger Parallelität. Es sollte die Eskalationsstufe für schwierige, hochwertige Arbeit sein und nicht der Standard für jeden Prompt. Eine gute Produktionsarchitektur wird einfache Arbeit meist an Flash leiten und nur schwierige oder fehlgeschlagene Aufgaben auf Pro hochstufen.
Der Modelflare-Preisstand vom 14. August liegt nahe an DeepSeeks aktuellem Festpreis und stellt V4 Pro derzeit über Chat Completions bereit. Prüfen Sie die Live-Seite erneut, sobald DeepSeeks neuer Plan beginnt; weder ein alter Artikel noch ein gecachter Preis-Screenshot ist die Abrechnungswahrheit.
Quellen und Prüfdatum
- DeepSeek: V4 Pro GA-Veröffentlichung
- DeepSeek-API-Modelle und Preise
- Änderungsprotokoll der DeepSeek API
- DeepSeek-Denkmodus
- DeepSeek Responses API-Kompatibilität
- DeepSeek Anthropic API-Kompatibilität
- DeepSeek-Kontext-Caching
- DeepSeek-Ratenlimits und Isolation
- DeepSeek V4 Pro Modellkarte und offene Gewichte
Offizielle Spezifikationen, Preispläne, Modelflare-Verfügbarkeit und Live-Preise wurden am 14. August 2026 geprüft.