Qwen3.8-Max: 2.4T-MoE und Einrichtung mit Modelflare
Praxisleitfaden zu Qwen3.8-Max: 2.4T/95B-MoE, multimodaler 1M-Kontext, Reasoning-Steuerung, aktuelle Modelflare-Preise und empfohlene Einführung.
Das Qwen-Team hat Qwen3.8-Max am 3. August 2026 offiziell veröffentlicht. Es handelt sich weder um das leicht zu verwechselnde ältere Modell Qwen3-8B noch nur um die Preview qwen3.8-max-preview vom Juli. Die aktuelle offizielle API-Modell-ID lautet qwen3.8-max, und Modelflare verwendet dieselbe ID.
Qwen3.8-Max ist das derzeit größte Max-Flaggschiff von Qwen und richtet sich an Coding, professionelle Workflows, langfristige Agents und native multimodale Aufgaben. Qwen kündigte zugleich an, die Open Weights von Qwen3.8-Max und Qwen3.8-27B in der folgenden Woche zu veröffentlichen. Bis Repositories und Lizenzen tatsächlich verfügbar sind, lautet die genaue Einordnung „Open Weights angekündigt“ und nicht „bereits lokal einsetzbar“.
Zentrale Spezifikationen
| Merkmal | Qwen3.8-Max |
|---|---|
| Modelflare-Modell-ID | qwen3.8-max |
| Architektur | Mixture-of-Experts (MoE) |
| Parameter insgesamt | 2.4T |
| Aktivierte Parameter pro Token | 95B |
| Kontextlänge | 1M tokens |
| Maximale Eingabe ohne Thinking Mode | 991K tokens |
| Maximale Eingabe im Thinking Mode | 983K tokens |
| Maximale Ausgabe | 131K tokens |
| Maximale Reasoning-Token | 262K tokens |
| Eingabemodalitäten | Text, Bild und Video |
| Ausgabemodalität | Text |
| Reasoning-Stufe | low, medium oder xhigh; Standard ist xhigh |
| Offizielle Funktionen | Prefix Completion, Function Calling, Context Cache, Structured Outputs, Batch und integrierte Responses-Tools |
2.4T bezeichnet die Gesamtgröße des Modells und nicht die Zahl der Parameter, die für jedes Token ausgeführt werden. Die offizielle Veröffentlichung nennt 95B aktivierte Parameter. Diese Größe eignet sich besser, um den tatsächlichen Rechenaufwand der MoE-Inferenz einzuordnen. Ein Kontext von 1M tokens bedeutet ebenfalls nicht, dass jede Anfrage ihn vollständig ausfüllen sollte. Je größer Eingabe und Reasoning-Budget werden, desto bewusster müssen Latenz, Cache und Kosten gestaltet werden.
Worauf Qwen3.8-Max ausgerichtet ist
Qwen positioniert dieses Release als breites Upgrade für Coding und Cowork und hebt drei Arten von Aufgaben hervor:
- Mehrtägige Softwareprojekte aus einem leeren Verzeichnis heraus abschließen, statt nur einzelne Funktionen zu erzeugen.
- Mehrstufige Ergebnisse für Forschung, Datenanalyse, Office, Design und andere professionelle Workflows organisieren.
- Bild- und Videoverständnis in Planung, Ausführung und Prüfung einsetzen, nicht nur für eine einmalige statische Erkennung.
Qwen zeigt Anbieter-Demonstrationen mit mehr als zehn Tagen autonomem Coding und Hunderten Iterationen zur Optimierung eines Chipdesigns. Diese Beispiele auf Systemebene hängen von Harness, Tools, Umgebung, Prompts und Bewertungsmethode ab und garantieren kein gleiches Ergebnis in der eigenen Anwendung. Für die Produktionsauswahl sollten eigene Repositories, Dokumente, Tool-Berechtigungen und Abnahmekriterien in einem festen Testkorpus verwendet werden.
Reasoning-Stufe auswählen
Qwen3.8-Max unterstützt reasoning_effort:
lowfür kurze Antworten, einfache Codeerklärungen und kostensensible Aufgaben.mediumals Ausgangspunkt für tägliche Entwicklung, Analyse und mehrstufige Aufgaben.xhighfür schwieriges Reasoning, langfristige Agents und komplexe Facharbeit; dies ist zugleich der Standardwert.
Qwen gibt an, dass preserve_thinking standardmäßig aktiv ist, damit mehrstufige Arbeit den vorherigen Reasoning-Zustand fortsetzen kann. Rekonstruiert ein Client den Nachrichtenverlauf selbst, sollte er die vom Anbieter zurückgegebenen Reasoning-Felder und Tool-Zustände erhalten, statt nur den finalen Text zusammenzufügen. Das Modell erlaubt bis zu 262K Reasoning-Token. Ein verfügbares Maximum ist jedoch kein empfohlener Standard; effort sollte nach Aufgabenerfolg und Stückkosten gewählt werden.
Aktuelle Verfügbarkeit bei Modelflare
Mit Stand vom 4. August 2026 listet Modelflare qwen3.8-max für:
- OpenAI Chat Completions,
- OpenAI Responses,
- einen Anthropic-Messages-kompatiblen Endpunkt.
Eine Protokollangabe belegt, dass der Pfad existiert, nicht dass jede private QwenCloud-Funktion automatisch weitergereicht wird. QwenCloud nennt web_search, code_interpreter, web_extractor, t2i_search und i2i_search als integrierte Responses-Tools. Bis jede Funktion über den genauen Modelflare-Zielpfad geprüft wurde, sollte clientdefiniertes Function Calling bevorzugt und sollten integrierte Tools als ungeprüft behandelt werden.
Die aktuelle öffentliche Preisübersicht für die Gruppe qwen-award lautet, jeweils in US-Dollar pro 1 Million tokens:
| Abrechnungsposten | Preis |
|---|---|
| Eingabe | $1.239 |
| Ausgabe | $3.71 |
| Cache-Lesezugriff | $0.161 |
| Explizite Cache-Erstellung | $1.547 |
| Explizite Cache-Erstellung für eine Stunde | $2.4752 |
Die Gruppe ist nur für berechtigte API Keys verfügbar. Preise, Berechtigungen und Protokollumfang können sich ändern. Verwenden Sie Modelle und Preise und die Nutzungsprotokolle pro Anfrage als aktuelle Quelle.
Empfohlene Chat-Completions-Konfiguration
Legen Sie den Modelflare API Key zunächst in einer Umgebungsvariable ab:
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
Prüfen Sie den grundlegenden Pfad zuerst mit einer Textanfrage:
curl -N -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Design a safe rollout plan for this service and include validation and rollback gates."
}
],
"reasoning_effort": "medium",
"stream": true
}'
Erstellen Sie mit medium zunächst eine Basis für Qualität, Latenz und Kosten. Nur Aufgaben, die tatsächlich tieferes Reasoning benötigen, werden auf xhigh angehoben. Dass der Upstream xhigh als Standard verwendet, ist kein Grund, jede Batch-Anfrage mit dem maximalen Reasoning-Budget auszuführen.
Multimodale Eingaben einführen
Das offizielle Modell akzeptiert Text, Bilder und Video. Multimodale Inhaltsformate unterscheiden sich jedoch je nach Protokoll und Upstream-Implementierung. Die Einführung sollte in drei Schritten erfolgen:
- Zuerst Authentifizierung, Modellzugriff, Streaming und Abrechnung nur mit Text prüfen.
- Mit einem festen Testbild Inhaltsformat, Größenlimits und Ausgabe validieren.
- Erst danach lange Videos, Tools oder mehrstufiges visuelles Feedback hinzufügen und prüfen, ob Wiederholungen abrechenbare Arbeit duplizieren.
Bild-URLs, Base64-Payloads, Datei-Uploads und Objektspeicher des Anbieters sind keine austauschbaren Protokolle. Testen Sie genau den Inhaltsblock Ende-zu-Ende, den der Client tatsächlich senden wird.
Empfohlene Plattformkonfiguration
- Pro Anwendung einen eigenen API Key verwenden und sicherstellen, dass die primäre Gruppe
qwen3.8-maxtatsächlich aufführt. - Tägliche Entwicklung und Analyse mit
mediumbeginnen, kurze Aufgaben auflowreduzieren undxhighschwierigen langfristigen Aufgaben vorbehalten. - Segmentierung und Cache für Langkontextaufgaben planen, statt bei jeder Anfrage die gesamte Wissensbasis in einen 1M-Kontext zu laden.
- Die wire contracts von Chat Completions, Responses und Anthropic getrennt prüfen.
- Integrierte Tools des Anbieters erst dann zur Produktionsabhängigkeit machen, wenn sie eine reale Anfrage über den Zielpfad von Modelflare bestanden haben.
- Erfolgsquote, erste Ausgabe, Gesamtlatenz, Reasoning-Token, Cache-Treffer und Kosten pro Anfrage anhand eines festen Aufgabensatzes vergleichen.
- Beim Wechsel von der Preview zum Produktionsmodell Regressionsbeispiele erneut ausführen und nicht annehmen, dass derselbe Familienname identische Ausgaben garantiert.
Geeignete und weniger geeignete Einsatzfälle
Qwen3.8-Max eignet sich für komplexe Softwareentwicklung, mehrstufige professionelle Workflows, Verständnis langer Dokumente und Videos, Agents mit multimodalem Feedback sowie Teams, die Reasoning und Orchestrierung in einem Flaggschiffmodell bündeln möchten. Für einfache Texttransformationen mit hohem Durchsatz und niedriger Latenz ist es möglicherweise nicht der wirtschaftlichste Standard. Vergleichen Sie bei identischen Eingaben Kosten und Latenz mit Qwen Flash, DeepSeek V4 Flash oder einem anderen kleineren Modell.
Quellen und Aktualität
- Offizielle Veröffentlichung von Qwen3.8-Max: Releasedatum, 95B aktivierte Parameter, Coding-/Cowork-Demonstrationen und Open-Weights-Plan.
- QwenCloud-Modellseite zu Qwen3.8-Max: Kontext, Ein- und Ausgabelimits, Modalitäten, offizielle Funktionen und Preise.
- Modelflare-Modelle und Preise: aktuelle Gruppen, Protokolle und Plattformpreise.
Dieser Artikel wurde am 4. August 2026 geprüft. Status der Open Weights, Modellsnapshots, Preise und Protokollunterstützung können sich ändern. Für Produktionskonfigurationen gelten die zum Zeitpunkt des Aufrufs aktuelle offizielle Modellseite, die Lizenz des Weight-Repositories und der Live-Katalog von Modelflare.