GLM-5.3, Kimi K3 und Qwen3.8-Max: Fähigkeiten, Preise und API
Faktengeprüfter Leitfaden zu GLM-5.3, Kimi K3 und Qwen3.8-Max mit Primärquellen, Modelflare-Preisen und -Gruppen, Chat Completions, Responses, Anthropic Messages und Produktionschecks.
Modelflare stellt glm-5.3, kimi-k3 und qwen3.8-max jetzt über ein gemeinsames kompatibles Gateway bereit. Dieser Launch-Leitfaden erklärt passende Einsatzbereiche, den aktuellen USD-Preisstand, die drei unterstützten Anfrageverträge und den sicheren Weg vom API-Key bis zum Produktionsprobe.
Die folgenden Angaben trennen Quellen der Anbieter von Fakten aus dem Modelflare-Katalog. Eine Anbieterzusage ist nicht automatisch eine Gateway-Funktion: Prüfe immer den aktuellen Modelleintag und den Endpoint, den dein Client verwendet.
Änderliche Verfügbarkeit, Gruppen und Preise wurden am 29. August 2026 geprüft. Danach ist die Modelflare-Preisseite maßgeblich.
Drei Modelle im Überblick
| Modell-ID | Guter Ausgangspunkt | Hinweise aus den Primärquellen | Kontext und Reasoning |
|---|---|---|---|
| glm-5.3 | Komplexe Programmierung und lang laufende Agents | Z.ai positioniert GLM-5.3 für schwierigen Code und längere Agent-Aufgaben; Denken bleibt in der API aktiviert | Denken ist immer aktiv; dokumentierte Stufen low, high, max, Standard max |
| kimi-k3 | Programmierung mit langem Kontext und Wissensarbeit | Kimi dokumentiert natives Bildverständnis und durchgängige Aufgaben mit langem Horizont | Bis zu 1M Kontext; Denken immer aktiv; low, high, max, Standard max |
| qwen3.8-max | Professionelle Abläufe und lang laufende Agents | Qwen dokumentiert ein MoE mit 2,4T Gesamt- und 95B aktiven Parametern, Code, visueller Eingabe und tool-orientierten Abläufen | 1M Kontext; Text-, Bild- und Videoeingabe; Textausgabe; einige Tools hängen von Region und Endpoint ab |
Lies die GLM-5.3-Ankündigung, die Kimi-Modellauswahl und die Qwen3.8-Max-Referenz für die aktuelle Formulierung der Anbieter. Deren Benchmarkwerte sind Anbieterberichte und keine Modelflare-Garantie.
Nach Arbeitslast auswählen
- Nutze glm-5.3 für anhaltende Planung, schwierige Codeänderungen oder lange Agent-Schleifen, wenn dauerhaftes Reasoning ins Budget passt.
- Nutze kimi-k3, wenn sehr großer Kontext, Bildverständnis oder ein durchgängiger Wissensarbeitsablauf entscheidend ist.
- Nutze qwen3.8-max, wenn ein 1M-Token-Fenster, multimodale Eingabe, strukturierte Tools oder professionelle Automatisierung wichtig sind.
Das sind Startpunkte, keine allgemeine Rangliste. Spiele eine datenschutzbereinigte Stichprobe eigener Aufgaben ab und messe Kosten erfolgreicher Aufgaben, Wiederholungen, Latenz und Prüfzeit. Ein großes Kontextlimit ist eine Obergrenze und keine Zusage gleicher Qualität oder Geschwindigkeit an jeder Position.
Modelflare-Preisstand
Die folgenden Werte sind USD pro 1 Million Token für die aktuellen öffentlichen Gruppen. Der Gruppenmultiplikator ist 0.8x und entspricht der Ankündigungsformel „offizieller Preis × 0.8“.
| Modell | Gruppe | Eingabe | Ausgabe | Cache-Eingabe |
|---|---|---|---|---|
| glm-5.3 | glm-stable | $1.12 | $3.52 | etwa $0.21 |
| kimi-k3 | kimi-stable | $2.40 | $12.00 | $0.24 |
| qwen3.8-max | qwen-stable | $1.60 | $4.80 | $0.20 |
Die Werte stammen aus Eingabepreis, Completion-, Cache- und Gruppenmultiplikator des Live-Katalogs und sind für die Lesbarkeit gerundet. Wenn die Preisseite ein eigenes Feld für Cache-Schreiben zeigt, verwende dieses für die Cache-Erstellung und leite es nicht aus dem Lesezugriff ab.
Alle drei Gruppen zeigen derzeit rpm: 0. Damit ist im Katalog kein fester RPM-Gruppenwert auf Plattformseite eingerichtet. Anbieter-, Konto-, Netzwerk- und Sicherheitsgrenzen bleiben bestehen. Preise und Verfügbarkeit ändern sich; gleiche die Live-Preisseite mit dem Nutzungsdatensatz ab.
Ein Gateway, drei API-Verträge
In diesem Snapshot markiert der Modelflare-Katalog alle drei IDs für diese öffentlichen Formate:
| Vertrag | Endpoint | Authentifizierung | Geeignet für |
|---|---|---|---|
| OpenAI Chat Completions | POST /v1/chat/completions | Authorization: Bearer | Vorhandene Chat-Clients und kompatible SDKs |
| OpenAI Responses | POST /v1/responses | Authorization: Bearer | Clients mit Responses-Elementen und -Events |
| Anthropic-Messages-kompatibel | POST /v1/messages | x-api-key oder Bearer plus anthropic-version | Anthropic-geformte Clients und Nachrichtenströme |
Die gemeinsame OpenAI-kompatible Base-URL lautet https://modelflare.dev/v1. Anthropic-SDKs verwenden meist https://modelflare.dev als Basis und ergänzen /v1/messages. Endpoint-Verfügbarkeit bedeutet keine Funktionsparität: Streaming-Events, Tools, strukturierte Ausgabe, multimodale Eingabe und Reasoning-Steuerung müssen separat geprüft werden.
Über Modelflare verbinden
- Erstelle oder aktualisiere unter API Keys einen Schlüssel und gib ihm die Gruppe des gewünschten Modells: glm-stable, kimi-stable oder qwen-stable.
- Halte den Schlüssel in einer Umgebungsvariable. Nicht in Repository, Browser-Speicher oder Support-Ticket ablegen.
- Prüfe die authentifizierte Antwort von /v1/models und sende mit der exakten ID eine kleine Anfrage ohne Streaming.
- Teste Streaming als eigenen Vertrag, bevor ein Agent oder Nutzerverkehr umgestellt wird.
Chat Completions
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "Fasse die Migrationsrisiken in drei Punkten zusammen."}],
"stream": false
}'
Responses API
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"input": "Gib eine kurze Checkliste für eine sichere Datenbankmigration zurück.",
"stream": false
}'
Anthropic Messages
curl -sS https://modelflare.dev/v1/messages \
-H "x-api-key: $MODELFLARE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Nenne die ersten drei Rollout-Prüfungen."}]
}'
Die Beispiele verwenden absichtlich Klartext und stream: false. Aktiviere Streaming erst, wenn der Client das Ereignisformat des gewählten Vertrags verarbeitet. Explizite Werte 0 und false müssen erhalten bleiben; provider-spezifische Felder nicht ohne Vertragsprüfung zwischen Modellen übertragen.
Vor Produktion prüfen
- Liste Modelle mit demselben Schlüssel und bestätige exakte ID und Gruppe.
- Führe am tatsächlichen Anwendungs-Endpoint je einen Test mit und ohne Streaming aus.
- Teste Tools, strukturierte Ausgabe, Bilder, Video und Reasoning-Steuerung einzeln, falls die Arbeitslast sie benötigt; eine Textantwort beweist die übrigen Funktionen nicht.
- Speichere Status, gewählte Gruppe, Eingabe-/Ausgabe-/Cache-Token, Latenz, Wiederholungen und Endabrechnung aus dem Nutzungsdatensatz.
- Begrenze Anwendungswiederholungen und unterscheide temporären Kapazitätsdruck von einem endgültigen Modell- oder Richtlinienfehler.
- Prüfe die Live-Preise vor hohem Volumen erneut; Preisseite und Nutzungsdatensatz sind maßgeblicher als kopierte Tabellen.
FAQ
Sind diese Preise dauerhaft? Nein. Dies ist ein datierter Katalogstand; die Live-Preisseite ist die Quelle der Wahrheit.
Bedeutet rpm: 0 unbegrenzten Verkehr? Nein. Die Gruppe hat nur keine plattformseitige RPM-Grenze. Anbieter-, Konto-, Netzwerk- und Sicherheitslimits können weiterhin greifen.
Kann derselbe Payload an alle drei Protokolle gehen? Nein. Behalte die Modell-ID, passe aber Envelope, Authentifizierung, Antwortparser und Streaming-Handler an den Vertrag an.
Welche Modelle dokumentieren 1M Kontext? Kimi K3 und Qwen3.8-Max nennen 1M in den verlinkten Primärquellen. Für GLM-5.3 macht diese Seite keine 1M-Angabe.
Quellen und Aktualität
- Z.ai: GLM-5.3
- Kimi API-Modellauswahl
- Alibaba Cloud Model Studio: Qwen3.8-Max
- Modelflare Live-Preise
- Ausführlicher Qwen3.8-Max-Leitfaden auf Modelflare
- OpenAI-kompatibler API-Leitfaden
- Responses API und Chat Completions im Vergleich
Aktualisierungsnotiz: 29. August 2026 — erste Fassung; Primärseiten, Modelflare-Gruppen, Endpoint-Markierungen und Preise wurden an diesem Tag geprüft.