GLM-5.3, Kimi K3, dan Qwen3.8-Max: kemampuan, harga, dan API
Panduan terverifikasi untuk GLM-5.3, Kimi K3, dan Qwen3.8-Max mencakup kemampuan pihak pertama, harga dan grup Modelflare, contoh Chat Completions, Responses, Anthropic Messages, serta pemeriksaan production.
Modelflare kini menyediakan glm-5.3, kimi-k3, dan qwen3.8-max melalui satu gateway kompatibel. Panduan peluncuran ini menjelaskan kegunaan tiap model, snapshot harga USD saat ini, tiga kontrak permintaan, serta jalur aman dari pembuatan API Key hingga probe production.
Isi berikut memisahkan dokumentasi pihak pertama vendor dari fakta katalog Modelflare. Kemampuan yang diklaim vendor tidak otomatis menjadi fitur gateway: selalu periksa baris model terkini dan uji endpoint yang benar-benar dipakai klien.
Ketersediaan, grup, dan harga yang dapat berubah diperiksa pada 29 Agustus 2026. Setelah tanggal itu, gunakan halaman harga Modelflare sebagai acuan.
Ringkasan tiga model
| ID model | Titik awal yang sesuai | Catatan kemampuan pihak pertama | Konteks dan penalaran |
|---|---|---|---|
| glm-5.3 | Coding kompleks dan tugas Agent jangka panjang | Z.ai memosisikan GLM-5.3 untuk coding sulit dan tugas agen yang lebih panjang; thinking tetap aktif di API | Thinking selalu aktif; level terdokumentasi low, high, max, default max |
| kimi-k3 | Coding konteks panjang dan pekerjaan pengetahuan | Kimi mendokumentasikan pemahaman visual native dan pekerjaan end-to-end jangka panjang | Konteks hingga 1M; thinking selalu aktif; low, high, max, default max |
| qwen3.8-max | Workflow profesional dan Agent panjang | Qwen mendokumentasikan MoE 2,4T total / 95B aktif dengan coding, input visual, dan workflow berorientasi tool | Konteks 1M; input teks, gambar, dan video; output teks; beberapa tool bergantung wilayah dan endpoint |
Baca pengumuman GLM-5.3, panduan pemilihan model Kimi, dan referensi Qwen3.8-Max untuk keterangan vendor terbaru. Angka benchmark dilaporkan oleh vendor dan bukan jaminan Modelflare.
Pilih berdasarkan workload
- Pilih glm-5.3 ketika tugas memerlukan perencanaan berkelanjutan, perubahan kode sulit, atau loop Agent panjang dan biaya reasoning selalu aktif dapat diterima.
- Pilih kimi-k3 ketika konteks sangat besar, pemahaman visual, atau alur pekerjaan pengetahuan end-to-end menjadi inti.
- Pilih qwen3.8-max ketika jendela 1M Token, input multimodal, tool terstruktur, atau otomatisasi profesional penting.
Ini titik awal, bukan peringkat universal. Putar ulang sampel tugas sendiri yang aman dari data sensitif dan ukur biaya per tugas berhasil, retry, latensi, serta waktu review. Batas konteks besar adalah kapasitas maksimum, bukan janji kegunaan atau kecepatan yang sama di setiap posisi.
Snapshot harga Modelflare
Nilai berikut adalah USD per 1 juta token untuk grup publik saat ini. Pengali grup sebesar 0.8x, sesuai ungkapan pengumuman “harga resmi × 0.8”.
| Model | Grup | Input | Output | Input cache |
|---|---|---|---|---|
| glm-5.3 | glm-stable | $1.12 | $3.52 | sekitar $0.21 |
| kimi-k3 | kimi-stable | $2.40 | $12.00 | $0.24 |
| qwen3.8-max | qwen-stable | $1.60 | $4.80 | $0.20 |
Nilai dihitung dari harga input, rasio completion, rasio cache, dan pengali grup pada katalog live, lalu dibulatkan agar mudah dibaca. Jika halaman harga menampilkan field khusus penulisan cache, gunakan field itu untuk pembuatan cache dan jangan menyimpulkannya dari harga baca.
Ketiga grup saat ini menampilkan rpm: 0, yang berarti katalog tidak menetapkan batas RPM grup tetap di sisi platform. Hal itu tidak menghapus kontrol vendor, akun, jaringan, atau keamanan. Harga dan ketersediaan berubah; cocokkan halaman harga live dengan catatan penggunaan.
Satu gateway, tiga kontrak API
Pada snapshot ini, katalog Modelflare menandai ketiga ID model untuk format publik berikut:
| Kontrak | Endpoint | Autentikasi | Cocok untuk |
|---|---|---|---|
| OpenAI Chat Completions | POST /v1/chat/completions | Authorization: Bearer | Klien chat lama dan SDK kompatibel |
| OpenAI Responses | POST /v1/responses | Authorization: Bearer | Klien yang memproses item dan event Responses |
| Kompatibel Anthropic Messages | POST /v1/messages | x-api-key atau Bearer ditambah anthropic-version | Klien berbentuk Anthropic dan stream pesan |
Base URL bersama yang kompatibel OpenAI adalah https://modelflare.dev/v1. SDK Anthropic biasanya memakai https://modelflare.dev sebagai base dan menambahkan /v1/messages. Ketersediaan endpoint bukan kesetaraan fitur: uji event streaming, tool, output terstruktur, input multimodal, dan kontrol reasoning secara terpisah.
Hubungkan melalui Modelflare
- Di API Keys, buat atau perbarui key dan berikan grup yang memuat model: glm-stable, kimi-stable, atau qwen-stable.
- Simpan key dalam environment variable. Jangan menaruhnya di repository, penyimpanan browser, atau tiket dukungan.
- Konfirmasi respons /v1/models yang terautentikasi, lalu kirim permintaan kecil non-streaming memakai ID yang tepat.
- Uji streaming sebagai kontrak terpisah sebelum memindahkan Agent atau traffic pengguna.
Chat Completions
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "Ringkas risiko migrasi dalam tiga poin."}],
"stream": false
}'
Responses API
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"input": "Berikan daftar singkat untuk migrasi database yang aman.",
"stream": false
}'
Anthropic Messages
curl -sS https://modelflare.dev/v1/messages \
-H "x-api-key: $MODELFLARE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"max_tokens": 256,
"messages": [{"role": "user", "content": "Sebutkan tiga pemeriksaan rollout pertama."}]
}'
Contoh sengaja memakai teks biasa dan stream: false. Aktifkan streaming hanya setelah klien menangani format event kontrak tersebut. Pertahankan nilai eksplisit 0 dan false jika bermakna, dan jangan menyalin field khusus vendor antar-model tanpa memeriksa kontraknya.
Verifikasi sebelum production
- Daftar model dengan key yang sama dan pastikan ID serta grup yang tepat terlihat.
- Jalankan satu probe non-streaming dan satu streaming pada endpoint yang benar-benar dipanggil aplikasi.
- Jika workload memakai tool, output terstruktur, gambar, video, atau kontrol reasoning, uji tiap fungsi pada model terpilih; respons teks yang berhasil bukan bukti fungsi lain.
- Catat status, grup terpilih, token input/output/cache, latensi, retry, dan biaya akhir dari catatan penggunaan.
- Batasi retry aplikasi dan bedakan respons kapasitas sementara dari error model atau kebijakan yang terminal.
- Periksa ulang harga live sebelum peluncuran volume besar; halaman harga dan catatan penggunaan lebih utama daripada tabel salinan.
Pertanyaan umum
Apakah harga ini permanen? Tidak. Ini snapshot katalog bertanggal; halaman harga live adalah sumber kebenaran.
Apakah rpm: 0 berarti traffic tanpa batas? Tidak. Artinya grup tidak memiliki plafon RPM yang dikonfigurasi di platform. Batas vendor, akun, jaringan, dan keamanan tetap dapat berlaku.
Bisakah payload yang sama dikirim ke tiga protokol? Tidak. Pertahankan ID model, tetapi sesuaikan envelope, autentikasi, parser respons, dan handler streaming dengan kontrak pilihan.
Model mana yang mendokumentasikan konteks 1M? Kimi K3 dan Qwen3.8-Max mencantumkan 1M dalam referensi pihak pertama yang ditautkan. Halaman ini tidak mengklaim 1M untuk GLM-5.3.
Sumber dan pembaruan
- Z.ai: GLM-5.3
- Pemilihan model API Kimi
- Alibaba Cloud Model Studio: Qwen3.8-Max
- Harga live Modelflare
- Panduan mendalam Qwen3.8-Max di Modelflare
- Panduan API kompatibel OpenAI
- Responses API dan Chat Completions
Catatan pembaruan: 29 Agustus 2026 — versi awal; halaman kemampuan pihak pertama, grup Modelflare, penanda endpoint, dan harga diperiksa pada tanggal itu.