Qwen3.8-Max: spesifikasi MoE 2.4T dan konfigurasi Modelflare
Panduan praktis Qwen3.8-Max: MoE 2.4T/95B, konteks multimodal 1M tokens, kontrol penalaran, harga Modelflare saat ini, dan konfigurasi rollout.
Tim Qwen resmi merilis Qwen3.8-Max pada 3 Agustus 2026. Model ini bukan Qwen3-8B lama yang mudah tertukar, dan tidak lagi hanya berupa qwen3.8-max-preview dari Juli: ID model API resmi saat ini adalah qwen3.8-max, sama dengan ID yang digunakan Modelflare.
Qwen3.8-Max adalah model flagship Max terbesar Qwen saat ini, ditujukan untuk coding, workflow profesional, Agent jangka panjang, dan tugas multimodal native. Qwen juga mengumumkan bahwa open weights Qwen3.8-Max dan Qwen3.8-27B akan hadir pada minggu berikutnya. Sampai repositori dan lisensinya benar-benar diterbitkan, deskripsi yang tepat adalah “open weights telah diumumkan”, bukan “sudah tersedia untuk deployment lokal”.
Spesifikasi utama
| Item | Qwen3.8-Max |
|---|---|
| ID model Modelflare | qwen3.8-max |
| Arsitektur | Mixture-of-Experts (MoE) |
| Total parameter | 2.4T |
| Parameter aktif per Token | 95B |
| Panjang konteks | 1M tokens |
| Input maksimum tanpa penalaran | 991K tokens |
| Input maksimum dengan penalaran | 983K tokens |
| Output maksimum | 131K tokens |
| Token penalaran maksimum | 262K tokens |
| Modalitas input | Teks, gambar, dan video |
| Modalitas output | Teks |
| Intensitas penalaran | low, medium, atau xhigh; default xhigh |
| Fitur resmi | Prefix Completion, Function Calling, Context Cache, Structured Outputs, Batch, dan tool bawaan Responses |
Angka 2.4T adalah ukuran total model, bukan jumlah parameter yang dijalankan untuk menghasilkan setiap Token. Rilis resmi menyebut 95B parameter aktif, ukuran yang lebih berguna untuk memahami komputasi yang benar-benar terlibat dalam inferensi MoE. Konteks 1M tokens juga tidak berarti setiap request harus mengisinya sampai penuh. Ketika input dan anggaran penalaran bertambah, latensi, cache, dan biaya perlu dirancang secara khusus.
Fokus Qwen3.8-Max
Qwen memosisikan rilis ini sebagai peningkatan luas untuk coding dan Cowork, dengan tiga jenis pekerjaan utama:
- Menyelesaikan proyek software selama beberapa hari mulai dari direktori kosong, bukan hanya membuat fungsi terpisah.
- Menyusun hasil kerja bertahap untuk riset, analisis data, Office, desain, dan workflow profesional lain.
- Menggunakan pemahaman gambar dan video selama perencanaan, eksekusi, dan verifikasi, bukan hanya sekali untuk pengenalan statis.
Qwen menampilkan demonstrasi dari penyedia yang mencakup lebih dari sepuluh hari coding otonom dan ratusan iterasi optimasi desain chip. Contoh tingkat sistem ini dipengaruhi oleh Harness, tool, lingkungan, prompt, dan metode penilaian. Contoh tersebut tidak menjamin hasil yang sama pada aplikasi Anda. Pemilihan untuk produksi harus memakai repositori, dokumen, izin tool, dan kriteria penerimaan milik Anda sendiri dalam kumpulan sampel tetap.
Memilih intensitas penalaran
Qwen3.8-Max mendukung reasoning_effort:
lowuntuk jawaban singkat, penjelasan kode ringan, dan tugas yang sensitif terhadap biaya.mediumsebagai titik awal pengembangan harian, analisis, dan tugas bertahap.xhighuntuk penalaran sulit, Agent jangka panjang, dan pekerjaan profesional kompleks; ini juga nilai default.
Qwen menyatakan preserve_thinking aktif secara default agar pekerjaan multi-turn dapat melanjutkan status penalaran sebelumnya. Jika client merekonstruksi riwayat pesan sendiri, pertahankan field penalaran dan status tool yang dikembalikan penyedia, bukan hanya menggabungkan teks akhir. Model mengizinkan hingga 262K tokens penalaran, tetapi batas maksimum yang tersedia bukan default yang disarankan. Pilih effort berdasarkan keberhasilan tugas dan biaya per unit.
Ketersediaan saat ini di Modelflare
Per 4 Agustus 2026, Modelflare mencantumkan qwen3.8-max untuk:
- OpenAI Chat Completions;
- OpenAI Responses;
- rute yang kompatibel dengan Anthropic Messages.
Label protokol membuktikan bahwa rute tersedia, bukan bahwa setiap fitur privat QwenCloud otomatis diteruskan. QwenCloud mencantumkan web_search, code_interpreter, web_extractor, t2i_search, dan i2i_search sebagai tool bawaan Responses. Sampai setiap fitur diuji melalui rute target Modelflare yang tepat, utamakan Function Calling yang ditentukan client dan perlakukan tool bawaan sebagai fitur yang belum diverifikasi.
Snapshot harga publik untuk grup qwen-award saat ini tercantum di bawah, dalam dolar AS per 1 juta tokens:
| Item penagihan | Harga |
|---|---|
| Input | $1.239 |
| Output | $3.71 |
| Pembacaan cache | $0.161 |
| Pembuatan cache eksplisit | $1.547 |
| Pembuatan cache eksplisit satu jam | $2.4752 |
Grup ini hanya tersedia untuk API Keys yang memenuhi syarat. Harga, kelayakan, dan cakupan protokol dapat berubah; gunakan Model dan Harga serta log penggunaan per request sebagai sumber terkini.
Konfigurasi Chat Completions yang disarankan
Simpan Modelflare API Key dalam environment variable:
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
Mulai dengan request teks untuk memvalidasi rute dasar:
curl -N -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Design a safe rollout plan for this service and include validation and rollback gates."
}
],
"reasoning_effort": "medium",
"stream": true
}'
Gunakan medium untuk membangun baseline kualitas, latensi, dan biaya, lalu naikkan hanya tugas yang benar-benar memerlukan penalaran lebih dalam ke xhigh. Default upstream xhigh bukan alasan untuk memberikan anggaran penalaran maksimum pada setiap request batch.
Menerapkan input multimodal
Model resmi menerima teks, gambar, dan video, tetapi format konten multimodal berbeda menurut protokol dan implementasi upstream. Terapkan dalam tiga tahap:
- Validasi autentikasi, akses model, streaming, dan penagihan hanya dengan teks.
- Gunakan satu gambar uji tetap untuk memvalidasi format konten, batas ukuran, dan output.
- Tambahkan video panjang, tool, atau feedback visual multi-turn setelah itu, sambil memeriksa apakah retry menggandakan pekerjaan yang dapat ditagih.
Jangan menganggap URL gambar, payload Base64, upload file, dan object storage penyedia sebagai protokol yang dapat saling menggantikan. Uji end-to-end blok konten yang benar-benar akan dikirim client.
Konfigurasi platform yang disarankan
- Gunakan API Key terpisah untuk setiap aplikasi dan pastikan grup utamanya benar-benar mencantumkan
qwen3.8-max. - Mulai pengembangan dan analisis harian dengan
medium, turunkan tugas singkat kelow, dan gunakanxhighhanya untuk pekerjaan sulit jangka panjang. - Rancang chunking dan cache untuk tugas berkonteks panjang, bukan memasukkan seluruh knowledge base ke setiap konteks 1M tokens.
- Validasi wire contract Chat Completions, Responses, dan Anthropic secara terpisah.
- Jangan jadikan tool bawaan penyedia sebagai dependensi produksi sebelum lolos request nyata melalui rute target Modelflare.
- Bandingkan tingkat keberhasilan, output pertama, total latensi, Token penalaran, cache hit, dan biaya per request pada kumpulan tugas tetap.
- Jalankan ulang sampel regresi saat pindah dari preview ke model produksi; jangan berasumsi bahwa nama keluarga yang sama menjamin output identik.
Workload yang sesuai dan yang perlu dibandingkan
Qwen3.8-Max cocok untuk software engineering kompleks, workflow profesional bertahap, pemahaman dokumen panjang dan video, Agent dengan feedback multimodal, serta tim yang ingin menyatukan penalaran dan orkestrasi dalam satu model flagship. Model ini mungkin bukan default paling ekonomis untuk transformasi teks sederhana dengan throughput tinggi dan latensi rendah. Bandingkan dengan Qwen Flash, DeepSeek V4 Flash, atau model lebih kecil pada input yang sama.
Sumber dan tanggal verifikasi
- Rilis resmi Qwen3.8-Max: tanggal rilis, 95B parameter aktif, demonstrasi Coding/Cowork, dan rencana open weights.
- Halaman model Qwen3.8-Max di QwenCloud: konteks, batas input dan output, modalitas, fitur resmi, dan harga.
- Model dan Harga Modelflare: grup, protokol, dan harga platform saat ini.
Artikel ini diverifikasi pada 4 Agustus 2026. Status open weights, snapshot model, harga, dan dukungan protokol dapat berubah; untuk produksi, gunakan halaman model resmi, lisensi repositori weights, dan katalog live Modelflare yang berlaku saat pemanggilan.