Qwen3.8-Max: spesifikasi MoE 2.4T dan konfigurasi Modelflare

Panduan praktis Qwen3.8-Max: MoE 2.4T/95B, konteks multimodal 1M tokens, kontrol penalaran, harga Modelflare saat ini, dan konfigurasi rollout.

Tim Qwen resmi merilis Qwen3.8-Max pada 3 Agustus 2026. Model ini bukan Qwen3-8B lama yang mudah tertukar, dan tidak lagi hanya berupa qwen3.8-max-preview dari Juli: ID model API resmi saat ini adalah qwen3.8-max, sama dengan ID yang digunakan Modelflare.

Qwen3.8-Max adalah model flagship Max terbesar Qwen saat ini, ditujukan untuk coding, workflow profesional, Agent jangka panjang, dan tugas multimodal native. Qwen juga mengumumkan bahwa open weights Qwen3.8-Max dan Qwen3.8-27B akan hadir pada minggu berikutnya. Sampai repositori dan lisensinya benar-benar diterbitkan, deskripsi yang tepat adalah “open weights telah diumumkan”, bukan “sudah tersedia untuk deployment lokal”.

Spesifikasi utama

Item Qwen3.8-Max
ID model Modelflare qwen3.8-max
Arsitektur Mixture-of-Experts (MoE)
Total parameter 2.4T
Parameter aktif per Token 95B
Panjang konteks 1M tokens
Input maksimum tanpa penalaran 991K tokens
Input maksimum dengan penalaran 983K tokens
Output maksimum 131K tokens
Token penalaran maksimum 262K tokens
Modalitas input Teks, gambar, dan video
Modalitas output Teks
Intensitas penalaran low, medium, atau xhigh; default xhigh
Fitur resmi Prefix Completion, Function Calling, Context Cache, Structured Outputs, Batch, dan tool bawaan Responses

Angka 2.4T adalah ukuran total model, bukan jumlah parameter yang dijalankan untuk menghasilkan setiap Token. Rilis resmi menyebut 95B parameter aktif, ukuran yang lebih berguna untuk memahami komputasi yang benar-benar terlibat dalam inferensi MoE. Konteks 1M tokens juga tidak berarti setiap request harus mengisinya sampai penuh. Ketika input dan anggaran penalaran bertambah, latensi, cache, dan biaya perlu dirancang secara khusus.

Fokus Qwen3.8-Max

Qwen memosisikan rilis ini sebagai peningkatan luas untuk coding dan Cowork, dengan tiga jenis pekerjaan utama:

  • Menyelesaikan proyek software selama beberapa hari mulai dari direktori kosong, bukan hanya membuat fungsi terpisah.
  • Menyusun hasil kerja bertahap untuk riset, analisis data, Office, desain, dan workflow profesional lain.
  • Menggunakan pemahaman gambar dan video selama perencanaan, eksekusi, dan verifikasi, bukan hanya sekali untuk pengenalan statis.

Qwen menampilkan demonstrasi dari penyedia yang mencakup lebih dari sepuluh hari coding otonom dan ratusan iterasi optimasi desain chip. Contoh tingkat sistem ini dipengaruhi oleh Harness, tool, lingkungan, prompt, dan metode penilaian. Contoh tersebut tidak menjamin hasil yang sama pada aplikasi Anda. Pemilihan untuk produksi harus memakai repositori, dokumen, izin tool, dan kriteria penerimaan milik Anda sendiri dalam kumpulan sampel tetap.

Memilih intensitas penalaran

Qwen3.8-Max mendukung reasoning_effort:

  • low untuk jawaban singkat, penjelasan kode ringan, dan tugas yang sensitif terhadap biaya.
  • medium sebagai titik awal pengembangan harian, analisis, dan tugas bertahap.
  • xhigh untuk penalaran sulit, Agent jangka panjang, dan pekerjaan profesional kompleks; ini juga nilai default.

Qwen menyatakan preserve_thinking aktif secara default agar pekerjaan multi-turn dapat melanjutkan status penalaran sebelumnya. Jika client merekonstruksi riwayat pesan sendiri, pertahankan field penalaran dan status tool yang dikembalikan penyedia, bukan hanya menggabungkan teks akhir. Model mengizinkan hingga 262K tokens penalaran, tetapi batas maksimum yang tersedia bukan default yang disarankan. Pilih effort berdasarkan keberhasilan tugas dan biaya per unit.

Ketersediaan saat ini di Modelflare

Per 4 Agustus 2026, Modelflare mencantumkan qwen3.8-max untuk:

  • OpenAI Chat Completions;
  • OpenAI Responses;
  • rute yang kompatibel dengan Anthropic Messages.

Label protokol membuktikan bahwa rute tersedia, bukan bahwa setiap fitur privat QwenCloud otomatis diteruskan. QwenCloud mencantumkan web_search, code_interpreter, web_extractor, t2i_search, dan i2i_search sebagai tool bawaan Responses. Sampai setiap fitur diuji melalui rute target Modelflare yang tepat, utamakan Function Calling yang ditentukan client dan perlakukan tool bawaan sebagai fitur yang belum diverifikasi.

Snapshot harga publik untuk grup qwen-award saat ini tercantum di bawah, dalam dolar AS per 1 juta tokens:

Item penagihan Harga
Input $1.239
Output $3.71
Pembacaan cache $0.161
Pembuatan cache eksplisit $1.547
Pembuatan cache eksplisit satu jam $2.4752

Grup ini hanya tersedia untuk API Keys yang memenuhi syarat. Harga, kelayakan, dan cakupan protokol dapat berubah; gunakan Model dan Harga serta log penggunaan per request sebagai sumber terkini.

Konfigurasi Chat Completions yang disarankan

Simpan Modelflare API Key dalam environment variable:

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

Mulai dengan request teks untuk memvalidasi rute dasar:

curl -N -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Design a safe rollout plan for this service and include validation and rollback gates."
      }
    ],
    "reasoning_effort": "medium",
    "stream": true
  }'

Gunakan medium untuk membangun baseline kualitas, latensi, dan biaya, lalu naikkan hanya tugas yang benar-benar memerlukan penalaran lebih dalam ke xhigh. Default upstream xhigh bukan alasan untuk memberikan anggaran penalaran maksimum pada setiap request batch.

Menerapkan input multimodal

Model resmi menerima teks, gambar, dan video, tetapi format konten multimodal berbeda menurut protokol dan implementasi upstream. Terapkan dalam tiga tahap:

  1. Validasi autentikasi, akses model, streaming, dan penagihan hanya dengan teks.
  2. Gunakan satu gambar uji tetap untuk memvalidasi format konten, batas ukuran, dan output.
  3. Tambahkan video panjang, tool, atau feedback visual multi-turn setelah itu, sambil memeriksa apakah retry menggandakan pekerjaan yang dapat ditagih.

Jangan menganggap URL gambar, payload Base64, upload file, dan object storage penyedia sebagai protokol yang dapat saling menggantikan. Uji end-to-end blok konten yang benar-benar akan dikirim client.

Konfigurasi platform yang disarankan

  1. Gunakan API Key terpisah untuk setiap aplikasi dan pastikan grup utamanya benar-benar mencantumkan qwen3.8-max.
  2. Mulai pengembangan dan analisis harian dengan medium, turunkan tugas singkat ke low, dan gunakan xhigh hanya untuk pekerjaan sulit jangka panjang.
  3. Rancang chunking dan cache untuk tugas berkonteks panjang, bukan memasukkan seluruh knowledge base ke setiap konteks 1M tokens.
  4. Validasi wire contract Chat Completions, Responses, dan Anthropic secara terpisah.
  5. Jangan jadikan tool bawaan penyedia sebagai dependensi produksi sebelum lolos request nyata melalui rute target Modelflare.
  6. Bandingkan tingkat keberhasilan, output pertama, total latensi, Token penalaran, cache hit, dan biaya per request pada kumpulan tugas tetap.
  7. Jalankan ulang sampel regresi saat pindah dari preview ke model produksi; jangan berasumsi bahwa nama keluarga yang sama menjamin output identik.

Workload yang sesuai dan yang perlu dibandingkan

Qwen3.8-Max cocok untuk software engineering kompleks, workflow profesional bertahap, pemahaman dokumen panjang dan video, Agent dengan feedback multimodal, serta tim yang ingin menyatukan penalaran dan orkestrasi dalam satu model flagship. Model ini mungkin bukan default paling ekonomis untuk transformasi teks sederhana dengan throughput tinggi dan latensi rendah. Bandingkan dengan Qwen Flash, DeepSeek V4 Flash, atau model lebih kecil pada input yang sama.

Sumber dan tanggal verifikasi

Artikel ini diverifikasi pada 4 Agustus 2026. Status open weights, snapshot model, harga, dan dukungan protokol dapat berubah; untuk produksi, gunakan halaman model resmi, lisensi repositori weights, dan katalog live Modelflare yang berlaku saat pemanggilan.