Ulasan DeepSeek V4 Pro GA: benchmark, harga API, dan analisis biaya

Ulasan terverifikasi DeepSeek V4 Pro GA yang membahas benchmark agent, konteks 1M, kompatibilitas API, harga saat ini dan berbasis waktu, contoh biaya, serta ketersediaan di Modelflare.

DeepSeek merilis DeepSeek-V4-Pro GA pada 13 Agustus 2026. API yang dihosting kini mengidentifikasi versinya sebagai DeepSeek-V4-Pro-0813, sedangkan ID model API stabil tetap deepseek-v4-pro. Model ini menawarkan jendela konteks satu juta token, hingga 384.000 token keluaran, dukungan native untuk Responses API, dan jadwal harga baru yang dimulai tidak lama setelah peluncuran.

Kesimpulan kami: V4 Pro layak dievaluasi untuk produksi pada coding yang sulit, pekerjaan berskala repositori, dan agent berdurasi panjang. DeepSeek melaporkan peningkatan konsisten dibandingkan V4 Flash pada benchmark agent yang sulit, tetapi Pro bukan pilihan ekonomis bawaan untuk setiap permintaan. Setelah jadwal baru dimulai, harga resmi input dan outputnya sekitar tiga kali Flash, sedangkan batas konkurensi akun hanya seperlimanya.

Ulasan ini memisahkan fakta API saat ini, hasil benchmark yang diterbitkan DeepSeek, analisis kami, dan ketersediaan saat ini di Modelflare. Kami tidak mereproduksi skor benchmark DeepSeek secara independen. Spesifikasi dan harga yang dapat berubah diverifikasi pada 14 Agustus 2026.

Ulasan DeepSeek V4 Pro: konteks satu juta token dan orkestrasi tool agent

Ringkasan DeepSeek V4 Pro GA

Item Informasi resmi saat ini
Tanggal GA 13 Agustus 2026
ID model API stabil deepseek-v4-pro
Versi model yang dihosting DeepSeek-V4-Pro-0813
Jendela konteks 1.000.000 token
Output maksimum 384.000 token
Mode thinking Didukung dan aktif secara default
Reasoning effort Pengumuman GA: low, high, max; lihat catatan kompatibilitas di bawah
Format API resmi Chat Completions, Responses API, API kompatibel Anthropic Messages
Fitur terdokumentasi Output JSON, tool call, cache konteks otomatis, prefix completion, FIM pada mode non-thinking
Konkurensi akun resmi 500 permintaan bersamaan

Batas satu juta token adalah plafon kapasitas, bukan jaminan kualitas. Akurasi retrieval, latensi, penggunaan ulang cache, panjang output, timeout klien, dan jumlah konteks yang tidak relevan tetap menentukan apakah permintaan panjang akan berguna.

Perubahan dari preview V4

Preview pada April memperkenalkan keluarga V4 dan arsitektur open-weight. Pembaruan GA pada Agustus adalah pembaruan produk yang dihosting dengan tiga perubahan praktis:

  • DeepSeek menyatakan performa agent meningkat secara berarti, khususnya pada tugas coding dan otomatisasi bergaya produksi;
  • API resmi kini mendukung format OpenAI Responses secara native dan menyertakan kompatibilitas yang diarahkan untuk Codex;
  • DeepSeek mengumumkan harga API peak dan off-peak yang berlaku pada 16:00 UTC, 16 Agustus 2026.

Model stabil dalam permintaan tetap deepseek-v4-pro, jadi klien yang sudah ada tidak perlu memigrasikan nama model. Halaman harga menampilkan versi hosted saat ini sebagai DeepSeek-V4-Pro-0813.

Jangan otomatis menganggap checkpoint preview yang dapat diunduh identik bit demi bit dengan versi GA yang dihosting. Model card V4 publik DeepSeek masih mendeskripsikan keluarga preview dan tidak memberi label 0813 pada checkpoint. Karena itu, deployment self-hosted dan API resmi memerlukan evaluasi terpisah.

Analisis benchmark: area keunggulan Pro atas Flash

DeepSeek menerbitkan hasil V4 Pro GA berikut. Kolom perbandingan menggunakan nilai pembaruan V4 Flash DeepSeek pada 31 Juli, dan delta adalah selisih skor absolut.

Benchmark V4 Pro GA V4 Flash 0731 Delta Pro
Terminal Bench 2.1 87.9 82.7 +5.2
NL2Repo 61.5 54.2 +7.3
Cybergym 83.3 76.7 +6.6
DeepSWE 62.7 54.4 +8.3
Toolathlon-Verified 74.1 70.3 +3.8
Agents' Last Exam 25.7 25.2 +0.5
AutomationBench (Public) 31.8 25.1 +6.7
DSBench-FullStack 71.1 68.7 +2.4
DSBench-Hard 67.2 59.6 +7.6

DeepSeek juga melaporkan skor HLE 42.7 tanpa tool dan 60.0 dengan tool untuk V4 Pro GA.

Polanya lebih penting daripada satu skor utama. Peningkatan absolut terbesar tampak pada pekerjaan repositori, tugas rekayasa perangkat lunak yang sulit, dan otomatisasi. Kesenjangannya jauh lebih kecil pada Agents' Last Exam dan sedang pada penggunaan tool secara luas. Hal ini mendukung strategi routing: gunakan Pro untuk tugas ketika peluang penyelesaian yang lebih tinggi lebih berharga daripada efisiensi token mentah, dan pertahankan Flash untuk klasifikasi, ringkasan, triase, serta sub-agent sederhana berjumlah besar.

Angka tersebut merupakan hasil yang dilaporkan penyedia, bukan benchmark independen Modelflare. Harness, izin tool, reasoning effort, pengaturan sampling, batas waktu, dan aturan penilaian dapat mengubah hasil agent secara material. Keputusan produksi sebaiknya memutar ulang tugas yang sama dan aman bagi privasi pada kedua model, lalu mengukur biaya per tugas berhasil, bukan sekadar token atau peringkat benchmark.

Arsitektur dan klaim konteks 1M

Model card V4 publik DeepSeek mendeskripsikan keluarga Pro sebagai model Mixture-of-Experts dengan total 1,6 triliun parameter dan 49 miliar parameter aktif. Dokumen itu memaparkan desain attention hibrida yang menggabungkan Compressed Sparse Attention dan Heavily Compressed Attention, Manifold-Constrained Hyper-Connections, optimizer Muon, serta pretraining pada lebih dari 32 triliun token.

DeepSeek menyatakan bahwa pada konteks 1M token, V4 Pro memakai 27% FLOPs inferensi satu token dan 10% cache KV yang dibutuhkan V3.2. Itu adalah klaim tingkat arsitektur dari penerbit model; bukan berarti permintaan satu juta token akan cepat, murah, atau sama akuratnya di setiap posisi.

Untuk pekerjaan konteks panjang yang nyata:

  • letakkan instruksi stabil dan materi repositori yang dapat digunakan ulang di awal agar prefix cache dapat membantu;
  • lacak prompt_cache_hit_tokens dan prompt_cache_miss_tokens, jangan menganggap hit pasti terjadi;
  • padatkan jejak tool lama dan file duplikat sebelum menghabiskan anggaran konteks;
  • uji retrieval pada kedalaman dokumen dan posisi token yang benar-benar digunakan aplikasi;
  • sisakan ruang untuk reasoning, hasil tool, dan jawaban akhir alih-alih memenuhi seluruh jendela dengan input.

Cache disk DeepSeek berjalan otomatis dan bersifat best effort. Cache mencocokkan prefix yang dapat digunakan ulang, dapat membutuhkan beberapa detik untuk dibuat, dan biasanya dihapus setelah tidak aktif selama beberapa jam hingga hari. Permintaan berulang yang mengubah konten bagian awal dapat kehilangan sebagian besar manfaat ekonominya.

Kompatibilitas API: native bukan berarti identik

Antarmuka Dukungan resmi DeepSeek Batas penting
Chat Completions Didukung Loop tool dengan thinking harus mempertahankan reasoning_content
Responses API Didukung Stateless; beberapa field OpenAI diabaikan atau tidak didukung
API kompatibel Anthropic Didukung Beberapa field diabaikan; konten gambar dan dokumen tidak didukung
FIM completion Beta Hanya mode non-thinking dan menggunakan endpoint beta

Lapisan Responses resmi mendukung teks, function call, pencarian web sisi server, dan tool kustom apply_patch untuk kompatibilitas Codex. Lapisan ini tidak mendukung previous_response_id, conversation, response tersimpan, mode background, service_tier, atau prompt cache key yang dikelola OpenAI. Field yang tidak didukung sering diabaikan tanpa peringatan, jadi HTTP 200 tidak membuktikan kesetaraan semantik. Klien Responses perlu membawa riwayatnya sendiri dan memeriksa jenis event, bukan menunggu penanda [DONE] seperti Chat Completions.

Ada batas penting lain pada loop tool Chat Completions: ketika mode thinking dan tool digunakan bersama, reasoning_content dari assistant harus dikirim kembali pada permintaan berikutnya. DeepSeek mendokumentasikan error 400 jika field ini hilang. Gateway dan adapter SDK perlu diuji dengan loop tool multi-turn yang lengkap, bukan satu prompt teks.

Pengumuman GA menyebut reasoning effort low, high, dan max tersedia. Namun, panduan thinking terperinci dan referensi API saat ini menyatakan bahwa high dan max adalah nilai efektif, low dan medium dipetakan ke high, sedangkan xhigh dipetakan ke max. Sampai DeepSeek menyelaraskan dokumen tersebut atau pengujian langsung membuktikan perilaku low yang berbeda, jangan membuat anggaran berdasarkan asumsi pengurangan biaya pada effort rendah.

Harga API resmi DeepSeek: saat ini dan mendatang

Semua harga di bawah dalam USD per satu juta token. Harga tetap saat ini masih ditampilkan sampai jadwal baru berlaku pada 16:00 UTC, 16 Agustus 2026, yaitu 00:00 tanggal 17 Agustus waktu Beijing.

Periode harga Input cache hit Input cache miss Output
Harga saat ini, diverifikasi 14 Agustus $0.003625 $0.435 $0.87
Harga off-peak baru $0.022 $0.66 $1.98
Harga peak baru $0.044 $1.32 $3.96

Dalam jadwal mendatang, waktu peak adalah 01:00–04:00 dan 06:00–10:00 UTC. Semua jam lainnya adalah off-peak, dengan harga setengah tarif peak.

Transisi ini bukan sekadar pembagian 2× berdasarkan waktu dari harga hari ini. Dibanding tarif tetap saat ini, harga off-peak baru sekitar 6,07× lebih tinggi untuk input cache, 1,52× untuk input tanpa cache, dan 2,28× untuk output. Harga peak menggandakan nilai off-peak baru tersebut. Penggunaan ulang cache tetap bernilai, tetapi harga input cache era peluncuran yang sangat rendah mengalami perubahan terbesar.

Contoh perhitungan biaya

Rumus biaya khusus token adalah:

biaya = token_cache_hit × tarif_cache_hit + token_cache_miss × tarif_cache_miss + token_output × tarif_output

Contoh berikut tidak mencakup biaya terpisah untuk jaringan, langganan, layanan tool, atau pembayaran. Agent yang menggunakan tool dapat menghasilkan beberapa panggilan model, jadi hitung seluruh tugas dan bukan hanya permintaan pertama.

Beban kerja DeepSeek saat ini Off-peak baru Peak baru Modelflare per 14 Agustus
Input 100K tanpa cache + output 10K $0.0522 $0.0858 $0.1716 $0.0540
Input 90K cache + 10K tanpa cache + output 10K $0.0134 $0.0284 $0.0568 $0.0138
Input 900K cache + 100K tanpa cache + output 20K $0.0642 $0.1254 $0.2508 $0.0663

Baris kedua dan ketiga menunjukkan mengapa struktur prompt penting. Prefix stabil yang besar dapat memangkas biaya secara drastis, tetapi hanya setelah cache hit benar-benar terjadi. Field usage API adalah sumber kebenaran untuk rekonsiliasi.

DeepSeek V4 Pro vs V4 Flash: pilihan harga-kinerja

Pada tarif resmi saat ini, Pro berharga sekitar 3,11× Flash untuk input tanpa cache dan output, tetapi hanya 1,29× untuk input cache. Setelah jadwal baru dimulai, Pro berharga 3× Flash untuk input tanpa cache dan output, serta sekitar 3,14× untuk input cache. Konkurensi akun resmi adalah 500 untuk Pro dan 2.500 untuk Flash.

Hal ini menghasilkan aturan operasional yang jelas:

  • pilih V4 Pro untuk perubahan repositori yang sulit, agent berjangka panjang, analisis keamanan, koordinasi tool yang kompleks, dan tugas dengan biaya kegagalan tinggi;
  • pilih V4 Flash untuk agent yang lebih sederhana, worker paralel, preprocessing, ekstraksi, ringkasan, dan trafik yang sensitif terhadap throughput;
  • lakukan routing menurut tingkat kesulitan yang teramati dan biaya per tugas berhasil, bukan menjadikan Pro sebagai default universal;
  • evaluasi ulang setelah transisi harga karena ekonomi beban Pro yang memakai cache berubah secara material.

Harga token 3× tetap dapat lebih murah jika Pro menghindari percobaan ulang atau perbaikan manusia. Sebaliknya, keunggulan lima poin benchmark tidak membenarkan pengiriman pekerjaan deterministik atau sepele ke model yang lebih besar. Ukur tingkat penyelesaian, waktu total, seluruh token lintas percobaan ulang, kegagalan tool, dan waktu koreksi reviewer.

Harga dan ketersediaan DeepSeek V4 Pro di Modelflare

Katalog harga live Modelflare diverifikasi pada 14 Agustus 2026. Katalog mencantumkan deepseek-v4-pro dan alias tersemat deepseek-v4-pro-0813 dalam grup deepseek-stable dengan harga dasar berikut per satu juta token:

Snapshot harga Modelflare Harga
Input cache hit $0.0037
Input cache miss $0.45
Output $0.90

Tarif snapshot tersebut sekitar 2,07% di atas harga input cache DeepSeek saat ini dan 3,45% di atas harga input tanpa cache serta output saat ini. Artikel ini tidak menjanjikan bahwa harga Modelflare akan tetap sama setelah transisi peak/off-peak DeepSeek. Selalu gunakan halaman harga live dan catatan usage permintaan untuk keputusan produksi.

Metadata katalog publik saat ini menandai rute Modelflare sebagai Chat Completions yang kompatibel dengan OpenAI. Walaupun endpoint DeepSeek sendiri kini mendukung format Responses dan Anthropic, dukungan penyedia tidak otomatis membuat setiap rute gateway kompatibel. Gunakan protokol persis yang ditampilkan di halaman harga live.

export MODELFLARE_API_KEY="your-api-key"

curl https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer ${MODELFLARE_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Review this migration plan and identify rollback risks."}
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high"
  }'

Untuk konfigurasi klien umum, lihat panduan API kompatibel OpenAI. Untuk akuntansi dan interpretasi token cache, lihat pelacakan biaya API AI.

Checklist evaluasi produksi

  1. Sematkan deepseek-v4-pro-0813 selama evaluasi jika tersedia pada rute, lalu tentukan apakah alias stabil dapat diterima untuk kontrol perubahan.
  2. Putar ulang kumpulan tugas tetap yang aman bagi privasi pada Pro dan Flash dengan tool, izin, timeout, dan aturan berhenti yang sama.
  3. Uji high dan max; perlakukan low setara dengan high sampai perilaku API saat ini membuktikan sebaliknya.
  4. Selesaikan loop tool multi-turn dan verifikasi bahwa reasoning_content, ID tool, argumen, dan hasil bertahan melewati setiap adapter.
  5. Untuk klien Responses, uji eksplisit setiap field yang diperlukan karena parameter yang tidak didukung dapat diabaikan tanpa peringatan.
  6. Catat input cache, input tanpa cache, output, token reasoning, latensi, percobaan ulang, dan biaya per tugas berhasil.
  7. Uji prompt panjang pada kedalaman realistis; jangan menyimpulkan kualitas retrieval satu juta token dari permintaan pendek.
  8. Lakukan load test di bawah batas konkurensi akun dan tangani response 429 dengan backoff terbatas.
  9. Modelkan harga saat ini dan jadwal peak/off-peak 16/17 Agustus sebelum menyetujui anggaran.
  10. Pertahankan Flash atau model alternatif sebagai fallback untuk ketersediaan dan pengendalian biaya; lihat routing API AI yang andal.

Kesimpulan akhir

DeepSeek V4 Pro GA adalah rilis penting yang berfokus pada agent, bukan sekadar preview dengan nama baru. Pola skor resmi paling kuat pada reasoning repositori, coding sulit, dan otomatisasi, sedangkan antarmuka Responses baru membuatnya lebih praktis bagi agent coding modern. Konteks 1M dan cache otomatis berguna, tetapi hanya saat aplikasi mempertahankan prefix stabil dan memverifikasi cache hit yang sebenarnya.

Catatan utamanya adalah ekonomi: harga Pro setelah peluncuran sekitar tiga kali Flash untuk sebagian besar kategori token, dengan konkurensi lebih rendah. Pro sebaiknya menjadi tingkat eskalasi bagi pekerjaan sulit bernilai tinggi, bukan default setiap prompt. Arsitektur produksi terbaik biasanya mengarahkan pekerjaan sederhana ke Flash dan hanya mempromosikan tugas sulit atau gagal ke Pro.

Snapshot harga Modelflare pada 14 Agustus dekat dengan harga tetap DeepSeek saat ini dan sekarang menyediakan Chat Completions untuk V4 Pro. Periksa kembali halaman live setelah jadwal baru DeepSeek dimulai; artikel lama maupun screenshot harga yang tersimpan dalam cache bukan sumber kebenaran billing.

Sumber dan tanggal verifikasi

Spesifikasi resmi, jadwal harga, ketersediaan Modelflare, dan harga live diverifikasi pada 14 Agustus 2026.