Analisis mendalam DeepSeek V4.1 Flash: arsitektur, harga Modelflare, serta perbandingan dengan OpenAI dan Anthropic

Analisis berbasis sumber tentang DeepSeek V4.1 Flash yang mencakup arsitektur, konteks 1M, keluaran 384K, benchmark Agent, batas API, perbandingan dengan OpenAI dan Anthropic, serta ketersediaan dan harga terkini di Modelflare.

Analisis mendalam DeepSeek V4.1 Flash: arsitektur, harga Modelflare, serta perbandingan dengan OpenAI dan Anthropic

DeepSeek V4.1 Flash adalah model multimodal berbobot terbuka dan berbiaya rendah yang dibangun untuk loop Agent yang panjang. Dirilis pada September 10, 2026, ia menggabungkan jendela konteks satu juta token, hingga 384K token keluaran, API resmi yang luar biasa murah, dan arsitektur yang mengurangi pemrosesan prompt serta tekanan cache KV. Keunggulan paling jelasnya bukan bahwa ia menang di setiap benchmark. Keunggulannya adalah jumlah pekerjaan Agent berkonteks panjang yang bisa ia coba per dolar sambil tetap kompetitif pada evaluasi pemrograman, terminal, otomasi, dan pemakaian alat.

Kesimpulan itu membutuhkan batas. Angka benchmark di bawah diterbitkan oleh DeepSeek, bukan direproduksi secara independen oleh Modelflare. Laporan DeepSeek sendiri mengatakan model ini masih tertinggal dari sistem tertutup terbesar pada penalaran tersulit dan kasus tepi. ID model API pihak pertama yang benar adalah deepseek-flash. DeepSeek V4.1 Flash sekarang sudah tayang di Modelflare di bawah ID model berversi deepseek-v4.1-flash-0910, dengan Chat Completions dan Responses di grup publik deepseek-stable.

Terakhir diverifikasi: 2026-09-10 UTC. Harga, alias, dan status katalog bisa berubah.

Jawaban langsung: apa itu DeepSeek V4.1 Flash

Pemberitahuan rilis DeepSeek mendefinisikan DeepSeek V4.1 Flash sebagai pengganti produksi untuk lini Flash sebelumnya. Titik akhir resmi menerima deepseek-flash. Nama lama deepseek-v4-flash dan deepseek-v4-flash-vision-exp untuk sementara diterima oleh DeepSeek dan diarahkan ke V4.1 Flash dengan tarif Flash. Mulai September 14, 2026 at 04:00 UTC, DeepSeek mengatakan permintaan untuk deepseek-v4-pro juga akan diarahkan ke V4.1 Flash sampai rilis V4.1 Pro yang kemudian.

Kebijakan migrasi ini milik API DeepSeek sendiri. Modelflare memakai ID bertanda rilis yang eksplisit deepseek-v4.1-flash-0910, alih-alih diam-diam memberi label baru pada entri deepseek-v4-flash sebelumnya. Operator Modelflare mengonfirmasi peluncuran, dan model muncul di katalog harga publik maupun origin pada 2026-09-10 15:21 UTC. Klien sebaiknya memakai ID persis yang ditunjukkan penyedia mereka, alih-alih menganggap alias pihak pertama bekerja tanpa perubahan melalui setiap gateway.

Identitas praktis model ini punya lima bagian: masukan gambar-dan-teks multimodal; keluaran teks; tulang punggung MoE berparameter 552B; memori Engram tambahan berparameter 196B; dan aktivasi asimetris 8B parameter per token prompt versus 16B per token yang didekode. Poin terakhir adalah pusatnya: beban Agent yang berat di masukan seharusnya menghabiskan lebih sedikit komputasi selama prefill berulang daripada desain decoder-only simetris pada skala yang serupa.

Spesifikasi dalam sekali lihat

Nilai berikut berasal dari rilis resmi, kartu model dan laporan teknis. “Parameter tulang punggung” dan “parameter Engram” menggambarkan penyimpanan yang berbeda; tidak satu pun angka itu sama dengan komputasi aktif per token.

Item DeepSeek V4.1 Flash
ID API resmi deepseek-flash
ID model Modelflare deepseek-v4.1-flash-0910
Kelas model Transformer Mixture-of-Experts multimodal
Masukan / keluaran Teks dan gambar masuk; teks keluar
Tata letak Transformer 40 lapisan: encoder kausal 20 lapisan + decoder 20 lapisan
Penyimpanan parameter Tulang punggung 552B + memori kondisional Engram 196B
Parameter aktif 8B per token prefill; 16B per token decode
Konteks / keluaran maksimum 1M / 384K token
Prapelatihan 45T token korpus multimodal; rasio token hanya-teks-ke-multimodal 7:1
Desain perhatian/cache utama CED + CSA2 + KV global FP4; KV SWA lokal FP8
Jejak KV global 890 byte per token, dilaporkan oleh DeepSeek
Preset penalaran publik low = 50, high = 75, max = 100 pada skala upaya internal
Batas konkurensi API resmi 2,500 permintaan bersamaan
Lisensi Lisensi checkpoint MIT

Langit-langit keluaran 384K adalah tiga kali maksimum 128K yang diterbitkan untuk model perbandingan OpenAI dan Anthropic saat ini dalam artikel ini. Itu batas, bukan anjuran: keluaran yang sangat panjang meningkatkan latensi, biaya, dan permukaan untuk penyimpangan. Untuk Agent yang panjang, pertanyaan yang lebih berguna adalah apakah model bisa mempertahankan persyaratan dan lulus pemeriksaan penerimaan yang nyata setelah pemanggilan alat.

Mengapa arsitektur dibangun untuk loop Agent yang panjang

Agent pemakai alat berulang kali menambahkan pengamatan, hasil perintah, dan suntingan ke riwayatnya. Setiap giliran baru mungkin membutuhkan prefill prompt, perhatian di atas konteks yang tumbuh, penyimpanan KV, dan keluaran baru. DeepSeek V4.1 Flash menyerang setiap biaya secara terpisah, alih-alih mengandalkan satu model yang lebih kecil.

Biaya Agent Mekanisme V4.1 Flash Efek yang dimaksud
Memproses ulang prompt panjang Causal Encoder-Decoder (CED) Hampir membagi dua pekerjaan prefill asimtotik untuk urutan panjang dalam analisis DeepSeek
Menyimpan riwayat global di HBM Pemakaian ulang lintas lapisan CSA2 + FP4 Mengurangi entri KV global yang terduplikasi dan byte per entri
Mempertahankan state perhatian lokal SWA Bounded Replay Merekonstruksi jendela lokal yang berbatas alih-alih menyimpan cache lokal penuh setiap lapisan
Mengingat pola token yang stabil Engram Memindahkan memori n-gram kondisional ke tabel yang diakses secara jarang
Menghasilkan token Dekode spekulatif DSpark Menyusun beberapa posisi kandidat dan memilih panjang verifikasi berdasarkan keyakinan dan beban sistem
Menangani gambar DeepSeek-ViT + projector Mengubah masukan visual menjadi embedding yang diproses bersama teks sejak prapelatihan

Mekanisme ini terutama memperbaiki ekonomi penyajian dan throughput. Mereka sendiri tidak membuktikan penalaran yang lebih baik. Kualitas model juga bergantung pada data, pascapelatihan, harness Agent, dan seberapa banyak upaya inferensi yang dibeli.

CED: potong pemrosesan prompt sebelum menyentuh cache

Laporan teknis membagi 40 lapisan Transformer menjadi encoder kausal 20 lapisan dan decoder 20 lapisan. Dua lapisan pertama hanya memakai jendela geser 128 token. Lapisan sisanya menggabungkan perhatian jendela geser lokal dengan konteks global yang terkompresi.

Untuk perhatian global, decoder tidak membangun riwayat KV penuh yang independen pada setiap lapisan. Kunci dan nilai globalnya diproyeksikan dari hidden state encoder terakhir. State jendela geser lokal tetap khusus per lapisan. DeepSeek memperkirakan kompleksitas prefill urutan panjang kira-kira setengah dari jalur semua-lapisan yang sesuai: suku dominan berubah dari memproses setiap token melalui semua lapisan L menjadi memproses konteks global melalui kira-kira L/2, plus pekerjaan jendela lokal yang berbatas.

Itu menjelaskan pecahan aktivasi 8B/16B. Token prompt mengaktifkan sekitar 8B parameter tulang punggung selama prefill; token yang baru dibangkitkan mengaktifkan sekitar 16B selama decode. Beban dengan dokumen sangat besar dan jawaban pendek lebih diuntungkan daripada beban yang didominasi ratusan ribu token yang dibangkitkan. CED mengurangi paruh pertama tagihan itu; ia tidak membuat decode menjadi gratis.

CSA2, FP4, dan SWA Bounded Replay: cerita memorinya

Compressed Sparse Attention 2 memampatkan cache sepanjang dimensi urutan, lapisan, dan presisi. Setiap lapisan CSA2 secara statis diberi salah satu dari tiga mode. Full menghitung KV utama, kunci indexer, dan posisi Top-K yang segar. Reindex memakai ulang KV utama dan kunci indexer tetapi memindainya kembali dengan kuerinya sendiri. Reuse memakai ulang KV bersama dan pemilihan jarang sebelumnya. Setiap lapisan tetap punya kueri sendiri dan KV jendela geser lokal.

Lapisan Full pertama decoder memilih entri Top-512 dan membangun kolam kandidat; lapisan Reindex kemudian memilih posisi Top-512 mereka dari kolam yang sudah diperkecil itu. KV global utama memakai representasi E2M1 kira-kira empat bit dengan skala E4M3 per 16 kanal. DeepSeek mempertahankan FP8 untuk cache SWA lokal yang lebih peka terhadap kuantisasi.

Lapisan cache Presisi / umur Hasil yang dilaporkan Apa yang tidak dijamin
KV global saat berjalan FP4, menetap di HBM 890 byte/token; sekitar 1/4 dari V4 Flash dan 437× lebih kecil daripada V1 Pemilihan jarang yang sempurna pada setiap kasus tepi
KV SWA lokal saat berjalan FP8 Mempertahankan jendela lokal-lapisan 128 token Memori yang dapat diabaikan pada konkurensi sembarang
KV global persisten Memori host atau SSD dalam desain penyebaran DeepSeek State global yang bisa dipakai ulang dan berumur panjang Periode retensi tetap pada API publik
State SWA lokal persisten Direkonstruksi dengan Bounded Replay Sekitar 1/8 jejak cache persisten total V4 Flash pada panjang urutan yang sama Pemutaran ulang persis setiap state lokal yang dibuang

Laporan mengatakan penyebarannya menyimpan KV persisten global setidaknya 72 jam dan memakai kolam SWA berumur pendek yang terdistribusi. Panduan cache konteks publik menggambarkan pembuatan cache sebagai otomatis dan upaya terbaik, mengatakan pembangunan bisa memakan waktu beberapa detik, dan mengatakan entri umumnya dibersihkan setelah jam atau hari. Klien produksi sebaiknya memperlakukan kontrak publik sebagai yang berwenang: periksa bidang token hit dan miss alih-alih menganggarkan di sekitar hit 72 jam yang dijamin.

DeepSeek sendiri mengidentifikasi dua batas ketahanan: CSA2 bisa memilih posisi jarang yang salah, dan Bounded Replay mendekati state lokal yang dibuang. Pengujiannya tidak menemukan degradasi sistematis pada pengaturan yang dievaluasi, tetapi konteks ekstrem dan batas pemulihan cache tetap menjadi area untuk pengujian tekanan lebih lanjut.

Engram, DSpark, dan jalur multimodal

Engram memisahkan sebagian penghafalan dari komputasi model yang padat. V4.1 Flash mengalokasikan parameter 196B di dua modul memori kondisional pada lapisan berindeks nol 1 dan 14. Masing-masing memakai n-gram token sepanjang dua, tiga, dan empat, delapan kepala hash, gerbang yang sadar konteks, dan prefetch memori host melalui RDMA. Ini parameter yang disimpan, bukan 196B parameter lain yang diaktifkan untuk setiap token.

DSpark adalah decoder spekulatif yang dilatih secara terpisah. Tiga blok Transformer melihat melalui jendela geser 128 token dan mengusulkan lima posisi secara paralel. Kepala ketergantungan yang ringan menghubungkan token draf; kepala keyakinan memperkirakan seberapa banyak draf yang akan bertahan pada verifikasi. Penjadwal memakai probabilitas itu dan throughput mesin yang terukur untuk memilih panjang verifikasi di bawah beban saat ini. Ini bisa memperbaiki throughput token sistem tanpa mengubah peran verifikasi akhir tulang punggung.

Jalur visual memakai DeepSeek-ViT yang dilatih secara terpisah dengan pengodean posisi rotary 2D. Langkah pixel-unshuffle 3×3 mengurangi hitungan token visual sembilan kali lipat sebelum proyeksi ke model bahasa. Encoder visi punya 32 lapisan, ukuran hidden 1,024, dan 16 kepala perhatian dalam konfigurasi yang dilaporkan. Tahap pelatihan autoregresifnya memakai gambar yang diskalakan antara 544×544 dan 1,344×1,344, setelah tahap kontrastif sebelumnya di atas sekitar 47B pasangan gambar-teks.

Pelatihan dan pascapelatihan

DeepSeek melaporkan 45T token prapelatihan dengan data multimodal yang diintegrasikan ke pelatihan model bahasa. Pipeline hanya-teks dan multimodal digabung pada rasio token 7:1 setelah penggantian tumpang tindih dan deduplikasi. Perhatian jarang dilatih dari awal pada panjang urutan 64K, tanpa pemanasan perhatian padat; konteks diperluas ke 1M pada titik token 34T.

Tahap Detail yang diterbitkan Mengapa ini penting
Prapelatihan kontrastif visi Sekitar 47B pasangan gambar-teks, fase resolusi rendah Mempelajari representasi visual yang luas sebelum integrasi bahasa
Penyetelan autoregresif visi 236B token dengan keterangan, grafik, OCR, dan data terkait Menambah pemahaman visual dan dokumen yang berbutir halus
Prapelatihan LLM 45T token; data multimodal disertakan sejak awal Menghindari memperlakukan visi hanya sebagai adaptor prompt yang terlambat
Pelatihan konteks Perhatian jarang dari 64K; diperluas ke 1M pada 34T token Melatih pola perhatian yang disebarkan, alih-alih mengubahnya hanya setelah pelatihan
Pascapelatihan SFT, reinforcement learning, dan distilasi on-policy Menyelaraskan penalaran, alat, dan perilaku Agent

Laporan tidak mengklaim algoritma pascapelatihan yang baru. Ia mengaitkan kenaikan pada pembuatan tugas dan lingkungan sintetis, penyaringan data yang lebih baik, imbalan yang bisa diverifikasi, serta skala arsitektur/data. Ini penting ketika membandingkan klaim “arsitektur model”: CED dan CSA2 menjelaskan efisiensi, sementara kinerja Agent yang diamati adalah hasil seluruh tumpukan pelatihan dan scaffold.

Upaya penalaran: kualitas punya tagihan token yang terlihat

DeepSeek membuka kontinum upaya internal dari 1 sampai 100 dan memetakan preset API publik low, high, dan max ke 50, 75, dan 100. Masukan kompatibilitas memetakan minimal dan low ke low; medium, high, dan xhigh ke high; serta max atau ultra ke max. Thinking secara bawaan adalah high.

Dalam sapuan yang dilaporkan DeepSeek, menaikkan upaya dari 25 ke 100 meningkatkan hasil rata-rata di delapan evaluasi penalaran dari 67.1% ke 76.3%, DeepSWE dari 66.0% ke 74.2%, dan Terminal-Bench 2.1 dari 82.4% ke 90.6%. Token keluaran tumbuh sekitar 2.5×. Rentang 60–80 menangkap sebagian besar kualitas pada kurang dari setengah anggaran token maksimum; langkah terakhir ke 100 memperpanjang trajektori Agent sebesar 1.6–1.8× untuk kenaikan yang lebih kecil.

Ini salah satu kendali paling berguna pada model. Pakai low untuk klasifikasi, ekstraksi, dan eksplorasi yang bisa diulang; high untuk pemrograman dan riset yang biasa; simpan max untuk tugas di mana percobaan lain atau kasus tepi yang terlewat lebih mahal daripada token tambahan. Perlakukan ini sebagai hipotesis awal dan ukur biaya tugas yang diterima.

Dalam mode thinking, temperature serta penalti presence/frequency diabaikan, dan top_p punya minimum 0.95. Dengan alat, klien harus mengembalikan reasoning_content yang lengkap dari pesan asisten bersama hasil alat; menghilangkannya menyebabkan respons 400. Aturan state itu lebih penting daripada menyalin set parameter OpenAI yang sudah akrab.

Perbandingan benchmark dengan OpenAI dan Anthropic

Tabel ini mereproduksi hasil terpilih dari Tabel 3 laporan teknis DeepSeek. Semua model ditampilkan pada pengaturan Max laporan. DeepSeek memakai scaffold yang diwajibkan atau resmi yang berbeda untuk beberapa evaluasi, konteks DeepSeek Harness 1M untuk pemrograman, dan konteks Claude Code 512K untuk tugas Agent visual. Angka-angka itu adalah bukti yang dilaporkan penyedia, bukan uji adu langsung yang independen dan bukan SLA produksi.

Evaluasi V4 Flash V4 Pro V4.1 Flash GPT-5.6 Sol Claude Opus 5
GPQA Diamond, Pass@1 89.9 92.4 90.9 94.1 93.4
Terminal-Bench 2.1, Pass@1 82.7 87.9 90.6 88.8 89.1
Terminal-Bench 3.0, Pass@1 7.6 11.8 30.0 34.4 43.3
Terminal-Bench 4.0, Pass@1 7.0 12.4 31.2 39.9 51.8
DeepSWE v1.1, terselesaikan 54.4 62.7 74.2 73.0 74.0
CyberGym, Pass@1 76.7 83.3 88.1 84.5
HLE dengan alat, Pass@1 51.5 60.0 63.9 63.6
AutomationBench, Pass@1 37.7 43.2 54.8 45.8 50.3
Agents' Last Exam, Pass@1 25.2 25.7 31.8 26.7 28.6
Chartography dengan alat, Pass@1 78.9 79.9 84.0

Bacaan terkuatnya spesifik. V4.1 Flash membuat langkah besar di atas V4 Flash pada tugas Agent dan kompetitif dengan GPT-5.6 Sol serta Claude Opus 5 pada DeepSWE, Terminal-Bench 2.1, otomasi, dan HLE pemakai alat. Ia tidak memimpin GPQA, versi Terminal-Bench yang kemudian, atau Chartography. Laporan sendiri memperingatkan bahwa nyaris seimbang pada tugas yang umum tidak berarti seimbang di garis depan pada penalaran tersulit dan kasus tepi.

GPT-6 Astra dan Claude Fable 5.1 dihilangkan dari tabel skor ini karena laporan DeepSeek tidak menerbitkan data perbandingan per baris yang sama untuk mereka. Menambah skor dari halaman penyedia yang terpisah akan menciptakan harness bersama yang palsu. Tim sebaiknya mengevaluasi semua kandidat pada tugas repositori, alat, batas waktu, kebijakan jaringan, dan pemeriksaan penerimaan yang sama.

Kompatibilitas API luas tetapi tidak identik

Layanan resmi membuka OpenAI Chat Completions, OpenAI Responses dan API kompatibel Anthropic. Keluasan itu menurunkan pekerjaan migrasi, tetapi kompatibilitas menggambarkan bentuk permintaan, bukan semantik daur hidup yang identik.

Permukaan Perilaku DeepSeek V4.1 Flash Konsekuensi migrasi
Chat Completions Streaming, keluaran JSON, pemanggilan fungsi; prefix/FIM dalam mode tanpa thinking Klien OpenAI yang ada adalah titik awal yang paling sederhana
Responses Tanpa state; fungsi dan gambar didukung Simpan seluruh percakapan sendiri
Bidang state Responses previous_response_id, percakapan, store, latar belakang, dan pengelolaan konteks tidak didukung atau diabaikan Respons 200 tidak membuktikan fitur itu berlaku
Alat yang di-host Pencarian web, pencarian berkas, interpreter kode, computer use, dan bawaan MCP diabaikan; dukungan alat kustom terbatas Jalankan alat di aplikasi dan uji setiap bidang yang diminta
Ringkasan penalaran Ringkasan dan isi penalaran terenkripsi tidak didukung Jangan bergantung pada bidang serah terima penalaran gaya OpenAI
Format Anthropic Bentuk pesan Anthropic diterima Pertahankan aturan penalaran dan state alat DeepSeek, alih-alih menganggap semantik Claude
Visi Gambar diterima pada masukan pengguna dan keluaran alat Validasi ukuran payload, mode detail, dan hitungan gambar

Panduan Responses DeepSeek juga mencantumkan bidang yang diabaikan seperti metadata, templat prompt, truncation, tingkat layanan, pengenal keselamatan, kunci/retensi cache prompt, dan opsi stream. Pengabaian diam-diam adalah bahaya kompatibilitas: penerimaan skema bisa menyembunyikan perilaku yang hilang. Bangun permintaan kesesuaian untuk setiap fitur yang menjadi sandaran aplikasi Anda. Panduan API kompatibel OpenAI menjelaskan mengapa bentuk titik akhir dan kemampuan perlu pemeriksaan yang terpisah.

Model OpenAI saat ini menyediakan ekosistem alat Responses bawaan yang lebih luas dan fitur state yang dikelola. API bawaan Anthropic punya kontrak blok thinking dan pemakaian alat yang matang sendiri. Keunggulan DeepSeek adalah satu model menerima ketiga dialek yang umum; biayanya adalah irisannya lebih kecil daripada permukaan bawaan penuh salah satu pesaing.

Batas visi dan ekonomi gambar

Panduan visi resmi mendukung JPEG, PNG, GIF, dan WebP melalui base64, URL eksternal, atau Files API. Gambar diubah ukurannya secara otomatis menuju kira-kira 1,300×1,300 dan memakai paling banyak 1,024 token masukan masing-masing. Detail low memakai tampilan 512×512; high dan original mempertahankan lebih banyak detail; auto saat ini berperilaku sebagai original.

Batas Nilai resmi
Badan permintaan 48 MiB
Gambar sebaris atau yang diambil dari luar 32 MiB masing-masing
Gambar yang dirujuk ID berkas 64 MiB masing-masing
Gambar per permintaan 600
Byte gambar gabungan 64 MiB tanpa ID berkas; 200 MiB dengan ID berkas
Tepi panjang 8,192 px; 4,096 px ketika mengirim 15 gambar atau lebih
Langit-langit token visual 1,024 token per gambar setelah pemrosesan

Pada maksimum 1,024 token visual, satu gambar yang tidak di-cache menyumbang sekitar $0.0001536 di luar puncak atau $0.0003072 puncak pada tarif masukan yang diterbitkan, sebelum teks pendamping dan keluaran. Aritmetika ini berguna untuk perkiraan skala, tetapi pengubahan ukuran gambar, perilaku cache, dan pemakaian token visual yang sebenarnya bisa mengubah tagihan. Lebih banyak gambar juga menghabiskan konteks yang kalau tidak bisa menampung teks atau riwayat alat.

V4.1 Flash cocok untuk tangkapan layar dokumen, grafik, OCR, dan pengamatan Agent visual. Ia bukan model pembangkitan gambar. Untuk gambar yang dibangkitkan, pakai model dan titik akhir yang dirancang untuk mengembalikan piksel, bukan teks.

Perbandingan harga API resmi

Halaman harga DeepSeek memperkenalkan tarif berikut pada 04:00 UTC, September 10. Jendela puncak hari kerja adalah 01:00–04:00 dan 06:00–10:00 UTC; semua waktu hari kerja lain dan akhir pekan memakai tarif di luar puncak. Cache konteks DeepSeek otomatis, jadi “masukan ter-cache” berarti hit cache yang dilaporkan, bukan bendera cache yang memaksanya.

Tarif OpenAI berasal dari perbandingan model saat ini; tarif Anthropic berasal dari halaman harganya. Nilainya adalah USD per satu juta token. Anthropic juga menagih penulisan cache; itu dihilangkan di sini karena tabel hanya membandingkan masukan baru, pembacaan cache, dan keluaran.

Model Konteks / keluaran maks Masukan baru atau luput Masukan ter-cache/dibaca Keluaran
DeepSeek V4.1 Flash, di luar puncak 1M / 384K $0.15 $0.003 $0.60
DeepSeek V4.1 Flash, puncak 1M / 384K $0.30 $0.006 $1.20
DeepSeek V4.1 Flash di Modelflare Batas model 1M / 384K $0.193548 $0.003871 $0.774194
GPT-5.6 Luna 1.05M / 128K $0.20 $0.02 $1.20
GPT-5.6 Terra 1.05M / 128K $2.00 $0.20 $12.00
GPT-5.6 Sol 1.05M / 128K $4.00 $0.40 $20.00
GPT-6 Astra 1.05M / 128K $10.00 $1.00 $50.00
Claude Sonnet 5 1M / 128K $2.00 $0.20 $10.00
Claude Opus 5 1M / 128K $5.00 $0.50 $25.00
Claude Fable 5.1 1M / 128K $10.00 $0.25 $50.00

Harga bukan nilai dengan sendirinya. Tokenizer yang berbeda bisa menagih hitungan token yang berbeda untuk teks yang sama; Anthropic mencatat bahwa tokenisasi yang lebih baru bisa menghasilkan kira-kira 30% lebih banyak token pada beberapa beban. Model juga bisa membutuhkan panjang keluaran, percobaan ulang, dan perbaikan manusia yang berbeda. Bandingkan biaya per tugas yang diterima, bukan hanya baris dengan angka masukan terkecil.

Katalog publik Modelflare saat ini membuka satu tarif di antara dua pita waktu DeepSeek: kira-kira 64.5% dari tarif puncak pihak pertama, atau 35.5% lebih rendah selama jendela puncak, sementara kira-kira 29.0% di atas tarif di luar puncak DeepSeek. Tarif gateway yang tercantum karena itu tidak punya penyesuaian pita waktu hari ini; beban yang fleksibel dan bisa memakai jendela di luar puncak DeepSeek dengan andal mungkin masih membayar lebih sedikit melalui API pihak pertama.

OpenAI menerapkan tarif lebih tinggi ketika konteks masukan melebihi 272K: seluruh permintaan memakai harga masukan dan masukan ter-cache 2× serta harga keluaran 1.5×. Batas ini penting pada skenario konteks panjang di bawah. DeepSeek memakai jendela waktu sebagai gantinya; model satu juta token yang tercantum dari Anthropic tidak memakai batas 272K yang sama pada tabel harga yang dikutip.

Dua skenario biaya yang bisa diulang

Skenario A adalah satu permintaan dengan 100K masukan yang tidak di-cache dan 10K keluaran. Rumusnya adalah 0.1 × input rate + 0.01 × output rate. Ia menganggap tidak ada masukan ter-cache, alat, percobaan ulang, pajak, atau tambahan khusus penyedia.

Model Biaya skenario A
DeepSeek V4.1 Flash, di luar puncak $0.021
DeepSeek V4.1 Flash di Modelflare $0.0271
GPT-5.6 Luna $0.032
DeepSeek V4.1 Flash, puncak $0.042
Claude Sonnet 5 $0.300
GPT-5.6 Terra $0.320
GPT-5.6 Sol $0.600
Claude Opus 5 $0.750
GPT-6 Astra / Claude Fable 5.1 $1.500

Skenario B adalah biaya marginal permintaan cache hangat dengan 900K masukan ter-cache, 100K masukan baru, dan 20K keluaran. Ia dengan sengaja mengecualikan permintaan sebelumnya yang membentuk cache. Rumus: 0.9 × cache-read rate + 0.1 × input rate + 0.02 × output rate. Pengubah konteks panjang seluruh-permintaan OpenAI diterapkan karena konteks masukan berjumlah satu juta token.

Model Biaya marginal skenario B
DeepSeek V4.1 Flash, di luar puncak $0.0297
DeepSeek V4.1 Flash di Modelflare $0.0383
DeepSeek V4.1 Flash, puncak $0.0594
GPT-5.6 Luna $0.1120
Claude Sonnet 5 $0.5800
GPT-5.6 Terra $1.1200
Claude Opus 5 $1.4500
GPT-5.6 Sol $2.1200
Claude Fable 5.1 $2.2250
GPT-6 Astra $5.3000

Perbandingan menahan kuantitas token tetap; ia tidak mengklaim kualitas yang sama. Cache DeepSeek bersifat upaya terbaik, sementara pembuatan cache Anthropic punya harga penulisan dan umur sendiri. Uji beban yang adil mencatat token hit/miss cache, semua percobaan, total keluaran termasuk penalaran yang ditagih, waktu yang berlalu, tingkat penerimaan, dan menit koreksi manusia. Panduan pelacakan biaya menyediakan kerangka akuntansinya.

Bobot terbuka tidak membuat hosting sendiri menjadi kecil

Rilis Hugging Face berlisensi MIT dan mendokumentasikan jalur penyajian vLLM dan SGLang. Pada cuplikan yang diperiksa untuk artikel ini, repositori berisi 48 pecahan safetensor dan sekitar 510.3 GB berkas Git-LFS pada commit dba1be0a40aa45a94ad051997016db3960a90277. Hitungan byte itu artefak unduhan, bukan RAM GPU yang diukur.

Sistemnya tetap punya tulang punggung 552B, memori Engram beralamat host 196B, perutean expert, jalur cache FP4/FP8, prefetch RDMA, dan penyimpanan KV persisten. Rilis DeepSeek mengundang tim yang merencanakan penyebaran skala besar dengan 2,000 GPU plus klaster penyimpanan untuk menghubungi perusahaan. Contoh itu menandai skala sistem penyajian penuh; itu bukan minimum yang dinyatakan untuk setiap penyebaran. Penyebaran riset yang lebih kecil boleh memakai kuantisasi atau paralelisme yang berbeda, tetapi tidak seharusnya disimpulkan dari ekonomi API penyedia.

Bobot terbuka memberi tim akses checkpoint, kemampuan memeriksa, dan kendali atas kebijakan penyebaran. Mereka tidak secara otomatis mereproduksi fusi kernel DeepSeek, hierarki cache, penjadwalan DSpark, pengelompokan batch, atau latensi API publik. Bandingkan rencana hosting sendiri dengan throughput yang diukur, pemulihan kegagalan, kapasitas menganggur, lebar pita penyimpanan, dan tenaga operasi.

DeepSeek V4.1 Flash di Modelflare

DeepSeek V4.1 Flash sudah tayang di Modelflare. Peluncuran yang dikonfirmasi operator terlihat secara independen di katalog harga Modelflare publik dan katalog origin. Pada 2026-09-10 15:21 UTC, keduanya membuka catatan baru deepseek-v4.1-flash-0910; konfigurasi produksi menunjukkan kemampuan deepseek-stable yang aktif dan rute yang diaktifkan yang mengiklankan model yang sama.

Butir Modelflare Nilai yang tayang
ID model yang dikirim deepseek-v4.1-flash-0910
Ketersediaan Tayang di katalog publik dan grup perutean yang diaktifkan
Grup publik deepseek-stable
Harga masukan $0.193548 / 1M token
Harga masukan ter-cache $0.003871 / 1M token
Harga keluaran $0.774194 / 1M token
Jenis titik akhir /v1/chat/completions dan /v1/responses

Harga diturunkan dari koefisien masukan dasar $0.322580645 pada entri yang tayang, rasio grup publik 0.6, rasio cache 0.02, dan rasio completion 4×. Untuk dua beban yang dihitung di atas, biaya Modelflare kira-kira $0.0271 dan $0.0383 masing-masing. Pakai halaman harga DeepSeek V4.1 Flash yang tayang untuk ID model dan tarif saat ini.

Tingkat bukti tetap penting. Katalog publik dan rute produksi yang diaktifkan menetapkan ketersediaan produk, dan operator secara eksplisit mengonfirmasi peluncuran. Pada 15:30 UTC, catatan produksi berisi enam pemanggilan Chat Completions yang selesai di bawah ID model baru yang persis, berjumlah 216 token prompt dan 173 token completion. Itu memverifikasi pengiriman Chat Completions yang terautentikasi dan keluaran yang ditagih. Sampel peluncuran itu masih terlalu kecil untuk mengukur latensi atau ketersediaan, dan tidak secara independen membuktikan perilaku Responses atau multimodal melalui rute ini. Tim sebaiknya menjalankan permintaan penerimaan kecil mereka sendiri pada titik akhir yang persis sebelum memindahkan pekerjaan produksi.

Di mana DeepSeek V4.1 Flash punya keunggulan nyata

Model ini punya keunggulan yang koheren ketika masukan panjang, giliran alat yang sering, dan anggaran semuanya penting. Arsitektur mengurangi tekanan prefill dan cache; harga API mengubah penghematan itu menjadi tarif publik yang luar biasa rendah; langit-langit keluaran 384K menyisakan ruang untuk patch atau laporan yang panjang; dan checkpoint menjaga jalur hosting sendiri tetap terbuka.

Beban Mengapa V4.1 Flash kandidat yang kuat Apa yang diukur
Agent repositori Hasil DeepSWE dan terminal yang dilaporkan penerbit kuat pada tarif token yang rendah Perubahan yang diterima, tingkat lulus tes, percobaan ulang, dan waktu perbaikan
Sintesis riset panjang Masukan 1M, hit cache yang murah, dan keluaran 384K Kebenaran kutipan, retensi persyaratan, dan total keluaran
Agent dokumen visual Gambar bawaan, pelatihan OCR/grafik, dan API Agent yang umum Akurasi bidang, kepekaan crop/detail, dan pemakaian token visual
Otomasi volume tinggi Harga puncak dan di luar puncak yang rendah; langit-langit konkurensi 2,500 permintaan Waktu antrean, tingkat 429, kegagalan alat, dan biaya per keberhasilan
Penyebaran terkendali Checkpoint MIT dan jalur vLLM/SGLang yang terdokumentasi Utilisasi perangkat keras, lebar pita cache/penyimpanan, dan biaya operasional

Klaim produksi terkuat karena itu adalah agensi berkonteks panjang yang efisien biaya, bukan “model terbaik secara keseluruhan.” Jika model menyelesaikan tugas nyata dalam satu jalankan yang diterima sementara model kecil yang lebih murah membutuhkan beberapa perbaikan, V4.1 menang pada hasil. Jika model tertutup di garis depan mencegah kegagalan yang mahal, harga tokennya yang lebih tinggi tetap bisa ekonomis.

Di mana OpenAI atau Anthropic tetap pilihan yang lebih aman

Pilih model OpenAI ketika aplikasi bergantung pada ekosistem Responses penuh, state yang dikelola, alat yang di-host, atau kontrak khusus OpenAI yang diabaikan DeepSeek. GPT-5.6 Luna adalah pesaing harga yang sangat dekat untuk beban yang lebih pendek dan tidak di-cache; Terra, Sol, dan Astra menukar harga daftar yang jauh lebih tinggi dengan tingkat kemampuan yang berbeda dan fitur platform bawaan.

Pilih model Anthropic ketika kontrak alat/thinking bawaan Claude, kendali cache, atau kinerja yang terukur pada pekerjaan Agent tersulit Anda lebih penting daripada harga daftar token. Dalam tabel DeepSeek sendiri, Claude Opus 5 memimpin Terminal-Bench 3/4 dan Chartography; Claude Fable 5.1 diposisikan untuk pekerjaan horizon panjang yang paling menuntut, meskipun jauh lebih mahal per token baru dan keluaran.

Untuk tindakan yang kritis bagi keselamatan atau mahal, pemilihan rute sebaiknya didasarkan pada mode kegagalan yang dievaluasi dan batas izin, bukan merek atau rata-rata benchmark. Pakai panduan perutean untuk memisahkan pekerjaan yang bisa diulang, fallback, dan tindakan yang punya efek samping.

Daftar periksa penyebaran

  1. Pakai deepseek-flash untuk API pihak pertama dan catat pemetaan khusus gateway secara terpisah.
  2. Mulai pada upaya high, lalu ukur low dan max pada set tugas yang diterima yang sama; jangan memetakan nama lintas penyedia sebagai komputasi yang setara.
  3. Ketika alat dipakai dalam mode thinking, kembalikan reasoning_content yang lengkap persis seperti yang diwajibkan.
  4. Audit setiap bidang Responses yang Anda andalkan; parameter yang ditolak dan yang diabaikan diam-diam membutuhkan penanganan yang berbeda.
  5. Catat token hit cache dan miss cache, token keluaran/penalaran, percobaan ulang, latensi, dan penerimaan akhir.
  6. Rancang ekonomi cache di sekitar hit yang diamati, alih-alih asumsi retensi yang tetap.
  7. Terapkan batas byte, hitungan, dimensi, dan detail gambar sebelum mengirim permintaan multimodal.
  8. Jaga otorisasi di sisi aplikasi, idempotensi alat, dan validasi keluaran agar tidak bergantung pada kualitas model.
  9. Periksa lagi harga jendela waktu, alias model, dan batas konkurensi sebelum peluncuran.
  10. Jalankan permintaan terautentikasi yang nyata pada rute yang persis; katalog model atau HTTP 200 saja bukan bukti kemampuan.

Pertanyaan yang sering diajukan

Apakah DeepSeek V4.1 Flash lebih baik daripada GPT-6 Astra atau Claude Fable 5.1? Bukan sebagai klaim universal. V4.1 Flash punya keunggulan harga dan bobot terbuka yang besar serta skor Agent yang dilaporkan penyedia yang kuat. DeepSeek sendiri mengatakan model tertutup terbesar mempertahankan keunggulan pada penalaran tersulit dan kasus tepi. Tidak ada perbandingan Astra/Fable pada harness yang sama di laporan V4.1.

Berapa parameter yang dimiliki DeepSeek V4.1 Flash? Laporan mencantumkan tulang punggung berparameter 552B plus parameter Engram 196B. Ia mengaktifkan sekitar 8B parameter tulang punggung per token prefill dan 16B per token yang didekode. Mengatakan hanya “552B total” menghilangkan Engram; mengatakan “748B active” juga salah.

Apa batas konteks dan keluarannya? Batas resmi adalah satu juta token konteks dan hingga 384K token keluaran. Embedding gambar, teks, riwayat alat, dan penalaran semuanya menghabiskan anggaran yang relevan.

Mengapa disebut Flash? Desainnya berfokus pada biaya penyajian yang lebih rendah: aktivasi prefill/decode yang asimetris, perhatian jarang yang terkompresi, KV global FP4, pemutaran ulang persisten yang berbatas, dan dekode spekulatif. “Flash” tidak menjanjikan latensi terendah untuk setiap prompt atau kondisi antrean.

Apakah cache publik bertahan 72 jam? Jangan menganggap begitu. Laporan teknis menggambarkan desain penyebaran dengan persistensi KV global setidaknya 72 jam. Panduan API publik menyebut caching sebagai upaya terbaik dan mengatakan entri umumnya dibersihkan setelah jam atau hari. Penagihan sebaiknya memakai bidang hit/miss yang diamati.

Apakah Responses API pengganti langsung untuk OpenAI Responses? Ia menerima bentuk yang akrab, tetapi tanpa state dan mengabaikan beberapa bidang OpenAI serta alat yang di-host. Uji kontrak kemampuan persis yang Anda butuhkan.

Bisakah ia membangkitkan gambar? Ia memahami masukan gambar dan mengembalikan teks. Ia bukan model pembangkitan gambar.

Bisakah saya memanggil V4.1 Flash melalui Modelflare hari ini? Ya. Pakai deepseek-v4.1-flash-0910 di grup deepseek-stable dengan Chat Completions atau Responses. Ini ID bertanda rilis milik Modelflare; alias pihak pertama deepseek-flash adalah kontrak penyedia yang terpisah.

Sumber, metode, dan log pembaruan

Artikel ini memprioritaskan sumber pihak pertama dan memisahkan fakta yang terdokumentasi, evaluasi yang dilaporkan DeepSeek, contoh yang dihitung, dan state katalog Modelflare yang diamati. Tidak ada benchmark model independen yang dijalankan. Matematika biaya disimpan di artefak sumber pendamping, dan setiap skenario menyatakan vektor token serta pengecualiannya. Sampul tanpa kata adalah ilustrasi editorial yang dibangkitkan AI dalam gaya visual Modelflare yang sudah ada.

Sumber primer: Rilis DeepSeek V4.1 Flash, laporan teknis, kartu model, harga, thinking, Responses, kompatibilitas Anthropic, visi, cache konteks, perbandingan model OpenAI, harga Anthropic, dan katalog publik Modelflare.

Pembaruan 2026-09-10: tinjauan hari publikasi yang pertama. Ia mencatat ID model pihak pertama, harga puncak/di luar puncak yang berlaku, pemberitahuan migrasi alias September 14, batas API saat ini, arsitektur laporan teknis, dan data benchmark. Pembaruan hari yang sama kemudian menambahkan peluncuran Modelflare yang terkonfirmasi di bawah deepseek-v4.1-flash-0910, harga gateway yang tayang, dan biaya gateway yang dihitung. Periksa lagi fakta yang bisa berubah sebelum implementasi.