DeepSeek V4 Flash Vision Exp: ulasan, harga, batas, dan perbandingan
Ulasan terverifikasi DeepSeek V4 Flash Vision Exp yang membahas biaya token gambar, batas API, benchmark, perbandingan dengan Gemini 3.7 Flash dan Claude Opus 4.8, serta harga dan ketersediaan terkini di Modelflare.
DeepSeek merilis DeepSeek V4 Flash Vision Exp pada 21 Agustus 2026. ID API yang tepat adalah deepseek-v4-flash-vision-exp. Model ini menerima teks dan gambar, menghasilkan teks, serta memakai tarif token yang sama dengan V4 Flash.
Poin terakhir adalah inti rilis ini. DeepSeek mengubah ukuran setiap gambar sebelum inferensi dan membatasi konsumsi hingga 384 token input. Biayanya sangat rendah untuk loop agent yang terus membaca tangkapan layar. Konsekuensinya juga jelas: gambar besar diperkecil menuju anggaran sekitar 800×800 piksel. Harga murah tidak sama dengan mempertahankan detail resolusi penuh.
Ini adalah model eksperimental, bukan pengganti otomatis bagi semua beban visual di production. Analisis ini memisahkan spesifikasi resmi, benchmark yang diterbitkan DeepSeek, perhitungan biaya yang dapat diulang, dan ketersediaan nyata di Modelflare. Fakta yang mudah berubah diperiksa pada 22 Agustus 2026.
Ringkasan DeepSeek V4 Flash Vision Exp
| Properti | Nilai resmi |
|---|---|
| Tanggal rilis | 21 Agustus 2026 |
| Status | Model API eksperimental |
| ID model | deepseek-v4-flash-vision-exp |
| Input dan output | Input teks dan gambar; output teks |
| Jendela konteks | 1M token |
| Output maksimum | 384K token |
| Thinking | Mendukung mode thinking dan non-thinking; thinking adalah default terdokumentasi |
| Format gambar | JPEG, PNG, GIF, WebP |
| Format API | Chat Completions, Responses API, Messages kompatibel Anthropic |
| Batas per gambar | Maksimum 384 token input setelah resize |
| Batas konkurensi | 2.500 |
| FIM Completion | Tidak didukung |
DeepSeek belum mengungkap jumlah parameter, parameter aktif, jumlah expert, corpus pelatihan, atau perubahan arsitektur. Angka presisi tanpa sumber primer adalah spekulasi.
Perubahan nyata dari V4 Flash
Menurut DeepSeek, Vision Exp setara dengan V4 Flash resmi untuk agent teks, penalaran, dan pengetahuan umum. Perubahan utamanya adalah pemahaman visual native: screenshot, gambar dokumen, grafik, dan foto dapat langsung masuk ke loop tool yang sama tanpa model terpisah untuk membuat deskripsi.
Tabel peluncuran memuat hasil berikut:
| Evaluasi | Skor terbitan DeepSeek |
|---|---|
| Terminal Bench 2.1 | 83.9 |
| NL2Repo | 57.7 |
| DeepSWE | 59.3 |
| DSBench-Hard | 63.6 |
| AutomationBench, set publik | 25.7 |
| ApexBench, Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| Chartography | 64.3 |
| ZeroBench, Pass@5 | 35.0 |
DeepSeek juga menyatakan kemampuan agent multimodal mendekati Claude Opus 4.8. Ini klaim vendor, bukan pengujian independen Modelflare. Barisnya mencampur tugas teks dan tugas yang memerlukan vision. Untuk pengujian agent coding publik, DeepSeek mencatat Harness mode minimal, max effort, top_p=0.95, dan temperature=1.0. Gunakan hasilnya untuk memilih workload replay sendiri, bukan sebagai peringkat universal.
Harga resmi dan biaya nyata per gambar
Halaman harga DeepSeek mencantumkan dolar AS per satu juta token. Jam puncak adalah 01:00–04:00 dan 06:00–10:00 UTC; waktu lain adalah off-peak.
| Meter | Off-peak | Peak |
|---|---|---|
| Input cache | $0.007 | $0.014 |
| Input tanpa cache | $0.22 | $0.44 |
| Output | $0.66 | $1.32 |
| Biaya input maksimum gambar 384 token | $0.00008448 | $0.00016896 |
Baris terakhir adalah perhitungan 384 × tarif input ÷ 1.000.000, bukan tarif gambar terpisah. Gambar lebih kecil dapat memakai lebih sedikit token. Teks input dan output model tetap dikenai biaya tambahan.
Resize otomatis menjelaskan harga sekaligus batasnya. Gambar di bawah sekitar 384×384 diperbesar dengan rasio tetap. Gambar lebih besar diperkecil menuju total piksel sekitar 800×800. Karena itu 2000×2000 dan 5000×5000 dapat mencapai batas 384 token yang sama. Tagihan turun, tetapi teks kecil, label grafik padat, dan koordinat layar presisi dapat hilang.
Perbandingan dengan Gemini 3.7 Flash dan Claude Opus 4.8
Ketiga model menyelesaikan versi berbeda dari masalah multimodal. Tabel memakai tarif standar API langsung dan tidak memasukkan tool, penyimpanan cache, retry, atau diskon gateway.
| Model | Status | Input | Konteks / output maks. | Input tanpa cache | Output | Kompromi utama |
|---|---|---|---|---|---|---|
| DeepSeek V4 Flash Vision Exp | Eksperimental | Teks, gambar | 1M / 384K | $0.22 off-peak; $0.44 peak | $0.66 off-peak; $1.32 peak | Tarif terendah dan batas 384 token per gambar; resize agresif |
| Gemini 3.7 Flash | GA | Teks, gambar, video, audio, PDF | 1M / 64K | $0.75 hingga 31-12-2026 | $3.75 hingga 31-12-2026 | Modalitas dan tool lebih luas; harga lebih tinggi dan akan naik |
| Claude Opus 4.8 | GA | Teks, gambar, PDF | 1M / 128K | $5.00 | $25.00 | Vision resolusi tinggi dan Computer Use matang; biaya premium |
Untuk 100K token input tanpa cache dan 10K output, tanpa gambar:
- DeepSeek sekitar $0.0286 off-peak atau $0.0572 peak.
- Gemini 3.7 Flash $0.1125 pada harga perkenalan.
- Claude Opus 4.8 $0.75.
Dalam contoh ini, DeepSeek sekitar 49% lebih murah daripada Gemini saat peak dan 75% saat off-peak. Dibanding Claude, selisihnya 92–96%. Persentase ini membandingkan tagihan, bukan kualitas.
Perbedaan gambar lebih besar, tetapi resolusinya juga berubah. Anthropic mendokumentasikan 1.296 visual token untuk gambar 1000×1000 pada Opus 4.8, sekitar $0.00648. DeepSeek membatasi gambar apa pun pada $0.00016896 peak dan $0.00008448 off-peak, sekitar 38 hingga 77 kali lebih murah. Namun DeepSeek mengecilkan menuju 800×800, sedangkan Opus mempertahankan detail lebih banyak.
Batch 100 gambar satu megapiksel, 100K token teks, dan 10K output berbiaya maksimum $0.0370 off-peak atau $0.0741 peak pada DeepSeek. Dengan 1.296 token per gambar dari dokumentasi Anthropic, tagihan Opus 4.8 sekitar $1.398. Ini bukan pengujian kualitas yang setara; ini menunjukkan bahwa triase visual murah dan inspeksi resolusi tinggi adalah workload berbeda.
Model untuk setiap workload
Uji DeepSeek V4 Flash Vision Exp secara terkendali untuk banyak screenshot, dokumen biasa, grafik, ekstraksi mirip OCR, dan observasi visual dalam loop tool ketika biaya per tugas berhasil lebih penting daripada mempertahankan setiap piksel.
Pilih Gemini 3.7 Flash untuk multimodalitas luas bila satu alur harus menangani gambar, video, audio, dan PDF, atau bergantung pada Search Grounding, eksekusi kode, File Search, URL Context, serta Computer Use preview. Gemini berstatus GA; endpoint visual DeepSeek masih eksperimental.
Pilih Claude Opus 4.8 untuk agent visual resolusi tinggi ketika dokumen padat, elemen UI kecil, Computer Use, dan tugas browser panjang layak membayar lebih. Anthropic mendukung sisi panjang hingga 2.576 piksel dan 4.784 visual token, sehingga perbandingan harga per gambar saja tidak setara.
Arsitektur bertingkat juga mungkin: model murah mengklasifikasi dan mengekstrak lebih dulu, lalu hanya kasus ambigu atau sensitif detail yang naik ke resolusi tinggi. Ukur panggilan kedua, latensi, dan rasio eskalasi; jika hampir semuanya naik, dua model tidak otomatis lebih murah.
Cara mengirim gambar dan batas
Panduan Vision DeepSeek mendukung:
- base64 inline untuk file lokal;
- URL HTTP atau HTTPS publik;
file_idFiles API yang dapat dipakai ulang.
| Batas | Nilai |
|---|---|
| Body inline | 48 MiB |
| Satu gambar base64 atau URL | 32 MiB |
| Satu gambar Files API | 64 MiB |
| Gambar per request | 600 |
Total tanpa file_id |
64 MiB |
Total dengan file_id |
200 MiB |
| Sisi maksimum | 8.192 px; 4.096 px untuk 15 gambar atau lebih |
| URL eksternal | 8.192 karakter dan selesai diunduh dalam 60 detik |
detail: "low" memaksa 512×512 dan cocok untuk OCR atau klasifikasi detail rendah. high, original, dan saat ini auto mempertahankan sumber sebelum aturan resize normal. Chat Completions hanya menerima gambar dalam pesan user; Responses juga mengizinkannya pada developer dan output tool, tetapi menolak gambar pada system atau assistant.
Contoh Responses API melalui Modelflare
Modelflare kini mencantumkan ID tepat dan route Responses API. Gunakan API key yang ditetapkan ke grup deepseek-stable:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODELFLARE_API_KEY"],
base_url="https://modelflare.dev/v1",
)
response = client.responses.create(
model="deepseek-v4-flash-vision-exp",
input=[
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Baca dasbor ini. Kembalikan tiga anomali dan bukti visual untuk masing-masing.",
},
{
"type": "input_image",
"image_url": "https://example.com/dashboard.png",
"detail": "low",
},
],
}
],
)
print(response.output_text)
Untuk gambar privat, gunakan base64 atau Files API, bukan URL publik. Jangan simpan credential, URL objek privat, atau data pribadi dalam log. Implementasi Responses DeepSeek stateless: previous_response_id, conversations, dan store tidak didukung. Function Calling serta Web Search didukung; Computer Use, Code Interpreter, File Search, dan MCP bawaan diabaikan.
Checklist production
- Pin
deepseek-v4-flash-vision-exp; jangan anggapdeepseek-v4-flashsebagai alias vision. - Buat set aman berisi teks kecil, tabel padat, grafik, screenshot, rotasi, dan konten adversarial.
- Bandingkan
detail: "low"dengan default berdasarkan keberhasilan, latensi, dan token tertagih. - Validasi Chat Completions, Responses, dan Messages secara terpisah bila memakai beberapa protokol.
- Uji output terstruktur, korelasi tool call, streaming, pembatalan, penolakan, dan gambar rusak.
- Gunakan ID Files API untuk gambar privat berulang dan tetapkan retensi serta penghapusan.
- Catat jumlah, dimensi, token input, cache, output, retry, latensi, route, dan biaya akhir.
- Pertahankan fallback GA untuk tugas penting atau sensitif detail sampai lolos ambang traffic nyata.
HTTP 200 hanya membuktikan satu request selesai. Itu tidak membuktikan screenshot dibaca benar, tool diotorisasi, atau biaya per tugas berhasil menurun.
Harga DeepSeek V4 Flash Vision Exp di Modelflare
Model ini sudah tersedia. Dalam pemeriksaan production lanjutan pada 22 Agustus 2026, katalog publik Model & Harga mencantumkan ID tepat deepseek-v4-flash-vision-exp dalam grup deepseek-stable, dengan route OpenAI-compatible Chat Completions dan Responses API.
Katalog memakai harga referensi peak resmi—input $0.44, output $1.32, dan input cache $0.014 per satu juta—kemudian menerapkan multiplier 0.9x dari deepseek-stable:
| Grup Modelflare | Input | Input cache | Output | Biaya input tanpa cache maksimum untuk gambar 384 token |
|---|---|---|---|---|
deepseek-stable |
$0.396 / 1M | $0.0126 / 1M | $1.188 / 1M | $0.000152064 |
Dengan tarif ini, 100K token teks tanpa cache dan 10K output berbiaya sekitar $0.05148. Seratus gambar pada batas 384 token, 100K token teks, dan 10K output berbiaya maksimum $0.06669, sebelum retry atau request lain.
Jangan anggap harga grup 0.9x sebagai jadwal off-peak langsung DeepSeek. Modelflare menerapkan multiplier pada harga referensi yang dikonfigurasi dan tidak berganti otomatis mengikuti jam vendor. Grup, route, dan harga dapat berubah; gunakan halaman live dan catatan request selesai sebagai sumber terkini.
Kesimpulan
DeepSeek V4 Flash Vision Exp mengubah ekonomi agent visual: setiap gambar dibatasi 384 token dengan tarif V4 Flash. Untuk triase screenshot, ekstraksi dokumen, pembacaan grafik, dan loop visual bervolume tinggi, selisihnya dapat berarti.
Batas yang sama adalah peringatannya. Resize dapat menghapus detail yang dibutuhkan Computer Use dan dokumen padat; endpoint masih eksperimental; benchmark berasal dari vendor. Evaluasi sebagai pekerja visual murah, bukan bukti bahwa satu model menggantikan seluruh stack multimodal.
Sumber resmi dan riwayat
Sumber primer:
- Change log DeepSeek
- Panduan Vision DeepSeek
- Model dan harga DeepSeek
- Responses API DeepSeek
- Google: Gemini 3.7 Flash
- Google: harga Gemini API
- Anthropic: ringkasan model Claude
- Anthropic: token visual dan batas gambar
Riwayat:
- 22 Agustus 2026: publikasi awal. Status, spesifikasi, pemrosesan gambar, batas, protokol, harga waktu, kompetitor, perhitungan, dan katalog Modelflare telah diperiksa.
- Kemudian pada 22 Agustus 2026: diperbarui setelah ID tepat tersedia di Modelflare. Ditambahkan harga 0.9x
deepseek-stable, perhitungan biaya, route yang didukung, dan contoh Responses API melalui Modelflare.