DeepSeek V4 Flash Vision Exp: ulasan, harga, batas, dan perbandingan

Ulasan terverifikasi DeepSeek V4 Flash Vision Exp yang membahas biaya token gambar, batas API, benchmark, perbandingan dengan Gemini 3.7 Flash dan Claude Opus 4.8, serta harga dan ketersediaan terkini di Modelflare.

DeepSeek merilis DeepSeek V4 Flash Vision Exp pada 21 Agustus 2026. ID API yang tepat adalah deepseek-v4-flash-vision-exp. Model ini menerima teks dan gambar, menghasilkan teks, serta memakai tarif token yang sama dengan V4 Flash.

Poin terakhir adalah inti rilis ini. DeepSeek mengubah ukuran setiap gambar sebelum inferensi dan membatasi konsumsi hingga 384 token input. Biayanya sangat rendah untuk loop agent yang terus membaca tangkapan layar. Konsekuensinya juga jelas: gambar besar diperkecil menuju anggaran sekitar 800×800 piksel. Harga murah tidak sama dengan mempertahankan detail resolusi penuh.

Ini adalah model eksperimental, bukan pengganti otomatis bagi semua beban visual di production. Analisis ini memisahkan spesifikasi resmi, benchmark yang diterbitkan DeepSeek, perhitungan biaya yang dapat diulang, dan ketersediaan nyata di Modelflare. Fakta yang mudah berubah diperiksa pada 22 Agustus 2026.

Ringkasan DeepSeek V4 Flash Vision Exp

Properti Nilai resmi
Tanggal rilis 21 Agustus 2026
Status Model API eksperimental
ID model deepseek-v4-flash-vision-exp
Input dan output Input teks dan gambar; output teks
Jendela konteks 1M token
Output maksimum 384K token
Thinking Mendukung mode thinking dan non-thinking; thinking adalah default terdokumentasi
Format gambar JPEG, PNG, GIF, WebP
Format API Chat Completions, Responses API, Messages kompatibel Anthropic
Batas per gambar Maksimum 384 token input setelah resize
Batas konkurensi 2.500
FIM Completion Tidak didukung

DeepSeek belum mengungkap jumlah parameter, parameter aktif, jumlah expert, corpus pelatihan, atau perubahan arsitektur. Angka presisi tanpa sumber primer adalah spekulasi.

Perubahan nyata dari V4 Flash

Menurut DeepSeek, Vision Exp setara dengan V4 Flash resmi untuk agent teks, penalaran, dan pengetahuan umum. Perubahan utamanya adalah pemahaman visual native: screenshot, gambar dokumen, grafik, dan foto dapat langsung masuk ke loop tool yang sama tanpa model terpisah untuk membuat deskripsi.

Tabel peluncuran memuat hasil berikut:

Evaluasi Skor terbitan DeepSeek
Terminal Bench 2.1 83.9
NL2Repo 57.7
DeepSWE 59.3
DSBench-Hard 63.6
AutomationBench, set publik 25.7
ApexBench, Pass@1 36.5
Agents' Last Exam 27.3
Chartography 64.3
ZeroBench, Pass@5 35.0

DeepSeek juga menyatakan kemampuan agent multimodal mendekati Claude Opus 4.8. Ini klaim vendor, bukan pengujian independen Modelflare. Barisnya mencampur tugas teks dan tugas yang memerlukan vision. Untuk pengujian agent coding publik, DeepSeek mencatat Harness mode minimal, max effort, top_p=0.95, dan temperature=1.0. Gunakan hasilnya untuk memilih workload replay sendiri, bukan sebagai peringkat universal.

Harga resmi dan biaya nyata per gambar

Halaman harga DeepSeek mencantumkan dolar AS per satu juta token. Jam puncak adalah 01:00–04:00 dan 06:00–10:00 UTC; waktu lain adalah off-peak.

Meter Off-peak Peak
Input cache $0.007 $0.014
Input tanpa cache $0.22 $0.44
Output $0.66 $1.32
Biaya input maksimum gambar 384 token $0.00008448 $0.00016896

Baris terakhir adalah perhitungan 384 × tarif input ÷ 1.000.000, bukan tarif gambar terpisah. Gambar lebih kecil dapat memakai lebih sedikit token. Teks input dan output model tetap dikenai biaya tambahan.

Resize otomatis menjelaskan harga sekaligus batasnya. Gambar di bawah sekitar 384×384 diperbesar dengan rasio tetap. Gambar lebih besar diperkecil menuju total piksel sekitar 800×800. Karena itu 2000×2000 dan 5000×5000 dapat mencapai batas 384 token yang sama. Tagihan turun, tetapi teks kecil, label grafik padat, dan koordinat layar presisi dapat hilang.

Perbandingan dengan Gemini 3.7 Flash dan Claude Opus 4.8

Ketiga model menyelesaikan versi berbeda dari masalah multimodal. Tabel memakai tarif standar API langsung dan tidak memasukkan tool, penyimpanan cache, retry, atau diskon gateway.

Model Status Input Konteks / output maks. Input tanpa cache Output Kompromi utama
DeepSeek V4 Flash Vision Exp Eksperimental Teks, gambar 1M / 384K $0.22 off-peak; $0.44 peak $0.66 off-peak; $1.32 peak Tarif terendah dan batas 384 token per gambar; resize agresif
Gemini 3.7 Flash GA Teks, gambar, video, audio, PDF 1M / 64K $0.75 hingga 31-12-2026 $3.75 hingga 31-12-2026 Modalitas dan tool lebih luas; harga lebih tinggi dan akan naik
Claude Opus 4.8 GA Teks, gambar, PDF 1M / 128K $5.00 $25.00 Vision resolusi tinggi dan Computer Use matang; biaya premium

Untuk 100K token input tanpa cache dan 10K output, tanpa gambar:

  • DeepSeek sekitar $0.0286 off-peak atau $0.0572 peak.
  • Gemini 3.7 Flash $0.1125 pada harga perkenalan.
  • Claude Opus 4.8 $0.75.

Dalam contoh ini, DeepSeek sekitar 49% lebih murah daripada Gemini saat peak dan 75% saat off-peak. Dibanding Claude, selisihnya 92–96%. Persentase ini membandingkan tagihan, bukan kualitas.

Perbedaan gambar lebih besar, tetapi resolusinya juga berubah. Anthropic mendokumentasikan 1.296 visual token untuk gambar 1000×1000 pada Opus 4.8, sekitar $0.00648. DeepSeek membatasi gambar apa pun pada $0.00016896 peak dan $0.00008448 off-peak, sekitar 38 hingga 77 kali lebih murah. Namun DeepSeek mengecilkan menuju 800×800, sedangkan Opus mempertahankan detail lebih banyak.

Batch 100 gambar satu megapiksel, 100K token teks, dan 10K output berbiaya maksimum $0.0370 off-peak atau $0.0741 peak pada DeepSeek. Dengan 1.296 token per gambar dari dokumentasi Anthropic, tagihan Opus 4.8 sekitar $1.398. Ini bukan pengujian kualitas yang setara; ini menunjukkan bahwa triase visual murah dan inspeksi resolusi tinggi adalah workload berbeda.

Model untuk setiap workload

Uji DeepSeek V4 Flash Vision Exp secara terkendali untuk banyak screenshot, dokumen biasa, grafik, ekstraksi mirip OCR, dan observasi visual dalam loop tool ketika biaya per tugas berhasil lebih penting daripada mempertahankan setiap piksel.

Pilih Gemini 3.7 Flash untuk multimodalitas luas bila satu alur harus menangani gambar, video, audio, dan PDF, atau bergantung pada Search Grounding, eksekusi kode, File Search, URL Context, serta Computer Use preview. Gemini berstatus GA; endpoint visual DeepSeek masih eksperimental.

Pilih Claude Opus 4.8 untuk agent visual resolusi tinggi ketika dokumen padat, elemen UI kecil, Computer Use, dan tugas browser panjang layak membayar lebih. Anthropic mendukung sisi panjang hingga 2.576 piksel dan 4.784 visual token, sehingga perbandingan harga per gambar saja tidak setara.

Arsitektur bertingkat juga mungkin: model murah mengklasifikasi dan mengekstrak lebih dulu, lalu hanya kasus ambigu atau sensitif detail yang naik ke resolusi tinggi. Ukur panggilan kedua, latensi, dan rasio eskalasi; jika hampir semuanya naik, dua model tidak otomatis lebih murah.

Cara mengirim gambar dan batas

Panduan Vision DeepSeek mendukung:

  1. base64 inline untuk file lokal;
  2. URL HTTP atau HTTPS publik;
  3. file_id Files API yang dapat dipakai ulang.
Batas Nilai
Body inline 48 MiB
Satu gambar base64 atau URL 32 MiB
Satu gambar Files API 64 MiB
Gambar per request 600
Total tanpa file_id 64 MiB
Total dengan file_id 200 MiB
Sisi maksimum 8.192 px; 4.096 px untuk 15 gambar atau lebih
URL eksternal 8.192 karakter dan selesai diunduh dalam 60 detik

detail: "low" memaksa 512×512 dan cocok untuk OCR atau klasifikasi detail rendah. high, original, dan saat ini auto mempertahankan sumber sebelum aturan resize normal. Chat Completions hanya menerima gambar dalam pesan user; Responses juga mengizinkannya pada developer dan output tool, tetapi menolak gambar pada system atau assistant.

Contoh Responses API melalui Modelflare

Modelflare kini mencantumkan ID tepat dan route Responses API. Gunakan API key yang ditetapkan ke grup deepseek-stable:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MODELFLARE_API_KEY"],
    base_url="https://modelflare.dev/v1",
)

response = client.responses.create(
    model="deepseek-v4-flash-vision-exp",
    input=[
        {
            "role": "user",
            "content": [
                {
                    "type": "input_text",
                    "text": "Baca dasbor ini. Kembalikan tiga anomali dan bukti visual untuk masing-masing.",
                },
                {
                    "type": "input_image",
                    "image_url": "https://example.com/dashboard.png",
                    "detail": "low",
                },
            ],
        }
    ],
)

print(response.output_text)

Untuk gambar privat, gunakan base64 atau Files API, bukan URL publik. Jangan simpan credential, URL objek privat, atau data pribadi dalam log. Implementasi Responses DeepSeek stateless: previous_response_id, conversations, dan store tidak didukung. Function Calling serta Web Search didukung; Computer Use, Code Interpreter, File Search, dan MCP bawaan diabaikan.

Checklist production

  1. Pin deepseek-v4-flash-vision-exp; jangan anggap deepseek-v4-flash sebagai alias vision.
  2. Buat set aman berisi teks kecil, tabel padat, grafik, screenshot, rotasi, dan konten adversarial.
  3. Bandingkan detail: "low" dengan default berdasarkan keberhasilan, latensi, dan token tertagih.
  4. Validasi Chat Completions, Responses, dan Messages secara terpisah bila memakai beberapa protokol.
  5. Uji output terstruktur, korelasi tool call, streaming, pembatalan, penolakan, dan gambar rusak.
  6. Gunakan ID Files API untuk gambar privat berulang dan tetapkan retensi serta penghapusan.
  7. Catat jumlah, dimensi, token input, cache, output, retry, latensi, route, dan biaya akhir.
  8. Pertahankan fallback GA untuk tugas penting atau sensitif detail sampai lolos ambang traffic nyata.

HTTP 200 hanya membuktikan satu request selesai. Itu tidak membuktikan screenshot dibaca benar, tool diotorisasi, atau biaya per tugas berhasil menurun.

Harga DeepSeek V4 Flash Vision Exp di Modelflare

Model ini sudah tersedia. Dalam pemeriksaan production lanjutan pada 22 Agustus 2026, katalog publik Model & Harga mencantumkan ID tepat deepseek-v4-flash-vision-exp dalam grup deepseek-stable, dengan route OpenAI-compatible Chat Completions dan Responses API.

Katalog memakai harga referensi peak resmi—input $0.44, output $1.32, dan input cache $0.014 per satu juta—kemudian menerapkan multiplier 0.9x dari deepseek-stable:

Grup Modelflare Input Input cache Output Biaya input tanpa cache maksimum untuk gambar 384 token
deepseek-stable $0.396 / 1M $0.0126 / 1M $1.188 / 1M $0.000152064

Dengan tarif ini, 100K token teks tanpa cache dan 10K output berbiaya sekitar $0.05148. Seratus gambar pada batas 384 token, 100K token teks, dan 10K output berbiaya maksimum $0.06669, sebelum retry atau request lain.

Jangan anggap harga grup 0.9x sebagai jadwal off-peak langsung DeepSeek. Modelflare menerapkan multiplier pada harga referensi yang dikonfigurasi dan tidak berganti otomatis mengikuti jam vendor. Grup, route, dan harga dapat berubah; gunakan halaman live dan catatan request selesai sebagai sumber terkini.

Kesimpulan

DeepSeek V4 Flash Vision Exp mengubah ekonomi agent visual: setiap gambar dibatasi 384 token dengan tarif V4 Flash. Untuk triase screenshot, ekstraksi dokumen, pembacaan grafik, dan loop visual bervolume tinggi, selisihnya dapat berarti.

Batas yang sama adalah peringatannya. Resize dapat menghapus detail yang dibutuhkan Computer Use dan dokumen padat; endpoint masih eksperimental; benchmark berasal dari vendor. Evaluasi sebagai pekerja visual murah, bukan bukti bahwa satu model menggantikan seluruh stack multimodal.

Sumber resmi dan riwayat

Sumber primer:

Riwayat:

  • 22 Agustus 2026: publikasi awal. Status, spesifikasi, pemrosesan gambar, batas, protokol, harga waktu, kompetitor, perhitungan, dan katalog Modelflare telah diperiksa.
  • Kemudian pada 22 Agustus 2026: diperbarui setelah ID tepat tersedia di Modelflare. Ditambahkan harga 0.9x deepseek-stable, perhitungan biaya, route yang didukung, dan contoh Responses API melalui Modelflare.