DeepSeek V4 Flash Vision Exp: đánh giá, giá, giới hạn và so sánh
Bài đánh giá đã kiểm chứng về DeepSeek V4 Flash Vision Exp: chi phí token ảnh, giới hạn API, benchmark, so sánh với Gemini 3.7 Flash và Claude Opus 4.8, cùng giá và trạng thái hiện tại trên Modelflare.
DeepSeek phát hành DeepSeek V4 Flash Vision Exp ngày 21 tháng 8 năm 2026. ID API chính xác là deepseek-v4-flash-vision-exp. Mô hình nhận văn bản và hình ảnh, trả văn bản, đồng thời giữ nguyên đơn giá token của V4 Flash.
Điểm cuối cùng mới là câu chuyện chính. DeepSeek thay đổi kích thước từng ảnh trước suy luận và giới hạn ở 384 token đầu vào. Chi phí rất thấp cho vòng lặp agent đọc nhiều ảnh chụp màn hình. Đổi lại, ảnh lớn bị thu về ngân sách xấp xỉ 800×800 pixel. Giá thấp không đồng nghĩa với giữ trọn chi tiết độ phân giải cao.
Đây là mô hình thử nghiệm, không phải lựa chọn thay thế mặc định cho mọi tác vụ thị giác production. Bài viết tách biệt thông số chính thức, benchmark do DeepSeek công bố, phép tính có thể kiểm tra và trạng thái thật trên Modelflare. Các dữ kiện dễ thay đổi được kiểm tra ngày 22 tháng 8 năm 2026.
Tổng quan DeepSeek V4 Flash Vision Exp
| Thuộc tính | Giá trị chính thức |
|---|---|
| Ngày phát hành | 21 tháng 8 năm 2026 |
| Trạng thái | Mô hình API thử nghiệm |
| ID mô hình | deepseek-v4-flash-vision-exp |
| Đầu vào và đầu ra | Văn bản, hình ảnh vào; văn bản ra |
| Cửa sổ ngữ cảnh | 1M token |
| Đầu ra tối đa | 384K token |
| Thinking | Có chế độ thinking và non-thinking; thinking là mặc định trong tài liệu |
| Định dạng ảnh | JPEG, PNG, GIF, WebP |
| Định dạng API | Chat Completions, Responses API, Messages tương thích Anthropic |
| Trần mỗi ảnh | Tối đa 384 token đầu vào sau resize |
| Giới hạn đồng thời | 2.500 |
| FIM Completion | Không hỗ trợ |
DeepSeek chưa công bố tổng tham số, tham số kích hoạt, số expert, corpus huấn luyện hay thay đổi kiến trúc. Mọi con số chính xác không có nguồn sơ cấp đều là suy đoán.
Điểm thực sự thay đổi so với V4 Flash
Theo DeepSeek, Vision Exp ngang V4 Flash chính thức về agent văn bản, suy luận và kiến thức thế giới. Phần mới là hiểu hình ảnh native: ảnh chụp màn hình, ảnh tài liệu, biểu đồ và ảnh thông thường có thể đi thẳng vào cùng vòng lặp tool mà không cần mô hình riêng tạo mô tả trước.
Bảng phát hành công bố các kết quả sau:
| Đánh giá | Điểm DeepSeek công bố |
|---|---|
| Terminal Bench 2.1 | 83.9 |
| NL2Repo | 57.7 |
| DeepSWE | 59.3 |
| DSBench-Hard | 63.6 |
| AutomationBench, bộ công khai | 25.7 |
| ApexBench, Pass@1 | 36.5 |
| Agents' Last Exam | 27.3 |
| Chartography | 64.3 |
| ZeroBench, Pass@5 | 35.0 |
DeepSeek cũng nói năng lực agent đa phương thức gần Claude Opus 4.8. Đây là tuyên bố của nhà cung cấp, không phải kiểm thử độc lập của Modelflare. Các hàng trộn tác vụ văn bản với tác vụ cần thị giác. Ghi chú chính thức nêu DeepSeek Harness chế độ minimal, max effort, top_p=0.95 và temperature=1.0 cho benchmark agent code công khai. Hãy dùng bảng để chọn workload cần replay, không phải để xếp hạng tuyệt đối.
Giá chính thức và chi phí thật của một ảnh
Trang giá DeepSeek niêm yết USD trên một triệu token. Giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC; thời gian còn lại là thấp điểm.
| Hạng mục | Thấp điểm | Cao điểm |
|---|---|---|
| Đầu vào cache | $0.007 | $0.014 |
| Đầu vào không cache | $0.22 | $0.44 |
| Đầu ra | $0.66 | $1.32 |
| Chi phí đầu vào tối đa cho ảnh 384 token | $0.00008448 | $0.00016896 |
Hàng cuối là phép tính 384 × đơn giá đầu vào ÷ 1.000.000, không phải gói phí ảnh riêng. Ảnh nhỏ có thể dùng ít token hơn. Văn bản đầu vào và đầu ra sinh ra vẫn được tính thêm.
Resize tự động giải thích cả giá lẫn giới hạn. Ảnh nhỏ hơn khoảng 384×384 được phóng theo tỷ lệ. Ảnh lớn hơn bị thu về tổng pixel gần 800×800. Vì thế ảnh 2000×2000 và 5000×5000 có thể cùng chạm trần 384 token. Hóa đơn giảm, nhưng chữ nhỏ, nhãn biểu đồ dày và tọa độ màn hình chính xác có thể mất.
So sánh với Gemini 3.7 Flash và Claude Opus 4.8
Ba mô hình giải quyết các phiên bản khác nhau của bài toán đa phương thức. Bảng dùng giá API trực tiếp tiêu chuẩn, không gồm tool, lưu cache, retry hay giảm giá gateway.
| Mô hình | Trạng thái | Đầu vào | Ngữ cảnh / đầu ra tối đa | Đầu vào không cache | Đầu ra | Đánh đổi chính |
|---|---|---|---|---|---|---|
| DeepSeek V4 Flash Vision Exp | Thử nghiệm | Văn bản, ảnh | 1M / 384K | $0.22 thấp điểm; $0.44 cao điểm | $0.66 thấp điểm; $1.32 cao điểm | Giá thấp nhất, trần 384 token mỗi ảnh; resize mạnh |
| Gemini 3.7 Flash | GA | Văn bản, ảnh, video, âm thanh, PDF | 1M / 64K | $0.75 đến 31-12-2026 | $3.75 đến 31-12-2026 | Phương thức và tool rộng hơn; giá cao hơn và sẽ tăng |
| Claude Opus 4.8 | GA | Văn bản, ảnh, PDF | 1M / 128K | $5.00 | $25.00 | Thị giác độ phân giải cao, Computer Use trưởng thành; giá premium |
Với 100K token đầu vào không cache và 10K đầu ra, không có ảnh:
- DeepSeek khoảng $0.0286 thấp điểm hoặc $0.0572 cao điểm.
- Gemini 3.7 Flash là $0.1125 theo giá giới thiệu.
- Claude Opus 4.8 là $0.75.
Trong ví dụ này DeepSeek rẻ hơn Gemini khoảng 49% vào cao điểm và 75% vào thấp điểm. So với Claude, mức chênh là 92–96%. Đây là so sánh hóa đơn, không phải chất lượng.
Với ảnh, chênh lệch lớn hơn nhưng độ phân giải cũng khác. Anthropic ghi 1.296 visual token cho ảnh 1000×1000 trên Opus 4.8, khoảng $0.00648. DeepSeek giới hạn mọi ảnh ở $0.00016896 cao điểm hoặc $0.00008448 thấp điểm, rẻ hơn khoảng 38 đến 77 lần. Tuy nhiên DeepSeek thu ảnh về gần 800×800, còn Opus giữ nhiều chi tiết hơn.
Một batch gồm 100 ảnh một megapixel, 100K token văn bản và 10K đầu ra có chi phí tối đa $0.0370 thấp điểm hoặc $0.0741 cao điểm trên DeepSeek. Theo 1.296 token mỗi ảnh trong tài liệu Anthropic, Opus 4.8 sẽ tốn $1.398. Đây không phải thử nghiệm chất lượng tương đương; nó cho thấy phân loại thị giác giá rẻ và kiểm tra độ phân giải cao là hai workload khác nhau.
Mô hình phù hợp với từng workload
Thử DeepSeek V4 Flash Vision Exp có kiểm soát cho nhiều screenshot, tài liệu thông thường, biểu đồ, trích xuất kiểu OCR và quan sát hình ảnh trong vòng lặp tool khi chi phí mỗi tác vụ thành công quan trọng hơn việc giữ từng pixel.
Chọn Gemini 3.7 Flash cho đa phương thức rộng khi một luồng cần xử lý ảnh, video, âm thanh, PDF hoặc phụ thuộc Search Grounding, thực thi code, File Search, URL Context và Computer Use preview. Gemini là GA; endpoint vision của DeepSeek là thử nghiệm.
Chọn Claude Opus 4.8 cho agent hình ảnh độ phân giải cao khi tài liệu dày, phần tử UI nhỏ, Computer Use và tác vụ trình duyệt dài đáng với giá cao. Anthropic hỗ trợ cạnh dài 2.576 pixel và tối đa 4.784 visual token, vì vậy chỉ so giá mỗi ảnh không phải cùng điều kiện.
Có thể routing theo tầng: mô hình rẻ phân loại và trích xuất trước, chỉ trường hợp mơ hồ hoặc cần chi tiết mới chuyển lên độ phân giải cao. Cần đo lần gọi thứ hai, độ trễ và tỷ lệ nâng cấp; nếu hầu hết đều nâng cấp, hai mô hình không tự động rẻ hơn.
Cách gửi ảnh và giới hạn
Hướng dẫn Vision của DeepSeek hỗ trợ:
- base64 inline cho tệp cục bộ;
- URL HTTP hoặc HTTPS công khai;
file_idFiles API tái sử dụng.
| Giới hạn | Giá trị |
|---|---|
| Body inline | 48 MiB |
| Một ảnh base64 hoặc URL | 32 MiB |
| Một ảnh Files API | 64 MiB |
| Ảnh mỗi request | 600 |
Tổng không có file_id |
64 MiB |
Tổng có file_id |
200 MiB |
| Cạnh tối đa | 8.192 px; 4.096 px khi có từ 15 ảnh |
| URL ngoài | 8.192 ký tự và tải xong trong 60 giây |
detail: "low" ép về 512×512, phù hợp OCR hoặc phân loại ít chi tiết. high, original và hiện tại auto giữ ảnh gốc trước quy tắc resize thường. Chat Completions chỉ nhận ảnh trong user; Responses cũng cho phép trong developer và output tool, nhưng từ chối ảnh trong system hay assistant.
Ví dụ Responses API qua Modelflare
Modelflare hiện đã niêm yết ID chính xác và route Responses API. Hãy dùng API key thuộc nhóm deepseek-stable:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MODELFLARE_API_KEY"],
base_url="https://modelflare.dev/v1",
)
response = client.responses.create(
model="deepseek-v4-flash-vision-exp",
input=[
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "Đọc bảng điều khiển này. Trả về ba điểm bất thường và bằng chứng nhìn thấy cho từng điểm.",
},
{
"type": "input_image",
"image_url": "https://example.com/dashboard.png",
"detail": "low",
},
],
}
],
)
print(response.output_text)
Với ảnh riêng tư, dùng base64 hoặc Files API thay vì URL công khai. Không ghi credential, URL đối tượng riêng hay dữ liệu cá nhân vào log. Responses của DeepSeek là stateless: không hỗ trợ previous_response_id, conversation hay store. Function Calling và Web Search hoạt động; Computer Use, Code Interpreter, File Search và MCP tích hợp bị bỏ qua.
Checklist production
- Pin đúng
deepseek-v4-flash-vision-exp; không xemdeepseek-v4-flashlà alias vision. - Tạo bộ dữ liệu an toàn với chữ nhỏ, bảng dày, biểu đồ, screenshot, ảnh xoay và nội dung adversarial.
- So
detail: "low"với mặc định theo tỷ lệ thành công, độ trễ và token tính phí. - Kiểm tra riêng Chat Completions, Responses và Messages nếu dùng nhiều protocol.
- Thử output có cấu trúc, liên kết tool call, streaming, hủy, từ chối và ảnh lỗi.
- Dùng Files API ID cho ảnh riêng lặp lại và định nghĩa thời gian lưu cùng quy trình xóa.
- Ghi số lượng, kích thước, token đầu vào, cache, đầu ra, retry, độ trễ, route và phí cuối.
- Giữ fallback GA cho tác vụ quan trọng hoặc nhạy chi tiết đến khi đạt ngưỡng traffic thật.
HTTP 200 chỉ chứng minh một request đã hoàn tất. Nó không chứng minh screenshot được đọc đúng, tool được cho phép hay chi phí mỗi tác vụ thành công đã giảm.
Giá DeepSeek V4 Flash Vision Exp trên Modelflare
Mô hình hiện đã khả dụng. Trong lần kiểm tra production sau đó ngày 22 tháng 8 năm 2026, danh mục công khai Mô hình và giá đã có ID chính xác deepseek-v4-flash-vision-exp trong nhóm deepseek-stable, cùng route OpenAI-compatible Chat Completions và Responses API.
Danh mục dùng giá peak chính thức làm tham chiếu—input $0.44, output $1.32 và input cache $0.014 trên một triệu—rồi áp dụng hệ số 0.9x của deepseek-stable:
| Nhóm Modelflare | Input | Input cache | Output | Chi phí input không cache tối đa cho ảnh 384 token |
|---|---|---|---|---|
deepseek-stable |
$0.396 / 1M | $0.0126 / 1M | $1.188 / 1M | $0.000152064 |
Theo mức này, 100K token văn bản không cache và 10K output tốn khoảng $0.05148. Một trăm ảnh ở trần 384 token, 100K token văn bản và 10K output tốn tối đa $0.06669, chưa gồm retry hay request khác.
Không nên xem giá nhóm 0.9x là lịch off-peak trực tiếp của DeepSeek. Modelflare áp dụng hệ số vào giá tham chiếu đã cấu hình và không tự đổi theo khung giờ của nhà cung cấp. Nhóm, route và giá có thể thay đổi; hãy dựa vào trang live và bản ghi request hoàn tất.
Kết luận
DeepSeek V4 Flash Vision Exp thay đổi kinh tế của agent thị giác: mỗi ảnh tối đa 384 token với đơn giá V4 Flash. Với phân loại screenshot, trích xuất tài liệu, đọc biểu đồ và vòng lặp thị giác khối lượng lớn, khác biệt có thể đáng kể.
Chính trần 384 token cũng là cảnh báo. Resize có thể xóa chi tiết mà Computer Use và tài liệu dày cần; endpoint vẫn thử nghiệm; benchmark do nhà cung cấp công bố. Hãy đánh giá nó như một worker thị giác giá thấp, không phải bằng chứng một mô hình thay toàn bộ stack đa phương thức.
Nguồn chính thức và lịch sử
Nguồn sơ cấp:
- Nhật ký thay đổi DeepSeek
- Hướng dẫn Vision DeepSeek
- Mô hình và giá DeepSeek
- Responses API DeepSeek
- Google: Gemini 3.7 Flash
- Google: giá Gemini API
- Anthropic: tổng quan mô hình Claude
- Anthropic: visual token và giới hạn ảnh
Lịch sử:
- 22 tháng 8 năm 2026: xuất bản lần đầu. Đã kiểm tra trạng thái, thông số, xử lý ảnh, giới hạn, protocol, giá theo giờ, đối thủ, phép tính và danh mục Modelflare.
- Sau đó trong ngày 22 tháng 8 năm 2026: cập nhật khi ID chính xác đã lên Modelflare. Bổ sung giá 0.9x của
deepseek-stable, phép tính, route hỗ trợ và ví dụ Responses API qua Modelflare.