DeepSeek V4 Flash: thông số và cấu hình trên Modelflare
Hướng dẫn DeepSeek-V4-Flash-0731: MoE 284B/13B, ngữ cảnh 1M tokens, kiểm soát suy luận, giá Modelflare hiện tại và cấu hình Chat Completions cùng Responses.
Ngày 31 tháng 7 năm 2026, DeepSeek đã cập nhật deepseek-v4-flash lên bản beta công khai chính thức của API, DeepSeek-V4-Flash-0731. ID dùng khi gọi mô hình không thay đổi. Đây không chỉ là đổi tên: phiên bản mới giữ nguyên kiến trúc và quy mô của bản preview, áp dụng hậu huấn luyện mới để cải thiện Coding Agent và khả năng dùng công cụ, đồng thời hỗ trợ Responses API theo cách native.
Với workload văn bản cần cân bằng suy luận, ngữ cảnh dài, throughput và chi phí, V4 Flash hướng đến lưu lượng lớn và tác vụ Agent hằng ngày nhiều hơn V4 Pro. Bài viết này tách biệt ba lớp thông tin dễ bị trộn lẫn: thông số do DeepSeek công bố, giao thức và mức giá hiện có trên Modelflare, cùng những hành vi vẫn cần kiểm chứng bằng workload thực tế của bạn.
Thông số chính
| Hạng mục | DeepSeek V4 Flash |
|---|---|
| ID mô hình trên Modelflare | deepseek-v4-flash |
| Phiên bản API chính thức hiện tại | DeepSeek-V4-Flash-0731 |
| Kiến trúc | Mixture-of-Experts (MoE) |
| Tổng số tham số | 284B |
| Tham số được kích hoạt trên mỗi Token | 13B |
| Độ dài ngữ cảnh | 1M tokens |
| Đầu ra tối đa | 384K tokens |
| Chế độ suy luận | Bật mặc định; effort mặc định là high |
| Mức suy luận | low, high hoặc max; xhigh hiện được ánh xạ thành high |
| Tính năng API chính thức | JSON Output, Tool Calls, Responses API và Chat Prefix Completion; FIM chỉ hỗ trợ khi tắt suy luận |
| Đầu vào và đầu ra chính | Văn bản vào, văn bản ra; không nên suy diễn rằng mô hình hỗ trợ ảnh |
Điểm đáng chú ý không chỉ là tổng 284B tham số, mà là sự kết hợp giữa 13B tham số được kích hoạt và ngữ cảnh 1M tokens. Routing MoE chỉ kích hoạt một phần mô hình cho mỗi Token, nhằm giữ dung lượng mô hình trong khi kiểm soát chi phí suy luận. Báo cáo kỹ thuật của DeepSeek cũng mô tả các thay đổi Attention dành cho hiệu quả ngữ cảnh dài. Việc thiết kế này có thực sự giảm độ trễ hay không vẫn phụ thuộc vào độ dài prompt, mức suy luận, tải upstream và kích thước đầu ra.
Bản cập nhật 0731 thay đổi gì
DeepSeek mô tả 0731 là bản hậu huấn luyện mới, không thay đổi kiến trúc hay quy mô mô hình. Kết quả Agent được công bố gồm 82,7 điểm trên Terminal Bench 2.1 và 70,3 điểm trên Toolathlon Verified. Hãng cho biết năng lực Agent đã vượt đáng kể V4 Pro Preview trước đó.
Những con số này cho thấy định hướng của bản phát hành, không phải SLA sản xuất. Đánh giá Code Agent công khai của DeepSeek dùng một Harness cụ thể, effort max, top_p=0.95 và temperature=1.0; một số bộ dữ liệu cũng là dữ liệu nội bộ. Để lựa chọn có ý nghĩa, hãy cố định ID mô hình, client, công cụ, timeout và tập tác vụ, sau đó ghi nhận tỷ lệ thành công, thời gian đến đầu ra đầu tiên, tổng độ trễ, lượng Token và số vòng chỉnh sửa.
Chọn tham số suy luận
V4 Flash bật chế độ suy luận theo mặc định với effort high. Có thể bắt đầu bằng chính sách sau:
- Tóm tắt, phân loại và chuyển đổi định dạng: bắt đầu với
low, rồi đo chất lượng. - Thay đổi mã, phân tích phức tạp và dùng công cụ nhiều bước: bắt đầu với
high. - Một số ít tác vụ khó: đánh giá
maxvới ngân sách rõ ràng cho độ trễ và Token suy luận. - Chỉ cần trả lời nhanh, trực tiếp: đặt
thinking.type=disabledthay vì phụ thuộc vào alias cũdeepseek-chatđã ngừng dùng.
Trong chế độ suy luận, temperature, top_p, presence_penalty và frequency_penalty không có tác dụng dù API vẫn chấp nhận. Hội thoại nhiều lượt có công cụ cũng phải giữ và gửi lại reasoning_content của lượt chứa tool call; nếu thiếu, upstream có thể trả về 400. Nếu client không thể duy trì trường này đúng cách, hãy kiểm tra tuyến cơ bản không dùng công cụ trước.
Khả năng cung cấp hiện tại trên Modelflare
Tính đến ngày 4 tháng 8 năm 2026, danh mục công khai của Modelflare liệt kê deepseek-v4-flash cho Chat Completions và Responses. DeepSeek cũng cung cấp định dạng tương thích Anthropic ở upstream, nhưng điều đó không có nghĩa Modelflare hiện mở cùng tuyến cho mô hình này. Hãy dùng trang Mô hình và giá làm nguồn cập nhật về giao thức đang hỗ trợ.
Mức giá công khai hiện tại được trình bày dưới đây, đơn vị USD trên 1 triệu tokens:
| Nhóm khả dụng | Đầu vào | Đầu ra | Đầu vào trúng cache | Ghi chú |
|---|---|---|---|---|
deepseek-award |
$0.105 | $0.21 | $0.0021 | Chỉ dành cho API Key đủ điều kiện dùng nhóm này |
deepseek-stable |
$0.15 | $0.30 | $0.003 | Nhóm ổn định |
Giá, điều kiện dùng nhóm và giao thức hỗ trợ có thể thay đổi. Không nên hard-code snapshot này như một hợp đồng tính phí lâu dài. Trước khi ra mắt, hãy kiểm tra lại danh mục live và đối chiếu nhóm, Token cùng chi phí thực tế trong log sử dụng.
Cấu hình Chat Completions
Trước tiên, lưu Modelflare API Key vào biến môi trường:
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
Sau đó gọi Base URL công khai tiêu chuẩn:
curl -N -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "You are a careful coding assistant."},
{"role": "user", "content": "Review this migration plan and list the rollback risks."}
],
"thinking": {"type": "enabled"},
"reasoning_effort": "high",
"stream": true
}'
Nếu OpenAI SDK không cung cấp trực tiếp thinking, hãy truyền qua extra_body. Các trường riêng của mô hình phải giữ nguyên dạng JSON gốc: không đổi tên và không làm mất giá trị false được chỉ định rõ.
Cấu hình Responses API
V4 Flash cũng có thể được gọi qua endpoint Responses của Modelflare:
curl -N -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-flash",
"input": "Inspect the proposed deployment sequence and identify unsafe assumptions.",
"reasoning": {"effort": "high"},
"stream": true
}'
Chat Completions và Responses có wire contract khác nhau. Việc một mô hình xuất hiện trên cả hai endpoint không chứng minh rằng kiểu sự kiện, trạng thái công cụ, cấu trúc lỗi hay cơ chế tiếp tục giống nhau. Trước khi đưa vào sản xuất, hãy kiểm tra riêng request không streaming, có streaming và có tool call.
Cấu hình nền tảng được đề xuất
- Tạo Modelflare API Key riêng cho từng ứng dụng và chọn nhóm chính thực sự có
deepseek-v4-flash. - Chỉ thêm fallback theo thứ tự khi fallback đó hỗ trợ cùng mô hình và giao thức.
- Bắt đầu tác vụ văn bản thông thường với
lowhoặc không suy luận, còn tác vụ Agent phức tạp vớihigh. - Đặt timeout của client cho suy luận dài và đầu ra dài, không dựa trên thời gian của một health prompt ngắn.
- Khi dùng công cụ, giữ nguyên toàn bộ thông điệp assistant, đặc biệt là
reasoning_contentvàtool_calls. - Trước khi ra mắt, đo tỷ lệ thành công, đầu ra đầu tiên, tổng độ trễ, Token đầu ra, nhóm được chọn và chi phí mỗi request trên tác vụ thực.
Trường hợp phù hợp và trường hợp cần so sánh
V4 Flash phù hợp với hỗ trợ coding thường xuyên, phân tích tài liệu dài, Agent dùng công cụ, xử lý văn bản hàng loạt và ứng dụng cần cân bằng năng lực với chi phí. Với bài toán dựa nhiều vào kiến thức có độ khó cao nhất hoặc tác vụ tự chủ dài hạn, hãy so sánh với V4 Pro hay một mô hình flagship khác. Nếu cần đầu vào ảnh, hãy chọn mô hình có hợp đồng đa phương thức được công bố rõ và đã được xác minh trên Modelflare.
Nguồn và ngày xác minh
- Nhật ký thay đổi API DeepSeek: trạng thái bản 0731 và đánh giá Agent.
- Mô hình và giá DeepSeek: ngữ cảnh, đầu ra tối đa và tính năng API chính thức.
- Model card DeepSeek V4 Flash: kiến trúc, quy mô tham số và báo cáo kỹ thuật.
- Hướng dẫn chế độ suy luận DeepSeek: mức effort, tham số sampling không có tác dụng và yêu cầu gửi lại lượt dùng công cụ.
- Mô hình và giá Modelflare: nhóm, giao thức và mức giá nền tảng hiện tại.
Bài viết được xác minh ngày 4 tháng 8 năm 2026. Snapshot mô hình, giá và hỗ trợ giao thức có thể thay đổi; khi triển khai sản xuất, hãy dùng tài liệu chính thức và danh mục live của Modelflare tại thời điểm gọi.