Đánh giá DeepSeek V4 Pro GA: benchmark, giá API và phân tích chi phí

Bài đánh giá DeepSeek V4 Pro GA đã kiểm chứng, gồm benchmark agent, ngữ cảnh 1M, tương thích API, giá hiện tại và theo khung giờ, ví dụ chi phí cùng trạng thái trên Modelflare.

DeepSeek phát hành chính thức DeepSeek-V4-Pro GA vào ngày 13 tháng 8 năm 2026. API được lưu trữ hiện nhận diện phiên bản là DeepSeek-V4-Pro-0813, còn ID model API ổn định vẫn là deepseek-v4-pro. Model có cửa sổ ngữ cảnh một triệu token, tối đa 384.000 token đầu ra, hỗ trợ native Responses API và một biểu giá mới bắt đầu không lâu sau ngày ra mắt.

Kết luận của chúng tôi: V4 Pro đáng được đánh giá trong môi trường production cho bài toán lập trình khó, công việc ở quy mô repository và Agent chạy dài. DeepSeek công bố mức cải thiện nhất quán so với V4 Flash trên các benchmark Agent khó, nhưng Pro không phải lựa chọn tiết kiệm mặc định cho mọi request. Khi biểu giá mới bắt đầu, giá input và output chính thức của Pro xấp xỉ ba lần Flash, còn giới hạn concurrency theo tài khoản chỉ bằng một phần năm.

Bài viết phân tách dữ kiện API hiện tại, kết quả benchmark do DeepSeek công bố, phân tích của chúng tôi và trạng thái cung cấp hiện tại trên Modelflare. Chúng tôi không tái lập độc lập điểm benchmark của DeepSeek. Các thông số và mức giá có thể thay đổi được kiểm tra ngày 14 tháng 8 năm 2026.

Đánh giá DeepSeek V4 Pro: ngữ cảnh một triệu token và điều phối công cụ Agent

Tổng quan DeepSeek V4 Pro GA

Hạng mục Thông tin chính thức hiện tại
Ngày GA 13 tháng 8 năm 2026
ID model API ổn định deepseek-v4-pro
Phiên bản model được lưu trữ DeepSeek-V4-Pro-0813
Cửa sổ ngữ cảnh 1.000.000 token
Đầu ra tối đa 384.000 token
Chế độ thinking Được hỗ trợ và bật mặc định
Reasoning effort Thông báo GA: low, high, max; xem lưu ý tương thích bên dưới
Định dạng API chính thức Chat Completions, Responses API, API tương thích Anthropic Messages
Tính năng được mô tả Đầu ra JSON, tool call, cache ngữ cảnh tự động, prefix completion, FIM ở chế độ không thinking
Concurrency tài khoản chính thức 500 request đồng thời

Một triệu token là trần dung lượng chứ không phải bảo đảm chất lượng. Độ chính xác retrieval, độ trễ, khả năng tái sử dụng cache, độ dài output, timeout của client và lượng ngữ cảnh không liên quan vẫn quyết định một request dài có hữu ích hay không.

Những thay đổi so với bản preview V4

Bản preview tháng 4 giới thiệu dòng V4 và kiến trúc open-weight. Bản cập nhật GA tháng 8 là cập nhật cho sản phẩm được lưu trữ với ba thay đổi thực tế:

  • DeepSeek cho biết hiệu năng Agent đã tăng đáng kể, đặc biệt trong tác vụ lập trình và tự động hóa giống production;
  • API chính thức giờ hỗ trợ native định dạng OpenAI Responses và có khả năng tương thích hướng đến Codex;
  • DeepSeek công bố giá API giờ cao điểm và thấp điểm, có hiệu lực lúc 16:00 UTC ngày 16 tháng 8 năm 2026.

Model ổn định trong request vẫn là deepseek-v4-pro, vì vậy client hiện có không cần chuyển đổi tên model. Trang giá hiển thị phiên bản hosted hiện tại là DeepSeek-V4-Pro-0813.

Không nên tự động xem checkpoint preview có thể tải xuống là giống từng bit với bản GA được lưu trữ. Model card V4 công khai của DeepSeek vẫn mô tả dòng preview và không gắn nhãn checkpoint là 0813. Do đó, triển khai self-hosted và API chính thức cần được đánh giá riêng.

Phân tích benchmark: Pro vượt Flash ở đâu

DeepSeek đã công bố các kết quả sau cho V4 Pro GA. Cột so sánh sử dụng giá trị từ bản cập nhật V4 Flash ngày 31 tháng 7 của DeepSeek, còn delta là chênh lệch điểm tuyệt đối.

Benchmark V4 Pro GA V4 Flash 0731 Chênh lệch Pro
Terminal Bench 2.1 87.9 82.7 +5.2
NL2Repo 61.5 54.2 +7.3
Cybergym 83.3 76.7 +6.6
DeepSWE 62.7 54.4 +8.3
Toolathlon-Verified 74.1 70.3 +3.8
Agents' Last Exam 25.7 25.2 +0.5
AutomationBench (Public) 31.8 25.1 +6.7
DSBench-FullStack 71.1 68.7 +2.4
DSBench-Hard 67.2 59.6 +7.6

DeepSeek cũng báo cáo điểm HLE 42.7 khi không dùng tool và 60.0 khi có tool cho V4 Pro GA.

Mẫu hình tổng thể quan trọng hơn một điểm số nổi bật. Mức tăng tuyệt đối lớn nhất xuất hiện ở công việc repository, bài toán kỹ thuật phần mềm khó và tự động hóa. Khoảng cách nhỏ hơn nhiều trên Agents' Last Exam và ở mức vừa phải với việc sử dụng tool rộng. Điều này ủng hộ chiến lược routing: dành Pro cho tác vụ mà xác suất hoàn thành cao hơn có giá trị hơn hiệu quả token thuần túy, còn Flash xử lý phân loại, tóm tắt, triage và sub-Agent đơn giản với khối lượng lớn.

Đây là kết quả do nhà cung cấp báo cáo, không phải benchmark độc lập của Modelflare. Harness, quyền tool, reasoning effort, cài đặt sampling, giới hạn thời gian và quy tắc chấm điểm có thể làm thay đổi đáng kể kết quả Agent. Quyết định production nên phát lại cùng một bộ tác vụ an toàn về riêng tư trên cả hai model và đo chi phí theo tác vụ thành công, không chỉ token hay thứ hạng benchmark.

Kiến trúc và tuyên bố ngữ cảnh 1M

Model card V4 công khai của DeepSeek mô tả dòng Pro là model Mixture-of-Experts với tổng cộng 1,6 nghìn tỷ tham số và 49 tỷ tham số được kích hoạt. Tài liệu nêu thiết kế attention lai kết hợp Compressed Sparse Attention với Heavily Compressed Attention, Manifold-Constrained Hyper-Connections, optimizer Muon và quá trình pretraining trên hơn 32 nghìn tỷ token.

DeepSeek cho biết ở ngữ cảnh 1M token, V4 Pro dùng 27% FLOPs suy luận đơn token và 10% KV cache mà V3.2 cần. Đây là tuyên bố cấp kiến trúc từ đơn vị phát hành model; điều đó không có nghĩa request một triệu token sẽ nhanh, rẻ hoặc chính xác như nhau tại mọi vị trí.

Với công việc ngữ cảnh dài thực tế:

  • đặt chỉ dẫn ổn định và tài liệu repository có thể tái sử dụng ở đầu để prefix cache phát huy tác dụng;
  • theo dõi prompt_cache_hit_tokensprompt_cache_miss_tokens thay vì giả định đã hit cache;
  • nén tool trace cũ và file trùng lặp trước khi chúng chiếm ngân sách ngữ cảnh;
  • kiểm thử retrieval ở đúng độ sâu tài liệu và vị trí token mà ứng dụng sử dụng;
  • dành chỗ cho reasoning, kết quả tool và câu trả lời cuối thay vì lấp đầy cả cửa sổ bằng input.

Cache đĩa của DeepSeek hoạt động tự động theo best effort. Nó khớp prefix có thể tái sử dụng, có thể mất vài giây để tạo và thường bị xóa sau vài giờ đến vài ngày không hoạt động. Một request lặp lại nhưng thay đổi nội dung ở phần đầu có thể mất hầu hết lợi ích kinh tế.

Tương thích API: native không đồng nghĩa giống hệt

Bề mặt Hỗ trợ chính thức của DeepSeek Giới hạn quan trọng
Chat Completions Hỗ trợ Vòng lặp tool có thinking phải giữ reasoning_content
Responses API Hỗ trợ Stateless; nhiều field OpenAI bị bỏ qua hoặc không được hỗ trợ
API tương thích Anthropic Hỗ trợ Một số field bị bỏ qua; không hỗ trợ nội dung hình ảnh và tài liệu
FIM completion Beta Chỉ ở chế độ không thinking và dùng endpoint beta

Lớp Responses chính thức hỗ trợ văn bản, function call, tìm kiếm web phía server và custom tool apply_patch dùng cho tương thích Codex. Nó không hỗ trợ previous_response_id, conversation, response được lưu, chế độ background, service_tier hay prompt cache key do OpenAI quản lý. Field không hỗ trợ thường bị bỏ qua mà không báo lỗi, vì vậy HTTP 200 không chứng minh tương đương về ngữ nghĩa. Client Responses phải tự mang lịch sử và kiểm tra loại event thay vì chờ dấu [DONE] kiểu Chat Completions.

Còn một giới hạn quan trọng trong vòng lặp tool Chat Completions: khi dùng đồng thời chế độ thinking và tool, reasoning_content của assistant phải được gửi lại trong request tiếp theo. DeepSeek ghi rõ sẽ có lỗi 400 nếu mất field này. Gateway và adapter SDK cần được kiểm thử bằng một vòng lặp tool nhiều lượt hoàn chỉnh, không chỉ một prompt văn bản.

Thông báo GA nói reasoning effort low, high và max đều khả dụng. Tuy nhiên, hướng dẫn thinking chi tiết và tài liệu API hiện tại cho biết highmax là giá trị thực tế; lowmedium được ánh xạ sang high, còn xhigh sang max. Cho đến khi DeepSeek thống nhất tài liệu hoặc kiểm thử trực tiếp chứng minh hành vi low riêng biệt, đừng lập ngân sách dựa trên giả định giảm chi phí nhờ effort thấp.

Giá API chính thức của DeepSeek: hiện tại và sắp tới

Tất cả mức giá dưới đây là USD trên một triệu token. Giá cố định hiện tại vẫn được niêm yết cho đến khi biểu giá mới có hiệu lực lúc 16:00 UTC ngày 16 tháng 8 năm 2026, tức 00:00 ngày 17 tháng 8 theo giờ Bắc Kinh.

Giai đoạn giá Input cache hit Input cache miss Output
Giá hiện tại, kiểm tra ngày 14 tháng 8 $0.003625 $0.435 $0.87
Giá thấp điểm mới $0.022 $0.66 $1.98
Giá cao điểm mới $0.044 $1.32 $3.96

Trong biểu giá sắp tới, giờ cao điểm là 01:00–04:00 và 06:00–10:00 UTC. Tất cả giờ còn lại là thấp điểm, với giá bằng một nửa mức cao điểm.

Quá trình chuyển đổi không phải phép chia 2× đơn giản theo giờ từ giá hiện nay. So với giá cố định hiện tại, giá thấp điểm mới cao hơn khoảng 6,07× với input cache, 1,52× với input không cache và 2,28× với output. Giá cao điểm gấp đôi các mức thấp điểm mới đó. Tái sử dụng cache vẫn có giá trị, nhưng giá input cache cực thấp ở thời kỳ ra mắt thay đổi nhiều nhất.

Ví dụ tính chi phí

Công thức chỉ tính token là:

chi_phí = token_cache_hit × giá_cache_hit + token_cache_miss × giá_cache_miss + token_output × giá_output

Các ví dụ sau không gồm chi phí riêng cho mạng, thuê bao, dịch vụ tool hoặc thanh toán. Agent dùng tool có thể tạo nhiều lần gọi model, vì vậy hãy tính toàn bộ tác vụ thay vì chỉ request đầu tiên.

Khối lượng công việc DeepSeek hiện tại Thấp điểm mới Cao điểm mới Modelflare ngày 14 tháng 8
100K input không cache + 10K output $0.0522 $0.0858 $0.1716 $0.0540
90K cache + 10K input không cache + 10K output $0.0134 $0.0284 $0.0568 $0.0138
900K cache + 100K input không cache + 20K output $0.0642 $0.1254 $0.2508 $0.0663

Hàng thứ hai và thứ ba cho thấy vì sao cấu trúc prompt quan trọng. Một prefix lớn và ổn định có thể giảm mạnh chi phí, nhưng chỉ sau khi thực sự hit cache. Các field usage của API là nguồn dữ liệu chuẩn để đối soát.

DeepSeek V4 Pro so với V4 Flash: lựa chọn giá-hiệu năng

Theo giá chính thức hiện tại, Pro đắt khoảng 3,11× Flash với input không cache và output, nhưng chỉ 1,29× với input cache. Sau khi biểu giá mới bắt đầu, Pro đắt 3× Flash cho input không cache và output, khoảng 3,14× cho input cache. Concurrency tài khoản chính thức là 500 với Pro so với 2.500 của Flash.

Từ đó có thể rút ra quy tắc vận hành rõ ràng:

  • chọn V4 Pro cho thay đổi repository khó, Agent chạy dài, phân tích bảo mật, phối hợp tool phức tạp và tác vụ mà một lần thất bại gây tốn kém;
  • chọn V4 Flash cho Agent đơn giản, worker song song, tiền xử lý, trích xuất, tóm tắt và lưu lượng nhạy với throughput;
  • routing theo độ khó quan sát được và chi phí trên tác vụ thành công thay vì biến Pro thành lựa chọn mặc định cho mọi việc;
  • đánh giá lại sau chuyển đổi giá vì kinh tế của workload Pro có cache thay đổi đáng kể.

Giá token cao gấp 3 vẫn có thể rẻ hơn nếu Pro tránh được retry hoặc sửa chữa thủ công. Ngược lại, lợi thế năm điểm benchmark không đủ để gửi công việc xác định hoặc đơn giản tới model lớn hơn. Hãy đo tỷ lệ hoàn thành, tổng thời gian, tổng token qua các lần retry, lỗi tool và thời gian reviewer sửa kết quả.

Giá và trạng thái DeepSeek V4 Pro trên Modelflare

Danh mục giá trực tiếp của Modelflare được kiểm tra ngày 14 tháng 8 năm 2026. Danh mục liệt kê deepseek-v4-pro và alias cố định deepseek-v4-pro-0813 trong nhóm deepseek-stable với giá cơ bản sau cho mỗi một triệu token:

Ảnh chụp giá Modelflare Giá
Input cache hit $0.0037
Input cache miss $0.45
Output $0.90

Các mức này cao hơn khoảng 2,07% so với giá input cache hiện tại của DeepSeek và 3,45% so với giá input không cache cùng output hiện tại. Bài viết không hứa rằng giá Modelflare sẽ giữ nguyên sau khi DeepSeek chuyển sang cao điểm/thấp điểm. Luôn dùng trang giá trực tiếp và bản ghi usage của request để ra quyết định production.

Metadata danh mục công khai hiện đánh dấu route Modelflare là Chat Completions tương thích OpenAI. Dù endpoint riêng của DeepSeek giờ hỗ trợ Responses và định dạng Anthropic, khả năng hỗ trợ của nhà cung cấp không tự động làm mọi route gateway tương thích. Hãy dùng đúng protocol được hiển thị trên trang giá trực tiếp.

export MODELFLARE_API_KEY="your-api-key"

curl https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer ${MODELFLARE_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "Review this migration plan and identify rollback risks."}
    ],
    "thinking": {"type": "enabled"},
    "reasoning_effort": "high"
  }'

Để thiết lập client nói chung, xem hướng dẫn API tương thích OpenAI. Để hiểu đối soát và token cache, xem theo dõi chi phí API AI.

Checklist đánh giá production

  1. Ghim deepseek-v4-pro-0813 trong quá trình đánh giá nếu route cung cấp, sau đó quyết định alias ổn định có phù hợp với kiểm soát thay đổi hay không.
  2. Phát lại một bộ tác vụ cố định, an toàn về riêng tư trên Pro và Flash với cùng tool, quyền, timeout và quy tắc dừng.
  3. Kiểm thử highmax; xem low tương đương high cho đến khi hành vi API hiện tại chứng minh điều ngược lại.
  4. Hoàn tất vòng lặp tool nhiều lượt và xác minh reasoning_content, ID tool, đối số và kết quả đi qua mọi adapter.
  5. Với client Responses, kiểm thử rõ từng field bắt buộc vì parameter không hỗ trợ có thể bị bỏ qua mà không cảnh báo.
  6. Ghi lại input cache, input không cache, output, token reasoning, độ trễ, retry và chi phí trên tác vụ thành công.
  7. Kiểm thử prompt dài ở độ sâu thực tế; không suy ra chất lượng retrieval một triệu token từ request ngắn.
  8. Load test dưới giới hạn concurrency của tài khoản và xử lý response 429 bằng backoff có giới hạn.
  9. Mô hình hóa cả giá hiện tại và biểu giá cao/thấp điểm ngày 16/17 tháng 8 trước khi duyệt ngân sách.
  10. Giữ Flash hoặc model khác làm fallback để bảo đảm khả dụng và kiểm soát chi phí; xem routing API AI đáng tin cậy.

Kết luận cuối

DeepSeek V4 Pro GA là một bản phát hành tập trung vào Agent có ý nghĩa, không chỉ là preview được đổi tên. Mẫu điểm chính thức mạnh nhất ở reasoning repository, coding khó và tự động hóa, trong khi giao diện Responses mới giúp model thực tế hơn cho Agent lập trình hiện đại. Ngữ cảnh 1M và cache tự động hữu ích, nhưng chỉ khi ứng dụng giữ prefix ổn định và xác minh cache hit thực tế.

Điểm cần cân nhắc chính là kinh tế: giá Pro sau ra mắt xấp xỉ ba lần Flash ở hầu hết loại token, với concurrency thấp hơn. Pro nên là tầng nâng cấp cho công việc khó, giá trị cao thay vì mặc định cho mọi prompt. Kiến trúc production tốt thường route công việc đơn giản tới Flash và chỉ nâng tác vụ khó hoặc thất bại lên Pro.

Ảnh chụp giá Modelflare ngày 14 tháng 8 gần với giá cố định hiện tại của DeepSeek và hiện cung cấp Chat Completions cho V4 Pro. Hãy kiểm tra lại trang trực tiếp sau khi biểu giá mới của DeepSeek bắt đầu; bài viết cũ hay ảnh giá trong cache đều không phải nguồn chuẩn cho billing.

Nguồn và ngày xác minh

Thông số chính thức, biểu giá, trạng thái Modelflare và giá trực tiếp được kiểm tra ngày 14 tháng 8 năm 2026.