DeepSeek V4.1 Flash: kiến trúc, giá Modelflare và các đối thủ
Phân tích dựa trên nguồn về DeepSeek V4.1 Flash, gồm kiến trúc, ngữ cảnh 1M, đầu ra 384K, benchmark Agent, giới hạn API, so với OpenAI và Anthropic, cùng mức sẵn sàng và giá hiện tại trên Modelflare.

DeepSeek V4.1 Flash là một mô hình đa phương thức, trọng số mở, chi phí thấp, dựng cho các vòng Agent dài. Phát hành ngày 10 tháng 9 năm 2026, nó kết hợp cửa sổ ngữ cảnh một triệu token, tới 384K token đầu ra, một API chính thức rẻ bất thường, và một kiến trúc giảm xử lý prompt cùng áp lực KV-cache. Lợi thế rõ nhất của nó không phải thắng mọi benchmark. Là lượng công việc Agent ngữ cảnh dài mà nó thử được trên mỗi đô-la, trong khi vẫn cạnh tranh trên các đánh giá lập trình, terminal, tự động hóa và dùng công cụ.
Kết luận đó cần biên. Các số benchmark bên dưới do DeepSeek công bố, không phải Modelflare tái lập độc lập. Báo cáo của chính DeepSeek nói mô hình vẫn thua các hệ đóng lớn nhất trên suy luận khó nhất và các trường hợp biên. ID mô hình API bên thứ nhất đúng là deepseek-flash. DeepSeek V4.1 Flash hiện đã lên sóng trên Modelflare dưới ID mô hình có phiên bản deepseek-v4.1-flash-0910, với cả Chat Completions và Responses trong nhóm công khai deepseek-stable.
Lần kiểm cuối: 2026-09-10 UTC. Giá, bí danh và trạng thái danh mục có thể đổi.
Câu trả lời thẳng: DeepSeek V4.1 Flash là gì
Thông báo phát hành của DeepSeek định nghĩa DeepSeek V4.1 Flash là bản thay thế production cho dòng Flash trước đó. Endpoint chính thức nhận deepseek-flash. Các tên cũ deepseek-v4-flash và deepseek-v4-flash-vision-exp tạm thời được DeepSeek chấp nhận và được định tuyến tới V4.1 Flash theo giá Flash. Bắt đầu 14 tháng 9 năm 2026 lúc 04:00 UTC, DeepSeek nói các yêu cầu tới deepseek-v4-pro cũng sẽ được định tuyến tới V4.1 Flash cho đến một bản V4.1 Pro sau này.
Chính sách chuyển này thuộc về API của chính DeepSeek. Modelflare dùng ID đóng dấu phát hành rõ deepseek-v4.1-flash-0910 thay vì âm thầm đổi tên mục deepseek-v4-flash trước đó. Người vận hành Modelflare đã xác nhận ra mắt, và mô hình xuất hiện trong cả danh mục giá công khai lẫn origin lúc 2026-09-10 15:21 UTC. Client nên dùng đúng ID mà nhà cung cấp của họ hiển thị, thay vì giả định một bí danh bên thứ nhất chạy không đổi qua mọi gateway.
Danh tính thực dụng của mô hình có năm phần: đầu vào đa phương thức ảnh và chữ; đầu ra chữ; một xương sống MoE 552B tham số; thêm một bộ nhớ Engram 196B tham số; và kích hoạt bất đối xứng 8B tham số mỗi token prompt so với 16B mỗi token được giải mã. Điểm cuối là trung tâm: các tải Agent nặng đầu vào nên tốn ít tính toán hơn trong các lần prefill lặp so với một thiết kế decoder-only đối xứng cùng quy mô.
Thông số trong một cái nhìn
Các giá trị sau lấy từ bản phát hành chính thức, model card và báo cáo kỹ thuật. “Tham số xương sống” và “tham số Engram” mô tả các kho khác nhau; không số nào bằng lượng tính toán đang hoạt động trên mỗi token.
| Hạng mục | DeepSeek V4.1 Flash |
|---|---|
| ID API chính thức | deepseek-flash |
| ID mô hình Modelflare | deepseek-v4.1-flash-0910 |
| Lớp mô hình | Transformer Mixture-of-Experts đa phương thức |
| Đầu vào / đầu ra | Chữ và ảnh vào; chữ ra |
| Bố cục Transformer | 40 lớp: bộ mã hóa nhân quả 20 lớp + bộ giải mã 20 lớp |
| Kho tham số | Xương sống 552B + bộ nhớ điều kiện Engram 196B |
| Tham số hoạt động | 8B mỗi token prefill; 16B mỗi token decode |
| Ngữ cảnh / đầu ra tối đa | 1M / 384K token |
| Tiền huấn luyện | 45T token ngữ liệu đa phương thức; tỷ lệ token chỉ chữ trên đa phương thức 7:1 |
| Thiết kế attention/cache chính | CED + CSA2 + KV toàn cục FP4; KV SWA cục bộ FP8 |
| Dấu chân KV toàn cục | 890 byte mỗi token, DeepSeek báo cáo |
| Các preset suy luận công khai | low = 50, high = 75, max = 100 trên thang effort nội bộ |
| Trần đồng thời API chính thức | 2,500 yêu cầu đồng thời |
| Giấy phép | Giấy phép checkpoint MIT |
Trần đầu ra 384K gấp ba mức tối đa 128K đã công bố cho các mô hình so sánh OpenAI và Anthropic hiện tại trong bài này. Đó là một giới hạn, không phải một khuyến nghị: đầu ra rất dài tăng độ trễ, chi phí và bề mặt cho sự trôi. Với các Agent dài, câu hữu ích hơn là mô hình có giữ được yêu cầu và vượt các kiểm tra nghiệm thu thật sau các lời gọi công cụ không.
Vì sao kiến trúc được dựng cho các vòng Agent dài
Một Agent dùng công cụ liên tục thêm quan sát, kết quả lệnh và các sửa vào lịch sử của nó. Mỗi lượt mới có thể cần prefill prompt, attention trên một ngữ cảnh đang lớn, lưu KV và đầu ra mới. DeepSeek V4.1 Flash xử lý từng chi phí riêng thay vì dựa vào một mô hình nhỏ hơn duy nhất.
| Chi phí Agent | Cơ chế V4.1 Flash | Hiệu ứng nhằm tới |
|---|---|---|
| Xử lý lại các prompt dài | Causal Encoder-Decoder (CED) | Gần như giảm một nửa lượng prefill tiệm cận cho chuỗi dài trong phân tích của DeepSeek |
| Giữ lịch sử toàn cục trong HBM | Tái dùng xuyên lớp CSA2 + FP4 | Giảm các mục KV toàn cục trùng và số byte mỗi mục |
| Giữ bền trạng thái attention cục bộ | SWA Bounded Replay | Dựng lại một cửa sổ cục bộ có biên thay vì lưu cache cục bộ đầy đủ của mọi lớp |
| Gọi lại các mẫu token ổn định | Engram | Đưa bộ nhớ n-gram điều kiện vào các bảng được truy cập thưa |
| Sinh token | Giải mã suy đoán DSpark | Nháp vài vị trí ứng viên và chọn độ dài kiểm chứng theo độ tin cậy và tải hệ thống |
| Xử lý ảnh | DeepSeek-ViT + bộ chiếu | Đổi đầu vào thị giác thành embedding được xử lý cùng chữ từ tiền huấn luyện trở đi |
Các cơ chế này chủ yếu cải thiện kinh tế phục vụ và thông lượng. Chúng tự chúng không chứng minh suy luận tốt hơn. Chất lượng mô hình còn phụ thuộc dữ liệu, hậu huấn luyện, harness của Agent và lượng nỗ lực suy luận được mua.
CED: cắt xử lý prompt trước khi đụng cache
Báo cáo kỹ thuật tách 40 lớp Transformer thành một bộ mã hóa nhân quả 20 lớp và một bộ giải mã 20 lớp. Hai lớp đầu chỉ dùng cửa sổ trượt 128 token. Các lớp còn lại kết hợp attention cửa sổ trượt cục bộ với ngữ cảnh toàn cục đã nén.
Với attention toàn cục, bộ giải mã không dựng một lịch sử KV đầy đủ độc lập ở mỗi lớp. Các key và value toàn cục của nó được chiếu từ trạng thái ẩn cuối của bộ mã hóa. Các trạng thái cửa sổ trượt cục bộ vẫn theo từng lớp. DeepSeek ước lượng độ phức tạp prefill chuỗi dài vào khoảng một nửa đường tương ứng qua mọi lớp: hạng chủ đạo đổi từ xử lý mọi token qua tất cả L lớp thành xử lý ngữ cảnh toàn cục qua khoảng L/2, cộng việc cửa sổ cục bộ có biên.
Điều đó giải thích phần kích hoạt tách 8B/16B. Các token prompt kích hoạt khoảng 8B tham số xương sống trong prefill; các token mới sinh kích hoạt khoảng 16B trong decode. Các tải với tài liệu khổng lồ và câu trả lời ngắn được lợi hơn các tải bị chi phối bởi hàng trăm nghìn token được sinh. CED giảm nửa đầu của hóa đơn đó; nó không làm việc giải mã thành miễn phí.
CSA2, FP4 và SWA Bounded Replay: câu chuyện bộ nhớ
Compressed Sparse Attention 2 nén cache dọc theo các chiều chuỗi, lớp và độ chính xác. Mỗi lớp CSA2 được gán tĩnh một trong ba chế độ. Full tính KV chính, các key của indexer và các vị trí Top-K mới. Reindex tái dùng KV chính và các key của indexer nhưng quét lại chúng bằng query của chính nó. Reuse tái dùng cả KV dùng chung và một lựa chọn thưa trước đó. Mỗi lớp vẫn có query riêng và KV cửa sổ trượt cục bộ riêng.
Lớp Full đầu tiên của bộ giải mã chọn các mục Top-512 và dựng một hồ ứng viên; các lớp Reindex sau chọn các vị trí Top-512 của chúng từ hồ đã thu nhỏ đó. KV toàn cục chính dùng biểu diễn E2M1 khoảng bốn bit với một scale E4M3 trên mỗi 16 kênh. DeepSeek giữ FP8 cho cache SWA cục bộ nhạy với lượng tử hóa hơn.
| Lớp cache | Độ chính xác / vòng đời | Kết quả được báo | Nó không bảo đảm gì |
|---|---|---|---|
| KV toàn cục lúc chạy | FP4, trú trong HBM | 890 byte/token; khoảng 1/4 của V4 Flash và nhỏ hơn V1 437× | Lựa chọn thưa hoàn hảo trên mọi trường hợp biên |
| KV SWA cục bộ lúc chạy | FP8 | Giữ cửa sổ cục bộ theo lớp 128 token | Bộ nhớ không đáng kể ở mọi mức đồng thời |
| KV toàn cục bền | Bộ nhớ host hoặc SSD trong thiết kế triển khai của DeepSeek | Trạng thái toàn cục tái dùng được, sống lâu | Một thời gian giữ cố định trên API công khai |
| Trạng thái SWA cục bộ bền | Được dựng lại bằng Bounded Replay | Khoảng 1/8 dấu chân cache bền tổng của V4 Flash ở cùng độ dài chuỗi | Replay đúng từng trạng thái cục bộ đã bỏ |
Báo cáo nói triển khai của nó giữ KV bền toàn cục ít nhất 72 giờ và dùng một hồ SWA phân tán sống ngắn. Hướng dẫn cache ngữ cảnh công khai mô tả việc tạo cache là tự động và best effort, nói việc dựng có thể mất vài giây, và nói các mục thường được xóa sau vài giờ hoặc vài ngày. Client production nên coi hợp đồng công khai là có thẩm quyền: hãy kiểm các trường token hit và miss thay vì lập ngân sách quanh một lần trúng được bảo đảm 72 giờ.
DeepSeek tự chỉ ra hai biên về độ vững: CSA2 có thể chọn sai các vị trí thưa, và Bounded Replay xấp xỉ trạng thái cục bộ đã bỏ. Các kiểm tra của nó không thấy suy giảm có hệ thống trong các thiết lập đã đánh giá, nhưng các ngữ cảnh cực đoan và các biên khôi phục cache vẫn là chỗ cần kiểm tra chịu tải thêm.
Engram, DSpark và đường đa phương thức
Engram tách một phần ghi nhớ khỏi tính toán mô hình dày. V4.1 Flash cấp 196B tham số cho hai mô-đun bộ nhớ điều kiện ở các lớp đánh số từ không là 1 và 14. Mỗi mô-đun dùng n-gram token độ dài hai, ba và bốn, tám đầu hash, cổng nhận ngữ cảnh và prefetch bộ nhớ host qua RDMA. Đây là tham số được lưu, không phải thêm 196B tham số được kích hoạt cho mọi token.
DSpark là một bộ giải mã suy đoán được huấn luyện riêng. Ba khối Transformer nhìn qua một cửa sổ trượt 128 token và đề xuất năm vị trí song song. Một đầu phụ thuộc nhẹ liên hệ các token nháp; một đầu độ tin cậy ước lượng bao nhiêu phần nháp sẽ sống sót qua kiểm chứng. Bộ lập lịch dùng các xác suất đó và thông lượng engine đã đo để chọn một độ dài kiểm chứng dưới tải hiện tại. Điều này có thể cải thiện thông lượng token của hệ thống mà không đổi vai trò kiểm chứng cuối của xương sống.
Đường thị giác dùng một DeepSeek-ViT được huấn luyện riêng với mã hóa vị trí quay 2D. Một bước pixel-unshuffle 3×3 giảm số token thị giác chín lần trước khi chiếu vào mô hình ngôn ngữ. Bộ mã hóa thị giác có 32 lớp, kích thước ẩn 1,024 và 16 đầu attention trong cấu hình được báo cáo. Giai đoạn huấn luyện tự hồi quy của nó dùng ảnh được co giữa 544×544 và 1,344×1,344, sau một giai đoạn tương phản trước đó trên khoảng 47B cặp ảnh-chữ.
Huấn luyện và hậu huấn luyện
DeepSeek báo cáo 45T token tiền huấn luyện với dữ liệu đa phương thức được đưa vào huấn luyện mô hình ngôn ngữ. Các đường chỉ chữ và đa phương thức được gộp ở tỷ lệ token 7:1 sau khi thay phần chồng và khử trùng. Attention thưa được huấn luyện từ đầu ở độ dài chuỗi 64K, không có giai đoạn làm nóng attention dày; ngữ cảnh kéo tới 1M tại điểm 34T token.
| Giai đoạn | Chi tiết đã công bố | Vì sao nó quan trọng |
|---|---|---|
| Tiền huấn luyện tương phản thị giác | Khoảng 47B cặp ảnh-chữ, pha độ phân giải thấp | Học các biểu diễn thị giác rộng trước khi nhập ngôn ngữ |
| Tinh chỉnh tự hồi quy thị giác | 236B token với chú thích, biểu đồ, OCR và dữ liệu liên quan | Thêm hiểu thị giác và tài liệu ở mức mịn |
| Tiền huấn luyện LLM | 45T token; dữ liệu đa phương thức được đưa từ đầu | Tránh coi thị giác chỉ là một bộ thích ứng prompt muộn |
| Huấn luyện ngữ cảnh | Attention thưa từ 64K; kéo tới 1M tại 34T token | Huấn luyện đúng mẫu attention được triển khai, thay vì chỉ chuyển sau khi huấn luyện |
| Hậu huấn luyện | SFT, học tăng cường và chưng cất on-policy | Canh suy luận, công cụ và hành vi Agent |
Báo cáo không nhận một thuật toán hậu huấn luyện mới. Nó quy các mức tăng cho việc tạo tác vụ và môi trường tổng hợp, lọc dữ liệu tốt hơn, phần thưởng kiểm chứng được và quy mô kiến trúc/dữ liệu. Điều này quan trọng khi so các nhận định “kiến trúc mô hình”: CED và CSA2 giải thích hiệu quả, trong khi hiệu năng Agent quan sát được là sản phẩm của cả chồng huấn luyện và scaffold.
Nỗ lực suy luận: chất lượng có một hóa đơn token nhìn thấy được
DeepSeek phơi một continuum effort nội bộ từ 1 đến 100 và ánh xạ các preset API công khai low, high và max tới 50, 75 và 100. Các đầu vào tương thích ánh xạ minimal và low tới low; medium, high và xhigh tới high; và max hoặc ultra tới max. Thinking mặc định là high.
Trong lần quét DeepSeek báo cáo, nâng effort từ 25 lên 100 làm kết quả trung bình trên tám đánh giá suy luận tăng từ 67.1% lên 76.3%, DeepSWE từ 66.0% lên 74.2%, và Terminal-Bench 2.1 từ 82.4% lên 90.6%. Token đầu ra tăng khoảng 2.5×. Khoảng 60–80 lấy được phần lớn chất lượng với chưa đến một nửa ngân sách token tối đa; bước cuối tới 100 kéo dài các quỹ đạo Agent 1.6–1.8× để đổi lấy các mức tăng nhỏ hơn.
Đây là một trong các nút điều khiển hữu ích nhất của mô hình. Dùng low cho phân loại, trích xuất và khám phá có thể thử lại; high cho lập trình và nghiên cứu bình thường; để dành max cho các tác vụ mà một lần thử nữa hoặc một trường hợp biên bị bỏ tốn hơn các token thêm. Hãy coi đây là các giả thuyết xuất phát và đo chi phí tác vụ được chấp nhận.
Trong chế độ thinking, temperature và các phạt presence/frequency bị bỏ qua, và top_p có mức tối thiểu 0.95. Với công cụ, client phải trả về đủ reasoning_content từ thông điệp assistant cùng kết quả công cụ; bỏ nó gây một phản hồi 400. Quy tắc trạng thái đó quan trọng hơn việc chép một bộ tham số OpenAI quen thuộc.
So sánh benchmark với OpenAI và Anthropic
Bảng này tái hiện các kết quả được chọn từ Bảng 3 của báo cáo kỹ thuật DeepSeek. Mọi mô hình được hiện ở thiết lập Max của báo cáo. DeepSeek dùng các scaffold bắt buộc hoặc chính thức khác nhau cho một số đánh giá, một ngữ cảnh DeepSeek Harness 1M cho lập trình, và một ngữ cảnh Claude Code 512K cho các tác vụ Agent thị giác. Các số là bằng chứng do nhà cung cấp báo cáo, không phải một bài kiểm tra đối đầu độc lập và không phải một SLA production.
| Đánh giá | V4 Flash | V4 Pro | V4.1 Flash | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|---|---|
| GPQA Diamond, Pass@1 | 89.9 | 92.4 | 90.9 | 94.1 | 93.4 |
| Terminal-Bench 2.1, Pass@1 | 82.7 | 87.9 | 90.6 | 88.8 | 89.1 |
| Terminal-Bench 3.0, Pass@1 | 7.6 | 11.8 | 30.0 | 34.4 | 43.3 |
| Terminal-Bench 4.0, Pass@1 | 7.0 | 12.4 | 31.2 | 39.9 | 51.8 |
| DeepSWE v1.1, resolved | 54.4 | 62.7 | 74.2 | 73.0 | 74.0 |
| CyberGym, Pass@1 | 76.7 | 83.3 | 88.1 | 84.5 | — |
| HLE with tools, Pass@1 | 51.5 | 60.0 | 63.9 | — | 63.6 |
| AutomationBench, Pass@1 | 37.7 | 43.2 | 54.8 | 45.8 | 50.3 |
| Agents' Last Exam, Pass@1 | 25.2 | 25.7 | 31.8 | 26.7 | 28.6 |
| Chartography with tools, Pass@1 | — | — | 78.9 | 79.9 | 84.0 |
Cách đọc mạnh nhất thì cụ thể. V4.1 Flash bước một bước lớn so với V4 Flash trên các tác vụ Agent và cạnh tranh với GPT-5.6 Sol cùng Claude Opus 5 trên DeepSWE, Terminal-Bench 2.1, tự động hóa và HLE dùng công cụ. Nó không dẫn GPQA, các phiên bản Terminal-Bench sau, hay Chartography. Bản thân báo cáo cảnh báo rằng gần ngang trên các tác vụ thường không nghĩa là ngang tuyến đầu trên suy luận khó nhất và các trường hợp biên.
GPT-6 Astra và Claude Fable 5.1 bị bỏ khỏi bảng điểm này vì báo cáo DeepSeek không công bố cùng dữ liệu so sánh theo từng dòng cho chúng. Thêm điểm từ các trang nhà cung cấp riêng sẽ tạo một harness chung giả. Các đội nên đánh giá mọi ứng viên trên cùng các tác vụ kho, công cụ, timeout, chính sách mạng và các kiểm tra nghiệm thu.
Tương thích API thì rộng nhưng không giống hệt
Dịch vụ chính thức phơi OpenAI Chat Completions, OpenAI Responses và một API tương thích Anthropic. Bề rộng đó giảm việc chuyển, nhưng tương thích mô tả hình của yêu cầu chứ không phải ngữ nghĩa vòng đời giống hệt.
| Bề mặt | Hành vi DeepSeek V4.1 Flash | Hệ quả khi chuyển |
|---|---|---|
| Chat Completions | Streaming, đầu ra JSON, function call; prefix/FIM ở chế độ không thinking | Các client OpenAI hiện có là điểm bắt đầu đơn giản nhất |
| Responses | Không trạng thái; hỗ trợ hàm và ảnh | Tự lưu bền cả hội thoại |
| Các trường trạng thái Responses | previous_response_id, hội thoại, store, background và quản lý ngữ cảnh không được hỗ trợ hoặc bị bỏ qua |
Một phản hồi 200 không chứng minh các tính năng đó có hiệu lực |
| Công cụ được host | Web search, file search, code interpreter, computer use và các built-in MCP bị bỏ qua; hỗ trợ custom-tool có hạn | Thực thi công cụ trong ứng dụng và kiểm mọi trường đã yêu cầu |
| Tóm tắt suy luận | Nội dung summary và suy luận mã hóa không được hỗ trợ | Đừng phụ thuộc các trường bàn giao suy luận kiểu OpenAI |
| Định dạng Anthropic | Hình thông điệp Anthropic được chấp nhận | Giữ các quy tắc suy luận và trạng thái công cụ của DeepSeek, đừng giả định ngữ nghĩa Claude |
| Thị giác | Ảnh được chấp nhận trong đầu vào người dùng và đầu ra công cụ | Kiểm kích thước payload, chế độ detail và số ảnh |
Hướng dẫn Responses của DeepSeek cũng liệt kê các trường bị bỏ qua như metadata, mẫu prompt, truncation, service tier, safety identifier, khóa/thời gian giữ prompt-cache và các tùy chọn stream. Bỏ qua im lặng là một mối nguy tương thích: việc chấp nhận schema có thể giấu hành vi thiếu. Hãy dựng một yêu cầu kiểm conformance cho mỗi tính năng ứng dụng của bạn phụ thuộc. Hướng dẫn API tương thích OpenAI giải thích vì sao hình endpoint và năng lực cần các kiểm tra riêng.
Các mô hình hiện tại của OpenAI cung cấp một hệ công cụ Responses gốc rộng hơn và các tính năng trạng thái được quản lý. API gốc của Anthropic có hợp đồng khối thinking và dùng công cụ đã chín của riêng nó. Lợi thế của DeepSeek là một mô hình nhận cả ba phương ngữ thường gặp; cái giá là phần giao nhỏ hơn bề mặt gốc đầy đủ của mỗi đối thủ.
Giới hạn thị giác và kinh tế ảnh
Hướng dẫn thị giác chính thức hỗ trợ JPEG, PNG, GIF và WebP qua base64, URL ngoài hoặc Files API. Ảnh được tự động đổi kích thước về khoảng 1,300×1,300 và dùng nhiều nhất 1,024 token đầu vào mỗi ảnh. low detail dùng một khung 512×512; high và original giữ nhiều chi tiết hơn; auto hiện hành xử như original.
| Giới hạn | Giá trị chính thức |
|---|---|
| Thân yêu cầu | 48 MiB |
| Ảnh nhúng hoặc lấy từ ngoài | 32 MiB mỗi ảnh |
| Ảnh được tham chiếu bằng file ID | 64 MiB mỗi ảnh |
| Số ảnh mỗi yêu cầu | 600 |
| Tổng byte ảnh | 64 MiB khi không có file ID; 200 MiB khi có file ID |
| Cạnh dài | 8,192 px; 4,096 px khi gửi 15 ảnh trở lên |
| Trần token thị giác | 1,024 token mỗi ảnh sau khi xử lý |
Ở mức tối đa 1,024 token thị giác, một ảnh chưa cache đóng góp khoảng $0.0001536 ngoài giờ cao điểm hoặc $0.0003072 giờ cao điểm theo các mức giá đầu vào đã công bố, trước chữ đi kèm và đầu ra. Phép tính này hữu ích cho ước lượng quy mô, nhưng việc đổi kích thước ảnh, hành vi cache và lượng token thị giác thực có thể đổi khoản phí. Nhiều ảnh hơn cũng tiêu ngữ cảnh lẽ ra giữ được chữ hoặc lịch sử công cụ.
V4.1 Flash hợp với ảnh chụp tài liệu, biểu đồ, OCR và các quan sát Agent thị giác. Nó không phải mô hình sinh ảnh. Với ảnh được sinh, hãy dùng một mô hình và endpoint được thiết kế để trả pixel chứ không phải chữ.
Giá API chính thức được so
Trang giá DeepSeek đưa các mức sau vào lúc 04:00 UTC ngày 10 tháng 9. Các cửa sổ giờ cao điểm ngày thường là 01:00–04:00 và 06:00–10:00 UTC; mọi thời điểm ngày thường khác và cuối tuần dùng mức ngoài giờ cao điểm. Cache ngữ cảnh của DeepSeek là tự động, nên “đầu vào đã cache” nghĩa là một lần trúng cache được báo, không phải một cờ cache ép một lần trúng.
Các mức OpenAI lấy từ bảng so sánh mô hình hiện tại của nó; các mức Anthropic lấy từ trang giá của nó. Giá trị là USD cho mỗi một triệu token. Anthropic cũng tính phí ghi cache; chúng bị bỏ ở đây vì bảng chỉ so đầu vào mới, lần đọc cache và đầu ra.
| Mô hình | Ngữ cảnh / đầu ra tối đa | Đầu vào mới hoặc miss | Đầu vào đã cache/đọc | Đầu ra |
|---|---|---|---|---|
| DeepSeek V4.1 Flash, ngoài giờ cao điểm | 1M / 384K | $0.15 | $0.003 | $0.60 |
| DeepSeek V4.1 Flash, giờ cao điểm | 1M / 384K | $0.30 | $0.006 | $1.20 |
| DeepSeek V4.1 Flash trên Modelflare | giới hạn mô hình 1M / 384K | $0.193548 | $0.003871 | $0.774194 |
| GPT-5.6 Luna | 1.05M / 128K | $0.20 | $0.02 | $1.20 |
| GPT-5.6 Terra | 1.05M / 128K | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Sol | 1.05M / 128K | $4.00 | $0.40 | $20.00 |
| GPT-6 Astra | 1.05M / 128K | $10.00 | $1.00 | $50.00 |
| Claude Sonnet 5 | 1M / 128K | $2.00 | $0.20 | $10.00 |
| Claude Opus 5 | 1M / 128K | $5.00 | $0.50 | $25.00 |
| Claude Fable 5.1 | 1M / 128K | $10.00 | $0.25 | $50.00 |
Giá tự nó không phải giá trị. Các tokenizer khác nhau có thể tính số token khác nhau cho cùng một đoạn chữ; Anthropic lưu ý rằng tokenization mới hơn có thể sinh khoảng 30% token nhiều hơn trên một số tải. Các mô hình cũng có thể cần độ dài đầu ra, lần thử lại và sửa chữa của người khác nhau. Hãy so chi phí trên mỗi tác vụ được chấp nhận, không chỉ dòng có số đầu vào nhỏ nhất.
Danh mục công khai hiện tại của Modelflare phơi một mức nằm giữa hai khung giờ của DeepSeek: nó khoảng 64.5% mức giờ cao điểm bên thứ nhất, hoặc thấp hơn 35.5% trong các cửa sổ giờ cao điểm, trong khi nó cao hơn khoảng 29.0% so với mức ngoài giờ cao điểm của DeepSeek. Biểu giá gateway được liệt kê do đó hôm nay không có điều chỉnh khung giờ; các tải linh hoạt dùng ổn định được cửa sổ ngoài giờ cao điểm của DeepSeek vẫn có thể trả ít hơn qua API bên thứ nhất.
OpenAI áp các mức cao hơn khi ngữ cảnh đầu vào vượt 272K: cả yêu cầu dùng giá đầu vào và đầu vào đã cache gấp 2× và giá đầu ra gấp 1.5×. Biên này quan trọng trong kịch bản ngữ cảnh dài bên dưới. DeepSeek dùng các cửa sổ thời gian thay vào đó; các mô hình một triệu token được liệt kê của Anthropic không dùng cùng biên 272K trong bảng giá được dẫn.
Hai kịch bản chi phí tái lập được
Kịch bản A là một yêu cầu với 100K đầu vào chưa cache và 10K đầu ra. Công thức là 0.1 × input rate + 0.01 × output rate. Nó giả định không có đầu vào đã cache, công cụ, lần thử lại, thuế hoặc khoản cộng riêng của nhà cung cấp.
| Mô hình | Chi phí kịch bản A |
|---|---|
| DeepSeek V4.1 Flash, ngoài giờ cao điểm | $0.021 |
| DeepSeek V4.1 Flash trên Modelflare | $0.0271 |
| GPT-5.6 Luna | $0.032 |
| DeepSeek V4.1 Flash, giờ cao điểm | $0.042 |
| Claude Sonnet 5 | $0.300 |
| GPT-5.6 Terra | $0.320 |
| GPT-5.6 Sol | $0.600 |
| Claude Opus 5 | $0.750 |
| GPT-6 Astra / Claude Fable 5.1 | $1.500 |
Kịch bản B là chi phí biên của một yêu cầu cache ấm với 900K đầu vào đã cache, 100K đầu vào mới và 20K đầu ra. Nó cố ý loại yêu cầu trước đó đã lập cache. Công thức: 0.9 × cache-read rate + 0.1 × input rate + 0.02 × output rate. Các hệ số ngữ cảnh dài trên cả yêu cầu của OpenAI được áp vì ngữ cảnh đầu vào tổng cộng một triệu token.
| Mô hình | Chi phí biên kịch bản B |
|---|---|
| DeepSeek V4.1 Flash, ngoài giờ cao điểm | $0.0297 |
| DeepSeek V4.1 Flash trên Modelflare | $0.0383 |
| DeepSeek V4.1 Flash, giờ cao điểm | $0.0594 |
| GPT-5.6 Luna | $0.1120 |
| Claude Sonnet 5 | $0.5800 |
| GPT-5.6 Terra | $1.1200 |
| Claude Opus 5 | $1.4500 |
| GPT-5.6 Sol | $2.1200 |
| Claude Fable 5.1 | $2.2250 |
| GPT-6 Astra | $5.3000 |
Phép so giữ số lượng token bằng nhau; nó không nhận chất lượng bằng nhau. Cache của DeepSeek là best effort, trong khi việc tạo cache của Anthropic có giá ghi và thời gian sống riêng. Một bài kiểm tra tải công bằng ghi token hit/miss cache, mọi lần thử, tổng đầu ra gồm suy luận bị tính phí, thời gian trôi, tỷ lệ nghiệm thu và số phút sửa của người. Hướng dẫn theo dõi chi phí đưa khung hạch toán.
Trọng số mở không làm việc tự host thành nhỏ
Bản phát hành Hugging Face được cấp phép MIT và ghi các đường phục vụ vLLM và SGLang. Trong ảnh chụp được kiểm cho bài này, kho chứa 48 mảnh safetensor và khoảng 510.3 GB tệp Git-LFS tại commit dba1be0a40aa45a94ad051997016db3960a90277. Số byte đó là một tạo phẩm tải xuống, không phải RAM GPU đã đo.
Hệ thống vẫn có một xương sống 552B, bộ nhớ Engram 196B được định địa chỉ trên host, định tuyến expert, các đường cache FP4/FP8, prefetch RDMA và lưu KV bền. Thông báo phát hành của DeepSeek mời các đội đang lên kế hoạch một triển khai quy mô lớn với 2,000 GPU cộng một cụm lưu trữ liên hệ công ty. Ví dụ đó báo hiệu quy mô của hệ phục vụ đầy đủ; nó không phải mức tối thiểu đã nêu cho mọi triển khai. Các triển khai nghiên cứu nhỏ hơn có thể dùng lượng tử hóa hoặc song song khác, nhưng không nên suy ra từ kinh tế API của nhà cung cấp.
Trọng số mở cho các đội quyền truy cập checkpoint, khả năng kiểm và quyền kiểm chính sách triển khai. Chúng không tự tái tạo fusion kernel, phân cấp cache, lập lịch DSpark, batching hoặc độ trễ API công khai của DeepSeek. Hãy so một kế hoạch tự host với thông lượng đã đo, khôi phục sự cố, dung lượng nhàn, băng thông lưu trữ và nhân công vận hành.
DeepSeek V4.1 Flash trên Modelflare
DeepSeek V4.1 Flash đã lên sóng trên Modelflare. Lần ra mắt được người vận hành xác nhận nhìn thấy độc lập trong danh mục giá Modelflare công khai và danh mục origin. Lúc 2026-09-10 15:21 UTC, cả hai đều phơi bản ghi deepseek-v4.1-flash-0910 mới; cấu hình production cho thấy một ability deepseek-stable đã bật và một tuyến đã bật quảng cáo cùng mô hình.
| Hạng mục Modelflare | Giá trị đang sống |
|---|---|
| ID mô hình để gửi | deepseek-v4.1-flash-0910 |
| Mức sẵn sàng | Đang sống trong danh mục công khai và nhóm định tuyến đã bật |
| Nhóm công khai | deepseek-stable |
| Giá đầu vào | $0.193548 / 1M token |
| Giá đầu vào đã cache | $0.003871 / 1M token |
| Giá đầu ra | $0.774194 / 1M token |
| Các loại endpoint | /v1/chat/completions và /v1/responses |
Các giá được suy từ hệ số đầu vào cơ sở $0.322580645 của mục đang sống, tỷ lệ nhóm công khai 0.6, tỷ lệ cache 0.02 và tỷ lệ completion 4×. Với hai tải đã tính ở trên, chi phí Modelflare khoảng $0.0271 và $0.0383. Hãy dùng trang giá DeepSeek V4.1 Flash đang sống cho ID mô hình và biểu giá hiện tại.
Các tầng bằng chứng vẫn quan trọng. Danh mục công khai và tuyến production đã bật xác lập việc sản phẩm có sẵn, và người vận hành xác nhận ra mắt một cách rõ. Đến 15:30 UTC, các bản ghi production chứa sáu lời gọi Chat Completions đã hoàn thành dưới đúng ID mô hình mới, tổng 216 token prompt và 173 token completion. Điều đó kiểm chứng việc điều phối Chat Completions đã xác thực và đầu ra bị tính phí. Đó vẫn là một mẫu ra mắt quá nhỏ để đo độ trễ hoặc mức sẵn sàng, và nó không độc lập chứng minh hành vi Responses hoặc đa phương thức qua tuyến này. Các đội nên chạy yêu cầu nghiệm thu nhỏ của chính mình trên đúng endpoint trước khi chuyển việc production.
Chỗ DeepSeek V4.1 Flash có lợi thế thật
Mô hình có một lợi thế mạch lạc khi đầu vào dài, các lượt công cụ dày và ngân sách đều quan trọng. Kiến trúc giảm áp lực prefill và cache; giá API biến các khoản tiết kiệm đó thành một biểu giá công khai thấp bất thường; trần đầu ra 384K để lại khoảng trống cho các bản vá hoặc báo cáo dài; và checkpoint giữ một đường tự host mở.
| Tải | Vì sao V4.1 Flash là ứng viên mạnh | Cần đo gì |
|---|---|---|
| Agent kho mã | Kết quả DeepSWE và terminal do nhà phát hành báo cáo mạnh, ở mức giá token thấp | Thay đổi được chấp nhận, tỷ lệ test qua, lần thử lại và thời gian sửa |
| Tổng hợp nghiên cứu dài | Đầu vào 1M, lần trúng cache rẻ và đầu ra 384K | Độ đúng trích dẫn, việc giữ yêu cầu và tổng đầu ra |
| Agent tài liệu thị giác | Ảnh gốc, huấn luyện OCR/biểu đồ và các API Agent thường gặp | Độ đúng trường, độ nhạy crop/detail và lượng token thị giác |
| Tự động hóa khối lượng cao | Giá giờ cao điểm và ngoài giờ cao điểm đều thấp; trần đồng thời 2,500 yêu cầu | Thời gian xếp hàng, tỷ lệ 429, lỗi công cụ và chi phí mỗi lần thành công |
| Triển khai được kiểm soát | Checkpoint MIT và các đường vLLM/SGLang đã ghi | Mức dùng phần cứng, băng thông cache/lưu trữ và chi phí vận hành |
Nhận định production mạnh nhất do đó là năng lực Agent ngữ cảnh dài, hiệu quả về chi phí, không phải “mô hình tốt nhất nói chung.” Nếu mô hình hoàn thành một tác vụ thật trong một lần chạy được chấp nhận ở chỗ một mô hình nhỏ rẻ hơn cần vài lần sửa, V4.1 thắng về kết quả. Nếu một mô hình đóng tuyến đầu ngăn một thất bại đắt, giá token cao hơn của nó vẫn có thể kinh tế.
Chỗ OpenAI hoặc Anthropic vẫn là lựa chọn an toàn hơn
Hãy chọn một mô hình OpenAI khi ứng dụng phụ thuộc hệ sinh thái Responses đầy đủ, trạng thái được quản lý, công cụ được host, hoặc một hợp đồng riêng của OpenAI mà DeepSeek bỏ qua. GPT-5.6 Luna là đối thủ giá đặc biệt gần cho các tải ngắn hơn, chưa cache; Terra, Sol và Astra đổi các giá niêm yết cao hơn nhiều lấy các bậc năng lực khác nhau và các tính năng nền tảng gốc.
Hãy chọn một mô hình Anthropic khi hợp đồng công cụ/thinking gốc của Claude, các kiểm soát cache, hoặc hiệu năng đã đo trên công việc Agent khó nhất của bạn quan trọng hơn giá niêm yết token. Trong bảng của chính DeepSeek, Claude Opus 5 dẫn Terminal-Bench 3/4 và Chartography; Claude Fable 5.1 được đặt cho công việc chân trời dài đòi hỏi nhất, dù nó đắt hơn đáng kể trên mỗi token mới và token đầu ra.
Với các hành động then chốt về an toàn hoặc đắt đỏ, việc chọn tuyến nên dựa trên các kiểu thất bại đã đánh giá và các biên quyền, không phải thương hiệu hay trung bình benchmark. Hãy dùng hướng dẫn định tuyến để tách việc thử lại được, các fallback và các hành động có tác dụng phụ.
Danh sách kiểm tra triển khai
- Dùng
deepseek-flashcho API bên thứ nhất và ghi riêng mọi ánh xạ riêng của gateway. - Bắt đầu ở effort high, rồi đo low và max trên cùng tập tác vụ được chấp nhận; đừng ánh xạ tên giữa các nhà cung cấp như cùng một lượng tính toán.
- Khi công cụ được dùng trong chế độ thinking, hãy trả về đủ
reasoning_contentđúng như yêu cầu. - Kiểm mọi trường Responses bạn phụ thuộc; các tham số bị từ chối và bị bỏ qua im lặng cần cách xử lý khác.
- Ghi token cache-hit và cache-miss, token đầu ra/suy luận, lần thử lại, độ trễ và nghiệm thu cuối.
- Thiết kế kinh tế cache quanh các lần trúng quan sát được chứ không quanh một giả định giữ cố định.
- Ép các giới hạn byte, số lượng, kích thước và detail của ảnh trước khi gửi yêu cầu đa phương thức.
- Giữ ủy quyền phía ứng dụng, tính lũy đẳng của công cụ và kiểm đầu ra độc lập với chất lượng mô hình.
- Kiểm lại giá theo cửa sổ thời gian, các bí danh mô hình và các giới hạn đồng thời trước khi ra mắt.
- Chạy một yêu cầu đã xác thực thật trên đúng tuyến; một danh mục mô hình hoặc HTTP 200 một mình không phải bằng chứng năng lực.
Câu hỏi thường gặp
DeepSeek V4.1 Flash có tốt hơn GPT-6 Astra hoặc Claude Fable 5.1 không? Không phải như một nhận định phổ quát. V4.1 Flash có lợi thế lớn về giá và trọng số mở cùng các điểm Agent do nhà cung cấp báo cáo mạnh. Bản thân DeepSeek nói các mô hình đóng lớn nhất giữ một lợi thế trên suy luận khó nhất và các trường hợp biên. Không có so sánh Astra/Fable cùng harness trong báo cáo V4.1.
DeepSeek V4.1 Flash có bao nhiêu tham số? Báo cáo liệt kê một xương sống 552B tham số cộng 196B tham số Engram. Nó kích hoạt khoảng 8B tham số xương sống mỗi token prefill và 16B mỗi token được giải mã. Chỉ nói “552B tổng” thì bỏ Engram; nói “748B đang hoạt động” cũng sai.
Ngữ cảnh và giới hạn đầu ra của nó là gì? Các giới hạn chính thức là một triệu token ngữ cảnh và tới 384K token đầu ra. Embedding ảnh, chữ, lịch sử công cụ và suy luận đều tiêu các ngân sách liên quan.
Vì sao nó được gọi là Flash? Thiết kế tập trung vào chi phí phục vụ thấp hơn: kích hoạt prefill/decode bất đối xứng, attention thưa đã nén, KV toàn cục FP4, replay bền có biên và giải mã suy đoán. “Flash” không hứa độ trễ thấp nhất cho mọi prompt hoặc mọi điều kiện hàng đợi.
Cache công khai có kéo dài 72 giờ không? Đừng giả định vậy. Báo cáo kỹ thuật mô tả một thiết kế triển khai với KV toàn cục bền ít nhất 72 giờ. Hướng dẫn API công khai gọi việc cache là best effort và nói các mục thường được xóa sau vài giờ hoặc vài ngày. Việc tính phí nên dùng các trường hit/miss quan sát được.
API Responses có phải bản thay thế thả vào cho OpenAI Responses không? Nó nhận một hình quen, nhưng nó không trạng thái và bỏ qua nhiều trường OpenAI cùng các công cụ được host. Hãy kiểm đúng hợp đồng năng lực bạn cần.
Nó sinh được ảnh không? Nó hiểu đầu vào ảnh và trả chữ. Nó không phải mô hình sinh ảnh.
Hôm nay tôi gọi được V4.1 Flash qua Modelflare không? Có. Hãy dùng deepseek-v4.1-flash-0910 trong nhóm deepseek-stable với Chat Completions hoặc Responses. Đây là ID đóng dấu phát hành của Modelflare; bí danh bên thứ nhất deepseek-flash là một hợp đồng nhà cung cấp riêng.
Nguồn, phương pháp và nhật ký cập nhật
Bài viết này ưu tiên các nguồn bên thứ nhất và tách sự kiện đã ghi, các đánh giá do DeepSeek báo cáo, các ví dụ đã tính và trạng thái danh mục Modelflare quan sát được. Không có benchmark mô hình độc lập nào được chạy. Phép tính chi phí được giữ trong tạo phẩm nguồn đi kèm, và mọi kịch bản nêu vector token cùng các loại trừ của nó. Ảnh bìa không chữ là một minh họa biên tập do AI sinh theo phong cách hình của Modelflare hiện có.
Các nguồn chính: bản phát hành DeepSeek V4.1 Flash, báo cáo kỹ thuật, model card, giá, thinking, Responses, tương thích Anthropic, thị giác, cache ngữ cảnh, so sánh mô hình OpenAI, giá Anthropic, và danh mục công khai Modelflare.
Cập nhật 2026-09-10: đánh giá ngày công bố ban đầu. Nó ghi ID mô hình bên thứ nhất, giá giờ cao điểm/ngoài giờ cao điểm đang hiệu lực, thông báo chuyển bí danh ngày 14 tháng 9, các giới hạn API hiện tại, kiến trúc trong báo cáo kỹ thuật và dữ liệu benchmark. Một cập nhật cùng ngày sau đó thêm lần ra mắt Modelflare đã xác nhận dưới deepseek-v4.1-flash-0910, các giá gateway đang sống và các chi phí gateway đã tính. Hãy kiểm lại các sự kiện có thể đổi trước khi triển khai.