DeepSeek V4.1 Flash: kiến trúc, giá Modelflare và các đối thủ

Phân tích dựa trên nguồn về DeepSeek V4.1 Flash, gồm kiến trúc, ngữ cảnh 1M, đầu ra 384K, benchmark Agent, giới hạn API, so với OpenAI và Anthropic, cùng mức sẵn sàng và giá hiện tại trên Modelflare.

DeepSeek V4.1 Flash: kiến trúc, giá Modelflare và các đối thủ

DeepSeek V4.1 Flash là một mô hình đa phương thức, trọng số mở, chi phí thấp, dựng cho các vòng Agent dài. Phát hành ngày 10 tháng 9 năm 2026, nó kết hợp cửa sổ ngữ cảnh một triệu token, tới 384K token đầu ra, một API chính thức rẻ bất thường, và một kiến trúc giảm xử lý prompt cùng áp lực KV-cache. Lợi thế rõ nhất của nó không phải thắng mọi benchmark. Là lượng công việc Agent ngữ cảnh dài mà nó thử được trên mỗi đô-la, trong khi vẫn cạnh tranh trên các đánh giá lập trình, terminal, tự động hóa và dùng công cụ.

Kết luận đó cần biên. Các số benchmark bên dưới do DeepSeek công bố, không phải Modelflare tái lập độc lập. Báo cáo của chính DeepSeek nói mô hình vẫn thua các hệ đóng lớn nhất trên suy luận khó nhất và các trường hợp biên. ID mô hình API bên thứ nhất đúng là deepseek-flash. DeepSeek V4.1 Flash hiện đã lên sóng trên Modelflare dưới ID mô hình có phiên bản deepseek-v4.1-flash-0910, với cả Chat Completions và Responses trong nhóm công khai deepseek-stable.

Lần kiểm cuối: 2026-09-10 UTC. Giá, bí danh và trạng thái danh mục có thể đổi.

Câu trả lời thẳng: DeepSeek V4.1 Flash là gì

Thông báo phát hành của DeepSeek định nghĩa DeepSeek V4.1 Flash là bản thay thế production cho dòng Flash trước đó. Endpoint chính thức nhận deepseek-flash. Các tên cũ deepseek-v4-flashdeepseek-v4-flash-vision-exp tạm thời được DeepSeek chấp nhận và được định tuyến tới V4.1 Flash theo giá Flash. Bắt đầu 14 tháng 9 năm 2026 lúc 04:00 UTC, DeepSeek nói các yêu cầu tới deepseek-v4-pro cũng sẽ được định tuyến tới V4.1 Flash cho đến một bản V4.1 Pro sau này.

Chính sách chuyển này thuộc về API của chính DeepSeek. Modelflare dùng ID đóng dấu phát hành rõ deepseek-v4.1-flash-0910 thay vì âm thầm đổi tên mục deepseek-v4-flash trước đó. Người vận hành Modelflare đã xác nhận ra mắt, và mô hình xuất hiện trong cả danh mục giá công khai lẫn origin lúc 2026-09-10 15:21 UTC. Client nên dùng đúng ID mà nhà cung cấp của họ hiển thị, thay vì giả định một bí danh bên thứ nhất chạy không đổi qua mọi gateway.

Danh tính thực dụng của mô hình có năm phần: đầu vào đa phương thức ảnh và chữ; đầu ra chữ; một xương sống MoE 552B tham số; thêm một bộ nhớ Engram 196B tham số; và kích hoạt bất đối xứng 8B tham số mỗi token prompt so với 16B mỗi token được giải mã. Điểm cuối là trung tâm: các tải Agent nặng đầu vào nên tốn ít tính toán hơn trong các lần prefill lặp so với một thiết kế decoder-only đối xứng cùng quy mô.

Thông số trong một cái nhìn

Các giá trị sau lấy từ bản phát hành chính thức, model cardbáo cáo kỹ thuật. “Tham số xương sống” và “tham số Engram” mô tả các kho khác nhau; không số nào bằng lượng tính toán đang hoạt động trên mỗi token.

Hạng mục DeepSeek V4.1 Flash
ID API chính thức deepseek-flash
ID mô hình Modelflare deepseek-v4.1-flash-0910
Lớp mô hình Transformer Mixture-of-Experts đa phương thức
Đầu vào / đầu ra Chữ và ảnh vào; chữ ra
Bố cục Transformer 40 lớp: bộ mã hóa nhân quả 20 lớp + bộ giải mã 20 lớp
Kho tham số Xương sống 552B + bộ nhớ điều kiện Engram 196B
Tham số hoạt động 8B mỗi token prefill; 16B mỗi token decode
Ngữ cảnh / đầu ra tối đa 1M / 384K token
Tiền huấn luyện 45T token ngữ liệu đa phương thức; tỷ lệ token chỉ chữ trên đa phương thức 7:1
Thiết kế attention/cache chính CED + CSA2 + KV toàn cục FP4; KV SWA cục bộ FP8
Dấu chân KV toàn cục 890 byte mỗi token, DeepSeek báo cáo
Các preset suy luận công khai low = 50, high = 75, max = 100 trên thang effort nội bộ
Trần đồng thời API chính thức 2,500 yêu cầu đồng thời
Giấy phép Giấy phép checkpoint MIT

Trần đầu ra 384K gấp ba mức tối đa 128K đã công bố cho các mô hình so sánh OpenAI và Anthropic hiện tại trong bài này. Đó là một giới hạn, không phải một khuyến nghị: đầu ra rất dài tăng độ trễ, chi phí và bề mặt cho sự trôi. Với các Agent dài, câu hữu ích hơn là mô hình có giữ được yêu cầu và vượt các kiểm tra nghiệm thu thật sau các lời gọi công cụ không.

Vì sao kiến trúc được dựng cho các vòng Agent dài

Một Agent dùng công cụ liên tục thêm quan sát, kết quả lệnh và các sửa vào lịch sử của nó. Mỗi lượt mới có thể cần prefill prompt, attention trên một ngữ cảnh đang lớn, lưu KV và đầu ra mới. DeepSeek V4.1 Flash xử lý từng chi phí riêng thay vì dựa vào một mô hình nhỏ hơn duy nhất.

Chi phí Agent Cơ chế V4.1 Flash Hiệu ứng nhằm tới
Xử lý lại các prompt dài Causal Encoder-Decoder (CED) Gần như giảm một nửa lượng prefill tiệm cận cho chuỗi dài trong phân tích của DeepSeek
Giữ lịch sử toàn cục trong HBM Tái dùng xuyên lớp CSA2 + FP4 Giảm các mục KV toàn cục trùng và số byte mỗi mục
Giữ bền trạng thái attention cục bộ SWA Bounded Replay Dựng lại một cửa sổ cục bộ có biên thay vì lưu cache cục bộ đầy đủ của mọi lớp
Gọi lại các mẫu token ổn định Engram Đưa bộ nhớ n-gram điều kiện vào các bảng được truy cập thưa
Sinh token Giải mã suy đoán DSpark Nháp vài vị trí ứng viên và chọn độ dài kiểm chứng theo độ tin cậy và tải hệ thống
Xử lý ảnh DeepSeek-ViT + bộ chiếu Đổi đầu vào thị giác thành embedding được xử lý cùng chữ từ tiền huấn luyện trở đi

Các cơ chế này chủ yếu cải thiện kinh tế phục vụ và thông lượng. Chúng tự chúng không chứng minh suy luận tốt hơn. Chất lượng mô hình còn phụ thuộc dữ liệu, hậu huấn luyện, harness của Agent và lượng nỗ lực suy luận được mua.

CED: cắt xử lý prompt trước khi đụng cache

Báo cáo kỹ thuật tách 40 lớp Transformer thành một bộ mã hóa nhân quả 20 lớp và một bộ giải mã 20 lớp. Hai lớp đầu chỉ dùng cửa sổ trượt 128 token. Các lớp còn lại kết hợp attention cửa sổ trượt cục bộ với ngữ cảnh toàn cục đã nén.

Với attention toàn cục, bộ giải mã không dựng một lịch sử KV đầy đủ độc lập ở mỗi lớp. Các key và value toàn cục của nó được chiếu từ trạng thái ẩn cuối của bộ mã hóa. Các trạng thái cửa sổ trượt cục bộ vẫn theo từng lớp. DeepSeek ước lượng độ phức tạp prefill chuỗi dài vào khoảng một nửa đường tương ứng qua mọi lớp: hạng chủ đạo đổi từ xử lý mọi token qua tất cả L lớp thành xử lý ngữ cảnh toàn cục qua khoảng L/2, cộng việc cửa sổ cục bộ có biên.

Điều đó giải thích phần kích hoạt tách 8B/16B. Các token prompt kích hoạt khoảng 8B tham số xương sống trong prefill; các token mới sinh kích hoạt khoảng 16B trong decode. Các tải với tài liệu khổng lồ và câu trả lời ngắn được lợi hơn các tải bị chi phối bởi hàng trăm nghìn token được sinh. CED giảm nửa đầu của hóa đơn đó; nó không làm việc giải mã thành miễn phí.

CSA2, FP4 và SWA Bounded Replay: câu chuyện bộ nhớ

Compressed Sparse Attention 2 nén cache dọc theo các chiều chuỗi, lớp và độ chính xác. Mỗi lớp CSA2 được gán tĩnh một trong ba chế độ. Full tính KV chính, các key của indexer và các vị trí Top-K mới. Reindex tái dùng KV chính và các key của indexer nhưng quét lại chúng bằng query của chính nó. Reuse tái dùng cả KV dùng chung và một lựa chọn thưa trước đó. Mỗi lớp vẫn có query riêng và KV cửa sổ trượt cục bộ riêng.

Lớp Full đầu tiên của bộ giải mã chọn các mục Top-512 và dựng một hồ ứng viên; các lớp Reindex sau chọn các vị trí Top-512 của chúng từ hồ đã thu nhỏ đó. KV toàn cục chính dùng biểu diễn E2M1 khoảng bốn bit với một scale E4M3 trên mỗi 16 kênh. DeepSeek giữ FP8 cho cache SWA cục bộ nhạy với lượng tử hóa hơn.

Lớp cache Độ chính xác / vòng đời Kết quả được báo Nó không bảo đảm gì
KV toàn cục lúc chạy FP4, trú trong HBM 890 byte/token; khoảng 1/4 của V4 Flash và nhỏ hơn V1 437× Lựa chọn thưa hoàn hảo trên mọi trường hợp biên
KV SWA cục bộ lúc chạy FP8 Giữ cửa sổ cục bộ theo lớp 128 token Bộ nhớ không đáng kể ở mọi mức đồng thời
KV toàn cục bền Bộ nhớ host hoặc SSD trong thiết kế triển khai của DeepSeek Trạng thái toàn cục tái dùng được, sống lâu Một thời gian giữ cố định trên API công khai
Trạng thái SWA cục bộ bền Được dựng lại bằng Bounded Replay Khoảng 1/8 dấu chân cache bền tổng của V4 Flash ở cùng độ dài chuỗi Replay đúng từng trạng thái cục bộ đã bỏ

Báo cáo nói triển khai của nó giữ KV bền toàn cục ít nhất 72 giờ và dùng một hồ SWA phân tán sống ngắn. Hướng dẫn cache ngữ cảnh công khai mô tả việc tạo cache là tự động và best effort, nói việc dựng có thể mất vài giây, và nói các mục thường được xóa sau vài giờ hoặc vài ngày. Client production nên coi hợp đồng công khai là có thẩm quyền: hãy kiểm các trường token hit và miss thay vì lập ngân sách quanh một lần trúng được bảo đảm 72 giờ.

DeepSeek tự chỉ ra hai biên về độ vững: CSA2 có thể chọn sai các vị trí thưa, và Bounded Replay xấp xỉ trạng thái cục bộ đã bỏ. Các kiểm tra của nó không thấy suy giảm có hệ thống trong các thiết lập đã đánh giá, nhưng các ngữ cảnh cực đoan và các biên khôi phục cache vẫn là chỗ cần kiểm tra chịu tải thêm.

Engram, DSpark và đường đa phương thức

Engram tách một phần ghi nhớ khỏi tính toán mô hình dày. V4.1 Flash cấp 196B tham số cho hai mô-đun bộ nhớ điều kiện ở các lớp đánh số từ không là 1 và 14. Mỗi mô-đun dùng n-gram token độ dài hai, ba và bốn, tám đầu hash, cổng nhận ngữ cảnh và prefetch bộ nhớ host qua RDMA. Đây là tham số được lưu, không phải thêm 196B tham số được kích hoạt cho mọi token.

DSpark là một bộ giải mã suy đoán được huấn luyện riêng. Ba khối Transformer nhìn qua một cửa sổ trượt 128 token và đề xuất năm vị trí song song. Một đầu phụ thuộc nhẹ liên hệ các token nháp; một đầu độ tin cậy ước lượng bao nhiêu phần nháp sẽ sống sót qua kiểm chứng. Bộ lập lịch dùng các xác suất đó và thông lượng engine đã đo để chọn một độ dài kiểm chứng dưới tải hiện tại. Điều này có thể cải thiện thông lượng token của hệ thống mà không đổi vai trò kiểm chứng cuối của xương sống.

Đường thị giác dùng một DeepSeek-ViT được huấn luyện riêng với mã hóa vị trí quay 2D. Một bước pixel-unshuffle 3×3 giảm số token thị giác chín lần trước khi chiếu vào mô hình ngôn ngữ. Bộ mã hóa thị giác có 32 lớp, kích thước ẩn 1,024 và 16 đầu attention trong cấu hình được báo cáo. Giai đoạn huấn luyện tự hồi quy của nó dùng ảnh được co giữa 544×544 và 1,344×1,344, sau một giai đoạn tương phản trước đó trên khoảng 47B cặp ảnh-chữ.

Huấn luyện và hậu huấn luyện

DeepSeek báo cáo 45T token tiền huấn luyện với dữ liệu đa phương thức được đưa vào huấn luyện mô hình ngôn ngữ. Các đường chỉ chữ và đa phương thức được gộp ở tỷ lệ token 7:1 sau khi thay phần chồng và khử trùng. Attention thưa được huấn luyện từ đầu ở độ dài chuỗi 64K, không có giai đoạn làm nóng attention dày; ngữ cảnh kéo tới 1M tại điểm 34T token.

Giai đoạn Chi tiết đã công bố Vì sao nó quan trọng
Tiền huấn luyện tương phản thị giác Khoảng 47B cặp ảnh-chữ, pha độ phân giải thấp Học các biểu diễn thị giác rộng trước khi nhập ngôn ngữ
Tinh chỉnh tự hồi quy thị giác 236B token với chú thích, biểu đồ, OCR và dữ liệu liên quan Thêm hiểu thị giác và tài liệu ở mức mịn
Tiền huấn luyện LLM 45T token; dữ liệu đa phương thức được đưa từ đầu Tránh coi thị giác chỉ là một bộ thích ứng prompt muộn
Huấn luyện ngữ cảnh Attention thưa từ 64K; kéo tới 1M tại 34T token Huấn luyện đúng mẫu attention được triển khai, thay vì chỉ chuyển sau khi huấn luyện
Hậu huấn luyện SFT, học tăng cường và chưng cất on-policy Canh suy luận, công cụ và hành vi Agent

Báo cáo không nhận một thuật toán hậu huấn luyện mới. Nó quy các mức tăng cho việc tạo tác vụ và môi trường tổng hợp, lọc dữ liệu tốt hơn, phần thưởng kiểm chứng được và quy mô kiến trúc/dữ liệu. Điều này quan trọng khi so các nhận định “kiến trúc mô hình”: CED và CSA2 giải thích hiệu quả, trong khi hiệu năng Agent quan sát được là sản phẩm của cả chồng huấn luyện và scaffold.

Nỗ lực suy luận: chất lượng có một hóa đơn token nhìn thấy được

DeepSeek phơi một continuum effort nội bộ từ 1 đến 100 và ánh xạ các preset API công khai low, highmax tới 50, 75 và 100. Các đầu vào tương thích ánh xạ minimallow tới low; medium, highxhigh tới high; và max hoặc ultra tới max. Thinking mặc định là high.

Trong lần quét DeepSeek báo cáo, nâng effort từ 25 lên 100 làm kết quả trung bình trên tám đánh giá suy luận tăng từ 67.1% lên 76.3%, DeepSWE từ 66.0% lên 74.2%, và Terminal-Bench 2.1 từ 82.4% lên 90.6%. Token đầu ra tăng khoảng 2.5×. Khoảng 60–80 lấy được phần lớn chất lượng với chưa đến một nửa ngân sách token tối đa; bước cuối tới 100 kéo dài các quỹ đạo Agent 1.6–1.8× để đổi lấy các mức tăng nhỏ hơn.

Đây là một trong các nút điều khiển hữu ích nhất của mô hình. Dùng low cho phân loại, trích xuất và khám phá có thể thử lại; high cho lập trình và nghiên cứu bình thường; để dành max cho các tác vụ mà một lần thử nữa hoặc một trường hợp biên bị bỏ tốn hơn các token thêm. Hãy coi đây là các giả thuyết xuất phát và đo chi phí tác vụ được chấp nhận.

Trong chế độ thinking, temperature và các phạt presence/frequency bị bỏ qua, và top_p có mức tối thiểu 0.95. Với công cụ, client phải trả về đủ reasoning_content từ thông điệp assistant cùng kết quả công cụ; bỏ nó gây một phản hồi 400. Quy tắc trạng thái đó quan trọng hơn việc chép một bộ tham số OpenAI quen thuộc.

So sánh benchmark với OpenAI và Anthropic

Bảng này tái hiện các kết quả được chọn từ Bảng 3 của báo cáo kỹ thuật DeepSeek. Mọi mô hình được hiện ở thiết lập Max của báo cáo. DeepSeek dùng các scaffold bắt buộc hoặc chính thức khác nhau cho một số đánh giá, một ngữ cảnh DeepSeek Harness 1M cho lập trình, và một ngữ cảnh Claude Code 512K cho các tác vụ Agent thị giác. Các số là bằng chứng do nhà cung cấp báo cáo, không phải một bài kiểm tra đối đầu độc lập và không phải một SLA production.

Đánh giá V4 Flash V4 Pro V4.1 Flash GPT-5.6 Sol Claude Opus 5
GPQA Diamond, Pass@1 89.9 92.4 90.9 94.1 93.4
Terminal-Bench 2.1, Pass@1 82.7 87.9 90.6 88.8 89.1
Terminal-Bench 3.0, Pass@1 7.6 11.8 30.0 34.4 43.3
Terminal-Bench 4.0, Pass@1 7.0 12.4 31.2 39.9 51.8
DeepSWE v1.1, resolved 54.4 62.7 74.2 73.0 74.0
CyberGym, Pass@1 76.7 83.3 88.1 84.5
HLE with tools, Pass@1 51.5 60.0 63.9 63.6
AutomationBench, Pass@1 37.7 43.2 54.8 45.8 50.3
Agents' Last Exam, Pass@1 25.2 25.7 31.8 26.7 28.6
Chartography with tools, Pass@1 78.9 79.9 84.0

Cách đọc mạnh nhất thì cụ thể. V4.1 Flash bước một bước lớn so với V4 Flash trên các tác vụ Agent và cạnh tranh với GPT-5.6 Sol cùng Claude Opus 5 trên DeepSWE, Terminal-Bench 2.1, tự động hóa và HLE dùng công cụ. Nó không dẫn GPQA, các phiên bản Terminal-Bench sau, hay Chartography. Bản thân báo cáo cảnh báo rằng gần ngang trên các tác vụ thường không nghĩa là ngang tuyến đầu trên suy luận khó nhất và các trường hợp biên.

GPT-6 Astra và Claude Fable 5.1 bị bỏ khỏi bảng điểm này vì báo cáo DeepSeek không công bố cùng dữ liệu so sánh theo từng dòng cho chúng. Thêm điểm từ các trang nhà cung cấp riêng sẽ tạo một harness chung giả. Các đội nên đánh giá mọi ứng viên trên cùng các tác vụ kho, công cụ, timeout, chính sách mạng và các kiểm tra nghiệm thu.

Tương thích API thì rộng nhưng không giống hệt

Dịch vụ chính thức phơi OpenAI Chat Completions, OpenAI Responses và một API tương thích Anthropic. Bề rộng đó giảm việc chuyển, nhưng tương thích mô tả hình của yêu cầu chứ không phải ngữ nghĩa vòng đời giống hệt.

Bề mặt Hành vi DeepSeek V4.1 Flash Hệ quả khi chuyển
Chat Completions Streaming, đầu ra JSON, function call; prefix/FIM ở chế độ không thinking Các client OpenAI hiện có là điểm bắt đầu đơn giản nhất
Responses Không trạng thái; hỗ trợ hàm và ảnh Tự lưu bền cả hội thoại
Các trường trạng thái Responses previous_response_id, hội thoại, store, background và quản lý ngữ cảnh không được hỗ trợ hoặc bị bỏ qua Một phản hồi 200 không chứng minh các tính năng đó có hiệu lực
Công cụ được host Web search, file search, code interpreter, computer use và các built-in MCP bị bỏ qua; hỗ trợ custom-tool có hạn Thực thi công cụ trong ứng dụng và kiểm mọi trường đã yêu cầu
Tóm tắt suy luận Nội dung summary và suy luận mã hóa không được hỗ trợ Đừng phụ thuộc các trường bàn giao suy luận kiểu OpenAI
Định dạng Anthropic Hình thông điệp Anthropic được chấp nhận Giữ các quy tắc suy luận và trạng thái công cụ của DeepSeek, đừng giả định ngữ nghĩa Claude
Thị giác Ảnh được chấp nhận trong đầu vào người dùng và đầu ra công cụ Kiểm kích thước payload, chế độ detail và số ảnh

Hướng dẫn Responses của DeepSeek cũng liệt kê các trường bị bỏ qua như metadata, mẫu prompt, truncation, service tier, safety identifier, khóa/thời gian giữ prompt-cache và các tùy chọn stream. Bỏ qua im lặng là một mối nguy tương thích: việc chấp nhận schema có thể giấu hành vi thiếu. Hãy dựng một yêu cầu kiểm conformance cho mỗi tính năng ứng dụng của bạn phụ thuộc. Hướng dẫn API tương thích OpenAI giải thích vì sao hình endpoint và năng lực cần các kiểm tra riêng.

Các mô hình hiện tại của OpenAI cung cấp một hệ công cụ Responses gốc rộng hơn và các tính năng trạng thái được quản lý. API gốc của Anthropic có hợp đồng khối thinking và dùng công cụ đã chín của riêng nó. Lợi thế của DeepSeek là một mô hình nhận cả ba phương ngữ thường gặp; cái giá là phần giao nhỏ hơn bề mặt gốc đầy đủ của mỗi đối thủ.

Giới hạn thị giác và kinh tế ảnh

Hướng dẫn thị giác chính thức hỗ trợ JPEG, PNG, GIF và WebP qua base64, URL ngoài hoặc Files API. Ảnh được tự động đổi kích thước về khoảng 1,300×1,300 và dùng nhiều nhất 1,024 token đầu vào mỗi ảnh. low detail dùng một khung 512×512; highoriginal giữ nhiều chi tiết hơn; auto hiện hành xử như original.

Giới hạn Giá trị chính thức
Thân yêu cầu 48 MiB
Ảnh nhúng hoặc lấy từ ngoài 32 MiB mỗi ảnh
Ảnh được tham chiếu bằng file ID 64 MiB mỗi ảnh
Số ảnh mỗi yêu cầu 600
Tổng byte ảnh 64 MiB khi không có file ID; 200 MiB khi có file ID
Cạnh dài 8,192 px; 4,096 px khi gửi 15 ảnh trở lên
Trần token thị giác 1,024 token mỗi ảnh sau khi xử lý

Ở mức tối đa 1,024 token thị giác, một ảnh chưa cache đóng góp khoảng $0.0001536 ngoài giờ cao điểm hoặc $0.0003072 giờ cao điểm theo các mức giá đầu vào đã công bố, trước chữ đi kèm và đầu ra. Phép tính này hữu ích cho ước lượng quy mô, nhưng việc đổi kích thước ảnh, hành vi cache và lượng token thị giác thực có thể đổi khoản phí. Nhiều ảnh hơn cũng tiêu ngữ cảnh lẽ ra giữ được chữ hoặc lịch sử công cụ.

V4.1 Flash hợp với ảnh chụp tài liệu, biểu đồ, OCR và các quan sát Agent thị giác. Nó không phải mô hình sinh ảnh. Với ảnh được sinh, hãy dùng một mô hình và endpoint được thiết kế để trả pixel chứ không phải chữ.

Giá API chính thức được so

Trang giá DeepSeek đưa các mức sau vào lúc 04:00 UTC ngày 10 tháng 9. Các cửa sổ giờ cao điểm ngày thường là 01:00–04:00 và 06:00–10:00 UTC; mọi thời điểm ngày thường khác và cuối tuần dùng mức ngoài giờ cao điểm. Cache ngữ cảnh của DeepSeek là tự động, nên “đầu vào đã cache” nghĩa là một lần trúng cache được báo, không phải một cờ cache ép một lần trúng.

Các mức OpenAI lấy từ bảng so sánh mô hình hiện tại của nó; các mức Anthropic lấy từ trang giá của nó. Giá trị là USD cho mỗi một triệu token. Anthropic cũng tính phí ghi cache; chúng bị bỏ ở đây vì bảng chỉ so đầu vào mới, lần đọc cache và đầu ra.

Mô hình Ngữ cảnh / đầu ra tối đa Đầu vào mới hoặc miss Đầu vào đã cache/đọc Đầu ra
DeepSeek V4.1 Flash, ngoài giờ cao điểm 1M / 384K $0.15 $0.003 $0.60
DeepSeek V4.1 Flash, giờ cao điểm 1M / 384K $0.30 $0.006 $1.20
DeepSeek V4.1 Flash trên Modelflare giới hạn mô hình 1M / 384K $0.193548 $0.003871 $0.774194
GPT-5.6 Luna 1.05M / 128K $0.20 $0.02 $1.20
GPT-5.6 Terra 1.05M / 128K $2.00 $0.20 $12.00
GPT-5.6 Sol 1.05M / 128K $4.00 $0.40 $20.00
GPT-6 Astra 1.05M / 128K $10.00 $1.00 $50.00
Claude Sonnet 5 1M / 128K $2.00 $0.20 $10.00
Claude Opus 5 1M / 128K $5.00 $0.50 $25.00
Claude Fable 5.1 1M / 128K $10.00 $0.25 $50.00

Giá tự nó không phải giá trị. Các tokenizer khác nhau có thể tính số token khác nhau cho cùng một đoạn chữ; Anthropic lưu ý rằng tokenization mới hơn có thể sinh khoảng 30% token nhiều hơn trên một số tải. Các mô hình cũng có thể cần độ dài đầu ra, lần thử lại và sửa chữa của người khác nhau. Hãy so chi phí trên mỗi tác vụ được chấp nhận, không chỉ dòng có số đầu vào nhỏ nhất.

Danh mục công khai hiện tại của Modelflare phơi một mức nằm giữa hai khung giờ của DeepSeek: nó khoảng 64.5% mức giờ cao điểm bên thứ nhất, hoặc thấp hơn 35.5% trong các cửa sổ giờ cao điểm, trong khi nó cao hơn khoảng 29.0% so với mức ngoài giờ cao điểm của DeepSeek. Biểu giá gateway được liệt kê do đó hôm nay không có điều chỉnh khung giờ; các tải linh hoạt dùng ổn định được cửa sổ ngoài giờ cao điểm của DeepSeek vẫn có thể trả ít hơn qua API bên thứ nhất.

OpenAI áp các mức cao hơn khi ngữ cảnh đầu vào vượt 272K: cả yêu cầu dùng giá đầu vào và đầu vào đã cache gấp 2× và giá đầu ra gấp 1.5×. Biên này quan trọng trong kịch bản ngữ cảnh dài bên dưới. DeepSeek dùng các cửa sổ thời gian thay vào đó; các mô hình một triệu token được liệt kê của Anthropic không dùng cùng biên 272K trong bảng giá được dẫn.

Hai kịch bản chi phí tái lập được

Kịch bản A là một yêu cầu với 100K đầu vào chưa cache và 10K đầu ra. Công thức là 0.1 × input rate + 0.01 × output rate. Nó giả định không có đầu vào đã cache, công cụ, lần thử lại, thuế hoặc khoản cộng riêng của nhà cung cấp.

Mô hình Chi phí kịch bản A
DeepSeek V4.1 Flash, ngoài giờ cao điểm $0.021
DeepSeek V4.1 Flash trên Modelflare $0.0271
GPT-5.6 Luna $0.032
DeepSeek V4.1 Flash, giờ cao điểm $0.042
Claude Sonnet 5 $0.300
GPT-5.6 Terra $0.320
GPT-5.6 Sol $0.600
Claude Opus 5 $0.750
GPT-6 Astra / Claude Fable 5.1 $1.500

Kịch bản B là chi phí biên của một yêu cầu cache ấm với 900K đầu vào đã cache, 100K đầu vào mới và 20K đầu ra. Nó cố ý loại yêu cầu trước đó đã lập cache. Công thức: 0.9 × cache-read rate + 0.1 × input rate + 0.02 × output rate. Các hệ số ngữ cảnh dài trên cả yêu cầu của OpenAI được áp vì ngữ cảnh đầu vào tổng cộng một triệu token.

Mô hình Chi phí biên kịch bản B
DeepSeek V4.1 Flash, ngoài giờ cao điểm $0.0297
DeepSeek V4.1 Flash trên Modelflare $0.0383
DeepSeek V4.1 Flash, giờ cao điểm $0.0594
GPT-5.6 Luna $0.1120
Claude Sonnet 5 $0.5800
GPT-5.6 Terra $1.1200
Claude Opus 5 $1.4500
GPT-5.6 Sol $2.1200
Claude Fable 5.1 $2.2250
GPT-6 Astra $5.3000

Phép so giữ số lượng token bằng nhau; nó không nhận chất lượng bằng nhau. Cache của DeepSeek là best effort, trong khi việc tạo cache của Anthropic có giá ghi và thời gian sống riêng. Một bài kiểm tra tải công bằng ghi token hit/miss cache, mọi lần thử, tổng đầu ra gồm suy luận bị tính phí, thời gian trôi, tỷ lệ nghiệm thu và số phút sửa của người. Hướng dẫn theo dõi chi phí đưa khung hạch toán.

Trọng số mở không làm việc tự host thành nhỏ

Bản phát hành Hugging Face được cấp phép MIT và ghi các đường phục vụ vLLM và SGLang. Trong ảnh chụp được kiểm cho bài này, kho chứa 48 mảnh safetensor và khoảng 510.3 GB tệp Git-LFS tại commit dba1be0a40aa45a94ad051997016db3960a90277. Số byte đó là một tạo phẩm tải xuống, không phải RAM GPU đã đo.

Hệ thống vẫn có một xương sống 552B, bộ nhớ Engram 196B được định địa chỉ trên host, định tuyến expert, các đường cache FP4/FP8, prefetch RDMA và lưu KV bền. Thông báo phát hành của DeepSeek mời các đội đang lên kế hoạch một triển khai quy mô lớn với 2,000 GPU cộng một cụm lưu trữ liên hệ công ty. Ví dụ đó báo hiệu quy mô của hệ phục vụ đầy đủ; nó không phải mức tối thiểu đã nêu cho mọi triển khai. Các triển khai nghiên cứu nhỏ hơn có thể dùng lượng tử hóa hoặc song song khác, nhưng không nên suy ra từ kinh tế API của nhà cung cấp.

Trọng số mở cho các đội quyền truy cập checkpoint, khả năng kiểm và quyền kiểm chính sách triển khai. Chúng không tự tái tạo fusion kernel, phân cấp cache, lập lịch DSpark, batching hoặc độ trễ API công khai của DeepSeek. Hãy so một kế hoạch tự host với thông lượng đã đo, khôi phục sự cố, dung lượng nhàn, băng thông lưu trữ và nhân công vận hành.

DeepSeek V4.1 Flash trên Modelflare

DeepSeek V4.1 Flash đã lên sóng trên Modelflare. Lần ra mắt được người vận hành xác nhận nhìn thấy độc lập trong danh mục giá Modelflare công khai và danh mục origin. Lúc 2026-09-10 15:21 UTC, cả hai đều phơi bản ghi deepseek-v4.1-flash-0910 mới; cấu hình production cho thấy một ability deepseek-stable đã bật và một tuyến đã bật quảng cáo cùng mô hình.

Hạng mục Modelflare Giá trị đang sống
ID mô hình để gửi deepseek-v4.1-flash-0910
Mức sẵn sàng Đang sống trong danh mục công khai và nhóm định tuyến đã bật
Nhóm công khai deepseek-stable
Giá đầu vào $0.193548 / 1M token
Giá đầu vào đã cache $0.003871 / 1M token
Giá đầu ra $0.774194 / 1M token
Các loại endpoint /v1/chat/completions/v1/responses

Các giá được suy từ hệ số đầu vào cơ sở $0.322580645 của mục đang sống, tỷ lệ nhóm công khai 0.6, tỷ lệ cache 0.02 và tỷ lệ completion 4×. Với hai tải đã tính ở trên, chi phí Modelflare khoảng $0.0271$0.0383. Hãy dùng trang giá DeepSeek V4.1 Flash đang sống cho ID mô hình và biểu giá hiện tại.

Các tầng bằng chứng vẫn quan trọng. Danh mục công khai và tuyến production đã bật xác lập việc sản phẩm có sẵn, và người vận hành xác nhận ra mắt một cách rõ. Đến 15:30 UTC, các bản ghi production chứa sáu lời gọi Chat Completions đã hoàn thành dưới đúng ID mô hình mới, tổng 216 token prompt và 173 token completion. Điều đó kiểm chứng việc điều phối Chat Completions đã xác thực và đầu ra bị tính phí. Đó vẫn là một mẫu ra mắt quá nhỏ để đo độ trễ hoặc mức sẵn sàng, và nó không độc lập chứng minh hành vi Responses hoặc đa phương thức qua tuyến này. Các đội nên chạy yêu cầu nghiệm thu nhỏ của chính mình trên đúng endpoint trước khi chuyển việc production.

Chỗ DeepSeek V4.1 Flash có lợi thế thật

Mô hình có một lợi thế mạch lạc khi đầu vào dài, các lượt công cụ dày và ngân sách đều quan trọng. Kiến trúc giảm áp lực prefill và cache; giá API biến các khoản tiết kiệm đó thành một biểu giá công khai thấp bất thường; trần đầu ra 384K để lại khoảng trống cho các bản vá hoặc báo cáo dài; và checkpoint giữ một đường tự host mở.

Tải Vì sao V4.1 Flash là ứng viên mạnh Cần đo gì
Agent kho mã Kết quả DeepSWE và terminal do nhà phát hành báo cáo mạnh, ở mức giá token thấp Thay đổi được chấp nhận, tỷ lệ test qua, lần thử lại và thời gian sửa
Tổng hợp nghiên cứu dài Đầu vào 1M, lần trúng cache rẻ và đầu ra 384K Độ đúng trích dẫn, việc giữ yêu cầu và tổng đầu ra
Agent tài liệu thị giác Ảnh gốc, huấn luyện OCR/biểu đồ và các API Agent thường gặp Độ đúng trường, độ nhạy crop/detail và lượng token thị giác
Tự động hóa khối lượng cao Giá giờ cao điểm và ngoài giờ cao điểm đều thấp; trần đồng thời 2,500 yêu cầu Thời gian xếp hàng, tỷ lệ 429, lỗi công cụ và chi phí mỗi lần thành công
Triển khai được kiểm soát Checkpoint MIT và các đường vLLM/SGLang đã ghi Mức dùng phần cứng, băng thông cache/lưu trữ và chi phí vận hành

Nhận định production mạnh nhất do đó là năng lực Agent ngữ cảnh dài, hiệu quả về chi phí, không phải “mô hình tốt nhất nói chung.” Nếu mô hình hoàn thành một tác vụ thật trong một lần chạy được chấp nhận ở chỗ một mô hình nhỏ rẻ hơn cần vài lần sửa, V4.1 thắng về kết quả. Nếu một mô hình đóng tuyến đầu ngăn một thất bại đắt, giá token cao hơn của nó vẫn có thể kinh tế.

Chỗ OpenAI hoặc Anthropic vẫn là lựa chọn an toàn hơn

Hãy chọn một mô hình OpenAI khi ứng dụng phụ thuộc hệ sinh thái Responses đầy đủ, trạng thái được quản lý, công cụ được host, hoặc một hợp đồng riêng của OpenAI mà DeepSeek bỏ qua. GPT-5.6 Luna là đối thủ giá đặc biệt gần cho các tải ngắn hơn, chưa cache; Terra, Sol và Astra đổi các giá niêm yết cao hơn nhiều lấy các bậc năng lực khác nhau và các tính năng nền tảng gốc.

Hãy chọn một mô hình Anthropic khi hợp đồng công cụ/thinking gốc của Claude, các kiểm soát cache, hoặc hiệu năng đã đo trên công việc Agent khó nhất của bạn quan trọng hơn giá niêm yết token. Trong bảng của chính DeepSeek, Claude Opus 5 dẫn Terminal-Bench 3/4 và Chartography; Claude Fable 5.1 được đặt cho công việc chân trời dài đòi hỏi nhất, dù nó đắt hơn đáng kể trên mỗi token mới và token đầu ra.

Với các hành động then chốt về an toàn hoặc đắt đỏ, việc chọn tuyến nên dựa trên các kiểu thất bại đã đánh giá và các biên quyền, không phải thương hiệu hay trung bình benchmark. Hãy dùng hướng dẫn định tuyến để tách việc thử lại được, các fallback và các hành động có tác dụng phụ.

Danh sách kiểm tra triển khai

  1. Dùng deepseek-flash cho API bên thứ nhất và ghi riêng mọi ánh xạ riêng của gateway.
  2. Bắt đầu ở effort high, rồi đo low và max trên cùng tập tác vụ được chấp nhận; đừng ánh xạ tên giữa các nhà cung cấp như cùng một lượng tính toán.
  3. Khi công cụ được dùng trong chế độ thinking, hãy trả về đủ reasoning_content đúng như yêu cầu.
  4. Kiểm mọi trường Responses bạn phụ thuộc; các tham số bị từ chối và bị bỏ qua im lặng cần cách xử lý khác.
  5. Ghi token cache-hit và cache-miss, token đầu ra/suy luận, lần thử lại, độ trễ và nghiệm thu cuối.
  6. Thiết kế kinh tế cache quanh các lần trúng quan sát được chứ không quanh một giả định giữ cố định.
  7. Ép các giới hạn byte, số lượng, kích thước và detail của ảnh trước khi gửi yêu cầu đa phương thức.
  8. Giữ ủy quyền phía ứng dụng, tính lũy đẳng của công cụ và kiểm đầu ra độc lập với chất lượng mô hình.
  9. Kiểm lại giá theo cửa sổ thời gian, các bí danh mô hình và các giới hạn đồng thời trước khi ra mắt.
  10. Chạy một yêu cầu đã xác thực thật trên đúng tuyến; một danh mục mô hình hoặc HTTP 200 một mình không phải bằng chứng năng lực.

Câu hỏi thường gặp

DeepSeek V4.1 Flash có tốt hơn GPT-6 Astra hoặc Claude Fable 5.1 không? Không phải như một nhận định phổ quát. V4.1 Flash có lợi thế lớn về giá và trọng số mở cùng các điểm Agent do nhà cung cấp báo cáo mạnh. Bản thân DeepSeek nói các mô hình đóng lớn nhất giữ một lợi thế trên suy luận khó nhất và các trường hợp biên. Không có so sánh Astra/Fable cùng harness trong báo cáo V4.1.

DeepSeek V4.1 Flash có bao nhiêu tham số? Báo cáo liệt kê một xương sống 552B tham số cộng 196B tham số Engram. Nó kích hoạt khoảng 8B tham số xương sống mỗi token prefill và 16B mỗi token được giải mã. Chỉ nói “552B tổng” thì bỏ Engram; nói “748B đang hoạt động” cũng sai.

Ngữ cảnh và giới hạn đầu ra của nó là gì? Các giới hạn chính thức là một triệu token ngữ cảnh và tới 384K token đầu ra. Embedding ảnh, chữ, lịch sử công cụ và suy luận đều tiêu các ngân sách liên quan.

Vì sao nó được gọi là Flash? Thiết kế tập trung vào chi phí phục vụ thấp hơn: kích hoạt prefill/decode bất đối xứng, attention thưa đã nén, KV toàn cục FP4, replay bền có biên và giải mã suy đoán. “Flash” không hứa độ trễ thấp nhất cho mọi prompt hoặc mọi điều kiện hàng đợi.

Cache công khai có kéo dài 72 giờ không? Đừng giả định vậy. Báo cáo kỹ thuật mô tả một thiết kế triển khai với KV toàn cục bền ít nhất 72 giờ. Hướng dẫn API công khai gọi việc cache là best effort và nói các mục thường được xóa sau vài giờ hoặc vài ngày. Việc tính phí nên dùng các trường hit/miss quan sát được.

API Responses có phải bản thay thế thả vào cho OpenAI Responses không? Nó nhận một hình quen, nhưng nó không trạng thái và bỏ qua nhiều trường OpenAI cùng các công cụ được host. Hãy kiểm đúng hợp đồng năng lực bạn cần.

Nó sinh được ảnh không? Nó hiểu đầu vào ảnh và trả chữ. Nó không phải mô hình sinh ảnh.

Hôm nay tôi gọi được V4.1 Flash qua Modelflare không? Có. Hãy dùng deepseek-v4.1-flash-0910 trong nhóm deepseek-stable với Chat Completions hoặc Responses. Đây là ID đóng dấu phát hành của Modelflare; bí danh bên thứ nhất deepseek-flash là một hợp đồng nhà cung cấp riêng.

Nguồn, phương pháp và nhật ký cập nhật

Bài viết này ưu tiên các nguồn bên thứ nhất và tách sự kiện đã ghi, các đánh giá do DeepSeek báo cáo, các ví dụ đã tính và trạng thái danh mục Modelflare quan sát được. Không có benchmark mô hình độc lập nào được chạy. Phép tính chi phí được giữ trong tạo phẩm nguồn đi kèm, và mọi kịch bản nêu vector token cùng các loại trừ của nó. Ảnh bìa không chữ là một minh họa biên tập do AI sinh theo phong cách hình của Modelflare hiện có.

Các nguồn chính: bản phát hành DeepSeek V4.1 Flash, báo cáo kỹ thuật, model card, giá, thinking, Responses, tương thích Anthropic, thị giác, cache ngữ cảnh, so sánh mô hình OpenAI, giá Anthropic, và danh mục công khai Modelflare.

Cập nhật 2026-09-10: đánh giá ngày công bố ban đầu. Nó ghi ID mô hình bên thứ nhất, giá giờ cao điểm/ngoài giờ cao điểm đang hiệu lực, thông báo chuyển bí danh ngày 14 tháng 9, các giới hạn API hiện tại, kiến trúc trong báo cáo kỹ thuật và dữ liệu benchmark. Một cập nhật cùng ngày sau đó thêm lần ra mắt Modelflare đã xác nhận dưới deepseek-v4.1-flash-0910, các giá gateway đang sống và các chi phí gateway đã tính. Hãy kiểm lại các sự kiện có thể đổi trước khi triển khai.