Qwen3.8-Max: thông số MoE 2.4T và cấu hình Modelflare
Hướng dẫn Qwen3.8-Max: MoE 2.4T/95B, ngữ cảnh đa phương thức 1M tokens, kiểm soát suy luận, giá Modelflare hiện tại và cấu hình triển khai.
Đội ngũ Qwen chính thức phát hành Qwen3.8-Max vào ngày 3 tháng 8 năm 2026. Đây không phải mô hình cũ Qwen3-8B dễ bị nhầm lẫn, và cũng không còn chỉ là qwen3.8-max-preview của tháng 7: ID mô hình API chính thức hiện tại là qwen3.8-max, cũng là ID được Modelflare sử dụng.
Đây là mô hình flagship Max lớn nhất hiện nay của Qwen, hướng đến coding, workflow chuyên nghiệp, Agent dài hạn và tác vụ đa phương thức native. Qwen đồng thời thông báo open weights của Qwen3.8-Max và Qwen3.8-27B sẽ xuất hiện vào tuần kế tiếp. Cho đến khi kho mã và giấy phép thực sự được công bố, cách nói chính xác vẫn là “đã công bố kế hoạch open weights”, không phải “đã có thể triển khai cục bộ”.
Thông số chính
| Hạng mục | Qwen3.8-Max |
|---|---|
| ID mô hình trên Modelflare | qwen3.8-max |
| Kiến trúc | Mixture-of-Experts (MoE) |
| Tổng số tham số | 2.4T |
| Tham số được kích hoạt trên mỗi Token | 95B |
| Độ dài ngữ cảnh | 1M tokens |
| Đầu vào tối đa khi không suy luận | 991K tokens |
| Đầu vào tối đa khi suy luận | 983K tokens |
| Đầu ra tối đa | 131K tokens |
| Token suy luận tối đa | 262K tokens |
| Phương thức đầu vào | Văn bản, hình ảnh và video |
| Phương thức đầu ra | Văn bản |
| Mức suy luận | low, medium hoặc xhigh; mặc định xhigh |
| Tính năng chính thức | Prefix Completion, Function Calling, Context Cache, Structured Outputs, Batch và công cụ tích hợp của Responses |
2.4T là tổng quy mô mô hình, không phải số tham số được thực thi để tạo mỗi Token. Bản phát hành chính thức nêu 95B tham số được kích hoạt, con số hữu ích hơn để hiểu lượng tính toán thực sự tham gia vào suy luận MoE. Ngữ cảnh 1M tokens cũng không có nghĩa mọi request đều nên dùng hết giới hạn: khi đầu vào và ngân sách suy luận tăng, độ trễ, cache và chi phí cần được thiết kế riêng.
Qwen3.8-Max hướng đến điều gì
Qwen định vị bản phát hành này là nâng cấp rộng cho coding và Cowork, tập trung vào ba loại công việc:
- Hoàn thành dự án phần mềm kéo dài nhiều ngày từ một thư mục trống, thay vì chỉ tạo các hàm riêng lẻ.
- Tổ chức sản phẩm bàn giao nhiều bước cho nghiên cứu, phân tích dữ liệu, Office, thiết kế và workflow chuyên nghiệp khác.
- Dùng khả năng hiểu hình ảnh và video trong toàn bộ khâu lập kế hoạch, thực thi và xác minh, thay vì chỉ nhận dạng tĩnh một lần.
Qwen đưa ra các trình diễn từ nhà cung cấp, gồm hơn mười ngày coding tự chủ và hàng trăm vòng tối ưu thiết kế chip. Đây là ví dụ ở cấp hệ thống, chịu ảnh hưởng của Harness, công cụ, môi trường, prompt và phương pháp chấm. Chúng không đảm bảo ứng dụng của bạn sẽ có kết quả tương tự. Việc chọn mô hình cho sản xuất nên dùng repository, tài liệu, quyền công cụ và tiêu chí nghiệm thu của chính bạn trên một tập mẫu cố định.
Chọn mức suy luận
Qwen3.8-Max hỗ trợ reasoning_effort:
lowcho câu trả lời ngắn, giải thích mã nhẹ và tác vụ nhạy cảm về chi phí.mediumlàm điểm bắt đầu cho phát triển hằng ngày, phân tích và tác vụ nhiều bước.xhighcho suy luận khó, Agent dài hạn và công việc chuyên môn phức tạp; đây cũng là giá trị mặc định.
Qwen cho biết preserve_thinking được bật mặc định để công việc nhiều lượt có thể tiếp tục từ trạng thái suy luận trước đó. Nếu client tự dựng lại lịch sử tin nhắn, hãy giữ các trường suy luận và trạng thái công cụ do nhà cung cấp trả về, thay vì chỉ nối văn bản cuối. Mô hình cho phép tối đa 262K tokens suy luận, nhưng giới hạn có thể dùng không phải giá trị mặc định được khuyến nghị. Hãy chọn effort dựa trên tỷ lệ thành công của tác vụ và chi phí đơn vị.
Khả năng cung cấp hiện tại trên Modelflare
Tính đến ngày 4 tháng 8 năm 2026, Modelflare liệt kê qwen3.8-max cho:
- OpenAI Chat Completions;
- OpenAI Responses;
- một tuyến tương thích với Anthropic Messages.
Nhãn giao thức chỉ chứng minh tuyến đó tồn tại, không chứng minh mọi tính năng riêng của QwenCloud đều tự động được chuyển tiếp. QwenCloud liệt kê web_search, code_interpreter, web_extractor, t2i_search và i2i_search là công cụ tích hợp của Responses. Cho đến khi từng tính năng được kiểm tra qua đúng tuyến Modelflare, hãy ưu tiên Function Calling do client định nghĩa và coi công cụ tích hợp là chưa được xác minh.
Mức giá công khai hiện tại của nhóm qwen-award được trình bày dưới đây, đơn vị USD trên 1 triệu tokens:
| Hạng mục tính phí | Giá |
|---|---|
| Đầu vào | $1.239 |
| Đầu ra | $3.71 |
| Đọc cache | $0.161 |
| Tạo cache tường minh | $1.547 |
| Tạo cache tường minh trong một giờ | $2.4752 |
Nhóm chỉ dành cho API Keys đủ điều kiện. Giá, điều kiện sử dụng và phạm vi giao thức có thể thay đổi; hãy dùng Mô hình và giá cùng log sử dụng theo request làm nguồn cập nhật.
Cấu hình Chat Completions được đề xuất
Trước tiên, lưu Modelflare API Key vào biến môi trường:
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
Bắt đầu bằng request văn bản để xác minh tuyến cơ bản:
curl -N -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Design a safe rollout plan for this service and include validation and rollback gates."
}
],
"reasoning_effort": "medium",
"stream": true
}'
Dùng medium để xây dựng mốc chất lượng, độ trễ và chi phí, sau đó chỉ nâng tác vụ thực sự cần suy luận sâu hơn lên xhigh. Việc upstream đặt mặc định xhigh không phải lý do để cấp ngân sách suy luận tối đa cho mọi request hàng loạt.
Triển khai đầu vào đa phương thức
Mô hình chính thức nhận văn bản, hình ảnh và video, nhưng định dạng nội dung đa phương thức thay đổi theo giao thức và triển khai upstream. Hãy triển khai theo ba bước:
- Xác minh xác thực, quyền truy cập mô hình, streaming và tính phí chỉ bằng văn bản.
- Dùng một hình ảnh kiểm thử cố định để xác minh định dạng nội dung, giới hạn kích thước và đầu ra.
- Sau đó mới thêm video dài, công cụ hoặc phản hồi thị giác nhiều lượt, đồng thời kiểm tra retry có làm trùng công việc tính phí hay không.
Không coi URL hình ảnh, payload Base64, upload tệp và object storage của nhà cung cấp là các giao thức có thể thay thế lẫn nhau. Hãy kiểm thử end-to-end đúng khối nội dung mà client thực sự gửi.
Cấu hình nền tảng được đề xuất
- Dùng API Key riêng cho từng ứng dụng và xác nhận nhóm chính thực sự liệt kê
qwen3.8-max. - Bắt đầu phát triển và phân tích hằng ngày với
medium, giảm tác vụ ngắn xuốnglowvà chỉ dùngxhighcho công việc khó, dài hạn. - Thiết kế chia đoạn và cache cho tác vụ ngữ cảnh dài, thay vì đưa toàn bộ cơ sở tri thức vào mỗi ngữ cảnh 1M tokens.
- Xác minh riêng wire contract của Chat Completions, Responses và Anthropic.
- Không biến công cụ tích hợp của nhà cung cấp thành phụ thuộc sản xuất cho đến khi nó vượt qua request thực trên tuyến Modelflare mục tiêu.
- So sánh tỷ lệ thành công, đầu ra đầu tiên, tổng độ trễ, Token suy luận, cache hit và chi phí mỗi request trên một tập tác vụ cố định.
- Chạy lại mẫu regression khi chuyển từ preview sang mô hình chính thức; không giả định cùng tên họ mô hình sẽ đảm bảo đầu ra giống nhau.
Trường hợp phù hợp và trường hợp cần so sánh
Qwen3.8-Max phù hợp với software engineering phức tạp, workflow chuyên nghiệp nhiều bước, hiểu tài liệu dài và video, Agent có phản hồi đa phương thức, cùng đội ngũ muốn hợp nhất suy luận và điều phối trong một mô hình flagship. Với chuyển đổi văn bản đơn giản cần throughput cao và độ trễ thấp, đây có thể không phải lựa chọn mặc định kinh tế nhất. Hãy so sánh với Qwen Flash, DeepSeek V4 Flash hoặc mô hình nhỏ hơn trên cùng đầu vào.
Nguồn và ngày xác minh
- Bản phát hành Qwen3.8-Max chính thức: ngày phát hành, 95B tham số được kích hoạt, trình diễn Coding/Cowork và kế hoạch open weights.
- Trang mô hình Qwen3.8-Max của QwenCloud: ngữ cảnh, giới hạn đầu vào và đầu ra, phương thức, tính năng chính thức và giá.
- Mô hình và giá Modelflare: nhóm, giao thức và mức giá nền tảng hiện tại.
Bài viết được xác minh ngày 4 tháng 8 năm 2026. Trạng thái open weights, snapshot mô hình, giá và hỗ trợ giao thức có thể thay đổi; khi triển khai sản xuất, hãy dùng trang mô hình chính thức, giấy phép repository weights và danh mục live của Modelflare tại thời điểm gọi.