GLM-5.3, Kimi K3 và Qwen3.8-Max: năng lực, giá và kết nối API

Hướng dẫn đã kiểm chứng về GLM-5.3, Kimi K3 và Qwen3.8-Max gồm năng lực từ nguồn chính chủ, giá và nhóm Modelflare, ví dụ Chat Completions, Responses, Anthropic Messages cùng kiểm tra production.

Modelflare hiện cung cấp glm-5.3, kimi-k3qwen3.8-max qua một gateway tương thích duy nhất. Hướng dẫn ra mắt này trình bày công việc phù hợp với từng mô hình, ảnh chụp giá USD hiện tại, ba hợp đồng request và lộ trình an toàn từ tạo API Key đến probe production.

Nội dung dưới đây tách tài liệu chính chủ của nhà cung cấp khỏi dữ kiện trong catalog Modelflare. Khả năng do nhà cung cấp công bố không tự động trở thành tính năng gateway đã mở; hãy luôn kiểm tra dòng mô hình hiện tại và endpoint mà client thực sự dùng.

Tính khả dụng, nhóm và giá có thể thay đổi được kiểm tra vào ngày 29 tháng 8 năm 2026. Sau ngày đó, hãy dùng trang giá Modelflare làm nguồn chuẩn.

Tổng quan ba mô hình

ID mô hình Điểm bắt đầu phù hợp Ghi chú từ nguồn chính chủ Ngữ cảnh và suy luận
glm-5.3 Lập trình phức tạp và tác vụ Agent dài hạn Z.ai định vị GLM-5.3 cho coding khó và tác vụ agent dài hơn; thinking luôn bật trong API Thinking luôn bật; các mức được ghi là low, high, max, mặc định max
kimi-k3 Lập trình ngữ cảnh dài và công việc tri thức Kimi ghi nhận khả năng hiểu hình ảnh native và công việc end-to-end dài hạn Ngữ cảnh tối đa 1M; thinking luôn bật; low, high, max, mặc định max
qwen3.8-max Workflow chuyên nghiệp và Agent dài hạn Qwen ghi nhận MoE tổng 2,4T / kích hoạt 95B, coding, đầu vào hình ảnh và workflow dùng tool Ngữ cảnh 1M; đầu vào văn bản, hình ảnh, video; đầu ra văn bản; một số tool phụ thuộc khu vực và endpoint

Xem thông báo GLM-5.3, hướng dẫn chọn mô hình Kimitài liệu Qwen3.8-Max để đọc mô tả hiện tại của nhà cung cấp. Điểm benchmark do nhà cung cấp tự báo cáo, không phải cam kết của Modelflare.

Chọn theo workload

  • Chọn glm-5.3 khi tác vụ cần lập kế hoạch liên tục, thay đổi code khó hoặc vòng lặp Agent dài và ngân sách chấp nhận reasoning luôn bật.
  • Chọn kimi-k3 khi ngữ cảnh rất lớn, hiểu hình ảnh hoặc quy trình công việc tri thức end-to-end là trọng tâm.
  • Chọn qwen3.8-max khi cửa sổ 1M Token, đầu vào đa phương thức, tool có cấu trúc hoặc tự động hóa chuyên nghiệp là quan trọng.

Đây là điểm bắt đầu, không phải bảng xếp hạng chung. Hãy chạy lại một mẫu tác vụ riêng đã loại dữ liệu nhạy cảm và đo chi phí mỗi tác vụ thành công, retry, độ trễ và thời gian review. Giới hạn ngữ cảnh lớn là trần dung lượng, không đảm bảo mọi vị trí đều hữu ích hoặc nhanh như nhau.

Ảnh chụp giá Modelflare

Các giá trị sau là USD trên 1 triệu token cho các nhóm công khai hiện tại. Hệ số nhóm là 0.8x, tương ứng cách nói “giá chính thức × 0.8” trong thông báo.

Mô hình Nhóm Đầu vào Đầu ra Đầu vào cache
glm-5.3 glm-stable $1.12 $3.52 khoảng $0.21
kimi-k3 kimi-stable $2.40 $12.00 $0.24
qwen3.8-max qwen-stable $1.60 $4.80 $0.20

Giá trị được tính từ giá đầu vào, tỷ lệ completion, tỷ lệ cache và hệ số nhóm trong catalog trực tiếp, rồi làm tròn để dễ đọc. Nếu trang giá có trường riêng cho ghi cache, hãy dùng trường đó khi tạo cache, không suy ra từ giá đọc.

Cả ba nhóm hiện hiển thị rpm: 0, nghĩa là catalog không cấu hình trần RPM cố định phía nền tảng cho nhóm. Điều này không loại bỏ giới hạn của nhà cung cấp, tài khoản, mạng hoặc an toàn. Giá và tính khả dụng có thể đổi; hãy đối chiếu trang giá trực tiếp với bản ghi usage.

Một gateway, ba hợp đồng API

Trong ảnh chụp này, catalog Modelflare đánh dấu cả ba ID mô hình hỗ trợ các định dạng công khai sau:

Hợp đồng Endpoint Xác thực Phù hợp với
OpenAI Chat Completions POST /v1/chat/completions Authorization: Bearer Client chat hiện có và SDK tương thích
OpenAI Responses POST /v1/responses Authorization: Bearer Client xử lý item và event của Responses
Tương thích Anthropic Messages POST /v1/messages x-api-key hoặc Bearer kèm anthropic-version Client theo dạng Anthropic và luồng message

Base URL tương thích OpenAI dùng chung là https://modelflare.dev/v1. Anthropic SDK thường dùng https://modelflare.dev làm base rồi nối /v1/messages. Endpoint khả dụng không đồng nghĩa tính năng ngang nhau; hãy kiểm tra riêng event streaming, tool, đầu ra có cấu trúc, đầu vào đa phương thức và điều khiển reasoning.

Kết nối qua Modelflare

  1. Trong API Keys, tạo hoặc cập nhật key và cấp nhóm chứa mô hình mong muốn: glm-stable, kimi-stable hoặc qwen-stable.
  2. Giữ key trong biến môi trường. Không đưa key vào repository, bộ nhớ trình duyệt hoặc ticket hỗ trợ.
  3. Xác nhận phản hồi /v1/models đã xác thực, rồi gửi request nhỏ không streaming với ID chính xác.
  4. Kiểm tra streaming như hợp đồng riêng trước khi chuyển Agent hoặc traffic người dùng.

Chat Completions

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "Tóm tắt rủi ro di chuyển bằng ba ý."}],
    "stream": false
  }'

Responses API

curl -sS https://modelflare.dev/v1/responses \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "input": "Trả về checklist ngắn cho việc di chuyển cơ sở dữ liệu an toàn.",
    "stream": false
  }'

Anthropic Messages

curl -sS https://modelflare.dev/v1/messages \
  -H "x-api-key: $MODELFLARE_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "Liệt kê ba kiểm tra rollout đầu tiên."}]
  }'

Ví dụ cố ý dùng văn bản thuần và stream: false. Chỉ bật streaming sau khi client xử lý đúng định dạng event của hợp đồng đã chọn. Giữ giá trị 0 và false tường minh khi chúng có ý nghĩa, và không sao chép field riêng của nhà cung cấp giữa các mô hình nếu chưa kiểm tra hợp đồng.

Xác minh trước production

  1. Liệt kê mô hình bằng cùng key và xác nhận ID cùng nhóm chính xác xuất hiện.
  2. Chạy một probe không streaming và một probe streaming trên endpoint ứng dụng thực sự gọi.
  3. Nếu workload dùng tool, đầu ra có cấu trúc, hình ảnh, video hoặc điều khiển reasoning, kiểm tra từng tính năng trên mô hình đã chọn; phản hồi văn bản thành công không chứng minh các tính năng khác.
  4. Lưu trạng thái, nhóm đã chọn, token đầu vào/đầu ra/cache, độ trễ, retry và phí cuối trong bản ghi usage.
  5. Giới hạn retry phía ứng dụng và phân biệt phản hồi thiếu dung lượng tạm thời với lỗi mô hình hoặc chính sách đã kết thúc.
  6. Kiểm tra lại giá trực tiếp trước khi chạy lưu lượng lớn; trang giá và bản ghi usage quan trọng hơn bảng đã sao chép.

Câu hỏi thường gặp

Các mức giá này có cố định không? Không. Đây là ảnh chụp catalog có ngày; trang giá trực tiếp là nguồn chuẩn.

rpm: 0 có nghĩa lưu lượng không giới hạn không? Không. Nó chỉ cho biết nhóm chưa đặt trần RPM phía nền tảng. Giới hạn của nhà cung cấp, tài khoản, mạng và an toàn vẫn có thể áp dụng.

Có thể gửi cùng payload cho cả ba giao thức không? Không. Giữ ID mô hình nhưng điều chỉnh envelope, xác thực, parser phản hồi và xử lý streaming theo hợp đồng đã chọn.

Mô hình nào ghi rõ ngữ cảnh 1M? Kimi K3 và Qwen3.8-Max ghi 1M trong nguồn chính chủ được liên kết. Trang này không đưa ra tuyên bố 1M cho GLM-5.3.

Nguồn và độ mới

Bản ghi cập nhật: 29 tháng 8 năm 2026 — bản đầu tiên; trang khả năng chính chủ, nhóm Modelflare, cờ endpoint và giá được kiểm tra cùng ngày.