GLM-5.3、Kimi K3 與 Qwen3.8-Max:能力、價格與 API 接入指南
依一手資料核對 GLM-5.3、Kimi K3 與 Qwen3.8-Max 的能力,整理 Modelflare 目前價格、模型分組、Chat Completions、Responses、Anthropic Messages 接入範例與正式環境檢查。
Modelflare 現已透過統一相容閘道開放 glm-5.3、kimi-k3 與 qwen3.8-max。本文介紹三款模型各自適合的工作、目前美元價格快照、三種請求契約,以及從建立 API Key 到正式環境探測的穩妥接入路徑。
下文會把模型供應商的一手資料與 Modelflare 目錄事實分開。供應商所宣稱的能力不會自動等於閘道已暴露的能力;請始終檢查即時模型項目,並測試用戶端實際使用的端點。
會變動的模型可用性、分組倍率與價格核驗於 2026 年 8 月 29 日。此日期之後請以 Modelflare 定價頁為準。
三款模型一覽
| 模型 ID | 適合作為起點的工作 | 一手資料中的能力 | 上下文與推理 |
|---|---|---|---|
| glm-5.3 | 複雜程式設計與長程 Agent 任務 | 智譜將 GLM-5.3 定位於困難程式設計和較長 Agent 任務;其 API 保持思考開啟 | 思考始終開啟;文件列出 low、high、max,預設 max |
| kimi-k3 | 長上下文程式設計與知識工作 | 月之暗面文件強調原生視覺理解,以及端到端長程工作 | 最長 1M 上下文;思考始終開啟;low、high、max,預設 max |
| qwen3.8-max | 專業工作流程與長程 Agent | 通義文件列出總參數 2.4T、啟用參數 95B 的 MoE,涵蓋程式設計、視覺輸入與工具工作流程 | 1M 上下文;支援文字、圖片、影片輸入和文字輸出;部分工具取決於地區與端點 |
可查閱GLM-5.3 發布說明、Kimi 模型選擇文件和 Qwen3.8-Max 參考中的供應商原文。供應商基準是其自行報告的結果,不是 Modelflare 的保證。
按工作負載選擇
- 當任務需要持續規劃、困難程式碼修改或更長的 Agent 循環,且預算允許始終開啟推理時,選擇 glm-5.3。
- 當請求的核心是超大上下文、視覺理解或端到端知識工作循環時,選擇 kimi-k3。
- 當需要 1M Token 視窗、多模態輸入、結構化工具流程或專業自動化時,選擇 qwen3.8-max。
這些只是起點,不構成統一排名。請用隱私安全的自有任務樣本回放,並衡量成功任務成本、重試、延遲和審核時間。大上下文限制是上限,不代表每個位置都同樣有用或快速。
Modelflare 價格快照
以下為目前公開 Modelflare 分組的 每 100 萬 Token 美元價格。分組倍率為 0.8x,與公告所稱「官價 × 0.8」一致。
| 模型 | 分組 | 輸入 | 輸出 | 快取命中輸入 |
|---|---|---|---|---|
| glm-5.3 | glm-stable | $1.12 | $3.52 | 約 $0.21 |
| kimi-k3 | kimi-stable | $2.40 | $12.00 | $0.24 |
| qwen3.8-max | qwen-stable | $1.60 | $4.80 | $0.20 |
數值依即時目錄中的輸入價格、補全倍率、快取倍率與分組倍率計算,並為便於閱讀四捨五入。若定價頁單獨展示快取寫入價格,請以該欄位計算快取建立,不要用快取讀取價格反推。
目前三個分組都顯示 rpm: 0,表示目錄沒有配置平台側固定的分組 RPM 上限;這並不取消上游、帳戶、網路或安全控制。價格和可用性會變化,請用即時定價頁與用量記錄對帳。
一個閘道,三種 API 契約
截至本次快照,Modelflare 目錄將三個模型 ID 都標記為支援以下公開格式:
| 契約 | 端點 | 驗證 | 適合場景 |
|---|---|---|---|
| OpenAI Chat Completions | POST /v1/chat/completions | Authorization: Bearer | 現有聊天用戶端與廣泛 SDK 相容 |
| OpenAI Responses | POST /v1/responses | Authorization: Bearer | 消費 Responses 項目和事件的用戶端 |
| Anthropic Messages 相容 | POST /v1/messages | x-api-key 或 Bearer,並帶 anthropic-version | Anthropic 形狀的用戶端和訊息流 |
共用的 OpenAI 相容 Base URL 是 https://modelflare.dev/v1。Anthropic SDK 通常把 https://modelflare.dev 作為 Base URL,再追加 /v1/messages。端點可用不等於功能完全一致;請分別驗證串流事件、工具、結構化輸出、多模態輸入和推理控制。
透過 Modelflare 接入
- 在 API Keys 中建立或更新 Key,並授予包含目標模型的分組:glm-stable、kimi-stable 或 qwen-stable。
- 把 Key 放在環境變數中,不要寫入版本庫、瀏覽器儲存或支援工單。
- 用同一個 Key 確認 /v1/models 回傳,再使用準確模型 ID 傳送一個小型非串流請求。
- 在遷移 Agent 或面向使用者的工作負載前,單獨測試串流契約。
Chat Completions
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
curl -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "用三條重點總結遷移風險。"}],
"stream": false
}'
Responses API
curl -sS https://modelflare.dev/v1/responses \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"input": "返回一份資料庫安全遷移的簡短檢查清單。",
"stream": false
}'
Anthropic Messages
curl -sS https://modelflare.dev/v1/messages \
-H "x-api-key: $MODELFLARE_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"max_tokens": 256,
"messages": [{"role": "user", "content": "列出前三項發布檢查。"}]
}'
範例刻意使用純文字和 stream: false。只有用戶端能處理相應契約的事件格式後再啟用串流。顯式 0 和 false 有語義時必須保留;未核對契約前,不要把某款模型的供應商欄位複製給另一款。
正式環境前核驗
- 用同一個 Key 列出模型,確認準確 ID 和分組可見。
- 針對應用實際呼叫的端點,各執行一次非串流和串流探測。
- 如果工作負載使用工具、結構化輸出、圖片、影片或推理控制,請在目標模型上逐項測試;一次文字成功不能證明這些能力。
- 從用量記錄保存請求狀態、所選分組、輸入/輸出/快取 Token、延遲、重試和最終扣費。
- 限制應用側重試次數,並區分臨時容量回應與終止性的模型或策略錯誤。
- 大量呼叫前重新查看即時定價頁;頁面和用量記錄優先於複製的表格。
常見問題
這些價格是永久的嗎? 不是。這是帶日期的目錄快照,即時定價頁才是準確資訊源。
rpm: 0 是不是代表流量無限? 不是。它只表示分組沒有配置平台側 RPM 上限;供應商、帳戶、網路和安全限制仍可能生效。
同一個 payload 能發給三種協定嗎? 不能。保留模型 ID,但要按所選契約調整包體、驗證、回應解析和串流處理。
哪些模型有文件證明支援 1M 上下文? Kimi K3 和 Qwen3.8-Max 的一手參考中有明確說明。本文不對 GLM-5.3 作 1M 聲明。
來源與更新
- 智譜:GLM-5.3
- Kimi API 模型選擇
- 阿里雲 Model Studio:Qwen3.8-Max
- Modelflare 即時定價
- Modelflare Qwen3.8-Max 深度指南
- OpenAI 相容 API 指南
- Responses API 與 Chat Completions 比較
更新記錄: 2026 年 8 月 29 日——首次發布;一手能力頁面、Modelflare 分組、端點標記和價格均於當日核驗。