GLM-5.3、Kimi K3 與 Qwen3.8-Max:能力、價格與 API 接入指南

依一手資料核對 GLM-5.3、Kimi K3 與 Qwen3.8-Max 的能力,整理 Modelflare 目前價格、模型分組、Chat Completions、Responses、Anthropic Messages 接入範例與正式環境檢查。

Modelflare 現已透過統一相容閘道開放 glm-5.3kimi-k3qwen3.8-max。本文介紹三款模型各自適合的工作、目前美元價格快照、三種請求契約,以及從建立 API Key 到正式環境探測的穩妥接入路徑。

下文會把模型供應商的一手資料與 Modelflare 目錄事實分開。供應商所宣稱的能力不會自動等於閘道已暴露的能力;請始終檢查即時模型項目,並測試用戶端實際使用的端點。

會變動的模型可用性、分組倍率與價格核驗於 2026 年 8 月 29 日。此日期之後請以 Modelflare 定價頁為準。

三款模型一覽

模型 ID 適合作為起點的工作 一手資料中的能力 上下文與推理
glm-5.3 複雜程式設計與長程 Agent 任務 智譜將 GLM-5.3 定位於困難程式設計和較長 Agent 任務;其 API 保持思考開啟 思考始終開啟;文件列出 lowhighmax,預設 max
kimi-k3 長上下文程式設計與知識工作 月之暗面文件強調原生視覺理解,以及端到端長程工作 最長 1M 上下文;思考始終開啟;lowhighmax,預設 max
qwen3.8-max 專業工作流程與長程 Agent 通義文件列出總參數 2.4T、啟用參數 95B 的 MoE,涵蓋程式設計、視覺輸入與工具工作流程 1M 上下文;支援文字、圖片、影片輸入和文字輸出;部分工具取決於地區與端點

可查閱GLM-5.3 發布說明Kimi 模型選擇文件Qwen3.8-Max 參考中的供應商原文。供應商基準是其自行報告的結果,不是 Modelflare 的保證。

按工作負載選擇

  • 當任務需要持續規劃、困難程式碼修改或更長的 Agent 循環,且預算允許始終開啟推理時,選擇 glm-5.3
  • 當請求的核心是超大上下文、視覺理解或端到端知識工作循環時,選擇 kimi-k3
  • 當需要 1M Token 視窗、多模態輸入、結構化工具流程或專業自動化時,選擇 qwen3.8-max

這些只是起點,不構成統一排名。請用隱私安全的自有任務樣本回放,並衡量成功任務成本、重試、延遲和審核時間。大上下文限制是上限,不代表每個位置都同樣有用或快速。

Modelflare 價格快照

以下為目前公開 Modelflare 分組的 每 100 萬 Token 美元價格。分組倍率為 0.8x,與公告所稱「官價 × 0.8」一致。

模型 分組 輸入 輸出 快取命中輸入
glm-5.3 glm-stable $1.12 $3.52 約 $0.21
kimi-k3 kimi-stable $2.40 $12.00 $0.24
qwen3.8-max qwen-stable $1.60 $4.80 $0.20

數值依即時目錄中的輸入價格、補全倍率、快取倍率與分組倍率計算,並為便於閱讀四捨五入。若定價頁單獨展示快取寫入價格,請以該欄位計算快取建立,不要用快取讀取價格反推。

目前三個分組都顯示 rpm: 0,表示目錄沒有配置平台側固定的分組 RPM 上限;這並不取消上游、帳戶、網路或安全控制。價格和可用性會變化,請用即時定價頁與用量記錄對帳。

一個閘道,三種 API 契約

截至本次快照,Modelflare 目錄將三個模型 ID 都標記為支援以下公開格式:

契約 端點 驗證 適合場景
OpenAI Chat Completions POST /v1/chat/completions Authorization: Bearer 現有聊天用戶端與廣泛 SDK 相容
OpenAI Responses POST /v1/responses Authorization: Bearer 消費 Responses 項目和事件的用戶端
Anthropic Messages 相容 POST /v1/messages x-api-key 或 Bearer,並帶 anthropic-version Anthropic 形狀的用戶端和訊息流

共用的 OpenAI 相容 Base URL 是 https://modelflare.dev/v1。Anthropic SDK 通常把 https://modelflare.dev 作為 Base URL,再追加 /v1/messages。端點可用不等於功能完全一致;請分別驗證串流事件、工具、結構化輸出、多模態輸入和推理控制。

透過 Modelflare 接入

  1. API Keys 中建立或更新 Key,並授予包含目標模型的分組:glm-stablekimi-stableqwen-stable
  2. 把 Key 放在環境變數中,不要寫入版本庫、瀏覽器儲存或支援工單。
  3. 用同一個 Key 確認 /v1/models 回傳,再使用準確模型 ID 傳送一個小型非串流請求。
  4. 在遷移 Agent 或面向使用者的工作負載前,單獨測試串流契約。

Chat Completions

export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'

curl -sS https://modelflare.dev/v1/chat/completions \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "kimi-k3",
    "messages": [{"role": "user", "content": "用三條重點總結遷移風險。"}],
    "stream": false
  }'

Responses API

curl -sS https://modelflare.dev/v1/responses \
  -H "Authorization: Bearer $MODELFLARE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "input": "返回一份資料庫安全遷移的簡短檢查清單。",
    "stream": false
  }'

Anthropic Messages

curl -sS https://modelflare.dev/v1/messages \
  -H "x-api-key: $MODELFLARE_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "max_tokens": 256,
    "messages": [{"role": "user", "content": "列出前三項發布檢查。"}]
  }'

範例刻意使用純文字和 stream: false。只有用戶端能處理相應契約的事件格式後再啟用串流。顯式 0 和 false 有語義時必須保留;未核對契約前,不要把某款模型的供應商欄位複製給另一款。

正式環境前核驗

  1. 用同一個 Key 列出模型,確認準確 ID 和分組可見。
  2. 針對應用實際呼叫的端點,各執行一次非串流和串流探測。
  3. 如果工作負載使用工具、結構化輸出、圖片、影片或推理控制,請在目標模型上逐項測試;一次文字成功不能證明這些能力。
  4. 從用量記錄保存請求狀態、所選分組、輸入/輸出/快取 Token、延遲、重試和最終扣費。
  5. 限制應用側重試次數,並區分臨時容量回應與終止性的模型或策略錯誤。
  6. 大量呼叫前重新查看即時定價頁;頁面和用量記錄優先於複製的表格。

常見問題

這些價格是永久的嗎? 不是。這是帶日期的目錄快照,即時定價頁才是準確資訊源。

rpm: 0 是不是代表流量無限? 不是。它只表示分組沒有配置平台側 RPM 上限;供應商、帳戶、網路和安全限制仍可能生效。

同一個 payload 能發給三種協定嗎? 不能。保留模型 ID,但要按所選契約調整包體、驗證、回應解析和串流處理。

哪些模型有文件證明支援 1M 上下文? Kimi K3 和 Qwen3.8-Max 的一手參考中有明確說明。本文不對 GLM-5.3 作 1M 聲明。

來源與更新

更新記錄: 2026 年 8 月 29 日——首次發布;一手能力頁面、Modelflare 分組、端點標記和價格均於當日核驗。