Qwen3.8-Max 正式發布:2.4T MoE 規格與 Modelflare 設定
深入了解 Qwen3.8-Max 的 2.4T/95B MoE、1M 多模態上下文、推理參數、Modelflare 即時價格與建議上線設定。
Qwen 團隊於 2026 年 8 月 3 日正式發布 Qwen3.8-Max。它不是容易混淆的舊型號 Qwen3-8B,也不再只是 7 月的 qwen3.8-max-preview:目前官方 API 模型 ID 已是 qwen3.8-max,Modelflare 也使用相同 ID。
這是 Qwen 目前規模最大的 Max 旗艦模型,重點面向 Coding、專業工作流程、長程 Agent 與原生多模態任務。官方同時宣布將於下一週發布 Qwen3.8-Max 與 Qwen3.8-27B 的開放權重;在權重儲存庫與授權條款真正公開以前,精確說法仍是「已宣布即將開放權重」,而不是已經可以在本機部署。
核心規格
| 項目 | Qwen3.8-Max |
|---|---|
| Modelflare 模型 ID | qwen3.8-max |
| 架構 | Mixture-of-Experts(MoE) |
| 總參數量 | 2.4T |
| 每個 Token 啟用參數量 | 95B |
| 上下文長度 | 1M tokens |
| 最大非思考輸入 | 991K tokens |
| 最大思考模式輸入 | 983K tokens |
| 最大輸出 | 131K tokens |
| 最大推理 Token | 262K tokens |
| 輸入模態 | 文字、影像、影片 |
| 輸出模態 | 文字 |
| 推理強度 | low、medium、xhigh;預設為 xhigh |
| 官方功能 | Prefix Completion、Function Calling、Context Cache、Structured Outputs、Batch 與 Responses 內建工具 |
2.4T 是模型總參數量,不代表每產生一個 Token 都會執行 2.4T 參數。官方發布資料指出每個 Token 啟用 95B 參數,這更適合用來理解 MoE 推理實際涉及的計算規模。1M 上下文也不代表每次請求都應塞滿;輸入與推理預算越大,延遲、快取與成本就越需要特別設計。
Qwen3.8-Max 著重提升的能力
Qwen 將本次發布定位為 Coding 與 Cowork 的全面升級,特別強調三類工作:
- 從空目錄開始執行多日軟體專案,而不是只產生單一函式;
- 為研究、資料分析、Office、設計等專業工作組織多步驟交付成果;
- 將影像與影片理解納入規劃、執行與驗證,而不只是做一次靜態辨識。
Qwen 展示了超過 10 天的自主程式開發、數百輪晶片設計最佳化等供應商示範。這些是系統層級案例,會同時受到 Harness、工具、環境、提示詞與評審方式影響,無法保證你的應用程式會得到相同結果。生產選型應使用自己的程式庫、文件、工具權限與驗收標準進行固定樣本評估。
如何選擇推理強度
Qwen3.8-Max 支援 reasoning_effort:
low:適合短問答、輕量程式碼解釋與成本敏感任務;medium:適合作為日常開發、分析與多步驟任務的起點;xhigh:用於困難推理、長程 Agent 與複雜專業工作,也是預設值。
Qwen 表示 preserve_thinking 預設啟用,讓多輪工作可以延續先前的推理狀態。若客戶端自行重建訊息歷史,應保留供應商回傳的推理欄位與工具狀態,而不是只串接最終文字。模型最多允許 262K 推理 tokens,但「上限可用」不代表「預設就應用滿」;effort 應依任務成功率與單位成本決定。
Modelflare 目前的開放方式
截至 2026 年 8 月 4 日,Modelflare 公開目錄為 qwen3.8-max 標示了:
- OpenAI Chat Completions;
- OpenAI Responses;
- Anthropic Messages 相容入口。
協定標示只能證明路由存在,無法證明所有 QwenCloud 私有功能都會自動轉送。QwenCloud 特別將 web_search、code_interpreter、web_extractor、t2i_search 與 i2i_search 列為 Responses 內建工具。在每項功能都透過實際 Modelflare 目標路由完成驗證以前,應優先使用客戶端定義的 Function Calling,並將這些內建工具視為尚未驗證。
目前 qwen-award 群組的公開價格快照如下,單位皆為美元/百萬 tokens:
| 計費項目 | 價格 |
|---|---|
| 輸入 | $1.239 |
| 輸出 | $3.71 |
| 快取讀取 | $0.161 |
| 明確快取建立 | $1.547 |
| 1 小時明確快取建立 | $2.4752 |
此群組僅供具備資格的 API Key 使用。價格、群組資格與協定範圍都可能變動,請以模型與價格即時頁面和每次請求的用量記錄為準。
建議的 Chat Completions 設定
先將 Modelflare API Key 放入環境變數:
export MODELFLARE_API_KEY='YOUR_MODELFLARE_API_KEY'
先從文字請求驗證基本鏈路:
curl -N -sS https://modelflare.dev/v1/chat/completions \
-H "Authorization: Bearer $MODELFLARE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Design a safe rollout plan for this service and include validation and rollback gates."
}
],
"reasoning_effort": "medium",
"stream": true
}'
先用 medium 建立品質、延遲與成本基準,再只將真正需要更深推理的任務提升至 xhigh。上游預設為 xhigh,不代表每個批次請求都應使用最高推理預算。
如何上線多模態輸入
官方模型接受文字、影像與影片輸入,但多模態內容格式會依協定與上游實作而異。建議分三階段導入:
- 先以純文字請求驗證身分、模型權限、串流回應與計費;
- 使用一張固定測試圖片驗證內容格式、大小限制與輸出;
- 之後才加入長影片、工具或多輪視覺回饋,同時確認重試是否會重複產生可計費工作。
不要把圖片 URL、Base64 payload、檔案上傳和供應商物件儲存視為可互換的協定。客戶端實際傳送哪一種內容區塊,就應端對端測試哪一種格式。
建議的站內設定方案
- 每個應用程式使用獨立 API Key,並確認其主要群組確實列出
qwen3.8-max; - 日常開發與分析從
medium開始,短任務可降至low,高難度長程工作再升至xhigh; - 長上下文任務應先設計切分與快取,不要預設每次都把整個知識庫放入 1M 上下文;
- 分別驗證 Chat Completions、Responses 與 Anthropic 的 wire contract;
- 供應商內建工具在通過目標 Modelflare 路由的真實請求以前,不應成為生產依賴;
- 使用固定任務集比較成功率、首次輸出、總延遲、推理 Token、快取命中與每次請求成本;
- 從 preview 遷移至正式模型時重新執行迴歸樣本,不要假設同一系列名稱能保證輸出完全相同。
適合與不適合的情境
Qwen3.8-Max 適合複雜軟體工程、多步驟專業工作流程、長文件與影片理解、需要多模態回饋的 Agent,以及希望以單一旗艦模型統一推理與協調的團隊。對高吞吐、低延遲的簡單文字轉換而言,它未必是最經濟的預設選擇;應以相同輸入和 Qwen Flash、DeepSeek V4 Flash 或其他較小模型比較成本與延遲。
資料來源與更新時間
- Qwen3.8-Max 官方發布文章:發布日期、95B 啟用參數、Coding/Cowork 展示與開放權重計畫;
- QwenCloud Qwen3.8-Max 模型頁面:上下文、輸入輸出上限、模態、官方功能與價格;
- Modelflare 模型與價格:目前群組、協定與站內價格。
本文資料核對時間為 2026 年 8 月 4 日。開放權重狀態、模型快照、價格與協定支援都可能變動;生產設定應以呼叫時的官方模型頁面、權重儲存庫授權條款與 Modelflare 即時目錄為準。