MiniMax H3 深度報告:開放權重、價格、效果與顛覆性
依官方資料與匿名偏好數據,深入檢視 MiniMax H3 的開放權重架構、社群授權、API 價格、自行託管成本,以及與 Seedance 2.5 等前沿影片模型的差異。
MiniMax H3 是 2026 年少數同時改變“效果上限”和“誰能改模型”的視頻模型。它能在同一上下文中理解文字、圖片、視頻與音頻,生成 4–15 秒、帶原生雙聲道音頻的視頻,提供 768P 與 2K 工作流,並公開可下載的 H3-Base checkpoint。
但真正嚴謹的結論不是“H3 已完全開源,而且打敗了所有閉源模型”。H3 是達到前沿水平、API 定價激進的開放權重模型,但它不是完整的 OSI 意義上的開源 AI 系統;現有匿名人類偏好數據也不能證明它全面勝過 Seedance 2.5。 Seedance 2.5 在單次 30 秒敘事和超大參考素材板上仍擁有更強的公開合同。H3 的顛覆性在於,它第一次把頂級效果、可修改權與低價托管調用大規模放到同一款視頻模型里。
下文的官方參數、許可、API 價格與 Modelflare 可用狀態均在 2026 年 8 月 30 日重新核驗。Arena 榜單快照分別標注為 8 月 25–26 日,後續會隨投票變化。
核心結論
- 開放性: H3 公開了兩套面向不同任務的 BF16 基礎 checkpoint、模型組件,以及 SGLang、vLLM、diffusers、ComfyUI 配方。這是真正能下載和運行的發佈,不是只在論文中承諾。
- 價格: MiniMax 官方列出的 768P 輸出價為每生成秒 $0.08,2K 為 $0.13。開放權重不等於推理免費,只是把 API 賬單轉移成 GPU、運維、存儲和工程成本。
- 效果: Arena 將 H3 與 Seedance 2.5 放在重疊的頭部區間。H3 在圖生視頻快照中暫列第一;Seedance 2.5 在文生視頻與視頻編輯中數值略高,但三項對比的置信區間都重疊。
- 顛覆性: H3 顯著縮小了可下載視頻模型與閉源前沿模型之間長期存在的效果差距。同月出現更快的 H3 Max 衍生模型,是下游團隊能夠修改模型層、而不只是包裝 API 的早期證據。
- 關鍵限制: 官方 2K 高質量路徑仍使用托管的 H3-Context-IR 與 H3-Regenerate-2K;社區許可還包含地區、用途、披露、署名和大型商業產品等條件。
MiniMax H3 到底公開了甚麼
| 項目 | 已核驗的 H3 合同 |
|---|---|
| 官方 API 模型 ID | MiniMax-H3 |
| 輸出時長 | 4–15 秒,只接受整數 |
| 輸出 | 24 FPS 視頻與 32 kHz 雙聲道音頻 |
| 分辨率 | 基礎輸出 768P;通過官方生成或 regeneration 工作流得到 2K |
| 首尾幀模式 | 0、1 或 2 張圖片 |
| 參考模式 | 最多 9 圖、3 視頻、3 音頻;全部素材合計最多 12 個文件 |
| 參考素材時長 | 單個視頻或音頻 2–15 秒;每種模態合計不超過 15 秒 |
| 對話語言 | 官方列出 11 種穩定支持語言 |
| 開放 checkpoint | FL2VA 負責文字與首尾幀任務;Ref2VA 負責多模態參考任務 |
| 核心生成器 | 33B 稠密 H3-Omni-Transformer,配合 Qwen3-VL-32B encoder 與視聽 VAE |
| 推薦運行時 | SGLang、vLLM、diffusers、ComfyUI |
API 對外只有一個模型名,但開放包內部是兩套專業化基礎 checkpoint。這個差異會直接影響運維:如果團隊既要提供首尾幀生成,又要支持任意多模態參考,就要為兩條路徑準備存儲和運行容量。
開放性審計:不要只看一個“開源”標籤
| 層級 | 已開放部分 | 仍有限制的部分 | 實際判斷 |
|---|---|---|---|
| 權重與推理組件 | 完整 H3-Base checkpoint 系列、processor、tokenizer、encoder、Omni Transformer、VisualVAE 與 AudioVAE | 倉庫體積很大,生產推理仍需要可觀 GPU 容量 | 可以真實本地運行與微調 |
| 運行時生態 | 四套主要運行時的官方配方、可下載樣例與可復現 768P 案例 | 初始版本仍使用 full attention;sparse-attention 推理以後再發佈 | 工程面已經可用,但還不是最高效形態 |
| 完整產品鏈路 | 本地 H3-Base 能生成 768P 音視頻 | H3-Context-IR 是托管系統;官方完整 2K 路徑會調用 Context-IR 與 regeneration API | 最高質量官方鏈路是混合式,而非完全本地 |
| 許可與可復現性 | 適用地區內允許修改、衍生、再分發與大量商業使用 | 自定義許可、排除地區、用途限制、披露義務、$2000 萬年營收授權門檻,並且沒有完整訓練數據/訓練代碼包 | “社區許可下的開放權重”比無條件“完全開源”更準確 |
MiniMax 官方將這次發佈稱為 open source。但按照 Open Source AI Definition,開源 AI 需要允許任何人出於任何目的使用、研究、修改和分享,並提供修改系統所需的優選形式,包括足夠的數據說明與訓練代碼。H3 的地區、用途限制以及不完整的訓練包沒有達到這條標準。
這並不是在做詞語游戲或否定貢獻。把前沿視頻基礎模型連同修改和分發權真正交給開發者,本身就是重大進展。使用準確稱謂,是為了避免團隊把“能下載權重”誤解成“全球任何場景都自動獲得部署權”。
H3 的架構為甚麼重要
H3 把多模態輸入組織成同一條 packed sequence。文字進入 H3 encoder;視覺輸入同時進入 encoder 與 VisualVAE;音頻進入 AudioVAE。單流 Omni Transformer 聯合預測視頻與音頻 latent,再由各自 decoder 還原最終畫面和雙聲道聲音。
它針對的是一個反復出現的生產故障:如果主體參考、動作遷移、口型、音效和超分分別交給多套模型,每次交接都可能丟失身份、時間關係或構圖。H3 試圖在同一上下文里共同學習文字意圖、視覺身份、動作、剪輯節奏、聲音與環境聲。
完整系統仍然分成三層:
- H3-Context-IR 深度理解自由形式的複雜多模態素材,生成結構化中間表達。
- H3-Base 根據中間表達生成 768P 音視頻。
- H3-Regenerate-2K 將基礎結果與原始上下文再次送入生成流程,補出更高細節。
這套架構同時解釋了效果主張與開放性限制。公開的基礎模型很有價值,但官方系統中的推理編排和高分辨率收尾仍有一部分以服務形式提供。
H3 與 Seedance 2.5:兩種相反的下注
| 決策維度 | MiniMax H3 | Seedance 2.5 | 對生產的影響 |
|---|---|---|---|
| 單次原生敘事時長 | 15 秒 | 30 秒,並支持延長 | Seedance 在拼接前可以承載更長故事弧 |
| 參考素材板 | 合計 12 個文件:最多 9 圖、3 視頻、3 音頻 | 最多 30 圖、10 視頻、10 音頻 | 多角色、多商品、多聲音與多動作參考的複雜活動更適合 Seedance |
| 輸出定位 | 768P 基礎與 2K 工作流;原生雙聲道 | 托管音視頻聯合生成;本文引用的 API 暴露 480p/720p | H3 強調分辨率與可移植性;Seedance 強調時長與控制容量 |
| 編輯 | 多模態參考與自然語言視頻編輯 | 時間戳級編輯、綠幕、機位與參考編輯 | Seedance 的專業製作控制寫得更明確;H3 提供更可修改的基礎 |
| 權重 | 可下載 H3-Base checkpoint | 閉源 | 許可允許時,H3 可自托管、微調、量化或繼續訓練 |
| 許可 | MiniMax H3 Community License | 托管服務條款 | H3 降低技術鎖定,但沒有消除法律審查 |
| 托管標價 | MiniMax 上 768P $0.08/秒,2K $0.13/秒 | fal 720p 約 $0.473/秒;Modelflare 720p $0.36/秒 | H3 標價優勢很大,但調用路徑與分辨率並不完全相同 |
兩邊的戰略分歧很清楚。Seedance 2.5 想用一次托管調用替代更多專業時間線工作;H3 則把 15 秒前沿核心做得更便宜、可下載、可擴展。一個工作室完全可能同時使用兩者:長時且參考密集的主鏡頭走 Seedance,短商品變體、精確編輯或私有微調走 H3。
匿名人類偏好榜單真正說明瞭甚麼
Arena 根據匿名模型兩兩對戰中的用戶偏好排名。它比廠商精選 Demo 更廣,但仍是持續變化的偏好信號,不是受控的生產基準。
| Arena 快照 | MiniMax H3 | Seedance 2.5 720p | Gemini Omni 1.1 Flash | 嚴謹解讀 |
|---|---|---|---|---|
| 文生視頻,8 月 25 日 | 1460±10,排名區間 4–7 | 1476±14,區間 3–7 | 1515±16,區間 1–3 | H3 與 Seedance 重疊;Gemini 在該快照領先 |
| 圖生視頻,8 月 25 日 | 1494±6,區間 1–3 | 1483±12,區間 1–4 | 1488±11,區間 1–4 | 三者處於同一頭部統計區間 |
| 視頻編輯,8 月 26 日 | 1392±19,區間 1–5 | 1410±26,區間 1–3 | 1367±15,區間 3–5 | Seedance 數值更高,但區間大幅重疊 |
這些數字足以支持“H3 已進入前沿模型”這一判斷,卻不能支持“H3 打敗 Seedance 2.5”。榜單無法代表你的準確 Prompt、素材授權、品牌限制、失敗預算與交付驗收。快照中 Seedance 的票數也明顯少於老模型,估值仍可能移動。
對效果最有用的結論應當按任務拆分:H3 在圖像條件生成與編輯方面非常有競爭力;Seedance 的規格優勢仍然是長敘事與重參考製作;Gemini Omni 則證明低價閉源模型仍可能在文生視頻偏好上領先。
H3 與其他可下載模型的差距
Arena 會把 H3 與其他可下載模型放在相同許可篩選中,但這些許可並不等價。同一批快照里的效果差距很大。
| 可下載模型 | Arena 顯示的許可 | 文生視頻 | 圖生視頻 |
|---|---|---|---|
| MiniMax H3 | MiniMax H3 Community License | 1460±10 | 1494±6 |
| Hunyuan Video 1.5 | Tencent community license | 1169±16 | 1197±16 |
| Kandinsky 5.0 T2V Pro | MIT | 1172±20 | — |
| Wan 2.2 A14B | Apache 2.0 | 1132±15 | 1170±10 |
| LTX-2 19B | LTX community license | 1152±8 | 1155±5 |
這不是說一個 Elo 數字可以裁定所有鏡頭。真正重要的是,可下載視頻模型過去通常意味著明顯的效果妥協,而 H3 直接進入了最佳閉源系統的偏好區間。即使企業最終沒有自托管,這也會改變採購、研究與 fallback 策略。
價格:低價是真的,但比較必須寫清分母
| 8 月 30 日核驗路徑 | 分辨率 | 每生成秒價格 | 15 秒輸出 | 未包含的重要成本 |
|---|---|---|---|---|
| MiniMax 官方 H3 API | 768P | $0.08 | $1.20 | 參考視頻輸入與額外圖片可能加價 |
| MiniMax 官方 H3 API | 2K | $0.13 | $1.95 | Context-IR 另按 Token 計費 |
| Modelflare Seedance 2.5 | 480p | $0.18 | $2.70 | 需要 seedance-stable;最長 30 秒 |
| Modelflare Seedance 2.5 | 720p | $0.36 | $5.40 | 與 H3 2K 的供應路徑和分辨率不同 |
| fal Seedance 2.5,16:9 估算 | 720p | 約 $0.473 | 約 $7.10 | Token 公式隨畫面面積變化;視頻參考會改變計費 |
| Google Gemini Omni Flash | 720p | 約 $0.10 | $1.50 | 閉源;輸入 Token 與更高分辨率另有規則 |
H3 的音頻參考免費,前 5 張參考圖片免費,之後每張 $0.04;參考視頻按時長和目標分辨率費率計費。將 768P 結果 regeneration 到 2K 需要每輸出秒 $0.05。因此,重參考任務的真實價格可能明顯高於表面輸出單價。
Seedance 2.5 在 Modelflare 的實時有效價格仍為 480p 每秒 $0.18、720p 每秒 $0.36,已包含 seedance-stable 分組倍率。它比 fal 引用路徑便宜,但仍高於 H3 官方托管價格。這只能用於預算,不代表兩條不同配置的視頻具有相同可用效果。
生產中應該比較的是每個驗收通過秒的成本:所有成功與失敗生成、付費參考、重試、人工編輯時間和最終可用時長,除以真正被接受的輸出秒數。單生成秒貴四倍的模型,如果能顯著減少返工或替代昂貴後期,仍可能在最終成本上獲勝。
為甚麼自托管不等於免費
H3 開放包改變的是控制權,不會改變計算規律。
- 核心是 33B 稠密生成器,還包括完整 Qwen3-VL-32B encoder 與多套 VAE。官方 SGLang 示例為每個 serving variant 使用 4 張 GPU。
- 初始開放版本運行 full attention;開發中使用的 sparse-attention 推理實現要在之後發佈。
- 同時服務兩套 checkpoint 會增加存儲、預熱容量、模型加載、可觀測性、審核與升級工作。
- 本地 H3-Base 輸出 768P。復現官方 2K 結果仍要使用托管服務,或另行驗證社區方案。
- GPU 利用率決定經濟性。流量突發的團隊可能為閒置自托管容量支付更多,即使邊際 GPU 秒看起來便宜。
當原始素材必須留在受控環境、固定風格值得投入 LoRA、流量足夠穩定能吃滿 GPU,或團隊確實要修改推理層時,自托管很有吸引力。實驗、突發流量和官方 2K 收尾繼續使用 API 也完全合理。
H3 真正顛覆了甚麼
- 開放性從信仰題變成效果題。 團隊現在可以評估可下載模型,而不必先接受二線輸出質量。
- 前沿價格開始承壓。 官方 2K 每秒 $0.13,迫使閉源系統用更長時長、更多控制、可靠性或工作流整合來證明溢價。
- 下游工程可以修改模型層。 量化、LoRA、繼續訓練、新 scheduler 和專用推理不再只能等待單一廠商路線圖。
- 混合架構變得實際。 敏感或重復的基礎生成可以留在本地,Context-IR、regeneration 或突發容量按需購買。
- 衍生週期被壓縮。 fal 在同月推出後訓練並優化推理的 H3 Max。fal 聲稱 5 秒 768P 可在 3 秒內生成;Artificial Analysis 也將其放入當前文生視頻頭部區間。速度是廠商數據,但衍生模型已經存在這一事實可獨立觀察。
最後一點最具顛覆性。閉源 API 也能降價或增加參數,但只有可修改基礎模型允許另一支團隊同時從模型與系統層攻擊質量、延遲和成本。
顛覆性在哪裡停止
- 社區許可不是 OSI 批准許可,默認排除歐盟、英國、韓國與美國;這些地區需要另行取得許可。
- 年營收超過 $2000 萬的商業產品要先獲得書面授權;商業界面必須顯著展示“MiniMax H3”。
- 公開生成內容有披露要求;下游服務還要部署安全措施並執行使用限制。
- H3-Context-IR 與官方 2K regeneration 實現不在開放發佈中。
- 足以復現系統的訓練數據說明與完整訓練代碼沒有公開。
- 開放權重不會自動解決肖像、聲音、同意、版權、品牌安全與人工審片義務。
因此,H3 更大程度上顛覆了技術與經濟棧,而不是徹底消除供應商依賴。MiniMax 開放了最有價值的基礎層,同時保留托管質量模塊、商業 API 與許可控制。
哪個模型更適合哪種生產約束
| 首要約束 | 更適合先試 | 原因 |
|---|---|---|
| 16–30 秒連續敘事 | Seedance 2.5 | 單次時長是 H3 的兩倍,並有明確延長能力 |
| 超過 12 個混合參考 | Seedance 2.5 | 最多 50 個文件,對比 H3 上限 12 個 |
| 自托管、微調或定制推理 | H3 | 可下載基礎 checkpoint 與多運行時支持 |
| 低成本 2K 短視頻 | H3 | 官方 2K $0.13/秒,且偏好數據很強 |
| 圖生視頻偏好信號 | H3,然後實測 | 當前 Arena 快照暫列第一,但頭部置信區間重疊 |
| 時間戳與綠幕工作流 | Seedance 2.5 | 專業編輯合同更明確 |
| 對話式閉源 API 編輯 | Gemini Omni 1.1 Flash | 原生對話編輯、當前文生視頻領先,720p 約 $0.10/秒 |
| 多鏡頭與元素級商業控制 | Kling 3 系列 | 更明確的分鏡、元素與動作控制面 |
| 已有 Google 或 OpenAI 生產體系 | Gemini/Veo 或 Sora | 身份、安全、計費與工具整合可能比可移植性更重要 |
“更適合先試”不是最終排名。改變生產路由之前,必須用準確交付物做受控評測。
更有意義的實測方法
- 選擇 12–20 個已獲授權的 Brief,覆蓋對話、商品文字、人體動作、多角色連續性、運鏡、圖像條件、視頻參考與局部編輯。
- 在合同允許範圍內,盡量固定輸出時長、畫幅、分辨率檔位、Prompt、參考文件與音頻要求。
- 對不支持的參數做記錄,不要靜默給其中一款模型更簡單的任務。
- 保留每次付費嘗試、審核失敗、超時和廢片,不得只評分最佳 seed。
- 隱藏模型名後,讓審片者分別評估身份、指令遵循、運動/物理、文字、音畫同步、時間連續性、編輯局部性與最終可用性。
- 記錄排隊時間、生成時間、重試次數、人工修改分鐘數、輸入費、輸出費、存儲與流量。
- 報告首輪可用率與每驗收通過秒成本,並給出置信區間;不要把所有結果壓成一個不透明“質量總分”。
- 任何模型、供應商、Prompt 擴寫器、安全策略或價格發生變化後,都用較小的哨兵集復測。
自托管還要使用一致的電力、預留 GPU、利用率、部署人力與故障恢復假設。拿 API 全額賬單只和本地集群電費比較,不是有效的 TCO 分析。
Modelflare 當前可用邊界
截至 8 月 30 日生產目錄核驗,Modelflare 尚未暴露準確的 MiniMax-H3 或 hailuo-03 模型 ID。本文不暗示 H3 當前可以通過 Modelflare API Key 調用。
Modelflare 已在 seedance-stable 中通過 OpenAI 兼容異步 Video API 提供 seedance-2.5,實時有效價格為 480p 每秒 $0.18、720p 每秒 $0.36。生成前請閱讀本地化的 Seedance 2.5 API 指南,並核對實時 Seedance 2.5 價格頁。
如果未來接入 H3,本文必須補充準確模型 ID、Endpoint、實際暴露的參考字段、分辨率、分組、有效價格和一條真實計費任務。僅有上游配置或第三方別名不能證明可用。
常見問題
MiniMax H3 到底算不算真正開源?
MiniMax 將其稱為開源,發佈內容也確實包括真實權重、組件、推理配方,以及修改和再分發權。按更嚴格的 OSI Open Source AI 定義,自定義地區/用途限制與缺失的完整訓練包,意味著“MiniMax H3 社區許可下的開放權重”是更穩妥的描述。
H3 是否比 Seedance 2.5 更強?
不能全面下結論。當前 Arena 圖生視頻快照中 H3 數值領先;文生視頻與編輯中 Seedance 2.5 數值領先。兩者的置信區間與排名區間都重疊,而 Seedance 還擁有更強的 30 秒和 50 參考素材合同。
H3 能不能完全離線生成 2K?
開放的 H3-Base 輸出 768P。MiniMax 官方完整 2K 配方會把本地基礎推理與托管 H3-Context-IR、H3-Regenerate-2K API 結合。完全本地的社區替代方案需要另行驗證,沒有證據時不能稱為復現了官方路徑。
本地運行 H3 一定比 API 便宜嗎?
取決於利用率、硬件、運行時優化、兩套 checkpoint、運維與質量目標。低量或突發任務通常 API 更簡單;持續工作負載、隱私需求或定制微調才更可能證明自托管合理。
結論
MiniMax H3 的顛覆性來自三件通常不會同時發生的事:前沿級人類偏好結果、最低每生成秒 $0.08 的官方托管價,以及下游團隊能夠修改的可下載權重。它讓開放權重模型進入主選清單,而不再只是為了理念或隱私才採用的 fallback。
它的限制同樣重要。H3 是帶嚴格社區許可的混合開放核心系統,硬件需求不低,官方 2K 高質量路徑還有托管模塊。Seedance 2.5 仍是 30 秒敘事與 50 個參考素材板上更激進的托管生產合同;Gemini Omni 也仍是很強的低價閉源競爭者。
按照瓶頸選擇:看重可移植、可修改、短視頻經濟性或圖像條件效果時優先測試 H3;看重長時連續性與巨大參考控制面時優先測試 Seedance。兩者都要按驗收通過產出判斷,而不是看發佈精選片。
官方資料與更新記錄
一手資料與測量來源:
- MiniMax:H3 發佈
- MiniMax:H3 開放權重與架構
- MiniMax H3 官方模型倉庫
- MiniMax H3 Community License
- MiniMax API:視頻生成合同
- MiniMax API 價格
- ByteDance Seed:Seedance 2.5 發佈
- Google:Gemini Omni Flash 模型規格
- Google:Gemini API 價格
- Arena 文生視頻榜單
- Arena 圖生視頻榜單
- Arena 視頻編輯榜單
- Open Source Initiative:Open Source AI Definition 1.0
- fal:H3 Max 衍生模型公告
更新記錄:
- 2026 年 8 月 30 日: 首次發佈。重新核驗 H3 官方架構、開放包、許可、API 價格、Seedance 2.5 合同、Modelflare 實時價格與可用狀態,以及帶日期的 Arena 快照。封面是合成編輯插畫,不是 H3 輸出、基準結果或真實產品界面。