
凌晨三點的書桌,開放式機殼、外接硬碟,以及一台顯示大型下載進度的螢幕
權重釋出了。所以在我進入正題之前,先回答 MiniMax 發表文章底下回覆最多的兩個問題。
不,你不需要超級電腦。選對檔案,下載量是 42.5 GB,而不是 123.6 GB。模型有 33B 參數,其中約 13B 位在 AdaLN 調變分支中,推論時甚至不需要載入。
然後我打開了 LICENSE 檔案。第 10 行,在我看到 2000 萬美元營收條款之前,是一串國家列表。我的國家在裡面。你的大概也在。
重點摘要
- MiniMax H3 開源權重已在 Hugging Face 上線,為
MiniMaxAI/MiniMax-H3,另有 ComfyUI 重新打包的鏡像Comfy-Org/MiniMax-H3。ComfyUI 同日支援原生功能。 - 不是單一檔案。有 兩個任務專用檢查點:
fl2va(文字與影像驅動)和ref2va(參考驅動),最小版本各約 21 GB。你只需要下載工作所需的檔案。 - 33B 密集單流 Transformer。最小可運作組合為 42.5 GB,比全精度的 123.6 GB 減少 66%。ComfyUI 表示 12 GB 顯示卡搭配卸載可執行。
- 本地生成原生為 短邊 768px,而非 2K。2K 來自第二階段的上下文內再生。
- 商用免費,但必須在使用者介面中顯示「MiniMax H3」,且年營收超過 2000 萬美元需要另行取得書面授權。授權的「適用區域」排除歐盟、英國、南韓和美國。託管 API 則屬於不同的法律關係。
同一個角色、兩個檢查點、同一個凌晨三點。左邊是 fl2va 的成果,右邊是 ref2va 的成果。同一個人、同一個房間、同一個夜晚,兩個完全不同的任務,而你聽到的風扇聲是與畫面同時生成的。

左:影像轉影片,這是 fl2va 檢查點的工作。右:參考轉影片,這是 ref2va 的工作。兩者皆由 MiniMax H3 以原生立體聲生成。請開啟聲音。
我請這個模型生成的第一個畫面,就是一個在等待模型下載完成的人。感覺很對。
權衡 MiniMax H3 開源權重:兩個檢查點與 42.5 GB 的門檻
這就是為什麼這個釋出引起轟動。Artificial Analysis 將 H3 評為 #1 影片編輯,並在文字轉影片和影像轉影片中均名列前三,並表示釋出權重「將使其成為遙遙領先的開源權重模型」(Artificial Analysis,2026 年 7 月)。這是一個有下載按鈕的前沿級影片模型。
誠實的另一面:同一個基準測試顯示 H3 在文字轉影片方面落後於 Google 的 Gemini Omni Flash,在影像轉影片方面落後於 Seedance 2.0 和 Gemini Omni Flash(南華早報,2026 年 7 月)。它在編輯方面是第一名,但並非所有項目都是第一名。
現在是幾乎沒有人在執行 git clone 之前檢查的部分。
沒有出現在任何標題中的參數數量。 模型卡將 H3-Omni-Transformer 描述為「一個 33B 參數的密集單流 Transformer,約有 13B 參數位在 AdaLN 相關分支中」,並補充說因為這些調變輸出可以預先計算並快取,「這些參數在僅推論的部署中不需要載入」。這就是修剪後檢查點的由來。當你只進行推論時,約 40% 的模型會變成查找表。
大多數人白白浪費 80 GB 的地方。 官方的 MiniMaxAI/MiniMax-H3 儲存庫如果全部下載是 498 GB。ComfyUI 鏡像則是 343 GB。兩者都包含兩個檢查點的所有精度變體。你需要的是四個檔案,而不是四百個。
| 檔案 | 大小 | 說明 | 適用場景 |
|---|---|---|---|
| minimax_h3_fl2va_pruned_int8_convrot.safetensors | 20.97 GB | fl2va 檢查點,已修剪 + int8 | 文字轉影片、影像轉影片 |
| minimax_h3_fl2va_int8_convrot.safetensors | 34.04 GB | fl2va,int8,未修剪 | 同上,更高保真度 |
| minimax_h3_fl2va_bf16.safetensors | 66.28 GB | fl2va,全精度 | 微調、研究 |
| minimax_h3_ref2va_pruned_int8_convrot.safetensors | 20.97 GB | ref2va 檢查點,已修剪 + int8 | 僅參考轉影片 |
| minimax_h3_ref2va_int8_convrot.safetensors | 34.04 GB | ref2va,int8,未修剪 | 同上,更高保真度 |
| minimax_h3_ref2va_bf16.safetensors | 66.28 GB | ref2va,全精度 | 微調、研究 |
| qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 15.69 GB | 文字編碼器,4-bit AWQ | 所有工作流程 |
| qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 27.14 GB | 文字編碼器,int8 | 所有工作流程 |
| qwen3vl_32b_minimax_h3_bf16.safetensors | 51.51 GB | 文字編碼器,全精度 | 所有工作流程 |
| minimax_h3_video_vae_fp16.safetensors | 5.21 GB | 影片 VAE | 所有工作流程 |
| minimax_h3_audio_vae_fp32.safetensors | 0.61 GB | 音訊 VAE | 所有工作流程(這是聲音部分) |
| 單一任務最小可運作組合 | 42.5 GB | 已修剪 fl2va + nvfp4 編碼器 + 兩個 VAE | 實際下載量 |
| 兩個檢查點,最小組合 | 63.4 GB | 加上已修剪 ref2va | 如果你需要全部三種模式 |
| 單一任務全 bf16 精度 | 123.6 GB | 全部 bf16 | 僅限研究用設備 |
檔案大小直接取自 Comfy-Org/MiniMax-H3 儲存庫索引,2026 年 8 月。
ComfyUI 對同一個數字的說法是:「總記憶體佔用減少 66%,從全精度的 123.6 GB 降至 42.5 GB」,這使得「新一代 2K 影片模型能夠在 RTX 3060 等 GPU 上本地運行」成為可能(ComfyUI,2026 年 8 月)。請將 12 GB 的數字視為他們在動態卸載下的宣稱,而非基準測試。我沒有在 3060 上運行過,而且卸載會用系統 RAM 和實際時間來換取 VRAM。
「本地運行」的其中一個含義是:768px。 H3 的原生畫布是短邊 768px,上限為 768x1344,根據 ComfyUI 的 H3 教學。持續時間固定為 24fps 下每區塊 17 幀。行銷中的 2K 片段來自 H3-Regenerate-2K,這是第二階段,將 768p 的結果加上原始上下文重新餵回模型。模型卡明確指出完整系統包含三個模組:H3-Context-IR、H3-Base 和 H3-Regenerate-2K。本地的 ComfyUI 提供的是 H3-Base。
而「開源」這個詞在這裡承擔了三種不同的功能。 可下載,是的。可商用,有條件。在你居住的地方可運行,這取決於你住在哪裡。Reddit 上稱之為「實際上是封閉原始碼模型」的說法在第一點上是錯的,但在其他兩點上指出了真實情況。第 7 節有條款原文。
本地 MiniMax H3 開源權重 vs 託管 API:選擇你的路徑
以下所有內容,包括整個四步驟示範,都在 Atlas Cloud 的一個瀏覽器分頁中運行,該平台提供所有三個 H3 端點以及我用於生成基礎畫面的影像模型。這與運行權重不同,而這個差異對於這個模型來說比平常更重要。
| 本地權重 | 託管 API | |
|---|---|---|
| 前期成本 | 42.5 GB 下載、12 GB+ 的 GPU、ComfyUI 安裝 | 一個 API 金鑰 |
| 到第一個片段所需的時間 | 樂觀估計一個晚上 | 約兩分鐘 |
| 每 5 秒片段成本 | GPU 時間和電費 | 0.70 美元(0.14 美元/秒) |
| 原生解析度 | 短邊 768px,透過再生階段可達 2K | 直接 2K,這是唯一的列舉值 |
| 微調、LoRA、修改 | 是的,這就是重點 | 不行 |
| 資料從不離開你的網路 | 是 | 否 |
| 授權風險 | 你接受社群授權及其區域條款 | 你是託管服務的客戶 |
| 如果你在歐盟、英國、韓國或美國 | 第 7 節 | 不受權重授權影響 |
經驗法則:每月少於約 100 個片段,或者你需要直接輸出 2K,或者你位於排除區域,託管在所有方面都勝出。超過這個數量,或者你打算在檢查點之上進行訓練,或者影片不能離開你的建築,那麼 42.5 GB 值得花一個晚上。
價格已從即時模型頁面驗證,2026 年 8 月。所有 H3 端點均按輸出秒數計費,無活躍折扣。
| 模型 | 在此處的功能 | 價格 | 折扣 |
|---|---|---|---|
| MiniMax H3 image-to-video | 步驟 2,fl2va 工作 | 0.14 美元 / 秒,2K | 無 |
| MiniMax H3 reference-to-video | 步驟 3,ref2va 工作 | 0.14 美元 / 秒,2K | 無 |
| MiniMax H3 text-to-video | 步驟 4,無參考基準 | 0.14 美元 / 秒,2K | 無 |
| GPT Image 2 text-to-image | 步驟 1,基礎畫面 | 所列 0.009 美元/張;我使用的高品質 16:9 執行報價 0.1745 美元 | 無 |
| Seedance 2.0 / Wan 2.7 / Kling v3.0 Turbo | 每秒參考點 | 0.112 / 0.10 / 0.095 美元/秒 | Kling 85 折 |
在開始寫程式之前,有一個不一致之處值得注意:H3 的 readme 仍記載 768p 層級為 0.10 美元/秒,持續時間 5 或 10 秒。但即時架構有所不同。resolution 只有一個允許值 2K,duration 接受從 5 到 15 的任何整數。請根據架構編寫程式。這個差距有個巧妙的對稱性:託管端關閉了 768p 層級,而 768p 正是你自行運行權重時得到的原生畫布。
步驟 1:使用 GPT Image 2 生成基礎畫面
這個示範的一切都從一張靜止畫面開始。場景刻意地直白:一位開發者在凌晨 3 點看著 21 GB 的檢查點下載。
模型:openai/gpt-image-2/text-to-image。設定:品質 high,比例 16:9。
plaintext1一張照片寫實的廣角鏡頭,凌晨 3 點的凌亂家庭辦公室,僅由兩台顯示器和桌上開放式機殼的 RGB 燈光照明。一位疲憊的開發者穿著灰色連帽衫,癱坐在網椅中,手托著下巴,盯著左邊的顯示器。左邊顯示器顯示深色終端機,有一個可見的下載進度條,大約在 78%。右邊顯示器顯示檔案瀏覽器。桌上放著一杯冷掉的半滿咖啡、一把機械鍵盤和一個小桌扇。雨滴從他身後的窗戶流下。淺景深、35mm、溫暖的顯示器主光與冷藍色窗光、可見的感光元件顆粒感。無文字疊加、無浮水印。 2
不要請影像模型渲染實際的 safetensors 檔名。長底線字串會變成亂碼。將檔名保留在你的說明文字中。

Atlas Cloud 上的 GPT Image 2 操作介面,輸入了凌晨 3 點的提示詞,輸出面板中顯示了完成的基礎畫面
Atlas Cloud 上的 GPT Image 2:品質 high,16:9,右側顯示了渲染出的基礎畫面。高品質層級對此執行報價 0.1745 美元,遠高於 0.009 美元的清單底價,因此請按層級預算。

生成的基礎畫面:一位疲憊的開發者在凌晨 3 點看著左邊顯示器上的下載進度條
步驟 1 的輸出。這張單一畫面將餵入步驟 2 和步驟 3。
步驟 2:影像轉影片,fl2va 檢查點的工作
這個端點對應於 minimax_h3_fl2va_pruned_int8_convrot.safetensors。輸入一張起始畫面,輸出動態和聲音。本地端這是你會載入的檔案;託管端則是一次 API 呼叫。
模型:minimax/h3/image-to-video。設定:image = 以 data URL 形式傳遞的步驟 1 畫面,resolution: 2K,duration: 5,ratio: 16:9。
plaintext1開發者保持靜止,只有呼吸和眨眼,眼睛緊盯著左邊顯示器。左邊顯示器上的進度條緩慢前進。機殼風扇開始加速,RGB 燈光亮度增強。在結束前一刻,他呼出一口氣,肩膀沉了下來。固定鏡頭,無攝影機移動、無縮放、無剪接。音訊:低沉的機殼風扇聲,音調逐漸升高,微弱的雨聲打在窗上,結尾處一聲柔和的兩音符完成提示音。 2
將圖片以 base64 data URL 傳遞,而非剛生成的儲存 URL。全新的物件 URL 可能會導致上游下載檢查失敗。另外請注意,H3 確實會遵循「固定鏡頭」的指示,這在此類別的影片模型中並非普遍成立。

Atlas Cloud 上的 MiniMax H3 影像轉影片操作介面,已載入基礎畫面,輸出面板中顯示完成的 2K 片段
MiniMax H3 影像轉影片:已載入基礎畫面,2K,執行完成。此截圖使用了端點預設的 8 秒,因此報價顯示為 1.12 美元。下方嵌入的片段是我使用的 5 秒版本,費用為 0.70 美元。

fl2va 工作:輸入一張畫面,輸出五秒的動態加上立體風扇聲。
步驟 3:參考轉影片,ref2va 檢查點的工作
不同的檢查點、不同的檔案、不同的任務。ref2va 不是延伸起始畫面。它接受參考素材,並建立一個新的鏡頭,保持角色和物體的一致性。這就是為什麼儲存庫提供兩個 21 GB 的檔案,而不是一個。
我給了它兩個參考:步驟 1 的畫面(人物和房間),以及一張顯示卡的微距照片(硬體)。
模型:minimax/h3/reference-to-video。設定:refers = 兩張圖片,resolution: 2K,duration: 8,ratio: 16:9。
plaintext1同一個男子,同一件灰色連帽衫,同一張臉,在同一個昏暗的家庭辦公室。新的鏡頭:從側面拍攝的中近景,他往椅背靠去,深吸一口氣,嘴角微微上揚。第二張參考圖片中的顯示卡越過他的肩膀可見,風扇正在減速,RGB 燈光穩定下來。保持他的身份、連帽衫、頭髮和房間照明與參考圖片一致。固定鏡頭。音訊:風扇聲逐漸減弱,一聲鍵盤按鍵聲,雨聲持續。 2
refers 接受圖片、影片和音訊的混合陣列,至少需要一張圖片或影片。僅音訊會被拒絕。這個端點也接受最長 15 秒的持續時間。
這個端點有一個特別的陷阱:必須明確設定 ratio。保留為 adaptive 會回傳 400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive',連續四次,包括在操作介面中明確附加了兩個參考時。在 API 呼叫中設定 ratio: "16:9" 後,第一次就成功了。這也是為什麼下方截圖是參考圖片而非操作介面截圖的原因:我無法將操作介面的比例控制從 adaptive 切換開,因此你看到的片段來自使用上述設定的 API,而非操作介面執行。

第二張參考圖片:夜間在開放式電腦機殼內,一張三風扇顯示卡的微距照片
參考圖片 2,與基礎畫面同批次生成,與步驟 1 畫面一起傳遞。

ref2va 工作:一個全新的鏡頭,而非續接。同一個男子、同一件連帽衫、同一個房間,參考 2 中的顯示卡現在出現在畫面中,風扇正在減速。請注意它對「中近景」的詮釋較為寬鬆,畫面仍然相當寬闊。
步驟 4:文字轉影片,MiniMax H3 開源權重基準
同一個場景,用文字描述,沒有任何參考。這個步驟的目的是展示這兩個檢查點實際上的用途。
模型:minimax/h3/text-to-video。設定:ratio 在此處為必填,且不能是 adaptive,因此設為 16:9。resolution: 2K,duration: 5。
plaintext1一位疲憊的開發者穿著灰色連帽衫,在凌晨 3 點的凌亂家庭辦公室中,由兩台顯示器和開放式機殼的 RGB 燈光照明,看著下載進度條在左邊螢幕上緩慢移動。他身後的窗戶上有雨滴。固定鏡頭 35mm 拍攝,淺景深,溫暖的顯示器光線與冷色窗光,底片顆粒感。音訊:逐漸升高的機殼風扇聲、微弱的雨聲、結尾處一聲柔和的完成提示音。 2

Atlas Cloud 上的 MiniMax H3 文字轉影片操作介面,已輸入提示詞,輸出面板中顯示完成的片段
MiniMax H3 文字轉影片:無參考素材,2K,比例設為 16:9(因為 adaptive 會被拒絕),執行完成。同樣的提示詞,但已經出現與步驟 2 不同的臉孔。

同樣的文字,不同的人。不錯的房間,但錯了人。這個差距正是 fl2va 和 ref2va 作為獨立檢查點存在的全部理由。
如果你要將三者腳本化,有一個操作注意事項:上游的並發量約為一個任務。重疊的任務會回傳 429 rate limit exceeded (task concurrency)。請按順序執行。一個 5 秒的 2K 片段每次大約需要兩分鐘。
MiniMax H3 開源權重的成本,以及授權條款的實際內容
成本問題有兩種貨幣。託管端,一個 5 秒的 2K 片段是 0.70 美元,15 秒的是 2.10 美元,按秒計費,沒有層級,沒有折扣。本地端,貨幣是 GB 和小時:42.5 GB 的下載、一張能容納它的顯示卡,以及一個 768p 的畫布(除非你也執行再生階段)。在每月數百個片段以上,算術就會反轉。低於這個數量則大多不划算。
然後還有第三種貨幣,那就是法律審查時間。我讀了整份 LICENSE。以下是其內容。

桌燈照亮了一台顯示密集文字文件的筆電,旁邊是螢光筆標記的列印稿、老花眼鏡和一杯水
開源權重釋出中,沒有人會為了發表文章而截圖的部分。
| 條款 | 章節 | 內容 | 對你的意義 |
|---|---|---|---|
| 適用區域 | I.3, I.5 | 全球,「排除排除區域」,定義為「歐盟、英國、大韓民國和美利堅合眾國」 | 社群授權並未授予你權利,而本文大多數讀者正居住在這些區域 |
| 區域使用禁令 | V.4 | 你不得「在適用區域外使用、複製、修改、散布或展示 MiniMax H3 作品或其任何輸出或結果」 | 這影響到輸出,而不僅僅是權重 |
| 獨立授權管道 | II | MiniMax 將「持續評估適用法律」,並邀請排除區域內的各方聯繫他們以取得授權 | 這是「尚未」,而非「永不」。儲存庫中附有申請表 |
| 歸屬要求 | IV.2 | 你「必須在使用 MiniMax H3 的任何商業產品的使用者介面上顯著顯示『MiniMax H3』」 | 需要修改使用者介面,而非僅是註腳 |
| 營收門檻 | IV.1 | 年營收超過 2000 萬美元時,你需要事先取得 MiniMax 的書面授權,請聯繫 [email protected] | 免費商用有上限 |
| 禁止模型洗白 | V.3 | 你不得使用 H3 或其輸出「來改善任何其他人工智慧模型」 | 排除了將蒸餾技術用於你自己的模型 |
| 再散布 | III.1, III.4 | 必須隨附本協議、包含 NOTICE 檔案、標記修改過的檔案 | 標準條款,但也約束了下游使用者 |
| 文字編碼器 | 附加說明 | 編碼器是 Qwen3-VL-32B,採用 Apache 2.0 授權 | 堆疊中的一個組件是真正 OSI 開放授權 |
| 管轄法律 | IX | 香港特別行政區法律,專屬香港管轄 | 值得在你的風險登記表中提上一筆 |
協議生效日期為 2026 年 8 月 2 日(Hugging Face,2026 年 8 月)。
大多數發表文章都以「開源權重」為開頭,然後就此打住。公平地說,MiniMax 並沒有隱藏它:儲存庫中附有 docs/QA-about-License.md,說明影片模型面臨比文字模型更快速變化的監管環境,提到了歐盟 AI 法案、英國和韓國的法規,以及美國正在進行的關於生成式影片的版權訴訟,並明確說明「目前的限制意味著『尚未』,而非『永不』」。同一份文件確認了操作上重要的區別:API 保持全球可用,因為 MiniMax 控制著服務基礎設施,而開源權重則失去了這種控制。
因此,如果你在舊金山、柏林、倫敦或首爾,務實的讀法不是「你永遠不能碰 H3」。而是「這個特定的授權並非讓你自行運行這些權重的工具」。請申請獨立授權,或使用託管端點,在那裡你是服務的客戶,而非權重的被授權人。
我不是律師,這也不是法律建議。上述條款原文引用自原始文件,以便你的法律顧問可以在大約十分鐘內直接閱讀。
MiniMax H3 開源權重:常見問題
MiniMax H3 開源權重真的釋出了嗎?我該從哪裡下載?
是的,截至 2026 年 8 月初。兩個地方。MiniMaxAI/MiniMax-H3 是官方儲存庫,約 498 GB,包含 diffusers 格式的管道、兩個變壓器、文字編碼器、兩個 VAE、文件和可重現腳本。Comfy-Org/MiniMax-H3 是重新打包的 ComfyUI 構建,總計約 343 GB,包含大多數人實際需要的量化單檔案檢查點。如果你使用 ComfyUI,請使用第二個並下載四個檔案。
MiniMax H3 有多少參數?我需要超級電腦嗎?
33B,採用密集單流 Transformer。其中約 13B 位於 AdaLN 相關分支中,其輸出可以預先計算並快取,因此僅推論的部署不需要載入它們。這就是「修剪後」檢查點的由來。不需要超級電腦。需要 42.5 GB 的下載和一台高階消費級 GPU。
我能在 12 GB 或 16 GB 的 VRAM 上運行 MiniMax H3 開源權重嗎?
ComfyUI 團隊表示,使用修剪後的 int8 fl2va 檢查點加上 nvfp4 AWQ 文字編碼器,12 GB 的顯示卡可以透過動態卸載來運行。這是他們的宣稱,而非我執行的基準測試。兩個注意事項:卸載會以系統 RAM 和較長的渲染時間來換取 VRAM,因此請預算 64 GB 的 RAM,並預期較長的渲染時間;而且你的本地畫布是 768px 短邊,而非 2K。
MiniMax H3 開源權重真的是開源嗎?還是只是開源權重?
精確來說是開源權重。權重可下載且可修改,這比一年前任何前沿影片模型提供的都要多。但授權未經 OSI 批准,訓練配方和資料未公開,商用帶有歸屬和營收條件,且區域條款限制了授權的適用範圍。唯一真正開源的組件是採用 Apache 2.0 授權的 Qwen3-VL-32B 編碼器。三個不同的層面,「開源」只清楚地描述了第一層。
我可以商用 MiniMax H3 開源權重嗎?2000 萬美元的門檻是什麼意思?
可以,但有兩個條件。你必須在商業產品的使用者介面上顯著顯示「MiniMax H3」(第 IV.2 節)。此外,如果你的商業產品和服務年營收超過 2000 萬美元,你需要在使用前取得 MiniMax 的獨立書面授權,請聯繫 [email protected](第 IV.1 節)。門檻是基於你的營收,而非你的 H3 使用量。
為什麼 MiniMax H3 授權排除美國和歐盟?我有什麼選擇?
根據 MiniMax 自己的授權 Q&A,因為影片生成處於比文字更快速變化的監管環境中,具體是歐盟 AI 法案、英國和韓國法規的演變,以及美國正在進行的關於生成式影片的版權訴訟。一旦權重公開,他們無法在後續執行安全措施,因此他們縮小了授權範圍,而不是延遲釋出。在排除區域的選擇:透過儲存庫中的表單申請獨立授權,或使用託管 API,這屬於不同的法律關係,且保持全球可用。在部署前,請讓你的法律顧問確認哪一種適合你。
驗證於 2026 年 8 月 3 日。後續關注清單上的三件事:社群 GGUF 和更低 bit 的量化(H3 尚無此類項目)、排除區域清單的任何變更,以及 readme 中仍記載的託管 768p 層級是否會重新開放。






