MiniMax 在上週發表了 H3 開源模型的第一週社群回顧,提到近 300 個衍生模型、一系列量化版本、原生的 Mac 推理引擎,以及由代理驅動的生產流程。全都值得一看。
但最值得拉出來談的,是第一個段落結尾處的一句話,描述了一位動畫創作者實際的工作方式。官方原文是:
他在 RTX 3060 上生成 480p 影片進行疊代,用本地硬體來預覽、篩選、試錯,直到某個版本令他滿意,才轉到雲端以更高解析度渲染最終版本,並完成超解析度。
官方報導給了這個習慣一個名字:本地草稿,雲端定稿。
這三個字,正是我們在數月模型比較工作中反覆遇到的結論。這篇文章的目的是要好好說清楚:為什麼這個分工成立,以及一旦成立,你需要保留什麼。
重點摘要
- 本地 MiniMax H3 終於能在消費級硬體上運行,但本地只是低解析度端。2K 最終版是獨立的一次生成,不是放大渲染。
- 從草稿到最終版唯一必須傳遞的只有提示詞,所以整個工作流程取決於提示詞能否跨越這個過程。
- 把同一句 MiniMax H3 提示詞逐字在多個模型上同時執行,目的是健康檢查提示詞,而不是排名模型。
- 一個約束條件可以完全照字面滿足,卻仍然錯失重點。鎖定承載概念的那個屬性,而不是副作用。
- 值得保留的兩項資產是:分類好的提示詞庫,以及每個提示詞背後的決策邏輯。
為什麼「本地草稿,雲端定稿」目前只對 MiniMax H3 有效
這個分工取決於一件事:本地端突然變強了。
開源一週內,社群在推理效率上進展神速。ComfyUI 團隊砍掉了佔參數量約四成的調製權重,換成預先計算的表格,加上 INT8 量化與自訂 kernel,把最小模型組合從 123.6GB 降到 42.5GB 記憶體。再加上動態卸載,一張消費級顯示卡就能做本地推理。
另外,Redis 創作者 antirez 用 C 和 Metal 從零寫了一個原生 Apple Silicon 推理引擎。它直接讀取 safetensors 權重,把文字與視覺編碼器、DiT、以及視覺與音訊 VAE 全部打包成一個原生 Mac 程式,完全不依賴 Python 或 PyTorch。
NVIDIA 研究團隊在發佈當天 4.5 小時內完成了第一版推理優化,並在八卡設定上回報了比 Diffusers 快 3.95 倍的端到端加速。
把這些加起來,結果很明確:本地現在能跑了,但渲染出來的東西解析度很低。
所以創作者的分工自然成立。低解析度快、便宜、可重複,正是試錯所需要的。最終交付還是回到雲端。兩端不是替代關係,而是同一條線上的兩個站。
在兩個 MiniMax H3 階段之間,實際傳遞的是什麼
這是我們真正關心的問題。
你在本地花了二十次 480p 的嘗試,終於調出你要的畫面。現在你轉到雲端做最終版。你能真正帶過去的東西是什麼?
不是 480p 的片段,解析度太低。不是模型權重,雲端有自己的。
是提示詞。
整條線上,唯一必須跨越兩端且保持不變的東西就是提示詞。它是這個工作流程中唯一的資產。
這個結論的影響比聽起來更大:
- 如果你的提示詞在環境改變後就失效,這個分層工作流程根本跑不起來。 你在本地調好的所有東西,在通往雲端的路上都白費了。
- 如果你為每個模型重寫提示詞,每次換模型你都得重複草稿階段。
- 反過來說:如果提示詞夠可攜,你甚至可以在一台更便宜的模型上進行草稿,只要它對同一句提示詞的解讀是可預測的。
所以問題變成:如何寫一個在環境改變後仍然有效的提示詞? 我們測試了這個。
同一句 MiniMax H3 提示詞,同時跑四個模型
過去幾天,我們做了十幾次這樣的比較:同一句提示詞逐字不變,只改提交參數,同時發給四個模型,涵蓋 VFX、產品 UI 動態、音樂短片等主題。
下面是用同一句提示詞在八個主題上跑的結果。每個片段是四格分割,左上 Seedance 2.5,右上 MiniMax H3,左下 Seedance 2.0,右下 Kling v3.0pro。
武俠對決:同一句提示詞,四個模型。請開聲音。
動漫戀愛場景,同樣的四格分割。
手提包廣告:同一句提示詞的產品短片。
女團表演,分割中各段音訊同步。
KNNOfby0vtw角色驅動場景,四個模型並排比較。
相機廣告,同一句提示詞平行執行。
運動鞋廣告,八個主題的最後一個。
這次測試的真正目的
這不是排名。這是對提示詞的體檢。
因為提示詞是逐字不變的,只改了提交參數:
- 四個模型之間的差異就是模型本身的差異。 這聽起來像廢話,但這是整個練習的基礎,而且只有在四個模型在同一個執行環境中運行時才成立。如果從不同來源拼湊幾個介面,你就會把連結層級的變數混入差異中,就無法分辨是模型差異還是平台差異。
- 所有四個模型都失敗的地方,是提示詞的問題,不是模型的問題。 這是草稿階段最有價值的訊號,而且是單獨跑一個模型永遠得不到的。一個模型沒做到,你會懷疑是模型的問題。四個都沒做到,答案就很清楚:回去改那一行提示詞,不要換模型。
- 每次只改一個變數,其餘保持不變。 這是唯一能讓「這個版本比較好」站得住腳的方法。如果一次改太多,你就無法歸因任何事。並行跑多個模型,意味著一個單一變數的改變,你同時就有四個觀察點。
所以檔案裡要記什麼
不是參數表。參數在模型頁面上就有,複製它們不帶任何資訊。值得記錄的是「我寫了什麼,然後我觀察到了什麼。」 兩個例子:
| 提示詞內容 | 四個模型顯示的結果 |
|---|---|
| 在 4 秒 / 8 秒 / 12 秒出現三個節拍 | 兩邊都有時間漂移,方向相反。MiniMax H3 提早,且領先幅度累積,落在接近 4/6/8 秒。Seedance 2.0 延遲,且完全漏掉中間的節拍。 |
| 「保持扁平圖形風格,不要渲染成逼真生物」 | 兩邊都完全照做,回傳平滑的向量霓虹輪廓。扁平?是的。手繪?完全不是。 |
第一個的價值在於方向。只記錄誤差的大小沒用,因為下次你補償時會補錯方向。一個需要推遲,另一個需要提前。
第二個更有價值,是下一節的主題。
你不再需要自己寫腳本來做這個
當我們做這些比較時,我們自己寫了腳本來提交任務並輪詢結果。現在不用了。Atlas Cloud 推出了 Model Explorer。
寫一句提示詞,選擇最多 10 個模型平行執行,結果並排回傳。
它的真正價值不是方便,而是控制。那次比較之所以能得出結論,是因為四個模型在同一個執行環境中運行。如果從不同來源拼湊四個介面,平台變數就會滲入差異:閘道行為、預設參數、資產編碼方式。任何一個變了,你就以為自己在比較模型,其實是在比較平台。在一個模型池內運行,這些變數就被結構性地壓住了。
有幾件事可以直接對應到草稿階段:
- 預設模型群組。 SOTA、Trending 和 Cheap,加上你自己儲存的組合。先用 Cheap 群組草稿來確定方向,再轉到 SOTA 群組做最終版。這就跟本文開頭的分工一樣,只是兩端都在雲端。
- 執行前顯示成本估算, 這樣你就不會等到最後才知道一輪花了多少錢。
- 同時支援圖片和影片, 圖片端包括文字轉圖片和圖片轉圖片。

Atlas Cloud Model Explorer:從一句提示詞選擇一組模型平行執行,執行前顯示每輪成本估算
可驗證不等於鎖定正確的維度
上一節那句「保持扁平,不要照片級真實」,是我們最常遇到的陷阱。
奇怪的是:約束條件可以完全滿足,卻仍然完全失敗。 扁平?是的。手繪?完全不是。檢查清單每一項都打勾,你得了滿分。
問題在於:我們鎖定了「扁平」,但實際上承載這個概念的屬性是**「可見的工具痕跡」**。改成「蠟筆、色鉛筆、粗筆刷、筆觸方向、不均勻填色、粗糙邊緣」,同一個模型的反應就完全翻轉。
手繪主題在四個模型上的表現。「扁平」很容易滿足,「可見的手工感」才是真正需要鎖定的屬性。
這可以濃縮成一個測試:
把你寫的每個約束條件拿出來問:模型能不能滿足這句話,但仍然漏掉我真正想要的東西?
如果可以,那這個鎖是瞄準了副作用,而不是概念本身。
症狀很熟悉:輸出結果逐項符合你的檢查清單,但任何知道參考對象的人一眼就能看出不對。
這時正確的做法不是增加更多鎖,而是回去找出真正承載概念的那個屬性。
回到「本地草稿,雲端定稿」,這一點更關鍵:瞄錯維度的約束條件,在草稿解析度下可能看不見。 在 480p 時,平滑輪廓和粗筆刷的差異已經模糊,你只有在花費力氣做了雲端最終版後,才會發現方向錯了。草稿是否能幫你省時間,取決於你在草稿時鎖定的屬性是不是真的。
社群已經把 MiniMax H3 流程打包成可重複使用的資產
官方報導還有一個值得單獨提出的訊號:開發者開始把整個生產過程包裝成可重複使用的東西。
一位 AI 藝術家在 Mac 上用 Claude Code 來協調另一台機器上的本地模型。Mac 負責專案設定、事實查核、腳本、時間軸、字幕、分鏡和結構審查,另一端則負責模型推理。整個過程分成 14 個階段,從簡報一直到批次渲染、素材剪輯和帳目回寫,完全不需要打開傳統編輯器。
另一個專案把同樣的概念包成一個外掛,內建技能,從故事或商業簡報到角色與場景設定、分鏡與關鍵畫格設計,然後為每個鏡頭選擇工作流程。提示詞、輸入資產、工作流程、候選鏡頭和選擇結果都保留在專案記錄中,所以中斷的任務可以從中斷處繼續。
方向都一樣:大家都在把「某個作品是怎麼做的」變成可重複使用的資產,而不是留下一堆完成的影片。我們做的兩樣東西正好落在這個線上。
兩個你現在就可以拿走的 MiniMax H3 資源
-
官方 MiniMax H3 提示詞庫(52 個提示詞,16 個分類,每個都有預覽)
Plain1https://github.com/AtlasCloudAI/awesome-minimax-h3-prompts
不是改寫版,而是官方展示中的原始提示詞,按場景分類,每個都配有一支實際生成的預覽影片,讓你看到結果後再決定要複製哪一個。
16 個分類涵蓋品牌與電影、視覺創意與包裝、動態圖形與 VFX、AI 敘事、產品與電商、數位與遊戲創意、工業與具身 AI、動畫與風格化、多材質參考、角色/動作/攝影機參考、語音複製、角色與物件編輯、場景與 VFX 編輯、音訊與對話編輯、精確指令遵循,以及風格預設。支援 20 種語言,並接受投稿。
在草稿階段最省時的使用方式:找一個主題接近的提示詞,看它的預覽,然後以它為起點進行編輯。 遠比從空白框開始快。

awesome-minimax-h3-prompts 倉庫在 GitHub 上的頁面,顯示分類索引以及一個帶預覽影片的條目
-
通用影片提示詞 Skill
Plain1https://github.com/kiana-liang/universal-video-prompt-skill
Plain1npx skills add kiana-liang/universal-video-prompt-skill
它解決了第二節的問題:你複製了提示詞,但無法複製寫提示詞時所做的判斷。 口號說的就是這個。你無法透過複製提示詞來複製的底層決策邏輯,就在這裡。
它的做法是把「先想清楚,再寫成形式」拆成一個可重複使用的決策檢查清單:
- 每行之前問兩個問題: 這屬於哪一層(全域、鎖定、或時間性),以及它是否以可觀察的形式寫成?
- 把不可驗證轉譯為可驗證。「保持一致性」變成可見的終端狀態。「緊張」變成眼神移動、呼吸和手部動作。
- 一種抗方言的方法: 同時寫出術語和可觀察的描述。知道術語的模型走捷徑,不知道的模型跟著描述走,一句提示詞涵蓋兩者。
- 跨環境不需重寫。 純語言層只寫一次,模型特定的偏差則記錄在另一個設定檔表中,就是第三節提到的那種。
這個倉庫提供 5 種鏡頭類型、4 個完整案例、6 個模型設定檔、4 支示範影片。每支影片都綁定它示範的特定規則,不是作品集。
它也清楚說明它不做什麼:沒有必填欄位,沒有範例是規則,每個規則都有例外。 如果你在找一個填空範本直接套用,這不是你要的。
最終端:在 Atlas Cloud 上運行 MiniMax H3
MiniMax H3 的所有三種呼叫模式都已上線 Atlas Cloud:文字轉影片、圖片轉影片、參考轉影片,每個模型頁面上都有參數、持續時間選項和請求範例。
Plain1總覽 https://www.atlascloud.ai/models/minimax-h3 2文字轉影片 https://www.atlascloud.ai/models/minimax/h3/text-to-video 3圖片轉影片 https://www.atlascloud.ai/models/minimax/h3/image-to-video 4參考轉影片 https://www.atlascloud.ai/models/minimax/h3/reference-to-video 5比較工具 https://www.atlascloud.ai/model-explorer
Atlas Cloud 將這些主流影片模型整合到一個池中,因此只需一個 API 就能改變模型字串來跑整個比較。這就是第三節中四個模型測試的運行方式,只是那時我們還自己寫腳本,而現在在 Model Explorer 上點幾下就行了。
所以實際的流程是這樣串起來的:
| 階段 | 地點 | 目的 |
|---|---|---|
| 草稿 | Model Explorer,選擇 Cheap 預設群組,一句提示詞平行執行 | 快速測試方向,建立模型設定檔表 |
| 定稿 | 同一個模型池,切換到目標模型 | 提示詞不變,只改模型字串 |
| 出貨 | API 呼叫,進入你自己的生產流程 | 批次、可協調 |
三個階段使用相同的提示詞和相同的金鑰。 過程中沒有重寫任何東西,環境也沒有改變,這正是第二節的重點:必須跨階段傳遞的唯一資產就是提示詞,所以不要讓它在途中變形。參數、持續時間選項和 API 範例都放在 MiniMax H3 模型頁面上。
結語
開源一週,社群已經把 MiniMax H3 裝進消費級顯示卡、原生 Mac 程式,以及自動化生產流程中。這些工作讓本地端變得真正可用。
但本地能跑不代表本地能交付。「本地草稿,雲端定稿」是一個好習慣,因為它不把兩端對立起來。 它接受這是同一條管線,兩個站做兩份工作。
而要讓這條線動起來,中間傳遞的那個東西必須可靠。那個東西就是提示詞。 所以真正值得你花時間的,永遠不是你渲染的任何一部影片,而是你當初為什麼那樣寫。
MiniMax H3 提示詞常見問題
沒有本地 GPU 要在哪裡跑 MiniMax H3?
所有三種 MiniMax H3 模式(文字轉影片、圖片轉影片、參考轉影片)都在 Atlas Cloud 上運行,每個模型頁面上都有參數和持續時間選項。在社群版本設定好之後,本地推理適合用來做便宜的 480p 草稿,但更高解析度的最終版仍然在雲端渲染。
如何公平地比較 MiniMax H3 與其他影片模型?
在同一執行環境中,用同一句提示詞逐字不變地跑多個模型。Model Explorer 可以同時平行跑最多 10 個模型,這樣閘道行為、預設參數和資產編碼都保持不變,你看到的差異就是模型本身的差異。
MiniMax H3 的提示詞可以轉移到其他模型嗎?
這正是好好寫提示詞的重點。保持純語言層可觀察且抗方言(術語加描述),並將模型特定的時間偏差記錄在另一個設定檔表中。這樣提示詞就能在從草稿模型切換到最終模型時保持不變。
哪裡可以找到現成的 MiniMax H3 提示詞?
awesome-minimax-h3-prompts 提示詞庫包含 52 個官方展示提示詞,分為 16 個分類,每個都有實際預覽影片,支援 20 種語言。找一個主題接近的,看預覽,然後從那裡開始編輯。






