Meta Title: MiniMax H3 吉卜力風格 2026:3 步驟,含音效
Meta Description: 一張繪製的關鍵幀、一次15秒的MiniMax H3渲染,風聲與蟬鳴便在同一檔案中到來。真實的提示詞、真實的設定、操作介面截圖。
MiniMax H3 吉卜力風格:3 步驟,打造真正有呼吸感的 15 秒手繪鏡頭
你見過那種行不通的版本。有人把一張繪製的肖像丟進影片工具,等著,然後得到三秒鐘的 Live Photo 搖晃感:頭髮顫動、雲朵凝結、沒有聲音、不斷循環。
手繪電影從來不是那樣動的。它也從來沒那麼安靜。
所以,這是我們改採的做法。一張繪製的關鍵幀、一次 MiniMax H3 吉卜力風格 的 15 秒渲染,然後草浪翻湧、電車駛過高架橋、蟬鳴聲鋪滿背景、四個鋼琴音符獲得解決。所有一切來自單次任務、在同一個檔案中、內嵌立體聲音效。
下方:先看完成的鏡頭,接著是精確的提示詞、真正能執行的設定、真實操作的遊樂場截圖,以及逐項的帳單。
重點摘要
- 單次 15 秒 2K 任務可產出 2560x1440、24fps、AAC 立體聲 32kHz、無浮水印。
- 手繪感是節奏問題,不是色調問題。要求「一拍二」而非流暢。
- 風聲、蟬鳴與鋼琴聲來自同一次渲染,無需第二道配樂工序。
- 3 步驟:繪製關鍵幀、將其動畫化、用參考圖到影片匹配第二個鏡頭。
- 將工作室與導演名稱排除在提示詞之外,改為描述工藝本身。
這是完成的鏡頭,在所有理論之前。
請開啟聲音。一次連續的 15 秒圖像轉影片任務,在 MiniMax H3 上執行,2K,無剪輯,無後製:草叢風動、電車鈴聲、蟬鳴底噪與鋼琴聲,全都在這單一個 mp4 檔案中同時抵達。
無法在你閱讀的地方播放影片?以下是四個重要的節拍,直接從上方檔案中擷取。

來自 MiniMax H3 吉卜力風格山坡渲染的四個幀,分別在 0s、5s、10s 與 15s,顯示第一次草叢風動、電車駛過高架橋、第二次風動以及最後的靜止節拍
同一渲染在 0s、5s、10s 與 15s 取樣。注意最後一張卡片:畫面中刻意沒有新元素進入。
為什麼大多數 MiniMax H3 吉卜力風格的嘗試看起來像濾鏡
先說結論:濾鏡感幾乎從來不是顏色的問題,而是時機、聲音與片長的問題。
這裡有證據。手繪賽璐珞電影並非以每秒 24 張獨特圖畫來動畫化。拆解宮崎駿的一個跑步循環,Animation Obsessive 稱之為「以『一拍二』方式繪製的跑步」,每秒「12 張圖畫」,其中「每張圖畫在螢幕上停留兩個幀」。(Animation Obsessive,2023 年 3 月)
現在想想影片模型預設會做什麼。它會進行插值。流暢地。絲滑地。以全幀率。
這就是全部破綻。你的色調沒問題。你的動作太好了。
問題是:模型能否在整整 15 秒內保持繪製圖層不融化?可以,而這就是它看起來的樣子。

手繪金魚與海草,在真實陽光照射的廚房檯面上方動畫化,來自 MiniMax H3 15 秒渲染
MiniMax H3 範例運行:用蠟筆勾勒的金魚與綠色海草筆觸,繪製在真人實拍的廚房素材之上,持續整整 15.08 秒且線條未模糊。此處以靜態 GIF 顯示;輸出的檔案包含 24 fps 影片與 32kHz 立體聲音效。
第二個致命原因:混合風格承諾。撰寫「寫實動畫水彩」會讓模型試圖同時滿足三個合約,結果就是人們稱之為「AI 垃圾」的糊狀物。專注於一種媒介,它就能保持。

黏土動畫狐狸躍起於裂石之上,旁邊是發光的熔岩裂縫,可見塑膠指紋紋理,來自 MiniMax H3 渲染
相同原理,不同媒介:單一風格承諾(「停格黏土」)在 10 秒內產生了真實的指紋紋理與停格動畫的重量。靜態 GIF ;原始檔案為 2560x1440 並含立體聲音效。
第三和第四個原因:寂靜,以及沒有呼吸空間。人們對這種風格的觀感中,大約一半來自聲音設計、風聲與稀疏的鋼琴。而停頓需要真正的秒數。一段 5 秒的片段在物理上無法容納三秒鐘的靜止。
這是我們反覆參考的診斷表。
| 輸出中的症狀 | 真正原因 | 在提示詞中加入這個 |
|---|---|---|
| 絲滑、滑動、「太流暢」的動作 | 模型以全幀率進行插值 | 一拍二手繪、保持畫格、輕微的幀間線條抖動、無插值的絲滑動作 |
| 輪廓融化或爬行 | 競爭的風格承諾 | 只命名一種媒介:純色填充、手繪墨線、水彩繪製背景 |
| 臉部或服裝在鏡頭中改變 | 太長的鏡頭中動作太多 | 每次風動只做一個動作;無新角色、無服裝變化 |
| 攝影光暈、散景、鏡頭耀光 | 攝影先驗知識洩漏 | 無攝影景深、無散景、無鏡頭耀光、無 3D 渲染 |
| 輸出完全無聲 | 未撰寫音訊指令 | 撰寫明確的 Audio: 段落,包含圖層與時間點 |
| 結尾感覺倉促 | 無保持的靜止節拍 | 從第十二秒到第十五秒,除了草之外什麼都不動:保持靜止,不要添加新動作 |
你使用的端點與提示詞同樣重要。共有三個,各自負責不同工作。
| 端點 | 控制什麼 | 長寬比 | 用於 |
|---|---|---|---|
| minimax/h3/text-to-video | 僅提示詞,無幀鎖定 | 需明確指定比例,不接受自適應 | 在你擁有美術作品前探索風格 |
| minimax/h3/image-to-video | 首幀鎖定構圖、色調、紙張紋理 | 列舉值僅限自適應;你的幀決定形狀 | 主要的「將繪畫動畫化」步驟 |
| minimax/h3/reference-to-video | 多個標記參考在新鏡頭中引導風格 | 接受所有 7 種比例,明確傳遞 16:9 | 第二個鏡頭、第三個鏡頭,匹配系列 |
一個值得寫在手心的陷阱:在同一次呼叫中同時傳送 image 與 refers 不會報錯。任務會完成、全額計費,並默默地丟棄其中一個輸入。我們在兩個端點上都測量過,被丟棄的方向不一。每次呼叫只選一個端點。
MiniMax H3 吉卜力風格工作流程:三個模型,一個分頁
本節提供完整鏈條及各環節費用。全部可在 Atlas Cloud 的一個瀏覽器分頁中端到端執行,下方所有截圖均在此操作,因此你無需為了重新上傳而匯出檔案。
為什麼對這個特定任務很重要:繪畫模型與影片模型必須在幀上達成一致。將它們保留在同一平台上,意味著你生成的關鍵幀已經是一個檔案,可供下一個遊樂場作為其首幀使用,而參考圖到影片步驟可以同時存取關鍵幀以及從你完成的剪輯中擷取的靜止幀。
| 此鏈條中的任務 | 模型 / 端點 | 解析度 | 價格(2026 年 8 月 21 日驗證) |
|---|---|---|---|
| 繪製關鍵幀 | openai/gpt-image-2/text-to-image | 2048x1152, quality high | 每張圖像 $0.1745(列出的 $0.009 是代幣層級最低價) |
| 將關鍵幀動畫化 | minimax/h3/image-to-video | 2K | $0.14/秒,15 秒則為 $2.10 |
| 先便宜地草擬 | 相同端點 | 768P | $0.10/秒,8 秒則為 $0.80 |
| 匹配第二個鏡頭 | minimax/h3/reference-to-video | 2K | $0.14/秒,參考圖免費 |
| 將照片重新繪製為藝術品 | google/nano-banana-2/edit | 2k 層級 | $0.12(列表為 $0.08;層級會調整價格) |
| 可選的額外音樂提示 | minimax/music-2.6 | 不適用 | 每首 $0.15 固定費用 |
一個能省去與自己試算表爭論的習慣:模型頁面上的標題價格是地板價,不是你的帳單。H3 頁面列出 $0.10/秒,這是 768P 層級;2K 是 $0.14。GPT Image 2 列出 $0.009,這是代幣層級最低價,而品質 high 在 2048x1152 時實際報價為 $0.1745。每次都要看「執行」按鈕,因為那才是你將被收取的金額。
截至 2026 年 8 月,H3 端點上沒有折扣活動。僅影像模型的 -developer 變體有降價,這對草稿有用,但對最終交付無關。
讓我們開始吧。
步驟 1:繪製關鍵幀
幀負責大部分工作。影片步驟無法憑空創造的一切——構圖、色調、線條品質、紙張紋理——都必須已經存在於這個 PNG 中。
開啟 GPT Image 2 文字轉圖像遊樂場 並逐字貼上以下內容。
Plain1Hand-painted 2D animation background in the style of 1990s Japanese cel animation: a wide summer hillside in late afternoon. Tall green grass fills the lower two thirds, painted in soft gouache with visible brush texture and hand-inked blade edges. A girl about ten years old stands in the middle distance seen from behind, wearing a plain yellow raincoat and a red backpack, one hand holding down a straw hat. Beyond the hill a narrow single-car tram crosses a green valley on a low stone viaduct; distant blue mountains fade into a pale cream sky with towering cumulus clouds painted as flat layered shapes. Warm 4pm light, soft ambient shadows, no harsh contrast, limited palette of grass green, cream, sky blue and one yellow accent. Cel-animation line quality: clean confident outlines, flat colour fills, hand-painted watercolour background, subtle paper grain. No text, no logos, no watermark, no photorealism, no 3D render, no lens flare, no modern buildings.
設定:品質 high,尺寸 2048x1152(16:9),一張圖像。不要在此處降至 medium。紙張紋理與墨線草葉邊緣正是較低層級會抹去的細節,而這兩樣東西正是後來讓整個鏡頭具有說服力的關鍵。
注意提示詞中沒有提到的內容。沒有工作室名稱,沒有導演名稱。每個風格指示都是對工藝的描述:gouache、手繪墨線邊緣、純色填充、賽璐珞動畫線條品質。這不是出於謹慎,而是更好的提示詞,因為「具有純色填充與可見紙張紋理的賽璐珞動畫」是具體指示,而工作室名稱則是模糊的指示。
這是執行結果。

Atlas Cloud 上的 GPT Image 2 遊樂場,已載入手繪山坡提示詞,品質設為 high,16:9,完成的吉卜力風格關鍵幀顯示在輸出面板中
GPT Image 2 品質 high ,2048x1152,在 Atlas Cloud 上執行。注意「執行」按鈕:$0.1745,而非定價頁面上的 $0.009。
以及關鍵幀本身,因為你即將把這個確切的檔案送入下一步:

手繪夏日山坡關鍵幀:從背後看到的女孩,穿著黃色雨衣,身處高草叢中,山谷對岸的石橋上有一輛單節電車,平塗的層狀積雲
使用 openai/gpt-image-2/text-to-image 生成。這個 PNG 是本文開頭完成的鏡頭的第一幀。
步驟 2:將其動畫化為 MiniMax H3 吉卜力風格動態
現在是關鍵部分。這個提示詞比大多數人寫的都要長,這是故意的:你正在寫的是一份時間表,而非一種氛圍。
它指定了典型提示詞不會指定的四件事:每次風動何時開始、電車何時進入與離開、節奏為一拍二、以及完整的音訊段落,包含每個音層的進場時間。
在 MiniMax H3 圖像轉影片頁面 載入你的步驟 1 PNG 並貼上以下內容。
Plain1Animate this painting as one continuous hand-drawn shot, 15 seconds, no cuts. 2Camera: a very slow push in, barely perceptible, plus a gentle drift right of about five percent of frame width. No zoom snap, no handheld shake. 3Motion: wind moves through the tall grass in two long travelling waves, one starting at second two and one at second nine, bending the blades the same direction each time. The girl's raincoat hem and hair lift with each gust; her straw hat brim flexes. Clouds drift almost imperceptibly. At second seven a single-car tram crosses the viaduct left to right and leaves frame at second eleven. From second twelve to fifteen nothing moves except the grass and one cloud shadow crossing the hill: hold the stillness, do not add new action. 4Animation cadence: hand-drawn on twos, held drawings, slight frame-to-frame line wobble. No interpolated silky motion, no morphing, no melting edges. Keep flat colour fills and painted paper texture. Do not add photographic depth of field, bokeh or lens flare. 5Audio: continuous summer cicadas at a steady mid level; layered grass rustle that swells with each gust; one distant tram bell at second seven with faint wheel rumble fading out by second eleven; and a sparse solo piano line of four notes entering at second three and resolving at second thirteen. No voice, no narration, no dialogue, no on-screen text, no music beyond that piano line.
設定:image = 你的步驟 1 PNG,解析度 2K,持續時間 15,比例保持 adaptive。最後一點不是偷懶。這個端點上的列舉值僅包含 adaptive,而輸出形狀由上傳的幀決定,因此 16:9 的關鍵幀會產生 16:9 的片段。
現在,在點擊「執行」按鈕之前先讀取它,因為這正是我們損失一次嘗試的地方。
在 2K 與 15 秒的設定下,報價應顯示 $2.10。我們的報價顯示 $1.12。持續時間滑桿從未接受我們的 15,任務是以預設的 8 秒執行的,而表單上的其他所有欄位看起來仍然完全正確。這是那次執行,陷阱就坐落在畫面中。

Atlas Cloud 上的 MiniMax H3 圖像轉影片遊樂場,已載入繪製的關鍵幀,解析度 2K,完成的吉卜力風格山坡片段在輸出面板中播放
提示詞要求 15 秒。播放器顯示 0:08。「執行」按鈕顯示 $1.12。解析度 2K 已確認,持續時間則沒有。請讀取價格,永遠不要相信滑桿。
解決方法有兩種:拖動滑桿並確認報價在提交前變為 $2.10,或透過 API 發送任務,其中 duration: 15 只是一個不會默默遺漏的欄位。本文開頭的片段是第二種方法,相同的端點與提示詞,resolution: 2K,duration: 15。
以這種方式交付:一個 15.08 秒的容器,2560x1440,24fps,H.264 搭配 AAC 立體聲 32kHz,任何地方都沒有浮水印。意外產生的 8 秒版本則以完全相同的幾何結構回傳,正好 8.00 秒。預計 5 到 10 分鐘的實際時間;在我們的執行中,8 秒 2K 任務約需 310 到 400 秒,而一個攜帶三個參考的 2K 任務則花了 557 秒。
步驟 3:使用參考圖到影片匹配第二個鏡頭
一個鏡頭是展示。兩個屬於同一個世界的鏡頭則是一個序列,而這正是大多數人的吉卜力風格實驗失敗之處:角色的臉部偏移、色調變暖、紙張紋理消失。
解決方法不是更好的提示詞,而是不同的端點。參考圖到影片會接收標記的參考素材,並將其外觀帶入新的攝影機設定。
將你的步驟 1 關鍵幀作為參考餵入。單一個幀就攜帶了色調、線條品質與紙張紋理,而在這個鏡頭中,它本身就能維持外觀,如下方結果所示。如果你自己的執行在動態開始後出現偏移,請從你的步驟 2 片段接近結尾處導出一個靜止幀作為第二個參考,這會攜帶模型在開始移動後對線條所做的一切。然後在參考圖到影片端點貼上以下內容。
Plain1Match the painted look, palette, line quality and paper grain of the reference images exactly, then film a different shot in the same world: a low camera at grass height on the same hillside, looking up at the same girl in the yellow raincoat as she crouches to touch one tall stalk, then stands and looks off toward the valley. 2One continuous shot. Hand-drawn on twos, held drawings, flat colour fills, hand-painted watercolour background. No photorealism, no new characters, no costume change, no text, no watermark. 3Camera: static for the first four seconds, then a slow tilt up following her as she stands, ending on her profile against the cream sky. 4Audio: the same summer cicada bed and grass rustle as the reference; one soft cloth movement as she stands; the same sparse solo piano continuing without restarting. No dialogue, no narration.
設定:refers = 你的關鍵幀,resolution 2K,ratio adaptive(參考幀設定輸出形狀),並選擇你的持續時間。我們的執行以 2K 回傳 8 秒,報價 $1.12,參考圖免費。來自真實執行的三個注意事項:
- 參考檔案是免費的。十張參考圖像與相同長度與解析度的一張參考圖像計費完全相同。
- 如果你傳遞一個 data URL,請明確宣告其
type。端點從副檔名推斷類型,而 data URL 沒有副檔名。 - 在自動化擷取中,永遠不要將
.mp4交給這個頁面的上傳器。這會導致每次上傳都默默失敗,並使「執行」按鈕變灰。

Atlas Cloud 上的 MiniMax H3 參考圖到影片遊樂場,已載入吉卜力關鍵幀作為參考,並在 2K 設定下準備好匹配鏡頭的提示詞
MiniMax H3 參考圖到影片:關鍵幀位於「參考素材」槽位,已載入匹配鏡頭的提示詞,2K。 參考素材 計費為 $0,因此 $1.12 的報價完全是渲染費用。結果如下方所示。

在相同 MiniMax H3 吉卜力風格世界中的第二個匹配鏡頭:低角度攝影機位於草叢高度,仰視穿著黃色雨衣的女孩
交付的第二個鏡頭。相同的色調、相同的線條粗細、相同的紙張紋理、新的攝影機。靜態 GIF ;原始 mp4 包含立體聲音效。
這就是完整的鏈條:繪製、動畫化、匹配。三次執行,一個分頁。
一旦鏈條運作正常,值得嘗試的三個變體:
- 你自己的照片,重新繪製。 將你擁有的風景或街頭照片送入
google/nano-banana-2/edit,使用提示詞:「Repaint this photograph as a hand-painted 2D animation background: gouache and watercolour texture, clean hand-inked outlines, flat colour fills, limited palette of green, cream and sky blue, subtle paper grain. Keep the exact same composition, camera angle and horizon line. Remove all text, signage and logos. No photorealism, no 3D render.」然後將結果動畫化。如果你想要直式,請先將繪製的幀裁切為 9:16,因為幀決定形狀,而非比例欄位。 - 相同幀,不同天氣。 在步驟 2 提示詞前綴「Repaint the lighting as dusk in light rain: palette shifts to slate blue, wet cream and one warm window glow;」並將音訊層換為穩定的小雨加上第八秒一次遙遠的雷聲。無需新的關鍵幀。
- 先在 768P 草擬。 每秒更便宜,適合初步規劃。但有一個硬性規則附帶於此,將在下一節說明。
MiniMax H3 吉卜力風格序列的成本
預覽:一個可發布的 30 秒雙鏡頭序列約需 $4.40,而廉價草擬路線有一個陷阱,可能讓它比節省的成本更貴。
以下是帳單,基於模型頁面上驗證的每秒費率,並與真實任務記錄比對確認。
| 項目 | 端點 | 數量 | 成本 |
|---|---|---|---|
| 繪製關鍵幀 | gpt-image-2, quality high, 2048x1152 | 1 張圖像 | $0.17 |
| 鏡頭一 | h3/image-to-video, 2K | 15 秒,$0.14/秒 | $2.10 |
| 鏡頭二 | h3/reference-to-video, 2K | 15 秒,$0.14/秒 | $2.10 |
| 鏡頭二的參考靜止幀 | h3/reference-to-video | 2 個檔案 | $0.00 |
| 序列總計 | 30 秒完成,2K,含音效 | $4.37 | |
| 任一鏡頭重跑一次 | h3, 2K | 15 秒 | +$2.10 |
| 可選的專屬音樂提示 | minimax/music-2.6 | 1 首 | +$0.15 |
| 可選先以 768P 草擬 | h3, 768P | 8 秒,$0.10/秒 | +$0.80 |
現在是陷阱。為了省錢而先在 768P 草擬,對於構圖與初步規劃是可行的,但它的運作方式並非人們假設的那樣。
我們測量了兩件事。首先,一個純文字轉影片的提示詞以不同解析度層級重新執行,並不會讓畫面變得更清晰,而是會產生一部不同的影片:不同的場景佈置、不同的攝影機高度、不同的道具。透過圖像轉影片鎖定首幀,才能將差異限制在細節層面。其次,這一點讓我們也感到意外:在鎖定相同首幀與相同提示詞的情況下,兩個層級的音軌是不相關的。它們之間的波形相關性測量值為 0.0053,屬於統計噪聲。
翻譯:768P 的草擬可以預覽你的構圖與動作節拍。但它絕不是你最終會出貨的混音。
致敬、版權與你可以發布的內容
簡短版本,且非法律建議:視覺風格本身通常不受版權保護,但訓練資料與輸出是一個活躍且備受爭議的問題,而平台條款則是另一回事。
這個爭議並非假設。2025 年 10 月 27 日,日本內容海外流通促進機構(CODA),一個涵蓋動畫、電影、遊戲與出版的權利人組織,提交了一份書面請求,要求「其成員的內容未經許可不能用於機器學習」,並指出「根據日本的版權體系,使用受版權保護的作品通常需要事先獲得許可,並且不存在可以透過後續異議來避免侵權責任的系統」。(CODA,2025 年 10 月)
三個實用習慣,可保持你的輸出乾淨:
- 描述工藝,而非工作室。我們上面的提示詞提到了 gouache、一拍二、純色填充與紙張紋理,而從未提及任何公司或導演。
- 不要將可識別的角色、標誌或標題卡放入畫面中。我們的山坡上完全沒有任何角色 IP。
- 在商業化之前,檢查適用於你帳戶的條款,並分別檢查你發布內容的平台條款。
建立一個與你喜愛的電影共享技術的世界。不要建立一個特定電影的仿冒品。
常見問題
MiniMax H3 能做到吉卜力風格嗎?我應該在提示詞中寫「吉卜力工作室」嗎?
第一個問題,可以。第二個問題,我們不會這麼做。本文中的每個結果都來自工藝詞彙:hand-painted 2D cel animation、gouache with visible brush texture、hand-inked outlines、flat colour fills、on twos, held drawings、subtle paper grain。這六個短語承載了外觀,它們比工作室名稱更具體,並且讓發布問題更簡單。
MiniMax H3 是自己生成風聲與鋼琴聲,還是我需要事後添加音效?
是它自己,在同一個任務中。MiniMax 將 H3 描述為「生成具有原生立體聲的影片,最高可達 15 秒 2K 解析度」(MiniMax,2026 年 7 月),而我們交付的檔案包含 AAC 立體聲 32kHz。撰寫一個專門的 Audio: 段落,命名每個音層及其進場時間。如果你想要一首完整的創作樂曲而非提示音,請在 minimax/music-2.6 上單獨生成,費用 $0.15,再進行混音。
一個鏡頭可以多長?15 秒真的能保持住嗎?
三個端點上的持續時間都接受從 4 到 15 的每個整數秒,而我們 15 秒的請求交付了一個 15.08 秒的容器。它能保持住。想要 15 秒而非 8 秒的原因不是為了史詩規模,而是恰恰相反:這是唯一能容納三秒鐘「什麼都不發生」的方法,而這正是這種風格所建立的節拍。
如何在兩個鏡頭之間保持相同的角色、色調與紙張紋理?
使用參考圖到影片,並提供兩個參考:原始關鍵幀加上從你第一個完成的剪輯中擷取的靜止幀,並將「match the painted look, palette, line quality and paper grain of the reference images exactly」作為第一個子句。注意一個無聲的失敗:在單次呼叫中混合使用 image 與 refers 會完成任務、全額計費,同時默默丟棄其中一個輸入,回應中沒有任何警告欄位。
我應該先在 768P 草擬,然後在 2K 重新執行以節省成本嗎?
為構圖目的先在 768P 草擬,是的。但必須透過圖像轉影片鎖定首幀,否則重新執行會產生一部不同的影片。並將草擬的音軌視為可拋棄的:相同幀、相同提示詞、不同層級,兩個音軌之間的波形相關性測量值為 0.0053。混音是重新生成的,而非放大。
MiniMax H3 吉卜力風格的影片發布或商業化安全嗎?
取決於畫面中有什麼以及你的帳戶條款怎麼說,這並非法律建議。使用風格描述性提示詞,畫面中不包含角色 IP、標誌與工作室名稱,是保守的版本,而本文展示的正是這個版本。在商業使用前,請驗證適用的條款。
最後一件值得重複的事,因為這是人們常跳過的部分。一個 minimax h3 ghibli style 鏡頭之所以成功,並非因為綠色調。而是因為動態刻意做得比模型能達到的更差,並且最後三秒被允許空無一物。寫下時間表。寫下聲音。然後讓它靜止。






