Seedance 2.5 現已上線 — 首發於 Atlas Cloud

我用一段 32 秒副歌 Hook 做出一支 MiniMax H3 音樂影片,只花 $4.80\. 音軌結果讓我很意外。

我把一段 32 秒 hook 當作免費參考音訊丟進 MiniMax H3,拿回四個鎖定節拍的鏡頭,剪出一支真正的 MiniMax H3 音樂影片,花費 $4.80\. 內含提示詞與帳單。

一位影片剪輯師在有多台影片監視器的控制台前工作

深夜的調色室,六台螢幕顯示同一位銀髮歌手的六個不同鏡頭_六個_ 鏡頭,一位藝人,一首歌。使用 openai/gpt-image-2/text-to-image 生成。

Suno 使用者每天生成約 700 萬首歌,差不多每兩週就等於一整個 Spotify 曲庫(TechCrunch,2026 年 2 月)。其中幾乎沒有任何一首會配上畫面。不是因為畫面做不出來,而是傳統路線要經過四個工具:生成靜態圖、讓它們動起來、另外跑一次 lip-sync,最後再進剪輯修補一切。每跳一站,就會丟掉臉、服裝,或節拍。

所以我直接跳過這些轉接。我把一段 8 秒副歌切片直接丟進影片模型的參考欄位,按下 Run。音訊沒有向我收費。

接著我把完成的 mp4 拆開,回答網路上沒有人願意正面回答的問題:模型輸出的聲音到底是我的歌,還是它自己生成、只是聽起來相似的東西?我實測了。答案和我預期不同,而且會改變你應該怎麼剪這支影片。

重點摘要

  • 參考音訊免費。 MiniMax H3 只按輸出秒數計費。我的四段 8 秒參考切片在帳單上增加了 $0.00。昂貴的是參考 video
  • 15 秒是單次生成上限,不是單一專案上限。 把歌曲切片,每個鏡頭拍一段,再串接。我的 32 秒成片是四次生成。
  • 把 hook 寫成 120 BPM。 一小節正好是 2.000 秒,因此 H3 的整數秒 duration 值會直接落在小節線上,不需要手動微調。8s = 4 小節。
  • 輸出音訊就是你的音軌,且樣本對齊。 我量到輸入切片與 H3 交付的立體聲混音在零延遲下有 0.892 的波形相關性。它不是重新生成的。不過最後剪輯時你仍然會想把 master 放回去,原因不同(見下文)。
  • 實際總花費:$7.53,包含失敗在內共九次生成。進入最終剪輯的四個鏡頭,加上歌曲與基礎畫面,總共 $4.80

我用一段 32 秒 Hook 剪出的 MiniMax H3 音樂影片

請開聲音。這是四次獨立生成,無轉場串接,並把原本的 32 秒 master 疊回上方。

「MIRA」,32 秒,2560x1440,24 fps。四次 minimax/h3/reference-to-video 生成,每段 8 秒,每個鏡頭 $1.12。歌曲作為參考音訊輸入,費用 $0.00。

四次生成,四個完全不同的燈光世界,同一張臉。中間沒有修圖或修片。

一位戴著發光紅色項圈的銀髮女性的四種畫面

四個鏡頭中的四個影格,顯示同一位歌手分別出現在霓虹屋頂、沙漠公路、白色棚景與黑色水槽_每支交付片段各抽出_ 一格。同樣的髮型、同樣的網眼上衣、同樣的紅色 LED 項圈,橫跨雨景、低角度夕陽、平面高調光與水下場景。


為什麼多數 MiniMax H3 音樂影片嘗試會在第十六秒崩掉

三種失敗模式,全都可以避免。

一:把 15 秒當成專案限制。 H3 的單次生成上限是 15 秒。很多人看到這點就下結論「不能做音樂影片」,然後放棄。但音樂影片本來就不是單一鏡頭。真正的音樂影片通常每 4 到 8 秒就會剪一次。這個上限只是逼你做剪輯師原本就會做的事。

二:用文字描述節奏。 「輕快、有活力、跟著節拍跳舞」沒有提供模型任何可鎖定的東西。它會自己發明一個 tempo,然後你的剪點永遠差半拍。直接給它實際音訊,就不需要猜。

三:讓服裝漂移。 每個鏡頭都需要相同的參考圖 以及 相同的服裝措辭,逐字一致。你在不同鏡頭中把「black mesh top」改成「dark mesh shirt」,就會得到另一個人。

兩條路線的實際成本如下:

傳統四工具流程單次 H3 參考呼叫
每個鏡頭使用工具Image model、video model、lip-sync tool、NLE一個 endpoint,最後再進 NLE
每個鏡頭手動步驟4 次交接、3 次檔案匯出1 次提交
角色一致性靠什麼手動重寫提示詞與運氣同一張參考圖逐字重用
畫面與聲音分開算圖,之後再對齊同一次生成,32 kHz 立體聲
每個 8 秒鏡頭成本四個獨立計費表2K 為 $1.12,768P 為 $0.80

公平地說,舊路線不是幻想。日本創作者 Arata Fukoe 曾以全 AI 音樂影片拿下 Project Odyssey 銅獎,Queen 和 Linkin Park 也都發布過官方 AI 輔助影片。只是那些流程會經過四到五個工具,而這正是一位只有一首歌的獨立音樂人沒有時間處理的事。

參考音訊到底為 MiniMax H3 音樂影片帶來什麼

這是你花任何錢之前最值得理解的部分。

H3 不是把音訊配到已完成影格上,而是在同一次流程中生成畫面與聲音。當你交給它一段參考音軌時,這段音軌不是情緒註記。我把輸入切片與交付 mp4 內的音訊串流做比較,在波形層級、使用 8 kHz mono downmix 測量:

  • 包絡相關性:0.956,零延遲
  • 2 秒視窗內原始波形相關性:0.892零樣本偏移

這不是模型重現一首相似的歌。這是你的檔案,樣本對齊,上面疊了提示詞要求的環境聲,並經過一次 AAC 重新編碼。作為對照,同樣的測量套到未提供參考音訊的控制組生成上,結果是 0.26,也就是噪聲底。

兩段幾乎相同的音訊波形,顯示藍色輸入與紅色輸出

上方是輸入切片波形,下方是 H3 交付的音訊,零偏移對齊_上:我上傳的 8 秒 mp3。下:H3 回傳的 mp4 內音訊串流。相同峰值、相同位置、沒有偏移。_

輸入限制很嚴格,而且會在提交時明確執行,不會默默處理:

參考輸入限制計費
Images最多 9在 Atlas Cloud 的 H3 endpoints 上免費
Videos最多 3 個,每個 2-15s以輸出費率計費
Audio最多 3 個,每個 2-15s,所有片段合計 15s$0.00
僅 Audio會被拒絕,至少需要一張 image 或一段 videon/a

我刻意測試了總音訊上限:在同一次呼叫中送出三段 8 秒切片。它在 5.8 秒後失敗,回傳 invalid params, total audio duration 24138 ms exceeds 15000 ms,且未被計費。好消息是:H3 不會悄悄丟掉多餘檔案然後照樣向你收費。

在那之前我還踩到另一個坑。如果你把音訊作為 base64 data URL 傳入,MIME type 會決定 API 推斷的副檔名。data:audio/mpeg 會因 audio format ".mpeg" not allowed 被拒絕。data:audio/mp3 則順利通過。我注意到之前有四次提交死在這裡,全都免費。


MiniMax H3 音樂影片工作流程,以及每一秒花多少錢

以下全部都透過 Atlas Cloud 上的一把 API key 完成,這也是我實際執行與計費的地方。三個模型,一個瀏覽器分頁。

步驟模型功能我實際被收取的價格
寫 hookminimax/music-2.6由風格提示加歌詞生成完整歌曲,mp3 最長可達 ~5 分鐘每首 $0.15,固定費率
鎖定藝人openai/gpt-image-2/text-to-image每個鏡頭都繼承的一張基礎畫面quality high、2048x1152 為 $0.1745
拍每個鏡頭minimax/h3/reference-to-video輸入 image 加 audio,輸出鎖節拍且帶立體聲的片段2K 為 $0.14/s,768P 為 $0.10/s。Audio input $0.00

關於這張表有兩點要說,因為標示價格會在兩個方向上誤導你。GPT Image 2 在目錄中顯示 $0.009 起;那是最低 token tier,而真正的 2048x1152 high render 會計費 $0.1745. H3 的目錄項顯示 $0.10,那只適用於 768P tier;我的 8 秒 2K 任務每個精準計費 $1.12,也就是每秒 $0.14。

如果你想要 first-frame lock 而不是 subject references,[minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) 採用相同費率,而 [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) 則涵蓋純提示詞鏡頭。

值得修正的一點是:這個計畫的早期版本假設你必須自備歌曲,因為平台上沒有整首歌生成器。現在有了。minimax/music-2.6 可以寫出音軌,所以包含歌曲在內,整條流程都能在同一個地方完成。


如何逐步製作 MiniMax H3 音樂影片

Step 1: 寫一段 120 BPM Hook,並切成每個鏡頭的片段

明確要求 120 BPM。在 120 BPM 下,一小節正好是 2.000 秒,因此 H3 的整數秒 duration enum 會自然落在小節線上:4s = 2 小節、6s = 3 小節、8s = 4 小節、10s = 5 小節。你的剪點會落在強拍上,不需要碰任何 marker。

模型:minimax/music-2.6。設定:format: mp3sample_rate: 44100bitrate: 256000is_instrumental: false

風格提示詞:

Plain
1Synth-pop at exactly 120 BPM, straight four-on-the-floor kick, bright analog
2sidechained pads, clean female lead vocal sitting forward in the mix, wide
3stereo chorus, no rap, sustained open vowels, cinematic and slightly
4melancholy, radio-ready master

歌詞:

Plain
1[Chorus]
2Hold the line, hold the light
3I am running out of night
4Say my name into the rain
5And I will burn again

它在 75 秒內回傳一首 70 秒音軌,費用 $0.15. 接著我沒有直接相信它,而是檢查 tempo:對檔案跑 onset-novelty autocorrelation。最強 lag 精準落在 0.500 s,也就是 120 BPM,而 beat grid 從解碼檔案的 0.24 s 開始,不是從零開始。這個 offset 很重要:從 0.24 開始切,每段切片都會從 downbeat 起頭。

Bash
1# 32-second master, starting on the downbeat at 0.24s
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# four 8-second slices, one per shot, each 4 bars and well under the 15s cap
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

如果你已經有自己的音軌,這一步可以完全跳過。那是最常見的情況,也是最便宜的情況。

Step 2: 用一張 GPT Image 2 基礎畫面鎖定藝人

每個鏡頭都會參考這個單一檔案。這裡任何錯誤都會錯四次,所以花這 $0.17 並仔細檢查。

模型:openai/gpt-image-2/text-to-image。設定:quality high ,size 2048x1152 (16:9)

Plain
1Cinematic music-video still, waist-up portrait. A 25-year-old East Asian female
2synth-pop singer with silver-white cropped hair and a straight-cut fringe, a matte
3black mesh top, a thin red LED choker glowing against her collarbone, and a single
4silver ear cuff. She stands on a rain-soaked rooftop at night holding a vintage
5chrome handheld microphone close to her mouth. Behind her, out-of-focus magenta
6and cyan neon signage, fine rain caught in a hard backlight, steam drifting from a
7vent. Shot on 35mm anamorphic, shallow depth of field, teal-and-magenta grade,
8visible film grain. Her face is sharp and evenly lit by a soft key from camera
9left. No text anywhere in the frame.

一位銀髮女性在雨中霓虹城市裡拿著復古麥克風

生成出的基礎畫面:銀髮歌手在雨水浸濕的霓虹屋頂上拿著鉻色麥克風_這是_ 後續每個鏡頭都繼承的基礎畫面。使用 openai/gpt-image-2/text-to-image 生成,quality high,2048x1152,計費 $0.1745。

AI 圖像生成器介面,顯示輸入設定與生成結果

GPT Image 2 在 Atlas Cloud playground 中執行這段精確提示詞,右側輸出面板顯示完成畫面

同一段提示詞放在 playground 中:Size 16:9 at 2048x1152,Quality high,Run 按鈕標示 $0.1745,這也是 API 實際向我收取的金額。目錄中的 $0.009 是最低 token tier,不是這個。提示詞相同、seed 不同,所以這張 render 並不是上方那個精確檔案。

那段提示詞中的服裝措辭(silver-white cropped hair、matte black mesh top、red LED choker、silver ear cuff)會在下方每個提示詞中逐字重用。這種重複就是整個一致性機制。不要改寫。

Step 3: 用免費參考音訊跑第一個 MiniMax H3 音樂影片鏡頭

模型:minimax/h3/reference-to-video。設定:refers = 基礎畫面加上 slice-0.mp3resolution: 2Kduration: 8ratio: 16:9

請明確設定 ratio。playground 預設是 adaptive,而當你明確指定想要的畫面比例時,endpoint 會穩定得多。

Plain
1Music video shot. The woman in the reference image sings the reference track
2straight down the lens on the wet neon rooftop, holding the chrome microphone at
3her mouth. She lands the first line hard on the downbeat, eyes locked to camera,
4then tilts her head back on the sustained note. Slow push-in from waist-up to a
5tight close-up across the eight seconds, handheld micro-drift, rain streaks
6crossing the hard backlight. Her mouth shapes follow the sung vowels of the
7reference audio exactly, she is singing, not speaking. Identical silver-white
8cropped hair, matte black mesh top and glowing red LED choker as the reference
9image. Soundscape: the reference track in stereo, plus faint rain and a distant
10city hum low in the mix.

鏡頭 1,請開聲音。2560x1440,精準 8.00 s,24 fps,32 kHz 立體聲。從提交到取得檔案花了 345 秒,計費 $1.12. 注意約 5 秒時她在長音上仰頭的動作。

AI 影片生成器介面,顯示輸入設定與生成影片

reference-to-video playground 載入基礎畫面與音訊切片,並在輸出面板顯示完成片段

Reference Materials 顯示 2/9: slice-0.mp3 佔一格,基礎畫面佔另一格。Resolution 2K、Duration 8,Run 按鈕標示 $1.12,正好是 8 x $0.14. 注意 Aspect Ratio 下拉選單停在 adaptive ,這是頁面預設;我的 API 呼叫會明確把 ratio 設為 16:9。

有一個數字值得記下:duration: 8 交付的是精準 8.00 秒的容器。duration: 4 則交付 4.46 秒。如果你打算在小節線上串接,請選擇會精準回來的 duration。

Step 4: 再拍三個世界,同時不丟失這張臉

同一張基礎畫面、同一句服裝描述、下一段音訊切片。其他全部改變。

4a. 黃金時刻的沙漠公路。 refers = 基礎畫面 + slice-8.mp32Kduration: 8ratio: 16:9

Plain
1Music video shot. The same woman from the reference image stands on the centre
2line of an empty desert highway at golden hour, no microphone, an open indigo
3denim jacket over the same matte black mesh top, the red LED choker still lit. She
4mouths the chorus of the reference track into the wind while the camera tracks
5backwards low over the asphalt. Heat shimmer off the road, dust lifting, her
6shadow stretching long toward the lens, an anamorphic flare crossing at the
7halfway point. Hair, face and wardrobe identical to the reference image.
8Soundscape: the reference track over open desert wind, wide and airy.

鏡頭 2,請開聲音。同一張臉,完全相反的色溫,參考音軌被重新混在開闊風聲下。332 s,$1.12。

4b. 白色無限棚。 refers = 基礎畫面 + slice-16.mp32Kduration: 8ratio: 16:9

Plain
1Music video shot. The same woman from the reference image in a pure white
2infinity-cove studio under flat high-key light with no shadows, wearing a glossy
3red vinyl trench coat over the same matte black mesh top, red LED choker visible
4at the collar. She dances four bars to the reference track, silver-white hair
5whipping on each turn. Locked-off wide frame, then a hard snap-zoom to a medium on
6the second downbeat. Small white paper squares fall like confetti through the
7final two seconds. Face and hair identical to the reference image. Soundscape: the
8reference track, dry and close, plus the squeak of shoes on the studio floor.

鏡頭 3,請開聲音。平面無陰影的光線是最難隱藏換臉破綻的地方,而它 撐住了 。8.00 s,$1.12。

4c. 水下 b-roll,沒有 lip sync。 refers = 基礎畫面 + slice-24.mp32Kduration: 8ratio: 16:9

Plain
1Music video shot. The same woman from the reference image suspended underwater in
2a black tank, silver-white hair floating out around her, the red LED choker
3glowing through the water, the black mesh top billowing slowly. One hard beam of
4light from directly above; bubbles rise past the lens in slow motion. She opens
5her eyes on the downbeat and reaches one hand toward the surface. She does not
6sing and her mouth stays closed. The camera rotates thirty degrees around her
7across the shot. Face identical to the reference image. Soundscape: the reference
8track heard from above the surface, muffled and low-passed, with bubble
9transients.

鏡頭 4,請開聲音。「she does not sing and her mouth stays closed」這個指令被遵守了,這才是有用的部分:參考音訊驅動的是 timing,不是強制表演。329 s,$1.12。

Step 5: 跑一個音訊欄位留空的控制組

提示詞與 Step 3 完全相同,逐字一致。唯一改變:refers 只放 image,沒有其他東西。768Pduration: 8

這支片段比任何文字都更能說明整個機制。把它和 Step 3 對照聽。

控制組。相同提示詞、沒有參考音訊,1344x768,8.00 s,200 s,$0.80. H3 自己寫了配樂,表演也變成泛泛的「有人在唱歌」,而不是唱這些詞。

與我的 master 相比,控制組音訊的包絡相關性是 0.26。Step 3 則是 0.956. 這個差距就是免費 audio slot 買到的東西。

Step 6: 故意把 Lip Sync 弄壞

每個模型都有音節上限。找出你的上限只花 $0.40。

我另外生成了一段 double-time rap 音軌(再次使用 minimax/music-2.6,$0.15),切出一段 4 秒、約每秒六個音節的片段,並用同一個屋頂設定以 768Pduration: 4 餵給 H3。

Plain
1Music video shot. The woman in the reference image raps the reference track
2straight down the lens on the wet neon rooftop, holding the chrome microphone at
3her mouth, delivering every syllable of the fast double-time verse. Locked-off
4medium close-up, slight handheld drift, rain streaks in the hard backlight. Her
5mouth shapes follow the rapped syllables of the reference audio exactly. Identical
6silver-white cropped hair, matte black mesh top and glowing red LED choker as the
7reference image. Soundscape: the reference track in stereo plus faint rain.

壓力測試,請開聲音。1344x768,4.46 s,192 s,$0.40. 嘴巴一直很忙,也跟著節拍,但它不再解析個別子音,而是落入重複開合循環。演唱線條會有明確母音口型;這個不會。

從交付檔案來看,我的誠實判斷是:延長的演唱母音是 H3 嘴型真正有說服力的地方,而密集 rap 子音會退化成看似合理的動作。把 close-up 安排在演唱段落,快嘴段落則放在 b-roll 上。關於語音與歌唱差異,這篇 lip sync 與音訊拆解 有更多細節。

Step 7: 串接、靜音,並把 Master 放回你的 MiniMax H3 音樂影片

四支精準 8.00 秒片段串接後正好是 32.00 秒,也就是 120 BPM 下的 16 小節。不需要修剪。

Bash
1# 1. strip each clip's audio
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. concatenate in bar order (4 x 8s = 32s = 16 bars @ 120 BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. lay the original master back
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

既然模型已經把你的音軌給回來,為什麼還要靜音?因為每支片段的立體聲混音都帶著該鏡頭提示詞要求的環境聲:鏡頭 1 的雨聲、鏡頭 2 的沙漠風、鏡頭 4 的水下低通濾波。單獨聽很美,跨剪接時卻不連貫。master 給你一個完整連續、全 bitrate、沒有逐鏡頭重新編碼的混音。H3 交付表演同步;你的 master 交付歌曲本身。


MiniMax H3 音樂影片配方的四種變化

直式發行剪輯。 設定 ratio: 9:16,你就能用同一張基礎畫面與相同切片得到 Spotify Canvas 或 Shorts 片段。它回來的是正確的 768x1344,所以不同於 playground 的 aspect 下拉選單,API 的 ratio 值確實會生效。Canvas loop 設計上是無聲的,所以這支以 GIF 形式發布。

一位銀髮女性在雨中城市屋頂上拿著麥克風

同一位藝人在霓虹屋頂上的直式 9:16 loop 剪輯_同一張基礎畫面、同一段參考切片,_ ratio: 9:16 、768P,費用 $0.80. 一個誠實的小皺褶:我要求「not singing」,結果它還是唱了。有聲音人聲放在參考欄位時,audio 會贏得爭論。如果你想要無聲表演者,請餵 instrumental slice。

用參考影片取代參考圖。 你可以交給 H3 最多三段 reference video clip,用來承載動作與構圖,而不是用文字描述。請盯緊計費表:reference video 會按輸出費率計費,而 reference audio 免費。這種不對稱是這個 endpoint 最有用的價格資訊。

純 b-roll visualisers。 完全移除表演者。餵入產品照、專輯封面物件或材質底片,加上 audio slice,提示詞只描述鏡頭運動。沒有臉要維持、沒有 lip sync 會壞,而且整支都可以用 768P 拍。

低價草稿,高價完稿。 768P 是 $0.10/s,2K 是 $0.14/s,兩者都會回傳相同的 32 kHz 立體聲,所以你評估的表演本身相同。省下來的錢不在保留鏡頭,而在淘汰鏡頭:每支失敗的 8 秒 take 是 $0.80,而不是 $1.12. 先用 768P roll 到 take 正確,再付一次 $1.12。若某個鏡頭要嘗試三次,那就是 $2.72,而不是 $3.36. 關於 tier 差異可參考 768P 與 2K 比較,關於單支 clip 最多能延展多遠,則看 clip 長度指南


一支完整 MiniMax H3 音樂影片實際花費多少

下方每一行都是任務完成後從 prediction record 拉回來的真實計費數字,不是標價。

項目模型與設定計費
Hook,70 s 歌曲minimax/music-2.6,mp3 44.1 kHz$0.15
藝人基礎畫面openai/gpt-image-2/text-to-image,high,2048x1152$0.17
鏡頭 1,霓虹屋頂minimax/h3/reference-to-video,2K,8 s$1.12
鏡頭 2,沙漠公路same,2K,8 s$1.12
鏡頭 3,白色棚景same,2K,8 s$1.12
鏡頭 4,水下same,2K,8 s$1.12
完成影片小計$4.80
驗證探針768P,4 s$0.40
控制組,無音訊768P,8 s$0.80
壓力測試用 rap 音軌minimax/music-2.6$0.15
Lip-sync 壓力測試768P,4 s$0.40
直式 Canvas 剪輯768P,8 s,9:16$0.80
本文主視覺圖片openai/gpt-image-2/text-to-image,high$0.17
超限測試,24 s 音訊提交時被拒絕$0.00
四次錯誤 audio MIME 提交提交時被拒絕$0.00
參考音訊,4 x 8 s免費 input$0.00
總花費$7.53

以進入剪輯的 2K 鏡頭來看,這相當於每完成一分鐘 $9.00,不含我的任何錯誤。若全片用 768P 拍攝,同樣一分鐘是 $6.61. 真人 MV 團隊不會報出這兩個數字中的任何一個。

如果你在為更長的作品編預算,有兩個操作細節值得注意。提交時拒絕是免費的,所以錯誤參數只會花你的時間,不會花錢。而 prediction 上的 price 欄位會延遲填入,所以如果你想取得真正的 invoice,而不是 null,請在檔案下載後再用 request ID 輪詢一次。


誰的歌、誰的臉:發布前你應該檢查什麼

簡短說,因為這很重要,但不需要說教。

你需要擁有參考音軌的權利。 免費 input 不代表免費授權。把商業發行單曲餵進去當 reference audio,然後發布輸出的內容,是通往 takedown 的最快路線。你自己的錄音、委託製作的音軌,或你生成的東西都可以。

不要用真實在世藝人的臉製作基礎畫面。 這裡的一致性機制非常擅長在多個鏡頭間維持同一張臉,而這正是把它指向真人時很糟糕的原因。

Open weights 與 API access 是兩種不同 licence。 MiniMax 於 2026 年 8 月在 Hugging Face 發布 H3 的 weights,其 community licence 目前排除 EU、UK、South Korea 與 US,並為這些地區開放正式授權管道。該限制適用於你自己執行 weights。透過 hosted API 呼叫模型是一種服務關係,不會讓你落入 weights licence 之下。在你做任何假設之前,值得先知道自己屬於哪種情況。

若想更全面了解 H3 與替代方案的位置,可以看 Seedance 2.5 比較提示詞結構指南。至於為什麼這件事值得麻煩:在帶音訊的 video editing leaderboard 上,H3 目前以 1,126 Elo 排名第一,領先 Gemini Omni Flash 的 1,119 與 Dreamina Seedance 2.0 的 1,027(Artificial Analysis,2026 年 8 月 10 日查詢)。這些分數會隨投票變動,所以請把它們視為當下快照。


MiniMax H3 音樂影片:常見問題

一支 MiniMax H3 音樂影片可以一次跑完整三分鐘嗎?

不能在一次生成中完成。單次呼叫上限是 15 秒。但這是單次生成上限,不是單一專案上限。三分鐘影片若每 8 秒一個鏡頭,就是 23 次生成,2K 約 $25.76;如果你的音軌是 120 BPM,每一次都會落在小節線上。切片、拍攝、串接,再把 master 放回去。

MiniMax H3 音樂影片用的是我的真實歌曲,還是模型會重新生成音訊?

它用的是你的真實歌曲。我測到上傳的 8 秒 mp3 與回傳 mp4 內音訊串流之間,在零樣本偏移下有 0.892 的原始波形相關性,上面再疊加提示詞要求的環境聲。沒有參考音訊的控制組與同一個 master 比對只得到 0.26。你仍然應該把 master 疊回最終串接,因為每支片段都有自己的逐鏡頭環境聲與自己的 AAC encode,剪接後不會乾淨連續。

把歌曲餵進 MiniMax H3 音樂影片會額外收費嗎?

不會。我的四段 8 秒參考切片讓 $4.48 的鏡頭帳單增加了 $0.00。需要注意的是 reference video,因為它按輸出費率計費。限制是三段 audio clip,每段 2 到 15 秒,總計 15 秒,而且 audio 永遠不能是唯一 reference。

MiniMax H3 在唱歌上的 lip sync 與說話相比有多好?

延長的演唱母音是它的強項:清楚不同的嘴型、符合音符的維持,以及長音時仰頭看起來像表演而不是 loop。密集咬字則是它放棄的地方。我的每秒六音節 rap 測試能跟上節拍,但不再解析子音,變成重複開合循環。把快嘴段落放到 b-roll 上。

如何讓 MiniMax H3 音樂影片的每個鏡頭都維持同一張臉?

三件事,而且都很無聊。同一張 reference image 在每次呼叫中重用,絕不重新生成。相同的服裝措辭在提示詞之間逐字複製,不要改寫。每個提示詞中都加入明確的「identical to the reference image」子句。我的四個鏡頭橫跨雨景、低角度夕陽、平面高調光與水下場景,沒有漂移。

MiniMax H3 音樂影片每完成一分鐘要花多少錢?

2K 下每完成一分鐘 $9.00,依據我 32 秒剪輯真實帳單 $4.80 計算。全片以 768P 拍攝,同樣一分鐘成本是 $6.61,而且 768P 交付相同的 32 kHz 立體聲,所以你評估的表演相同。用 $0.80 roll 掉淘汰 take,只在最後會進剪輯的 take 上支付 $1.12。

最新模型

一個 API,暢享全模態 AI。

探索全部模型