Seedance 2.5 現已上線 — 首發於 Atlas Cloud

MiniMax H3 口型同步與音頻:我餵了它6秒的聲音,然後從我的流程中刪除了4個工具。

MiniMax H3 的唇形同步與音訊,用一次 API 呼叫取代了我原本六步驟的配音流程。兩個真實錄製、沒人記錄的參考音訊限制,以及實際帳單。

Man wearing headphones speaks into a microphone while reading a script

本文中每個鏡頭起始的夜班電台框架,使用 openai/gpt-image-2/text-to-image 生成,品質高,2048x1152

這張靜態圖片是下方整個教學的唯一輸入。使用 openai/gpt-image-2/text-to-image 生成,品質高,2048x1152。

回想一下你上次拍完一段 8 秒的鏡頭,結果卻沒聲音的經驗。

你匯出了片段。你打開一個 TTS 分頁,輸入台詞。你在音效庫裡翻找雨聲和環境音。你把所有東西拖進時間軸,左右移動波形,直到嘴巴不再對不上。然後你付錢給另一個唇形同步模型來修補嘴巴。四套工具、三個 wav 檔、一個小時,結果表演看起來還是像配音的,因為它本來就是。

那條鏈,正是 MiniMax H3 悄悄刪除的東西。不是因為它「有音訊」(很多模型都這麼宣稱),而是因為請求主體中那個幾乎沒人測試的欄位:你可以免費提供一段你已經擁有的音訊,然後讓聲音回到畫面上。

以下是兩次鏡頭的測試,專門隔離那個欄位,以及它取代的每一步的實際價格、會讓你的請求被拒絕的嚴格限制,還有實際的帳單。

重點摘要

  • 一次呼叫就能同時回傳畫面、對話、環境音和唇部動作。文字、視覺和音訊分別編碼,然後由一個單一的 Omni Transformer 共同預測影片和音訊的潛在特徵(Hugging Face 模型卡,2026 年 8 月)。
  • 輸入音訊免費。輸入影片則不然:MiniMax 以輸出費率計費參考影片,所以同樣 15 秒的素材,作為歌曲成本為 $0,作為影片片段則約為 $1.95。
  • 嚴格限制:最多 3 個音訊片段,每個 2 到 15 秒,總計 15 秒,且音訊不能單獨使用。必須搭配至少一張圖片或一段影片。
  • 在 Atlas Cloud 上,2K 解析度每秒 $0.14,一個完整的 10 秒有聲鏡頭成本為 $1.40,低於專門的唇形同步模型每秒 $0.22 的修補費用(針對已渲染的片段)。

有聲:兩個 MiniMax H3 唇形同步與音訊測試,僅差六秒

這一段請戴上耳機。兩半使用了相同的基礎畫面、相同的兩句台詞以及相同的提示詞,一字不差。只有其中一半先聽到了六秒的聲音錄音。

fXlyer__czg

開啟聲音,使用耳機:左半(測試 A,無參考音訊)由左耳播放,右半(測試 B,有 6 秒參考音訊)由右耳播放。相同畫面、相同台詞、相同提示詞。兩個測試:minimax/h3/reference-to-video,2K,10 秒,輸出為 2560x1440,24fps,附帶 32 kHz 立體聲軌道。

測試 A 只能依靠提示詞中的「冷靜、低沉、有磁性的男性廣播嗓音」來生成聲音。測試 B 則得到了一段 6.19 秒、完全不同的句子,並被告知僅將其視為音色錨點。兩個測試都沒有後續配音。兩者都沒使用唇形同步模型。在兩者中,嘴巴都跟隨模型產生的任何聲音,因為嘴巴和聲音是一起產生的。

請用自己的耳朵判斷音色,而不是相信我的話。我可以陳述事實的是機制、設定和帳單,接下來會說明。

為什麼 MiniMax H3 唇形同步與音訊打破了所有人的六步驟配音鏈

舊的鏈從來不是真正的工作流程。它是一項修補工作。

ImGr2NgcCCY

開啟聲音。一個 3D 動畫的蟾蜍和變色龍在夜晚的馬戲團帳篷裡對話,環境音伴隨對話出現。這是 MiniMax H3 原生音訊的參考片段。動畫角色上的嘴型是最難偽造的情況,這也是為什麼這個片段值得你花 20 秒觀看。

有三件事一直在出問題,而且是由結構性原因造成的,而非運氣不好。

時間軸掌握在你的手中。 影片模型給你畫格。TTS 模型給你波形。兩者的輸出都不知道彼此的存在,因此對齊是一項人類判斷,以每秒 30 畫格的速度,用肉眼在凌晨 1 點進行。每次重新渲染都會重新開始這個判斷。

修補式唇形同步有其極限。 專門的唇形同步模型只負責已存在影片的嘴部區域。它可以讓嘴巴與音訊一致。但它無法讓下巴在硬輔音前繃緊,無法在台詞前加入呼吸,也無法在句子結束時讓肩膀放下,因為那些畫格是在知道角色要說什麼之前就渲染好的。你得到了精準度,卻沒有表演,這看起來就是詭異。

音效設計是另一個專案。 雨聲、環境音、椅子吱嘎聲、對話底下的低音線。所有這些都來自不同的來源,必須與一個本身就被貼上去的聲音達到平衡。

音訊 VAE 告訴你關於 MiniMax H3 唇形同步與音訊的事

以下是行銷語言以外的部分,因為你可以從檔案名稱看到它。

在 H3 中,文字通過 H3-Encoder,視覺輸入通過 H3-Encoder 和 H3-VisualVAE,而音訊則單獨通過一個獨立的 H3-AudioVAE。然後 H3-Omni-Transformer 共同預測影片和音訊的潛在特徵,這些特徵再分別解碼為影片和立體聲音訊。AudioVAE 在左右聲道共享一個編碼器和解碼器,獨立處理每個聲道,重新組合成立體聲,並將 32 kHz 音訊壓縮為時間速率為 40 Hz 的潛在特徵序列(Hugging Face 模型卡)。

當 ComfyUI 在第一天就提供支援時,該架構在 VAE 資料夾中顯示為兩個獨立的檔案:minimax_h3_video_vae_fp16.safetensorsminimax_h3_audio_vae_fp32.safetensors,由一個接受影片路徑和音訊路徑的雙 VAE 載入器載入(ComfyUI 部落格,2026 年 8 月)。音訊是模型圍繞其建立的模態,而不是事後附加的後處理。

排行榜也同意這一點。Artificial Analysis 將 H3 列為其影片編輯排行榜的第一名,在 5,043 個盲選樣本中音訊 Elo 為 1,130,同時在文字轉影片和圖片轉影片中都排名前三(Artificial Analysis,2026 年 7 月)。在該特定排名中,「非常好的畫面」和「第一名」之間的差距正是音訊。

MiniMax H3 唇形同步與音訊工作流程,與其取代的鏈進行價格比較

判斷這個的誠實方法不是靠感覺。而是逐步計算舊鏈的價格,使用一個 10 秒完成的鏡頭的實際每秒費率,然後計算替代方案的價格。

#舊鏈,逐步進行執行的模型該步驟的成本使用 MiniMax H3 唇形同步與音訊
1渲染無聲畫面影片模型,例如 bytedance/seedance-2.0 每秒 $0.112$1.12同一次呼叫
2為台詞配音minimax/speech-2.6-hd約 $0.02(約 250 字元)同一次呼叫
3尋找或製作配樂minimax/music-2.6每首 $0.15同一次呼叫
4疊加環境音與特效音效庫加上你的雙手你的夜晚同一次呼叫
5在時間軸上對齊所有東西編輯器加上你的雙手你的夜晚不存在
6混音編輯器加上你的雙手你的夜晚不存在
7修補嘴巴sync/lipsync-v3 每秒 $0.22$2.20不存在
總計4 個模型加上 2 次手動調整約 $3.49 加上你的夜晚1 次呼叫,$1.40

請仔細閱讀第 7 行。修補一個你已經渲染好的片段的嘴巴,每秒成本為 $0.22,而生成整個鏡頭(包含聲音、環境音和嘴部動作)的成本為每秒 $0.14。修補比原始生成更貴。這個單一比較就是整個論點。

沒人提到的不對稱性:你自己的音訊免費,你自己的影片則不然。

MiniMax 的隨用隨付定價表將輸入素材與輸出分開列出。對於 H3,音訊輸入是免費的。前五張輸入圖片免費,之後每張 $0.04。輸入影片按輸入片段的時長,以輸出解析度的費率計費,2K 解析度下為每秒 $0.13(MiniMax 定價文件,2026 年 8 月 3 日查閱)。因此,同樣 15 秒的參考素材,作為歌曲、語音備忘錄或客戶提供的 VO 是免費的,而作為影片片段則約為 $1.95。

這就是應該改變你建構方式的那條線。參考音訊是模型中最便宜的控制面,而且也是沒人在測試的那個。

參考輸入數量每個片段總計計費方式(MiniMax)
圖片最多 9 張n/an/a前 5 張免費,之後每張 $0.04
影片最多 3 個2 到 15 秒最多 15 秒以輸出費率計費,2K 解析度下每秒 $0.13
音訊最多 3 個2 到 15 秒最多 15 秒免費
任意混合最多 12 個檔案n/an/a如上,依類型分別計費
僅音訊不允許。音訊必須搭配圖片或影片輸入,不能作為唯一輸入

限制來自模型卡上的 H3-Base-Ref2VA 規格。Atlas Cloud 上 minimax/h3/reference-to-video 的 schema 也用其措辭說明了同樣的事情:「至少需要一張圖片或一段影片(單獨音訊不允許)。」

關於 Atlas 計費的兩個附註,均來自我的實際執行而非文件頁面。Atlas 對所有三個 H3 端點收取單一固定費率,每個輸出秒 $0.14,而我附加的參考影片並未產生額外的獨立費用。這是一個觀察結果,而非政策,因此請將 MiniMax 規則納入預算,並將固定費率視為獎勵。Atlas 也接受 resolution: "768P",並以同樣的 $0.14 計費,這是一個值得在 MiniMax H3 API 定價分析 中閱讀的差異,這裡不多作說明。

以下所有操作都在 Atlas Cloud 的一個瀏覽器分頁中完成:基礎畫面、語音參考以及兩個 H3 測試,使用一個 API 金鑰和一個輪詢迴圈。三個 H3 端點僅在輸入形狀上有所不同,因此 refers 變成 image 變成純文字,你的程式碼其餘部分無需更改。

MiniMax H3 唇形同步與音訊,逐步操作

五個步驟。其中兩個是便宜的設定,兩個是實際測試,最後一個不花錢,因為它設計為失敗。

步驟 1:使用 GPT Image 2 建立基礎畫面

示範是一個夜班廣播主持人,選擇這個角色只有一個原因:嘴巴的特寫鏡頭是唯一能真正判斷唇形同步的構圖。廣角鏡頭會讓模型有作弊空間。

這個提示詞中有兩點是不可妥協的。嘴巴必須在說話的中間微微張開,這樣第一個畫格看起來就已經在說話;畫面上不能有任何文字,這樣後續的動態字幕才不會與內嵌的文字打架。

plaintext
1Photoreal cinematic still, 16:9, night-shift radio studio, tight chest-up framing on a
2man in his late thirties leaning into a vintage silver condenser microphone on a boom arm,
3foam windscreen inches from his lips, headphones half-off one ear. Warm tungsten desk lamp
4from camera-left carves his cheekbone; a red neon ON AIR sign burns out of focus behind his
5shoulder and bleeds crimson onto the mixing desk faders in the lower foreground. Rain streaks
6the studio window on the right, city lights smeared into bokeh. Thin cigarette smoke drifts
7through the lamp beam. Mouth slightly open mid-word, eyes down toward a paper script. Shot on
835mm, shallow depth of field, fine film grain, deep shadows, no text anywhere in the frame.
9

openai/gpt-image-2/text-to-image 上的設定:品質 high,尺寸 16:9 2048x1152,一張圖片。模型列表上的 $0.009 是代幣層級的最低費用,並非實際支付金額。在此尺寸和品質下,執行按鈕顯示每次繪製 $0.1745,你可以在下面的截圖中看到。

AI image generator interface showing a prompt and its generated output

Atlas Cloud 上的 GPT Image 2,輸入了廣播室的提示詞,選擇了高品質和 16:9 2048x1152,以及在 OUTPUT 面板中渲染完成的基礎畫面。GPT Image 2 on Atlas Cloud:上面確切的提示詞,高品質,16:9 2048x1152,以及 OUTPUT 中同一畫面的第二次繪製。

步驟 2:製作六秒的語音參考

這是人們會搞錯的步驟,所以在提示詞之前先閱讀推理。

參考音訊必須說一個與你想要的影片中不同的句子。它只是一個音色錨點,僅此而已。台詞來自提示詞。MiniMax 自己的參考轉影片範例明確說明了這個區別:它將一個片段標記為部分重複用於音樂的來源音軌,第二個片段純粹作為「語音音色參考」,而新的對話則內嵌在提示詞中。如果你的參考音訊說出了你要求的相同詞語,你就會讓模型複製音軌,而不是轉移聲音。

plaintext
1You're listening to Night Line, ninety-one point four, and it is coming up on
2three in the morning.
3

minimax/speech-2.6-hd 上的設定:任何冷靜低沉的男聲都可以,我選擇了 Magnetic-voiced MaleEnglish_magnetic_voiced_man)。將 speed 設定為 0.95,確保片段落在 2 到 15 秒的視窗內且有餘裕,將 vol 保留為 1.0,並保留 mp3 輸出。該模型每 1,000 個字元收費 $0.08,從 $0.10 降價,此折扣自 2026 年 8 月起有效。我的台詞回來時長 6.19 秒,費用為 $0.00792。

Voice generator interface with text input and audio waveform output

Atlas Cloud 上的 MiniMax Speech 2.6 HD,參考台詞輸入到文字欄位,OUTPUT 面板中顯示渲染後的音訊波形

MiniMax Speech 2.6 HD on Atlas Cloud:一行輸入,一個短 mp3 輸出,執行按鈕上顯示 20% 的折扣。截圖是在預設的 Expressive Narrator 語音下捕捉的,因此請在執行前將語音選擇器切換為 Magnetic-voiced Male,並將速度降至 0.95。

步驟 3:使用參考音訊執行 MiniMax H3 唇形同步與音訊

現在兩個檔案一起放入 refers:步驟 1 的靜態圖片和步驟 2 的 mp3。這是測試 B。

提示詞使用 H3 訓練時使用的分段結構。subject_definitions 命名誰和什麼是參考,detailed_description<d>[English] ...</d> 標籤內攜帶對話,兩個音訊部分描述混音。如果你不熟悉段落名稱,MiniMax H3 提示詞指南涵蓋了完整的結構。對於音訊工作,只有三個欄位重要,它們都在這裡。

plaintext
1subject_definitions:
2<Subject 1> is the man at the radio microphone in <Picture 1>, late thirties, headphones
3half-off one ear, red ON AIR neon behind his shoulder.
4<Picture 1> is the opening frame of the target video.
5<Audio 2> is the voice timbre reference for <Subject 1>: a calm, low, magnetic male
6broadcast voice. Reference the timbre only; do not reuse its words.
7
8summary:
9[image reference + audio timbre reference] A single continuous 10-second close-up. <Subject 1>
10delivers two lines straight into the microphone in the voice timbre of <Audio 2>, while the
11camera pushes in slowly. The mouth movement, the breath before each line, and the room tone
12are generated together.
13
14detailed_description:
15The shot opens exactly on <Picture 1>. Warm tungsten from camera-left, red neon bleeding onto
16the mixing desk in the foreground, rain on the window behind. <Subject 1> takes a short breath,
17tilts a few degrees toward the windscreen, and speaks, <d>[English] It's three in the morning,
18and I know exactly who's still awake.</d> As he speaks, his jaw and lips move naturally with
19every syllable; the plosives on "three" and "morning" are visible. He glances down at the script,
20then back up past the lens, and continues, <d>[English] So let's keep this between us.</d>
21Exactly as his voice stops, his lips settle closed and he exhales through his nose. Throughout,
22the camera executes one slow, deliberate push-in; the neon flickers once, faintly, around second
23seven. No on-screen text.
24
25overall_soundscape:
26Close, dry, booth-treated voice with a touch of proximity effect from the microphone. Under it:
27a low electrical hum from the desk, rain steady against the glass, one distant car passing on
28the wet street, the soft creak of the chair as he leans in, and a single audible breath before
29each line.
30
31non_diegetic_music:
32A sparse, slow late-night jazz double bass, very quiet, well under the voice, entering around
33second two and never rising above the dialogue.
34

minimax/h3/reference-to-video 上的設定:解析度 2K,時長 10,長寬比 16:9refers 包含兩個檔案。陣列內的順序不重要,只要至少其中一個是圖片或影片即可。Duration 滑桿預設為 8,所以請移動它,如果你想要你要求的畫面,請將 Aspect Ratio 從 adaptive 切換掉。

四個參數陷阱,其中三個讓我花了錢。參數是 ratio,不是 aspect_ratio,搞錯會返回 400。始終明確發送 duration,因為 schema 預設值說 8,但沒有它的請求會返回一個 5 秒的檔案。在此端點上,同時發送 imagerefers 會完成、全額計費,並靜默地丟棄其中一個。如果你將音訊作為 base64 資料 URL 傳遞,請將其標記為 data:audio/mp3,而不是 data:audio/mpeg。我的第一次嘗試就因此失敗:

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed
2

至少那次是免費的,這就帶我們來到學習限制的有用方法。

AI video generator interface showing text prompt input and video output

Atlas Cloud 上的 MiniMax H3 reference-to-video 遊樂場,mp3 在參考素材的插槽 1,基礎畫面在插槽 2,解析度 2K,完成的片段在 OUTPUT 面板中播放

MiniMax H3 reference-to-video on Atlas Cloud:參考素材顯示 2/9,mp3 在插槽一,靜態圖片在插槽二,解析度 2K,完成的片段在右側。此截圖是以遊樂場預設的 8 秒執行,這就是為什麼執行按鈕顯示 $1.12;我上面的兩個測試是以 10 秒執行,每個 $1.40。

步驟 4:執行 MiniMax H3 唇形同步與音訊控制測試

更改一個輸入以及所有提及它的地方。從 refers 中移除 mp3,只留下圖片;刪除 <Audio 2> 定義;從摘要中刪除「以 <Audio 2> 的語音音色」這句話;並將括號標籤更改為 [image reference]。其他所有內容保持不變,設定也完全相同:2K,10 秒,16:9。

這就是讓它成為控制測試而非第二次嘗試的原因。模型現在沒有音色錨點,因此它會從文字描述中發明一個聲音,並對其剛剛發明的聲音進行唇形同步。兩個測試都回傳了 10.13 秒,費用均為 $1.40,精確到分。

WnfqR2I-a-8

開啟聲音。單獨的測試 A:相同畫面、相同台詞、無參考音訊。這裡的聲音是模型的發明,嘴巴仍然跟隨它。

兩個測試,一個變數。這是整篇文章中最便宜的實驗,也是唯一能告訴你音訊欄位實際作用的一個。

步驟 5:故意破壞 MiniMax H3 唇形同步與音訊

最後一步是免費的,而且值得做一次,這樣你才能在凌晨 2 點認出這個失敗。

將 mp3 放入 refers,不加其他東西。沒有圖片,沒有影片,只有音訊。然後提交。

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "A man at a radio microphone speaks two lines into the windscreen.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'
12

這裡是值得知道的部分,因為它與 schema 暗示的不同。提交呼叫返回 HTTP 200,帶有正常的任務 ID 和 "status": "processing",因此一個 naive 的客戶端會認為它成功了。23 毫秒後,任務失敗:

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}
7

該預測上從未出現過 price 欄位,因此它沒有花費任何費用。實際教訓關乎你的程式碼,而非你的錢包:提交時的 200 狀態碼並不代表成功。輪詢該 ID,並在假設你已獲得片段之前檢查 status

另外四種擴展 MiniMax H3 唇形同步與音訊的方法

雙測試是最小有用的實驗。以下是同一個欄位接下來可以如何運用。

一個鏡頭,多種語言。 保留畫面,保留構圖,更改 <d>...</d> 內的語言標籤,然後再次執行。嘴巴會跟隨新語言而非舊語言,因為嘴巴和聲音來自同一次前向傳遞。模型卡列出了 11 種語言的穩定對話支援:阿拉伯語、中文、英語、法語、德語、義大利語、日語、韓語、葡萄牙語、俄語和西班牙語,還有更多語言在不同程度上獲得支援。以下兩個片段是同一支預告片,搭配兩種不同的語音軌道,而 MiniMax 也從相同的設定中製作了法語版本和無旁白版本。

hj7ZId3KOKk

開啟聲音。英語旁白版本:太空人特寫,灰橙色星球,旁白和配樂與畫面同時出現。預告片工作與同樣的三個提示詞欄位相同,只是音景不同。

Hv62FGyBNPM

開啟聲音。日語版本,與預告片逐格相同。沒有進行重新配音,也沒有進行單獨的 VO 錄製環節。

唱歌,搭配你已經擁有的副歌。 這就是免費輸入音訊不再只是附註的地方。將一個現有的副歌或器樂片段放入 refers,長度不超過 15 秒,描述表演,角色就會跟著表演。你不需要為你帶來的音樂付費。

zui3Zw_UWnY

開啟聲音。一個樂團片段,使用復古的攝錄影機風格,從後台到表演,音軌和畫面同時出現。這是大多數音樂錄影帶工作實際想要的形狀。

兩個人說話比一個人更難。 單一說話者的特寫是簡單的情況,正因如此這篇文章才使用它。對於兩個角色之間的對話,請按照 MiniMax 自己範例的方式明確標記他們,將 <Subject 1> (S1)<Subject 2> (S2) 附加到每個 <d> 行,並預期在模型搞錯順序或歸屬時需要重新生成。為雙人對話預留兩次執行的預算。

沒有說一句話的環境音。 overall_soundscape 是一個獨立的欄位,它可以在沒有任何對話的情況下運作。玻璃上的雨聲、椅子吱嘎聲、冰箱嗡嗡聲、房間本身。這使得同一個端點成為一個合法的 ASMR 和環境音工具,而且是嘴巴永遠不重要的用例。

我自己的兩個測試有一個誠實的限制:同次生成意味著嘴巴和聲音一致,但並不意味著畫面中的每個物理細節都與聲音一致。將長台詞塞進短時間、模糊的表演指示以及多說話者場景,都會降低結果品質。在發佈之前觀看你的片段,就像你會觀看人類演員的鏡頭一樣。

MiniMax H3 唇形同步與音訊實際花費了我多少

以下的每個數字都是實際帳戶上的真實費用,是在事後提取的。預測上的 price 欄位很晚才會填入,因此輪詢直到 completed 常常返回空值。重新獲取該 ID 以獲得數字。

步驟模型執行內容費用
1openai/gpt-image-2/text-to-image1 張基礎畫面,品質高,2048x1152$0.1745(執行按鈕上顯示的價格)
2minimax/speech-2.6-hd99 個字元,6.19 秒的參考語音$0.01
3minimax/h3/reference-to-video測試 B,10 秒 2K,refers 包含圖片+音訊$1.40
4minimax/h3/reference-to-video測試 A,10 秒 2K,refers 僅包含圖片$1.40
5minimax/h3/reference-to-video僅音訊請求,23 毫秒後失敗$0.00
整個實驗,兩個測試約 $2.98

兩個會計註記,因為誠實比附註更便宜。步驟 3 中錯誤的 audio/mpeg 資料 URL 也未花費任何費用,因為它在提交時返回 400。拒絕是免費的,但格式正確的請求搭配損壞的輸入則不然,因此一個靜默返回 404 的參考 URL 仍會全額計費。步驟 3 截圖中的遊樂場畫面是第三次 H3 執行,使用面板的預設 8 秒,這在表格之上額外收取了 $1.12。那次執行是為了這篇文章,而非實驗。

舊鏈,在上面的表格中定價,約為 $3.49,用於一個 10 秒的鏡頭加上一個晚上的手動對齊。而這是一次兩個完整的 10 秒有聲鏡頭、一個受控的 A/B 測試以及兩個故意失敗的請求,花費更少。

話雖如此,H3 對於人們會嘗試交給它的幾項工作來說是錯誤的工具,而且替代方案更便宜。

你真正想要的是什麼正確的模型價格原因
一張人像照片加上一個現有音訊檔案,變成會說話的頭像bytedance/avatar-omni-human-v1.5$0.12/s專為音訊轉影片設計,輸出長度跟隨你的音訊
一個已完成的片段,其嘴巴需要說另一種語言sync/lipsync-v3$0.22/sH3 不會修改你現有的渲染,而修補正是這個模型的工作
在會說話的頭像上最便宜的嘴巴修補veed/lipsync$0.013/s大約便宜十倍,而且它只觸及嘴巴,不影響表演
一個完整的導演鏡頭,包含音色、環境音和配樂一起生成minimax/h3/reference-to-video$0.14/s畫面與聲音來自一次前向傳遞,因此表演是設計出來的,而非修補的

如果你是在角色工作而非音訊上比較 H3 與其最接近的競爭對手,Seedance 2.5 比較是更好的讀物。如果你在想開放權重是否讓這件事免費,它們並不會讓它變快:2K 仍然來自 API 端,而社群報告指出,在消費級顯示卡上,10 秒 480p 的本地渲染需要數分鐘而非數秒。

關於語音、歌曲與權利的誠實說明

免費上傳不等於免費使用。一首不是你寫的歌,以及一個不屬於你的聲音,是兩個不同的許可,兩者都不會由一個不收你上傳費用的 API 授予。請使用你自己的錄音、已授權的音樂或你自己生成的合成語音,這正是步驟 2 所做的。

另外,社群權重帶有地域限制,目前不包括歐盟、英國、南韓或美國,而是提供正式的授權管道。這是一個更長的故事,在 MiniMax H3 開放權重指南中有所說明。

MiniMax H3 唇形同步與音訊:常見問題

MiniMax H3 唇形同步與音訊真的在同一次傳遞中生成聲音嗎?還是之後才配音的?

同一次傳遞。文字通過 H3-Encoder,視覺通過 H3-Encoder 加上 H3-VisualVAE,音訊則通過一個獨立的 H3-AudioVAE。H3-Omni-Transformer 共同預測影片和音訊的潛在特徵,然後分別解碼為畫面與 32 kHz 立體聲音訊。沒有任何東西是之後疊加上去的,這就是為什麼嘴巴、呼吸和環境音都屬於同一個鏡頭。

我可以將自己的歌曲或語音輸入到 MiniMax H3 唇形同步與音訊中嗎?是否需要額外費用?

可以,而且不需要。MiniMax 的隨用隨付表將 H3 音訊輸入列為免費。需要注意的不對稱性是影片:輸入影片按其時長以輸出費率計費,2K 解析度下每秒 $0.13,因此 15 秒的參考影片約需 $1.95,而 15 秒的參考音訊則為 $0。

為什麼 MiniMax H3 唇形同步與音訊會拒絕一個只有音訊的請求?

因為音訊是唯一不能單獨使用的參考類型。它必須搭配至少一張圖片或一段影片。其餘限制來自 H3-Base-Ref2VA 規格:最多 9 張圖片,最多 3 段影片和最多 3 個音訊片段,每個影片或音訊片段長度在 2 到 15 秒之間,每種類型總計 15 秒,一次請求中所有類型總共最多 12 個檔案。

MiniMax H3 唇形同步與音訊能否在整個片段中保持穩定,還是只適用於第一句台詞?

對於有喘息空間的單一說話者,它能在整個片段中保持穩定,而不會只對好第一句台詞然後開始偏移。三件事會破壞它:將長腳本塞進短時間、模糊或缺失的表演指示,以及模型需要決定誰何時說話的多說話者場景。請為每句台詞提供標記的說話者,並給出足夠的秒數來說完它。

MiniMax H3 唇形同步與音訊是否需要為另一種語言重新配音?

不需要。更改對話標記內的語言標籤,從 <d>[English] ...</d> 改為 <d>[Japanese] ...</d>,然後再次執行相同的提示詞。嘴巴是與新聲音一起生成的,因此它會匹配新語言而非舊語言。模型卡列出了 11 種語言的穩定對話支援。

在本地執行 MiniMax H3 唇形同步與音訊是否更便宜?

每個片段更便宜,但在其他所有方面都更昂貴。權重是開放的,但社群報告指出,在 16GB 消費級顯示卡上本地執行,一個 10 秒 480p 的生成需要數分鐘,自託管渲染的短邊為 768,而 2K 仍然來自 API 端的重新生成步驟。再加上社群授權中的地域限制,對於完成的工作來說,API 仍然是實用路徑。

最新模型

一個 API,暢享全模態 AI。

探索全部模型