Seedance 2.0 Mini & Fast API 全球最低價 —— 比官方定價最高低 68%

MiniMax H3 動畫影片生成器:15秒、4:3,以及 Veo 3.1 搞砸的標題卡

MiniMax H3 動畫影片生成器與 Veo 3.1 在相同關鍵影格上的比較。H3 支援 4 到 15 秒及六種比例,Veo 上限為 8 秒及兩種比例。日語對話,9 個參考影像,實際運行。

整個夏天,我的動態牆都在循環播放同一支影片。世界盃球員被重新繪製成少年漫畫主角。獨裁者、海盜船長、最後四秒才出現的滄桑導師。每篇貼文都有數百萬觀看次數,而且幾乎每場比賽後劇情都會更新。

那些製作這些影片的人不是為了寫基準測試文章。他們是選一個模型,花掉點數,然後在下一場比賽開踢前就發布。

所以我拿了一個動畫關鍵幀和一個提示詞,用相同的輸入,把 MiniMax H3 和 Veo 3.1 都推到最高設定,來測試它們作為動畫影片生成器的表現。

第一個出問題的不是影像品質。而是下拉選單。Veo 3.1 最多只能 8 秒,而且只提供兩種畫面比例。一個特寫臉部、跟著球橫向搖攝、最後讓標題卡落地的鏡頭,根本塞不進 8 秒。它連在品質上失敗的機會都沒有。

關鍵要點

  • Veo 3.1 的 duration 枚舉值是 [4, 6, 8]aspect_ratio 枚舉值是 [16:9, 9:16]。MiniMax H3 則支援 4 到 15 秒的任何整數秒,並提供 21:9、16:9、4:3、1:1、3:4、9:16。Veo 沒有 4:3,就完全無法做出復古 OVA 的構圖。
  • H3 的模型卡列出了 11 種原生穩定的對話語言,日文是其中之一。音訊和畫面是同時生成的,32 kHz 立體聲,不是事後配音。
  • 參考素材包的差距很大:H3 最多可接受 9 張圖片、3 部影片和 3 段音訊(最多 12 個檔案)。Veo 3.1 的參考端點只接受 3 張圖片,而且一旦使用它,duration 就會縮減為只有 [8]
  • 兩個會默默毀掉測試的陷阱:Veo 的 API 預設 generate_audiofalseresolution 預設為 720p;而 H3 的文字轉影片 ratio 預設為 1:1。如果沒修改這些設定,你就是在比較一個無聲的 720p 片段和一個正方形的片段。
  • Veo 3.1 保留了兩個 H3 完全沒有的東西:seednegative_prompt。對於 2D 動畫來說,後者真的很重要,我會在後續展示原因。

MiniMax H3 動畫影片生成器 vs Veo 3.1,同一個關鍵幀的對比

一個原創角色。一個關鍵幀。一個提示詞,完全相同的文字分別輸入兩個模型。兩邊的其他設定都調到最高。

MiniMax H3,圖片轉影片,2K,8 秒,原生音訊。請打開聲音:人群背景音、擊球聲和日文喊叫聲都是與畫面同時生成的。使用 Atlas Cloud 上的 minimax/h3/image-to-video 生成。

Veo 3.1,圖片轉影片,1080p,8 秒,手動開啟 generate_audio,並加上 negative_prompt 以保持線條平面。相同的起始幀,相同的文字。使用 Atlas Cloud 上的 google/veo3.1/image-to-video 生成。

兩者都畫得很漂亮。Veo 的擊球廣角鏡頭,帶有手繪衝擊線和漂浮在空中的漫畫音效,確實很討喜。這是誠實的起點,也是為什麼本文的其餘部分都在討論參數和指令遵循,而不是感覺。

為什麼大多數 MiniMax H3 動畫影片生成器 vs Veo 3.1 的測試會出錯

今年夏天同時發生了兩件事。

動畫成了 AI 影片中產量最高的格式。2026 年世界盃被改寫成少年漫畫錦標賽,球員被塑造成獨裁者、海盜船長、海軍上將和導師,劇情在 TikTok、Instagram、X 和 YouTube 上「幾乎每場比賽後都會演進」(Complex,2026 年 7 月)。

而 MiniMax H3 以開放權重發布。首日的 ComfyUI 討論串獲得了 330 分和 95 則留言,人們在數小時內就貼出了真實的本地運作數據(Hacker News,2026 年 8 月)。

將這兩件事放在一起,你會預期看到一堆動畫比較。但幾乎沒有,因為大多數測試都以下列四種方式之一建構錯誤。

它們比較的是圖片,而不是限制條件。 動畫鏡頭講究的是時間點。一個橫搖到標題卡的鏡頭,在變成渲染問題之前,首先就是一個持續時間問題。

它們忘了 Veo 的 API 預設是無聲的。 在 API 上,generate_audiofalseresolution720p。很多「Veo 在動畫中沒有音訊」的貼文,只是有人從未撥動過一個布林值開關。

它們忘了 H3 的文字轉影片預設是正方形的。 ratio 預設為 1:1,而不是 16:9。如果你在沒有設定 ratio 的情況下執行 t2v 動畫提示詞,你會得到一個正方形片段和一個令人困惑的結論。

它們使用寫實照片的提示詞進行測試。 「電影感、體積光、淺景深」正是那種會把 2D 模型拖向 3D 渲染陰影的詞彙。動畫的失敗模式不是模糊,而是塑膠感。

三個在按下執行前就決定動畫測試結果的設定

在開始之前,先在兩邊設定好這些,否則比較無效。

設定MiniMax H3Veo 3.1如果跳過會發生什麼事
音訊與畫面同時生成,永遠開啟generate_audio 預設為 falseVeo 回傳一個無聲片段,看起來比實際差
畫面形狀文字轉影片的 ratio 預設為 1:1aspect_ratio 預設為 16:9H3 給你一個無法使用的正方形動畫片段
解析度預設為 2K預設為 720p你用 2K 和 720p 比較,然後稱之為品質落差

想自己用同一個動畫提示詞測試 MiniMax H3 和 Veo 3.1 嗎?Atlas Cloud 的模型比較功能 可以一次並排執行它們——相同的提示詞和設定,生成前就會顯示成本。

MiniMax H3 和 Veo 3.1 在 Atlas Cloud 模型比較中,使用相同的動畫提示詞——相同的設定,生成前顯示價格。從 model-explorer 頁面即時擷取

MiniMax H3 和 Veo 3.1 在 Atlas Cloud 模型比較中,使用相同的動畫提示詞——相同的設定,生成前顯示價格。從 model-explorer 頁面即時擷取。

MiniMax H3 vs Veo 3.1 動畫規格表:長度、比例、音訊、參考素材

我直接從兩個模型的即時輸入架構中取得資料,而不是相信任何發布文章。以下每個值都是你可以在模型頁面上自行查看的枚舉值,不是個人印象。

表 1:MiniMax H3 vs Veo 3.1,決定動畫鏡頭的參數

MiniMax H3Veo 3.1
持續時間4 到 15,每整數秒(預設 8)4, 6, 8(預設 8)
畫面比例21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
比例預設值(文字轉影片)1:0116:09
解析度768P, 2K(預設 2K)720p, 1080p, 4k(預設 720p)
音訊同時生成,32 kHz 立體聲generate_audio,預設 false
原生對話語言11 種穩定,包含日文未發布為穩定列表
參考素材包最多 9 張圖片、3 部影片、3 段音訊,總共 12 個檔案3 張圖片
使用參考素材時的持續時間仍然 4 到 15縮減為只有 8
seed不可用可用
negative_prompt不可用可用
權重可下載封閉

持續時間、比例、解析度、音訊和參考素材限制,均來自 MiniMax H3 圖片轉影片H3 文字轉影片H3 參考素材轉影片Veo 3.1 圖片轉影片Veo 3.1 參考素材轉影片 頁面的即時架構。9 張圖片和 12 個檔案的參考素材上限,以及 11 種語言的對話列表,來自 MiniMax H3 模型卡(Hugging Face,2026 年 8 月)。

現在來看排行榜,因為它們說的話和規格表不同,而且兩者都很重要。

表 2:群眾投票 Elo 與每分鐘牌價,2026 年 8 月 7 日快照

模型文字轉影片(含音訊)圖片轉影片(含音訊)美金/分鐘
Gemini Omni Flash1,244 (#1) ±71,191 (#2) ±9$6.00
MiniMax H31,238 (#2) ±91,190 (#3) ±10$7.80
Dreamina Seedance 2.0 720p1,224 (#3) ±61,198 (#1) ±7$9.07
Kling 3.0 1080p (Pro)1,111 (#7) ±6未列入前十$20.16
Veo 3.11,093 (#11) ±71,085 (#10) ±7$24.00
Veo 3.1 Fast1,091 (#14) ±6未列入前十$9.00
Veo 3.1 Lite1,089 (#15) ±7未列入前十$4.80

Elo 和價格數據來自 Artificial Analysis Video Arena(Artificial Analysis,2026 年 8 月)。這些是滾動的群眾投票,數字會變動。$/min 欄位是標準化的模型估算值,不是你的實際帳單。

145 分的 Elo 差距很大,但這是一般用途的投票,不是動畫投票。而且我必須坦白說:MiniMax 並沒有將 H3 定位為動畫模型。內部的第一線回饋清單中,電影、動畫和喜劇劇情片是 H3 不針對的領域。所以有趣的問題不是「哪一個是動畫模型」,而是為什麼一個不以動畫為賣點的模型,仍然在這個鏡頭中勝出,以及 Google 在哪裡仍然能拿下這一回合。

在進入教學之前有一個實用提示。以下每個模型都透過同一個控制台和同一個 API 金鑰運行,這是參數可以比較的唯一原因。相同的佇列、相同的驗證、同一張帳單。如果你在一個服務上設定 GPT Image 2,在另一個服務上設定 Veo,你會發現的一半差異來自於底層管線,而不是模型本身。

建構鏡頭:MiniMax H3 vs Veo 3.1,逐步教學

一個從頭到尾的連續範例。「最後哨音」:一個原創的青少年前鋒,紅髮,身穿白色與海軍藍的 9 號球衣,球場照明燈,一個橫搖跟拍射門動作,以及一個必須在最後兩秒內出現並穩定停留的日文標題卡。

沒有真實球員、沒有官方角色、沒有現有的動畫 IP。只有風格和致敬。為什麼這麼做,稍後會說明。

步驟 1:使用 GPT Image 2 設計動畫關鍵幀

關鍵幀承載了美術指導方向,這樣影片模型就不需要自己發明。請注意左側三分之一處的留白空間:這是刻意設計的。影片模型會在那裡寫入標題卡,這就是文字穩定性的測試。

Plain
1一個現代少年運動動畫的單一幀。賽璐珞著色2D動畫,手工描線,線條粗細一致,平塗色塊,
2硬邊圖形陰影,完全沒有3D陰影也沒有寫實皮膚。特寫一個原創青少年前鋒:凌亂的深紅色頭髮,
3白色與海軍藍的球衣,背號9,一邊臉頰上有汗水和草痕,雙眼圓睜帶著疲憊的決心,張嘴正在吶喊。
4在他身後,球場照明燈的強光映照在一面模糊的觀眾色彩牆上;放射狀速度線從畫面中央爆發;
5一根草葉靜止懸浮在空中。飽和色調,深青色陰影,暖橙色邊緣光。16:9構圖,角色偏右構圖,
6左側三分之一處有乾淨的留白。圖片中任何地方都沒有文字。

設定:模型 openai/gpt-image-2/text-to-image,品質 high,尺寸 16:9 (2048x1152)。沒有其他設定。

AI 圖片生成器介面,顯示提示詞和生成的動畫足球員

Atlas Cloud 上的 GPT Image 2 工作區,顯示「最後哨音」關鍵幀提示詞,以及輸出面板中的完成動畫幀

Atlas Cloud 上的 GPT Image 2:品質設定為高,右側是完成的關鍵幀。

紅髮動畫足球員在擁擠的體育場中吶喊

基礎動畫關鍵幀:一個原創紅髮前鋒在球場照明燈下吶喊,賽璐珞著色,平塗色塊和速度線

兩個模型都收到的關鍵幀。平塗色塊、硬邊陰影,以及等待標題卡的空白左側三分之一。

步驟 2:MiniMax H3 圖片轉影片,所有設定調到最高

輸入相同的圖片,輸出 2K。我這裡只將 H3 限制在 8 秒,以便與 Veo 的上限匹配。這不是 H3 的限制,步驟 4 會解除上限。

Plain
1賽璐珞著色2D動畫,手工描線線條粗細一致,平塗色塊,無3D陰影。在前鋒的臉上停留一拍,
2然後一個激烈的橫搖鏡頭跟著他踢出的球,橫搖讓畫面模糊成拖曳的作畫張力運動軌跡。
3在衝擊瞬間有一幀完全靜默。在最後兩秒內,一個粗體白色日文標題文字「ラストホイッスル」
4強勢切入畫面的左側三分之一處,並穩定停留,沒有變形、沒有閃爍、沒有漂移。
5前鋒用日文喊出一句台詞:「まだ終わってない!」
6音訊:體育場的喧囂聲逐漸增強,一次清脆的擊球衝擊聲,在標題卡出現時伴隨一聲低沉的和太鼓聲。

設定:模型 minimax/h3/image-to-videoresolution: 2Kduration: 8ratio: adaptive(圖片轉影片會從你的輸入圖片中取得畫面形狀),image = 步驟 1 的輸出。

一個警告:如果你改用文字轉影片,請明確寫出 ratio: 16:9。預設值是 1:1,它會很樂意給你一個正方形動畫片段。

AI 影片生成器介面,顯示文字提示詞和生成的動畫影片

Atlas Cloud 上的 MiniMax H3 圖片轉影片工作區,顯示「最後哨音」提示詞、已載入的關鍵幀,以及輸出面板中的完成片段

Atlas Cloud 上的 MiniMax H3 圖片轉影片:左側載入了步驟 1 的關鍵幀,右側正在播放完成的片段。

步驟 3: Veo 3.1 圖片轉影片,手動開啟音訊

提示詞完全相同,一個字都不差。改變任何一個形容詞,它就不再是比較了。不同的是 Veo 提供而 H3 沒有的額外欄位。

negative_prompt,對於 2D 動畫來說,這是這個列表中單一最有用的控制項:

Plain
13D渲染,CGI,塑膠光影,寫實皮膚,真人影片,動態模糊湯,扭曲文字,亂碼文字,多餘手指,字幕條

設定:模型 google/veo3.1/image-to-videoresolution: 1080p(請修改,預設是 720p),duration: 8(這是上限),aspect_ratio: 16:9generate_audio: true(API 預設是 false,這是無聲片段的陷阱),seed: 20260807image = 相同的步驟 1 輸出。

AI 影片生成器介面,顯示輸入設定和生成的動畫影片

Atlas Cloud 上的 Veo 3.1 圖片轉影片工作區,顯示已啟用 Generate Audio、已載入動畫關鍵幀,以及輸出面板中的完成片段

Atlas Cloud 上的 Veo 3.1 圖片轉影片,已開啟 Generate Audio,右側是完成的片段。

步驟 4:在五個動畫特定面向評分

這裡不需要生成任何東西。只需要觀察動畫真正會出問題的地方。兩個片段都嵌在這篇文章的上方,所以你可以自己評分,而不是只聽我說的。

並排比較模糊和清晰的足球場場景

兩個片段最後一幀的並排比較,左邊是 MiniMax H3 的清晰日文標題文字,右邊是 Veo 3.1 的亂碼垂直字元

每個片段的最後一幀。左邊,H3 寫出了 ラストホイッスル,全部八個片假名都正確且穩定。右邊,Veo 3.1 寫出了三個字元,既不是要求的詞,也無法組成一個詞。

標題卡是決定勝負的關鍵,而且差距很明顯。H3 精確地渲染了要求的片假名,邊緣銳利且穩定,疊加在球門區域的拖曳橫搖畫面上。Veo 3.1 則產生了一個由三個字元組成的垂直堆疊,既不是要求的詞,也不是一個詞。在同一個畫面中,它還讓角色離開了鏡頭,並讓背景逐漸滑向半寫實的體育場照片,儘管 photorealistic skin3D render 就在負面提示詞中。

表 3:決定動畫片段的五個面向,來自這兩次運行

面向MiniMax H3Veo 3.1
角色與關鍵幀的連續性在完整 8 秒內保持了完全相同的臉部、頭髮和球衣在新的廣角鏡頭中重新繪製了角色,造型正確但屬於不同的繪圖
線條粗細和平塗賽璐珞陰影保持不變,沒有滑向 3D在中景鏡頭中保持,但到最後滑向了照片級別的體育場背景
日文標題卡ラストホイッスル 正確渲染且穩定停留三個字元,不是要求的詞,不是一個詞
輸出的音訊軌道32 kHz 立體聲,完全符合模型卡所述48 kHz 立體聲,只因為我手動設定了 generate_audio
橫搖鏡頭和作畫張力拖曳執行為拖曳的橫搖並進入標題被替換成一個硬切到新的設定

最後一行是截至目前對 H3 最公開的批評,也正是我為什麼把這個寫進兩個提示詞的原因。在首日的 ComfyUI 討論串中,使用者 fwip 抱怨即使是官方示範提示詞也被忽略了:「一個從屋頂頂進行的激烈橫搖,將漂浮的文字連同運動痕跡一起抹去。而影片根本沒有執行任何那個轉場,它只是用一個剪接取代了它。」

在這次運行中,是 Veo 把橫搖換成了剪接,而 H3 執行了拖曳。一次運行不能當作定論,我不會說不是這樣。但這確實表示這個批評不是 H3 特有的:橫搖鏡頭是這次測試中兩邊最不可靠的指令。如果你的分鏡腳本依賴橫搖,請繞過它而不是依賴它。

步驟 5:Veo 3.1 結構上無法輸出的 4:3 復古 OVA 片段

這不是品質偏好。這是一道牆。Veo 的 aspect_ratio 枚舉值只有兩個,而且都不是 4:3;它的 duration 枚舉值也沒有 12。90 年代 OVA 的風格根本無法實現。

Plain
1一個1990年代OVA動畫片段,4:3全畫面。手繪背景美術,可見筆刷紋理,賽璐珞角色帶有粗細不均的濃墨線條,
2照明燈周圍有強烈的光暈效果,16mm膠卷顆粒和微弱的畫格晃動。同一個紅髮前鋒,穿著白色海軍藍9號球衣,
3從一個濕透的球場走下來,人群噪音逐漸消退成單一的鈴聲。鏡頭緩慢推近他的臉。他用日文輕聲說:
4「次は、勝つ」。復古色調:柔和墨綠、灰塵琥珀、深紅褐色陰影。音訊:遠處的雨聲、孤獨的類比合成器音墊、
5在遠方傳來的一聲帶有大量殘響的哨音。

設定:模型 minimax/h3/text-to-videoresolution: 2Kduration: 12ratio: 4:3。記得手動設定這個比例,因為預設值不是它。

AI 影片生成器介面,顯示文字提示詞和生成的動畫影片

Atlas Cloud 上的 MiniMax H3 文字轉影片工作區,顯示已輸入的 OVA 提示詞,以及輸出面板中完成的復古片段

Atlas Cloud 上的 MiniMax H3 文字轉影片,已輸入 OVA 提示詞,片段已完成。完全坦白:這次特定的運行將 Aspect Ratio 留在 16:9,Duration 留在 8,所以你在右側看到的是寬螢幕的短版。下面的 4:3 十二秒片段是透過 API 呼叫明確設定 ratio: 4:3duration: 12 產生的。

骯髒球衣的動畫足球員站在體育場中

4:3 復古 OVA 片段:同一個前鋒以 90 年代動畫風格從濕透的球場走下來

H3 文字轉影片,4:3,12 秒。輸出的檔案是 1920x1440,這是精確的 4:3 像素,帶有 32 kHz 立體聲軌。此處以降低幀率的無聲 GIF 顯示,以保持頁面輕量。使用 Atlas Cloud 上的 minimax/h3/text-to-video 生成。

步驟 6:九張參考圖片,一個角色,四個鏡頭

跨鏡頭的角色一致性是 AI 動畫中最困難的問題,而解決方案是依靠參考素材的數量。首先建立素材包:使用步驟 1 的提示詞,但將構圖改為正面、四分之三側面、完全側面、背面、大笑、咬牙、全身站姿、球衣細節和球鞋細節。共九張圖片,總成本約八美分。

四幅紅髮動畫足球員身穿 9 號球衣的插圖

同一個原創前鋒角色的四個角度,作為參考素材包生成,排列成 2x2 網格

九個參考角度中的四個。H3 在一個參考素材包中最多可接受九張圖片,而且還可加上影片和音訊參考素材。

Plain
1賽璐珞著色2D動畫,手工描線線條粗細一致,平塗色塊,無3D陰影。在所有鏡頭中保持參考的前鋒的臉部、
2髮型輪廓和9號球衣完全一致。一個連續鏡頭中的四個片段:(1) 低角度推近他的球鞋踩在草皮上,
3(2) 橫搖向上到他的眼睛的緊密特寫,(3) 廣角鏡頭顯示他衝過三名繪製成模糊剪影的後衛,
4(4) 凍結在半空中頭槌的瞬間,速度線向外爆發。音訊:人群喧囂、呼吸聲、球鞋踩草皮的聲音、
5在凍結瞬間的一聲和太鼓擊打。

設定:模型 minimax/h3/reference-to-videorefers = 你的圖片,帶有 type: imageresolution: 2Kduration: 8 或更高,ratio: adaptive16:9

Veo 3.1 的等效設定無法在這些設定下運行,而且你不需要嘗試就知道原因。它的參考端點最多接受三張圖片,而且選擇這個端點會讓 duration 縮減為唯一的合法值 8。九張圖片的素材包和 10 秒的鏡頭都超出了範圍。

AI 影片生成器介面,顯示提示詞輸入和生成的動畫影片

Atlas Cloud 上的 MiniMax H3 參考素材轉影片工作區,顯示參考素材計數器為 4/9,以及輸出面板中的第一個片段

Atlas Cloud 上的 MiniMax H3 參考素材轉影片。計數器顯示 Reference Materials (4/9),下方有 MAX:9,這是介面中的上限,而不是規格表的說法。輸出是第一個片段,低角度推近球鞋。

另外四個值得進行的 MiniMax H3 動畫影片生成器測試

「最後哨音」的鏡頭只測試了其中四個差異。以下這四個則測試了其餘部分。所有測試都在 H3 上運行;備註會說明 Veo 3.1 能否匹配那些測試。

  1. 超寬螢幕作畫打鬥, 21:9 ,10 秒。 Veo 完全無法輸出 21:9。
Plain
1賽璐珞著色2D動畫動作,粗細漸變的墨線,平塗色塊,硬邊陰影,無3D陰影。兩個原創蒙面決鬥者
2在黃昏的風吹寺廟屋頂上。刀劍碰撞,畫面震動,兩名戰士在爆發的手繪衝擊格和放射狀速度線中分開。
3鏡頭:低角度推近,然後橫向跟拍,然後快速切換到夕陽背景下的一個廣角剪影。音訊:兩次尖銳的
4金屬碰撞聲、布料撕裂聲、在最後凍結畫面上的一聲低沉和太鼓擊打,沒有音樂。
  1. 節拍同步的 AMV 片段,參考素材轉影片並帶有音訊參考。 H3 最多可接受三段音訊片段作為參考輸入。Veo 3.1 完全沒有音訊輸入,只有音訊輸出。
Plain
1賽璐珞著色2D動畫蒙太奇,與參考音訊軌對齊。五個短節拍:窗戶上的雨、手緊繃繃帶、
2城市天際線從火車窗外閃過、起跑衝刺、凍結在伸出的手上。每個片段都精確落在參考音訊的
3一個強拍上。平塗色塊,濃墨線條,高對比夜間色調,深靛藍和霓虹洋紅。
  1. 兩句日文對話場景,12 秒。 這是嘴型同步的壓力測試,而且 12 秒已經超出 Veo 的範圍。
Plain
1賽璐珞著色2D動畫,平塗色塊,無3D陰影。兩個原創角色在黃金時段的屋頂上,採取正反打鏡頭。
2第一個用日文說:「本当に行くの?」。第二個半笑著用日文回答:「もう決めた」。
3嘴巴與每個音節匹配。溫暖邊緣光,長長的影子,頭髮中輕柔的風。音訊:兩個不同的日文聲音,
4遠處的車流聲,一聲蟬鳴。
  1. 直式少年漫畫短片, 9:16 ,8 秒。 兩個模型都能做直式,所以這是唯一一個可以實際 A/B 測試而不是假設的地方。
Plain
1賽璐珞著色2D動畫,直式構圖。一個原創青少年跑者以慢動作衝破紙製橫幅,然後畫面瞬間回到
2全速,她在體育場直道上加速。速度線,平塗色塊,硬邊陰影,大膽的圖形化天空。鏡頭:低角度
3跟拍鏡頭,然後向上橫搖到她的臉。音訊:橫幅撕裂聲、人群湧動聲、一次屏住呼吸然後釋放。

如果你想要這些提示詞背後的語法,MiniMax H3 提示詞指南 比我這裡更深入地探討了 H3 如何解析鏡頭和音訊指令。

60 秒動畫開場在 MiniMax H3 與 Veo 3.1 上的成本比較

標準動畫 OP 大約是 90 秒。假設為八個 8 秒的鏡頭,共 64 秒的完成影片,加上每個鏡頭一個關鍵幀,每個 $0.009 美元。

有一個你需要知道的真實價格差異,我不想隱瞞。Atlas Cloud 目錄列出 MiniMax H3 為每秒 $0.10 美元,而模型說明文件則細分為 2K 每秒 $0.14 美元,768P 每秒 $0.10 美元。Veo 3.1 列出為每秒 $0.20 美元,而其說明文件則區分為含音訊每秒 $0.40 美元,不含音訊每秒 $0.20 美元。

我截圖中的執行按鈕證實了這一點。H3 參考素材轉影片,8 秒 2K,報價 Run $1.12,這正是每秒 $0.14 美元。Veo 3.1 圖片轉影片,8 秒 1080p 含音訊,報價 Run $3.2,這正是每秒 $0.40 美元。所以說明文件的費率才是實際收費的,而目錄標題是入門級。我仍然在下面列出了兩種讀數。這些是 2026 年 8 月的牌價。

表 4:八個 8 秒鏡頭,包含關鍵幀

設定影片成本(目錄費率)影片成本(說明文件費率)關鍵幀成本總成本範圍
MiniMax H3, 2K$6.40$8.96$0.07$6.47 到 $9.03
MiniMax H3, 768P$6.40$6.40$0.07$6.47
Veo 3.1, 1080p 含音訊$12.80$25.60$0.07$12.87 到 $25.67
Veo 3.1 Lite, 720p$3.20$3.20$0.07$3.27

價格取自表 1 中連結的 Atlas Cloud 模型頁面,2026 年 8 月。目前這四個都沒有折扣。

這張表沒有包含兩件事,而且兩者都比每秒費率影響更大。

重試。 沒有人會發布動畫鏡頭的第一次生成。無論你假設的倍數是多少,套用到兩邊,差距會以相同比例擴大。

實際時間,而這個方向是相反的。 在 2026 年 8 月 7 日從頭到尾計時:H3 在 2K 下生成 8 秒花了 447 秒,大約 7.5 分鐘。H3 文字轉影片在 2K 下生成 12 秒花了 334 秒。Veo 3.1 在 1080p 下生成 8 秒含音訊花了 152 秒,不到三分鐘。Veo 在首次生成上大約快了三倍,如果你在凌晨兩點迭代一個鏡頭,這就值真金白銀。佇列會變化,所以請將這些視為一個下午的快照,而不是規格。但任何引用「2 到 3 分鐘」來描述 H3 在 2K 下的人,都是在引用說明文件,而不是佇列。2K 與 768P 的比較分析 涵蓋了何時較高階層級值得額外花費幾分鐘。

動畫風格、致敬,以及你實際上可以發布什麼

這篇文章中的所有內容都是風格和致敬。一個原創角色、一套原創球衣、一個原創標題。沒有生成或要求任何官方動畫角色,也沒有使用任何真實足球員的名字或肖像。世界盃趨勢被引用為一種格式,因為這才是它有用的地方。

這個區別並非裝飾。如果你正在商業上製作動畫風格內容,「以 90 年代 OVA 的風格」和「這個特定節目中的這個特定角色」是不同的法律客體,而且只有其中一個是可行的業務。

關於開放權重:H3 確實可以下載,而且人們在第一天就運行了它。一位評論者報告說,在配備 16GB 記憶體的 4070 Ti Super 上,生成一個 10 秒 480p 片段需要 10 分鐘,其他人則回報在 5080 上需要 3 分鐘,在 RTX 6000 Pro 上需要 68 秒。但自架推論運行在 768 短邊上;產生 2K 的 Context-IR 和 Regenerate-2K 階段仍然在 API 端。

授權有一個真正的陷阱。社群授權目前不涵蓋歐盟、英國、南韓或美國,理由是這些地區「目前正在制定或執行與 AI 相關的法規」。一個正式的授權申請管道是開放的,一位 HN 評論者將其總結為「你只需要做出小指承諾你不會讓迪士尼生氣,他們就會寄給你授權」。有趣,但這也正是如果你身處這四個地區之一時,你不能跳過的合規步驟。開放權重文章 有完整的地區列表。

常見問題

MiniMax H3 與 Veo 3.1 相比,是一個好的動畫影片生成器嗎?

對於大多數動畫工作來說,H3 更好,而且主要是出於與渲染無關的原因。它支援 4 到 15 秒,而 Veo 只有 4、6 或 8 秒;它提供六種畫面比例,包括 4:3 和 21:9,而 Veo 只有兩種;它將日文列為 11 種原生穩定對話語言之一;它可以接受九張參考圖片,而 Veo 只有三張。Veo 3.1 在一個特定情況下勝出:當你需要 seed 來進行可重現的重新生成,或者需要 negative_prompt 來防止鏡頭滑向 3D 渲染陰影時。H3 沒有這兩個參數。如果你的工作流程依賴其中任何一個,這是一個真正的理由留在 Veo。

Veo 3.1 可以生成 4:3 或 15 秒的動畫片段嗎?

不行,而且這不是風格問題。Veo 3.1 的 aspect_ratio 枚舉值正好包含 16:99:16,其 duration 枚舉值正好包含 468。沒有 4:3 的值可以選擇,也沒有辦法請求 12 或 15 秒。如果你的參考是 90 年代電視動畫或 OVA,那麼這個構圖在 Veo 上是無法實現的,而在 H3 上則可以。

為什麼我的 Veo 3.1 動畫片段回傳時是無聲的?

因為 generate_audio 在 API 上預設為 false。工作區的切換開關通常已經開啟,所以這只會影響直接呼叫 API 的人。請明確設定 generate_audio: true。同時,也請設定 resolution,因為它預設為 720p,而不是你可能想要的 1080p 或 4k。

MiniMax H3 是否支援動畫的日文對話和嘴型同步?

是的。模型卡列出了 11 種具有穩定對話支援的語言:阿拉伯文、中文、英文、法文、德文、義大利文、日文、韓文、葡萄牙文、俄文和西班牙文。音訊是與畫面同時生成的,32 kHz 立體聲,而不是事後配音,這就是為什麼嘴型時間在整句台詞中都能保持,而不只是前幾個音節。請直接將日文台詞以日文寫入提示詞中。

我可以使用多少張參考圖片來保持動畫角色的一致性?

MiniMax H3 最多接受 9 張圖片、最多 3 部影片和最多 3 段音訊,所有類型合計最多 12 個檔案。Veo 3.1 的參考素材轉影片端點接受 1 到 3 張圖片,而且選擇它會讓 duration 縮減為只有 8 這個合法值。對於一個系列中的重複出現動畫角色來說,這個差異就是整個比賽的關鍵。

MiniMax H3 有開放權重,所以我可以在本地免費運行我的動畫工作流程嗎?

你可以下載並運行它,但有三個注意事項。自架推論在 768 短邊上運行,而產生 2K 輸出的 Context-IR 和 Regenerate-2K 階段仍然在 API 端。真實世界的本地速度因顯卡而異:根據首日 ComfyUI 討論串,在 4070 Ti Super 上生成一個 10 秒 480p 片段大約需要 10 分鐘,在 5080 上大約需要 3 分鐘,在 RTX 6000 Pro 上大約需要 68 秒。此外,社群授權目前不涵蓋歐盟、英國、南韓或美國,所以如果你身處其中一個地區,你需要取得正式授權才能商業使用。

最新模型

一個 API,暢享全模態 AI。

探索全部模型