Seedance 2.5 現已上線 — 首發於 Atlas Cloud

MiniMax H3 動畫影片生成器:15秒、4:3,以及Veo 3.1搞砸的標題卡

MiniMax H3 動畫影片生成器 vs Veo 3.1 在相同關鍵影格上的比較。H3 支援 4 到 15 秒及六種比例,Veo 上限為 8 秒及兩種比例。日語對話、9 個參考、實際運行。

整個夏天,我的動態一直被同一支影片反覆洗版。世界盃球員被畫成少年漫畫主角。一個獨裁者。一個海盜船長。一個在最後四秒出現的滄桑導師。每篇貼文數百萬觀看,劇情在幾乎每場比賽後都會更新。

那些製作這些影片的人,不是在寫基準測試文章。他們挑選一個模型,燒掉點數,然後在下一場開球前發佈。

所以我拿了一個動畫關鍵影格和一個提示詞,用相同的輸入,將兩者都推到最高設定,測試了 MiniMax H3 動畫影片生成器與 Veo 3.1。

第一個出問題的不是影像品質。而是一個下拉選單。Veo 3.1 停在 8 秒,並且只提供兩種畫面比例。一個鏡頭要停在臉上,跟著球甩動,然後讓標題卡落下,這在 8 秒內塞不進去。它根本沒有機會在品質上失敗。

關鍵要點

  • Veo 3.1 的 duration 列舉是 [4, 6, 8],而它的 aspect_ratio 列舉是 [16:9, 9:16]。MiniMax H3 可以執行 4 到 15 秒的任何整數秒,並提供 21:9, 16:9, 4:3, 1:1, 3:4, 9:16。Veo 沒有 4:3 意味著完全無法使用復古 OVA 構圖。
  • H3 的模型卡列出了 11 種原生穩定的對話語言,日語是其中之一。音訊與畫面一起以 32 kHz 立體聲生成,而非事後配音。
  • 參考素材包差距很大:H3 最多可接受 9 張圖片、最多 3 部影片和 3 個音訊片段(總共最多 12 個檔案)。Veo 3.1 的參考端點接受 3 張圖片,而且一旦使用,duration 就會縮減為只有 [8]
  • 兩個會悄悄毀掉測試的陷阱:Veo 的 API 預設將 generate_audio 設為 falseresolution 設為 720p;而 H3 的文字轉影片 ratio 預設為 1:1。忽略這些設定,你就是在比較一個無聲的 720p 片段和一個正方形的片段。
  • Veo 3.1 保留了 H3 完全沒有的兩個東西:seednegative_prompt。對於 2D 動畫來說,後者確實很重要,我會展示原因。

MiniMax H3 動畫影片生成器 vs Veo 3.1,同一個影格背靠背比較

一個原創角色。一個關鍵影格。一個提示詞,逐字複製到兩個模型中。其他所有設定在各自模型上都調到最高。

MiniMax H3,圖片轉影片,2K,8 秒,原生音訊。打開聲音:人群背景音、擊球聲和日語喊叫聲是在生成畫面的同一個過程中產生的。使用 Atlas Cloud 上的 minimax/h3/image-to-video 生成。

Veo 3.1,圖片轉影片,1080p,8 秒,手動將 generateaudio 開啟,並加上保持線條平面化的 negativeprompt。相同的起始影格,相同的文字。使用 Atlas Cloud 上的 google/veo3.1/image-to-video 生成。

兩者都畫得很漂亮。Veo 對擊球的廣角鏡頭,帶有手繪的衝擊線和一個漂浮在空中的漫畫狀音效,確實很可愛。這是一個誠實的起點,也是為什麼本文的其餘部分討論的是參數和指令遵循,而不是感覺。

為什麼大多數 MiniMax H3 動畫影片生成器 vs Veo 3.1 的測試會出錯

今年夏天同時發生了兩件事。

動畫成為 AI 影片中數量最多的格式。2026 年世界盃被改寫成一個少年錦標賽,球員被描繪成獨裁者、海盜船長、海軍上將和導師,故事線在 TikTok、Instagram、X 和 YouTube 上「幾乎每場比賽後都會演變」。

而 MiniMax H3 以開放權重發佈。第 0 天的 ComfyUI 討論串就獲得了 330 分和 95 則評論,人們在幾小時內就貼出了實際的本地跑分數字。

把這些加在一起,你會預期看到一堆動畫比較。但幾乎沒有,因為大多數測試都以四種方式之一建構錯誤。

他們比較的是畫面,而不是限制條件。 動畫鏡頭是關於時間的。一個甩鏡進入標題卡,在成為渲染問題之前,首先是一個時長問題。

他們忘記 Veo 的 API 預設是無聲的。 在 API 上,generate_audiofalseresolution720p。很多「Veo 在動畫中沒有聲音」的貼文,只是因為有人沒打開布林開關。

他們忘記 H3 的文字轉影片預設是正方形的。 ratio 預設為 1:1,而不是 16:9。在不設定的情況下執行 t2v 動畫提示詞,你會得到一個正方形片段和一個令人困惑的結論。

他們用寫實照片的提示詞來測試。 「電影感、體積光、淺景深」正是那種會把 2D 模型拉向 3D 渲染陰影的詞彙。動畫中的失敗模式不是模糊,而是塑膠感。

三個在按下執行按鈕前就決定動畫測試結果的設定

在開始之前,先設定好這兩邊的設定,否則比較無效。

設定MiniMax H3Veo 3.1如果你跳過它會發生什麼
音訊與畫面一起生成,始終開啟generate_audio 預設為 falseVeo 回傳一個無聲片段,看起來比實際更糟
畫面形狀文字轉影片時 ratio 預設為 1:1aspect_ratio 預設為 16:9H3 給你一個無法使用的正方形動畫片段
解析度預設為 2K預設為 720p你比較 2K 和 720p,然後稱之為品質差距

MiniMax H3 vs Veo 3.1 動畫規格表:時長、比例、音訊、參考素材

我直接從兩個模型的即時輸入 schema 中擷取資料,而非相信任何發佈文章。下面的每個值都是你可以在模型頁面上自行查看的列舉值,而非印象。

表 1:MiniMax H3 vs Veo 3.1,決定動畫鏡頭的參數

MiniMax H3Veo 3.1
時長4 到 15,每整數秒(預設 8)4, 6, 8(預設 8)
畫面比例21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
比例預設值(文字轉影片)1:0116:09
解析度768P, 2K(預設 2K)720p, 1080p, 4k(預設 720p)
音訊聯合生成,32 kHz 立體聲generate_audio,預設 false
原生對話語言11 種穩定語言,包含日語未發布為穩定列表
參考素材包最多 9 張圖片,3 部影片,3 個音訊片段,總共 12 個檔案3 張圖片
使用參考素材時的時長仍為 4 到 15縮減為僅 8
seed不可用可用
negative_prompt不可用可用
權重可下載封閉

時長、比例、解析度、音訊和參考素材限制是從 MiniMax H3 image-to-videoH3 text-to-videoH3 reference-to-videoVeo 3.1 image-to-videoVeo 3.1 reference-to-video 頁面的即時 schema 中讀取。9 張圖片和 12 個檔案的參考上限,以及 11 種語言的對話列表,來自 MiniMax H3 model card (Hugging Face, August 2026)。

現在來看排行榜,因為它們說明了與規格表不同的東西,而且兩者都很重要。

表 2:群眾投票 Elo 和每分鐘牌價,2026 年 8 月 7 日快照

模型文字轉影片(含音訊)圖片轉影片(含音訊)美元/分鐘
Gemini Omni Flash1,244 (#1) ±71,191 (#2) ±9$6.00
MiniMax H31,238 (#2) ±91,190 (#3) ±10$7.80
Dreamina Seedance 2.0 720p1,224 (#3) ±61,198 (#1) ±7$9.07
Kling 3.0 1080p (Pro)1,111 (#7) ±6未列入前十名$20.16
Veo 3.11,093 (#11) ±71,085 (#10) ±7$24.00
Veo 3.1 Fast1,091 (#14) ±6未列入前十名$9.00
Veo 3.1 Lite1,089 (#15) ±7未列入前十名$4.80

Elo 和價格數據來自 Artificial Analysis Video Arena (Artificial Analysis, August 2026)。這些是滾動的群眾投票,並且會變動。美元/分鐘欄是標準化的模型估算,不是你的帳單。

145 分的 Elo 差距很大,但這是通用投票,不是動畫投票。而且這裡有我必須坦白說的部分:MiniMax 並沒有將 H3 宣傳為動畫模型。內部的第一線回饋清單列出電影、動畫和喜劇劇情片是 H3 針對的領域。所以有趣的問題不是「哪個是動畫模型」。而是為什麼一個不以動畫為賣點的模型仍然能在這個鏡頭中勝出,以及 Google 在哪個環節仍然能扳回一城。

在教學之前有一個實用提示。下面的每個模型都通過同一個控制台和同一個 API 金鑰執行,這也是參數具有可比性的唯一原因。相同的佇列,相同的驗證,一張帳單。如果你在一個服務上設定 GPT Image 2,在另一個服務上設定 Veo,你發現的一半差異將是管道問題,而不是模型本身的問題。

建構鏡頭:MiniMax H3 vs Veo 3.1,逐步執行

一個從頭到尾的連續範例。「最後的哨音」:一個原創的青少年前鋒,紅髮,身穿白色和海軍藍色 9 號球衣,聚光燈下,一個甩鏡捕捉擊球瞬間,以及一個必須在最後兩秒落下並保持穩定的日語標題卡。

沒有真實球員,沒有官方角色,沒有現有的動畫 IP。只有風格和致敬。稍後會詳細說明原因。

第 1 步:使用 GPT Image 2 設計動畫關鍵影格

關鍵影格承載了美術指導,這樣影片模型就不需要憑空創造。請注意左側三分之一的負空間:這是故意的。標題卡將由影片模型寫在那裡,這就是文字穩定性測試。

Plain
1來自現代少年運動動畫的單一影格。賽璐珞風格 2D 動畫,手繪墨線,線條粗細一致,平塗色彩填充,硬邊圖形陰影,完全沒有 3D 著色,也沒有寫實皮膚。特寫一個原創青少年前鋒:凌亂的深紅色頭髮,白色和海軍藍色球衣,背號 9,一側臉頰有汗水和草痕,睜大的眼睛充滿疲憊的決心,張開嘴正在大喊。在他身後,體育場的聚光燈照射進一片模糊的人群色彩牆;放射狀的速度線從畫面中心爆發;一片草葉凍結在空氣中。飽和色調,深青色陰影,溫暖的橙色邊緣光。16:9 構圖,角色位於畫面偏右,左側三分之一保持乾淨的負空間。圖片中沒有任何文字。

設定:模型 openai/gpt-image-2/text-to-image,品質 high,尺寸 16:9 (2048x1152)。沒有其他設定。

AI 圖片生成器介面,顯示用於建立動畫圖片的編號步驟

Atlas Cloud 上的 GPT Image 2 遊樂場,顯示 Last Whistle 關鍵影格提示詞以及在輸出面板中的完成動畫影格

Atlas Cloud 上的 GPT Image 2:品質設定為高,右側是完成的關鍵影格。

在擁擠體育場中大喊的紅髮動畫運動員特寫

基礎動畫關鍵影格:一個原創的紅髮前鋒在體育場聚光燈下大喊,賽璐珞風格,平塗色彩和速度線

兩個模型都收到的關鍵影格。平塗色彩,硬陰影,以及一個空的左側三分之一,等待標題卡。

第 2 步:MiniMax H3 圖片轉影片,所有設定調到最高

相同的圖片輸入,2K 輸出。我這裡只將 H3 限制在 8 秒,以匹配 Veo 的上限。這不是 H3 的限制,第 4 步會解除限制。

Plain
1Cel-shaded 2D anime, hand-inked line weight, flat colour, no 3D shading. Hold on the
2striker's face for one beat, then a violent whip pan follows the ball as he strikes it,
3the pan smearing the frame into streaked sakuga motion trails. One frame of total silence
4at impact. Over the final two seconds, bold white Japanese title lettering reading
5ラストホイッスル punches onto the left third of frame and holds rock-steady, no warping,
6no flicker, no drift. The striker shouts one line in Japanese: 「まだ終わってない!」
7Audio: stadium roar swelling, a single sharp ball-strike impact, a low taiko hit under the
8title card.

設定:模型 minimax/h3/image-to-videoresolution: 2Kduration: 8ratio: adaptive(圖片轉影片會從輸入圖片取得畫面形狀),image = 第 1 步的輸出。

如果你改用文字轉影片,有一個警告:請明確寫出 ratio: 16:9。預設值是 1:1,它會很樂意給你一個正方形的動畫片段。

AI 影片生成器介面,顯示輸入提示詞和輸出影片

Atlas Cloud 上的 MiniMax H3 圖片轉影片遊樂場,顯示 Last Whistle 提示詞、已載入的關鍵影格以及在輸出面板中的完成片段

Atlas Cloud 上的 MiniMax H3 圖片轉影片:左側載入了第 1 步的關鍵影格,右側正在播放完成的片段。

第 3 步: Veo 3.1 圖片轉影片,手動開啟音訊

提示詞完全相同,逐字逐句。更改任何一個形容詞,它就變成了不同的比較。改變的是 Veo 提供而 H3 沒有的額外欄位。

negative_prompt,對於 2D 動畫來說,這是這個清單中唯一最有用的控制項:

Plain
13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur
2soup, warped lettering, gibberish text, extra fingers, subtitle bar

設定:模型 google/veo3.1/image-to-videoresolution: 1080p(更改此項,預設是 720p),duration: 8(這是上限),aspect_ratio: 16:9generate_audio: true(API 預設是 false,這是無聲片段的陷阱),seed: 20260807image = 相同的第 1 步輸出。

AI 影片生成器介面,顯示輸入設定和生成的動畫影片

Atlas Cloud 上的 Veo 3.1 圖片轉影片遊樂場,顯示已啟用生成音訊、已載入動畫關鍵影格以及在輸出面板中的完成片段

Atlas Cloud 上的 Veo 3.1 圖片轉影片,已開啟 Generate Audio,右側是完成的片段。

第 4 步:在五個動畫特定軸線上評分

沒有什麼需要生成的。只需觀察動畫真正會出問題的地方。兩個片段都嵌入在本文章開頭附近,所以你可以自己評分,而不是只聽我的話。

並排顯示的足球場場景,標示為 MiniMax H3 和 Veo 3.1

兩個片段最終影格的並排比較,左側是 MiniMax H3,帶有清晰的日語標題字樣,右側是 Veo 3.1,帶有亂碼的垂直字元

每個片段的最後一個影格。左側,H3 寫出了 ラストホイッスル,全部八個片假名正確且穩定。右側,Veo 3.1 寫出了三個字元,既不是要求的詞,也不構成一個詞。

標題卡是決定勝負的關鍵,而且差距很大。H3 準確地渲染了要求的片假名,邊緣銳利且穩定,疊加在球門區域的拉伸甩鏡上。Veo 3.1 產生了一個垂直堆疊的三個字元,既不是要求的詞,也不是一個詞。在同一個影格中,它還讓角色離開了畫面,並讓背景滑向半寫實的體育場畫面,儘管 photorealistic skin3D render 就在負面提示詞中。

表 3:決定動畫片段的五個軸線,來自這兩次執行

軸線MiniMax H3Veo 3.1
來自關鍵影格的角色連續性在整個 8 秒內保持了精確的臉、頭髮和球衣在一個新的廣角鏡頭中重新繪製了角色,外型正確但是一張不同的圖
線條粗細和平塗賽璐珞著色保持住了,沒有向 3D 偏移在中景中保持住了,但在結尾漂移到攝影風格的體育場畫面
日語標題卡ラストホイッスル 正確渲染並保持穩定三個字元,不是要求的詞,也不是一個詞
提供的音訊軌32 kHz 立體聲,完全符合模型卡所述48 kHz 立體聲,僅因為我手動設定了 generate_audio 才存在
甩鏡和 sakuga 拖曳效果執行為一個帶有拖曳效果的甩鏡進入標題替換為一個硬切到新場景

最後一行是迄今為止對 H3 最響亮的公開批評,這正是我把它寫進兩個提示詞的原因。在第 0 天的 ComfyUI 討論串中,用戶 fwip 抱怨說,即使是官方示範提示詞也被忽略了:「一個從屋頂上『猛烈的甩鏡,將漂浮的文字跟著拖曳、模糊掉』,結果影片完全沒有做那個轉場,它只是用一個剪接代替了。」

在這次執行中,是 Veo 用剪接取代了甩鏡,而 H3 做到了拖曳效果。一次執行並不能下定論,我也不會聲稱如此。但這確實意味著批評並非 H3 專屬:甩鏡是整個測試中兩邊都最不可靠的指令。如果你的分鏡依賴於甩鏡,請繞過它來設計分鏡,而不是透過它來設計。

第 5 步: Veo 3.1 在結構上無法輸出的 4:3 復古 OVA 片段

這不是品質偏好問題。這是一道牆。Veo 的 aspect_ratio 列舉有兩個值,但都不是 4:3,而它的 duration 列舉沒有 12。90 年代的 OVA 風格根本無法實現。

Plain
1A 1990s OVA anime cut, 4:3 full-frame. Hand-painted background art with visible brush
2texture, cel-paint characters with thick uneven ink lines, heavy halation glow around the
3floodlights, 16mm film grain and faint gate weave. The same red-haired striker in a
4white-and-navy number 9 kit walks off a rain-soaked pitch as the crowd noise fades to a
5single ringing tone. Camera pushes in slowly on his face. He says quietly in Japanese:
6「次は、勝つ」. Retro palette: muted teal, dusty amber, deep maroon shadows. Audio:
7distant rain, a lone analogue synth pad, one reverb-heavy whistle in the far distance.

設定:模型 minimax/h3/text-to-videoresolution: 2Kduration: 12ratio: 4:3。請手動設定此比例,記住預設值。

AI 影片生成器介面,顯示文字提示詞和生成的動畫影片

Atlas Cloud 上的 MiniMax H3 文字轉影片遊樂場,顯示已輸入的 OVA 提示詞以及在輸出面板中的完成復古片段

Atlas Cloud 上的 MiniMax H3 文字轉影片,已輸入 OVA 提示詞,片段已完成。完全公開:這次特定執行將 Aspect Ratio 保留在 16:9,Duration 保留在 8,所以你在右邊看到的是寬螢幕的短版本。下面的 4:3 十二秒片段來自於 API 呼叫,並明確設定了 ratio: 4:3 duration: 12

穿著髒兮兮球衣的紅髮動畫足球員站在體育場內

4:3 復古 OVA 片段:同一名前鋒以 90 年代動畫風格走下被雨水浸濕的球場

H3 文字轉影片,4:3,12 秒。傳回的檔案解析度為 1920x1440,這是精確的 4:3 像素,並帶有 32 kHz 立體聲音軌。為了保持頁面輕量,此處以降低幀率的無聲 GIF 顯示。使用 Atlas Cloud 上的 minimax/h3/text-to-video 生成。

第 6 步:九張參考圖片,一個角色,四個鏡頭

跨鏡頭的角色一致性是 AI 動畫中最困難的問題,而解決方案是增加參考素材的數量。先建立素材包:重新執行第 1 步的提示詞,但將構圖改為正面、三分之四側面、全側面、背面、大笑、咬牙、全身站姿、球衣細節和球鞋細節。九張圖片,總共大約八美分。

具體且明確?是的(指定了四張插圖,紅髮,動畫,足球)

同一個原創前鋒角色的四個角度,作為參考素材包生成,以二乘二網格排列

九個參考角度中的四個。H3 在一個參考素材包中最多接受九張圖片,此外還可以加上影片和音訊參考。

Plain
1Cel-shaded 2D anime, consistent hand-inked line weight, flat colour, no 3D shading. Keep
2the referenced striker's face, hair silhouette and number 9 kit identical across every cut.
3Four cuts in one continuous take: (1) low-angle push-in on his boots hitting the turf,
4(2) whip-pan up to a tight close-up of his eyes, (3) wide shot of him sprinting past three
5defenders drawn as blurred silhouettes, (4) freeze on a mid-air header, speed lines
6exploding outward. Audio: crowd roar, breath, boot-on-turf impacts, one taiko hit on the
7freeze.

設定:模型 minimax/h3/reference-to-videorefers = 你的圖片,帶有 type: imageresolution: 2Kduration: 8 或更高,ratio: adaptive16:9

Veo 3.1 的等效設定無法在這些設定下執行,你也不需要嘗試就知道原因。它的參考端點最多接受三張圖片,而且選擇該端點會將 duration 縮減為唯一合法的值 8。九張圖片的素材包和 10 秒的鏡頭都超出了範圍。

AI 影片生成器介面,顯示輸入提示詞和生成的動畫影片

Atlas Cloud 上的 MiniMax H3 參考轉影片遊樂場,顯示參考計數器為九分之四,以及輸出面板中的第一個鏡頭

Atlas Cloud 上的 MiniMax H3 參考轉影片。計數器顯示為 Reference Materials (4/9) ,下方有 MAX:9 ,這是介面中的上限,而不是規格表上的聲明。輸出是第一個鏡頭,低角度推進到球鞋上。

另外四個值得執行的 MiniMax H3 動畫影片生成器測試

Last Whistle 鏡頭只測試了其中四個差異。這四個測試了其餘的。全部都在 H3 上執行;備註會說明哪些是 Veo 3.1 可以匹配的。

  1. 超寬比例的 sakuga 打鬥, 21:9 ,10 秒。 Veo 完全無法輸出 21:9。
Plain
1Cel-shaded 2D anime action, thick tapered ink lines, flat colour, hard-edged shadows,
2no 3D shading. Two original masked duelists on a windswept temple roof at dusk. Blade
3clash, the frame shudders, both fighters break apart in a burst of hand-drawn impact
4frames and radial speed lines. Camera: low-angle push-in, then a lateral track, then a
5snap to a wide silhouette against the orange sky. Audio: two sharp metal clashes, cloth
6snap, a low taiko hit on the final freeze, no music.
  1. ** Beat 同步的 AMV 剪輯,使用音訊參考的參考轉影片。** H3 最多接受三個音訊片段作為參考輸入。Veo 3.1 完全沒有音訊輸入,只有音訊輸出。
Plain
1Cel-shaded 2D anime montage cut to the referenced audio track. Five short beats: rain on
2a window, a hand tightening a bandage, a city skyline flashing past a train window, a
3sprint start, a freeze on an outstretched hand. Every cut lands exactly on a downbeat of
4the referenced audio. Flat colour, thick ink lines, high-contrast night palette of deep
5indigo and neon magenta.
  1. 兩行日語對話場景,12 秒。 這是唇形同步的壓力測試,而 12 秒已經超出了 Veo 的範圍。
Plain
1Cel-shaded 2D anime, flat colour, no 3D shading. Two original characters on a rooftop at
2golden hour, shot reverse shot. First says in Japanese:「本当に行くの?」. The second
3answers, half-smiling, in Japanese:「もう決めた」. Mouths match every syllable. Warm rim
4light, long shadows, gentle wind in hair. Audio: two distinct Japanese voices, distant
5traffic, one cicada.
  1. 垂直版少年短片, 9:16 ,8 秒。 兩個模型都可以做垂直格式,所以這是唯一一個你應該實際進行 A/B 測試而不是假設的地方。
Plain
1Cel-shaded 2D anime, vertical composition. An original teenage runner bursts through a
2paper banner in slow-motion, then the frame snaps back to full speed as she accelerates
3down a stadium straight. Speed lines, flat colour, hard shadows, bold graphic sky.
4Camera: low-angle follow shot, then a whip up to her face. Audio: banner tear, crowd
5surge, one breath held then released.

如果你想要這些背後的提示詞語法,MiniMax H3 提示詞指南 比我這裡更深入地探討了 H3 如何解析鏡頭和音訊指令。

在 MiniMax H3 與 Veo 3.1 上製作 60 秒動畫片頭的成本

一個標準的動畫 OP 大約是 90 秒。假設是八個 8 秒的鏡頭,總共 64 秒的完成影片,加上每個鏡頭一個關鍵影格,每個 $0.009。

有一個你應該知道的真實定價差異,而不是讓我粉飾過去。Atlas Cloud 目錄列出 MiniMax H3 為每秒 $0.10 固定價格,而模型 README 則細分為 2K 每秒 $0.14 和 768P 每秒 $0.10。Veo 3.1 列出為每秒 $0.20,而其 README 則區分為含音訊每秒 $0.40 和不含音訊每秒 $0.20。

我螢幕截圖中的執行按鈕確認了這一點。H3 參考轉影片,8 秒,2K,報價 Run $1.12,這正是每秒 $0.14。Veo 3.1 圖片轉影片,8 秒,1080p,含音訊,報價 Run $3.2,這正是每秒 $0.40。所以是 README 的費率在計費,而目錄標題是入門級。我仍然在下面顯示了兩種讀數。這些是 2026 年 8 月的牌價。

表 4:八個 8 秒鏡頭,包含關鍵影格

設定影片成本(目錄費率)影片成本(README 費率)關鍵影格總範圍
MiniMax H3, 2K$6.40$8.96$0.07$6.47 to $9.03
MiniMax H3, 768P$6.40$6.40$0.07$6.47
Veo 3.1, 1080p with audio$12.80$25.60$0.07$12.87 to $25.67
Veo 3.1 Lite, 720p$3.20$3.20$0.07$3.27

價格來自表 1 中連結的 Atlas Cloud 模型頁面,2026 年 8 月。目前這四者都沒有折扣。

該表未包含的兩件事,而且兩者都比每秒費率影響更大。

重試。 沒有人會拿動畫鏡頭的第一次拍攝就上線。無論你假設的倍數是多少,將其應用於兩欄,差距會以相同比例擴大。

實際時間,而且這個方向相反。 在 2026 年 8 月 7 日計時從頭到尾:H3 2K 8 秒花了 447 秒,約 7.5 分鐘。H3 文字轉影片 2K 12 秒花了 334 秒。Veo 3.1 1080p 8 秒含音訊花了 152 秒,不到三分鐘。在這裡,Veo 獲得第一次拍攝的速度大約快了三倍,如果你在凌晨 2 點疊代一個鏡頭,這就值真金白銀。佇列會變動,所以請將此視為一個下午的快照,而不是規格。但是,任何引用 H3 2K 為「2 到 3 分鐘」的人,引用的是 README,而不是佇列。2K 與 768P 分析 涵蓋了何時較高階層值得多花幾分鐘。

動畫風格、致敬,以及你實際上可以發佈的內容

本文中的所有內容都是風格和致敬。一個原創角色,一套原創球衣,一個原創標題。沒有生成或要求任何官方動畫角色,也沒有使用任何真實足球員的名字或肖像。世界盃趨勢被引用為一種 格式,因為這就是它有用的地方。

這個區別並非裝飾。如果你在商業上製作動畫風格內容,「在 90 年代 OVA 的風格中」和「這個來自這個特定節目的特定角色」是不同的法律客體,而且只有一個是商業行為。

關於開放權重:H3 確實可以下載,而且人們在第一天就運行了。一位評論者報告說,在配備 16GB 的 4070 Ti Super 上,一個 10 秒 480p 片段需要 10 分鐘,其他人則發佈了在 5080 上需要 3 分鐘,在 RTX 6000 Pro 上需要 68 秒。但自託管運行在 768 短邊;產生 2K 的 Context-IR 和 Regenerate-2K 階段則保留在 API 端。

許可證有一個真正的陷阱。社群許可證目前不涵蓋歐盟、英國、南韓或美國,理由是這些地區「正在制定或執行 AI 相關法規」。一個正式的許可請求管道是開放的,一位 HN 評論者將其總結為「你只需要保證不會惹惱迪士尼,他們就會寄給你許可證」。很有趣,而且這也正是如果你身處這四個地區之一時,無法跳過的合規步驟。開放權重文章 有完整的區域列表。

常見問題

與 Veo 3.1 相比,MiniMax H3 是一個好的動畫影片生成器嗎?

對於大多數動畫工作來說,H3 更好,而且主要是出於與渲染無關的原因。它支援 4 到 15 秒,而 Veo 只支援 4、6 或 8 秒;它提供六種畫面比例,包括 4:3 和 21:9,而 Veo 只有兩種;它將日語列為 11 種原生穩定對話語言之一;它可以接受九張參考圖片,而 Veo 只能接受三張。Veo 3.1 在一種特定情況下勝出:當你需要 seed 來進行可重複的重新拍攝,或者需要 negative_prompt 來防止鏡頭漂移到 3D 渲染陰影時。H3 沒有這兩個參數。如果你的工作流程依賴於其中任何一個,這是一個真正的理由留在 Veo。

Veo 3.1 可以生成 4:3 或 15 秒的動畫片段嗎?

不行,而且這不是風格上的原因。Veo 3.1 的 aspect_ratio 列舉僅包含 16:99:16,而它的 duration 列舉僅包含 468。沒有可以選擇的 4:3 值,也沒有辦法要求 12 或 15 秒。如果你的參考是 90 年代的電視動畫或 OVA,這種構圖在 Veo 上無法實現,而在 H3 上則可以。

為什麼我的 Veo 3.1 動畫片段回傳時是無聲的?

因為 generate_audio 在 API 上預設為 false。遊樂場的切換開關通常已經開啟,所以這只會影響直接呼叫 API 的人。請明確設定 generate_audio: true。同時,也設定 resolution,因為它預設為 720p,而不是你可能想要的 1080p 或 4k。

MiniMax H3 支援動畫的日語對話和唇形同步嗎?

是的。模型卡列出了 11 種具有穩定對話支援的語言:阿拉伯語、中文、英語、法語、德語、義大利語、日語、韓語、葡萄牙語、俄語和西班牙語。音訊是與畫面一起以 32 kHz 立體聲生成的,而不是事後配音,這就是為什麼嘴巴的時機可以在整個句子中保持一致,而不是只有前幾個音節。將日語句子直接以日語寫入提示詞中。

我可以使用多少張參考圖片來保持動畫角色的一致性?

MiniMax H3 最多接受 9 張圖片、最多 3 個影片片段和最多 3 個音訊片段,所有類型的總硬上限為 12 個檔案。Veo 3.1 的參考轉影片端點接受 1 到 3 張圖片,選擇它會將 duration 縮減為唯一合法的值 8。對於一個在系列中反覆出現的動畫角色來說,這個差異就是整個遊戲的關鍵。

MiniMax H3 有開放權重,所以我可以在本地免費運行我的動畫工作流程嗎?

你可以下載並運行它,但有三個注意事項。自託管推理在 768 短邊運行,而產生 2K 輸出的 Context-IR 和 Regenerate-2K 階段則保留在 API 端。實際的本地速度因顯示卡而異:根據第 0 天的 ComfyUI 討論串,在 4070 Ti Super 上,一個 10 秒 480p 片段大約需要 10 分鐘,在 5080 上大約需要 3 分鐘,在 RTX 6000 Pro 上大約需要 68 秒。此外,社群許可證目前不涵蓋歐盟、英國、南韓或美國,所以如果你身處這些地區之一,在商業使用之前需要取得正式許可證。

最新模型

一個 API,暢享全模態 AI。

探索全部模型