整個夏天,我的動態都在循環播放同一支影片。世界盃球員被重新畫成少年漫畫主角。一個獨裁者。一個海盜船長。一個在最後四秒出現的滄桑導師。每則貼文都有數百萬觀看,劇情在幾乎每場比賽後都會更新。
製作這些影片的人沒有人在寫基準測試文章。他們是挑一個模型、燒額度、在下一場開踢前就發布。
所以我拿了一個動畫關鍵影格和一個提示詞,用 MiniMax H3 動畫影片生成器對上 Veo 3.1,兩者都在相同輸入下推到最高設定。
第一個壞掉的東西不是畫質。是一個下拉選單。Veo 3.1 停在 8 秒,只提供兩種長寬比。一個鏡頭要停在臉上、跟著球甩鏡、然後讓標題卡落下,8 秒鐘根本不夠。它根本沒機會在畫質上失敗。
關鍵結論
- Veo 3.1 的
duration枚舉是[4, 6, 8],aspect_ratio枚舉是[16:9, 9:16]。MiniMax H3 可跑 4 到 15 秒的任何整數秒,並提供21:9, 16:9, 4:3, 1:1, 3:4, 9:16。Veo 沒有 4:3 意味著完全無法做出復古 OVA 畫面構圖。 - H3 的模型卡列出了 11 種原生穩定的對話語言,日文是其中之一。音頻和畫面是同時生成的,32 kHz 立體聲,不是後期配音。
- 參考素材包差距很大:H3 最多可接受 9 張圖片加上最多 3 段影片和 3 段音頻(最多 12 個檔案)。Veo 3.1 的參考端點只能接受 3 張圖片,而且一旦使用它,
duration就會強制變成[8]。 - 兩個會悄悄搞砸測試的陷阱:Veo 的 API 預設
generate_audio為false,resolution為720p;H3 的文字轉影片ratio預設為1:1。放著不管,你就是在比較一個無聲的 720p 片段和一個正方形的片段。 - Veo 3.1 保留了 H3 完全沒有的兩樣東西:
seed和negative_prompt。對於 2D 動畫來說,第二個參數真的非常重要,我會在後面展示原因。
MiniMax H3 動畫影片生成器 vs Veo 3.1,同一個影格,背對背比較
一個原創角色。一個關鍵影格。一個提示詞,完全複製貼上到兩個模型。其他所有設定都各自調到最高。
Zdu1SJ7kN_o
MiniMax H3,圖片轉影片,2K,8 秒,原生音頻。請打開聲音:群眾背景音、擊球聲和日文喊叫是在同一個生成步驟中與畫面一起產生的。在 Atlas Cloud 上使用 minimax/h3/image-to-video 生成。
r_7UCdbs8Mk
Veo 3.1,圖片轉影片,1080p,8 秒,手動開啟 generateaudio,加上 negativeprompt 來保持線條平塗。相同的第一幀,相同的文字。在 Atlas Cloud 上使用 google/veo3.1/image-to-video 生成。
兩者都畫得很漂亮。Veo 的擊球廣角鏡頭,帶有手繪撞擊線和漂浮在空中的漫畫音效,真的很棒。這是誠實的起點,也正是為什麼本文接下來要討論的是參數和指令遵循,而不是主觀感受。
為什麼大多數 MiniMax H3 動畫影片生成器 vs Veo 3.1 的測試會出錯
今年夏天同時發生了兩件事。
動畫成了 AI 影片中產量最高的格式。2026 年世界盃被改寫成少年漫畫錦標賽,球員被塑造成獨裁者、海盜船長、海軍上將和導師,劇情在 TikTok、Instagram、X 和 YouTube 上「幾乎每場比賽後都會更新」(Complex,2026 年 7 月)。
而 MiniMax H3 開放了權重。第 0 天的 ComfyUI 討論串在幾小時內就達到了 330 分和 95 則留言,人們貼出了實際的本機跑分數據(Hacker News,2026 年 8 月)。
把這兩件事放在一起,你會預期看到一堆動畫比較。但幾乎沒有,因為大多數測試都在以下四種方式中出了錯。
他們比較的是畫面,而不是限制條件。 動畫鏡頭是時機問題。甩鏡後接標題卡,在變成渲染問題之前,首先是時長問題。
他們忘記 Veo 的 API 預設是無聲的。 在 API 上,generate_audio 是 false,resolution 是 720p。很多「Veo 在動畫中沒有音頻」的貼文,只是有人沒去打開那個布林值。
他們忘記 H3 的文字轉影片預設是正方形的。 ratio 預設是 1:1,不是 16:9。在沒設定的情況下執行 t2v 動畫提示詞,你會得到一個正方形片段和一個困惑的結論。
他們用寫實照片的提示詞來測試。 「電影感、體積光、淺景深」正是那種會把 2D 模型拖向 3D 渲染陰影的詞彙。動畫的失敗模式不是模糊,而是塑膠感。
三個在按下執行前就決定動畫測試結果的設定
在做任何事之前,先設定好這兩邊的這些參數,否則比較無效。
| 設定 | MiniMax H3 | Veo 3.1 | 跳過它會發生什麼事 |
|---|---|---|---|
| 音頻 | 與畫面同時生成,永遠開啟 | generate_audio 預設為 false | Veo 回傳一個無聲片段,看起來比實際更糟 |
| 畫面形狀 | 文字轉影片時 ratio 預設為 1:1 | aspect_ratio 預設為 16:9 | H3 給你一個無法使用的正方形動畫片段 |
| 解析度 | 預設為 2K | 預設為 720p | 你在比較 2K 和 720p,然後稱之為畫質差距 |
MiniMax H3 vs Veo 3.1 動畫規格表:長度、比例、音頻、參考素材
我直接從兩個模型的即時輸入架構中擷取資料,而不是相信任何發布文章。下面的每個值都是你可以在模型頁面上自己查看的枚舉,不是個人印象。
表 1:MiniMax H3 vs Veo 3.1,決定動畫鏡頭的參數
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| 時長 | 4 到 15,每個整數秒(預設 8) | 4, 6, 8(預設 8) |
| 長寬比 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| 預設比例(文字轉影片) | 1:01 | 16:09 |
| 解析度 | 768P, 2K(預設 2K) | 720p, 1080p, 4k(預設 720p) |
| 音頻 | 共同生成,32 kHz 立體聲 | generate_audio,預設 false |
| 原生對話語言 | 11 種穩定,包含日文 | 未公布為穩定清單 |
| 參考素材包 | 最多 9 張圖片、3 段影片、3 段音頻,總共 12 個檔案 | 3 張圖片 |
| 使用參考素材時的時長 | 仍是 4 到 15 | 強制變成只限 8 |
| seed | 不可用 | 可用 |
| negative_prompt | 不可用 | 可用 |
| 權重 | 可下載 | 封閉 |
時長、比例、解析度、音頻和參考素材限制來自 MiniMax H3 圖片轉影片、H3 文字轉影片、H3 參考素材轉影片、Veo 3.1 圖片轉影片 和 Veo 3.1 參考素材轉影片 頁面上的即時架構。9 張圖片和 12 個檔案的參考上限以及 11 種語言的對話清單來自 MiniMax H3 模型卡(Hugging Face,2026 年 8 月)。
現在看計分板,因為它們說的事情和規格表不同,而兩者都很重要。
表 2:群眾投票 Elo 與每分鐘牌價,2026 年 8 月 7 日快照
| 模型 | 文字轉影片(含音頻) | 圖片轉影片(含音頻) | 每分鐘費用 |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | 未列入前十 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | 未列入前十 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | 未列入前十 | $4.80 |
Elo 和價格數據來自 Artificial Analysis Video Arena(Artificial Analysis,2026 年 8 月)。這些是滾動的群眾投票,數字會變動。每分鐘費用欄是標準化的模型估算,不是你的實際帳單。
145 分的 Elo 差距很大,但這是通用投票,不是針對動畫的投票。而且這裡我必須坦白說:MiniMax 並沒有把 H3 定位為動畫模型。內部第一線回饋清單顯示,電影、動畫和漫畫劇情是 H3 不針對的領域。所以有趣的問題不是「哪個是動畫模型」,而是為什麼一個不以動畫為賣點的模型在鏡頭表現上仍然勝出,以及 Google 又在哪裡扳回一城。
在進入教學之前有一個實務提醒。下面每個模型都是透過同一個主控台和同一個 API 金鑰執行,這是參數可以直接比較的唯一原因。相同的佇列、相同的認證、同一張帳單。如果你把 GPT Image 2 放在一個服務上,Veo 放在另一個服務上,你發現的一半差異會是管道問題,而不是模型問題。
建構鏡頭:MiniMax H3 vs Veo 3.1,逐步教學
一個從頭到尾的執行範例。「最後的哨音」:一個原創青少年前鋒,紅髮、白色海軍藍 9 號球衣、球場照明燈、擊球時甩鏡、以及一個必須在最後兩秒落下並保持穩定的日文標題卡。
沒有真實球員、沒有官方角色、沒有現有動畫 IP。只有風格和致敬。稍後會詳細說明原因。
步驟 1:使用 GPT Image 2 設計動畫關鍵影格
關鍵影格承載了美術方向,這樣影片模型就不必自己發明。請注意左邊三分之一處的留白空間:這是刻意為之。標題卡將由影片模型寫在那裡,這是文字穩定性的測試。
plaintext1一部現代少年運動動畫的單一影格。賽璐珞風格 2D 動畫,手繪墨線、線條粗細一致、平塗色塊、硬邊圖形陰影、完全沒有 3D 陰影或寫實皮膚。特寫一位原創青少年前鋒:凌亂的深紅髮、白色海軍藍球衣、背號 9、臉頰上有一道汗水和草痕、睜大的眼睛帶著疲憊的決心、張嘴大吼。在他身後,體育場照明燈刺入模糊的群眾色彩牆;畫面中央爆出放射狀速度線;一根草葉凍結在空中。飽和色調、深青色陰影、暖橙色邊緣光。16:9 構圖,角色偏右,左邊三分之一處乾淨留白。圖片中沒有任何文字。
設定:模型 openai/gpt-image-2/text-to-image,品質 high,尺寸 16:9 (2048x1152)。沒有其他設定。

Atlas Cloud 上的 GPT Image 2 遊樂場,顯示 Last Whistle 關鍵影格提示詞和輸出面板中的完成動畫影格
Atlas Cloud 上的 GPT Image 2:品質設為高,右側是完成的關鍵影格。

基礎動畫關鍵影格:一個原創紅髮前鋒在體育場照明燈下大吼,賽璐珞風格、平塗顏色和速度線
兩個模型都收到的關鍵影格。平塗顏色、硬邊陰影、左邊三分之一處留白等待標題卡。
步驟 2:MiniMax H3 圖片轉影片,全部推到最高
同樣的圖片輸入,2K 輸出。我這裡故意把 H3 限制在 8 秒,以便與 Veo 的上限匹配。這不是 H3 的限制,步驟 4 會解除這個限制。
plaintext1賽璐珞風格 2D 動畫,手繪墨線、平塗顏色、無 3D 陰影。在射手臉上停頓一拍,然後隨著他踢球出現一個劇烈的甩鏡,甩鏡時畫面模糊成帶有拖曳線條的作畫崩壞動態痕跡。撞擊瞬間有一幀完全靜默。在最後兩秒,粗體白色日文標題 ラストホイッスル 出現在畫面左邊三分之一處並保持穩定不動,不變形、不閃爍、不飄移。射手用日文大喊一句台詞:「まだ終わってない!」音頻:體育場歡呼聲高漲、一次清脆的擊球撞擊聲、標題卡出現時的低沉太鼓聲。
設定:模型 minimax/h3/image-to-video,resolution: 2K,duration: 8,ratio: adaptive(圖片轉影片會從輸入圖片中取得畫面形狀),image = 步驟 1 的輸出。
一個警告:如果你改用文字轉影片,請明確寫出 ratio: 16:9。預設是 1:1,它會很樂意給你一個正方形動畫片段。

Atlas Cloud 上的 MiniMax H3 圖片轉影片遊樂場,顯示 Last Whistle 提示詞、已載入的關鍵影格和輸出面板中的完成片段
Atlas Cloud 上的 MiniMax H3 圖片轉影片:左側載入步驟 1 的關鍵影格,右側播放完成的片段。
步驟 3:Veo 3.1 圖片轉影片,手動開啟音頻
提示詞完全一樣,逐字複製。改變任何一個形容詞就不再是比較了。會改變的是 Veo 給你而 H3 沒有的額外欄位。
negative_prompt,對於 2D 動畫來說,這是這份清單中唯一最有用的控制項:
plaintext13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
設定:模型 google/veo3.1/image-to-video,resolution: 1080p(要更改,預設是 720p),duration: 8(這是上限),aspect_ratio: 16:9,generate_audio: true(API 預設是 false,這是無聲片段的陷阱),seed: 20260807,image = 相同的步驟 1 輸出。

Atlas Cloud 上的 Veo 3.1 圖片轉影片遊樂場,顯示已啟用產生音頻、已載入動畫關鍵影格和輸出面板中的完成片段
Atlas Cloud 上的 Veo 3.1 圖片轉影片,已開啟 Generate Audio,右側是完成的片段。
步驟 4:在五個動畫專用軸向上評分
這裡不需要生成任何東西。只是觀察,在動畫真正會出問題的地方。兩個片段都嵌入在本文上方附近,所以你可以自己打分,而不是相信我。

兩個片段最後一幀的並排比較,左側 MiniMax H3 有清晰的日文標題,右側 Veo 3.1 有亂碼的垂直字符
每個片段的最後一幀。左邊,H3 寫出了 ラストホイッスル,全部八個片假名正確且穩定。右邊,Veo 3.1 寫出了三個字符,既不是要求的詞彙,也不是一個詞。
標題卡是決定勝負的地方,而且差距很大。H3 準確渲染了要求的片假名,邊緣銳利且穩定,覆蓋在球門區的模糊甩鏡上。Veo 3.1 產生了一個由三個字符組成的垂直堆疊,既不是要求的詞彙,也不是一個詞。在同一幀中,它還讓角色移出了畫面,並讓背景在最後滑向半寫實的體育場靜態畫面,儘管 photorealistic skin 和 3D render 就在負面提示詞中。
表 3:決定動畫片段的五個軸向,來自這兩次執行
| 軸向 | MiniMax H3 | Veo 3.1 |
|---|---|---|
| 角色與關鍵影格的連續性 | 在整個 8 秒內保持完全相同的臉、頭髮和球衣 | 在新的廣角鏡頭中重新繪製角色,造型正確但是不同的圖畫 |
| 線條粗細和平塗賽璐珞陰影 | 保持,沒有漂向 3D | 在中景鏡頭中保持,最後漂向寫實的體育場靜態畫面 |
| 日文標題卡 | ラストホイッスル 正確渲染並保持穩定 | 三個字符,不是要求的詞彙,也不是一個詞 |
| 產生的音頻軌道 | 32 kHz 立體聲,完全如模型卡所述 | 48 kHz 立體聲,只在於我手動設定了 generate_audio |
| 甩鏡和作畫崩壞模糊 | 執行為模糊的甩鏡並進入標題 | 被替換成硬切到下一個新場景 |
最後一行是迄今為止對 H3 最大的公開批評,也正是我把它寫進兩個提示詞的原因。在第 0 天的 ComfyUI 討論串中,使用者 fwip 抱怨連官方示範提示詞都被忽略了:「一個劇烈的甩鏡從屋頂上把那些浮動的文字帶著一起模糊掉,拖動模糊。然後影片完全沒有做任何那種轉場,它只是用一個切換來代替。」
在這次執行中,是 Veo 把甩鏡換成了切換,而 H3 做了模糊。一次執行各一次不能算是定論,我也不會說不是。但這確實意味著批評不是 H3 專屬的:甩鏡是整個測試中兩邊都最不可靠的指令。如果你的分鏡依賴甩鏡,那就繞過它來編排,而不是透過它。
步驟 5:Veo 3.1 在結構上無法輸出的 4:3 復古 OVA 片段
這不是品質偏好。這是一道牆。Veo 的 aspect_ratio 枚舉只有兩個值,而且沒有 4:3,它的 duration 枚舉也沒有 12。90 年代 OVA 的外觀根本無法實現。
plaintext11990 年代 OVA 動畫片段,4:3 全畫面。手繪背景美術,可見筆刷紋理,賽璐珞上色角色,粗細不均的濃墨線條,照明燈周圍有強烈的暈光輝光,16mm 底片顆粒和輕微的片門抖動。同一個紅髮前鋒,穿著白色海軍藍 9 號球衣,從被雨淋濕的球場走出來,群眾噪音逐漸消失變成單一的鈴聲。鏡頭慢慢推近他的臉。他輕聲用日文說:「次は、勝つ」。復古色調:暗藍綠色、灰塵琥珀色、深栗色陰影。音頻:遙遠的雨聲、孤單的類比合成器 pad、遠方一聲回音很重的哨音。
設定:模型 minimax/h3/text-to-video,resolution: 2K,duration: 12,ratio: 4:3。記得手動設定這個比例,因為預設值不同。

Atlas Cloud 上的 MiniMax H3 文字轉影片遊樂場,顯示輸入的 OVA 提示詞和輸出面板中完成的復古片段
Atlas Cloud 上的 MiniMax H3 文字轉影片,已輸入 OVA 提示詞,片段已完成。完全公開:這次特定執行把 Aspect Ratio 留在 16:9,Duration 留在 8,所以你在右邊看到的是寬螢幕的短版本。下面的 4:3 十二秒片段來自 API 呼叫,其中明確設定了 ratio: 4:3 和 duration: 12。

4:3 復古 OVA 片段:同一個前鋒以 90 年代動畫風格從被雨淋濕的球場走出來
H3 文字轉影片,4:3,12 秒。傳回的檔案是 1920x1440,精確符合 4:3,並帶有 32 kHz 立體聲音軌。此處以降低幀率的無聲 GIF 顯示以保持頁面輕量。在 Atlas Cloud 上使用 minimax/h3/text-to-video 生成。
步驟 6:九張參考圖片,一個角色,四個鏡頭
跨鏡頭的角色一致性是 AI 動畫中最困難的問題,而解決方案是參考素材的數量。先建立素材包:重新執行步驟 1 的提示詞,但將構圖改為正面、四分之三側面、全側面、背面、大笑、咬牙、全身站姿、球衣細節和球鞋細節。九張圖片,總共大約八美分。

同一原創前鋒角色的四個角度,作為參考素材包生成,排列成 2x2 網格
九個參考角度中的四個。H3 在一個參考素材包中最多可接受九張圖片,還可加上影片和音頻參考素材。
plaintext1賽璐珞風格 2D 動畫,一致的手繪墨線、平塗顏色、無 3D 陰影。在每個鏡頭中保持參考前鋒的臉、頭髮輪廓和 9 號球衣完全相同。一個連續鏡頭中的四個剪輯:(1) 低角度推進他的靴子踩在草地上,(2) 甩鏡向上到他的眼睛特寫,(3) 他衝過三名模糊剪影後衛的廣角鏡頭,(4) 凍結在一個空中頭錘,速度線向外爆開。音頻:群眾歡呼、呼吸、靴子踩在草地上的撞擊聲、凍結時的一個太鼓聲。
設定:模型 minimax/h3/reference-to-video,refers = 你的圖片,type: image,resolution: 2K,duration: 8 或更高,ratio: adaptive 或 16:9。
Veo 3.1 的等效設定無法以這些設定執行,你也不需要嘗試就知道原因。它的參考端點最多接受 3 張圖片,而且選擇該端點會讓 duration 強制縮減為唯一的合法值 8。一個九張圖片的素材包和一個 10 秒的鏡頭都超出範圍。

Atlas Cloud 上的 MiniMax H3 參考素材轉影片遊樂場,顯示參考素材計數器為 4/9,輸出面板中顯示第一個鏡頭
Atlas Cloud 上的 MiniMax H3 參考素材轉影片。計數器顯示 Reference Materials (4/9),下方有 MAX:9,這是介面中的上限,而不是規格表上的聲明。輸出是第一個鏡頭,低角度推進靴子。
另外四個值得做的 MiniMax H3 動畫影片生成器執行
Last Whistle 鏡頭只測試了其中四個差異。這四個測試了其餘的。它們都在 H3 上執行;備註中會說明哪些 Veo 3.1 可以匹配。
- 超寬銀幕作畫打鬥,
21:9,10 秒。 Veo 完全無法輸出 21:9。
plaintext1賽璐珞風格 2D 動畫動作,粗細漸變的墨線、平塗顏色、硬邊陰影、無 3D 陰影。兩個原創蒙面決鬥者在黃昏風吹的寺廟屋頂上。刀劍交鋒,畫面震動,兩名戰士在爆發的手繪衝擊幀和放射狀速度線中分開。攝影機:低角度推進,然後水平跟拍,然後快速切換到夕陽下的寬廣剪影。音頻:兩聲尖銳金屬碰撞、布料啪響、最後凍結時的低沉太鼓聲,沒有音樂。
- 節拍同步的 AMV 剪輯,使用音頻參考素材的參考素材轉影片。 H3 最多可接受三段音頻作為參考輸入。Veo 3.1 完全沒有音頻輸入,只有音頻輸出。
plaintext1賽璐珞風格 2D 動畫蒙太奇,對齊參考音頻軌道。五個短拍:窗上的雨、繃帶纏緊的手、從火車窗外掠過的城市天際線、起跑衝刺、凍結在伸出的手。每個剪輯正好落在參考音頻的重拍上。平塗顏色、濃墨線條、高對比夜晚色調,深靛藍和霓虹洋紅。
- 兩行日文對話場景,12 秒。 這是唇形同步的壓力測試,12 秒已經超出 Veo 的範圍。
plaintext1賽璐珞風格 2D 動畫,平塗顏色、無 3D 陰影。兩個原創角色在黃金時刻的屋頂上,正反打鏡頭。第一個用日文說:「本当に行くの?」。第二個半笑著用日文回答:「もう決めた」。嘴巴吻合每個音節。溫暖的邊緣光、長長的影子、頭髮輕柔飄動。音頻:兩個不同的日文聲音、遙遠的車聲、一聲蟬鳴。
- 直式少年短片,
9:16,8 秒。 兩個模型都可以做直式,所以這是唯一一個真正要 A/B 比較而不是假設的地方。
plaintext1賽璐珞風格 2D 動畫,直式構圖。一個原創青少年跑者以慢動作衝破紙製橫幅,然後畫面突然恢復全速,她在體育場直道上加速。速度線、平塗顏色、硬邊陰影、大膽的圖形化天空。攝影機:低角度跟拍鏡頭,然後甩鏡向上到她的臉。音頻:橫幅撕裂、群眾湧動、屏住呼吸然後釋放。
如果你想要這些背後的提示詞語法,MiniMax H3 提示詞指南 對 H3 如何解析攝影機和音頻指令有更深入的探討,這裡無法詳述。
MiniMax H3 vs Veo 3.1:60 秒動畫開頭的成本是多少
一個標準的動畫 OP 大約是 90 秒。算作八個 8 秒的鏡頭,共 64 秒的成品影片,加上每個鏡頭一個關鍵影格,每個 $0.009。
有一個實際的定價差異你應該知道,而不是讓我含糊帶過。Atlas Cloud 目錄顯示 MiniMax H3 的固定價格為每秒 $0.10,而模型說明文件則細分為 2K 每秒 $0.14、768P 每秒 $0.10。Veo 3.1 目錄顯示每秒 $0.20,而說明文件則區分為含音頻每秒 $0.40、不含音頻每秒 $0.20。
我螢幕截圖中的執行按鈕解決了這個問題。H3 參考素材轉影片,8 秒 2K,報價 Run $1.12,正好是每秒 $0.14。Veo 3.1 圖片轉影片,8 秒 1080p 含音頻,報價 Run $3.2,正好是每秒 $0.40。所以說明文件費率才是實際計費的費率,目錄標題只是入門等級。我下面仍然列出了兩種讀數。這些是 2026 年 8 月的牌價。
表 4:八個 8 秒鏡頭,包含關鍵影格
| 設定 | 影片成本(目錄費率) | 影片成本(說明文件費率) | 關鍵影格 | 總成本範圍 |
|---|---|---|---|---|
| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 至 $9.03 |
| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1, 1080p 含音頻 | $12.80 | $25.60 | $0.07 | $12.87 至 $25.67 |
| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 |
價格取自表 1 中連結的 Atlas Cloud 模型頁面,2026 年 8 月。這四種目前都沒有折扣。
表格中沒有包含的兩件事,而且兩者都比每秒費率影響更大。
重試。 沒有人會使用動畫鏡頭的第一次生成。無論你假設的倍數是多少,套用到兩欄時,差距會以相同比例擴大。
實際時間,而這個是反過來的。 在 2026 年 8 月 7 日從頭到尾計時:H3 2K 8 秒花了 447 秒,約 7.5 分鐘。H3 文字轉影片 2K 12 秒花了 334 秒。Veo 3.1 1080p 8 秒含音頻花了 152 秒,不到三分鐘。在第一次生成的速度上,Veo 大約快了三倍,而如果你在凌晨兩點迭代一個鏡頭,這就值真金白銀。佇列會變動,所以請將這些視為某個下午的快照,而不是規格。但任何聲稱 H3 2K 只要「2 到 3 分鐘」的人,引用的是說明文件,而不是實際佇列。2K 與 768P 比較 涵蓋了何時較高階層級值得多花幾分鐘。
動畫風格、致敬,以及你實際上可以發布什麼
本文中的所有內容都是風格和致敬。一個原創角色、一套原創球衣、一個原創標題。沒有生成或要求任何官方動畫角色,也沒有使用任何真實足球員的名字或肖像。世界盃趨勢被引用為一種格式,因為這正是它有用的地方。
這個區別不是裝飾。如果你要商業性地製作動畫風格內容,「90 年代 OVA 風格」和「這個特定節目中的這個特定角色」是不同的法律物件,且只有一個是可行的生意。
關於開放權重:H3 確實可以下載,而且人們在第一天就跑了。一位評論者報告說,在 4070 Ti Super 16GB 上,10 秒 480p 片段需要 10 分鐘,其他人在 5080 上報告 3 分鐘,在 RTX 6000 Pro 上報告 68 秒。但自架推理運行在 768 短邊;產生 2K 的 Context-IR 和 Regenerate-2K 階段仍留在 API 端。
授權有一個真正的陷阱。社群授權目前不涵蓋歐盟、英國、南韓或美國,理由是這些地區「目前正在制定或執行 AI 相關法規」。有一個正式的授權申請管道,一位 HN 評論者將其總結為「你只需要小指頭發誓你不會惹毛迪士尼,他們就會寄給你授權」。有趣,但如果你身處這四個地區之一,這正是你不能跳過的合規步驟。開放權重文章 有完整的區域清單。
常見問題
MiniMax H3 是比 Veo 3.1 更好的動畫影片生成器嗎?
對於大多數動畫工作來說,是 H3,而且主要是因為與渲染無關的原因。它可跑 4 到 15 秒,而 Veo 只有 4、6 或 8 秒;它提供六種長寬比,包括 4:3 和 21:9,而 Veo 只有兩種;它將日文列為 11 種原生穩定對話語言之一;它可接受九張參考圖片,而 Veo 只有三張。Veo 3.1 在一個特定情況下勝出:當你需要 seed 進行可重複的重新生成,或 negative_prompt 來防止鏡頭漂向 3D 渲染陰影時。H3 沒有這兩個參數。如果你的流程依賴其中任何一個,那是一個真正值得留在 Veo 的理由。
Veo 3.1 可以生成 4:3 或 15 秒的動畫片段嗎?
不行,而且不是出於風格原因。Veo 3.1 的 aspect_ratio 枚舉恰好包含 16:9 和 9:16,其 duration 枚舉恰好包含 4、6 和 8。沒有 4:3 的值可以選擇,也無法要求 12 或 15 秒。如果你的參考來源是 90 年代電視動畫或 OVA,在 Veo 上無法達到那種構圖,而 H3 可以。
為什麼我的 Veo 3.1 動畫片段回來是無聲的?
因為 generate_audio 在 API 上預設為 false。遊樂場的開關通常已經開啟,所以這只會咬到直接呼叫 API 的人。請明確設定 generate_audio: true。同時,也設定 resolution,因為它預設為 720p,而不是你可能想要的 1080p 或 4k。
MiniMax H3 支援動畫的日文對話和唇形同步嗎?
是的。模型卡列出了 11 種具有穩定對話支援的語言:阿拉伯文、中文、英文、法文、德文、義大利文、日文、韓文、葡萄牙文、俄文和西班牙文。音頻是與畫面共同生成的,32 kHz 立體聲,而不是後期配音,這就是為什麼嘴巴時機可以貫穿整個句子,而不只是前幾個音節。直接將日文句子以日文寫入提示詞中。
我可以使用多少張參考圖片來保持動畫角色的一致性?
MiniMax H3 最多接受 9 張圖片、最多 3 段影片和最多 3 段音頻,所有類型總共硬上限為 12 個檔案。Veo 3.1 的參考素材轉影片端點接受 1 到 3 張圖片,選擇它會讓 duration 強制縮減為唯一的合法值 8。對於一個在系列中反覆出現的動畫角色來說,這個差異就是整個遊戲的關鍵。
MiniMax H3 有開放權重,所以我可以在本地免費運行我的動畫流程嗎?
你可以下載並運行它,但有三個注意事項。自架推理運行在 768 短邊,而產生 2K 輸出的 Context-IR 和 Regenerate-2K 階段仍留在 API 端。實際的本機速度因顯示卡而異:根據第 0 天 ComfyUI 討論串,在 4070 Ti Super 上,10 秒 480p 片段大約需要 10 分鐘;在 5080 上約 3 分鐘;在 RTX 6000 Pro 上約 68 秒。而且社群授權目前不涵蓋歐盟、英國、南韓或美國,所以如果你身處這些地區,商業使用需要正式授權。






