整個夏天,我的動態牆都在循環播放同一支影片。世界盃球員被重新繪製成少年漫畫主角。獨裁者、海盜船長、最後四秒才出現的滄桑導師。每篇貼文都有數百萬觀看次數,而且幾乎每場比賽後劇情都會更新。
那些製作這些影片的人不是為了寫基準測試文章。他們是選一個模型,花掉點數,然後在下一場比賽開踢前就發布。
所以我拿了一個動畫關鍵幀和一個提示詞,用相同的輸入,把 MiniMax H3 和 Veo 3.1 都推到最高設定,來測試它們作為動畫影片生成器的表現。
第一個出問題的不是影像品質。而是下拉選單。Veo 3.1 最多只能 8 秒,而且只提供兩種畫面比例。一個特寫臉部、跟著球橫向搖攝、最後讓標題卡落地的鏡頭,根本塞不進 8 秒。它連在品質上失敗的機會都沒有。
關鍵要點
- Veo 3.1 的
duration枚舉值是[4, 6, 8],aspect_ratio枚舉值是[16:9, 9:16]。MiniMax H3 則支援 4 到 15 秒的任何整數秒,並提供21:9、16:9、4:3、1:1、3:4、9:16。Veo 沒有 4:3,就完全無法做出復古 OVA 的構圖。 - H3 的模型卡列出了 11 種原生穩定的對話語言,日文是其中之一。音訊和畫面是同時生成的,32 kHz 立體聲,不是事後配音。
- 參考素材包的差距很大:H3 最多可接受 9 張圖片、3 部影片和 3 段音訊(最多 12 個檔案)。Veo 3.1 的參考端點只接受 3 張圖片,而且一旦使用它,
duration就會縮減為只有[8]。 - 兩個會默默毀掉測試的陷阱:Veo 的 API 預設
generate_audio為false,resolution預設為720p;而 H3 的文字轉影片ratio預設為1:1。如果沒修改這些設定,你就是在比較一個無聲的 720p 片段和一個正方形的片段。 - Veo 3.1 保留了兩個 H3 完全沒有的東西:
seed和negative_prompt。對於 2D 動畫來說,後者真的很重要,我會在後續展示原因。
MiniMax H3 動畫影片生成器 vs Veo 3.1,同一個關鍵幀的對比
一個原創角色。一個關鍵幀。一個提示詞,完全相同的文字分別輸入兩個模型。兩邊的其他設定都調到最高。
MiniMax H3,圖片轉影片,2K,8 秒,原生音訊。請打開聲音:人群背景音、擊球聲和日文喊叫聲都是與畫面同時生成的。使用 Atlas Cloud 上的 minimax/h3/image-to-video 生成。
Veo 3.1,圖片轉影片,1080p,8 秒,手動開啟 generate_audio,並加上 negative_prompt 以保持線條平面。相同的起始幀,相同的文字。使用 Atlas Cloud 上的 google/veo3.1/image-to-video 生成。
兩者都畫得很漂亮。Veo 的擊球廣角鏡頭,帶有手繪衝擊線和漂浮在空中的漫畫音效,確實很討喜。這是誠實的起點,也是為什麼本文的其餘部分都在討論參數和指令遵循,而不是感覺。
為什麼大多數 MiniMax H3 動畫影片生成器 vs Veo 3.1 的測試會出錯
今年夏天同時發生了兩件事。
動畫成了 AI 影片中產量最高的格式。2026 年世界盃被改寫成少年漫畫錦標賽,球員被塑造成獨裁者、海盜船長、海軍上將和導師,劇情在 TikTok、Instagram、X 和 YouTube 上「幾乎每場比賽後都會演進」(Complex,2026 年 7 月)。
而 MiniMax H3 以開放權重發布。首日的 ComfyUI 討論串獲得了 330 分和 95 則留言,人們在數小時內就貼出了真實的本地運作數據(Hacker News,2026 年 8 月)。
將這兩件事放在一起,你會預期看到一堆動畫比較。但幾乎沒有,因為大多數測試都以下列四種方式之一建構錯誤。
它們比較的是圖片,而不是限制條件。 動畫鏡頭講究的是時間點。一個橫搖到標題卡的鏡頭,在變成渲染問題之前,首先就是一個持續時間問題。
它們忘了 Veo 的 API 預設是無聲的。 在 API 上,generate_audio 是 false,resolution 是 720p。很多「Veo 在動畫中沒有音訊」的貼文,只是有人從未撥動過一個布林值開關。
它們忘了 H3 的文字轉影片預設是正方形的。 ratio 預設為 1:1,而不是 16:9。如果你在沒有設定 ratio 的情況下執行 t2v 動畫提示詞,你會得到一個正方形片段和一個令人困惑的結論。
它們使用寫實照片的提示詞進行測試。 「電影感、體積光、淺景深」正是那種會把 2D 模型拖向 3D 渲染陰影的詞彙。動畫的失敗模式不是模糊,而是塑膠感。
三個在按下執行前就決定動畫測試結果的設定
在開始之前,先在兩邊設定好這些,否則比較無效。
| 設定 | MiniMax H3 | Veo 3.1 | 如果跳過會發生什麼事 |
|---|---|---|---|
| 音訊 | 與畫面同時生成,永遠開啟 | generate_audio 預設為 false | Veo 回傳一個無聲片段,看起來比實際差 |
| 畫面形狀 | 文字轉影片的 ratio 預設為 1:1 | aspect_ratio 預設為 16:9 | H3 給你一個無法使用的正方形動畫片段 |
| 解析度 | 預設為 2K | 預設為 720p | 你用 2K 和 720p 比較,然後稱之為品質落差 |
想自己用同一個動畫提示詞測試 MiniMax H3 和 Veo 3.1 嗎?Atlas Cloud 的模型比較功能 可以一次並排執行它們——相同的提示詞和設定,生成前就會顯示成本。

MiniMax H3 和 Veo 3.1 在 Atlas Cloud 模型比較中,使用相同的動畫提示詞——相同的設定,生成前顯示價格。從 model-explorer 頁面即時擷取。
MiniMax H3 vs Veo 3.1 動畫規格表:長度、比例、音訊、參考素材
我直接從兩個模型的即時輸入架構中取得資料,而不是相信任何發布文章。以下每個值都是你可以在模型頁面上自行查看的枚舉值,不是個人印象。
表 1:MiniMax H3 vs Veo 3.1,決定動畫鏡頭的參數
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| 持續時間 | 4 到 15,每整數秒(預設 8) | 4, 6, 8(預設 8) |
| 畫面比例 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| 比例預設值(文字轉影片) | 1:01 | 16:09 |
| 解析度 | 768P, 2K(預設 2K) | 720p, 1080p, 4k(預設 720p) |
| 音訊 | 同時生成,32 kHz 立體聲 | generate_audio,預設 false |
| 原生對話語言 | 11 種穩定,包含日文 | 未發布為穩定列表 |
| 參考素材包 | 最多 9 張圖片、3 部影片、3 段音訊,總共 12 個檔案 | 3 張圖片 |
| 使用參考素材時的持續時間 | 仍然 4 到 15 | 縮減為只有 8 |
| seed | 不可用 | 可用 |
| negative_prompt | 不可用 | 可用 |
| 權重 | 可下載 | 封閉 |
持續時間、比例、解析度、音訊和參考素材限制,均來自 MiniMax H3 圖片轉影片、H3 文字轉影片、H3 參考素材轉影片、Veo 3.1 圖片轉影片 和 Veo 3.1 參考素材轉影片 頁面的即時架構。9 張圖片和 12 個檔案的參考素材上限,以及 11 種語言的對話列表,來自 MiniMax H3 模型卡(Hugging Face,2026 年 8 月)。
現在來看排行榜,因為它們說的話和規格表不同,而且兩者都很重要。
表 2:群眾投票 Elo 與每分鐘牌價,2026 年 8 月 7 日快照
| 模型 | 文字轉影片(含音訊) | 圖片轉影片(含音訊) | 美金/分鐘 |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | 未列入前十 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | 未列入前十 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | 未列入前十 | $4.80 |
Elo 和價格數據來自 Artificial Analysis Video Arena(Artificial Analysis,2026 年 8 月)。這些是滾動的群眾投票,數字會變動。$/min 欄位是標準化的模型估算值,不是你的實際帳單。
145 分的 Elo 差距很大,但這是一般用途的投票,不是動畫投票。而且我必須坦白說:MiniMax 並沒有將 H3 定位為動畫模型。內部的第一線回饋清單中,電影、動畫和喜劇劇情片是 H3 不針對的領域。所以有趣的問題不是「哪一個是動畫模型」,而是為什麼一個不以動畫為賣點的模型,仍然在這個鏡頭中勝出,以及 Google 在哪裡仍然能拿下這一回合。
在進入教學之前有一個實用提示。以下每個模型都透過同一個控制台和同一個 API 金鑰運行,這是參數可以比較的唯一原因。相同的佇列、相同的驗證、同一張帳單。如果你在一個服務上設定 GPT Image 2,在另一個服務上設定 Veo,你會發現的一半差異來自於底層管線,而不是模型本身。
建構鏡頭:MiniMax H3 vs Veo 3.1,逐步教學
一個從頭到尾的連續範例。「最後哨音」:一個原創的青少年前鋒,紅髮,身穿白色與海軍藍的 9 號球衣,球場照明燈,一個橫搖跟拍射門動作,以及一個必須在最後兩秒內出現並穩定停留的日文標題卡。
沒有真實球員、沒有官方角色、沒有現有的動畫 IP。只有風格和致敬。為什麼這麼做,稍後會說明。
步驟 1:使用 GPT Image 2 設計動畫關鍵幀
關鍵幀承載了美術指導方向,這樣影片模型就不需要自己發明。請注意左側三分之一處的留白空間:這是刻意設計的。影片模型會在那裡寫入標題卡,這就是文字穩定性的測試。
Plain1一個現代少年運動動畫的單一幀。賽璐珞著色2D動畫,手工描線,線條粗細一致,平塗色塊, 2硬邊圖形陰影,完全沒有3D陰影也沒有寫實皮膚。特寫一個原創青少年前鋒:凌亂的深紅色頭髮, 3白色與海軍藍的球衣,背號9,一邊臉頰上有汗水和草痕,雙眼圓睜帶著疲憊的決心,張嘴正在吶喊。 4在他身後,球場照明燈的強光映照在一面模糊的觀眾色彩牆上;放射狀速度線從畫面中央爆發; 5一根草葉靜止懸浮在空中。飽和色調,深青色陰影,暖橙色邊緣光。16:9構圖,角色偏右構圖, 6左側三分之一處有乾淨的留白。圖片中任何地方都沒有文字。
設定:模型 openai/gpt-image-2/text-to-image,品質 high,尺寸 16:9 (2048x1152)。沒有其他設定。

Atlas Cloud 上的 GPT Image 2 工作區,顯示「最後哨音」關鍵幀提示詞,以及輸出面板中的完成動畫幀
Atlas Cloud 上的 GPT Image 2:品質設定為高,右側是完成的關鍵幀。

基礎動畫關鍵幀:一個原創紅髮前鋒在球場照明燈下吶喊,賽璐珞著色,平塗色塊和速度線
兩個模型都收到的關鍵幀。平塗色塊、硬邊陰影,以及等待標題卡的空白左側三分之一。
步驟 2:MiniMax H3 圖片轉影片,所有設定調到最高
輸入相同的圖片,輸出 2K。我這裡只將 H3 限制在 8 秒,以便與 Veo 的上限匹配。這不是 H3 的限制,步驟 4 會解除上限。
Plain1賽璐珞著色2D動畫,手工描線線條粗細一致,平塗色塊,無3D陰影。在前鋒的臉上停留一拍, 2然後一個激烈的橫搖鏡頭跟著他踢出的球,橫搖讓畫面模糊成拖曳的作畫張力運動軌跡。 3在衝擊瞬間有一幀完全靜默。在最後兩秒內,一個粗體白色日文標題文字「ラストホイッスル」 4強勢切入畫面的左側三分之一處,並穩定停留,沒有變形、沒有閃爍、沒有漂移。 5前鋒用日文喊出一句台詞:「まだ終わってない!」 6音訊:體育場的喧囂聲逐漸增強,一次清脆的擊球衝擊聲,在標題卡出現時伴隨一聲低沉的和太鼓聲。
設定:模型 minimax/h3/image-to-video,resolution: 2K,duration: 8,ratio: adaptive(圖片轉影片會從你的輸入圖片中取得畫面形狀),image = 步驟 1 的輸出。
一個警告:如果你改用文字轉影片,請明確寫出 ratio: 16:9。預設值是 1:1,它會很樂意給你一個正方形動畫片段。

Atlas Cloud 上的 MiniMax H3 圖片轉影片工作區,顯示「最後哨音」提示詞、已載入的關鍵幀,以及輸出面板中的完成片段
Atlas Cloud 上的 MiniMax H3 圖片轉影片:左側載入了步驟 1 的關鍵幀,右側正在播放完成的片段。
步驟 3: Veo 3.1 圖片轉影片,手動開啟音訊
提示詞完全相同,一個字都不差。改變任何一個形容詞,它就不再是比較了。不同的是 Veo 提供而 H3 沒有的額外欄位。
negative_prompt,對於 2D 動畫來說,這是這個列表中單一最有用的控制項:
Plain13D渲染,CGI,塑膠光影,寫實皮膚,真人影片,動態模糊湯,扭曲文字,亂碼文字,多餘手指,字幕條
設定:模型 google/veo3.1/image-to-video,resolution: 1080p(請修改,預設是 720p),duration: 8(這是上限),aspect_ratio: 16:9,generate_audio: true(API 預設是 false,這是無聲片段的陷阱),seed: 20260807,image = 相同的步驟 1 輸出。

Atlas Cloud 上的 Veo 3.1 圖片轉影片工作區,顯示已啟用 Generate Audio、已載入動畫關鍵幀,以及輸出面板中的完成片段
Atlas Cloud 上的 Veo 3.1 圖片轉影片,已開啟 Generate Audio,右側是完成的片段。
步驟 4:在五個動畫特定面向評分
這裡不需要生成任何東西。只需要觀察動畫真正會出問題的地方。兩個片段都嵌在這篇文章的上方,所以你可以自己評分,而不是只聽我說的。

兩個片段最後一幀的並排比較,左邊是 MiniMax H3 的清晰日文標題文字,右邊是 Veo 3.1 的亂碼垂直字元
每個片段的最後一幀。左邊,H3 寫出了 ラストホイッスル,全部八個片假名都正確且穩定。右邊,Veo 3.1 寫出了三個字元,既不是要求的詞,也無法組成一個詞。
標題卡是決定勝負的關鍵,而且差距很明顯。H3 精確地渲染了要求的片假名,邊緣銳利且穩定,疊加在球門區域的拖曳橫搖畫面上。Veo 3.1 則產生了一個由三個字元組成的垂直堆疊,既不是要求的詞,也不是一個詞。在同一個畫面中,它還讓角色離開了鏡頭,並讓背景逐漸滑向半寫實的體育場照片,儘管 photorealistic skin 和 3D render 就在負面提示詞中。
表 3:決定動畫片段的五個面向,來自這兩次運行
| 面向 | MiniMax H3 | Veo 3.1 |
|---|---|---|
| 角色與關鍵幀的連續性 | 在完整 8 秒內保持了完全相同的臉部、頭髮和球衣 | 在新的廣角鏡頭中重新繪製了角色,造型正確但屬於不同的繪圖 |
| 線條粗細和平塗賽璐珞陰影 | 保持不變,沒有滑向 3D | 在中景鏡頭中保持,但到最後滑向了照片級別的體育場背景 |
| 日文標題卡 | ラストホイッスル 正確渲染且穩定停留 | 三個字元,不是要求的詞,不是一個詞 |
| 輸出的音訊軌道 | 32 kHz 立體聲,完全符合模型卡所述 | 48 kHz 立體聲,只因為我手動設定了 generate_audio |
| 橫搖鏡頭和作畫張力拖曳 | 執行為拖曳的橫搖並進入標題 | 被替換成一個硬切到新的設定 |
最後一行是截至目前對 H3 最公開的批評,也正是我為什麼把這個寫進兩個提示詞的原因。在首日的 ComfyUI 討論串中,使用者 fwip 抱怨即使是官方示範提示詞也被忽略了:「一個從屋頂頂進行的激烈橫搖,將漂浮的文字連同運動痕跡一起抹去。而影片根本沒有執行任何那個轉場,它只是用一個剪接取代了它。」
在這次運行中,是 Veo 把橫搖換成了剪接,而 H3 執行了拖曳。一次運行不能當作定論,我不會說不是這樣。但這確實表示這個批評不是 H3 特有的:橫搖鏡頭是這次測試中兩邊最不可靠的指令。如果你的分鏡腳本依賴橫搖,請繞過它而不是依賴它。
步驟 5:Veo 3.1 結構上無法輸出的 4:3 復古 OVA 片段
這不是品質偏好。這是一道牆。Veo 的 aspect_ratio 枚舉值只有兩個,而且都不是 4:3;它的 duration 枚舉值也沒有 12。90 年代 OVA 的風格根本無法實現。
Plain1一個1990年代OVA動畫片段,4:3全畫面。手繪背景美術,可見筆刷紋理,賽璐珞角色帶有粗細不均的濃墨線條, 2照明燈周圍有強烈的光暈效果,16mm膠卷顆粒和微弱的畫格晃動。同一個紅髮前鋒,穿著白色海軍藍9號球衣, 3從一個濕透的球場走下來,人群噪音逐漸消退成單一的鈴聲。鏡頭緩慢推近他的臉。他用日文輕聲說: 4「次は、勝つ」。復古色調:柔和墨綠、灰塵琥珀、深紅褐色陰影。音訊:遠處的雨聲、孤獨的類比合成器音墊、 5在遠方傳來的一聲帶有大量殘響的哨音。
設定:模型 minimax/h3/text-to-video,resolution: 2K,duration: 12,ratio: 4:3。記得手動設定這個比例,因為預設值不是它。

Atlas Cloud 上的 MiniMax H3 文字轉影片工作區,顯示已輸入的 OVA 提示詞,以及輸出面板中完成的復古片段
Atlas Cloud 上的 MiniMax H3 文字轉影片,已輸入 OVA 提示詞,片段已完成。完全坦白:這次特定的運行將 Aspect Ratio 留在 16:9,Duration 留在 8,所以你在右側看到的是寬螢幕的短版。下面的 4:3 十二秒片段是透過 API 呼叫明確設定 ratio: 4:3 和 duration: 12 產生的。

4:3 復古 OVA 片段:同一個前鋒以 90 年代動畫風格從濕透的球場走下來
H3 文字轉影片,4:3,12 秒。輸出的檔案是 1920x1440,這是精確的 4:3 像素,帶有 32 kHz 立體聲軌。此處以降低幀率的無聲 GIF 顯示,以保持頁面輕量。使用 Atlas Cloud 上的 minimax/h3/text-to-video 生成。
步驟 6:九張參考圖片,一個角色,四個鏡頭
跨鏡頭的角色一致性是 AI 動畫中最困難的問題,而解決方案是依靠參考素材的數量。首先建立素材包:使用步驟 1 的提示詞,但將構圖改為正面、四分之三側面、完全側面、背面、大笑、咬牙、全身站姿、球衣細節和球鞋細節。共九張圖片,總成本約八美分。

同一個原創前鋒角色的四個角度,作為參考素材包生成,排列成 2x2 網格
九個參考角度中的四個。H3 在一個參考素材包中最多可接受九張圖片,而且還可加上影片和音訊參考素材。
Plain1賽璐珞著色2D動畫,手工描線線條粗細一致,平塗色塊,無3D陰影。在所有鏡頭中保持參考的前鋒的臉部、 2髮型輪廓和9號球衣完全一致。一個連續鏡頭中的四個片段:(1) 低角度推近他的球鞋踩在草皮上, 3(2) 橫搖向上到他的眼睛的緊密特寫,(3) 廣角鏡頭顯示他衝過三名繪製成模糊剪影的後衛, 4(4) 凍結在半空中頭槌的瞬間,速度線向外爆發。音訊:人群喧囂、呼吸聲、球鞋踩草皮的聲音、 5在凍結瞬間的一聲和太鼓擊打。
設定:模型 minimax/h3/reference-to-video,refers = 你的圖片,帶有 type: image,resolution: 2K,duration: 8 或更高,ratio: adaptive 或 16:9。
Veo 3.1 的等效設定無法在這些設定下運行,而且你不需要嘗試就知道原因。它的參考端點最多接受三張圖片,而且選擇這個端點會讓 duration 縮減為唯一的合法值 8。九張圖片的素材包和 10 秒的鏡頭都超出了範圍。

Atlas Cloud 上的 MiniMax H3 參考素材轉影片工作區,顯示參考素材計數器為 4/9,以及輸出面板中的第一個片段
Atlas Cloud 上的 MiniMax H3 參考素材轉影片。計數器顯示 Reference Materials (4/9),下方有 MAX:9,這是介面中的上限,而不是規格表的說法。輸出是第一個片段,低角度推近球鞋。
另外四個值得進行的 MiniMax H3 動畫影片生成器測試
「最後哨音」的鏡頭只測試了其中四個差異。以下這四個則測試了其餘部分。所有測試都在 H3 上運行;備註會說明 Veo 3.1 能否匹配那些測試。
- 超寬螢幕作畫打鬥,
21:9,10 秒。 Veo 完全無法輸出 21:9。
Plain1賽璐珞著色2D動畫動作,粗細漸變的墨線,平塗色塊,硬邊陰影,無3D陰影。兩個原創蒙面決鬥者 2在黃昏的風吹寺廟屋頂上。刀劍碰撞,畫面震動,兩名戰士在爆發的手繪衝擊格和放射狀速度線中分開。 3鏡頭:低角度推近,然後橫向跟拍,然後快速切換到夕陽背景下的一個廣角剪影。音訊:兩次尖銳的 4金屬碰撞聲、布料撕裂聲、在最後凍結畫面上的一聲低沉和太鼓擊打,沒有音樂。
- 節拍同步的 AMV 片段,參考素材轉影片並帶有音訊參考。 H3 最多可接受三段音訊片段作為參考輸入。Veo 3.1 完全沒有音訊輸入,只有音訊輸出。
Plain1賽璐珞著色2D動畫蒙太奇,與參考音訊軌對齊。五個短節拍:窗戶上的雨、手緊繃繃帶、 2城市天際線從火車窗外閃過、起跑衝刺、凍結在伸出的手上。每個片段都精確落在參考音訊的 3一個強拍上。平塗色塊,濃墨線條,高對比夜間色調,深靛藍和霓虹洋紅。
- 兩句日文對話場景,12 秒。 這是嘴型同步的壓力測試,而且 12 秒已經超出 Veo 的範圍。
Plain1賽璐珞著色2D動畫,平塗色塊,無3D陰影。兩個原創角色在黃金時段的屋頂上,採取正反打鏡頭。 2第一個用日文說:「本当に行くの?」。第二個半笑著用日文回答:「もう決めた」。 3嘴巴與每個音節匹配。溫暖邊緣光,長長的影子,頭髮中輕柔的風。音訊:兩個不同的日文聲音, 4遠處的車流聲,一聲蟬鳴。
- 直式少年漫畫短片,
9:16,8 秒。 兩個模型都能做直式,所以這是唯一一個可以實際 A/B 測試而不是假設的地方。
Plain1賽璐珞著色2D動畫,直式構圖。一個原創青少年跑者以慢動作衝破紙製橫幅,然後畫面瞬間回到 2全速,她在體育場直道上加速。速度線,平塗色塊,硬邊陰影,大膽的圖形化天空。鏡頭:低角度 3跟拍鏡頭,然後向上橫搖到她的臉。音訊:橫幅撕裂聲、人群湧動聲、一次屏住呼吸然後釋放。
如果你想要這些提示詞背後的語法,MiniMax H3 提示詞指南 比我這裡更深入地探討了 H3 如何解析鏡頭和音訊指令。
60 秒動畫開場在 MiniMax H3 與 Veo 3.1 上的成本比較
標準動畫 OP 大約是 90 秒。假設為八個 8 秒的鏡頭,共 64 秒的完成影片,加上每個鏡頭一個關鍵幀,每個 $0.009 美元。
有一個你需要知道的真實價格差異,我不想隱瞞。Atlas Cloud 目錄列出 MiniMax H3 為每秒 $0.10 美元,而模型說明文件則細分為 2K 每秒 $0.14 美元,768P 每秒 $0.10 美元。Veo 3.1 列出為每秒 $0.20 美元,而其說明文件則區分為含音訊每秒 $0.40 美元,不含音訊每秒 $0.20 美元。
我截圖中的執行按鈕證實了這一點。H3 參考素材轉影片,8 秒 2K,報價 Run $1.12,這正是每秒 $0.14 美元。Veo 3.1 圖片轉影片,8 秒 1080p 含音訊,報價 Run $3.2,這正是每秒 $0.40 美元。所以說明文件的費率才是實際收費的,而目錄標題是入門級。我仍然在下面列出了兩種讀數。這些是 2026 年 8 月的牌價。
表 4:八個 8 秒鏡頭,包含關鍵幀
| 設定 | 影片成本(目錄費率) | 影片成本(說明文件費率) | 關鍵幀成本 | 總成本範圍 |
|---|---|---|---|---|
| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 到 $9.03 |
| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1, 1080p 含音訊 | $12.80 | $25.60 | $0.07 | $12.87 到 $25.67 |
| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 |
價格取自表 1 中連結的 Atlas Cloud 模型頁面,2026 年 8 月。目前這四個都沒有折扣。
這張表沒有包含兩件事,而且兩者都比每秒費率影響更大。
重試。 沒有人會發布動畫鏡頭的第一次生成。無論你假設的倍數是多少,套用到兩邊,差距會以相同比例擴大。
實際時間,而這個方向是相反的。 在 2026 年 8 月 7 日從頭到尾計時:H3 在 2K 下生成 8 秒花了 447 秒,大約 7.5 分鐘。H3 文字轉影片在 2K 下生成 12 秒花了 334 秒。Veo 3.1 在 1080p 下生成 8 秒含音訊花了 152 秒,不到三分鐘。Veo 在首次生成上大約快了三倍,如果你在凌晨兩點迭代一個鏡頭,這就值真金白銀。佇列會變化,所以請將這些視為一個下午的快照,而不是規格。但任何引用「2 到 3 分鐘」來描述 H3 在 2K 下的人,都是在引用說明文件,而不是佇列。2K 與 768P 的比較分析 涵蓋了何時較高階層級值得額外花費幾分鐘。
動畫風格、致敬,以及你實際上可以發布什麼
這篇文章中的所有內容都是風格和致敬。一個原創角色、一套原創球衣、一個原創標題。沒有生成或要求任何官方動畫角色,也沒有使用任何真實足球員的名字或肖像。世界盃趨勢被引用為一種格式,因為這才是它有用的地方。
這個區別並非裝飾。如果你正在商業上製作動畫風格內容,「以 90 年代 OVA 的風格」和「這個特定節目中的這個特定角色」是不同的法律客體,而且只有其中一個是可行的業務。
關於開放權重:H3 確實可以下載,而且人們在第一天就運行了它。一位評論者報告說,在配備 16GB 記憶體的 4070 Ti Super 上,生成一個 10 秒 480p 片段需要 10 分鐘,其他人則回報在 5080 上需要 3 分鐘,在 RTX 6000 Pro 上需要 68 秒。但自架推論運行在 768 短邊上;產生 2K 的 Context-IR 和 Regenerate-2K 階段仍然在 API 端。
授權有一個真正的陷阱。社群授權目前不涵蓋歐盟、英國、南韓或美國,理由是這些地區「目前正在制定或執行與 AI 相關的法規」。一個正式的授權申請管道是開放的,一位 HN 評論者將其總結為「你只需要做出小指承諾你不會讓迪士尼生氣,他們就會寄給你授權」。有趣,但這也正是如果你身處這四個地區之一時,你不能跳過的合規步驟。開放權重文章 有完整的地區列表。
常見問題
MiniMax H3 與 Veo 3.1 相比,是一個好的動畫影片生成器嗎?
對於大多數動畫工作來說,H3 更好,而且主要是出於與渲染無關的原因。它支援 4 到 15 秒,而 Veo 只有 4、6 或 8 秒;它提供六種畫面比例,包括 4:3 和 21:9,而 Veo 只有兩種;它將日文列為 11 種原生穩定對話語言之一;它可以接受九張參考圖片,而 Veo 只有三張。Veo 3.1 在一個特定情況下勝出:當你需要 seed 來進行可重現的重新生成,或者需要 negative_prompt 來防止鏡頭滑向 3D 渲染陰影時。H3 沒有這兩個參數。如果你的工作流程依賴其中任何一個,這是一個真正的理由留在 Veo。
Veo 3.1 可以生成 4:3 或 15 秒的動畫片段嗎?
不行,而且這不是風格問題。Veo 3.1 的 aspect_ratio 枚舉值正好包含 16:9 和 9:16,其 duration 枚舉值正好包含 4、6 和 8。沒有 4:3 的值可以選擇,也沒有辦法請求 12 或 15 秒。如果你的參考是 90 年代電視動畫或 OVA,那麼這個構圖在 Veo 上是無法實現的,而在 H3 上則可以。
為什麼我的 Veo 3.1 動畫片段回傳時是無聲的?
因為 generate_audio 在 API 上預設為 false。工作區的切換開關通常已經開啟,所以這只會影響直接呼叫 API 的人。請明確設定 generate_audio: true。同時,也請設定 resolution,因為它預設為 720p,而不是你可能想要的 1080p 或 4k。
MiniMax H3 是否支援動畫的日文對話和嘴型同步?
是的。模型卡列出了 11 種具有穩定對話支援的語言:阿拉伯文、中文、英文、法文、德文、義大利文、日文、韓文、葡萄牙文、俄文和西班牙文。音訊是與畫面同時生成的,32 kHz 立體聲,而不是事後配音,這就是為什麼嘴型時間在整句台詞中都能保持,而不只是前幾個音節。請直接將日文台詞以日文寫入提示詞中。
我可以使用多少張參考圖片來保持動畫角色的一致性?
MiniMax H3 最多接受 9 張圖片、最多 3 部影片和最多 3 段音訊,所有類型合計最多 12 個檔案。Veo 3.1 的參考素材轉影片端點接受 1 到 3 張圖片,而且選擇它會讓 duration 縮減為只有 8 這個合法值。對於一個系列中的重複出現動畫角色來說,這個差異就是整個比賽的關鍵。
MiniMax H3 有開放權重,所以我可以在本地免費運行我的動畫工作流程嗎?
你可以下載並運行它,但有三個注意事項。自架推論在 768 短邊上運行,而產生 2K 輸出的 Context-IR 和 Regenerate-2K 階段仍然在 API 端。真實世界的本地速度因顯卡而異:根據首日 ComfyUI 討論串,在 4070 Ti Super 上生成一個 10 秒 480p 片段大約需要 10 分鐘,在 5080 上大約需要 3 分鐘,在 RTX 6000 Pro 上大約需要 68 秒。此外,社群授權目前不涵蓋歐盟、英國、南韓或美國,所以如果你身處其中一個地區,你需要取得正式授權才能商業使用。






