一段8秒的Veo 3.1片段,價格是同樣8秒MiniMax H3的三倍。在Artificial Analysis的盲投票排行榜上,它落後145 Elo。文章到這裡就該結束了。
但Veo 3.1的API預設關閉了音訊生成。參數是 generate_audio,其架構預設值為 false,而且回應中沒有任何資訊告訴你片段是無聲的。MiniMax H3沒有這樣的開關,因為H3在同一次處理中同時生成畫面和32kHz立體聲,而且一直如此。因此,大量流傳的「Veo看起來更好」的評論,都是建立在將一個靜音的Google片段,放在一個自帶音軌的中國模型旁邊。
我想知道這145分的差距實際上是什麼樣子。於是我拿Veo目前最受歡迎的格式——玻璃水果ASMR剪輯——寫了一個提示詞,並在兩個模型上以各自能達到的最高設定來運行。音訊開啟。沒有絲毫妥協。
然後我繼續測試,直到找出Google仍然佔優勢的三個地方,因為這些優勢確實存在,而且沒有人在這些比較文章中提及。
關鍵要點
- 在Artificial Analysis的文字轉影片(含音訊)項目中,MiniMax H3得分1,238 Elo,Veo 3.1為1,093 Elo。在盲投票中差距為145分(快照日期:2026-08-06)。
- Veo 3.1的
generate_audio參數在API架構中預設為false。如果你呼叫API但從未設定它,你就是在拿一個靜音的Veo片段,與預設輸出立體聲的H3片段進行比較。- H3接受4到15秒之間的任何整數秒數。Veo 3.1僅接受4、6或8秒。這是一個結構性的上限,而非設定問題。
- Veo 3.1根本沒有出現在Artificial Analysis的影片編輯排行榜上。H3在該排行榜上位列第一。
- Veo 3.1在4K輸出、以及使用
seed和negative_prompt的可重現性方面仍然勝出。此外,如果720p對你來說足夠,Veo 3.1 Lite確實比H3提供的任何方案都便宜。
MiniMax H3 vs Veo 3.1,一個提示詞,三種結果連續對比
一個提示詞,三種結果,依序為:MiniMax H3 2K、Veo 3.1 1080p(明確開啟音訊)、Veo 3.1 Lite 720p。每個片段都保留其原生音軌,請開啟聲音。觀看每個片段的最後一秒,以及最便宜的模型對其最終畫格邊緣的處理方式。

一個微距電影場景,水晶玻璃西瓜放在濕黑石板上,兩個監看螢幕播放著相同的切片畫面_本文實際執行的設定:一個ASMR產品廣告,兩個模型,一個API金鑰。使用 openai/gpt-image-2/text-to-image 生成。_
為何MiniMax H3 vs Veo 3.1突然成為唯一值得進行的比較
MiniMax H3於2026年7月問世,並做到了排行榜上其他模型未曾做到的事。它在幾週內就進入了Artificial Analysis所有三個影片競技場的前三名,並且是唯一一個接近頂尖的開源權重參賽者。
以下是這兩個模型實際上的排名,資料直接從即時排行榜擷取,而非引用新聞稿(Artificial Analysis,2026年8月):
表A:Artificial Analysis影片競技場,2026-08-06快照
| 排行榜 | MiniMax H3 | Veo 3.1 | Veo 3.1 Fast | Veo 3.1 Lite |
|---|---|---|---|---|
| 文字轉影片(含音訊) | 1,238 (排名帶 1-2, 6,830 票) | 1,093 (排名帶 11-15, 8,536 票) | 1,091 | 1,089 |
| 圖片轉影片 | 1,189 (排名帶 1-3) | 1,084 (排名帶 8-12) | 1,077 | 1,065 |
| 影片編輯 | 1,132 (排名 1) | 未上榜 | 未上榜 | 未上榜 |
| 供應商目錄價格,每分鐘1080p | $7.80 | $24.00 | $9.00 | $4.80 |
| 開源權重 | 是 | 否 | 否 | 否 |
該表格中有三件事值得更多關注。
145分的差距是在音訊排行榜上。 在文字轉影片(含音訊)項目中,僅有Gemini Omni Flash(1,243)領先H3,且兩者處於相同的統計誤差範圍內。Veo 3.1排名第十一。投票者在同時聽過兩個片段後,以壓倒性優勢選擇了H3。
Veo 3.1並未出現在影片編輯排行榜上。 該排行榜上有八個模型,H3排名第一,領先Gemini Omni Flash九分。Google並非輸了這場比較,而是根本沒有參賽。如果你的工作流程是「生成,然後修改畫面中的某個元素」,那麼這個區別對你來說沒有幫助。
MiniMax自己的公告誇大了一個數字,所以請不要重複引用。 官方說法指出H3在編輯排行榜上領先第二名93分。第二名是Gemini Omni Flash(1,123分),僅落後H3九分。93分的差距是相對於排名第五的Dreamina Seedance 2.0(1,037分)。這兩個數字都是真實的,只是它們屬於不同的行。
為何大多數的正面對決都搞錯了
三種常見的錯誤模式,依出現頻率高低排列:
- 靜音的Veo。
generate_audio在Veo 3.1的API架構中預設為false。從未設定此參數的開發者會得到一個靜音片段,然後用它來與H3的立體聲混音進行比較。這不是模型比較,這是設定錯誤。值得注意:Atlas Cloud的網頁版遊樂場會為你預先啟用此開關,因此這個陷阱主要影響直接呼叫API的開發者,而這正是大多數發布基準測試的人。 - 解析度不匹配。 H3的API預設解析度是
2K,但許多測試為了速度而將其設定為768P,然後將結果與1080p的Veo畫面放在一起比較。 - 為了公平而將H3限制在8秒。 這並不公平,它為了讓表格看起來整齊,而丟棄了H3將近一半的時長範圍。
為了保持誠實,H3自身的弱點也是真實存在的:塞滿參考素材欄位往往會降低提示詞的遵循度,而非提高;其2K等級確實很慢;而且MiniMax本身並未將其定位為電影或動畫模型。在此次運作中,H3也傾向於風格化,將提示詞解讀為拋光切割水晶的產品攝影,而非Veo所產生的超現實物體。
MiniMax H3 vs Veo 3.1:規格、音訊行為與每秒的價格
這裡的方法刻意保持簡單:一個提示詞,三個端點,一個API金鑰,無任何編輯。兩個家族模型並排託管在 Atlas Cloud 上,這是唯一能在同一個提示詞下進行比較,而無需兩個獨立計費帳戶和兩種不同參數語法的方式。這就是全部的產品提及。模型本身才是重點。
表B:能力矩陣,來自即時API架構
| MiniMax H3 | Veo 3.1 | Veo 3.1 Lite | |
|---|---|---|---|
| 時長 | 任何整數秒,4到15 | 4、6或8 | 4、6或8 (1080p強制為8) |
| 解析度 | 768P 或 2K | 720p, 1080p, 4k | 720p, 1080p |
| 畫面比例 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 僅16:9或9:16 | 僅16:9或9:16 |
| 音訊 | 原生,始終開啟,32kHz立體聲,無開關,無附加費用 | generate_audio,預設值 false | 始終開啟,無開關 |
| 參考輸入 | refers[]:可混合圖片、影片和音訊,4到15秒 | images: 1到3,時長鎖定為8 | 無 |
| seed | 無 | 有 | 有 |
| negative_prompt | 無 | 有 | 無 |
| 開源權重 | 是,Hugging Face上 | 否 | 否 |
| Atlas Cloud 價格,每秒 | 2K為$0.14,768P為$0.10 | 靜音$0.20,含音訊$0.40 | $0.05,含音訊 |
將最後兩行放在一起看,就能得到整個比較中最鮮明的一條界線:
開啟音訊的MiniMax H3,比關閉音訊的Veo 3.1更便宜。 每秒$0.14對比$0.20。
Google自己的價格表也確認了這個上限。根據Google的預設費率,Veo 3.1在720p和1080p(含音訊)的價格為每秒$0.40,4K則為$0.60(Google Gemini API 文件,2026年8月)。Atlas將其拆分為靜音層($0.20)和音訊層($0.40),因此當你將 generate_audio 設為 true 時,每秒成本就會翻倍。H3沒有類似的機制,因為根本沒有什麼需要開啟。
在進行測試之前,還有一個不對稱性值得指出:H3的 resolution 和 duration 在其三個端點上都是必填欄位,其文字轉影片的 ratio 預設值為 1:1。只發送一個提示詞,你會得到一個方形影片。而Veo則會愉快地預設出一個合理的16:9 720p影片。
MiniMax H3 vs Veo 3.1,相同提示詞,兩款模型:完整測試
三個模型使用同一個提示詞,一個字都沒改。這個提示詞設計來同時測試四個方面:Veo擅長的超現實玻璃物理學;與破碎動作同步的原生擬音;一句人類旁白;以及在最後一秒淡入的下三分之一文字卡,這是H3宣稱有優勢的地方。
請完全照抄以下內容。
Plain1極致微距ASMR鏡頭,16:9。一個由透明水晶玻璃雕刻而成的超寫實西瓜,放在一塊濕黑石板上。一把鏡面拋光的主廚刀向下壓,以一個緩慢的連續動作乾淨地切開它;玻璃分開時發出清脆的碎裂聲,並噴濺出細小的透明碎片,在石板上彈跳散開。左側是冷藍色邊緣光,後方有一盞暖色實用燈。100mm微距鏡頭,淺景深,緩慢推進。聲音:刀刃下清脆的玻璃破裂聲,碎片敲擊石板的滴答聲,低沉的環境音。一個平靜的女聲說:「每次切割,都乾淨俐落。」在最後一秒,純白色無襯線字體在畫面下方三分之一處淡入,顯示「CUT CLEAN」。
步驟 1:MiniMax H3 文字轉影片,2K解析度
打開 MiniMax H3 Text-to-Video,貼上提示詞,然後設定三個關鍵欄位:
- 解析度:
2K。 必填欄位。這是最高等級,在16:9請求下輸出2560x1440。 - 時長:
8。 必填欄位。與Veo的上限匹配,以便進行同規格比較。 - 比例:
16:9。 這是人們常忽略的設定。預設值為1:1,而文字轉影片會直接拒絕adaptive並回傳400錯誤。不做修改就會得到一個方形影片。
沒有種子欄位,也沒有負面提示詞欄位。你能得到的就是取樣器給出的結果,唯一的控制項就是提示詞。
費用:8秒 * $0.14 = $1.12,含音訊。也要有耐心的預算:這個作業總共花了455秒。我嘗試了四次想截取這個步驟完成的遊樂場畫面,但2K的佇列每次都比我瀏覽器會話的時間還長,所以這裡直接使用API的輸出,100%無重新取樣。

MiniMax H3 2K輸出的100%裁切,顯示清晰的下三分之一文字和解析的玻璃切面_MiniMax H3,2K,8秒,16:9,從輸出的2560x1440畫格中裁切為1:1。文字邊緣清晰,石板上的個別玻璃碎片保持其切面,這是排行榜投票所依據的等級。_
步驟 2:Veo 3.1 文字轉影片,開啟音訊
打開 Veo 3.1 Text-to-Video 並貼上相同的提示詞。設定:
- 解析度:
1080p。 Veo的列舉也提供4k,這是H3完全無法比擬的。順便一提:720p和1080p的計費費率相同,因此選擇1080p是免費的升級。 - 時長:
8。 最大值。 - 畫面比例:
16:9。 這裡只有16:9和9:16可選。 generate_audio:true。 這是網路世界跳過的步驟。架構預設值為false,而且回傳一個靜音片段看起來不像錯誤。negative_prompt:模糊、扭曲的文字、多餘的手指、文字上的動態模糊。H3無法提供的額外控制。seed:12345。 H3同樣沒有此功能。Google提供了一個可重複性的控制碼。
費用:8秒 * $0.40 = $3.20,含音訊。將 generate_audio 關閉,相同的片段價格為$1.60且無聲。

Atlas Cloud上的Veo 3.1文字轉影片遊樂場,開啟了「Generate Audio」開關,完成的片段在輸出面板中播放_Veo 3.1,執行完成。「Generate Audio」開關已開啟,「Run」按鈕顯示$3.2,這是8秒鐘的音訊費率。此截圖使用頁面預設的720p,其計費與1080p相同;本文中的1080p片段是透過API從相同提示詞生成的。請注意兩個空白欄位「Negative Prompt」和「Seed」,這是MiniMax H3沒有對應功能的。_
步驟 3:Veo 3.1 Lite,經濟實惠的選擇
打開 Veo 3.1 Lite Text-to-Video,再次使用相同的提示詞。設定:720p,8 秒,16:9,seed 12345。
請注意此頁面上缺少什麼:沒有音訊開關,因為Lite總是生成音訊。也要注意其架構中的一個陷阱:Lite的1080p會強制時長為8秒,因此不存在4秒的1080p Lite片段。
費用:8秒 * $0.05 = $0.40。這是本文中所有包含聲音的完成片段中最便宜的,H3也包括在內。

Atlas Cloud上的Veo 3.1 Lite遊樂場,設定為720p,沒有音訊切換開關,完成的片段在輸出面板中_Veo 3.1 Lite 720p。此頁面上完全沒有_ generate_audio 控制項,這就是重點。
步驟 4:在五個軸線上為MiniMax H3 vs Veo 3.1評分
此步驟無模型呼叫,無成本。精確來說,這是每個模型的一次輸出,首次嘗試,無重新生成。這是三個片段的同規格比較,而非成功率研究。
表D:實際回傳的結果,每次一個片段
| 軸線 | MiniMax H3 2K | Veo 3.1 1080p | Veo 3.1 Lite 720p | 決定因素 |
|---|---|---|---|---|
| 玻璃物理學與真實感 | 乾淨但風格化 | 最佳 | 中等 | Veo產生了可信的玻璃物體,具有真實的剪切平面和石板上的灰塵。H3渲染了一個多面切割的水晶裝飾品,更接近產品CGI而非照片中的物體。 |
| 字面理解提示詞 | 中等 | 中等 | 物體方面最佳 | 只有Lite賦予了玻璃西瓜綠色的外皮和深色的籽。H3和Veo都忽略了西瓜的提示,生成了一個通用的水晶球體。 |
| 螢幕上的文字 | 最佳 | 良好 | 差 | 三個模型都渲染出了可讀的「CUT CLEAN」,這已經比聽起來更罕見。只有H3在2K下按要求在最後一秒將其置於畫面下方三分之一處。Lite將其放大到畫面中央並提前出現。 |
| 整體提示詞遵循度 | 最佳 | 中等 | 最差 | 提示詞要求極致微距,無人物。H3保持了乾淨。Veo添加了一隻未經要求的手。Lite則在最終畫面的兩側邊緣憑空生成了兩個穿著相同、剪影相同的女人。 |
| 首次嘗試即可使用 | 是 | 是 | 否 | 上述Lite的畫面在後期製作中無法修復。 |

MiniMax H3和Veo 3.1片段中,下三分之一文字淡入時刻的匹配畫面
兩個片段中的相同節拍,「CUT CLEAN」淡入的畫面。左邊是MiniMax H3 2K,右邊是Veo 3.1 1080p(含音訊)。Veo的玻璃更接近被拍攝的物體;H3的文字更清晰且位置正確。
音訊軸線需要聆聽判斷,因此上述的影片片段可供你評判。可以量化的是:三個片段都回傳了連續的立體聲音軌,無超過0.6秒的空白區域。H3提供32kHz立體聲,混音較大聲,平均電平接近-18 dB,峰值觸及0 dBFS。Veo 3.1提供48kHz立體聲,平均電平較保守,約為-31 dB。H3的音軌大約大聲13 dB,聽起來像是模型直接輸出的更完成的混音,但也為你後續調整留下了更少的動態餘量。
步驟 5:Veo 3.1 結構上無法做到的15秒片段
與步驟1相同的頁面,相同的提示詞,更改兩個欄位:時長 15,解析度 768P,比例仍為 16:9。沒有新的截圖,因為是同一個遊樂場。
這個步驟沒有Veo的對應方案。Veo 3.1的 duration 列舉在其所有端點上都是 [4, 6, 8],沒有任何計劃、等級或旗標可以提高它。Google對於想要更長時長的官方答案是使用一個獨立的影片擴展功能(Google video generation docs,2026年8月),這意味著需要生成8秒的區塊然後拼接,這就需要匹配接縫處的色調和音訊。H3則提供一個連續的單次拍攝和一個連續的音訊底層。
費用:15秒 * $0.10 = $1.50,這比一個8秒的Veo 3.1含音訊片段的一半價格還低。
MiniMax H3,768P,15秒,一個連續不間斷的拍攝,帶有一條連續不間斷的音訊底層。請開啟聲音。Veo 3.1沒有任何設定可以產生此檔案。請注意H3在刀片上憑空創造的雕刻文字:指定的文字它渲染得很清晰,但憑空創造的文字則是亂碼。
關於這個片段有兩個誠實的說明。它運行了485秒,是本文中最慢的作業,其音訊底層明顯比8秒版本稀疏,在3秒和11秒標記附近有實際的空白。更長的時長是可行的,但更長並非沒有代價。
四個教程步驟的總花費:$1.12 + $3.20 + $0.40 + $1.50 = $6.22,每個模型一次嘗試,無重新生成。下一節中使用的額外768P 8秒版本增加了$0.80,而遊樂場的截圖則是在此基礎上另外的付費運作。
MiniMax H3 vs Veo 3.1:H3超越Google限制之處
H3這邊有四項功能,它們不是Veo功能的較慢或較便宜版本,而是Veo根本沒有提供的功能。
21:9 寬銀幕。 H3的 ratio 列舉除了常見的16:9和9:16之外,還包括 21:9、4:3、1:1 和 3:4。Veo 3.1和Lite都只提供16:9或9:16。如果你要製作一個寬銀幕格式的預告片,其中一個模型可以原生取景,另一個則需要裁切。
不僅僅是圖片的參考素材。 H3的 reference-to-video 端點接受一個 refers[] 陣列,可以混合圖片、影片和音訊參考來錨定視覺風格,並且在這樣做時仍保持完整的4到15秒範圍。Veo 3.1的參考轉影片功能接受一個 images 陣列,最多3個條目,且其 duration 列舉會縮減為 [8],因此使用參考功能會將你鎖定在8秒。一個從經驗中得出的提醒:將H3的參考素材欄位塞滿,往往會使輸出偏離提示詞而非更接近,所以請逐步增加。
2K是重新渲染,而不是放大。 這個結果讓我感到驚訝,而且我沒有在任何地方看到過相關描述。在H3的文字轉影片功能上,對相同的提示詞分別運行 768P 和 2K,你得到的不是同一部電影的兩種尺寸。你得到的是兩部不同的電影。在此次運行中,768P版本將西瓜保持完整直立,後面有一根燃燒的蠟燭,並在4秒時將文字橫跨畫面中央放置。而2K版本將西瓜打破成三塊,移動了背景燈光,並如提示所述,在最後一秒將文字以小字體放置在畫面下方三分之一處。相同的提示詞,相同的比例,相同的無種子取樣器。

在MiniMax H3上,相同提示詞分別在768P和2K下運行的並排畫面,顯示了不同的場景佈置,而非相同鏡頭的兩種尺寸_相同提示詞,相同模型,相同比例,左邊是768P,右邊是2K,都在相同的時間戳記。不同的場景佈置、不同的燈光、不同的文字處理。如果你需要構圖在不同等級之間保持一致,請改用_ image-to-video 來鎖定第一幀。
永遠沒有音訊附加費用。 說得清楚一點,因為這會改變你的預算規劃:沒有任何版本的H3片段可以因為靜音而更便宜,也沒有任何版本的Veo 3.1片段可以在靜音價格下擁有聲音。
為了保持帳目清楚,以下是Google真正勝出而H3無法匹敵的三個地方:
- 4K。 Veo 3.1的解析度列舉包含
4k。H3最高僅到2K。如果客戶合約要求4K母帶,這個比較到此為止。 seed和negative_prompt。 Veo允許你調整可重複性,並明確禁止失敗模式。H3兩者都沒有。在需要重新生成一個接近成功但略有瑕疵的片段,而又不想失去整體視覺效果的場景中,這個差距會很傷。- 速度,某種程度上。 Veo 3.1的模型文件指出,一個8秒的1080p片段大約需要2到3分鐘。在此次同時提交的運行中,H3的2K版本花了455秒,Veo 3.1的1080p版本花了462秒,兩者實際上是持平的,且都遠超過其引用數字。Veo 3.1 Lite在237秒內完成,不到前兩者的一半時間。如果你需要在客戶面前即時迭代,Lite是三者中唯一跟得上速度的,這是一個真實的優勢,是每秒價格所無法體現的。
一個完成的廣告在MiniMax H3 vs Veo 3.1上的成本
每秒價格並不是你實際的花費。你實際的花費是每秒價格乘以你丟棄的片段數量。下面的30秒列應用了3:1的保留率,即每三個生成才能得到一個可用的片段,這是基於正常製作實務的工作假設,而非此次運行測量得出的結果。請將其視為一個縮放因子,而非基準。
表C:每個交付廣告的實際成本,Atlas Cloud 2026年8月定價,無任何有效折扣
| 端點與等級 | $/秒 | 一個8秒片段 | 30秒廣告,保留率3:1 | 音訊 |
|---|---|---|---|---|
| MiniMax H3, 2K | $0.14 | $1.12 | $12.60 | 始終開啟 |
| MiniMax H3, 768P | $0.10 | $0.80 | $9.00 | 始終開啟 |
| Veo 3.1, 靜音 | $0.20 | $1.60 | $18.00 | 關閉 |
| Veo 3.1, 開啟音訊 | $0.40 | $3.20 | $36.00 | 開啟 |
| Veo 3.1 Lite, 720p | $0.05 | $0.40 | $4.50 | 始終開啟 |
兩個結論,第二個結論並非我預期要寫的。
如果你需要2K、或超過8秒的時長、或16:9和9:16以外的比例、或無附加費用的原生音訊,H3在成本上以大幅優勢勝出。 H3最高等級的30秒廣告成本,大約是Veo 3.1含音訊版本的3分之1。
如果720p和8秒確實足夠,那麼Veo 3.1 Lite是這裡最便宜的選擇,而且差距巨大。 每秒$0.05的價格是H3最便宜等級的一半,音訊包含在內且無需擔心忘記開啟開關,而且速度是兩款旗艦模型的兩倍。任何告訴你H3是無條件便宜選擇的人,都沒有考慮過Lite這一行。Google也在其價格表中列出了Veo 3.1 Fast,720p的價格為每秒$0.10,儘管Atlas的目錄和其模型頁面對此等級的報價不同,因此Fast的確切數字尚不確定。
問題在於這個折扣買到了什麼。這是Lite在首次嘗試時回傳的最後一個畫面:

Veo 3.1 Lite片段的最終畫面,畫面兩側邊緣出現了兩個相同的、被憑空創造的女性剪影_Veo 3.1 Lite,最終畫面,首次嘗試。提示詞中提到了一個女聲;Lite決定讓她現身,而且還出現了兩次,以相同的剪影呈現。它也賦予了西瓜三個模型中最逼真的綠色外皮和籽,這使得這個結果令人沮喪,而非單純的糟糕。_
這就是經濟實惠等級的真實面貌。它對物體的理解比兩款旗艦模型都好,然後以一種後期無法修復的方式破壞了畫面。如果失敗率發生變化,每秒便宜並不等於每個可用片段便宜,所以如果你選擇Lite,請為重新生成預留預算,而不是假設標價就是最終成本。
開源權重、排除地區與沒人讀的部分
權重確實已經發布。Hugging Face上的 MiniMaxAI/MiniMax-H3 是一個330億參數的密集單流全能Transformer,採用BF16格式,附帶兩個現成的檢查點、完整的Qwen3-VL-32B文字編碼器和兩個自動編碼器。全部下載大約需要499 GB。它是當前的旗艦模型,而非舊版,而且在Artificial Analysis每個影片排行榜的頂尖位置中,它是唯一的開源權重參賽者。
然後你閱讀授權條款,它所做的遠比「開源權重」這個詞暗示的要多(Hugging Face,2026年8月):
- §I.5 定義了排除地區為歐盟、英國、韓國和美國。授權在全球範圍內有效,但上述地區除外。
- §V.4 比部署限制更進一步。你不得在「適用領土」之外使用、複製、修改、分發或展示這些作品或其任何輸出。
- §IV.1 要求如果你的商業產品年收入超過2000萬美元,需要事先獲得單獨的書面授權。
- §IV.2 要求你在基於其構建的商業產品的使用者介面中顯著顯示「MiniMax H3」。
MiniMax並沒有讓這個規定懸而未決。倉庫中提供了授權問答和申請表,授權條款指出公司將持續評估這些司法管轄區,並歡迎有興趣的各方提出申請。因此,準確的描述是「尚未開放,請聯繫我們」,而非「永久禁止」。在您圍繞當地權重規劃美國或歐盟產品之前,這仍然是一個需要交由法務部門處理的問題。
而當地權重並非API。自託管的H3-Base渲染的短邊為768像素;2K路徑需要通過API端的單獨重新生成階段。開源權重買到的是你控制的768p模型,而不是贏得那些投票的2K模型。
有一件事我無法確定:通過第三方API提供服務時,Veo 3.1的輸出是否帶有SynthID浮水印。請將其視為未經證實的資訊。本文中的H3檔案沒有可見的浮水印。
常見問題
MiniMax H3真的比Veo 3.1好嗎?
在含音訊的盲投票中,是的,在Artificial Analysis的文字轉影片項目中領先145 Elo,而且H3在Veo 3.1未出現的影片編輯排行榜上排名第一。它在含音訊情況下的每秒成本,也比Veo無音訊時更便宜。Veo 3.1在4K輸出以及seed加negative_prompt控制方面仍然勝出。
為什麼我的Veo 3.1影片是無聲的?
因為 generate_audio 在Veo 3.1和Veo 3.1 Fast上預設為 false。請明確將其設為 true。請注意,這會使你的每秒成本翻倍,在Atlas Cloud上從$0.20變為$0.40。MiniMax H3沒有這個參數,因為音訊是在生成畫面的同時生成的。Veo 3.1 Lite也總是生成音訊。
MiniMax H3能生成比Veo 3.1的8秒更長的片段嗎?
可以。H3接受4到15秒之間的任何整數秒數作為一個連續的單次拍攝,這兩個欄位在請求中都是必填的。Veo 3.1的時長列舉是固定的 [4, 6, 8]。要在Veo上獲得更高時長,需要生成8秒的區塊然後進行擴展或拼接,並匹配接縫處的色調和音訊。
MiniMax H3有開源權重。這是否意味著它是免費的?
並非大多數人理解的那樣。完整下載約需499 GB,自託管的H3-Base渲染的短邊為768像素,而2K需要API端的重新生成階段。社群授權條款還排除了歐盟、英國、韓國和美國,且此限制涵蓋了輸出,而不僅僅是部署,但為這些地區提供了一個正式授權管道。
對於一個完成的30秒廣告,MiniMax H3和Veo 3.1哪個更便宜?
在保留率3:1的情況下,H3的2K版本一個30秒廣告的成本約為$12.60,而Veo 3.1含音訊版本約為$36.00。但如果720p和8秒區塊是可接受的,Veo 3.1 Lite以約$4.50的價格勝過兩者。H3的成本優勢取決於你是否需要2K、更長的時長、更廣泛的畫面比例選擇或免費的音訊。
MiniMax H3能像Veo 3.1一樣生成4K嗎?
不能。H3的解析度列舉僅有 768P 和 2K。Veo 3.1的列舉包含 4k,根據Google自家定價為每秒$0.60,而Veo 3.1 Lite也明確不支援4K。如果合約要求4K母帶,那麼標準的Veo 3.1是三者中唯一能提供的。






