Seedance 2.5 現已上線 — 首發於 Atlas Cloud

MiniMax H3 與 Veo 3.1:Elo 差距達 145,且大多數比較都是在測試一個被靜音的 Veo

MiniMax H3 與 Veo 3.1,在相同提示下進行測試。H3 在 Artificial Analysis 上領先 145 Elo,Veo 的 API 預設關閉音訊,但 Veo 仍贏得三項優勢。

一段8秒的Veo 3.1片段,價格是同樣8秒MiniMax H3的三倍。在Artificial Analysis的盲投票排行榜上,它落後145 Elo。文章到這裡就該結束了。

但Veo 3.1的API預設關閉了音訊生成。參數是 generate_audio,其架構預設值為 false,而且回應中沒有任何資訊告訴你片段是無聲的。MiniMax H3沒有這樣的開關,因為H3在同一次處理中同時生成畫面和32kHz立體聲,而且一直如此。因此,大量流傳的「Veo看起來更好」的評論,都是建立在將一個靜音的Google片段,放在一個自帶音軌的中國模型旁邊。

我想知道這145分的差距實際上是什麼樣子。於是我拿Veo目前最受歡迎的格式——玻璃水果ASMR剪輯——寫了一個提示詞,並在兩個模型上以各自能達到的最高設定來運行。音訊開啟。沒有絲毫妥協。

然後我繼續測試,直到找出Google仍然佔優勢的三個地方,因為這些優勢確實存在,而且沒有人在這些比較文章中提及。

關鍵要點

  • 在Artificial Analysis的文字轉影片(含音訊)項目中,MiniMax H3得分1,238 Elo,Veo 3.1為1,093 Elo。在盲投票中差距為145分(快照日期:2026-08-06)。
  • Veo 3.1的 generate_audio 參數在API架構中預設為 false。如果你呼叫API但從未設定它,你就是在拿一個靜音的Veo片段,與預設輸出立體聲的H3片段進行比較。
  • H3接受4到15秒之間的任何整數秒數。Veo 3.1僅接受4、6或8秒。這是一個結構性的上限,而非設定問題。
  • Veo 3.1根本沒有出現在Artificial Analysis的影片編輯排行榜上。H3在該排行榜上位列第一。
  • Veo 3.1在4K輸出、以及使用 seednegative_prompt 的可重現性方面仍然勝出。此外,如果720p對你來說足夠,Veo 3.1 Lite確實比H3提供的任何方案都便宜。

MiniMax H3 vs Veo 3.1,一個提示詞,三種結果連續對比

一個提示詞,三種結果,依序為:MiniMax H3 2K、Veo 3.1 1080p(明確開啟音訊)、Veo 3.1 Lite 720p。每個片段都保留其原生音軌,請開啟聲音。觀看每個片段的最後一秒,以及最便宜的模型對其最終畫格邊緣的處理方式。

玻璃西瓜與刀,前方有兩個螢幕監看

一個微距電影場景,水晶玻璃西瓜放在濕黑石板上,兩個監看螢幕播放著相同的切片畫面_本文實際執行的設定:一個ASMR產品廣告,兩個模型,一個API金鑰。使用 openai/gpt-image-2/text-to-image 生成。_


為何MiniMax H3 vs Veo 3.1突然成為唯一值得進行的比較

MiniMax H3於2026年7月問世,並做到了排行榜上其他模型未曾做到的事。它在幾週內就進入了Artificial Analysis所有三個影片競技場的前三名,並且是唯一一個接近頂尖的開源權重參賽者。

以下是這兩個模型實際上的排名,資料直接從即時排行榜擷取,而非引用新聞稿(Artificial Analysis,2026年8月):

表A:Artificial Analysis影片競技場,2026-08-06快照

排行榜MiniMax H3Veo 3.1Veo 3.1 FastVeo 3.1 Lite
文字轉影片(含音訊)1,238 (排名帶 1-2, 6,830 票)1,093 (排名帶 11-15, 8,536 票)1,0911,089
圖片轉影片1,189 (排名帶 1-3)1,084 (排名帶 8-12)1,0771,065
影片編輯1,132 (排名 1)未上榜未上榜未上榜
供應商目錄價格,每分鐘1080p$7.80$24.00$9.00$4.80
開源權重

該表格中有三件事值得更多關注。

145分的差距是在音訊排行榜上。 在文字轉影片(含音訊)項目中,僅有Gemini Omni Flash(1,243)領先H3,且兩者處於相同的統計誤差範圍內。Veo 3.1排名第十一。投票者在同時聽過兩個片段後,以壓倒性優勢選擇了H3。

Veo 3.1並未出現在影片編輯排行榜上。 該排行榜上有八個模型,H3排名第一,領先Gemini Omni Flash九分。Google並非輸了這場比較,而是根本沒有參賽。如果你的工作流程是「生成,然後修改畫面中的某個元素」,那麼這個區別對你來說沒有幫助。

MiniMax自己的公告誇大了一個數字,所以請不要重複引用。 官方說法指出H3在編輯排行榜上領先第二名93分。第二名是Gemini Omni Flash(1,123分),僅落後H3九分。93分的差距是相對於排名第五的Dreamina Seedance 2.0(1,037分)。這兩個數字都是真實的,只是它們屬於不同的行。

為何大多數的正面對決都搞錯了

三種常見的錯誤模式,依出現頻率高低排列:

  1. 靜音的Veo。 generate_audio 在Veo 3.1的API架構中預設為 false。從未設定此參數的開發者會得到一個靜音片段,然後用它來與H3的立體聲混音進行比較。這不是模型比較,這是設定錯誤。值得注意:Atlas Cloud的網頁版遊樂場會為你預先啟用此開關,因此這個陷阱主要影響直接呼叫API的開發者,而這正是大多數發布基準測試的人。
  2. 解析度不匹配。 H3的API預設解析度是 2K,但許多測試為了速度而將其設定為 768P,然後將結果與1080p的Veo畫面放在一起比較。
  3. 為了公平而將H3限制在8秒。 這並不公平,它為了讓表格看起來整齊,而丟棄了H3將近一半的時長範圍。

為了保持誠實,H3自身的弱點也是真實存在的:塞滿參考素材欄位往往會降低提示詞的遵循度,而非提高;其2K等級確實很慢;而且MiniMax本身並未將其定位為電影或動畫模型。在此次運作中,H3也傾向於風格化,將提示詞解讀為拋光切割水晶的產品攝影,而非Veo所產生的超現實物體。


MiniMax H3 vs Veo 3.1:規格、音訊行為與每秒的價格

這裡的方法刻意保持簡單:一個提示詞,三個端點,一個API金鑰,無任何編輯。兩個家族模型並排託管在 Atlas Cloud 上,這是唯一能在同一個提示詞下進行比較,而無需兩個獨立計費帳戶和兩種不同參數語法的方式。這就是全部的產品提及。模型本身才是重點。

表B:能力矩陣,來自即時API架構

MiniMax H3Veo 3.1Veo 3.1 Lite
時長任何整數秒,4到154、6或84、6或8 (1080p強制為8)
解析度768P 或 2K720p, 1080p, 4k720p, 1080p
畫面比例21:9, 16:9, 4:3, 1:1, 3:4, 9:16僅16:9或9:16僅16:9或9:16
音訊原生,始終開啟,32kHz立體聲,無開關,無附加費用generate_audio,預設值 false始終開啟,無開關
參考輸入refers[]:可混合圖片、影片和音訊,4到15秒images: 1到3,時長鎖定為8
seed
negative_prompt
開源權重是,Hugging Face上
Atlas Cloud 價格,每秒2K為$0.14,768P為$0.10靜音$0.20,含音訊$0.40$0.05,含音訊

將最後兩行放在一起看,就能得到整個比較中最鮮明的一條界線:

開啟音訊的MiniMax H3,比關閉音訊的Veo 3.1更便宜。 每秒$0.14對比$0.20。

Google自己的價格表也確認了這個上限。根據Google的預設費率,Veo 3.1在720p和1080p(含音訊)的價格為每秒$0.40,4K則為$0.60(Google Gemini API 文件,2026年8月)。Atlas將其拆分為靜音層($0.20)和音訊層($0.40),因此當你將 generate_audio 設為 true 時,每秒成本就會翻倍。H3沒有類似的機制,因為根本沒有什麼需要開啟。

在進行測試之前,還有一個不對稱性值得指出:H3的 resolutionduration 在其三個端點上都是必填欄位,其文字轉影片的 ratio 預設值為 1:1。只發送一個提示詞,你會得到一個方形影片。而Veo則會愉快地預設出一個合理的16:9 720p影片。


MiniMax H3 vs Veo 3.1,相同提示詞,兩款模型:完整測試

三個模型使用同一個提示詞,一個字都沒改。這個提示詞設計來同時測試四個方面:Veo擅長的超現實玻璃物理學;與破碎動作同步的原生擬音;一句人類旁白;以及在最後一秒淡入的下三分之一文字卡,這是H3宣稱有優勢的地方。

請完全照抄以下內容。

Plain
1極致微距ASMR鏡頭,16:9。一個由透明水晶玻璃雕刻而成的超寫實西瓜,放在一塊濕黑石板上。一把鏡面拋光的主廚刀向下壓,以一個緩慢的連續動作乾淨地切開它;玻璃分開時發出清脆的碎裂聲,並噴濺出細小的透明碎片,在石板上彈跳散開。左側是冷藍色邊緣光,後方有一盞暖色實用燈。100mm微距鏡頭,淺景深,緩慢推進。聲音:刀刃下清脆的玻璃破裂聲,碎片敲擊石板的滴答聲,低沉的環境音。一個平靜的女聲說:「每次切割,都乾淨俐落。」在最後一秒,純白色無襯線字體在畫面下方三分之一處淡入,顯示「CUT CLEAN」。

步驟 1:MiniMax H3 文字轉影片,2K解析度

打開 MiniMax H3 Text-to-Video,貼上提示詞,然後設定三個關鍵欄位:

  • 解析度: 2K 必填欄位。這是最高等級,在16:9請求下輸出2560x1440。
  • 時長: 8 必填欄位。與Veo的上限匹配,以便進行同規格比較。
  • 比例: 16:9 這是人們常忽略的設定。預設值為 1:1,而文字轉影片會直接拒絕 adaptive 並回傳400錯誤。不做修改就會得到一個方形影片。

沒有種子欄位,也沒有負面提示詞欄位。你能得到的就是取樣器給出的結果,唯一的控制項就是提示詞。

費用:8秒 * $0.14 = $1.12,含音訊。也要有耐心的預算:這個作業總共花了455秒。我嘗試了四次想截取這個步驟完成的遊樂場畫面,但2K的佇列每次都比我瀏覽器會話的時間還長,所以這裡直接使用API的輸出,100%無重新取樣。

切割水晶碗與鬆散水晶,文字顯示CUT CLEAN

MiniMax H3 2K輸出的100%裁切,顯示清晰的下三分之一文字和解析的玻璃切面_MiniMax H3,2K,8秒,16:9,從輸出的2560x1440畫格中裁切為1:1。文字邊緣清晰,石板上的個別玻璃碎片保持其切面,這是排行榜投票所依據的等級。_

步驟 2:Veo 3.1 文字轉影片,開啟音訊

打開 Veo 3.1 Text-to-Video 並貼上相同的提示詞。設定:

  • 解析度: 1080p Veo的列舉也提供 4k,這是H3完全無法比擬的。順便一提:720p和1080p的計費費率相同,因此選擇1080p是免費的升級。
  • 時長: 8 最大值。
  • 畫面比例: 16:9 這裡只有16:9和9:16可選。
  • generate_audio true 這是網路世界跳過的步驟。架構預設值為 false,而且回傳一個靜音片段看起來不像錯誤。
  • negative_prompt 模糊、扭曲的文字、多餘的手指、文字上的動態模糊。H3無法提供的額外控制。
  • seed 12345 H3同樣沒有此功能。Google提供了一個可重複性的控制碼。

費用:8秒 * $0.40 = $3.20,含音訊。將 generate_audio 關閉,相同的片段價格為$1.60且無聲。

AI影片生成器介面,顯示文字提示詞和已完成的影片

Atlas Cloud上的Veo 3.1文字轉影片遊樂場,開啟了「Generate Audio」開關,完成的片段在輸出面板中播放_Veo 3.1,執行完成。「Generate Audio」開關已開啟,「Run」按鈕顯示$3.2,這是8秒鐘的音訊費率。此截圖使用頁面預設的720p,其計費與1080p相同;本文中的1080p片段是透過API從相同提示詞生成的。請注意兩個空白欄位「Negative Prompt」和「Seed」,這是MiniMax H3沒有對應功能的。_

步驟 3:Veo 3.1 Lite,經濟實惠的選擇

打開 Veo 3.1 Lite Text-to-Video,再次使用相同的提示詞。設定:720p8 秒,16:9seed 12345

請注意此頁面上缺少什麼:沒有音訊開關,因為Lite總是生成音訊。也要注意其架構中的一個陷阱:Lite的1080p會強制時長為8秒,因此不存在4秒的1080p Lite片段。

費用:8秒 * $0.05 = $0.40。這是本文中所有包含聲音的完成片段中最便宜的,H3也包括在內。

AI影片生成器介面,顯示提示詞設定和生成的影片預覽

Atlas Cloud上的Veo 3.1 Lite遊樂場,設定為720p,沒有音訊切換開關,完成的片段在輸出面板中_Veo 3.1 Lite 720p。此頁面上完全沒有_ generate_audio 控制項,這就是重點。

步驟 4:在五個軸線上為MiniMax H3 vs Veo 3.1評分

此步驟無模型呼叫,無成本。精確來說,這是每個模型的一次輸出,首次嘗試,無重新生成。這是三個片段的同規格比較,而非成功率研究。

表D:實際回傳的結果,每次一個片段

軸線MiniMax H3 2KVeo 3.1 1080pVeo 3.1 Lite 720p決定因素
玻璃物理學與真實感乾淨但風格化最佳中等Veo產生了可信的玻璃物體,具有真實的剪切平面和石板上的灰塵。H3渲染了一個多面切割的水晶裝飾品,更接近產品CGI而非照片中的物體。
字面理解提示詞中等中等物體方面最佳只有Lite賦予了玻璃西瓜綠色的外皮和深色的籽。H3和Veo都忽略了西瓜的提示,生成了一個通用的水晶球體。
螢幕上的文字最佳良好三個模型都渲染出了可讀的「CUT CLEAN」,這已經比聽起來更罕見。只有H3在2K下按要求在最後一秒將其置於畫面下方三分之一處。Lite將其放大到畫面中央並提前出現。
整體提示詞遵循度最佳中等最差提示詞要求極致微距,無人物。H3保持了乾淨。Veo添加了一隻未經要求的手。Lite則在最終畫面的兩側邊緣憑空生成了兩個穿著相同、剪影相同的女人。
首次嘗試即可使用上述Lite的畫面在後期製作中無法修復。

並排比較兩個清晰雕刻的冰雕

MiniMax H3和Veo 3.1片段中,下三分之一文字淡入時刻的匹配畫面

兩個片段中的相同節拍,「CUT CLEAN」淡入的畫面。左邊是MiniMax H3 2K,右邊是Veo 3.1 1080p(含音訊)。Veo的玻璃更接近被拍攝的物體;H3的文字更清晰且位置正確。

音訊軸線需要聆聽判斷,因此上述的影片片段可供你評判。可以量化的是:三個片段都回傳了連續的立體聲音軌,無超過0.6秒的空白區域。H3提供32kHz立體聲,混音較大聲,平均電平接近-18 dB,峰值觸及0 dBFS。Veo 3.1提供48kHz立體聲,平均電平較保守,約為-31 dB。H3的音軌大約大聲13 dB,聽起來像是模型直接輸出的更完成的混音,但也為你後續調整留下了更少的動態餘量。

步驟 5:Veo 3.1 結構上無法做到的15秒片段

與步驟1相同的頁面,相同的提示詞,更改兩個欄位:時長 15解析度 768P,比例仍為 16:9。沒有新的截圖,因為是同一個遊樂場。

這個步驟沒有Veo的對應方案。Veo 3.1的 duration 列舉在其所有端點上都是 [4, 6, 8],沒有任何計劃、等級或旗標可以提高它。Google對於想要更長時長的官方答案是使用一個獨立的影片擴展功能(Google video generation docs,2026年8月),這意味著需要生成8秒的區塊然後拼接,這就需要匹配接縫處的色調和音訊。H3則提供一個連續的單次拍攝和一個連續的音訊底層。

費用:15秒 * $0.10 = $1.50,這比一個8秒的Veo 3.1含音訊片段的一半價格還低。

MiniMax H3,768P,15秒,一個連續不間斷的拍攝,帶有一條連續不間斷的音訊底層。請開啟聲音。Veo 3.1沒有任何設定可以產生此檔案。請注意H3在刀片上憑空創造的雕刻文字:指定的文字它渲染得很清晰,但憑空創造的文字則是亂碼。

關於這個片段有兩個誠實的說明。它運行了485秒,是本文中最慢的作業,其音訊底層明顯比8秒版本稀疏,在3秒和11秒標記附近有實際的空白。更長的時長是可行的,但更長並非沒有代價。

四個教程步驟的總花費:$1.12 + $3.20 + $0.40 + $1.50 = $6.22,每個模型一次嘗試,無重新生成。下一節中使用的額外768P 8秒版本增加了$0.80,而遊樂場的截圖則是在此基礎上另外的付費運作。


MiniMax H3 vs Veo 3.1:H3超越Google限制之處

H3這邊有四項功能,它們不是Veo功能的較慢或較便宜版本,而是Veo根本沒有提供的功能。

21:9 寬銀幕。 H3的 ratio 列舉除了常見的16:9和9:16之外,還包括 21:94:31:13:4。Veo 3.1和Lite都只提供16:9或9:16。如果你要製作一個寬銀幕格式的預告片,其中一個模型可以原生取景,另一個則需要裁切。

不僅僅是圖片的參考素材。 H3的 reference-to-video 端點接受一個 refers[] 陣列,可以混合圖片、影片和音訊參考來錨定視覺風格,並且在這樣做時仍保持完整的4到15秒範圍。Veo 3.1的參考轉影片功能接受一個 images 陣列,最多3個條目,且其 duration 列舉會縮減為 [8],因此使用參考功能會將你鎖定在8秒。一個從經驗中得出的提醒:將H3的參考素材欄位塞滿,往往會使輸出偏離提示詞而非更接近,所以請逐步增加。

2K是重新渲染,而不是放大。 這個結果讓我感到驚訝,而且我沒有在任何地方看到過相關描述。在H3的文字轉影片功能上,對相同的提示詞分別運行 768P2K,你得到的不是同一部電影的兩種尺寸。你得到的是兩部不同的電影。在此次運行中,768P版本將西瓜保持完整直立,後面有一根燃燒的蠟燭,並在4秒時將文字橫跨畫面中央放置。而2K版本將西瓜打破成三塊,移動了背景燈光,並如提示所述,在最後一秒將文字以小字體放置在畫面下方三分之一處。相同的提示詞,相同的比例,相同的無種子取樣器。

切割水晶玻璃在藍色和橙色燈光下的比較

在MiniMax H3上,相同提示詞分別在768P和2K下運行的並排畫面,顯示了不同的場景佈置,而非相同鏡頭的兩種尺寸_相同提示詞,相同模型,相同比例,左邊是768P,右邊是2K,都在相同的時間戳記。不同的場景佈置、不同的燈光、不同的文字處理。如果你需要構圖在不同等級之間保持一致,請改用_ image-to-video 來鎖定第一幀。

永遠沒有音訊附加費用。 說得清楚一點,因為這會改變你的預算規劃:沒有任何版本的H3片段可以因為靜音而更便宜,也沒有任何版本的Veo 3.1片段可以在靜音價格下擁有聲音。

為了保持帳目清楚,以下是Google真正勝出而H3無法匹敵的三個地方:

  • 4K。 Veo 3.1的解析度列舉包含 4k。H3最高僅到2K。如果客戶合約要求4K母帶,這個比較到此為止。
  • seed negative_prompt Veo允許你調整可重複性,並明確禁止失敗模式。H3兩者都沒有。在需要重新生成一個接近成功但略有瑕疵的片段,而又不想失去整體視覺效果的場景中,這個差距會很傷。
  • 速度,某種程度上。 Veo 3.1的模型文件指出,一個8秒的1080p片段大約需要2到3分鐘。在此次同時提交的運行中,H3的2K版本花了455秒,Veo 3.1的1080p版本花了462秒,兩者實際上是持平的,且都遠超過其引用數字。Veo 3.1 Lite在237秒內完成,不到前兩者的一半時間。如果你需要在客戶面前即時迭代,Lite是三者中唯一跟得上速度的,這是一個真實的優勢,是每秒價格所無法體現的。

一個完成的廣告在MiniMax H3 vs Veo 3.1上的成本

每秒價格並不是你實際的花費。你實際的花費是每秒價格乘以你丟棄的片段數量。下面的30秒列應用了3:1的保留率,即每三個生成才能得到一個可用的片段,這是基於正常製作實務的工作假設,而非此次運行測量得出的結果。請將其視為一個縮放因子,而非基準。

表C:每個交付廣告的實際成本,Atlas Cloud 2026年8月定價,無任何有效折扣

端點與等級$/秒一個8秒片段30秒廣告,保留率3:1音訊
MiniMax H3, 2K$0.14$1.12$12.60始終開啟
MiniMax H3, 768P$0.10$0.80$9.00始終開啟
Veo 3.1, 靜音$0.20$1.60$18.00關閉
Veo 3.1, 開啟音訊$0.40$3.20$36.00開啟
Veo 3.1 Lite, 720p$0.05$0.40$4.50始終開啟

兩個結論,第二個結論並非我預期要寫的。

如果你需要2K、或超過8秒的時長、或16:9和9:16以外的比例、或無附加費用的原生音訊,H3在成本上以大幅優勢勝出。 H3最高等級的30秒廣告成本,大約是Veo 3.1含音訊版本的3分之1。

如果720p和8秒確實足夠,那麼Veo 3.1 Lite是這裡最便宜的選擇,而且差距巨大。 每秒$0.05的價格是H3最便宜等級的一半,音訊包含在內且無需擔心忘記開啟開關,而且速度是兩款旗艦模型的兩倍。任何告訴你H3是無條件便宜選擇的人,都沒有考慮過Lite這一行。Google也在其價格表中列出了Veo 3.1 Fast,720p的價格為每秒$0.10,儘管Atlas的目錄和其模型頁面對此等級的報價不同,因此Fast的確切數字尚不確定。

問題在於這個折扣買到了什麼。這是Lite在首次嘗試時回傳的最後一個畫面:

一名女性旁邊是半個水晶西瓜,文字顯示CUT CLEAN

Veo 3.1 Lite片段的最終畫面,畫面兩側邊緣出現了兩個相同的、被憑空創造的女性剪影_Veo 3.1 Lite,最終畫面,首次嘗試。提示詞中提到了一個女聲;Lite決定讓她現身,而且還出現了兩次,以相同的剪影呈現。它也賦予了西瓜三個模型中最逼真的綠色外皮和籽,這使得這個結果令人沮喪,而非單純的糟糕。_

這就是經濟實惠等級的真實面貌。它對物體的理解比兩款旗艦模型都好,然後以一種後期無法修復的方式破壞了畫面。如果失敗率發生變化,每秒便宜並不等於每個可用片段便宜,所以如果你選擇Lite,請為重新生成預留預算,而不是假設標價就是最終成本。


開源權重、排除地區與沒人讀的部分

權重確實已經發布。Hugging Face上的 MiniMaxAI/MiniMax-H3 是一個330億參數的密集單流全能Transformer,採用BF16格式,附帶兩個現成的檢查點、完整的Qwen3-VL-32B文字編碼器和兩個自動編碼器。全部下載大約需要499 GB。它是當前的旗艦模型,而非舊版,而且在Artificial Analysis每個影片排行榜的頂尖位置中,它是唯一的開源權重參賽者。

然後你閱讀授權條款,它所做的遠比「開源權重」這個詞暗示的要多(Hugging Face,2026年8月):

  • §I.5 定義了排除地區為歐盟、英國、韓國和美國。授權在全球範圍內有效,但上述地區除外。
  • §V.4 比部署限制更進一步。你不得在「適用領土」之外使用、複製、修改、分發或展示這些作品或其任何輸出
  • §IV.1 要求如果你的商業產品年收入超過2000萬美元,需要事先獲得單獨的書面授權。
  • §IV.2 要求你在基於其構建的商業產品的使用者介面中顯著顯示「MiniMax H3」。

MiniMax並沒有讓這個規定懸而未決。倉庫中提供了授權問答和申請表,授權條款指出公司將持續評估這些司法管轄區,並歡迎有興趣的各方提出申請。因此,準確的描述是「尚未開放,請聯繫我們」,而非「永久禁止」。在您圍繞當地權重規劃美國或歐盟產品之前,這仍然是一個需要交由法務部門處理的問題。

而當地權重並非API。自託管的H3-Base渲染的短邊為768像素;2K路徑需要通過API端的單獨重新生成階段。開源權重買到的是你控制的768p模型,而不是贏得那些投票的2K模型。

有一件事我無法確定:通過第三方API提供服務時,Veo 3.1的輸出是否帶有SynthID浮水印。請將其視為未經證實的資訊。本文中的H3檔案沒有可見的浮水印。


常見問題

MiniMax H3真的比Veo 3.1好嗎?

在含音訊的盲投票中,是的,在Artificial Analysis的文字轉影片項目中領先145 Elo,而且H3在Veo 3.1未出現的影片編輯排行榜上排名第一。它在含音訊情況下的每秒成本,也比Veo無音訊時更便宜。Veo 3.1在4K輸出以及seednegative_prompt控制方面仍然勝出。

為什麼我的Veo 3.1影片是無聲的?

因為 generate_audio 在Veo 3.1和Veo 3.1 Fast上預設為 false。請明確將其設為 true。請注意,這會使你的每秒成本翻倍,在Atlas Cloud上從$0.20變為$0.40。MiniMax H3沒有這個參數,因為音訊是在生成畫面的同時生成的。Veo 3.1 Lite也總是生成音訊。

MiniMax H3能生成比Veo 3.1的8秒更長的片段嗎?

可以。H3接受4到15秒之間的任何整數秒數作為一個連續的單次拍攝,這兩個欄位在請求中都是必填的。Veo 3.1的時長列舉是固定的 [4, 6, 8]。要在Veo上獲得更高時長,需要生成8秒的區塊然後進行擴展或拼接,並匹配接縫處的色調和音訊。

MiniMax H3有開源權重。這是否意味著它是免費的?

並非大多數人理解的那樣。完整下載約需499 GB,自託管的H3-Base渲染的短邊為768像素,而2K需要API端的重新生成階段。社群授權條款還排除了歐盟、英國、韓國和美國,且此限制涵蓋了輸出,而不僅僅是部署,但為這些地區提供了一個正式授權管道。

對於一個完成的30秒廣告,MiniMax H3和Veo 3.1哪個更便宜?

在保留率3:1的情況下,H3的2K版本一個30秒廣告的成本約為$12.60,而Veo 3.1含音訊版本約為$36.00。但如果720p和8秒區塊是可接受的,Veo 3.1 Lite以約$4.50的價格勝過兩者。H3的成本優勢取決於你是否需要2K、更長的時長、更廣泛的畫面比例選擇或免費的音訊。

MiniMax H3能像Veo 3.1一樣生成4K嗎?

不能。H3的解析度列舉僅有 768P2K。Veo 3.1的列舉包含 4k,根據Google自家定價為每秒$0.60,而Veo 3.1 Lite也明確不支援4K。如果合約要求4K母帶,那麼標準的Veo 3.1是三者中唯一能提供的。

最新模型

一個 API,暢享全模態 AI。

探索全部模型