一段8秒的Veo 3.1视频,价格是同样8秒的MiniMax H3的三倍。在Artificial Analysis盲测排行榜上,它落后145 Elo。文章本该到此结束。
但Veo 3.1的API默认关闭了音频生成。参数是generate_audio,其模式默认值为false,并且响应中没有任何信息告诉你片段是无声的。MiniMax H3没有这样的开关,因为H3在同一个生成过程中同时生成画面和32kHz立体声,而且一直如此。因此,流传的许多“Veo画质更好”的说法,都是基于将一个无声的Google片段与一个自带音效的中国模型片段放在一起比较得出的。
我想知道这145分的差距实际看起来是什么样。于是我拿Veo曾经最火爆的格式——玻璃水果ASMR片段——写了一个提示词,然后在两个模型上运行,将所有设置都推到各自极限。音频开启。不做任何裁剪。
然后我继续测试,直到找到Google仍然胜出的三个地方——因为它们确实存在,而写这些对比文章的人似乎都没提到。
关键要点
- 在Artificial Analysis的带音频文生视频榜单上,MiniMax H3的Elo评分为1,238,Veo 3.1为1,093。盲测(快照日期:2026-08-06)差距为145分。
- Veo 3.1的
generate_audio参数在API模式中默认值为false。如果你调用API但从未设置它,你就是在拿一个无声的Veo片段与默认自带立体声的H3片段比较。- H3接受4到15秒之间的任意整数秒。Veo 3.1只接受4、6或8秒。这是结构性的上限,而非设置问题。
- Veo 3.1根本没有出现在Artificial Analysis的视频编辑排行榜上。H3在该榜单上排名第一。
- Veo 3.1在4K输出、
seed加negative_prompt的可重复性方面仍然胜出,并且如果你觉得720p就够用,Veo 3.1 Lite确实比H3的任何产品都要便宜。
MiniMax H3 vs Veo 3.1:一个提示词,三段连续生成
laLbhPPVt_g
一个提示词,三段生成,按顺序:MiniMax H3 2K、Veo 3.1 1080p(音频显式开启)、Veo 3.1 Lite 720p。每个片段保留其原生音频轨道,因此请打开声音。注意每个片段的最后一秒,以及最便宜的模型对最终帧边缘的处理。

一个微距电影场景:水晶玻璃西瓜放在湿石板上,两台制作监视器播放着相同的切片镜头_本文实际使用的设置:一个ASMR产品广告,两个模型,一个API密钥。使用openai/gpt-image-2/text-to-image生成。_
为什么MiniMax H3 vs Veo 3.1突然成为唯一值得做的比较
MiniMax H3于2026年7月问世,并做到了其他模型尚未做到的事:在几周内,它进入了Artificial Analysis所有三个视频竞技场的前三名,并且它是唯一一个接近顶部的开放权重模型。
以下是这两个模型实际的位置,来自实时数据而非新闻稿(Artificial Analysis,2026年8月):
表A:Artificial Analysis视频竞技场,快照日期2026-08-06
| 排行榜 | MiniMax H3 | Veo 3.1 | Veo 3.1 Fast | Veo 3.1 Lite |
|---|---|---|---|---|
| 文生视频(带音频) | 1,238(排名区间1-2,6,830票) | 1,093(区间11-15,8,536票) | 1,091 | 1,089 |
| 图生视频 | 1,189(区间1-3) | 1,084(区间8-12) | 1,077 | 1,065 |
| 视频编辑 | 1,132(排名第1) | 未上榜 | 未上榜 | 未上榜 |
| 供应商列表价,每分钟1080p | $7.80 | $24.00 | $9.00 | $4.80 |
| 开放权重 | 是 | 否 | 否 | 否 |
该表中有三件事值得更多关注。
145分的差距是在音频榜单上。 在带音频的文生视频榜单上,只有Gemini Omni Flash(1,243)领先于H3,且两者处于同一统计误差区间。Veo 3.1排第十一。投票者同时听到两个片段后,明显更倾向于选择H3而非Veo。
Veo 3.1不在视频编辑排行榜上。 该榜单上有八个模型,H3排名第一,领先Gemini Omni Flash九分。Google并非输掉了这场比较,而是根本没有参赛。如果你的工作流程是“先生成,再修改画面中的某个元素”,这个区别对你没有帮助。
MiniMax自己的公告夸大了一个数字,所以不要重复引用。 官方称H3在编辑榜单上领先第二名93分。第二名是Gemini Omni Flash(1,123分),实际上只落后H3九分。93分的差距是指与排名第五的Dreamina Seedance 2.0(1,037分)之间的差距。两个数字都是真实的,只是属于不同的行。
为什么大多数直接对比会出错
三种失败模式,按我看到频率从高到低排列:
- 无声的Veo。 Veo 3.1 API模式中
generate_audio默认值为false。一个从未设置该参数的开发者会得到一个无声片段,然后将其与H3的立体声混合片段进行比较。这不是模型对比,而是设置错误。值得注意的是:Atlas Cloud网页版Playground会预先启用该开关,因此这个陷阱主要影响直接调用API的人,而发布基准测试的大多是这些人。 - 分辨率不匹配。 H3 API的默认分辨率是
2K,但许多测试为了速度将其设为768P,然后将结果与1080p的Veo画面放在一起比较。 - 为了公平而将H3限制为8秒。 这并不公平,它为了表格整洁而丢弃了H3近一半的时长范围。
为了保持诚实,H3自身的弱点也是真实的:填满参考槽往往会降低提示遵循度而非提高,其2K档次确实很慢,而且MiniMax本身并未将其定位为电影或动画模型。在这次运行中,H3也偏向风格化,将提示解读为抛光切割水晶的产品摄影,而非Veo产生的超现实物体。
MiniMax H3 vs Veo 3.1:规格、音频行为,以及一秒能买到什么
这里的方法故意很无聊:一个提示词,三个端点,一个API密钥,不编辑。两个系列都并排托管在Atlas Cloud上,这是唯一能在不涉及两个独立计费账户和两种不同参数方言的情况下进行相同提示词运行的原因。这就是产品提及的全部。模型才是主题。
表B:能力矩阵,来自实时API模式
| MiniMax H3 | Veo 3.1 | Veo 3.1 Lite | |
|---|---|---|---|
| 时长 | 4到15秒任意整数秒 | 4、6或8秒 | 4、6或8秒(1080p强制8秒) |
| 分辨率 | 768P或2K | 720p、1080p、4k | 720p、1080p |
| 宽高比 | 21:9、16:9、4:3、1:1、3:4、9:16 | 仅16:9或9:16 | 仅16:9或9:16 |
| 音频 | 原生,始终开启,32kHz立体声,无开关,无附加费用 | generate_audio,默认false | 始终开启,无开关 |
| 参考输入 | refers[]:任意图像、视频和音频混合,4到15秒 | images:1到3个,时长锁定为8秒 | 无 |
| seed | 无 | 有 | 有 |
| negative_prompt | 无 | 有 | 无 |
| 开放权重 | 是,在Hugging Face上 | 否 | 否 |
| Atlas Cloud上的价格,每秒 | 2K:$0.14,768P:$0.10 | 无声:$0.20,带音频:$0.40 | $0.05,含音频 |
将最后两行放在一起看,你会得到整个比较中最尖锐的结论:
MiniMax H3带声音比Veo 3.1不带声音还便宜。 每秒$0.14对比$0.20。
Google自己的价格表也确认了上限。Veo 3.1在720p和1080p下,含音频的默认费率为每秒$0.40,4K升至$0.60(Google Gemini API文档,2026年8月)。Atlas将其拆分为无声档$0.20和音频档$0.40,因此一旦你将generate_audio设为true,每秒成本就翻倍。H3没有等效的杠杆,因为没什么需要开启的。
在运行之前还有一个值得指出的不对称性:H3的resolution和duration在其三个端点上都是必填字段,其文生视频的ratio默认值为1:1。发送一个裸提示词,你会得到一个正方形视频。而Veo会愉快地默认生成一个合理的16:9 720p片段。
MiniMax H3 vs Veo 3.1,相同提示词,两个模型:完整运行
三个模型使用同一个提示词,一个字都不改。它设计来同时考验四件事:超现实的玻璃物理(这是Veo的主场)、与破碎同步的原生拟音、一句人声旁白,以及一个在最后一秒淡入的下三分之一文字卡片(这是H3声称的优势领域)。
请逐字复制以下内容。
plaintext1Extreme macro ASMR shot, 16:9. A hyper-realistic watermelon carved from clear 2crystal glass rests on a wet black slate slab. A mirror-polished chef's knife 3presses down and slices cleanly through it in one slow, continuous motion; the 4glass parts with a bright ringing crack and a spray of tiny translucent shards 5that scatter and tick across the slate. Cold blue rim light from the left, one 6warm practical behind. 100mm macro, shallow depth of field, slow push-in. 7Sound: the crisp ring of glass under the blade, shards ticking onto stone, low 8room tone. A calm woman's voice says: "Cut clean. Every single time." In the 9final second, crisp white sans-serif type fades in across the lower third 10reading CUT CLEAN.
步骤1:MiniMax H3文生视频,2K
打开MiniMax H3文生视频,粘贴提示词,然后设置三个重要字段:
- 分辨率:
2K。 必填字段。这是最高档次,对于16:9请求输出2560x1440。 - 时长:
8。 必填字段。与Veo的上限匹配,以便第一次比较是对等的。 - 比例:
16:9。 这是人们容易忽略的字段。默认值为1:1,而文生视频直接拒绝adaptive并返回400。如果不管,你会得到一个正方形视频。
没有seed字段,也没有negative_prompt字段。你得到的是采样器给你的结果,唯一的控制就是提示词。
计费:8秒 × $0.14 = $1.12,含音频。也要有耐心:这个任务总共耗时455秒。我尝试了四次截取这一步完成的Playground运行结果,但2K队列每次都超出了浏览器会话时间,所以这里直接展示API输出本身,100%无重采样。

MiniMax H3 2K输出的100%裁剪图,显示清晰的下三分之一文字和清晰的玻璃刻面_MiniMax H3,2K,8秒,16:9,从输出的2560x1440帧中裁剪出1:1。文字边缘清晰,石板上的单个玻璃碎片保持刻面,这是排行榜投票所依据的档次。_
步骤2:Veo 3.1文生视频,音频开启
打开Veo 3.1文生视频,粘贴相同的提示词。设置:
- 分辨率:
1080p。 Veo的枚举也提供4k,这是H3完全无法匹配的。有用信息:720p和1080p计费相同,所以1080p是免费升级。 - 时长:
8。 最大值。 - 宽高比:
16:9。 这里只有16:9和9:16。 generate_audio:true。 这是整个互联网忽略的一步。模式默认值为false,而且无声返回看起来不像错误。negative_prompt:blurry, warped text, extra fingers, motion blur on type。H3没有的免费额外控制。seed:12345。 同样H3没有。Google给了你一个可重复性手柄。
计费:8秒 × $0.40 = $3.20,音频开启。将generate_audio关闭,同样的片段是$1.60且无声。

Atlas Cloud上的Veo 3.1文生视频Playground,Generate Audio开关已打开,输出面板中播放着完成的片段_Veo 3.1,运行完成。Generate Audio开关已打开,运行按钮显示$3.2,即8秒的音频费率。此截图保留了页面默认的720p,与1080p计费相同;本文中的1080p片段来自通过API的相同提示词。注意两个空字段,Negative Prompt和Seed,MiniMax H3没有等效项。_
步骤3:Veo 3.1 Lite,廉价座位
打开Veo 3.1 Lite文生视频,同样提示词。设置:720p,8秒,16:9,seed 12345。
注意此页面缺少什么:没有音频开关,因为Lite始终生成音频。还要注意其模式中的一个陷阱:Lite的1080p强制时长设为8秒,因此4秒的1080p Lite片段不存在。
计费:8秒 × $0.05 = $0.40。这是本文中所有含音频的完成片段中最便宜的,包括H3在内。

Atlas Cloud上的Veo 3.1 Lite Playground,720p,没有音频开关,输出面板中显示完成的片段_Veo 3.1 Lite,720p。此页面上根本没有generate_audio控制,这就是关键点。_
步骤4:在五个维度上对MiniMax H3 vs Veo 3.1评分
此步骤无模型调用,无成本。准确地说:每个模型生成一次,首次尝试,不重试。这是三个片段的直接对比阅读,而非保留率研究。
表D:实际返回的结果,各一次尝试
| 维度 | MiniMax H3 2K | Veo 3.1 1080p | Veo 3.1 Lite 720p | 决定因素 |
|---|---|---|---|---|
| 玻璃物理与真实感 | 干净但风格化 | 最佳 | 中等 | Veo生成了一个可信的玻璃物体,具有真实的剪切面和石板上的灰尘。H3渲染了一个有刻面的切割水晶装饰品,更接近产品CGI而非拍摄的实物。 |
| 字面理解提示 | 中等 | 中等 | 物体方面最佳 | 只有Lite赋予了玻璃西瓜绿色外皮和深色籽。H3和Veo都放弃了对西瓜的解读,生成了一个通用的水晶球体。 |
| 屏幕文字 | 最佳 | 良好 | 较差 | 三个模型都清晰渲染了CUT CLEAN,这比听起来要罕见。只有H3在2K下按要求在最后一秒将其置于下三分之一。Lite将其放大到画面中央并提前引入。 |
| 整体提示遵循度 | 最佳 | 中等 | 最差 | 提示要求极端微距,无人物。H3保持干净。Veo添加了一只未要求的手。Lite在最终帧的两侧边缘生成了两个相同的女性肖像剪影。 |
| 首次尝试即可用 | 是 | 是 | 否 | 上面的Lite帧在后期无法修复。 |

MiniMax H3和Veo 3.1片段在文字CUT CLEAN淡入时刻的匹配帧
两个片段中相同的瞬间,CUT CLEAN淡入的帧。左:MiniMax H3 2K,右:Veo 3.1 1080p(音频开启)。Veo的玻璃看起来更像拍摄的物体;H3的文字更清晰且位置正确。
音频维度是听觉判断,所以上面的视频就是你的评判依据。可测量的是:三个片段都返回了连续的立体声轨道,没有超过0.6秒的无声区域。H3提供32kHz立体声,混音电平较高,平均电平接近-18 dB,峰值触及0 dBFS。Veo 3.1提供48kHz立体声,平均电平保守,约为-31 dB。H3的音轨大约响13 dB,听起来像是模型直接输出了更完整的混音,但也给你的后期处理留下了更少的余量。
步骤5:Veo 3.1在结构上无法做到的15秒片段
与步骤1相同的页面,相同的提示词,更改两个字段:时长 15,分辨率 768P,比例仍为16:9。没有新截图,就是同一个Playground。
这一步没有Veo的对应物。Veo 3.1的duration枚举在其所有端点上都是[4, 6, 8],没有任何计划、档次或标志能提高它。Google自己对更长时长的回答是一个单独的视频扩展功能(Google视频生成文档,2026年8月),这意味着生成8秒的块然后拼接起来,这就要求在接缝处匹配色调和音频。H3则给你一个连续的片段,带有连续的音频基底。
计费:15秒 × $0.10 = $1.50,不到一个8秒Veo 3.1带音频片段成本的一半。
VNmboe6k4M4
MiniMax H3,768P,15秒,一个不间断的片段,一个不间断的音频基底。打开声音。Veo 3.1没有任何设置能产生这个文件。注意H3在刀片上发明的刻字:指定的文字它渲染得很清晰,但发明的文字是无意义的。
关于这个片段的两个诚实说明。它运行了485秒,是本文中最慢的任务,其音频基底明显比8秒版本稀疏,在3秒和11秒附近有真正的间隙。更长的时长是可行的,但更长并非没有代价。
四个教程步骤的总花费:$1.12 + $3.20 + $0.40 + $1.50 = $6.22,每个模型单次尝试,无重试。下一节中使用的额外768P 8秒运行增加了$0.80,而Playground截图是另外付费的运行。
MiniMax H3 vs Veo 3.1:H3超越Google限制的地方
H3这边的四个能力,并非Veo功能的更慢或更便宜版本,而是Veo根本没有暴露的东西。
21:9宽银幕。 H3的ratio枚举除了常见的两个比例外,还包括21:9、4:3、1:1和3:4。Veo 3.1和Lite都只提供16:9或9:16,没有其他。如果你正在剪辑一个宽银幕格式的预告片,其中一个模型可以原生取景,另一个则需要裁剪。
不仅限于图像的参考输入。 H3的reference-to-video端点接受一个refers[]数组,可以混合图像、视频和音频参考来锚定外观,并且在此过程中保持完整的4到15秒时长范围。Veo 3.1的参考到视频接受一个最多3个条目的images数组,其duration枚举折叠为[8],因此使用参考会将你锁定在8秒。一个经验警告:将H3的参考槽填满容量往往会将输出拉离提示词而非拉近,所以要逐步增加。
2K是重新渲染,而非放大。 这一点让我很惊讶,我没在任何地方看到过。在H3文生视频上以768P和2K运行相同的提示词,你不会得到两个不同尺寸的同一部电影。你会得到两部不同的电影。在这次运行中,768P的片段将西瓜保持完整直立,后面点着一根蜡烛,并在四秒标记处将文字横跨画面中央。2K片段将西瓜切成三块,移动了背景灯光,并将文字按提示在最后一秒以小尺寸置于下三分之一。相同的提示词,相同的比例,相同的无种子采样器。

相同提示词在MiniMax H3上以768P和2K运行的并排帧,显示不同的布景而非相同镜头不同尺寸_相同提示词,相同模型,相同比例,左为768P,右为2K,相同时间戳。不同的布景、不同的灯光、不同的文字处理。如果你需要在不同档次之间保持构图一致,改用image-to-video锁定第一帧。_
永远没有音频附加费。 直白地说,因为这会影响你的预算:不存在一个H3片段因为无声而更便宜的版本,也不存在一个Veo 3.1片段能以无声价格获得声音的版本。
为了保持账目诚实,Google真正胜出而H3没有答案的三个地方:
- 4K。 Veo 3.1的分辨率枚举包括
4k。H3最高只有2K。如果客户合同要求4K母版,这个比较到此为止。 seed和negative_prompt。 Veo允许你微调可重复性并显式禁止失败模式。H3两者都不提供。在需要重试接近成功但有不完美之处的镜头而同时不想丢失整个外观的拍摄中,这个差距很要命。- 速度,某种程度上。 Veo 3.1的模型文档称一个8秒1080p片段大约需要2到3分钟。在这次运行中,同时提交的H3 2K耗时455秒,Veo 3.1 1080p耗时462秒,因此它们实际上旗鼓相当,且都远高于引用的数字。Veo 3.1 Lite在237秒内完成,不到两者的一半。如果你在客户面前实时迭代,Lite是三者中唯一能跟上的,这是每秒价格无法体现的真实优势。
一个完成的广告在MiniMax H3和Veo 3.1上各花费多少
每秒价格并不是你实际花费的金额。你实际花费的是每秒价格乘以你丢弃的片段数量。下面30秒列应用了3:1的保留率(即每三个生成中有一个可用),这是来自正常制作实践的工作假设,而非本次运行测量的结果。请将其视为一个缩放因子,而非基准。
表C:每个交付广告点的实际成本,Atlas Cloud定价,2026年8月,无活跃折扣
| 端点和档次 | 美元/秒 | 一个8秒片段 | 30秒广告,3:1保留率 | 音频 |
|---|---|---|---|---|
| MiniMax H3, 2K | $0.14 | $1.12 | $12.60 | 始终开启 |
| MiniMax H3, 768P | $0.10 | $0.80 | $9.00 | 始终开启 |
| Veo 3.1, 无声 | $0.20 | $1.60 | $18.00 | 关闭 |
| Veo 3.1, 音频开启 | $0.40 | $3.20 | $36.00 | 开启 |
| Veo 3.1 Lite, 720p | $0.05 | $0.40 | $4.50 | 始终开启 |
两个结论,第二个并非我预期会写出的结论。
如果你需要2K、或超过8秒的时长、或16:9和9:16以外的比例、或原生音频且无附加费,H3在成本上大幅胜出。 H3最高档次的一个30秒广告大约相当于Veo 3.1带声音的同一广告的三分之一。
如果720p和8秒确实足够,Veo 3.1 Lite是这里最便宜的选择,而且差距很大。 每秒$0.05是H3最便宜档次的一半,音频包含在内,没有可忘记的开关,而且速度是任何一个旗舰模型的两倍。任何告诉你H3无条件是最便宜选项的人,都没有看过Lite这一行。Google还将Veo 3.1 Fast列为介于两者之间,在其自己的价格表中720p为每秒$0.10,尽管Atlas的目录和其模型页面对该档次引用了不同的数字,因此请将Fast的确切数字视为未确定。
问题在于折扣买到了什么。这是Lite在首次尝试中返回的最后一帧:

Veo 3.1 Lite片段的最后一帧,画面两侧边缘有两个相同的幻觉女性肖像剪影_Veo 3.1 Lite,最后一帧,首次尝试。提示词提到了女人的声音;Lite决定展示她,两次,以匹配的剪影。它还赋予了西瓜三个模型中最好的绿色外皮和籽,这正是让这个结果令人沮丧而非简单糟糕的原因。_
这就是廉价档次的真实面貌。它在物体识别上比任何一个旗舰模型都好,然后以你无法在后期修复的方式破坏了画面。如果每秒便宜不等于每个可用片段便宜,因为失败率会变化,所以如果你选择Lite,请为重试做预算,而不是假定标价。
开放权重、排除地区,以及没人读的部分
权重确实是发布的。MiniMaxAI/MiniMax-H3在Hugging Face上是一个33B参数的密集单流全能Transformer,采用BF16,附带两个现成检查点、完整的Qwen3-VL-32B文本编码器和两个自动编码器。全部拉取下来大约499 GB。它是当前旗舰,而非已退役版本,并且在Artificial Analysis所有视频排行榜的顶级排名中,它是唯一的开放权重条目。
然后你读到许可证,它比“开放权重”暗示的要复杂得多(Hugging Face,2026年8月):
- §I.5定义了排除地区为欧盟、英国、大韩民国和美利坚合众国。授权在全球范围内适用,但排除这些地区。
- §V.4更进一步,不仅限于部署。你不得在适用地区之外使用、复制、修改、分发或展示作品或其任何输出。
- §IV.1要求如果你的商业产品年收入超过2000万美元,则需要单独的事先书面授权。
- §IV.2要求你在基于其构建的任何商业产品的用户界面中显著显示“MiniMax H3”。
MiniMax并未对此置之不理。仓库附带了一个许可证问答和一个申请表,并且许可证说明公司会持续评估这些司法管辖区,并邀请有兴趣的人申请。因此准确的表述是“尚未确定,请询问我们”,而非“永久禁止”。但如果你计划围绕本地权重构建一个美国或欧盟产品,这仍然是一个需要提交给法律部门的问题。
而本地权重并非API。自托管H3-Base渲染的短边为768像素;2K路径通过API端的一个单独再生阶段运行。开放权重购买的是你控制的768p模型,而非赢得投票的2K模型。
有一件事我无法确定:通过第三方API提供的Veo 3.1输出是否带有SynthID水印。请将其视为未经验证。本次运行中的H3文件没有可见水印。
常见问题解答
MiniMax H3真的比Veo 3.1好吗?
在带音频的盲测中,是的,在Artificial Analysis文生视频上领先145 Elo,并且H3在Veo 3.1未出现的视频编辑排行榜上排名第一。它带声音的每秒成本也比Veo不带声音还便宜。Veo 3.1在4K输出以及seed加negative_prompt控制方面仍然胜出。
为什么我的Veo 3.1视频是无声的?
因为generate_audio在Veo 3.1和Veo 3.1 Fast上默认值为false。请显式将其设为true。注意这会使你的每秒成本翻倍,从Atlas Cloud上的$0.20变为$0.40。MiniMax H3没有这样的参数,因为音频与画面在同一过程中生成。Veo 3.1 Lite也始终生成音频。
MiniMax H3能生成比Veo 3.1的8秒更长的片段吗?
可以。H3接受4到15秒之间的任意整数秒作为单个连续片段,请求中这两个字段都是必填的。Veo 3.1的时长枚举是[4, 6, 8],是硬性的。在Veo上生成更长的片段意味着生成8秒的块然后扩展或拼接,接着在接缝处匹配色调和音频。
MiniMax H3有开放权重。这是否意味着它是免费的?
并非大多数人理解的那种免费。完整下载大约499 GB,自托管H3-Base渲染的短边为768像素,而2K需要API端的再生阶段。社区许可证还排除了欧盟、英国、韩国和美国,并且该限制涵盖输出而不仅仅是部署,不过这些地区有正式的授权渠道开放。
对于一个完成的30秒广告,MiniMax H3和Veo 3.1哪个更便宜?
H3在2K下,以3:1的保留率,一个30秒广告大约需要$12.60,而Veo 3.1带音频大约需要$36.00。但如果720p和8秒块可以接受,Veo 3.1 Lite以大约$4.50的价格击败了二者。H3的成本优势取决于你是否需要2K、更长的片段、更宽的比例选择或免费音频。
MiniMax H3能像Veo 3.1一样做4K吗?
不能。H3的分辨率枚举只有768P和2K。Veo 3.1的枚举包括4k,Google自己的定价为每秒$0.60,而Veo 3.1 Lite也明确不支持4K。如果4K母版是合同要求,那么Veo 3.1标准版是这三个中唯一能交付的。






