MiniMax H3 对比 Gemini Omni Flash:Google 以 5 分优势获胜。然后客户要求更改。

MiniMax H3 与 Gemini Omni Flash 在三个排行榜上的差距均在误差范围内。于是我对两者各进行一次测试,然后将相同的修订说明发回。

我盯着三个 Artificial Analysis 排行榜看了十分钟,想弄清楚到底谁赢了。

文本转视频:Gemini Omni Flash 领先5分。图像转视频:Gemini 领先2分。视频编辑:MiniMax H3 领先9分。

然后我看了置信区间一列。±7。±9。±10。

三个榜单,三个差距,每一个都在自己的误差线内。在盲测投票中,这两个模型其实是同一个模型。

于是我关掉排行榜,转而打开下拉菜单。那个差距不是5分。那个差距是整整一个分辨率层级。

关键要点

  • Artificial Analysis 的三个差距(+5、+2、+9,快照于2026年8月6日)均落在 ±7 到 ±10 的置信区间内。就原始质量而言,这是平局,而非胜利。
  • H3 支持 2K、最长15秒、六种宽高比。Gemini Omni Flash 的 API 上限为 720p、10秒、两种宽高比。这些都是枚举值,而非主观意见。
  • H3 接受音频作为输入。Gemini 不支持。Gemini 有 seedthinking_level。H3 两者都没有。
  • Gemini 有一个专门的 video-edit 端点,可以修改你的源片段。H3 的修改路径是 reference-to-video,它会以你的片段作为参考重新生成。它们不是同一种操作,第二轮测试就证明了这一点。
  • 两者中只有一个可下载权重,而且不是 Google 的那个。

Side-by-side comparison of a night food stall scene at different resolutions

MiniMax H3 与 Gemini Omni Flash 测试的第一轮,两个模型都用相同的首帧生成动画,并排显示

第一轮:相同的首帧,相同的提示词,相同的时长。左侧 MiniMax H3 为 2K,右侧 Gemini Omni Flash 为 720p。此处显示为静音 GIF;两个交付文件均包含原生音频,并作为可播放视频嵌入在下方。这就是问题所在。它们都很好。


为什么 MiniMax H3 与 Gemini Omni Flash 的排行榜差距被误读

你几乎能找到的所有 MiniMax H3 与 Gemini Omni Flash 的帖子,都只引用一个排行榜和一个价格。这两种习惯都会得出错误答案。

以下是所有三个 Artificial Analysis 排行榜,其中包含每个人都忽略的那一列。

表 A:MiniMax H3 与 Gemini Omni Flash 在三个 Artificial Analysis 排行榜上的对比(含音频),快照于2026年8月6日

排行榜Gemini Omni FlashMiniMax H3差距是否在误差区间内?
文本转视频1,243 (#1) ±7, 11,842 票1,238 (#2) ±9, 6,830 票Gemini +5
图像转视频1,191 (#2) ±9, 6,506 票1,189 (#3) ±10, 5,545 票Gemini +2
视频编辑1,123 (#2) ±5, 11,706 票1,132 (#1) ±6, 9,128 票H3 +9是,勉强

Elo 分数来自 Artificial Analysis 视频竞技场(Artificial Analysis,2026年8月)。图像转视频排行榜由 Dreamina Seedance 2.0 720p 以 1,197 分领先,因此这两个模型均未占据该榜首。这些是滚动式群众投票分数,并且会变动,这正是为什么5分的差距不能作为定论。

一个5分的领先优势,配合 ±9 的区间,意味着排名可能仅凭投票噪音就在下周反转。这并非“Gemini 在文本转视频上更好”。这只是一个带有记分牌的抛硬币游戏。

人们还常搞错另外三件事:

美元/分钟这一列并非你实际支付的费用。 Artificial Analysis 列出 Gemini 为 6.00 美元/分钟,H3 为 7.80 美元/分钟。这一列标准化为默认设置下一分钟 1080p 内容的成本。Gemini Omni Flash 根本无法生成 1080p 内容。因此,这个数字是一个建模估算值,而非发票金额。请比较最终交付物,而非秒数。

一个排行榜不能代表整个模型。 H3 在三个排行榜上分别位列第二、第三和第一。Gemini 位列第一、第二和第二。单独引用任何一个排行榜,你都能证明你原本就相信的观点。

“Omni”并不意味着“什么都能吃进去”。 这是一个好名字,但具有误导性。这两个模型中只有一个接受音频文件作为输入。它不是名字里带有“omni”的那个。

没有人打印的 MiniMax H3 与 Gemini Omni Flash 规格表

如果 Elo 分数无法区分它们,那么约束表可以。我从两个模型的实时输入模式中提取了信息,而不是相信任何发布帖子,并且差异并不微妙。

表 B:MiniMax H3 与 Gemini Omni Flash 硬约束,从2026年8月6日的实时 API 模式中读取

约束条件MiniMax H3Gemini Omni Flash
分辨率768P 或 2K720p,并且这是枚举中唯一的值
时长4 到 15 秒3 到 10 秒
宽高比21:9, 16:9, 4:3, 1:1, 3:4, 9:16仅 16:9 和 9:16
修改路径reference-to-video(以参考重新生成)专用 video-edit 端点(修改你的源文件)
尾帧控制支持 end_image不支持
参考限制≤9 张图片, ≤3 个视频, ≤3 个音频, 共 12 个文件1 到 10 张图片
音频输入
seed 可复现性
thinking_level是(default / high / low)
开放权重是,在 Hugging Face 上

诚实看待这张表,Gemini 明确赢得了三行。可复现的种子对于构建需要两次渲染相同帧的管线至关重要。真正的 video-edit 端点是一个与参考条件再生截然不同的工具。而 thinking_level 为你提供了一个 H3 根本没有暴露的质量调节旋钮。

H3 赢得了五行,而正是这些行决定了你是否能交付客户要求的文件。

我在 Atlas Cloud 上运行了以下所有内容,因为两个模型都在那里位于同一个 /api/v1/model/generateVideo 端点之后,这意味着整个测试只需要一个轮询循环和一个认证头。切换模型只是更改 model 字符串。这个细节正是“两个都用”是现实答案而非敷衍之词的全部原因。

表 C:本测试中每个端点的成本,根据2026年8月6日的实时价格表验证

端点价格本测试的10秒片段
openai/gpt-image-2/text-to-image0.009 美元/图像0.01 美元
minimax/h3/image-to-video0.14 美元/秒1.40 美元
minimax/h3/reference-to-video0.14 美元/秒1.40 美元
google/gemini-omni-flash/image-to-video0.13 美元/秒1.30 美元
google/gemini-omni-flash/video-edit0.14 美元/秒1.40 美元
google/gemini-omni-flash/text-to-video0.125 美元/秒未使用
minimax/h3/text-to-video0.14 美元/秒未使用

本月两个模型都没有折扣。Gemini 还提供了一个更便宜的开发者层级(文本转视频和图像转视频为 0.112 美元/秒,参考到视频为 0.12 美元/秒);H3 没有等效层级。

Gemini Omni Flash 无法跨越的开放权重线。 H3 的权重已发布在 Hugging Face 上(MiniMax,2026年8月):一个 33B 密集单流 Omni Transformer,加上 Qwen3-VL-32B 文本编码器、一个视觉 VAE 和一个音频 VAE。有两个注意事项比下载大小更重要。首先,你自行部署运行的是 768 像素短边;Context-IR 预处理阶段和 Regenerate-2K 模块不在发布版本中,2K 输出来自这两个模块。其次,社区许可证目前不涵盖欧盟、英国、韩国或美国,这些地区有单独的申请表。在基于它构建产品之前,请先阅读它。Gemini Omni Flash 没有等效的对话,因为没有可下载的文件。

这种开放权重的定位,加上激进的价格,是整个发布战略的故事(南华早报,2026年8月)。

亲自运行 MiniMax H3 与 Gemini Omni Flash 修改测试

这是没有人运行过的部分。每个人都测试第一次生成。没有人测试第二次。

真正的工作不是一个提示词。真正的工作是你已经喜欢的一个片段,再加上一个客户回信说“喜欢,能不能让招牌写成 24H,她的围裙改成红色”。这一句话就是这两个模型不再是可互换的地方,而这恰好是视频编辑排行榜衡量的确切任务。

场景被刻意设计得残酷:一个雨夜面摊,摊主直视镜头,身后有一块手绘招牌,上面写着可辨认的文字,汤上冒着蒸汽,雨打在遮阳篷上。一个同时考验唇形同步、画面文字稳定性、流畅运动和分层环境音频的帧。

两个模型获得相同的首帧、相同的提示词和相同的修改备注。以下每次运行都是10秒,这是 Gemini Omni Flash 的上限,且完全在 H3 的能力范围内。

步骤 1:使用 GPT Image 2 锁定首帧

两个模型必须从同一张图像开始,否则第一轮衡量的是构图运气而非模型本身。打开 GPT Image 2 工作台,将质量设置为 ,比例设置为 16:9,然后粘贴以下内容:

plaintext
1Photoreal night street-food stall in heavy rain, shot on a 35mm lens at f/2.0. A woman in her late thirties in an indigo canvas apron stands behind a steaming noodle counter, looking straight into the lens, mid-sentence. Behind her a hand-painted tin light-box sign glows warm amber with the words "OPEN LATE" in clean bold sans-serif capitals. Rain streaks through the sodium streetlight, steam rises off the broth pot, wet asphalt reflects red and green neon from across the street. Shallow depth of field, practical lighting only, slight lens haze, natural skin texture, no text anywhere else in the frame. 16:9.

AI image generator interface showing a prompt and the generated image

Atlas Cloud 上的 GPT Image 2 工作台,左侧为面摊提示词,输出面板中为生成的首帧

Atlas Cloud 上的 GPT Image 2:左侧提示词,OUTPUT 中为共享首帧。本步骤成本为 $0.009。

A woman stands at a steaming street food stall at night

生成的首帧:一位身着靛蓝围裙的女性在雨夜中站在热气腾腾的面摊后面,身后是一块发光的“OPEN LATE”手绘招牌

两个模型收到的单一输入。注意修改将针对的两件事:“OPEN LATE”招牌和靛蓝围裙。使用 openai/gpt-image-2/text-to-image 生成。

步骤 2:MiniMax H3 上的第一轮

进入 MiniMax H3 工作台,选择 image-to-video 任务,上传步骤 1 的帧,并将 resolution 设置为 2Kduration 设置为 10ratio 设置为 adaptive(图像转视频枚举仅提供 adaptive)。提示词:

plaintext
1The vendor looks into the lens and says, in a warm tired voice: "Broth's been on since four this morning. Sit down, it's still raining." She lifts the ladle as she speaks. Steam curls up across the frame. Rain keeps falling on the awning behind her. The camera holds still, no push, no pan. Ambient audio: rain on canvas, broth simmering, distant traffic, her voice close and dry.

AI video generation interface showing text prompt input and video output

Atlas Cloud 上的 MiniMax H3 图像转视频工作台,选择了 2K 分辨率,输出面板中播放着完成的片段

Atlas Cloud 上的 MiniMax H3 图像转视频:选择了 2K,OUTPUT 中为完成的片段。此截图以工作台默认的 8 秒运行,价格为 1.12 美元;用于比较的 10 秒版本嵌入在下方,价格为 1.40 美元。

A8bowsMJgME

MiniMax H3,第一轮,2K,10秒。打开声音:对话、雨声和汤的沸腾声都是在同一遍中生成的,并非后期叠加。

步骤 3:Gemini Omni Flash 上的第一轮,相同的帧,相同的文字

打开 Gemini Omni Flash 工作台,选择 image-to-video,上传相同的步骤 1 帧,然后粘贴步骤 2 的提示词,不更改任何字符。设置:resolution 720pduration 10aspect_ratio 16:9thinking_level defaultseed -1

在填写该表单时,请注意两件事,因为它们正是本文的缩影。resolution 下拉菜单中只有一个选项。duration 字段在 10 处停止。我并非选择了 720p 而不是更好的选项;而是根本没有其他选项可选。

关于此处缺失的内容的说明:我无法为 Gemini 的任何一个步骤捕获到运行完成的工作台截图。我用于截图的分阶段环境从 Google 端返回了 403 PERMISSION_DENIED,所有三次尝试均如此,因此我唯一的 Gemini 截图显示的是失败的 OUTPUT 面板,我不会将其伪装成成功运行。下面的片段是真实的,是通过生产 API 使用上述设置生成的。两个 H3 步骤确实成功捕获了,那些截图是真实的。

pllIxfhjUR4

Gemini Omni Flash,第一轮,720p,10秒,相同的输入。在上面的 H3 片段之后直接播放此片段,并亲自判断音频。

步骤 4:第二轮,将修改发送给 Gemini Omni Flash

这是关键的一轮。切换到同一 Gemini 模型页面上的 video-edit 任务,上传 Gemini 在步骤 3 中生成的片段 作为 video 输入,设置 resolution 720pthinking_level high(一个包含两部分编辑的指令正是该旋钮所针对的复杂情况)。完全按照客户可能发送的方式粘贴此备注:

plaintext
1Keep this exact shot: same camera position, same woman, same face, same rain, same lighting, same audio. Change the hand-painted sign so it reads "OPEN 24H" instead of "OPEN LATE", in the same painted style and the same amber glow. Change her apron from indigo blue to deep crimson. Change nothing else in the frame.

UKw9LEogi0I

Gemini Omni Flash 在修改备注之后。观察招牌,然后是围裙,然后检查其他任何东西是否移动。

步骤 5:第二轮,将相同的修改发送给 MiniMax H3

这里存在诚实的结构差异,在阅读结果之前你应该知道它。H3 没有 video-edit 端点。它的修改路径是 reference-to-video:你给它原始片段作为参考,它生成一个以该参考为条件的新视频。它不是在编辑你的文件。它是在生成一个应该看起来像你的文件的新文件。

在 MiniMax H3 页面上,选择 reference-to-video 任务,将 H3 在步骤 2 中生成的片段 作为视频参考添加到 refers,然后设置 resolution 2Kduration 10ratio adaptive。粘贴步骤 4 的提示词,不做任何编辑。

此步骤也没有工作台截图,原因不同且更无聊:我用于捕获的 headless 浏览器在加载视频参考时,在参考上传器上崩溃了三次。该运行本身通过 API 顺利进行,没有抱怨。

TKIThp6r_oU

MiniMax H3 在相同的修改备注之后,通过 reference-to-video 以 2K 生成。

Comparison of a woman cooking at a rainy night food stall

第二轮并排对比:Gemini Omni Flash 的 video-edit 结果旁边是 MiniMax H3 的 reference-to-video 结果,两者都来自相同的修改备注

第二轮并排,静音 GIF。左侧 Gemini Omni Flash 通过 video-edit,右侧 MiniMax H3 通过 reference-to-video。两者都有相同的句子需要处理。

第二轮实际发生了什么。 我原本预期 H3 会输掉这一轮。参考条件再生比真正的编辑端点更粗糙,而“重新生成整个片段并希望它落在同一位置”正是导致不同面孔、相机漂移以及客户询问镜头发生了什么情况的原因。

但那不是返回的结果。两个模型都完成了任务,而且都完成得很干净。

Gemini 的 video-edit 表现得如所宣传的那样。招牌显示为“OPEN 24H”,采用相同的手绘字体、相同的琥珀色光芒和相同的铁皮风化效果。围裙是深红色。其他一切都没有改变:相同的面孔、相同的表情、相同的勺子角度、相同的蒸汽形状、相同的雨、相同的背景尾灯。它读起来就像原始文件,只是进行了两次像素级的修正,因为这本质上就是它所做的。

H3 的 reference-to-video 产生了相同的两个变化,并且比架构所暗示的更好地保持了镜头。招牌变了,围裙变了,在全部 10 秒内,画面的构图、从勺子流出的汤、蒸汽羽流和她的面孔都与第一轮的片段保持了一致。如果存在漂移,我通过逐帧检查也无法找到。

所以第二轮是第三个统计上的平局,而我不会假装不是这样来编造一个更整洁的故事。区分两个输出的不是编辑质量。而是 H3 返回了 2560x1440 分辨率和 32 kHz 立体声轨道,而 Gemini 返回了 1280x720。相同的指令,相同的成功,不同的交付物。

关于方法的一个诚实说明:这只是对一个镜头的一次修改,不是一项受控研究。对一个招牌和一件服装进行两部分更改是一个相当友好的编辑。更困难的情况(物体被相机移过,改变被拍摄对象遮挡的东西,层层叠加的四轮备注)才是专用编辑端点应该占优势的地方,也是再生开始摇摆的地方。在做出决定之前,请先运行你自己的测试。

值得测试的另外三个 MiniMax H3 与 Gemini Omni Flash 差异点

第二轮是改变交付的差异点。还有三个差异点值得你花二十分钟的自己的积分来测试。

给它输入一个音频文件。 H3 的 reference-to-video 最多接受三个 2 到 15 秒的音频片段,只要同时提供至少一个图像或视频参考。这意味着你可以给它一个真实的人声录音,并让角色进行表演。Gemini Omni Flash 在其四个端点中的任何一个上都没有音频输入字段,因此这个比较根本无法进行。对于 Google 来说,这并非评分损失;这是一种根本不存在的功能。

要求 21:9。 H3 的 reference-to-video 比例枚举包含 21:9、16:9、4:3、1:1、3:4 和 9:16。Gemini 的 aspect_ratio 枚举包含 16:9 和 9:16。如果你的交付物是宽银幕标题序列或 1:1 社交媒体剪辑,那么这两个模型中有一个不在讨论范围内。

锁定种子并重新运行。 这次情况相反。Gemini 暴露了 seed;H3 在任何端点上都没有暴露它。如果你正在构建一个管线,要求相同的请求在周二返回与周一相同的帧,那么 Gemini 提供了一个句柄,而 H3 什么也没提供。对于回归测试、A/B 文案变体或任何自动化渲染农场,这是一个真正的优势,并且应该记在 Google 的账上。

实际测试 MiniMax H3 与 Gemini Omni Flash 的成本

上面的整个实验,包括四次视频生成和一次图像生成,总共花费了大约 5.51 美元。一张首帧 0.009 美元,两个 10 秒第一轮片段分别为 1.40 美元和 1.30 美元,两个 10 秒第二轮片段各 1.40 美元。

每秒价格方面,Gemini 更便宜:0.125 到 0.14 美元,而 H3 是固定的 0.14 美元,因此根据端点不同,大约便宜 7% 到 11%。这个数字是真实的,但单独来看几乎毫无用处。

原因如下。假设交付物是一个 15 秒的 21:9 电影风格开场白,分辨率为 2K。H3 可以将其作为一个片段渲染出来。Gemini 根本无法渲染:分辨率、时长、宽高比都不行。你需要拼接一个 10 秒和一个 5 秒的 16:9 片段,裁剪以伪造宽银幕,并交付 720p 的内容。你无法交付的东西的每秒价格并不是节省。

反过来看。假设交付物是一个 16:9 的社交媒体剪辑,将经历四轮客户备注,并且当法务团队要求在三周后重新渲染时,必须返回字节完全相同的版本。Gemini 的 video-edit 加上 seed 正是为此循环而构建的,而且在执行时每秒成本更低。

表 D:哪个 MiniMax H3 与 Gemini Omni Flash 任务去哪里

你面前的任务发送给
2K 交付MiniMax H3
超过 10 秒的单个镜头MiniMax H3
21:9, 4:3, 1:1 或 3:4 画幅MiniMax H3
输入真实的音频轨道MiniMax H3
在自己的 GPU 上自行部署MiniMax H3
固定在特定的尾帧MiniMax H3
对话式的多轮修改Gemini Omni Flash
保留片段中未修改的部分Gemini Omni Flash
通过种子实现可复现的渲染Gemini Omni Flash
普通的 16:9 短格式,最低每秒成本Gemini Omni Flash

本文的结论是那张表,而不是一个分数。如果一个基准测试无法以超过其自身误差线的差距来区分两个模型,那么该基准测试已经告诉了你它所知道的一切,从那时起,规格表将接管。

要更广泛地了解 H3 与其他模型的对比情况,MiniMax H3 替代方案分析 涵盖了在其不领先的排行榜上击败它的模型。

常见问题解答

MiniMax H3 比 Gemini Omni Flash 更好吗?

盲测投票无法区分它们。在三个 Artificial Analysis 排行榜上,差距分别为 5、2 和 9 个 Elo 点,每一个都落在 ±7 到 ±10 的置信区间内。根据规格而非排名来选择。分辨率上限、时长限制和宽高比列表将改变你的交付物;5 个 Elo 点不会。

哪个更便宜,MiniMax H3 还是 Gemini Omni Flash?

每秒价格方面,Gemini 更便宜。在 Atlas Cloud 上,它的价格为 0.125 到 0.14 美元/秒,而 H3 为固定的 0.14 美元/秒,此外还有一个 0.112 美元/秒的开发者层级,H3 没有等效层级。但 Gemini 上限为 720p、10 秒和两种宽高比,因此对于许多交付物来说,你比较的不是同一个产品。为最终剪辑定价,而不是为每秒定价。

Gemini Omni Flash 能生成 1080p、2K 或 15 秒视频吗?

不能。其 API 的 resolution 参数只有一个合法值 720pduration 接受 3 到 10 秒。MiniMax H3 提供 768P2K,以及 4 到 15 秒。这些是读取自 2026 年 8 月 6 日实时模式的枚举约束,而非编辑意见,Google 可能会在未来解除这些限制。

我能像自行部署 MiniMax H3 那样自行部署 Gemini Omni Flash 吗?

不能。H3 的权重在 Hugging Face 上,可以在本地以 768 像素短边运行。产生 2K 输出的 Context-IR 阶段和 Regenerate-2K 模块不在发布版本中,并且保留在 API 端。同时检查许可证:它目前不涵盖欧盟、英国、韩国或美国,除非另行申请。

我必须只选一个吗?

不,上面按任务划分的表格是更好的答案。两个模型在 Atlas Cloud 上都位于同一个 generateVideo 端点之后,因此同时运行两者意味着一个轮询循环和一个不同的 model 字符串,而不是两个集成。根据交付物进行路由,优于押注于每周变动的排行榜。

最新模型

一个 API,畅享全模态 AI。

探索全部模型