整个夏天,我的信息流一直在循环播放同一个视频。世界杯球员被重绘成少年漫画主角。一个独裁者。一个海盗船长。一个在最后四秒才出现的饱经风霜的导师。每个帖子数百万的播放量,剧情几乎每场比赛后都会更新。
制作这些视频的人不是在写基准测试帖子。他们选择模型,消耗积分,然后在下一场开球前发布。
所以我拿了一个动漫关键帧和一段提示词,在相同输入下,将 MiniMax H3 作为动漫视频生成器与 Veo 3.1 进行对比测试,两者都推到最高设置。
首先出问题的不是图像质量。而是一个下拉菜单。Veo 3.1 只能生成 8 秒,并且只提供两种宽高比。一个镜头先停留在脸上,然后随着球做摇摄,最后落定一个标题卡,这不可能在 8 秒内完成。它根本没有机会在质量上失败。
关键要点
- Veo 3.1 的
duration枚举是[4, 6, 8],其aspect_ratio枚举是[16:9, 9:16]。MiniMax H3 支持从 4 到 15 的任意整数秒,并提供21:9, 16:9, 4:3, 1:1, 3:4, 9:16。Veo 没有 4:3,意味着完全无法实现复古 OVA 画幅。 - H3 的模型卡列出了 11 种原生稳定的对话语言,日语是其中之一。音频和画面以 32 kHz 立体声同时生成,不是后期配音。
- 参考包功能差距很大:H3 最多可接受 9 张图片加上最多 3 个视频和 3 个音频片段(总共最多 12 个文件)。Veo 3.1 的参考端点接受 3 张图片,一旦使用,
duration会缩减为仅[8]。 - 两个会悄悄毁掉测试的陷阱:Veo 的 API 默认将
generate_audio设为false,resolution设为720p;H3 的文本转视频ratio默认是1:1。忽略这些,你就是在比较一个无声的 720p 片段和一个方形片段。 - Veo 3.1 拥有 H3 完全没有的两个功能:
seed和negative_prompt。对于 2D 动漫来说,第二个功能确实很重要,我会展示它的作用。
MiniMax H3 动漫视频生成器 vs Veo 3.1,同一帧的背靠背对比
一个原创角色。一个关键帧。一段提示词,逐字复制到两个模型中。其他所有设置都调到最高。
Zdu1SJ7kN_o
MiniMax H3,图生视频,2K,8 秒,原生音频。打开声音:人群嘈杂声、击球声和日语喊叫声是在同一通道中与画面一起生成的。使用 Atlas Cloud 上的 minimax/h3/image-to-video 生成。
r_7UCdbs8Mk
Veo 3.1,图生视频,1080p,8 秒,手动开启 generate_audio,并添加了 negative_prompt 以保持线条平整。相同的第一帧,相同的提示词。使用 Atlas Cloud 上的 google/veo3.1/image-to-video 生成。
两者都画得很漂亮。Veo 的击球广角镜头,带有手绘冲击线和空中漂浮的漫画音效,确实很可爱。这是诚实的起点,也是为什么本文其余部分将讨论参数和指令遵循,而不是感觉。
为什么大多数 MiniMax H3 动漫视频生成器与 Veo 3.1 的对比测试会出错
今年夏天同时发生了两件事。
动漫成为 AI 视频中数量最多的格式。2026 年世界杯被改写为一场少年锦标赛,球员被塑造成独裁者、海盗船长、海军将军和导师,剧情在 TikTok、Instagram、X 和 YouTube 上“几乎每场比赛后都会更新”(Complex,2026 年 7 月)。
而 MiniMax H3 发布了开放权重。发布当天的 ComfyUI 帖子获得了 330 个点赞和 95 条评论,人们在几小时内就发布了真实的本地运行数据(Hacker News,2026 年 8 月)。
把这两件事放在一起,你可能会期待看到大量动漫对比。但几乎没有,因为大多数测试在构建时都犯了以下四种错误之一。
他们比较的是画面,而不是约束条件。 动漫镜头是时机的艺术。一个摇摄到标题卡的镜头,在成为渲染问题之前首先是时长问题。
他们忘记了 Veo 的 API 默认是静音的。 在 API 上,generate_audio 默认是 false,resolution 默认是 720p。很多“Veo 在动漫中没有音频”的帖子,只是有人从未翻转过那个布尔值。
他们忘记了 H3 的文本转视频默认是方形的。 ratio 默认是 1:1,而不是 16:9。在没有设置的情况下运行动漫 t2v 提示词,你会得到一个方形片段和一个混乱的结论。
他们使用照片级真实的提示词进行测试。 “电影感、体积光、浅景深”正是那种会把 2D 模型拉向 3D 渲染着色的词汇。在动漫中,失败模式不是模糊,而是塑料感。
在运行前决定动漫测试的三个设置
在任何事情之前,在两边都设置好这些,否则比较无效。
| 设置 | MiniMax H3 | Veo 3.1 | 如果跳过会怎样 |
|---|---|---|---|
| 音频 | 与画面一起生成,始终开启 | generate_audio 默认为 false | Veo 返回无声片段,看起来比实际差 |
| 画面形状 | 文本转视频 ratio 默认为 1:1 | aspect_ratio 默认为 16:9 | H3 给你一个方形动漫片段,无法使用 |
| 分辨率 | 默认为 2K | 默认为 720p | 你比较 2K 和 720p,然后称之为质量差距 |
MiniMax H3 与 Veo 3.1 的动漫规格表:时长、比例、音频、参考
我提取了两个模型的实时输入模式,而不是相信任何发布帖子。下面的每个值都是你可以在模型页面上自己读取的枚举,而不是印象。
表 1:MiniMax H3 与 Veo 3.1,决定动漫镜头的参数
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| 时长 | 4 到 15,每一整秒(默认 8) | 4, 6, 8(默认 8) |
| 宽高比 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| 比例默认(文本转视频) | 1:01 | 16:09 |
| 分辨率 | 768P, 2K(默认 2K) | 720p, 1080p, 4k(默认 720p) |
| 音频 | 联合生成,32 kHz 立体声 | generate_audio,默认 false |
| 原生对话语言 | 11 种稳定语言,包括日语 | 未发布稳定的语言列表 |
| 参考包 | 最多 9 张图片,3 个视频,3 个音频片段,总共 12 个文件 | 3 张图片 |
| 使用参考时的时长 | 仍然为 4 到 15 | 缩减为仅 8 |
| seed | 不可用 | 可用 |
| negative_prompt | 不可用 | 可用 |
| 权重 | 可下载 | 封闭 |
时长、比例、分辨率、音频和参考限制来自 MiniMax H3 图生视频、H3 文生视频、H3 参考生视频、Veo 3.1 图生视频 和 Veo 3.1 参考生视频 页面上的实时模式。9 张图片和 12 个文件的参考上限以及 11 种语言的对话列表来自 MiniMax H3 模型卡(Hugging Face,2026 年 8 月)。
现在来看排行榜,因为它们与规格表不同,而且两者都很重要。
表 2:众包投票 Elo 和每分钟列表价格,2026 年 8 月 7 日快照
| 模型 | 文生视频(含音频) | 图生视频(含音频) | $/分钟 |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | 未进入前十 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | 未进入前十 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | 未进入前十 | $4.80 |
Elo 和价格数据来自 Artificial Analysis Video Arena(Artificial Analysis,2026 年 8 月)。这些是滚动众包投票,数据会变动。$/分钟列是归一化的模型估计值,不是你的发票。
145 点的 Elo 差距很大,但这是一个通用投票,不是动漫投票。而且我必须直说:MiniMax 并没有将 H3 定位为动漫模型。内部一线反馈列表将电影、动画和戏剧列为 H3 不 针对的领域。所以有趣的问题不是“哪个是动漫模型”,而是为什么一个不以动漫为卖点的模型仍然赢得了镜头,以及 Google 在哪里仍然占得上风。
在教程开始前有一个实用说明。下面的每个模型都通过同一个控制台和同一个 API 密钥运行,这是参数具有可比性的唯一原因。相同的队列,相同的认证,一张账单。如果你在一个服务上设置 GPT Image 2,在另一个服务上设置 Veo,你会发现一半的差异是管道问题,而不是模型问题。
构建镜头:MiniMax H3 vs Veo 3.1,逐步操作
一个贯穿始终的例子。“Last Whistle”:一个原创的青少年前锋,红头发,白色和海军蓝的 9 号球衣,泛光灯,击球时的摇摄,以及一个必须在最后两秒内出现并保持稳定的日语标题卡。
没有真实球员,没有官方角色,没有现有的动漫 IP。只有风格和致敬。稍后会有更多关于原因的解释。
第一步:使用 GPT Image 2 设计动漫关键帧
关键帧承载了艺术指导,这样视频模型就不必自行发明了。注意左三分之一的空白区域:这是故意的。标题卡将由视频模型写在那里,这是文本稳定性测试。
plaintext1现代少年体育动漫的单帧。赛璐珞着色2D动画,手绘墨线,线条粗细一致,纯色填充,硬边图形阴影,绝对没有3D着色和照片级真实皮肤。特写一个原创的青少年前锋:凌乱的深红色头发,白色和海军蓝的球衣,号码9,脸颊上有汗水和草痕,眼睛睁大,带着疲惫的决心,嘴巴张开,正在大喊。在他身后,体育场泛光灯照亮了一面模糊的观众色彩墙;径向速度线从画面中心爆发;一片草叶悬浮在空中。饱和调色板,深青色阴影,温暖的橙色轮廓光。16:9构图,角色位于画面中心偏右,左三分之一干净空白。图像中没有任何文字。
设置:模型 openai/gpt-image-2/text-to-image,质量 high,尺寸 16:9 (2048x1152)。其他没有。

Atlas Cloud 上的 GPT Image 2 工作台,包含 Last Whistle 关键帧提示词和输出面板中完成的动漫帧
GPT Image 2 on Atlas Cloud:质量设置为 high,右侧是完成的关键帧。

基础动漫关键帧:一个原创的红发前锋在体育场泛光灯下大喊,赛璐珞着色,纯色和速度线
两个模型都接收到的关键帧。纯色,硬阴影,以及一个等待标题卡的空左三分之一。
第二步:MiniMax H3 图生视频,所有设置拉到最高
相同的图片输入,2K 输出。我在这里将 H3 限制为 8 秒,只是为了匹配 Veo 的上限。这不是 H3 的极限,第 4 步会解除限制。
plaintext1赛璐珞着色2D动漫,手绘墨线,纯色,无3D着色。在击球手的脸上停留一拍,然后一个剧烈的摇摄跟随球,当他击球时,摇摄将画面拖成条纹状的 sakuga 运动轨迹。撞击瞬间有一帧完全静音。在最后两秒内,粗体白色日语标题文字ラストホイッスル出现在画面左三分之一处,并保持稳定,无变形、无闪烁、无漂移。击球手用日语喊出一句台词:「まだ終わってない!」音频:体育场咆哮声渐强,一次尖锐的击球冲击声,标题卡下的一声低沉太鼓。
设置:模型 minimax/h3/image-to-video,resolution: 2K,duration: 8,ratio: adaptive(图生视频从其输入图像中获取画面形状),image = 第一步的输出。
如果你改为使用文生视频,有一个警告:请明确写出 ratio: 16:9。默认是 1:1,它会很乐意给你一个方形的动漫片段。

Atlas Cloud 上的 MiniMax H3 图生视频工作台,包含 Last Whistle 提示词,已加载关键帧,输出面板中播放完成片段
MiniMax H3 图生视频 on Atlas Cloud:左侧加载了第一步的关键帧,右侧播放完成的片段。
第三步:Veo 3.1 图生视频,手动开启音频
提示词相同,逐字复制。改变一个形容词就不算比较了。变化的是 Veo 提供而 H3 没有的额外字段。
negative_prompt,对于 2D 动漫来说,这是这个列表中最有用的控制:
plaintext13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
设置:模型 google/veo3.1/image-to-video,resolution: 1080p(更改它,默认是 720p),duration: 8(这是上限),aspect_ratio: 16:9,generate_audio: true(API 默认是 false,这是静音片段陷阱),seed: 20260807,image = 相同的第一步输出。

Atlas Cloud 上的 Veo 3.1 图生视频工作台,显示已启用生成音频,已加载动漫关键帧,输出面板中播放完成片段
Veo 3.1 图生视频 on Atlas Cloud,已开启生成音频,右侧是完成片段。
第四步:在五个特定于动漫的轴上评分
这里不需要生成任何东西。只需观察,在动漫真正会出问题的地方。两个片段都嵌入在本文开头附近,所以你可以自己打分,而不是相信我的话。

两个片段最后一帧的并排对比,左侧 MiniMax H3 有清晰的日语标题文字,右侧 Veo 3.1 有乱码的垂直字符
每个片段的最后一帧。左侧,H3 写出了 ラストホイッスル,所有八个片假名都正确且稳定。右侧,Veo 3.1 写出了三个字符,不是要求的词,也不构成一个词。
标题卡是决定胜负的地方,而且差距不大。H3 精确渲染了要求的片假名,硬边且稳定,叠加在球门区域的条纹摇摄上。Veo 3.1 产生了一个垂直堆叠的三个字符,既不是要求的词,也不是一个词。在同一帧上,它还将角色移出了画面,并让背景滑向半照片级真实的体育场画面,尽管 photorealistic skin 和 3D render 位于负面提示词中。
表 3:决定动漫片段的五个轴,来自这两次运行
| 轴 | MiniMax H3 | Veo 3.1 |
|---|---|---|
| 关键帧的角色连续性 | 在整个 8 秒内保持确切的面部、头发和球衣 | 在新的广角镜头中重新绘制了角色,模型正确,但不同的绘制 |
| 线条粗细和纯色赛璐珞着色 | 保持,没有向 3D 漂移 | 在中景镜头中保持,但在结束时漂移到照片级的体育场画面 |
| 日语标题卡 | ラストホイッスル 正确渲染且稳定 | 三个字符,不是要求的词,也不是一个词 |
| 交付的音频轨道 | 32 kHz 立体声,完全符合模型卡说明 | 48 kHz 立体声,仅因为我手动设置了 generate_audio 才存在 |
| 摇摄和 sakuga 拖尾 | 执行了一个拖尾的摇摄进入标题 | 替换为一个硬切到新场景 |
最后一行是迄今为止对 H3 最响亮的公开批评,这也正是我把它写进两个提示词的原因。在发布当天的 ComfyUI 帖子中,用户 fwip 抱怨即使是官方演示提示词也被忽略了:“一个剧烈的摇摄,从屋顶上把漂浮的文字拖走,带有运动条纹。但视频根本没有做那个过渡,只是用切替换了它。” 在这次运行中,是 Veo 把摇摄换成了切,而 H3 做了拖尾。每个只运行一次不是定论,我不会声称相反。但这确实意味着批评不是 H3 特有的:在这个测试中,摇摄是两边最不可靠的指令。如果你的分镜依赖于摇摄,请围绕它而不是通过它来规划分镜。
第五步:Veo 3.1 在结构上无法输出的 4:3 复古 OVA 片段
这不是质量偏好。这是一堵墙。Veo 的 aspect_ratio 枚举只有两个值,都不是 4:3,其 duration 枚举没有 12。90 年代 OVA 的样子根本不可实现。
plaintext1一个 1990 年代 OVA 动漫片段,4:3 全画幅。手绘背景艺术,可见笔刷纹理,赛璐珞上色角色,粗且不均匀的墨线,泛光灯周围强烈的光晕辉光,16mm 胶片颗粒和微弱的门框抖动。同一个红发前锋,穿着白色和海军蓝的 9 号球衣,在雨淋湿的球场上走下场,观众噪音逐渐消失,变成一声单一的铃声。镜头缓慢推近他的脸。他用日语轻声说:「次は、勝つ」。复古调色板:柔和青绿色,尘土琥珀色,深栗色阴影。音频:远处的雨声,一个孤独的模拟合成器垫音,远处一声混响很重的哨声。
设置:模型 minimax/h3/text-to-video,resolution: 2K,duration: 12,ratio: 4:3。手动设置该比例,记住默认值。

Atlas Cloud 上的 MiniMax H3 文生视频工作台,输入了 OVA 提示词,输出面板中播放完成的复古片段
MiniMax H3 文生视频 on Atlas Cloud,输入了 OVA 提示词,片段完成。完全披露:这次特定运行将 Aspect Ratio 留在了 16:9,Duration 为 8,所以你在右侧看到的是宽屏短版本。下面的 4:3 十二秒片段来自 API 调用,明确设置了 ratio: 4:3 和 duration: 12。

4:3 复古 OVA 片段:同一个前锋在 90 年代动漫风格中走下湿漉漉的球场
H3 文生视频,4:3,12 秒。交付的文件分辨率为 1920x1440,这是精确的 4:3 像素,带有 32 kHz 立体声音轨。此处以较慢帧率的无声 GIF 显示,以保持页面轻量。使用 Atlas Cloud 上的 minimax/h3/text-to-video 生成。
第六步:九张参考图片,一个角色,四个片段
跨镜头角色一致性是 AI 动漫中最难的问题,而它通过参考数量来解决。首先构建参考包:重新运行第一步的提示词,将构图分别改为正面、四分之三侧面、完整侧面、背面、大笑、咬牙切齿、全身站姿、球衣细节和球鞋细节。九张图片,总共大约八美分。

同一个原创前锋角色的四个角度,作为参考包生成,排列成 2x2 网格
九个参考角度中的四个。H3 在一个参考包中最多接受九张图片,此外还可以接受视频和音频参考。
plaintext1赛璐珞着色2D动漫,一致的手绘墨线,纯色,无3D着色。在每一个片段中保持引用的前锋的面部、头发轮廓和9号球衣完全相同。一个连续镜头中的四个片段:(1)低角度推进镜头,他的球鞋踩在草地上,(2)向上摇摄到他的眼睛的特写,(3)广角镜头,他高速跑过三个防守球员,画成模糊的剪影,(4)定格在半空中头球,速度线向外爆发。音频:人群咆哮,呼吸声,球鞋与草地撞击声,定格时的一声太鼓。
设置:模型 minimax/h3/reference-to-video,refers = 你的图片,type: image,resolution: 2K,duration: 8 或更高,ratio: adaptive 或 16:9。
Veo 3.1 的等效功能无法在这些设置下运行,你不需要尝试就知道原因。它的参考端点最多接受三张图片,选择该端点会将 duration 缩减为唯一合法的值 8。九张图片的包和 10 秒的片段都超出了范围。

Atlas Cloud 上的 MiniMax H3 参考生视频工作台,显示参考计数器为 4/9,输出面板中显示第一个片段
MiniMax H3 参考生视频 on Atlas Cloud。计数器显示 Reference Materials (4/9),下面有 MAX:9,这是界面中的上限,而不是规格表上的声明。输出是第一个片段,低角度推进镜头到球鞋。
另外四个值得一试的 MiniMax H3 动漫视频生成器运行
Last Whistle 镜头只强调了四个差异。下面这四个强调了其余部分。它们都在 H3 上运行;注释说明了哪些 Veo 3.1 可以匹配。
- 超宽画幅 sakuga 战斗,
21:9,10 秒。 Veo 根本无法输出 21:9。
plaintext1赛璐珞着色2D动漫动作,粗锥形墨线,纯色,硬边阴影,无3D着色。两个原创蒙面对手在黄昏时风吹的寺庙屋顶上。刀剑碰撞,画面震动,两个战士在一阵手绘冲击帧和径向速度线中分开。摄像机:低角度推进,然后横向跟踪,然后快速切换到橙色天空下的宽幅剪影。音频:两次尖锐的金属碰撞声,布料撕裂声,最后定格时的一声低沉太鼓,无音乐。
- 节拍同步的 AMV 片段,带音频参考的参考生视频。 H3 最多接受三个音频片段作为参考输入。Veo 3.1 没有音频输入,只有音频输出。
plaintext1赛璐珞着色2D动漫蒙太奇,与引用的音频轨道同步。五个短节拍:窗户上的雨,一只手收紧绷带,城市天际线从火车窗外飞过,起跑冲刺,定格在一只伸出的手上。每个片段正好落在引用的音频的重拍上。纯色,粗墨线,高对比度夜间调色板,深靛蓝和霓虹洋红。
- 两行日语对话场景,12 秒。 这是口型同步的压力测试,12 秒已经超出了 Veo 的范围。
plaintext1赛璐珞着色2D动漫,纯色,无3D着色。两个原创角色在黄金时分的屋顶上,正反打。第一个用日语说:「本当に行くの?」。第二个半笑着用日语回答:「もう決めた」。嘴巴匹配每一个音节。温暖的轮廓光,长长的影子,头发在微风中轻轻飘动。音频:两个不同的日语声音,远处交通声,一声蝉鸣。
- 竖屏少年短片,
9:16,8 秒。 两个模型都可以做竖屏,所以这是唯一一个可以实际进行 A/B 测试而不是假设的地方。
plaintext1赛璐珞着色2D动漫,竖屏构图。一个原创的青少年跑步者慢动作冲破纸制横幅,然后画面快速恢复到全速,她在体育场直道上加速。速度线,纯色,硬阴影,大胆的图形天空。摄像机:低角度跟拍,然后向上摇摄到她的脸。音频:横幅撕裂声,人群涌动声,一声屏住呼吸然后释放的声音。 2 3如果你想要这些背后的提示词语法,[MiniMax H3 提示词指南](https://www.atlascloud.ai/blog/guides/minimax-h3-prompt-guide?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) 比我在这里更深入地介绍了 H3 如何解析摄像机和音频指令。
MiniMax H3 与 Veo 3.1 上 60 秒动漫片头的成本
一个标准的动漫片头大约是 90 秒。可以说总共 8 个镜头,每个 8 秒,共 64 秒的完成视频,加上每个镜头一个关键帧,每个 $0.009。
有一个真实的价格差异,你应该知道,而不是让我掩盖。Atlas Cloud 目录显示 MiniMax H3 为 $0.10/秒,而模型自述文件细分为 $0.14/秒(2K)和 $0.10/秒(768P)。Veo 3.1 列为 $0.20/秒,而其自述文件则区分了 $0.40/秒(含音频)和 $0.20/秒(不含)。
我的截图中的运行按钮可以解决这个问题。H3 参考生视频,8 秒,2K,报价 Run $1.12,正好是 $0.14/秒。Veo 3.1 图生视频,8 秒,1080p,开启音频,报价 Run $3.2,正好是 $0.40/秒。所以自述文件中的费率才是实际收费的,而目录标题是入门层级。但无论如何,我下面还是显示了两个读数。这些是截至 2026 年 8 月的列表价格。
表 4:八个 8 秒镜头,包含关键帧
| 设置 | 视频成本(目录费率) | 视频成本(自述文件费率) | 关键帧 | 总范围 |
|---|---|---|---|---|
| MiniMax H3,2K | $6.40 | $8.96 | $0.07 | $6.47 到 $9.03 |
| MiniMax H3,768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1,1080p 含音频 | $12.80 | $25.60 | $0.07 | $12.87 到 $25.67 |
| Veo 3.1 Lite,720p | $3.20 | $3.20 | $0.07 | $3.27 |
价格来自表 1 中链接的 Atlas Cloud 模型页面,2026 年 8 月。目前这四种都没有折扣。
该表不包括两件事,而它们的影响比每秒费率更大。
重试。 没有人会发布动漫镜头的第一次拍摄。无论你假设的乘数是多少,将其应用于两列,差距会按相同比例扩大。
实际时间,这一点则相反。 在 2026 年 8 月 7 日从头到尾计时:H3 在 2K 下生成 8 秒耗时 447 秒,约 7.5 分钟。H3 文生视频在 2K 下生成 12 秒耗时 334 秒。Veo 3.1 在 1080p 下生成 8 秒含音频耗时 152 秒,不到 3 分钟。在此,Veo 获得第一次拍摄的速度大约快三倍,如果你在凌晨 2 点迭代镜头,这是真金白银。队列会变化,所以请将这些视为一个下午的快照,而不是规格。但任何说 H3 在 2K 下“2 到 3 分钟”的人都是在引用自述文件,而不是队列。2K 与 768P 对比分析 涵盖了何时更高层级值得额外的时间。
动漫风格、致敬以及你可以实际发布的内容
本文中的所有内容都是风格和致敬。一个原创角色,一套原创球衣,一个原创标题。没有生成或请求任何官方动漫角色,也没有使用任何真实足球运动员的名字或肖像。世界杯趋势被引用为一种 格式,因为这就是它的用途。
这种区别不是装饰性的。如果你在商业上制作动漫风格的内容,“以 90 年代 OVA 的风格”和“来自这个特定节目的这个特定角色”是不同的法律对象,只有一个是可持续的业务。
关于开放权重:H3 确实可以下载,人们在第一天就运行了。一位评论者报告说,在 16GB 的 4070 Ti Super 上,生成 10 秒 480p 片段需要 10 分钟,而其他人发布了在 5080 上需要 3 分钟,在 RTX 6000 Pro 上需要 68 秒。但自托管运行在 768 短边;产生 2K 的 Context-IR 和 Regenerate-2K 阶段仍然在 API 端。
许可证有一个真正的陷阱。社区许可证目前不涵盖欧盟、英国、韩国或美国,理由是这些地区“正在制定或执行 AI 相关法规”。一个正式的许可申请渠道是开放的,一位 HN 评论者将其总结为“你只需要小指承诺你不会惹恼迪士尼,他们就会给你发许可证”。这很有趣,而且如果你在四个地区之一,这也是你不能跳过的合规步骤。开放权重文章 有完整的地区列表。
常见问题
MiniMax H3 相比 Veo 3.1 是一个好的动漫视频生成器吗?
对于大多数动漫工作来说,是的,H3,而且主要是因为与渲染无关的原因。它支持 4 到 15 秒,而 Veo 只支持 4、6 或 8 秒;它提供六种宽高比,包括 4:3 和 21:9,而 Veo 只有两种;它在 11 种原生稳定对话语言中包括了日语;它接受九张参考图片,而 Veo 只接受三张。Veo 3.1 在一种特定情况下胜出:当你需要 seed 来重现镜头,或者需要 negative_prompt 来防止镜头漂移到 3D 渲染着色时。H3 没有这两个参数。如果你的流程依赖于任何一个,那是一个真正的理由来坚持使用 Veo。
Veo 3.1 能生成 4:3 或 15 秒的动漫片段吗?
不能,而且这不是风格原因。Veo 3.1 的 aspect_ratio 枚举只包含 16:9 和 9:16,其 duration 枚举只包含 4、6 和 8。没有 4:3 值可选,也没有办法请求 12 或 15 秒。如果你的参考是 90 年代电视动漫或 OVA,画幅在 Veo 上无法实现,而在 H3 上可以实现。
为什么我的 Veo 3.1 动漫片段无声地回来了?
因为 generate_audio 在 API 上默认为 false。工作台切换通常已经开启,所以这只影响直接调用 API 的人。请明确设置 generate_audio: true。同时,也设置 resolution,因为它默认为 720p,而不是你可能想要的 1080p 或 4k。
MiniMax H3 是否为动漫做日语对话和口型同步?
是的。模型卡列出了 11 种支持稳定对话的语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。音频与画面以 32 kHz 立体声同时生成,而不是事后配音,这就是为什么口型在整句台词中保持一致,而不仅仅是前几个音节。将日语台词直接写在提示词中,使用日语。
我可以使用多少张参考图片来保持动漫角色的一致性?
MiniMax H3 最多接受 9 张图片,最多 3 个视频片段和最多 3 个音频片段,所有类型的文件总数上限为 12 个。Veo 3.1 的参考生视频端点接受 1 到 3 张图片,选择该端点会将 duration 缩减为唯一合法的值 8。对于一个系列中反复出现的动漫角色,这个差异是决定性的。
MiniMax H3 有开放权重,所以我可以在本地免费运行我的动漫流程吗?
你可以下载并运行它,但有三个注意事项。自托管推理运行在 768 短边,产生 2K 输出的 Context-IR 和 Regenerate-2K 阶段仍然在 API 端。现实世界的本地速度因显卡而异:根据发布当天的 ComfyUI 帖子,在 4070 Ti Super 上生成 10 秒 480p 片段大约需要 10 分钟,在 5080 上大约需要 3 分钟,在 RTX 6000 Pro 上大约需要 68 秒。并且社区许可证目前不涵盖欧盟、英国、韩国或美国,所以如果你在这些地区,在商业使用之前需要获得正式许可证。






