整个夏天,我刷到的视频都是同一个内容在循环播放。世界杯球员被重绘成少年漫主角。一个独裁者。一个海盗船长。一个在最后四秒出现的老练导师。每条帖子数百万播放量,剧情几乎每场比赛后都会更新。
那些制作这些视频的人,没有人在写基准测试帖子。他们选一个模型,烧掉额度,赶在下一次开球前把东西发出去。
所以我拿了一个动漫关键帧和一条提示词,在相同输入下,将 MiniMax H3 和 Veo 3.1 都推到最高设置,进行了一次动漫视频生成测试。
第一个出问题的不是画质,而是一个下拉菜单。Veo 3.1 只到 8 秒,并且只提供两种宽高比。一个镜头要停留在一张脸上,用甩镜头跟随球,然后让标题卡落下,这 8 秒根本不够。它甚至没有机会在画质上失败。
关键要点
- Veo 3.1 的
duration枚举是[4, 6, 8],aspect_ratio枚举是[16:9, 9:16]。MiniMax H3 支持 4 到 15 的任意整数秒,并提供21:9, 16:9, 4:3, 1:1, 3:4, 9:16。Veo 没有 4:3,意味着根本无法使用复古 OVA 构图。 - H3 的模型卡列出了 11 种原生稳定的对话语言,日语是其中之一。音频和画面以 32 kHz 立体声一起生成,而非后期配音。
- 参考包不可同日而语:H3 最多可接受 9 张图片,外加最多 3 个视频和 3 个音频片段(总共最多 12 个文件)。Veo 3.1 的参考端点接受 3 张图片,而且一旦使用参考,
duration就坍缩到只有8。 - 两个会悄悄毁掉测试的陷阱:Veo 的 API 默认
generate_audio为false,resolution默认为720p;H3 的文生视频ratio默认是1:1。忽略这些,你就是在比较一个无声的 720p 片段和一个方形片段。 - Veo 3.1 保留了两个 H3 完全没有的东西:
seed和negative_prompt。对于 2D 动漫来说,第二个参数确实很重要,我会展示原因。
MiniMax H3 动漫视频生成器 vs Veo 3.1,同一帧画面的背靠背对比
一个原创角色。一个关键帧。一条提示词,逐字复制到两个模型中。其他所有设置各取最大值。
MiniMax H3,图生视频,2K,8 秒,原生音频。打开声音:人群的底噪、击球声和日语的喊叫都是在生成画面的同时生成的。使用 Atlas Cloud 上的 minimax/h3/image-to-video 生成。
Veo 3.1,图生视频,1080p,8 秒,手动打开 generate_audio,加上保持线稿平坦的 negative_prompt。相同的首帧,相同的文字。使用 Atlas Cloud 上的 google/veo3.1/image-to-video 生成。
两者都画得很漂亮。Veo 的击球广角镜头,带有手绘的冲击线和漂浮在空中的漫画音效,真的非常可爱。这是诚实的起点,也是为什么本文接下来讨论的是参数和指令遵循,而不是感觉。
为什么大多数 MiniMax H3 动漫视频生成器 vs Veo 3.1 的测试会出错
今年夏天同时发生了两件事。
动漫成为了 AI 视频中最高产的形式。2026 年世界杯被改写成一个少年漫画锦标赛,球员被塑造成独裁者、海盗船长、海军上将和导师,剧情在 TikTok、Instagram、X 和 YouTube 上“几乎每场比赛后都会演变”(Complex,2026 年 7 月)。
而 MiniMax H3 发布了开放权重。上线当天的 ComfyUI 讨论串达到了 330 分和 95 条评论,数小时内人们就发布了真实的本地运行数据(Hacker News,2026 年 8 月)。
把这两件事放在一起,你可能会期待一堆动漫对比。但几乎没有,因为大多数测试都以四种方式之一构建错误。
他们在比较画面,而不是比较约束条件。 动漫镜头是时机的艺术。一个甩镜头切到标题卡,首先是一个时长问题,然后才是渲染问题。
他们忘了 Veo 的 API 默认是无声的。 在 API 上,generate_audio 是 false,resolution 是 720p。很多“Veo 在动漫里没有音频”的帖子,只是有人没翻转一个布尔值。
他们忘了 H3 的文生视频默认是方形的。 ratio 默认是 1:1,不是 16:9。如果没设置这个参数就运行一个 t2v 动漫提示词,你会得到一个方形剪辑和困惑的结论。
他们用照片级提示词测试。 “电影感、体积光、浅景深”正是那种会把 2D 模型拖向 3D 渲染阴影的词汇。在动漫中,失败模式不是模糊,而是塑料感。
三个在运行前就决定动漫测试结果的设置
在开始之前,必须在两边设置好这些,否则对比无效。
| 设置 | MiniMax H3 | Veo 3.1 | 如果跳过会发生什么 |
|---|---|---|---|
| 音频 | 与画面一起生成,始终开启 | generate_audio 默认为 false | Veo 返回无声片段,看起来比实际差 |
| 画面形状 | 文生视频 ratio 默认为 1:1 | aspect_ratio 默认为 16:9 | H3 给你一个无法使用的方形动漫剪辑 |
| 分辨率 | 默认为 2K | 默认为 720p | 你在比较 2K 和 720p,并称之为画质差距 |
想亲自测试 MiniMax H3 和 Veo 3.1 在相同动漫提示词下的表现?Atlas Cloud 的模型对比 可以一次运行它们——相同提示词和设置,生成前显示成本。

Atlas Cloud 模型对比中,MiniMax H3 和 Veo 3.1 在相同动漫提示词下的对比——相同设置,生成前显示价格。实时截图自 model-explorer。
MiniMax H3 vs Veo 3.1 动漫规格表:时长、比例、音频、参考
我拉取了两个模型的实时输入 schema,而不是相信任何发布帖子。下面的每个值都是你可以在模型页面上自己读到的枚举,而非印象。
表 1:MiniMax H3 vs Veo 3.1,决定动漫镜头的参数
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| 时长 | 4 到 15,每整数秒(默认 8) | 4, 6, 8(默认 8) |
| 宽高比 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| 比例默认(文生视频) | 1:1 | 16:9 |
| 分辨率 | 768P, 2K(默认 2K) | 720p, 1080p, 4k(默认 720p) |
| 音频 | 联合生成,32 kHz 立体声 | generate_audio,默认 false |
| 原生对话语言 | 11 种稳定,包含日语 | 未作为稳定列表发布 |
| 参考包 | 最多 9 张图片,3 个视频,3 个音频片段,总共 12 个文件 | 3 张图片 |
| 使用参考时的时长 | 仍然 4 到 15 | 坍缩到只有 8 |
| seed | 不可用 | 可用 |
| negative_prompt | 不可用 | 可用 |
| 权重 | 可下载 | 封闭 |
时长、比例、分辨率、音频和参考限制来自以下页面的实时 schema:MiniMax H3 图生视频、H3 文生视频、H3 参考生视频、Veo 3.1 图生视频 和 Veo 3.1 参考生视频。9 张图片和 12 个文件的上限以及 11 种语言对话列表来自 MiniMax H3 模型卡(Hugging Face,2026 年 8 月)。
现在来看排行榜,因为它们比规格表说明了一些不同的东西,而且两者都很重要。
表 2:众包投票 Elo 和每分单价,2026 年 8 月 7 日快照
| 模型 | 文生视频(含音频) | 图生视频(含音频) | 美元/分钟 |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | 未列入前十 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | 未列入前十 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | 未列入前十 | $4.80 |
Elo 和价格数据来自 Artificial Analysis Video Arena(Artificial Analysis,2026 年 8 月)。这些是滚动众包投票,数据会变动。美元/分钟列是标准化的模型估算,并非你的实际账单。
145 点的 Elo 差距很大,但这是一个通用投票,不是动漫投票。而且这里我必须直说:MiniMax 并未将 H3 定位为动漫模型。内部一线反馈将电影、动画和喜剧剧情列为 H3 不针对的领域。所以有趣的问题不是“哪个是动漫模型”,而是为什么一个不主打动漫的模型仍然赢得了这个镜头,以及谷歌在哪些地方仍然能扳回一局。
在教程之前有一个实用说明。下面的每个模型都通过同一个控制台和同一个 API 密钥运行,这是参数具有可比性的唯一原因。同一个队列,同一个认证,同一张账单。如果你在一个服务上设置 GPT Image 2,在另一个服务上设置 Veo,那么你发现的一半差异将是基础设施问题,而不是模型问题。
构建镜头:MiniMax H3 vs Veo 3.1,一步步来
一个完整的运行示例。“最后哨声”:一个原创的青少年前锋,红发,白色和深蓝色 9 号球衣,泛光灯,一个击球时的甩镜头,以及一个必须在最后两秒落下并保持稳定的日语标题卡。
没有真实球员,没有官方角色,没有现有动漫 IP。只有风格和致敬。稍后会详细说明原因。
步骤 1:用 GPT Image 2 设计动漫关键帧
关键帧承载了艺术方向,这样视频模型就不必自己发明了。注意左侧三分之一处的负空间:这是故意的。标题卡将由视频模型写在那里,这是文本稳定性测试。
Plain1A single frame from a modern shonen sports anime. Cel-shaded 2D animation, hand-inked 2line art with consistent line weight, flat colour fills, hard-edged graphic shadows, 3absolutely no 3D shading and no photoreal skin. Close-up on an original teenage striker: 4messy dark-red hair, white-and-navy kit with the number 9, sweat and grass streaks across 5one cheek, eyes wide with exhausted determination, mouth open mid-shout. Behind him, 6stadium floodlights blaze into a wall of blurred crowd colour; radial speed lines burst 7from the centre of frame; one blade of grass hangs frozen in the air. Saturated palette, 8deep cyan shadows, warm orange rim light. 16:9 composition, the character framed right of 9centre, clean negative space on the left third. No text anywhere in the image.
设置:模型 openai/gpt-image-2/text-to-image,质量 high,尺寸 16:9 (2048x1152)。没有其他设置。

Atlas Cloud 上的 GPT Image 2 工作台,包含 Last Whistle 关键帧提示词,以及输出面板中完成的动漫帧
Atlas Cloud 上的 GPT Image 2:质量设置为高,右侧是完成的关键帧。

基础动漫关键帧:一个原创的红发前锋在球场泛光灯下喊叫,赛璐珞风格,纯色填充和速度线
两个模型接收到的关键帧。纯色、硬阴影,以及一个等待标题卡的空左三分之一。
步骤 2:MiniMax H3 图生视频,所有设置最大化
同样的图片输入,2K 输出。这里我让 H3 只跑 8 秒,以匹配 Veo 的上限。这不是 H3 的限制,步骤 4 将解除这个上限。
Plain1Cel-shaded 2D anime, hand-inked line weight, flat colour, no 3D shading. Hold on the 2striker's face for one beat, then a violent whip pan follows the ball as he strikes it, 3the pan smearing the frame into streaked sakuga motion trails. One frame of total silence 4at impact. Over the final two seconds, bold white Japanese title lettering reading 5ラストホイッスル punches onto the left third of frame and holds rock-steady, no warping, 6no flicker, no drift. The striker shouts one line in Japanese: 「まだ終わってない!」 7Audio: stadium roar swelling, a single sharp ball-strike impact, a low taiko hit under the 8title card.
设置:模型 minimax/h3/image-to-video,resolution: 2K,duration: 8,ratio: adaptive(图生视频会从你的输入图片获取画面形状),image = 步骤 1 的输出。
一个警告:如果你改用文生视频,请明确写出 ratio: 16:9。默认是 1:1,它会愉快地给你一个方形动漫剪辑。

Atlas Cloud 上的 MiniMax H3 图生视频工作台,包含 Last Whistle 提示词,已加载关键帧,输出面板中显示完成的片段
Atlas Cloud 上的 MiniMax H3 图生视频:左侧加载了步骤 1 的关键帧,右侧播放完成的片段。
步骤 3:Veo 3.1 图生视频,手动打开音频
提示词完全相同,逐字逐句。改变一个形容词,它就不再是对比了。改变的是 Veo 给你而 H3 没有的额外字段。
negative_prompt,对于 2D 动漫来说,这是列表中最有用的控制:
Plain13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
设置:模型 google/veo3.1/image-to-video,resolution: 1080p(注意修改,默认是 720p),duration: 8(这是上限),aspect_ratio: 16:9,generate_audio: true(API 默认是 false,这是无声片段的陷阱),seed: 20260807,image = 相同的步骤 1 输出。

Atlas Cloud 上的 Veo 3.1 图生视频工作台,显示已启用生成音频,已加载动漫关键帧,输出面板中显示完成的片段
Atlas Cloud 上的 Veo 3.1 图生视频,已打开 Generate Audio,右侧是完成的片段。
步骤 4:在五个动漫特定维度上评分
这里不需要生成任何东西。只需要看,看在动漫真正会出问题的点上。两个片段都嵌入在本文顶部附近,你可以自己评分,而不是相信我的话。

两个片段最后一帧的并排对比,左侧 MiniMax H3 显示清晰的日语标题文字,右侧 Veo 3.1 显示乱码的垂直字符
每个片段的最后一帧。左侧,H3 写下了 ラストホイッスル,所有八个片假名正确且稳定。右侧,Veo 3.1 写了三个字符,既不是请求的单词,也不构成一个单词。
标题卡是决定胜负的地方,而且差距很大。H3 精确地渲染了请求的片假名,边缘锐利且稳定,覆盖在球门区的条纹甩镜上。Veo 3.1 产生了一个垂直堆叠的三个字符,既不是请求的单词也不是一个单词。在同一帧上,它还将角色移出了画面,并让背景滑向半照片级的球场画面,尽管 photorealistic skin 和 3D render 就在负面提示词中。
表 3:决定动漫镜头的五个维度,基于这两次运行
| 维度 | MiniMax H3 | Veo 3.1 |
|---|---|---|
| 来自关键帧的角色连续性 | 在完整的 8 秒内保持了精确的脸部、头发和球衣 | 重新绘制了角色,在一个新的广角镜头中,形象符合但是一幅不同的画 |
| 线条粗细和纯色赛璐珞阴影 | 保持,没有向 3D 漂移 | 在中景中保持,但到结束时漂移到了照片级的球场画面 |
| 日语标题卡 | ラストホイッスル 渲染正确且稳定 | 三个字符,不是请求的单词,也不是一个单词 |
| 交付的音频轨道 | 32 kHz 立体声,与模型卡说明完全一致 | 48 kHz 立体声,仅因为我手动设置了 generate_audio 才存在 |
| 甩镜头和作画动态模糊 | 执行为一个模糊的甩镜进入标题 | 替换为一个硬切到新的设置 |
最后一行是目前对 H3 最响亮的公开批评,也正是我把它写进两个提示词的原因。在发布当天的 ComfyUI 讨论串中,用户 fwip 抱怨即使是官方演示的提示词也被忽略了:“一个剧烈的甩镜头从屋顶离开,将飘浮的文字一起甩掉,拖出运动条纹。而视频根本没有做任何过渡,只是用了一个切。”
在这次运行中,是 Veo 把甩镜头换成了切,而 H3 执行了模糊。每次运行只有一次结果,不能作为定论,我也不想这么说。但这确实意味着这个批评不是 H3 特有的:甩镜头是整个测试中两边最不可靠的指令。如果你的分镜依赖甩镜头,请围绕它而不是通过它来规划分镜。
步骤 5:Veo 3.1 结构上无法输出的 4:3 复古 OVA 剪辑
这不是一个质量偏好。这是一堵墙。Veo 的 aspect_ratio 枚举只有两个值,都不是 4:3,而它的 duration 枚举没有 12。90 年代的 OVA 造型根本不可实现。
Plain1A 1990s OVA anime cut, 4:3 full-frame. Hand-painted background art with visible brush 2texture, cel-paint characters with thick uneven ink lines, heavy halation glow around the 3floodlights, 16mm film grain and faint gate weave. The same red-haired striker in a 4white-and-navy number 9 kit walks off a rain-soaked pitch as the crowd noise fades to a 5single ringing tone. Camera pushes in slowly on his face. He says quietly in Japanese: 6「次は、勝つ」. Retro palette: muted teal, dusty amber, deep maroon shadows. Audio: 7distant rain, a lone analogue synth pad, one reverb-heavy whistle in the far distance.
设置:模型 minimax/h3/text-to-video,resolution: 2K,duration: 12,ratio: 4:3。手动设置这个比例,记住默认值。

Atlas Cloud 上的 MiniMax H3 文生视频工作台,输入了 OVA 提示词,输出面板中显示完成的复古片段
Atlas Cloud 上的 MiniMax H3 文生视频,输入了 OVA 提示词,片段已完成。完全披露:这一次运行把 Aspect Ratio 留在了 16:9,Duration 留在了 8,所以你在右边看到的是宽屏的短版本。下面 4:3 的 12 秒版本来自明确设置了 ratio: 4:3 和 duration: 12 的 API 调用。

4:3 复古 OVA 剪辑:同一个前锋以 90 年代动漫风格走下被雨水浸透的球场
H3 文生视频,4:3,12 秒。交付的文件是 1920x1440,精确到像素的 4:3,带有 32 kHz 立体声轨道。这里以降低帧率的无声 GIF 显示,以保持页面轻量。使用 Atlas Cloud 上的 minimax/h3/text-to-video 生成。
步骤 6:九张参考图片,一个角色,四个剪辑
跨镜头角色一致性是 AI 动漫中最难的问题,而它通过参考数量来解决。首先构建参考包:重新运行步骤 1 的提示词,将构图分别改为正面、四分之三面、全侧面、背面、大笑、咬牙切齿、全身站姿、球衣细节和球鞋细节。九张图片,总共大约八美分。

同一个原创前锋角色的四个角度,作为参考包生成,排列成 2x2 网格
九个参考角度中的四个。H3 在一个参考包中最多接受九张图片,外加视频和音频参考。
Plain1Cel-shaded 2D anime, consistent hand-inked line weight, flat colour, no 3D shading. Keep 2the referenced striker's face, hair silhouette and number 9 kit identical across every cut. 3Four cuts in one continuous take: (1) low-angle push-in on his boots hitting the turf, 4(2) whip-pan up to a tight close-up of his eyes, (3) wide shot of him sprinting past three 5defenders drawn as blurred silhouettes, (4) freeze on a mid-air header, speed lines 6exploding outward. Audio: crowd roar, breath, boot-on-turf impacts, one taiko hit on the 7freeze.
设置:模型 minimax/h3/reference-to-video,refers = 你的图片,带 type: image,resolution: 2K,duration: 8 或更高,ratio: adaptive 或 16:9。
Veo 3.1 的等效功能无法在这些设置下运行,你也不需要试就知道原因。它的参考端点最多接受三张图片,而且选择该端点会将 duration 坍缩到唯一合法的值 8。九张图片的包和 10 秒的镜头都不在范围内。

Atlas Cloud 上的 MiniMax H3 参考生视频工作台,显示参考计数器为 4/9,输出面板中显示第一个剪辑
Atlas Cloud 上的 MiniMax H3 参考生视频。计数器显示 Reference Materials (4/9),下方有 MAX:9,这是界面中的上限,而非规格表中的声明。输出是第一个剪辑,即靴子的低角度推进镜头。
另外四个值得一试的 MiniMax H3 动漫视频生成器运行
Last Whistle 镜头只测试了其中四个差异。下面这四个测试了其余部分。它们都在 H3 上运行;注释说明了哪些是 Veo 3.1 可以匹配的。
- 超宽幅作画战斗,
21:9,10 秒。 Veo 根本无法输出 21:9。
Plain1Cel-shaded 2D anime action, thick tapered ink lines, flat colour, hard-edged shadows, 2no 3D shading. Two original masked duelists on a windswept temple roof at dusk. Blade 3clash, the frame shudders, both fighters break apart in a burst of hand-drawn impact 4frames and radial speed lines. Camera: low-angle push-in, then a lateral track, then a 5snap to a wide silhouette against the orange sky. Audio: two sharp metal clashes, cloth 6snap, a low taiko hit on the final freeze, no music.
- 节拍同步的 AMV 剪辑,带音频参考的参考生视频。 H3 最多接受三个音频片段作为参考输入。Veo 3.1 没有音频输入,只有音频输出。
Plain1Cel-shaded 2D anime montage cut to the referenced audio track. Five short beats: rain on 2a window, a hand tightening a bandage, a city skyline flashing past a train window, a 3sprint start, a freeze on an outstretched hand. Every cut lands exactly on a downbeat of 4the referenced audio. Flat colour, thick ink lines, high-contrast night palette of deep 5indigo and neon magenta.
- 两行日语对话场景,12 秒。 这是唇形同步的压力测试,12 秒已经超出了 Veo 的范围。
Plain1Cel-shaded 2D anime, flat colour, no 3D shading. Two original characters on a rooftop at 2golden hour, shot reverse shot. First says in Japanese:「本当に行くの?」. The second 3answers, half-smiling, in Japanese:「もう決めた」. Mouths match every syllable. Warm rim 4light, long shadows, gentle wind in hair. Audio: two distinct Japanese voices, distant 5traffic, one cicada.
- 竖屏少年漫画短片,
9:16,8 秒。 两个模型都能做竖屏,所以这是唯一一个可以真正 A/B 测试而不是假设的地方。
Plain1Cel-shaded 2D anime, vertical composition. An original teenage runner bursts through a 2paper banner in slow-motion, then the frame snaps back to full speed as she accelerates 3down a stadium straight. Speed lines, flat colour, hard shadows, bold graphic sky. 4Camera: low-angle follow shot, then a whip up to her face. Audio: banner tear, crowd 5surge, one breath held then released.
如果你想了解这些提示词背后的语法,MiniMax H3 提示词指南 比我在这里能更深入地介绍 H3 如何解析相机和音频指令。
MiniMax H3 vs Veo 3.1 上 60 秒动漫开场曲的成本
一个标准的动漫 OP 大约是 90 秒。假设八个 8 秒的镜头,共 64 秒成品视频,加上每个镜头一个关键帧,每个 $0.009。
有一个真实的定价差异,你应该知道,而不是让我粉饰过去。Atlas Cloud 目录将 MiniMax H3 列为 $0.10/秒,而模型自述文件将其分解为 2K 时 $0.14/秒,768P 时 $0.10/秒。Veo 3.1 列为 $0.20/秒,而其自述文件将含音频的 $0.40/秒和不含音频的 $0.20/秒分开。
我的截图中的运行按钮说明了问题。H3 参考生视频,8 秒 2K,报价 Run $1.12,正好是 $0.14/秒。Veo 3.1 图生视频,8 秒 1080p 含音频,报价 Run $3.2,正好是 $0.40/秒。所以自述文件中的费率是实际收费的,而目录标题是入门层级。不过下面我还是展示了两个读数。这些是 2026 年 8 月的标价。
表 4:八个 8 秒镜头,包含关键帧
| 设置 | 视频成本(目录费率) | 视频成本(自述文件费率) | 关键帧 | 总范围 |
|---|---|---|---|---|
| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 to $9.03 |
| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1, 1080p 含音频 | $12.80 | $25.60 | $0.07 | $12.87 to $25.67 |
| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 |
价格来自表 1 中链接的 Atlas Cloud 模型页面,2026 年 8 月。这四种目前都没有折扣。
该表不包括两件事,两者都比每秒费率影响更大。
重试。 没有人会直接发布动漫镜头的第一次生成。无论你假设的乘数是多少,应用到两列,差距将以相同比例扩大。
挂钟时间,这一点方向相反。 2026 年 8 月 7 日从头到尾计时:H3 在 2K 下 8 秒耗时 447 秒,约 7.5 分钟。H3 文生视频在 2K 下 12 秒耗时 334 秒。Veo 3.1 在 1080p 下 8 秒含音频耗时 152 秒,不到 3 分钟。Veo 在这里大约快三倍,如果你在凌晨 2 点迭代一个镜头,这值真金白银。队列会变化,所以把这些看作一个下午的快照,而不是规格。但任何引用“2 到 3 分钟”来指代 H3 在 2K 下的人,都是在引用自述文件,而不是队列。2K 对比 768P 分析 涵盖了何时更高的层级值得额外的几分钟。
动漫风格、致敬以及你实际可以发布的内容
本文中的所有内容都是风格和致敬。一个原创角色,一套原创球衣,一个原创标题。没有生成或请求任何官方动漫角色,也没有使用任何真实足球运动员的姓名或肖像。世界杯趋势被引用为一种格式,因为它正是以这种形式发挥作用的。
这个区别不是装饰。如果你在商业上制作动漫风格的内容,“以 90 年代 OVA 的风格”和“这个特定节目中的这个特定角色”是不同的法律实体,只有一个是商业行为。
关于开放权重:H3 确实可以下载,人们在第一天就跑了。一位评论者报告说,在 16GB 的 4070 Ti Super 上,10 秒 480p 的片段需要 10 分钟,其他人报告说在 5080 上需要 3 分钟,在 RTX 6000 Pro 上需要 68 秒。但自托管运行在 768 短边;产生 2K 输出的 Context-IR 和 Regenerate-2K 阶段保留在 API 端。
许可证有一个真正的陷阱。社区许可证目前不涵盖欧盟、英国、韩国或美国,理由是这些地区“正在制定或执行与 AI 相关的法规”。一个正式的许可申请渠道是开放的,一位 HN 评论者总结道:“你只需用小指发誓你不会让迪士尼生气,他们就会给你发许可证。”有趣,而且如果你在四个地区之一,这恰恰是你不能跳过的合规步骤。开放权重分析 有完整的地区列表。
常见问题解答
与 Veo 3.1 相比,MiniMax H3 是一个好的动漫视频生成器吗?
对于大多数动漫工作,答案是肯定的,H3,这主要是因为渲染之外的原因。它支持 4 到 15 秒,而 Veo 只支持 4、6 或 8 秒;它提供六种宽高比,包括 4:3 和 21:9,而 Veo 只有两种;它将日语列为 11 种原生稳定对话语言之一;它最多可接受九张参考图片,而 Veo 只有三张。Veo 3.1 在一种特定情况下胜出:当你需要 seed 来进行可重复的重新拍摄,或者需要 negative_prompt 来阻止镜头漂移到 3D 渲染阴影时。H3 没有这两个参数。如果你的流程依赖于其中任何一个,这确实是一个值得继续使用 Veo 的理由。
Veo 3.1 能生成 4:3 或 15 秒的动漫片段吗?
不能,而且这不是风格原因。Veo 3.1 的 aspect_ratio 枚举只包含 16:9 和 9:16,duration 枚举只包含 4、6 和 8。没有可选的 4:3 值,也没有办法请求 12 或 15 秒。如果你的参考是 90 年代的电视动画或 OVA,那么构图在 Veo 上无法实现,而在 H3 上可以实现。
为什么我的 Veo 3.1 动漫片段无声地返回了?
因为 API 上的 generate_audio 默认为 false。工作台上的开关通常已经打开,所以这只会影响直接调用 API 的人。明确设置 generate_audio: true。同时,也要设置 resolution,因为它默认为 720p,而不是你很可能想要的 1080p 或 4k。
MiniMax H3 支持日语对话和动漫的唇形同步吗?
是的。模型卡列出了 11 种具有稳定对话支持的语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。音频与画面一起以 32 kHz 立体声生成,而不是事后配音,这就是为什么整个句子中的嘴巴时机都能保持,而不只是前几个音节。直接将日语台词用日语写入提示词。
我可以使用多少张参考图片来保持动漫角色的一致性?
MiniMax H3 最多接受 9 张图片、最多 3 个视频片段和最多 3 个音频片段,所有类型合计最多 12 个文件。Veo 3.1 的参考生视频端点接受 1 到 3 张图片,并且选择该端点会将 duration 坍缩到只有 8 作为唯一合法值。对于一个系列中反复出现的动漫角色来说,这个差异就是整场比赛的关键。
MiniMax H3 有开放权重,所以我可以在本地免费运行我的动漫流程吗?
你可以下载并运行它,但有三个注意事项。自托管推理在 768 短边运行,产生 2K 输出的 Context-IR 和 Regenerate-2K 阶段保留在 API 端。现实世界的本地速度因显卡而异:根据发布当天的 ComfyUI 讨论串,在 4070 Ti Super 上,10 秒 480p 的片段大约需要 10 分钟;在 5080 上大约需要 3 分钟;在 RTX 6000 Pro 上大约需要 68 秒。而且社区许可证目前不涵盖欧盟、英国、韩国或美国,所以如果你在这些地区,在商业使用之前需要正式许可证。






