整个夏天,我的信息流一直在循环播放同一个视频。世界杯球员被重新画成少年主角。一个独裁者。一个海盗船长。一个在最后四秒出现的老练导师。每条帖子数百万观看量,几乎每场比赛后剧情都会更新。
制作这些视频的人不是在写基准测试帖子。他们挑选一个模型,消耗积分,然后在下次开球前发布。
所以我拿了一个动漫关键帧和一个提示词,在相同的输入下,将MiniMax H3作为动漫视频生成器与Veo 3.1进行测试,两者都设为最高设置。
第一个出问题的不是图像质量,而是一个下拉框。Veo 3.1只生成8秒,并且只提供两种宽高比。一个镜头要表现脸部特写、跟着球的甩镜头,然后让标题卡落下,8秒内根本不够。它根本没有机会在质量上失败。
关键要点
- Veo 3.1的
duration枚举是[4, 6, 8],其aspect_ratio枚举是[16:9, 9:16]。MiniMax H3支持从4到15的任意整数秒,并提供21:9, 16:9, 4:3, 1:1, 3:4, 9:16。Veo没有4:3,意味着根本无法实现复古OVA的取景。 - H3的模型卡列出了11种原生稳定的对话语言,日语是其中之一。音频和画面以32kHz立体声同时生成,不是后期配音。
- 参考素材包差距很大:H3最多接受9张图片加上最多3个视频和3个音频文件(最多12个文件)。Veo 3.1的参考端点接受3张图片,一旦使用参考,
duration就固定为[8]。 - 两个会悄悄破坏测试的陷阱:Veo的API默认
generate_audio为false,resolution默认为720p;H3的文本转视频ratio默认是1:1。如果不设置这些,你就是在比较一个无声的720p片段和一个正方形片段。 - Veo 3.1拥有H3完全没有的两个功能:
seed和negative_prompt。对于2D动漫来说,后者确实重要,我后面会展示。
MiniMax H3 动漫视频生成器 vs Veo 3.1,相同的帧画面背靠背对比
一个原创角色。一个关键帧。一个提示词,逐字符复制到两个模型中。其他所有设置都各自调到最高。
MiniMax H3,图生视频,2K,8秒,原生音频。打开声音:人群背景音、击球声和日语喊叫声都是与画面同时生成的。使用Atlas Cloud上的minimax/h3/image-to-video生成。
Veo 3.1,图生视频,1080p,8秒,手动开启generateaudio,并添加了negativeprompt以保持线条平涂。相同的第一帧,相同的提示词。使用Atlas Cloud上的google/veo3.1/image-to-video生成。
两者都画得很漂亮。Veo的击球广角镜头,配有手绘冲击线和飘浮在空中的漫画拟声词,确实很可爱。这是诚实的起点,也是为什么本文其余部分将讨论参数和指令遵循,而不是感觉。
为什么大多数MiniMax H3动漫视频生成器 vs Veo 3.1的测试都错了
今年夏天同时发生了两件事。
动漫成为AI视频中产量最高的格式。2026年世界杯被改写成一个少年锦标赛,球员被塑造成独裁者、海盗船长、海军将军和导师,剧情“几乎每场比赛后都会更新”,跨越TikTok、Instagram、X和YouTube(Complex,2026年7月)。
MiniMax H3发布了开放权重。第0天的ComfyUI帖子获得了330分和95条评论,人们在几小时内就发布了真实的本地运行数据(Hacker News,2026年8月)。
把这两件事放在一起,你会期待看到大量动漫对比。但几乎都没有,因为大多数测试都以四种方式之一构建错误。
他们比较的是画面,而不是约束条件。 动漫镜头讲究的是时机。一个甩镜头接标题卡,在渲染问题之前首先是个时长问题。
他们忘了Veo的API默认是无声的。 在API上,generate_audio默认为false,resolution默认为720p。很多“Veo在动漫中没有音频”的帖子,只是有人从未翻转过布尔值。
他们忘了H3的文本转视频默认是正方形的。 ratio默认是1:1,不是16:9。不设置这个参数直接运行t2v动漫提示词,你会得到一个正方形片段和混乱的结论。
他们使用逼真风格提示词进行测试。 “电影感、体积光、浅景深”正是那种会把2D模型拖向3D渲染着色的词汇。动漫的失败模式不是模糊,而是塑料感。
三个决定动漫测试成败的设置,在按下运行按钮前必须设置
在设置好这些之前,对比是无效的。
| 设置 | MiniMax H3 | Veo 3.1 | 如果跳过会怎样 |
|---|---|---|---|
| 音频 | 与画面同时生成,始终开启 | generate_audio 默认为 false | Veo返回无声片段,看起来比实际差 |
| 画面形状 | 文本转视频 ratio 默认为 1:1 | aspect_ratio 默认为 16:9 | H3给你一个无法使用的正方形动漫片段 |
| 分辨率 | 默认为 2K | 默认为 720p | 你在比较2K和720p,并称之为质量差距 |
MiniMax H3 vs Veo 3.1 动漫规格表:时长、比例、音频、参考素材
我直接从两个模型当前的输入模式中提取数据,而不是相信任何发布文章。下面的每个值都是你可以在模型页面上自己看到的枚举值,不是主观印象。
表1:MiniMax H3 vs Veo 3.1,决定动漫镜头的参数
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| 时长 | 4到15,每整秒(默认8) | 4, 6, 8(默认8) |
| 宽高比 | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| 文本转视频默认比例 | 1:01 | 16:09 |
| 分辨率 | 768P, 2K(默认2K) | 720p, 1080p, 4k(默认720p) |
| 音频 | 联合生成,32 kHz立体声 | generate_audio,默认为false |
| 原生对话语言 | 11种稳定,包括日语 | 未作为稳定列表发布 |
| 参考素材包 | 最多9张图片,3个视频,3个音频文件,总共12个文件 | 3张图片 |
| 使用参考素材时的时长 | 仍然4到15 | 仅固定为8 |
| seed | 不可用 | 可用 |
| negative_prompt | 不可用 | 可用 |
| 权重 | 可下载 | 封闭 |
时长、比例、分辨率、音频和参考素材限制来自MiniMax H3图生视频、H3文本转视频、H3参考素材转视频、Veo 3.1图生视频和Veo 3.1参考素材转视频的实时模式页面。9张图片和12个文件的参考上限以及11种语言对话列表来自MiniMax H3模型卡(Hugging Face,2026年8月)。
现在看排行榜,因为排行榜和规格表说法不同,但两者都很重要。
表2:众投Elo和每分钟列表价格,2026年8月7日快照
| 模型 | 文本转视频(带音频) | 图生视频(带音频) | 美元/分钟 |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | 未进入前十 | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | 未进入前十 | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | 未进入前十 | $4.80 |
Elo和价格数据来自Artificial Analysis Video Arena(Artificial Analysis,2026年8月)。这些是滚动众投结果,会发生变化。$/分钟列是标准化模型估算,不是你的实际发票。
145分的Elo差距很大,但这是通用投票,不是针对动漫的。而且这里我必须直说:MiniMax并没有将H3作为动漫模型来营销。内部一线反馈将电影、动画和喜剧剧情列为H3 不 针对的领域。所以有趣的问题不是“哪个是动漫模型”,而是为什么一个不以动漫为卖点的模型仍然赢得了镜头,而Google在哪些方面仍然胜出。
在教程之前有一个实用说明。下面的每个模型都通过同一个控制台和同一个API密钥运行,这是参数可比较的唯一原因。相同的队列,相同的认证,一张账单。如果你在一个服务上设置GPT Image 2,在另一个服务上设置Veo,你发现的一半差异将来自管道,而不是模型本身。
构建镜头:MiniMax H3 vs Veo 3.1,逐步操作
一个连续运行的示例,从头到尾。“最后哨声”:一个原创的青少年前锋,红发,白色和海军蓝9号球衣,泛光灯,关于击球的甩镜头,以及一个必须在最后两秒出现并稳定保持的日语标题卡。
没有真实球员,没有官方角色,没有现有动漫IP。只有风格和致敬。稍后详细说明原因。
第1步:使用GPT Image 2设计动漫关键帧
关键帧承载美术方向,这样视频模型就不必自己发明。注意左侧三分之一处的负空间:这是故意的。标题卡将由视频模型写在那里,这就是文本稳定性测试。
Plain1一帧现代少年体育动漫的画面。赛璐珞风格的2D动画,手绘墨线,线条粗细一致,纯色填充,硬边图形阴影,绝对不能有3D阴影或逼真皮肤。特写一个原创的青少年前锋:凌乱深红色头发,白色和海军蓝球衣,号码9,一侧脸颊有汗水和草痕,睁大眼睛,疲惫而坚定,嘴巴张开,正在呐喊。他身后,体育场泛光灯照亮了一堵模糊的观众色彩墙;径向速度线从画面中心爆发;一根草叶悬在空中。饱和色调,深青色阴影,暖橙色边缘光。16:9构图,角色位于画面右侧中心,左侧三分之一处干净留白。图像中没有任何文字。
设置:模型 openai/gpt-image-2/text-to-image,质量 high,尺寸16:9(2048x1152)。没有其他设置。

Atlas Cloud上的GPT Image 2工作区,包含Last Whistle关键帧提示词和输出面板中完成的动漫帧
Atlas Cloud上的GPT Image 2:质量设为高,右侧是完成的关键帧。

基础动漫关键帧:一个原创的红发前锋在体育场泛光灯下呐喊,赛璐珞风格,纯色和速度线
两个模型接收的关键帧。纯色,硬阴影,左侧三分之一空白等待标题卡。
第2步:MiniMax H3图生视频,全高设置
输入相同的图片,输出2K。这里我仅将H3限制在8秒,以匹配Veo的上限。这不是H3的极限,第4步会解除限制。
Plain1赛璐珞风格2D动漫,手绘墨线,纯色,无3D阴影。在前锋脸上停留一拍,然后随着他击球,一个剧烈的甩镜头跟随球,画面模糊成条纹状的作画运动轨迹。击球瞬间有一帧完全静默。在最后两秒内,粗体白色日语标题文字「ラストホイッスル」出现在画面左侧三分之一处,并保持稳定,无变形、无闪烁、无漂移。前锋用日语喊出一句台词:「まだ終わってない!」。音频:体育场欢呼声增强,一次尖锐的击球声,在标题卡下出现一个低沉的太鼓声。
设置:模型 minimax/h3/image-to-video,resolution: 2K,duration: 8,ratio: adaptive(图生视频从输入图像获取画面形状),image = 第1步的输出。
如果你改用文本转视频,请提醒自己:必须明确写出 ratio: 16:9。默认是 1:1,它会愉快地给你一个正方形的动漫片段。

Atlas Cloud上的MiniMax H3图生视频工作区,包含Last Whistle提示词、加载的关键帧和输出面板中的完成片段
Atlas Cloud上的MiniMax H3图生视频:左侧加载了第1步的关键帧,右侧播放着完成的片段。
第3步:Veo 3.1图生视频,手动开启音频
提示词完全相同,逐字逐句。改变任何一个形容词,就不再是对比了。改变的是Veo提供而H3没有的额外字段。
negative_prompt,对于2D动漫来说,这是这个列表中最重要的单个控制:
Plain13D渲染,CGI,塑料着色,逼真皮肤,真人实拍画面,运动模糊糊状,变形文字,乱码文本,多余手指,字幕条
设置:模型 google/veo3.1/image-to-video,resolution: 1080p(需要更改,默认是720p),duration: 8(这是上限),aspect_ratio: 16:9,generate_audio: true(API默认是false,这是无声片段的陷阱),seed: 20260807,image = 相同的第1步输出。

Atlas Cloud上的Veo 3.1图生视频工作区,显示已启用生成音频,加载了动漫关键帧,输出面板中有完成的片段
Atlas Cloud上的Veo 3.1图生视频,已开启生成音频,右侧是完成的片段。
第4步:在五个动漫特定维度上评分
这里不需要生成任何东西。只需根据动漫实际出问题的点来观察。两个片段都嵌入在本文顶部附近,你可以自己评分,而不是相信我的话。

两个片段最后一帧的并排对比,左侧MiniMax H3有清晰的日语标题文字,右侧Veo 3.1有乱码的垂直字符
每个片段的最后一帧。左侧,H3写了「ラストホイッスル」,所有八个片假名正确且稳定。右侧,Veo 3.1写了三个字符,不是请求的文字,也不构成一个词。
标题卡是这个回合决定胜负的地方,而且差距不大。H3精确地渲染了请求的片假名,硬边且稳定,叠加在球门区域条纹状的甩镜头上。Veo 3.1产生了一组三个垂直堆叠的字符,既不是请求的文字,也不是一个词。在同一帧中,它还把角色移出了画面,让背景滑向半逼真的体育场照片,尽管photorealistic skin和3D render就在负面提示词中。
表3:决定动漫片段的五个维度,来自这两次运行
| 维度 | MiniMax H3 | Veo 3.1 |
|---|---|---|
| 关键帧的角色一致性 | 在整个8秒内保持精确的脸部、头发和球衣 | 在一个新的广角镜头中重新绘制了角色,符合模型但不同画法 |
| 线条粗细和纯色赛璐珞着色 | 保持,没有向3D漂移 | 在中景镜头中保持,但到结尾漂移到了摄影棚风格的体育场照片 |
| 日语标题卡 | ラストホイッスル 渲染正确且稳定 | 三个字符,不是请求的文字,也不是一个词 |
| 提供的音频轨道 | 32 kHz立体声,完全符合模型卡说明 | 48 kHz立体声,只因为我手动设置了generate_audio才存在 |
| 甩镜头和作画拖尾 | 执行成一个条纹状的平移进入标题 | 被硬切替换为新的设置 |
最后一行是迄今为止对H3最响亮的公开批评,这恰恰是我将两者都写入提示词的原因。在第0天的ComfyUI帖子中,用户fwip抱怨官方演示提示词也被忽略:“一个剧烈的甩镜头掠过屋顶,把漂浮的文字拖走,留下运动条纹。但视频根本没有做任何过渡,只是用切镜替换了它。”在这次运行中,正是Veo把甩镜头换成了切镜,而H3执行了拖尾。各一次运行不是定论,我不会声称相反。但这确实意味着批评并非H3特有:甩镜头是整个测试中两边都最不可靠的指令。如果你的分镜依赖甩镜头,请围绕它而不是通过它来设计分镜。
第5步:Veo 3.1在结构上无法输出的4:3复古OVA片段
这不是质量偏好问题,而是一堵墙。Veo的aspect_ratio枚举只有两个值,都不包含4:3,它的duration枚举也没有12。90年代OVA的风格在Veo上根本无法实现。
Plain1一个1990年代OVA风格的动漫片段,4:3全画幅。手绘背景艺术,可见笔触纹理,赛璐珞角色,粗而不均匀的墨线,泛光灯周围有强烈的光晕,16mm胶片颗粒和轻微的片门抖动。同一个红发前锋,身穿白色和海军蓝9号球衣,在观众噪音逐渐减弱到单一泛音时,走下被雨水浸湿的球场。摄像机慢慢推近他的脸。他低声用日语说:「次は、勝つ」。复古调色板:柔和蓝绿色,尘土琥珀色,深栗色阴影。音频:远处的雨声,一个孤独的模拟合成器垫音,远处一声带有混响的哨声。
设置:模型 minimax/h3/text-to-video,resolution: 2K,duration: 12,ratio: 4:3。手动设置这个比例,记住默认值。

Atlas Cloud上的MiniMax H3文本转视频工作区,输入了OVA提示词,输出面板中有完成的复古片段
Atlas Cloud上的MiniMax H3文本转视频,输入了OVA提示词,片段已完成。完全披露:这个特定运行将宽高比保留为16:9,时长为8,所以你在右侧看到的是宽屏短版。下面的4:3十二秒片段来自明确设置了ratio: 4:3和duration: 12的API调用。

4:3复古OVA片段:同一个前锋在90年代动漫风格中走下被雨水浸湿的球场
H3文本转视频,4:3,12秒。交付的文件为1920x1440,精确到像素的4:3,带有32 kHz立体声音轨。此处显示为静音GIF,帧率降低以保持页面轻量。使用Atlas Cloud上的minimax/h3/text-to-video生成。
第6步:九张参考图片,一个角色,四个片段
跨镜头角色一致性是AI动漫中最难的问题,而解决方法是参考素材的数量。首先构建素材包:重新运行第1步的提示词,将取景分别改为正面、四分之三、全侧面、背面、大笑、咬牙、全身姿势、球衣细节和球鞋细节。九张图片,总共大约八美分。

同一个原创前锋角色的四个角度,作为参考素材包生成,排列成2x2网格
九个参考角度中的四个。H3在一个参考素材包中最多接受九张图片,此外还可以叠加视频和音频参考。
Plain1赛璐珞风格2D动漫,一致的手绘墨线,纯色,无3D阴影。在每一个片段中保持所参考前锋的脸部、头发轮廓和9号球衣完全一致。一个连续镜头中的四个片段:(1) 低角度推进他的靴子踩在草坪上,(2) 向上甩镜头到他的眼睛特写,(3) 他冲刺越过三个后卫的广角镜头,后卫画成模糊剪影,(4) 定格在半空中头球,速度线向外爆发。音频:人群欢呼声,呼吸声,靴子踩在草坪上的撞击声,定格时一个太鼓声。
设置:模型 minimax/h3/reference-to-video,refers = 你的图片,type: image,resolution: 2K,duration: 8 或更高,ratio: adaptive 或 16:9。
Veo 3.1的等效设置无法以这些参数运行,你也不需要尝试就知道原因。它的参考端点最多接受三张图片,选择该端点后duration会固定为唯一合法的值8。九张图片的素材包和10秒的拍摄时间都不在范围内。

Atlas Cloud上的MiniMax H3参考素材转视频工作区,显示参考素材计数器为四分之九,输出面板中为第一个片段
Atlas Cloud上的MiniMax H3参考素材转视频。计数器显示Reference Materials (4/9),下方有MAX:9,这是界面中的上限,而不是规格表上的声明。输出是第一个片段,靴子的低角度推进。
值得再做的四个MiniMax H3动漫视频生成器运行
Last Whistle镜头只测试了四个差异点。这四个测试了剩下的。所有都在H3上运行;注释说明Veo 3.1能否匹配。
- 超宽作画战斗,
21:9,10秒。 Veo根本无法输出21:9。
Plain1赛璐珞风格2D动漫动作,粗锥形墨线,纯色,硬边阴影,无3D阴影。两个原创蒙面对手在黄昏时分的风刮过的寺庙屋顶上。刀刃碰撞,画面颤抖,两个战斗者在一系列手绘冲击帧和径向速度线中分开。摄像机:低角度推进,然后横向跟踪,然后快速切换到橙色天空下的宽幅剪影。音频:两次尖锐的金属碰撞声,布料啪嗒声,最终定格时一个低沉的太鼓声,没有音乐。
- 节拍同步AMV片段,参考素材转视频,带音频参考。 H3最多接受三个音频片段作为参考输入。Veo 3.1根本没有音频输入,只有音频输出。
Plain1赛璐珞风格2D动漫蒙太奇,与参考音轨同步。五个短节拍:窗户上的雨,收紧绷带的手,城市天际线从火车窗外闪过,冲刺起跑,定格在一个伸出的手上。每个片段精确落在参考音频的沉重节拍上。纯色,粗墨线,高对比度夜间调色板,深靛蓝和霓虹洋红。
- 两行日语对话场景,12秒。 这是口型同步压力测试,12秒已经超出Veo的范围。
Plain1赛璐珞风格2D动漫,纯色,无3D阴影。两个原创角色在黄金时分的屋顶上,正反打镜头。第一个用日语说:「本当に行くの?」。第二个半微笑着用日语回答:「もう決めた」。嘴巴匹配每个音节。温暖的边缘光,长阴影,头发轻轻飘动。音频:两个不同的日语声音,远处的交通声,一只蝉。
- 竖屏少年短片,
9:16,8秒。 两个模型都能做竖屏,所以这是唯一一个可以真正A/B测试而不是假设的地方。
Plain1赛璐珞风格2D动漫,竖屏构图。一个原创的青少年跑步者慢动作冲破纸横幅,然后帧率恢复到全速,她加速冲过体育场直道。速度线,纯色,硬阴影,大胆的图形天空。摄像机:低角度跟拍,然后向上甩到她的脸。音频:横幅撕裂声,人群涌动声,一次屏住呼吸然后释放。
如果你想了解这些背后的提示词语法,MiniMax H3提示词指南比我这里更深入地介绍了H3如何解析相机和音频指令。
MiniMax H3 vs Veo 3.1 制作60秒动漫开头需要多少钱
一个标准的动漫OP大约是90秒。假设八个8秒的片段,64秒的成品视频,加上每个片段一个关键帧,每个$0.009。
存在一个真实的价格差异,你应该知道,而不是让我掩饰。Atlas Cloud目录显示MiniMax H3为每秒$0.10的固定价格,而模型README则分解为2K下$0.14/s,768P下$0.10/s。Veo 3.1目录显示每秒$0.20,而其README则区分带音频$0.40/s和不带音频$0.20/s。
我截图中的运行按钮给出了答案。H3参考素材转视频,8秒,2K,报价Run $1.12,正好是每秒$0.14。Veo 3.1图生视频,8秒,1080p,带音频,报价Run $3.2,正好是每秒$0.40。所以按README费率收费,而目录价格是入门级。不过下面我还是列出了两种读数。这些是2026年8月的列表价格。
表4:八个8秒片段,包含关键帧
| 设置 | 视频成本(目录费率) | 视频成本(README费率) | 关键帧 | 总范围 |
|---|---|---|---|---|
| MiniMax H3, 2K | $6.40 | $8.96 | $0.07 | $6.47 to $9.03 |
| MiniMax H3, 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1, 1080p 带音频 | $12.80 | $25.60 | $0.07 | $12.87 to $25.67 |
| Veo 3.1 Lite, 720p | $3.20 | $3.20 | $0.07 | $3.27 |
价格来自表1中链接的Atlas Cloud模型页面,2026年8月。这四种目前都没有折扣。
该表不包括的两件事,都比每秒费率影响更大。
重试。 没有人第一次就发布一个动漫片段。无论你假设的倍率是多少,应用于两列,差距会按相同比例扩大。
实际耗时,而这一点反过来。 在2026年8月7日从头到尾计时:H3在2K下8秒花了447秒,大约7.5分钟。H3文本转视频2K下12秒花了334秒。Veo 3.1在1080p下8秒带音频花了152秒,不到三分钟。在这里,Veo获得第一次结果的速度大约是H3的三倍,如果你在凌晨2点迭代一个镜头,这是真正的价值。队列会变动,所以把这当作一个下午的快照,而不是规格。但任何说H3在2K下“2到3分钟”的人,都是在引用README,而不是队列。2K与768P对比一文涵盖了何时更高档次值得多花几分钟。
动漫风格、致敬和你能实际发布的内容
本文中的所有内容都是风格和致敬。一个原创角色,原创球衣,原创标题。没有生成或请求任何官方动漫角色,也没有使用任何真实足球运动员的名字或肖像。世界杯趋势被引用为一种_格式_,因为这就是它的有用之处。
这种区别不是装饰性的。如果你要商业化地制作动漫风格的内容,“90年代OVA的风格”和“这个特定节目中的这个特定角色”是不同的法律对象,只有一个是可行的业务。
关于开放权重:H3确实可以下载,人们在第一天就运行了它。一位评论者报告说,在4070 Ti Super(16GB)上,10秒480p片段需要10分钟,其他人报告在5080上需要3分钟,在RTX 6000 Pro上需要68秒。但自托管运行在768短边;产生2K的Context-IR和Regenerate-2K阶段仍然在API端。
许可证有一个真正的陷阱。社区许可证目前不涵盖欧盟、英国、韩国或美国,理由是这些地区“正在制定或执行AI相关法规”。一个正式的许可申请渠道是开放的,一位HN评论者总结为“你只需要保证不会惹迪士尼生气,他们就会给你发许可证”。有趣,也是如果你在四个地区之一时不能跳过的合规步骤。开放权重文章有完整的地区列表。
常见问题解答
MiniMax H3 与 Veo 3.1 相比,是一个好的动漫视频生成器吗?
对于大多数动漫工作,H3更好,主要原因是渲染之外的因素。它支持4到15秒,而Veo只支持4、6或8秒;它提供六种宽高比,包括4:3和21:9,而Veo只有两种;它列出日语为11种原生稳定对话语言之一;它接受九张参考图片,而Veo只有三张。Veo 3.1在一种特定情况下胜出:当你需要seed来实现可重复的重拍,或者需要negative_prompt来防止镜头漂移到3D渲染着色时。H3没有这两个参数。如果你的管道依赖其中任何一个,那是真正坚持使用Veo的理由。
Veo 3.1 能生成4:3的动漫或15秒的片段吗?
不能,而且不是出于风格原因。Veo 3.1的aspect_ratio枚举只包含16:9和9:16,其duration枚举只包含4、6和8。没有4:3的值可选,也无法请求12或15秒。如果你的参考是90年代电视动漫或OVA,这种取景在Veo上无法实现,而在H3上可用。
为什么我的Veo 3.1动漫片段是无声的?
因为API上generate_audio默认为false。工作区中的切换开关通常已经打开,所以这只影响直接调用API的人。请明确设置generate_audio: true。同时,也设置resolution,因为它默认为720p,而不是你可能想要的1080p或4k。
MiniMax H3 是否支持动漫的日语对话和口型同步?
是的。模型卡列出了11种具有稳定对话支持的语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。音频与画面同时以32 kHz立体声生成,而不是后期配音,这就是为什么口型时间能在整个句子中保持,而不仅仅是前几个音节。在提示词中直接用日语写出日语台词。
我可以使用多少张参考图片来保持动漫角色的一致性?
MiniMax H3最多接受9张图片,最多3个视频片段和最多3个音频片段,所有类型的文件总数上限为12个。Veo 3.1的参考素材转视频端点接受1到3张图片,并且选择它会将duration固定为8作为唯一合法值。对于一个系列中的重复动漫角色,这个差异是全部关键。
MiniMax H3 有开放权重,所以我可以在本地免费运行我的动漫管道吗?
你可以下载并运行,但有三个注意事项。自托管推理在768短边运行,产生2K输出的Context-IR和Regenerate-2K阶段仍然在API端。根据第0天ComfyUI帖子,实际本地速度因显卡而异:在4070 Ti Super上大约10分钟生成10秒480p片段,在5080上大约3分钟,在RTX 6000 Pro上大约68秒。并且社区许可证目前不涵盖欧盟、英国、韩国或美国,所以如果你在这些地区,在商业使用之前需要正式许可证。






