
本文所有样片都从这张夜班电台画面出发,使用 openai/gpt-image-2/text-to-image 生成,质量 high,2048x1152。
这张静态图就是下方整个教程的输入。使用 openai/gpt-image-2/text-to-image 生成,质量 high,2048x1152。
回想一下你上次拍完一个8秒镜头,结果发现它是无声的。
你导出了片段。你打开TTS面板,输入了对白。你在音效库里翻找雨声和房间环境音。你把所有素材拖到时间线上,左右挪动波形,直到嘴巴不再对不上。然后你还得专门花钱请一个唇形同步模型来修复嘴部。四个工具,三个WAV文件,一小时,可最终效果还是像配音——因为它本来就是配音的。
这个链条,正是MiniMax H3悄悄删除的东西。不是因为“它支持音频”(很多模型都声称支持),而是因为请求体里有一个几乎没人测试的插槽:你可以免费把你已有的音频丢进去,然后让声音出现在一张脸上。
下面是一个两轮测试,用来隔离那个插槽的真实效果,以及它替代的每一步的实际价格、会拒绝你请求的硬性限制,还有真实的账单。
关键要点
- 一次调用返回画面、对白、房间环境音和唇部动作。文本、视觉和音频分别编码,然后由一个统一的Omni Transformer联合预测视频和音频的潜在表示(Hugging Face模型卡,2026年8月)。
- 输入音频免费。输入视频不免费:MiniMax将参考视频按输出速率计费,所以同样的15秒素材,作为音频成本为0美元,作为视频片段大约需要1.95美元。
- 硬性限制:最多3个音频片段,每个2到15秒,总时长15秒,且音频不能单独使用。它必须与至少一张图片或一个视频一起使用。
- 在Atlas Cloud上,2K分辨率每秒$0.14,一个完整的10秒有声镜头成本$1.40,这比专门花$0.22/秒请唇形同步模型去修补已经渲染好的片段更便宜。
声音打开:两轮MiniMax H3唇形同步与音频测试,相差6秒
戴上耳机。两半都使用相同的底图、相同的两行对白和相同的提示词,一字不差。只有其中一半先听到了一段6秒的人声录音。
fXlyer__czg
打开声音,戴上耳机:左半边(测试A,无参考音频)在左耳播放,右半边(测试B,带6秒参考音频)在右耳播放。同一帧、同一对白、同一提示词。两轮均使用:minimax/h3/reference-to-video,2K,10秒,最终输出2560x1440,24fps,32kHz立体声轨。
测试A只有提示词里“平静、低沉、富有磁性的男性广播嗓音”的描述作为依据,所以它自己发明了一个声音。测试B则被给予6.19秒的完全不同句子,并被告知仅将其作为音色锚点。两轮测试之后都没有进行配音。都没有靠近任何唇形同步模型。在两轮中,嘴巴都跟随模型产生的声音,因为嘴巴和声音是一起产生的。
请用你自己的耳朵判断音色,而不是听信我的说法。我能作为事实陈述的是机制、设置和账单,接下来就是这些。
为什么MiniMax H3唇形同步与音频打破了你那六步配音链条
旧的链条从来就不是一个真正的工作流。它是一场修复工程。
ImGr2NgcCCY
打开声音。一个3D动画蟾蜍和变色龙在夜间马戏团帐篷里交谈,对话下方有围栏环境音。这是一个MiniMax H3原生音频参考片段。动画角色上的嘴型是最难伪造的情况,所以这个片段值得你花20秒关注。
三件事一直在出问题,而且出问题是结构性的,而不是运气不好。
时间线掌握在你手中。 视频模型给你帧。TTS模型给你波形。两者输出互不知晓,所以对齐是人为判断,每秒30帧,肉眼判断,在凌晨1点进行。每次重新渲染都要重新做这个判断。
补丁式唇形同步有上限。 专用唇形同步模型只拥有已存在素材的嘴部区域。它可以让嘴巴与音频对齐。但它无法让下颌在硬辅音前绷紧,无法在对白前放一个呼吸,无法让句子结束时肩膀放松下来,因为这些帧是在任何人知道角色要说什么之前就渲染出来的。你得到的是准确度,却没有表演,这看起来就是恐怖谷。
音效设计是另一个项目。 雨声、房间环境音、椅子吱嘎声、对白下方的低音线。所有东西都来自不同的来源,还得与一个本身也是贴上去的声音平衡。
H3音频VAE告诉你关于MiniMax H3唇形同步与音频的什么
这是非营销语言的部分,因为你可以从文件名中看到它。
在H3中,文本通过H3-Encoder,视觉输入通过H3-Encoder和H3-VisualVAE,音频仅通过独立的H3-AudioVAE。然后H3-Omni-Transformer联合预测视频和音频的潜在表示,这些潜在表示分别被解码为视频和立体声音频。AudioVAE在左右声道共享一个编码器和解码器,独立处理每一路,然后重新组合成立体声,并将32kHz音频压缩成以40Hz时间速率表示的潜在token序列(Hugging Face模型卡)。
当ComfyUI发布首日支持时,该架构在VAE文件夹中显示为两个独立文件:minimax_h3_video_vae_fp16.safetensors和minimax_h3_audio_vae_fp32.safetensors,由一个双VAE加载器加载,该加载器接受视频路径和音频路径(ComfyUI博客,2026年8月)。音频是模型从一开始就围绕构建的模态,而不是事后加上的补丁。
排行榜也证实了这一点。Artificial Analysis将H3排在视频编辑排行榜的第一位,音频方面在5043个盲选样本中获得了1130 Elo,同时在文本到视频和图像到视频方面也位列前三(Artificial Analysis,2026年7月)。在那一特定排名中,“画质很好”和“第一名”之间的差距就是音频。
MiniMax H3唇形同步与音频工作流,针对它所替代的链条进行定价
诚实的判断方式不是靠感觉。而是分步计算旧链条的实际价格,针对一个10秒完成镜头,使用真实的每秒费率,然后计算替代方案的价格。
| # | 旧链条,一步一步 | 运行工具 | 该步骤成本 | 使用MiniMax H3唇形同步与音频 |
|---|---|---|---|---|
| 1 | 渲染无声画面 | 一个视频模型,例如 bytedance/seedance-2.0,$0.112/秒 | $1.12 | 同一次调用 |
| 2 | 录制对白 | minimax/speech-2.6-hd | 约$0.02(约250个字符) | 同一次调用 |
| 3 | 寻找或制作配乐 | minimax/music-2.6 | $0.15/曲 | 同一次调用 |
| 4 | 叠加环境音和细节音效 | 音效库 + 你的双手 | 你的夜晚 | 同一次调用 |
| 5 | 在时间线上对齐所有元素 | 编辑器 + 你的双手 | 你的夜晚 | 不存在 |
| 6 | 混音 | 编辑器 + 你的双手 | 你的夜晚 | 不存在 |
| 7 | 修补嘴部 | sync/lipsync-v3,$0.22/秒 | $2.20 | 不存在 |
| 总计 | 4个模型 + 2次手动操作 | 约$3.49 + 你的夜晚 | 1次调用,$1.40 |
请把第7行读两遍。修补你已经渲染好的片段的嘴部,每秒成本$0.22,而生成整个镜头(包括声音、环境音和嘴部动作)每秒成本$0.14。修补比原始生成更贵。这个单一的比较就是全部论点。
没人提到的非对称性:你自己的音频免费,你自己的视频不免费。
MiniMax的按量付费定价表将输入材料与输出分开列出。对于H3,音频输入免费。前5张输入图片免费,之后每张$0.04。输入视频按其输入片段的时长、以输出分辨率的价格计费,2K分辨率下为$0.13/秒(MiniMax定价文档,查于2026年8月3日)。因此,同样的15秒参考素材,作为歌曲、语音备忘录或客户提供的画外音,成本为零;作为视频片段,则大约$1.95。
这就是应该改变你构建方式的那条线。参考音频是模型中最便宜的控制面,而且它是没人测试的那个。
| 参考输入 | 数量 | 每个片段 | 总计 | 计费方式(MiniMax) |
|---|---|---|---|---|
| 图片 | 最多9张 | 不适用 | 不适用 | 前5张免费,之后每张$0.04 |
| 视频 | 最多3个 | 2到15秒 | 最多15秒 | 按输出速率计费,2K下$0.13/秒 |
| 音频 | 最多3个 | 2到15秒 | 最多15秒 | 免费 |
| 任意混合 | 最多12个文件 | 不适用 | 不适用 | 按类型如上计费 |
| 仅音频 | 不允许。音频必须伴随图片或视频输入,不能作为唯一输入 |
限制来自模型卡上的H3-Base-Ref2VA规范。Atlas Cloud上minimax/h3/reference-to-video的schema也用同样的话说:“至少需要一张图片或一个视频(仅音频不允许)。”
在Atlas计费方面有两个脚注,都来自我自己的运行而非文档页面。Atlas对所有三个H3端点统一按每秒$0.14的固定费率计费,我附加的一个参考视频并没有额外收费。这仅是一次观察,并非政策,所以请按MiniMax的规则做预算,并将固定费率视为额外福利。Atlas也接受resolution: "768P"并按同样的$0.14计费,这个差异值得在关于MiniMax H3 API定价的详细文章中阅读,而不是在这里。
以下所有操作都在Atlas Cloud的一个浏览器标签页中完成:底图、语音参考以及两个H3样片,都在同一个API密钥下,使用同一个轮询循环。三个H3端点仅在输入形状上有所不同,因此refers变成image再变成纯文本,而代码的其他部分无需更改。
MiniMax H3唇形同步与音频,一步一步
五个步骤。其中两个是廉价设置,两个是实际测试,最后一个不花钱,因为它被设计为失败。
步骤1:使用GPT Image 2构建底图
演示场景是一个夜班电台主持人,选择这个场景只有一个原因:嘴部的特写镜头是唯一能让你真正判断唇形同步的构图。广角镜头会让模型作弊。
这个提示词中有两件事是必须的。嘴巴必须微张,处于说话中间,这样第一帧就已经看起来是在说话;画面中不能有任何文字,这样后面的动态字幕不会与内嵌文字冲突。
plaintext1摄影写实电影感静帧,16:9,夜班电台直播间,紧身胸部以上构图,一个三十多岁男性 2身体前倾,靠近一支复古银色电容麦克风,麦克风吊臂,泡沫防风罩距离嘴唇几英寸, 3耳机半挂在一边耳朵上。温暖的钨丝台灯从画面左侧照亮他的颧骨;红色霓虹ON AIR标志 4在身后虚化,红光渗入前景下方的调音台推子。右侧窗户上雨水流淌,城市灯光模糊成 5散景。薄薄的香烟烟雾在灯光柱中飘散。嘴唇微张,处于说话中间,眼睛向下看着纸上 6的脚本。35mm镜头拍摄,浅景深,精细胶片颗粒,深阴影,画面中任何地方都没有文字。 7
在openai/gpt-image-2/text-to-image上的设置:质量 high,尺寸 16:9 2048x1152,一张图片。模型列表上的$0.009是token级别的底价,并非你实际支付的金额。在此尺寸和质量下,运行按钮显示$0.1745/次,你可以在下方截图中看到。

Atlas Cloud上的GPT Image 2,输入了电台广播室的提示词,选择了质量high和16:9 2048x1152,以及OUTPUT面板中渲染完成的底图。GPT Image 2 at Atlas Cloud:上述确切提示词,质量high,16:9 2048x1152,以及OUTPUT中同一张图的第二次绘制。
步骤2:制作六秒语音参考
这一步是很多人会搞错的地方,所以请在提示词之前阅读推理过程。
参考音频必须说与你想要在视频中出现的句子不同的句子。它只是一个音色锚点,仅此而已。对白来自提示词。MiniMax自己的参考转视频示例就明确区分了这一点:它将一个片段标记为部分复用的音乐源,另一个片段纯粹作为“语音音色参考”,而新的对白直接写在提示词中。如果你的参考音频说了你要求的那句话,你就会让模型去复制这条音轨,而不是仅仅转移音色。
plaintext1You're listening to Night Line, ninety-one point four, and it is coming up on 2three in the morning. 3
在minimax/speech-2.6-hd上的设置:任何平静低沉的男声都可以,我选择了磁性男声(English_magnetic_voiced_man)。将speed设为0.95,这样音频会落在2到15秒的窗口内,并留有余量,vol保持1.0,输出格式保持mp3。该模型为每1000字符$0.08,从$0.10降低,这是2026年8月生效的20%折扣。我的对白长度为6.19秒,计费$0.00792。

Atlas Cloud上的MiniMax Speech 2.6 HD,参考语句输入到文本框中,OUTPUT面板中显示了渲染后的音频波形。
MiniMax Speech 2.6 HD at Atlas Cloud:输入一行,输出一个短mp3,运行按钮上显示20%折扣。截图是在默认的“生动叙述者”语音下捕获的,所以请先切换到“磁性男声”,并将速度降至0.95,再运行。
步骤3:使用参考音频运行MiniMax H3唇形同步与音频
现在将两个文件一起放入refers:步骤1的静态图和步骤2的mp3。这是测试B。
提示词使用H3训练时使用的分段结构。subject_definitions指定谁是什么以及参考内容是什么,detailed_description在<d>[English] ...</d>标签内包含对白,而两个音频部分描述了混音。如果你对这些分段名称不熟悉,可以查阅MiniMax H3提示词指南,其中介绍了完整结构。音频工作只涉及三个字段,它们都在这里。
plaintext1subject_definitions: 2<Subject 1> is the man at the radio microphone in <Picture 1>, late thirties, headphones 3half-off one ear, red ON AIR neon behind his shoulder. 4<Picture 1> is the opening frame of the target video. 5<Audio 2> is the voice timbre reference for <Subject 1>: a calm, low, magnetic male 6broadcast voice. Reference the timbre only; do not reuse its words. 7 8summary: 9[image reference + audio timbre reference] A single continuous 10-second close-up. <Subject 1> 10delivers two lines straight into the microphone in the voice timbre of <Audio 2>, while the 11camera pushes in slowly. The mouth movement, the breath before each line, and the room tone 12are generated together. 13 14detailed_description: 15The shot opens exactly on <Picture 1>. Warm tungsten from camera-left, red neon bleeding onto 16the mixing desk in the foreground, rain on the window behind. <Subject 1> takes a short breath, 17tilts a few degrees toward the windscreen, and speaks, <d>[English] It's three in the morning, 18and I know exactly who's still awake.</d> As he speaks, his jaw and lips move naturally with 19every syllable; the plosives on "three" and "morning" are visible. He glances down at the script, 20then back up past the lens, and continues, <d>[English] So let's keep this between us.</d> 21Exactly as his voice stops, his lips settle closed and he exhales through his nose. Throughout, 22the camera executes one slow, deliberate push-in; the neon flickers once, faintly, around second 23seven. No on-screen text. 24 25overall_soundscape: 26Close, dry, booth-treated voice with a touch of proximity effect from the microphone. Under it: 27a low electrical hum from the desk, rain steady against the glass, one distant car passing on 28the wet street, the soft creak of the chair as he leans in, and a single audible breath before 29each line. 30 31non_diegetic_music: 32A sparse, slow late-night jazz double bass, very quiet, well under the voice, entering around 33second two and never rising above the dialogue. 34
在minimax/h3/reference-to-video上的设置:分辨率 2K,时长 10,宽高比 16:9,refers中包含两个文件。数组内的顺序无关紧要,只需确保至少有一个是图片或视频。时长滑块默认为8,所以需要移动它,并且如果希望获得你要求的画面,请将宽高比从adaptive切换掉。
四个参数陷阱,其中三个让我花过钱。关键参数是ratio,而不是aspect_ratio,搞错会返回400。始终显式发送duration,因为schema默认是8,但如果没有指定,请求返回的却是5秒文件。在这个端点上,同时发送image和refers会成功完成、全额计费,但会默默丢弃其中一个。此外,如果你将音频作为base64数据URL传递,请标记为data:audio/mp3,而不是data:audio/mpeg。我的第一次尝试就死在了这个地方:
plaintext1content[2].audio_url: invalid param: audio format ".mpeg" not allowed 2
至少这种错误是免费的,这引出了学习限制的有用方法。

Atlas Cloud上的MiniMax H3 reference-to-video测试面板,mp3在插槽1,底图在插槽2,分辨率2K,以及OUTPUT面板中播放的完成片段。
MiniMax H3 reference-to-video at Atlas Cloud:参考材料显示2/9,mp3在插槽1,静态图在插槽2,分辨率2K,右侧是完成片段。此次捕获以面板默认的8秒运行,因此运行按钮显示$1.12;我的两个测试样片以10秒运行,每个$1.40。
步骤4:运行MiniMax H3唇形同步与音频控制测试
更改一个输入及其所有提及。从refers中移除mp3,仅保留图片;删除<Audio 2>定义;从summary中删除“使用<Audio 2>的音色”这句话;将括号标签改为[image reference]。其他所有内容不变,设置保持一致:2K,10秒,16:9。
这就是让它成为控制组而不是第二次尝试的原因。模型现在没有音色锚点,所以它会从书面描述中发明一个声音,然后对刚发明出来的声音进行唇形同步。两个样片都返回了10.13秒的时长,并各自计费$1.40,精确到分。
WnfqR2I-a-8
打开声音。单独的测试A:相同的帧,相同的对白,没有参考音频。这里的声音是模型自己发明的,嘴巴仍然跟随它。
两轮测试,一个变量。这是整篇文章中最便宜的实验,也是唯一能告诉你音频插槽真正作用的实验。
步骤5:故意让MiniMax H3唇形同步与音频失败
最后一步是免费的,而且值得做一次,这样你就能在凌晨2点识别出该错误。
将mp3放入refers,不放入其他任何东西。没有图片,没有视频,只有音频。然后提交。
plaintext1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Authorization: Bearer $ATLAS_API_KEY" \ 3 -H "Content-Type: application/json" \ 4 -d '{ 5 "model": "minimax/h3/reference-to-video", 6 "prompt": "A man at a radio microphone speaks two lines into the windscreen.", 7 "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}], 8 "resolution": "2K", 9 "duration": 10, 10 "ratio": "16:9" 11 }' 12
这里值得知道的是,因为这不是schema暗示的那样。提交调用返回HTTP 200,并带有正常的任务ID和"status": "processing",所以一个天真的客户端会认为它成功了。23毫秒后,任务失败:
plaintext1{ 2 "status": "failed", 3 "error_code": 1010001, 4 "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video", 5 "latency_ms": 23 6} 7
该预测上从未出现price字段,所以没有花费。实际教训是关于你的代码,而不是你的钱包:提交时返回200并不代表成功。轮询该ID,并在假设你有了一个片段之前检查status。
用MiniMax H3唇形同步与音频进行更多尝试
两轮测试是最小的有用实验。以下是同一个插槽可以进一步应用的地方。
一个镜头,多种语言。 保持帧,保持构图,改变<d>...</d>内的语言标签,然后重新运行。嘴巴会跟随新语言,而不是旧语言,因为嘴巴和声音来自同一个前向传播。模型卡列出了11种语言的稳定对白支持:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语,还有更多语言在不同程度上受支持。下面这两个片段是同一个预告片,带有两个不同的语音轨,MiniMax还从同一个设置中制作了法语版和无旁白版。
hj7ZId3KOKk
打开声音。英语旁白版:一个宇航员在尘土橙色的行星上的特写,旁白和配乐随画面一起出现。预告片工作就是相同的三个提示字段,配上不同的音景。
Hv62FGyBNPM
打开声音。日语版,逐帧相同的预告片。没有进行任何重新配音,也没有单独的VO录制环节。
演唱,使用你已经拥有的副歌。 这是免费输入音频不再只是脚注的地方。将一个已有的副歌或乐器片段(15秒或更短)放入refers,描述表演,然后角色就会跟着它表演。你不需要为你带来的音乐付费。
zui3Zw_UWnY
打开声音。一个乐队片段,采用复古摄像机风格,从后台到表演,音轨和画面同时到达。这正是大多数音乐视频工作所需要的形态。
两个人的对话比一个人更困难。 单人特写是简单情况,这正是本文使用它的原因。对于两个角色之间的对话,请像MiniMax自己的示例那样明确标注,将<Subject 1> (S1)和<Subject 2> (S2)附加到每个<d>行,并预计当模型把顺序或归属搞错时需要重新运行。为每个双人场景预算两次运行。
没有一句台词的环境音。 overall_soundscape是一个独立的字段,它可以在完全没有对白的情况下工作。雨打玻璃、椅子吱嘎声、冰箱嗡嗡声、房间本身。这使得同一个端点成为合法的ASMR和环境音工具,也是唯一一个嘴巴无关紧要的用途。
我自己的两个样片有一个诚实的局限:同一次生成意味着嘴巴和声音是一致的,但这并不意味着画面中的每一个物理细节都与声音一致。将长台词塞进短时长、模糊的表演指导以及多说话人场景都会降低结果质量。在发布之前,请像观看人类演员的表演那样观看你的片段。
MiniMax H3唇形同步与音频实际花费了我多少钱
以下每个数字都是真实账户上的真实费用,是事后提取的。预测上的price字段填充较晚,因此轮询直到completed通常返回空。重新获取该ID以获取数字。
| 步骤 | 模型 | 运行内容 | 计费金额 |
|---|---|---|---|
| 1 | openai/gpt-image-2/text-to-image | 1张底图,质量high,2048x1152 | $0.1745(运行按钮上显示) |
| 2 | minimax/speech-2.6-hd | 99个字符,6.19秒参考语音 | $0.01 |
| 3 | minimax/h3/reference-to-video | 测试B,10秒,2K,图片+音频在refers中 | $1.40 |
| 4 | minimax/h3/reference-to-video | 测试A,10秒,2K,仅图片 | $1.40 |
| 5 | minimax/h3/reference-to-video | 仅音频请求,23ms后失败 | $0.00 |
| 整个实验,两个样片 | 约$2.98 |
两条会计说明,因为诚实比脚注更便宜。步骤3中错误的audio/mpeg数据URL也不花钱,因为它在提交时返回了400。拒绝是免费的,但结构良好的请求如果输入有问题则不是免费的,因此一个静默404的参考URL仍然会全额计费。步骤3截图中的测试面板捕捉是第三个H3运行,使用面板默认的8秒,这额外计费了$1.12。该运行是为了本文,而不是为了实验。
旧链条(在上面的表格中定价)对于一个10秒镜头大约需要$3.49加上一个晚上的手动对齐。而这次是两个完整的10秒有声镜头、一个受控的A/B测试以及两个故意失败的请求,花费更少。
不过,H3不适合几项人们会尝试交给它的任务,而且替代方案更便宜。
| 你实际想要什么 | 合适的模型 | 价格 | 原因 |
|---|---|---|---|
| 一张肖像 + 一个现有音频文件 -> 生成一个会说话的头 | bytedance/avatar-omni-human-v1.5 | $0.12/秒 | 专为音频转视频而建,且输出长度跟随你的音频 |
| 一个已完成片段,其嘴部需要说另一种语言 | sync/lipsync-v3 | $0.22/秒 | H3不会修改你现有的渲染,而修补正是这个模型的专长 |
| 在会说话的头上的最便宜的嘴部修复 | veed/lipsync | $0.013/秒 | 大约便宜十倍,且它只影响嘴部,不影响表演 |
| 一个完整的定向镜头,包含音色、环境音和配乐 | minimax/h3/reference-to-video | $0.14/秒 | 画面和声音来自一次处理,因此表演是设计出来的而非修复的 |
如果你是在H3与其最接近的竞争对手(基于角色工作而非音频)之间做选择,可以参考Seedance 2.5对比。如果你想知道开源权重是否会让它免费,答案是不会让它变快:2K仍然来自API端,社区报告显示,在消费级显卡上,本地渲染10秒480p需要几分钟而不是几秒。
关于声音、歌曲和权利的一句坦诚说明
免费上传不等于免费使用。一首你没有创作的歌曲和一种不属于你的声音是两个不同的许可,两者都不由API通过免费上传来授予。请使用你自己的录音、获得许可的音乐或你自己生成的合成语音——这正是步骤2所做的。
另外,社区权重附带地域限制,目前不涵盖欧盟、英国、韩国或美国,而是提供了一个正式许可渠道。这是一个更长的故事,在MiniMax H3开源权重指南中有讲述。
MiniMax H3唇形同步与音频:常见问题
MiniMax H3唇形同步与音频是否真的在同一次处理中生成声音,还是之后配音?
同一次处理。文本通过H3-Encoder,视觉通过H3-Encoder加上H3-VisualVAE,音频通过独立的H3-AudioVAE。H3-Omni-Transformer联合预测视频和音频的潜在表示,然后分别解码为画面和32kHz立体声音频。没有任何东西是在之后叠加的,这就是为什么嘴巴、呼吸和房间环境音属于同一个镜头。
我可以将自己的歌曲或声音输入MiniMax H3唇形同步与音频吗?需要额外付费吗?
可以,而且不需要。MiniMax的按量付费表将H3音频输入列为免费。需要注意的非对称性是视频:输入视频按输出速率以其时长计费,2K下为$0.13/秒,因此15秒的参考视频大约需要$1.95,而15秒的参考音频则为$0。
为什么MiniMax H3唇形同步与音频会拒绝仅包含音频的请求?
因为音频是唯一不能单独使用的参考类型。它必须至少附带一张图片或一个视频。其余限制(来自H3-Base-Ref2VA规范):最多9张图片,最多3个视频和最多3个音频片段,每个视频或音频片段时长在2到15秒之间,每个类型总时长不超过15秒,一次请求中所有类型的文件总数最多12个。
MiniMax H3唇形同步与音频能保持整个片段的一致性,还是只有第一句?
对于有呼吸空间的单个说话者,它能保持整个片段的一致性,而不是只说一句然后漂移。三件事会破坏它:将长脚本塞进短时长、模糊或缺失的表演指导,以及模型需要决定谁何时说话的多说话人场景。为每一行赋予一个标签说话人,并给予足够的秒数来说完它。
MiniMax H3唇形同步与音频需要为另一种语言重新配音吗?
不需要。更改对白标记内的语言标签,从<d>[English] ...</d>改为<d>[Japanese] ...</d>,然后重新运行相同的提示词即可。嘴巴会与新的声音一起生成,因此它会匹配新语言而不是旧语言。模型卡列出了11种语言的稳定对白支持。
本地运行MiniMax H3唇形同步与音频更便宜吗?
每次片段更便宜,但在其他所有方面都更昂贵。权重是开源的,但社区报告在16GB消费级显卡上本地运行10秒480p生成需要几分钟,自托管渲染为768短边,而2K仍然来自API端的重新生成步骤。再加上社区许可证中的地域限制,对于完成的作品,API仍然是务实的选择。






