
深夜调色间,六台监视器显示同一位银发歌手的六个不同镜头_六个_ 镜头,一位艺人,一首歌。使用 openai/gpt-image-2/text-to-image 生成。
Suno 用户每天大约生成 700 万首歌,差不多每两周就是一个完整 Spotify 曲库的规模(TechCrunch,2026 年 2 月)。其中几乎没有几首会配上画面。不是因为画面做不出来,而是传统路线要经过四个工具:生成静帧、把它们动画化、单独跑一次 lip-sync,再到剪辑里修所有东西。每转手一次,脸、服装或节拍就会丢一次。
所以我跳过了这些中转。我把一段 8 秒的副歌切片直接丢进视频模型的参考槽,然后按下 Run。音频没有向我收任何费用。
接着我把完成的 mp4 拆开,只为回答一个网上没人说清楚的问题:模型输出回来的声音到底是我的歌,还是它新编了一个听起来很像的东西?我测量了它。答案和我预想的不一样,而且会改变你剪片的方式。
关键要点
- 参考音频免费。 MiniMax H3 只按输出秒数计费。我的四段 8 秒参考切片给账单增加了 $0.00。昂贵的是参考 视频。
- 15 秒是单次生成上限,不是单个项目上限。 把歌曲切片,每个镜头拍一段,再拼接。我的 32 秒成片是四次生成。
- 把 Hook 写成 120 BPM。 一小节正好是 2.000 秒,因此 H3 的整秒
duration值会自然落在小节线上,无需手动微调。8s = 4 小节。- 输出音频就是你的音轨,并且样本级对齐。 我测得输入切片与 H3 交付的立体声混音在零延迟处的波形相关性为 0.892。它不是重新生成的。不过最终剪辑你仍然应该把母带重新铺回去,原因不同(见下文)。
- 实际总花费:$7.53,包含九次生成和失败尝试。进入最终成片的四个镜头,加上歌曲和基础帧,共计 $4.80。
我用一个 32 秒 Hook 剪出的 MiniMax H3 音乐视频
请打开声音。这是四次独立生成,直接拼接,没有转场,并把原始 32 秒母带重新铺在最上面。
“MIRA”,32 秒,2560x1440,24 fps。四次 minimax/h3/reference-to-video 生成,每次 8 秒,每个镜头 $1.12。歌曲作为参考音频输入,费用 $0.00。
四次生成,四个完全不同的灯光世界,同一张脸。它们之间没有任何修图或后期重绘。

四个镜头的四帧,展示同一位歌手出现在霓虹屋顶、沙漠公路、白色影棚和黑色水箱中_每个_ 交付片段抽取一帧。同样的头发、同样的网纱上衣、同样的红色 LED 颈环,跨越雨夜、低角度夕阳、平坦高调光和水下环境。
为什么大多数 MiniMax H3 音乐视频尝试会在第 16 秒崩掉
三种失败模式,全部都可以避免。
第一:把 15 秒当成项目上限。 H3 单次生成最长 15 秒。很多人看到这一点,就得出“不能做音乐视频”的结论,然后放弃。但音乐视频本来就不是一个镜头拍到底。真正的 MV 通常每 4 到 8 秒就会剪一次。这个上限只是迫使你去做剪辑师本来就会做的事。
第二:用文字描述节奏。 “Upbeat, energetic, dancing to the beat” 并没有给模型任何可锁定的东西。它会自己发明一个速度,而你的剪切点会永远差半拍。把真实音频交给它,就消除了猜测。
第三:让服装漂移。 每个镜头都需要同一张参考图,并且 需要逐字相同的服装描述。镜头之间把 “black mesh top” 改成 “dark mesh shirt”,你就会得到另一个人。
两条路线的实际成本是这样的:
| 传统四工具链 | 单次 H3 参考调用 | |
|---|---|---|
| 每个镜头使用的工具 | 图像模型、视频模型、lip-sync 工具、NLE | 一个 endpoint,最后再进 NLE |
| 每个镜头的手动步骤 | 4 次交接、3 次文件导出 | 1 次提交 |
| 角色一致性靠什么 | 手动重新提示和运气 | 同一张参考图逐字复用 |
| 画面和声音 | 分别渲染,之后再对齐 | 同一轮生成,32 kHz 立体声 |
| 每个 8 秒镜头成本 | 四个独立计费表 | 2K 为 $1.12,768P 为 $0.80 |
公平地说,老路线并不是幻想。日本创作者 Arata Fukoe 曾凭一支完全 AI 音乐视频获得 Project Odyssey 铜奖,Queen 和 Linkin Park 也都发布过官方 AI 辅助视频。只是那些流程都要经过四五个工具,而这恰恰是只有一首歌的独立音乐人没时间处理的事。
参考音频到底给 MiniMax H3 音乐视频带来了什么
这是你花钱之前最值得理解的部分。
H3 是在同一轮里生成画面和声音,而不是给完成的画面配音。当你给它一条参考音轨时,这条音轨不是情绪提示。我在波形层面把输入切片与交付 mp4 内部的音频流做了比较,使用 8 kHz 单声道 downmix:
- 包络相关性:零延迟处 0.956
- 2 秒窗口内原始波形相关性:0.892,且为 零样本偏移
这不是模型在复现一首类似的歌。这就是你的文件,样本级对齐,上面叠加了提示词要求的环境声,并经历了一轮 AAC 重新编码。作为对比,我用无参考音频生成的对照样本做同样测量,结果是 0.26,也就是噪声底。

上方为输入切片波形,下方为 H3 交付音频,零偏移对齐_上:我上传的 8 秒 mp3。下:H3 返回的 mp4 内部音频流。相同峰值、相同位置、无偏移。_
输入限制很严格,而且会在提交时直接执行,而不是悄悄处理:
| 参考输入 | 限制 | 计费 |
|---|---|---|
| 图像 | 最多 9 张 | Atlas Cloud 的 H3 endpoints 免费 |
| 视频 | 最多 3 段,每段 2-15s | 按输出费率计费 |
| 音频 | 最多 3 段,每段 2-15s,所有片段总计 15s | $0.00 |
| 仅音频 | 会被拒绝,至少需要一张图像或一段视频 | n/a |
我故意测试了总音频上限,在一次调用里发送三段 8 秒切片。它在 5.8 秒后失败,返回 invalid params, total audio duration 24138 ms exceeds 15000 ms,且没有计费。好消息是:H3 不会静悄悄丢掉额外文件然后照样收钱。
在那之前我还踩了一个坑。如果你把音频作为 base64 data URL 传入,API 推断的扩展名由 MIME 类型决定。data:audio/mpeg 会被拒绝,提示 audio format ".mpeg" not allowed。data:audio/mp3 则顺利通过。我在注意到这一点前提交死了四次,全部免费。
MiniMax H3 音乐视频工作流,以及每一秒的成本
下面所有步骤都通过 Atlas Cloud 的一个 API key 完成,这也是我实际运行和计费的地方。三个模型,一个浏览器标签页。
| 步骤 | 模型 | 作用 | 我实际被收取的价格 |
|---|---|---|---|
| 写 Hook | minimax/music-2.6 | 根据风格提示和歌词生成完整歌曲,mp3 最长约 ~5 分钟 | 每首 $0.15,固定价 |
| 锁定艺人 | openai/gpt-image-2/text-to-image | 每个镜头继承的一张基础帧 | quality high、2048x1152 为 $0.1745 |
| 拍每个镜头 | minimax/h3/reference-to-video | 图像加音频输入,输出带立体声音频的卡点片段 | 2K 为 $0.14/s,768P 为 $0.10/s。音频输入 $0.00 |
关于这张表有两点要说明,因为标价会在两个方向上误导你。GPT Image 2 在目录里显示 $0.009 的地板价;那是最低 token 档,真正的 2048x1152 high 渲染会计费 $0.1745。H3 的目录条目显示 $0.10,那只是 768P 档;我的 8 秒 2K 任务每个都精确计费 $1.12,也就是每秒 $0.14。
如果你想用首帧锁定而不是主体参考,[minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) 费率相同,[minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) 则覆盖纯提示词镜头。
值得修正的一点是:这个方案的早期版本曾假设你必须自带歌曲,因为平台上没有整首歌生成器。现在有了。minimax/music-2.6 可以写歌,所以整个链路,包括歌曲本身,都能在一个地方完成。
如何一步步制作 MiniMax H3 音乐视频
第 1 步:写一个 120 BPM 的 Hook,并切成逐镜头切片
明确要求 120 BPM。在 120 BPM 下,一小节正好是 2.000 秒,所以 H3 的整秒 duration 枚举会自然落在小节线上:4s = 2 小节,6s = 3 小节,8s = 4 小节,10s = 5 小节。你的剪切点会落在强拍上,不需要碰任何 marker。
模型:minimax/music-2.6。设置:format: mp3,sample_rate: 44100,bitrate: 256000,is_instrumental: false。
风格提示:
Plain1Synth-pop at exactly 120 BPM, straight four-on-the-floor kick, bright analog 2sidechained pads, clean female lead vocal sitting forward in the mix, wide 3stereo chorus, no rap, sustained open vowels, cinematic and slightly 4melancholy, radio-ready master
歌词:
Plain1[Chorus] 2Hold the line, hold the light 3I am running out of night 4Say my name into the rain 5And I will burn again
它用 75 秒返回了一首 70 秒音轨,费用 $0.15. 然后我没有直接相信它,而是通过对文件运行 onset-novelty autocorrelation 来检查速度。最强 lag 正好出现在 0.500 s,也就是 120 BPM;而节拍网格从解码文件的 0.24 s 处开始,不是从零开始。这个偏移很重要:从 0.24 开始切,每段切片都会从强拍开始。
Bash1# 32-second master, starting on the downbeat at 0.24s 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# four 8-second slices, one per shot, each 4 bars and well under the 15s cap 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
如果你已经有自己的音轨,完全跳过这一步。这才是正常情况,也是最便宜的情况。
第 2 步:用一张 GPT Image 2 基础帧锁定艺人
每个镜头都引用这个单一文件。这里有什么问题,后面就会重复四次,所以花掉这 $0.17 并认真检查。
模型:openai/gpt-image-2/text-to-image。设置:quality high ,size 2048x1152 (16:9)。
Plain1Cinematic music-video still, waist-up portrait. A 25-year-old East Asian female 2synth-pop singer with silver-white cropped hair and a straight-cut fringe, a matte 3black mesh top, a thin red LED choker glowing against her collarbone, and a single 4silver ear cuff. She stands on a rain-soaked rooftop at night holding a vintage 5chrome handheld microphone close to her mouth. Behind her, out-of-focus magenta 6and cyan neon signage, fine rain caught in a hard backlight, steam drifting from a 7vent. Shot on 35mm anamorphic, shallow depth of field, teal-and-magenta grade, 8visible film grain. Her face is sharp and evenly lit by a soft key from camera 9left. No text anywhere in the frame.

生成的基础帧:银发歌手在雨水浸湿的霓虹屋顶上拿着铬色麦克风_后续_ 每个镜头继承的基础帧。使用 openai/gpt-image-2/text-to-image 生成,quality high,2048x1152,计费 $0.1745。

GPT Image 2 在 Atlas Cloud playground 中运行这条精确提示词,输出面板里显示完成帧
同一条提示词在 playground 中:Size 16:9 at 2048x1152,Quality high,Run 按钮报价 $0.1745,也就是 API 实际向我收取的价格。目录中的 $0.009 是最低 token 档,不是这一次。同一提示词,不同 seed,所以这张渲染不是上方那份精确文件。
那条提示词里的服装词(silver-white cropped hair, matte black mesh top, red LED choker, silver ear cuff)会在下面每条提示词中逐字复用。这种重复就是整个一致性机制。不要改写。
第 3 步:用免费参考音频运行第一个 MiniMax H3 音乐视频镜头
模型:minimax/h3/reference-to-video。设置:refers = 基础帧加上 slice-0.mp3,resolution: 2K,duration: 8,ratio: 16:9。
明确设置 ratio。playground 默认是 adaptive,当你说清楚想要的画幅时,endpoint 会更稳定。
Plain1Music video shot. The woman in the reference image sings the reference track 2straight down the lens on the wet neon rooftop, holding the chrome microphone at 3her mouth. She lands the first line hard on the downbeat, eyes locked to camera, 4then tilts her head back on the sustained note. Slow push-in from waist-up to a 5tight close-up across the eight seconds, handheld micro-drift, rain streaks 6crossing the hard backlight. Her mouth shapes follow the sung vowels of the 7reference audio exactly, she is singing, not speaking. Identical silver-white 8cropped hair, matte black mesh top and glowing red LED choker as the reference 9image. Soundscape: the reference track in stereo, plus faint rain and a distant 10city hum low in the mix.
镜头 1,打开声音。2560x1440,精确 8.00 s,24 fps,32 kHz 立体声。从提交到拿到文件 345 秒,计费 $1.12. 注意大约 5 s 处长音时她向后仰头的动作。

reference-to-video playground 中已加载基础帧和音频切片,输出面板显示完成片段
Reference Materials 显示 2/9: slice-0.mp3 占一个槽,基础帧占另一个。Resolution 2K,Duration 8,Run 按钮报价 $1.12,也就是 8 x $0.14. 注意 Aspect Ratio 下拉框停在 adaptive ,这是页面默认值;我的 API 调用明确把 ratio 设为 16:9。
有一个数字值得记下来:duration: 8 交付的容器精确为 8.00 秒。duration: 4 则交付了 4.46 秒。如果你计划按小节线拼接,请使用会精确返回的时长。
第 4 步:再拍三个世界,同时不丢掉这张脸
同一张基础帧,同一句服装描述,下一段音频切片。其他一切都改变。
4a. 金色时刻的沙漠公路。 refers = 基础帧 + slice-8.mp3,2K,duration: 8,ratio: 16:9。
Plain1Music video shot. The same woman from the reference image stands on the centre 2line of an empty desert highway at golden hour, no microphone, an open indigo 3denim jacket over the same matte black mesh top, the red LED choker still lit. She 4mouths the chorus of the reference track into the wind while the camera tracks 5backwards low over the asphalt. Heat shimmer off the road, dust lifting, her 6shadow stretching long toward the lens, an anamorphic flare crossing at the 7halfway point. Hair, face and wardrobe identical to the reference image. 8Soundscape: the reference track over open desert wind, wide and airy.
镜头 2,打开声音。同一张脸,相反的色温,参考音轨被重新混在开阔风声下。332 s,$1.12。
4b. 白色无限影棚。 refers = 基础帧 + slice-16.mp3,2K,duration: 8,ratio: 16:9。
Plain1Music video shot. The same woman from the reference image in a pure white 2infinity-cove studio under flat high-key light with no shadows, wearing a glossy 3red vinyl trench coat over the same matte black mesh top, red LED choker visible 4at the collar. She dances four bars to the reference track, silver-white hair 5whipping on each turn. Locked-off wide frame, then a hard snap-zoom to a medium on 6the second downbeat. Small white paper squares fall like confetti through the 7final two seconds. Face and hair identical to the reference image. Soundscape: the 8reference track, dry and close, plus the squeak of shoes on the studio floor.
镜头 3,打开声音。平坦无影的光线是最难隐藏换脸的地方,而它 稳住了 。8.00 s,$1.12。
4c. 水下 b-roll,无 lip sync。 refers = 基础帧 + slice-24.mp3,2K,duration: 8,ratio: 16:9。
Plain1Music video shot. The same woman from the reference image suspended underwater in 2a black tank, silver-white hair floating out around her, the red LED choker 3glowing through the water, the black mesh top billowing slowly. One hard beam of 4light from directly above; bubbles rise past the lens in slow motion. She opens 5her eyes on the downbeat and reaches one hand toward the surface. She does not 6sing and her mouth stays closed. The camera rotates thirty degrees around her 7across the shot. Face identical to the reference image. Soundscape: the reference 8track heard from above the surface, muffled and low-passed, with bubble 9transients.
镜头 4,打开声音。指令 “she does not sing and her mouth stays closed” 得到了遵守,这一点很有用:参考音频驱动的是时机,不是强制表演。329 s,$1.12。
第 5 步:跑一个空音频槽的对照样本
和第 3 步同一条提示词,逐字相同。唯一变化:refers 里只有图像,没有别的。768P,duration: 8。
这个片段比任何段落都更能解释整个机制。把它和第 3 步对照着听。
对照样本。提示词完全相同,没有参考音频,1344x768,8.00 s,200 s,$0.80. H3 写了自己的配乐,表演是泛泛的“有人在唱歌”,而不是这些词。
与我的母带相比,对照样本的音频包络相关性为 0.26。第 3 步为 0.956. 这个差距就是免费音频槽带来的价值。
第 6 步:故意弄坏 Lip Sync
每个模型都有音节上限。找到你的上限要花 $0.40。
我又生成了一条 double-time rap 音轨(仍然用 minimax/music-2.6,$0.15),切出一段 4 秒切片,大约每秒六个音节,然后把它喂进同一套屋顶场景,设置为 768P、duration: 4。
Plain1Music video shot. The woman in the reference image raps the reference track 2straight down the lens on the wet neon rooftop, holding the chrome microphone at 3her mouth, delivering every syllable of the fast double-time verse. Locked-off 4medium close-up, slight handheld drift, rain streaks in the hard backlight. Her 5mouth shapes follow the rapped syllables of the reference audio exactly. Identical 6silver-white cropped hair, matte black mesh top and glowing red LED choker as the 7reference image. Soundscape: the reference track in stereo plus faint rain.
压力测试,打开声音。1344x768,4.46 s,192 s,$0.40. 嘴部一直在动,也保持在节拍上,但不再解析单个辅音,而是落入重复的张合循环。演唱线条会有明确的元音口型;这个不会。
我对交付文件的真实判断是:持续的演唱元音是 H3 嘴部表现真正有说服力的地方;密集的说唱辅音则会退化成“看起来合理”的运动。把特写安排在演唱句,把快节奏段落放到 b-roll 上。关于语音与演唱差异的更多细节,可以看这篇 lip sync 与音频拆解。
第 7 步:拼接、静音,并把母带重新铺回 MiniMax H3 音乐视频
四个精确 8.00 秒的片段拼接后正好是 32.00 秒,也就是 120 BPM 下的 16 小节。不需要修剪。
Bash1# 1. strip each clip's audio 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. concatenate in bar order (4 x 8s = 32s = 16 bars @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. lay the original master back 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
既然模型已经把你的音轨还给你了,为什么还要静音?因为每个片段的立体声混音都带着该片段提示词要求的环境声:镜头 1 的雨声、镜头 2 的沙漠风声、镜头 4 的水下低通滤波。单个镜头很美,但跨剪切点就不连贯。母带给你的是一个连续的全码率混音,没有逐镜头重新编码。H3 交付表演同步。你的母带交付歌曲本身。
MiniMax H3 音乐视频配方的四种变体
竖版发布剪辑。 设置 ratio: 9:16,就能从同一张基础帧和同样的切片得到一个 Spotify Canvas 或 Shorts 切片。它返回的是真正的 768x1344,所以和 playground 里的画幅下拉框不同,API 的 ratio 值确实会生效。Canvas 循环按设计是静音的,所以这个版本以 GIF 发布。

同一位艺人在霓虹屋顶上的 9:16 竖版循环剪辑_同一张基础帧,同一段参考切片,_ ratio: 9:16 ,768P,费用 $0.80. 一个诚实的小问题:我要求 “not singing”,结果还是在唱。有 vocal 放在参考槽里时,音频会赢下这场争论。如果你想要静默表演者,请喂入 instrumental 切片。
用参考视频代替参考图像。 你可以给 H3 最多三段参考视频片段,用它们承载运动和构图,而不是用文字描述。注意计费表:参考 视频 按输出费率计费,而参考音频免费。这个不对称性是这个 endpoint 上最有用的定价事实。
纯 b-roll visualisers。 完全去掉表演者。输入产品照、专辑封面物件或纹理板,再加音频切片,只提示相机运动。没有脸要保持,没有 lip sync 会崩,而且整支都可以用 768P 拍。
低成本打样,高成本定稿。 768P 是 $0.10/s,2K 是 $0.14/s,两者都返回相同的 32 kHz 立体声,所以你评估的表演是一样的。省钱不在保留镜头,而在废片:每个失败的 8 秒 take 花 $0.80,而不是 $1.12. 先用 768P 滚到 take 对了,再为最终那一次付 $1.12。一个需要三次尝试的镜头,这样是 $2.72 而不是 $3.36. 关于档位差异的更多内容见 768P 与 2K 对比,关于单个片段能拉多长见 clip length guide。
一支完整 MiniMax H3 音乐视频实际花了多少钱
下面每一行都是完成后从 prediction record 拉回来的真实计费数字,不是目录价。
| 项目 | 模型和设置 | 计费 |
|---|---|---|
| Hook,70 s 歌曲 | minimax/music-2.6,mp3 44.1 kHz | $0.15 |
| 艺人基础帧 | openai/gpt-image-2/text-to-image,high,2048x1152 | $0.17 |
| 镜头 1,霓虹屋顶 | minimax/h3/reference-to-video,2K,8 s | $1.12 |
| 镜头 2,沙漠公路 | same,2K,8 s | $1.12 |
| 镜头 3,白色影棚 | same,2K,8 s | $1.12 |
| 镜头 4,水下 | same,2K,8 s | $1.12 |
| 完成视频小计 | $4.80 | |
| 验证探针 | 768P,4 s | $0.40 |
| 对照样本,无音频 | 768P,8 s | $0.80 |
| 压力测试用 rap 音轨 | minimax/music-2.6 | $0.15 |
| Lip-sync 压力测试 | 768P,4 s | $0.40 |
| 竖版 Canvas 剪辑 | 768P,8 s,9:16 | $0.80 |
| 本文 Hero image | openai/gpt-image-2/text-to-image,high | $0.17 |
| 超限测试,24 s 音频 | 提交时被拒绝 | $0.00 |
| 四次错误音频 MIME 提交 | 提交时被拒绝 | $0.00 |
| 参考音频,4 x 8 s | 免费输入 | $0.00 |
| 总花费 | $7.53 |
按进入成片的 2K 镜头计算,这是 每完成一分钟 $9.00,还不算我的任何错误。如果全片都用 768P 拍,同样一分钟是 $6.61. 人类 MV 团队不会报出这两个数字中的任何一个。
如果你在预算更长的作品,有两条操作备注。提交时被拒绝是免费的,所以错误参数只会花你的时间,不花钱。并且 prediction 上的 price 字段会延迟填充,所以如果你想要真实账单而不是 null,请在文件下载后再次轮询 request ID。
谁的歌,谁的脸:发布前要检查什么
简短说,因为这很重要,也不需要长篇说教。
你需要拥有参考音轨的权利。 免费输入不等于免费清权。把一首商业发行单曲作为参考音频喂进去,然后发布输出结果,是通往下架通知的最快路线。你自己的录音、你委托制作的音轨,或你生成的内容都可以。
不要用真实在世艺人的脸来制作基础帧。 这里的一致性机制非常擅长在多个镜头中保持同一张脸,这也正是把它指向真人会很糟糕的原因。
开放权重和 API 访问是两种不同许可证。 MiniMax 于 2026 年 8 月在 Hugging Face 发布了 H3 的权重,其社区许可证目前排除欧盟、英国、韩国和美国,并为这些地区开放了正式授权渠道。这个限制适用于你自己运行权重的情况。通过托管 API 调用模型属于服务关系,不会让你受权重许可证约束。在做任何假设之前,值得先弄清楚自己处在哪种情况。
如果想更广泛地了解 H3 相对其他选择的位置,可以看 Seedance 2.5 对比 和 prompt structure guide。至于为什么这件事值得折腾:在带音频的视频编辑模型排行榜上,H3 目前以 1,126 Elo 排名第一,领先 Gemini Omni Flash 的 1,119 和 Dreamina Seedance 2.0 的 1,027(Artificial Analysis,2026 年 8 月 10 日检查)。这些分数会随投票变化,所以请把它们视为一个快照。
MiniMax H3 音乐视频:常见问题
一支 MiniMax H3 音乐视频能直接跑完整三分钟吗?
不能通过一次生成完成。单次调用上限为 15 秒。但这是单次生成上限,不是单个项目上限。一支三分钟视频如果每个镜头 8 秒,就是 23 次生成,2K 大约 $25.76;如果你的音轨是 120 BPM,每一次都会落在小节线上。切片、拍摄、拼接、把母带铺回去。
MiniMax H3 音乐视频使用的是我的真实歌曲,还是模型重新生成音频?
它使用的是你的真实歌曲。我测得我上传的 8 秒 mp3 与返回 mp4 内部音频流之间,在零样本偏移处的原始波形相关性为 0.892,上面叠加了提示词要求的环境声。没有参考音频生成的对照样本与同一母带的相关性为 0.26。你仍然应该把母带重新铺到最终拼接成片上,因为每个片段都有自己的逐镜头环境声和 AAC 编码,剪切后无法干净延续。
把歌曲喂进 MiniMax H3 音乐视频会额外收费吗?
不会。我的四段 8 秒参考切片给 $4.48 的镜头账单增加了 $0.00。需要注意的是参考 视频,因为它按输出费率计费。限制是最多三段音频,每段 2 到 15 秒,总计 15 秒,并且音频绝不能是唯一参考。
MiniMax H3 在演唱上的 lip sync 和语音相比有多好?
持续演唱的元音是它的强项:清晰的口型、与音符匹配的保持动作,以及长音时的后仰读起来像表演,而不是循环。密集吐字则是它放弃的地方。我的每秒六个音节 rap 测试保持了节拍,但不再解析辅音,并落入重复张合循环。把快节奏段落放到 b-roll 上。
如何在 MiniMax H3 音乐视频的每个镜头中保持同一张脸?
三件事,而且都很无聊。同一张参考图在每次调用中复用,绝不重新生成。相同的服装描述在提示词之间逐字复制,不要改写。并且每条提示词都明确写上 “identical to the reference image”。我的四个镜头跨越雨夜、低角度阳光、平坦高调光和水下环境,没有漂移。
MiniMax H3 音乐视频每完成一分钟要多少钱?
按我的真实账单计算,一段 32 秒成片花费 $4.80,折合 2K 每完成一分钟 $9.00。全片用 768P 拍同样一分钟为 $6.61,而且 768P 交付同样的 32 kHz 立体声,所以你评估的表演完全一样。用 $0.80 跑废片,只在最终能进剪辑的 take 上支付 $1.12。






