仅限两周 | Seedream 5.0 Pro 立享 8 折!

Seedance 2.5 对比 MiniMax H3:每个人都测试了30秒的Flex。但没人测试过Shot 4。

Seedance 2.5 对比 MiniMax H3,相同角色设定,相同提示词。真实规格参数、可复制粘贴的5步短剧工作流,以及哪一个能在四个镜头中保持面部一致性。

MiniMax在上周五发布了H3。24小时内,Seedance 2.5就送到了用户手中,时间线坍缩成一场对话:三十秒、原生4K、五十个参考输入。H3的发布帖子静悄悄地躺在下方,几乎没人真正跑过测试。

我理解原因。三十秒是个很漂亮的数字,适合放进标题。

但如果你真的在制作竖屏短剧,你就会知道毁掉你夜晚的不是第30秒,而是第4个镜头。男主角的下颌线偏移了半厘米,领结少了一个褶皱,观众在钩子落地前就划走了。没有人会因为一个片段是15秒而不是30秒而流失。他们流失是因为特写里的那个人和全景里的不是同一个人。

所以我跳过了参数对决。我制作了一张角色转面图、一张六格场景板,写了一个15秒的哥特短剧提示词,然后把完全相同的素材包发给两边。然后我盯着那张脸看。

关键要点

  • 两者都是真实的,但并非同样可触达。 H3的三个端点(文本、图像和参考到视频)现已上线并可调用。Seedance 2.5的API在字节跳动那边已发布,但在我所用的多模型平台上,它仍然只是一个Day-0页面,因此我进行的头对头对比中,Seedance一侧是Seedance 2.0参考到视频。我在所有重要之处都标注了这一点。
  • 规格清晰分立。 Seedance 2.5 = 单次生成最长30秒,原生4K,最多50个多模态参考,区域级编辑。H3 = 5到15秒,原生2K 24fps,9张图片+3个视频+3个音频片段(最多12个文件),每个输出均有立体声,整段指令编辑。
  • 角色稳定性是素材包问题,而非模型生成问题。 使用一张复合转面图加一张光照板,两个模型都保持了相同的面容和服装。无论生成次数多少,都无法拯救或毁掉镜头;关键在于素材包。
  • 没人测试的那个模型已经排到第三。 在Artificial Analysis图像到视频竞技场中,H3以1185 Elo排名第三,落后于Seedance 2.0的1196 Elo。Seedance 2.5尚未登榜。
  • 两者都能生成自己的音频。 H3还接受最多三个音频参考来固定角色的声音,这省去了短剧流程中整个TTS和同步步骤。
  • 关注每帧像素,而非秒数。 相同的参考包、相同的时长:H3的参考到视频返回1440p,Seedance 2.0的参考到视频返回720p。这重新定义了整个成本问题。

Seedance 2.5自身的配对数据尚未公布。一旦端点在我测试的平台开放,我会立即补充。

Seedance 2.5 vs MiniMax H3 结果,不谈理论

在谈任何理论之前,我们先看工作流产出的内容。这是从一个完成的15秒竖屏片段中截取的四个镜头并拼贴而成。这是MiniMax自家H3参考运行的结果,基于你将在步骤1和步骤2中看到的角色表和场景板,原生1440x2560分辨率。我使用相同素材包进行的后续运行将在教程中展示,并附有游乐场状态。

她到达雕花门(场景板第4格),然后是在走廊对峙,接着是他紧贴脸部的特写,最后是双人镜头。他的发际线在侧面和特写中分得一模一样。她的半扎辫王冠在正面脸部特写中幸存,而这正是大多数模型悄悄重建脸部的时刻。奶油色蕾丝紧身胸衣从第一帧到最后一帧保持着相同的领口和袖口。

这就是整个测试。不是三十秒。而是四个镜头和一条下颌线。

为什么Seedance 2.5 vs MiniMax H3在同一周爆发,以及为什么大多数角色测试毫无用处

MiniMax于7月30日发布了H3,这是一个通用多模态视频模型,能将文本、图像、视频和音频作为单一上下文处理,并返回5到15秒、最高2K分辨率、原生立体声的片段。它还能编辑现有素材,并将动作从一个片段转移到另一个片段。MiniMax表示权重将在数天内发布(Reuters,2026年7月)。

Seedance 2.5在同一窗口期发布,带着更响亮的数据:单次生成长达30秒、原生4K、单个任务中最多50个多模态参考输入(The Next Web,2026年7月)。其API已在开发者手中,具备局部编辑功能(可重绘帧的一部分,同时保持表演、光照和摄像机行为不变)、参考到视频(接受绿幕或3D白模区块)、11种语言,以及实验性长视频模式(可达180秒)(CineD,2026年7月)。

关注度差距是很有趣的部分。我找到的几乎所有帖子都是2.5的片段。与此同时,公共竞技场数据却说了另一回事:在Artificial Analysis的图像到视频排行榜上,720p的Seedance 2.0以1196 Elo领先,Gemini Omni Flash以1195 Elo紧随其后,而MiniMax H3在发布仅四天后就以1185 Elo位列第三。Seedance 2.5尚未有评级(Artificial Analysis,2026年7月)。声音最少的模型,恰恰是得分与关注度比率最高的那个。

现在谈谈真正决定你输出的部分,因为它几乎与你选择哪个logo无关。

大多数角色一致性测试在模型参与之前就已经失败了。四种失败模式,全部由你来解决:

失败模式输出中看到的现象修复方法
多视图参考作为单独文件发送每个镜头的脸都“几乎正确”,但彼此不一致将视图合成为一张图,然后在提示词中分配角色(“左边的男人”,“右边的女人”)
每个镜头都重写角色描述服装和配饰在镜头间漂移一次性写好身份块,然后逐字复用;每个镜头只更改摄影机和动作
让光照随场景移动在新光照下,面部结构被重建构建一个单独的场景板,锁定光照方向、雾气和地面反射,并将其作为参考输入
将最大时长视为质量指标30秒内的一次漂移毁掉所有30秒将剪辑切分为可以重新生成的粒度,然后再讨论长度

第一行是人们最容易出错的地方。发送六张单视图图像,模型会将其视为六个候选人物并取平均值。发送一张干净的复合图,模型会将其视为从三个角度看到的同一个人。同样的像素,完全不同的结果。

Seedance 2.5 vs MiniMax H3 规格表,以及今天实际可调用的内容

将能力与可用性分开,矛盾就变得清晰了。在原始能力上,Seedance 2.5在时长、分辨率上限、参考数量以及编辑粒度上领先。在可用性上,H3是本周在通用模型平台上拥有三个活跃端点的那个。如果你正在为2026年规划做AI视频模型对比,第二列与第一列同样重要。

 MiniMax H3Seedance 2.5Seedance 2.0 参考到视频(我实际运行的)
单次生成最大长度5 到 15 秒最长 30 秒,无需拼接(测试版可达 180 秒,实验性)短片段菜单,详见模型页面
分辨率原生 2K,16:9 至 9:16 下短边为 1440p;标称将推出 768p 档位原生 4K,10 位色深此端点最高 720p
帧率24 fps未单独公布未单独公布
参考输入9 张图片 + 3 个视频 + 3 个音频,共 12 个文件最多 50 个多模态参考9 张图片 + 3 个视频 + 3 个音频
原生音频是,每个输出均为立体声是,外加 11 种字幕和语音语言
编辑粒度整段指令编辑(替换角色、背景、光照、对话)区域级编辑,可重绘帧的一部分整段指令编辑
提示词上限7,000 字符未公布未公布
开放权重发布后数天内宣布未宣布未宣布
Artificial Analysis I2V Elo,2026年7月31日1,185(第3名)尚未评级1,196(第1名,Dreamina 720p 条目)
在我测试的平台上可调用是,3 个端点否,Day-0 页面

测试设置的全部披露。 当我运行本次测试时,Seedance 2.5在我使用的平台上尚未开放,因此Seedance一侧使用的是Seedance 2.0 参考到视频,这是同一家族中当前已发布的产品,具有相同的四模态参考系统。如果2.5会改变答案,我会明确指出。Seedance 2.5 页面目前只是一个Day-0通知。

以下所有内容均在单个浏览器标签页中运行,使用同一个密钥,共三个模型:

步骤模型产出物关键设置驱动成本的因素
1OpenAI GPT Image 2 文生图角色转面图质量高,16:9按图像计费,即用即付,当前费率见模型页面
2同一模型,第二次运行六格场景及光照板质量高,16:9按图像计费,即用即付
3MiniMax H3 参考到视频9:16 竖屏片段,含原生音频9:16,2K,测试时长5秒,正式剪辑时长15秒秒数×分辨率,按秒计费
4Seedance 2.0 参考到视频对照运行,完全相同输入9:16,最高可用分辨率,相同时长秒数×分辨率,按秒计费
5H3 参考到视频,以片段为输入修复一个镜头,无需重新生成全部相同分辨率,短时长秒数×分辨率,按秒计费

H3还有文生视频图生视频端点,如果你想使用纯文本基线或首尾帧控制。

在计划批量生成之前,还有一件事值得了解:屏幕文字。这个15秒的H3标题序列在八次硬切中保持了英文演职员表,没有一个拼写错误,这在生成视频中是最难保持稳定的要素之一。

Seedance 2.5 vs MiniMax H3 短剧工作流,分步详解

五个步骤。请完全按照原文复制提示词,包括那些难看的部分。我没有为文章做任何清理,你也不应该为模型做任何清理。

步骤1:使用GPT Image 2构建角色表

在制作任何视频之前,先制作参考包。一张图片,两个角色,每个角色三个视图,纯白色无缝背景,均匀的影棚灯光。这消除了除你关心的那个之外的所有歧义:这个人长什么样。

plaintext
1一张全身角色转面参考图,纯白色无缝背景,两个角色并排,共六个人物,均匀中性影棚灯光,地面无阴影,无文字,无标签,无水印。
2
3左半部分,男主角,三个视图排成一排:正面、右侧面、背面。二十多岁,肤色白皙,深色波浪中长发,下颌线锐利。穿着及地黑色天鹅绒长外套,领口和袖口有细腻的同色系刺绣,黑色锦缎马甲,黑色丝绸领结,直筒黑色长裤,抛光黑色皮革德比鞋。手臂自然垂于两侧,中性表情。
4
5右半部分,女主角,三个视图排成一排:正面、右侧面、背面。二十出头,肤色白皙,长卷栗色头发,半扎辫王冠。穿着奶油色维多利亚棉质蕾丝连衣裙,长袖带蕾丝袖口,合身紧身胸衣配小纽扣,全长及踝裙摆,奶油色踝带低跟鞋。手臂自然垂于两侧,中性表情。
6
7摄影写实风格,六个人物比例一致,脚部对齐在同一水平线上,边缘到边缘清晰对焦。

设置: 模型 OpenAI GPT Image 2 文生图,质量高,宽高比 16:9,其他默认。 总计:11字。完美。AI图像生成器界面,显示提示输入和生成的角色 Atlas Cloud上的GPT Image 2文生图,运行完成:左侧是转面提示词,OUTPUT面板中白色背景上的六个人物。

这是目标形态。六个人物,同一基线,背景中没有任何可争论的东西: 让我们 驱动演示片段的参考包:男主角穿黑色天鹅绒,女主角穿奶油色维多利亚蕾丝,每个角色三个视图,一个文件。 维多利亚风格黑色和奶油色服装的正面、侧面和背面视图 我自己对步骤1提示词进行的GPT Image 2运行,与上图参考进行对比。

步骤2:用六格场景板锁定场景

你保住了脸,但光照仍会背叛你。第二张参考图像固定了六个机位、月光方向、空气中雾气的多少以及地面的湿润程度。你在告诉模型,这部电影只有一套光照设置。

plaintext
1一张六格电影场景板,2行3列,面板之间为细黑边框,每个面板底部用优雅的小写白色全大写字母间距字体标注标题。主题:废弃哥特城堡内部,夜晚。冷蓝色月光,低飘雾气,湿润反光石地板,高耸彩色玻璃窗,带小火苗的铁制烛台,深去饱和的黑色,厚重的天鹅绒窗帘。所有面板中均无人。
2
3面板1,标题 “WIDE ESTABLISHING VIEW - CORRIDOR”:长柱廊向远处延伸至点亮的彩色玻璃窗。
4面板2,标题 “LOW ANGLE - MOONLIGHT ACROSS FLOOR”:低角度机位,一束月光斜射过湿润的板岩。
5面板3,标题 “DOORWAY & STAIRCASE COMPOSITION”:拱形门框,内嵌弧形石楼梯。
6面板4,标题 “CLOSE DETAIL - CARVED DOOR”:厚重雕花木门紧贴镜头,带铁质把手。
7面板5,标题 “WINDOW-SIDE VIEW - FOG & CURTAINS”:高窗,雾气涌入,窗帘边缘在前景。
8面板6,标题 “FINAL POSTER FRAME - EMPTY HALL”:对称空荡大厅,图案地毯通向窗户。
9
10摄影感,电影感,胶片颗粒,六个面板色调一致。

设置: 同一模型,质量高,宽高比 16:9。 六张故事板面板,展示黑暗哥特城堡内部及月光 驱动演示片段的场景板:六个哥特城堡内部,同一色调,标题可读。 六种电影机位角度,黑暗哥特城堡内部 我自己对步骤2场景板提示词进行的GPT Image 2运行。

步骤3:使用MiniMax H3参考到视频生成镜头

两张参考图像加上一个包含机位和音频方向的提示词。声音在同一轮中生成,因此没有单独的语音或配乐步骤。在调试时保持短时长,然后在正式剪辑时推至15秒。

plaintext
1参考图像1是角色表:左边的男人是男主角,右边的女人是女主角。保持两个身份完全如所示:他的下颌线、深色波浪发、黑色天鹅绒长外套、黑色锦缎马甲和黑色丝绸领结;她的栗色半扎辫发型和奶油色维多利亚蕾丝连衣裙。参考图像2是场景和光照板:匹配其冷蓝色月光、飘动雾气、湿润反光石地板和深去饱和的黑色调。
2
39:16竖屏,高端真人短剧风格,浅景深,电影感对比度,无字幕,无屏幕文字,无水印。
4
5镜头1:中近景,摄像机缓慢推进。女主角站在月光照射的走廊中,呼吸微弱,目光凝视画框右侧外的某物。雾气在膝盖高度飘过她身边。
6镜头2:硬切。从她身后过肩镜头,男主角从黑暗拱门中步入月光,外套捕捉光线,表情冷漠而好奇。
7镜头3:他面部的紧贴特写,半明半暗地映着窗户,然后是她面部的匹配特写,她拒绝移开视线。
8
9音频:低沉持续的贝司嗡鸣,遥远的石头回声,她不安的呼吸,他步入光线时一声沉重的脚步声,最后一个切上出现一次柔和的弦乐渐强。

设置: 模型 MiniMax H3 参考到视频,分辨率 2K,时长 8(滑块默认值;正式剪辑推至15),宽高比自适应,两个文件均放入参考材料。面板将其计为9个中的2个,因此你有充足空间添加服装或道具图。

值得注意宽高比的情况。我将宽高比设为自适应,仅在提示词中写了“9:16竖屏”。H3仍然返回了竖屏,因此它从文本中读取了构图,无需使用表单字段。 AI视频生成器界面,显示文本提示和完成后的视频预览 Atlas Cloud上的MiniMax H3参考到视频,运行完成:两个参考文件已加载(9个中的2个),分辨率2K,生成的竖屏片段在OUTPUT面板中播放。

第一帧是女主角穿着奶油色蕾丝紧身胸衣,站在场景板面板1中的走廊里,雾气在膝盖高度,月光照在潮湿的地板上,与场景板中的位置完全一致。两张参考图像都落地了。

步骤4:使用完全相同素材包运行Seedance 2.5 vs MiniMax H3对照

不要更改一个字。相同的两张参考图像,相同的提示词,不同的模型。我让每个页面自身的时长默认值保持不变,而不是强制匹配,并在下方说明每个模型返回的结果。为了“配合”另一个模型而改述提示词,正是比较开始撒谎的方式。

plaintext
1与步骤3相同的提示词,逐字复制。不要为了另一个模型而改述它。

设置: 模型 Seedance 2.0 参考到视频,分辨率 720p,相同的两张参考图像放入参考图片(同样是9个中的2个,另有单独插槽用于最多3个参考视频和3个参考音频文件)。时长保持页面默认值,返回的片段为10秒。 AI视频生成界面,显示文本提示和完成后的视频 Atlas Cloud上的Seedance 2.0参考到视频,使用与步骤3完全相同的参考包和提示词运行完成,OUTPUT面板中显示10秒结果。

以下是两个OUTPUT面板实际显示的内容,我如实报告,而非选择赢家。

两个运行都保持了角色。相同的奶油色蕾丝连衣裙,相同的领口和袖口,相同的栗色头发,相同的雾气与月光走廊,均来自场景板。两者都没有创造出一个不同的女人。参考包在两边都完成了这项工作,这是我最关心的发现。

差异在于形式,而非面孔。这个Seedance端点返回720p;H3在相同输入下返回2K。构图也不同:H3从提示词文本中直接读出了“9:16竖屏”并返回竖屏,而Seedance运行返回的是16:9,因为该页面有自己的宽高比控制,仅凭提示词文本未能覆盖。如果你在为TikTok剪辑,第一次忘记表单字段时,这个差异会让你多花一次运行的成本。Seedance 2.5可能会改变分辨率这一部分,并增加区域级重试,我不想假装我测量过这一点。

步骤5:修复一个镜头,无需重新生成整个片段

短剧的真正成本不在于第一次生成,而在于第七次修改。H3接受现有片段作为输入,并根据指令进行编辑,同时保持你未提及的部分不变。Seedance 2.5在此处的卖点更精细:重绘帧的一个区域,同时保持表演、光照和摄像机不变。

plaintext
1使用提供的片段:保持两个角色、他们的服装、摄像机运动以及剪辑节奏完全不变。仅更改环境:将月光石走廊替换为同一城堡的舞厅,高耸的拱形窗户,点亮的枝形吊灯,温暖的烛光,并重新照亮两个角色,使其主光源来自画面左侧的枝形吊灯而非窗户。将她唯一的一句台词重写为“你从未睡着过,是吗。”保持她在相同节拍上的表演时间。

设置: MiniMax H3 参考到视频,以步骤3的片段作为参考输入,时长5,分辨率2K。

超越Seedance 2.5 vs MiniMax H3测试:四种优化参考包的方法

同一角色,下一集。 将步骤1的图保存为资产,只更改提示词中的镜头列表和故事模块。身份来自文件,而非你记忆中上周二如何措辞的印象。

同时固定声音。 H3接受最多三个音频参考,每个2到15秒,且必须伴随图像或视频输入。给它一个声音样本,角色就会以该音色说话,这样你就不用在各集之间重新选配音演员了。

在付费渲染前先锁定摄像机。 Seedance 2.5的参考到视频接受3D白模区块和绿幕板,因此你可以先在灰色几何体上锁定构图,然后再投入最终效果。此示例运行在Seedance 2.1(家族早期成员)上,但工作流形态相同。

本地化一个母版剪辑,而非重新拍摄。 区域级替换可以更换面孔、产品或口头语言,同时保持摄像机、时间点和唇部时长不变。此处,一个母版美妆镜头被重新选角并重新配音为西班牙语、韩语和印地语,房间、构图和唇部时长保持不变。

另外,考虑到有人会问当你不再保持理智时动作转移会是什么样子:三个穿西装的男人,被替换为三只逼真的水豚,它们逐拍跟随原始片段的动作路径,直到堆叠成金字塔。

还有所有这一切的朴素版本,没人会发帖的那种:静态海报变成动态海报,布局保持不变。 穿粉色恐龙连帽衫的卡通男孩伸着手,巨大爪子 静态源海报。将其输入参考到视频,并加上“保持框架、调色板和布局,动画化文字”,你将获得同一设计的动态版本。

Seedance 2.5 vs MiniMax H3短片实际成本是多少

这里没有数字,因为数字会变动,而结构不会。两个家族都按秒计费,即用即付,无座位费也无订阅费。这留下三个变量:秒数、分辨率等级以及重试次数。

第三个变量就是全部账单。一个15秒的片段,第一次就成功,只需一次收费。同一个片段到第七次,就是七次。因此,省钱的方法不是选择更便宜的每秒模型,而是在生成任何内容之前先做好参考包。步骤1和步骤2中的两次图像调用是整个流程中最便宜的一行,却决定了你要进行多少次视频调用。在整个链条中,这是投资回报率最高的一环,远远领先。

然后纠正按秒计费的直觉。相同参考包,相同时长:H3的参考到视频返回1440p,而此Seedance参考到视频端点返回720p。每秒是错误的单位。每帧像素,以及你是否需要额外付费进行单独的放大处理,才是正确的单位。

音频也应纳入计算。两边都在同一轮中生成原生同步声音。如果你当前的流程是视频模型加TTS再加一个对齐音轨的编辑人员,那么你节省的是两次API调用和一个工作人员整个下午的时间,而这一节省在任何价格清单上都找不到。

哪个任务选哪个模型:

任务选择原因注意事项
竖屏短剧,9:16,TikTok或ReelShortMiniMax H31440p竖屏,自带立体声,现已可调用,15秒足够一个完整钩子在15秒处剪辑,因此按节拍规划
一个连续30秒的品牌影片Seedance 2.5单次生成,无需拼接,原生4K先确认平台可用性
在已批准的剪辑中修复一个镜头Seedance 2.5区域级重绘,其余部分保持不变H3的整段剪辑编辑今天已能完成大部分工作
产品和电商剪辑两者均可两者都能很好地保持屏幕文字和品牌标识在最终输出分辨率下验证文字
游戏或界面演示MiniMax H32K分辨率下UI和排版稳定性出色单次生成上限15秒
单个母版的多语言版本Seedance 2.5区域替换加多语言语音本地化质量仍需母语者检查
今晚就要发货MiniMax H3三个端点已上线,外加整个Seedance 2.0系列Seedance 2.5的可用性因平台而异

在发布之前。 MiniMax表示H3的权重将在发布后数天内发布,但开放权重不等同于商业许可,因此自托管前请阅读条款。水印和商业使用政策在消费者应用和API访问之间也可能不同,我在撰写本文时无法从主要条款页面确认任何一方,因此请查阅提供商的条款,而非仅凭我的说法。此外,任何模型许可都不涵盖肖像权或商标权。如果参考包中包含真实人物、真实品牌或他人知识产权,那是一个单独的法律问题,模型条款无法回答。

上表中所有模型都在同一个密钥上运行,模型页面包含当前费率以及可复制粘贴的代码,包括Seedance系列本周可能进行的任何促销活动。

常见问题

在角色一致性方面,Seedance 2.5比MiniMax H3更好吗?

理论上应该更好,最多50个多模态参考对比H3的12个文件,再加上区域级重试。但截至2026年7月31日,尚无公开的配对测试可供参考,Seedance 2.5也尚未获得竞技场评级。在我实际能运行的测试中,决定身份稳定性的变量是参考包结构,而非模型代数:使用一张复合转面图加一张光照板,两边都保持了角色。在花钱选择模型之前,先做好参考包。

我现在就能用Seedance 2.5,还是必须等待?

其API已在字节跳动上线。在第三方模型平台上的可用性参差不齐,在我测试的平台上,它仍是一个Day-0通知。如果你今晚就需要产出,可调用的选项是MiniMax H3的三个端点以及整个已发布的Seedance 2.0系列。

MiniMax H3真的能生成30秒视频吗?

不能。规格是单次生成5到15秒,24fps。更长的视频需要扩展或拼接,这是另一回事,具有不同的漂移风险。30秒单次生成属于Seedance 2.5。不要让这两个说法混淆。

两个模型都能生成音频吗?我能让一个角色在多集中保持同一声音吗?

两者都在同一轮中生成原生同步音频,H3每个结果都输出立体声。对于持久的声音,H3接受最多三个音频参考(每个2到15秒),必须与图像或视频输入一起提交,不能单独提交。

实际上应该发送多少张参考图像?

比你想象的要少,但结构要更好。一张精心制作的复合图通常胜过六张松散的裁剪图,因为单独的文件会诱使模型将它们平均成一个不存在的人。给它两个明确的任务:身份和光照,不要包含相互冲突的风格样本。

我应该用哪个模型制作TikTok或ReelShort风格的竖屏短剧?

本周发货,9:16,高分辨率,声音已混好:MiniMax H3。如果你计划一个30秒的连续场景,并希望重试单个区域而非整个片段:为Seedance 2.5构建,并在你的平台开放时进行检查。

最新模型

一个 API,畅享全模态 AI。

探索全部模型