Seedance 2.5 现已上线 — 首发 Atlas Cloud

MiniMax H3 视频参考:一个角色,两个镜头,以及一条悄无声息掏空你钱的规则

每个指南都重复着9/3/3规格表。而这个则运行它:一个来自图像、视频和音频参考的双人镜头,在一个MiniMax H3引用到视频通话中。

关于该模型的每一篇文章都在同一行停了下来。九张图片,三段视频剪辑,三段音频剪辑,总共十二个文件。读起来像保修卡。

于是我也把它当作保修卡来对待。我构建了一个角色,构建了一个道具,生成了一幕夜景,将该夜景作为参考视频重新输入,截取了一段八秒的爵士乐作为参考音轨,并将三种参考类型通过一次请求推送出去。然后我开始故意打破规则,看看哪些规则API会真正防御。

其中四条规则的防御方式并非你所预期。其中一条规则仍然会向你收取全额费用,即使你得到了一个并未请求的视频,而你期待的错误信息却从未出现。这一条才值得读到末尾。

关键要点

  • 三种参考类型,一个数组。 最多9张图片,3段视频剪辑和3段音频剪辑,共12个文件。它们都放入同一个 refers 字段,并且 type 是可选的,因为API会根据文件扩展名推断类型。
  • 音频不能单独飞行。 仅含音频的请求会被拒绝并返回一个具名错误。它必须至少与一张图片或一段视频一起提交。
  • 参考视频与图片转视频是互斥的,但没有任何提示。 将首帧 imagerefers 一起发送,任务仍然会完成。你的两个输入之一会在静默中被丢弃,且按全额收费。已在2026年8月12日于两个端点分别验证两次。
  • 提交时不做任何验证。 本文中每个错误的请求都返回了HTTP 200和一个ID。真正的裁决在提交后两到三分钟,在生成阶段才到来。此处的拒绝是免费的;完成则不是。
  • 额外的参考文件是免费的。 一张参考图片和十张参考图片,对于相同的剪辑长度,收费完全相同。价格取决于输出秒数,而非输入数量。

以下是另一端生成的结果。两个镜头,一张脸,两个完全不同的地点,第二个镜头同时由一张图片、一段视频和一个音频文件构建而成。

_镜头A(雨夜,霓虹小巷),然后镜头B(第二天早晨空旷的有顶市场),仅通过拼接剪切在一起。同一个女人,右眉上方同样的疤痕,同样的靛蓝色夹克,同样的毛巾。镜头B是同时使用三个参考生成的:她的肖像、镜头A的剪辑片段本身,以及一段八秒的爵士乐片段。两个镜头均为 minimax/h3/reference-to-video,2K分辨率,2560x1440,24fps,带原生32kHz立体声轨。建议在播放后半段时打开声音,她将说出她的台词。

为什么 MiniMax H3 参考视频胜过任何你能写出的提示词

提示词描述一个人。而参考 就是 那个人。这个区别正是此端点存在的全部原因,也是MiniMax H3目前位居视频编辑排行榜榜首的原因:Elo评分1,125,来自10,280票(Artificial Analysis,2026年8月)。不过,这个数字需要精确理解:同一表格列出其排名范围为1到2,与Google Gemini Omni Flash(1,122分)在统计上并列。第一名,但共享一个置信区间。H3同时在文本转视频和图片转视频中位列前三的相关说法,同样来自该实验室的公告(Artificial Analysis on X,2026年8月)。

排名很廉价。以下是实际表现,相同的提示词,三个级别的参考,其他所有条件完全相同。

让我们说

三个 MiniMax H3 参考视频运行,使用相同的提示词:无参考、一张角色参考图片、两张参考图片

_相同的提示词,相同的768P 4秒设置,从左到右:完全没有参考(文本转视频),一张角色参考图片,两张参考图片(角色加上拉面碗)。提示词在三个运行中都写着“来自参考图片的女人”。在左侧面板中,这个短语指向无物,因此模型编造了一个陌生人。使用 minimax/h3/text-to-video 和 minimax/h3/reference-to-video 生成。

对这张图有两种诚实的解读。从面板一到面板二的飞跃是巨大的:没有参考,“来自参考图片的女人”是一个指向空白的短语,模型安静地用一个与你项目无关的人填补了空白。从面板二到面板三的飞跃要小得多,因为我的提示词也 用文字描述了 碗,而H3仅从文本就画出了一个可接受的带有鹤图案的深蓝色碗。这正是有用的部分。参考图片和好的名词短语在争夺同一项工作,所以把你的参考名额花在语言无法准确描述的东西上:特定的面孔、特定的产品、特定的标志。

本文中几乎每次失败背后的模式都与面板一相同。没有任何东西警告你,你请求的一部分落在了空处。

参考实际锁定什么,以及不锁定什么。 参考图片锁定身份:面部结构、头发、区分性标记、服装。它不锁定光照,这是最常见的意外。它还会拖带参考照片的光线,这就是为什么在氛围环境中拍摄的角色表会生成一个无法适应场景切换的角色。请以平淡、中性方式拍摄你的参考。参考视频锁定运动、调色和颗粒感,而非身份。参考音频锁定音频本身。如果你需要在同一系列中让同一张脸以同一声音念出台词,那么参考堆栈正在做三项不同的工作,你必须指明哪项是哪项。从业者指南通常建议在提示词中用位置命名它们(“图片1是角色,图片2是产品”),这个惯例值得采用;我下面的提示词使用简单的描述性命名,当参考在视觉上清晰时也同样有效。

为什么第一次调用通常令人失望。 四件事,均在2026年8月12日测量:

  1. 提交端点不验证任何内容。错误的MIME、164秒的音频、无效URL、互斥字段:所有这些都返回HTTP 200和预测ID。你稍后才会发现。
  2. ratio 默认为 adaptive,文档说明为“让模型选择”。使用16:9参考时,我得到的是1344x768(768P),无论我将其保持为 adaptive 还是强制为16:9,因此当你的输入本身一致时,默认值是无害的。当它们不一致时,这就像抛硬币,而这是唯一一个你可以简单地将决定权从模型手中夺走的H3端点。
  3. 首帧图片加上参考不会报错。它会静默地丢弃其中一个并收费。
  4. 如果模型没有具体的东西可以把握,它就会自信地填补空白,而一个自信的错误面孔看起来与一次成功运行完全一样。

关于提示词构建方面,MiniMax H3 提示词指南 比我在这里更深入地探讨了措辞。

MiniMax H3 参考视频规则手册:三种类型,一次请求

所有三种参考类型共享一个数组。以下是发布的契约,以及当我对其施加压力时端点实际执行的操作。

表1:三种参考类型

参考图片参考视频参考音频
最大文件数93个剪辑3个剪辑
组合上限三种类型总共12个文件
每个文件时长不适用2到15秒2到15秒
总时长不适用15秒15秒
格式png, jpeg, jpg, webpmp4, movmp3, wav
能否单独使用?,需要一张图片或一个视频
锁定什么身份、服装、产品、风格运动、镜头、调色、颗粒感音频本身
不锁定什么新场景的光照镜头中的人精确的轨道(见步骤6)
交付方式为公共URL或base64数据URL公共URL或base64数据URL必须声明为 audio/mp3,而非 audio/mpeg
是否强制执行?10张图片顺利通过未测试超过1个剪辑每个剪辑的时间窗口强制执行,15秒 总时长 未强制执行

文件数量和时长窗口是MiniMax公布的限制(Hailuo,2026年8月),与发布文章交叉核对,该文章列出了相同的参考视频窗口:每个2到15秒,总计15秒(MarkTechPost,2026年8月)。最后三行中的每一行都是我的测量结果。

规格说明书中没有告诉你两件事。首先,每个条目的 type 字段是可选的,并且从URL扩展名推断,这意味着base64数据URL或无扩展名的链接 必须 声明其类型,否则请求会猜错。其次,浏览器上传器限制为九个文件(参考材料 (2/9)MAX:9,见下方步骤5截图),低于MiniMax自己的十二个。我仍然通过API发送了十张参考图片,任务正常完成,因此九是UI限制,而非模型限制。

表2:参考视频 vs 图片转视频 vs 文本转视频

reference-to-videoimage-to-videotext-to-video
接受 refers是,必需,至少1个否(静默忽略)
接受图片首帧否(静默忽略)是,必需
接受 end_image 最后一帧
比例选项全部7个,包括16:9、9:16、21:9仅 adaptive全部7个
分辨率768P 或 2K,默认 2K相同相同
时长4到15秒整数,默认 8相同相同
混合另一个端点的输入任务完成,输入被丢弃,全额收费任务完成,refers被丢弃,全额收费不适用

第四行是没人提及的区别。在图片转视频上,宽高比枚举只包含一个值 adaptive,因为首帧决定形状。在参考视频上,你得到全部七个,这使得它成为唯一一个你可以在锁定角色的同时强制画面形状的H3端点。如果你正在为此工作选择层级,MiniMax H3 2K vs 768P 涵盖了额外像素带来的好处。

最后一行是昂贵的那行。文档将两个端点描述为互斥的,确实如此,因为只有一个输入路径被采纳。但没有错误。我在2026年8月12日以两种方式运行了:一个携带首帧 imagereference-to-video 调用在115秒内完成,收费$0.40;一个携带 refersimage-to-video 调用在167秒内完成,收费$0.40。两者都生成了一个视频。两者都丢弃了我发送的一半输入,并且响应中没有字段说明哪一半被丢弃。

表3:此工作流使用的模型

以下所有操作都在 Atlas Cloud 的一个浏览器标签页中运行,价格和截图均来自此处。费率检查于2026年8月12日。

步骤模型费率运行次数费用
角色 + 道具参考openai/gpt-image-2/text-to-image起价$0.009;高质量2048x1152测量为$0.17452$0.35
参考音频minimax/music-2.6$0.15 每首1$0.15
镜头A和镜头Bminimax/h3/reference-to-video768P $0.10/秒,2K $0.14/秒2 x 8秒 2K$2.24
参考阶梯同上,加上 minimax/h3/text-to-video768P $0.10/秒3 x 4秒 768P$1.20

本月三个H3端点均无折扣活动。有两个邻居目前更便宜,如果你只是构建参考静态图片:gpt-image-2-developer/text-to-image 五折优惠,从$0.009降至$0.004,截至2026年8月。完整的每秒费用明细请参阅 MiniMax H3 API 定价 指南。

MiniMax H3 参考视频,逐步操作

场景:一个女人经营拉面摊。镜头A是雨夜霓虹小巷。镜头B是第二天早上同一个女人在空旷的有顶市场,不同的地点,不同的时间,不同的镜头。除了参考之外,两次调用之间没有任何东西传递,这正是测试的目的。

步骤1:构建角色参考,特意平淡打光

这是人们做错的一步。角色参考不是你角色的漂亮照片,而是对她们脸部的 测量。中性光、纯色背景、无场景、无氛围。H3会同时学习光线和脸部,因此有氛围的参考会产生一个与该氛围绑定在一起的角色。

模型:openai/gpt-image-2/text-to-image。设置:质量 ,尺寸 2048x1152 (16:9),格式 png。

text
1一位三十出头女性的编辑照片,街头小吃厨师。近景四分之三肖像,中性表情,直视镜头。黑色短发塞到一只耳后,右眉上方有一道小疤痕,暖橄榄色皮肤。她穿着褪色的靛蓝色工作夹克,袖子卷到肘部,左肩上搭着一条折叠的白色毛巾。纯浅灰色工作室背景,柔和均匀的主光,无道具,面部清晰对焦,自然皮肤纹理,无修图。照片级真实,50mm镜头。

AI图片生成器截图,显示输入提示词和生成的肖像

Atlas Cloud 上的 GPT Image 2 工作区,角色参考提示词已加载,输出面板中显示完成的肖像

Atlas Cloud 上的 GPT Image 2:质量设置为高,16:9,角色表渲染在右侧。

穿蓝色连衣裤、肩上搭着毛巾的女人

MiniMax H3 参考视频的角色参考图片:拉面厨师的中性工作室肖像,右眉上方有疤痕

参考图片1。右眉上方的疤痕和折叠的白色毛巾是刻意设计的:它们是廉价且明确的身份锚点,你可以在后续每一帧中检查。

步骤2:构建道具参考

第二个参考槽,第二个任务。物体在这里比面孔表现更好,这使得一个独特的道具成为证明参考生效的最简单方法。相同模型,相同设置。

text
1一张深蓝色陶瓷拉面碗的产品照片,碗边有手绘的白鹤,碗口有缺口,盛着热气腾腾的酱油拉面。正面视角,纯浅灰色背景,柔和均匀的光线,清晰对焦,照片级真实,50mm镜头。

猪肉,(5) 鸡蛋,(6) 和 (7) 绿色 (8) 葱花 (9)

道具参考图片:深蓝色拉面碗,带有手绘白鹤和缺口边缘

参考图片2。手绘的鹤和碗口的缺口是线索。如果它们出现在视频中,说明参考被读取了。

步骤3:镜头A,两张图片进入 MiniMax H3 参考视频

两张参考图片,都是 type: "image",放入 refers。明确设置比例。adaptive 是默认值,当你的参考已经是16:9时,它通常能做正确的事,但它会为你做决定,在这个端点上你不必让它决定。

模型:minimax/h3/reference-to-video。设置:分辨率 2K,时长 8,比例 16:9

text
1广角定场镜头。夜晚,大雨,狭窄的霓虹小巷。参考图片中的女人独自在塑料雨棚下一个小型热气腾腾的拉面摊后工作,用勺子将汤舀入参考图片中带有白鹤的深蓝色碗里。蒸汽从粉红色和绿色的霓虹灯反射中升起,照在湿漉漉的路面上。缓慢推进到摊位。环境音:雨打塑料布的声音、沸腾的汤声、远处的交通声。无对话。

此调用的输出是顶部展示片段的前半部分。保留其URL。它是步骤5的输入。

步骤4:截取一段八秒的参考音频

参考音频不是音轨槽位。它是模型匹配自身混音的基础,也是该端点上最挑剔的输入。生成一首曲目,然后将其截短,因为完整的歌曲会被拒绝。

模型:minimax/music-2.6,带 is_instrumental: trueformat: "mp3"

text
1稀疏的深夜爵士乐,刷钹军鼓,直立贝斯,一支弱音小号,忧郁,70 BPM,器乐。

然后截取大约八秒,并编码为 data:audio/mp3 URL。我在这里首先犯了三件事,都带有确切的错误文本:

  • MIME字符串比字节更重要。 声明 data:audio/mpeg,参考会被拒绝,错误为 audio format ".mpeg" not allowed,即使文件是一个完全普通的MP3。写成 audio/mp3
  • 每个剪辑2到15秒,并且强制执行。 我生成的曲目是164秒。返回错误为 invalid param: audio duration 164258 ms, expected [2000, 15000] ms。截取到8.05秒后修复了。两次拒绝都不收费。
  • 15秒组合上限已记录但未强制执行。 我在同一次请求中发送了两个8秒的剪辑,总计16.1秒,期待被拒绝。任务正常完成并收费。不要依赖于此:它被记录为限制,可能随时开始像限制一样运作。

AI音乐生成器界面,显示文本提示词和生成的音频波形

Atlas Cloud 上的 MiniMax Music 2.6 工作区,爵士乐提示词和输出面板中完成的曲目

Atlas Cloud 上的 MiniMax Music 2.6,每次运行$0.15,右侧为完成的曲目。一个值得从此截图复制的东西和一个不复制的东西:价格和mp3格式是正确的,但 Is Instrumental 仍然关闭,页面上的演示歌词仍留在框中,因此这次特定运行返回了一首1分35秒的带人声歌曲。在运行之前,请切换该开关并清除歌词字段,否则你将截取一段有人声的背景参考。我的API运行,使用 isinstrumental: true,在209秒内返回了2分44秒的器乐。

步骤5:镜头B,一次 MiniMax H3 参考视频调用,包含所有三种类型

这是关键字真正涉及的调用。三种参考类型,三项不同的工作,一个数组:

  1. 步骤1中的角色肖像,type: "image",用于保持她的面孔
  2. 步骤3中的镜头A mp4,type: "video",用于在剪辑之间传递调色和颗粒感
  3. 步骤4中的八秒爵士乐片段,type: "audio",作为背景音

平台上其他生成任务的输出URL可以直接放入 refers 作为视频参考,这正是多镜头连续性的实际机制。不是“H3记住你的角色”。而是你把前一个镜头交还给它。

模型:minimax/h3/reference-to-video。设置:分辨率 2K,时长 8,比例 16:9

text
1参考图片中的同一个女人,第二天早上。明亮空旷的有顶市场,通过天窗射入的冷净日光,身后的卷帘门仍然关闭。中景镜头,静态相机。她用折叠的白色毛巾擦拭柜台,抬头看向镜头说了一句台词,然后继续工作。保持她的脸、头发、伤疤和靛蓝色夹克与参考图片一致。携带参考剪辑的调色和颗粒感。使用参考音频作为背景音乐。

AI视频生成器界面,显示输入提示词和生成的视频

Atlas Cloud 上的 MiniMax H3 参考视频工作区,加载了图片和音频参考,输出面板中显示生成的剪辑

在同一次MiniMax H3参考视频工作区中的调用,2K分辨率,8秒。在 参考材料 (2/9) 中可以看到两个不同类型的参考槽:槽1是 ref-audio-8s.mp3,槽2是她的肖像。视频参考通过“通过链接添加”(该面板右上角)或通过API添加,因为它位于URL而非磁盘上。从这个面板可以读出三件事:上传器显示 MAX:9,尽管MiniMax自己的上限是12;宽高比默认为 adaptive,除非你更改它;2K 8秒的运行价格为$1.12,即$0.14每秒的层级。

步骤6:验证参考实际生效

任务完成不代表成功。两项检查,都很便宜。

检查面部。 从每个镜头中提取一帧,并排放在一起。寻找你植入的锚点:伤疤、发际线、夹克、毛巾。

两张图片对比,一张是霓虹夜,一张是早晨市场光下的女人

镜头A中的一帧与镜头B中的一帧并排对比,显示同一个 MiniMax H3 参考视频角色出现在两个不同场景中

左:镜头A,夜晚,霓虹,广角。右:镜头B,有顶市场,第二天早上,中景。相同面孔,右眉上方相同伤疤,相同夹克和毛巾,跨越场景和构图变化,除了参考之外没有共享任何内容。

有一件事没有按照我写提示词的方式运行。我要求“明亮空旷的有顶市场,冷净日光” 以及 “携带参考剪辑的调色和颗粒感”,而参考剪辑获胜了。镜头B无疑是早晨,无疑是一个不同的地点,但远比“明亮”所暗示的要更具氛围,因为夜晚的调色随着视频参考一起过来了。你不能在一次调用中同时要求相同的外观和相反的光线。如果你需要光线改变,请放弃调色指令,或者放弃视频参考,仅用图片来保持身份。

检查音频。 绘制你上传的八秒片段的波形,与返回的mp4中包含的轨道波形并排,并添加一个对照:完全没有音频参考生成的剪辑。

三个堆叠的音频波形,比较上传的、返回的和对照的轨道

上传的八秒参考音频的波形,生成的剪辑内返回的音频轨道波形,以及无音频参考的对照

顶部:作为参考发送的8.05秒爵士乐片段。中间:从返回的镜头B mp4中提取的轨道,约5.5秒处被对话台词主导。底部:镜头A,相同工作流,无音频参考。

这就是我必须纠正我最初相信的一些事情的地方。参考音频 不会 原封不动地返回。我的片段与返回轨道之间的包络相关性为0.25,而无参考对照为−0.05,因此两者相关但远非相同,并且返回的形状明显是它自己的混音,而不是我的文件叠加上其他东西。参考显然做的是在下面放了一些东西:镜头B的背景音在前五秒内比无音频对照高出约7 dB,在任何对话开始之前。将参考音频理解为对混音的引导,而不是音乐槽位。如果你需要精确的曲目放在画面下,请稍后将其铺上。

如果你正在基于此音频方面进行构建,MiniMax H3 唇形同步和音频MiniMax H3 音乐视频 教程都从相同的参考音频行为开始。关于围绕所有这些的轮询和重试代码,MiniMax H3 教程 包含循环。

另外四个值得借鉴的 MiniMax H3 参考视频设置

重新设计你已有的剪辑。 将一个完成的剪辑作为视频参考放入 refers,完全不使用图片,并要求不同的媒介。运动、构图、推进和道具会保留;表面会改变。这是H3视频编辑排名背后的机制,也是 MiniMax H3 vs Veo 3.1 动画 中动画工作的相同机制。

女人在霓虹小巷中的食品车前做饭

从用作 MiniMax H3 参考视频参考的镜头A剪辑生成的动画重新设计

镜头A的小巷仅作为参考传回,并带有 cel-shaded 动画提示词。相同的摊位,相同的勺子,相同的鹤碗,相同的推进,重新绘制。一个值得知道的细节:转换在最初几帧中最弱,一旦镜头投入到移动中就最强。以静音GIF显示。使用 minimax/h3/reference-to-video 生成,768P,4秒,$0.40。

让一张照片活起来。 一张肖像加上一段2到15秒窗口内的人声剪辑,提示表演。比唇形同步流水线更便宜,因为它是一次调用。

将产品锁定到任何场景中。 参考图片锁定对象比锁定面孔更可靠,因此真实产品照片加场景提示词是该端点上最可靠的东西。在将其用于广告之前,请检查 你被允许对结果做什么

构建一个系列,而不是一个剪辑。 链式操作:镜头N的输出成为镜头N+1的视频参考。每次调用仍然限制在15秒,因此连续性是你的工作,而不是模型的工作。MiniMax H3 视频可以有多长 涵盖了该上限的限制。

在将系列作品交付给一个引擎之前,比较一下引擎?Seedance 2.5 vs MiniMax H3 和 MiniMax H3 替代品 是两篇值得阅读的文章。

一个双镜头 MiniMax H3 参考视频场景的实际成本

以下每一行都是2026年8月12日的真实任务,金额取自API在每个完成的预测上返回的 price 字段。

表4:实际账单

任务模型设置结果收费
角色参考gpt-image-2high, 2048x1152完成$0.1745
道具参考gpt-image-2high, 2048x1152完成$0.1745
参考音频music-2.6instrumental, mp3完成,164秒曲目,209秒等待$0.15
镜头Ah3/reference-to-video2K, 8s, 2张图片参考309秒内完成$1.12
镜头Bh3/reference-to-video2K, 8s, 图片 + 视频 + 音频参考557秒内完成$1.12
阶梯,无参考h3/text-to-video768P, 4s154秒内完成$0.40
阶梯,1张图片参考h3/reference-to-video768P, 4s119秒内完成$0.40
阶梯,2张图片参考h3/reference-to-video768P, 4s128秒内完成$0.40
动画重新设计h3/reference-to-video768P, 4s, 1个视频参考239秒内完成$0.40
步骤5在工作区中重新运行h3/reference-to-video2K, 8s, 图片 + 音频参考完成$1.12
对照:10张图片参考h3/reference-to-video768P, 4s150秒内完成$0.40
对照:首帧图片 + refersh3/reference-to-video768P, 4s完成,一个输入被丢弃$0.40
对照:在 image-to-video 上使用 refersh3/image-to-video768P, 4s完成,refers 被丢弃$0.40
对照:16.1秒参考音频h3/reference-to-video768P, 4s完成,超过已记录的限制$0.40
对照:省略比例,然后比例 adaptiveh3/reference-to-video768P, 4s, 两次两者完成,相同 1344x768$0.80
步骤1和4的截图重新运行gpt-image-2, music-2.6如上完成$0.32
对照:仅音频参考h3/reference-to-video768P, 4s7ms内失败$0.00
对照:164秒参考音频h3/reference-to-video768P, 4s16秒内失败$0.00
对照:audio/mpeg MIMEh3/reference-to-video768P, 4s17秒内失败$0.00
对照:无效参考 URLh3/reference-to-video768P, 4s21秒内失败$0.00
总计$8.18

诚实地拆分这个总数。本文顶部完成的双镜头场景,包括参考和音频,是其中的$2.74。另外$5.44是调查费用:对照、故意破坏以及为截图在浏览器中重新运行步骤。如果你已经知道规则,一个16秒的双镜头序列,2K分辨率,成本低于一个三明治。

从该表中得出三件事。

参考是免费的。 十张图片对照与单张图片阶梯运行在相同长度和分辨率下,成本完全相同,都是$0.40。在这个平台上,计费仅根据输出秒数和分辨率,没有其他。值得指出一个矛盾:MiniMax自己的平台规则描述输入视频按输出速率收费,而OpenRouter上的统一模式包含一个单独的 reference_images 项目。这两者都没有出现在我的发票上。如果你在其他地方做预算,请自己定价,而不是假设。

失败是免费的,并且来得很晚。 所有四次拒绝都不收费,这是好消息。坏消息是它们何时到达:音频单独规则7毫秒,音频长度、错误MIME和无效URL为16到21秒,而在提交时则完全没有。本文中每个格式错误的请求都首先得到HTTP 200和预测ID,因此请将提交响应视为收据,而非验证,并在相信任何内容之前轮询 status 字段。

静默成功是昂贵的失败。 两次混合对照各花费了整整$0.40,并返回了一个完全有效的视频,但仅基于我一半的输入。没有错误,没有警告字段,也没有办法从响应中判断有任何内容被丢弃。这是表格中唯一一行,钱从账户中离开了,而我却没有得到任何我想要的东西。

关于最后一点,有一个诚实的更正,因为它在写作过程中发生了变化。在八月初,一个返回404的参考URL行为相同:任务完成,参考被静默忽略,全额收费。在2026年8月12日重新运行,端点现在检查可达性,并以命名错误免费终止任务:content[1].image_url: media not found (HTTP 404)。那个特定的漏洞已被修补。但互斥输入的漏洞尚未修补。有关每个剪辑的信用计算,请参阅 每个视频的 MiniMax H3 信用 表格。

谁的脸,谁的声音:在上传参考之前检查这一点

这个端点与文本转视频在一个法律相关方面不同:你提供肖像。真实人物的参考图片、某人电影中的参考剪辑、可识别声音中的参考人声,所有这些都是你声称拥有使用权的材料。模型端的内容规则在此基础上仍然适用,并且关于真实人物比关于虚构人物更严格。在客户看到输出之前,值得阅读两篇指南:MiniMax H3 内容限制商业使用与许可 分析,其中还涵盖了MiniMax条款中的地域排除。

MiniMax H3 参考视频:常见问题解答

MiniMax H3 参考视频能否在两个不同镜头中保持同一角色?

可以,我上面的双镜头测试跨越了从夜晚到早晨的完全光照反转。但仅凭角色图片并不能做到这一点。可靠的模式是将前一个镜头的输出URL作为参考视频与角色图片一起传入,这样第二个调用既继承了身份,也继承了调色和颗粒感。

我可以在同一次 MiniMax H3 参考视频调用中同时使用首帧图片和参考吗?

不可以,而失败模式正是问题所在。同时发送 imagerefers 不会报错。在2026年8月12日测试,任务在115秒内完成,收费$0.40,并静默丢弃了两个输入之一。在图片转视频端点上,反之亦然。每次调用选择一个路径。

我能否仅发送一个音频文件作为 MiniMax H3 参考视频的参考?

不能。音频必须与至少一张参考图片或视频一起提交,并且端点会通过显式错误强制执行:reference-to-video requires at least one reference image or video。它在生成阶段而非提交时到达,被拒绝的任务是免费的。音频参考还必须位于2到15秒内,总计15秒,并声明为 audio/mp3 而非 audio/mpeg

MiniMax H3 参考视频是否为每个参考文件额外收费?

在Atlas Cloud上不收费。十张参考图片的运行与一张参考图片的运行在768P和4秒下收费相同,均为$0.40,因此计费仅跟踪输出秒数和分辨率。但请注意矛盾:MiniMax自己的规则提到输入视频按输出速率计费,而其他平台则暴露单独的参考图片项目。请在你计费的任何表面上自行验证。

如果我的一个 MiniMax H3 参考视频 URL 无效,会发生什么?

截至2026年8月12日,端点会验证可达性,并以命名错误 content[1].image_url: media not found (HTTP 404) 在约21秒后免费终止整个任务。这是一个变化:八月初,相同的请求会完成,静默忽略缺失的参考,并全额收费。不要假设旧的行为报告仍然有效,并且务必检查 status 字段,而不是认为提交时的200响应意味着什么。

MiniMax H3 参考视频实际上是最好的模型吗?

在衡量它的唯一公开正面交锋中,是的,但很微弱。MiniMax H3 在视频编辑排行榜上领先,Elo评分1,125,来自10,280票,但其列出的排名范围为1到2,而Gemini Omni Flash落后3个Elo点,置信区间重叠。将其视为“联合最佳可用”,根据工作流的其余部分选择,如果这个平局对你很重要,请阅读 MiniMax H3 替代品

最新模型

一个 API,畅享全模态 AI。

探索全部模型