2025年12月,YouTube封禁了Screen Culture和KH Studio。两个频道,合计超过两百万订阅者,超过十亿播放量。它们将官方素材与AI图像拼接,制作出看似官方的电影预告片。到3月,Screen Culture已经发布了23个版本的《神奇四侠》预告片,其中一些在搜索结果中排名超过了真正的官方预告片(Deadline,2025年12月)。
它们被禁并非因为使用AI,而是因为垃圾信息和误导性元数据:把他人的电影冒充为官方发布内容。
但十亿播放量证明了另一件事:预告片是电影营销中杠杆率最高的十五秒。形式从来不是问题,归属才是。
所以,这个实验的实用版本是:将同样的形式用于属于你自己的电影。一个15秒的预告片,2K分辨率,原生立体声,一句旁白,一段配乐,一个标题卡。一次生成。没有剪辑时间线,没有配音棚,没有音乐授权,没有After Effects合成。
关键要点
- 预告片是你能向视频模型要求的最密集的输出:多镜头、旁白、配乐、音效设计以及屏幕上的文字,全部叠加。H3目前在Artificial Analysis的视频编辑+音频排行榜上排名第一,而电影片头序列在MiniMax自己的第一方用例列表中。
- 15秒是H3的硬性上限。这不算电影预告片(通常30到60秒),但恰好是社交媒体剪辑的长度,而社交媒体剪辑才是实际工作中最有效的。
- 将提示词写成带有时间码的提示表,而不是一堆形容词。建立、冲突、高潮、标题卡。四个节拍。
- API中没有任何音频参数。如果你不通过文字指定配乐、旁白和音效设计,你只会得到模型随意生成的内容。
- Atlas Cloud上的实际价格:768p草稿1.50美元,2K最终版2.10美元,加上开场帧约0.17美元。一个完成的预告片价格在2.03美元到3.77美元之间。

GPT Image 2生成的开场帧,锁定电影基调:1970年代钢制潜水钟内部,一位穿着磨损橙色潜水服的女性,琥珀色仪表灯和声纳屏的淡绿色光晕。一切其他画面都基于此帧。使用openai/gpt-image-2/text-to-image生成,质量high,分辨率2048x1152。这一张图片确保了768p草稿和2K最终版不会变成两部不同的电影。
我用一次生成做出的MiniMax H3电影预告片
先看成品,再谈理论。一部原创深海惊悚片预告片,名为《SALVAGE》。一次API调用,之后没有任何剪辑。
《SALVAGE》,15秒,一次生成,使用minimax/h3/image-to-video。开启声音:船体呻吟声、声纳脉冲声、弦乐群和那句旁白,全部来自同一次调用,与画面一同输出。费用2.10美元。
这个文件中包含什么,以及各部分来源:
- 四个独立镜头,硬切,没有叠化。一次生成。
- 24 fps,AAC立体声,32 kHz。不是后期添加的。
- 一句旁白,女声,按照提示词要求位于5到7.5秒之间。
- 一个标题卡,最后两秒完全静止。
这相当于将五个传统的后期制作步骤合并为一个。这正是预告片成为该模型高难度测试(而对其他模型则是糟糕测试)的原因。
为什么大多数MiniMax H3电影预告片尝试在第九秒后崩坏
预告片是最难伪造的类别,因为你无法隐藏弱点。如果文字抖动,你能看到。如果唇形不同步,你能听到。如果配乐没有落在剪辑点上,整个东西就像有音乐配乐的幻灯片。
这大致就是H3目前所处位置的原因。在Artificial Analysis的视频编辑+音频排行榜上,它凭借8,249票、1,130 Elo评分排名第一,领先Gemini Omni Flash 9分,领先Dreamina Seedance 2.0 93分,并且是该梯队中唯一标注为开放权重的模型(Artificial Analysis,2026年8月)。MiniMax自己的发布材料将电影片头序列列为第一方用例,与动画海报和角色一致的游戏过场动画并列(MarkTechPost,2026年8月)。
以下是该发布集中官方15秒科幻片头,让你在花钱之前先听听“原生音频”是什么意思:
《最后一支舰队离开地球》,来自MiniMax官方H3展示集。以2560x1440、24 fps、AAC立体声32 kHz输出。注意标题卡向后移动以及预告片中间的“她知道为什么”卡片在镜头持续移动时保持静止。
现在看看失败列表。以下每一项都是实际发生在我最终制作出本文顶部那个片段之前遇到的问题。
- 试图在一次调用中塞入60秒的预告片。 15秒是硬性上限。要求一个完整预告片的故事量,你会得到一团糟,因为模型会把八个节拍压缩成四个。写一个引导片。
- 写形容词而不是提示表。 “史诗级电影预告片、戏剧性、高张力”只会给你一种情绪,而不是结构。时间码给你结构。
- 模糊的标题卡。 如果你不在提示词中明确写出文字字符串、说明文字应该如何处理,并加上明确的“稳定”指令,你得到的会是近似字母。三行或以上的文字开始出现问题。
- 得到无声文件,或者你从未要求的配乐。 在text-to-video、image-to-video或reference-to-video中都没有
audio参数。音频是通过提示词中的散文来指定的,否则就没有。 - 在纯文本转视频上草率打草稿。 没有锁定第一帧,768p和2K会生成两部不同的电影,因为2K版本是在上下文中的重新生成,而不是简单放大。你的廉价草稿无法预测昂贵最终版的效果。
- 没有发送
duration参数。 模式文档默认值为8,但省略它会导致被计费为5秒任务并返回5秒文件。你的预告片会在冲突节拍处被截断。 - 假设HTTP 200表示成功。 如果提到真实电影系列,输入筛选会在几秒内拒绝任务。其他提示词会被悄悄截断并正常计费。
第4、5、6点是代价高昂的,而且文档中都没有提及。
MiniMax H3电影预告片生成器工作流程及各步骤成本
五个步骤,五个模型,一个浏览器标签页,一个API密钥。以下价格是今天每个模型页面上的实时每秒费率,不是博客文章中的数字。
| 步骤 | 模型 | 功能 | 今日价格(2026年8月) |
|---|---|---|---|
| 锁定开场帧 | GPT Image 2(文本转图像) | 一个帧,确定演员、服装和色调 | 按token计费。2048x1152高画质实测0.1745美元 |
| 草稿和完成预告片 | MiniMax H3 image-to-video | 15秒预告片本身,画面和声音 | 2K 0.14美元/秒,768p 0.10美元/秒 |
| 纯文本变体 | MiniMax H3 text-to-video | 相同的节拍表,但未锁定帧 | 相同费率 |
| 竖屏剪辑、演员锁定 | MiniMax H3 reference-to-video | 9:16社交媒体版本,最多9张参考图像 | 相同费率 |
| 挽救768p的可用片段 | Atlas Cloud Video Upscaler | 提升你喜欢的草稿,而不是重新运行 | 1080p 0.018美元/秒,2K 0.024美元/秒,最低5秒 |
Atlas Cloud模型目录上的三个H3端点 Atlas Cloud模型目录 。文本转视频、图像转视频和参考转视频是同一个密钥下的不同路由,因此下面的整个流程从未离开一个标签页。
值得记在手上的参数事实,全部基于今天实时模式文档而非自述文件检查:resolution为768P或2K,默认2K。duration为4到15之间的任意整数。字段名为ratio,而非aspect_ratio,在图像转视频中该字段被忽略,因为输出形状继承自输入帧。文本转视频和参考转视频接受21:9到9:16。所有操作都是异步的:POST /api/v1/model/generateVideo,然后轮询/api/v1/model/prediction/{id}。
MiniMax H3电影预告片教程:15秒,四个节拍,一次生成
电影是一部原创深海惊悚片。标题用一个词,这样文字有空间呼吸。一句旁白。直接复制提示词,然后将名词替换为你自己的项目。
步骤1:使用GPT Image 2锁定开场帧
不要从视频模型开始。一帧花费约17美分,而15秒的2K生成花费2.10美元,所以你想以低一个数量级的成本确定外观。更重要的是,锁定的第一帧是唯一能让你的768p草稿预测2K最终版的因素。
Plain1Cinematic film still, anamorphic look inside a 16:9 frame: the interior of a 1970s steel 2diving bell descending into black water, seen over the shoulder of a woman in a scuffed 3orange dive suit. Her face is lit only by a single amber instrument lamp and the pale 4green wash of a sonar screen. Condensation beads on the thick porthole glass; beyond it, 5absolute darkness with one faint drift of particles. Heavy 35mm film grain, deep crushed 6blacks, teal-and-amber palette, shallow depth of field, practical lighting only. 7No lens flare, no text, no logos, no watermark, no subtitles.
设置:质量high,尺寸2048x1152,输出格式png。质量high在这里不是可选的,因为颗粒感和暗部压缩是视频模型将延续十五秒的东西。

Atlas Cloud上的GPT Image 2工作台,带有潜水钟提示词和完成的开场帧在输出面板中_Atlas Cloud上的GPT Image 2,运行完成:左侧是上述提示词,右侧是成为本文主视觉的帧。_
步骤2:编写15秒预告片节拍表(建立、冲突、高潮、标题卡)
这是所有“最佳预告片生成器”综述中不会给你的部分。预告片提示词就是提示表。画面有时码,音频有时码,旁白有窗口,标题卡有它的文字字符串。
以下是单独的结构,以便你可以用你自己的电影填充:
| 节拍 | 时间窗口 | 画面 | 剪辑 | 音频提示 |
|---|---|---|---|---|
| 建立 | 0.0-4.0秒 | 主角在他们世界中的一次缓慢移动 | 无剪辑,单次推进或跟踪 | 环境音,一个标志性声音,低音垫 |
| 冲突 | 4.0-8.0秒 | 展示问题规模的广角,然后回到一个细节 | 两次硬切 | 低音垫收紧,一个金属撞击声,弦乐进入 |
| 高潮 | 8.0-12.0秒 | 三个快速细节,然后黑屏 | 三次硬切,然后六帧黑屏 | 上升的弦乐群,一个冲击声,然后静音 |
| 标题卡 | 12.0-15.0秒 | 标题淡入,最后两秒完全静止 | 完全不动 | 一个次低音冲击,然后衰减的尾音 |
以下是填充好的结构,准备与步骤1中的帧一起粘贴到image-to-video中:
Plain115-second 16:9 teaser trailer for an original deep-sea thriller. Continue exactly from the 2supplied first frame: same woman, same orange dive suit, same amber-and-sonar-green 3lighting, same heavy grain. Four beats, hard cuts, no dissolves. 4 50.0-4.0s ESTABLISH. Slow push-in past her shoulder toward the porthole. Dust motes drift. 6The sonar screen sweeps once. She breathes; her exhale fogs the glass. 74.0-8.0s CONFLICT. Hard cut to a low wide: the dive bell tiny against a black cliff face, 8cable taut above it. Hard cut back to her hand snapping a switch. The instrument lamp 9stutters. A shape passes the porthole, out of focus, unidentifiable. 108.0-12.0s CLIMAX. Three rapid cuts: extreme close-up of her eye catching a red overload 11light; the porthole glass flexing with a hairline crack; total black for six frames. 1212.0-15.0s TITLE CARD. Fade up from black on one title, centred, holding dead still for the 13last two seconds: SALVAGE 14Extremely wide letter-spacing, heavy condensed serif, brushed cold steel with a faint rust 15edge and a restrained inner glow, not pure white. Below it, small caps at half the size: 16NOTHING DOWN HERE STAYS LOST 17Both lines rock-steady: no jitter, no warping, no drift, no re-render between frames. 18 19AUDIO, generate natively, do not deliver a silent track: 200.0-4.0s low hull groan around 40 Hz, one sonar ping at 1.5s with a long tail, distant 21pressure hiss. 224.0-8.0s the hiss tightens; a single metallic clank at 6.2s; strings enter on one 23sustained low note. 248.0-12.0s rising string cluster, a rivet pop at 10.5s, then hard silence at 11.8s. 2512.0-15.0s one deep sub-bass impact on the title card, then a slow decaying reverb tail 26over quiet sonar. 27NARRATION, one line only, female voice, low and unhurried, mixed under the music, spoken 28between 5.0s and 7.5s: "Nothing down here stays lost." 29 30NEGATIVE: no on-screen text other than the two title lines; no subtitles, no captions, no 31watermark, no studio logo, no lens flare, no whip pans, no camera shake beyond a slow 32handheld float, no daylight, no visible creature, no gore, no blood.
其中有三点比看起来更重要。AUDIO块的存在是因为没有音频参数可设置。“rock-steady”行是因为文字稳定性是预告片最常见的失败原因。11.8秒处的六帧黑屏让标题卡感觉像标题卡,而不是另一个镜头。

从完成的《SALVAGE》预告片中提取的四帧,分别标注为建立、冲突、高潮和标题卡,显示节拍表实际渲染后的样子_四个节拍实际输出的样子,从2K文件中提取。从左到右:2秒处的推进,5秒处的低角度广角,10秒处的过载灯,14秒处的标题卡。_
步骤3:以768p草稿制作MiniMax H3电影预告片,花费1.50美元
相同的帧,相同的提示词,resolution: "768P",duration: 15。务必显式发送duration。省略它会导致被计费为5秒任务。你得到1344x768,24 fps,AAC立体声,账单1.50美元。
_768p草稿。结构上_与2K最终版相同,因为第一帧已锁定。标题卡中的小字是你可以看到分辨率差距的地方。
仅根据以下四点进行判断,完全忽略锐度:
- 剪辑是否在节拍点上,还是一个节拍吞掉了另一个?
- 旁白是否存在,并且是否落在5到7.5秒的窗口内?
- 标题卡是否静止,还是抖动?
- 配乐是否在12秒处击中冲击点?
如果任何一项失败,修改提示词并以1.50美元重新草稿。不要在2.10美元版本上修复。
步骤4:以2K完成MiniMax H3电影预告片
仅更改一个字段。相同的image,相同的提示词,resolution: "2K"。输出为2560x1440,账单2.10美元。
由于第一帧已锁定,两个版本在细节上有所不同,而非内容上。诚实的说法是:大字在768p下可读,但第二行只有在2K下才能解析为实际字母形状。

标题卡100%裁剪,左侧768p,右侧2K,显示副标题行只有在2K下才能解析为可读字母形状_相同秒数,相同帧,100%裁剪。宽间距的SALVAGE在两个版本中都存活。下方半尺寸的行是为什么你需要以2K完成的原因。_

Atlas Cloud上的MiniMax H3图像转视频工作台,加载了潜水钟帧,输出面板中有一个完成的剪辑_Atlas Cloud上的MiniMax H3图像转视频,运行完成。此截图中的工作台分辨率和持续时间选择器保持默认值,因此输出中的剪辑是比上述15秒调用更短的运行,而不是完成的预告片。_
还有一种更便宜的完成方式。如果768p版本已经可用,通过视频升级器以每秒0.024美元的价格升级到2K,15秒只需0.36美元。它能保护你已经喜欢的版本,但无法创造源素材中不存在的字母细节,而且2K路径最多接受23秒的输入。
步骤5:使用参考转视频制作竖屏MiniMax H3电影预告片
16:9文件用于网站。9:16文件才是实际被观看的。参考转视频可以接受最多九张参考图像加上视频和音频,因此你可以锁定相同的主角和色调到一个竖屏重构图,而不是靠运气。
发送refers作为一个数组,包含步骤1的帧加上一个视觉参考板,ratio: "9:16",duration: 15,resolution: "2K"。提示词使用相同的节拍表,但带有竖屏构图:冲突节拍变成单个中近景而不是低角度广角,标题卡文字更大,副标题分成两行。
一个不会报错但会浪费钱的陷阱:不要在同一个请求中同时发送image和refers。它们是互斥的,API会接受两者,但其中一个会被静默丢弃。
使用minimax/h3/reference-to-video制作的竖屏剪辑,相同演员,相同色调,为手机重新构图。

Atlas Cloud上的MiniMax H3参考转视频工作台,加载了参考材料,输出面板中有一个完成的剪辑_Atlas Cloud上的MiniMax H3参考转视频,运行完成,参考槽已填充。分辨率和持续时间再次为工作台默认值。_
MiniMax H3电影预告片提示词的四种变体
相同的节拍表,四种不同的交付物。
宽银幕。 在text-to-video或reference-to-video上将ratio改为21:9。相同的提示表,更宽的宽银幕,标题卡明显有更多空间。
仅标题卡。 删除节拍一到三,只保留标题卡,设置duration: 4。2K版本花费0.56美元,得到一个带有次低音冲击的标志动画。在电影之外非常有用,因为“预告片”通常用于游戏、书籍或播客。
另一种语言。 H3原生支持多种语言的旁白,因此将旁白行改写为日语,无需单独配音音轨即可得到一个本地化的预告片。
另一种类别。 竖屏剧情预告片使用相同的四个节拍,但用对话代替旁白。以下是H3展示集中的官方9:16示例:十五秒,八个镜头,一个角色在所有镜头中保持一致,带有口语对话而非画外音。
MiniMax官方H3竖屏预告片,1440x2560,15秒,八个镜头,AAC立体声带对话。相同的节拍结构,针对短剧观众。
想要30秒的预告片?将第一个剪辑的最后一帧作为第二个剪辑的第一帧。详情请参阅我们的MiniMax H3视频长度指南。
MiniMax H3电影预告片的实际成本
完成一个15秒2K预告片的四种实际路径。帧成本为GPT Image 2在high质量、2048x1152下的实测0.1745美元。
| 路径 | 费用明细 | 总计 |
|---|---|---|
| 直接2K | 帧0.1745美元 + 2K 2.10美元 | 2.27美元 |
| 草稿后完成(推荐) | 帧0.1745美元 + 768p 1.50美元 + 2K 2.10美元 | 3.77美元 |
| 草稿后升级 | 帧0.1745美元 + 768p 1.50美元 + 升级0.36美元 | 2.03美元 |
| 实际会话,三次草稿 | 帧0.1745美元 + 3 x 1.50美元 + 2K 2.10美元 | 6.77美元 |
| 添加竖屏剪辑 | + 2.10美元 | — |
MiniMax自己的直接定价略低于Atlas的费率,因此其他地方可能会看到15秒2K剪辑1.95美元的价格。在Atlas上,费率为0.14美元/秒,即2.10美元,本文中所有账单均使用此数字。
以下是2.10美元所取代的,诚实地评估:
| 传统后期制作步骤 | 通常由谁完成 | H3是否在一次运行中交付? | 效果如何(评估) |
|---|---|---|---|
| 多镜头组合 | 剪辑师 | 是 | 四个节拍保持;剪辑落在写定的时间码上 |
| 旁白录制 | 配音演员+录音棚 | 是 | 落在5到7.5秒的窗口内,如写定 |
| 配乐 | 作曲人或版权库 | 是 | 旋律弧线和12秒冲击点都存在 |
| 音效设计 | 音效设计师 | 是,但有前提 | 提示音落在节拍上,但未达到指定时间码的帧精确 |
| 标题卡动画 | 动态设计师 | 是 | 2K下稳定;半尺寸行在768p下模糊 |
如果你想逐行对比H3端点与其他端点的价格,MiniMax H3 API定价详解有每次调用的算术,而上述三个端点位于同一个密钥下,在同一模型目录中,如果你想自己运行整个流程。
粉丝预告片、真实电影以及导致十亿播放量被删除的元数据
值得精确说明那些频道到底发生了什么,因为教训不是“不要用AI制作预告片”。
两个频道都被暂停,进行了更正,重新加入合作伙伴计划,然后再次违规,最终因违反YouTube的垃圾信息和误导性元数据政策而被终止。问题在于呈现方式:标题和缩略图显示为官方工作室素材,用于那些没有此预告片的电影。如果你在为现有作品制作概念片,请在标题、缩略图和描述中明确标注,不要让元数据暗示它来自工作室。
H3在API层面也对此进行了限制。在提示词中提到真实电影系列或特定电影,任务会在几秒内被输入筛选拒绝,而不是生成一个你随后需要思考的东西。这是一个粗略的过滤器,偶尔会误伤无辜的提示词,但这是一个有用的信号,表明界限在哪里。
如果你是自己托管而非调用API,还有一个注意事项:发布的权重根据MiniMax H3社区许可协议发布,而生成2K版本的H3-Context-IR和H3-Regenerate-2K模块不在开放发布中,仅保留在API端。我们的商业使用和许可指南涵盖了条款;本文使用的API路径不适用这些条款。
常见问题解答
MiniMax H3电影预告片生成器能制作完整预告片,还是只能15秒?
每次生成15秒是硬性上限。电影预告片通常30到60秒,完整预告片90秒到三分钟(Beverly Boy,2026),因此一次调用只能得到社交媒体剪辑,而非电影院版本。如需更长,可通过将上一个剪辑的最后一帧作为下一个剪辑的第一帧来串联生成。
MiniMax H3是否原生生成预告片配音和音乐,还是我需要后期添加?
原生生成,与画面在同一次调用中输出,以AAC立体声32 kHz伴随24 fps视频交付。但三个端点都没有音频参数。你需要通过提示词中的散文指定配乐、旁白和音效,并附上时间码。跳过该块,你将得到一段你无法控制的音轨。
屏幕上的标题卡文字能否清晰可读?
可以,如果你写出文字字符串,描述文字的处理方式,并添加明确的稳定性指令,如“rock-steady, no jitter, no warping”。保持两行以内。大间距的大字在768p下存活;小字行只有在2K下才能正确解析。
制作一个MiniMax H3电影预告片需要多少钱?
在Atlas Cloud上,15秒2K为2.10美元(0.14美元/秒),同样长度768p为1.50美元(0.10美元/秒)。加上开场帧约0.17美元。一个完成的预告片价格在2.03美元到3.77美元之间,具体取决于你是升级草稿还是重新运行2K。务必显式发送duration。
我能为真实存在的电影制作预告片吗?
技术上,输入筛选会阻止命名的电影系列,因此模型会在计费前拒绝。实际上,YouTube已经因误导性元数据封禁了拥有十亿播放量的频道。请制作原创内容,或者明确标注为概念或粉丝作品。
我能否在更长的预告片中保持同一个主角?
使用reference-to-video,它接受最多九张参考图像加上参考视频和音频,并在那里锁定你的演员,而不是依赖纯文本保持一致。不要在同一个请求中同时发送image和refers:它们互斥,API不会报错,但其中一个会被静默丢弃。






