你见过那种不奏效的版本。有人将手绘肖像丢进视频工具,等待,得到三秒的Live Photo抖动:头发微颤,云层冻结,没有声音,循环播放。
手绘电影从未那样动过,也从未那么安静过。
所以,我们换了一种方式。一幅手绘关键帧,一次MiniMax H3 吉卜力风格渲染,时长15秒,草浪起伏,电车驶过高架桥,蝉鸣贯穿始终,四个钢琴音符收束。全部来自一次作业,一个文件,内置立体声音频。
下方:先看成片,然后是精确的提示词、真正生效的设置、真实操作的游乐场截图,以及逐项清单。
核心要点
- 一次15秒2K作业输出2560x1440、24fps、AAC立体声32kHz,无水印。
- 手绘感是节奏问题,而非调色板问题。要求“拍二”(on twos),而非平滑。
- 风声、蝉鸣和钢琴来自同一次渲染,无需二次配乐。
- 3步:绘制关键帧、动画化、用参考到视频匹配第二个镜头。
- 提示词中避免使用工作室和导演名称,转而描述工艺。
以下是成片,在理论之前。
0ewchq5dcTc
打开声音。一次连续的15秒图像转视频作业,在MiniMax H3上,2K,无剪辑,无后期:草风、电车铃声、蝉鸣与钢琴,全部出现在这个单一的mp4文件中。
在你阅读的地方无法播放视频?以下是四个关键节拍,直接从上方文件中提取。

MiniMax H3吉卜力风格山坡渲染的四帧,分别在第0秒、5秒、10秒和15秒,展示首次草风、电车驶过高架桥、第二次草风和最后的静止节拍
同一渲染在0秒、5秒、10秒和15秒的采样。注意最后一帧:没有新元素进入画面,这是有意为之。
为什么大多数MiniMax H3吉卜力风格尝试看起来像滤镜
先下结论:滤镜感几乎从来不是色彩问题,而是节奏、声音和时长问题。
以下是证据。手绘赛璐珞动画并非每秒24张独特画稿。在分析宫崎骏的一个奔跑循环时,Animation Obsessive称之为“以‘拍二’方式绘制的奔跑”,即“每秒12张画稿”,其中“每张画稿在屏幕上停留两帧”。(Animation Obsessive,2023年3月)
现在思考视频模型默认会做什么——插值。平滑、丝滑,全帧率。
这正是破绽所在。你的调色板没问题,但你的运动太流畅了。
问题在于:模型能否在整整15秒内保持手绘图层不融化?答案是肯定的,请看效果。

手绘金鱼和海草,在真实的阳光厨房台面上动画化,来自MiniMax H3 15秒渲染
MiniMax H3样本运行:蜡笔勾勒的金鱼和绿色海草笔触,绘制在真人实拍厨房镜头上,持续完整15.08秒,线条未模糊。此处以静音GIF展示;交付文件包含24fps视频和32kHz立体声音频。
第二个死因:混合风格承诺。写下“逼真动漫水彩”会让模型试图同时满足三种契约,结果就是人们称之为“AI slop”的糊状物。专注于一种媒介,它就能保持稳定。

黏土动画狐狸在裂缝岩石上腾跃,旁边是发光熔岩裂缝,可见橡皮泥指纹纹理,来自MiniMax H3渲染
同理,不同媒介:单一风格承诺(“定格黏土动画”)产生真实的指纹纹理和定格动画质感,持续10秒。静音GIF;源文件为2560x1440,含立体声音频。
第三和第四个死因:静音,以及没有喘息空间。人们所说的这种风格中,大约一半是声音设计——风声和稀疏的钢琴。而停顿需要真实秒数。一个5秒的片段物理上无法容纳三秒的静止。
以下是我们反复使用的诊断表。
| 输出中的症状 | 真正原因 | 在提示词中添加 |
|---|---|---|
| 丝滑、流畅、“过于平滑”的运动 | 模型以全帧率插值 | 手绘拍二,保持画稿,轻微帧间线条抖动,无插值丝滑运动 |
| 轮廓融化或蠕动 | 风格承诺冲突 | 只命名一种媒介:平涂色块、手绘轮廓、水彩背景 |
| 中镜头时面部或服装变化 | 单一镜头中动作过多 | 每次风动一个动作;无新角色、无服装变化 |
| 摄影光晕、散景、镜头光晕 | 照片先验泄漏 | 无摄影景深、无散景、无镜头光晕、无3D渲染 |
| 输出静音 | 未编写音频条款 | 显式编写Audio:段落,包含层次和时间点 |
| 结尾显得仓促 | 无保持节拍 | 从第12秒到第15秒,只有草在动:保持静止,不添加新动作 |
你使用的端点与提示词同等重要。有三个端点,各有不同职责。
| 端点 | 控制内容 | 宽高比 | 用途 |
|---|---|---|---|
| minimax/h3/text-to-video | 仅提示词,无帧锁定 | 需显式指定比例,自适应被拒绝 | 在拥有艺术之前探索外观 |
| minimax/h3/image-to-video | 首帧锁定构图、调色板、纸张纹理 | 枚举仅自适应;你的帧决定形状 | 主要步骤:动画化一幅画 |
| minimax/h3/reference-to-video | 多个标记参考引导新镜头的风格 | 接受所有7种比例,显式传递16:9 | 第二、第三镜头,匹配系列 |
一个值得写在手上的陷阱:在同一个调用中同时发送image和refers不会报错。作业完成,全额计费,并静默丢弃其中一个输入。我们在两个端点上测量过,丢弃方向各不相同。每次调用只选择一个端点。
MiniMax H3 吉卜力风格工作流:三个模型,一个标签页
本节提供完整链条及每个环节的成本。整个过程在Atlas Cloud的一个浏览器标签页中运行,下方所有截图均在此操作,因此你无需导出文件再重新上传到其他地方。
对于这个特定任务,这一点很重要:绘画模型和视频模型必须就帧达成一致。将它们放在同一平台上意味着你生成的关键帧已经是下一个游乐场可以接受为首帧的文件,而参考到视频步骤可以同时访问关键帧和你已完成的剪辑中提取的静帧。
| 链条中的作业 | 模型/端点 | 分辨率 | 价格(2026年8月21日验证) |
|---|---|---|---|
| 绘制关键帧 | openai/gpt-image-2/text-to-image | 2048x1152, quality high | $0.1745/图(列表中的$0.009是token层级底价) |
| 动画化关键帧 | minimax/h3/image-to-video | 2K | $0.14/秒,15秒为$2.10 |
| 先低价草稿 | 同上端点 | 768P | $0.10/秒,8秒为$0.80 |
| 匹配第二镜头 | minimax/h3/reference-to-video | 2K | $0.14/秒,参考文件免费 |
| 将照片重绘为艺术品 | google/nano-banana-2/edit | 2k tier | $0.12(列表说$0.08;tier提升后移动) |
| 可选额外音乐提示 | minimax/music-2.6 | 不适用 | $0.15/曲,固定价格 |
一个能避免与你的电子表格争论的习惯:模型页面上的标题数字是底价,而非你的账单。H3页面列出$0.10/秒,这是768P tier;2K是$0.14/秒。GPT Image 2列出$0.009,这是token层级底价,而quality high且2048x1152实际报价为$0.1745。每次点击“运行”按钮前阅读它,因为那是你实际被收费的数字。
截至2026年8月,H3端点没有折扣。只有图像模型的-developer变体有折扣,这对草稿有用,但对交付无关。
我们开始吧。
第一步:绘制关键帧
帧承担大部分工作。视频步骤无法发明的所有内容——构图、调色板、线条质量、纸张纹理——都必须已经存在于此PNG中。
打开GPT Image 2 text-to-image游乐场,并逐字粘贴以下内容。
plaintext1手绘2D动画背景,风格为1990年代日本赛璐珞动画:夏日午后开阔山坡。高大绿草占据下方三分之二,用水粉绘制,可见笔刷纹理和手绘草叶边缘。一个约十岁女孩站在中景,背对镜头,穿着黄色雨衣和红色背包,一只手按住草帽。山坡后方,一辆单节电车在低矮石砌高架桥上穿过绿色山谷;远处蓝色山脉渐隐于浅奶油色天空,高耸积云以扁平分层形状绘制。下午4点温暖光线,柔和环境阴影,无强烈对比,有限调色板:草绿、奶油、天蓝和一点黄色。赛璐珞动画线条质量:清晰自信的轮廓、平涂色块、手绘水彩背景、轻微纸张纹理。无文字、无标志、无水印、无照片写实、无3D渲染、无镜头光晕、无现代建筑。
设置:quality **high**,尺寸 2048x1152(16:9),一张图。不要在这里降到medium。纸张纹理和手绘草叶边缘正是低层级会平滑掉的细节,而这两点正是之后整个镜头成立的关键。
注意提示词没有说什么。没有工作室名称,没有导演名称。每个风格指令都是对工艺的描述:水粉、手绘边缘、平涂色块、赛璐珞动画线条质量。这不是谨慎,而是更好的提示词,因为“具有平涂色块和可见纸张纹理的赛璐珞动画”是一个具体指令,而工作室名称是模糊的。
以下是运行结果。

Atlas Cloud上的GPT Image 2游乐场,加载了手绘山坡提示词,quality high,16:9,输出面板中渲染了完成的吉卜力风格关键帧
GPT Image 2,quality high,2048x1152,在Atlas Cloud上运行。注意“运行”按钮:$0.1745,而非定价页面上的$0.009。
以及关键帧单独展示,因为你即将把这个文件直接输入下一步:

手绘夏日山坡关键帧:一个穿黄色雨衣的女孩背对镜头站在高草中,一辆单节电车在山谷外的石砌高架桥上,扁平分层积云
使用openai/gpt-image-2/text-to-image生成。此PNG是文章顶部完成镜头的第一帧。
第二步:动画化为MiniMax H3 吉卜力风格运动
现在是有趣的部分。这个提示词比大多数人写的都长,这是有意为之:你在编写一个时间表,而非一种氛围。
它指定了四个典型提示词没有的内容:每次风动的开始时间、电车进入和离开的时间、节奏是拍二,以及一个完整的音频段落,包含每层音频的进入时间。
将你的第一步PNG加载到MiniMax H3 image-to-video页面并粘贴以下内容。
plaintext1将此画作动画化为一个连续的手绘镜头,15秒,无剪辑。 2镜头:极慢的推近,几乎不可察觉,加上向右约5%画面宽度的缓慢漂移。无缩放快切,无手持抖动。 3运动:风以两道长波方式穿过高草,第一道从第2秒开始,第二道从第9秒开始,每次将草叶向同一方向吹弯。女孩的雨衣下摆和头发随每次风动抬起;她的草帽边缘弯曲。云层几乎不可察觉地漂移。在第7秒,一辆单节电车从左向右驶过高架桥,并在第11秒离开画面。从第12秒到第15秒,除了草和一片云影掠过山坡,没有其他动作:保持静止,不添加新动作。 4动画节奏:手绘拍二,保持画稿,轻微帧间线条抖动。无插值丝滑运动,无变形,无边缘融化。保持平涂色块和手绘纸张纹理。不添加摄影景深、散景或镜头光晕。 5音频:持续夏日蝉鸣,稳定中等音量;分层草叶沙沙声,随每次风动增强;一声远处电车铃声在第7秒,伴随微弱车轮隆隆声,在第11秒前消失;以及一条稀疏的独奏钢琴线,四个音符,在第3秒进入,在第13秒解决。无人声、无旁白、无对话、无屏幕文字、无超出该钢琴线的音乐。
设置:image = 你的第一步PNG,resolution **2K**,duration **15**,比例保持adaptive。最后一点不是懒惰。此端点上的枚举只包含adaptive,上传的帧决定输出形状,所以16:9的关键帧会给你16:9的片段。
在点击“运行”按钮之前先阅读它,因为我们正是在这里丢失了一次尝试。
在2K和15秒时,报价应为$2.10。我们的显示为$1.12。时长滑块从未接受我们的15,作业以8秒默认值运行,而表单上的其他所有字段看起来仍然完全正确。以下是那次运行,陷阱就在画面中。

Atlas Cloud上的MiniMax H3 image-to-video游乐场,加载了手绘关键帧,分辨率2K,输出面板中播放着完成的吉卜力风格山坡片段
提示词要求15秒。播放器显示0:08。“运行”按钮显示$1.12。分辨率2K已提交,时长未提交。读取价格,绝不要读取滑块。
以下两种方式之一修复:拖动滑块并确认报价在提交前变为$2.10,或者通过API发送作业,其中duration: 15只是一个不会悄然丢失的字段。本文顶部的片段是第二种方式,同一端点和同一提示词,resolution: 2K,duration: 15。
以此方式交付:一个15.08秒的容器,2560x1440,24fps,H.264,AAC立体声音频32kHz,任何地方无水印。意外生成的8秒版本恰好以8.00秒返回,几何相同。预算5到10分钟的实际时间;8秒2K作业在我们的运行中落在310到400秒之间,而一个携带三个参考的2K作业耗时557秒。
第三步:用参考到视频匹配第二镜头
一个镜头是演示。两个属于同一世界的镜头是一个序列,而大多数人在这里的吉卜力风格实验会失败:角色面孔漂移,调色板变暖,纸张纹理消失。
解决方案不是更好的提示词,而是不同的端点。参考到视频接受标记的参考材料,并将其外观带入新的摄像机设置。
将你的第一步关键帧作为参考提供。单帧携带调色板、线条质量和纸张纹理,在此镜头中它独自保持了外观,如下方结果所示。如果你的运行在运动开始后出现漂移,请添加从第二步接近结尾处导出的静帧作为第二个参考,它携带了模型在运动开始后对线条的处理。然后将其粘贴到参考到视频端点。
plaintext1精确匹配参考图像的手绘外观、调色板、线条质量和纸张纹理,然后拍摄同一世界中的不同镜头:低机位,草的高度,在同一山坡上,仰视同一个穿黄色雨衣的女孩,她蹲下触摸一根高草,然后站起来望向山谷。 2一个连续镜头。手绘拍二,保持画稿,平涂色块,手绘水彩背景。无照片写实、无新角色、无服装变化、无文字、无水印。 3镜头:前四秒静止,然后随着她站起来缓慢仰拍,最终以她侧脸对着奶油色天空结束。 4音频:与参考相同的夏日蝉鸣和草叶沙沙声;她站起来时一声轻柔衣物摩擦声;同一稀疏独奏钢琴继续,不重新开始。无对话、无旁白。
设置:refers = 你的关键帧,resolution 2K,ratio adaptive(参考帧设定输出形状),并选择你的时长。我们的运行返回8秒2K,报价$1.12,参考文件免费。来自真实运行的三个注意事项:
- 参考文件免费。十个参考图像与一个相同长度和分辨率的参考图像收费完全相同。
- 如果你传递数据URL,请显式声明其
type。端点从文件扩展名推断类型,而数据URL没有扩展名。 - 在自动化捕获中,千万不要将
.mp4交给此页面的上传器。它会导致每次上传静默失败并使“运行”按钮变灰。

Atlas Cloud上的MiniMax H3 reference-to-video游乐场,吉卜力关键帧作为参考加载,2K下已输入匹配镜头提示词
MiniMax H3 reference-to-video:关键帧在“参考材料”槽中,匹配镜头提示词已加载,2K。参考材料免费,因此$1.12报价全部来自渲染。结果如下方所示。

同一MiniMax H3吉卜力风格世界中的匹配第二镜头:低机位草的高度,仰视穿黄色雨衣的女孩
交付的第二镜头。相同调色板、相同线条粗细、相同纸张纹理,新摄像机。静音GIF;源mp4文件携带立体声音频。
这就是完整链条:绘制、动画化、匹配。三次运行,一个标签页。
一旦链条工作正常,值得尝试的三种变体:
- 你自己的照片,重绘。 通过
google/nano-banana-2/edit发送你拥有的一张风景或街拍照片,提示词为:“将此照片重绘为手绘2D动画背景:水粉和水彩纹理,清晰手绘轮廓,平涂色块,有限调色板(绿、奶油、天蓝),轻微纸张纹理。保持完全相同的构图、摄像机角度和地平线。移除所有文字、标志和标识。无照片写实、无3D渲染。” 然后动画化结果。如果你想要竖屏,先将重绘的帧裁剪为9:16,因为帧决定形状,而非比例字段。 - 同一帧,不同天气。 在第二步提示词前添加:“将光照重绘为黄昏微雨:调色板变为石板蓝、湿奶油色和一处温暖窗光;” 并将音频层替换为稳定细雨,加上第8秒的一声远方雷声。无需新关键帧。
- 先在768P起草。 每秒更便宜,适合粗排。但有一个硬性规则,见下一节。
MiniMax H3 吉卜力风格序列的成本
预览:一个可发布的30秒两个镜头序列约$4.40,而廉价起草路线有一个陷阱,成本可能超过节省。
以下是账单,基于模型页面验证的每秒费率,并与真实作业记录确认。
| 项目 | 端点 | 数量 | 成本 |
|---|---|---|---|
| 手绘关键帧 | gpt-image-2, quality high, 2048x1152 | 1张图 | $0.17 |
| 镜头一 | h3/image-to-video, 2K | 15秒 x $0.14/秒 | $2.10 |
| 镜头二 | h3/reference-to-video, 2K | 15秒 x $0.14/秒 | $2.10 |
| 镜头二的参考静帧 | h3/reference-to-video | 2个文件 | $0.00 |
| 序列总计 | 30秒成品,2K,含音频 | $4.37 | |
| 任一镜头的一次重跑 | h3, 2K | 15秒 | +$2.10 |
| 可选专用音乐提示 | minimax/music-2.6 | 1条曲目 | +$0.15 |
| 可选先在768P起草 | h3, 768P | 8秒 x $0.10/秒 | +$0.80 |
现在讲陷阱。为了省钱而先以768P起草,对构图和粗排有效,但效果并非人们设想的那样。
我们测量了两件事。首先,在不同分辨率层级重跑一个纯文本到视频提示词,并不会让画面更清晰,而是会生成一部不同的影片:不同的布景、不同的摄像机高度、不同的道具。通过图像到视频锁定首帧,才能将差异限制在细节上。其次,这一点让我们惊讶:在相同锁定首帧和相同提示词下,两个层级的音频轨道无关。它们之间的波形相关性测量为0.0053,属于统计噪声。
翻译:768P草稿预览你的构图和动作节拍。它绝不是你最终交付的混音。
致敬、版权与你可以发布的内容
简短版本,并非法律建议:视觉风格本身通常不受版权保护,但训练数据和输出是一个活跃且有争议的问题,平台条款则是另一回事。
这场争议并非假设。2025年10月27日,日本内容海外发行协会(一个涵盖动漫、电影、游戏和出版的权利人组织)提交了一份书面请求,要求“其成员的内容未经许可不得用于机器学习”,并指出“根据日本版权制度,使用受版权保护的作品通常需要事先许可,不存在通过后续异议规避侵权责任的制度”(CODA,2025年10月)。
三个保持输出干净的实际习惯:
- 描述工艺,而非工作室。我们的提示词中提到了水粉、拍二、平涂色块和纸张纹理,没有任何地方提到公司或导演姓名。
- 不要将可识别的角色、标志或标题卡放入画面。我们的山坡上没有任何角色IP。
- 在盈利前检查适用于你账户的条款,并单独检查你发布平台的条款。
构建一个与你喜爱的电影共享技术的世界。不要构建一个特定电影的仿制品。
常见问题解答
MiniMax H3能实现吉卜力风格吗?我应该在提示词中写“Studio Ghibli”吗?
第一个问题答案是肯定的,但我们不建议写工作室名称。本文中的所有结果都来自工艺词汇:手绘2D赛璐珞动画、水粉加可见笔刷纹理、手绘轮廓、平涂色块、拍二,保持画稿、轻微纸张纹理。这六个短语承载了外观,它们比工作室名称更具体,并且让发布问题更简单。
MiniMax H3是自行生成风和钢琴,还是我之后需要添加音效?
自行生成,在同一个作业中。MiniMax将H3描述为“生成带原生立体声的视频,最长15秒,2K分辨率”(MiniMax,2026年7月),我们的交付文件携带AAC立体声32kHz。编写一个专门的Audio:段落,命名每一层及其进入时间。如果你想要完整的作曲曲目而非提示,请单独在minimax/music-2.6上生成,费用$0.15,然后混入。
一个镜头可以多长?15秒真的能保持稳定吗?
时长在所有三个端点上接受从4到15的每个整数秒,而我们15秒的请求交付了一个15.08秒的容器。它保持稳定。想要15秒而非8秒的原因不是宏大场面,而是相反的:这是唯一能拥有三秒什么都不发生的时机,而这正是这种风格赖以构建的节拍。
如何跨两个镜头保持相同的角色、调色板和纸张纹理?
使用参考到视频,有两个参考:原始关键帧加上第一个已完成剪辑中的一帧,并编写“精确匹配参考图像的手绘外观、调色板、线条质量和纸张纹理”作为第一句。注意一个静默失败:在单个调用中混合image和refers会完成作业并全额计费,同时丢弃其中一个输入,响应中没有任何警告字段。
我应该先在768P起草然后以2K重跑来省钱吗?
为构图而先在768P起草,可以。但必须通过图像到视频锁定首帧,否则重跑会返回不同的影片。并且将草稿的音频视为一次性:相同帧、相同提示词、不同层级,两个音频轨道之间的波形相关性为0.0053。混音是重新生成的,而非上采样。
MiniMax H3吉卜力风格视频发布或盈利安全吗?
取决于画面中的内容以及你的账户条款,且这不是法律建议。风格描述性提示词,无角色IP、无标志、无工作室名称在画面中,是保守版本,本文演示的正是这个版本。在商业使用前验证适用条款。
最后一点值得重复,因为这是人们跳过的地方。一个minimax h3 ghibli style镜头之所以成立,不是因为它绿色的调色板,而是因为它的运动故意比模型能做到的差,并且最后三秒被允许空白。编写时间表。编写声音。然后让它静止。






