MiniMax 发布了一篇社区综述,总结了 H3 作为开放模型的第一周。文中提到近 300 个衍生模型、一系列量化版本、一个原生 Mac 推理引擎以及由智能体驱动的生产管线。所有这些都值得一看。
但最值得单独拎出来的是第一节末尾的一句话,描述了一位动画创作者的实际工作方式。原文如下:
他在 RTX 3060 上生成 480p 视频进行迭代,利用本地硬件进行预览、筛选和试错,只有当他满意某个版本后,才转移到云端以更高分辨率渲染最终版本,并完成超分辨率处理。
官方文章给这个习惯起了一个名字:本地草稿,云端精修。
这三个字正是我们在数月的模型比较工作中反复遇到的结论。本文试图将其说清楚:为什么这种拆分站得住脚,以及一旦站住脚,你真正需要保留的是什么。
要点总结
- 本地 MiniMax H3 终于能在消费级硬件上运行,但本地只是低分辨率端。2K 最终版本是单独的一步,而不是更大的渲染。
- 从草稿到最终版本唯一需要传递的是提示词,因此整个工作流取决于你的提示词能否在传递过程中保持不变。
- 将一条逐字相同的 MiniMax H3 提示词同时运行在多个模型上,是为了健康检查提示词,而不是给模型排名。
- 一个约束条件可以逐字满足,却仍然偏离本意。锁定承载概念的那个属性,而不是副作用。
- 值得保留的两项资产是分类好的提示词库和每条提示词背后的决策逻辑。
为什么“本地草稿,云端精修”目前仅适用于 MiniMax H3
这种拆分依赖于一件事:本地端突然变得强大了。
在开源的一周内,社区在推理效率上进展迅速。ComfyUI 团队削减了构成参数数量约 40% 的调制权重,将其替换为预计算表,并加入了 INT8 量化和自定义内核,将最小的模型组合从 123.6GB 内存降至 42.5GB。再加上动态卸载,一张消费级显卡就能运行本地推理。
另外,Redis 的创建者 antirez 用 C 和 Metal 从头编写了一个原生 Apple Silicon 推理引擎。它直接读取 safetensors 权重,并将文本和视觉编码器、DiT 以及视觉和音频 VAE 打包成一个原生 Mac 程序,不依赖 Python 或 PyTorch。
NVIDIA 的研究团队在发布当天 4.5 小时内完成了推理优化的一轮初始工作,并报告在八卡配置上比 Diffusers 实现了 3.95 倍的端到端加速。
将所有这一切叠加起来,结果很明确:本地运行现在可行,但它渲染的是低分辨率。
因此,创作者的这种拆分自然成立。低分辨率快速、廉价且可重复,这正是试错所需要的。最终交付仍然回到云端。两端不是替代关系,而是同一条流水线上的两个工位。
两个 MiniMax H3 阶段之间真正传递的是什么
这是我们真正关心的问题。
你在本地以 480p 进行了二十次尝试,终于调出了想要的效果。现在你转移到云端进行最终渲染。你真正能带过去的是什么?
不是 480p 片段,它的分辨率太低。不是模型权重,云端有自己的。
是提示词。
在整个流程中,唯一需要在两端传递并保持不变的就是提示词。它是这个工作流中唯一的资产。
这个含义比听起来更重要:
- 如果环境变化后你的提示词失效,那么这种分层工作流根本无法运行。 你在本地调优的一切在前往云端的路上都被浪费了。
- 如果你为每个模型重写提示词,那么每次切换模型你都要重复草稿阶段。
- 反过来想:如果提示词足够可移植,你甚至可以在更便宜的模型上起草,只要它对同一句话的理解是可预测的。
所以问题变成:如何写出一个在环境变化后仍然有效的提示词? 我们对此进行了测试。
一条 MiniMax H3 提示词,同时运行四个模型
在过去几天里,我们进行了十几次这样的对比:一条逐字相同的提示词,只改变提交参数,发送给四个模型,主题涵盖 VFX、产品 UI 动效、音乐短片等。
以下是同一测试在八个主题上的运行结果。每个片段是同一提示词的四格分割:左上 Seedance 2.5,右上 MiniMax H3,左下 Seedance 2.0,右下 Kling v3.0pro。
武侠对决:一个提示词,四个模型。请打开声音。
动漫浪漫场景,同样的四格分割。
手袋广告:同一条提示词的产品片段。
女团表演,分割中音频同步。
KNNOfby0vtw一个角色驱动的场景,四个模型并排显示。
相机广告,相同提示词并行。
运动鞋广告,八个主题中的最后一个。
这次运行实际测试的是什么
这不是排名。这是对提示词的一次体检。
因为提示词逐字相同,只改变了提交参数:
- 四个模型之间的差异就是模型之间的差异。 这听起来像不言而喻,但它是整个练习的基础,并且只有在四个模型运行在同一个执行环境中时才成立。把来自不同来源的四个界面拼凑起来,链接级别的变量就会混入差异中,你无法区分模型差异和平台差异。
- 四个模型都失败的地方是提示词问题,而不是模型问题。 这是草稿阶段最有价值的信号,也是你永远无法从运行单个模型中获得的。一个模型失败,你怀疑模型。四个都失败,答案很明确:回去修改那一行,不要换模型。
- 每次只改一个变量,其余保持不变。 这是唯一能让“这个版本更好”站住脚的方法。分散改动,你无法归因任何东西。并行运行多个模型意味着一次单变量改变就能同时获得四个观察点。
那么文件中应该记录什么
不是参数表。参数在模型页面上,复制它们不携带信息。值得记录的是“我写了什么,然后我观察到了什么”。 两个例子:
| 提示词内容 | 四次运行的结果 |
|---|---|
| 三个节拍分别在 4秒 / 8秒 / 12秒 | 两者都出现时间漂移,但方向相反。MiniMax H3 提前运行,且误差累积,最终落在约 4/6/8秒。Seedance 2.0 滞后,且完全丢失了中间节拍。 |
| “保持扁平图形风格,不要渲染成真实生物” | 两者都严格遵守字面,返回了平滑的矢量霓虹轮廓。扁平?是的。手绘?完全不是。 |
第一个的价值在于方向。只记录误差大小是没用的,因为下次补偿时你会补偿错方向。一个需要往后推,另一个需要往前压。
第二个更有价值,也是下一节的主题。
你不再需要为此编写脚本
当我们进行这些比较时,我们编写了自己的脚本来提交作业并轮询结果。现在不需要了。Atlas Cloud 推出了 Model Explorer。
写一条提示词,选择最多 10 个模型并行运行,结果并排返回。
它真正的价值不是便利,而是控制。那次比较之所以能得出结论,是因为四个模型在同一执行环境中运行。把四个不同来源的界面拼凑起来,平台变量就会渗入差异:网关行为、默认参数、资产编码方式。改变任何一个,你以为自己在比较模型,实际上是在比较平台。在一个模型池内运行,这些变量在结构上就被控制住了。
有几个功能直接映射到草稿阶段:
- 预设模型组。 SOTA、热门和低成本,加上你自己的保存组。用低成本组起草确定方向,然后切换到 SOTA 组进行最终版。这就是本文开头提到的同样拆分,只是两端现在都在云端。
- 运行前显示成本估算, 这样你不需要等到最后才知道一轮花费了多少。
- 同时支持图片和视频, 图片端包括文生图和图生图。

Atlas Cloud Model Explorer:一组预设模型,从一条提示词并行运行,运行前显示每次运行的成本估算
可验证不等于锁定正确的维度
上一节的那句话“保持扁平,不要照片级真实”是我们遇到的最典型的陷阱。
奇怪的是:约束条件可以完全满足,却仍然完全失败。 扁平?是的。手绘?完全不是。在清单上逐项打勾,你就得了满分。
问题在于:我们锁定了“扁平度”,但实际承载概念的那个属性是**“可见的工具痕迹”**。换成“蜡笔、彩铅笔、粗笔刷、排线方向、不均匀填充、粗糙边缘”,同一个模型完全反转。
手绘主题在四个模型上的表现。“扁平”很容易满足,“可见的手工感”才是真正需要锁定的属性。
这可以提炼成一个测试:
对你写的每个约束条件问自己:模型能否满足这句话,却仍然丢掉我真正想要的东西?
如果能,那么锁定的是副作用,而不是概念。
症状很熟悉:输出逐条符合你的清单,但任何了解参考的人一眼就能看出不对。
此时的正确做法不是增加更多约束条件,而是回去找到实际承载概念的那个属性。
回到“本地草稿,云端精修”,这一点影响更大:一个瞄准错误维度的约束条件在草稿分辨率下可能不可见。 在 480p 下,平滑轮廓和粗笔刷之间的差异已经模糊,你只有在花费精力完成云端最终版后才发现方向错了。草稿是否能节省时间,取决于你在草稿时锁定的属性是否是真的那个。
社区已经将 MiniMax H3 流程打包
官方文章还包含一个值得单独提的信号:开发者开始将整个生产流程封装成可复用的东西。
一位 AI 艺术家在 Mac 上使用 Claude Code 来编排第二台机器上的本地模型。Mac 负责项目设置、事实核查、脚本、时间线、字幕、故事板和结构审查,另一端负责模型推理。整个过程分为 14 个阶段,从简报一直到批量渲染、剪辑合成和账本回写,全程无需打开传统编辑器。
另一个项目将同样的想法包装成一个插件,内置技能,从故事或商业简报开始,到角色和场景设置、故事板和关键帧设计,然后为每个镜头选择工作流。提示词、输入资产、工作流、候选镜头和选择都保存在项目记录中,因此中断的任务可以在停止处恢复。
方向都是一样的:每个人都在把“这个作品是怎么做出来的”变成可复用的资产,而不是留下一堆完成的电影。我们制作的两样东西正好落在这条线上。
两个你可以立即使用的 MiniMax H3 资源
-
官方 MiniMax H3 提示词库(52 条提示词,16 个类别,每个都有预览)
Plain1https://github.com/AtlasCloudAI/awesome-minimax-h3-prompts
不是改写,而是官方展示中的原始提示词,按场景组织,每条都配有真实的生成预览视频,这样你可以在决定复制哪条之前看到结果。
16 个类别涵盖品牌与电影、视觉创意与包装、动态图形与 VFX、AI 叙事、产品与电商、数字与游戏创意、工业与具身 AI、动画与风格化、多材质参考、角色/动作/相机参考、声音克隆、角色与对象编辑、场景与 VFX 编辑、音频与对话编辑、精确指令遵循,以及风格预设。支持 20 种语言,并接受提交。
在草稿时最省时的用法是:找到一条主题接近你的提示词,观看它的预览,然后以此为基础进行编辑。 比从空白框开始快得多。

GitHub 上的 awesome-minimax-h3-prompts 仓库,显示类别索引和其中一个条目及其预览视频
-
通用视频提示词技能
Plain1https://github.com/kiana-liang/universal-video-prompt-skill
Plain1npx skills add kiana-liang/universal-video-prompt-skill
它解决了第二节的问题:你复制了提示词,但无法复制写提示词时所做的判断。 标语说的正是这个。无法通过复制提示词来复制的底层决策逻辑,就存在于这里。
它的作用是将“先想清楚,再写成形式”分解为可复用的决策检查清单:
- 每行之前问两个问题: 这属于哪一层(全局、锁定或时序),并且是否以可观察的形式写成?
- 将不可验证的转化为可验证的。“保持一致”变成可见的最终状态。“紧张”变成眼神、呼吸和手部动作。
- 一种防方言的方法: 同时写出术语和可观察的描述。知道术语的模型走捷径,不知道的模型遵循描述,一条提示词覆盖两者。
- 跨环境无需重写。 纯语言层只写一次,模型特定的偏差放在单独的个人资料表中,即第三节中的那种。
该仓库包含 5 种镜头类型、4 个完整案例、6 个模型个人资料和 4 个演示视频。每个视频都绑定到它所演示的特定规则,不是展示片。
它也很清楚自己不做的事:没有必填槽位,没有例子是规则,每条规则都有例外。 如果你在寻找一个填空模板直接套用,这不是它。
精修端:在 Atlas Cloud 上运行 MiniMax H3
所有三种 MiniMax H3 调用模式都在 Atlas Cloud 上运行:文生视频、图生视频和参考生视频,每个模型页面上都有参数、时长选项和请求示例。
Plain1概述 https://www.atlascloud.ai/models/minimax-h3 2文生视频 https://www.atlascloud.ai/models/minimax/h3/text-to-video 3图生视频 https://www.atlascloud.ai/models/minimax/h3/image-to-video 4参考生视频 https://www.atlascloud.ai/models/minimax/h3/reference-to-video 5比较工具 https://www.atlascloud.ai/model-explorer
Atlas Cloud 将这些主流视频模型汇集到一个池中,因此通过一个 API,只需更改一个模型字符串即可运行整个比较。第三节中的四模型测试就是这样运行的,不过那时我们仍然自己编写了脚本,而现在在 Model Explorer 中只需点击几下。
因此,在实践中,管道是这样连接的:
| 阶段 | 地点 | 目的 |
|---|---|---|
| 草稿 | Model Explorer,使用低成本预设,一条提示词并行运行 | 快速测试方向,构建模型个人资料表 |
| 精修 | 同一池,切换到目标模型 | 提示词不变,只更改模型字符串 |
| 交付 | API 调用,进入你自己的生产流程 | 批量、可编排 |
所有三个阶段使用相同的提示词和相同的密钥。 中间没有任何重写,环境也没有变化,这正是第二节的要点:需要在阶段之间传递的唯一资产是提示词,所以不要让它变形。参数、时长选项和 API 示例都位于 MiniMax H3 模型页面上。
总结
开源一周,社区已经将 MiniMax H3 适配到消费级显卡、原生 Mac 程序以及自动化生产流程中。这些工作使得本地端真正可用。
但本地运行不等于本地交付。“本地草稿,云端精修”是一个好习惯,因为它没有将两端对立起来。 它承认这是一条流水线,两个工位做两件事。
要让流水线运转,中间传递的零件必须可靠。那个零件就是提示词。 因此,值得你花时间的从来不是你渲染的某一部作品,而是你当初为什么那样写。
MiniMax H3 提示词常见问题
在哪里可以运行 MiniMax H3 而不需要本地 GPU?
所有三种 MiniMax H3 模式(文生视频、图生视频和参考生视频)都在 Atlas Cloud 上运行,每个模型页面上都有参数和时长选项。在社区构建配置好后,本地推理对于廉价 480p 草稿很有用,但更高分辨率的最终版本仍在云端渲染。
如何公平地比较 MiniMax H3 与其他视频模型?
在单个执行环境中,使用一条逐字相同的提示词跨模型运行。Model Explorer 可以并行运行最多 10 个模型,保持网关行为、默认参数和资产编码恒定,这样你看到的差异就是模型差异。
MiniMax H3 提示词可以迁移到其他模型吗?
这正是写好提示词的全部意义。保持纯语言层可观察且防方言(术语加描述),并将模型特定的时序偏差记录在单独的个人资料表中。这样,提示词在从草稿模型切换到最终模型时可以保持不变。
在哪里可以找到现成的 MiniMax H3 提示词?
awesome-minimax-h3-prompts 库包含 52 条官方展示提示词,涵盖 16 个类别,每条都有真实的预览视频,支持 20 种语言。找到一条主题接近你的,观看预览,然后从中编辑。






