
凌晨3点的书桌,敞开的主机箱、一块外置硬盘和一台显示器,显示器上显示着一个大型下载进度条
权重已经发布。所以,在回答其他问题之前,先让我回答MiniMax发布帖子下获赞最多的两个问题。
不,你不需要一台超级计算机。选对文件,下载大小是42.5 GB,而不是123.6 GB。该模型有33B参数,其中大约13B位于AdaLN调制分支中,推理时甚至不需要加载这些分支。
然后我打开了LICENSE文件。在第10行,在我看到2000万美元营收条款之前,是一个国家列表。我的国家在列表里,你的很可能也在。
关键要点
- MiniMax H3开源权重已在Hugging Face上以
MiniMaxAI/MiniMax-H3发布,并在Comfy-Org/MiniMax-H3有一个ComfyUI重新打包的镜像。ComfyUI在同一天就提供了原生支持。 - 这不是一个文件。有两个特定任务的检查点:
fl2va(文本和图像驱动)和ref2va(参考驱动),它们的最小版本各为21 GB。你只需要下载你的任务所需的那一个。 - 33B密集单流Transformer。最小可用组合是42.5 GB,比全精度的123.6 GB减少了66%。ComfyUI表示12 GB显卡配合卸载可以运行。
- 本地生成原生为短边768px,而非2K。2K需要通过第二次上下文内再生(regeneration)过程获得。
- 商业使用免费,但你必须在UI中显示“MiniMax H3”,并且年收入超过2000万美元时需要单独的书面授权。此外,许可证的适用区域(Applicable Territory)排除了欧盟、英国、韩国和美国。托管的API则属于不同的法律关系。
一个人物,两个检查点,同一个凌晨3点。左侧是fl2va的功能,右侧是ref2va的功能。同一个人,同一个房间,同一个夜晚,两种完全不同的任务,而你所听到的风扇声是与画面在同一遍过程中生成的。

左:图像到视频,这是fl2va检查点的工作。右:参考到视频,这是ref2va检查点的工作。两者均在MiniMax H3上渲染,原生立体声。请打开声音。
我让这个模型生成的第一件事就是一个人正在等待这个模型下载完成。感觉挺合适的。
权衡MiniMax H3开源权重:两个检查点与42.5 GB的下限
这就是这次发布引起轰动的原因。Artificial Analysis将H3评为视频编辑领域第一名,并在文本到视频和图像到视频领域均位列前三,并表示发布权重“将使其成为迄今为止遥遥领先的最强开源权重模型”(Artificial Analysis,2026年7月)。这是一个前沿级别的视频模型,并且提供了下载按钮。
诚实的另一面是:同样的基准测试显示,H3在文本到视频方面落后于Google的Gemini Omni Flash,在图像到视频方面也落后于Seedance 2.0和Gemini Omni Flash(南华早报,2026年7月)。它在编辑方面是第一,但并非在所有方面都是第一。
现在来看几乎没人在运行git clone之前检查过的那部分。
没有出现在任何头条新闻里的参数数量。 模型卡将H3-Omni-Transformer描述为“一个33B参数的密集单流Transformer,其中大约13B参数位于AdaLN相关分支中”,并补充说,由于这些调制输出可以预先计算和缓存,“这些参数在仅推理部署中不需要加载。”这就是精简检查点的来源。当你只进行推理时,模型的大约40%变成了一个查找表。
大多数人在哪里白白浪费80 GB。 官方的MiniMaxAI/MiniMax-H3仓库如果全部拉取是498 GB。ComfyUI镜像有343 GB。两者都包含了两个检查点的每一种精度变体。你只需要四个文件,而不是四百个。
| 文件 | 大小 | 是什么 | 你需要的任务 |
|---|---|---|---|
| minimax_h3_fl2va_pruned_int8_convrot.safetensors | 20.97 GB | fl2va检查点,精简版 + int8 | 文本到视频,图像到视频 |
| minimax_h3_fl2va_int8_convrot.safetensors | 34.04 GB | fl2va,int8,未精简 | 相同任务,更高保真度 |
| minimax_h3_fl2va_bf16.safetensors | 66.28 GB | fl2va,全精度 | 微调,研究 |
| minimax_h3_ref2va_pruned_int8_convrot.safetensors | 20.97 GB | ref2va检查点,精简版 + int8 | 仅参考到视频 |
| minimax_h3_ref2va_int8_convrot.safetensors | 34.04 GB | ref2va,int8,未精简 | 相同任务,更高保真度 |
| minimax_h3_ref2va_bf16.safetensors | 66.28 GB | ref2va,全精度 | 微调,研究 |
| qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 15.69 GB | 文本编码器,4-bit AWQ | 每个工作流都需要 |
| qwen3vl_32b_minimax_h3_int8_convrot.safetensors | 27.14 GB | 文本编码器,int8 | 每个工作流都需要 |
| qwen3vl_32b_minimax_h3_bf16.safetensors | 51.51 GB | 文本编码器,全精度 | 每个工作流都需要 |
| minimax_h3_video_vae_fp16.safetensors | 5.21 GB | 视频VAE | 每个工作流都需要 |
| minimax_h3_audio_vae_fp32.safetensors | 0.61 GB | 音频VAE | 每个工作流都需要(这是声音) |
| 单个任务的最小工作集 | 42.5 GB | 精简版fl2va + nvfp4编码器 + 两个VAE | 实际的下载量 |
| 两个检查点,最小配置 | 63.4 GB | 加上精简版ref2va | 如果你想要所有三种模式 |
| 单个任务,全bf16 | 123.6 GB | 全部bf16 | 仅限研究级机器 |
文件大小直接从Comfy-Org/MiniMax-H3仓库索引读取,2026年8月。
ComfyUI对同一数字的表述是:“总内存占用减少66%,从全精度的123.6 GB降至42.5 GB”,这“使得下一代2K视频模型能够在RTX 3060等GPU上本地运行”(ComfyUI,2026年8月)。请将12 GB这个数字视为他们关于动态卸载的声明,而不是基准测试。我没有在3060上运行过它,卸载是用系统RAM换取显存,但会消耗更多时间。
“本地运行”有一个未被强调的含义:768px。 H3的原生画布短边为768px,上限为768x1344,根据ComfyUI的H3教程。时长以24fps下每块17帧的网格对齐。宣传材料中的2K片段来自H3-Regenerate-2K,这是一个第二遍过程,将768p的结果加上原始上下文重新输入模型。模型卡明确说明完整系统由三个模块组成:H3-Context-IR、H3-Base和H3-Regenerate-2K。本地的ComfyUI给你的是H3-Base。
而“开放”这个词在这里承担了三种不同的含义。 可下载,是的。可商业使用,有条件。可在你居住的地方运行,这取决于你住在哪里。Reddit上称其为“实际上是闭源模型”的帖子,在第一点上错了,但在另外两点上指出了真实情况。第7节包含了条款文本。
本地MiniMax H3开源权重 vs 托管API:选择你的路径
在这条线以下的所有内容,包括整个四步演示,都在Atlas Cloud的一个浏览器标签中运行,它提供了所有三个H3端点以及我用于基础帧的图像模型。这与运行权重不同,而这种区别对于这个模型来说比通常更重要。
| 本地权重 | 托管API | |
|---|---|---|
| 前期成本 | 42.5 GB下载,12 GB+ GPU,ComfyUI安装 | 一个API密钥 |
| 首次获得片段的时间 | 乐观估计,一个晚上 | 大约两分钟 |
| 每个5秒片段的成本 | GPU时间和电费 | 0.14美元/秒,即0.70美元 |
| 原生分辨率 | 短边768px,通过再生过程获得2K | 直接2K,这是唯一的枚举值 |
| 微调、LoRA、修改 | 可以,这正是它的意义所在 | 不可以 |
| 数据不离开你的网络 | 可以 | 不可以 |
| 许可证风险 | 你接受社区许可证及其地域条款 | 你是托管服务的客户 |
| 如果你在欧盟、英国、韩国或美国 | 第7节 | 不受权重许可证影响 |
经验法则:每月大约不到100个片段,或者你需要直接输出2K,或者你位于受限制地区,托管服务在每个方面都胜出。超过这个数量,或者你打算在检查点基础上进行训练,或者素材不能离开你的建筑,那么42.5 GB值得花一个晚上去下载。
价格从2026年8月的实时模型页面验证。所有H3端点按输出秒数计费,无活跃折扣。
| 模型 | 在此处的用途 | 价格 | 折扣 |
|---|---|---|---|
| MiniMax H3图像到视频 | 第2步,fl2va任务 | 2K分辨率下0.14美元/秒 | 无 |
| MiniMax H3参考到视频 | 第3步,ref2va任务 | 2K分辨率下0.14美元/秒 | 无 |
| MiniMax H3文本到视频 | 第4步,无参考基线 | 2K分辨率下0.14美元/秒 | 无 |
| GPT Image 2文本到图像 | 第1步,基础帧 | 列表价0.009美元/图像;我使用的高质量16:9运行报价为0.1745美元 | 无 |
| Seedance 2.0 / Wan 2.7 / Kling v3.0 Turbo | 每秒参考点 | 0.112美元/0.10美元/0.095美元每秒 | Kling 15% off |
在你编写代码之前,有一个不一致之处值得了解:H3的README仍然记录了0.10美元/秒的768p层级和5或10秒的时长。但实时模式与此不符。resolution只有一个允许的值2K,而duration接受从5到15的任何整数。请根据模式进行编码。这个差距存在一种有趣的对称性:托管端关闭了768p层级,而768p正是你自己运行权重时获得的原生画布。
第1步:使用GPT Image 2生成基础帧
本演示中的所有内容都始于一张静态图片。场景故意设置得很直白:一个开发者凌晨3点看着一个21 GB的检查点下载。
模型:openai/gpt-image-2/text-to-image。设置:质量high,比例16:9。
plaintext1一个逼真的广角镜头,拍摄凌晨3点凌乱的家庭办公室,仅由两台显示器和书桌上敞开式主机箱的RGB灯光照亮。一个疲惫的开发者穿着灰色连帽衫,懒散地坐在网布椅中,手托着下巴,盯着左边的显示器。左边显示器显示一个深色终端,有一个可见的下载进度条,大约在78%。右边显示器显示一个文件浏览器。书桌上放着一杯半满的冷咖啡、一个机械键盘和一个小台扇。他身后的窗户上雨水流淌。浅景深,35mm,温暖的显示器主光与冷色的窗户光形成对比,可见的胶片颗粒感。无文字叠加,无水印。
不要要求图像模型渲染实际的safetensors文件名。长下划线字符串会变得模糊不清。将文件名保留在你的描述中。

Atlas Cloud上的GPT Image 2工作台,输入了凌晨3点的提示词,输出面板中显示了已完成的基础帧
Atlas Cloud上的GPT Image 2:高质量,16:9,右侧渲染的基础帧。高质量层级的这次运行报价为0.1745美元,远高于0.009美元的列表价,因此请按层级预算。

生成的基础帧:凌晨3点,疲惫的开发者看着左边显示器上的下载进度条
第1步的输出。这一帧将用于第2步和第3步。
第2步:图像到视频,fl2va检查点的工作
这个端点对应的是minimax_h3_fl2va_pruned_int8_convrot.safetensors。输入第一帧,输出运动和声音。在本地,这是你要加载的文件;在托管端,这是一次API调用。
模型:minimax/h3/image-to-video。设置:image = 第1步的帧以data URL形式传递,resolution: 2K,duration: 5,ratio: 16:9。
plaintext1开发者保持静止,只有呼吸和眨眼,眼睛盯着左边的显示器。左边显示器上的进度条缓慢前进。机箱风扇加速旋转,RGB灯光变得更亮。在结束前一刻,他呼出一口气,肩膀沉了下来。锁定摄像机,无摄像机运动,无变焦,无切换。音频:低沉的风扇声逐渐升高,窗外隐约的雨声,最后一声轻柔的两音符完成提示音。
将图像作为base64 data URL传递,而不是新生成的存储URL。全新的对象URL可能无法通过上游下载检查。另外请注意,H3确实遵循了“锁定摄像机”的要求,这在这个类别的视频模型中并不普遍。

Atlas Cloud上的MiniMax H3图像到视频工作台,加载了基础帧,输出面板中有完成的2K片段
MiniMax H3图像到视频:加载基础帧,2K,运行完成。此截图使用了端点默认的8秒,因此报价显示为1.12美元。下面我嵌入的片段是5秒版本,价格为0.70美元。

fl2va任务:输入一帧,输出五秒的运动和立体声风扇声。
第3步:参考到视频,ref2va检查点的工作
不同的检查点,不同的文件,不同的任务。ref2va不是扩展第一帧。它接受参考素材,并构建一个新镜头,保持身份和物体的一致性。这就是为什么仓库提供了两个21 GB的文件,而不是一个。
我给了它两个参考:第1步的帧(用于人物和房间),以及一张显卡的微距照片(用于硬件)。
模型:minimax/h3/reference-to-video。设置:refers = 两张图片,resolution: 2K,duration: 8,ratio: 16:9。
plaintext1同一个人,同样的灰色连帽衫,同样的脸,在同一个黑暗的家庭办公室。新镜头:从侧面拍的中近景,他向后靠在椅子上,长舒一口气,嘴角微微上扬。第二张参考图片中的显卡清晰可见,位于他的肩膀后方,风扇正在减速,RGB灯光趋于稳定。保持他的身份、连帽衫、头发和房间照明与参考图像一致。锁定摄像机。音频:风扇声逐渐减弱,一次键盘按键声,雨声继续。
refers接受图像、视频和音频的混合数组,至少需要一张图像或视频。仅音频会被拒绝。此端点还接受最长15秒的时长。
这个端点有一个特别需要注意的陷阱:显式设置ratio。将其保留为adaptive会导致返回400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive',连续四次,包括在工作台明确附加了两个参考的情况下。在API调用中设置ratio: "16:9"后,第一次就成功了。这也是为什么下面的截图是参考图像而不是工作台截图:我无法将工作台的“宽高比”控件从adaptive切换出来,所以这里你看到的片段来自API,使用了上述设置,而不是来自工作台运行。

第二张参考图像:夜晚敞开的PC机箱内,一张三风扇显卡的微距照片
参考图像2,与基础帧在同一批次中生成,与第1步的帧一起传递。

ref2va任务:一个全新的视角,而非延续。同一个人,同样的连帽衫,同一个房间,参考2中的显卡现在出现在画面中,风扇正在减速。注意它对“中近景”的解释比较宽松,保持了相当宽的景别。
第4步:文本到视频,MiniMax H3开源权重的基线
同样的场景,用文字描述,没有任何参考。这一步的存在是为了向你展示这两个检查点真正的作用。
模型:minimax/h3/text-to-video。设置:ratio在此处必须设置,且不能为adaptive,因此设为16:9。resolution: 2K,duration: 5。
plaintext1凌晨3点,一个疲惫的开发者穿着灰色连帽衫,在凌乱的家庭办公室里,被两台显示器和敞开式主机箱的RGB灯光照亮,看着左边屏幕上的下载进度条缓慢爬升。他身后的窗户上雨水流淌。锁定摄像机,35mm镜头,浅景深,温暖的显示器光与冷色的窗户光形成对比,胶片颗粒感。音频:逐渐升高的风扇声,隐约的雨声,最后一声轻柔的完成提示音。

Atlas Cloud上的MiniMax H3文本到视频工作台,输入了提示词,输出面板中有完成的片段
MiniMax H3文本到视频:无参考素材,2K,宽高比设置为16:9,因为此处拒绝adaptive,运行完成。同样的提示词,但已经出现了与第2步中不同的面孔。

同样的文字,不同的人。房间不错,但人不对。这个差距正是fl2va和ref2va作为独立检查点存在的全部理由。
如果你编写脚本调用所有三个端点,有一个操作注意事项:上游的并发大约为一个任务。重叠的任务会返回429 rate limit exceeded (task concurrency)错误。请按顺序运行它们。一个5秒的2K片段每次大约需要两分钟。
MiniMax H3开源权重的成本,以及许可证实际说了什么
成本问题有两种货币形式。托管方面,一个5秒的2K片段是0.70美元,一个15秒的是2.10美元,按秒计费,无层级,无折扣。本地方面,货币是千兆字节和小时:下载42.5 GB,一张能容纳它的显卡,以及一个768p的画布,除非你也运行再生过程。每月超过几百个片段时,经济账就会翻转。低于这个数量,则基本无关紧要。
然后还有第三种货币,即法律审查时间。我阅读了整个LICENSE文件。以下是其中的内容。

台灯照亮着一台显示密集文本文档的笔记本电脑,旁边是荧光笔标注的打印件、老花镜和水杯
这是开源权重发布中,没有人会在发布帖中截取的那部分。
| 条款 | 章节 | 内容 | 对你的影响 |
|---|---|---|---|
| 适用区域(Applicable Territory) | I.3, I.5 | 全球范围,“排除受限制地区”,定义为“欧盟、英国、韩国和美国” | 社区许可证不授予你权利,而本文大部分读者都居住在这些地区 |
| 地域使用禁令 | V.4 | 你不得“在适用区域之外使用、复制、修改、分发或展示MiniMax H3作品或其任何输出或结果” | 它涉及输出内容,而不仅仅是权重 |
| 单独许可渠道 | II | MiniMax将“持续评估适用法律”,并邀请受限制地区的用户联系他们以获取许可 | 是“尚未”,而非“永不”。仓库中附有申请表格 |
| 署名要求 | IV.2 | 你“必须在任何使用它的商业产品的用户界面上显著显示‘MiniMax H3’” | 这是一个UI变更,而非脚注 |
| 营收门槛 | IV.1 | 年营收超过2000万美元时,你需要事先获得[email protected]的书面授权 | 免费商业使用有上限 |
| 禁止模型洗白 | V.3 | 你不得使用H3或其输出“来改进任何其他人工智能模型” | 排除了将知识蒸馏到你自己的模型中的可能性 |
| 再分发 | III.1, III.4 | 附带协议,包含NOTICE文件,标记修改过的文件 | 标准条款,但它也约束下游用户 |
| 文本编码器 | 附加说明 | 编码器是Qwen3-VL-32B,基于Apache 2.0许可证 | 堆栈中的一个组件是真正符合OSI标准的开源 |
| 管辖法律 | IX | 香港特别行政区法律,香港专属管辖权 | 值得在你的风险登记簿中记上一笔 |
协议生效日期为2026年8月2日(Hugging Face,2026年8月)。
大多数发布报道都只提到了“开源权重”就停住了。公平地说,MiniMax并没有隐藏这一点:仓库自带docs/QA-about-License.md文件,解释了视频模型面临的监管环境比文本模型变化更快,提到了欧盟AI法案、英国和韩国的规则,以及美国关于生成式视频的持续版权诉讼,并直截了当地指出“目前的限制意味着‘尚未’,而非‘永不’”。同一份文件确认了实际操作中最重要的分歧:API保持全球可用,因为MiniMax控制着服务基础设施,而开源权重则失去了这种控制。
所以,如果你在旧金山、柏林、伦敦或首尔,实际解读并非“你永远不能碰H3”。而是“这个特定的许可证不是让你在自己的机器上运行这些权重的工具”。申请单独的许可证,或者使用托管端点,在那里你是服务的客户,而不是权重的被许可方。
我不是律师,这不是法律建议。以上条款文本已引用,以便你的实际法律顾问可以在大约十分钟内阅读原文。
MiniMax H3开源权重:常见问题解答
MiniMax H3开源权重真的发布了吗?我在哪里下载?
是的,截至2026年8月初。两个地方。MiniMaxAI/MiniMax-H3是官方仓库,约498 GB,包含diffusers格式的流水线、两个Transformer、文本编码器、两个VAE、文档和可复现脚本。Comfy-Org/MiniMax-H3是重新打包的ComfyUI版本,总计约343 GB,包含大多数人实际想要的量化单文件检查点。如果你正在运行ComfyUI,请使用第二个,并下载四个文件。
MiniMax H3有多少参数?我需要超级计算机吗?
33B,密集单流Transformer。其中约13B位于AdaLN相关分支中,其输出可以预先计算和缓存,因此仅推理部署无需加载它们。这就是“精简”检查点的意义。不需要超级计算机。需要42.5 GB的下载和一块像样的消费级GPU。
我能在12 GB或16 GB显存上运行MiniMax H3开源权重吗?
ComfyUI团队表示,使用精简版int8 fl2va检查点加上nvfp4 AWQ文本编码器,12 GB显卡可以通过动态卸载运行。这是他们的说法,不是我运行的基准测试。两个注意事项:卸载用系统RAM换取显存,所以请准备好64 GB RAM并预计较长的渲染时间;而且你的本地画布是短边768px,而不是2K。
MiniMax H3开源权重真的是开源的吗,还是只是开源权重?
精确地说,是开源权重。权重可下载、可修改,这比一年前任何前沿视频模型提供的都要多。但许可证并非OSI批准,训练配方和数据未公开,商业使用带有署名和营收条件,地域条款限制了授权的适用地点。唯一真正开源的组件是Qwen3-VL-32B编码器,基于Apache 2.0。三个不同的层面,“开放”这个描述只清晰地适用于第一个层面。
我可以商业使用MiniMax H3开源权重吗?2000万美元的门槛是什么意思?
可以,但有两个条件。你必须在商业产品的用户界面上显著显示“MiniMax H3”(第IV.2节)。如果你的商业产品和服务年营收超过2000万美元,你需要在使用前获得MiniMax的单独书面授权,请求发送至[email protected](第IV.1节)。门槛是基于你的营收,而非你使用H3的规模。
为什么MiniMax H3许可证排除了美国和欧盟?我有哪些选择?
根据MiniMax自己的许可证问答,因为视频生成所处的监管环境比文本变化更快,特别是欧盟AI法案、不断发展的英国和韩国法规,以及美国关于生成式视频的活跃版权诉讼。一旦权重公开,他们无法在后续环节强制执行安全措施,因此他们限定了授权的范围,而不是推迟发布。在受限制地区的选择:通过仓库中的表格申请单独许可证,或者使用托管API,这是一种不同的法律关系,且保持全球可用。在部署前,请让你的法律顾问确认哪一种适合你。
核实于2026年8月3日。后续关注三件事:社区的GGUF和更低bit量化(目前H3尚无)、受限制地区列表的任何变更,以及README中仍记载的托管768p层级是否会恢复。






