仅限两周 | Seedream 5.0 Pro 立享 8 折!

MiniMax H3 开源权重:你不需要超级计算机。你可能需要律师。

MiniMax H3 开源权重已发布:33B 参数,最低下载量 42.5 GB,两个检查点,许可证的地域条款排除美国、欧盟、英国和韩国。

所有 Atlas Cloud 链接的 UTM 基准: ?utm_source=blog&utm_medium=article&utm_campaign=minimax-h3-open-source-weights


MiniMax H3 开源权重:你不需要超级计算机。你可能需要律师。

木桌上的笔记本电脑和发光的台式电脑

凌晨 3 点的书桌,敞开的机箱,外接硬盘,显示器上显示着大型下载进度条

权重已发布。所以,在讨论其他内容之前,先回答 MiniMax 发布帖下回复最多的两个问题。

不,你不需要超级计算机。选对文件,下载量是 42.5 GB,而不是 123.6 GB。该模型有 33B 参数,其中大约 13B 位于 AdaLN 调制分支中,推理时甚至不需要加载。

然后我打开了 LICENSE 文件。第 10 行,在我看到 2000 万美元收入条款之前,是一个国家列表。我的国家在列表上。你的可能也在。

关键要点

  • MiniMax H3 开源权重已在 Hugging Face 上发布,名称为 MiniMaxAI/MiniMax-H3,以及 ComfyUI 打包的镜像 Comfy-Org/MiniMax-H3。ComfyUI 在同一天提供了原生支持。
  • 这不是一个文件。有两个任务特定检查点fl2va(文本和图像驱动)和 ref2va(参考驱动),最小格式各 21 GB。你只需下载你的任务所需的那一个。
  • 33B 密集单流 Transformer。最小可工作组合为 42.5 GB,比全精度的 123.6 GB 减少了 66%。ComfyUI 表示 12 GB 显卡加卸载可以运行。
  • 本地生成原生为短边 768px,而非 2K。2K 来自第二次上下文内重新生成过程。
  • 商业使用免费,但必须在 UI 中显示“MiniMax H3”,并且年收入超过 2000 万美元需要单独书面授权。此外,许可的适用区域排除欧盟、英国、韩国和美国。托管 API 是另一种法律关系。

一个角色,两个检查点,凌晨 3 点。左侧是 fl2va 的功能,右侧是 ref2va 的功能。同一个人,同一个房间,同一个夜晚,两个完全不同的任务,你听到的风扇噪音与画面在同一次生成中产生。

4. 细化草稿 9:

左:图像到视频,fl2va 检查点的工作。右:参考到视频,ref2va 检查点的工作。两者均使用 MiniMax H3 原生立体声渲染。打开声音。

我让这个模型生成的第一件事是一个正在等待该模型下载完成的人。感觉挺对。

MiniMax H3 开源权重,权衡:两个检查点与 42.5 GB 下限

以下是该版本引起轰动的原因。Artificial Analysis 将 H3 评为视频编辑第一名,并在文本到视频和图像到视频中均位列前三,并表示发布权重“将使其成为迄今为止遥遥领先的领先开源权重模型”(Artificial Analysis,2026 年 7 月)。这是一个前沿级别的视频模型,带有下载按钮。

诚实的另一面:同一基准测试中,H3 在文本到视频方面落后于 Google 的 Gemini Omni Flash,在图像到视频方面落后于 Seedance 2.0 和 Gemini Omni Flash(南华早报,2026 年 7 月)。它在编辑方面排名第一,但并非在所有方面都排名第一。

现在来说几乎没人点击 git clone 之前检查的部分。

没有出现在任何头条中的参数数量。 模型卡将 H3-Omni-Transformer 描述为“一个 33B 参数的密集单流 Transformer,其中约 13B 参数位于 AdaLN 相关分支中”,并补充说,由于这些调制输出可以预计算和缓存,因此“这些参数无需为仅推理部署加载”。这就是修剪过的检查点的来源。当你只进行推理时,大约 40% 的模型变成了查找表。

大多数人在哪里白白浪费了 80 GB。 官方 MiniMaxAI/MiniMax-H3 仓库如果全部拉取,大小为 498 GB。ComfyUI 镜像为 343 GB。两者都包含两个检查点的所有精度变体。你需要四个文件,而不是四百个。

文件大小是什么你需要它用于
minimax_h3_fl2va_pruned_int8_convrot.safetensors20.97 GBfl2va 检查点,修剪 + int8文本到视频、图像到视频
minimax_h3_fl2va_int8_convrot.safetensors34.04 GBfl2va,int8,未修剪相同,更高保真度
minimax_h3_fl2va_bf16.safetensors66.28 GBfl2va,全精度微调、研究
minimax_h3_ref2va_pruned_int8_convrot.safetensors20.97 GBref2va 检查点,修剪 + int8仅参考到视频
minimax_h3_ref2va_int8_convrot.safetensors34.04 GBref2va,int8,未修剪相同,更高保真度
minimax_h3_ref2va_bf16.safetensors66.28 GBref2va,全精度微调、研究
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15.69 GB文本编码器,4 位 AWQ每个工作流
qwen3vl_32b_minimax_h3_int8_convrot.safetensors27.14 GB文本编码器,int8每个工作流
qwen3vl_32b_minimax_h3_bf16.safetensors51.51 GB文本编码器,全精度每个工作流
minimax_h3_video_vae_fp16.safetensors5.21 GB视频 VAE每个工作流
minimax_h3_audio_vae_fp32.safetensors0.61 GB音频 VAE每个工作流(这是声音)
单个任务的最小工作集42.5 GB修剪的 fl2va + nvfp4 编码器 + 两个 VAE实际下载量
两个检查点,最小63.4 GB添加修剪的 ref2va如果你想要所有三种模式
单个任务,全 bf16123.6 GBbf16 一切仅限研究机器

文件大小直接来自 Comfy-Org/MiniMax-H3 仓库索引,2026 年 8 月。

ComfyUI 自己对同一数字的表述:“总内存占用减少 66%,从全精度的 123.6 GB 降至 42.5 GB”,这“使得下一代 2K 视频模型能够在 RTX 3060 等 GPU 上本地运行”(ComfyUI,2026 年 8 月)。将 12 GB 数字视为他们带有动态卸载的声明,而不是基准测试。我没有在 3060 上运行过,卸载会用系统 RAM 和挂钟时间换取 VRAM。

“本地运行”悄然意味着的另一件事:768px。 根据 ComfyUI 的 H3 教程,H3 的原生画布是短边 768px,上限为 768x1344。时长以 24fps 的 17 帧每块网格对齐。营销材料中的 2K 片段来自 H3-Regenerate-2K,这是一个第二次过程,将 768p 结果加上原始上下文反馈回模型。模型卡明确指出整个系统由三个模块组成:H3-Context-IR、H3-Base 和 H3-Regenerate-2K。本地 ComfyUI 提供的是 H3-Base。

而“开源”这个词在这里承担着三个不同的角色。 可下载,是的。可商业使用,有条件。可在你居住的地方运行,这取决于你住在哪里。Reddit 帖子称其为“实际上是闭源模型”,在第一个点上错了,但在另外两个点上指出了一个真实情况。第 7 节包含条款文本。

本地 MiniMax H3 开源权重 vs 托管 API:选择你的路径

此线以下的所有内容,整个四步演示,都在 Atlas Cloud 的一个浏览器标签页中运行,该站点提供所有三个 H3 端点以及我用于基础帧的图像模型。这与运行权重不同,而且对于这个模型,这种差异比往常更重要。

 本地权重托管 API
前期成本42.5 GB 下载,12 GB+ GPU,ComfyUI 安装API 密钥
首个片段的时间乐观估计一个晚上大约两分钟
每 5 秒片段的成本GPU 时间和电费0.70 美元,按 0.14 美元/秒
原生分辨率短边 768px,2K 通过重新生成过程2K 直接,它是唯一的枚举值
微调、LoRA、改动是的,这就是重点
数据永不离开你的网络
许可证风险你接受社区许可证及其区域条款你是托管服务的客户
如果你在欧盟、英国、韩国或美国第 7 节不受权重许可证影响

经验法则:每月大约低于 100 个片段,或者你需要直接输出 2K,或者你位于排除区域,托管在每个方面都胜出。高于此数量,或者你打算在检查点基础上进行训练,或者素材不能离开你的建筑,那么 42.5 GB 值得花一个晚上。

价格从实时模型页面验证,2026 年 8 月。所有 H3 端点按输出秒数计费,没有活跃折扣。

模型在这里的作用价格折扣
MiniMax H3 图像到视频步骤 2,fl2va 任务2K 分辨率下 0.14 美元/秒
MiniMax H3 参考到视频步骤 3,ref2va 任务2K 分辨率下 0.14 美元/秒
MiniMax H3 文本到视频步骤 4,无参考基线2K 分辨率下 0.14 美元/秒
GPT Image 2 文本到图像步骤 1,基础帧列出 0.009 美元/图像;我使用的高质量 16:9 运行报价 0.1745 美元
Seedance 2.0 / Wan 2.7 / Kling v3.0 Turbo每秒参考点0.112 美元 / 0.10 美元 / 0.095 美元每秒Kling 15% 折扣

在开始编写代码之前,有一个不一致之处值得了解:H3 自述文件仍然记录了 768p 层级,价格为 0.10 美元/秒,时长 5 或 10 秒。实时架构与此不同。resolution 只有一个允许的值 2Kduration 接受从 5 到 15 的任何整数。请根据架构编写。这个差距有一个巧妙的对称性:768p 层级在托管端已关闭,而 768p 正是你自己运行权重时获得的原生画布。

第 1 步:使用 GPT Image 2 生成基础帧

本演示中的所有内容都从一张静态图像开始。这个场景故意很直白:一个开发者在凌晨 3 点看着 21 GB 的检查点下载。

模型:openai/gpt-image-2/text-to-image。设置:质量 high,比例 16:9

plaintext
1一张照片级真实感的广角镜头,凌晨 3 点的杂乱家庭办公室,仅由两台显示器和一个书桌上敞开的机箱的 RGB 灯光照亮。一个疲惫的开发者穿着灰色连帽衫,懒散地坐在网眼椅上,手托着下巴,盯着左边的显示器。左边的显示器显示着一个深色终端,单一下载进度条大约在 78%。右边的显示器显示着一个文件浏览器。书桌上放着一杯冷了一半的咖啡、一个机械键盘和一个小台扇。雨痕划过他身后的窗户。浅景深,35mm,温暖的显示器主光与冷蓝色窗户光形成对比,可见传感器颗粒。没有文字叠加,没有水印。

不要要求图像模型渲染实际的 safetensors 文件名。长带下划线的字符串会变成一团糟。将文件名保留在你的描述中。

AI 图像生成器界面截图,包含输入和输出

Atlas Cloud 上的 GPT Image 2 工作台,输入了凌晨 3 点的提示词,输出面板中显示了完成的基础帧

Atlas Cloud 上的 GPT Image 2:质量高,16:9,右侧渲染了基础帧。高质量层级此次运行报价 0.1745 美元,远高于 0.009 美元的列表底线,因此按层级预算。

男子穿着连帽衫看着双电脑显示器上的加载条

生成的基础帧:凌晨 3 点疲惫的开发者看着左显示器上的下载条

第 1 步输出。此单帧馈入步骤 2 和 3。

第 2 步:图像到视频,fl2va 检查点的工作

这是对应于 minimax_h3_fl2va_pruned_int8_convrot.safetensors 的端点。输入一帧,输出运动和声音。在本地,这是你要加载的文件;在托管模式下,这是一个 API 调用。

模型:minimax/h3/image-to-video。设置:image = 第 1 步帧作为数据 URL 传递,resolution: 2Kduration: 5ratio: 16:9

plaintext
1开发者保持不动,只有呼吸和眨眼,眼睛盯着左边的显示器。左边显示器上的进度条缓慢前进。机箱风扇加速转动,其 RGB 灯光脉冲变亮。结束前片刻,他呼出一口气,肩膀放松下来。固定机位,无镜头移动,无变焦,无剪切。音频:低沉的机箱风扇噪音,音调升高,窗外微弱的雨声,接近结束时一声轻柔的两音完成提示音。

将图像作为 base64 数据 URL 传递,而不是新生成的存储 URL。全新的对象 URL 可能无法通过上游下载检查。另外请注意,H3 实际上遵循“固定机位”的要求,这在该类视频模型中并非普遍成立。

MiniMax 图像到视频生成器界面截图

Atlas Cloud 上的 MiniMax H3 图像到视频工作台,已加载基础帧,输出面板中有完成的 2K 片段

MiniMax H3 图像到视频:已加载基础帧,2K,运行完成。此截图使用了端点默认的 8 秒时长,因此报价为 1.12 美元。我嵌入的下面是 5 秒版本,价格为 0.70 美元。

紧张的人坐在书桌前等待电脑进度条

fl2va 任务:输入一帧,输出五秒运动加上立体声风扇噪音。

第 3 步:参考到视频,ref2va 检查点的工作

不同的检查点,不同的文件,不同的任务。ref2va 不会扩展第一帧。它接受参考材料并构建一个新的镜头,保持身份和对象的一致性。这就是为什么仓库提供两个 21 GB 文件而不是一个的原因。

我给了它两个参考:第 1 步帧用于人物和房间,以及一张显卡的微距照片用于硬件。

模型:minimax/h3/reference-to-video。设置:refers = 两张图像,resolution: 2Kduration: 8ratio: 16:9

plaintext
1同一个人,同一件灰色连帽衫,同一张脸,在同一个黑暗的家庭办公室。新镜头:从侧面中近景,他向后靠在椅子上,长长地呼出一口气,嘴角微微上扬。第二张参考图像中的显卡在他肩膀上方可见,风扇正在减速,RGB 灯光稳定成一种颜色。保持其身份、连帽衫、头发和房间的灯光与参考图像一致。固定机位。音频:风扇噪音逐渐减弱,一次键盘按键声,雨声继续。

refers 接受图像、视频和音频的混合数组,至少一张图像或视频。仅音频会被拒绝。此端点也接受最长 15 秒的时长。

此端点的一个陷阱:明确设置 ratio。保留为 adaptive 时会返回 400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive',连续四次,包括在明确附加了两个参考的工作台中也是如此。在 API 调用中使用 ratio: "16:9" 后,第一次就成功了。这也是为什么下面的截图是参考图像而不是工作台截图:我无法将工作台的长宽比控制从 adaptive 切换掉,所以你看到的片段来自 API,使用了上述设置,而不是工作台运行。

垂直安装的显卡,带有三个风扇,在机箱内部

第二张参考图像:夜间敞开机箱内三风扇显卡的微距照片

参考图像 2,与基础帧在同一批次中生成,与第 1 步帧一起传递。

男子穿着连帽衫在夜间使用双电脑显示器工作

ref2va 任务:一个全新的镜头,而不是延续。同一个人,同一件连帽衫,同一个房间,来自参考 2 的显卡现在出现在画面中,风扇正在减速。注意它松散地解释了“中近景”,保持得相当宽。

第 4 步:文本到视频,MiniMax H3 开源权重基线

相同的场景,用文字描述,没有参考。此步骤旨在向你展示两个检查点实际上用于什么。

模型:minimax/h3/text-to-video。设置:ratio 在此处是必需的,不能是 adaptive,因此 16:9resolution: 2Kduration: 5

plaintext
1凌晨 3 点,一个疲惫的开发者穿着灰色连帽衫在杂乱的家庭办公室,由两台显示器和敞开的机箱的 RGB 灯光照亮,看着下载进度条在左屏幕上缓慢移动。雨后窗外的窗户。固定机位 35mm 镜头,浅景深,温暖显示器光与冷窗户光形成对比,胶片颗粒。音频:上升的机箱风扇噪音,微弱的雨声,结束时轻柔的完成提示音。

MiniMax 文本到视频 AI 界面,显示提示词和生成的视频

Atlas Cloud 上的 MiniMax H3 文本到视频工作台,输入了提示词,输出面板中显示了完成的片段

MiniMax H3 文本到视频:无参考材料,2K,长宽比设置为 16:9,因为此处拒绝 adaptive,运行完成。相同的提示词,但已经与第 2 步中的人脸不同。

男子穿着灰色连帽衫盯着发光的电脑屏幕

相同的文字,不同的人。不错的房间,错误的人。这个差距正是 fl2varef2va 作为单独检查点存在的全部理由。

如果你脚本化所有三个,一个操作注意事项:上游并发大约为一个任务。重叠的作业会返回 429 rate limit exceeded (task concurrency)。请串行运行它们。一个 5 秒的 2K 片段每次大约需要两分钟。

MiniMax H3 开源权重需要多少成本,以及许可证实际说了什么

成本问题有两种货币。托管模式下,一个 5 秒的 2K 片段是 0.70 美元,一个 15 秒的是 2.10 美元,按秒计费,没有层级,没有折扣。本地模式下,货币是吉字节和小时:42.5 GB 下载,一张能容纳它的显卡,以及 768p 画布,除非你也运行重新生成过程。每月数百个片段以上,计算方式会翻转。低于此数量,基本不需要关心。

然后是第三种货币,即法律审查时间。我阅读了整个 LICENSE。以下是内容。

台灯照亮了显示密集文本文档的笔记本电脑,旁边是重点打印件、老花镜和一杯水

台灯照亮了显示密集文本文档的笔记本电脑,旁边是重点打印件、老花镜和一杯水

开源权重发布中没有人会在发布帖中截图的部分。

条款章节内容对你意味着什么
适用区域I.3, I.5全球范围,“排除区域除外”,定义为“欧盟、英国、大韩民国和美利坚合众国”社区许可证不授予你权利,而本文大多数读者居住在这些区域
区域使用禁令V.4你不得“在适用区域之外使用、复制、修改、分发或展示 MiniMax H3 作品或其任何输出或结果”它影响到输出,而不仅仅是权重
单独许可渠道IIMiniMax 将“持续评估适用法律”,并邀请排除区域的各方联系他们获取许可是“尚未”,而不是“永不”。仓库中附带申请表
署名IV.2在任何使用它的商业产品中,你“必须在用户界面上显著显示‘MiniMax H3’”UI 更改,而非脚注
收入门槛IV.1年收入超过 2000 万美元,你需要从 [email protected] 获得事先书面授权免费商业使用有上限
禁止模型清洗V.3你不得使用 H3 或其输出“改进任何其他人工智能模型”排除蒸馏到你自己的模型
再分发III.1, III.4随附协议,包含 NOTICE 文件,标记修改过的文件标准,但也会约束下游用户
文本编码器附加说明编码器是 Qwen3-VL-32B,基于 Apache 2.0堆栈中有一个组件是真正 OSI 开放的
管辖法律IX香港特别行政区法律,香港专属管辖权值得在你的风险登记册中记一笔

协议生效日期为 2026 年 8 月 2 日(Hugging Face,2026 年 8 月)。

大多数发布报道以“开源权重”开头,然后就此打住。值得称赞的是,MiniMax 并没有隐藏它:仓库附带了自己的 docs/QA-about-License.md,解释视频模型面临的监管环境比文本模型更快变化,提到了欧盟 AI 法案、英国和韩国的规则,以及正在进行的美国关于生成式视频的版权诉讼,并明确说明“目前的限制意味着‘尚未’,而不是‘永不’”。同一份文件确认了操作上重要的划分:API 保持全球可用,因为 MiniMax 控制服务基础设施,而开源权重则放弃了这种控制。

所以,如果你在旧金山、柏林、伦敦或首尔,实际的解读不是“你永远不能碰 H3”。而是“这个特定的许可证不是让你在自己机器上运行这些权重的工具”。申请单独的许可证,或者使用托管端点,在那里你是服务的客户,而不是权重的被许可人。

我不是律师,这不是法律建议。上述条款文本已引用,你的实际法律顾问可以在大约十分钟内阅读原文。

MiniMax H3 开源权重:常见问题解答

MiniMax H3 开源权重真的发布了吗?我在哪里下载?

是的,截至 2026 年 8 月初。两个地方。MiniMaxAI/MiniMax-H3 是官方仓库,大约 498 GB,包含 diffusers 格式的管道、两个 transformer、文本编码器、两个 VAE、文档和可重现脚本。Comfy-Org/MiniMax-H3 是打包的 ComfyUI 构建,总共约 343 GB,包含大多数人实际想要的量化单文件检查点。如果你正在运行 ComfyUI,请使用第二个并下载四个文件。

MiniMax H3 有多少参数?我需要超级计算机吗?

33B,密集单流 Transformer。其中大约 13B 位于 AdaLN 相关分支中,其输出可以预计算和缓存,因此仅推理部署无需加载它们。这就是“修剪”检查点所指的内容。不需要超级计算机。42.5 GB 下载和一块严肃的消费级 GPU。

我能在 12 GB 或 16 GB 的 VRAM 上运行 MiniMax H3 开源权重吗?

ComfyUI 团队表示,使用修剪过的 int8 fl2va 检查点加上 nvfp4 AWQ 文本编码器,12 GB 显卡可以通过动态卸载运行。这是他们的声明,不是我运行的基准测试。两个注意事项:卸载用系统 RAM 换取 VRAM,因此请预算 64 GB RAM 并预期较长的渲染时间,并且你的本地画布是短边 768px,而不是 2K。

MiniMax H3 开源权重真的是开源的吗?还是仅仅是开源权重?

精确地说,是开源权重。权重可下载且可修改,这比一年前任何前沿视频模型提供的都要多。但许可证未经 OSI 批准,训练配方和数据未发布,商业使用带有署名和收入条件,并且区域条款限制了授权的适用范围。唯一真正开源的部分是 Qwen3-VL-32B 编码器,基于 Apache 2.0。三个不同的层面,“开源”仅清晰地描述了第一个。

我可以商业使用 MiniMax H3 开源权重吗?2000 万美元的线是什么意思?

可以,有两个条件。你必须在商业产品的用户界面上显著显示“MiniMax H3”(第 IV.2 节)。如果你的商业产品和服务年收入超过 2000 万美元,你需要在使用前获得 MiniMax 的单独事先书面授权,请求发送至 [email protected](第 IV.1 节)。门槛是你的收入,而不是你的 H3 使用量。

为什么 MiniMax H3 许可证排除美国和欧盟?我的选择是什么?

根据 MiniMax 自己的许可证问答,因为视频生成处于比文本更快的监管环境中,特别是欧盟 AI 法案、不断发展的英国和韩国规则,以及正在进行的美国关于生成式视频的版权诉讼。一旦权重公开,他们无法在下游执行保障措施,因此他们限制了授权范围,而不是推迟发布。在排除区域的选择:通过仓库中的表格申请单独许可证,或者使用托管 API,这是一种不同的法律关系,并保持全球可用。让你的法律顾问确认哪一种适合你,然后再部署。


2026 年 8 月 3 日验证。后续清单上的三件事:社区 GGUF 和更低比特量化(H3 尚不存在)、排除区域列表的任何变化,以及自述文件中仍然记录的托管 768p 层级是否还会回来。

最新模型

一个 API,畅享全模态 AI。

探索全部模型