Seedance 2.5 现已上线 — 首发 Atlas Cloud

MiniMax H3 本地部署指南 2026:GGUF + ComfyUI 有效配置

MiniMax H3 本地指南:GGUF、ComfyUI 设置、VRAM 检查、工作流选择以及 Atlas Cloud 完成成本

MiniMax H3 本地运行指南 2026:GGUF + ComfyUI 有效设置

你下载了一堆GGUF文件。ComfyUI仍然显示空模型下拉菜单。然后运行开始,吃掉你的显存,并在预览应该出现时崩溃。

这就是**MiniMax H3 本地运行指南(GGUF + 本地 + ComfyUI)**搜索背后的真实痛点。简而言之:只有在通过许可、硬件和文件选择检查后,才能运行本地MiniMax H3。首先使用ComfyUI模板。从文本转视频或图像转视频测试开始,然后仅在需要额外控制时,才转向首帧-末帧或参考驱动的工作流。

如果视频片段对客户、启动页面或付费广告很重要,请在本地完成草稿,并在Atlas Cloud上完成最终成品。这可以避免将一个损坏的节点变成通宵的硬件仪式。

关键要点

  • 本地H3从ComfyUI 0.30.0+模板开始。
  • 文本/图像工作流和参考工作流使用不同的检查点家族。
  • GGUF有帮助,但显存仍然是瓶颈。
  • 从5秒、16:9、固定种子的测试开始。
  • 当硬件或地区风险较大时,使用云端完成。

显示红熊猫提示及其简单图形输出的图表

MiniMax H3 GGUF本地ComfyUI展示,红熊猫冒烟测试工作流及结果

展示:本地MiniMax H3 GGUF路径作为紧凑的ComfyUI SOP卡片,右侧为红熊猫冒烟测试结果。

MiniMax H3 本地运行:为何热门以及首次尝试为何失败

先给结论:MiniMax H3令人兴奋,因为它将文本、图像、视频和音频上下文融合到一个视频模型中。大多数失败的本地运行并不神秘。它们是文件不匹配、ComfyUI版本过旧、地区假设错误或内存不足。

MiniMax于2026年7月31日发布了H3,作为一款多模态生成模型,在官方托管工作流中支持原生立体音频和高达15秒的2K输出(MiniMax博客,2026年7月)。官方Hugging Face卡片将H3-Base列为330亿参数模型,并解释了H3编码器、视觉VAE和音频VAE的分割。

问题是:

为什么首次本地尝试感觉如此脆弱?

因为H3本地不是单个文件。你需要协调一个去噪器、一个Qwen3-VL文本编码器、视频VAE、音频VAE、工作流模板、节点支持、GPU内存、系统RAM和存储。一个错误文件夹可能看起来完全像是一个损坏的模型。

MiniMax H3故障排除表,列出症状、可能原因和修复方法

MiniMax H3本地故障映射图,显示症状、原因和修复方法

故障映射:症状、可能原因以及在归咎于模型之前的最快修复方法。

MiniMax H3 GGUF + ComfyUI 工作流概览

预览:本节在接触40GB下载之前为你提供决策树。

证据:Unsloth的GGUF卡片将标准文本/图像/首帧-末帧检查点家族与参考视频检查点家族分开,这种区分解释了大部分本地设置失败的原因(Unsloth GGUF,2026年8月)。

我们开始吧。

工作流任务本地文件家族最佳用途Atlas Cloud 备选方案
文本转视频仅提示词标准H3去噪器冒烟测试、氛围、环境MiniMax H3 文本转视频
图像转视频单张图像转视频标准H3去噪器产品展示、广告、社交钩子MiniMax H3 图像转视频
首帧和末帧起始帧加结束帧标准H3去噪器受控过渡Atlas 图像转视频(带结束帧)
参考转视频多个参考参考H3去噪器身份、风格、音频参考MiniMax H3 参考转视频
工作流选择本地 MiniMax H3 GGUFAtlas Cloud
设置时间长:文件、节点、显存检查短:一个浏览器标签页
硬件你的GPU、RAM、NVMe托管GPU
分辨率路径先草稿/调试最佳更适合2K交付
批量工作手动,除非脚本化对于重复的客户运行更容易
成本模型硬件加时间根据今天 models/all 上列出的 H3 视频端点,从 0.1 美元/秒起
最佳适用提示词调试和控制完成片段、团队交付、本地硬件较弱

本地并不更差。托管也不是魔法。它们解决工作流中不同阶段的问题。

步骤 1:MiniMax H3 许可和硬件检查

简要说明:在下载任何内容之前先执行此操作。官方H3许可包含区域条款,并且开放权重路线与托管/API路线不同。如果你在美国、欧盟、英国或韩国,不要将可下载文件视为自动允许本地部署的权限。申请授权或使用带有安全措施的托管路线。

将以下决策提示复制到你的笔记中:

Plain
1MiniMax H3 本地决策:
21. 我当前的国家/地区允许H3开放权重路线,或者我已获得书面授权。
32. 我有足够的磁盘空间用于去噪器、Qwen3-VL编码器、视频VAE、音频VAE和缓存。
43. 我可以从5秒、模板默认分辨率、固定种子和低量化级别开始。
54. 在草稿路径正常工作之前,我不会承诺本地2K输出。
65. 如果任何答案为否,我将使用托管H3工作流,而不是强行本地部署。

选择设置:

硬件起点预期
8 到 12 GB 显存Q2 或最小可用的社区量化级别仅实验
16 GB 显存Q2/Q3 或修剪后的GGUF最佳现实入门点
24 GB+ 显存如果完整工作流能加载,则为 Q4/Q5更好的本地测试
32 GB+ 显存更高质量实验仍不保证

许可和硬件检查表,用于下载MiniMax H3 GGUF

MiniMax H3 本地许可和硬件检查清单

步骤 1 完成:下载GGUF文件前的许可、显存、RAM和存储检查。

步骤 2:MiniMax H3 ComfyUI 模板设置

简要说明:首先更新ComfyUI,然后使用原生MiniMax H3模板。不要在首次运行时凭记忆构建图形。模板库 > 视频 > MiniMax H3 是更安全的路由,因为它以预期形状连接视频和音频组件。

复制此设置检查清单:

Plain
1ComfyUI MiniMax H3 设置:
2- 更新 ComfyUI 至 0.30.0 或更高版本。
3- 更新后重启 ComfyUI。
4- 打开 工作流 > 浏览模板 > 视频 > MiniMax H3。
5- 从文本转视频开始,然后再尝试图像转视频或参考转视频。
6- 如果使用GGUF,请安装所选模型卡片所需的GGUF加载器节点。

选择设置:

设置选择
ComfyUI 版本最新稳定版,最低 0.30.0
浏览器Chrome 或 Edge
首个工作流文本转视频
首个时长5秒
首个分辨率模板默认,之后再提高

ComfyUI MiniMax H3 模板路线、输入和测试表

MiniMax H3 ComfyUI 模板库 SOP 卡片

步骤 2 完成:MiniMax H3 文本转视频、图像转视频和参考转视频的模板路线。

步骤 3:MiniMax H3 GGUF 文件和文件夹

简要说明:下载正确的文件家族。通常你需要H3去噪器GGUF、Qwen3-VL文本编码器、视频VAE和音频VAE。文件夹名称因加载器而异,因此当模型卡片与博客文章冲突时,以模型卡片为准。

复制此文件映射:

Plain
1MiniMax H3 本地文件:
2- 文本/图像/首帧-末帧工作流:标准H3去噪器
3- 参考转视频 / 多参考工作流:参考H3去噪器
4- 共享:Qwen3-VL 32B 文本编码器
5- 共享:H3 视频 VAE
6- 共享:H3 音频 VAE
7- 文件夹规则:遵循你所安装的确切GGUF节点和模型卡片说明

选择设置:

文件用途常见文件夹所需工作流
标准H3去噪器GGUF标准文本/图像/首帧-末帧去噪器models/diffusion_models 或加载器特定文件夹文本转视频、图像转视频、首帧-末帧
参考H3去噪器GGUF参考驱动去噪器同一个去噪器文件夹参考转视频
qwen3vl_32b_minimax_h3-*.gguf文本编码器models/text_encoders 或加载器特定文件夹所有工作流
minimax_h3_video_vae_fp16.safetensors视频解码models/vae所有工作流
minimax_h3_audio_vae_fp32.safetensors音频解码models/vae原生音频路径

映射 MiniMax H3 文件到其用途和文件夹位置的表格

MiniMax H3 GGUF 文件和文件夹映射

步骤 3 完成:文件用途、文件夹目标以及每个文件防止的错误。

步骤 4:MiniMax H3 GGUF 文本转视频冒烟测试

简要说明:在尝试产品拍摄或参考密集剪辑之前,先运行一个很小的文本转视频任务。红熊猫提示很有用,因为它同时测试运动、毛发细节、薄雾和氛围,而不要求模型解决排版或身份问题。通过该测试后,添加一个高精度指令片段,检查H3能否在更长15秒的运行中保持主体、道具、位置和动作序列的一致性。

复制此提示:

Plain
1一只红熊猫在黎明薄雾笼罩的森林中,小心翼翼地沿着长满苔藓的倒木行走。柔和电影感光线,浅景深,毛茸茸上细小的水珠,轻轻转头看向镜头。镜头:缓慢侧跟,无切换。音频:宁静的森林环境,爪子在湿树皮上的轻柔声音,远处鸟鸣,无音乐。

选择设置:

设置
工作流文本转视频
检查点标准H3 GGUF去噪器
宽高比16:09
时长5秒
帧率如果暴露,则为24
步数模板默认,或对于快速Turbo LoRA测试为6到10
种子固定并记录下来

红熊猫冒烟测试输入工作流和输出检查点图

MiniMax H3 文本转视频红熊猫完成运行卡片

步骤 4 完成:文本转视频冒烟测试设置和预期成功信号。

红熊猫挂在树枝上的风格化插图

MiniMax H3 GGUF 红熊猫冒烟测试 GIF

案例 1 运动效果:红熊猫冒烟测试显示为静音GIF。完整的H3交付可能包含原生立体音频,但此嵌入特意静音。

下一个检查更严格。仅在基本冒烟测试通过后使用它,因为目标不再是"工作流渲染了吗?",而是"模型是否遵循多部分指令?" 在此片段中,观察雨夜便利店场景是否保持稳定,角色是否为同一个人,红色饮料罐是否在视觉上始终与后来的六罐装相关联,以及镜头变化是否感觉像一次连续动作而不是随机场景重置。

案例 1B 精度检查:一个15秒高精度指令样本,用于测试本地H3文本转视频管线稳定后的主体一致性、道具连续性、湿夜环境细节和动作执行。

步骤 5:MiniMax H3 本地图像转视频产品拍摄

简要说明:图像转视频是H3对增长团队有用的地方。廉价地锁定首帧,然后动画化它。对于包含可读包装或标签文本的首帧,在GPT Image 2 文本转图像上生成静态图像,或使用你自己的产品照片。

复制此首帧提示:

Plain
1一个高级半透明香水瓶放在深色湿石上,雨滴在玻璃上,细银标签上写着"H3 LOCAL TEST",柔和工作室背光,逼真产品摄影,16:9构图,为运动留出空间,无额外文字。

复制此H3图像转视频提示:

Plain
1香水瓶保持居中,同时雨珠慢慢滑下玻璃。柔和的边缘光从左到右扫过,薄雾在湿石上盘旋,银标签保持可读。镜头:微妙的30度环绕,无切换。音频:细腻的雨落在石头上,微弱的玻璃叮当声,无对话。

选择设置:

设置
首帧模型GPT Image 2, 高质量, 16:9
本地工作流图像转视频
检查点标准H3 GGUF去噪器
时长5秒
本地分辨率先使用模板默认
云端完成选项Atlas MiniMax H3 图像转视频, 2K, 5秒, 16:9

产品图像转视频工作流图,含输入和输出检查点

MiniMax H3 图像转视频产品拍摄完成工作流卡片

步骤 5 完成:产品图像转视频设置、首帧提示和云端完成选项。

标有 H3 LOCAL TEST 的玻璃香水瓶,带有雨滴

MiniMax H3 图像转视频香水产品 GIF

案例 2 运动效果:产品图像转视频变体,显示为静音工作流GIF。

步骤 6:ComfyUI 中的 MiniMax H3 首帧和末帧

简要说明:首帧-末帧是隐藏的工作流。当起始和结束状态都重要时,它比纯文本更强,例如白天到午夜、干净瓶子到结霜瓶子、或空店到营业店。

复制此首帧提示:

Plain
1一个狭窄的赛博朋克茶店门面,傍晚时分,湿路面,青色和琥珀色霓虹灯,门外一个纸灯笼,电影感逼真照片,16:9,无人,可读招牌文字"MOON TEA"。

复制此末帧提示:

Plain
1同一个狭窄的赛博朋克茶店门面,午夜雨后,湿路面反射更亮的青色和琥珀色霓虹灯,同一个纸灯笼发出更强光,电影感逼真照片,16:9,无人,可读招牌文字"MOON TEA"。

复制此H3首帧-末帧提示:

Plain
1将同一个门面从傍晚转变为午夜雨后。保留店铺几何结构和"MOON TEA"招牌。灯笼逐渐变亮,水坑反射加深,霓虹灯闪烁一次,薄雾穿过小巷。镜头:锁定三脚架拍摄,无变焦,无切换。音频:柔和的雨声,远处城市嗡嗡声,一声安静的霓虹灯嗡嗡声。

选择设置:

设置
工作流图像转视频(带可选结束帧),或如果暴露则为首帧-末帧模板
检查点标准H3 GGUF去噪器
时长5秒
宽高比16:09
种子固定

显示帧过渡输入工作流和输出检查点的图

MiniMax H3 首帧-末帧店面完成工作流卡片

步骤 6 完成:首帧、末帧、提示词以及首帧-末帧工作流的成功检查。

带有 MOON TEA 文字和波浪线的极简店面插图

MiniMax H3 首帧末帧店面 GIF

案例 3 运动效果:店面过渡计划显示为静音工作流GIF。

步骤 7:MiniMax H3 本地到 Atlas Cloud 完成

简要说明:这不是投降。这是生产卫生。如果本地草稿有效但最终成品需要2K、可预测交付或团队友好的浏览器工作流,则仅将保留的提示词移动到Atlas Cloud

复制此交接清单:

Plain
1本地到 Atlas H3 完成:
21. 保留最终提示词、种子记录、宽高比和时长。
32. 对于文本转视频,将提示词粘贴到 MiniMax H3 文本转视频。
43. 对于图像转视频,上传首帧并粘贴运动提示词。
54. 对于首帧-末帧过渡,如果页面暴露两个控件,则上传首帧和末帧。
65. 对于参考转视频,仅在连续性真正需要时上传参考图像、视频或音频。

选择设置:

资产本地设置Atlas 模型Atlas 设置变化什么保留什么
红熊猫文本转视频, 5秒minimax/h3/text-to-video如果需要则为2K托管渲染提示词, 宽高比
香水图像转视频, 首帧minimax/h3/image-to-video5秒, 16:9交付路径帧, 运动提示词
店面首帧-末帧H3 图像转视频路由5秒, 首帧和结束帧(如果可用)更少的本地维护起始/结束意图
角色参考参考转视频minimax/h3/reference-to-video上传参考浏览器工作流主题/风格目标

AI 视频生成器界面截图,显示一个编织骑士

Atlas Cloud MiniMax H3 图像转视频完成运行

步骤 7 完成:MiniMax H3 本地草稿的托管完成路线。

MiniMax H3 本地变体:文本、图像、帧和参考工作流

一旦冒烟测试通过,不要同时改变所有内容。每次运行只改变一个控制项。

使用文本转视频探索氛围。当产品形状、面部、包装或布局必须保留时,使用图像转视频。当起始和结束状态重要时,使用首帧-末帧工作流。当工作是图像、视频或音频参考之间的连续性时,使用参考转视频。

事实上,

这就是整个本地价值:受控调试。红熊猫测试运动,香水瓶测试产品可读性,店面测试状态转换。这三个案例比你用10个随机漂亮提示词学到的更多。

MiniMax H3 成本:本地硬件 vs Atlas Cloud 价格

本地并非免费。它只是以不同的单位向你收费:GPU折旧、SSD空间、下载时间、电费、驱动维护和失败的夜晚。

Atlas Cloud 在 models/all 上列出了三个 MiniMax H3 视频端点,截至2026年8月24日,价格为 0.1 美元/秒起。GPT Image 2 文本转图像的价格为 0.009 美元/张起,开发人员文本转图像层级显示为 0.004 美元/张起。将这些作为目录起始价格,然后在 playground 中确认确切的报价后再运行。

工作示例本地成本逻辑Atlas 基于目录低价的估算实际调用
5秒图像转视频产品剪辑硬件加一张首帧图像H3视频从0.50美元起,加图像成本适合云端完成的候选
15秒文本转视频概念长时间本地运行和更高失败成本从1.50美元起先测试短片段
三个5秒变体3个本地队列和手动看护从1.50美元起,如果需要加图像如果面向客户则值得云端

看看这个:

5秒的本地草稿可能很聪明。15秒的盲目本地运行是人们开始像欠钱一样跟GPU讨价还价的地方。

MiniMax H3 本地 GGUF 用户的法律说明

MiniMax H3 本地使用在成为技术问题之前首先是一个许可问题。官方模型卡片指向 MiniMax H3 社区许可,以及针对美国、欧盟、英国和韩国的许可申请路径。

所以是的,MiniMax H3 本地运行指南(GGUF + 本地 + ComfyUI)的答案部分很无聊:在商业使用之前验证当前许可。托管服务、API 访问和本地开放权重部署是不同的路线。

这不是法律建议。阅读当前许可并获取适当的审查以进行商业部署。

常见问题解答

我能否在本地使用 GGUF 运行 MiniMax H3?

可以,如果你的许可立场、硬件和文件设置都满足条件。从标准H3 GGUF去噪器、共享文本编码器、视频VAE、音频VAE以及一个简短的ComfyUI文本转视频模板运行开始。

我应该为 ComfyUI 下载哪个 MiniMax H3 GGUF?

对于文本转视频、图像转视频和首帧-末帧工作,使用标准H3去噪器。对于参考转视频,使用参考H3去噪器。将去噪器与所选模型卡片所需的 Qwen3-VL 文本编码器和 H3 VAE 配对。如果模型卡片使用内部标签命名文件,则将这些标签视为下载标识符,而不是面向读者的工作流名称。

MiniMax H3 首帧-末帧和参考转视频有什么区别?

首帧-末帧工作流使用文本加上零、一或两帧来控制过渡。参考转视频适用于更丰富的参考输入,例如多张图像、视频或音频参考。它们是不同的检查点路线,而不是在加载错误文件后可以随意切换的开关。

本地运行 MiniMax H3 需要多少显存?

将16GB显存视为低层级实验的现实入门点。24GB+ 更适合 Q4/Q5 风格测试。8到12GB可能只能运行狭窄的实验,系统RAM和NVMe速度仍然重要。

MiniMax H3 本地也会生成音频吗?

H3 家族围绕原生音频-视频输出构建。你的本地工作流是否能发出可用的音频,取决于音频 VAE 和工作流路径是否正确安装和连接。本文中的静音GIF仅是发布格式。

MiniMax H3 本地在美国、欧盟、英国或韩国合法吗?

不要假设。官方许可材料将这些地区标识为需要特别关注或授权才能使用开放权重本地部署。在下载、部署或商业使用输出之前,验证当前许可。

结论

MiniMax H3 本地工作最好被视为受控的生产测试,而不是一键安装。在下载大型GGUF文件之前,先检查许可、GPU内存、系统RAM、存储和当前的ComfyUI支持。

实用的路线很简单:使用官方ComfyUI模板,为工作选择正确的模型家族,运行一个短的文本转视频冒烟测试,然后在基本步骤通过后,再进入图像转视频或首帧-末帧工作流。保持每个测试小型化,一次只改变一个变量,并根据输出决定最终成品是保留在本地还是转移到 Atlas Cloud 以获得更可预测的完成。

最新模型

一个 API,畅享全模态 AI。

探索全部模型