Ejecutar MiniMax H3 en ComfyUI requiere un estricto cumplimiento de las reglas de la cuadrícula espacial y temporal para evitar errores de forma de tensor, exportaciones MP4 silenciosas o bloqueos del modelo. MiniMax H3 resuelve estos cuellos de botella sintetizando video 2K y audio estéreo sincronizado nativo en una sola pasada directa.
Conclusiones clave: Flujo de trabajo de MiniMax H3 en ComfyUI
- Paso multimodal nativo: MiniMax H3 sintetiza video 2K y audio estéreo de 32 kHz sincronizado directamente dentro de una sola pasada de difusión en ComfyUI.
- Umbral de hardware: Requiere un mínimo de 16 GB de VRAM para ejecución cuantizada INT8; se recomiendan 24 GB para renderizado nativo 2K.
- Regla de cuadrícula espacial: Las resoluciones del lienzo y los fotogramas clave deben ser estrictamente divisibles por 32, p. ej., 1344×768, para evitar errores de forma de tensor en el VAE espacial.
- Fórmula de cuadrícula temporal: Las duraciones de los clips deben cumplir con la ecuación Fotogramas totales = 17k + 5 (5, 22, 39, 56, 141 fotogramas a 24 fps) para evitar truncamiento latente.
- Optimización de velocidad: Compatible con un LoRA Turbo oficial de 8 pasos que reduce los tiempos de renderizado en ~60% con CFG fijado en 1.0.
Mientras que Texto a Video (T2V) se basa en una inicialización latente puramente impulsada por texto, Imagen a Video (I2V) ancla las trayectorias de movimiento usando nodos de condicionamiento first_frame, last_frame o MiniMaxH3AddGuide. Las siguientes secciones detallan la configuración completa del entorno, los diagramas de conexión de nodos y los protocolos de solución de problemas para ambas canalizaciones.
Requisitos previos esenciales y estructura de directorios del modelo
Colocar un codificador de texto de 32B en models/checkpoints en lugar de models/text_encoders hará que ComfyUI se congele durante la compilación del gráfico o falle con un KeyError poco útil. La mayoría de los fallos de configuración ocurren porque los archivos terminan en las subcarpetas incorrectas, o porque se sustituyen los pesos estándar de Qwen por el codificador de texto visual personalizado requerido por MiniMax H3.

Requisitos de compatibilidad del sistema
Antes de descargar los pesos del modelo, confirme que su instalación cumple con estas especificaciones básicas de hardware y entorno:
- Núcleo de ComfyUI: Versión v0.30.0 o superior.
- Nodos personalizados: ComfyUI-MiniMaxH3-Easy o el paquete oficial Comfy-Org.
- VRAM de GPU: 16 GB (mín. INT8) / 24 GB (rec. 2K).
- Pila de software: Python 3.10+ con PyTorch 2.4+ y CUDA 12.1+.
Matriz de ubicación de directorios del modelo
Descargue los pesos oficiales del modelo MiniMax H3 de código abierto desde el repositorio de modelos de Hugging Face y coloque cada archivo en su subcarpeta de destino designada.
| Categoría del modelo | Nombre exacto del archivo | Directorio de destino | Notas y precisión |
| Modelo de difusión (T2V/FL2V) | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | Modelo de difusión cuantizado INT8 principal |
| Modelo de difusión (Ref2V) | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | Requerido para gráficos de guía de referencia |
| Codificador de texto | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ | Pesos de visión-lenguaje personalizados de 4 bits |
| VAE de video | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ | Decodificador espacial visual FP16 |
| VAE de audio | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ | Decodificador acústico FP32 (evita recorte) |
| LoRA Turbo (Opcional) | minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors | ComfyUI/models/loras/ | Habilita inferencia rápida de 8 pasos |
Nota de instalación crítica
El archivo qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors es un codificador de texto-visión cuantizado AWQ de 4 bits personalizado (arquitectura Qwen3-VL) específicamente ajustado para el condicionamiento de indicaciones de MiniMax H3. No lo sustituya por transformadores de lenguaje estándar en la carpeta text_encoders, ya que los modelos de lenguaje genéricos carecen de la proyección visual multimodal necesaria para la generación latente de video.
Construcción del gráfico de nodos de Texto a Video (T2V) en ComfyUI
Construir un gráfico de nodos de Texto a Video (T2V) limpio en ComfyUI requiere enrutar las incrustaciones de texto, las configuraciones de resolución espacial y los tensores de fotogramas latentes en una secuencia lineal estricta.
Nota sobre paquetes de nodos: Los nombres de nodos utilizados en esta guía de flujo de trabajo, como MiniMaxH3TextToVideo y MiniMaxH3ImageToVideo, hacen referencia al paquete personalizado ComfyUI-MiniMaxH3-Easy. Si está utilizando el paquete oficial Comfy-Org, estas operaciones se dividen en nodos separados MiniMaxH3Sampler y MiniMaxH3Conditioning.
Guía de conexión de nodos T2V paso a paso

Configurar la generación latente T2V requiere aislar el condicionamiento de texto y los parámetros espaciales antes de ejecutar el paso del muestreador.
- Conexión del codificador de texto: Enrute su nodo de indicación de texto al cargador del codificador de texto visual Qwen3-VL. Pase el tensor de salida directamente al puerto de condicionamiento de indicación positiva del nodo MiniMaxH3TextToVideo.
- Cálculo de dimensión espacial: Conecte los valores de salida de ResolutionSelector a ImageScaleToTotalPixels. Este paso calcula la asignación de píxeles mientras impone dimensiones espaciales que permanecen divisibles por 32.
- Muestreador y generación latente: Enrute los pesos del modelo, los tensores de condicionamiento positivo y los parámetros de resolución directamente a MiniMaxH3TextToVideo para generar el latente de video en bruto.
- Decodificación VAE y exportación de video: Envíe el tensor latente a través de minimax_h3_video_vae_fp16 para decodificarlo, luego conecte el lote de fotogramas renderizados directamente a SaveVideo.
Matriz de enrutamiento de nodos T2V
Para construir este gráfico sin dependencias rotas, siga las conexiones de puertos de nodos exactas que se describen a continuación:
| Nodo de origen | Puerto de salida | Nodo de destino | Puerto de entrada | Función del flujo de trabajo |
| Codificador Qwen3-VL | CONDITIONING | MiniMaxH3TextToVideo | positive | Dirige la conexión del codificador de texto |
| ResolutionSelector | WIDTH / HEIGHT | ImageScaleToTotalPixels | width / height | Establece límites de relación de aspecto |
| ImageScaleToTotalPixels | IMAGE_BOUNDS | MiniMaxH3TextToVideo | resolution | Fija la cuadrícula espacial de 32 píxeles |
| MiniMaxH3TextToVideo | LATENT | VAEDecode | samples | Controla la generación latente T2V |
| VAEDecode | IMAGE | SaveVideo | pixels | Renderiza la salida de video MP4 final |
MiniMax H3 se basa casi por completo en indicaciones positivas detalladas analizadas por el modelo de visión-lenguaje Qwen3-VL, lo que significa que los nodos de condicionamiento negativo tradicionales añaden carga computacional innecesaria sin mejorar la calidad de salida. Conectar SaveVideo directamente al nodo de decodificación VAE de video asegura una representación MP4 adecuada a 24 fps sin fotogramas finales caídos.
Construcción del flujo de trabajo de Imagen a Video (I2V) y Primer/Último fotograma

Intentar animar un retrato estático o unir dos fotogramas clave a menudo resulta en una distorsión violenta del sujeto o en fallos inmediatos de forma de tensor cuando las imágenes de inicio y fin difieren incluso en unos pocos píxeles. Convertir una canalización de texto estándar en un flujo de trabajo de Imagen a Video (I2V) requiere reemplazar el nodo muestreador base y establecer canalizaciones de condicionamiento de imagen precisas a través de sus fotogramas inicial y final.
Interpolación de fotogramas clave y configuración de nodos
Para pasar de T2V a la generación de video de Primer-Último fotograma (FL2V), reemplace MiniMaxH3TextToVideo con MiniMaxH3ImageToVideo. Este nodo expone puertos de entrada dedicados para first_frame y last_frame, lo que le permite definir estados iniciales, estados finales o transiciones de morphing completas.
- Nodos LoadImage: Coloque dos nodos LoadImage en su lienzo para contener sus fotogramas clave inicial y de destino.
- Coincidencia de dimensiones: Enrute las salidas de imagen a través de GetImageSize para extraer las dimensiones de ancho y alto en bruto. Esto evita discrepancias en la cuadrícula espacial antes de que los tensores entren al muestreador.
- Condicionamiento de tensores: Conecte los tensores de píxeles procesados a first_frame para animación estándar de una sola imagen, o complete tanto first_frame como last_frame para ejecutar interpolación de fotogramas clave.
Matriz de conexión de nodos I2V y FL2V
| Nodo de origen | Puerto de salida | Nodo de destino | Puerto de entrada | Función de la canalización |
| LoadImage (Inicio) | IMAGE | MiniMaxH3ImageToVideo | first_frame | Establece el condicionamiento de imagen inicial |
| LoadImage (Fin) | IMAGE | MiniMaxH3ImageToVideo | last_frame | Establece el fotograma terminal para morphs FL2V |
| GetImageSize | WIDTH / HEIGHT | ResolutionSelector | width / height | Bloquea la relación de aspecto de entrada a múltiplos de 32 |
| Codificador Qwen3-VL | CONDITIONING | MiniMaxH3ImageToVideo | positive | Guía la trayectoria de movimiento mediante indicaciones de texto |
| MiniMaxH3ImageToVideo | LATENT | VAEDecode | samples | Envía latentes FL2V al VAE de video |
MiniMax H3 impone una paridad de dimensiones estricta entre las entradas de fotogramas clave. Ambos fotogramas clave deben coincidir con la resolución espacial exacta. Si first_frame y last_frame difieren en tamaño, el muestreo se detiene durante la inicialización latente. Enrute ambas imágenes a través del mismo nodo de escalado para garantizar dimensiones de píxel idénticas.
Guía de referencia avanzada con MiniMaxH3AddGuide
Los gráficos estándar de Imagen a Video solo controlan el primer y el último fotograma, dejando el movimiento intermedio sin anclar. El nodo MiniMaxH3AddGuide soluciona esto anclando imágenes de referencia, lotes de imágenes de múltiples fotogramas o pistas de audio en cualquier frame_idx específico a lo largo de la línea de tiempo de generación.
Capacidades principales de MiniMaxH3AddGuide
| Parámetro de entrada | Comportamiento de anclaje | Reglas de restricción |
| frame_idx | Especifica el índice de fotograma exacto de destino | Los valores negativos cuentan hacia atrás desde el final del video. |
| Imagen / Múltiples fotogramas | Bloquea la consistencia del personaje o el diseño de la escena | Los lotes de menos de 5 fotogramas usan la primera imagen; los lotes de 5+ se ajustan a longitudes de clip de $17k + 5$ (5, 22, 39). |
| Pista de audio | Alinea diálogos o efectos de sonido en el índice | Se recorta automáticamente a la duración restante del video. |
Cómo encadenar nodos de anclaje para la generación de video de referencia
Encadenar varios nodos MiniMaxH3AddGuide juntos permite la generación completa de video de referencia (R2V):
- Anclaje de personaje principal: Conecte su condicionamiento positivo en MiniMaxH3AddGuide con frame_idx establecido en 0 para bloquear la identidad del personaje al inicio.
- Fotograma clave de movimiento intermedio: Encadene un segundo nodo MiniMaxH3AddGuide, alimentando una imagen de fotograma clave en frame_idx 60 para forzar al personaje a alcanzar una pose específica a mitad de la escena.
- Acoplamiento de audio: Conecte una banda sonora de destino al puerto de entrada de audio y pase su audio_vae para sincronizar el sonido directamente en ese desplazamiento de la línea de tiempo.
Encadenar estas guías de condicionamiento mantiene la estabilidad temporal sin obligar al muestreador de difusión a reinicializar los latentes.
Integración de audio nativo sincronizado con enrutamiento VAE dual

Los creadores pasan horas alineando manualmente pistas de voz externas en software de edición de video, solo para enfrentarse a una deriva de sincronización labial antinatural o a un ruido ambiental de fondo desajustado. MiniMax H3 elimina la alineación de audio en posproducción al confiar en la generación multimodal verdadera, sintetizando fotogramas de video y sonido estéreo de 32 kHz juntos dentro de una sola pasada directa.
Arquitectura de la transmisión de paso único
A diferencia de las canalizaciones tradicionales que encadenan modelos distintos de texto a voz después del renderizado de video, MiniMax H3 procesa texto, imagen y señales temporales en un espacio latente unificado. Durante la fase de eliminación de ruido, SamplerCustomAdvanced genera una carga latente compuesta que contiene mapas de características visuales y acústicas. Esta síntesis conjunta garantiza una sincronización de diálogos precisa y una generación de efectos de sonido orgánica alineada con precisión con la acción en pantalla.
Decodificación VAE dual y configuración de nodos
Para transformar los latentes en bruto en medios reproducibles, el gráfico divide la salida en dos rutas de decodificación separadas antes de la multiplexación MP4.
| Componente del nodo | Activo del modelo / Precisión | Función | Destino de salida |
| Cargador VAE de video | minimax_h3_video_vae_fp16.safetensors | Decodifica latentes visuales en secuencias de fotogramas RGB | VAEDecode -> CreateVideo (Flujo de video) |
| Cargador VAE de audio | minimax_h3_audio_vae_fp32.safetensors | Decodifica latentes acústicos en señales de audio sin comprimir | VAEDecodeAudio -> CreateVideo (Flujo de audio) |
| Guardador de video | SaveVideo | Multiplexa los flujos de video y audio estéreo nativos | Archivo MP4 codificado |
Configuración técnica de nodos
- Cargar VAE duales: Agregue dos nodos VAELoader distintos a su lienzo. Apunte el primero a minimax_h3_video_vae_fp16.safetensors y el segundo a minimax_h3_audio_vae_fp32.safetensors.
- Ejecutar decodificación VAE dual: Enrute la salida latente visual del muestreador a VAEDecode y el fragmento latente de audio a VAEDecodeAudio. Mantener minimax_h3_audio_vae_fp32 en precisión FP32 evita artefactos de recorte y distorsión de frecuencia en las pistas de fondo.
- Multiplexar mediante SaveVideo: Alimente el tensor de imagen decodificado y la forma de onda de audio sin comprimir a CreateVideo o directamente a SaveVideo. El nodo maneja el empaquetado final del contenedor, escribiendo un archivo MP4 a 24 fps terminado con audio estéreo incorporado.
Esta configuración de flujo dual nativo ofrece una ejecución de audio con precisión de fase directamente dentro de ComfyUI sin necesidad de plugins de sincronización labial externos.
Matemáticas de resolución, restricciones de relación de aspecto y ajuste de cuadrícula de fotogramas
Ingresar una resolución estándar de 1920x1080 o establecer la duración de su clip en 60 fotogramas en ComfyUI bloqueará instantáneamente su cola de renderizado con un error de forma de tensor o dejará costuras de borde muy distorsionadas. MiniMax H3 impone límites matemáticos rígidos para las dimensiones espaciales y las duraciones de los clips porque su arquitectura VAE 3D comprime los latentes de video a través de bloques espaciales específicos y pasos temporales.
Dimensiones espaciales y ajustes preestablecidos de relación de aspecto
El VAE espacial reduce la resolución de las entradas por un factor de 32. Si el ancho o alto de destino no es un múltiplo estricto de 32, el muestreador de difusión falla durante las asignaciones de tensor de límite. El modelo apunta a un borde corto nativo de 768 px, equilibrando la fidelidad visual con su presupuesto de megapíxeles objetivo.
| Relación de aspecto | Dimensiones preestablecidas (px) | Verificación de divisibilidad | Orientación objetivo |
| 16:09 | 1344 x 768 | 1344 / 32 = 42, 768 / 32 = 24 | Paisaje panorámico |
| 9:16 | 768 x 1344 | 768 / 32 = 24, 1344 / 32 = 42 | Vertical móvil / UGC |
| 1:01 | 1024 x 1024 | 1024 / 32 = 32, 1024 / 32 = 32 | Cuadrado |
| 21:09 | 1536 x 672 | 1536 / 32 = 48, 672 / 32 = 21 | Ultraancho cinematográfico |
El uso de dimensiones de píxel no estándar obliga al VAE a rellenar o estirar los mapas de características, degradando los detalles de textura fina.
La regla de cuadrícula de fotogramas 17k + 5
El ajuste de la dimensión temporal sigue una fórmula igualmente rígida. Para mantenerse dentro de los límites de duración de video de MiniMax H3, la arquitectura procesa secuencias de video en fragmentos latentes de 17 fotogramas con una inicialización de cola de 5 fotogramas. Para evitar el truncamiento temporal o fallos silenciosos de decodificación VAE, cada renderizado debe satisfacer la ecuación de la cuadrícula de fotogramas 17k + 5, donde k representa un contador de pasos entero.

A una tasa de fotogramas de 24 fps estándar, esta matemática dicta duraciones temporales exactas:
- k = 0 (5 fotogramas): ~0.21 segundos (micro-movimiento o ráfaga estática)
- k = 1 (22 fotogramas): ~0.91 segundos (rebanada de acción rápida)
- k = 3 (56 fotogramas): ~2.33 segundos (secuencia de toma corta)
- k = 8 (141 fotogramas): ~5.87 segundos (límite de clip estándar completo)
Establecer un recuento objetivo en 60 obliga a ComfyUI a eliminar 4 fotogramas hasta 56 (k=3), desperdiciando cálculo de VRAM durante el muestreo. Siempre ajuste sus parámetros de nodo al límite de paso exacto de 17k + 5 antes de poner en cola un lote de generación.
Optimización de velocidad: Habilitación de la ejecución LoRA Turbo de 8 pasos
Pasar más de seis minutos esperando que se renderice un solo video de vista previa de 6 segundos hace que la iteración rápida de indicaciones sea casi imposible en GPU de consumo. La ejecución de muestreo estándar requiere de 20 a 30 pasos, creando un grave cuello de botella operativo al ajustar señales de movimiento, probar movimientos de cámara o evaluar transiciones de fotogramas clave.
Integración de los pesos de destilación Turbo
Integrar el archivo de pesos oficial minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 reduce los pases de muestreo a un flujo de trabajo de inferencia de 8 pasos. Este proceso de destilación logra una optimización significativa de la velocidad de generación sin comprometer la cohesión visual general.
Para configurar esta configuración de destilación en ComfyUI:
- Colocar pesos del modelo: Mueva minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors a su directorio ComfyUI/models/loras/.
- Conectar nodo LoraLoader: Enrute el tensor del modelo de difusión principal a través de un nodo LoraLoader antes de alimentar al muestreador. Establezca turbo_model_strength en 1.0.
- Ajustar conteo de pasos: Reduzca el parámetro de pasos en su nodo MiniMaxH3Sampler del estándar de 20 a exactamente 8.
- Bloquear escala CFG: Fuerce el parámetro de escala de guía libre de clasificador a 1.0 para evitar la sobresaturación.
Puntos de referencia de rendimiento: Ejecución estándar vs. Turbo
| Parámetro / Métrica de referencia | Canalización de muestreo estándar | Ejecución LoRA Turbo de 8 pasos |
| Conteo de pasos de inferencia | 20 a 30 pasos | 8 pasos |
| Tiempo de renderizado (RTX 4090, 2K) | ~380 segundos | ~145 segundos |
| Escala de guía CFG | 3.5 a 6.0 | Fijado en 1.0 (Destilado) |
| Uso principal en producción | Renderizados maestros finales | Previsualización rápida y maquetas de escena |
| Estabilidad temporal | Reconstrucción completa | Pequeño jitter de bordes en física de partículas compleja |
Al ejecutar minimax_h3_fl2v_turbo_8step, establecer CFG por encima de 1.0 fuerza pases de doble condicionamiento innecesarios, causando quemaduras de color extremas, explosiones de contraste y desgarro espacial en fotogramas de alto movimiento. Activar turbo_mode con una fuerza LoRA Turbo fija de 1.0 permite a los creadores validar movimientos de cámara complejos en menos de tres minutos antes de comprometerse con renderizados de producción completos de 20 pasos.
Solución de problemas comunes de errores en el gráfico de MiniMax H3 en ComfyUI
La mayoría de los fallos operativos en los gráficos de MiniMax H3 se deben a pequeñas discrepancias de alineación de tensores, decodificadores de audio desvinculados o cuellos de botella de memoria de GPU durante la carga del modelo.
Guía de diagnóstico y soluciones rápidas
-
CUDA Fuera de Memoria (OOM)
- Causa principal: Cargar el codificador de texto de 32B junto con pesos de difusión int8 en GPU de 16 GB de VRAM sin descarga de memoria.
- Solución paso a paso: Agregue las banderas de inicio --lowvram o --medvram a su script de inicio de ComfyUI. Para configuraciones de memoria de GPU ajustadas, considere ejecutar MiniMax H3 en ComfyUI con cuantización GGUF para reducir los requisitos de memoria base. Asegúrese de que qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors esté colocado estrictamente dentro de models/text_encoders/, permitiendo la descarga de VRAM entre el análisis de texto y los pases de muestreo.
-
Error de discrepancia de forma
- Causa principal: Los valores de ancho/alto personalizados o las imágenes de fotogramas clave de entrada violan la cuadrícula de divisibilidad espacial requerida de 32 píxeles.
- Solución paso a paso: Inserte un nodo ResolutionSelector o ImageScaleToTotalPixels antes del muestreador para forzar todas las dimensiones del lienzo y la imagen al múltiplo de 32 más cercano.
-
Falta de pista de audio en la exportación
- Causa principal: La ruta del VAE de audio está desvinculada o omitida durante la ejecución del gráfico.
- Solución paso a paso: Conecte minimax_h3_audio_vae_fp32 en el nodo VAEDecodeAudio, luego conecte los latentes de audio decodificados en el puerto de audio del nodo SaveVideo junto con el flujo de video.
-
Fallo del nodo GetImageSize
- Causa principal: Relaciones de aspecto de fotogramas clave no coincidentes o lotes de imágenes de múltiples fotogramas no válidos alimentados a las entradas del muestreador I2V.
- Solución paso a paso: Ejecute las imágenes inicial y terminal a través de un nodo ImageScaleToTotalPixels unificado para bloquear los fotogramas clave a dimensiones idénticas antes de la inicialización latente.
-
Advertencia de nodos faltantes en ComfyUI Manager
- Causa principal: Los paquetes de nodos personalizados requeridos de MiniMax H3 no están indexados o faltan en el entorno local.
- Solución paso a paso: Abra ComfyUI Manager, seleccione Instalar nodos personalizados faltantes, busque ComfyUI-MiniMaxH3-Easy, haga clic en Instalar y reinicie ComfyUI.
Resolución de caídas de memoria y conflictos de registro de nodos
Muchos tutoriales omiten cómo ComfyUI administra la asignación de VRAM en generaciones consecutivas. Si experimenta un error repentino de CUDA Fuera de Memoria en un segundo o tercer intento de renderizado a pesar de un pase inicial exitoso, ComfyUI ha retenido el codificador de texto en VRAM. Establecer banderas de descarga explícitas en su script de inicio libera la memoria asignada entre los pasos del muestreador.
Al abrir archivos JSON de la comunidad, las advertencias de nodos faltantes en ComfyUI Manager generalmente indican registros de nodos desactualizados. Instalar ComfyUI-MiniMaxH3-Easy soluciona estas dependencias faltantes directamente. Para canalizaciones I2V, resolver un fallo de GetImageSize o un error de discrepancia de forma requiere asegurarse de que tanto las imágenes de fotogramas clave inicial como terminal coincidan con los límites de píxel objetivo.







