Exécuter MiniMax H3 dans ComfyUI nécessite un respect strict des règles de grille spatiale et temporelle pour éviter les erreurs de forme de tenseur, les exportations MP4 silencieuses ou les plantages du modèle. MiniMax H3 résout ces goulots d’étranglement en synthétisant une vidéo 2K et un audio stéréo natif synchronisé en une seule passe avant.
Points clés : Workflow ComfyUI MiniMax H3
- Passe multimodale native : MiniMax H3 synthétise une vidéo 2K et un audio stéréo 32 kHz synchronisé directement au sein d’une seule passe de diffusion ComfyUI.
- Seuil matériel : Nécessite un minimum de 16 Go de VRAM pour une exécution quantifiée INT8, 24 Go recommandés pour le rendu natif 2K.
- Règle de grille spatiale : Les résolutions du canevas et des images clés doivent être strictement divisibles par 32, par exemple 1344×768, pour éviter les erreurs de forme du tenseur VAE spatial.
- Formule de grille temporelle : Les durées des clips doivent respecter l’équation Images totales = 17k + 5 (5, 22, 39, 56, 141 images à 24 ips) pour éviter la troncature latente.
- Optimisation de la vitesse : Prend en charge un Turbo LoRA officiel en 8 étapes pour réduire les temps de rendu d’environ 60 % avec CFG verrouillé à 1,0.
Alors que la Text-to-Video (T2V) repose sur une initialisation latente purement textuelle, l’Image-to-Video (I2V) ancre les trajectoires de mouvement à l’aide des nœuds de conditionnement first_frame, last_frame ou MiniMaxH3AddGuide. Les sections suivantes détaillent la configuration complète de l’environnement, les schémas de câblage des nœuds et les protocoles de dépannage pour les deux pipelines.
Prérequis essentiels et structure des répertoires des modèles
Placer un encodeur de texte 32B dans models/checkpoints au lieu de models/text_encoders fera geler ComfyUI lors de la compilation du graphe ou échouera avec une KeyError peu utile. La plupart des échecs de configuration surviennent parce que les fichiers se retrouvent dans les mauvais sous-dossiers, ou parce que les poids Qwen standard sont substitués à l’encodeur de texte visuel personnalisé requis par MiniMax H3.

Exigences de compatibilité système
Avant de télécharger les poids du modèle, vérifiez que votre installation répond à ces spécifications matérielles et environnementales de base :
- Noyau ComfyUI : Version v0.30.0 ou supérieure.
- Nœuds personnalisés : ComfyUI-MiniMaxH3-Easy ou le package officiel Comfy-Org.
- VRAM GPU : 16 Go (min INT8) / 24 Go (recommandé 2K).
- Pile logicielle : Python 3.10+ avec PyTorch 2.4+ et CUDA 12.1+.
Matrice de placement des répertoires des modèles
Téléchargez les poids officiels du modèle open-source MiniMax H3 depuis le dépôt de modèles Hugging Face et placez chaque fichier dans son sous-dossier cible désigné.
| Catégorie de modèle | Nom exact du fichier | Répertoire de destination | Notes et précision |
| Modèle de diffusion (T2V/FL2V) | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | Modèle de diffusion INT8 quantifié principal |
| Modèle de diffusion (Ref2V) | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | Requis pour les graphes de guidage par référence |
| Encodeur de texte | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ | Poids personnalisés vision-langage 4 bits |
| VAE vidéo | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ | Décodeur spatial visuel FP16 |
| VAE audio | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ | Décodeur acoustique FP32 (empêche l’écrêtage) |
| Turbo LoRA (optionnel) | minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors | ComfyUI/models/loras/ | Permet une inférence rapide en 8 étapes |
Note d’installation critique
Le fichier qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors est un encodeur texte-vision quantifié AWQ 4 bits personnalisé (architecture Qwen3-VL) spécifiquement affiné pour le conditionnement des invites de MiniMax H3. Ne le remplacez pas par des transformateurs de langage standard dans le dossier text_encoders, car les modèles de langage génériques manquent de la projection visuelle multimodale nécessaire à la génération vidéo latente.
Construction du graphe de nœuds Text-to-Video (T2V) dans ComfyUI
Construire un graphe de nœuds Text-to-Video (T2V) propre dans ComfyUI nécessite d’acheminer les embeddings de texte, les paramètres de résolution spatiale et les tenseurs d’images latentes dans une séquence linéaire stricte.
Note sur le package de nœuds : Les noms de nœuds utilisés tout au long de ce guide de workflow, tels que MiniMaxH3TextToVideo et MiniMaxH3ImageToVideo, font référence au package personnalisé ComfyUI-MiniMaxH3-Easy. Si vous utilisez le package officiel Comfy-Org, ces opérations sont divisées en nœuds séparés MiniMaxH3Sampler et MiniMaxH3Conditioning.
Guide de câblage des nœuds T2V étape par étape

La configuration de la génération latente T2V nécessite d’isoler le conditionnement textuel et les paramètres spatiaux avant d’exécuter la passe d’échantillonnage.
- Câblage de l’encodeur de texte : Acheminez votre nœud d’invite textuelle vers le chargeur d’encodeur de texte visuel Qwen3-VL. Passez le tenseur de sortie directement dans le port de conditionnement d’invite positive du nœud MiniMaxH3TextToVideo.
- Calcul des dimensions spatiales : Dirigez les valeurs de sortie de ResolutionSelector vers ImageScaleToTotalPixels. Cette étape calcule l’allocation des pixels tout en imposant des dimensions spatiales restant divisibles par 32.
- Échantillonneur et génération latente : Acheminez les poids du modèle, les tenseurs de conditionnement positifs et les paramètres de résolution directement dans MiniMaxH3TextToVideo pour générer le latent vidéo brut.
- Décodage VAE et exportation vidéo : Envoyez le tenseur latent via minimax_h3_video_vae_fp16 pour le décodage, puis dirigez le lot d’images rendues directement vers SaveVideo.
Matrice de routage des nœuds T2V
Pour construire ce graphe sans dépendances cassées, suivez les connexions de ports de nœuds exactes décrites ci-dessous :
| Nœud source | Port de sortie | Nœud cible | Port d’entrée | Fonction du workflow |
| Encodeur Qwen3-VL | CONDITIONING | MiniMaxH3TextToVideo | positive | Dirige le câblage de l’encodeur de texte |
| ResolutionSelector | WIDTH / HEIGHT | ImageScaleToTotalPixels | width / height | Définit les limites du rapport d’aspect |
| ImageScaleToTotalPixels | IMAGE_BOUNDS | MiniMaxH3TextToVideo | resolution | Fixe la grille spatiale de 32 pixels |
| MiniMaxH3TextToVideo | LATENT | VAEDecode | samples | Contrôle la génération latente T2V |
| VAEDecode | IMAGE | SaveVideo | pixels | Rend la sortie vidéo MP4 finale |
MiniMax H3 repose presque entièrement sur des invites positives détaillées analysées par le modèle vision-langage Qwen3-VL, ce qui signifie que les nœuds de conditionnement négatif traditionnels ajoutent une charge de calcul inutile sans améliorer la qualité de la sortie. Connecter SaveVideo directement au nœud de décodage VAE vidéo garantit un rendu MP4 correct à 24 ips sans perte d’images de fin.
Construction du workflow Image-to-Video (I2V) et Premier/Dernière image

Tenter d’animer un portrait statique ou de faire le pont entre deux images clés entraîne souvent une déformation violente du sujet ou un crash immédiat de la forme du tenseur lorsque vos images de début et de fin diffèrent ne serait-ce que de quelques pixels. Convertir un pipeline textuel standard en workflow Image-to-Video (I2V) nécessite de remplacer le nœud d’échantillonnage de base et d’établir des pipelines de conditionnement d’image précis sur vos images initiales et finales.
Interpolation d’images clés et configuration des nœuds
Pour passer de T2V à la génération vidéo First-Last-Frame (FL2V), remplacez MiniMaxH3TextToVideo par MiniMaxH3ImageToVideo. Ce nœud expose des ports d’entrée dédiés pour first_frame et last_frame, vous permettant de définir des états de départ, des états de fin ou des transitions de morphing complètes.
- Nœuds LoadImage : Placez deux nœuds LoadImage sur votre canevas pour contenir vos images clés initiale et cible.
- Appariement des dimensions : Acheminez les sorties d’image via GetImageSize pour extraire les dimensions brutes de largeur et de hauteur. Cela évite les décalages de grille spatiale avant que les tenseurs n’entrent dans l’échantillonneur.
- Conditionnement des tenseurs : Connectez les tenseurs de pixels traités à first_frame pour une animation standard à une seule image, ou remplissez à la fois first_frame et last_frame pour exécuter une interpolation d’images clés.
Matrice de connexion des nœuds I2V et FL2V
| Nœud source | Port de sortie | Nœud cible | Port d’entrée | Fonction du pipeline |
| LoadImage (Début) | IMAGE | MiniMaxH3ImageToVideo | first_frame | Établit le conditionnement initial de l’image |
| LoadImage (Fin) | IMAGE | MiniMaxH3ImageToVideo | last_frame | Définit l’image de fin pour les morphs FL2V |
| GetImageSize | WIDTH / HEIGHT | ResolutionSelector | width / height | Verrouille le rapport d’aspect d’entrée sur des multiples de 32 |
| Encodeur Qwen3-VL | CONDITIONING | MiniMaxH3ImageToVideo | positive | Guide la trajectoire de mouvement via des invites textuelles |
| MiniMaxH3ImageToVideo | LATENT | VAEDecode | samples | Envoie les latents FL2V à la VAE vidéo |
MiniMax H3 impose une parité stricte des dimensions entre les entrées d’images clés. Les deux images clés doivent correspondre exactement à la même résolution spatiale. Si first_frame et last_frame diffèrent en taille, l’échantillonnage s’arrête lors de l’initialisation latente. Acheminez les deux images via le même nœud de mise à l’échelle pour garantir des dimensions de pixels identiques.
Guidage avancé par référence avec MiniMaxH3AddGuide
Les graphes Image-to-Video standard ne contrôlent que la première et la dernière image, laissant le mouvement intermédiaire non ancré. Le nœud MiniMaxH3AddGuide résout ce problème en ancrant des images de référence, des lots d’images multi-images ou des pistes audio à n’importe quel frame_idx spécifique le long de la chronologie de génération.
Capacités principales de MiniMaxH3AddGuide
| Paramètre d’entrée | Comportement d’ancrage | Règles de contrainte |
| frame_idx | Spécifie l’index exact de l’image cible | Les valeurs négatives comptent à rebours à partir de la fin de la vidéo. |
| Image / Multi-images | Verrouille la cohérence du personnage ou la disposition de la scène | Les lots de moins de 5 images utilisent la première image ; les lots de 5+ images se fixent sur les longueurs de clip $17k + 5$ (5, 22, 39). |
| Piste audio | Aligne le dialogue ou les effets sonores à l’index | Se recadre automatiquement à la durée vidéo restante. |
Comment chaîner des nœuds d’ancrage pour la génération vidéo de référence
Chaîner plusieurs nœuds MiniMaxH3AddGuide ensemble permet la génération vidéo de référence complète (R2V) :
- Ancrage du personnage principal : Connectez votre conditionnement positif à MiniMaxH3AddGuide avec frame_idx défini sur 0 pour verrouiller l’identité du personnage au début.
- Image clé de mouvement à mi-séquence : Chaînez un second nœud MiniMaxH3AddGuide, en fournissant une image clé à frame_idx 60 pour forcer le personnage à adopter une pose spécifique au milieu de la scène.
- Couplage audio : Connectez une bande sonore cible au port d’entrée audio et passez votre audio_vae pour synchroniser le son directement à ce décalage temporel.
Chaîner ces guides de conditionnement maintient la stabilité temporelle sans forcer l’échantillonneur de diffusion à réinitialiser les latents.
Intégration de l’audio natif synchronisé avec le routage double VAE

Les créateurs passent régulièrement des heures à aligner manuellement des pistes vocales externes dans un logiciel de montage vidéo, pour ensuite faire face à une dérive de synchro labiale non naturelle ou à un bruit ambiant décalé. MiniMax H3 élimine l’alignement audio post-traitement en s’appuyant sur une véritable génération multimodale, synthétisant les images vidéo et le son stéréo 32 kHz ensemble en une seule passe avant.
Architecture du flux monophase
Contrairement aux pipelines traditionnels qui enchaînent des modèles texte-parole distincts après le rendu vidéo, MiniMax H3 traite les indices textuels, d’image et temporels dans un espace latent unifié. Pendant la phase de débruitage, SamplerCustomAdvanced produit une charge latente composite contenant à la fois des cartes de caractéristiques visuelles et acoustiques. Cette synthèse conjointe garantit une synchronisation précise du dialogue et une génération d’effets sonores organiques alignée précisément sur l’action à l’écran.
Décodage double VAE et configuration des nœuds
Pour transformer les latents bruts en médias lisibles, le graphe divise la sortie en deux chemins de décodage séparés avant le multiplexage MP4.
| Composant du nœud | Actif du modèle / Précision | Fonction | Destination de sortie |
| Chargeur VAE vidéo | minimax_h3_video_vae_fp16.safetensors | Décode les latents visuels en séquences d’images RVB | VAEDecode -> CreateVideo (Flux vidéo) |
| Chargeur VAE audio | minimax_h3_audio_vae_fp32.safetensors | Décode les latents acoustiques en signaux audio non compressés | VAEDecodeAudio -> CreateVideo (Flux audio) |
| Sauvegarde vidéo | SaveVideo | Multiplexe les flux vidéo et audio stéréo natifs | Fichier MP4 encodé |
Configuration technique des nœuds
- Charger les deux VAE : Ajoutez deux nœuds VAELoader distincts à votre canevas. Pointez le premier vers minimax_h3_video_vae_fp16.safetensors et le second vers minimax_h3_audio_vae_fp32.safetensors.
- Exécuter le décodage double VAE : Acheminez la sortie latente visuelle de l’échantillonneur vers VAEDecode et le morceau latent audio vers VAEDecodeAudio. Conserver minimax_h3_audio_vae_fp32 en précision FP32 empêche les artefacts d’écrêtage et la distorsion de fréquence dans les fonds sonores.
- Multiplexer via SaveVideo : Fournissez le tenseur d’image décodé et la forme d’onde audio non compressée à CreateVideo ou directement à SaveVideo. Le nœud gère l’assemblage final du conteneur, écrivant un fichier MP4 final à 24 ips avec audio stéréo intégré.
Cette configuration native à double flux garantit une exécution audio précise en phase directement dans ComfyUI, sans nécessiter de plugins de synchronisation labiale externes.
Mathématiques de résolution, contraintes de rapport d’aspect et alignement de la grille d’images
Saisir une résolution standard 1920x1080 ou définir la durée de votre clip à 60 images dans ComfyUI fera immédiatement planter votre file d’attente de rendu avec une erreur de forme de tenseur ou vous laissera avec des bords de couture fortement déformés. MiniMax H3 impose des limites mathématiques rigides pour les dimensions spatiales et les durées de clip car son architecture VAE 3D compresse les latents vidéo à travers des blocs spatiaux spécifiques et des pas temporels.
Dimensions spatiales et préréglages de rapport d’aspect
La VAE spatiale sous-échantillonne les entrées par un facteur de 32. Si votre largeur ou hauteur cible n’est pas un multiple strict de 32, l’échantillonneur de diffusion échoue lors des allocations de tenseurs de bordure. Le modèle cible un petit bord natif de 768px, équilibrant la fidélité visuelle par rapport à son budget mégapixel cible.
| Rapport d’aspect | Dimensions préréglées (Px) | Vérification de divisibilité | Orientation cible |
| 16:09 | 1344 x 768 | 1344 / 32 = 42, 768 / 32 = 24 | Paysage grand écran |
| 9:16 | 768 x 1344 | 768 / 32 = 24, 1344 / 32 = 42 | Vertical mobile / UGC |
| 1:01 | 1024 x 1024 | 1024 / 32 = 32, 1024 / 32 = 32 | Cadre carré |
| 21:09 | 1536 x 672 | 1536 / 32 = 48, 672 / 32 = 21 | Ultra-large cinématographique |
Utiliser des dimensions de pixels non standard force la VAE à remplir ou étirer les cartes de caractéristiques, dégradant les détails de texture fins.
La règle de grille d’images 17k + 5
L’alignement des dimensions temporelles suit une formule tout aussi rigide. Pour rester dans les limites de longueur vidéo de MiniMax H3, l’architecture traite les séquences vidéo en morceaux latents de 17 images avec une initialisation de queue de 5 images. Pour éviter la troncature temporelle ou les plantages silencieux du décodage VAE, chaque rendu doit satisfaire l’équation de grille d’images 17k + 5, où k représente un compteur de pas entier.

À une fréquence d’images standard de 24 ips, ce calcul dicte des durées temporelles exactes :
- k = 0 (5 images) : ~0,21 seconde (micro-mouvement ou burst statique)
- k = 1 (22 images) : ~0,91 seconde (tranche d’action rapide)
- k = 3 (56 images) : ~2,33 secondes (séquence courte)
- k = 8 (141 images) : ~5,87 secondes (limite de clip standard complète)
Définir un nombre cible à 60 force ComfyUI à abandonner 4 images pour descendre à 56 (k=3), gaspillant le calcul VRAM pendant l’échantillonnage. Alignez toujours vos paramètres de nœud sur la limite de pas exacte 17k + 5 avant de mettre en file d’attente un lot de génération.
Optimisation de la vitesse : Activation de l’exécution Turbo LoRA en 8 étapes
Passer plus de six minutes à attendre le rendu d’une seule vidéo de prévisualisation de 6 secondes rend l’itération rapide des invites presque impossible sur les GPU grand public. L’échantillonnage standard nécessite 20 à 30 étapes, créant un goulot d’étranglement opérationnel sévère lors du réglage des indices de mouvement, des tests de mouvements de caméra ou de l’évaluation des transitions d’images clés.
Intégration des poids de distillation Turbo
L’intégration du fichier de poids officiel minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 réduit les passes d’échantillonnage à un workflow d’inférence en 8 étapes. Ce processus de distillation atteint une optimisation significative de la vitesse de génération sans compromettre la cohésion visuelle globale.
Pour configurer cette distillation dans ComfyUI :
- Placer les poids du modèle : Déplacez minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors dans votre répertoire ComfyUI/models/loras/.
- Câbler le nœud LoraLoader : Acheminez le tenseur du modèle de diffusion principal via un nœud LoraLoader avant de l’envoyer à l’échantillonneur. Définissez turbo_model_strength sur 1.0.
- Ajuster le nombre d’étapes : Réduisez le paramètre steps dans votre nœud MiniMaxH3Sampler de la valeur standard de 20 à exactement 8.
- Verrouiller l’échelle CFG : Forcez le paramètre d’échelle de guidage sans classifieur à 1.0 pour éviter la sursaturation.
Benchmarks de performance : Exécution standard vs Turbo
| Paramètre / Métrique de benchmark | Pipeline d’échantillonnage standard | Exécution Turbo LoRA en 8 étapes |
| Nombre d’étapes d’inférence | 20 à 30 étapes | 8 étapes |
| Temps de rendu (RTX 4090, 2K) | ~380 secondes | ~145 secondes |
| Échelle de guidage CFG | 3.5 à 6.0 | Fixée à 1.0 (Distillé) |
| Utilisation principale en production | Rendu final | Prévisualisation rapide et maquettes de scène |
| Stabilité temporelle | Reconstruction complète | Légère gigue de bord sur les particules complexes |
Lors de l’exécution de minimax_h3_fl2v_turbo_8step, définir CFG au-dessus de 1.0 force des passes de double conditionnement inutiles, provoquant une brûlure extrême des couleurs, des écrêtages de contraste et des déchirures spatiales sur les images à fort mouvement. Activer turbo_mode avec une force Turbo LoRA fixe de 1.0 permet aux créateurs de valider des mouvements de caméra complexes en moins de trois minutes avant de s’engager dans des rendus de production complets en 20 étapes.
Dépannage des erreurs courantes de graphe MiniMax H3 dans ComfyUI
La plupart des échecs opérationnels dans les graphes MiniMax H3 proviennent de légers décalages d’alignement des tenseurs, de décodeurs audio non liés ou de goulots d’étranglement de mémoire GPU lors du chargement du modèle.
Guide de diagnostic et correctifs rapides
-
CUDA hors mémoire (OOM)
- Cause principale : Chargement de l’encodeur de texte 32B avec les poids de diffusion int8 sur des GPU de 16 Go de VRAM sans déchargement mémoire.
- Correctif étape par étape : Ajoutez les drapeaux de lancement --lowvram ou --medvram à votre script de démarrage ComfyUI. Pour les configurations mémoire GPU serrées, envisagez d’exécuter MiniMax H3 dans ComfyUI avec la quantification GGUF pour réduire les besoins mémoire de base. Assurez-vous que qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors est placé strictement dans models/text_encoders/, permettant le déchargement VRAM entre l’analyse textuelle et les passes d’échantillonnage.
-
Erreur de forme de tenseur
- Cause principale : Des valeurs de largeur/hauteur personnalisées ou des images clés d’entrée violent la grille de divisibilité spatiale requise de 32 pixels.
- Correctif étape par étape : Insérez un nœud ResolutionSelector ou ImageScaleToTotalPixels avant l’échantillonneur pour forcer toutes les dimensions du canevas et de l’image au multiple de 32 le plus proche.
-
Piste audio manquante à l’exportation
- Cause principale : Le chemin de la VAE audio est délié ou contourné lors de l’exécution du graphe.
- Correctif étape par étape : Connectez minimax_h3_audio_vae_fp32 dans le nœud VAEDecodeAudio, puis acheminez les latents audio décodés dans le port audio du nœud SaveVideo avec le flux vidéo.
-
Échec du nœud GetImageSize
- Cause principale : Rapports d’aspect d’images clés incompatibles ou lots d’images multi-images invalides introduits dans les entrées de l’échantillonneur I2V.
- Correctif étape par étape : Passez les images initiale et terminale via un nœud unifié ImageScaleToTotalPixels pour verrouiller les images clés à des dimensions identiques avant l’initialisation latente.
-
Avertissement de nœuds manquants dans ComfyUI Manager
- Cause principale : Les packages de nœuds personnalisés MiniMax H3 requis ne sont pas indexés ou sont absents de l’environnement local.
- Correctif étape par étape : Ouvrez ComfyUI Manager, sélectionnez Installer les nœuds personnalisés manquants, recherchez ComfyUI-MiniMaxH3-Easy, cliquez sur Installer, puis redémarrez ComfyUI.
Résolution des chutes de mémoire et des conflits de registre de nœuds
De nombreux tutoriels oublient comment ComfyUI gère l’allocation VRAM entre les générations consécutives. Si vous rencontrez une erreur CUDA hors mémoire soudaine lors d’une deuxième ou troisième tentative de rendu malgré une première passe réussie, ComfyUI a conservé l’encodeur de texte en VRAM. Définir des drapeaux de déchargement explicites dans votre script de démarrage libère la mémoire allouée entre les étapes d’échantillonnage.
Lors de l’ouverture de fichiers JSON communautaires, les avertissements de nœuds manquants de ComfyUI Manager indiquent généralement des registres de nœuds obsolètes. L’installation de ComfyUI-MiniMaxH3-Easy corrige ces dépendances manquantes directement. Pour les pipelines I2V, la résolution d’un échec de GetImageSize ou d’une erreur de forme de tenseur nécessite de s’assurer que les images clés initiale et terminale correspondent aux limites de pixels cibles.







