Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

MiniMax H3 ComfyUI Workflow: Guide complet pour T2V & I2V

Maîtrisez le workflow MiniMax H3 ComfyUI pour T2V et I2V. Apprenez les règles de grille spatiale, le routage audio dual VAE, les mathématiques des trames 17k+5 et la configuration Turbo LoRA en 8 étapes.

MiniMax H3 ComfyUI Workflow: Guide complet pour T2V & I2V

Exécuter MiniMax H3 dans ComfyUI nécessite un respect strict des règles de grille spatiale et temporelle pour éviter les erreurs de forme de tenseur, les exportations MP4 silencieuses ou les plantages du modèle. MiniMax H3 résout ces goulots d’étranglement en synthétisant une vidéo 2K et un audio stéréo natif synchronisé en une seule passe avant.

Points clés : Workflow ComfyUI MiniMax H3

  • Passe multimodale native : MiniMax H3 synthétise une vidéo 2K et un audio stéréo 32 kHz synchronisé directement au sein d’une seule passe de diffusion ComfyUI.
  • Seuil matériel : Nécessite un minimum de 16 Go de VRAM pour une exécution quantifiée INT8, 24 Go recommandés pour le rendu natif 2K.
  • Règle de grille spatiale : Les résolutions du canevas et des images clés doivent être strictement divisibles par 32, par exemple 1344×768, pour éviter les erreurs de forme du tenseur VAE spatial.
  • Formule de grille temporelle : Les durées des clips doivent respecter l’équation Images totales = 17k + 5 (5, 22, 39, 56, 141 images à 24 ips) pour éviter la troncature latente.
  • Optimisation de la vitesse : Prend en charge un Turbo LoRA officiel en 8 étapes pour réduire les temps de rendu d’environ 60 % avec CFG verrouillé à 1,0.

Alors que la Text-to-Video (T2V) repose sur une initialisation latente purement textuelle, l’Image-to-Video (I2V) ancre les trajectoires de mouvement à l’aide des nœuds de conditionnement first_frame, last_frame ou MiniMaxH3AddGuide. Les sections suivantes détaillent la configuration complète de l’environnement, les schémas de câblage des nœuds et les protocoles de dépannage pour les deux pipelines.

Prérequis essentiels et structure des répertoires des modèles

Placer un encodeur de texte 32B dans models/checkpoints au lieu de models/text_encoders fera geler ComfyUI lors de la compilation du graphe ou échouera avec une KeyError peu utile. La plupart des échecs de configuration surviennent parce que les fichiers se retrouvent dans les mauvais sous-dossiers, ou parce que les poids Qwen standard sont substitués à l’encodeur de texte visuel personnalisé requis par MiniMax H3.

Configuration du graphe de nœuds de l’espace de travail ComfyUI montrant CLIP Text Encode, KSampler, EmptySD3LatentImage et Load VAE configurés pour la génération vidéo MiniMax H3

Exigences de compatibilité système

Avant de télécharger les poids du modèle, vérifiez que votre installation répond à ces spécifications matérielles et environnementales de base :

  • Noyau ComfyUI : Version v0.30.0 ou supérieure.
  • Nœuds personnalisés : ComfyUI-MiniMaxH3-Easy ou le package officiel Comfy-Org.
  • VRAM GPU : 16 Go (min INT8) / 24 Go (recommandé 2K).
  • Pile logicielle : Python 3.10+ avec PyTorch 2.4+ et CUDA 12.1+.

Matrice de placement des répertoires des modèles

Téléchargez les poids officiels du modèle open-source MiniMax H3 depuis le dépôt de modèles Hugging Face et placez chaque fichier dans son sous-dossier cible désigné.

    
Catégorie de modèleNom exact du fichierRépertoire de destinationNotes et précision
Modèle de diffusion (T2V/FL2V)minimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/Modèle de diffusion INT8 quantifié principal
Modèle de diffusion (Ref2V)minimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/Requis pour les graphes de guidage par référence
Encodeur de texteqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/Poids personnalisés vision-langage 4 bits
VAE vidéominimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/Décodeur spatial visuel FP16
VAE audiominimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/Décodeur acoustique FP32 (empêche l’écrêtage)
Turbo LoRA (optionnel)minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensorsComfyUI/models/loras/Permet une inférence rapide en 8 étapes

Note d’installation critique

Le fichier qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors est un encodeur texte-vision quantifié AWQ 4 bits personnalisé (architecture Qwen3-VL) spécifiquement affiné pour le conditionnement des invites de MiniMax H3. Ne le remplacez pas par des transformateurs de langage standard dans le dossier text_encoders, car les modèles de langage génériques manquent de la projection visuelle multimodale nécessaire à la génération vidéo latente.

Construction du graphe de nœuds Text-to-Video (T2V) dans ComfyUI

Construire un graphe de nœuds Text-to-Video (T2V) propre dans ComfyUI nécessite d’acheminer les embeddings de texte, les paramètres de résolution spatiale et les tenseurs d’images latentes dans une séquence linéaire stricte.

Note sur le package de nœuds : Les noms de nœuds utilisés tout au long de ce guide de workflow, tels que MiniMaxH3TextToVideo et MiniMaxH3ImageToVideo, font référence au package personnalisé ComfyUI-MiniMaxH3-Easy. Si vous utilisez le package officiel Comfy-Org, ces opérations sont divisées en nœuds séparés MiniMaxH3Sampler et MiniMaxH3Conditioning.

Guide de câblage des nœuds T2V étape par étape

Diagramme du graphe de nœuds Text-to-Video ComfyUI illustrant le conditionnement de l’invite textuelle, la mise à l’échelle de la résolution, l’échantillonneur MiniMaxH3TextToVideo et le décodage VAE vidéo

La configuration de la génération latente T2V nécessite d’isoler le conditionnement textuel et les paramètres spatiaux avant d’exécuter la passe d’échantillonnage.

  1. Câblage de l’encodeur de texte : Acheminez votre nœud d’invite textuelle vers le chargeur d’encodeur de texte visuel Qwen3-VL. Passez le tenseur de sortie directement dans le port de conditionnement d’invite positive du nœud MiniMaxH3TextToVideo.
  2. Calcul des dimensions spatiales : Dirigez les valeurs de sortie de ResolutionSelector vers ImageScaleToTotalPixels. Cette étape calcule l’allocation des pixels tout en imposant des dimensions spatiales restant divisibles par 32.
  3. Échantillonneur et génération latente : Acheminez les poids du modèle, les tenseurs de conditionnement positifs et les paramètres de résolution directement dans MiniMaxH3TextToVideo pour générer le latent vidéo brut.
  4. Décodage VAE et exportation vidéo : Envoyez le tenseur latent via minimax_h3_video_vae_fp16 pour le décodage, puis dirigez le lot d’images rendues directement vers SaveVideo.

Matrice de routage des nœuds T2V

Pour construire ce graphe sans dépendances cassées, suivez les connexions de ports de nœuds exactes décrites ci-dessous :

     
Nœud sourcePort de sortieNœud ciblePort d’entréeFonction du workflow
Encodeur Qwen3-VLCONDITIONINGMiniMaxH3TextToVideopositiveDirige le câblage de l’encodeur de texte
ResolutionSelectorWIDTH / HEIGHTImageScaleToTotalPixelswidth / heightDéfinit les limites du rapport d’aspect
ImageScaleToTotalPixelsIMAGE_BOUNDSMiniMaxH3TextToVideoresolutionFixe la grille spatiale de 32 pixels
MiniMaxH3TextToVideoLATENTVAEDecodesamplesContrôle la génération latente T2V
VAEDecodeIMAGESaveVideopixelsRend la sortie vidéo MP4 finale

MiniMax H3 repose presque entièrement sur des invites positives détaillées analysées par le modèle vision-langage Qwen3-VL, ce qui signifie que les nœuds de conditionnement négatif traditionnels ajoutent une charge de calcul inutile sans améliorer la qualité de la sortie. Connecter SaveVideo directement au nœud de décodage VAE vidéo garantit un rendu MP4 correct à 24 ips sans perte d’images de fin.

Construction du workflow Image-to-Video (I2V) et Premier/Dernière image

Configuration du graphe de nœuds Image-to-Video ComfyUI montrant deux nœuds LoadImage, l’appariement des dimensions GetImageSize et l’interpolation d’images clés MiniMaxH3ImageToVideo

Tenter d’animer un portrait statique ou de faire le pont entre deux images clés entraîne souvent une déformation violente du sujet ou un crash immédiat de la forme du tenseur lorsque vos images de début et de fin diffèrent ne serait-ce que de quelques pixels. Convertir un pipeline textuel standard en workflow Image-to-Video (I2V) nécessite de remplacer le nœud d’échantillonnage de base et d’établir des pipelines de conditionnement d’image précis sur vos images initiales et finales.

Interpolation d’images clés et configuration des nœuds

Pour passer de T2V à la génération vidéo First-Last-Frame (FL2V), remplacez MiniMaxH3TextToVideo par MiniMaxH3ImageToVideo. Ce nœud expose des ports d’entrée dédiés pour first_frame et last_frame, vous permettant de définir des états de départ, des états de fin ou des transitions de morphing complètes.

  1. Nœuds LoadImage : Placez deux nœuds LoadImage sur votre canevas pour contenir vos images clés initiale et cible.
  2. Appariement des dimensions : Acheminez les sorties d’image via GetImageSize pour extraire les dimensions brutes de largeur et de hauteur. Cela évite les décalages de grille spatiale avant que les tenseurs n’entrent dans l’échantillonneur.
  3. Conditionnement des tenseurs : Connectez les tenseurs de pixels traités à first_frame pour une animation standard à une seule image, ou remplissez à la fois first_frame et last_frame pour exécuter une interpolation d’images clés.

Matrice de connexion des nœuds I2V et FL2V

     
Nœud sourcePort de sortieNœud ciblePort d’entréeFonction du pipeline
LoadImage (Début)IMAGEMiniMaxH3ImageToVideofirst_frameÉtablit le conditionnement initial de l’image
LoadImage (Fin)IMAGEMiniMaxH3ImageToVideolast_frameDéfinit l’image de fin pour les morphs FL2V
GetImageSizeWIDTH / HEIGHTResolutionSelectorwidth / heightVerrouille le rapport d’aspect d’entrée sur des multiples de 32
Encodeur Qwen3-VLCONDITIONINGMiniMaxH3ImageToVideopositiveGuide la trajectoire de mouvement via des invites textuelles
MiniMaxH3ImageToVideoLATENTVAEDecodesamplesEnvoie les latents FL2V à la VAE vidéo

MiniMax H3 impose une parité stricte des dimensions entre les entrées d’images clés. Les deux images clés doivent correspondre exactement à la même résolution spatiale. Si first_frame et last_frame diffèrent en taille, l’échantillonnage s’arrête lors de l’initialisation latente. Acheminez les deux images via le même nœud de mise à l’échelle pour garantir des dimensions de pixels identiques.

Guidage avancé par référence avec MiniMaxH3AddGuide

Les graphes Image-to-Video standard ne contrôlent que la première et la dernière image, laissant le mouvement intermédiaire non ancré. Le nœud MiniMaxH3AddGuide résout ce problème en ancrant des images de référence, des lots d’images multi-images ou des pistes audio à n’importe quel frame_idx spécifique le long de la chronologie de génération.

Capacités principales de MiniMaxH3AddGuide

   
Paramètre d’entréeComportement d’ancrageRègles de contrainte
frame_idxSpécifie l’index exact de l’image cibleLes valeurs négatives comptent à rebours à partir de la fin de la vidéo.
Image / Multi-imagesVerrouille la cohérence du personnage ou la disposition de la scèneLes lots de moins de 5 images utilisent la première image ; les lots de 5+ images se fixent sur les longueurs de clip $17k + 5$ (5, 22, 39).
Piste audioAligne le dialogue ou les effets sonores à l’indexSe recadre automatiquement à la durée vidéo restante.

Comment chaîner des nœuds d’ancrage pour la génération vidéo de référence

Chaîner plusieurs nœuds MiniMaxH3AddGuide ensemble permet la génération vidéo de référence complète (R2V) :

  1. Ancrage du personnage principal : Connectez votre conditionnement positif à MiniMaxH3AddGuide avec frame_idx défini sur 0 pour verrouiller l’identité du personnage au début.
  2. Image clé de mouvement à mi-séquence : Chaînez un second nœud MiniMaxH3AddGuide, en fournissant une image clé à frame_idx 60 pour forcer le personnage à adopter une pose spécifique au milieu de la scène.
  3. Couplage audio : Connectez une bande sonore cible au port d’entrée audio et passez votre audio_vae pour synchroniser le son directement à ce décalage temporel.

Chaîner ces guides de conditionnement maintient la stabilité temporelle sans forcer l’échantillonneur de diffusion à réinitialiser les latents.

Intégration de l’audio natif synchronisé avec le routage double VAE

Graphe de nœuds de routage double VAE ComfyUI montrant le décodeur VAE vidéo et le décodeur VAE audio multiplexés dans SaveVideo pour une exportation audio stéréo synchronisée

Les créateurs passent régulièrement des heures à aligner manuellement des pistes vocales externes dans un logiciel de montage vidéo, pour ensuite faire face à une dérive de synchro labiale non naturelle ou à un bruit ambiant décalé. MiniMax H3 élimine l’alignement audio post-traitement en s’appuyant sur une véritable génération multimodale, synthétisant les images vidéo et le son stéréo 32 kHz ensemble en une seule passe avant.

Architecture du flux monophase

Contrairement aux pipelines traditionnels qui enchaînent des modèles texte-parole distincts après le rendu vidéo, MiniMax H3 traite les indices textuels, d’image et temporels dans un espace latent unifié. Pendant la phase de débruitage, SamplerCustomAdvanced produit une charge latente composite contenant à la fois des cartes de caractéristiques visuelles et acoustiques. Cette synthèse conjointe garantit une synchronisation précise du dialogue et une génération d’effets sonores organiques alignée précisément sur l’action à l’écran.

Décodage double VAE et configuration des nœuds

Pour transformer les latents bruts en médias lisibles, le graphe divise la sortie en deux chemins de décodage séparés avant le multiplexage MP4.

    
Composant du nœudActif du modèle / PrécisionFonctionDestination de sortie
Chargeur VAE vidéominimax_h3_video_vae_fp16.safetensorsDécode les latents visuels en séquences d’images RVBVAEDecode -> CreateVideo (Flux vidéo)
Chargeur VAE audiominimax_h3_audio_vae_fp32.safetensorsDécode les latents acoustiques en signaux audio non compressésVAEDecodeAudio -> CreateVideo (Flux audio)
Sauvegarde vidéoSaveVideoMultiplexe les flux vidéo et audio stéréo natifsFichier MP4 encodé

Configuration technique des nœuds

  1. Charger les deux VAE : Ajoutez deux nœuds VAELoader distincts à votre canevas. Pointez le premier vers minimax_h3_video_vae_fp16.safetensors et le second vers minimax_h3_audio_vae_fp32.safetensors.
  2. Exécuter le décodage double VAE : Acheminez la sortie latente visuelle de l’échantillonneur vers VAEDecode et le morceau latent audio vers VAEDecodeAudio. Conserver minimax_h3_audio_vae_fp32 en précision FP32 empêche les artefacts d’écrêtage et la distorsion de fréquence dans les fonds sonores.
  3. Multiplexer via SaveVideo : Fournissez le tenseur d’image décodé et la forme d’onde audio non compressée à CreateVideo ou directement à SaveVideo. Le nœud gère l’assemblage final du conteneur, écrivant un fichier MP4 final à 24 ips avec audio stéréo intégré.

Cette configuration native à double flux garantit une exécution audio précise en phase directement dans ComfyUI, sans nécessiter de plugins de synchronisation labiale externes.

Mathématiques de résolution, contraintes de rapport d’aspect et alignement de la grille d’images

Saisir une résolution standard 1920x1080 ou définir la durée de votre clip à 60 images dans ComfyUI fera immédiatement planter votre file d’attente de rendu avec une erreur de forme de tenseur ou vous laissera avec des bords de couture fortement déformés. MiniMax H3 impose des limites mathématiques rigides pour les dimensions spatiales et les durées de clip car son architecture VAE 3D compresse les latents vidéo à travers des blocs spatiaux spécifiques et des pas temporels.

Dimensions spatiales et préréglages de rapport d’aspect

La VAE spatiale sous-échantillonne les entrées par un facteur de 32. Si votre largeur ou hauteur cible n’est pas un multiple strict de 32, l’échantillonneur de diffusion échoue lors des allocations de tenseurs de bordure. Le modèle cible un petit bord natif de 768px, équilibrant la fidélité visuelle par rapport à son budget mégapixel cible.

    
Rapport d’aspectDimensions préréglées (Px)Vérification de divisibilitéOrientation cible
16:091344 x 7681344 / 32 = 42, 768 / 32 = 24Paysage grand écran
9:16768 x 1344768 / 32 = 24, 1344 / 32 = 42Vertical mobile / UGC
1:011024 x 10241024 / 32 = 32, 1024 / 32 = 32Cadre carré
21:091536 x 6721536 / 32 = 48, 672 / 32 = 21Ultra-large cinématographique

Utiliser des dimensions de pixels non standard force la VAE à remplir ou étirer les cartes de caractéristiques, dégradant les détails de texture fins.

La règle de grille d’images 17k + 5

L’alignement des dimensions temporelles suit une formule tout aussi rigide. Pour rester dans les limites de longueur vidéo de MiniMax H3, l’architecture traite les séquences vidéo en morceaux latents de 17 images avec une initialisation de queue de 5 images. Pour éviter la troncature temporelle ou les plantages silencieux du décodage VAE, chaque rendu doit satisfaire l’équation de grille d’images 17k + 5, où k représente un compteur de pas entier.

Formule de la règle de grille d’images 17k+5

À une fréquence d’images standard de 24 ips, ce calcul dicte des durées temporelles exactes :

  • k = 0 (5 images) : ~0,21 seconde (micro-mouvement ou burst statique)
  • k = 1 (22 images) : ~0,91 seconde (tranche d’action rapide)
  • k = 3 (56 images) : ~2,33 secondes (séquence courte)
  • k = 8 (141 images) : ~5,87 secondes (limite de clip standard complète)

Définir un nombre cible à 60 force ComfyUI à abandonner 4 images pour descendre à 56 (k=3), gaspillant le calcul VRAM pendant l’échantillonnage. Alignez toujours vos paramètres de nœud sur la limite de pas exacte 17k + 5 avant de mettre en file d’attente un lot de génération.

Optimisation de la vitesse : Activation de l’exécution Turbo LoRA en 8 étapes

Passer plus de six minutes à attendre le rendu d’une seule vidéo de prévisualisation de 6 secondes rend l’itération rapide des invites presque impossible sur les GPU grand public. L’échantillonnage standard nécessite 20 à 30 étapes, créant un goulot d’étranglement opérationnel sévère lors du réglage des indices de mouvement, des tests de mouvements de caméra ou de l’évaluation des transitions d’images clés.

Intégration des poids de distillation Turbo

L’intégration du fichier de poids officiel minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 réduit les passes d’échantillonnage à un workflow d’inférence en 8 étapes. Ce processus de distillation atteint une optimisation significative de la vitesse de génération sans compromettre la cohésion visuelle globale.

Pour configurer cette distillation dans ComfyUI :

  1. Placer les poids du modèle : Déplacez minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors dans votre répertoire ComfyUI/models/loras/.
  2. Câbler le nœud LoraLoader : Acheminez le tenseur du modèle de diffusion principal via un nœud LoraLoader avant de l’envoyer à l’échantillonneur. Définissez turbo_model_strength sur 1.0.
  3. Ajuster le nombre d’étapes : Réduisez le paramètre steps dans votre nœud MiniMaxH3Sampler de la valeur standard de 20 à exactement 8.
  4. Verrouiller l’échelle CFG : Forcez le paramètre d’échelle de guidage sans classifieur à 1.0 pour éviter la sursaturation.

Benchmarks de performance : Exécution standard vs Turbo

   
Paramètre / Métrique de benchmarkPipeline d’échantillonnage standardExécution Turbo LoRA en 8 étapes
Nombre d’étapes d’inférence20 à 30 étapes8 étapes
Temps de rendu (RTX 4090, 2K)~380 secondes~145 secondes
Échelle de guidage CFG3.5 à 6.0Fixée à 1.0 (Distillé)
Utilisation principale en productionRendu finalPrévisualisation rapide et maquettes de scène
Stabilité temporelleReconstruction complèteLégère gigue de bord sur les particules complexes

Lors de l’exécution de minimax_h3_fl2v_turbo_8step, définir CFG au-dessus de 1.0 force des passes de double conditionnement inutiles, provoquant une brûlure extrême des couleurs, des écrêtages de contraste et des déchirures spatiales sur les images à fort mouvement. Activer turbo_mode avec une force Turbo LoRA fixe de 1.0 permet aux créateurs de valider des mouvements de caméra complexes en moins de trois minutes avant de s’engager dans des rendus de production complets en 20 étapes.

Dépannage des erreurs courantes de graphe MiniMax H3 dans ComfyUI

La plupart des échecs opérationnels dans les graphes MiniMax H3 proviennent de légers décalages d’alignement des tenseurs, de décodeurs audio non liés ou de goulots d’étranglement de mémoire GPU lors du chargement du modèle.

Guide de diagnostic et correctifs rapides

  1. CUDA hors mémoire (OOM)

    1. Cause principale : Chargement de l’encodeur de texte 32B avec les poids de diffusion int8 sur des GPU de 16 Go de VRAM sans déchargement mémoire.
    2. Correctif étape par étape : Ajoutez les drapeaux de lancement --lowvram ou --medvram à votre script de démarrage ComfyUI. Pour les configurations mémoire GPU serrées, envisagez d’exécuter MiniMax H3 dans ComfyUI avec la quantification GGUF pour réduire les besoins mémoire de base. Assurez-vous que qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors est placé strictement dans models/text_encoders/, permettant le déchargement VRAM entre l’analyse textuelle et les passes d’échantillonnage.
  2. Erreur de forme de tenseur

    1. Cause principale : Des valeurs de largeur/hauteur personnalisées ou des images clés d’entrée violent la grille de divisibilité spatiale requise de 32 pixels.
    2. Correctif étape par étape : Insérez un nœud ResolutionSelector ou ImageScaleToTotalPixels avant l’échantillonneur pour forcer toutes les dimensions du canevas et de l’image au multiple de 32 le plus proche.
  3. Piste audio manquante à l’exportation

    1. Cause principale : Le chemin de la VAE audio est délié ou contourné lors de l’exécution du graphe.
    2. Correctif étape par étape : Connectez minimax_h3_audio_vae_fp32 dans le nœud VAEDecodeAudio, puis acheminez les latents audio décodés dans le port audio du nœud SaveVideo avec le flux vidéo.
  4. Échec du nœud GetImageSize

    1. Cause principale : Rapports d’aspect d’images clés incompatibles ou lots d’images multi-images invalides introduits dans les entrées de l’échantillonneur I2V.
    2. Correctif étape par étape : Passez les images initiale et terminale via un nœud unifié ImageScaleToTotalPixels pour verrouiller les images clés à des dimensions identiques avant l’initialisation latente.
  5. Avertissement de nœuds manquants dans ComfyUI Manager

    1. Cause principale : Les packages de nœuds personnalisés MiniMax H3 requis ne sont pas indexés ou sont absents de l’environnement local.
    2. Correctif étape par étape : Ouvrez ComfyUI Manager, sélectionnez Installer les nœuds personnalisés manquants, recherchez ComfyUI-MiniMaxH3-Easy, cliquez sur Installer, puis redémarrez ComfyUI.

Résolution des chutes de mémoire et des conflits de registre de nœuds

De nombreux tutoriels oublient comment ComfyUI gère l’allocation VRAM entre les générations consécutives. Si vous rencontrez une erreur CUDA hors mémoire soudaine lors d’une deuxième ou troisième tentative de rendu malgré une première passe réussie, ComfyUI a conservé l’encodeur de texte en VRAM. Définir des drapeaux de déchargement explicites dans votre script de démarrage libère la mémoire allouée entre les étapes d’échantillonnage.

Lors de l’ouverture de fichiers JSON communautaires, les avertissements de nœuds manquants de ComfyUI Manager indiquent généralement des registres de nœuds obsolètes. L’installation de ComfyUI-MiniMaxH3-Easy corrige ces dépendances manquantes directement. Pour les pipelines I2V, la résolution d’un échec de GetImageSize ou d’une erreur de forme de tenseur nécessite de s’assurer que les images clés initiale et terminale correspondent aux limites de pixels cibles.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles