Seedance 2.5 è ora live — In anteprima su Atlas Cloud

MiniMax H3 ComfyUI Workflow: Guida completa per T2V e I2V

Padroneggia il flusso di lavoro MiniMax H3 ComfyUI per T2V e I2V. Scopri le regole della griglia spaziale, il routing audio duale VAE, la matematica dei fotogrammi 17k+5 e la configurazione Turbo LoRA a 8 passi.

MiniMax H3 ComfyUI Workflow: Guida completa per T2V e I2V

Eseguire MiniMax H3 in ComfyUI richiede il rispetto rigoroso delle regole della griglia spaziale e temporale per evitare errori di forma dei tensori, esportazioni MP4 silenziose o crash del modello. MiniMax H3 risolve questi colli di bottiglia sintetizzando video 2K e audio stereo sincronizzato nativo in un unico passaggio forward.

Punti chiave: flusso di lavoro MiniMax H3 in ComfyUI

  • Passaggio multimodale nativo: MiniMax H3 sintetizza video 2K e audio stereo sincronizzato a 32 kHz direttamente all'interno di un singolo passaggio di diffusione di ComfyUI.
  • Soglia hardware: Richiede un minimo di 16 GB di VRAM per l'esecuzione quantizzata INT8; 24 GB sono consigliati per il rendering nativo 2K.
  • Regola della griglia spaziale: Le risoluzioni della tela e dei fotogrammi chiave devono essere rigorosamente divisibili per 32, ad esempio 1344×768, per evitare errori di forma dei tensori VAE spaziali.
  • Formula della griglia temporale: Le durate dei clip devono rispettare l'equazione Frames totali = 17k + 5 (5, 22, 39, 56, 141 fotogrammi a 24 fps) per evitare il troncamento latente.
  • Ottimizzazione della velocità: Supporta una LoRA Turbo ufficiale a 8 passaggi per ridurre i tempi di rendering di circa il 60% con CFG bloccato a 1.0.

Mentre la generazione da testo a video (T2V) si basa sull'inizializzazione latente puramente testuale, quella da immagine a video (I2V) ancora le traiettorie di movimento utilizzando i nodi di condizionamento first_frame, last_frame o MiniMaxH3AddGuide. Le sezioni seguenti descrivono in dettaglio la configurazione completa dell'ambiente, gli schemi di collegamento dei nodi e i protocolli di risoluzione dei problemi per entrambe le pipeline.

Prerequisiti essenziali e struttura delle directory del modello

Posizionare un codificatore di testo 32B in models/checkpoints invece che in models/text_encoders farà sì che ComfyUI si blocchi durante la compilazione del grafo o fallisca con un KeyError poco utile. La maggior parte degli errori di configurazione si verifica perché i file finiscono nelle sottocartelle sbagliate o perché i pesi standard di Qwen vengono sostituiti con il codificatore di testo visivo personalizzato richiesto da MiniMax H3.

Schema del grafo dei nodi dell'area di lavoro di ComfyUI che mostra CLIP Text Encode, KSampler, EmptySD3LatentImage e Load VAE configurati per la generazione video di MiniMax H3

Requisiti di compatibilità del sistema

Prima di scaricare i pesi del modello, verificare che l'installazione soddisfi questi requisiti hardware e ambientali di base:

  • Core di ComfyUI: Versione v0.30.0 o superiore.
  • Nodi personalizzati: ComfyUI-MiniMaxH3-Easy o pacchetto ufficiale Comfy-Org.
  • GPU VRAM: 16 GB (minimo INT8) / 24 GB (consigliato 2K).
  • Stack software: Python 3.10+ con PyTorch 2.4+ e CUDA 12.1+.

Matrice di posizionamento delle directory del modello

Scaricare i pesi ufficiali del modello open-source MiniMax H3 dal repository di modelli Hugging Face e posizionare ogni file nella sottocartella di destinazione designata.

    
Categoria del modelloNome file esattoDirectory di destinazioneNote e precisione
Modello di diffusione (T2V/FL2V)minimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/Modello di diffusione INT8 quantizzato core
Modello di diffusione (Ref2V)minimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/Richiesto per i grafi di guida di riferimento
Codificatore di testoqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/Pesi personalizzati visione-linguaggio a 4 bit
VAE videominimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/Decodificatore spaziale visivo FP16
VAE audiominimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/Decodificatore acustico FP32 (previene il clipping)
LoRA Turbo (opzionale)minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensorsComfyUI/models/loras/Abilita inferenza rapida a 8 passaggi

Nota critica sull'installazione

Il file qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors è un codificatore testo-visione quantizzato AWQ a 4 bit personalizzato (architettura Qwen3-VL) specificamente ottimizzato per il condizionamento dei prompt di MiniMax H3. Non sostituirlo con trasformatori linguistici standard nella cartella text_encoders, poiché i modelli linguistici generici mancano della proiezione visiva multimodale necessaria per la generazione video latente.

Costruzione del grafo dei nodi ComfyUI per la generazione da testo a video (T2V)

Costruire un grafo dei nodi pulito per la generazione da testo a video (T2V) in ComfyUI richiede di instradare gli embedding di testo, le impostazioni di risoluzione spaziale e i tensori dei fotogrammi latenti in una sequenza lineare rigorosa.

Nota sul pacchetto di nodi: I nomi dei nodi utilizzati in questa guida al flusso di lavoro, come MiniMaxH3TextToVideo e MiniMaxH3ImageToVideo, fanno riferimento al pacchetto personalizzato ComfyUI-MiniMaxH3-Easy. Se si utilizza il pacchetto ufficiale Comfy-Org, queste operazioni sono suddivise in nodi separati MiniMaxH3Sampler e MiniMaxH3Conditioning.

Guida passo-passo al collegamento dei nodi T2V

Diagramma del grafo dei nodi Text-to-Video di ComfyUI che illustra il condizionamento del prompt di testo, il ridimensionamento della risoluzione, il campionatore MiniMaxH3TextToVideo e la decodifica VAE video

L'impostazione della generazione latente T2V richiede di isolare il condizionamento del testo e i parametri spaziali prima di eseguire il passaggio del campionatore.

  1. Collegamento del codificatore di testo: Instradare il nodo del prompt di testo nel caricatore del codificatore di testo visivo Qwen3-VL. Passare il tensore di uscita direttamente nella porta di condizionamento del prompt positivo del nodo MiniMaxH3TextToVideo.
  2. Calcolo della dimensione spaziale: Inviare i valori di uscita da ResolutionSelector a ImageScaleToTotalPixels. Questo passaggio calcola l'allocazione dei pixel imponendo dimensioni spaziali che rimangano divisibili per 32.
  3. Campionatore e generazione latente: Instradare i pesi del modello, i tensori di condizionamento positivo e i parametri di risoluzione direttamente in MiniMaxH3TextToVideo per generare il latente video grezzo.
  4. Decodifica VAE ed esportazione video: Inviare il tensore latente attraverso minimax_h3_video_vae_fp16 per la decodifica, quindi instradare il batch di fotogrammi renderizzati direttamente in SaveVideo.

Matrice di instradamento dei nodi T2V

Per costruire questo grafo senza dipendenze interrotte, seguire le connessioni esatte delle porte dei nodi elencate di seguito:

     
Nodo sorgentePorta di uscitaNodo di destinazionePorta di ingressoFunzione del flusso di lavoro
Codificatore Qwen3-VLCONDITIONINGMiniMaxH3TextToVideopositiveDirige il collegamento del codificatore di testo
ResolutionSelectorWIDTH / HEIGHTImageScaleToTotalPixelswidth / heightImposta i limiti delle proporzioni
ImageScaleToTotalPixelsIMAGE_BOUNDSMiniMaxH3TextToVideoresolutionFissa la griglia spaziale a 32 pixel
MiniMaxH3TextToVideoLATENTVAEDecodesamplesControlla la generazione latente T2V
VAEDecodeIMAGESaveVideopixelsRenderizza l'output video MP4 finale

MiniMax H3 si basa quasi interamente su prompt positivi dettagliati analizzati dal modello visione-linguaggio Qwen3-VL, il che significa che i nodi di condizionamento negativo tradizionali aggiungono carico computazionale inutile senza migliorare la qualità dell'output. Collegare SaveVideo direttamente al nodo di decodifica VAE video garantisce un rendering MP4 corretto a 24 fps senza fotogrammi finali caduti.

Costruzione del flusso di lavoro da immagine a video (I2V) e primo/ultimo fotogramma

Schema del grafo dei nodi Image-to-Video di ComfyUI che mostra due nodi LoadImage, GetImageSize per la corrispondenza delle dimensioni e MiniMaxH3ImageToVideo per l'interpolazione dei fotogrammi chiave

Tentare di animare un ritratto statico o collegare due fotogrammi chiave spesso provoca una violenta distorsione del soggetto o un crash immediato della forma del tensore quando le immagini di inizio e fine differiscono anche solo di pochi pixel. Per convertire una pipeline di testo standard in un flusso di lavoro da immagine a video (I2V), è necessario sostituire il nodo campionatore di base e stabilire pipeline di condizionamento dell'immagine precise tra i fotogrammi iniziali e finali.

Interpolazione dei fotogrammi chiave e configurazione dei nodi

Per passare da T2V alla generazione video primo-ultimo fotogramma (FL2V), sostituire MiniMaxH3TextToVideo con MiniMaxH3ImageToVideo. Questo nodo espone porte di ingresso dedicate per first_frame e last_frame, consentendo di definire stati iniziali, stati finali o transizioni di morph complete.

  1. Nodi LoadImage: Posizionare due nodi LoadImage sulla tela per contenere i fotogrammi chiave iniziale e di destinazione.
  2. Corrispondenza delle dimensioni: Instradare le uscite dell'immagine attraverso GetImageSize per estrarre le dimensioni larghezza e altezza grezze. Questo previene disallineamenti della griglia spaziale prima che i tensori entrino nel campionatore.
  3. Condizionamento del tensore: Collegare i tensori di pixel elaborati a first_frame per l'animazione standard a immagine singola, oppure popolare sia first_frame che last_frame per eseguire l'interpolazione dei fotogrammi chiave.

Matrice di connessione dei nodi I2V e FL2V

     
Nodo sorgentePorta di uscitaNodo di destinazionePorta di ingressoFunzione della pipeline
LoadImage (Inizio)IMAGEMiniMaxH3ImageToVideofirst_frameStabilisce il condizionamento dell'immagine iniziale
LoadImage (Fine)IMAGEMiniMaxH3ImageToVideolast_frameImposta il fotogramma terminale per i morph FL2V
GetImageSizeWIDTH / HEIGHTResolutionSelectorwidth / heightBlocca le proporzioni di ingresso a multipli di 32
Codificatore Qwen3-VLCONDITIONINGMiniMaxH3ImageToVideopositiveGuida la traiettoria del movimento tramite prompt di testo
MiniMaxH3ImageToVideoLATENTVAEDecodesamplesInvia i latenti FL2V al VAE video

MiniMax H3 impone una rigorosa parità dimensionale tra gli input dei fotogrammi chiave. Entrambi i fotogrammi chiave devono corrispondere alla stessa risoluzione spaziale esatta. Se first_frame e last_frame differiscono in dimensioni, il campionamento si arresta durante l'inizializzazione latente. Instradare entrambe le immagini attraverso lo stesso nodo di ridimensionamento per garantire dimensioni pixel identiche.

Guida di riferimento avanzata con MiniMaxH3AddGuide

I grafi standard da immagine a video controllano solo il primo e l'ultimo fotogramma, lasciando il movimento intermedio senza ancoraggio. Il nodo MiniMaxH3AddGuide risolve questo problema ancorando immagini di riferimento, batch di immagini multi-fotogramma o tracce audio in qualsiasi frame_idx specifico lungo la linea temporale di generazione.

Capacità principali di MiniMaxH3AddGuide

   
Parametro di inputComportamento di ancoraggioRegole vincolanti
frame_idxSpecifica l'indice esatto del fotogramma di destinazioneI valori negativi contano all'indietro dalla fine del video.
Immagine / Multi-fotogrammaBlocca la coerenza del personaggio o il layout della scenaBatch con meno di 5 fotogrammi usano la prima immagine; batch di 5+ si agganciano alle lunghezze dei clip $17k + 5$ (5, 22, 39).
Traccia audioAllinea il dialogo o gli effetti sonori all'indiceSi ritaglia automaticamente alla durata rimanente del video.

Come concatenare nodi di ancoraggio per la generazione video di riferimento

Concatenare diversi nodi MiniMaxH3AddGuide insieme abilita la generazione video di riferimento completa (R2V):

  1. Ancoraggio del personaggio principale: Collegare il condizionamento positivo in MiniMaxH3AddGuide con frame_idx impostato a 0 per bloccare l'identità del personaggio all'inizio.
  2. Fotogramma chiave di movimento a metà sequenza: Concatenare un secondo nodo MiniMaxH3AddGuide, fornendo un'immagine del fotogramma chiave a frame_idx 60 per forzare il personaggio a raggiungere una posa specifica a metà scena.
  3. Accoppiamento audio: Collegare una colonna sonora di destinazione alla porta di ingresso audio e passare il proprio audio_vae per sincronizzare il suono direttamente in corrispondenza di quell'offset temporale.

Concatenare queste guide di condizionamento mantiene la stabilità temporale senza costringere il campionatore di diffusione a reinizializzare i latenti.

Integrazione dell'audio nativo sincronizzato con routing VAE duale

Grafo dei nodi ComfyUI con routing VAE duale che mostra il decodificatore VAE video e il decodificatore VAE audio multiplexati in SaveVideo per l'esportazione audio stereo sincronizzata

I creatori passano ore ad allineare manualmente tracce vocali esterne in software di editing video, solo per affrontare una deriva innaturale del labiale o rumore ambientale non corrispondente. MiniMax H3 elimina l'allineamento audio post-elaborazione affidandosi alla generazione multimodale reale, sintetizzando fotogrammi video e suono stereo a 32 kHz insieme in un unico passaggio forward.

Architettura del flusso a passaggio singolo

A differenza delle pipeline tradizionali che concatenano modelli distinti di sintesi vocale dopo il rendering video, MiniMax H3 elabora segnali testuali, visivi e temporali in uno spazio latente unificato. Durante la fase di denoising, SamplerCustomAdvanced produce un payload latente composito contenente sia mappe di caratteristiche visive che acustiche. Questa sintesi congiunta garantisce una sincronizzazione del dialogo precisa e una generazione di effetti sonori organici allineati con precisione all'azione sullo schermo.

Decodifica VAE duale e configurazione dei nodi

Per trasformare i latenti grezzi in media riproducibili, il grafo divide l'uscita in due percorsi di decodifica separati prima del multiplexing MP4.

    
Componente del nodoRisorsa del modello / PrecisioneFunzioneDestinazione di uscita
Caricatore VAE videominimax_h3_video_vae_fp16.safetensorsDecodifica i latenti visivi in sequenze di fotogrammi RGBVAEDecode -> CreateVideo (Flusso video)
Caricatore VAE audiominimax_h3_audio_vae_fp32.safetensorsDecodifica i latenti acustici in segnali audio non compressiVAEDecodeAudio -> CreateVideo (Flusso audio)
Salvatore videoSaveVideoMultiplexa i flussi video e audio stereo nativiFile MP4 codificato

Configurazione tecnica dei nodi

  1. Caricare VAE duali: Aggiungere due nodi VAELoader distinti alla tela. Puntare il primo a minimax_h3_video_vae_fp16.safetensors e il secondo a minimax_h3_audio_vae_fp32.safetensors.
  2. Eseguire la decodifica VAE duale: Instradare l'uscita latente visiva dal campionatore in VAEDecode e il chunk latente audio in VAEDecodeAudio. Mantenere minimax_h3_audio_vae_fp32 in precisione FP32 previene artefatti di clipping e distorsione di frequenza nelle colonne sonore di sottofondo.
  3. Multiplexare tramite SaveVideo: Inviare il tensore dell'immagine decodificata e la forma d'onda audio non compressa in CreateVideo o direttamente in SaveVideo. Il nodo gestisce l'impacchettamento del contenitore finale, scrivendo un file MP4 finito a 24 fps con audio stereo incorporato.

Questa configurazione nativa a doppio flusso fornisce un'esecuzione audio accurata in fase direttamente all'interno di ComfyUI, senza richiedere plugin esterni per il sincronismo labiale.

Matematica della risoluzione, vincoli delle proporzioni e aggancio alla griglia dei fotogrammi

Inserire una risoluzione standard 1920x1080 o impostare la durata del clip a 60 fotogrammi in ComfyUI farà immediatamente crashare la coda di rendering con un errore di forma del tensore o lascerà bordi di giunzione fortemente distorti. MiniMax H3 impone confini matematici rigidi per le dimensioni spaziali e le durate dei clip perché la sua architettura VAE 3D comprime i latenti video attraverso blocchi spaziali specifici e passi temporali.

Dimensioni spaziali e preset delle proporzioni

Il VAE spaziale sottocampiona gli input di un fattore 32. Se la larghezza o l'altezza di destinazione non è un multiplo stretto di 32, il campionatore di diffusione fallisce durante le allocazioni dei tensori di confine. Il modello mira a un bordo corto nativo di 768px, bilanciando la fedeltà visiva con il suo budget di megapixel di destinazione.

    
ProporzioniDimensioni preset (Px)Verifica divisibilitàOrientamento di destinazione
16:091344 x 7681344 / 32 = 42, 768 / 32 = 24Widescreen orizzontale
9:16768 x 1344768 / 32 = 24, 1344 / 32 = 42Verticale mobile / UGC
1:011024 x 10241024 / 32 = 32, 1024 / 32 = 32Quadrato
21:091536 x 6721536 / 32 = 48, 672 / 32 = 21Ultrawide cinematografico

L'uso di dimensioni pixel non standard costringe il VAE a riempire o ridimensionare le mappe delle caratteristiche, degradando i dettagli fini della texture.

La regola della griglia dei fotogrammi 17k + 5

L'aggancio della dimensione temporale segue una formula altrettanto rigida. Per rimanere entro i limiti di lunghezza video di MiniMax H3, l'architettura elabora le sequenze video in chunk latenti di 17 fotogrammi con un'inizializzazione della coda di 5 fotogrammi. Per evitare troncamenti temporali o crash silenziosi della decodifica VAE, ogni rendering deve soddisfare l'equazione della griglia dei fotogrammi 17k + 5, dove k rappresenta un contatore di passi intero.

Formula della regola della griglia dei fotogrammi 17k+5

Con un frame rate standard di 24 fps, questa matematica determina durate temporali esatte:

  • k = 0 (5 fotogrammi): ~0,21 secondi (micro-movimento o burst statico)
  • k = 1 (22 fotogrammi): ~0,91 secondi (fetta d'azione rapida)
  • k = 3 (56 fotogrammi): ~2,33 secondi (sequenza di inquadratura breve)
  • k = 8 (141 fotogrammi): ~5,87 secondi (limite massimo del clip standard)

Impostare un conteggio di destinazione a 60 costringe ComfyUI a scartare 4 fotogrammi scendendo a 56 (k=3), sprecando calcolo VRAM durante il campionamento. Agganciare sempre i parametri del nodo al confine esatto del passo 17k + 5 prima di accodare un batch di generazione.

Ottimizzazione della velocità: abilitazione dell'esecuzione Turbo LoRA a 8 passaggi

Trascorrere oltre sei minuti in attesa del rendering di un singolo video di anteprima di 6 secondi rende quasi impossibile l'iterazione rapida dei prompt su GPU consumer. Il campionamento standard richiede da 20 a 30 passaggi, creando un grave collo di bottiglia operativo quando si modificano i segnali di movimento, si testano i movimenti della telecamera o si valutano le transizioni dei fotogrammi chiave.

Integrazione dei pesi di distillazione Turbo

Integrare il file di peso ufficiale minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 riduce i passaggi di campionamento a un flusso di lavoro di inferenza a 8 passaggi. Questo processo di distillazione ottiene un'ottimizzazione significativa della velocità di generazione senza compromettere la coerenza visiva complessiva.

Per configurare questa distillazione in ComfyUI:

  1. Posizionare i pesi del modello: Spostare minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors nella directory ComfyUI/models/loras/.
  2. Collegare il nodo LoraLoader: Instradare il tensore del modello di diffusione primario attraverso un nodo LoraLoader prima di inviarlo al campionatore. Impostare turbo_model_strength a 1.0.
  3. Regolare il conteggio dei passaggi: Ridurre il parametro steps nel nodo MiniMaxH3Sampler dal valore standard di 20 a esattamente 8.
  4. Bloccare la scala CFG: Forzare il parametro della scala di guida senza classificatore a 1.0 per evitare la sovrasaturazione.

Benchmark delle prestazioni: esecuzione standard vs. Turbo

   
Parametro / metrica di benchmarkPipeline di campionamento standardEsecuzione Turbo LoRA a 8 passaggi
Conteggio passaggi di inferenzaDa 20 a 30 passaggi8 passaggi
Tempo di rendering (RTX 4090, 2K)~380 secondi~145 secondi
Scala di guida CFG3.5 a 6.0Fisso a 1.0 (distillato)
Uso produttivo principaleRendering finali masterPre-visualizzazione rapida e bozzetti di scena
Stabilità temporaleRicostruzione completaLievi tremolii sui bordi in fisica particellare complessa

Quando si esegue minimax_h3_fl2v_turbo_8step, impostare CFG sopra 1.0 forza passaggi di doppio condizionamento inutili, causando bruciature estreme dei colori, sbiancamenti del contrasto e lacerazioni spaziali attraverso fotogrammi ad alto movimento. Attivare turbo_mode con una forza Turbo LoRA fissa di 1.0 consente ai creatori di convalidare movimenti complessi della telecamera in meno di tre minuti prima di impegnarsi in rendering di produzione completi a 20 passaggi.

Risoluzione degli errori comuni del grafo ComfyUI MiniMax H3

La maggior parte dei guasti operativi nei grafi MiniMax H3 deriva da piccoli disallineamenti di allineamento dei tensori, decodificatori audio non collegati o colli di bottiglia della memoria GPU durante il caricamento del modello.

Guida diagnostica e correzioni rapide

  1. CUDA Out of Memory (OOM)

    1. Causa principale: Caricamento del codificatore di testo 32B insieme ai pesi di diffusione int8 su GPU con 16 GB di VRAM senza offloading della memoria.
    2. Correzione passo-passo: Aggiungere i flag di avvio --lowvram o --medvram allo script di avvio di ComfyUI. Per configurazioni con memoria GPU limitata, considerare l'esecuzione di MiniMax H3 in ComfyUI con quantizzazione GGUF per abbassare i requisiti di memoria di base. Assicurarsi che qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors sia posizionato rigorosamente all'interno di models/text_encoders/, consentendo l'offloading VRAM tra l'analisi del testo e i passaggi di campionamento.
  2. Errore di disallineamento della forma (Shape Mismatch)

    1. Causa principale: Valori personalizzati di larghezza/altezza o immagini di fotogrammi chiave in ingresso violano la griglia di divisibilità spaziale richiesta di 32 pixel.
    2. Correzione passo-passo: Inserire un nodo ResolutionSelector o ImageScaleToTotalPixels prima del campionatore per forzare tutte le dimensioni della tela e dell'immagine al multiplo più vicino di 32.
  3. Traccia audio mancante nell'esportazione

    1. Causa principale: Il percorso del VAE audio è scollegato o bypassato durante l'esecuzione del grafo.
    2. Correzione passo-passo: Collegare minimax_h3_audio_vae_fp32 nel nodo VAEDecodeAudio, quindi instradare i latenti audio decodificati nella porta audio del nodo SaveVideo insieme al flusso video.
  4. Errore del nodo GetImageSize

    1. Causa principale: Proporzioni dei fotogrammi chiave non corrispondenti o batch di immagini multi-fotogramma non validi inviati agli ingressi del campionatore I2V.
    2. Correzione passo-passo: Eseguire sia le immagini iniziali che quelle terminali attraverso un nodo ImageScaleToTotalPixels unificato per bloccare i fotogrammi chiave a dimensioni identiche prima dell'inizializzazione latente.
  5. Avviso di nodi mancanti in ComfyUI Manager

    1. Causa principale: I pacchetti di nodi personalizzati MiniMax H3 richiesti non sono indicizzati o mancano nell'ambiente locale.
    2. Correzione passo-passo: Aprire ComfyUI Manager, selezionare Install Missing Custom Nodes, cercare ComfyUI-MiniMaxH3-Easy, fare clic su Install e riavviare ComfyUI.

Risoluzione dei cali di memoria e dei conflitti di registro dei nodi

Molti tutorial tralasciano come ComfyUI gestisca l'allocazione VRAM tra generazioni consecutive. Se si verifica un improvviso errore CUDA Out of Memory al secondo o terzo tentativo di rendering nonostante un primo passaggio riuscito, ComfyUI ha mantenuto il codificatore di testo in VRAM. Impostare flag di offload espliciti nello script di avvio libera la memoria allocata tra i passaggi del campionatore.

Quando si aprono file JSON della community, gli avvisi di nodi mancanti in ComfyUI Manager di solito indicano registri di nodi obsoleti. L'installazione di ComfyUI-MiniMaxH3-Easy risolve direttamente queste dipendenze mancanti. Per le pipeline I2V, la risoluzione di un errore di GetImageSize o di un errore di disallineamento della forma richiede di assicurarsi che sia le immagini dei fotogrammi chiave iniziali che quelle terminali corrispondano ai limiti di pixel di destinazione.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli