Seedance 2.5 już dostępne — Jako pierwsze na Atlas Cloud

MiniMax H3 ComfyUI Workflow: Kompletny przewodnik dla T2V i I2V

Opanuj przepływ pracy MiniMax H3 ComfyUI dla T2V i I2V. Poznaj zasady siatki przestrzennej, podwójne routowanie audio VAE, matematykę ramek 17k+5 oraz konfigurację 8-stopniowego Turbo LoRA.

MiniMax H3 ComfyUI Workflow: Kompletny przewodnik dla T2V i I2V

Wykonanie MiniMax H3 w ComfyUI wymaga ścisłego przestrzegania reguł siatki przestrzennej i czasowej, aby uniknąć błędów kształtu tensorów, cichych eksportów MP4 lub awarii modelu. MiniMax H3 rozwiązuje te wąskie gardła, syntetyzując wideo 2K i natywny zsynchronizowany dźwięk stereo w jednym przejściu w przód.

Najważniejsze wnioski: Przepływ pracy MiniMax H3 w ComfyUI

  • Natywne multimodalne przejście: MiniMax H3 syntetyzuje wideo 2K i zsynchronizowany dźwięk stereo 32 kHz bezpośrednio w jednym przejściu dyfuzyjnym ComfyUI.
  • Próg sprzętowy: Wymaga minimum 16 GB VRAM dla wykonania w INT8, zalecane 24 GB dla natywnego renderowania 2K.
  • Reguła siatki przestrzennej: Rozdzielczość płótna i klatek kluczowych musi być ściśle podzielna przez 32, np. 1344×768, aby uniknąć błędów kształtu tensora przestrzennego VAE.
  • Wzór siatki czasowej: Długość klipów musi być zgodna z równaniem Całkowita liczba klatek = 17k + 5 (5, 22, 39, 56, 141 klatek przy 24 kl/s), aby uniknąć przycięcia latentów.
  • Optymalizacja prędkości: Obsługuje oficjalną Turbo LoRA 8-krokową, aby skrócić czas renderowania o ~60% przy CFG zablokowanym na 1.0.

Podczas gdy Text-to-Video (T2V) opiera się na czysto tekstowej inicjalizacji latentów, Image-to-Video (I2V) kotwiczy trajektorie ruchu za pomocą węzłów warunkujących first_frame, last_frame lub MiniMaxH3AddGuide. Poniższe sekcje opisują kompletne przygotowanie środowiska, schematy połączeń węzłów oraz protokoły rozwiązywania problemów dla obu potoków.

Podstawowe wymagania wstępne i struktura katalogów modeli

Umieszczenie 32B enkodera tekstu w models/checkpoints zamiast models/text_encoders spowoduje zawieszenie ComfyUI podczas kompilacji grafu lub zakończy się błędem KeyError bez użytecznej informacji. Większość błędów konfiguracji wynika z umieszczenia plików w niewłaściwych podfolderach lub zastąpienia niestandardowego enkodera tekstu wizyjnego, wymaganego przez MiniMax H3, standardowymi wagami Qwen.

Zrzut ekranu konfiguracji grafu węzłów w ComfyUI pokazujący CLIP Text Encode, KSampler, EmptySD3LatentImage i Load VEA skonfigurowane do generowania wideo MiniMax H3

Wymagania dotyczące zgodności systemu

Przed pobraniem wag modeli upewnij się, że Twoja instalacja spełnia poniższe minimalne wymagania sprzętowe i środowiskowe:

  • Rdzeń ComfyUI: Wersja v0.30.0 lub wyższa.
  • Niestandardowe węzły: ComfyUI-MiniMaxH3-Easy lub oficjalny pakiet Comfy-Org.
  • GPU VRAM: 16 GB (min. dla INT8) / 24 GB (zalecane dla 2K).
  • Stos oprogramowania: Python 3.10+ z PyTorch 2.4+ i CUDA 12.1+.

Tabela rozmieszczenia katalogów modeli

Pobierz oficjalne wagi modelu MiniMax H3 open-source z repozytorium modeli Hugging Face i umieść każdy plik w wyznaczonym podfolderze docelowym.

    
Kategoria modeluDokładna nazwa plikuKatalog docelowyUwagi i precyzja
Model dyfuzyjny (T2V/FL2V)minimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/Podstawowy model dyfuzyjny w INT8
Model dyfuzyjny (Ref2V)minimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/Wymagany do grafów z prowadzeniem referencyjnym
Enkoder tekstuqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/Niestandardowe 4-bitowe wagi wizyjno-językowe
VAE wideominimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/Dekoder przestrzenny wizualny w FP16
VAE audiominimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/Dekoder akustyczny w FP32 (zapobiega przycinaniu)
Turbo LoRA (opcjonalnie)minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensorsComfyUI/models/loras/Umożliwia szybką inferencję w 8 krokach

Krytyczna uwaga dotycząca instalacji

Plik qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors to niestandardowy, 4-bitowy enkoder wizyjno-tekstowy (architektura Qwen3-VL) z kwantyzacją AWQ, specjalnie dostrojony do warunkowania promptów w MiniMax H3. Nie zastępuj go standardowymi transformerami językowymi w folderze text_encoders, ponieważ ogólne modele językowe nie mają multimodalnej projekcji wizyjnej wymaganej do generowania latentów wideo.

Budowanie grafu węzłów Text-to-Video (T2V) w ComfyUI

Zbudowanie czystego grafu węzłów Text-to-Video (T2V) w ComfyUI wymaga przeprowadzenia osadzeń tekstowych, ustawień rozdzielczości przestrzennej i tensorów ramek latentów w ścisłej, liniowej sekwencji.

Uwaga dotycząca pakietów węzłów: Nazwy węzłów używane w tym przewodniku, takie jak MiniMaxH3TextToVideo i MiniMaxH3ImageToVideo, odnoszą się do niestandardowego pakietu ComfyUI-MiniMaxH3-Easy. Jeśli używasz oficjalnego pakietu Comfy-Org, te operacje są podzielone na osobne węzły MiniMaxH3Sampler i MiniMaxH3Conditioning.

Instrukcja krok po kroku łączenia węzłów T2V

Diagram grafu węzłów Text-to-Video w ComfyUI ilustrujący warunkowanie promptu tekstowego, skalowanie rozdzielczości, próbnik MiniMaxH3TextToVideo i dekodowanie VAE wideo

Ustawienie generacji latentów T2V wymaga oddzielenia warunkowania tekstowego i parametrów przestrzennych przed wykonaniem przejścia próbnika.

  1. Połączenie enkodera tekstu: Przekaż węzeł promptu tekstowego do ładowarki enkodera wizyjno-tekstowego Qwen3-VL. Wyślij tensor wyjściowy bezpośrednio do portu dodatniego warunkowania promptu węzła MiniMaxH3TextToVideo.
  2. Obliczenie wymiarów przestrzennych: Przekaż wartości wyjściowe z ResolutionSelector do ImageScaleToTotalPixels. Ten krok oblicza alokację pikseli, wymuszając wymiary przestrzenne podzielne przez 32.
  3. Próbnik i generacja latentów: Przekaż wagi modelu, tensory dodatniego warunkowania i parametry rozdzielczości bezpośrednio do MiniMaxH3TextToVideo, aby wygenerować surowy latent wideo.
  4. Dekodowanie VAE i eksport wideo: Wyślij tensor latentów przez minimax_h3_video_vae_fp16 w celu dekodowania, a następnie przekaż wyrenderowaną partię ramek bezpośrednio do SaveVideo.

Tabela połączeń węzłów T2V

Aby zbudować ten graf bez przerwanych zależności, postępuj zgodnie z dokładnymi połączeniami portów węzłów opisanymi poniżej:

     
Węzeł źródłowyPort wyjściowyWęzeł docelowyPort wejściowyFunkcja w przepływie
Enkoder Qwen3-VLCONDITIONINGMiniMaxH3TextToVideopositiveKieruje połączeniem enkodera tekstu
ResolutionSelectorWIDTH / HEIGHTImageScaleToTotalPixelswidth / heightUstawia granice proporcji
ImageScaleToTotalPixelsIMAGE_BOUNDSMiniMaxH3TextToVideoresolutionWymusza siatkę przestrzenną 32 pikseli
MiniMaxH3TextToVideoLATENTVAEDecodesamplesSteruje generacją latentów T2V
VAEDecodeIMAGESaveVideopixelsRenderuje końcowe wyjście wideo MP4

MiniMax H3 opiera się prawie wyłącznie na szczegółowych promptach dodatnich analizowanych przez model wizyjno-językowy Qwen3-VL, co oznacza, że tradycyjne węzły warunkowania negatywnego dodają niepotrzebne obciążenie obliczeniowe bez poprawy jakości wyniku. Połączenie SaveVideo bezpośrednio z węzłem dekodowania VAE wideo zapewnia prawidłowe renderowanie MP4 przy 24 kl/s bez odrzucania końcowych ramek.

Budowanie przepływu Image-to-Video (I2V) i pierwsza/ostatnia ramka

Zrzut ekranu konfiguracji grafu węzłów Image-to-Video w ComfyUI pokazujący podwójne węzły LoadImage, dopasowanie wymiarów GetImageSize i interpolację klatek kluczowych MiniMaxH3ImageToVideo

Próba animowania statycznego portretu lub połączenia dwóch klatek kluczowych często kończy się gwałtownym zniekształcaniem obiektu lub natychmiastowym błędem kształtu tensora, gdy obrazy początkowe i końcowe różnią się nawet o kilka pikseli. Przekształcenie standardowego potoku tekstowego w przepływ Image-to-Video (I2V) wymaga zastąpienia podstawowego węzła próbnika i ustanowienia precyzyjnych potoków warunkowania obrazu dla ramek początkowych i końcowych.

Interpolacja klatek kluczowych i konfiguracja węzłów

Aby przejść z T2V do generowania wideo w trybie pierwsza-ostatnia ramka (FL2V), zastąp MiniMaxH3TextToVideo węzłem MiniMaxH3ImageToVideo. Ten węzeł udostępnia dedykowane porty wejściowe dla first_frame i last_frame, umożliwiając zdefiniowanie stanów początkowych, końcowych lub pełnych przejść morfingu.

  1. Węzły LoadImage: Umieść dwa węzły LoadImage na płótnie, aby przechowywać obrazy początkowe i docelowe.
  2. Dopasowanie wymiarów: Przekaż wyjścia obrazów przez GetImageSize, aby wyodrębnić surowe wymiary szerokości i wysokości. Zapobiega to niezgodności siatki przestrzennej przed wejściem tensorów do próbnika.
  3. Warunkowanie tensorów: Połącz przetworzone tensory pikseli z portem first_frame dla standardowej animacji pojedynczego obrazu lub wypełnij zarówno first_frame, jak i last_frame, aby wykonać interpolację klatek kluczowych.

Tabela połączeń węzłów I2V i FL2V

     
Węzeł źródłowyPort wyjściowyWęzeł docelowyPort wejściowyFunkcja w potoku
LoadImage (Start)IMAGEMiniMaxH3ImageToVideofirst_frameUstanawia początkowe warunkowanie obrazu
LoadImage (End)IMAGEMiniMaxH3ImageToVideolast_frameUstawia ramkę końcową dla morfingu FL2V
GetImageSizeWIDTH / HEIGHTResolutionSelectorwidth / heightBlokuje proporcje wejściowe do wielokrotności 32
Enkoder Qwen3-VLCONDITIONINGMiniMaxH3ImageToVideopositiveKieruje trajektorią ruchu za pomocą promptów tekstowych
MiniMaxH3ImageToVideoLATENTVAEDecodesamplesWysyła latenty FL2V do VAE wideo

MiniMax H3 wymusza ścisłą zgodność wymiarów między wejściami klatek kluczowych. Obie klatki kluczowe muszą mieć dokładnie tę samą rozdzielczość przestrzenną. Jeśli first_frame i last_frame różnią się rozmiarem, próbkowanie zatrzymuje się podczas inicjalizacji latentów. Przekaż oba obrazy przez ten sam węzeł skalowania, aby zapewnić identyczne wymiary pikseli.

Zaawansowane prowadzenie referencyjne za pomocą MiniMaxH3AddGuide

Standardowe grafy Image-to-Video kontrolują tylko pierwszą i ostatnią ramkę, pozostawiając ruch pośredni bez zakotwiczenia. Węzeł MiniMaxH3AddGuide rozwiązuje ten problem, kotwicząc obrazy referencyjne, partie obrazów wieloklatkowych lub ścieżki audio w określonym frame_idx wzdłuż osi czasu generacji.

Podstawowe możliwości MiniMaxH3AddGuide

   
Parametr wejściowyZachowanie kotwiczeniaReguły ograniczeń
frame_idxOkreśla dokładny indeks docelowej ramkiWartości ujemne liczą wstecz od końca wideo.
Obraz / Wiele ramekBlokuje spójność postaci lub układ scenyPartie poniżej 5 ramek używają pierwszego obrazu; partie 5+ dopasowują się do długości klipów $17k + 5$ (5, 22, 39).
Ścieżka audioWyrównuje dialog lub efekty dźwiękowe w indeksieAutomatycznie przycina do pozostałego czasu trwania wideo.

Jak łączyć węzły kotwiczące do generowania wideo referencyjnego

Łączenie kilku węzłów MiniMaxH3AddGuide umożliwia pełne generowanie wideo referencyjnego (R2V):

  1. Kotwica głównej postaci: Połącz swoje dodatnie warunkowanie z MiniMaxH3AddGuide z frame_idx ustawionym na 0, aby zablokować tożsamość postaci na początku.
  2. Klatka kluczowa ruchu w środku sekwencji: Połącz drugi węzeł MiniMaxH3AddGuide, podając obraz klatki kluczowej przy frame_idx 60, aby wymusić przyjęcie przez postać określonej pozy w środku sceny.
  3. Sprzężenie audio: Połącz docelową ścieżkę dźwiękową z portem audio i przekaż swoje audio_vae, aby zsynchronizować dźwięk bezpośrednio w tym przesunięciu osi czasu.

Łączenie tych kotwic warunkujących utrzymuje stabilność czasową bez wymuszania ponownej inicjalizacji latentów przez próbnik dyfuzyjny.

Integracja zsynchronizowanego natywnego dźwięku z podwójnym routingiem VAE

Zrzut ekranu grafu węzłów podwójnego routingu VAE w ComfyUI pokazujący dekoder VAE wideo i dekoder VAE audio multipleksowane w SaveVideo do eksportu zsynchronizowanego dźwięku stereo

Twórcy spędzają godzinami na ręcznym wyrównywaniu zewnętrznych ścieżek mowy w oprogramowaniu do edycji wideo, tylko po to, by zmierzyć się z nienaturalnym dryfem synchronizacji ust lub niedopasowanym szumem tła pomieszczenia. MiniMax H3 eliminuje potrzebę poprodukcyjnego wyrównywania dźwięku, opierając się na prawdziwej generacji multimodalnej, syntetyzując ramki wideo i 32 kHz dźwięk stereo razem w jednym przejściu w przód.

Architektura strumienia jednoprzebiegowego

W przeciwieństwie do tradycyjnych potoków, które łączą osobne modele tekstu na mowę po renderowaniu wideo, MiniMax H3 przetwarza wskazówki tekstowe, obrazowe i czasowe w jednolitą przestrzeń latentów. W fazie usuwania szumów SamplerCustomAdvanced zwraca złożoną porcję latentów zawierającą zarówno mapy cech wizualnych, jak i akustycznych. Ta wspólna synteza gwarantuje precyzyjną synchronizację dialogu i organiczną generację efektów dźwiękowych dokładnie dopasowanych do akcji na ekranie.

Podwójne dekodowanie VAE i konfiguracja węzłów

Aby przekształcić surowe latenty w odtwarzalne media, graf dzieli wyjście na dwie oddzielne ścieżki dekodowania przed multipleksowaniem MP4.

    
Składnik węzłaZasób modelu / precyzjaFunkcjaMiejsce docelowe wyjścia
Ładowarka VAE wideominimax_h3_video_vae_fp16.safetensorsDekoduje latenty wizualne na sekwencje ramek RGBVAEDecode -> CreateVideo (strumień wideo)
Ładowarka VAE audiominimax_h3_audio_vae_fp32.safetensorsDekoduje latenty akustyczne na nieskompresowane sygnały audioVAEDecodeAudio -> CreateVideo (strumień audio)
Zapisywacz wideoSaveVideoMultipleksuje strumienie wideo i natywnego dźwięku stereoZakodowany plik MP4

Techniczna konfiguracja węzłów

  1. Załaduj podwójne VAE: Dodaj dwa osobne węzły VAELoader do swojego płótna. Wskaż pierwszy na minimax_h3_video_vae_fp16.safetensors, a drugi na minimax_h3_audio_vae_fp32.safetensors.
  2. Wykonaj podwójne dekodowanie VAE: Przekaż wyjście wizualnych latentów z próbnika do VAEDecode, a porcję latentów audio do VAEDecodeAudio. Utrzymanie minimax_h3_audio_vae_fp32 w precyzji FP32 zapobiega artefaktom przycinania i zniekształceniom częstotliwości w ścieżkach dźwiękowych.
  3. Multipleksowanie przez SaveVideo: Podaj zdekodowany tensor obrazu i nieskompresowaną falę dźwiękową do CreateVideo lub bezpośrednio do SaveVideo. Węzeł zajmuje się końcowym pakowaniem kontenera, zapisując gotowy plik MP4 z wbudowanym dźwiękiem stereo przy 24 kl/s.

To natywne, podwójne ustawienie strumienia zapewnia dokładną fazowo realizację dźwięku bezpośrednio w ComfyUI, bez konieczności stosowania zewnętrznych wtyczek do synchronizacji ust.

Matematyka rozdzielczości, ograniczenia proporcji i przyciąganie do siatki ramek

Wprowadzenie standardowej rozdzielczości 1920x1080 lub ustawienie długości klipu na 60 klatek w ComfyUI natychmiast spowoduje awarię kolejki renderowania z błędem kształtu tensora lub pozostawi mocno zniekształcone krawędzie. MiniMax H3 wymusza sztywne matematyczne granice dla wymiarów przestrzennych i czasów trwania klipów, ponieważ jego architektura 3D VAE kompresuje latenty wideo w określonych blokach przestrzennych i krokach czasowych.

Wymiary przestrzenne i ustawienia proporcji

VAE przestrzenne zmniejsza próbkowanie wejść o współczynnik 32. Jeśli docelowa szerokość lub wysokość nie jest ścisłą wielokrotnością 32, próbnik dyfuzyjny zawodzi podczas alokacji tensorów brzegowych. Model celuje w natywną krótką krawędź 768px, równoważąc wierność wizualną z docelowym budżetem megapikseli.

    
ProporcjeUstawione wymiary (px)Sprawdzenie podzielnościOrientacja docelowa
16:091344 x 7681344 / 32 = 42, 768 / 32 = 24Szeroki ekran poziom
9:16768 x 1344768 / 32 = 24, 1344 / 32 = 42Pionowy mobile / UGC
1:011024 x 10241024 / 32 = 32, 1024 / 32 = 32Kwadrat
21:091536 x 6721536 / 32 = 48, 672 / 32 = 21Kinowy ultrawide

Użycie niestandardowych wymiarów pikseli zmusza VAE do rozciągania lub dopełniania map cech, pogarszając drobne szczegóły tekstury.

Reguła siatki ramek 17k + 5

Przyciąganie wymiarów czasowych podlega równie sztywnej regule. Aby pozostać w granicach limitów długości wideo MiniMax H3, architektura przetwarza sekwencje wideo w 17-ramkowych porcjach latentów z 5-ramkowym ogonem inicjalizacyjnym. Aby uniknąć czasowego przycięcia lub cichych awarii dekodowania VAE, każde renderowanie musi spełniać równanie siatki ramek 17k + 5, gdzie k reprezentuje całkowity licznik kroków.

Wzór reguły siatki ramek 17k+5

Przy standardowej prędkości klatek 24 kl/s, ta matematyka określa dokładne czasy trwania:

  • k = 0 (5 klatek): ~0,21 sekundy (mikroruch lub statyczny wybuch)
  • k = 1 (22 klatki): ~0,91 sekundy (szybki wycinek akcji)
  • k = 3 (56 klatek): ~2,33 sekundy (krótka sekwencja ujęcia)
  • k = 8 (141 klatek): ~5,87 sekundy (pełny standardowy limit klipu)

Ustawienie docelowej liczby na 60 zmusza ComfyUI do odrzucenia 4 klatek w dół do 56 (k=3), marnując obliczenia VRAM podczas próbkowania. Zawsze przyciągaj parametry węzła do dokładnej granicy kroku 17k + 5 przed kolejkowaniem partii generacji.

Optymalizacja prędkości: włączanie 8-krokowej Turbo LoRA

Spędzanie ponad sześciu minut na oczekiwaniu na renderowanie pojedynczego 6-sekundowego wideo podglądowego sprawia, że szybka iteracja promptów jest prawie niemożliwa na konsumenckich GPU. Standardowe próbkowanie wymaga od 20 do 30 kroków, tworząc poważne wąskie gardło operacyjne podczas dostrajania wskazówek ruchu, testowania ruchów kamery lub oceny przejść klatek kluczowych.

Integracja wag destylacji Turbo

Zintegrowanie oficjalnego pliku wag minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 zmniejsza liczbę przejść próbkowania do 8-krokowego przepływu inferencji. Ten proces destylacji osiąga znaczącą optymalizację prędkości generacji bez utraty ogólnej spójności wizualnej.

Aby skonfigurować to ustawienie destylacji w ComfyUI:

  1. Umieść wagi modelu: Przenieś minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors do katalogu ComfyUI/models/loras/.
  2. Podłącz węzeł LoraLoader: Przekaż tensor głównego modelu dyfuzyjnego przez węzeł LoraLoader przed podaniem go do próbnika. Ustaw turbo_model_strength na 1.0.
  3. Dostosuj liczbę kroków: Zmniejsz parametr steps w węźle MiniMaxH3Sampler ze standardowych 20 na dokładnie 8.
  4. Zablokuj skalę CFG: Ustaw parametr skali prowadzenia bez klasyfikatora na 1.0, aby uniknąć przesycenia.

Porównanie wydajności: standardowa vs. Turbo

   
Parametr / metryka porównawczaStandardowy potok próbkowania8-krokowa Turbo LoRA
Liczba kroków inferencji20 do 30 kroków8 kroków
Czas renderowania (RTX 4090, 2K)~380 sekund~145 sekund
Skala prowadzenia CFG3,5 do 6,0Stała na 1.0 (destylowana)
Główne zastosowanie produkcyjneKońcowe renderowanie główneSzybka prewizualizacja i szkice scen
Stabilność czasowaPełna rekonstrukcjaNiewielkie drgania krawędzi przy złożonych fizykach cząstek

Podczas używania minimax_h3_fl2v_turbo_8step, ustawienie CFG powyżej 1.0 wymusza niepotrzebne podwójne przejścia warunkowania, powodując ekstremalne wypalanie kolorów, kontrastowe przebicia i przestrzenne rozdarcia na ramkach o dużym ruchu. Aktywacja turbo_mode ze stałą siłą Turbo LoRA 1.0 pozwala twórcom zweryfikować złożone ruchy kamery w mniej niż trzy minuty przed przejściem do pełnych 20-krokowych renderów produkcyjnych.

Rozwiązywanie typowych błędów grafu MiniMax H3 w ComfyUI

Większość błędów operacyjnych w grafach MiniMax H3 wynika z drobnych niezgodności tensorów, niepodłączonych dekoderów audio lub wąskich gardeł pamięci GPU podczas ładowania modelu.

Przewodnik diagnostyczny i szybkie poprawki

  1. Brak pamięci CUDA (OOM)

    1. Główna przyczyna: Ładowanie 32B enkodera tekstu obok wag dyfuzyjnych int8 na GPU z 16GB VRAM bez wyładowywania pamięci.
    2. Poprawka krok po kroku: Dodaj flagi --lowvram lub --medvram do skryptu uruchamiania ComfyUI. W przypadku ciasnych konfiguracji pamięci GPU rozważ uruchomienie MiniMax H3 w ComfyUI z kwantyzacją GGUF, aby obniżyć bazowe wymagania pamięciowe. Upewnij się, że qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors znajduje się ściśle w models/text_encoders/, co pozwala na wyładowanie VRAM między analizą tekstu a przejściami próbkowania.
  2. Błąd niezgodności kształtu

    1. Główna przyczyna: Niestandardowe wartości szerokości/wysokości lub wejściowe obrazy klatek kluczowych naruszają wymaganą siatkę podzielności przestrzennej przez 32 piksele.
    2. Poprawka krok po kroku: Wstaw węzeł ResolutionSelector lub ImageScaleToTotalPixels przed próbnikiem, aby wymusić wszystkie wymiary płótna i obrazu do najbliższej wielokrotności 32.
  3. Brak ścieżki audio w eksporcie

    1. Główna przyczyna: Ścieżka VAE audio jest niepodłączona lub pominięta podczas wykonywania grafu.
    2. Poprawka krok po kroku: Podłącz minimax_h3_audio_vae_fp32 do węzła VAEDecodeAudio, a następnie przekaż zdekodowane latenty audio do portu audio węzła SaveVideo wraz ze strumieniem wideo.
  4. Błąd węzła GetImageSize

    1. Główna przyczyna: Niezgodność proporcji klatek kluczowych lub nieprawidłowe partie obrazów wieloklatkowych podawane do wejść próbnika I2V.
    2. Poprawka krok po kroku: Przeprowadź zarówno obrazy początkowe, jak i końcowe przez ujednolicony węzeł ImageScaleToTotalPixels, aby zablokować klatki kluczowe do identycznych wymiarów przed inicjalizacją latentów.
  5. Ostrzeżenie o brakujących węzłach w ComfyUI Manager

    1. Główna przyczyna: Wymagane niestandardowe pakiety węzłów MiniMax H3 są niezindeksowane lub brakujące w lokalnym środowisku.
    2. Poprawka krok po kroku: Otwórz ComfyUI Manager, wybierz Zainstaluj brakujące węzły niestandardowe, wyszukaj ComfyUI-MiniMaxH3-Easy, kliknij Zainstaluj i uruchom ponownie ComfyUI.

Rozwiązywanie problemów z pamięcią i konfliktami rejestrów węzłów

Wiele samouczków pomija sposób, w jaki ComfyUI zarządza alokacją VRAM w kolejnych generacjach. Jeśli po udanym pierwszym przejściu podczas drugiej lub trzeciej próby renderowania pojawi się nagły błąd braku pamięci CUDA, oznacza to, że ComfyUI zatrzymał enkoder tekstu w VRAM. Ustawienie jawnych flag wyładowania w skrypcie uruchamiania zwalnia przydzieloną pamięć między krokami próbnika.

Podczas otwierania plików JSON społeczności, ostrzeżenia o brakujących węzłach w ComfyUI Manager zwykle wskazują na nieaktualne rejestry węzłów. Zainstalowanie ComfyUI-MiniMaxH3-Easy bezpośrednio naprawia te brakujące zależności. W przypadku potoków I2V, rozwiązanie błędu GetImageSize lub niezgodności kształtu wymaga zapewnienia, że zarówno obrazy początkowe, jak i końcowe klatek kluczowych pasują do docelowych granic pikseli.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele