Wykonanie MiniMax H3 w ComfyUI wymaga ścisłego przestrzegania reguł siatki przestrzennej i czasowej, aby uniknąć błędów kształtu tensorów, cichych eksportów MP4 lub awarii modelu. MiniMax H3 rozwiązuje te wąskie gardła, syntetyzując wideo 2K i natywny zsynchronizowany dźwięk stereo w jednym przejściu w przód.
Najważniejsze wnioski: Przepływ pracy MiniMax H3 w ComfyUI
- Natywne multimodalne przejście: MiniMax H3 syntetyzuje wideo 2K i zsynchronizowany dźwięk stereo 32 kHz bezpośrednio w jednym przejściu dyfuzyjnym ComfyUI.
- Próg sprzętowy: Wymaga minimum 16 GB VRAM dla wykonania w INT8, zalecane 24 GB dla natywnego renderowania 2K.
- Reguła siatki przestrzennej: Rozdzielczość płótna i klatek kluczowych musi być ściśle podzielna przez 32, np. 1344×768, aby uniknąć błędów kształtu tensora przestrzennego VAE.
- Wzór siatki czasowej: Długość klipów musi być zgodna z równaniem Całkowita liczba klatek = 17k + 5 (5, 22, 39, 56, 141 klatek przy 24 kl/s), aby uniknąć przycięcia latentów.
- Optymalizacja prędkości: Obsługuje oficjalną Turbo LoRA 8-krokową, aby skrócić czas renderowania o ~60% przy CFG zablokowanym na 1.0.
Podczas gdy Text-to-Video (T2V) opiera się na czysto tekstowej inicjalizacji latentów, Image-to-Video (I2V) kotwiczy trajektorie ruchu za pomocą węzłów warunkujących first_frame, last_frame lub MiniMaxH3AddGuide. Poniższe sekcje opisują kompletne przygotowanie środowiska, schematy połączeń węzłów oraz protokoły rozwiązywania problemów dla obu potoków.
Podstawowe wymagania wstępne i struktura katalogów modeli
Umieszczenie 32B enkodera tekstu w models/checkpoints zamiast models/text_encoders spowoduje zawieszenie ComfyUI podczas kompilacji grafu lub zakończy się błędem KeyError bez użytecznej informacji. Większość błędów konfiguracji wynika z umieszczenia plików w niewłaściwych podfolderach lub zastąpienia niestandardowego enkodera tekstu wizyjnego, wymaganego przez MiniMax H3, standardowymi wagami Qwen.

Wymagania dotyczące zgodności systemu
Przed pobraniem wag modeli upewnij się, że Twoja instalacja spełnia poniższe minimalne wymagania sprzętowe i środowiskowe:
- Rdzeń ComfyUI: Wersja v0.30.0 lub wyższa.
- Niestandardowe węzły: ComfyUI-MiniMaxH3-Easy lub oficjalny pakiet Comfy-Org.
- GPU VRAM: 16 GB (min. dla INT8) / 24 GB (zalecane dla 2K).
- Stos oprogramowania: Python 3.10+ z PyTorch 2.4+ i CUDA 12.1+.
Tabela rozmieszczenia katalogów modeli
Pobierz oficjalne wagi modelu MiniMax H3 open-source z repozytorium modeli Hugging Face i umieść każdy plik w wyznaczonym podfolderze docelowym.
| Kategoria modelu | Dokładna nazwa pliku | Katalog docelowy | Uwagi i precyzja |
| Model dyfuzyjny (T2V/FL2V) | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | Podstawowy model dyfuzyjny w INT8 |
| Model dyfuzyjny (Ref2V) | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | Wymagany do grafów z prowadzeniem referencyjnym |
| Enkoder tekstu | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ | Niestandardowe 4-bitowe wagi wizyjno-językowe |
| VAE wideo | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ | Dekoder przestrzenny wizualny w FP16 |
| VAE audio | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ | Dekoder akustyczny w FP32 (zapobiega przycinaniu) |
| Turbo LoRA (opcjonalnie) | minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors | ComfyUI/models/loras/ | Umożliwia szybką inferencję w 8 krokach |
Krytyczna uwaga dotycząca instalacji
Plik qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors to niestandardowy, 4-bitowy enkoder wizyjno-tekstowy (architektura Qwen3-VL) z kwantyzacją AWQ, specjalnie dostrojony do warunkowania promptów w MiniMax H3. Nie zastępuj go standardowymi transformerami językowymi w folderze text_encoders, ponieważ ogólne modele językowe nie mają multimodalnej projekcji wizyjnej wymaganej do generowania latentów wideo.
Budowanie grafu węzłów Text-to-Video (T2V) w ComfyUI
Zbudowanie czystego grafu węzłów Text-to-Video (T2V) w ComfyUI wymaga przeprowadzenia osadzeń tekstowych, ustawień rozdzielczości przestrzennej i tensorów ramek latentów w ścisłej, liniowej sekwencji.
Uwaga dotycząca pakietów węzłów: Nazwy węzłów używane w tym przewodniku, takie jak MiniMaxH3TextToVideo i MiniMaxH3ImageToVideo, odnoszą się do niestandardowego pakietu ComfyUI-MiniMaxH3-Easy. Jeśli używasz oficjalnego pakietu Comfy-Org, te operacje są podzielone na osobne węzły MiniMaxH3Sampler i MiniMaxH3Conditioning.
Instrukcja krok po kroku łączenia węzłów T2V

Ustawienie generacji latentów T2V wymaga oddzielenia warunkowania tekstowego i parametrów przestrzennych przed wykonaniem przejścia próbnika.
- Połączenie enkodera tekstu: Przekaż węzeł promptu tekstowego do ładowarki enkodera wizyjno-tekstowego Qwen3-VL. Wyślij tensor wyjściowy bezpośrednio do portu dodatniego warunkowania promptu węzła MiniMaxH3TextToVideo.
- Obliczenie wymiarów przestrzennych: Przekaż wartości wyjściowe z ResolutionSelector do ImageScaleToTotalPixels. Ten krok oblicza alokację pikseli, wymuszając wymiary przestrzenne podzielne przez 32.
- Próbnik i generacja latentów: Przekaż wagi modelu, tensory dodatniego warunkowania i parametry rozdzielczości bezpośrednio do MiniMaxH3TextToVideo, aby wygenerować surowy latent wideo.
- Dekodowanie VAE i eksport wideo: Wyślij tensor latentów przez minimax_h3_video_vae_fp16 w celu dekodowania, a następnie przekaż wyrenderowaną partię ramek bezpośrednio do SaveVideo.
Tabela połączeń węzłów T2V
Aby zbudować ten graf bez przerwanych zależności, postępuj zgodnie z dokładnymi połączeniami portów węzłów opisanymi poniżej:
| Węzeł źródłowy | Port wyjściowy | Węzeł docelowy | Port wejściowy | Funkcja w przepływie |
| Enkoder Qwen3-VL | CONDITIONING | MiniMaxH3TextToVideo | positive | Kieruje połączeniem enkodera tekstu |
| ResolutionSelector | WIDTH / HEIGHT | ImageScaleToTotalPixels | width / height | Ustawia granice proporcji |
| ImageScaleToTotalPixels | IMAGE_BOUNDS | MiniMaxH3TextToVideo | resolution | Wymusza siatkę przestrzenną 32 pikseli |
| MiniMaxH3TextToVideo | LATENT | VAEDecode | samples | Steruje generacją latentów T2V |
| VAEDecode | IMAGE | SaveVideo | pixels | Renderuje końcowe wyjście wideo MP4 |
MiniMax H3 opiera się prawie wyłącznie na szczegółowych promptach dodatnich analizowanych przez model wizyjno-językowy Qwen3-VL, co oznacza, że tradycyjne węzły warunkowania negatywnego dodają niepotrzebne obciążenie obliczeniowe bez poprawy jakości wyniku. Połączenie SaveVideo bezpośrednio z węzłem dekodowania VAE wideo zapewnia prawidłowe renderowanie MP4 przy 24 kl/s bez odrzucania końcowych ramek.
Budowanie przepływu Image-to-Video (I2V) i pierwsza/ostatnia ramka

Próba animowania statycznego portretu lub połączenia dwóch klatek kluczowych często kończy się gwałtownym zniekształcaniem obiektu lub natychmiastowym błędem kształtu tensora, gdy obrazy początkowe i końcowe różnią się nawet o kilka pikseli. Przekształcenie standardowego potoku tekstowego w przepływ Image-to-Video (I2V) wymaga zastąpienia podstawowego węzła próbnika i ustanowienia precyzyjnych potoków warunkowania obrazu dla ramek początkowych i końcowych.
Interpolacja klatek kluczowych i konfiguracja węzłów
Aby przejść z T2V do generowania wideo w trybie pierwsza-ostatnia ramka (FL2V), zastąp MiniMaxH3TextToVideo węzłem MiniMaxH3ImageToVideo. Ten węzeł udostępnia dedykowane porty wejściowe dla first_frame i last_frame, umożliwiając zdefiniowanie stanów początkowych, końcowych lub pełnych przejść morfingu.
- Węzły LoadImage: Umieść dwa węzły LoadImage na płótnie, aby przechowywać obrazy początkowe i docelowe.
- Dopasowanie wymiarów: Przekaż wyjścia obrazów przez GetImageSize, aby wyodrębnić surowe wymiary szerokości i wysokości. Zapobiega to niezgodności siatki przestrzennej przed wejściem tensorów do próbnika.
- Warunkowanie tensorów: Połącz przetworzone tensory pikseli z portem first_frame dla standardowej animacji pojedynczego obrazu lub wypełnij zarówno first_frame, jak i last_frame, aby wykonać interpolację klatek kluczowych.
Tabela połączeń węzłów I2V i FL2V
| Węzeł źródłowy | Port wyjściowy | Węzeł docelowy | Port wejściowy | Funkcja w potoku |
| LoadImage (Start) | IMAGE | MiniMaxH3ImageToVideo | first_frame | Ustanawia początkowe warunkowanie obrazu |
| LoadImage (End) | IMAGE | MiniMaxH3ImageToVideo | last_frame | Ustawia ramkę końcową dla morfingu FL2V |
| GetImageSize | WIDTH / HEIGHT | ResolutionSelector | width / height | Blokuje proporcje wejściowe do wielokrotności 32 |
| Enkoder Qwen3-VL | CONDITIONING | MiniMaxH3ImageToVideo | positive | Kieruje trajektorią ruchu za pomocą promptów tekstowych |
| MiniMaxH3ImageToVideo | LATENT | VAEDecode | samples | Wysyła latenty FL2V do VAE wideo |
MiniMax H3 wymusza ścisłą zgodność wymiarów między wejściami klatek kluczowych. Obie klatki kluczowe muszą mieć dokładnie tę samą rozdzielczość przestrzenną. Jeśli first_frame i last_frame różnią się rozmiarem, próbkowanie zatrzymuje się podczas inicjalizacji latentów. Przekaż oba obrazy przez ten sam węzeł skalowania, aby zapewnić identyczne wymiary pikseli.
Zaawansowane prowadzenie referencyjne za pomocą MiniMaxH3AddGuide
Standardowe grafy Image-to-Video kontrolują tylko pierwszą i ostatnią ramkę, pozostawiając ruch pośredni bez zakotwiczenia. Węzeł MiniMaxH3AddGuide rozwiązuje ten problem, kotwicząc obrazy referencyjne, partie obrazów wieloklatkowych lub ścieżki audio w określonym frame_idx wzdłuż osi czasu generacji.
Podstawowe możliwości MiniMaxH3AddGuide
| Parametr wejściowy | Zachowanie kotwiczenia | Reguły ograniczeń |
| frame_idx | Określa dokładny indeks docelowej ramki | Wartości ujemne liczą wstecz od końca wideo. |
| Obraz / Wiele ramek | Blokuje spójność postaci lub układ sceny | Partie poniżej 5 ramek używają pierwszego obrazu; partie 5+ dopasowują się do długości klipów $17k + 5$ (5, 22, 39). |
| Ścieżka audio | Wyrównuje dialog lub efekty dźwiękowe w indeksie | Automatycznie przycina do pozostałego czasu trwania wideo. |
Jak łączyć węzły kotwiczące do generowania wideo referencyjnego
Łączenie kilku węzłów MiniMaxH3AddGuide umożliwia pełne generowanie wideo referencyjnego (R2V):
- Kotwica głównej postaci: Połącz swoje dodatnie warunkowanie z MiniMaxH3AddGuide z frame_idx ustawionym na 0, aby zablokować tożsamość postaci na początku.
- Klatka kluczowa ruchu w środku sekwencji: Połącz drugi węzeł MiniMaxH3AddGuide, podając obraz klatki kluczowej przy frame_idx 60, aby wymusić przyjęcie przez postać określonej pozy w środku sceny.
- Sprzężenie audio: Połącz docelową ścieżkę dźwiękową z portem audio i przekaż swoje audio_vae, aby zsynchronizować dźwięk bezpośrednio w tym przesunięciu osi czasu.
Łączenie tych kotwic warunkujących utrzymuje stabilność czasową bez wymuszania ponownej inicjalizacji latentów przez próbnik dyfuzyjny.
Integracja zsynchronizowanego natywnego dźwięku z podwójnym routingiem VAE

Twórcy spędzają godzinami na ręcznym wyrównywaniu zewnętrznych ścieżek mowy w oprogramowaniu do edycji wideo, tylko po to, by zmierzyć się z nienaturalnym dryfem synchronizacji ust lub niedopasowanym szumem tła pomieszczenia. MiniMax H3 eliminuje potrzebę poprodukcyjnego wyrównywania dźwięku, opierając się na prawdziwej generacji multimodalnej, syntetyzując ramki wideo i 32 kHz dźwięk stereo razem w jednym przejściu w przód.
Architektura strumienia jednoprzebiegowego
W przeciwieństwie do tradycyjnych potoków, które łączą osobne modele tekstu na mowę po renderowaniu wideo, MiniMax H3 przetwarza wskazówki tekstowe, obrazowe i czasowe w jednolitą przestrzeń latentów. W fazie usuwania szumów SamplerCustomAdvanced zwraca złożoną porcję latentów zawierającą zarówno mapy cech wizualnych, jak i akustycznych. Ta wspólna synteza gwarantuje precyzyjną synchronizację dialogu i organiczną generację efektów dźwiękowych dokładnie dopasowanych do akcji na ekranie.
Podwójne dekodowanie VAE i konfiguracja węzłów
Aby przekształcić surowe latenty w odtwarzalne media, graf dzieli wyjście na dwie oddzielne ścieżki dekodowania przed multipleksowaniem MP4.
| Składnik węzła | Zasób modelu / precyzja | Funkcja | Miejsce docelowe wyjścia |
| Ładowarka VAE wideo | minimax_h3_video_vae_fp16.safetensors | Dekoduje latenty wizualne na sekwencje ramek RGB | VAEDecode -> CreateVideo (strumień wideo) |
| Ładowarka VAE audio | minimax_h3_audio_vae_fp32.safetensors | Dekoduje latenty akustyczne na nieskompresowane sygnały audio | VAEDecodeAudio -> CreateVideo (strumień audio) |
| Zapisywacz wideo | SaveVideo | Multipleksuje strumienie wideo i natywnego dźwięku stereo | Zakodowany plik MP4 |
Techniczna konfiguracja węzłów
- Załaduj podwójne VAE: Dodaj dwa osobne węzły VAELoader do swojego płótna. Wskaż pierwszy na minimax_h3_video_vae_fp16.safetensors, a drugi na minimax_h3_audio_vae_fp32.safetensors.
- Wykonaj podwójne dekodowanie VAE: Przekaż wyjście wizualnych latentów z próbnika do VAEDecode, a porcję latentów audio do VAEDecodeAudio. Utrzymanie minimax_h3_audio_vae_fp32 w precyzji FP32 zapobiega artefaktom przycinania i zniekształceniom częstotliwości w ścieżkach dźwiękowych.
- Multipleksowanie przez SaveVideo: Podaj zdekodowany tensor obrazu i nieskompresowaną falę dźwiękową do CreateVideo lub bezpośrednio do SaveVideo. Węzeł zajmuje się końcowym pakowaniem kontenera, zapisując gotowy plik MP4 z wbudowanym dźwiękiem stereo przy 24 kl/s.
To natywne, podwójne ustawienie strumienia zapewnia dokładną fazowo realizację dźwięku bezpośrednio w ComfyUI, bez konieczności stosowania zewnętrznych wtyczek do synchronizacji ust.
Matematyka rozdzielczości, ograniczenia proporcji i przyciąganie do siatki ramek
Wprowadzenie standardowej rozdzielczości 1920x1080 lub ustawienie długości klipu na 60 klatek w ComfyUI natychmiast spowoduje awarię kolejki renderowania z błędem kształtu tensora lub pozostawi mocno zniekształcone krawędzie. MiniMax H3 wymusza sztywne matematyczne granice dla wymiarów przestrzennych i czasów trwania klipów, ponieważ jego architektura 3D VAE kompresuje latenty wideo w określonych blokach przestrzennych i krokach czasowych.
Wymiary przestrzenne i ustawienia proporcji
VAE przestrzenne zmniejsza próbkowanie wejść o współczynnik 32. Jeśli docelowa szerokość lub wysokość nie jest ścisłą wielokrotnością 32, próbnik dyfuzyjny zawodzi podczas alokacji tensorów brzegowych. Model celuje w natywną krótką krawędź 768px, równoważąc wierność wizualną z docelowym budżetem megapikseli.
| Proporcje | Ustawione wymiary (px) | Sprawdzenie podzielności | Orientacja docelowa |
| 16:09 | 1344 x 768 | 1344 / 32 = 42, 768 / 32 = 24 | Szeroki ekran poziom |
| 9:16 | 768 x 1344 | 768 / 32 = 24, 1344 / 32 = 42 | Pionowy mobile / UGC |
| 1:01 | 1024 x 1024 | 1024 / 32 = 32, 1024 / 32 = 32 | Kwadrat |
| 21:09 | 1536 x 672 | 1536 / 32 = 48, 672 / 32 = 21 | Kinowy ultrawide |
Użycie niestandardowych wymiarów pikseli zmusza VAE do rozciągania lub dopełniania map cech, pogarszając drobne szczegóły tekstury.
Reguła siatki ramek 17k + 5
Przyciąganie wymiarów czasowych podlega równie sztywnej regule. Aby pozostać w granicach limitów długości wideo MiniMax H3, architektura przetwarza sekwencje wideo w 17-ramkowych porcjach latentów z 5-ramkowym ogonem inicjalizacyjnym. Aby uniknąć czasowego przycięcia lub cichych awarii dekodowania VAE, każde renderowanie musi spełniać równanie siatki ramek 17k + 5, gdzie k reprezentuje całkowity licznik kroków.

Przy standardowej prędkości klatek 24 kl/s, ta matematyka określa dokładne czasy trwania:
- k = 0 (5 klatek): ~0,21 sekundy (mikroruch lub statyczny wybuch)
- k = 1 (22 klatki): ~0,91 sekundy (szybki wycinek akcji)
- k = 3 (56 klatek): ~2,33 sekundy (krótka sekwencja ujęcia)
- k = 8 (141 klatek): ~5,87 sekundy (pełny standardowy limit klipu)
Ustawienie docelowej liczby na 60 zmusza ComfyUI do odrzucenia 4 klatek w dół do 56 (k=3), marnując obliczenia VRAM podczas próbkowania. Zawsze przyciągaj parametry węzła do dokładnej granicy kroku 17k + 5 przed kolejkowaniem partii generacji.
Optymalizacja prędkości: włączanie 8-krokowej Turbo LoRA
Spędzanie ponad sześciu minut na oczekiwaniu na renderowanie pojedynczego 6-sekundowego wideo podglądowego sprawia, że szybka iteracja promptów jest prawie niemożliwa na konsumenckich GPU. Standardowe próbkowanie wymaga od 20 do 30 kroków, tworząc poważne wąskie gardło operacyjne podczas dostrajania wskazówek ruchu, testowania ruchów kamery lub oceny przejść klatek kluczowych.
Integracja wag destylacji Turbo
Zintegrowanie oficjalnego pliku wag minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 zmniejsza liczbę przejść próbkowania do 8-krokowego przepływu inferencji. Ten proces destylacji osiąga znaczącą optymalizację prędkości generacji bez utraty ogólnej spójności wizualnej.
Aby skonfigurować to ustawienie destylacji w ComfyUI:
- Umieść wagi modelu: Przenieś minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors do katalogu ComfyUI/models/loras/.
- Podłącz węzeł LoraLoader: Przekaż tensor głównego modelu dyfuzyjnego przez węzeł LoraLoader przed podaniem go do próbnika. Ustaw turbo_model_strength na 1.0.
- Dostosuj liczbę kroków: Zmniejsz parametr steps w węźle MiniMaxH3Sampler ze standardowych 20 na dokładnie 8.
- Zablokuj skalę CFG: Ustaw parametr skali prowadzenia bez klasyfikatora na 1.0, aby uniknąć przesycenia.
Porównanie wydajności: standardowa vs. Turbo
| Parametr / metryka porównawcza | Standardowy potok próbkowania | 8-krokowa Turbo LoRA |
| Liczba kroków inferencji | 20 do 30 kroków | 8 kroków |
| Czas renderowania (RTX 4090, 2K) | ~380 sekund | ~145 sekund |
| Skala prowadzenia CFG | 3,5 do 6,0 | Stała na 1.0 (destylowana) |
| Główne zastosowanie produkcyjne | Końcowe renderowanie główne | Szybka prewizualizacja i szkice scen |
| Stabilność czasowa | Pełna rekonstrukcja | Niewielkie drgania krawędzi przy złożonych fizykach cząstek |
Podczas używania minimax_h3_fl2v_turbo_8step, ustawienie CFG powyżej 1.0 wymusza niepotrzebne podwójne przejścia warunkowania, powodując ekstremalne wypalanie kolorów, kontrastowe przebicia i przestrzenne rozdarcia na ramkach o dużym ruchu. Aktywacja turbo_mode ze stałą siłą Turbo LoRA 1.0 pozwala twórcom zweryfikować złożone ruchy kamery w mniej niż trzy minuty przed przejściem do pełnych 20-krokowych renderów produkcyjnych.
Rozwiązywanie typowych błędów grafu MiniMax H3 w ComfyUI
Większość błędów operacyjnych w grafach MiniMax H3 wynika z drobnych niezgodności tensorów, niepodłączonych dekoderów audio lub wąskich gardeł pamięci GPU podczas ładowania modelu.
Przewodnik diagnostyczny i szybkie poprawki
-
Brak pamięci CUDA (OOM)
- Główna przyczyna: Ładowanie 32B enkodera tekstu obok wag dyfuzyjnych int8 na GPU z 16GB VRAM bez wyładowywania pamięci.
- Poprawka krok po kroku: Dodaj flagi --lowvram lub --medvram do skryptu uruchamiania ComfyUI. W przypadku ciasnych konfiguracji pamięci GPU rozważ uruchomienie MiniMax H3 w ComfyUI z kwantyzacją GGUF, aby obniżyć bazowe wymagania pamięciowe. Upewnij się, że qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors znajduje się ściśle w models/text_encoders/, co pozwala na wyładowanie VRAM między analizą tekstu a przejściami próbkowania.
-
Błąd niezgodności kształtu
- Główna przyczyna: Niestandardowe wartości szerokości/wysokości lub wejściowe obrazy klatek kluczowych naruszają wymaganą siatkę podzielności przestrzennej przez 32 piksele.
- Poprawka krok po kroku: Wstaw węzeł ResolutionSelector lub ImageScaleToTotalPixels przed próbnikiem, aby wymusić wszystkie wymiary płótna i obrazu do najbliższej wielokrotności 32.
-
Brak ścieżki audio w eksporcie
- Główna przyczyna: Ścieżka VAE audio jest niepodłączona lub pominięta podczas wykonywania grafu.
- Poprawka krok po kroku: Podłącz minimax_h3_audio_vae_fp32 do węzła VAEDecodeAudio, a następnie przekaż zdekodowane latenty audio do portu audio węzła SaveVideo wraz ze strumieniem wideo.
-
Błąd węzła GetImageSize
- Główna przyczyna: Niezgodność proporcji klatek kluczowych lub nieprawidłowe partie obrazów wieloklatkowych podawane do wejść próbnika I2V.
- Poprawka krok po kroku: Przeprowadź zarówno obrazy początkowe, jak i końcowe przez ujednolicony węzeł ImageScaleToTotalPixels, aby zablokować klatki kluczowe do identycznych wymiarów przed inicjalizacją latentów.
-
Ostrzeżenie o brakujących węzłach w ComfyUI Manager
- Główna przyczyna: Wymagane niestandardowe pakiety węzłów MiniMax H3 są niezindeksowane lub brakujące w lokalnym środowisku.
- Poprawka krok po kroku: Otwórz ComfyUI Manager, wybierz Zainstaluj brakujące węzły niestandardowe, wyszukaj ComfyUI-MiniMaxH3-Easy, kliknij Zainstaluj i uruchom ponownie ComfyUI.
Rozwiązywanie problemów z pamięcią i konfliktami rejestrów węzłów
Wiele samouczków pomija sposób, w jaki ComfyUI zarządza alokacją VRAM w kolejnych generacjach. Jeśli po udanym pierwszym przejściu podczas drugiej lub trzeciej próby renderowania pojawi się nagły błąd braku pamięci CUDA, oznacza to, że ComfyUI zatrzymał enkoder tekstu w VRAM. Ustawienie jawnych flag wyładowania w skrypcie uruchamiania zwalnia przydzieloną pamięć między krokami próbnika.
Podczas otwierania plików JSON społeczności, ostrzeżenia o brakujących węzłach w ComfyUI Manager zwykle wskazują na nieaktualne rejestry węzłów. Zainstalowanie ComfyUI-MiniMaxH3-Easy bezpośrednio naprawia te brakujące zależności. W przypadku potoków I2V, rozwiązanie błędu GetImageSize lub niezgodności kształtu wymaga zapewnienia, że zarówno obrazy początkowe, jak i końcowe klatek kluczowych pasują do docelowych granic pikseli.







