Utföra MiniMax H3 i ComfyUI kräver strikt efterlevnad av rumsliga och temporala rutnätsregler för att förhindra tensorformfel, tyst MP4-export eller modellkraschar. MiniMax H3 löser dessa flaskhalsar genom att syntetisera 2K-video och inbyggd synkroniserad stereo-ljud i en enda framåtpassning.
Viktiga slutsatser: MiniMax H3 ComfyUI-arbetsflöde
- Inbyggd multimodal passning: MiniMax H3 syntetiserar 2K-video och synkroniserat 32 kHz stereo-ljud direkt inom en enda ComfyUI-diffusionspassning.
- Hårdvarutröskel: Kräver minst 16 GB VRAM för INT8-kvantiserad körning, 24 GB rekommenderas för inbyggd 2K-rendering.
- Rumslig rutnätsregel: Canvas- och keyframe-upplösningar måste vara strikt delbara med 32, t.ex. 1344×768, för att förhindra rumsliga VAE-tensorformfel.
- Temporal rutnätsformel: Klipplängder måste följa ekvationen Totala bildrutor = 17k + 5 (5, 22, 39, 56, 141 bildrutor vid 24 fps) för att undvika latent trunkering.
- Hastighetsoptimering: Stöder en officiell 8-stegs Turbo LoRA för att minska renderingstider med ~60 % med CFG låst på 1.0.
Medan Text-till-Video (T2V) förlitar sig på ren textdriven latent initialisering, förankrar Bild-till-Video (I2V) rörelsebanor med hjälp av first_frame, last_frame eller MiniMaxH3AddGuide-villkorsnoder. Följande avsnitt beskriver den fullständiga miljöinstallationen, nodkopplingsdiagram och felsökningsprotokoll för båda pipeline.
Väsentliga förutsättningar och modellkatalogstruktur
Att placera en 32B textkodare i models/checkpoints istället för models/text_encoders kommer att få ComfyUI att frysa under grafkompilering eller misslyckas med en oanvändbar KeyError. De flesta installationsfel uppstår för att filer hamnar i fel undermappar, eller för att vanliga Qwen-vikter ersätts med den anpassade vision-textkodaren som krävs av MiniMax H3.

Systemkompatibilitetskrav
Innan du laddar ner modellvikter, bekräfta att din installation uppfyller dessa baskrav på hårdvara och miljö:
- ComfyUI Core: Version v0.30.0 eller högre.
- Anpassade noder: ComfyUI-MiniMaxH3-Easy eller officiellt Comfy-Org-paket.
- GPU VRAM: 16 GB (INT8 min) / 24 GB (2K rek).
- programvarustack: Python 3.10+ med PyTorch 2.4+ och CUDA 12.1+.
Modellkatalogplaceringsmatris
Ladda ner de officiella MiniMax H3 öppen källkodsmodellvikterna från Hugging Face-modellförrådet och placera varje fil i dess avsedda målmapp.
| Modellkategori | Exakt filnamn | Destinationskatalog | Anteckningar och precision |
| Diffusionsmodell (T2V/FL2V) | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | Kärna INT8-kvantiserad diffusionsmodell |
| Diffusionsmodell (Ref2V) | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | Krävs för referensstyrda grafer |
| Textkodare | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ | Anpassade 4-bitars vision-språkvikter |
| Video VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ | FP16 visuell spatial avkodare |
| Ljud-VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ | FP32 akustisk avkodare (förhindrar klippning) |
| Turbo LoRA (valfritt) | minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors | ComfyUI/models/loras/ | Möjliggör 8-stegs snabb inferens |
Kritisk installationsanmärkning
Filen qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors är en anpassad 4-bitars AWQ-kvantiserad vision-textkodare (Qwen3-VL-arkitektur) som är specifikt finjusterad för MiniMax H3-promptvillkor. Byt inte ut den mot vanliga språktransformatorer i mappen text_encoders, eftersom generiska språkmodeller saknar den multimodala visionsprojektion som krävs för latent videogenerering.
Bygga Text-till-Video (T2V) ComfyUI-nodgrafen
Att bygga en ren Text-till-Video (T2V)-nodgraf i ComfyUI kräver att textinbäddningar, rumsliga upplösningsinställningar och latenta bildrutetensorer dirigeras i en strikt linjär sekvens.
Nodpaketnotering: Nodnamnen som används i hela denna arbetsflödesguide, såsom MiniMaxH3TextToVideo och MiniMaxH3ImageToVideo, refererar till det anpassade ComfyUI-MiniMaxH3-Easy-paketet. Om du använder det officiella Comfy-Org-kärnpaketet delas dessa operationer upp i separata MiniMaxH3Sampler- och MiniMaxH3Conditioning-noder.
Steg-för-steg T2V-nodkopplingsguide

Att ställa in T2V-latentgenerering kräver att textvillkor och rumsliga parametrar isoleras innan samplarsteget körs.
- Textkodarkoppling: Dirigera din textpromptnod till Qwen3-VL vision-textkodarladdaren. Skicka utmatningstensorn direkt till den positiva promptvillkorsporten på MiniMaxH3TextToVideo-noden.
- Rumslig dimensionsberäkning: Koppla utdata från ResolutionSelector till ImageScaleToTotalPixels. Detta steg beräknar pixelallokering samtidigt som rumsliga dimensioner som är delbara med 32 upprätthålls.
- Samplare och latent generering: Dirigera modellvikter, positiva villkorstensorer och upplösningsparametrar direkt till MiniMaxH3TextToVideo för att generera den råa videolatin.
- VAE-avkodning och videoexport: Skicka den latenta tensorn genom minimax_h3_video_vae_fp16 för avkodning, koppla sedan den renderade bildrutebatchen direkt till SaveVideo.
T2V-noddirigeringsmatris
För att konstruera denna graf utan brutna beroenden, följ de exakta nodportsanslutningarna som beskrivs nedan:
| Källnod | Utport | Målnod | Inport | Arbetsflödesfunktion |
| Qwen3-VL-kodare | CONDITIONING | MiniMaxH3TextToVideo | positive | Dirigerar textkodarkoppling |
| ResolutionSelector | WIDTH / HEIGHT | ImageScaleToTotalPixels | width / height | Anger bildförhållandegränser |
| ImageScaleToTotalPixels | IMAGE_BOUNDS | MiniMaxH3TextToVideo | resolution | Fixerar 32-pixels rumsligt rutnät |
| MiniMaxH3TextToVideo | LATENT | VAEDecode | samples | Styr T2V-latentgenerering |
| VAEDecode | IMAGE | SaveVideo | pixels | Renderar slutlig MP4-videoutdata |
MiniMax H3 förlitar sig nästan helt på detaljerade positiva prompts som tolkas av Qwen3-VL-vision-språkmodellen, vilket innebär att traditionella negativa villkorsnoder lägger till onödig beräkningsbelastning utan att förbättra utdatakvaliteten. Att ansluta SaveVideo direkt till video-VAE-avkodningsnoden säkerställer korrekt 24 fps MP4-rendering utan tappade efterföljande bildrutor.
Konstruera Bild-till-Video (I2V) och Första/Sista Bildruta-arbetsflödet

Att försöka animera ett statiskt porträtt eller brygga två keyframes resulterar ofta i våldsam subjektförvrängning eller omedelbara tensorformkraschar när dina start- och slutbilder skiljer sig åt med ens några pixlar. Att konvertera en standard textpipeline till ett Bild-till-Video (I2V)-arbetsflöde kräver att du byter ut bas-samplarnoden och etablerar precisa bildvillkorspipeline över dina inledande och slutliga bildrutor.
Keyframe-interpolation och nodkonfiguration
För att övergå från T2V till Första-Sista-Bildruta (FL2V)-videogenerering, ersätt MiniMaxH3TextToVideo med MiniMaxH3ImageToVideo. Denna nod exponerar dedikerade inportar för first_frame och last_frame, vilket gör att du kan definiera starttillstånd, sluttillstånd eller fullständiga morfningsövergångar.
- Load Image-noder: Placera två LoadImage-noder på din arbetsyta för att hålla dina inledande och målinriktade keyframes.
- Dimensionsmatchning: Dirigera bildutdata genom GetImageSize för att extrahera råa bredd- och höjddimensioner. Detta förhindrar rumsliga rutnätsmissmatchningar innan tensorer når samplern.
- Tensorvillkor: Anslut de bearbetade pixel-tensorerna till first_frame för standard enkelbildsanimation, eller fyll i både first_frame och last_frame för att utföra keyframe-interpolation.
I2V- och FL2V-nodanslutningsmatris
| Källnod | Utport | Målnod | Inport | Pipelinefunktion |
| LoadImage (Start) | IMAGE | MiniMaxH3ImageToVideo | first_frame | Etablerar initial bildvillkor |
| LoadImage (Slut) | IMAGE | MiniMaxH3ImageToVideo | last_frame | Ställer in terminal bildruta för FL2V-morphs |
| GetImageSize | WIDTH / HEIGHT | ResolutionSelector | width / height | Låser inmatningsbildförhållande till multiplar av 32 |
| Qwen3-VL-kodare | CONDITIONING | MiniMaxH3ImageToVideo | positive | Styr rörelsebana via textprompt |
| MiniMaxH3ImageToVideo | LATENT | VAEDecode | samples | Skickar FL2V-latenter till video-VAE |
MiniMax H3 upprätthåller strikt dimensionsparitet mellan keyframe-inmatningar. Båda keyframes måste matcha exakt rumslig upplösning. Om first_frame och last_frame skiljer sig i storlek, stoppas samplingen under latent initialisering. Dirigera båda bilderna genom samma skalningsnod för att säkerställa identiska pixeldimensioner.
Avancerad referensstyrning med MiniMaxH3AddGuide
Standard Bild-till-Video-grafer styr endast de första och sista bildrutorna och lämnar mellanliggande rörelse oförankrad. MiniMaxH3AddGuide-noden löser detta genom att förankra referensbilder, flerbildsbildrutebatcher eller ljudspår vid vilket specifikt frame_idx som helst längs genereringstidslinjen.
Kärnfunktioner hos MiniMaxH3AddGuide
| Parameterinmatning | Förankringsbeteende | Begränsningsregler |
| frame_idx | Anger exakt målbildruteindex | Negativa värden räknar bakåt från slutet av videon. |
| Bild / Flerbildruta | Låser karaktärskonsistens eller scenlayout | Batcher under 5 bildrutor använder den första bilden; batcher på 5+ snäpper till $17k + 5$-klipplängder (5, 22, 39). |
| Ljudspår | Justerar dialog eller ljudeffekter vid index | Beskärs automatiskt till återstående videolängd. |
Hur man kedjar förankringsnoder för referensvideogenerering
Att kedja flera MiniMaxH3AddGuide-noder tillsammans möjliggör full referensvideogenerering (R2V):
- Primär karaktärsförankring: Anslut din positiva villkorsstyrning till MiniMaxH3AddGuide med frame_idx satt till 0 för att låsa karaktärsidentiteten i början.
- Mittsekvens rörelsekeyframe: Kedja en andra MiniMaxH3AddGuide-nod och mata en keyframe-bild vid frame_idx 60 för att tvinga karaktären att inta en specifik pose mitt i scenen.
- Ljudkoppling: Anslut ett målljudspår till ljudinporten och skicka din audio_vae för att synkronisera ljud direkt vid den tidslinjeförskjutningen.
Att kedja dessa villkorsstyrningar bibehåller temporal stabilitet utan att tvinga diffusionssamplern att återinitialisera latenter.
Integrera synkroniserat inbyggt ljud med dubbel VAE-routing

Skapare lägger regelbundet timmar på att manuellt justera externa tal-spår i videoredigeringsprogram, bara för att möta onaturlig läppflapsdrift eller missmatchat bakgrundsbrus. MiniMax H3 eliminerar efterbearbetning av ljudjustering genom att förlita sig på sann multimodal generering, syntetisera videorutor och 32 kHz stereo-ljud tillsammans inom en enda framåtpassning.
Arkitekturen för enkelpassströmmen
Till skillnad från traditionella pipeline som kedjar distinkta text-till-tal-modeller efter videorendering, bearbetar MiniMax H3 text-, bild- och temporala signaler till ett enhetligt latent utrymme. Under avbrusningsfasen matar SamplerCustomAdvanced ut en sammansatt latent nyttolast som innehåller både visuella och akustiska funktionskartor. Denna gemensamma syntes garanterar precis dialogsynkronisering och organisk ljudeffektsgenerering som är exakt anpassad till handlingen på skärmen.
Dubbel VAE-avkodning och nodkonfiguration
För att omvandla råa latenter till spelbara medier, delar grafen upp utdata i två separata avkodningsvägar innan MP4-multiplexering.
| Nodkomponent | Modelltillgång / Precision | Funktion | Utgångsdestination |
| Video VAE-laddare | minimax_h3_video_vae_fp16.safetensors | Avkodar visuella latenter till RGB-bildrutsekvenser | VAEDecode -> CreateVideo (Videoström) |
| Ljud-VAE-laddare | minimax_h3_audio_vae_fp32.safetensors | Avkodar akustiska latenter till okomprimerade ljudsignaler | VAEDecodeAudio -> CreateVideo (Ljudström) |
| Videospårare | SaveVideo | Multiplexerar video och inbyggda stereo-ljudströmmar | Kodad MP4-fil |
Teknisk nodinstallation
- Ladda dubbla VAE:er: Lägg till två distinkta VAELoader-noder på din arbetsyta. Peka den första till minimax_h3_video_vae_fp16.safetensors och den andra till minimax_h3_audio_vae_fp32.safetensors.
- Utför dubbel VAE-avkodning: Dirigera den visuella latenta utmatningen från samplern till VAEDecode och den ljudlatenta delen till VAEDecodeAudio. Att hålla minimax_h3_audio_vae_fp32 i FP32-precision förhindrar klippartefakter och frekvensdistorsion i bakgrundsmusik.
- Multiplexera via SaveVideo: Mata den avkodade bildtensorn och okomprimerade ljudvågformen till CreateVideo eller direkt till SaveVideo. Noden hanterar slutlig containerpaketering och skriver en färdig 24 fps MP4-fil med inbäddat stereo-ljud.
Denna inbyggda dubbelströmsuppsättning levererar fasnoggrann ljudkörning direkt inom ComfyUI utan behov av externa läppsynkroniseringsplugin.
Upplösningsmatematik, bildförhållandebegränsningar och bildrute-rutnätssnappning
Att ange en standard 1920x1080-upplösning eller ställa in din klipplängd till 60 bildrutor i ComfyUI kommer omedelbart att krascha din renderingskö med ett tensorformfel eller lämna dig med kraftigt förvrängda kantdefekter. MiniMax H3 upprätthåller rigida matematiska gränser för rumsliga dimensioner och klipplängder eftersom dess 3D VAE-arkitektur komprimerar videolatenter över specifika rumsliga block och temporala steg.
Rumsliga dimensioner och bildförhållandeförinställningar
Den rumsliga VAE:n nedsamplar inmatningar med en faktor 32. Om din målbredd eller -höjd inte är en strikt multipel av 32, misslyckas diffusionssamplern under gränstensorallokeringar. Modellen riktar in sig på en 768px inbyggd kort sida, vilket balanserar visuell trohet mot dess mål megapixelbudget.
| Bildförhållande | Förinställda dimensioner (px) | Delbarhetskontroll | Målorientering |
| 16:09 | 1344 x 768 | 1344 / 32 = 42, 768 / 32 = 24 | Bredbildslandskap |
| 9:16 | 768 x 1344 | 768 / 32 = 24, 1344 / 32 = 42 | Vertikal mobil / UGC |
| 1:01 | 1024 x 1024 | 1024 / 32 = 32, 1024 / 32 = 32 | Fyrkantig bildruta |
| 21:09 | 1536 x 672 | 1536 / 32 = 48, 672 / 32 = 21 | Cinematisk ultrawide |
Att använda icke-standard pixeldimensioner tvingar VAE:n att padda eller sträcka funktionskartor, vilket försämrar fina texturdetaljer.
17k + 5 Bildrute-rutnätsregeln
Temporal dimensionssnappning följer en lika rigid formel. För att hålla sig inom MiniMax H3-videolängdsgränser, bearbetar arkitekturen videosekvenser i 17-bildrutes latenta bitar med en 5-bildrutes svansinitialisering. För att undvika temporal trunkering eller tyst VAE-avkodningskrasch, måste varje rendering uppfylla 17k + 5 bildrute-rutnätsekvationen, där k representerar en heltalsstegräknare.

Vid en standard 24 fps bildhastighet, dikterar denna matematik exakta temporala varaktigheter:
- k = 0 (5 bildrutor): ~0,21 sekunder (mikrorörelse eller statisk stöt)
- k = 1 (22 bildrutor): ~0,91 sekunder (snabb actionskiva)
- k = 3 (56 bildrutor): ~2,33 sekunder (kort tagningsekvens)
- k = 8 (141 bildrutor): ~5,87 sekunder (full standardklippgräns)
Att ställa in ett målantal på 60 tvingar ComfyUI att släppa 4 bildrutor ner till 56 (k=3), vilket slösar VRAM-beräkning under sampling. Snappa alltid dina nodparametrar till exakt 17k + 5-steggräns innan du köar en generationsbatch.
Hastighetsoptimering: Aktivera 8-stegs Turbo LoRA-körning
Att spendera över sex minuter på att vänta på att en enda 6-sekunders förhandsvisningsvideo ska renderas gör snabb promptiteration nästan omöjlig på konsument-GPU:er. Standard sampling kräver 20 till 30 steg, vilket skapar en allvarlig operativ flaskhals när man justerar rörelsesignaler, testar kamerarörelser eller utvärderar keyframe-övergångar.
Integrera turbodestillationsvikterna
Att integrera den officiella minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16-vikten minskar samplingar till en 8-stegs inferensarbetsflöde. Denna destillationsprocess uppnår betydande genereringshastighetsoptimering utan att kompromissa med övergripande visuell sammanhållning.
För att konfigurera denna destillationsuppsättning i ComfyUI:
- Placera modellvikter: Flytta minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors till din ComfyUI/models/loras/-katalog.
- Koppla LoraLoader-nod: Dirigera den primära diffusionsmodelltensorn genom en LoraLoader-nod innan du matar samplern. Ställ in turbo_model_strength till 1.0.
- Justera stegantal: Sänk stegparametern i din MiniMaxH3Sampler-nod från standard 20 till exakt 8.
- Lås CFG-skala: Tvinga den klassificeringsfria guidningsskalparametern till 1.0 för att undvika övermättnad.
Prestandamått: Standard vs. Turbo-körning
| Parameter / Mått | Standard sampling-pipeline | 8-stegs Turbo LoRA-körning |
| Inferensstegantal | 20 till 30 steg | 8 steg |
| Rendereringstid (RTX 4090, 2K) | ~380 sekunder | ~145 sekunder |
| CFG-guidningsskala | 3.5 till 6.0 | Fast på 1.0 (destillerad) |
| Primär produktionsanvändning | Slutliga master-renderingar | Snabb förvisualisering och scenmockups |
| Temporal stabilitet | Full rekonstruktion | Mindre kantjitter på komplex partikelfysik |
När du kör minimax_h3_fl2v_turbo_8step, tvingar inställning av CFG över 1.0 onödiga dubbelvillkorspass, vilket orsakar extrem färgbränning, kontrastutblåsningar och rumslig rivning över bildrutor med hög rörelse. Att aktivera turbo_mode med en fast Turbo LoRA-styrka på 1.0 gör att skapare kan validera komplexa kamerarörelser på under tre minuter innan de förbinder sig till fulla 20-stegs produktionsrenderingar.
Felsökning av vanliga ComfyUI MiniMax H3-grafel
De flesta operativa fel i MiniMax H3-grafer härrör från mindre tensorjusteringsmissmatchningar, olänkade ljudavkodare eller GPU-minnesflaskhalsar under modellinläsning.
Diagnostisk guide och snabbfixar
-
CUDA Out of Memory (OOM)
- Primär orsak: Inläsning av 32B textkodaren tillsammans med int8-diffusionsvikter på 16 GB VRAM GPU:er utan minnesavlastning.
- Steg-för-steg-fix: Lägg till --lowvram eller --medvram-startflaggor i ditt ComfyUI-startskript. För snäva GPU-minneskonfigurationer, överväg att köra MiniMax H3 i ComfyUI med GGUF-kvantisering för att sänka basminneskraven. Se till att qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors placeras strikt i models/text_encoders/, vilket möjliggör VRAM-avlastning mellan texttolkning och samplingspass.
-
Formmissmatchfel
- Primär orsak: Anpassade bredd-/höjdvärden eller inmatningskeyframe-bilder bryter mot det krävda 32-pixels rumsliga delbarhetsrutnätet.
- Steg-för-steg-fix: Infoga en ResolutionSelector- eller ImageScaleToTotalPixels-nod före samplern för att tvinga alla canvas- och bilddimensioner till närmaste multipel av 32.
-
Saknat ljudspår i export
- Primär orsak: Ljud-VAE-vägen är olänkad eller förbikopplad under grafkörning.
- Steg-för-steg-fix: Anslut minimax_h3_audio_vae_fp32 till VAEDecodeAudio-noden, skicka sedan de avkodade ljudlatenterna till SaveVideo-nodens ljudport tillsammans med videoströmmen.
-
GetImageSize-nodfel
- Primär orsak: Missmatchande keyframe-bildförhållanden eller ogiltiga flerbildsbatcher matade till I2V-samplerinmatningar.
- Steg-för-steg-fix: Kör både initiala och terminala bilder genom en enhetlig ImageScaleToTotalPixels-nod för att låsa keyframes till identiska dimensioner före latent initialisering.
-
ComfyUI Manager saknar nodvarning
- Primär orsak: Krävda MiniMax H3-anpassade nodpaket är oindexerade eller saknas i den lokala miljön.
- Steg-för-steg-fix: Öppna ComfyUI Manager, välj Install Missing Custom Nodes, sök efter ComfyUI-MiniMaxH3-Easy, klicka på Installera och starta om ComfyUI.
Lösa minnesfall och nodregisterkonflikter
Många handledningar missar hur ComfyUI hanterar VRAM-allokering över på varandra följande generationer. Om du upplever ett plötsligt CUDA Out of Memory-fel på ett andra eller tredje renderingsförsök trots en lyckad första körning, har ComfyUI behållit textkodaren i VRAM. Att ställa in explicita avlastningsflaggor i ditt startskript frigör allokerat minne mellan samplingssteg.
När du öppnar community JSON-filer, indikerar ComfyUI Manager saknade nodvarningar vanligtvis föråldrade nodregister. Att installera ComfyUI-MiniMaxH3-Easy åtgärdar dessa saknade beroenden direkt. För I2V-pipeline, kräver lösning av ett GetImageSize-fel eller ett formmissmatchfel att både initiala och terminala keyframe-bilder matchar målpixelgränserna.







