Seedance 2.5 är nu live — Först på Atlas Cloud

MiniMax H3 ComfyUI Workflow: Komplett guide för T2V och I2V

Bemästra MiniMax H3 ComfyUI-arbetsflödet för T2V och I2V. Lär dig rumsliga rutnätsregler, dual VAE-ljudroutning, 17k+5 bildrutor-matematik och 8-stegs Turbo LoRA-installation.

MiniMax H3 ComfyUI Workflow: Komplett guide för T2V och I2V

Utföra MiniMax H3 i ComfyUI kräver strikt efterlevnad av rumsliga och temporala rutnätsregler för att förhindra tensorformfel, tyst MP4-export eller modellkraschar. MiniMax H3 löser dessa flaskhalsar genom att syntetisera 2K-video och inbyggd synkroniserad stereo-ljud i en enda framåtpassning.

Viktiga slutsatser: MiniMax H3 ComfyUI-arbetsflöde

  • Inbyggd multimodal passning: MiniMax H3 syntetiserar 2K-video och synkroniserat 32 kHz stereo-ljud direkt inom en enda ComfyUI-diffusionspassning.
  • Hårdvarutröskel: Kräver minst 16 GB VRAM för INT8-kvantiserad körning, 24 GB rekommenderas för inbyggd 2K-rendering.
  • Rumslig rutnätsregel: Canvas- och keyframe-upplösningar måste vara strikt delbara med 32, t.ex. 1344×768, för att förhindra rumsliga VAE-tensorformfel.
  • Temporal rutnätsformel: Klipplängder måste följa ekvationen Totala bildrutor = 17k + 5 (5, 22, 39, 56, 141 bildrutor vid 24 fps) för att undvika latent trunkering.
  • Hastighetsoptimering: Stöder en officiell 8-stegs Turbo LoRA för att minska renderingstider med ~60 % med CFG låst på 1.0.

Medan Text-till-Video (T2V) förlitar sig på ren textdriven latent initialisering, förankrar Bild-till-Video (I2V) rörelsebanor med hjälp av first_frame, last_frame eller MiniMaxH3AddGuide-villkorsnoder. Följande avsnitt beskriver den fullständiga miljöinstallationen, nodkopplingsdiagram och felsökningsprotokoll för båda pipeline.

Väsentliga förutsättningar och modellkatalogstruktur

Att placera en 32B textkodare i models/checkpoints istället för models/text_encoders kommer att få ComfyUI att frysa under grafkompilering eller misslyckas med en oanvändbar KeyError. De flesta installationsfel uppstår för att filer hamnar i fel undermappar, eller för att vanliga Qwen-vikter ersätts med den anpassade vision-textkodaren som krävs av MiniMax H3.

ComfyUI-arbetsyta nodgrafuppsättning som visar CLIP Text Encode, KSampler, EmptySD3LatentImage och Load VAE konfigurerade för MiniMax H3-videogenerering

Systemkompatibilitetskrav

Innan du laddar ner modellvikter, bekräfta att din installation uppfyller dessa baskrav på hårdvara och miljö:

  • ComfyUI Core: Version v0.30.0 eller högre.
  • Anpassade noder: ComfyUI-MiniMaxH3-Easy eller officiellt Comfy-Org-paket.
  • GPU VRAM: 16 GB (INT8 min) / 24 GB (2K rek).
  • programvarustack: Python 3.10+ med PyTorch 2.4+ och CUDA 12.1+.

Modellkatalogplaceringsmatris

Ladda ner de officiella MiniMax H3 öppen källkodsmodellvikterna från Hugging Face-modellförrådet och placera varje fil i dess avsedda målmapp.

    
ModellkategoriExakt filnamnDestinationskatalogAnteckningar och precision
Diffusionsmodell (T2V/FL2V)minimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/Kärna INT8-kvantiserad diffusionsmodell
Diffusionsmodell (Ref2V)minimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/Krävs för referensstyrda grafer
Textkodareqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/Anpassade 4-bitars vision-språkvikter
Video VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/FP16 visuell spatial avkodare
Ljud-VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/FP32 akustisk avkodare (förhindrar klippning)
Turbo LoRA (valfritt)minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensorsComfyUI/models/loras/Möjliggör 8-stegs snabb inferens

Kritisk installationsanmärkning

Filen qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors är en anpassad 4-bitars AWQ-kvantiserad vision-textkodare (Qwen3-VL-arkitektur) som är specifikt finjusterad för MiniMax H3-promptvillkor. Byt inte ut den mot vanliga språktransformatorer i mappen text_encoders, eftersom generiska språkmodeller saknar den multimodala visionsprojektion som krävs för latent videogenerering.

Bygga Text-till-Video (T2V) ComfyUI-nodgrafen

Att bygga en ren Text-till-Video (T2V)-nodgraf i ComfyUI kräver att textinbäddningar, rumsliga upplösningsinställningar och latenta bildrutetensorer dirigeras i en strikt linjär sekvens.

Nodpaketnotering: Nodnamnen som används i hela denna arbetsflödesguide, såsom MiniMaxH3TextToVideo och MiniMaxH3ImageToVideo, refererar till det anpassade ComfyUI-MiniMaxH3-Easy-paketet. Om du använder det officiella Comfy-Org-kärnpaketet delas dessa operationer upp i separata MiniMaxH3Sampler- och MiniMaxH3Conditioning-noder.

Steg-för-steg T2V-nodkopplingsguide

ComfyUI Text-till-Video-nodgrafsdiagram som illustrerar textpromptvillkor, upplösningsskalning, MiniMaxH3TextToVideo-samplare och video-VAE-avkodning

Att ställa in T2V-latentgenerering kräver att textvillkor och rumsliga parametrar isoleras innan samplarsteget körs.

  1. Textkodarkoppling: Dirigera din textpromptnod till Qwen3-VL vision-textkodarladdaren. Skicka utmatningstensorn direkt till den positiva promptvillkorsporten på MiniMaxH3TextToVideo-noden.
  2. Rumslig dimensionsberäkning: Koppla utdata från ResolutionSelector till ImageScaleToTotalPixels. Detta steg beräknar pixelallokering samtidigt som rumsliga dimensioner som är delbara med 32 upprätthålls.
  3. Samplare och latent generering: Dirigera modellvikter, positiva villkorstensorer och upplösningsparametrar direkt till MiniMaxH3TextToVideo för att generera den råa videolatin.
  4. VAE-avkodning och videoexport: Skicka den latenta tensorn genom minimax_h3_video_vae_fp16 för avkodning, koppla sedan den renderade bildrutebatchen direkt till SaveVideo.

T2V-noddirigeringsmatris

För att konstruera denna graf utan brutna beroenden, följ de exakta nodportsanslutningarna som beskrivs nedan:

     
KällnodUtportMålnodInportArbetsflödesfunktion
Qwen3-VL-kodareCONDITIONINGMiniMaxH3TextToVideopositiveDirigerar textkodarkoppling
ResolutionSelectorWIDTH / HEIGHTImageScaleToTotalPixelswidth / heightAnger bildförhållandegränser
ImageScaleToTotalPixelsIMAGE_BOUNDSMiniMaxH3TextToVideoresolutionFixerar 32-pixels rumsligt rutnät
MiniMaxH3TextToVideoLATENTVAEDecodesamplesStyr T2V-latentgenerering
VAEDecodeIMAGESaveVideopixelsRenderar slutlig MP4-videoutdata

MiniMax H3 förlitar sig nästan helt på detaljerade positiva prompts som tolkas av Qwen3-VL-vision-språkmodellen, vilket innebär att traditionella negativa villkorsnoder lägger till onödig beräkningsbelastning utan att förbättra utdatakvaliteten. Att ansluta SaveVideo direkt till video-VAE-avkodningsnoden säkerställer korrekt 24 fps MP4-rendering utan tappade efterföljande bildrutor.

Konstruera Bild-till-Video (I2V) och Första/Sista Bildruta-arbetsflödet

ComfyUI Bild-till-Video-nodgrafuppsättning som visar dubbla LoadImage-noder, GetImageSize-dimensionsmatchning och MiniMaxH3ImageToVideo-keyframe-interpolation

Att försöka animera ett statiskt porträtt eller brygga två keyframes resulterar ofta i våldsam subjektförvrängning eller omedelbara tensorformkraschar när dina start- och slutbilder skiljer sig åt med ens några pixlar. Att konvertera en standard textpipeline till ett Bild-till-Video (I2V)-arbetsflöde kräver att du byter ut bas-samplarnoden och etablerar precisa bildvillkorspipeline över dina inledande och slutliga bildrutor.

Keyframe-interpolation och nodkonfiguration

För att övergå från T2V till Första-Sista-Bildruta (FL2V)-videogenerering, ersätt MiniMaxH3TextToVideo med MiniMaxH3ImageToVideo. Denna nod exponerar dedikerade inportar för first_frame och last_frame, vilket gör att du kan definiera starttillstånd, sluttillstånd eller fullständiga morfningsövergångar.

  1. Load Image-noder: Placera två LoadImage-noder på din arbetsyta för att hålla dina inledande och målinriktade keyframes.
  2. Dimensionsmatchning: Dirigera bildutdata genom GetImageSize för att extrahera råa bredd- och höjddimensioner. Detta förhindrar rumsliga rutnätsmissmatchningar innan tensorer når samplern.
  3. Tensorvillkor: Anslut de bearbetade pixel-tensorerna till first_frame för standard enkelbildsanimation, eller fyll i både first_frame och last_frame för att utföra keyframe-interpolation.

I2V- och FL2V-nodanslutningsmatris

     
KällnodUtportMålnodInportPipelinefunktion
LoadImage (Start)IMAGEMiniMaxH3ImageToVideofirst_frameEtablerar initial bildvillkor
LoadImage (Slut)IMAGEMiniMaxH3ImageToVideolast_frameStäller in terminal bildruta för FL2V-morphs
GetImageSizeWIDTH / HEIGHTResolutionSelectorwidth / heightLåser inmatningsbildförhållande till multiplar av 32
Qwen3-VL-kodareCONDITIONINGMiniMaxH3ImageToVideopositiveStyr rörelsebana via textprompt
MiniMaxH3ImageToVideoLATENTVAEDecodesamplesSkickar FL2V-latenter till video-VAE

MiniMax H3 upprätthåller strikt dimensionsparitet mellan keyframe-inmatningar. Båda keyframes måste matcha exakt rumslig upplösning. Om first_frame och last_frame skiljer sig i storlek, stoppas samplingen under latent initialisering. Dirigera båda bilderna genom samma skalningsnod för att säkerställa identiska pixeldimensioner.

Avancerad referensstyrning med MiniMaxH3AddGuide

Standard Bild-till-Video-grafer styr endast de första och sista bildrutorna och lämnar mellanliggande rörelse oförankrad. MiniMaxH3AddGuide-noden löser detta genom att förankra referensbilder, flerbildsbildrutebatcher eller ljudspår vid vilket specifikt frame_idx som helst längs genereringstidslinjen.

Kärnfunktioner hos MiniMaxH3AddGuide

   
ParameterinmatningFörankringsbeteendeBegränsningsregler
frame_idxAnger exakt målbildruteindexNegativa värden räknar bakåt från slutet av videon.
Bild / FlerbildrutaLåser karaktärskonsistens eller scenlayoutBatcher under 5 bildrutor använder den första bilden; batcher på 5+ snäpper till $17k + 5$-klipplängder (5, 22, 39).
LjudspårJusterar dialog eller ljudeffekter vid indexBeskärs automatiskt till återstående videolängd.

Hur man kedjar förankringsnoder för referensvideogenerering

Att kedja flera MiniMaxH3AddGuide-noder tillsammans möjliggör full referensvideogenerering (R2V):

  1. Primär karaktärsförankring: Anslut din positiva villkorsstyrning till MiniMaxH3AddGuide med frame_idx satt till 0 för att låsa karaktärsidentiteten i början.
  2. Mittsekvens rörelsekeyframe: Kedja en andra MiniMaxH3AddGuide-nod och mata en keyframe-bild vid frame_idx 60 för att tvinga karaktären att inta en specifik pose mitt i scenen.
  3. Ljudkoppling: Anslut ett målljudspår till ljudinporten och skicka din audio_vae för att synkronisera ljud direkt vid den tidslinjeförskjutningen.

Att kedja dessa villkorsstyrningar bibehåller temporal stabilitet utan att tvinga diffusionssamplern att återinitialisera latenter.

Integrera synkroniserat inbyggt ljud med dubbel VAE-routing

ComfyUI dubbel VAE-routing nodgraf som visar video-VAE-avkodare och ljud-VAE-avkodare multiplexerade till SaveVideo för synkroniserad stereo-ljudexport

Skapare lägger regelbundet timmar på att manuellt justera externa tal-spår i videoredigeringsprogram, bara för att möta onaturlig läppflapsdrift eller missmatchat bakgrundsbrus. MiniMax H3 eliminerar efterbearbetning av ljudjustering genom att förlita sig på sann multimodal generering, syntetisera videorutor och 32 kHz stereo-ljud tillsammans inom en enda framåtpassning.

Arkitekturen för enkelpassströmmen

Till skillnad från traditionella pipeline som kedjar distinkta text-till-tal-modeller efter videorendering, bearbetar MiniMax H3 text-, bild- och temporala signaler till ett enhetligt latent utrymme. Under avbrusningsfasen matar SamplerCustomAdvanced ut en sammansatt latent nyttolast som innehåller både visuella och akustiska funktionskartor. Denna gemensamma syntes garanterar precis dialogsynkronisering och organisk ljudeffektsgenerering som är exakt anpassad till handlingen på skärmen.

Dubbel VAE-avkodning och nodkonfiguration

För att omvandla råa latenter till spelbara medier, delar grafen upp utdata i två separata avkodningsvägar innan MP4-multiplexering.

    
NodkomponentModelltillgång / PrecisionFunktionUtgångsdestination
Video VAE-laddareminimax_h3_video_vae_fp16.safetensorsAvkodar visuella latenter till RGB-bildrutsekvenserVAEDecode -> CreateVideo (Videoström)
Ljud-VAE-laddareminimax_h3_audio_vae_fp32.safetensorsAvkodar akustiska latenter till okomprimerade ljudsignalerVAEDecodeAudio -> CreateVideo (Ljudström)
VideospårareSaveVideoMultiplexerar video och inbyggda stereo-ljudströmmarKodad MP4-fil

Teknisk nodinstallation

  1. Ladda dubbla VAE:er: Lägg till två distinkta VAELoader-noder på din arbetsyta. Peka den första till minimax_h3_video_vae_fp16.safetensors och den andra till minimax_h3_audio_vae_fp32.safetensors.
  2. Utför dubbel VAE-avkodning: Dirigera den visuella latenta utmatningen från samplern till VAEDecode och den ljudlatenta delen till VAEDecodeAudio. Att hålla minimax_h3_audio_vae_fp32 i FP32-precision förhindrar klippartefakter och frekvensdistorsion i bakgrundsmusik.
  3. Multiplexera via SaveVideo: Mata den avkodade bildtensorn och okomprimerade ljudvågformen till CreateVideo eller direkt till SaveVideo. Noden hanterar slutlig containerpaketering och skriver en färdig 24 fps MP4-fil med inbäddat stereo-ljud.

Denna inbyggda dubbelströmsuppsättning levererar fasnoggrann ljudkörning direkt inom ComfyUI utan behov av externa läppsynkroniseringsplugin.

Upplösningsmatematik, bildförhållandebegränsningar och bildrute-rutnätssnappning

Att ange en standard 1920x1080-upplösning eller ställa in din klipplängd till 60 bildrutor i ComfyUI kommer omedelbart att krascha din renderingskö med ett tensorformfel eller lämna dig med kraftigt förvrängda kantdefekter. MiniMax H3 upprätthåller rigida matematiska gränser för rumsliga dimensioner och klipplängder eftersom dess 3D VAE-arkitektur komprimerar videolatenter över specifika rumsliga block och temporala steg.

Rumsliga dimensioner och bildförhållandeförinställningar

Den rumsliga VAE:n nedsamplar inmatningar med en faktor 32. Om din målbredd eller -höjd inte är en strikt multipel av 32, misslyckas diffusionssamplern under gränstensorallokeringar. Modellen riktar in sig på en 768px inbyggd kort sida, vilket balanserar visuell trohet mot dess mål megapixelbudget.

    
BildförhållandeFörinställda dimensioner (px)DelbarhetskontrollMålorientering
16:091344 x 7681344 / 32 = 42, 768 / 32 = 24Bredbildslandskap
9:16768 x 1344768 / 32 = 24, 1344 / 32 = 42Vertikal mobil / UGC
1:011024 x 10241024 / 32 = 32, 1024 / 32 = 32Fyrkantig bildruta
21:091536 x 6721536 / 32 = 48, 672 / 32 = 21Cinematisk ultrawide

Att använda icke-standard pixeldimensioner tvingar VAE:n att padda eller sträcka funktionskartor, vilket försämrar fina texturdetaljer.

17k + 5 Bildrute-rutnätsregeln

Temporal dimensionssnappning följer en lika rigid formel. För att hålla sig inom MiniMax H3-videolängdsgränser, bearbetar arkitekturen videosekvenser i 17-bildrutes latenta bitar med en 5-bildrutes svansinitialisering. För att undvika temporal trunkering eller tyst VAE-avkodningskrasch, måste varje rendering uppfylla 17k + 5 bildrute-rutnätsekvationen, där k representerar en heltalsstegräknare.

17k+5 bildrute-rutnätsregelformel

Vid en standard 24 fps bildhastighet, dikterar denna matematik exakta temporala varaktigheter:

  • k = 0 (5 bildrutor): ~0,21 sekunder (mikrorörelse eller statisk stöt)
  • k = 1 (22 bildrutor): ~0,91 sekunder (snabb actionskiva)
  • k = 3 (56 bildrutor): ~2,33 sekunder (kort tagningsekvens)
  • k = 8 (141 bildrutor): ~5,87 sekunder (full standardklippgräns)

Att ställa in ett målantal på 60 tvingar ComfyUI att släppa 4 bildrutor ner till 56 (k=3), vilket slösar VRAM-beräkning under sampling. Snappa alltid dina nodparametrar till exakt 17k + 5-steggräns innan du köar en generationsbatch.

Hastighetsoptimering: Aktivera 8-stegs Turbo LoRA-körning

Att spendera över sex minuter på att vänta på att en enda 6-sekunders förhandsvisningsvideo ska renderas gör snabb promptiteration nästan omöjlig på konsument-GPU:er. Standard sampling kräver 20 till 30 steg, vilket skapar en allvarlig operativ flaskhals när man justerar rörelsesignaler, testar kamerarörelser eller utvärderar keyframe-övergångar.

Integrera turbodestillationsvikterna

Att integrera den officiella minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16-vikten minskar samplingar till en 8-stegs inferensarbetsflöde. Denna destillationsprocess uppnår betydande genereringshastighetsoptimering utan att kompromissa med övergripande visuell sammanhållning.

För att konfigurera denna destillationsuppsättning i ComfyUI:

  1. Placera modellvikter: Flytta minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors till din ComfyUI/models/loras/-katalog.
  2. Koppla LoraLoader-nod: Dirigera den primära diffusionsmodelltensorn genom en LoraLoader-nod innan du matar samplern. Ställ in turbo_model_strength till 1.0.
  3. Justera stegantal: Sänk stegparametern i din MiniMaxH3Sampler-nod från standard 20 till exakt 8.
  4. Lås CFG-skala: Tvinga den klassificeringsfria guidningsskalparametern till 1.0 för att undvika övermättnad.

Prestandamått: Standard vs. Turbo-körning

   
Parameter / MåttStandard sampling-pipeline8-stegs Turbo LoRA-körning
Inferensstegantal20 till 30 steg8 steg
Rendereringstid (RTX 4090, 2K)~380 sekunder~145 sekunder
CFG-guidningsskala3.5 till 6.0Fast på 1.0 (destillerad)
Primär produktionsanvändningSlutliga master-renderingarSnabb förvisualisering och scenmockups
Temporal stabilitetFull rekonstruktionMindre kantjitter på komplex partikelfysik

När du kör minimax_h3_fl2v_turbo_8step, tvingar inställning av CFG över 1.0 onödiga dubbelvillkorspass, vilket orsakar extrem färgbränning, kontrastutblåsningar och rumslig rivning över bildrutor med hög rörelse. Att aktivera turbo_mode med en fast Turbo LoRA-styrka på 1.0 gör att skapare kan validera komplexa kamerarörelser på under tre minuter innan de förbinder sig till fulla 20-stegs produktionsrenderingar.

Felsökning av vanliga ComfyUI MiniMax H3-grafel

De flesta operativa fel i MiniMax H3-grafer härrör från mindre tensorjusteringsmissmatchningar, olänkade ljudavkodare eller GPU-minnesflaskhalsar under modellinläsning.

Diagnostisk guide och snabbfixar

  1. CUDA Out of Memory (OOM)

    1. Primär orsak: Inläsning av 32B textkodaren tillsammans med int8-diffusionsvikter på 16 GB VRAM GPU:er utan minnesavlastning.
    2. Steg-för-steg-fix: Lägg till --lowvram eller --medvram-startflaggor i ditt ComfyUI-startskript. För snäva GPU-minneskonfigurationer, överväg att köra MiniMax H3 i ComfyUI med GGUF-kvantisering för att sänka basminneskraven. Se till att qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors placeras strikt i models/text_encoders/, vilket möjliggör VRAM-avlastning mellan texttolkning och samplingspass.
  2. Formmissmatchfel

    1. Primär orsak: Anpassade bredd-/höjdvärden eller inmatningskeyframe-bilder bryter mot det krävda 32-pixels rumsliga delbarhetsrutnätet.
    2. Steg-för-steg-fix: Infoga en ResolutionSelector- eller ImageScaleToTotalPixels-nod före samplern för att tvinga alla canvas- och bilddimensioner till närmaste multipel av 32.
  3. Saknat ljudspår i export

    1. Primär orsak: Ljud-VAE-vägen är olänkad eller förbikopplad under grafkörning.
    2. Steg-för-steg-fix: Anslut minimax_h3_audio_vae_fp32 till VAEDecodeAudio-noden, skicka sedan de avkodade ljudlatenterna till SaveVideo-nodens ljudport tillsammans med videoströmmen.
  4. GetImageSize-nodfel

    1. Primär orsak: Missmatchande keyframe-bildförhållanden eller ogiltiga flerbildsbatcher matade till I2V-samplerinmatningar.
    2. Steg-för-steg-fix: Kör både initiala och terminala bilder genom en enhetlig ImageScaleToTotalPixels-nod för att låsa keyframes till identiska dimensioner före latent initialisering.
  5. ComfyUI Manager saknar nodvarning

    1. Primär orsak: Krävda MiniMax H3-anpassade nodpaket är oindexerade eller saknas i den lokala miljön.
    2. Steg-för-steg-fix: Öppna ComfyUI Manager, välj Install Missing Custom Nodes, sök efter ComfyUI-MiniMaxH3-Easy, klicka på Installera och starta om ComfyUI.

Lösa minnesfall och nodregisterkonflikter

Många handledningar missar hur ComfyUI hanterar VRAM-allokering över på varandra följande generationer. Om du upplever ett plötsligt CUDA Out of Memory-fel på ett andra eller tredje renderingsförsök trots en lyckad första körning, har ComfyUI behållit textkodaren i VRAM. Att ställa in explicita avlastningsflaggor i ditt startskript frigör allokerat minne mellan samplingssteg.

När du öppnar community JSON-filer, indikerar ComfyUI Manager saknade nodvarningar vanligtvis föråldrade nodregister. Att installera ComfyUI-MiniMaxH3-Easy åtgärdar dessa saknade beroenden direkt. För I2V-pipeline, kräver lösning av ett GetImageSize-fel eller ett formmissmatchfel att både initiala och terminala keyframe-bilder matchar målpixelgränserna.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller