Die Ausführung von MiniMax H3 in ComfyUI erfordert die strikte Einhaltung der räumlichen und zeitlichen Gitterregeln, um Tensorformfehler, stille MP4-Exporte oder Modellabstürze zu vermeiden. MiniMax H3 behebt diese Engpässe, indem es 2K-Video und natives synchrones Stereo-Audio in einem einzigen Vorwärtsdurchlauf synthetisiert.
Wichtige Erkenntnisse: MiniMax H3 ComfyUI Workflow
- Natives multimodales Pass: MiniMax H3 synthetisiert 2K-Video und synchronisiertes 32 kHz Stereo-Audio direkt innerhalb eines einzigen ComfyUI-Diffusionsdurchlaufs.
- Hardware-Schwelle: Erfordert mindestens 16 GB VRAM für INT8-quantisierte Ausführung; 24 GB empfohlen für natives 2K-Rendering.
- Räumliche Gitterregel: Die Auflösungen von Leinwand und Keyframes müssen streng durch 32 teilbar sein, z. B. 1344×768, um räumliche VAE-Tensorformfehler zu vermeiden.
- Zeitliche Gitterformel: Cliplängen müssen der Gleichung Gesamtframes = 17k + 5 (5, 22, 39, 56, 141 Frames bei 24fps) entsprechen, um eine latente Trunkierung zu vermeiden.
- Geschwindigkeitsoptimierung: Unterstützt einen offiziellen 8-Schritt-Turbo-LoRA, um Renderzeiten um ~60% zu senken, wobei CFG auf 1,0 fixiert ist.
Während Text-to-Video (T2V) auf rein textgesteuerter latenter Initialisierung basiert, verankert Image-to-Video (I2V) Bewegungsverläufe mithilfe von first_frame-, last_frame- oder MiniMaxH3AddGuide-Conditioning-Knoten. Die folgenden Abschnitte beschreiben die vollständige Umgebungseinrichtung, Knotenverdrahtungsdiagramme und Fehlerbehebungsprotokolle für beide Pipelines.
Wesentliche Voraussetzungen und Modellverzeichnisstruktur
Das Platzieren eines 32B-Text-Encoders in models/checkpoints anstelle von models/text_encoders bewirkt, dass ComfyUI während der Graphenkompilierung einfriert oder mit einem nicht hilfreichen KeyError fehlschlägt. Die meisten Einrichtungsfehler treten auf, weil Dateien in den falschen Unterordnern landen oder weil Standard-Qwen-Gewichte durch den benutzerdefinierten Vision-Text-Encoder ersetzt werden, der für MiniMax H3 erforderlich ist.

Systemkompatibilitätsanforderungen
Überprüfen Sie vor dem Herunterladen der Modellgewichte, ob Ihre Installation die folgenden grundlegenden Hardware- und Umgebungsspezifikationen erfüllt:
- ComfyUI Core: Version v0.30.0 oder höher.
- Benutzerdefinierte Knoten: ComfyUI-MiniMaxH3-Easy oder offizielles Comfy-Org-Paket.
- GPU VRAM: 16 GB (INT8 min) / 24 GB (2K empf.).
- Software-Stack: Python 3.10+ mit PyTorch 2.4+ und CUDA 12.1+.
Modellverzeichnis-Positionierungsmatrix
Laden Sie die offiziellen MiniMax H3 Open-Source-Modellgewichte aus dem Hugging Face-Modell-Repository herunter und platzieren Sie jede Datei in ihrem vorgesehenen Zielunterordner.
| Modellkategorie | Exakter Dateiname | Zielverzeichnis | Hinweise & Genauigkeit |
| Diffusionsmodell (T2V/FL2V) | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | Kern-INT8-quantisiertes Diffusionsmodell |
| Diffusionsmodell (Ref2V) | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | Erforderlich für Referenzführungsgraphen |
| Text-Encoder | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ | Benutzerdefinierte 4-Bit-Vision-Language-Gewichte |
| Video-VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ | FP16-Video-räumlicher Decoder |
| Audio-VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ | FP32-Akustik-Decoder (verhindert Clipping) |
| Turbo LoRA (Optional) | minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors | ComfyUI/models/loras/ | Ermöglicht 8-Schritt-Schnellinferenz |
Kritischer Installationshinweis
Die Datei qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ist ein benutzerdefinierter 4-Bit-AWQ-quantisierter Vision-Text-Encoder (Qwen3-VL-Architektur), der speziell für das MiniMax H3-Prompt-Conditioning feinabgestimmt wurde. Ersetzen Sie ihn nicht durch Standard-Sprachtransformatoren im Ordner text_encoders, da generische Sprachmodelle die multimodale Vision-Projektion vermissen lassen, die für die latente Videogenerierung erforderlich ist.
Erstellen des Text-to-Video (T2V) ComfyUI-Knotengraphen
Das Erstellen eines sauberen Text-to-Video (T2V)-Knotengraphen in ComfyUI erfordert das strikte lineare Verketten von Text-Embeddings, räumlichen Auflösungseinstellungen und latenten Frametensoren.
Hinweis zum Knotenpaket: Die in diesem Workflow-Leitfaden verwendeten Knotennamen, wie MiniMaxH3TextToVideo und MiniMaxH3ImageToVideo, beziehen sich auf das benutzerdefinierte Paket ComfyUI-MiniMaxH3-Easy. Wenn Sie das offizielle Comfy-Org-Kernpaket verwenden, werden diese Operationen in separate Knoten MiniMaxH3Sampler und MiniMaxH3Conditioning aufgeteilt.
Schritt-für-Schritt-Anleitung zur T2V-Knotenverdrahtung

Das Einrichten der T2V-Latentgenerierung erfordert, das Text-Conditioning und die räumlichen Parameter zu isolieren, bevor der Sampler-Pass ausgeführt wird.
- Text-Encoder-Verdrahtung: Leiten Sie Ihren Text-Prompt-Knoten in den Qwen3-VL-Vision-Text-Encoder-Lader. Leiten Sie den Ausgangstensor direkt in den positiven Prompt-Conditioning-Port des MiniMaxH3TextToVideo-Knotens.
- Berechnung der räumlichen Dimensionen: Leiten Sie die Ausgabewerte von ResolutionSelector in ImageScaleToTotalPixels. Dieser Schritt berechnet die Pixelzuweisung, während er räumliche Dimensionen erzwingt, die durch 32 teilbar bleiben.
- Sampler- und Latentgenerierung: Leiten Sie Modellgewichte, positive Conditioning-Tensoren und Auflösungsparameter direkt in MiniMaxH3TextToVideo, um das rohe Video-Latent zu generieren.
- VAE-Dekodierung und Videoexport: Senden Sie den latenten Tensor durch minimax_h3_video_vae_fp16 zur Dekodierung und leiten Sie dann den gerenderten Framebatch direkt in SaveVideo.
T2V-Knoten-Routing-Matrix
Um diesen Graphen ohne unterbrochene Abhängigkeiten zu erstellen, folgen Sie den unten aufgeführten genauen Knotenportverbindungen:
| Quellknoten | Ausgangsport | Zielknoten | Eingangsport | Workflow-Funktion |
| Qwen3-VL-Encoder | CONDITIONING | MiniMaxH3TextToVideo | positive | Leitet Text-Encoder-Verdrahtung |
| ResolutionSelector | WIDTH / HEIGHT | ImageScaleToTotalPixels | width / height | Legt Seitenverhältnisgrenzen fest |
| ImageScaleToTotalPixels | IMAGE_BOUNDS | MiniMaxH3TextToVideo | resolution | Fixiert 32-Pixel-Raumgitter |
| MiniMaxH3TextToVideo | LATENT | VAEDecode | samples | Steuert T2V-Latentgenerierung |
| VAEDecode | IMAGE | SaveVideo | pixels | Rendert endgültige MP4-Videoausgabe |
MiniMax H3 verlässt sich fast vollständig auf detaillierte positive Prompts, die vom Qwen3-VL-Vision-Language-Modell analysiert werden, was bedeutet, dass traditionelle negative Conditioning-Knoten unnötige Rechenlast hinzufügen, ohne die Ausgabequalität zu verbessern. Das direkte Verbinden von SaveVideo mit dem Video-VAE-Dekodierknoten stellt eine ordnungsgemäße 24fps-MP4-Wiedergabe ohne fallengelassene Nachläuferframes sicher.
Erstellen des Image-to-Video (I2V)- und First/Last-Frame-Workflows

Der Versuch, ein statisches Porträt zu animieren oder zwei Keyframes zu überbrücken, führt oft zu heftiger Subjektverzerrung oder sofortigen Tensorformabstürzen, wenn sich Ihre Start- und Endbilder bereits um einige Pixel unterscheiden. Die Umwandlung einer standardmäßigen Textpipeline in einen Image-to-Video (I2V)-Workflow erfordert das Austauschen des Basissampler-Knotens und das Einrichten präziser Bild-Conditioning-Pipelines über Ihre Anfangs- und Endframes hinweg.
Keyframe-Interpolation und Knotenkonfiguration
Um von T2V zur First-Last-Frame (FL2V)-Videogenerierung zu wechseln, ersetzen Sie MiniMaxH3TextToVideo durch MiniMaxH3ImageToVideo. Dieser Knoten zeigt dedizierte Eingangsports für first_frame und last_frame an, sodass Sie Startzustände, Endzustände oder vollständige Morph-Übergänge definieren können.
- LoadImage-Knoten: Platzieren Sie zwei LoadImage-Knoten auf Ihrer Leinwand, um Ihre Anfangs- und Ziel-Keyframes zu halten.
- Dimensionsabgleich: Leiten Sie Bildausgaben durch GetImageSize, um rohe Breiten- und Höhendimensionen zu extrahieren. Dies verhindert räumliche Gitterfehlanpassungen, bevor Tensoren in den Sampler gelangen.
- Tensor-Conditioning: Verbinden Sie die verarbeiteten Pixeltensoren mit first_frame für die Standard-Einzelbildanimation, oder füllen Sie sowohl first_frame als auch last_frame, um Keyframe-Interpolation durchzuführen.
I2V- und FL2V-Knotenverbindungsmatrix
| Quellknoten | Ausgangsport | Zielknoten | Eingangsport | Pipeline-Funktion |
| LoadImage (Start) | IMAGE | MiniMaxH3ImageToVideo | first_frame | Legt anfängliches Bild-Conditioning fest |
| LoadImage (Ende) | IMAGE | MiniMaxH3ImageToVideo | last_frame | Setzt Endframe für FL2V-Morphs |
| GetImageSize | WIDTH / HEIGHT | ResolutionSelector | width / height | Sperrt Eingabe-Seitenverhältnis auf Vielfache von 32 |
| Qwen3-VL-Encoder | CONDITIONING | MiniMaxH3ImageToVideo | positive | Leitet Bewegungstrajektorie über Text-Prompts |
| MiniMaxH3ImageToVideo | LATENT | VAEDecode | samples | Sendet FL2V-Latents an Video-VAE |
MiniMax H3 erzwingt strikte Dimensionsparität zwischen Keyframe-Eingaben. Beide Keyframes müssen exakt die gleiche räumliche Auflösung aufweisen. Wenn sich first_frame und last_frame in der Größe unterscheiden, stoppt das Sampling während der latenten Initialisierung. Leiten Sie beide Bilder durch denselben Skalierungsknoten, um identische Pixelabmessungen sicherzustellen.
Erweiterte Referenzführung mit MiniMaxH3AddGuide
Standard-Image-to-Video-Graphen steuern nur den ersten und letzten Frame, sodass die Zwischenbewegung unverankert bleibt. Der MiniMaxH3AddGuide-Knoten löst dies, indem er Referenzbilder, Multi-Frame-Bildbatches oder Audiospuren an einem beliebigen frame_idx entlang der Generierungszeitachse verankert.
Kernfunktionen von MiniMaxH3AddGuide
| Parametereingabe | Verankerungsverhalten | Einschränkungsregeln |
| frame_idx | Gibt den genauen Zielframe-Index an | Negative Werte zählen vom Ende des Videos rückwärts. |
| Bild / Multi-Frame | Fixiert Charakterkonsistenz oder Szenenlayout | Batches unter 5 Frames verwenden das erste Bild; Batches von 5+ rasten auf $17k + 5$ Cliplängen ein (5, 22, 39). |
| Audiospur | Richtet Dialog oder Soundeffekte am Index aus | Schneidet automatisch auf die verbleibende Videodauer zu. |
Wie man Ankerknoten für die Referenzvideogenerierung verkettet
Das Verketten mehrerer MiniMaxH3AddGuide-Knoten ermöglicht die vollständige Referenzvideogenerierung (R2V):
- Primärer Charakteranker: Verbinden Sie Ihr positives Conditioning mit MiniMaxH3AddGuide mit frame_idx auf 0 gesetzt, um die Charakteridentität zu Beginn zu fixieren.
- Keyframe für Zwischenbewegung: Verketten Sie einen zweiten MiniMaxH3AddGuide-Knoten, der ein Keyframe-Bild bei frame_idx 60 einspeist, um den Charakter zu einer bestimmten Pose in der Szene zu zwingen.
- Audio-Kopplung: Verbinden Sie einen Ziel-Soundtrack mit dem Audio-Eingangsport und übergeben Sie Ihr audio_vae, um den Sound direkt an diesem Zeitlinienversatz zu synchronisieren.
Das Verketten dieser Conditioning-Anker gewährleistet zeitliche Stabilität, ohne dass der Diffusions-Sampler Latents neu initialisieren muss.
Integration von synchronisiertem nativem Audio mit dualem VAE-Routing

Kreative verbringen stundenlang damit, externe Sprachspuren in Videobearbeitungssoftware manuell auszurichten, nur um später mit unnatürlicher Lippensynchronisationsdrift oder nicht passendem Umgebungsrauschen konfrontiert zu werden. MiniMax H3 eliminiert die Nachbearbeitung der Audioausrichtung, indem es auf echte multimodale Generierung setzt, Videoframes und 32 kHz Stereo-Ton gemeinsam in einem einzigen Vorwärtsdurchlauf synthetisiert.
Architektur des Single-Pass-Streams
Im Gegensatz zu traditionellen Pipelines, die separate Text-to-Speech-Modelle nach der Videowiedergabe verketten, verarbeitet MiniMax H3 Text-, Bild- und zeitliche Hinweise in einem einheitlichen latenten Raum. Während der Entrauschungsphase gibt SamplerCustomAdvanced ein zusammengesetztes latentes Payload aus, das sowohl visuelle als auch akustische Feature-Maps enthält. Diese gemeinsame Synthese garantiert punktgenaue Dialogsynchronisation und organische Soundeffektgenerierung, die präzise mit der On-Screen-Aktion ausgerichtet ist.
Dual-VAE-Dekodierung und Knotenkonfiguration
Um rohe Latents in abspielbare Medien umzuwandeln, teilt der Graph die Ausgabe in zwei separate Dekodierungspfade auf, bevor MP4-Multiplexing erfolgt.
| Knotenkomponente | Modell-Asset / Genauigkeit | Funktion | Ausgangsziel |
| Video-VAE-Lader | minimax_h3_video_vae_fp16.safetensors | Dekodiert visuelle Latents in RGB-Framesequenzen | VAEDecode -> CreateVideo (Videostream) |
| Audio-VAE-Lader | minimax_h3_audio_vae_fp32.safetensors | Dekodiert akustische Latents in unkomprimierte Audiosignale | VAEDecodeAudio -> CreateVideo (Audiostream) |
| Video-Speicher | SaveVideo | Multiplexet Video- und natives Stereo-Audio-Streams | Kodierte MP4-Datei |
Technischer Knotenaufbau
- Laden der dualen VAEs: Fügen Sie zwei verschiedene VAELoader-Knoten zu Ihrer Leinwand hinzu. Verweisen Sie den ersten auf minimax_h3_video_vae_fp16.safetensors und den zweiten auf minimax_h3_audio_vae_fp32.safetensors.
- Ausführen der dualen VAE-Dekodierung: Leiten Sie den visuellen latenten Ausgang vom Sampler in VAEDecode und das Audio-Latent-Chunk in VAEDecodeAudio. Die Beibehaltung von minimax_h3_audio_vae_fp32 in FP32-Genauigkeit verhindert Clipping-Artefakte und Frequenzverzerrungen in Hintergrund-Scores.
- Multiplexing über SaveVideo: Speisen Sie den dekodierten Bildtensor und die unkomprimierte Audio-Wellenform in CreateVideo oder direkt in SaveVideo ein. Der Knoten übernimmt die endgültige Container-Paketierung und schreibt eine fertige 24-fps-MP4-Datei mit eingebettetem Stereo-Audio.
Dieser native Dual-Stream-Aufbau liefert phasengenaue Audioausführung direkt innerhalb von ComfyUI, ohne dass externe Lippen-Synchronisations-Plugins erforderlich sind.
Auflösungsmathematik, Seitenverhältnisbeschränkungen und Frame-Gitter-Snapping
Die Eingabe einer standardmäßigen 1920x1080-Auflösung oder das Einstellen Ihrer Cliplänge auf 60 Frames in ComfyUI wird Ihre Render-Warteschlange sofort mit einem Tensorformfehler zum Absturz bringen oder Ihnen stark verzerrte Kantenübergänge hinterlassen. MiniMax H3 erzwingt strenge mathematische Grenzen für räumliche Dimensionen und Clipdauern, da seine 3D-VAE-Architektur Video-Latents über bestimmte räumliche Blöcke und zeitliche Schritte hinweg komprimiert.
Räumliche Dimensionen und Seitenverhältnis-Voreinstellungen
Die räumliche VAE unterabtastet Eingaben um den Faktor 32. Wenn Ihre Zielbreite oder -höhe kein striktes Vielfaches von 32 ist, schlägt der Diffusions-Sampler während der Grenztensorzuweisungen fehl. Das Modell zielt auf eine 768px native kurze Kante ab, wobei die visuelle Treue gegen sein Ziel-Megapixel-Budget abgewogen wird.
| Seitenverhältnis | Voreingestellte Dimensionen (Px) | Teilbarkeitsprüfung | Zielorientierung |
| 16:09 | 1344 x 768 | 1344 / 32 = 42, 768 / 32 = 24 | Breitbild-Landschaft |
| 9:16 | 768 x 1344 | 768 / 32 = 24, 1344 / 32 = 42 | Vertikal / UGC |
| 1:01 | 1024 x 1024 | 1024 / 32 = 32, 1024 / 32 = 32 | Quadratischer Rahmen |
| 21:09 | 1536 x 672 | 1536 / 32 = 48, 672 / 32 = 21 | Kinematografisches Ultrabreit |
Die Verwendung nicht standardmäßiger Pixelabmessungen zwingt die VAE, Feature-Maps zu padden oder zu strecken, was feine Texturdetails verschlechtert.
Die 17k + 5 Frame-Gitter-Regel
Das zeitliche Dimensions-Snapping folgt einer ebenso strengen Formel. Um innerhalb der MiniMax H3-Videolängenbegrenzung zu bleiben, verarbeitet die Architektur Videosequenzen in 17-Frame-latenten Blöcken mit einer 5-Frame-Schwanzinitialisierung. Um zeitliche Trunkierung oder stille VAE-Dekodierungsabstürze zu vermeiden, muss jeder Render die 17k + 5**-Frame-Gittergleichung** erfüllen, wobei k einen ganzzahligen Schritt-Zähler darstellt.

Bei einer standardmäßigen 24fps-Framerate diktiert diese Mathematik exakte zeitliche Dauern:
- k = 0 (5 Frames): ~0,21 Sekunden (Mikrobewegung oder statischer Burst)
- k = 1 (22 Frames): ~0,91 Sekunden (schneller Aktionsausschnitt)
- k = 3 (56 Frames): ~2,33 Sekunden (kurze Aufnahmesequenz)
- k = 8 (141 Frames): ~5,87 Sekunden (vollständige Standardclipgrenze)
Das Setzen einer Zielanzahl auf 60 zwingt ComfyUI, 4 Frames auf 56 (k=3) fallen zu lassen, was VRAM-Berechnung während des Samplings verschwendet. Snappen Sie Ihre Knotenparameter immer auf die exakte 17k + 5-Schrittgrenze, bevor Sie einen Generierungsbatch in die Warteschlange stellen.
Geschwindigkeitsoptimierung: Aktivieren der 8-Schritt-Turbo-LoRA-Ausführung
Mehr als sechs Minuten auf ein einzelnes 6-Sekunden-Vorschauvideo zu warten, macht eine schnelle Prompt-Iteration auf Consumer-GPUs fast unmöglich. Standard-Sampling-Läufe erfordern 20 bis 30 Schritte, was einen schwerwiegenden operationellen Engpass beim Feintuning von Bewegungshinweisen, Testen von Kamerabewegungen oder Bewerten von Keyframe-Übergängen schafft.
Integration der Turbo-Destillationsgewichte
Die Integration der offiziellen minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16-Gewichtedatei reduziert die Sampling-Pässe auf einen 8-Schritt-Inferenz-Workflow. Dieser Destillationsprozess erreicht eine signifikante Generierungsgeschwindigkeitsoptimierung, ohne die allgemeine visuelle Kohärenz zu beeinträchtigen.
Um diesen Destillationsaufbau in ComfyUI zu konfigurieren:
- Modellgewichte platzieren: Verschieben Sie minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors in Ihr ComfyUI/models/loras/-Verzeichnis.
- LoraLoader-Knoten verdrahten: Leiten Sie den primären Diffusionsmodell-Tensor durch einen LoraLoader-Knoten, bevor Sie den Sampler speisen. Setzen Sie turbo_model_strength auf 1.0.
- Schrittzahl anpassen: Senken Sie den Schritte-Parameter in Ihrem MiniMaxH3Sampler-Knoten von den standardmäßigen 20 auf genau 8.
- CFG-Skala fixieren: Erzwingen Sie den Parameter für die classifier-free guidance scale auf 1.0, um Übersättigung zu vermeiden.
Leistungsbenchmarks: Standard vs. Turbo-Ausführung
| Parameter / Benchmark-Metrik | Standard-Sampling-Pipeline | 8-Schritt-Turbo-LoRA-Ausführung |
| Inferenz-Schrittzahl | 20 bis 30 Schritte | 8 Schritte |
| Renderzeit (RTX 4090, 2K) | ~380 Sekunden | ~145 Sekunden |
| CFG-Guidance-Skala | 3,5 bis 6,0 | Fixiert auf 1,0 (destilliert) |
| Primäre Produktionsnutzung | Endgültige Master-Render | Schnelle Pre-Visualisierung & Szenen-Mockups |
| Zeitliche Stabilität | Vollständige Rekonstruktion | Leichtes Kanten-Flackern bei komplexer Partikelphysik |
Wenn Sie minimax_h3_fl2v_turbo_8step ausführen, erzwingt das Setzen von CFG über 1,0 unnötige Doppel-Conditioning-Pässe, was zu extremer Farbverbrennung, Kontrastübersteuerung und räumlichem Zerreißen über hochbewegliche Frames führt. Die Aktivierung von turbo_mode mit einer festen Turbo-LoRA-Stärke von 1,0 ermöglicht es Kreativen, komplexe Kamerabewegungen in unter drei Minuten zu validieren, bevor sie sich für vollständige 20-Schritt-Produktions-Render entscheiden.
Fehlerbehebung bei häufigen ComfyUI MiniMax H3-Graphenfehlern
Die meisten Betriebsfehler in MiniMax H3-Graphen resultieren aus geringfügigen Tensorausrichtungsfehlanpassungen, nicht verbundenen Audio-Decodern oder GPU-Speicher-Engpässen während des Modellladens.
Diagnoseleitfaden & Schnellkorrekturen
-
CUDA Out of Memory (OOM)
- Hauptursache: Laden des 32B-Text-Encoders zusammen mit int8-Diffusionsgewichten auf GPUs mit 16 GB VRAM ohne Speicher-Auslagerung.
- Schritt-für-Schritt-Korrektur: Fügen Sie Ihrem ComfyUI-Startskript die Flags --lowvram oder --medvram hinzu. Für enge GPU-Speicherkonfigurationen erwägen Sie, MiniMax H3 in ComfyUI mit GGUF-Quantisierung auszuführen, um die Basisspeicheranforderungen zu senken. Stellen Sie sicher, dass qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors strikt in models/text_encoders/ platziert ist, was VRAM-Auslagerung zwischen Textanalyse und Sampling-Pässen ermöglicht.
-
Shape-Mismatch-Fehler
- Hauptursache: Benutzerdefinierte Breiten-/Höhenwerte oder eingegebene Keyframe-Bilder verletzen das erforderliche 32-Pixel-Raumgitter.
- Schritt-für-Schritt-Korrektur: Fügen Sie einen ResolutionSelector- oder ImageScaleToTotalPixels-Knoten vor dem Sampler ein, um alle Leinwand- und Bilddimensionen auf das nächste Vielfache von 32 zu zwingen.
-
Fehlende Audiospur im Export
- Hauptursache: Der Audio-VAE-Pfad ist während der Graphenausführung nicht verbunden oder umgangen.
- Schritt-für-Schritt-Korrektur: Verbinden Sie minimax_h3_audio_vae_fp32 mit dem VAEDecodeAudio-Knoten und leiten Sie dann die dekodierten Audio-Latents in den Audio-Port des SaveVideo-Knotens zusammen mit dem Videostream.
-
GetImageSize-Knotenfehler
- Hauptursache: Nicht übereinstimmende Keyframe-Seitenverhältnisse oder ungültige Multi-Frame-Bildbatches, die in I2V-Sampler-Eingänge eingespeist werden.
- Schritt-für-Schritt-Korrektur: Führen Sie sowohl Anfangs- als auch Endbilder durch einen einheitlichen ImageScaleToTotalPixels-Knoten, um Keyframes vor der latenten Initialisierung auf identische Dimensionen zu fixieren.
-
ComfyUI-Manager-Warnung für fehlende Knoten
- Hauptursache: Erforderliche benutzerdefinierte MiniMax H3-Knotenpakete sind nicht indiziert oder fehlen in der lokalen Umgebung.
- Schritt-für-Schritt-Korrektur: Öffnen Sie ComfyUI-Manager, wählen Sie Fehlende benutzerdefinierte Knoten installieren, suchen Sie nach ComfyUI-MiniMaxH3-Easy, klicken Sie auf Installieren und starten Sie ComfyUI neu.
Behebung von Speicherverlusten und Knotenregisterkonflikten
Viele Tutorials übersehen, wie ComfyUI die VRAM-Zuweisung über aufeinanderfolgende Generierungen hinweg verwaltet. Wenn Sie einen plötzlichen CUDA-Out-of-Memory-Fehler bei einem zweiten oder dritten Render-Versuch erleben, obwohl der erste Durchlauf erfolgreich war, hat ComfyUI den Text-Encoder im VRAM behalten. Das Setzen expliziter Auslagerungsflags in Ihrem Startskript gibt zugewiesenen Speicher zwischen Sampler-Schritten frei.
Beim Öffnen von Community-JSON-Dateien weisen ComfyUI-Manager-Warnungen für fehlende Knoten normalerweise auf veraltete Knotenregister hin. Die Installation von ComfyUI-MiniMaxH3-Easy behebt diese fehlenden Abhängigkeiten direkt. Für I2V-Pipelines erfordert die Behebung eines GetImageSize-Fehlers oder eines Shape-Mismatch-Fehlers, sicherzustellen, dass sowohl Anfangs- als auch End-Keyframe-Bilder mit den Zielpixelgrenzen übereinstimmen.







