การดำเนินการ MiniMax H3 ใน ComfyUI จำเป็นต้องปฏิบัติตามกฎของตารางเชิงพื้นที่และเชิงเวลาอย่างเคร่งครัด เพื่อป้องกันข้อผิดพลาดของรูปร่างเทนเซอร์ การส่งออก MP4 ที่เงียบ หรือการล่มของโมเดล MiniMax H3 แก้ปัญหาคอขวดเหล่านี้โดยการสังเคราะห์วิดีโอ 2K และเสียงสเตอริโอที่ซิงค์กันโดยธรรมชาติในฟอร์เวิร์ดพาสเดียว
ข้อควรจำสำคัญ: เวิร์กโฟลว์ MiniMax H3 ComfyUI
- พาสมัลติโมดัลโดยธรรมชาติ: MiniMax H3 สังเคราะห์วิดีโอ 2K และเสียงสเตอริโอ 32 kHz ที่ซิงค์กันโดยตรงภายในพาสดฟฟิวชั่น ComfyUI เดียว
- ข้อกำหนดฮาร์ดแวร์: ต้องการ VRAM อย่างน้อย 16 GB สำหรับการทำงานแบบ INT8 แนะนำ 24 GB สำหรับการเรนเดอร์ 2K โดยธรรมชาติ
- กฎตารางเชิงพื้นที่: ความละเอียดของผืนผ้าใบและคีย์เฟรมต้องหารด้วย 32 ลงตัว เช่น 1344×768 เพื่อป้องกันข้อผิดพลาดของรูปร่างเทนเซอร์ VAE เชิงพื้นที่
- สูตรตารางเชิงเวลา: ความยาวคลิปต้องเป็นไปตามสมการ Total Frames = 17k + 5 (5, 22, 39, 56, 141 เฟรมที่ 24fps) เพื่อหลีกเลี่ยงการตัดทอนแฝง
- การเพิ่มประสิทธิภาพความเร็ว: รองรับ Turbo LoRA 8 ขั้นตอนอย่างเป็นทางการเพื่อลดเวลาเรนเดอร์ ~60% โดย CFG ถูกล็อกที่ 1.0
ในขณะที่ Text-to-Video (T2V) อาศัยการเริ่มต้นแฝงที่ขับเคลื่อนด้วยข้อความล้วน ๆ Image-to-Video (I2V) จะยึดวิถีการเคลื่อนที่โดยใช้โหนดปรับสภาพ first_frame, last_frame หรือ MiniMaxH3AddGuide ส่วนต่อไปนี้จะอธิบายรายละเอียดการตั้งค่าสภาพแวดล้อม แผนภาพการเชื่อมต่อโหนด และโปรโตคอลการแก้ปัญหาสำหรับทั้งสองไปป์ไลน์
ข้อกำหนดเบื้องต้นที่จำเป็นและโครงสร้างไดเรกทอรีโมเดล
การวางตัวเข้ารหัสข้อความ 32B ไว้ใน models/checkpoints แทนที่จะเป็น models/text_encoders จะทำให้ ComfyUI ค้างระหว่างการคอมไพล์กราฟ หรือล้มเหลวด้วย KeyError ที่ไม่ช่วยอะไร ความล้มเหลวในการตั้งค่าส่วนใหญ่เกิดจากไฟล์ไปอยู่ในโฟลเดอร์ย่อยผิด หรือการแทนที่น้ำหนัก Qwen มาตรฐานด้วยตัวเข้ารหัสข้อความแบบภาพที่กำหนดเองที่ MiniMax H3 ต้องการ

ข้อกำหนดความเข้ากันได้ของระบบ
ก่อนดาวน์โหลดน้ำหนักโมเดล ตรวจสอบให้แน่ใจว่าการติดตั้งของคุณตรงตามข้อกำหนดฮาร์ดแวร์และสภาพแวดล้อมพื้นฐานเหล่านี้:
- ComfyUI Core: เวอร์ชัน v0.30.0 หรือสูงกว่า
- โหนดกำหนดเอง: ComfyUI-MiniMaxH3-Easy หรือแพ็คเกจทางการ Comfy-Org
- GPU VRAM: 16 GB (ขั้นต่ำ INT8) / 24 GB (แนะนำ 2K)
- สแต็กซอฟต์แวร์: Python 3.10+ พร้อม PyTorch 2.4+ และ CUDA 12.1+
ตารางการวางไดเรกทอรีโมเดล
ดาวน์โหลดน้ำหนักโมเดลโอเพนซอร์ส MiniMax H3 อย่างเป็นทางการจากคลังโมเดล Hugging Face และวางแต่ละไฟล์ลงในโฟลเดอร์ย่อยเป้าหมายที่กำหนด
| หมวดหมู่โมเดล | ชื่อไฟล์ที่แน่นอน | ไดเรกทอรีปลายทาง | หมายเหตุและความแม่นยำ |
| โมเดล Diffusion (T2V/FL2V) | minimax_h3_fl2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | โมเดลดฟฟิวชัน INT8 หลัก |
| โมเดล Diffusion (Ref2V) | minimax_h3_ref2va_pruned_int8_convrot.safetensors | ComfyUI/models/diffusion_models/ | จำเป็นสำหรับกราฟการอ้างอิง |
| ตัวเข้ารหัสข้อความ | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | ComfyUI/models/text_encoders/ | น้ำหนักวิทัศน์-ภาษา 4 บิตแบบกำหนดเอง |
| Video VAE | minimax_h3_video_vae_fp16.safetensors | ComfyUI/models/vae/ | ตัวถอดรหัสเชิงพื้นที่ภาพ FP16 |
| Audio VAE | minimax_h3_audio_vae_fp32.safetensors | ComfyUI/models/vae/ | ตัวถอดรหัสอะคูสติก FP32 (ป้องกันการคลิป) |
| Turbo LoRA (ไม่บังคับ) | minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors | ComfyUI/models/loras/ | เปิดใช้งานการอนุมานแบบ 8 ขั้นตอนเร็ว |
หมายเหตุการติดตั้งที่สำคัญ
ไฟล์ qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors เป็นตัวเข้ารหัสข้อความแบบภาพ (สถาปัตยกรรม Qwen3-VL) ที่ผ่านการควอนไทซ์ AWQ 4 บิตแบบกำหนดเอง ซึ่งปรับแต่งโดยเฉพาะสำหรับการปรับสภาพพรอมต์ของ MiniMax H3 อย่าแทนที่ด้วยทรานส์ฟอร์มเมอร์ภาษาทั่วไปในโฟลเดอร์ text_encoders เนื่องจากโมเดลภาษาทั่วไปขาดการฉายภาพมัลติโมดัลที่จำเป็นสำหรับการสร้างวิดีโอแฝง
การสร้างกราฟโหนด Text-to-Video (T2V) ComfyUI
การสร้างกราฟโหนด Text-to-Video (T2V) ที่สะอาดใน ComfyUI ต้องกำหนดเส้นทางเทนเซอร์ฝังข้อความ การตั้งค่าความละเอียดเชิงพื้นที่ และเทนเซอร์เฟรมแฝงในลำดับเชิงเส้นที่เข้มงวด
หมายเหตุแพ็คเกจโหนด: ชื่อโหนดที่ใช้ตลอดคู่มือเวิร์กโฟลว์นี้ เช่น MiniMaxH3TextToVideo และ MiniMaxH3ImageToVideo อ้างอิงถึงแพ็คเกจกำหนดเอง ComfyUI-MiniMaxH3-Easy หากคุณใช้แพ็คเกจหลักทางการ Comfy-Org การดำเนินการเหล่านี้จะถูกแยกเป็นโหนด MiniMaxH3Sampler และ MiniMaxH3Conditioning แยกกัน
คู่มือการเชื่อมต่อโหนด T2V ทีละขั้นตอน

การตั้งค่าการสร้างแฝง T2V ต้องแยกการปรับสภาพข้อความและพารามิเตอร์เชิงพื้นที่ก่อนดำเนินการสุ่มตัวอย่าง
- การเดินสายตัวเข้ารหัสข้อความ: กำหนดเส้นทางโหนดพรอมต์ข้อความของคุณไปยังตัวโหลดตัวเข้ารหัสข้อความแบบภาพ Qwen3-VL ส่งเทนเซอร์เอาต์พุตไปยังพอร์ตการปรับสภาพพรอมต์เชิงบวกของโหนด MiniMaxH3TextToVideo โดยตรง
- การคำนวณมิติเชิงพื้นที่: ส่งค่าเอาต์พุตจาก ResolutionSelector ไปยัง ImageScaleToTotalPixels ขั้นตอนนี้จะคำนวณการจัดสรรพิกเซลในขณะที่บังคับใช้มิติเชิงพื้นที่ที่ยังคงหารด้วย 32 ลงตัว
- การสร้างตัวสุ่มตัวอย่างและแฝง: กำหนดเส้นทางน้ำหนักโมเดล เทนเซอร์ปรับสภาพเชิงบวก และพารามิเตอร์ความละเอียดไปยัง MiniMaxH3TextToVideo โดยตรงเพื่อสร้างแฝงวิดีโอดิบ
- การถอดรหัส VAE และส่งออกวิดีโอ: ส่งเทนเซอร์แฝงผ่าน minimax_h3_video_vae_fp16 เพื่อถอดรหัส จากนั้นส่งชุดเฟรมที่เรนเดอร์ไปยัง SaveVideo โดยตรง
ตารางการกำหนดเส้นทางโหนด T2V
ในการสร้างกราฟนี้โดยไม่มีการขึ้นต่อกันที่ขาด ให้ทำตามการเชื่อมต่อพอร์ตโหนดที่แน่นอนตามที่ระบุด้านล่าง:
| โหนดต้นทาง | พอร์ตเอาต์พุต | โหนดปลายทาง | พอร์ตอินพุต | ฟังก์ชันเวิร์กโฟลว์ |
| Qwen3-VL Encoder | CONDITIONING | MiniMaxH3TextToVideo | positive | ควบคุมการเดินสายตัวเข้ารหัสข้อความ |
| ResolutionSelector | WIDTH / HEIGHT | ImageScaleToTotalPixels | width / height | ตั้งค่าขอบเขตอัตราส่วนภาพ |
| ImageScaleToTotalPixels | IMAGE_BOUNDS | MiniMaxH3TextToVideo | resolution | แก้ไขตารางเชิงพื้นที่ 32 พิกเซล |
| MiniMaxH3TextToVideo | LATENT | VAEDecode | samples | ควบคุมการสร้างแฝง T2V |
| VAEDecode | IMAGE | SaveVideo | pixels | เรนเดอร์เอาต์พุตวิดีโอ MP4 สุดท้าย |
MiniMax H3 อาศัยพรอมต์เชิงบวกที่มีรายละเอียดสูงซึ่งแยกวิเคราะห์โดยโมเดลวิทัศน์-ภาษา Qwen3-VL เกือบทั้งหมด หมายความว่าโหนดปรับสภาพเชิงลบแบบเดิม ๆ จะเพิ่มภาระการคำนวณโดยไม่จำเป็นโดยไม่ปรับปรุงคุณภาพเอาต์พุต การเชื่อมต่อ SaveVideo กับโหนดถอดรหัส VAE วิดีโอโดยตรงช่วยให้แน่ใจว่าการเรนเดอร์ MP4 ที่ 24fps ถูกต้องโดยไม่มีการตกหล่นของเฟรมท้าย
การสร้างเวิร์กโฟลว์ Image-to-Video (I2V) และเฟรมแรก/สุดท้าย

การพยายามทำให้ภาพนิ่งเคลื่อนไหวหรือเชื่อมสองคีย์เฟรมมักจะส่งผลให้เกิดการบิดเบือนของวัตถุอย่างรุนแรงหรือการล่มของรูปร่างเทนเซอร์ทันทีเมื่อภาพเริ่มต้นและสิ้นสุดแตกต่างกันแม้เพียงไม่กี่พิกเซล การแปลงไปป์ไลน์ข้อความมาตรฐานเป็นเวิร์กโฟลว์ Image-to-Video (I2V) ต้องเปลี่ยนโหนดตัวสุ่มตัวอย่างพื้นฐานและการสร้างไปป์ไลน์ปรับสภาพภาพที่แม่นยำระหว่างเฟรมเริ่มต้นและเฟรมสุดท้ายของคุณ
การประมาณค่าคีย์เฟรมและการกำหนดค่าโหนด
ในการเปลี่ยนจาก T2V เป็นการสร้างวิดีโอแบบเฟรมแรก-สุดท้าย (FL2V) ให้แทนที่ MiniMaxH3TextToVideo ด้วย MiniMaxH3ImageToVideo โหนดนี้จะเปิดเผยพอร์ตอินพุตเฉพาะสำหรับ first_frame และ last_frame ทำให้คุณสามารถกำหนดสถานะเริ่มต้น สถานะสิ้นสุด หรือการเปลี่ยนรูปร่างที่สมบูรณ์ได้
- โหนด Load Image: วางโหนด LoadImage สองตัวบนผืนผ้าใบเพื่อเก็บคีย์เฟรมเริ่มต้นและเป้าหมายของคุณ
- การจับคู่มิติ: กำหนดเส้นทางเอาต์พุตภาพผ่าน GetImageSize เพื่อแยกความกว้างและความสูงดิบ การดำเนินการนี้ป้องกันความไม่ตรงกันของตารางเชิงพื้นที่ก่อนที่เทนเซอร์จะเข้าสู่ตัวสุ่มตัวอย่าง
- การปรับสภาพเทนเซอร์: เชื่อมต่อเทนเซอร์พิกเซลที่ประมวลผลแล้วเข้ากับ first_frame สำหรับแอนิเมชันภาพเดี่ยวมาตรฐาน หรือป้อนทั้ง first_frame และ last_frame เพื่อดำเนินการประมาณค่าคีย์เฟรม
ตารางการเชื่อมต่อโหนด I2V และ FL2V
| โหนดต้นทาง | พอร์ตเอาต์พุต | โหนดปลายทาง | พอร์ตอินพุต | ฟังก์ชันไปป์ไลน์ |
| LoadImage (เริ่มต้น) | IMAGE | MiniMaxH3ImageToVideo | first_frame | สร้างการปรับสภาพภาพเริ่มต้น |
| LoadImage (สิ้นสุด) | IMAGE | MiniMaxH3ImageToVideo | last_frame | ตั้งค่าเฟรมสิ้นสุดสำหรับการเปลี่ยนรูปร่าง FL2V |
| GetImageSize | WIDTH / HEIGHT | ResolutionSelector | width / height | ล็อกอัตราส่วนภาพอินพุตให้เป็นพหุคูณของ 32 |
| Qwen3-VL Encoder | CONDITIONING | MiniMaxH3ImageToVideo | positive | กำหนดวิถีการเคลื่อนที่ผ่านพรอมต์ข้อความ |
| MiniMaxH3ImageToVideo | LATENT | VAEDecode | samples | ส่งแฝง FL2V ไปยัง VAE วิดีโอ |
MiniMax H3 บังคับใช้ความเท่าเทียมกันของมิติที่เข้มงวดระหว่างอินพุตคีย์เฟรม คีย์เฟรมทั้งสองต้องตรงกับความละเอียดเชิงพื้นที่ที่แน่นอน หาก first_frame และ last_frame มีขนาดแตกต่างกัน การสุ่มตัวอย่างจะหยุดระหว่างการเริ่มต้นแฝง กำหนดเส้นทางภาพทั้งสองผ่านโหนดปรับขนาดเดียวกันเพื่อให้แน่ใจว่ามิติพิกเซลเหมือนกัน
การอ้างอิงขั้นสูงด้วย MiniMaxH3AddGuide
กราฟ Image-to-Video มาตรฐานควบคุมเฉพาะเฟรมแรกและเฟรมสุดท้าย ทำให้การเคลื่อนที่ระหว่างกลางไม่มีการยึดเกาะ โหนด MiniMaxH3AddGuide แก้ปัญหานี้โดยยึดภาพอ้างอิง ชุดภาพหลายเฟรม หรือแทร็กเสียงไว้ที่ frame_idx เฉพาะใด ๆ ตามไทม์ไลน์การสร้าง
ความสามารถหลักของ MiniMaxH3AddGuide
| อินพุตพารามิเตอร์ | พฤติกรรมการยึด | กฎข้อจำกัด |
| frame_idx | ระบุดัชนีเฟรมเป้าหมายที่แน่นอน | ค่าลบจะนับถอยหลังจากจุดสิ้นสุดของวิดีโอ |
| Image / Multi-frame | ล็อกความสม่ำเสมอของตัวละครหรือเลย์เอาต์ฉาก | ชุดที่น้อยกว่า 5 เฟรมจะใช้ภาพแรก ชุดที่ 5+ จะยึดตามความยาวคลิป $17k + 5$ (5, 22, 39) |
| Audio Track | จัดแนวบทสนทนาหรือเอฟเฟกต์เสียงที่ดัชนี | ครอบตัดโดยอัตโนมัติตามระยะเวลาวิดีโอที่เหลือ |
วิธีการเชื่อมโยงโหนดยึดสำหรับการสร้างวิดีโออ้างอิง
การเชื่อมโยงโหนด MiniMaxH3AddGuide หลายตัวเข้าด้วยกันทำให้สามารถสร้างวิดีโออ้างอิงแบบเต็ม (R2V):
- การยึดตัวละครหลัก: เชื่อมต่อการปรับสภาพเชิงบวกของคุณเข้ากับ MiniMaxH3AddGuide โดยตั้งค่า frame_idx เป็น 0 เพื่อล็อกเอกลักษณ์ของตัวละครที่จุดเริ่มต้น
- คีย์เฟรมการเคลื่อนที่ระหว่างลำดับ: เชื่อมโยงโหนด MiniMaxH3AddGuide ตัวที่สอง โดยป้อนภาพคีย์เฟรมที่ frame_idx 60 เพื่อบังคับให้ตัวละครทำท่าทางเฉพาะกลางฉาก
- การเชื่อมโยงเสียง: เชื่อมต่อซาวด์แทร็กเป้าหมายเข้ากับพอร์ตอินพุตเสียง และส่ง audio_vae ของคุณเพื่อซิงค์เสียงโดยตรงที่ออฟเซ็ตไทม์ไลน์นั้น
การเชื่อมโยงคำแนะนำการปรับสภาพเหล่านี้ช่วยรักษาความเสถียรทางเวลาโดยไม่ต้องบังคับให้ตัวสุ่มตัวอย่างดฟฟิวชันเริ่มต้นแฝงใหม่
การรวมเสียงพื้นเมืองแบบซิงค์กับเส้นทาง VAE คู่

ผู้สร้างมักใช้เวลาหลายชั่วโมงในการจัดแนวแทร็กเสียงพูดภายนอกในซอฟต์แวร์ตัดต่อวิดีโอด้วยตนเอง เพียงเพื่อพบกับการล่องลอยของริมฝีปากที่ไม่เป็นธรรมชาติหรือเสียงรบกวนในห้องที่ไม่ตรงกัน MiniMax H3 ขจัดกระบวนการปรับแต่งเสียงภายหลังการผลิตโดยอาศัยการสร้างหลายรูปแบบ (multimodal) ที่แท้จริง โดยสังเคราะห์เฟรมวิดีโอและเสียงสเตอริโอ 32 kHz ร่วมกันภายในฟอร์เวิร์ดพาสเดียว
สถาปัตยกรรมของสตรีมพาสเดียว
แตกต่างจากไปป์ไลน์แบบดั้งเดิมที่เชื่อมโยงโมเดลข้อความเป็นคำพูดแยกต่างหากหลังจากเรนเดอร์วิดีโอ MiniMax H3 จะประมวลผลข้อความ ภาพ และสัญญาณเวลาเข้าสู่พื้นที่แฝงแบบรวม ในระหว่างขั้นตอนการลดสัญญาณรบกวน SamplerCustomAdvanced จะส่งออกเพย์โหลดแฝงแบบผสมที่มีทั้งแผนที่คุณลักษณะทางภาพและอะคูสติก การสังเคราะห์ร่วมกันนี้รับประกันการซิงค์บทสนทนาที่แม่นยำและการสร้างเอฟเฟกต์เสียงที่เป็นธรรมชาติซึ่งสอดคล้องกับการกระทำบนหน้าจออย่างแน่นอน
การถอดรหัส VAE คู่และการกำหนดค่าโหนด
ในการแปลงแฝงดิบเป็นสื่อที่เล่นได้ กราฟจะแยกเอาต์พุตเป็นสองเส้นทางถอดรหัสแยกกันก่อนการมัลติเพล็กซ์ MP4
| ส่วนประกอบโหนด | สินทรัพย์โมเดล / ความแม่นยำ | ฟังก์ชัน | ปลายทางเอาต์พุต |
| Video VAE Loader | minimax_h3_video_vae_fp16.safetensors | ถอดรหัสแฝงภาพเป็นลำดับเฟรม RGB | VAEDecode -> CreateVideo (สตรีมวิดีโอ) |
| Audio VAE Loader | minimax_h3_audio_vae_fp32.safetensors | ถอดรหัสแฝงอะคูสติกเป็นสัญญาณเสียงที่ไม่ถูกบีบอัด | VAEDecodeAudio -> CreateVideo (สตรีมเสียง) |
| Video Saver | SaveVideo | มัลติเพล็กซ์สตรีมวิดีโอและเสียงสเตอริโอพื้นเมือง | ไฟล์ MP4 ที่เข้ารหัส |
การตั้งค่าโหนดทางเทคนิค
- โหลด VAE คู่: เพิ่มโหนด VAELoader สองตัวที่แตกต่างกันลงในผืนผ้าใบ ชี้ตัวแรกไปที่ minimax_h3_video_vae_fp16.safetensors และตัวที่สองไปที่ minimax_h3_audio_vae_fp32.safetensors
- ดำเนินการถอดรหัส VAE คู่: กำหนดเส้นทางเอาต์พุตแฝงภาพจากตัวสุ่มตัวอย่างไปยัง VAEDecode และชิ้นส่วนแฝงเสียงไปยัง VAEDecodeAudio การรักษา minimax_h3_audio_vae_fp32 ในความแม่นยำ FP32 ช่วยป้องกันสิ่งแปลกปลอมจากการคลิปและการบิดเบือนความถี่ในซาวด์แทร็กพื้นหลัง
- มัลติเพล็กซ์ผ่าน SaveVideo: ป้อนเทนเซอร์ภาพที่ถอดรหัสแล้วและรูปคลื่นเสียงที่ไม่ถูกบีบอัดไปยัง CreateVideo หรือโดยตรงไปยัง SaveVideo โหนดจะจัดการการบรรจุคอนเทนเนอร์สุดท้าย โดยเขียนไฟล์ MP4 ที่ 24 fps พร้อมเสียงสเตอริโอในตัว
การตั้งค่าสตรีมคู่แบบพื้นเมืองนี้ให้การทำงานของเสียงที่แม่นยำตามเฟสภายใน ComfyUI โดยตรง โดยไม่ต้องใช้ปลั๊กอินการซิงค์ริมฝีปากภายนอก
คณิตศาสตร์ความละเอียด ข้อจำกัดอัตราส่วนภาพ และการยึดตารางเฟรม
การป้อนความละเอียดมาตรฐาน 1920x1080 หรือตั้งค่าความยาวคลิปเป็น 60 เฟรมใน ComfyUI จะทำให้คิวเรนเดอร์ของคุณล่มทันทีด้วยข้อผิดพลาดของรูปร่างเทนเซอร์ หรือทำให้เกิดรอยต่อขอบที่บิดเบี้ยวอย่างรุนแรง MiniMax H3 บังคับใช้ขอบเขตทางคณิตศาสตร์ที่เข้มงวดสำหรับมิติเชิงพื้นที่และระยะเวลาคลิป เนื่องจากสถาปัตยกรรม VAE 3 มิติบีบอัดแฝงวิดีโอผ่านบล็อกเชิงพื้นที่เฉพาะและจังหวะทางเวลา
มิติเชิงพื้นที่และค่าที่ตั้งไว้ล่วงหน้าอัตราส่วนภาพ
VAE เชิงพื้นที่ลดขนาดอินพุตลงด้วยปัจจัย 32 หากความกว้างหรือความสูงเป้าหมายของคุณไม่ใช่พหุคูณที่แน่นอนของ 32 ตัวสุ่มตัวอย่างดฟฟิวชันจะล้มเหลวระหว่างการจัดสรรเทนเซอร์ขอบเขต โมเดลกำหนดเป้าหมายขอบสั้นธรรมชาติ 768px โดยสร้างสมดุลระหว่างความเที่ยงตรงของภาพกับงบประมาณเมกะพิกเซลเป้าหมาย
| อัตราส่วนภาพ | ขนาดที่ตั้งไว้ล่วงหน้า (Px) | การตรวจสอบการหารลงตัว | การวางแนวเป้าหมาย |
| 16:09 | 1344 x 768 | 1344 / 32 = 42, 768 / 32 = 24 | ภาพแนวกว้าง |
| 9:16 | 768 x 1344 | 768 / 32 = 24, 1344 / 32 = 42 | แนวตั้ง / UGC |
| 1:01 | 1024 x 1024 | 1024 / 32 = 32, 1024 / 32 = 32 | กรอบสี่เหลี่ยมจัตุรัส |
| 21:09 | 1536 x 672 | 1536 / 32 = 48, 672 / 32 = 21 | อัลตร้าไวด์แบบภาพยนตร์ |
การใช้มิติพิกเซลที่ไม่ได้มาตรฐานจะบังคับให้ VAE ทำการแพดหรือยืดแผนที่คุณลักษณะ ทำให้รายละเอียดพื้นผิวที่ละเอียดลดลง
กฎตารางเฟรม 17k + 5
การยึดมิติทางเวลาก็เป็นไปตามสูตรที่เข้มงวดเท่าเทียมกัน เพื่อให้อยู่ในขีดจำกัดความยาววิดีโอ MiniMax H3 สถาปัตยกรรมจะประมวลผลลำดับวิดีโอในชิ้นส่วนแฝง 17 เฟรมพร้อมการเริ่มต้นท้าย 5 เฟรม เพื่อหลีกเลี่ยงการตัดทอนทางเวลาหรือการล่มของการถอดรหัส VAE แบบเงียบ ทุกการเรนเดอร์ต้องเป็นไปตามสมการตารางเฟรม 17k + 5 โดยที่ k แทนตัวนับขั้นตอนจำนวนเต็ม

ที่อัตราเฟรมมาตรฐาน 24fps คณิตศาสตร์นี้กำหนดระยะเวลาทางเวลาที่แน่นอน:
- k = 0 (5 เฟรม): ~0.21 วินาที (การเคลื่อนไหวขนาดเล็กหรือการระเบิดนิ่ง)
- k = 1 (22 เฟรม): ~0.91 วินาที (การกระทำสั้น ๆ)
- k = 3 (56 เฟรม): ~2.33 วินาที (ลำดับช็อตสั้น)
- k = 8 (141 เฟรม): ~5.87 วินาที (ขีดจำกัดคลิปมาตรฐานเต็ม)
การตั้งค่าเป้าหมายเป็น 60 จะบังคับให้ ComfyUI ทิ้ง 4 เฟรมเหลือ 56 (k=3) ทำให้สิ้นเปลืองการคำนวณ VRAM ระหว่างการสุ่มตัวอย่าง ยึดพารามิเตอร์โหนดของคุณเข้ากับขอบเขตขั้นตอน 17k + 5 ที่แน่นอนเสมอก่อนที่จะจัดคิวชุดการสร้าง
การเพิ่มประสิทธิภาพความเร็ว: การเปิดใช้งานการดำเนินการ Turbo LoRA 8 ขั้นตอน
การรอมากกว่าหกนาทีเพื่อให้วิดีโอตัวอย่าง 6 วินาทีเพียงคลิปเดียวเรนเดอร์ทำให้การปรับเปลี่ยนพรอมต์อย่างรวดเร็วแทบจะเป็นไปไม่ได้บน GPU สำหรับผู้บริโภค การสุ่มตัวอย่างมาตรฐานต้องใช้ 20 ถึง 30 ขั้นตอน สร้างคอขวดในการปฏิบัติการที่รุนแรงเมื่อปรับสัญญาณการเคลื่อนที่ ทดสอบการเคลื่อนไหวของกล้อง หรือประเมินการเปลี่ยนคีย์เฟรม
การรวมน้ำหนักการกลั่น Turbo
การรวมไฟล์น้ำหนักทางการ minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 จะลดการส่งผ่านการสุ่มตัวอย่างลงเหลือเวิร์กโฟลว์การอนุมาน 8 ขั้นตอน กระบวนการกลั่นนี้ทำให้เกิดการเพิ่มประสิทธิภาพความเร็วในการสร้างอย่างมีนัยสำคัญโดยไม่กระทบต่อความสอดคล้องทางภาพโดยรวม
ในการกำหนดค่าการตั้งค่าการกลั่นนี้ใน ComfyUI:
- วางน้ำหนักโมเดล: ย้าย minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors ไปยังไดเรกทอรี ComfyUI/models/loras/ ของคุณ
- เดินสายโหนด LoraLoader: กำหนดเส้นทางเทนเซอร์โมเดลดฟฟิวชันหลักผ่านโหนด LoraLoader ก่อนป้อนตัวสุ่มตัวอย่าง ตั้งค่า turbo_model_strength เป็น 1.0
- ปรับจำนวนขั้นตอน: ลดพารามิเตอร์ steps ในโหนด MiniMaxH3Sampler ของคุณจาก 20 มาตรฐานลงเหลือ 8
- ล็อกสเกล CFG: บังคับพารามิเตอร์สเกลคำแนะนำแบบไม่มีตัวแยกประเภทเป็น 1.0 เพื่อหลีกเลี่ยงการอิ่มตัวสีมากเกินไป
เกณฑ์มาตรฐานประสิทธิภาพ: การดำเนินการมาตรฐานเทียบกับ Turbo
| พารามิเตอร์ / ตัวชี้วัดเกณฑ์มาตรฐาน | ไปป์ไลน์การสุ่มตัวอย่างมาตรฐาน | การดำเนินการ Turbo LoRA 8 ขั้นตอน |
| จำนวนขั้นตอนการอนุมาน | 20 ถึง 30 ขั้นตอน | 8 ขั้นตอน |
| เวลาเรนเดอร์ (RTX 4090, 2K) | ~380 วินาที | ~145 วินาที |
| สเกลคำแนะนำ CFG | 3.5 ถึง 6.0 | คงที่ที่ 1.0 (กลั่นแล้ว) |
| การใช้งานหลักในการผลิต | การเรนเดอร์มาสเตอร์สุดท้าย | การแสดงภาพล่วงหน้าอย่างรวดเร็วและจำลองฉาก |
| ความเสถียรทางเวลา | การสร้างใหม่เต็มรูปแบบ | กระตุกขอบเล็กน้อยในฟิสิกส์อนุภาคที่ซับซ้อน |
เมื่อรัน minimax_h3_fl2v_turbo_8step การตั้งค่า CFG สูงกว่า 1.0 จะบังคับให้มีการส่งผ่านการปรับสภาพสองครั้งโดยไม่จำเป็น ทำให้เกิดการไหม้ของสีที่รุนแรง การสูญเสียคอนทราสต์ และการฉีกขาดเชิงพื้นที่ในเฟรมที่มีการเคลื่อนที่สูง การเปิดใช้งาน turbo_mode ด้วยความแข็งแกร่ง Turbo LoRA คงที่ที่ 1.0 ช่วยให้ผู้สร้างสามารถตรวจสอบการเคลื่อนไหวของกล้องที่ซับซ้อนได้ภายในเวลาไม่ถึงสามนาทีก่อนที่จะดำเนินการเรนเดอร์การผลิตแบบ 20 ขั้นตอนเต็ม
การแก้ไขข้อผิดพลาดกราฟ MiniMax H3 ComfyUI ทั่วไป
ความล้มเหลวในการปฏิบัติการส่วนใหญ่ในกราฟ MiniMax H3 เกิดจากการไม่ตรงกันของการจัดแนวเทนเซอร์เล็กน้อย ตัวถอดรหัสเสียงที่ไม่ได้เชื่อมต่อ หรือคอขวดของหน่วยความจำ GPU ระหว่างการโหลดโมเดล
คู่มือการวินิจฉัยและการแก้ไขด่วน
-
CUDA หน่วยความจำไม่เพียงพอ (OOM)
- สาเหตุหลัก: การโหลดตัวเข้ารหัสข้อความ 32B พร้อมกับน้ำหนักดฟฟิวชัน int8 บน GPU VRAM 16GB โดยไม่มีการถ่ายหน่วยความจำ
- การแก้ไขทีละขั้นตอน: เพิ่มแฟล็ก --lowvram หรือ --medvram ในสคริปต์เริ่มต้น ComfyUI ของคุณ สำหรับการตั้งค่าหน่วยความจำ GPU ที่จำกัด ให้พิจารณา รัน MiniMax H3 ใน ComfyUI ด้วย GGUF quantization เพื่อลดข้อกำหนดหน่วยความจำพื้นฐาน ตรวจสอบให้แน่ใจว่า qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ถูกวางไว้ใน models/text_encoders/ อย่างเคร่งครัด เพื่อให้สามารถถ่าย VRAM ระหว่างการแยกวิเคราะห์ข้อความและการส่งผ่านการสุ่มตัวอย่าง
-
ข้อผิดพลาด Shape Mismatch
- สาเหตุหลัก: ค่าความกว้าง/ความสูงที่กำหนดเองหรือภาพคีย์เฟรมอินพุตละเมิดตารางการหารลงตัว 32 พิกเซลที่ต้องการ
- การแก้ไขทีละขั้นตอน: แทรกโหนด ResolutionSelector หรือ ImageScaleToTotalPixels ก่อนตัวสุ่มตัวอย่างเพื่อบังคับให้ขนาดผืนผ้าใบและภาพทั้งหมดเป็นพหุคูณที่ใกล้ที่สุดของ 32
-
ไม่มีแทร็กเสียงในเอาต์พุต
- สาเหตุหลัก: เส้นทาง VAE เสียงไม่ได้เชื่อมต่อหรือถูกบายพาสระหว่างการดำเนินการกราฟ
- การแก้ไขทีละขั้นตอน: เชื่อมต่อ minimax_h3_audio_vae_fp32 เข้ากับโหนด VAEDecodeAudio จากนั้นส่งแฝงเสียงที่ถอดรหัสแล้วไปยังพอร์ตเสียงของโหนด SaveVideo พร้อมกับสตรีมวิดีโอ
-
ความล้มเหลวของโหนด GetImageSize
- สาเหตุหลัก: อัตราส่วนภาพคีย์เฟรมไม่ตรงกันหรือชุดภาพหลายเฟรมที่ไม่ถูกต้องที่ป้อนเข้าสู่อินพุตตัวสุ่มตัวอย่าง I2V
- การแก้ไขทีละขั้นตอน: รันภาพเริ่มต้นและสิ้นสุดผ่านโหนด ImageScaleToTotalPixels เดียวกันเพื่อล็อกคีย์เฟรมให้มีมิติที่เหมือนกันก่อนการเริ่มต้นแฝง
-
คำเตือน ComfyUI Manager Missing Nodes
- สาเหตุหลัก: แพ็คเกจโหนดกำหนดเอง MiniMax H3 ที่จำเป็นไม่ได้ถูกจัดทำดัชนีหรือหายไปจากสภาพแวดล้อมภายในเครื่อง
- การแก้ไขทีละขั้นตอน: เปิด ComfyUI Manager เลือก Install Missing Custom Nodes ค้นหา ComfyUI-MiniMaxH3-Easy คลิก Install และรีสตาร์ท ComfyUI
การแก้ไขปัญหาหน่วยความจำลดลงและข้อขัดแย้งของรีจิสทรีโหนด
บทช่วยสอนหลายบทละเลยว่า ComfyUI จัดการการจัดสรร VRAM อย่างไรในรุ่นที่ต่อเนื่องกัน หากคุณพบข้อผิดพลาด CUDA หน่วยความจำไม่เพียงพออย่างกะทันหันในครั้งที่สองหรือสามที่พยายามเรนเดอร์ แม้ว่าการผ่านครั้งแรกจะสำเร็จ แสดงว่า ComfyUI ยังคงเก็บตัวเข้ารหัสข้อความไว้ใน VRAM การตั้งค่าแฟล็ก offload ที่ชัดเจนในสคริปต์เริ่มต้นของคุณจะทำให้หน่วยความจำที่จัดสรรไว้ว่างระหว่างขั้นตอนการสุ่มตัวอย่าง
เมื่อเปิดไฟล์ JSON ของชุมชน คำเตือน ComfyUI Manager missing nodes มักจะบ่งชี้ว่ารีจิสทรีโหนดล้าสมัย การติดตั้ง ComfyUI-MiniMaxH3-Easy จะแก้ไขการขึ้นต่อกันที่ขาดหายไปเหล่านี้โดยตรง สำหรับไปป์ไลน์ I2V การแก้ไขความล้มเหลวของ GetImageSize หรือข้อผิดพลาด shape mismatch จำเป็นต้องตรวจสอบให้แน่ใจว่าภาพคีย์เฟรมเริ่มต้นและสิ้นสุดตรงกับขอบเขตพิกเซลเป้าหมาย







