Seedance 2.5 ใช้งานได้แล้ววันนี้ — ที่แรกบน Atlas Cloud

MiniMax H3 ComfyUI Workflow: คู่มือฉบับสมบูรณ์สำหรับ T2V และ I2V

เรียนรู้การใช้งานเวิร์กโฟลว์ MiniMax H3 ComfyUI สำหรับ T2V และ I2V ศึกษาเกี่ยวกับกฎการจัดวางกริดเชิงพื้นที่, การกำหนดเส้นทางเสียงแบบ VAE คู่, คณิตศาสตร์เฟรม 17k+5, และการตั้งค่า Turbo LoRA 8 ขั้นตอน

MiniMax H3 ComfyUI Workflow: คู่มือฉบับสมบูรณ์สำหรับ T2V และ I2V

การดำเนินการ MiniMax H3 ใน ComfyUI จำเป็นต้องปฏิบัติตามกฎของตารางเชิงพื้นที่และเชิงเวลาอย่างเคร่งครัด เพื่อป้องกันข้อผิดพลาดของรูปร่างเทนเซอร์ การส่งออก MP4 ที่เงียบ หรือการล่มของโมเดล MiniMax H3 แก้ปัญหาคอขวดเหล่านี้โดยการสังเคราะห์วิดีโอ 2K และเสียงสเตอริโอที่ซิงค์กันโดยธรรมชาติในฟอร์เวิร์ดพาสเดียว

ข้อควรจำสำคัญ: เวิร์กโฟลว์ MiniMax H3 ComfyUI

  • พาสมัลติโมดัลโดยธรรมชาติ: MiniMax H3 สังเคราะห์วิดีโอ 2K และเสียงสเตอริโอ 32 kHz ที่ซิงค์กันโดยตรงภายในพาสดฟฟิวชั่น ComfyUI เดียว
  • ข้อกำหนดฮาร์ดแวร์: ต้องการ VRAM อย่างน้อย 16 GB สำหรับการทำงานแบบ INT8 แนะนำ 24 GB สำหรับการเรนเดอร์ 2K โดยธรรมชาติ
  • กฎตารางเชิงพื้นที่: ความละเอียดของผืนผ้าใบและคีย์เฟรมต้องหารด้วย 32 ลงตัว เช่น 1344×768 เพื่อป้องกันข้อผิดพลาดของรูปร่างเทนเซอร์ VAE เชิงพื้นที่
  • สูตรตารางเชิงเวลา: ความยาวคลิปต้องเป็นไปตามสมการ Total Frames = 17k + 5 (5, 22, 39, 56, 141 เฟรมที่ 24fps) เพื่อหลีกเลี่ยงการตัดทอนแฝง
  • การเพิ่มประสิทธิภาพความเร็ว: รองรับ Turbo LoRA 8 ขั้นตอนอย่างเป็นทางการเพื่อลดเวลาเรนเดอร์ ~60% โดย CFG ถูกล็อกที่ 1.0

ในขณะที่ Text-to-Video (T2V) อาศัยการเริ่มต้นแฝงที่ขับเคลื่อนด้วยข้อความล้วน ๆ Image-to-Video (I2V) จะยึดวิถีการเคลื่อนที่โดยใช้โหนดปรับสภาพ first_frame, last_frame หรือ MiniMaxH3AddGuide ส่วนต่อไปนี้จะอธิบายรายละเอียดการตั้งค่าสภาพแวดล้อม แผนภาพการเชื่อมต่อโหนด และโปรโตคอลการแก้ปัญหาสำหรับทั้งสองไปป์ไลน์

ข้อกำหนดเบื้องต้นที่จำเป็นและโครงสร้างไดเรกทอรีโมเดล

การวางตัวเข้ารหัสข้อความ 32B ไว้ใน models/checkpoints แทนที่จะเป็น models/text_encoders จะทำให้ ComfyUI ค้างระหว่างการคอมไพล์กราฟ หรือล้มเหลวด้วย KeyError ที่ไม่ช่วยอะไร ความล้มเหลวในการตั้งค่าส่วนใหญ่เกิดจากไฟล์ไปอยู่ในโฟลเดอร์ย่อยผิด หรือการแทนที่น้ำหนัก Qwen มาตรฐานด้วยตัวเข้ารหัสข้อความแบบภาพที่กำหนดเองที่ MiniMax H3 ต้องการ

การตั้งค่ากราฟโหนดพื้นที่ทำงาน ComfyUI แสดง CLIP Text Encode, KSampler, EmptySD3LatentImage และ Load VAE ที่กำหนดค่าสำหรับการสร้างวิดีโอ MiniMax H3

ข้อกำหนดความเข้ากันได้ของระบบ

ก่อนดาวน์โหลดน้ำหนักโมเดล ตรวจสอบให้แน่ใจว่าการติดตั้งของคุณตรงตามข้อกำหนดฮาร์ดแวร์และสภาพแวดล้อมพื้นฐานเหล่านี้:

  • ComfyUI Core: เวอร์ชัน v0.30.0 หรือสูงกว่า
  • โหนดกำหนดเอง: ComfyUI-MiniMaxH3-Easy หรือแพ็คเกจทางการ Comfy-Org
  • GPU VRAM: 16 GB (ขั้นต่ำ INT8) / 24 GB (แนะนำ 2K)
  • สแต็กซอฟต์แวร์: Python 3.10+ พร้อม PyTorch 2.4+ และ CUDA 12.1+

ตารางการวางไดเรกทอรีโมเดล

ดาวน์โหลดน้ำหนักโมเดลโอเพนซอร์ส MiniMax H3 อย่างเป็นทางการจากคลังโมเดล Hugging Face และวางแต่ละไฟล์ลงในโฟลเดอร์ย่อยเป้าหมายที่กำหนด

    
หมวดหมู่โมเดลชื่อไฟล์ที่แน่นอนไดเรกทอรีปลายทางหมายเหตุและความแม่นยำ
โมเดล Diffusion (T2V/FL2V)minimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/โมเดลดฟฟิวชัน INT8 หลัก
โมเดล Diffusion (Ref2V)minimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/จำเป็นสำหรับกราฟการอ้างอิง
ตัวเข้ารหัสข้อความqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/น้ำหนักวิทัศน์-ภาษา 4 บิตแบบกำหนดเอง
Video VAEminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/ตัวถอดรหัสเชิงพื้นที่ภาพ FP16
Audio VAEminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/ตัวถอดรหัสอะคูสติก FP32 (ป้องกันการคลิป)
Turbo LoRA (ไม่บังคับ)minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensorsComfyUI/models/loras/เปิดใช้งานการอนุมานแบบ 8 ขั้นตอนเร็ว

หมายเหตุการติดตั้งที่สำคัญ

ไฟล์ qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors เป็นตัวเข้ารหัสข้อความแบบภาพ (สถาปัตยกรรม Qwen3-VL) ที่ผ่านการควอนไทซ์ AWQ 4 บิตแบบกำหนดเอง ซึ่งปรับแต่งโดยเฉพาะสำหรับการปรับสภาพพรอมต์ของ MiniMax H3 อย่าแทนที่ด้วยทรานส์ฟอร์มเมอร์ภาษาทั่วไปในโฟลเดอร์ text_encoders เนื่องจากโมเดลภาษาทั่วไปขาดการฉายภาพมัลติโมดัลที่จำเป็นสำหรับการสร้างวิดีโอแฝง

การสร้างกราฟโหนด Text-to-Video (T2V) ComfyUI

การสร้างกราฟโหนด Text-to-Video (T2V) ที่สะอาดใน ComfyUI ต้องกำหนดเส้นทางเทนเซอร์ฝังข้อความ การตั้งค่าความละเอียดเชิงพื้นที่ และเทนเซอร์เฟรมแฝงในลำดับเชิงเส้นที่เข้มงวด

หมายเหตุแพ็คเกจโหนด: ชื่อโหนดที่ใช้ตลอดคู่มือเวิร์กโฟลว์นี้ เช่น MiniMaxH3TextToVideo และ MiniMaxH3ImageToVideo อ้างอิงถึงแพ็คเกจกำหนดเอง ComfyUI-MiniMaxH3-Easy หากคุณใช้แพ็คเกจหลักทางการ Comfy-Org การดำเนินการเหล่านี้จะถูกแยกเป็นโหนด MiniMaxH3Sampler และ MiniMaxH3Conditioning แยกกัน

คู่มือการเชื่อมต่อโหนด T2V ทีละขั้นตอน

แผนภาพกราฟโหนด Text-to-Video ComfyUI แสดงการปรับสภาพพรอมต์ข้อความ การปรับขนาดความละเอียด ตัวสุ่มตัวอย่าง MiniMaxH3TextToVideo และการถอดรหัส VAE วิดีโอ

การตั้งค่าการสร้างแฝง T2V ต้องแยกการปรับสภาพข้อความและพารามิเตอร์เชิงพื้นที่ก่อนดำเนินการสุ่มตัวอย่าง

  1. การเดินสายตัวเข้ารหัสข้อความ: กำหนดเส้นทางโหนดพรอมต์ข้อความของคุณไปยังตัวโหลดตัวเข้ารหัสข้อความแบบภาพ Qwen3-VL ส่งเทนเซอร์เอาต์พุตไปยังพอร์ตการปรับสภาพพรอมต์เชิงบวกของโหนด MiniMaxH3TextToVideo โดยตรง
  2. การคำนวณมิติเชิงพื้นที่: ส่งค่าเอาต์พุตจาก ResolutionSelector ไปยัง ImageScaleToTotalPixels ขั้นตอนนี้จะคำนวณการจัดสรรพิกเซลในขณะที่บังคับใช้มิติเชิงพื้นที่ที่ยังคงหารด้วย 32 ลงตัว
  3. การสร้างตัวสุ่มตัวอย่างและแฝง: กำหนดเส้นทางน้ำหนักโมเดล เทนเซอร์ปรับสภาพเชิงบวก และพารามิเตอร์ความละเอียดไปยัง MiniMaxH3TextToVideo โดยตรงเพื่อสร้างแฝงวิดีโอดิบ
  4. การถอดรหัส VAE และส่งออกวิดีโอ: ส่งเทนเซอร์แฝงผ่าน minimax_h3_video_vae_fp16 เพื่อถอดรหัส จากนั้นส่งชุดเฟรมที่เรนเดอร์ไปยัง SaveVideo โดยตรง

ตารางการกำหนดเส้นทางโหนด T2V

ในการสร้างกราฟนี้โดยไม่มีการขึ้นต่อกันที่ขาด ให้ทำตามการเชื่อมต่อพอร์ตโหนดที่แน่นอนตามที่ระบุด้านล่าง:

     
โหนดต้นทางพอร์ตเอาต์พุตโหนดปลายทางพอร์ตอินพุตฟังก์ชันเวิร์กโฟลว์
Qwen3-VL EncoderCONDITIONINGMiniMaxH3TextToVideopositiveควบคุมการเดินสายตัวเข้ารหัสข้อความ
ResolutionSelectorWIDTH / HEIGHTImageScaleToTotalPixelswidth / heightตั้งค่าขอบเขตอัตราส่วนภาพ
ImageScaleToTotalPixelsIMAGE_BOUNDSMiniMaxH3TextToVideoresolutionแก้ไขตารางเชิงพื้นที่ 32 พิกเซล
MiniMaxH3TextToVideoLATENTVAEDecodesamplesควบคุมการสร้างแฝง T2V
VAEDecodeIMAGESaveVideopixelsเรนเดอร์เอาต์พุตวิดีโอ MP4 สุดท้าย

MiniMax H3 อาศัยพรอมต์เชิงบวกที่มีรายละเอียดสูงซึ่งแยกวิเคราะห์โดยโมเดลวิทัศน์-ภาษา Qwen3-VL เกือบทั้งหมด หมายความว่าโหนดปรับสภาพเชิงลบแบบเดิม ๆ จะเพิ่มภาระการคำนวณโดยไม่จำเป็นโดยไม่ปรับปรุงคุณภาพเอาต์พุต การเชื่อมต่อ SaveVideo กับโหนดถอดรหัส VAE วิดีโอโดยตรงช่วยให้แน่ใจว่าการเรนเดอร์ MP4 ที่ 24fps ถูกต้องโดยไม่มีการตกหล่นของเฟรมท้าย

การสร้างเวิร์กโฟลว์ Image-to-Video (I2V) และเฟรมแรก/สุดท้าย

การตั้งค่ากราฟโหนด Image-to-Video ComfyUI แสดงโหนด LoadImage สองตัว การจับคู่มิติ GetImageSize และการประมาณค่าเฟรมคีย์ MiniMaxH3ImageToVideo

การพยายามทำให้ภาพนิ่งเคลื่อนไหวหรือเชื่อมสองคีย์เฟรมมักจะส่งผลให้เกิดการบิดเบือนของวัตถุอย่างรุนแรงหรือการล่มของรูปร่างเทนเซอร์ทันทีเมื่อภาพเริ่มต้นและสิ้นสุดแตกต่างกันแม้เพียงไม่กี่พิกเซล การแปลงไปป์ไลน์ข้อความมาตรฐานเป็นเวิร์กโฟลว์ Image-to-Video (I2V) ต้องเปลี่ยนโหนดตัวสุ่มตัวอย่างพื้นฐานและการสร้างไปป์ไลน์ปรับสภาพภาพที่แม่นยำระหว่างเฟรมเริ่มต้นและเฟรมสุดท้ายของคุณ

การประมาณค่าคีย์เฟรมและการกำหนดค่าโหนด

ในการเปลี่ยนจาก T2V เป็นการสร้างวิดีโอแบบเฟรมแรก-สุดท้าย (FL2V) ให้แทนที่ MiniMaxH3TextToVideo ด้วย MiniMaxH3ImageToVideo โหนดนี้จะเปิดเผยพอร์ตอินพุตเฉพาะสำหรับ first_frame และ last_frame ทำให้คุณสามารถกำหนดสถานะเริ่มต้น สถานะสิ้นสุด หรือการเปลี่ยนรูปร่างที่สมบูรณ์ได้

  1. โหนด Load Image: วางโหนด LoadImage สองตัวบนผืนผ้าใบเพื่อเก็บคีย์เฟรมเริ่มต้นและเป้าหมายของคุณ
  2. การจับคู่มิติ: กำหนดเส้นทางเอาต์พุตภาพผ่าน GetImageSize เพื่อแยกความกว้างและความสูงดิบ การดำเนินการนี้ป้องกันความไม่ตรงกันของตารางเชิงพื้นที่ก่อนที่เทนเซอร์จะเข้าสู่ตัวสุ่มตัวอย่าง
  3. การปรับสภาพเทนเซอร์: เชื่อมต่อเทนเซอร์พิกเซลที่ประมวลผลแล้วเข้ากับ first_frame สำหรับแอนิเมชันภาพเดี่ยวมาตรฐาน หรือป้อนทั้ง first_frame และ last_frame เพื่อดำเนินการประมาณค่าคีย์เฟรม

ตารางการเชื่อมต่อโหนด I2V และ FL2V

     
โหนดต้นทางพอร์ตเอาต์พุตโหนดปลายทางพอร์ตอินพุตฟังก์ชันไปป์ไลน์
LoadImage (เริ่มต้น)IMAGEMiniMaxH3ImageToVideofirst_frameสร้างการปรับสภาพภาพเริ่มต้น
LoadImage (สิ้นสุด)IMAGEMiniMaxH3ImageToVideolast_frameตั้งค่าเฟรมสิ้นสุดสำหรับการเปลี่ยนรูปร่าง FL2V
GetImageSizeWIDTH / HEIGHTResolutionSelectorwidth / heightล็อกอัตราส่วนภาพอินพุตให้เป็นพหุคูณของ 32
Qwen3-VL EncoderCONDITIONINGMiniMaxH3ImageToVideopositiveกำหนดวิถีการเคลื่อนที่ผ่านพรอมต์ข้อความ
MiniMaxH3ImageToVideoLATENTVAEDecodesamplesส่งแฝง FL2V ไปยัง VAE วิดีโอ

MiniMax H3 บังคับใช้ความเท่าเทียมกันของมิติที่เข้มงวดระหว่างอินพุตคีย์เฟรม คีย์เฟรมทั้งสองต้องตรงกับความละเอียดเชิงพื้นที่ที่แน่นอน หาก first_frame และ last_frame มีขนาดแตกต่างกัน การสุ่มตัวอย่างจะหยุดระหว่างการเริ่มต้นแฝง กำหนดเส้นทางภาพทั้งสองผ่านโหนดปรับขนาดเดียวกันเพื่อให้แน่ใจว่ามิติพิกเซลเหมือนกัน

การอ้างอิงขั้นสูงด้วย MiniMaxH3AddGuide

กราฟ Image-to-Video มาตรฐานควบคุมเฉพาะเฟรมแรกและเฟรมสุดท้าย ทำให้การเคลื่อนที่ระหว่างกลางไม่มีการยึดเกาะ โหนด MiniMaxH3AddGuide แก้ปัญหานี้โดยยึดภาพอ้างอิง ชุดภาพหลายเฟรม หรือแทร็กเสียงไว้ที่ frame_idx เฉพาะใด ๆ ตามไทม์ไลน์การสร้าง

ความสามารถหลักของ MiniMaxH3AddGuide

   
อินพุตพารามิเตอร์พฤติกรรมการยึดกฎข้อจำกัด
frame_idxระบุดัชนีเฟรมเป้าหมายที่แน่นอนค่าลบจะนับถอยหลังจากจุดสิ้นสุดของวิดีโอ
Image / Multi-frameล็อกความสม่ำเสมอของตัวละครหรือเลย์เอาต์ฉากชุดที่น้อยกว่า 5 เฟรมจะใช้ภาพแรก ชุดที่ 5+ จะยึดตามความยาวคลิป $17k + 5$ (5, 22, 39)
Audio Trackจัดแนวบทสนทนาหรือเอฟเฟกต์เสียงที่ดัชนีครอบตัดโดยอัตโนมัติตามระยะเวลาวิดีโอที่เหลือ

วิธีการเชื่อมโยงโหนดยึดสำหรับการสร้างวิดีโออ้างอิง

การเชื่อมโยงโหนด MiniMaxH3AddGuide หลายตัวเข้าด้วยกันทำให้สามารถสร้างวิดีโออ้างอิงแบบเต็ม (R2V):

  1. การยึดตัวละครหลัก: เชื่อมต่อการปรับสภาพเชิงบวกของคุณเข้ากับ MiniMaxH3AddGuide โดยตั้งค่า frame_idx เป็น 0 เพื่อล็อกเอกลักษณ์ของตัวละครที่จุดเริ่มต้น
  2. คีย์เฟรมการเคลื่อนที่ระหว่างลำดับ: เชื่อมโยงโหนด MiniMaxH3AddGuide ตัวที่สอง โดยป้อนภาพคีย์เฟรมที่ frame_idx 60 เพื่อบังคับให้ตัวละครทำท่าทางเฉพาะกลางฉาก
  3. การเชื่อมโยงเสียง: เชื่อมต่อซาวด์แทร็กเป้าหมายเข้ากับพอร์ตอินพุตเสียง และส่ง audio_vae ของคุณเพื่อซิงค์เสียงโดยตรงที่ออฟเซ็ตไทม์ไลน์นั้น

การเชื่อมโยงคำแนะนำการปรับสภาพเหล่านี้ช่วยรักษาความเสถียรทางเวลาโดยไม่ต้องบังคับให้ตัวสุ่มตัวอย่างดฟฟิวชันเริ่มต้นแฝงใหม่

การรวมเสียงพื้นเมืองแบบซิงค์กับเส้นทาง VAE คู่

แผนภาพกราฟโหนดเส้นทาง VAE คู่ ComfyUI แสดงตัวถอดรหัส VAE วิดีโอและตัวถอดรหัส VAE เสียงที่มัลติเพล็กซ์ไปยัง SaveVideo สำหรับการส่งออกเสียงสเตอริโอที่ซิงค์กัน

ผู้สร้างมักใช้เวลาหลายชั่วโมงในการจัดแนวแทร็กเสียงพูดภายนอกในซอฟต์แวร์ตัดต่อวิดีโอด้วยตนเอง เพียงเพื่อพบกับการล่องลอยของริมฝีปากที่ไม่เป็นธรรมชาติหรือเสียงรบกวนในห้องที่ไม่ตรงกัน MiniMax H3 ขจัดกระบวนการปรับแต่งเสียงภายหลังการผลิตโดยอาศัยการสร้างหลายรูปแบบ (multimodal) ที่แท้จริง โดยสังเคราะห์เฟรมวิดีโอและเสียงสเตอริโอ 32 kHz ร่วมกันภายในฟอร์เวิร์ดพาสเดียว

สถาปัตยกรรมของสตรีมพาสเดียว

แตกต่างจากไปป์ไลน์แบบดั้งเดิมที่เชื่อมโยงโมเดลข้อความเป็นคำพูดแยกต่างหากหลังจากเรนเดอร์วิดีโอ MiniMax H3 จะประมวลผลข้อความ ภาพ และสัญญาณเวลาเข้าสู่พื้นที่แฝงแบบรวม ในระหว่างขั้นตอนการลดสัญญาณรบกวน SamplerCustomAdvanced จะส่งออกเพย์โหลดแฝงแบบผสมที่มีทั้งแผนที่คุณลักษณะทางภาพและอะคูสติก การสังเคราะห์ร่วมกันนี้รับประกันการซิงค์บทสนทนาที่แม่นยำและการสร้างเอฟเฟกต์เสียงที่เป็นธรรมชาติซึ่งสอดคล้องกับการกระทำบนหน้าจออย่างแน่นอน

การถอดรหัส VAE คู่และการกำหนดค่าโหนด

ในการแปลงแฝงดิบเป็นสื่อที่เล่นได้ กราฟจะแยกเอาต์พุตเป็นสองเส้นทางถอดรหัสแยกกันก่อนการมัลติเพล็กซ์ MP4

    
ส่วนประกอบโหนดสินทรัพย์โมเดล / ความแม่นยำฟังก์ชันปลายทางเอาต์พุต
Video VAE Loaderminimax_h3_video_vae_fp16.safetensorsถอดรหัสแฝงภาพเป็นลำดับเฟรม RGBVAEDecode -> CreateVideo (สตรีมวิดีโอ)
Audio VAE Loaderminimax_h3_audio_vae_fp32.safetensorsถอดรหัสแฝงอะคูสติกเป็นสัญญาณเสียงที่ไม่ถูกบีบอัดVAEDecodeAudio -> CreateVideo (สตรีมเสียง)
Video SaverSaveVideoมัลติเพล็กซ์สตรีมวิดีโอและเสียงสเตอริโอพื้นเมืองไฟล์ MP4 ที่เข้ารหัส

การตั้งค่าโหนดทางเทคนิค

  1. โหลด VAE คู่: เพิ่มโหนด VAELoader สองตัวที่แตกต่างกันลงในผืนผ้าใบ ชี้ตัวแรกไปที่ minimax_h3_video_vae_fp16.safetensors และตัวที่สองไปที่ minimax_h3_audio_vae_fp32.safetensors
  2. ดำเนินการถอดรหัส VAE คู่: กำหนดเส้นทางเอาต์พุตแฝงภาพจากตัวสุ่มตัวอย่างไปยัง VAEDecode และชิ้นส่วนแฝงเสียงไปยัง VAEDecodeAudio การรักษา minimax_h3_audio_vae_fp32 ในความแม่นยำ FP32 ช่วยป้องกันสิ่งแปลกปลอมจากการคลิปและการบิดเบือนความถี่ในซาวด์แทร็กพื้นหลัง
  3. มัลติเพล็กซ์ผ่าน SaveVideo: ป้อนเทนเซอร์ภาพที่ถอดรหัสแล้วและรูปคลื่นเสียงที่ไม่ถูกบีบอัดไปยัง CreateVideo หรือโดยตรงไปยัง SaveVideo โหนดจะจัดการการบรรจุคอนเทนเนอร์สุดท้าย โดยเขียนไฟล์ MP4 ที่ 24 fps พร้อมเสียงสเตอริโอในตัว

การตั้งค่าสตรีมคู่แบบพื้นเมืองนี้ให้การทำงานของเสียงที่แม่นยำตามเฟสภายใน ComfyUI โดยตรง โดยไม่ต้องใช้ปลั๊กอินการซิงค์ริมฝีปากภายนอก

คณิตศาสตร์ความละเอียด ข้อจำกัดอัตราส่วนภาพ และการยึดตารางเฟรม

การป้อนความละเอียดมาตรฐาน 1920x1080 หรือตั้งค่าความยาวคลิปเป็น 60 เฟรมใน ComfyUI จะทำให้คิวเรนเดอร์ของคุณล่มทันทีด้วยข้อผิดพลาดของรูปร่างเทนเซอร์ หรือทำให้เกิดรอยต่อขอบที่บิดเบี้ยวอย่างรุนแรง MiniMax H3 บังคับใช้ขอบเขตทางคณิตศาสตร์ที่เข้มงวดสำหรับมิติเชิงพื้นที่และระยะเวลาคลิป เนื่องจากสถาปัตยกรรม VAE 3 มิติบีบอัดแฝงวิดีโอผ่านบล็อกเชิงพื้นที่เฉพาะและจังหวะทางเวลา

มิติเชิงพื้นที่และค่าที่ตั้งไว้ล่วงหน้าอัตราส่วนภาพ

VAE เชิงพื้นที่ลดขนาดอินพุตลงด้วยปัจจัย 32 หากความกว้างหรือความสูงเป้าหมายของคุณไม่ใช่พหุคูณที่แน่นอนของ 32 ตัวสุ่มตัวอย่างดฟฟิวชันจะล้มเหลวระหว่างการจัดสรรเทนเซอร์ขอบเขต โมเดลกำหนดเป้าหมายขอบสั้นธรรมชาติ 768px โดยสร้างสมดุลระหว่างความเที่ยงตรงของภาพกับงบประมาณเมกะพิกเซลเป้าหมาย

    
อัตราส่วนภาพขนาดที่ตั้งไว้ล่วงหน้า (Px)การตรวจสอบการหารลงตัวการวางแนวเป้าหมาย
16:091344 x 7681344 / 32 = 42, 768 / 32 = 24ภาพแนวกว้าง
9:16768 x 1344768 / 32 = 24, 1344 / 32 = 42แนวตั้ง / UGC
1:011024 x 10241024 / 32 = 32, 1024 / 32 = 32กรอบสี่เหลี่ยมจัตุรัส
21:091536 x 6721536 / 32 = 48, 672 / 32 = 21อัลตร้าไวด์แบบภาพยนตร์

การใช้มิติพิกเซลที่ไม่ได้มาตรฐานจะบังคับให้ VAE ทำการแพดหรือยืดแผนที่คุณลักษณะ ทำให้รายละเอียดพื้นผิวที่ละเอียดลดลง

กฎตารางเฟรม 17k + 5

การยึดมิติทางเวลาก็เป็นไปตามสูตรที่เข้มงวดเท่าเทียมกัน เพื่อให้อยู่ในขีดจำกัดความยาววิดีโอ MiniMax H3 สถาปัตยกรรมจะประมวลผลลำดับวิดีโอในชิ้นส่วนแฝง 17 เฟรมพร้อมการเริ่มต้นท้าย 5 เฟรม เพื่อหลีกเลี่ยงการตัดทอนทางเวลาหรือการล่มของการถอดรหัส VAE แบบเงียบ ทุกการเรนเดอร์ต้องเป็นไปตามสมการตารางเฟรม 17k + 5 โดยที่ k แทนตัวนับขั้นตอนจำนวนเต็ม

สูตรกฎตารางเฟรม 17k+5

ที่อัตราเฟรมมาตรฐาน 24fps คณิตศาสตร์นี้กำหนดระยะเวลาทางเวลาที่แน่นอน:

  • k = 0 (5 เฟรม): ~0.21 วินาที (การเคลื่อนไหวขนาดเล็กหรือการระเบิดนิ่ง)
  • k = 1 (22 เฟรม): ~0.91 วินาที (การกระทำสั้น ๆ)
  • k = 3 (56 เฟรม): ~2.33 วินาที (ลำดับช็อตสั้น)
  • k = 8 (141 เฟรม): ~5.87 วินาที (ขีดจำกัดคลิปมาตรฐานเต็ม)

การตั้งค่าเป้าหมายเป็น 60 จะบังคับให้ ComfyUI ทิ้ง 4 เฟรมเหลือ 56 (k=3) ทำให้สิ้นเปลืองการคำนวณ VRAM ระหว่างการสุ่มตัวอย่าง ยึดพารามิเตอร์โหนดของคุณเข้ากับขอบเขตขั้นตอน 17k + 5 ที่แน่นอนเสมอก่อนที่จะจัดคิวชุดการสร้าง

การเพิ่มประสิทธิภาพความเร็ว: การเปิดใช้งานการดำเนินการ Turbo LoRA 8 ขั้นตอน

การรอมากกว่าหกนาทีเพื่อให้วิดีโอตัวอย่าง 6 วินาทีเพียงคลิปเดียวเรนเดอร์ทำให้การปรับเปลี่ยนพรอมต์อย่างรวดเร็วแทบจะเป็นไปไม่ได้บน GPU สำหรับผู้บริโภค การสุ่มตัวอย่างมาตรฐานต้องใช้ 20 ถึง 30 ขั้นตอน สร้างคอขวดในการปฏิบัติการที่รุนแรงเมื่อปรับสัญญาณการเคลื่อนที่ ทดสอบการเคลื่อนไหวของกล้อง หรือประเมินการเปลี่ยนคีย์เฟรม

การรวมน้ำหนักการกลั่น Turbo

การรวมไฟล์น้ำหนักทางการ minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 จะลดการส่งผ่านการสุ่มตัวอย่างลงเหลือเวิร์กโฟลว์การอนุมาน 8 ขั้นตอน กระบวนการกลั่นนี้ทำให้เกิดการเพิ่มประสิทธิภาพความเร็วในการสร้างอย่างมีนัยสำคัญโดยไม่กระทบต่อความสอดคล้องทางภาพโดยรวม

ในการกำหนดค่าการตั้งค่าการกลั่นนี้ใน ComfyUI:

  1. วางน้ำหนักโมเดล: ย้าย minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors ไปยังไดเรกทอรี ComfyUI/models/loras/ ของคุณ
  2. เดินสายโหนด LoraLoader: กำหนดเส้นทางเทนเซอร์โมเดลดฟฟิวชันหลักผ่านโหนด LoraLoader ก่อนป้อนตัวสุ่มตัวอย่าง ตั้งค่า turbo_model_strength เป็น 1.0
  3. ปรับจำนวนขั้นตอน: ลดพารามิเตอร์ steps ในโหนด MiniMaxH3Sampler ของคุณจาก 20 มาตรฐานลงเหลือ 8
  4. ล็อกสเกล CFG: บังคับพารามิเตอร์สเกลคำแนะนำแบบไม่มีตัวแยกประเภทเป็น 1.0 เพื่อหลีกเลี่ยงการอิ่มตัวสีมากเกินไป

เกณฑ์มาตรฐานประสิทธิภาพ: การดำเนินการมาตรฐานเทียบกับ Turbo

   
พารามิเตอร์ / ตัวชี้วัดเกณฑ์มาตรฐานไปป์ไลน์การสุ่มตัวอย่างมาตรฐานการดำเนินการ Turbo LoRA 8 ขั้นตอน
จำนวนขั้นตอนการอนุมาน20 ถึง 30 ขั้นตอน8 ขั้นตอน
เวลาเรนเดอร์ (RTX 4090, 2K)~380 วินาที~145 วินาที
สเกลคำแนะนำ CFG3.5 ถึง 6.0คงที่ที่ 1.0 (กลั่นแล้ว)
การใช้งานหลักในการผลิตการเรนเดอร์มาสเตอร์สุดท้ายการแสดงภาพล่วงหน้าอย่างรวดเร็วและจำลองฉาก
ความเสถียรทางเวลาการสร้างใหม่เต็มรูปแบบกระตุกขอบเล็กน้อยในฟิสิกส์อนุภาคที่ซับซ้อน

เมื่อรัน minimax_h3_fl2v_turbo_8step การตั้งค่า CFG สูงกว่า 1.0 จะบังคับให้มีการส่งผ่านการปรับสภาพสองครั้งโดยไม่จำเป็น ทำให้เกิดการไหม้ของสีที่รุนแรง การสูญเสียคอนทราสต์ และการฉีกขาดเชิงพื้นที่ในเฟรมที่มีการเคลื่อนที่สูง การเปิดใช้งาน turbo_mode ด้วยความแข็งแกร่ง Turbo LoRA คงที่ที่ 1.0 ช่วยให้ผู้สร้างสามารถตรวจสอบการเคลื่อนไหวของกล้องที่ซับซ้อนได้ภายในเวลาไม่ถึงสามนาทีก่อนที่จะดำเนินการเรนเดอร์การผลิตแบบ 20 ขั้นตอนเต็ม

การแก้ไขข้อผิดพลาดกราฟ MiniMax H3 ComfyUI ทั่วไป

ความล้มเหลวในการปฏิบัติการส่วนใหญ่ในกราฟ MiniMax H3 เกิดจากการไม่ตรงกันของการจัดแนวเทนเซอร์เล็กน้อย ตัวถอดรหัสเสียงที่ไม่ได้เชื่อมต่อ หรือคอขวดของหน่วยความจำ GPU ระหว่างการโหลดโมเดล

คู่มือการวินิจฉัยและการแก้ไขด่วน

  1. CUDA หน่วยความจำไม่เพียงพอ (OOM)

    1. สาเหตุหลัก: การโหลดตัวเข้ารหัสข้อความ 32B พร้อมกับน้ำหนักดฟฟิวชัน int8 บน GPU VRAM 16GB โดยไม่มีการถ่ายหน่วยความจำ
    2. การแก้ไขทีละขั้นตอน: เพิ่มแฟล็ก --lowvram หรือ --medvram ในสคริปต์เริ่มต้น ComfyUI ของคุณ สำหรับการตั้งค่าหน่วยความจำ GPU ที่จำกัด ให้พิจารณา รัน MiniMax H3 ใน ComfyUI ด้วย GGUF quantization เพื่อลดข้อกำหนดหน่วยความจำพื้นฐาน ตรวจสอบให้แน่ใจว่า qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ถูกวางไว้ใน models/text_encoders/ อย่างเคร่งครัด เพื่อให้สามารถถ่าย VRAM ระหว่างการแยกวิเคราะห์ข้อความและการส่งผ่านการสุ่มตัวอย่าง
  2. ข้อผิดพลาด Shape Mismatch

    1. สาเหตุหลัก: ค่าความกว้าง/ความสูงที่กำหนดเองหรือภาพคีย์เฟรมอินพุตละเมิดตารางการหารลงตัว 32 พิกเซลที่ต้องการ
    2. การแก้ไขทีละขั้นตอน: แทรกโหนด ResolutionSelector หรือ ImageScaleToTotalPixels ก่อนตัวสุ่มตัวอย่างเพื่อบังคับให้ขนาดผืนผ้าใบและภาพทั้งหมดเป็นพหุคูณที่ใกล้ที่สุดของ 32
  3. ไม่มีแทร็กเสียงในเอาต์พุต

    1. สาเหตุหลัก: เส้นทาง VAE เสียงไม่ได้เชื่อมต่อหรือถูกบายพาสระหว่างการดำเนินการกราฟ
    2. การแก้ไขทีละขั้นตอน: เชื่อมต่อ minimax_h3_audio_vae_fp32 เข้ากับโหนด VAEDecodeAudio จากนั้นส่งแฝงเสียงที่ถอดรหัสแล้วไปยังพอร์ตเสียงของโหนด SaveVideo พร้อมกับสตรีมวิดีโอ
  4. ความล้มเหลวของโหนด GetImageSize

    1. สาเหตุหลัก: อัตราส่วนภาพคีย์เฟรมไม่ตรงกันหรือชุดภาพหลายเฟรมที่ไม่ถูกต้องที่ป้อนเข้าสู่อินพุตตัวสุ่มตัวอย่าง I2V
    2. การแก้ไขทีละขั้นตอน: รันภาพเริ่มต้นและสิ้นสุดผ่านโหนด ImageScaleToTotalPixels เดียวกันเพื่อล็อกคีย์เฟรมให้มีมิติที่เหมือนกันก่อนการเริ่มต้นแฝง
  5. คำเตือน ComfyUI Manager Missing Nodes

    1. สาเหตุหลัก: แพ็คเกจโหนดกำหนดเอง MiniMax H3 ที่จำเป็นไม่ได้ถูกจัดทำดัชนีหรือหายไปจากสภาพแวดล้อมภายในเครื่อง
    2. การแก้ไขทีละขั้นตอน: เปิด ComfyUI Manager เลือก Install Missing Custom Nodes ค้นหา ComfyUI-MiniMaxH3-Easy คลิก Install และรีสตาร์ท ComfyUI

การแก้ไขปัญหาหน่วยความจำลดลงและข้อขัดแย้งของรีจิสทรีโหนด

บทช่วยสอนหลายบทละเลยว่า ComfyUI จัดการการจัดสรร VRAM อย่างไรในรุ่นที่ต่อเนื่องกัน หากคุณพบข้อผิดพลาด CUDA หน่วยความจำไม่เพียงพออย่างกะทันหันในครั้งที่สองหรือสามที่พยายามเรนเดอร์ แม้ว่าการผ่านครั้งแรกจะสำเร็จ แสดงว่า ComfyUI ยังคงเก็บตัวเข้ารหัสข้อความไว้ใน VRAM การตั้งค่าแฟล็ก offload ที่ชัดเจนในสคริปต์เริ่มต้นของคุณจะทำให้หน่วยความจำที่จัดสรรไว้ว่างระหว่างขั้นตอนการสุ่มตัวอย่าง

เมื่อเปิดไฟล์ JSON ของชุมชน คำเตือน ComfyUI Manager missing nodes มักจะบ่งชี้ว่ารีจิสทรีโหนดล้าสมัย การติดตั้ง ComfyUI-MiniMaxH3-Easy จะแก้ไขการขึ้นต่อกันที่ขาดหายไปเหล่านี้โดยตรง สำหรับไปป์ไลน์ I2V การแก้ไขความล้มเหลวของ GetImageSize หรือข้อผิดพลาด shape mismatch จำเป็นต้องตรวจสอบให้แน่ใจว่าภาพคีย์เฟรมเริ่มต้นและสิ้นสุดตรงกับขอบเขตพิกเซลเป้าหมาย

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด