Seedance 2.5 متاح الآن — لأول مرة على Atlas Cloud

MiniMax H3 ComfyUI سير العمل: دليل كامل لـ T2V و I2V

أتقن سير عمل MiniMax H3 ComfyUI لـ T2V و I2V. تعلم قواعد الشبكة المكانية، توجيه الصوت المزدوج VAE، رياضيات 17k+5 إطار، وإعداد Turbo LoRA بخطوات 8.

MiniMax H3 ComfyUI سير العمل: دليل كامل لـ T2V و I2V

يتطلب تنفيذ MiniMax H3 في ComfyUI الالتزام الصارم بقواعد الشبكة المكانية والزمنية لمنع أخطاء شكل الموتر، أو تصدير MP4 صامت، أو تعطل النموذج. يعمل MiniMax H3 على حل هذه الاختناقات من خلال توليف فيديو بدقة 2K وصوت ستيريو متزامن أصلي في تمريرة انتشار واحدة.

الخلاصات الرئيسية: سير عمل MiniMax H3 في ComfyUI

  • تمريرة متعددة الوسائط أصلية: يقوم MiniMax H3 بتوليف فيديو بدقة 2K وصوت ستيريو 32 كيلوهرتز متزامن مباشرة ضمن تمريرة انتشار واحدة في ComfyUI.
  • الحد الأدنى للعتاد: يتطلب ما لا يقل عن 16 جيجابايت من VRAM للتنفيذ الكمي INT8، و24 جيجابايت موصى بها لعرض 2K الأصلي.
  • قاعدة الشبكة المكانية: يجب أن تكون دقة اللوحة والإطارات الرئيسية قابلة للقسمة بشكل صارم على 32، مثل 1344×768، لمنع أخطاء شكل موتر VAE المكاني.
  • صيغة الشبكة الزمنية: يجب أن تتوافق أطوال المقاطع مع معادلة إجمالي الإطارات = 17k + 5 (5، 22، 39، 56، 141 إطارًا بمعدل 24 إطارًا في الثانية) لتجنب اقتطاع الكامن.
  • تحسين السرعة: يدعم LoRA توربو رسمي من 8 خطوات لتقليل أوقات العرض بنسبة ~60% مع تثبيت CFG عند 1.0.

بينما يعتمد تحويل النص إلى فيديو (T2V) على التهيئة الكامنة النقية المعتمدة على النص، فإن تحويل الصورة إلى فيديو (I2V) يربط مسارات الحركة باستخدام عقد التكييف first_frame أو last_frame أو MiniMaxH3AddGuide. توضح الأقسام التالية إعداد البيئة الكامل، ومخططات توصيل العقد، وبروتوكولات استكشاف الأخطاء وإصلاحها لكلا المسارين.

المتطلبات الأساسية وهيكل دليل النموذج

وضع مشفر نص 32B في models/checkpoints بدلاً من models/text_encoders سيتسبب في تجميد ComfyUI أثناء تجميع الرسم البياني أو فشله مع خطأ KeyError غير مفيد. تحدث معظم حالات فشل الإعداد لأن الملفات تنتهي في مجلدات فرعية خاطئة، أو بسبب استبدال أوزان Qwen القياسية بمشفر النص البصري المخصص المطلوب من MiniMax H3.

إعداد رسم بياني لعقد مساحة عمل ComfyUI يظهر CLIP Text Encode وKSampler وEmptySD3LatentImage وLoad VAE مهيأة لتوليد فيديو MiniMax H3

متطلبات توافق النظام

قبل تنزيل أوزان النموذج، تأكد من أن التثبيت يلبي متطلبات العتاد والبيئة الأساسية التالية:

  • نواة ComfyUI: الإصدار v0.30.0 أو أعلى.
  • العقد المخصصة: ComfyUI-MiniMaxH3-Easy أو حزمة Comfy-Org الرسمية.
  • ذاكرة GPU VRAM: 16 جيجابايت (حد أدنى INT8) / 24 جيجابايت (موصى به 2K).
  • حزمة البرامج: Python 3.10+ مع PyTorch 2.4+ وCUDA 12.1+.

مصفوفة وضع الدليل للنماذج

قم بتنزيل أوزان نموذج MiniMax H3 مفتوح المصدر الرسمية من مستودع نماذج Hugging Face وضع كل ملف في المجلد الفرعي الهدف المخصص له.

    
فئة النموذجاسم الملف بالضبطدليل الوجهةملاحظات والدقة
نموذج الانتشار (T2V/FL2V)minimax_h3_fl2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/نموذج الانتشار الكمي INT8 الأساسي
نموذج الانتشار (Ref2V)minimax_h3_ref2va_pruned_int8_convrot.safetensorsComfyUI/models/diffusion_models/مطلوب لرسوم التوجيه المرجعية
مشفر النصqwen3vl_32b_minimax_h3_nvfp4_awq.safetensorsComfyUI/models/text_encoders/أوزان رؤية-لغة مخصصة 4 بت
VAE الفيديوminimax_h3_video_vae_fp16.safetensorsComfyUI/models/vae/مفكك تشفير بصري مكاني FP16
VAE الصوتminimax_h3_audio_vae_fp32.safetensorsComfyUI/models/vae/مفكك تشفير صوتي FP32 (يمنع القص)
Turbo LoRA (اختياري)minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensorsComfyUI/models/loras/يتيح استدلالًا سريعًا من 8 خطوات

ملاحظة تثبيت هامة

ملف qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors هو مشفر نص-رؤية مخصص مكمم 4 بت (معمارية Qwen3-VL) تم ضبطه بدقة لتكييف موجهات MiniMax H3. لا تستبدله بمحولات لغة قياسية في مجلد text_encoders، لأن نماذج اللغة العامة تفتقر إلى الإسقاط البصري متعدد الوسائط المطلوب لتوليد الفيديو الكامن.

بناء رسم بياني لعقد ComfyUI لتحويل النص إلى فيديو (T2V)

يتطلب بناء رسم بياني نظيف لعقد تحويل النص إلى فيديو (T2V) في ComfyUI توجيه تضمينات النص وإعدادات الدقة المكانية وموترات الإطارات الكامنة في تسلسل خطي صارم.

ملاحظة حول حزمة العقد: أسماء العقد المستخدمة في هذا الدليل، مثل MiniMaxH3TextToVideo وMiniMaxH3ImageToVideo، تشير إلى الحزمة المخصصة ComfyUI-MiniMaxH3-Easy. إذا كنت تستخدم الحزمة الأساسية الرسمية Comfy-Org، فإن هذه العمليات مقسمة إلى عقد منفصلة MiniMaxH3Sampler وMiniMaxH3Conditioning.

دليل توصيل عقد T2V خطوة بخطوة

مخطط رسم بياني لعقد تحويل النص إلى فيديو في ComfyUI يوضح تكييف الموجه النصي، وضبط الدقة، وعينة MiniMaxH3TextToVideo، وفك تشفير VAE الفيديو

يتطلب إعداد التوليد الكامن T2V عزل تكييف النص والمعلمات المكانية قبل تنفيذ تمريرة العينة.

  1. توصيل مشفر النص: قم بتوجيه عقدة الموجه النصي إلى محمل مشفر النص البصري Qwen3-VL. مرر موتر الإخراج مباشرة إلى منفذ تكييف الموجه الإيجابي لعقدة MiniMaxH3TextToVideo.
  2. حساب الأبعاد المكانية: قم بتوصيل قيم الإخراج من ResolutionSelector إلى ImageScaleToTotalPixels. تحسب هذه الخطوة تخصيص البكسل مع فرض أبعاد مكانية تبقى قابلة للقسمة على 32.
  3. العينة والتوليد الكامن: قم بتوجيه أوزان النموذج وموترات التكييف الإيجابي ومعلمات الدقة مباشرة إلى MiniMaxH3TextToVideo لتوليد الكامن الخام للفيديو.
  4. فك تشفير VAE وتصدير الفيديو: أرسل الموتر الكامن عبر minimax_h3_video_vae_fp16 لفك التشفير، ثم قم بتوجيه دفعة الإطارات المقدمة مباشرة إلى SaveVideo.

مصفوفة توجيه عقد T2V

لبناء هذا الرسم البياني بدون تبعيات مكسورة، اتبع اتصالات منافذ العقدة المحددة أدناه:

     
عقدة المصدرمنفذ الإخراجعقدة الهدفمنفذ الإدخالوظيفة سير العمل
مشفر Qwen3-VLCONDITIONINGMiniMaxH3TextToVideopositiveيوجه توصيل مشفر النص
ResolutionSelectorWIDTH / HEIGHTImageScaleToTotalPixelswidth / heightيحدد حدود نسبة الأبعاد
ImageScaleToTotalPixelsIMAGE_BOUNDSMiniMaxH3TextToVideoresolutionيثبت الشبكة المكانية 32 بكسل
MiniMaxH3TextToVideoLATENTVAEDecodesamplesيتحكم في التوليد الكامن T2V
VAEDecodeIMAGESaveVideopixelsيعرض إخراج فيديو MP4 النهائي

يعتمد MiniMax H3 بشكل شبه كامل على الموجهات الإيجابية المفصلة التي يحللها نموذج الرؤية-اللغة Qwen3-VL، مما يعني أن عقد التكييف السلبي التقليدية تضيف حملًا حسابيًا غير ضروري دون تحسين جودة الإخراج. توصيل SaveVideo مباشرة بعقدة فك تشفير VAE الفيديو يضمن عرض MP4 صحيح بمعدل 24 إطارًا في الثانية دون إطارات متأخرة مسقطة.

بناء سير عمل تحويل الصورة إلى فيديو (I2V) والإطار الأول/الأخير

إعداد رسم بياني لعقد تحويل الصورة إلى فيديو في ComfyUI يظهر عقدتي LoadImage مزدوجة ومطابقة أبعاد GetImageSize واستيفاء الإطارات الرئيسية MiniMaxH3ImageToVideo

محاولة تحريك صورة ثابتة أو ربط إطارين رئيسيين غالبًا ما تؤدي إلى تشوه عنيف للموضوع أو انهيار فوري لشكل الموتر عندما تختلف صور البداية والنهاية حتى ببضعة بكسلات. يتطلب تحويل مسار نصي قياسي إلى سير عمل تحويل الصورة إلى فيديو (I2V) استبدال عقدة العينة الأساسية وإنشاء خطوط تكييف دقيقة للصورة عبر الإطارات الأولية والنهائية.

استيفاء الإطارات الرئيسية وتكوين العقد

للانتقال من T2V إلى توليد فيديو الإطار الأول-الأخير (FL2V)، استبدل MiniMaxH3TextToVideo بـ MiniMaxH3ImageToVideo. تكشف هذه العقدة عن منافذ إدخال مخصصة لـ first_frame و last_frame، مما يسمح لك بتعريف حالات البداية أو حالات الإغلاق أو تحولات المورف الكاملة.

  1. عقد تحميل الصورة: ضع عقدتي LoadImage على اللوحة لتثبيت الإطارات الرئيسية الأولية والهدف.
  2. مطابقة الأبعاد: قم بتوجيه مخرجات الصورة عبر GetImageSize لاستخراج أبعاد العرض والارتفاع الخام. يمنع هذا عدم تطابق الشبكة المكانية قبل دخول الموترات إلى العينة.
  3. تكييف الموتر: قم بتوصيل موترات البكسل المعالجة إلى first_frame للرسوم المتحركة القياسية بصورة واحدة، أو قم بملء كل من first_frame و last_frame لتنفيذ استيفاء الإطارات الرئيسية.

مصفوفة اتصال عقد I2V و FL2V

     
عقدة المصدرمنفذ الإخراجعقدة الهدفمنفذ الإدخالوظيفة المسار
LoadImage (البداية)IMAGEMiniMaxH3ImageToVideofirst_frameيحدد تكييف الصورة الأولية
LoadImage (النهاية)IMAGEMiniMaxH3ImageToVideolast_frameيحدد الإطار النهائي لتحولات FL2V
GetImageSizeWIDTH / HEIGHTResolutionSelectorwidth / heightيقفل نسبة أبعاد الإدخال إلى مضاعفات 32
مشفر Qwen3-VLCONDITIONINGMiniMaxH3ImageToVideopositiveيوجه مسار الحركة عبر الموجهات النصية
MiniMaxH3ImageToVideoLATENTVAEDecodesamplesيرسل الكامن FL2V إلى VAE الفيديو

يفرض MiniMax H3 تكافؤًا صارمًا للأبعاد بين مدخلات الإطارات الرئيسية. يجب أن يتطابق كلا الإطارين الرئيسيين في الدقة المكانية المحددة. إذا اختلف first_frame و last_frame في الحجم، يتوقف أخذ العينات أثناء التهيئة الكامنة. قم بتوجيه كلتا الصورتين عبر نفس عقدة القياس لضمان أبعاد بكسل متطابقة.

التوجيه المرجعي المتقدم باستخدام MiniMaxH3AddGuide

تتحكم رسوم تحويل الصورة إلى فيديو القياسية فقط في الإطارات الأولى والأخيرة، تاركة الحركة الوسيطة غير مثبتة. تحل عقدة MiniMaxH3AddGuide هذه المشكلة عن طريق تثبيت الصور المرجعية، أو دفعات الصور متعددة الإطارات، أو المسارات الصوتية في أي frame_idx محدد على طول الجدول الزمني للتوليد.

القدرات الأساسية لـ MiniMaxH3AddGuide

   
مدخل المعلمةسلوك التثبيتقواعد القيد
frame_idxيحدد فهرس الإطار الهدف بالضبطالقيم السالبة تعد عكسيًا من نهاية الفيديو.
صورة / متعددة الإطاراتيقفل تناسق الشخصية أو تخطيط المشهدالدفعات التي تقل عن 5 إطارات تستخدم الصورة الأولى؛ الدفعات المكونة من 5+ تطابق أطوال مقطع $17k + 5$ (5، 22، 39).
مسار صوتييزامن الحوار أو المؤثرات الصوتية في الفهرسيقطع تلقائيًا إلى مدة الفيديو المتبقية.

كيفية ربط عقد التثبيت لتوليد الفيديو المرجعي

يتيح ربط عدة عقد MiniMaxH3AddGuide معًا توليد فيديو مرجعي كامل (R2V):

  1. تثبيت الشخصية الرئيسية: قم بتوصيل التكييف الإيجابي في MiniMaxH3AddGuide مع ضبط frame_idx على 0 لقفل هوية الشخصية في البداية.
  2. إطار حركة وسطي: قم بربط عقدة MiniMaxH3AddGuide ثانية، بتغذية صورة إطار رئيسي عند frame_idx 60 لإجبار الشخصية على الوصول إلى وضعية محددة في منتصف المشهد.
  3. اقتران صوتي: قم بتوصيل مسار صوتي مستهدف بمنفذ الإدخال الصوتي ومرر audio_vae الخاص بك لمزامنة الصوت مباشرة في ذلك الإزاحة الزمنية.

يحافظ ربط هذه التوجيهات التكييفية على الاستقرار الزمني دون إجبار عينة الانتشار على إعادة تهيئة الكامن.

دمج الصوت الأصلي المتزامن مع التوجيه المزدوج لـ VAE

مخطط رسم بياني لعقد توجيه VAE المزدوج في ComfyUI يظهر مفكك تشفير VAE الفيديو ومفكك تشفير VAE الصوت متعدد الإرسال في SaveVideo لتصدير صوت ستيريو متزامن

يقضي المبدعون ساعات في محاذاة مسارات الكلام الخارجية يدويًا في برامج تحرير الفيديو، فقط لمواجهة انحراف شفاه غير طبيعي أو ضوضاء غرفة غير متطابقة. يزيل MiniMax H3 محاذاة الصوت بعد المعالجة من خلال الاعتماد على التوليد متعدد الوسائط الحقيقي، حيث يتم توليف إطارات الفيديو والصوت الاستريو 32 كيلوهرتز معًا في تمريرة أمامية واحدة.

بنية التدفق أحادي التمرير

على عكس المسارات التقليدية التي تربط نماذج تحويل النص إلى كلام متميزة بعد عرض الفيديو، يعالج MiniMax H3 الإشارات النصية والصورية والزمنية في فضاء كامن موحد. خلال مرحلة إزالة الضوضاء، يخرج SamplerCustomAdvanced حمولة كامنة مركبة تحتوي على خرائط ميزات بصرية وصوتية معًا. يضمن هذا التوليف المشترك مزامنة حوار دقيقة وتوليد مؤثرات صوتية عضوية محاذية بدقة للحركة على الشاشة.

فك تشفير VAE المزدوج وتكوين العقد

لتحويل الكامن الخام إلى وسائط قابلة للتشغيل، يقسم الرسم البياني المخرجات إلى مساري فك تشفير منفصلين قبل تعدد الإرسال MP4.

    
مكون العقدةأصل النموذج / الدقةالوظيفةوجهة الإخراج
محمل VAE الفيديوminimax_h3_video_vae_fp16.safetensorsيفك تشفير الكامن البصري إلى تسلسلات إطارات RGBVAEDecode -> CreateVideo (تيار الفيديو)
محمل VAE الصوتminimax_h3_audio_vae_fp32.safetensorsيفك تشفير الكامن الصوتي إلى إشارات صوتية غير مضغوطةVAEDecodeAudio -> CreateVideo (تيار الصوت)
حافظ الفيديوSaveVideoيقوم بتعدد إرسال تيارات الفيديو والصوت الاستريو الأصليةملف MP4 مشفر

الإعداد الفني للعقد

  1. تحميل VAE مزدوج: أضف عقدتي VAELoader متميزتين إلى اللوحة. وجه الأولى إلى minimax_h3_video_vae_fp16.safetensors والثانية إلى minimax_h3_audio_vae_fp32.safetensors.
  2. تنفيذ فك تشفير VAE المزدوج: قم بتوجيه المخرجات الكامنة البصرية من العينة إلى VAEDecode والجزء الكامن الصوتي إلى VAEDecodeAudio. الحفاظ على minimax_h3_audio_vae_fp32 بدقة FP32 يمنع تشوهات القص وتشويه التردد في الموسيقى الخلفية.
  3. تعدد الإرسال عبر SaveVideo: قم بتغذية موتر الصورة المفكك والموجة الصوتية غير المضغوطة إلى CreateVideo أو مباشرة إلى SaveVideo. تتولى العقدة تغليف الحاوية النهائية، وتكتب ملف MP4 نهائي بمعدل 24 إطارًا في الثانية مع صوت ستيريو مضمن.

يوفر هذا الإعداد المزدوج الأصلي تنفيذًا صوتيًا دقيق الطور مباشرة داخل ComfyUI دون الحاجة إلى إضافات مزامنة شفاه خارجية.

حساب الدقة، قيود نسبة الأبعاد، وانطباق شبكة الإطارات

إدخال دقة قياسية 1920x1080 أو ضبط طول المقطع على 60 إطارًا في ComfyUI سيتسبب في انهيار فوري لقائمة العرض مع خطأ في شكل الموتر أو ترك حواف مشوهة بشدة. يفرض MiniMax H3 حدودًا رياضية صارمة للأبعاد المكانية ومدد المقاطع لأن بنية VAE ثلاثية الأبعاد تضغط الكامنات الفيديو عبر كتل مكانية محددة وخطوات زمنية.

الأبعاد المكانية وإعدادات نسبة الأبعاد

يقلل VAE المكاني من عينات المدخلات بعامل 32. إذا كان العرض أو الارتفاع المستهدف ليس مضاعفًا صارمًا لـ 32، تفشل عينة الانتشار أثناء تخصيصات الموتر الحدودية. يستهدف النموذج حافة قصيرة أصلية 768 بكسل، لتحقيق التوازن بين الدقة البصرية مقابل ميزانية الميجابكسل المستهدفة.

    
نسبة الأبعادالأبعاد المحددة (بكسل)فحص القابلية للقسمةالاتجاه المستهدف
16:091344 × 7681344 / 32 = 42, 768 / 32 = 24شاشة عريضة أفقية
9:16768 × 1344768 / 32 = 24, 1344 / 32 = 42عمودي / محتوى مستخدم
1:011024 × 10241024 / 32 = 32, 1024 / 32 = 32إطار مربع
21:091536 × 6721536 / 32 = 48, 672 / 32 = 21سينمائي فائق العرض

استخدام أبعاد بكسل غير قياسية يجبر VAE على توسيع أو حشو خرائط الميزات، مما يقلل من التفاصيل النسيجية الدقيقة.

قاعدة شبكة الإطارات 17k + 5

يتبع الانطباق الزمني صيغة صارمة بنفس القدر. للبقاء ضمن حدود طول فيديو MiniMax H3، تعالج البنية تسلسلات الفيديو في كتل كامنة مكونة من 17 إطارًا مع تهيئة ذيل من 5 إطارات. لتجنب الاقتطاع الزمني أو أعطال فك تشفير VAE الصامتة، يجب أن يفي كل عرض بمعادلة شبكة الإطارات 17k + 5، حيث يمثل k عداد خطوة صحيح.

صيغة قاعدة شبكة الإطارات 17k+5

بمعدل إطارات قياسي 24 إطارًا في الثانية، تحدد هذه الرياضيات مددًا زمنية دقيقة:

  • k = 0 (5 إطارات): ~0.21 ثانية (حركة صغيرة أو انفجار ثابت)
  • k = 1 (22 إطارًا): ~0.91 ثانية (شريحة حركة سريعة)
  • k = 3 (56 إطارًا): ~2.33 ثانية (تسلسل لقطة قصير)
  • k = 8 (141 إطارًا): ~5.87 ثانية (حد المقطع القياسي الكامل)

تعيين عدد مستهدف إلى 60 يجبر ComfyUI على إسقاط 4 إطارات وصولًا إلى 56 (k=3)، مما يهدر حسابات VRAM أثناء أخذ العينات. قم دائمًا بانطباق معلمات العقدة على حدود خطوة 17k + 5 بالضبط قبل وضع دفعة توليد في قائمة الانتظار.

تحسين السرعة: تمكين تنفيذ Turbo LoRA من 8 خطوات

إنفاق أكثر من ست دقائق في انتظار عرض فيديو معاينة واحد مدته 6 ثوانٍ يجعل التكرار السريع للموجهات شبه مستحيل على وحدات GPU الاستهلاكية. تتطلب عمليات أخذ العينات القياسية من 20 إلى 30 خطوة، مما يخلق عنق زجاجة تشغيلي حاد عند تعديل إشارات الحركة، أو اختبار حركات الكاميرا، أو تقييم انتقالات الإطارات الرئيسية.

دمج أوزان التقطير Turbo

دمج ملف الوزن الرسمي minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16 يقلص تمريرات أخذ العينات إلى سير عمل استدلال من 8 خطوات. تحقق عملية التقطير هذه تحسينًا كبيرًا في سرعة التوليد دون المساس بالتماسك البصري العام.

لتكوين إعداد التقطير هذا في ComfyUI:

  1. وضع أوزان النموذج: انقل minimax_h3_fl2v_turbo_8step_v1.0_comfyui_bf16.safetensors إلى دليل ComfyUI/models/loras/.
  2. توصيل عقدة LoraLoader: قم بتوجيه موتر نموذج الانتشار الأساسي عبر عقدة LoraLoader قبل تغذية العينة. اضبط turbo_model_strength على 1.0.
  3. ضبط عدد الخطوات: اخفض معلمة الخطوات في عقدة MiniMaxH3Sampler من 20 القياسية إلى 8 بالضبط.
  4. قفل مقياس CFG: أجبر معلمة مقياس التوجيه الخالي من المصنف على 1.0 لتجنب التشبع الزائد.

معايير الأداء: التنفيذ القياسي مقابل Turbo

   
المعلمة / مقياس الأداءمسار أخذ العينات القياسيتنفيذ Turbo LoRA من 8 خطوات
عدد خطوات الاستدلال20 إلى 30 خطوة8 خطوات
وقت العرض (RTX 4090، 2K)~380 ثانية~145 ثانية
مقياس توجيه CFG3.5 إلى 6.0ثابت عند 1.0 (مقطر)
الاستخدام الإنتاجي الأساسيعرض رئيسي نهائيمعاينة سريعة ونماذج أولية للمشهد
الاستقرار الزمنيإعادة بناء كاملةاهتزاز طفيف في الحواف على فيزياء الجسيمات المعقدة

عند تشغيل minimax_h3_fl2v_turbo_8step، يؤدي ضبط CFG فوق 1.0 إلى فرض تمريرات تكييف مزدوجة غير ضرورية، مما يسبب حرقًا شديدًا للألوان، وانفجارات تباين، وتمزقًا مكانيًا عبر الإطارات عالية الحركة. يتيح تنشيط turbo_mode بقوة Turbo LoRA ثابتة 1.0 للمبدعين التحقق من حركات الكاميرا المعقدة في أقل من ثلاث دقائق قبل الالتزام بعروض إنتاج كاملة من 20 خطوة.

استكشاف أخطاء رسوم ComfyUI MiniMax H3 الشائعة وإصلاحها

تنبع معظم حالات فشل التشغيل في رسوم MiniMax H3 من عدم تطابق طفيف في محاذاة الموتر، أو مفككات تشفير صوتية غير مرتبطة، أو اختناقات في ذاكرة GPU أثناء تحميل النموذج.

دليل التشخيص والإصلاحات السريعة

  1. نفاد ذاكرة CUDA (OOM)

    1. السبب الرئيسي: تحميل مشفر النص 32B مع أوزان انتشار INT8 على وحدات GPU بسعة 16 جيجابايت VRAM دون تفريغ الذاكرة.
    2. الإصلاح خطوة بخطوة: أضف علامات تشغيل --lowvram أو --medvram إلى سكريبت بدء تشغيل ComfyUI. لإعدادات الذاكرة الضيقة، فكر في تشغيل MiniMax H3 في ComfyUI باستخدام كمية GGUF لخفض متطلبات الذاكرة الأساسية. تأكد من وضع qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors بدقة داخل models/text_encoders/، مما يسمح بتفريغ VRAM بين تحليل النص وتمريرات أخذ العينات.
  2. خطأ عدم تطابق الشكل

    1. السبب الرئيسي: قيم العرض/الارتفاع المخصصة أو صور الإطارات الرئيسية المدخلة تنتهك شبكة القابلية للقسمة المكانية 32 بكسل المطلوبة.
    2. الإصلاح خطوة بخطوة: أدخل عقدة ResolutionSelector أو ImageScaleToTotalPixels قبل العينة لإجبار جميع أبعاد اللوحة والصورة على أقرب مضاعف لـ 32.
  3. غياب المسار الصوتي في التصدير

    1. السبب الرئيسي: مسار VAE الصوتي غير متصل أو ملتف أثناء تنفيذ الرسم البياني.
    2. الإصلاح خطوة بخطوة: قم بتوصيل minimax_h3_audio_vae_fp32 بعقدة VAEDecodeAudio، ثم قم بتوجيه الكامنات الصوتية المفككة إلى منفذ الصوت في عقدة SaveVideo بجانب تيار الفيديو.
  4. فشل عقدة GetImageSize

    1. السبب الرئيسي: نسب أبعاد إطارات رئيسية غير متطابقة أو دفعات صور متعددة الإطارات غير صالحة مغذاة إلى مدخلات عينة I2V.
    2. الإصلاح خطوة بخطوة: قم بتشغيل كل من الصور الأولية والنهائية من خلال عقدة ImageScaleToTotalPixels موحدة لقفل الإطارات الرئيسية على أبعاد متطابقة قبل التهيئة الكامنة.
  5. تحذير عقد مفقودة من ComfyUI Manager

    1. السبب الرئيسي: حزم العقد المخصصة المطلوبة لـ MiniMax H3 غير مفهرسة أو مفقودة من البيئة المحلية.
    2. الإصلاح خطوة بخطوة: افتح ComfyUI Manager، واختر Install Missing Custom Nodes، وابحث عن ComfyUI-MiniMaxH3-Easy، وانقر Install، وأعد تشغيل ComfyUI.

حل انخفاضات الذاكرة وتعارضات سجل العقد

تفتقد العديد من البرامج التعليمية كيفية إدارة ComfyUI لتخصيص VRAM عبر عمليات التوليد المتتالية. إذا واجهت خطأ نفاد ذاكرة CUDA مفاجئًا في محاولة العرض الثانية أو الثالثة على الرغم من نجاح الممر الأول، فإن ComfyUI احتفظ بمشفر النص في VRAM. يؤدي تعيين علامات تفريغ صريحة في سكريبت بدء التشغيل إلى تحرير الذاكرة المخصصة بين خطوات العينة.

عند فتح ملفات JSON الخاصة بالمجتمع، عادة ما تشير تحذيرات العقد المفقودة من ComfyUI Manager إلى سجلات عقد قديمة. يؤدي تثبيت ComfyUI-MiniMaxH3-Easy إلى إصلاح هذه التبعيات المفقودة مباشرة. بالنسبة لمسارات I2V، يتطلب حل فشل GetImageSize أو خطأ عدم تطابق الشكل التأكد من أن صور الإطارات الرئيسية الأولية والنهائية تطابق حدود البكسل المستهدفة.

أحدث النماذج

واجهة برمجية واحدة لكل وسائط الذكاء الاصطناعي.

استكشف جميع النماذج