مدة فيديو MiniMax H3 هي 15 ثانية. لقد أحصيت عشر قطع داخل واحد منها.

يتراوح طول فيديو MiniMax H3 من 4 إلى 15 ثانية كاملة بمعدل 24 إطارًا في الثانية. تعرّف على ما تحصل عليه بالضبط إطارًا بإطار، وعدد القطع التي تناسب مقطعًا واحدًا، وكيفية ربط 45 ثانية.

الجميع يفعل الشيء نفسه في اليوم الأول. تفتح القائمة المنسدلة للمدة، ترى الرقم 15، وتبدأ في القسمة. فيلم مدته عشر دقائق؟ أربعون جيلاً. فيديو شرح مدته ثلاث دقائق؟ اثنا عشر. ثم تنظر إلى الرقم الناتج عن هذه القسمة، تغلق علامة التبويب، وتقرر أن النموذج ليس جاهزًا بعد لأي شيء يحتوي على قصة.

لقد قمت بالقسمة أيضًا. ثم شغلت ffmpeg على تسعة مقاطع H3 حقيقية ووجدت شيئًا جعل العملية الحسابية بأكملها تبدو سخيفة.

أحد تلك المقاطع يبلغ طوله 15.10 ثانية. بداخله، يكتشف كاشف المشاهد عشرة قصات نظيفة. عشرة. ملابس مختلفة، تأطير مختلف، خلفيات مختلفة، بطاقات نصية كاملة الإطار، كل ذلك داخل جيل واحد كلف سعر جيل واحد. لو كنت قد خططت لذلك المقطع بالطريقة التي توحي بها القسمة، جيل واحد لكل لقطة، لكانت دفعت عشرة أضعاف الثمن لنفس الخمس عشرة ثانية.

القسمة هي الخطأ. الحد الأقصى ليس ساعة توقيت، إنه حاوية، ولا أحد تقريبًا يملؤها.

تسلسل لمتزلج يقفز فوق حافة خرسانية في الليل

متزلج في منتصف حركة بهلوانية تم التقاطها كتسلسل وميض، العديد من الأوضاع المتميزة مجمدة داخل إطار واحد

إطار واحد، لحظات عديدة. هذا هو النموذج الذهني الذي تثنيك عنه القائمة المنسدلة للمدة.

الوجبات الرئيسية

  • معامل duration يقبل أعدادًا صحيحة من 4 إلى 15 فقط. القيمة الافتراضية هي 8. لا يوجد 7.5، ولا قيمة أعلى من 15.
  • كل مقطع يعود بمعدل 24 إطارًا في الثانية، وبدقة تصل إلى 2K أصلية، مع صوت استريو يتم توليده في نفس مرحلة الصورة.
  • مقطع "15 ثانية" الخاص بك هو في الواقع 362 إطارًا، أي 15.083 ثانية. تنتقل المدد إلى أعلى إلى شبكة مكونة من 17 إطارًا، و duration: 8 فقط يقع على ثانية كاملة.
  • يمكن لجيل واحد أن يحمل لقطات متعددة. اكتب SHOT 1 / CUT TO في المطالبة وسيقوم النموذج بقصها لك، دون أي تكلفة إضافية.
  • لا يوجد معامل تمديد في واجهة API. يمكنك تجاوز 15 ثانية عن طريق التتابع: الإطار الأخير في الإطار الأول التالي، صور مرجعية للحفاظ على المظهر، ثم دمج صارم.

شاهد 45 ثانية من طول فيديو MiniMax H3، مبنية من ثلاثة مقاطع

قبل أي نظرية، إليك الشيء نفسه. إعلان مدته 45 ثانية لوعاء نودلز ليلي يسمى "MIDNIGHT BOWL". ثلاثة أجيال، خمس عشرة ثانية لكل منها، ثلاث لقطات داخل كل منها. تسع لقطات، قطعة سردية واحدة متصلة، لا تذويبات تخفي الوصلات.

المقطع الكامل البالغ 45 ثانية. ثلاثة أجيال من MiniMax H3 مترابطة بدون تأثيرات انتقالية. الشيف، المئزر، المصباح واللافتة المرسومة باليد ينجون من عمليتي تسليم.

تسعة إطارات فيديو لشيف يقوم بإعداد وتقديم الرامن

تسعة إطارات من إعلان MIDNIGHT BOWL مرتبة كورقة اتصال 3x3، مع تسمية SHOT 1 إلى SHOT 9 وأوقات زمنية

تسع لقطات، ثلاثة أجيال. كل صف هو جيل واحد، كل عمود هو قصة قام النموذج بها بنفسه. اللقطتان 3 و4 متناغمتان لأن الجيل 2 يبدأ من الإطار الأخير للجيل 1، وهذا هو بالضبط ما يجعل التماس غير مرئي.

ثلاثة أجيال. ليس تسعة. هذه الفجوة هي جوهر هذه المقالة.

لم أقم بقص أي منها يدويًا. طلبت من كل جيل ثلاث لقطات بأوقات زمنية، ووجد كاشف المشاهد في ffmpeg القصات عند 4.9 ثانية و 9.1 ثانية في الأول، و 4.9 ثانية و 9.0 ثانية في الثاني، و 5.3 ثانية و 11.0 ثانية في الثالث. تسع لقطات، ثلاث فواتير.

لماذا يدمر طول فيديو MiniMax H3 الخطط الطويلة

الرقم نفسه جيد. خمس عشرة ثانية في أعلى النطاق هو سخي لهذا الجيل من النماذج، والمقاطع بدقة 2K مع صوت استريو حقيقي مرفق. ما يدمر الناس هو الوحدة التي يخططون بها.

إذا كنت تضع ميزانية بالثواني، فإن مقطعًا مدته دقيقة واحدة هو "أربعة مقاطع" ومقطع مدته عشر دقائق هو "أربعون مقطعًا"، وأربعون مقطعًا من أي شيء هو كابوس من أعمال الاستمرارية. إذا كنت تضع ميزانية باللقطات، فإن مقطعًا مدته دقيقة واحدة هو أربعة أجيال تحمل ما يقرب من اثنتي عشرة لقطة، وهو مقدار تغطية طبيعي لإعلان تجاري. نفس النموذج، نفس الحد الأقصى، خطة إنتاج مختلفة تمامًا.

أصابع تمسك بشريط فيلم بني داكن يظهر شارعًا وأيديًا وصورة ظلية

رسم توضيحي لملصق مسطح بأسلوب رجعي لشريط واحد من فيلم 35 ملم حيث يحمل كل إطار متتالٍ مشهدًا مختلفًا تمامًا

ضع الميزانية باللقطات، وليس بالثواني. شريط واحد تمت فوترته، ثلاثة مشاهد مختلفة بداخله.

هناك شيء آخر يكسر الخطط الطويلة، وهو ليس الحد الأقصى على الإطلاق. إنها اللحامات. المقاطع الفردية لا تنهار أبدًا تقريبًا في المنتصف. إنها تنهار عند الوصلات، لأن كل جيل يخترع خلفيته الصوتية الخاصة وينحرف قليلاً في الملابس والإضاءة. خطط للحامات وستكون 45 ثانية سهلة. تجاهلها وستظل أربعة مقاطع مثالية تبدو كأربعة مقاطع منفصلة.

ما هو طول فيديو MiniMax H3 حقًا: من 4 إلى 15 ثانية كاملة على شبكة مكونة من 17 إطارًا

ابدأ بالمواصفات، لأن رقمين مختلفين يتم تداولهما. يسرد مخطط API المباشر لجميع نقاط نهاية H3 الثلاث على Atlas Cloud duration كـ enum من 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15 بالضبط، مع قيمة افتراضية 8. أعداد صحيحة، لا شيء كسري، لا شيء يتجاوز 15. تغطية الإطلاق تطابق هذه القراءة: إخراج 2K، من 4 إلى 15 ثانية، مدد صحيحة فقط (MarkTechPost، أغسطس 2026). يصف منشور الإطلاق الخاص بـ MiniMax نفسه الأمر بأنه يصل إلى 15 ثانية بدقة 2K مع صوت استريو أصلي (MiniMax، أغسطس 2026).

ستظل ترى "من 5 إلى 15 ثانية" مكتوبة في شتى ملفات التعريف المختصرة وأدلة البدء السريع، بما في ذلك بعض النصوص على المنصة. تعامل مع مخطط API على أنه الحقيقة. الحد الأدنى هو 4، وقد قمت بفوترة مقاطع مدتها 4 ثوانٍ لإثبات ذلك.

الآن الجزء الذي لا يذكره أحد تقريبًا. اطلب 15 ثانية ولن تحصل على 360 إطارًا. ستحصل على 362 إطارًا.

يبني H3 الفيديو في كتل من 17 إطارًا ويقوم بتقريب المدة التي طلبتها إلى أعلى إلى عدد الإطارات التالي 17k + 5 بمعدل 24 إطارًا في الثانية. هذه الشبكة موثقة في البرنامج التعليمي الرسمي لـ H3 على ComfyUI (وثائق ComfyUI، 2026)، وهي تنطبق على جانب API أيضًا. لقد قمت بعد الإطارات على تسعة ملفات H3 حقيقية باستخدام ffmpeg:

text
1ffmpeg -i video-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | tail -1
2# frame=  362  ...
3#   Duration: 00:00:15.10, 1280x720, 24 fps
4

كل ملف مدة 15 ثانية عاد بـ 362 إطارًا. كل ملف مدة 10 ثوانٍ عاد بـ 243 إطارًا. الأجيال الثلاثة الجديدة التي شغّلتها لهذه المقالة عادت أيضًا بـ 362 إطارًا، والبروفة التي مدتها 4 ثوانٍ في الخطوة 5 عادت بـ 107 إطارات. قم بتشغيلها من خلال الشبكة: 362 هي 17x21+5، 243 هي 17x14+5، و107 هي 17x6+5. توقعت المعادلة الثلاثة تمامًا، وهو نوع من الاتفاق يجعلني أثق ببقية الجدول.

المدةالإطارات المسلمة (17k+5)الطول الفعلي بمعدل 24 إطارًا في الثانيةتقع على ثانية كاملة؟المصدر
41074.458 ثانيةلامقاس
51245.167 ثانيةلاالشبكة
61586.583 ثانيةلاالشبكة
71757.292 ثانيةلاالشبكة
81928.000 ثانيةنعمالشبكة
92269.417 ثانيةلاالشبكة
1024310.125 ثانيةلامقاس
1127711.542 ثانيةلاالشبكة
1229412.250 ثانيةلاالشبكة
1332813.667 ثانيةلاالشبكة
1434514.375 ثانيةلاالشبكة
1536215.083 ثانيةلامقاس

ثلاثة أشياء تخرج من ذلك الجدول.

duration: 8 هي القيمة الوحيدة في النطاق بأكمله التي تمنحك ثانية كاملة نظيفة، وتصادف أنها القيمة الافتراضية. هذه ليست مصادفة، إنها 17x11+5 = 192 = 8 x 24 بالضبط.

اطلب 6 وستحصل على 6.583 ثانية، أكثر من نصف ثانية من الصورة المجانية. اطلب 13 وستحصل على 13.667. الشبكة دائمًا تقرب لأعلى، وليس لأسفل، لذلك أنت أبدًا بأقل من المطلوب.

وإذا كنت تقطع لموسيقى أو تطابق تحريرًا دقيقًا للإطارات، فلا تحسب خطك الزمني أبدًا كـ duration x 24. قم بقياس الملف. مشروع من 40 مقطعًا مخطط له على افتراض الثواني الكاملة سيكون خارجًا بمقدار أربع ثوانٍ تقريبًا بحلول النهاية.

عشر قصات داخل جيل واحد من MiniMax H3 مدته 15 ثانية

هذا هو المقطع الذي ذكرته في البداية. جيل واحد، 362 إطارًا، 15.10 ثانية في الحاوية. إنها قطعة من نوع الأزياء الحركية، وتتصرف مثل فيديو موسيقي تم تحريره بدلاً من لقطة واحدة.

لقطة مقربة لعيون امرأة خلف نص أبيض عريض ONE LOOK

جيل واحد من MiniMax H3. تغييرات في الملابس، تغييرات في التأطير، شاشات منقسمة وبطاقات نصية كاملة الإطار، كل ذلك داخل مهمة واحدة مدتها 15 ثانية.

لقد شغلت كاشف المشاهد من ffmpeg عليه بدلاً من العد بالعين:

text
1ffmpeg -i video-5.mp4 -vf "select='gt(scene,0.6)',showinfo" -f null -
2# تم وضع علامة على 18 كسرًا، عند 1.54 2.88 3.63 4.21 5.54 5.83 6.92 8.88 11.17 13.00 ...
3

عشرة من هذه التغييرات هي تغييرات لقطة نظيفة عبر الثلاث عشرة ثانية الأولى. الذيل عبارة عن بطاقة عنوان وامضة على خلفية سوداء، مما يضخم العدد الأولي، لذا فإن العشرة هو الرقم المحافظ الصادق. على أي حال، إنها ليست لقطة واحدة، وهي ليست ثلاث.

الآن الحالة الضابطة، لأن "H3 دائمًا يقطع مقاطعك إلى أجزاء" هو الفشل المعاكس وهو أيضًا خاطئ تمامًا. هذا الملف التالي هو أيضًا جيل واحد مدته 15 ثانية، أيضًا 362 إطارًا، ويكتشف نفس الكاشف صفر قصات بالضبط فيه.

منظر من منظور الشخص الأول لناطحات سحاب تنهار على شارع مدينة

جيل مختلف منفرد، نفس 362 إطارًا، صفر قصات مكتشفة. حركة كاميرا مستمرة واحدة لمدة خمس عشرة ثانية كاملة.

إذن الحد الأقصى ليس "خمس عشرة ثانية من اللقطات". إنها خمس عشرة ثانية من وقت الشاشة التي يمكنك تقسيمها كيفما تشاء، من لقطة واحدة متواصلة إلى عشر قصات. أنت تتحكم فيها من خلال المطالبة، وتدفع نفس الثمن في كلتا الحالتين.

نقاط النهاية الثلاثة وراء طول فيديو MiniMax H3، في علامة تبويب واحدة

يتطلب تجاوز الخمس عشرة ثانية ثلاث وظائف مختلفة: شيء لإنشاء إطار مرتكز، شيء للتحريك والتسلسل، وشيء لتحريك الكاميرا دون فقدان الهدف. على Atlas Cloud تعيش الأربعة جميعًا في نفس الكتالوج بمفتاح واحد ورصيد واحد، وهو ما يهم هنا في الغالب لأن السلسلة في القسم التالي تسلم الملفات بينها بشكل متكرر.

الخطوةالنموذجالوظيفة في هذا البناءنطاق الطولالسعر المدرج، 4 أغسطس 2026
الإطار المرتكزopenai/gpt-image-2/text-to-imageصورة ثابتة واحدة تحدد الشكل العامغير متاح0.1745 دولار لتشغيلتي بجودة عالية
الافتتاح، لا حاجة لصورة ثابتةminimax/h3/text-to-videoمباشرة من المطالبة إلى المقطع4 إلى 15 ثانية، افتراضي 80.14 دولار / ثانية
الجيلان 1 و 2minimax/h3/image-to-videoتحريك إطار أول، ثم التسلسل من إطار أخير4 إلى 15 ثانية، افتراضي 80.14 دولار / ثانية
الجيل 3minimax/h3/reference-to-videoوضع كاميرا جديد، نفس الموضوع4 إلى 15 ثانية، افتراضي 80.14 دولار / ثانية

جميع نقاط نهاية H3 الثلاث لا تحمل أي خصم حاليًا، لذا فإن السعر هو السعر. يمكنك تأكيد أي منها على كتالوج النماذج الكامل.

ثلاثة مصائد معاملات تستحق المعرفة قبل كتابة أي طلب واحد، كلها مأخوذة من المخططات المباشرة بدلاً من نصوص التوثيق:

  1. ratio يتصرف بشكل مختلف على كل نقطة نهاية. text-to-video يقدم ست نسب ويتم الافتراضي على 1:1، والذي سيسلمك بهدوء مقطعًا مربعًا إذا نسيت تعيينه، ولا يقبل adaptive على الإطلاق. image-to-video يقدم فقط adaptive، لذا فإن التأطير يتبع إطارك الأول. reference-to-video هو الوحيد الذي يحتوي على المجموعة الكاملة بالإضافة إلى adaptive.
  2. resolution هو 768P أو 2K، مع افتراضي 2K. كلا المستويين يقعان تحت سعر واحد مدرج لكل ثانية في الكتالوج، لذا فإن الانخفاض إلى 768P لا يوفر لك المال. استخدم 2K.
  3. image-to-video يأخذ أيضًا end_image اختياريًا. يمكنك تثبيت طرفي المقطع، وليس فقط البداية. هذا يحول خدعة التسلسل أدناه إلى شيء يمكنك توجيهه من كلا الاتجاهين.

كيفية التغلب على حد طول فيديو MiniMax H3، خطوة بخطوة

هذا هو بناء MIDNIGHT BOWL الكامل. كل مطالبة أدناه هي التي أرسلتها بالفعل، انسخها كما هي. إجمالي وقت التشغيل هو ثلاثة أجيال H3 بالإضافة إلى صورة ثابتة واحدة، والكل قابل للتكرار في علامة تبويب متصفح.

الخطوة 1: قفل الشكل في إطار مرتكز واحد

لا تبدأ بالفيديو. ابدأ بصورة ثابتة واحدة تعجبك حقًا، لأن كل مقطع في السلسلة سيرث ضوءها وملابسها ولافتاتها. الحصول على هذا خطأ مكلف؛ إتقانه يكلف سنتات.

النموذج: openai/gpt-image-2/text-to-image. الإعدادات: الجودة عالية، النسبة 16:9.

text
1لقطة فيلم، الساعة 2 صباحًا في زقاق خلفي ضيق بطوكيو، كشك نودلز ليلي. شيف يبلغ من العمر 50 عامًا يرتدي مئزرًا بحريًا وعصابة رأس بيضاء ينحني فوق قدر مرق يبخر خلف طاولة خشبية مخدوشة، أكمامه ملفوفة حتى المرفقين، ساعديه مضاءان باللون البرتقالي الساخن بواسطة مصباح معلق واحد. الأسفلت المبلل بالمطر يعكس لافتات حمراء وخضراء؛ فوانيس ورقية ولافتة خشبية مرسومة باليد تقرأ "MIDNIGHT BOWL" معلقة فوق الطاولة. يتصاعد البخار عبر الإطار من جهة اليمين. تم التصوير بعدسة 35 ملم بفتحة f/2، عمق مجال ضحل، ظلال عميقة، إضاءة رئيسية تنجستن دافئة مقابل ليل أزرق بارد، حبيبات فيلم دقيقة مرئية، لا تراكبات نصية.
2

واجهة مولد صور AI تعرض نص المطالبة والصورة الناتجة

ملعب GPT Image 2 على Atlas Cloud مع مطالبة MIDNIGHT BOWL المرتكزة المملوءة والصورة النهائية في لوحة الإخراج

GPT Image 2 على Atlas Cloud: الجودة مضبوطة على عالية، 16:9، الإطار المرتكز معروض على اليمين.

4

إطار MIDNIGHT BOWL المرتكز: شيف يرتدي مئزرًا بحريًا خلف قدر مرق يبخر تحت مصباح معلق واحد في زقاق خلفي ممطر

الإطار المرتكز. كل شيء في المصب يحصل على هذا المصباح، هذا المئزر وهذه اللافتة.

الخطوة 2: ضع ثلاث لقطات داخل جيل واحد من MiniMax H3 مدته 15 ثانية

هذه هي الخطوة التي تغير الميزانية. بدلاً من طلب خمس عشرة ثانية متصلة واحدة، سلم النموذج قائمة لقطات بأوقات زمنية صريحة وكلمات CUT TO. سيقوم بقصها لك، داخل جيل واحد تمت فوترته.

النموذج: minimax/h3/image-to-video. الإعدادات: resolution 2K، duration 15، ratio adaptive (الخيار الوحيد هنا، التأطير يتبع إطارك الأول)، الإطار الأول = الصورة الثابتة من الخطوة 1.

text
1SHOT 1 (0-5s): لقطة واسعة ثابتة للكشك. يتصاعد البخار؛ يغرف الشيف المرق في وعاء أسود؛ يتساقط المطر من حافة المظلة. SHOT 2 (5-10s): CUT TO لقطة ماكرو قريبة للمغرفة تكسر سطح المرق، دهون ذهبية تدور، بصل أخضر مفروم يسقط في أقواس بطيئة. SHOT 3 (10-15s): CUT TO لقطة متوسطة للشيف ينظر مباشرة إلى العدسة، يمسح يديه على المئزر، ويقول باليابانية بابتسامة متعبة: "Ippai, dozo." يضع الوعاء على الطاولة وتستقر اللقطة على وجهه.
2الصوت: مطر غزير على المظلة، مرق يغلي، ارتطام المغرفة بحافة القدر، قطار بعيد، همهمة مدينة منخفضة في الليل. سطر واحد من الحوار الياباني الذكوري الواضح، نغمة غرفة طبيعية، لا موسيقى.
3حافظ على نفس الشيف، المئزر، عصابة الرأس، المصباح واللافتة في جميع اللقطات الثلاث. قصات حادة فقط، لا تذويبات، لا انتقالات بحركة الكاميرا. إضاءة رئيسية تنجستن دافئة، ليل أزرق بارد، مظهر 35 ملم، حبيبات فيلم.
4

ثلاثة أشياء تجعل هذا يعمل. نطاقات ثانية صريحة، السلسلة النصية الحرفية CUT TO، وبند استمرارية في الأسفل يسمي كل عنصر يجب أن ينجو من القصات. احذف بند الاستمرارية وستعود اللقطة 3 بمئزر مختلف.

واجهة مولد فيديو AI تعرض إعدادات الإدخال وإخراج الفيديو المكتمل

ملعب MiniMax H3 image-to-video على Atlas Cloud مع الإطار المرتكز المحمل، المدة 15 و 2K المحددين، المقطع النهائي يعمل في لوحة الإخراج

MiniMax H3 image-to-video على Atlas Cloud: الإطار المرتكز محمل كإطار أول، الدقة 2K، المقطع النهائي على اليمين. لاحظ شريط تمرير المدة والسعر الذي يتتبعه. هذا التشغيل بالذات ترك المدة على الافتراضي 8، ولهذا يقرأ الزر $1.12؛ عند 15 يقرأ $2.10.

شيف يعد الطعام في كشك شارع يبخر في ليلة ممطرة

الجيل 1. مهمة واحدة تمت فوترتها، ثلاث لقطات (تم قياس القصات عند 4.92 ثانية و 9.13 ثانية)، سطر واحد من الحوار مع مزامنة الشفاه، أصلية 2560x1440، وصوت استريو 32 كيلوهرتز في نفس الملف.

الخطوة 3: تسلسل الـ 15 ثانية التالية من الإطار الأخير

لا يوجد معامل تمديد. التسلسل يدوي وهو تافه: اسحب الإطار النهائي للجيل 1 وأعد تغذيته كإطار أول للجيل 2.

bash
1ffmpeg -sseof -0.08 -i generation-1.mp4 -frames:v 1 -q:v 2 handoff-frame-01.jpg
2

النموذج: minimax/h3/image-to-video مرة أخرى. الإعدادات: الإطار الأول = handoff-frame-01.jpg، resolution 2K، duration 15، ratio adaptive.

الانضباط المهم هنا هو ما تتركه خارجًا. لا تصف الشيف مرة أخرى. إنه موجود بالفعل في البكسلات التي سلمتها للتو، وإعادة وصفه تمنح النموذج الإذن بإعادة تفسيره.

text
1استمر من هذا الإطار بالضبط، نفس الرجل، نفس المئزر، نفس الإضاءة. SHOT 1 (0-5s): يدفع الوعاء عبر الطاولة بكلتا يديه نحو الكاميرا. SHOT 2 (5-10s): CUT TO لقطة فوق الكتف لأيدي زبون يرفع عيدان خشبية ويشطرها، أساور كم معطف مطر رمادي مبلل مرئية. SHOT 3 (10-15s): CUT TO لقطة ماكرو شديدة لسحب النودلز، بخار يتصاعد أمام العدسة، مرق يتقطر عائدًا إلى الوعاء.
2الصوت: مطر مستمر وغليان منقول من قبل، خزف على خشب، عيدان تتكسر، صوت مص، نفس القطار البعيد. لا موسيقى، لا تعليق صوتي.
3قصات حادة فقط. نفس إضاءة التنجستن الرئيسية من المصباح المعلق، نفس الليل الأزرق البارد في الخلفية، نفس عمق المجال الضحل 35 ملم وحبيبات الفيلم.
4

شيف مبتسم بعصابة رأس يقدم وعاءًا من الطعام يبخر

الجيل 2، بدأ من الإطار الأخير للجيل 1. نفس الشيف، نفس نمط عصابة الرأس، نفس القميص العلوي البحري، نفس المطبخ خلفه. ثلاث لقطات مرة أخرى، قصات عند 4.92 ثانية و 9.04 ثانية.

شيف مبتسم بعصابة رأس يقدم وعاءًا أسود يبخر

حلقة مدتها ثانيتان عبر التماس بين الجيل الأول والجيل الثاني

التماس نفسه: آخر ثانية من الجيل 1 في أول ثانية من الجيل 2. لا تأثير انتقالي، مجرد قص.

الخطوة 4: حرك الكاميرا باستخدام Reference-to-Video

تسلسل الإطار الأخير له قيد واحد متأصل: إنه دائمًا يستأنف من حيث كانت الكاميرا السابقة واقفة. للقفز إلى زاوية جديدة حقًا مع الحفاظ على نفس الموضوع، قم بتبديل نقاط النهاية.

النموذج: minimax/h3/reference-to-video. الإعدادات: refers = الإطار المرتكز من الخطوة 1 بالإضافة إلى الإطار الأخير من الجيل 2، resolution 2K، duration 15، واضبط ratio صراحةً على 16:9 هنا بدلاً من تركه على adaptive. تقبل نقطة النهاية هذه ما يصل إلى تسع صور مرجعية، وثلاثة مقاطع فيديو مرجعية وثلاثة مقاطع صوتية، مع الحد الأقصى للفيديو المرجعي 15 ثانية إجمالاً (MarkTechPost، أغسطس 2026).

text
1لقطة واسعة من زاوية منخفضة من منتصف الشارع المبلل تنظر عائدة إلى نفس كشك النودلز، نفس الشيف بداخله. SHOT 1 (0-6s): خطوط المطر عبر الإطار؛ زبونان ظليان جالسان على الطاولة؛ الشيف يعمل تحت المصباح الواحد. SHOT 2 (6-11s): CUT TO اللافتة الخشبية المرسومة باليد بينما يتحرك نص أبيض حركي بجانبها، حرفًا حرفًا: "MIDNIGHT BOWL - OPEN TILL 4AM". يظل النص حادًا كشفرات الحلاقة ومثبتًا على اللافتة بينما تنجرف الكاميرا. SHOT 3 (11-15s): CUT BACK to the wide as the chef looks up, raises one hand in a small wave, and the bulb flickers once.
2الصوت: مطر، أجواء شارع، دراجة بخارية تمر، نفس القطار الخافت، ضربة تحتية منخفضة واحدة عندما يظهر النص. لا حوار.
3نفس الشيف، نفس المئزر وعصابة الرأس، نفس اللافتات وألوان الفوانيس مثل الصور المرجعية. قصات حادة فقط، حبيبات فيلم، 35 ملم، تنجستن دافئ مقابل أزرق بارد.
4

تعليمات ratio هذه ليست بجنون ارتياب. إليك ما يحدث عندما تترك القائمة المنسدلة بمفردها على نقطة النهاية هذه:

واجهة مولد فيديو AI تعرض رسالة خطأ في التحقق من صحة الإدخال

ملعب MiniMax H3 reference-to-video على Atlas Cloud مع صورتين مرجعيتين محملتين، نسبة العرض إلى الارتفاع متروكة على adaptive، ورسالة خطأ 400 في لوحة الإخراج

MiniMax H3 reference-to-video على Atlas Cloud: كلتا الصورتين المرجعيتين محملتين، الدقة 2K، ونسبة العرض إلى الارتفاع لا تزال جالسة على افتراضيها adaptive. يعود التشغيل بـ 400: "ratio is required for t2va (text-only) and cannot be 'adaptive'; allowed: 16:9/4:3/1:1/3:4/9:16/21:9". اضبطها صراحةً وسيمر نفس الطلب، وهو كيف تم صنع المقطع أدناه. لاحظ أن الفقرة أعلاه في الصفحة تقرأ أيضًا "768P/1080P/2K, 5s/10s" بينما يقول المخطط 768P أو 2K ومن 4 إلى 15 ثانية. ثق بالمخطط.

لم أتمكن من جعل القائمة المنسدلة للنسبة في الملعب تحمل تغييرًا مبرمجًا عبر ثلاث محاولات، لذا فإن الجيل 3 الناجح أدناه جاء من API مع ratio: "16:9" مضبوطًا في نص الطلب. التشغيل الفاشل لم يكلف شيئًا.

شيف يعد الطعام لزبائن في كشك طعام ليلي ممطر

الجيل 3. وضع كاميرا جديد تمامًا من عبر الشارع المبلل، نفس الشيف، والنص الأبيض المتحرك على اللافتة يظل حادًا كشفرات الحلاقة بينما تنجرف الكاميرا. قصات عند 5.29 ثانية و 10.96 ثانية.

مقارنة جنبًا إلى جنب لكشك طعام ياباني في الليل

مقارنة جنبًا إلى جنب للإطار المرتكز الأصلي وإطار من الجيل الثالث، تظهر نفس الشيف واللافتة بعد 41 ثانية وعمليتي تسليم

يسار: الإطار المرتكز من الخطوة 1. يمين: الجيل 3 عند علامة 41 ثانية، بعد عمليتي تسليم. نفس الشيف، نفس عصابة الرأس، نفس القميص العلوي البحري، نفس اللافتة المرسومة باليد، نفس الفانوس الأحمر.

الخطوة 5: قياس طول فيديو MiniMax H3 الحقيقي، ثم الربط

اعتيادان للانتهاء بهما. أولاً، قم بإجراء بروفة رخيصة قبل أن تشتري الخمس عشرة ثانية. نفس المطالبة، duration 4، وستعرف ما إذا كان النموذج قد فهم قائمة اللقطات الخاصة بك مقابل ما يقرب من ربع السعر.

شيف يطبخ في كشك خارجي يبخر في زقاق ممطر

البروفة التي مدتها 4 ثوانٍ لنفس قائمة اللقطات. تم قياسها بـ 107 إطارات، أي 4.458 ثانية، بالضبط ما تتوقعه الشبكة. كافية لمعرفة ما إذا كان النموذج قد فهم المشهد قبل شراء اللقطة الكاملة.

ثانيًا، قم بقياس كل ملف قبل أن تقص، لأن أياً منها ليس بالطول الذي طلبته:

bash
1# عدد الإطارات الحقيقي ومدة الحاوية، وليس duration x 24
2ffmpeg -i generation-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | grep -o 'frame= *[0-9]*' | tail -1
3
4# دمج بقص حاد، لا انتقالات، لا إعادة ترميز
5printf "file 'generation-1.mp4'\nfile 'generation-2.mp4'\nfile 'generation-3.mp4'\n" > list.txt
6ffmpeg -f concat -safe 0 -i list.txt -c copy midnight-bowl-45s.mp4
7

ثلاثة ملفات بـ 362 إطارًا لكل منها يعطي 1086 إطارًا، والذي قمت بقياسه على الدمج النهائي: 45.25 ثانية من الصورة، وليس 45. صغير، حتى تقوم بربط أربعين منها.

الاختلافات: الحوار، والعمودي، والبروفة التي مدتها 4 ثوانٍ

بمجرد أن تعمل السلسلة، تغطي نفس نقاط النهاية الثلاث معظم ما يطلبه الناس بالفعل.

لقطة وحوار عكسي. ضع جانبي المحادثة داخل جيل واحد بدلاً من جيلين. مزامنة الشفاه والخلفية الصوتية مستمرة ضمن مهمة واحدة ومستقلة عبر المهام، لذا فإن المحادثة المقسمة عبر جيلين تعطيك نغمتين غرفتين غير مرتبطتين. حافظ على التبادلات داخل مقطع واحد.

امرأة شابة تبكي تنظر إلى رجل في درج

ممثلان شابان في منتصف جدال على هبوط درج خرساني، ضوء نافذة قاسٍ يضرب عليهما، تم التصوير فوق كتف واحد

لقطة وحوار عكسي يعملان، طالما أن كلا الزاويتين تعيشان داخل نفس الجيل.

عمودي. على image-to-video لا تقوم بتعيين النسبة، بل تقوم بتعيين الإطار الأول. قم بإنشاء إطار مرتكز طويل وسيتبعه adaptive. أحد المقاطع التي قمت بقياسها عاد بـ 1280x2276 مع نفس عدد الإطارات 243 مثل نظائره 16:9، لذا فإن شبكة الإطارات لا تهتم بنسبة العرض إلى الارتفاع الخاصة بك.

البروفة التي مدتها 4 ثوانٍ كممارسة قياسية. بسعر 0.14 دولارًا للثانية، أربع ثوانٍ تساوي 0.56 دولارًا مقابل 2.10 دولارًا للقطة كاملة. في بناء من تسع لقطات، البروفة لكل جيل قبل الالتزام تكلف أقل من مهمة واحدة مهدرة مدتها 15 ثانية.

حيث يعض الحد الأقصى حقًا. أي شيء يحتاج إلى أداء متواصل أطول من خمس عشرة ثانية. مونولوج مستمر لمدة 30 ثانية ليس مشكلة تسلسل، إنها مشكلة مزامنة شفاه عبر التماس، ولا قدر من انضباط المطالبة يصلحها.

ما تكلفه 45 ثانية من طول فيديو MiniMax H3

بسعر 0.14 دولارًا للثانية، جيل كامل مدته 15 ثانية هو 2.10 دولارًا. هذا هو الرقم الوحيد الذي تحتاجه؛ كل شيء آخر هو عملية ضرب. العمود المثير للاهتمام هو الأخير.

الطول المستهدفالأجيال عند 15 ثانيةالتكلفة الخطيةواقعي بمعدل احتفاظ 1 من 3اللقطات المسلمةالتكلفة لكل لقطة
15 ثانية12.10 دولار6.30 دولار30.70 دولار
45 ثانية (هذا البناء)36.30 دولار18.90 دولار90.70 دولار
60 ثانية48.40 دولار25.20 دولار120.70 دولار
3 دقائق1225.20 دولار75.60 دولار360.70 دولار
10 دقائق4084.00 دولار252.00 دولار1200.70 دولار

اقرأ عمود التكلفة لكل لقطة وسيتبخر الذعر بشأن الحد الأقصى في الغالب. التخطيط لجيل واحد لكل لقطة يضعك عند 2.10 دولار للقطة. حزم ثلاث لقطات في كل جيل يضعك عند 0.70 دولار. نفس النموذج، نفس الحد الأقصى البالغ خمس عشرة ثانية، ثلث الفاتورة.

عمود معدل الاحتفاظ هو الذي ينساه الناس. لا شيء قابل للاستخدام يعود في المحاولة الأولى في كل مرة، والخطة التي تفترض ذلك هي خطة تنفد ميزانيتها في الدقيقة الثانية.

للسياق حول مكان الحد الأقصى بالنسبة لكل شيء آخر في الكتالوج، كل هذه حالية اعتبارًا من 4 أغسطس 2026:

النموذجأقصى جيل واحدملحوظالسعر المدرج
minimax/h3من 4 إلى 15 ثانية768P أو 2K، صوت استريو أصلي0.14 دولار / ثانية
bytedance/seedance-2.0من 4 إلى 15 ثانية، أو -1 للتلقائيمن 480p إلى 4K أصلي0.112 دولار / ثانية
kwaivgi/kling-v3.0-proمن 3 إلى 15 ثانيةلديه علم multi_shot صريح مع مطالبات لكل لقطة0.095 دولار / ثانية، خصم 15%
alibaba/wan-2.7من 2 إلى 15 ثانيةأوسع نطاق، 720P أو 1080P0.10 دولار / ثانية
google/veo3.14 أو 6 أو 8 ثوانٍ فقطلا يوجد خيار 15 ثانية على الإطلاق0.20 دولار / ثانية
alibaba/wan-2.5/video-extendيضيف من 5 إلى 10 ثوانٍيمدد ملفًا موجودًا بدلاً من توليد جديد0.052 دولار / ثانية

استنتاجان. الخمس عشرة ثانية من H3 موجودة في قمة الجيل الحالي، وليس خلفه، و Veo 3.1 يتوقف عند ثمانية. وإذا كان ما تحتاجه حقًا هو ملف طويل واحد من نقطة نهاية واحدة، فإن نموذج تمديد مخصص موجود، لكن تبديل النماذج في منتصف السلسلة يعني تبديل الوجوه.

ملاحظة صادقة واحدة حول الصوت والأوزان وطول فيديو MiniMax H3

ثلاثة تحذيرات، لا شيء منها يحرك الحد الأقصى.

الصوت لا ينتقل عبر الأجيال. كل مهمة تؤلف خلفيتها الاستريو الخاصة من الصفر. ثلاثة مقاطع متسلسلة تعني ثلاث خلفيات مطر غير مرتبطة، وستسمع التغيير حتى عندما تتطابق الصورة تمامًا. حلان: اكتب بند الأجواء بشكل متطابق في كل مطالبة حتى تقترب الخلفيات، أو اكتم الصوت في المقطع المخيط وضع مسارًا واحدًا مستمرًا تحته. بالنسبة للحوار، حافظ على التبادل داخل جيل واحد.

ست موجات صوتية سوداء صغيرة بجانب موجة صوتية برتقالية طويلة واحدة

عدة أجزاء منفصلة قصيرة من أشكال موجات صوتية مع فجوات مرئية بينها على اليسار، شكل موجة صوتية واحدة متصلة على اليمين، على خلفية شاحبة موحدة

يسار: ما يمنحك إياه التسلسل فعليًا. يمين: ما عليك بناؤه تحته.

الاستضافة الذاتية لا تفتح مقاطع أطول. هبطت الأوزان مفتوحة المصدر في 2 أغسطس 2026 (Hugging Face، أغسطس 2026)، وتشغيلها محليًا يمنحك حافة قصيرة 768 بكسل مقربة إلى مضاعفات 32، وفقًا لملاحظات إعداد ComfyUI. شبكة 17 إطارًا وسقف 15 ثانية هما نفس الشيء. كما أن الترخيص المجتمعي لا يغطي حاليًا الاتحاد الأوروبي أو المملكة المتحدة أو كوريا أو الولايات المتحدة، لذا فإن API هو الطريق العملي لمعظم الفرق.

يمكن للنموذج إعادة كتابتك بهدوء. لقد حدث لي أن H3 أعاد completed على مهمة حيث أسقط بصمت عنصرًا طلبته. اسحب الإطارات من كل مقطع وانظر إليها قبل أن تربط. على سلسلة من تسع لقطات، مقطع واحد غير مراقب هو خط واحد مهدر.

الأسئلة الشائعة

ما هو أقصى طول فيديو لـ MiniMax H3؟

خمس عشرة ثانية. معامل duration هو enum من أعداد صحيحة من 4 إلى 15 مع افتراضي 8، لذا فإن 16 مرفوض و 7.5 ليست قيمة صالحة. كل مقطع هو 24 إطارًا في الثانية بدقة تصل إلى 2K أصلية مع صوت استريو يتم توليده جنبًا إلى جنب مع الصورة.

هل يمكن لـ MiniMax H3 توليد فيديوهات أطول من 15 ثانية؟

ليس في جيل واحد، وواجهة API لا تحتوي على معامل تمديد. يمكنك تجاوز 15 ثانية عن طريق التسلسل: اسحب الإطار الأخير من مقطع واحد كإطار أول للمقطع التالي، استخدم reference-to-video عندما تحتاج إلى زاوية كاميرا جديدة، ثم ادمج مع قصات حادة. بعض الواجهات الأمامية الاستهلاكية تضيف ميزة التمديد الخاصة بها فوق H3 للوصول إلى ما يقرب من 30 ثانية، ولكن هذا هو المنتج الذي يقوم بالربط، وليس النموذج الذي يولد لفترة أطول.

لماذا مقطع MiniMax H3 الذي تبلغ مدته 15 ثانية هو في الواقع 15.08 ثانية؟

لأن المدد تنتقل إلى أعلى إلى شبكة مكونة من 17 إطارًا. طلب 15 ثانية يعيد 362 إطارًا، وهو 17x21+5، وعند 24 إطارًا في الثانية يكون ذلك 15.083 ثانية. طلب 10 يعيد 243 إطارًا، أو 10.125 ثانية. فقط duration: 8 يقع على ثانية كاملة، عند 192 إطارًا بالضبط. إذا كان التحرير دقيقًا للإطارات، قم بقياس كل ملف بدلاً من حساب duration x 24.

هل يمكنني وضع لقطات متعددة داخل جيل واحد من MiniMax H3؟

نعم، وهو أكبر توفير متاح. اكتب لقطات بأوقات زمنية صريحة في المطالبة مع الكلمات الحرفية CUT TO، وأضف بند استمرارية يسمي ما يجب أن ينجو من القصات. لقد قمت بقياس عشر قصات نظيفة داخل جيل واحد حقيقي مدته 15 ثانية. ثلاث لقطات لكل جيل مريحة وموثوقة، مما يحول مقطعًا بقيمة 2.10 دولار إلى ثلاث لقطات بقيمة 0.70 دولار لكل منها.

هل طول فيديو MiniMax H3 الأقصر يكلف أقل؟

نعم، خطيًا. الفوترة بالثانية بسعر 0.14 دولار، لذا فإن بروفة مدتها 4 ثوانٍ تكلف 0.56 دولار مقابل 2.10 دولار للقطة كاملة مدتها 15 ثانية. الدقة قصة مختلفة: 768P و 2K يقعان تحت سعر واحد مدرج في الكتالوج، لذا فإن خفض الدقة لا يوفر شيئًا. قصر المقطع، وليس البكسلات.

كم عدد مقاطع MiniMax H3 التي أحتاجها لفيديو مدته دقيقة واحدة؟

أربعة، إذا ملأت كل خمس عشرة ثانية في كل مرة. ولكن عد باللقطات بدلاً من ذلك: أربعة أجيال بثلاث لقطات لكل منها يعطيك اثنتي عشرة لقطة من التغطية، وهو مقدار طبيعي لإعلان تجاري مدته دقيقة واحدة. ثم اضرب ميزانيتك في ثلاثة تقريبًا لحساب اللقطات التي تتخلص منها.

أحدث النماذج

واجهة برمجية واحدة لكل وسائط الذكاء الاصطناعي.

استكشف جميع النماذج