تبدأ كل مقالة عن هذا النموذج عند نفس السطر. تسع صور، ثلاثة مقاطع فيديو، ثلاثة مقاطع صوتية، اثنا عشر ملفًا إجمالًا. يبدو وكأنه بطاقة ضمان.
لذا تعاملت معه كواحدة. بنيت شخصية، بنيت دعامة، أنشأت مشهدًا ليليًا، ثم أعدت تغذية ذلك المشهد الليلي كفيديو مرجعي، قصفت ثماني ثوانٍ من موسيقى الجاز في مسار صوتي مرجعي، ودفعت بجميع أنواع المراجع الثلاثة عبر طلب واحد. ثم بدأت في كسر القواعد عمدًا لأرى أيها يدافع عنه واجهة برمجة التطبيقات بالفعل.
أربعة منها لا يتم الدفاع عنها بالطريقة التي تتوقعها. واحد منها لا يزال يفرض عليك السعر الكامل لمقطع فيديو لم تطلبه، ولا تصل رسالة الخطأ التي كنت تأمل فيها أبدًا. هذا هو القسم الذي يستحق القراءة حتى النهاية.
النقاط الرئيسية
- ثلاثة أنواع مراجع، مصفوفة واحدة. ما يصل إلى 9 صور و3 مقاطع فيديو و3 مقاطع صوتية و12 ملفًا معًا. كلها تذهب إلى نفس حقل
refers، وtypeاختياري لأن واجهة برمجة التطبيقات تستنتجه من امتداد الملف. - لا يمكن للصوت أن يطير وحده أبدًا. يتم رفض الطلب الصوتي فقط مع خطأ محدد. يجب أن يرافق طلبًا يحتوي على صورة واحدة أو فيديو واحد على الأقل.
- المرجع إلى الفيديو والصورة إلى الفيديو متنافيان، لكن لا شيء يخبرك بذلك. أرسل
imageمن الإطار الأول جنبًا إلى جنب معrefersوتنتهي المهمة على أي حال. يتم التخلص من أحد إدخالك بصمت، بالسعر الكامل. تم التحقق منه مرتين في 2026-08-12، على كلا نقطتي النهاية. - لا يتم التحقق من صحة أي شيء عند الإرسال. كل طلب خاطئ في هذه المقالة أعاد HTTP 200 ومعرفًا. الحكم الحقيقي يصل بعد دقيقتين إلى ثلاث دقائق في مرحلة التوليد. الرفض هناك مجاني؛ الإكمال ليس مجانيًا.
- ملفات المرجع الإضافية مجانية. صورة مرجعية واحدة وعشر صور مرجعية يتم محاسبتها بنفس المبلغ تمامًا لنفس طول المقطع. السعر يتبع ثواني الإخراج، وليس عدد المدخلات.
هذا ما خرج من الجانب الآخر. لقطتان، وجه واحد، مكانان مختلفان تمامًا، واللقطة الثانية بُنيت من صورة وفيديو وملف صوتي في نفس الوقت.
اللقطة أ (مطر، ليل، زقاق نيون) ثم اللقطة ب (سوق مغطى فارغ في صباح اليوم التالي)، مقطوعتان معًا دون إضافة أي شيء سوى الوصلة. نفس المرأة، نفس الندبة فوق الحاجب الأيمن، نفس السترة النيلية، نفس المنشفة. اللقطة ب تم توليدها من ثلاثة مراجع في وقت واحد: صورتها الشخصية، مقطع اللقطة أ نفسه، وقطعة جاز مدتها ثماني ثوانٍ. كلتا اللقطتين من minimax/h3/reference-to-video بدقة 2K، 2560x1440، 24 إطارًا في الثانية، مع المسار الصوتي الاستريو الأصلي 32kHz. يُستحسن تشغيل الصوت في النصف الثاني، حيث تؤدي جملتها.
لماذا يتفوق MiniMax H3 Reference to Video على أي وصف يمكنك كتابته
الوصف يصف شخصًا. المرجع هو الشخص. هذا الفرق هو السبب الكامل لوجود نقطة النهاية هذه، وهو السبب في أن MiniMax H3 يحتل حاليًا قمة لوحة متصدرات تحرير الفيديو: Elo 1,125 عبر 10,280 صوتًا (Artificial Analysis، أغسطس 2026). لكن يجدر أن نكون دقيقين بشأن هذا الرقم: نفس الجدول يسرد نطاق ترتيبه بين 1 و2، مرتبطًا إحصائيًا مع Google Gemini Omni Flash عند 1,122. المركز الأول، ضمن فترة ثقة يشاركها فيه. الادعاء ذو الصلة بأن H3 يحتل أيضًا المراكز الثلاثة الأولى لكل من النص إلى فيديو والصورة إلى فيديو يأتي من منشور إعلان نفس المختبر (Artificial Analysis on X، أغسطس 2026).
الترتيبات رخيصة. إليك السلوك الفعلي، نفس الوصف، ثلاثة مستويات من المرجع، كل شيء آخر متطابق.

ثلاث عمليات تشغيل MiniMax H3 reference to video على نفس الوصف: بدون مرجع، صورة مرجعية لشخصية واحدة، وصورتان مرجعيتان
نفس الوصف، نفس إعدادات 768P 4s، من اليسار إلى اليمين: بدون مراجع على الإطلاق (نص إلى فيديو)، صورة مرجعية لشخصية واحدة، صورتان مرجعيتان (شخصية بالإضافة إلى وعاء الرامين). يقول الوصف "المرأة من الصورة المرجعية" في الثلاثة. في اللوحة اليسرى، لا تشير هذه العبارة إلى أحد، لذا يخترع النموذج شخصًا غريبًا. تم التوليد باستخدام minimax/h3/text-to-video و minimax/h3/reference-to-video.
قراءتان صادقتان لهذا الشريط. القفزة من اللوحة الأولى إلى اللوحة الثانية هائلة: بدون مرجع، "المرأة من الصورة المرجعية" هي عبارة لا تشير إلى شيء، والنموذج يملأ الفراغ بهدوء بشخص ليس له علاقة بمشروعك. القفزة من اللوحة الثانية إلى اللوحة الثالثة أصغر بكثير، لأن وصفي أيضًا وصف الوعاء بالكلمات، و H3 رسم وعاءً بحريًا مقبولًا مع طائر كركي عليه من النص وحده. هذا هو الجزء المفيد. الصورة المرجعية والعبارة الاسمية الجيدة تتنافسان على نفس المهمة، لذا استخدم فتحات المرجع الخاصة بك للأشياء التي لا تستطيع اللغة تحديدها: وجه محدد، منتج محدد، شعار محدد.
النمط وراء كل فشل تقريبًا في هذه المقالة هو نفسه اللوحة الأولى. لا شيء يحذرك من أن جزءًا من طلبك قد وقع على لا شيء.
ما يثبته المرجع فعليًا، وما لا يثبته. الصورة المرجعية تثبت الهوية: بنية الوجه، الشعر، العلامات المميزة، الثوب. لا تثبت الإضاءة، وهذه هي المفاجأة الأكثر شيوعًا على الإطلاق. كما أنها تسحب ضوء الصورة المرجعية معها، ولهذا فإن ورقة الشخصية الملتقطة في بيئة جوية تنتج شخصية لا تستطيع النجاة من تغيير المشهد. التقط مرجعك بإضاءة مسطحة ومحايدة. الفيديو المرجعي يثبت الحركة، التدرج اللوني والحبيبات، وليس الهوية. الصوت المرجعي يثبت الطبقة الصوتية نفسها. إذا كنت بحاجة إلى نفس الوجه يقرأ سطرًا بنفس الصوت عبر سلسلة من المشاهد، فإن مجموعة المرجع تقوم بثلاث مهام مختلفة وعليك أن تحدد أيها يفعل ماذا. تتقارب أدلة الممارسين على تسميتها موضعيًا في الوصف ("الصورة 1 هي الشخصية، الصورة 2 هي المنتج") وهذه الاتفاقية تستحق التبني؛ وصفي أدناه يستخدم تسمية وصفية عادية بدلاً من ذلك، والتي تعمل أيضًا عندما تكون المراجع واضحة بصريًا.
لماذا خيبة الأمل في النداء الأول عادة. أربعة أشياء، جميعها تم قياسها في 2026-08-12:
- نقطة نهاية الإرسال لا تتحقق من صحة أي شيء. MIME خاطئ، صوت بطول 164 ثانية، رابط معطل، حقول متنافية: كل ذلك يعيد HTTP 200 مع معرف تنبؤ. تكتشف ذلك لاحقًا.
ratioالافتراضي هوadaptive، الموثق باسم "دع النموذج يختار". مع مراجع بنسبة 16:9 حصلت على 1344x768 عند 768P سواء تركته علىadaptiveأو أجبرته على 16:9، لذا فإن الإعداد الافتراضي غير ضار عندما تكون مدخلاتك متوافقة بالفعل. إنها قطعة نقود عندما لا تكون كذلك، وهذه هي نقطة نهاية H3 الوحيدة حيث يمكنك ببساطة سحب القرار منها.- صورة الإطار الأول بالإضافة إلى المراجع لا تنتج خطأً. إنها تتجاهل واحدًا منها بصمت وتقوم بالفوترة.
- إذا لم يكن لدى النموذج شيء ملموس ليتشبث به، فإنه يملأ الفجوة بثقة، والوجه الخاطئ الواثق يبدو تمامًا مثل عملية تشغيل ناجحة.
بالنسبة لجانب صياغة الوصف، يغطي دليل أوامر MiniMax H3 الصياغة بشكل أعمق مما يمكنني هنا.
كتاب قواعد MiniMax H3 Reference to Video: ثلاثة أنواع، طلب واحد
جميع أنواع المراجع الثلاثة تشترك في مصفوفة واحدة. إليك العقد كما هو منشور، بجانب ما فعلته نقطة النهاية فعليًا عندما ضغطت عليها.
الجدول 1: أنواع المراجع الثلاثة
| صور مرجعية | فيديو مرجعي | صوت مرجعي | |
|---|---|---|---|
| الحد الأقصى للملفات | 9 | 3 مقاطع | 3 مقاطع |
| السقف المشترك | 12 ملفًا عبر جميع الأنواع الثلاثة | ||
| مدة كل ملف | غير متاح | 2 إلى 15 ثانية | 2 إلى 15 ثانية |
| المدة الإجمالية | غير متاح | 15 ثانية | 15 ثانية |
| الصيغ | png, jpeg, jpg, webp | mp4, mov | mp3, wav |
| هل يمكن استخدامه بمفرده؟ | نعم | نعم | لا، يحتاج إلى صورة أو فيديو |
| ما يثبته | الهوية، الثوب، المنتج، الأسلوب | الحركة، الكاميرا، التدرج، الحبيبات | الطبقة الصوتية نفسها |
| ما لا يثبته | إضاءة المشهد الجديد | من في اللقطة | المسار الدقيق (انظر الخطوة 6) |
| يتم تسليمه كـ | رابط عام أو بيانات base64 URL | رابط عام أو بيانات base64 URL | يجب التصريح به كـ audio/mp3، ليس audio/mpeg |
| هل يتم فرضه؟ | 10 صور مرت بشكل جيد | لم يتم اختباره بعد مقطع واحد | نافذة كل مقطع مفروضة، الإجمالي 15 ثانية لم يتم فرضه |
أعداد الملفات ونوافذ المدة هي الحدود المنشورة من MiniMax (Hailuo، أغسطس 2026)، تم التحقق منها مقابل مقالة الإطلاق التي تسرد نفس نافذة الفيديو المرجعي 2 إلى 15 ثانية لكل منها و15 ثانية إجمالاً (MarkTechPost، أغسطس 2026). كل شيء في الصفوف الثلاثة الأخيرة هو من قياساتي الخاصة.
شيئان لا تخبرك بهما ورقة المواصفات. أولاً، حقل type في كل إدخال اختياري ويتم استنتاجه من امتداد الرابط، مما يعني أن رابط بيانات base64 أو رابط بدون امتداد يجب أن يعلن عن نوعه وإلا فإن الطلب سيخمن بشكل خاطئ. ثانيًا، أداة الرفع في المتصفح تتوقف عند تسعة ملفات (Reference Materials (2/9)، MAX:9 في لقطة شاشة الخطوة 5 أدناه)، وهو أقل من اثني عشر ملفًا من MiniMax نفسها. لقد أرسلت عشر صور مرجعية عبر واجهة برمجة التطبيقات على أي حال واكتملت المهمة بشكل طبيعي، لذا فإن تسعة هو حد لواجهة المستخدم، وليس حدًا للنموذج.
الجدول 2: reference-to-video مقابل image-to-video مقابل text-to-video
| reference-to-video | image-to-video | text-to-video | |
|---|---|---|---|
| يقبل refers | نعم، مطلوب، على الأقل 1 | لا (يتم تجاهله بصمت) | لا |
| يقبل image first frame | لا (يتم تجاهله بصمت) | نعم، مطلوب | لا |
| يقبل end_image last frame | لا | نعم | لا |
| خيارات النسبة | جميع الـ7، بما في ذلك 16:9، 9:16، 21:9 | adaptive فقط | جميع الـ7 |
| الدقة | 768P أو 2K، افتراضي 2K | نفس الشيء | نفس الشيء |
| المدة | أعداد صحيحة 4 إلى 15 ثانية، افتراضي 8 | نفس الشيء | نفس الشيء |
| خلط إدخال نقطة النهاية الأخرى | المهمة تكتمل، يتم إسقاط الإدخال، شحن كامل | المهمة تكتمل، يتم إسقاط refers، شحن كامل | غير متاح |
ذلك الصف الرابع هو الفرق الذي لا يذكره أحد. في image-to-video، يحتوي تعداد نسبة العرض إلى الارتفاع على قيمة واحدة بالضبط، adaptive، لأن الإطار الأول يقرر الشكل. في reference-to-video تحصل على جميع القيم السبع، مما يجعل هذه هي نقطة نهاية H3 الوحيدة حيث يمكنك فرض شكل إطار مع الاستمرار في تثبيت شخصية. إذا كنت تختار مستوى لهذا العمل، فإن 2K مقابل 768P لـ MiniMax H3 يغطي ما تشتريه البكسلات الإضافية.
الصف الأخير هو الصف المكلف. تؤطر الوثائق نقطتي النهاية على أنهما متنافيتان، وهما كذلك، بمعنى أن مسار إدخال واحد فقط يتم تكريمه. لكن لا يوجد خطأ. قمت بتشغيله بالاتجاهين في 2026-08-12: استدعاء reference-to-video يحمل image من الإطار الأول اكتمل في 115 ثانية وتمت فوترة $0.40، واستدعاء image-to-video يحمل refers اكتمل في 167 ثانية وتمت فوترة $0.40. كلاهما أنتج فيديو. كلاهما تخلص من نصف ما أرسلته، ولا يوجد حقل في الاستجابة يخبرك بأي نصف.
الجدول 3: النماذج التي يستخدمها سير العمل هذا
كل ما يلي يعمل في علامة تبويب متصفح واحدة على Atlas Cloud، وهو مصدر الأسعار ولقطات الشاشة. الأسعار تم التحقق منها في 2026-08-12.
| الخطوة | النموذج | السعر | مرات التشغيل | التكلفة |
|---|---|---|---|---|
| مراجع الشخصية + الدعامة | openai/gpt-image-2/text-to-image | مدرج من $0.009؛ جودة عالية عند 2048x1152 تم قياسها عند $0.1745 | 2 | $0.35 |
| الصوت المرجعي | minimax/music-2.6 | $0.15 لكل مسار | 1 | $0.15 |
| اللقطة أ واللقطة ب | minimax/h3/reference-to-video | $0.10/ثانية عند 768P، $0.14/ثانية عند 2K | 2 × 8 ثوانٍ عند 2K | $2.24 |
| سلم المرجع | نفس الشيء، بالإضافة إلى minimax/h3/text-to-video | $0.10/ثانية عند 768P | 3 × 4 ثوانٍ عند 768P | $1.20 |
لا يوجد خصم نشط على أي من نقاط نهاية H3 الثلاثة هذا الشهر. جيران اثنان أرخص الآن إذا كنت تبني صورًا ثابتة مرجعية فقط: gpt-image-2-developer/text-to-image بخصم 50%، من $0.009 إلى $0.004 اعتبارًا من أغسطس 2026. التفاصيل الكاملة لكل ثانية موجودة في دليل تسعير واجهة برمجة تطبيقات MiniMax H3.
MiniMax H3 Reference to Video، خطوة بخطوة
المشهد: امرأة تدير كشك رامين. اللقطة أ هي زقاق نيون ممطر ليلاً. اللقطة ب هي نفس المرأة في صباح اليوم التالي في سوق مغطى فارغ، مكان مختلف، وقت مختلف من اليوم وعدسة مختلفة. لا شيء ينتقل بين النداءين سوى المراجع، وهذا هو الهدف من الاختبار.
الخطوة 1: بناء المرجع الشخصي، بإضاءة مسطحة عن قصد
هذه هي الخطوة التي يخطئ فيها الناس. المرجع الشخصي ليس صورة لطيفة لشخصيتك، إنه قياس لوجهها. ضوء محايد، خلفية بسيطة، لا مشهد، لا مزاج. H3 يتعلم الضوء مع الوجه، لذا فإن المرجع الجوي ينتج شخصية ملحومة بذلك الجو.
النموذج: openai/gpt-image-2/text-to-image. الإعدادات: الجودة عالية، الحجم 2048x1152 (16:9)، الصيغة png.
text1صورة تحريرية لامرأة في أوائل الثلاثينيات من عمرها، طاهية طعام الشارع. صورة شخصية قريبة بثلاثة أرباع، تعبير محايد، اتصال بصري مباشر مع الكاميرا. شعر أسود قصير مرتجع خلف أذن واحدة، ندبة صغيرة فوق الحاجب الأيمن، بشرة زيتونية دافئة. ترتدي سترة عمل نيلية باهتة بأكمام مطوية إلى الكوع ومنشفة بيضاء مطوية على الكتف الأيسر. خلفية استوديو رمادية فاتحة محايدة، إضاءة رئيسية ناعمة متساوية، لا دعامات، تركيز حاد على الوجه، نسيج بشرة طبيعي، لا تنميق. واقعي فوتوغرافي، عدسة 50 مم. 2

ملعب GPT Image 2 على Atlas Cloud مع تحميل وصف المرجع الشخصي والصورة النهائية في لوحة الإخراج
GPT Image 2 على Atlas Cloud: الجودة مضبوطة على عالية، 16:9، ورقة الشخصية معروضة على اليمين.

صورة مرجعية للشخصية لـ MiniMax H3 reference to video: صورة شخصية استوديو محايدة لطاهية رامين مع ندبة فوق حاجبها الأيمن
الصورة المرجعية 1. الندبة فوق الحاجب الأيمن والمنشفة البيضاء المطوية مقصودة: فهي أدوات تعريف رخيصة لا لبس فيها يمكنك التحقق منها في كل إطار لاحق.
الخطوة 2: بناء المرجع الدعامي
فتحة المرجع الثانية، مهمة ثانية. تتصرف الكائنات بشكل أفضل من الوجوه هنا، مما يجعل الدعامة المميزة أسهل طريقة لإثبات أن المرجع قد وصل. نفس النموذج، نفس الإعدادات.
text1صورة منتج لوعاء رامين سيراميكي أزرق داكن واحد مع طائر كركي أبيض مرسوم باليد على الجانب، مكسور عند الحافة، مملوء برامين شويو يخرج منه البخار. منظر أمامي مباشر، خلفية رمادية فاتحة محايدة، ضوء ناعم متساوٍ، تركيز حاد، واقعي فوتوغرافي، عدسة 50 مم. 2

صورة مرجعية للدعامة: وعاء رامين أزرق داكن مع طائر كركي أبيض مرسوم باليد وحافة مكسورة
الصورة المرجعية 2. طائر الكركي المرسوم باليد والكسر في الحافة هما الدليلان. إذا بقيا في الفيديو، فهذا يعني أن المرجع قد تمت قراءته.
الخطوة 3: اللقطة أ، صورتان في MiniMax H3 reference to video
صورتان مرجعيتان، كلاهما type: "image"، في refers. اضبط النسبة صراحة. adaptive هو الإعداد الافتراضي وسيفعل الشيء الصحيح عادةً عندما تكون مراجعك بالفعل 16:9، لكنه يقرر نيابة عنك، وفي نقطة النهاية هذه ليس عليك السماح بذلك.
النموذج: minimax/h3/reference-to-video. الإعدادات: الدقة 2K، المدة 8، النسبة 16:9.
text1لقطة تأسيسية واسعة. أمطار غزيرة ليلاً في زقاق ضيق مضاء بالنيون. المرأة من الصورة المرجعية تعمل بمفردها خلف كشك رامين صغير يخرج منه البخار تحت مظلة بلاستيكية، تغرف المرق في الوعاء البحري مع طائر الكركي الأبيض من الصورة المرجعية. يرتفع البخار عبر انعكاسات النيون الوردية والخضراء على الرصيف المبلل. اقتراب بطيء نحو الكشك. صوت محيط: مطر على البلاستيك، مرق يغلي، حركة مرور بعيدة. لا حوار. 2
إخراج هذا النداء هو النصف الأول من مقطع العرض التوضيحي في الأعلى. احتفظ برابطه. إنه مدخل الخطوة 5.
الخطوة 4: قص ثماني ثوانٍ من الصوت المرجعي
الصوت المرجعي ليس فتحة موسيقى تصويرية. إنه طبقة يستخدمها النموذج لمطابقة المزيج الخاص به، وهو الإدخال الأكثر حساسية على نقطة النهاية. قم بتوليد مسار، ثم قصه، لأن الأغنية الكاملة سيتم رفضها.
النموذج: minimax/music-2.6، مع is_instrumental: true و format: "mp3".
text1جاز ليلي متفرق، طبول فرشاة، كونتراباس، بوق مكتوم واحد، كئيب، 70 نبضة في الدقيقة، آلي. 2
ثم قص حوالي ثماني ثوانٍ وقم بتشفيره كرابط data:audio/mp3. ثلاثة أشياء أخطأت فيها هنا أولاً، جميعها مع نص الخطأ الدقيق:
- سلسلة MIME تهم أكثر من البايتات. صرح بـ
data:audio/mpegوسيتم رفض المرجع معaudio format ".mpeg" not allowed، على الرغم من أن الملف هو MP3 عادي تمامًا. اكتبaudio/mp3. - 2 إلى 15 ثانية لكل مقطع، ويتم فرضه. كان المسار الذي قمت بتوليده 164 ثانية. عاد كـ
invalid param: audio duration 164258 ms, expected [2000, 15000] ms. قصه إلى 8.05 ثانية أصلح الأمر. كلا الرفضين لم يكلفا شيئًا. - السقف المشترك البالغ 15 ثانية موثق لكن لم يتم فرضه. أرسلت مقطعين مدة كل منهما 8 ثوانٍ في نفس الطلب، بإجمالي 16.1 ثانية، متوقعًا رفضًا. اكتملت المهمة وتمت الفوترة بشكل طبيعي. لا تبنِ على ذلك: إنه منشور كحد ويمكن أن يبدأ في التصرف كواحد في أي وقت.

ملعب MiniMax Music 2.6 على Atlas Cloud مع وصف الجاز والمسار النهائي في لوحة الإخراج
MiniMax Music 2.6 على Atlas Cloud، $0.15 لكل تشغيل، المسار النهائي على اليمين. شيء واحد لتنسخه من لقطة الشاشة هذه وشيء واحد لا تنسخه: السعر وصيغة mp3 صحيحان، لكن Is Instrumental لا يزال متوقفًا وكلمات الأغاني التجريبية للصفحة لا تزال موجودة في المربع، لذا فإن هذا التشغيل المعين عاد كأغنية مدتها 1:35 مع غناء. اقلب هذا المفتاح إلى وضع التشغيل وامسح حقل كلمات الأغاني قبل تشغيله، وإلا فستقوم بقص طبقة مرجعية مع شخص يغني فوقها. تشغيل API الخاص بي، مع isinstrumental: true، أعاد 2:44 من الموسيقى الآلية في 209 ثوانٍ.
الخطوة 5: اللقطة ب، استدعاء MiniMax H3 reference to video واحد مع جميع الأنواع الثلاثة
هذا هو الاستدعاء الذي تدور حوله الكلمة المفتاحية حقًا. ثلاثة أنواع مراجع، ثلاث مهام مختلفة، مصفوفة واحدة:
- الصورة الشخصية من الخطوة 1،
type: "image"، لتثبيت وجهها - ملف mp4 للقطة أ من الخطوة 3،
type: "video"، لنقل التدرج والحبيبات عبر القطع - قطعة الجاز التي مدتها ثماني ثوانٍ من الخطوة 4،
type: "audio"، كطبقة صوتية
يمكن إسقاط روابط الإخراج من التوليدات الأخرى على المنصة مباشرة في refers كمرجع فيديو، وهي الآلية الفعلية وراء استمرارية اللقطات المتعددة. ليس "H3 يتذكر شخصيتك". أنت تسلم اللقطة السابقة إليه مرة أخرى.
النموذج: minimax/h3/reference-to-video. الإعدادات: الدقة 2K، المدة 8، النسبة 16:9.
text1نفس المرأة من الصورة المرجعية، في صباح اليوم التالي. سوق مغطى مشرق فارغ، ضوء نهار بارد ونظيف عبر نافذة سقفية، مصاريع لا تزال مغلقة خلفها. لقطة متوسطة القرب، كاميرا ثابتة. تمسح المنضدة بالمنشفة البيضاء المطوية، تنظر للأعلى نحو الكاميرا وتقول سطرًا واحدًا، ثم تعود إلى العمل. حافظ على وجهها وشعرها وندبتها وستراتها النيلية مطابقة للمرجع. انقل التدرج والحبيبات من مقطع المرجع. استخدم الصوت المرجعي كخلفية موسيقية. 2

ملعب MiniMax H3 reference to video على Atlas Cloud مع تحميل مرجع صورة وصوت والمقطع المولد في لوحة الإخراج
نفس الاستدعاء في ملعب MiniMax H3 Reference-to-Video، بدقة 2K و8 ثوانٍ. فتحتا مرجع من نوعين مختلفين مرئيتان في Reference Materials (2/9): الفتحة 1 هي ref-audio-8s.mp3، الفتحة 2 هي صورتها الشخصية. المرجع الفيديو يتم إدخاله من خلال "Add via link" (أعلى يمين تلك اللوحة) أو من خلال واجهة برمجة التطبيقات، لأنه موجود في رابط وليس على القرص. ثلاثة أشياء لقراءتها من هذه اللوحة: أداة الرفع تقول MAX:9 على الرغم من أن سقف MiniMax نفسه هو 12، Aspect Ratio يبقى على adaptive ما لم تقم بتغييره، وسعر التشغيل لـ 2K عند 8 ثوانٍ هو $1.12، وهو مستوى $0.14 في الثانية.
الخطوة 6: تحقق من أن المرجع قد وصل بالفعل
المهمة المكتملة ليست مهمة ناجحة. فحصان، كلاهما رخيص.
افحص الوجه. اسحب إطارًا من كل لقطة وضعهما جنبًا إلى جنب. أنت تبحث عن المراسي التي زرعتها: الندبة، خط الشعر، السترة، المنشفة.

إطار من اللقطة أ بجانب إطار من اللقطة ب، يظهر نفس شخصية MiniMax H3 reference to video في مشهدين مختلفين
يسار: اللقطة أ، ليل، نيون، واسع. يمين: اللقطة ب، سوق مغطى، صباح اليوم التالي، لقطة متوسطة القرب. نفس الوجه، نفس الندبة فوق الحاجب الأيمن، نفس السترة والمنشفة، عبر تغيير المشهد والتأطير دون مشاركة أي شيء سوى المراجع.
شيء واحد لم يحدث بالطريقة التي كتبت بها الوصف. لقد طلبت "سوق مغطى مشرق فارغ، ضوء نهار بارد ونظيف" و "انقل التدرج والحبيبات من مقطع المرجع"، وفاز مقطع المرجع. اللقطة ب هي بلا شك صباح وبلا شك مكان مختلف، لكنها أكثر جوية بكثير مما يوحي به "مشرق"، لأن التدرج الليلي جاء مع مرجع الفيديو. لا يمكنك أن تطلب من استدعاء واحد نفس المظهر والضوء المعاكس. إذا كنت بحاجة إلى تغيير الضوء، فأسقط تعليمات التدرج، أو أسقط مرجع الفيديو واحتفظ بالهوية باستخدام الصورة وحدها.
افحص الصوت. ارسم شكل الموجة للقطعة التي تبلغ مدتها ثماني ثوانٍ والتي قمت بتحميلها بجانب المسار الذي عاد داخل mp4، وأضف عنصر تحكم: مقطع تم توليده بدون أي مرجع صوتي على الإطلاق.

شكل الموجة للصوت المرجعي المرفوع لمدة 8 ثوانٍ، والمسار الصوتي المعاد داخل المقطع المولد، وعنصر تحكم بدون مرجع صوتي
أعلى: قطعة الجاز التي تبلغ 8.05 ثانية والتي تم إرسالها كمرجع. وسط: المسار المستخرج من ملف mp4 للقطة ب المعاد، ويهيمن عليه سطر الحوار عند حوالي 5.5 ثانية. أسفل: اللقطة أ، نفس سير العمل، بدون مرجع صوتي.
هنا يجب أن أصحح شيئًا كنت أعتقده مسبقًا. الصوت المرجعي لا يعاد حرفيًا. ارتباط الغلاف بين القطعة الخاصة بي والمسار المعاد هو 0.25، مقابل −0.05 لعنصر التحكم بدون مرجع، لذا فإن الاثنين مرتبطان لكن ليسا متطابقين بأي حال من الأحوال، والشكل المعاد هو بوضوح مزيج خاص به وليس ملفي مع شيء موضوع فوقه. ما فعله المرجع بوضوح هو وضع شيء تحته: طبقة اللقطة ب تعمل بحوالي 7 ديسيبل أكثر سخونة من عنصر التحكم بدون صوت عبر الثواني الخمس الأولى، قبل أن يبدأ أي حوار. اقرأ الصوت المرجعي كتوجيه للمزيج، وليس فتحة موسيقى. إذا كنت بحاجة إلى مسارك الدقيق تحت الصورة، فقم بوضعه لاحقًا.
إذا كنت تبني على الجانب الصوتي من هذا، فإن MiniMax H3 lip sync and audio ودليل MiniMax H3 music video يبدآن من نفس سلوك الصوت المرجعي هذا. بالنسبة لكود الاستقصاء وإعادة المحاولة حول كل هذا، يحتوي MiniMax H3 tutorial على الحلقة.
أربعة إعدادات إضافية لـ MiniMax H3 Reference to Video تستحق السرقة
إعادة تصميم مقطع تملكه بالفعل. ضع مقطعًا منتهيًا في refers كمرجع فيديو، بدون أي صور على الإطلاق، واطلب وسيطًا مختلفًا. الحركة، التأطير، الاقتراب والدعامات تبقى؛ السطح يتغير. هذه هي الآلية وراء ترتيب تحرير الفيديو في H3، وهي نفس الآلية وراء عمل الأنمي في MiniMax H3 vs Veo 3.1 for anime.

إعادة تصميم أنمي تم توليدها من مقطع اللقطة أ المستخدم كمرجع MiniMax H3 reference to video
زقاق اللقطة أ تم إرجاعه كالمرجع الوحيد، مع وصف أنمي بتظليل خلوي. نفس الكشك، نفس المغرفة، نفس وعاء الكركي، نفس الاقتراب، معاد رسمه. تفصيل واحد يستحق المعرفة: التحويل أضعف في الإطارات الأولى وأقوى بمجرد أن تلتزم الكاميرا بالحركة. معروض كـ GIF صامت. تم التوليد باستخدام minimax/h3/reference-to-video بدقة 768P، 4s، $0.40.
جعل صورة تنبض بالحياة. صورة شخصية واحدة بالإضافة إلى مقطع صوتي واحد داخل نافذة 2 إلى 15 ثانية، مع وصف الأداء. أرخص من خط أنابيب مزامنة الشفاه لأنه استدعاء واحد.
تثبيت منتج في أي مشهد. الصور المرجعية تثبت الكائنات بقوة أكبر من الوجوه، لذا فإن صورة منتج حقيقية بالإضافة إلى وصف مشهد هو أكثر شيء موثوق على نقطة النهاية هذه. تحقق من ما يُسمح لك بفعله بالنتيجة قبل أن تذهب في إعلان.
بناء سلسلة، وليس مقطعًا. قم بتسلسلها: إخراج اللقطة ن يصبح مرجع فيديو اللقطة ن+1. كل استدعاء لا يزال يقتصر على 15 ثانية، لذا فإن الاستمرارية هي وظيفتك، وليس وظيفة النموذج. كم يمكن أن يكون طول فيديو MiniMax H3 يغطي أين يؤثر هذا السقف.
مقارنة المحركات قبل أن تلتزم بسلسلة لأحدها؟ Seedance 2.5 vs MiniMax H3 و MiniMax H3 alternatives هما اللذان يجب قراءتهما.
كم تكلفة مشهد مزدوج اللقطة من MiniMax H3 Reference to Video فعليًا
كل سطر أدناه هو مهمة حقيقية من 2026-08-12، مع المبلغ المأخوذ من حقل price الذي تعيده واجهة برمجة التطبيقات عند كل تنبؤ مكتمل.
الجدول 4: الفاتورة الفعلية
| المهمة | النموذج | الإعدادات | النتيجة | المبلغ المحسوب |
|---|---|---|---|---|
| المرجع الشخصي | gpt-image-2 | عالي، 2048x1152 | مكتمل | $0.1745 |
| المرجع الدعامي | gpt-image-2 | عالي، 2048x1152 | مكتمل | $0.1745 |
| الصوت المرجعي | music-2.6 | آلي، mp3 | مكتمل، مسار 164 ثانية، انتظار 209 ثوانٍ | $0.15 |
| اللقطة أ | h3/reference-to-video | 2K، 8s، مرجعا صورتين | مكتمل في 309 ثوانٍ | $1.12 |
| اللقطة ب | h3/reference-to-video | 2K، 8s، مراجع صورة + فيديو + صوت | مكتمل في 557 ثوانٍ | $1.12 |
| السلم، بدون مرجع | h3/text-to-video | 768P، 4s | مكتمل في 154 ثوانٍ | $0.40 |
| السلم، مرجع صورة واحدة | h3/reference-to-video | 768P، 4s | مكتمل في 119 ثوانٍ | $0.40 |
| السلم، مرجعا صورتين | h3/reference-to-video | 768P، 4s | مكتمل في 128 ثوانٍ | $0.40 |
| إعادة تصميم الأنمي | h3/reference-to-video | 768P، 4s، مرجع فيديو واحد | مكتمل في 239 ثوانٍ | $0.40 |
| إعادة تشغيل الخطوة 5 في الملعب | h3/reference-to-video | 2K، 8s، مراجع صورة + صوت | مكتمل | $1.12 |
| التحكم: 10 مراجع صور | h3/reference-to-video | 768P، 4s | مكتمل في 150 ثوانٍ | $0.40 |
| التحكم: صورة الإطار الأول + refers | h3/reference-to-video | 768P، 4s | مكتمل، تم إسقاط أحد الإدخالات | $0.40 |
| التحكم: refers على image-to-video | h3/image-to-video | 768P، 4s | مكتمل، تم إسقاط refers | $0.40 |
| التحكم: 16.1 ثانية من الصوت المرجعي | h3/reference-to-video | 768P، 4s | مكتمل فوق الحد الموثق | $0.40 |
| التحكم: النسبة محذوفة، ثم النسبة adaptive | h3/reference-to-video | 768P، 4s، مرتين | كلاهما مكتمل، 1344x768 متطابق | $0.80 |
| إعادة تشغيل لقطات الشاشة للخطوتين 1 و 4 | gpt-image-2, music-2.6 | كما هو مذكور أعلاه | مكتمل | $0.32 |
| التحكم: الصوت المرجعي بمفرده | h3/reference-to-video | 768P، 4s | فشل في 7ms | $0.00 |
| التحكم: الصوت المرجعي 164 ثانية | h3/reference-to-video | 768P، 4s | فشل في 16s | $0.00 |
| التحكم: MIME audio/mpeg | h3/reference-to-video | 768P، 4s | فشل في 17s | $0.00 |
| التحكم: رابط مرجع معطل | h3/reference-to-video | 768P، 4s | فشل في 21s | $0.00 |
| المجموع | $8.18 |
قسّم هذا المجموع بأمانة. المشهد المزدوج اللقطة النهائي في أعلى هذه المقالة، بما في ذلك المراجع والصوت، هو $2.74 منه. الـ $5.44 الأخرى هي التحقيق: عناصر التحكم، الكسر المتعمد، وإعادة تشغيل الخطوات في المتصفح من أجل لقطات الشاشة. إذا كنت تعرف القواعد بالفعل، فإن تسلسلًا مزدوج اللقطة مدته 16 ثانية بدقة 2K يكلف أقل من شطيرة.
ثلاثة أشياء تخرج من هذا الجدول.
المراجع مجانية. عنصر التحكم بعشر صور كلف بالضبط نفس $0.40 مثل تشغيل السلم بصورة واحدة بنفس الطول والدقة. على هذه المنصة، يعمل العداد على ثواني الإخراج والدقة فقط، وليس على أي شيء آخر. يجدر الإشارة إلى تناقض واحد: تصف قواعد منصة MiniMax الخاصة بها فيديو الإدخال على أنه يتم محاسبته بمعدل الإخراج، ويحمل المخطط الموحد عبر OpenRouter بندًا منفصلاً reference_images. لم يظهر أي منهما في فاتورتي هنا. إذا كنت تضع ميزانية في مكان آخر، فاحسب السعر بنفسك بدلاً من الافتراض.
الفشل مجاني، ومتأخر. جميع حالات الرفض الأربعة لم تكلف شيئًا، وهذا هو الخبر السار. الخبر السيئ هو متى تصل: 7 مللي ثانية لقاعدة الصوت وحده، 16 إلى 21 ثانية لطول الصوت، و MIME الخاطئ والرابط المعطل، ولا شيء على الإطلاق في وقت الإرسال. كل طلب مشوه في هذه المقالة حصل على HTTP 200 ومعرف التنبؤ أولاً، لذا تعامل مع استجابة الإرسال كإيصال، وليس كتحقق، واستقصِ حقل status قبل أن تصدق أي شيء.
النجاح الصامت هو الفشل المكلف. عنصري التحكم في الخلط كلف كل منهما $0.40 كاملة وأعادا فيديو صالحًا تمامًا مبنيًا على نصف مدخلاتي. لا يوجد خطأ، ولا حقل تحذير، ولا طريقة لمعرفة من الاستجابة أن أي شيء قد تم التخلص منه. هذا هو السطر الوحيد في الجدول حيث غادر المال الحساب ولم أحصل على أي شيء أردته.
تصحيح صادق واحد بشأن تلك النقطة الأخيرة، لأنها تغيرت تحتي بينما كنت أكتب. في أوائل أغسطس، كان رابط مرجعي يعيد 404 يتصرف بنفس الطريقة: اكتملت المهمة، وتم تجاهل المرجع بصمت، وتم تحميل المبلغ بالكامل. عند إعادة تشغيله في 2026-08-12، تتحقق نقطة النهاية الآن من إمكانية الوصول وتفشل المهمة مجانًا مع خطاب مسمى، content[1].image_url: media not found (HTTP 404). تلك الفتحة المحددة مغلقة. فتحة المدخلات المتنافية ليست مغلقة. بالنسبة لحسابات الائتمان لكل مقطع، يحتوي MiniMax H3 credits per video على الجداول.
وجه من، صوت من: تحقق من هذا قبل رفع مرجع
تختلف نقطة النهاية هذه عن النص إلى فيديو في جانب واحد ذي صلة قانونية: أنت تقدم الشبه. صورة مرجعية لشخص حقيقي، مقطع مرجعي من فيلم شخص ما، صوت مرجعي بصوت يمكن التعرف عليه، كل هذه مواد تدعي أن لديك الحق في استخدامها. قواعد المحتوى من جانب النموذج لا تزال سارية فوق ذلك، وهي أكثر صرامة بشأن الأشخاص الحقيقيين منها بشأن الأشخاص المخترعين. دليلان يستحقان القراءة قبل أن يرى العميل الإخراج: MiniMax H3 content restrictions وتحليل الاستخدام التجاري والترخيص، الذي يغطي أيضًا استثناءات الإقليم في شروط MiniMax.
MiniMax H3 Reference to Video: الأسئلة الشائعة
هل يمكن لـ MiniMax H3 reference to video الحفاظ على نفس الشخصية عبر لقطتين مختلفتين؟
نعم، واختبار اللقطتين الخاص بي أعلاه يصمد عبر انعكاس إضاءة كامل من الليل إلى الصباح. لكن صورة الشخصية وحدها ليست ما يفعل ذلك. النمط الموثوق هو تمرير رابط إخراج اللقطة السابقة مرة أخرى كفيديو مرجعي جنبًا إلى جنب مع صورة الشخصية، بحيث يرث الاستدعاء الثاني التدرج والحبيبات بالإضافة إلى الهوية.
هل يمكنني استخدام صورة من الإطار الأول ومراجع في نفس استدعاء MiniMax H3 reference to video؟
لا، وطريقة الفشل هي المشكلة. إرسال كل من image و refers لا ينتج خطأً. تم اختباره في 2026-08-12، اكتملت المهمة في 115 ثانية، وتمت فوترة $0.40، وتم التخلص بصمت من أحد الإدخالين. نفس الشيء يحدث بالعكس على نقطة نهاية image-to-video. اختر مسارًا واحدًا لكل استدعاء.
هل يمكنني إرسال ملف صوتي بمفرده كمرجع MiniMax H3 reference to video؟
لا. يجب أن يسافر الصوت مع صورة مرجعية واحدة أو فيديو واحد على الأقل، وتفرضه نقطة النهاية بخطأ صريح: reference-to-video requires at least one reference image or video. يصل في مرحلة التوليد، وليس عند الإرسال، والمهمة المرفوضة مجانية. يجب أن تكون المراجع الصوتية أيضًا داخل 2 إلى 15 ثانية، و15 ثانية إجمالاً، وأن تُصرح كـ audio/mp3 بدلاً من audio/mpeg.
هل تفرض MiniMax H3 reference to video رسومًا إضافية على كل ملف مرجعي؟
ليس على Atlas Cloud. تشغيل بعشر صور مرجعية وتشغيل بصورة واحدة كلفا نفس $0.40 عند 768P و4 ثوانٍ، لذا فإن العداد يتتبع ثواني الإخراج والدقة فقط. لاحظ التناقض مع ذلك: قواعد MiniMax الخاصة تذكر فيديو الإدخال على أنه يتم قياسه بمعدل الإخراج، والمنصات الأخرى تكشف عن بند منفصل للصور المرجعية. تحقق على السطح الذي تقوم بالفوترة من خلاله.
ماذا يحدث إذا كان أحد روابط MiniMax H3 reference to video معطلاً؟
اعتبارًا من 2026-08-12، تتحقق نقطة النهاية من إمكانية الوصول وتفشل المهمة بأكملها مجانًا، مع content[1].image_url: media not found (HTTP 404) بعد حوالي 21 ثانية. هذا تغيير: في وقت سابق من أغسطس، كان نفس الطلب يكتمل، ويتجاهل المرجع المفقود بصمت، ويفرض السعر الكامل. لا تفترض أن تقارير السلوك الأقدم لا تزال صالحة، وتحقق من حقل status بدلاً من افتراض أن 200 عند الإرسال يعني أي شيء.
هل MiniMax H3 reference to video هو بالفعل أفضل نموذج لهذا؟
على المواجهة المباشرة العامة الوحيدة التي تقيس ذلك، نعم، بشكل طفيف. يتصدر MiniMax H3 لوحة متصدرات تحرير الفيديو عند Elo 1,125 عبر 10,280 صوتًا، لكن نطاق ترتيبه المدرج هو 1 إلى 2 و Gemini Omni Flash يبعد 3 نقاط Elo خلفه بفترة متداخلة. تعامل معه على أنه "أفضل ما هو متاح بشكل مشترك"، اختر بناءً على باقي سير العمل، واقرأ MiniMax H3 alternatives إذا كان التعادل يهمك.






