MiniMax H3 مزامنة الشفاه والصوت: أطعمته 6 ثوانٍ من صوت وحذفت 4 أدوات من سير العمل الخاص بي

استبدلت مزامنة الشفاه والصوت في MiniMax H3 سلسلة الدبلجة ذات الست خطوات باستدعاء API واحد. لقطتان حقيقيتان، حدود الصوت المرجعي التي لا يوثقها أحد، والفواتير الحقيقية.

رجل يرتدي سماعات رأس يتحدث في ميكروفون أثناء قراءة نص

إطار الراديو في المناوبة الليلية الذي تبدأ منه كل لقطة في هذه المقالة، تم إنشاؤه باستخدام openai/gpt-image-2/text-to-image بجودة عالية، 2048x1152

هذه اللقطة الثابتة هي المدخل للبرنامج التعليمي بأكمله أدناه. تم إنشاؤها باستخدام openai/gpt-image-2/text-to-image، جودة عالية، 2048x1152.

فكر في آخر مرة أنهيت فيها لقطة مدتها 8 ثوانٍ وخرجت صامتة.

لقد صدّرت المقطع. فتحت علامة تبويب TTS وكتبت السطر. بحثت في مكتبة صوتية عن صوت المطر وصوت الغرفة. سحبت كل ذلك إلى خط زمني وحرّكت الشكل الموجي يميناً ويساراً حتى توقف الفم عن الكذب. ثم دفعت لنموذج محاذاة شفاه منفصل لإصلاح الفم على أي حال. أربع أدوات، ثلاثة ملفات wav، ساعة واحدة، ولا يزال الأداء يبدو مدبلجاً، لأنه كان كذلك.

هذه السلسلة هي ما حذفه MiniMax H3 بهدوء. ليس لأنه "يحتوي على صوت" (الكثير من النماذج تدّعي ذلك)، ولكن بسبب خانة واحدة في جسم الطلب لا يختبرها أحد تقريباً: يمكنك تسليمها مقطعاً صوتياً تمتلكه بالفعل، مجاناً، والحصول على الصوت على وجه.

أدناه اختبار اللقطتين اللتين تعزلان تلك الخانة، والأسعار الحقيقية لكل خطوة تحل محلها، والحدود الصارمة التي سترفض طلبك، والفاتورة الفعلية.

النقاط الرئيسية

  • استدعاء واحد يعيد الصورة والحوار وصوت الغرفة وحركة الشفاه معاً. يتم ترميز النص والمرئيات والصوت بشكل منفصل، ثم يتنبأ محول Omni واحد بشكل مشترك باللاتينات الفيديو والصوت (بطاقة نموذج Hugging Face، أغسطس 2026).
  • الصوت المدخل مجاني. الفيديو المدخل ليس مجانياً: MiniMax يفوتر الفيديو المرجعي بسعر المخرجات، لذا فإن نفس المادة التي تبلغ مدتها 15 ثانية تكلف 0 دولار كأغنية وحوالي 1.95 دولار كمقطع فيديو.
  • الحدود الصارمة: 3 مقاطع صوتية كحد أقصى، كل منها من 2 إلى 15 ثانية، 15 ثانية إجمالاً، ولا يمكن للصوت أن يسافر بمفرده أبداً. يجب أن يرافق صورة أو فيديو واحداً على الأقل.
  • بسعر 0.14 دولار لكل ثانية لـ 2K على Atlas Cloud، تبلغ تكلفة اللقطة الكاملة التي تبلغ مدتها 10 ثوانٍ مع الصوت 1.40 دولار، وهو أقل من دفع 0.22 دولار لكل ثانية لنموذج محاذاة شفاه مخصص لتصحيح مقطع قمت بالفعل بتقديمه.

الصوت قيد التشغيل: لقطتان من MiniMax H3 لمحاذاة الشفاه والصوت، بفارق ست ثوانٍ

ارتدِ سماعات الرأس لهذه التجربة. تلقى كلا النصفين نفس الإطار الأساسي، نفس سطري الحوار، ونفس المطالبة، كلمة بكلمة. واحد فقط منهما سمع تسجيلاً لصوت مدته ست ثوانٍ أولاً.

fXlyer__czg

الصوت قيد التشغيل، واستخدم سماعات الرأس: النصف الأيسر (اللقطة أ، بدون صوت مرجعي) يُشغل في أذنك اليسرى، والنصف الأيمن (اللقطة ب، مع مرجع صوتي مدته 6 ثوانٍ) في أذنك اليمنى. نفس الإطار، نفس السطور، نفس المطالبة. كلا اللقطتين: minimax/h3/reference-to-video، 2K، 10 ثوانٍ، تم تسليمهما بدقة 2560x1440 بمعدل 24 إطاراً في الثانية مع مسار ستيريو 32 كيلو هرتز.

اللقطة أ لم يكن لديها ما تستند إليه سوى الكلمات "صوت مذيع ذكر هادئ، منخفض، مغناطيسي" في المطالبة، لذا اخترعت صوتاً. اللقطة ب تلقت 6.19 ثانية من جملة مختلفة تماماً وقيل لها إنها مجرد مرجع للجرس الصوتي. لم يتم دبلجة أي من اللقطتين بعد ذلك. لم تقترب أي منهما من نموذج محاذاة شفاه. في كلتيهما، يتبع الفم الصوت الذي أنتجه النموذج، لأن الفم والصوت تم إنتاجهما معاً.

احكم على الجرس الصوتي بأذنيك بدلاً من أخذ كلامي. ما يمكنني ذكره كحقيقة هو الآلية والإعدادات والفاتورة، وهذه هي التالية.

لماذا كسر MiniMax H3 لمحاذاة الشفاه والصوت سلسلة الدبلجة المكونة من ست خطوات لدى الجميع

السلسلة القديمة لم تكن سير عمل حقاً. كانت مهمة إصلاح.

ImGr2NgcCCY

الصوت قيد التشغيل. ضفدع ثلاثي الأبعاد وحرباء يتحدثان مع بعضهما البعض داخل خيمة سيرك ليلاً، مع أجواء الحظيرة الجالسة تحت الحوار. مقطع مرجعي من MiniMax للصوت الأصلي H3. أشكال الفم على الشخصيات المتحركة هي الحالة الأصعب لتزييفها، ولهذا السبب يستحق هذا المقطع 20 ثانية من انتباهك.

ثلاثة أشياء كانت تنكسر باستمرار، وانكسرت لأسباب هيكلية وليس سوء الحظ.

الخط الزمني كان بين يديك. نموذج فيديو يعطيك إطارات. نموذج TTS يعطيك شكلاً موجياً. لا شيء في أي من المخرجات يعرف عن الآخر، لذا كانت المحاذاة حكماً بشرياً يتم بمعدل 30 إطاراً في الثانية، بالعين، الساعة 1 صباحاً. كل إعادة تصدير تبدأ ذلك الحكم من جديد.

محاذاة الشفاه على شكل تصحيح لها سقف. نموذج محاذاة شفاه مخصص يمتلك فقط منطقة الفم من لقطات موجودة بالفعل. يمكنه جعل الفم يتوافق مع الصوت. لا يمكنه جعل الفك يتوتر قبل حرف ساكن قوي، أو وضع نَفَس قبل سطر، أو ترك الكتفين ينخفضان عند انتهاء الجملة، لأن تلك الإطارات تم تقديمها قبل أن يعرف أحد ما سيقوله الشخصية. تحصل على الدقة بدون أداء، وهو ما يقرأ على أنه غريب.

تصميم الصوت كان مشروعاً ثانياً. المطر، صوت الغرفة، صرير الكرسي، خط الجهير الجالس تحت الحوار. كلها وصلت من مصدر مختلف وكان يجب موازنتها مع صوت كان هو نفسه ملصقاً.

ما يخبرك به VAE الصوتي عن MiniMax H3 لمحاذاة الشفاه والصوت

هذا هو الجزء الذي ليس لغة تسويقية، لأنه يمكنك رؤيته في اسم ملف.

في H3، يمر النص عبر H3-Encoder، والمدخلات المرئية تمر عبر كل من H3-Encoder و H3-VisualVAE، ويمر الصوت فقط عبر H3-AudioVAE مستقل. ثم يتنبأ H3-Omni-Transformer بشكل مشترك بلا تينات الفيديو والصوت، والتي يتم فك تشفيرها إلى فيديو وصوت ستيريو بشكل منفصل. يشترك AudioVAE في مشفر واحد ومفكك تشفير واحد عبر القناتين اليسرى واليمنى، ويعالج كل منهما بشكل مستقل، ويعيد دمجهما للستيريو، ويضغط صوت 32 كيلو هرتز إلى سلسلة من الرموز الكامنة بمعدل زمني 40 هرتز (بطاقة نموذج Hugging Face).

عندما شحن ComfyUI دعماً من اليوم الأول، ظهرت تلك البنية كملفين منفصلين في مجلد VAE: minimax_h3_video_vae_fp16.safetensors و minimax_h3_audio_vae_fp32.safetensors، يتم تحميلهما بواسطة محمل VAE مزدوج يأخذ مسار فيديو ومسار صوت (مدونة ComfyUI، أغسطس 2026). الصوت هو وسيلة (modality) تم بناء النموذج حولها، وليس معالجة لاحقة ملحقة بنهايته.

تتفق لوحات الصدارة على مكان ظهور ذلك. وضعت Artificial Analysis H3 في المرتبة الأولى على لوحة تحرير الفيديو الخاصة بها مع الصوت عند 1130 Elo من 5043 عينة تفضيل عمياء، بينما وضعته في المراكز الثلاثة الأولى في كل من النص إلى فيديو والصورة إلى فيديو (Artificial Analysis، يوليو 2026). الفجوة بين "صورة جيدة جداً" و"المركز الأول" في ذلك الترتيب بالذات هي الصوت.

سير عمل MiniMax H3 لمحاذاة الشفاه والصوت، مسعراً مقابل السلسلة التي يستبدلها

الطريقة الصادقة للحكم على هذا ليست المشاعر. هي تسعير السلسلة القديمة خطوة بخطوة، باستخدام أسعار حقيقية لكل ثانية للقطة نهائية مدتها 10 ثوانٍ، ثم تسعير البديل.

#السلسلة القديمة، خطوة بخطوةما قام بتشغيلهاكم تكلفت تلك الخطوةمع MiniMax H3 لمحاذاة الشفاه والصوت
1تقديم الصورة الصامتةنموذج فيديو، مثلاً bytedance/seedance-2.0 بسعر 0.112 دولار/ثانية1.12 دولارنفس الاستدعاء الواحد
2التعبير عن السطورminimax/speech-2.6-hdحوالي 0.02 دولار لحوالي 250 حرفاًنفس الاستدعاء الواحد
3العثور على الموسيقى التصويرية أو إنشاؤهاminimax/music-2.60.15 دولار لكل مسارنفس الاستدعاء الواحد
4طبقات الأجواء والمؤثرات الموضعيةمكتبة صوتية بالإضافة إلى يديكأمسيتكنفس الاستدعاء الواحد
5محاذاة كل شيء على خط زمنيمحرر بالإضافة إلى يديكأمسيتكغير موجود
6المزجمحرر بالإضافة إلى يديكأمسيتكغير موجود
7تصحيح الفمsync/lipsync-v3 بسعر 0.22 دولار/ثانية2.20 دولارغير موجود
الإجمالي4 نماذج بالإضافة إلى تمريرتين يدويتينحوالي 3.49 دولار بالإضافة إلى أمسيتكاستدعاء واحد، 1.40 دولار

اقرأ الصف 7 مرتين. تصحيح فم مقطع قمت بتقديمه بالفعل يكلف 0.22 دولار لكل ثانية، بينما توليد اللقطة بأكملها بصوتها وأجواءها وحركة فمها يكلف 0.14 دولار لكل ثانية. التصحيح أغلى من الأصل. هذه المقارنة الواحدة هي الحجة بأكملها.

اللاتماثل الذي لا يذكره أحد: الصوت الخاص بك مجاني، الفيديو الخاص بك ليس مجانياً.

يسرد جدول تسعير الدفع حسب الاستخدام من MiniMax المواد المدخلة بشكل منفصل عن المخرجات. بالنسبة لـ H3، الإدخال الصوتي مجاني. الصور الخمس الأولى المدخلة مجانية وكل صورة بعد ذلك تكلف 0.04 دولار. يتم فوترة الفيديو المدخل حسب مدة المقطع المدخل بسعر دقة المخرجات، وهو 0.13 دولار لكل ثانية بدقة 2K (وثائق تسعير MiniMax، تم التحقق منه في 3 أغسطس 2026). لذا فإن نفس المادة المرجعية التي تبلغ مدتها 15 ثانية لا تكلف شيئاً كأغنية أو رسالة صوتية أو VO يقدمه العميل، وحوالي 1.95 دولار كمقطع فيديو.

هذا هو الخط الذي يجب أن يغير كيفية بناءك. الصوت المرجعي هو أرخص سطح تحكم في النموذج، وهو الوحيد الذي لا يختبره أحد.

الإدخال المرجعيكملكل مقطعالإجماليالفوترة (MiniMax)
صورةحتى 9n/an/aأول 5 مجاناً، ثم 0.04 دولار لكل منها
فيديوحتى 32 إلى 15 ثانية15 ثانية كحد أقصىيتم فوترته بسعر المخرجات، 0.13 دولار/ثانية بدقة 2K
صوتحتى 32 إلى 15 ثانية15 ثانية كحد أقصىمجاني
أي مزيج12 ملفاً كحد أقصىn/an/aكما هو مذكور أعلاه، حسب النوع
صوت بمفردهغير مسموح. يجب أن يكون الصوت مصحوباً بإدخال صورة أو فيديو ولا يمكن استخدامه كإدخال وحيد

الحدود من مواصفات H3-Base-Ref2VA على بطاقة النموذج. يقول مخطط Atlas Cloud لـ minimax/h3/reference-to-video نفس الشيء بكلماته الخاصة: "مطلوب صورة واحدة على الأقل أو فيديو (الصوت وحده غير مسموح به)."

ملاحظتان جانبيتان على جانب العداد من Atlas، كلاهما من عملياتي الخاصة بدلاً من صفحة وثائق. يقوم Atlas بفوترة مبلغ ثابت قدره 0.14 دولار لكل ثانية مخرجات لجميع نقاط نهاية H3 الثلاث، وفيديو مرجعي أرفقته لم يضف رسوماً منفصلة فوق ذلك. هذه ملاحظة واحدة، وليست سياسة، لذا ضع في ميزانيتك قاعدة MiniMax وتعامل مع السعر الثابت كمكافأة. يقبل Atlas أيضاً resolution: "768P" ويقوم بفوترته بنفس 0.14 دولار، وهو تناقض يستحق القراءة عنه في تفصيل أسعار API MiniMax H3 بدلاً من هنا.

كل شيء أدناه يعمل في علامة تبويب متصفح واحدة على Atlas Cloud: الإطار الأساسي، والمرجع الصوتي، وكلتا لقطتي H3، على مفتاح API واحد مع حلقة استقصاء واحدة. تختلف نقاط نهاية H3 الثلاث فقط في شكل مدخلاتها، لذا يصبح refers image يصبح نصاً عادياً ولا شيء آخر في الكود الخاص بك يتغير.

MiniMax H3 لمحاذاة الشفاه والصوت، خطوة بخطوة

خمس خطوات. اثنتان منها عبارة عن إعداد رخيص، واثنتان هما الاختبار الفعلي، والأخيرة لا تكلف شيئاً لأنها مصممة للفشل.

الخطوة 1: بناء الإطار الأساسي باستخدام GPT Image 2

العرض التوضيحي هو مذيع راديو في المناوبة الليلية، تم اختياره لسبب واحد: لقطة قريبة ضيقة على الفم هي التأطير الوحيد الذي يمكنك فيه الحكم فعلياً على محاذاة الشفاه. اللقطة الواسعة تسمح للنموذج بالغش.

شيئان في هذه المطالبة غير قابلين للتفاوض. يجب أن يكون الفم مفتوحاً قليلاً في منتصف الكلمة، بحيث يُقرأ الإطار الأول بالفعل على أنه كلام، ويجب ألا يكون هناك أي نص في أي مكان في الإطار، حتى لا تتعارض التسميات التوضيحية الديناميكية لاحقاً مع الحروف المدمجة.

plaintext
1صورة سينمائية واقعية، 16:9، استوديو راديو في المناوبة الليلية، تأطير ضيق من الصدر إلى الأعلى لرجل
2في أواخر الثلاثينيات من عمره يميل نحو ميكروفون مكثف فضي عتيق على ذراع ذراع الرافعة،
3شاشة رغوة على بعد بوصات من شفتيه، سماعات رأس نصفها منزوع عن أذن واحدة. مصباح مكتب تنجستن دافئ
4من يسار الكاميرا ينحت عظمة وجنته؛ لافتة نيون حمراء ON AIR تحترق خارج نطاق التركيز خلف
5كتفه وتنزف قرمزياً على مقاييس خلاط الصوت في المقدمة السفلية. خطوط المطر
6على نافذة الاستوديو على اليمين، أضواء المدينة ملطخة في بوكيه. دخان سجائر رقيق ينجرف
7عبر شعاع المصباح. الفم مفتوح قليلاً في منتصف الكلمة، عينان إلى الأسفل نحو نص ورقي. تم التصوير على
835mm، عمق مجال ضحل، حبيبات فيلم ناعمة، ظلال عميقة، لا يوجد نص في أي مكان في الإطار.
9

الإعدادات على openai/gpt-image-2/text-to-image: الجودة عالية، الحجم 16:9 بدقة 2048x1152، صورة واحدة. 0.009 دولار على قائمة النماذج هو حد أدنى لشريحة الرمز، وليس ما تدفعه. في هذا الحجم والجودة، يقتبس زر التشغيل 0.1745 دولار لكل رسم، والذي يمكنك قراءته في لقطة الشاشة أدناه.

واجهة مولد صور بالذكاء الاصطناعي تظهر مطالبة ومخرجاتها

GPT Image 2 على Atlas Cloud مع مطالبة كشك الراديو المكتوبة، والجودة عالية و 16:9 2048x1152 محددة، والإطار الأساسي النهائي المعروض في لوحة OUTPUT_GPT Image 2 على Atlas Cloud: المطالبة بالضبط أعلاه، الجودة عالية، 16:9 بدقة 2048x1152، ورسم ثانٍ لنفس الإطار في OUTPUT._

الخطوة 2: عمل المرجع الصوتي لمدة ست ثوانٍ

هذه هي الخطوة التي يخطئ فيها الناس، لذا اقرأ المنطق قبل المطالبة.

يجب أن يقول الصوت المرجعي جملة مختلفة عن تلك التي تريدها في الفيديو. إنه مرتكز للجرس الصوتي، لا شيء آخر. السطور تأتي من المطالبة. مثال المرجع إلى فيديو الخاص بـ MiniMax يجعل هذا التقسيم صريحاً: فهو يسمي مقطعاً واحداً كالمسار المصدر لإعادة الاستخدام جزئياً للموسيقى، ومقطعاً ثانياً فقط كـ "مرجع جرس الصوت"، مع كتابة الحوار الجديد في السطر في المطالبة. إذا كان المرجع الخاص بك يقول نفس الكلمات التي طلبتها، فأنت تدعو النموذج لنسخ المسار بدلاً من نقل الصوت.

plaintext
1أنت تستمع إلى Night Line، واحد وتسعين فاصل أربعة، والساعة تقترب من
2الثالثة صباحاً.
3

الإعدادات على minimax/speech-2.6-hd: أي صوت ذكر هادئ منخفض يعمل، واخترت ذكر ذو صوت مغناطيسي (English_magnetic_voiced_man). اضبط speed على 0.95 بحيث تقع اللقطة داخل نافذة 2 إلى 15 ثانية مع مساحة كافية، اترك vol عند 1.0، واحتفظ بمخرجات mp3. النموذج بسعر 0.08 دولار لكل 1000 حرف، انخفاضاً من 0.10 دولار، خصم 20% ساري المفعول اعتباراً من أغسطس 2026. عاد سطري بطول 6.19 ثانية وتمت فوترته بمبلغ 0.00792 دولار.

واجهة مولد الصوت مع إدخال نص وشكل موجي صوتي في المخرجات

MiniMax Speech 2.6 HD على Atlas Cloud مع سطر المرجع المكتوب في حقل النص والشكل الموجي الصوتي المعروض في لوحة OUTPUT

MiniMax Speech 2.6 HD على Atlas Cloud: سطر واحد داخلاً، ملف mp3 قصير خارجاً، مع الخصم 20% الظاهر على زر التشغيل. تم التقاط لقطة الشاشة على الصوت الافتراضي Expressive Narrator، لذا قم بتبديل منتقي الصوت إلى ذكر ذو صوت مغناطيسي واخفض السرعة إلى 0.95 قبل تشغيله.

الخطوة 3: تشغيل MiniMax H3 لمحاذاة الشفاه والصوت مع الصوت المرجعي

الآن يذهب كلا الملفين إلى refers معاً: اللقطة الثابتة من الخطوة 1 والملف mp3 من الخطوة 2. هذه هي اللقطة ب.

تستخدم المطالبة البنية المقسمة التي تم تدريب H3 عليها. subject_definitions يسمي من وماذا هي المراجع، detailed_description يحمل الحوار داخل علامات <d>[English] ...</d>، ويصف قسمي الصوت المزيج. إذا كانت أسماء الأقسام جديدة بالنسبة لك، فإن دليل مطالبة MiniMax H3 يغطي الهيكل الكامل. فقط ثلاثة حقول تهم للعمل الصوتي، وكلها هنا.

plaintext
1subject_definitions:
2<Subject 1> هو الرجل عند ميكروفون الراديو في <Picture 1>، في أواخر الثلاثينيات، سماعات رأس
3نصفها منزوع عن أذن واحدة، نيون ON AIR الأحمر خلف كتفه.
4<Picture 1> هو الإطار الافتتاحي للفيديو المستهدف.
5<Audio 2> هو مرجع جرس الصوت لـ <Subject 1>: صوت بث ذكر هادئ، منخفض، مغناطيسي.
6ارجع إلى الجرس فقط؛ لا تعيد استخدام كلماته.
7
8summary:
9[مرجع صورة + مرجع جرس صوت] لقطة مقربة واحدة مستمرة مدتها 10 ثوانٍ. <Subject 1>
10يلقي سطرين مباشرة في الميكروفون بجرس صوت <Audio 2>، بينما
11تتحرك الكاميرا ببطء إلى الداخل. حركة الفم، والنَفَس قبل كل سطر، وصوت الغرفة
12يتم توليدها معاً.
13
14detailed_description:
15تفتح اللقطة تماماً على <Picture 1>. تنجستن دافئ من يسار الكاميرا، نيون أحمر ينزف على
16خلاط الصوت في المقدمة، مطر على النافذة في الخلف. <Subject 1> يأخذ نَفَساً قصيراً،
17يميل بضع درجات نحو شاشة الرغوة، ويتحدث، <d>[English] إنها الثالثة صباحاً،
18وأنا أعرف بالضبط من لا يزال مستيقظاً.</d> بينما يتحدث، يتحرك فكه وشفتيه بشكل طبيعي مع
19كل مقطع؛ الانفجارات على "الثالثة" و"صباحاً" مرئية. يلقي نظرة سريعة على النص،
20ثم يعود إلى أعلى متجاوزاً العدسة، ويواصل، <d>[English] لذا دعنا نبقي هذا بيننا.</d>
21بالضبط عندما يتوقف صوته، تستقر شفتاه مغلقتين ويخرج الزفير من أنفه. في جميع الأنحاء،
22تنفذ الكاميرا حركة دفع بطيئة ومتعمدة واحدة؛ يومض النيون مرة واحدة، بشكل خافت، حوالي الثانية
23السابعة. لا يوجد نص على الشاشة.
24
25overall_soundscape:
26صوت قريب وجاف ومعالج بالكشك مع لمسة من تأثير القرب من الميكروفون. تحته:
27همهمة كهربائية منخفضة من المكتب، مطر ثابت على الزجاج، سيارة واحدة بعيدة تمر على
28الشارع المبلل، صرير ناعم للكرسي عندما يميل إلى الداخل، ونَفَس واحد مسموع قبل كل سطر.
29
30non_diegetic_music:
31كونتراباس جاز ليلي بطيء ومتفرق، هادئ جداً، تحت الصوت جيداً، يدخل حوالي الثانية
32الثانية ولا يرتفع أبداً فوق الحوار.
33

الإعدادات على minimax/h3/reference-to-video: الدقة 2K، المدة 10، نسبة العرض إلى الارتفاع 16:9، و refers يحمل كلا الملفين. الترتيب داخل المصفوفة لا يهم، فقط أن واحداً منهم على الأقل هو صورة أو فيديو. شريط تمرير المدة افتراضياً إلى 8، لذا قم بتحريكه، وقم بتبديل نسبة العرض إلى الارتفاع عن adaptive إذا كنت تريد الإطار الذي طلبته.

أربعة فخاخ للمعلمات، ثلاثة منها كلفتني مالاً. المفتاح هو ratio، وليس aspect_ratio، والحصول عليه خطأ يُرجع 400. أرسل duration دائماً بشكل صريح، لأن المخطط الافتراضي يقول 8 ولكن طلباً بدونه عاد كملف مدته 5 ثوانٍ. في نقطة النهاية هذه، إرسال image جنباً إلى جنب مع refers يكتمل، ويتم فوترته بالكامل، ويسقط واحداً منهما بصمت. وإذا مررت الصوت كـ URL بيانات base64، فعنونه بـ data:audio/mp3، وليس data:audio/mpeg. ماتت محاولتي الأولى على هذا بالضبط:

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed
2

هذا على الأقل مجاني، وهو ما يقودنا إلى الطريقة المفيدة لتعلم الحدود.

واجهة مولد فيديو بالذكاء الاصطناعي تظهر إدخال نص مطالبة وإخراج فيديو

ملعب MiniMax H3 reference-to-video على Atlas Cloud، مع mp3 في الفتحة 1 والإطار الأساسي في الفتحة 2 من المواد المرجعية، الدقة 2K، والمقطع النهائي يعرض في لوحة OUTPUT

MiniMax H3 reference-to-video على Atlas Cloud: المواد المرجعية تقرأ 2/9 مع mp3 في الفتحة الأولى والثابت في الفتحة الثانية، الدقة 2K، مقطع نهائي على اليمين. تم التقاط هذه اللقطة عند الإعداد الافتراضي للملعب البالغ 8 ثوانٍ، ولهذا السبب يقول زر التشغيل 1.12 دولار؛ لقطاتي أعلاه تم تشغيلها لمدة 10 ثوانٍ مقابل 1.40 دولار لكل منهما.

الخطوة 4: تشغيل لقطة التحكم في MiniMax H3 لمحاذاة الشفاه والصوت

غيّر مدخلاً واحداً وكل ذكر له. قم بإسقاط mp3 من refers بحيث تبقى الصورة فقط، احذف تعريف <Audio 2>، اقطع العبارة "بجرس صوت <Audio 2>" من الملخص، وقم بتغيير علامة القوس إلى [مرجع صورة]. لا شيء آخر يتحرك، وتبقى الإعدادات متطابقة: 2K، 10 ثوانٍ، 16:9.

هذا ما يجعلها لقطة تحكم بدلاً من محاولة ثانية. النموذج الآن ليس لديه مرتكز جرس، لذا فهو يخترع صوتاً من الوصف المكتوب ويحاذي الشفاه مع الصوت الذي اخترعه للتو. عادت كلتا اللقطتين بمدة 10.13 ثانية وتمت فوترتهما بمبلغ 1.40 دولار لكل منهما، إلى السنت.

WnfqR2I-a-8

الصوت قيد التشغيل. اللقطة أ بمفردها: نفس الإطار، نفس السطور، لا يوجد صوت مرجعي. الصوت هنا هو اختراع النموذج، والفم لا يزال يتبعه.

لقطتان، متغير واحد. هذه هي أرخص تجربة في هذه المقالة بأكملها والوحيدة التي تخبرك ما الذي تفعله خانة الصوت فعلياً.

الخطوة 5: كسر MiniMax H3 لمحاذاة الشفاه والصوت عن قصد

الخطوة الأخيرة مجانية، وتستحق القيام بها مرة واحدة حتى تتعرف على الفشل في الساعة 2 صباحاً.

ضع mp3 في refers ولا شيء غير ذلك. لا صورة، لا فيديو، مجرد صوت. ثم أرسل.

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "رجل عند ميكروفون راديو يتحدث سطرين في شاشة الرغوة.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'
12

هذا هو الجزء الذي يستحق المعرفة، لأنه ليس ما يوحي به المخطط. استدعاء الإرسال يُرجع HTTP 200 مع معرف مهمة عادي و "status": "processing"، لذا يعتقد عميل ساذج أنه عمل. بعد 23 مللي ثانية تكون المهمة ميتة:

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}
7

لم يظهر حقل price أبداً على هذا التنبؤ، لذا لم يكلف شيئاً. الدرس العملي يتعلق بالكود الخاص بك، وليس محفظتك: 200 عند الإرسال ليس نجاحاً. استقصِ المعرف، وتحقق من status قبل أن تفترض أن لديك مقطعاً.

أربع طرق أخرى لدفع MiniMax H3 لمحاذاة الشفاه والصوت إلى أقصى حد

اختبار اللقطتين هو أصغر تجربة مفيدة. إليك أين تذهب نفس الخانة بعد ذلك.

لقطة واحدة، عدة لغات. احتفظ بالإطار، احتفظ بالحركة، غيّر علامة اللغة داخل <d>...</d> وقم بتشغيلها مرة أخرى. يتبع الفم اللغة الجديدة بدلاً من القديمة، لأن الفم والصوت يخرجان من نفس الممر الأمامي. تسرد بطاقة النموذج دعماً مستقراً للحوار لـ 11 لغة: العربية، الصينية، الإنجليزية، الفرنسية، الألمانية، الإيطالية، اليابانية، الكورية، البرتغالية، الروسية والإسبانية، مع دعم المزيد بدرجات متفاوتة. هذان المقطعان هما نفس المقطع الترويجي مع مسارين صوتيين مختلفين، وقام MiniMax أيضاً بقص نسخة فرنسية ونسخة خالية من السرد من نفس الإعداد.

hj7ZId3KOKk

الصوت قيد التشغيل. النسخة الإنجليزية بالتعليق الصوتي: لقطة قريبة لرائد فضاء على كوكب بلون برتقالي مغبر، السرد والموسيقى التصويرية يصلان مع الصورة. العمل الترويجي هو نفس الحقول الثلاثة للمطالبة مع مشهد صوتي مختلف.

Hv62FGyBNPM

الصوت قيد التشغيل. النسخة اليابانية، إطاراً بإطار نفس المقطع الترويجي. لم يتم إعادة دبلجة أي شيء ولم تحدث جلسة VO منفصلة.

الغناء، مع لحن تمتلكه بالفعل. هذا هو المكان الذي يتوقف فيه الصوت المدخل المجاني عن كونه حاشية. قم بإسقاط لحن موجود أو مقطوعة موسيقية في refers بمدة 15 ثانية أو أقل، صف الأداء، وتؤدي الشخصية له. أنت لا تدفع مقابل الموسيقى التي تحضرها.

zui3Zw_UWnY

الصوت قيد التشغيل. فرقة تم قصها بمظهر كاميرا فيديو قديمة، خلف الكواليس إلى الأداء، مع المسار والصورة يصلان معاً. هذا هو الشكل الذي تريده معظم أعمال الفيديو الموسيقي فعلاً.

شخصان يتحدثان أصعب من واحد. المتحدث الواحد في لقطة قريبة هو الحالة السهلة، وهذا هو بالضبط سبب استخدام هذه المقالة لها. بالنسبة للحوار بين شخصيتين، قم بتسميتهما بشكل صريح كما يفعل مثال MiniMax الخاص، مع <Subject 1> (S1) و <Subject 2> (S2) مرفقين بكل سطر <d>، وتوقع إعادة التشغيل عندما يخطئ النموذج في الترتيب أو الإسناد. خصص تشغيلين لكل حوار ثنائي.

الأجواء بدون كلمة منطوقة. overall_soundscape هو حقل بمفرده، ويعمل بدون أي حوار على الإطلاق. مطر على الزجاج، صرير كرسي، همهمة ثلاجة، الغرفة نفسها. هذا يجعل نفس نقطة النهاية أداة ASMR وأجواء مشروعة، وهو الاستخدام الوحيد حيث لا يهم الفم أبداً.

حد واحد صادق من لقطاتي الخاصة: التوليد في نفس الممر يعني أن الفم والصوت متفقان، ولا يعني أن كل التفاصيل المادية في الإطار تتفق مع الصوت. السطور الطويلة المحشورة في مدة قصيرة، وتوجيه الأداء الغامض، والمشاهد متعددة المتحدثين كلها تؤدي إلى تدهور النتيجة. شاهد مقطعك قبل شحنه، بنفس الطريقة التي تشاهد بها لقطة من ممثل بشري.

ما كلفني MiniMax H3 لمحاذاة الشفاه والصوت فعلياً

كل رقم أدناه هو رسوم حقيقية على حساب حقيقي، تم سحبها بعد وقوعها. حقل price على التنبؤ يمتلئ متأخراً، لذا فإن الاستقصاء حتى completed غالباً ما يعود بلا شيء. أعد جلب المعرف للحصول على الرقم.

الخطوةالنموذجما تم تشغيلهتمت فوترته
1openai/gpt-image-2/text-to-imageإطار أساسي واحد، جودة عالية، 2048x11520.1745 دولار (مقتبس على زر التشغيل)
2minimax/speech-2.6-hd99 حرفاً، 6.19 ثانية من الصوت المرجعي0.01 دولار
3minimax/h3/reference-to-videoاللقطة ب، 10 ثوانٍ بدقة 2K، صورة + صوت في refers1.40 دولار
4minimax/h3/reference-to-videoاللقطة أ، 10 ثوانٍ بدقة 2K، صورة فقط1.40 دولار
5minimax/h3/reference-to-videoطلب صوت فقط، فشل بعد 23 مللي ثانية0.00 دولار
التجربة بأكملها، كلتا اللقطتينحوالي 2.98 دولار

ملاحظتان محاسبيتان، لأن الصدق أرخص من حاشية. عنوان URL لبيانات audio/mpeg الخاطئ في الخطوة 3 لم يكلف شيئاً أيضاً، حيث أعاد 400 عند الإرسال. الرفض مجاني، لكن الطلب جيد التكوين مع إدخال معطل ليس كذلك، لذا فإن عنوان URL مرجعي يعيد 404 بصمت سيظل يفوتيرك بالكامل. ولقطة الشاشة في الخطوة 3 هي تشغيل ثالث لـ H3 عند الإعداد الافتراضي للوحة البالغ 8 ثوانٍ، والذي تمت فوترته بمبلغ 1.12 دولار إضافي على الجدول. هذا التشغيل موجود لهذه المقالة، وليس للتجربة.

السلسلة القديمة، المسعرة في الجدول أعلاه، كانت حوالي 3.49 دولار للقطة واحدة مدتها 10 ثوانٍ بالإضافة إلى أمسية من المحاذاة اليدوية. كانت هذه لقطتان كاملتان مدتهما 10 ثوانٍ مع الصوت، واختبار A/B متحكم فيه، وطلبان مكسوران عن قصد، بأقل من ذلك.

ومع ذلك، فإن H3 هو الأداة الخاطئة للعديد من المهام التي سيحاول الناس تسليمها إليه، والبدائل أرخص.

ما تريده فعلاًالنموذج المناسبالسعرالسبب
صورة شخصية واحدة بالإضافة إلى ملف صوتي موجود، إلى رأس متحدثbytedance/avatar-omni-human-v1.50.12 دولار/ثانيةمصمم خصيصاً للصوت إلى فيديو، وطول المخرجات يتبع صوتك
مقطع نهائي يحتاج فمه إلى التحدث بلغة جديدةsync/lipsync-v30.22 دولار/ثانيةH3 لا يعدل التقديم الحالي الخاص بك، والتصحيح هو بالضبط وظيفة هذا النموذج
أرخص إصلاح ممكن للفم على رأس متحدثveed/lipsync0.013 دولار/ثانيةأرخص بعشر مرات تقريباً، ويلمس الفم فقط، وليس الأداء
لقطة كاملة موجهة، مع الجرس والأجواء والموسيقى التصويرية معاًminimax/h3/reference-to-video0.14 دولار/ثانيةالصورة والصوت يأتيان من ممر واحد، لذا فإن الأداء مصمم بدلاً من إصلاحه

إذا كنت تختار بين H3 وأقرب منافسيه في العمل على الشخصيات بدلاً من الصوت، فإن مقارنة Seedance 2.5 هي قراءة أفضل. وإذا كنت تتساءل عما إذا كانت الأوزان المفتوحة تجعل هذا مجانياً، فهي لا تجعله سريعاً: 2K لا يزال يأتي من جانب API، وتقارير المجتمع تضع تقديم 480p محلياً لمدة 10 ثوانٍ في دقائق وليس ثوانٍ على بطاقات المستهلك.

ملاحظة صادقة واحدة حول الأصوات والأغاني والحقوق

المجاني للتحميل ليس نفسه المجاني للاستخدام. أغنية لم تكتبها وصوت ليس لك هما إذنان منفصلان، ولا يتم منح أي منهما بواسطة API لا يفرض عليك رسوماً مقابل التحميل. استخدم تسجيلاتك الخاصة، أو الموسيقى المرخصة، أو صوتاً اصطناعياً قمت بتوليده بنفسك، وهو بالضبط ما تفعله الخطوة 2.

بشكل منفصل، تحمل الأوزان المجتمعية قيوداً إقليمية لا تغطي حالياً الاتحاد الأوروبي أو المملكة المتحدة أو كوريا الجنوبية أو الولايات المتحدة، مع قناة ترخيص رسمية مفتوحة بدلاً من ذلك. هذه قصة أطول، وهي مروية في دليل الأوزان المفتوحة MiniMax H3.

MiniMax H3 لمحاذاة الشفاه والصوت: الأسئلة الشائعة

هل يقوم MiniMax H3 لمحاذاة الشفاه والصوت حقاً بتوليد الصوت في نفس الممر، أم يتم دبلجته بعد ذلك؟

نفس الممر. يمر النص عبر H3-Encoder، والمرئيات عبر H3-Encoder بالإضافة إلى H3-VisualVAE، والصوت عبر H3-AudioVAE مستقل. يتنبأ H3-Omni-Transformer بشكل مشترك بلا تينات الفيديو والصوت، والتي يتم بعد ذلك فك تشفيرها بشكل منفصل إلى صورة وصوت ستيريو 32 كيلو هرتز. لا يتم وضع أي شيء في طبقات بعد ذلك، ولهذا السبب ينتمي الفم والنَفَس وصوت الغرفة إلى نفس اللقطة.

هل يمكنني إدخال أغنيتي أو صوتي في MiniMax H3 لمحاذاة الشفاه والصوت، وهل يكلف ذلك extra؟

نعم، ولا. يسرد جدول الدفع حسب الاستخدام من MiniMax الإدخال الصوتي لـ H3 كمجاني. التباين الذي يجب مراقبته هو الفيديو: يتم فوترة الفيديو المدخل حسب مدته بسعر المخرجات، 0.13 دولار لكل ثانية بدقة 2K، لذا فإن 15 ثانية من الفيديو المرجعي تكلف حوالي 1.95 دولار بينما 15 ثانية من الصوت المرجعي تكلف 0 دولار.

لماذا يرفض MiniMax H3 لمحاذاة الشفاه والصوت طلباً يحتوي فقط على صوت؟

لأن الصوت هو نوع المرجع الوحيد الذي لا يمكنه السفر بمفرده. يجب أن يكون مصحوباً بصورة أو فيديو واحد على الأقل. باقي الحدود، من مواصفات H3-Base-Ref2VA: حتى 9 صور، وحتى 3 مقاطع فيديو وحتى 3 مقاطع صوتية، كل مقطع فيديو أو صوت بين 2 و 15 ثانية، 15 ثانية إجمالاً لكل نوع، والحد الأقصى 12 ملفاً عبر جميع الأنواع في طلب واحد.

هل سيبقى MiniMax H3 لمحاذاة الشفاه والصوت طوال المقطع، أم فقط السطر الأول؟

بالنسبة لمتحدث واحد مع مساحة للتنفس، فإنه يبقى طوال المقطع بدلاً من أن يهبط على سطر واحد وينحرف. ثلاثة أشياء تكسره: حشر نص طويل في مدة قصيرة، وتوجيه الأداء الغامض أو المفقود، والمشاهد متعددة المتحدثين حيث يجب على النموذج أن يقرر من يتحدث ومتى. أعط كل سطر متحدثاً مسمى وثوانٍ كافية ليقوله.

هل يحتاج MiniMax H3 لمحاذاة الشفاه والصوت إلى إعادة دبلجة للغة أخرى؟

لا. غيّر علامة اللغة داخل علامة الحوار، من <d>[English] ...</d> إلى <d>[Japanese] ...</d>، وقم بتشغيل نفس المطالبة مرة أخرى. يتم توليد الفم مع الصوت الجديد، لذا فهو يطابق اللغة الجديدة بدلاً من القديمة. تسرد بطاقة النموذج دعماً مستقراً للحوار لـ 11 لغة.

هل هو أرخص لتشغيل MiniMax H3 لمحاذاة الشفاه والصوت محلياً؟

أرخص لكل مقطع، مكلف بكل طريقة أخرى. الأوزان مفتوحة، لكن تقارير المجتمع حول التشغيل المحلي على بطاقات مستهلك بسعة 16 جيجابايت تقيس تقديم 480p لمدة 10 ثوانٍ في دقائق، والاستضافة الذاتية تُقدم بطول جانب قصير 768، و 2K لا يزال يأتي من خطوة إعادة التوليد من جانب API. أضف الحدود الإقليمية في الترخيص المجتمعي ويبقى API المسار العملي للعمل النهائي.

أحدث النماذج

واجهة برمجية واحدة لكل وسائط الذكاء الاصطناعي.

استكشف جميع النماذج