Seedance 2.5 متاح الآن — لأول مرة على Atlas Cloud

لقد صنعت فيديو موسيقي MiniMax H3 من مقطع واحد مدته 32 ثانية مقابل 4.80 دولار. المسار الصوتي فاجأني.

أدخلت مقطعًا صوتيًا مدته 32 ثانية (هوك) في MiniMax H3 كمرجع صوتي مجاني، وحصلت على أربع لقطات متزامنة مع الإيقاع، ثم قمت بقص فيديو موسيقي حقيقي لـ MiniMax H3 بتكلفة 4.80 دولار. تتضمن التعليمات والفواتير.

محرر فيديو يعمل على وحدة تحكم بها عدة شاشات فيديو

غرفة مونتاج ليلية، ست شاشات تعرض ست لقطات مختلفة لنفس المغنية ذات الشعر الفضي. ست لقطات، فنانة واحدة، أغنية واحدة. تم إنشاؤها باستخدام openai/gpt-image-2/text-to-image.

يُنتج مستخدمو Suno حوالي 7 ملايين أغنية يوميًا، أي ما يعادل تقريبًا كتالوج Spotify كامل كل أسبوعين (TechCrunch، فبراير 2026). تقريبًا لن يكون لأيٍ منها صورة مرفقة. ليس لأن الصورة مستحيلة، ولكن لأن الطريق التقليدي يمر عبر أربع أدوات: إنشاء صور ثابتة، وتحريكها، وتشغيل تمرير مزامنة الشفاه بشكل منفصل، ثم إصلاح كل شيء في التحرير. كل خطوة تفقد الوجه، أو الملابس، أو الإيقاع.

لذا تخطيتُ الخطوات. أسقطتُ شريحة مدتها 8 ثوانٍ من الكورس مباشرةً في فتحة المرجع لنموذج فيديو وضغطت على "تشغيل". لم يفرض عليّ أي رسوم مقابل الصوت.

ثم قمت بتفكيك ملف mp4 النهائي للإجابة على السؤال الوحيد الذي لا يجيب عليه أحد على الإنترنت بشكل مباشر: هل الصوت الخارج من النموذج هو أغنيتي، أم شيء اخترعه يبدو مشابهًا فقط؟ قمت بقياسه. الإجابة لم تكن ما توقعته، وهي تغير كيفية قصك للشيء.

الخلاصات الرئيسية

  • الصوت المرجعي مجاني. MiniMax H3 يفرض رسومًا على الثواني الناتجة فقط. شرائحي المرجعية الأربع التي تبلغ 8 ثوانٍ أضافت 0.00 دولار إلى الفاتورة. الفيديو المرجعي هو المكلف.
  • 15 ثانية هي سقف لكل عملية إنشاء، وليس لكل مشروع. قطّع الأغنية، وصوّر شريحة واحدة لكل لقطة، ثم اربطها. مقطعي الذي تبلغ مدته 32 ثانية هو أربع عمليات إنشاء.
  • اكتب الهوك عند 120 نبضة في الدقيقة (BPM). الشريط الواحد يساوي بالضبط 2.000 ثانية، لذا فإن قيم duration بالثواني الكاملة لـ H3 تقع على خطوط الأشرطة دون أي تعديل يدوي. 8 ثوانٍ = 4 أشرطة.
  • الصوت الناتج هو مسارك، محاذٍ للعينة. قمت بقياس ارتباط شكل موجة قدره 0.892 عند تأخير صفري بين شريحة الإدخال الخاصة بي ومزيج الاستريو الذي سلمه H3. لم يتم إعادة إنشائه. لا تزال بحاجة إلى وضع الماستر مرة أخرى للقطع النهائي، لسبب مختلف (أدناه).
  • إجمالي الإنفاق الفعلي: 7.53 دولارًا عبر تسع عمليات إنشاء بما في ذلك العمليات الفاشلة. اللقطات الأربع التي دخلت في القطع النهائي بالإضافة إلى الأغنية والإطار الأساسي بلغت 4.80 دولارًا.

مقطع الفيديو الموسيقي MiniMax H3 الذي قمت بقصه من هوك واحد مدته 32 ثانية

شغّل الصوت. هذا هو أربع عمليات إنشاء منفصلة، تم ربطها بدون انتقالات، مع وضع الماستر الأصلي الذي تبلغ مدته 32 ثانية في الأعلى.

TfrOvWHf4ys

"MIRA"، 32 ثانية، 2560x1440، 24 إطارًا في الثانية. أربع عمليات إنشاء minimax/h3/reference-to-video مدة كل منها 8 ثوانٍ، بسعر 1.12 دولارًا لكل لقطة. دخلت الأغنية كصوت مرجعي وبتكلفة 0.00 دولار.

أربع عمليات إنشاء، أربعة عوالم إضاءة مختلفة تمامًا، وجه واحد. لم يتم لمس أي شيء بينهما.

أربع مناظر لامرأة ذات شعر فضي ترتدي طوقًا أحمر متوهجًا

أربعة إطارات من اللقطات الأربع تُظهر نفس المغنية على سطح مضاء بالنيون، طريق سريع صحراوي، استوديو أبيض، وخزان ماء أسود. إطار واحد تم سحبه من كل مقطع تم تسليمه. نفس الشعر، نفس القميص الشبكي، نفس القلادة LED الحمراء عبر المطر، الشمس المنخفضة، الإضاءة العالية المسطحة، وتحت الماء.


لماذا تفشل معظم محاولات مقطع الفيديو الموسيقي MiniMax H3 عند الثانية السادسة عشرة

ثلاثة أنماط فشل، كلها يمكن تجنبها.

الأول: التعامل مع 15 ثانية كحد للمشروع. يحد H3 عملية الإنشاء الواحدة بـ 15 ثانية. يقرأ الناس ذلك، ويستنتجون "لا توجد مقاطع فيديو موسيقية"، ويستسلمون. لكن مقطع الفيديو الموسيقي لم يكن أبدًا لقطة واحدة. المقطع الحقيقي يقص كل 4 إلى 8 ثوانٍ على أي حال. السقف فقط يجبرك على فعل ما كان سيفعله المحرر بغض النظر.

الثاني: وصف الإيقاع بالكلمات. "متفائل، نشيط، يرقص على الإيقاع" لا يعطي النموذج شيئًا يثبت عليه. يخترع إيقاعًا، وتهبط نقاط القطع لديك نصف إيقاع متأخرة إلى الأبد. تسليم الصوت الفعلي يزيل التخمين.

الثالث: ترك خزانة الملابس تتغير. كل لقطة تحتاج إلى نفس الصورة المرجعية ونفس صياغة خزانة الملابس، حرفيًا. تغيير "قميص شبكي أسود" إلى "قميص شبكي غامق" بين اللقطات ينتج شخصًا مختلفًا.

إليك ما تكلفك هاتان الطريقتان فعليًا:

 سلسلة الأدوات التقليدية الأربعةاستدعاء H3 المرجعي الفردي
أدوات لكل لقطةنموذج صورة، نموذج فيديو، أداة مزامنة شفاه، محرر فيديونقطة نهاية واحدة، ثم محرر فيديو في النهاية
الخطوات اليدوية لكل لقطة4 عمليات تسليم، 3 تصديرات ملفات1 إرسال
ما يثبت الشخصيةإعادة مطالبة يدوية وحظصورة مرجعية واحدة تُستخدم حرفيًا
الصورة والصوتيتم عرضهما بشكل منفصل، محاذاة لاحقًايتم إنشاؤهما في نفس المسار، استريو 32 كيلوهرتز
تكلفة كل لقطة مدتها 8 ثوانٍأربعة عدادات منفصلة1.12 دولارًا عند 2K، 0.80 دولارًا عند 768P

لنكون منصفين للطريق القديم: إنه ليس خيالًا. حصل المبدع الياباني Arata Fukoe على برونزية Project Odyssey مع مقطع فيديو موسيقي بالكامل بالذكاء الاصطناعي، وقد أصدرت كل من Queen و Linkin Park مقاطع فيديو رسمية مدعومة بالذكاء الاصطناعي. تلك السلاسل مرت عبر أربع أو خمس أدوات، وهو بالضبط الشيء الذي لا يملك فنان مستقل مع أغنية واحدة وقتًا له.

ما يشتريه الصوت المرجعي فعليًا لمقطع فيديو موسيقي MiniMax H3

هذا هو الجزء الذي يستحق الفهم قبل أن تنفق أي شيء.

يولد H3 الصورة والصوت في مسار واحد بدلاً من دبلجة الصوت على الإطارات النهائية. عندما تعطيه مسارًا مرجعيًا، فإن المسار ليس مجرد ملاحظة مزاجية. قارنت شريحة الإدخال الخاصة بي مقابل تيار الصوت داخل mp4 الذي تم تسليمه، على مستوى شكل الموجة، على مزيج أحادي 8 كيلوهرتز:

  • ارتباط الغلاف (Envelope correlation): 0.956 عند تأخير صفري
  • ارتباط شكل الموجة الخام عبر نافذة مدتها ثانيتان: 0.892 عند إزاحة عينة صفرية

هذا ليس نموذجًا يعيد إنتاج أغنية مشابهة. هذا هو ملفك، محاذٍ للعينة، مع الأجواء التي طلبها المطالبة (prompt) المضافة في الأعلى وجولة واحدة من إعادة ترميز AAC. للمقارنة، نفس القياس ضد لقطة تحكم تم إنشاؤها بدون صوت مرجعي عاد عند 0.26، وهو مستوى الضوضاء.

موجتان صوتيتان متطابقتان تقريبًا تظهران الإدخال الأزرق والإخراج الأحمر

شكل موجة شريحة الإدخال أعلاه، والصوت الذي سلمه H3 أدناه، محاذيان عند إزاحة صفرية. الأعلى: ملف mp3 الذي قمت بتحميله (8 ثوانٍ). الأسفل: تيار الصوت داخل mp4 الذي أعاده H3. نفس القمم، نفس المواضع، بدون إزاحة.

حدود الإدخال صارمة، ويتم تطبيقها في وقت الإرسال بدلاً من الصمت:

الإدخال المرجعيالحدالفوترة
الصورحتى 9مجاني على نقاط نهاية H3 لـ Atlas Cloud
مقاطع الفيديوحتى 3، كل منها 2-15 ثانيةيتم الفوترة بمعدل الإخراج
الصوتحتى 3، كل منها 2-15 ثانية، إجمالي 15 ثانية عبر جميع المقاطع0.00 دولار
الصوت فقطمرفوض، يحتاج إلى صورة واحدة أو فيديو على الأقللا ينطبق

اختبرت سقف الصوت الإجمالي عن قصد بإرسال ثلاث شرائح مدة كل منها 8 ثوانٍ في استدعاء واحد. فشل في 5.8 ثوانٍ مع invalid params, total audio duration 24138 ms exceeds 15000 ms ولم يتم فوترته. أخبار سارة: H3 لا يسقط الملف الإضافي بهدوء ويحاسبك على أي حال.

فخ آخر وقعت فيه قبل ذلك. إذا قمت بتمرير الصوت كعنوان URL بيانات base64، فإن نوع MIME يحدد الامتداد الذي يستنتجه API. data:audio/mpeg مرفوض مع audio format ".mpeg" not allowed. data:audio/mp3 يمر بسلاسة. ماتت أربعة إرسالات على هذا قبل أن ألاحظ، جميعها مجانية.


سير عمل مقطع الفيديو الموسيقي MiniMax H3، وما تكلفه كل ثانية

كل ما يلي يعمل من خلال مفتاح API واحد على Atlas Cloud، وهو المكان الذي قمت بتشغيل وفوترة كل شيء فيه. ثلاثة نماذج، علامة تبويب متصفح واحدة.

الخطوةالنموذجما يفعلهالسعر الذي تمت فوترته فعليًا
كتابة الهوكminimax/music-2.6أغنية كاملة من مطالبة أسلوبية وكلمات، mp3 حتى ~5 دقائق0.15 دولارًا لكل أغنية، ثابت
تثبيت الفنانopenai/gpt-image-2/text-to-imageإطار أساسي واحد ترثه كل لقطة0.1745 دولارًا عند جودة عالية، 2048x1152
تصوير كل لقطةminimax/h3/reference-to-videoصورة وصوت داخليان، مقطع مقفل على الإيقاع مع صوت ستيريو خارجي0.14 دولارًا/ثانية عند 2K، 0.10 دولارًا/ثانية عند 768P. الصوت الإدخال 0.00 دولارًا

ملاحظتان على هذا الجدول، لأن الأرقام المدرجة تكذب في كلا الاتجاهين. يُظهر GPT Image 2 حدًا أدنى قدره 0.009 دولارًا في الكتالوج؛ هذا هو أدنى مستوى للرمز (token)، وعرض عالي high حقيقي بدقة 2048x1152 يفوتير بـ 0.1745 دولارًا. يُظهر إدخال كتالوج H3 0.10 دولارًا، وهو فقط مستوى 768P؛ كل وظيفة 2K لمدة 8 ثوانٍ تمت فوترتها بـ 1.12 دولارًا بالضبط، وهو 0.14 دولارًا في الثانية.

إذا كنت تريد قفل الإطار الأول بدلاً من مراجع الموضوع، فإن [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) يأخذ نفس الأسعار، و [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) يغطي اللقطات النقية بالمطالبة.

التصحيح الجدير بالذكر: نسخة سابقة من هذه الخطة افترضت أنه كان عليك إحضار أغنيتك الخاصة لأنه لم يكن هناك مولد أغنية كاملة على المنصة. يوجد الآن واحد. minimax/music-2.6 يكتب المسار، لذا فإن السلسلة بأكملها، بما في ذلك الأغنية، تعمل في مكان واحد.


كيفية صنع مقطع فيديو موسيقي MiniMax H3، خطوة بخطوة

الخطوة 1: كتابة هوك عند 120 BPM وتقطيعه إلى شرائح لكل لقطة

اطلب 120 BPM صراحةً. عند 120 BPM، الشريط الواحد يساوي بالضبط 2.000 ثانية، لذا فإن قيم duration بالثواني الكاملة لـ H3 تهبط على خطوط الأشرطة مجانًا: 4s = شريطان، 6s = 3 أشرطة، 8s = 4 أشرطة، 10s = 5 أشرطة. تقع قصاتك على الداون بيت دون أن تلمس علامة واحدة.

النموذج: minimax/music-2.6. الإعدادات: format: mp3، sample_rate: 44100، bitrate: 256000، is_instrumental: false.

مطالبة الأسلوب:

plaintext
1Synth-pop عند 120 BPM بالضبط، كيك مستقيم four-on-the-floor،
2وسادات sidechained أنالوج ساطعة، غناء أنثوي رئيسي واضح يجلس في مقدمة المزيج،
3كورس ستيريو واسع، لا راب، حروف علة مفتوحة مستدامة، سينمائي وحزين قليلاً،
4ماستر جاهز للراديو

الكلمات:

plaintext
1[Chorus]
2Hold the line, hold the light
3I am running out of night
4Say my name into the rain
5And I will burn again

أعاد مسارًا مدته 70 ثانية في 75 ثانية مقابل 0.15 دولارًا. ثم راجعت الإيقاع بدلاً من الوثوق به، عن طريق تشغيل ارتباط ذاتي لحداثة البداية (onset-novelty autocorrelation) عبر الملف. أقوى تأخر عاد عند 0.500 ثانية بالضبط، وهو 120 BPM، ويبدأ شبكة الإيقاع عند 0.24 ثانية في الملف المفكوك بدلاً من الصفر. هذا الإزاحة مهمة: قص من 0.24 وكل شريحة تبدأ على داون بيت.

plaintext
1# ماستر 32 ثانية، يبدأ على الداون بيت عند 0.24 ثانية
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# أربع شرائح مدة كل منها 8 ثوانٍ، واحدة لكل لقطة، كل منها 4 أشرطة وأقل بكثير من حد 15 ثانية
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

إذا كان لديك بالفعل مسارك الخاص، فتخطَ هذه الخطوة تمامًا. هذه هي الحالة الطبيعية، وهي الأرخص.

الخطوة 2: تثبيت الفنان بإطار أساسي واحد من GPT Image 2

كل لقطة تشير إلى هذا الملف الفردي. أي شيء خاطئ هنا سيكون خاطئًا أربع مرات، لذا أنفق 0.17 دولارًا وانظر إليه بشكل صحيح.

النموذج: openai/gpt-image-2/text-to-image. الإعدادات: quality high ، size 2048x1152 (16:9).

plaintext
1لقطة موسيقية سينمائية، صورة نصفية. مغنية سينث-بوب أنثى شرق آسيوية تبلغ من العمر 25 عامًا
2ذات شعر فضي-أبيض قصير وغرة مستقيمة، وقميص شبكي أسود غير لامع، وقلادة LED حمراء رفيعة
3تتوهج على عظمة الترقوة، وقرط فضي واحد. تقف على سطح مبلل بالمطر في الليل
4تحمل ميكروفونًا كروم عتيقًا بالقرب من فمها. خلفها، لافتات نيون بألوان أرجوانية وسماوية
5غير واضحة، مطر ناعم يلتقطه ضوء خلفي قوي، بخار يتصاعد من فتحة تهوية.
6تم تصويرها على 35mm anamorphic، عمق ميدان ضحل، تدرج ألوان سماوي-أرجواني،
7حبيبات فيلم مرئية. وجهها حاد ومضاء بشكل متساوٍ بواسطة ضوء رئيسي ناعم من يسار الكاميرا.
8لا يوجد نص في أي مكان في الإطار.

امرأة ذات شعر فضي تحمل ميكروفونًا عتيقًا في مدينة نيوم ممطرة

الإطار الأساسي المُنشأ: مغنية ذات شعر فضي مع ميكروفون كروم على سطح نيوم مبتل بالمطر. الإطار الأساسي الذي ترثه كل لقطة لاحقة. تم إنشاؤه باستخدام openai/gpt-image-2/text-to-image، جودة عالية، 2048x1152، تمت فوترته بـ 0.1745 دولارًا.

واجهة مولد الصور بالذكاء الاصطناعي تظهر إعدادات الإدخال والإخراج المُنشأ

GPT Image 2 يشغل نفس المطالبة بالضبط في ملعب Atlas Cloud مع الإطار النهائي في لوحة الإخراج.

نفس المطالبة في الملعب: الحجم 16:9 عند 2048x1152، الجودة عالية، وزر التشغيل يقتبس 0.1745 دولارًا، وهو ما فوترني به API فعليًا. سعر 0.009 دولارًا في الكتالوج هو أدنى مستوى للرمز، وليس هذا. نفس المطالبة، بذرة مختلفة، لذا فإن هذا العرض ليس الملف الدقيق أعلاه.

كلمات خزانة الملابس في تلك المطالبة (شعر فضي-أبيض قصير، قميص شبكي أسود غير لامع، قلادة LED حمراء، قرط فضي) سيتم إعادة استخدامها حرفيًا في كل مطالبة أدناه. هذا التكرار هو آلية التناسق بأكملها. لا تقم بإعادة صياغتها.

الخطوة 3: تشغيل أول لقطة فيديو موسيقي MiniMax H3 مع صوت مرجعي مجاني

النموذج: minimax/h3/reference-to-video. الإعدادات: refers = الإطار الأساسي بالإضافة إلى slice-0.mp3، resolution: 2K، duration: 8، ratio: 16:9.

اضبط ratio صراحةً. الإعداد الافتراضي في الملعب هو adaptive، والنقطة النهائية تكون أكثر سعادة عندما تحدد الشكل الذي تريده.

plaintext
1لقطة فيديو موسيقي. المرأة في الصورة المرجعية تغني المسار المرجعي
2مباشرة في العدسة على سطح النيون المبلل، وهي تحمل الميكروفون الكروم عند
3فمها. تهبط على السطر الأول بقوة على الداون بيت، وعيناها مثبتتان على الكاميرا،
4ثم تميل رأسها إلى الخلف على النوتة المستدامة. حركة بطيئة إلى الأمام من صورة نصفية
5إلى لقطة قريبة ضيقة عبر الثماني ثوانٍ، انجراف يدوي صغير، خطوط المطر تعبر
6الضوء الخلفي القوي. تتبع حركات فمها أحرف العلة المغناة للصوت المرجعي
7بالضبط، إنها تغني، لا تتحدث. نفس الشعر الفضي-الأبيض القصير، نفس القميص الشبكي الأسود غير اللامع
8ونفس قلادة LED الحمراء المتوهجة كما في الصورة المرجعية. المشهد الصوتي: المسار المرجعي في ستيريو،
9بالإضافة إلى مطر خافت وهمهمة مدينة بعيدة منخفضة في المزيج.

7sPeYEe-xII

اللقطة 1، شغّل الصوت. 2560x1440، 8.00 ثانية بالضبط، 24 إطارًا في الثانية، استريو 32 كيلوهرتز. 345 ثانية من الإرسال إلى الملف، تمت فوترتها بـ 1.12 دولارًا. شاهد إمالة الرأس للخلف على النوتة المستدامة عند حوالي 5 ثوانٍ.

واجهة مولد الفيديو بالذكاء الاصطناعي تظهر إعدادات الإدخال والفيديو المُنشأ

ملعب reference-to-video مع الإطار الأساسي وشريحة الصوت المحملة والمقطع النهائي في لوحة الإخراج.

المواد المرجعية تقرأ 2/9: slice-0.mp3 في فتحة واحدة، والإطار الأساسي في الأخرى. الدقة 2K، المدة 8، وزر التشغيل يقتبس 1.12 دولارًا، وهو بالضبط 8 × 0.14 دولارًا. لاحظ القائمة المنسدلة لنسبة العرض إلى الارتفاع على adaptive، وهو الإعداد الافتراضي للصفحة؛ استدعاءات API الخاصة بي تضبط ratio على 16:9 صراحةً.

رقم واحد يستحق كتابته: duration: 8 سلم حاوية مدتها 8.00 ثوانٍ بالضبط. duration: 4 سلم 4.46 ثانية. إذا كنت تخطط للربط على خطوط الأشرطة، فابق على المدد التي تعود بالضبط.

الخطوة 4: تصوير ثلاثة عوالم أخرى دون فقدان الوجه

نفس الإطار الأساسي، نفس جملة خزانة الملابس، شريحة الصوت التالية. كل شيء آخر يتغير.

4a. طريق سريع صحراوي في الساعة الذهبية. refers = إطار أساسي + slice-8.mp3، 2K، duration: 8، ratio: 16:9.

plaintext
1لقطة فيديو موسيقي. نفس المرأة من الصورة المرجعية تقف على الخط الأوسط
2لطريق سريع صحراوي فارغ في الساعة الذهبية، بدون ميكروفون، وسترة جينز نيلي مفتوحة
3فوق نفس القميص الشبكي الأسود غير اللامع، والقلادة LED الحمراء لا تزال مضاءة. تتحرك
4شفاهها مع كلمات الكورس للمسار المرجعي في الريح بينما تتحرك الكاميرا للخلف
5منخفضة فوق الأسفلت. وميض حراري من الطريق، غبار يثار، ظلها يمتد طويلاً نحو
6العدسة، توهج anamorphic يعبر عند نقطة المنتصف. الشعر والوجه وخزانة الملابس
7مطابقة للصورة المرجعية. المشهد الصوتي: المسار المرجعي على ريح صحراء مفتوحة، واسع وجيد التهوية.

4XEki-v2vCU

اللقطة 2، شغّل الصوت. نفس الوجه، درجة حرارة لون معاكسة، والمسار المرجعي مُعاد مزجه تحت ريح مفتوحة. 332 ثانية، 1.12 دولارًا.

4b. استوديو أبيض لانهائي. refers = إطار أساسي + slice-16.mp3، 2K، duration: 8، ratio: 16:9.

plaintext
1لقطة فيديو موسيقي. نفس المرأة من الصورة المرجعية في استوديو أبيض لانهائي
2تحت ضوء عالٍ مسطح بدون ظلال، ترتدي معطف واق من المطر من الفينيل الأحمر اللامع
3فوق نفس القميص الشبكي الأسود غير اللامع، والقلادة LED الحمراء مرئية عند
4الياقة. ترقص أربعة أشرطة على المسار المرجعي، والشعر الفضي-الأبيض يتطاير مع كل
5دورة. إطار عريض ثابت، ثم تكبير حاد إلى لقطة متوسطة على الداون بيت الثاني.
6مربعات ورقية بيضاء صغيرة تتساقط مثل القصاصات عبر الثانيتين الأخيرتين.
7الوجه والشعر متطابقان مع الصورة المرجعية. المشهد الصوتي: المسار المرجعي، جاف وقريب،
8بالإضافة إلى صرير الأحذية على أرضية الاستوديو.

VAyqdkVpnm0

اللقطة 3، شغّل الصوت. الضوء المسطح بدون ظل هو أصعب مكان لإخفاء تبديل الوجه، وقد وبقى. 8.00 ثانية، 1.12 دولارًا.

4c. لقطة تحت الماء بدون مزامنة شفاه. refers = إطار أساسي + slice-24.mp3، 2K، duration: 8، ratio: 16:9.

plaintext
1لقطة فيديو موسيقي. نفس المرأة من الصورة المرجعية معلقة تحت الماء في
2خزان أسود، الشعر الفضي-الأبيض يطفو حولها، والقلادة LED الحمراء تتوهج عبر
3الماء، والقميص الشبكي الأسود يتموج ببطء. شعاع ضوء واحد قوي من الأعلى مباشرة؛
4فقاعات ترتفع أمام العدسة بالحركة البطيئة. تفتح عينيها على الداون بيت وتمد
5يدًا نحو السطح. إنها لا تغني وفمها يبقى مغلقًا. تدور الكاميرا ثلاثين درجة
6حولها عبر اللقطة. الوجه مطابق للصورة المرجعية. المشهد الصوتي: المسار المرجعي يُسمع من
7فوق السطح، مكتوم ومنخفض التمرير، مع فقاعات عابرة.

fibdweUMRpY

اللقطة 4، شغّل الصوت. تم تنفيذ التعليمات "إنها لا تغني وفمها يبقى مغلقًا"، وهو الجزء المفيد: الصوت المرجعي يدفع التوقيت، وليس أداءً إلزاميًا. 329 ثانية، 1.12 دولارًا.

الخطوة 5: تشغيل لقطة التحكم، مع فتحة الصوت فارغة

نفس المطالبة كما في الخطوة 3، كلمة بكلمة. التغيير الوحيد: refers يحمل الصورة ولا شيء غير ذلك. 768P، duration: 8.

هذا المقطع الواحد يشرح الآلية بأكملها أفضل من أي فقرة. استمع إليه مقابل الخطوة 3.

FAoPplGmKJc

لقطة التحكم. نفس المطالبة، بدون صوت مرجعي، 1344x768، 8.00 ثوانٍ، 200 ثانية، 0.80 دولارًا. كتب H3 الموسيقى التصويرية الخاصة به، والأداء هو "شخص ما يغني" بشكل عام بدلاً من هذه الكلمات.

بالقياس على ماستر الخاص بي، سجل صوت التحكم 0.26 ارتباط غلاف. سجلت الخطوة 3 0.956. هذه الفجوة هي ما تشتريه فتحة الصوت المجانية.

الخطوة 6: كسر مزامنة الشفاه عن قصد

كل نموذج له سقف للمقاطع الصوتية. العثور على سقفك يكلف 0.40 دولارًا.

قمت بإنشاء مسار راب منفصل بسرعة مضاعفة (minimax/music-2.6 مرة أخرى، 0.15 دولارًا)، وقصصت شريحة مدتها 4 ثوانٍ تحتوي على حوالي ستة مقاطع لفظية في الثانية، وأدخلتها في نفس إعداد السطح عند 768P، duration: 4.

plaintext
1لقطة فيديو موسيقي. المرأة في الصورة المرجعية تغني راب المسار المرجعي
2مباشرة في العدسة على سطح النيون المبلل، وهي تحمل الميكروفون الكروم عند
3فمها، وتقدم كل مقطع لفظي من الآية السريعة بسرعة مضاعفة. لقطة قريبة متوسطة ثابتة،
4انجراف يدوي طفيف، خطوط المطر في الضوء الخلفي القوي. تتبع حركات فمها
5المقاطع المغناة للراب من الصوت المرجعي بالضبط. نفس الشعر الفضي-الأبيض القصير، نفس القميص الشبكي الأسود غير اللامع
6ونفس قلادة LED الحمراء المتوهجة كما في الصورة المرجعية. المشهد الصوتي: المسار المرجعي في ستيريو
7بالإضافة إلى مطر خافت.

jiQVCjOCbKg

اختبار الضغط، شغّل الصوت. 1344x768، 4.46 ثانية، 192 ثانية، 0.40 دولارًا. يظل الفم مشغولاً وعلى الإيقاع، لكنه يتوقف عن حل الحروف الساكنة الفردية ويستقر في دورة فتح-إغلاق متكررة. تحصل الأسطر المغناة على أشكال حروف علة مميزة؛ هذا لا يفعل.

قراءتي الصادقة من الملفات التي تم تسليمها: أحرف العلة المغناة المستدامة هي حيث يكون عمل فم H3 مقنعًا حقًا، والحروف الساكنة الكثيفة للراب هي حيث يتدهور إلى حركة معقولة. خطط للقطات القريبة حول الأسطر المغناة وضع الأشرطة السريعة على لقطات b-roll. هناك مزيد من التفاصيل حول الفرق بين الكلام والغناء في تحليل مزامنة الشفاه والصوت.

الخطوة 7: الربط، وكتم الصوت، ووضع الماستر مرة أخرى على مقطع الفيديو الموسيقي MiniMax H3 الخاص بك

أربعة مقاطع مدة كل منها 8.00 ثوانٍ بالضبط تتسلسل إلى 32.00 ثانية بالضبط، وهو 16 شريطًا عند 120 BPM. لا قص.

plaintext
1# 1. قم بإزالة الصوت من كل مقطع
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. تسلسل بترتيب الأشرطة (4 × 8s = 32s = 16 شريطًا @ 120 BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. وضع الماستر الأصلي مرة أخرى
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

لماذا تكبد عناء كتم الصوت، إذا كان النموذج يعيد مسارك بالفعل؟ لأن مزيج الاستريو لكل مقطع يحمل الأجواء التي طلبتها مطالبة ذلك المقطع: المطر على اللقطة 1، ريح الصحراء على اللقطة 2، مرشح تحت الماء منخفض التمرير على اللقطة 4. جميل لكل لقطة، غير متماسك عبر القطع. الماستر يعطيك مزيجًا مستمرًا واحدًا بمعدل بت كامل بدون إعادة ترميز لكل لقطة. H3 يسلم تزامن الأداء. الماستر الخاص بك يسلم الأغنية.


أربعة أشكال مختلفة لوصفة مقطع الفيديو الموسيقي MiniMax H3

قصص الإصدار العمودي. اضبط ratio: 9:16 وستحصل على شريحة Spotify Canvas أو شريحة Shorts من نفس الإطار الأساسي ونفس الشرائح. عادت بدقة 768x1344 حقيقية، لذا على عكس القائمة المنسدلة للنسبة في الملعب، فإن قيمة ratio في API تثبت. حلقات Canvas صامتة حسب التصميم، لذا يتم إرسال هذا كـ GIF.

امرأة ذات شعر فضي تحمل ميكروفونًا على سطح مدينة ممطرة

شريحة حلقة عمودية 9:16 من نفس الفنانة على سطح النيون. نفس الإطار الأساسي، نفس الشريحة المرجعية، ratio: 9:16 عند 768P مقابل 0.80 دولارًا. تجعد واحد صادق: طلبت "لا تغني" وحصلت على غناء على أي حال. مع صوت في فتحة المرجع، يفوز الصوت بالجدال. إذا كنت تريد مؤديًا صامتًا، فقدم شريحة موسيقية.

فيديو مرجعي بدلاً من صورة مرجعية. يمكنك تمرير ما يصل إلى ثلاثة مقاطع فيديو مرجعية إلى H3 لحمل الحركة والتأطير بدلاً من وصفها. راقب العداد: الفيديو المرجعي يتم فوترته بمعدل الإخراج، بينما الصوت المرجعي مجاني. هذا التفاوت هو أغلى حقيقة تسعيرية على هذه النقطة النهائية.

مرئيات b-roll خالصة. تخلص من المؤدي تمامًا. قدم صورة منتج، أو غلاف ألبوم، أو لوحة نسيج بالإضافة إلى شريحة الصوت، واطلب حركة الكاميرا فقط. لا وجه للحفاظ عليه، لا مزامنة شفاه لكسرها، ويمكنك تصوير كل شيء عند 768P.

مسودة رخيصة، نهائي مكلف. 768P هو 0.10 دولارًا/ثانية مقابل 0.14 دولارًا/ثانية لـ 2K، وكلاهما يعود باستريو 32 كيلوهرتز متطابق، لذا فإن الأداء الذي تحكم عليه هو نفسه. التوفير ليس في اللقطات المحفوظة، بل في المرفوضة: كل لقطة مأخوذة فاشلة مدتها 8 ثوانٍ تكلف 0.80 دولارًا بدلاً من 1.12 دولارًا. اعمل عند 768P حتى تصبح اللقطة صحيحة، ثم ادفع 1.12 دولارًا مرة واحدة. في لقطة تتطلب ثلاث محاولات، هذا هو 2.72 دولارًا بدلاً من 3.36 دولارًا. مزيد من التفاصيل حول فرق المستوى في مقارنة 768P مقابل 2K، وحول المدى الذي يمكن أن يمتد إليه مقطع واحد في دليل طول المقطع.


ما كلفه مقطع فيديو موسيقي MiniMax H3 كامل فعليًا

كل سطر أدناه هو رقم فوترة فعلي تم سحبه من سجل التنبؤ بعد الانتهاء، وليس سعرًا مدرجًا.

البندالنموذج والإعداداتالفوترة
الهوك، أغنية 70 ثانيةminimax/music-2.6، mp3 44.1 كيلوهرتز0.15 دولارًا
الإطار الأساسي للفنانopenai/gpt-image-2/text-to-image، عالي، 2048x11520.17 دولارًا
اللقطة 1، سطح النيونminimax/h3/reference-to-video، 2K، 8 ثوانٍ1.12 دولارًا
اللقطة 2، طريق سريع صحراوينفسه، 2K، 8 ثوانٍ1.12 دولارًا
اللقطة 3، الاستوديو الأبيضنفسه، 2K، 8 ثوانٍ1.12 دولارًا
اللقطة 4، تحت الماءنفسه، 2K، 8 ثوانٍ1.12 دولارًا
المجموع الفرعي للفيديو النهائي 4.80 دولارًا
مسبار التحقق768P، 4 ثوانٍ0.40 دولارًا
لقطة التحكم، بدون صوت768P، 8 ثوانٍ0.80 دولارًا
مسار الراب لاختبار الضغطminimax/music-2.60.15 دولارًا
اختبار ضغط مزامنة الشفاه768P، 4 ثوانٍ0.40 دولارًا
قص Canvas عمودي768P، 8 ثوانٍ، 9:160.80 دولارًا
الصورة الرئيسية لهذه المقالةopenai/gpt-image-2/text-to-image، عالي0.17 دولارًا
اختبار تجاوز الحد، 24 ثانية من الصوتمرفوض عند الإرسال0.00 دولارًا
أربعة إرسالات مع نوع MIME صوت خاطئمرفوض عند الإرسال0.00 دولارًا
الصوت المرجعي، 4 × 8 ثوانٍإدخال مجاني0.00 دولارًا
إجمالي الإنفاق 7.53 دولارًا

هذا هو 9.00 دولارًا لكل دقيقة مكتملة عند 2K على اللقطات التي دخلت القطع، قبل أي من أخطائي. تم التصوير بالكامل عند 768P نفس الدقيقة تكلف 6.61 دولارًا. طاقم تصوير فيديو موسيقي بشري لا يقتبس أيًا من هذين الرقمين.

ملاحظتان تشغيليتان إذا كنت تضع ميزانية لقطعة أطول. حالات الرفض عند الإرسال مجانية، لذا فإن المعلمات السيئة تكلفك وقتًا ولا شيء غير ذلك. وحقل price في التنبؤ يتم تعبئته بتأخير، لذا استفسر عن معرف الطلب مرة أخرى بعد تنزيل الملفات إذا كنت تريد فاتورة حقيقية بدلاً من null.


من أغنيته، من وجهه: ما يجب التحقق منه قبل النشر

باختصار، لأنه مهم ولا يحتاج إلى وعظ.

تحتاج إلى حقوق المسار المرجعي. الإدخال المجاني لا يعني التخليص المجاني. تغذية أغنية منفردة صدرت تجاريًا كصوت مرجعي، ثم نشر ما يخرج، هو الطريق السريع إلى إزالة المحتوى. تسجيلك الخاص، أو مسار كلفته، أو شيء أنشأته هو أمر جيد.

لا تقم ببناء الإطار الأساسي من وجه فنان حقيقي. آلية التناسق هنا جيدة جدًا في الحفاظ على الوجه عبر اللقطات، وهو بالضبط سبب كون توجيهها إلى شخص حقيقي فكرة سيئة.

الأوزان المفتوحة والوصول عبر API هما ترخيصان مختلفان. نشر MiniMax أوزان H3 على Hugging Face في أغسطس 2026، ويستبعد ترخيص المجتمع الخاص به حاليًا الاتحاد الأوروبي والمملكة المتحدة وكوريا الجنوبية والولايات المتحدة، مع قناة ترخيص رسمية مفتوحة لتلك المناطق. هذا القيد يتعلق بتشغيل الأوزان بنفسك. استدعاء النموذج من خلال API مستضاف هو علاقة خدمة ولا يضعك تحت ترخيص الأوزان. من الجيد معرفة الموقف الذي أنت فيه قبل أن تفترض أيًا من الاتجاهين.

للحصول على نظرة أوسع حول مكانة H3 مقارنة بالبدائل، يوجد مقارنة Seedance 2.5 و دليل بنية المطالبة. للسياق حول سبب كونها تستحق العناء على الإطلاق: على لوحة متصدرين تحرير الفيديو التي تسجل النماذج مع الصوت، يحتل H3 حاليًا المركز الأول عند 1,126 Elo، متقدمًا على Gemini Omni Flash عند 1,119 و Dreamina Seedance 2.0 عند 1,027 (Artificial Analysis، تم التحقق في 10 أغسطس 2026). تلك النتائج تتغير مع الأصوات، لذا تعامل معها كلمحة.


مقطع فيديو موسيقي MiniMax H3: الأسئلة الشائعة

هل يمكن لمقطع فيديو موسيقي MiniMax H3 واحد أن يمتد لثلاث دقائق كاملة؟

ليس في عملية إنشاء واحدة. استدعاء واحد يحد عند 15 ثانية. لكن هذا هو سقف لكل عملية إنشاء، وليس لكل مشروع. فيديو مدته ثلاث دقائق بمعدل 8 ثوانٍ لكل لقطة هو 23 عملية إنشاء، أي حوالي 25.76 دولارًا عند 2K، وكل واحدة تهبط على خط الشريط إذا كان مسارك عند 120 BPM. قطّع، وصوّر، واربط، وضع الماستر مرة أخرى.

هل يستخدم مقطع فيديو موسيقي MiniMax H3 أغنيتي الفعلية، أم يعيد النموذج إنشاء الصوت؟

يستخدم أغنيتك الفعلية. قمت بقياس ارتباط شكل موجة خام قدره 0.892 عند إزاحة عينة صفرية بين ملف mp3 الذي تبلغ مدته 8 ثوانٍ الذي قمت بتحميله وتيار الصوت داخل mp4 الذي تم إرجاعه، مع الأجواء التي طلبها المطالبة المضافة في الأعلى. لقطة تحكم تم إنشاؤها بدون صوت مرجعي سجلت 0.26 مقابل نفس الماستر. لا يزال يجب عليك وضع الماستر الخاص بك مرة أخرى على التسلسل النهائي، لأن كل مقطع يحمل أجواءه الخاصة لكل لقطة وترميز AAC الخاص به، والتي لا تنجو من القطع بشكل نظيف.

هل تغذية أغنية في مقطع فيديو موسيقي MiniMax H3 تكلف extra؟

لا. شرائحي المرجعية الأربع التي تبلغ 8 ثوانٍ أضافت 0.00 دولارًا إلى فاتورة لقطة بقيمة 4.48 دولارًا. الفيديو المرجعي هو الذي يجب مراقبته، لأنه يتم فوترته بمعدل الإخراج. الحدود هي ثلاثة مقاطع صوتية، كل منها من 2 إلى 15 ثانية، إجمالي 15 ثانية، ولا يمكن أن يكون الصوت هو المرجع الوحيد أبدًا.

ما مدى جودة مزامنة شفاه MiniMax H3 للغناء مقارنة بالكلام؟

أحرف العلة المغناة المستدامة هي نقطة قوته: أشكال فم مميزة، وإمساك يتطابق مع النوتة، والإمالة للخلف على نوتة طويلة تقرأ كأداء وليس كحلقة. التسليم الكثيف هو حيث يستسلم. اختبار الراب الخاص بي بستة مقاطع لفظية في الثانية حافظ على الإيقاع لكنه توقف عن حل الحروف الساكنة ووقع في دورة فتح-إغلاق متكررة. ضع الأشرطة السريعة على لقطات b-roll.

كيف أحافظ على نفس الوجه عبر كل لقطة من مقطع فيديو موسيقي MiniMax H3؟

ثلاثة أشياء، كلها مملة. صورة مرجعية واحدة يُعاد استخدامها في كل استدعاء، ولا يتم إعادة إنشائها أبدًا. نفس صياغة خزانة الملابس منسوخة حرفيًا بين المطالبات، وليس إعادة صياغتها. وشرط صريح "مطابق للصورة المرجعية" في كل مطالبة. لقطاتي الأربع عبرت المطر، والشمس المنخفضة، والإضاءة العالية المسطحة، وتحت الماء دون أي انحراف.

كم تكلفة مقطع فيديو موسيقي MiniMax H3 لكل دقيقة مكتملة؟

9.00 دولارًا لكل دقيقة مكتملة عند 2K، بناءً على فاتورتي الحقيقية البالغة 4.80 دولارًا لقص مدته 32 ثانية. تم التصوير بالكامل عند 768P، نفس الدقيقة تكلف 6.61 دولارًا، و 768P يسلم نفس استريو 32 كيلوهرتز، لذا فإن الأداء الذي تحكم عليه هو متطابق. قم بتشغيل المرفوضات عند 0.80 دولارًا وادفع 1.12 دولارًا فقط على اللقطة التي تنجو من التحرير.

أحدث النماذج

واجهة برمجية واحدة لكل وسائط الذكاء الاصطناعي.

استكشف جميع النماذج