Seedance 2.5 متاح الآن — لأول مرة على Atlas Cloud

مولّد فيديو الأنمي MiniMax H3: 15 ثانية، ونسبة 4:3، وبطاقة العنوان التي أفسدها Veo 3.1

مولّد فيديو الأنمي MiniMax H3 مقابل Veo 3.1 على نفس الإطار المفتاحي. H3 يعمل من 4 إلى 15 ثانية وست نسب أبعاد، بينما Veo يقتصر على 8 ثوانٍ ونسبتين فقط. حوار ياباني، 9 مراجع، تشغيلات حقيقية.

طوال الصيف، كان تغذيتي عبارة عن نفس الفيديو في حلقة مكررة. لاعبو كأس العالم يُعاد رسمهم كأبطال شونن. ديكتاتور. قبطان قراصنة. معلم متمرّس يظهر في آخر أربع ثوانٍ. ملايين المشاهدات لكل منشور، والقصة تتحدّث بعد كل مباراة تقريبًا.

لا أحد يصنع تلك المقاطع يكتب منشورات معايير. إنهم يختارون نموذجًا، يحرقون الرصيد، ويُصدرون قبل انطلاق المباراة التالية.

لذا أخذت إطارًا رئيسيًا واحدًا للأنمي وموجهًا واحدًا، واختبرت MiniMax H3 كمُولّد فيديو أنمي ضد Veo 3.1، كلاهما مدفوعان إلى أقصى إعداداتهما على مدخلات متطابقة.

أول ما انكسر لم يكن جودة الصورة. كان قائمة منسدلة. Veo 3.1 يتوقف عند 8 ثوانٍ ويقدم نسبتي عرض إلى ارتفاع فقط. لقطة تثبت على وجه، وحركة كاميرا سريعة تتبع الكرة، ثم تسمح بظهور بطاقة عنوان لا تتناسب مع 8 ثوانٍ. لم تتح لها الفرصة أبدًا للفشل في الجودة.

الاستنتاجات الرئيسية

  • تعداد duration في Veo 3.1 هو [4, 6, 8] وتعداد aspect_ratio هو [16:9, 9:16]. MiniMax H3 يدير أي ثانية كاملة من 4 إلى 15 ويقدم 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. عدم وجود 4:3 في Veo يعني عدم وجود إطار OVA الرجعي على الإطلاق.
  • بطاقة نموذج H3 تسرد 11 لغة حوار ثابتة أصلاً واليابانية واحدة منها. يتم توليد الصوت والصورة معًا بمعدل 32 كيلوهرتز ستيريو، وليس دبلجة لاحقة.
  • حزم المرجع ليست متقاربة: H3 يأخذ حتى 9 صور بالإضافة إلى 3 مقاطع فيديو و3 مقاطع صوتية (12 ملفًا كحد أقصى). نقطة نهاية المرجع في Veo 3.1 تأخذ 3 صور، وبمجرد استخدامها ينهار duration إلى [8] فقط.
  • مصيدتان تدمران الاختبارات بصمت: API Veo يجعل generate_audio افتراضيًا false و resolution افتراضيًا 720p، و ratio في H3 للنص إلى فيديو افتراضيًا 1:1. اتركها كما هي وستقارن مقطعًا صامتًا بدقة 720p بمقطع مربع.
  • يحتفظ Veo 3.1 بشيئين ليسا لدى H3 على الإطلاق: seed و negative_prompt. بالنسبة للأنمي ثنائي الأبعاد، هذا الثاني مهم حقًا، وسأوضح أين.

MiniMax H3 مُولّد فيديو الأنمي ضد Veo 3.1، نفس الإطار جنبًا إلى جنب

شخصية أصلية واحدة. إطار رئيسي واحد. موجه واحد، منسوخ حرفًا بحرف في كلا النموذجين. كل شيء آخر بأقصى حد لكل جانب.

MiniMax H3، صورة إلى فيديو، 2K، 8 ثوانٍ، صوت أصلي. شغّل الصوت: حشد الجماهير، ضرب الكرة والصراخ الياباني تم توليدهم في نفس مرور الصورة. تم التوليد باستخدام minimax/h3/image-to-video على Atlas Cloud.

Veo 3.1، صورة إلى فيديو، 1080p، 8 ثوانٍ، تم تشغيل generateaudio يدويًا، بالإضافة إلى negativeprompt يحافظ على الخطوط المسطحة. نفس الإطار الأول، نفس الكلمات. تم التوليد باستخدام google/veo3.1/image-to-video على Atlas Cloud.

كلاهما يرسم بشكل جميل. لقطة Veo الواسعة للضربة، مع خطوط تأثير مرسومة يدويًا وتأثير صوت مانغا يطفو في الهواء، جميلة حقًا. هذه هي نقطة البداية الصادقة، ولهذا السبب بقية هذه المقالة تدور حول المعلمات واتباع التعليمات بدلاً من الأجواء.

لماذا تفشل معظم اختبارات MiniMax H3 كمُولّد فيديو أنمي ضد Veo 3.1

حدث شيئان في وقت واحد هذا الصيف.

أصبح الأنمي التنسيق الأعلى حجمًا في فيديو الذكاء الاصطناعي. تمت إعادة كتابة كأس العالم 2026 كبطولة شونن، مع لاعبين يُصوّرون كديكتاتور، قبطان قراصنة، جنرال بحري ومعلم، وقصص "تتطور بعد كل مباراة تقريبًا" عبر TikTok وInstagram وX وYouTube (Complex، يوليو 2026).

وشُحن MiniMax H3 بأوزان مفتوحة. وصل موضوع ComfyUI في اليوم الأول إلى 330 نقطة و95 تعليقًا، مع نشر أشخاص لأرقام محلية حقيقية في غضون ساعات (Hacker News، أغسطس 2026).

اجمع بين هذين وستتوقع كومة من مقارنات الأنمي. لا يوجد أي منها تقريبًا، لأن معظم الاختبارات تُبنى بشكل خاطئ بإحدى أربع طرق.

يقارنون الصور، وليس القيود. لقطات الأنمي هي توقيت. حركة كاميرا سريعة إلى بطاقة عنوان هي مشكلة مدة قبل أن تكون مشكلة عرض.

ينسون أن API Veo صامت افتراضيًا. على API، generate_audio هو false و resolution هو 720p. الكثير من منشورات "Veo ليس لديه صوت في الأنمي" هي مجرد شخص لم يقلب منطقية.

ينسون أن H3 للنص إلى فيديو هو مربع افتراضيًا. ratio افتراضيًا 1:1، وليس 16:9. قم بتشغيل موجه أنمي t2v دون تعيينه وستحصل على مقطع مربع واستنتاج مشوش.

يختبرون بموجهات واقعية. "سينمائي، إضاءة حجمية، عمق مجال ضحل" هي بالضبط المفردات التي تسحب النموذج ثنائي الأبعاد نحو تظليل العرض ثلاثي الأبعاد. وضع الفشل في الأنمي ليس الضبابية. إنه البلاستيك.

الإعدادات الثلاثة التي تحدد اختبار الأنمي قبل أن تضغط على تشغيل

قبل أي شيء آخر، اضبط هذه على كلا الجانبين أو المقارنة باطلة.

الإعدادMiniMax H3Veo 3.1ماذا يحدث إذا تخطيته
الصوتيتم توليده مع الصورة، دائمًا قيد التشغيلgenerate_audio افتراضيًا falseيعيد Veo مقطعًا صامتًا ويبدو أسوأ مما هو عليه
شكل الإطارratio افتراضيًا 1:1 للنص إلى فيديوaspect_ratio افتراضيًا 16:9يسلمك H3 مقطع أنمي مربع لا يمكنك استخدامه
الدقةافتراضيًا 2Kافتراضيًا 720pتقارن 2K مقابل 720p وتسميها فجوة جودة

ورقة مواصفات MiniMax H3 ضد Veo 3.1 للأنمي: الطول، النسبة، الصوت، المراجع

سحبت مخططات الإدخال المباشرة لكلا النموذجين بدلاً من الثقة في أي منشور إطلاق. كل قيمة أدناه هي تعداد يمكنك قراءته بنفسك على صفحات النموذج، وليس انطباعًا.

الجدول 1: MiniMax H3 ضد Veo 3.1، المعلمات التي تحدد لقطة الأنمي

MiniMax H3Veo 3.1
المدةمن 4 إلى 15، كل ثانية كاملة (الافتراضي 8)4، 6، 8 (الافتراضي 8)
نسب العرض إلى الارتفاع21:9، 16:9، 4:3، 1:1، 3:4، 9:1616:9، 9:16
النسبة الافتراضية (نص إلى فيديو)1:0116:09
الدقة768P، 2K (الافتراضي 2K)720p، 1080p، 4k (الافتراضي 720p)
الصوتيتم توليده بشكل مشترك، 32 كيلوهرتز ستيريوgenerate_audio، الافتراضي false
لغات الحوار الأصلية11 لغة مستقرة، بما في ذلك اليابانيةلم يتم نشرها كقائمة مستقرة
حزمة المرجعحتى 9 صور، 3 فيديوهات، 3 مقاطع صوتية، 12 ملفًا إجمالاً3 صور
المدة عند استخدام المراجعلا تزال من 4 إلى 15تنهار إلى 8 فقط
seedغير متوفرمتوفر
negative_promptغير متوفرمتوفر
الأوزانقابلة للتنزيلمغلقة

المدة، النسبة، الدقة، الصوت وحدود المرجع مقروءة من المخططات الحية على صفحات MiniMax H3 image-to-video، H3 text-to-video، H3 reference-to-video، Veo 3.1 image-to-video و Veo 3.1 reference-to-video. سقف 9 صور و12 ملفًا وقائمة 11 لغة حوار تأتي من بطاقة نموذج MiniMax H3 (Hugging Face، أغسطس 2026).

الآن لوحات النتائج، لأنها تقول شيئًا مختلفًا عن ورقة المواصفات وكلاهما مهم.

الجدول 2: تصويت الجمهور Elo وسعر القائمة في الدقيقة، لقطة 7 أغسطس 2026

النموذجنص إلى فيديو (مع الصوت)صورة إلى فيديو (مع الصوت)$/دقيقة
Gemini Omni Flash1,244 (#1) ±71,191 (#2) ±9$6.00
MiniMax H31,238 (#2) ±91,190 (#3) ±10$7.80
Dreamina Seedance 2.0 720p1,224 (#3) ±61,198 (#1) ±7$9.07
Kling 3.0 1080p (Pro)1,111 (#7) ±6غير مدرج في العشرة الأوائل$20.16
Veo 3.11,093 (#11) ±71,085 (#10) ±7$24.00
Veo 3.1 Fast1,091 (#14) ±6غير مدرج في العشرة الأوائل$9.00
Veo 3.1 Lite1,089 (#15) ±7غير مدرج في العشرة الأوائل$4.80

أرقام Elo والأسعار من Artificial Analysis Video Arena (Artificial Analysis، أغسطس 2026). هذه أصوات جمهور متجددة وتتحرك. عمود $/دقيقة هو تقدير نموذجي موحد، وليس فاتورتك.

فجوة Elo البالغة 145 نقطة كبيرة، لكنها تصويت للأغراض العامة، وليس تصويتًا للأنمي. وهنا الجزء الذي يجب أن أقوله بوضوح: MiniMax لا تسوق H3 كنموذج أنمي. ردود الفعل الداخلية من الخط الأول تسرد الفيلم، الرسوم المتحركة والدراما الكوميدية كمجالات لا يستهدفها H3. لذا السؤال المثير للاهتمام ليس "أيهما نموذج الأنمي". إنه لماذا النموذج الذي لا يبيع نفسه على الأنمي لا يزال يفوز باللقطة، وأين لا يزال Google يأخذ الجولة.

ملاحظة عملية واحدة قبل البرنامج التعليمي. كل نموذج أدناه يعمل من خلال نفس الكونسول ونفس مفتاح API، وهو السبب الوحيد الذي يجعل المعلمات قابلة للمقارنة على الإطلاق. نفس قائمة الانتظار، نفس المصادقة، فاتورة واحدة. إذا قمت بإعداد GPT Image 2 على خدمة وVeo على أخرى، نصف الاختلافات التي تجدها ستكون سباكة وليس نموذجًا.

بناء اللقطة: MiniMax H3 ضد Veo 3.1، خطوة بخطوة

مثال واحد جارٍ، من البداية إلى النهاية. "الصافرة الأخيرة": مهاجم مراهق أصلي، شعر أحمر، قميص أبيض وأزرق داكن رقم 9، أضواء كاشفة، حركة كاميرا سريعة على الضربة، وبطاقة عنوان يابانية يجب أن تظهر في آخر ثانيتين وتثبت بثبات.

لا لاعب حقيقي، لا شخصية رسمية، لا ملكية فكرية أنمي موجودة. أسلوب وتكريم فقط. المزيد عن السبب لاحقًا.

الخطوة 1: تصميم الإطار الرئيسي للأنمي باستخدام GPT Image 2

يحمل الإطار الرئيسي التوجيه الفني حتى لا يضطر نموذج الفيديو لاختراعه. لاحظ المساحة السلبية في الثلث الأيسر: إنها متعمدة. بطاقة العنوان ستُكتب هناك بواسطة نموذج الفيديو، وهذا هو اختبار ثبات النص.

Plain
1إطار واحد من أنمي رياضي شونن حديث. رسوم متحركة ثنائية الأبعاد بتظليل مسطح، خطوط مرسومة
2يدويًا بسمك خط ثابت، تعبئة ألوان مسطحة، ظلال رسومية حادة،
3لا يوجد تظليل ثلاثي الأبعاد على الإطلاق ولا جلد واقعي. لقطة قريبة لمهاجم مراهق أصلي:
4شعر أحمر داكن أشعث، قميص أبيض وأزرق داكن مع الرقم 9، عرق وخطوط عشب على
5أحد الخدين، عيون واسعة بتصميم منهك، فم مفتوح في منتصف الصراخ. خلفه،
6أضواء ملعب كاشفة تتوهج في جدار من ألوان الجمهور المشوشة؛ خطوط سرعة شعاعية
7تنفجر من مركز الإطار؛ نصل عشب واحد معلق في الهواء. لوحة ألوان مشبعة،
8ظلال سيان عميقة، إضاءة حافة برتقالية دافئة. تكوين 16:9، الشخصية مؤطرة على يمين
9المركز، مساحة سلبية نظيفة على الثلث الأيسر. لا يوجد نص في أي مكان في الصورة.

الإعدادات: model openai/gpt-image-2/text-to-image، quality high، size 16:9 (2048x1152). لا شيء آخر.

واجهة مولد الصور بالذكاء الاصطناعي تظهر خطوات مرقمة لإنشاء صورة أنمي

ملعب GPT Image 2 على Atlas Cloud مع موجه الإطار الرئيسي لـ Last Whistle وإطار الأنمي النهائي في لوحة الإخراج

GPT Image 2 على Atlas Cloud: الجودة مضبوطة على عالية، الإطار الرئيسي النهائي على اليمين.

رياضي أنمي ذو شعر أحمر كثيف يصرخ في ملعب مزدحم

الإطار الرئيسي للأنمي الأساسي: مهاجم أصلي ذو شعر أحمر في منتصف الصراخ تحت أضواء الملعب الكاشفة، بتظليل مسطح وألوان مسطحة وخطوط سرعة

الإطار الرئيسي الذي يستقبله كلا النموذجين. لون مسطح، ظلال صلبة، وثلث أيسر فارغ ينتظر بطاقة عنوان.

الخطوة 2: MiniMax H3 صورة إلى فيديو، كل شيء بأقصى حد

نفس الصورة مدخلة، 2K مخرجة. أبقيت H3 على 8 ثوانٍ هنا فقط لتطابق سقف Veo. هذا ليس حد H3 والخطوة 4 ترفع السقف.

Plain
1أنمي ثنائي الأبعاد بتظليل مسطح، سمك خط مرسوم يدويًا، لون مسطح، لا تظليل ثلاثي الأبعاد. تثبت على
2وجه المهاجم لوقفة واحدة، ثم حركة كاميرا سريعة عنيفة تتبع الكرة أثناء تسديده،
3الحركة تشوه الإطار إلى خطوط حركة ساكوجا مشوهة. إطار واحد من الصمت التام
4عند الاصطدام. خلال الثانيتين الأخيرتين، تظهر أحرف عنوان يابانية بيضاء جريئة تقرأ
5ラストホイッスル على الثلث الأيسر من الإطار وتثبت بثبات صخري، لا تشوه،
6لا وميض، لا انجراف. يصرخ المهاجم سطرًا واحدًا باليابانية: 「まだ終わってない!」
7الصوت: هدير الملعب يتصاعد، صوت اصطدام كرة حاد واحد، ضربة تايكو منخفضة تحت بطاقة العنوان.

الإعدادات: model minimax/h3/image-to-video، resolution: 2K، duration: 8، ratio: adaptive (صورة إلى فيديو تأخذ شكل الإطار من صورة الإدخال)، image = ناتج الخطوة 1.

تحذير واحد إذا انتقلت إلى نص إلى فيديو بدلاً من ذلك: اكتب ratio: 16:9 صراحة. الافتراضي هو 1:1 وسيسلمك بكل سرور مقطع أنمي مربع.

واجهة مولد فيديو بالذكاء الاصطناعي تظهر موجه الإدخال وفيديو الإخراج

ملعب MiniMax H3 صورة إلى فيديو على Atlas Cloud مع موجه Last Whistle، الإطار الرئيسي محمل والمقطع النهائي في لوحة الإخراج

MiniMax H3 صورة إلى فيديو على Atlas Cloud: الإطار الرئيسي من الخطوة 1 محمل على اليسار، المقطع النهائي يُشغل على اليمين.

الخطوة 3: Veo 3.1 صورة إلى فيديو، الصوت مشغل يدويًا

الموجه متطابق، كلمة بكلمة. غير صفة واحدة ويتوقف عن كونه مقارنة. ما يتغير هو الحقل الإضافي الذي يعطيك إياه Veo وليس لدى H3.

negative_prompt، والذي بالنسبة للأنمي ثنائي الأبعاد هو التحكم الأكثر فائدة في هذه القائمة:

Plain
1تظليل ثلاثي الأبعاد، CGI، تظليل بلاستيكي، جلد واقعي، لقطات حية، حساء ضبابية الحركة،
2حروف مشوهة، نص غير مفهوم، أصابع إضافية، شريط ترجمة

الإعدادات: model google/veo3.1/image-to-video، resolution: 1080p (غيّره، الافتراضي هو 720p)، duration: 8 (هذا هو السقف)، aspect_ratio: 16:9، generate_audio: true (الافتراضي في API هو false، هذا هو مصيدة المقطع الصامت)، seed: 20260807، image = نفس ناتج الخطوة 1.

واجهة مولد فيديو بالذكاء الاصطناعي تظهر إعدادات الإدخال وفيديو أنمي مُولد

ملعب Veo 3.1 صورة إلى فيديو على Atlas Cloud يظهر تمكين توليد الصوت، الإطار الرئيسي للأنمي محمل والمقطع النهائي في لوحة الإخراج

Veo 3.1 صورة إلى فيديو على Atlas Cloud، مع تشغيل Generate Audio والمقطع النهائي على اليمين.

الخطوة 4: تقييمه على خمسة محاور خاصة بالأنمي

لا شيء لتوليده هنا. فقط انظر، على الأشياء التي ينكسر عليها الأنمي بالفعل. كلا المقطعين مضمنان بالقرب من أعلى هذه المقالة، لذا يمكنك تقييمهما بنفسك بدلاً من أخذ كلمتي.

مشاهد ملعب كرة قدم جنبًا إلى جنب مُوسومة MiniMax H3 و Veo 3.1

جنبًا إلى جنب للإطار النهائي من كلا المقطعين، MiniMax H3 على اليسار مع حروف عنوان يابانية نظيفة، Veo 3.1 على اليمين مع أحرف عمودية مشوشة

الإطار الأخير من كل مقطع. على اليسار، كتب H3 ラストホイッスル، جميع الكاتاكانا الثمانية صحيحة وثابتة. على اليمين، كتب Veo 3.1 ثلاثة أحرف ليست الكلمة المطلوبة ولا تشكل كلمة.

بطاقة العنوان هي حيث حُسمت الجولة، ولم تكن قريبة. قام H3 بعرض الكاتاكانا المطلوبة بالضبط، حادة وثابتة، فوق حركة بان مشوشة لمنطقة المرمى. أنتج Veo 3.1 كومة عمودية من ثلاثة أحرف ليست الكلمة المطلوبة ولا كلمة. على نفس الإطار، أسقط أيضًا الشخصية خارج الإطار وترك الخلفية تنزلق نحو لوحة ملعب شبه واقعية، على الرغم من وجود photorealistic skin و 3D render في الموجه السلبي.

الجدول 3: خمسة محاور تحدد لقطة أنمي، من هاتين التشغيلتين

المحورMiniMax H3Veo 3.1
استمرارية الشخصية من الإطار الرئيسياحتفظ بالوجه الدقيق والشعر والقميص طوال الـ 8 ثوانٍأعاد رسم الشخصية في لقطة واسعة جديدة، على النموذج لكن رسمًا مختلفًا
سمك الخط والتظليل المسطح للأنميثبت، لا انجراف نحو ثلاثي الأبعادثبت في اللقطة المتوسطة، انجرف نحو لوحة ملعب فوتوغرافية بحلول النهاية
بطاقة العنوان اليابانيةラストホイッスル تم عرضها بشكل صحيح وثابتثلاثة أحرف، ليست الكلمة المطلوبة، ليست كلمة
المسار الصوتي المُسلّم32 كيلوهرتز ستيريو، تمامًا كما تنص بطاقة النموذج48 كيلوهرتز ستيريو، موجود فقط لأنني قمت بتعيين generate_audio بنفسي
حركة الكاميرا السريعة وتشويه ساكوجانُفذت كحركة بان مشوهة إلى العنواناستُبدلت بقصّة حادة إلى إعداد جديد

هذا الصف الأخير هو الانتقاد العلني الأكبر لـ H3 حتى الآن، وهو بالضبط سبب كتابتي له في كلا الموجهين. في موضوع ComfyUI في اليوم الأول، اشتكى المستخدم fwip من أنه حتى موجهات العرض التوضيحي الرسمية تم تجاهلها: "حركة بان عنيفة من على السطح تشوش الكلمات العائمة بعيدًا معها، مشوشة بالحركة. والفيديو ببساطة لم يفعل أيًا من ذلك الانتقال على الإطلاق، لقد استبدلها بقصّة."

في هذه التشغيلة، كان Veo هو من استبدل البان بقصّة، و H3 هو من شوش. تشغيلة واحدة لكل منهما ليست حكمًا، ولن أدعي غير ذلك. لكن هذا يعني أن الانتقاد ليس خاصًا بـ H3: حركات البان السريعة هي أقل تعليمات موثوقة في هذا الاختبار بأكمله على كلا الجانبين. إذا كان لوحة القصة الخاصة بك تعتمد على واحدة، فخطط حولها بدلاً من من خلالها.

الخطوة 5: لقطة OVA الرجعية بنسبة 4:3 التي لا يمكن لـ Veo 3.1 إخراجها هيكليًا

هذا ليس تفضيل جودة. إنه جدار. تعداد aspect_ratio في Veo له قيمتان ولا شيء منهما 4:3، وتعداد duration ليس لديه 12. مظهر OVA في التسعينيات ببساطة غير قابل للعنونة.

Plain
1لقطة أنمي OVA من التسعينيات، 4:3 إطار كامل. خلفية مرسومة يدويًا مع نسيج فرشاة مرئي،
2شخصيات مرسومة بالطلاء بخطوط حبر سميكة غير متساوية، توهج هالة كثيف حول
3الأضواء الكاشفة، حبيبات فيلم 16 مم وتمايل خفيف للبوابة. نفس المهاجم ذو الشعر الأحمر
4في قميص أبيض وأزرق داكن رقم 9 يمشي خارج ملعب مبتل بالمطر بينما يخفت ضجيج الجمهور إلى نغمة رنين واحدة.
5الكاميرا تدفع ببطء نحو وجهه. يقول بهدوء باليابانية: 「次は、勝つ」. لوحة رجعية: أزرق مخضر باهت، كهرماني مغبر، ظلال مارون عميقة.
6الصوت: مطر بعيد، وسادة توليف تناظرية وحيدة، صافرة واحدة ذات صدى ثقيل في المسافة البعيدة.

الإعدادات: model minimax/h3/text-to-video، resolution: 2K، duration: 12، ratio: 4:3. اضبط تلك النسبة يدويًا، تذكر الافتراضي.

واجهة مولد فيديو بالذكاء الاصطناعي مع موجه نصي وفيديو أنمي مُولد

ملعب MiniMax H3 نص إلى فيديو على Atlas Cloud مع موجه OVA مكتوب والمقطع الرجعي النهائي في لوحة الإخراج

MiniMax H3 نص إلى فيديو على Atlas Cloud، موجه OVA مكتوب، المقطع مكتمل. الإفصاح الكامل: هذه التشغيلة بالذات تركت Aspect Ratio عند 16:9 و Duration عند 8، لذا ما تراه على اليمين هو النسخة القصيرة ذات الشاشة العريضة. المقطع الذي تبلغ مدته 12 ثانية بنسبة 4:3 أدناه جاء من استدعاء API مع تعيين ratio: 4:3 و duration: 12 صراحة.

لاعب كرة قدم أنمي ذو شعر أحمر يقف بزي متسخ داخل ملعب

لقطة OVA الرجعية بنسبة 4:3: نفس المهاجم يمشي خارج ملعب مبتل بالمطر بأسلوب أنمي التسعينيات

H3 نص إلى فيديو، 4:3، 12 ثانية. الملف المسلّم عاد بحجم 1920x1440، وهو 4:3 بالبكسل، مع مسار ستيريو 32 كيلوهرتز. معروض هنا كـ GIF صامت بمعدل إطارات منخفض للحفاظ على خفة الصفحة. تم التوليد باستخدام minimax/h3/text-to-video على Atlas Cloud.

الخطوة 6: تسع صور مرجعية، شخصية واحدة، أربع لقطات

اتساق الشخصية عبر اللقطات هو أصعب مشكلة في أنمي الذكاء الاصطناعي، ويتم حلها بحجم المرجع. قم ببناء الحزمة أولاً: أعد تشغيل موجه الخطوة 1 مع تبديل التأطير للأمام، ثلاثة أرباع، ملف شخصي كامل، خلف، ضاحك، أسنان مطبقة، وقفة كاملة الجسم، تفاصيل القميص وتفاصيل الحذاء. تسع صور، حوالي ثمانية سنتات إجمالاً.

ملموس ومحدد؟ نعم (يحدد أربع رسوم توضيحية، شعر أحمر، أنمي، كرة قدم)

أربع زوايا لنفس الشخصية المهاجمة الأصلية تم توليدها كحزمة مرجعية، مرتبة في شبكة اثنين في اثنين

أربع من الزوايا المرجعية التسع. يقبل H3 ما يصل إلى تسع صور في حزمة مرجعية واحدة، بالإضافة إلى مراجع فيديو وصوتية فوق ذلك.

Plain
1أنمي ثنائي الأبعاد بتظليل مسطح، سمك خط مرسوم يدويًا ثابت، لون مسطح، لا تظليل ثلاثي الأبعاد. احتفظ
2بوجه المهاجم المرجعي وصورة ظلية الشعر وقميص رقم 9 متطابقين عبر كل لقطة.
3أربع لقطات في لقطة واحدة مستمرة: (1) اقتراب من زاوية منخفضة على حذائه يلامس العشب،
4(2) حركة بان سريعة لأعلى إلى لقطة قريبة ضيقة لعينيه، (3) لقطة واسعة له يركض متجاوزًا ثلاثة
5مدافعين مرسومين كصور ظلية مشوشة، (4) تجميد على رأسية في الهواء، خطوط سرعة
6تنفجر للخارج. الصوت: هدير الجمهور، نفس، اصطدامات حذاء بالعشب، ضربة تايكو واحدة عند التجميد.

الإعدادات: model minimax/h3/reference-to-video، refers = صورك مع type: image، resolution: 2K، duration: 8 أو أعلى، ratio: adaptive أو 16:9.

المكافئ في Veo 3.1 لا يمكن تشغيله بهذه الإعدادات ولا تحتاج لمحاولته لتعرف السبب. نقطة نهاية المرجع الخاصة به تقبل حدًا أقصى ثلاث صور، واختيار تلك النقطة النهائية ينهار duration إلى قيمة قانونية واحدة وهي 8. حزمة من تسع صور ولقطة مدتها 10 ثوانٍ كلاهما خارج النطاق.

واجهة مولد فيديو بالذكاء الاصطناعي تظهر موجه الإدخال وفيديو أنمي مُولد

ملعب MiniMax H3 مرجع إلى فيديو على Atlas Cloud يظهر عداد المرجع عند أربعة من تسعة واللقطة الأولى في لوحة الإخراج

MiniMax H3 مرجع إلى فيديو على Atlas Cloud. العداد يقرأ Reference Materials (4/9) مع MAX:9 تحته، وهو السقف في الواجهة وليس ادعاءً من ورقة مواصفات. الإخراج هو اللقطة الأولى، الاقتراب من زاوية منخفضة على الحذاء.

أربع تشغيلات إضافية لـ MiniMax H3 كمُولّد فيديو أنمي تستحق العناء

لقطة Last Whistle تختبر فقط أربعة من الاختلافات. هذه الأربعة تختبر الباقي. جميعها تعمل على H3؛ الملاحظات تقول أي منها يمكن لـ Veo 3.1 مطابقته.

  1. قتال ساكوجا فائق العرض، 21:9، 10 ثوانٍ. لا يمكن لـ Veo إخراج 21:9 على الإطلاق.
Plain
1أكشن أنمي ثنائي الأبعاد بتظليل مسطح، خطوط حبر سميكة مدببة، لون مسطح، ظلال حادة،
2لا تظليل ثلاثي الأبعاد. مبارزان مقنعان أصليان على سطح معبد تهب عليه الرياح عند الغسق. اصطدام
3شفرة، الإطار يهتز، كلا المقاتلين ينفصلان في انفجار من إطارات التأثير المرسومة يدويًا
4وخطوط السرعة الشعاعية. الكاميرا: اقتراب من زاوية منخفضة، ثم مسار جانبي، ثم قصّة
5لصورة ظلية واسعة ضد السماء البرتقالية. الصوت: اصطدامان معديان حادان، صوت قماش،
6ضربة تايكو منخفضة على التجميد النهائي، لا موسيقى.
  1. لقطة AMV متزامنة مع الإيقاع، مرجع إلى فيديو مع مرجع صوتي. H3 يأخذ ما يصل إلى ثلاثة مقاطع صوتية كمدخل مرجعي. Veo 3.1 ليس لديه إدخال صوتي على الإطلاق، فقط إخراج صوتي.
Plain
1مونتاج أنمي ثنائي الأبعاد بتظليل مسطح مقطوع للمسار الصوتي المرجعي. خمس إيقاعات قصيرة: مطر على
2نافذة، يد تشد ضمادة، أفق مدينة يمر عبر نافذة قطار، بداية عدو سريع،
3تجميد على يد ممدودة. كل لقطة تهبط بالضبط على إيقاع قوي
4للمسار الصوتي المرجعي. لون مسطح، خطوط حبر سميكة، لوحة ليلية عالية التباين من نيلي عميق
5ونيون أرجواني.
  1. مشهد حوار ياباني من سطرين، 12 ثانية. هذا هو اختبار الإجهاد لمزامنة الشفاه، و 12 ثانية بالفعل خارج نطاق Veo.
Plain
1أنمي ثنائي الأبعاد بتظليل مسطح، لون مسطح، لا تظليل ثلاثي الأبعاد. شخصيتان أصليتان على سطح في
2الساعة الذهبية، لقطة ورد على لقطة. الأولى تقول باليابانية:「本当に行くの?」. الثانية
3تجيب بنصف ابتسامة باليابانية:「もう決めた」. الأفواه تتطابق مع كل مقطع. إضاءة حافة دافئة، ظلال طويلة،
4رياح لطيفة في الشعر. الصوت: صوتان يابانيان مميزان، مرور بعيد، زيز واحد.
  1. شورت شونن عمودي، 9:16، 8 ثوانٍ. كلا النموذجين يمكنهما العمل عموديًا، لذا هذا هو المكان الوحيد لمقارنتهما A/B بدلاً من الافتراض.
Plain
1أنمي ثنائي الأبعاد بتظليل مسطح، تكوين عمودي. عداءة مراهقة أصلية تنفجر عبر
2لافتة ورقية بالحركة البطيئة، ثم يعود الإطار إلى السرعة الكاملة بينما تتسارع
3على مضمار ملعب مستقيم. خطوط سرعة، لون مسطح، ظلال صلبة، سماء رسومية جريئة.
4الكاميرا: لقطة متابعة من زاوية منخفضة، ثم حركة بان سريعة لأعلى إلى وجهها. الصوت: تمزق اللافتة،
5اندفاع الجمهور، نفس واحد محبوس ثم يُطلق.
6
7إذا كنت تريد قواعد اللغة وراء هذه الموجهات، فإن [دليل موجهات MiniMax H3](https://www.atlascloud.ai/blog/guides/minimax-h3-prompt-guide?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) يتعمق أكثر في كيفية تحليل H3 لتعليمات الكاميرا والصوت أكثر مما يمكنني هنا.
8
9## كم تكلف افتتاحية أنمي مدتها 60 ثانية على MiniMax H3 مقابل Veo 3.1
10
11افتتاحية الأنمي القياسية تبلغ حوالي 90 ثانية. لنقل ثماني لقطات مدة كل منها 8 ثوانٍ، 64 ثانية من الفيديو النهائي، بالإضافة إلى إطار رئيسي واحد لكل لقطة بسعر $0.009 لكل منها.
12
13هناك تفاوت حقيقي في التسعير يجب أن تعرفه بدلاً من أن أتجاهله. كتالوج Atlas Cloud يسرد MiniMax H3 بسعر $0.10 في الثانية بشكل ثابت، بينما يوضحه ملف النموذج بأنه $0.14/ثانية بدقة 2K و $0.10/ثانية بدقة 768P. Veo 3.1 مسجل بسعر $0.20 في الثانية، بينما يفرق ملفه بين $0.40/ثانية مع الصوت و $0.20/ثانية بدونه.
14
15أزرار التشغيل في لقطات الشاشة الخاصة بي تحسم الأمر. H3 مرجع إلى فيديو، 8 ثوانٍ بدقة 2K، مقتبس `Run $1.12`، وهو بالضبط $0.14 في الثانية. Veo 3.1 صورة إلى فيديو، 8 ثوانٍ بدقة 1080p مع الصوت، مقتبس `Run $3.2`، وهو بالضبط $0.40 في الثانية. لذا فإن أسعار ملف النموذج هي التي تتم محاسبتها، وعنوان الكتالوج هو الطبقة الدنيا. لقد عرضت كلا القراءتين أدناه على أي حال. هذه أسعار القائمة اعتبارًا من أغسطس 2026.
16
17**الجدول 4: ثماني لقطات مدة كل منها 8 ثوانٍ، بما في ذلك الإطارات الرئيسية**
18
19| الإعداد | تكلفة الفيديو (سعر الكتالوج) | تكلفة الفيديو (سعر ملف النموذج) | الإطارات الرئيسية | النطاق الإجمالي |
20| ------------------------- | ------------------------- | ------------------------ | --------- | ---------------- |
21| MiniMax H3، 2K | $6.40 | $8.96 | $0.07 | $6.47 إلى $9.03 |
22| MiniMax H3، 768P | $6.40 | $6.40 | $0.07 | $6.47 |
23| Veo 3.1، 1080p مع الصوت | $12.80 | $25.60 | $0.07 | $12.87 إلى $25.67 |
24| Veo 3.1 Lite، 720p | $3.20 | $3.20 | $0.07 | $3.27 |
25
26الأسعار مأخوذة من صفحات نموذج Atlas Cloud المرتبطة في الجدول 1، أغسطس 2026. لا يوجد خصم على أي من هذه الأربعة حاليًا.
27
28شيئان لا يتضمنهما ذلك الجدول، وكلاهما يؤثر بقوة من السعر في الثانية.
29
30**إعادة المحاولات.** لا أحد يصدر اللقطة الأولى من لقطة أنمي. أي مضاعف تفترضه، طبقه على كلا العمودين وستتسع الفجوة بنفس النسبة.
31
32**وقت الحائط، وهذا يسير في الاتجاه الآخر.** تم التوقيت من البداية إلى النهاية في 7 أغسطس 2026: H3 بدقة 2K لمدة 8 ثوانٍ استغرق 447 ثانية، حوالي 7.5 دقيقة. H3 نص إلى فيديو بدقة 2K لمدة 12 ثانية استغرق 334 ثانية. Veo 3.1 بدقة 1080p لمدة 8 ثوانٍ مع الصوت استغرق 152 ثانية، أقل من ثلاث دقائق. Veo أسرع بحوالي ثلاث مرات للوصول إلى اللقطة الأولى هنا، وإذا كنت تكرر على لقطة في الساعة 2 صباحًا، فهذا يستحق أموالًا حقيقية. قوائم الانتظار تتحرك، لذا تعامل مع هذه كلقطة واحدة بعد الظهر بدلاً من مواصفة. لكن أي شخص يقتبس "2 إلى 3 دقائق" لـ H3 بدقة 2K يقتبس ملفًا نصيًا، وليس قائمة انتظار. يغطي [تحليل 2K مقابل 768P](https://www.atlascloud.ai/blog/guides/minimax-h3-2k-vs-768p?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) متى يستحق المستوى الأعلى الدقائق الإضافية.
33
34## أسلوب الأنمي، التكريم، وما يمكنك نشره فعليًا
35
36كل شيء في هذه المقالة هو أسلوب وتكريم. شخصية أصلية، قميص أصلي، عنوان أصلي. لم يتم توليد أو طلب أي شخصية أنمي رسمية، ولم يتم استخدام اسم أو صورة أي لاعب كرة قدم حقيقي. يتم الإشارة إلى اتجاه كأس العالم كـ _تنسيق_، لأن هذا هو ما هو مفيد لأجله.
37
38هذا التمييز ليس زخرفة. إذا كنت تنتج محتوى بأسلوب الأنمي تجاريًا، فإن "على غرار OVA في التسعينيات" و"هذه الشخصية المحددة من هذا العرض المحدد" هما شيئان قانونيان مختلفان، وواحد منهما فقط هو عمل تجاري.
39
40فيما يتعلق بالأوزان المفتوحة: H3 قابل للتنزيل حقًا، وقد قام الناس بتشغيله في اليوم الأول. أبلغ أحد المعلقين عن 10 دقائق لمقطع مدته 10 ثوانٍ بدقة 480p على بطاقة 4070 Ti Super مع 16 جيجابايت، ونشر آخرون 3 دقائق على بطاقة 5080 و 68 ثانية على RTX 6000 Pro. لكن الاستضافة الذاتية تعمل بحافة قصيرة 768؛ مراحل Context-IR و Regenerate-2K التي تنتج 2K تبقى على جانب API.
41
42الترخيص له عائق حقيقي. الترخيص المجتمعي لا يغطي حاليًا الاتحاد الأوروبي، المملكة المتحدة، كوريا الجنوبية أو الولايات المتحدة، مستشهدًا بمناطق "تطور أو تطبق حاليًا لوائح متعلقة بالذكاء الاصطناعي". قناة طلب الترخيص الرسمية مفتوحة، والتي لخصها أحد المعلقين على HN بأنها "عليك فقط أن تعد بوعد البنك الصغير بأنك لن تغضب ديزني وسيرسلون لك ترخيصًا". مضحك، وأيضًا بالضبط خطوة الامتثال التي لا يمكنك تخطيها إذا كنت في واحدة من هذه المناطق الأربع. [الشرح عن الأوزان المفتوحة](https://www.atlascloud.ai/blog/guides/minimax-h3-open-source-weights?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) لديه قائمة المناطق الكاملة.
43
44## الأسئلة المتكررة
45
46### هل MiniMax H3 مُولّد فيديو أنمي جيد مقارنة بـ Veo 3.1؟
47
48بالنسبة لمعظم أعمال الأنمي، نعم، H3، وذلك لأسباب لا تتعلق بالعرض بشكل أساسي. يعمل لمدة 4 إلى 15 ثانية مقابل 4 أو 6 أو 8 لـ Veo، ويقدم ست نسب عرض إلى ارتفاع بما في ذلك 4:3 و 21:9 مقابل نسبتين لـ Veo، ويسرد اليابانية من بين 11 لغة حوار ثابتة أصلاً، ويأخذ تسع صور مرجعية مقابل ثلاث لـ Veo. Veo 3.1 يفوز في موقف محدد واحد: عندما تحتاج إلى `seed` لإعادة اللقطات القابلة للتكرار، أو `negative_prompt` لمنع اللقطة من الانجراف نحو تظليل العرض ثلاثي الأبعاد. H3 ليس لديه أي من المعلمتين. إذا كان خط الإنتاج الخاص بك يعتمد على أي منهما، فهذا سبب حقيقي للبقاء.
49
50### هل يمكن لـ Veo 3.1 توليد أنمي بنسبة 4:3 أو مقطع مدته 15 ثانية؟
51
52لا، وليس لأسباب أسلوبية. تعداد `aspect_ratio` في Veo 3.1 يحتوي بالضبط على `16:9` و `9:16`، وتعداد `duration` يحتوي بالضبط على `4` و `6` و `8`. لا توجد قيمة 4:3 للاختيار ولا طريقة لطلب 12 أو 15 ثانية. إذا كان مرجعك هو أنمي تلفزيوني أو OVA من التسعينيات، فإن التأطير بعيد المنال على Veo ومتاح على H3.
53
54### لماذا عاد مقطع الأنمي الخاص بي من Veo 3.1 صامتًا؟
55
56لأن `generate_audio` افتراضيًا `false` على API. مفتاح الواجهة عادة ما يكون قيد التشغيل بالفعل، لذا هذا فقط يعض الأشخاص الذين يستدعون API مباشرة. قم بتعيين `generate_audio: true` صراحة. بينما أنت هناك، قم بتعيين `resolution` أيضًا، لأنه افتراضيًا `720p` بدلاً من 1080p أو 4k التي ربما كنت تقصدها.
57
58### هل يقوم MiniMax H3 بالحوار الياباني ومزامنة الشفاه للأنمي؟
59
60نعم. تسرد بطاقة النموذج 11 لغة مع دعم حوار مستقر: العربية، الصينية، الإنجليزية، الفرنسية، الألمانية، الإيطالية، اليابانية، الكورية، البرتغالية، الروسية والإسبانية. يتم توليد الصوت مع الصورة بشكل مشترك بمعدل 32 كيلوهرتز ستيريو بدلاً من الدبلجة لاحقًا، ولهذا السبب يستمر توقيت الفم عبر سطر كامل بدلاً من المقاطع الأولى. اكتب السطر الياباني مباشرة في الموجه باليابانية.
61
62### كم عدد الصور المرجعية التي يمكنني استخدامها للحفاظ على اتساق شخصية الأنمي؟
63
64يقبل MiniMax H3 ما يصل إلى 9 صور، وما يصل إلى 3 مقاطع فيديو وما يصل إلى 3 مقاطع صوتية، مع سقف صارم يبلغ 12 ملفًا عبر جميع الأنواع. نقطة نهاية مرجع إلى فيديو في Veo 3.1 تقبل 1 إلى 3 صور، واختيارها ينهار `duration` إلى `8` باعتباره القيمة القانونية الوحيدة. بالنسبة لشخصية أنمي متكررة عبر سلسلة، هذا الاختلاف هو كل شيء.
65
66### MiniMax H3 لديه أوزان مفتوحة، فهل يمكنني تشغيل خط أنابيب الأنمي الخاص بي محليًا مجانًا؟
67
68يمكنك تنزيله وتشغيله، مع ثلاثة تحذيرات. الاستدلال المستضاف ذاتيًا يعمل بحافة قصيرة 768، ومراحل Context-IR و Regenerate-2K التي تنتج 2K تبقى على جانب API. تتراوح السرعات المحلية الواقعية على نطاق واسع حسب البطاقة: حوالي 10 دقائق لمقطع 480p مدته 10 ثوانٍ على بطاقة 4070 Ti Super، حوالي 3 دقائق على بطاقة 5080، حوالي 68 ثانية على RTX 6000 Pro، وفقًا لموضوع ComfyUI في اليوم الأول. والترخيص المجتمعي لا يغطي حاليًا الاتحاد الأوروبي، المملكة المتحدة، كوريا الجنوبية أو الولايات المتحدة، لذا إذا كنت في واحدة من هذه، فأنت بحاجة إلى الترخيص الرسمي قبل الاستخدام التجاري.

أحدث النماذج

واجهة برمجية واحدة لكل وسائط الذكاء الاصطناعي.

استكشف جميع النماذج