طوال الصيف، كان محتوى حسابي عبارة عن نفس الفيديو المتكرر. لاعبو كأس العالم أعيد رسمهم كأبطال شونين. ديكتاتور. قبطان قرصان. مرشد متجهم يظهر في الثواني الأربع الأخيرة. ملايين المشاهدات للمنشور، والقصة تتحدّث بعد كل مباراة تقريبًا.
لا أحد ممن يصنعون تلك المنشورات يكتب منشورات معيارية. هم يختارون نموذجًا، يحرقون الرصيد، ويُطلقون قبل الركلة التالية.
لذا أخذت لقطة أنمي رئيسية واحدة وموجهًا واحدًا، واختبرت MiniMax H3 كمولّد فيديو أنمي مقابل Veo 3.1، مع دفع كلاهما إلى أقصى إعداداتهما على مدخلات متطابقة.
أول ما انكسر لم يكن جودة الصورة. بل كانت قائمة منسدلة. Veo 3.1 يتوقف عند 8 ثوانٍ ويقدم نسبتي أبعاد فقط. لقطة تثبت على وجه، حركات سريعة مع الكرة، ثم تسمح بظهور بطاقة عنوان لا تتناسب مع 8 ثوانٍ. لم تتح لها الفرصة أبدًا للفشل في الجودة.
النقاط الرئيسية
- تعداد
durationفي Veo 3.1 هو[4, 6, 8]وتعدادaspect_ratioهو[16:9, 9:16]. MiniMax H3 يدعم أي عدد صحيح من الثواني من 4 إلى 15 ويقدم21:9, 16:9, 4:3, 1:1, 3:4, 9:16. عدم وجود 4:3 في Veo يعني عدم وجود إطار OVA قديم على الإطلاق. - بطاقة نموذج H3 تدرج 11 لغة حوار مستقرة أصلية واليابانية واحدة منها. يتم توليد الصوت والصورة معًا بتردد 32 كيلوهرتز ستيريو، وليس إضافة دبلجة لاحقًا.
- حزم المرجع ليست متقاربة: H3 يستقبل حتى 9 صور بالإضافة إلى 3 فيديوهات و 3 مقاطع صوتية (12 ملفًا كحد أقصى). نقطة نهاية المرجع في Veo 3.1 تستقبل 3 صور، وبمجرد استخدامها ينهار
durationإلى[8]فقط. - فخان يفسدان الاختبارات بصمت: واجهة API لـ Veo تجعل
generate_audioافتراضيًا علىfalseوresolutionعلى720p، ونسبةratioفي النص إلى الفيديو لـ H3 افتراضية على1:1. اترك هذه كما هي وستقارن مقطعًا صامتًا بدقة 720p مقابل مقطع مربع. - يحتفظ Veo 3.1 بشيئين لا يمتلكهما H3 على الإطلاق:
seedوnegative_prompt. بالنسبة للأنمي ثنائي الأبعاد، الثاني مهم حقًا، وسأعرض أين.
MiniMax H3 كمولّد فيديو أنمي مقابل Veo 3.1، نفس الإطار جنبًا إلى جنب
شخصية أصلية واحدة. إطار رئيسي واحد. موجه واحد، منسوخ حرفيًا إلى كلا النموذجين. كل شيء آخر بأقصى إعدادات لكل جانب.
MiniMax H3، صورة إلى فيديو، 2K، 8 ثوانٍ، صوت أصلي. شغّل الصوت: ضجيج الجمهور، ضرب الكرة والصراخ الياباني يتم توليدها في نفس مسار الصورة. تم الإنشاء باستخدام minimax/h3/image-to-video على Atlas Cloud.
Veo 3.1، صورة إلى فيديو، 1080p، 8 ثوانٍ، مع تشغيل generateaudio يدويًا، بالإضافة إلى negativeprompt يحافظ على الخطوط المسطحة. نفس الإطار الأول، نفس الكلمات. تم الإنشاء باستخدام google/veo3.1/image-to-video على Atlas Cloud.
كلاهما يرسم بشكل جميل. لقطة Veo الواسعة للركلة، مع خطوط التأثير المرسومة يدويًا وتأثير صوت المانجا العائم في الهواء، جميلة حقًا. هذه هي نقطة البداية الصادقة، ولهذا السبب بقية المقالة تدور حول المعاملات واتباع التعليمات وليس الانطباعات.
لماذا تفشل معظم اختبارات MiniMax H3 كمولّد فيديو أنمي مقابل Veo 3.1
حدث شيئان معًا هذا الصيف.
أصبح الأنمي الشكل الأعلى حجمًا في فيديو الذكاء الاصطناعي. أُعيد كتابة كأس العالم 2026 كبطولة شونين، مع تعيين اللاعبين كديكتاتور، قبطان قرصان، جنرال بحري ومرشد، وقصص تتطور "بعد كل مباراة تقريبًا" عبر تيك توك، إنستغرام، إكس ويوتيوب (Complex، يوليو 2026).
وتم إطلاق MiniMax H3 بأوزان مفتوحة. وصل خيط ComfyUI في اليوم الأول إلى 330 نقطة و 95 تعليقًا، مع نشر الناس لأرقام محلية حقيقية في غضون ساعات (Hacker News، أغسطس 2026).
ضع هذه معًا وستتوقع كومة من مقارنات الأنمي. لا يوجد أي منها تقريبًا، لأن معظم الاختبارات تُبنى بشكل خاطئ بإحدى أربع طرق.
يقارنون الصور، وليس القيود. لقطات الأنمي هي توقيت. الحركة السريعة إلى بطاقة العنوان هي مشكلة مدة قبل أن تكون مشكلة عرض.
ينسون أن واجهة API لـ Veo صامتة افتراضيًا. في واجهة API، generate_audio هو false و resolution هو 720p. الكثير من منشورات "Veo ليس لديه صوت في الأنمي" هي مجرد شخص لم يقلب قيمة منطقية.
ينسون أن النص إلى فيديو لـ H3 مربع افتراضيًا. ratio افتراضي على 1:1، وليس 16:9. قم بتشغيل موجه أنمي t2v دون تعيينه وستحصل على مقطع مربع واستنتاج مشوش.
يختبرون بموجهات فوتوريلية. "سينمائي، إضاءة حجمية، عمق مجال ضحل" هي بالضبط المفردات التي تسحب النموذج ثنائي الأبعاد نحو تظليل عرض ثلاثي الأبعاد. وضع الفشل في الأنمي ليس الضبابية. إنه البلاستيك.
الإعدادات الثلاثة التي تحدد اختبار الأنمي قبل أن تضغط تشغيل
قبل أي شيء آخر، اضبط هذه على كلا الجانبين أو تكون المقارنة باطلة.
| الإعداد | MiniMax H3 | Veo 3.1 | ماذا يحدث إذا تخطيته |
|---|---|---|---|
| الصوت | يتم توليده مع الصورة، دائمًا نشط | generate_audio افتراضي على false | يعيد Veo مقطعًا صامتًا ويبدو أسوأ مما هو عليه |
| شكل الإطار | ratio افتراضي على 1:1 في النص إلى فيديو | aspect_ratio افتراضي على 16:9 | يعطيك H3 مقطع أنمي مربع لا يمكنك استخدامه |
| الدقة | افتراضي على 2K | افتراضي على 720p | تقارن 2K مقابل 720p وتسميه فجوة جودة |
هل تريد اختبار MiniMax H3 و Veo 3.1 على نفس موجه الأنمي بنفسك؟ مقارنة النماذج في Atlas Cloud تشغلهما جنبًا إلى جنب في مسار واحد — نفس الموجه والإعدادات، التكلفة معروضة قبل أن تنشئ.

MiniMax H3 وVeo 3.1 على نفس موجه الأنمي في مقارنة النماذج في Atlas Cloud — نفس الإعدادات، السعر معروض قبل الإنشاء. تم التقاطها مباشرة من مستكشف النماذج.
ورقة المواصفات الفنية لـ MiniMax H3 مقابل Veo 3.1 للأنمي: المدة، النسبة، الصوت، المراجع
سحبت مخططات الإدخال المباشرة لكلا النموذجين بدلاً من الوثوق بأي منشور إطلاق. كل قيمة أدناه هي تعداد يمكنك قراءته بنفسك على صفحات النماذج، وليس انطباعًا.
الجدول 1: MiniMax H3 مقابل Veo 3.1، المعاملات التي تحدد لقطة أنمي
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| المدة | 4 إلى 15، كل ثانية كاملة (الافتراضي 8) | 4، 6، 8 (الافتراضي 8) |
| نسب الأبعاد | 21:9، 16:9، 4:3، 1:1، 3:4، 9:16 | 16:9، 9:16 |
| النسبة الافتراضية (نص إلى فيديو) | 1:01 | 16:09 |
| الدقة | 768P، 2K (الافتراضي 2K) | 720p، 1080p، 4k (الافتراضي 720p) |
| الصوت | يتم توليده مشتركًا، 32 كيلوهرتز ستيريو | generate_audio، افتراضي false |
| لغات الحوار الأصلية | 11 مستقرة، اليابانية متضمنة | غير منشورة كقائمة مستقرة |
| حزمة المرجع | حتى 9 صور، 3 فيديوهات، 3 مقاطع صوتية، 12 ملفًا إجمالاً | 3 صور |
| المدة عند استخدام المراجع | لا يزال 4 إلى 15 | ينهار إلى 8 فقط |
| seed | غير متاح | متاح |
| negative_prompt | غير متاح | متاح |
| الأوزان | قابلة للتحميل | مغلقة |
المدة، النسبة، الدقة، الصوت وحدود المرجع مقروءة من المخططات المباشرة على صفحات MiniMax H3 صورة إلى فيديو، H3 نص إلى فيديو، H3 مرجع إلى فيديو، Veo 3.1 صورة إلى فيديو و Veo 3.1 مرجع إلى فيديو. سقف 9 صور و 12 ملفًا وقائمة 11 لغة حوار مأخوذة من بطاقة نموذج MiniMax H3 (Hugging Face، أغسطس 2026).
الآن لوحات النتائج، لأنها تقول شيئًا مختلفًا عن ورقة المواصفات وكليهما مهم.
الجدول 2: Elo تصويت الجمهور وسعر الدقيقة، لقطة سريعة 7 أغسطس 2026
| النموذج | نص إلى فيديو (مع صوت) | صورة إلى فيديو (مع صوت) | $/دقيقة |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | غير مدرج في العشرة الأوائل | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | غير مدرج في العشرة الأوائل | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | غير مدرج في العشرة الأوائل | $4.80 |
أرقام Elo والأسعار من Artificial Analysis Video Arena (Artificial Analysis، أغسطس 2026). هذه أصوات جمهور متحركة وتتغير. عمود $/دقيقة هو تقدير نموذجي معياري، وليس فاتورتك.
فجوة 145 نقطة Elo كبيرة، لكنها تصويت عام، وليس تصويتًا للأنمي. وهنا الجزء الذي يجب أن أقوله بوضوح: MiniMax لا تسوق H3 كنموذج أنمي. قائمة الملاحظات الداخلية من الخط الأول تذكر الفيلم، الرسوم المتحركة والدراما الكوميدية كمجالات لا يستهدفها H3. لذا السؤال المثير للاهتمام ليس "أي منهما هو نموذج الأنمي". بل لماذا النموذج الذي لا يبيع نفسه على الأنمي لا يزال يفوز باللقطة، وأين لا يزال Google يأخذ الجولة.
ملاحظة عملية واحدة قبل البرنامج التعليمي. كل نموذج أدناه يعمل من خلال نفس الكونسول ونفس مفتاح API، وهو السبب الوحيد الذي يجعل المعاملات قابلة للمقارنة على الإطلاق. نفس الطابور، نفس المصادقة، فاتورة واحدة. إذا قمت بإعداد GPT Image 2 على خدمة و Veo على أخرى، نصف الاختلافات التي تجدها ستكون سباكة وليس نموذجًا.
بناء اللقطة: MiniMax H3 مقابل Veo 3.1، خطوة بخطوة
مثال جارٍ واحد، من البداية إلى النهاية. "الصافرة الأخيرة": مهاجم مراهق أصلي، شعر أحمر، قميص أبيض وأزرق داكن رقم 9، أضواء كاشفة، حركة سريعة مع الركلة، وبطاقة عنوان يابانية يجب أن تظهر في الثانيتين الأخيرتين وتثبت بثبات.
لا لاعب حقيقي، ولا شخصية رسمية، ولا ملكية فكرية أنمي موجودة. الأسلوب والتكريم فقط. المزيد عن السبب لاحقًا.
الخطوة 1: تصميم إطار الأنمي الرئيسي باستخدام GPT Image 2
الإطار الرئيسي يحمل التوجيه الفني بحيث لا يضطر نموذج الفيديو إلى اختراعه. لاحظ المساحة السلبية في الثلث الأيسر: إنها مقصودة. ستكتب بطاقة العنوان هناك بواسطة نموذج الفيديو، وهذا هو اختبار ثبات النص.
Plain1إطار واحد من أنمي رياضي شونين حديث. رسوم متحركة ثنائية الأبعاد بتظليل مسطح، خطوط مرسومة 2باليد بوزن خط ثابت، تعبئة ألوان مسطحة، ظلال بيانية حادة، 3لا تظليل ثلاثي الأبعاد على الإطلاق ولا جلد فوتوريلي. لقطة قريبة لمهاجم مراهق أصلي: 4شعر أحمر داكن أشعث، قميص أبيض وأزرق داكن مع الرقم 9، عرق وأوساخ عشب على 5أحد الخدين، عينان واسعتان بتصميم exhausted، فم مفتوح في منتصف الصراخ. خلفه، 6أضواء كاشفة للملعب تتوهج في جدار من ألوان الجمهور الضبابية؛ خطوط سرعة شعاعية 7تنفجر من مركز الإطار؛ شفرة عشب واحدة معلقة في الهواء. لوحة ألوان مشبعة، 8ظلال سيان عميقة، إضاءة حافة برتقالية دافئة. تكوين 16:9، الشخصية مؤطرة يمين 9المركز، مساحة سلبية نظيفة على الثلث الأيسر. لا نص في أي مكان في الصورة.
الإعدادات: النموذج openai/gpt-image-2/text-to-image، الجودة high، الحجم 16:9 (2048x1152). لا شيء آخر.

ملعب GPT Image 2 على Atlas Cloud مع موجه إطار الصافرة الأخيرة وإطار الأنمي النهائي في لوحة الإخراج
GPT Image 2 على Atlas Cloud: الجودة مضبوطة على عالية، الإطار الرئيسي النهائي على اليمين.

إطار الأنمي الرئيسي الأساسي: مهاجم أصلي ذو شعر أحمر يصرخ تحت أضواء الملعب الكاشفة، بتظليل مسطح وألوان وخطوط سرعة
الإطار الرئيسي الذي يستقبله كلا النموذجين. ألوان مسطحة، ظلال صلبة، وثلث أيسر فارغ ينتظر بطاقة عنوان.
الخطوة 2: MiniMax H3 صورة إلى فيديو، كل شيء بأقصى إعدادات
نفس الصورة داخلة، 2K خارجة. أمسكت H3 عند 8 ثوانٍ هنا فقط لمطابقة سقف Veo. هذا ليس حد H3 والخطوة 4 تزيل الحد الأقصى.
Plain1أنمي ثنائي الأبعاد بتظليل مسطح، وزن خط مرسوم باليد، لون مسطح، لا تظليل ثلاثي الأبعاد. تثبيت على 2وجه المهاجم لوقفة واحدة، ثم حركة سريعة عنيفة تتبع الكرة بينما يسددها، 3الحركة السريعة تلطخ الإطار بمسارات حركة ساكوغا مخططة. إطار واحد من الصمت التام 4عند الاصطدام. على مدى الثانيتين الأخيرتين، نص عنوان ياباني أبيض عريض يقرأ 5ラストホイッスル يظهر على الثلث الأيسر من الإطار ويثبت بثبات، لا تشويه، 6لا وميض، لا انحراف. المهاجم يصرخ سطرًا واحدًا باليابانية: 「まだ終わってない!」 7الصوت: هدير الملعب يتصاعد، صوت اصطدام كرة حاد واحد، صوت تايكو منخفض تحت 8بطاقة العنوان.
الإعدادات: النموذج minimax/h3/image-to-video، resolution: 2K، duration: 8، ratio: adaptive (صورة إلى فيديو تأخذ شكل إطارها من صورة الإدخال)، image = مخرجات الخطوة 1.
تحذير واحد إذا انتقلت إلى النص إلى فيديو بدلاً من ذلك: اكتب ratio: 16:9 صراحة. الافتراضي هو 1:1 وسيعطيك بسعادة مقطع أنمي مربع.

ملعب MiniMax H3 صورة إلى فيديو على Atlas Cloud مع موجه الصافرة الأخيرة، الإطار الرئيسي محمل والمقطع النهائي في لوحة الإخراج
MiniMax H3 صورة إلى فيديو على Atlas Cloud: إطار الخطوة 1 محمل على اليسار، المقطع النهائي يعمل على اليمين.
الخطوة 3: Veo 3.1 صورة إلى فيديو، الصوت مشغل يدويًا
الموجه متطابق، كلمة بكلمة. غير صفة واحدة وسيتوقف عن كونها مقارنة. ما يتغير هو الحقل الإضافي الذي يعطيك إياه Veo وليس H3.
negative_prompt، الذي بالنسبة للأنمي ثنائي الأبعاد هو التحكم الأكثر فائدة في هذه القائمة:
Plain1عرض ثلاثي الأبعاد، CGI، تظليل بلاستيكي، جلد فوتوريلي، لقطات حية، 2حساء ضبابية الحركة، حروف مشوهة، نص غير مفهوم، أصابع إضافية، شريط ترجمة
الإعدادات: النموذج google/veo3.1/image-to-video، resolution: 1080p (غيّره، الافتراضي هو 720p)، duration: 8 (هذا هو السقف)، aspect_ratio: 16:9، generate_audio: true (الافتراضي في API هو false، هذا هو فخ المقطع الصامت)، seed: 20260807، image = نفس مخرجات الخطوة 1.

ملعب Veo 3.1 صورة إلى فيديو على Atlas Cloud يظهر تشغيل توليد الصوت، إطار الأنمي محمل والمقطع النهائي في لوحة الإخراج
Veo 3.1 صورة إلى فيديو على Atlas Cloud، مع تشغيل توليد الصوت والمقطع النهائي على اليمين.
الخطوة 4: تقييمه على خمسة محاور خاصة بالأنمي
لا شيء لتوليده هنا. فقط انظر، على الأشياء التي ينكسر فيها الأنمي حقًا. كلا المقطعين مضمنان بالقرب من أعلى هذه المقالة، لذا يمكنك تقييمهما بنفسك بدلاً من أخذ كلامي.

جنبًا إلى جنب للإطار النهائي من كلا المقطعين، MiniMax H3 على اليسار مع حروف عنوان يابانية نظيفة، Veo 3.1 على اليمين مع أحرف عمودية مشوهة
الإطار الأخير من كل مقطع. على اليسار، كتب H3 ラストホイッスル، جميع الكانا الثمانية صحيحة وثابتة. على اليمين، كتب Veo 3.1 ثلاثة أحرف ليست الكلمة المطلوبة ولا تشكل كلمة.
بطاقة العنوان هي حيث حُسمت الجولة، ولم تكن قريبة. عرض H3 الكانا المطلوبة بالضبط، صلبة الحواف وثابتة، فوق حركة سريعة مخططة لمرمى المرمى. أنتج Veo 3.1 كومة رأسية من ثلاثة أحرف ليست الكلمة المطلوبة ولا كلمة. على نفس الإطار، أسقط أيضًا الشخصية خارج اللقطة وترك الخلفية تنزلق نحو لوحة ملعب شبه فوتوريلية، على الرغم من وجود photorealistic skin و 3D render في الموجه السلبي.
الجدول 3: خمسة محاور تحدد لقطة أنمي، من هذين التشغيلين
| المحور | MiniMax H3 | Veo 3.1 |
|---|---|---|
| استمرارية الشخصية من الإطار الرئيسي | أمسك بالوجه والشعر والقميص بالضبط لمدة 8 ثوانٍ كاملة | أعاد رسم الشخصية في لقطة واسعة جديدة، على النموذج ولكن برسم مختلف |
| وزن الخط والتظليل المسطح للخلايا | ثابت، لا انحراف نحو ثلاثي الأبعاد | ثابت في اللقطة المتوسطة، انحرف نحو لوحة ملعب فوتوغرافية بحلول النهاية |
| بطاقة العنوان اليابانية | ラストホイッスル عرضت بشكل صحيح وثابتة | ثلاثة أحرف، ليست الكلمة المطلوبة، ليست كلمة |
| المسار الصوتي المسلّم | 32 كيلوهرتز ستيريو، تمامًا كما تنص بطاقة النموذج | 48 كيلوهرتز ستيريو، موجود فقط لأنني قمت بتعيين generate_audio بنفسي |
| الحركة السريعة وطمس الساكوغا | نُفذت كحركة سريعة ملطخة إلى العنوان | استُبدلت بقصة حادة إلى إعداد جديد |
الصف الأخير هو النقد العام الأكثر صخبًا لـ H3 حتى الآن، وهو بالضبط سبب كتابته في كلا الموجهين. في خيط ComfyUI في اليوم الأول، اشتكى المستخدم fwip من أنه حتى الموجهات التجريبية الرسمية تم تجاهلها: "حركة سريعة عنيفة من على السطح تلطخ الكلمات العائمة بعيدًا معها، مع خطوط حركة. والفيديو ببساطة لم يفعل أيًا من ذلك الانتقال على الإطلاق، لقد استبدله بقصة."
في هذا التشغيل، كان Veo هو من استبدل الحركة السريعة بقصة، و H3 هو من قام بالتلطيخ. لقطة واحدة لكل منهما ليست حكمًا، ولن أدعي غير ذلك. لكن هذا يعني أن النقد ليس خاصًا بـ H3: الحركات السريعة هي أقل تعليمات موثوقة في هذا الاختبار بأكمله على كلا الجانبين. إذا كان لوحة القصة الخاصة بك تعتمد على واحدة، فخطط حولها وليس من خلالها.
الخطوة 5: لقطة OVA القديمة 4:3 التي لا يمكن لـ Veo 3.1 إخراجها هيكليًا
هذا ليس تفضيلًا للجودة. إنه جدار. تعداد aspect_ratio في Veo له قيمتان وليس أيًا منهما 4:3، وتعداد duration ليس لديه 12. مظهر OVA التسعينيات ببساطة غير قابل للتحقيق.
Plain1لقطة أنمي OVA من التسعينيات، 4:3 إطار كامل. خلفية مرسومة يدويًا مع نسيج فرشاة مرئي، 2شخصيات مرسومة على السيلولويد بخطوط حبر سميكة غير متساوية، توهج هالة كثيف حول 3الأضواء الكاشفة، حبيبات فيلم 16 مم واهتزاز بوابة خفيف. نفس المهاجم ذو الشعر الأحمر 4بقميص أبيض وأزرق داكن رقم 9 يمشي خارج ملعب مبلل بالمطر بينما يخفت ضجيج الجمهور إلى 5نغمة رنين واحدة. الكاميرا تدفع ببطء نحو وجهه. يقول بهدوء باليابانية: 6「次は、勝つ」. لوحة قديمة: أخضر مزرق خافت، كهرماني مغبر، ظلال عنابي عميق. الصوت: 7مطر بعيد، وسادة توليف تماثلية وحيدة، صافرة واحدة ذات صدى ثقيل في المسافة البعيدة.
الإعدادات: النموذج minimax/h3/text-to-video، resolution: 2K، duration: 12، ratio: 4:3. اضبط هذه النسبة يدويًا، تذكر الافتراضي.

ملعب MiniMax H3 نص إلى فيديو على Atlas Cloud مع موجه OVA مكتوبًا والمقطع القديم النهائي في لوحة الإخراج
MiniMax H3 نص إلى فيديو على Atlas Cloud، موجه OVA مكتوب، المقطع مكتمل. الإفصاح الكامل: هذا التشغيل بالذات ترك نسبة الأبعاد عند 16:9 والمدة عند 8، لذا ما تراه على اليمين هو النسخة القصيرة ذات الشاشة العريضة. المقطع 4:3 لمدة اثنتي عشرة ثانية أدناه جاء من استدعاء API مع ratio: 4:3 و duration: 12 مضبوطين صراحة.

لقطة OVA القديمة 4:3: نفس المهاجم يمشي خارج ملعب مبلل بالمطر بأسلوب أنمي التسعينيات
H3 نص إلى فيديو، 4:3، 12 ثانية. الملف المسلّم عاد بحجم 1920x1440، وهو 4:3 بالبكسل، مع مسار صوت 32 كيلوهرتز ستيريو. معروض هنا كصورة GIF صامتة بمعدل إطارات منخفض للحفاظ على خفة الصفحة. تم الإنشاء باستخدام minimax/h3/text-to-video على Atlas Cloud.
الخطوة 6: تسع صور مرجعية، شخصية واحدة، أربع لقطات
اتساق الشخصية عبر اللقطات هو أصعب مشكلة في أنمي الذكاء الاصطناعي، ويتم حلها بحجم المرجع. قم ببناء الحزمة أولاً: أعد تشغيل موجه الخطوة 1 مع تبديل التأطير للأمام، ثلاثة أرباع، ملف جانبي كامل، خلف، ضاحك، أسنان مشدودة، وقفة كاملة الجسم، تفاصيل القميص وتفاصيل الحذاء. تسع صور، حوالي ثمانية سنتات إجمالاً.

أربع زوايا لنفس شخصية المهاجم الأصلية تم إنشاؤها كحزمة مرجعية، مرتبة في شبكة 2×2
أربع من الزوايا المرجعية التسع. H3 يقبل حتى 9 صور في حزمة مرجعية واحدة، بالإضافة إلى مراجع فيديو وصوتية فوق ذلك.
Plain1أنمي ثنائي الأبعاد بتظليل مسطح، وزن خط ثابت مرسوم باليد، لون مسطح، لا تظليل ثلاثي الأبعاد. حافظ على 2وجه المهاجم المرجعي، صورة ظلية للشعر وقميص رقم 9 متطابقين عبر كل لقطة. 3أربع لقطات في لقطة واحدة متواصلة: (1) دفع من زاوية منخفضة على حذائه يلامس العشب، 4(2) حركة سريعة لأعلى إلى لقطة قريبة ضيقة لعينيه، (3) لقطة واسعة له وهو يركض عبر ثلاثة 5مدافعين مرسومين كصور ظلية ضبابية، (4) تجميد على ضربة رأس في الهواء، خطوط سرعة 6تنفجر للخارج. الصوت: هدير الجمهور، نفس، تأثيرات حذاء على العشب، ضربة تايكو واحدة عند 7التجميد.
الإعدادات: النموذج minimax/h3/reference-to-video، refers = صورك مع type: image، resolution: 2K، duration: 8 أو أعلى، ratio: adaptive أو 16:9.
لا يمكن تشغيل ما يعادله في Veo 3.1 بهذه الإعدادات ولا تحتاج إلى تجربته لتعرف السبب. نقطة نهاية المرجع الخاصة به تقبل بحد أقصى ثلاث صور، واختيار نقطة النهاية تلك ينهار duration إلى قيمة قانونية واحدة وهي 8. حزمة من تسع صور ولقطة مدتها 10 ثوانٍ كلاهما خارج النطاق.

ملعب MiniMax H3 مرجع إلى فيديو على Atlas Cloud يظهر عداد المرجع عند 4 من 9 واللقطة الأولى في لوحة الإخراج
MiniMax H3 مرجع إلى فيديو على Atlas Cloud. العداد يقرأ Reference Materials (4/9) مع MAX:9 أسفله، وهو السقف في الواجهة وليس ادعاءً من ورقة مواصفات. الإخراج هو اللقطة الأولى، الدفع من زاوية منخفضة على الحذاء.
أربع تشغيلات إضافية لـ MiniMax H3 كمولّد فيديو أنمي تستحق التجربة
لقطة الصافرة الأخيرة تختبر فقط أربعة من الاختلافات. هذه الأربعة تختبر الباقي. كلها تعمل على H3؛ الملاحظات تقول أي منها يمكن لـ Veo 3.1 مطابقته.
- قتال ساكوغا فائق العرض،
21:9، 10 ثوانٍ. لا يمكن لـ Veo إخراج 21:9 على الإطلاق.
Plain1أكشن أنمي ثنائي الأبعاد بتظليل مسطح، خطوط حبر سميكة مدببة، لون مسطح، ظلال صلبة الحواف، 2لا تظليل ثلاثي الأبعاد. مبارزان ملثمان أصليان على سطح معبد تعصف به الرياح عند الغسق. اصطدام 3سيف، الإطار يهتز، كلا المقاتلين ينفصلان في انفجار من إطارات الاصطدام المرسومة باليد 4وخطوط السرعة الشعاعية. الكاميرا: دفع من زاوية منخفضة، ثم مسار جانبي، ثم 5لقطة سريعة إلى صورة ظلية عريضة ضد السماء البرتقالية. الصوت: اصطدامان معديان حادان، 6طقطقة قماش، ضربة تايكو منخفضة عند التجميد النهائي، لا موسيقى.
- لقطة AMV متزامنة مع الإيقاع، مرجع إلى فيديو مع مرجع صوتي. H3 يقبل حتى ثلاثة مقاطع صوتية كمدخل مرجعي. Veo 3.1 ليس لديه مدخل صوتي على الإطلاق، فقط إخراج صوتي.
Plain1مونتاج أنمي ثنائي الأبعاد بتظليل مسطح مقطوع إلى المسار الصوتي المرجعي. خمس إيقاعات قصيرة: مطر على 2نافذة، يد تشد ضمادة، أفق مدينة يمر بسرعة بجانب نافذة قطار، بداية عدو سريع، 3تجميد على يد ممدودة. كل لقطة تهبط بالضبط على إيقاع قوي للمسار الصوتي المرجعي. لون مسطح، خطوط حبر سميكة، 4لوحة ليلية عالية التباين من النيلي العميق والنيون الأرجواني.
- مشهد حوار ياباني من سطرين، 12 ثانية. هذا هو اختبار الإجهاد لمزامنة الشفاه، و 12 ثانية خارج نطاق Veo بالفعل.
Plain1أنمي ثنائي الأبعاد بتظليل مسطح، لون مسطح، لا تظليل ثلاثي الأبعاد. شخصيتان أصليتان على سطح في 2الساعة الذهبية، لقطة رد فعل متبادلة. الأولى تقول باليابانية:「本当に行くの?」. الثانية 3تجيب، بنصف ابتسامة، باليابانية:「もう決めた」. الأفواه تطابق كل مقطع. إضاءة حافة دافئة، ظلال طويلة، 4رياح لطيفة في الشعر. الصوت: صوتان يابانيان مميزان، مرور بعيد، زيز واحد.
- مقطع شونين عمودي،
9:16، 8 ثوانٍ. كلا النموذجين يمكنهما عمل العمودي، لذا هذا هو المكان الوحيد لمقارنتهما A/B بدلاً من الافتراض.
Plain1أنمي ثنائي الأبعاد بتظليل مسطح، تكوين عمودي. عداءة مراهقة أصلية تنفجر عبر 2لافتة ورقية في حركة بطيئة، ثم يعود الإطار إلى السرعة الكاملة بينما تتسارع 3على طول مضمار ملعب. خطوط سرعة، لون مسطح، ظلال صلبة، سماء بيانية جريئة. 4الكاميرا: لقطة متابعة من زاوية منخفضة، ثم حركة سريعة لأعلى إلى وجهها. الصوت: تمزق اللافتة، 5موجة جمهور، نفس واحد محبوس ثم يخرج.
إذا كنت تريد قواعد النحو الخاصة بالموجهات وراء هذه، دليل موجهات MiniMax H3 يتعمق أكثر في كيفية تحليل H3 لتعليمات الكاميرا والصوت أكثر مما يمكنني هنا.
كم تكلفة افتتاحية أنمي مدتها 60 ثانية على MiniMax H3 مقابل Veo 3.1
افتتاحية الأنمي القياسية تبلغ حوالي 90 ثانية. دعنا نقول ثماني لقطات مدة كل منها 8 ثوانٍ، 64 ثانية من الفيديو النهائي، بالإضافة إلى إطار رئيسي واحد لكل لقطة بتكلفة $0.009 لكل منها.
هناك تباين حقيقي في التسعير يجب أن تعرفه بدلاً من أن أتجاهله. كتالوج Atlas Cloud يسرد MiniMax H3 بسعر $0.10 في الثانية الثابت، بينما يوزعه ملف readme للنموذج على أنه $0.14/ثانية عند 2K و $0.10/ثانية عند 768P. Veo 3.1 مسجل بسعر $0.20 في الثانية، بينما يفرق ملف readme الخاص به بين $0.40/ثانية مع الصوت و $0.20/ثانية بدونه.
أزرار التشغيل في لقطات الشاشة الخاصة بي تحسم الأمر. H3 مرجع إلى فيديو، 8 ثوانٍ عند 2K، عرض Run $1.12، وهو بالضبط $0.14 في الثانية. Veo 3.1 صورة إلى فيديو، 8 ثوانٍ بدقة 1080p مع الصوت، عرض Run $3.2، وهو بالضبط $0.40 في الثانية. لذا فإن أسعار ملف readme هي التي يتم الفوترة بها، وعنوان الكتالوج هو الطبقة الدنيا. لقد عرضت كلا القراءتين أدناه على أي حال. هذه أسعار قائمة اعتبارًا من أغسطس 2026.
الجدول 4: ثماني لقطات مدة كل منها 8 ثوانٍ، بما في ذلك الإطارات الرئيسية
| الإعداد | تكلفة الفيديو (سعر الكتالوج) | تكلفة الفيديو (سعر readme) | الإطارات الرئيسية | النطاق الإجمالي |
|---|---|---|---|---|
| MiniMax H3، 2K | $6.40 | $8.96 | $0.07 | $6.47 إلى $9.03 |
| MiniMax H3، 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1، 1080p مع صوت | $12.80 | $25.60 | $0.07 | $12.87 إلى $25.67 |
| Veo 3.1 Lite، 720p | $3.20 | $3.20 | $0.07 | $3.27 |
الأسعار مأخوذة من صفحات نماذج Atlas Cloud المرتبطة في الجدول 1، أغسطس 2026. لا شيء من هذه الأربعة مخفض حاليًا.
شيئان لا يتضمنهما هذا الجدول، وكلاهما يؤثر بقوة أكبر من السعر في الثانية.
إعادة المحاولة. لا أحد يشحن اللقطة الأولى من لقطة أنمي. أي مضاعف تفترضه، طبقه على كلا العمودين وتتسع الفجوة بنفس النسبة.
الوقت الفعلي، وهذا يسير في الاتجاه الآخر. تم التوقيت من البداية إلى النهاية في 7 أغسطس 2026: H3 عند 2K لمدة 8 ثوانٍ استغرق 447 ثانية، حوالي 7.5 دقيقة. H3 نص إلى فيديو عند 2K لمدة 12 ثانية استغرق 334 ثانية. Veo 3.1 عند 1080p لمدة 8 ثوانٍ مع الصوت استغرق 152 ثانية، أقل من ثلاث دقائق. Veo أسرع بحوالي ثلاث مرات إلى أول لقطة هنا، وإذا كنت تكرر على لقطة في الساعة 2 صباحًا، فهذا يستحق أموالًا حقيقية. قوائم الانتظار تتحرك، لذا تعامل مع هذه كلقطة واحدة بعد الظهر وليس كمواصفة. لكن أي شخص يقتبس "2 إلى 3 دقائق" لـ H3 عند 2K يقتبس ملف readme، وليس قائمة انتظار. تفصيل 2K مقابل 768P يغطي متى يكون المستوى الأعلى يستحق الدقائق الإضافية.
أسلوب الأنمي، التكريم، وما يمكنك نشره فعليًا
كل شيء في هذه المقالة هو أسلوب وتكريم. شخصية أصلية، قميص أصلي، عنوان أصلي. لم يتم إنشاء أو طلب أي شخصية أنمي رسمية، ولم يتم استخدام اسم أو صورة أي لاعب كرة قدم حقيقي. يتم الإشارة إلى اتجاه كأس العالم كـ تنسيق، لأن هذا هو ما هو مفيد من أجله.
هذا التمييز ليس زخرفة. إذا كنت تنتج محتوى بأسلوب الأنمي تجاريًا، "على غرار OVA التسعينيات" و "هذه الشخصية المحددة من هذا العرض المحدد" هما كائنان قانونيان مختلفان، وواحد فقط منهما هو عمل تجاري.
بخصوص الأوزان المفتوحة: H3 قابل للتحميل حقًا، وقام الأشخاص بتشغيله في اليوم الأول. أحد المعلقين أبلغ عن 10 دقائق لمقطع 480p مدته 10 ثوانٍ على بطاقة 4070 Ti Super بسعة 16 جيجابايت، وآخرون نشروا 3 دقائق على 5080 و 68 ثانية على RTX 6000 Pro. لكن الاستضافة الذاتية تعمل بحافة قصيرة 768؛ مراحل Context-IR و Regenerate-2K التي تنتج 2K تبقى على جانب API.
الترخيص له عائق حقيقي. الترخيص المجتمعي لا يغطي حاليًا الاتحاد الأوروبي، المملكة المتحدة، كوريا الجنوبية أو الولايات المتحدة، مستشهدًا بمناطق "تطبق أو تنفذ حاليًا لوائح تتعلق بالذكاء الاصطناعي". قناة طلب الترخيص الرسمية مفتوحة، والتي لخصها أحد معلقي HN بأنها "عليك فقط أن تعد بوعد صغير بأنك لن تغضب ديزني وسيرسلون لك ترخيصًا". مضحك، وأيضًا بالضبط خطوة الامتثال التي لا يمكنك تخطيها إذا كنت في إحدى هذه المناطق الأربع. مقال الأوزان المفتوحة يحتوي على قائمة المناطق الكاملة.
الأسئلة المتكررة
هل MiniMax H3 مولد فيديو أنمي جيد مقارنة بـ Veo 3.1؟
بالنسبة لمعظم أعمال الأنمي، H3، وذلك لأسباب لا تتعلق بالعرض. فهو يعمل من 4 إلى 15 ثانية مقابل 4 أو 6 أو 8 لـ Veo، ويقدم ست نسب أبعاد بما في ذلك 4:3 و 21:9 مقابل نسبتين لـ Veo، ويدرج اليابانية بين 11 لغة حوار مستقرة أصلية، ويستقبل تسع صور مرجعية مقابل ثلاث لـ Veo. Veo 3.1 يفوز في موقف واحد محدد: عندما تحتاج إلى seed لإعادة التشغيل القابلة للتكرار، أو negative_prompt لمنع لقطة من الانزلاق نحو تظليل العرض ثلاثي الأبعاد. H3 ليس لديه أي من المعاملين. إذا كان خط أنابيبك يعتمد على أي منهما، فهذا سبب حقيقي للبقاء.
هل يمكن لـ Veo 3.1 توليد أنمي بنسبة 4:3 أو مقطع مدته 15 ثانية؟
لا، وليس لأسباب أسلوبية. تعداد aspect_ratio في Veo 3.1 يحتوي بالضبط على 16:9 و 9:16، وتعداد duration يحتوي بالضبط على 4 و 6 و 8. لا توجد قيمة 4:3 للاختيار ولا توجد طريقة لطلب 12 أو 15 ثانية. إذا كان مرجعك هو أنمي تلفزيوني أو OVA من التسعينيات، فإن التأطير خارج متناول Veo ومتاح على H3.
لماذا عاد مقطع الأنمي الخاص بي على Veo 3.1 صامتًا؟
لأن generate_audio افتراضي على false في API. عادةً ما يكون مفتاح الملعب قيد التشغيل بالفعل، لذا هذا يعض فقط الأشخاص الذين يتصلون بـ API مباشرة. اضبط generate_audio: true صراحة. أثناء وجودك هناك، اضبط resolution أيضًا، لأنه افتراضي على 720p بدلاً من 1080p أو 4k التي ربما قصدتها.
هل يقوم MiniMax H3 بالحوار الياباني ومزامنة الشفاه للأنمي؟
نعم. بطاقة النموذج تدرج 11 لغة مع دعم حوار مستقر: العربية، الصينية، الإنجليزية، الفرنسية، الألمانية، الإيطالية، اليابانية، الكورية، البرتغالية، الروسية والإسبانية. يتم توليد الصوت مع الصورة بتردد 32 كيلوهرتز ستيريو بدلاً من الدبلجة اللاحقة، ولهذا السبب يستمر توقيت الفم عبر سطر كامل بدلاً من المقاطع الأولى فقط. اكتب السطر الياباني مباشرة في الموجه باليابانية.
كم عدد الصور المرجعية التي يمكنني استخدامها للحفاظ على اتساق شخصية الأنمي؟
MiniMax H3 يقبل حتى 9 صور، وحتى 3 مقاطع فيديو وحتى 3 مقاطع صوتية، مع سقف صارم يبلغ 12 ملفًا عبر جميع الأنواع. نقطة نهاية المرجع إلى فيديو في Veo 3.1 تقبل من 1 إلى 3 صور، واختيارها ينهار duration إلى 8 كالقيمة القانونية الوحيدة. بالنسبة لشخصية أنمي متكررة عبر سلسلة، هذا الاختلاف هو كل شيء.
MiniMax H3 لديه أوزان مفتوحة، لذا هل يمكنني تشغيل خط أنابيب الأنمي الخاص بي محليًا مجانًا؟
يمكنك تنزيله وتشغيله، مع ثلاثة تحذيرات. الاستدلال المستضاف ذاتيًا يعمل بحافة قصيرة 768، ومراحل Context-IR و Regenerate-2K التي تنتج 2K تبقى على جانب API. تتراوح السرعات المحلية الحقيقية على نطاق واسحسب البطاقة: حوالي 10 دقائق لمقطع 480p مدته 10 ثوانٍ على 4070 Ti Super، حوالي 3 دقائق على 5080، حوالي 68 ثانية على RTX 6000 Pro، وفقًا لخيط ComfyUI في اليوم الأول. والترخيص المجتمعي لا يغطي حاليًا الاتحاد الأوروبي، المملكة المتحدة، كوريا الجنوبية أو الولايات المتحدة، لذا إذا كنت في إحدى هذه المناطق، فأنت بحاجة إلى الترخيص الرسمي قبل الاستخدام التجاري.






