طوال الصيف، كانت خلاصتي تعرض نفس الفيديو في حلقة مكررة. لاعبو كأس العالم يُعاد رسمهم كأبطال شونين. ديكتاتور. قبطان قراصنة. معلم مخضرم يظهر في آخر أربع ثوانٍ. ملايين المشاهدات لكل منشور، والقصة تتحدث بعد كل مباراة تقريباً.
لا أحد من صنّاع تلك الفيديوهات يكتب منشورات معيارية. هم يختارون نموذجاً، يحرقون الرصيد، وينشرون قبل انطلاق المباراة التالية.
لذا أخذت إطاراً مفتاحياً واحداً من الأنمي وموجهاً واحداً، واختبرت MiniMax H3 كأداة لتوليد فيديو الأنمي ضد Veo 3.1، مع دفع كلاهما إلى أقصى إعداداته على مدخلات متطابقة.
أول ما انكسر لم يكن جودة الصورة. بل قائمة منسدلة. Veo 3.1 يتوقف عند 8 ثوانٍ ويقدم نسبتي أبعاد فقط. لقطة تثبت على وجه، ثم انتقال سريع مع الكرة، ثم تسمح لبطاقة عنوان بالظهور لا تناسب 8 ثوانٍ. لم تكن لديها فرصة أصلاً للفشل في الجودة.
الخلاصات الرئيسية
- تعداد
durationفي Veo 3.1 هو[4, 6, 8]وتعدادaspect_ratioهو[16:9, 9:16]. بينما يدير MiniMax H3 أي ثانية كاملة من 4 إلى 15 ويقدم21:9, 16:9, 4:3, 1:1, 3:4, 9:16. غياب 4:3 في Veo يعني غياب التأطير الرجعي OVA نهائياً. - بطاقة نموذج H3 تسرد 11 لغة حوار مستقرة أصلياً واليابانية واحدة منها. الصوت والصورة يولَّدان معاً بستيريو 32 كيلوهرتز، وليسا مدبلجين لاحقاً.
- حزم المراجع ليست متقاربة: H3 يقبل حتى 9 صور بالإضافة إلى 3 فيديوهات و3 مقاطع صوتية (12 ملفاً كحد أقصى). نقطة نهاية المراجع في Veo 3.1 تأخذ 3 صور، وبمجرد استخدامها ينهار
durationإلى[8]فقط. - فخّان يفسدان الاختبارات بصمت: واجهة Veo API تجعل
generate_audioافتراضياً علىfalseوresolutionعلى720p، وratioفي نص-إلى-فيديو H3 افتراضياً على1:1. اتركهما كما هما وستقارن مقطع 720p صامتاً بمقطع مربع. - Veo 3.1 يحتفظ بشيئين لا يملكهما H3 إطلاقاً:
seedوnegative_prompt. بالنسبة لأنمي ثنائي الأبعاد، الثاني مهم فعلاً، وسأريكم أين.
مولّد فيديو الأنمي MiniMax H3 ضد Veo 3.1، نفس الإطار وجهاً لوجه
شخصية أصلية واحدة. إطار مفتاحي واحد. موجه واحد، منسوخ حرفاً بحرف إلى كلا النموذجين. كل شيء آخر في أقصى إعداداته على الجانبين.
MiniMax H3، صورة-إلى-فيديو، 2K، 8 ثوانٍ، صوت أصلي. شغّل الصوت: هدير الجمهور، ضربة الكرة والصرخة اليابانية تُولَّد في نفس المرور الذي تُولَّد فيه الصورة. تم التوليد بـ minimax/h3/image-to-video على Atlas Cloud.
Veo 3.1، صورة-إلى-فيديو، 1080p، 8 ثوانٍ، مع تفعيل generateaudio يدوياً، وإضافة negativeprompt تثبّت الخطوط مسطحة. نفس الإطار الأول، نفس الكلمات. تم التوليد بـ google/veo3.1/image-to-video على Atlas Cloud.
كلاهما يرسم بشكل جميل. اللقطة الواسعة من Veo للضربة، مع خطوط تأثير مرسومة يدوياً ومؤثر صوتي مانغا يطفو في الهواء، جميلة فعلاً. تلك هي نقطة البداية الصادقة، ولهذا السبب بقية هذا المقال عن المعاملات واتباع التعليمات بدلاً من الانطباعات.
لماذا تفشل معظم اختبارات مولّد فيديو الأنمي MiniMax H3 ضد Veo 3.1
حدث أمران في نفس الوقت هذا الصيف.
أصبح الأنمي الشكل الأعلى حجماً في فيديو الذكاء الاصطناعي. أُعيدت كتابة كأس العالم 2026 كبطولة شونين، مع اختيار اللاعبين كديكتاتور، وقبطان قراصنة، وجنرال بحري ومعلم، وخطوط قصصية "تتطور بعد كل مباراة تقريباً" عبر تيك توك وإنستغرام وإكس ويوتيوب (Complex، يوليو 2026).
وفي نفس الوقت، صدر MiniMax H3 بأوزان مفتوحة. خيط ComfyUI في اليوم الأول وصل إلى 330 نقطة و95 تعليقاً، مع نشر الناس لأرقام محلية حقيقية خلال ساعات (Hacker News، أغسطس 2026).
اجمع هذين معاً وستتوقع كومة من مقارنات الأنمي. لا يوجد أي منها تقريباً، لأن معظم الاختبارات تُبنى بشكل خاطئ بإحدى أربع طرق.
يقارنون الصور، وليس القيود. لقطات الأنمي مسألة توقيت. الانتقال السريع إلى بطاقة عنوان هو مشكلة مدة قبل أن يكون مشكلة عرض.
ينسون أن واجهة Veo صامتة افتراضياً. في الـ API، generate_audio هو false وresolution هو 720p. الكثير من منشورات "Veo ليس لديه صوت في الأنمي" هي مجرد شخص لم يقلب متغيراً منطقياً.
ينسون أن نص-إلى-فيديو H3 مربع افتراضياً. ratio افتراضي على 1:1 وليس 16:9. شغّل موجه أنمي t2v دون ضبطه وستحصل على مقطع مربع واستنتاج مشوش.
يختبرون بموجهات واقعية ضوئياً. "سينمائي، إضاءة حجمية، عمق مجال ضحل" هو بالضبط المفردات التي تسحب نموذجاً ثنائي الأبعاد نحو تظليل عرض ثلاثي الأبعاد. نمط الفشل في الأنمي ليس الضبابية. بل اللمعان البلاستيكي.
الإعدادات الثلاثة التي تحسم اختبار الأنمي قبل أن تضغط تشغيل
قبل أي شيء آخر، اضبط هذه على الجانبين وإلا كانت المقارنة لاغية.
| الإعداد | MiniMax H3 | Veo 3.1 | ماذا يحدث إذا تجاهلته |
|---|---|---|---|
| الصوت | يُولَّد مع الصورة، يعمل دائماً | generate_audio افتراضي على false | يعيد Veo مقطعاً صامتاً ويبدو أسوأ مما هو عليه |
| شكل الإطار | ratio افتراضي على 1:1 في نص-إلى-فيديو | aspect_ratio افتراضي على 16:9 | يعطيك H3 لقطة أنمي مربعة لا يمكنك استخدامها |
| الدقة | افتراضية على 2K | افتراضية على 720p | تقارن 2K ضد 720p وتسميها فجوة جودة |
ورقة مواصفات MiniMax H3 ضد Veo 3.1 للأنمي: المدة، النسبة، الصوت، المراجع
سحبت مخططات المدخلات الحية لكلا النموذجين بدلاً من الثقة بأي منشور إطلاق. كل قيمة أدناه تعداد يمكنك قراءته بنفسك على صفحات النموذج، وليس انطباعاً.
الجدول 1: MiniMax H3 ضد Veo 3.1، المعاملات التي تحسم لقطة الأنمي
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| المدة | 4 إلى 15، كل ثانية كاملة (الافتراضي 8) | 4، 6، 8 (الافتراضي 8) |
| نسب الأبعاد | 21:9، 16:9، 4:3، 1:1، 3:4، 9:16 | 16:9، 9:16 |
| النسبة الافتراضية (نص-إلى-فيديو) | 1:1 | 16:9 |
| الدقة | 768P، 2K (الافتراضي 2K) | 720p، 1080p، 4k (الافتراضي 720p) |
| الصوت | يُولَّد بشكل مشترك، ستيريو 32 كيلوهرتز | generate_audio، افتراضي على false |
| لغات الحوار الأصلية | 11 لغة مستقرة، اليابانية ضمنها | غير منشورة كقائمة مستقرة |
| حزمة المراجع | حتى 9 صور، 3 فيديوهات، 3 مقاطع صوتية، 12 ملفاً إجمالاً | 3 صور |
| المدة عند استخدام المراجع | لا تزال 4 إلى 15 | تنهار إلى 8 فقط |
| seed | غير متاح | متاح |
| negative_prompt | غير متاح | متاح |
| الأوزان | قابلة للتنزيل | مغلقة |
المدة، النسبة، الدقة، الصوت وحدود المراجع مقروءة من المخططات الحية على صفحات MiniMax H3 صورة-إلى-فيديو، وH3 نص-إلى-فيديو، وH3 مرجع-إلى-فيديو، وVeo 3.1 صورة-إلى-فيديو وVeo 3.1 مرجع-إلى-فيديو. سقف الصور التسع والملفات الاثني عشر وقائمة اللغات الإحدى عشرة من بطاقة نموذج MiniMax H3 (Hugging Face، أغسطس 2026).
الآن لوحات النتائج، لأنها تقول شيئاً مختلفاً عن ورقة المواصفات وكلاهما مهم.
الجدول 2: إيلو تصويت الجمهور وسعر القائمة في الدقيقة، لقطة من 7 أغسطس 2026
| النموذج | نص-إلى-فيديو (مع الصوت) | صورة-إلى-فيديو (مع الصوت) | $/دقيقة |
|---|---|---|---|
| Gemini Omni Flash | 1,244 (#1) ±7 | 1,191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1,238 (#2) ±9 | 1,190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1,224 (#3) ±6 | 1,198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1,111 (#7) ±6 | غير مدرج في العشرة الأوائل | $20.16 |
| Veo 3.1 | 1,093 (#11) ±7 | 1,085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1,091 (#14) ±6 | غير مدرج في العشرة الأوائل | $9.00 |
| Veo 3.1 Lite | 1,089 (#15) ±7 | غير مدرج في العشرة الأوائل | $4.80 |
أرقام الإيلو والسعر من Artificial Analysis Video Arena (Artificial Analysis، أغسطس 2026). هذه تصويتات جمهور متجددة وتتحرك. عمود $/دقيقة هو تقدير نموذجي معياري، وليس فاتورتك.
فجوة إيلو بـ145 نقطة كبيرة، لكنها تصويت عام، وليس تصويت أنمي. وهذا الجزء الذي يجب أن أقوله بوضوح: MiniMax لا تسوق H3 كنموذج أنمي. قائمة الملاحظات الداخلية من السطر الأول تذكر الفيلم والرسوم المتحركة والدراما المصورة كمجالات H3 غير موجه إليها. لذا السؤال المثير ليس "أيهما نموذج الأنمي". بل لماذا النموذج الذي لا يبيع نفسه كأنمي لا يزال يفوز باللقطة، وأين ما زال Google يربح الجولة.
ملاحظة عملية واحدة قبل البرنامج التعليمي. كل نموذج أدناه يعمل عبر نفس الكونسول ونفس مفتاح API، وهو السبب الوحيد الذي يجعل المعاملات قابلة للمقارنة أصلاً. نفس الطابور، نفس المصادقة، فاتورة واحدة. إذا جهزت GPT Image 2 على خدمة وVeo على أخرى، فستجد أن نصف الاختلافات أنابيب وليست نموذجاً.
ابنِ اللقطة: MiniMax H3 ضد Veo 3.1، خطوة بخطوة
مثال واحد متواصل، من البداية إلى النهاية. "الصافرة الأخيرة": مهاجم مراهق أصلي، شعر أحمر، قميص رقم 9 أبيض وكحلي، أضواء كاشفة، انتقال سريع عند الضربة، وبطاقة عنوان يابانية يجب أن تظهر في آخر ثانيتين وتثبت بثبات.
لا لاعب حقيقي، لا شخصية رسمية، لا ملكية فكرية أنمي موجودة. أسلوب وتكريم فقط. المزيد عن السبب بعد قليل.
الخطوة 1: صمّم إطار الأنمي المفتاحي بـ GPT Image 2
الإطار المفتاحي يحمل التوجيه الفني حتى لا يضطر نموذج الفيديو لاختراعه. لاحظ المساحة السلبية في الثلث الأيسر: إنها متعمدة. بطاقة العنوان ستُكتب هناك بواسطة نموذج الفيديو، وهذا اختبار ثبات النص.
Plain1A single frame from a modern shonen sports anime. Cel-shaded 2D animation, hand-inked 2line art with consistent line weight, flat colour fills, hard-edged graphic shadows, 3absolutely no 3D shading and no photoreal skin. Close-up on an original teenage striker: 4messy dark-red hair, white-and-navy kit with the number 9, sweat and grass streaks across 5one cheek, eyes wide with exhausted determination, mouth open mid-shout. Behind him, 6stadium floodlights blaze into a wall of blurred crowd colour; radial speed lines burst 7from the centre of frame; one blade of grass hangs frozen in the air. Saturated palette, 8deep cyan shadows, warm orange rim light. 16:9 composition, the character framed right of 9centre, clean negative space on the left third. No text anywhere in the image.
الإعدادات: النموذج openai/gpt-image-2/text-to-image، الجودة high، الحجم 16:9 (2048x1152). لا شيء آخر.

ملعب GPT Image 2 على Atlas Cloud مع موجه إطار الصافرة الأخيرة المفتاحي والإطار الأنمي النهائي في لوحة الإخراج
GPT Image 2 على Atlas Cloud: الجودة مضبوطة على عالية، الإطار المفتاحي النهائي على اليمين.

إطار الأنمي المفتاحي الأساسي: مهاجم أصلي ذو شعر أحمر في منتصف صرخة تحت أضواء الملعب الكاشفة، بتظليل خلوي وألوان مسطحة وخطوط سرعة
الإطار المفتاحي الذي يستقبله كلا النموذجين. لون مسطح، ظلال صلبة، وثلث أيسر فارغ ينتظر بطاقة عنوان.
الخطوة 2: MiniMax H3 صورة-إلى-فيديو، كل شيء في أقصاه
نفس الصورة داخلاً، 2K خارجاً. أبقيت H3 عند 8 ثوانٍ هنا فقط ليطابق سقف Veo. هذا ليس حد H3 والخطوة 4 تزيل الغطاء.
Plain1Cel-shaded 2D anime, hand-inked line weight, flat colour, no 3D shading. Hold on the 2striker's face for one beat, then a violent whip pan follows the ball as he strikes it, 3the pan smearing the frame into streaked sakuga motion trails. One frame of total silence 4at impact. Over the final two seconds, bold white Japanese title lettering reading 5ラストホイッスル punches onto the left third of frame and holds rock-steady, no warping, 6no flicker, no drift. The striker shouts one line in Japanese: 「まだ終わってない!」 7Audio: stadium roar swelling, a single sharp ball-strike impact, a low taiko hit under the 8title card.
الإعدادات: النموذج minimax/h3/image-to-video، resolution: 2K، duration: 8، ratio: adaptive (صورة-إلى-فيديو تأخذ شكل الإطار من صورتك المدخلة)، image = مخرجات الخطوة 1.
تحذير واحد إذا اتجهت إلى نص-إلى-فيديو بدلاً من ذلك: اكتب ratio: 16:9 صراحةً. الافتراضي هو 1:1 وسيعطيك عن طيب خاطر لقطة أنمي مربعة.

ملعب MiniMax H3 صورة-إلى-فيديو على Atlas Cloud مع موجه الصافرة الأخيرة، الإطار المفتاحي محمّل والمقطع النهائي في لوحة الإخراج
MiniMax H3 صورة-إلى-فيديو على Atlas Cloud: إطار الخطوة 1 المفتاحي محمّل على اليسار، والمقطع النهائي يعمل على اليمين.
الخطوة 3: Veo 3.1 صورة-إلى-فيديو، مع تفعيل الصوت يدوياً
الموجه متطابق، كلمة بكلمة. غيّر صفة واحدة وسيتوقف عن كونه مقارنة. ما يتغير هو الحقل الإضافي الذي يمنحك إياه Veo ولا يمنحك إياه H3.
negative_prompt، وهو لأنمي ثنائي الأبعاد أكثر تحكم مفيد في هذه القائمة:
Plain13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
الإعدادات: النموذج google/veo3.1/image-to-video، resolution: 1080p (غيّره، الافتراضي 720p)، duration: 8 (هذا هو السقف)، aspect_ratio: 16:9، generate_audio: true (افتراضي الـ API هو false، هذا فخ المقطع الصامت)، seed: 20260807، image = نفس مخرجات الخطوة 1.

ملعب Veo 3.1 صورة-إلى-فيديو على Atlas Cloud يعرض تفعيل توليد الصوت، الإطار الأنمي المفتاحي محمّلاً والمقطع النهائي في لوحة الإخراج
Veo 3.1 صورة-إلى-فيديو على Atlas Cloud، مع تفعيل Generate Audio والمقطع النهائي على اليمين.
الخطوة 4: قيّمه على خمسة محاور خاصة بالأنمي
لا شيء لتوليده هنا. فقط انظر، إلى الأشياء التي ينكسر عليها الأنمي فعلاً. كلا المقطعين مضمّنان قرب أعلى هذا المقال، لذا يمكنك تقييمهما بنفسك بدلاً من أخذ كلامي.

جنباً إلى جنب للإطار الأخير من كلا المقطعين، MiniMax H3 على اليسار مع حروف عنوان يابانية نظيفة، Veo 3.1 على اليمين مع أحرف عمودية مشوشة
الإطار الأخير من كل مقطع. على اليسار، كتب H3 ラストホイッスル، كل أحرف الكاتاكانا الثمانية صحيحة وثابتة تماماً. على اليمين، أنتج Veo 3.1 ثلاثة أحرف ليست الكلمة المطلوبة ولا تشكل كلمة.
بطاقة العنوان هي حيث حُسمت الجولة، ولم تكن قريبة. عرض H3 الكاتاكانا المطلوبة بدقة، بحواف صلدة وثبات، فوق انتقال ممزق لمرمى المرمى. أنتج Veo 3.1 كومة رأسية من ثلاثة أحرف ليست الكلمة المطلوبة ولا كلمة. على نفس الإطار، أسقط الشخصية خارج اللقطة وترك الخلفية تنزلق نحو لوحة ملعب شبه واقعية ضوئياً، رغم وجود photorealistic skin و3D render في الموجه السلبي.
الجدول 3: خمسة محاور تحسم لقطة الأنمي، من هاتين المحاولتين
| المحور | MiniMax H3 | Veo 3.1 |
|---|---|---|
| استمرارية الشخصية من الإطار المفتاحي | حافظ على نفس الوجه والشعر والقميص طوال 8 ثوانٍ كاملة | أعاد رسم الشخصية في لقطة واسعة جديدة، على النموذج لكن برسم مختلف |
| وزن الخط والتظليل الخلوي المسطح | ثابت، بلا انجراف نحو ثلاثي الأبعاد | ثابت في اللقطة المتوسطة، انجرف إلى لوحة ملعب فوتوغرافية في النهاية |
| بطاقة العنوان اليابانية | ラストホイッスル عُرض بشكل صحيح وثبت بثبات | ثلاثة أحرف، ليست الكلمة المطلوبة، ولا كلمة |
| المسار الصوتي المسلّم | ستيريو 32 كيلوهرتز، تماماً كما تنص بطاقة النموذج | ستيريو 48 كيلوهرتز، موجود فقط لأنني ضبطت generate_audio بنفسي |
| الانتقال السريع ولطخة الساكوغا | نُفذ كمسار ممزق نحو العنوان | استُبدل بقصّة صلبة إلى لقطة جديدة |
ذلك الصف الأخير هو الانتقاد العام الأعلى صوتاً لـ H3 حتى الآن، وهو بالضبط سبب كتابتي له في كلا الموجهين. في خيط ComfyUI في اليوم الأول، اشتكى المستخدم fwip من أنه حتى النماذج التجريبية الرسمية تُتجاهل: "انتقال سريع عنيف من السطح يلطخ الكلمات العائمة معه، بآثار حركة ممزقة. والفيديو ببساطة لم ينفذ أياً من ذلك الانتقال إطلاقاً، بل استبدله بقصّة."
في هذه المحاولة، كان Veo هو من استبدل الانتقال بقصّة، وH3 هو من لطّخ. محاولة واحدة لكل منهما ليست حكماً، ولن أدّعي عكس ذلك. لكنه يعني أن الانتقاد ليس خاصاً بـ H3: الانتقالات السريعة هي أقل تعليمات موثوقية في هذا الاختبار بأكمله على أي من الجانبين. إذا كان لوح القصة لديك يعتمد على واحدة، خطط حولها وليس عبرها.
الخطوة 5: لقطة OVA الرجعية 4:3 التي لا يستطيع Veo 3.1 إخراجها بنيوياً
هذا ليس تفضيلاً جمالياً. إنه جدار. تعداد aspect_ratio في Veo له قيمتان ولا أي منهما 4:3، وتعداد duration لا يملك 12. مظهر الأوفا التسعينياتي ببساطة غير قابل للعنونة.
Plain1A 1990s OVA anime cut, 4:3 full-frame. Hand-painted background art with visible brush 2texture, cel-paint characters with thick uneven ink lines, heavy halation glow around the 3floodlights, 16mm film grain and faint gate weave. The same red-haired striker in a 4white-and-navy number 9 kit walks off a rain-soaked pitch as the crowd noise fades to a 5single ringing tone. Camera pushes in slowly on his face. He says quietly in Japanese: 6「次は、勝つ」. Retro palette: muted teal, dusty amber, deep maroon shadows. Audio: 7distant rain, a lone analogue synth pad, one reverb-heavy whistle in the far distance.
الإعدادات: النموذج minimax/h3/text-to-video، resolution: 2K، duration: 12، ratio: 4:3. اضبط النسبة يدوياً، تذكر الافتراضي.

ملعب MiniMax H3 نص-إلى-فيديو على Atlas Cloud مع كتابة موجه OVA والمقطع الرجعي النهائي في لوحة الإخراج
MiniMax H3 نص-إلى-فيديو على Atlas Cloud، موجه OVA مكتوب، المقطع مكتمل. إفصاح كامل: هذه المحاولة بالذات تركت Aspect Ratio عند 16:9 وDuration عند 8، لذا ما تراه على اليمين هو النسخة القصيرة ذات الشاشة العريضة. لقطة 4:3 ذات الاثنتي عشرة ثانية أدناه أتت من استدعاء API مع ratio: 4:3 وduration: 12 مضبوطين صراحةً.

لقطة OVA الرجعية 4:3: نفس المهاجم يخرج من ملعب مبتل بالمطر بأسلوب أنمي التسعينيات
H3 نص-إلى-فيديو، 4:3، 12 ثانية. الملف المسلّم عاد بحجم 1920x1440، وهو 4:3 بالبكسل، مع مسار ستيريو 32 كيلوهرتز. معروض هنا كـ GIF صامت بمعدل إطارات مخفض للحفاظ على خفة الصفحة. تم التوليد بـ minimax/h3/text-to-video على Atlas Cloud.
الخطوة 6: تسع صور مرجعية، شخصية واحدة، أربع لقطات
اتساق الشخصية عبر اللقطات هو أصعب مشكلة في أنمي الذكاء الاصطناعي، وتُحل بحجم المراجع. ابنِ الحزمة أولاً: أعد تشغيل موجه الخطوة 1 مع تبديل التأطير إلى أمامي، وثلاثة أرباع، وملف جانبي كامل، وخلفي، وضاحك، وأسنان مشدودة، ووقفة كاملة الجسم، وتفاصيل القميص وتفاصيل الحذاء. تسع صور، حوالي ثمانية سنتات إجمالاً.

أربع زوايا لنفس الشخصية المهاجمة الأصلية مولّدة كحزمة مراجع، مرتبة في شبكة اثنين في اثنين
أربع من زوايا المرجع التسع. يقبل H3 حتى تسع صور في حزمة مراجع واحدة، بالإضافة إلى مراجع فيديو وصوت فوقها.
Plain1Cel-shaded 2D anime, consistent hand-inked line weight, flat colour, no 3D shading. Keep 2the referenced striker's face, hair silhouette and number 9 kit identical across every cut. 3Four cuts in one continuous take: (1) low-angle push-in on his boots hitting the turf, 4(2) whip-pan up to a tight close-up of his eyes, (3) wide shot of him sprinting past three 5defenders drawn as blurred silhouettes, (4) freeze on a mid-air header, speed lines 6exploding outward. Audio: crowd roar, breath, boot-on-turf impacts, one taiko hit on the 7freeze.
الإعدادات: النموذج minimax/h3/reference-to-video، refers = صورك مع type: image، resolution: 2K، duration: 8 أو أعلى، ratio: adaptive أو 16:9.
المكافئ في Veo 3.1 لا يمكن تشغيله بهذه الإعدادات ولا تحتاج لتجربته لتعرف لماذا. نقطة نهاية المراجع الخاصة به تقبل حداً أقصى ثلاث صور، واختيار تلك النقطة ينهار duration إلى قيمة قانونية واحدة هي 8. حزمة من تسع صور ولقطة من 10 ثوانٍ كلاهما خارج النطاق.

ملعب MiniMax H3 مرجع-إلى-فيديو على Atlas Cloud يعرض عدّاد المراجع عند أربعة من تسعة وأول لقطة في لوحة الإخراج
MiniMax H3 مرجع-إلى-فيديو على Atlas Cloud. العدّاد يقرأ Reference Materials (4/9) مع MAX:9 تحته، وهو السقف في الواجهة وليس ادعاءً من ورقة مواصفات. الإخراج هو اللقطة الأولى، الدفع بزاوية منخفضة على الحذاء.
أربع محاولات إضافية لمولّد فيديو الأنمي MiniMax H3 تستحق التنفيذ
لقطة الصافرة الأخيرة تختبر فقط أربعة من الاختلافات. هذه الأربعة تختبر البقية. كلها تعمل على H3؛ الملاحظات تقول أيها يمكن لـ Veo 3.1 مجاراته.
- قتال ساكوغا فائق الاتساع،
21:9، 10 ثوانٍ. لا يمكن لـ Veo إخراج 21:9 إطلاقاً.
Plain1Cel-shaded 2D anime action, thick tapered ink lines, flat colour, hard-edged shadows, 2no 3D shading. Two original masked duelists on a windswept temple roof at dusk. Blade 3clash, the frame shudders, both fighters break apart in a burst of hand-drawn impact 4frames and radial speed lines. Camera: low-angle push-in, then a lateral track, then a 5snap to a wide silhouette against the orange sky. Audio: two sharp metal clashes, cloth 6snap, a low taiko hit on the final freeze, no music.
- لقطة AMV متزامنة مع الإيقاع، مرجع-إلى-فيديو مع مرجع صوتي. يقبل H3 حتى ثلاثة مقاطع صوتية كمدخل مرجعي. Veo 3.1 لا يملك أي مدخل صوتي إطلاقاً، فقط مخرج صوتي.
Plain1Cel-shaded 2D anime montage cut to the referenced audio track. Five short beats: rain on 2a window, a hand tightening a bandage, a city skyline flashing past a train window, a 3sprint start, a freeze on an outstretched hand. Every cut lands exactly on a downbeat of 4the referenced audio. Flat colour, thick ink lines, high-contrast night palette of deep 5indigo and neon magenta.
- مشهد حوار ياباني بسطرين، 12 ثانية. هذا اختبار الإجهاد لمزامنة الشفاه، و12 ثانية خارج نطاق Veo أصلاً.
Plain1Cel-shaded 2D anime, flat colour, no 3D shading. Two original characters on a rooftop at 2golden hour, shot reverse shot. First says in Japanese:「本当に行くの?」. The second 3answers, half-smiling, in Japanese:「もう決めた」. Mouths match every syllable. Warm rim 4light, long shadows, gentle wind in hair. Audio: two distinct Japanese voices, distant 5traffic, one cicada.
- عمل قصير شونين عمودي،
9:16، 8 ثوانٍ. كلا النموذجين يستطيعان العمودي، لذا هذا هو المكان الوحيد لإجراء A/B فعلي بينهما بدلاً من الافتراض.
Plain1Cel-shaded 2D anime, vertical composition. An original teenage runner bursts through a 2paper banner in slow-motion, then the frame snaps back to full speed as she accelerates 3down a stadium straight. Speed lines, flat colour, hard shadows, bold graphic sky. 4Camera: low-angle follow shot, then a whip up to her face. Audio: banner tear, crowd 5surge, one breath held then released.
إذا أردت القواعد النحوية للموجهات خلف هذه، فإن دليل موجهات MiniMax H3 يتعمق في كيفية تحليل H3 لتعليمات الكاميرا والصوت أكثر مما أستطيع هنا.
كم تكلف افتتاحية أنمي من 60 ثانية على MiniMax H3 ضد Veo 3.1
افتتاحية الأنمي القياسية حوالي 90 ثانية. اعتبرها ثماني لقطات من 8 ثوانٍ، أي 64 ثانية من الفيديو النهائي، بالإضافة إلى إطار مفتاحي واحد لكل لقطة بسعر $0.009 لكل واحدة.
هناك فارق تسعير حقيقي يجب أن تعرفه بدلاً من أن أتجاهله. كتالوج Atlas Cloud يسرد MiniMax H3 بسعر $0.10 في الثانية بشكل ثابت، بينما يوزعها ملف قراءة النموذج كالتالي: $0.14/ثانية بدقة 2K و$0.10/ثانية بدقة 768P. بينما يُسرد Veo 3.1 بسعر $0.20 في الثانية، وملف القراءة الخاص به يفصل $0.40/ثانية مع الصوت عن $0.20/ثانية بدونه.
أزرار التشغيل في لقطات الشاشة تحسم الأمر. H3 مرجع-إلى-فيديو، 8 ثوانٍ بدقة 2K، عرض Run $1.12، وهو بالضبط $0.14 في الثانية. Veo 3.1 صورة-إلى-فيديو، 8 ثوانٍ بدقة 1080p مع الصوت، عرض Run $3.2، وهو بالضبط $0.40 في الثانية. إذاً أسعار ملف القراءة هي التي تُفوتر، وعنوان الكتالوج هو المستوى الابتدائي. سأعرض كلا القراءتين أدناه على أي حال. هذه أسعار قائمة اعتباراً من أغسطس 2026.
الجدول 4: ثماني لقطات من 8 ثوانٍ، مع تضمين الإطارات المفتاحية
| الإعداد | تكلفة الفيديو (سعر الكتالوج) | تكلفة الفيديو (سعر ملف القراءة) | الإطارات المفتاحية | النطاق الإجمالي |
|---|---|---|---|---|
| MiniMax H3، 2K | $6.40 | $8.96 | $0.07 | $6.47 إلى $9.03 |
| MiniMax H3، 768P | $6.40 | $6.40 | $0.07 | $6.47 |
| Veo 3.1، 1080p مع الصوت | $12.80 | $25.60 | $0.07 | $12.87 إلى $25.67 |
| Veo 3.1 Lite، 720p | $3.20 | $3.20 | $0.07 | $3.27 |
الأسعار من صفحات نماذج Atlas Cloud المرتبطة في الجدول 1، أغسطس 2026. لا يوجد خصم على أي من هذه الأربعة حالياً.
أمران لا يشملها الجدول، وكلاهما يؤثر بقوة أكبر من السعر في الثانية.
إعادة المحاولات. لا أحد ينشر المحاولة الأولى للقطة أنمي. أي مضاعف تفترضه، طبّقه على العمودين وستتسع الفجوة بنفس النسبة.
الوقت الفعلي، وهذا يسير في الاتجاه الآخر. بقياس النهاية إلى النهاية في 7 أغسطس 2026: H3 بدقة 2K لمدة 8 ثوانٍ أخذ 447 ثانية، حوالي 7.5 دقائق. H3 نص-إلى-فيديو بدقة 2K لمدة 12 ثانية أخذ 334 ثانية. Veo 3.1 بدقة 1080p لمدة 8 ثوانٍ مع الصوت أخذ 152 ثانية، أقل من ثلاث دقائق. Veo أسرع بثلاث مرات تقريباً إلى أول محاولة هنا، وإذا كنت تكرر على لقطة في الثانية 2 صباحاً فهذا يستحق مالاً حقيقياً. الطوابير تتحرك، فتعامل مع هذا كلقطة من بعد ظهر واحد وليس كمواصفة. لكن أي شخص يذكر "دقيقتين إلى ثلاث" لـ H3 بدقة 2K يقتبس ملف قراءة، وليس طابوراً. تفصيل 2K ضد 768P يغطي متى يستحق المستوى الأعلى الدقائق الإضافية.
أسلوب الأنمي، التكريم، وما يمكنك نشره فعلاً
كل شيء في هذا المقال أسلوب وتكريم. شخصية أصلية، قميص أصلي، عنوان أصلي. لم يتم توليد أو طلب أي شخصية أنمي رسمية، ولم يُستخدم اسم أو ملامح أي لاعب كرة قدم حقيقي. موضة كأس العالم مذكورة كـ صيغة، لأن هذا ما هي مفيدة لأجله.
هذا التمييز ليس زخرفة. إذا كنت تنتج محتوى بأسلوب الأنمي تجارياً، فإن "بأسلوب أوفا التسعينيات" و"هذه الشخصية المحددة من هذا العرض المحدد" كائنان قانونيان مختلفان، وواحد منهما فقط عمل تجاري.
بخصوص الأوزان المفتوحة: H3 قابل للتنزيل فعلاً، وشغّله الناس في اليوم الأول. أبلغ أحد المعلقين عن 10 دقائق لمقطع 480p من 10 ثوانٍ على 4070 Ti Super بذاكرة 16GB، ونشر آخرون 3 دقائق على 5080 و68 ثانية على RTX 6000 Pro. لكن الاستضافة الذاتية تعمل بحافة قصيرة 768؛ مراحل Context-IR وRegenerate-2K التي تنتج 2K تبقى في جانب الـ API.
الترخيص له عيب حقيقي. الترخيص المجتمعي لا يغطي حالياً الاتحاد الأوروبي والمملكة المتحدة وكوريا الجنوبية والولايات المتحدة، مستشهداً بمناطق "تطور أو تنفذ حالياً لوائح متعلقة بالذكاء الاصطناعي". قناة طلبات ترخيص رسمية مفتوحة، لخّصها أحد معلقي HN كالتالي: "فقط عليك أن تعد بوعد صغير ألا تغضب ديزني وسيرسلون لك ترخيصاً". مضحك، وهو أيضاً بالضبط خطوة الامتثال التي لا يمكنك تخطيها إذا كنت في واحدة من تلك المناطق الأربع. الكتابة عن الأوزان المفتوحة لديها قائمة المناطق الكاملة.
الأسئلة الشائعة
هل MiniMax H3 مولّد فيديو أنمي جيد مقارنة بـ Veo 3.1؟
لمعظم أعمال الأنمي، نعم، H3، وبشكل أساسي لأسباب لا علاقة لها بالعرض. يعمل من 4 إلى 15 ثانية ضد 4 أو 6 أو 8 في Veo، ويقدم ست نسب أبعاد بما فيها 4:3 و21:9 ضد اثنتين في Veo، ويسرد اليابانية بين 11 لغة حوار مستقرة أصلياً، ويأخذ تسع صور مرجعية ضد ثلاث في Veo. يفوز Veo 3.1 في حالة واحدة محددة: عندما تحتاج seed لإعادة محاولات قابلة للتكرار، أو negative_prompt لمنع لقطة من الانجراف نحو تظليل عرض ثلاثي الأبعاد. H3 لا يملك أياً من المعلمتين. إذا كان خط إنتاجك يعتمد على أي منهما، فهذا سبب حقيقي للبقاء.
هل يمكن لـ Veo 3.1 توليد الأنمي بنسبة 4:3 أو مقطع من 15 ثانية؟
لا، وليس لأسباب أسلوبية. تعداد aspect_ratio في Veo 3.1 يحتوي بالضبط على 16:9 و9:16، وتعداد duration يحتوي بالضبط على 4 و6 و8. لا توجد قيمة 4:3 لاختيارها ولا طريقة لطلب 12 أو 15 ثانية. إذا كان مرجعك أنمي تلفزيوني أو OVA من التسعينيات، فالتأطير خارج المتناول على Veo ومتاح على H3.
لماذا عاد مقطع الأنمي الخاص بي من Veo 3.1 صامتاً؟
لأن generate_audio افتراضي على false في الـ API. مفتاح الملعب عادة ما يكون مفعلاً مسبقاً، لذا هذا يلدغ فقط من يستدعي الـ API مباشرة. اضبط generate_audio: true صراحةً. وبينما أنت هناك، اضبط resolution أيضاً، لأنه افتراضي على 720p وليس 1080p أو 4k التي ربما قصدتها.
هل يدعم MiniMax H3 الحوار والمزامنة الشفوية اليابانية للأنمي؟
نعم. بطاقة النموذج تسرد 11 لغة بدعم حوار مستقر: العربية، الصينية، الإنجليزية، الفرنسية، الألمانية، الإيطالية، اليابانية، الكورية، البرتغالية، الروسية والإسبانية. الصوت يُولَّد بشكل مشترك مع الصورة بستيريو 32 كيلوهرتز بدلاً من الدبلجة اللاحقة، وهذا سبب تماسك توقيت الفم عبر سطر كامل بدلاً من المقاطع الأولى. اكتب السطر الياباني مباشرة في الموجه باليابانية.
كم صورة مرجعية يمكنني استخدامها للحفاظ على اتساق شخصية الأنمي؟
يقبل MiniMax H3 حتى 9 صور، وحتى 3 مقاطع فيديو وحتى 3 مقاطع صوتية، بسقف صارم يبلغ 12 ملفاً عبر جميع الأنواع. نقطة نهاية مرجع-إلى-فيديو في Veo 3.1 تقبل 1 إلى 3 صور، واختيارها ينهار duration إلى 8 كقيمة قانونية وحيدة. لشخصية أنمي متكررة عبر سلسلة، هذا الفرق هو لعبة الكرة كلها.
MiniMax H3 له أوزان مفتوحة، فهل يمكنني تشغيل خط أنمي محلياً مجاناً؟
يمكنك تنزيله وتشغيله، مع ثلاثة تحفظات. الاستدلال المستضاف ذاتياً يعمل بحافة قصيرة 768، ومراحل Context-IR وRegenerate-2K التي تنتج مخرجات 2K تبقى في جانب الـ API. السرعات المحلية الواقعية تتفاوت كثيراً حسب البطاقة: حوالي 10 دقائق لمقطع 480p من 10 ثوانٍ على 4070 Ti Super، حوالي 3 دقائق على 5080، حوالي 68 ثانية على RTX 6000 Pro، وفقاً لخيط ComfyUI في اليوم الأول. والترخيص المجتمعي لا يغطي حالياً الاتحاد الأوروبي والمملكة المتحدة وكوريا الجنوبية أو الولايات المتحدة، لذا إذا كنت في واحدة منها، فأنت بحاجة إلى الترخيص الرسمي قبل الاستخدام التجاري.






