مينيماكس H3 ضد جيميني أومني فلاش: جوجل تفوز على اللوحة بـ5 نقاط. ثم يطلب العميل تغييرًا.

مقارنة بين MiniMax H3 و Gemini Omni Flash على ثلاث لوحات متصدرة، وجميع الفروقات الثلاثة تقع ضمن هامش الخطأ. لذا أجريت اختبارًا واحدًا لكل منهما، ثم أرسلت نفس ملاحظة المراجعة إلى كليهما.

حدقت في ثلاث لوحات متصدرة من Artificial Analysis لمدة عشر دقائق لأعرف من الفائز الفعلي.

النص إلى فيديو: Gemini Omni Flash بفارق 5 نقاط. الصورة إلى فيديو: Gemini بفارق نقطتين. تحرير الفيديو: MiniMax H3 بفارق 9 نقاط.

ثم نظرت إلى عمود فاصل الثقة. زائد أو ناقص 7. زائد أو ناقص 9. زائد أو ناقص 10.

ثلاث لوحات، ثلاث فجوات، كل واحدة منها تقع ضمن هامش الخطأ الخاص بها. في التصويت الأعمى، هذان النموذجان هما نفس النموذج.

لذا أغلقت اللوحات المتصدرة وفتحت القوائم المنسدلة بدلاً من ذلك. تلك الفجوة ليست 5 نقاط. تلك الفجوة هي طبقة دقة كاملة.

النقاط الرئيسية

  • جميع الفجوات الثلاث في Artificial Analysis (+5، +2، +9، لقطة مأخوذة في 6 أغسطس 2026) تقع ضمن فترات الثقة من ±7 إلى ±10. من حيث الجودة الخام، هذا تعادل وليس فوزًا.
  • H3 يصدر 2K، حتى 15 ثانية، وستة نسب عرض إلى ارتفاع. واجهة Gemini Omni Flash API تحد عند 720p، 10 ثوانٍ، ونسبتي عرض إلى ارتفاع فقط. هذه قيم تعداد (enum)، وليست آراء.
  • H3 يقبل الصوت كمدخل. Gemini لا يقبل. Gemini لديها seed و thinking_level. H3 ليس لديه أي منهما.
  • Gemini لديها نقطة نهاية مخصصة video-edit تقوم بتعديل مقطعك المصدر. مسار المراجعة في H3 هو reference-to-video، والذي يعيد التوليد باستخدام المقطع الخاص بك كمرجع. إنهما ليسا نفس العملية، والجولة الثانية تظهر ذلك.
  • واحد فقط من الاثنين لديه أوزان قابلة للتنزيل، وهو ليس نموذج Google.

مقارنة جنبًا إلى جنب لمشهد كشك طعام ليلي بدقات مختلفة

الجولة الأولى من اختبار MiniMax H3 مقابل Gemini Omni Flash، كلا النموذجين يقومان بتحريك نفس الإطار الأول، معروضين جنبًا إلى جنب

الجولة الأولى: نفس الإطار الأول، نفس المطالبة، نفس المدة. اليسار MiniMax H3 بدقة 2K، اليمين Gemini Omni Flash بدقة 720p. معروض هنا كملف GIF صامت؛ كلا الملفين المسلَّمين يحملان صوتًا أصليًا وكلاهما مضمن كفيديو قابل للتشغيل في الأسفل. هذه هي المشكلة. كلاهما جيد.


لماذا تُقرأ فجوة لوحة الصدارة بين MiniMax H3 و Gemini Omni Flash بشكل خاطئ

تقريبًا كل منشور عن MiniMax H3 مقابل Gemini Omni Flash ستجده يقتبس لوحة صدارة واحدة وسعرًا واحدًا. كلا العادتين تنتجان إجابة خاطئة.

هذه هي لوحات Artificial Analysis الثلاث، مع العمود الذي يتجاهله الجميع.

الجدول أ: MiniMax H3 مقابل Gemini Omni Flash عبر ثلاث لوحات صدارة من Artificial Analysis (مع الصوت)، لقطة مأخوذة في 6 أغسطس 2026

لوحة الصدارةGemini Omni FlashMiniMax H3الفجوةداخل هوامش الخطأ؟
نص إلى فيديو1,243 (#1) ±7, 11,842 صوتًا1,238 (#2) ±9, 6,830 صوتًاGemini +5نعم
صورة إلى فيديو1,191 (#2) ±9, 6,506 صوتًا1,189 (#3) ±10, 5,545 صوتًاGemini +2نعم
تحرير فيديو1,123 (#2) ±5, 11,706 صوتًا1,132 (#1) ±6, 9,128 صوتًاH3 +9نعم، بالكاد

أرقام Elo من Artificial Analysis Video Arena (Artificial Analysis, أغسطس 2026). الصورة إلى فيديو يقودها Dreamina Seedance 2.0 720p عند 1,197، لذا لا يحمل أي منهما هذا التاج. هذه نتائج تصويت جماعي متغيرة وتتحرك، وهذا هو بالضبط سبب عدم كون فجوة 5 نقاط حكمًا.

فارق 5 نقاط مع فترة ±9 يعني أن الترتيب يمكن أن ينقلب الأسبوع القادم بمجرد ضوضاء التصويت. هذا ليس "Gemini أفضل في النص إلى فيديو." هذا هو تقليب عملة بلوحة نتائج ملحقة.

ثلاثة أشياء أخرى يخطئ فيها الناس:

عمود الدولار في الدقيقة ليس ما تدفعه. تدرج Artificial Analysis $6.00/دقيقة لـ Gemini و $7.80/دقيقة لـ H3. هذا العمود يطبيع إلى تكلفة دقيقة واحدة من 1080p بالإعدادات الافتراضية. Gemini Omni Flash لا يمكنها إنتاج 1080p على الإطلاق. لذا الرقم هو تقدير نمذجة، وليس فاتورة. قارن المنتجات النهائية المسلَّمة، وليس الثواني.

لوحة واحدة ليست النموذج. H3 يحتل المركز الثاني والثالث والأول عبر اللوحات الثلاث. Gemini تحتل المركز الأول والثاني والثاني. اقتبس أيًا منهما بمفردك ويمكنك إثبات ما كنت تعتقده بالفعل.

"Omni" لا تعني "يأكل أي شيء." إنه اسم جيد ومضلل. واحد من هذين الاثنين يقبل ملفات الصوت كمدخل. إنه ليس الذي يحمل "omni" في اسمه.

ورقة المواصفات بين MiniMax H3 و Gemini Omni Flash التي لا يطبعها أحد

إذا كانت نتائج Elo لا تستطيع التفريق بينهما، فإن جداول القيود تستطيع. لقد سحبت مخططات الإدخال المباشرة لكلا النموذجين بدلاً من الوثوق بأي منشور إطلاق، والاختلافات ليست دقيقة.

الجدول ب: القيود الصارمة لـ MiniMax H3 مقابل Gemini Omni Flash، مقروءة من مخططات API المباشرة في 6 أغسطس 2026

القيدMiniMax H3Gemini Omni Flash
الدقة768P أو 2K720p، وهذه هي القيمة الوحيدة في التعداد
المدة4 إلى 15 ثانية3 إلى 10 ثوانٍ
نسب العرض إلى الارتفاع21:9، 16:9، 4:3، 1:1، 3:4، 9:1616:9 و 9:16 فقط
مسار المراجعةreference-to-video (يعيد التوليد مع المراجع)نقطة نهاية مخصصة video-edit (تعدل المصدر الخاص بك)
التحكم في الإطار الأخيرend_image مدعومغير متوفر
حدود المراجع≤9 صور، ≤3 فيديوهات، ≤3 ملفات صوتية، 12 ملفًا إجماليًا1 إلى 10 صور
إدخال الصوتنعملا
إمكانية تكرار seedلانعم
thinking_levelلانعم (افتراضي / عالي / منخفض)
الأوزان المفتوحةنعم، على Hugging Faceلا

اقرأ هذا الجدول بصدق، ستربح Gemini ثلاثة صفوف بشكل قاطع. البذور القابلة للتكرار (seeds) مهمة إذا كنت تبني خط أنابيب يجب أن يعرض نفس الإطار مرتين. نقطة نهاية video-edit حقيقية هي أداة مختلفة تمامًا عن إعادة التوليد المشروطة بالمرجع. و thinking_level يعطيك قرص جودة لا يعرضه H3 ببساطة.

H3 يربح خمسة صفوف، وهي الصفوف التي تحدد ما إذا كان يمكنك تسليم الملف الذي طلبه العميل.

لقد قمت بتشغيل كل ما هو أدناه على Atlas Cloud لأن كلا النموذجين موجودان خلف نفس نقطة النهاية /api/v1/model/generateVideo هناك، مما يعني حلقة استقصاء واحدة ورأس مصادقة واحد للاختبار بأكمله. كان تبديل النماذج مجرد تغيير لسلسلة model. هذه التفاصيل هي السبب الكامل وراء أن "استخدم كليهما" هو إجابة واقعية وليس تهربًا.

الجدول ج: تكلفة كل نقطة نهاية في هذا الاختبار، تم التحقق منها مقابل قائمة الأسعار المباشرة في 6 أغسطس 2026

نقطة النهايةالسعرهذا المقطع التجريبي لمدة 10 ثوانٍ
openai/gpt-image-2/text-to-image$0.009 / صورة$0.01
minimax/h3/image-to-video$0.14 / ثانية$1.40
minimax/h3/reference-to-video$0.14 / ثانية$1.40
google/gemini-omni-flash/image-to-video$0.13 / ثانية$1.30
google/gemini-omni-flash/video-edit$0.14 / ثانية$1.40
google/gemini-omni-flash/text-to-video$0.125 / ثانيةغير مستخدم
minimax/h3/text-to-video$0.14 / ثانيةغير مستخدم

لا يحمل أي من النموذجين خصمًا هذا الشهر. كما توفر Google طبقة مطور أرخص (0.112 دولار/ثانية للنص إلى فيديو والصورة إلى فيديو، 0.12 دولار/ثانية للمرجع إلى فيديو)؛ H3 ليس لديه طبقة مكافئة.

خط الأوزان المفتوحة الذي لا يمكن لـ Gemini Omni Flash تجاوزه. تم نشر أوزان H3 على Hugging Face (MiniMax، أغسطس 2026): محول Omni كثيف أحادي التدفق بحجم 33B، بالإضافة إلى مشفر النص Qwen3-VL-32B، وVAE بصري وVAE صوتي. تحذيران مهمان أكثر من حجم التنزيل. أولاً، ما تقوم بتشغيله بنفسك يعمل على الجانب القصير بدقة 768 بكسل؛ مرحلة المعالجة المسبقة Context-IR ووحدة Regenerate-2K ليستا في الإصدار، وخرج 2K يأتي من هاتين الوحدتين. ثانيًا، لا يغطي ترخيص المجتمع حاليًا الاتحاد الأوروبي أو المملكة المتحدة أو كوريا الجنوبية أو الولايات المتحدة، وهناك نموذج طلب منفصل لتلك المناطق. اقرأه قبل أن تبني منتجًا عليه. ليس لدى Gemini Omni Flash محادثة مكافئة، لأنه لا يوجد ملف لتنزيله.

هذا الموقف من الأوزان المفتوحة، إلى جانب التسعير القوي، هو القصة الاستراتيجية الكاملة للإطلاق (South China Morning Post، أغسطس 2026).

قم بتشغيل اختبار المراجعة بين MiniMax H3 و Gemini Omni Flash بنفسك

هذا هو الجزء الذي لم يقم أحد بتشغيله. الجميع يقيس الأداء على الجيل الأول. لا أحد يقيس الجيل الثاني.

العمل الحقيقي ليس مطالبة واحدة. العمل الحقيقي هو مقطع يعجبك بالفعل، بالإضافة إلى عميل يكتب: "أحبه، هل يمكن أن تقول اللافتة 24H ويمكن أن يكون مئزرها أحمر." هذه الجملة الواحدة هي حيث يتوقف هذان النموذجان عن كونهما قابلين للتبادل، وتصادف أنها المهمة الدقيقة التي تقيسها لوحة صدارة تحرير الفيديو.

المشهد قاسٍ عمدًا: كشك نودلز مبلل بالمطر ليلاً، البائعة تتحدث مباشرة إلى العدسة، لافتة مرسومة باليد بكلمات مقروءة خلفها، بخار من المرق، مطر على المظلة. إطار واحد يضغط على مزامنة الشفاه، وثبات النص على الشاشة، والحركة السلسة، والصوت المحيطي متعدد الطبقات في آن واحد.

كلا النموذجين يحصلان على نفس الإطار الأول، ونفس المطالبة، ونفس ملاحظة المراجعة. كل تشغيل أدناه هو 10 ثوانٍ، وهو سقف Gemini Omni Flash وداخل نطاق H3.

الخطوة 1: تثبيت الإطار الأول باستخدام GPT Image 2

يجب أن يبدأ كلا النموذجين من نفس الصورة، وإلا فإن الجولة الأولى تقيس حظ التأليف بدلاً من النموذج. افتح ملعب GPT Image 2، واضبط الجودة على عالية والنسبة على 16:9، والصق هذا:

plaintext
1Photoreal night street-food stall in heavy rain, shot on a 35mm lens at f/2.0. A woman in her late thirties in an indigo canvas apron stands behind a steaming noodle counter, looking straight into the lens, mid-sentence. Behind her a hand-painted tin light-box sign glows warm amber with the words "OPEN LATE" in clean bold sans-serif capitals. Rain streaks through the sodium streetlight, steam rises off the broth pot, wet asphalt reflects red and green neon from across the street. Shallow depth of field, practical lighting only, slight lens haze, natural skin texture, no text anywhere else in the frame. 16:9.

واجهة مولد الصور بالذكاء الاصطناعي تظهر مطالبة والصورة المولدة

ملعب GPT Image 2 على Atlas Cloud مع مطالبة كشك النودلز على اليسار والإطار الأول المولد في لوحة الإخراج

GPT Image 2 على Atlas Cloud: المطالبة على اليسار، الإطار الأول المشترك في OUTPUT. التكلفة لهذه الخطوة ، $0.009.

امرأة تقف عند كشك طعام شوارع في الليل مع بخار

الإطار الأول المولد: امرأة بمئزر نيلي خلف طاولة نودلز في الليل تحت المطر، مع لافتة مكتوبة بخط اليد "OPEN LATE" تتوهج خلفها

المدخل الوحيد الذي تلقاه كلا النموذجين. لاحظ الشيئين اللذين ستستهدفهما المراجعة: لافتة "OPEN LATE" والمئزر النيلي. تم التوليد باستخدام openai/gpt-image-2/text-to-image.

الخطوة 2: الجولة الأولى على MiniMax H3

اذهب إلى ملعب MiniMax H3، اختر مهمة image-to-video، ارفع إطار الخطوة 1، واضبط resolution على 2K، duration على 10، ratio على adaptive (تعداد الصورة إلى فيديو يقدم فقط adaptive). المطالبة:

plaintext
1The vendor looks into the lens and says, in a warm tired voice: "Broth's been on since four this morning. Sit down, it's still raining." She lifts the ladle as she speaks. Steam curls up across the frame. Rain keeps falling on the awning behind her. The camera holds still, no push, no pan. Ambient audio: rain on canvas, broth simmering, distant traffic, her voice close and dry.

واجهة توليد فيديو بالذكاء الاصطناعي تظهر إدخال نص المطالبة وإخراج الفيديو

ملعب MiniMax H3 للصورة إلى فيديو على Atlas Cloud مع تحديد دقة 2K والمقطع النهائي يتم تشغيله في لوحة الإخراج

MiniMax H3 الصورة إلى فيديو على Atlas Cloud: تم تحديد 2K، المقطع النهائي في OUTPUT. هذا الالتقاط تم تشغيله على الإعداد الافتراضي للملعب البالغ 8 ثوانٍ وسعره $1.12؛ الإصدار ذو 10 ثوانٍ المستخدم للمقارنة مضمن أدناه وتكلفته $1.40.

A8bowsMJgME

MiniMax H3، الجولة الأولى، 2K، 10 ثوانٍ. الصوت قيد التشغيل: الحوار، والمطر، والمرق تم توليدها جميعًا في نفس المسار، وليست مضافة لاحقًا.

الخطوة 3: الجولة الأولى على Gemini Omni Flash، نفس الإطار، نفس الكلمات

افتح ملعب Gemini Omni Flash، اختر image-to-video، ارفع نفس إطار الخطوة 1، والصق مطالبة الخطوة 2 دون تغيير حرف واحد. الإعدادات: resolution 720p، duration 10، aspect_ratio 16:9، thinking_level default، seed -1.

شيئان يجب ملاحظتهما أثناء وجودك في هذا النموذج، لأنهما يمثلان المقالة بشكل مصغر. القائمة المنسدلة resolution تحتوي على خيار واحد بالضبط. حقل duration يتوقف عند 10. لم أختر 720p على شيء أفضل؛ لا يوجد شيء آخر للاختيار.

ملاحظة حول ما هو مفقود هنا: لم أتمكن من التقاط لقطة شاشة للملعب بعد اكتمال التشغيل لأي من خطوتي Gemini. بيئة الاختبار حيث ألتقط لقطات الشاشة أعادت 403 PERMISSION_DENIED من جانب Google في جميع المحاولات الثلاث، لذا فإن لقطات Gemini الوحيدة التي لدي تظهر لوحة OUTPUT فاشلة ولن أقوم بتجميلها كتشغيل ناجح. المقاطع أدناه حقيقية، تم توليدها من خلال API الإنتاج بالإعدادات المذكورة أعلاه. خطوتا H3 تم التقاطهما بشكل نظيف ولقطات الشاشة تلك حقيقية.

pllIxfhjUR4

Gemini Omni Flash، الجولة الأولى، 720p، 10 ثوانٍ، مدخلات متطابقة. شغّل هذا مباشرة بعد مقطع H3 أعلاه واحكم على الصوت بنفسك.

الخطوة 4: الجولة الثانية، أرسل المراجعة إلى Gemini Omni Flash

هذه هي الجولة المهمة. انتقل إلى مهمة video-edit في نفس صفحة نموذج Gemini، ارفع المقطع الذي أنتجه Gemini نفسه في الخطوة 3 كمدخل video، واضبط resolution 720p و thinking_level high (تعليمات تحرير من جزأين هي بالضبط الحالة المعقدة التي يستخدم من أجلها هذا القرص). الصق هذه الملاحظة تمامًا كما سيرسلها العميل:

plaintext
1Keep this exact shot: same camera position, same woman, same face, same rain, same lighting, same audio. Change the hand-painted sign so it reads "OPEN 24H" instead of "OPEN LATE", in the same painted style and the same amber glow. Change her apron from indigo blue to deep crimson. Change nothing else in the frame.

UKw9LEogi0I

Gemini Omni Flash بعد ملاحظة المراجعة. شاهد اللافتة، ثم المئزر، ثم تحقق مما إذا كان أي شيء آخر قد تحرك.

الخطوة 5: الجولة الثانية، أرسل نفس المراجعة إلى MiniMax H3

هذا هو الاختلاف الهيكلي الصادق، ويجب أن تعرفه قبل قراءة النتيجة. H3 ليس لديه نقطة نهاية video-edit. مسار المراجعة الخاص به هو reference-to-video: تعطيه المقطع الأصلي كمرجع ويقوم بتوليد فيديو جديد مشروط بذلك المرجع. إنه لا يقوم بتحرير ملفك. إنه يصنع ملفًا جديدًا من المفترض أن يبدو مثل ملفك.

في صفحة MiniMax H3، اختر مهمة reference-to-video، أضف المقطع الذي أنتجه H3 في الخطوة 2 إلى refers كمرجع فيديو، ثم اضبط resolution 2K، duration 10، ratio adaptive. الصق مطالبة الخطوة 4 بدون أي تعديلات على الإطلاق.

هذه الخطوة ليس لديها لقطة شاشة للملعب أيضًا، لسبب مختلف وممل: المتصفح عديم الرأس الذي أستخدمه للالتقاط تعطل ثلاث مرات على أداة رفع المراجع أثناء تحميل مرجع فيديو. التشغيل نفسه تم من خلال API دون شكوى.

TKIThp6r_oU

MiniMax H3 بعد ملاحظة المراجعة المتطابقة، عبر reference-to-video بدقة 2K.

مقارنة لامرأة تطبخ في كشك طعام ليلي ممطر

مقارنة جنبًا إلى جنب للجولة الثانية: نتيجة Gemini Omni Flash video-edit بجانب نتيجة MiniMax H3 reference-to-video، كلاهما من نفس ملاحظة المراجعة

الجولة الثانية جنبًا إلى جنب، GIF صامت. اليسار Gemini Omni Flash عبر video-edit، اليمين MiniMax H3 عبر reference-to-video. كلاهما كان لديه نفس الجملة للعمل منها.

ما حدث بالفعل في الجولة الثانية. توقعت أن يخسر H3 هذه الجولة. إعادة التوليد المشروطة بالمرجع هي أداة أقل دقة من نقطة نهاية تحرير حقيقية، و"إعادة توليد المقطع بالكامل ونأمل أن يقع في نفس المكان" هو بالضبط الطريقة التي تحصل بها على وجه مختلف، وكاميرا متحركة، وعميل يسأل عما حدث للمشهد.

هذا ليس ما عاد. كلا النموذجين قاما بالمهمة، وقاما بها بشكل نظيف.

video-edit الخاص بـ Gemini تصرفت تمامًا كما هو معلن. اللافتة تقرأ OPEN 24H بنفس الحروف المرسومة يدويًا، مع نفس التوهج الكهرماني ونفس تأثيرات الطقس على القصدير. المئزر أصبح قرمزيًا غامقًا. كل شيء آخر لم يتأثر: نفس الوجه، نفس التعبير، نفس زاوية المغرفة، نفس شكل البخار، نفس المطر، نفس أضواء السيارة الخلفية في الخلفية. يبدو وكأنه الملف الأصلي مع تصحيحين بعمق بكسلات، لأن هذا هو ما هو عليه أساسًا.

reference-to-video الخاص بـ H3 أنتج نفس التغييرين وحافظ على المشهد بشكل أفضل بكثير مما يوحي به الهيكل. تغيرت اللافتة، تغير المئزر، وعلى مدى 10 ثوانٍ كاملة، بقيت الإطارات، وتدفق المرق من المغرفة، وعمود البخار، ووجهها مطابقًا للمقطع من الجولة الأولى. إذا كان هناك انحراف هنا، لم أستطع العثور عليه من خلال التنقل بين الإطارات.

لذا فإن الجولة الثانية هي ثالث تعادل إحصائي، ولن أدعي عكس ذلك لصنع قصة أكثر ترتيبًا. ما يفصل بين المخرجين ليس جودة التحرير. إنه أن H3 أعاد 2560x1440 مع مسار صوتي ستيريو 32 كيلوهرتز و Gemini أعادت 1280x720. نفس التعليمات، نفس النجاح، منتج نهائي مختلف.

تحذير صادق واحد حول المنهجية: هذه مراجعة واحدة على مشهد واحد، وليست دراسة مضبوطة. تغيير مكون من جزأين على لافتة وقطعة ملابس هو تعديل ودود إلى حد ما. الحالات الأصعب (إزالة جسم تتحرك الكاميرا بجانبه، تغيير شيء يحجبه الشخص، أربع جولات من الملاحظات المتراكمة على بعضها البعض) هي حيث يجب أن تتفوق نقطة نهاية التحرير المخصصة، وحيث يجب أن تبدأ إعادة التوليد في التذبذب. قم بتشغيل اختباراتك قبل أن تقرر.

ثلاثة فوارق أخرى بين MiniMax H3 و Gemini Omni Flash تستحق الاختبار

الجولة الثانية هي الفرق الذي يغير عملية التسليم. ثلاثة أخرى تستحق عشرين دقيقة من رصيدك الخاص.

قم بتغذيته بملف صوتي. reference-to-video الخاص بـ H3 يقبل ما يصل إلى ثلاثة مقاطع صوتية مدة كل منها 2 إلى 15 ثانية، طالما أن مرجع صورة أو فيديو واحد على الأقل يأتي معها. هذا يعني أنه يمكنك تسليمه تسجيل صوت حقيقي وجعل الشخصية تؤديه. Gemini Omni Flash ليس لديها حقل إدخال صوتي على أي من نقاط النهاية الأربع الخاصة بها، لذا لا يمكن تشغيل هذه المقارنة على الإطلاق. هذه ليست خسارة تسجيل لـ Google؛ إنها قدرة غائبة ببساطة.

اطلب 21:9. تعداد النسبة في reference-to-video الخاص بـ H3 يحتوي على 21:9، 16:9، 4:3، 1:1، 3:4 و 9:16. تعداد aspect_ratio الخاص بـ Gemini يحتوي على 16:9 و 9:16. إذا كان منتجك النهائي هو تسلسل افتتاحي عريض أو مقطع لوسائل التواصل الاجتماعي بنسبة 1:1، فإن واحدًا من هذين النموذجين ليس في المحادثة.

أغلق seed وأعد التشغيل. هذا يذهب في الاتجاه الآخر. Gemini تعرض seed؛ H3 لا يعرضها على أي نقطة نهاية. إذا كنت تبني خط أنابيب حيث يجب أن يعيد نفس الطلب نفس الإطارات يوم الثلاثاء كما أعاد يوم الاثنين، فإن Gemini تعطيك مقبضًا و H3 لا يعطيك شيئًا. لاختبارات الانحدار، أو متغيرات النسخ A/B، أو أي مزرعة عرض آلية، هذه ميزة حقيقية وهي تقع على جانب Google من الميزانية العمومية.

ما هي التكلفة الفعلية لاختبار MiniMax H3 مقابل Gemini Omni Flash

التجربة بأكملها أعلاه، أربعة عمليات توليد فيديو وصورة واحدة، بلغت حوالي 5.51 دولارًا. إطار أول واحد بسعر $0.009، مقطعان من الجولة الأولى لمدة 10 ثوانٍ بسعر $1.40 و $1.30، مقطعان من الجولة الثانية لمدة 10 ثوانٍ بسعر $1.40 لكل منهما.

في الثانية الواحدة، Gemini أرخص: $0.125 إلى $0.14 مقابل $0.14 ثابت لـ H3، لذا حوالي 7 إلى 11 بالمائة أقل اعتمادًا على نقطة النهاية. هذا الرقم صحيح وهو أيضًا عديم الفائدة تقريبًا بمفرده.

إليك السبب. افترض أن المنتج النهائي هو افتتاحية سينمائية 15 ثانية بنسبة 21:9 بدقة 2K. H3 يعرضها كمقطع واحد. Gemini لا يمكنها عرضها على الإطلاق: لا الدقة، ولا المدة، ولا نسبة العرض إلى الارتفاع. ستقوم بلصق مقطع 10 ثوانٍ ومقطع 5 ثوانٍ بنسبة 16:9، وتقطيع لتزييف الشاشة العريضة، وشحن بدقة 720p. السعر في الثانية لشيء لا يمكنك تسليمه ليس توفيرًا.

اقلبها. افترض أن المنتج النهائي هو مقطع لوسائل التواصل الاجتماعي بنسبة 16:9 سيمر بأربع جولات من ملاحظات العميل ويجب أن يعود متطابقًا بايتًا بايت عندما يطلب الفريق القانوني إعادة عرضه في غضون ثلاثة أسابيع. video-edit الخاص بـ Gemini بالإضافة إلى seed مبني تمامًا لهذه الحلقة، ويكلف أقل في الثانية أثناء القيام بذلك.

الجدول د: أي مهمة بين MiniMax H3 و Gemini Omni Flash تذهب إلى أين

المهمة التي أمامكأرسلها إلى
تسليم بدقة 2KMiniMax H3
لقطة واحدة أطول من 10 ثوانٍMiniMax H3
تأطير 21:9، 4:3، 1:1 أو 3:4MiniMax H3
تغذية مسار صوتي حقيقيMiniMax H3
الاستضافة الذاتية على وحدات معالجة الرسوم الخاصة بكMiniMax H3
الوصول إلى إطار نهائي محددMiniMax H3
مراجعات متعددة الجولات حواريةGemini Omni Flash
الحفاظ على الأجزاء غير المتأثرة من المقطعGemini Omni Flash
عمليات عرض قابلة للتكرار عبر seedGemini Omni Flash
محتوى قصير بنسبة 16:9 بأقل سعر في الثانيةGemini Omni Flash

استنتاج هذه المقالة هو ذلك الجدول، وليس نتيجة. إذا كان المعيار لا يمكنه فصل نموذجين بأكثر من هامش الخطأ الخاص به، فإن المعيار قد أخبرك بكل ما يعرفه، وتتولى ورقة المواصفات المسؤولية من هناك.

للحصول على نظرة أوسع حول مكانة H3 مقارنة ببقية المجال، يغطي تحليل بدائل MiniMax H3 النماذج التي تتفوق عليه في اللوحات التي لا يتصدرها.

الأسئلة الشائعة

هل MiniMax H3 أفضل من Gemini Omni Flash؟

التصويت الأعمى لا يستطيع التفريق بينهما. عبر ثلاث لوحات صدارة من Artificial Analysis، الفجوات هي 5 و 2 و 9 نقاط Elo، وكل واحدة تقع ضمن فاصل ثقة من ±7 إلى ±10. اختر بناءً على المواصفات، وليس على الترتيب. سقف الدقة، حد المدة، وقائمة نسب العرض إلى الارتفاع ستغير منتجك النهائي؛ 5 نقاط Elo لن تفعل ذلك.

أيهما أرخص، MiniMax H3 أم Gemini Omni Flash؟

في الثانية، Gemini. على Atlas Cloud، تتراوح من 0.125 دولار إلى 0.14 دولار في الثانية مقابل 0.14 دولار ثابت لـ H3، مع طبقة مطور بسعر 0.112 دولار في الثانية ليس لـ H3 ما يعادلها. لكن Gemini محدودة بـ 720p و 10 ثوانٍ ونسبتي عرض إلى ارتفاع، لذا بالنسبة للعديد من المنتجات النهائية، أنت لا تقارن نفس المنتج. قم بتسعير المقطع النهائي، وليس الثانية.

هل يمكن لـ Gemini Omni Flash توليد فيديو بدقة 1080p أو 2K أو 15 ثانية؟

لا. معلمة resolution في API الخاص بها لها قيمة قانونية واحدة، 720p، و duration تقبل من 3 إلى 10 ثوانٍ. يقدم MiniMax H3 خيار 768P أو 2K ومدة من 4 إلى 15 ثانية. هذه قيود تعداد (enum) مقروءة من المخطط المباشر في 6 أغسطس 2026، وليست رأيًا تحريريًا، وقد ترفعها Google لاحقًا.

هل يمكنني استضافة Gemini Omni Flash بنفسي كما يمكنني استضافة MiniMax H3؟

لا. أوزان H3 موجودة على Hugging Face وتعمل محليًا على الجانب القصير بدقة 768 بكسل. مرحلة Context-IR ووحدة Regenerate-2K التي تنتج خرج 2K ليستا في الإصدار وتبقى في جانب API. تحقق أيضًا من الترخيص: لا يغطي حاليًا الاتحاد الأوروبي أو المملكة المتحدة أو كوريا الجنوبية أو الولايات المتحدة بدون طلب منفصل.

هل يجب أن أختار واحدًا فقط؟

لا، والجدول الخاص بتوزيع المهام أعلاه هو الإجابة الأفضل. كلا النموذجين موجودان خلف نفس نقطة النهاية generateVideo على Atlas Cloud، لذا تشغيل كليهما يعني حلقة استقصاء واحدة وسلسلة model مختلفة، وليس دمجين. التوجيه حسب المنتج النهائي أفضل من المراهنة على لوحة صدارة تتحرك كل أسبوع.

أحدث النماذج

واجهة برمجية واحدة لكل وسائط الذكاء الاصطناعي.

استكشف جميع النماذج