

تتيح MiniMax H3 API الوصول إلى نموذج الفيديو العام متعدد الوسائط من MiniMax، الذي يقرأ النصوص والصور والفيديو والصوت كسياق واحد بدلًا من التعامل مع مهمة واحدة في كل مرة. تعمل المقاطع لمدة من 5 إلى 15 ثانية بمعدل 24 FPS عبر نسب أبعاد من 21:9 إلى 9:16، ويمكن لمطالبة واحدة تبديل الشخصيات أو استبدال الخلفيات أو إعادة كتابة الحوار أو استنساخ صوت من مقطع مرجعي. تقدم Atlas Cloud كل ذلك عبر نقطة نهاية واحدة متوافقة مع OpenAI. ابدأ التطوير اليوم.
يوفر لك Atlas Cloud أحدث النماذج الإبداعية الرائدة في الصناعة.
يقرأ كل endpoint في MiniMax H3 API النصوص والصور والفيديو والصوت بطريقة مختلفة، لذا راجع الصفوف أدناه وطابق النمط مع ما تبنيه.
| النمط | الوصف |
|---|---|
| MiniMax H3 T2V API (النص إلى الفيديو) | اكتب prompt يصل إلى 7,000 حرف، وسيعيد النموذج مقطعًا مدته من 5 إلى 15 ثانية بمعدل 24 FPS وبدقة 1440p، مع صوت stereo أصلي يُنشأ في العملية نفسها. تُحدَّد نسبة العرض إلى الارتفاع لكل طلب من بين 21:9 و16:9 و4:3 و1:1 و3:4 و9:16، لذلك تكفي مكالمة واحدة لإنشاء مقاطع دعائية سينمائية ومقاطع عمودية للشبكات الاجتماعية على حد سواء. |
| MiniMax H3 I2V API (الصورة إلى الفيديو) | تحدد صورة واحدة الإطار الافتتاحي، بينما تثبّت صورتان الإطارين الأول والأخير، ويتولى H3 ملء الحركة بينهما وفق نسبة العرض إلى الارتفاع في صورة الإدخال. تُقبل المصادر من 256 إلى 5760 بكسل لكل ضلع، مما يجعل تحريك الرسومات الرئيسية ولقطات المنتجات الثابتة وإطارات storyboard أمرًا مباشرًا. |
| MiniMax H3 Omni Reference API (المرجع إلى الفيديو) | هل تحتاج إلى عمل عدة مصادر معًا؟ يمكن تضمين ما يصل إلى تسع صور وثلاثة مقاطع فيديو وثلاثة مسارات صوتية في طلب واحد ضمن حد أقصى قدره 12 ملفًا، وتُقرأ كلها كسياق واحد متعدد الوسائط. يمكنك الحفاظ على شخصية أو حركة كاميرا أو نبرة صوت عبر اللقطات، أو تعديل مقطع موجود باستبدال الشخصيات والخلفيات والسطور المنطوقة. |
كل مقطع يعيده MiniMax H3 API يمتد حتى خمس عشرة ثانية بدقة 1440p مع صوت ستيريو أصلي، ويُنشأ من أي مزيج من مراجع النصوص والصور والفيديو والصوت، كما يمكن للاستدعاء نفسه تعديل الشخصيات والمشاهد والحوار داخل اللقطات المتوفرة لديك بالفعل.
يقبل طلب MiniMax H3 API واحد ما يصل إلى تسع صور مرجعية، وثلاثة مقاطع فيديو، وثلاثة مسارات صوتية، بحد أقصى قدره اثنا عشر ملفًا. وبدلًا من التعامل معها كخانات منفصلة، يعامل النموذج النص والصورة والصوت كسياق واحد، فيستخلص شخصية من صورة، وحركة كاميرا من مقطع، ومزاجًا من مسار صوتي داخل المشهد نفسه. تحصل الفرق التي لديها مواد جاهزة على مسار مباشر نحو لقطة نهائية.
كل نتيجة تأتي مزودة بالصوت. يتم إنتاج الحوار والأجواء والموسيقى بصوت ستيريو أصلي في نفس المرور الذي يعرض الصورة بمعدل 24 إطارًا في الثانية، لذلك لا يلزم تأليف موسيقى أو دبلجة لاحقًا. وبما أن التوقيت يُحسم أثناء إنشاء اللقطة، تبقى الخطوات والكلام والقصات متزامنة مع الحركة. تخرج الإعلانات القصيرة ومقاطع الشبكات الاجتماعية جاهزة للنشر.
هل تحتاج إلى استبدال قطة بكلب، أو تغيير شاشة خضراء، أو إعادة كتابة جملة حوار واحدة؟ يطبق MiniMax H3 API تعديلات كهذه على الفيديو الذي تزوده به، بما يشمل الشخصيات والعناصر والخلفيات والإضاءة والمؤثرات، بينما تبقى الأجزاء التي لم تذكرها قريبة من الأصل. تدعم المطالبات حتى 7000 حرف، لذا يمكن تجميع عشرات التغييرات في مرور واحد. وهذا يجعل التكرار على نسخة معتمدة أمرًا عمليًا.
أرسل عينة صوتية إلى جانب الصور أو اللقطات، وستتحدث الشخصية المُنشأة بذلك الطابع الصوتي. يُسمح بما يصل إلى ثلاثة مراجع صوتية لكل طلب، مدة كل منها بين ثانيتين وخمس عشرة ثانية، ويجب أن يرافق الصوت دائمًا إدخالًا بصريًا بدلًا من إرساله منفردًا. يمكن أيضًا استبدال الحوار الحالي وضبط الأداء ليتطابق معه. تحافظ أعمال السلاسل على صوت واحد مميز عبر كل حلقة.
تمتد المقاطع من خمس إلى خمس عشرة ثانية، ويضع وضع 1440p عدد 1440 بكسل على الجانب القصير بين 16:9 و9:16، أو نحو 3.7 ميغابكسل عند النسب الأعرض مثل 2976 × 1248 لـ 21:9. يمكن اختيار ست نسب، من 21:9 السينمائية إلى 9:16 العمودية، كما يستطيع MiniMax H3 API اختيار واحدة لك أيضًا. يغطي هذا النطاق إعلانًا تشويقيًا، وحلقة منتج متكررة، ودراما عمودية دون تبديل النماذج.
إذا كانت ملفات المصدر لديك قادمة مباشرة من كاميرا أو من خط زمني للتحرير، فيمكن إدخالها كما هي: فيديو H.264 وH.265، وصور ثابتة JPG وPNG وWEBP وHEIC وHEIF، بالإضافة إلى صوت WAV وMP3. حدود كل ملف هي 50MB للفيديو، و30MB للصور، و15MB للصوت، بينما يتيح تمرير الأصول عبر URL إبقاء الطلبات ضمن حد جسم الطلب البالغ 64MB. على Atlas Cloud تعمل المجموعة كلها عبر مفتاح واحد متوافق مع OpenAI مع فوترة حسب الاستخدام.
كل مقطع في هذه المجموعة ناتج عن نص توجيهي متطابق أُرسل إلى MiniMax H3 API وإلى نموذجَي فيديو آخرين مستضافين على Atlas Cloud، بحيث يمكن مقارنة الحركة والصوت ومدى الالتزام بالتعليمات من دون تغيير أي كلمة.
15 seconds، فيديو قصير أفقي بنسبة 16:9. لقطات تصوير حي لمغسلة ذاتية الخدمة في ساعة متأخرة من الليل، ممزوجة برسوم متحركة متوهجة مرسومة باليد لتكوين صورة متعددة الوسائط. مغسلة صغيرة ذاتية الخدمة، أضواؤها الفلورية تومض بخفوت؛ في الداخل غسالات تعمل، وسلال غسيل بلاستيكية، ومقعد قديم، مع جورب واحد ملقى على الأرض. المكان كله هادئ ويحمل مزاجًا خافتًا مفعمًا بالحنين. يحمل ملمس لقطات هاتف محمول مصوّرة بيد واحدة، مع اهتزاز واضح في الكاميرا؛ يتسبب الضوء الفلوري الأبيض في تذبذب التعريض بين السطوع والخفوت؛ الأسطح الزجاجية تحمل انعكاسات محيطة؛ ويظهر تأخر في التركيز عندما تقترب العدسة من الأجسام. يجب ألا تبدو الصورة مصقولة ومرتبة مثل إعلان تجاري — بل ينبغي أن يكون الإحساس العام أشبه بلقطة وثائقية حقيقية، كما لو أنك دخلت المكان مصادفة في وقت متأخر من الليل والتقطت المشهد وأنت تطارد رؤية غريبة تشبه الحلم.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
منظور الشخص الأول · ارتفاع بمستوى العين · كاميرا ألعاب محمولة باليد المشهد: تحاكي اللقطة لاعبًا يشغّل لعبة FPS حربية حديثة، يمسك بندقية هجومية بكلتا يديه بينما يتقدم ببطء على طول المحيط الخارجي لقاعدة عسكرية. يتحرك اللاعب إلى الأمام على طريق بجانب ساتر، ويتنقل مؤشر التصويب عبر الممر في الأمام؛ بعد توقف قصير، يطلق بضع طلقات نحو هدف بعيد، ثم يواصل التقدم — مثل لقطات لعب مباشرة للاعب عادي. الإضاءة: يتداخل الضوء الطبيعي البارد لقاعدة عسكرية حديثة مع الدخان ونيران فوهة السلاح. الصورة واقعية وحادة، مع سلاح معدني وغبار وضباب ساحة المعركة بجودة ألعاب AAA. حركة الكاميرا: في الكاميرا تمايل خفيف محمول باليد أثناء حركة اللاعب — تتقدم ببطء أولًا، ثم تقوم بمسحات صغيرة يمينًا ويسارًا للمراقبة، مع اهتزاز ارتداد خفيف عند إطلاق النار، قبل أن تواصل في النهاية التقدم بثبات.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
من أفلام العلامات التجارية والدراما العمودية إلى مقاطع المنتجات ومرئيات الألعاب والتعديلات الدقيقة على اللقطات الحالية، يغطي MiniMax H3 API كل سيناريو عبر طلب واحد متعدد الوسائط يعيد فيديو مع صوت ستيريو أصلي.
مرّر إطارات لوحة القصة وقائمة اللقطات في استدعاء واحد للحصول على عروض دعائية بدقة 1440p، وإعلانات TVC، وحملات أزياء بمعدل 24 FPS. يأتي الصوت الستيريو الأصلي مع كل نتيجة، لتتمكن فرق العلامات التجارية من معاينة نسخ نهائية جاهزة.
يدعم الإخراج العمودي 9:16 مشاهد الدراما المكتوبة، من ألغاز الأزياء إلى المواجهات العائلية، مع أداء الحوار صوتيًا في العملية نفسها. تحصل الاستوديوهات التي تبني مكتبات دراما قصيرة على خطّافات مدتها 15 ثانية من دون حجز ممثلين أو مواقع تصوير.
إذا احتاجت اللقطة إلى وجه وحركة محددين، يمكن لما يصل إلى تسع صور وثلاثة فيديوهات وثلاثة مقاطع صوتية توجيه استدعاء واحد. تبقى هوية الشخصية وحركة الكاميرا ونبرة الصوت ثابتة عبر الحلقات.
هل تحتاج إلى تغيير لاحق؟ يمكن تحرير اللقطات الحالية عبر موجّه: استبدال عنصر، تغيير الخلفية، ضبط الإضاءة، أو إعادة صياغة جملة منطوقة من دون إعادة تصوير أي إطار.
تتحول صور المنتجات إلى حركة: صورة مرجعية واحدة تصبح عرضًا بزاوية 360 درجة، أو شرحًا لميزة، أو مقطعًا مدفوعًا للشبكات الاجتماعية. تتيح نسب العرض إلى الارتفاع من 21:9 إلى 9:16 استخدام مجموعة أصول واحدة في كل موضع نشر.
يحافظ الإخراج المنمّط على جودته في game CG، وcharacter PV، وافتتاحيات الأنمي، وعروض الواجهات التي يجب أن تبقى فيها القوائم وعناصر HUD والطبقات النصية قابلة للقراءة. تستخدمه فرق الفن للتحقق من المفاهيم قبل الإنتاج.
قارِن MiniMax H3 API بنماذج الفيديو الأخرى المستضافة على Atlas Cloud، وتعرّف عمليًا على اختلاف وسائط الإدخال، وحدود المراجع، والمدة، والدقة، ومخرجات الصوت قبل الالتزام بأي endpoint.
| النموذج | وسائط الإدخال | الحد الأقصى لملفات المراجع | مدة المخرَج | الدقة القصوى | الصوت الأصلي |
|---|---|---|---|---|---|
| MiniMax H3 | نص، صورة، فيديو، صوت | 9 صور، 3 فيديوهات، 3 مقاطع صوتية، بإجمالي 12 ملفًا | من 5s إلى 15s | 1440p عند 24 FPS | √ صوت ستيريو أصلي في كل مخرَج |
| Seedance 2.0 Reference-to-Video | نص، صورة، فيديو، صوت | 9 صور، 3 فيديوهات، 3 مقاطع صوتية | حتى 15s | 720p | √ حوار ستيريو ومؤثرات وموسيقى تُولَّد في تمريرة واحدة |
| Veo3.1 Reference-to-video | نص وصورة | 3 صور مرجعية | 4s أو 6s أو 8s | 4K لمدة 8s فقط | √ حوار وأجواء ومؤثرات صوتية متزامنة مع الخط الزمني |
| Wan-2.7 Reference-to-video | نص، صورة، فيديو، صوت | 5 صور أو مقاطع فيديو، بالإضافة إلى مقطع صوتي واحد | من 2s إلى 15s | 1080p | √ توليد موسيقى ومؤثرات، أو قيادة مزامنة الشفاه باستخدام الصوت الخاص بك |
| Kling v3.0 Pro Image-to-Video | نص وصورة | - | حتى 15s | 1080p | √ حوار متعدد اللغات مع مزامنة الشفاه بخمس لغات |
Get started in minutes — follow these simple steps to integrate and deploy models through Atlas Cloud’s platform.
سجّل في atlascloud.ai وأكمل التحقق. يحصل المستخدمون الجدد على رصيد مجاني لاستكشاف المنصة واختبار النماذج.
دمج نماذج MiniMax H3 المتقدمة مع منصة Atlas Cloud المسرّعة بـ GPU يوفر أداءً لا مثيل له وقابلية للتوسع وتجربة مطور استثنائية.
زمن انتقال منخفض:
استدلال محسّن لـ GPU للاستجابة في الوقت الفعلي.
API موحد:
قم بتشغيل MiniMax H3 و GPT و Gemini و DeepSeek من خلال تكامل واحد.
تسعير شفاف:
فواتير يمكن التنبؤ بها لكل رمز مع خيارات بدون خادم.
تجربة المطور:
SDKs والتحليلات وأدوات الضبط الدقيق والقوالب.
الموثوقية:
وقت تشغيل 99.99%، RBAC، وتسجيل جاهز للامتثال.
الأمان والامتثال:
SOC 2 Type II، توافق HIPAA، سيادة البيانات في الولايات المتحدة.
تمنح MiniMax H3 API المطورين وصولًا برمجيًا إلى MiniMax H3، وهو نموذج فيديو متعدد الوسائط مفتوح وعام الغرض يتعامل مع النصوص والصور والفيديو والصوت كسياق مشترك واحد. وبدلًا من فصل التوليد والتحرير والمراجع في نماذج مهام منفصلة، يقرأ H3 مجموعة المدخلات كاملة ويعيد مقطعًا نهائيًا مزودًا بالصوت. على Atlas Cloud يعمل خلف مفتاح API واحد مع تسعير بالدفع حسب الاستخدام.
تشمل إمكاناته أفلام العلامات التجارية، والمقاطع التشويقية، والدراما القصيرة العمودية، وإعلانات المنتجات والتجارة الإلكترونية، وعروض الحركة للألعاب وUI، والتحريك بأساليب فنية مختلفة. وبما أن النموذج يتعامل مع النصوص الظاهرة على الشاشة والترجمات وأصول العلامة التجارية، تستخدمه الفرق أيضًا للتحقق من المفاهيم، ومعاينة القصص المصورة، والعروض المرئية قبل تخصيص ميزانية الإنتاج.
أنشئ حسابًا على Atlas Cloud، وولّد مفتاح API، ثم أرسل مطالبة مع أي ملفات مرجعية إلى نقطة نهاية إنشاء الفيديو، واستعلم دوريًا حتى تحصل على النتيجة النهائية. يُوصى بتمرير الوسائط كعناوين URL مستضافة بدلًا من الرفع المضمّن، لأن حجم نص الطلب محدود بـ 64MB. ابدأ البناء اليوم.
الفوترة بنظام الدفع حسب الاستخدام، لذا تدفع لكل استدعاء بدلًا من شراء اشتراك أو ترخيص مقعد. تتبع التكلفة ما تقوم بعرضه فعليًا، ما يعني أن الدقة وطول المقطع يحددان إجمالي تكلفة الدفعة. راجع صفحة النموذج لمعرفة السعر الحالي لكل عملية توليد قبل التخطيط لتشغيلات كبيرة الحجم.
نعم. تُسلَّم كل نتيجة من H3 بصوت ستيريو أصلي، بحيث تصل الحوارات والمؤثرات والأجواء الصوتية في نفس المرور مع الصورة. عند تزويد النموذج بمقطع صوتي مرجعي، يمكنه نقل تلك النبرة إلى شخصية، مما يلغي خطوة منفصلة لتوليف الصوت من مسار العمل.
تتراوح المقاطع من 5 إلى 15 ثانية بمعدل 24 FPS. في وضع 1440p يُعرض الضلع الأقصر عند 1440 بكسل للنسب بين 16:9 و9:16، وخارج هذا النطاق يحتفظ الإطار بإجمالي يقارب 3.7M بكسل، مثل 2976 × 1248 عند 21:9. تقبل طلبات تحويل النص إلى فيديو وomni reference النسب 21:9 و16:9 و4:3 و1:1 و3:4 و9:16، بينما ترث طلبات الإطار الأول والأخير نسبة العرض إلى الارتفاع من صورة الإدخال.
يمكن إرفاق ما يصل إلى تسع صور، وثلاثة مقاطع فيديو، وثلاثة مقاطع صوتية مع مطالبة واحدة، بحد أقصى يبلغ اثني عشر ملفًا إجمالًا. يجب ألا يتجاوز إجمالي مدة الفيديو والصوت لكل منهما 15 ثانية، كما يجب أن يكون الصوت مصحوبًا بصورة أو فيديو بدلًا من أن يصل منفردًا. يمكن أن تصل المطالبات إلى 7000 حرف، مما يترك مساحة لتوجيهات لقطة بلقطة تغطي الكاميرا والأداء والصوت.
تشمل المدخلات المقبولة فيديو H.264 وH.265، وصور JPG وJPEG وPNG وWEBP وHEIC وHEIF، وصوت WAV أو MP3، مع AAC أو MP3 للمسار الصوتي داخل ملف الفيديو. حدود الحجم لكل ملف هي 50MB للفيديو، و30MB للصور، و15MB للصوت. وبما أن نص الطلب محدود بـ 64MB، تظل عناوين URL المستضافة الخيار الأكثر أمانًا للأصول الثقيلة.
التحرير أحد أوضاعه الأساسية. أرسل مقطعًا مصدرًا مع التعليمات، ويمكن لـ MiniMax H3 API استبدال الشخصيات أو الكائنات، وتغيير الخلفيات والإضاءة، وإضافة مؤثرات بصرية على طبقات، وإعادة كتابة الحوار مع الحفاظ على ثبات المناطق غير المعدلة. تُنفَّذ التعليمات المركبة في طلب واحد، لذلك تُطبَّق عدة تغييرات معًا بدلًا من توزيعها على جولات متكررة ذهابًا وإيابًا.
تأخذ معظم نماذج الفيديو مطالبة واحدة مع صورة واحدة وتعيد مقطعًا صامتًا. أما H3 فيستهلك بدلًا من ذلك مجموعة مختلطة من المراجع، ويقرأ نية الشخصية والحركة والكاميرا والصوت عبرها كلها، ثم يعيد مقطعًا بصوت أصلي. إذا كان مسار عملك الحالي يربط بين نموذج فيديو ونموذج صوت ومحرر، فإن H3 يدمج تلك المراحل في استدعاء واحد.
أدلة وشروحات وتحديثات المنتج لمساعدتك على تحقيق أقصى استفادة من Atlas Cloud.