
Grok Imagine Video 1.5 هي عائلة xAI لتوليد الفيديو للمطورين الذين يحتاجون إلى حركة مضبوطة انطلاقًا من الأوصاف النصية والمدخلات المرئية. حرّك الإطار الابتدائي باستخدام تعليمات حركة باللغة الطبيعية، واختر 480p أو 720p لسير عمل يعتمد على المراجع، وأضف صوتًا مرجعيًا اختياريًا لتوجيه النتيجة. يمكنك الوصول إلى الأوضاع المدعومة باستخدام مفتاح واحد متوافق مع OpenAI من Atlas Cloud، مع تسعير شفاف بنظام الدفع حسب الاستخدام. ابدأ البناء اليوم.
Grok Imagine Video 1.5 من تطوير xAI. توفّر Atlas Cloud (التي تُشغّلها Atlas Cloud AI LLC) إمكانية الوصول إليه ولا تملكه. جميع العلامات التجارية ملك لأصحابها المعنيين.
استكشف ستة endpoints تحوّل النص أو الإطارات الابتدائية أو الأصول المرجعية إلى فيديو ضمن سير عمل المطورين وسير العمل القياسية.
| النمط | الوصف |
|---|---|
| Grok Imagine Video 1.5 Developer Reference-to-Video API | حوّل من 1 إلى 7 صور مرجعية وصوتًا مرجعيًا اختياريًا إلى فيديو مع صوت متزامن مدمج أصليًا. يمكن أن تصل مدة المخرجات إلى 15 ثانية بدقة 480p أو 720p. تناسب نقطة النهاية هذه المشاهد الموجّهة بالمراجع والمفاهيم البصرية التي تتطلب عدة صور مصدرية. |
| Grok Imagine Video 1.5 Reference-to-Video API | بإرشاد من 1 إلى 7 صور مرجعية، تنشئ نقطة النهاية هذه فيديوهات بصوت متزامن مدمج أصليًا، كما يمكنها قبول صوت مرجعي اختياري. تدعم مددًا تصل إلى 15 ثانية بدقة 480p أو 720p. اخترها لإنتاج فيديو يستند إلى مراجع متعددة وتسلسلات موجّهة بالصوت. |
| Grok Imagine Video 1.5 Developer Text-to-Video API | تكفي مطالبة نصية لإنشاء فيديو بصوت متزامن مدمج أصليًا عبر نقطة النهاية المخصصة للمطورين هذه. أنشئ مقاطع تصل مدتها إلى 15 ثانية بدقة 480p أو 720p أو 1080p. يلائم هذا المفاهيم القائمة على المطالبات، ولوحات القصة، وإنتاج الفيديوهات القصيرة. |
| Grok Imagine Video 1.5 Text-to-Video API | أنشئ فيديو مباشرةً من مطالبة نصية مع توليد صوت متزامن مدمج أصليًا. تشمل خيارات الإخراج المتاحة 480p و720p و1080p، بمدة قصوى قدرها 15 ثانية. استخدمه للمشاهد المكتوبة، أو مفاهيم الحملات، أو أصول الفيديو المخصصة لمنصات التواصل الاجتماعي. |
| Grok Imagine Video 1.5 Developer Image-to-Video API | بدءًا من صورة واحدة، تطبّق نقطة النهاية المخصصة للمطورين هذه تعليمات حركة باللغة الطبيعية لإنتاج فيديو متحرك. تشمل خيارات الدقة 480p و720p و1080p. وتناسب تحريك الأعمال الفنية، والمرئيات الخاصة بالمنتجات، والإطارات الافتتاحية المُعدّة مسبقًا. |
| Grok Imagine Video 1.5 Image-to-Video API | حرّك صورة الإطار الابتدائي عبر وصف الحركة المطلوبة باللغة الطبيعية. يمكن إنشاء الفيديو الناتج بدقة 480p أو 720p أو 1080p. يدعم سير العمل هذا دراسات الحركة، والسرد البصري، والإنتاج الإبداعي القائم على الصور. |
يجمع Grok Imagine Video 1.5 بين النص والصورة الابتدائية وسير عمل الصور المرجعية من صورة واحدة إلى سبع صور، مع صوت أصلي متزامن وإخراج يصل إلى 1080p ومقاطع تصل مدتها إلى 15 ثانية في نمطي النص أو المرجع، بينما تضيف Atlas Cloud واجهة API واحدة وتسعيراً شفافاً حسب الاستخدام.
ابدأ بموجّه نصي وأنشئ مقاطع تصل مدتها إلى 15 ثانية بدقة 480p أو 720p أو 1080p. يصل الصوت الأصلي المتزامن مع الفيديو ضمن عملية التوليد نفسها. شكّل المشهد والحركة بالكامل عبر التوجيه المكتوب عندما لا تتوفر صورة مصدر. يناسب هذا المسار الأفلام المفاهيمية والتجارب السينمائية وخطوط إنتاج المحتوى المعتمدة على الموجّهات.
يتحوّل إطار ابتدائي واحد إلى تسلسل متحرك عبر موجّهات الحركة باللغة الطبيعية. اختر إخراجاً بدقة 480p أو 720p أو 1080p، بينما تحدد الصورة التكوين الافتتاحي. وجّه حركة العناصر وحركة المشهد في الموجّه، ثم دع النموذج يواصل التحريك انطلاقاً من ذلك المرساة البصرية. يناسب هذا اللقطات التجارية للمنتجات ولحظات الشخصيات والصور الثابتة الموجّهة فنياً التي تحتاج إلى حركة.
وجّه Grok Imagine Video 1.5 باستخدام صورة مرجعية واحدة إلى سبع صور، مع صوت مرجعي اختياري. ينتج نمط المرجع مقاطع تصل مدتها إلى 15 ثانية بدقة 480p أو 720p، مع صوت أصلي متزامن. استخدم هذه المدخلات لدفع المشهد المُولّد نحو توجه بصري محدد مسبقاً. يناسب هذا المسار الحملات والقصص المبنية على مراجع إبداعية موجودة.
يُولَّد الفيديو والصوت معاً، بحيث يمكن أن يتضمن كل مقطع صوتاً أصلياً متزامناً من دون مرحلة صوت منفصلة. ابنِ المشاهد حول أفعال مرئية يمكن تعزيز توقيتها عبر المسار الصوتي المصاحب. عندما تكون المزامنة مهمة، يقلل مسار التوليد الموحّد هذا من الفاصل بين إنشاء الصورة وإنتاج الصوت. وهو مفيد بشكل خاص للقطات الغنية بالأداء والأجواء.
مدّد لحظة بصرية مكتملة عبر مقاطع نصية أو مرجعية تصل مدتها إلى 15 ثانية، بدلاً من التوقف عند حلقة قصيرة. تتيح المدة المتوفرة تقديم التمهيد والحركة والخاتمة الواضحة ضمن تسلسل مُولّد واحد. اقرن هذه المساحة الزمنية بتغيير زوايا الكاميرا واستمرارية الحركة لإنشاء لحظة أكثر تطوراً. تناسب هذه المدة الإعلانات القصيرة والكشف السردي ومشاهد الفيديو الاجتماعية.
انتقل بين التوليد من النصوص والصور الابتدائية والمراجع عبر واجهة Atlas Cloud API واحدة، مع تسعير شفاف حسب الاستخدام. اختر سير العمل الذي يناسب كل أصل بدلاً من إجبار كل فكرة على المرور عبر نوع إدخال واحد. يتيح التكامل نفسه للمطورين الوصول إلى نقاط النهاية الست المدرجة لـ Grok Imagine Video v1.5، بما في ذلك المساران Standard وDeveloper. يبسّط ذلك التجارب والتخطيط للإنتاج عبر مهام الفيديو المتنوعة.
تعرّف على كيفية تفسير Grok Imagine Video 1.5 وبديلين من Atlas Cloud للموجّهات المتطابقة، عبر مشاهد حركة سينمائية وفانتازيا مُنَمَّقة.
فيلم فانتازيا باروكي تحت الماء، مدته 9 ثوانٍ وبلقطة واحدة متواصلة، داخل دار أوبرا مهجورة ومغمورة بالكامل بالماء: غطّاسة حرة رشيقة بشعر منسدل وقناع لؤلؤي مضيء تطارد أخطبوطًا أحمر مرجانيًا زاهيًا يحمل مفتاحًا نحاسيًا مزخرفًا، عبر ستائر مخملية عائمة. ابدأ من داخل أرضية مسرح متشققة بلقطة صاعدة درامية من زاوية منخفضة، بينما تتدحرج الغطّاسة وتغوص برأسها أولًا عبر الشق؛ ثم انتقل إلى حركة تتبّع جانبية قريبة وهي تنساب بين مقاعد المسرح المنهارة، مع استجابة شعرها وملابسها طبيعيًا للتيارات، بينما تنتفخ الستائر وتتبعها فقاعات عبر الأقواس المتراكبة؛ ثم دُر حولها وارفع الكاميرا إلى أعلى بينما ينتزع ضغط الماء ثريا بلورية من موضعها فوقها. في ذروة المشهد، تلتوي جانبياً في اللحظة الأخيرة لتتجنب الثريا الساقطة، فتتصادم البلورات وتتبعثر بواقعية، بينما يلتقط الأخطبوط المفتاح المتدحرج بمهارة بواسطة مخالبه المعقدة المتلوية، ويتوقف في وقار احتفالي، ثم يعيده إلى يدها المفتوحة. حركة مائية متصلة، وبداية واضحة ثم مطاردة ثم خاتمة، واتساق في الشخصية وقناع اللؤلؤ، مع تمثيل دقيق فيزيائيًا لمقاومة الماء والطفو والقماش والشعر والفقاعات وتشوه المخالب والاصطدامات وتجنب التصادم. أشعة سماوية باردة بلون السيان، تتسلل من المناور المحطمة وتخترق القاعة المظلمة الغارقة؛ الأحمر المرجاني هو اللون الوحيد عالي التشبع، ليوجّه العين عبر الطبقات العميقة من الأقواس والستائر والحطام المعلّق والفقاعات. تصوير سينمائي فوتوغرافي واقعي تحت الماء، بملمس زيتي مرهف، وفخامة باروكية أنيقة، وتأثيرات انكسار ضوئي حجمية، وتفاصيل عالية، ومن دون نص أو واجهة أو قطوع متخفية على هيئة إطارات ثابتة. صوت غامر: دوي مكتوم تحت الماء، وتيارات متدفقة، ورفرفة القماش، وفقاعات، واصطدامات بلورية، ونبض أوركسترالي متوتر ينتهي بنغمة هارب رقيقة واحدة عند إعادة المفتاح. نسبة أبعاد 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
إعلان كوميدي عبثي مليء بالحركة، مدته 9 ثوانٍ، تدور أحداثه داخل صالون حلاقة من خمسينيات القرن العشرين، مُفصّل بعناية فائقة عند الفجر. كلب راعٍ إنجليزي قديم عابس وكثيف الفرو، مغطى برغوة صابون بيضاء كثيفة، يقتحم الباب ويندفع عبر الصالون بينما ينفض الرغوة في كل اتجاه؛ فيقفز حلاق مذعور إلى كرسي دوّار ويطارده راكبًا إياه، ويقص بسرعة شعر الكلب المتطاير، مع تزامن كل طقّة مقص واضحة بدقة مع ضربات طبول جاز حادة. ابدأ بلقطة تتبّع شديدة الانخفاض عند مستوى الأرض، تندفع بمحاذاة الكفوف المبللة وهي تنزلق فوق بلاط مربعات لامع أبيض وأسود، فترسل قطرات ورذاذ رغوة واقعيين نحو العدسة؛ ثم نفّذ حركة التفاف سريعة إلى أعلى، تليها لقطة تتبّع دائرية سريعة تستخدم ثلاث مرايا كبيرة لكشف مواقع الكلب والحلاق المتغيرة والحفاظ عليها باستمرار عبر انعكاسات معقدة ودقيقة؛ ثم نفّذ حركة اقتراب سريعة بالكاميرا بينما تتساقط قصاصات الشعر الأخيرة في الهواء وتدور وتهبط بدقة فوق رأس الكلب، لتشكّل تسريحة بومبادور شاهقة ومبالغًا فيها. يتوقف الكلب ويتخذ وضعية مغرورة في لحظة استعراضية مدتها ثانية واحدة تشبه التجميد، ثم يعطس فجأة مطلقًا نفخة انفجارية من الرغوة والشعر، بينما ينتهي الجاز بضربة حافة طبول كوميدية حادة. أضواء تنغستن عملية دافئة تشق ضباب الصباح الفيروزي البارد خارج النوافذ؛ لوحة ألوان عتيقة غنية من العنابي والكريمي والنحاس المصقول والخشب الداكن؛ تصوير سينمائي إعلاني حي فاخر، وكوريغرافيا متصلة عالية السرعة بسلاسة، واتساق في الشخصيات والاستمرارية المكانية، مع تمثيل دقيق فيزيائيًا للفرو المبلل ورغوة الصابون والشعر المتساقط والانعكاسات ودوران الكرسي والقصور الذاتي والاصطدامات، وتفاصيل فوتوغرافية واقعية ملموسة ووضوح حركي حاد، ومن دون حركة بطيئة، أو لقطات تأسيسية فارغة، أو شاشات، أو واجهات برمجية، أو لوحات معلومات، أو أشرطة تقدم، أو مخططات، أو تعليقات توضيحية، أو نص تفسيري، أو شعارات، أو علامات مائية، بنسبة أبعاد 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
يحوّل Grok Imagine Video 1.5 المطالبات، والإطارات المصدرية، وما يصل إلى سبع صور مرجعية إلى مقاطع فيديو قصيرة بصوت متزامن للحملات، وعروض المنتجات، وقصص الشخصيات، ومحتوى شبكات التواصل الاجتماعي، والنمذجة البصرية السريعة.
حوّل صورة ثابتة لمنتج إلى مشهد متحرك باستخدام مطالبات حركة باللغة الطبيعية وصوت متزامن. أنشئ مقاطع عرض قصيرة للمتاجر الإلكترونية، وصفحات الحملات، ومواد الإطلاق، أو المواضع الإعلانية المدفوعة على شبكات التواصل الاجتماعي بدقة تصل إلى 1080p.
وجّه المشهد باستخدام مرجع واحد إلى سبعة مراجع للشخصيات، مع إمكانية إضافة صوت مرجعي اختياري. يتيح هذا الإعداد ظهور طاقم متكرر، ولحظات الحوار، ومقاطع سردية قصيرة بصوت متزامن أصلي.
ابدأ بمطالبة نصية لإنشاء فيديو متكامل بصوت متزامن أصلي. يمكن لفرق التسويق استكشاف مفاهيم الحملات، والمقاطع المزاجية، والإعلانات التشويقية للإطلاق دون إعداد صورة مصدر.
حوّل إطار بداية واحد إلى حركة باستخدام توجيهات باللغة الطبيعية بدقة تصل إلى 1080p. أنشئ مواد حملات موجزة للخلاصات، وصفحات الإطلاق، وإعلانات الفعاليات، وتحديثات المنتجات، والمنشورات التي ينشئها المبدعون.
امنح إطارًا معتمدًا من لوحة القصة حياةً جديدة بحركة موجّهة بالمطالبة، مع الاحتفاظ به كصورة البداية. يمكن للمخرجين والمصممين إنشاء لقطات previz قصيرة بصوت متزامن لمراجعتها.
اجمع بين صور المنتجات، ولقطات الشخصيات، وتفاصيل الأزياء، ومراجع المشاهد في ما يصل إلى سبع صور. يمكن لفرق العلامات التجارية توجيه مشاهد ترويجية قصيرة بصوت متزامن، مع الاستناد في كل طلب إلى الأصول المرئية الموفّرة.
قارن Grok Imagine Video 1.5 مع نماذج Reference-to-Video الرائدة من حيث المدخلات المقبولة، وطول المقطع، والدقة، والصوت المتزامن، والسعر القياسي لكل ثانية.
| النموذج | أنواع المدخلات | طول المقطع | أقصى دقة | صوت أصلي | السعر القياسي |
|---|---|---|---|---|---|
| Grok Imagine Video v1.5 | نص، صورة، صور مرجعية، صوت | حتى 15 ثانية | 1080p | √ | $0.08/ثانية |
| Seedance 2.0 Reference-to-Video | نص، صورة، فيديو، صوت | من 4 إلى 15 ثانية | 4K | √ | $0.112/ثانية |
| MiniMax H3 Reference-to-Video | نص، صورة، فيديو، صوت | من 4 إلى 15 ثانية | 2K | √ | $0.038/ثانية |
| Wan-2.7 Reference-to-video | نص، صورة، فيديو، صوت | من 2 إلى 10 ثوانٍ | 1080p | √ | $0.10/ثانية |
Get started in minutes — follow these simple steps to integrate and deploy models through Atlas Cloud’s platform.
سجّل في atlascloud.ai وأكمل التحقق. يحصل المستخدمون الجدد على رصيد مجاني لاستكشاف المنصة واختبار النماذج.
دمج نماذج Grok Imagine Video 1.5 المتقدمة مع منصة Atlas Cloud المسرّعة بـ GPU يوفر أداءً لا مثيل له وقابلية للتوسع وتجربة مطور استثنائية.
زمن انتقال منخفض:
استدلال محسّن لـ GPU للاستجابة في الوقت الفعلي.
API موحد:
قم بتشغيل Grok Imagine Video 1.5 و GPT و Gemini و DeepSeek من خلال تكامل واحد.
تسعير شفاف:
فواتير يمكن التنبؤ بها لكل رمز مع خيارات بدون خادم.
تجربة المطور:
SDKs والتحليلات وأدوات الضبط الدقيق والقوالب.
الموثوقية:
وقت تشغيل 99.99%، RBAC، وتسجيل جاهز للامتثال.
الأمان والامتثال:
SOC 2 Type II، توافق HIPAA، سيادة البيانات في الولايات المتحدة.
Grok Imagine Video 1.5 هو عائلة نماذج xAI لتوليد الفيديو، وتتيح إنشاء مقاطع انطلاقًا من نص أو صورة بداية أو عدة صور مرجعية. ومن خلال Atlas Cloud، يمكن للمطورين الوصول إلى نقاط نهاية منفصلة لكل وضع توليد.
تتوفر ثلاثة أوضاع: text-to-video وimage-to-video وreference-to-video. اختر text لإنشاء مشهد من الصفر، أو image لتحريك إطار البداية، أو reference لتوجيه الشخصيات والعناصر والأنماط باستخدام عدة صور.
أنشئ مفتاح API في Atlas Cloud، ثم أرسل طلبًا موثّقًا إلى نقطة نهاية توليد الفيديو مع معرّف النموذج المناسب. استخدم معرّف المهمة المُعاد للتحقق من حالة التوليد واسترداد عنوان URL للفيديو المكتمل.
يتطلب text-to-video مطالبةً بلغة طبيعية، بينما يضيف image-to-video صورةً واحدة لإطار البداية. يقبل reference-to-video مطالبةً من 1 إلى 7 صور مرجعية، مع إمكانية اختيارية لاستخدام معرّفات أصوات مُعدّة مسبقًا للحوار المُولّد.
تدعم مخططات Atlas Cloud المتاحة مقاطع تتراوح مدتها بين 1 و15 ثانية. يوفر text-to-video وimage-to-video إخراجًا بدقّات 480p أو 720p أو 1080p، بينما يدعم reference-to-video دقّتي 480p أو 720p.
نعم. ينشئ text-to-video صوتًا أصليًا متزامنًا انطلاقًا من المطالبة، ويمكن لـ reference-to-video دمج صوت مُولّد مع صوت مُعدّ مسبقًا اختياري للحوار.
تعرض Atlas Cloud سعرًا أساسيًا قياسيًا قدره $0.08 لكل نقطة نهاية مشمولة في صفحة هذه العائلة. راجع تفاصيل الفوترة الحالية لنقطة النهاية المحددة قبل النشر، لأن سجل الأسعار المتاح لا يحدد وحدة الفوترة.
أرسل من 1 إلى 7 صور عبر نقطة نهاية reference-to-video. حدّد الأصول المطلوبة في المطالبة باستخدام وسوم مثل <IMAGE_0> و<IMAGE_1>، حتى يتمكن النموذج من ربط كل مرجع بالشخصية أو العنصر المقصود في المشهد.
لا تتضمن مخططات Atlas Cloud المتاحة مَعلمة مخصصة للإطار الأخير. يستخدم image-to-video صورةً واحدة كإطار بداية، بينما يستخدم reference-to-video من 1 إلى 7 صور كإرشاد بصري، وليس كإطارين أول وأخير مضمونين.
اختر reference-to-video عندما تحتاج عدة صور إلى توجيه الأشخاص أو العناصر أو النمط البصري في مشهد جديد. استخدم image-to-video عندما ينبغي أن تصبح صورة موجودة إطار الافتتاح، وأن تتبع حركتها مطالبةً بلغة طبيعية.
أدلة وشروحات وتحديثات المنتج لمساعدتك على تحقيق أقصى استفادة من Atlas Cloud.