توفر Pixverse API للمطورين وصولاً مباشراً إلى نماذج إنشاء مقاطع الفيديو الخاصة بـ AISphere. يغطي V6 تحويل النص إلى فيديو، والصورة إلى فيديو، والإنشاء الموجه بمرجع، والتحكم في إطار البداية والنهاية، وتمديد المقطع في مسار عمل واحد، بينما يحول C1 القصص المصورة إلى تسلسلات متعددة اللقطات تحافظ على اتساق الشخصيات والمشاهد عبر القطعات. تخدم Atlas Cloud كلتا السلسلتين بتسعير شفاف في الثانية وبدون إعداد للبنية التحتية. ابدأ البناء اليوم.
يوفر لك Atlas Cloud أحدث النماذج الإبداعية الرائدة في الصناعة.
اكتشف ما تستقبله كل نقطة نهاية في Pixverse API، وما تولده، وتكلفتها على Atlas Cloud، بدءًا من المطالبات النصية الفردية وحتى التحكم المرجعي المكون من سبع صور.
| Modality | Description |
|---|---|
| Pixverse V6 Text-to-Video API (Text to Video) | Describe a scene in up to 5,000 characters and V6 renders it as a video of 1 to 15 seconds, at up to 1080p, with audio generated in the same pass. Eight aspect ratios from 21:9 cinematic to 9:16 vertical cover film, social, and ad formats without post-cropping. Pricing on Atlas Cloud starts at $0.025 per second. |
| Pixverse V6 Image-to-Video API (Image to Video) | A single still image is all this endpoint needs to produce a motion clip that preserves the source's visual identity, guided by a text prompt of up to 5,000 characters. It accepts JPG and PNG inputs up to 10MB with aspect ratios from 1:2.5 to 2.5:1, so portraits, product shots, and wide banners all animate without reformatting. Optional native audio and a seed parameter make outputs repeatable for production pipelines. |
| Pixverse V6 Start-End-to-Video API (Image to Video) | When a clip has to land on an exact final frame, this endpoint takes both a start image and an end image and generates all the motion in between. Frames can be passed as public URLs or Base64 in PNG, JPEG, or WebP, and clips run 1 to 15 seconds at up to 1080p. That makes it the natural pick for scene transitions, loopable content, and shots with a fixed visual destination. |
| Pixverse V6 Reference-to-Video API (Reference to Video) | Up to seven reference images steer each generation, and every image can be tagged as subject or background and given its own reference name for prompt-level control. V6 keeps character appearance and scene context stable across the clip, which removes manual keyframing from character-driven and brand-consistent work. Output supports the full range of eight aspect ratios and resolutions up to 1080p. |
| Pixverse V6 Video-Extend API (Video to Video) | Need a clip to run longer than its original cut? Pass a source video URL plus a text prompt and V6 continues the footage for another 1 to 15 seconds, preserving the established motion and visual style. At $0.025 per second on Atlas Cloud, extending a scene costs the same as generating one from scratch. |
| Pixverse C1 Text-to-Video API (Text to Video) | C1 treats text-to-video as a storyboard problem, generating clips built for multi-shot narrative continuity rather than isolated standalone shots. Prompts up to 5,000 characters drive videos of 1 to 15 seconds with native audio, eight aspect ratio options, and quality up to 1080p. Atlas Cloud prices the C1 series from $0.03 per second on a pay-as-you-go basis. |
| Pixverse C1 Image-to-Video API (Image to Video) | Feed C1 a still image and it returns a video sequence in which character and scene fidelity hold from the first frame to the last. Inputs follow the same practical limits as V6, JPG or PNG up to 10MB with aspect ratios from 1:2.5 to 2.5:1, so existing assets drop straight in. Its storyboard-aware design suits multi-scene projects where identity drift between shots is not acceptable. |
| Pixverse C1 Start-End-to-Video API (Image to Video) | Defining a clip by its first and last frames gives C1 a complete narrative arc to fill, and the model generates the connecting motion while keeping the series' storyboard-native visual language intact. Start and end images upload as URLs or Base64 in PNG, JPEG, or WebP, with durations of 1 to 15 seconds and a seed option for repeatable results. Episodic and multi-chapter productions use it to lock scene-to-scene transitions in place. |
| Pixverse C1 Reference-to-Video API (Reference to Video) | For serialized content where a character must look identical from one episode to the next, this endpoint accepts up to seven tagged reference images and holds their appearance across every generated shot. Subject and background tags plus per-image reference names give the Pixverse API its most granular consistency control, layered on C1's multi-shot architecture. It is available on Atlas Cloud from $0.03 per second with one OpenAI-compatible key. |
يوفّر الجمع بين النماذج المتقدمة ومنصة Atlas Cloud المسرَّعة بوحدات GPU سرعة وقابلية توسّع وتحكّمًا إبداعيًا لا مثيل لها في توليد الصور والفيديو.
صُمِّم C1 للتعامل مع المشاهد التي تكشف حدود معظم نماذج الفيديو بالذكاء الاصطناعي — تصميم حركات القتال القريب، والحركة عالية السرعة، وتأثيرات الجسيمات، وديناميكا الموائع، والبيئات الغنية بالأجواء. تظل العلاقات المكانية والوزن الفيزيائي متسقة عبر الإطارات، ما يقلل من أعباء التصحيح التي يتطلبها محتوى الحركة عادةً. كما يدعم المشاهد الواقعية والمُنمَّطة معًا ضمن سير عمل توليد واحد.
يحوِّل PixVerse C1 تخطيطات القصص المصوّرة الثابتة مباشرةً إلى تسلسلات فيديو متواصلة، مع تقسيم المشاهد تلقائيًا وفقًا لبنية الموجّه. يمكن لفرق الإنتاج رفع اللوحات الثابتة والحصول على تسلسل متعدد اللقطات دون إعادة بناء كل مشهد من الصفر. وهذا يجعل C1 الخيار العملي لاستوديوهات الأفلام وفرق الرسوم المتحركة والوكالات التي تعمل وفق موجزات إبداعية معتمدة مسبقًا.
يعرض PixVerse V6 حركات الكاميرا — لقطات التتبّع، وتحوّلات المنظور، والكشف التدريجي عن البيئات — بدقة وبأقل قدر من التشوّهات. وتظل مشاعر الشخصيات ولغة أجسادها متسقة عبر تغيّرات المشاهد، ما يجعله موثوقًا للتسلسلات السردية التي تتطلب أكثر من مقطع واحد مستقل. بالنسبة لفرق التسويق واستوديوهات المحتوى، يعني ذلك تصحيحًا يدويًا أقل وتكرارًا أسرع من الموجز الإبداعي إلى الناتج النهائي.
ضَع وسمًا لما يصل إلى سبع صور مرجعية كموضوع أو خلفية، وامنح كل صورة اسمًا، ثم استدعِها مباشرةً في الموجّه. تحافظ الوجوه والمنتجات والبيئات على مظهرها الدقيق في كل إطار.
هل تريد الصوت دون خط معالجة منفصل؟ يعرض كل من V6 وC1 صوتًا متزامنًا في تمريرة التوليد نفسها، بحيث تخرج الإعلانات التشويقية والإعلانات ومقاطع الشبكات الاجتماعية من الـ API جاهزة للنشر.
من الإطارات السينمائية بنسبة 21:9 إلى الخلاصات العمودية بنسبة 9:16، تغطي ثماني نسب أبعاد وأربعة مستويات دقة إنتاج الأفلام والبث ومحتوى الشبكات الاجتماعية. اختر 360p للمسودات أو 1080p للتسليم النهائي، دون أي قصّ بعد التوليد.
يمكن أن يصل طول الموجّه الواحد إلى 5,000 حرف، وهو ما يكفي لتحديد ترتيب اللقطات والإضاءة والأزياء والإيقاع في طلب واحد. وتتحوّل النصوص التفصيلية إلى لقطات مطابقة للموجز من المحاولة الأولى.
الموجّه نفسه، تم توليده بواسطة Pixverse ونماذج الفيديو الرائدة الأخرى: لقطات متعددة وفيلم إعلاني تجاري فاخر
أنشئ إعلانًا تجاريًا سينمائيًا مدته 10 ثوانٍ لدراجة كهربائية فاخرة. المشهد 1، 0–2 ث: لقطة ماكرو مقرّبة لقطرات المطر وهي تنزلق على إطار الدراجة الأسود غير اللامع. انعكاسات نيون ناعمة، عمق ميدان ضحل، حركة كاميرا بطيئة بالدفع للأمام. أجواء مطر خافتة. المشهد 2، 2–5 ث: لقطة تتبع من زاوية منخفضة بينما تسير الدراجة ليلًا في شارع مديني مبلل. تتناثر المياه من الإطارات عبر برك ضحلة. أضف صوتًا واقعيًا لرذاذ الإطارات، وهمهمة خفيفة للمحرك الكهربائي، وأجواء حركة مرور بعيدة. المشهد 3، 5–8 ث: لقطة متابعة جانبية سلسة للدراجة نفسها وهي تمر تحت أضواء الشوارع. حافظ تمامًا على نفس هندسة الهيكل والعجلات والمصباح الأمامي واللون والنسب. ضبابية حركة مضبوطة، تأطير إعلاني فاخر. المشهد 4، 8–10 ث: اللقطة البطولية الختامية: تتوقف الدراجة بجوار مبنى زجاجي. يتوهج المصباح الأمامي بلطف، وتتلاشى انعكاسات المطر والنيون بشكل طبيعي. المنتج في المنتصف، حاد الوضوح، بمظهر إعلاني راقٍ. المتطلبات: - الحفاظ على تصميم الدراجة نفسه تمامًا في جميع اللقطات - استخدام تحكم سينمائي واضح بالكاميرا: لقطة ماكرو مقرّبة، تتبع من زاوية منخفضة، متابعة جانبية، لقطة بطولية ختامية - الحفاظ على اتساق المطر والإضاءة والانعكاسات وأجواء المدينة - مزامنة الصوت مع الحركة: المطر، رذاذ الإطارات، همهمة المحرك الكهربائي، أجواء المدينة - لا عجلات مشوّهة، ولا تغيّر في بنية الهيكل، ولا تفاصيل منتج غير متسقة - خامات واقعية، مظهر فيلم إعلاني مصقول، 1080p
Pixverse
Wan 2.7
Kling V3.0
أنشئ إعلانًا تجاريًا سينمائيًا مدته 10 ثوانٍ لمكبر صوت لاسلكي شفاف موضوع على طاولة استوديو عصرية. المشهد 1، 0–2 ث: لقطة ماكرو مقرّبة لهيكل مكبر الصوت الشفاف. المكوّنات الداخلية مرئية عبر الغلاف الشفاف. إضاءة استوديو ناعمة، انعكاسات نقية، عمق ميدان ضحل، حركة كاميرا بطيئة بالدفع للأمام. المشهد 2، 2–5 ث: يبدأ مكبر الصوت بالعمل. تضيء حلقة LED خافتة من المركز نحو الخارج. تنفّذ الكاميرا لقطة دوران سلسة حول المنتج. أضف نغمة تشغيل ناعمة ونبضة باس منخفضة متزامنة مع حركة إضاءة الـ LED. المشهد 3، 5–8 ث: لقطة جانبية قريبة: تتجسّد الموجات الصوتية عبر اهتزازات لطيفة على كوب ماء قريب. يظل مكبر الصوت بنفس الشكل والحجم والخامة والتخطيط الداخلي تمامًا. خلفية استوديو نقية، تأطير فاخر للمنتج. المشهد 4، 8–10 ث: اللقطة البطولية الختامية: مكبر الصوت الشفاف في منتصف الطاولة، حلقة الـ LED تتوهج بلطف، والكاميرا تتراجع ببطء. استوديو مستقبلي بسيط، ومظهر إعلاني مصقول. المتطلبات: - الحفاظ على تصميم مكبر الصوت نفسه تمامًا في جميع اللقطات - استخدام تحكم سينمائي بالكاميرا: لقطة ماكرو مقرّبة، دوران سلس، لقطة جانبية قريبة، تراجع بطولي ختامي - الحفاظ على اتساق إضاءة الاستوديو والانعكاسات والشفافية وحجم المنتج - مزامنة الصوت مع الحدث: نغمة التشغيل، نبضة الباس، الاهتزاز الخفيف - لا تغيير في المكوّنات الداخلية، ولا تشوّه في الغلاف الشفاف، ولا اختلاف في موضع الـ LED - أسلوب إعلانات التقنية الراقية، تكوين نقي، خامات واقعية، 1080p
Pixverse
Wan 2.7
Kling V3.0
سواء كنت تحرّك لقطة منتج واحدة أو تخرج مسلسلًا متعدد الحلقات، يغطي Pixverse API على Atlas Cloud فيديو الشبكات الاجتماعية، وتحريك التجارة الإلكترونية، والانتقالات السلسة، والسرد الطويل، مع تسعير شفاف بنظام الدفع حسب الاستخدام.
حوّل موجّهًا نصيًا واحدًا إلى مقطع عمودي يوقف التمرير باستخدام توليد النص إلى فيديو في Pixverse V6. يحافظ المبدعون الذين ينشرون يوميًا على TikTok وReels وShorts على تجدد خلاصاتهم بتكلفة $0.025 للثانية.
تتحوّل صور المنتجات الثابتة إلى مقاطع رئيسية غنية بالحركة عبر تحويل الصورة إلى فيديو في V6، مع الحفاظ على الهوية البصرية الأصلية إطارًا بإطار. تحوّل فرق التجارة الإلكترونية كتالوجاتها الكاملة إلى إعلانات دون حجز جلسة تصوير في استوديو.
هل تحتاج إلى البطل نفسه عبر عشر حلقات؟ يثبّت تحويل المرجع إلى فيديو في C1 مظهر الشخصية والبيئة من مقطع إلى آخر، ما يمنح فرق الرسوم المتحركة واستوديوهات الويبتون ومالكي الملكيات الفكرية خط إنتاج مسلسلًا موثوقًا.
عندما يحدد إطاران مفتاحيان لقطتك، تولّد نقطة النهاية start-end كل الحركة بينهما. تحصل على قطعات مشاهد مصقولة، وكشوفات متحوّلة، وخلفيات بصرية قابلة للتكرار الحلقي بإتقان دون أي عمل يدوي على الإطارات المفتاحية.
نادرًا ما تحتاج المقاطع المولّدة إلى الانتهاء عند قطعها الأول، إذ تواصل نقطة النهاية video-extend في V6 تمديد اللقطات مع الحفاظ على الحركة والأسلوب. يربط المحرّرون المقاطع الممدّدة في إعلانات تشويقية وفيديوهات موسيقية وتسلسلات أطول.
تقع جميع نقاط نهاية V6 وC1 خلف مفتاح واحد متوافق مع OpenAI على Atlas Cloud، وتُحتسب التكلفة بنظام الدفع حسب الاستخدام بدءًا من $0.025 للثانية. يضيف المطوّرون توليد فيديو جاهزًا للإنتاج إلى منتجاتهم دون إدارة بنية GPU التحتية.
قبل أن تختار حزمة توليد الفيديو الخاصة بك، اطّلع على مقارنة PixVerse API مع Kling وVeo وSora وWan من حيث أوضاع الإدخال والدقة وطول المقطع والصوت الأصلي والتسعير لكل ثانية.
| النموذج | أوضاع الإدخال | أقصى دقة | طول المقطع | صوت أصلي | Price per Second |
|---|---|---|---|---|---|
| PixVerse V6 | نص، صورة، صور مرجعية، إطارات البداية والنهاية، تمديد الفيديو | 1080p | من 1 إلى 15 ثانية | √ | From $0.025/s on Atlas Cloud |
| PixVerse C1 | نص، صورة، صور مرجعية، إطارات البداية والنهاية | 1080p | من 1 إلى 15 ثانية | √ | From $0.03/s on Atlas Cloud |
| Kling 2.5 Turbo Pro | نص، صورة | 1080p | 5 أو 10 ثوانٍ | - | About $0.07/s |
| Google Veo 3.1 | نص، صورة، صور مرجعية، الإطاران الأول والأخير | حتى 4K | 4 أو 6 أو 8 ثوانٍ | √ | $0.40/s (Fast from $0.10/s) |
| OpenAI Sora 2 | نص، صورة | 720p (1080p على Sora 2 Pro) | 4 أو 8 أو 12 ثانية | √ | $0.10/s ($0.30/s for Pro) |
| Alibaba Wan 2.5 | نص، صورة، توجيه صوتي اختياري | 1080p | 5 أو 10 ثوانٍ | √ | From $0.05/s |
Get started in minutes — follow these simple steps to integrate and deploy models through Atlas Cloud’s platform.
سجّل في atlascloud.ai وأكمل التحقق. يحصل المستخدمون الجدد على رصيد مجاني لاستكشاف المنصة واختبار النماذج.
دمج نماذج Pixverse المتقدمة مع منصة Atlas Cloud المسرّعة بـ GPU يوفر أداءً لا مثيل له وقابلية للتوسع وتجربة مطور استثنائية.
زمن انتقال منخفض:
استدلال محسّن لـ GPU للاستجابة في الوقت الفعلي.
API موحد:
قم بتشغيل Pixverse و GPT و Gemini و DeepSeek من خلال تكامل واحد.
تسعير شفاف:
فواتير يمكن التنبؤ بها لكل رمز مع خيارات بدون خادم.
تجربة المطور:
SDKs والتحليلات وأدوات الضبط الدقيق والقوالب.
الموثوقية:
وقت تشغيل 99.99%، RBAC، وتسجيل جاهز للامتثال.
الأمان والامتثال:
SOC 2 Type II، توافق HIPAA، سيادة البيانات في الولايات المتحدة.
يمنح PixVerse API المطورين وصولاً برمجيًا إلى نماذج إنشاء مقاطع الفيديو بالذكاء الاصطناعي الخاصة بـ PixVerse عبر Atlas Cloud. بدلاً من استخدام تطبيق المستهلك PixVerse، الذي يعمل بأرصدة يومية ويضيف علامة مائية ويقيد الدقة، يمكنك استدعاء النماذج مباشرةً عبر REST API والدفع فقط مقابل ما تقوم بإنشائه.
V6 هي السلسلة الرائدة متعددة الأغراض، وتغطي تحويل النص إلى فيديو، والصورة إلى فيديو، والمرجع إلى فيديو، والتحكم في الإطارين الأول والأخير، وتمديد الفيديو ضمن مسار واحد. أما C1 فتعتمد نهجًا قائمًا على القصة المصوّرة (storyboard) مصممًا لإنتاج السرد متعدد اللقطات، حيث يكون استمرار المشاهد واتساق الشخصيات عبر القطعات بنفس أهمية جودة الإطار الواحد. على Atlas Cloud، تبدأ نقاط نهاية V6 من $0.025 لكل ثانية، ونقاط نهاية C1 من $0.03 لكل ثانية.
التسعير قائم على الدفع حسب الاستخدام دون الحاجة إلى اشتراك. تُحتسب رسوم نقاط نهاية PixVerse V6 الخمس جميعها بدءًا من $0.025 لكل ثانية من الفيديو المُنشأ، وتبدأ نقاط نهاية C1 الأربع من $0.03 لكل ثانية. لا تدفع إلا مقابل ما تُنشئه، مع تسعير شفاف لكل استدعاء في كل طلب.
تُخرج جميع نقاط نهاية التوليد في PixVerse الفيديو بدقة 360p أو 540p أو 720p أو 1080p، مع 720p كإعداد افتراضي. يمكن أن تتراوح مدة المقاطع من 1 إلى 15 ثانية، وتتوفر ثماني نسب أبعاد: 16:9 و9:16 و1:1 و4:3 و3:4 و2:3 و3:2 و21:9. يغطي هذا النطاق كل شيء من الصيغ الرأسية لوسائل التواصل الاجتماعي إلى الإطارات السينمائية 21:9 دون أي قص بعد التوليد.
نعم. يُنتج كلٌّ من V6 وC1 الصوت في نفس عملية التوليد، ويوفّر Pixverse API معامل sound المُفعَّل افتراضيًا. اضبطه على false إذا كنت تخطط لإضافة الموسيقى بنفسك. الاستثناء الوحيد هو نقطة نهاية V6 Video-Extend، التي لا توفّر معاملًا للصوت.
يقرأ C1 تخطيط القصة المصوّرة متعددة اللوحات كما يقرأ المخرج صفحة قصص مصوّرة، فيعامل كل لوحة كلقطة منفصلة ويستنتج منطق الانتقال بينها. الناتج هو تسلسل متواصل متعدد اللقطات بشخصيات متسقة ومنطق مكاني ثابت، ما يتيح للفرق الانتقال من اللوحات المعتمدة إلى اللقطات دون إعادة بناء كل مشهد. وفي نقطة نهاية تحويل النص إلى فيديو، يمكن أيضًا التحكم في تقسيم اللقطات مباشرة عبر بنية الموجّه (prompt).
تقبل نقطتا نهاية Reference-to-Video في كلٍّ من V6 وC1 من 1 إلى 7 صور مرجعية في كل طلب، ويمكن وسم كلٍّ منها كمرجع للشخصية (subject) أو للخلفية (background). يمكن تقديم الصور كروابط URL عامة أو سلاسل Base64 بصيغة PNG أو JPEG أو WebP، بحدٍّ أقصى إجمالي للطلب يبلغ 20MB. المراجع الموسومة هي ما يُبقي هوية الشخصيات ثابتة من مقطع إلى آخر في الإنتاجات متعددة اللقطات.
تستقبل نقطة نهاية V6 Video-Extend رابط URL لفيديو مصدر مع موجّه نصي، وتُولّد استكمالًا يتراوح من 1 إلى 15 ثانية. تنتقل استمرارية الحركة والأسلوب البصري عبر الامتداد، ما يجعله عمليًا لإطالة مقطع بعد مدته الأصلية أو لبناء محتوى متسلسل من مصادر متعددة. تُحتسب رسومه بنفس سعر $0.025 لكل ثانية كباقي نقاط نهاية V6.
أنشئ حسابًا على Atlas Cloud، وولّد مفتاح API، ثم استدعِ أي نقطة نهاية من PixVerse مع وضع المفتاح في ترويسة Authorization. تعمل الطلبات بشكل غير متزامن: أرسل طلب توليد، واستلم مُعرّف التنبؤ (prediction ID)، ثم استعلم من نقطة نهاية النتائج حتى تصبح الحالة completed. لا توجد بنية تحتية تحتاج إلى إعداد، وتعني ميزة الوصول من اليوم صفر (Day-0) أن إصدارات PixVerse الجديدة تظهر دون أي ترحيل. ابدأ البناء اليوم.