Wan 3.0 المرجع متعدد الوسائط يستوعب 20 أصلًا، و PDF هو أحدها.

مرجع Wan 3.0 متعدد الوسائط يقبل 20 أصلًا في استدعاء واحد: صورًا، فيديو، صوت، ملفات PDF، وحتى رابط URL. اطلع على نتائج Alibaba الخاصة وسير عمل يمكنك تشغيله اليوم.

آخر تحديث: Wan 3.0 متاح الآن اعتبارًا من 24 أغسطس 2026.

لقد أنشأت مجلدًا لإعلان مدته 15 ثانية. صورتان ثابتتان لشخصيتين. فيديو بنبرة العلامة التجارية أرسله العميل. دليل العلامة التجارية الموجود فقط كملف PDF. عينة صوتية للممثل الذي تريده بالفعل.

ثم فتحت نموذج الفيديو الخاص بك وطلب منك صورة واحدة.

لذلك فعلت ما يفعله الجميع. ترجمت المجلد إلى مطالبة من 800 كلمة وصليت. انحرف الوجه في اللقطة الثالثة. تغير لون السترة. كان الصوت لشخص آخر تمامًا.

المرجع الشامل في Wan 3.0 هو المرة الأولى التي يقول فيها نموذج الفيديو: حسنًا، أعطني المجلد. ما يصل إلى 20 أصلًا في استدعاء واحد، عبر خمسة أنواع من المدخلات، مترابطة معًا من خلال لقطة واحدة مستمرة مدتها 30 ثانية.

تقدم هذه المقالة ثلاثة أشياء وتتجاهل الباقي. تحلل ما هي هذه الأصول العشرون بالضبط، وتستخدم مقاطع Alibaba المنشأة كدليل، وتعطيك سير عمل مكافئًا يمكنك تشغيله اليوم، لأن Wan 3.0 لا يزال في المرحلة التجريبية العامة على سحابة Alibaba الخاصة وليس قابلاً للاستدعاء من منصات الطرف الثالث بعد.

الوجبات الرئيسية

  • يقبل المرجع متعدد الوسائط في Wan 3.0 ما يصل إلى 20 أصلًا في استدعاء واحد، تشمل الصور والفيديو والصوت والمستندات وصفحات الويب الحية، ويحافظ عليها متناسقة عبر لقطة واحدة مدتها 30 ثانية.
  • وهو أول نموذج فيديو رئيسي يعامل ملف PDF أو مجموعة شرائح أو عنوان URL كمدخل إبداعي بدلاً من شيء تعيد صياغته في مطالبة.
  • دخل Wan 3.0 في المرحلة التجريبية العامة في 6 أغسطس 2026 على Alibaba Cloud Model Studio وQwen Cloud تحت الاسم wan3.0-video. إنه ذو أوزان مغلقة. أي شخص يخبرك أنه بالفعل Apache 2.0 هو مجرد تخمين.
  • العنوان الرئيسي لـ 20 أصلًا ليس حيث يتفوق حقًا. نماذج المرجع-إلى-الفيديو التي يمكنك استدعاؤها الآن تقبل بالفعل أصولًا أكثر من 20. الفجوة هي المستندات وصفحات الويب، وليس العدد.
  • يمكنك اختبار تنسيق الشخصيتين والمرجع المقفل والصوت الكامل مجانًا باستخدام أداة توليد الإعلانات القصيرة بالذكاء الاصطناعي المجانية من Atlas Cloud: أدخل أربع صور للمنتج، واخرج بمقطع قصير مدته 15 ثانية مع حوار، بدون بطاقة ائتمان. Fluffy cat and black cat running down a grand hotel hallway

قطتان تطاردان عبر خمس مجموعات مختلفة بواسطة Wan 3.0 دون انحراف الشخصية_صورتان مرجعيتان. خمس مجموعات مختلفة تمامًا، من ممر فندق إلى أسطوانة غسالة إلى كشك هاتف أحمر. ولا إطار واحد من الانحراف. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba_ Wan 3.0 creator handbook ، أغسطس 2026، وهو أيضًا مصدر جميع مقاطع Wan 3.0 الأخرى في هذه المقالة.

لماذا ينهار الفيديو متعدد المرجع، وما الذي يغيره المرجع متعدد الوسائط في Wan 3.0

نماذج الفيديو ليس لديها ذاكرة بين المقاطع. كل عملية توليد تبدأ من الصفر. هذه هي المشكلة بأكملها في جملة واحدة.

لذا، بمجرد أن تحتاج قصتك إلى أكثر من لقطة واحدة، فأنت تقوم بالتجميع. اللقطة الأولى تعطيك وجهًا تحبه. اللقطة الثانية تعطيك قريبًا لذلك الوجه. اللقطة الثالثة تغير السترة بهدوء من لون البرقوق إلى العنابي، وبحلول الوقت الذي تلاحظ فيه، تكون قد دفعت ثمن 11 عرضًا.

ساعد المرجع أحادي الصورة، لكنه كان يقفل شيئًا واحدًا فقط. وجهًا. لم يستطع في نفس الوقت تثبيت وجه، وملابس، ودعامة، وموقع، وصوت، لأنه كان هناك فتحة واحدة وخمس مهام.

هناك طريقتان للخروج. أعط النموذج فتحات أكثر، أو أوقفه عن البدء من جديد. يقوم Wan 3.0 بكليهما في وقت واحد، ولهذا السبب فإن الميزتين الرئيسيتين هما في الواقع ميزة واحدة. لقطة أصلية مدتها 30 ثانية تعني أنه لا يوجد قطع يمكن للشخصية أن تنحرف عبره. عشرون أصلًا مرجعيًا يعني أن كل عنصر يجب أن يظل ثابتًا يحصل على فتحته المخصصة بدلاً من القتال على فتحة واحدة.

هذا ما يبدو عليه الأمر عندما لا يتم تجميع أي شيء. ثلاثون ثانية، كاميرا واحدة مستمرة، طفل في عربة تسوق ينتهي به الأمر مطمورًا داخل لوحة إعلانية ثم يخرج من تحتها.

30 ثانية كاملة في تمريرة واحدة، بدون قطع، مع الموسيقى التصويرية المولدة في نفس التمريرة. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba.

ما يعنيه "20 أصلًا" داخل المرجع متعدد الوسائط في Wan 3.0

عشرون هو رقم رئيسي. المهم هو أن العشرين ليست كلها من نفس النوع. يغطي المرجع الشامل في Wan 3.0 خمسة أنواع من المدخلات، وكل منها يتحكم في محور مختلف من المخرجات.

الصور تتحكم في الهوية. بطاقة شخصية، صورة منتج، لوحة موقع. يسمي Wan 3.0 هذا بالاتساق على مستوى البكسل، وفي أمثلة Alibaba الخاصة، يمتد القفل إلى ما وراء الوجه ليشمل خزانة الملابس: العباءة الرمادية ذات الطبقات، السترة الجلدية المربوطة، حزام الخصر الداكن، كلها تبقى على قيد الحياة عبر معركة قتال متلاحم مدتها ستة عشر ثانية عبر ثلاثة مواقع.

Young man in traditional Chinese robes standing outdoors at sunset

بطاقتا شخصية تقودان مشهد قتال في فنون الدفاع عن النفس الصينية مع تفاصيل الزي محفوظة إطارًا بإطار

بطاقتا شخصية بالإضافة إلى لوحة موقع واحدة لضفة القصب. الزي والمكان يثبتان خلال كل رمية. معروضة هنا كـ GIF صامتة؛ الملف النهائي يحتوي على مزيج استريو 44.1 كيلوهرتز. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba.

الصوت يتحكم في الصوت. هذا هو الجزء الذي يجعل "متعدد الوسائط" أكثر من تسويق. تقوم بإرفاق عينة صوتية لكل شخصية، وتكتب السطور في المطالبة، ويعود الحوار بهذا الجرس، متزامنًا مع الشفاه، في نفس تمريرة الصورة. شخصان، مرجعان صوتيان، صالة رياضية واحدة.

صورتان للموضوع بالإضافة إلى مقطعين صوتيين مرجعيين منفصلين، ويعود الحوار بهذين الصوتين. يستحق تشغيل الصوت لهذا المقطع. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba.

الفيديو يتحكم في التوقيت. الفيديو المرجعي ليس موجودًا ليتم نسخه. إنه موجود ليتبرع بإيقاعه: مدة بقاء الإيقاع، كيفية حركة الانتقال. في هذا المقطع، توفر خمس لقطات رئيسية الموضوعات ويوفر فيديو مرجعي إيقاع القلب الأفقي للبطاقة بينهم.

Woman wearing an elaborate traditional Chinese headdress and blue embroidered dress

خمس لقطات رئيسية مقلوبة مع وتيرة مأخوذة من فيديو مرجعي_خمس_ صور رئيسية للموضوعات، فيديو مرجعي واحد لإيقاع القلب. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba.

المستندات وصفحات الويب تتحكم في البنية. هذا هو الجديد حقًا. يقبل Wan 3.0 ملفات المستندات وعناوين URL الحية كمدخل إبداعي، وتذكر التقارير عن النسخة التجريبية .doc و.xls و.ppt و.pdf و.txt ضمن التنسيقات المقبولة (AlphaSignal، أغسطس 2026). يعمل نفس المنطق بالفعل مع صورة القصة المصورة: لوحة واحدة داخلة، وست لقطات خارجة، بترتيب اللوحة نفسه.

Two people with umbrellas stand on a rainy train station platform

لوحة قصة مصورة واحدة موسعة إلى ست لقطات متسلسلة في محطة قطار ممطرة

لوحة قصة مصورة واحدة كمرجع، وست لقطات مولدة بترتيبها، وصولاً إلى تمرير الملاحظة بين الأيدي في اللقطة الخامسة. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba.

الإطارات الأولى والأخيرة تتحكم في نقاط النهاية. أقدم حيلة في الكتاب، لا تزال مدعومة، ولا تزال أسرع طريقة لتحديد حدود اللقطة.

هذا هو كيف يقارن ذلك بالإصدار الذي يستخدمه معظم الناس اليوم.

Wan 2.7 المرجع-إلى-فيديوWan 3.0 المرجع الشامل
الأصول المرجعيةصورة واحدة لكل موضوع، حتى 3 فيديوهات، مقطع صوتي واحدما يصل إلى 20 أصلًا في المجموع
الوسائطصورة، فيديو، صوتصورة، فيديو، صوت، مستند، صفحة ويب
أقصى مدة، تمريرة واحدة10 ثوانٍ30 ثانية بشكل أصلي، بالإضافة إلى المدة الذكية
الصوت في نفس التمريرةنعمنعم
تحرير الفيديو وتمديدهغير مكشوفتحرير قائم على التعليمات والمرجع، بالإضافة إلى التمديد
التوفرمتاح على واجهات برمجة تطبيقات الطرف الثالثالنسخة التجريبية من Alibaba Cloud Model Studio وQwen Cloud

هناك قاعدة واحدة لا يضعها أحد في المستندات ويتعلمها الجميع بالطريقة الصعبة: مرجع واحد، مهمة واحدة. الصورة 1 تثبت الوجه والزي. الفيديو 1 يتبرع بالحركة فقط. الصوت 1 يتبرع بالجرس فقط. اللحظة التي تسند فيها إلى أصل واحد مهمتين متعارضتين، أو تقوم بتحميل صورة مرجعية بها شخصان، يضطر النموذج للتخمين، والتخمين هو بالضبط ما كنت تحاول إيقافه. دليل Alibaba واضح أيضًا في هذا الشأن: موضوع واحد لكل صورة مرجعية.

سير عمل المرجع متعدد الوسائط في Wan 3.0 الذي يمكنك تشغيله اليوم

إجابة مباشرة أولاً. Wan 3.0 في النسخة التجريبية العامة على سحابة Alibaba الخاصة، تحت معرف النموذج wan3.0-video (Alibaba Wan، أغسطس 2026). لم يصل بعد إلى منصات واجهات برمجة تطبيقات الطرف الثالث، بما في ذلك Atlas Cloud. أي شخص يبيع لك وصولاً إلى واجهة برمجة تطبيقات Wan 3.0 الآن هو يعيد بيع شيء آخر.

ما وصل هو شكل سير العمل. حزمة مرجعية داخلة، استدعاء واحد، مقطع منتهٍ مع صوت خارج. هذا يعمل اليوم على نماذج المرجع-إلى-فيديو التي يمكنك استدعاؤها في علامة تبويب المتصفح، وبمجرد أن تصطف جميعها، يبدو العنوان الرئيسي لـ 20 أصلًا مختلفًا.

النموذجالأصول المرجعيةالوسائطأقصى مدةصوت أصليالسعر لكل ثانية
Wan 3.0 (نسخة Alibaba التجريبية، غير متوفر على Atlas)20 في المجموعصورة، فيديو، صوت، مستند، صفحة ويب30 ثانيةنعمتم الإبلاغ عن 0.05 دولار إلى 0.20 دولار حسب الدقة
Wan 2.7 المرجع-إلى-فيديوصورة واحدة لكل موضوع، 3 فيديوهات، مقطع صوتي واحدصورة، فيديو، صوت10 ثوانٍنعم0.10 دولار
Seedance 2.5 المرجع-إلى-فيديو50 (30 صورة / 10 فيديو / 10 صوت)صورة، فيديو، صوت30 ثانيةنعم0.13 دولار
MiniMax H3 المرجع-إلى-فيديومختلط، لا حد مذكورصورة، فيديو، صوت15 ثانيةنعم0.10 دولار
Kling Video O3 Pro المرجع-إلى-فيديو7 صور، أو 4 صور + 1 فيديوصورة، فيديو15 ثانيةنعم0.10 دولار
Vidu Q3-Mix المرجع-إلى-فيديو4 صورصورة16 ثانيةنعم0.11 دولار
Veo 3.1 المرجع-إلى-فيديو3 صورصورة8 ثوانٍاختياري0.20 دولار

الأسعار هي أسعار Atlas Cloud اعتبارًا من أغسطس 2026. أرقام Wan 3.0 هي تلك المبلغ عنها للنسخة التجريبية من Alibaba Cloud، وليست سعر Atlas، ولم تنشر Alibaba صفحة أسعار عامة للنموذج بعد، لذا تعامل مع هذا الصف كمؤقت.

اقرأ هذا الجدول مرتين وستظهر القصة الحقيقية. العنوان الرئيسي لـ 20 أصلًا ليس حيث يتفوق Wan 3.0، لأن Seedance 2.5 يقبل بالفعل 50 ويطابق الـ 30 ثانية. ما لا يقبله أي شيء آخر في تلك القائمة هو ملف PDF.

بالنسبة للإرشادات أدناه، يعمل العرض التوضيحي على Wan 2.7 المرجع-إلى-فيديو، لأن شكل إدخاله هو أقرب قريب حي للمرجع الشامل: صور موضوعات متعددة، فيديو مرجعي اختياري، ومقطع صوتي، كلها مرتبطة بتسميات character1 وcharacter2 داخل المطالبة. ثلاثة نماذج، علامة تبويب متصفح واحدة، لا تثبيت محلي.

للتشغيل المستضاف الحالي، افتح Wan 3.0 على Atlas Cloud واختبر مطالبة مثل المطالبة أدناه قبل نشر سير العمل.

لقطة شاشة للمطالبة والتأثير المولد لـ Wan 3.0 للمرجع متعدد الوسائط

لقطة شاشة من المطالبة إلى النتيجة لـ Wan 3.0: تسليم العلامة التجارية بـ 20 مرجعًا.

ابنها بنفسك: مشهد مرجع متعدد الوسائط في أربع خطوات

المشهد: مكتب استقبال فندق بألوان باستيل. موظف استقبال بوجه جامد. مسافر يحمل قطة راغدول. ينظر موظف الاستقبال مباشرة إلى العدسة ويقول "القطة لديها حجز. أنت ليس لديك."

صورتان بالإضافة إلى مقطع صوتي واحد، أي ثلاثة أصول مرجعية عبر وسيطين. هذا هو أصغر بناء يكون صادقًا متعدد الوسائط بدلاً من مجرد متعدد الصور.

الخطوة 1: توليد الصورة المرجعية 1، الموضوع الذي يجب تثبيته

الصور المرجعية لها ثلاث مهام فقط وثلاث فقط: موضوع واحد، يواجه الكاميرا، خلفية نظيفة. كل شيء آخر هو زخرفة. استخدم GPT Image 2 بجودة high، حجم 16:9، n=1.

Plain
1صورة استوديو كاملة لموظف استقبال فندق في منتصف العمر بتعبير جامد، واقف في المنتصف تمامًا على خلفية حائط بلون وردي غبار مسطح. يرتدي زي جرس أرجواني برقوقي مزدوج الصدر مع زخرفة ذهبية وأزرار نحاسية، وقبعة صغيرة مستديرة، وشارب رفيع. تأطير متماثل تمامًا، إضاءة أمامية ناعمة متساوية، لا ظل على الحائط، حبيبات فيلم 35 مم، لوحة ألوان باستيل باهتة. موضوع واحد فقط، لا أشخاص آخرون، لا نص، لا شعار، لا دعامات في الإطار.
2

واجهة مولد صور ذكاء اصطناعي تظهر خطوات مرقمة وجرس مولّد

ملعب GPT Image 2 على Atlas Cloud مع صورة مرجعية لموظف الاستقبال م rendered في لوحة الإخراج

GPT Image 2 على Atlas Cloud: جودة عالية، 16:9، موضوع واحد، خلفية مسطحة. هذا هو الملف الذي يصبح character1.

الخطوة 2: توليد الصورة المرجعية 2، الموضوع الثاني المثبت

نفس النموذج، نفس الإعدادات. التباين اللوني بين الشخصيتين متعمد، لأنه يعطي النموذج طريقة سهلة لإبقائهما منفصلين عندما يشتركان في الإطار.

Plain
1صورة استوديو كاملة لمسافرة شابة تحمل قطة راغدول منفوشة على صدرها، واقفة في المنتصف تمامًا على خلفية حائط بلون أصفر خردلي مسطح. ترتدي معطف صوف خردلي، وقبعة حمراء ونظارات مستديرة بقرون السلحفاة، وتحمل حقيبة سفر جلدية صغيرة عتيقة في يدها الحرة. تأطير متماثل تمامًا، إضاءة أمامية ناعمة متساوية، لا ظل على الحائط، حبيبات فيلم 35 مم، لوحة ألوان باستيل باهتة. موضوع واحد فقط، لا أشخاص آخرون، لا نص، لا شعار.
2

الخطوة 3: توليد المرجع الصوتي، وهو الجزء متعدد الوسائط الفعلي

المقطع الصوتي هو ما يحول هذا من مهمة متعددة الصور إلى مهمة متعددة الوسائط. فتحة الصوت في Wan 2.7 تريد عينة قصيرة، تقريبًا من 1 إلى 10 ثوانٍ، لذا اجعل السطر قصيرًا. استخدم MiniMax Speech 2.6 HD واختر صوتًا ذكريًا منخفضًا ومسطحًا وغير منزعج.

Plain
1مساء الخير. تسجيل الوصول؟ بالطبع. الجميع يفعل.
2

الخطوة 4: استدعاء واحد، ثلاثة مراجع، مقطع واحد منتهٍ

الآن تدخل الحزمة بأكملها معًا على Wan 2.7 المرجع-إلى-فيديو. الإعدادات: resolution: 1080P، ratio: 16:9، duration: 10، وهو سقف هذا النموذج، prompt_extend: false، seed: -1. قم بتحميل images بالترتيب، الخطوة 1 أولاً، بحيث يتم تعيينها إلى character1، ثم الخطوة 2 كـ character2، وأرفق ملف الخطوة 3 بـ audio.

Plain
1لقطة واسعة متماثلة تمامًا في المنتصف لردهة فندق باستيل ومكتب استقبال، جدران وردية غبارية ورف مفاتيح أصفر خردلي خلفه. character1 هو موظف الاستقبال واقف خلف المكتب؛ character2 هي المسافرة واقفة أمامه، لا تزال تحمل قطتها الراغدول. تدفع الكاميرا ببطء إلى الداخل على طول محور مركزي مثالي ولا تميل أبدًا. character1 ينظر مباشرة إلى العدسة ويقول بلهجة مسطحة: "القطة لديها حجز. أنت ليس لديك." character2 تطرف مرة واحدة، تدير رأسها ببطء نحو القطة، ثم تعود إلى المكتب. القطة تحدق مباشرة في الكاميرا دون أن تتحرك. حبيبات فيلم 35 مم، إضاءة ناعمة متساوية، لوحة ألوان باستيل باهتة، لا اهتزاز كاميرا، لا قطع.
2

المطالبة السلبية:

Plain
1اهتزاز محمول، قطع مفاجئ، ترجمة، نص على الشاشة، علامة مائية، أشخاص إضافيون، أيدي مشوهة، تحول الوجه، تغير اللون، ضبابية الحركة
2

لقطة شاشة لواجهة مولد فيديو ذكاء اصطناعي مع إدخال وإخراج

ملعب Wan 2.7 المرجع-إلى-فيديو على Atlas Cloud مع صورتي مرجع وملف صوتي واحد محملين والمقطع النهائي في لوحة الإخراج

Wan 2.7 المرجع-إلى-فيديو على Atlas Cloud: صورتان مرجعيتان ومقطع صوتي واحد مرفقان على اليسار، واللقطة النهائية تعمل على اليمين بدقة 1080P و 16:9. هذا الالتقاط يعمل بالمدة الافتراضية للنموذج؛ اضبطها على 10 للحصول على النسخة الكاملة أدناه.

المقطع النهائي. كلا الوجهين تم تثبيتهما، وكلا الزيين تم تثبيتهما، وتم تسليم السطر بالصوت المستنسخ من الخطوة 3، لذا هذا المقطع يستحق التشغيل مع الصوت.

امرأة تحمل قطة عند مكتب استقبال فندق مع جرسون

الصورتان المرجعيتان بجانب إطار من المقطع النهائي، تظهران نفس الوجوه والأزياء

المراجع على اليسار، إطار من المقطع الذي تم تسليمه على اليمين. الزخرفة الموحدة، القبعة، النظارات والقطة كلها تنجو من الرحلة.

اختلافات في سير عمل المرجع متعدد الوسائط في Wan 3.0

ادفعها إلى 30 ثانية. نفس حزمة المرجع تعمل على Seedance 2.5 المرجع-إلى-فيديو مع duration: 30، مما يمنحك الطول الذي يعد به Wan 3.0 دون انتظار النسخة التجريبية. يقبل ما يصل إلى 30 صورة مرجعية و10 فيديوهات و10 مقاطع صوتية، لذلك الحزمة لديها مجال للنمو. اكتب الـ 20 ثانية الإضافية كإيقاعات في المطالبة، وليس كأجواء، وإلا سيقوم النموذج بالحشو.

واجهة مولد فيديو ذكاء اصطناعي تظهر إعدادات الإدخال وتقدم التوليد

ملعب Seedance 2.5 المرجع-إلى-فيديو على Atlas Cloud مع ضبط المدة على 30 واللقطة الطويلة م rendered

Seedance 2.5 المرجع-إلى-فيديو على Atlas Cloud مع ضبط المدة على 30 ونفس الصورتين المرجعيتين مرفقتين، تم التقاطهما في منتصف التوليد. لاحظ علامات @image1 و @image2 في المطالبة: هذه هي الطريقة التي تخبر بها Seedance أي مرجع يلعب أي دور. تحقق من السعر المعروض على زر التشغيل قبل الالتزام، حيث يعكس المدة التي سيرسلها المهمة بالفعل.

النسخة التي مدتها 30 ثانية من نفس المشهد، نفس حزمة المرجع، الإيقاعات مكتوبة لقطة بلقطة.

أضف فيديو مرجعيًا للحركة فقط. أرفق مقطعًا يعجبك إيقاعه واذكر ذلك صراحة في المطالبة، شيء مثل "اتبع الفيديو المرجعي لإيقاع القطع فقط، تجاهل موضوعاته وإطاره". هذه هي الحيلة وراء مثال قلب البطاقة أعلاه.

أصلح الانحراف بالمطالبة السلبية قبل لمس المطالبة الإيجابية. تحول الوجه، تغير اللون، والاهتزاز المحمول هي الثلاثة التي تدمر اللقطات المقفلة بالمرجع، وعادة ما يكون قمعها أرخص من وصفها بشكل زائد.

جرب تنسيق المرجع متعدد الوسائط مجانًا

إذا كنت تريد شكل هذا قبل أن تريد المعلمات، فقد أطلق Atlas Cloud أداة توليد إعلانات قصيرة بالذكاء الاصطناعي مجانية الأسبوع الماضي والتي تدير نفس السلسلة بدون أي مقابض.

تكتب سطرًا واحدًا عن منتجك ونقاط بيعه. تكتب سيناريو كوميدي لشخصيتين لك، افتتاحية، صراع، تحول، ثم تعرض فيديو مدته 15 ثانية مع حوار منطوق ومؤثرات صوتية مدمجة. يمكنك إرفاق ما يصل إلى أربع صور حقيقية للمنتج كمراجع، ويحافظ الإعلان على شكلها ولونها وملصقها وشعارها من النص إلى الإطار النهائي. ستة أنماط تأتي معها، من الميم المضحك عبر التحول والمسلسل الهزلي إلى الفخامة والبيع القوي، ويعود الحوار باللغة التي كتبت بها الوصف.

هذه هي نفس سلسلة الشخصيتين-بالإضافة-إلى-الصور-المرجعية-بالإضافة-إلى-الصوت من البرنامج التعليمي، مطروحًا منها كتابة المطالبة ومطروحًا منها الفاتورة. مما يجعلها طريقة مناسبة لمعرفة ما إذا كان هذا التنسيق يناسب منتجك قبل أن تنفق أي شيء على ضبطه.

للحصول على فكرة عما تفعله مجموعة من الصور الثابتة المرجعية بقطعة منتج، هذا هو إصدار Wan 3.0 الخاص بالمهمة: خمس صور داخلة، فيلم إطلاق واحد خارج، كل صورة ترسو إيقاعًا واحدًا من التحرير.

Animated floating stack of white and mint green cards

خمس صور ثابتة مرجعية موسعة إلى فيلم إطلاق منتج بأسلوب Material Design_خمس صور مرجعية تقود فيلم منتج مدته تسع ثوانٍ، كل واحدة ترسو إيقاعًا وتسلم إلى التالي. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba._

كم تكلفة مقطع المرجع متعدد الوسائط في Wan 3.0

الخطوةالنموذجسعر الوحدةالكميةالتكلفة
1 و2، صورتان مرجعيتانGPT Image 20.009 دولار لكل صورة20.02 دولار
3، المرجع الصوتيMiniMax Speech 2.6 HD0.08 دولار لكل 1000 حرف49 حرفًا0.00 دولار
4، اللقطة التي مدتها 10 ثوانٍ بدقة 1080PWan 2.7 المرجع-إلى-فيديو0.15 دولار لكل ثانية بدقة 1080P10 ثوانٍ1.50 دولار
إجمالي البرنامج التعليميحوالي 1.52 دولار
الاختلاف، 30 ثانيةSeedance 2.5 المرجع-إلى-فيديو0.134 دولار لكل ثانية بدقة 480P30 ثانيةحوالي 4.02 دولار
المسار المجانيأداة توليد الإعلانات القصيرة المجانية بالذكاء الاصطناعيمجانيمقطع واحد، 15 ثانية0 دولار

هذه هي أسعار المنصة نفسها، تم التحقق منها في أغسطس 2026 ويتم الفوترة حسب الاستخدام. هناك شيئان يحركان الإجمالي أكثر مما يتوقعه الناس. الدقة هي الأول: 0.10 دولار لكل ثانية في جدول المقارنة هو السعر الأساسي لـ Wan 2.7، وفاتورة 1080P بسعر 0.15 دولار، وهذا هو مصدر الـ 1.50 دولار أعلاه. الثاني هو أن Seedance يسعّر بعدد البكسلات، لذا فإن سعره المدرج 0.134 دولار لكل ثانية هو رقم 480P وتكلفة 720P أكثر مما يشير إليه الضرب المباشر. كمرجع، فإن معدل النسخة التجريبية المبلغ عنه لـ Wan 3.0 البالغ 0.20 دولار لكل ثانية بدقة 1080p سيضع لقطة كاملة مدتها 30 ثانية بحوالي 6 دولارات، وهو أكثر من مسار Seedance بدقة 480P اليوم.

ملاحظة حول استخدام هذا. Wan 3.0 هو إصدار تجريبي وشروطه يمكن أن تتغير، لذا أعد قراءتها قبل بناء خط أنابيب عليه. إذا كانت صورك المرجعية لأشخاص حقيقيين، احصل على إذنهم أولاً، لأن المرجع-إلى-فيديو هو بالضبط الإمكانية التي تجعل ذلك مهمًا. مقاطع المثال في هذه المقالة هي نتائج Alibaba المنشأة من دليلها العام للمنشئين، مستنسخة هنا للتعليق.

الأسئلة الشائعة

كم عدد المراجع التي يمكن أن يقبلها المرجع متعدد الوسائط في Wan 3.0 فعليًا؟

ما يصل إلى 20 أصلًا في استدعاء واحد، مأخوذة من الصور والفيديو والصوت والمستندات وصفحات الويب. الحد العملي أقل من الحد الفني. قم بتعيين كل أصل مهمة واحدة بالضبط، موضوع واحد لكل صورة، وستستخدم أقل بكثير من 20 لمعظم المشاهد.

هل يمكن لـ Wan 3.0 حقًا تحويل ملف PDF أو صفحة ويب إلى فيديو؟

نعم، هذا هو الجزء الفريد حقًا. إلى جانب النص والصورة والصوت والفيديو، فإنه يقبل ملفات المستندات وعناوين URL الحية، مع تقارير عن النسخة التجريبية تسرد .doc و.xls و.ppt و.pdf و.txt. لا يوجد نموذج مرجع-إلى-فيديو آخر في جدول المقارنة أعلاه يقبل مستندًا على الإطلاق.

هل Wan 3.0 مفتوح المصدر؟ هل يمكنني تشغيله في ComfyUI؟

لا، وليس الآن. Wan 3.0 هو إصدار تجريبي مغلق يعمل على سحابة Alibaba الخاصة. تم إصدار الأجيال السابقة من Wan علنًا، ولهذا السبب يوجد التوقع، لكن Alibaba لم تؤكد الأوزان لـ 3.0. الصفحات التي تدعي إصدار Apache 2.0 بحجم 1.3B أو 14B من Wan 3.0 غير مدعومة بأي شيء رسمي.

هل Wan 3.0 متاح من خلال واجهات برمجة تطبيقات الطرف الثالث حتى الآن؟

ليس بعد، بما في ذلك Atlas Cloud. أقرب شيء يمكنك استدعاؤه اليوم هو Wan 2.7 المرجع-إلى-فيديو، الذي يتطابق شكل إدخاله تقريبًا تمامًا مع المرجع الشامل بصرف النظر عن وسائط المستند وصفحة الويب، أو Seedance 2.5 المرجع-إلى-فيديو إذا كنت بحاجة إلى الـ 30 ثانية كاملة.

ما هي أرخص طريقة لاختبار فيديو بشخصيتين مقفل المرجع؟

أداة توليد الإعلانات القصيرة المجانية بالذكاء الاصطناعي المرتبطة أعلاه. أربع صور مرجعية داخلة، مقطع مدته 15 ثانية منطوق بشخصيتين خارج، بدون معلمات وبدون إنفاق. إذا كان يحمل منتجك وشكلك، فاذهب بعد ذلك لضبط السلسلة المدفوعة.

لماذا لا تزال شخصياتي تنحرف حتى مع الصور المرجعية؟

ثلاثة أسباب، حسب ترتيب التكرار. مرجع واحد يحمل مهمتين، لذا يُطلب منه تثبيت كل من الوجه والموقع. الصورة المرجعية تحتوي على أكثر من شخص أو خلفية مزدحمة، لذا لا يعرف النموذج أي جزء يقفل. أو أن الانحراف هو قطعة أثرية عرضية وليس فشلًا مرجعيًا، وفي هذه الحالة ضع تحول الوجه، تغير اللون في المطالبة السلبية قبل إعادة كتابة أي شيء.

أحدث النماذج

واجهة برمجية واحدة لكل وسائط الذكاء الاصطناعي.

استكشف جميع النماذج