لقد أنشأت مجلدًا لإعلان مدته 15 ثانية. صورتان ثابتتان لشخصيتين. فيديو بنبرة العلامة التجارية أرسله العميل. دليل العلامة التجارية لا يوجد إلا بصيغة PDF. عينة صوتية من الممثل الذي تريده بالفعل.
ثم فتحت نموذج الفيديو الخاص بك وطلب صورة واحدة فقط.
لذا فعلت ما يفعله الجميع. ترجمت المجلد إلى موجه من 800 كلمة وصليت. انزلق الوجه في المشهد الثالث. تغير لون السترة. كان الصوت لشخص آخر تمامًا.
المرجع الشامل لـ Wan 3.0 هو أول مرة يقول فيها نموذج فيديو: حسنًا، أعطني المجلد. ما يصل إلى 20 أصلًا في استدعاء واحد، عبر خمسة أنواع من المدخلات، متماسكة خلال لقطة واحدة متواصلة مدتها 30 ثانية.
هذه المقالة تفعل ثلاثة أشياء وتتخطى الباقي. تشرح ماهية هذه الأصول العشرين فعليًا، وتستخدم مقاطع Alibaba التي تم إنشاؤها كدليل، وتمنحك سير عمل مكافئًا يمكنك تشغيله اليوم، لأن Wan 3.0 لا يزال في النسخة التجريبية العامة على سحابة Alibaba الخاصة ولم يصبح قابلاً للاستدعاء من منصات الطرف الثالث بعد.
الوجبات الرئيسية
- المرجع متعدد الوسائط لـ Wan 3.0 يقبل ما يصل إلى 20 أصلًا في استدعاء واحد، تشمل الصور والفيديوهات والصوت والمستندات وصفحات الويب الحية، ويحافظ على تناسقها عبر لقطة واحدة مدتها 30 ثانية.
- هو أول نموذج فيديو رئيسي يعامل ملف PDF أو مجموعة شرائح أو رابط URL كمدخل إبداعي بدلاً من شيء تعيد صياغته في موجه.
- دخل Wan 3.0 النسخة التجريبية العامة في 6 أغسطس 2026 على Alibaba Cloud Model Studio و Qwen Cloud تحت اسم
wan3.0-video. أوزانه مغلقة. أي شخص يخبرك أنه أصبح بالفعل تحت ترخيص Apache 2.0 فهو يخمن. - العنوان الرئيسي لـ 20 أصلًا ليس هو المكان الذي يتفوق فيه حقًا. نماذج تحويل المرجع إلى فيديو التي يمكنك استدعاؤها الآن تقبل بالفعل أصولًا أكثر من 20. الفجوة هي المستندات وصفحات الويب، وليس عدد الأصول.
- يمكنك اختبار تنسيق الشخصيتين المقفل بالمرجع والصوت الكامل مجانًا باستخدام منشئ الإعلانات القصيرة المجاني بالذكاء الاصطناعي من Atlas Cloud: أربع صور منتج مدخلة، مقطع قصير مدته 15 ثانية مع حوار منطوق، بدون بطاقة.

قطتان تطاردان عبر خمس مجموعات مختلفة بواسطة Wan 3.0 دون انحراف الشخصية صورتان مرجعيتان. خمس مجموعات مختلفة تمامًا، من ممر فندق إلى أسطوانة غسالة إلى كشك هاتف أحمر. ولا إطار واحد من الانحراف. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba Wan 3.0 creator handbook ، أغسطس 2026، والذي يأتي منه أيضًا كل مقطع Wan 3.0 الآخر في هذه المقالة.
لماذا ينهار الفيديو متعدد المرجع، وماذا يغير المرجع متعدد الوسائط لـ Wan 3.0
نماذج الفيديو ليس لديها ذاكرة بين المقاطع. كل توليد يبدأ من الصفر. هذه هي المشكلة بأكملها في جملة واحدة.
لذا بمجرد أن تحتاج قصتك إلى أكثر من لقطة، فأنت تقوم بالتجميع. اللقطة الأولى تعطيك وجهًا تحبه. اللقطة الثانية تعطيك ابن عم لذلك الوجه. اللقطة الثالثة تغير السترة بهدوء من البرقوقي إلى العنابي، وبحلول الوقت الذي تلاحظ فيه، تكون قد دفعت بالفعل مقابل أحد عشر عرضًا.
المرجع أحادي الصورة ساعد، لكنه كان يقفل شيئًا واحدًا فقط. وجهًا. لم يستطع في نفس الوقت تثبيت وجه، وزي، ودعامة، وموقع، وصوت، لأنه كان هناك فتحة واحدة وخمس مهام.
هناك طريقتان للخروج. إعطاء النموذج المزيد من الفتحات، أو إيقاف جعله يبدأ من جديد. Wan 3.0 يفعل كليهما في وقت واحد، ولهذا السبب فإن الميزتين الرئيسيتين هما في الواقع ميزة واحدة. لقطة أصلية مدتها 30 ثانية تعني أنه لا يوجد قطع لتنحرف الشخصية عبره. عشرون أصلًا مرجعيًا يعني أن كل عنصر يجب أن يبقى ثابتًا يحصل على فتحته المخصصة بدلاً من القتال على فتحة واحدة.
إليك ما يبدو عليه ذلك عندما لا يكون هناك شيء مُجمّع. ثلاثون ثانية، كاميرا واحدة متصلة، طفل في عربة تسوق ينتهي به الأمر مضمنًا داخل لوحة إعلانية ثم يخرج من تحتها.
30 ثانية كاملة في تمريرة واحدة، بدون قطع، مع الموسيقى التصويرية المولّدة في نفس التمريرة. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba.
ما يعنيه "20 أصلًا" فعليًا داخل المرجع متعدد الوسائط لـ Wan 3.0
عشرون هو رقم عنوان رئيسي. المهم هو أن العشرين ليست كلها من نفس النوع. المرجع الشامل لـ Wan 3.0 يغطي خمسة أنواع من المدخلات، وكل واحد يتحكم في محور مختلف من المخرجات.
الصور تتحكم في الهوية. بطاقة شخصية، لقطة منتج، لوحة موقع. يسمي Wan 3.0 هذا الاتساق على مستوى البكسل، وفي أمثلة Alibaba الخاصة، يمتد القفل إلى ما بعد الوجه إلى خزانة الملابس: الرداء الرمادي الطبقات، والسترة الجلدية المربوطة، والغطاء القاتم حول الخصر، كلها تبقى خلال قتال بالأيدي مدته ستة عشر ثانية عبر ثلاثة مواقع.

بطاقتا شخصيتين تقودان مشهد قتال فيلم ووشيا مع تفاصيل الزي محفوظة إطارًا بإطار
بطاقتا شخصيتين بالإضافة إلى لوحة موقع واحدة لضفة القصب. الزي والمكان يثبتان خلال كل رمية. معروضة هنا كـ GIF صامتة؛ الملف المسلّم يحمل مزيجًا استريو 44.1 كيلوهرتز. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba.
الصوت يتحكم في الصوت. هذا هو الجزء الذي يجعل "متعدد الوسائط" أكثر من مجرد تسويق. تقوم بإرفاق عينة صوتية لكل شخصية، وتكتب الأسطر في الموجه، ويعود الحوار بهذا الجرس، متزامنًا مع الشفاه، في نفس تمريرة الصورة. شخصان، مرجعان صوتيان، صالة ألعاب رياضية واحدة.
صورتان للموضوع بالإضافة إلى مقطعين صوتيين مرجعيين منفصلين، ويعود الحوار بهذين الصوتين. يستحق تشغيل الصوت لهذا المقطع. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba.
الفيديو يتحكم في التوقيت. الفيديو المرجعي ليس موجودًا ليتم نسخه. إنه موجود للتبرع بإيقاعه: كم من الوقت تستمر النبضة، وكيف تتحرك الانتقالات. في هذا المقطع، خمسة إطارات رئيسية تزود بالموضوعات وفيديو مرجعي يزود بإيقاع التقليب الأفقي للبطاقة بينها.

خمسة إطارات رئيسية يتم تقليبها بإيقاع مأخوذ من فيديو مرجعي_خمسة_ صور إطارات رئيسية للموضوعات، فيديو مرجعي واحد لإيقاع التقليب. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba.
المستندات وصفحات الويب تتحكم في الهيكل. هذا هو الجديد حقًا. Wan 3.0 يقبل ملفات المستندات وعناوين URL الحية كمدخل إبداعي، والتقارير عن النسخة التجريبية تذكر .doc، .xls، .ppt، .pdf و .txt بين الصيغ المقبولة (AlphaSignal، أغسطس 2026). نفس المنطق يعمل بالفعل مع صورة القصة المصورة: لوحة واحدة مدخلة، ست لقطات مخرجة، بترتيب اللوحة نفسه.

لوحة قصة مصورة واحدة موسعة إلى ست لقطات متتالية على منصة قطار ممطرة
لوحة قصة مصورة واحدة كمرجع، ست لقطات مولّدة بترتيبها، وصولاً إلى تمرير الملاحظة بين الأيدي في اللقطة الخامسة. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba.
الإطارات الأولى والأخيرة تتحكم في نقاط النهاية. أقدم حيلة في الكتاب، لا تزال مدعومة، ولا تزال أسرع طريقة لتحديد حدود اللقطة.
إليك كيف يقارن ذلك بالنسخة التي يستخدمها معظم الأشخاص اليوم.
| Wan 2.7 تحويل المرجع إلى فيديو | Wan 3.0 المرجع الشامل | |
|---|---|---|
| الأصول المرجعية | صورة واحدة لكل موضوع، حتى 3 فيديوهات، مقطع صوتي واحد | حتى 20 أصلًا في المجموع |
| الوسائط | صورة، فيديو، صوت | صورة، فيديو، صوت، مستند، صفحة ويب |
| أقصى مدة، تمريرة واحدة | 10 ثوان | 30 ثانية أصلية، بالإضافة إلى مدة ذكية |
| الصوت في نفس التمريرة | نعم | نعم |
| تحرير الفيديو وتمديده | غير معروض | تحرير قائم على التعليمات والمرجع، بالإضافة إلى التمديد |
| التوفر | مباشر على واجهات برمجة تطبيقات الطرف الثالث | نسخة تجريبية من Alibaba Cloud Model Studio و Qwen Cloud |
هناك قاعدة واحدة لا يضعها أحد في المستندات ويتعلمها الجميع بالطريقة الصعبة: مرجع واحد، مهمة واحدة. الصورة1 تثبت الوجه والزي. الفيديو1 يتبرع بالحركة فقط. الصوت1 يتبرع بالجرس فقط. بمجرد أن تعطي أصلًا واحدًا مهمتين متعارضتين، أو تقوم بتحميل صورة مرجعية بشخصين فيها، يجب على النموذج أن يخمن، والتخمين هو بالضبط ما كنت تحاول إيقافه. دليل Alibaba صريح أيضًا بشأن هذا: موضوع واحد لكل صورة مرجعية.
سير عمل المرجع متعدد الوسائط لـ Wan 3.0 الذي يمكنك تشغيله اليوم
الإجابة المباشرة أولاً. Wan 3.0 في نسخة تجريبية عامة على سحابة Alibaba الخاصة، تحت معرف النموذج wan3.0-video (Alibaba Wan، أغسطس 2026). لم يصل إلى منصات واجهة برمجة تطبيقات الطرف الثالث بعد، بما في ذلك Atlas Cloud. أي شخص يبيع لك وصول واجهة برمجة تطبيقات Wan 3.0 الآن فهو يعيد بيع شيء آخر.
ما وصل هو شكل سير العمل. حزمة مرجعية مدخلة، استدعاء واحد، مقطع منتهي مع صوت خارج. يعمل هذا اليوم على نماذج تحويل المرجع إلى فيديو التي يمكنك استدعاؤها في علامة تبويب المتصفح، وبمجرد أن تصطف جميعها، يبدو العنوان الرئيسي لـ 20 أصلًا مختلفًا.
| النموذج | الأصول المرجعية | الوسائط | أقصى مدة | صوت أصلي | السعر لكل ثانية |
|---|---|---|---|---|---|
| Wan 3.0 (نسخة تجريبية من Alibaba، غير متوفرة على Atlas) | 20 إجمالاً | صورة، فيديو، صوت، مستند، صفحة ويب | 30 ثانية | نعم | تم الإبلاغ عن 0.05 إلى 0.20 دولار حسب الدقة |
| Wan 2.7 تحويل المرجع إلى فيديو | صورة واحدة لكل موضوع، 3 فيديوهات، مقطع صوتي واحد | صورة، فيديو، صوت | 10 ثوان | نعم | 0.10 دولار |
| Seedance 2.5 تحويل المرجع إلى فيديو | 50 (30 صورة / 10 فيديو / 10 صوت) | صورة، فيديو، صوت | 30 ثانية | نعم | 0.13 دولار |
| MiniMax H3 تحويل المرجع إلى فيديو | مختلط، لا يوجد حد معلن | صورة، فيديو، صوت | 15 ثانية | نعم | 0.10 دولار |
| Kling Video O3 Pro تحويل المرجع إلى فيديو | 7 صور، أو 4 صور + 1 فيديو | صورة، فيديو | 15 ثانية | نعم | 0.10 دولار |
| Vidu Q3-Mix تحويل المرجع إلى فيديو | 4 صور | صورة | 16 ثانية | نعم | 0.11 دولار |
| Veo 3.1 تحويل المرجع إلى فيديو | 3 صور | صورة | 8 ثوان | اختياري | 0.20 دولار |
الأسعار هي أسعار Atlas Cloud اعتبارًا من أغسطس 2026. أرقام Wan 3.0 هي تلك التي تم الإبلاغ عنها للإصدار التجريبي من Alibaba Cloud، وليس سعر Atlas، ولم تنشر Alibaba صفحة أسعار عامة للنموذج بعد، لذا تعامل مع هذا الصف كصف مؤقت.
اقرأ هذا الجدول مرتين وستظهر القصة الحقيقية. العنوان الرئيسي لـ 20 أصلًا ليس حيث يتفوق Wan 3.0، لأن Seedance 2.5 يأخذ بالفعل 50 ويطابق 30 ثانية. ما لا يأخذه أي شيء آخر في تلك القائمة هو ملف PDF.
للاطلاع على الشرح أدناه، يعرض العرض التوضيحي على Wan 2.7 تحويل المرجع إلى فيديو، لأن شكل مدخلاته هو أقرب قريب حي للمرجع الشامل: صور موضوعات متعددة، فيديو مرجعي اختياري، ومقطع صوتي، كلها مرتبطة بتسميات character1 و character2 داخل الموجه. ثلاثة نماذج، علامة تبويب متصفح واحدة، لا تثبيت محلي.
قم ببنائه بنفسك: مشهد مرجع متعدد الوسائط في أربع خطوات
المشهد: مكتب استقبال فندق بألوان الباستيل. موظف استقبال بوجه جامد. مسافر يحمل قطة راجدول. موظف الاستقبال ينظر مباشرة إلى العدسة ويقول "القطة لديها حجز. أنت لا."
صورتان بالإضافة إلى مقطع صوتي واحد، أي ثلاثة أصول مرجعية عبر وسيطين. هذا هو أصغر بناء يكون صادقًا متعدد الوسائط بدلاً من مجرد متعدد الصور.
الخطوة 1. توليد الصورة المرجعية 1، الموضوع الذي يجب تثبيته
الصور المرجعية لديها ثلاث مهام فقط: موضوع واحد، مواجه للكاميرا، خلفية نظيفة. كل شيء آخر هو زينة. استخدم GPT Image 2 بجودة high، حجم 16:9، n=1.
Plain1صورة استوديو كاملة الطول لموظف استقبال فندق في منتصف العمر بتعبير وجه جامد، واقف في المنتصف تمامًا مقابل جدار وردي باهت مسطح. يرتدي زي جرسون أرجواني برقوقي مزدوج الصدر مع زخارف ذهبية وأزرار نحاسية، وقبعة صغيرة مستديرة، وشارب رفيع. تأطير متماثل تمامًا، إضاءة أمامية ناعمة متساوية، لا ظل على الحائط، حبيبات فيلم 35 ملم، لوحة ألوان باستيلية صامتة. موضوع واحد فقط، لا أشخاص آخرين، لا نص، لا شعار، لا دعامات في الإطار.

ملعب GPT Image 2 على Atlas Cloud مع صورة مرجعية لموظف الاستقبال معروضة في لوحة الإخراج
GPT Image 2 على Atlas Cloud: جودة عالية، 16:9، موضوع واحد، خلفية مسطحة. هذا هو الملف الذي يصبح character1.
الخطوة 2. توليد الصورة المرجعية 2، الموضوع الثاني المثبت
نفس النموذج، نفس الإعدادات. تباين الألوان بين الشخصيتين متعمد، لأنه يعطي النموذج طريقة سهلة لإبقائهما منفصلين عندما يتشاركان الإطار.
Plain1صورة استوديو كاملة الطول لمسافرة شابة تحمل قطة راجدول منفوشة على صدرها، واقفة في المنتصف تمامًا مقابل جدار أصفر خردلي مسطح. ترتدي معطفًا صوفيًا بلون الخردل، وقبعة حمراء، ونظارات دائرية باطار من الصدف، وتحمل حقيبة سفر جلدية صغيرة عتيقة في يدها الحرة. تأطير متماثل تمامًا، إضاءة أمامية ناعمة متساوية، لا ظل على الحائط، حبيبات فيلم 35 ملم، لوحة ألوان باستيلية صامتة. موضوع واحد فقط، لا أشخاص آخرين، لا نص، لا شعار.
الخطوة 3. توليد المرجع الصوتي، وهو الجزء متعدد الوسائط الفعلي
المقطع الصوتي هو ما يحول هذا من وظيفة متعددة الصور إلى وظيفة متعددة الوسائط. فتحة الصوت في Wan 2.7 تريد عينة قصيرة، حوالي 1 إلى 10 ثوانٍ، لذا اجعل السطر قصيرًا. استخدم MiniMax Speech 2.6 HD واختر صوتًا ذكوريًا منخفضًا، مسطحًا، غير منزعج.
Plain1مساء الخير. تسجيل الوصول؟ بالطبع. الجميع يفعل.
الخطوة 4. استدعاء واحد، ثلاثة مراجع، مقطع واحد منتهي
الآن تذهب الحزمة بأكملها معًا على Wan 2.7 تحويل المرجع إلى فيديو. الإعدادات: resolution: 1080P، ratio: 16:9، duration: 10، وهو سقف هذا النموذج، prompt_extend: false، seed: -1. قم بتحميل images بالترتيب، الخطوة 1 أولاً، بحيث يتم تعيينها إلى character1، ثم الخطوة 2 كـ character2، وأرفق ملف الخطوة 3 بـ audio.
Plain1لقطة واسعة متماثلة، في المنتصف تمامًا لاستقبال فندق بألوان الباستيل، جدران وردية باهتة ورف مفاتيح أصفر خردلي خلفه. character1 هو موظف الاستقبال واقف خلف المكتب؛ character2 هي المسافرة واقفة أمامه، لا تزال تحمل قطتها الراجدول. الكاميرا تتحرك للأمام ببطء على طول محور مركزي مثالي ولا تميل أبدًا. character1 ينظر مباشرة إلى العدسة ويقول بشكل مسطح: "القطة لديها حجز. أنت لا." character2 ترمش مرة واحدة، تدير رأسها ببطء نحو القطة، ثم تعود إلى المكتب. القطة تحدق مباشرة في الكاميرا دون أن تتحرك. حبيبات فيلم 35 ملم، إضاءة ناعمة متساوية، لوحة ألوان باستيلية صامتة، لا اهتزاز للكاميرا، لا قطع.
الموجه السلبي:
Plain1اهتزاز محمول، قطع مفاجئ، ترجمات، نص على الشاشة، علامة مائية، أشخاص إضافيون، أيدي مشوهة، تحول الوجه، تحول اللون، ضبابية الحركة

ملعب Wan 2.7 تحويل المرجع إلى فيديو على Atlas Cloud مع صورتين مرجعيتين وملف صوتي واحد محمل والمقطع المنتهي في لوحة الإخراج
Wan 2.7 تحويل المرجع إلى فيديو على Atlas Cloud: صورتان مرجعيتان ومقطع صوتي واحد مرفق على اليسار، اللقطة المنتهية تعمل على اليمين بدقة 1080P و 16:9. هذا الالتقاط تم تشغيله بالمدة الافتراضية للنموذج؛ اضبطها على 10 للنسخة الكاملة أدناه.
المقطع المنتهي. كلا الوجهين ثابتين، كلا الزيين ثابتين، وتم تسليم السطر بالصوت المستنسخ من الخطوة 3، لذا هذا المقطع يستحق التشغيل مع الصوت.

الصورتان المرجعيتان للصورتين الشخصيتين بجانب إطار من المقطع المنتهي، تظهران نفس الوجوه والملابس
المراجع على اليسار، إطار من المقطع المسلّم على اليمين. الزخارف على الزي، القبعة، النظارات والقطة كلها تبقى خلال الرحلة.
أشكال مختلفة لسير عمل المرجع متعدد الوسائط لـ Wan 3.0
ادفعها إلى 30 ثانية. نفس حزمة المرجع تعمل على Seedance 2.5 تحويل المرجع إلى فيديو مع duration: 30، مما يمنحك الطول الذي يعد به Wan 3.0 دون انتظار النسخة التجريبية. يأخذ ما يصل إلى 30 صورة مرجعية، و10 فيديوهات و10 مقاطع صوتية، لذا فإن الحزمة لديها مساحة للنمو. اكتب الـ 20 ثانية الإضافية كنبضات في الموجه، وليس كأجواء، وإلا سيقوم النموذج بالحشو.

ملعب Seedance 2.5 تحويل المرجع إلى فيديو على Atlas Cloud مع ضبط المدة على 30 واللقطة الطويلة معروضة
Seedance 2.5 تحويل المرجع إلى فيديو على Atlas Cloud مع ضبط المدة على 30 ونفس الصورتين المرجعيتين مرفقتين، تم التقاطها في منتصف التوليد. لاحظ @image1 و @image2 في الموجه: هذه هي الطريقة التي تخبر بها Seedance أي مرجع يلعب أي دور. تحقق من السعر المقتبس على زر التشغيل قبل الالتزام، لأنه يعكس المدة التي سيرسلها الوظيفة فعليًا.
النسخة التي مدتها 30 ثانية من نفس المشهد، نفس حزمة المرجع، النبضات مكتوبة لقطة بلقطة.
أضف فيديو مرجعي للحركة فقط. أرفق مقطعًا يعجبك إيقاعه واذكر ذلك صراحة في الموجه، شيء مثل "اتبع الفيديو المرجعي لإيقاع القطع فقط، تجاهل موضوعاته ومكانه". تلك هي الحيلة وراء مثال تقليب البطاقة أعلاه.
أصلح الانحراف باستخدام الموجه السلبي قبل لمس الموجب. تحول الوجه وتحول اللون والاهتزاز المحمول هي الثلاثة التي تفسد اللقطات المقفلة بالمرجع، وعادة ما يكون قمعها أرخص من وصفها.
جرب تنسيق المرجع متعدد الوسائط مجانًا
إذا كنت تريد شكل هذا قبل أن تريد المعلمات، فقد أطلقت Atlas Cloud منشئ إعلانات قصيرة مجاني بالذكاء الاصطناعي الأسبوع الماضي والذي يدير نفس السلسلة بدون أي مقابض.
تكتب سطرًا واحدًا عن منتجك ونقاط بيعه. يكتب سيناريو كوميدي لشخصيتين لك، خطاف، صراع، تطور، ثم يعرض فيديو مدته 15 ثانية مع حوار منطوق ومؤثرات صوتية مدمجة. يمكنك إرفاق ما يصل إلى أربع صور منتج حقيقية كمراجع، ويحافظ الإعلان على شكلها ولونها وملصقها وشعارها من السيناريو إلى الإطار النهائي. ستة أنماط تأتي معه، من الميم المضحك عبر تطور الحبكة والمسلسل الكوميدي إلى الفاخر والبيع القوي، ويعود الحوار باللغة التي كتبت بها الوصف.
هذه هي نفس سلسلة الشخصيتين بالإضافة إلى الصور المرجعية بالإضافة إلى الصوت من البرنامج التعليمي، ناقص كتابة الموجه وناقص الفاتورة. مما يجعلها طريقة جيدة لمعرفة ما إذا كان هذا التنسيق يناسب منتجك قبل أن تنفق أي شيء في ضبطه.
للحصول على فكرة عما تفعله مجموعة من الصور الثابتة المرجعية بمقطع منتج، هذه هي نسخة Wan 3.0 الخاصة من المهمة: خمس صور مدخلة، شريط إطلاق واحد خارج، كل صورة ثابتة ترسخ نبضة واحدة من التحرير.

خمس صور ثابتة مرجعية موسعة إلى شريط إطلاق منتج بأسلوب Material Design_خمس صور مرجعية تقود فيلم منتج مدته تسع ثوان، كل واحدة ترسخ نبضة وتسلم إلى التالية. المصدر: دليل منشئ Wan 3.0 الرسمي من Alibaba._
كم تكلفة مقطع المرجع متعدد الوسائط لـ Wan 3.0
| الخطوة | النموذج | السعر لكل وحدة | الكمية | التكلفة |
|---|---|---|---|---|
| 1 و 2، صورتان مرجعيتان | GPT Image 2 | 0.009 دولار لكل صورة | 2 | 0.02 دولار |
| 3، مرجع صوتي | MiniMax Speech 2.6 HD | 0.08 دولار لكل 1000 حرف | 49 حرفًا | 0.00 دولار |
| 4، لقطة 10 ثوانٍ بدقة 1080P | Wan 2.7 تحويل المرجع إلى فيديو | 0.15 دولار لكل ثانية بدقة 1080P | 10 ثوان | 1.50 دولار |
| إجمالي البرنامج التعليمي | حوالي 1.52 دولار | |||
| البديل، 30 ثانية | Seedance 2.5 تحويل المرجع إلى فيديو | 0.134 دولار لكل ثانية بدقة 480P | 30 ثانية | حوالي 4.02 دولار |
| المسار المجاني | منشئ الإعلانات القصيرة المجاني بالذكاء الاصطناعي | مجاني | مقطع واحد، 15 ثانية | 0 دولار |
هذه هي أسعار المنصة نفسها، تم التحقق منها في أغسطس 2026 ويتم الفوترة حسب الاستخدام. شيئان يحركان الإجمالي أكثر مما يتوقع الناس. الدقة هي الأول: 0.10 دولار لكل ثانية في جدول المقارنة هو السعر الأساسي لـ Wan 2.7، ودقة 1080P تبلغ 0.15 دولار، وهو من أين يأتي 1.50 دولار أعلاه. الثاني هو أن Seedance تسعّر حسب عدد البكسل، لذا فإن 0.134 دولار لكل ثانية المدرجة هي رقم 480P وتكلفة لقطة 720P أكثر من مضاعفة بسيطة. كمرجع، سعر النسخة التجريبية لـ Wan 3.0 المبلغ عنه 0.20 دولار لكل ثانية بدقة 1080p سيضع لقطة كاملة مدتها 30 ثانية بحوالي 6 دولارات، وهو أكثر من مسار Seedance بدقة 480P اليوم.
ملاحظة حول استخدام هذا. Wan 3.0 هو إصدار تجريبي وشروطه يمكن أن تتغير، لذا أعد قراءتها قبل بناء خط أنابيب عليه. إذا كانت صورك المرجعية لأشخاص حقيقيين، احصل على إذنهم أولاً، لأن تحويل المرجع إلى فيديو هو بالتحديد القدرة التي تجعل ذلك مهمًا. مقاطع المثال في هذه المقالة هي نتائج Alibaba الخاصة المولدة من دليل منشئها العام، معاد إنتاجها هنا للتعليق.
الأسئلة الشائعة
كم عدد المراجع التي يمكن أن يأخذها المرجع متعدد الوسائط لـ Wan 3.0 فعليًا؟
ما يصل إلى 20 أصلًا في استدعاء واحد، مأخوذة من الصور والفيديوهات والصوت والمستندات وصفحات الويب. الحد العملي أقل من النظري. قم بتعيين كل أصل مهمة واحدة بالضبط، موضوع واحد لكل صورة، وستستخدم أقل بكثير من 20 لمعظم المشاهد.
هل يمكن لـ Wan 3.0 حقًا تحويل ملف PDF أو صفحة ويب إلى فيديو؟
نعم، هذا هو الجزء الفريد حقًا. إلى جانب النص والصورة والصوت والفيديو، فإنه يقبل ملفات المستندات وعناوين URL الحية، مع تقارير عن النسخة التجريبية تذكر .doc، .xls، .ppt، .pdf و .txt. لا يوجد نموذج تحويل مرجع إلى فيديو آخر في جدول المقارنة أعلاه يأخذ مستندًا على الإطلاق.
هل Wan 3.0 مفتوح المصدر؟ هل يمكنني تشغيله في ComfyUI؟
لا، وليس الآن. Wan 3.0 هو إصدار تجريبي مغلق يعمل على سحابة Alibaba الخاصة. تم إصدار الأجيال السابقة من Wan بشكل مفتوح، ولهذا السبب يوجد التوقع، لكن Alibaba لم تؤكد أوزان 3.0. الصفحات التي تدعي إصدار Apache 2.0 بحجم 1.3B أو 14B من Wan 3.0 غير مدعومة بأي شيء رسمي.
هل Wan 3.0 متاح من خلال واجهات برمجة تطبيقات الطرف الثالث بعد؟
ليس بعد، بما في ذلك Atlas Cloud. أقرب شيء يمكنك استدعاؤه اليوم هو Wan 2.7 تحويل المرجع إلى فيديو، الذي يتطابق شكل مدخلاته مع المرجع الشامل تقريبًا باستثناء وسائط المستندات وصفحات الويب، أو Seedance 2.5 تحويل المرجع إلى فيديو إذا كنت بحاجة إلى 30 ثانية كاملة.
ما هي أرخص طريقة لاختبار فيديو بشخصيتين مقفل بالمرجع؟
منشئ الإعلانات القصيرة المجاني بالذكاء الاصطناعي المرتبط أعلاه. أربع صور مرجعية مدخلة، مقطع قصير مدته 15 ثانية بشخصيتين وحوار منطوق خارج، بدون معلمات وبدون إنفاق. إذا كان يثبت منتجك وتنسيقك، فاذهب لضبط السلسلة المدفوعة.
لماذا لا تزال شخصياتي تنحرف حتى مع الصور المرجعية؟
ثلاثة أسباب، حسب الترتيب من حيث التكرار. مرجع واحد يحمل مهمتين، لذا فهو مطالب بتثبيت كل من الوجه والموقع. الصورة المرجعية تحتوي على أكثر من شخص أو خلفية مزدحمة، لذا لا يعرف النموذج أي جزء يثبت. أو الانحراف هو قطعة أثرية للعرض وليس فشلًا مرجعيًا، وفي هذه الحالة ضع تحول الوجه، تحول اللون في الموجه السلبي قبل إعادة كتابة أي شيء.






