اتساق اللقطات المتعددة في Wan 3.0: أحصيت كل قطعة في 110 مقطعًا رسميًا
لقد كتبت سيناريو من أربع لقطات. اللقطة الأولى تظهر بشكل مثالي: قبعة من القش، عقد من الخرز الأسود، فستان كتّان أبيض، إضاءة صحيحة تمامًا. تصل اللقطة الثانية، وهي امرأة مختلفة في قبعة مختلفة.
هذه الفجوة هي السبب الكامل وراء تركيز الجميع على اتساق اللقطات المتعددة في Wan 3.0، وهو الوعد بإنشاء ست لقطات، وثلاثين ثانية، ونفس الشخصية طوال الوقت، من موجه واحد.
لذا توقفت عن قراءة أوراق المواصفات. قمت بتنزيل جميع الملفات التجريبية البالغ عددها 110 التي نشرتها Alibaba مع دليلها الرسمي لـ Wan 3.0، وشغلت ffmpeg على كل منها، وحللت جميع الموجهات الـ 64 المزدوجة، ثم فعلت ما لم يفعله أحد في نتائج البحث: أحصيت القطع الفعلية في مقاطع الفيديو الناتجة وقارنتها بعدد اللقطات الذي طلبه كل موجه.
ثلاث نتائج تتعارض مع ما ستقرأه في كل مكان آخر.

جناح تصحيح ألوان سينمائي حيث يعرض جدار من الشاشات نفس الشخصية ذات قبعة القش عبر ست لقطات مختلفة، النقطة المرجعية لاتساق اللقطات المتعددة في Wan 3.0
جدار مرجعي لمصحح الألوان هو النموذج الذهني الصادق لاتساق اللقطات المتعددة: هوية واحدة، ستة تأطيرات، يتم فحصها جنبًا إلى جنب. تم إنشاؤه باستخدام openai/gpt-image-2.
النتائج الرئيسية
- 6 لقطات حقيقية ولكنها غير مضمونة: 3 من موجهات اللقطات المتعددة الرسمية لـ Alibaba حققت العدد المعلن بالضبط، بينما قصرت 2 منها.
- أسوأ حالة طلبت 4 لقطات وأنتجت 2.
- لا توجد دقة 4K. لا يوجد أي من الملفات الرسمية البالغ عددها 110 يتجاوز 1080p، و 4 ملفات فقط هي بالضبط 1920x1080.
- الدعائم والكاميرا تنجرفان قبل الوجوه. راقب القبعة، لا العيون.
- لا يوجد API عام لـ Wan 3.0 خارج منصة Alibaba الخاصة حتى الآن، لذا فإن البرنامج التعليمي أدناه يعيد بنائه على نماذج يمكنك الاتصال بها اليوم.
إليك أفضل نتيجة، من دليل Alibaba الرسمي. ست لقطات معلنة في الموجه، ست لقطات تم تسليمها، نفس الشخصيتين، نفس الملابس، نفس المطر:

تسلسل أنمي من ست لقطات على منصة قطار ممطرة، نفس الفتاة بمظلة شفافة والفتى بحقيبة ظهر خاكية تم الحفاظ عليهما باستمرار عبر كل قطعة
عرض تجريبي رسمي لـ Wan 3.0 من Alibaba (مقطع من الدليل v013، 1280x720، 20.05 ثانية). قام الموجه بترقيم اللقطات من 1 إلى 6؛ يجد ffmpeg 5 قطعًا صعبة بالضبط، لذا تم تسليم جميع اللقطات الست. لم يتم إنشاؤه بواسطة Atlas Cloud.
ما هو اتساق اللقطات المتعددة في Wan 3.0 فعليًا؟
النسخة المختصرة: إنها ثلاثة وعود منفصلة تحت اسم واحد، و Alibaba محددة بشكل غير معتاد بشأن أي ثلاثة.
في مقالها الإطلاقي، تقسم Alibaba الاتساق إلى الشخصيات ("ملامح الوجه، تسريحة الشعر ولونه، شكل الجسم، الملابس، والإكسسوارات")، والدعائم ("ظهور متعدد الزوايا، الهيكل المادي، الشعارات، وتفاصيل المادة")، والفضاء ("تحديد موقع الشخصية وزاوية الكاميرا") (Alibaba Cloud، 2026). هذا التقسيم ثلاثي الطبقات هو معيار التقييم لكل ما يلي. نفس الوجه، قلادة خاطئة، يعتبر فشلاً.
يقوم النموذج بإنشاء ما يصل إلى 30 ثانية في مهمة واحدة، بدقة 480P أو 720P أو 1080P (Alibaba Cloud، 2026).
الآن الجزء الذي تخطئ فيه نتائج البحث.
| الادعاء الشائع في نتائج البحث | ما تظهره المواد الرسمية فعليًا |
|---|---|
| "توليد 4K أصلي" | المنشور الرسمي يذكر 480P / 720P / 1080P فقط. عبر 110 ملفًا تجريبيًا رسميًا، لا شيء يتجاوز 1080p، و 4 ملفات فقط هي بالضبط 1920x1080. الإخراج الأفقي المعتاد "1080p" هو 1920x1072. |
| "ما يصل إلى 6 لقطات مستقلة لكل توليد" | لا يوجد مواصفات لعدد اللقطات في منشور Alibaba الإطلاقي. تجريبيًا، يصمد الأمر: من بين 8 موجهات متعددة اللقطات بشكل صريح في الدليل، أعلى ما تم الإعلان عنه هو 6، وقد سلم اثنان منها 6 لقطات. |
| "ما يصل إلى 12 صورة مرجعية" | تقارير الاختبارات العملية تصل إلى 10 صور بالإضافة إلى 5 مقاطع فيديو بالإضافة إلى 5 مقاطع صوتية (Curious Refuge، 2026). منشور Alibaba لا يعطي أي رقم على الإطلاق. |
| "أوزان مفتوحة، رخصة Apache-2.0" | الإصدارات السابقة من Wan كانت ذات أوزان مفتوحة؛ Wan 3.0 يصدر كخدمة منصة ولم تظهر أي أوزان (Curious Refuge، 2026). |
| "الـ API متاح" | يعمل على Alibaba Cloud Model Studio. منصات الاستدلال التابعة لجهات خارجية لا تملكه بعد. |
وهذا هو الجدول الذي استغرق بناؤه أطول وقت. كل رقم هو من عملي، من اكتشاف المشهد عبر ffmpeg على الملف المسلَّم مقارنة بعدد اللقطات المكتوب في الموجه المزدوج:
| العرض التجريبي الرسمي | الموجه يعلن | القطع الصعبة التي تم العثور عليها | اللقطات المسلَّمة | الحكم |
|---|---|---|---|---|
| v013 منصة قطار ممطرة، أنمي | 6 لقطات | 5 | 6 | دقيق |
| v055 يوميات جولدن ريتريفر | 6 لقطات، 30.0 ثانية | 5 | 6 | دقيق |
| v021 متجر رامن وقطة صغيرة | 4 لقطات | 3 | 4 | دقيق |
| v008 بحيرة غابة، ثلاثي الأبعاد | 4 لقطات | 2 | 3 | أقل بواحدة |
| v085 امرأة بقبعة القش | 4 لقطات | 1 | 2 | النصف |
| v041 ممر إلى الزقاق السحري | 3 مقاطع، "لا قطع صعب" | 0 | لقطة واحدة مستمرة | كما طلب تمامًا |
| v045، v084، v102 | 3 / 5 / موضوعات متعددة | كثيرة جدًا لحلها | غير قابل للعد | القطع السريع والوميض بالحبر يمنعان الكشف |
اقرأ الصفوف الوسطى مرة أخرى. ثلاثة موجهات حققت عددها بالضبط. اثنان لم يفعلا. عدد اللقطات الذي تكتبه هو طلب، وليس عقدًا.
لماذا ينكسر اتساق اللقطات المتعددة في Wan 3.0: 4 أنماط فشل
الحكم أولاً: نادرًا ما ينكسر على الوجه. ينكسر على الأشياء والكاميرا، وينكسر بشدة عندما تغير عدة أشياء في وقت واحد.
إليك المقطع الذي علمني أكثر، لأنه أسوأ أداء في عرض Alibaba الخاص.
GtZy2TUK4ak
عرض تجريبي رسمي لـ Wan 3.0 من Alibaba (مقطع من الدليل v085، 1240x742، 30.08 ثانية). يقوم الموجه بكتابة أربع لقطات موقوتة. يجد ffmpeg قطعة واحدة حقيقية، عند 9.3 ثانية. تنهار اللقطتان 3 و 4 إلى لقطة واحدة مستمرة تتلاشى إلى الأسود. لم يتم إنشاؤه بواسطة Atlas Cloud.
نمط الفشل 1: الدعائم تنجرف قبل الوجوه. في هذا المقطع، انظر إلى اللقطة الافتتاحية وحدها، قبل حدوث أي قطعة. عند 0.6 ثانية، قبعة البو aver لها شريط أسود رقيق والقلادة حجر بحري زاوي. عند 9.2 ثانية، الشريط هو شريط عريض أسود والقلادة هي قطرة سوداء لامعة ناعمة. وجهها ثابت طوال الوقت. الإكسسوارات ليست كذلك.

إطاران من نفس اللقطة المستمرة التي تبلغ تسع ثوانٍ، جنبًا إلى جنب، يظهران اتساع شريط القبعة وتغير شكل ولون قلادة العنق
كلا الإطارين من نفس اللقطة غير المتقطعة للعرض التجريبي الرسمي v085، بفاصل 8.6 ثوانٍ، ولا يوجد قطعة بينهما. يتغير كل من شريط القبعة والقلادة. هذه هي طبقة الدعائم التي تفشل بينما تظل طبقة الشخصية ثابتة.
لهذا السبب فإن اختبار القبول الذي يعمل فعليًا هو قائمة مراجعة للدعائم، وليس فحصًا للشعور العام. بالنسبة لهذه الشخصية، هناك ثلاثة عناصر: شكل القبعة وشريطها، عقد الخرز والقلادة، خط رقبة الفستان.
نمط الفشل 2: المشاهد متعددة الموضوعات تصمد بشكل فردي وتتلاشى عند التلامس. تظل كل شخصية يمكن التعرف عليها بمفردها. ضعها في الإطار معًا، تتفاعل، وتتداخل الهويات. وجدت الاختبارات المستقلة نفس الشيء: "بدأ اتساق الشخصية في الانهيار، وبدا التركيب أحيانًا وكأنه تأثير شاشة خضراء سيء أكثر من كونه بيئة مولدة بشكل طبيعي"، مع تزامن الشفاه الذي تم تسليط الضوء عليه باعتباره أكبر نقطة ضعف (Curious Refuge، 2026).
نمط الفشل 3: لقد غيرت أربعة متغيرات في سطر واحد. موقع جديد زائد زاوية كاميرا جديدة زائد إضاءة جديدة زائد حالة ملابس جديدة هي الطريقة الموثوقة لفقدان هوية. يواجه موجهات الدليل الخاصة هذا من خلال إعادة ذكر الزي الكامل في كل مقطع. عبر الموجهات الـ 64 المزدوجة، 9 تقول صراحة "يبقى دون تغيير"، و 5 تثبت موضع الكاميرا، و 4 تطلب بقاء الشخصية متطابقة.
نمط الفشل 4: 30 ثانية في مهمة واحدة ليست 30 ثانية من لقطة واحدة. هذه منتجات مختلفة. مهمة متعددة اللقطات مدتها 30 ثانية تقطع بين التأطيرات. إذا كنت تريد لقطة واحدة مستمرة غير متقطعة، فإن تسلسل الاستمرارات يتحلل: الخطأ في الهوية يتراكم عند كل تسليم، لذا فإن اللقطة الواحدة النظيفة قصيرة بطبيعتها.
يحتوي الدليل على موجه واحد فقط يحصل على السلاسة بشكل صحيح، ومن الجدير نسخ بنية الجملة:

ثلاثة مقاطع موجهة تم تقديمها كلقطة واحدة مستمرة غير متقطعة، من ممر شقة عبر باب إلى زقاق قوطي مضاء بمصباح
عرض تجريبي رسمي لـ Wan 3.0 من Alibaba (مقطع من الدليل v041، 720x1280، 15.04 ثانية). ثلاثة مقاطع موجهة، ويجد ffmpeg صفر قطع صعبة، وهو بالضبط ما طلبه الموجه. لم يتم إنشاؤه بواسطة Atlas Cloud.
سطر التسليم الخاص به، مترجمًا، هو أكثر شيء قابل لإعادة الاستخدام في الدليل بأكمله: استمر بسلاسة من الإطار الأخير للمقطع السابق؛ تظل الشخصية، والملابس، والموقع، وموضع الكاميرا متطابقة تمامًا؛ لا قطع صعب ولا انتقال مفاجئ للمشهد. فقط موجه واحد من 64 يستخدمه. اسرقه.
سير عمل اتساق اللقطات المتعددة الذي يمكنك تشغيله اليوم
السؤال هو: أين يمكنك تشغيل هذا فعليًا الآن؟
حاليًا، يعيش Wan 3.0 على منصة Model Studio الخاصة بـ Alibaba. لا توجد منصة استدلال تابعة لجهة خارجية تستضيفه. في Atlas Cloud يظهر فقط كإدخال قادم قريبًا بدون نقاط نهاية حية، وهي الحالة الصادقة للوضع وتستحق الذكر بوضوح بدلاً من التظاهر بغير ذلك.
لذا لديك خياران: انتظر، أو توقف عن مطالبة موجه واحد بفعل ستة أشياء.
الخيار الثاني أفضل على أي حال، وعدّي للقطات هو الحجة لصالحه. مهمة واحدة متعددة اللقطات أعطتك عدد لقطات أخطأ بمقدار النصف في عرض Alibaba الخاص. تقسيم المهمة يعيد تلك السيطرة إلى يديك:
- ثبّت المظهر مرة واحدة، كصورة ثابتة.
- انسخ تلك الهوية إلى إطار مفتاحي لكل لقطة، مع تغيير متغير واحد فقط في كل مرة.
- حرك كل لقطة على حدة مع الإطار المرجعي المثبت.
- اربط محليًا.
أبطأ في الإعداد، لكنه أكثر قابلية للتنبؤ بشكل كبير. وكل نموذج في السلسلة يمكن الاتصال به اليوم.
| الخطوة | النموذج | الدور في السلسلة | السعر المدرج |
|---|---|---|---|
| 1 | bytedance/seedream-v5.0-pro/text-to-image | تثبيت مظهر الشخصية | $0.045 / صورة |
| 2 | google/nano-banana-2/edit | نسخ الهوية إلى الإطار المفتاحي لكل لقطة | $0.08 / صورة |
| 3 | alibaba/wan-2.7/reference-to-video | تحريك كل لقطة مع الإطار المرجعي المثبت | $0.10 / ثانية |
| بديل | alibaba/wan-2.7/text-to-video | موجه واحد، لقطات متعددة (الأقل قابلية للتحكم) | $0.10 / ثانية |
| إصلاح | alibaba/wan-2.7/video-edit | إصلاح دعائم خاطئة دون إعادة التوليد | $0.10 / ثانية |
يجدر بالذكر لسؤال "أفضل نموذج لاتساق اللقطات المتعددة": المرجع إلى فيديو هو فئة كاملة الآن. bytedance/seedance-2.0-fast/reference-to-video يكلف $0.072/ثانية (خصم 20% من $0.09، اعتبارًا من أغسطس 2026)، kwaivgi/kling-video-o3-pro/reference-to-video $0.095/ثانية (خصم 15% من $0.112)، minimax/h3/reference-to-video $0.10/ثانية، و google/veo3.1/reference-to-video $0.20/ثانية. جميع الأسعار تم التحقق منها مقابل الكتالوج المباشر في 21 أغسطس 2026.
تحذير واحد قبل الخطوات: الأسعار المدرجة هي أرضية، وليس عرضًا. الدقة والمدة يغيران الرقم الحقيقي، لذا اقرأ زر التشغيل قبل الالتزام.
كيفية بناء اتساق اللقطات المتعددة على غرار Wan 3.0، خطوة بخطوة
نحن نعيد بناء نفس خريطة المشاهد التي أخطأت فيها نموذج Alibaba الخاص: امرأة قبعة القش، أربع لقطات، من الحديقة إلى السيارة. نفس السيناريو، تحكم لكل لقطة، وهذه المرة ستحصل على أربع لقطات لأنك قمت بإنشاء أربع.
لنبدأ.
الخطوة 1: ثبّت المظهر. تصبح صورة واحدة مرساة الهوية لكل ما يلي. قم بتوليدها على Seedream v5.0 Pro، بنسبة 16:9، بأعلى دقة تقدمها الصفحة. قم بتسمية الدعائم الثلاثة المرجعية بشكل صريح، لأنها هي التي تنجرف.
plaintext1لقطة فيلم 35 ملم، حديقة ورود قديمة مضاءة بالشمس. امرأة شابة أنيقة ترتدي قبعة بوتر من القش الطبيعي بشريط أسود، عقد من الخرز الأسود مع قلادة واحدة على شكل دمعة، وفستان كتّان أبيض بدون أكمام. تقف أمام جدار من الورود المتفتحة الوردية والقشدية، إحدى يديها تلمس برفق حافة قبعتها، نظرة لطيفة وتأملية قليلاً خارج الكاميرا. ضوء طبيعي ناعم دافئ، وهج شمسي مرقط، عمق مجال ضحل، حبيبات فيلم دقيقة، لقطة متوسطة قريبة.

واجهة Seedream v5.0 Pro على Atlas Cloud مع إدخال موجه قبعة القش والإطار المفتاحي النهائي للشخصية معروض في لوحة الإخراج
الخطوة 1 مكتملة: مرساة الهوية لتسلسل اللقطات الأربع بأكمله.
الخطوة 2: انسخ الهوية إلى اللقطات 2 إلى 4. إطار مفتاحي واحد لكل لقطة، تشغيل واحد لكل منها، باستخدام Nano Banana 2 Edit مع إخراج الخطوة 1 كمرجع. الانضباط المهم: أعد ذكر الملابس الكاملة في كل مرة، ثم غير شيئًا واحدًا فقط.
اللقطة 2، المنعطف العاطفي:
plaintext1احتفظ بنفس المرأة تمامًا من الصورة المرجعية: نفس الوجه، نفس قبعة البوتر من القش الطبيعي بشريط أسود، نفس عقد الخرز الأسود مع قلادة على شكل دمعة، نفس فستان الكتان الأبيض بدون أكمام. لقطة جديدة: لقطة قريبة سينمائية، ترفع قبعة القش ببطء عن رأسها وتخفض ذقنها، بتعبير حزين خفيف. نفس خلفية حديقة الورود. حافظ بدقة على نفس الإضاءة، لون البشرة، حبيبات الفيلم ودرجة الألوان كما في المرجع.
اللقطة 3، القطع إلى السيارة:
plaintext1احتفظ بنفس المرأة تمامًا من الصورة المرجعية: نفس الوجه، نفس عقد الخرز الأسود مع قلادة على شكل دمعة، نفس فستان الكتان الأبيض بدون أكمام، وقبعة البوتر من القش الآن مستلقية على حجرها. لقطة جديدة: المقعد الخلفي لسيارة متحركة، صورة جانبية، يدها مسندة على الباب، تنظر من نافذة مغطاة بقطرات المطر، وخضرة ضبابية تندفع خلفها. ضوء غائم مع حشوة داخلية دافئة، عمق مجال ضحل، حزن أنيق. حافظ بدقة على نفس الوجه، نفس درجة الألوان ونفس حبيبات فيلم 35 ملم كما في المرجع.
اللقطة 4، النظرة الأخيرة:
plaintext1احتفظ بنفس المرأة تمامًا من الصورة المرجعية: نفس الوجه، نفس عقد الخرز الأسود مع قلادة على شكل دمعة. لقطة جديدة: لقطة قريبة شديدة للوجه بجانب نافذة السيارة، عيناها تغلقان ببطء، بتعبير هادئ ومريح. تنزلق قطرات المطر على الزجاج أمامها، يتحول التركيز إلى القطرات، وتختفي الخلفية في بوكيه. جو سينمائي على غرار Wong Kar-wai، حبيبات فيلم دقيقة. حافظ بدقة على نفس الوجه، نفس الإضاءة ونفس درجة الألوان كما في المرجع.

واجهة Nano Banana 2 Edit على Atlas Cloud مع تحميل الإطار المفتاحي من الخطوة 1 كمرجع وعرض الإطار المفتاحي للقطة 2، مع الحفاظ على الهوية والملابس
الخطوة 2 مكتملة: الإطار المفتاحي للقطة 2، نفس المرأة، القبعة الآن في يديها.
الخطوة 3: حرك اللقطة 1 مع الإطار المرجعي المثبت. الآن تصبح كل لقطة فيديو بشكل مستقل على Wan 2.7 reference-to-video. الإعدادات: 720P، 5 ثوانٍ، واسقط الإطار المفتاحي من الخطوة 1 في خانة الصور. تحقق من عرض زر التشغيل قبل إطلاقه.
plaintext1اللقطة 1 من 4. الصورة المرجعية 1 تحدد الشخصية: حافظ على نفس الوجه، نفس قبعة البوتر من القش الطبيعي بشريط أسود، نفس عقد الخرز الأسود مع قلادة على شكل دمعة ونفس فستان الكتان الأبيض بدون أكمام متطابقين طوال المقطع. مظهر فيلم 35 ملم، حديقة ورود قديمة مضاءة بالشمس. تلمس المرأة برفق حافة قبعتها بينما ترفع نسمة هواء ناعمة خصلات شعرها؛ تدفع الكاميرا ببطء إلى الداخل. ضوء طبيعي دافئ، وهج شمسي مرقط، عمق مجال ضحل، حبيبات فيلم دقيقة. يظل موضع الكاميرا ثابتًا. لا قطع صعب ولا تغيير مشهد.

واجهة Wan 2.7 reference-to-video على Atlas Cloud مع الإطار المفتاحي في خانة الصور والمقطع النهائي الذي تبلغ مدته خمس ثوانٍ يعمل في لوحة الإخراج
الخطوة 3 مكتملة: المقطع المقفل بالمرجع معروض في لوحة الإخراج.
وإليك ما خرج:

مقطع مدته خمس ثوانٍ مقفل بالمرجع للمرأة ذات قبعة القش في حديقة الورود، شريط القبعة والقلادة يظلان ثابتين طوال الوقت
تشغيلنا الخاص على Atlas Cloud، وليس عرضًا تجريبيًا من Alibaba. يظهر كـ GIF صامت؛ الملف المسلَّم يحمل مسارًا صوتيًا.
الخطوة 4: سلسلة اللقطات 2 إلى 4، ثم الربط. كرر الخطوة 3 لكل إطار مفتاحي متبقي، والصق سطر التسليم من الدليل في أعلى كل موجه تالٍ:
plaintext1استمر بسلاسة من الإطار الأخير للمقطع السابق. تظل الشخصية، والملابس، والموقع، وموضع الكاميرا متطابقة تمامًا. لا قطع صعب ولا انتقال مفاجئ للمشهد.
ثم قم بالربط محليًا باستخدام ffmpeg وقم بإجراء فحص القبول ثلاثي النقاط: شكل القبعة وشريطها، عقد الخرز والقلادة، وما إذا كان تقدم التأطير بين اللقطات منطقيًا بالفعل. إذا كانت دعائم واحدة فقط خاطئة في لقطة واحدة، لا تقم بإعادة توليد اللقطة. أرسلها عبر wan-2.7/video-edit وقم بتغيير ذلك فقط، مستعيرًا صياغة الدليل: حافظ على الإجراءات والملابس وبقية الإطار دون تغيير.
الاختلافات: المشاهد متعددة الموضوعات وأقفال الأنماط
ثلاثة أنماط من الدليل تستحق السرقة.
بطاقات الشخصيات للقطات متعددة الموضوعات. عندما يشارك شخصان أو أكثر الإطار، تقوم الموجهات الرسمية بتعيين بطاقات شخصيات بأحرف وإعادة ذكر الزي الكامل لكل منها في كل مقطع. مطول، قبيح، ولكنه يعمل بشكل أفضل من الضمائر.
إعلان النمط العالمي للأعمال المنمقة. الحبر، والأنمي الخلوي، والأنماط الثقيلة الأخرى تحتاج إلى تثبيت النمط مرة واحدة للقطعة بأكملها، ثم ورقة إيقاع موقوتة تحته.

تسلسل فنون قتالية بالحبر مع مبارز سيف في غابة خيزران، نمط مقفل عبر ورقة إيقاع موقوتة من خمس ضربات
عرض تجريبي رسمي لـ Wan 3.0 من Alibaba (مقطع من الدليل v084، 20.05 ثانية، مقصوص). خمس ضربات موقوتة تحت إعلان نمط حبر عالمي واحد. ضربات الفرشاة النابضة هي السبب في عدم قدرة الكشف التلقائي للقطات على عد هذا. لم يتم إنشاؤه بواسطة Atlas Cloud.
أصلح، لا تعيد التوليد. تمريرة تحرير فيديو على دعائم خاطئة واحدة أرخص من توليد جديد ولا يمكنها كسر اللقطات التي كانت صحيحة بالفعل.
كم تكلفة تسلسل من أربع لقطات
أرقام ملموسة للتسلسل المبني أعلاه، بالأسعار المدرجة:
- مرساة هوية واحدة على Seedream v5.0 Pro: $0.045
- 3 إطارات مفتاحية للقطات على Nano Banana 2 Edit: 3 × $0.08 = $0.24
- 4 مقاطع مدة كل منها 5 ثوانٍ، بدقة 720P، على Wan 2.7 reference-to-video: 20 ثانية × $0.10 = $2.00
- الإجمالي: حوالي $2.29 لتسلسل مدته 20 ثانية، من أربع لقطات، مقفل الهوية
قم بتمديده إلى قطعة من ست لقطات مدتها 30 ثانية وسيصبح سطر الفيديو $3.00، ليصل إلى حوالي $3.44 إجمالاً.
تحذيران صادقان. أولاً، الأسعار المدرجة هي أرضية: مستويات الدقة والمدة تغير التكلفة الفعلية، وعرض التشغيل الخاص بالواجهة هو الرقم الوحيد الملزم، ولهذا السبب فإن لقطات الشاشة أعلاه أكثر أهمية من هذه القائمة. ثانيًا، بالنسبة لـ Wan 3.0 نفسه، تقوم Alibaba بتسعير توليد الفيديو في Model Studio لكل ثانية حسب مستوى الدقة، لكنني لم أتمكن من تأكيد أسعار Wan 3.0 بالثانية من صفحة رسمية، لذا أنا لا أذكر أرقامًا لم أتمكن من التحقق منها.
يجدر بالذكر ما تشتريه مع نهج المهمة المقسمة: ليس سعرًا أقل، بل عدد لقطات يطابق السيناريو الخاص بك. بناءً على أدلة عرض Alibaba الخاص، هذا ليس شيئًا يمكن لمهمة واحدة مدتها 30 ثانية أن تعدك به بعد، وهو الإجابة العملية على اتساق اللقطات المتعددة في Wan 3.0 حتى يفتح الـ API.
الأسئلة الشائعة
كم عدد اللقطات التي يمكن لـ Wan 3.0 الحفاظ على اتساقها في توليد واحد؟
ستة، بناءً على الأدلة الحالية، مع تحذير. لا ينشر منشور Alibaba الإطلاقي مواصفات لعدد اللقطات. عبر الموجهات الثمانية متعددة اللقطات بشكل صريح في دليله الرسمي، أعلى ما تم الإعلان عنه هو 6، وقد سلم اثنان منها بالضبط 6 لقطات تم التحقق من قطعها. تعامل مع 6 على أنها سقف ملاحظ، وليس ضمانًا.
هل يولد Wan 3.0 حقًا دقة 4K أصلية؟
لا. المنشور الرسمي يذكر 480P و 720P و 1080P فقط. عبر جميع الملفات التجريبية الرسمية البالغ عددها 110، لا شيء يتجاوز 1080p، فقط 4 ملفات هي بالضبط 1920x1080، والإخراج الأفقي الشائع هو 1920x1072. تنقسم معدلات الإطارات إلى 24 إطارًا في الثانية لـ 63 ملفًا و 30 إطارًا في الثانية لـ 46 ملفًا.
هل الـ API لـ Wan 3.0 متاح، وأين يمكنني تشغيله؟
يعمل على Alibaba Cloud Model Studio. لا توجد منصة استدلال تابعة لجهة خارجية تستضيفه بعد؛ يدرجه Atlas Cloud كإدخال قادم قريبًا بدون نقاط نهاية حية. إذا كنت بحاجة إلى إخراج متعدد اللقطات هذا الأسبوع، فإن سلسلة Wan 2.7 reference-to-video أعلاه هي البديل العملي.
لماذا تتغير شخصياتي بين اللقطات حتى مع وجود صورة مرجعية؟
عادةً لأن موجهًا واحدًا قام بتغيير الموقع وزاوية الكاميرا والإضاءة في وقت واحد. غير متغيرًا واحدًا لكل لقطة، وأعد ذكر الملابس الكاملة في كل موجه. تحقق أيضًا من الأشياء الصحيحة: في عرض Alibaba الخاص، ظل الوجه ثابتًا بينما تغير كل من شريط القبعة وقلادة العنق داخل لقطة واحدة غير متقطعة.
هل أوزان Wan 3.0 مفتوحة المصدر؟
لم يتم إصدار أي أوزان. كانت إصدارات Wan السابقة قابلة للتنزيل والتشغيل محليًا، بينما يتم شحن Wan 3.0 كخدمة منصة مستضافة. أي شخص يستشهد برخصة Apache-2.0 لـ Wan 3.0 يكرر شيئًا ليس له مصدر رسمي وراءه.
ما هي أسرع طريقة للحصول على اتساق اللقطات المتعددة بدون الوصول إلى Wan 3.0؟
أربع حركات: ثبّت صورة هوية واحدة، انسخها إلى إطار مفتاحي واحد لكل لقطة مع تغيير متغير واحد في كل مرة، حرك كل لقطة باستخدام reference-to-video، ثم اربط محليًا وتحقق من دعائمك. حوالي $2.29 وحوالي نصف ساعة لتسلسل من أربع لقطات.
المنهجية: جميع الملفات التجريبية البالغ عددها 110 والموجهات الـ 64 المزدوجة مأخوذة من دليل Wan 3.0 الرسمي لـ Alibaba، وتم أرشفتها محليًا في 11 أغسطس 2026. تمت قراءة البيانات الوصفية ملفًا تلو الآخر باستخدام ffmpeg؛ عدد اللقطات مأخوذ من كشف تغيير المشهد في ffmpeg عند عتبة 0.2، وتم فحصه مقابل الإطارات المستخرجة؛ تم تحليل بنية الموجه برمجيًا. تم التحقق من أسعار Atlas Cloud مقابل كتالوج النماذج المباشر في 21 أغسطس 2026.
المصادر: Alibaba Cloud (أغسطس 2026); Curious Refuge (2026).






