عادةً ما ينتهي توليد تصميمات رقص طويلة بالذكاء الاصطناعي بالإحباط عندما تتحول الأطراف إلى سائل في حوالي الثانية الثامنة. ويُظهر الاختبار الواقعي على المخرجات الأصلية لـ Wan 3.0 قفزة كبيرة في الحفاظ على الحركة، مع إبقاء التشريح الجسدي وهوية الشخصية سليمين عبر عمليات توليد مستمرة مدتها 30 ثانية.
في هذا الاختبار المعياري للرقص عبر Wan 3.0، نقوم بتقييم أسلوبين ممتدين للرقص في ظل قيود صارمة بعدم إجراء أي تعديل، لاختبار كيفية موازنة النموذج بين فيزياء الملابس المعقدة وتتبع عدة أشخاص وثبات الكاميرا الأصلي، محققًا متوسط درجة 4.2 من 5.
| الرقص | النتيجة | الثبات الزمني | الآثار الأساسية |
| اختبار حجاب الرقص الشرقي | 4.6 / 5 | احتفاظ عالٍ بهوية الوجه وفيزياء حجاب نظيفة بزاوية 360 درجة | فقدان بسيط لاحتكاك الأرضية وتليّن الأصابع بعد الثانية 24 |
| رقصة الشريك التقليدية | 3.8 / 5 | قفل مثالي لهوية الشخصيتين عبر الاحتجاب الكامل | قفزات مقطعية غير مطلوبة تسبب وميضًا في الإطارات وتقلبات في الإضاءة |
يؤكد الاختبار أن Wan 3.0 يقاوم تدهور الحركة الحاد في فيديوهات الذكاء الاصطناعي أثناء التوليد طويل المدى. فبينما كانت مولدات الفيديو الأقدم تُذيب حركة المفاصل المعقدة، يحافظ Wan 3.0 على المحاذاة الهيكلية وهوية الوجه وديناميكيات الملابس عبر فيديو رقص كامل بالذكاء الاصطناعي مدته 30 ثانية.
منهجية الاختبار: تقييم منطق الحركة المستمر والاحتفاظ بالتشريح
تُخفي معظم معايير فيديوهات الذكاء الاصطناعي معدلات الفشل المرتفعة خلف مقاطع مقتطعة من ثلاث ثوانٍ وانتقاء اللقطات الأفضل من محاولات متعددة. ولتقييم الثبات الجسدي الحقيقي، تفرض منهجية اختبار الرقص عبر Wan 3.0 بروتوكولًا صارمًا بعدم إجراء أي تعديلات. يستخدم كل مخرج تقييم في هذا الاختبار توليد فيديو بلقطة واحدة خام عبر المدة الكاملة البالغة 30 ثانية دون أي إصلاحات بعد الإنتاج.
قيود التوليد الموحدة
قيّدنا جميع معايير التنفيذ لعزل فيزياء النموذج الأساسية:
- الدقة والسرعة: مخرجات أصلية بدقة 1080p تُعرض بمعدل 24 إطارًا في الثانية.
- التحكم بالبذرة: قيم بذرة ثابتة عبر تشغيلات المقارنة لنفس المطالبات.
- ضوابط الحركة: إعدادات قوة الحركة الأساسية عند القيمة الافتراضية 0.50.
- ما بعد المعالجة: صفر قص زمني أو لصق أو تعديلات في السرعة.
الركائز الأساسية للتقييم
- السلامة التشريحية: تتبع عدد الأصابع وحركة المعصم وهندسة الوجه خلال الدورانات السريعة.
- الفيزياء والزخم: قياس انتقال الوزن ورد فعل الجاذبية على الملابس الانسيابية مثل الأكمام الحريرية وحجاب الرقص الشرقي.
- الاستمرارية المكانية: تقييم اتساق الهوية عبر الحركة أثناء الدوران الكامل بزاوية 360 درجة واحتجاب عدة أشخاص.
يشكّل هذا الإطار معيارًا متكررًا لتوليد رقصات الذكاء الاصطناعي يفصل الاستدلال الزمني الحقيقي عن الحيل البصرية اللحظية.
حالة الاختبار الأولى: انسيابية الرقص الشرقي وعزل الجذع وفيزياء القماش
عادةً ما أدى استخدام مطالبات تتعلق بستائر ممتدة ومعالجة قماش بطيئة الحركة في نماذج الفيديو السابقة إلى تمزق القماش أو اختراق شبكة اليد أو تشوه الوجه خلف الأقمشة الشفافة. وقد كشف تنفيذ اختبار الرقص الشرقي عبر Wan 3.0 عن مدى فعالية النموذج في إدارة طبقات الحجاب المستمرة، واحتجاب اليد أمام الوجه، وزخم دوران الملابس عبر خط زمني متصل مدته 30 ثانية.
ملاحظة: جميع مقاطع الفيديو أدناه مخرجات خام غير محررة تم توليدها عبر Atlas Cloud's Wan 3.0 Image-to-Video بدقة 1080p و30 ثانية وبسعر 4.80 دولارًا لكل عملية توليد.
صورة الإطار الأول من الفيديو:

تصميم المطالبة:

مخرج الفيديو:
تقييم واقعية الحركة واحتجاب الحجاب
بدلاً من الاعتماد على قصات الكاميرا السريعة، يحافظ النموذج على ثبات الإطارات من خلال تصميم رقص متعمد بطيء الإيقاع ودورانات كاملة للجسم. يسلط هذا الاختبار الضوء على كيفية تعامل Wan 3.0 مع الأقمشة الشفافة متعددة الطبقات وتتبع الأصابع عن قرب دون تشوهات بصرية.
| عنصر الحركة | سلوك الحركة المُراقَب | الدرجة |
| الثبات الأساسي للوضعية والإطارات | وقفة ابتدائية صلبة تحافظ على تمدد واسع للحجاب دون أي وميض في الخلفية | 4.9 / 5 |
| هندسة اليد واحتجاب الوجه | تموجات الذراع الحلزونية البطيئة تحافظ على خمسة أصابع مميزة أثناء وضع الحجاب على الوجه | 4.4 / 5 |
| فيزياء القماش الدورانية | حجاب حريري شفاف يستجيب بدقة للزخم الزاوي خلال دوران كامل بزاوية 360 درجة | 4.6 / 5 |
ديناميكيات الملابس وسلوك التصادم
تشمل الملاحظات الفيزيائية الرئيسية من عملية التوليد المستمرة البالغة 30 ثانية ما يلي:
- قفل الوضعية الأساسية الثابتة (من 0 إلى 13 ثانية): يثبّت النموذج وضعية الذراعين المفتوحة الافتتاحية تحت إضاءة المسرح، محافظًا على وضوح نسيج الخرز على زي الرقص الشرقي دون وميض دقيق أو انحراف في الوضعية.
- سلامة الأصابع واحتجاب الطبقات (من 14 إلى 23 ثانية): بينما تلفّ الراقصة الحجاب الأزرق الشفاف حول وجهها وصدرها، تبقى مفاصل الأصابع مفصلية بشكل واضح. يمنع ثبات التتبع العالي هندسة اليد من الاندماج مع شبكة الوجه أو الذوبان في نسيج القماش.
- زخم الملابس الطارد المركزي (من 24 إلى 29 ثانية): لا يخترق الحجاب الحريري الجلد أو الشعر عندما يتمدد تحت قوة طرد مركزي واقعية أثناء دوران كامل بزاوية 360 درجة، ثم ينسدل بسلاسة حول الكتفين عند التوقف.
تؤكد هذه اللفافات القماشية النظيفة وتتبع الوجه المستقر أن Wan 3.0 يتعامل مع حركة الأقمشة متعددة الطبقات دون تمزق الإطارات الذي يميز عمليات توليد الذكاء الاصطناعي الطويلة.
حالة الاختبار الثانية: رقصة الشريك التقليدية، والتلامس الثنائي، والاحتجاب المكاني
عادةً ما يتسبب توليد راقصَين في لقطة واحدة في تعطل نماذج فيديو الذكاء الاصطناعي خلال ثوانٍ، ما يؤدي إلى اندماج الأطراف أو ارتداء أحد المؤديين لزي الآخر أثناء الدوران. ويكشف اختبار رقصة شريك عبر Wan 3.0 التي تجمع راقصَين في ثنائي تقليدي عن كيفية تعامل النموذج مع التفاعلات المكانية المعقدة وتداخل الملابس وتتبع عدة أشخاص.
صورة الإطار الأول من الفيديو:

تصميم المطالبة:

مخرج الفيديو:
أداء تتبع عدة أشخاص والاحتجاب المكاني
في اختباراتنا لفيديو رقص Guofeng بالذكاء الاصطناعي، نفّذ مؤديان يرتديان زيّي هانفو أحمر وأزرق متباينين دورانات متزامنة وحركات أكمام عبر لقطة مستمرة مدتها 30 ثانية.
| مقياس تعدد الأشخاص | سلوك النموذج المُراقَب | الدرجة |
| قفل هوية الشخصيتين | تظل تفاصيل زيّ هانفو الأحمر والأزرق مميزة عبر جميع قصات الكاميرا | 4.7 / 5 |
| استعادة الاحتجاب المكاني | تتعافى الراقصة في الخلفية بشكل نظيف بعد دوران الراقصة الحمراء بظهرها (12–17 ثانية) | 4.3 / 5 |
| استمرارية الكاميرا والانتقالات | تتسبب قصات القفز الأصلية المتكررة في قفزات تأطير مفاجئة ووميض إضاءة طفيف | 3.2 / 5 |
تقاطعات الملابس والعيوب الزمنية
- قفل الهوية عبر الاحتجاب (من 0 إلى 17 ثانية): عندما تستدير الراقصة الحمراء وتحجب الراقصة الزرقاء تمامًا عن النظر (12–16 ثانية)، يستعيد النموذج الراقصة المخفية بسلاسة، محتفظًا بهندسة وجهها الدقيقة وزينة شعرها وزخارف زيّ هانفو الأزرق.
- ديناميكيات الأكمام وانفصالها (من 18 إلى 23 ثانية): تمر الأكمام المائية المتداخلة عبر خطوط الصدر دون اندماج الأنسجة أو تمزق القماش أو تسرب الألوان.
- قصات القفز الأصلية ووميض الإضاءة (عند الثواني 1 و11 و23): بدلاً من البقاء على لقطة مستمرة واحدة، يميل Wan 3.0 إلى القفز بين زوايا الكاميرا، مثل فرض قصة خلفية ضيقة عند الثانية 11. تكسر هذه التحولات المفاجئة الإيقاع وتسبب وميض إضاءة قصيرًا وتلعثمًا في الإطارات.
ملاحظة للمبدعين: بينما يتعامل Wan 3.0 مع قفل هوية متعددة الأشخاص بشكل استثنائي، يتطلب تثبيت التأطير المستمر مطالبات سلبية صريحة مثل قصات قفز الكاميرا، أو التبديل المفاجئ للمشهد، أو وميض الإضاءة لمنع القصات الزاوية غير المرغوبة.
خط زمني لتدهور الحركة على مدى 30 ثانية: تتبع السلامة التشريحية من الثانية 0 إلى 30
عادةً ما يكشف توليد مقاطع رقص بالذكاء الاصطناعي لمدة 30 ثانية عن تدهور كامن حول الثانية 20، حيث تفقد القدمان احتكاكهما بالأرضية بينما تتليّن الأصابع. ويوضح تحليل عمليات التوليد في اختباراتنا كيفية إدارة Wan 3.0 لهذا التدهور عبر الخطوط الزمنية الطويلة.
من 0 إلى 10 ثوانٍ: القفل الأساسي والثبات الساكن
خلال الثواني العشر الأولى، يقدم Wan 3.0 تعريفًا حادًا للحواف وانجرافًا صفريًا في الوضعيات منخفضة السرعة.
- تثبيت القدمين: تحافظ القدمان على احتكاك قوي بأرضية المسرح أثناء الوقفات الثابتة وتمريرات اليد الدقيقة.
- حدة الزي: يحتفظ الهامش المعدني والستائر الحريرية وزينة الشعر بتفاصيل حادة عالية التردد دون وميض دقيق.
- السلامة التشريحية: تبقى ملامح الوجه وعدد الأصابع مقفلة بنسبة 100%.
من 10 إلى 20 ثانية: تدهور طفيف وقصات تأطير
بين الثانية 10 والثانية 20، تظل ميكانيكا الجسم الأساسية ثابتة، على الرغم من أن قفزات الكاميرا المولّدة من النموذج تُدخل تشوهات انتقالية قصيرة.
- أداء الاحتجاب: تظل هندسة الأصابع سليمة أثناء لف الحجاب البطيء حول الوجه والصدر (اختبار الرقص الشرقي).
- قصات تأطير غير مطلوبة: تسبب التبديلات المفاجئة في المنظور، مثل قصة الرؤية الخلفية عند الثانية 11 في اختبار الثنائي، وميض إضاءة لحظيًا، على الرغم من بقاء هويات الشخصيات مقفلة.
من 20 إلى 30 ثانية: الحد النهائي وفقدان احتكاك الأرضية
تكشف الثواني العشر الأخيرة حدود ميزانية الحركة في Wan 3.0.
- انزلاق الأرضية الدوراني (24–28 ثانية): أثناء الدورانات الكاملة للجسم ودورانات الشخصيتين، تفقد القدمان الاحتكاك الميكانيكي مع المسرح الخشبي، ما يسبب انزلاقًا خفيفًا على الأرضية بأسلوب "التزلج على الجليد".
- عزل الهوية: على الرغم من انزلاق الأرضية وتبديل الكاميرا، تظل هندسة الوجه مطابقة تمامًا للإطار الأول.
على الرغم من أن Wan 3.0 ليس محصنًا تمامًا ضد تدهور الحركة في المراحل المتأخرة، وتحديدًا فقدان احتكاك الأرضية بعد الثانية 20، فإن قدرته على عزل هوية الوجه عن الانجراف الجسدي تمثل قفزة جيلية حقيقية. بالنسبة للمبدعين، هذا يعني أن عمليات التوليد الطويلة تظل قابلة للاستخدام في الإنتاج، بشرط إدارة الدورانات الكاملة للجسم عند علامة الثانية 25 تقريبًا عبر تأطير متوسط أو قصات قصيرة بعد الإنتاج.
وصفات مطالبات جاهزة للنسخ واللصق لتوليد رقصات ذكاء اصطناعي مستقرة في Wan 3.0
عادةً ما يؤدي كتابة طلبات بسيطة مثل "امرأة ترقص" في Wan 3.0 إلى تأرجح فوضوي في الكاميرا ودوران غير مثبت للأطراف. ويتطلب تحقيق استمرارية حركة يمكن التنبؤ بها لمدة 30 ثانية إشارات مكانية منظمة، وأوصافًا تشريحية دقيقة للحركة، وصيغة قيود الكاميرا المبنية على مبادئ هندسة المطالبات في Wan 3.0.
يقدم هذا دليل مطالبات الرقص عبر Wan 3.0 وصفات مطالبات مجربة لتوليد فيديوهات رقص بالذكاء الاصطناعي محسّنة للتوليد بلقطة واحدة.
وصفة العزل الدقيق: معلمات الرقص الشرقي
عند المطالبة بحركات دقيقة مثل عزل الصدر أو اهتزاز الورك، حدد مسافة الكاميرا أولاً لمنع دوران الجسم الكامل غير المرغوب.
- قالب المطالبة الإيجابية:
لقطة متوسطة على مستوى العين، بتأطير ثابت ومقفل. راقصة محترفة بشعر داكن في كعكة منخفضة، ترتدي بدلة رقص شرقي ملكية زرقاء مرصعة بالجواهر ومزينة بهامش من العملات الفضية المعلقة. تؤدي رقصة شرقية مستمرة على مسرح خشبي داكن، وقدماها مثبتتان بقوة على سطح الأرضية. تنفذ عزلًا متحكمًا للجذع وتموجات صدرية خفيفة وموجات ذراع حلزونية انسيابية أثناء التعامل مع حجاب حريري ملكي أزرق شفاف. زخم قماش طبيعي، وعمق مجال ضحل، وإضاءة مسرح حجمية دافئة، ولقطة مستمرة مدتها 30 ثانية دون تغيير في المنظور.
- ملاحظات التنفيذ الأساسية: استخدم مصطلحات حركة دقيقة مثل "عزل الجذع" و"اهتزاز الورك الإيقاعي" في معلمات مطالبة الرقص الشرقي لإجبار آلية الانتباه على التركيز على إحداثيات شبكة الجذع الأساسية بدلاً من حركات الأطراف الواسعة.
وصفة تصميم رقص متعدد الأشخاص: رقصة شريك Guofeng
يفشل توليد شخصيتين عندما تدمج أوصاف المطالبة الموضوعيين في عبارة واحدة. افصل المؤديين حسب لون الزي والمواضع المكانية الصريحة.
- قالب المطالبة الإيجابية:
لقطة كاملة للجسم بزاوية واسعة. راقصتان تؤديان ثنائي Guofeng صيني تقليدي على مسرح خشبي. الراقصة اليسرى ترتدي هانفو أحمر بأكمام طويلة واسعة؛ والراقصة اليمنى ترتدي هانفو أزرق. دوران متزامن للأكمام، ودوران بطيء يدًا بيد، ومشاركة أنيقة للوزن، وحركات أقدام رشيقة. لقطة تتبع كاميرا سلسة تتبع حركتهما الدائرية. إضاءة مسرح غنية، وعمق مكاني واضح، ولقطة طويلة مستمرة مدتها 30 ثانية، بواقعية فوتوغرافية.
- ملاحظات التنفيذ الأساسية: يثبّت مثال مطالبة رقصة Guofeng هذا كل مؤدية بملابس مميزة حسب اللون لتثبيت اتساق الهوية أثناء دورانات التقاطع المكاني.
المطالبات السلبية الأساسية لثبات الرقص
لمنع التشوهات الجسدية أثناء التغيرات السريعة في السرعة، طبق هذه المطالبات السلبية المستهدفة في Wan 3.0 للرقص:
| الهدف من التشوه | سلسلة الكلمات السلبية الموصى بها |
| تشوه الأطراف والمفاصل | أطراف مدمجة، أذرع إضافية، أقدام طافية، خلع في المفاصل، أيدي منصهرة، أصابع ملتصقة |
| عدم الاستقرار الزمني | استيفاء إطارات مهتز، قصات كاميرا مفاجئة، ملابس متحولة، قماش يومض |
| تشوهات الحركة | انزلاق الأرضية، أقدام تتزلج على الجليد، ضبابية حركة مفاجئة، انحناء جسم غير طبيعي |
يضمن استخدام هذه الوصفات المنظمة أن يخصص Wan 3.0 ميزانية الحركة نحو الحركة الإيقاعية بدلاً من اهتزاز الكاميرا.
سير عمل المبدعين: متى تستخدم مدة 30 ثانية أصلية مقابل قصات متعددة
إن قضاء ساعات في توليد مقطع موسيقي مدته 30 ثانية لتكتشف أن قدمي المؤدي تفقدان احتكاك الأرضية عند الثانية 22 يظل صداعًا رئيسيًا في خطوط إنتاج الفيديو الرقمي. يعتمد الاختيار بين اللقطات المتصلة والقصات النمطية على المنصة المستهدفة وإيقاع الحركة.
الخيارات الاستراتيجية لخط الإنتاج: مدة 30 ثانية أصلية مقابل قصات متعددة لرقص الذكاء الاصطناعي
يساعد فهم المفاضلات في استراتيجية مدة 30 ثانية الأصلية مقابل القصات المتعددة لرقص الذكاء الاصطناعي على تحسين ميزانيات توليد GPU مع الحفاظ على الجودة البصرية عبر صيغ الفيديو القصير.
| أسلوب الإنتاج | أفضل صيغ المحتوى | المزايا التقنية الرئيسية | القيود المعروفة |
| لقطة أصلية مدتها 30 ثانية | مقاطع رقص Guofeng الجوية، لقطات طويلة سينمائية، عروض منفردة | استمرارية مكانية غير منقطعة، صوت أصلي متزامن، صفر قصات تحرير | انزلاق بسيط للأرضية وضبابية في الأصابع قرب الثانية 25 |
| قصات نمطية من 8 إلى 12 ثانية | معارك رقص عالية الإيقاع، مقاطع حركة أقدام سريعة، فيديوهات موسيقية متعددة الزوايا | يزيل التدهور الزمني، يعزز الإيقاع البصري، يتيح تبديلات ديناميكية للكاميرا | يتطلب تجميع الجدول الزمني بعد الإنتاج |
استخدام التوليد الأصلي لمدة 30 ثانية
تتفوق عمليات التوليد بلقطة واحدة في العروض الجوية لرقص Guofeng حيث تكون حركة الأكمام الانسيابية وتتبع الكاميرا غير المنقطع أولوية. يحافظ الاستفادة من المزامنة السمعية البصرية الأصلية في Wan 3.0 على تصميم الرقص المستمر متوافقًا مع إيقاعات الموسيقى التصويرية دون مزامنة شفاه يدوية أو لصق صوتي خارجي.
استخدام القصات النمطية القصيرة
تعمل مقاطع TikTok وShorts السريعة بشكل أفضل مع قصات سريعة من 8 إلى 12 ثانية. تحافظ اللقطات القصيرة على الإيقاع حيويًا، وتفرغ ذاكرة النموذج قبل بدء انجراف الإطارات، وتمنح المحررين نقاط قص نظيفة بين اللقطات الواسعة وتتبع الوجه.
خط إنتاج عملي لمبدعي رقص الذكاء الاصطناعي
يتطلب تنفيذ سير عمل مبدع الفيديو القصير عبر Wan 3.0 بكفاءة هيكلة المدخلات قبل بدء التوليد:
- تثبيت الصور المرجعية: مرر صور الشخصيات إلى مدخلات المرجع متعددة الوسائط في Wan 3.0 للحفاظ على هندسة الوجه عبر الدورانات المعقدة.
- تطبيق التوجيه الصوتي: أدخل المسارات المرجعية مباشرة في النموذج للاستفادة من المحاذاة السمعية البصرية المدمجة.
- تعيين حدود التأطير: ادمج علامات كاميرا متوسطة واسعة مع مطالبات سلبية صريحة لاحتواء الحركة المكانية داخل حدود الكاميرا النشطة.
يحقق هذا الأسلوب المنهجي مراقبة جودة متسقة لإنتاج فيديوهات رقص الذكاء الاصطناعي. توصيتنا العملية عبر Wan 3.0 هي استخدام مقاطع أصلية مدتها 30 ثانية للرقصات المنفردة المستمرة، مع الاحتفاظ بقصات متعددة الزوايا مدتها 8 ثوانٍ لتصميم رقص جماعي سريع.







