Seedance 2.5 ใช้งานได้แล้ววันนี้ — ที่แรกบน Atlas Cloud

Wan 3.0 การอ้างอิงแบบมัลติโมดัลรองรับ 20 ทรัพย์สิน โดย PDF เป็นหนึ่งในนั้น

Wan 3.0 multimodal reference รองรับ assets 20 รายการในการเรียกครั้งเดียว: รูปภาพ, วิดีโอ, เสียง, PDF, แม้กระทั่ง URL ดูผลลัพธ์ของ Alibaba เองและ workflow ที่คุณสามารถรันได้วันนี้

คุณสร้างโฟลเดอร์สำหรับโฆษณาความยาว 15 วินาทีหนึ่งชิ้น ภาพนิ่งตัวละครสองภาพ วิดีโอโทนแบรนด์ที่ลูกค้าส่งมา หนังสือแบรนด์ที่มีเฉพาะไฟล์ PDF ตัวอย่างเสียงจากนักแสดงที่คุณต้องการจริงๆ

จากนั้นคุณเปิดโมเดลวิดีโอของคุณ และมันขอแค่ภาพเดียว

คุณก็ทำสิ่งที่ทุกคนทำ คุณแปลโฟลเดอร์นั้นเป็นพรอมต์ 800 คำแล้วสวดมนต์ ใบหน้าเปลี่ยนไปในช็อตที่สาม เสื้อแจ็กเก็ตเปลี่ยนสี เสียงเป็นคนอื่นไปเลย

Omni-reference ของ Wan 3.0 เป็นครั้งแรกที่โมเดลวิดีโอพูดว่า: โอเค เอาโฟลเดอร์มาให้ฉันเลย ใช้ทรัพย์สินได้มากถึง 20 รายการในการเรียกครั้งเดียว ครอบคลุมอินพุตห้าประเภท คงความสม่ำเสมอกันผ่านเทคเดียวที่ต่อเนื่อง 30 วินาที

บทความนี้ทำสามอย่างและข้ามส่วนที่เหลือ มันแจกแจงว่าทรัพย์สิน 20 รายการนั้นคืออะไร ใช้คลิปที่ Alibaba สร้างขึ้นเองเป็นหลักฐาน และให้เวิร์กโฟลว์ที่เทียบเท่าที่คุณสามารถรันได้ในวันนี้ เพราะ Wan 3.0 ยังอยู่ในเบต้าสาธารณะบนคลาวด์ของ Alibaba เอง และยังไม่สามารถเรียกใช้งานจากแพลตฟอร์มของบุคคลที่สามได้

ประเด็นสำคัญ

  • Multimodal reference ของ Wan 3.0 รองรับทรัพย์สินได้มากถึง 20 รายการในการเรียกครั้งเดียว ครอบคลุมภาพ วิดีโอ เสียง เอกสาร และหน้าเว็บสด และคงความสม่ำเสมอตลอดเทคเดียว 30 วินาที
  • มันเป็นโมเดลวิดีโอกระแสหลักแรกที่ถือว่าไฟล์ PDF สไลด์ หรือ URL เป็นอินพุตเชิงสร้างสรรค์ แทนที่จะเป็นสิ่งที่คุณต้องถอดความใส่ในพรอมต์
  • Wan 3.0 เข้าสู่เบต้าสาธารณะเมื่อวันที่ 6 สิงหาคม 2026 บน Alibaba Cloud Model Studio และ Qwen Cloud ในชื่อ wan3.0-video มันเป็น closed weights ใครก็ตามที่บอกว่ามันเป็น Apache 2.0 แล้วคือการเดา
  • หัวข้อ 20 ทรัพย์สินไม่ใช่จุดที่มันเหนือกว่า แท้จริงแล้ว โมเดล reference-to-video ที่คุณเรียกใช้ได้ในตอนนี้รองรับทรัพย์สินมากกว่า 20 รายการอยู่แล้ว จุดต่างคือเอกสารและหน้าเว็บ ไม่ใช่จำนวน
  • คุณสามารถทดสอบรูปแบบสองตัวละคร ล็อกด้วย reference และมีเสียงเต็มรูปแบบได้ฟรีด้วยเครื่องมือสร้างสกิตโฆษณา AI ฟรีของ Atlas Cloud: ใส่รูปผลิตภัณฑ์สี่รูป ได้สกิตพูดได้ 15 วินาที ไม่ต้องใช้บัตรเครดิต

แมวขนฟูและแมวดำวิ่งลงทางเดินโรงแรมหรู

แมวสองตัววิ่งผ่านฉากห้าฉากที่แตกต่างกันโดย Wan 3.0 โดยไม่มีการลื่นไถลของตัวละคร_ภาพอ้างอิงสองภาพ ฉากที่แตกต่างกันโดยสิ้นเชิงห้าฉาก ตั้งแต่ทางเดินโรงแรมไปจนถึงถังซักผ้าไปจนถึงตู้โทรศัพท์สีแดง ไม่มีการลื่นไถลแม้แต่เฟรมเดียว ที่มา: คู่มือผู้สร้าง Wan 3.0 อย่างเป็นทางการของ Alibaba_ Wan 3.0 creator handbook _ สิงหาคม 2026 ซึ่งเป็นที่มาของคลิป Wan 3.0 ทั้งหมดในบทความนี้_

ทำไม Multi-Reference Video ถึงพัง และ Wan 3.0 Multimodal Reference เปลี่ยนอะไร

โมเดลวิดีโอไม่มีหน่วยความจำระหว่างคลิป ทุกครั้งที่สร้างเริ่มจากศูนย์ นั่นคือปัญหาทั้งหมดในประโยคเดียว

ดังนั้นทันทีที่เรื่องราวของคุณต้องการมากกว่าหนึ่งช็อต คุณต้องต่อชิ้นส่วน ช็อตหนึ่งให้ใบหน้าที่คุณชอบ ช็อตสองให้ลูกพี่ลูกน้องของใบหน้านั้น ช็อตสามเปลี่ยนแจ็กเก็ตจากสีม่วงเข้มเป็นเบอร์กันดีอย่างเงียบๆ และพอคุณสังเกตเห็น คุณก็จ่ายค่าเรนเดอร์ไปสิบเอ็ดครั้งแล้ว

การอ้างอิงภาพเดียวช่วยได้ แต่มันล็อกได้แค่สิ่งเดียวเท่านั้นคือใบหน้า ไม่สามารถยึดใบหน้า ชุด อุปกรณ์ประกอบฉาก สถานที่ และเสียงไปพร้อมกันได้ เพราะมีช่องเดียวและมีงานห้าอย่าง

มีทางออกสองทาง ให้ช่องแก่โมเดลมากขึ้น หรือหยุดให้มันเริ่มใหม่ Wan 3.0 ทำทั้งสองอย่างพร้อมกัน และนั่นคือเหตุผลที่คุณสมบัติหลักสองอย่างนั้นเป็นคุณสมบัติเดียวจริงๆ เทค 30 วินาทีแบบเนทีฟหมายความว่าไม่มีรอยต่อให้ตัวละครลื่นไถล ทรัพย์สินอ้างอิง 20 รายการหมายความว่าทุกองค์ประกอบที่ต้องคงที่ได้รับช่องเฉพาะของมันเองแทนที่จะแย่งชิงช่องเดียว

นี่คือสิ่งที่ดูเหมือนเมื่อไม่มีอะไรถูกต่อกัน สามสิบวินาที กล้องเดียวต่อเนื่อง เด็กในรถเข็นสินค้าที่ลงเอยฝังอยู่ในป้ายโฆษณาแล้วเดินออกมาจากข้างใต้

สามสิบวินาทีเต็มในรอบเดียว ไม่มีการตัด พร้อมซาวด์แทร็กที่สร้างในรอบเดียวกัน ที่มา: คู่มือผู้สร้าง Wan 3.0 อย่างเป็นทางการของ Alibaba

"20 ทรัพย์สิน" จริงๆ แล้วหมายถึงอะไรใน Wan 3.0 Multimodal Reference

ยี่สิบเป็นตัวเลขพาดหัว สิ่งที่สำคัญคือยี่สิบนั้นไม่ใช่สิ่งเดียวกันทั้งหมด Omni-reference ของ Wan 3.0 ครอบคลุมอินพุตห้าประเภท และแต่ละประเภทควบคุมแกนที่แตกต่างกันของเอาต์พุต

ภาพควบคุมเอกลักษณ์ การ์ดตัวละคร ภาพผลิตภัณฑ์ แผ่นสถานที่ Wan 3.0 เรียกสิ่งนี้ว่าความสม่ำเสมอระดับพิกเซล และในตัวอย่างของ Alibaba เอง การล็อกขยายเกินใบหน้าไปถึงเครื่องแต่งกาย: เสื้อคลุมสีเทาซ้อนกัน เสื้อหนังคาดเข็มขัด ผ้าคาดเอวสีเข้ม ทั้งหมดคงอยู่ผ่านการต่อสู้ประชิดตัวยาว 16 วินาทีข้ามสามสถานที่

ชายหนุ่มในชุดจีนโบราณยืนกลางแจ้งตอนพระอาทิตย์ตก

การ์ดตัวละครสองตัวขับเคลื่อนฉากต่อสู้ wuxia โดยรายละเอียดเครื่องแต่งกายคงที่ในทุกเฟรม

การ์ดตัวละครสองตัวบวกแผ่นสถานที่ของตลิ่งกก เครื่องแต่งกายและฉากคงที่ตลอดการปาเป้า ที่นี่แสดงเป็น GIF เงียบ ไฟล์ที่ส่งมาพร้อมมิกซ์สเตอริโอ 44.1kHz ที่มา: คู่มือผู้สร้าง Wan 3.0 อย่างเป็นทางการของ Alibaba

เสียงควบคุมน้ำเสียง นี่คือส่วนที่ทำให้ "multimodal" เป็นมากกว่าการตลาด คุณแนบตัวอย่างเสียงต่อตัวละคร เขียนบทในพรอมต์ แล้วบทสนทนาจะกลับมาในน้ำเสียงนั้น ตรงกับริมฝีปาก ในรอบเดียวกับภาพ สองคน สองตัวอย่างเสียง โรงยิมเดียว

ภาพตัวแบบสองภาพบวกคลิปตัวอย่างเสียงแยกสองคลิป และบทสนทนากลับมาในสองเสียงนั้น คุ้มที่จะเปิดเสียงสำหรับอันนี้ ที่มา: คู่มือผู้สร้าง Wan 3.0 อย่างเป็นทางการของ Alibaba

วิดีโอควบคุมจังหวะ วิดีโออ้างอิงไม่ได้มีไว้เพื่อคัดลอก มันมีไว้เพื่อบริจาคจังหวะ: จังหวะที่ค้างไว้นานแค่ไหน การเปลี่ยนผ่านเคลื่อนไหวอย่างไร ในอันนี้ คีย์เฟรมห้าภาพให้ตัวแบบ และวิดีโออ้างอิงให้จังหวะการพลิกการ์ดแนวนอนระหว่างพวกเขา

ผู้หญิงสวมเครื่องประดับศีรษะจีนโบราณวิจิตรและชุดปักสีน้ำเงิน

คีย์เฟรมห้าภาพถูกพลิกด้วยจังหวะจากวิดีโออ้างอิง_ภาพคีย์เฟรมห้าภาพสำหรับตัวแบบ วิดีโออ้างอิงหนึ่งภาพสำหรับจังหวะการพลิก ที่มา: คู่มือผู้สร้าง Wan 3.0 อย่างเป็นทางการของ Alibaba_

เอกสารและหน้าเว็บควบคุมโครงสร้าง นี่คือส่วนใหม่จริงๆ Wan 3.0 ยอมรับไฟล์เอกสารและ URL สดเป็นอินพุตเชิงสร้างสรรค์ และรายงานเกี่ยวกับเบต้าแสดงรายการ .doc, .xls, .ppt, .pdf และ .txt เป็นรูปแบบที่ยอมรับ (AlphaSignal, สิงหาคม 2026) ตรรกะเดียวกันนี้ทำงานกับภาพสตอรีบอร์ดอยู่แล้ว: สตอรีบอร์ดหนึ่งภาพเข้า ได้หกช็อตออก ตามลำดับของสตอรีบอร์ดเอง

คนสองคนถือร่มยืนบนชานชาลาสถานีรถไฟฝนตก

แผ่นสตอรีบอร์ดแผ่นเดียวขยายเป็นหกช็อตต่อเนื่องที่ชานชาลาสถานีรถไฟฝนตก

แผ่นสตอรีบอร์ดหนึ่งแผ่นเป็นข้อมูลอ้างอิง สร้างหกช็อตตามลำดับ ลงไปจนถึงการส่งโน้ตในมือที่ช็อตห้า ที่มา: คู่มือผู้สร้าง Wan 3.0 อย่างเป็นทางการของ Alibaba

เฟรมแรกและเฟรมสุดท้ายควบคุมจุดสิ้นสุด เทคนิคที่เก่าที่สุดในตำรา ยังคงรองรับ ยังคงเป็นวิธีที่เร็วที่สุดในการจำกัดขอบเขตของช็อต

นี่คือวิธีการเทียบกับเวอร์ชันที่คนส่วนใหญ่ใช้จริงในวันนี้

Wan 2.7 Reference-to-VideoWan 3.0 omni-reference
ทรัพย์สินอ้างอิงหนึ่งภาพต่อตัวแบบ, สูงสุด 3 วิดีโอ, 1 คลิปเสียงสูงสุด 20 ทรัพย์สินรวม
รูปแบบภาพ, วิดีโอ, เสียงภาพ, วิดีโอ, เสียง, เอกสาร, หน้าเว็บ
ระยะเวลาสูงสุด หนึ่งรอบ10 วินาที30 วินาทีเนทีฟ พร้อม smart duration
เสียงในรอบเดียวกันใช่ใช่
การตัดต่อและขยายวิดีโอไม่เปิดเผยการตัดต่อแบบ instruction และ reference based พร้อมการขยาย
การพร้อมใช้งานใช้งานได้บน API ของบุคคลที่สามเบต้าบน Alibaba Cloud Model Studio และ Qwen Cloud

มีกฎข้อหนึ่งที่ไม่มีใครเขียนในเอกสาร และทุกคนเรียนรู้ด้วยวิธีที่ยาก: หนึ่ง reference หนึ่งงาน Image1 ล็อกใบหน้าและชุด Video1 ให้เฉพาะการเคลื่อนไหว Audio1 ให้เฉพาะน้ำเสียง ทันทีที่คุณมอบสองงานที่ขัดแย้งกันให้กับทรัพย์สินเดียว หรืออัปโหลดภาพอ้างอิงที่มีคนสองคนในนั้น โมเดลต้องเดา และการเดาคือสิ่งที่คุณพยายามหยุดไว้ คู่มือของ Alibaba ยังพูดตรงไปตรงมาเกี่ยวกับเรื่องนี้เช่นกัน: หนึ่งตัวแบบต่อภาพอ้างอิง

เวิร์กโฟลว์ Wan 3.0 Multimodal Reference ที่คุณรันได้ในวันนี้

คำตอบตรงก่อน Wan 3.0 อยู่ในเบต้าสาธารณะบนคลาวด์ของ Alibaba เอง ภายใต้ไอดีโมเดล wan3.0-video (Alibaba Wan, สิงหาคม 2026) ยังไม่ลงจอดบนแพลตฟอร์ม API ของบุคคลที่สาม รวมถึง Atlas Cloud ใครก็ตามที่ขายคุณ Wan 3.0 API access ตอนนี้คือกำลังขายของอย่างอื่น

สิ่งที่ลงจอดแล้วคือรูปร่างของเวิร์กโฟลว์ แพ็ก reference เข้า เรียกครั้งเดียว ได้คลิปพร้อมเสียงออก สิ่งนี้ทำงานได้ในวันนี้บนโมเดล reference-to-video ที่คุณเรียกใช้ได้ในแท็บเบราว์เซอร์ และเมื่อคุณจัดเรียงทั้งหมดแล้ว หัวข้อ 20 ทรัพย์สินจะดูแตกต่างออกไป

โมเดลทรัพย์สินอ้างอิงรูปแบบระยะเวลาสูงสุดเสียงเนทีฟราคาต่อวินาที
Wan 3.0 (Alibaba beta, ยังไม่บน Atlas)20 รายการรวมภาพ, วิดีโอ, เสียง, เอกสาร, หน้าเว็บ30 วินาทีใช่รายงาน $0.05 ถึง $0.20 ตามความละเอียด
Wan 2.7 Reference-to-Video1 ภาพต่อตัวแบบ, 3 วิดีโอ, 1 คลิปเสียงภาพ, วิดีโอ, เสียง10 วินาทีใช่$0.10
Seedance 2.5 Reference-to-Video50 (30 ภาพ / 10 วิดีโอ / 10 เสียง)ภาพ, วิดีโอ, เสียง30 วินาทีใช่$0.13
MiniMax H3 Reference-to-Videoผสม, ไม่มีขีดจำกัดที่ระบุภาพ, วิดีโอ, เสียง15 วินาทีใช่$0.10
Kling Video O3 Pro Reference-to-Video7 ภาพ, หรือ 4 ภาพ + 1 วิดีโอภาพ, วิดีโอ15 วินาทีใช่$0.10
Vidu Q3-Mix Reference-to-Video4 ภาพภาพ16 วินาทีใช่$0.11
Veo 3.1 Reference-to-Video3 ภาพภาพ8 วินาทีไม่บังคับ$0.20

ราคาเป็นอัตรา Atlas Cloud ณ เดือนสิงหาคม 2026 ตัวเลขของ Wan 3.0 เป็นตัวเลขที่รายงานสำหรับเบต้า Alibaba Cloud ไม่ใช่อัตราของ Atlas และ Alibaba ยังไม่ได้เผยแพร่หน้าราคาสาธารณะสำหรับโมเดล ดังนั้นให้ถือว่าแถวนั้นเป็นข้อมูลชั่วคราว

อ่านตารางนั้นสองครั้งแล้วเรื่องจริงจะปรากฏ หัวข้อ 20 ทรัพย์สินไม่ใช่จุดที่ Wan 3.0 เหนือกว่า เพราะ Seedance 2.5 รับได้ถึง 50 และเท่ากับ 30 วินาที สิ่งที่ไม่มีในรายการนั้นรองรับคือไฟล์ PDF

สำหรับคำแนะนำด้านล่าง การสาธิตจะรันบน Wan 2.7 Reference-to-Video เพราะรูปร่างอินพุตของมันใกล้เคียงกับ omni-reference มากที่สุดในปัจจุบัน: ภาพตัวแบบหลายภาพ, วิดีโออ้างอิงเพิ่มเติม, และคลิปเสียง ทั้งหมดแมปกับป้ายชื่อ character1 และ character2 ภายในพรอมต์ สามโมเดล หนึ่งแท็บเบราว์เซอร์ ไม่ต้องติดตั้งในเครื่อง

สร้างด้วยตัวเอง: ฉาก Multimodal Reference ในสี่ขั้นตอน

ฉาก: เคาน์เตอร์ต้อนรับโรงแรมสีพาสเทล พนักงานต้อนรับหน้าตาย นักเดินทางถือแมว ragdoll พนักงานต้อนรับมองตรงไปที่เลนส์แล้วพูดว่า "แมวมีจองแล้ว คุณไม่มี"

ภาพสองภาพบวกคลิปเสียงหนึ่งคลิป ซึ่งเป็นทรัพย์สินอ้างอิงสามรายการในสองรูปแบบ นั่นคือการสร้างที่เล็กที่สุดที่ซื่อสัตย์ว่าเป็น multimodal จริงๆ ไม่ใช่แค่ multi-image

ขั้นตอนที่ 1. สร้างภาพอ้างอิง 1 ตัวแบบที่ต้องล็อก

ภาพอ้างอิงมีสามงานและสามงานเท่านั้น: หนึ่งตัวแบบ, หันหน้ากล้อง, พื้นหลังสะอาด ทุกอย่างอื่นเป็นของตกแต่ง ใช้ GPT Image 2 ด้วยคุณภาพ high, ขนาด 16:9, n=1.

Plain
1ภาพเหมือนเต็มตัวในสตูดิโอของพนักงานต้อนรับโรงแรมวัยกลางคนที่มีสีหน้าตาย ยืนตรงกลางกับผนังสีชมพูหม่นแบน เขาสวมเครื่องแบบกระดุมสองแถวสีพลัมม่วงมีขอบทองและกระดุมทองเหลือง หมวกทรงกลมเล็ก และหนวดบาง โครงสร้างสมมาตรสมบูรณ์ แสงหน้าสม่ำเสมอ ไม่มีเงาบนผนัง เม็ดฟิล์ม 35mm จานสีพาสเทลหม่น หนึ่งตัวแบบเท่านั้น ไม่มีคนอื่น ไม่มีข้อความ ไม่มีโลโก้ ไม่มีอุปกรณ์ประกอบในเฟรม

อินเทอร์เฟซเครื่องมือสร้างภาพ AI แสดงขั้นตอนที่มีเลขและพนักงานต้อนรับที่สร้างขึ้น

GPT Image 2 playground บน Atlas Cloud พร้อมภาพเหมือนพนักงานต้อนรับที่ใช้เป็น reference ในแผงเอาต์พุต

GPT Image 2 บน Atlas Cloud: คุณภาพ high, 16:9, หนึ่งตัวแบบ, พื้นหลังแบน นี่คือไฟล์ที่จะกลายเป็น character1

ขั้นตอนที่ 2. สร้างภาพอ้างอิง 2 ตัวแบบที่สองที่ล็อก

โมเดลเดียวกัน การตั้งค่าเดียวกัน ความแตกต่างของสีระหว่างสองตัวละครนั้นตั้งใจ เพราะมันทำให้โมเดลมีวิธีง่ายๆ ในการแยกพวกเขาออกจากกันเมื่อแชร์เฟรม

Plain
1ภาพเหมือนเต็มตัวในสตูดิโอของนักเดินทางหญิงสาวถือแมว ragdoll ขนฟูแนบหน้าอก ยืนตรงกลางกับผนังสีเหลืองมัสตาร์ดแบน เธอสวมเสื้อโค้ทขนสัตว์สีมัสตาร์ด หมวกเบเร่ต์สีแดง และแว่นตากรอบกระดองเต่า และถือกระเป๋าเดินทางหนังวินเทจใบเล็กในมืออีกข้าง โครงสร้างสมมาตรสมบูรณ์ แสงหน้าสม่ำเสมอ ไม่มีเงาบนผนัง เม็ดฟิล์ม 35mm จานสีพาสเทลหม่น หนึ่งตัวแบบเท่านั้น ไม่มีคนอื่น ไม่มีข้อความ ไม่มีโลโก้

ขั้นตอนที่ 3. สร้างตัวอย่างเสียง ซึ่งเป็นส่วน multimodal จริง

คลิปเสียงคือสิ่งที่เปลี่ยนสิ่งนี้จากงาน multi-image เป็น multimodal ช่องเสียงของ Wan 2.7 ต้องการตัวอย่างสั้น ประมาณ 1 ถึง 10 วินาที ดังนั้นให้บรรทัดสั้น ใช้ MiniMax Speech 2.6 HD และเลือกเสียงชายต่ำ แบน สบายๆ

Plain
1Good evening. Checking in? Of course. Everyone is.

ขั้นตอนที่ 4. หนึ่งการเรียก, สาม reference, หนึ่งคลิปที่เสร็จสมบูรณ์

ตอนนี้ทั้งแพ็กเข้าไปด้วยกันบน Wan 2.7 Reference-to-Video การตั้งค่า: resolution: 1080P, ratio: 16:9, duration: 10 ซึ่งเป็นเพดานของโมเดลนี้, prompt_extend: false, seed: -1 โหลด images ตามลำดับ ขั้นตอนที่ 1 ก่อนเพื่อให้แมปกับ character1 จากนั้นขั้นตอนที่ 2 เป็น character2 และแนบไฟล์ขั้นตอนที่ 3 ไปที่ audio

Plain
1Symmetrical, dead-centre wide shot of a pastel hotel lobby front desk, dusty-pink walls and a mustard-yellow key rack behind it. character1 is the concierge standing behind the desk; character2 is the traveller standing in front of it, still holding her ragdoll cat. The camera pushes in slowly along a perfect centre axis and never tilts. character1 looks straight down the lens and says flatly: "The cat has a reservation. You do not." character2 blinks once, turns her head slowly towards the cat, then back to the desk. The cat stares directly into the camera without moving. 35mm film grain, even soft lighting, muted pastel palette, no camera shake, no cuts.

พรอมต์เชิงลบ:

Plain
1handheld shake, jump cuts, subtitles, on-screen text, watermark, extra people, deformed hands, face morphing, colour shift, motion blur

ภาพหน้าจออินเทอร์เฟซเครื่องมือสร้างวิดีโอ AI พร้อมอินพุตและเอาต์พุต

Wan 2.7 Reference-to-Video playground บน Atlas Cloud พร้อมภาพอ้างอิงสองภาพและไฟล์เสียงหนึ่งไฟล์ที่โหลด และคลิปที่เสร็จแล้วในแผงเอาต์พุต

Wan 2.7 Reference-to-Video บน Atlas Cloud: ภาพอ้างอิงสองภาพและคลิปเสียงหนึ่งคลิปแนบทางซ้าย เทคที่เสร็จแล้วเล่นทางขวาที่ 1080P และ 16:9 การจับภาพนี้รันที่ระยะเวลาเริ่มต้นของโมเดล ตั้งเป็น 10 สำหรับเวอร์ชันเต็มด้านล่าง

คลิปที่เสร็จสมบูรณ์ ใบหน้าทั้งสองคงที่ ชุดทั้งสองคงที่ และบทพูดถูกส่งในเสียงที่โคลนจากขั้นตอนที่ 3 ดังนั้นอันนี้คุ้มที่จะเล่นพร้อมเสียง

ผู้หญิงถือแมวที่เคาน์เตอร์ต้อนรับโรงแรมกับพนักงานต้อนรับ

ภาพเหมือนสองภาพที่เป็น reference ถัดจากเฟรมจากคลิปที่เสร็จแล้ว แสดงใบหน้าและชุดเดียวกัน

Reference ทางซ้าย เฟรมจากคลิปที่ส่งทางขวา ขอบเครื่องแบบ เบเร่ต์ แว่นตา และแมวรอดชีวิตจากการเดินทาง

รูปแบบต่างๆ ของเวิร์กโฟลว์ Wan 3.0 Multimodal Reference

ขยายเป็น 30 วินาที แพ็ก reference เดียวกันรันบน Seedance 2.5 Reference-to-Video ด้วย duration: 30 ซึ่งจะได้ความยาวที่ Wan 3.0 สัญญาไว้โดยไม่ต้องรอเบต้า รองรับภาพอ้างอิงได้สูงสุด 30 ภาพ 10 วิดีโอ และ 10 คลิปเสียง ดังนั้นแพ็กมีที่ว่างให้เติบโต เขียนอีก 20 วินาทีเป็นจังหวะในพรอมต์ ไม่ใช่เป็นบรรยากาศ ไม่เช่นนั้นโมเดลจะเติม

อินเทอร์เฟซเครื่องมือสร้างวิดีโอ AI แสดงการตั้งค่าอินพุตและความคืบหน้าการสร้าง

Seedance 2.5 Reference-to-Video playground บน Atlas Cloud พร้อมระยะเวลาตั้งเป็น 30 และเทคยาวที่เรนเดอร์แล้ว

Seedance 2.5 Reference-to-Video บน Atlas Cloud พร้อมระยะเวลาตั้งเป็น 30 และภาพอ้างอิงสองภาพเดียวกันแนบ ถูกจับขณะสร้าง หมายเหตุ @image1 และ @image2 ชิปในพรอมต์: นั่นคือวิธีบอก Seedance ว่า reference ใดเล่นส่วนใด ตรวจสอบราคาที่อ้างอิงบนปุ่ม Run ก่อนยืนยัน เพราะมันสะท้อนระยะเวลาที่งานจะส่งจริง

เวอร์ชัน 30 วินาทีของฉากเดียวกัน แพ็ก reference เดียวกัน จังหวะถูกเขียนออกมาทีละช็อต

เพิ่มวิดีโออ้างอิงสำหรับการเคลื่อนไหวเท่านั้น แนบคลิปที่มีจังหวะที่คุณชอบและพูดอย่างชัดเจนในพรอมต์ เช่น "ปฏิบัติตามวิดีโออ้างอิงสำหรับจังหวะการตัดเท่านั้น ไม่สนใจตัวแบบและฉากของมัน" นั่นคือเทคนิคเบื้องหลังตัวอย่างการพลิกการ์ดด้านบน

แก้ไขการลื่นไถลด้วยพรอมต์เชิงลบก่อนแตะพรอมต์เชิงบวก Face morphing, colour shift และ handheld shake เป็นสามสิ่งที่ทำลายช็อตที่ล็อกด้วย reference และโดยปกติแล้วการระงับพวกมันถูกกว่าการอธิบายให้หมด

ทดสอบรูปแบบ Multimodal Reference ฟรี

ถ้าคุณต้องการรูปร่างของสิ่งนี้ก่อนที่จะต้องการพารามิเตอร์ Atlas Cloud เปิดตัว เครื่องมือสร้างสกิตโฆษณา AI ฟรี เมื่อสัปดาห์ที่แล้ว ซึ่งรันเชนเดียวกันโดยไม่ต้องปรับอะไร

คุณเขียนหนึ่งบรรทัดเกี่ยวกับผลิตภัณฑ์และจุดขายของมัน มันเขียนสคริปต์ตลกสองตัวละครให้คุณ แฮงค์ ขัดแย้ง พลิก จากนั้นเรนเดอร์วิดีโอ 15 วินาทีพร้อมบทสนทนาพูดและเอฟเฟกต์เสียงในตัว คุณสามารถแนบรูปผลิตภัณฑ์จริงได้สูงสุดสี่รูปเป็น reference และโฆษณาจะคงรูปร่าง สี ฉลาก และโลโก้ของพวกเขาตั้งแต่สคริปต์ถึงเฟรมสุดท้าย มีสไตล์หกแบบให้เลือก ตั้งแต่ meme ตลกไปจนถึง plot twist และ sitcom ไปจนถึงหรูหราและ hard sell และบทสนทนาจะกลับมาในภาษาที่คุณเขียนคำอธิบาย

นั่นคือเชนสองตัวละครบวกภาพ reference บวกเสียงเดียวกันจากบทช่วยสอน ลบการเขียนพรอมต์และลบเงิน ซึ่งทำให้เป็นวิธีที่เหมาะสมในการค้นหาว่ารูปแบบนี้เหมาะกับผลิตภัณฑ์ของคุณหรือไม่ก่อนที่คุณจะใช้จ่ายอะไรในการปรับแต่ง

สำหรับความเข้าใจว่ากองภาพนิ่ง reference ทำอะไรกับชิ้นงานผลิตภัณฑ์ นี่คือเวอร์ชันของ Wan 3.0 เอง: ห้าภาพเข้า หนึ่งรีลเปิดตัวออก แต่ละภาพยึดจังหวะหนึ่งของการตัดต่อ

แอนิเมชั่นกองการ์ดสีขาวและมิ้นต์ลอย

ภาพนิ่ง reference ห้าภาพขยายเป็นรีลเปิดตัวผลิตภัณฑ์สไตล์ Material Design_ภาพอ้างอิงห้าภาพขับเคลื่อนฟิล์มผลิตภัณฑ์เก้าวินาที แต่ละภาพยึดจังหวะและส่งต่อให้ภาพถัดไป ที่มา: คู่มือผู้สร้าง Wan 3.0 อย่างเป็นทางการของ Alibaba_

ค่าใช้จ่ายของคลิป Wan 3.0 Multimodal Reference

ขั้นตอนโมเดลราคาต่อหน่วยปริมาณราคา
1 และ 2, สองภาพ referenceGPT Image 2$0.009 ต่อภาพ2$0.02
3, เสียง referenceMiniMax Speech 2.6 HD$0.08 ต่อ 1K ตัวอักษร49 ตัวอักษร$0.00
4, เทค 10 วินาทีที่ 1080PWan 2.7 Reference-to-Video$0.15 ต่อวินาทีที่ 1080P10 วินาที$1.50
รวมบทช่วยสอนประมาณ $1.52
รูปแบบ, 30 วินาทีSeedance 2.5 Reference-to-Video$0.134 ต่อวินาทีที่ 480P30 วินาทีประมาณ $4.02
เส้นทางฟรีเครื่องมือสร้างสกิตโฆษณา AI ฟรีฟรี1 คลิป, 15 วินาที$0

นั่นคืออัตราของแพลตฟอร์มเอง ตรวจสอบในเดือนสิงหาคม 2026 และคิดค่าบริการตามการใช้งานจริง สองสิ่งที่ทำให้ยอดรวมเปลี่ยนแปลงมากกว่าที่คนคาด ความละเอียดเป็นอันดับแรก: $0.10 ต่อวินาทีในตารางเปรียบเทียบคืออัตราพื้นฐานของ Wan 2.7 และ 1080P คิดที่ $0.15 ซึ่งเป็นที่มาของ $1.50 ด้านบน อันที่สองคือ Seedance กำหนดราคาตามจำนวนพิกเซล ดังนั้น $0.134 ต่อวินาทีที่ระบุคือตัวเลขที่ 480P และเทค 720P มีค่าใช้จ่ายมากกว่าการคูณตรงๆ สำหรับการอ้างอิง อัตราเบต้า Wan 3.0 ที่รายงาน $0.20 ต่อวินาทีที่ 1080p จะทำให้เทค 30 วินาทีเต็มอยู่ที่ประมาณ $6 ซึ่งมากกว่าเส้นทาง Seedance ที่ 480P ในวันนี้

หมายเหตุเกี่ยวกับการใช้สิ่งนี้ Wan 3.0 เป็นเบต้าและข้อกำหนดสามารถเปลี่ยนแปลงได้ ดังนั้นอ่านอีกครั้งก่อนสร้างไปป์ไลน์บนมัน ถ้าภาพ reference ของคุณเป็นคนจริง ให้ขออนุญาตก่อน เพราะ reference-to-video คือความสามารถที่ทำให้เรื่องนั้นสำคัญ คลิปตัวอย่างในบทความนี้เป็นผลลัพธ์ที่ Alibaba สร้างขึ้นเองจากคู่มือผู้สร้างสาธารณะ ทำซ้ำที่นี่เพื่อการวิจารณ์

คำถามที่พบบ่อย

Multimodal reference ของ Wan 3.0 รับ reference ได้กี่รายการจริงๆ?

สูงสุด 20 ทรัพย์สินในการเรียกครั้งเดียว จากภาพ วิดีโอ เสียง เอกสาร และหน้าเว็บ ขีดจำกัดในทางปฏิบัติต่ำกว่าขีดจำกัดทางเทคนิค กำหนดให้แต่ละทรัพย์สินมีงานเดียวเท่านั้น หนึ่งตัวแบบต่อภาพ แล้วคุณจะใช้ทรัพย์สินน้อยกว่า 20 รายการสำหรับฉากส่วนใหญ่

Wan 3.0 สามารถเปลี่ยน PDF หรือหน้าเว็บเป็นวิดีโอได้จริงหรือ?

ได้ นั่นคือส่วนที่พิเศษอย่างแท้จริง นอกจากข้อความ ภาพ เสียง และวิดีโอแล้ว มันยังยอมรับไฟล์เอกสารและ URL สด โดยมีรายงานเกี่ยวกับเบต้าที่แสดงรายการ .doc, .xls, .ppt, .pdf และ .txt ไม่มีโมเดล reference-to-video อื่นในตารางเปรียบเทียบที่ยอมรับเอกสารเลย

Wan 3.0 เป็นโอเพนซอร์สหรือไม่ ฉันสามารถรันใน ComfyUI ได้หรือไม่?

ไม่ และตอนนี้ยังไม่ได้ Wan 3.0 เป็นเบต้าปิดที่ทำงานบนคลาวด์ของ Alibaba เอง Wan รุ่นก่อนหน้าถูกปล่อยอย่างเปิดเผย ซึ่งเป็นสาเหตุที่ความคาดหวังนั้นมีอยู่ แต่ Alibaba ยังไม่ได้ยืนยันน้ำหนักสำหรับ 3.0 หน้าที่อ้างว่ามี Wan 3.0 รุ่น 1.3B หรือ 14B Apache 2.0 ไม่ได้รับการสนับสนุนจากสิ่งที่เป็นทางการ

Wan 3.0 พร้อมใช้งานผ่าน API ของบุคคลที่สามหรือยัง?

ยังไม่ รวมถึง Atlas Cloud สิ่งที่ใกล้เคียงที่สุดที่คุณเรียกใช้ได้ในวันนี้คือ Wan 2.7 Reference-to-Video ซึ่งรูปร่างอินพุตของมันตรงกับ omni-reference เกือบทั้งหมด ยกเว้นรูปแบบเอกสารและหน้าเว็บ หรือ Seedance 2.5 Reference-to-Video ถ้าคุณต้องการ 30 วินาทีเต็ม

วิธีที่ถูกที่สุดในการทดสอบวิดีโอสองตัวละครที่ล็อกด้วย reference คืออะไร?

เครื่องมือสร้างสกิตโฆษณา AI ฟรีที่เชื่อมโยงด้านบน รูป reference สี่รูปเข้า ได้คลิปสองตัวละครพูดได้ 15 วินาทีออก ไม่มีพารามิเตอร์และไม่มีค่าใช้จ่าย ถ้ามันคงผลิตภัณฑ์และรูปแบบของคุณได้ ก็ไปปรับแต่งเชนที่เสียเงิน

ทำไมตัวละครของฉันยังคงลื่นไถลแม้จะมีภาพ reference?

สามสาเหตุ ตามความถี่ หนึ่ง reference กำลังทำงานสองอย่าง ดังนั้นมันถูกขอให้แก้ไขทั้งใบหน้าและสถานที่ ภาพ reference มีมากกว่าหนึ่งคนหรือพื้นหลังที่ยุ่งเหยิง ดังนั้นโมเดลไม่รู้ว่าจะล็อกส่วนไหน หรือการลื่นไถลเป็นสิ่งตกค้างจากการเรนเดอร์มากกว่าความล้มเหลวของ reference ซึ่งในกรณีนี้ให้ใส่ face morphing, colour shift ในพรอมต์เชิงลบก่อนที่จะเขียนอะไรใหม่

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด