Seedance 2.5 ใช้งานได้แล้ววันนี้ — ที่แรกบน Atlas Cloud

Wan 3.0 Multi-Shot Consistency: ฉันนับทุกคัตในคลิปทางการ 110 คลิป

Wan 3.0 Multi-Shot Consistency: ฉันนับครบ 110 คลิป

Wan 3.0 Multi-Shot Consistency: ผมนับทุกคัทใน 110 คลิปอย่างเป็นทางการ

คุณเขียนสคริปต์ 4 ช็อต ช็อต 1 ลงตัวสมบูรณ์: หมวกฟาง, สร้อยลูกปัดสีดำ, ชุดเดรสผ้าลินินสีขาว, แสงถูกต้องทุกประการ ช็อต 2 มาถึง และมันเป็นผู้หญิงคนละคนในหมวกคนละใบ

ช่องว่างนั้นคือเหตุผลทั้งหมดที่ผู้คนจ้องมอง Wan 3.0 multi-shot consistency หรือคำสัญญาของพรอมต์เดียว 6 ช็อต 30 วินาที ตัวละครเดียวกันตลอดทั้งเรื่อง

ดังนั้นผมจึงหยุดอ่านสเปกชีต ผมดาวน์โหลดไฟล์ตัวอย่างทั้งหมด 110 ไฟล์ที่ Alibaba เผยแพร่พร้อมกับคู่มือผู้สร้าง Wan 3.0 อย่างเป็นทางการ ใช้ ffmpeg กับทุกไฟล์ แยกวิเคราะห์พรอมต์คู่ทั้งหมด 64 ชุด จากนั้นทำในสิ่งที่ไม่มีใครในผลการค้นหาทำ: ผมนับคัทจริงในวิดีโอที่ส่งออก และเปรียบเทียบกับจำนวนช็อตที่พรอมต์แต่ละอันขอไว้

ข้อค้นพบสามข้อขัดแย้งกับสิ่งที่คุณจะอ่านในที่อื่น

ห้องปรับสีภาพยนตร์ที่ผนังจอภาพแสดงตัวละครหมวกฟางตัวเดียวกันใน 6 ช็อตที่แตกต่างกัน จุดอ้างอิงสำหรับ Wan 3.0 multi-shot consistency

ผนังอ้างอิงของนักปรับสีคือแบบจำลองทางความคิดที่ซื่อสัตย์สำหรับความสม่ำเสมอหลายช็อต: ตัวตนเดียว 6 เฟรม ตรวจสอบเคียงข้างกัน สร้างด้วย openai/gpt-image-2

ประเด็นสำคัญ

  • 6 ช็อตมีจริงแต่ไม่รับประกัน: 3 ในพรอมต์หลายช็อตของ Alibaba เองตรงตามจำนวนที่ประกาศทุกประการ 2 ช็อตให้ผลน้อยกว่า
  • กรณีที่แย่ที่สุดขอ 4 ช็อต แต่สร้างได้แค่ 2
  • ไม่มี 4K เลย ไม่มีไฟล์ทางการ 110 ไฟล์ใดเกิน 1080p และมีเพียง 4 ไฟล์ที่ 1920x1080 พอดี
  • อุปกรณ์ประกอบฉากและกล้องเปลี่ยนก่อนใบหน้า ดูที่หมวก ไม่ใช่ดวงตา
  • ยังไม่มี Wan 3.0 API สาธารณะนอกแพลตฟอร์มของ Alibaba เอง ดังนั้นบทช่วยสอนด้านล่างจึงสร้างขึ้นใหม่บนโมเดลที่คุณเรียกใช้ได้ในวันนี้

นี่คือผลลัพธ์ที่ดีที่สุด จากคู่มือของ Alibaba เอง ประกาศ 6 ช็อตในพรอมต์ ส่งมอบ 6 ช็อต ตัวละครสองตัวเดิม ชุดเดิม ฝนเดิม:

ลำดับอนิเมะ 6 ช็อตบนชานชาลารถไฟฝนตก เด็กผู้หญิงคนเดิมกับร่มใสและเด็กผู้ชายกับกระเป๋าเป้สีกากีคงที่ตลอดทุกคัท

ตัวอย่าง Wan 3.0 เบต้าอย่างเป็นทางการของ Alibaba (คลิปคู่มือ v013, 1280x720, 20.05 วินาที) พรอมต์ระบุหมายเลขช็อต 1 ถึง 6; ffmpeg พบฮาร์ดคัท 5 ครั้งพอดี ดังนั้นทั้ง 6 ช็อตจึงลงตัว ไม่ได้สร้างโดย Atlas Cloud

Wan 3.0 Multi-Shot Consistency จริงๆ แล้วคืออะไร

แบบสั้น: มันคือคำสัญญาสามข้อที่สวมชื่อเดียว และ Alibaba ระบุเจาะจงผิดปกติว่าสามข้อนั้นคืออะไร

ในบทความเปิดตัว Alibaba แบ่งความสม่ำเสมอออกเป็นตัวละคร ("ลักษณะใบหน้า ทรงผมและสีผม รูปร่าง เสื้อผ้า และเครื่องประดับ") อุปกรณ์ประกอบฉาก ("ลักษณะหลายมุม โครงสร้างฮาร์ดแวร์ โลโก้ และรายละเอียดวัสดุ") และพื้นที่ ("การจัดวางตัวละครและมุมกล้อง") (Alibaba Cloud, 2026) การแบ่งสามชั้นนั้นคือเกณฑ์การให้คะแนนสำหรับทุกด้านล่าง หน้าเดียวกัน สร้อยคอผิด ถือว่าล้มเหลว

โมเดลสร้างวิดีโอได้สูงสุด 30 วินาทีในงานเดียว ที่ 480P, 720P หรือ 1080P (Alibaba Cloud, 2026)

ตอนนี้ส่วนที่ผลการค้นหาเข้าใจผิด

ข้ออ้างทั่วไปในผลการค้นหาสิ่งที่เนื้อหาจากผู้พัฒนาแสดงจริง
"สร้าง 4K ดั้งเดิม"โพสต์ทางการระบุเฉพาะ 480P / 720P / 1080P เท่านั้น ในไฟล์ตัวอย่างทางการ 110 ไฟล์ ไม่มีอะไรเกิน 1080p มีเพียง 4 ไฟล์ที่ 1920x1080 พอดี ผลลัพธ์แนวตั้งทั่วไป "1080p" คือ 1920x1072
"สูงสุด 6 ช็อตอิสระต่อการสร้าง"ไม่มีสเปกจำนวนช็อตปรากฏในโพสต์เปิดตัวของ Alibaba เอง จากการทดสอบพบว่าใช้ได้: ใน 8 พรอมต์หลายช็อตที่ระบุชัดเจนในคู่มือ สูงสุดที่ประกาศคือ 6 และสองในนั้นส่งมอบ 6 ช็อต
"สูงสุด 12 ภาพอ้างอิง"รายงานการทดสอบจริงระบุสูงสุด 10 ภาพ บวก 5 คลิปวิดีโอ บวก 5 คลิปเสียง (Curious Refuge, 2026) โพสต์ของ Alibaba ไม่ได้ให้ตัวเลขใดๆ
"โอเพ่นเวท, Apache-2.0"Wan รุ่นก่อนหน้ามีโอเพ่นเวท; Wan 3.0 มาเป็นบริการบนแพลตฟอร์ม และยังไม่มีเวทใดปรากฏ (Curious Refuge, 2026)
"API ออกแล้ว"ทำงานบน Alibaba Cloud Model Studio แพลตฟอร์มอนุมานของบุคคลที่สามยังไม่มี

และนี่คือตารางที่ใช้เวลาสร้างนานที่สุด ทุกตัวเลขเป็นของผม จากการตรวจจับฉากด้วย ffmpeg ในไฟล์ที่ส่งออก เทียบกับจำนวนช็อตที่เขียนในพรอมต์คู่:

ตัวอย่างทางการพรอมต์ระบุฮาร์ดคัทที่พบช็อตที่ส่งมอบคำตัดสิน
v013 ชานชาลาฝนตก อนิเมะ6 ช็อต56ตรงเป๊ะ
v055 ไดอารี่โกลเด้นรีทรีฟเวอร์6 ช็อต, 30.0 วินาที56ตรงเป๊ะ
v021 ร้านราเมนกับลูกแมว4 ช็อต34ตรงเป๊ะ
v008 ทะเลสาบป่า 3D4 ช็อต23ขาด 1
v085 หญิงหมวกฟาง4 ช็อต12ขาดครึ่ง
v041 โถงทางเดินสู่ตรอกเวทมนตร์3 ส่วน, "ไม่มีฮาร์ดคัท"01 เทคต่อเนื่องตรงตามที่ขอ
v045, v084, v1023 / 5 / หลายหัวข้อมากเกินไปจะระบุนับไม่ได้คัตเร็วและภาพเหมือนหมึกสั่นไหวทำให้ตรวจจับไม่ได้

อ่านแถวกลางอีกครั้ง สามพรอมต์ตรงตามจำนวนเป๊ะ สองพรอมต์ไม่ตรง จำนวนช็อตที่คุณพิมพ์คือคำขอ ไม่ใช่สัญญา

ทำไม Wan 3.0 Multi-Shot Consistency ถึงพัง: 4 โหมดความล้มเหลว

คำตัดสินก่อน: ไม่ค่อยพังที่ใบหน้า แต่มันพังที่วัตถุและกล้อง และพังหนักที่สุดเมื่อคุณเปลี่ยนหลายอย่างพร้อมกัน

นี่คือคลิปที่สอนผมมากที่สุด เพราะมันคือตัวที่แย่ที่สุดในการจัดแสดงของ Alibaba เอง

GtZy2TUK4ak

ตัวอย่าง Wan 3.0 เบต้าอย่างเป็นทางการของ Alibaba (คลิปคู่มือ v085, 1240x742, 30.08 วินาที) พรอมต์กำหนด 4 ช็อตพร้อมเวลา ffmpeg พบฮาร์ดคัทจริง 1 ครั้ง ที่ 9.3 วินาที ช็อต 3 และ 4 รวมกันเป็นเทคเดียวที่คงอยู่แล้วจางเป็นสีดำ ไม่ได้สร้างโดย Atlas Cloud

โหมดความล้มเหลว 1: อุปกรณ์ประกอบฉากเปลี่ยนก่อนใบหน้า ในคลิปนั้น ดูที่เทคเปิดเพียงอย่างเดียวก่อนที่จะเกิดคัทใดๆ ที่ 0.6 วินาที หมวกปีกกว้างมีแถบสีดำบาง และจี้เป็นหินสีน้ำเงินเหลี่ยมเพชร ที่ 9.2 วินาที แถบกลายเป็นริบบิ้นสีดำกว้าง และจี้กลายเป็นหยดสีดำมันวาวเรียบ ใบหน้าของเธอคงที่ตลอดเวลา เครื่องประดับไม่คงที่

สองเฟรมจากเทคต่อเนื่องเก้าวินาทีเดียวกัน วางเคียงข้างกัน แสดงให้เห็นแถบหมวกกว้างขึ้นและจี้สร้อยคอเปลี่ยนรูปร่างและสี

ทั้งสองเฟรมมาจากเทคเดียวกันของตัวอย่าง v085 อย่างเป็นทางการ ห่างกัน 8.6 วินาที ไม่มีคัทระหว่างกัน แถบหมวกและจี้เปลี่ยนไปทั้งคู่ นี่คือชั้นอุปกรณ์ประกอบฉากล้มเหลวในขณะที่ชั้นตัวละครยังคงอยู่

นั่นคือสาเหตุที่การทดสอบการยอมรับที่ใช้ได้จริงคือรายการตรวจสอบอุปกรณ์ประกอบฉาก ไม่ใช่การตรวจสอบอารมณ์ สำหรับตัวละครนี้มีสามรายการ: รูปทรงหมวกและแถบ สร้อยลูกปัดและจี้ คอเสื้อเดรส

โหมดความล้มเหลว 2: ฉากหลายหัวข้อคงที่แยกกัน แต่เลอะเมื่อสัมผัสกัน ตัวละครแต่ละตัวยังคงจำได้เมื่ออยู่คนเดียว วางพวกมันในเฟรมเดียวกัน มีปฏิสัมพันธ์กัน และตัวตนจะรั่วไหล การทดสอบอิสระพบสิ่งเดียวกัน: "ความสม่ำเสมอของตัวละครเริ่มพัง และการประกอบภาพบางครั้งดูเหมือนเอฟเฟกต์กรีนสกรีนที่ไม่ดีมากกว่าสภาพแวดล้อมที่สร้างขึ้นโดยธรรมชาติ" โดยที่การขยับปากถูกระบุว่าเป็นจุดอ่อนที่ใหญ่ที่สุด (Curious Refuge, 2026)

โหมดความล้มเหลว 3: คุณเปลี่ยนตัวแปรสี่ตัวในบรรทัดเดียว สถานที่ใหม่ บวกมุมกล้องใหม่ บวกแสงใหม่ บวกสถานะเสื้อผ้าใหม่ เป็นวิธีที่เชื่อถือได้ในการสูญเสียตัวตน พรอมต์ของคู่มือต่อสู้กับสิ่งนี้โดยระบุชุดเต็มอีกครั้งในทุกส่วน ในพรอมต์คู่ 64 ชุด มี 9 ชุดที่ระบุชัดเจนว่า "คงที่", 5 ชุดกำหนดตำแหน่งกล้อง และ 4 ชุดกำหนดให้ตัวละครเหมือนเดิม

โหมดความล้มเหลว 4: 30 วินาทีในงานเดียวไม่ใช่ 30 วินาทีของช็อตเดียว สิ่งเหล่านี้เป็นผลิตภัณฑ์ที่แตกต่างกัน งานหลายช็อต 30 วินาทีจะตัดระหว่างเฟรม ถ้าสิ่งที่คุณต้องการคือเทคต่อเนื่องไม่ขาดตอน การต่อเนื่องลูกโซ่จะลดคุณภาพลง: ข้อผิดพลาดของตัวตนจะทวีคูณในการส่งต่อแต่ละครั้ง ดังนั้นเทคเดียวที่สะอาดจึงสั้นโดยธรรมชาติ

คู่มือมีพรอมต์เดียวที่ทำให้ไร้รอยต่อได้อย่างถูกต้อง และคุ้มค่าที่จะลอกโครงสร้างประโยค:

สามส่วนพรอมต์ที่สร้างเป็นเทคต่อเนื่องไม่ขาดตอน ตั้งแต่โถงทางเดินอพาร์ทเมนต์ผ่านประตูสู่ตรอกโกธิคที่มีแสงตะเกียง

ตัวอย่าง Wan 3.0 เบต้าอย่างเป็นทางการของ Alibaba (คลิปคู่มือ v041, 720x1280, 15.04 วินาที) สามส่วนพรอมต์ ffmpeg พบฮาร์ดคัทเป็นศูนย์ ซึ่งตรงตามที่พรอมต์ต้องการทุกประการ ไม่ได้สร้างโดย Atlas Cloud

บรรทัดส่งต่อของมัน แปลแล้ว เป็นสิ่งที่ใช้ซ้ำได้มากที่สุดในคู่มือทั้งหมด: ดำเนินต่อไปอย่างราบรื่นจากเฟรมสุดท้ายของส่วนก่อนหน้า; ตัวละคร เสื้อผ้า สถานที่ และตำแหน่งกล้องยังคงเหมือนเดิมทุกประการ; ไม่มีฮาร์ดคัทและไม่มีการเปลี่ยนฉากกะทันหัน มีเพียงพรอมต์เดียวใน 64 ที่ใช้มัน ขโมยไปใช้ได้เลย

ขั้นตอนการทำงาน Multi-Shot Consistency ที่คุณใช้ได้ในวันนี้

คำถามคือ: คุณจะรันสิ่งนี้ที่ไหนจริงๆ?

ตอนนี้ Wan 3.0 อยู่บน Model Studio ของ Alibaba เอง ไม่มีแพลตฟอร์มอนุมานของบุคคลที่สามใดโฮสต์มัน บน Atlas Cloud มันปรากฏเป็นรายการ "เร็วๆ นี้" เท่านั้น โดยไม่มีเอนด์พอยต์ที่ใช้งานจริง ซึ่งเป็นสถานะที่ซื่อสัตย์ และควรพูดอย่างตรงไปตรงมามากกว่าแสร้งทำเป็นอย่างอื่น

ดังนั้นคุณมีสองทางเลือก: รอ หรือหยุดขอให้พรอมต์เดียวทำหกสิ่ง

ตัวเลือกที่สองดีกว่าอยู่แล้ว และการนับคัทของผมคือข้อโต้แย้งสำหรับมัน งานหลายช็อตเดียวให้จำนวนช็อตที่พลาดไปครึ่งหนึ่งในการจัดแสดงของ Alibaba เอง การแยกงานจะนำการควบคุมนั้นกลับมาอยู่ในมือคุณ:

  1. ล็อคลุคครั้งเดียว เป็นภาพนิ่ง
  2. คัดลอกตัวตนนั้นไปยังคีย์เฟรมต่อช็อต เปลี่ยนทีละหนึ่งตัวแปรเท่านั้น
  3. สร้างแอนิเมชันแต่ละช็อตแยกกัน โดยล็อค reference
  4. ต่อในเครื่อง

ตั้งค่าช้ากว่า แต่คาดเดาได้ดีกว่าอย่างมาก และทุกโมเดลในห่วงโซ่สามารถเรียกใช้ได้ในวันนี้

ขั้นตอนโมเดลบทบาทในห่วงโซ่ราคาที่ระบุ
1bytedance/seedream-v5.0-pro/text-to-imageล็อคลุคตัวละคร$0.045 / ภาพ
2google/nano-banana-2/editคัดลอกตัวตนไปยังคีย์เฟรมของแต่ละช็อต$0.08 / ภาพ
3alibaba/wan-2.7/reference-to-videoสร้างแอนิเมชันแต่ละช็อตโดยล็อค reference$0.10 / วินาที
ทางเลือกalibaba/wan-2.7/text-to-videoหนึ่งพรอมต์ หลายช็อต (ควบคุมได้น้อยที่สุด)$0.10 / วินาที
แก้ไขalibaba/wan-2.7/video-editซ่อมอุปกรณ์ประกอบฉากที่ผิดหนึ่งชิ้นโดยไม่ต้องสร้างใหม่$0.10 / วินาที

น่ารู้สำหรับคำถาม "โมเดลที่ดีที่สุดสำหรับ multi-shot consistency": reference-to-video เป็นหมวดหมู่ทั้งหมดแล้ว bytedance/seedance-2.0-fast/reference-to-video ราคา $0.072/วินาที (ลด 20% จาก $0.09 ณ สิงหาคม 2026), kwaivgi/kling-video-o3-pro/reference-to-video $0.095/วินาที (ลด 15% จาก $0.112), minimax/h3/reference-to-video $0.10/วินาที และ google/veo3.1/reference-to-video $0.20/วินาที ราคาทั้งหมดตรวจสอบจากแคตตาล็อกสดเมื่อวันที่ 21 สิงหาคม 2026

คำเตือนหนึ่งก่อนขั้นตอน: ราคาที่ระบุคือราคาพื้น ไม่ใช่ราคาจริง ความละเอียดและระยะเวลาจะเปลี่ยนตัวเลขจริง ดังนั้นให้อ่านปุ่ม Run ก่อนตัดสินใจ

วิธีสร้าง Wan 3.0-Style Multi-Shot Consistency ทีละขั้นตอน

เราจะสร้างแผ่นบีทเดียวกับที่โมเดลของ Alibaba เองทำพลาด: หญิงหมวกฟาง สี่ช็อต จากสวนไปรถยนต์ สคริปต์เดียวกัน ควบคุมต่อช็อต และคราวนี้คุณจะได้สี่ช็อตเพราะคุณสร้างสี่ช็อต

มาเริ่มกันเลย

ขั้นตอนที่ 1: ล็อคลุค ภาพหนึ่งภาพจะกลายเป็นจุดยึดตัวตนสำหรับทุกอย่าง downstream สร้างบน Seedream v5.0 Pro, 16:9, ความละเอียดสูงสุดที่หน้านี้มี ตั้งชื่ออุปกรณ์ประกอบฉากสามจุดตรวจสอบอย่างชัดเจน เพราะสิ่งเหล่านั้นคือสิ่งที่เปลี่ยน

plaintext
135mm film still, vintage sunlit rose garden. An elegant young woman wearing a
2natural straw boater hat with a black band, a black beaded necklace with a single
3teardrop pendant, and a white sleeveless linen dress. She stands before a wall of
4blooming pink and cream roses, one hand lightly touching the brim of her hat,
5gentle and thoughtful gaze just off camera. Soft warm natural light, dappled sun
6flare, shallow depth of field, fine film grain, medium close-up.

Seedream v5.0 Pro playground บน Atlas Cloud พร้อมพรอมต์หมวกฟางที่ป้อนและคีย์เฟรมตัวละครที่เสร็จแล้วแสดงในแผงผลลัพธ์

ขั้นตอนที่ 1 เสร็จสมบูรณ์: จุดยึดตัวตนสำหรับลำดับสี่ช็อตทั้งหมด

ขั้นตอนที่ 2: คัดลอกตัวตนไปยังช็อต 2 ถึง 4 หนึ่งคีย์เฟรมต่อช็อต หนึ่งรันต่อครั้ง ใช้ Nano Banana 2 Edit โดยใช้ผลลัพธ์จากขั้นตอนที่ 1 เป็น reference ระเบียบวินัยที่สำคัญ: ระบุชุดเต็มทุกครั้ง แล้วเปลี่ยนเพียงสิ่งเดียว

ช็อต 2, การเปลี่ยนอารมณ์:

plaintext
1Keep the exact same woman from the reference image: identical face, identical
2natural straw boater hat with black band, identical black beaded necklace with a
3teardrop pendant, identical white sleeveless linen dress. New shot: cinematic
4close-up, she slowly lifts the straw hat off her head and lowers her chin, a faint
5wistful expression. Same rose garden background. Strictly preserve the same
6lighting, skin tone, film grain and colour grade as the reference.

ช็อต 3, การตัดไปที่รถ:

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant, identical white sleeveless linen dress,
3the straw boater hat now resting on her lap. New shot: back seat of a moving car,
4side profile, her hand propped against the door, gazing out a rain-beaded window,
5blurred green foliage rushing past. Overcast light with a warm interior fill,
6shallow depth of field, elegant melancholy. Strictly preserve the same face, the
7same colour grade and the same 35mm film grain as the reference.

ช็อต 4, มองครั้งสุดท้าย:

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant. New shot: extreme facial close-up beside
3the car window, eyes slowly closing, a calm and released expression. Raindrops
4slide down the glass in front of her, focus shifting onto the droplets, background
5falling into bokeh. Wong Kar-wai style cinematic mood, fine film grain. Strictly
6preserve the same face, the same lighting and the same colour grade as the
7reference.

Nano Banana 2 Edit playground บน Atlas Cloud โดยมีคีย์เฟรมขั้นตอนที่ 1 โหลดเป็น reference และคีย์เฟรมช็อต 2 ที่สร้างขึ้น ตัวตนและชุดยังคงที่

ขั้นตอนที่ 2 เสร็จสมบูรณ์: คีย์เฟรมช็อต 2 ผู้หญิงคนเดิม ตอนนี้หมวกอยู่ในมือเธอ

ขั้นตอนที่ 3: สร้างแอนิเมชันช็อต 1 โดยล็อค reference ตอนนี้แต่ละช็อตกลายเป็นวิดีโออิสระบน Wan 2.7 reference-to-video การตั้งค่า: 720P, 5 วินาที และวางคีย์เฟรมขั้นตอนที่ 1 ลงในช่อง Images ตรวจสอบราคาในปุ่ม Run ก่อนกด

plaintext
1Shot 1 of 4. Reference image 1 defines the character: keep the same face, the same
2natural straw boater hat with black band, the same black beaded necklace with a
3teardrop pendant and the same white sleeveless linen dress identical for the entire
4clip. 35mm film look, vintage sunlit rose garden. The woman lightly touches the
5brim of her hat as a soft breeze lifts strands of her hair; the camera pushes in
6very slowly. Warm natural light, dappled sun flare, shallow depth of field, fine
7film grain. The camera position stays stable. No hard cut and no scene change.

Wan 2.7 reference-to-video playground บน Atlas Cloud โดยมีคีย์เฟรมในช่อง Images และคลิป 5 วินาทีที่เสร็จแล้วกำลังเล่นในแผงผลลัพธ์

ขั้นตอนที่ 3 เสร็จสมบูรณ์: คลิปที่ล็อค reference แสดงในแผงผลลัพธ์

และนี่คือสิ่งที่ออกมา:

คลิป 5 วินาทีที่ล็อค reference ของหญิงหมวกฟางในสวนกุหลาบ แถบหมวกและสร้อยคอคงที่ตลอด

รันของเราเองบน Atlas Cloud ไม่ใช่ตัวอย่างของ Alibaba แสดงเป็น GIF เงียบ; ไฟล์ที่ส่งมอบมีแทร็กเสียง

ขั้นตอนที่ 4: ต่อช็อต 2 ถึง 4 เป็นลูกโซ่ จากนั้นต่อ ทำซ้ำขั้นตอนที่ 3 สำหรับคีย์เฟรมที่เหลือแต่ละอัน และวางประโยคส่งต่อจากคู่มือที่ด้านบนของพรอมต์ติดตามทุกครั้ง:

plaintext
1Continue seamlessly from the last frame of the previous segment. The character,
2the wardrobe, the location and the camera position stay completely identical.
3No hard cut and no abrupt scene transition.

จากนั้นต่อในเครื่องด้วย ffmpeg และรันการตรวจสอบการยอมรับสามจุด: รูปทรงหมวกและแถบ สร้อยลูกปัดและจี้ และว่าลำดับเฟรมระหว่างช็อตสมเหตุสมผลหรือไม่ ถ้าอุปกรณ์ประกอบฉากเพียงชิ้นเดียวผิดในช็อตเดียว อย่าสร้างช็อตใหม่ ส่งมันผ่าน wan-2.7/video-edit และเปลี่ยนเฉพาะสิ่งนั้น โดยยืมวลีจากคู่มือ: คงการกระทำ เสื้อผ้า และส่วนที่เหลือของเฟรมไว้ไม่เปลี่ยนแปลง

รูปแบบต่างๆ: ฉากหลายหัวข้อและการล็อคสไตล์

สามรูปแบบจากคู่มือที่คุ้มค่าที่จะขโมย

การ์ดตัวละครสำหรับช็อตหลายหัวข้อ เมื่อคนสองคนขึ้นไปอยู่ในเฟรมเดียวกัน พรอมต์ทางการจะกำหนดการ์ดตัวละครที่มีตัวอักษร และประกาศชุดเต็มของแต่ละคนอีกครั้งในทุกส่วน ยาวเยอะ ดูไม่สวย แต่ใช้ได้ดีกว่าสรรพนาม

การประกาศสไตล์ทั่วโลกสำหรับงานที่มีสไตล์ ภาพหมึก, เซลแอนิเมชัน และสไตล์หนักอื่นๆ ต้องปักสไตล์ครั้งเดียวสำหรับทั้งชิ้น จากนั้นมีแผ่นบีทที่ระบุเวลาอยู่ข้างใต้

ลำดับศิลปะการต่อสู้แบบภาพหมึกกับนักดาบในป่าไผ่ สไตล์ถูกล็อคข้ามการต่อสู้ห้าจังหวะที่ระบุเวลา

ตัวอย่าง Wan 3.0 เบต้าอย่างเป็นทางการของ Alibaba (คลิปคู่มือ v084, 20.05 วินาที, ครอบตัด) ห้าจังหวะที่ระบุเวลาภายใต้การประกาศสไตล์ภาพหมึกทั่วโลกหนึ่งครั้ง ลายเส้นที่สั่นไหวคือสาเหตุที่การตรวจจับคัทอัตโนมัตินับคลิปนี้ไม่ได้ ไม่ได้สร้างโดย Atlas Cloud

แก้ไข อย่าสร้างใหม่ การผ่าน video-edit บนอุปกรณ์ประกอบฉากที่ผิดหนึ่งชิ้นถูกกว่าการเรนเดอร์ใหม่ และไม่สามารถทำลายช็อตที่ถูกต้องแล้วได้

ลำดับสี่ช็อตราคาเท่าไหร่

ตัวเลขที่เป็นรูปธรรมสำหรับลำดับที่สร้างด้านบน ในอัตราที่ระบุ:

  • จุดยึดตัวตน 1 จุดบน Seedream v5.0 Pro: $0.045
  • คีย์เฟรมช็อต 3 คีย์บน Nano Banana 2 Edit: 3 x $0.08 = $0.24
  • คลิป 4 คลิป ที่ 5 วินาที, 720P, บน Wan 2.7 reference-to-video: 20 วินาที x $0.10 = $2.00
  • รวม: ประมาณ $2.29 สำหรับลำดับ 20 วินาที สี่ช็อต ที่ล็อคตัวตน

ขยายเป็นชิ้น 6 ช็อต 30 วินาที และบรรทัดวิดีโอจะกลายเป็น $3.00 รวมประมาณ $3.44

ข้อควรระวังที่ซื่อสัตย์สองข้อ ประการแรก ราคาที่ระบุคือราคาพื้น: ระดับความละเอียดและระยะเวลาเปลี่ยนค่าใช้จ่ายจริง และราคา Run ของ playground เท่านั้นที่เป็นตัวเลขที่ผูกมัด ซึ่งเป็นสาเหตุที่ภาพหน้าจอด้านบนสำคัญกว่ารายการนี้ ประการที่สอง บน Wan 3.0 เอง Alibaba กำหนดราคาการสร้างวิดีโอ Model Studio ต่อวินาทีตามระดับความละเอียด แต่ผมไม่สามารถยืนยันอัตราต่อวินาทีที่แน่นอนของ Wan 3.0 จากหน้าเว็บทางการได้ ดังนั้นผมจึงไม่อ้างตัวเลขที่ผมไม่สามารถตรวจสอบได้

น่าสังเกตว่าคุณกำลังซื้ออะไรด้วยแนวทางแยกงาน: ไม่ใช่ราคาที่ถูกกว่า แต่เป็นจำนวนช็อตที่ตรงกับสคริปต์ของคุณ จากหลักฐานในการจัดแสดงของ Alibaba เอง นั่นคือสิ่งที่งาน 30 วินาทีเดียวยังไม่สามารถสัญญากับคุณได้ และมันคือคำตอบเชิงปฏิบัติสำหรับ Wan 3.0 multi-shot consistency จนกว่า API จะเปิด

คำถามที่พบบ่อย

Wan 3.0 สามารถรักษาความสม่ำเสมอได้กี่ช็อตในการสร้างครั้งเดียว?

หกช็อต จากหลักฐานปัจจุบัน พร้อมข้อแม้ โพสต์เปิดตัวของ Alibaba ไม่ได้เผยแพร่สเปกจำนวนช็อต ใน 8 พรอมต์หลายช็อตที่ระบุชัดเจนในคู่มือทางการ สูงสุดที่ประกาศคือ 6 และสองในนั้นส่งมอบ 6 ช็อตที่ตรวจสอบแล้วอย่างแม่นยำ ถือว่า 6 เป็นเพดานที่สังเกตได้ ไม่ใช่การรับประกัน

Wan 3.0 สร้าง 4K ดั้งเดิมจริงหรือไม่?

ไม่ โพสต์ทางการระบุเฉพาะ 480P, 720P และ 1080P เท่านั้น ในไฟล์ตัวอย่างทางการทั้งหมด 110 ไฟล์ ไม่มีอะไรเกิน 1080p มีเพียง 4 ไฟล์ที่ 1920x1080 พอดี และผลลัพธ์แนวนอนทั่วไปคือ 1920x1072 อัตราเฟรมแบ่งเป็น 24fps สำหรับ 63 ไฟล์ และ 30fps สำหรับ 46 ไฟล์

Wan 3.0 API พร้อมใช้งานหรือไม่ และฉันสามารถรันได้ที่ไหน?

มันทำงานบน Alibaba Cloud Model Studio ยังไม่มีแพลตฟอร์มอนุมานของบุคคลที่สามใดโฮสต์มัน; Atlas Cloud แสดงเป็นรายการ "เร็วๆ นี้" โดยไม่มีเอนด์พอยต์ที่ใช้งานจริง ถ้าคุณต้องการผลลัพธ์หลายช็อตในสัปดาห์นี้ ห่วงโซ่ Wan 2.7 reference-to-video ด้านบนคือตัวทดแทนที่ใช้งานได้

ทำไมตัวละครของฉันยังเปลี่ยนระหว่างช็อตแม้จะมีภาพอ้างอิง?

โดยปกติแล้วเพราะพรอมต์เดียวเปลี่ยนสถานที่ มุมกล้อง และแสงพร้อมกัน เปลี่ยนทีละหนึ่งตัวแปรต่อช็อต และระบุชุดเต็มในทุกพรอมต์ นอกจากนี้ ตรวจสอบสิ่งที่ถูกต้อง: ในตัวอย่างของ Alibaba เอง ใบหน้าคงที่ในขณะที่แถบหมวกและจี้สร้อยคอเปลี่ยนทั้งคู่ภายในเทคเดียวที่ไม่ขาดตอน

เวทของ Wan 3.0 เป็นโอเพนซอร์สหรือไม่?

ยังไม่มีการปล่อยเวท Wan รุ่นก่อนหน้าสามารถดาวน์โหลดและรันในเครื่องได้ ในขณะที่ Wan 3.0 มาเป็นบริการบนแพลตฟอร์มที่โฮสต์ ใครก็ตามที่อ้างถึงสัญญาอนุญาต Apache-2.0 สำหรับ Wan 3.0 กำลังพูดซ้ำสิ่งที่ไม่มีแหล่งที่มาจากผู้พัฒนา

วิธีที่เร็วที่สุดในการรับ multi-shot consistency โดยไม่ต้องเข้าถึง Wan 3.0 คืออะไร?

สี่ขั้นตอน: ล็อคภาพตัวตนหนึ่งภาพ คัดลอกไปยังคีย์เฟรมหนึ่งตัวต่อช็อตโดยเปลี่ยนทีละหนึ่งตัวแปร สร้างแอนิเมชันแต่ละช็อตด้วย reference-to-video จากนั้นต่อในเครื่องและตรวจสอบอุปกรณ์ประกอบฉากของคุณ ประมาณ $2.29 และประมาณครึ่งชั่วโมงสำหรับลำดับสี่ช็อต


วิธีการ: ไฟล์ตัวอย่าง 110 ไฟล์และพรอมต์คู่ 64 ชุดทั้งหมดมาจากคู่มือผู้สร้าง Wan 3.0 อย่างเป็นทางการของ Alibaba เก็บถาวรในเครื่องเมื่อวันที่ 11 สิงหาคม 2026 เมตาดาต้าอ่านทีละไฟล์ด้วย ffmpeg; จำนวนช็อตมาจากการตรวจจับการเปลี่ยนแปลงฉากของ ffmpeg ที่เกณฑ์ 0.2 ตรวจสอบข้ามกับเฟรมที่แยกออกมา; โครงสร้างพรอมต์ถูกแยกวิเคราะห์โดยโปรแกรม ราคา Atlas Cloud ตรวจสอบจากแคตตาล็อกโมเดลสดเมื่อวันที่ 21 สิงหาคม 2026

แหล่งที่มา: Alibaba Cloud (สิงหาคม 2026); Curious Refuge (2026)

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด