
จอตัดต่อสองจอวางเคียงกันกำลังเล่นภาพเดียวกันคือปั๊มน้ำมันกลางทะเลทราย จอหนึ่งมีไทม์ไลน์ 30 วินาทีที่ต่อเนื่องด้านล่าง อีกจอมีไทม์ไลน์แบ่งออกเป็นสองส่วน
ที่วินาทีที่ 20 หัวจ่ายน้ำมันพ่นหญ้าสีเขียวสดออกมา ยังมีหยดน้ำเกาะอยู่ ม้าขยิบตาด้วยความพอใจ พนักงานใช้ไม้จิ้มฟันหลุดจากปาก
มุกนั้นใช้ได้เฉพาะในช็อต 30 วินาทีที่ต่อเนื่องเท่านั้น ถ้าตัดคลิป 8 วินาทีสี่คลิปมาต่อกัน ม้าจะเปลี่ยนสี แว่นกันแดดจะเปลี่ยนรูปทรง ท้องฟ้าจะเปลี่ยนโทนอุ่นขึ้นหนึ่งสต็อป และมุกเด็ดตายที่รอยต่อ
ดังนั้นเมื่อ Wan 3.0 และ Seedance 2.5 เปิดตัวในเวลาเดียวกัน โดยอ้างว่า 30 วินาทีแบบเนทีฟ ผ่านครั้งเดียว ไม่ต้องต่อกัน มันจึงไม่ใช่แค่เรื่องของเกณฑ์มาตรฐานอีกต่อไป แต่มันเป็นครั้งแรกที่โมเดลวิดีโอ AI สามารถเก็บการตั้งเรื่อง การพลิก และการลงมุกไว้ในช็อตเดียวได้
ผมแยกสเปกออกมา ตรวจสอบกับไฟล์เดโม่ที่ Alibaba เผยแพร่เอง และพบสิ่งที่ไม่มีใครเขียนถึง: ทั้งสองโมเดลบอกว่า 30 วินาที แต่ความละเอียดใต้ 30 วินาทีนั้นไม่ใช่สินค้าชนิดเดียวกันเลย
ประเด็นสำคัญ
- ทั้งสองโมเดลสร้าง 30 วินาทีได้ในครั้งเดียวจริงๆ ส่วนนั้นไม่ใช่การตลาด Wan 3.0 รองรับ 2 ถึง 30 วินาทีพร้อมตัวเลือกปรับระยะเวลาอัจฉริยะ Seedance 2.5 รองรับ 4 ถึง 30 วินาที
- มีเพียง Wan 3.0 เท่านั้นที่เรนเดอร์ 1080p แบบเนทีฟที่ 30 วินาที Seedance 2.5 สร้างแบบเนทีฟที่ 480p และ 720p เท่านั้น ตัวเลือก 1080p, 1440p และ 4K เป็นการอัปสเกลหลังการสร้างจากแหล่ง 720p และเอกสาร API ของตัวเองระบุว่าระดับ 4K "ไม่ใช่การสร้าง 4K แบบเนทีฟ"
- Seedance 2.5 ชนะในเรื่องปริมาณอ้างอิง: รูปภาพสูงสุด 30 ภาพ บวกวิดีโอ 10 ไฟล์ บวกไฟล์เสียง 10 ไฟล์ รวม 50 ไฟล์ คู่มือผู้สร้างของ Wan 3.0 จำกัดการอ้างอิงไว้ที่ 20
- Wan 3.0 มีอินพุตที่ไม่มีใครมี: ไฟล์
.doc,.xls,.ppt,.pdf,.txtและหน้าเว็บสด สามารถป้อนเป็นข้อมูลอ้างอิงสร้างสรรค์ได้โดยตรง - มีเพียงหนึ่งในสองเท่านั้นที่สามารถรันได้จริงนอก Alibaba ในวันนี้ Wan 3.0 อยู่ในเบต้าสาธารณะบน Alibaba Cloud Model Studio และ Qwen Cloud โดยการเข้าถึง API ของบุคคลที่สามยังคงทยอยเปิดให้บริการ Seedance 2.5 ใช้งานได้จริงบน Atlas Cloud โดยมีตัวควบคุมระยะเวลา 30 วินาทีในตอนนี้
- ต้องการทดสอบโครงสร้างเรื่องราว 30 วินาทีก่อนจ่ายเงินสักวินาที? ตัวสร้างสกิตโฆษณา AI ฟรี ของ Atlas Cloud ให้คุณใช้งานฟรีหนึ่งครั้ง: สปอตความยาว 15 วินาทีที่สมบูรณ์พร้อมบทพูดและเสียงประกอบ ดาวน์โหลดแบบไม่มีลายน้ำ
เดโม่ Wan 3.0 อย่างเป็นทางการของ Alibaba จากคู่มือผู้สร้าง Tongyi Wan 3.0 ครั้งเดียว ไม่ตัด 30.07 วินาที วัดด้วย ffprobe: 1920x1072, 24fps, เสียง AAC สเตอริโอฝังในตัว เปิดเสียงเพื่อฟังการสะบัดหางและไม้จิ้มฟันตกพื้นในวินาทีที่ 29 ใช้เป็นเอกสารอ้างอิงเพื่อการเปรียบเทียบและวิจารณ์เท่านั้น
Wan 3.0 กับ Seedance 2.5 เนทีฟ 30 วินาที: อะไรเปลี่ยนไปจริงๆ ในเดือนนี้
สิบห้าวินาทีเป็นกำแพงมานานแล้ว Wan 2.7 จุดสูงสุดตรงนั้น Seedance 2.0 จุดสูงสุดตรงนั้น "ภาพยนตร์ AI หนึ่งนาที" ทุกเรื่องที่คุณเห็นในฟีดเมื่อปีที่แล้วคือคลิปสี่ถึงแปดคลิปที่ต่อกันใน NLE โดยมีนักปรับสีเพื่อซ่อนรอยต่อ
สองสิ่งทำลายกำแพงนั้นในเวลาไม่กี่สัปดาห์เดียวกัน Alibaba เปิด Wan 3.0 เบต้าสาธารณะเมื่อวันที่ 6 สิงหาคม 2026 พร้อมการสร้าง 30 วินาทีแบบเนทีฟและอินพุตอ้างอิงมัลติโมดอลเต็มรูปแบบ (AlphaSignal, สิงหาคม 2026) ByteDance เพิ่ม Seedance จาก 15 เป็น 30 วินาทีในเวอร์ชัน 2.5 โดยวางตำแหน่งให้เป็นวิธีลดการต่อคลิปและการเปลี่ยนแปลงทางภาพที่เกิดขึ้น
คำว่า "เนทีฟ" มีความสำคัญในทางเทคนิค มันหมายถึงการผ่านไปข้างหน้าครั้งเดียวบนลำดับแฝงเดียว ไม่ใช่การขยายเฟรมสุดท้ายที่โมเดลนำเฟรมสุดท้ายของคลิป A ไปเริ่มคลิป B การขยายคือสาเหตุที่ปลอกคอของตัวละครเปลี่ยนรูปร่างอย่างเงียบๆ ระหว่างช็อต การผ่านแบบเนทีฟมีทั้ง 30 วินาทีในบริบทเดียวกัน ดังนั้นม้าจึงยังคงเป็นม้าตัวเดิม
เดโม่ปั๊มน้ำมันเป็นการทดสอบที่ชัดเจนที่สุด โครงสร้างคือสี่จังหวะ: 0 ถึง 8 วินาทีไม่มีอะไรเกิดขึ้น 8 ถึง 16 วินาทีมีอะไรแปลกเกิดขึ้น 16 ถึง 24 วินาทีคือมุกเด็ด 24 ถึง 30 วินาทีคือเดินจากไป มุกเด็ดอยู่ที่วินาทีที่ 20 ซึ่งหมายความว่ามุกจะลงได้ก็ต่อเมื่อม้า แว่นกันแดด สีโทนฟ้า-ส้ม และกล้องนิ่งๆ รอดพ้น 19 วินาทีแรกโดยไม่เปลี่ยนแปลง การต่อคลิปทำไม่ได้ ไม่ใช่เพราะบรรณาธิการไม่ดี แต่เพราะคลิป B ไม่เคยเห็นคลิป A
Wan 3.0 กับ Seedance 2.5 เนทีฟ 30 วินาที: ภาพพังตรงไหนจริงๆ
สามสิบวินาทีคือสองเท่าของสิบห้า ความเสี่ยงในการล่องลอยไม่ใช่สองเท่า แต่มันแย่กว่านั้น และมันเปลี่ยนไปเป็นโหมดความล้มเหลวที่แตกต่าง
ความล้มเหลวของงานต่อคลิปคือระหว่างคลิป ความล้มเหลวของเนทีฟ 30 วินาทีคือภายในคลิป ในการผลิตภาพยนตร์สั้นด้วย Seedance 2.5 ผู้ตรวจสอบพบความไม่ต่อเนื่องและการเปลี่ยนรูปที่ปรากฏเป็น "ความไม่เสถียรทางภาพหรือการเปลี่ยนแปลงรูปร่างของโมเดลตัวละคร" ซึ่งกระจุกตัวอยู่ในลำดับแอ็คชั่นเร็ว และโดยเฉพาะอย่างยิ่งระบุว่าสิ่งแปลกปลอมเหล่านี้ไม่สามารถทำความสะอาดได้ด้วยการอัปสเกล (MindStudio, สิงหาคม 2026) นั่นเป็นส่วนสำคัญสำหรับใครก็ตามที่วางแผนจะเรนเดอร์ที่ 720p แล้วอัปสเกลเป็น 4K ทีหลัง: ตัวอัปสเกลจะทำให้การเปลี่ยนรูปชัดเจนขึ้น ไม่ใช่ลบออก
การผลิตเดียวกันบันทึกอัตราส่วนการถ่ายทำ 3.2 ต่อ 1 ประมาณ 450 วินาทีของการสร้างดิบเพื่อตัดเป็นผลงานสุดท้าย 2 นาที 22 วินาที วางแผนงานช็อตยาวเหมือนการถ่ายทำที่มีคัฟเวอร์เรจ ไม่ใช่เหมือนคิวเรนเดอร์ที่ทุกงานส่งออก
ข้อค้นพบอีกสองข้อจากการผลิตนั้นน่าสนใจ เอกลักษณ์ทางภาพทั่วทั้งภาพยนตร์ขึ้นอยู่กับภาพอ้างอิงสามภาพ: ภาพเหมือนตัวละครสองภาพและภาพสถานที่หนึ่งภาพ แม้ว่าระบบจะรับได้ถึง 50 ภาพ และในการคัดเลือกเสียงพากย์ การเขียนว่า "American" แก้ปัญหาสำเนียงอังกฤษที่ไม่ตั้งใจ ในขณะที่การเขียนว่า "American English" ไม่ได้ผล เพราะคำว่า "English" ดึงการออกเสียงกลับไปทางสำเนียงอังกฤษ
โครงสร้างพรอมต์ที่อยู่รอด 30 วินาทีคือโครงสร้างที่ Alibaba ใช้ในคู่มือของตัวเอง: จังหวะที่มีการระบุเวลาอย่างชัดเจน ไม่ใช่ย่อหน้าบรรยายบรรยากาศ เขียน 0-8s, 8-16s, 16-24s, 24-30s ให้แต่ละบล็อกมีพฤติกรรมกล้องและเหตุการณ์ของตัวเอง และจบด้วยบรรทัดเสียงเดียวครอบคลุมทั้งคลิป คุณจะเห็นโครงร่างนั้นในขั้นตอนที่ 4 ด้านล่าง เพราะผมเก็บโครงสร้างของ Alibaba ไว้และแค่แปลเท่านั้น
Wan 3.0 กับ Seedance 2.5 เนทีฟ 30 วินาที: สเปก ราคา และสิ่งที่คุณใช้ได้วันนี้
นี่คือสถานการณ์จริง และเป็นส่วนที่โมเดลทั้งสองหยุดเป็นสินค้าที่เทียบเคียงกันได้
อ่านบรรทัดความละเอียดสองครั้ง เพราะมันคือทั้งบทความ เอกสาร API Seedance 2.5 Text-to-Video ของ Atlas Cloud เองระบุว่า 720p-esr ปรับปรุงจากแหล่ง 480p, ว่า 1080p-esr, 1440p-esr และ 4k-esr ทั้งหมดปรับปรุงจากแหล่ง 720p และว่าตัวเลือก 4K ส่งมอบขอบสั้น 2160 พิกเซล "ไม่ใช่การสร้าง 4K แบบเนทีฟ" ดังนั้นคลิป Seedance 30 วินาทีที่ระบุว่า 4K จึงมีรายละเอียดจริงเท่ากับ 720p ที่ถูกสุ่มตัวอย่างใหม่ ในทางตรงกันข้าม แผนราคาของ Wan 3.0 มีระดับ 1080p ตรงที่ $0.20 ต่อวินาที และไฟล์เดโม่ 30 วินาทีที่ Alibaba เผยแพร่เองวัดได้ 1920x1072
ข้อดีของข้อจำกัดนี้: การทดสอบทั้งหมดรันในแท็บเบราว์เซอร์เดียว บนสามโมเดล โดยไม่ต้องตั้งค่าภายในเครื่อง
| บทบาทในการทดสอบนี้ | โมเดล | ราคาที่ระบุ |
|---|---|---|
| เฟรมเปิด | GPT Image 2 Text-to-Image | จาก $0.009 / ภาพ |
| การรัน 30 วินาทีเนทีฟ | Seedance 2.5 Text-to-Video | จาก $0.134 / วินาที |
ราคาที่ระบุได้รับการยืนยันจากหน้าโมเดล Atlas Cloud สิงหาคม 2026 อ่านเป็นราคาขั้นต่ำ ไม่ใช่ราคาจริง ทุกโมเดลเหล่านี้คิดเงินตามสิ่งที่คุณร้องขอจริง และปุ่ม Run จะแสดงราคาสำหรับการตั้งค่าที่แน่นอนของคุณก่อนที่คุณจะคลิก ในการทดสอบนี้ ปุ่มแสดงราคา $0.1745 สำหรับหนึ่งเฟรม GPT Image 2 ที่คุณภาพสูงและ 2048x1152 และ $1.514799 สำหรับงาน Seedance 2.5 ห้าวินาทีที่ 720p และ 16:9 ซึ่งคิดเป็นประมาณ $0.30 ต่อวินาที แทนที่จะเป็น $0.134 ที่ระบุไว้ ตัวเลขที่ระบุเป็นอัตรา 480p ตรวจสอบที่ปุ่ม ไม่ใช่ในแคตตาล็อก Seedance 2.5 ยังมี เอนด์พอยต์ reference-to-video ในราคา $0.134 ต่อวินาทีเท่ากัน หากคุณต้องการใช้ขีดจำกัด 50 ข้อมูลอ้างอิง
วิธีทำการทดสอบเนทีฟ 30 วินาทีนี้บน Seedance 2.5
ห้าขั้นตอน สามโมเดล ทั้งหมดในเบราว์เซอร์ คัดลอกพรอมต์ตามที่เขียน
ขั้นตอนที่ 1: ล็อกโครงสร้าง 30 วินาทีแบบระบุเวลา
อย่ารันอะไรเลย อ่านโครงสร้างก่อน เพราะนี่คือส่วนที่ตัดสินว่า 30 วินาทีของคุณจะคงอยู่หรือไม่
เดโม่ปั๊มน้ำมัน Wan 3.0 ที่ด้านบนของบทความนี้สร้างขึ้นเป็นสี่บล็อกที่มีป้ายกำกับ พร้อมหลักการกล้องคงที่ที่ระบุไว้ครั้งเดียวที่หัว: การสังเกตอย่างสงบและเป็นกลาง, มิดไวด์แบบนิ่ง, การซูมสุดขีดเฉพาะในจังหวะที่ไร้สาระ ทุกเหตุการณ์ถูกตรึงไว้กับช่วงเวลา เสียงคือหนึ่งบรรทัดที่ส่วนท้ายครอบคลุมทั้ง 30 วินาที
นี่คือโครงร่างเปล่าๆ เติมลงไปแล้วคุณจะมีพรอมต์ที่โมเดลเนทีฟ 30 วินาทีสามารถติดตามได้จริง:
Plain1A 30-second [genre] set in [place]. [Visual style, grade, saturation]. Camera language: [doctrine], punctuated by [exception]. 2 30-8s: [setup, wide, establish the normal world, introduce the anomaly on the horizon] 4 58-16s: [the anomaly acts, still treated as normal, one POV or reaction insert] 6 716-24s: [the payoff, extreme close-up on the thing itself, hard cut to the reaction face] 8 924-30s: [the walk-off, a small physical button that closes the joke] 10 11Audio: [ambience, three or four specific diegetic sounds, one final small sound]. No music, no dialogue, no on-screen text.
สเปกที่วัดได้ของไฟล์อ้างอิงของ Alibaba สำหรับใครก็ตามที่ต้องการตรวจสอบตัวเลขของผม: 30.07 วินาที, 1920x1072, 24fps, AAC stereo นั่นคือเกณฑ์ที่ใช้เปรียบเทียบการรัน Seedance
ขั้นตอนที่ 2: สร้างเฟรมเปิด
คุณต้องมีจุดยึดภาพที่แน่นอน เพื่อให้การรัน 15 วินาทีและ 30 วินาทีเริ่มต้นจากโลกเดียวกัน เปิด GPT Image 2 Text-to-Image
การตั้งค่า: quality high, aspect ratio 16:9, 1 image.
Plain1A wide, dead-still establishing shot of a lonely Route 66 style gas station in a bright desert. Retro yellow-orange-and-blue building, paint faintly sun-bleached; a faded vintage-red fuel pump out front; a small convenience store beside it with a washed-out cola vending machine by the door. Cracked orange dry earth in the foreground, warm terracotta mountains far behind, cloudless clean cyan-blue sky. A gas station attendant in greasy blue coveralls and oversized black sunglasses slouches half-asleep in a chair by the door, toothpick in his mouth. Strict bright teal-and-orange color grading, high saturation, high brightness, cinematic photoreal, locked-off camera, 16:9.

เพลย์กราวด์ GPT Image 2 บน Atlas Cloud โดยตั้งค่าคุณภาพเป็น high และ 16:9 ภาพช็อตเปิดปั๊มน้ำมัน Route 66 ที่สร้างขึ้นในแผงเอาต์พุต
GPT Image 2 บน Atlas Cloud: คุณภาพ high, 16:9, หนึ่งภาพ ปุ่ม Run แสดงราคา $0.1745 สำหรับเฟรมนี้ ซึ่งเป็นราคาจริงสำหรับการเรนเดอร์คุณภาพสูง 2048x1152 ราคา $0.009 บนหน้าโมเดลเป็นราคาขั้นต่ำ

เฟรมช็อตเปิดปั๊มน้ำมัน Route 66 ที่สร้างด้วย GPT Image 2 ท้องฟ้าสีฟ้าครามและดินแห้งสีส้ม พนักงานกำลังงีบอยู่ข้างประตู
เฟรมเปิด นี่คืออินพุตสำหรับขั้นตอนที่ 3 และเป้าหมายภาพสำหรับขั้นตอนที่ 4 สร้างด้วย openai/gpt-image-2
ขั้นตอนที่ 3: ชนกำแพง 15 วินาที
การตั้งค่า: first frame = เอาต์พุตขั้นตอนที่ 2, duration ลากไปที่ค่าสูงสุด 15, resolution 1080P.
Plain1Locked-off wide shot holds. A cowgirl in a wide-brim hat rides a real horse in from the horizon at a walk. The dozing attendant is woken by hoofbeats, pushes his sunglasses up, sits upright, chewing his toothpick, unimpressed. She dismounts cleanly, leads the horse straight to the vintage fuel pump. Bright teal-and-orange grade, high saturation, photoreal, calm observational camera, no cuts.
ดรอปดาวน์หยุดที่ 15 นั่นคือประเด็นทั้งหมดของขั้นตอนนี้ มุกเด็ดของคุณถูกกำหนดไว้ที่วินาทีที่ 20 และไปป์ไลน์นี้ไม่สามารถถึงวินาทีที่ 20 ได้ในชิ้นเดียว เพื่อไปถึงนั้นคุณจะต้องสร้างคลิปที่สองจากเฟรมสุดท้าย และทันทีที่คุณทำอย่างนั้น ม้าตัวนั้นก็จะกลายเป็นม้าใหม่

ขั้นตอนที่ 4: รันการผ่านเนทีฟ 30 วินาทีเต็ม
เปิด Seedance 2.5 Text-to-Video
การตั้งค่า: duration = 30, resolution = 720p, ratio = 16:9, generate_audio = on, output_format = mp4, ปิดลายน้ำ
เลือก 720p อย่างตั้งใจ ไม่ใช่ 1080p-esr 720p คือเพดานจริงของโมเดล ดังนั้นนี่คือการเปรียบเทียบพิกเซลแบบเท่าเทียม ไม่ใช่การเปรียบเทียบกับตัวอัปสเกล
พรอมต์ด้านล่างคือพรอมต์เดโม่ปั๊มน้ำมันของ Alibaba เอง แปลตรงตัวจากคู่มือผู้สร้าง Wan 3.0 และปรับโครงสร้างใหม่เป็นไม่มีอะไรเลย จังหวะเดียวกัน เวลาเดียวกัน หลักการกล้องเดียวกัน รายการเสียงเดียวกัน
Plain1A 30-second absurdist deadpan comedy short set at a sun-bleached Route 66 style gas station in a bright desert. Photoreal, strict bright teal-and-orange grading, high saturation and high brightness, so the absurd event happens in a completely normal, almost pretty world. Camera language: calm, objective observation, mostly locked-off medium wides and slow lateral drifts, no emotional steering, punctuated by sudden extreme close-ups on the absurd beats. 2 30-8s: Wide, locked-off. Cyan sky, drifting dust. The retro yellow-orange-and-blue station sits alone by the road; an attendant in greasy blue coveralls and huge black sunglasses dozes in a chair, toothpick in mouth. Only wind. On the horizon a cowgirl on a real horse appears at a walk. Cut to medium: hoofbeats wake him, he pushes his sunglasses, sits up, reads the pair as "another one asking for directions." 4 58-16s: She says nothing. She dismounts cleanly, leads the horse straight to the old fuel pump. The horse casually puts its head next to the pump like it has done this before. Brief slightly fish-eyed POV from behind his sunglasses, the woman and horse look even stranger. Close: his brow furrows, he takes the sunglasses off, about to shout. Slow-motion close-up: as the glasses come off, she aims the fuel nozzle at the horse's mouth and squeezes the trigger. 6 716-24s: Extreme close-up on the nozzle. Out comes not gasoline but jets of fresh bright-green grass, still beaded with water. Hard cut to an extreme close-up of the attendant's face, frozen: eyes wide as saucers, mouth slightly open, toothpick forgotten mid-chew. Medium: the horse eats happily, squints with pleasure, then gives one satisfied powerful flick of its tail, and the dust it kicks up lands squarely on the still-stunned attendant's face. 8 924-30s: "Tank full" of grass. She hangs the nozzle back on the pump, digs coins from her pocket, walks to the store door and drops them clinking into a tin can on the counter. She glances back at the petrified attendant; under the hat brim the corner of her mouth lifts a fraction. She remounts and rides off in a trail of dust. The camera pushes slowly in on him: same frozen posture, face covered in dust, sunglasses still pinched in his hand, and finally the toothpick drops from his mouth with a small clack. 10 11Audio: dry desert wind throughout, hoofbeats, the mechanical clunk of the pump handle, wet grass spurting, the tail flick, coins in a tin can, and one small clack as the toothpick hits the ground. No music, no dialogue, no on-screen text.
คำเตือนหนึ่งข้อที่จะช่วยให้คุณไม่ต้องเสียเงินเปล่า และเป็นกับดักเดียวกันกับขั้นตอนที่ 3: ลากสไลเดอร์ระยะเวลาไปที่ 30 อย่าพิมพ์ 30 ลงในช่องตัวเลข ช่องตัวเลขจะแสดง 30 อย่างมีความสุขในขณะที่สไลเดอร์ยังคงอยู่ที่ค่าเริ่มต้นห้าวินาที และปุ่ม Run จะแสดงราคาสำหรับห้าวินาที ตรวจสอบราคาก่อนคลิก ที่ 720p และ 16:9 งานห้าวินาทีแสดงราคา $1.514799 ดังนั้นการผ่าน 30 วินาทีจริงจะแสดงราคาประมาณหกเท่า
ไม่มีภาพหน้าจอการรันที่เสร็จแล้วสำหรับขั้นตอนนี้ ความพยายามจับภาพอัตโนมัติสามครั้งทั้งหมดส่งค่าเริ่มต้นสไลเดอร์แทนที่จะเป็น 30 วินาที และแทนที่จะแสดงคลิปห้าวินาทีที่ระบุว่าเป็นคลิป 30 วินาที การจับภาพจึงถูกเว้นไว้ พรอมต์และการตั้งค่าด้านบนคือสิ่งที่ต้องวางและตั้งค่า
ขั้นตอนที่ 5: อ่านการล่องลอยอย่างตรงไปตรงมา
นี่คือฝั่ง Seedance 2.5 ของพรอมต์นั้นที่สร้างขึ้นที่เนทีฟ 30 วินาที, 720p, 16:9, เสียงเปิด
_Seedance 2.5, พรอมต์ปั๊มน้ำมัน Wan 3.0 เหมือนกันคัดลอกตรงตัว: เนทีฟ 30 วินาทีในการสร้างครั้งเดียว, 1280x720, 24fps, เสียงฝังในตัว สี่จังหวะเดียวกัน, คาวเกิร์ลและม้ามาถึง, มุกหัวจ่ายน้ำมัน, ภาพใกล้ตัวพนักงานที่มีความไม่ลงรอยทางความคิด วางไว้ข้างคลิป Wan 3.0 ที่ด้านบนเพื่อเปรียบเทียบแบบเท่าเทียม
วางคลิปทั้งสองข้างกันและตรวจสอบห้าสิ่งเฉพาะ อย่าตรวจสอบ "อันไหนดูดีกว่า" นั่นเป็นการโต้แย้งเรื่องรสนิยมและจะเสียเวลาช่วงบ่ายของคุณ
- สีขนและเครื่องแต่งกาย ม้าสีเดียวกันในวินาทีที่ 29 กับวินาทีที่ 6 หรือไม่? แว่นกันแดดรูปร่างเหมือนกันหลังจากถอดแล้วกลับมาในมือเขาหรือไม่?
- ความเสถียรของเกรด สุ่มตัวอย่างท้องฟ้าที่วินาทีที่ 2 และวินาทีที่ 28 เกรดโทนฟ้า-ส้มมีแนวโน้มลอยไปทางอุ่นขึ้นเมื่อสร้างนานขึ้นบ่อยกว่าที่คาด
- จังหวะทางกายภาพที่วินาทีที่ 20 หญ้าออกจากหัวจ่ายน้ำมันเป็นคำขอทางฟิสิกส์ มันโค้งและตกลงมาด้วยน้ำหนัก หรือมันจางหายไปเป็นพื้นผิว?
- วินัยของกล้อง พรอมต์บอกว่าให้นิ่ง นับจำนวนครั้งที่กล้องสร้างการขยับเข้าไปโดยไม่ได้รับคำขอ นี่คือความล้มเหลวที่พบบ่อยที่สุดในการสร้างยาว: โมเดลหมดเหตุการณ์ที่กำหนดและเติมเวลาด้วยการเคลื่อนไหว
- การเปลี่ยนรูปในภาพเคลื่อนไหวเร็ว การสะบัดหางและการเตะฝุ่นคือการเคลื่อนไหวที่เร็วที่สุดในคลิป ตามบันทึกการผลิตของ MindStudio นี่คือจุดที่ความไม่ต่อเนื่องกระจุกตัว และสิ่งที่การอัปสเกลจะไม่แก้ไข
ให้คะแนนห้าสิ่งนี้ ไม่ใช่บรรยากาศ นั่นคือการเปรียบเทียบที่คุณสามารถปกป้องกับลูกค้าได้
พรอมต์ที่ตรงกันอีกสามข้อสำหรับ Wan 3.0 กับ Seedance 2.5 เนทีฟ 30 วินาที
เดโม่เดียวนั้นเป็นเรื่องเล่า ต่อไปนี้คือไฟล์ 30 วินาทีอย่างเป็นทางการของ Wan 3.0 อีกสามไฟล์จากคู่มือเดียวกัน แต่ละไฟล์เน้นส่วนต่างกันของปัญหา 30 วินาที สำหรับสัตว์ทะเลและบทพูดแฟนตาซีมืด ฝั่ง Seedance 2.5 ถูกสร้างขึ้นด้วยพรอมต์เดียวกันที่เนทีฟ 30 วินาทีและฝังไว้หลังแต่ละอันทันที เพื่อให้คุณดูทั้งสองอันแทนที่จะเชื่อคำพูดผม
| พรอมต์ | สิ่งที่ทดสอบความเครียด | ไฟล์ทางการ Wan 3.0, วัดได้ | ฝั่ง Seedance 2.5, พรอมต์เดียวกัน |
|---|---|---|---|
| ภาพยนตร์ภัยพิบัติสัตว์ทะเล | 10 ช็อตที่มีสคริปต์บวกดนตรีประกอบใน 30 วินาที | 1920x1072, 24fps, 30.07s, AAC | สร้างที่ 30 วินาที, ฝังด้านล่าง; ชื่อ IP หนึ่งชื่อและข้อความแบรนด์เรือถูกลบออกเพื่อให้ฟิลเตอร์เนื้อหาของ Seedance ผ่าน สตอรีบอร์ดเหมือนกันยกเว้นนั้น |
| บทพูดภาษาอังกฤษแฟนตาซีมืด | เสียงภาษาอังกฤษเนทีฟและการลิปซิงค์ข้ามการเคลื่อนกล้องช้าๆ ต่อเนื่อง | 1280x720, 24fps, 30.05s, AAC | สร้างที่ 30 วินาทีจากพรอมต์ตรงตัว, ฝังด้านล่าง |
| อนิเมะกีฬา 2D, พรอมต์สองบรรทัด | โมเดลสามารถเติม 30 วินาทีโดยแทบไม่มีคำสั่งได้หรือไม่ | 1280x720, 24fps, 30.05s, AAC | ไม่ได้สร้างที่นี่; แสดงเป็นกริดเฟรมเฉพาะ Wan เพื่ออ่านโครงสร้างข้ามเวลา |
| ตลกกล้องแพน (ไม่รวม) | 8 แพนและ 8 จังหวะอารมณ์โดยไม่ตัด | 1280x720, 24fps, 30.04s, AAC | ไม่รัน: ความหนาแน่นของบทสนทนาเฉพาะภาษาจีน การเขียนใหม่เป็นภาษาอังกฤษจะไม่เป็นการเปรียบเทียบที่ยุติธรรม |
เดโม่ Wan 3.0 อย่างเป็นทางการ: สิบช็อตที่มีสคริปต์และดนตรีประกอบเต็มรูปแบบในการผ่าน 30 วินาทีครั้งเดียว ที่ 1920x1072 นี่คือข้อโต้แย้งที่หนักที่สุดสำหรับ 1080p เนทีฟ เพราะปริมาณน้ำและรายละเอียดผิวหนังเปียกของสัตว์คือสิ่งที่การอัปสเกล 720p สร้างขึ้นมาแทนที่จะแก้ไข คู่มือผู้สร้าง Alibaba Tongyi ใช้เพื่อการเปรียบเทียบและวิจารณ์
Seedance 2.5, พรอมต์ภัยพิบัติสิบช็อตเดียวกันที่เนทีฟ 30 วินาที, เปิดเสียง เรือประมงในพายุ, ลูกเรือที่หวาดกลัว, คลื่นขนาดใหญ่ที่ซัดขึ้นมา, จากนั้นสัตว์ทะเลลึกผุดขึ้นมาจากผิวน้ำท่ามกลางฟ้าแลบ การอ้างอิง IP หนึ่งและข้อความแบรนด์บนตัวเรือถูกถอดออกเพื่อให้ฟิลเตอร์เนื้อหาของ Seedance ผ่าน; สตอรีบอร์ดเหมือนกันยกเว้นนั้น ซึ่งทำให้รายละเอียดปริมาณน้ำและผิวหนังเปียกเป็นการเปรียบเทียบแบบเท่าเทียมกับคลิป Wan 3.0 ด้านบน
เดโม่ Wan 3.0 อย่างเป็นทางการ, เปิดเสียง บทสนทนาภาษาอังกฤษเนทีฟของวายร้าย "Ripe enough for the void" พูดในการเอียงกล้องช้าขึ้นครั้งเดียวโดยไม่ตัด นี่คือคลิปที่ทีมงานที่ใช้ภาษาอังกฤษควรทดสอบ เพราะเสียง, ลิปซิงค์ และการเคลื่อนกล้องต่อเนื่อง 30 วินาทีต้องคงอยู่พร้อมกัน
Seedance 2.5, พรอมต์แฟนตาซีมืดเดียวกันคัดลอกตรงตัว, เนทีฟ 30 วินาที, เปิดเสียง วายร้ายตาสีม่วงคนเดียวกัน, ลวดลายดาวรูน, เงาเนบิวลาก่อตัวในฝ่ามือที่เปิด และสองบรรทัดภาษาอังกฤษ ดูว่าลิปซิงค์และการขยับต่อเนื่องครั้งเดียวคงอยู่ตลอด 30 วินาทีหรือไม่เหมือนกับฝั่ง Wan 3.0
ถ้าคุณรันฝั่ง Seedance 2.5 ที่ตรงกันของอันนี้ ให้เก็บสองบรรทัดภาษาอังกฤษตามเดิมและจำความผิดปกติของสำเนียงจากบันทึกการผลิต: เขียน "American" ไม่ใช่ "American English" คำว่า "English" ดึงการออกเสียงกลับไปทางสำเนียงอังกฤษ
อันที่สามคือความประหลาดใจเงียบๆ พรอมต์อนิเมะกีฬา 2D ในคู่มือของ Alibaba มีสองบรรทัด ไม่มีเวลา ไม่มีรายการช็อต แค่นักมวยต่อยกระสอบทราย เหนื่อย เจ็บปวด สามสิบวินาทีจากนั้นคือการทดสอบว่าโมเดลสามารถสร้างโครงสร้างของตัวเองได้หรือไม่ นี่คือตัวอย่างตลอดเวลาทำงาน:

สี่เฟรมจากเดโม่อนิเมะกีฬา 2D Wan 3.0 อย่างเป็นทางการที่สุ่มตัวอย่างประมาณวินาทีที่ 1, 10, 20 และ 29 แสดงการออกแบบนักมวยและพื้นหลังยิมตลอด 30 วินาที
สี่เฟรมจากเดโม่อนิเมะกีฬา 2D Wan 3.0 อย่างเป็นทางการที่สุ่มตัวอย่างประมาณวินาทีที่ 1, 10, 20 และ 29 การออกแบบตัวละครเดียวกัน, เสื้อกล้ามตัวเดียวกัน, กระสอบทรายเดียวกัน, แถวล็อกเกอร์เดียวกัน, ข้ามการเปลี่ยนจากภาพกว้างไปภาพใกล้ที่พรอมต์ไม่ได้ขอ กริดนิ่งแทนที่จะเป็นคลิป เพราะการเปรียบเทียบที่นี่คือข้ามเวลาภายในไฟล์เดียว ไม่ใช่การเคลื่อนไหว
การอ่านเชิงปฏิบัติ: ด้วยพรอมต์สองบรรทัด โมเดลสร้างคัฟเวอร์เรจของตัวเอง โดยเคลื่อนจากภาพกว้างนิ่งไปเป็นภาพใกล้เหงื่อและความเหนื่อยล้า และคงการออกแบบตัวละครไว้ระหว่างทำ นั่นคือข่าวดี ข้อแลกเปลี่ยนคือคุณสละการควบคุมว่าเหตุการณ์จะเกิดขึ้นเมื่อไหร่ ถ้าคุณต้องการ 30 วินาทีเพื่อลงจังหวะเฉพาะที่วินาทีเฉพาะ ให้เขียนเวลากำกับ
ทดสอบการเล่าเรื่องเนทีฟ 30 วินาทีฟรีก่อนจ่ายเงินสำหรับทั้งสอง
การรัน 30 วินาที 720p บน Seedance 2.5 แสดงราคาประมาณ $9 เมื่อคุณคิดราคาความละเอียดจริงแทนที่จะเป็นราคาขั้นต่ำ การรัน 30 วินาที 1080p บนแผนราคา Wan 3.0 คือ $6.00 ไม่มีอันไหนแพงตามมาตรฐานการผลิต แต่ด้วยอัตราส่วนการถ่ายทำ 3.2 ต่อ 1 คุณไม่ได้ซื้อคลิปเดียว แต่คุณซื้อสามหรือสี่คลิป
ก่อนที่คุณจะใช้จ่ายอะไร มันคุ้มค่าที่จะตอบคำถามที่ถูกกว่า: สคริปต์ของฉันยืนหยัดเป็นช็อตต่อเนื่องหนึ่งช็อตได้จริงหรือไม่? ความล้มเหลวส่วนใหญ่ของ 30 วินาทีไม่ใช่ความล้มเหลวของโมเดล แต่เป็นความล้มเหลวของโครงสร้าง: สามจังหวะที่ยัดลงในที่ที่มีที่ว่างเพียงสอง หรือมุกเด็ดที่เขียนไว้ที่วินาทีที่ 26 โดยไม่มีอะไรดำเนินไปตั้งแต่วินาทีที่ 8 ถึง 20
เครื่องสร้างสกิตโฆษณา AI ฟรีของ Atlas Cloud ตอบคำถามนั้นโดยไม่เสียค่าใช้จ่าย คุณให้คำอธิบายผลิตภัณฑ์หนึ่งรายการและรูปภาพผลิตภัณฑ์สูงสุดสี่รูป แต่ละรูปไม่เกิน 8MB เลือกหนึ่งในหกสไตล์ (มุกตลก, พลิกผัน, ซิทคอม, อบอุ่นใจ, หรูหรา หรือขายตรง) จากนั้นมันจะเขียนสคริปต์สองตัวละครก่อน ด้วยการดึงดูดสามวินาที ความขัดแย้ง และการพลิกผัน จากนั้นสร้างทุกช็อตรอบสคริปต์นั้น ตัวละครพูดบทของพวกเขาดัง ๆ และเอฟเฟกต์เสียงถูกเรนเดอร์ลงในวิดีโอ
ข้อจำกัดที่ตรงไปตรงมา: มันคือ 15 วินาที ไม่ใช่ 30 คุณต้องลงชื่อเข้าใช้ และคุณได้รับการสร้างฟรีหนึ่งครั้งก่อนที่คุณจะเติมเครดิต แต่ 15 วินาทีที่มีการดึงดูด ความขัดแย้ง และการพลิกผันบอกคุณได้ว่าสามจังหวะของคุณหายใจได้หรือไม่ ถ้าโครงสร้างใช้ได้ที่นั่น ใช้จังหวะเดียวกัน ยืดมันลงบนโครงร่าง 0-8s / 8-16s / 16-24s / 24-30s จากขั้นตอนที่ 1 แล้วใช้จ่ายเก้าเหรียญเพื่อการผ่านเนทีฟ 30 วินาทีจริง
ค่าใช้จ่ายจริงของคลิปเนทีฟ 30 วินาทีบน Wan 3.0 กับ Seedance 2.5
| การตั้งค่า | อัตรา | ระยะเวลา | หนึ่งคลิป |
|---|---|---|---|
| Wan 3.0, 1080p เนทีฟ (Alibaba Cloud เท่านั้น) | $0.20 / วินาที | 30 วินาที | $6.00 |
| Wan 3.0, 720p เนทีฟ (Alibaba Cloud เท่านั้น) | $0.10 / วินาที | 30 วินาที | $3.00 |
| Wan 3.0, 480p เนทีฟ (Alibaba Cloud เท่านั้น) | $0.05 / วินาที | 30 วินาที | $1.50 |
| Seedance 2.5, 720p เนทีฟ, บน Atlas Cloud | $0.30 / วินาที ที่วัดที่ 720p, ระบุจาก $0.134 | 30 วินาที | ประมาณ $9.09 |
| GPT Image 2 เฟรมเปิด, คุณภาพสูง, 2048x1152 | ระบุจาก $0.009 / ภาพ | 1 ภาพ | $0.1745 ที่แสดงราคา |
การเปรียบเทียบที่ตัดสินใจจริงๆ: Wan 3.0 ที่ 720p ถูกกว่าต่อวินาทีเมื่อเทียบกับ Seedance 2.5 ที่ 720p และที่ 1080p มันเป็นเพียงหนึ่งในสองที่ขายพิกเซลจริง คำตอบของ Seedance 2.5 คือช่องอ้างอิง 50 ช่อง, ความพร้อมใช้งานจริง และ API ที่ใช้งานได้ซึ่งคุณสามารถส่งมอบงานได้ในบ่ายวันนี้
หมายเหตุแหล่งที่มาและใบอนุญาตสำหรับคลิปเนทีฟ 30 วินาทีเหล่านี้
ทุกคลิป Wan 3.0 และทุกพรอมต์ Wan 3.0 ในบทความนี้มาจากคู่มือผู้สร้าง Tongyi Wan 3.0 ที่เผยแพร่ต่อสาธารณะของ Alibaba นำมาใช้ซ้ำที่นี่เพื่อการเปรียบเทียบและวิจารณ์ ให้เครดิต ไม่มีการดัดแปลง และไม่ลบลายน้ำ การใช้เชิงพาณิชย์ของเอาต์พุต Seedance 2.5 อยู่ภายใต้ข้อกำหนดของ ByteDance และ Volcengine; การเรียกเก็บเงิน API และการจัดการข้อมูลในฝั่ง Atlas Cloud อยู่ภายใต้ข้อกำหนดของ Atlas Cloud เอง ไม่มีการใช้รูปเหมือนของบุคคลจริงในที่ใดในการทดสอบนี้ ถ้าคุณกำลังส่งมอบงานให้ลูกค้า ให้อ่านข้อกำหนดโมเดลสำหรับเอนด์พอยต์เฉพาะที่คุณเรียก ไม่ใช่สรุปบล็อกของข้อกำหนดเหล่านั้น
คำถามที่พบบ่อย
เนทีฟ 30 วินาทีของ Wan 3.0 เป็นการผ่านครั้งเดียวจริงหรือไม่ หรือเป็นคลิปที่ต่อกัน?
ผ่านครั้งเดียว Wan 3.0 สร้าง 2 ถึง 30 วินาทีในการสร้างครั้งเดียวด้วยตัวเลือกระยะเวลาอัจฉริยะ ดังนั้นมันสามารถตัดสินใจได้ว่าคลิปไม่ต้องการเต็ม 30 วินาที ซึ่งแตกต่างจากการขยายเฟรมสุดท้ายที่คลิปที่สองถูกสร้างจากเฟรมสุดท้ายของคลิปแรกและเอกลักษณ์ล่องลอยข้ามรอยต่อ
อันไหนคือ 1080p จริงที่ 30 วินาที, Wan 3.0 หรือ Seedance 2.5?
Wan 3.0 มันมีระดับ 1080p เนทีฟบนแผนราคา และไฟล์เดโม่ 30 วินาทีของ Alibaba เองวัดได้ 1920x1072 Seedance 2.5 สร้างแบบเนทีฟที่ 480p และ 720p เท่านั้น; ตัวเลือก 1080p, 1440p และ 4K เป็นการปรับปรุงจากแหล่ง 720p และเอกสาร API ของมันอธิบายระดับ 4K ว่า "ไม่ใช่การสร้าง 4K แบบเนทีฟ"
ภาพยังคงพังในวินาทีที่ 25 หรือไม่?
มันเป็นไปได้ แต่ความล้มเหลวเปลี่ยนรูปร่าง แทนที่จะเป็นรอยต่อที่มองเห็นได้ระหว่างคลิป คุณจะได้การเปลี่ยนรูปและความไม่ต่อเนื่องภายในช็อต ซึ่งกระจุกตัวอยู่ในส่วนการเคลื่อนไหวเร็ว และการอัปสเกลไม่ได้ลบมันออก การผลิตภาพยนตร์สั้น Seedance 2.5 ที่มีเอกสารบันทึกอัตราส่วนการถ่ายทำ 3.2 ต่อ 1 ดังนั้นวางแผนช็อตยาวด้วยคัฟเวอร์เรจ
โมเดลไหนรับข้อมูลอ้างอิงมากกว่า?
Seedance 2.5, มากกว่า: 30 ภาพ บวกวิดีโอ 10 ไฟล์ บวกไฟล์เสียง 10 ไฟล์ รวม 50 ไฟล์ โดยวิดีโอและเสียงอ้างอิงแต่ละประเภทจำกัดรวมกันไม่เกิน 30 วินาทีต่อคำขอ คู่มือของ Wan 3.0 จำกัดการอ้างอิงไว้ที่ 20 แต่เป็นรุ่นเดียวที่รับไฟล์ .pdf, .ppt, .xls, .doc, .txt และหน้าเว็บสดเป็นอินพุตสร้างสรรค์
Wan 3.0 จะมีน้ำหนักเปิดหรือไม่?
ไม่มีคำมั่นสัญญาอย่างเป็นทางการ ณ เดือนสิงหาคม 2026 เบต้าสาธารณะ ยังไม่มีการเผยแพร่น้ำหนัก Wan 3.0, จุดตรวจสอบ Hugging Face หรือโหนด ComfyUI และน้ำหนักเปิดอย่างเป็นทางการสำหรับสายวิดีโอหลักหยุดที่ Wan 2.2 (Kingy AI, สิงหาคม 2026) ปฏิบัติต่อสิ่งที่คุณอ่านเกี่ยวกับการปล่อยน้ำหนัก 3.0 เป็นการคาดเดาจนกว่า Alibaba จะบอกเป็นอย่างอื่น






