MiniMax H3 Developer เปิดตัวแล้ววันนี้ — ลด 60% เริ่มต้นเพียง $0.02 ต่อวินาที

Wan 3.0 ข้อกำหนด VRAM: ทำไม 80GB ถึงไม่เพียงพอ และอะไรที่ทำงานได้จริงในปัจจุบัน

ข้อกำหนด VRAM ของ Wan 3.0 คำนวณจากสเปก 1080P/30s ของตัวเอง: 13.5 เท่าของความยาวซีเควนซ์ ไม่มีน้ำหนักสาธารณะ และระดับของ Wan ในเครื่องที่ทำงานในปัจจุบัน

อัปเดตล่าสุด: Wan 3.0 เปิดให้บริการแล้วตั้งแต่วันที่ 24 สิงหาคม 2026

คุณเปิดแท็บหกแท็บ แต่ละแท็บแสดงตารางที่ดูสะอาดตา: 1.3B บน 8GB, 14B บน 24GB, Apache-2.0, เปิดตัวเมษายน 2026 คุณจึงเปิดหน้า Wan-AI บน Hugging Face เพื่อดาวน์โหลด checkpoint

27 repositories ตัวล่าสุดคือ Wan2.2

ตารางเหล่านั้นไม่ได้ล้าสมัย พวกมันถูกสร้างขึ้นมา ความต้องการ VRAM ของ Wan 3.0 ไม่สามารถถูกวัดโดยใครนอก Alibaba ได้ เพราะ Wan 3.0 เพิ่งเข้าสู่เบต้าสาธารณะเมื่อวันที่ 6 สิงหาคม 2026 และไม่เคยปล่อยไฟล์น้ำหนักออกมา ไม่มีอะไรให้ปล่อยในเดือนเมษายน

แล้วคำตอบที่แท้จริงคืออะไร? ยังไม่มีใครวัด Benchmark แต่สเปกชีตของ Wan 3.0 เองก็ตีกรอบคำตอบไว้อย่างชัดเจน และเราได้คำนวณให้คุณด้านล่างแล้ว

ประเด็นสำคัญ

  • ไม่มีน้ำหนัก Wan 3.0 อยู่ที่ไหนเลย ตาราง VRAM ทุกตารางบนเว็บในตอนนี้ถูกสร้างขึ้นมาล้วนๆ
  • Wan 3.0 เป็น API เบต้าของผู้พัฒนาโดยตรง: สูงสุด 30 วินาที, สูงสุด 1080P, ไม่มีระดับ 4K
  • สเปกของมันบ่งบอกว่ามีลำดับ latent มากกว่า 13.5 เท่าของคลิป 720P 5 วินาที ซึ่งคิดเป็นภาระ attention ~180 เท่า
  • ขีดจำกัดการทำงานในเครื่องจริงในตอนนี้คือ Wan2.2 TI2V-5B บน 24GB หรือ 6GB ด้วย quantization จากชุมชน
  • สำหรับผลลัพธ์ 1080P ในสัปดาห์นี้ ให้เช่าเวลาแทนที่จะซื้อ VRAM เปรียบเทียบ 768p กับ 2k

ความต้องการ VRAM ของ Wan ที่เห็นได้ชัด: เฟรมแรกเดียวกันที่อนิเมชันที่ระดับ 720P ทางซ้ายและระดับ 1080P ทางขวา ทั้งคู่เรนเดอร์โดยไม่มี GPU ในเครื่อง

เฟรมแรกเดียวกัน, พรอมต์การเคลื่อนไหวเดียวกัน, โมเดลเดียวกัน เปลี่ยนเฉพาะระดับความละเอียด: 720P ทางซ้ายที่ $0.50 สำหรับ 5 วินาที, 1080P ทางขวาที่ $0.75 ทั้งคู่เรนเดอร์บน Wan 2.7 โดยใช้ VRAM ในเครื่องเป็นศูนย์ และราคาบนแต่ละป้ายคือราคาที่ปุ่ม Run ให้จริง แสดงเป็น GIF เงียบ

นี่คือสิ่งที่ข้อโต้แย้งทั้งหมดนี้เกี่ยวกับ ไม่ใช่กิกะไบต์ แต่เป็นพิกเซล

ทำไมทุกตารางความต้องการ VRAM ของ Wan 3.0 ที่คุณพบถึงเป็นเรื่องแต่ง

สรุปก่อน: หน้าอันดับต้นๆ สำหรับคำค้นนี้ใช้ตัวเลขของ Wan 2.1 และ Wan 2.2 ซ้ำ แปะ "3.0" ลงไป และสร้างวันที่วางจำหน่ายขึ้นมา คุณสามารถพิสูจน์หักล้างทั้งหมดได้ภายในประมาณ 60 วินาที

ลองดูนี่สิ

หน้าโปรไฟล์ Hugging Face ของ Wan-AI ที่แสดงโมเดล AI ของพวกเขา

หน้า Hugging Face องค์กร Wan-AI แสดง 27 repositories โดยมี Wan2.2 เป็นเวอร์ชันสูงสุด พิสูจน์ว่าไม่มีน้ำหนัก Wan 3.0 สำหรับการทดสอบ VRAM ในเครื่อง

องค์กรอย่างเป็นทางการ Wan-AI บน Hugging Face, แท็บโมเดล, เรียงลำดับใหม่ล่าสุดก่อน 27 repos และหมายเลขเวอร์ชันสูงสุดในรายการคือ 2.2 (Hugging Face, สิงหาคม 2026)

ไม่มี repo Wan3.0 ไม่มี repo Wan2.7, Wan2.6 หรือ Wan2.5 เช่นกัน สิ่งที่ใหม่ที่สุดในองค์กรคือ Wan2.2-Animate-2-14B-Diffusers ซึ่งอัปเดตเมื่อเจ็ดวันที่แล้ว (Hugging Face, สิงหาคม 2026)

นี่คือการแจกแจงข้อกล่าวหาทีละข้อ

ตารางที่ 1: สิ่งที่คำแนะนำอ้าง vs สิ่งที่ตรวจสอบได้

ข้อกล่าวหาที่คุณจะพบในหน้าแรกตรวจสอบได้ ณ สิงหาคม 2026วิธีตรวจสอบด้วยตัวเอง
"Wan 3.0 ปล่อยน้ำหนัก 1.3B + 14B ในเดือนเมษายน 2026"Wan 3.0 เปิดเบต้าสาธารณะเมื่อ 6 สิงหาคม 2026 ไม่มีน้ำหนักในวันที่ใดๆโหลดหน้า org Wan-AI
"Wan 3.0 เป็น Apache-2.0"ไม่เคยมีไฟล์ใบอนุญาตสำหรับ 3.0 ถูกเผยแพร่ค้นหาใน org เพื่อหา repo 3.0 ไม่มีเลย
"1.3B ทำงานบน 8GB, 14B บน 24GB"เหล่านั้นคือตัวเลขของ Wan 2.1/2.2 Wan 2.2 A14B ต้องการ 80GBส่วนฮาร์ดแวร์ใน README ของ Wan2.2
"ระดับเวิร์กโฟลว์ 4K / 30s เต็มรูปแบบ"เบต้าสูงสุดที่ 1080P ระดับคือ 480P, 720P, 1080Pรายการราคาต่อวินาทีของ Alibaba เอง
"ทำงานใน ComfyUI / WanGP วันนี้"รายการที่รองรับของ WanGP ครอบคลุม Wan 2.1/2.2 เท่านั้นREADME ของ Wan2GP

สิ่งที่ Alibaba จัดส่งจริงในเดือนสิงหาคม 2026 คือผลิตภัณฑ์ API และเว็บ ไม่ใช่ checkpoint การสร้างหนึ่งครั้งสูงสุด 30 วินาที ความละเอียดสูงสุดที่ 1080P และรับอินพุตข้อความ รูปภาพ เสียง วิดีโอ และแม้แต่เอกสาร (doc, xls, ppt, pdf, md) เป็นอินพุตอ้างอิง ราคา API อยู่ที่ ¥0.3 / ¥0.6 / ¥1.2 ต่อวินาที สำหรับ 480P / 720P / 1080P (QbitAI, สิงหาคม 2026)

สังเกตสิ่งที่หายไปจากรายการนั้น: ลิงก์ดาวน์โหลด

ความต้องการ VRAM ของ Wan 3.0 คำนวณจากสเปกของมันเอง

สัญญา: เมื่อจบส่วนนี้ คุณจะรู้ว่าทำไม "แค่หา์ด 32GB" ถึงใช้ไม่ได้ พร้อมตัวเลขที่คุณสามารถคำนวณใหม่ได้เอง หลักฐาน: การคำนวณต้องใช้ข้อเท็จจริงที่เผยแพร่เพียงสองอย่างเท่านั้น อัตราส่วนการบีบอัด VAE ของ Wan และขีดจำกัด 1080P/30s ของ Wan 3.0

มาเริ่มกันเลย

มันคือความยาวลำดับ ไม่ใช่จำนวนพารามิเตอร์ ทุกคนจ้องที่ตัวเลข B นั่นเป็นตัวแปรที่ผิด

หน่วยความจำและการคำนวณของ video diffusion transformer จะปรับขนาดตามจำนวน token latent ที่ต้อง attention ซึ่งจำนวนนั้นมาจากความละเอียดคูณระยะเวลา ไม่ใช่จากพารามิเตอร์ VAE ของ Wan2.2 บีบอัดที่ 4x16x16 ในเวลา ความสูง และความกว้าง และ DiT patchify ทับอีกครั้ง ดังนั้นแต่ละ token latent จะครอบคลุมบล็อกพิกเซลประมาณ 4x32x32 (Wan2.2 README, สิงหาคม 2026) VAE รุ่นเก่า Wan2.1 บีบอัดที่ 4x8x8 ดังนั้นเมื่อรวมกับ patchify จะได้ 4x16x16 ต่อ token มากกว่า token ถึงสี่เท่าสำหรับคลิปเดียวกัน

ใช้ขีดจำกัดของ Wan 3.0 เองผ่านการคำนวณนี้ แล้วนี่คือสิ่งที่ออกมา

ตารางที่ 2: จำนวน token latent ตามคลิปเป้าหมาย (การคำนวณของเรา, 24fps)

คลิปเป้าหมายเฟรมเฟรม latentToken (VAE 2.2-gen)Token (VAE 2.1-gen)เทียบกับ 5s 720P
5s 480P (832x480)1213112,09048,3600.44x
5s 720P (1280x704)1213127,280109,1201.0x (พื้นฐาน)
10s 1080P (1920x1088)24161124,440497,7604.6x
30s 1080P (1920x1088)721181369,2401,476,96013.5x

อ่านแถวสุดท้ายอีกครั้ง ความสามารถหลักของ Wan 3.0 คือลำดับความยาวมากกว่า 13.5 เท่าของคลิป 720P 5 วินาทีที่การ์ด 4090 ของคุณกำลังทำงานหนักอยู่

และ self-attention เป็นกำลังสองของความยาวลำดับ 13.5 ยกกำลังสองคือประมาณ 180 ดังนั้นงาน attention สำหรับคลิป 1080P 30 วินาทีหนึ่งคลิปนั้นมีปริมาณประมาณ 180 เท่า ของงาน attention ของคลิป 720P 5 วินาทีหนึ่งคลิป ก่อนที่จะนับอะไรอื่น

นั่นคือตัวเลขที่ไม่มีใครใน SERP คำนวณได้ และมันเป็นเหตุผลว่าทำไม "ซื้อเพิ่มอีก 8 กิกะไบต์" จึงไม่ใช่แผน

แล้วมันหมายถึงอะไรในแง่ของกิกะไบต์? น้ำหนักเป็นส่วนที่น่าเบื่อ MoE 27B รวมที่ fp8 ใช้ประมาณ 27GB, bf16 ประมาณ 54GB MoE ช่วยในเรื่อง การคำนวณ ต่อสเต็ปเท่านั้น (A14B ของ Wan2.2 เปิดใช้งาน 14B จาก 27B พารามิเตอร์ต่อสเต็ป) ไม่ใช่สิ่งที่ต้องอยู่ในหน่วยความจำ

ส่วนที่น่าสนใจคือ activations สถานะซ่อนของเลเยอร์ transformer หนึ่งเลเยอร์ที่ model dim 5120 ใน bf16 มีค่าใช้จ่ายเท่ากับ tokens x 5120 x 2 bytes:

  • 5s 720P (27,280 tokens): 0.28 GB ต่อเลเยอร์
  • 30s 1080P (369,240 tokens): 3.8 GB ต่อเลเยอร์
  • 30s 1080P บน VAE 2.1-gen (1,476,960 tokens): 15.1 GB ต่อเลเยอร์

ต่อเลเยอร์ คูณด้วยจำนวนเลเยอร์ที่การใช้งาน attention ต้องเก็บไว้ เพิ่ม text encoder เพิ่ม VAE decode pass แล้วตัวเลข 80GB ก็ไม่ดูอนุรักษ์นิยมอีกต่อไป

ตารางที่ 3: VRAM โดยประมาณหากน้ำหนักถูกจัดส่ง (ประมาณการ ไม่ได้วัด)

คลิปเป้าหมายหากเป็นโมเดล 5B-class ที่มีการบีบอัดสูง (fp8)หากเป็น MoE A14B-class (fp8)คำตัดสินเชิงปฏิบัติ
5s 480P~8-10 GB~30-34 GBการ์ด 12GB เป็นไปได้สำหรับโมเดลเล็กเท่านั้น
5s 720P~10-14 GB~34-40 GBพื้น 16GB, สบายที่ 24GB
10s 1080P~20-28 GB~45-60 GBการ์ด 32GB เริ่มจะไม่พอแล้ว
30s 1080P~45-70 GB~90-140 GBไม่มีการ์ดผู้บริโภคตัวเดียว ที่ quantization ใดๆ

ทุกเซลล์ในตารางนั้นเป็น การประมาณการ ที่ได้จากตารางที่ 2 บวกกับขนาด checkpoint ที่เผยแพร่ ตัวเลขจริงขึ้นอยู่กับเคอร์เนล attention กลยุทธ์ offload และว่า Alibaba จะจัดส่งน้ำหนักหรือไม่ ปฏิบัติต่อมันเหมือนรูปร่างของปัญหา ไม่ใช่แผ่นข้อมูลจำเพาะ

รูปร่างชัดเจนพอ: การตั้งค่าระดับธงไม่เคยเป็นภาระงานของการ์ดผู้บริโภค

ความต้องการ VRAM ของ Wan ที่คุณสามารถทำได้จริงในวันนี้

นี่คือส่วนที่ตารางที่ถูกสร้างขึ้นมาแอบอ้างว่าเป็น ตัวเลขเหล่านี้เผยแพร่โดยทีม Wan และเป็นของจริง

ตารางที่ 4: ระดับ VRAM จริงของ Wan, สิงหาคม 2026

รูปแบบVRAM ขั้นต่ำความละเอียดความเร็วที่วัดได้ธงที่คุณต้องใช้น้ำหนัก
Wan2.2 T2V-A14B / I2V-A14B80GB GPU เดียว480P / 720Pไม่ได้เผยแพร่--offload_model True --convert_model_dtypeApache-2.0
Wan2.2 TI2V-5B24GB (RTX 4090)720P @ 24fps5s 720P ใน ต่ำกว่า 9 นาที--offload_model True --convert_model_dtype --t5_cpuApache-2.0
Wan 2.1 / 2.2 ผ่าน WanGP6GB ขึ้นไปส่วนใหญ่ 480Pช้ากว่า, คุณภาพลดลงint8 / fp8 / gguf / NVFP4 / Nunchakuพื้นฐาน Apache-2.0
Wan 2.5 / 2.6 / 2.7n/aAPI เท่านั้นn/an/aไม่มีเผยแพร่
Wan 3.0n/aAPI เท่านั้น, เบต้าผู้พัฒนาโดยตรงn/an/aไม่มีเผยแพร่

สองสิ่งในตารางนั้นสมควรดูอีกครั้ง

ประการแรก: แถว A14B มีธงประหยัดหน่วยความจำทั้งสองเปิดอยู่แล้ว และ ยังคง ต้องการ 80GB นั่นคือตัวเลข GPU เดียวอย่างเป็นทางการ ไม่ใช่ตัวเลขแบบไร้เดียงสา ประการที่สอง: แถว 5B คือคำตอบผู้บริโภคที่ซื่อสัตย์ และ README ของมันเองอ้างว่า 5 วินาทีของ 720P ในเวลาต่ำกว่า 9 นาทีบน 4090

ต่ำกว่า 24GB คุณอยู่ในอาณาเขตของชุมชน WanGP (โปรเจกต์ deepbeepmeep/Wan2GP ซึ่งอธิบายตัวเองว่าเป็นโมเดล generative "ที่เข้าถึงได้สำหรับคนที่การ์ดจอไม่แรง") ทำให้โมเดลที่เลือกทำงานได้ถึง 6GB โดยใช้ quantization int8, fp8, gguf, NVFP4 และ Nunchaku รองรับ Wan 2.1 และ 2.2 ไม่รองรับ 3.0 เพราะไม่มีอะไรให้รองรับ

ตอนนี้ส่วนที่ควรเปลี่ยนการตัดสินใจซื้อของคุณ: สมมติฐานที่ว่า "เวอร์ชันถัดไปจะเปิดเผย" ล้มเหลวสามครั้งติดต่อกัน Wan 2.2 เป็น Apache-2.0 Wan 2.5 กลายเป็น API เท่านั้น Wan 2.6 และ 2.7 ไม่เคยจัดส่งน้ำหนัก Wan 3.0 ไม่มีไฟล์ใบอนุญาตเลย

การซื้อการ์ดวันนี้โดยเดิมพันว่าน้ำหนัก 3.0 จะลงจอดในวันพรุ่งนี้คือการเดิมพันสวนทางกับแนวโน้มสามรุ่น

สำหรับการรันโฮสต์ปัจจุบัน เปิด Wan 3.0 บน Atlas Cloud และทดสอบพรอมต์เช่นด้านล่างก่อนที่คุณจะเผยแพร่เวิร์กโฟลว์

ภาพหน้าจอพรอมต์และเอฟเฟกต์ที่สร้างจาก Wan 3.0 สำหรับ wan-3.0-vram-requirements

ภาพหน้าจอผลลัพธ์จากพรอมต์ของ Wan 3.0: เส้นทางการเรนเดอร์ที่ไม่มี GPU

ข้ามความต้องการ VRAM: เวิร์กโฟลว์ Wan ที่ไม่มี GPU

ขอพูดตรงๆ เกี่ยวกับขอบเขตก่อน เพราะหน้าส่วนใหญ่ในกลุ่มนี้จะไม่พูด

ไม่มีใครโฮสต์ Wan 3.0 ไม่ใช่ Atlas Cloud ไม่ใช่ใครอื่น ไม่มีน้ำหนัก ดังนั้นจึงไม่มี inference จากบุคคลที่สาม หากหน้าใดเสนอ "การเข้าถึง API Wan 3.0" แสดงว่ากำลังขายอย่างอื่นให้คุณ

สิ่งที่คุณได้รับได้ทันทีคือส่วนอื่นๆ ของตระกูล โฮสต์ คิดเงินต่อวินาที โดยไม่มี VRAM เข้ามาเกี่ยวข้อง Atlas Cloud รัน Wan 2.2 ถึง 2.7 ผ่าน API เดียวและแท็บเบราว์เซอร์เดียว และ Wan 2.7 ที่ 1080P เป็นสิ่งที่ใกล้เคียงที่สุดกับเอาต์พุตคลาส 3.0 ที่มีอยู่นอกช่องทางเบต้าของ Alibaba เอง

สำหรับผู้อ่านที่บทความนี้เขียนขึ้น มันแก้ปัญหาเฉพาะได้ คุณกำลังจะใช้เงินสี่หลักกับการ์ดเพื่อไล่ตาม checkpoint ที่ไม่มีอยู่จริง การเช่าเวลาหมายความว่าคุณจะรู้ว่าผลลัพธ์จริงๆ หน้าตาเป็นอย่างไรก่อนที่คุณจะซื้ออะไร และถ้าน้ำหนัก 3.0 ไม่เคยลดราคา ก็ไม่มีอะไรเสียหายนอกจากเงินไม่กี่ดอลลาร์

ตารางที่ 5: ตระกูล Wan ที่โฮสต์ (ราคาตามรายการ ณ สิงหาคม 2026)

รหัสโมเดลความละเอียดระยะเวลาสูงสุดราคาเหมาะสำหรับ
atlascloud/wan-2.2-turbo/image-to-video480p / 720p / 1080p, 30fps5s เท่านั้น$0.02 / sถูกที่สุดในตระกูลสำหรับลองดู
atlascloud/wan-2.2/image-to-video480P ดั้งเดิม + 720P VSR3-10s$0.03 / sแบทช์ประหยัดงบ
alibaba/wan-2.5/text-to-videoสูงสุด 1920x108010s$0.035 / s1080P ข้อความเป็นวิดีโอราคาถูก
alibaba/wan-2.6/text-to-videoสูงสุด 1920x10805 / 10 / 15s$0.07 / sการถ่ายที่ยาวขึ้น ไม่ต้องใช้เฟรมแรก
alibaba/wan-2.7/image-to-video720P / 1080P, plus 1080P-SR and 1440P-SR15s$0.10 / s listระดับที่ใกล้เคียงกับเอาต์พุตคลาส 3.0 มากที่สุด
alibaba/wan-2.2/animate-mixสลับตัวละครในฟุตเทจที่มีอยู่ตรงกับคลิปต้นฉบับของคุณ$0.126 / sการสลับตัวละครลงในช็อต

คำเตือนหนึ่งข้อก่อนการสอน เพราะมันจะแสดงในใบแจ้งหนี้ของคุณ: ราคาตามรายการคือราคาขั้นต่ำ หน้า Wan 2.7 ระบุราคา $0.10 ต่อวินาที ในการรันของเราในเดือนสิงหาคม 2026 งานห้าวินาทีเดียวกันระบุราคา $0.50 ที่ระดับ 720P และ $0.75 ที่ 1080P ดังนั้นระดับธงคิดค่าบริการที่ $0.15 ต่อวินาที ซึ่งเป็นครึ่งหนึ่งของอัตราที่ระบุไว้ อ่านราคาที่ปุ่มให้คุณก่อนคลิกเสมอ

ตารางที่ 6: สี่เส้นทางสู่ 30 วินาทีของ 1080P

เส้นทางเงินต้นต่อ 30s ของ 1080Pคุณได้มันจริงหรือ?
ซื้อการ์ด 24GB (คลาส 4090)~$1,600-2,000ค่าไฟฟ้าไม่ 24GB รัน Wan2.2 TI2V-5B ที่ 720P ไม่มีน้ำหนัก 3.0 อยู่
เช่าการ์ด 80GBรายชั่วโมงชั่วโมงของการคำนวณ + การตั้งค่ามีแค่ Wan 2.2 A14B และยังไม่ใช่ 1080P/30s
เบต้าผู้พัฒนาโดยตรงของ Alibabaไม่มี¥1.2/s x 30 = ¥36 (~$5)ใช่ คลิปต่อเนื่องหนึ่งคลิป, เฉพาะช่องทางผู้พัฒนาโดยตรง
Wan 2.7 ที่โฮสต์ที่ 1080Pไม่มี2 x 15s ที่ ~$0.15/s = ~$4.50ฟุตเทจ 30 วินาที แต่เป็นสองคลิป (ขีดจำกัด 15s)

ทำการหาร ที่ประมาณ $4.50 ต่อ 30 วินาทีของ 1080P การ์ดราคา $2,000 ต้องใช้การเรนเดอร์ 30 วินาทีประมาณ 440 ครั้งเพื่อถึงจุดคุ้มทุน และมันยังไม่สามารถสร้างแม้แต่ครั้งเดียว

นั่นคือข้อโต้แย้ง ตอนนี้เป็นขั้นตอนสามขั้นตอนเพื่อให้คุณตัดสินผลลัพธ์ด้วยตัวเอง

ขั้นตอนที่ 1: ล็อคเฟรมแรกที่ 16:9

ทุกการเปรียบเทียบ VRAM ที่ซื่อสัตย์ต้องการตัวแปรเดียว ดังนั้นเราจึงกำหนดเฟรมแรก จากนั้นป้อนเฟรมที่เหมือนกันและพรอมต์การเคลื่อนไหวที่เหมือนกันให้กับทั้งสองระดับ ความแตกต่างใดๆ ที่คุณเห็นหลังจากนั้นคือระดับ ไม่ใช่ลูกเต๋า

เปิด Qwen Image 2.0 Pro text-to-image playground และวางสิ่งนี้:

text
1ภาพกว้าง cinematic ภายในโฮมออฟฟิศมืดๆ เวลาตีสอง: วิศวกรหนุ่มในฮู้ดสีเทาเอนหลังบนเก้าอี้ทำงาน ใบหน้าสว่างด้วยแสงจากจอสามจอที่แสดงไทม์ไลน์วิดีโอที่หยุดไว้ ข้างโต๊ะมีเคส PC เปิดอยู่เรืองแสง มองเห็นการ์ดกราฟิกขนาดใหญ่พิเศษใบหนึ่งด้านใน พัดลมกำลังหมุน ฝุ่นละอองในอากาศ การจัดสี teal-and-amber ความชัดลึกต่ำ เลนส์ anamorphic 35mm เสมือนจริง รายละเอียดสูง 16:9
2

การตั้งค่า: คลิกชิปขนาด 16:9 ซึ่งจะปรับเฟรมเป็น 1280 x 720 และปล่อยให้อย่างอื่นเป็นค่าเริ่มต้น ราคาคือ $0.06 ต่อภาพ (ปัจจุบันลด 20% จาก $0.075) กล่องความกว้างและความสูงสูงสุดได้ถึง 2048 ต่อด้านหากคุณต้องการเฟรมที่ใหญ่ขึ้น แต่ค่าเริ่มต้นของชิปนั้นมีรูปร่างที่เหมาะสมสำหรับทั้งสองระดับวิดีโอแล้ว

ทำไมต้องเป็นฉากนี้? เพราะมันคือตัวผู้อ่าน เก็บไฟล์เอาต์พุตไว้ คุณต้องการมันสองครั้ง

ภาพหน้าจออินเทอร์เฟซตัวสร้างภาพ AI ที่แสดงอินพุตและเอาต์พุต

Qwen Image 2.0 Pro playground บน Atlas Cloud พร้อมชิปขนาด 16:9 ที่เลือก และเฟรมแรก 1280x720 ที่เสร็จแล้วในแผงเอาต์พุต

ขั้นตอนที่ 1 เสร็จสมบูรณ์: ชิป 16:9 ที่เลือกที่ 1280 x 720 และเฟรมแรกที่ทั้งสองระดับวิดีโอจะเริ่มต้น $0.06 บนปุ่ม Run

ขั้นตอนที่ 2: อนิเมชันที่ระดับ VRAM 720P

นี่คือตัวแทนของสิ่งที่การตั้งค่าในเครื่อง 24GB จริงจะได้: 720P ห้าวินาที และนั่นคือขีดจำกัด

ทางเลือกที่ตั้งใจไว้หนึ่งอย่าง ที่นี่ แทนที่จะสลับโมเดลระหว่างสองระดับ เราจะรัน โมเดลเดียวกันที่ทั้งสองระดับ ดังนั้นตัวแปรเดียวในการเปรียบเทียบคือระดับความละเอียด โหลดภาพจากขั้นตอนที่ 1 เป็นเฟรมแรกใน Wan 2.7 image-to-video playground จากนั้นวางพรอมต์การเคลื่อนไหวนี้:

text
1วิศวกรค่อยๆ โน้มตัวไปข้างหน้าและขยี้ตา; แสงจอเรืองแสงกระพริบเมื่อไทม์ไลน์เลื่อน; กล้องขยับเข้าไปเล็กน้อย; ฝุ่นละอองลอยผ่านลำแสง; การสั่นไหวของมือถือเล็กน้อย; ช็อตต่อเนื่องเดียว ไม่มีการตัด
2

การตั้งค่า: ความละเอียด 720P ระยะเวลา 5s อย่างอื่นเป็นค่าเริ่มต้น ปุ่ม Run ระบุราคา $0.50 ซึ่งเป็นอัตราตามรายการ $0.10 ต่อวินาทีคูณห้าวินาที จดตัวเลขนั้นไว้ เพราะขั้นตอนที่ 3 จะเปลี่ยนมัน

อินเทอร์เฟซสร้างวิดีโอ AI แสดงอินพุตพรอมต์ข้อความและเอาต์พุตวิดีโอ

Wan 2.7 image-to-video playground ที่ระดับ 720P พร้อมเฟรมแรกที่โหลดแล้ว ระยะเวลา 5s และคลิปที่เสร็จแล้วในแผงเอาต์พุต

ขั้นตอนที่ 2 เสร็จสมบูรณ์: ระดับ 720P, 5 วินาที, ราคา $0.50, พร้อมคลิปจริงในแผงเอาต์พุต

ขั้นตอนที่ 3: อนิเมชันเฟรมเดียวกันที่ 1080P โดยไม่มี GPU ในเครื่อง

หน้าเดียวกัน, เฟรมแรกเดียวกัน, พรอมต์การเคลื่อนไหวเหมือนกันทุกคำ, ระยะเวลา 5 วินาทีเดียวกัน เปลี่ยนตัวควบคุมเพียงตัวเดียว: ตั้งค่าความละเอียดเป็น 1080P

ราคา Run เปลี่ยนจาก $0.50 เป็น $0.75 นั่นคือ $0.15 ต่อวินาทีของคุณ วัดได้ บนหน้าที่ระบุราคาตามรายการ $0.10

ข้อผิดพลาดในการตั้งค่าสองอย่างที่ต้องระวัง ซึ่งทั้งสองอย่างทำให้เราต้องเสียเงินรันจริงเพื่อเรียนรู้:

  • ตัวควบคุมระยะเวลาไม่ได้ยืนยันเสมอไป เราตั้งค่าระยะเวลาเป็น 10 วินาที ช่องแสดง 10 แต่งานยังคงเรนเดอร์ 5 ราคาของปุ่ม Run เป็นแหล่งความจริงเดียว: ที่ $0.15 ต่อวินาที งาน 1080P 10 วินาทีจริงต้องอ่านได้ประมาณ $1.50 ดังนั้นราคา $0.75 หมายความว่าคุณยังคงซื้อ 5 วินาทีไม่ว่าสไลเดอร์จะแสดงอะไรก็ตาม อ่านราคา ไม่ใช่ช่อง
  • ยืนยันว่าภาพของคุณถูกโหลดแล้ว หากช่องอ้างอิงยังคงมีภาพตัวอย่างที่ตั้งไว้ล่วงหน้าของหน้า การรันจะสร้างสิ่งที่แตกต่างออกไปอย่างมีความสุข ดูภาพขนาดย่อก่อนคลิก อินเทอร์เฟซสร้างวิดีโอ AI แสดงพรอมต์ข้อความและวิดีโอที่สร้าง

Wan 2.7 image-to-video playground ที่ระดับ 1080P โดยปุ่ม Run ระบุราคา $0.75 และคลิป 1080P ที่เสร็จแล้วในแผงเอาต์พุต

ขั้นตอนที่ 3 เสร็จสมบูรณ์ที่ระดับ 1080P ราคา Run คือประเด็น: $0.75 สำหรับห้าวินาทีเดียวกันที่ราคา $0.50 ต่ำกว่าหนึ่งระดับ บนหน้าที่ระบุ $0.10 ต่อวินาที

เรนเดอร์ทั้งสองอยู่ในคลิปที่ด้านบนของบทความนี้ เคียงข้างกัน นั่นคือข้อโต้แย้ง VRAM ทั้งหมดในห้าวินาที: เอาต์พุตสองระดับ พร้อมต์เดียวกัน และไม่เกี่ยวข้องกับหน่วยความจำวิดีโอในเครื่องแม้แต่กิกะไบต์เดียว

รูปแบบต่างๆ ที่น่าลอง ลดลงเหลือ 480P เพื่อการลองดูราคาถูกก่อนที่จะตัดสินใจเรนเดอร์ 1080P เปลี่ยนเป็น alibaba/wan-2.6/text-to-video ที่ $0.07/s เมื่อคุณไม่มีเฟรมแรกและต้องการ 15 วินาทีในครั้งเดียว ใช้ alibaba/wan-2.2/animate-mix ที่ $0.126/s เพื่อใส่ตัวละครอื่นลงในฟุตเทจที่คุณมีอยู่แล้ว และถ้าคุณต้องการใกล้เคียง 30 วินาที ให้จัดงบประมาณสำหรับสองคลิป เนื่องจากขีดจำกัด 15 วินาทีต่อคลิปที่แทบไม่มีบทช่วยสอนกล่าวถึง

คำถามที่พบบ่อย

GPU 24GB สามารถรัน Wan 3.0 ได้หรือไม่?

ไม่ใช่ตอนนี้ เพราะไม่มีน้ำหนักให้โหลด หากพวกเขาจัดส่งในอนาคต คณิตศาสตร์ในตารางที่ 2 บอกว่า 24GB จะได้ 480P และคลิปสั้นภายใต้ quantization ที่รุนแรง การตั้งค่าระดับธง 1080P/30s เป็นคนละระดับกัน และไม่สามารถเข้าถึงได้บนการ์ดผู้บริโภคตัวเดียว

ฉันจะดาวน์โหลดน้ำหนัก Wan 3.0 ได้ที่ไหน?

ไม่มีที่ไหน องค์กร Wan-AI บน Hugging Face สูงสุดที่ Wan2.2 และ org GitHub Wan-Video ไม่มี repo inference 3.0 และไม่มีใบอนุญาต 3.0 เว็บไซต์ใดๆ ที่เสนอ "ดาวน์โหลด checkpoint Wan 3.0" ไม่ได้แจกจ่ายสิ่งที่มันอ้าง

Wan 3.0 เป็นโอเพนซอร์สหรือ Apache 2.0 หรือไม่?

ไม่มีใบอนุญาตที่เผยแพร่ แนวโน้มกำลังไปในทิศทางตรงกันข้าม: Wan 2.2 เป็น Apache-2.0, Wan 2.5 กลายเป็น API เท่านั้น และ 2.6 และ 2.7 ไม่ได้จัดส่งน้ำหนักเลย สามรุ่นติดต่อกันที่ปิดตัวลง วางแผนตามนั้น

โมเดล Wan ที่ใช้ VRAM ต่ำที่สุดที่ฉันสามารถรันได้จริงในวันนี้คืออะไร?

Wan2.2 TI2V-5B อย่างเป็นทางการ 24GB บน 4090 ทำ 5s ของ 720P ในเวลาต่ำกว่า 9 นาที ต่ำกว่านั้น เส้นทาง quantization ของ WanGP ถึง 6GB ในโมเดลที่เลือก และคุณต้องจ่ายด้วยความเร็วและรายละเอียด

Wan 3.0 vs Wan 2.7: อันไหนที่ฉันสามารถรันในเครื่องได้?

ไม่มีเลย ทั้งคู่เป็น API เท่านั้น หากข้อกำหนดคือ "รันบนเครื่องของฉัน" ตัวเลือกของคุณคือตระกูล Wan 2.1 และ 2.2 หากข้อกำหนดคือเอาต์พุตคลาส 2.7 นั่นคือการเรียกแบบโฮสต์ ไม่ใช่การติดตั้งในเครื่อง

ถ้าฉันรันในเครื่องไม่ได้ ฉันจะได้ 30 วินาทีของ 1080P ตอนนี้ได้อย่างไร?

เบต้าผู้พัฒนาโดยตรงของ Alibaba คิดเงินต่อวินาทีและส่งมอบ 30 วินาทีในคลิปเดียว นอกช่องทางเหล่านั้นมีขีดจำกัด 15 วินาทีต่อคลิปที่เข้มงวด ดังนั้น 30 วินาทีหมายถึงการต่อสองคลิป ในการทดสอบการต่อเนื่อง Wan 2.7 ของเรา ข้อจำกัดนั้นเข้มงวด: ส่วนต้นฉบับต้องมีความยาว 2 ถึง 10 วินาที เอาต์พุตต้องยาวกว่าต้นฉบับอย่างเคร่งครัด เฟรมต้นฉบับไม่ได้รับการรักษาไว้ และการต่อเนื่องแบบลูกโซ่ไม่ได้สะสมความยาว บทช่วยสอนส่วนใหญ่ไม่เคยพูดถึงเรื่องนั้น

ดังนั้นเวอร์ชันสั้นของคำถาม ความต้องการ VRAM ของ Wan 3.0 ทั้งหมด: หยุดหาการ์ด เพราะ checkpoint ที่คุณจะซื้อมันไม่มีอยู่ รัน Wan 2.2 ในเครื่องหากคุณต้องการน้ำหนักบนดิสก์ และเช่าเวลาสำหรับ 1080P เมื่อคุณต้องการเอาต์พุตที่ตารางปลอมกำลังขาย

โมเดลล่าสุด

API เดียวสำหรับ AI สื่อทุกประเภท

สำรวจโมเดลทั้งหมด