อัปโหลดสเปรดชีตหนึ่งแผ่น แล้วได้รับแอนิเมชันธุรกิจความยาว 23 วินาทีพร้อมดนตรี
นั่นคือคำมั่นสัญญาของ Wan 3.0 document to video ซึ่งเป็นฟีเจอร์ป้อนเอกสารโดยตรงรุ่นแรกของตระกูล และเดโมอย่างเป็นทางการก็ทำตามคำมั่นนั้นได้จริงมากกว่าที่ฉันคาดไว้ ตัวเลขถูกต้อง เช็คได้ $1,580 เติบโตเป็น $3,460 ป้ายอ่านว่า +45.7% และตัวเลขเหล่านั้นตรงกลับไปยังเซลล์เฉพาะในแผ่นต้นทาง
จากนั้นฉันลาก playhead ไปที่ตำแหน่ง 12 วินาที และอ่านคำอธิบายแผนภูมิ
"Southeasta North America"
สองภูมิภาคขายถูกบีบรวมเป็นคำที่ไม่มีอยู่จริง นี่คือเส้นน้ำที่แท้จริงของ document-to-video ในปี 2026: โมเดลอ่านตารางของคุณได้จริง แต่ก็ยังวาดแผนภูมิของคุณไม่ได้ ด้านล่างนี้คือการตรวจสอบแบบเฟรมต่อเฟรมที่ไม่มีใครตีพิมพ์มาก่อน พร้อมกับห่วงโซ่สามขั้นตอนที่คุณสามารถใช้ได้จริงในบ่ายนี้
ประเด็นสำคัญ
- Wan 3.0 รองรับ 1 ไฟล์หรือ 1 ลิงก์ สูงสุด 100MB หรือ 50 หน้า และเอาต์พุตสูงสุด 30 วินาทีที่ 1080p
- มันสร้างภาพยนตร์จากเอกสารของคุณ ไม่ใช่เปลี่ยนสไลด์ 3 ให้เป็นช็อต 3
- ค่าในเซลล์คงอยู่ครบถ้วน แต่คำอธิบายแผนภูมิ เส้นสเกลแกน และตัวคั่นหลักพัน ไม่คงอยู่
- มีข้อจำกัดที่ชัดเจน: ไม่มี 4K, ไม่มีโอเพนเวท, ช่องทางเฉพาะของบริษัทเท่านั้น
- โมเดลบริบทยาวบวกโมเดลวิดีโอ 15 วินาทีสามารถจำลองสิ่งนี้ได้เกือบทั้งหมดในวันนี้

เอาต์พุต Wan 3.0 document to video: เดโม xlsx อย่างเป็นทางการแสดงเป็นภาพยนตร์ข้อมูลแอนิเมชันสไตล์ Keynote
การสาธิต: เดโมเบต้าสาธารณะอย่างเป็นทางการของ Wan 3.0 จาก Alibaba ป้อน .xlsx ของ GMV รายเดือน รับเอาต์พุตเป็นภาพยนตร์ข้อมูลแอนิเมชันยาว 23 วินาที ที่นี่แสดงเป็น GIF เงียบ; ไฟล์ที่ส่งมามีแทร็กเสียง AAC สเตอริโอ 44.1kHz ที่มา: คู่มือผู้สร้าง Wan 3.0 อย่างเป็นทางการของ Alibaba
สิ่งที่ Wan 3.0 Document to Video ทำได้จริง
ฉบับสั้น เพื่อให้คุณไปต่อได้ภายในหนึ่งนาทีถ้านั่นคือทั้งหมดที่คุณต้องการ
คุณส่งเอกสารหนึ่งไฟล์หรือหนึ่งลิงก์เว็บ มันอ่านทั้งเอกสาร ตัดสินใจว่าเรื่องราวคืออะไร และสร้างวิดีโอพร้อมภาพและเสียงในรอบเดียว สูงสุด 30 วินาที สูงสุด 1080p มันไม่เดินตามหน้าของคุณตามลำดับ
นี่คือข้อจำกัดที่ควบคุมโปรเจกต์จริง
| สเปค | การป้อนเอกสาร Wan 3.0 |
|---|---|
| รูปแบบ | doc, xls, ppt, pdf, txt, md, พร้อม key / pages / numbers และลิงก์เว็บธรรมดา |
| จำนวนอินพุตต่องาน | 1 ไฟล์ หรือ 1 ลิงก์ (ไม่ใช่ทั้งสองอย่าง ไม่ใช่หลายไฟล์) |
| ขีดจำกัดขนาด | 100MB |
| ขีดจำกัดหน้า | 50 หน้า |
| เอาต์พุตสูงสุด | 30 วินาที, รอบต่อเนื่องเดี่ยว |
| ความละเอียดสูงสุด | 1080p (ไม่มีระดับ 4K) |
| เสียง | สร้างในรอบเดียวกับภาพ |
| โอเพนเวท | ไม่มี; Wan 2.2 ยังคงเป็นรุ่นโอเพนเวทล่าสุด |
| หาได้ที่ไหน | Alibaba Cloud Model Studio (Bailian) และ Qwen Cloud ต้องได้รับเชิญ |
เบต้าสาธารณะเปิดเมื่อวันที่ 6 สิงหาคม 2026 (AgentUpdate, สิงหาคม 2026) รายการรูปแบบและแผ่นราคาสองแผ่นที่เผยแพร่มาจากการรวบรวมสเปคแยกต่างหาก (Ngram, สิงหาคม 2026)
คู่มืออย่างเป็นทางการมาพร้อมกรณีการใช้งานเอกสาร 4 กรณี และพวกมันสอดคล้องกับงานสี่ประเภทที่ผู้คนจ่ายเงินให้เอเจนซี่อยู่แล้ว:
- เอกสารข้อเสนอเป็นภาพยนตร์แบรนด์ เอกสารเสนอขายสกินแคร์กลายเป็นโฆษณา 30 วินาทีพร้อมนักแสดงนำและเรื่องราวแสงยามเช้า
- สื่อการสอนเป็นบทเรียนวิดีโอ รายการสารานุกรมกลายเป็นคลาสแอนิเมชันสำหรับนักเรียน ป.1
- สเปรดชีตเป็นแผนภูมิแอนิเมชัน เดโมด้านบน และยากที่สุดในสี่กรณี
- รายงานเป็นสรุปแบบพูด รายงานที่เขียนขึ้นกลายเป็นการบรรยายสรุปสไตล์พิธีกร
ตอนนี้คือจุดที่บทความส่วนใหญ่จัดหมวดหมู่ผิด
คู่แข่งในกลุ่ม "PDF to video" ไม่ได้ทำแบบนี้ Kapwing's document-to-video ดึงข้อความออกจากไฟล์ของคุณแล้ววางลงบนไทม์ไลน์ ไม่มีการสร้างฉากและไม่มีพิธีกร Pictory และ Powtoon ประกอบฟุตเทจสต็อกหรือแอนิเมชันเทมเพลต และหน้าเว็บของ Powtoon เองก็โฆษณาอวาตาร์ AI และเสียงอ่านสคริปต์ของคุณ ทั้งสามผลิตสไลด์พร้อมเสียงบรรยาย
| Wan 3.0 | Kapwing Document to Video | Pictory | Powtoon Anything-to-Video | |
|---|---|---|---|---|
| สิ่งที่ได้ | ภาพยนตร์ที่สร้างขึ้น | ข้อความของคุณบนไทม์ไลน์ | ฟุตเทจสต็อกตัดตามสคริปต์ | แอนิเมชันเทมเพลต |
| สร้างภาพใหม่ | ใช่ ทุกเฟรม | ไม่ | ไม่, คลิปจากคลัง | ไม่, ทรัพย์สินเทมเพลต |
| พิธีกร AI | ไม่มีโดยค่าเริ่มต้น | ไม่มี | มีเสียงพากย์ให้เลือก | อวาตาร์และเสียง |
| เสียง | สร้างพร้อมภาพ | คุณเพิ่มเอง | เสียงพากย์ TTS | เสียงพากย์ TTS |
| เอาต์พุตเดี่ยวยาวที่สุด | 30 วินาที | ความยาวโปรเจกต์ | ความยาวโปรเจกต์ | ความยาวโปรเจกต์ |
| การเข้าถึง | ต้องเชิญ, ช่องทางบริษัท | สาธารณะ | สาธารณะ | สาธารณะ |
อ่านตารางนั้นสองครั้ง เพราะมันคือข้อโต้แย้งทั้งหมด: สิ่งเหล่านี้ไม่ใช่คู่แข่งในหมวดหมู่เดียวกัน อันหนึ่งทำสไลด์โชว์พร้อมเสียงบรรยาย อีกอันทำฟุตเทจที่ไม่เคยมีมาก่อน การเปรียบเทียบราคาต่อนาทีก็เหมือนการเปรียบเทียบเครื่องถ่ายเอกสารกับทีมงานถ่ายทำ
Wan 3.0 สามารถทำสไลด์โชว์แบบนั้นได้หรือไม่? ได้ และนั่นคือข้อแม้ที่ซื่อสัตย์
ตัวอย่างตรงกันข้าม: เมื่อขอให้เปลี่ยนหน้าเว็บเกี่ยวกับกลศาสตร์ควอนตัมเป็นคำอธิบายสนุกๆ Wan 3.0 ผลิตรูปแบบพิธีกรพร้อมคำบรรยายตามที่คู่แข่งขายได้พอดี มันชนกำแพง 30 วินาทีที่ 30.02 วินาที เดโมเบต้าสาธารณะอย่างเป็นทางการของ Alibaba มีเสียง
ดังนั้นความแตกต่างไม่ใช่ Wan 3.0 ไม่สามารถสร้างคำอธิบายแบบมีพิธีกรได้ แต่คือกับคู่แข่ง รูปแบบนั้นเป็นสิ่งเดียวที่มีในเมนู
ทำไม Wan 3.0 Document to Video ถึงทำลายแผนภูมิแต่เก็บตัวเลขของคุณไว้
นี่คือสิ่งที่มีประโยชน์ที่สุดในบทความนี้: ฉันดึงเฟรมที่เว้นระยะเท่ากัน 12 เฟรมจากเดโมสเปรดชีตอย่างเป็นทางการและอ่านทุกสัญลักษณ์
คำตัดสินแยกออกเป็นสองส่วนชัดเจน ค่าผ่าน เฟอร์นิเจอร์แผนภูมิล้มเหลว
สิ่งที่รอด ที่ตำแหน่ง 4 วินาที เฟรมอ่านว่า $1,580 ลูกศรสีเทาบาง $3,460 คำบรรยาย "Monthly GMV Growth" และป้ายสีปะการังอ่านว่า +45.7% ตัวพิมพ์สะอาด เครื่องหมายจุลภาคอยู่ในตำแหน่งที่ถูกต้อง ไม่มีตัวอักษรเสียหาย พรอมต์ที่อยู่เบื้องหลังเดโมนี้อ้างถึงเซลล์สเปรดชีตเฉพาะ และตัวเลขบนหน้าจอตรงกับเซลล์เหล่านั้น การทดสอบของบุคคลที่สามในเด็คผลิตภัณฑ์ 8 หน้าพบสิ่งเดียวกัน: 45g, 12 hours และ 55 degrees แสดงผลถูกต้องทั้งหมด และสโลแกนปิดท้ายออกมาโดยไม่มีตัวอักษรผิดแม้แต่ตัวเดียว (AI-Driven Lab, สิงหาคม 2026)
นั่นตอบคำถามที่ทีมการเงินและ L&D ต้องการรู้จริงๆ ตัวเลขของคุณไม่กลายพันธุ์อย่างเงียบๆ
สิ่งที่พัง เฟรมแผนภูมิเป็นเรื่องที่แตกต่าง

การตรวจสอบเฟรม Wan 3.0 document to video แสดงคำอธิบายแผนภูมิที่รวมกันและแกน y ที่พัง
หยุดที่ 12 วินาทีในเดโมอย่างเป็นทางการ ข้อบกพร่องสามแห่งในหนึ่งเฟรม: ชื่อสองภูมิภาครวมกันเป็น "Southeasta North America", "North America" ถูกซ้ำเป็นซีรีส์ของตัวเอง และแกน y อ่านว่า 30, 60, 70 ในขณะที่ป้ายข้อมูลด้านบนบอกว่า $3,880
นับความล้มเหลวในเฟรมเดียวนั้น:
- คำอธิบายรวมกัน "Southeast Asia" และ "North America" ชนกันเป็น "Southeasta North America" จากนั้น "North America" ปรากฏอีกครั้งเป็นซีรีส์แยก ดังนั้นหนึ่งภูมิภาคถูกติดป้ายสองครั้งและอีกหนึ่งภูมิภาคหายไป
- แกน y ที่ไม่ใช่สเกล เส้นขีดอ่านว่า 30, 60, 70 ช่องว่างพิกเซลเท่ากัน ค่าไม่เท่ากัน และ 40 กับ 50 หายไป
- แกนและป้ายในหน่วยต่างกัน เส้นกริดสูงสุดคือ 70 ป้ายที่ปักหมุดที่จุดข้อมูลบนสุดบอกว่า $3,880
- การเลื่อนขนาดตามเส้นเดียว ป้ายบนเส้นโค้งบนสุดเริ่มที่ $330 และ $335 จากนั้นลงที่ $3,970 และ $3,880 เส้นที่เพิ่มขึ้นอย่างราบรื่นไม่สามารถมีการกระโดดสิบเท่าระหว่างจุดสองจุดที่อยู่ติดกันได้ ป้ายสองจุดที่อยู่ระหว่างนั้นเบลอเกินกว่าจะอ่านได้อย่างมั่นใจ ซึ่งเป็นคำตอบในตัวของมันเอง
ส่วนแผนภูมิแท่งก็ทำซ้ำรูปแบบ แท่งสี่แท่งมี $1750, $1,580, $2,350 และ $2,580 ดังนั้นแท่งที่สั้นที่สุดมีตัวเลขสูงเป็นอันดับสอง และป้ายแรกหายเครื่องหมายจุลภาคหลักพันในขณะที่อีกสามป้ายคงไว้ ถัดจากนั้นมีตัวเลขการเติบโตสีเขียวห้าตัวสำหรับแท่งสี่แท่ง และส่วนโดนัทตรงกลางคือ $89,7M ซึ่งเป็นเครื่องหมายจุลภาคที่ควรเป็นจุดทศนิยม
สังเกตว่าสิ่งเหล่านี้ทั้งหมดมีอะไรเหมือนกัน ไม่มีข้อผิดพลาดด้านเนื้อหาแม้แต่จุดเดียว ทุกจุดเป็นข้อผิดพลาดในการ วาด: เลย์เอาต์ การติดป้าย สเกล เครื่องหมายวรรคตอน โมเดลเข้าใจแผ่นงานแล้วจึงเรนเดอร์แผนภูมิแบบที่โมเดลวิดีโอเรนเดอร์ข้อความหนาแน่นใดๆ ก็ตาม โดยประมาณ
มีเหตุผลเชิงโครงสร้างที่สองที่เอาต์พุตไม่เหมือนเด็คของคุณ
คำนวณดู 50 หน้าคือเพดานหน้า 30 วินาทีคือเพดานระยะเวลา นั่นคือ 0.6 วินาทีต่อหน้า
คุณไม่สามารถนำเสนอหนึ่งหน้าใน 0.6 วินาที ดังนั้นโมเดลจึงทำสิ่งเดียวที่สมเหตุสมผลและสร้างตัวอย่างแทน การทดสอบเด็คของบุคคลที่สามนั้นได้ข้อสรุปเดียวกันโดยอิสระ: มันถือว่าการนำเสนอเป็นแหล่งข้อมูลสำหรับโฆษณาแบบภาพยนตร์ ไม่ใช่สไลด์ที่จะเปิดทีละหน้า กรอบแว่นของผลิตภัณฑ์ลอยจากหนาเป็นไร้ขอบเป็นรูปทรงที่สามข้ามช็อต
ซึ่งเป็นสาเหตุที่เพดาน 30 วินาทีเป็นข้อจำกัดในการออกแบบ ไม่ใช่เชิงอรรถในสเปกชีต
เราวัดไฟล์ที่ส่งมอบ: เดโมเอกสารอย่างเป็นทางการสี่ชิ้นลงที่ 30.04s, 30.02s, 25.03s และ 23.04s คลิป 30 วินาทีสองคลิปหยุดภายในสี่ในร้อยวินาทีของกันและกัน และเดโมสเปรดชีตถูกขอ 22 วินาที แต่ส่งมอบ 23.04 เราวิเคราะห์เพดานนั้นใน พรีวิว Wan 3.0
ดังนั้น: ปรับความคาดหวัง ป้อนเอกสาร รับตัวอย่าง รักษาแผนภูมิให้เรียบง่าย
ขั้นตอนการทำงาน Document to Video ที่คุณสามารถใช้ได้วันนี้
การตรวจสอบความเป็นจริงอย่างรวดเร็วก่อนบทช่วยสอน เพราะมันช่วยประหยัดเวลาค้นหาหนึ่งชั่วโมง
การป้อนเอกสารของ Wan 3.0 อยู่บนช่องทางของ Alibaba เท่านั้น การเข้าถึงต้องได้รับเชิญ และน้ำหนักไม่ได้เผยแพร่ ไม่มีใครนอกช่องทางเหล่านั้นสามารถให้บริการได้ รวมถึงเราด้วย สิ่งที่คุณ สามารถ ทำได้วันนี้คือสร้างครึ่งที่มีประโยชน์ของเดโม xlsx นั้นด้วยโมเดลที่เปิดให้บริการอยู่แล้ว และการตรวจสอบเฟรมด้านบนบอกคุณอย่างชัดเจนว่าจะหลีกเลี่ยงส่วนที่พังได้อย่างไร
สามขั้นตอน หนึ่งแท็บเบราว์เซอร์บน Atlas Cloud:
- โมเดลหนึ่งล้านโทเค็นอ่านเอกสารและเขียนสคริปต์ช็อตที่มีไทม์โค้ด โดยตัวเลขทุกตัวถูกฝังเป็นสตริงตัวอักษร
- โมเดลภาพเรนเดอร์เฟรมแรก ซึ่งเป็นจุดที่ความแม่นยำของข้อความทั้งหมดถูกล็อค
- โมเดลวิดีโอทำให้เฟรมนั้นเคลื่อนไหวตามสคริปต์
| ขั้นตอน | โมเดล | ราคาที่ระบุ | ระยะเวลาสูงสุด | เหตุผลที่ใช้ที่นี่ |
|---|---|---|---|---|
| 1. สคริปต์ | Qwen3.8 Max (/models/qwen/qwen3.8-max) | $2 เข้า / $6 ออกต่อ 1M tokens | n/a | บริบท 1M กลืนทั้งเด็ค |
| 2. เฟรมแรก | GPT Image 2 Text-to-Image | $0.009 ต่อภาพ (พื้น) | n/a | การเรนเดอร์ข้อความแข็งแกร่งที่สุดสำหรับตัวเลขบนหน้าจอ |
| 3. เรนเดอร์ | Wan 2.7 Image-to-Video | $0.1 ต่อวินาที | 15s | การควบคุมเฟรมแรกทำให้ตัวพิมพ์ของคุณคงที่ |
| ตัวเลือกเสียง | Wan 2.7 Text-to-Video | $0.1 ต่อวินาที | 15s | สร้างดนตรีและเอฟเฟกต์เสียงในรอบเดียว แต่ไม่รับเฟรมแรก |
| สลับสำหรับขั้นตอน 3 | MiniMax H3 Text-to-Video | $0.1 ต่อวินาที | 15s | อัตราเดียวกัน ลักษณะการเคลื่อนไหวต่างกัน |
| สลับสำหรับขั้นตอน 3 | Seedance 2.5 Text-to-Video | $0.134 ต่อวินาที | 30s | ตัวเดียวที่นี่ที่ถึง 30s ในเทคเดียว |
ข้อจำกัดที่ซื่อสัตย์สามข้อในห่วงโซ่นี้ มันไม่กินไฟล์ .pptx ดังนั้นคุณวางข้อความหรือ CSV เอง Wan 2.7 สูงสุดที่ 15 วินาที ดังนั้นเทคเดียว 30 วินาทีจึงเป็นไปไม่ได้ และเส้นทาง image-to-video นั้นเงียบโดยการออกแบบ: พารามิเตอร์ audio ของมันรับแทร็กที่คุณจัดหาเพื่อขับเคลื่อนลิปซิงค์ มันไม่ได้สร้างซาวด์แทร็ก หากคุณต้องการเสียงที่สร้างในรอบเดียวกัน คุณใช้พี่น้อง text-to-video และสละการควบคุมเฟรมแรก ซึ่งสำหรับวิดีโอที่เต็มไปด้วยตัวเลขเงินนั้นเป็นการแลกเปลี่ยนที่ผิด ราคาได้รับการยืนยันจากหน้าโมเดลเมื่อวันที่ 20 สิงหาคม 2026 และโปรดทราบว่าราคาที่ระบุคือพื้น: ระดับคุณภาพและความละเอียดจะผลักดันราคาจริงให้สูงขึ้น ดังนั้นอ่านปุ่ม Run ก่อนที่คุณจะยืนยัน
มาสร้างกัน
ขั้นตอนที่ 1: เปลี่ยนสเปรดชีตของคุณเป็นสคริปต์ช็อตที่มีไทม์โค้ด
โมเดลวิดีโอไม่จำตัวเลข พวกมันเรนเดอร์สตริงใดก็ตามที่คุณให้ ดังนั้นงานของขั้นตอนนี้คือการแปลงตารางเป็นทิศทางช็อตที่ตัวเลขทุกตัวถูกเขียนเป็นข้อความในเครื่องหมายคำพูดแล้ว
วางแผ่นของคุณระหว่างเครื่องหมาย <<< การตั้งค่า: อุณหภูมิ 0.3, max_tokens 4000 รักษา max_tokens ให้มาก เพราะโมเดลที่สามารถใช้เหตุผลซึ่งหมดงบประมาณระหว่างคิดจะคืนคำตอบที่ว่างเปล่าซึ่งคุณยังต้องจ่าย
text1คุณคือผู้กำกับโมชั่นกราฟิก ด้านล่างคือข้อมูลส่งออกสเปรดชีตดิบ 2 3<<< 4เดือน,อเมริกาเหนือ,เอเชียตะวันออกเฉียงใต้,ยุโรป,GMV รวม 5ม.ค.,1580,880,640,3100 6ก.พ.,2110,1240,900,4250 7มี.ค.,2740,1610,1150,5500 8เม.ย.,3120,1980,1330,6430 9พ.ค.,3350,2240,1460,7050 10มิ.ย.,3460,2480,1580,7520 11การเติบโต H1,+45.7%,,, 12>>> 13 14เขียนสคริปต์ช็อตสำหรับวิดีโอข้อมูลธุรกิจสไตล์ Apple-Keynote 15ความยาว 10 วินาที อัตราส่วน 16:9 กฎ: 161. มี 2 ช็อตพอดี ให้แต่ละช็อตมีไทม์โค้ดเข้า/ออก (00:00-00:05, 17 00:05-00:10) 182. ตัวเลขทุกตัวที่ปรากฏบนหน้าจอต้องถูกเขียนในคำอธิบายช็อต 19 เป็นสตริงตัวอักษรที่แน่นอน ในเครื่องหมายคำพูด เช่น "$1,580" 20 ห้ามเขียน "ตัวเลขของเดือนมกราคม" - ให้เขียนตัวเลข 213. ห้ามขอคำอธิบายแผนภูมิ แกนที่มีป้ายเส้นขีด หรือมากกว่า 22 สองชุดข้อมูลบนหน้าจอพร้อมกัน ให้ใช้ตัวเลขขนาดใหญ่เดี่ยว 23 และป้ายรูปเม็ดยาสีปะการังหนึ่งอันแทน 244. พื้นหลังสีขาวบริสุทธิ์ จานสีปะการังอ่อน + เทาเข้ม ฟอนต์ Sans-serif 255. จบด้วยหนึ่งบรรทัดของทิศทาง BGM + SFX (เสียงหวือตอนเลื่อนเข้า 26 เสียงกระดิ่งหนึ่งครั้งบนป้าย) 27ให้เอาต์พุตเฉพาะสคริปต์ ไม่มีความคิดเห็น 28
กฎข้อ 3 คือผลตอบแทนจากการตรวจสอบ เอาต์พุตอย่างเป็นทางการพังที่สามสิ่งพอดี: คำอธิบายแผนภูมิ เส้นขีดแกน และแผนภูมิหลายชุด ดังนั้นเราจึงลบทั้งสามออกจากคำขอ และใช้พื้นที่หน้าจอนั้นกับตัวเลขขนาดใหญ่เกินและป้ายรหัสสีแทน ข้อมูลเดียวกัน ไม่มีพื้นผิวที่ล้มเหลว
กฎข้อ 2 คือสิ่งที่คนมักข้าม และเป็นเหตุผลที่ตัวเลขรอดมาถึงจุดสิ้นสุดของห่วงโซ่นี้ คำอธิบายช็อตที่พูดว่า "ตัวเลขของเดือนมกราคม" จะส่งคืนตัวเลขให้โมเดลที่ต้องประดิษฐ์สัญลักษณ์สำหรับมัน คำอธิบายช็อตที่พูดว่า "$1,580" ในเครื่องหมายคำพูดให้สตริงที่สองขั้นตอนถัดไปจะคัดลอก คุณไม่ได้ขอการแสดงข้อมูลเป็นภาพที่นี่ คุณกำลังขอคำสั่งพิมพ์
สิ่งที่ได้กลับมาคือสคริปต์สองช็อตที่มีไทม์โค้ดเข้าและออก ตัวเลขบนหน้าจอทุกตัวถูกอ้างเป็นตัวอักษร และบรรทัดปิดท้าย BGM และ SFX เก็บไว้ในไฟล์ชั่วคราว ขั้นตอนที่ 2 และ 3 จะอ่านจากมัน
ขั้นตอนที่ 2: สร้างเฟรมแรกของแบรนด์
อักขระข้อความบนหน้าจอทุกตัวจะถูกตัดสินที่นี่ โมเดลภาพที่คุณภาพสูงเรนเดอร์ $1,580 ได้ถูกต้องอย่างน่าเชื่อถือกว่าโมเดลวิดีโอที่ต้องเขียนมันในขณะที่เคลื่อนที่ด้วย ดังนั้นเราจึงตั้งค่าตัวพิมพ์ในภาพนิ่ง และให้ขั้นตอนที่ 3 ผลักพิกเซลเท่านั้น
เปิด GPT Image 2 และตั้งค่าคุณภาพเป็น high และขนาดเป็นตัวเลือก 16:9 ซึ่งในหน้านี้คือ 2048x1152 จับคู่อัตราส่วนภาพกับวิดีโอที่คุณกำลังจะทำ ไม่เช่นนั้นขั้นตอนที่ 3 จะเริ่มต้นด้วยการครอบตัวพิมพ์ของคุณ
text1เฟรมการนำเสนอสไตล์ Apple-Keynote ที่บริสุทธิ์บนพื้นหลังสีขาวบริสุทธิ์ 2ไร้รอยต่อ ถ่ายภาพราวกับฉายบนผนังสตูดิโอด้าน พาดหัวตรงกลาง 3เป็นฟอนต์เรขาคณิต Sans-serif สีเทาเข้ม อ่านว่า "H1 2026" 4วางในพื้นที่ว่างที่กว้างขวาง ด้านล่างมีตัวเลขขนาดใหญ่เกินสองตัว 5ในฟอนต์เดียวกัน "$1,580" ทางซ้ายและ "$3,460" ทางขวา 6คั่นด้วยลูกศรสีเทาอ่อนบาง ใต้ลูกศร มีข้อความคำบรรยายสีเทาอ่อนขนาดเล็ก 7อ่านว่า "Monthly GMV Growth" ด้านล่างนั้น มีป้ายรูปเม็ดยาสีปะการังหนึ่งอัน 8ที่มีข้อความสีขาวอ่านว่า "+45.7%" แสงกระจายสม่ำเสมออ่อนๆ 9มีการไล่สีอบอุ่นจางๆ ที่มุมบนขวา เนื้อกระดาษละเอียดอ่อน 10ไม่รก ไม่มีโลโก้ ไม่มีแผนภูมิ ความเรียบง่ายแบบองค์กรที่สะอาดมาก 16:9 11
รายละเอียดสองอย่างที่ควรคัดลอก "ไม่มีแผนภูมิ" อยู่ในนั้นโดยเจตนา และอ่านราคาบนปุ่ม Run ก่อนที่คุณจะกด เพราะคุณภาพสูงบนเฟรม 2K กว้างมีค่าใช้จ่ายเป็นเท่าของราคารายการ $0.009

GPT Image 2 playground บน Atlas Cloud พร้อมพรอมต์เฟรมแรกและเฟรมสไตล์ Keynote ที่เรนเดอร์แสดงตัวเลขทุกตัวถูกต้อง
GPT Image 2 ที่คุณภาพ high, 16:9 ที่ 2048x1152 ตัวเลขทุกตัวลง: "H1 2026", "$1,580", "$3,460" และป้ายสีปะการัง "+45.7%" ซึ่งเป็นเหตุผลว่าทำไมตัวพิมพ์ถึงถูกกำหนดในภาพนิ่งและไม่ใช่ในโมเดลวิดีโอ
ขั้นตอนที่ 3: เรนเดอร์คลิป Document to Video และตรวจสอบตัวเลขทุกตัว
ขั้นตอนสุดท้าย โหลดภาพจากขั้นตอนที่ 2 เป็นเฟรมแรก และให้โมเดลวิดีโอทำให้เคลื่อนไหวในขณะที่คงตัวพิมพ์ให้คงที่
เปิด Wan 2.7 Image-to-Video การตั้งค่า: อัปโหลดเฟรมแรกของคุณ, ความละเอียด 1080P, ระยะเวลา 10s ปล่อยช่องเสียงว่างไว้ เนื่องจากโมเดลนี้ถือว่าเสียงเป็นอินพุตขับเคลื่อน ไม่ใช่สิ่งที่มันสร้าง คุณจะทำ scoring คลิปนี้ด้วยตัวเอง หรือในรอบ text-to-video แยกต่างหาก
text1ทำให้เฟรมนี้เคลื่อนไหวเป็นวิดีโอข้อมูลธุรกิจสไตล์ Apple-Keynote 2ความยาว 10 วินาที โดยคงตัวพิมพ์ที่มีอยู่ให้เสถียรระดับพิกเซล 3 400:00-00:05 - พาดหัว "H1 2026" คงอยู่ จากนั้นสลายเป็นอนุภาคสีทอง 5ที่ลอยออกไปด้านนอก ตัวเลขสองตัว "$1,580" และ "$3,460" 6เลื่อนเข้ามาจากซ้ายและขวาและล็อคเข้าที่ ลูกศรสีเทาบางวาดตัวเอง 7ระหว่างพวกมันจากซ้ายไปขวา ป้ายสีปะการังที่อ่านว่า "+45.7%" 8โผล่ขึ้นมาจากด้านล่างด้วยการโอเวอร์ชูตเล็กน้อย จับเวลากับเสียงกระดิ่งใสหนึ่งครั้ง 9 1000:05-00:10 - ทุกอย่างเลื่อนออกไปทางซ้ายอย่างราบรื่น แท่งกลมหนาสามแท่ง 11เติบโตขึ้นจากฐานร่วมกับพื้นหลังสีขาวบริสุทธิ์เดียวกัน สีปะการัง สีทีล และสีอำพัน 12โดยมีตัวเลขเดี่ยวขนาดใหญ่หนึ่งตัวเหนือแต่ละแท่ง: "$3,460", "$2,480", "$1,580" 13ไม่มีคำอธิบายแผนภูมิ ไม่มีแกน ไม่มีป้ายเส้นขีด ไม่มีเส้นกริด 14กล้องคงที่และนิ่งสนิทตลอด 15
"คงตัวพิมพ์ที่มีอยู่ให้เสถียรระดับพิกเซล" และ "กล้องคงที่" กำลังทำงานจริง ทุกการเคลื่อนไหวของกล้องคือโอกาสอีกครั้งที่โมเดลจะวาดข้อความที่มันควรปล่อยไว้
จากนั้นทำสิ่งที่น่าเบื่อแต่สำคัญ: หยุดที่แต่ละเฟรมที่มีตัวเลขปรากฏ และอ่านเทียบกับแถวต้นทาง นั่นคือการตรวจสอบ 30 วินาที และมันเป็นสิ่งเดียวที่คั่นระหว่างคุณกับวิดีโอที่แสดงตัวเลขรายได้ผิดอย่างมั่นใจ

Wan 2.7 Image-to-Video playground บน Atlas Cloud พร้อมเฟรมแรกที่โหลดและคลิปข้อมูลที่เรนเดอร์เสร็จแล้ว
Wan 2.7 Image-to-Video ที่ 1080P พร้อมเฟรมแรกจากขั้นตอนที่ 2 อัปโหลดและคลิปที่เสร็จแล้วในแผงเอาต์พุต สิ่งที่ควรสังเกต: เราขอ 10 วินาที ช่องระยะเวลาแสดง 10 และการเรนเดอร์ส่งคืน 5 ราคา Run บอกเราก่อนที่ไฟล์จะทำ ซึ่งเป็นเหตุผลทั้งหมดที่ต้องอ่าน

คลิปข้อมูลที่เสร็จแล้วสร้างใหม่จากสเปรดชีต GMV เดียวกัน ตัวเลขทุกตัวคงอยู่ครบถ้วน
ผลลัพธ์: สเปรดชีตเดียวกัน สร้างใหม่โดยจงใจออกแบบคำอธิบายแผนภูมิและเส้นขีดแกนออก โมเดลบีบอัดสองช็อตที่เขียนสคริปต์ไว้เป็นห้าวินาทีที่มันเรนเดอร์จริง และตัวเลขทุกตัวรอดจากการย้าย: "$1,580" และ "$3,460" ในช่วงเปิด จากนั้น "$3,460", "$2,480" และ "$1,580" บนแท่งสามแท่ง ป้ายที่เสียหายเป็นศูนย์ เพราะไม่มีป้ายให้เสียหายอีกแล้ว เงียบโดยการออกแบบ เนื่องจากเส้นทาง image-to-video ไม่ได้สร้างเสียงให้คุณ
รูปแบบ Document to Video และราคาของวิดีโอหนึ่งนาทีที่เสร็จสมบูรณ์
กรณีสเปรดชีตนั้นยากที่สุด อีกสามกรณีการใช้งานอย่างเป็นทางการนั้นง่ายกว่า และเป็นที่ที่มูลค่าทางการค้าส่วนใหญ่อยู่
สื่อการสอน ป้อนข้อมูลสารานุกรมและขอให้เป็นบทเรียนในระดับการอ่านที่กำหนด เอาต์พุตด้านล่างเป็นคลาสแอนิเมชันสไตล์ชิบิเกี่ยวกับกวีหวังเว่ย ยาว 25.03 วินาที
สไตล์การวาดคงที่ตลอดทั้งเรื่อง รายละเอียดตัวละครไม่คงที่ ที่ตำแหน่ง 3 วินาที เขาสวมหมวกสีดำบนพื้นหลังสีขาวธรรมดา เมื่อถึง 22 วินาที หมวกเปลี่ยนเป็นสีฟ้าอ่อนและเขายืนอยู่ในภาพวาดม้วนคลาสสิก การลอยตัวแบบเดียวกับที่ผู้ทดสอบเด็คเห็นในกรอบแว่นเหล่านั้น ถ้าคุณสร้างสิ่งนี้ใหม่บนห่วงโซ่สามขั้นตอน ให้ล็อคการ์ดตัวละครในขั้นตอนที่ 1 และใช้เฟรมจากขั้นตอนที่ 2 ซ้ำเป็นจุดยึดสไตล์
รายการสารานุกรมเป็นบทเรียนแอนิเมชันสำหรับ ป.1 ยาว 25.03s พร้อมเสียงที่สร้างขึ้น เดโมเบต้าสาธารณะอย่างเป็นทางการของ Alibaba Wan 3.0
ภาพยนตร์แบรนด์ เอกสารข้อเสนอกลายเป็นสปอตโฆษณาเต็ม 30 วินาที มันสวยที่สุดในสี่เดโมและตรวจสอบได้น้อยที่สุด เพราะคุณไม่เห็นว่าเอกสารต้นทางพูดว่าอะไร ดูความสม่ำเสมอมากกว่าความสวยงาม: นี่คือโหมดความล้มเหลวที่จับผู้ทดสอบบุคคลที่สาม ซึ่งผลิตภัณฑ์ของเขาเปลี่ยนรูปร่างสามครั้งในคลิปเดียว
เอกสารข้อเสนอเป็นภาพยนตร์แบรนด์สกินแคร์ยาว 30.04s เดโมเบต้าสาธารณะอย่างเป็นทางการของ Alibaba Wan 3.0 มีเสียง
รายงานสรุป ไม่มีเดโมอย่างเป็นทางการสำหรับกรณีนี้ ดังนั้นให้ถือว่ารูปแบบนี้ยังไม่ผ่านการทดสอบ: ขอพิธีกรหนึ่งคน หนึ่งข้อความต่อช็อต และใส่ตัวเลขทุกตัวในเครื่องหมายคำพูดเหมือนในขั้นตอนที่ 1
ต่อไปเรื่องเงิน
| อะไร | อัตรา | 30 วินาทีของวิดีโอที่เสร็จสมบูรณ์ |
|---|---|---|
| Wan 3.0, 1080p (แผ่น RMB) | ¥1.2 ต่อวินาที | ¥36 |
| Wan 3.0, 1080p (แผ่น USD) | $0.20 ต่อวินาที | $6.00 |
| Wan 3.0, 720p (แผ่น RMB) | ¥0.6 ต่อวินาที | ¥18 |
| ห่วงโซ่สามขั้นตอน หนึ่งรอบ | สคริปต์ + เฟรม + $0.1/วินาที เรนเดอร์ | ประมาณ $1.20 สำหรับ 10s |
| ห่วงโซ่สามขั้นตอน 3 ครั้ง | สคริปต์ใช้ซ้ำ เฟรมและเรนเดอร์ซ้ำ | ประมาณ $3.50 |
แผ่นราคา Wan 3.0 สองแผ่นที่เผยแพร่ disagree ว่า 1080p คือ ¥1.2 หรือ $0.20 ต่อวินาที ซึ่งไม่ใช่ตัวเลขเดียวกัน ตรวจสอบอัตราที่ endpoint ที่คุณถูกเรียกเก็บจริงก่อนที่คุณจะตั้งงบประมาณสำหรับซีรีส์
ต้นทุนที่ซ่อนอยู่ไม่ใช่อัตราต่อวินาที มันคือการรันซ้ำ การป้อนเอกสารใช้หนึ่งไฟล์ต่องาน ดังนั้นการเปลี่ยนตัวเลขเดียวหมายถึงการสร้างวิดีโอใหม่ทั้งหมด ในห่วงโซ่สามขั้นตอน สคริปต์ช็อตเป็นสิ่งประดิษฐ์ข้อความที่ใช้ซ้ำได้ ดังนั้นการเปลี่ยนตัวเลขทำให้คุณเสียค่าเรนเดอร์หนึ่งครั้งแทนที่จะเป็นงานเต็มหนึ่งงาน ในรอบการรายงานรายไตรมาส ความแตกต่างนั้นบดบังราคาต่อวินาที
ข้อสังเกตทางกฎหมายหนึ่งข้อก่อนที่คุณจะอัปโหลดอะไร เอกสารที่คุณส่งไปยังโมเดลที่โฮสต์คือเอกสารที่ออกจากอาคารของคุณ และเด็คภายในและข้อมูลทางการเงินที่ยังไม่ได้เผยแพร่มักมีนโยบายที่เกี่ยวข้อง ตรวจสอบก่อนที่ความกดดันของกำหนดเวลาจะมาถึง ไม่ใช่ทีหลัง และคลิปเดโมอย่างเป็นทางการทุกคลิปในบทความนี้เป็นของ Alibaba อ้างอิงที่นี่เป็นวัสดุเบต้าสาธารณะ ไม่มีอะไรที่นี่เป็นใบอนุญาตให้นำไปใช้ในเชิงพาณิชย์
คำถามที่พบบ่อย Wan 3.0 Document to Video
Wan 3.0 document to video รองรับไฟล์ประเภทใดบ้าง และขนาดเท่าไหร่?
doc, xls, ppt, pdf, txt และ md พร้อมด้วย key, pages และ numbers ที่รายงานเช่นกัน รวมถึงลิงก์เว็บธรรมดาแทนไฟล์ หนึ่งไฟล์หรือหนึ่งลิงก์ต่องาน สูงสุด 100MB หรือ 50 หน้า
Wan 3.0 เปลี่ยนแต่ละสไลด์เป็นฉากหรือไม่?
ไม่ และนี่คือความเข้าใจผิดที่พบบ่อยที่สุด มันอ่านเอกสารทั้งหมด จากนั้นกำกับวิดีโอจากสิ่งที่เรียนรู้ ที่เพดานนั่นคือ 50 หน้าใน 30 วินาที หรือ 0.6 วินาทีต่อหน้า ดังนั้นมันจึงผลิตตัวอย่างมากกว่าการเปิดหน้า ทั้งกรณีการใช้งานอย่างเป็นทางการและการทดสอบอิสระชี้ไปในทางเดียวกัน
ตัวเลขจากสเปรดชีตของฉันในวิดีโอแม่นยำหรือไม่?
ค่าในเซลล์คงอยู่ครบถ้วนในทุกกรณีที่ฉันตรวจสอบ รวมถึง $1,580, $3,460 และ +45.7% ในเดโมอย่างเป็นทางการ สิ่งที่ล้มเหลวคือเฟอร์นิเจอร์แผนภูมิ: คำอธิบายรวมกัน เส้นขีดแกนออกมาไม่เป็นเชิงเส้น และตัวคั่นหลักพันหายไป ใส่ตัวเลขทุกตัวเป็นสตริงตัวอักษรในเครื่องหมายคำพูด และออกแบบคำอธิบายแผนภูมิและป้ายเส้นขีดออกจากคำขอทั้งหมด
ฉันสามารถใช้ Wan 3.0 document to video ผ่าน API วันนี้ได้หรือไม่?
ผ่านช่องทางของ Alibaba เท่านั้น ซึ่งปัจจุบันต้องได้รับเชิญ และน้ำหนักไม่ได้เผยแพร่ Wan 2.2 ยังคงเป็นรุ่นโอเพนเวทล่าสุดในสายนี้ จนกว่าสิ่งนั้นจะเปลี่ยน ห่วงโซ่สามขั้นตอนด้านบนคือตัวเลือกทดแทนที่ใช้งานได้จริง
วิดีโอ Wan 3.0 ความยาว 30 วินาทีราคาเท่าไหร่?
ในอัตรา 1080p ที่เผยแพร่ นั่นคือ ¥36 หรือ $6.00 ในแผ่นนานาชาติ สำหรับคลิป 30 วินาทีหนึ่งคลิป ควรตั้งงบประมาณสำหรับการรันซ้ำมากกว่าการรันครั้งเดียว เพราะการแก้ไขตัวเลขหนึ่งหมายถึงการสร้างใหม่ทั้งหมด
อะไรคือสิ่งที่ใกล้เคียงกับ Wan 3.0 document to video ที่สุดที่ฉันสามารถใช้ได้ตอนนี้?
โมเดลบริบทยาวเพื่อเขียนสคริปต์ช็อต จากนั้น Wan 2.7 ที่ $0.1 ต่อวินาทีสำหรับการเรนเดอร์ โดยมี MiniMax H3 ในอัตราเดียวกันหรือ Seedance 2.5 ที่ $0.134 ต่อวินาทีเป็นตัวเลือก คุณจะได้ลุคฟุตเทจที่สร้างขึ้นและข้อความที่แม่นยำในเฟรม สิ่งที่คุณไม่ได้: 30 วินาทีในเทคต่อเนื่องเดียว เสียงในรอบเดียวกับการเรนเดอร์ image-to-video หรือโมเดลที่อ่าน .pptx ให้คุณ
สรุปโดยสุจริต: Wan 3.0 document to video เป็นความสามารถจริงที่มีเพดานจริง และช่องว่างระหว่างเอาต์พุตของมันกับของคุณนั้นเล็กกว่าที่เห็น ตราบใดที่คุณหยุดขอให้สิ่งใดสิ่งหนึ่งวาดคำอธิบายแผนภูมิ






