Ladda upp ett kalkylark. Få tillbaka en 23-sekunders affärsanimation med musik.
Det är löftet från Wan 3.0 document to video, familjens första inbyggda dokumentinmatning, och den officiella demon levererar mer bokstavligt än jag förväntade mig. Siffrorna stämmer. 1 580 USD växer till 3 460 USD, märket visar +45,7 %, och dessa siffror går direkt tillbaka till specifika celler i källarket.
Sedan drog jag spelhuvudet till 12-sekundersmarkeringen och läste diagramförklaringen.
”Southeasta North America.”
Två försäljningsregioner sammanpressade till ett ord som inte existerar. Det är den verkliga vattenlinjen för dokument-till-video år 2026: modellen läste verkligen din tabell, men den kan fortfarande inte rita ditt diagram. Nedan finns den bildruta-för-bildruta-granskning som ingen annan har publicerat, plus en trestegskedja du faktiskt kan köra i eftermiddag.
Viktiga slutsatser
- Wan 3.0 accepterar 1 fil eller 1 länk, upp till 100 MB eller 50 sidor, och matar ut upp till 30 sekunder i 1080p.
- Den regisserar en film från ditt dokument. Den gör inte om bild 3 till tagning 3.
- Cellvärden överlever intakta. Diagramförklaringar, axelmarkeringar och tusentalsavgränsare gör det inte.
- Begränsningar är hårda: ingen 4K, inga öppna vikter, endast förstapartskanaler.
- En lång-kontext-modell plus en 15-sekunders videomodell återskapar det mesta idag.

Wan 3.0 document to video-utdata: den officiella xlsx-demon renderad som en Keynote-stilad animerad datafilm
Showcase: Alibabas officiella Wan 3.0 public-beta-demo, en .xlsx med månatlig GMV in, 23 sekunder animerad datafilm ut. Visad här som en tyst GIF; den levererade filen har ett 44,1 kHz stereoljudspår (AAC). Källa: Alibabas officiella Wan 3.0-skaparhandbok.
Vad Wan 3.0 Document to Video faktiskt gör
Kortversionen, så du kan gå om en minut om det är allt du behöver.
Du ger den ett dokument eller en webblänk. Den läser hela, bestämmer vad berättelsen är och genererar en video med bild och ljud i samma pass. Max 30 sekunder, max 1080p. Den går inte igenom dina sidor i ordning.
Här är begränsningarna som faktiskt styr ett projekt.
| Specifikation | Wan 3.0 dokumentinmatning |
|---|---|
| Format | doc, xls, ppt, pdf, txt, md, plus key / pages / numbers och en vanlig webblänk |
| Inmatningar per jobb | 1 fil eller 1 länk (inte båda, inte flera) |
| Storleksgräns | 100 MB |
| Sidgräns | 50 sidor |
| Max utdata | 30 sekunder, en enda kontinuerlig passage |
| Max upplösning | 1080p (ingen 4K-nivå) |
| Ljud | genereras i samma pass som bilden |
| Öppna vikter | inga; Wan 2.2 är fortfarande den senaste öppna viktreleasen |
| Var du får det | Alibaba Cloud Model Studio (Bailian) och Qwen Cloud, inbjudningskrävande |
Offentlig beta öppnade den 6 augusti 2026 (AgentUpdate, augusti 2026). Formatlistan och de två publicerade prislistorna kommer från en separat specifikationssammanställning (Ngram, augusti 2026).
Den officiella handboken levererar fyra dokumentanvändningsfall, och de kartlägger rent på fyra jobb som folk redan betalar byråer för:
- Förslagsdokument till en varumärkesfilm. Ett hudvårdspitchdokument blir en 30-sekunders reklam med en huvudskådespelerska och en morgonljusberättelse.
- Kursmaterial till en videolektion. En encyklopedipost blir en animerad lektion för förstaklassare.
- Kalkylark till animerade diagram. Demon ovan, och vida den svåraste av de fyra.
- Rapport till en talad sammanfattning. En skriftlig rapport blir en presentatörsgenomgång.
Nu är det här de flesta artiklar får kategorin fel.
De etablerade aktörerna inom "PDF till video" gör inte detta. Kapwings dokument-till-video drar ut texten ur din fil och lägger den på en tidslinje, utan scenbyggande och utan presentatör. Pictory och Powtoon monterar arkivmaterial eller mallanimation, och Powtoons egna produktsidor annonserar AI-avatarer och röster som läser ditt manus. Alla tre producerar berättade bildspel.
| Wan 3.0 | Kapwing Document to Video | Pictory | Powtoon Anything-to-Video | |
|---|---|---|---|---|
| Vad som kommer ut | en genererad film | din text på en tidslinje | arkivmaterial klippt till ett manus | mallanimation |
| Skapar ny bildmaterial | ja, varje bildruta | nej | nej, biblioteksklipp | nej, malltillgångar |
| AI-presentatör | ingen som standard | ingen | valfri röst | avatarer och röster |
| Ljud | genereras med bilden | du lägger till det | TTS-berättarröst | TTS-berättarröst |
| Längsta enskilda utdata | 30s | projektlängd | projektlängd | projektlängd |
| Tillgänglighet | inbjudningsbaserat, förstapart | offentligt | offentligt | offentligt |
Läs den tabellen två gånger, för det är hela argumentet: dessa är inte konkurrenter i samma kategori. En gör berättade bildspel. Den andra gör bildmaterial som aldrig funnits. Att jämföra dem på pris per minut är som att jämföra en kopiator med ett filmteam.
Kan Wan 3.0 också göra bildspelssaken? Ja, och det är det ärliga förbehållet.
Motexempel: ombeds att förvandla en webbsida om kvantmekanik till en rolig förklaring, producerade Wan 3.0 exakt presentatör-plus-bildtext-formatet som de etablerade aktörerna säljer. Den träffar 30-sekundersväggen vid 30,02s. Officiell Alibaba public-beta-demo, ljud på.
Så skillnaden är inte att Wan 3.0 inte kan göra talande-huvud-förklaringar. Det är att med de etablerade aktörerna är det formatet det enda på menyn.
Varför Wan 3.0 Document to Video bryter diagram men behåller dina siffror
Här är den mest användbara saken i den här artikeln: Jag drog ut 12 jämnt fördelade bildrutor från den officiella kalkylarksdemon och läste varje glyf.
Domen delas rent i två. Värden klarar sig. Diagrammöbler misslyckas.
Vad överlevde. Vid 4-sekundersmarkeringen läser bildrutan $1,580, en tunn grå pil, $3,460, bildtexten "Monthly GMV Growth" och ett korallfärgat märke som läser +45.7%. Typografin är ren, kommatecken är på rätt plats, inga förvrängda tecken. Prompten bakom denna demo hänvisar till specifika kalkylarksceller, och siffrorna på skärmen matchar dem. Ett tredjepartstest på en 8-sidig produktpresentation fann samma sak: 45g, 12 timmar och 55 grader renderades alla korrekt, och den avslutande sloganen kom ut utan ett enda felaktigt tecken (AI-Driven Lab, augusti 2026).
Det svarar på frågan som ekonomi- och L&D-team faktiskt bryr sig om. Dina siffror muterar inte tyst.
Vad gick sönder. Diagrambildrutorna är en annan historia.

Wan 3.0 document to video bildrutegranskning som visar en sammanslagen diagramförklaring och en trasig y-axel
Fryst vid 12s i den officiella demon. Tre defekter i en bildruta: två regionnamn sammansmälta till "Southeasta North America", "North America" sedan upprepat som sin egen serie, och en y-axel som läser 30, 60, 70 medan den översta datamärkningen säger $3,880.
Räkna misslyckandena i den ena bildrutan:
- Sammanslagen förklaring. "Southeast Asia" och "North America" kolliderar till "Southeasta North America". Sedan visas "North America" igen som en separat serie, så en region är märkt två gånger och en har försvunnit.
- En y-axel som inte är en skala. Markeringarna läser 30, 60, 70. Lika pixelluckor, ojämna värden, och 40 och 50 helt enkelt saknade.
- Axel och etiketter i olika enheter. Den högsta rutnätslinjen är 70. Etiketten fäst vid den översta datapunkten säger $3,880.
- Magnituddrift längs en linje. Etiketterna på den översta kurvan börjar vid $330 och $335, landar sedan på $3,970 och $3,880. En jämnt stigande linje kan inte hålla ett tiofaldigt hopp mellan två intilliggande punkter. De två etiketterna däremellan är suddiga bortom säker läsning, vilket är sitt eget slags svar.
Stapeldiagramsegmentet upprepar mönstret. Fyra staplar bär $1750, $1,580, $2,350 och $2,580, så den kortaste stapeln har det näst högsta numret, och den första etiketten förlorar sitt tusentalskomma medan de andra tre behåller sina. Bredvid sitter fem gröna tillväxtsiffror för fyra staplar. Och cirkeldiagramsegmentet centrerar på $89,7M, ett kommatecken där en decimalpunkt borde vara.
Lägg märke till vad alla dessa har gemensamt. Inte en enda är ett innehållsfel. Varenda en är ett ritningsfel: layout, etikettering, skala, skiljetecken. Modellen förstod arket och renderade sedan diagrammet på det sätt som en videomodell renderar all tät text, ungefärligt.
Det finns en andra, strukturell anledning till att utdata inte ser ut som din presentation.
Gör matematiken. 50 sidor är sidgränsen, 30 sekunder är tidsgränsen. Det är 0,6 sekunder per sida.
Du kan inte presentera en sida på 0,6 sekunder, så modellen gör det enda vettiga och gör en trailer istället. Det tredjepartsdecktestet nådde samma slutsats oberoende: det behandlade presentationen som källmaterial för en filmisk annons, inte som bilder att bläddra igenom. Produktens glasögonbågar drev från tjocka till båg- till en tredje form över tagningarna.
Vilket också är anledningen till att 30-sekundersgränsen är en designbegränsning, inte en fotnot i specifikationsbladet.
Vi mätte de levererade filerna: de fyra officiella dokumentdemonerna landar på 30,04s, 30,02s, 25,03s och 23,04s. De två 30-sekundersklippen stannar döda inom fyra hundradelar av en sekund från varandra. Och kalkylarksdemon bad om 22 sekunder, men levererade 23,04. Vi tog isär den gränsen i Wan 3.0-förhandsvisningen.
Så: förväntningar kalibrerade. Mata den med ett dokument, få en trailer, håll dina diagram enkla.
Dokument-till-video-arbetsflödet du kan köra idag
Snabb verklighetskontroll innan handledningen, för det sparar dig en timmes sökande.
Wan 3.0:s dokumentinmatning finns endast på Alibabas egna kanaler, åtkomst är inbjudningskrävande, och vikterna är inte publicerade. Ingen utanför dessa kanaler kan erbjuda det, inklusive oss. Vad du kan göra idag är att återskapa den användbara halvan av den xlsx-demon med modeller som redan är öppna för affärer, och bildrutegranskningen ovan berättar exakt hur du undviker den del som går sönder.
Tre steg, en webbläsarflik på Atlas Cloud:
- En miljon-token-modell läser dokumentet och skriver ett tidskodsatt tagningsmanus, med varje nummer inbakat som en bokstavlig sträng.
- En bildmodell renderar den första bildrutan, vilket är där all textnoggrannhet låses in.
- En videomodell animerar den bildrutan enligt manuset.
| Steg | Modell | Listat pris | Max varaktighet | Varför den är här |
|---|---|---|---|---|
| 1. Manus | Qwen3.8 Max (/models/qwen/qwen3.8-max) | $2 in / $6 ut per 1M tokens | n/a | 1M kontext sväljer en hel presentation |
| 2. Första bild | GPT Image 2 Text-to-Image | $0,009 per bild (grund) | n/a | starkaste textrendering för siffror på skärm |
| 3. Rendera | Wan 2.7 Image-to-Video | $0,1 per sekund | 15s | första-bild-kontroll håller din typografi stabil |
| Ljudalternativ | Wan 2.7 Text-to-Video | $0,1 per sekund | 15s | genererar musik och ljudeffekter i samma pass, men tar ingen första bild |
| Byt för steg 3 | MiniMax H3 Text-to-Video | $0,1 per sekund | 15s | samma taxa, annan rörelsekaraktär |
| Byt för steg 3 | Seedance 2.5 Text-to-Video | $0,134 per sekund | 30s | den enda här som når 30s i ett pass |
Tre ärliga begränsningar i denna kedja. Den äter inte en .pptx-binär, så du klistrar in texten eller CSV själv. Wan 2.7 toppar vid 15 sekunder, så en enda 30-sekunderstagning är inte möjlig. Och bild-till-video-vägen är tyst av design: dess audio-parameter tar ett spår du tillhandahåller för att driva läppsynk, den uppfinner inte ett ljudspår. Om du vill ha ljud genererat i samma pass använder du text-till-video-syskonet och ger upp första-bild-kontroll, vilket för en video full av dollarsiffror är fel byte. Priser verifierade på modellsidorna den 20 augusti 2026, och notera att ett listat pris är ett golv: kvalitets- och upplösningsnivåer trycker upp den levande offerten, så läs Kör-knappen innan du förbinder dig.
Låt oss bygga det.
Steg 1: Förvandla ditt kalkylark till ett tidskodsatt tagningsmanus
Videomodeller kommer inte ihåg siffror. De renderar vilken sträng du än ger dem. Så jobbet i detta steg är att konvertera en tabell till tagningsanvisningar där varje siffra redan är utskriven som text inom citattecken.
Klistra in ditt ark mellan <<<-markörerna. Inställningar: temperatur 0,3, max_tokens 4000. Håll max_tokens generöst, eftersom en resonemangskapabel modell som får slut på budget mitt i tanken returnerar ett tomt svar du fortfarande betalar för.
text1Du är en rörlig grafik-regissör. Nedan finns en rå kalkylarksexport. 2 3<<< 4Month,North America,Southeast Asia,Europe,Total GMV 5Jan,1580,880,640,3100 6Feb,2110,1240,900,4250 7Mar,2740,1610,1150,5500 8Apr,3120,1980,1330,6430 9May,3350,2240,1460,7050 10Jun,3460,2480,1580,7520 11H1 growth,+45.7%,,, 12>>> 13 14Skriv ett tagningsmanus för en 10-sekunders, 16:9, Apple-Keynote-stilad 15affärsdatavideo. Regler: 161. Exakt 2 tagningar. Ge varje en in/ut-tidskod (00:00-00:05, 17 00:05-00:10). 182. Varje siffra som visas på skärmen måste skrivas i tagningsbeskrivningen 19 som en exakt bokstavlig sträng inom citattecken, t.ex. "$1,580". 20 Skriv aldrig "januarisiffran" - skriv siffrorna. 213. Be INTE om en förklaring, en axel med tick-etiketter, eller mer än 22 två dataserier på skärmen samtidigt. Använd stora fristående siffror 23 och ett enda korallfärgat pillerformat märke istället. 244. Rent vit bakgrund, mjuk korall + mörkgrå palett, sans-serif. 255. Avsluta med en rad BGM + SFX-anvisning (swoosh vid inzoomning, 26 en klockklang på märket). 27Skriv endast manuset, ingen kommentar. 28
Regel 3 är utdelningen från granskningen. Den officiella utdatan bröt på exakt tre saker: förklaringar, axeltickar och multi-serie-diagram. Så vi tar bort alla tre från briefen och använder den skärmytan för överdimensionerade siffror och ett färgkodat märke istället. Samma information, ingen av misslyckandeytorna.
Regel 2 är den som folk hoppar över, och det är anledningen till att siffrorna överlever till slutet av denna kedja. En tagningsbeskrivning som säger "januarisiffran" lämnar tillbaka numret till en modell som måste uppfinna glyfer för det. En tagningsbeskrivning som säger "$1,580" inom citattecken ger de nästa två stegen en sträng att kopiera. Du ber inte om datavisualisering här, du ber om en skrivinstruktion.
Det som kommer tillbaka är ett tvåtagningars manus med in- och ut-tidskoder, varje siffra på skärmen citerad som en bokstavlig, och en avslutande BGM- och SFX-rad. Spara det i en skrapfil; steg 2 och 3 läser båda från det.
Steg 2: Generera varumärkets första bildruta
Varje tecken av text på skärmen avgörs här. En bildmodell av hög kvalitet renderar $1,580 korrekt långt mer pålitligt än en videomodell kan skriva det medan den också flyttar det, så vi löser typografin i en stillbild och låter steg 3 bara trycka pixlar runt.
Öppna GPT Image 2 och ställ in kvalitet på hög och storlek på 16:9-alternativet, som på denna sida är 2048x1152. Matcha bildförhållandet till videon du ska göra, annars börjar steg 3 med att beskära din typografi.
text1En orörd Apple-Keynote-stilad presentationsbildruta på en ren vit 2sömlös bakgrund, fotograferad som om den projicerades på en matt 3studiovägg. Centrerad rubrik i ett djupt kolgrått geometriskt sans-serif 4som läser "H1 2026", placerad i generöst negativt utrymme. Nedanför, två 5överdimensionerade siffror i samma typsnitt, "$1,580" till vänster och 6"$3,460" till höger, åtskilda av en tunn ljusgrå pil. Under pilen, 7liten ljusgrå bildtext som läser "Monthly GMV Growth". Därunder, ett 8enda korallfärgat pillerformat märke med vit text som läser "+45.7%". 9Mjuk jämn diffus belysning, svag varm gradient i det övre högra hörnet, 10subtilt papperskorn, ingen röra, inga logotyper, inga diagram. 11Ultraren företagsminimalism, 16:9. 12
Två detaljer värda att kopiera. "Inga diagram" är där med avsikt. Och läs prisofferten på Kör-knappen innan du trycker på den, för hög kvalitet på en bred 2K-bildruta kostar en multipel av listpriset på $0,009.

GPT Image 2-lekplatsen på Atlas Cloud med första-bild-promtten och den renderade Keynote-stilade bildrutan som visar varje siffra korrekt
GPT Image 2 vid hög kvalitet, 16:9 vid 2048x1152. Varje siffra landade: "H1 2026", "$1,580", "$3,460" och det korallfärgade "+45.7%"-märket, vilket är exakt varför typografin låses i en stillbild och inte i en videomodell.
Steg 3: Rendera dokument-till-video-klippet och verifiera varje siffra
Sista steget. Ladda steg-2-bilden som första bildruta och låt videomodellen animera den medan den håller typografin stilla.
Öppna Wan 2.7 Image-to-Video. Inställningar: din första bildruta uppladdad, upplösning 1080P, varaktighet 10s. Lämna ljudfältet tomt, eftersom denna modell behandlar ljud som en drivande inmatning snarare än något den skapar. Du poängsätter detta klipp själv, eller i ett separat text-till-video-pass.
text1Animera denna bildruta som en 10-sekunders Apple-Keynote-stilad 2affärsdatavideo, håll befintlig typografi pixelstabil. 3 400:00-00:05 - Rubriken "H1 2026" hålls, löses sedan upp i gyllene 5partiklar som driver utåt. De två siffrorna "$1,580" och 6"$3,460" glider in från vänster och höger och låser sig på plats; den tunna 7grå pilen ritar sig själv mellan dem från vänster till höger. Det korallfärgade 8märket som läser "+45.7%" poppar upp från nedanför med en lätt överskottsrörelse, 9tidsatt till en enda tydlig klockklang. 10 1100:05-00:10 - Allt glider smidigt av till vänster. Tre 12tjocka rundade staplar växer uppåt från en gemensam baslinje mot samma 13rena vita bakgrund, korall, teal och bärnsten, med en stor fristående 14siffra ovanför varje: "$3,460", "$2,480", "$1,580". Ingen 15förklaring, ingen axel, inga tick-etiketter, inga rutnätslinjer. Kameran förblir låst 16och perfekt stilla hela tiden. 17
"Att hålla befintlig typografi pixelstabil" och "kameran förblir låst" gör verkligt arbete. Varje kameras rörelse är en ny chans för modellen att rita om text den borde lämna ifred.
Gör sedan det tråkiga, viktiga: pausa på varje bildruta där en siffra visas och läs den mot källraden. Det är en 30-sekunders kontroll, och det är det enda som står mellan dig och en video med självförtroende som visar fel intäktssiffra.

Wan 2.7 Image-to-Video-lekplatsen på Atlas Cloud med första bildrutan laddad och det färdiga dataklippet renderat
Wan 2.7 Image-to-Video vid 1080P med steg-2 första bildrutan uppladdad och det färdiga klippet i utmatningspanelen. Värt att notera vad panelen säger: vi bad om 10 sekunder, varaktighetsfältet visade 10, och renderingen kom tillbaka 5. Kör-offerten berättade det för oss innan filen gjorde det, vilket är hela anledningen till att läsa den.

Det färdiga dataklippet återskapat från samma GMV-kalkylark, varje siffra intakt
Utdelningen: samma kalkylark, återskapat med förklaringar och axeltickar medvetet bortdesignade. Modellen komprimerade båda manuskripttagningarna till de fem sekunder den faktiskt renderade, och varje siffra överlevde flytten: "$1,580" och "$3,460" i början, sedan "$3,460", "$2,480" och "$1,580" över de tre staplarna. Noll förvrängda etiketter, för det fanns inga etiketter kvar att förvränga. Tyst av design, eftersom bild-till-video-vägen poängsätter inget åt dig.
Dokument-till-video-varianter och vad en färdig minut kostar
Kalkylarksfallet är det svåraste. De andra tre officiella användningsfallen är lättare, och det är där det mesta av det kommersiella värdet ligger.
Kursmaterial. Mata den med en encyklopedipost och be om en lektion på en specifik läsenivå. Utdata nedan är en chibi-stilad animerad lektion om poeten Wang Wei, 25,03 sekunder lång.
Ritstilen håller hela vägen. Karaktärsdetaljerna gör det inte. Vid 3-sekundersmarkeringen bär han en svart keps mot en enkel vit bakgrund; vid 22 sekunder har kepsen blivit ljusblå och han står inuti en klassisk rullmålning. Samma drift som decktestaren såg i glasögonbågarna. Om du återskapar detta på trestegskedjan, lås ett karaktärskort i steg 1 och återanvänd steg-2-bilden som din stilankare.
Encyklopedipost till en förstaklassares animerade lektion, 25,03s med genererat ljud. Officiell Alibaba Wan 3.0 public-beta-demo.
Varumärkesfilmer. Ett förslagsdokument blir en hel 30-sekunders reklam. Det är den vackraste av de fyra demonerna och den minst verifierbara, eftersom du inte kan se vad källdokumentet sa. Titta på konsistens snarare än skönhet: detta är misslyckandet som fångade tredjepartstestaren, vars produkt ändrade form tre gånger i ett klipp.
Förslagsdokument till en 30,04s hudvårdsvarumärkesfilm. Officiell Alibaba Wan 3.0 public-beta-demo, ljud på.
Rapportsammanfattningar. Ingen officiell demo finns för denna, så behandla mönstret som otestat: be om en presentatör, ett påstående per tagning, och sätt varje siffra inom citattecken exakt som i steg 1.
Nu pengarna.
| Vad | Taxa | 30 sekunder färdig video |
|---|---|---|
| Wan 3.0, 1080p (RMB-ark) | ¥1,2 per sekund | ¥36 |
| Wan 3.0, 1080p (USD-ark) | $0,20 per sekund | $6,00 |
| Wan 3.0, 720p (RMB-ark) | ¥0,6 per sekund | ¥18 |
| Trestegskedja, ett pass | manus + bildruta + $0,1/s rendering | ungefär $1,20 för 10s |
| Trestegskedja, 3 försök | manus återanvänt, bildruta och rendering upprepade | ungefär $3,50 |
Två publicerade Wan 3.0-prislistor är oense om huruvida 1080p är ¥1,2 eller $0,20 per sekund, vilket inte är samma tal. Kontrollera taxan på den slutpunkt du faktiskt debiteras mot innan du budgeterar en serie.
Den dolda kostnaden är inte per-sekund-taxan. Det är omkörningen. Dokumentinmatning tar en fil per jobb, så att ändra en enda siffra innebär att regenerera hela videon. I trestegskedjan är tagningsmanuset en återanvändbar textartefakt, så en sifferändring kostar dig en rendering istället för ett helt jobb. Över en kvartalsrapporteringscykel överskuggar den skillnaden per-sekund-priset.
En juridisk notering innan du laddar upp något. Ett dokument du skickar till en värdbaserad modell är ett dokument som lämnar din byggnad, och interna presentationer och ej offentliggjorda finansiella rapporter har vanligtvis en policy kopplad till det. Kontrollera den innan deadline-trycket kommer, inte efter. Och varje officiell demoklipp i denna artikel tillhör Alibaba, citerade här som public-beta-material; inget här är en licens att återanvända dem kommersiellt.
Wan 3.0 Document to Video FAQ
Vilka filtyper accepterar Wan 3.0 document to video, och hur stora?
doc, xls, ppt, pdf, txt och md, med key, pages och numbers också rapporterade, plus en vanlig webblänk istället för en fil. En fil eller en länk per jobb, upp till 100 MB eller 50 sidor.
Förvandlar Wan 3.0 varje bild till en scen?
Nej, och detta är den vanligaste missuppfattningen. Den läser hela dokumentet, regisserar sedan en video från vad den lärt sig. Vid gränsen är det 50 sidor till 30 sekunder, eller 0,6 sekunder per sida, så den producerar en trailer snarare än en sidvändare. Både de officiella användningsfallen och oberoende testning pekar åt samma håll.
Är siffrorna från mitt kalkylark korrekta i videon?
Cellvärden höll upp i vartenda fall jag kontrollerade, inklusive $1,580, $3,460 och +45,7% i den officiella demon. Vad som misslyckas är diagrammöbler: förklaringar slås samman, axeltickar blir icke-linjära, och tusentalsavgränsare försvinner. Injicera varje siffra som en citerad bokstavlig och designa bort förklaringar och tick-etiketter från briefen helt.
Kan jag använda Wan 3.0 document to video via ett API idag?
Endast via Alibabas egna kanaler, för närvarande inbjudningskrävande, och vikterna är inte publicerade. Wan 2.2 förblir den senaste öppna viktreleansen i serien. Tills det ändras är trestegskedjan ovan det praktiska substitutet.
Hur mycket kostar en 30-sekunders Wan 3.0-video?
Vid den publicerade 1080p-taxan är det ¥36, eller $6,00 på det internationella arket, för ett 30-sekundersklipp. Budgetera för omkörningar snarare än för ett enda pass, eftersom en korrigering av en siffra innebär att regenerera hela.
Vad är det närmaste Wan 3.0 document to video jag kan köra just nu?
En lång-kontext-modell för att skriva tagningsmanuset, sedan Wan 2.7 till $0,1 per sekund för renderingen, med MiniMax H3 till samma taxa eller Seedance 2.5 till $0,134 per sekund som alternativ. Du får det genererade bildmaterialets utseende och bildruteexakt text. Vad du inte får: 30 sekunder i en enda kontinuerlig tagning, ljud i samma pass som bild-till-video-renderingen, eller en modell som läser .pptx åt dig.
Den ärliga sammanfattningen: Wan 3.0 document to video är en verklig kapacitet med en verklig begränsning, och gapet mellan dess utdata och din är mindre än det ser ut, så länge du slutar be någon av dem att rita en förklaring.






