Seedance 2.5 är nu live — Först på Atlas Cloud

Wan 3.0 Dokument till Video: Jag granskade varje bildruta

Wan 3.0 dokument till video är verklig: Jag kontrollerade den officiella xlsx-demon bildruta för bildruta. Siffrorna överlever, diagrammen går sönder. Plus ett arbetsflöde du kan köra nu.

Ladda upp ett kalkylark. Få tillbaka en 23-sekunders affärsanimation med musik.

Det är löftet från Wan 3.0 document to video, familjens första inbyggda dokumentinmatning, och den officiella demon levererar mer bokstavligt än jag förväntade mig. Siffrorna stämmer. 1 580 USD växer till 3 460 USD, märket visar +45,7 %, och dessa siffror går direkt tillbaka till specifika celler i källarket.

Sedan drog jag spelhuvudet till 12-sekundersmarkeringen och läste diagramförklaringen.

”Southeasta North America.”

Två försäljningsregioner sammanpressade till ett ord som inte existerar. Det är den verkliga vattenlinjen för dokument-till-video år 2026: modellen läste verkligen din tabell, men den kan fortfarande inte rita ditt diagram. Nedan finns den bildruta-för-bildruta-granskning som ingen annan har publicerat, plus en trestegskedja du faktiskt kan köra i eftermiddag.

Viktiga slutsatser

  • Wan 3.0 accepterar 1 fil eller 1 länk, upp till 100 MB eller 50 sidor, och matar ut upp till 30 sekunder i 1080p.
  • Den regisserar en film från ditt dokument. Den gör inte om bild 3 till tagning 3.
  • Cellvärden överlever intakta. Diagramförklaringar, axelmarkeringar och tusentalsavgränsare gör det inte.
  • Begränsningar är hårda: ingen 4K, inga öppna vikter, endast förstapartskanaler.
  • En lång-kontext-modell plus en 15-sekunders videomodell återskapar det mesta idag.

Gul text som läser H1 2026 Wan med guldglitter-stänk

Wan 3.0 document to video-utdata: den officiella xlsx-demon renderad som en Keynote-stilad animerad datafilm

Showcase: Alibabas officiella Wan 3.0 public-beta-demo, en .xlsx med månatlig GMV in, 23 sekunder animerad datafilm ut. Visad här som en tyst GIF; den levererade filen har ett 44,1 kHz stereoljudspår (AAC). Källa: Alibabas officiella Wan 3.0-skaparhandbok.

Vad Wan 3.0 Document to Video faktiskt gör

Kortversionen, så du kan gå om en minut om det är allt du behöver.

Du ger den ett dokument eller en webblänk. Den läser hela, bestämmer vad berättelsen är och genererar en video med bild och ljud i samma pass. Max 30 sekunder, max 1080p. Den går inte igenom dina sidor i ordning.

Här är begränsningarna som faktiskt styr ett projekt.

SpecifikationWan 3.0 dokumentinmatning
Formatdoc, xls, ppt, pdf, txt, md, plus key / pages / numbers och en vanlig webblänk
Inmatningar per jobb1 fil eller 1 länk (inte båda, inte flera)
Storleksgräns100 MB
Sidgräns50 sidor
Max utdata30 sekunder, en enda kontinuerlig passage
Max upplösning1080p (ingen 4K-nivå)
Ljudgenereras i samma pass som bilden
Öppna vikteringa; Wan 2.2 är fortfarande den senaste öppna viktreleasen
Var du får detAlibaba Cloud Model Studio (Bailian) och Qwen Cloud, inbjudningskrävande

Offentlig beta öppnade den 6 augusti 2026 (AgentUpdate, augusti 2026). Formatlistan och de två publicerade prislistorna kommer från en separat specifikationssammanställning (Ngram, augusti 2026).

Den officiella handboken levererar fyra dokumentanvändningsfall, och de kartlägger rent på fyra jobb som folk redan betalar byråer för:

  • Förslagsdokument till en varumärkesfilm. Ett hudvårdspitchdokument blir en 30-sekunders reklam med en huvudskådespelerska och en morgonljusberättelse.
  • Kursmaterial till en videolektion. En encyklopedipost blir en animerad lektion för förstaklassare.
  • Kalkylark till animerade diagram. Demon ovan, och vida den svåraste av de fyra.
  • Rapport till en talad sammanfattning. En skriftlig rapport blir en presentatörsgenomgång.

Nu är det här de flesta artiklar får kategorin fel.

De etablerade aktörerna inom "PDF till video" gör inte detta. Kapwings dokument-till-video drar ut texten ur din fil och lägger den på en tidslinje, utan scenbyggande och utan presentatör. Pictory och Powtoon monterar arkivmaterial eller mallanimation, och Powtoons egna produktsidor annonserar AI-avatarer och röster som läser ditt manus. Alla tre producerar berättade bildspel.

Wan 3.0Kapwing Document to VideoPictoryPowtoon Anything-to-Video
Vad som kommer uten genererad filmdin text på en tidslinjearkivmaterial klippt till ett manusmallanimation
Skapar ny bildmaterialja, varje bildrutanejnej, biblioteksklippnej, malltillgångar
AI-presentatöringen som standardingenvalfri röstavatarer och röster
Ljudgenereras med bildendu lägger till detTTS-berättarröstTTS-berättarröst
Längsta enskilda utdata30sprojektlängdprojektlängdprojektlängd
Tillgänglighetinbjudningsbaserat, förstapartoffentligtoffentligtoffentligt

Läs den tabellen två gånger, för det är hela argumentet: dessa är inte konkurrenter i samma kategori. En gör berättade bildspel. Den andra gör bildmaterial som aldrig funnits. Att jämföra dem på pris per minut är som att jämföra en kopiator med ett filmteam.

Kan Wan 3.0 också göra bildspelssaken? Ja, och det är det ärliga förbehållet.

Motexempel: ombeds att förvandla en webbsida om kvantmekanik till en rolig förklaring, producerade Wan 3.0 exakt presentatör-plus-bildtext-formatet som de etablerade aktörerna säljer. Den träffar 30-sekundersväggen vid 30,02s. Officiell Alibaba public-beta-demo, ljud på.

Så skillnaden är inte att Wan 3.0 inte kan göra talande-huvud-förklaringar. Det är att med de etablerade aktörerna är det formatet det enda på menyn.

Varför Wan 3.0 Document to Video bryter diagram men behåller dina siffror

Här är den mest användbara saken i den här artikeln: Jag drog ut 12 jämnt fördelade bildrutor från den officiella kalkylarksdemon och läste varje glyf.

Domen delas rent i två. Värden klarar sig. Diagrammöbler misslyckas.

Vad överlevde. Vid 4-sekundersmarkeringen läser bildrutan $1,580, en tunn grå pil, $3,460, bildtexten "Monthly GMV Growth" och ett korallfärgat märke som läser +45.7%. Typografin är ren, kommatecken är på rätt plats, inga förvrängda tecken. Prompten bakom denna demo hänvisar till specifika kalkylarksceller, och siffrorna på skärmen matchar dem. Ett tredjepartstest på en 8-sidig produktpresentation fann samma sak: 45g, 12 timmar och 55 grader renderades alla korrekt, och den avslutande sloganen kom ut utan ett enda felaktigt tecken (AI-Driven Lab, augusti 2026).

Det svarar på frågan som ekonomi- och L&D-team faktiskt bryr sig om. Dina siffror muterar inte tyst.

Vad gick sönder. Diagrambildrutorna är en annan historia.

Annoterat linjediagram som visar tre fel i förklaring, skala och enheter

Wan 3.0 document to video bildrutegranskning som visar en sammanslagen diagramförklaring och en trasig y-axel

Fryst vid 12s i den officiella demon. Tre defekter i en bildruta: två regionnamn sammansmälta till "Southeasta North America", "North America" sedan upprepat som sin egen serie, och en y-axel som läser 30, 60, 70 medan den översta datamärkningen säger $3,880.

Räkna misslyckandena i den ena bildrutan:

  1. Sammanslagen förklaring. "Southeast Asia" och "North America" kolliderar till "Southeasta North America". Sedan visas "North America" igen som en separat serie, så en region är märkt två gånger och en har försvunnit.
  2. En y-axel som inte är en skala. Markeringarna läser 30, 60, 70. Lika pixelluckor, ojämna värden, och 40 och 50 helt enkelt saknade.
  3. Axel och etiketter i olika enheter. Den högsta rutnätslinjen är 70. Etiketten fäst vid den översta datapunkten säger $3,880.
  4. Magnituddrift längs en linje. Etiketterna på den översta kurvan börjar vid $330 och $335, landar sedan på $3,970 och $3,880. En jämnt stigande linje kan inte hålla ett tiofaldigt hopp mellan två intilliggande punkter. De två etiketterna däremellan är suddiga bortom säker läsning, vilket är sitt eget slags svar.

Stapeldiagramsegmentet upprepar mönstret. Fyra staplar bär $1750, $1,580, $2,350 och $2,580, så den kortaste stapeln har det näst högsta numret, och den första etiketten förlorar sitt tusentalskomma medan de andra tre behåller sina. Bredvid sitter fem gröna tillväxtsiffror för fyra staplar. Och cirkeldiagramsegmentet centrerar på $89,7M, ett kommatecken där en decimalpunkt borde vara.

Lägg märke till vad alla dessa har gemensamt. Inte en enda är ett innehållsfel. Varenda en är ett ritningsfel: layout, etikettering, skala, skiljetecken. Modellen förstod arket och renderade sedan diagrammet på det sätt som en videomodell renderar all tät text, ungefärligt.

Det finns en andra, strukturell anledning till att utdata inte ser ut som din presentation.

Gör matematiken. 50 sidor är sidgränsen, 30 sekunder är tidsgränsen. Det är 0,6 sekunder per sida.

Du kan inte presentera en sida på 0,6 sekunder, så modellen gör det enda vettiga och gör en trailer istället. Det tredjepartsdecktestet nådde samma slutsats oberoende: det behandlade presentationen som källmaterial för en filmisk annons, inte som bilder att bläddra igenom. Produktens glasögonbågar drev från tjocka till båg- till en tredje form över tagningarna.

Vilket också är anledningen till att 30-sekundersgränsen är en designbegränsning, inte en fotnot i specifikationsbladet.

Vi mätte de levererade filerna: de fyra officiella dokumentdemonerna landar på 30,04s, 30,02s, 25,03s och 23,04s. De två 30-sekundersklippen stannar döda inom fyra hundradelar av en sekund från varandra. Och kalkylarksdemon bad om 22 sekunder, men levererade 23,04. Vi tog isär den gränsen i Wan 3.0-förhandsvisningen.

Så: förväntningar kalibrerade. Mata den med ett dokument, få en trailer, håll dina diagram enkla.

Dokument-till-video-arbetsflödet du kan köra idag

Snabb verklighetskontroll innan handledningen, för det sparar dig en timmes sökande.

Wan 3.0:s dokumentinmatning finns endast på Alibabas egna kanaler, åtkomst är inbjudningskrävande, och vikterna är inte publicerade. Ingen utanför dessa kanaler kan erbjuda det, inklusive oss. Vad du kan göra idag är att återskapa den användbara halvan av den xlsx-demon med modeller som redan är öppna för affärer, och bildrutegranskningen ovan berättar exakt hur du undviker den del som går sönder.

Tre steg, en webbläsarflik på Atlas Cloud:

  1. En miljon-token-modell läser dokumentet och skriver ett tidskodsatt tagningsmanus, med varje nummer inbakat som en bokstavlig sträng.
  2. En bildmodell renderar den första bildrutan, vilket är där all textnoggrannhet låses in.
  3. En videomodell animerar den bildrutan enligt manuset.
StegModellListat prisMax varaktighetVarför den är här
1. ManusQwen3.8 Max (/models/qwen/qwen3.8-max)$2 in / $6 ut per 1M tokensn/a1M kontext sväljer en hel presentation
2. Första bildGPT Image 2 Text-to-Image$0,009 per bild (grund)n/astarkaste textrendering för siffror på skärm
3. RenderaWan 2.7 Image-to-Video$0,1 per sekund15sförsta-bild-kontroll håller din typografi stabil
LjudalternativWan 2.7 Text-to-Video$0,1 per sekund15sgenererar musik och ljudeffekter i samma pass, men tar ingen första bild
Byt för steg 3MiniMax H3 Text-to-Video$0,1 per sekund15ssamma taxa, annan rörelsekaraktär
Byt för steg 3Seedance 2.5 Text-to-Video$0,134 per sekund30sden enda här som når 30s i ett pass

Tre ärliga begränsningar i denna kedja. Den äter inte en .pptx-binär, så du klistrar in texten eller CSV själv. Wan 2.7 toppar vid 15 sekunder, så en enda 30-sekunderstagning är inte möjlig. Och bild-till-video-vägen är tyst av design: dess audio-parameter tar ett spår du tillhandahåller för att driva läppsynk, den uppfinner inte ett ljudspår. Om du vill ha ljud genererat i samma pass använder du text-till-video-syskonet och ger upp första-bild-kontroll, vilket för en video full av dollarsiffror är fel byte. Priser verifierade på modellsidorna den 20 augusti 2026, och notera att ett listat pris är ett golv: kvalitets- och upplösningsnivåer trycker upp den levande offerten, så läs Kör-knappen innan du förbinder dig.

Låt oss bygga det.

Steg 1: Förvandla ditt kalkylark till ett tidskodsatt tagningsmanus

Videomodeller kommer inte ihåg siffror. De renderar vilken sträng du än ger dem. Så jobbet i detta steg är att konvertera en tabell till tagningsanvisningar där varje siffra redan är utskriven som text inom citattecken.

Klistra in ditt ark mellan <<<-markörerna. Inställningar: temperatur 0,3, max_tokens 4000. Håll max_tokens generöst, eftersom en resonemangskapabel modell som får slut på budget mitt i tanken returnerar ett tomt svar du fortfarande betalar för.

text
1Du är en rörlig grafik-regissör. Nedan finns en rå kalkylarksexport.
2
3<<<
4Month,North America,Southeast Asia,Europe,Total GMV
5Jan,1580,880,640,3100
6Feb,2110,1240,900,4250
7Mar,2740,1610,1150,5500
8Apr,3120,1980,1330,6430
9May,3350,2240,1460,7050
10Jun,3460,2480,1580,7520
11H1 growth,+45.7%,,,
12>>>
13
14Skriv ett tagningsmanus för en 10-sekunders, 16:9, Apple-Keynote-stilad
15affärsdatavideo. Regler:
161. Exakt 2 tagningar. Ge varje en in/ut-tidskod (00:00-00:05,
17   00:05-00:10).
182. Varje siffra som visas på skärmen måste skrivas i tagningsbeskrivningen
19   som en exakt bokstavlig sträng inom citattecken, t.ex. "$1,580".
20   Skriv aldrig "januarisiffran" - skriv siffrorna.
213. Be INTE om en förklaring, en axel med tick-etiketter, eller mer än
22   två dataserier på skärmen samtidigt. Använd stora fristående siffror
23   och ett enda korallfärgat pillerformat märke istället.
244. Rent vit bakgrund, mjuk korall + mörkgrå palett, sans-serif.
255. Avsluta med en rad BGM + SFX-anvisning (swoosh vid inzoomning,
26   en klockklang på märket).
27Skriv endast manuset, ingen kommentar.
28

Regel 3 är utdelningen från granskningen. Den officiella utdatan bröt på exakt tre saker: förklaringar, axeltickar och multi-serie-diagram. Så vi tar bort alla tre från briefen och använder den skärmytan för överdimensionerade siffror och ett färgkodat märke istället. Samma information, ingen av misslyckandeytorna.

Regel 2 är den som folk hoppar över, och det är anledningen till att siffrorna överlever till slutet av denna kedja. En tagningsbeskrivning som säger "januarisiffran" lämnar tillbaka numret till en modell som måste uppfinna glyfer för det. En tagningsbeskrivning som säger "$1,580" inom citattecken ger de nästa två stegen en sträng att kopiera. Du ber inte om datavisualisering här, du ber om en skrivinstruktion.

Det som kommer tillbaka är ett tvåtagningars manus med in- och ut-tidskoder, varje siffra på skärmen citerad som en bokstavlig, och en avslutande BGM- och SFX-rad. Spara det i en skrapfil; steg 2 och 3 läser båda från det.

Steg 2: Generera varumärkets första bildruta

Varje tecken av text på skärmen avgörs här. En bildmodell av hög kvalitet renderar $1,580 korrekt långt mer pålitligt än en videomodell kan skriva det medan den också flyttar det, så vi löser typografin i en stillbild och låter steg 3 bara trycka pixlar runt.

Öppna GPT Image 2 och ställ in kvalitet på hög och storlek på 16:9-alternativet, som på denna sida är 2048x1152. Matcha bildförhållandet till videon du ska göra, annars börjar steg 3 med att beskära din typografi.

text
1En orörd Apple-Keynote-stilad presentationsbildruta på en ren vit
2sömlös bakgrund, fotograferad som om den projicerades på en matt
3studiovägg. Centrerad rubrik i ett djupt kolgrått geometriskt sans-serif
4som läser "H1 2026", placerad i generöst negativt utrymme. Nedanför, två
5överdimensionerade siffror i samma typsnitt, "$1,580" till vänster och
6"$3,460" till höger, åtskilda av en tunn ljusgrå pil. Under pilen,
7liten ljusgrå bildtext som läser "Monthly GMV Growth". Därunder, ett
8enda korallfärgat pillerformat märke med vit text som läser "+45.7%".
9Mjuk jämn diffus belysning, svag varm gradient i det övre högra hörnet,
10subtilt papperskorn, ingen röra, inga logotyper, inga diagram.
11Ultraren företagsminimalism, 16:9.
12

Två detaljer värda att kopiera. "Inga diagram" är där med avsikt. Och läs prisofferten på Kör-knappen innan du trycker på den, för hög kvalitet på en bred 2K-bildruta kostar en multipel av listpriset på $0,009.

Skärmdump av en AI-bildgenerator som visar inmatningssteg och utdata

GPT Image 2-lekplatsen på Atlas Cloud med första-bild-promtten och den renderade Keynote-stilade bildrutan som visar varje siffra korrekt

GPT Image 2 vid hög kvalitet, 16:9 vid 2048x1152. Varje siffra landade: "H1 2026", "$1,580", "$3,460" och det korallfärgade "+45.7%"-märket, vilket är exakt varför typografin låses i en stillbild och inte i en videomodell.

Steg 3: Rendera dokument-till-video-klippet och verifiera varje siffra

Sista steget. Ladda steg-2-bilden som första bildruta och låt videomodellen animera den medan den håller typografin stilla.

Öppna Wan 2.7 Image-to-Video. Inställningar: din första bildruta uppladdad, upplösning 1080P, varaktighet 10s. Lämna ljudfältet tomt, eftersom denna modell behandlar ljud som en drivande inmatning snarare än något den skapar. Du poängsätter detta klipp själv, eller i ett separat text-till-video-pass.

text
1Animera denna bildruta som en 10-sekunders Apple-Keynote-stilad
2affärsdatavideo, håll befintlig typografi pixelstabil.
3
400:00-00:05 - Rubriken "H1 2026" hålls, löses sedan upp i gyllene
5partiklar som driver utåt. De två siffrorna "$1,580" och
6"$3,460" glider in från vänster och höger och låser sig på plats; den tunna
7grå pilen ritar sig själv mellan dem från vänster till höger. Det korallfärgade
8märket som läser "+45.7%" poppar upp från nedanför med en lätt överskottsrörelse,
9tidsatt till en enda tydlig klockklang.
10
1100:05-00:10 - Allt glider smidigt av till vänster. Tre
12tjocka rundade staplar växer uppåt från en gemensam baslinje mot samma
13rena vita bakgrund, korall, teal och bärnsten, med en stor fristående
14siffra ovanför varje: "$3,460", "$2,480", "$1,580". Ingen
15förklaring, ingen axel, inga tick-etiketter, inga rutnätslinjer. Kameran förblir låst
16och perfekt stilla hela tiden.
17

"Att hålla befintlig typografi pixelstabil" och "kameran förblir låst" gör verkligt arbete. Varje kameras rörelse är en ny chans för modellen att rita om text den borde lämna ifred.

Gör sedan det tråkiga, viktiga: pausa på varje bildruta där en siffra visas och läs den mot källraden. Det är en 30-sekunders kontroll, och det är det enda som står mellan dig och en video med självförtroende som visar fel intäktssiffra.

AI-videogenereringsgränssnitt som visar inmatningsprompt och färdig video

Wan 2.7 Image-to-Video-lekplatsen på Atlas Cloud med första bildrutan laddad och det färdiga dataklippet renderat

Wan 2.7 Image-to-Video vid 1080P med steg-2 första bildrutan uppladdad och det färdiga klippet i utmatningspanelen. Värt att notera vad panelen säger: vi bad om 10 sekunder, varaktighetsfältet visade 10, och renderingen kom tillbaka 5. Kör-offerten berättade det för oss innan filen gjorde det, vilket är hela anledningen till att läsa den.

H1 2026 månatlig GMV-tillväxt från $1,580 till $3,460, upp 45,7%

Det färdiga dataklippet återskapat från samma GMV-kalkylark, varje siffra intakt

Utdelningen: samma kalkylark, återskapat med förklaringar och axeltickar medvetet bortdesignade. Modellen komprimerade båda manuskripttagningarna till de fem sekunder den faktiskt renderade, och varje siffra överlevde flytten: "$1,580" och "$3,460" i början, sedan "$3,460", "$2,480" och "$1,580" över de tre staplarna. Noll förvrängda etiketter, för det fanns inga etiketter kvar att förvränga. Tyst av design, eftersom bild-till-video-vägen poängsätter inget åt dig.

Dokument-till-video-varianter och vad en färdig minut kostar

Kalkylarksfallet är det svåraste. De andra tre officiella användningsfallen är lättare, och det är där det mesta av det kommersiella värdet ligger.

Kursmaterial. Mata den med en encyklopedipost och be om en lektion på en specifik läsenivå. Utdata nedan är en chibi-stilad animerad lektion om poeten Wang Wei, 25,03 sekunder lång.

Ritstilen håller hela vägen. Karaktärsdetaljerna gör det inte. Vid 3-sekundersmarkeringen bär han en svart keps mot en enkel vit bakgrund; vid 22 sekunder har kepsen blivit ljusblå och han står inuti en klassisk rullmålning. Samma drift som decktestaren såg i glasögonbågarna. Om du återskapar detta på trestegskedjan, lås ett karaktärskort i steg 1 och återanvänd steg-2-bilden som din stilankare.

Encyklopedipost till en förstaklassares animerade lektion, 25,03s med genererat ljud. Officiell Alibaba Wan 3.0 public-beta-demo.

Varumärkesfilmer. Ett förslagsdokument blir en hel 30-sekunders reklam. Det är den vackraste av de fyra demonerna och den minst verifierbara, eftersom du inte kan se vad källdokumentet sa. Titta på konsistens snarare än skönhet: detta är misslyckandet som fångade tredjepartstestaren, vars produkt ändrade form tre gånger i ett klipp.

Förslagsdokument till en 30,04s hudvårdsvarumärkesfilm. Officiell Alibaba Wan 3.0 public-beta-demo, ljud på.

Rapportsammanfattningar. Ingen officiell demo finns för denna, så behandla mönstret som otestat: be om en presentatör, ett påstående per tagning, och sätt varje siffra inom citattecken exakt som i steg 1.

Nu pengarna.

VadTaxa30 sekunder färdig video
Wan 3.0, 1080p (RMB-ark)¥1,2 per sekund¥36
Wan 3.0, 1080p (USD-ark)$0,20 per sekund$6,00
Wan 3.0, 720p (RMB-ark)¥0,6 per sekund¥18
Trestegskedja, ett passmanus + bildruta + $0,1/s renderingungefär $1,20 för 10s
Trestegskedja, 3 försökmanus återanvänt, bildruta och rendering upprepadeungefär $3,50

Två publicerade Wan 3.0-prislistor är oense om huruvida 1080p är ¥1,2 eller $0,20 per sekund, vilket inte är samma tal. Kontrollera taxan på den slutpunkt du faktiskt debiteras mot innan du budgeterar en serie.

Den dolda kostnaden är inte per-sekund-taxan. Det är omkörningen. Dokumentinmatning tar en fil per jobb, så att ändra en enda siffra innebär att regenerera hela videon. I trestegskedjan är tagningsmanuset en återanvändbar textartefakt, så en sifferändring kostar dig en rendering istället för ett helt jobb. Över en kvartalsrapporteringscykel överskuggar den skillnaden per-sekund-priset.

En juridisk notering innan du laddar upp något. Ett dokument du skickar till en värdbaserad modell är ett dokument som lämnar din byggnad, och interna presentationer och ej offentliggjorda finansiella rapporter har vanligtvis en policy kopplad till det. Kontrollera den innan deadline-trycket kommer, inte efter. Och varje officiell demoklipp i denna artikel tillhör Alibaba, citerade här som public-beta-material; inget här är en licens att återanvända dem kommersiellt.

Wan 3.0 Document to Video FAQ

Vilka filtyper accepterar Wan 3.0 document to video, och hur stora?

doc, xls, ppt, pdf, txt och md, med key, pages och numbers också rapporterade, plus en vanlig webblänk istället för en fil. En fil eller en länk per jobb, upp till 100 MB eller 50 sidor.

Förvandlar Wan 3.0 varje bild till en scen?

Nej, och detta är den vanligaste missuppfattningen. Den läser hela dokumentet, regisserar sedan en video från vad den lärt sig. Vid gränsen är det 50 sidor till 30 sekunder, eller 0,6 sekunder per sida, så den producerar en trailer snarare än en sidvändare. Både de officiella användningsfallen och oberoende testning pekar åt samma håll.

Är siffrorna från mitt kalkylark korrekta i videon?

Cellvärden höll upp i vartenda fall jag kontrollerade, inklusive $1,580, $3,460 och +45,7% i den officiella demon. Vad som misslyckas är diagrammöbler: förklaringar slås samman, axeltickar blir icke-linjära, och tusentalsavgränsare försvinner. Injicera varje siffra som en citerad bokstavlig och designa bort förklaringar och tick-etiketter från briefen helt.

Kan jag använda Wan 3.0 document to video via ett API idag?

Endast via Alibabas egna kanaler, för närvarande inbjudningskrävande, och vikterna är inte publicerade. Wan 2.2 förblir den senaste öppna viktreleansen i serien. Tills det ändras är trestegskedjan ovan det praktiska substitutet.

Hur mycket kostar en 30-sekunders Wan 3.0-video?

Vid den publicerade 1080p-taxan är det ¥36, eller $6,00 på det internationella arket, för ett 30-sekundersklipp. Budgetera för omkörningar snarare än för ett enda pass, eftersom en korrigering av en siffra innebär att regenerera hela.

Vad är det närmaste Wan 3.0 document to video jag kan köra just nu?

En lång-kontext-modell för att skriva tagningsmanuset, sedan Wan 2.7 till $0,1 per sekund för renderingen, med MiniMax H3 till samma taxa eller Seedance 2.5 till $0,134 per sekund som alternativ. Du får det genererade bildmaterialets utseende och bildruteexakt text. Vad du inte får: 30 sekunder i en enda kontinuerlig tagning, ljud i samma pass som bild-till-video-renderingen, eller en modell som läser .pptx åt dig.

Den ärliga sammanfattningen: Wan 3.0 document to video är en verklig kapacitet med en verklig begränsning, och gapet mellan dess utdata och din är mindre än det ser ut, så länge du slutar be någon av dem att rita en förklaring.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller