Upload één spreadsheet. Ontvang een 23-seconden bedrijfsanimatie met muziek.
Dat is de belofte van Wan 3.0 document naar video, de eerste native documentinvoer van de familie, en de officiële demo lost die in letterlijker zin in dan ik had verwacht. De cijfers kloppen: $1.580 groeit naar $3.460, de badge leest +45,7%, en die cijfers zijn direct terug te voeren naar specifieke cellen in het bronbestand.
Toen sleepte ik de afspeelkop naar de 12-secondenmarkering en las de legenda van de grafiek.
"Southeasta North America."
Twee verkoopregio's samengeperst in een woord dat niet bestaat. Dat is de echte waterlijn van document-naar-video in 2026: het model heeft je tabel echt gelezen, en het kan nog steeds je grafiek niet tekenen. Hieronder staat de framevoor-frame-audit die niemand anders heeft gepubliceerd, plus een driedelige keten die je vanmiddag nog daadwerkelijk kunt uitvoeren.
Belangrijkste conclusies
- Wan 3.0 accepteert 1 bestand of 1 link, tot 100 MB of 50 pagina's, en levert tot 30 seconden in 1080p.
- Het regisseert een film op basis van je document. Het maakt niet van dia 3 shot 3.
- Celwaarden blijven intact. Grafieklegenda's, asaanduidingen en duizendtallen niet.
- Grenzen zijn hard: geen 4K, geen open weights, alleen first-party kanalen.
- Een long-context model plus een 15-seconden videomodel reproduceert het grootste deel vandaag.

Wan 3.0 document naar video output: de officiële xlsx demo gerenderd als een Keynote-stijl geanimeerde datafilm
De showcase: Alibaba's officiële Wan 3.0 publieke-bètademo, één .xlsx van maandelijkse GMV erin, 23 seconden geanimeerde datafilm eruit. Getoond als stille GIF; het geleverde bestand heeft een 44,1 kHz stereo AAC-track. Bron: Alibaba's officiële Wan 3.0 creator-handleiding.
Wat Wan 3.0 Document naar Video Eigenlijk Doet
Korte versie, voor als je er over een minuut weer uit wilt als dat alles is wat je nodig hebt.
Je geeft het één document of één weblink. Het leest het geheel, beslist wat het verhaal is, en genereert een video met beeld en geluid in dezelfde pas. Maximaal 30 seconden, maximaal 1080p. Het doorloopt je pagina's niet op volgorde.
Hier zijn de limieten die een project daadwerkelijk bepalen.
| Specificatie | Wan 3.0 documentinvoer |
|---|---|
| Formaten | doc, xls, ppt, pdf, txt, md, plus key / pages / numbers en een gewone weblink |
| Invoer per taak | 1 bestand of 1 link (niet beide, niet meerdere) |
| Maximale grootte | 100 MB |
| Maximale pagina's | 50 pagina's |
| Max. output | 30 seconden, enkele continue pas |
| Max. resolutie | 1080p (geen 4K-tier) |
| Audio | gegenereerd in dezelfde pas als het beeld |
| Open weights | geen; Wan 2.2 is nog steeds de laatste open-weight release |
| Waar te krijgen | Alibaba Cloud Model Studio (Bailian) en Qwen Cloud, met uitnodiging |
Publieke bèta geopend op 6 augustus 2026 (AgentUpdate, augustus 2026). De formatenlijst en de twee gepubliceerde prijslijsten komen uit een aparte specificatierondleiding (Ngram, augustus 2026).
De officiële handleiding bevat vier documentgebruiksscenario's, en die sluiten netjes aan op vier taken waarvoor mensen al betalen aan bureaus:
- Voorsteldocument naar een merkfilm. Een skincare-pitchdocument wordt een 30-seconden advertentie met een hoofdrolspeelster en een ochtendlichtverhaal.
- Cursusmateriaal naar een videoles. Een encyclopedie-artikel wordt een geanimeerde les voor eersteklassers.
- Spreadsheet naar geanimeerde grafieken. De demo hierboven, en veruit de moeilijkste van de vier.
- Rapport naar een gesproken samenvatting. Een geschreven rapport wordt een presentator-stijl briefing.
Nu is hier waar de meeste artikelen de categorie verkeerd hebben.
De gevestigde orde in 'PDF naar video' doet dit niet. Kapwing's document-naar-video haalt de tekst uit je bestand en legt het op een tijdlijn, zonder scèneopbouw en zonder presentator. Pictory en Powtoon assembleren stock footage of template-animatie, en Powtoon's eigen productpagina's adverteren AI-avatars en stemmen die je script voorlezen. Alle drie produceren ze ingesproken dia's.
| Wan 3.0 | Kapwing Document to Video | Pictory | Powtoon Anything-to-Video | |
|---|---|---|---|---|
| Wat eruit komt | een gegenereerde film | je tekst op een tijdlijn | stock footage gemonteerd op script | template-animatie |
| Bedenkt nieuwe beelden | ja, elk frame | nee | nee, bibliotheekclips | nee, template-assets |
| AI-presentator | geen standaard | geen | optionele stem | avatars en stemmen |
| Audio | gegenereerd met het beeld | jij voegt het toe | TTS-voice-over | TTS-voice-over |
| Langste enkele output | 30 seconden | projectlengte | projectlengte | projectlengte |
| Beschikbaarheid | alleen op uitnodiging, first-party | openbaar | openbaar | openbaar |
Lees die tabel twee keer, want het is het hele argument: dit zijn geen concurrenten in dezelfde categorie. De één maakt ingesproken diavoorstellingen. De ander maakt beelden die nooit hebben bestaan. Ze vergelijken op prijs per minuut is als een fotokopieermachine vergelijken met een filmploeg.
Kan Wan 3.0 ook de diavoorstelling? Ja, en dat is de eerlijke kanttekening.
Tegenvoorbeeld: gevraagd om een webpagina over kwantummechanica om te zetten in een leuke uitleg, produceerde Wan 3.0 exact het presentator-plus-ondertiteling-formaat dat de gevestigde orde verkoopt. Het raakt de 30-seconden grens op 30,02s. Officiële Alibaba publieke-bètademo, audio aan.
Het verschil is dus niet dat Wan 3.0 geen talking-head uitleg kan maken. Het is dat bij de gevestigde orde dat formaat het enige op het menu is.
Waarom Wan 3.0 Document naar Video Grafieken Breekt maar Je Cijfers Houdt
Hier is het nuttigste van dit artikel: ik heb 12 gelijkmatig verdeelde frames uit de officiële spreadsheetdemo gehaald en elk glyph gelezen.
Het oordeel valt netjes in tweeën. Waarden slagen. Grafiekmeubilair faalt.
Wat overleefde. Op de 4-secondenmarkering leest het frame $1.580, een dunne grijze pijl, $3.460, het bijschrift "Maandelijkse GMV Groei", en een koraalkleurige badge met +45,7%. Typografie is strak, komma's staan op de juiste plaats, geen verminkte tekens. De prompt achter deze demo verwijst naar specifieke spreadsheetcellen, en de cijfers op het scherm komen ermee overeen. Een test van derden op een 8-pagina's productdeck vond hetzelfde: 45g, 12 uur en 55 graden werden allemaal correct weergegeven, en de slotzin kwam zonder een enkel verkeerd teken (AI-Driven Lab, augustus 2026).
Dat beantwoordt de vraag waar financiële en L&D-teams echt om geven. Je cijfers muteren niet stilletjes.
Wat brak. De grafiekframes zijn een ander verhaal.

Wan 3.0 document naar video frame-audit met een samengevoegde grafieklegenda en een gebroken y-as
Bevroren op 12s in de officiële demo. Drie gebreken in één frame: twee regiogegevens samengesmolten tot "Southeasta North America", "North America" vervolgens herhaald als eigen serie, en een y-as met 30, 60, 70 terwijl het bovenste datalabel $3.880 zegt.
Tel de fouten in dat ene frame:
- Samengevoegde legenda. "Southeast Asia" en "North America" botsen in "Southeasta North America". Vervolgens verschijnt "North America" opnieuw als aparte serie, dus één regio is dubbel gelabeld en één is verdwenen.
- Een y-as die geen schaal is. De streepjes lezen 30, 60, 70. Gelijke pixelafstanden, ongelijke waarden, en 40 en 50 ontbreken gewoon.
- As- en labels in verschillende eenheden. De hoogste rasterlijn is 70. Het label vastgepind aan het bovenste datapunt zegt $3.880.
- Magnitude-verschuiving langs één lijn. De labels op die bovenste curve beginnen bij $330 en $335, en komen dan uit op $3.970 en $3.880. Een vloeiende stijgende lijn kan geen tienvoudige sprong tussen twee aangrenzende punten bevatten. De twee labels ertussen zijn uitgesmeerd voorbij duidelijke leesbaarheid, wat op zichzelf een antwoord is.
Het staafdiagramsegment herhaalt het patroon. Vier staven dragen $1750, $1.580, $2.350 en $2.580, dus de kortste staaf heeft het op één na hoogste getal, en het eerste label mist zijn duizendkomma terwijl de andere drie het wel hebben. Daarnaast zitten vijf groene groeicijfers voor vier staven. En het donutsegment centreert op $89,7M, een komma waar een decimaal punt hoort.
Merk op wat al deze gemeen hebben. Geen enkele is een inhoudsfout. Elke is een tekenfout: lay-out, labeling, schaal, interpunctie. Het model begreep het blad en rendeerde vervolgens de grafiek zoals een videomodel elke dichte tekst rendert, bij benadering.
Er is een tweede, structurele reden waarom de output er totaal niet uitziet als je deck.
Doe de rekensom. 50 pagina's is de paginagrens, 30 seconden is de duurgrens. Dat is 0,6 seconden per pagina.
Je kunt geen pagina presenteren in 0,6 seconden, dus doet het model het enige zinnige en maakt er een trailer van. Die decktest van derden kwam onafhankelijk tot dezelfde conclusie: het behandelde de presentatie als bronmateriaal voor een filmische advertentie, niet als dia's om doorheen te bladeren. De monturen van het productproduct verschoof van dik naar randloos naar een derde vorm over verschillende shots.
Wat ook de reden is waarom de 30-seconden grens een ontwerpbeperking is, geen voetnoot in de specificatie.
We hebben de geleverde bestanden gemeten: de vier officiële documentdemo's komen uit op 30,04s, 30,02s, 25,03s en 23,04s. De twee 30-seconden clips stoppen abrupt binnen vier honderdsten van een seconde van elkaar. En de spreadsheetdemo werd gevraagd voor 22 seconden, en leverde 23,04. We hebben die grens uit elkaar gehaald in de Wan 3.0 preview.
Dus: verwachtingen bijgesteld. Voer een document in, krijg een trailer, houd je grafieken eenvoudig.
De Document naar Video Workflow Die Je Vandaag Kunt Uitvoeren
Snelle realiteitscheck voor de tutorial, want het bespaart je een uur zoeken.
Wan 3.0's documentinvoer is alleen te vinden op Alibaba's eigen kanalen, toegang is alleen op uitnodiging, en de weights zijn niet gepubliceerd. Niemand buiten die kanalen kan het aanbieden, ook wij niet. Wat je wel vandaag kunt doen, is de nuttige helft van die xlsx-demo herbouwen met modellen die al open voor zaken zijn, en de frame-audit hierboven vertelt je precies hoe je het deel dat breekt kunt omzeilen.
Drie stappen, één browsertabblad op Atlas Cloud:
- Een model met een miljoen tokens leest het document en schrijft een shot script met tijdscodes, waarbij elk getal als letterlijke string is ingebakken.
- Een beeldmodel rendert het eerste frame, waar alle tekstnauwkeurigheid wordt vastgelegd.
- Een videomodel animeert dat frame volgens het script.
| Stap | Model | Lijstprijs | Max. duur | Waarom dit hier is |
|---|---|---|---|---|
| 1. Script | Qwen3.8 Max (/models/qwen/qwen3.8-max) | $2 in / $6 uit per 1M tokens | n.v.t. | 1M context slikt een heel deck |
| 2. Eerste frame | GPT Image 2 Text-to-Image | $0,009 per afbeelding (vloer) | n.v.t. | sterkste tekstweergave voor cijfers op het scherm |
| 3. Render | Wan 2.7 Image-to-Video | $0,1 per seconde | 15s | Eerste-framecontrole houdt je typografie stabiel |
| Audio optie | Wan 2.7 Text-to-Video | $0,1 per seconde | 15s | Genereert muziek en SFX in dezelfde pas, maar neemt geen eerste frame |
| Vervang voor stap 3 | MiniMax H3 Text-to-Video | $0,1 per seconde | 15s | Zelfde tarief, ander bewegingskarakter |
| Vervang voor stap 3 | Seedance 2.5 Text-to-Video | $0,134 per seconde | 30s | De enige hier die 30s in één pas haalt |
Drie eerlijke beperkingen aan deze keten. Het eet geen .pptx-binary, dus je plakt de tekst of de CSV zelf. Wan 2.7 stopt bij 15 seconden, dus een enkele take van 30 seconden is niet mogelijk. En de image-to-video route is standaard stil: de audio-parameter neemt een track die jij aanlevert voor lip-sync, het verzint geen soundtrack. Als je audio in dezelfde pas gegenereerd wilt hebben, gebruik je de text-to-video variant en geef je de controle over het eerste frame op, wat voor een video vol dollartekens de verkeerde afweging is. Prijzen geverifieerd op de modelpagina's op 20 augustus 2026, en let op: een lijstprijs is een vloer: kwaliteits- en resolutietiers duwen de live offerte omhoog, dus lees de Run-knop voordat je je vastlegt.
Laten we het bouwen.
Stap 1: Zet Je Spreadsheet Om in een Shot Script met Tijdscodes
Videomodellen onthouden geen getallen. Ze renderen elke string die je ze geeft. De taak van deze stap is dus om een tabel om te zetten in shotaanwijzingen waarbij elk cijfer al als tekst tussen aanhalingstekens is uitgeschreven.
Plak je blad tussen de <<<-markeringen. Instellingen: temperatuur 0,3, max_tokens 4000. Houd max_tokens royaal, want een redeneeraar model dat halverwege zijn budget opraakt, geeft een leeg antwoord waarvoor je nog steeds betaalt.
text1Je bent een motion-graphics regisseur. Hieronder staat een onbewerkte spreadsheet export. 2 3<<< 4Maand,Noord-Amerika,Zuid-Oost Azië,Europa,Totale GMV 5Jan,1580,880,640,3100 6Feb,2110,1240,900,4250 7Maa,2740,1610,1150,5500 8Apr,3120,1980,1330,6430 9Mei,3350,2240,1460,7050 10Jun,3460,2480,1580,7520 11H1 groei,+45,7%,,, 12>>> 13 14Schrijf een shot script voor een 10-seconden, 16:9, Apple-Keynote-stijl 15bedrijfsdatavideo. Regels: 161. Precies 2 shots. Geef elk een in/out tijdcode (00:00-00:05, 17 00:05-00:10). 182. Elk getal dat op het scherm verschijnt, moet in de shotbeschrijving 19 worden geschreven als een exacte letterlijke string, tussen 20 aanhalingstekens, b.v. "$1.580". Schrijf nooit "het januari cijfer" 21 - schrijf de cijfers. 223. Vraag NIET om een legenda, een as met ticklabels, of meer dan 23 twee dataseries tegelijk op het scherm. Gebruik grote losstaande 24 cijfers en één koraalkleurige pillvormige badge. 254. Puur witte achtergrond, zacht koraal + donkergrijs palet, schreefloos. 265. Eindig met één regel BGM + SFX aanwijzing (whoosh bij inschuiven, 27 één beltoon bij de badge). 28Geef alleen het script, geen commentaar. 29
Regel 3 is de beloning van de audit. De officiële output brak op precies drie dingen: legendes, asticks en multi-serie grafieken. Dus verwijderen we alle drie uit de briefing en besteden die schermruimte aan oversized cijfers en een kleurgecodeerde badge. Zelfde informatie, geen van het faaloppervlak.
Regel 2 is degene die mensen overslaan, en het is de reden dat de cijfers overleven tot het einde van deze keten. Een shotbeschrijving die zegt "het januari cijfer" geeft het getal terug aan een model dat glyphs ervoor moet verzinnen. Een shotbeschrijving die "$1.580" tussen aanhalingstekens zegt, geeft de volgende twee stappen een string om te kopiëren. Je vraagt hier niet om datavisualisatie, je vraagt om een type-instructie.
Wat terugkomt is een script met twee shots met in- en uittijdscodes, elk getal op het scherm als letterlijk citaat, en een afsluitende BGM- en SFX-regel. Bewaar het in een kladbestand; stap 2 en 3 lezen er beide uit.
Stap 2: Genereer het Eerste Merkframe
Elk teken van tekst op het scherm wordt hier bepaald. Een beeldmodel van hoge kwaliteit rendert $1.580 correct veel betrouwbaarder dan een videomodel het kan schrijven terwijl het ook beweegt, dus we lossen de typografie op in een stilstaand beeld en laten stap 3 alleen pixels verplaatsen.
Open GPT Image 2 en stel kwaliteit in op hoog en de grootte op de 16:9-optie, wat op deze pagina 2048x1152 is. Match de beeldverhouding met de video die je gaat maken, anders begint stap 3 met het bijsnijden van je typografie.
text1Een onberispelijk Apple-Keynote-stijl presentatieframe op een puur witte 2naadloze achtergrond, gefotografeerd alsof het geprojecteerd wordt op een matte 3studiomuur. Gecentreerde kop in een diep antraciet geometrisch schreefloos 4lettertype met "H1 2026", gezet in royale negatieve ruimte. Daaronder, twee 5overdreven grote cijfers in hetzelfde lettertype, "$1.580" links en 6"$3.460" rechts, gescheiden door een dunne lichtgrijze pijl. Onder de 7pijl, kleine lichtgrijze bijschrifttekst met "Maandelijkse GMV 8Groei". Daaronder, een enkele koraalkleurige pillvormige badge met witte 9tekst met "+45,7%". Zachte gelijkmatige diffuse belichting, zwak warm 10verloop in de rechterbovenhoek, subtiele papierkorrel, geen rommel, geen 11logo's, geen grafieken. Ultra-schoon bedrijfsminimalisme, 16:9. 12
Twee details die het kopiëren waard zijn. "Geen grafieken" staat er met opzet in. En lees de prijsopgave op de Run-knop voordat je erop drukt, want kwaliteit hoog op een breed 2K frame kost een veelvoud van het $0,009 lijstcijfer.

GPT Image 2 speelruimte op Atlas Cloud met de eerste-frame prompt en het gerenderde Keynote-stijl frame met elk cijfer correct gespeld
GPT Image 2 op kwaliteit hoog, 16:9 op 2048x1152. Elk cijfer is geland: "H1 2026", "$1.580", "$3.460" en de koraal "+45,7%" badge, wat precies is waarom de typografie wordt vastgelegd in een stilstaand beeld en niet in een videomodel.
Stap 3: Render de Document naar Video Clip en Verifieer Elk Cijfer
Laatste stap. Laad de stap-2 afbeelding als eerste frame en laat het videomodel het animeren terwijl de typografie stil blijft.
Open Wan 2.7 Image-to-Video. Instellingen: je eerste frame geüpload, resolutie 1080P, duur 10s. Laat het audioveld leeg, want dit model behandelt audio als een aansturende invoer in plaats van iets dat het creëert. Je voegt deze clip zelf toe van een soundtrack, of in een aparte text-to-video pas.
text1Animeer dit frame als een 10-seconden Apple-Keynote-stijl bedrijfsdata- 2video, waarbij de bestaande typografie pixel-stabiel blijft. 3 400:00-00:05 - De kop "H1 2026" blijft, lost dan op in gouden 5deeltjes die naar buiten drijven. De twee cijfers "$1.580" en 6"$3.460" schuiven van links en rechts naar binnen en vergrendelen op hun plaats; 7de dunne grijze pijl tekent zichzelf tussen hen van links naar rechts. De koraalbadge 8met "+45,7%" springt van onderen omhoog met een lichte overshoot, 9getimed op een enkele heldere beltoon. 10 1100:05-00:10 - Alles schuift soepel naar links. Drie 12dikke afgeronde staven groeien omhoog vanuit een gedeelde basislijn tegen dezelfde 13puur witte achtergrond, koraal, blauwgroen en amber, met één groot losstaand 14cijfer boven elk: "$3.460", "$2.480", "$1.580". Geen 15legenda, geen as, geen ticklabels, geen rasterlijnen. Camera blijft vergrendeld 16en perfect stil gedurende de hele tijd. 17
"De bestaande typografie pixel-stabiel houden" en "camera blijft vergrendeld" doen echt werk. Elke camerabeweging is een nieuwe kans voor het model om tekst te hertekenen die het met rust zou moeten laten.
Doe dan het saaie, belangrijke deel: pauzeer op elk frame waar een getal verschijnt en controleer het tegen de bronrij. Dat is een check van 30 seconden, en het is het enige dat tussen jou en een video staat die zelfverzekerd het verkeerde omzetcijfer laat zien.

Wan 2.7 Image-to-Video speelruimte op Atlas Cloud met het eerste frame geladen en de voltooide dataclip gerenderd
Wan 2.7 Image-to-Video op 1080P met het stap-2 eerste frame geüpload en de voltooide clip in het uitvoerpaneel. Het is de moeite waard om op te merken wat het paneel zegt: we vroegen om 10 seconden, het duurveld toonde 10, en de render kwam terug op 5. De Run-offerte vertelde ons dat al voordat het bestand het deed, wat de hele reden is om het te lezen.

De voltooide dataclip herbouwd van dezelfde GMV-spreadsheet, elk cijfer intact
De payoff: dezelfde spreadsheet, herbouwd met legendes en asticks bewust weggelaten. Het model heeft beide scriptshotten gecomprimeerd in de vijf seconden die het daadwerkelijk renderde, en elk cijfer overleefde de verplaatsing: "$1.580" en "$3.460" in de opening, vervolgens "$3.460", "$2.480" en "$1.580" over de drie staven. Nul verminkte labels, omdat er geen labels meer waren om te verminken. Stil ontwerp, aangezien de image-to-video route niets voor je scoort.
Document naar Video Variaties en Wat een Afgewerkte Minuut Kost
De spreadsheetcase is de moeilijkste. De andere drie officiële gebruiksscenario's zijn eenvoudiger, en die bevatten de meeste commerciële waarde.
Cursusmateriaal. Voer een encyclopedie-artikel in en vraag om een les op een specifiek leesniveau. De output hieronder is een chibi-stijl geanimeerde les over de dichter Wang Wei, 25,03 seconden lang.
De tekeningstijl blijft de hele tijd consistent. De karakterdetails niet. Op de 3-secondenmarkering draagt hij een zwarte muts tegen een effen witte achtergrond; tegen 22 seconden is de muts lichtblauw geworden en staat hij in een klassiek schilderij op rol. Dezelfde verschuiving die de decktester zag in die monturen. Als je dit herbouwt op de driedelige keten, vergrendel dan een karakterkaart in stap 1 en hergebruik het stap-2 frame als je stijlanker.
Encyclopedie-artikel naar een geanimeerde les voor de eerste klas, 25,03s met gegenereerde audio. Officiële Alibaba Wan 3.0 publieke-bètademo.
Merkfilms. Een voorsteldocument wordt een volledige 30-seconden spot. Het is de mooiste van de vier demo's en de minst verifieerbare, omdat je niet kunt zien wat het brondocument zei. Let op consistentie, niet op schoonheid: dit is de faalmodus die de tester van derden opviel, wiens product drie keer van vorm veranderde in één clip.
Voorsteldocument naar een 30,04s skincare merkfilm. Officiële Alibaba Wan 3.0 publieke-bètademo, audio aan.
Rapport samenvattingen. Er bestaat geen officiële demo voor deze, dus behandel het patroon als ongetest: vraag om één presentator, één bewering per shot, en zet elk getal tussen aanhalingstekens zoals in stap 1.
Nu het geld.
| Wat | Tarief | 30 seconden afgewerkte video |
|---|---|---|
| Wan 3.0, 1080p (RMB-lijst) | ¥1,2 per seconde | ¥36 |
| Wan 3.0, 1080p (USD-lijst) | $0,20 per seconde | $6,00 |
| Wan 3.0, 720p (RMB-lijst) | ¥0,6 per seconde | ¥18 |
| Driedelige keten, één pas | script + frame + $0,1/s render | ruwweg $1,20 voor 10s |
| Driedelige keten, 3 pogingen | script hergebruikt, frame en render herhaald | ruwweg $3,50 |
Twee gepubliceerde Wan 3.0 prijslijsten zijn het oneens over of 1080p ¥1,2 of $0,20 per seconde is, wat niet hetzelfde getal is. Controleer het tarief op het endpoint waartegen je daadwerkelijk wordt gefactureerd voordat je een reeks budgetteert.
De verborgen kosten zijn niet het per-seconde tarief. Het is de heruitvoering. Documentinvoer neemt één bestand per taak, dus het wijzigen van één enkel cijfer betekent het opnieuw genereren van de hele video. In de driedelige keten is het shot script een herbruikbaar tekstartefact, dus een cijferwijziging kost je één render in plaats van één volledige taak. Over een kwartaalrapportagecyclus overtreft dat verschil de per-seconde prijs.
Eén juridische opmerking voordat je iets uploadt. Een document dat je naar een gehost model stuurt, is een document dat je gebouw verlaat, en interne decks en niet-openbare financiële gegevens hebben meestal een beleid daarvoor. Controleer het vóór de deadline-druk, niet erna. En elke officiële democlip in dit artikel is eigendom van Alibaba, hier geciteerd als publiek bètamateriaal; niets hier is een licentie om ze commercieel te hergebruiken.
Wan 3.0 Document naar Video FAQ
Welke bestandstypen accepteert Wan 3.0 document naar video, en hoe groot?
doc, xls, ppt, pdf, txt en md, met key, pages en numbers ook gemeld, plus een gewone weblink in plaats van een bestand. Eén bestand of één link per taak, tot 100 MB of 50 pagina's.
Maakt Wan 3.0 van elke dia een scène?
Nee, en dit is het meest voorkomende misverstand. Het leest het hele document, regisseert dan een video van wat het heeft geleerd. Bij de grens is dat 50 pagina's in 30 seconden, of 0,6 seconden per pagina, dus het produceert een trailer in plaats van een paginadraaier. Zowel de officiële gebruiksscenario's als onafhankelijke tests wijzen dezelfde kant op.
Zijn de cijfers uit mijn spreadsheet accuraat in de video?
Celwaarden hielden stand in elke case die ik controleerde, inclusief $1.580, $3.460 en +45,7% in de officiële demo. Wat faalt is grafiekmeubilair: legendes worden samengevoegd, asstreepjes komen niet-lineair uit en duizendtallen gaan verloren. Injecteer elk cijfer als een letterlijke quote en ontwerp legendes en ticklabels volledig uit de briefing.
Kan ik Wan 3.0 document naar video vandaag via een API gebruiken?
Alleen via Alibaba's eigen kanalen, momenteel alleen op uitnodiging, en de weights zijn niet gepubliceerd. Wan 2.2 blijft de laatste open-weight release in de lijn. Totdat dat verandert, is de bovenstaande driedelige keten het praktische alternatief.
Hoeveel kost een 30-seconden Wan 3.0 video?
Tegen het gepubliceerde 1080p-tarief is dat ¥36, of $6,00 op de internationale lijst, voor één 30-seconden clip. Budgetteer voor heruitvoeringen in plaats van een enkele pas, want een correctie van één cijfer betekent het opnieuw genereren van het geheel.
Wat is het dichtst bij Wan 3.0 document naar video dat ik nu kan draaien?
Een long-context model om het shot script te schrijven, vervolgens Wan 2.7 voor $0,1 per seconde voor de render, met MiniMax H3 tegen hetzelfde tarief of Seedance 2,5 voor $0,134 per seconde als alternatieven. Je krijgt de gegenereerde-beeld-look en frame-accurate tekst. Wat je niet krijgt: 30 seconden in één continue take, audio in dezelfde pas als de image-to-video render, of een model dat de .pptx voor je leest.
De eerlijke samenvatting: Wan 3.0 document naar video is een echte mogelijkheid met een echte grens, en de kloof tussen zijn output en die van jou is kleiner dan het lijkt, zolang je stopt met vragen aan een van beide om een legenda te tekenen.






