Seedance 2.5 è ora live — In anteprima su Atlas Cloud

Wan 3.0 Da documento a video: Ho verificato ogni fotogramma.

Wan 3.0 da documento a video è reale: ho controllato la demo ufficiale xlsx fotogramma per fotogramma. I numeri sopravvivono, i grafici si rompono. In più un workflow che puoi eseguire ora.

Carica un foglio di calcolo. Ricevi un'animazione aziendale di 23 secondi con musica.

Questa è la promessa di Wan 3.0 Document to Video, il primo input nativo per documenti della famiglia, e la demo ufficiale la mantiene in modo più letterale di quanto mi aspettassi. I numeri sono corretti. $1.580 diventa $3.460, il badge riporta +45,7%, e quelle cifre riconducono direttamente a celle specifiche del foglio sorgente.

Poi ho trascinato la testina di riproduzione al secondo 12 e ho letto la legenda del grafico.

"Southeasta North America."

Due regioni di vendita schiacciate in una parola che non esiste. Questa è la vera linea di galleggiamento del documento-a-video nel 2026: il modello ha effettivamente letto la tua tabella, ma ancora non sa disegnare il tuo grafico. Di seguito trovi l'analisi fotogramma per fotogramma che nessun altro ha pubblicato, più una catena in tre passaggi che puoi effettivamente eseguire oggi pomeriggio.

Punti chiave

  • Wan 3.0 accetta 1 file o 1 link, fino a 100 MB o 50 pagine, e produce fino a 30 secondi a 1080p.
  • Crea un film dal tuo documento. Non trasforma la diapositiva 3 nell'inquadratura 3.
  • I valori delle celle sopravvivono intatti. Legende dei grafici, tacche degli assi e separatori delle migliaia no.
  • Limiti invalicabili: niente 4K, niente pesi aperti, solo canali di prima parte.
  • Un modello a contesto lungo più un modello video da 15 secondi riproduce gran parte di questo oggi.

Testo dorato che legge H1 2026 Wan con schizzi di glitter dorati

Output di Wan 3.0 document to video: la demo ufficiale xlsx renderizzata come filmato di dati animato in stile Keynote

La vetrina: la demo pubblica beta ufficiale di Alibaba Wan 3.0, un .xlsx con GMV mensile in input, 23 secondi di filmato di dati animato in output. Mostrato qui come GIF silenziosa; il file consegnato include una traccia AAC stereo a 44,1 kHz. Fonte: manuale del creatore ufficiale di Alibaba Wan 3.0.

Cosa fa effettivamente Wan 3.0 Document to Video

Versione breve, così puoi andartene in un minuto se è tutto ciò che ti serve.

Gli dai un documento o un link web. Lo legge tutto, decide qual è la storia e genera un video con immagini e suono in un unico passaggio. Massimo 30 secondi, massimo 1080p. Non sfoglia le tue pagine in ordine.

Ecco i limiti che effettivamente governano un progetto.

SpecificaInput documenti Wan 3.0
Formatidoc, xls, ppt, pdf, txt, md, più key / pages / numbers e un semplice link web
Input per lavoro1 file o 1 link (non entrambi, non diversi)
Limite dimensione100 MB
Limite pagine50 pagine
Output massimo30 secondi, singolo passaggio continuo
Risoluzione max1080p (nessun livello 4K)
Audiogenerato nello stesso passaggio dell'immagine
Pesi apertinessuno; Wan 2.2 è ancora l'ultima release a pesi aperti
Dove ottenerloAlibaba Cloud Model Studio (Bailian) e Qwen Cloud, accesso su invito

La beta pubblica è stata aperta il 6 agosto 2026 (AgentUpdate, agosto 2026). L'elenco dei formati e i due listini prezzi pubblicati provengono da un riepilogo separato delle specifiche (Ngram, agosto 2026).

Il manuale ufficiale presenta quattro casi d'uso per i documenti, e corrispondono a quattro lavori per cui le persone già pagano le agenzie:

  • Documento di proposta in un film di marca. Un documento di presentazione per la cura della pelle diventa un annuncio di 30 secondi con un'attrice protagonista e una storia di luce mattutina.
  • Materiale didattico in una lezione video. Una voce di enciclopedia diventa una lezione animata per bambini di prima elementare.
  • Foglio di calcolo in grafici animati. La demo sopra, e di gran lunga la più difficile delle quattro.
  • Report in un riepilogo parlato. Un report scritto diventa un briefing in stile presentatore.

Ora, ecco dove la maggior parte degli articoli sbaglia la categoria.

I concorrenti "PDF to video" non fanno questo. Il document-to-video di Kapwing estrae il testo dal tuo file e lo posiziona su una timeline, senza costruzione di scene e senza presentatore. Pictory e Powtoon assemblano filmati stock o animazioni basate su template, e le stesse pagine prodotto di Powtoon pubblicizzano avatar AI e voci che leggono il tuo copione. Tutti e tre producono diapositive narrate.

Wan 3.0Kapwing Document to VideoPictoryPowtoon Anything-to-Video
Cosa viene prodottoun film generatoil tuo testo su una timelinefilmati stock tagliati su un copioneanimazione template
Inventa nuove immaginisì, ogni fotogrammanono, clip libreriano, risorse template
Presentatore AInessuno per defaultnessunovoce opzionaleavatar e voci
Audiogenerato con l'immaginelo aggiungi tuvoiceover TTSvoiceover TTS
Singolo output max30 secondidurata progettodurata progettodurata progetto
Disponibilitàsolo su invito, prima partepubblicopubblicopubblico

Leggi quella tabella due volte, perché è l'intero argomento: questi non sono concorrenti nella stessa categoria. Uno produce presentazioni narrate. L'altro produce filmati che non sono mai esistiti. Confrontarli sul prezzo al minuto è come confrontare una fotocopiatrice con una troupe cinematografica.

Wan 3.0 può fare anche la cosa della presentazione? Sì, e questa è l'onesta avvertenza.

Controesempio: quando gli è stato chiesto di trasformare una pagina web sulla meccanica quantistica in un simpatico spiegone, Wan 3.0 ha prodotto esattamente il formato presentatore-più-didascalia che i concorrenti vendono. Colpisce il muro dei 30 secondi a 30,02 secondi. Demo ufficiale beta pubblica di Alibaba, audio attivo.

Quindi la differenza non è che Wan 3.0 non possa fare spiegoni con testa parlante. È che con i concorrenti, quel formato è l'unica cosa nel menu.

Perché Wan 3.0 Document to Video Rompe i Grafici ma Mantiene i Tuoi Numeri

Ecco la cosa più utile in questo articolo: ho estratto 12 fotogrammi equidistanti dalla demo ufficiale del foglio di calcolo e ho letto ogni glifo.

Il verdetto si divide nettamente in due. I valori passano. L'arredamento del grafico fallisce.

Cosa è sopravvissuto. Al secondo 4 il fotogramma mostra $1.580, una sottile freccia grigia, $3.460, la didascalia "Monthly GMV Growth" e un badge corallo che legge +45,7%. La tipografia è pulita, le virgole sono al posto giusto, nessun carattere distorto. Il prompt dietro questa demo cita celle specifiche del foglio di calcolo, e le cifre sullo schermo corrispondono. Un test di terze parti su un deck di prodotto di 8 pagine ha riscontrato la stessa cosa: 45g, 12 ore e 55 gradi sono stati renderizzati correttamente, e lo slogan finale è uscito senza un singolo carattere sbagliato (AI-Driven Lab, agosto 2026).

Questo risponde alla domanda che i team finanziari e di formazione si pongono realmente. Le tue cifre non mutano silenziosamente.

Cosa si è rotto. I fotogrammi dei grafici sono un'altra storia.

Grafico a linee annotato che mostra tre errori in legenda, scala e unità

Analisi fotogramma di Wan 3.0 document to video che mostra una legenda del grafico fusa e un asse y rotto

Congelato a 12 secondi nella demo ufficiale. Tre difetti in un fotogramma: due nomi di regione fusi in "Southeasta North America", "North America" poi ripetuto come serie a sé, e un asse y che legge 30, 60, 70 mentre l'etichetta dati superiore dice $3.880.

Conta i fallimenti in quel singolo fotogramma:

  1. Legenda fusa. "Southeast Asia" e "North America" si scontrano in "Southeasta North America". Poi "North America" appare di nuovo come serie separata, quindi una regione viene etichettata due volte e una è scomparsa.
  2. Un asse y che non è una scala. Le tacche leggono 30, 60, 70. Spazi tra pixel uguali, valori disuguali, e 40 e 50 semplicemente mancanti.
  3. Asse ed etichette in unità diverse. La linea di griglia più alta è 70. L'etichetta fissata al punto dati superiore dice $3.880.
  4. Deriva di magnitudine lungo una linea. Le etichette su quella curva superiore iniziano a $330 e $335, poi atterrano a $3.970 e $3.880. Una linea ascendente uniforme non può contenere un salto di dieci volte tra due punti adiacenti. Le due etichette in mezzo sono sfocate oltre una lettura sicura, che è una risposta a sé stante.

Il segmento del grafico a barre ripete lo schema. Quattro barre portano $1750, $1.580, $2.350 e $2.580, quindi la barra più corta contiene il secondo numero più alto, e la prima etichetta perde il separatore delle migliaia mentre le altre tre lo mantengono. Accanto ci sono cinque cifre di crescita verdi per quattro barre. E il segmento ad anello si concentra su $89,7M, una virgola dove dovrebbe esserci un punto decimale.

Nota cosa hanno in comune tutti questi. Non uno è un errore di contenuto. Ognuno è un errore di disegno: layout, etichettatura, scala, punteggiatura. Il modello ha compreso il foglio e poi ha renderizzato il grafico nel modo in cui un modello video renderizza qualsiasi testo denso, approssimativamente.

C'è una seconda ragione strutturale per cui l'output non assomiglia per niente al tuo deck.

Fai i calcoli. 50 pagine è il limite massimo, 30 secondi è il limite di durata. Sono 0,6 secondi per pagina.

Non puoi presentare una pagina in 0,6 secondi, quindi il modello fa l'unica cosa sensata e crea un trailer. Quel test del deck di terze parti è giunto indipendentemente alla stessa conclusione: ha trattato la presentazione come materiale sorgente per un annuncio cinematografico, non come diapositive da sfogliare. Le montature degli occhiali del prodotto sono passate da spesse a senza montatura a una terza forma attraverso le inquadrature.

Il che è anche il motivo per cui il limite di 30 secondi è un vincolo di progettazione, non una nota tecnica.

Abbiamo misurato i file consegnati: le quattro demo ufficiali dei documenti arrivano a 30,04s, 30,02s, 25,03s e 23,04s. I due clip da 30 secondi si fermano entro quattro centesimi di secondo l'uno dall'altro. E alla demo del foglio di calcolo sono stati chiesti 22 secondi, poi ne ha consegnati 23,04. Abbiamo analizzato quel limite nell'anteprima di Wan 3.0.

Quindi: aspettative calibrate. Dagli un documento, ottieni un trailer, mantieni i tuoi grafici semplici.

Il Flusso di Lavoro Document to Video che Puoi Eseguire Oggi

Un rapido controllo di realtà prima del tutorial, perché ti fa risparmiare un'ora di ricerca.

L'input documenti di Wan 3.0 vive solo sui canali di Alibaba, l'accesso è su invito e i pesi non sono pubblicati. Nessuno al di fuori di quei canali può offrirlo, incluso noi. Quello che puoi fare oggi è ricostruire la metà utile di quella demo xlsx con modelli già aperti al pubblico, e l'analisi dei fotogrammi sopra ti dice esattamente come evitare la parte che si rompe.

Tre passaggi, una scheda del browser su Atlas Cloud:

  1. Un modello da un milione di token legge il documento e scrive un copione con inquadrature temporizzate, con ogni numero inserito come stringa letterale.
  2. Un modello di immagine renderizza il primo fotogramma, dove viene bloccata tutta la precisione del testo.
  3. Un modello video anima quel fotogramma secondo il copione.
PassaggioModelloPrezzo indicatoDurata maxPerché è qui
1. CopioneQwen3.8 Max (/models/qwen/qwen3.8-max)$2 in / $6 out per 1M tokenn/a1M di contesto ingoia un intero deck
2. Primo frameGPT Image 2 Text-to-Image$0,009 per immagine (minimo)n/ail rendering testuale più forte per cifre sullo schermo
3. RenderWan 2.7 Image-to-Video$0,1 al secondo15sil controllo del primo fotogramma mantiene stabile la tua tipografia
Opzione audioWan 2.7 Text-to-Video$0,1 al secondo15sgenera musica e SFX nello stesso passaggio, ma non accetta primo frame
Alternativa step 3MiniMax H3 Text-to-Video$0,1 al secondo15sstessa tariffa, diverso carattere di movimento
Alternativa step 3Seedance 2.5 Text-to-Video$0,134 al secondo30sl'unico qui che raggiunge 30 secondi in un unico passaggio

Tre limiti onesti su questa catena. Non mangia un binario .pptx, quindi incolli tu il testo o il CSV. Wan 2.7 arriva al massimo a 15 secondi, quindi una singola ripresa da 30 secondi è fuori discussione. E il percorso immagine-a-video è silenzioso per progettazione: il suo parametro audio accetta una traccia che fornisci tu per guidare il lip-sync, non inventa una colonna sonora. Se vuoi l'audio generato nello stesso passaggio, usi il fratello text-to-video e rinunci al controllo del primo fotogramma, che per un video pieno di cifre in dollari è lo scambio sbagliato. I prezzi sono verificati sulle pagine dei modelli il 20 agosto 2026, e nota che un prezzo indicato è un minimo: i livelli di qualità e risoluzione spingono il preventivo in tempo reale più in alto, quindi leggi il pulsante Esegui prima di impegnarti.

Costruiamolo.

Passaggio 1: Trasforma il tuo foglio di calcolo in un copione con inquadrature temporizzate

I modelli video non ricordano i numeri. Renderizzano qualunque stringa tu dia loro. Quindi il compito di questo passaggio è convertire una tabella in indicazioni di inquadratura dove ogni cifra è già scritta come testo tra virgolette.

Incolla il tuo foglio tra i marcatori <<<. Impostazioni: temperatura 0,3, max_tokens 4000. Mantieni max_tokens generoso, perché un modello con capacità di ragionamento che esaurisce il budget a metà pensiero ti restituisce una risposta vuota per cui hai comunque pagato.

text
1Sei un regista di motion-graphics. Di seguito c'è un export grezzo di un foglio di calcolo.
2
3<<<
4Mese,America del Nord,Sud-est asiatico,Europa,GMV Totale
5Gen,1580,880,640,3100
6Feb,2110,1240,900,4250
7Mar,2740,1610,1150,5500
8Apr,3120,1980,1330,6430
9Mag,3350,2240,1460,7050
10Giu,3460,2480,1580,7520
11Crescita H1,+45,7%,,,
12>>>
13
14Scrivi un copione per un video di dati aziendali in stile Apple Keynote, 10 secondi, 16:9. Regole:
151. Esattamente 2 inquadrature. Assegna a ciascuna un timecode in/out (00:00-00:05, 00:05-00:10).
162. Ogni numero che appare sullo schermo deve essere scritto nella descrizione dell'inquadratura come stringa letterale esatta, tra virgolette, ad es. "$1.580". Non scrivere mai "la cifra di gennaio" - scrivi le cifre.
173. NON chiedere una legenda, un asse con etichette delle tacche o più di due serie di dati contemporaneamente sullo schermo. Usa grandi numeri autonomi e un singolo badge a forma di pillola color corallo.
184. Sfondo bianco puro, palette soft corallo + grigio scuro, sans-serif.
195. Termina con una riga di direzione per BGM + SFX (woosh all'ingresso, un rintocco di campana sul badge).
20Output solo il copione, nessun commento.
21

La regola 3 è il frutto dell'analisi. L'output ufficiale si è rotto esattamente su tre cose: legende, tacche degli assi e grafici a serie multiple. Quindi cancelliamo tutti e tre dal brief e spendiamo quello spazio dello schermo per numeri sovradimensionati e un badge colorato. Stesse informazioni, nessuna superficie di fallimento.

La regola 2 è quella che la gente salta, ed è il motivo per cui le cifre sopravvivono fino alla fine di questa catena. Una descrizione dell'inquadratura che dice "la cifra di gennaio" restituisce il numero a un modello che deve inventare glifi per esso. Una descrizione dell'inquadratura che dice "$1.580" tra virgolette dà ai due passaggi successivi una stringa da copiare. Non stai chiedendo una visualizzazione dati qui, stai chiedendo un'istruzione di battitura.

Quello che torna è un copione di due inquadrature con timecode in e out, ogni cifra sullo schermo quotata come letterale, e una riga di chiusura per BGM e SFX. Tienilo in un file di appunti; i passaggi 2 e 3 leggono entrambi da lì.

Passaggio 2: Genera il primo fotogramma del marchio

Ogni carattere di testo sullo schermo viene deciso qui. Un modello di immagine ad alta qualità renderizza $1.580 correttamente in modo molto più affidabile di quanto un modello video possa scriverlo mentre lo muove, quindi sistemiamo la tipografia in una natura morta e lasciamo che il passaggio 3 spinga solo i pixel.

Apri GPT Image 2 e imposta la qualità su alta e la dimensione sull'opzione 16:9, che su questa pagina è 2048x1152. Abbina le proporzioni al video che stai per fare, altrimenti il passaggio 3 inizia a ritagliare la tua tipografia.

text
1Un fotogramma immacolato in stile Apple Keynote su sfondo bianco puro senza cuciture, fotografato come se fosse proiettato su una parete opaca da studio. Titolo centrato in un geometrico sans-serif grigio carbone scuro che recita "H1 2026", ambientato in un generoso spazio negativo. Sotto, due numeri sovradimensionati nello stesso carattere, "$1.580" a sinistra e "$3.460" a destra, separati da una sottile freccia grigio chiaro. Sotto la freccia, una piccola didascalia in grigio chiaro che recita "Monthly GMV Growth". Sotto, un singolo badge a forma di pillola color corallo con testo bianco che recita "+45,7%". Illuminazione diffusa morbida e uniforme, leggera sfumatura calda nell'angolo in alto a destra, leggera grana di carta, nessun ingombro, nessun logo, nessun grafico. Minimalismo aziendale ultra pulito, 16:9.
2

Due dettagli degni di essere copiati. "Nessun grafico" è lì apposta. E leggi il prezzo sul pulsante Esegui prima di premerlo, perché la qualità alta su un fotogramma wide 2K costa un multiplo della cifra indicata di $0,009.

Screenshot di un generatore di immagini AI che mostra i passaggi di input e l'output

Playground di GPT Image 2 su Atlas Cloud con il prompt del primo fotogramma e il fotogramma in stile Keynote renderizzato che mostra ogni cifra scritta correttamente

GPT Image 2 a qualità alta, 16:9 a 2048x1152. Ogni cifra è atterrata: "H1 2026", "$1.580", "$3.460" e il badge corallo "+45,7%", che è esattamente il motivo per cui la tipografia viene sistemata in una natura morta e non in un modello video.

Passaggio 3: Renderizza il clip Document to Video e verifica ogni cifra

Ultimo passaggio. Carica l'immagine del passaggio 2 come primo fotogramma e lascia che il modello video lo animi mantenendo ferma la tipografia.

Apri Wan 2.7 Image-to-Video. Impostazioni: il tuo primo fotogramma caricato, risoluzione 1080P, durata 10s. Lascia vuoto il campo audio, poiché questo modello tratta l'audio come un input di guida piuttosto che qualcosa che crea. Stai montando tu questo clip, o in un passaggio separato text-to-video.

text
1Anima questo fotogramma come un video di dati aziendali in stile Apple Keynote di 10 secondi, mantenendo la tipografia esistente pixel-stabile.
2
300:00-00:05 - Il titolo "H1 2026" si mantiene, poi si dissolve in particelle dorate che si allontanano. I due numeri "$1.580" e "$3.460" scivolano dentro da sinistra e destra e si bloccano in posizione; la sottile freccia grigia si disegna tra di loro da sinistra a destra. Il badge corallo che recita "+45,7%" spunta dal basso con un leggero overshoot, sincronizzato con un singolo chiaro rintocco di campana.
4
500:05-00:10 - Tutto scivola via dolcemente verso sinistra. Tre spesse barre arrotondate crescono verso l'alto da una linea di base comune sullo stesso sfondo bianco puro, corallo, verde acqua e ambra, con un grande numero autonomo sopra ciascuna: "$3.460", "$2.480", "$1.580". Nessuna legenda, nessun asse, nessuna etichetta delle tacche, nessuna linea di griglia. La telecamera rimane bloccata e perfettamente ferma per tutto il tempo.
6

"Mantenendo la tipografia esistente pixel-stabile" e "telecamera rimane bloccata" stanno facendo un lavoro reale. Ogni movimento della telecamera è un'altra possibilità per il modello di ridisegnare il testo che dovrebbe lasciare stare.

Poi fai la parte noiosa e importante: metti in pausa su ogni fotogramma in cui appare un numero e leggilo rispetto alla riga sorgente. Questo è un controllo di 30 secondi, ed è l'unica cosa tra te e un video che mostra con sicurezza la cifra di fatturato sbagliata.

Interfaccia di generazione video AI che mostra il prompt di input e il video completato

Playground di Wan 2.7 Image-to-Video su Atlas Cloud con il primo fotogramma caricato e il clip di dati finito renderizzato

Wan 2.7 Image-to-Video a 1080P con il primo fotogramma del passaggio 2 caricato e il clip finito nel pannello di output. Vale la pena notare cosa dice il pannello: abbiamo chiesto 10 secondi, il campo durata mostrava 10, e il render è tornato 5. Il preventivo Run ce lo ha detto prima del file, che è il motivo per cui vale la pena leggerlo.

Crescita GMV mensile H1 2026 da $1.580 a $3.460, +45,7%

Il clip di dati finito ricostruito dallo stesso foglio di calcolo GMV, ogni cifra intatta

Il risultato: lo stesso foglio di calcolo, ricostruito con legende e tacche degli assi deliberatamente progettate per essere assenti. Il modello ha compresso entrambe le inquadrature copiate nei cinque secondi che ha effettivamente renderizzato, e ogni cifra è sopravvissuta al movimento: "$1.580" e "$3.460" nell'apertura, poi "$3.460", "$2.480" e "$1.580" sopra le tre barre. Zero etichette distorte, perché non c'erano etichette da distorcere. Silenzioso per progettazione, poiché il percorso immagine-a-video non produce nulla per te.

Variazioni di Document to Video e Quanto Costa un Minuto Finito

Il caso del foglio di calcolo è il più difficile. Gli altri tre casi d'uso ufficiali sono più facili, ed è lì che risiede la maggior parte del valore commerciale.

Materiale didattico. Dagli una voce di enciclopedia e chiedi una lezione a un livello di lettura specifico. L'output qui sotto è una lezione animata in stile chibi sul poeta Wang Wei, lunga 25,03 secondi.

Lo stile di disegno regge per tutto il tempo. I dettagli del personaggio no. Al secondo 3 indossa un berretto nero su sfondo bianco semplice; al secondo 22 il berretto è diventato azzurro e lui è in piedi all'interno di un dipinto classico a rotolo. La stessa deriva vista dal tester del deck in quelle montature. Se ricostruisci questo sulla catena a tre passaggi, blocca una scheda personaggio nel passaggio 1 e riutilizza il fotogramma del passaggio 2 come ancora di stile.

Voce di enciclopedia in una lezione animata per la prima elementare, 25,03 secondi con audio generato. Demo ufficiale beta pubblica di Alibaba Wan 3.0.

Film di marca. Un documento di proposta diventa uno spot completo di 30 secondi. È la più carina delle quattro demo e la meno verificabile, poiché non puoi vedere cosa diceva il documento sorgente. Guarda la coerenza piuttosto che la bellezza: questa è la modalità di fallimento che ha colto il tester di terze parti, il cui prodotto ha cambiato forma tre volte in un clip.

Documento di proposta in un film di marca per la cura della pelle di 30,04 secondi. Demo ufficiale beta pubblica di Alibaba Wan 3.0, audio attivo.

Riassunti di report. Non esiste una demo ufficiale per questo, quindi tratta lo schema come non testato: chiedi un presentatore, un'affermazione per inquadratura, e metti ogni cifra tra virgolette esattamente come nel passaggio 1.

Ora i soldi.

CosaTariffa30 secondi di video finito
Wan 3.0, 1080p (foglio RMB)¥1,2 al secondo¥36
Wan 3.0, 1080p (foglio USD)$0,20 al secondo$6,00
Wan 3.0, 720p (foglio RMB)¥0,6 al secondo¥18
Catena a tre passaggi, 1 tentativocopione + frame + $0,1/s rendercirca $1,20 per 10s
Catena a tre passaggi, 3 tentativicopione riutilizzato, frame e render ripetuticirca $3,50

Due listini prezzi pubblicati di Wan 3.0 non concordano se 1080p sia ¥1,2 o $0,20 al secondo, che non sono lo stesso numero. Controlla la tariffa sull'endpoint su cui vieni effettivamente fatturato prima di preventivare una serie.

Il costo nascosto non è la tariffa al secondo. È la riesecuzione. L'input documenti prende un file per lavoro, quindi modificare una singola cifra significa rigenerare l'intero video. Nella catena a tre passaggi, il copione è un artefatto di testo riutilizzabile, quindi una modifica di un numero ti costa un render invece di un lavoro completo. In un ciclo di report trimestrale, quella differenza supera di gran lunga il prezzo al secondo.

Una nota legale prima di caricare qualsiasi cosa. Un documento che invii a un modello ospitato è un documento che esce dal tuo edificio, e i deck interni e i dati finanziari non rilasciati di solito hanno una politica associata a questo. Controllala prima che arrivi la pressione della scadenza, non dopo. E ogni clip demo ufficiale in questo articolo appartiene ad Alibaba, citata qui come materiale beta pubblico; nulla qui è una licenza per riutilizzarli commercialmente.

FAQ su Wan 3.0 Document to Video

Quali tipi di file può accettare Wan 3.0 document to video e quanto grandi?

doc, xls, ppt, pdf, txt e md, con key, pages e numbers anche segnalati, più un semplice link web invece di un file. Un file o un link per lavoro, fino a 100 MB o 50 pagine.

Wan 3.0 trasforma ogni diapositiva in una scena?

No, e questo è l'equivoco più comune. Legge l'intero documento, poi dirige un video da ciò che ha imparato. Al limite si tratta di 50 pagine in 30 secondi, ovvero 0,6 secondi per pagina, quindi produce un trailer piuttosto che un gira-pagina. Sia i casi d'uso ufficiali che i test indipendenti puntano nella stessa direzione.

I numeri del mio foglio di calcolo sono accurati nel video?

I valori delle celle hanno retto in ogni caso che ho controllato, inclusi $1.580, $3.460 e +45,7% nella demo ufficiale. Ciò che fallisce è l'arredamento del grafico: le legende si fondono, le tacche degli assi risultano non lineari e i separatori delle migliaia scompaiono. Inietta ogni cifra come letterale quotato e progetta legende ed etichette delle tacche fuori dal brief completamente.

Posso usare Wan 3.0 document to video tramite un'API oggi?

Solo attraverso i canali di Alibaba, attualmente ad accesso su invito, e i pesi non sono pubblicati. Wan 2.2 rimane l'ultima release a pesi aperti della linea. Fino a quando non cambia, la catena a tre passaggi sopra è il sostituto pratico.

Quanto costa un video Wan 3.0 di 30 secondi?

Alla tariffa 1080p pubblicata sono ¥36, o $6,00 sul foglio internazionale, per un singolo clip di 30 secondi. Preventiva per le riesecuzioni piuttosto che per un singolo passaggio, perché una correzione di un numero significa rigenerare l'intero video.

Qual è la cosa più vicina a Wan 3.0 document to video che posso eseguire ora?

Un modello a contesto lungo per scrivere il copione, poi Wan 2.7 a $0,1 al secondo per il render, con MiniMax H3 alla stessa tariffa o Seedance 2,5 a $0,134 al secondo come alternative. Ottieni l'aspetto di filmato generato e testo preciso al fotogramma. Quello che non ottieni: 30 secondi in un'unica ripresa continua, audio nello stesso passaggio del render immagine-a-video, o un modello che legge il .pptx per te.

Il riassunto onesto: Wan 3.0 document to video è una capacità reale con un limite reale, e il divario tra il suo output e il tuo è più piccolo di quanto sembri, purché smetti di chiedere a entrambi di disegnare una legenda.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli