
Una parete di una suite di color grading che mostra la stessa inquadratura di un tetto sotto la pioggia ai timecode da 00:00 a 00:30
Trenta secondi di un unico piano continuo, distribuiti su una timeline. Arrivarci è tutta la storia.
Il giorno in cui Wan 3.0 Preview è entrato in beta pubblica, sono andato a cercare la sua scheda tecnica. La prima pagina dei risultati mi diceva che produce 4K nativo, che viene distribuito sotto Apache 2.0 e che ha una «modalità regista AI a sei telecamere». Sei siti diversi, stesse affermazioni, e nemmeno uno che linkasse a una fonte primaria.
Così ho aperto la pagina del modello di Alibaba. 480P, 720P, 1080P. Niente 4K. Poi ho interrogato direttamente l’API di Hugging Face e ho estratto ogni repository sotto l’organizzazione Wan-AI. Il più recente è Wan2.2-Animate-2, pubblicato lo stesso giorno del lancio di Wan 3.0. Non c’è nessun 3.0 di alcun tipo.
Poi ho fatto la parte che nessun altro sta facendo. Il punto forte di Wan 3.0 sono 30 secondi di video continuo in un solo passaggio, e io non ho accesso al modello, quindi ho provato a riprodurre quel risultato con i modelli che posso effettivamente chiamare oggi. Ho fallito. Il modo in cui ho fallito si è rivelato la cosa più utile di questo articolo.
Punti chiave
- Wan 3.0 Preview è entrato in beta pubblica il 6 agosto 2026. ID modello
wan3.0-video, protetto da una richiesta di accesso su Alibaba Cloud Model Studio e Qwen Cloud. Non è una registrazione aperta. - Le specifiche reali: fino a 30 secondi in un solo passaggio, 480P/720P/1080P, a $0.05/$0.10/$0.20 per secondo di output.
- Non c’è 4K e non ci sono pesi aperti. Ho interrogato l’API di Hugging Face per ogni repo sotto
Wan-AI. Non esiste nulla oltre Wan 2.2 disponibile per il download. - I rate limit sono il vero collo di bottiglia: 2 richieste concorrenti, 30 RPM, 50 task asincroni in coda.
- Non puoi simulare il piano sequenza da 30 secondi con Wan 2.7. Tre limiti non documentati bloccano la clip davvero continua più lunga a 15 secondi, e concatenare una seconda continuazione fa tornare il modello indietro in loop invece di farlo avanzare.
Il muro dei 15 secondi: cosa sta vendendo davvero Wan 3.0 Preview
Ecco il miglior risultato che sono riuscito a ottenere. Quindici secondi ininterrotti a 1080P: un avvicinamento verso un’insegna al neon, un venditore che chiude un chiosco di caffè su un tetto sotto la pioggia, poi una gru verso il basso fino alla strada bagnata e a un taxi. Un unico file generato continuo, senza montaggio, con audio generato.

Quindici secondi di video continuo Wan 2.7: insegna al neon, venditore sul tetto, discesa con gru verso una strada piovosa e un taxi
La clip davvero continua più lunga che la famiglia Wan 2.7 abbia prodotto per me: 15 secondi, 1080P, un solo file. Qui è mostrata come GIF silenziosa; il file consegnato contiene audio stereo a 44,1 kHz.
È buono. È anche esattamente la metà di ciò che Wan 3.0 sostiene di fare con una sola chiamata, e 15 secondi è il punto in cui il soffitto è saldato. Tutto ciò che segue spiega come ho trovato quella saldatura.
Perché quasi ogni scheda tecnica di Wan 3.0 Preview che leggi è probabilmente sbagliata
Due cose rendono questo lancio insolitamente rumoroso. Primo, 30 secondi in un singolo passaggio di generazione sono davvero una novità per la famiglia. Wan2.7-Video arriva al massimo a 15 secondi e la maggior parte dei modelli video mainstream si colloca tra 5 e 15 (TNGlobal, agosto 2026). Secondo, Wan 3.0 accetta input di riferimento che nessun altro accetta: oltre a testo, immagine, audio e video, accetta file doc, xls, ppt, pdf e md, più pagine web, quindi una presentazione può diventare un video (AlphaSignal, agosto 2026).
Questa combinazione ha prodotto un’enorme quantità di copertura da parte di siti che non hanno mai aperto la documentazione. Ecco ogni affermazione ampiamente circolata, verificata sulla fonte primaria.
Tabella A: verifica delle specifiche di Wan 3.0 Preview
| Affermazione in circolazione | Cosa dice la fonte primaria | Verdetto |
|---|---|---|
| 30 secondi in un solo passaggio di generazione | Confermato, rispetto ai 2-15s di Wan 2.7 | ✅ Reale |
| Output 4K nativo | Le risoluzioni ufficiali sono solo 480P, 720P e 1080P | ❌ Falso |
| Pesi aperti Apache 2.0 | Non esiste alcun repository Wan 3.0 sotto Wan-AI su Hugging Face | ❌ Falso |
| Document-to-video (PDF, PPT, XLS) | Confermato come tipo di input di riferimento | ✅ Reale |
| «Modalità regista AI a sei telecamere» | Non compare in alcuna documentazione Alibaba | ❌ Non supportato |
| «Lip sync in 12 lingue con identity lock» | Non compare in alcuna documentazione Alibaba | ❌ Non supportato |
| $0.05 / $0.10 / $0.20 al secondo | Confermato per 480P / 720P / 1080P | ✅ Reale |
| Aperto a tutti | Accesso tramite richiesta su Model Studio e Qwen Cloud | ⚠️ Beta, invito richiesto |
Prezzi e rate limit arrivano direttamente dalla pagina del modello: 2 richieste concorrenti, 30 richieste al minuto e una coda asincrona da 50 task (QwenCloud, agosto 2026). Quel numero sulla concorrenza riceve pochissima copertura ed è la riga più importante della pagina. Due job paralleli, ognuno della durata di minuti, vanno bene per una demo di lancio. Non sono una pipeline.
Ora la domanda che interessa davvero alla community open source. Wan 2.1 e Wan 2.2 sono usciti con checkpoint scaricabili. Wan 2.5 ha promesso pesi che non sono mai arrivati, Wan 2.6 è stato completamente chiuso e Wan 2.7 è rimasto solo API. Ho verificato se 3.0 interrompe la serie interrogando l’API di Hugging Face per ogni modello sotto l’organizzazione Wan-AI, ordinati per data di creazione. I tre repository più recenti sono tutti varianti Wan2.2-Animate-2 create il 6 agosto 2026, lo stesso giorno del lancio di Wan 3.0. Il repo più scaricato è ancora Wan2.2-TI2V-5B-Diffusers con circa 179.000 download negli ultimi 30 giorni (Hugging Face, agosto 2026).
Quindi la risposta è no, e Wan 2.2 resta il limite massimo dei pesi aperti. Se il tuo piano prevedeva di eseguirlo in locale o di fare fine-tuning, non c’è nulla da eseguire.
Lo stack di Wan 3.0 Preview: cosa puoi davvero usare oggi
La situazione si divide nettamente. Wan 3.0 è dietro un modulo di richiesta con un limite di concorrenza di due job. Tutto ciò che viene prima, da Wan 2.7 indietro fino a 2.2, è chiamabile immediatamente con una sola API key, insieme a Seedance e Kling per confronti tra modelli. Tutto in questo articolo è stato eseguito così, in una sola scheda del browser.
I prezzi qui sotto provengono dal catalogo modelli di Atlas Cloud del 10 agosto 2026, non da un post di blog qualsiasi.
Tabella B: Wan 3.0 Preview rispetto a ciò che è già disponibile
| Modello | Passaggio singolo più lungo | Risoluzioni | Accesso | Concorrenza | Prezzo indicato al secondo |
|---|---|---|---|---|---|
| Wan 3.0 Preview | 30s | 480P / 720P / 1080P | Richiesta necessaria | 2 | $0.05 / $0.10 / $0.20 |
| Wan 2.7 text-to-video | 15s | 720P / 1080P / 1080P-SR / 1440P-SR | Aperto | Standard | da $0.10 |
| Wan 2.7 image-to-video | 15s | 720P / 1080P | Aperto | Standard | da $0.10 |
| Wan 2.6 text-to-video | 15s | 720p / 1080p | Aperto | Standard | $0.07 (30% di sconto su $0.10) |
| Wan 2.5 text-to-video | 10s | 720p / 1080p | Aperto | Standard | $0.035 (30% di sconto su $0.05) |
| Wan 2.2 image-to-video | 10s | 480p / 720p | Aperto, pesi scaricabili | Standard | $0.03 |
| Seedance 2.5 text-to-video | 30s | 480p / 720p | Aperto | Standard | da $0.134 |
| Kling v3.0 Pro text-to-video | 15s | Default del modello | Aperto | Standard | $0.095 (15% di sconto su $0.112) |
Gli sconti sono attivi ad agosto 2026 e a tempo limitato, quindi controlla la pagina del modello prima di basare il budget su di essi.
Da quella tabella emergono due cose. Il passaggio singolo da 30 secondi di Wan 3.0 non è più unico: Seedance 2.5 accetta già una durata da 4 a 30 secondi in una sola chiamata, solo con limite a 720p. E Wan 2.7 è l’unica riga che offre 1440P-SR, un livello di super-risoluzione fatturato all’80% del 1080P nativo secondo il suo stesso schema, che Wan 3.0 non ha.
Ciò che Wan 3.0 ha e nessun altro offre sono 30 secondi a 1080P in un solo passaggio, più input documentali di riferimento. Wan 3.0 ha una pagina segnaposto su Atlas Cloud contrassegnata come Coming Soon, quindi arriverà sulla stessa key quando verrà rilasciato. Fino ad allora, ecco esattamente fin dove ti portano i modelli più vecchi.
Tutorial Wan 3.0 Preview, passaggio 1: scrivi il brief del piano sequenza
Il brief si trasferisce tra le generazioni, quindi scrivilo una volta sola. Wan 3.0 premia descrizioni lunghe delle inquadrature con timecode, e Wan 2.7 accetta la stessa struttura entro un limite di prompt di 5.000 caratteri.
Il template che funziona: Shot [timecode] + subject action + camera move + light + ambient audio. Dichiara nella prima riga che la ripresa è continua e descrivi esplicitamente il tappeto sonoro, perché Wan 2.7 genera audio in modo nativo e inventerà qualcosa di poco utile se lo lasci vuoto.
Ho scelto di proposito un chiosco di caffè su un tetto in una notte piovosa. Mette sotto stress quattro cose che di solito si rompono tutte insieme: movimento di camera sostenuto, coerenza del volto nel tempo, riflessi del neon sul bagnato e un tappeto audio ambientale continuo.
text1BEAT 1 (0-10s): Slow dolly-in from a flickering pink-and-cyan neon sign toward a 2young female vendor wiping down a steel counter on a rooftop coffee stall. 3BEAT 2 (10-15s): The camera cranes down over the rooftop edge to the wet street 4below, gliding toward a taxi idling at the curb. 5Constant: heavy rain, neon palette, 35mm anamorphic, film grain, no cuts. 6
Questo è il piano, non il prompt. I prompt da incollare sono qui sotto.
Passaggio 2: genera l’apertura a 1080P
Apri la pagina Wan 2.7 text-to-video e incolla Beat 1, scritto per esteso.
text1Continuous single take, no cuts. A rainy night rooftop coffee stall in Shenzhen. 2Shot [0-4s]: Slow dolly-in from a flickering pink-and-cyan neon sign toward a 3young female vendor wiping down a steel counter, rain streaking through the neon 4glow, steam rising from a kettle. 5Shot [4-10s]: The camera settles at chest height as she looks up and half-smiles, 6shallow depth of field, wet reflections on the counter, raindrops visible against 7the dark sky behind her. 8Audio: steady rain, distant traffic hum, the clink of a ceramic cup. 9Cinematic, anamorphic, 35mm, high dynamic range, fine film grain. 10
Impostazioni: Resolution 1080P, Aspect ratio 16:9, Duration 10, Prompt extend OFF.
Prompt extend è attivo di default e riscrive il prompt prima della generazione, distruggendo silenziosamente il controllo delle inquadrature con timecode. Disattivalo ogni volta che il breakdown delle inquadrature è il punto centrale.
Imposta la durata a 10 invece del massimo di 15 secondi. Non è una scelta di costo, e il motivo diventa visibile solo nel passaggio 3.

Wan 2.7 text-to-video su Atlas Cloud, run completata, output 1080P visibile nel pannello OUTPUT
Passaggio 2 nel playground: prompt incollato, 1080P, 16:9, run completata con il risultato a destra. Nota la stima del pulsante Run di $0.75 per un job 1080P da cinque secondi, che equivale a $0.15 al secondo invece del «da $0.10» del catalogo.
Passaggio 3: continua la clip e osserva dove si rompe
L’endpoint image-to-video di Wan 2.7 ha una modalità di continuazione video che prende una clip esistente e continua a girare. Prendi l’URL dell’output del passaggio 2, inseriscilo nel campo video, imposta Duration su 15 e incolla Beat 2:
text1Continue the same unbroken take with identical camera language and lighting. 2The crane-down continues past the rooftop edge to street level, the camera 3gliding forward through the rain toward a taxi idling at the curb, wipers 4sweeping. Keep the rain intensity, neon colour palette, film grain and ambient 5audio identical to the source clip. No cut, no fade, no scene change. 6
Questo produce la clip da 15 secondi all’inizio dell’articolo. Ora i tre limiti che ho incontrato, nessuno dei quali è nella documentazione.
Uno: la clip sorgente deve durare da 2 a 10 secondi. Ecco perché il passaggio 2 è limitato a 10. Genera un’apertura da 15 secondi e non potrai estenderla affatto, perché un file da 15 secondi non è un input valido.
Due: la durata richiesta deve superare la durata della sorgente. Dai in input una clip da 10 secondi e chiedi 10 secondi, e l’API la rifiuta direttamente: first_clip duration (10s after trim) must be less than the requested duration (10s). Quindi l’output contiene la sorgente, e il massimo che puoi guadagnare in un passaggio è 5 secondi.
Tre: non preserva la clip sorgente. Questo è il punto che conta. Qui sotto, la riga superiore è la clip originale da 10 secondi a 5s e 9.9s. La riga inferiore è l’output della continuazione agli stessi due timecode.

Quattro frame che confrontano la clip sorgente e l’output della continuazione a 5 secondi e 9,9 secondi
Riga superiore: la clip sorgente a 5s e 9.9s. Riga inferiore: l’output della continuazione agli stessi timecode. A 5s coincidono. A 9.9s la sorgente è ancora sulla venditrice, mentre la continuazione è già passata alla strada, perché ha ricompresso la sorgente nei suoi primi sei secondi circa e ha usato il resto per nuovo materiale.
Quindi la continuazione non è concatenazione. Ri-renderizza la clip più velocemente per fare spazio, e gli ultimi secondi della performance originale semplicemente spariscono.
Il che solleva l’idea ovvia: concatenarla. Dai in input il risultato da 15 secondi e chiedi altri 15. Ci ho provato. Ecco cosa è tornato.

Una seconda continuazione concatenata che torna alla venditrice sul tetto invece di far avanzare la scena
Il secondo passaggio di continuazione. Ripete la strada e il taxi, poi torna in loop alla venditrice sul tetto dall’inizio della sequenza invece di andare avanti. La concatenazione non accumula.
Questo è il muro. Il limite di output è 15 secondi, il limite di input è 10, e il secondo anello della catena va all’indietro. Quindici secondi di footage davvero continuo sono il soffitto per questa famiglia di modelli. Qualsiasi cosa più lunga è un taglio, non un piano sequenza, e i tagli sono esattamente ciò che un singolo passaggio da 30 secondi esiste per eliminare.
Una precisazione: la cattura del playground per questo passaggio di continuazione è fallita tre volte perché l’immagine di riferimento preimpostata della pagina continuava a prendere il controllo della run, quindi il passaggio 3 è stato eseguito tramite API invece che dall’interfaccia del playground. Il prompt, le impostazioni e gli output qui sopra provengono tutti da quella run reale.
Quanto costano davvero 30 secondi di Wan 3.0 Preview
Il pulsante Run nel passaggio 2 indicava $0.75 per un job 1080P da cinque secondi. Sono $0.15 al secondo, non i $0.10 indicati dal catalogo, perché la cifra listata è un minimo e la fatturazione scala con la risoluzione. Fidati sempre della stima più che della scheda.
A quel prezzo reale, i miei 15 secondi di footage continuo sono costati $1.50 per l’apertura da 10 secondi più $2.25 per la continuazione, quindi $3.75 per 15 secondi consegnati.
Tabella C: quanto costano 30 secondi, in cinque modi
| Percorso | Calcolo | Totale | Cosa ottieni davvero |
|---|---|---|---|
| Wan 3.0 Preview, 1080P | $0.20 × 30 | $6.00 | 30s continui, un passaggio, senza giunzioni |
| Wan 3.0 Preview, 720P | $0.10 × 30 | $3.00 | 30s continui a 720P |
| Wan 3.0 Preview, 480P | $0.05 × 30 | $1.50 | 30s continui a 480P |
| Wan 2.7, apertura più continuazione | $0.15 × 25 fatturati | $3.75 | Solo 15s. Non può arrivare a 30. |
| Seedance 2.5, 480p | da $0.134 × 30 | ~$4.05 | 30s continui, limitati a 720p |
Rileggi la quarta riga. Produrre 15 secondi continui su Wan 2.7 è costato più di quanto Wan 3.0 chieda per 30 secondi continui a 720P. Il workaround non è l’opzione economica: è quella costosa che per giunta non funziona.
Una precisazione sulla riga Seedance: la tariffa indicata è il minimo a 480p e il modello fattura in base all’area in pixel, quindi in pratica le run a 720p costano circa 2,25 volte quella cifra.
Sulle licenze, fai attenzione. Wan 3.0 è in beta, quindi i termini commerciali derivano dall’accordo di servizio Alibaba Cloud che accetti al momento della richiesta, non da una licenza del modello, e possono cambiare prima della disponibilità generale. Senza pesi pubblicati, deployment locale e fine-tuning non sono opzioni. Verifica requisiti di attribuzione e watermarking rispetto ai termini del tuo account prima di consegnare lavori per clienti.
Domande frequenti
Wan 3.0 Preview è già disponibile per tutti?
No. È entrato in beta pubblica il 6 agosto 2026, ma l’accesso è soggetto a richiesta tramite Alibaba Cloud Model Studio e Qwen Cloud. Gli account approvati ottengono 2 richieste concorrenti, 30 RPM e una coda asincrona da 50 task, dimensionata per la valutazione più che per la produzione.
Wan 3.0 Preview è open source, e dove sono i pesi?
Non ce ne sono. Interrogando l’API di Hugging Face per ogni repository sotto l’organizzazione Wan-AI non risulta nulla oltre Wan 2.2. I tre repo più recenti, tutte varianti Wan2.2-Animate-2, sono stati creati lo stesso giorno del lancio di Wan 3.0. Wan 2.2 resta il limite massimo dei pesi aperti.
Wan 3.0 Preview fa davvero 4K nativo?
No. La documentazione ufficiale elenca 480P, 720P e 1080P. L’affermazione sul 4K arriva da siti aggregatori che si citano a vicenda invece della fonte primaria, e contraddice la tabella prezzi di Alibaba, che ha esattamente tre livelli di risoluzione.
Quanto costa un video Wan 3.0 Preview da 30 secondi?
A 1080P, $0.20 per secondo di output fanno $6.00 per 30 secondi. A 720P sono $3.00 e a 480P sono $1.50. Per confronto, 15 secondi continui su Wan 2.7 a 1080P mi sono costati $3.75 alla tariffa realmente fatturata.
Posso generare oggi un piano sequenza da 30 secondi senza accesso a Wan 3.0 Preview?
Non con Wan 2.7. La sua modalità di continuazione limita l’output a 15 secondi, accetta solo clip sorgente di 10 secondi o meno e, se concatenata, va in loop all’indietro. Seedance 2.5 arriva da 4 a 30 secondi in un solo passaggio, ma solo fino a 720p.
Wan 3.0 Preview contro Wan 2.7: vale la pena aspettare?
Se ti serve una singola inquadratura continua più lunga di 15 secondi, oppure input di riferimento da documenti e pagine web, sì, e non c’è workaround. Per qualsiasi cosa da 15 secondi o meno, Wan 2.7 è più pratico in questo momento, perché un limite di concorrenza di 2 richieste rende il lavoro in batch più lento su 3.0 rispetto al modello che sostituisce.






