La linea Wan è già la famiglia video open source più forkata su internet. I repository Wan 2.2 e Wan 2.1 hanno circa 17.000 stelle ciascuno (GitHub, agosto 2026), e la pagina Wan-AI gestisce centinaia di migliaia di download al mese tra i suoi checkpoint (Hugging Face, agosto 2026). Quindi quando Wan 3.0 è entrato in accesso anticipato con generazione nativa di 30 secondi, fino a 20 input di riferimento e audio generato nello stesso passaggio dell'immagine, la prima domanda non è stata se la gente lo avrebbe usato. Era se qualcuno avrebbe saputo scrivere per lui.
Perché una singola generazione di 30 secondi non è una versione più grande di un clip di 5 secondi. È un problema di scrittura diverso. Un prompt di 5 secondi descrive un'immagine che si muove. Un prompt di 30 secondi dirige il tempo: chi cambia, quando, su quale taglio, con quale suono sotto.
Il manuale del creatore di Wan 3.0 diffuso con l'accesso anticipato contiene diciannove casi ufficiali di prompt e risultati. Li ho studiati tutti, poi ho scelto i tre che insegnano la tecnica più trasferibile e ho smontato ciascuno: cosa controlla effettivamente il prompt, perché è costruito in quel modo e come riutilizzare la sua struttura per le tue inquadrature. Ogni video qui sotto è l'output reale e non modificato per il caso discusso. I prompt originali dei casi sono scritti in cinese; le strutture qui sono riformulazioni inglesi della loro architettura, e la linea Wan accetta prompt in entrambe le lingue.
Punti chiave
- I prompt lunghi di Wan 3.0 condividono un'architettura: prima i legami di riferimento, poi le regole globali, infine un elenco di inquadrature con timestamp. I prompt di test brevi possono omettere livelli, i prompt di produzione non dovrebbero.
- Scrivi la performance come una catena di azioni visibili, mai come un'etichetta emotiva. "Ansioso" è una speranza. "Masticare rallenta, sopracciglia si abbassano, sguardo cade sulle mani" è un'istruzione.
- Il suono è parte del prompt, non un passaggio successivo. Il dialogo va tra parentesi graffe, effetti e musica ottengono frasi proprie, e il silenzio va richiesto esplicitamente.
- I casi ufficiali ripetono il loro vincolo più importante e vietano il fallimento che si aspettano. Un prompt del manuale proibisce "scivolamento fluido" in tre formulazioni diverse, perché il modello tende per impostazione predefinita allo scorrimento fluido.
- Il movimento può essere quantificato: fotogrammi per scatto, percentuale della larghezza dell'inquadratura per scatto, numero di ripetizioni. Il caso della libellula qui sotto ne è la prova.
Una generazione, 30 secondi, dieci beat di storyboard numerati e un arco di colonna sonora completo scritti in un unico prompt: una barca da pesca, una tempesta e un mostro marino che emerge secondo programma. Caso ufficiale dal manuale Wan 3.0, mostrato qui senza modifiche.
Cosa Rende Diversa la Scrittura di un Prompt Wan 3.0
Tre capacità cambiano il lavoro, e ciascuna aggiunge un'abilità di scrittura che i modelli più brevi non hanno mai richiesto.
30 secondi nativi significano struttura. Quando un modello rende 5 secondi, un prompt può essere una frase densa. A 30 secondi, un prompt non strutturato deriva: i personaggi si scambiano i vestiti, la telecamera dimentica la sua regola, il finale non ha nulla a che fare con l'inizio. Ogni caso lungo nel manuale combatte la deriva allo stesso modo, con fasi esplicite e stati finali. Quella struttura è il nucleo di questa guida.
Audio congiunto significa direzione del suono. Wan 3.0 genera la colonna sonora insieme all'immagine. Dialogo, effetti, atmosfera e musica sono tutti promptabili, il che significa anche che una colonna sonora non scritta è una colonna sonora improvvisata. I casi ufficiali trattano l'audio con la stessa disciplina della luce: dichiarato, circoscritto e talvolta deliberatamente silenziato.
Fino a 20 riferimenti significa sintassi di legame. Volti, abiti, luoghi, voci e persino immagini di storyboard possono essere ancorati a materiali caricati. I casi del manuale legano ogni riferimento a un soggetto nominato una volta, poi riutilizzano il nome in ogni inquadratura successiva. Se hai testato la stessa disciplina sulla generazione attuale, ad esempio su Wan 2.7 reference-to-video, la versione 3.0 ti sembrerà familiare piuttosto che nuova.
Niente di tutto ciò richiede di scrivere un romanzo ogni volta. Il caso buono più breve del manuale è una singola frase su un UFO che ruba una mucca in uno stile dipinto a mano. L'abilità è sapere quali livelli servono alla tua inquadratura, che è esattamente a cosa servono i tre casi qui sotto.
Lo Stack di Prompt Wan 3.0: Tre Livelli Che Ogni Caso Lungo Condivide
Spogliando i diciannove casi ufficiali fino all'osso, i casi lunghi sono tutti lo stesso stack a tre livelli.
Livello 1: legami di riferimento. Una riga per materiale caricato, che dichiara cosa è e cosa può essere preso da esso. Definisci la donna nell'immagine 1 come Soggetto 1. Prendi solo l'abito dall'immagine 2. La voce del Soggetto 2 segue l'audio 1. Lega una volta, poi riferisci per nome per sempre. Plurali vaghi come "le immagini definiscono i personaggi" sono esattamente ciò che questo livello esiste per prevenire.
Livello 2: regole globali. Tutto ciò che deve rimanere vero per l'intero clip, scritto prima di qualsiasi azione: stile visivo e suoi punti di riferimento, un sistema di colori nominato, comportamento della luce, grammatica della telecamera, disciplina della performance, disciplina audio e un elenco di fallimenti vietati. Questo livello è dove i casi del manuale sono più aggressivi. Un caso di arti marziali limita il rallenty a due usi di meno di un secondo ciascuno, vieta i sottotitoli sullo schermo, vieta completamente la musica di sottofondo e proibisce alla telecamera di fermarsi per più di 1,5 secondi.
Livello 3: la timeline. Beat con timestamp o numerati, ciascuno con un evento principale e uno stato finale visibile. Non "combattono per un po'" ma "da 0 a 1,5 secondi: lui sta al bordo dei canneti, controluce, vento nel cappotto, e dice la sua unica battuta." Gli stati finali sono ciò che mantiene il secondo quindici coerente con il secondo cinque.
Un modo utile per tenerlo a mente: Il Livello 1 è il casting, il Livello 2 è il regolamento, il Livello 3 è l'elenco delle inquadrature. I tre casi che seguono enfatizzano ciascuno un livello diverso.
Caso 1: Come Scrivere un Prompt Wan 3.0 per la Performance, un Volto per 30 Secondi
Il caso meno appariscente nel manuale è quello che la maggior parte delle persone dovrebbe studiare per primo: un singolo primo piano fisso di una giovane donna in un abito da laurea blu, tenuto per 30 secondi interi mentre parla, si preoccupa e infine guarda in basso verso le sue mani.
Trenta secondi, una sola inquadratura, nessun taglio. L'abito ti dice la scena, la fronte ti dice la posta in gioco e lo sguardo che cade atterra esattamente dove il prompt lo ha messo. Caso ufficiale del manuale, output non modificato.
Ecco cosa fa il prompt ufficiale, mossa per mossa, con parole mie piuttosto che le sue:
- Telecamera prima del soggetto. Si apre bloccando l'inquadratura: primo piano frontale, testa e parte superiore del corpo, e un'imperfezione deliberata, una seconda persona sul bordo sinistro che è completamente sfocata. Sfondi che nomini e poi sfochi sono sfondi che il modello non nitirà a metà inquadratura.
- Abbigliamento come esposizione. Un abito da laurea blu sostituisce un paragrafo di ambientazione. Il modello deduce la cerimonia, la folla, il giorno. Scegli il singolo capo o oggetto di scena che implica il mondo e salta la descrizione del mondo.
- Emozione come catena di atti visibili. Il prompt non chiede mai "ansia". Scrive la bocca che si muove mentre parla, il sopracciglio leggermente aggrottato, l'espressione seria del volto. Ogni elemento è qualcosa che una telecamera può verificare. Le etichette emotive sono speranze. I movimenti muscolari sono istruzioni.
- Il micro-movimento che vende realismo. Due dettagli fanno più di tutto il resto messo insieme: la telecamera mantiene un leggero dondolio da respirazione a mano libera, e il suo sguardo viaggia da davanti a giù verso le sue mani, su una traiettoria dichiarata. Dai a qualsiasi ripresa lunga un cambiamento lento e deliberato come questo e l'inquadratura sembrerà diretta piuttosto che generata.
Struttura riutilizzabile, in inglese, struttura identica al caso:
Plain1Frontale [dimensione inquadratura] su [soggetto], [dettaglio inquadratura]. Un [elemento sfocato] si trova al [bordo] dell'inquadratura. [Soggetto] indossa [un capo che implica l'intera scena]. [Soggetto] sta [azione], bocca che si muove, [dettaglio sopracciglia/occhi/mascella]. La luce proviene da [direzione], mantenendo [nota su pelle/tessuto]. La telecamera è bloccata ma porta un leggero dondolio da respirazione a mano libera. Durante l'inquadratura, [un lento cambiamento visibile: una traiettoria dello sguardo, uno spostamento di postura, un oggetto abbassato].
Riempi quel modello con un tuo soggetto prima di toccare le epiche di 30 secondi. Se il volto regge per trenta secondi, la tua struttura è solida.
Caso 2: Come Strutturare un Prompt Wan 3.0 di 30 Secondi Come un Regista
Il corto surreale del manuale è il miglior oggetto di insegnamento strutturale in tutto il documento: una cowgirl cavalca un vero cavallo in una solitaria stazione di servizio sulla Route 66, prende la pompa e riempie il suo cavallo di erba fresca mentre la visione del mondo dell'impiegato crolla silenziosamente.
Trenta secondi di impostazione impassibile e un perfetto gag visivo. La commedia è scritta nella struttura: inquadratura fissa osservativa, poi un improvviso primissimo piano esattamente quando accade la cosa assurda. Caso ufficiale del manuale, output non modificato.
Il suo prompt è organizzato in cinque moduli nominati, e l'elenco dei moduli stesso è la lezione:
- Una logline. Due frasi su cosa succede e qual è la battuta. Non immagini visive, storia. Scrivere questo per primo ti costringe a sapere a cosa servono i 30 secondi.
- Un sistema di colori nominato. Non "colorato" ma una legge a due colori: cielo verde acqua e terra arancione, poi ogni oggetto principale assegnato a un lato di esso, la pompa rossa sbiadita, la sciarpa arancione, le montagne terracotta. Nomina il sistema, poi distribuiscilo. La coerenza nei video AI è di solito un problema di palette prima di essere un problema di personaggio.
- Un elenco di personaggi con ruoli narrativi. Ogni personaggio riceve due o tre tratti visibili e, soprattutto, una funzione: l'impiegato è esplicitamente designato come portatore dell'inquadratura di reazione del film. Assegnare un ruolo dice al modello dove appartiene l'attenzione della telecamera in ogni beat in cui appare quel personaggio.
- Una filosofia della telecamera nominata. Il caso inventa una regola e la definisce in una riga: osservazione calma più primo piano assurdo, ovvero inquadrature fisse e panoramiche lente come impostazione predefinita, interrotte da un improvviso primissimo piano solo quando si verifica l'evento assurdo. Nominare la tua regola della telecamera e poi riferirsi ad essa batte la ridescrizione dei movimenti della telecamera in ogni beat. È anche l'intero meccanismo comico: lo sguardo piatto fa sì che il primo piano della pompa d'erba atterri.
- Una timeline in quattro atti con stati finali. Setup, escalation, punchline, conseguenze, ciascuno con un intervallo di tempo, un evento principale e un'immagine finale congelata, fino allo stuzzicadenti che finalmente cade dalla bocca dell'impiegato nell'ultimo beat.
Il modello trasferibile è più grande della commedia. Logline, legge della palette, personaggi con ruoli, una regola della telecamera nominata, quattro atti con stati finali: questa è una scheda di produzione, e Wan 3.0 è la prima generazione di questa famiglia con abbastanza pista, trenta secondi, perché una scheda conti. Il showcase del mostro marino all'inizio di questo articolo è la stessa struttura con dieci beat e un arco musicale con colonna sonora, scritto allo stesso modo: ogni beat un evento, ogni beat uno stato finale visibile.
Caso 3: Scrivere la Fisica del Movimento in un Prompt Wan 3.0
La cosa più difficile da ottenere da qualsiasi modello video è un movimento che non sia fluido. I modelli tendono a movimenti gentili e continui, motivo per cui ogni fata AI fluttua come un palloncino lento. La fata del manuale non fluttua. Si muove come una libellula: sospensione ferma, scatto istantaneo, stop netto, nuova direzione.

Sospensione, scatto, stop netto. La sfocatura nel mezzo di ogni scatto è larga uno o due fotogrammi, esattamente come previsto dal prompt. Caso ufficiale del manuale, mostrato come GIF muta; il clip consegnato porta la sua atmosfera.
Questo prompt vince con quattro tecniche che puoi prendere direttamente:
- Dichiarazione di priorità all'inizio. La prima riga annuncia il singolo requisito di massima priorità, la legge del movimento della libellula, prima di qualsiasi scenario. L'attenzione è un budget. Spendi i token di apertura sulla regola che decide il successo, non sul colore del tappeto.
- Un ancoraggio di fisica del mondo reale. Invece di aggettivi come "veloce e agile", il prompt nomina un animale la cui firma di movimento il modello ha visto migliaia di volte: sospensione puntuale, lancio a scoppio, stop completo, riorientamento netto. Un ancoraggio familiare supera dieci avverbi astratti.
- Numeri dove gli aggettivi sarebbero sfocati. Lo scatto deve attraversare dal 60 al 90 percento della larghezza dell'inquadratura entro 3-5 fotogrammi. Lo stop deve durare 2-4 fotogrammi. Almeno sei scoppi chiaramente separati devono verificarsi nei primi otto secondi. La sfocatura da movimento residua è prevista per 1-2 fotogrammi. A questo punto non stai scrivendo poesia, stai scrivendo un capitolato, e il modello lo rispetta. Guarda la striscia qui sotto: il fotogramma a metà scatto è pura scia, i fotogrammi ai lati sono perfettamente nitidi.
- Vietare l'impostazione predefinita. Il prompt vieta esplicitamente il fallimento che prevede, in più formulazioni: niente fata che fluttua lentamente, niente crociera a velocità uniforme, niente scivolamento fluido continuo, e poi una frase correttiva che dice cosa non è il movimento, "non un percorso di volo continuo, ma spostamenti brevi, netti, quasi da salto di fotogramma." Quando sai cosa farà il modello in pilota automatico, scrivi il pilota automatico fuori dall'inquadratura.

Quattro fermi consecutivi dal caso della libellula: sospensione accanto all'orsacchiotto, sfocatura da movimento a metà scatto, arrivo sopra i blocchi, sospensione a stop netto
Quattro fotogrammi dall'output sopra. Nitido, striato, nitido, nitido: il budget di sfocatura dal prompt, visibile fotogramma per fotogramma.
Le stesse quattro mosse si generalizzano a qualsiasi problema di movimento: panoramiche a frusta che non devono diventare tagli, impatti che necessitano di peso, movimento meccanico che non deve diventare organico. Ancora, quantifica, dai priorità e vieta l'impostazione predefinita.
Dialogo, Suono e Sintassi di Riferimento nei Prompt Wan 3.0
I tre casi sopra sono silenziosi sui meccanismi che fanno parlare i prompt Wan 3.0, quindi ecco il livello di sintassi, compilato dal resto dei casi del manuale.
Il dialogo va tra parentesi graffe. Le battute pronunciate sono racchiuse come {Quale gruppo muscolare oggi} piuttosto che lasciate in prosa aperta, il che impedisce al modello di narrare il tuo dialogo come didascalia. Le battute arrivano con sincronizzazione labiale, e una scena di dialogo è scritta come azione alternata e battute tra parentesi, esattamente come una sceneggiatura.
Le voci possono essere assegnate. La sintassi di riferimento si estende all'audio: definisci la donna nell'immagine 1 come Soggetto 1, poi dichiara che la voce del Soggetto 1 segue l'audio 1. Volto da un file, voce da un altro, entrambi bloccati per la durata.
L'audio ha bisogno di una dichiarazione di disciplina. I casi più forti dichiarano il loro paesaggio sonoro come dichiarano la loro palette. Un caso di animazione dichiara i suoi tipi audio in anticipo: solo atmosfera e musica, nessun discorso. Il caso di arti marziali va oltre, vietando completamente la musica di sottofondo, mantenendo solo respiro, attrito dei tessuti, colpi e vento, e ottiene esattamente quello. La musica, quando desiderata, è scritta come un arco attraverso la timeline, da ronzii di terrore bassi attraverso escalation di archi a un impatto di ottoni e una lunga nota cupa, mappata sui beat che deve colpire.
Anche il silenzio è una richiesta. Senza prompt, il modello riempie la traccia. Se la tua inquadratura ha bisogno solo di tono ambiente e un evento sonoro, dillo. La direzione del suono in Wan 3.0 non è guarnizione. È la seconda metà del mezzo.
Dove Praticare la Formula del Prompt Wan 3.0 Oggi
Wan 3.0 è ancora in arrivo e gli utenti non possono usarlo in questo momento. La struttura sopra si accumula comunque ora, perché nulla di ciò è bloccato alla versione: legami, regole globali, timeline, dialoghi tra parentesi e default vietati funzionano tutti sull'attuale generazione Wan.
L'intera famiglia attuale è live su Atlas Cloud, Wan 2.7 text-to-video, image-to-video, reference-to-video e video editing, con una chiave e prezzi per esecuzione mostrati prima di premere avvia. Un esercizio pratico: prendi la struttura del Caso 1, riempila con il tuo soggetto ed eseguila come una breve ripresa su Wan 2.7 text-to-video. Se la catena di performance regge lì, lo stesso file sarà la tua bozza per Wan 3.0 al giorno uno, con la durata alzata invece di riscritta. Atlas Cloud ha l'abitudine di portare l'accesso al giorno zero quando questa famiglia si aggiorna, quindi l'ambiente di pratica e la destinazione sono probabilmente la stessa pagina.
Domande Frequenti
Quanto dovrebbe essere lungo un prompt Wan 3.0?
Quanto serve all'inquadratura e non di più. Il manuale ufficiale spazia da una singola frase, un gag UFO dipinto a mano, a prompt oltre mille parole per un film di mostri in dieci beat. La variabile decisiva è la durata e la dimensione del cast: un test di 5 secondi con un solo soggetto ha bisogno di una frase densa, una storia di 30 secondi con più personaggi ha bisogno di tutti e tre i livelli: legami, regole globali e una timeline.
Wan 3.0 genera suono dal prompt?
Sì, l'audio è generato nello stesso passaggio dell'immagine. Il dialogo è scritto tra parentesi graffe e arriva con sincronizzazione labiale, gli effetti sonori e l'atmosfera sono scritti come prosa, e la musica può essere diretta come un arco attraverso la timeline. La disciplina funziona in entrambi i sensi: se vuoi quasi silenzio, o atmosfera senza colonna sonora, devi dirlo, altrimenti il modello riempirà la traccia da solo.
Qual è la sintassi delle parentesi graffe nei prompt Wan 3.0?
Le parentesi graffe delimitano le parole pronunciate ad alta voce da un personaggio, come in {Ci vediamo al traguardo}. Tenere il dialogo tra parentesi lo separa dalla descrizione della scena, così il modello esegue la battuta invece di illustrarla. Per lavori multilingue, dichiara la lingua prima della battuta e lo stile di resa con essa.
Come posso mantenere coerente un personaggio in un video Wan 3.0 di 30 secondi?
Lega il personaggio a un riferimento una volta, con ambito: definisci la persona nell'immagine 1 come Soggetto 1, prendi solo volto, capelli e abito. Poi ripeti il nome del soggetto in ogni beat della timeline in cui appare, e ristabilisci i due o tre tratti bloccati in qualsiasi momento ad alto rischio come un'azione che coinvolge il costume o un cambio di luce. Il caso della scena di lotta del manuale ristabilisce persino i blocchi di tratti per modulo, che è la versione cintura e bretelle.
Posso praticare la scrittura di prompt Wan 3.0 prima di avere accesso?
Sì, e dovresti. La struttura a tre livelli, i dialoghi tra parentesi, i legami di riferimento e la tecnica del default vietato funzionano tutti sulla famiglia attuale oggi. Wan 2.7 su Atlas Cloud copre text-to-video, image-to-video, reference-to-video e video editing con una chiave, quindi un modello testato lì si trasferisce a 3.0 come un cambio di durata piuttosto che una riscrittura.
Conclusione
Diciannove casi ufficiali dicono la stessa cosa in tre modi diversi: un prompt Wan 3.0 è un documento di produzione, non una didascalia. Assegna i tuoi riferimenti, legifera il tuo stile, programma i tuoi beat e tratta il suono come metà dell'immagine. Inizia con la struttura del primo piano della laureata, passa al brief in cinque moduli e conserva il capitolato di movimento con budget di fotogrammi per l'inquadratura che ne ha bisogno. I modelli continueranno a cambiare. La disciplina di scrivere il tempo invece di descrivere immagini è la parte che ti resta.






