Seedance 2.5 è ora live — In anteprima su Atlas Cloud

Wan 3.0 vs Seedance 2.5 Native 30s: Entrambi dicono 30 secondi, solo uno è realmente 1080p

Wan 3.0 vs Seedance 2.5 nativo 30s, confrontati con i prompt demo di Alibaba: quale dei due renderizza pixel 1080p reali, quale esegue upscaling e quale puoi eseguire oggi.

Due monitor che mostrano una scena western accanto a storyboard

Due monitor di montaggio affiancati che riproducono la stessa inquadratura di una stazione di servizio nel deserto, uno con una timeline ininterrotta di 30 secondi sotto e l’altro con una timeline suddivisa in due segmenti

Al secondo 20, l’ugello del carburante spruzza erba verde fresca. Ancora gocciolante d’acqua. Il cavallo socchiude gli occhi con piacere. Al commesso cade lo stuzzicadenti dalla bocca.

Quella battuta funziona solo all’interno di un’unica inquadratura continua di 30 secondi. Unisci quattro clip da 8 secondi e il cavallo cambia mantello, gli occhiali da sole cambiano forma, il cielo vira di un tono più caldo, e la battuta finale muore da qualche parte nelle giunture.

Perciò, quando Wan 3.0 e Seedance 2.5 sono arrivati entrambi nella stessa finestra dichiarando 30 secondi nativi, un solo passaggio, nessuna cucitura, ha smesso di essere una storia di benchmark. È diventata la prima volta che un modello video AI poteva contenere un’impostazione, una svolta e una risoluzione in un’unica ripresa.

Ho esaminato le specifiche, ho confrontato i documenti demo ufficiali pubblicati da Alibaba, e ho scoperto la cosa che nessuno che scrive di questo ha riportato: entrambi i modelli dicono 30 secondi, ma la risoluzione sotto quei 30 secondi non è affatto lo stesso prodotto.

Punti chiave

  1. Entrambi i modelli generano davvero 30 secondi in un solo passaggio. Quella parte non è marketing. Wan 3.0 copre da 2 a 30 secondi con un'opzione di durata intelligente, Seedance 2.5 copre da 4 a 30 secondi.
  2. Solo Wan 3.0 renderizza in 1080p nativo a 30 secondi. Seedance 2.5 genera nativamente solo a 480p e 720p. Le sue opzioni 1080p, 1440p e 4K sono upscale post-generazione di una sorgente a 720p, e la sua stessa documentazione API dice che il livello 4K "non è generazione 4K nativa".
  3. Seedance 2.5 vince per volume di riferimenti: fino a 30 immagini più 10 video più 10 file audio, 50 in totale. Il manuale del creatore di Wan 3.0 limita i riferimenti a 20.
  4. Wan 3.0 ha un input che nessun altro ha: file .doc, .xls, .ppt, .pdf, .txt e pagine web live, inseriti direttamente come riferimenti creativi.
  5. Solo uno dei due è effettivamente eseguibile al di fuori di Alibaba oggi. Wan 3.0 è in beta pubblica su Alibaba Cloud Model Studio e Qwen Cloud, con accesso API di terze parti ancora in fase di rilascio. Seedance 2.5 è live su Atlas Cloud con 30 nel controllo della durata in questo momento.
  6. Vuoi mettere alla prova la struttura di una storia di 30 secondi prima di pagare un solo secondo? Il generatore gratuito di spot pubblicitari AI di Atlas Cloud ti offre un tentativo gratuito: uno spot finito di 15 secondi con dialoghi parlati ed effetti sonori, download senza filigrana.
Invalid YouTube video ID

Demo ufficiale di Wan 3.0 di Alibaba, dal manuale del creatore Tongyi Wan 3.0. Una ripresa, nessun taglio, 30.07 secondi. Misurato con ffprobe: 1920x1072, 24fps, audio stereo AAC integrato. Accendi l’audio per la scodinzolata della coda e lo stuzzicadenti che cade a terra al secondo 29. Utilizzato qui come materiale di riferimento per confronto e commento.

Wan 3.0 vs Seedance 2.5 Native 30s: Cosa è cambiato davvero questo mese

Quindici secondi sono stati a lungo il muro. Wan 2.7 arriva al massimo lì. Seedance 2.0 arrivava al massimo lì. Ogni "film AI di un minuto" che hai visto nel tuo feed nell’ultimo anno era composto da quattro a otto clip incollate insieme in un NLE, con una passata del colorista per nascondere le giunture.

Due cose hanno infranto quel muro nelle stesse poche settimane. Alibaba ha aperto la beta pubblica di Wan 3.0 il 6 agosto 2026 con generazione nativa di 30 secondi e input di riferimento multimodale completo (AlphaSignal, agosto 2026). ByteDance ha raddoppiato Seedance da 15 a 30 secondi nella versione 2.5, posizionandolo esplicitamente come un modo per ridurre la cucitura delle clip e la deriva visiva che ne consegue.

"Nativo" conta qui in un senso tecnico specifico. Significa un singolo passaggio forward su una sequenza latente, non un'estensione dell'ultimo fotogramma in cui il modello prende il fotogramma finale della clip A e avvia la clip B da esso. L'estensione è il motivo per cui il colletto della giacca del tuo personaggio cambia silenziosamente forma tra un'inquadratura e l’altra. Un passaggio nativo ha l’intero 30 secondi nello stesso contesto, quindi il cavallo rimane lo stesso cavallo.

La demo della stazione di servizio è il test più pulito possibile di questo. La struttura è di quattro battute: da 0 a 8 secondi non succede nulla, da 8 a 16 secondi succede qualcosa di strano, da 16 a 24 secondi arriva la battuta finale, da 24 a 30 secondi per l’uscita di scena. La battuta arriva al secondo 20. Il che significa che arriva solo se il cavallo, gli occhiali da sole, la gradazione ciano e arancio e la macchina da presa fissa e impassibile sopravvivono tutti intatti ai primi 19 secondi. La cucitura non può fare questo. Non perché l’editor sia cattivo, ma perché la clip B non ha mai visto la clip A.

Wan 3.0 vs Seedance 2.5 Native 30s: Dove si rompe veramente l’immagine

Trenta secondi sono il doppio di quindici. Il rischio di deriva non è due volte più grande, è peggio, e si sposta in una modalità di fallimento diversa.

I fallimenti del flusso di lavoro con cucitura erano tra le clip. I fallimenti nativi di 30 secondi sono all’interno della clip. In una produzione di cortometraggi pratici con Seedance 2.5, il recensore ha riscontrato decoerenza e morfismo che si manifestavano come "spigolosità visiva o instabilità nei modelli dei personaggi", concentrati in sequenze di azione rapida, e ha notato specificamente che questi artefatti non possono essere puliti dall’upscaling (MindStudio, agosto 2026). Questa è la parte che conta per chiunque pianifichi di renderizzare a 720p e poi fare upscale a 4K: l’upscaler accentua il morfismo, non lo rimuove.

La stessa produzione ha registrato un rapporto di ripresa di 3.2 a 1. Circa 450 secondi di generazione grezza per montare un finale di 2 minuti e 22 secondi. Pianifica i lavori di lunga ripresa come un set con copertura, non come una coda di render dove ogni lavoro viene spedito.

Altri due risultati di quella produzione vale la pena rubare direttamente. L’identità visiva dell’intero film si basava su tre immagini di riferimento, due ritratti di personaggi e una tavola di location, anche se il sistema ne accetta fino a 50. E nel doppiaggio, scrivere "American" ha risolto un accento britannico indesiderato, mentre scrivere "American English" no, perché la parola "English" spingeva la recitazione verso una lettura britannica.

La struttura del prompt che sopravvive a 30 secondi è quella che Alibaba usa nel proprio manuale: battute esplicite con timestamp. Non un paragrafo di atmosfera. Scrivi 0-8s, 8-16s, 16-24s, 24-30s, dai a ciascun blocco il proprio comportamento della fotocamera e il proprio evento, e termina con una singola riga audio che copre l’intera clip. Vedrai esattamente quella struttura nel Passaggio 4 qui sotto, perché ho mantenuto la struttura di Alibaba e l’ho solo tradotta.

Wan 3.0 vs Seedance 2.5 Native 30s: Specifiche, prezzo e cosa puoi eseguire oggi

Ecco lo stato reale delle cose, e la parte in cui i due modelli smettono di essere prodotti comparabili.

Leggi la riga delle risoluzioni due volte, perché è l’intero articolo. La documentazione API di Seedance 2.5 Text-to-Video di Atlas Cloud stessa afferma che 720p-esr migliora una sorgente a 480p, che 1080p-esr, 1440p-esr e 4k-esr migliorano tutte una sorgente a 720p, e che l’opzione 4K fornisce un lato corto di 2160 pixel "non generazione 4K nativa". Quindi una clip Seedance di 30 secondi etichettata 4K è 720p di dettaglio reale, ricampionato. Il listino prezzi di Wan 3.0, al contrario, ha un livello 1080p diretto a $0.20 al secondo, e i file demo ufficiali di 30 secondi pubblicati da Alibaba misurano 1920x1072.

Il vantaggio di questo vincolo: l’intero test si esegue in una scheda del browser, su tre modelli, senza configurazione locale.

Ruolo in questo testModelloPrezzo indicato
Fotogramma di aperturaGPT Image 2 Text-to-Imageda $0.009 / immagine
L’esecuzione nativa 30sSeedance 2.5 Text-to-Videoda $0.134 / SEC

Prezzi indicati verificati sulle pagine dei modelli Atlas Cloud, agosto 2026. Leggili come minimi, non come preventivi. Ognuno di questi modelli fattura in base a ciò che richiedi effettivamente, e il pulsante Esegui ti quota le tue impostazioni esatte prima di cliccare. In questo test il pulsante ha quotato $0.1745 per un fotogramma GPT Image 2 a qualità alta e 2048x1152, e $1.514799 per un lavoro Seedance 2.5 di cinque secondi a 720p e 16:9, che equivale a circa $0.30 al secondo anziché i $0.134 indicati. La cifra indicata è la tariffa 480p. Controlla il pulsante, non il catalogo. Seedance 2.5 offre anche un endpoint reference-to-video allo stesso $0.134 al secondo se vuoi spingere il limite di 50 riferimenti.

Come riprodurre questo test Native 30s su Seedance 2.5

Cinque passaggi, tre modelli, tutto nel browser. Copia i prompt alla lettera.

Passaggio 1: Blocca la struttura timestampata dei 30 secondi

Non eseguire ancora nulla. Prima leggi la struttura, perché questa è la parte che decide se i tuoi 30 secondi reggono.

La demo di Wan 3.0 della stazione di servizio all’inizio di questo articolo è costruita come quattro blocchi etichettati con una dottrina fissa della fotocamera dichiarata una volta all’inizio: osservazione calma e obiettiva, campi medi fissi, primissimi piani improvvisi solo sulle battute assurde. Ogni evento è ancorato a un intervallo di tempo. L’audio è una riga alla fine che copre tutti i 30 secondi.

Ecco la struttura, vuota. Riempila e avrai un prompt che un modello nativo di 30 secondi può effettivamente seguire:

Plain
1A 30-second [genre] set in [place]. [Visual style, grade, saturation]. Camera language: [doctrine], punctuated by [exception].
2
30-8s: [setup, wide, establish the normal world, introduce the anomaly on the horizon]
4
58-16s: [the anomaly acts, still treated as normal, one POV or reaction insert]
6
716-24s: [the payoff, extreme close-up on the thing itself, hard cut to the reaction face]
8
924-30s: [the walk-off, a small physical button that closes the joke]
10
11Audio: [ambience, three or four specific diegetic sounds, one final small sound]. No music, no dialogue, no on-screen text.

La specifica misurabile del file di riferimento di Alibaba, per chiunque voglia controllare i miei numeri: 30.07 secondi, 1920x1072, 24fps, AAC stereo. Questo è il livello con cui viene misurata l’esecuzione Seedance.

Passaggio 2: Genera il fotogramma di apertura

Hai bisogno di un’ancora visiva fissa in modo che le esecuzioni da 15 e 30 secondi partano dallo stesso mondo. Apri GPT Image 2 Text-to-Image.

Impostazioni: qualità high, rapporto d’aspetto 16:9, 1 immagine.

Plain
1A wide, dead-still establishing shot of a lonely Route 66 style gas station in a bright desert. Retro yellow-orange-and-blue building, paint faintly sun-bleached; a faded vintage-red fuel pump out front; a small convenience store beside it with a washed-out cola vending machine by the door. Cracked orange dry earth in the foreground, warm terracotta mountains far behind, cloudless clean cyan-blue sky. A gas station attendant in greasy blue coveralls and oversized black sunglasses slouches half-asleep in a chair by the door, toothpick in his mouth. Strict bright teal-and-orange color grading, high saturation, high brightness, cinematic photoreal, locked-off camera, 16:9.

Screenshot di un generatore di immagini AI con prompt e immagine di output

Playground di GPT Image 2 su Atlas Cloud con qualità impostata su alta e 16:9, l’immagine generata della stazione di servizio sulla Route 66 nel pannello di output

GPT Image 2 su Atlas Cloud: qualità alta, 16:9, un’immagine. Il pulsante Esegui ha quotato $0.1745 per questo fotogramma, che è quanto costa effettivamente un render di alta qualità a 2048x1152. I $0.009 sulla pagina del modello sono il minimo.

Uomo che riposa fuori da una stazione di servizio vintage sulla Route 66 nel deserto

Fotogramma di apertura della stazione di servizio sulla Route 66 generato con GPT Image 2, cielo ciano e terra arancione screpolata, commesso che sonnecchia accanto alla porta

Il fotogramma di apertura. Questo è l’input per il Passaggio 3 e il riferimento visivo per il Passaggio 4. Generato con openai/gpt-image-2.

Passaggio 3: Colpisci il muro dei 15 secondi

Impostazioni: primo fotogramma = output del Passaggio 2, duration trascinato al massimo di 15, risoluzione 1080P.

Plain
1Locked-off wide shot holds. A cowgirl in a wide-brim hat rides a real horse in from the horizon at a walk. The dozing attendant is woken by hoofbeats, pushes his sunglasses up, sits upright, chewing his toothpick, unimpressed. She dismounts cleanly, leads the horse straight to the vintage fuel pump. Bright teal-and-orange grade, high saturation, photoreal, calm observational camera, no cuts.

Il menu a discesa si ferma a 15. Questo è il punto centrale di questo passaggio. La tua battuta finale è programmata per il secondo 20, e questa pipeline non può raggiungere il secondo 20 in un unico pezzo. Per arrivarci dovresti generare una seconda clip dall’ultimo fotogramma, e nel momento in cui lo fai, il cavallo è un cavallo nuovo.

Screenshot di un’interfaccia di generatore video AI con input e output

Passaggio 4: Esegui il passaggio nativo completo di 30 secondi

Apri Seedance 2.5 Text-to-Video.

Impostazioni: duration = 30, resolution = 720p, ratio = 16:9, generate_audio = on, output_format = mp4, watermark off.

Scegli 720p deliberatamente, non 1080p-esr. 720p è il vero limite del modello, quindi questo è un confronto pixel per pixel invece di un confronto con un upscaler.

Il prompt qui sotto è il prompt demo della stazione di servizio di Alibaba, tradotto fedelmente dal manuale del creatore Wan 3.0 e ristrutturato in nulla. Stesse battute, stessi tempi, stessa dottrina della fotocamera, stesso elenco audio.

Plain
1A 30-second absurdist deadpan comedy short set at a sun-bleached Route 66 style gas station in a bright desert. Photoreal, strict bright teal-and-orange grading, high saturation and high brightness, so the absurd event happens in a completely normal, almost pretty world. Camera language: calm, objective observation, mostly locked-off medium wides and slow lateral drifts, no emotional steering, punctuated by sudden extreme close-ups on the absurd beats.
2
30-8s: Wide, locked-off. Cyan sky, drifting dust. The retro yellow-orange-and-blue station sits alone by the road; an attendant in greasy blue coveralls and huge black sunglasses dozes in a chair, toothpick in mouth. Only wind. On the horizon a cowgirl on a real horse appears at a walk. Cut to medium: hoofbeats wake him, he pushes his sunglasses, sits up, reads the pair as "another one asking for directions."
4
58-16s: She says nothing. She dismounts cleanly, leads the horse straight to the old fuel pump. The horse casually puts its head next to the pump like it has done this before. Brief slightly fish-eyed POV from behind his sunglasses, the woman and horse look even stranger. Close: his brow furrows, he takes the sunglasses off, about to shout. Slow-motion close-up: as the glasses come off, she aims the fuel nozzle at the horse's mouth and squeezes the trigger.
6
716-24s: Extreme close-up on the nozzle. Out comes not gasoline but jets of fresh bright-green grass, still beaded with water. Hard cut to an extreme close-up of the attendant's face, frozen: eyes wide as saucers, mouth slightly open, toothpick forgotten mid-chew. Medium: the horse eats happily, squints with pleasure, then gives one satisfied powerful flick of its tail, and the dust it kicks up lands squarely on the still-stunned attendant's face.
8
924-30s: "Tank full" of grass. She hangs the nozzle back on the pump, digs coins from her pocket, walks to the store door and drops them clinking into a tin can on the counter. She glances back at the petrified attendant; under the hat brim the corner of her mouth lifts a fraction. She remounts and rides off in a trail of dust. The camera pushes slowly in on him: same frozen posture, face covered in dust, sunglasses still pinched in his hand, and finally the toothpick drops from his mouth with a small clack.
10
11Audio: dry desert wind throughout, hoofbeats, the mechanical clunk of the pump handle, wet grass spurting, the tail flick, coins in a tin can, and one small clack as the toothpick hits the ground. No music, no dialogue, no on-screen text.

Un avvertimento che ti farà risparmiare una fattura sprecata, ed è la stessa trappola del Passaggio 3: trascina il cursore della durata a 30, non digitare 30 nella casella numerica. La casella mostrerà 30 mentre il cursore rimane sul suo valore predefinito di cinque secondi, e il pulsante Esegui ti quoterà per cinque secondi. Controlla il preventivo prima di cliccare. A 720p e 16:9, un lavoro di cinque secondi quota $1.514799, quindi un vero passaggio di 30 secondi quota circa sei volte tanto.

Non c’è screenshot dell’esecuzione finita per questo passaggio. Tre tentativi di acquisizione automatica hanno tutti inviato il valore predefinito del cursore invece di 30 secondi, e piuttosto che mostrarti una clip di cinque secondi etichettata come una di 30 secondi, l’acquisizione è stata omessa. Il prompt e le impostazioni sopra sono esattamente ciò che devi incollare e impostare.

Passaggio 5: Leggi la deriva, onestamente

Ecco il lato Seedance 2.5 di quel prompt esatto, generato a 30 secondi nativi, 720p, 16:9, audio attivo.

Seedance 2.5, lo stesso prompt di Wan 3.0 della stazione di servizio copiato alla lettera: 30 secondi nativi in una generazione, 1280x720, 24fps, audio integrato. Stesse quattro battute, cowgirl e cavallo che arrivano, il gag dell’ugello del carburante, il primo piano di dissonanza cognitiva del commesso. Mettilo accanto alla clip Wan 3.0 all’inizio per una lettura alla pari.

Metti le due clip fianco a fianco e controlla cinque cose specifiche. Non controllare "quale sembra migliore", è una discussione di gusto e ti farà perdere il pomeriggio.

  1. Identità del mantello e del costume. Il cavallo ha lo stesso colore al secondo 29 come al secondo 6? Gli occhiali da sole hanno la stessa forma dopo che vengono tolti e rimessi in mano?
  2. Stabilità della gradazione. Campiona il cielo al secondo 2 e al secondo 28. La gradazione ciano e arancio tende a virare verso il caldo nelle generazioni lunghe più spesso di quanto ci si aspetti.
  3. La battuta fisica al secondo 20. Erba che esce da un ugello del carburante è una richiesta fisica. L’erba cade e scende con peso, o svanisce come una texture?
  4. Disciplina della fotocamera. Il prompt dice "locked-off". Conta quante volte la fotocamera inventa un push-in non richiesto. Questo è il fallimento più comune delle generazioni lunghe: il modello esaurisce gli eventi programmati e riempie il tempo con movimento.
  5. Morfismo nel movimento rapido. La scodinzolata della coda e il calcio di polvere sono i movimenti più rapidi della clip. Secondo le note di produzione di MindStudio, è esattamente qui che si concentra la decoerenza, ed è esattamente ciò che un upscale non risolverà.

Valuta queste cinque cose, non l’atmosfera. Questo è un confronto che puoi difendere con un cliente.

Tre ulteriori prompt abbinati Wan 3.0 vs Seedance 2.5 Native 30s

Una demo è un aneddoto. Ecco altri tre file ufficiali Wan 3.0 da 30 secondi dello stesso manuale, ognuno dei quali mette alla prova una parte diversa del problema dei 30 secondi. Per il mostro marino e il monologo fantasy oscuro, il lato Seedance 2.5 è stato generato con lo stesso prompt a 30 secondi nativi e viene incorporato subito dopo ciascuno, così puoi guardarli entrambi invece di credermi sulla parola.

PromptCosa mette alla provaFile ufficiale Wan 3.0, misuratoLato Seedance 2.5, stesso prompt
Film di disastro con mostro marino10 inquadrature scriptate più una colonna sonora orchestrale in 30s1920x1072, 24fps, 30.07s, AACgenerato a 30s, incorporato sotto; un nome IP e il testo del marchio della barca sono stati rimossi per far passare il filtro dei contenuti di Seedance, lo storyboard è per il resto identico
Monologo fantasy oscuro in inglesevoce inglese nativa e sincronizzazione labiale in una lenta carrellata continua1280x720, 24fps, 30.05s, AACgenerato a 30s dal prompt alla lettera, incorporato sotto
Anime sportivo 2D, prompt di due righeil modello può riempire 30 secondi con quasi nessuna istruzione1280x720, 24fps, 30.05s, AACnon generato qui; mostrato come una griglia di fotogrammi solo Wan per leggere la struttura nel tempo
Commedia breve con whip-pan (escluso)8 whip-pan e 8 battute emotive senza taglio1280x720, 24fps, 30.04s, AACnon eseguito: la densità del dialogo è specifica per il mandarino, una riscrittura in inglese non sarebbe un confronto equo alla pari

Demo ufficiale Wan 3.0: dieci inquadrature scriptate e un crescendo orchestrale completo all’interno di un singolo passaggio di 30 secondi, a 1920x1072. Questo è l’argomento più forte per il 1080p nativo, perché il volume d’acqua e il dettaglio della pelle bagnata della creatura sono esattamente ciò che un upscale 720p inventa piuttosto che risolve. Manuale del creatore Tongyi di Alibaba, utilizzato per confronto e commento.

Seedance 2.5, lo stesso prompt del disastro di dieci inquadrature a 30 secondi nativi, audio attivo. Barca da pesca in tempesta, il mozzo terrorizzato, il mare che si solleva, poi il leviatano degli abissi che emerge in superficie nel lampo. Un riferimento IP e il testo del marchio sullo scafo sono stati rimossi affinché il filtro dei contenuti di Seedance lo passasse; lo storyboard è per il resto identico, il che rende il dettaglio del volume d’acqua e della pelle bagnata un confronto equo alla pari con la clip Wan 3.0 qui sopra.

Demo ufficiale Wan 3.0, audio attivo. Dialogo del cattivo in inglese nativo, "Ripe enough for the void", pronunciato in un’unica, lenta carrellata verso l’alto senza taglio. Questa è la clip che i team di lingua inglese dovrebbero testare, perché voce, sincronizzazione labiale e un movimento continuo della fotocamera di 30 secondi devono reggere tutti insieme.

Seedance 2.5, lo stesso prompt fantasy oscuro copiato alla lettera, 30 secondi nativi, audio attivo. Stesso cattivo dagli occhi viola, i segni runici stellari, la nebulosa d’ombra che si forma nel palmo della mano, e le due battute in inglese. Osserva se la sincronizzazione labiale e la singola carrellata continua reggono per tutti i 30 secondi come fanno dal lato Wan 3.0.

Se esegui il lato Seedance 2.5 abbinato di questo, tieni le due battute in inglese alla lettera e ricorda la stranezza dell’accento dalle note di produzione: scrivi "American", non "American English". La parola "English" spinge la recitazione verso una lettura britannica.

Il terzo è la sorpresa silenziosa. Il prompt dell’anime sportivo 2D nel manuale di Alibaba è di due righe. Nessun timestamp, nessun elenco di inquadrature, solo un pugile che colpisce un sacco pesante, stanco, dolorante. Trenta secondi da questo è una vera prova di se il modello può inventare la propria struttura. Ecco campionato lungo la sua durata:

Quattro pannelli anime di un pugile esausto che si allena con un sacco da boxe

Quattro fotogrammi dalla demo ufficiale Wan 3.0 dell’anime sportivo 2D, campionati approssimativamente a 1, 10, 20 e 29 secondi, che mostrano il design del pugile e lo sfondo della palestra per tutti i 30 secondi

Quattro fotogrammi dalla demo ufficiale Wan 3.0 dell’anime sportivo 2D, campionati approssimativamente a 1, 10, 20 e 29 secondi. Stesso design del personaggio, stessa canottiera, stesso sacco pesante, stessa fila di armadietti, attraverso un cambiamento da campo largo a primo piano che il prompt non ha mai richiesto. Una griglia fissa piuttosto che una clip, perché il confronto qui è nel tempo all’interno di un file, non nel movimento.

Lettura pratica: con un prompt di due righe, il modello ha inventato la propria copertura, passando da un campo largo fisso a un primo piano di sudore e stanchezza, e ha mantenuto il design del personaggio mentre lo faceva. Questa è la buona notizia. Il compromesso è che hai rinunciato al controllo di quando accade qualcosa. Se hai bisogno che 30 secondi atterrino una battuta specifica a un secondo specifico, scrivi i timestamp.

Testa la narrazione nativa di 30 secondi gratuitamente prima di pagare per l’uno o l’altro

Un’esecuzione Seedance 2.5 a 720p di 30 secondi quota circa $9 una volta che prezzi la risoluzione reale anziché il minimo del catalogo. Un’esecuzione Wan 3.0 a 1080p di 30 secondi sul listino prezzi è $6.00. Nessuno dei due è costoso per gli standard di produzione, ma con un rapporto di ripresa di 3.2 a 1 non stai comprando una clip, ne stai comprando tre o quattro.

Prima di spendere qualcosa, vale la pena rispondere a una domanda più economica: la mia sceneggiatura regge davvero come un’unica inquadratura continua? La maggior parte dei fallimenti dei 30 secondi non sono fallimenti del modello. Sono fallimenti di struttura, tre battute stipate dove c’era spazio per due, o una risoluzione scritta al secondo 26 senza nulla che porti i secondi da 8 a 20.

Il generatore gratuito di spot pubblicitari AI di Atlas Cloud risponde a questo gratuitamente. Gli fornisci una descrizione del prodotto e fino a quattro foto del prodotto, ciascuna sotto 8MB, scegli uno dei sei stili (meme divertente, colpo di scena, sitcom, commovente, lusso o vendita aggressiva), e prima scrive una sceneggiatura con due personaggi, con un gancio di tre secondi, un conflitto e un colpo di scena, poi costruisce ogni inquadratura attorno a quella sceneggiatura. I personaggi parlano le loro battute ad alta voce e gli effetti sonori sono renderizzati nel video.

I limiti onesti: sono 15 secondi, non 30, devi aver effettuato l’accesso e ottieni una generazione gratuita prima di ricaricare i crediti. Ma 15 secondi con un gancio, un conflitto e un colpo di scena ti dicono se le tue tre battute respirano. Se la struttura funziona lì, prendi le stesse battute, allungale sulla struttura 0-8s / 8-16s / 16-24s / 24-30s del Passaggio 1, e vai a spendere i nove dollari per un vero passaggio nativo di 30 secondi.

Quanto costa effettivamente una clip nativa di 30 secondi su Wan 3.0 vs Seedance 2.5

ConfigurazioneTariffaDurataUna clip
Wan 3.0, 1080p nativo (solo Alibaba Cloud)$0.20 / sec30s$6.00
Wan 3.0, 720p nativo (solo Alibaba Cloud)$0.10 / sec30s$3.00
Wan 3.0, 480p nativo (solo Alibaba Cloud)$0.05 / sec30s$1.50
Seedance 2.5, 720p nativo, su Atlas Cloud$0.30 / sec misurato a 720p, indicato da $0.13430scirca $9.09
GPT Image 2 fotogramma di apertura, qualità alta, 2048x1152indicato da $0.009 / immagine1 immagine$0.1745 quotato

Il confronto che decide davvero: Wan 3.0 a 720p è più economico al secondo di Seedance 2.5 a 720p, e a 1080p è l’unico dei due che vende pixel reali. La risposta di Seedance 2.5 è 50 slot di riferimento, disponibilità live e un’API funzionante che puoi utilizzare per spedire questo pomeriggio.

Nota su fonti e licenze per queste clip native di 30 secondi

Ogni clip Wan 3.0 e ogni prompt Wan 3.0 in questo articolo provengono dal manuale del creatore Tongyi Wan 3.0 distribuito pubblicamente da Alibaba, riprodotto qui per confronto e commento, accreditato, non modificato e senza rimuovere la filigrana. L’uso commerciale dell’output di Seedance 2.5 rientra nei termini di ByteDance e Volcengine; la fatturazione API e la gestione dei dati sul lato Atlas Cloud rientrano nei termini di Atlas Cloud. Nessuna somiglianza di persona reale viene riprodotta in questo test. Se stai spedendo lavoro per clienti, leggi i termini del modello per l’endpoint specifico che chiami, non un riepilogo del blog degli stessi.

Domande frequenti

I 30 secondi nativi di Wan 3.0 sono davvero un solo passaggio o clip cucite?

Un solo passaggio. Wan 3.0 genera da 2 a 30 secondi in una singola generazione con un’opzione di durata intelligente, quindi può anche decidere che la clip non ha bisogno dei 30 secondi interi. Questo è diverso dall’estensione dell’ultimo fotogramma, in cui una seconda clip viene seminata dall’ultimo fotogramma della prima e l’identità deriva lungo la giuntura.

Quale dei due è davvero 1080p a 30 secondi, Wan 3.0 o Seedance 2.5?

Wan 3.0. Ha un livello 1080p nativo nel suo listino prezzi, e i file demo ufficiali di 30 secondi di Alibaba misurano 1920x1072. Seedance 2.5 genera nativamente solo a 480p e 720p; le sue opzioni 1080p, 1440p e 4K sono miglioramenti di una sorgente a 720p, e la sua documentazione API descrive il livello 4K come "non generazione 4K nativa".

L’immagine si rompe ancora al secondo 25?

Può, ma il fallimento ha cambiato forma. Invece di una giuntura visibile tra le clip, si ottengono morfismo e decoerenza all’interno dell’inquadratura, concentrati nei passaggi di movimento rapido, e l’upscaling non li rimuove. Una produzione documentata di cortometraggi Seedance 2.5 ha avuto un rapporto di ripresa di 3.2 a 1, quindi pianifica le lunghe riprese con copertura.

Quale modello accetta più materiale di riferimento?

Seedance 2.5, con ampio margine: 30 immagini più 10 video più 10 file audio, 50 in totale, con video e audio di riferimento ciascuno limitato a 30 secondi combinati per richiesta. Il manuale di Wan 3.0 limita i riferimenti a 20, ma è l’unico che accetta file .pdf, .ppt, .xls, .doc, .txt e pagine web live come input creativo.

Wan 3.0 avrà pesi aperti?

Non c’è impegno ufficiale. Al momento della beta pubblica dell’agosto 2026, non sono stati pubblicati pesi Wan 3.0, checkpoint Hugging Face o nodo ComfyUI, e i pesi aperti ufficiali per la linea video di punta si fermano a Wan 2.2 (Kingy AI, agosto 2026). Tratta qualsiasi altra cosa tu legga su un rilascio di pesi 3.0 come speculazione fino a quando Alibaba non dice diversamente.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli