Seedance 2.5 è ora live — In anteprima su Atlas Cloud

Wan 3.0 Multimodal Reference accetta 20 risorse, e un PDF è una di esse.

Il riferimento multimodale Wan 3.0 accetta 20 risorse in una singola chiamata: immagini, video, audio, PDF e persino un URL. Guarda i risultati di Alibaba e un flusso di lavoro che puoi eseguire oggi.

Hai creato una cartella per un singolo spot di 15 secondi. Due foto di personaggi. Un video sul tono del brand inviato dal cliente. Un brand book che esiste solo come PDF. Un campione vocale dell'attore che vuoi davvero.

Poi hai aperto il tuo modello video e ti ha chiesto una sola immagine.

Quindi hai fatto quello che fanno tutti. Hai tradotto la cartella in un prompt di 800 parole e hai pregato. Il volto è cambiato nell'inquadratura tre. La giacca ha cambiato colore. La voce era di qualcun altro.

Il riferimento omnidirezionale di Wan 3.0 è la prima volta che un modello video dice: va bene, passami la cartella. Fino a 20 risorse in una singola chiamata, attraverso cinque tipi di input, tenuti insieme in un'unica ripresa continua di 30 secondi.

Questo articolo fa tre cose e salta il resto. Spiega cosa sono effettivamente quelle 20 risorse, usa le clip generate dallo stesso Alibaba come prova e ti fornisce un flusso di lavoro equivalente che puoi eseguire oggi, perché Wan 3.0 è ancora in beta pubblica sul cloud di Alibaba e non è ancora richiamabile da piattaforme terze.

Punti chiave

  • Il riferimento multimodale di Wan 3.0 accetta fino a 20 risorse in una singola chiamata, tra immagini, video, audio, documenti e pagine web live, e le mantiene coerenti in un'unica ripresa di 30 secondi.
  • È il primo modello video mainstream a trattare un PDF, una presentazione o un URL come input creativo invece di qualcosa che devi parafrasare in un prompt.
  • Wan 3.0 è entrato in beta pubblica il 6 agosto 2026 su Alibaba Cloud Model Studio e Qwen Cloud come wan3.0-video. Ha pesi chiusi. Chiunque ti dica che è già Apache 2.0 sta solo indovinando.
  • Il titolo delle 20 risorse non è il punto in cui supera davvero. I modelli reference-to-video che puoi chiamare ora accettano già più di 20 risorse. Il divario sono i documenti e le pagine web, non il numero.
  • Puoi testare il formato a due personaggi, con riferimento bloccato e voce completa gratuitamente con il generatore di sketch pubblicitari AI gratuito di Atlas Cloud: quattro foto di prodotto in input, uno sketch parlato di 15 secondi in output, senza carta di credito.

Gatto soffice e gatto nero che corrono lungo un corridoio di un grande hotel

Due gatti inseguiti attraverso cinque diversi set da Wan 3.0 senza deriva del personaggio_Due immagini di riferimento. Cinque set completamente diversi, da un corridoio d'albergo a un cestello di lavatrice a una cabina telefonica rossa. Neppure un fotogramma di deriva. Fonte: il manuale ufficiale del creatore di Wan 3.0_ di Alibaba , agosto 2026, che è anche la fonte di tutte le altre clip di Wan 3.0 in questo articolo.

Perché il multi-riferimento video fallisce e cosa cambia il riferimento multimodale di Wan 3.0

I modelli video non hanno memoria tra le clip. Ogni generazione parte da zero. Questo è tutto il problema in una frase.

Quindi nel momento in cui la tua storia ha bisogno di più di una ripresa, stai cucendo. La prima inquadratura ti dà un volto che ami. La seconda ti dà un cugino di quel volto. La terza cambia silenziosamente la giacca dal prugna al bordeaux, e quando te ne accorgi hai già pagato undici rendering.

Il riferimento a immagine singola ha aiutato, ma ha sempre bloccato solo una cosa. Un volto. Non poteva tenere contemporaneamente un volto, un outfit, un oggetto di scena, una location e una voce, perché c'era uno slot e cinque lavori.

Ci sono due vie d'uscita. Dare al modello più slot, o smettere di farlo ricominciare da capo. Wan 3.0 fa entrambe le cose contemporaneamente, ed è per questo che le due caratteristiche principali sono in realtà una sola caratteristica. Una ripresa nativa di 30 secondi significa che non c'è taglio attraverso cui il personaggio possa derivare. Venti risorse di riferimento significano che ogni elemento che deve rimanere fisso ottiene il proprio slot dedicato invece di lottare per uno.

Ecco come appare quando nulla è cucito. Trenta secondi, una telecamera continua, un bambino in un carrello della spesa che finisce incastrato in un cartellone pubblicitario e poi ne esce camminando da sotto.

30 secondi completi in un unico passaggio, senza tagli, con la colonna sonora generata nello stesso passaggio. Fonte: manuale ufficiale del creatore di Wan 3.0 di Alibaba.

Cosa significano effettivamente "20 risorse" all'interno del riferimento multimodale di Wan 3.0

Venti è un numero da titolo. Ciò che conta è che i venti non sono tutti dello stesso tipo. Il riferimento omnidirezionale di Wan 3.0 copre cinque tipi di input, e ciascuno controlla un asse diverso dell'output.

Le immagini controllano l'identità. Una scheda personaggio, una foto di prodotto, una scheda location. Wan 3.0 chiama questa coerenza a livello di pixel, e negli esempi di Alibaba il blocco si estende oltre il volto fino al guardaroba: la veste grigia a strati, il corpetto di cuoio con cinghie, la fascia scura in vita sopravvivono a un combattimento corpo a corpo di sedici secondi attraverso tre location.

Giovane uomo in abiti tradizionali cinesi in piedi all'aperto al tramonto

Due schede personaggio che guidano una scena di combattimento wuxia con dettagli del costume mantenuti fotogramma per fotogramma

Due schede personaggio più una scheda location del canneto. Il guardaroba e l'ambientazione resistono a ogni lancio. Mostrato qui come GIF silenziosa; il file consegnato porta un mix stereo a 44,1 kHz. Fonte: manuale ufficiale del creatore di Wan 3.0 di Alibaba.

L'audio controlla la voce. Questa è la parte che rende "multimodale" più di una strategia di marketing. Alleghi un campione vocale per personaggio, scrivi le battute nel prompt, e il dialogo torna con quel timbro, labiale sincronizzato, nello stesso passaggio dell'immagine. Due persone, due riferimenti vocali, una palestra.

Due immagini di soggetto più due clip vocali di riferimento separate, e il dialogo torna con quelle due voci. Vale la pena accendere l'audio per questo. Fonte: manuale ufficiale del creatore di Wan 3.0 di Alibaba.

Il video controlla il tempismo. Un video di riferimento non è lì per essere copiato. È lì per donare il suo ritmo: quanto dura un battito, come si muove una transizione. In questo, cinque fotogrammi chiave forniscono i soggetti e un video di riferimento fornisce la cadenza orizzontale del flip di carta tra di loro.

Donna con elaborato copricapo tradizionale cinese e abito blu ricamato

Cinque fotogrammi chiave attraversati con il ritmo preso da un video di riferimento_Cinque_ fotogrammi chiave per i soggetti, un video di riferimento per il ritmo del flip. Fonte: manuale ufficiale del creatore di Wan 3.0 di Alibaba.

Documenti e pagine web controllano la struttura. Questa è la parte davvero nuova. Wan 3.0 accetta file di documenti e URL live come input creativo, e i resoconti sulla beta elencano .doc, .xls, .ppt, .pdf e .txt tra i formati accettati (AlphaSignal, agosto 2026). La stessa logica funziona già con un'immagine di storyboard: una scheda in input, sei inquadrature in output, nell'ordine della scheda stessa.

Due persone con ombrelli in piedi su una banchina di una stazione ferroviaria piovosa

Una singola scheda di storyboard espansa in sei inquadrature sequenziali su una banchina ferroviaria piovosa

Una scheda di storyboard come riferimento, sei inquadrature generate nel suo ordine, fino al passaggio del biglietto tra le mani nell'inquadratura cinque. Fonte: manuale ufficiale del creatore di Wan 3.0 di Alibaba.

Il primo e l'ultimo fotogramma controllano gli estremi. Il trucco più vecchio del mondo, ancora supportato, ancora il modo più veloce per delimitare un'inquadratura.

Ecco come si confronta con la versione che la maggior parte delle persone usa effettivamente oggi.

Wan 2.7 Reference-to-VideoWan 3.0 omni-reference
Risorse di riferimentoun'immagine per soggetto, fino a 3 video, 1 clip vocalefino a 20 risorse in totale
Modalitàimmagine, video, audioimmagine, video, audio, documento, pagina web
Durata massima, un passaggio10 s30 s nativa, più durata intelligente
Audio nello stesso passaggio
Modifica ed estensione videonon espostamodifica basata su istruzioni e riferimento, più estensione
Disponibilitàlive su API di terze partiAlibaba Cloud Model Studio e Qwen Cloud beta

C'è una regola che nessuno mette nei documenti e tutti imparano a proprie spese: un riferimento, un lavoro. Image1 blocca il volto e l'outfit. Video1 dona solo il movimento. Audio1 dona solo il timbro. Nel momento in cui assegni a una singola risorsa due lavori contrastanti, o carichi un'immagine di riferimento con due persone, il modello deve indovinare, e indovinare è esattamente quello che stavi cercando di evitare. Anche il manuale di Alibaba è diretto su questo: un soggetto per immagine di riferimento.

Il flusso di lavoro di riferimento multimodale di Wan 3.0 che puoi eseguire oggi

Risposta diretta prima. Wan 3.0 è in beta pubblica sul cloud di Alibaba, con l'ID modello wan3.0-video (Alibaba Wan, agosto 2026). Non è ancora arrivato su piattaforme API di terze parti, Atlas Cloud incluso. Chiunque ti stia vendendo l'accesso API a Wan 3.0 in questo momento sta rivendendo qualcos'altro.

Ciò che è arrivato è la forma del flusso di lavoro. Pacchetto di riferimento in input, una chiamata, clip finita con audio in output. Questo funziona oggi su modelli reference-to-video che puoi chiamare in una scheda del browser, e una volta che li allinei tutti, il titolo delle 20 risorse appare diverso.

ModelloRisorse di riferimentoModalitàDurata massimaAudio nativoPrezzo al secondo
Wan 3.0 (beta Alibaba, non su Atlas)20 totaliimmagine, video, audio, documento, pagina web30 sSegnalato $0.05 a $0.20 per risoluzione
Wan 2.7 Reference-to-Video1 immagine per soggetto, 3 video, 1 clip vocaleimmagine, video, audio10 s$0.10
Seedance 2.5 Reference-to-Video50 (30 immagine / 10 video / 10 audio)immagine, video, audio30 s$0.13
MiniMax H3 Reference-to-Videomisto, nessun limite dichiaratoimmagine, video, audio15 s$0.10
Kling Video O3 Pro Reference-to-Video7 immagini, o 4 immagini + 1 videoimmagine, video15 s$0.10
Vidu Q3-Mix Reference-to-Video4 immaginiimmagine16 s$0.11
Veo 3.1 Reference-to-Video3 immaginiimmagine8 sOpzionale$0.20

I prezzi sono le tariffe di Atlas Cloud a partire da agosto 2026. Le cifre di Wan 3.0 sono quelle riportate per la beta di Alibaba Cloud, non una tariffa Atlas, e Alibaba non ha ancora pubblicato una pagina dei prezzi pubblica per il modello, quindi considera quella riga come provvisoria.

Leggi quella tabella due volte e la vera storia emerge. Il titolo delle 20 risorse non è dove Wan 3.0 supera, perché Seedance 2.5 ne accetta già 50 e raggiunge i 30 secondi. Ciò che nient'altro in quella lista accetta è un PDF.

Per il walkthrough qui sotto, la demo gira su Wan 2.7 Reference-to-Video, perché la sua forma di input è il parente vivente più prossimo dell'omni-reference: più immagini di soggetto, un video di riferimento opzionale e una clip vocale, tutti mappati alle etichette character1 e character2 all'interno del prompt. Tre modelli, una scheda del browser, nessuna installazione locale.

Costruiscilo da solo: una scena di riferimento multimodale in quattro passaggi

La scena: una reception di un hotel pastello. Un concierge impassibile. Un viaggiatore con un gatto di pezza. Il concierge guarda dritto nell'obiettivo e dice "Il gatto ha una prenotazione. Tu no."

Due immagini più una clip vocale, che sono tre risorse di riferimento in due modalità. Questa è la build più piccola che è onestamente multimodale piuttosto che solo multi-immagine.

Passaggio 1. Genera l'immagine di riferimento 1, il soggetto che devi bloccare

Le immagini di riferimento hanno tre lavori e solo tre: un soggetto, di fronte alla telecamera, sfondo pulito. Tutto il resto è decorazione. Usa GPT Image 2 con qualità high, dimensione 16:9, n=1.

Plain
1Ritratto a figura intera in studio di un concierge d'albergo di mezza età con espressione impassibile, in piedi al centro esatto contro una parete rosa polverosa piatta. Indossa un'uniforme da facchino prugna a doppio petto con alamari dorati e bottoni in ottone, un piccolo cappello a pillola rotondo e un sottile baffetto. Inquadratura perfettamente simmetrica, luce frontale morbida e uniforme, nessuna ombra sul muro, grana pellicola 35mm, tavolozza pastello tenue. Un solo soggetto, nessun'altra persona, nessun testo, nessun logo, nessun oggetto di scena nell'inquadratura.

Interfaccia del generatore di immagini AI che mostra passaggi numerati e un facchino generato

Playground di GPT Image 2 su Atlas Cloud con il ritratto di riferimento del concierge renderizzato nel pannello di output

GPT Image 2 su Atlas Cloud: qualità alta, 16:9, un soggetto, sfondo piatto. Questo è il file che diventa character1.

Passaggio 2. Genera l'immagine di riferimento 2, il secondo soggetto bloccato

Stesso modello, stesse impostazioni. Il contrasto cromatico tra i due personaggi è intenzionale, poiché dà al modello un modo semplice per tenerli separati quando condividono un'inquadratura.

Plain
1Ritratto a figura intera in studio di una giovane viaggiatrice che tiene un gatto di pezza soffice contro il petto, in piedi al centro esatto contro una parete giallo senape piatta. Indossa un cappotto di lana senape, un berretto rosso e occhiali tondi tartarugati, e tiene una piccola valigia di cuoio vintage nella mano libera. Inquadratura perfettamente simmetrica, luce frontale morbida e uniforme, nessuna ombra sul muro, grana pellicola 35mm, tavolozza pastello tenue. Un solo soggetto, nessun'altra persona, nessun testo, nessun logo.

Passaggio 3. Genera il riferimento vocale, che è la parte veramente multimodale

La clip vocale è ciò che trasforma questo da un lavoro multi-immagine in uno multimodale. Lo slot audio di Wan 2.7 vuole un campione breve, all'incirca da 1 a 10 secondi, quindi mantieni la battuta corta. Usa MiniMax Speech 2.6 HD e scegli una voce maschile bassa, piatta e imperturbabile.

Plain
1Buonasera. Check-in? Certo. Tutti lo fanno.

Passaggio 4. Una chiamata, tre riferimenti, una clip finita

Ora l'intero pacchetto va insieme su Wan 2.7 Reference-to-Video. Impostazioni: resolution: 1080P, ratio: 16:9, duration: 10, che è il massimo di questo modello, prompt_extend: false, seed: -1. Carica images in ordine, prima il passaggio 1, in modo che si mappi su character1, poi il passaggio 2 come character2, e allega il file del passaggio 3 a audio.

Plain
1Inquadratura ampia, simmetrica, centrata al millimetro della reception di un hotel pastello, pareti rosa polveroso e un porta chiavi giallo senape dietro. character1 è il concierge in piedi dietro il bancone; character2 è la viaggiatrice in piedi di fronte, che tiene ancora il suo gatto di pezza. La telecamera si avvicina lentamente lungo un asse centrale perfetto e non inclina mai. character1 guarda dritto nell'obiettivo e dice con tono piatto: "Il gatto ha una prenotazione. Tu no." character2 sbatte le palpebre una volta, gira lentamente la testa verso il gatto, poi torna al bancone. Il gatto fissa direttamente la telecamera senza muoversi. Grana pellicola 35mm, illuminazione morbida e uniforme, tavolozza pastello tenue, nessuna vibrazione della telecamera, nessun taglio.

Prompt negativo:

Plain
1vibrazione manuale, tagli netti, sottotitoli, testo sullo schermo, filigrana, persone extra, mani deformate, morphing del volto, spostamento di colore, sfocatura da movimento

Screenshot di un'interfaccia di generatore video AI con input e output

Playground di Wan 2.7 Reference-to-Video su Atlas Cloud con due immagini di riferimento e un file audio caricati e la clip finita nel pannello di output

Wan 2.7 Reference-to-Video su Atlas Cloud: due immagini di riferimento e una clip vocale allegate a sinistra, la ripresa finita in riproduzione a destra a 1080P e 16:9. Questa acquisizione è stata eseguita alla durata predefinita del modello; impostala a 10 per la versione completa qui sotto.

La clip finita. Entrambi i volti mantenuti, entrambi gli outfit mantenuti, e la battuta pronunciata con la voce clonata dal passaggio 3, quindi vale la pena riprodurla con l'audio.

Donna con gatto alla reception dell'hotel con facchino

I due ritratti di riferimento accanto a un fotogramma della clip finita, che mostrano gli stessi volti e outfit

Riferimenti a sinistra, un fotogramma della clip consegnata a destra. Le alamari dell'uniforme, il berretto, gli occhiali e il gatto sopravvivono tutti al viaggio.

Variazioni sul flusso di lavoro di riferimento multimodale di Wan 3.0

Portalo a 30 secondi. Lo stesso pacchetto di riferimento gira su Seedance 2.5 Reference-to-Video con duration: 30, che ti dà la lunghezza che Wan 3.0 promette senza aspettare la beta. Accetta fino a 30 immagini di riferimento, 10 video e 10 clip audio, quindi il pacchetto ha spazio per crescere. Scrivi i 20 secondi extra come battute nel prompt, non come atmosfere, o il modello riempirà.

Interfaccia del generatore video AI che mostra le impostazioni di input e l'avanzamento della generazione

Playground di Seedance 2.5 Reference-to-Video su Atlas Cloud con durata impostata a 30 e la lunga ripresa renderizzata

Seedance 2.5 Reference-to-Video su Atlas Cloud con durata impostata a 30 e gli stessi due ritratti di riferimento allegati, catturato a metà generazione. Nota i chip @image1 e @image2 nel prompt: è così che dici a Seedance quale riferimento interpreta quale parte. Controlla il prezzo quotato sul pulsante Esegui prima di impegnarti, poiché riflette la durata che il lavoro invierà effettivamente.

La versione da 30 secondi della stessa scena, stesso pacchetto di riferimento, battute scritte inquadratura per inquadratura.

Aggiungi un video di riferimento solo per il movimento. Allega una clip di cui ti piace il ritmo e dillo esplicitamente nel prompt, qualcosa come "segui il video di riferimento solo per il ritmo di taglio, ignora i suoi soggetti e l'ambientazione". Questo è il trucco dietro l'esempio del flip di carta più sopra.

Correggi la deriva con il prompt negativo prima di toccare quello positivo. Il morphing del volto, lo spostamento di colore e la vibrazione manuale sono i tre che rovinano le inquadrature con riferimento bloccato, e di solito sono più economici da sopprimere che da descrivere.

Prova il formato di riferimento multimodale gratuitamente

Se vuoi la forma di questo prima dei parametri, Atlas Cloud ha rilasciato un generatore di sketch pubblicitari AI gratuito la scorsa settimana che esegue la stessa catena senza nessuna manopola.

Scrivi una riga sul tuo prodotto e i suoi punti di forza. Scrive una sceneggiatura comica a due personaggi per te, gancio, conflitto, colpo di scena, poi renderizza un video di 15 secondi con dialogo parlato ed effetti sonori integrati. Puoi allegare fino a quattro foto reali del prodotto come riferimenti, e lo spot mantiene la loro forma, colore, etichetta e logo dalla sceneggiatura al fotogramma finale. Sono inclusi sei stili, dal meme divertente al colpo di scena, alla sitcom, al lusso e alla vendita aggressiva, e il dialogo torna nella lingua in cui hai scritto la descrizione.

Questa è la stessa catena a due personaggi più immagini di riferimento più voce del tutorial, meno la scrittura del prompt e meno il conto. Il che lo rende un modo decente per scoprire se questo formato si adatta al tuo prodotto prima di spendere qualsiasi cosa per ottimizzarlo.

Per avere un'idea di cosa fa una pila di fotogrammi di riferimento a un pezzo di prodotto, questa è la versione di Wan 3.0 del lavoro: cinque immagini in input, un reel di lancio in output, ogni fotogramma che ancora un battito del montaggio.

Pila animata di carte bianche e verde menta fluttuanti

Cinque fotogrammi di riferimento espansi in un reel di lancio prodotto in stile Material Design_Cinque immagini di riferimento che guidano un filmato di prodotto di nove secondi, ciascuna che ancora un battito e passa al successivo. Fonte: manuale ufficiale del creatore di Wan 3.0 di Alibaba._

Quanto costa una clip di riferimento multimodale di Wan 3.0

PassaggioModelloPrezzo unitarioQuantitàCosto
1 e 2, due immagini di riferimentoGPT Image 2$0,009 per immagine2$0,02
3, riferimento vocaleMiniMax Speech 2.6 HD$0,08 per 1.000 caratteri49 caratteri$0,00
4, la ripresa da 10 secondi a 1080PWan 2.7 Reference-to-Video$0,15 al secondo a 1080P10 s$1,50
Totale tutorialcirca $1,52
Variazione, 30 secondiSeedance 2.5 Reference-to-Video$0,134 al secondo a 480P30 scirca $4,02
Via gratuitaGeneratore di sketch pubblicitari AI gratuitogratuito1 clip, 15 s$0

Queste sono le tariffe della piattaforma, verificate nell'agosto 2026 e fatturate a consumo. Due cose fanno muovere il totale più di quanto la gente si aspetti. La risoluzione è la prima: i $0,10 al secondo nella tabella comparativa sono la tariffa base di Wan 2.7, e 1080P costa $0,15, da cui provengono i $1,50 sopra. La seconda è che Seedance fa pagare in base al conteggio dei pixel, quindi i suoi $0,134 al secondo indicati sono la cifra per 480P e una ripresa a 720P costa più di quanto suggerisca una moltiplicazione diretta. Per riferimento, la tariffa beta riportata di Wan 3.0 di $0,20 al secondo a 1080p metterebbe una ripresa completa di 30 secondi a circa $6, che è più della via Seedance a 480P oggi.

Una nota sull'uso di questo materiale. Wan 3.0 è una beta e i suoi termini possono cambiare, quindi rileggili prima di costruire una pipeline su di esso. Se le tue immagini di riferimento sono persone reali, ottieni il loro permesso prima, poiché la reference-to-video è precisamente la capacità che rende importante questa cosa. Le clip di esempio in questo articolo sono risultati generati dallo stesso Alibaba dal suo manuale pubblico per creatori, riprodotti qui per commento.

Domande frequenti

Quanti riferimenti può effettivamente accettare il riferimento multimodale di Wan 3.0?

Fino a 20 risorse in una singola chiamata, tratte da immagini, video, audio, documenti e pagine web. Il limite pratico è inferiore a quello tecnico. Assegna a ciascuna risorsa esattamente un lavoro, un soggetto per immagine, e userai molto meno di 20 per la maggior parte delle scene.

Wan 3.0 può davvero trasformare un PDF o una pagina web in un video?

Sì, questa è la parte veramente unica. Oltre a testo, immagine, audio e video, accetta file di documenti e URL live, con resoconti sulla beta che elencano .doc, .xls, .ppt, .pdf e .txt. Nessun altro modello reference-to-video nella tabella comparativa sopra accetta un documento.

Wan 3.0 è open source? Posso eseguirlo in ComfyUI?

No, e non al momento. Wan 3.0 è una beta chiusa in esecuzione sul cloud di Alibaba. Le generazioni precedenti di Wan sono state rilasciate apertamente, motivo per cui l'aspettativa esiste, ma Alibaba non ha confermato i pesi per la 3.0. Le pagine che affermano un rilascio Apache 2.0 di Wan 3.0 da 1,3B o 14B non sono supportate da nulla di ufficiale.

Wan 3.0 è disponibile tramite API di terze parti?

Non ancora, Atlas Cloud incluso. La cosa più vicina che puoi chiamare oggi è Wan 2.7 Reference-to-Video, la cui forma di input corrisponde quasi esattamente all'omni-reference a parte le modalità documento e pagina web, o Seedance 2.5 Reference-to-Video se hai bisogno dei 30 secondi completi.

Qual è il modo più economico per testare un video a due personaggi con riferimento bloccato?

Il generatore di sketch pubblicitari AI gratuito linkato sopra. Quattro foto di riferimento in input, una clip di 15 secondi parlata a due personaggi in output, nessun parametro e nessuna spesa. Se mantiene il tuo prodotto e il tuo formato, allora vai a ottimizzare la catena a pagamento.

Perché i miei personaggi derivano ancora anche con le immagini di riferimento?

Tre cause, in ordine di frequenza. Un riferimento sta portando due lavori, quindi gli viene chiesto di fissare sia il volto che la location. L'immagine di riferimento ha più di una persona o uno sfondo impegnativo, quindi il modello non sa quale parte bloccare. Oppure la deriva è un artefatto di rendering piuttosto che un fallimento del riferimento, nel qual caso metti morphing del volto, spostamento di colore nel prompt negativo prima di riscrivere qualsiasi cosa.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli