MiniMax ha rilasciato H3 venerdì. In ventiquattr'ore Seedance 2.5 era nelle mani delle persone, e la timeline si è ridotta a una conversazione: trenta secondi, 4K nativo, cinquanta input di riferimento. Il post di lancio di H3 stava sotto, in silenzio, con quasi nessuno che gli faceva un test vero.
Capisco perché. Trenta secondi è un bel numero. Ci sta in un titolo.
Ma se produci davvero corti verticali, sai che la cosa che ti rovina la notte non è il secondo trenta. È l'inquadratura 4. La mascella del protagonista si sposta di mezzo centimetro, la sua cravatta perde una piega, e lo spettatore scorre via prima che l'aggancio faccia presa. Nessuno abbandona perché un clip era quindici secondi invece di trenta. Abbandonano perché il tizio nel primo piano non è il tizio del campo largo.
Quindi ho saltato il duello delle specifiche. Ho costruito un foglio di rotazione del personaggio, una tavola di location a sei pannelli, ho scritto un prompt per un corto gotico di 15 secondi, e ho inviato lo stesso pacchetto a entrambi i lati. Poi ho fissato il volto.
Punti chiave
- Solo H3 è chiamabile oggi — L'API di Seedance 2.5 è disponibile da ByteDance, ma ancora una pagina Day-0 su questa piattaforma.
- Le specifiche si separano nettamente: Seedance 2.5 = 30 secondi in un colpo solo, 4K nativo, fino a 50 riferimenti; H3 = 5–15 secondi, 2K, audio stereo su ogni clip.
- La stabilità del personaggio è un problema di confezionamento — un buon pacchetto di riferimenti, non un modello più grande, tiene il volto.
- Entrambi generano audio nativo; H3 fissa anche una voce da fino a tre riferimenti audio.
- Giudica i pixel per fotogramma, non i secondi — sullo stesso esecuzione, H3 ha restituito 1440p contro i 720p di Seedance.
Il risultato Seedance 2.5 vs MiniMax H3, prima di ogni teoria
Prima di ogni teoria, ecco cosa produce il flusso di lavoro. Queste sono quattro inquadrature estratte da un clip verticale finito di 15 secondi e affiancate. È l'esecuzione di riferimento H3 di MiniMax stesso costruita esattamente dal foglio del personaggio e dalla tavola della location che vedrai nel Passo 1 e Passo 2, a 1440x2560 nativi. Le mie esecuzioni dello stesso pacchetto arrivano più avanti, nel tutorial, con lo stato del playground visibile.
Lei raggiunge la porta intagliata, che è il pannello 4 della tavola della location, poi lo scontro nel corridoio, poi un primo piano stretto di lui, poi il due-inquadratura. La sua attaccatura dei capelli si divide allo stesso modo nel profilo e nel primo piano. La sua corona di trecce a metà altezza sopravvive a un primo piano del viso, che è esattamente dove la maggior parte dei modelli ricostruisce silenziosamente un volto. Il corpetto di pizzo color crema mantiene la stessa scollatura e polsino dalla prima all'ultima inquadratura.
Questo è tutto il test. Non trenta secondi. Quattro inquadrature e una mascella.
Perché Seedance 2.5 vs MiniMax H3 sono usciti la stessa settimana, e perché la maggior parte dei test di coerenza del personaggio sono inutili
MiniMax ha rilasciato H3 il 30 luglio, un modello video multimodale general-purpose che legge testo, immagini, video e audio come un unico contesto e restituisce clip da 5 a 15 secondi fino a 2K con audio stereo nativo. Può anche modificare filmati esistenti e trasferire movimento da un clip all'altro, e MiniMax ha detto che i pesi sarebbero seguiti entro pochi giorni (Reuters, luglio 2026).
Seedance 2.5 è atterrato nella stessa finestra con un numero più forte: 30 secondi in una singola generazione, 4K nativo, e fino a 50 input di riferimento multimodali in un unico lavoro (The Next Web, luglio 2026). La sua API è già nelle mani degli sviluppatori, con editing localizzato che ridisegna parte di un fotogramma lasciando intatte performance, illuminazione e comportamento della telecamera, riferimento-a-video che accetta piani green screen o blocchi 3D in bianco, undici lingue, e una modalità video lunga sperimentale che raggiunge 180 secondi (CineD, luglio 2026).
Il divario di attenzione è la parte interessante. Quasi ogni post che ho trovato era un clip di 2.5. Nel frattempo, i numeri dell'arena pubblica dicono qualcos'altro: sulla classifica image-to-video di Artificial Analysis, Seedance 2.0 a 720p guida con 1.196 Elo, Gemini Omni Flash segue con 1.195, e MiniMax H3 è già terzo a 1.185, a quattro giorni dal lancio. Seedance 2.5 non ha ancora una valutazione lì (Artificial Analysis, luglio 2026). Il modello con meno chiacchiere è quello con il rapporto più alto tra punteggio e attenzione.
Ora la parte che decide realmente il tuo output, perché non ha quasi nulla a che fare con quale logo scegli.
La maggior parte dei test di coerenza del personaggio fallisce prima ancora che il modello sia coinvolto. Quattro modalità di fallimento, e tutte e quattro sono tue da risolvere:
| Modalità di fallimento | Cosa vedi nell'output | La soluzione |
|---|---|---|
| Riferimenti multivista inviati come file separati | Il volto di ogni inquadratura è "quasi giusto" e nessuno concorda | Componi le viste in un'unica immagine, poi assegna i ruoli nel prompt ("l'uomo a SINISTRA", "la donna a DESTRA") |
| Riscrivere la descrizione del personaggio per ogni inquadratura | Abbigliamento e accessori cambiano da un'inquadratura all'altra | Scrivi il blocco identitario una volta e riutilizzalo alla lettera; solo telecamera e azione cambiano per inquadratura |
| Lasciare che l'illuminazione si muova con la scena | Il volto viene ricostruito strutturalmente nella nuova luce | Costruisci una tavola della location separata che blocchi direzione della luce, nebbia e riflesso del pavimento, e fornisci come riferimento |
| Trattare la durata massima come metrica di qualità | Una deriva entro 30 secondi uccide tutti i 30 | Taglia alla granularità che puoi rigenerare, poi parla di lunghezza |
Vuoi mettere Seedance 2.5 e MiniMax H3 di fronte allo stesso prompt tu stesso? Il confronto modelli di Atlas Cloud li esegue fianco a fianco in un unico passaggio — prompt e impostazioni identici, con il costo stimato prima di generare — così puoi giudicare volti, movimento e testo sullo schermo senza prenotare due test separati.

Seedance 2.5 e MiniMax H3 sul prompt identico nel confronto modelli di Atlas Cloud. Seedance 2.5 ha restituito 720p a $2.42; MiniMax H3 ha restituito 1440p per $1.12, ed entrambi i prezzi erano stimati prima dell'esecuzione. Catturato live sul model-explorer.
La prima riga è quella che la maggior parte delle persone sbaglia. Invia sei immagini a vista singola e il modello le tratta come sei candidati persone e le media. Invia un composito pulito e le tratta come una persona vista da tre lati. Stessi pixel, risultato completamente diverso.
Scheda tecnica Seedance 2.5 vs MiniMax H3, e cosa puoi realmente chiamare oggi
Separa capacità da disponibilità e la tensione diventa chiara. Sulla capacità grezza, Seedance 2.5 guida per durata, tetto di risoluzione, numero di riferimenti e granularità di editing. Sulla disponibilità, H3 è quello con tre endpoint live su una piattaforma modello general-purpose questa settimana. Se stai facendo un confronto di modelli video AI per la pianificazione 2026, quella seconda colonna conta tanto quanto la prima.
| MiniMax H3 | Seedance 2.5 | Seedance 2.0 Ref-to-Video (quello che ho eseguito) | |
|---|---|---|---|
| Durata massima, una generazione | da 5 a 15 s | fino a 30 s, senza stitching (modalità beta fino a 180 s, sperimentale) | menu clip brevi, vedi pagina modello |
| Risoluzione | 2K nativo, lato corto 1440p a 16:9 e 9:16; un livello 768p è elencato come in arrivo | 4K nativo, colore a 10 bit | fino a 720p su questo endpoint |
| Frame rate | 24 fps | non pubblicato separatamente | non pubblicato separatamente |
| Input di riferimento | 9 immagini + 3 video + 3 audio, 12 file totali | fino a 50 riferimenti multimodali | 9 immagini + 3 video + 3 audio |
| Audio nativo | sì, ogni output, stereo | sì, più 11 lingue di sottotitoli e voce | sì |
| Granularità di editing | modifiche di intero clip su istruzione (sostituisci personaggio, sfondo, illuminazione, dialogo) | modifiche a livello di regione che ridisegnano parte di un fotogramma | modifiche di intero clip su istruzione |
| Limite prompt | 7.000 caratteri | non pubblicato | non pubblicato |
| Pesi aperti | annunciato per pochi giorni dopo il lancio | non annunciato | non annunciato |
| Elo I2V di Artificial Analysis, 31 luglio 2026 | 1.185 (3°) | non ancora valutato | 1.196 (1°, voce Dreamina 720p) |
| Chiamabile sulla piattaforma che ho testato | sì, 3 endpoint | non ancora, pagina Day-0 | sì |
Divulgazione completa sulla configurazione del test. Seedance 2.5 non era aperto sulla mia piattaforma quando ho eseguito questo, quindi il lato Seedance è Seedance 2.0 Reference-to-Video, il membro attualmente in spedizione della stessa famiglia con lo stesso sistema di riferimento quad-modale. Dove 2.5 cambierebbe la risposta, lo dico. La pagina di Seedance 2.5 è per ora un avviso Day-0.
Tutto ciò che segue viene eseguito in una scheda del browser, su una chiave, tre modelli totali:
| Passo | Modello | Cosa produce | Impostazioni chiave | Cosa determina il costo |
|---|---|---|---|---|
| 1 | OpenAI GPT Image 2 Text-to-Image | il foglio di rotazione del personaggio | qualità alta, 16:9 | per immagine, pagamento a consumo, tariffa corrente sulla pagina del modello |
| 2 | stesso modello, seconda esecuzione | la tavola della location e dell'illuminazione a sei pannelli | qualità alta, 16:9 | per immagine, pagamento a consumo |
| 3 | MiniMax H3 Reference-to-Video | il clip 9:16 con audio nativo | 9:16, 2K, durata 5 per un test e 15 per il taglio reale | secondi x risoluzione, fatturato al secondo |
| 4 | Seedance 2.0 Reference-to-Video | l'esecuzione di controllo, input identici | 9:16, risoluzione massima disponibile, stessa durata | secondi x risoluzione, fatturato al secondo |
| 5 | H3 Reference-to-Video, clip come input | un'inquadratura fissa senza rigenerare tutto | stessa risoluzione, durata breve | secondi x risoluzione, fatturato al secondo |
H3 ha anche voci text-to-video e image-to-video se vuoi una baseline puramente testuale o un controllo primo-e-ultimo fotogramma.
Un'altra cosa da sapere prima di pianificare un batch: il testo sullo schermo. Questa sequenza titoli di 15 secondi di H3 mantiene i crediti in inglese attraverso otto tagli netti senza un solo errore di ortografia, che è una delle cose più difficili da mantenere stabile in un video generato.
Il flusso di lavoro per corti Seedance 2.5 vs MiniMax H3, passo dopo passo
Cinque passi. Copia i prompt esattamente come scritti, incluse le parti brutte. Non li ho ripuliti per l'articolo e non dovresti ripulirli per il modello.
Passo 1: Costruisci il foglio del personaggio con GPT Image 2
Crea il pacchetto di riferimento prima di fare qualsiasi video. Un'immagine, due personaggi, tre viste ciascuno, sfondo bianco puro senza giunture, illuminazione uniforme da studio. Questo rimuove ogni ambiguità tranne quella che ti interessa: che aspetto ha questa persona.
plaintext1A full-body character turnaround reference sheet on a pure white seamless background, two characters side by side, six figures total, even neutral studio lighting, no shadows on the floor, no text, no labels, no watermark. 2 3LEFT HALF, male lead, three views in a row: front, right profile, back. Late 20s, pale complexion, dark wavy medium-length hair, sharp jawline. Wearing a floor-length black velvet frock coat with subtle tone-on-tone embroidery on the lapels and cuffs, a black brocade waistcoat, a black silk cravat, straight black trousers, polished black leather derby shoes. Arms relaxed at his sides, neutral expression. 4 5RIGHT HALF, female lead, three views in a row: front, right profile, back. Early 20s, fair complexion, long wavy chestnut-brown hair with a half-up braided crown. Wearing a cream Victorian cotton-lace dress, long sleeves with lace cuffs, fitted bodice with small buttons, full ankle-length skirt, cream ankle-strap low-heel shoes. Arms relaxed at her sides, neutral expression. 6 7Photographic realism, consistent scale between all six figures, feet aligned on the same baseline, sharp focus edge to edge.
Impostazioni: modello OpenAI GPT Image 2 Text-to-Image, Qualità alta, Aspect ratio 16:9, tutto il resto predefinito.
GPT Image 2 Text-to-Image su Atlas Cloud, esecuzione completata: il prompt di rotazione a sinistra, sei figure su un foglio bianco nel pannello OUTPUT.
Questa è la forma target. Sei figure, una linea di base, niente nello sfondo su cui discutere:
Il pacchetto di riferimento che ha guidato il clip demo: protagonista maschile in velluto nero, protagonista femminile in pizzo vittoriano color crema, tre viste ciascuno, un file.
La mia esecuzione di GPT Image 2 del prompt del Passo 1, per confronto con il riferimento sopra.
Passo 2: Blocca la location con una tavola della scena a sei pannelli
Hai tenuto il volto. La luce ti tradirà ancora. La seconda immagine di riferimento fissa sei posizioni della telecamera, la direzione del chiaro di luna, quanta nebbia c'è nell'aria e quanto è bagnato il pavimento. Stai dicendo al modello che questo film ha esattamente un'impostazione di illuminazione.
plaintext1A six-panel cinematic location board, 2 rows by 3 columns, thin black gutters between panels, each panel captioned in small elegant white all-caps letterspaced type at the bottom of that panel. Subject: the interior of an abandoned gothic castle at night. Cold blue moonlight, drifting low fog, wet reflective stone floor, tall stained-glass windows, iron candle sconces with small warm flames, deep desaturated blacks, heavy velvet curtains. No people in any panel. 2 3Panel 1, caption "WIDE ESTABLISHING VIEW - CORRIDOR": a long pillared corridor receding to a lit stained-glass window. 4Panel 2, caption "LOW ANGLE - MOONLIGHT ACROSS FLOOR": low camera, a shaft of moonlight raking across wet flagstones. 5Panel 3, caption "DOORWAY & STAIRCASE COMPOSITION": an arched doorway framing a curved stone staircase. 6Panel 4, caption "CLOSE DETAIL - CARVED DOOR": tight shot of a heavy carved wooden door with an iron handle. 7Panel 5, caption "WINDOW-SIDE VIEW - FOG & CURTAINS": tall window, fog rolling in, curtain edge in foreground. 8Panel 6, caption "FINAL POSTER FRAME - EMPTY HALL": symmetrical empty hall, patterned runner rug leading to the window. 9 10Photographic, cinematic, film grain, consistent colour grade across all six panels.
Impostazioni: stesso modello, Qualità alta, Aspect ratio 16:9.
La tavola della location che ha guidato il clip demo: sei interni di castello gotico, una gradazione cromatica, didascalie leggibili.
La mia esecuzione di GPT Image 2 del prompt della tavola del Passo 2.
Passo 3: Genera l'inquadratura con MiniMax H3 reference-to-video
Due immagini di riferimento più un prompt che trasporta le posizioni della telecamera e la direzione audio. Il suono è prodotto nello stesso passaggio, quindi non c'è un passo separato per voce o colonna sonora. Mantieni la durata breve mentre regoli, poi spingi a 15 per il taglio reale.
plaintext1Reference image 1 is the character sheet: the man on the LEFT is the male lead, the woman on the RIGHT is the female lead. Keep both identities exactly as shown: his jawline, dark wavy hair, black velvet frock coat, black brocade waistcoat and black silk cravat; her chestnut half-up braided hair and cream Victorian lace dress. Reference image 2 is the location and lighting board: match its cold blue moonlight, drifting fog, wet reflective stone floor and desaturated black tones. 2 39:16 vertical, premium live-action short-drama look, shallow depth of field, cinematic contrast, no subtitles, no on-screen text, no watermark. 4 5Shot 1: Medium close-up, camera slowly pushing in. The female lead stands in the moonlit corridor, breathing shallow, eyes fixed on something off-frame right. Fog moves past her at knee height. 6Shot 2: Hard cut. Over-the-shoulder from behind her, the male lead steps out of the dark archway into the moonlight, coat catching the light, expression cold and curious. 7Shot 3: Tight close-up on his face, half-lit by the window, then a matching close-up on hers as she refuses to look away. 8 9Audio: low sustained bass drone, distant stone echo, her unsteady breath, one heavy footfall as he steps into the light, a single soft string swell on the last cut.
Impostazioni: modello MiniMax H3 Reference-to-Video, Risoluzione 2K, Durata 8 (il valore predefinito del cursore; spingi a 15 per il taglio reale), Aspect Ratio adattivo, ed entrambi i file in Materiali di Riferimento. Il pannello li conta come 2 di 9, quindi hai molto spazio per aggiungere piastre di guardaroba o oggetti di scena in seguito.
Vale la pena notare cosa è successo con il rapporto. Ho lasciato Aspect Ratio su adattivo e ho scritto solo "9:16 vertical" all'interno del prompt. H3 è comunque tornato verticale, quindi ha letto l'inquadratura dal testo invece di aver bisogno del campo del modulo.
MiniMax H3 Reference-to-Video su Atlas Cloud, esecuzione completata: entrambi i file di riferimento caricati come 2 di 9, risoluzione 2K, e il clip verticale generato in riproduzione nel pannello OUTPUT.
Il primo fotogramma è la protagonista femminile nel corpetto di pizzo color crema, in piedi nel corridoio del pannello 1 della tavola, con nebbia all'altezza del ginocchio e il chiaro di luna che colpisce il pavimento bagnato esattamente dove la tavola lo aveva posizionato. Entrambe le immagini di riferimento sono atterrate.
Passo 4: Esegui il controllo Seedance 2.5 vs MiniMax H3 con il pacchetto identico
Non cambiare una parola. Stesse due immagini di riferimento, stesso prompt, modello diverso. Ho lasciato il valore predefinito di durata di ogni pagina da solo invece di forzare una corrispondenza, e dico cosa ha restituito ciascuno qui sotto. Riformulare un prompt "per" l'altro modello è esattamente come i confronti iniziano a mentire.
plaintext1Same prompt as Step 3, verbatim. Do not re-word it for the other model.
Impostazioni: modello Seedance 2.0 Reference-to-Video, Risoluzione 720p, stesse due immagini di riferimento in Immagini di Riferimento (di nuovo 2 di 9, con slot separati per fino a 3 video di riferimento e 3 file audio di riferimento). Durata lasciata al valore predefinito della pagina, che è tornato come un clip di 10 secondi.
Seedance 2.0 Reference-to-Video su Atlas Cloud, esecuzione completata con il pacchetto di riferimento e il prompt identici del Passo 3, e un risultato di 10 secondi nel pannello OUTPUT.
Ecco cosa hanno mostrato effettivamente i due pannelli OUTPUT, e lo riporto in modo piatto senza scegliere un vincitore.
Entrambe le esecuzioni hanno tenuto il personaggio. Stesso vestito di pizzo color crema con la stessa scollatura e polsini, stessi capelli castani, stesso corridoio di nebbia e chiaro di luna preso dalla tavola. Nessuno dei due ha inventato una donna diversa. Il pacchetto di riferimento ha fatto quel lavoro su entrambi i lati, che è il risultato che mi interessa di più.
Le differenze riguardavano la forma, non il volto. Questo endpoint di Seedance ha fornito 720p; H3 ha fornito 2K da input identici. E la differenza di inquadratura: H3 ha letto "9:16 vertical" direttamente dal testo del prompt e ha restituito verticale, mentre l'esecuzione di Seedance è tornata 16:9 perché quella pagina porta il proprio controllo del rapporto d'aspetto e il testo del prompt da solo non lo ha sovrascritto. Se stai tagliando per TikTok, quella differenza ti costerà un'esecuzione la prima volta che dimentichi il campo del modulo. Seedance 2.5 cambierebbe probabilmente la metà della risoluzione e aggiungerebbe rigenerazioni a livello di regione, e non farò finta di averlo misurato.
Passo 5: Correggi un'inquadratura senza rigenerare l'intero clip
Il costo reale di un corto non è la generazione uno. È la revisione sette. H3 accetta un clip esistente come input e modifica seguendo le istruzioni, mantenendo ciò che non hai menzionato. La proposta di Seedance 2.5 qui è più fine: ridisegna una regione del fotogramma e lascia intatte performance, illuminazione e telecamera.
plaintext1Using the supplied clip: keep the two characters, their wardrobe, the camera moves and the cutting rhythm exactly as they are. Change only the environment, replace the moonlit stone corridor with the same castle's ballroom, tall arched windows, a lit chandelier, and warm candlelight, and re-light both characters so their key light comes from the chandelier at frame left instead of the window. Rewrite her only spoken line to "You were never asleep, were you." Keep her performance timing on the same beats.
Impostazioni: MiniMax H3 Reference-to-Video con il clip del Passo 3 come input di riferimento, Durata 5, Risoluzione 2K.
Oltre il test Seedance 2.5 vs MiniMax H3: Quattro modi per spingere un pacchetto di riferimento
Stesso personaggio, prossimo episodio. Salva il foglio del Passo 1 come risorsa e cambia solo l'elenco delle inquadrature e il blocco della storia nel prompt. L'identità viene da un file, non dalla tua memoria di come l'hai formulato martedì scorso.
Fissa anche la voce. H3 accetta fino a tre riferimenti audio, da 2 a 15 secondi ciascuno, e devono accompagnare un input immagine o video. Dagli un campione vocale e il personaggio parla in quel timbro, così non devi rimpiazzare un doppiatore tra gli episodi.
Blocca la telecamera prima di pagare per il render. Il reference-to-video di Seedance 2.5 accetta blocchi 3D in bianco e piani green screen, così puoi fissare l'inquadratura su geometria grigia e solo dopo impegnarti in un aspetto finito. Questo esempio è stato eseguito su Seedance 2.1, un membro precedente della famiglia, ma la forma del flusso di lavoro è la stessa.
Localizza un taglio master invece di rigirarlo. La sostituzione a livello di regione scambia un volto, un prodotto o una lingua parlata mentre telecamera, tempismo e durata delle labbra rimangono fermi. Qui un taglio master di bellezza viene rimpiazzato e re-vocalizzato per spagnolo, coreano e hindi, con la stanza, l'inquadratura e la durata delle labbra tenute al loro posto.
E perché qualcuno chiederà come appare il trasferimento di movimento quando smetti di essere ragionevole: tre uomini in abiti, sostituiti da tre capibara fotorealistici, che seguono il percorso di movimento del clip originale battuta per battuta finché non si impilano in una piramide.
C'è anche la versione semplice di tutto questo, quella che nessuno pubblica: un poster statico diventa un poster animato, e il layout sopravvive.
Il poster statico originale. Forniscilo a reference-to-video con "mantieni la cornice, la tavolozza e il layout, anima il testo" e ottieni una versione animata dello stesso design.
Quanto ti costa realmente un cortometraggio Seedance 2.5 vs MiniMax H3
Niente numeri qui, perché i numeri si muovono e la struttura no. Entrambe le famiglie fatturano al secondo, pagamento a consumo, senza abbonamento. Questo lascia tre variabili: secondi, livello di risoluzione e rigenerazioni.
La terza è l'intero conto. Un clip di 15 secondi che atterra al primo tentativo è un addebito. Lo stesso clip al settimo tentativo è sette. Quindi la mossa per risparmiare denaro non è scegliere il modello più economico al secondo, ma ottenere il pacchetto di riferimento giusto prima di generare qualsiasi cosa. Quelle due chiamate di immagine nei Passi 1 e 2 sono la linea più economica dell'intera pipeline e quella che decide quante chiamate video farai. Il ritorno sull'investimento più alto in tutta la catena, di gran lunga.
Poi correggi l'istinto al secondo. Stesso pacchetto di riferimento, stesso tempo di esecuzione: il reference-to-video di H3 restituisce 1440p, questo endpoint reference-to-video di Seedance restituisce 720p. Al secondo è l'unità sbagliata. Pixel per fotogramma, e se poi devi pagare per un passaggio di upscale separato, è quella giusta.
L'audio appartiene anche all'aritmetica. Entrambi i lati producono suono sincronizzato nativo nello stesso passaggio. Se la tua pipeline attuale è modello video + TTS + un editor che allinea le tracce, ciò che risparmi sono due chiamate API e un pomeriggio di una persona, e quel risparmio non compare in nessun listino prezzi da nessuna parte.
Quale modello per quale lavoro:
| Lavoro | Scegli | Perché | Avvertenza |
|---|---|---|---|
| Corto verticale, 9:16, TikTok o ReelShort | MiniMax H3 | 1440p verticale con stereo nativo, chiamabile ora, 15 s sono un gancio completo | tagli a 15 s, quindi pianifica le battute di conseguenza |
| Film di marca continuo di 30 secondi | Seedance 2.5 | singola generazione, senza stitching, 4K nativo | verifica prima la disponibilità sulla tua piattaforma |
| Correggere un'inquadratura all'interno di un taglio approvato | Seedance 2.5 | ridisegno a livello di regione lascia il resto intatto | H3 con modifica di intero clip ti porta già gran parte della strada oggi |
| Tagli per prodotti e e-commerce | entrambi | entrambi tengono bene testo sullo schermo e marchi | verifica il testo alla risoluzione che spedisci |
| Demo di giochi o interfacce | MiniMax H3 | stabilità di UI e tipografia a 2K è forte | limite di 15 s per un singolo passaggio |
| Versioni multilingua di un master | Seedance 2.5 | sostituzione di regione più voce multilingua | la qualità di localizzazione richiede ancora un controllo madrelingua |
| Spedire stasera | MiniMax H3 | tre endpoint live, più tutto Seedance 2.0 | l'accesso a Seedance 2.5 varia in base alla piattaforma |
Prima di spedire. MiniMax ha detto che i pesi di H3 sarebbero seguiti entro pochi giorni dal lancio, e pesi aperti non sono la stessa cosa di una licenza commerciale, quindi leggi i termini prima di self-hostare. La politica di filigrana e uso commerciale differisce anche tra app consumer e accesso API su entrambi i lati, e non ho potuto confermare nessuna delle due da una pagina dei termini primaria mentre scrivevo, quindi verifica i termini del fornitore invece di prendere la mia parola per buona. E niente in nessuna licenza di modello copre somiglianza o marchio. Se una persona reale, un marchio reale o la proprietà intellettuale di qualcun altro è nel tuo pacchetto di riferimento, questa è una questione legale separata e i termini del modello non la risponderanno.
Ogni modello nelle tabelle sopra viene eseguito sulla stessa chiave, e le pagine dei modelli portano le tariffe correnti più codice copia-incolla, incluse le eventuali promozioni in corso sulla linea Seedance questa settimana.
Domande frequenti
Seedance 2.5 è migliore di MiniMax H3 per la coerenza del personaggio?
Sulla carta dovrebbe esserlo, con fino a 50 riferimenti multimodali contro i 12 file di H3, più le rigenerazioni a livello di regione. Ma al 31 luglio 2026 non c'è un test pubblico abbinato a cui possa fare riferimento, e Seedance 2.5 non ha ancora una valutazione nell'arena. Nelle esecuzioni che ho potuto effettivamente fare, la variabile che decideva la stabilità dell'identità era la struttura del pacchetto di riferimento, non la generazione del modello: con un foglio di rotazione composito più una tavola di illuminazione, entrambi i lati hanno tenuto il personaggio. Prepara il pacchetto giusto prima di perdere tempo a confrontare modelli.
Posso usare Seedance 2.5 subito, o devo aspettare?
La sua API è live presso ByteDance. La disponibilità su piattaforme di modelli di terze parti è disomogenea, e su quella che ho testato è ancora un avviso Day-0. Se hai bisogno di output stasera, le opzioni chiamabili sono i tre endpoint di MiniMax H3 e l'intera linea Seedance 2.0 in spedizione.
MiniMax H3 fa davvero video di 30 secondi?
No. La specifica è da 5 a 15 secondi per generazione a 24 fps. Qualsiasi cosa più lunga è estensione o stitching, che è una cosa diversa con un diverso rischio di deriva. La generazione singola di 30 secondi appartiene a Seedance 2.5. Non confondere le due affermazioni.
Entrambi i modelli generano audio, e posso mantenere una voce attraverso gli episodi?
Entrambi producono audio sincronizzato nativo nello stesso passaggio, e H3 emette stereo su ogni risultato. Per una voce persistente, H3 accetta fino a tre riferimenti audio da 2 a 15 secondi ciascuno, che devono essere inviati insieme a un input immagine o video, non da soli.
Quante immagini di riferimento dovrei inviare effettivamente?
Meno di quanto pensi, strutturate meglio di quanto pensi. Un composito ben composto generalmente batte sei ritagli sciolti, perché file separati invitano il modello a mediarli in una persona che non esiste. Dagli due lavori chiari, identità e illuminazione, e non includere campioni di stile che si combattono a vicenda.
Quale modello dovrei usare per corti verticali stile TikTok o ReelShort?
In spedizione questa settimana, in 9:16, ad alta risoluzione con suono già mixato: MiniMax H3. Pianificare una scena continua di 30 secondi in cui prevedi di rigenerare singole regioni invece di interi clip: preparati per Seedance 2.5 e controlla quando la tua piattaforma lo apre.






