Per tutta l'estate il mio feed è stato lo stesso video in loop. Giocatori dei Mondiali ridisegnati come protagonisti shonen. Un dittatore. Un capitano pirata. Un mentore segnato che compare negli ultimi quattro secondi. Milioni di visualizzazioni per post, e la storia si aggiorna dopo quasi ogni partita.
Nessuno di quelli che li creano scrive post di benchmark. Scelgono un modello, bruciano crediti e pubblicano prima del calcio d'inizio successivo.
Così ho preso un keyframe anime e un prompt, e ho testato MiniMax H3 come generatore video anime contro Veo 3.1, entrambi spinti al massimo delle loro impostazioni su input identici.
La prima cosa che si è rotta non è stata la qualità dell'immagine. È stato un menu a tendina. Veo 3.1 si ferma a 8 secondi e offre esattamente due rapporti d'aspetto. Un'inquadratura che tiene su un volto, una whip pan con la palla, poi lascia atterrare una title card non sta in 8 secondi. Non ha mai avuto la possibilità di fallire sulla qualità.
Punti chiave
- L'enumerazione
durationdi Veo 3.1 è[4, 6, 8]e la sua enumerazioneaspect_ratioè[16:9, 9:16]. MiniMax H3 esegue qualsiasi secondo intero da 4 a 15 e offre21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Nessun 4:3 su Veo significa nessuna possibilità di inquadratura OVA retrò. - La scheda tecnica di H3 elenca 11 lingue di dialogo native stabili e il giapponese è una di queste. Audio e immagini sono generati insieme a 32 kHz stereo, non doppiati in seguito.
- I pacchetti di riferimento non sono simili: H3 accetta fino a 9 immagini più fino a 3 video e 3 clip audio (12 file massimo). L'endpoint di riferimento di Veo 3.1 accetta 3 immagini e, nel momento in cui lo usi,
durationsi riduce a solo[8]. - Due trappole che rovinano silenziosamente i test: l'API di Veo imposta
generate_audiosufalseeresolutionsu720pdi default, mentre il rapporto di default di H3 per text-to-video è1:1. Se li lasci così, stai confrontando una clip 720p muta con una clip quadrata. - Veo 3.1 mantiene due cose che H3 non ha affatto:
seedenegative_prompt. Per l'anime 2D, quest'ultimo è davvero importante e mostrerò dove.
MiniMax H3 Anime Video Generator vs Veo 3.1, Lo Stesso Fotogramma Uno Dopo l'Altro
Un personaggio originale. Un keyframe. Un prompt, copiato carattere per carattere in entrambi i modelli. Tutto il resto al massimo su ciascun lato.
MiniMax H3, image-to-video, 2K, 8 secondi, audio nativo. Alza il volume: il brusio della folla, il colpo alla palla e il grido in giapponese sono generati nello stesso passaggio dell'immagine. Generato con minimax/h3/image-to-video su Atlas Cloud.
Veo 3.1, image-to-video, 1080p, 8 secondi, generateaudio attivato manualmente, più un negativeprompt che mantiene il tratto piatto. Stesso primo fotogramma, stesse parole. Generato con google/veo3.1/image-to-video su Atlas Cloud.
Entrambi disegnano magnificamente. L'inquadratura ampia di Veo del tiro, con linee d'impatto disegnate a mano e un effetto sonoro manga che fluttua nell'aria, è davvero piacevole. Questo è il punto di partenza onesto, ed è il motivo per cui il resto di questo articolo riguarda parametri e aderenza alle istruzioni piuttosto che sensazioni.
Perché la Maggior Parte dei Test MiniMax H3 Anime Video Generator vs Veo 3.1 Sono Sbagliati
Due cose sono successe contemporaneamente quest'estate.
L'anime è diventato il formato con il volume più alto nel video AI. La Coppa del Mondo 2026 è stata riscritta come un torneo shonen, con giocatori interpretati come un dittatore, un capitano pirata, un generale della marina e un mentore, e storie che "si evolvono dopo quasi ogni partita" su TikTok, Instagram, X e YouTube (Complex, luglio 2026).
E MiniMax H3 è stato rilasciato con pesi aperti. Il thread di ComfyUI del giorno 0 ha raggiunto 330 punti e 95 commenti, con persone che pubblicavano numeri locali reali nel giro di ore (Hacker News, agosto 2026).
Mettendo insieme queste cose, ci si aspetterebbe un mucchio di confronti anime. Non ce ne sono quasi, perché la maggior parte dei test vengono costruiti male in uno dei quattro modi seguenti.
Confrontano immagini, non vincoli. Le inquadrature anime riguardano il tempismo. Una whip pan in una title card è un problema di durata prima di essere un problema di rendering.
Si dimenticano che l'API di Veo è muta di default. Nell'API, generate_audio è false e resolution è 720p. Molti post "Veo non ha audio nell'anime" sono solo qualcuno che non ha mai attivato un booleano.
Si dimenticano che il text-to-video di H3 è quadrato di default. ratio predefinito è 1:1, non 16:9. Eseguire un prompt anime t2v senza impostarlo ti dà una clip quadrata e una conclusione confusa.
Testano con prompt fotorealistici. "Cinematografico, luce volumetrica, profondità di campo ridotta" è esattamente il vocabolario che trascina un modello 2D verso l'ombreggiatura 3D. Il modo di fallire nell'anime non è la sfocatura. È la plastica.
Le tre impostazioni che decidono un test anime prima di premere Esegui
Prima di tutto, imposta queste su entrambi i lati, altrimenti il confronto è nullo.
| Impostazione | MiniMax H3 | Veo 3.1 | Cosa succede se la salti |
|---|---|---|---|
| Audio | Generato insieme all'immagine, sempre acceso | generate_audio predefinito false | Veo restituisce una clip muta e sembra peggiore di quanto sia |
| Forma del fotogramma | ratio predefinito 1:1 su text-to-video | aspect_ratio predefinito 16:9 | H3 ti dà un ritaglio anime quadrato che non puoi usare |
| Risoluzione | predefinita 2K | predefinita 720p | Confronti 2K contro 720p e lo chiami divario di qualità |
Vuoi testare MiniMax H3 e Veo 3.1 sullo stesso prompt anime? Il confronto modelli di Atlas Cloud li esegue fianco a fianco in un unico passaggio — stessi prompt e impostazioni, costo mostrato prima di generare.

MiniMax H3 e Veo 3.1 sullo stesso prompt anime nel confronto modelli di Atlas Cloud — stesse impostazioni, prezzo mostrato prima di generare. Catturato live su model-explorer.
La Scheda Tecnica MiniMax H3 vs Veo 3.1 per Anime: Durata, Rapporto, Audio, Riferimenti
Ho estratto gli schemi di input live di entrambi i modelli anziché fidarmi di qualsiasi post di lancio. Ogni valore qui sotto è un'enumerazione che puoi leggere tu stesso sulle pagine dei modelli, non un'impressione.
Tabella 1: MiniMax H3 vs Veo 3.1, i parametri che decidono un'inquadratura anime
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Durata | Da 4 a 15, ogni secondo intero (default 8) | 4, 6, 8 (default 8) |
| Rapporti d'aspetto | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Rapporto predefinito (text-to-video) | 1:01 | 16:09 |
| Risoluzione | 768P, 2K (default 2K) | 720p, 1080p, 4k (default 720p) |
| Audio | Generato congiuntamente, 32 kHz stereo | generate_audio, default false |
| Lingue di dialogo native | 11 stabili, giapponese incluso | Non pubblicato come elenco stabile |
| Pacchetto di riferimento | fino a 9 immagini, 3 video, 3 clip audio, 12 file totali | 3 immagini |
| Durata quando si usano riferimenti | ancora da 4 a 15 | si riduce a solo 8 |
| seed | non disponibile | disponibile |
| negative_prompt | non disponibile | disponibile |
| Pesi | scaricabili | chiusi |
Durata, rapporto, risoluzione, audio e limiti di riferimento sono letti dagli schemi live sulle pagine MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video e Veo 3.1 reference-to-video. Il tetto di 9 immagini e 12 file e l'elenco delle 11 lingue di dialogo provengono dalla scheda tecnica MiniMax H3 (Hugging Face, agosto 2026).
Ora le classifiche, perché dicono qualcosa di diverso dalla scheda tecnica ed entrambe contano.
Tabella 2: Elo del voto popolare e prezzo al minuto, istantanea del 7 agosto 2026
| Modello | Text-to-video (con audio) | Image-to-video (con audio) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1.244 (#1) ±7 | 1.191 (#2) ±9 | $6,00 |
| MiniMax H3 | 1.238 (#2) ±9 | 1.190 (#3) ±10 | $7,80 |
| Dreamina Seedance 2.0 720p | 1.224 (#3) ±6 | 1.198 (#1) ±7 | $9,07 |
| Kling 3.0 1080p (Pro) | 1.111 (#7) ±6 | non nella top 10 | $20,16 |
| Veo 3.1 | 1.093 (#11) ±7 | 1.085 (#10) ±7 | $24,00 |
| Veo 3.1 Fast | 1.091 (#14) ±6 | non nella top 10 | $9,00 |
| Veo 3.1 Lite | 1.089 (#15) ±7 | non nella top 10 | $4,80 |
I dati Elo e prezzo provengono dall'Artificial Analysis Video Arena (Artificial Analysis, agosto 2026). Sono voti popolari mobili e si spostano. La colonna $/min è una stima normalizzata del modello, non la tua fattura.
Un divario Elo di 145 punti è grande, ma è un voto generico, non un voto anime. E c'è una parte che devo dire chiaramente: MiniMax non commercializza H3 come modello anime. Il feedback interno di prima linea elenca film, animazione e commedia-drammatica come aree a cui H3 non è destinato. Quindi la domanda interessante non è "quale è il modello anime". È perché il modello che non si vende come anime vince comunque l'inquadratura, e dove Google vince ancora il round.
Una nota pratica prima del tutorial. Ogni modello qui sotto viene eseguito attraverso la stessa console e la stessa chiave API, che è l'unico motivo per cui i parametri sono confrontabili. Stessa coda, stessa autenticazione, un'unica fattura. Se imposti GPT Image 2 su un servizio e Veo su un altro, metà delle differenze che trovi saranno infrastrutturali piuttosto che del modello.
Costruisci l'Inquadratura: MiniMax H3 vs Veo 3.1, Passo Dopo Passo
Un esempio continuo, dall'inizio alla fine. "Last Whistle": un'attaccante adolescente originale, capelli rossi, maglia numero 9 bianca e blu, riflettori, una whip pan sul tiro e una title card in giapponese che deve atterrare negli ultimi due secondi e rimanere ferma.
Niente giocatore reale, niente personaggio ufficiale, niente IP anime esistente. Solo stile e omaggio. Più avanti spiegherò perché.
Passo 1: Progetta il keyframe anime con GPT Image 2
Il keyframe porta la direzione artistica in modo che il modello video non debba inventarla. Nota lo spazio negativo sul terzo sinistro: è intenzionale. La title card viene scritta lì dal modello video, e questo è il test di stabilità del testo.
Plain1Un singolo fotogramma da un anime sportivo shonen moderno. Animazione 2D cel-shaded, linee 2a inchiostro disegnate a mano con spessore consistente, riempimenti di colore piatti, 3ombre grafiche nette, assolutamente nessuna ombreggiatura 3D e nessuna pelle fotorealistica. 4Primo piano su un'attaccante adolescente originale: capelli rosso scuro spettinati, maglia 5bianca e blu con il numero 9, sudore e strisce d'erba su una guancia, occhi spalancati con 6determinazione stanca, bocca aperta mentre urla. Dietro di lei, i riflettori dello stadio 7brillano in un muro di colore della folla sfocato; linee di velocità radiali scoppiano dal 8centro dell'inquadratura; un filo d'erba rimane sospeso in aria. Tavolozza satura, ombre 9ciano profonde, luce di bordo arancione calda. Composizione 16:9, il personaggio inquadrato 10a destra del centro, spazio negativo pulito sul terzo sinistro. Nessun testo da nessuna 11parte nell'immagine.
Impostazioni: modello openai/gpt-image-2/text-to-image, qualità high, dimensione 16:9 (2048x1152). Nient'altro.

Playground GPT Image 2 su Atlas Cloud con il prompt del keyframe Last Whistle e il fotogramma anime finito nel pannello di output
GPT Image 2 su Atlas Cloud: qualità impostata su high, il keyframe finito a destra.

Il keyframe anime di base: un'attaccante dai capelli rossi originale mentre urla sotto i riflettori dello stadio, cel-shaded con colore piatto e linee di velocità
Il keyframe che entrambi i modelli ricevono. Colore piatto, ombre dure e un terzo sinistro vuoto in attesa di una title card.
Passo 2: MiniMax H3 image-to-video, tutto al massimo
Stessa immagine in input, 2K in output. Ho tenuto H3 a 8 secondi solo per eguagliare il limite di Veo. Non è il limite di H3 e il Passo 4 toglie il tappo.
Plain1Anime 2D cel-shaded, spessore di linea a inchiostro disegnato a mano, colore piatto, nessuna 2ombreggiatura 3D. Mantieni il volto dell'attaccante per un istante, poi una violenta whip pan 3segue la palla mentre la colpisce, la pan sfuma l'inquadratura in scie di motion blur sakuga. 4Un fotogramma di silenzio totale all'impatto. Negli ultimi due secondi, una title card in 5giapponese in grassetto bianco che recita ラストホイッスル appare sul terzo sinistro 6dell'inquadratura e rimane fermissima, senza deformazioni, senza sfarfallio, senza deriva. 7L'attaccante urla una frase in giapponese: 「まだ終わってない!」 8Audio: ruggito dello stadio che cresce, un singolo impatto netto del colpo alla palla, un 9colpo di taiko basso sotto la title card.
Impostazioni: modello minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video prende la forma del fotogramma dall'immagine di input), image = output del Passo 1.
Un avvertimento se invece passi al text-to-video: scrivi esplicitamente ratio: 16:9. Il valore predefinito è 1:1 e ti darà volentieri un ritaglio anime quadrato.

Playground MiniMax H3 image-to-video su Atlas Cloud con il prompt Last Whistle, keyframe caricato e la clip finita nel pannello di output
MiniMax H3 image-to-video su Atlas Cloud: il keyframe del Passo 1 caricato a sinistra, la clip finita che viene riprodotta a destra.
Passo 3: Veo 3.1 image-to-video, audio attivato manualmente
Il prompt è identico, parola per parola. Cambiare un singolo aggettivo significa che non è più un confronto. Ciò che cambia è il campo extra che Veo ti dà e H3 no.
negative_prompt, che per l'anime 2D è il controllo più utile di questa lista:
Plain13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
Impostazioni: modello google/veo3.1/image-to-video, resolution: 1080p (cambialo, il default è 720p), duration: 8 (questo è il limite), aspect_ratio: 16:9, generate_audio: true (il default API è false, questa è la trappola della clip muta), seed: 20260807, image = stesso output del Passo 1.

Playground Veo 3.1 image-to-video su Atlas Cloud che mostra generate audio abilitato, il keyframe anime caricato e la clip finita nel pannello di output
Veo 3.1 image-to-video su Atlas Cloud, con Generate Audio attivato e la clip finita a destra.
Passo 4: Valutalo su cinque assi specifici per anime
Niente da generare qui. Basta guardare, sulle cose su cui l'anime si rompe davvero. Entrambe le clip sono incorporate all'inizio di questo articolo, quindi puoi valutarle tu stesso invece di credermi sulla parola.

Confronto affiancato dell'ultimo fotogramma di entrambe le clip, MiniMax H3 a sinistra con la scritta giapponese pulita, Veo 3.1 a destra con caratteri verticali distorti
L'ultimo fotogramma di ogni clip. A sinistra, H3 ha scritto ラストホイッスル, tutti e otto i katakana corretti e fermi. A destra, Veo 3.1 ha scritto tre caratteri che non sono la parola richiesta e non ne formano una.
La title card è dove il round è stato deciso, e non è stato nemmeno vicino. H3 ha reso esattamente i katakana richiesti, netti e stabili, su una pan sfocata della porta. Veo 3.1 ha prodotto una pila verticale di tre caratteri che non sono né la parola richiesta né una parola. Nello stesso fotogramma ha anche fatto uscire il personaggio dall'inquadratura e ha lasciato che lo sfondo scivolasse verso un fondale da stadio semi-fotorealistico, nonostante photorealistic skin e 3D render fossero nel prompt negativo.
Tabella 3: cinque assi che decidono un taglio anime, da queste due esecuzioni
| Asse | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Continuità del personaggio dal keyframe | Ha mantenuto l'esatto volto, capelli e maglia per tutti gli 8 secondi | Ha ridisegnato il personaggio in una nuova inquadratura ampia, in modello ma un disegno diverso |
| Spessore di linea e ombreggiatura cel piatta | Mantenuto, nessuna deriva verso il 3D | Mantenuto nell'inquadratura media, scivolato verso un fondale fotografico da stadio alla fine |
| Title card giapponese | ラストホイッスル reso correttamente e tenuto fermo | Tre caratteri, non la parola richiesta, non una parola |
| Traccia audio fornita | 32 kHz stereo, esattamente come dichiara la scheda tecnica | 48 kHz stereo, presente solo perché ho impostato io generate_audio |
| Whip pan e scia sakuga | Eseguita come una pan sfocata nella title card | Sostituita con un taglio netto a una nuova inquadratura |
L'ultima riga è la critica pubblica più forte a H3 finora, che è esattamente il motivo per cui l'ho scritta in entrambi i prompt. Nel thread di ComfyUI del giorno 0, l'utente fwip si è lamentato che anche i prompt demo ufficiali venivano ignorati: "una violenta WHIP PAN dal tetto che SFOCCA le parole fluttuanti via con sé, striato di motion. E il video non ha fatto affatto quella transizione, l'ha semplicemente sostituita con un taglio."
In questa esecuzione è stato Veo a scambiare la pan con un taglio, e H3 a sfumare. Una ripresa ciascuno non è un verdetto, e non direi il contrario. Ma significa che la critica non è specifica di H3: le whip pan sono l'istruzione meno affidabile in tutto questo test, da entrambe le parti. Se il tuo storyboard dipende da una, costruisci lo storyboard intorno ad essa piuttosto che attraverso di essa.
Passo 5: Il taglio OVA retrò 4:3 che Veo 3.1 strutturalmente non può produrre
Non è una preferenza di qualità. È un muro. L'enumerazione aspect_ratio di Veo ha due valori e nessuno è 4:3, e la sua enumerazione duration non ha 12. L'aspetto OVA degli anni '90 è semplicemente irraggiungibile.
Plain1Un taglio anime OVA degli anni '90, 4:3 full-frame. Fondali dipinti a mano con texture 2visibile del pennello, personaggi dipinti su cell con linee di inchiostro spesse e 3irregolari, alone di halation pesante intorno ai riflettori, grana cinematografica 16mm 4e leggero sfarfallio del fotogramma. La stessa attaccante dai capelli rossi in maglia 5numero 9 bianca e blu cammina fuori da un campo inzuppato di pioggia mentre il rumore 6della folla svanisce in un unico tono persistente. La telecamera si avvicina lentamente 7al suo volto. Dice a bassa voce in giapponese: 「次は、勝つ」. Tavolozza retrò: verde 8acqua tenue, ambra polverosa, ombre marrone scuro. Audio: pioggia lontana, un pad 9analogico solitario, un fischio con molto riverbero in lontananza.
Impostazioni: modello minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Imposta quel rapporto manualmente, ricorda il default.

Playground MiniMax H3 text-to-video su Atlas Cloud con il prompt OVA digitato e la clip retrò finita nel pannello di output
MiniMax H3 text-to-video su Atlas Cloud, prompt OVA digitato, clip completata. Piena divulgazione: questa particolare esecuzione ha lasciato Aspect Ratio a 16:9 e Duration a 8, quindi ciò che vedi a destra è la versione corta widescreen. Il taglio 4:3 di dodici secondi qui sotto è arrivato dalla chiamata API con ratio: 4:3 e duration: 12 impostati esplicitamente.

Il taglio OVA retrò 4:3: la stessa attaccante che cammina fuori da un campo inzuppato di pioggia in stile anime anni '90
H3 text-to-video, 4:3, 12 secondi. Il file consegnato è tornato 1920x1440, che è 4:3 al pixel, con una traccia stereo 32 kHz. Mostrato qui come GIF muta a frame rate ridotto per mantenere la pagina leggera. Generato con minimax/h3/text-to-video su Atlas Cloud.
Passo 6: Nove immagini di riferimento, un personaggio, quattro tagli
La coerenza del personaggio tra inquadrature diverse è il problema più difficile nell'anime AI, e si risolve con il volume di riferimento. Costruisci prima il pacchetto: riesegui il prompt del Passo 1 con l'inquadratura cambiata per fronte, tre quarti, profilo intero, schiena, che ride, denti stretti, posa a figura intera, dettaglio della maglia e dettaglio degli scarpini. Nove immagini, circa otto centesimi in totale.

Quattro angolazioni dello stesso attaccante originale generato come pacchetto di riferimento, disposte in una griglia due per due
Quattro delle nove angolazioni di riferimento. H3 accetta fino a nove immagini in un pacchetto di riferimento, più riferimenti video e audio sopra.
Plain1Anime 2D cel-shaded, spessore di linea a inchiostro disegnato a mano consistente, colore 2piatto, nessuna ombreggiatura 3D. Mantieni il volto dell'attaccante di riferimento, la 3sagoma dei capelli e la maglia numero 9 identici in ogni taglio. Quattro tagli in una 4singola ripresa continua: (1) push-in dal basso sui suoi scarpini che toccano il terreno, 5(2) whip-pan verso l'alto verso un primo piano stretto dei suoi occhi, (3) inquadratura 6ampia di lei che scatta oltre tre difensori disegnati come sagome sfocate, (4) fermo su 7una colpo di testa a mezz'aria, linee di velocità che esplodono verso l'esterno. Audio: 8ruggito della folla, respiro, impatti scarpino-terreno, un colpo di taiko sul fermo.
Impostazioni: modello minimax/h3/reference-to-video, refers = le tue immagini con type: image, resolution: 2K, duration: 8 o superiore, ratio: adaptive o 16:9.
L'equivalente Veo 3.1 non può essere eseguito con queste impostazioni e non devi provarlo per sapere perché. Il suo endpoint di riferimento accetta un massimo di tre immagini, e scegliere quell'endpoint riduce duration a un unico valore legale di 8. Un pacchetto di nove immagini e una ripresa di 10 secondi sono entrambi fuori portata.

Playground MiniMax H3 reference-to-video su Atlas Cloud che mostra il contatore di riferimento a quattro su nove e il primo taglio nel pannello di output
MiniMax H3 reference-to-video su Atlas Cloud. Il contatore legge Reference Materials (4/9) con MAX:9 sotto, che è il limite nell'interfaccia piuttosto che un'affermazione da una scheda tecnica. L'output è il taglio uno, il push-in dal basso sugli scarpini.
Quattro Altre Esecuzioni MiniMax H3 Anime Video Generator che Vale la Pena Fare
L'inquadratura Last Whistle sollecita solo quattro delle differenze. Queste quattro sollecitano il resto. Tutte girano su H3; le note dicono quali Veo 3.1 può eguagliare.
- Combattimento sakuga ultrawide,
21:9, 10 secondi. Veo non può produrre 21:9 affatto.
Plain1Azione anime 2D cel-shaded, linee di inchiostro spesse e affusolate, colore piatto, ombre 2nette, nessuna ombreggiatura 3D. Due duellanti mascherati originali su un tetto di tempio 3battuto dal vento al crepuscolo. Scontro di lame, l'inquadratura trema, entrambi i 4combattenti si separano in uno scoppio di fotogrammi d'impatto disegnati a mano e linee 5di velocità radiali. Telecamera: push-in dal basso, poi una traccia laterale, poi uno 6scatto a una silhouette ampia contro il cielo arancione. Audio: due scontri di metallo 7acuti, schiocco di stoffa, un colpo di taiko basso sul fermo finale, nessuna musica.
- Taglio AMV sincronizzato al ritmo, reference-to-video con un riferimento audio. H3 accetta fino a tre clip audio come input di riferimento. Veo 3.1 non ha alcun input audio, solo output audio.
Plain1Montaggio anime 2D cel-shaded tagliato sulla traccia audio di riferimento. Cinque brevi 2battiti: pioggia su una finestra, una mano che stringe una benda, uno skyline cittadino 3che sfreccia oltre il finestrino di un treno, uno scatto di partenza, un fermo su una 4mano tesa. Ogni taglio cade esattamente su un downbeat dell'audio di riferimento. Colore 5piatto, linee di inchiostro spesse, tavolozza notturna ad alto contrasto di indaco scuro 6e magenta neon.
- Scena di dialogo in giapponese di due battute, 12 secondi. Questo è il test di stress della sincronizzazione labiale, e 12 secondi sono già fuori dalla portata di Veo.
Plain1Anime 2D cel-shaded, colore piatto, nessuna ombreggiatura 3D. Due personaggi originali su 2un tetto all'ora d'oro, campo e controcampo. Il primo dice in giapponese: 「本当に行くの?」. 3Il secondo risponde, con un mezzo sorriso, in giapponese: 「もう決めた」. Le bocche 4corrispondono a ogni sillaba. Luce di bordo calda, ombre lunghe, vento gentile tra i 5capelli. Audio: due voci giapponesi distinte, traffico lontano, una cicala.
- Cortometraggio shonen verticale,
9:16, 8 secondi. Entrambi i modelli possono fare verticale, quindi questo è l'unico posto per fare un vero A/B invece di presumere.
Plain1Anime 2D cel-shaded, composizione verticale. Un'attaccante adolescente originale irrompe 2attraverso uno striscione di carta al rallentatore, poi l'inquadratura scatta di nuovo a 3piena velocità mentre accelera lungo una pista dello stadio. Linee di velocità, colore 4piatto, ombre dure, cielo grafico audace. Telecamera: inquadratura di follow dal basso, 5poi una whip sul suo volto. Audio: strappo dello striscione, ondata di folla, un respiro 6trattenuto e poi rilasciato. 7 8Se vuoi la grammatica dei prompt dietro a questi, la [guida ai prompt di MiniMax H3](https://www.atlascloud.ai/blog/guides/minimax-h3-prompt-guide?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) approfondisce come H3 analizza le istruzioni di telecamera e audio più di quanto possa fare qui. 9 10## Quanto Costa un'Apertura Anime di 60 Secondi su MiniMax H3 vs Veo 3.1 11 12Una tipica OP anime dura circa 90 secondi. Diciamo otto inquadrature di 8 secondi, 64 secondi di video finito, più un keyframe per inquadratura a $0,009 ciascuno. 13 14C'è una discrepanza di prezzo reale che dovresti conoscere piuttosto che lasciarmela nascondere. Il catalogo Atlas Cloud elenca MiniMax H3 a $0,10 al secondo fisso, mentre il readme del modello lo suddivide in $0,14/s a 2K e $0,10/s a 768P. Veo 3.1 è elencato a $0,20 al secondo, mentre il suo readme separa $0,40/s con audio da $0,20/s senza. 15 16I pulsanti di esecuzione nei miei screenshot lo risolvono. H3 reference-to-video, 8 secondi a 2K, quotato `Run $1,12`, che è esattamente $0,14 al secondo. Veo 3.1 image-to-video, 8 secondi a 1080p con audio attivo, quotato `Run $3,2`, che è esattamente $0,40 al secondo. Quindi le tariffe del readme sono quelle che vengono addebitate, e il titolo del catalogo è il livello di ingresso. Ho comunque mostrato entrambe le letture qui sotto. Questi sono prezzi di listino ad agosto 2026. 17 18**Tabella 4: otto inquadrature di 8 secondi, keyframe inclusi** 19 20| Setup | Costo video (tariffa catalogo) | Costo video (tariffa readme) | Keyframe | Intervallo totale | 21| ------------------------- | ------------------------------ | ---------------------------- | -------- | ------------------- | 22| MiniMax H3, 2K | $6,40 | $8,96 | $0,07 | $6,47 a $9,03 | 23| MiniMax H3, 768P | $6,40 | $6,40 | $0,07 | $6,47 | 24| Veo 3.1, 1080p con audio | $12,80 | $25,60 | $0,07 | $12,87 a $25,67 | 25| Veo 3.1 Lite, 720p | $3,20 | $3,20 | $0,07 | $3,27 | 26 27Prezzi prelevati dalle pagine dei modelli Atlas Cloud collegate nella Tabella 1, agosto 2026. Nessuno di questi quattro è scontato al momento. 28 29Due cose che quella tabella non include, ed entrambe colpiscono più duramente della tariffa al secondo. 30 31**Ripetizioni.** Nessuno pubblica la prima ripresa di un'inquadratura anime. Qualunque moltiplicatore tu assuma, applicalo a entrambe le colonne e il divario si allarga nella stessa proporzione. 32 33**Tempo reale, e questo va nella direzione opposta.** Cronometrato end-to-end il 7 agosto 2026: H3 a 2K per 8 secondi ha impiegato 447 secondi, circa 7,5 minuti. H3 text-to-video a 2K per 12 secondi ha impiegato 334 secondi. Veo 3.1 a 1080p per 8 secondi con audio ha impiegato 152 secondi, meno di tre minuti. Veo è circa tre volte più veloce per una prima ripresa qui, e se stai iterando su un'inquadratura alle 2 del mattino, questo vale denaro reale. Le code si muovono, quindi trattali come un'istantanea di un pomeriggio piuttosto che come una specifica. Ma chiunque citi "da 2 a 3 minuti" per H3 a 2K sta citando un readme, non una coda. La [suddivisione 2K vs 768P](https://www.atlascloud.ai/blog/guides/minimax-h3-2k-vs-768p?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) copre quando il livello superiore vale i minuti extra. 34 35## Stile Anime, Omaggio e Cosa Puoi Effettivamente Pubblicare 36 37Tutto in questo articolo è stile e omaggio. Un personaggio originale, una maglia originale, un titolo originale. Nessun personaggio anime ufficiale è stato generato o richiesto, e nessun nome o somiglianza di calciatore reale è stato utilizzato. La tendenza dei Mondiali viene citata come _formato_, perché è ciò per cui è utile. 38 39Questa distinzione non è decorativa. Se stai producendo contenuti in stile anime commercialmente, "nello stile di OVA anni '90" e "questo personaggio specifico di questo show specifico" sono oggetti legali diversi, e solo uno di essi è un business. 40 41Sui pesi aperti: H3 è genuinamente scaricabile, e la gente lo ha eseguito il primo giorno. Un commentatore ha riportato 10 minuti per una clip di 10 secondi a 480p su una 4070 Ti Super con 16GB, e altri hanno postato 3 minuti su una 5080 e 68 secondi su una RTX 6000 Pro. Ma l'auto-hosting esegue a 768 short edge; le fasi Context-IR e Regenerate-2K che producono 2K rimangono sul lato API. 42 43La licenza ha un vero problema. La licenza comunitaria attualmente non copre l'UE, il Regno Unito, la Corea del Sud o gli Stati Uniti, citando regioni "attualmente in fase di sviluppo o applicazione di normative relative all'AI". Un canale formale di richiesta di licenza è aperto, che un commentatore di HN ha riassunto come "devi solo promettere con la manina sul fuoco che non farai arrabbiare Disney e ti invieranno una licenza". Divertente, e anche esattamente il passo di conformità che non puoi saltare se ti trovi in uno di questi quattro territori. L'[articolo sui pesi aperti](https://www.atlascloud.ai/blog/guides/minimax-h3-open-source-weights?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) contiene l'elenco completo dei territori. 44 45## Domande Frequenti 46 47### MiniMax H3 è un buon generatore video anime rispetto a Veo 3.1? 48 49Per la maggior parte dei lavori anime, H3, e principalmente per ragioni che non riguardano il rendering. Esegue da 4 a 15 secondi contro i 4, 6 o 8 di Veo, offre sei rapporti d'aspetto inclusi 4:3 e 21:9 contro i due di Veo, elenca il giapponese tra 11 lingue di dialogo native stabili e accetta nove immagini di riferimento contro le tre di Veo. Veo 3.1 vince in una situazione specifica: quando hai bisogno di `seed` per ripetizioni riproducibili, o `negative_prompt` per impedire a un'inquadratura di scivolare nell'ombreggiatura 3D. H3 non ha nessuno di questi parametri. Se la tua pipeline dipende da uno di essi, questa è una ragione genuina per restare. 50 51### Veo 3.1 può generare anime in 4:3 o una clip di 15 secondi? 52 53No, e non per ragioni stilistiche. L'enumerazione `aspect_ratio` di Veo 3.1 contiene esattamente `16:9` e `9:16`, e la sua enumerazione `duration` contiene esattamente `4`, `6` e `8`. Non c'è un valore 4:3 da selezionare e nessun modo per richiedere 12 o 15 secondi. Se il tuo riferimento è un anime TV o OVA degli anni '90, l'inquadratura è irraggiungibile su Veo e disponibile su H3. 54 55### Perché la mia clip anime Veo 3.1 è tornata muta? 56 57Perché `generate_audio` è impostato su `false` di default sull'API. L'interruttore del playground di solito è già attivo, quindi questo colpisce solo chi chiama l'API direttamente. Imposta esplicitamente `generate_audio: true`. Mentre sei lì, imposta anche `resolution`, poiché di default è `720p` piuttosto che il 1080p o 4k che probabilmente intendevi. 58 59### MiniMax H3 fa dialoghi in giapponese e sincronizzazione labiale per anime? 60 61Sì. La scheda tecnica elenca 11 lingue con supporto stabile per i dialoghi: arabo, cinese, inglese, francese, tedesco, italiano, giapponese, coreano, portoghese, russo e spagnolo. L'audio viene generato insieme all'immagine a 32 kHz stereo piuttosto che doppiato in seguito, motivo per cui il tempismo della bocca regge per un'intera battuta invece che per le prime sillabe. Scrivi la frase in giapponese direttamente nel prompt in giapponese. 62 63### Quante immagini di riferimento posso usare per mantenere coerente un personaggio anime? 64 65MiniMax H3 accetta fino a 9 immagini, fino a 3 clip video e fino a 3 clip audio, con un tetto massimo di 12 file in totale. L'endpoint reference-to-video di Veo 3.1 accetta da 1 a 3 immagini, e selezionandolo si riduce `duration` a `8` come unico valore legale. Per un personaggio anime ricorrente in una serie, questa differenza è l'intera partita. 66 67### MiniMax H3 ha pesi aperti, quindi posso eseguire la mia pipeline anime localmente gratuitamente? 68 69Puoi scaricarlo ed eseguirlo, con tre avvertenze. L'inferenza self-hosted viene eseguita a 768 short edge, e le fasi Context-IR e Regenerate-2K che producono output 2K rimangono sul lato API. Le velocità locali reali variano ampiamente in base alla scheda: circa 10 minuti per una clip di 10 secondi a 480p su una 4070 Ti Super, circa 3 minuti su una 5080, circa 68 secondi su una RTX 6000 Pro, secondo il thread ComfyUI del giorno 0. E la licenza comunitaria attualmente non copre l'UE, il Regno Unito, la Corea del Sud o gli Stati Uniti, quindi se ti trovi in uno di questi, hai bisogno della licenza formale prima dell'uso commerciale.






