Per tutta l'estate il mio feed ha mostrato lo stesso video in loop. Giocatori dei Mondiali ridisegnati come protagonisti shonen. Un dittatore. Un capitano pirata. Un mentore incanutito che appare negli ultimi quattro secondi. Milioni di visualizzazioni per post, e la trama si aggiorna dopo quasi ogni partita.
Nessuno di quelli che li crea scrive post di benchmark. Scelgono un modello, bruciano crediti e pubblicano prima del calcio d'inizio successivo.
Così ho preso un keyframe anime e un prompt, e ho testato MiniMax H3 come generatore di video anime contro Veo 3.1, entrambi spinti al massimo delle loro impostazioni su input identici.
La prima cosa che si è rotta non è stata la qualità dell'immagine. È stato un menu a tendina. Veo 3.1 si ferma a 8 secondi e offre esattamente due aspect ratio. Un'inquadratura che tiene su un volto, una panoramica rapida con la palla, poi fa atterrare un titolo di testa, non ci sta in 8 secondi. Non ha mai avuto la possibilità di fallire sulla qualità.
Punti chiave
- L'enum
durationdi Veo 3.1 è[4, 6, 8]e il suo enumaspect_ratioè[16:9, 9:16]. MiniMax H3 esegue qualsiasi secondo intero da 4 a 15 e offre21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Nessun 4:3 su Veo significa nessuna possibilità di inquadratura OVA retrò. - La scheda tecnica di H3 elenca 11 lingue di dialogo nativamente stabili e il giapponese è una di queste. Audio e immagine sono generati insieme a 32 kHz stereo, non doppiati in seguito.
- I pacchetti di riferimento non sono vicini: H3 accetta fino a 9 immagini più fino a 3 video e 3 clip audio (max 12 file). L'endpoint di riferimento di Veo 3.1 accetta 3 immagini e, nel momento in cui lo usi,
durationcollassa a solo[8]. - Due trappole che rovinano silenziosamente i test: l'API di Veo imposta
generate_audiosufalseeresolutionsu720pdi default, e ilratiodi text-to-video di H3 predefinisce1:1. Lasciateli così e confronterete un clip silenzioso a 720p contro uno quadrato. - Veo 3.1 mantiene due cose che H3 non ha affatto:
seedenegative_prompt. Per l'anime 2D, quest'ultimo è davvero importante, e lo mostrerò più avanti.
MiniMax H3 Generatore Video Anime vs Veo 3.1, Lo Stesso Fotogramma Uno di Fronte all'Altro
Un personaggio originale. Un keyframe. Un prompt, copiato carattere per carattere in entrambi i modelli. Tutto il resto al massimo per ciascun lato.
MiniMax H3, image-to-video, 2K, 8 secondi, audio nativo. Alza il volume: il rumore della folla, il colpo sulla palla e il grido giapponese sono generati nello stesso passaggio dell'immagine. Generato con minimax/h3/image-to-video su Atlas Cloud.
Veo 3.1, image-to-video, 1080p, 8 secondi, generateaudio attivato manualmente, più un negativeprompt che mantiene piatto il tratto del disegno. Stesso primo fotogramma, stesse parole. Generato con google/veo3.1/image-to-video su Atlas Cloud.
Entrambi disegnano magnificamente. L'inquadratura ampia di Veo sul colpo, con linee d'impatto disegnate a mano e un effetto sonoro manga che fluttua nell'aria, è davvero piacevole. Questo è il punto di partenza onesto, ed è il motivo per cui il resto di questo articolo riguarda parametri e aderenza alle istruzioni, piuttosto che sensazioni.
Perché la Maggior Parte dei Test tra MiniMax H3 Generatore Video Anime e Veo 3.1 Fallisce
Due cose sono successe contemporaneamente quest'estate.
L'anime è diventato il formato più popolare nel video AI. I Mondiali 2026 sono stati riscritti come un torneo shonen, con giocatori interpretati come un dittatore, un capitano pirata, un generale della marina e un mentore, e trame che "si evolvono dopo quasi ogni partita" su TikTok, Instagram, X e YouTube (Complex, luglio 2026).
E MiniMax H3 è stato rilasciato con pesi aperti. Il thread ComfyUI del giorno zero ha raggiunto 330 punti e 95 commenti, con persone che pubblicavano numeri reali locali entro poche ore (Hacker News, agosto 2026).
Mettendo insieme queste cose, ci si aspetterebbe una marea di confronti anime. Ce ne sono quasi nessuno, perché la maggior parte dei test viene costruita male in uno dei quattro modi seguenti.
Confrontano immagini, non vincoli. Le inquadrature anime sono questione di tempismo. Una panoramica rapida in un titolo di testa è un problema di durata prima di essere un problema di rendering.
Dimenticano che l'API di Veo è silenziosa per impostazione predefinita. Nell'API, generate_audio è false e resolution è 720p. Molti post del tipo "Veo non ha audio nell'anime" sono solo qualcuno che non ha mai attivato un booleano.
Dimenticano che il text-to-video di H3 è quadrato per impostazione predefinita. ratio predefinito è 1:1, non 16:9. Esegui un prompt anime t2v senza impostarlo e ottieni un clip quadrato e una conclusione confusa.
Testano con prompt fotorealistici. "Cinematografico, luce volumetrica, profondità di campo ridotta" è esattamente il vocabolario che trascina un modello 2D verso l'ombreggiatura di un render 3D. La modalità di fallimento nell'anime non è la sfocatura. È la plastica.
Le tre impostazioni che decidono un test anime prima di premere il pulsante di esecuzione
Prima di tutto, impostatele su entrambi i lati, altrimenti il confronto è nullo.
| Impostazione | MiniMax H3 | Veo 3.1 | Cosa succede se la salti |
|---|---|---|---|
| Audio | Generato con l'immagine, sempre attivo | generate_audio predefinito false | Veo restituisce un clip muto e sembra peggiore di quanto sia |
| Forma fotogramma | ratio predefinito 1:1 su text-to-video | aspect_ratio predefinito 16:9 | H3 ti dà un taglio anime quadrato che non puoi usare |
| Risoluzione | predefinita 2K | predefinita 720p | Confronti 2K contro 720p e lo chiami un divario di qualità |
La Scheda Tecnica Anime MiniMax H3 vs Veo 3.1: Durata, Aspect Ratio, Audio, Riferimenti
Ho estratto gli schemi di input live di entrambi i modelli invece di fidarmi di qualsiasi post di lancio. Ogni valore qui sotto è un enum che puoi leggere tu stesso sulle pagine dei modelli, non un'impressione.
Tabella 1: MiniMax H3 vs Veo 3.1, i parametri che decidono un'inquadratura anime
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Durata | Da 4 a 15, ogni secondo intero (predefinito 8) | 4, 6, 8 (predefinito 8) |
| Aspect ratio | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Ratio predefinito (text-to-video) | 1:01 | 16:09 |
| Risoluzione | 768P, 2K (predefinito 2K) | 720p, 1080p, 4k (predefinito 720p) |
| Audio | Generato congiuntamente, 32 kHz stereo | generate_audio, predefinito false |
| Lingue di dialogo native | 11 stabili, giapponese incluso | Non pubblicato come elenco stabile |
| Pacchetto di riferimento | fino a 9 immagini, 3 video, 3 clip audio, 12 file totali | 3 immagini |
| Durata quando si usano riferimenti | ancora da 4 a 15 | collassa a solo 8 |
| seed | non disponibile | disponibile |
| negative_prompt | non disponibile | disponibile |
| Pesi | scaricabili | chiusi |
Durata, aspect ratio, risoluzione, audio e limiti dei riferimenti sono letti dagli schemi live sulle pagine MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video e Veo 3.1 reference-to-video. Il limite di 9 immagini e 12 file e l'elenco di 11 lingue di dialogo provengono dalla scheda tecnica MiniMax H3 (Hugging Face, agosto 2026).
Ora le classifiche, perché dicono qualcosa di diverso dalla scheda tecnica ed entrambe contano.
Tabella 2: Elo voto popolare e prezzo al minuto, snapshot 7 agosto 2026
| Model | Text-to-video (con audio) | Image-to-video (con audio) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1.244 (#1) ±7 | 1.191 (#2) ±9 | $6.00 |
| MiniMax H3 | 1.238 (#2) ±9 | 1.190 (#3) ±10 | $7.80 |
| Dreamina Seedance 2.0 720p | 1.224 (#3) ±6 | 1.198 (#1) ±7 | $9.07 |
| Kling 3.0 1080p (Pro) | 1.111 (#7) ±6 | non nella top 10 | $20.16 |
| Veo 3.1 | 1.093 (#11) ±7 | 1.085 (#10) ±7 | $24.00 |
| Veo 3.1 Fast | 1.091 (#14) ±6 | non nella top 10 | $9.00 |
| Veo 3.1 Lite | 1.089 (#15) ±7 | non nella top 10 | $4.80 |
Dati Elo e prezzi da Artificial Analysis Video Arena (Artificial Analysis, agosto 2026). Sono voti popolari mobili e cambiano. La colonna $/min è una stima normalizzata del modello, non la tua fattura.
Un divario Elo di 145 punti è grande, ma è un voto generico, non un voto anime. E qui c'è la parte che devo dire chiaramente: MiniMax non commercializza H3 come un modello anime. Il feedback interno di prima linea elenca film, animazione e commedia-drammatica come le aree in cui H3 non è mirato. Quindi la domanda interessante non è "quale è il modello anime". È perché il modello che non si vende sull'anime vince comunque l'inquadratura, e dove Google si prende ancora il round.
Una nota pratica prima del tutorial. Ogni modello qui sotto viene eseguito attraverso la stessa console e la stessa chiave API, che è l'unica ragione per cui i parametri sono confrontabili. Stessa coda, stessa autenticazione, un'unica fattura. Se configuri GPT Image 2 su un servizio e Veo su un altro, metà delle differenze che troverai saranno dovute all'infrastruttura, non al modello.
Costruisci l'Inquadratura: MiniMax H3 vs Veo 3.1, Passo dopo Passo
Un esempio concreto, dall'inizio alla fine. "Ultimo Fischio": un attaccante adolescente originale, capelli rossi, maglia bianca e blu numero 9, luci dello stadio, una panoramica rapida sul tiro, e un titolo di testa in giapponese che deve atterrare negli ultimi due secondi e rimanere fermo.
Nessun vero giocatore, nessun personaggio ufficiale, nessun IP anime esistente. Solo stile e omaggio. Più avanti spiegherò perché.
Passo 1: Progetta il keyframe anime con GPT Image 2
Il keyframe porta la direzione artistica, così il modello video non deve inventarla. Nota lo spazio negativo sul terzo sinistro: è intenzionale. Il titolo di testa viene scritto lì dal modello video, e questa è la prova di stabilità del testo.
Plain1Un singolo fotogramma da un moderno anime sportivo shonen. Animazione 2D cel-shaded, line art 2disegnata a mano con spessore di tratto costante, riempimenti di colore piatto, ombre grafiche 3dure, assolutamente nessuna ombreggiatura 3D e nessuna pelle fotorealistica. Primo piano su un 4attaccante adolescente originale: capelli rossi arruffati, maglia bianca e blu con il numero 9, 5sudore e strisce d'erba su una guancia, occhi spalancati con determinazione esausta, bocca 6aperta a metà di un grido. Dietro di lui, i riflettori dello stadio brillano in un muro di 7colore della folla sfocato; linee di velocità radiali scoppiano dal centro del fotogramma; 8un filo d'erba rimane congelato nell'aria. Tavolozza satura, ombre ciano profonde, caldo 9bordo di luce arancione. Composizione 16:9, il personaggio inquadrato a destra del centro, 10spazio negativo pulito sul terzo sinistro. Nessun testo nell'immagine.
Impostazioni: modello openai/gpt-image-2/text-to-image, qualità high, formato 16:9 (2048x1152). Nient'altro.

Playground di GPT Image 2 su Atlas Cloud con il prompt del keyframe di Ultimo Fischio e il fotogramma anime finito nel pannello di output
GPT Image 2 su Atlas Cloud: qualità impostata su alta, il keyframe finito a destra.

Il keyframe anime di base: un attaccante originale dai capelli rossi a metà grido sotto i riflettori dello stadio, cel-shaded con colore piatto e linee di velocità
Il keyframe che entrambi i modelli ricevono. Colore piatto, ombre dure e un terzo sinistro vuoto in attesa di un titolo di testa.
Passo 2: MiniMax H3 image-to-video, tutto al massimo
Stessa immagine in ingresso, 2K in uscita. Ho tenuto H3 a 8 secondi qui solo per eguagliare il limite di Veo. Non è il limite di H3 e il Passo 4 rimuove il tetto.
Plain1Anime 2D cel-shaded, spessore di tratto disegnato a mano, colore piatto, nessuna ombreggiatura 3D. 2Tieni sul volto dell'attaccante per un momento, poi una violenta panoramica rapida segue la 3palla mentre la colpisce, la panoramica sfuma il fotogramma in scie di movimento sakuga 4striate. Un fotogramma di silenzio totale all'impatto. Negli ultimi due secondi, un carattere 5in grassetto bianco giapponese che legge ラストホイッスル appare sul terzo sinistro del 6fotogramma e rimane fermissimo, nessuna deformazione, nessuno sfarfallio, nessuna deriva. 7L'attaccante grida una frase in giapponese: 「まだ終わってない!」 8Audio: ruggito dello stadio che cresce, un singolo impatto netto sulla palla, un colpo di 9taiko basso sotto il titolo di testa.
Impostazioni: modello minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video prende la forma del fotogramma dall'immagine di input), image = output del Passo 1.
Un avvertimento se passi invece a text-to-video: scrivi esplicitamente ratio: 16:9. Il default è 1:1 e ti darà volentieri un taglio anime quadrato.

Playground di MiniMax H3 image-to-video su Atlas Cloud con il prompt di Ultimo Fischio, keyframe caricato e il clip finito nel pannello di output
MiniMax H3 image-to-video su Atlas Cloud: il keyframe del Passo 1 caricato a sinistra, il clip finito in riproduzione a destra.
Passo 3: Veo 3.1 image-to-video, audio attivato manualmente
Il prompt è identico, parola per parola. Cambia un singolo aggettivo e smette di essere un confronto. Ciò che cambia è il campo extra che Veo ti dà e H3 no.
negative_prompt, che per l'anime 2D è il controllo più utile di questa lista:
Plain13D render, CGI, ombreggiatura plastica, pelle fotorealistica, filmato live action, zuppa di 2motion blur, lettering deformato, testo senza senso, dita in più, barra dei sottotitoli
Impostazioni: modello google/veo3.1/image-to-video, resolution: 1080p (cambialo, il default è 720p), duration: 8 (questo è il limite), aspect_ratio: 16:9, generate_audio: true (il default API è false, questa è la trappola del clip muto), seed: 20260807, image = stesso output del Passo 1.

Playground di Veo 3.1 image-to-video su Atlas Cloud che mostra l'audio di generazione abilitato, il keyframe anime caricato e il clip finito nel pannello di output
Veo 3.1 image-to-video su Atlas Cloud, con Genera Audio attivato e il clip finito a destra.
Passo 4: Valutalo su cinque assi specifici per anime
Niente da generare qui. Basta guardare, sulle cose su cui l'anime si rompe davvero. Entrambi i clip sono incorporati vicino all'inizio di questo articolo, quindi puoi valutarli tu stesso invece di credere alla mia parola.

Confronto affiancato dell'ultimo fotogramma di entrambi i clip, MiniMax H3 a sinistra con lettering giapponese pulito del titolo, Veo 3.1 a destra con caratteri verticali senza senso
L'ultimo fotogramma di ogni clip. A sinistra, H3 ha scritto ラストホイッスル, tutti e otto i katakana corretti e fermi. A destra, Veo 3.1 ha scritto tre caratteri che non sono la parola richiesta e non ne formano una.
Il titolo di testa è dove si è deciso il round, e non è stato vicino. H3 ha reso esattamente i katakana richiesti, netti e stabili, su una panoramica striata della porta. Veo 3.1 ha prodotto una pila verticale di tre caratteri che non sono né la parola richiesta né una parola. Nello stesso fotogramma ha anche fatto uscire il personaggio dall'inquadratura e ha lasciato che lo sfondo scivolasse verso un'immagine semi-fotorealistica dello stadio, nonostante photorealistic skin e 3D render fossero nel negative prompt.
Tabella 3: cinque assi che decidono un taglio anime, da queste due esecuzioni
| Asse | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Continuità del personaggio dal keyframe | Ha mantenuto l'esatto volto, capelli e maglia per tutti gli 8 secondi | Ha ridisegnato il personaggio in una nuova inquadratura ampia, in modello ma un disegno diverso |
| Spessore del tratto e ombreggiatura cel piatta | Mantenuto, nessuna deriva verso il 3D | Mantenuto nell'inquadratura media, scivolato verso un fondale fotografico dello stadio alla fine |
| Titolo di testa giapponese | ラストホイッスル reso correttamente e mantenuto fermo | Tre caratteri, non la parola richiesta, non una parola |
| Traccia audio consegnata | 32 kHz stereo, esattamente come dichiara la scheda tecnica | 48 kHz stereo, presente solo perché ho impostato generate_audio manualmente |
| Panoramica rapida e scia sakuga | Eseguita come una panoramica sfumata nel titolo | Sostituita con un taglio netto a una nuova impostazione |
L'ultima riga è la critica pubblica più forte a H3 finora, che è esattamente il motivo per cui l'ho scritta in entrambi i prompt. Sul thread ComfyUI del giorno zero, l'utente fwip si è lamentato che anche i prompt demo ufficiali venivano ignorati: "una violenta PANORAMICA RAPIDA dal tetto che STRASCINA via le parole fluttuanti, striate di movimento. E il video semplicemente non ha fatto nessuna di quelle transizioni, le ha sostituite con un taglio."
In questa esecuzione è stato Veo a scambiare la panoramica con un taglio, e H3 a sfumare. Un take ciascuno non è un verdetto, e non direi il contrario. Ma significa che la critica non è specifica di H3: le panoramiche rapide sono l'istruzione meno affidabile in tutto questo test, su entrambi i lati. Se il tuo storyboard dipende da una, progetta lo storyboard intorno ad essa piuttosto che attraverso di essa.
Passo 5: Il taglio OVA retrò 4:3 che Veo 3.1 strutturalmente non può produrre
Questa non è una preferenza di qualità. È un muro. L'enum aspect_ratio di Veo ha due valori e nessuno è 4:3, e il suo enum duration non ha 12. L'aspetto OVA anni '90 è semplicemente irraggiungibile.
Plain1Un taglio anime OVA degli anni '90, 4:3 full-frame. Fondali dipinti a mano con texture di 2pennello visibile, personaggi dipinti su cell con linee spesse e irregolari, alone di 3alone pesante attorno ai riflettori, grana della pellicola 16mm e leggero movimento del 4fotogramma. Lo stesso attaccante dai capelli rossi con una maglia numero 9 bianca e blu 5cammina fuori da un campo bagnato dalla pioggia mentre il rumore della folla svanisce in 6un unico tono squillante. La telecamera si avvicina lentamente al suo volto. Dice 7piano in giapponese: 「次は、勝つ」. Tavolozza retrò: acquamarina spenta, ambra polverosa, 8ombre marroni profonde. Audio: pioggia lontana, un singolo pad sintetico analogico, un 9fischio con molto riverbero in lontananza.
Impostazioni: modello minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Imposta quel ratio manualmente, ricorda il default.

Playground di MiniMax H3 text-to-video su Atlas Cloud con il prompt OVA digitato e il clip retrò finito nel pannello di output
MiniMax H3 text-to-video su Atlas Cloud, prompt OVA digitato, clip completato. Piena trasparenza: questa particolare esecuzione ha lasciato Aspect Ratio a 16:9 e Duration a 8, quindi quello che vedi a destra è la versione breve widescreen. Il taglio 4:3 da dodici secondi qui sotto proviene dalla chiamata API con ratio: 4:3 e duration: 12 impostati esplicitamente.

Il taglio OVA retrò 4:3: lo stesso attaccante che cammina fuori da un campo bagnato dalla pioggia in stile anime anni '90
H3 text-to-video, 4:3, 12 secondi. Il file consegnato è tornato 1920x1440, che è 4:3 al pixel, con una traccia stereo a 32 kHz. Mostrato qui come GIF muta a frame rate ridotto per mantenere la pagina leggera. Generato con minimax/h3/text-to-video su Atlas Cloud.
Passo 6: Nove immagini di riferimento, un personaggio, quattro tagli
La coerenza del personaggio tra inquadrature diverse è il problema più difficile nell'AI anime, e si risolve con il volume di riferimenti. Costruisci prima il pacchetto: ripeti il prompt del Passo 1 con l'inquadratura cambiata per fronte, tre quarti, profilo completo, schiena, che ride, denti stretti, posa a figura intera, dettaglio maglia e dettaglio scarpa. Nove immagini, circa otto centesimi in totale.

Quattro angolazioni dello stesso personaggio attaccante originale generato come pacchetto di riferimento, disposte in una griglia due per due
Quattro delle nove angolazioni di riferimento. H3 accetta fino a nove immagini in un pacchetto di riferimento, più video e audio sopra.
Plain1Anime 2D cel-shaded, spessore di tratto disegnato a mano costante, colore piatto, nessuna 2ombreggiatura 3D. Mantieni il volto, la silhouette dei capelli e la maglia numero 9 del 3riferimento identici in ogni taglio. Quattro tagli in un'unica ripresa continua: (1) push-in 4dal basso sui suoi stivali che toccano l'erba, (2) panoramica rapida verso l'alto fino a un 5primo piano stretto dei suoi occhi, (3) inquadratura ampia di lui che scatta oltre tre 6difensori disegnati come silhouette sfocate, (4) freeze su un colpo di testa a mezz'aria, 7linee di velocità che esplodono verso l'esterno. Audio: ruggito della folla, respiro, impatti 8stivali-erba, un colpo di taiko sul freeze.
Impostazioni: modello minimax/h3/reference-to-video, refers = le tue immagini con type: image, resolution: 2K, duration: 8 o superiore, ratio: adaptive o 16:9.
L'equivalente di Veo 3.1 non può essere eseguito con queste impostazioni e non devi provarlo per sapere perché. Il suo endpoint di riferimento accetta un massimo di tre immagini, e scegliere quell'endpoint collassa duration a un singolo valore legale di 8. Un pacchetto di nove immagini e un take di 10 secondi sono entrambi fuori portata.

Playground di MiniMax H3 reference-to-video su Atlas Cloud che mostra il contatore dei riferimenti a quattro su nove e il primo taglio nel pannello di output
MiniMax H3 reference-to-video su Atlas Cloud. Il contatore legge Reference Materials (4/9) con MAX:9 sotto, che è il limite nell'interfaccia piuttosto che un'affermazione da una scheda tecnica. L'output è il primo taglio, il push-in dal basso sugli stivali.
Quattro Ulteriori Esecuzioni del Generatore Video Anime MiniMax H3 che Vale la Pena Fare
L'inquadratura di Ultimo Fischio mette alla prova solo quattro delle differenze. Queste quattro mettono alla prova il resto. Tutte girano su H3; le note dicono quali Veo 3.1 può eguagliare.
- Combattimento sakuga ultrawide,
21:9, 10 secondi. Veo non può produrre 21:9.
Plain1Azione anime 2D cel-shaded, linee di inchiostro spesse e affusolate, colore piatto, ombre 2dure, nessuna ombreggiatura 3D. Due duellanti mascherati originali su un tetto di un tempio 3spazzato dal vento al crepuscolo. Scontro di lame, il fotogramma trema, entrambi i 4combattenti si separano in uno scoppio di fotogrammi di impatto disegnati a mano e linee 5di velocità radiali. Telecamera: push-in dal basso, poi una traccia laterale, poi un 6passaggio a una silhouette ampia contro il cielo arancione. Audio: due scontri metallici 7acuti, scatto di stoffa, un colpo di taiko basso sul freeze finale, nessuna musica.
- Taglio AMV sincronizzato al beat, reference-to-video con un riferimento audio. H3 accetta fino a tre clip audio come input di riferimento. Veo 3.1 non ha alcun input audio, solo output audio.
Plain1Montaggio anime 2D cel-shaded tagliato sulla traccia audio di riferimento. Cinque brevi 2battiti: pioggia su una finestra, una mano che stringe una benda, uno skyline della città 3che sfreccia oltre il finestrino di un treno, un via di scatto, un freeze su una mano tesa. 4Ogni taglio atterra esattamente su un downbeat dell'audio di riferimento. Colore piatto, 5linee di inchiostro spesse, tavolozza notturna ad alto contrasto di indaco intenso e 6magenta neon.
- Scena di dialogo in giapponese di due battute, 12 secondi. Questo è il test di stress del lip-sync, e 12 secondi sono già fuori dalla portata di Veo.
Plain1Anime 2D cel-shaded, colore piatto, nessuna ombreggiatura 3D. Due personaggi originali su un 2tetto all'ora d'oro, campo-controcampo. Il primo dice in giapponese: 「本当に行くの?」. 3Il secondo risponde, con mezzo sorriso, in giapponese: 「もう決めた」. Le bocche 4corrispondono a ogni sillaba. Caldo bordo di luce, ombre lunghe, vento gentile tra i capelli. 5Audio: due voci giapponesi distinte, traffico lontano, una cicala.
- Cortometraggio shonen verticale,
9:16, 8 secondi. Entrambi i modelli possono fare verticale, quindi questo è l'unico posto per confrontarli direttamente A/B piuttosto che assumere.
Plain1Anime 2D cel-shaded, composizione verticale. Un'adolescente attaccante originale irrompe 2attraverso uno striscione di carta al rallentatore, poi il fotogramma torna a velocità piena 3mentre accelera lungo una pista dello stadio. Linee di velocità, colore piatto, ombre dure, 4cielo grafico audace. Telecamera: inquadratura di follow dal basso, poi una panoramica 5rapida verso il suo volto. Audio: strappo dello striscione, ondata di folla, un respiro 6trattenuto poi rilasciato. 7 8Se vuoi la grammatica del prompt dietro questi, la [guida ai prompt di MiniMax H3](https://www.atlascloud.ai/blog/guides/minimax-h3-prompt-guide?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) approfondisce come H3 analizza le istruzioni di telecamera e audio più di quanto io possa fare qui. 9 10## Quanto Costa un'Opening Anime di 60 Secondi su MiniMax H3 vs Veo 3.1 11 12Una OP anime standard dura circa 90 secondi. Diciamo otto inquadrature da 8 secondi, 64 secondi di video finito, più un keyframe per inquadratura a $0,009 ciascuno. 13 14C'è una reale discrepanza di prezzo che dovresti conoscere piuttosto che lasciarmi nascondere. Il catalogo di Atlas Cloud elenca MiniMax H3 a $0,10 al secondo fisso, mentre il readme del modello lo suddivide in $0,14/s a 2K e $0,10/s a 768P. Veo 3.1 è elencato a $0,20 al secondo, mentre il suo readme separa $0,40/s con audio da $0,20/s senza. 15 16I pulsanti di esecuzione nei miei screenshot lo risolvono. H3 reference-to-video, 8 secondi a 2K, quotato `Run $1,12`, che è esattamente $0,14 al secondo. Veo 3.1 image-to-video, 8 secondi a 1080p con audio attivo, quotato `Run $3,2`, che è esattamente $0,40 al secondo. Quindi le tariffe del readme sono quelle che vengono addebitate, e il titolo del catalogo è il livello di ingresso. Ho comunque mostrato entrambe le letture qui sotto. Questi sono prezzi di listino ad agosto 2026. 17 18**Tabella 4: otto inquadrature da 8 secondi, keyframe inclusi** 19 20| Setup | Costo video (tariffa catalogo) | Costo video (tariffa readme) | Keyframe | Intervallo totale | 21| ------------------------- | ------------------------------ | ---------------------------- | -------- | ----------------- | 22| MiniMax H3, 2K | $6,40 | $8,96 | $0,07 | $6,47 a $9,03 | 23| MiniMax H3, 768P | $6,40 | $6,40 | $0,07 | $6,47 | 24| Veo 3.1, 1080p con audio | $12,80 | $25,60 | $0,07 | $12,87 a $25,67 | 25| Veo 3.1 Lite, 720p | $3,20 | $3,20 | $0,07 | $3,27 | 26 27Prezzi presi dalle pagine dei modelli Atlas Cloud collegate nella Tabella 1, agosto 2026. Nessuno di questi quattro è scontato al momento. 28 29Due cose che quella tabella non include, ed entrambe colpiscono più duramente della tariffa al secondo. 30 31**Ripetizioni.** Nessuno pubblica il primo take di un'inquadratura anime. Qualunque moltiplicatore tu assuma, applicalo a entrambe le colonne e il divario si allarga nella stessa proporzione. 32 33**Tempo reale, e questo va nella direzione opposta.** Cronometrato dall'inizio alla fine il 7 agosto 2026: H3 a 2K per 8 secondi ha impiegato 447 secondi, circa 7,5 minuti. H3 text-to-video a 2K per 12 secondi ha impiegato 334 secondi. Veo 3.1 a 1080p per 8 secondi con audio ha impiegato 152 secondi, meno di tre minuti. Veo è circa tre volte più veloce per un primo take qui, e se stai iterando su un'inquadratura alle 2 del mattino, questo vale soldi veri. Le code si muovono, quindi trattali come un'istantanea di un pomeriggio, non come una specifica. Ma chi cita "da 2 a 3 minuti" per H3 a 2K sta citando un readme, non una coda. La [suddivisione 2K vs 768P](https://www.atlascloud.ai/blog/guides/minimax-h3-2k-vs-768p?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) copre quando vale la pena il livello superiore per i minuti extra. 34 35## Stile Anime, Omaggio e Cosa Puoi Effettivamente Pubblicare 36 37Tutto in questo articolo è stile e omaggio. Un personaggio originale, una maglia originale, un titolo originale. Nessun personaggio anime ufficiale è stato generato o richiesto, e nessun nome o somiglianza di un vero calciatore è stato utilizzato. Il trend dei Mondiali è citato come un _formato_, perché è ciò per cui è utile. 38 39Quella distinzione non è una decorazione. Se stai producendo contenuti in stile anime commercialmente, "nello stile degli OVA anni '90" e "questo personaggio specifico di questo show specifico" sono oggetti legali diversi, e solo uno di essi è un'attività commerciale. 40 41Sui pesi aperti: H3 è genuinamente scaricabile, e le persone lo hanno eseguito dal primo giorno. Un commentatore ha riportato 10 minuti per un clip di 10 secondi a 480p su una 4070 Ti Super con 16 GB, e altri hanno postato 3 minuti su una 5080 e 68 secondi su una RTX 6000 Pro. Ma l'hosting locale funziona a un bordo corto di 768; le fasi Context-IR e Regenerate-2K che producono 2K rimangono sul lato API. 42 43La licenza ha una vera fregatura. La licenza comunitaria non copre attualmente l'UE, il Regno Unito, la Corea del Sud o gli Stati Uniti, citando regioni "attualmente in fase di sviluppo o applicazione di normative relative all'IA". Un canale formale di richiesta di licenza è aperto, che un commentatore HN ha riassunto come "devi solo promettere con il mignolo che non farai arrabbiare Disney e ti invieranno una licenza". Divertente, e anche esattamente il passaggio di conformità che non puoi saltare se ti trovi in uno di quei quattro territori. L'[articolo sui pesi aperti](https://www.atlascloud.ai/blog/guides/minimax-h3-open-source-weights?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) ha l'elenco completo dei territori. 44 45## Domande Frequenti 46 47### MiniMax H3 è un buon generatore di video anime rispetto a Veo 3.1? 48 49Per la maggior parte dei lavori anime, H3, e principalmente per ragioni che non riguardano il rendering. Esegue da 4 a 15 secondi contro i 4, 6 o 8 di Veo, offre sei aspect ratio inclusi 4:3 e 21:9 contro i due di Veo, elenca il giapponese tra 11 lingue di dialogo nativamente stabili e accetta nove immagini di riferimento contro le tre di Veo. Veo 3.1 vince in una situazione specifica: quando hai bisogno di `seed` per ripetizioni riproducibili, o di `negative_prompt` per impedire a un'inquadratura di scivolare verso l'ombreggiatura 3D. H3 non ha nessuno dei due parametri. Se la tua pipeline dipende da uno di questi, è una ragione genuina per restare. 50 51### Veo 3.1 può generare anime in 4:3 o un clip di 15 secondi? 52 53No, e non per ragioni stilistiche. L'enum `aspect_ratio` di Veo 3.1 contiene esattamente `16:9` e `9:16`, e il suo enum `duration` contiene esattamente `4`, `6` e `8`. Non c'è un valore 4:3 da selezionare e nessun modo per richiedere 12 o 15 secondi. Se il tuo riferimento è un anime TV anni '90 o un OVA, l'inquadratura è fuori portata su Veo e disponibile su H3. 54 55### Perché il mio clip anime Veo 3.1 è tornato muto? 56 57Perché `generate_audio` è impostato su `false` per impostazione predefinita nell'API. L'interruttore nel playground è solitamente già attivo, quindi questo colpisce solo chi chiama direttamente l'API. Imposta esplicitamente `generate_audio: true`. Mentre sei lì, imposta anche `resolution`, poiché il default è `720p` piuttosto che il 1080p o 4k che probabilmente intendevi. 58 59### MiniMax H3 fa dialoghi in giapponese e lip-sync per anime? 60 61Sì. La scheda tecnica elenca 11 lingue con supporto stabile per i dialoghi: arabo, cinese, inglese, francese, tedesco, italiano, giapponese, coreano, portoghese, russo e spagnolo. L'audio è generato congiuntamente all'immagine a 32 kHz stereo piuttosto che doppiato successivamente, motivo per cui la sincronizzazione labiale regge per un'intera battuta invece che per le prime sillabe. Scrivi la frase giapponese direttamente nel prompt in giapponese. 62 63### Quante immagini di riferimento posso usare per mantenere coerente un personaggio anime? 64 65MiniMax H3 accetta fino a 9 immagini, fino a 3 clip video e fino a 3 clip audio, con un tetto massimo di 12 file in totale. L'endpoint reference-to-video di Veo 3.1 accetta da 1 a 3 immagini, e selezionandolo collassa `duration` a `8` come unico valore legale. Per un personaggio anime ricorrente in una serie, quella differenza è tutto. 66 67### MiniMax H3 ha pesi aperti, quindi posso eseguire la mia pipeline anime localmente gratuitamente? 68 69Puoi scaricarlo ed eseguirlo, con tre avvertenze. L'inferenza auto-ospitata funziona a un bordo corto di 768, e le fasi Context-IR e Regenerate-2K che producono 2K rimangono sul lato API. Le velocità locali nel mondo reale variano ampiamente a seconda della scheda: circa 10 minuti per un clip di 10 secondi a 480p su una 4070 Ti Super, circa 3 minuti su una 5080, circa 68 secondi su una RTX 6000 Pro, secondo il thread ComfyUI del giorno zero. E la licenza comunitaria non copre attualmente l'UE, il Regno Unito, la Corea del Sud o gli Stati Uniti, quindi se ti trovi in uno di questi, hai bisogno della licenza formale prima dell'uso commerciale.






