Per tutta l'estate il mio feed è stato lo stesso video in loop. Giocatori dei Mondiali ridisegnati come protagonisti shonen. Un dittatore. Un capitano pirata. Un mentore incanutito che compare negli ultimi quattro secondi. Milioni di visualizzazioni per post, e la trama si aggiorna dopo quasi ogni partita.
Nessuno di quelli che li realizza sta scrivendo post di benchmark. Scelgono un modello, bruciano crediti e pubblicano prima del calcio d'inizio successivo.
Così ho preso un keyframe anime e un prompt, e ho testato MiniMax H3 come generatore di video anime contro Veo 3.1, entrambi spinti al massimo delle impostazioni su input identici.
La prima cosa che si è rotta non è stata la qualità dell'immagine. È stato un menu a tendina. Veo 3.1 si ferma a 8 secondi e offre esattamente due rapporti d'aspetto. Un'inquadratura che tiene su un volto, una panoramica a frusta con la palla, poi lascia che una title card cada non entra in 8 secondi. Non ha mai avuto la possibilità di fallire sulla qualità.
Punti chiave
- L'enum
durationdi Veo 3.1 è[4, 6, 8]e il suoaspect_ratioè[16:9, 9:16]. MiniMax H3 accetta qualsiasi secondo intero da 4 a 15 e offre21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Nessun 4:3 su Veo significa nessuna inquadratura OVA retrò, punto. - La scheda tecnica di H3 elenca 11 lingue dialogiche nativamente stabili e il giapponese è una di queste. Audio e immagine sono generati insieme a 32 kHz stereo, non doppiati in seguito.
- I pacchetti di riferimento non sono simili: H3 accetta fino a 9 immagini più fino a 3 video e 3 clip audio (12 file massimo). L'endpoint di riferimento di Veo 3.1 accetta 3 immagini, e nel momento in cui lo usi
durationcollassa a solo[8]. - Due trappole che rovinano silenziosamente i test: l'API di Veo imposta
generate_audioafalseeresolutiona720pdi default, mentre ilratiodi H3 per text-to-video predefinito è1:1. Lasciali così e stai confrontando una clip silenziosa in 720p con una quadrata. - Veo 3.1 mantiene due cose che H3 non ha affatto:
seedenegative_prompt. Per l'anime 2D il secondo è davvero importante, e lo mostrerò dove.
MiniMax H3 Generatore Video Anime vs Veo 3.1, Lo Stesso Fotogramma Uno Dopo l'Altro
Un personaggio originale. Un keyframe. Un prompt, copiato identico in entrambi i modelli. Tutto il resto al massimo su ciascun lato.
MiniMax H3, image-to-video, 2K, 8 secondi, audio nativo. Alza il volume: il brusio della folla, il colpo alla palla e il grido giapponese sono generati nello stesso passaggio dell'immagine. Generato con minimax/h3/image-to-video su Atlas Cloud.
Veo 3.1, image-to-video, 1080p, 8 secondi, generateaudio attivato manualmente, più un negativeprompt che mantiene piatto il line art. Stesso primo fotogramma, stesse parole. Generato con google/veo3.1/image-to-video su Atlas Cloud.
Entrambi disegnano meravigliosamente. L'inquadratura ampia di Veo sul colpo, con linee d'impatto disegnate a mano e un effetto sonoro manga che fluttua nell'aria, è davvero incantevole. Questo è il punto di partenza onesto, ed è il motivo per cui il resto di questo articolo riguarda parametri e rispetto delle istruzioni piuttosto che vibrazioni.
Perché la Maggior Parte dei Test del Generatore Video Anime MiniMax H3 vs Veo 3.1 Sbagliano
Due cose sono successe contemporaneamente quest'estate.
L'anime è diventato il formato più diffuso nel video AI. La Coppa del Mondo 2026 è stata riscritta come un torneo shonen, con giocatori interpretati come un dittatore, un capitano pirata, un generale della marina e un mentore, e trame che "si evolvono dopo quasi ogni partita" su TikTok, Instagram, X e YouTube (Complex, luglio 2026).
E MiniMax H3 è stato rilasciato con pesi open. Il thread ComfyUI del giorno 0 ha raggiunto 330 punti e 95 commenti, con persone che hanno pubblicato numeri reali locali entro poche ore (Hacker News, agosto 2026).
Mettendo insieme queste cose, ti aspetteresti una marea di confronti sull'anime. Non ce ne sono quasi, perché la maggior parte dei test viene costruita male in uno di quattro modi.
Confrontano immagini, non vincoli. Le inquadrature anime sono tempismo. Una panoramica a frusta in una title card è un problema di durata prima di essere un problema di rendering.
Dimenticano che l'API di Veo è silenziosa per impostazione predefinita. Nell'API, generate_audio è false e resolution è 720p. Molti post "Veo non ha audio nell'anime" sono solo qualcuno che non ha mai attivato un booleano.
Dimenticano che H3 in text-to-video è quadrato per impostazione predefinita. ratio predefinito è 1:1, non 16:9. Esegui un prompt anime t2v senza impostarlo e ottieni una clip quadrata e una conclusione confusa.
Testano con prompt fotorealistici. "Cinematografico, luce volumetrica, profondità di campo ridotta" è esattamente il vocabolario che trascina un modello 2D verso l'ombreggiatura 3D. Il modo in cui fallisce l'anime non è la sfocatura. È la plastica.
Le tre impostazioni che decidono un test anime prima di premere run
Prima di qualsiasi altra cosa, imposta queste su entrambi i lati o il confronto è nullo.
| Impostazione | MiniMax H3 | Veo 3.1 | Cosa succede se la salti |
|---|---|---|---|
| Audio | Generato con l'immagine, sempre attivo | generate_audio predefinito a false | Veo restituisce una clip silenziosa e sembra peggiore di quanto sia |
| Forma del fotogramma | ratio predefinito a 1:1 su text-to-video | aspect_ratio predefinito a 16:9 | H3 ti dà un taglio anime quadrato che non puoi usare |
| Risoluzione | predefinita a 2K | predefinita a 720p | Confronti 2K contro 720p e lo chiami gap di qualità |
Il Foglio Tecnico Anime MiniMax H3 vs Veo 3.1: Durata, Rapporto, Audio, Riferimenti
Ho estratto gli schemi di input live di entrambi i modelli piuttosto che fidarmi di qualsiasi post di lancio. Ogni valore sotto è un enum che puoi leggere tu stesso sulle pagine dei modelli, non un'impressione.
Tabella 1: MiniMax H3 vs Veo 3.1, i parametri che decidono un'inquadratura anime
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Durata | Da 4 a 15, ogni secondo intero (predefinito 8) | 4, 6, 8 (predefinito 8) |
| Rapporti d'aspetto | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Rapporto predefinito (text-to-video) | 1:01 | 16:09 |
| Risoluzione | 768P, 2K (predefinito 2K) | 720p, 1080p, 4k (predefinito 720p) |
| Audio | Generato congiuntamente, 32 kHz stereo | generate_audio, predefinito false |
| Lingue dialogiche native | 11 stabili, giapponese incluso | Non pubblicato come elenco stabile |
| Pacchetto di riferimento | fino a 9 immagini, 3 video, 3 clip audio, 12 file totali | 3 immagini |
| Durata quando si usano riferimenti | ancora da 4 a 15 | collassa a solo 8 |
| seed | non disponibile | disponibile |
| negative_prompt | non disponibile | disponibile |
| Pesi | scaricabili | chiusi |
Durata, rapporto, risoluzione, audio e limiti dei riferimenti sono letti dagli schemi live sulle pagine MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video e Veo 3.1 reference-to-video. Il tetto di 9 immagini e 12 file e l'elenco di 11 lingue dialogiche provengono dalla scheda tecnica di MiniMax H3 (Hugging Face, agosto 2026).
Ora le classifiche, perché dicono qualcosa di diverso dal foglio tecnico e contano entrambe.
Tabella 2: Elo del voto pubblico e prezzo al minuto, istantanea del 7 agosto 2026
| Modello | Text-to-video (con audio) | Image-to-video (con audio) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1.244 (#1) ±7 | 1.191 (#2) ±9 | $6,00 |
| MiniMax H3 | 1.238 (#2) ±9 | 1.190 (#3) ±10 | $7,80 |
| Dreamina Seedance 2.0 720p | 1.224 (#3) ±6 | 1.198 (#1) ±7 | $9,07 |
| Kling 3.0 1080p (Pro) | 1.111 (#7) ±6 | non elencato nella top 10 | $20,16 |
| Veo 3.1 | 1.093 (#11) ±7 | 1.085 (#10) ±7 | $24,00 |
| Veo 3.1 Fast | 1.091 (#14) ±6 | non elencato nella top 10 | $9,00 |
| Veo 3.1 Lite | 1.089 (#15) ±7 | non elencato nella top 10 | $4,80 |
Punteggi Elo e prezzi da Artificial Analysis Video Arena (Artificial Analysis, agosto 2026). Sono voti pubblici mobili e cambiano. La colonna $/min è una stima normalizzata del modello, non la tua fattura.
Un divario Elo di 145 punti è grande, ma è un voto generico, non un voto anime. Ed ecco la parte che devo dire chiaramente: MiniMax non commercializza H3 come modello anime. Il feedback interno di prima linea elenca film, animazione e commedia-drammatica come le aree in cui H3 non è mirato. Quindi la domanda interessante non è "quale è il modello anime". È perché il modello che non si vende come anime vince comunque l'inquadratura, e dove Google continua a vincere il round.
Una nota pratica prima del tutorial. Ogni modello qui sotto viene eseguito attraverso la stessa console e la stessa chiave API, che è l'unico motivo per cui i parametri sono comparabili. Stessa coda, stessa autenticazione, un'unica fattura. Se imposti GPT Image 2 su un servizio e Veo su un altro, metà delle differenze che troverai saranno infrastrutture piuttosto che modello.
Costruisci l'Inquadratura: MiniMax H3 vs Veo 3.1, Passo dopo Passo
Un esempio reale, dall'inizio alla fine. "Ultimo Fischio": un attaccante adolescente originale, capelli rossi, maglia bianca e blu numero 9, fari dello stadio, una panoramica a frusta sul colpo, e una title card giapponese che deve atterrare negli ultimi due secondi e rimanere ferma.
Nessun giocatore reale, nessun personaggio ufficiale, nessun IP anime esistente. Solo stile e omaggio. Più avanti spiegherò perché.
Passo 1: Progetta il keyframe anime con GPT Image 2
Il keyframe porta la direzione artistica in modo che il modello video non debba inventarla. Nota lo spazio negativo sul terzo sinistro: è intenzionale. La title card viene scritta lì dal modello video, e questo è il test di stabilità del testo.
Plain1Un singolo fotogramma da un moderno anime sportivo shonen. Animazione 2D cel-shaded, line art 2disegnata a mano con spessore di linea costante, riempimenti di colore piatto, ombre grafiche 3dure, assolutamente nessuna ombreggiatura 3D e nessuna pelle fotorealistica. Primo piano di un 4attaccante adolescente originale: capelli rossi arruffati, divisa bianca e blu con il numero 9, 5sudore e strisce d'erba su una guancia, occhi spalancati con determinazione esausta, bocca aperta 6a metà di un grido. Dietro di lui, i fari dello stadio ardono in un muro di colore sfocato della 7folla; linee di velocità radiali esplodono dal centro dell'inquadratura; un filo d'erba rimane 8congelato nell'aria. Tavolozza satura, ombre ciano profonde, luce di bordo arancione calda. 9Composizione 16:9, il personaggio inquadrato a destra del centro, spazio negativo pulito sul 10terzo sinistro. Nessun testo nell'immagine.
Impostazioni: modello openai/gpt-image-2/text-to-image, qualità high, dimensione 16:9 (2048x1152). Nient'altro.

Playground di GPT Image 2 su Atlas Cloud con il prompt del keyframe di Ultimo Fischio e il fotogramma anime finito nel pannello di output
GPT Image 2 su Atlas Cloud: qualità impostata su alta, il keyframe finito a destra.

Il keyframe anime di base: un attaccante dai capelli rossi originale a metà grido sotto i fari dello stadio, cel-shaded con colore piatto e linee di velocità
Il keyframe che entrambi i modelli ricevono. Colore piatto, ombre dure e un terzo sinistro vuoto in attesa di una title card.
Passo 2: MiniMax H3 image-to-video, tutto al massimo
Stessa immagine in ingresso, 2K in uscita. Ho tenuto H3 a 8 secondi qui solo per corrispondere al tetto di Veo. Non è il limite di H3 e il Passo 4 toglie il limite.
Plain1Anime 2D cel-shaded, spessore di linea disegnato a mano, colore piatto, nessuna ombreggiatura 3D. 2Tieni il volto dell'attaccante per un battito, poi una violenta panoramica a frusta segue la palla 3mentre la colpisce, la panoramica sfuma l'inquadratura in scie di movimento sakuga striate. Un 4fotogramma di silenzio totale all'impatto. Negli ultimi due secondi, un audace lettering bianco 5giapponese con la scritta ラストホイッスル compare sul terzo sinistro dell'inquadratura e rimane 6perfettamente fermo, senza distorsioni, senza sfarfallio, senza deriva. L'attaccante grida una 7battuta in giapponese: 「まだ終わってない!」 8Audio: ruggito dello stadio che cresce, un singolo colpo secco di impatto della palla, un colpo 9di taiko basso sotto la title card.
Impostazioni: modello minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video prende la forma del fotogramma dall'immagine di input), image = output del Passo 1.
Un avvertimento se passi a text-to-video invece: scrivi ratio: 16:9 esplicitamente. Il valore predefinito è 1:1 e ti darà volentieri un taglio anime quadrato.

Playground di MiniMax H3 image-to-video su Atlas Cloud con il prompt di Ultimo Fischio, keyframe caricato e la clip finita nel pannello di output
MiniMax H3 image-to-video su Atlas Cloud: il keyframe del Passo 1 caricato a sinistra, la clip finita che riproduce a destra.
Passo 3: Veo 3.1 image-to-video, audio attivato manualmente
Il prompt è identico, parola per parola. Cambia un singolo aggettivo e smette di essere un confronto. Ciò che cambia è il campo extra che Veo ti dà e H3 no.
negative_prompt, che per l'anime 2D è il singolo controllo più utile di questa lista:
Plain1Rendering 3D, CGI, ombreggiatura plastica, pelle fotorealistica, filmati live action, zuppa di 2motion blur, lettering distorto, testo senza senso, dita extra, barra dei sottotitoli
Impostazioni: modello google/veo3.1/image-to-video, resolution: 1080p (cambialo, il predefinito è 720p), duration: 8 (questo è il tetto), aspect_ratio: 16:9, generate_audio: true (il predefinito API è false, questa è la trappola della clip silenziosa), seed: 20260807, image = lo stesso output del Passo 1.

Playground di Veo 3.1 image-to-video su Atlas Cloud che mostra l'audio di generazione abilitato, il keyframe anime caricato e la clip finita nel pannello di output
Veo 3.1 image-to-video su Atlas Cloud, con Genera Audio attivato e la clip finita a destra.
Passo 4: Valutalo su cinque assi specifici dell'anime
Niente da generare qui. Basta guardare, sulle cose in cui l'anime si rompe effettivamente. Entrambe le clip sono incorporate vicino all'inizio di questo articolo, così puoi valutarle tu stesso invece di credere alla mia parola.

Affiancamento del fotogramma finale di entrambe le clip, MiniMax H3 a sinistra con lettering giapponese pulito, Veo 3.1 a destra con caratteri verticali incomprensibili
L'ultimo fotogramma di ogni clip. A sinistra, H3 ha scritto ラストホイッスル, tutti gli otto katakana corretti e perfettamente fermi. A destra, Veo 3.1 ha scritto tre caratteri che non sono la parola richiesta e non formano una parola.
La title card è dove il round è stato deciso, e non è stato vicino. H3 ha reso esattamente i katakana richiesti, netti e stabili, su una panoramica striata della porta. Veo 3.1 ha prodotto una pila verticale di tre caratteri che non sono né la parola richiesta né una parola. Nello stesso fotogramma ha anche fatto uscire il personaggio dall'inquadratura e ha lasciato che lo sfondo scivolasse verso un platea di stadio semi-fotorealistica, nonostante pelle fotorealistica e rendering 3D fossero nel negative prompt.
Tabella 3: cinque assi che decidono un taglio anime, da queste due esecuzioni
| Asse | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Continuità del personaggio dal keyframe | Ha mantenuto il volto, i capelli e la divisa esatti per tutti gli 8 secondi | Ha ridisegnato il personaggio in una nuova inquadratura ampia, in modello ma un disegno diverso |
| Spessore di linea e ombreggiatura cel piatto | Mantenuto, nessuna deriva verso il 3D | Mantenuto nell'inquadratura media, scivolato verso una platea fotografica dello stadio alla fine |
| Title card giapponese | ラストホイッスル reso correttamente e tenuto fermo | Tre caratteri, non la parola richiesta, non una parola |
| Traccia audio consegnata | 32 kHz stereo, esattamente come dichiara la scheda tecnica | 48 kHz stereo, presente solo perché ho impostato generate_audio manualmente |
| Panoramica a frusta e scia sakuga | Eseguita come una panoramica sfumata nella title | Sostituita con un taglio netto a una nuova inquadratura |
Quell'ultima riga è la critica pubblica più forte a H3 finora, che è esattamente il motivo per cui l'ho scritta in entrambi i prompt. Nel thread ComfyUI del giorno 0, l'utente fwip si è lamentato che anche i prompt demo ufficiali venivano ignorati: "una violenta PANORAMICA A FRUSTA dal tetto che STRIZZA via le parole fluttuanti, striate di movimento. E il video semplicemente non ha fatto nessuna di quelle transizioni, l'ha sostituita con un taglio."
In questa esecuzione è stato Veo a scambiare la panoramica con un taglio, e H3 a sfumare. Una ripresa ciascuno non è una sentenza, e non direi il contrario. Ma significa che la critica non è specifica di H3: le panoramiche a frusta sono l'istruzione meno affidabile di tutto questo test, da entrambe le parti. Se il tuo storyboard dipende da una, progetta lo storyboard attorno ad essa piuttosto che attraverso di essa.
Passo 5: Il taglio OVA retrò 4:3 che Veo 3.1 strutturalmente non può produrre
Non è una preferenza di qualità. È un muro. L'enum aspect_ratio di Veo ha due valori e nessuno è 4:3, e il suo enum duration non ha 12. L'aspetto OVA degli anni '90 è semplicemente irraggiungibile.
Plain1Un taglio anime OVA degli anni '90, 4:3 full-frame. Sfondo dipinto a mano con texture a pennello 2visibile, personaggi in cel-paint con linee di inchiostro spesse e irregolari, forte alone di 3aloni attorno ai fari, grana cinematografica 16mm e leggero movimento del fotogramma. Lo stesso 4attaccante dai capelli rossi in divisa bianca e blu numero 9 esce da un campo inzuppato di 5pioggia mentre il rumore della folla svanisce in un singolo tono squillante. La telecamera si 6avvicina lentamente al suo viso. Dice tranquillamente in giapponese: 「次は、勝つ」. Tavolozza 7retrò: acquamarina tenue, ambra polverosa, ombre marroni profonde. Audio: pioggia lontana, un 8singolo pad synth analogico, un fischio con molto riverbero in lontananza.
Impostazioni: modello minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Imposta quel rapporto manualmente, ricorda il predefinito.

Playground di MiniMax H3 text-to-video su Atlas Cloud con il prompt OVA digitato e la clip retrò finita nel pannello di output
MiniMax H3 text-to-video su Atlas Cloud, prompt OVA digitato, clip completata. A piena divulgazione: questa particolare esecuzione ha lasciato Aspect Ratio a 16:9 e Duration a 8, quindi quello che vedi a destra è la versione breve panoramica. Il taglio 4:3 da dodici secondi sotto proviene dalla chiamata API con ratio: 4:3 e duration: 12 impostati esplicitamente.

Il taglio OVA retrò 4:3: lo stesso attaccante che esce da un campo inzuppato di pioggia in stile anime anni '90
H3 text-to-video, 4:3, 12 secondi. Il file consegnato è tornato 1920x1440, che è 4:3 al pixel, con una traccia stereo a 32 kHz. Mostrato qui come GIF silenziosa a frame rate ridotto per mantenere la pagina leggera. Generato con minimax/h3/text-to-video su Atlas Cloud.
Passo 6: Nove immagini di riferimento, un personaggio, quattro tagli
La coerenza del personaggio tra diverse inquadrature è il problema più difficile nell'anime AI, e si risolve con il volume di riferimento. Costruisci prima il pacchetto: ripeti il prompt del Passo 1 con l'inquadratura cambiata per frontale, tre quarti, profilo completo, schiena, che ride, denti stretti, in piedi a figura intera, dettaglio della divisa e dettaglio degli scarpini. Nove immagini, circa otto centesimi in totale.

Quattro angolazioni dello stesso personaggio attaccante originale generate come pacchetto di riferimento, disposte in una griglia due per due
Quattro delle nove angolazioni di riferimento. H3 accetta fino a nove immagini in un pacchetto di riferimento, più riferimenti video e audio in aggiunta.
Plain1Anime 2D cel-shaded, spessore di linea disegnato a mano coerente, colore piatto, nessuna ombreggiatura 3D. 2Mantieni il volto, la silhouette dei capelli e la divisa numero 9 del riferimento identici in ogni taglio. 3Quattro tagli in un'unica ripresa continua: (1) carrellata dal basso sugli scarpini che colpiscono 4l'erba, (2) panoramica a frusta verso l'alto fino a un primo piano stretto dei suoi occhi, 5(3) campo largo di lui che scatta oltre tre difensori disegnati come sagome sfocate, (4) fermo su 6un colpo di testa a mezz'aria, linee di velocità che esplodono verso l'esterno. Audio: ruggito 7della folla, respiro, impatti scarpino-erba, un colpo di taiko sul fermo.
Impostazioni: modello minimax/h3/reference-to-video, refers = le tue immagini con type: image, resolution: 2K, duration: 8 o superiore, ratio: adaptive o 16:9.
L'equivalente di Veo 3.1 non può essere eseguito con queste impostazioni e






