Seedance 2.5 è ora live — In anteprima su Atlas Cloud

MiniMax H3 Anime Video Generator: 15 secondi, 4:3, e la title card Veo 3.1 rovinata

MiniMax H3 anime video generator vs Veo 3.1 sullo stesso keyframe. H3 va da 4 a 15 secondi e sei rapporti, Veo si ferma a 8 secondi e due. Dialogo in giapponese, 9 riferimenti, esecuzioni reali.

Per tutta l'estate il mio feed è stato lo stesso video in loop. Giocatori dei Mondiali ridisegnati come protagonisti shonen. Un dittatore. Un capitano pirata. Un mentore incanutito che compare negli ultimi quattro secondi. Milioni di visualizzazioni per post, e la trama si aggiorna dopo quasi ogni partita.

Nessuno di quelli che li realizza sta scrivendo post di benchmark. Scelgono un modello, bruciano crediti e pubblicano prima del calcio d'inizio successivo.

Così ho preso un keyframe anime e un prompt, e ho testato MiniMax H3 come generatore di video anime contro Veo 3.1, entrambi spinti al massimo delle impostazioni su input identici.

La prima cosa che si è rotta non è stata la qualità dell'immagine. È stato un menu a tendina. Veo 3.1 si ferma a 8 secondi e offre esattamente due rapporti d'aspetto. Un'inquadratura che tiene su un volto, una panoramica a frusta con la palla, poi lascia che una title card cada non entra in 8 secondi. Non ha mai avuto la possibilità di fallire sulla qualità.

Punti chiave

  • L'enum duration di Veo 3.1 è [4, 6, 8] e il suo aspect_ratio è [16:9, 9:16]. MiniMax H3 accetta qualsiasi secondo intero da 4 a 15 e offre 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Nessun 4:3 su Veo significa nessuna inquadratura OVA retrò, punto.
  • La scheda tecnica di H3 elenca 11 lingue dialogiche nativamente stabili e il giapponese è una di queste. Audio e immagine sono generati insieme a 32 kHz stereo, non doppiati in seguito.
  • I pacchetti di riferimento non sono simili: H3 accetta fino a 9 immagini più fino a 3 video e 3 clip audio (12 file massimo). L'endpoint di riferimento di Veo 3.1 accetta 3 immagini, e nel momento in cui lo usi duration collassa a solo [8].
  • Due trappole che rovinano silenziosamente i test: l'API di Veo imposta generate_audio a false e resolution a 720p di default, mentre il ratio di H3 per text-to-video predefinito è 1:1. Lasciali così e stai confrontando una clip silenziosa in 720p con una quadrata.
  • Veo 3.1 mantiene due cose che H3 non ha affatto: seed e negative_prompt. Per l'anime 2D il secondo è davvero importante, e lo mostrerò dove.

MiniMax H3 Generatore Video Anime vs Veo 3.1, Lo Stesso Fotogramma Uno Dopo l'Altro

Un personaggio originale. Un keyframe. Un prompt, copiato identico in entrambi i modelli. Tutto il resto al massimo su ciascun lato.

MiniMax H3, image-to-video, 2K, 8 secondi, audio nativo. Alza il volume: il brusio della folla, il colpo alla palla e il grido giapponese sono generati nello stesso passaggio dell'immagine. Generato con minimax/h3/image-to-video su Atlas Cloud.

Veo 3.1, image-to-video, 1080p, 8 secondi, generateaudio attivato manualmente, più un negativeprompt che mantiene piatto il line art. Stesso primo fotogramma, stesse parole. Generato con google/veo3.1/image-to-video su Atlas Cloud.

Entrambi disegnano meravigliosamente. L'inquadratura ampia di Veo sul colpo, con linee d'impatto disegnate a mano e un effetto sonoro manga che fluttua nell'aria, è davvero incantevole. Questo è il punto di partenza onesto, ed è il motivo per cui il resto di questo articolo riguarda parametri e rispetto delle istruzioni piuttosto che vibrazioni.

Perché la Maggior Parte dei Test del Generatore Video Anime MiniMax H3 vs Veo 3.1 Sbagliano

Due cose sono successe contemporaneamente quest'estate.

L'anime è diventato il formato più diffuso nel video AI. La Coppa del Mondo 2026 è stata riscritta come un torneo shonen, con giocatori interpretati come un dittatore, un capitano pirata, un generale della marina e un mentore, e trame che "si evolvono dopo quasi ogni partita" su TikTok, Instagram, X e YouTube (Complex, luglio 2026).

E MiniMax H3 è stato rilasciato con pesi open. Il thread ComfyUI del giorno 0 ha raggiunto 330 punti e 95 commenti, con persone che hanno pubblicato numeri reali locali entro poche ore (Hacker News, agosto 2026).

Mettendo insieme queste cose, ti aspetteresti una marea di confronti sull'anime. Non ce ne sono quasi, perché la maggior parte dei test viene costruita male in uno di quattro modi.

Confrontano immagini, non vincoli. Le inquadrature anime sono tempismo. Una panoramica a frusta in una title card è un problema di durata prima di essere un problema di rendering.

Dimenticano che l'API di Veo è silenziosa per impostazione predefinita. Nell'API, generate_audio è false e resolution è 720p. Molti post "Veo non ha audio nell'anime" sono solo qualcuno che non ha mai attivato un booleano.

Dimenticano che H3 in text-to-video è quadrato per impostazione predefinita. ratio predefinito è 1:1, non 16:9. Esegui un prompt anime t2v senza impostarlo e ottieni una clip quadrata e una conclusione confusa.

Testano con prompt fotorealistici. "Cinematografico, luce volumetrica, profondità di campo ridotta" è esattamente il vocabolario che trascina un modello 2D verso l'ombreggiatura 3D. Il modo in cui fallisce l'anime non è la sfocatura. È la plastica.

Le tre impostazioni che decidono un test anime prima di premere run

Prima di qualsiasi altra cosa, imposta queste su entrambi i lati o il confronto è nullo.

ImpostazioneMiniMax H3Veo 3.1Cosa succede se la salti
AudioGenerato con l'immagine, sempre attivogenerate_audio predefinito a falseVeo restituisce una clip silenziosa e sembra peggiore di quanto sia
Forma del fotogrammaratio predefinito a 1:1 su text-to-videoaspect_ratio predefinito a 16:9H3 ti dà un taglio anime quadrato che non puoi usare
Risoluzionepredefinita a 2Kpredefinita a 720pConfronti 2K contro 720p e lo chiami gap di qualità

Il Foglio Tecnico Anime MiniMax H3 vs Veo 3.1: Durata, Rapporto, Audio, Riferimenti

Ho estratto gli schemi di input live di entrambi i modelli piuttosto che fidarmi di qualsiasi post di lancio. Ogni valore sotto è un enum che puoi leggere tu stesso sulle pagine dei modelli, non un'impressione.

Tabella 1: MiniMax H3 vs Veo 3.1, i parametri che decidono un'inquadratura anime

MiniMax H3Veo 3.1
DurataDa 4 a 15, ogni secondo intero (predefinito 8)4, 6, 8 (predefinito 8)
Rapporti d'aspetto21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
Rapporto predefinito (text-to-video)1:0116:09
Risoluzione768P, 2K (predefinito 2K)720p, 1080p, 4k (predefinito 720p)
AudioGenerato congiuntamente, 32 kHz stereogenerate_audio, predefinito false
Lingue dialogiche native11 stabili, giapponese inclusoNon pubblicato come elenco stabile
Pacchetto di riferimentofino a 9 immagini, 3 video, 3 clip audio, 12 file totali3 immagini
Durata quando si usano riferimentiancora da 4 a 15collassa a solo 8
seednon disponibiledisponibile
negative_promptnon disponibiledisponibile
Pesiscaricabilichiusi

Durata, rapporto, risoluzione, audio e limiti dei riferimenti sono letti dagli schemi live sulle pagine MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video e Veo 3.1 reference-to-video. Il tetto di 9 immagini e 12 file e l'elenco di 11 lingue dialogiche provengono dalla scheda tecnica di MiniMax H3 (Hugging Face, agosto 2026).

Ora le classifiche, perché dicono qualcosa di diverso dal foglio tecnico e contano entrambe.

Tabella 2: Elo del voto pubblico e prezzo al minuto, istantanea del 7 agosto 2026

ModelloText-to-video (con audio)Image-to-video (con audio)$/min
Gemini Omni Flash1.244 (#1) ±71.191 (#2) ±9$6,00
MiniMax H31.238 (#2) ±91.190 (#3) ±10$7,80
Dreamina Seedance 2.0 720p1.224 (#3) ±61.198 (#1) ±7$9,07
Kling 3.0 1080p (Pro)1.111 (#7) ±6non elencato nella top 10$20,16
Veo 3.11.093 (#11) ±71.085 (#10) ±7$24,00
Veo 3.1 Fast1.091 (#14) ±6non elencato nella top 10$9,00
Veo 3.1 Lite1.089 (#15) ±7non elencato nella top 10$4,80

Punteggi Elo e prezzi da Artificial Analysis Video Arena (Artificial Analysis, agosto 2026). Sono voti pubblici mobili e cambiano. La colonna $/min è una stima normalizzata del modello, non la tua fattura.

Un divario Elo di 145 punti è grande, ma è un voto generico, non un voto anime. Ed ecco la parte che devo dire chiaramente: MiniMax non commercializza H3 come modello anime. Il feedback interno di prima linea elenca film, animazione e commedia-drammatica come le aree in cui H3 non è mirato. Quindi la domanda interessante non è "quale è il modello anime". È perché il modello che non si vende come anime vince comunque l'inquadratura, e dove Google continua a vincere il round.

Una nota pratica prima del tutorial. Ogni modello qui sotto viene eseguito attraverso la stessa console e la stessa chiave API, che è l'unico motivo per cui i parametri sono comparabili. Stessa coda, stessa autenticazione, un'unica fattura. Se imposti GPT Image 2 su un servizio e Veo su un altro, metà delle differenze che troverai saranno infrastrutture piuttosto che modello.

Costruisci l'Inquadratura: MiniMax H3 vs Veo 3.1, Passo dopo Passo

Un esempio reale, dall'inizio alla fine. "Ultimo Fischio": un attaccante adolescente originale, capelli rossi, maglia bianca e blu numero 9, fari dello stadio, una panoramica a frusta sul colpo, e una title card giapponese che deve atterrare negli ultimi due secondi e rimanere ferma.

Nessun giocatore reale, nessun personaggio ufficiale, nessun IP anime esistente. Solo stile e omaggio. Più avanti spiegherò perché.

Passo 1: Progetta il keyframe anime con GPT Image 2

Il keyframe porta la direzione artistica in modo che il modello video non debba inventarla. Nota lo spazio negativo sul terzo sinistro: è intenzionale. La title card viene scritta lì dal modello video, e questo è il test di stabilità del testo.

Plain
1Un singolo fotogramma da un moderno anime sportivo shonen. Animazione 2D cel-shaded, line art
2disegnata a mano con spessore di linea costante, riempimenti di colore piatto, ombre grafiche
3dure, assolutamente nessuna ombreggiatura 3D e nessuna pelle fotorealistica. Primo piano di un
4attaccante adolescente originale: capelli rossi arruffati, divisa bianca e blu con il numero 9,
5sudore e strisce d'erba su una guancia, occhi spalancati con determinazione esausta, bocca aperta
6a metà di un grido. Dietro di lui, i fari dello stadio ardono in un muro di colore sfocato della
7folla; linee di velocità radiali esplodono dal centro dell'inquadratura; un filo d'erba rimane
8congelato nell'aria. Tavolozza satura, ombre ciano profonde, luce di bordo arancione calda.
9Composizione 16:9, il personaggio inquadrato a destra del centro, spazio negativo pulito sul
10terzo sinistro. Nessun testo nell'immagine.

Impostazioni: modello openai/gpt-image-2/text-to-image, qualità high, dimensione 16:9 (2048x1152). Nient'altro.

Interfaccia del generatore di immagini AI che mostra passaggi numerati per creare un'immagine anime

Playground di GPT Image 2 su Atlas Cloud con il prompt del keyframe di Ultimo Fischio e il fotogramma anime finito nel pannello di output

GPT Image 2 su Atlas Cloud: qualità impostata su alta, il keyframe finito a destra.

Atleta anime dai capelli rossi che grida intensamente in uno stadio affollato

Il keyframe anime di base: un attaccante dai capelli rossi originale a metà grido sotto i fari dello stadio, cel-shaded con colore piatto e linee di velocità

Il keyframe che entrambi i modelli ricevono. Colore piatto, ombre dure e un terzo sinistro vuoto in attesa di una title card.

Passo 2: MiniMax H3 image-to-video, tutto al massimo

Stessa immagine in ingresso, 2K in uscita. Ho tenuto H3 a 8 secondi qui solo per corrispondere al tetto di Veo. Non è il limite di H3 e il Passo 4 toglie il limite.

Plain
1Anime 2D cel-shaded, spessore di linea disegnato a mano, colore piatto, nessuna ombreggiatura 3D.
2Tieni il volto dell'attaccante per un battito, poi una violenta panoramica a frusta segue la palla
3mentre la colpisce, la panoramica sfuma l'inquadratura in scie di movimento sakuga striate. Un
4fotogramma di silenzio totale all'impatto. Negli ultimi due secondi, un audace lettering bianco
5giapponese con la scritta ラストホイッスル compare sul terzo sinistro dell'inquadratura e rimane
6perfettamente fermo, senza distorsioni, senza sfarfallio, senza deriva. L'attaccante grida una
7battuta in giapponese: 「まだ終わってない!」
8Audio: ruggito dello stadio che cresce, un singolo colpo secco di impatto della palla, un colpo
9di taiko basso sotto la title card.

Impostazioni: modello minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video prende la forma del fotogramma dall'immagine di input), image = output del Passo 1.

Un avvertimento se passi a text-to-video invece: scrivi ratio: 16:9 esplicitamente. Il valore predefinito è 1:1 e ti darà volentieri un taglio anime quadrato.

Interfaccia del generatore video AI che mostra il prompt di input e il video di output

Playground di MiniMax H3 image-to-video su Atlas Cloud con il prompt di Ultimo Fischio, keyframe caricato e la clip finita nel pannello di output

MiniMax H3 image-to-video su Atlas Cloud: il keyframe del Passo 1 caricato a sinistra, la clip finita che riproduce a destra.

Passo 3: Veo 3.1 image-to-video, audio attivato manualmente

Il prompt è identico, parola per parola. Cambia un singolo aggettivo e smette di essere un confronto. Ciò che cambia è il campo extra che Veo ti dà e H3 no.

negative_prompt, che per l'anime 2D è il singolo controllo più utile di questa lista:

Plain
1Rendering 3D, CGI, ombreggiatura plastica, pelle fotorealistica, filmati live action, zuppa di
2motion blur, lettering distorto, testo senza senso, dita extra, barra dei sottotitoli

Impostazioni: modello google/veo3.1/image-to-video, resolution: 1080p (cambialo, il predefinito è 720p), duration: 8 (questo è il tetto), aspect_ratio: 16:9, generate_audio: true (il predefinito API è false, questa è la trappola della clip silenziosa), seed: 20260807, image = lo stesso output del Passo 1.

Interfaccia del generatore video AI che mostra le impostazioni di input e il video anime generato

Playground di Veo 3.1 image-to-video su Atlas Cloud che mostra l'audio di generazione abilitato, il keyframe anime caricato e la clip finita nel pannello di output

Veo 3.1 image-to-video su Atlas Cloud, con Genera Audio attivato e la clip finita a destra.

Passo 4: Valutalo su cinque assi specifici dell'anime

Niente da generare qui. Basta guardare, sulle cose in cui l'anime si rompe effettivamente. Entrambe le clip sono incorporate vicino all'inizio di questo articolo, così puoi valutarle tu stesso invece di credere alla mia parola.

Scene di stadi di calcio affiancate etichettate MiniMax H3 e Veo 3.1

Affiancamento del fotogramma finale di entrambe le clip, MiniMax H3 a sinistra con lettering giapponese pulito, Veo 3.1 a destra con caratteri verticali incomprensibili

L'ultimo fotogramma di ogni clip. A sinistra, H3 ha scritto ラストホイッスル, tutti gli otto katakana corretti e perfettamente fermi. A destra, Veo 3.1 ha scritto tre caratteri che non sono la parola richiesta e non formano una parola.

La title card è dove il round è stato deciso, e non è stato vicino. H3 ha reso esattamente i katakana richiesti, netti e stabili, su una panoramica striata della porta. Veo 3.1 ha prodotto una pila verticale di tre caratteri che non sono né la parola richiesta né una parola. Nello stesso fotogramma ha anche fatto uscire il personaggio dall'inquadratura e ha lasciato che lo sfondo scivolasse verso un platea di stadio semi-fotorealistica, nonostante pelle fotorealistica e rendering 3D fossero nel negative prompt.

Tabella 3: cinque assi che decidono un taglio anime, da queste due esecuzioni

AsseMiniMax H3Veo 3.1
Continuità del personaggio dal keyframeHa mantenuto il volto, i capelli e la divisa esatti per tutti gli 8 secondiHa ridisegnato il personaggio in una nuova inquadratura ampia, in modello ma un disegno diverso
Spessore di linea e ombreggiatura cel piattoMantenuto, nessuna deriva verso il 3DMantenuto nell'inquadratura media, scivolato verso una platea fotografica dello stadio alla fine
Title card giapponeseラストホイッスル reso correttamente e tenuto fermoTre caratteri, non la parola richiesta, non una parola
Traccia audio consegnata32 kHz stereo, esattamente come dichiara la scheda tecnica48 kHz stereo, presente solo perché ho impostato generate_audio manualmente
Panoramica a frusta e scia sakugaEseguita come una panoramica sfumata nella titleSostituita con un taglio netto a una nuova inquadratura

Quell'ultima riga è la critica pubblica più forte a H3 finora, che è esattamente il motivo per cui l'ho scritta in entrambi i prompt. Nel thread ComfyUI del giorno 0, l'utente fwip si è lamentato che anche i prompt demo ufficiali venivano ignorati: "una violenta PANORAMICA A FRUSTA dal tetto che STRIZZA via le parole fluttuanti, striate di movimento. E il video semplicemente non ha fatto nessuna di quelle transizioni, l'ha sostituita con un taglio."

In questa esecuzione è stato Veo a scambiare la panoramica con un taglio, e H3 a sfumare. Una ripresa ciascuno non è una sentenza, e non direi il contrario. Ma significa che la critica non è specifica di H3: le panoramiche a frusta sono l'istruzione meno affidabile di tutto questo test, da entrambe le parti. Se il tuo storyboard dipende da una, progetta lo storyboard attorno ad essa piuttosto che attraverso di essa.

Passo 5: Il taglio OVA retrò 4:3 che Veo 3.1 strutturalmente non può produrre

Non è una preferenza di qualità. È un muro. L'enum aspect_ratio di Veo ha due valori e nessuno è 4:3, e il suo enum duration non ha 12. L'aspetto OVA degli anni '90 è semplicemente irraggiungibile.

Plain
1Un taglio anime OVA degli anni '90, 4:3 full-frame. Sfondo dipinto a mano con texture a pennello
2visibile, personaggi in cel-paint con linee di inchiostro spesse e irregolari, forte alone di
3aloni attorno ai fari, grana cinematografica 16mm e leggero movimento del fotogramma. Lo stesso
4attaccante dai capelli rossi in divisa bianca e blu numero 9 esce da un campo inzuppato di
5pioggia mentre il rumore della folla svanisce in un singolo tono squillante. La telecamera si
6avvicina lentamente al suo viso. Dice tranquillamente in giapponese: 「次は、勝つ」. Tavolozza
7retrò: acquamarina tenue, ambra polverosa, ombre marroni profonde. Audio: pioggia lontana, un
8singolo pad synth analogico, un fischio con molto riverbero in lontananza.

Impostazioni: modello minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Imposta quel rapporto manualmente, ricorda il predefinito.

Interfaccia del generatore video AI con prompt di testo e video anime generato

Playground di MiniMax H3 text-to-video su Atlas Cloud con il prompt OVA digitato e la clip retrò finita nel pannello di output

MiniMax H3 text-to-video su Atlas Cloud, prompt OVA digitato, clip completata. A piena divulgazione: questa particolare esecuzione ha lasciato Aspect Ratio a 16:9 e Duration a 8, quindi quello che vedi a destra è la versione breve panoramica. Il taglio 4:3 da dodici secondi sotto proviene dalla chiamata API con ratio: 4:3 e duration: 12 impostati esplicitamente.

Giocatore di calcio anime dai capelli rossi in piedi in una divisa sporca all'interno di uno stadio

Il taglio OVA retrò 4:3: lo stesso attaccante che esce da un campo inzuppato di pioggia in stile anime anni '90

H3 text-to-video, 4:3, 12 secondi. Il file consegnato è tornato 1920x1440, che è 4:3 al pixel, con una traccia stereo a 32 kHz. Mostrato qui come GIF silenziosa a frame rate ridotto per mantenere la pagina leggera. Generato con minimax/h3/text-to-video su Atlas Cloud.

Passo 6: Nove immagini di riferimento, un personaggio, quattro tagli

La coerenza del personaggio tra diverse inquadrature è il problema più difficile nell'anime AI, e si risolve con il volume di riferimento. Costruisci prima il pacchetto: ripeti il prompt del Passo 1 con l'inquadratura cambiata per frontale, tre quarti, profilo completo, schiena, che ride, denti stretti, in piedi a figura intera, dettaglio della divisa e dettaglio degli scarpini. Nove immagini, circa otto centesimi in totale.

Concreto e specifico? Sì (specifica quattro illustrazioni, capelli rossi, anime, calcio

Quattro angolazioni dello stesso personaggio attaccante originale generate come pacchetto di riferimento, disposte in una griglia due per due

Quattro delle nove angolazioni di riferimento. H3 accetta fino a nove immagini in un pacchetto di riferimento, più riferimenti video e audio in aggiunta.

Plain
1Anime 2D cel-shaded, spessore di linea disegnato a mano coerente, colore piatto, nessuna ombreggiatura 3D.
2Mantieni il volto, la silhouette dei capelli e la divisa numero 9 del riferimento identici in ogni taglio.
3Quattro tagli in un'unica ripresa continua: (1) carrellata dal basso sugli scarpini che colpiscono
4l'erba, (2) panoramica a frusta verso l'alto fino a un primo piano stretto dei suoi occhi,
5(3) campo largo di lui che scatta oltre tre difensori disegnati come sagome sfocate, (4) fermo su
6un colpo di testa a mezz'aria, linee di velocità che esplodono verso l'esterno. Audio: ruggito
7della folla, respiro, impatti scarpino-erba, un colpo di taiko sul fermo.

Impostazioni: modello minimax/h3/reference-to-video, refers = le tue immagini con type: image, resolution: 2K, duration: 8 o superiore, ratio: adaptive o 16:9.

L'equivalente di Veo 3.1 non può essere eseguito con queste impostazioni e

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli