Seedance 2.5 è ora live — In anteprima su Atlas Cloud

MiniMax H3 Anime Video Generator: 15 Secondi, 4:3, e la Title Card Veo 3.1 Rovinata

MiniMax H3 generatore video anime vs Veo 3.1 sullo stesso keyframe. H3 va da 4 a 15 secondi e sei rapporti d'aspetto, Veo si ferma a 8 secondi e due. Dialogo in giapponese, 9 riferimenti, esecuzioni reali.

Per tutta l'estate il mio feed ha mostrato lo stesso video in loop. Giocatori dei Mondiali ridisegnati come protagonisti shonen. Un dittatore. Un capitano pirata. Un mentore incanutito che appare negli ultimi quattro secondi. Milioni di visualizzazioni per post, e la trama si aggiorna dopo quasi ogni partita.

Nessuno di quelli che li crea scrive post di benchmark. Scelgono un modello, bruciano crediti e pubblicano prima del calcio d'inizio successivo.

Così ho preso un keyframe anime e un prompt, e ho testato MiniMax H3 come generatore di video anime contro Veo 3.1, entrambi spinti al massimo delle loro impostazioni su input identici.

La prima cosa che si è rotta non è stata la qualità dell'immagine. È stato un menu a tendina. Veo 3.1 si ferma a 8 secondi e offre esattamente due aspect ratio. Un'inquadratura che tiene su un volto, una panoramica rapida con la palla, poi fa atterrare un titolo di testa, non ci sta in 8 secondi. Non ha mai avuto la possibilità di fallire sulla qualità.

Punti chiave

  • L'enum duration di Veo 3.1 è [4, 6, 8] e il suo enum aspect_ratio è [16:9, 9:16]. MiniMax H3 esegue qualsiasi secondo intero da 4 a 15 e offre 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Nessun 4:3 su Veo significa nessuna possibilità di inquadratura OVA retrò.
  • La scheda tecnica di H3 elenca 11 lingue di dialogo nativamente stabili e il giapponese è una di queste. Audio e immagine sono generati insieme a 32 kHz stereo, non doppiati in seguito.
  • I pacchetti di riferimento non sono vicini: H3 accetta fino a 9 immagini più fino a 3 video e 3 clip audio (max 12 file). L'endpoint di riferimento di Veo 3.1 accetta 3 immagini e, nel momento in cui lo usi, duration collassa a solo [8].
  • Due trappole che rovinano silenziosamente i test: l'API di Veo imposta generate_audio su false e resolution su 720p di default, e il ratio di text-to-video di H3 predefinisce 1:1. Lasciateli così e confronterete un clip silenzioso a 720p contro uno quadrato.
  • Veo 3.1 mantiene due cose che H3 non ha affatto: seed e negative_prompt. Per l'anime 2D, quest'ultimo è davvero importante, e lo mostrerò più avanti.

MiniMax H3 Generatore Video Anime vs Veo 3.1, Lo Stesso Fotogramma Uno di Fronte all'Altro

Un personaggio originale. Un keyframe. Un prompt, copiato carattere per carattere in entrambi i modelli. Tutto il resto al massimo per ciascun lato.

MiniMax H3, image-to-video, 2K, 8 secondi, audio nativo. Alza il volume: il rumore della folla, il colpo sulla palla e il grido giapponese sono generati nello stesso passaggio dell'immagine. Generato con minimax/h3/image-to-video su Atlas Cloud.

Veo 3.1, image-to-video, 1080p, 8 secondi, generateaudio attivato manualmente, più un negativeprompt che mantiene piatto il tratto del disegno. Stesso primo fotogramma, stesse parole. Generato con google/veo3.1/image-to-video su Atlas Cloud.

Entrambi disegnano magnificamente. L'inquadratura ampia di Veo sul colpo, con linee d'impatto disegnate a mano e un effetto sonoro manga che fluttua nell'aria, è davvero piacevole. Questo è il punto di partenza onesto, ed è il motivo per cui il resto di questo articolo riguarda parametri e aderenza alle istruzioni, piuttosto che sensazioni.

Perché la Maggior Parte dei Test tra MiniMax H3 Generatore Video Anime e Veo 3.1 Fallisce

Due cose sono successe contemporaneamente quest'estate.

L'anime è diventato il formato più popolare nel video AI. I Mondiali 2026 sono stati riscritti come un torneo shonen, con giocatori interpretati come un dittatore, un capitano pirata, un generale della marina e un mentore, e trame che "si evolvono dopo quasi ogni partita" su TikTok, Instagram, X e YouTube (Complex, luglio 2026).

E MiniMax H3 è stato rilasciato con pesi aperti. Il thread ComfyUI del giorno zero ha raggiunto 330 punti e 95 commenti, con persone che pubblicavano numeri reali locali entro poche ore (Hacker News, agosto 2026).

Mettendo insieme queste cose, ci si aspetterebbe una marea di confronti anime. Ce ne sono quasi nessuno, perché la maggior parte dei test viene costruita male in uno dei quattro modi seguenti.

Confrontano immagini, non vincoli. Le inquadrature anime sono questione di tempismo. Una panoramica rapida in un titolo di testa è un problema di durata prima di essere un problema di rendering.

Dimenticano che l'API di Veo è silenziosa per impostazione predefinita. Nell'API, generate_audio è false e resolution è 720p. Molti post del tipo "Veo non ha audio nell'anime" sono solo qualcuno che non ha mai attivato un booleano.

Dimenticano che il text-to-video di H3 è quadrato per impostazione predefinita. ratio predefinito è 1:1, non 16:9. Esegui un prompt anime t2v senza impostarlo e ottieni un clip quadrato e una conclusione confusa.

Testano con prompt fotorealistici. "Cinematografico, luce volumetrica, profondità di campo ridotta" è esattamente il vocabolario che trascina un modello 2D verso l'ombreggiatura di un render 3D. La modalità di fallimento nell'anime non è la sfocatura. È la plastica.

Le tre impostazioni che decidono un test anime prima di premere il pulsante di esecuzione

Prima di tutto, impostatele su entrambi i lati, altrimenti il confronto è nullo.

ImpostazioneMiniMax H3Veo 3.1Cosa succede se la salti
AudioGenerato con l'immagine, sempre attivogenerate_audio predefinito falseVeo restituisce un clip muto e sembra peggiore di quanto sia
Forma fotogrammaratio predefinito 1:1 su text-to-videoaspect_ratio predefinito 16:9H3 ti dà un taglio anime quadrato che non puoi usare
Risoluzionepredefinita 2Kpredefinita 720pConfronti 2K contro 720p e lo chiami un divario di qualità

La Scheda Tecnica Anime MiniMax H3 vs Veo 3.1: Durata, Aspect Ratio, Audio, Riferimenti

Ho estratto gli schemi di input live di entrambi i modelli invece di fidarmi di qualsiasi post di lancio. Ogni valore qui sotto è un enum che puoi leggere tu stesso sulle pagine dei modelli, non un'impressione.

Tabella 1: MiniMax H3 vs Veo 3.1, i parametri che decidono un'inquadratura anime

MiniMax H3Veo 3.1
DurataDa 4 a 15, ogni secondo intero (predefinito 8)4, 6, 8 (predefinito 8)
Aspect ratio21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
Ratio predefinito (text-to-video)1:0116:09
Risoluzione768P, 2K (predefinito 2K)720p, 1080p, 4k (predefinito 720p)
AudioGenerato congiuntamente, 32 kHz stereogenerate_audio, predefinito false
Lingue di dialogo native11 stabili, giapponese inclusoNon pubblicato come elenco stabile
Pacchetto di riferimentofino a 9 immagini, 3 video, 3 clip audio, 12 file totali3 immagini
Durata quando si usano riferimentiancora da 4 a 15collassa a solo 8
seednon disponibiledisponibile
negative_promptnon disponibiledisponibile
Pesiscaricabilichiusi

Durata, aspect ratio, risoluzione, audio e limiti dei riferimenti sono letti dagli schemi live sulle pagine MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video e Veo 3.1 reference-to-video. Il limite di 9 immagini e 12 file e l'elenco di 11 lingue di dialogo provengono dalla scheda tecnica MiniMax H3 (Hugging Face, agosto 2026).

Ora le classifiche, perché dicono qualcosa di diverso dalla scheda tecnica ed entrambe contano.

Tabella 2: Elo voto popolare e prezzo al minuto, snapshot 7 agosto 2026

ModelText-to-video (con audio)Image-to-video (con audio)$/min
Gemini Omni Flash1.244 (#1) ±71.191 (#2) ±9$6.00
MiniMax H31.238 (#2) ±91.190 (#3) ±10$7.80
Dreamina Seedance 2.0 720p1.224 (#3) ±61.198 (#1) ±7$9.07
Kling 3.0 1080p (Pro)1.111 (#7) ±6non nella top 10$20.16
Veo 3.11.093 (#11) ±71.085 (#10) ±7$24.00
Veo 3.1 Fast1.091 (#14) ±6non nella top 10$9.00
Veo 3.1 Lite1.089 (#15) ±7non nella top 10$4.80

Dati Elo e prezzi da Artificial Analysis Video Arena (Artificial Analysis, agosto 2026). Sono voti popolari mobili e cambiano. La colonna $/min è una stima normalizzata del modello, non la tua fattura.

Un divario Elo di 145 punti è grande, ma è un voto generico, non un voto anime. E qui c'è la parte che devo dire chiaramente: MiniMax non commercializza H3 come un modello anime. Il feedback interno di prima linea elenca film, animazione e commedia-drammatica come le aree in cui H3 non è mirato. Quindi la domanda interessante non è "quale è il modello anime". È perché il modello che non si vende sull'anime vince comunque l'inquadratura, e dove Google si prende ancora il round.

Una nota pratica prima del tutorial. Ogni modello qui sotto viene eseguito attraverso la stessa console e la stessa chiave API, che è l'unica ragione per cui i parametri sono confrontabili. Stessa coda, stessa autenticazione, un'unica fattura. Se configuri GPT Image 2 su un servizio e Veo su un altro, metà delle differenze che troverai saranno dovute all'infrastruttura, non al modello.

Costruisci l'Inquadratura: MiniMax H3 vs Veo 3.1, Passo dopo Passo

Un esempio concreto, dall'inizio alla fine. "Ultimo Fischio": un attaccante adolescente originale, capelli rossi, maglia bianca e blu numero 9, luci dello stadio, una panoramica rapida sul tiro, e un titolo di testa in giapponese che deve atterrare negli ultimi due secondi e rimanere fermo.

Nessun vero giocatore, nessun personaggio ufficiale, nessun IP anime esistente. Solo stile e omaggio. Più avanti spiegherò perché.

Passo 1: Progetta il keyframe anime con GPT Image 2

Il keyframe porta la direzione artistica, così il modello video non deve inventarla. Nota lo spazio negativo sul terzo sinistro: è intenzionale. Il titolo di testa viene scritto lì dal modello video, e questa è la prova di stabilità del testo.

Plain
1Un singolo fotogramma da un moderno anime sportivo shonen. Animazione 2D cel-shaded, line art
2disegnata a mano con spessore di tratto costante, riempimenti di colore piatto, ombre grafiche
3dure, assolutamente nessuna ombreggiatura 3D e nessuna pelle fotorealistica. Primo piano su un
4attaccante adolescente originale: capelli rossi arruffati, maglia bianca e blu con il numero 9,
5sudore e strisce d'erba su una guancia, occhi spalancati con determinazione esausta, bocca
6aperta a metà di un grido. Dietro di lui, i riflettori dello stadio brillano in un muro di
7colore della folla sfocato; linee di velocità radiali scoppiano dal centro del fotogramma;
8un filo d'erba rimane congelato nell'aria. Tavolozza satura, ombre ciano profonde, caldo
9bordo di luce arancione. Composizione 16:9, il personaggio inquadrato a destra del centro,
10spazio negativo pulito sul terzo sinistro. Nessun testo nell'immagine.

Impostazioni: modello openai/gpt-image-2/text-to-image, qualità high, formato 16:9 (2048x1152). Nient'altro.

Interfaccia del generatore di immagini AI che mostra il prompt e l'immagine generata del giocatore di calcio anime

Playground di GPT Image 2 su Atlas Cloud con il prompt del keyframe di Ultimo Fischio e il fotogramma anime finito nel pannello di output

GPT Image 2 su Atlas Cloud: qualità impostata su alta, il keyframe finito a destra.

Giocatore di calcio anime dai capelli rossi che urla in uno stadio affollato

Il keyframe anime di base: un attaccante originale dai capelli rossi a metà grido sotto i riflettori dello stadio, cel-shaded con colore piatto e linee di velocità

Il keyframe che entrambi i modelli ricevono. Colore piatto, ombre dure e un terzo sinistro vuoto in attesa di un titolo di testa.

Passo 2: MiniMax H3 image-to-video, tutto al massimo

Stessa immagine in ingresso, 2K in uscita. Ho tenuto H3 a 8 secondi qui solo per eguagliare il limite di Veo. Non è il limite di H3 e il Passo 4 rimuove il tetto.

Plain
1Anime 2D cel-shaded, spessore di tratto disegnato a mano, colore piatto, nessuna ombreggiatura 3D.
2Tieni sul volto dell'attaccante per un momento, poi una violenta panoramica rapida segue la
3palla mentre la colpisce, la panoramica sfuma il fotogramma in scie di movimento sakuga
4striate. Un fotogramma di silenzio totale all'impatto. Negli ultimi due secondi, un carattere
5in grassetto bianco giapponese che legge ラストホイッスル appare sul terzo sinistro del
6fotogramma e rimane fermissimo, nessuna deformazione, nessuno sfarfallio, nessuna deriva.
7L'attaccante grida una frase in giapponese: 「まだ終わってない!」
8Audio: ruggito dello stadio che cresce, un singolo impatto netto sulla palla, un colpo di
9taiko basso sotto il titolo di testa.

Impostazioni: modello minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video prende la forma del fotogramma dall'immagine di input), image = output del Passo 1.

Un avvertimento se passi invece a text-to-video: scrivi esplicitamente ratio: 16:9. Il default è 1:1 e ti darà volentieri un taglio anime quadrato.

Interfaccia del generatore di video AI che mostra il prompt testuale e il video anime generato

Playground di MiniMax H3 image-to-video su Atlas Cloud con il prompt di Ultimo Fischio, keyframe caricato e il clip finito nel pannello di output

MiniMax H3 image-to-video su Atlas Cloud: il keyframe del Passo 1 caricato a sinistra, il clip finito in riproduzione a destra.

Passo 3: Veo 3.1 image-to-video, audio attivato manualmente

Il prompt è identico, parola per parola. Cambia un singolo aggettivo e smette di essere un confronto. Ciò che cambia è il campo extra che Veo ti dà e H3 no.

negative_prompt, che per l'anime 2D è il controllo più utile di questa lista:

Plain
13D render, CGI, ombreggiatura plastica, pelle fotorealistica, filmato live action, zuppa di
2motion blur, lettering deformato, testo senza senso, dita in più, barra dei sottotitoli

Impostazioni: modello google/veo3.1/image-to-video, resolution: 1080p (cambialo, il default è 720p), duration: 8 (questo è il limite), aspect_ratio: 16:9, generate_audio: true (il default API è false, questa è la trappola del clip muto), seed: 20260807, image = stesso output del Passo 1.

Interfaccia del generatore di video AI che mostra le impostazioni di input e il video anime generato

Playground di Veo 3.1 image-to-video su Atlas Cloud che mostra l'audio di generazione abilitato, il keyframe anime caricato e il clip finito nel pannello di output

Veo 3.1 image-to-video su Atlas Cloud, con Genera Audio attivato e il clip finito a destra.

Passo 4: Valutalo su cinque assi specifici per anime

Niente da generare qui. Basta guardare, sulle cose su cui l'anime si rompe davvero. Entrambi i clip sono incorporati vicino all'inizio di questo articolo, quindi puoi valutarli tu stesso invece di credere alla mia parola.

Confronto affiancato di scene di stadi di calcio sfocate e nitide

Confronto affiancato dell'ultimo fotogramma di entrambi i clip, MiniMax H3 a sinistra con lettering giapponese pulito del titolo, Veo 3.1 a destra con caratteri verticali senza senso

L'ultimo fotogramma di ogni clip. A sinistra, H3 ha scritto ラストホイッスル, tutti e otto i katakana corretti e fermi. A destra, Veo 3.1 ha scritto tre caratteri che non sono la parola richiesta e non ne formano una.

Il titolo di testa è dove si è deciso il round, e non è stato vicino. H3 ha reso esattamente i katakana richiesti, netti e stabili, su una panoramica striata della porta. Veo 3.1 ha prodotto una pila verticale di tre caratteri che non sono né la parola richiesta né una parola. Nello stesso fotogramma ha anche fatto uscire il personaggio dall'inquadratura e ha lasciato che lo sfondo scivolasse verso un'immagine semi-fotorealistica dello stadio, nonostante photorealistic skin e 3D render fossero nel negative prompt.

Tabella 3: cinque assi che decidono un taglio anime, da queste due esecuzioni

AsseMiniMax H3Veo 3.1
Continuità del personaggio dal keyframeHa mantenuto l'esatto volto, capelli e maglia per tutti gli 8 secondiHa ridisegnato il personaggio in una nuova inquadratura ampia, in modello ma un disegno diverso
Spessore del tratto e ombreggiatura cel piattaMantenuto, nessuna deriva verso il 3DMantenuto nell'inquadratura media, scivolato verso un fondale fotografico dello stadio alla fine
Titolo di testa giapponeseラストホイッスル reso correttamente e mantenuto fermoTre caratteri, non la parola richiesta, non una parola
Traccia audio consegnata32 kHz stereo, esattamente come dichiara la scheda tecnica48 kHz stereo, presente solo perché ho impostato generate_audio manualmente
Panoramica rapida e scia sakugaEseguita come una panoramica sfumata nel titoloSostituita con un taglio netto a una nuova impostazione

L'ultima riga è la critica pubblica più forte a H3 finora, che è esattamente il motivo per cui l'ho scritta in entrambi i prompt. Sul thread ComfyUI del giorno zero, l'utente fwip si è lamentato che anche i prompt demo ufficiali venivano ignorati: "una violenta PANORAMICA RAPIDA dal tetto che STRASCINA via le parole fluttuanti, striate di movimento. E il video semplicemente non ha fatto nessuna di quelle transizioni, le ha sostituite con un taglio."

In questa esecuzione è stato Veo a scambiare la panoramica con un taglio, e H3 a sfumare. Un take ciascuno non è un verdetto, e non direi il contrario. Ma significa che la critica non è specifica di H3: le panoramiche rapide sono l'istruzione meno affidabile in tutto questo test, su entrambi i lati. Se il tuo storyboard dipende da una, progetta lo storyboard intorno ad essa piuttosto che attraverso di essa.

Passo 5: Il taglio OVA retrò 4:3 che Veo 3.1 strutturalmente non può produrre

Questa non è una preferenza di qualità. È un muro. L'enum aspect_ratio di Veo ha due valori e nessuno è 4:3, e il suo enum duration non ha 12. L'aspetto OVA anni '90 è semplicemente irraggiungibile.

Plain
1Un taglio anime OVA degli anni '90, 4:3 full-frame. Fondali dipinti a mano con texture di
2pennello visibile, personaggi dipinti su cell con linee spesse e irregolari, alone di
3alone pesante attorno ai riflettori, grana della pellicola 16mm e leggero movimento del
4fotogramma. Lo stesso attaccante dai capelli rossi con una maglia numero 9 bianca e blu
5cammina fuori da un campo bagnato dalla pioggia mentre il rumore della folla svanisce in
6un unico tono squillante. La telecamera si avvicina lentamente al suo volto. Dice
7piano in giapponese: 「次は、勝つ」. Tavolozza retrò: acquamarina spenta, ambra polverosa,
8ombre marroni profonde. Audio: pioggia lontana, un singolo pad sintetico analogico, un
9fischio con molto riverbero in lontananza.

Impostazioni: modello minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Imposta quel ratio manualmente, ricorda il default.

Interfaccia del generatore di video AI che mostra il prompt testuale e il video anime generato

Playground di MiniMax H3 text-to-video su Atlas Cloud con il prompt OVA digitato e il clip retrò finito nel pannello di output

MiniMax H3 text-to-video su Atlas Cloud, prompt OVA digitato, clip completato. Piena trasparenza: questa particolare esecuzione ha lasciato Aspect Ratio a 16:9 e Duration a 8, quindi quello che vedi a destra è la versione breve widescreen. Il taglio 4:3 da dodici secondi qui sotto proviene dalla chiamata API con ratio: 4:3 e duration: 12 impostati esplicitamente.

Giocatore di calcio anime in uniforme sporca in piedi in uno stadio

Il taglio OVA retrò 4:3: lo stesso attaccante che cammina fuori da un campo bagnato dalla pioggia in stile anime anni '90

H3 text-to-video, 4:3, 12 secondi. Il file consegnato è tornato 1920x1440, che è 4:3 al pixel, con una traccia stereo a 32 kHz. Mostrato qui come GIF muta a frame rate ridotto per mantenere la pagina leggera. Generato con minimax/h3/text-to-video su Atlas Cloud.

Passo 6: Nove immagini di riferimento, un personaggio, quattro tagli

La coerenza del personaggio tra inquadrature diverse è il problema più difficile nell'AI anime, e si risolve con il volume di riferimenti. Costruisci prima il pacchetto: ripeti il prompt del Passo 1 con l'inquadratura cambiata per fronte, tre quarti, profilo completo, schiena, che ride, denti stretti, posa a figura intera, dettaglio maglia e dettaglio scarpa. Nove immagini, circa otto centesimi in totale.

Quattro illustrazioni di un giocatore di calcio anime dai capelli rossi con la maglia numero 9

Quattro angolazioni dello stesso personaggio attaccante originale generato come pacchetto di riferimento, disposte in una griglia due per due

Quattro delle nove angolazioni di riferimento. H3 accetta fino a nove immagini in un pacchetto di riferimento, più video e audio sopra.

Plain
1Anime 2D cel-shaded, spessore di tratto disegnato a mano costante, colore piatto, nessuna
2ombreggiatura 3D. Mantieni il volto, la silhouette dei capelli e la maglia numero 9 del
3riferimento identici in ogni taglio. Quattro tagli in un'unica ripresa continua: (1) push-in
4dal basso sui suoi stivali che toccano l'erba, (2) panoramica rapida verso l'alto fino a un
5primo piano stretto dei suoi occhi, (3) inquadratura ampia di lui che scatta oltre tre
6difensori disegnati come silhouette sfocate, (4) freeze su un colpo di testa a mezz'aria,
7linee di velocità che esplodono verso l'esterno. Audio: ruggito della folla, respiro, impatti
8stivali-erba, un colpo di taiko sul freeze.

Impostazioni: modello minimax/h3/reference-to-video, refers = le tue immagini con type: image, resolution: 2K, duration: 8 o superiore, ratio: adaptive o 16:9.

L'equivalente di Veo 3.1 non può essere eseguito con queste impostazioni e non devi provarlo per sapere perché. Il suo endpoint di riferimento accetta un massimo di tre immagini, e scegliere quell'endpoint collassa duration a un singolo valore legale di 8. Un pacchetto di nove immagini e un take di 10 secondi sono entrambi fuori portata.

Interfaccia del generatore di video AI che mostra l'input del prompt e il video anime generato

Playground di MiniMax H3 reference-to-video su Atlas Cloud che mostra il contatore dei riferimenti a quattro su nove e il primo taglio nel pannello di output

MiniMax H3 reference-to-video su Atlas Cloud. Il contatore legge Reference Materials (4/9) con MAX:9 sotto, che è il limite nell'interfaccia piuttosto che un'affermazione da una scheda tecnica. L'output è il primo taglio, il push-in dal basso sugli stivali.

Quattro Ulteriori Esecuzioni del Generatore Video Anime MiniMax H3 che Vale la Pena Fare

L'inquadratura di Ultimo Fischio mette alla prova solo quattro delle differenze. Queste quattro mettono alla prova il resto. Tutte girano su H3; le note dicono quali Veo 3.1 può eguagliare.

  1. Combattimento sakuga ultrawide, 21:9 , 10 secondi. Veo non può produrre 21:9.
Plain
1Azione anime 2D cel-shaded, linee di inchiostro spesse e affusolate, colore piatto, ombre
2dure, nessuna ombreggiatura 3D. Due duellanti mascherati originali su un tetto di un tempio
3spazzato dal vento al crepuscolo. Scontro di lame, il fotogramma trema, entrambi i
4combattenti si separano in uno scoppio di fotogrammi di impatto disegnati a mano e linee
5di velocità radiali. Telecamera: push-in dal basso, poi una traccia laterale, poi un
6passaggio a una silhouette ampia contro il cielo arancione. Audio: due scontri metallici
7acuti, scatto di stoffa, un colpo di taiko basso sul freeze finale, nessuna musica.
  1. Taglio AMV sincronizzato al beat, reference-to-video con un riferimento audio. H3 accetta fino a tre clip audio come input di riferimento. Veo 3.1 non ha alcun input audio, solo output audio.
Plain
1Montaggio anime 2D cel-shaded tagliato sulla traccia audio di riferimento. Cinque brevi
2battiti: pioggia su una finestra, una mano che stringe una benda, uno skyline della città
3che sfreccia oltre il finestrino di un treno, un via di scatto, un freeze su una mano tesa.
4Ogni taglio atterra esattamente su un downbeat dell'audio di riferimento. Colore piatto,
5linee di inchiostro spesse, tavolozza notturna ad alto contrasto di indaco intenso e
6magenta neon.
  1. Scena di dialogo in giapponese di due battute, 12 secondi. Questo è il test di stress del lip-sync, e 12 secondi sono già fuori dalla portata di Veo.
Plain
1Anime 2D cel-shaded, colore piatto, nessuna ombreggiatura 3D. Due personaggi originali su un
2tetto all'ora d'oro, campo-controcampo. Il primo dice in giapponese: 「本当に行くの?」.
3Il secondo risponde, con mezzo sorriso, in giapponese: 「もう決めた」. Le bocche
4corrispondono a ogni sillaba. Caldo bordo di luce, ombre lunghe, vento gentile tra i capelli.
5Audio: due voci giapponesi distinte, traffico lontano, una cicala.
  1. Cortometraggio shonen verticale, 9:16 , 8 secondi. Entrambi i modelli possono fare verticale, quindi questo è l'unico posto per confrontarli direttamente A/B piuttosto che assumere.
Plain
1Anime 2D cel-shaded, composizione verticale. Un'adolescente attaccante originale irrompe
2attraverso uno striscione di carta al rallentatore, poi il fotogramma torna a velocità piena
3mentre accelera lungo una pista dello stadio. Linee di velocità, colore piatto, ombre dure,
4cielo grafico audace. Telecamera: inquadratura di follow dal basso, poi una panoramica
5rapida verso il suo volto. Audio: strappo dello striscione, ondata di folla, un respiro
6trattenuto poi rilasciato.
7
8Se vuoi la grammatica del prompt dietro questi, la [guida ai prompt di MiniMax H3](https://www.atlascloud.ai/blog/guides/minimax-h3-prompt-guide?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) approfondisce come H3 analizza le istruzioni di telecamera e audio più di quanto io possa fare qui.
9
10## Quanto Costa un'Opening Anime di 60 Secondi su MiniMax H3 vs Veo 3.1
11
12Una OP anime standard dura circa 90 secondi. Diciamo otto inquadrature da 8 secondi, 64 secondi di video finito, più un keyframe per inquadratura a $0,009 ciascuno.
13
14C'è una reale discrepanza di prezzo che dovresti conoscere piuttosto che lasciarmi nascondere. Il catalogo di Atlas Cloud elenca MiniMax H3 a $0,10 al secondo fisso, mentre il readme del modello lo suddivide in $0,14/s a 2K e $0,10/s a 768P. Veo 3.1 è elencato a $0,20 al secondo, mentre il suo readme separa $0,40/s con audio da $0,20/s senza.
15
16I pulsanti di esecuzione nei miei screenshot lo risolvono. H3 reference-to-video, 8 secondi a 2K, quotato `Run $1,12`, che è esattamente $0,14 al secondo. Veo 3.1 image-to-video, 8 secondi a 1080p con audio attivo, quotato `Run $3,2`, che è esattamente $0,40 al secondo. Quindi le tariffe del readme sono quelle che vengono addebitate, e il titolo del catalogo è il livello di ingresso. Ho comunque mostrato entrambe le letture qui sotto. Questi sono prezzi di listino ad agosto 2026.
17
18**Tabella 4: otto inquadrature da 8 secondi, keyframe inclusi**
19
20| Setup                     | Costo video (tariffa catalogo) | Costo video (tariffa readme) | Keyframe | Intervallo totale |
21| ------------------------- | ------------------------------ | ---------------------------- | -------- | ----------------- |
22| MiniMax H3, 2K            | $6,40                          | $8,96                        | $0,07    | $6,47 a $9,03     |
23| MiniMax H3, 768P          | $6,40                          | $6,40                        | $0,07    | $6,47             |
24| Veo 3.1, 1080p con audio  | $12,80                         | $25,60                       | $0,07    | $12,87 a $25,67   |
25| Veo 3.1 Lite, 720p        | $3,20                          | $3,20                        | $0,07    | $3,27             |
26
27Prezzi presi dalle pagine dei modelli Atlas Cloud collegate nella Tabella 1, agosto 2026. Nessuno di questi quattro è scontato al momento.
28
29Due cose che quella tabella non include, ed entrambe colpiscono più duramente della tariffa al secondo.
30
31**Ripetizioni.** Nessuno pubblica il primo take di un'inquadratura anime. Qualunque moltiplicatore tu assuma, applicalo a entrambe le colonne e il divario si allarga nella stessa proporzione.
32
33**Tempo reale, e questo va nella direzione opposta.** Cronometrato dall'inizio alla fine il 7 agosto 2026: H3 a 2K per 8 secondi ha impiegato 447 secondi, circa 7,5 minuti. H3 text-to-video a 2K per 12 secondi ha impiegato 334 secondi. Veo 3.1 a 1080p per 8 secondi con audio ha impiegato 152 secondi, meno di tre minuti. Veo è circa tre volte più veloce per un primo take qui, e se stai iterando su un'inquadratura alle 2 del mattino, questo vale soldi veri. Le code si muovono, quindi trattali come un'istantanea di un pomeriggio, non come una specifica. Ma chi cita "da 2 a 3 minuti" per H3 a 2K sta citando un readme, non una coda. La [suddivisione 2K vs 768P](https://www.atlascloud.ai/blog/guides/minimax-h3-2k-vs-768p?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) copre quando vale la pena il livello superiore per i minuti extra.
34
35## Stile Anime, Omaggio e Cosa Puoi Effettivamente Pubblicare
36
37Tutto in questo articolo è stile e omaggio. Un personaggio originale, una maglia originale, un titolo originale. Nessun personaggio anime ufficiale è stato generato o richiesto, e nessun nome o somiglianza di un vero calciatore è stato utilizzato. Il trend dei Mondiali è citato come un _formato_, perché è ciò per cui è utile.
38
39Quella distinzione non è una decorazione. Se stai producendo contenuti in stile anime commercialmente, "nello stile degli OVA anni '90" e "questo personaggio specifico di questo show specifico" sono oggetti legali diversi, e solo uno di essi è un'attività commerciale.
40
41Sui pesi aperti: H3 è genuinamente scaricabile, e le persone lo hanno eseguito dal primo giorno. Un commentatore ha riportato 10 minuti per un clip di 10 secondi a 480p su una 4070 Ti Super con 16 GB, e altri hanno postato 3 minuti su una 5080 e 68 secondi su una RTX 6000 Pro. Ma l'hosting locale funziona a un bordo corto di 768; le fasi Context-IR e Regenerate-2K che producono 2K rimangono sul lato API.
42
43La licenza ha una vera fregatura. La licenza comunitaria non copre attualmente l'UE, il Regno Unito, la Corea del Sud o gli Stati Uniti, citando regioni "attualmente in fase di sviluppo o applicazione di normative relative all'IA". Un canale formale di richiesta di licenza è aperto, che un commentatore HN ha riassunto come "devi solo promettere con il mignolo che non farai arrabbiare Disney e ti invieranno una licenza". Divertente, e anche esattamente il passaggio di conformità che non puoi saltare se ti trovi in uno di quei quattro territori. L'[articolo sui pesi aperti](https://www.atlascloud.ai/blog/guides/minimax-h3-open-source-weights?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) ha l'elenco completo dei territori.
44
45## Domande Frequenti
46
47### MiniMax H3 è un buon generatore di video anime rispetto a Veo 3.1?
48
49Per la maggior parte dei lavori anime, H3, e principalmente per ragioni che non riguardano il rendering. Esegue da 4 a 15 secondi contro i 4, 6 o 8 di Veo, offre sei aspect ratio inclusi 4:3 e 21:9 contro i due di Veo, elenca il giapponese tra 11 lingue di dialogo nativamente stabili e accetta nove immagini di riferimento contro le tre di Veo. Veo 3.1 vince in una situazione specifica: quando hai bisogno di `seed` per ripetizioni riproducibili, o di `negative_prompt` per impedire a un'inquadratura di scivolare verso l'ombreggiatura 3D. H3 non ha nessuno dei due parametri. Se la tua pipeline dipende da uno di questi, è una ragione genuina per restare.
50
51### Veo 3.1 può generare anime in 4:3 o un clip di 15 secondi?
52
53No, e non per ragioni stilistiche. L'enum `aspect_ratio` di Veo 3.1 contiene esattamente `16:9` e `9:16`, e il suo enum `duration` contiene esattamente `4`, `6` e `8`. Non c'è un valore 4:3 da selezionare e nessun modo per richiedere 12 o 15 secondi. Se il tuo riferimento è un anime TV anni '90 o un OVA, l'inquadratura è fuori portata su Veo e disponibile su H3.
54
55### Perché il mio clip anime Veo 3.1 è tornato muto?
56
57Perché `generate_audio` è impostato su `false` per impostazione predefinita nell'API. L'interruttore nel playground è solitamente già attivo, quindi questo colpisce solo chi chiama direttamente l'API. Imposta esplicitamente `generate_audio: true`. Mentre sei lì, imposta anche `resolution`, poiché il default è `720p` piuttosto che il 1080p o 4k che probabilmente intendevi.
58
59### MiniMax H3 fa dialoghi in giapponese e lip-sync per anime?
60
61Sì. La scheda tecnica elenca 11 lingue con supporto stabile per i dialoghi: arabo, cinese, inglese, francese, tedesco, italiano, giapponese, coreano, portoghese, russo e spagnolo. L'audio è generato congiuntamente all'immagine a 32 kHz stereo piuttosto che doppiato successivamente, motivo per cui la sincronizzazione labiale regge per un'intera battuta invece che per le prime sillabe. Scrivi la frase giapponese direttamente nel prompt in giapponese.
62
63### Quante immagini di riferimento posso usare per mantenere coerente un personaggio anime?
64
65MiniMax H3 accetta fino a 9 immagini, fino a 3 clip video e fino a 3 clip audio, con un tetto massimo di 12 file in totale. L'endpoint reference-to-video di Veo 3.1 accetta da 1 a 3 immagini, e selezionandolo collassa `duration` a `8` come unico valore legale. Per un personaggio anime ricorrente in una serie, quella differenza è tutto.
66
67### MiniMax H3 ha pesi aperti, quindi posso eseguire la mia pipeline anime localmente gratuitamente?
68
69Puoi scaricarlo ed eseguirlo, con tre avvertenze. L'inferenza auto-ospitata funziona a un bordo corto di 768, e le fasi Context-IR e Regenerate-2K che producono 2K rimangono sul lato API. Le velocità locali nel mondo reale variano ampiamente a seconda della scheda: circa 10 minuti per un clip di 10 secondi a 480p su una 4070 Ti Super, circa 3 minuti su una 5080, circa 68 secondi su una RTX 6000 Pro, secondo il thread ComfyUI del giorno zero. E la licenza comunitaria non copre attualmente l'UE, il Regno Unito, la Corea del Sud o gli Stati Uniti, quindi se ti trovi in uno di questi, hai bisogno della licenza formale prima dell'uso commerciale.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli