Tout l'été, mon fil d'actualité a tourné en boucle sur la même vidéo. Des joueurs de Coupe du Monde redessinés en protagonistes shonen. Un dictateur. Un capitaine pirate. Un mentor buriné qui apparaît dans les quatre dernières secondes. Des millions de vues par publication, et l'intrigue se met à jour après presque chaque match.
Personne ne publie de benchmarks. On choisit un modèle, on brûle des crédits, et on livre avant le coup d'envoi suivant.
J'ai donc pris une image clé d'anime et un prompt, et testé MiniMax H3 comme générateur de vidéo d'anime face à Veo 3.1, tous deux poussés à leurs réglages maximum sur des entrées identiques.
La première chose qui a cassé n'était pas la qualité d'image. C'était une liste déroulante. Veo 3.1 s'arrête à 8 secondes et propose exactement deux ratios d'aspect. Un plan qui tient sur un visage, des whip pans avec le ballon, puis laisse un carton titre atterrir ne tient pas en 8 secondes. Il n'a jamais eu la chance d'échouer sur la qualité.
Points clés
- L'énumération
durationde Veo 3.1 est[4, 6, 8]et son énumérationaspect_ratioest[16:9, 9:16]. MiniMax H3 accepte n'importe quelle seconde entière de 4 à 15 et propose21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Pas de 4:3 sur Veo signifie pas de cadrage rétro OVA, point. - La fiche modèle de H3 liste 11 langues de dialogue nativement stables, et le japonais en fait partie. L'audio et l'image sont générés ensemble en stéréo 32 kHz, pas doublés après coup.
- Les packs de référence ne sont pas comparables : H3 accepte jusqu'à 9 images plus jusqu'à 3 vidéos et 3 clips audio (12 fichiers max). L'endpoint de référence de Veo 3.1 prend 3 images, et dès que vous l'utilisez,
durationse réduit à[8]uniquement. - Deux pièges qui ruinent silencieusement les tests : l'API de Veo a
generate_audiopar défaut àfalseetresolutionà720p, et leratiode la text-to-video de H3 est par défaut1:1. Laissez-les ainsi, et vous comparez un clip 720p silencieux à un clip carré. - Veo 3.1 conserve deux choses que H3 n'a pas du tout :
seedetnegative_prompt. Pour l'anime 2D, ce second paramètre compte vraiment, et je montrerai où.
MiniMax H3 Générateur de Vidéo d'Anime vs Veo 3.1, La Même Image en Boucle
Un personnage original. Une image clé. Un prompt, copié caractère par caractère dans les deux modèles. Tout le reste poussé au maximum de chaque côté.
MiniMax H3, image vers vidéo, 2K, 8 secondes, audio natif. Activez le son : le bruit de la foule, le coup de pied et le cri japonais sont générés dans la même passe que l'image. Généré avec minimax/h3/image-to-video sur Atlas Cloud.
Veo 3.1, image vers vidéo, 1080p, 8 secondes, generateaudio activé manuellement, plus un negativeprompt qui maintient le line art plat. Même première image, mêmes mots. Généré avec google/veo3.1/image-to-video sur Atlas Cloud.
Les deux dessinent magnifiquement. Le plan large de Veo du coup de pied, avec des lignes d'impact dessinées à la main et un effet sonore manga flottant dans l'air, est vraiment charmant. C'est le point de départ honnête, et c'est pourquoi le reste de cet article porte sur les paramètres et le respect des instructions plutôt que sur les impressions.
Pourquoi la Plupart des Tests du Générateur de Vidéo d'Anime MiniMax H3 vs Veo 3.1 échouent
Deux choses se sont produites en même temps cet été.
L'anime est devenu le format le plus utilisé dans la vidéo IA. La Coupe du Monde 2026 a été réécrite comme un tournoi shonen, avec des joueurs incarnant un dictateur, un capitaine pirate, un général de marine et un mentor, et des intrigues qui « évoluent après presque chaque match » sur TikTok, Instagram, X et YouTube (Complex, juillet 2026).
Et MiniMax H3 est sorti avec des poids ouverts. Le fil ComfyUI du jour 0 a atteint 330 points et 95 commentaires, avec des gens publiant des chiffres locaux réels en quelques heures (Hacker News, août 2026).
Mettez ces deux éléments ensemble, et on s'attendrait à une pile de comparaisons d'anime. Il n'y en a presque pas, car la plupart des tests sont construits de travers d'une des quatre manières suivantes.
Ils comparent les images, pas les contraintes. Les plans d'anime sont une question de timing. Un whip pan suivi d'un carton titre est un problème de durée avant d'être un problème de rendu.
Ils oublient que l'API de Veo est silencieuse par défaut. Sur l'API, generate_audio est false et resolution est 720p. Beaucoup de messages « Veo n'a pas d'audio dans l'anime » viennent juste de quelqu'un qui n'a jamais activé un booléen.
Ils oublient que la text-to-video de H3 est carrée par défaut. ratio par défaut à 1:1, pas 16:9. Lancer un prompt d'anime t2v sans le définir vous donne un clip carré et une conclusion confuse.
Ils testent avec des prompts photoréalistes. « Cinématique, lumière volumétrique, faible profondeur de champ » est exactement le vocabulaire qui tire un modèle 2D vers un rendu 3D. Le mode d'échec dans l'anime n'est pas le flou. C'est le plastique.
Les trois réglages qui décident d'un test d'anime avant d'appuyer sur Run
Avant toute chose, définissez ces paramètres des deux côtés, sinon la comparaison est nulle.
| Réglage | MiniMax H3 | Veo 3.1 | Ce qui se passe si vous l'ignorez |
|---|---|---|---|
| Audio | Généré avec l'image, toujours activé | generate_audio par défaut false | Veo renvoie un clip silencieux et semble pire qu'il n'est |
| Format d'image | ratio par défaut 1:1 en text-to-video | aspect_ratio par défaut 16:9 | H3 vous donne un carré d'anime inutilisable |
| Résolution | par défaut 2K | par défaut 720p | Vous comparez 2K contre 720p et appelez ça un écart de qualité |
Vous voulez tester MiniMax H3 et Veo 3.1 sur le même prompt d'anime vous-même ? La comparaison de modèles d'Atlas Cloud les exécute côte à côte en une seule passe — même prompt et réglages, coût affiché avant de générer.

MiniMax H3 et Veo 3.1 sur le même prompt d'anime dans la comparaison de modèles d'Atlas Cloud — mêmes réglages, prix affiché avant de générer. Capturé en direct sur le model-explorer.
La Fiche Technique de l'Anime MiniMax H3 vs Veo 3.1 : Durée, Ratio, Audio, Références
J'ai récupéré les schémas d'entrée en direct des deux modèles plutôt que de me fier à un message de lancement. Chaque valeur ci-dessous est une énumération que vous pouvez lire vous-même sur les pages des modèles, pas une impression.
Tableau 1 : MiniMax H3 vs Veo 3.1, les paramètres qui décident d'un plan d'anime
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Durée | 4 à 15, chaque seconde entière (défaut 8) | 4, 6, 8 (défaut 8) |
| Ratios d'aspect | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Ratio par défaut (text-to-video) | 1:01 | 16:09 |
| Résolution | 768P, 2K (défaut 2K) | 720p, 1080p, 4k (défaut 720p) |
| Audio | Généré conjointement, stéréo 32 kHz | generate_audio, défaut false |
| Langues de dialogue natives | 11 stables, japonais inclus | Non publié comme liste stable |
| Pack de référence | jusqu'à 9 images, 3 vidéos, 3 clips audio, 12 fichiers max | 3 images |
| Durée avec références | toujours 4 à 15 | réduite à 8 seulement |
| seed | non disponible | disponible |
| negative_prompt | non disponible | disponible |
| Poids | téléchargeables | fermés |
Durée, ratio, résolution, audio et limites de référence sont lus à partir des schémas en direct des pages MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video et Veo 3.1 reference-to-video. Le plafond de 9 images et 12 fichiers et la liste de 11 langues de dialogue proviennent de la fiche modèle MiniMax H3 (Hugging Face, août 2026).
Maintenant les classements, car ils disent quelque chose de différent de la fiche technique, et les deux comptent.
Tableau 2 : Elo des votes de la foule et prix par minute, instantané du 7 août 2026
| Modèle | Texte vers vidéo (avec audio) | Image vers vidéo (avec audio) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1 244 (#1) ±7 | 1 191 (#2) ±9 | 6,00 $ |
| MiniMax H3 | 1 238 (#2) ±9 | 1 190 (#3) ±10 | 7,80 $ |
| Dreamina Seedance 2.0 720p | 1 224 (#3) ±6 | 1 198 (#1) ±7 | 9,07 $ |
| Kling 3.0 1080p (Pro) | 1 111 (#7) ±6 | non listé dans le top 10 | 20,16 $ |
| Veo 3.1 | 1 093 (#11) ±7 | 1 085 (#10) ±7 | 24,00 $ |
| Veo 3.1 Fast | 1 091 (#14) ±6 | non listé dans le top 10 | 9,00 $ |
| Veo 3.1 Lite | 1 089 (#15) ±7 | non listé dans le top 10 | 4,80 $ |
Chiffres Elo et prix issus de l'Artificial Analysis Video Arena (Artificial Analysis, août 2026). Ce sont des votes de la foule glissants et ils évoluent. La colonne $/min est une estimation de modèle normalisée, pas votre facture.
Un écart Elo de 145 points est important, mais c'est un vote général, pas un vote spécifique à l'anime. Et voici la partie que je dois dire clairement : MiniMax ne commercialise pas H3 comme un modèle d'anime. Les retours de première ligne internes listent le film, l'animation et le drame comique comme les domaines auxquels H3 n'est pas destiné. Donc la question intéressante n'est pas « lequel est le modèle d'anime ». C'est pourquoi le modèle qui ne se vend pas comme animateur remporte tout de même le plan, et où Google remporte encore la manche.
Une note pratique avant le tutoriel. Chaque modèle ci-dessous s'exécute via la même console et la même clé API, ce qui est la seule raison pour laquelle les paramètres sont comparables. Même file d'attente, même authentification, une seule facture. Si vous configurez GPT Image 2 sur un service et Veo sur un autre, la moitié des différences que vous trouverez seront de la plomberie plutôt que du modèle.
Construire le Plan : MiniMax H3 vs Veo 3.1, Étape par Étape
Un exemple concret, du début à la fin. « Dernier Coup de Sifflet » : un attaquant adolescent original, cheveux roux, maillot blanc et marine numéro 9, projecteurs, un whip pan sur le tir, et un carton titre japonais qui doit atterrir dans les deux dernières secondes et tenir stable.
Pas de vrai joueur, pas de personnage officiel, pas de propriété intellectuelle d'anime existante. Style et hommage uniquement. Plus d'explications sur pourquoi dans un instant.
Étape 1 : Concevoir l'image clé de l'anime avec GPT Image 2
L'image clé porte la direction artistique afin que le modèle vidéo n'ait pas à l'inventer. Notez l'espace négatif sur le tiers gauche : il est délibéré. Le carton titre y sera écrit par le modèle vidéo, et c'est le test de stabilité du texte.
Plain1Un plan unique d'un anime sportif shonen moderne. Animation 2D cel-shaded, line art encré 2à la main avec une épaisseur de trait constante, remplissages de couleur unie, ombres 3graphiques dures, absolument aucun ombrage 3D ni peau photoréaliste. Gros plan sur un 4attaquant adolescent original : cheveux roux en bataille, tenue blanche et marine avec le 5numéro 9, sueur et traînées d'herbe sur une joue, yeux écarquillés de détermination 6épuisée, bouche ouverte au milieu d'un cri. Derrière lui, les projecteurs du stade 7flamboient dans un mur de couleur de foule floue ; des lignes de vitesse radiales jaillissent 8du centre du cadre ; un brin d'herbe pend gelé dans l'air. Palette saturée, ombres cyan 9profond, lumière de contour orange chaude. Composition 16:9, le personnage cadré à droite 10du centre, espace négatif propre sur le tiers gauche. Aucun texte nulle part dans l'image.
Réglages : modèle openai/gpt-image-2/text-to-image, qualité high, taille 16:9 (2048x1152). Rien d'autre.

Aire de jeu GPT Image 2 sur Atlas Cloud avec le prompt d'image clé Dernier Coup de Sifflet et l'image anime finie dans le panneau de sortie
GPT Image 2 sur Atlas Cloud : qualité réglée sur high, l'image clé finie à droite.

L'image clé de base de l'anime : un attaquant original aux cheveux roux criant sous les projecteurs du stade, cel-shaded avec couleur unie et lignes de vitesse
L'image clé que les deux modèles reçoivent. Couleur unie, ombres dures, et un tiers gauche vide attendant un carton titre.
Étape 2 : MiniMax H3 image-to-video, tout au maximum
Même image en entrée, 2K en sortie. J'ai limité H3 à 8 secondes ici uniquement pour correspondre au plafond de Veo. Ce n'est pas la limite de H3 et l'étape 4 enlève le plafond.
Plain1Anime 2D cel-shaded, épaisseur de trait encré à la main, couleur unie, pas d'ombrage 3D. 2Tenir sur le visage de l'attaquant pendant un temps, puis un whip pan violent suit le 3ballon alors qu'il le frappe, le pan maculant le cadre en traînées de mouvement sakuga. 4Un cadre de silence total à l'impact. Au cours des deux dernières secondes, un carton 5titre en japonais blanc gras lisant ラストホイッスル apparaît sur le tiers gauche du 6cadre et tient parfaitement stable, sans déformation, sans scintillement, sans dérive. 7L'attaquant crie une ligne en japonais : 「まだ終わってない!」 8Audio : rugissement du stade qui enfle, un impact de balle net et sec, un coup de taiko 9grave sous le carton titre.
Réglages : modèle minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video prend la forme de cadre de votre image d'entrée), image = le résultat de l'étape 1.
Un avertissement si vous passez plutôt en text-to-video : écrivez ratio: 16:9 explicitement. La valeur par défaut est 1:1 et il vous donnera joyeusement un carré d'anime.

Aire de jeu MiniMax H3 image-to-video sur Atlas Cloud avec le prompt Dernier Coup de Sifflet, l'image clé chargée et le clip fini dans le panneau de sortie
MiniMax H3 image-to-video sur Atlas Cloud : l'image clé de l'étape 1 chargée à gauche, le clip fini joué à droite.
Étape 3 : Veo 3.1 image-to-video, audio activé manuellement
Le prompt est identique, mot pour mot. Changer un seul adjectif et ce n'est plus une comparaison. Ce qui change, c'est le champ supplémentaire que Veo vous donne et que H3 n'a pas.
negative_prompt, qui pour l'anime 2D est le contrôle le plus utile de cette liste :
Plain13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
Réglages : modèle google/veo3.1/image-to-video, resolution: 1080p (changez-le, la valeur par défaut est 720p), duration: 8 (c'est le plafond), aspect_ratio: 16:9, generate_audio: true (la valeur par défaut de l'API est false, c'est le piège du clip silencieux), seed: 20260807, image = le même résultat de l'étape 1.

Aire de jeu Veo 3.1 image-to-video sur Atlas Cloud montrant l'audio activé, l'image clé d'anime chargée et le clip fini dans le panneau de sortie
Veo 3.1 image-to-video sur Atlas Cloud, avec Generate Audio activé et le clip fini à droite.
Étape 4 : Noter sur cinq axes spécifiques à l'anime
Rien à générer ici. Il suffit de regarder, sur les choses sur lesquelles l'anime se casse réellement. Les deux clips sont intégrés près du haut de cet article, vous pouvez donc les noter vous-même plutôt que de me croire.

Côte à côte de la dernière image des deux clips, MiniMax H3 à gauche avec un lettrage japonais propre, Veo 3.1 à droite avec des caractères verticaux brouillés
La dernière image de chaque clip. À gauche, H3 a écrit ラストホイッスル, les huit katakana corrects et parfaitement stables. À droite, Veo 3.1 a écrit trois caractères qui ne sont pas le mot demandé et n'en forment pas un.
Le carton titre est l'endroit où la manche s'est jouée, et ce n'était pas serré. H3 a rendu les katakana demandés exactement, nets et stables, sur un pan maculé du but. Veo 3.1 a produit un empilement vertical de trois caractères qui ne sont ni le mot demandé ni un mot. Sur la même image, il a également fait sortir le personnage du cadre et laissé l'arrière-plan glisser vers une plaque de stade semi-photoréaliste, malgré photorealistic skin et 3D render dans le prompt négatif.
Tableau 3 : cinq axes qui décident d'un plan d'anime, à partir de ces deux exécutions
| Axe | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Continuité du personnage depuis l'image clé | A conservé exactement le visage, les cheveux et le maillot pendant les 8 secondes complètes | A redessiné le personnage dans un nouveau plan large, fidèle mais un dessin différent |
| Épaisseur de trait et ombrage cel plat | A tenu, pas de dérive vers le 3D | A tenu dans le plan moyen, a dérivé vers une plaque de stade photographique à la fin |
| Carton titre japonais | ラストホイッスル rendu correctement et stable | Trois caractères, pas le mot demandé, pas un mot |
| Piste audio livrée | Stéréo 32 kHz, exactement comme indiqué sur la fiche modèle | Stéréo 48 kHz, présent uniquement car j'ai réglé generate_audio moi-même |
| Whip pan et traînée sakuga | Exécuté comme un pan maculé jusqu'au carton titre | Remplacé par un cut sec vers un nouveau plan |
Cette dernière ligne est la critique publique la plus virulente de H3 à ce jour, ce qui est exactement pourquoi je l'ai écrite dans les deux prompts. Sur le fil ComfyUI du jour 0, l'utilisateur fwip s'est plaint que même les prompts de démonstration officiels étaient ignorés : « un violent WHIP PAN depuis le toit qui MACULE les mots flottants en les emportant, traînée de mouvement. Et la vidéo n'a tout simplement pas fait cette transition, elle l'a remplacée par un cut. »
Dans cette exécution, c'est Veo qui a remplacé le pan par un cut, et H3 qui a maculé. Une seule prise chacun n'est pas un verdict, et je ne prétendrais pas le contraire. Mais cela signifie que la critique n'est pas spécifique à H3 : les whip pans sont l'instruction la moins fiable de tout ce test, des deux côtés. Si votre storyboard en dépend, concevez autour plutôt qu'à travers.
Étape 5 : Le plan 4:3 rétro OVA que Veo 3.1 ne peut structurellement pas produire
Ce n'est pas une préférence de qualité. C'est un mur. L'énumération aspect_ratio de Veo a deux valeurs et aucune n'est 4:3, et son énumération duration n'a pas de 12. Le look OVA des années 90 est tout simplement inaccessible.
Plain1Un plan d'anime OVA des années 1990, 4:3 plein écran. Fond peint à la main avec texture 2de pinceau visible, personnages en cel-paint avec des lignes épaisses et irrégulières à 3l'encre, forte lueur de halation autour des projecteurs, grain de film 16 mm et léger 4tremblement de la fenêtre. Le même attaquant aux cheveux roux dans un maillot blanc et 5marine numéro 9 quitte un terrain détrempé par la pluie tandis que le bruit de la foule 6s'évanouit en une seule sonnerie persistante. La caméra s'approche lentement de son 7visage. Il dit doucement en japonais : 「次は、勝つ」. Palette rétro : teal doux, 8ambre poussiéreux, ombres lie-de-vin profondes. Audio : pluie lointaine, une seule nappe 9de synthé analogique, un coup de sifflet avec beaucoup de réverbération au loin.
Réglages : modèle minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Définissez ce ratio manuellement, rappelez-vous la valeur par défaut.

Aire de jeu MiniMax H3 text-to-video sur Atlas Cloud avec le prompt OVA tapé et le clip rétro fini dans le panneau de sortie
MiniMax H3 text-to-video sur Atlas Cloud, prompt OVA tapé, clip terminé. Divulgation complète : cette exécution particulière a laissé Aspect Ratio à 16:9 et Duration à 8, donc ce que vous voyez à droite est la version courte en écran large. Le plan 4:3 de douze secondes ci-dessous provient de l'appel API avec ratio: 4:3 et duration: 12 définis explicitement.

Le plan rétro 4:3 OVA : le même attaquant quittant un terrain détrempé par la pluie dans le style anime des années 90
H3 text-to-video, 4:3, 12 secondes. Le fichier livré est revenu en 1920x1440, soit du 4:3 au pixel près, avec une piste stéréo 32 kHz. Montré ici sous forme de GIF silencieux à fréquence d'images réduite pour alléger la page. Généré avec minimax/h3/text-to-video sur Atlas Cloud.
Étape 6 : Neuf images de référence, un personnage, quatre plans
La cohérence du personnage entre les plans est le problème le plus difficile de l'anime IA, et il se résout par le volume de références. Construisez d'abord le pack : relancez le prompt de l'étape 1 avec le cadrage changé pour la face, trois-quarts, profil complet, dos, riant, dents serrées, stance corps entier, détail du maillot et détail des chaussures. Neuf images, environ huit cents au total.

Quatre angles du même personnage attaquant original générés comme pack de référence, disposés en grille deux par deux
Quatre des neuf angles de référence. H3 accepte jusqu'à neuf images dans un seul pack de référence, plus des références vidéo et audio par-dessus.
Plain1Anime 2D cel-shaded, épaisseur de trait encré à la main cohérente, couleur unie, pas 2d'ombrage 3D. Garder le visage de l'attaquant de référence, la silhouette des cheveux et 3le maillot numéro 9 identiques dans chaque plan. Quatre plans en une seule prise continue : 4(1) poussée en contre-plongée sur ses chaussures touchant le gazon, (2) whip pan vers le 5haut jusqu'à un gros plan serré de ses yeux, (3) plan large de lui sprintant devant trois 6défenseurs dessinés comme des silhouettes floues, (4) arrêt sur une tête à mi-hauteur, des 7lignes de vitesse explosant vers l'extérieur. Audio : rugissement de la foule, souffle, 8impacts chaussures-gazon, un coup de taiko à l'arrêt.
Réglages : modèle minimax/h3/reference-to-video, refers = vos images avec type: image, resolution: 2K, duration: 8 ou plus, ratio: adaptive ou 16:9.
L'équivalent Veo 3.1 ne peut pas être exécuté avec ces réglages et vous n'avez pas besoin d'essayer pour savoir pourquoi. Son endpoint de référence accepte un maximum de trois images, et choisir cet endpoint réduit duration à une seule valeur légale de 8. Un pack de neuf images et une prise de 10 secondes sont tous deux hors de portée.

Aire de jeu MiniMax H3 reference-to-video sur Atlas Cloud montrant le compteur de références à quatre sur neuf et le premier plan dans le panneau de sortie
MiniMax H3 reference-to-video sur Atlas Cloud. Le compteur indique Reference Materials (4/9) avec MAX:9 en dessous, ce qui est le plafond dans l'interface plutôt qu'une affirmation d'une fiche technique. La sortie est le plan un, la poussée en contre-plongée sur les chaussures.
Quatre Autres Exécutions du Générateur de Vidéo d'Anime MiniMax H3 Qui Valent le Coup
Le plan Dernier Coup de Sifflet ne sollicite que quatre des différences. Ces quatre-là sollicitent le reste. Toutes s'exécutent sur H3 ; les notes indiquent lesquelles Veo 3.1 peut égaler.
- Combat sakuga ultra-large,
21:9, 10 secondes. Veo ne peut pas produire de 21:9 du tout.
Plain1Action anime 2D cel-shaded, traits d'encre épais et effilés, couleur unie, ombres dures, 2pas d'ombrage 3D. Deux duellistes masqués originaux sur un toit de temple balayé par le 3vent au crépuscule. Choc des lames, le cadre frémit, les deux combattants se séparent 4dans une explosion d'images d'impact dessinées à la main et de lignes de vitesse radiales. 5Caméra : poussée en contre-plongée, puis un travelling latéral, puis un saut vers une 6silhouette large contre le ciel orange. Audio : deux chocs métalliques nets, claquement de 7tissu, un coup de taiko grave à l'arrêt final, pas de musique.
- Plan AMV synchronisé, reference-to-video avec une référence audio. H3 accepte jusqu'à trois clips audio comme entrée de référence. Veo 3.1 n'a aucune entrée audio, seulement une sortie audio.
Plain1Montage anime 2D cel-shaded coupé sur la piste audio de référence. Cinq temps courts : 2pluie sur une fenêtre, une main qui serre un bandage, une ligne d'horizon de ville 3défilant par la fenêtre d'un train, un départ en sprint, un arrêt sur une main tendue. 4Chaque coupe tombe exactement sur un temps fort de l'audio de référence. Couleur unie, 5traits d'encre épais, palette nocturne à fort contraste d'indigo profond et magenta néon.
- Scène de dialogue en japonais de deux lignes, 12 secondes. C'est le test de stress du synchronisme labial, et 12 secondes sont déjà en dehors de la portée de Veo.
Plain1Anime 2D cel-shaded, couleur unie, pas d'ombrage 3D. Deux personnages originaux sur un 2toit à l'heure dorée, plan contre-plan. Le premier dit en japonais :「本当に行くの?」. 3Le second répond, à moitié souriant, en japonais :「もう決めた」. Les bouches 4correspondent à chaque syllabe. Lumière de contour chaude, longues ombres, vent doux dans 5les cheveux. Audio : deux voix japonaises distinctes, circulation lointaine, une cigale.
- Court métrage shonen vertical,
9:16, 8 secondes. Les deux modèles peuvent faire du vertical, c'est donc le seul endroit pour vraiment les comparer plutôt que de supposer.
Plain1Anime 2D cel-shaded, composition verticale. Une adolescente coureuse originale traverse 2une bannière en papier au ralenti, puis le cadre revient à pleine vitesse alors qu'elle 3accélère dans une ligne droite de stade. Lignes de vitesse, couleur unie, ombres dures, 4ciel graphique audacieux. Caméra : plan suivant en contre-plongée, puis un whip up vers 5son visage. Audio : déchirure de bannière, poussée de foule, une respiration retenue puis 6relâchée.
Si vous voulez la grammaire de prompt derrière tout cela, le guide de prompt MiniMax H3 approfondit la façon dont H3 analyse les instructions de caméra et d'audio plus que je ne peux le faire ici.
Ce que Coûte un Générique d'Anime de 60 Secondes sur MiniMax H3 vs Veo 3.1
Un générique d'anime standard dure environ 90 secondes. Disons huit plans de 8 secondes, 64 secondes de vidéo finie, plus une image clé par plan à 0,009 $ chacune.
Il existe un véritable écart de prix que vous devez connaître plutôt que de le laisser sous silence. Le catalogue Atlas Cloud liste MiniMax H3 à 0,10 $ par seconde fixe, tandis que le readme du modèle le décompose en 0,14 $/s en 2K et 0,10 $/s en 768P. Veo 3.1 est listé à 0,20 $ par seconde, tandis que son readme sépare 0,40 $/s avec audio de 0,20 $/s sans.
Les boutons de run dans mes captures d'écran le confirment. H3 reference-to-video, 8 secondes en 2K, facturé Run $1.12, ce qui est exactement 0,14 $ par seconde. Veo 3.1 image-to-video, 8 secondes en 1080p avec audio, facturé Run $3.2, ce qui est exactement 0,40 $ par seconde. Donc les tarifs du readme sont ceux qui sont facturés, et le titre du catalogue est le palier d'entrée. J'ai tout de même montré les deux lectures ci-dessous. Ce sont des prix catalogue d'août 2026.
Tableau 4 : huit plans de 8 secondes, images clés incluses
| Configuration | Coût vidéo (tarif catalogue) | Coût vidéo (tarif readme) | Images clés | Fourchette totale |
|---|---|---|---|---|
| MiniMax H3, 2K | 6,40 $ | 8,96 $ | 0,07 $ | 6,47 $ à 9,03 $ |
| MiniMax H3, 768P | 6,40 $ | 6,40 $ | 0,07 $ | 6,47 $ |
| Veo 3.1, 1080p avec audio | 12,80 $ | 25,60 $ | 0,07 $ | 12,87 $ à 25,67 $ |
| Veo 3.1 Lite, 720p | 3,20 $ | 3,20 $ | 0,07 $ | 3,27 $ |
Prix issus des pages de modèles Atlas Cloud liées dans le tableau 1, août 2026. Aucun de ces quatre n'est actuellement remisé.
Deux choses que ce tableau n'inclut pas, et qui frappent plus fort que le tarif à la seconde.
Les retentatives. Personne ne livre la première prise d'un plan d'anime. Quel que soit le multiplicateur que vous supposez, appliquez-le aux deux colonnes et l'écart s'élargit dans la même proportion.
Le temps réel, et celui-ci va dans l'autre sens. Chronométré bout en bout le 7 août 2026 : H3 en 2K pour 8 secondes a pris 447 secondes, environ 7 minutes et demie. H3 text-to-video en 2K pour 12 secondes a pris 334 secondes. Veo 3.1 en 1080p pour 8 secondes avec audio a pris 152 secondes, moins de trois minutes. Veo est environ trois fois plus rapide pour une première prise ici, et si vous itérez sur un plan à 2h du matin, cela vaut de l'argent réel. Les files d'attente bougent, donc traitez cela comme un instantané d'un après-midi plutôt que comme une spécification. Mais quiconque cite « 2 à 3 minutes » pour H3 en 2K cite un readme, pas une file d'attente. L'analyse comparative 2K vs 768P couvre quand le palier supérieur vaut les minutes supplémentaires.
Style d'Anime, Hommage, et Ce Que Vous Pouvez Réellement Publier
Tout dans cet article est style et hommage. Un personnage original, un maillot original, un titre original. Aucun personnage d'anime officiel n'a été généré ou demandé, et aucun nom ou apparence de footballeur réel n'a été utilisé. La tendance de la Coupe du Monde est mentionnée comme un format, car c'est ce en quoi elle est utile.
Cette distinction n'est pas décorative. Si vous produisez du contenu de style anime commercialement, « dans le style d'un OVA des années 90 » et « ce personnage spécifique de cette série spécifique » sont des objets juridiques différents, et un seul d'entre eux est un business.
Concernant les poids ouverts : H3 est véritablement téléchargeable, et les gens l'ont exécuté dès le premier jour. Un commentateur a rapporté 10 minutes pour un clip de 10 secondes en 480p sur une 4070 Ti Super avec 16 Go, et d'autres ont posté 3 minutes sur une 5080 et 68 secondes sur une RTX 6000 Pro. Mais l'auto-hébergement s'exécute avec un bord court de 768 ; les étapes Context-IR et Regenerate-2K qui produisent du 2K restent du côté API.
La licence a un véritable piège. La licence communautaire ne couvre actuellement pas l'UE, le Royaume-Uni, la Corée du Sud ou les États-Unis, citant les régions « développant ou appliquant actuellement des réglementations liées à l'IA ». Un canal de demande de licence formelle est ouvert, qu'un commentateur de HN a résumé comme « il suffit de promettre sur l'honneur que tu ne fâcheras pas Disney et ils t'enverront une licence ». Drôle, et aussi exactement l'étape de conformité que vous ne pouvez pas sauter si vous êtes dans l'un de ces quatre territoires. L'article sur les poids ouverts contient la liste complète des territoires.
Foire Aux Questions
MiniMax H3 est-il un bon générateur de vidéo d'anime par rapport à Veo 3.1 ?
Pour la plupart des travaux d'anime, oui, H3, et principalement pour des raisons qui ne concernent pas le rendu. Il fonctionne de 4 à 15 secondes contre 4, 6 ou 8 pour Veo, il propose six ratios d'aspect dont 4:3 et 21:9 contre deux pour Veo, il liste le japonais parmi 11 langues de dialogue nativement stables, et il accepte neuf images de référence contre trois pour Veo. Veo 3.1 gagne dans une situation spécifique : quand vous avez besoin de seed pour des reprises reproductibles, ou de negative_prompt pour empêcher un plan de dériver vers un ombrage 3D. H3 n'a aucun de ces deux paramètres. Si votre pipeline dépend de l'un ou l'autre, c'est une raison légitime de rester.
Veo 3.1 peut-il générer de l'anime en 4:3 ou un clip de 15 secondes ?
Non, et pas pour des raisons stylistiques. L'énumération aspect_ratio de Veo 3.1 contient exactement 16:9 et 9:16, et son énumération duration contient exactement 4, 6 et 8. Il n'y a pas de valeur 4:3 à sélectionner et aucun moyen de demander 12 ou 15 secondes. Si votre référence est un anime TV ou OVA des années 90, le cadrage est hors de portée sur Veo et disponible sur H3.
Pourquoi mon clip d'anime Veo 3.1 est-il revenu silencieux ?
Parce que generate_audio est par défaut à false sur l'API. Le bouton de l'aire de jeu est généralement déjà activé, donc cela ne concerne que les personnes appelant l'API directement. Définissez generate_audio: true explicitement. Pendant que vous y êtes, définissez aussi resolution, car elle est par défaut à 720p plutôt que le 1080p ou 4k que vous vouliez probablement.
MiniMax H3 gère-t-il le dialogue en japonais et le synchronisme labial pour l'anime ?
Oui. La fiche modèle liste 11 langues avec un support de dialogue stable : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe et espagnol. L'audio est généré conjointement avec l'image en stéréo 32 kHz plutôt que d'être doublé après coup, ce qui explique pourquoi le timing de la bouche tient sur toute une ligne au lieu des premières syllabes. Écrivez la ligne japonaise directement dans le prompt en japonais.
Combien d'images de référence puis-je utiliser pour garder un personnage d'anime cohérent ?
MiniMax H3 accepte jusqu'à 9 images, jusqu'à 3 clips vidéo et jusqu'à 3 clips audio, avec un plafond dur de 12 fichiers tous types confondus. L'endpoint reference-to-video de Veo 3.1 accepte 1 à 3 images, et le sélectionner réduit duration à 8 comme seule valeur légale. Pour un personnage d'anime récurrent dans une série, cette différence change toute la donne.
MiniMax H3 a des poids ouverts, donc je peux exécuter mon pipeline d'anime localement gratuitement ?
Vous pouvez le télécharger et l'exécuter, avec trois réserves. L'inférence auto-hébergée s'exécute avec un bord court de 768, et les étapes Context-IR et Regenerate-2K qui produisent du 2K restent du côté API. Les vitesses locales réelles varient considérablement selon la carte : environ 10 minutes pour un clip de 10 secondes en 480p sur une 4070 Ti Super, environ 3 minutes sur une 5080, environ 68 secondes sur une RTX 6000 Pro, selon le fil ComfyUI du jour 0. Et la licence communautaire ne couvre actuellement pas l'UE, le Royaume-Uni, la Corée du Sud ou les États-Unis, donc si vous êtes dans l'un de ces pays, vous avez besoin de la licence formelle avant une utilisation commerciale.






