Tout l'été, mon fil d'actualité a été la même vidéo en boucle. Des joueurs de la Coupe du Monde redessinés en héros de shonen. Un dictateur. Un capitaine pirate. Un mentor buriné qui apparaît dans les quatre dernières secondes. Des millions de vues par publication, et le scénario se met à jour après presque chaque match.
Ceux qui créent ces vidéos n'écrivent pas de posts de benchmark. Ils choisissent un modèle, brûlent des crédits, et publient avant le coup d'envoi suivant.
J'ai donc pris une image clé d'anime et un prompt, et j'ai testé MiniMax H3 comme générateur de vidéo anime contre Veo 3.1, tous deux poussés à leurs réglages maximum sur des entrées identiques.
La première chose qui a cassé n'était pas la qualité d'image. C'était une liste déroulante. Veo 3.1 s'arrête à 8 secondes et propose exactement deux rapports d'aspect. Un plan qui tient sur un visage, fait un whip pan avec le ballon, puis laisse un carton titre atterrir ne tient pas en 8 secondes. Il n'a jamais eu la chance d'échouer sur la qualité.
Points clés
- L'énumération
durationde Veo 3.1 est[4, 6, 8]et son énumérationaspect_ratioest[16:9, 9:16]. MiniMax H3 fonctionne avec n'importe quelle seconde entière de 4 à 15 et propose21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Pas de 4:3 sur Veo signifie pas de cadrage rétro OVA, du tout. - La fiche technique de H3 mentionne 11 langues de dialogue nativement stables, et le japonais en fait partie. L'audio et l'image sont générés ensemble en stéréo 32 kHz, pas doublés après.
- Les packs de référence ne sont pas proches : H3 accepte jusqu'à 9 images plus jusqu'à 3 vidéos et 3 clips audio (12 fichiers max). Le point de terminaison de référence de Veo 3.1 prend 3 images, et dès que vous l'utilisez,
durationse réduit à[8]uniquement. - Deux pièges qui ruinent silencieusement les tests : l'API de Veo par défaut
generate_audioàfalseetresolutionà720p, et leratiode text-to-video de H3 par défaut à1:1. Laissez-les ainsi et vous comparez un clip silencieux en 720p à un clip carré. - Veo 3.1 conserve deux choses que H3 n'a pas du tout :
seedetnegative_prompt. Pour l'anime 2D, ce second point compte vraiment, et je vais montrer où.
MiniMax H3 Générateur de Vidéo Anime vs Veo 3.1, La Même Image Clé Face à Face
Un personnage original. Une image clé. Un prompt, copié caractère par caractère dans les deux modèles. Tout le reste poussé au maximum de chaque côté.
MiniMax H3, image-to-video, 2K, 8 secondes, audio natif. Activez le son : le bruit de la foule, le coup de pied et le cri japonais sont générés dans le même passage que l'image. Généré avec minimax/h3/image-to-video sur Atlas Cloud.
Veo 3.1, image-to-video, 1080p, 8 secondes, generateaudio activé manuellement, plus un negativeprompt maintenant le line art à plat. Même première image, mêmes mots. Généré avec google/veo3.1/image-to-video sur Atlas Cloud.
Les deux dessinent magnifiquement. Le plan large de Veo sur le tir, avec des lignes d'impact dessinées à la main et un effet sonore manga flottant dans l'air, est vraiment charmant. C'est le point de départ honnête, et c'est pourquoi le reste de cet article porte sur les paramètres et le respect des instructions plutôt que sur les impressions.
Pourquoi la Plupart des Tests du Générateur de Vidéo Anime MiniMax H3 vs Veo 3.1 Tournent Mal
Deux choses se sont produites en même temps cet été.
L'anime est devenu le format le plus volumineux dans la vidéo IA. La Coupe du Monde 2026 a été réécrite comme un tournoi shonen, avec des joueurs incarnant un dictateur, un capitaine pirate, un général de marine et un mentor, et des scénarios qui « évoluent après presque chaque match » sur TikTok, Instagram, X et YouTube (Complex, juillet 2026).
Et MiniMax H3 est sorti avec des poids ouverts. Le fil ComfyUI du jour 0 a atteint 330 points et 95 commentaires, avec des gens publiant de vrais chiffres locaux en quelques heures (Hacker News, août 2026).
Mettez les deux ensemble et on s'attendrait à un tas de comparaisons d'anime. Il n'y en a presque pas, car la plupart des tests sont mal construits de quatre façons.
Ils comparent des images, pas des contraintes. Les plans d'anime sont une question de timing. Un whip pan vers un carton titre est un problème de durée avant d'être un problème de rendu.
Ils oublient que l'API de Veo est silencieuse par défaut. Sur l'API, generate_audio est false et resolution est 720p. Beaucoup de posts « Veo n'a pas d'audio dans l'anime » viennent de quelqu'un qui n'a jamais activé un booléen.
Ils oublient que le text-to-video de H3 est carré par défaut. ratio par défaut est 1:1, pas 16:9. Lancez un prompt t2v anime sans le configurer et vous obtenez un clip carré et une conclusion confuse.
Ils testent avec des prompts photoréalistes. « Cinématographique, lumière volumétrique, faible profondeur de champ » est exactement le vocabulaire qui tire un modèle 2D vers un ombrage de rendu 3D. Le mode d'échec dans l'anime n'est pas le flou. C'est le plastique.
Les trois paramètres qui décident un test anime avant même d'appuyer sur Run
Avant toute chose, réglez-les des deux côtés ou la comparaison est nulle.
| Paramètre | MiniMax H3 | Veo 3.1 | Ce qui se passe si vous l'oubliez |
|---|---|---|---|
| Audio | Généré avec l'image, toujours activé | generate_audio par défaut à false | Veo renvoie un clip silencieux et semble pire qu'il ne l'est |
| Forme du cadre | ratio par défaut à 1:1 en text-to-video | aspect_ratio par défaut à 16:9 | H3 vous donne un plan anime carré que vous ne pouvez pas utiliser |
| Résolution | par défaut à 2K | par défaut à 720p | Vous comparez 2K contre 720p et appelez ça un écart de qualité |
La Fiche Technique Anime MiniMax H3 vs Veo 3.1 : Durée, Ratio, Audio, Références
J'ai récupéré les schémas d'entrée en direct des deux modèles plutôt que de me fier à un message de lancement. Chaque valeur ci-dessous est une énumération que vous pouvez lire vous-même sur les pages des modèles, pas une impression.
Tableau 1 : MiniMax H3 vs Veo 3.1, les paramètres qui décident d'un plan anime
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Durée | 4 à 15, toutes les secondes entières (par défaut 8) | 4, 6, 8 (par défaut 8) |
| Rapports d'aspect | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Ratio par défaut (text-to-video) | 1:01 | 16:09 |
| Résolution | 768P, 2K (par défaut 2K) | 720p, 1080p, 4k (par défaut 720p) |
| Audio | Généré conjointement, stéréo 32 kHz | generate_audio, par défaut false |
| Langues de dialogue natives | 11 stables, japonais inclus | Non publié comme liste stable |
| Pack de référence | jusqu'à 9 images, 3 vidéos, 3 clips audio, 12 fichiers au total | 3 images |
| Durée avec utilisation de références | toujours 4 à 15 | réduit à 8 uniquement |
| seed | non disponible | disponible |
| negative_prompt | non disponible | disponible |
| Poids | téléchargeables | fermés |
La durée, le ratio, la résolution, l'audio et les limites de référence sont lus à partir des schémas en direct sur les pages MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video et Veo 3.1 reference-to-video. Le plafond de 9 images et 12 fichiers et la liste de 11 langues de dialogue proviennent de la fiche technique du modèle MiniMax H3 (Hugging Face, août 2026).
Maintenant les classements, car ils disent quelque chose de différent de la fiche technique et les deux comptent.
Tableau 2 : Elo de vote public et prix par minute, instantané du 7 août 2026
| Modèle | Text-to-video (avec audio) | Image-to-video (avec audio) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1 244 (#1) ±7 | 1 191 (#2) ±9 | 6,00 $ |
| MiniMax H3 | 1 238 (#2) ±9 | 1 190 (#3) ±10 | 7,80 $ |
| Dreamina Seedance 2.0 720p | 1 224 (#3) ±6 | 1 198 (#1) ±7 | 9,07 $ |
| Kling 3.0 1080p (Pro) | 1 111 (#7) ±6 | non listé dans le top 10 | 20,16 $ |
| Veo 3.1 | 1 093 (#11) ±7 | 1 085 (#10) ±7 | 24,00 $ |
| Veo 3.1 Fast | 1 091 (#14) ±6 | non listé dans le top 10 | 9,00 $ |
| Veo 3.1 Lite | 1 089 (#15) ±7 | non listé dans le top 10 | 4,80 $ |
Les chiffres Elo et de prix proviennent de l'Arène Vidéo Artificial Analysis (Artificial Analysis, août 2026). Ce sont des votes publics continus et ils évoluent. La colonne $/min est une estimation de modèle normalisée, pas votre facture.
Un écart Elo de 145 points est important, mais c'est un vote général, pas un vote anime. Et voici la partie que je dois dire clairement : MiniMax ne commercialise pas H3 comme un modèle anime. Les retours internes de première ligne listent le film, l'animation et le drame comique comme les domaines auxquels H3 n'est pas destiné. Donc la question intéressante n'est pas « lequel est le modèle anime ». C'est pourquoi le modèle qui ne se vend pas sur l'anime gagne quand même le plan, et où Google remporte encore la manche.
Une note pratique avant le tutoriel. Chaque modèle ci-dessous fonctionne via la même console et la même clé API, ce qui est la seule raison pour laquelle les paramètres sont comparables. Même file d'attente, même authentification, une seule facture. Si vous configurez GPT Image 2 sur un service et Veo sur un autre, la moitié des différences que vous trouverez seront de la plomberie plutôt que du modèle.
Construire le Plan : MiniMax H3 vs Veo 3.1, Étape par Étape
Un exemple concret, du début à la fin. « Dernier Coup de Sifflet » : un attaquant adolescent original, cheveux roux, maillot blanc et marine numéro 9, lumières du stade, un whip pan sur le tir, et un carton titre japonais qui doit atterrir dans les deux dernières secondes et rester stable.
Aucun vrai joueur, aucun personnage officiel, aucune propriété intellectuelle d'anime existante. Style et hommage uniquement. Plus d'explications sur pourquoi dans un instant.
Étape 1 : Concevoir l'image clé anime avec GPT Image 2
L'image clé porte la direction artistique afin que le modèle vidéo n'ait pas à l'inventer. Notez l'espace négatif sur le tiers gauche : il est délibéré. Le carton titre y sera écrit par le modèle vidéo, et c'est le test de stabilité du texte.
Plain1Une seule image d'un anime sportif shonen moderne. Animation 2D cel-shaded, line art tracé à la main 2avec une épaisseur de trait constante, remplissages de couleur plate, ombres graphiques dures, 3absolument aucun ombrage 3D et aucune peau photoréaliste. Gros plan sur un attaquant adolescent original : 4cheveux roux en désordre, tenue blanche et marine avec le numéro 9, transpiration et traînées d'herbe sur 5une joue, yeux écarquillés de détermination épuisée, bouche ouverte en plein cri. Derrière lui, les 6projecteurs du stade flamboient dans un mur de couleur de foule floue ; des lignes de vitesse radiales 7jaillissent du centre du cadre ; un brin d'herbe reste figé dans l'air. Palette saturée, ombres cyan 8profond, lumière de bord orange chaud. Composition 16:9, personnage cadré à droite du centre, espace 9négatif propre sur le tiers gauche. Aucun texte nulle part dans l'image.
Paramètres : modèle openai/gpt-image-2/text-to-image, qualité high, taille 16:9 (2048x1152). Rien d'autre.

Terrain de jeu GPT Image 2 sur Atlas Cloud avec le prompt d'image clé Dernier Coup de Sifflet et l'image d'anime finale dans le panneau de sortie
GPT Image 2 sur Atlas Cloud : qualité réglée sur high, l'image clé finale à droite.

L'image clé de base de l'anime : un attaquant roux original en train de crier sous les projecteurs du stade, cel-shaded avec couleur plate et lignes de vitesse
L'image clé que les deux modèles reçoivent. Couleur plate, ombres dures, et un tiers gauche vide attendant un carton titre.
Étape 2 : MiniMax H3 image-to-video, tout au maximum
Même image entrée, sortie 2K. J'ai limité H3 à 8 secondes ici seulement pour correspondre au plafond de Veo. Ce n'est pas la limite de H3 et l'étape 4 supprime la limite.
Plain1Anime 2D cel-shaded, épaisseur de trait tracée à la main, couleur plate, pas d'ombrage 3D. Tenez sur le 2visage de l'attaquant pendant un temps, puis un violent whip pan suit le ballon lorsqu'il le frappe, 3le pan étalant le cadre en traînées de mouvement sakuga floues. Une image de silence total à l'impact. 4Au cours des deux dernières secondes, un lettrage japonais blanc audacieux lisant 5ラストホイッスル apparaît sur le tiers gauche du cadre et reste stable, sans déformation, 6sans scintillement, sans dérive. L'attaquant crie une réplique en japonais : 「まだ終わってない!」 7Audio : rugissement du stade qui monte, un impact de balle sec et aigu, un coup de taiko sourd sous le 8carton titre.
Paramètres : modèle minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video prend la forme de son cadre de votre image d'entrée), image = la sortie de l'étape 1.
Un avertissement si vous utilisez plutôt text-to-video : écrivez ratio: 16:9 explicitement. La valeur par défaut est 1:1 et il vous donnera volontiers un plan anime carré.

Terrain de jeu MiniMax H3 image-to-video sur Atlas Cloud avec le prompt Dernier Coup de Sifflet, l'image clé chargée et le clip final dans le panneau de sortie
MiniMax H3 image-to-video sur Atlas Cloud : l'image clé de l'étape 1 chargée à gauche, le clip final en cours de lecture à droite.
Étape 3 : Veo 3.1 image-to-video, audio activé manuellement
Le prompt est identique, mot pour mot. Changez un seul adjectif et ce n'est plus une comparaison. Ce qui change, c'est le champ supplémentaire que Veo vous donne et que H3 n'a pas.
negative_prompt, qui pour l'anime 2D est le contrôle le plus utile de cette liste :
Plain1Rendu 3D, CGI, ombrage plastique, peau photoréaliste, séquence live action, flou de mouvement 2soupe, lettrage déformé, texte absurde, doigts supplémentaires, barre de sous-titres
Paramètres : modèle google/veo3.1/image-to-video, resolution: 1080p (modifiez-le, la valeur par défaut est 720p), duration: 8 (c'est le plafond), aspect_ratio: 16:9, generate_audio: true (la valeur par défaut de l'API est false, c'est le piège du clip silencieux), seed: 20260807, image = la même sortie de l'étape 1.

Terrain de jeu Veo 3.1 image-to-video sur Atlas Cloud montrant generate audio activé, l'image clé d'anime chargée et le clip final dans le panneau de sortie
Veo 3.1 image-to-video sur Atlas Cloud, avec Generate Audio activé et le clip final à droite.
Étape 4 : Noter sur cinq axes spécifiques à l'anime
Rien à générer ici. Regardez simplement, sur les choses où l'anime échoue réellement. Les deux clips sont intégrés près du haut de cet article, vous pouvez donc les noter vous-même au lieu de me croire sur parole.

Côte à côte de la dernière image des deux clips, MiniMax H3 à gauche avec un lettrage japonais propre, Veo 3.1 à droite avec des caractères verticaux incohérents
La dernière image de chaque clip. À gauche, H3 a écrit ラストホイッスル, les huit katakana corrects et parfaitement stables. À droite, Veo 3.1 a écrit trois caractères qui ne sont pas le mot demandé et ne forment pas un mot.
Le carton titre est là où la manche s'est jouée, et ce n'était pas serré. H3 a rendu les katakana demandés exactement, nets et stables, sur un pan flou du but. Veo 3.1 a produit une pile verticale de trois caractères qui ne sont ni le mot demandé ni un mot. Sur la même image, il a également fait sortir le personnage du cadre et laissé l'arrière-plan glisser vers un décor de stade semi-photoréaliste, malgré peau photoréaliste et rendu 3D dans le prompt négatif.
Tableau 3 : cinq axes qui décident d'un plan anime, d'après ces deux exécutions
| Axe | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Continuité du personnage depuis l'image clé | A conservé exactement le visage, les cheveux et la tenue pendant les 8 secondes | A redessiné le personnage dans un nouveau plan large, fidèle mais un dessin différent |
| Épaisseur de trait et ombrage cel plat | A tenu, pas de dérive vers la 3D | A tenu dans le plan moyen, a dérivé vers un décor de stade photographique à la fin |
| Carton titre japonais | ラストホイッスル rendu correctement et stable | Trois caractères, pas le mot demandé, pas un mot |
| Piste audio livrée | Stéréo 32 kHz, exactement comme indiqué sur la fiche technique | Stéréo 48 kHz, présent uniquement car j'ai activé generate_audio moi-même |
| Whip pan et traînée sakuga | Exécuté comme un pan étalé vers le titre | Remplacé par un cut sec vers un nouveau plan |
Cette dernière ligne est la critique publique la plus forte de H3 jusqu'à présent, ce qui est exactement pourquoi je l'ai écrite dans les deux prompts. Sur le fil ComfyUI du jour 0, l'utilisateur fwip s'est plaint que même les prompts de démonstration officiels étaient ignorés : « un violent WHIP PAN du toit qui EMBROUILLE les mots flottants avec lui, strié de mouvement. Et la vidéo n'a tout simplement pas fait cette transition du tout, elle l'a remplacée par un cut. »
Dans cette exécution, c'est Veo qui a remplacé le pan par un cut, et H3 qui a étalé. Une prise de chaque côté n'est pas un verdict, et je ne prétendrai pas le contraire. Mais cela signifie que la critique n'est pas spécifique à H3 : les whip pans sont l'instruction la moins fiable de tout ce test, des deux côtés. Si votre storyboard dépend de l'un d'eux, construisez votre storyboard autour plutôt que de passer par lui.
Étape 5 : Le plan OVA rétro 4:3 que Veo 3.1 ne peut structurellement pas produire
Ce n'est pas une préférence de qualité. C'est un mur. L'énumération aspect_ratio de Veo a deux valeurs et aucune n'est 4:3, et son énumération duration n'a pas de 12. Le look OVA des années 90 est tout simplement inaccessible.
Plain1Un plan d'anime OVA des années 1990, 4:3 plein écran. Arrière-plan peint à la main avec une texture 2de pinceau visible, personnages en cel-paint avec des lignes d'encre épaisses et irrégulières, forte 3halation lumineuse autour des projecteurs, grain de film 16 mm et léger scintillement de la porte. 4Le même attaquant aux cheveux roux dans un maillot blanc et marine numéro 9 quitte un terrain détrempé 5par la pluie tandis que le bruit de la foule s'estompe en une seule sonnerie persistante. La caméra 6se rapproche lentement de son visage. Il dit doucement en japonais : 「次は、勝つ」. Palette rétro : 7teal sourd, ambre poussiéreux, ombres bordeaux profondes. Audio : pluie lointaine, un seul nappe de 8synthé analogique, un coup de sifflet lourd d'écho au loin.
Paramètres : modèle minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Réglez ce ratio manuellement, souvenez-vous de la valeur par défaut.

Terrain de jeu MiniMax H3 text-to-video sur Atlas Cloud avec le prompt OVA tapé et le clip rétro final dans le panneau de sortie
MiniMax H3 text-to-video sur Atlas Cloud, prompt OVA tapé, clip terminé. Divulgation complète : cette exécution particulière a laissé Aspect Ratio à 16:9 et Duration à 8, donc ce que vous voyez à droite est la version courte en écran large. Le plan de 12 secondes en 4:3 ci-dessous provient de l'appel API avec ratio: 4:3 et duration: 12 explicitement définis.

Le plan OVA rétro 4:3 : le même attaquant quittant un terrain détrempé par la pluie dans le style anime des années 90
H3 text-to-video, 4:3, 12 secondes. Le fichier livré est revenu en 1920x1440, ce qui est du 4:3 au pixel près, avec une piste stéréo 32 kHz. Montré ici sous forme de GIF silencieux à une fréquence d'images réduite pour alléger la page. Généré avec minimax/h3/text-to-video sur Atlas Cloud.
Étape 6 : Neuf images de référence, un personnage, quatre plans
La cohérence du personnage entre les plans est le problème le plus difficile dans l'anime IA, et il est résolu par le volume de références. Construisez d'abord le pack : relancez le prompt de l'étape 1 avec le cadrage changé pour face, trois-quarts, profil complet, dos, rire, dents serrées, debout en pied, détail du maillot et détail des chaussures. Neuf images, environ huit cents au total.

Quatre angles du même personnage attaquant original généré comme pack de référence, disposés en grille deux par deux
Quatre des neuf angles de référence. H3 accepte jusqu'à neuf images dans un pack de référence, plus des références vidéo et audio par-dessus.
Plain1Anime 2D cel-shaded, épaisseur de trait constante tracée à la main, couleur plate, pas d'ombrage 3D. 2Gardez le visage, la silhouette des cheveux et le maillot numéro 9 de l'attaquant de référence identiques 3dans chaque plan. Quatre plans en une seule prise continue : (1) push-in en contre-plongée sur ses 4chaussures touchant le gazon, (2) whip-pan vers le haut jusqu'à un gros plan serré de ses yeux, 5(3) plan large de lui sprintant devant trois défenseurs dessinés comme des silhouettes floues, 6(4) gel sur une tête en l'air, des lignes de vitesse explosant vers l'extérieur. Audio : rugissement 7de la foule, souffle, impacts de chaussures sur le gazon, un coup de taiko sur le gel.
Paramètres : modèle minimax/h3/reference-to-video, refers = vos images avec type: image, resolution: 2K, duration: 8 ou plus, ratio: adaptive ou 16:9.
L'équivalent Veo 3.1 ne peut pas être exécuté avec ces paramètres et vous n'avez pas besoin d'essayer pour savoir pourquoi. Son point de terminaison de référence accepte un maximum de trois images, et choisir ce point de terminaison réduit duration à une seule valeur légale de 8. Un pack de neuf images et une prise de 10 secondes sont tous deux hors de portée.

Terrain de jeu MiniMax H3 reference-to-video sur Atlas Cloud montrant le compteur de références à quatre sur neuf et le premier plan dans le panneau de sortie
MiniMax H3 reference-to-video sur Atlas Cloud. Le compteur affiche Reference Materials (4/9) avec MAX:9 en dessous, ce qui est le plafond dans l'interface plutôt qu'une affirmation d'une fiche technique. La sortie est le premier plan, le push-in en contre-plongée sur les chaussures.
Quatre Autres Exécutions du Générateur de Vidéo Anime MiniMax H3 qui Valent le Coup
Le plan Dernier Coup de Sifflet ne sollicite que quatre des différences. Ces quatre-là sollicitent le reste. Toutes s'exécutent sur H3 ; les notes indiquent celles que Veo 3.1 peut égaler.
- Combat sakuga ultra-large,
21:9, 10 secondes. Veo ne peut pas produire de 21:9 du tout.
Plain1Action anime 2D cel-shaded, lignes d'encre épaisses et effilées, couleur plate, ombres dures, 2pas d'ombrage 3D. Deux duellistes masqués originaux sur un toit de temple balayé par le vent au 3crépuscule. Choc des lames, le cadre tremble, les deux combattants se séparent dans une explosion 4d'images d'impact dessinées à la main et de lignes de vitesse radiales. Caméra : push-in en 5contre-plongée, puis un travelling latéral, puis un snap vers une large silhouette contre le ciel 6orange. Audio : deux chocs métalliques aigus, claquement de tissu, un coup de taiko sourd sur le gel 7final, pas de musique.
- Plan AMV synchronisé sur le rythme, reference-to-video avec une référence audio. H3 accepte jusqu'à trois clips audio comme entrée de référence. Veo 3.1 n'a aucune entrée audio, seulement une sortie audio.
Plain1Montage anime 2D cel-shaded coupé sur la piste audio de référence. Cinq temps courts : pluie sur 2une fenêtre, une main serrant un bandage, une ligne d'horizon de ville filant par la fenêtre d'un 3train, un départ en sprint, un gel sur une main tendue. Chaque plan tombe exactement sur un temps 4fort de l'audio de référence. Couleur plate, lignes d'encre épaisses, palette nocturne à fort 5contraste d'indigo profond et de magenta néon.
- Scène de dialogue en japonais de deux lignes, 12 secondes. C'est le test de synchronisation labiale, et 12 secondes sont déjà hors de la portée de Veo.
Plain1Anime 2D cel-shaded, couleur plate, pas d'ombrage 3D. Deux personnages originaux sur un toit à 2l'heure dorée, plan-contreplan. Le premier dit en japonais :「本当に行くの?」. Le second répond, 3mi-sourire, en japonais :「もう決めた」. Les bouches correspondent à chaque syllabe. Lumière de 4bord chaleureuse, ombres longues, douce brise dans les cheveux. Audio : deux voix japonaises 5distinctes, circulation lointaine, une cigale.
- Court métrage shonen vertical,
9:16, 8 secondes. Les deux modèles peuvent faire du vertical, c'est donc le seul endroit pour réellement les comparer plutôt que de supposer.
Plain1Anime 2D cel-shaded, composition verticale. Une coureuse adolescente originale traverse une 2bannière en papier au ralenti, puis le cadre revient à pleine vitesse alors qu'elle accélère 3dans une ligne droite de stade. Lignes de vitesse, couleur plate, ombres dures, ciel graphique 4audacieux. Caméra : plan de suivi en contre-plongée, puis whip up vers son visage. Audio : 5déchirure de bannière, montée de la foule, un souffle retenu puis relâché. 6 7Si vous voulez la grammaire de prompt derrière ceux-ci, le [guide de prompt MiniMax H3](https://www.atlascloud.ai/blog/guides/minimax-h3-prompt-guide?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) approfondit la façon dont H3 analyse les instructions de caméra et d'audio mieux que je ne peux le faire ici. 8 9## Combien Coûte un Générique d'Anime de 60 Secondes sur MiniMax H3 vs Veo 3.1 10 11Un générique d'anime standard dure environ 90 secondes. Disons huit plans de 8 secondes, 64 secondes de vidéo finie, plus une image clé par plan à 0,009 $ chacune. 12 13Il y a un véritable écart de prix que vous devriez connaître plutôt que de le laisser passer. Le catalogue d'Atlas Cloud liste MiniMax H3 à 0,10 $ par seconde fixe, tandis que le readme du modèle le détaille à 0,14 $/s en 2K et 0,10 $/s en 768P. Veo 3.1 est listé à 0,20 $ par seconde, tandis que son readme sépare 0,40 $/s avec audio de 0,20 $/s sans. 14 15Les boutons Run dans mes captures d'écran tranchent. H3 reference-to-video, 8 secondes en 2K, a facturé `Run 1,12 $`, ce qui est exactement 0,14 $ par seconde. Veo 3.1 image-to-video, 8 secondes en 1080p avec audio activé, a facturé `Run 3,2 $`, ce qui est exactement 0,40 $ par seconde. Donc les tarifs du readme sont ceux qui sont facturés, et le titre du catalogue est le niveau d'entrée. J'ai montré les deux lectures ci-dessous quand même. Ce sont les prix catalogue d'août 2026. 16 17**Tableau 4 : huit plans de 8 secondes, images clés incluses** 18 19| Configuration | Coût vidéo (tarif catalogue) | Coût vidéo (tarif readme) | Images clés | Fourchette totale | 20| --------------------------- | ---------------------------- | ------------------------- | ----------- | ----------------- | 21| MiniMax H3, 2K | 6,40 $ | 8,96 $ | 0,07 $ | 6,47 $ à 9,03 $ | 22| MiniMax H3, 768P | 6,40 $ | 6,40 $ | 0,07 $ | 6,47 $ | 23| Veo 3.1, 1080p avec audio | 12,80 $ | 25,60 $ | 0,07 $ | 12,87 $ à 25,67 $ | 24| Veo 3.1 Lite, 720p | 3,20 $ | 3,20 $ | 0,07 $ | 3,27 $ | 25 26Prix extraits des pages de modèles Atlas Cloud liées dans le Tableau 1, août 2026. Aucun de ces quatre n'est actuellement réduit. 27 28Deux choses que ce tableau n'inclut pas, et qui pèsent plus lourd que le tarif par seconde. 29 30**Répétitions.** Personne ne publie la première prise d'un plan anime. Quel que soit le multiplicateur que vous supposez, appliquez-le aux deux colonnes et l'écart se creuse dans la même proportion. 31 32**Temps réel, et celui-ci va dans l'autre sens.** Chronométré bout en bout le 7 août 2026 : H3 en 2K pour 8 secondes a pris 447 secondes, environ 7,5 minutes. H3 text-to-video en 2K pour 12 secondes a pris 334 secondes. Veo 3.1 en 1080p pour 8 secondes avec audio a pris 152 secondes, moins de trois minutes. Veo est environ trois fois plus rapide pour une première prise ici, et si vous itérez sur un plan à 2h du matin, cela vaut de l'argent réel. Les files d'attente bougent, donc traitez-les comme un instantané d'un après-midi plutôt que comme une spécification. Mais quiconque cite « 2 à 3 minutes » pour H3 en 2K cite un readme, pas une file d'attente. La [répartition 2K vs 768P](https://www.atlascloud.ai/blog/guides/minimax-h3-2k-vs-768p?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) couvre quand le niveau supérieur vaut les minutes supplémentaires. 33 34## Style Anime, Hommage, et Ce Que Vous Pouvez Réellement Publier 35 36Tout dans cet article est style et hommage. Un personnage original, une tenue originale, un titre original. Aucun personnage d'anime officiel n'a été généré ou demandé, et aucun nom ou image de vrai footballeur n'a été utilisé. La tendance de la Coupe du Monde est référencée comme un _format_, car c'est ce pour quoi elle est utile. 37 38Cette distinction n'est pas une décoration. Si vous produisez du contenu de style anime commercialement, « dans le style d'un OVA des années 90 » et « ce personnage spécifique de cette série spécifique » sont des objets juridiques différents, et un seul d'entre eux est une activité commerciale. 39 40Sur les poids ouverts : H3 est réellement téléchargeable, et les gens l'ont exécuté dès le premier jour. Un commentateur a signalé 10 minutes pour un clip 480p de 10 secondes sur une 4070 Ti Super avec 16 Go, et d'autres ont posté 3 minutes sur une 5080 et 68 secondes sur une RTX 6000 Pro. Mais l'auto-hébergement fonctionne avec un bord court de 768 ; les étapes Context-IR et Regenerate-2K qui produisent la 2K restent du côté de l'API. 41 42La licence a un vrai piège. La licence communautaire ne couvre actuellement pas l'UE, le Royaume-Uni, la Corée du Sud ou les États-Unis, citant des régions « développant ou appliquant actuellement des réglementations liées à l'IA ». Un canal de demande de licence formelle est ouvert, qu'un commentateur HN a résumé comme « vous devez juste promettre sur l'honneur que vous ne rendrez pas Disney fâché et ils vous enverront une licence ». Drôle, et aussi exactement l'étape de conformité que vous ne pouvez pas sauter si vous êtes dans l'un de ces quatre territoires. L'[article sur les poids ouverts](https://www.atlascloud.ai/blog/guides/minimax-h3-open-source-weights?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-anime-video-generator) contient la liste complète des territoires. 43 44## Foire Aux Questions 45 46### MiniMax H3 est-il un bon générateur de vidéo anime par rapport à Veo 3.1 ? 47 48Pour la plupart des travaux d'anime, H3, et principalement pour des raisons qui ne concernent pas le rendu. Il fonctionne de 4 à 15 secondes contre les 4, 6 ou 8 de Veo, il propose six rapports d'aspect dont 4:3 et 21:9 contre les deux de Veo, il liste le japonais parmi 11 langues de dialogue nativement stables, et il prend neuf images de référence contre les trois de Veo. Veo 3.1 gagne dans une situation spécifique : quand vous avez besoin de `seed` pour des reprises reproductibles, ou de `negative_prompt` pour empêcher un plan de dériver vers un ombrage de rendu 3D. H3 n'a aucun de ces paramètres. Si votre pipeline dépend de l'un ou l'autre, c'est une raison valable de rester. 49 50### Veo 3.1 peut-il générer de l'anime en 4:3 ou un clip de 15 secondes ? 51 52Non, et pas pour des raisons stylistiques. L'énumération `aspect_ratio` de Veo 3.1 contient exactement `16:9` et `9:16`, et son énumération `duration` contient exactement `4`, `6` et `8`. Il n'y a pas de valeur 4:3 à sélectionner et aucun moyen de demander 12 ou 15 secondes. Si votre référence est un anime TV ou OVA des années 90, le cadrage est inaccessible sur Veo et disponible sur H3. 53 54### Pourquoi mon clip anime Veo 3.1 est-il revenu silencieux ? 55 56Parce que `generate_audio` par défaut est `false` sur l'API. Le bouton dans le terrain de jeu est généralement déjà activé, donc cela ne concerne que les personnes appelant directement l'API. Définissez `generate_audio: true` explicitement. Pendant que vous y êtes, définissez aussi `resolution`, car elle par défaut à `720p` plutôt que le 1080p ou 4k que vous vouliez probablement. 57 58### MiniMax H3 fait-il du dialogue en japonais et de la synchronisation labiale pour l'anime ? 59 60Oui. La fiche technique liste 11 langues avec un support de dialogue stable : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe et espagnol. L'audio est généré conjointement avec l'image en stéréo 32 kHz plutôt que doublé après, ce qui explique pourquoi le timing de la bouche tient sur toute une ligne au lieu des premières syllabes. Écrivez la ligne japonaise directement dans le prompt en japonais. 61 62### Combien d'images de référence puis-je utiliser pour garder un personnage d'anime cohérent ? 63 64MiniMax H3 accepte jusqu'à 9 images, jusqu'à 3 clips vidéo et jusqu'à 3 clips audio, avec un plafond strict de 12 fichiers tous types confondus. Le point de terminaison reference-to-video de Veo 3.1 accepte 1 à 3 images, et le sélectionner réduit `duration` à `8` comme seule valeur légale. Pour un personnage d'anime récurrent dans une série, cette différence est tout le jeu. 65 66### MiniMax H3 a des poids ouverts, donc je peux exécuter mon pipeline d'anime localement gratuitement ? 67 68Vous pouvez le télécharger et l'exécuter, avec trois réserves. L'inférence auto-hébergée fonctionne avec un bord court de 768, et les étapes Context-IR et Regenerate-2K qui produisent la sortie 2K restent du côté de l'API. Les vitesses locales réelles varient considérablement selon la carte : environ 10 minutes pour un clip 480p de 10 secondes sur une 4070 Ti Super, environ 3 minutes sur une 5080, environ 68 secondes sur une RTX 6000 Pro, selon le fil ComfyUI du jour 0. Et la licence communautaire ne couvre actuellement pas l'UE, le Royaume-Uni, la Corée du Sud ou les États-Unis, donc si vous êtes dans l'un de ces pays, vous avez besoin de la licence formelle avant une utilisation commerciale.






