Tout l'été, mon fil d'actualité a été le même en boucle. Des joueurs de la Coupe du Monde redessinés en protagonistes de shonen. Un dictateur. Un capitaine pirate. Un mentor usé qui apparaît dans les quatre dernières secondes. Des millions de vues par publication, et l'histoire se met à jour après presque chaque match.
Personne ne produit des articles de référence. Ils choisissent un modèle, brûlent des crédits et expédient avant le coup d'envoi suivant.
J'ai donc pris une keyframe d'anime et un prompt, et testé MiniMax H3 comme générateur de vidéo d'anime contre Veo 3.1, tous deux poussés à leurs réglages maximum sur des entrées identiques.
La première chose qui a cassé n'était pas la qualité d'image. C'était un menu déroulant. Veo 3.1 s'arrête à 8 secondes et propose exactement deux ratios d'écran. Un plan qui tient sur un visage, un panoramique rapide avec le ballon, puis laisse un carton titre atterrir ne tient pas dans 8 secondes. Il n'a jamais eu la chance d'échouer sur la qualité.
Points clés
- L'énumération
durationde Veo 3.1 est[4, 6, 8]et son énumérationaspect_ratioest[16:9, 9:16]. MiniMax H3 fonctionne de 4 à 15 secondes entières et propose21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Pas de 4:3 sur Veo signifie pas de cadrage rétro OVA, du tout. - La fiche technique de H3 liste 11 langues de dialogue natives stables, et le japonais en fait partie. L'audio et l'image sont générés ensemble en stéréo 32 kHz, pas doublés après coup.
- Les packs de référence ne sont pas comparables : H3 accepte jusqu'à 9 images plus jusqu'à 3 vidéos et 3 clips audio (12 fichiers max). L'endpoint de référence de Veo 3.1 prend 3 images, et dès que vous l'utilisez,
durationse réduit à[8]uniquement. - Deux pièges qui ruinent silencieusement les tests : l'API de Veo a
generate_audiopar défaut àfalseetresolutionà720p, et le ratio par défaut de H3 en text-to-video est1:1. Laissez-les ainsi et vous comparez un clip silencieux en 720p avec un clip carré. - Veo 3.1 conserve deux choses que H3 n'a pas du tout :
seedetnegative_prompt. Pour l'anime 2D, ce second point compte vraiment, et je vais montrer où.
MiniMax H3 Générateur de Vidéo Anime vs Veo 3.1, La Même Image en Boucle
Un personnage original. Une keyframe. Un prompt, copié caractère par caractère dans les deux modèles. Tout le reste au maximum de chaque côté.
MiniMax H3, image-to-video, 2K, 8 secondes, audio natif. Activez le son : le bruit de la foule, le coup de pied et le cri japonais sont générés dans le même passage que l'image. Généré avec minimax/h3/image-to-video sur Atlas Cloud.
Veo 3.1, image-to-video, 1080p, 8 secondes, generateaudio activé manuellement, plus un negativeprompt maintenant le line art à plat. Même première image, mêmes mots. Généré avec google/veo3.1/image-to-video sur Atlas Cloud.
Les deux dessinent magnifiquement. Le plan large de Veo sur le tir, avec des lignes d'impact dessinées à la main et un effet sonore manga flottant dans l'air, est vraiment charmant. C'est le point de départ honnête, et c'est pourquoi le reste de cet article porte sur les paramètres et le respect des instructions plutôt que sur les impressions.
Pourquoi la Plupart des Tests MiniMax H3 Générateur de Vidéo Anime vs Veo 3.1 Échouent
Deux choses se sont produites en même temps cet été.
L'anime est devenu le format le plus volumineux dans la vidéo IA. La Coupe du Monde 2026 a été réécrite comme un tournoi shonen, avec des joueurs incarnant un dictateur, un capitaine pirate, un général de marine et un mentor, et des histoires qui "évoluent après presque chaque match" sur TikTok, Instagram, X et YouTube (Complex, juillet 2026).
Et MiniMax H3 est sorti avec des poids ouverts. Le fil ComfyUI du jour 0 a atteint 330 points et 95 commentaires, avec des gens publiant des chiffres locaux réels en quelques heures (Hacker News, août 2026).
Mettez ces deux choses ensemble et vous vous attendriez à une pile de comparaisons d'anime. Il n'y en a presque pas, car la plupart des tests sont construits de travers de quatre manières.
Ils comparent des images, pas des contraintes. Les plans d'anime sont une question de timing. Un panoramique rapide jusqu'à un carton titre est un problème de durée avant d'être un problème de rendu.
Ils oublient que l'API de Veo est silencieuse par défaut. Sur l'API, generate_audio est false et resolution est 720p. Beaucoup de publications "Veo n'a pas d'audio dans l'anime" viennent juste de quelqu'un qui n'a jamais activé un booléen.
Ils oublient que le text-to-video de H3 est carré par défaut. ratio par défaut est 1:1, pas 16:9. Lancez un prompt t2v anime sans le définir et vous obtenez un clip carré et une conclusion confuse.
Ils testent avec des prompts photoréalistes. "Cinématique, lumière volumétrique, faible profondeur de champ" est exactement le vocabulaire qui tire un modèle 2D vers un rendu 3D. Le mode d'échec dans l'anime n'est pas le flou. C'est le plastique.
Les trois réglages qui décident un test anime avant même d'appuyer sur Exécuter
Avant tout le reste, définissez-les des deux côtés ou la comparaison est nulle.
| Réglage | MiniMax H3 | Veo 3.1 | Ce qui se passe si vous l'ignorez |
|---|---|---|---|
| Audio | Généré avec l'image, toujours activé | generate_audio par défaut à false | Veo renvoie un clip silencieux et semble pire qu'il ne l'est |
| Format d'image | ratio par défaut à 1:1 en text-to-video | aspect_ratio par défaut à 16:9 | H3 vous donne un carré d'anime inutilisable |
| Résolution | par défaut à 2K | par défaut à 720p | Vous comparez du 2K contre du 720p et appelez ça un écart de qualité |
La Fiche Technique MiniMax H3 vs Veo 3.1 pour l'Anime : Durée, Ratio, Audio, Références
J'ai récupéré les schémas d'entrée en direct des deux modèles plutôt que de me fier à un message de lancement. Chaque valeur ci-dessous est une énumération que vous pouvez lire vous-même sur les pages des modèles, pas une impression.
Tableau 1 : MiniMax H3 vs Veo 3.1, les paramètres qui décident d'un plan d'anime
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Durée | 4 à 15, toutes les secondes entières (par défaut 8) | 4, 6, 8 (par défaut 8) |
| Ratios d'écran | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Ratio par défaut (text-to-video) | 1:01 | 16:09 |
| Résolution | 768P, 2K (par défaut 2K) | 720p, 1080p, 4k (par défaut 720p) |
| Audio | Généré conjointement, stéréo 32 kHz | generate_audio, par défaut false |
| Langues de dialogue natives | 11 stables, japonais inclus | Non publié comme liste stable |
| Pack de référence | jusqu'à 9 images, 3 vidéos, 3 clips audio, 12 fichiers au total | 3 images |
| Durée lors de l'utilisation de références | toujours 4 à 15 | réduit à 8 uniquement |
| seed | non disponible | disponible |
| negative_prompt | non disponible | disponible |
| Poids | téléchargeables | fermés |
Durée, ratio, résolution, audio et limites de référence sont lus à partir des schémas en direct sur les pages MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video et Veo 3.1 reference-to-video. Le plafond de 9 images et 12 fichiers et la liste de 11 langues de dialogue proviennent de la fiche technique MiniMax H3 (Hugging Face, août 2026).
Maintenant, les classements, car ils disent quelque chose de différent de la fiche technique et les deux comptent.
Tableau 2 : Elo par vote public et prix par minute, instantané du 7 août 2026
| Modèle | Text-to-video (avec audio) | Image-to-video (avec audio) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1 244 (#1) ±7 | 1 191 (#2) ±9 | 6,00 $ |
| MiniMax H3 | 1 238 (#2) ±9 | 1 190 (#3) ±10 | 7,80 $ |
| Dreamina Seedance 2.0 720p | 1 224 (#3) ±6 | 1 198 (#1) ±7 | 9,07 $ |
| Kling 3.0 1080p (Pro) | 1 111 (#7) ±6 | non listé dans le top 10 | 20,16 $ |
| Veo 3.1 | 1 093 (#11) ±7 | 1 085 (#10) ±7 | 24,00 $ |
| Veo 3.1 Fast | 1 091 (#14) ±6 | non listé dans le top 10 | 9,00 $ |
| Veo 3.1 Lite | 1 089 (#15) ±7 | non listé dans le top 10 | 4,80 $ |
Chiffres Elo et prix issus de l'Artificial Analysis Video Arena (Artificial Analysis, août 2026). Ce sont des votes publics glissants et ils évoluent. La colonne $/min est une estimation de modèle normalisée, pas votre facture.
Un écart Elo de 145 points est grand, mais c'est un vote généraliste, pas un vote anime. Et voici la partie que je dois dire clairement : MiniMax ne présente pas H3 comme un modèle d'anime. Les retours internes de première ligne listent le film, l'animation et le drame comique comme les domaines pour lesquels H3 n'est pas conçu. Donc la question intéressante n'est pas "lequel est le modèle d'anime". C'est pourquoi le modèle qui ne se vend pas comme tel gagne quand même le plan, et où Google remporte encore la manche.
Une note pratique avant le tutoriel. Chaque modèle ci-dessous fonctionne via la même console et la même clé API, ce qui est la seule raison pour laquelle les paramètres sont comparables. Même file d'attente, même authentification, une seule facture. Si vous configurez GPT Image 2 sur un service et Veo sur un autre, la moitié des différences que vous trouverez seront liées à la plomberie plutôt qu'au modèle.
Construire le Plan : MiniMax H3 vs Veo 3.1, Étape par Étape
Un exemple complet, du début à la fin. "Last Whistle" : un attaquant adolescent original, cheveux roux, maillot blanc et bleu marine numéro 9, lumières de stade, un panoramique rapide sur le tir, et un carton titre japonais qui doit atterrir dans les deux dernières secondes et rester stable.
Pas de vrai joueur, pas de personnage officiel, pas de propriété intellectuelle d'anime existante. Style et hommage seulement. Plus d'explications sur pourquoi dans un instant.
Étape 1 : Concevoir la keyframe d'anime avec GPT Image 2
La keyframe porte la direction artistique afin que le modèle vidéo n'ait pas à l'inventer. Notez l'espace négatif sur le tiers gauche : il est délibéré. Le carton titre y sera écrit par le modèle vidéo, et c'est le test de stabilité du texte.
Plain1Une seule image d'un anime sportif shonen moderne. Animation 2D en cel-shading, line art 2encré à la main avec une épaisseur de trait constante, aplats de couleur, ombres 3graphiques aux bords nets, absolument aucun ombrage 3D ni peau photoréaliste. Gros plan 4sur un attaquant adolescent original : cheveux roux en désordre, maillot blanc et bleu 5marine avec le numéro 9, sueur et traces d'herbe sur une joue, yeux écarquillés de 6détermination épuisée, bouche ouverte en plein cri. Derrière lui, les projecteurs du 7stade brillent dans un mur de couleur de foule floue ; des lignes de vitesse radiales 8jaillissent du centre du cadre ; un brin d'herbe reste suspendu dans l'air. Palette 9saturée, ombres cyan profond, lumière de contour orange chaud. Composition 16:9, le 10personnage cadré à droite du centre, espace négatif propre sur le tiers gauche. Pas de 11texte dans l'image.
Paramètres : modèle openai/gpt-image-2/text-to-image, qualité high, format 16:9 (2048x1152). Rien d'autre.

Playground GPT Image 2 sur Atlas Cloud avec le prompt de la keyframe Last Whistle et l'image d'anime finale dans le panneau de sortie
GPT Image 2 sur Atlas Cloud : qualité réglée sur high, la keyframe finale à droite.

La keyframe d'anime de base : un attaquant roux original en plein cri sous les projecteurs du stade, en cel-shading avec aplats et lignes de vitesse
La keyframe reçue par les deux modèles. Couleurs plates, ombres dures, et un tiers gauche vide prêt à recevoir un carton titre.
Étape 2 : MiniMax H3 image-to-video, tout au maximum
Même image en entrée, sortie en 2K. J'ai limité H3 à 8 secondes ici uniquement pour correspondre au plafond de Veo. Ce n'est pas la limite de H3 et l'étape 4 enlève cette limite.
Plain1Anime 2D en cel-shading, line art encré à la main, aplats de couleur, pas d'ombrage 3D. 2Tenez sur le visage de l'attaquant pendant un temps, puis un violent panoramique rapide 3suit le ballon lorsqu'il frappe, le panoramique étirant le cadre en traînées de mouvement 4sakuga. Une image de silence total à l'impact. Pendant les deux dernières secondes, un 5carton titre japonais blanc en caractères gras lisant ラストホイッスル apparaît sur le 6tiers gauche du cadre et reste parfaitement stable, sans déformation, sans scintillement, 7sans dérive. L'attaquant crie une ligne en japonais : 「まだ終わってない!」 8Audio : rugissement du stade qui monte, un impact de balle sec et aigu, un coup de taiko 9grave sous le carton titre.
Paramètres : modèle minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (l'image-to-video prend la forme du cadre de votre image d'entrée), image = sortie de l'étape 1.
Un avertissement si vous passez plutôt au text-to-video : écrivez explicitement ratio: 16:9. La valeur par défaut est 1:1 et il vous donnera volontiers un carré d'anime.

Playground MiniMax H3 image-to-video sur Atlas Cloud avec le prompt Last Whistle, la keyframe chargée et le clip final dans le panneau de sortie
MiniMax H3 image-to-video sur Atlas Cloud : la keyframe de l'étape 1 chargée à gauche, le clip final joué à droite.
Étape 3 : Veo 3.1 image-to-video, audio activé manuellement
Le prompt est identique, mot pour mot. Changez un seul adjectif et ce n'est plus une comparaison. Ce qui change, c'est le champ supplémentaire que Veo vous donne et que H3 n'a pas.
negative_prompt, qui pour l'anime 2D est le contrôle le plus utile de cette liste :
Plain13D render, CGI, ombrage plastique, peau photoréaliste, prise de vue réelle, soupe de 2flou de mouvement, lettrage déformé, texte absurde, doigts supplémentaires, barre de 3sous-titres
Paramètres : modèle google/veo3.1/image-to-video, resolution: 1080p (changez-le, la valeur par défaut est 720p), duration: 8 (c'est le plafond), aspect_ratio: 16:9, generate_audio: true (la valeur par défaut de l'API est false, c'est le piège du clip silencieux), seed: 20260807, image = même sortie de l'étape 1.

Playground Veo 3.1 image-to-video sur Atlas Cloud avec generate audio activé, la keyframe d'anime chargée et le clip final dans le panneau de sortie
Veo 3.1 image-to-video sur Atlas Cloud, avec Generate Audio activé et le clip final à droite.
Étape 4 : Noter sur cinq axes spécifiques à l'anime
Rien à générer ici. Juste regarder, sur les choses sur lesquelles l'anime échoue réellement. Les deux clips sont intégrés près du début de cet article, vous pouvez donc les noter vous-même au lieu de me croire sur parole.

Côte à côte de la dernière image des deux clips, MiniMax H3 à gauche avec un lettrage de carton titre japonais propre, Veo 3.1 à droite avec des caractères verticaux brouillés
La dernière image de chaque clip. À gauche, H3 a écrit ラストホイッスル, les huit katakana corrects et parfaitement stables. À droite, Veo 3.1 a écrit trois caractères qui ne sont pas le mot demandé et ne forment pas un mot.
Le carton titre est l'endroit où la manche a été décidée, et ce n'était pas serré. H3 a rendu les katakana demandés exactement, aux bords nets et stables, sur un panoramique filé du but. Veo 3.1 a produit une pile verticale de trois caractères qui ne sont ni le mot demandé ni un mot. Sur la même image, il a également fait sortir le personnage du cadre et laissé l'arrière-plan glisser vers un plan de stade semi-photoréaliste, malgré photorealistic skin et 3D render dans le negative prompt.
Tableau 3 : cinq axes qui décident d'un plan d'anime, à partir de ces deux exécutions
| Axe | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Continuité du personnage depuis la keyframe | A conservé exactement le visage, les cheveux et le maillot pendant les 8 secondes | A redessiné le personnage dans un nouveau plan large, fidèle mais un dessin différent |
| Épaisseur de trait et ombrage cel plat | A tenu, pas de dérive vers le 3D | A tenu dans le plan moyen, a dérivé vers un plan de stade photographique à la fin |
| Carton titre japonais | ラストホイッスル rendu correctement et stable | Trois caractères, pas le mot demandé, pas un mot |
| Piste audio livrée | Stéréo 32 kHz, exactement comme indiqué dans la fiche | Stéréo 48 kHz, présent uniquement car j'ai réglé generate_audio moi-même |
| Panoramique rapide et traînée sakuga | Exécuté comme un panoramique filé vers le carton | Remplacé par un cut sec vers un nouveau plan |
Cette dernière ligne est la critique publique la plus forte de H3 jusqu'à présent, ce qui est exactement pourquoi je l'ai écrite dans les deux prompts. Sur le fil ComfyUI du jour 0, l'utilisateur fwip s'est plaint que même les prompts de démonstration officiels étaient ignorés : "un violent WHIP PAN du toit qui EMBROUILLE les mots flottants avec lui, avec des traînées de mouvement. Et la vidéo n'a tout simplement pas fait cette transition, elle l'a remplacée par un cut."
Dans cette exécution, c'est Veo qui a remplacé le panoramique par un cut, et H3 qui a fait la traînée. Un seul essai de chaque ne constitue pas un verdict, et je ne dirais pas le contraire. Mais cela signifie que la critique n'est pas spécifique à H3 : les panoramiques rapides sont l'instruction la moins fiable de tout ce test, des deux côtés. Si votre storyboard en dépend, construisez autour plutôt qu'à travers.
Étape 5 : Le plan OVA rétro 4:3 que Veo 3.1 ne peut structurellement pas produire
Ce n'est pas une préférence de qualité. C'est un mur. L'énumération aspect_ratio de Veo a deux valeurs et aucune n'est 4:3, et son énumération duration n'a pas de 12. Le look OVA des années 90 est tout simplement inaccessible.
Plain1Un plan d'anime OVA des années 1990, plein cadre 4:3. Fond peint à la main avec texture 2de pinceau visible, personnages peints sur cellulo avec des lignes d'encre épaisses et 3irrégulières, forte lueur de halation autour des projecteurs, grain de film 16mm et 4léger tremblement de porte. Le même attaquant roux en maillot blanc et bleu marine 5numéro 9 sort d'un terrain détrempé par la pluie tandis que le bruit de la foule 6s'estompe en une seule sonnerie. La caméra se rapproche lentement de son visage. Il dit 7doucement en japonais : 「次は、勝つ」. Palette rétro : teal atténué, ambre poussiéreux, 8ombres bordeaux profond. Audio : pluie lointaine, un seul pad synthé analogique, un 9sifflet avec beaucoup de réverbération au loin.
Paramètres : modèle minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Définissez ce ratio manuellement, souvenez-vous de la valeur par défaut.

Playground MiniMax H3 text-to-video sur Atlas Cloud avec le prompt OVA tapé et le clip rétro final dans le panneau de sortie
MiniMax H3 text-to-video sur Atlas Cloud, prompt OVA tapé, clip terminé. Pleine transparence : cette exécution particulière a laissé le ratio d'aspect à 16:9 et la durée à 8, donc ce que vous voyez à droite est la version courte en écran large. Le plan de 12 secondes en 4:3 ci-dessous provient de l'appel API avec ratio: 4:3 et duration: 12 explicitement définis.

Le plan OVA rétro 4:3 : le même attaquant sortant d'un terrain détrempé par la pluie dans le style anime des années 90
H3 text-to-video, 4:3, 12 secondes. Le fichier livré est revenu en 1920x1440, soit du 4:3 au pixel près, avec une piste stéréo 32 kHz. Montré ici sous forme de GIF silencieux à une fréquence d'images réduite pour alléger la page. Généré avec minimax/h3/text-to-video sur Atlas Cloud.
Étape 6 : Neuf images de référence, un personnage, quatre plans
La cohérence du personnage entre les plans est le problème le plus difficile dans l'anime IA, et il est résolu par le volume de références. Construisez d'abord le pack : relancez le prompt de l'étape 1 avec le cadrage changé pour face, trois-quarts, profil complet, dos, riant, dents serrées, posture en pied, détail du maillot et détail des chaussures. Neuf images, environ huit cents au total.

Quatre angles du même attaquant original générés comme pack de référence, disposés en grille deux par deux
Quatre des neuf angles de référence. H3 accepte jusqu'à neuf images dans un seul pack de référence, plus des références vidéo et audio par-dessus.
Plain1Anime 2D en cel-shading, line art encré à la main cohérent, aplats de couleur, pas 2d'ombrage 3D. Gardez le visage, la silhouette des cheveux et le maillot numéro 9 de 3l'attaquant de référence identiques dans chaque plan. Quatre plans en une seule prise 4continue : (1) angle bas pénétrant sur ses chaussures touchant le gazon, (2) panoramique 5rapide vers le haut jusqu'à un gros plan serré de ses yeux, (3) plan large de lui 6sprintant devant trois défenseurs dessinés comme des silhouettes floues, (4) arrêt sur 7une tête en l'air, lignes de vitesse explosant vers l'extérieur. Audio : rugissement de 8la foule, souffle, impacts de chaussures sur le gazon, un coup de taiko sur l'arrêt.
Paramètres : modèle minimax/h3/reference-to-video, refers = vos images avec type: image, resolution: 2K, duration: 8 ou plus, ratio: adaptive ou 16:9.
L'équivalent Veo 3.1 ne peut pas être exécuté avec ces réglages et vous n'avez pas besoin d'essayer pour savoir pourquoi. Son endpoint de référence accepte un maximum de trois images, et choisir cet endpoint réduit duration à une seule valeur légale de 8. Un pack de neuf images et une prise de 10 secondes sont tous deux hors de portée.

Playground MiniMax H3 reference-to-video sur Atlas Cloud montrant le compteur de références à quatre sur neuf et le premier plan dans le panneau de sortie
MiniMax H3 reference-to-video sur Atlas Cloud. Le compteur indique Reference Materials (4/9) avec MAX:9 en dessous, ce qui est le plafond dans l'interface plutôt qu'une affirmation de la fiche technique. La sortie est le premier plan, l'angle bas pénétrant sur les chaussures.
Quatre Autres Exécutions du Générateur de Vidéo Anime MiniMax H3 à Essayer
Le plan Last Whistle ne sollicite que quatre différences. Ces quatre-là sollicitent le reste. Toutes tournent sur H3 ; les notes indiquent lesquelles Veo 3.1 peut égaler.
- Combat sakuga ultra-large,
21:9, 10 secondes. Veo ne peut pas produire du 21:9 du tout.
Plain1Action anime 2D en cel-shading, lignes d'encre épaisses et effilées, aplats de couleur, 2ombres aux bords nets, pas d'ombrage 3D. Deux duellistes masqués originaux sur un toit 3de temple balayé par le vent au crépuscule. Choc de lames, le cadre tremble, les deux 4combattants se séparent dans une explosion d'images d'impact dessinées à la main et de 5lignes de vitesse radiales. Caméra : angle bas pénétrant, puis un travelling latéral, 6puis un passage à une large silhouette contre le ciel orange. Audio : deux chocs métalliques 7secs, claquement de tissu, un coup de taiko grave sur l'arrêt final, pas de musique.
- Plan AMV synchronisé, reference-to-video avec une référence audio. H3 accepte jusqu'à trois clips audio comme entrée de référence. Veo 3.1 n'a aucune entrée audio, seulement une sortie audio.
Plain1Montage anime 2D en cel-shading coupé sur la piste audio de référence. Cinq temps 2courts : pluie sur une fenêtre, une main serrant un bandage, une ligne d'horizon 3défilant par la fenêtre d'un train, un départ en sprint, un arrêt sur une main tendue. 4Chaque coupe tombe exactement sur un temps fort de l'audio de référence. Couleurs plates, 5lignes d'encre épaisses, palette nocturne à fort contraste d'indigo profond et de 6magenta néon.
- Scène de dialogue en japonais de deux lignes, 12 secondes. C'est le test de stress du synchronisme labial, et 12 secondes sont déjà hors de la portée de Veo.
Plain1Anime 2D en cel-shading, aplats de couleur, pas d'ombrage 3D. Deux personnages originaux 2sur un toit à l'heure dorée, champ contre champ. Le premier dit en japonais : 3「本当に行くの?」. Le second répond, à moitié souriant, en japonais : 「もう決めた」. 4Les bouches correspondent à chaque syllabe. Lumière de contour chaude, longues ombres, 5vent doux dans les cheveux. Audio : deux voix japonaises distinctes, circulation lointaine, 6une cigale.
- Court métrage shonen vertical,
9:16, 8 secondes. Les deux modèles peuvent faire du vertical, c'est donc le seul endroit pour les comparer directement plutôt que de supposer.
Plain1Anime 2D en cel-shading, composition verticale. Une adolescente coureuse originale 2traverse une bannière en papier au ralenti, puis le cadre revient à pleine vitesse 3tandis qu'elle accélère dans une ligne droite de stade. Lignes de vitesse, couleurs 4plates, ombres dures, ciel graphique audacieux. Caméra : plan suivant en angle bas, puis 5un panoramique rapide vers son visage. Audio : déchirure de bannière, poussée de foule, 6un souffle retenu puis relâché.
Si vous voulez la grammaire des prompts derrière tout cela, le guide de prompt MiniMax H3 approfondit la façon dont H3 interprète les instructions de caméra et d'audio mieux que je ne peux le faire ici.
Combien Coûte un Opening d'Anime de 60 Secondes sur MiniMax H3 vs Veo 3.1
Un OP d'anime standard dure environ 90 secondes. Disons huit plans de 8 secondes, 64 secondes de vidéo finale, plus une keyframe par plan à 0,009 $ chacune.
Il y a une véritable divergence de prix que vous devriez connaître plutôt que de la laisser passer. Le catalogue Atlas Cloud affiche MiniMax H3 à 0,10 $ par seconde, tandis que le readme du modèle le détaille à 0,14 $/s en 2K et 0,10 $/s en 768P. Veo 3.1 est listé à 0,20 $ par seconde, tandis que son readme sépare 0,40 $/s avec audio et 0,20 $/s sans.
Les boutons d'exécution dans mes captures d'écran tranchent. H3 reference-to-video, 8 secondes en 2K, a indiqué Run $1.12, soit exactement 0,14 $ par seconde. Veo 3.1 image-to-video, 8 secondes en 1080p avec audio, a indiqué Run $3.2, soit exactement 0,40 $ par seconde. Les taux du readme sont donc ceux qui sont facturés, et le titre du catalogue est le palier d'entrée. J'ai montré les deux lectures ci-dessous quand même. Ce sont des prix catalogue en août 2026.
Tableau 4 : huit plans de 8 secondes, keyframes incluses
| Configuration | Coût vidéo (taux catalogue) | Coût vidéo (taux readme) | Keyframes | Fourchette totale |
|---|---|---|---|---|
| MiniMax H3, 2K | 6,40 $ | 8,96 $ | 0,07 $ | 6,47 $ à 9,03 $ |
| MiniMax H3, 768P | 6,40 $ | 6,40 $ | 0,07 $ | 6,47 $ |
| Veo 3.1, 1080p avec audio | 12,80 $ | 25,60 $ | 0,07 $ | 12,87 $ à 25,67 $ |
| Veo 3.1 Lite, 720p | 3,20 $ | 3,20 $ | 0,07 $ | 3,27 $ |
Prix extraits des pages des modèles Atlas Cloud liées dans le Tableau 1, août 2026. Aucun de ces quatre n'est actuellement réduit.
Deux choses que ce tableau n'inclut pas, et qui pèsent plus lourd que le taux par seconde.
Les retakes. Personne n'expédie la première prise d'un plan d'anime. Quel que soit le multiplicateur que vous supposez, appliquez-le aux deux colonnes et l'écart s'élargit dans la même proportion.
Le temps réel, et celui-ci va dans l'autre sens. Chronométré bout en bout le 7 août 2026 : H3 en 2K pour 8 secondes a pris 447 secondes, environ 7,5 minutes. H3 text-to-video en 2K pour 12 secondes a pris 334 secondes. Veo 3.1 en 1080p pour 8 secondes avec audio a pris 152 secondes, moins de trois minutes. Veo est environ trois fois plus rapide pour une première prise ici, et si vous itérez sur un plan à 2h du matin, cela vaut de l'argent réel. Les files d'attente bougent, donc traitez cela comme un instantané d'un après-midi plutôt que comme une spécification. Mais quiconque annonce "2 à 3 minutes" pour H3 en 2K cite un readme, pas une file d'attente. Le comparatif 2K vs 768P couvre quand le niveau supérieur vaut les minutes supplémentaires.
Style d'Anime, Hommage, et Ce Que Vous Pouvez Réellement Publier
Tout dans cet article est style et hommage. Un personnage original, un maillot original, un titre original. Aucun personnage d'anime officiel n'a été généré ou demandé, et aucun nom ou ressemblance de footballeur réel n'a été utilisé. La tendance de la Coupe du Monde est référencée en tant que format, car c'est ce pour quoi elle est utile.
Cette distinction n'est pas décorative. Si vous produisez du contenu de style anime commercialement, "dans le style des OVA des années 90" et "ce personnage spécifique de ce spectacle spécifique" sont des objets juridiques différents, et un seul d'entre eux est une activité.
Sur les poids ouverts : H3 est vraiment téléchargeable, et les gens l'ont exécuté dès le premier jour. Un commentateur a rapporté 10 minutes pour un clip de 10 secondes en 480p sur une 4070 Ti Super avec 16 Go, et d'autres ont posté 3 minutes sur une 5080 et 68 secondes sur un RTX 6000 Pro. Mais l'auto-hébergement fonctionne avec un bord court de 768 pixels ; les étapes Context-IR et Regenerate-2K qui produisent du 2K restent côté API.
La licence a un véritable piège. La licence communautaire ne couvre actuellement pas l'UE, le Royaume-Uni, la Corée du Sud ou les États-Unis, citant les régions "actuellement en développement ou en application de réglementations liées à l'IA". Un canal de demande de licence formelle est ouvert, qu'un commentateur HN a résumé comme "vous devez juste promettre sur l'honneur que vous ne fâcherez pas Disney et ils vous enverront une licence". Drôle, et aussi exactement l'étape de conformité que vous ne pouvez pas sauter si vous êtes dans l'un de ces quatre territoires. L'article sur les poids ouverts contient la liste complète des territoires.
Foire Aux Questions
MiniMax H3 est-il un bon générateur de vidéo d'anime par rapport à Veo 3.1 ?
Pour la plupart des travaux d'anime, H3, et principalement pour des raisons qui ne concernent pas le rendu. Il fonctionne de 4 à 15 secondes contre 4, 6 ou 8 pour Veo, il propose six ratios d'écran dont 4:3 et 21:9 contre deux pour Veo, il liste le japonais parmi 11 langues de dialogue natives stables, et il accepte neuf images de référence contre trois pour Veo. Veo 3.1 gagne dans une situation spécifique : quand vous avez besoin de seed pour des reprises reproductibles, ou de negative_prompt pour empêcher un plan de dériver vers un ombrage 3D. H3 n'a aucun de ces paramètres. Si votre pipeline dépend de l'un ou l'autre, c'est une raison valable de rester.
Veo 3.1 peut-il générer de l'anime en 4:3 ou un clip de 15 secondes ?
Non, et pas pour des raisons stylistiques. L'énumération aspect_ratio de Veo 3.1 contient exactement 16:9 et 9:16, et son énumération duration contient exactement 4, 6 et 8. Il n'y a pas de valeur 4:3 à sélectionner et aucun moyen de demander 12 ou 15 secondes. Si votre référence est un anime TV ou OVA des années 90, le cadrage est hors de portée sur Veo et disponible sur H3.
Pourquoi mon clip d'anime Veo 3.1 est-il revenu silencieux ?
Parce que generate_audio est par défaut false sur l'API. Le bouton du playground est généralement déjà activé, donc cela ne concerne que les personnes appelant l'API directement. Définissez explicitement generate_audio: true. Pendant que vous y êtes, définissez aussi resolution, car elle est par défaut à 720p plutôt que le 1080p ou 4k que vous vouliez probablement.
MiniMax H3 gère-t-il le dialogue en japonais et le synchronisme labial pour l'anime ?
Oui. La fiche technique liste 11 langues avec un support de dialogue stable : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe et espagnol. L'audio est généré conjointement avec l'image en stéréo 32 kHz plutôt que doublé après, ce qui explique pourquoi le timing de la bouche tient sur toute une ligne au lieu des premières syllabes. Écrivez la ligne japonaise directement dans le prompt en japonais.
Combien d'images de référence puis-je utiliser pour maintenir la cohérence d'un personnage d'anime ?
MiniMax H3 accepte jusqu'à 9 images, jusqu'à 3 clips vidéo et jusqu'à 3 clips audio, avec un plafond strict de 12 fichiers tous types confondus. L'endpoint reference-to-video de Veo 3.1 accepte 1 à 3 images, et le sélectionner réduit duration à 8 comme seule valeur légale. Pour un personnage d'anime récurrent dans une série, cette différence change tout.
MiniMax H3 a des poids ouverts, donc je peux exécuter mon pipeline d'anime localement gratuitement ?
Vous pouvez le télécharger et l'exécuter, avec trois réserves. L'inférence auto-hébergée fonctionne avec un bord court de 768 pixels, et les étapes Context-IR et Regenerate-2K qui produisent du 2K restent côté API. Les vitesses locales réelles varient considérablement selon la carte : environ 10 minutes pour un clip de 10 secondes en 480p sur une 4070 Ti Super, environ 3 minutes sur une 5080, environ 68 secondes sur un RTX 6000 Pro, selon le fil ComfyUI du jour 0. Et la licence communautaire ne couvre actuellement pas l'UE, le Royaume-Uni, la Corée du Sud ou les États-Unis, donc si vous êtes dans l'un de ces pays, vous avez besoin de la licence formelle avant toute utilisation commerciale.






