DEUX SEMAINES SEULEMENT | 20 % DE RÉDUCTION sur Seedream 5.0 Pro !

MiniMax H3 est en ligne : vidéo native 2K, un seul passage, et un coût réduit par seconde.

MiniMax H3 est disponible sur Atlas Cloud : vidéo native 2K avec audio stéréo en un seul passage. Voir la tarification réelle à la seconde, trois points d’entrée API et des prompts prêts à copier.

Une résolution plus élevée a toujours signifié une facture plus élevée. MiniMax H3 enfreint silencieusement cette règle. Il génère directement en 2K natif, et le prix à la seconde est inférieur à ce que coûte un clip en 720p sur le modèle vidéo que la plupart des gens utilisent en premier.

 

 

Voilà le titre, mais la résolution et le prix ne représentent que la moitié de ce qui rend MiniMax H3 intéressant. L'autre moitié, c'est son fonctionnement : un seul modèle qui lit le texte, l'image, la vidéo et l'audio ensemble et renvoie un clip finalisé, image et son, en une seule passe. Voici ce qu'il fait, ce qu'il coûte, et les prompts exacts qui ont produit chaque clip de cet article.

Points clés

  • MiniMax H3 génère du 2K natif (2560 x 1440) avec une bande-son stéréo synchronisée générée dans la même passe, pas ajoutée après.
  • Prix vérifiés sur la page du modèle (juillet 2026) : 2K à 0,14 $ par seconde, 768p à 0,10 $ par seconde. Pour comparaison, Seedance 2.0 coûte environ 0,24 $ par seconde en 720p, donc H3 offre une image de résolution supérieure pour un prix unitaire inférieur.
  • Trois points d'entrée (texte, image et référence vidéo) partagent une même clé API. La référence vers vidéo accepte jusqu'à neuf images, clips et une piste audio mélangés comme ancres d'identité.

MiniMax H3 fonctionne en une seule passe au lieu de trois outils

Fabriquer un clip fini nécessite généralement de diviser le travail. Vous générez une image dans un modèle, passez à un deuxième modèle pour l'audio, puis ouvrez un éditeur pour aligner les deux. Chaque transfert perd un peu de l'intention originale, et la chronologie s'allonge rapidement.

MiniMax H3 condense tout cela. Il lit l'ensemble du brief comme un seul contexte : à quoi ressemble le personnage, comment se déroule le mouvement, comment la caméra bouge, la clé émotionnelle, et ce que le son doit évoquer – tout entre ensemble et ressort sous forme d'un seul clip. MiniMax présente cette orientation comme un éloignement des modèles spécialisés par tâche vers une intelligence multimodale générale, et en pratique, cela signifie moins d'outils ouverts à la fois.

Deux choses méritent d'être dites clairement, car toutes deux sont faciles à vérifier dans le résultat. Premièrement, les clips contiennent du son réel : les fichiers de démonstration ci-dessous sortent avec une piste audio stéréo intégrée, pas ajoutée en post-production. Deuxièmement, la résolution est véritablement du 2K, 2560 x 1440 à 24 images par seconde, pas un upscale.

Trois façons d'utiliser MiniMax H3 sur Atlas Cloud

MiniMax H3 est disponible sur Atlas Cloud avec trois points d'entrée, et tous répondent à la même clé API. Chacun dispose d'un Playground que vous pouvez essayer dans le navigateur avant d'écrire une ligne de code.

Point d'entréePiloté parEntréesIdéal pour
Texte vers vidéoUn seul prompt texteAucun matériel de référenceCréer une scène à partir de zéro
Image vers vidéoUne première image, plus une dernière image optionnelleUne ou deux images fixesAnimer une image fixe que vous possédez déjà
Référence vers vidéoUn prompt texte plus un matériel de référenceJusqu'à 9 images, clips vidéo et une piste audio mélangésGarder un personnage, un produit ou un style cohérent tout au long du clip

Le chemin référence vers vidéo est le plus flexible. Il traite vos références comme des ancres d'identité, de sorte qu'un personnage, un produit ou un look reste cohérent pendant que le prompt le place dans de nouvelles scènes et mouvements. Vous pouvez mélanger des images et des clips vidéo, et ajouter une piste audio pour synchroniser l'action sur un rythme. Au moins une image ou une vidéo est requise ; l'audio seul n'est pas autorisé.

Comme chaque modèle sur la plateforme partage une même convention d'appel, passer à H3 depuis un autre modèle vidéo consiste simplement à changer le champ model. L'authentification, le polling et la récupération des résultats restent identiques, ce qui est l'avantage silencieux d'utiliser des modèles vidéo, image, audio et langage derrière une seule clé et une seule facture.

Combien coûte MiniMax H3 : 2K, 768p et la comparaison avec Seedance

MiniMax H3 facture à la seconde de vidéo générée, selon la résolution. Ces chiffres proviennent directement de la page du modèle, vérifiée le 31 juillet 2026.

RésolutionCoût par secondeUn clip de 8 secondes
2K (2560 x 1440)0,14 $1,12 $
768p0,10 $0,80 $

Voici la partie qui semble contre-intuitive au premier abord. Une seconde de H3 en 2K natif coûte 0,14 $. En comparaison, Seedance 2.0, l'autre modèle vidéo phare de la plateforme, facture environ 0,24 $ par seconde en 720p. Donc H3 vous offre une image de résolution supérieure, à un prix inférieur par seconde, par rapport à un clip de résolution inférieure sur Seedance. Résolution en hausse, prix unitaire en baisse, en même temps.

Une note honnête sur le chiffre, pour que personne ne se trompe dans son budget. Il n'y a pas de promotion derrière le prix de H3. La remise de 20 % en cours sur la plateforme concerne le modèle d'image Seedream 5.0 Pro, pas H3, donc 0,14 $ par seconde en 2K est le tarif en vigueur à fin juillet 2026. Le palier 768p est listé à 0,10 $ par seconde ; le 2K est le palier disponible et appelable aujourd'hui.

Le livre de prompts MiniMax H3 : des démonstrations que vous pouvez copier

Chaque clip ci-dessous a été produit par le prompt imprimé à côté. Copiez-en un, remplacez par vos propres références, et exécutez-le. Chaque bloc montre également les images de référence qui ont été utilisées, dans l'ordre où le prompt les appelle (image 1, image 2, etc.).

Films de marque et cinéma/TV

Les bandes-annonces, les spots TVC et les films d'ambiance de marque sont les plus directement adaptés, car ils s'intègrent dans un pipeline de contenu existant avec le moins de retouches.

Références d'entrée, image 1 pour l'ambiance et le style, image 2 pour le personnage principal : Silhouette faisant face à un portail géant avec le texte The Stars Were Listening Image de référence 1, ambiance et style général Vues multiples d'une femme portant un long manteau gris charbon Image de référence 2, le personnage principal

 

 

Plain
1Look cinématographique réaliste, lumière et ombre à fort contraste, rythme serré. L'image 1 est la référence pour l'ambiance et le style général. L'image 2 est la référence pour le personnage principal. Plan 1, plan d'ensemble ultra-large. Une énorme porte cosmique circulaire remplit presque le cadre ; la silhouette est petite devant, placée bas et légèrement à droite du centre. Le sol est mouillé et réfléchissant ; le centre de la porte est noir d'encre. La caméra avance lentement. Un titre principal apparaît en fondu depuis le bord de l'obscurité, d'abord flou puis net : "THE STARS WERE LISTENING", très étroit, gras, tout en majuscules, rouge foncé mêlé de rouille, avec un léger grain et des bords flous. Audio : pulsation grave et profonde, grondement métallique lointain, un coup doux lorsque le texte se résout. Coupe franche.

Création visuelle et packaging de contenu

Courts métrages créatifs, séquences de titres, vidéos musicales d'ambiance et affiches animées. C'est là que la gestion du texte à l'écran et du rythme du modèle se montre le plus.

Séquence de titre de film criminel à suspense léger. Cinq références de style définissent le look rétro-anime, collage de bande dessinée ; le modèle rend chaque crédit anglais lisible et fait atterrir les transitions sur les coups de batterie. Bannière anime noir mettant en scène un personnage silhouetté dans un train de métro Référence de style Détective en silhouette tenant une photo devant un tableau d'indices Référence de style

 

 

Plain
1Génère une séquence de titre d'ouverture en paysage 16:9 de 15 secondes pour un film criminel à suspense léger. Le style général suit le langage visuel de ces images : séquences de titre rétro-anime japonaises, silhouettes aux bords nets, collage de bande dessinée, écrans partagés asymétriques, blocs de couleur géométriques forts, crédits en anglais, quelques décorations en katakana japonais, attitude jazz-crime. L'ambiance est 60% suspense, 40% jazz : mystérieuse, cool, agile, avec une sensation de crime urbain, pas d'horreur, pas lourde. Le mouvement ressemble à un collage de graphisme animé : des cadres de lignes apparaissent d'abord sur fond noir, les limites de l'écran partagé défilent rapidement, les blocs de couleur et les panneaux se collent bloc par bloc ; les silhouettes de personnages, les gros plans d'accessoires et les crédits anglais glissent, apparaissent et se dévoilent par masque en séquence sur les coups de batterie. Les crédits en anglais doivent être clairement lisibles et peuvent être animés. N'ajoute pas de chinois, pas de caractères illisibles, pas d'anglais mal orthographié. Chaque crédit et rôle en anglais apparaît exactement une fois. Garde les transitions variées : masque vinyle circulaire, coupe verticale de porte de voiture, une longue ombre humaine balayant l'écran, coupe de ligne rouge, grand masque de lettre anglaise, recomposition de cadre en écran partagé, coupe dure de bloc de couleur. Toutes les transitions atterrissent sur les coups de batterie. Pas de fondus doux. BGM : musique de titre originale de 15 secondes, 60% suspense, 40% jazz, construite à partir d'une note de basse soutenue, cordes pizzicato tendues, pulsations de synthé froides, grosse caisse, brosses de jazz clairsemées et courtes phrases de saxophone grave. Les 2 premières secondes établissent le suspense avec des fréquences graves et des charleston ; à 3 secondes, un coup de batterie grave entre ; à 6 secondes, un groove de basse jazz rejoint ; à 10 secondes, un court riff de saxophone apparaît ; les 2 dernières secondes verrouillent le cadre avec un accord tendu plus un coup de batterie. N'imite aucune mélodie existante.

Cuisine live-action fusionnée avec de l'animation dessinée à la main. Aucun matériel de référence, texte vers vidéo uniquement. Le prompt mise sur une texture imparfaite de caméra de téléphone pour éviter de ressembler à une publicité.

 

 

Plain
115 secondes, paysage 16:9. Images live-action d'une petite cuisine au crépuscule fusionnées avec une animation lumineuse dessinée à la main. La lumière du coucher de soleil persiste encore à la fenêtre ; la petite cuisine vécue a une vieille table en bois, une tasse à moitié lavée, une bouteille en verre légèrement embuée et un torchon suspendu. L'image porte le léger tremblement de la prise de vue à une main avec un smartphone, l'hésitation lors de la mise au point en gros plan, les fluctuations d'exposition dues au contre-jour, et un bruit légèrement grossier dans les ombres. Ne la rends pas soigneusement composée comme une publicité, cela doit donner l'impression que quelqu'un filme à la hâte quelque chose d'impossible chez lui. Pas de grands yeux, pas de bouches fendues, pas de crocs, pas de mouvements menaçants ou de bond, pas de coupe soudaine au noir, pas de jumpscares. Le son utilise uniquement l'ambiance sonore de la cuisine, le frottement du torchon, le léger cliquetis de la tasse, l'eau qui goutte du robinet, les pas du filmeur et une respiration légère, plus le doux ton électronique et les petits cris de la créature dessinée à la main.

Clip musical dark-pop, cyber-grunge. Deux références définissent le traitement typographique et la texture d'impression ; le montage reste dur, pas de fondus. Trois femmes posant dans des tenues déchirées avec des accents de fausse fourrure Référence de traitement typographique Grille de modèles de design typographique déchirés en noir, blanc et rouge Référence de traitement typographique

 

 

Plain
1Style : dark-pop / cyber-grunge / clip rap, texture réaliste de haute couture, texture de magazine de cinéma, contraste élevé mais pas bon marché. Référence globale : magazines indépendants de la fin des années 90 au début des années 2000, papier photocopieur, scans de films, affiches de musique underground et esthétique de collage zine. L'image a un grain grossier, un léger tremblement de film, des points de trame, des bavures d'impression et un mauvais alignement de scan. Rythme de montage rapide, uniquement des coupes franches, pas de fondus et pas de transitions douces. Le style et la texture du traitement typographique suivent les images de référence.

Affiche animée. Une référence, l'affiche statique originale. Le prompt conserve la disposition et la palette inchangées et n'anime que l'entrée du texte. Garçon anime en hoodie dinosaure rose tendant la main avec une griffe géante L'affiche statique originale

 

 

Plain
1Réalise une vidéo d'affiche animée. Garde le cadre blanc de la galerie, le cadre intérieur, la palette rouge-blanc-noir, l'aspect figurine 3D et la structure de disposition de l'image originale inchangés ; lorsque le texte entre, ajoute un effet sonore d'entrée de texte agile.

Expérience numérique et création de jeux

Interface utilisateur de jeu, interfaces produit et démos d'interaction. Le point fort ici est que H3 suit un prompt écrit sous forme de blocs chronométrés.

Visite guidée de l'interface utilisateur de l'équipement de jeu, chronométrée par seconde. C'est celui qui mérite d'être lu attentivement. Le prompt est écrit sous forme de segments chronométrés, et le modèle les suit : états du menu, clics du curseur, panneaux qui glissent, grille d'armement, barre de chargement de 0 % à 100 %, puis l'environnement complet qui se charge autour du personnage. Personnage de poulpe stylisé aux cheveux roses assis en tailleur sur un fond violet uni Image de référence 1, le personnage Menu de jeu vidéo violet avec le curseur pointant sur le bouton Continuer Image de référence 2, le style de l'interface utilisateur

 

 

Plain
1La référence du personnage est l'image 1, la référence du style de l'interface utilisateur est l'image 2.
2
3[0s-2s] Prise de vue plongeante. Le personnage est assis sur un sol violet vif très saturé, en référence à l'image 1, regardant vers la caméra. Une interface utilisateur de menu de jeu s'affiche à droite : START NEW GAME, CONTINUE (surligné), SETTINGS, EXIT GAME. Le profil du joueur MINIMAX s'affiche en haut à gauche. Le curseur clique sur "CONTINUE".
4
5[2s-4s] Zoom fluide vers son bras droit. Un panneau d'interface utilisateur glisse depuis la droite et le panneau "RIGHT ARM EQUIPMENT" apparaît. La sélection met en surbrillance "PHANTOM GRIP", puis glisse vers "CHRONOS CLAW". Sa main droite se reconfigure mécaniquement, les doigts se séparent, de nouvelles articulations en forme de griffe se verrouillent en place, les LED cyan clignotent plus fort.
6
7[4s-7s] La caméra décrit un arc fluide autour de son côté gauche. Une nouvelle interface utilisateur glisse, la grille "ARMAMENT CUSTOMIZATION", montrant les composants de la main, de l'avant-bras, du coude et du haut du bras. La sélection parcourt rapidement les pièces. Son bras gauche se désassemble segment par segment, avec des câbles et des pistons exposés visibles pendant l'échange.
8
9[7s-8.5s] La caméra recule pour un plan moyen. Le bouton CONFIRM CONFIG clignote. Clic. Tous les panneaux de l'interface utilisateur se contractent et disparaissent. Le personnage déplie ses jambes et s'assoit maintenant détendu, un genou relevé.
10
11[8.5s-10s] Une barre de CHARGEMENT apparaît en bas, se remplissant rapidement de 0% à 100%. L'environnement violet vif commence à s'assombrir, des ombres rampantes depuis les bords, une lumière dorée chaude s'infiltrant.
12
13[10s-15s] Alors qu'elle se lève, l'environnement complet se charge autour d'elle. Un bidonville cyberpunk dense se résout : néons clignotants, rues mouillées reflétant la lumière, foules en mouvement, motos qui zigzaguent, bâtiments empilés s'étendant vers des gratte-ciel lointains. La caméra se stabilise en troisième personne derrière elle. Des éléments d'interface HUD apparaissent en fondu, avec une mini-carte en haut à droite et un compteur de santé et de munitions en bas à gauche. Un marqueur de quête apparaît. Elle s'avance dans la rue.

Démo UI/UX de page de destination produit. Une photo du produit comme référence ; le prompt demande une page de destination dynamique et énergique. Chaussure de course Nike bleu clair avec des accents verts et un talon rose La photo du produit de référence

 

 

Plain
1Une page web, conception d'interface utilisateur de page web, animation web, la vidéo montre un défilement fluide vers le bas de la page. Une vidéo démo UI/UX de page de destination produit explosive et très énergique, de style site officiel Nike, dont le sujet principal présenté est le produit de l'image 1. La page utilise une typographie sans empattement surdimensionnée, inclinée, puissante et grossière pour une disposition percutante. En arrière-plan, des ombres et lumières rapides, une texture de fibre de carbone sombre ou de maille respirante sportive s'entrelacent et se déplacent. La vidéo montre un défilement de page vers le bas au rythme serré, ainsi que des interactions UI telles qu'un fort agrandissement visuel et une inversion des couleurs au survol.

Mouvement d'interface utilisateur web, prompt minimal. La preuve que le style chronométré et détaillé est facultatif ; une instruction courte fonctionne aussi. Voiture de sport électrique grise élégante avec des feux arrière rouges lumineux dans un studio sombre Image de référence

 

 

Plain
1Simule une conception d'interface utilisateur web : d'abord le titre en haut glisse vers le bas pour apparaître, puis la barre de texte en dessous remonte, et les lumières de la voiture passent de sombres à rouges.

Comment démarrer avec MiniMax H3

Il y a deux façons de commencer, et aucune ne prend beaucoup de temps.

Utilisez-le dans le Playground. Connectez-vous à Atlas Cloud et ouvrez MiniMax H3 directement sur la page du modèle. Tapez un prompt, choisissez une résolution et une durée, et générez, sans code requis. C'est le moyen le plus rapide de voir si le modèle correspond à votre plan avant de l'intégrer dans quoi que ce soit.

Ou appelez l'API en trois étapes.

  1. Obtenez votre clé API. Ouvrez la console Atlas Cloud et créez une clé sur la page des clés API. Les trois points d'entrée H3 partagent la même clé.
  2. Lisez les champs sur la page du modèle. La référence des paramètres et le code copiable se trouvent sur chaque point d'entrée : texte-vers-vidéo, image-vers-vidéo, et référence-vers-vidéo. Les trois prennent des entrées différentes, donc ne mélangez pas leurs corps de requête.
  3. Lancez la première requête. Un seul point de terminaison et une seule convention d'appel atteignent tous les modèles de la plateforme, donc passer d'un autre modèle vidéo à H3 signifie changer le champ model pour le point d'entrée H3 correspondant. L'authentification, le polling et la récupération des résultats restent les mêmes.

Au-delà de H3, la même clé atteint des modèles vidéo, image, audio et langage que vous pouvez combiner, une seule API et une seule facture, donc construire une pièce finie ne signifie pas faire la navette entre des actifs et des factures de différents fournisseurs.

Questions fréquemment posées

Qu'est-ce que MiniMax H3 ?

MiniMax H3 est le modèle de génération vidéo multimodal de MiniMax, disponible sur Atlas Cloud via trois points d'entrée : texte-vers-vidéo, image-vers-vidéo et référence-vers-vidéo. Il lit le texte, l'image, la vidéo et l'audio comme un seul contexte et renvoie un clip 2K fini avec un son synchronisé en une seule passe.

Combien coûte MiniMax H3 ?

MiniMax H3 facture à la seconde de vidéo. Vérifié sur la page du modèle en juillet 2026, le 2K natif (2560 x 1440) est à 0,14 $ par seconde et le 768p à 0,10 $ par seconde. Un clip de 8 secondes en 2K coûte donc 1,12 $. Il n'y a pas de réduction promotionnelle sur H3 à ce moment-là.

MiniMax H3 génère-t-il de l'audio, ou seulement de la vidéo ?

Les deux, ensemble. Les clips de démonstration sortent de MiniMax H3 avec une piste audio stéréo synchronisée générée dans la même passe que l'image, plutôt qu'ajoutée dans une étape séparée. Les prompts peuvent diriger le son, en décrivant la musique, les effets sonores et le timing en même temps que les visuels.

Quelle est la différence entre les trois points d'entrée de MiniMax H3 ?

Texte-vers-vidéo fonctionne à partir d'un seul prompt. Image-vers-vidéo anime une première image, avec une dernière image optionnelle. Référence-vers-vidéo maintient un sujet cohérent en utilisant jusqu'à neuf matériaux de référence mélangés, images, clips vidéo et une piste audio. Les trois partagent une même clé API et une même convention d'appel.

Quelle résolution et quelle durée de clip MiniMax H3 supporte-t-il ?

MiniMax H3 génère du 2K natif à 2560 x 1440 et 24 images par seconde, avec un palier 768p moins cher sur la grille tarifaire. Les clips durent d'environ 5 à 15 secondes, et les rapports d'aspect incluent adaptatif, 21:9, 16:9, 4:3, 1:1, 3:4 et 9:16.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles