

L’API MiniMax H3 donne accès au modèle vidéo multimodal généraliste de MiniMax, qui traite le texte, les images, la vidéo et l’audio comme un seul contexte plutôt que comme des tâches séparées. Les clips durent de 5 à 15 secondes à 24 FPS, dans des formats allant de 21:9 à 9:16, et une seule invite peut remplacer des personnages, changer des arrière-plans, réécrire des dialogues ou cloner une voix à partir d’un clip de référence. Atlas Cloud fournit le tout via un endpoint unique compatible OpenAI. Commencez à développer dès aujourd’hui.
Atlas Cloud vous offre les derniers modèles créatifs de pointe de l'industrie.
Chaque endpoint de l’API MiniMax H3 interprète différemment le texte, les images, la vidéo et l’audio ; parcourez donc les lignes ci-dessous et associez une modalité à ce que vous êtes en train de créer.
| Modalité | Description |
|---|---|
| MiniMax H3 T2V API (texte vers vidéo) | Rédigez un prompt allant jusqu’à 7,000 caractères et le modèle renvoie un clip de 5 à 15 secondes à 24 FPS en 1440p, avec un son stéréo natif généré dans le même passage. Le format d’image est défini pour chaque requête parmi 21:9, 16:9, 4:3, 1:1, 3:4 et 9:16 ; un seul appel couvre donc aussi bien les bandes-annonces cinématiques que les formats verticaux pour les réseaux sociaux. |
| MiniMax H3 I2V API (image vers vidéo) | Une image définit la première image, et deux images verrouillent à la fois la première et la dernière, H3 générant le mouvement entre les deux au format d’image de l’image d’entrée. Les sources de 256 à 5760 pixels par côté sont acceptées, ce qui permet de mettre facilement en mouvement des visuels clés, des images produit et des images de storyboard. |
| MiniMax H3 Omni Reference API (référence vers vidéo) | Besoin de faire fonctionner plusieurs sources ensemble ? Jusqu’à neuf images, trois clips vidéo et trois pistes audio peuvent tenir dans une seule requête, dans la limite de 12 fichiers, le tout étant interprété comme un contexte multimodal unique. Conservez un personnage, un mouvement de caméra ou un timbre de voix d’un plan à l’autre, ou modifiez un clip existant en remplaçant des sujets, des arrière-plans et des répliques parlées. |
Chaque clip renvoyé par l’API MiniMax H3 dure jusqu’à quinze secondes en 1440p avec son stéréo natif, généré à partir de n’importe quelle combinaison de références texte, image, vidéo et voix ; le même appel peut aussi modifier les personnages, les scènes et les dialogues dans des séquences que vous possédez déjà.
Une requête à l’API MiniMax H3 accepte jusqu’à neuf images de référence, trois clips vidéo et trois pistes audio, dans la limite de douze fichiers. Plutôt que de les lire comme des emplacements séparés, le modèle traite texte, image et son comme un contexte unique, en intégrant dans une même scène un personnage issu d’une photo, un mouvement de caméra issu d’un clip et une ambiance issue d’une piste. Les équipes qui disposent déjà de contenus bénéficient ainsi d’un chemin direct vers un plan finalisé.
Chaque résultat est livré avec du son. Les dialogues, l’ambiance et la musique sont produits en stéréo native lors du même passage qui rend l’image à 24 images par seconde ; il n’est donc pas nécessaire d’ajouter une musique ou un doublage ensuite. Comme le timing est défini pendant la génération du plan, les pas, la parole et les coupes restent synchronisés avec l’action. Les publicités courtes et les formats sociaux sortent prêts à publier.
Besoin de remplacer un chat par un chien, de changer un fond vert ou de réécrire une réplique ? L’API MiniMax H3 applique ce type de modifications à la vidéo que vous fournissez, qu’il s’agisse de personnages, d’objets, d’arrière-plans, d’éclairage ou d’effets, tandis que les éléments non mentionnés restent proches de l’original. Les prompts peuvent atteindre 7000 caractères, ce qui permet d’empiler une douzaine de changements en un seul passage. L’itération sur un montage validé devient ainsi réellement praticable.
Envoyez un échantillon de voix avec vos images ou vos séquences, et le personnage généré parlera avec ce timbre. Jusqu’à trois références audio sont autorisées par requête, chacune d’une durée de deux à quinze secondes, et l’audio doit toujours accompagner une entrée visuelle plutôt qu’être fourni seul. Les dialogues existants peuvent également être remplacés et l’interprétation ajustée en conséquence. Pour les séries, une même voix reconnaissable peut être conservée d’un épisode à l’autre.
Les clips durent de cinq à quinze secondes, et le mode 1440p place 1440 pixels sur le côté court entre 16:9 et 9:16, soit environ 3,7 mégapixels pour des ratios plus larges comme 2976 par 1248 en 21:9. Six ratios sont disponibles, du cinématique 21:9 au vertical 9:16, et l’API MiniMax H3 peut aussi en choisir un pour vous. Cette plage couvre une bande-annonce, une boucle produit et une fiction verticale sans changer de modèle.
Si vos fichiers source proviennent directement d’une caméra ou d’une timeline de montage, ils peuvent être envoyés tels quels : vidéo H.264 et H.265, images JPG, PNG, WEBP, HEIC et HEIF, ainsi que fichiers audio WAV et MP3. Les limites par fichier sont de 50MB pour la vidéo, 30MB pour les images et 15MB pour l’audio, tandis que la transmission des ressources par URL permet de maintenir les requêtes sous la limite de corps de 64MB. Sur Atlas Cloud, l’ensemble passe par une seule clé compatible OpenAI, avec une facturation à l’usage.
Chaque clip de cette série provient d’un prompt strictement identique envoyé à l’API MiniMax H3 et à deux autres modèles vidéo hébergés sur Atlas Cloud, afin de comparer le mouvement, le son et le respect des consignes sans changer un seul mot.
15 secondes, courte vidéo au format paysage 16:9. Prise de vues en live-action d’une laverie automatique en libre-service tard dans la nuit, mêlée à une animation lumineuse dessinée à la main pour créer une image en techniques mixtes. Une petite laverie en libre-service, avec ses néons qui vacillent faiblement ; à l’intérieur, des machines à laver en marche, des paniers à linge en plastique et un vieux banc, avec une chaussette seule posée au sol. Tout l’espace est silencieux, traversé par une légère atmosphère nostalgique. L’image doit avoir la texture d’une vidéo tournée d’une seule main avec un téléphone, avec un tremblement de caméra bien visible ; la lumière blanche des néons fait fluctuer l’exposition entre clair et sombre ; les surfaces vitrées portent des reflets ambiants ; la mise au point accuse un retard lorsque l’objectif s’approche des objets. L’image ne doit pas être aussi soignée et ordonnée qu’une publicité : l’impression générale doit être celle d’un véritable instantané documentaire, comme si vous étiez entré là par hasard au milieu de la nuit et aviez capté la scène en poursuivant une vision étrange, onirique.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Perspective à la première personne · hauteur des yeux · caméra de jeu portée à la main Scène : le plan simule un joueur aux commandes d’un FPS de guerre moderne, tenant un fusil d’assaut à deux mains tout en avançant lentement le long du périmètre extérieur d’une base militaire. Le joueur progresse sur une route à côté d’un abri, le réticule balayant le passage devant lui ; après une brève pause, il tire quelques rafales vers un objectif lointain, puis continue d’avancer, comme dans une séquence de gameplay en direct d’un joueur ordinaire. Éclairage : la lumière naturelle aux tons froids d’une base militaire moderne s’entremêle à la fumée et aux flammes de bouche. L’image est réaliste et nette, avec une arme métallique, de la poussière de champ de bataille et une brume qui évoquent une qualité de jeu AAA. Caméra : la caméra présente un léger balancement de prise de vue à main levée pendant les déplacements du joueur : d’abord une progression lente, puis de petits balayages vers la gauche et la droite pour observer, avec une subtile secousse de recul lors des tirs, avant de reprendre enfin une avancée régulière.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Des films de marque et dramas verticaux aux montages produit, visuels de jeu et retouches précises de séquences existantes, l’API MiniMax H3 couvre chaque scénario via une seule requête multimodale qui renvoie une vidéo avec audio stéréo natif.
Fournissez les images du storyboard et une liste de plans dans un seul appel pour des bandes-annonces 1440p, des spots TVC et des campagnes mode à 24 FPS. L’audio stéréo natif est livré avec chaque résultat, afin que les équipes de marque puissent visionner des montages finalisés.
La sortie verticale 9:16 couvre les scènes de drama scénarisées, du mystère en costume à la confrontation familiale, avec des dialogues générés dans le même passage. Les studios qui constituent des catalogues de dramas courts obtiennent des accroches de 15 secondes sans réserver d’acteurs ni de plateaux.
Si un plan nécessite un visage et un mouvement précis, jusqu’à neuf images, trois vidéos et trois clips audio peuvent guider un seul appel. L’identité du personnage, le travail de caméra et le timbre vocal restent cohérents d’un épisode à l’autre.
Besoin d’une modification après coup ? Les séquences existantes peuvent être éditées par prompt : remplacer un sujet, changer un arrière-plan, ajuster l’éclairage ou réécrire une réplique sans retourner une seule image.
Les photos produit prennent vie : une seule image de référence devient une présentation à 360 degrés, une vidéo explicative de fonctionnalité ou un montage pour les réseaux sociaux payants. Les formats de 21:9 à 9:16 permettent d’alimenter tous les emplacements avec un même ensemble de ressources.
Le rendu stylisé tient la route pour les CG de jeu, PV de personnages, openings d’anime et démos d’interface où les menus, éléments de HUD et incrustations de texte doivent rester lisibles. Les équipes artistiques l’utilisent pour valider des concepts avant la production.
Comparez l’API MiniMax H3 aux autres modèles vidéo hébergés sur Atlas Cloud et voyez concrètement les différences de modalités d’entrée, de limites de références, de durée, de résolution et de sortie audio avant de vous engager sur un endpoint.
| Modèle | Modalités d’entrée | Nombre maximal de fichiers de référence | Durée de sortie | Résolution maximale | Audio natif |
|---|---|---|---|---|---|
| MiniMax H3 | Texte, image, vidéo, audio | 9 images, 3 vidéos, 3 clips audio, 12 fichiers au total | 5s à 15s | 1440p à 24 FPS | √ Audio stéréo natif sur chaque sortie |
| Seedance 2.0 Reference-to-Video | Texte, image, vidéo, audio | 9 images, 3 vidéos, 3 clips audio | Jusqu’à 15s | 720p | √ Dialogues stéréo, effets et musique générés en une seule passe |
| Veo3.1 Reference-to-video | Texte et image | 3 images de référence | 4s, 6s ou 8s | 4K uniquement pour une durée de 8s | √ Dialogues, ambiance et effets sonores alignés sur la timeline |
| Wan-2.7 Reference-to-video | Texte, image, vidéo, audio | 5 images ou clips vidéo, plus un clip vocal | 2s à 15s | 1080p | √ Musique et effets générés, ou synchronisation labiale pilotée avec votre propre audio |
| Kling v3.0 Pro Image-to-Video | Texte et image | - | Jusqu’à 15s | 1080p | √ Dialogues multilingues avec synchronisation labiale en cinq langues |
Soyez opérationnel en quelques minutes — suivez ces étapes simples pour intégrer et déployer des modèles via la plateforme Atlas Cloud.
Inscrivez-vous sur atlascloud.ai et complétez la vérification. Les nouveaux utilisateurs reçoivent des crédits gratuits pour explorer la plateforme et tester les modèles.
Combiner les modèles MiniMax H3 avancés avec la plateforme accélérée par GPU d'Atlas Cloud offre des performances, une évolutivité et une expérience développeur inégalées.
Faible Latence :
Inférence optimisée par GPU pour un raisonnement en temps réel.
API Unifiée :
Exécutez MiniMax H3, GPT, Gemini et DeepSeek avec une seule intégration.
Tarification Transparente :
Facturation prévisible par token avec options serverless.
Expérience Développeur :
SDK, analytiques, outils de fine-tuning et modèles.
Fiabilité :
99,99% de disponibilité, RBAC et journalisation conforme.
Sécurité et Conformité :
SOC 2 Type II, alignement HIPAA, souveraineté des données aux États-Unis.
La MiniMax H3 API donne aux développeurs un accès programmatique à MiniMax H3, un modèle vidéo multimodal ouvert et généraliste qui traite le texte, les images, la vidéo et l’audio comme un contexte partagé unique. Plutôt que de séparer génération, montage et référence dans des modèles de tâches distincts, H3 lit l’ensemble complet des entrées et renvoie un clip finalisé avec le son. Sur Atlas Cloud, il fonctionne derrière une clé API unique, avec une tarification à l’usage.
Films de marque, bandes-annonces, courts dramas verticaux, spots produit et e-commerce, démos de motion pour jeux et UI, ainsi qu’animations stylisées font tous partie de son périmètre. Comme le modèle gère le texte à l’écran, les sous-titres et les assets de marque, les équipes l’utilisent aussi pour valider des concepts, prévisualiser des storyboards et préparer des pitches visuels avant d’engager un budget de production.
Créez un compte Atlas Cloud, générez une clé API, puis envoyez un prompt accompagné de tout fichier de référence au endpoint de génération vidéo et interrogez-le jusqu’à obtenir le résultat final. Il est recommandé de transmettre les médias sous forme d’URL hébergées plutôt qu’en uploads inline, car le corps de la requête est limité à 64MB. Commencez à développer dès aujourd’hui.
La facturation se fait à l’usage : vous payez par appel au lieu d’acheter un abonnement ou une licence par siège. Le coût suit ce que vous rendez réellement, ce qui signifie que la résolution et la durée du clip déterminent le total pour un lot. Consultez la page du modèle pour connaître le tarif actuel par génération avant de planifier des exécutions à grand volume.
Oui. Chaque résultat H3 est livré avec du son en stéréo native : dialogues, effets et ambiance arrivent dans la même passe que l’image. Fournissez un clip audio de référence et le modèle peut appliquer ce timbre à un personnage, ce qui supprime une étape distincte de synthèse vocale dans le pipeline.
Les clips durent de 5 à 15 secondes à 24 FPS. En mode 1440p, le petit côté est rendu à 1440 pixels pour les ratios compris entre 16:9 et 9:16 ; en dehors de cette plage, l’image conserve environ 3.7M pixels au total, par exemple 2976 par 1248 en 21:9. Les requêtes text to video et omni reference acceptent 21:9, 16:9, 4:3, 1:1, 3:4 et 9:16, tandis que les requêtes first and last frame héritent du ratio de l’image d’entrée.
Jusqu’à neuf images, trois segments vidéo et trois clips audio peuvent accompagner un même prompt, dans la limite de douze fichiers au total. La vidéo et l’audio doivent chacun rester dans une durée cumulée de 15 secondes, et l’audio doit accompagner une image ou une vidéo plutôt qu’être envoyé seul. Les prompts peuvent atteindre 7000 caractères, ce qui laisse de la place pour des consignes plan par plan couvrant la caméra, le jeu et le son.
Les entrées acceptées incluent les vidéos H.264 et H.265, les images JPG, JPEG, PNG, WEBP, HEIC et HEIF, ainsi que l’audio WAV ou MP3, avec AAC ou MP3 pour la piste audio à l’intérieur d’un fichier vidéo. Les limites par fichier sont de 50MB pour la vidéo, 30MB pour les images et 15MB pour l’audio. Comme le corps de la requête est limité à 64MB, les URL hébergées restent l’option la plus sûre pour les assets volumineux.
Le montage est l’un de ses modes principaux. Envoyez un clip source avec des instructions, et la MiniMax H3 API peut remplacer des personnages ou des objets, changer les arrière-plans et l’éclairage, ajouter des effets visuels en couches, et réécrire les dialogues tout en gardant stables les zones non modifiées. Les instructions composées sont traitées en une seule requête, de sorte que plusieurs changements s’appliquent ensemble plutôt qu’au fil d’allers-retours répétés.
La plupart des modèles vidéo prennent un prompt et une image, puis renvoient un clip muet. H3, lui, consomme un ensemble mixte de références, lit l’intention liée au personnage, au mouvement, à la caméra et au son à travers toutes ces références, puis renvoie un clip avec audio natif. Si votre pipeline assemble actuellement un modèle vidéo, un modèle vocal et un éditeur, H3 regroupe ces étapes en un seul appel.
Guides, tutoriels et actualités produit pour tirer le meilleur d'Atlas Cloud.