DEUX SEMAINES SEULEMENT | 20 % DE RÉDUCTION sur Seedream 5.0 Pro !
Hero background 1Hero background 2

MiniMax H3 API for Video Generation and Editing

L’API MiniMax H3 donne accès au modèle vidéo multimodal généraliste de MiniMax, qui traite le texte, les images, la vidéo et l’audio comme un seul contexte plutôt que comme des tâches séparées. Les clips durent de 5 à 15 secondes à 24 FPS, dans des formats allant de 21:9 à 9:16, et une seule invite peut remplacer des personnages, changer des arrière-plans, réécrire des dialogues ou cloner une voix à partir d’un clip de référence. Atlas Cloud fournit le tout via un endpoint unique compatible OpenAI. Commencez à développer dès aujourd’hui.

Explorez les Modèles Leaders

Atlas Cloud vous offre les derniers modèles créatifs de pointe de l'industrie.

Du texte à neuf références : modalités de l’API MiniMax H3

Chaque endpoint de l’API MiniMax H3 interprète différemment le texte, les images, la vidéo et l’audio ; parcourez donc les lignes ci-dessous et associez une modalité à ce que vous êtes en train de créer.

ModalitéDescription
MiniMax H3 T2V API (texte vers vidéo)Rédigez un prompt allant jusqu’à 7,000 caractères et le modèle renvoie un clip de 5 à 15 secondes à 24 FPS en 1440p, avec un son stéréo natif généré dans le même passage. Le format d’image est défini pour chaque requête parmi 21:9, 16:9, 4:3, 1:1, 3:4 et 9:16 ; un seul appel couvre donc aussi bien les bandes-annonces cinématiques que les formats verticaux pour les réseaux sociaux.
MiniMax H3 I2V API (image vers vidéo)Une image définit la première image, et deux images verrouillent à la fois la première et la dernière, H3 générant le mouvement entre les deux au format d’image de l’image d’entrée. Les sources de 256 à 5760 pixels par côté sont acceptées, ce qui permet de mettre facilement en mouvement des visuels clés, des images produit et des images de storyboard.
MiniMax H3 Omni Reference API (référence vers vidéo)Besoin de faire fonctionner plusieurs sources ensemble ? Jusqu’à neuf images, trois clips vidéo et trois pistes audio peuvent tenir dans une seule requête, dans la limite de 12 fichiers, le tout étant interprété comme un contexte multimodal unique. Conservez un personnage, un mouvement de caméra ou un timbre de voix d’un plan à l’autre, ou modifiez un clip existant en remplaçant des sujets, des arrière-plans et des répliques parlées.

Image, son et montage en un seul appel à l’API MiniMax H3

Chaque clip renvoyé par l’API MiniMax H3 dure jusqu’à quinze secondes en 1440p avec son stéréo natif, généré à partir de n’importe quelle combinaison de références texte, image, vidéo et voix ; le même appel peut aussi modifier les personnages, les scènes et les dialogues dans des séquences que vous possédez déjà.

Douze fichiers de référence, un seul appel à l’API MiniMax H3

Une requête à l’API MiniMax H3 accepte jusqu’à neuf images de référence, trois clips vidéo et trois pistes audio, dans la limite de douze fichiers. Plutôt que de les lire comme des emplacements séparés, le modèle traite texte, image et son comme un contexte unique, en intégrant dans une même scène un personnage issu d’une photo, un mouvement de caméra issu d’un clip et une ambiance issue d’une piste. Les équipes qui disposent déjà de contenus bénéficient ainsi d’un chemin direct vers un plan finalisé.

Son stéréo natif dans chaque clip

Chaque résultat est livré avec du son. Les dialogues, l’ambiance et la musique sont produits en stéréo native lors du même passage qui rend l’image à 24 images par seconde ; il n’est donc pas nécessaire d’ajouter une musique ou un doublage ensuite. Comme le timing est défini pendant la génération du plan, les pas, la parole et les coupes restent synchronisés avec l’action. Les publicités courtes et les formats sociaux sortent prêts à publier.

Modifications au niveau du prompt via l’API MiniMax H3

Besoin de remplacer un chat par un chien, de changer un fond vert ou de réécrire une réplique ? L’API MiniMax H3 applique ce type de modifications à la vidéo que vous fournissez, qu’il s’agisse de personnages, d’objets, d’arrière-plans, d’éclairage ou d’effets, tandis que les éléments non mentionnés restent proches de l’original. Les prompts peuvent atteindre 7000 caractères, ce qui permet d’empiler une douzaine de changements en un seul passage. L’itération sur un montage validé devient ainsi réellement praticable.

Transfert de timbre vocal et remplacement de dialogues

Envoyez un échantillon de voix avec vos images ou vos séquences, et le personnage généré parlera avec ce timbre. Jusqu’à trois références audio sont autorisées par requête, chacune d’une durée de deux à quinze secondes, et l’audio doit toujours accompagner une entrée visuelle plutôt qu’être fourni seul. Les dialogues existants peuvent également être remplacés et l’interprétation ajustée en conséquence. Pour les séries, une même voix reconnaissable peut être conservée d’un épisode à l’autre.

1440p et six formats d’image dans l’API MiniMax H3

Les clips durent de cinq à quinze secondes, et le mode 1440p place 1440 pixels sur le côté court entre 16:9 et 9:16, soit environ 3,7 mégapixels pour des ratios plus larges comme 2976 par 1248 en 21:9. Six ratios sont disponibles, du cinématique 21:9 au vertical 9:16, et l’API MiniMax H3 peut aussi en choisir un pour vous. Cette plage couvre une bande-annonce, une boucle produit et une fiction verticale sans changer de modèle.

Formats de production en entrée, sans étape de conversion

Si vos fichiers source proviennent directement d’une caméra ou d’une timeline de montage, ils peuvent être envoyés tels quels : vidéo H.264 et H.265, images JPG, PNG, WEBP, HEIC et HEIF, ainsi que fichiers audio WAV et MP3. Les limites par fichier sont de 50MB pour la vidéo, 30MB pour les images et 15MB pour l’audio, tandis que la transmission des ressources par URL permet de maintenir les requêtes sous la limite de corps de 64MB. Sur Atlas Cloud, l’ensemble passe par une seule clé compatible OpenAI, avec une facturation à l’usage.

Même prompt, trois moteurs : comparaison directe de l’API MiniMax H3

Chaque clip de cette série provient d’un prompt strictement identique envoyé à l’API MiniMax H3 et à deux autres modèles vidéo hébergés sur Atlas Cloud, afin de comparer le mouvement, le son et le respect des consignes sans changer un seul mot.

Prompt

15 secondes, courte vidéo au format paysage 16:9. Prise de vues en live-action d’une laverie automatique en libre-service tard dans la nuit, mêlée à une animation lumineuse dessinée à la main pour créer une image en techniques mixtes. Une petite laverie en libre-service, avec ses néons qui vacillent faiblement ; à l’intérieur, des machines à laver en marche, des paniers à linge en plastique et un vieux banc, avec une chaussette seule posée au sol. Tout l’espace est silencieux, traversé par une légère atmosphère nostalgique. L’image doit avoir la texture d’une vidéo tournée d’une seule main avec un téléphone, avec un tremblement de caméra bien visible ; la lumière blanche des néons fait fluctuer l’exposition entre clair et sombre ; les surfaces vitrées portent des reflets ambiants ; la mise au point accuse un retard lorsque l’objectif s’approche des objets. L’image ne doit pas être aussi soignée et ordonnée qu’une publicité : l’impression générale doit être celle d’un véritable instantané documentaire, comme si vous étiez entré là par hasard au milieu de la nuit et aviez capté la scène en poursuivant une vision étrange, onirique.

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

Prompt

Perspective à la première personne · hauteur des yeux · caméra de jeu portée à la main Scène : le plan simule un joueur aux commandes d’un FPS de guerre moderne, tenant un fusil d’assaut à deux mains tout en avançant lentement le long du périmètre extérieur d’une base militaire. Le joueur progresse sur une route à côté d’un abri, le réticule balayant le passage devant lui ; après une brève pause, il tire quelques rafales vers un objectif lointain, puis continue d’avancer, comme dans une séquence de gameplay en direct d’un joueur ordinaire. Éclairage : la lumière naturelle aux tons froids d’une base militaire moderne s’entremêle à la fumée et aux flammes de bouche. L’image est réaliste et nette, avec une arme métallique, de la poussière de champ de bataille et une brume qui évoquent une qualité de jeu AAA. Caméra : la caméra présente un léger balancement de prise de vue à main levée pendant les déplacements du joueur : d’abord une progression lente, puis de petits balayages vers la gauche et la droite pour observer, avec une subtile secousse de recul lors des tirs, avant de reprendre enfin une avancée régulière.

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

La place de l’API MiniMax H3 en production

Des films de marque et dramas verticaux aux montages produit, visuels de jeu et retouches précises de séquences existantes, l’API MiniMax H3 couvre chaque scénario via une seule requête multimodale qui renvoie une vidéo avec audio stéréo natif.

Films de marque cinématographiques avec l’API MiniMax H3

Fournissez les images du storyboard et une liste de plans dans un seul appel pour des bandes-annonces 1440p, des spots TVC et des campagnes mode à 24 FPS. L’audio stéréo natif est livré avec chaque résultat, afin que les équipes de marque puissent visionner des montages finalisés.

Production de dramas courts verticaux

La sortie verticale 9:16 couvre les scènes de drama scénarisées, du mystère en costume à la confrontation familiale, avec des dialogues générés dans le même passage. Les studios qui constituent des catalogues de dramas courts obtiennent des accroches de 15 secondes sans réserver d’acteurs ni de plateaux.

Assemblage de plans à références multiples

Si un plan nécessite un visage et un mouvement précis, jusqu’à neuf images, trois vidéos et trois clips audio peuvent guider un seul appel. L’identité du personnage, le travail de caméra et le timbre vocal restent cohérents d’un épisode à l’autre.

Montage de séquences existantes avec l’API MiniMax H3

Besoin d’une modification après coup ? Les séquences existantes peuvent être éditées par prompt : remplacer un sujet, changer un arrière-plan, ajuster l’éclairage ou réécrire une réplique sans retourner une seule image.

Marketing produit et e-commerce

Les photos produit prennent vie : une seule image de référence devient une présentation à 360 degrés, une vidéo explicative de fonctionnalité ou un montage pour les réseaux sociaux payants. Les formats de 21:9 à 9:16 permettent d’alimenter tous les emplacements avec un même ensemble de ressources.

API MiniMax H3 pour les visuels de jeu et d’anime

Le rendu stylisé tient la route pour les CG de jeu, PV de personnages, openings d’anime et démos d’interface où les menus, éléments de HUD et incrustations de texte doivent rester lisibles. Les équipes artistiques l’utilisent pour valider des concepts avant la production.

API MiniMax H3 comparée aux autres modèles vidéo multimodaux

Comparez l’API MiniMax H3 aux autres modèles vidéo hébergés sur Atlas Cloud et voyez concrètement les différences de modalités d’entrée, de limites de références, de durée, de résolution et de sortie audio avant de vous engager sur un endpoint.

ModèleModalités d’entréeNombre maximal de fichiers de référenceDurée de sortieRésolution maximaleAudio natif
MiniMax H3Texte, image, vidéo, audio9 images, 3 vidéos, 3 clips audio, 12 fichiers au total5s à 15s1440p à 24 FPS√ Audio stéréo natif sur chaque sortie
Seedance 2.0 Reference-to-VideoTexte, image, vidéo, audio9 images, 3 vidéos, 3 clips audioJusqu’à 15s720p√ Dialogues stéréo, effets et musique générés en une seule passe
Veo3.1 Reference-to-videoTexte et image3 images de référence4s, 6s ou 8s4K uniquement pour une durée de 8s√ Dialogues, ambiance et effets sonores alignés sur la timeline
Wan-2.7 Reference-to-videoTexte, image, vidéo, audio5 images ou clips vidéo, plus un clip vocal2s à 15s1080p√ Musique et effets générés, ou synchronisation labiale pilotée avec votre propre audio
Kling v3.0 Pro Image-to-VideoTexte et image-Jusqu’à 15s1080p√ Dialogues multilingues avec synchronisation labiale en cinq langues

Comment utiliser MiniMax H3 sur Atlas Cloud

Soyez opérationnel en quelques minutes — suivez ces étapes simples pour intégrer et déployer des modèles via la plateforme Atlas Cloud.

Créer un compte Atlas Cloud

Inscrivez-vous sur atlascloud.ai et complétez la vérification. Les nouveaux utilisateurs reçoivent des crédits gratuits pour explorer la plateforme et tester les modèles.

Pourquoi Utiliser MiniMax H3 sur Atlas Cloud

Combiner les modèles MiniMax H3 avancés avec la plateforme accélérée par GPU d'Atlas Cloud offre des performances, une évolutivité et une expérience développeur inégalées.

Performance et Flexibilité

Faible Latence :
Inférence optimisée par GPU pour un raisonnement en temps réel.

API Unifiée :
Exécutez MiniMax H3, GPT, Gemini et DeepSeek avec une seule intégration.

Tarification Transparente :
Facturation prévisible par token avec options serverless.

Entreprise et Échelle

Expérience Développeur :
SDK, analytiques, outils de fine-tuning et modèles.

Fiabilité :
99,99% de disponibilité, RBAC et journalisation conforme.

Sécurité et Conformité :
SOC 2 Type II, alignement HIPAA, souveraineté des données aux États-Unis.

MiniMax H3 API : réponses pour les développeurs

La MiniMax H3 API donne aux développeurs un accès programmatique à MiniMax H3, un modèle vidéo multimodal ouvert et généraliste qui traite le texte, les images, la vidéo et l’audio comme un contexte partagé unique. Plutôt que de séparer génération, montage et référence dans des modèles de tâches distincts, H3 lit l’ensemble complet des entrées et renvoie un clip finalisé avec le son. Sur Atlas Cloud, il fonctionne derrière une clé API unique, avec une tarification à l’usage.

Films de marque, bandes-annonces, courts dramas verticaux, spots produit et e-commerce, démos de motion pour jeux et UI, ainsi qu’animations stylisées font tous partie de son périmètre. Comme le modèle gère le texte à l’écran, les sous-titres et les assets de marque, les équipes l’utilisent aussi pour valider des concepts, prévisualiser des storyboards et préparer des pitches visuels avant d’engager un budget de production.

Créez un compte Atlas Cloud, générez une clé API, puis envoyez un prompt accompagné de tout fichier de référence au endpoint de génération vidéo et interrogez-le jusqu’à obtenir le résultat final. Il est recommandé de transmettre les médias sous forme d’URL hébergées plutôt qu’en uploads inline, car le corps de la requête est limité à 64MB. Commencez à développer dès aujourd’hui.

La facturation se fait à l’usage : vous payez par appel au lieu d’acheter un abonnement ou une licence par siège. Le coût suit ce que vous rendez réellement, ce qui signifie que la résolution et la durée du clip déterminent le total pour un lot. Consultez la page du modèle pour connaître le tarif actuel par génération avant de planifier des exécutions à grand volume.

Oui. Chaque résultat H3 est livré avec du son en stéréo native : dialogues, effets et ambiance arrivent dans la même passe que l’image. Fournissez un clip audio de référence et le modèle peut appliquer ce timbre à un personnage, ce qui supprime une étape distincte de synthèse vocale dans le pipeline.

Les clips durent de 5 à 15 secondes à 24 FPS. En mode 1440p, le petit côté est rendu à 1440 pixels pour les ratios compris entre 16:9 et 9:16 ; en dehors de cette plage, l’image conserve environ 3.7M pixels au total, par exemple 2976 par 1248 en 21:9. Les requêtes text to video et omni reference acceptent 21:9, 16:9, 4:3, 1:1, 3:4 et 9:16, tandis que les requêtes first and last frame héritent du ratio de l’image d’entrée.

Jusqu’à neuf images, trois segments vidéo et trois clips audio peuvent accompagner un même prompt, dans la limite de douze fichiers au total. La vidéo et l’audio doivent chacun rester dans une durée cumulée de 15 secondes, et l’audio doit accompagner une image ou une vidéo plutôt qu’être envoyé seul. Les prompts peuvent atteindre 7000 caractères, ce qui laisse de la place pour des consignes plan par plan couvrant la caméra, le jeu et le son.

Les entrées acceptées incluent les vidéos H.264 et H.265, les images JPG, JPEG, PNG, WEBP, HEIC et HEIF, ainsi que l’audio WAV ou MP3, avec AAC ou MP3 pour la piste audio à l’intérieur d’un fichier vidéo. Les limites par fichier sont de 50MB pour la vidéo, 30MB pour les images et 15MB pour l’audio. Comme le corps de la requête est limité à 64MB, les URL hébergées restent l’option la plus sûre pour les assets volumineux.

Le montage est l’un de ses modes principaux. Envoyez un clip source avec des instructions, et la MiniMax H3 API peut remplacer des personnages ou des objets, changer les arrière-plans et l’éclairage, ajouter des effets visuels en couches, et réécrire les dialogues tout en gardant stables les zones non modifiées. Les instructions composées sont traitées en une seule requête, de sorte que plusieurs changements s’appliquent ensemble plutôt qu’au fil d’allers-retours répétés.

La plupart des modèles vidéo prennent un prompt et une image, puis renvoient un clip muet. H3, lui, consomme un ensemble mixte de références, lit l’intention liée au personnage, au mouvement, à la caméra et au son à travers toutes ces références, puis renvoie un clip avec audio natif. Si votre pipeline assemble actuellement un modèle vidéo, un modèle vocal et un éditeur, H3 regroupe ces étapes en un seul appel.

Explorer Plus de Familles

Seedance 2.0

L'API Seedance 2.0 vous donne un accès en production au modèle vidéo multimodal de ByteDance — des entrées quadrimodales (texte, image, vidéo, audio) et un système « Universal Reference » leader du secteur qui verrouille la composition, les mouvements de caméra et les actions des personnages à travers les plans. Intégrez un contrôle de niveau réalisateur avec un seul appel d'API, un tarif fixe de 0,09 $/s, une clé instantanée et aucune liste d'attente — le tout soutenu par une disponibilité et une conformité de niveau entreprise. Seedance 2.0 Native 4K est désormais disponible !

Voir la Famille

GPT Image 2

L'API GPT Image 2 offre aux développeurs un accès au dernier modèle d'image d'OpenAI, le successeur de GPT Image 1.5. Elle génère et modifie des images avec un rendu de texte précis pour les caractères latins et CJK, ainsi qu'une composition solide pour les affiches, les maquettes et les infographies. Sur Atlas Cloud, vous y accédez via une API unifiée aux côtés de plus de 300 modèles, avec des crédits gratuits, une disponibilité de 99,99 % et sans aucune vérification d'organisation OpenAI requise.

Voir la Famille

Seedream 5.0 Pro

L'API Seedream 5.0 Pro offre aux développeurs le modèle d'édition d'images contrôlable de ByteDance sur Atlas Cloud. Elle positionne les modifications avec précision à l'aide d'ancrages et de coordonnées, sépare les images en calques modifiables, fusionne de multiples références et fait correspondre les couleurs et matériaux exacts, avec du texte multilingue en 2K et 3K. Sur Atlas Cloud, vous y accédez via une seule clé !

Voir la Famille

Gemini Omni Flash

La Gemini Omni API apporte à votre stack le modèle multimodal de génération et d'édition vidéo de Google DeepMind, présenté à Google I/O 2026. Gemini Omni fusionne le moteur de raisonnement de Gemini avec les médias génératifs : il accepte n'importe quelle combinaison de texte, d'images, de vidéo et d'audio pour produire des résultats cohérents et ancrés dans la connaissance. Affinez vos résultats par simple conversation — remplacez des objets, réécrivez des scènes, changez de style — tandis que la physique, les personnages et la continuité restent intacts. Atlas Cloud propose toute la gamme Gemini Omni Flash — texte vers vidéo, image vers vidéo avec jusqu'à 7 images de référence, et référence vers vidéo — via une API unifiée, avec une tarification transparente à la seconde à partir de $0.112 et sans abonnement. Commencez à développer dès aujourd'hui.

Voir la Famille

Grok Imagine

La Grok Imagine API offre aux développeurs la génération d'images, de vidéos et d'audio de xAI dans une seule suite. Elle produit des images jusqu'à 2K avec un rendu de texte multilingue, ainsi que des vidéos allant jusqu'à 15 secondes avec un audio natif synchronisé et une édition basée sur des références. Sur Atlas Cloud, une seule clé exécute chaque mode Grok Imagine, ce qui vous permet de passer d'une image, d'une vidéo et d'un audio à l'autre sans configuration distincte, à partir de 0,02 $ par image et 0,05 $ par seconde.

Voir la Famille

Google

Les modèles créatifs les plus puissants de Google sont tous disponibles sur Atlas Cloud. Veo 3.1 offre une génération de vidéos cinématographiques, Nano Banana 2 permet de créer des images haute fidélité, et Gemini apporte une intelligence multimodale à chaque flux de travail. Accédez à la suite complète de modèles Google via une seule API key avec une disponibilité Day-0 et une tarification à l'usage (pay-as-you-go).

Voir la Famille

Seedance 2.0 Mini

Seedance 2.0 Mini apporte la génération de vidéos multimodale de ByteDance aux flux de travail où la vitesse et les coûts sont primordiaux. Il offre les capacités de base de Seedance 2.0 avec une empreinte plus légère — une génération plus rapide, un coût par vidéo réduit et la même intégration API que celle que vous utilisez déjà. Pour les équipes qui gèrent des pipelines à haut volume ou du prototypage à grande échelle, Mini est le choix par défaut pratique.

Voir la Famille

ByteDance

De la génération de vidéos cinématiques à la création d'images haute fidélité, les modèles les plus puissants de ByteDance sont disponibles sur Atlas Cloud. Exécutez Seedance et Seedream à grande échelle avec les prix d'inférence les plus bas et aucune surcharge d'infrastructure.

Voir la Famille

Alibaba

Atlas Cloud rassemble l'ensemble de la gamme de modèles d'Alibaba sous une seule API : Qwen pour les tâches linguistiques et d'imagerie, et Wan pour la génération de vidéos jusqu'en 1080p. Accédez à chaque modèle avec une tarification à l'usage (pay-as-you-go) sans abonnement. L'API Alibaba est disponible via une URL de base unique en utilisant votre client existant compatible avec OpenAI.

Voir la Famille

OpenAI

Atlas Cloud vous donne accès à l'ensemble de la gamme de l'API OpenAI, de GPT Image 2 pour la génération d'images à Sora 2 pour la vidéo. Chaque modèle est disponible en paiement à l'usage sans engagement mensuel. Intégrez-le en remplaçant simplement l'URL de base à l'aide de l'API compatible OpenAI.

Voir la Famille

xAI

Créez des pipelines complets d'images et de vidéos en utilisant la xAI API sur Atlas Cloud. Générez en 2K, éditez avec des images de référence et animez des images en clips synchronisés avec l'audio.

Voir la Famille

Kwaivgi

L'API Kwaivgi à 15 % en dessous du tarif standard. Atlas Cloud offre un accès Day-0 aux nouvelles versions de Kling avec une tarification à l'usage et sans limite de postes. Un seul compte, une seule clé, tous les modèles Kling du niveau standard au niveau master.

Voir la Famille

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles