
Grok Imagine Video donne aux développeurs accès à la famille de modèles vidéo de xAI pour créer, animer, prolonger et retoucher des clips. Générez des vidéos de 1 à 15 secondes à partir de prompts, guidez des personnes, des objets ou des styles avec jusqu'à sept images de référence, et travaillez en 480p ou 720p. Atlas Cloud réunit ces fonctionnalités via des points de terminaison compatibles avec OpenAI, avec une tarification transparente à l'usage. Commencez à créer dès aujourd'hui.
Grok Imagine Video est développé par xAI. Atlas Cloud (exploité par Atlas Cloud AI LLC) en fournit l’accès mais n’en est pas propriétaire. Toutes les marques appartiennent à leurs détenteurs respectifs.
Choisissez l’endpoint Grok Imagine Video adapté à vos ressources sources, à la transformation souhaitée et à votre workflow de production.
| Modalité | Description |
|---|---|
| Grok Imagine Video T2V API (Texte vers vidéo) | Transformez des prompts en langage naturel en vidéos de 1 à 15 secondes, en 480p ou 720p. Cet endpoint convient à la visualisation de concepts, aux contenus courts pour les réseaux sociaux et aux scènes créées sans média source. |
| Grok Imagine Video I2V API (Image vers vidéo) | À partir d’une image fournie, cet endpoint applique des prompts de mouvement en langage naturel pour produire une vidéo en 480p ou 720p. Utilisez-le pour animer des illustrations, des visuels de produits, des images de personnages ou des visuels de campagne. |
| Grok Imagine Video R2V API (Référence vers vidéo) | Guide la génération vidéo à l’aide de 1 à 7 images de référence représentant des personnes, des objets ou des styles visuels. Les sorties peuvent durer jusqu’à 10 secondes en 480p ou 720p, pour une production créative guidée par des références. |
| Grok Imagine Video Extend API (Extension vidéo) | Prolongez un fichier MP4 existant de 2 à 15 secondes avec une extension guidée par un prompt, d’une durée de 2 à 10 secondes. La sortie conserve le format d’entrée et est limitée à 720p, ce qui rend cet endpoint utile pour allonger des plans déjà établis. |
| Grok Imagine Video Edit API (Montage vidéo) | Fournissez un fichier MP4 et des instructions en langage naturel pour modifier son contenu visuel tout en conservant la durée de la source. La sortie est limitée à 8,7 secondes, ce qui convient aux révisions ciblées et aux transformations de courtes séquences fondées sur des prompts. |
Grok Imagine Video transforme du texte, des images de départ et jusqu’à sept références en clips courts, puis prolonge ou modifie des séquences MP4 existantes grâce à l’API unifiée à l’usage d’Atlas Cloud.
Rédigez un prompt en langage naturel et générez un clip de 1 à 15 secondes en 480p ou 720p. Sept formats d’image, dont 16:9, 1:1 et 9:16, permettent d’adapter chaque plan à son support. Contrôlez directement dans le prompt le sujet, l’action, les mouvements de caméra et l’atmosphère. Ce workflow constitue un point de départ flexible pour les moments clés d’une histoire, les concepts de campagne et les vidéos pour les réseaux sociaux.
Transformez une image de départ fournie en vidéo de 1 à 15 secondes en 480p ou 720p. L’image définit la composition initiale, tandis qu’un prompt de mouvement en langage naturel dirige les déplacements et l’évolution de la scène. Choisissez parmi sept formats d’image lorsqu’un autre format de sortie est nécessaire. Ce workflow convient aux plans produit, aux scènes illustrées et aux concepts dirigés artistiquement qui nécessitent du mouvement sans reconstruire l’image d’ouverture.
Guidez une vidéo à l’aide de 1 à 7 images de référence représentant des personnes, des objets ou des styles visuels. Faites référence aux entrées individuelles dans le prompt, puis générez jusqu’à 10 secondes en 480p ou 720p selon sept formats d’image pris en charge. Comme les références façonnent la scène sans servir uniquement d’image de départ, les créateurs disposent d’un meilleur contrôle sur les éléments visuels récurrents. Utilisez ce workflow pour les scènes centrées sur des personnages, la narration produit ou les campagnes sensibles au style.
Poursuivez une vidéo MP4 existante de 2 à 15 secondes avec une extension pilotée par prompt de 2 à 10 secondes. Grok Imagine Video reprend à partir de la dernière image et renvoie le clip d’origine avec le nouveau segment, à la résolution d’entrée jusqu’à 720p. Décrivez l’action, la révélation ou le mouvement de caméra suivant en langage courant. Les fins abruptes deviennent ainsi plus faciles à transformer en séquences narratives complètes.
Fournissez à Grok Imagine Video un MP4 et des instructions en langage naturel pour transformer la séquence tout en conservant sa durée d’origine. Les vidéos d’entrée peuvent durer jusqu’à 8.7 secondes, et la facturation suit la durée de la vidéo fournie. Demandez une modification visuelle, un changement d’atmosphère ou une révision de la scène sans recréer le clip depuis zéro. Ce workflow convient particulièrement aux variations créatives courtes et aux retouches contrôlées après génération.
Passez de la génération à partir de texte à la génération à partir d’image, à la génération guidée par références, à la prolongation et à la modification via une API unifiée. Sélectionnez le point de terminaison correspondant aux sources disponibles et envoyez chaque tâche via un flux de prédiction asynchrone. Conservez des méthodes d’authentification et des schémas d’intégration cohérents dans tous les workflows. L’accès à l’usage facilite les expérimentations et les pipelines de production reproductibles. Les développeurs peuvent créer des outils vidéo plus complets avec moins de charge d’intégration.
Découvrez comment Grok Imagine Video et deux alternatives de premier plan interprètent des prompts identiques à travers le mouvement, la continuité, le contrôle de la caméra, l’éclairage et la narration visuelle.
Un film d’aventure en extérieur de 8–10 secondes, hyperréaliste, se déroulant dans une gorge émeraude juste après une pluie torrentielle. Dès la première image et jusqu’à la dernière, un kayakiste vêtu d’une combinaison imperméable bleu cobalt et d’un gilet de sauvetage orange-rouge dévale des eaux vives déchaînées. Ouvrir sur un plan de suivi ultra-bas au ras de l’eau, filant à côté du kayak tandis que les pales de la pagaie tranchent le courant et projettent des éclaboussures nettes sur l’objectif ; le kayak bondit sur la crête d’une vague abrupte et est propulsé dans les airs. Effectuer un whip-pan vers le POV à la première personne du kayakiste tandis que l’embarcation roule sur le côté sous un arbre tombé, traverse un rideau d’eau translucide et évite de justesse des rochers humides et dentelés, les mains, la pagaie et la proue cobalt restant physiquement cohérentes à travers les éclaboussures et les occultations momentanées. Le kayakiste plante la pagaie dans le courant, prend appui sur la paroi du canyon pour effectuer un virage de rebond serré, puis replonge dans le torrent. Au point culminant, passer à une plongée de drone depuis le sommet de la falaise, descendre rapidement et tourner autour du kayakiste pendant l’atterrissage ; la proue percute une caisse en bois flottante avec un impact convaincant, la brisant — puis, dans une révélation soudaine et ludique, une guirlande reliée de lanternes en papier colorées parfaitement intactes jaillit, se déploie et se balance chaleureusement sur l’eau froide et tumultueuse tandis que le kayak poursuit sa course. Mouvement continu anatomiquement correct, inertie réaliste du kayak, résistance de la pagaie, collisions, dynamique des fluides turbulents, mouvement du tissu, gouttelettes, projections d’eau sur l’objectif et identité du sujet parfaitement préservée après chaque obstruction ; aucun ralenti, aucun plan d’établissement vide, aucune coupe vers des écrans, interfaces, tableaux de bord, barres de progression, graphiques, légendes, logos ou textes explicatifs. Lumière froide cyan par ciel couvert, parois rocheuses émeraude assombries par la pluie, gilet de sauvetage orange-rouge vif, lueur chaude de lanternes multicolores, compositions cinématographiques panoramiques en diagonale accentuant la vitesse, contraste élevé, flou de mouvement naturel, cinématographie immersive et photoréaliste de sports d’action. Audio synchronisé : grondement des rapides, impacts secs de la pagaie, craquement du bois, respiration forcée, eau frappant la coque et accent musical percussif éclatant lorsque les lanternes sont libérées. Format d’image 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Une séquence cinématographique d’action continue de 8–10 secondes sur un marché nocturne en plein air, quelques instants avant une pluie torrentielle : un chef spécialisé dans les ramen, les yeux bandés, sprinte avec assurance dans un labyrinthe d’étals bondés tout en étirant continuellement entre ses mains un ruban de nouilles blanc argenté. Commencer par une vue aérienne parfaitement verticale, puis plonger rapidement depuis les airs dans le dédale du marché éclairé au néon, tandis que les premières grosses gouttes de pluie frappent les auvents et le sol détrempé. Verrouiller la caméra sur le ruban de nouilles en vol et foncer à quelques centimètres de celui-ci tandis qu’il claque au-dessus de braseros de charbon ardent, de clients surpris, de grils grésillants et de parapluies qui s’ouvrent brusquement sous l’effet du vent ; préserver un mouvement humain fluide, une physique élastique crédible des nouilles, des occultations complexes au premier plan, la pluie éclaboussante, les étincelles et une vapeur dense. Effectuer un panoramique fouetté vers le chef qui franchit d’un bond une caisse basse sans ralentir, puis exécuter une orbite rapide à 360 degrés autour de lui tandis qu’il se contorsionne et relâche les nouilles vers l’arrière avec un élan précis. Le ruban de nouilles décrit un arc net jusque dans une marmite en cuivre en pleine ébullition derrière lui — au moment exact du triomphe, un chat tigré roux espiègle surgit de sous l’étal, attrape dans sa gueule la moitié des nouilles pendantes et détale, créant un gag visuel percutant tandis que le chef continue de courir, inconscient de la situation. Photoréalisme néon-noir, reflets cyan-verts et magenta sur le sol détrempé par la pluie, feu orange-fournaise chaleureux comme accent visuel rythmique, vapeur et pluie tactiles, chorégraphie stable, détails cinématographiques nets, rythme énergique en temps réel, aucun ralenti, aucune coupe rompant la continuité spatiale ou celle des personnages. Audio : tonnerre montant, conversations du marché, pas martelés, claquements de parapluies, charbon grésillant, eau bouillante, sifflements des nouilles synchronisés aux mouvements de caméra, avec pour conclusion le miaulement comique et éclatant du chat suivi de l’éclaboussure de la marmite en cuivre. Aucun écran, interface utilisateur, tableau de bord, barre de progression, graphique, légende, sous-titre, logo, filigrane ou texte explicatif. Format d’image 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video transforme les prompts, les images fixes, les références et les fichiers MP4 existants en solutions concrètes pour les clips destinés aux réseaux sociaux, les visuels produit, les récits de marque, les séquences plus longues, les retouches ciblées et les outils pour créateurs.
Grok Imagine Video transforme les prompts en langage naturel en clips courts en 480p ou 720p. Utilisez-le pour produire des teasers pour les réseaux sociaux, des concepts de campagne et des ébauches visuelles rapides, sans préparer de séquences source à l'avance.
À partir d'une image produit, l'endpoint image to video ajoute des mouvements pilotés par un prompt en 480p ou 720p. Les marques peuvent transformer des images fixes de catalogue en révélations produit, supports de lancement et visuels pour les marketplaces.
Avec une à sept images, reference to video guide des personnes, des objets ou des styles dans un nouveau clip. Les équipes créatives peuvent développer des récits de marque, des concepts de personnages et des scènes produit ancrés dans les visuels fournis.
Poursuivez un fichier MP4 existant avec une extension de deux à dix secondes pilotée par un prompt, qui préserve la résolution d'entrée jusqu'à 720p. Cela permet de créer des séquences narratives plus longues, des transitions épisodiques et des séquences suivantes à partir de séquences approuvées.
Modifiez un fichier MP4 au moyen d'instructions en langage naturel tout en conservant sa durée d'origine, avec une sortie limitée à 8.7 secondes. Les équipes peuvent créer des styles alternatifs, des variantes de campagne localisées ou des traitements visuels révisés.
Créez des outils vidéo pilotés par des prompts autour des cinq modes de Grok Imagine Video pour la génération, l'animation, les références, la prolongation et le montage. Les développeurs peuvent prendre en charge les workflows des créateurs au sein d'une même famille, tout en sélectionnant une sortie en 480p ou 720p.
Comparez les workflows de Grok Imagine Video à certaines alternatives d’Atlas Cloud selon les méthodes d’entrée, la durée des clips, la résolution maximale et la tarification standard.
| Modèle | Workflow d’entrée | Durée du clip ou du segment | Résolution maximale | Prix standard |
|---|---|---|---|---|
| Grok Imagine Video Text-to-Video | Prompt textuel | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Image-to-Video | Image de départ + prompt textuel | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Reference-to-Video | 1–7 images de référence + prompt textuel | 1–10s | 720p | $0.05/sec |
| Grok Imagine Video Extend | MP4 de 2–15s + prompt textuel | Extension de 2–10s | Correspond à l’entrée, jusqu’à 720p | $0.07/sec |
| Grok Imagine Video Edit | MP4 + instruction textuelle | Correspond à l’entrée, jusqu’à 8.7s | - | $0.07/sec d’entrée |
| MiniMax H3 Text-to-Video | Prompt textuel | 4–15s | 2K | $0.038/sec |
| Seedance 2.0 Image-to-Video | Image de départ + texte, dernière image facultative | 4–15s | 4K natif | $0.112/sec |
| Vidu Q3-Mix Reference to Video | 1–4 images de référence + prompt textuel | 1–16s | 1440p SR, jusqu’à 1080p en natif | $0.125/exécution |
| Wan-2.7 Video-edit | Vidéo source + texte, images ou audio facultatifs | - | 1080p | $0.10/exécution |
Soyez opérationnel en quelques minutes — suivez ces étapes simples pour intégrer et déployer des modèles via la plateforme Atlas Cloud.
Inscrivez-vous sur atlascloud.ai et complétez la vérification. Les nouveaux utilisateurs reçoivent des crédits gratuits pour explorer la plateforme et tester les modèles.
Combiner les modèles Grok Imagine Video avancés avec la plateforme accélérée par GPU d'Atlas Cloud offre des performances, une évolutivité et une expérience développeur inégalées.
Faible Latence :
Inférence optimisée par GPU pour un raisonnement en temps réel.
API Unifiée :
Exécutez Grok Imagine Video, GPT, Gemini et DeepSeek avec une seule intégration.
Tarification Transparente :
Facturation prévisible par token avec options serverless.
Expérience Développeur :
SDK, analytiques, outils de fine-tuning et modèles.
Fiabilité :
99,99% de disponibilité, RBAC et journalisation conforme.
Sécurité et Conformité :
SOC 2 Type II, alignement HIPAA, souveraineté des données aux États-Unis.
Grok Imagine Video est la famille de modèles de génération vidéo de xAI permettant de créer, d’animer, de prolonger et de retoucher de courts clips. Atlas Cloud fournit des endpoints API distincts pour les workflows texte, image, référence, extension et retouche.
Grok Imagine Video peut générer un clip à partir d’un texte, animer une image de départ ou utiliser jusqu’à sept images de référence pour guider les personnes, les objets et les styles. Des endpoints distincts peuvent prolonger un clip existant ou retoucher un fichier MP4 à l’aide d’instructions en langage naturel.
Créez une clé API Atlas Cloud et envoyez une requête POST authentifiée à /api/v1/model/generateVideo. Indiquez l’identifiant du modèle requis, le prompt ainsi que toute image ou vidéo requise par cette route. La réponse inclut un identifiant de requête, le statut et les champs de sortie.
Choisissez text-to-video lorsque la scène commence par un prompt, ou image-to-video lorsqu’une image fournie doit devenir la première frame. Reference-to-video offre un guidage plus large à partir de plusieurs images, tandis que extend-video et edit-video opèrent sur des fichiers MP4 existants.
Text-to-video et image-to-video prennent en charge des clips de 1 à 15 secondes en 480p ou 720p. Reference-to-video prend en charge des clips de 1 à 10 secondes dans les mêmes résolutions, tandis que les proportions courantes incluent 16:9, 9:16, 1:1, 4:3, 3:4, 3:2 et 2:3. Les routes d’extension et de retouche suivent leurs propres limites d’entrée.
Oui. xAI documente la génération audio native dans le workflow vidéo Grok Imagine, ce qui permet de produire simultanément le son et les éléments visuels. Les schémas publiés par Atlas Cloud pour ces routes n’exposent pas de paramètre audio distinct.
Fournissez entre une et sept URLs d’images publiques en HTTPS ou URI de données base64 via l’endpoint reference-to-video. Des balises telles que <IMAGE_0> peuvent associer chaque référence à des personnes, des objets ou des styles décrits dans le prompt. Cette route renvoie des clips d’une durée maximale de 10 secondes en 480p ou 720p.
Utilisez extend-video avec un fichier MP4 de 2 à 15 secondes et demandez 2 à 10 secondes supplémentaires d’action guidée par le prompt. Pour des modifications ciblées, edit-video accepte un fichier MP4 de 8.7 secondes maximum et conserve sa durée. Les deux routes limitent la résolution de sortie à 720p.
La tarification standard d’Atlas Cloud est de $0.05 par seconde pour text-to-video, image-to-video et reference-to-video. Extend-video et edit-video appliquent un tarif standard de $0.07 par seconde. La retouche est facturée selon la durée de la vidéo d’entrée, car la sortie conserve cette durée.
Vérifiez d’abord que l’endpoint sélectionné correspond à votre type d’entrée et que chaque prompt, URL d’image ou URL de vidéo requis est présent. Contrôlez les limites propres à la route concernant la durée, la résolution, les proportions, le nombre de références et les fichiers MP4 avant de renvoyer la requête. Si la requête aboutit mais que la scène est inexacte, reformulez le prompt en précisant les mouvements du sujet, les mouvements de caméra, le rythme et les détails visuels.
Guides, tutoriels et actualités produit pour tirer le meilleur d'Atlas Cloud.