
Grok Imagine Video 1.5 est la famille de génération vidéo de xAI destinée aux développeurs qui ont besoin de mouvements contrôlés à partir de prompts et d’entrées visuelles. Animez une image de départ à l’aide d’instructions de mouvement en langage naturel, sélectionnez 480p ou 720p pour vos workflows de référence et ajoutez une voix de référence facultative pour guider le résultat. Accédez aux modes pris en charge avec une seule clé Atlas Cloud compatible avec l’API OpenAI, grâce à une tarification transparente à l’usage. Commencez à développer dès aujourd’hui.
Grok Imagine Video 1.5 est développé par xAI. Atlas Cloud (exploité par Atlas Cloud AI LLC) en fournit l’accès mais n’en est pas propriétaire. Toutes les marques appartiennent à leurs détenteurs respectifs.
Découvrez six endpoints qui transforment du texte, des images de départ ou des ressources de référence en vidéos, pour les workflows développeur et standard.
| Modalité | Description |
|---|---|
| Grok Imagine Video 1.5 Developer Reference-to-Video API | Transformez de 1 à 7 images de référence et, en option, une voix de référence en vidéo avec un audio synchronisé généré nativement. Les sorties peuvent durer jusqu’à 15 secondes en 480p ou 720p. Cet endpoint convient aux scènes guidées par des références et aux concepts visuels nécessitant plusieurs images sources. |
| Grok Imagine Video 1.5 Reference-to-Video API | Guidé par 1 à 7 images de référence, cet endpoint génère des vidéos avec un audio synchronisé généré nativement et peut également accepter une voix de référence facultative. Il prend en charge des durées allant jusqu’à 15 secondes en 480p ou 720p. Choisissez-le pour la production vidéo multi-références et les séquences guidées par la voix. |
| Grok Imagine Video 1.5 Developer Text-to-Video API | Un prompt textuel suffit pour générer une vidéo avec un audio synchronisé généré nativement via cet endpoint développeur. Créez des clips d’une durée maximale de 15 secondes en 480p, 720p ou 1080p. Il convient aux concepts pilotés par prompt, aux storyboards et à la production de vidéos courtes. |
| Grok Imagine Video 1.5 Text-to-Video API | Créez directement une vidéo à partir d’un prompt textuel tout en générant nativement un audio synchronisé. Les options de sortie incluent 480p, 720p et 1080p, avec une durée maximale de 15 secondes. Utilisez-le pour des scènes scénarisées, des concepts de campagne ou des contenus vidéo pour les réseaux sociaux. |
| Grok Imagine Video 1.5 Developer Image-to-Video API | À partir d’une image, cet endpoint développeur applique des instructions de mouvement en langage naturel pour produire une vidéo animée. Les résolutions disponibles sont 480p, 720p et 1080p. Il convient à l’animation d’illustrations, de visuels produit et d’images d’ouverture préparées. |
| Grok Imagine Video 1.5 Image-to-Video API | Animez une image de départ en décrivant le mouvement souhaité en langage naturel. La vidéo obtenue peut être générée en 480p, 720p ou 1080p. Ce workflow prend en charge les études de mouvement, la narration visuelle et la création de contenus reposant sur une image. |
Grok Imagine Video 1.5 réunit les workflows à partir de texte, d’une image de départ et d’une à sept images de référence, avec un audio synchronisé natif, une sortie jusqu’en 1080p et des clips pouvant durer jusqu’à 15 secondes en mode texte ou référence, tandis qu’Atlas Cloud ajoute une API unique et une tarification transparente à l’usage.
Commencez par un prompt textuel et générez des clips allant jusqu’à 15 secondes en 480p, 720p ou 1080p. L’audio synchronisé natif est généré avec la vidéo, au cours de la même génération. Décrivez entièrement la scène et l’action par écrit lorsqu’aucune image source n’est disponible. Ce workflow convient aux films conceptuels, aux expérimentations cinématographiques et aux pipelines de contenu pilotés par des prompts.
Une seule image de départ devient une séquence animée grâce à des prompts de mouvement en langage naturel. Choisissez une sortie en 480p, 720p ou 1080p, tandis que l’image définit la composition d’ouverture. Décrivez dans le prompt les mouvements du sujet et de la scène, puis laissez le modèle animer la séquence à partir de ce repère visuel. Ce workflow convient aux prises de vue de produits, aux moments mettant en scène des personnages et aux images fixes artistiques auxquelles il faut donner du mouvement.
Guidez Grok Imagine Video 1.5 à l’aide d’une à sept images de référence et d’une voix de référence facultative. Le mode référence produit des clips allant jusqu’à 15 secondes en 480p ou 720p, avec un audio synchronisé natif. Utilisez ces entrées pour orienter la scène générée vers une direction visuelle établie. Ce workflow convient aux campagnes et aux récits construits à partir de références créatives existantes.
La vidéo et le son sont générés ensemble : chaque clip peut ainsi inclure un audio synchronisé natif sans étape audio distincte. Concevez vos scènes autour d’actions visibles dont le rythme peut être renforcé par la piste audio associée. Lorsque la synchronisation est essentielle, ce processus de génération combinée réduit le passage de relais entre la création visuelle et la production sonore. Il est particulièrement utile pour les séquences riches en performances et en atmosphère.
Déployez un temps fort visuel complet sur des clips texte ou référence pouvant durer jusqu’à 15 secondes, au lieu de vous limiter à une courte boucle. Cette durée permet d’inclure la mise en place, le mouvement et une conclusion claire au sein d’une même séquence générée. Associez cette durée à des changements de perspective de caméra et à une action continue pour créer un moment plus abouti. Cette longueur convient parfaitement aux publicités courtes, aux révélations narratives et aux scènes vidéo pour les réseaux sociaux.
Passez de la génération à partir de texte, d’images de départ ou de références via une API Atlas Cloud unique, avec une tarification transparente à l’usage. Sélectionnez le workflow adapté à chaque ressource au lieu de faire passer toutes vos idées par un seul type d’entrée. Cette même intégration donne aux développeurs accès aux six endpoints Grok Imagine Video v1.5 répertoriés, y compris les routes standard et Developer. Cela simplifie l’expérimentation et la planification de la production pour des projets vidéo variés.
Découvrez comment Grok Imagine Video 1.5 et deux alternatives d’Atlas Cloud interprètent des prompts identiques dans des scènes d’action cinématographiques et de fantasy stylisée.
Un film fantastique baroque sous-marin de 9 secondes, tourné en un seul plan, à l’intérieur d’un opéra abandonné entièrement inondé : une gracieuse apnéiste aux cheveux flottants et au masque nacré lumineux poursuit un poulpe rouge corail éclatant qui transporte une clé en laiton ouvragée, à travers des rideaux de velours dérivant dans l’eau. Commencer depuis l’intérieur d’un plancher de scène fissuré avec un spectaculaire plan en contre-plongée, tandis qu’elle effectue une roulade puis plonge la tête la première à travers la fissure ; enchaîner avec un travelling latéral serré tandis qu’elle se faufile entre des fauteuils de théâtre renversés, ses cheveux et son costume réagissant naturellement aux courants, pendant que les rideaux ondulent et que des bulles s’échappent à travers des arches superposées ; puis tourner autour d’elle et effectuer un mouvement de grue vers le haut tandis que la pression de l’eau arrache un lustre en cristal au-dessus d’elle. Au point culminant, elle se vrille de côté au tout dernier instant pour éviter le lustre qui tombe, les cristaux s’entrechoquant et se dispersant de manière réaliste, tandis que le poulpe rattrape habilement la clé en train de chuter avec ses tentacules complexes et recourbés, marque une pause solennelle, puis la remet dans sa main ouverte. Mouvement fluide continu, début–poursuite–résolution clairement lisible, personnage et masque nacré cohérents, résistance de l’eau, flottabilité, tissu, cheveux, bulles, déformation des tentacules, impacts et évitement des collisions physiquement exacts. Des faisceaux cyan froids provenant de lucarnes brisées traversent l’auditorium sombre immergé ; le rouge corail est la seule couleur fortement saturée, guidant le regard à travers les profondeurs formées par les arches, les rideaux, les débris suspendus et les bulles. Photographie sous-marine cinématographique photoréaliste avec une subtile texture de peinture à l’huile, grandeur baroque élégante, caustiques volumétriques, niveau de détail élevé, aucun texte, aucune interface, aucune coupe déguisée en image fixe. Audio immersif : grondements étouffés sous l’eau, courants rapides, bruissement du tissu, bulles, impacts cristallins et pulsation orchestrale tendue se résolvant en une délicate note de harpe au moment où la clé est rendue. Format d’image 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Une publicité de comédie d’action absurde, située à l’aube dans un salon de coiffure des années 1950 méticuleusement détaillé. Un bobtail anglais hargneux et hirsute, couvert d’une épaisse mousse blanche, jaillit par la porte et traverse le salon à toute allure en projetant de la mousse partout ; un coiffeur surpris bondit sur un fauteuil pivotant et le poursuit en taillant rapidement son pelage qui vole au vent, chaque claquement net des ciseaux étant parfaitement synchronisé avec les percussions de jazz percutantes. Commencer par un travelling au ras du sol, en plan extrêmement bas, qui file à côté des pattes mouillées tandis qu’elles dérapent sur des carreaux brillants en damier noir et blanc, projetant vers l’objectif des gouttelettes et des éclaboussures de mousse réalistes ; effectuer un whip-pan vers le haut pour enchaîner sur un travelling circulaire rapide utilisant trois grands miroirs afin de révéler et de préserver en continu les positions changeantes du chien et du coiffeur à travers des reflets complexes et exacts ; puis exécuter un rapide mouvement de dolly-in tandis que les dernières mèches coupées en plein vol tombent, tourbillonnent et atterrissent parfaitement sur la tête du chien, formant une banane outrageusement haute. Le chien s’arrête et prend une pose satisfaite pendant un temps fort d’une seconde, semblable à un arrêt sur image, puis éternue soudainement en projetant un nuage explosif de mousse et de poils, tandis que le jazz se termine sur un coup de caisse claire comique et percutant. Des lumières pratiques chaudes au tungstène traversent le brouillard matinal bleu sarcelle froid visible au-delà des fenêtres ; palette vintage riche mêlant bordeaux, crème, laiton poli et bois sombre ; cinématographie publicitaire haut de gamme en prises de vue réelles, chorégraphie continue et fluide à grande vitesse, personnages et continuité spatiale cohérents, fourrure mouillée, mousse de savon, poils détachés, reflets, rotation du fauteuil, inertie et collisions physiquement exacts, détails photoréalistes et tactiles, mouvement parfaitement lisible, aucun ralenti, aucun plan d’ensemble vide, aucun écran, aucune interface logicielle, aucun tableau de bord, aucune barre de progression, aucun graphique, aucune légende, aucun texte explicatif, aucun logo, aucun filigrane, format d’image 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video 1.5 transforme des prompts, des images sources et jusqu’à sept images de référence en courtes vidéos avec audio synchronisé pour les campagnes, les présentations de produits, les récits de personnages, les contenus pour les réseaux sociaux et le prototypage visuel rapide.
Animez une image fixe de produit à l’aide de prompts de mouvement en langage naturel et d’un audio synchronisé. Créez de courtes vidéos de présentation pour les boutiques en ligne, les pages de campagne, les supports de lancement ou les emplacements publicitaires sur les réseaux sociaux, jusqu’en 1080p.
Guide une scène avec une à sept références de personnages et, en option, une voix de référence. Cette configuration prend en charge les apparitions récurrentes des personnages, les scènes de dialogue et les courtes séquences narratives avec audio synchronisé natif.
Partez d’un prompt textuel pour générer une vidéo complète avec audio synchronisé natif. Les équipes marketing peuvent explorer des concepts de campagne, des vidéos d’ambiance et des teasers de lancement sans préparer d’image source.
Transformez une image de départ unique en animation grâce à des instructions en langage naturel, jusqu’en 1080p. Produisez des supports de campagne concis pour les fils d’actualité, les pages de lancement, les annonces d’événements, les mises à jour produit et les publications créées par des créateurs.
Donnez vie à une image de storyboard approuvée grâce à des mouvements dirigés par prompt, tout en la conservant comme image de départ. Les réalisateurs et les designers peuvent créer de courts plans de prévisualisation avec audio synchronisé pour la validation.
Combinez des vues de produits, des portraits de personnages, des détails de tenues et des références de scènes provenant de sept images maximum. Les équipes de marque peuvent diriger de courtes scènes promotionnelles avec son synchronisé, tout en ancrant chaque demande dans les ressources visuelles fournies.
Comparez Grok Imagine Video 1.5 aux principaux modèles de référence vers vidéo pour les entrées acceptées, la durée des clips, la résolution, l’audio synchronisé et la tarification standard à la seconde.
| Modèle | Types d’entrée | Durée du clip | Résolution maximale | Audio natif | Tarif standard |
|---|---|---|---|---|---|
| Grok Imagine Video v1.5 | Texte, image, images de référence, voix | Jusqu’à 15 secondes | 1080p | √ | $0.08/seconde |
| Seedance 2.0 Reference-to-Video | Texte, image, vidéo, audio | De 4 à 15 secondes | 4K | √ | $0.112/seconde |
| MiniMax H3 Reference-to-Video | Texte, image, vidéo, audio | De 4 à 15 secondes | 2K | √ | $0.038/seconde |
| Wan-2.7 Reference-to-video | Texte, image, vidéo, audio | De 2 à 10 secondes | 1080p | √ | $0.10/seconde |
Soyez opérationnel en quelques minutes — suivez ces étapes simples pour intégrer et déployer des modèles via la plateforme Atlas Cloud.
Inscrivez-vous sur atlascloud.ai et complétez la vérification. Les nouveaux utilisateurs reçoivent des crédits gratuits pour explorer la plateforme et tester les modèles.
Combiner les modèles Grok Imagine Video 1.5 avancés avec la plateforme accélérée par GPU d'Atlas Cloud offre des performances, une évolutivité et une expérience développeur inégalées.
Faible Latence :
Inférence optimisée par GPU pour un raisonnement en temps réel.
API Unifiée :
Exécutez Grok Imagine Video 1.5, GPT, Gemini et DeepSeek avec une seule intégration.
Tarification Transparente :
Facturation prévisible par token avec options serverless.
Expérience Développeur :
SDK, analytiques, outils de fine-tuning et modèles.
Fiabilité :
99,99% de disponibilité, RBAC et journalisation conforme.
Sécurité et Conformité :
SOC 2 Type II, alignement HIPAA, souveraineté des données aux États-Unis.
Grok Imagine Video 1.5 est la famille de modèles de génération vidéo de xAI permettant de créer des clips à partir de texte, d’une image de départ ou de plusieurs images de référence. Via Atlas Cloud, les développeurs peuvent accéder à des endpoints distincts pour chaque mode de génération.
Trois modes sont disponibles : text-to-video, image-to-video et reference-to-video. Choisissez text-to-video pour créer une scène à partir de zéro, image-to-video pour animer une image de départ ou reference-to-video pour guider les sujets, les objets et les styles à l’aide de plusieurs images.
Créez une clé API Atlas Cloud et envoyez une requête authentifiée à l’endpoint de génération vidéo avec l’ID de modèle approprié. Utilisez l’ID de tâche renvoyé pour vérifier l’état de la génération et récupérer l’URL de la vidéo terminée.
text-to-video nécessite un prompt en langage naturel, tandis que image-to-video ajoute une image de départ. reference-to-video accepte un prompt et 1 à 7 images de référence, avec des IDs de voix prédéfinis facultatifs pour les dialogues générés.
Les schémas Atlas Cloud disponibles prennent en charge des clips de 1 à 15 secondes. text-to-video et image-to-video proposent une sortie en 480p, 720p ou 1080p, tandis que reference-to-video prend en charge 480p ou 720p.
Oui. text-to-video génère un son natif synchronisé à partir du prompt, et reference-to-video peut combiner un son généré avec une voix prédéfinie facultative pour les dialogues.
Atlas Cloud affiche un prix de base standard de $0.08 pour chaque endpoint couvert par cette page dédiée à la famille de modèles. Consultez les détails de facturation actuels de l’endpoint sélectionné avant le déploiement, car l’enregistrement de prix fourni ne précise pas son unité de facturation.
Fournissez entre 1 et 7 images via l’endpoint reference-to-video. Identifiez les ressources concernées dans le prompt avec des balises telles que <IMAGE_0> et <IMAGE_1>, afin que le modèle puisse associer chaque référence au sujet ou à l’élément de scène prévu.
Les schémas Atlas Cloud disponibles n’incluent pas de paramètre dédié à la dernière image. image-to-video utilise une image comme image de départ, tandis que reference-to-video utilise 1 à 7 images comme indications visuelles, sans garantir qu’elles correspondent à la première et à la dernière image.
Choisissez reference-to-video lorsque plusieurs images doivent guider les personnes, les objets ou le style visuel d’une nouvelle scène. Utilisez image-to-video lorsqu’une image existante doit devenir l’image d’ouverture et que son animation doit suivre un prompt en langage naturel.
Guides, tutoriels et actualités produit pour tirer le meilleur d'Atlas Cloud.