



L'API Grok Imagine couvre les modèles d'image, vidéo et parole d'xAI, de Image 2.0 à Video 1.5 et xAI TTS v1. Générez des images statiques en 1K ou 2K selon 14 rapports d'aspect, créez une vidéo de 15 secondes en 1080p, guidez les plans avec jusqu'à 7 images de référence, ou narrez-les dans 20 langues. Atlas Cloud exécute chaque mode sur un seul point de terminaison, avec un tarif à l'utilisation à partir de $0.02 par image et $0.05 par seconde. Commencez à créer aujourd'hui.
Grok Imagine est développé par xAI. Atlas Cloud (exploité par Atlas Cloud AI LLC) en fournit l’accès mais n’en est pas propriétaire. Toutes les marques appartiennent à leurs détenteurs respectifs.
Atlas Cloud vous offre les derniers modèles créatifs de pointe de l'industrie.
Choisissez le bon modèle Grok Imagine API selon votre type d'entrée, la durée de sortie, la résolution et le tarif par appel.
| Modalité | Description |
|---|---|
| Grok Imagine Image 2.0 T2I API (Text to Image) | Écrivez une invite jusqu'à 8 000 caractères et ce point de terminaison retourne entre une et quatre images en résolution 1K ou 2K. Les niveaux de qualité faible ou moyen vous permettent d'ajuster l'effort de rendu contre le délai d'exécution, avec une tarification de 0,04 $ par image. C'est idéal pour l'exploration conceptuelle, les visuels créatifs pour les réseaux sociaux et la production visuelle par lot où le volume compte. |
| Grok Imagine Image 2.0 Edit API (Image to Image) | Fournissez jusqu'à trois images de référence avec une instruction en langage naturel au point de terminaison, et les résultats modifiés reviennent en 1K ou 2K dans le rapport d'aspect que vous spécifiez ou en automatique. Les mêmes niveaux de qualité faible et moyen s'appliquent, et chaque image coûte 0,04 $. Le restylage de produits, les changements d'arrière-plan et les variations de conception rapides utilisent tous un seul appel. |
| Grok Imagine Image Quality T2I API (Text to Image) | Quand les détails fins comptent, ce point de terminaison convertit les invites textuelles en images polies en 1K ou 2K et retourne jusqu'à quatre variations par requête à 0,05 $ par image. Les rapports d'aspect couvrent les formats carré, portrait, paysage et ultrawide. Utilisez-le pour les images héros, les créations publicitaires et les rendus de produits de marque. |
| Grok Imagine Image Quality Edit API (Image to Image) | Fournissez entre une et huit images source avec une instruction d'édition et recevez des versions révisées en 1K ou 2K pour 0,05 $ par image. Les références multi-images s'adressent en ligne comme <IMAGE_0> et <IMAGE_1>, de sorte que les sujets et les styles peuvent être combinés en une seule instruction. Les actualisations de campagne, les transferts de style et les éditions composites sont les cas d'usage typiques. |
| Grok Imagine Image T2I API (Text to Image) | Le point de terminaison text-to-image original maintient la sortie 1K et 2K et le lot de quatre images au prix d'image le plus bas de la famille, 0,02 $ par image. Cela en fait une valeur par défaut pratique pour les pipelines à haut volume, la génération de miniatures et les tests rapides d'invites. |
| Grok Imagine Image Edit API (Image to Image) | Besoin d'éditions légères à grande échelle? Ce point de terminaison accepte entre une et huit images avec une instruction texte et retourne jusqu'à quatre résultats modifiés en 1K ou 2K pour 0,02 $ par image. Le nettoyage du catalogue, les variantes saisonnières et les passes de conception itératives restent économiques. |
| Grok Imagine Video v1.5 T2V API (Text to Video) | Une invite seule produit une à quinze secondes de vidéo avec audio synchronisé natif en 480p, 720p ou 1080p, sur sept rapports d'aspect. La facturation est 0,08 $ par seconde de sortie. Les bandes-annonces, les spots sociaux et les scènes narratives qui nécessitent l'audio intégré y conviennent le mieux. |
| Grok Imagine Video v1.5 I2V API (Image to Video) | Fournissez une trame d'ouverture et une instruction de mouvement, et v1.5 l'anime pendant jusqu'à quinze secondes à des résolutions jusqu'à 1080p avec l'audio généré dans le même passage. Le coût est 0,08 $ par seconde. Les spins de produits, l'animation de portrait et les ressources de campagne still-to-motion conviennent ici. |
| Grok Imagine Video v1.5 R2V API (Reference to Video) | Entre une et sept images de référence guident les personnages, les objets et le style à l'écran, tandis qu'une à trois voix choisies parmi 26 présets animent l'audio parlé. La sortie atteint quinze secondes à 480p ou 720p pour 0,08 $ par seconde. La narration cohérente des personnages, l'essayage virtuel et les mascottes de marque en tirent le meilleur parti. |
| Grok Imagine Video T2V API (Text to Video) | Les invites textuelles deviennent des clips d'une à quinze secondes à 480p ou 720p, avec sept rapports d'aspect couvrant la livraison paysage, carré et vertical. À 0,05 $ par seconde, c'est l'option économique pour le contenu social et les storyboards rapides. |
| Grok Imagine Video I2V API (Image to Video) | Ancrez une image statique comme trame d'ouverture, décrivez le mouvement désiré, et le clip s'étend à quinze secondes à 480p ou 720p. La tarification s'élève à 0,05 $ par seconde, ce qui rend l'animation en masse des photos de produits et des portraits abordable. |
| Grok Imagine Video R2V API (Reference to Video) | Entre une et sept images de référence façonnent qui et quoi apparaît à l'écran sans épingler une trame d'ouverture fixe. Les clips durent jusqu'à dix secondes à 480p ou 720p et coûtent 0,05 $ par seconde. Utilisez-le quand l'identité et le style doivent rester cohérents d'un plan à l'autre. |
| Grok Imagine Video Extend API (Video Extension) | Un mp4 existant de deux à quinze secondes peut être continué par deux à dix secondes supplémentaires, guidé par une invite qui définit ce qui se passe ensuite. La sortie correspond à la vidéo source et est plafonnée à 720p, facturée 0,07 $ par seconde. C'est pratique pour étendre un court clip à la durée d'annonce requise. |
| Grok Imagine Video Edit API (Video to Video) | Les instructions en langage naturel réécrivent un mp4 existant tandis que la scène originale, le mouvement et le cadrage sont préservés. La sortie maintient la durée source, limitée à 8,7 secondes, et la facturation suit la vidéo d'entrée à 0,07 $ par seconde. Les ajouts d'accessoires, les changements de garde-robe et le restylage se font sans nouveau tournage. |
| xAI TTS v1 API (Text to Speech) | Jusqu'à 15 000 caractères de texte deviennent de la parole naturelle avec une latence inférieure à la seconde sur 20 langues, avec détection automatique de la langue disponible. La livraison est réglable : vitesse de lecture de 0,7x à 1,5x, codecs incluant mp3, wav et pcm, et taux d'échantillonnage jusqu'à 48 kHz. Les voix-off, les invites IVR et la narration intégrée à l'application sont les cas d'usage naturels. |
Chaque partie de l'API Grok Imagine répond à un besoin de production différent, avec des images fixes 2K dans 14 rapports d'aspect, une édition guidée par des références, une vidéo dotée de son audio synchronisé intégré, et de la parole dans 20 langues.

Les dialogues, l'ambiance et la musique sont générés dans le même passage que le mouvement, de sorte que les clips d'une durée maximale de 15 secondes arrivent déjà synchronisés. Aucune étape de composition ou de doublage séparée n'est nécessaire avant la publication.

Grok Imagine Image 2.0 conserve des textures photoréalistes en 1K ou 2K sur 14 rapports d'aspect, avec des niveaux de qualité low et medium à 0,04 $ par image. Une seule génération couvre les bannières principales, les recadrages pour l'impression et les gros plans.

Soumettez une photo et Grok Imagine Video v1.5 l'ancêtre comme image d'ouverture, puis construit le mouvement autour à une résolution maximale de 1080p. Les plans de catalogue et les portraits deviennent des showreels sans aucun tournage supplémentaire.

Jusqu'à trois images de référence peuvent être éditées ensemble en 1K ou 2K, des instructions en langage naturel ne modifiant que les éléments que vous indiquez. À 0,04 $ par édition, les itérations de design et les ensembles de variantes conformes à la charte restent économiques.

Entre une et sept images de référence transportent les personnages, les accessoires et le style dans des clips d'une durée maximale de 15 secondes, sans image de départ fixe. Essayage virtuel, placement de produit et séries centrées sur les personnages conservent un look reconnaissable.

xAI TTS v1 est intégré à la même suite, transformant le texte en parole expressive dans 20 langues avec une latence inférieure à la seconde. Associez-le à de la vidéo générée pour des explications narrées, des publicités localisées et des assistants intégrés à l'application.

Un contrôle fin du rythme, de l'accentuation et du ton façonne chaque lecture, et une synthèse en moins d'une seconde rend l'audition d'une réplique quasi instantanée. Avec plus de 80 voix, un seul moteur couvre les livres audio, le doublage et les dialogues de personnages.
Chaque ligne exécute la consigne identique via l'API Grok Imagine et deux modèles concurrents sur Atlas Cloud, afin que le mouvement, la synchronisation audio, le niveau de détail et la typographie puissent être évalués sur un pied d'égalité.
Scène de marché de nuit cinématographique en prise de vues réelles, d'environ 10 secondes. Plan d'ouverture en contre-plongée, suivi latéral glissant devant des étals fumants, tandis qu'un jeune chef wok, trempé dans un débardeur, fait sauter des nouilles, une colonne de flammes jaillissant du wok et éclairant son visage d'une lueur orange. Le caméra effectue un whip pan vers la droite pour entrer dans un gros plan macro de crevettes grillant et se recroquevillant dans l'huile, des gouttelettes projetées, puis recule et part en grue au-dessus du comptoir alors qu'il rattrape le wok en rotation et dresse les nouilles en un seul mouvement continu. Dernier plan : un chat de marché hirsute bondit sur le comptoir, saisit une crevette et s'enfuit dans la foule pendant que le chef pivote en riant, la caméra basculant sur une poursuite handheld rapide derrière le chat. Asphalte mouillé reflétant la lumière des lanternes rouges, vapeur flottante, profondeur de champ réduite, look documentaire granuleux avec grain fin. Audio : moteur à gaz rugissant, huile qui crépite, rumeur du marché et cliquetis des louche, une rythmique de tambours montante qui tombe pile sur le saut du chat. Ratio d'aspect 16:9.
Generated with Grok Imagine Video v1.5 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Grok Imagine Video on Atlas Cloud
Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud
Chaque workflow ci-dessous fonctionne avec une seule clé compatible OpenAI, permettant à une équipe de faire évoluer un concept depuis les ébauches d'images Grok Imagine API, les modifications par référence, la vidéo avec audio synchronisé, jusqu'à la narration localisée, sans changer de stack technique.
Image 2.0 génère 1 000 ébauches en environ dix secondes sur le niveau de qualité bas, avec jusqu'à quatre variantes par appel. Les équipes design explorent rapidement de nombreuses directions, puis ré-rendent le meilleur résultat en 2K.
Alimentez jusqu'à trois images de référence dans Grok Imagine Image 2.0 Edit et décrivez le changement en langage naturel. Les équipes e-commerce échangent les arrière-plans, restylent les emballages et maintiennent un produit unique cohérent sur tout un catalogue.
xAI TTS v1 convertit des scripts en parole expressive dans vingt langues et plus de quatre-vingts voix, avec une latence inférieure à une seconde. Les équipes produit l'associent à de la vidéo générée pour des publicités localisées, des tutoriels et une narration in-app.
Grok Imagine Video v1.5 génère musique, effets et dialogue synchronisés avec l'image, sur des clips de quinze secondes maximum en 1080p. Les marketeurs obtiennent un spot fini en un seul passage, sans session audio séparée.
Besoin du même personnage dans chaque plan ? Le reference-to-video accepte une à sept images de référence plus une voix de référence optionnelle, permettant aux créateurs de séries de garder une identité et un ton vocal stables sur un clip de quinze secondes.
Les séquences existantes peuvent être restylées via un édit en langage naturel ou prolongées d'une extension de deux à dix secondes correspondant à la source. Les équipes post-production corrigent les accessoires, le costume et le rythme sans retour sur le plateau.
Découvrez comment les modèles de différents fournisseurs se comparent — performance, tarification et atouts uniques pour une décision éclairée.
| Modèle | Limite d'Images de Référence | Nombre de Sorties | Résolution | Ratio d'Aspect |
|---|---|---|---|---|
| Grok Imagine Image Quality | 8 | 1~4 | 2K, 1K | Auto, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1 |
| Nano Banana 2 | 14 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Nano Banana Pro | 10 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Seedream 5.0 Lite | 14 | 1~15 | 2K~4K+ | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Qwen-Image | 3 | 1~6 | 512P~2K | Width[512, 2048]px, Height[512, 2048]px |
Soyez opérationnel en quelques minutes — suivez ces étapes simples pour intégrer et déployer des modèles via la plateforme Atlas Cloud.
Inscrivez-vous sur atlascloud.ai et complétez la vérification. Les nouveaux utilisateurs reçoivent des crédits gratuits pour explorer la plateforme et tester les modèles.
Combiner les modèles Grok Imagine avancés avec la plateforme accélérée par GPU d'Atlas Cloud offre des performances, une évolutivité et une expérience développeur inégalées.
Faible Latence :
Inférence optimisée par GPU pour un raisonnement en temps réel.
API Unifiée :
Exécutez Grok Imagine, GPT, Gemini et DeepSeek avec une seule intégration.
Tarification Transparente :
Facturation prévisible par token avec options serverless.
Expérience Développeur :
SDK, analytiques, outils de fine-tuning et modèles.
Fiabilité :
99,99% de disponibilité, RBAC et journalisation conforme.
Sécurité et Conformité :
SOC 2 Type II, alignement HIPAA, souveraineté des données aux États-Unis.
L'API Grok Imagine est le point d'accès unifié d'Atlas Cloud à la stack de génération xAI Grok Imagine, couvrant la création d'images, l'édition d'images, la vidéo et la synthèse vocale. Une seule clé donne accès à tous les modes, y compris les derniers modèles Grok Imagine Image 2.0 Text-to-Image et Grok Imagine Image 2.0 Edit sortis le 7 août 2026. La facturation est à l'usage, par génération réussie : vous payez par appel, sans abonnement.
Trois générations d'images coexistent: Grok Imagine Image à 0,02 $ par image, Grok Imagine Image Quality à 0,05 $, et Grok Imagine Image 2.0 à partir de 0,04 $, chacun avec son propre point de terminaison d'édition. La vidéo est disponible via Grok Imagine Video à 0,05 $ par seconde et Grok Imagine Video v1.5 à 0,08 $ par seconde, avec des points de terminaison d'extension et d'édition. xAI TTS v1 complète la suite avec plus de 80 voix dans 20 langues.
Image 2.0 planifie la typographie et la mise en page comme le ferait un designer, de sorte que les compositions denses et le petit texte restent lisibles au lieu de se dissoudre en texture. Il expose également un niveau de qualité sélectionnable, vous permettant d'arbitrer entre temps de rendu et fidélité sur le même prompt, ce que les modèles Image et Image Quality antérieurs ne proposent pas. Les variantes Text-to-Image et Edit partagent ce comportement.
La tarification est par génération réussie, sans minimum. Grok Imagine Image 2.0 est à 0,04 $ par image en qualité low et 1K, 0,06 $ en qualité low avec 2K ou qualité medium avec 1K, et 0,08 $ en qualité medium avec 2K, tandis que chaque image d'entrée sur le point de terminaison Edit ajoute 0,01 $. Pour les autres modèles d'image, Grok Imagine Image est à 0,02 $ par image et Grok Imagine Image Quality à 0,05 $, et la vidéo démarre à 0,05 $ par seconde.
Créez une clé API Atlas Cloud, puis envoyez votre prompt et un identifiant de modèle tel que xai/grok-imagine-image-2.0/text-to-image au point de terminaison de génération d'images. Le rendu est asynchrone, donc l'appel retourne un ID de requête que vous interrogez sur le point de terminaison de prédiction jusqu'à ce que son statut passe de processing à completed. Comme chaque modèle Grok Imagine suit le même schéma, ajouter la vidéo ou la voix plus tard signifie modifier une seule chaîne. Commencez à développer dès aujourd'hui.
Les sorties rendent en 1K (1024x1024) ou 2K (2048x2048) sur 14 rapports d'aspect, du carré 1:1 et du widescreen 16:9 au format haut 9:20 et bannière ultrawide 20:9. Un seul appel peut retourner jusqu'à quatre images, et les prompts peuvent atteindre 8 000 caractères. Sur le point de terminaison Edit, le rapport d'aspect est par défaut sur auto et suit votre première image d'entrée sauf si vous le définissez explicitement.
Jusqu'à trois images source par requête, fournies sous forme d'URLs publiques ou de data URIs en base64. Lorsque vous en transmettez plusieurs, citez-les dans le prompt comme <IMAGE_0>, <IMAGE_1> et <IMAGE_2> pour que le modèle sache à quelle instruction chaque élément s'applique. Chaque image d'entrée ajoute 0,01 $ à l'appel, et vous pouvez demander une à quatre variantes éditées à la fois.
Oui. Grok Imagine Video v1.5 produit un audio natif et synchronisé dans le même passage que l'image, de sorte que la musique, les effets sonores et le dialogue s'alignent sur le mouvement au lieu de nécessiter un deuxième pipeline. Son mode reference-to-video accepte une voix de référence en option aux côtés de une à sept images de référence. Les clips durent jusqu'à 15 secondes, atteignant la 1080p en text-to-video et image-to-video.
Choisissez Image 2.0 lorsque l'image contient de la typographie, une mise en page ou des détails multi-composants qui doivent rester cohérents, et lorsque vous souhaitez un contrôle direct sur l'arbitrage vitesse/fidélité. Grok Imagine Image Quality reste un tarif forfaitaire simple de 0,05 $ par image avec la même sortie 1K et 2K et 14 rapports d'aspect. Si le volume compte plus que le texte fin, le Grok Imagine Image original à 0,02 $ par image reste l'option la plus économique.
Medium est le niveau de qualité par défaut et prend environ 84 secondes en 1K car il vise la meilleure sortie du modèle. Définir la qualité sur low réduit cela à environ 10 secondes, soit environ 8x plus rapide, à 0,04 $ au lieu de 0,06 $ pour une image 1K. Élaborez et itérez en qualité low, puis relancez uniquement les prompts gagnants en medium et 2K une fois la composition figée.
Guides, tutoriels et actualités produit pour tirer le meilleur d'Atlas Cloud.