



L'API Grok Imagine supporta i modelli di immagine, video e sintesi vocale di xAI, da Image 2.0 a Video 1.5 e xAI TTS v1. Genera immagini statiche 1K o 2K su 14 proporzioni d'aspetto, crea scene fino a 15 secondi di movimento 1080p, guida gli scatti con fino a 7 immagini di riferimento, o narrarli in 20 lingue. Atlas Cloud esegue ogni modalità su un singolo endpoint, con prezzi pay-as-you-go da $0,02 per immagine e $0,05 al secondo. Inizia a sviluppare oggi.
Grok Imagine è sviluppato da xAI. Atlas Cloud (gestita da Atlas Cloud AI LLC) ne fornisce l’accesso ma non ne è proprietaria. Tutti i marchi appartengono ai rispettivi titolari.
Atlas Cloud ti fornisce i più recenti modelli creativi leader del settore.
Abbina il modello Grok Imagine API giusto al tuo tipo di input, lunghezza dell'output, risoluzione e prezzo per chiamata.
| Modalità | Descrizione |
|---|---|
| Grok Imagine Image 2.0 T2I API (Text to Image) | Scrivi un prompt fino a 8.000 caratteri e questo endpoint restituisce una o quattro immagini a risoluzione 1K o 2K. Un livello di qualità basso o medio ti permette di scambiare lo sforzo di rendering contro i tempi di consegna, con prezzi di $0.04 per immagine. È adatto all'esplorazione di concetti, creazioni social e produzione visiva in batch dove il volume conta. |
| Grok Imagine Image 2.0 Edit API (Image to Image) | Fornisci all'endpoint fino a tre immagini di riferimento con un'istruzione in linguaggio naturale, e i risultati modificati tornano in 1K o 2K nel rapporto d'aspetto che hai impostato o in auto. Si applicano gli stessi livelli di qualità basso e medio, e ogni immagine costa $0.04. Il restyling dei prodotti, gli scambi di sfondo e le variazioni di design rapide si eseguono tutto in una chiamata. |
| Grok Imagine Image Quality T2I API (Text to Image) | Dove i dettagli più fini contano, questo endpoint trasforma i prompt di testo in immagini fisse lucide a 1K o 2K e restituisce fino a quattro variazioni per richiesta a $0.05 per immagine. I rapporti d'aspetto spaziano da quadrati, portrait, landscape e ultrawide. Usalo per immagini hero, creazioni pubblicitarie e render di prodotto di qualità brand. |
| Grok Imagine Image Quality Edit API (Image to Image) | Fornisci da uno a otto immagini sorgente con un'istruzione di modifica e ricevi versioni rivedute a 1K o 2K per $0.05 per immagine. I riferimenti multi-immagine si affrontano inline come <IMAGE_0> e <IMAGE_1>, quindi soggetti e stili possono essere combinati in un'unica istruzione. Gli aggiornamenti delle campagne, i trasferimenti di stile e le modifiche composite sono i lavori usuali. |
| Grok Imagine Image T2I API (Text to Image) | L'endpoint text-to-image originale mantiene output 1K e 2K e batch di quattro immagini al prezzo d'immagine più basso della famiglia, $0.02 per immagine. Questo lo rende una scelta pratica per pipeline ad alto volume, generazione di miniature e test rapidi di prompt. |
| Grok Imagine Image Edit API (Image to Image) | Hai bisogno di modifiche leggere su larga scala? Questo endpoint accetta da uno a otto immagini con un'istruzione di testo e restituisce fino a quattro risultati modificati a 1K o 2K per $0.02 per immagine. La pulizia del catalogo, le varianti stagionali e i passaggi di design iterativi rimangono economici. |
| Grok Imagine Video v1.5 T2V API (Text to Video) | Un prompt da solo produce da uno a quindici secondi di video con audio sincronizzato nativo a 480p, 720p, o 1080p, su sette rapporti d'aspetto. La fatturazione è $0.08 al secondo di output. Trailer, spot social e scene narrative che hanno bisogno di suono integrato si adattano meglio. |
| Grok Imagine Video v1.5 I2V API (Image to Video) | Fornisci un fotogramma iniziale e un prompt di movimento, e v1.5 lo anima per fino a quindici secondi con risoluzioni che raggiungono 1080p con audio generato nello stesso passaggio. Il costo è $0.08 al secondo. Rotazioni di prodotto, animazione di ritratti e asset di campagna still-to-motion si adattano qui. |
| Grok Imagine Video v1.5 R2V API (Reference to Video) | Da uno a sette immagini di riferimento guidano i personaggi, gli oggetti e lo stile sullo schermo, mentre fino a tre voci scelte da 26 preset guidano l'audio parlato. L'output raggiunge quindici secondi a 480p o 720p per $0.08 al secondo. La narrazione coerente dei personaggi, la prova virtuale e le mascotte del marchio traggono il massimo beneficio. |
| Grok Imagine Video T2V API (Text to Video) | I prompt di testo diventano clip da uno a quindici secondi a 480p o 720p, con sette rapporti d'aspetto che coprono la consegna landscape, square e vertical. A $0.05 al secondo, è l'opzione di valore per i contenuti social e i concept board rapidi. |
| Grok Imagine Video I2V API (Image to Video) | Ancora un'immagine fissa come primo fotogramma, descrivi il movimento che desideri e la clip si estende fino a quindici secondi a 480p o 720p. Il prezzo rimane a $0.05 al secondo, il che mantiene l'animazione in massa di foto e ritratti di prodotto accessibile. |
| Grok Imagine Video R2V API (Reference to Video) | Tra uno e sette immagini di riferimento definiscono chi e cosa appare sullo schermo senza fissare un fotogramma di apertura fisso. Le clip durano fino a dieci secondi a 480p o 720p e costano $0.05 al secondo. Usalo quando l'identità e lo stile devono rimanere coerenti da scena a scena. |
| Grok Imagine Video Extend API (Video Extension) | Un mp4 esistente di due a quindici secondi può essere continuato da altri due a dieci secondi, guidato da un prompt che imposta cosa succede dopo. L'output corrisponde al video sorgente ed è limitato a 720p, fatturato a $0.07 al secondo. È utile per estendere un taglio breve a una lunghezza di annuncio richiesta. |
| Grok Imagine Video Edit API (Video to Video) | Le istruzioni in linguaggio naturale riscrivono un mp4 esistente mentre la scena originale, il movimento e l'inquadratura sopravvivono. L'output mantiene la durata sorgente, limitata a 8.7 secondi, e la fatturazione segue il video di input a $0.07 al secondo. L'aggiunta di oggetti di scena, i cambi di abbigliamento e il restyling avvengono senza una nuova ripresa. |
| xAI TTS v1 API (Text to Speech) | Fino a 15.000 caratteri di testo diventano parlato naturale con latenza inferiore al secondo in 20 lingue, con rilevamento automatico della lingua disponibile. La consegna è regolabile: velocità di riproduzione da 0,7x a 1,5x, codec inclusi mp3, wav e pcm, e frequenze di campionamento fino a 48 kHz. Voice-over, prompt IVR e narrazione in-app sono gli adattamenti naturali. |
Ogni parte dell'API Grok Imagine risponde a una diversa esigenza produttiva, coprendo immagini statiche 2K in 14 formati, editing guidato da reference, video con audio sincronizzato integrato e voce in 20 lingue.

Dialogo, ambientazione e musica sono generati nello stesso passaggio del movimento, quindi i clip fino a 15 secondi arrivano già sincronizzati. Non è necessario un passaggio separato per la colonna sonora o il doppiaggio prima della pubblicazione.

Grok Imagine Image 2.0 mantiene texture fotorealistiche a 1K o 2K in 14 formati, con livelli di qualità bassa e media a $0.04 per immagine. Una generazione copre banner principali, ritagli per stampa e primi piani.

Carica una foto e Grok Imagine Video v1.5 la fissa come frame iniziale, poi costruisce il movimento attorno ad essa fino a 1080p. Riprese da catalogo e ritratti diventano showreel senza necessità di riprese.

Fino a tre immagini di riferimento possono essere modificate insieme a 1K o 2K, con istruzioni in linguaggio naturale che modificano solo gli elementi specificati. A $0.04 per modifica, le iterazioni di design e i set di varianti in brand restano economici.

Da una a sette immagini di riferimento trasportano personaggi, oggetti e stile in clip fino a 15 secondi, senza frame iniziale fisso. Virtual try-on, product placement e serie basate su personaggi mantengono un look riconoscibile.

xAI TTS v1 è incluso nella stessa suite, trasformando il testo in voce espressiva in 20 lingue con latenza sub-secondaria. Abbinandolo al video generato per explainers narrati, annunci localizzati e assistenti in-app.

Controllo fine su ritmo, enfasi e tono modula ogni lettura, e la sintesi sub-secondaria rende l'audizione di una riga quasi istantanea. Oltre 80 voci, un unico motore copre audiolibri, doppiaggio e dialoghi dei personaggi.
Ogni riga esegue lo stesso prompt attraverso l'API Grok Imagine e due modelli concorrenti su Atlas Cloud, così movimento, sincronizzazione audio, dettaglio e tipografia possono essere valutati in modo equo.
Scena cinematografica dal vivo di un mercato notturno, della durata di circa 10 secondi. Inizia con un piano basso in tracking che scivola tra bancarelle fumanti mentre un giovane chef al wok, con una canottiera fradicia, lancia i noodles; una colonna di fiamma esplode dal wok illuminandogli il viso di arancione. La camera effettua un whip pan verso destra entrando in un primo piano macro di gamberi che si cuociono e si arricciano nell'olio, goccioline che volano via, poi si allontana e sale in crane sopra il bancone mentre lui cattura il wok rotante e impiatta i noodles in un unico movimento continuo. Ultimo piano: un gatto randagio del mercato balza sul bancone, afferra un gambero e scappa nella folla mentre lo chef gira ridendo, e la camera esplode in un inseguimento handheld veloce dietro il gatto. Asfalto bagnato che riflette la luce delle lanterne rosse, vapore fluttuante, profondità di campo ridotta, look da documentario grainy con grana fine. Audio: bruciatore a gas ruggente, olio che sfrigola, chiacchiere e schiamazzi del mercato e tintinnio di mestoli, un pattern di tamburi crescente che arriva esattamente sul salto del gatto. Aspect ratio 16:9.
Generated with Grok Imagine Video v1.5 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Grok Imagine Video on Atlas Cloud
Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud
Ogni flusso di lavoro descritto di seguito funziona con una singola chiave compatibile OpenAI, consentendo a un team di portare un'idea dagli abbozzi immagine di Grok Imagine API, alle modifiche con riferimento, al video con audio sincronizzato e alla narrazione localizzata senza cambiare stack tecnologici.
Image 2.0 restituisce 1K bozze in circa dieci secondi nel tier a bassa qualità e fino a quattro varianti per chiamata. I team di design esplorano molte direzioni in fase iniziale, poi rendono il vincitore in 2K.
Carica fino a tre immagini di riferimento in Grok Imagine Image 2.0 Edit e descrivi la modifica in linguaggio naturale. I team di e-commerce sostituiscono gli sfondi, rivestono il packaging e mantengono un unico prodotto coerente in tutto il catalogo.
xAI TTS v1 converte i copioni in discorso espressivo in venti lingue e oltre ottanta voci con latenza inferiore al secondo. I team prodotto lo abbinano al video generato per annunci localizzati, tutorial e narrazione in-app.
Grok Imagine Video v1.5 scrive musica sincronizzata, effetti e dialoghi insieme all'immagine in clip fino a quindici secondi a 1080p. I marketeuri ottengono uno spot finito in un solo passaggio, senza sessione audio separata.
Hai bisogno dello stesso personaggio in ogni inquadratura? Reference-to-video accetta da una a sette immagini di riferimento più una voce di riferimento opzionale, così i creatori di serie mantengono identità e tono vocale costanti in una clip di quindici secondi.
Il materiale girato può essere rivisto tramite editing in linguaggio naturale o continuato con un'estensione da due a dieci secondi che rispetta la fonte. I team di post-produzione correggono oggetti, costumi e ritmo senza tornare in set.
Scopri come si confrontano i modelli di diversi provider — confronta prestazioni, prezzi e punti di forza unici per una decisione informata.
| Modello | Limite Immagine di Riferimento | Num. Output | Risoluzione | Proporzione |
|---|---|---|---|---|
| Grok Imagine Image Quality | 8 | 1~4 | 2K, 1K | Auto, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1 |
| Nano Banana 2 | 14 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Nano Banana Pro | 10 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Seedream 5.0 Lite | 14 | 1~15 | 2K~4K+ | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Qwen-Image | 3 | 1~6 | 512P~2K | Width[512, 2048]px, Height[512, 2048]px |
Inizia in pochi minuti — segui questi semplici passaggi per integrare e distribuire i modelli tramite la piattaforma Atlas Cloud.
Registrati su atlascloud.ai e completa la verifica. I nuovi utenti ricevono crediti gratuiti per esplorare la piattaforma e testare i modelli.
Combinando i modelli avanzati di Grok Imagine con la piattaforma GPU-accelerata di Atlas Cloud, ottieni prestazioni, scalabilità ed esperienza di sviluppo senza pari.
Bassa Latenza:
Inferenza ottimizzata su GPU per elaborazione in tempo reale.
API Unificata:
Esegui Grok Imagine, GPT, Gemini e DeepSeek con un'unica integrazione.
Prezzi Trasparenti:
Fatturazione prevedibile per token con opzioni Serverless.
Esperienza Sviluppatore:
SDK, analytics, strumenti di fine-tuning e template.
Affidabilità:
99,99% di uptime, RBAC e logging conforme alle normative.
Sicurezza e Conformità:
SOC 2 Type II, allineamento HIPAA, sovranità dei dati negli USA.
L'API Grok Imagine è il punto di accesso unificato di Atlas Cloud allo stack di generazione xAI Grok Imagine, che copre creazione di immagini, editing, video e sintesi vocale. Una sola API key sblocca tutte le modalità, inclusi i nuovi modelli Grok Imagine Image 2.0 Text-to-Image e Grok Imagine Image 2.0 Edit rilasciati il 7 agosto 2026. Il billing è pay-as-you-go per generazione andata a buon fine: si paga per chiamata, senza abbonamenti.
Tre modelli per la generazione di immagini coesistono: Grok Imagine Image a $0,02 per immagine, Grok Imagine Image Quality a $0,05 e Grok Imagine Image 2.0 a partire da $0,04, ciascuno con il proprio endpoint di editing. Per il video ci sono Grok Imagine Video a $0,05 al secondo e Grok Imagine Video v1.5 a $0,08 al secondo, con endpoint di estensione e editing. xAI TTS v1 completa la suite con oltre 80 voci in 20 lingue.
Image 2.0 gestisce tipografia e layout come farebbe un designer, mantenendo leggibili composizioni dense e testo piccolo invece di dissolverlo in texture. Espone inoltre un livello di qualità selezionabile, permettendo di bilanciare tempi di render e fedeltà sullo stesso prompt, una funzionalità assente nei precedenti modelli Image e Image Quality. Entrambe le varianti Text-to-Image ed Edit condividono questo comportamento.
Il pricing è basato su generazioni andate a buon fine, senza spesa minima. Grok Imagine Image 2.0 costa $0,04 per immagine a bassa qualità e 1K, $0,06 a bassa qualità con 2K o media qualità con 1K, e $0,08 a media qualità con 2K; ogni immagine di input sull'endpoint Edit aggiunge $0,01. Per gli altri modelli immagine, Grok Imagine Image è $0,02 per immagine e Grok Imagine Image Quality è $0,05; il video parte da $0,05 al secondo.
Crea una API key Atlas Cloud, poi invia il tuo prompt e un model id come xai/grok-imagine-image-2.0/text-to-image all'endpoint di generazione immagini. Il rendering è asincrono: la chiamata restituisce un request id da interrogare sull'endpoint prediction finché lo status non passa da processing a completed. Poiché tutti i modelli Grok Imagine seguono lo stesso pattern, aggiungere video o sintesi vocale in seguito significa modificare una sola stringa. Inizia a sviluppare oggi.
I output vengono generati a 1K (1024x1024) o 2K (2048x2048) su 14 rapporti d'aspetto, dal quadrato 1:1 e dal widescreen 16:9 al verticale 9:20 e al banner ultrawide 20:9. Una singola chiamata può restituire fino a quattro immagini, e i prompt possono arrivare a 8.000 caratteri. Sull'endpoint Edit il rapporto d'aspetto predefinito è auto e segue la prima immagine di input, a meno che non venga impostato esplicitamente.
Fino a tre immagini sorgente per richiesta, fornite come URL pubblici o data URI in base64. Quando se ne forniscono più di una, riferiscile nel prompt come <IMAGE_0>, <IMAGE_1> e <IMAGE_2> in modo che il modello sappia a quale asset si applica ogni istruzione. Ogni immagine di input aggiunge $0,01 alla chiamata, e puoi richiedere da una a quattro varianti modificate alla volta.
Sì. Grok Imagine Video v1.5 produce audio nativo e sincronizzato nella stessa passata dell'immagine, così musica, effetti sonori e dialoghi si allineano al movimento senza richiedere una pipeline separata. La modalità reference-to-video accetta una voce di riferimento opzionale insieme a una o sette immagini di riferimento. I clip arrivano a 15 secondi, fino a 1080p per text-to-video e image-to-video.
Scegli Image 2.0 quando il frame contiene tipografia, layout o dettagli multi-part che devono restare coerenti, e quando vuoi controllo diretto sul trade-off tra velocità e fedeltà. Grok Imagine Image Quality offre un prezzo fisso di $0,05 per immagine con gli stessi output 1K e 2K e 14 rapporti d'aspetto. Se il volume conta più della precisione del testo, il modello originale Grok Imagine Image a $0,02 per immagine resta la soluzione più economica.
Medium è il livello di qualità predefinito e impiega circa 84 secondi a 1K perché punta al risultato migliore del modello. Impostare la qualità su low riduce il tempo a circa 10 secondi, circa 8 volte più veloce, a $0,04 invece di $0,06 per un'immagine 1K. Bozza e itera a bassa qualità, poi rilancia solo i prompt vincenti a medium e 2K una volta definita la composizione.
Guide, tutorial e novità di prodotto per sfruttare al meglio Atlas Cloud.