



Die Grok Imagine API umfasst xAIs Bild-, Video- und Sprachmodelle, von Image 2.0 bis Video 1.5 und xAI TTS v1. Generieren Sie 1K oder 2K Standbilder über 14 Seitenverhältnisse, erweitern Sie eine Szene auf 15 Sekunden 1080p-Motion, steuern Sie Aufnahmen mit bis zu 7 Referenzbildern, oder озвучить Sie diese in 20 Sprachen. Atlas Cloud führt alle Modi auf einem Endpunkt aus, mit Pay-as-you-go-Preisgestaltung ab $0.02 pro Bild und $0.05 pro Sekunde. Beginnen Sie heute mit der Entwicklung.
Grok Imagine wurde von xAI entwickelt. Atlas Cloud (betrieben von Atlas Cloud AI LLC) stellt lediglich den Zugang bereit und ist nicht Eigentümerin des Modells. Alle Marken sind Eigentum ihrer jeweiligen Inhaber.
Atlas Cloud bietet Ihnen die neuesten branchenführenden kreativen Modelle.
Wählen Sie das richtige Grok Imagine API Modell für Ihren Eingabetyp, Ausgabelänge, Auflösung und Preis pro Aufruf.
| Modalität | Beschreibung |
|---|---|
| Grok Imagine Image 2.0 T2I API (Text to Image) | Schreiben Sie Prompts mit bis zu 8.000 Zeichen, und dieser Endpoint gibt ein bis vier Bilder in 1K- oder 2K-Auflösung zurück. Mit niedrigen oder mittleren Qualitätsstufen können Sie Rendering-Aufwand gegen Bearbeitungsgeschwindigkeit abwägen; die Preisgestaltung beträgt $0.04 pro Bild. Ideal für Konzepterkundung, Social-Media-Inhalte und großvolumige Batch-Visual-Produktion. |
| Grok Imagine Image 2.0 Edit API (Image to Image) | Übergeben Sie dem Endpoint bis zu drei Referenzbilder mit natürlichsprachigen Anweisungen, und bearbeitete Ergebnisse kommen in 1K oder 2K im Seitenverhältnis Ihrer Wahl oder automatisch zurück. Die gleichen niedrigen und mittleren Qualitätsstufen gelten; jedes Bild kostet $0.04. Produktumgestaltung, Hintergrundaustausch und schnelle Design-Variationen können alles mit einem Aufruf erfolgen. |
| Grok Imagine Image Quality T2I API (Text to Image) | Wo feinere Details zählen, wandelt dieser Endpoint Text-Prompts in polierte Standbilder in 1K oder 2K um und gibt bis zu vier Variationen pro Anfrage für je $0.05 pro Bild zurück. Seitenverhältnisse umfassen Quadrat-, Hochformat-, Breitformat- und Ultrabreitformat-Formate. Verwenden Sie ihn für Hauptbilder, Werbeinhalte und hochwertige Produktrenderings. |
| Grok Imagine Image Quality Edit API (Image to Image) | Übergeben Sie ein bis acht Quellbilder mit Bearbeitungsanweisungen und erhalten Sie überarbeitete Versionen in 1K oder 2K für je $0.05 pro Bild. Mehrfach-Bildreferenzen werden inline als <IMAGE_0> und <IMAGE_1> adressiert, sodass Motive und Stile in einer einzigen Anweisung kombiniert werden können. Kampagnenaktualisierungen, Stilübertragungen und zusammengesetzte Bearbeitungen sind die typischen Aufgaben. |
| Grok Imagine Image T2I API (Text to Image) | Der ursprüngliche Text-to-Image-Endpoint bietet 1K- und 2K-Ausgabe sowie Vier-Bild-Batching zum niedrigsten Bildpreis in der Familie, $0.02 pro Bild. Das macht ihn zur praktischen Standardwahl für Hochvolumen-Pipelines, Miniaturbildgenerierung und schnelle Prompt-Tests. |
| Grok Imagine Image Edit API (Image to Image) | Benötigen Sie leichte Bearbeitungen in großem Maßstab? Dieser Endpoint akzeptiert ein bis acht Bilder mit Textanweisungen und gibt bis zu vier bearbeitete Ergebnisse in 1K oder 2K für je $0.02 pro Bild zurück. Katalogbereinigung, saisonale Varianten und iterative Design-Durchläufe bleiben kostengünstig. |
| Grok Imagine Video v1.5 T2V API (Text to Video) | Ein einzelner Prompt erzeugt ein bis 15 Sekunden Video mit nativ synchronisiertem Audio in 480p, 720p oder 1080p über sieben Seitenverhältnisse. Die Abrechnung beträgt $0.08 pro Sekunde Ausgabe. Trailer, Social-Media-Spots und narrative Szenen mit integriertem Sound sind ideal dafür. |
| Grok Imagine Video v1.5 I2V API (Image to Video) | Geben Sie einen Startframe und einen Motion-Prompt an, und v1.5 animiert es für bis zu 15 Sekunden mit Auflösungen bis zu 1080p und Audio, das im gleichen Durchlauf generiert wird. Die Kosten betragen $0.08 pro Sekunde. Produktrotationen, Porträtanimation und Still-to-Motion-Kampagnen-Assets sind gut geeignet. |
| Grok Imagine Video v1.5 R2V API (Reference to Video) | Ein bis sieben Referenzbilder leiten die Charaktere, Objekte und den Stil auf dem Bildschirm, während bis zu drei aus 26 Voreinstellungen gewählte Stimmen das gesprochene Audio antreiben. Die Ausgabe erreicht bis zu 15 Sekunden bei 480p oder 720p für $0.08 pro Sekunde. Charakterkonsistentes Storytelling, virtuelles Anprobieren und Marken-Maskottchen profitieren am meisten. |
| Grok Imagine Video T2V API (Text to Video) | Text-Prompts werden zu Clips von ein bis 15 Sekunden bei 480p oder 720p mit sieben Seitenverhältnissen, die Landschafts-, Quadrat- und Hochformat-Lieferung abdecken. Mit $0.05 pro Sekunde ist es die wirtschaftliche Option für Social-Media-Inhalte und schnelle Konzeptboards. |
| Grok Imagine Video I2V API (Image to Video) | Verankern Sie ein Standbild als ersten Frame, beschreiben Sie die gewünschte Bewegung, und der Clip erstreckt sich über bis zu 15 Sekunden bei 480p oder 720p. Die Preisgestaltung liegt bei $0.05 pro Sekunde, was die Massenanimation von Produktfotos und Porträts erschwinglich macht. |
| Grok Imagine Video R2V API (Reference to Video) | Ein bis sieben Referenzbilder bestimmen, wer und was auf dem Bildschirm erscheint, ohne einen festen Öffnungs-Frame festzulegen. Clips laufen bis zu zehn Sekunden bei 480p oder 720p und kosten $0.05 pro Sekunde. Verwenden Sie ihn, wenn Identität und Stil von Aufnahme zu Aufnahme konsistent bleiben müssen. |
| Grok Imagine Video Extend API (Video Extension) | Ein vorhandenes mp4 von zwei bis 15 Sekunden kann um weitere zwei bis zehn Sekunden fortgesetzt werden, gesteuert durch einen Prompt, der festlegt, was als nächstes passiert. Die Ausgabe entspricht dem Quellvideo und ist auf 720p begrenzt; die Abrechnung beträgt $0.07 pro Sekunde. Es ist praktisch, um einen kurzen Schnitt auf die erforderliche Werbelänge zu strecken. |
| Grok Imagine Video Edit API (Video to Video) | Natürlichsprachige Anweisungen schreiben ein vorhandenes mp4 um, während die ursprüngliche Szene, Bewegung und Rahmung erhalten bleibt. Die Ausgabe behält die Quelldauer bei, begrenzt auf 8,7 Sekunden; die Abrechnung folgt dem Eingabevideo mit $0.07 pro Sekunde. Requisitenzusätze, Garderobenwechsel und Umgestaltungen erfolgen ohne Neuaufnahme. |
| xAI TTS v1 API (Text to Speech) | Bis zu 15.000 Textzeichen werden mit Latenzzeiten unter einer Sekunde in 20 Sprachen zu natürlicher Sprache, mit verfügbarer automatischer Spracherkennung. Die Lieferung ist abstimmbar: Wiedergabgeschwindigkeit von 0,7x bis 1,5x, Codecs einschließlich mp3, wav und pcm, sowie Abtastraten bis zu 48 kHz. Voice-Overs, IVR-Prompts und In-App-Erzählungen sind die natürlichen Einsatzbereiche. |
Jeder Teil der Grok Imagine API erfüllt einen anderen Produktionsbedarf: 2K-Bilder in 14 Seitenverhältnissen, referenzgeführte Bearbeitung, Video mit eigenem synchronisiertem Audio und Sprache in 20 Sprachen.

Dialog, Ambiente und Musik werden im selben Durchlauf wie die Bewegung erzeugt, sodass Clips bis zu 15 Sekunden bereits synchron ankommen. Ein separater Schritt für Musik oder Synchronisation ist vor der Veröffentlichung nicht nötig.

Grok Imagine Image 2.0 liefert fotorealistische Texturen in 1K oder 2K über 14 Seitenverhältnisse hinweg, mit den Stufen Low und Medium zu je $0,04 pro Bild. Eine einzige Generierung deckt Hero-Banner, Druckausschnitte und Nahaufnahmen ab.

Laden Sie ein Foto hoch, und Grok Imagine Video v1.5 verwendet es als ersten Frame und erzeugt darum herum Bewegung bis zu 1080p. Katalogaufnahmen und Porträts werden so ohne Neudreh zu Showreels.

Bis zu drei Referenzbilder können gemeinsam in 1K oder 2K bearbeitet werden, wobei Anweisungen in freier Sprache nur die genannten Elemente verändern. Bei $0,04 pro Bearbeitung bleiben Design-Iterationen und markengerechte Variantensets kostengünstig.

Ein bis sieben Referenzbilder transportieren Figuren, Requisiten und Stil in Clips bis zu 15 Sekunden Länge, ohne festen Startframe. Virtuelle Anproben, Product Placements und figurbasierte Serien behalten so einen wiedererkennbaren Look.

xAI TTS v1 ist in derselben Suite enthalten und wandelt Text mit Latenz unter einer Sekunde in ausdrucksvolle Sprache in 20 Sprachen um. Kombinieren Sie es mit generiertem Video für narrated Explaines, lokalisierte Werbespots und In-App-Assistenten.

Fein abgestimmte Kontrolle über Tempo, Akzentuierung und Tonfall prägt jede Lesung, und die Synthese unter einer Sekunde macht das Auditionieren eines Satzes fast augenblicklich. Über 80 Stimmen deckt eine Engine ab: Hörbücher, Synchronisation und Figurendialog.
Jede Zeile führt denselben Prompt durch die Grok Imagine API und zwei konkurrierende Modelle auf Atlas Cloud, sodass Bewegung, Audio-Sync, Details und Typografie auf gleicher Grundlage bewertet werden können.
Live-Action-Kinematografie-Nachtmärkte-Szene, ca. 10 Sekunden. Beginnt mit einer Untersicht-Tracking-Shot, der an dampfenden Buden vorbeigleitet, während ein junger Wok-Koch in einem durchnässten Tanktop Nudeln wirft, eine Flammensäule aus dem Wok aufsteigt und sein Gesicht orange beleuchtet. Die Kamera schwenzt schnell nach rechts in eine enge Makro-Aufnahme von Garnelen, die in Öl brutzeln und sich kräuseln, Tröpfchen spritzen, dann zieht sie zurück und schwenzt über die Theke, während er den rotierenden Wok fängt und die Nudeln in einer einzigen kontinuierlichen Bewegung auf den Teller gibt. Letzter Moment: Eine zerzauste Marktkatze springt auf die Theke, schnappt sich eine Garnele und verschwindet in der Menschenmenge, während der Koch sich lachend umdreht, die Kamera bricht in eine schnelle Handkamera-Verfolgungsjagd hinter der Katze aus. Nasser Asphalt, der rotes Laternenlicht reflektiert, treibender Dampf, flache Tiefenschärfe, grobkörniger Dokumentarfilm-Look mit feinem Korn. Audio: Brüllender Gasbrenner, bratendes Öl, Marktgeräusche und klappernde Kellen, ein ansteigendes Trommel-Muster, das genau auf den Sprung der Katze trifft. 16:9 Seitenverhältnis.
Generated with Grok Imagine Video v1.5 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Grok Imagine Video on Atlas Cloud
Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud
Every workflow below runs on one OpenAI-compatible key, so a team can move a concept through Grok Imagine API image drafts, reference edits, video with synchronized audio, and localized narration without changing stacks.
Image 2.0 returns 1K drafts in roughly ten seconds on the low quality tier and up to four variants per call. Design teams scan many directions early, then re-render the winner at 2K.
Feed up to three reference images into Grok Imagine Image 2.0 Edit and describe the change in plain language. Ecommerce teams swap backgrounds, restyle packaging, and hold a single product consistent across a catalog.
xAI TTS v1 converts scripts into expressive speech across twenty languages and more than eighty voices with sub-second latency. Product teams pair it with generated video for localized ads, tutorials, and in-app narration.
Grok Imagine Video v1.5 writes synchronized music, effects, and dialogue alongside picture in clips up to fifteen seconds at 1080p. Marketers get a finished spot in one pass, with no separate audio session.
Need the same character in every shot? Reference-to-video accepts one to seven reference images plus an optional reference voice, so series creators keep identity and vocal tone steady across a fifteen-second clip.
Existing footage can be restyled through natural language editing or continued with a two to ten second extension that matches the source. Post teams fix props, wardrobe, and pacing without returning to set.
Sehen Sie, wie sich Modelle verschiedener Anbieter vergleichen — Leistung, Preise und einzigartige Stärken für eine fundierte Entscheidung.
| Modell | Limit für Referenzbilder | Anzahl der Ausgaben | Auflösung | Seitenverhältnis |
|---|---|---|---|---|
| Grok Imagine Image Quality | 8 | 1~4 | 2K, 1K | Auto, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1 |
| Nano Banana 2 | 14 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Nano Banana Pro | 10 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Seedream 5.0 Lite | 14 | 1~15 | 2K~4K+ | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Qwen-Image | 3 | 1~6 | 512P~2K | Width[512, 2048]px, Height[512, 2048]px |
In wenigen Minuten startklar — folgen Sie diesen einfachen Schritten, um Modelle über die Plattform von Atlas Cloud zu integrieren und bereitzustellen.
Registrieren Sie sich auf atlascloud.ai und schließen Sie die Verifizierung ab. Neue Nutzer erhalten kostenlose Credits zum Erkunden der Plattform und Testen von Modellen.
Die Kombination der fortschrittlichen Grok Imagine-Modelle mit der GPU-beschleunigten Plattform von Atlas Cloud bietet unübertroffene Leistung, Skalierbarkeit und Entwicklererfahrung.
Niedrige Latenz:
GPU-optimierte Inferenz für Echtzeit-Reasoning.
Einheitliche API:
Führen Sie Grok Imagine, GPT, Gemini und DeepSeek mit einer Integration aus.
Transparente Preisgestaltung:
Vorhersehbare Token-basierte Abrechnung mit serverlosen Optionen.
Entwicklererfahrung:
SDKs, Analysen, Fine-Tuning-Tools und Vorlagen.
Zuverlässigkeit:
99,99% Verfügbarkeit, RBAC und compliance-bereite Protokollierung.
Sicherheit & Compliance:
SOC 2 Type II, HIPAA-Ausrichtung, Datensouveränität in den USA.
Die Grok Imagine API ist der einheitliche Zugriffspunkt von Atlas Cloud auf den xAI Grok Imagine Generation-Stack, der Bilderstellung, Bildbearbeitung, Video und Sprachsynthese abdeckt. Ein einziger API-Key gewährt Zugriff auf alle Modi, einschließlich der am 7. August 2026 veröffentlichten Modelle Grok Imagine Image 2.0 Text-to-Image und Grok Imagine Image 2.0 Edit. Die Abrechnung erfolgt nutzungsbasiert pro erfolgreicher Generierung – Sie zahlen pro Aufruf, ohne Abonnement.
Drei Bildgenerierungsmodelle stehen nebeneinander: Grok Imagine Image für $0,02 pro Bild, Grok Imagine Image Quality für $0,05 und Grok Imagine Image 2.0 ab $0,04, jeweils mit eigenem Edit-Endpoint. Video läuft über Grok Imagine Video für $0,05 pro Sekunde und Grok Imagine Video v1.5 für $0,08 pro Sekunde, jeweils mit Extend- und Edit-Endpunkten. xAI TTS v1 rundet das Angebot mit mehr als 80 Stimmen in 20 Sprachen ab.
Image 2.0 plant Typografie und Layout wie ein Designer, sodass dichte Kompositionen und kleiner Text lesbar bleiben statt in Texturen aufzulösen. Zudem bietet es einen wählbaren Qualitätslevel, mit dem Sie Renderzeit gegen Detailgenauigkeit austauschen können – ein Feature, das die früheren Image- und Image Quality-Modelle nicht bieten. Beide Varianten, Text-to-Image und Edit, teilen dieses Verhalten.
Die Preise gelten pro erfolgreicher Generierung ohne Mindestumsatz. Grok Imagine Image 2.0 kostet $0,04 pro Bild bei niedriger Qualität und 1K, $0,06 bei niedriger Qualität mit 2K oder mittlerer Qualität mit 1K, und $0,08 bei mittlerer Qualität mit 2K, während jedes Eingabebild auf dem Edit-Endpoint zusätzliche $0,01 kostet. Für die anderen Bildmodelle liegen Grok Imagine Image bei $0,02 pro Bild und Grok Imagine Image Quality bei $0,05, und Video startet bei $0,05 pro Sekunde.
Erstellen Sie einen Atlas Cloud API-Key und senden Sie Ihre Prompt sowie eine Modell-ID wie xai/grok-imagine-image-2.0/text-to-image an den Bildgenerierungs-Endpoint. Das Rendering erfolgt asynchron, daher gibt der Aufruf eine Request-ID zurück, die Sie auf dem Prediction-Endpoint abfragen, bis der Status von processing auf completed wechselt. Da jedes Grok Imagine-Modell nach demselben Muster funktioniert, bedeutet das Hinzufügen von Video oder Sprache später lediglich das Ändern eines Strings. Fangen Sie noch heute an.
Die Ausgaben werden in 1K (1024x1024) oder 2K (2048x2048) über 14 Seitenverhältnisse gerendert, von quadratisch 1:1 und Breitbild 16:9 bis hin zu hochformatig 9:20 und ultraweit 20:9 als Banner-Formate. Ein einziger Aufruf kann bis zu vier Bilder zurückgeben, und Prompts können bis zu 8.000 Zeichen umfassen. Auf dem Edit-Endpoint ist das Seitenverhältnis auf auto eingestellt und orientiert sich am ersten Eingabebild, sofern Sie es nicht explizit festlegen.
Bis zu drei Quelldateien pro Anfrage, bereitgestellt als öffentliche URLs oder Base64-Daten-URIs. Wenn Sie mehrere angeben, referenzieren Sie diese im Prompt als <IMAGE_0>, <IMAGE_1> und <IMAGE_2>, damit das Modell weiß, auf welches Bild jede Anweisung zielt. Jedes Eingabebild kostet zusätzliche $0,01 pro Aufruf, und Sie können ein bis vier bearbeitete Varianten gleichzeitig anfordern.
Ja. Grok Imagine Video v1.5 erzeugt nativ synchronisiertes Audio im gleichen Durchgang wie das Bild, sodass Musik, Soundeffekte und Dialoge zeitgleich mit der Bewegung ankommen, ohne eine zweite Pipeline zu benötigen. Der Reference-to-Video-Modus akzeptiert eine optionale Referenzstimme zusammen mit einem bis sieben Referenzbildern. Clips dauern bis zu 15 Sekunden und erreichen 1080p bei Text-to-Video und Image-to-Video.
Wählen Sie Image 2.0, wenn das Bild Typografie, Layout oder mehrteilige Details enthält, die zusammenhängend wirken müssen, und wenn Sie direkten Einfluss auf das Verhältnis von Geschwindigkeit zu Detailgenauigkeit nehmen möchten. Grok Imagine Image Quality bleibt ein einfacher Pauschalpreis von $0,05 pro Bild mit denselben 1K- und 2K-Ausgaben sowie 14 Seitenverhältnissen. Wenn Volumen wichtiger ist als feine Textwiedergabe, bleibt das ursprüngliche Grok Imagine Image für $0,02 pro Bild die wirtschaftlichste Option.
Medium ist der Standard-Qualitätslevel und benötigt etwa 84 Sekunden bei 1K, da er die beste Ausgabe des Modells anstrebt. Die Einstellung von quality auf low reduziert dies auf rund 10 Sekunden – etwa 8x schneller – und kostet $0,04 statt $0,06 für ein 1K-Bild. Entwerfen und iterieren Sie bei niedriger Qualität, und führen Sie erst die besten Prompts bei medium und 2K erneut aus, sobald die Komposition steht.
Anleitungen, Tutorials und Produkt-Updates, mit denen Sie das Beste aus Atlas Cloud herausholen.