
Grok Imagine Video ermöglicht Entwicklern den Zugriff auf xAIs Videofamilie zum Erstellen, Animieren, Erweitern und Bearbeiten von Clips. Erstelle 1- bis 15-sekündige Videos aus Prompts, steuere Personen, Objekte oder Stile mit bis zu sieben Referenzbildern und arbeite in 480p oder 720p. Atlas Cloud bündelt diese Möglichkeiten über OpenAI-compatible Endpoints mit transparenten Pay-as-you-go-Preisen. Beginne noch heute mit der Entwicklung.
Grok Imagine Video wurde von xAI entwickelt. Atlas Cloud (betrieben von Atlas Cloud AI LLC) stellt lediglich den Zugang bereit und ist nicht Eigentümerin des Modells. Alle Marken sind Eigentum ihrer jeweiligen Inhaber.
Wählen Sie den Grok Imagine Video-Endpunkt, der zu Ihren Quell-Assets, der gewünschten Transformation und Ihrem Produktionsworkflow passt.
| Modalität | Beschreibung |
|---|---|
| Grok Imagine Video T2V API (Text To Video) | Wandeln Sie natürlichsprachliche Prompts in 1 bis 15 Sekunden lange Videos mit 480p oder 720p um. Dieser Endpunkt eignet sich für die Visualisierung von Konzepten, Social-Media-Clips und Szenen, die ohne Quellmedien erstellt werden. |
| Grok Imagine Video I2V API (Image To Video) | Ausgehend von einem bereitgestellten Bild wendet dieser Endpunkt natürlichsprachliche Bewegungs-Prompts an, um Videos mit 480p oder 720p zu erzeugen. Nutzen Sie ihn, um Illustrationen, Produktbilder, Charakter-Frames oder Kampagnenvisuals zu animieren. |
| Grok Imagine Video R2V API (Reference To Video) | Steuern Sie die Videogenerierung mit 1 bis 7 Referenzbildern, die Personen, Objekte oder visuelle Stile darstellen. Die Ausgaben können bis zu 10 Sekunden lang sein und mit 480p oder 720p erstellt werden – ideal für referenzbasierte kreative Produktionen. |
| Grok Imagine Video Extend API (Video Extension) | Setzen Sie ein vorhandenes 2 bis 15 Sekunden langes MP4 mit einer promptgesteuerten Erweiterung von 2 bis 10 Sekunden fort. Die Ausgabe entspricht dem Eingabeformat und ist auf 720p begrenzt. Dadurch eignet sich dieser Endpunkt zum Verlängern bestehender Aufnahmen. |
| Grok Imagine Video Edit API (Video Editing) | Übergeben Sie ein MP4 und natürlichsprachliche Anweisungen, um dessen visuellen Inhalt zu ändern und dabei die ursprüngliche Dauer beizubehalten. Die Ausgabe ist auf 8.7 Sekunden begrenzt und eignet sich für gezielte Überarbeitungen sowie promptbasierte Transformationen kurzer Videosequenzen. |
Grok Imagine Video verwandelt Text, Startbilder und bis zu sieben Referenzen in kurze Clips und erweitert oder bearbeitet anschließend vorhandenes MP4-Material über die einheitliche Pay-as-you-go-API von Atlas Cloud.
Verfasse einen Prompt in natürlicher Sprache und generiere einen 1 bis 15 Sekunden langen Clip in 480p oder 720p. Sieben Seitenverhältnisse, darunter 16:9, 1:1 und 9:16, sorgen dafür, dass jede Aufnahme auf die vorgesehene Fläche passt. Steuere Motiv, Handlung, Kamerabewegung und Atmosphäre direkt im Prompt. Der Workflow bietet einen flexiblen Ausgangspunkt für Story-Beats, Kampagnenkonzepte und Social-Videos.
Verwandle ein bereitgestelltes Startbild in ein 1 bis 15 Sekunden langes Video in 480p oder 720p. Das Bild legt die Anfangskomposition fest, während ein Bewegungs-Prompt in natürlicher Sprache die Bewegung und Entwicklung der Szene steuert. Wähle aus sieben Seitenverhältnissen, wenn eine andere Ausgabeform benötigt wird. Dieser Workflow eignet sich für Produktaufnahmen, illustrierte Szenen und visuell inszenierte Konzepte, die Bewegung benötigen, ohne das Startbild neu erstellen zu müssen.
Steuere ein Video mit 1 bis 7 Referenzbildern, die Personen, Objekte oder visuelle Stile darstellen. Verweise im Prompt auf einzelne Eingaben und generiere anschließend bis zu 10 Sekunden in 480p oder 720p über sieben unterstützte Seitenverhältnisse hinweg. Da die Referenzen die Szene prägen, ohne ausschließlich als Startbild zu dienen, erhalten Kreative mehr Kontrolle über wiederkehrende visuelle Elemente. Nutze diesen Workflow für charakterorientierte Szenen, produktbezogenes Storytelling oder stilbewusste Kampagnen.
Setze ein vorhandenes 2 bis 15 Sekunden langes MP4 mit einer promptgesteuerten Erweiterung von 2 bis 10 Sekunden fort. Grok Imagine Video knüpft an das letzte Bild an und liefert den ursprünglichen Clip zusammen mit dem neuen Segment zurück, wobei die Eingabeauflösung bis zu 720p beibehalten wird. Beschreibe die nächste Handlung, Enthüllung oder Kamerabewegung in einfacher Sprache. So lassen sich abrupte Enden leichter in vollständige narrative Beats verwandeln.
Übergib Grok Imagine Video ein MP4 und Anweisungen in natürlicher Sprache, um das Material zu verändern und dabei seine ursprüngliche Dauer beizubehalten. Eingaben dürfen bis zu 8.7 Sekunden lang sein; die Abrechnung richtet sich nach der Länge des Eingangsvideos. Fordere eine visuelle Änderung, einen Atmosphärenwechsel oder eine Überarbeitung auf Szenenebene an, ohne den Clip von Grund auf neu erstellen zu müssen. Der Workflow eignet sich besonders für kurze kreative Varianten und kontrollierte Verfeinerungen nach der Generierung.
Wechsle über eine einheitliche API zwischen Text-zu-Video, Bild-zu-Video, referenzgesteuerter Generierung, Erweiterung und Bearbeitung. Wähle den Endpoint, der zum verfügbaren Ausgangsmaterial passt, und übermittle jeden Auftrag über einen asynchronen Prediction-Flow. Halte Authentifizierung und Integrationsmuster über alle Workflows hinweg konsistent. Der Pay-as-you-go-Zugriff unterstützt Experimente und wiederholbare Produktions-Pipelines. Entwickler können mit weniger Integrationsaufwand umfassendere Video-Tools entwickeln.
Erlebe, wie Grok Imagine Video und zwei führende Alternativen identische Prompts in Bezug auf Bewegung, Kontinuität, Kamerasteuerung, Beleuchtung und visuelles Storytelling interpretieren.
Ein 8–10-sekündiger hyperrealistischer Outdoor-Abenteuerfilm in einer smaragdgrünen Schlucht unmittelbar nach einem sintflutartigen Regensturm. Ein Kajakfahrer in einem kobaltblauen wasserdichten Anzug und einer orange-roten Schwimmweste rast vom ersten bis zum letzten Frame durch wildes Wildwasser. Eröffne mit einer extrem niedrig über der Wasserlinie geführten Tracking-Aufnahme, die neben dem Kajak herjagt, während die Paddelblätter in die Strömung schneiden und klar definierte Gischt über die Linse spritzt; das Kajak schießt einen steilen Wellenkamm hinauf und wird in die Luft katapultiert. Führe per Whip-Pan in die Ich-Perspektive (POV) des Kajakfahrers über, während das Boot seitlich unter einem umgestürzten Baum hindurchrollt, eine durchscheinende Wasserwand durchbricht und nur knapp an zerklüfteten nassen Felsen vorbeikommt; Hände, Paddel und der kobaltblaue Bug bleiben durch Spritzer und kurzzeitige Verdeckungen hinweg physisch konsistent. Der Kajakfahrer stemmt das Paddel gegen die Strömung, stößt sich in einer engen Rebound-Wende von der Canyonwand ab und fällt zurück in den Strom. Im Höhepunkt erfolgt der Übergang zu einem Drohnensturzflug vom Klippengipfel, der schnell abwärts führt und den Kajakfahrer während der Landung umkreist; der Bug prallt überzeugend gegen eine schwimmende Holzkiste, zerbricht sie – und als überraschende, spielerische Enthüllung springt eine verbundene Schnur aus vollkommen intakten bunten Papierlaternen heraus, entfaltet sich und schaukelt warm leuchtend über das kalte, reißende Wasser, während das Kajak weiter voranstürmt. Durchgehend anatomisch korrekte Bewegungen, realistische Trägheit des Kajaks, Paddelwiderstand, Kollisionen, turbulente Flüssigkeitsdynamik, Stoffbewegungen, Tropfen, Spritzwasser auf der Linse und unveränderte Identität des Motivs nach jeder Verdeckung; keine Zeitlupe, keine leeren Establishing-Aufnahmen, keine Schnitte zu Bildschirmen, Benutzeroberflächen, Dashboards, Fortschrittsbalken, Diagrammen, Bildunterschriften, Logos oder erklärenden Texten. Bedecktes, kaltes cyanfarbenes Tageslicht, regengedunkelte smaragdgrüne Felswände, leuchtend orange-rote Schwimmweste, warmes mehrfarbiges Laternenleuchten, filmische Breitbild-Diagonal-Kompositionen zur Betonung der Geschwindigkeit, hoher Kontrast, natürliche Bewegungsunschärfe, immersive fotorealistische Action-Sport-Kinematografie. Synchronisierter Ton: tosende Stromschnellen, scharfe Paddelschläge, knackendes Holz, angestrengter Atem, Wasser, das gegen den Rumpf schlägt, und ein heller perkussiver musikalischer Akzent, wenn die Laternen freispringen. Seitenverhältnis 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Eine 8–10-sekündige filmische Sequenz mit durchgehender Action auf einem Open-Air-Nachtmarkt kurz vor einem sintflutartigen Regenguss: Ein blindfolded Ramen-Meister sprintet selbstsicher durch ein Labyrinth dicht gedrängter Essensstände und spannt dabei ununterbrochen ein Band aus silberweißen Nudeln zwischen seinen Händen. Beginne mit einer perfekt vertikalen Vogelperspektive und stürze dann schnell von oben in das neonbeleuchtete Markt-Labyrinth, während die ersten schweren Regentropfen auf Markisen und nasses Pflaster prasseln. Verfolge das fliegende Nudelband und rase zentimeterbreit neben ihm her, während es über glühende Kohlebecken, erschrockene Gäste, brutzelnde Grills und im Wind aufspringende Regenschirme peitscht; bewahre nahtlose menschliche Bewegungen, glaubwürdige elastische Nudelphysik, komplexe Verdeckungen im Vordergrund, spritzenden Regen, Funken und dichten Dampf. Führe per Whip-Pan zum Koch, der über eine niedrige Kiste springt, ohne seinen Schritt zu unterbrechen, und führe dann eine schnelle 360-Grad-Umlaufbewegung um ihn aus, während er sich dreht und die Nudeln mit präzisem Impuls nach hinten freigibt. Das Nudelband schwingt sauber in einen kräftig kochenden Kupfertopf hinter ihm – genau im Moment des Triumphs springt ein schelmischer orangefarbener Kater unter dem Stand hervor, schnappt sich die Hälfte der herabhängenden Nudeln mit dem Maul und flitzt davon, wodurch eine prägnante visuelle Pointe entsteht, während der Koch ahnungslos weiterläuft. Fotorealistischer Neon-Noir-Stil, cyan-grüne und magentafarbene Spiegelungen auf dem regennassen Boden, warmes feueroranges Glühen des Ofens als rhythmische visuelle Akzente, fühlbarer Dampf und Regen, stabile Choreografie, gestochen scharfe filmische Details, energiegeladenes Echtzeit-Tempo, keine Zeitlupe, keine Schnitte, die die räumliche oder charakterliche Kontinuität unterbrechen. Ton: aufziehender Donner, Marktgeräusche, stampfende Schritte, aufspringende Regenschirme, brutzelnde Kohle, kochendes Wasser, mit den Kamerabewegungen synchronisierte Nudelgeräusche, abschließend ein helles komödiantisches Miauen und ein Platschen im Kupfertopf. Keine Bildschirme, Benutzeroberflächen, Dashboards, Fortschrittsbalken, Diagramme, Bildunterschriften, Untertitel, Logos, Wasserzeichen oder erklärenden Texte. Seitenverhältnis 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video verwandelt Prompts, Standbilder, Referenzen und vorhandene MP4-Dateien in praktische Möglichkeiten für Social Clips, Produktvisualisierungen, Markengeschichten, längere Sequenzen, gezielte Bearbeitungen und Creator-Tools.
Grok Imagine Video wandelt natürlichsprachliche Prompts in kurze Clips mit 480p oder 720p um. Erstelle damit Social-Teaser, Kampagnenkonzepte und schnelle visuelle Entwürfe, ohne zuvor Ausgangsmaterial vorbereiten zu müssen.
Ausgehend von einem Produktbild fügt der image to video endpoint auf Prompts ausgerichtete Bewegungen mit 480p oder 720p hinzu. Marken können Katalogbilder in Produktenthüllungen, Launch-Assets und Visualisierungen für Marktplätze verwandeln.
Mit einem bis sieben Bildern führt reference to video Personen, Objekte oder Stile in einen neuen Clip. Kreativteams können Markengeschichten, Charakterkonzepte und Produktszenen entwickeln, die auf bereitgestellten Visuals basieren.
Setze ein vorhandenes MP4 mit einer zwei bis zehn Sekunden langen, promptgesteuerten Erweiterung fort, die die Eingabeauflösung bis zu 720p beibehält. So lassen sich längere Storyboard-Sequenzen, episodische Übergänge und anschließende Sequenzen aus freigegebenem Videomaterial realisieren.
Bearbeite ein MP4 mit Anweisungen in natürlicher Sprache und behalte dabei die Quelldauer bei; die Ausgabe ist auf 8.7 Sekunden begrenzt. Teams können alternative Looks, lokalisierte Kampagnenvarianten oder überarbeitete visuelle Umsetzungen erstellen.
Entwickle promptgesteuerte Videotools rund um die fünf Grok Imagine Video-Modi für Generierung, Animation, Referenzen, Erweiterung und Bearbeitung. Entwickler können Creator-Workflows aus einer einzigen Produktfamilie bereitstellen und dabei eine Ausgabe mit 480p oder 720p auswählen.
Vergleichen Sie Grok Imagine Video-Workflows mit ausgewählten Atlas Cloud-Alternativen hinsichtlich Eingabemethoden, Cliplänge, maximaler Auflösung und Standardpreisen.
| Modell | Eingabe-Workflow | Clip- oder Segmentlänge | Maximale Auflösung | Standardpreis |
|---|---|---|---|---|
| Grok Imagine Video Text-to-Video | Text-Prompt | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Image-to-Video | Startbild + Text-Prompt | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Reference-to-Video | 1–7 Referenzbilder + Text-Prompt | 1–10s | 720p | $0.05/sec |
| Grok Imagine Video Extend | 2–15s MP4 + Text-Prompt | 2–10s Verlängerung | Entspricht der Eingabe, bis zu 720p | $0.07/sec |
| Grok Imagine Video Edit | MP4 + Textanweisung | Entspricht der Eingabe, bis zu 8.7s | - | $0.07/Eingabesek. |
| MiniMax H3 Text-to-Video | Text-Prompt | 4–15s | 2K | $0.038/sec |
| Seedance 2.0 Image-to-Video | Startbild + Text, optional letztes Bild | 4–15s | Natives 4K | $0.112/sec |
| Vidu Q3-Mix Reference to Video | 1–4 Referenzbilder + Text-Prompt | 1–16s | 1440p SR, nativ bis zu 1080p | $0.125/Run |
| Wan-2.7 Video-edit | Quellvideo + Text, optionale Bilder oder Audio | - | 1080p | $0.10/Run |
In wenigen Minuten startklar — folgen Sie diesen einfachen Schritten, um Modelle über die Plattform von Atlas Cloud zu integrieren und bereitzustellen.
Registrieren Sie sich auf atlascloud.ai und schließen Sie die Verifizierung ab. Neue Nutzer erhalten kostenlose Credits zum Erkunden der Plattform und Testen von Modellen.
Die Kombination der fortschrittlichen Grok Imagine Video-Modelle mit der GPU-beschleunigten Plattform von Atlas Cloud bietet unübertroffene Leistung, Skalierbarkeit und Entwicklererfahrung.
Niedrige Latenz:
GPU-optimierte Inferenz für Echtzeit-Reasoning.
Einheitliche API:
Führen Sie Grok Imagine Video, GPT, Gemini und DeepSeek mit einer Integration aus.
Transparente Preisgestaltung:
Vorhersehbare Token-basierte Abrechnung mit serverlosen Optionen.
Entwicklererfahrung:
SDKs, Analysen, Fine-Tuning-Tools und Vorlagen.
Zuverlässigkeit:
99,99% Verfügbarkeit, RBAC und compliance-bereite Protokollierung.
Sicherheit & Compliance:
SOC 2 Type II, HIPAA-Ausrichtung, Datensouveränität in den USA.
Grok Imagine Video ist die Videogenerierungs-Modellfamilie von xAI zum Erstellen, Animieren, Erweitern und Bearbeiten kurzer Clips. Atlas Cloud stellt separate API-Endpunkte für text-, bild-, referenz-, erweiterungs- und bearbeitungsbasierte Workflows bereit.
Grok Imagine Video kann einen Clip aus Text generieren, ein Ausgangsbild animieren oder bis zu sieben Referenzbilder verwenden, um Personen, Objekte und Stile vorzugeben. Separate Endpunkte können einen bestehenden Clip fortsetzen oder eine MP4-Datei anhand natürlichsprachlicher Anweisungen bearbeiten.
Erstellen Sie einen Atlas Cloud API-Schlüssel und senden Sie eine authentifizierte POST-Anfrage an /api/v1/model/generateVideo. Geben Sie die erforderliche Modell-ID, den Prompt sowie alle für diese Route erforderlichen Bild- oder Videoeingaben an. Die Antwort enthält eine Anfrage-ID, den Status und Ausgabefelder.
Wählen Sie text-to-video, wenn die Szene mit einem Prompt beginnt, oder image-to-video, wenn ein bereitgestelltes Bild zum Ausgangsbild werden soll. reference-to-video ermöglicht eine umfassendere Steuerung durch mehrere Bilder, während extend-video und edit-video mit vorhandenen MP4-Dateien arbeiten.
text-to-video und image-to-video unterstützen Clips von 1 bis 15 Sekunden in 480p oder 720p. reference-to-video unterstützt 1 bis 10 Sekunden bei denselben Auflösungen. Zu den gängigen Seitenverhältnissen gehören 16:9, 9:16, 1:1, 4:3, 3:4, 3:2 und 2:3. Für die Erweiterungs- und Bearbeitungsrouten gelten eigene Eingabelimits.
Ja. xAI dokumentiert die native Audiogenerierung als Bestandteil des Grok Imagine-Video-Workflows, sodass Ton und Bild gemeinsam erzeugt werden können. Die veröffentlichten Schemas von Atlas Cloud für diese Routen bieten keinen separaten Audio-Schalter.
Über den Endpunkt reference-to-video können Sie zwischen einer und sieben öffentlichen HTTPS-Bild-URLs oder base64-Daten-URIs angeben. Tags wie <IMAGE_0> können einzelne Referenzen mit den im Prompt beschriebenen Personen, Objekten oder Stilen verknüpfen. Diese Route liefert Clips von bis zu 10 Sekunden in 480p oder 720p.
Verwenden Sie extend-video mit einer 2 bis 15 Sekunden langen MP4-Datei und fordern Sie zusätzliche, durch einen Prompt gesteuerte Aktionen von 2 bis 10 Sekunden an. Für gezielte Änderungen akzeptiert edit-video eine MP4-Datei mit einer Länge von höchstens 8,7 Sekunden und behält deren Dauer bei. Beide Routen begrenzen die Ausgabeauflösung auf 720p.
Der Standardpreis von Atlas Cloud beträgt $0.05 pro Sekunde für text-to-video, image-to-video und reference-to-video. Für extend-video und edit-video gilt ein Standardsatz von $0.07 pro Sekunde. Die Bearbeitung wird anhand der Dauer des Eingabevideos abgerechnet, da die Ausgabe diese Dauer beibehält.
Prüfen Sie zunächst, ob der ausgewählte Endpunkt zu Ihrem Eingabetyp passt und ob jeder erforderliche Prompt sowie jede benötigte Bild- oder Video-URL vorhanden ist. Überprüfen Sie vor dem erneuten Senden die routenspezifischen Limits für Dauer, Auflösung, Seitenverhältnis, Referenzanzahl und MP4-Dateien. Wenn die Anfrage erfolgreich ist, die Szene jedoch ungenau ausfällt, formulieren Sie den Prompt mit konkreten Angaben zu Subjektbewegung, Kamerabewegung, Timing und visuellen Details neu.
Anleitungen, Tutorials und Produkt-Updates, mit denen Sie das Beste aus Atlas Cloud herausholen.