
Grok Imagine Video 1.5 är xAI:s videogenereringsfamilj för utvecklare som behöver styrd rörelse utifrån prompter och visuella indata. Animera en startbild med rörelseinstruktioner på naturligt språk, välj 480p eller 720p för referensarbetsflöden och lägg till en valfri referensröst som styr resultatet. Få åtkomst till stödda lägen via en enda OpenAI-kompatibel Atlas Cloud-nyckel med transparent betalning efter användning. Börja bygga idag.
Grok Imagine Video 1.5 är utvecklad av xAI. Atlas Cloud (som drivs av Atlas Cloud AI LLC) tillhandahåller åtkomst till modellen men äger den inte. Alla varumärken tillhör sina respektive ägare.
Utforska sex endpoints som omvandlar text, startbilder eller referenstillgångar till video för utvecklar- och standardarbetsflöden.
| Modalitet | Beskrivning |
|---|---|
| Grok Imagine Video 1.5 Developer Reference-to-Video API | Omvandla 1 till 7 referensbilder och en valfri referensröst till video med inbyggt synkroniserat ljud. Utdata kan vara upp till 15 sekunder lång i 480p eller 720p. Den här endpointen passar referensstyrda scener och visuella koncept som kräver flera källbilder. |
| Grok Imagine Video 1.5 Reference-to-Video API | Med vägledning av 1 till 7 referensbilder genererar den här endpointen videor med inbyggt synkroniserat ljud och kan även ta emot en valfri referensröst. Den stöder längder på upp till 15 sekunder i 480p eller 720p. Välj den för videoproduktion med flera referenser och röststyrda sekvenser. |
| Grok Imagine Video 1.5 Developer Text-to-Video API | Det räcker med en textprompt för att generera video med inbyggt synkroniserat ljud via den här utvecklarendpointen. Skapa klipp på upp till 15 sekunder i 480p, 720p eller 1080p. Den passar promptdrivna koncept, storyboards och produktion av kortformatvideo. |
| Grok Imagine Video 1.5 Text-to-Video API | Skapa video direkt från en textprompt samtidigt som synkroniserat ljud genereras inbyggt. Tillgängliga utdataalternativ är 480p, 720p och 1080p, med en maximal längd på 15 sekunder. Använd den för manusbaserade scener, kampanjkoncept eller sociala videoassets. |
| Grok Imagine Video 1.5 Developer Image-to-Video API | Med utgångspunkt i en bild tillämpar den här utvecklarendpointen rörelseinstruktioner på naturligt språk för att skapa en animerad video. Upplösningsalternativen omfattar 480p, 720p och 1080p. Den lämpar sig för att animera konstverk, produktbilder och förberedda öppningsbilder. |
| Grok Imagine Video 1.5 Image-to-Video API | Animera en startbild genom att beskriva den önskade rörelsen på naturligt språk. Den resulterande videon kan genereras i 480p, 720p eller 1080p. Det här arbetsflödet stöder rörelsestudier, visuellt berättande och bilddriven kreativ produktion. |
Grok Imagine Video 1.5 samlar arbetsflöden för text, startbild och en till sju referensbilder med inbyggt synkroniserat ljud, upp till 1080p-utdata och klipp på upp till 15 sekunder i text- eller referensläge, medan Atlas Cloud tillhandahåller ett API och transparent prissättning enligt betala-efter-användning.
Börja med en textprompt och generera klipp på upp till 15 sekunder i 480p, 720p eller 1080p. Inbyggt synkroniserat ljud levereras tillsammans med videon i samma generering. Utforma scenen och handlingen helt genom skriftliga instruktioner när ingen källbild finns. Det här arbetsflödet passar konceptfilmer, filmiska experiment och promptdrivna innehållsflöden.
En enda startbild blir en rörlig sekvens genom rörelsepromptar på naturligt språk. Välj utdata i 480p, 720p eller 1080p medan bilden etablerar den inledande kompositionen. Beskriv motivets och scenens rörelser i prompten och låt sedan modellen animera vidare från den visuella utgångspunkten. Det passar produktbilder, karaktärsögonblick och konstnärligt regisserade stillbilder som behöver rörelse.
Styr Grok Imagine Video 1.5 med en till sju referensbilder och en valfri referensröst. Referensläget producerar klipp på upp till 15 sekunder i 480p eller 720p, med inbyggt synkroniserat ljud. Använd dessa indata för att styra den genererade scenen mot en etablerad visuell riktning. Det här arbetsflödet passar kampanjer och berättelser som bygger på befintliga kreativa referenser.
Video och ljud genereras tillsammans, så varje klipp kan innehålla inbyggt synkroniserat ljud utan ett separat ljudsteg. Bygg scener kring synliga handlingar vars timing kan förstärkas av det medföljande ljudspåret. När synkronisering är viktig minskar detta kombinerade genereringsflöde överlämningen mellan visuellt skapande och ljudproduktion. Det är särskilt användbart för material med mycket framträdanden och atmosfär.
Sträck ut ett komplett visuellt moment över text- eller referensklipp på upp till 15 sekunder i stället för att stanna vid en kort loop. Den tillgängliga längden ger utrymme för anslag, rörelse och en tydlig upplösning i en enda genererad sekvens. Kombinera den tiden med varierande kameraperspektiv och kontinuerlig handling för att skapa ett mer utvecklat ögonblick. Den här längden passar bra för korta annonser, narrativa avslöjanden och scener för sociala videor.
Växla mellan generering från text, startbilder och referenser via ett enda Atlas Cloud API, med transparent prissättning enligt betala-efter-användning. Välj det arbetsflöde som passar varje tillgång i stället för att tvinga varje idé genom en enda indatatyp. Samma integration ger utvecklare tillgång till alla sex listade Grok Imagine Video v1.5-endpoints, inklusive standard- och Developer-rutter. Det förenklar experimenterande och produktionsplanering för varierande videouppgifter.
Se hur Grok Imagine Video 1.5 och två Atlas Cloud-alternativ tolkar identiska prompts inom filmisk action och stiliserad fantasy.
En 9 sekunder lång barock fantasyfilm i en enda tagning, under vattnet och inne i ett övergivet, helt översvämmat operahus: en graciös fridykare med böljande hår och en självlysande pärlmask jagar en intensivt korallröd bläckfisk som bär på en utsmyckad mässingsnyckel genom svävande sammetsgardiner. Börja inifrån ett sprucket scengolv med en dramatisk uppåtriktad grodperspektivbild när hon rullar och dyker med huvudet först genom sprickan; övergå till en tät lateral följning när hon slingrar sig mellan kullvälta teaterstolar, medan hår och dräkt reagerar naturligt på strömmarna och gardiner böljar samt bubblor stiger genom lager av valvbågar; kretsa sedan runt henne och höj kameran med en kranrörelse när vattentrycket sliter loss en kristallkrona ovanför. I klimax vrider hon sig åt sidan i sista ögonblicket för att undvika den fallande kristallkronan, vars kristaller kolliderar och sprids realistiskt, medan bläckfisken skickligt fångar den tumlande nyckeln med sina komplexa, slingrande tentakler, pausar med högtidlig ceremoni och lägger tillbaka den i hennes öppna hand. Kontinuerlig flytande rörelse, tydlig början–jakt–upplösning, konsekvent karaktär och pärlmask, fysikaliskt korrekt vattenmotstånd, flytkraft, tyg, hår, bubblor, tentakeldeformation, stötar och kollisionsundvikande. Kalla cyanblå ljusstrålar från krossade takfönster skär genom den mörka, nedsänkta salongen; korallrött är den enda starkt mättade färgen och leder blicken genom djupa lager av valvbågar, gardiner, svävande bråte och bubblor. Fotorealistisk filmisk undervattensfotografering med en subtil oljemålad textur, elegant barock storslagenhet, volymetriska kaustiska ljuseffekter, hög detaljrikedom, ingen text, inget gränssnitt, inga klipp förklädda som stillbilder. Omslutande ljud: dova undervattensmuller, strömmande vatten, prasslande tyg, bubblor, kristallina stötar och en spänd orkesterpuls som upplöses i en enda delikat harpton när nyckeln lämnas tillbaka. Bildformat 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
En absurd actionkomedireklam på 9 sekunder, förlagd till en minutiöst detaljerad frisersalong från 1950-talet i gryningen. En butter, raggig Old English Sheepdog, dränkt i ett tjockt lager vitt tvålskum, rusar genom dörren och far över salongen medan den skakar skum överallt; en förskräckt barberare hoppar upp på en snurrstol och åker efter, samtidigt som han klipper snabbt i hundens flygande päls, där varje skarpt saxknäpp är exakt synkroniserat med slagkraftiga jazztrummor. Börja med en extremt marknära följning som rusar bredvid våta tassar när de slirar över blanka svartvita schackrutiga klinkers och skickar realistiska droppar och skumstänk mot objektivet; svep kameran uppåt i en snabb cirkulär följning som använder tre stora speglar för att kontinuerligt visa och bevara hundens och barberarens skiftande positioner genom komplexa, korrekta reflektioner; utför sedan en snabb dolly-in när de sista luftburna pälsklippen tumlar, virvlar och landar perfekt på hundens huvud och formar en osannolikt hög pompadour. Hunden stannar och poserar självgott i ett heroiskt, fryst ögonblick på en sekund, men nyser sedan plötsligt med en explosiv puff av skum och hår när jazzen avslutas med ett skarpt komiskt virveltrumsslag. Varma praktiska volframljus skär genom den svala turkosa morgondimman utanför fönstren; en fyllig vintagepalett med bordeauxrött, crème, polerad mässing och mörkt trä; exklusiv live-action-reklamfilmografi, sömlös kontinuerlig koreografi i hög hastighet, konsekventa karaktärer och rumslig kontinuitet, fysikaliskt korrekt våt päls, tvålskum, löst hår, reflektioner, stolens rotation, tröghet och kollisioner, taktil fotorealistisk detaljrikedom, skarp rörelseåtergivning, ingen slow motion, inga tomma etableringsbilder, inga skärmar, inga programvarugränssnitt, inga dashboards, inga förloppsindikatorer, inga diagram, inga bildtexter, ingen förklarande text, inga logotyper, inga vattenstämplar, bildformat 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video 1.5 omvandlar promptar, källbilder och upp till sju referensbilder till korta videor med synkroniserat ljud för kampanjer, produktpresentationer, karaktärsberättelser, innehåll för sociala medier och snabb visuell prototypframtagning.
Animera en produktbild med rörelsepromptar på naturligt språk och synkroniserat ljud. Skapa korta presentationsklipp för butiker, kampanjsidor, lanseringsmaterial eller betalda placeringar i sociala medier i upp till 1080p.
Styr en scen med en till sju karaktärsreferenser och en valfri referensröst. Den här konfigurationen stöder återkommande rollbesättningar, dialogscener och korta berättande klipp med inbyggt synkroniserat ljud.
Börja med en textprompt för att generera en komplett video med inbyggt synkroniserat ljud. Marknadsföringsteam kan utforska kampanjkoncept, stämningsfilmer och lanseringsteasers utan att förbereda en källbild.
Förvandla en enda startbild till rörelse med instruktioner på naturligt språk i upp till 1080p. Skapa kortfattat kampanjmaterial för flöden, lanseringssidor, evenemangsannonser, produktuppdateringar och kreatörsdrivna inlägg.
Ge en godkänd storyboardbild liv med promptstyrda rörelser samtidigt som den behålls som startbild. Regissörer och designers kan skapa korta previz-klipp med synkroniserat ljud för granskning.
Kombinera produktvyer, karaktärsporträtt, kläddetaljer och scenreferenser från upp till sju bilder. Varumärkesteam kan styra korta reklamscener med synkroniserat ljud och samtidigt förankra varje förfrågan i tillhandahållet visuellt material.
Jämför Grok Imagine Video 1.5 med ledande referens-till-video-modeller vad gäller accepterade indata, klipplängd, upplösning, synkroniserat ljud och standardpris per sekund.
| Modell | Indatatyper | Klipplängd | Maximal upplösning | Inbyggt ljud | Standardpris |
|---|---|---|---|---|---|
| Grok Imagine Video v1.5 | Text, bild, referensbilder, röst | Upp till 15 sekunder | 1080p | √ | $0.08/sekund |
| Seedance 2.0 Reference-to-Video | Text, bild, video, ljud | 4 till 15 sekunder | 4K | √ | $0.112/sekund |
| MiniMax H3 Reference-to-Video | Text, bild, video, ljud | 4 till 15 sekunder | 2K | √ | $0.038/sekund |
| Wan-2.7 Reference-to-video | Text, bild, video, ljud | 2 till 10 sekunder | 1080p | √ | $0.10/sekund |
Get started in minutes — follow these simple steps to integrate and deploy models through Atlas Cloud’s platform.
Registrera dig på atlascloud.ai och slutför verifieringen. Nya användare får gratis krediter för att utforska plattformen och testa modeller.
Att kombinera de avancerade Grok Imagine Video 1.5-modellerna med Atlas Clouds GPU-accelererade plattform ger oöverträffad prestanda, skalbarhet och utvecklarupplevelse.
Låg Latens:
GPU-optimerad inferens för realtidsresonemang.
Enhetligt API:
Kör Grok Imagine Video 1.5, GPT, Gemini och DeepSeek med en integration.
Transparent Prissättning:
Förutsägbar fakturering per token med serverlösa alternativ.
Utvecklarupplevelse:
SDK:er, analys, finjusteringsverktyg och mallar.
Tillförlitlighet:
99.99% drifttid, RBAC och efterlevnadsredo loggning.
Säkerhet & Efterlevnad:
SOC 2 Type II, HIPAA-anpassning, datasuveränitet i USA.
Grok Imagine Video 1.5 är xAI:s modellfamilj för videogenerering, som skapar videoklipp från text, en startbild eller flera referensbilder. Genom Atlas Cloud kan utvecklare använda separata endpoints för varje genereringsläge.
Tre lägen är tillgängliga: text-to-video, image-to-video och reference-to-video. Välj text för att skapa en scen från grunden, image för att animera en startbildruta eller reference mode för att styra motiv, objekt och stil med flera bilder.
Skapa en Atlas Cloud API-nyckel och skicka en autentiserad begäran till endpointen för videogenerering med lämpligt modell-ID. Använd det returnerade uppgifts-ID:t för att kontrollera genereringsstatusen och hämta URL:en till den färdiga videon.
Text-to-video kräver en prompt på naturligt språk, medan image-to-video dessutom kräver en bild av startbildrutan. Reference-to-video tar emot en prompt och 1 till 7 referensbilder, med valfria förinställda röst-ID:n för genererad dialog.
De tillgängliga Atlas Cloud-schemana stöder klipp på 1 till 15 sekunder. Text-to-video och image-to-video erbjuder utdata i 480p, 720p eller 1080p, medan reference-to-video stöder 480p eller 720p.
Ja. Text-to-video genererar inbyggt synkroniserat ljud från prompten, och reference-to-video kan kombinera genererat ljud med en valfri förinställd röst för dialog.
Atlas Cloud anger ett standardbaspris på $0.08 för varje endpoint som omfattas av den här familjesidan. Granska det valda endpointets aktuella debiteringsuppgifter före driftsättning, eftersom den angivna prisposten inte specificerar debiteringsenheten.
Tillhandahåll mellan 1 och 7 bilder via reference-to-video-endpointen. Identifiera specifika resurser i prompten med taggar som <IMAGE_0> och <IMAGE_1>, så att modellen kan koppla varje referens till det avsedda motivet eller scenelementet.
De tillgängliga Atlas Cloud-schemana innehåller ingen särskild parameter för sista bildrutan. Image-to-video använder en bild som startbildruta, medan reference-to-video använder 1 till 7 bilder som visuell vägledning snarare än som garanterade första och sista bildrutor.
Välj reference-to-video när flera bilder behöver styra personerna, objekten eller den visuella stilen i en ny scen. Använd image-to-video när en befintlig bild ska bli den inledande bildrutan och rörelsen ska följa en prompt på naturligt språk.
Guider, handledningar och produktnyheter som hjälper dig att få ut mesta möjliga av Atlas Cloud.