Seedance 2.0 Mini & Fast API till världens lägsta priser — upp till 68 % rabatt på det officiella priset
Grok Imagine Video with Reference Guidance

Grok Imagine Video with Reference Guidance

Grok Imagine Video ger utvecklare tillgång till xAI:s videofamilj för att skapa, animera, förlänga och redigera klipp. Generera videor på 1 till 15 sekunder från prompter, styr personer, objekt eller stilar med upp till sju referensbilder och arbeta i 480p eller 720p. Atlas Cloud samlar dessa funktioner via OpenAI-kompatibla endpoints med transparent, användningsbaserad prissättning. Börja bygga idag.

Grok Imagine Video är utvecklad av xAI. Atlas Cloud (som drivs av Atlas Cloud AI LLC) tillhandahåller åtkomst till modellen men äger den inte. Alla varumärken tillhör sina respektive ägare.

Jämför videolägen och arbetsflöden i Grok Imagine

Välj den Grok Imagine Video-endpoint som passar dina källresurser, önskade transformation och produktionsarbetsflöde.

ModalitetBeskrivning
Grok Imagine Video T2V API (Text To Video)Omvandla promptar på naturligt språk till videor på 1–15 sekunder i 480p eller 720p. Den här endpointen passar för konceptvisualisering, klipp för sociala medier och scener som skapas utan källmedia.
Grok Imagine Video I2V API (Image To Video)Utgå från en angiven bild och använd promptar på naturligt språk för att skapa rörelse i en video i 480p eller 720p. Använd den för att animera illustrationer, produktbilder, karaktärsbildrutor eller kampanjmaterial.
Grok Imagine Video R2V API (Reference To Video)Styr videogenereringen med 1–7 referensbilder som föreställer personer, objekt eller visuella stilar. Resultatet kan vara upp till 10 sekunder långt i 480p eller 720p, vilket möjliggör kreativ produktion baserad på referenser.
Grok Imagine Video Extend API (Video Extension)Fortsätt en befintlig MP4 på 2–15 sekunder med en promptstyrd förlängning på 2–10 sekunder. Resultatet matchar indatans format och är begränsat till 720p, vilket gör endpointen användbar för att förlänga etablerade bildsekvenser.
Grok Imagine Video Edit API (Video Editing)Tillhandahåll en MP4-fil och instruktioner på naturligt språk för att ändra det visuella innehållet samtidigt som källans längd behålls. Resultatet är begränsat till 8.7 sekunder, vilket passar riktade korrigeringar och promptbaserade transformationer av kort videomaterial.

Grok Imagine Video i fem kreativa arbetsflöden

Grok Imagine Video omvandlar text, startbilder och upp till sju referenser till korta klipp och förlänger eller redigerar sedan befintligt MP4-material via Atlas Clouds enhetliga API med betalning efter användning.

Grok Imagine Video från text

Skriv en prompt på naturligt språk och generera ett klipp på 1 till 15 sekunder i 480p eller 720p. Sju bildförhållanden, inklusive 16:9, 1:1 och 9:16, gör att varje bildruta kan anpassas till det avsedda formatet. Styr motiv, handling, kamerarörelse och stämning direkt i prompten. Det är en flexibel utgångspunkt för berättelsemoment, kampanjkoncept och sociala videor.

Animera en startbild

Omvandla en angiven startbild till en video på 1 till 15 sekunder i 480p eller 720p. Bilden definierar den inledande kompositionen, medan en rörelseprompt på naturligt språk styr rörelsen och scenens utveckling. Välj mellan sju bildförhållanden när ett annat utdataformat behövs. Det här arbetsflödet passar produktbilder, illustrerade scener och konstnärligt styrda koncept som behöver rörelse utan att öppningsbilden måste byggas om.

Referensstyrning i Grok Imagine Video

Styr en video med 1 till 7 referensbilder som representerar personer, objekt eller visuella stilar. Hänvisa till enskilda indata i prompten och generera sedan upp till 10 sekunder i 480p eller 720p med sju stödda bildförhållanden. Eftersom referenserna formar scenen utan att enbart fungera som en startbild får kreatörer större kontroll över återkommande visuella element. Använd det för karaktärsdrivna scener, produktberättande eller stilmedvetna kampanjer.

Förläng berättelsen

Fortsätt en befintlig MP4 på 2 till 15 sekunder med en promptstyrd förlängning på 2 till 10 sekunder. Grok Imagine Video fortsätter från den sista bildrutan och returnerar originalklippet tillsammans med det nya segmentet, med samma upplösning som indatan upp till 720p. Beskriv nästa handling, avslöjande eller kamerarörelse med vanligt språk. Det gör det enklare att omvandla abrupta slut till kompletta berättelsemoment.

Redigera klipp med Grok Imagine Video

Ge Grok Imagine Video en MP4-fil och instruktioner på naturligt språk för att förändra videomaterialet samtidigt som källans längd bevaras. Indata kan vara upp till 8.7 sekunder lång, och debiteringen baseras på indatavideons längd. Be om en visuell förändring, en stämningsförskjutning eller en ändring på scen-nivå utan att bygga om klippet från grunden. Det passar väl för korta kreativa variationer och kontrollerade finjusteringar efter generering.

Fem arbetsflöden, ett API

Växla mellan text-till-video, bild-till-video, referensstyrd generering, förlängning och redigering via ett enhetligt API. Välj det endpoint som motsvarar det tillgängliga källmaterialet och skicka varje jobb genom ett asynkront prediktionsflöde. Använd konsekventa mönster för autentisering och integration genom hela arbetsflödet. Åtkomst med betalning efter användning stödjer experiment och repeterbara produktionspipelines. Utvecklare kan bygga mer omfattande videoverktyg med mindre integrationsarbete.

En prompt, tre visioner: en jämförelse av Grok Imagine Video

Se hur Grok Imagine Video och två ledande alternativ tolkar identiska promptar genom rörelse, kontinuitet, kamerakontroll, ljussättning och visuellt berättande.

Prompt

En 8–10 sekunder lång hyperrealistisk äventyrsfilm utomhus, inspelad i en smaragdgrön ravin direkt efter ett skyfall. En kajakpaddlare i koboltblå vattentät dräkt och orange-röd flytväst forsar genom våldsamt vitt vatten från första till sista bildrutan. Inled med en extremt låg trackingbild längs vattenlinjen som rusar bredvid kajaken medan paddelbladen skär ner i strömmen och kastar skarpa stänk över linsen; kajaken skjuter upp över en brant vågkam och slungas upp i luften. Gör en whip-pan över till kajakpaddlarens förstapersonsperspektiv när båten rullar sidledes under ett nedfallet träd, bryter igenom en genomskinlig vattenridå och med knapp marginal passerar taggiga, våta klippor, samtidigt som händerna, paddeln och den koboltblå fören förblir fysiskt konsekventa genom stänk och tillfälliga skymningar. Kajakpaddlaren sätter paddeln mot strömmen, skär loss från ravinväggen i en tät returvändning och faller tillbaka ner i forsen. Vid klimax övergår scenen till ett drönarstup från klippkrönet, med en snabb nedstigning och en omloppsrörelse runt kajakpaddlaren under landningen; fören träffar en flytande trälåda med övertygande kraft och slår sönder den – och, som en plötslig lekfull överraskning, skjuter ett sammanhängande snöre av perfekt intakta färgglada papperslyktor ut, vecklar ut sig och guppar varmt över det kalla strömmande vattnet medan kajaken fortsätter framåt. Kontinuerlig anatomiskt korrekt rörelse, realistisk kajakinerti, paddelmotstånd, kollisioner, turbulent vätskedynamik, tygens rörelser, vattendroppar, stänk på linsen och oföränderlig motividentitet efter varje hinder; ingen slow motion, inga tomma etableringsbilder, inga klipp till skärmar, gränssnitt, instrumentpaneler, förloppsindikatorer, diagram, bildtexter, logotyper eller förklarande text. Mulet kallt cyanblått dagsljus, smaragdgröna regnmörka klippväggar, livfull orange-röd flytväst, varm flerfärgad lyktglöd, filmiska diagonala widescreen-kompositioner som framhäver hastighet, hög kontrast, naturlig rörelseoskärpa och uppslukande fotorealistisk action-sportskinematografi. Synkroniserat ljud: dånande forsar, skarpa paddelträffar, trä som knäcks, ansträngd andning, vatten som slår mot skrovet och en klar perkussiv musikalisk accent när lyktorna bryter sig loss. Bildförhållande 16:9.

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Seedance 2.5 Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

Prompt

En 8–10 sekunder lång kontinuerlig actionsekvens i en utomhusbaserad nattmarknad, ögonblick före ett skyfall: en ögonbindelförsedd ramennästare springer självsäkert genom en labyrint av fullpackade matstånd medan han oavbrutet sträcker ett band av silvervita nudlar mellan händerna. Börja med en perfekt vertikal fågelperspektivbild och störta sedan snabbt från ovan ner i den neonupplysta marknadslabyrinten när de första tunga regndropparna träffar markiser och våt gatubeläggning. Lås fast vid det flygande nudelbandet och rusa bara några centimeter bredvid det när det piskar över glödande kolgrillar, förskräckta matgäster, fräsande grillar och paraplyer som slår upp i vinden; bevara sömlös mänsklig rörelse, trovärdig elastisk nudelfysik, komplex förgrundsskymning, stänkande regn, gnistor och tät ånga. Gör en whip-pan till kocken när han hoppar över en låg låda utan att bryta steget och utför sedan en snabb 360-graders omloppsrörelse runt honom när han vrider sig och släpper nudlarna bakåt med exakt rörelsemängd. Nudelbandet bågar rent ner i en kraftigt kokande koppargryta bakom honom – i triumfens exakta ögonblick hoppar en lurig orange tabbykatt fram under ståndet, hugger tag i hälften av de hängande nudlarna med munnen och rusar iväg, vilket skapar en skarp visuell poäng medan kocken fortsätter springa ovetande. Neon-noir-fotorealism, cyan-gröna och magentafärgade reflektioner över regnvåt mark, varmt ugnsorange eldljus som rytmiska visuella accenter, taktil ånga och regn, stabil koreografi, skarpa filmiska detaljer, energiskt tempo i realtid, ingen slow motion och inga klipp som bryter den rumsliga kontinuiteten eller karaktärskontinuiteten. Ljud: tilltagande åska, marknadssorl, dundrande fotsteg, paraplyer som slår upp, fräsande kol, kokande vatten och nudlar som susar synkroniserat med kamerarörelserna, med avslutning i ett klart komiskt katthämt och ett plask i koppargrytan. Inga skärmar, användargränssnitt, instrumentpaneler, förloppsindikatorer, diagram, bildtexter, undertexter, logotyper, vattenstämplar eller förklarande text. Bildförhållande 16:9.

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Seedance 2.5 Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

Grok Imagine Video genom alla kreativa faser

Grok Imagine Video omvandlar prompter, stillbilder, referenser och befintliga MP4-filer till praktiska möjligheter för sociala klipp, produktbilder, varumärkesberättelser, längre sekvenser, riktade redigeringar och verktyg för kreatörer.

Sociala klipp med Grok Imagine Video

Grok Imagine Video omvandlar prompter på naturligt språk till korta klipp i 480p eller 720p. Använd det för att skapa teasers för sociala medier, kampanjkoncept och snabba visuella utkast utan att förbereda källmaterial i förväg.

Animera produktbilder

Utifrån en produktbild lägger image to video endpoint till promptstyrd rörelse i 480p eller 720p. Varumärken kan omvandla katalogbilder till produktpresentationer, lanseringsmaterial och bilder för marknadsplatser.

Referensstyrda varumärkesberättelser

Med en till sju bilder kan reference to video styra personer, objekt eller stilar in i ett nytt klipp. Kreativa team kan utveckla varumärkesberättelser, karaktärskoncept och produktscener med utgångspunkt i angivna bilder.

Berättelseutökningar med Grok Imagine Video

Fortsätt en befintlig MP4 med en promptstyrd förlängning på två till tio sekunder som behåller indatans upplösning upp till 720p. Detta stöder längre storyboardsekvenser, episodiska övergångar och fortsatta sekvenser från godkänt filmmaterial.

Videoredigering med naturligt språk

Redigera en MP4 med instruktioner på naturligt språk samtidigt som källans längd behålls, med utdata begränsad till 8.7 sekunder. Team kan skapa alternativa uttryck, lokaliserade kampanjvarianter eller reviderade visuella bearbetningar.

Bygg med Grok Imagine Video

Skapa promptstyrda videoverktyg kring de fem Grok Imagine Video-lägena för generering, animering, referenser, förlängning och redigering. Utvecklare kan stödja kreatörers arbetsflöden med en enda produktfamilj och samtidigt välja utdata i 480p eller 720p.

Var Grok Imagine Video står bland videomodeller

Jämför arbetsflöden för Grok Imagine Video med utvalda Atlas Cloud-alternativ utifrån inmatningsmetod, klipplängd, maximal upplösning och standardpris.

ModellInmatningsarbetsflödeKlipplängd eller segmentlängdMaximal upplösningStandardpris
Grok Imagine Video Text-to-VideoTextprompt1–15 s720p$0.05/sek
Grok Imagine Video Image-to-VideoStartbild + textprompt1–15 s720p$0.05/sek
Grok Imagine Video Reference-to-Video1–7 referensbilder + textprompt1–10 s720p$0.05/sek
Grok Imagine Video Extend2–15 s MP4 + textprompt2–10 s förlängningSamma som indata, upp till 720p$0.07/sek
Grok Imagine Video EditMP4 + textinstruktionSamma som indata, upp till 8.7 s-$0.07/indatasek
MiniMax H3 Text-to-VideoTextprompt4–15 s2K$0.038/sek
Seedance 2.0 Image-to-VideoStartbild + text, valfri sista bildruta4–15 sNative 4K$0.112/sek
Vidu Q3-Mix Reference to Video1–4 referensbilder + textprompt1–16 s1440p SR, native upp till 1080p$0.125/körning
Wan-2.7 Video-editKällvideo + text, valfria bilder eller ljud-1080p$0.10/körning

Hur man använder Grok Imagine Video på Atlas Cloud

Get started in minutes — follow these simple steps to integrate and deploy models through Atlas Cloud’s platform.

Skapa ett Atlas Cloud-konto

Registrera dig på atlascloud.ai och slutför verifieringen. Nya användare får gratis krediter för att utforska plattformen och testa modeller.

Varför Använda Grok Imagine Video på Atlas Cloud

Att kombinera de avancerade Grok Imagine Video-modellerna med Atlas Clouds GPU-accelererade plattform ger oöverträffad prestanda, skalbarhet och utvecklarupplevelse.

Prestanda & flexibilitet

Låg Latens:
GPU-optimerad inferens för realtidsresonemang.

Enhetligt API:
Kör Grok Imagine Video, GPT, Gemini och DeepSeek med en integration.

Transparent Prissättning:
Förutsägbar fakturering per token med serverlösa alternativ.

Företag & Skala

Utvecklarupplevelse:
SDK:er, analys, finjusteringsverktyg och mallar.

Tillförlitlighet:
99.99% drifttid, RBAC och efterlevnadsredo loggning.

Säkerhet & Efterlevnad:
SOC 2 Type II, HIPAA-anpassning, datasuveränitet i USA.

Frågor om Grok Imagine Video – besvarade

Grok Imagine Video är xAI:s familj av videogenereringsmodeller för att skapa, animera, förlänga och redigera korta klipp. Atlas Cloud tillhandahåller separata API-endpoints för text-, bild-, referens-, förlängnings- och redigeringsarbetsflöden.

Grok Imagine Video kan generera ett klipp från text, animera en startbild eller använda upp till sju referensbilder för att styra personer, objekt och stilar. Separata endpoints kan fortsätta på ett befintligt klipp eller redigera en MP4-fil med instruktioner på naturligt språk.

Skapa en Atlas Cloud API-nyckel och skicka en autentiserad POST-begäran till /api/v1/model/generateVideo. Ange det obligatoriska modell-ID:t, prompten samt eventuell bild- eller videoindata som krävs av den aktuella routen. Svaret innehåller ett request-ID, status och utdatafält.

Välj text-till-video när scenen börjar med en prompt, eller bild-till-video när en angiven bild ska bli startbilden. Referens-till-video ger bredare vägledning från flera bilder, medan extend-video och edit-video arbetar med befintliga MP4-filer.

Text-till-video och bild-till-video stöder klipp på 1 till 15 sekunder i 480p eller 720p. Referens-till-video stöder 1 till 10 sekunder i samma upplösningar, medan vanliga bildförhållanden omfattar 16:9, 9:16, 1:1, 4:3, 3:4, 3:2 och 2:3. Förlängnings- och redigeringsroutar har egna begränsningar för indata.

Ja. xAI beskriver inbyggd ljudgenerering som en del av Grok Imagine-videoarbetsflödet, vilket gör att ljud och bild kan produceras samtidigt. Atlas Clouds publicerade scheman för dessa routar exponerar ingen separat ljudparameter.

Ange mellan en och sju offentliga HTTPS-bild-URL:er eller base64-data-URI:er via endpointen referens-till-video. Taggar som <IMAGE_0> kan koppla enskilda referenser till personer, objekt eller stilar som beskrivs i prompten. Den här routen returnerar klipp på upp till 10 sekunder i 480p eller 720p.

Använd extend-video med en MP4 på 2 till 15 sekunder och begär ytterligare 2 till 10 sekunder med promptstyrd handling. För riktade ändringar accepterar edit-video en MP4-fil på högst 8.7 sekunder och bevarar dess längd. Båda routarna begränsar utdataupplösningen till 720p.

Atlas Clouds standardprissättning är $0.05 per sekund för text-till-video, bild-till-video och referens-till-video. Extend-video och edit-video använder en standardkostnad på $0.07 per sekund. Redigering debiteras baserat på indatavideons längd eftersom utdata behåller samma längd.

Kontrollera först att den valda endpointen matchar din indatatyp och att alla obligatoriska promptar, bild-URL:er eller video-URL:er finns med. Kontrollera routens specifika begränsningar för längd, upplösning, bildförhållande, antal referenser och MP4-filer innan du skickar begäran igen. Om begäran lyckas men scenen blir felaktig bör du skriva om prompten med tydliga beskrivningar av motivets rörelser, kamerarörelser, tempo och visuella detaljer.

Utforska Fler Familjer

Seedance 2.5

Seedance 2.5 API är nu tillgängligt på Atlas Cloud! Det ger utvecklare ByteDances nyaste videomodell. Den genererar upp till 30 sekunder inbyggd video i en enda körning från text, en enskild bild eller upp till 50 multimodala referenser, med synkroniserat ljud och flerspråkig text i bildrutan. På Atlas Cloud når du den genom en enda nyckel, med motivkonsekvens och förbättrad fysik som håller långa tagningar sammanhängande.

Visa Familj

Wan 3.0

Wan 3.0 API är nästa generation av Alibabas Wan-videofamilj, byggd för att ta långformatsgenerering, multireferenskontroll och audiovisuell kvalitet till nya höjder. Atlas Cloud är redan värd för Wan 2.7, 2.6 och 2.5, och Wan 3.0 körs på samma enhetliga nyckel utan separat konfiguration. Börja bygga idag. Rulla ner till uppvisningen för att se vad Wan 3.0 kan skapa.

Visa Familj

MiniMax H3

MiniMax H3 är MiniMax multimodala videofamilj för att skapa med text, bilder och referenser. Via de rutter som stöds bevarar den motiv från referensmedia, erbjuder flexibla bildformat och kombinerar genererat ljud med bild genom H3 Developer, med utdataprofiler som väljs per endpoint. Atlas Cloud samlar hela familjen bakom en enda OpenAI-kompatibel nyckel, med transparent användningsbaserad prissättning från standardpriset $0.038 per sekund. Börja bygga redan idag.

Visa Familj

Seedream 5.0 Pro

Seedream 5.0 Pro API ger utvecklare ByteDances kontrollerbara bildredigeringsmodell på Atlas Cloud. Den placerar redigeringar exakt med ankare och koordinater, separerar bilder i redigerbara lager, slår samman flera referenser och matchar exakta färger och material, med flerspråkig text i 2K och 3K. På Atlas Cloud når du den via en enda nyckel!

Visa Familj

Seedance 2.0

Seedance 2.0 är ByteDance:s produktionsmodell för video och möjliggör exakt skapande av videoklipp. Omvandla prompts till video, animera en bild för första bildrutan med valfri vägledning från sista bildrutan eller forma resultaten med referensmedia och valfri webbsökning. Atlas Cloud samlar dessa arbetsflöden i ett enhetligt API med transparent prissättning enligt användning och en OpenAI-kompatibel nyckel. Börja bygga idag.

Visa Familj

GPT Image 2.5

gpt-image-2.5-familjen från OpenAI ger utvecklare möjlighet att välja mellan Flare och Sunburst för produktionsarbetsflöden för bilder. Rendera med valfria upplösningar upp till 3840x2160 och välj mellan fem kvalitetsnivåer, däribland xhigh och max, för att uppfylla specifika krav på utdata. Atlas Cloud erbjuder färdig REST-inferens utan cold starts och med standardpriser från $0.004 per generering. Börja bygga idag.

Visa Familj

GPT Image 2

GPT Image 2 API ger utvecklare tillgång till OpenAI:s senaste bildmodell, uppföljaren till GPT Image 1.5. Den genererar och redigerar bilder med exakt textåtergivning i latinska och CJK-tecken, plus en stark komposition för affischer, mockups och infografik. På Atlas Cloud når du den via ett enhetligt API tillsammans med över 300 modeller, med gratis krediter, 99,99 % upptid och utan krav på OpenAI-organisationsverifiering.

Visa Familj

Gemini Omni Flash

gemini omni API ger utvecklare tillgång till Google DeepMinds nativt multimodala Gemini Omni Flash-familj, inklusive Gemini Omni 1.1 Flash. Skapa filmiska videor med synkroniserat inbyggt ljud, animera stillbilder med exakt kontroll över start- och slutbild eller redigera befintligt videomaterial med textstyrda ändringar som bevarar innehåll som inte berörs. Atlas Cloud erbjuder en OpenAI-kompatibel nyckel, samlad åtkomst och transparent prissättning med betalning efter användning. Börja bygga redan i dag.

Visa Familj

Grok Imagine

Grok Imagine API täcker xAI:s bild-, video- och talmodeller – från Image 2.0 till Video 1.5 och xAI TTS v1. Rendera 1K eller 2K stillbilder över 14 bildformat, skapa upp till 15 sekunders 1080p-video, styr resultatet med upp till 7 referensbilder, eller lägg till röst på 20 språk. Atlas Cloud kör alla lägen på en enda slutpunkt, prissatt per användning från $0.02 per bild och $0.05 per sekund. Börja bygga idag.

Visa Familj

Google

Googles mest kraftfulla kreativa modeller är alla tillgängliga på Atlas Cloud. Veo 3.1 levererar filmisk videogenerering, Nano Banana 2 driver skapandet av högupplösta bilder, och Gemini tillför multimodal intelligens till varje arbetsflöde. Få tillgång till hela Googles modellsvit via en enda API key med Day-0-tillgänglighet och pay-as-you-go-prissättning.

Visa Familj

Seedance 2.0 Mini

Seedance 2.0 Mini tar ByteDances multimodala videogenerering till arbetsflöden där hastighet och kostnad är avgörande. Det levererar kärnfunktionerna i Seedance 2.0 med ett lättare fotavtryck – snabbare generering, lägre kostnad per video och samma API-integration som du redan använder. För team som kör pipelines med hög volym eller gör prototyper i stor skala är Mini den praktiska standarden.

Visa Familj

ByteDance

Från filmisk videogenerering till skapande av högupplösta bilder, ByteDances kraftfullaste modeller är live på Atlas Cloud. Kör Seedance och Seedream i stor skala med de lägsta inferenspriserna och noll infrastrukturkostnader.

Visa Familj

Ett API för all media-AI.

Utforska alla modeller