
Grok Imagine Video zapewnia deweloperom dostęp do rodziny modeli wideo xAI do tworzenia, animowania, wydłużania i edytowania klipów. Generuj filmy o długości od 1 do 15 sekund na podstawie promptów, steruj postaciami, obiektami lub stylami, korzystając z maksymalnie siedmiu obrazów referencyjnych, i pracuj w rozdzielczości 480p lub 720p. Atlas Cloud udostępnia te możliwości za pośrednictwem endpointów zgodnych z OpenAI, oferując przejrzyste rozliczanie pay-as-you-go. Zacznij tworzyć już dziś.
Grok Imagine Video został opracowany przez xAI. Atlas Cloud (prowadzona przez Atlas Cloud AI LLC) zapewnia dostęp do modelu, ale nie jest jego właścicielem. Wszystkie znaki towarowe należą do ich odpowiednich właścicieli.
Wybierz endpoint Grok Imagine Video odpowiedni do posiadanych materiałów źródłowych, oczekiwanej transformacji i przepływu pracy w produkcji.
| Modalność | Opis |
|---|---|
| Grok Imagine Video T2V API (Text To Video) | Zamieniaj prompty w języku naturalnym na filmy trwające od 1 do 15 sekund w rozdzielczości 480p lub 720p. Ten endpoint sprawdza się przy wizualizacji koncepcji, krótkich materiałach do mediów społecznościowych oraz scenach tworzonych bez materiałów źródłowych. |
| Grok Imagine Video I2V API (Image To Video) | Rozpoczynając od dostarczonego obrazu, ten endpoint stosuje prompty ruchu w języku naturalnym, aby wygenerować film w rozdzielczości 480p lub 720p. Używaj go do animowania dzieł graficznych, zdjęć produktów, kadrów z postaciami lub materiałów wizualnych kampanii. |
| Grok Imagine Video R2V API (Reference To Video) | Steruj generowaniem filmu za pomocą od 1 do 7 obrazów referencyjnych przedstawiających osoby, obiekty lub style wizualne. Wyniki mogą trwać do 10 sekund w rozdzielczości 480p lub 720p, wspierając kreatywną produkcję opartą na materiałach referencyjnych. |
| Grok Imagine Video Extend API (Video Extension) | Kontynuuj istniejący plik MP4 o długości od 2 do 15 sekund, dodając sterowane promptem rozszerzenie trwające od 2 do 10 sekund. Wynik zachowuje format wejściowy i jest ograniczony do 720p, dzięki czemu ten endpoint przydaje się do wydłużania gotowych ujęć. |
| Grok Imagine Video Edit API (Video Editing) | Przekaż plik MP4 i instrukcje w języku naturalnym, aby zmodyfikować jego zawartość wizualną, zachowując długość źródłowego materiału. Wynik jest ograniczony do 8.7 sekundy, dzięki czemu endpoint nadaje się do ukierunkowanych poprawek i transformacji krótkich nagrań na podstawie promptów. |
Grok Imagine Video zamienia tekst, klatki początkowe i maksymalnie siedem materiałów referencyjnych w krótkie klipy, a następnie rozszerza lub edytuje istniejące nagrania MP4 za pośrednictwem ujednoliconego interfejsu API Atlas Cloud z rozliczeniem pay-as-you-go.
Napisz prompt w języku naturalnym i wygeneruj klip trwający od 1 do 15 sekund w rozdzielczości 480p lub 720p. Siedem proporcji obrazu, w tym 16:9, 1:1 i 9:16, pozwala dopasować każde ujęcie do docelowego płótna. Bezpośrednio w prompcie określ temat, akcję, ruch kamery i atmosferę. To elastyczny punkt wyjścia do tworzenia kluczowych momentów historii, koncepcji kampanii i materiałów wideo do mediów społecznościowych.
Przekształć dostarczony obraz klatki początkowej w film trwający od 1 do 15 sekund w rozdzielczości 480p lub 720p. Obraz wyznacza kompozycję otwierającą, a prompt dotyczący ruchu, napisany w języku naturalnym, steruje ruchem i rozwojem sceny. W razie potrzeby innego kształtu wyjściowego wybierz jedną z siedmiu proporcji obrazu. Ten przepływ pracy sprawdza się w przypadku ujęć produktowych, scen ilustrowanych i koncepcji artystycznych wymagających ruchu bez ponownego tworzenia klatki otwierającej.
Nadaj kierunek filmowi za pomocą od 1 do 7 obrazów referencyjnych przedstawiających osoby, obiekty lub style wizualne. Odwołuj się do poszczególnych materiałów wejściowych w prompcie, a następnie generuj filmy o długości do 10 sekund w rozdzielczości 480p lub 720p, korzystając z siedmiu obsługiwanych proporcji obrazu. Ponieważ materiały referencyjne kształtują scenę, ale nie służą wyłącznie jako klatka początkowa, twórcy zyskują większą kontrolę nad powtarzającymi się elementami wizualnymi. Wykorzystaj ten tryb do scen z udziałem bohaterów, narracji produktowej lub kampanii uwzględniających styl.
Kontynuuj istniejący plik MP4 o długości od 2 do 15 sekund, dodając sterowane promptem rozszerzenie trwające od 2 do 10 sekund. Grok Imagine Video rozpoczyna od ostatniej klatki i zwraca oryginalny klip wraz z nowym segmentem, zachowując rozdzielczość wejściową do 720p. Opisz prostym językiem kolejną akcję, ujawnienie lub ruch kamery. Dzięki temu nagłe zakończenia łatwiej przekształcić w kompletne elementy narracji.
Przekaż Grok Imagine Video plik MP4 oraz instrukcje w języku naturalnym, aby przekształcić nagranie z zachowaniem jego pierwotnej długości. Materiały wejściowe mogą trwać do 8,7 sekundy, a rozliczenie odbywa się na podstawie długości filmu wejściowego. Poproś o zmianę wizualną, modyfikację atmosfery lub korektę na poziomie sceny bez tworzenia klipu od zera. To rozwiązanie doskonale nadaje się do krótkich wariantów kreatywnych i kontrolowanych poprodukcyjnych udoskonaleń.
Przechodź między generowaniem tekst-na-wideo, obraz-na-wideo, generowaniem sterowanym materiałami referencyjnymi, rozszerzaniem i edycją za pośrednictwem jednego ujednoliconego interfejsu API. Wybierz endpoint odpowiadający dostępnym materiałom źródłowym i przesyłaj każde zadanie w ramach asynchronicznego przepływu predykcji. Zachowaj spójne wzorce uwierzytelniania i integracji we wszystkich przepływach pracy. Dostęp w modelu pay-as-you-go ułatwia eksperymentowanie i tworzenie powtarzalnych potoków produkcyjnych. Deweloperzy mogą budować bardziej rozbudowane narzędzia wideo przy mniejszym nakładzie integracyjnym.
Zobacz, jak Grok Imagine Video i dwie wiodące alternatywy interpretują identyczne prompty pod kątem ruchu, ciągłości, kontroli kamery, oświetlenia i wizualnego storytellingu.
8–10-sekundowy hiperrealistyczny film przygodowy na świeżym powietrzu, którego akcja rozgrywa się w szmaragdowym wąwozie tuż po gwałtownej ulewie. Kajakarz w kobaltowoniebieskim wodoodpornym kombinezonie i pomarańczowoczerwonej kamizelce ratunkowej przedziera się przez wzburzoną kipiel od pierwszej do ostatniej klatki. Rozpocznij od ujęcia trackingowego tuż nad lustrem wody, pędzącego obok kajaka, gdy pióra wiosła tną nurt, rozrzucając na obiektyw wyraźne krople; kajak wspina się na stromy grzbiet fali i zostaje wybity w powietrze. Wykonaj whip-pan do ujęcia POV z perspektywy kajakarza, gdy łódź przechyla się bokiem pod zwalonym drzewem, przebija przez półprzezroczystą kurtynę wody i z trudem omija poszarpane, mokre skały, przy czym dłonie, wiosło i kobaltowy dziób pozostają fizycznie spójne podczas rozbryzgów i chwilowego zasłonięcia. Kajakarz opiera wiosło o nurt, odbija się ciasnym nawrotem od ściany kanionu i ponownie wpada w rwący potok. W kulminacyjnym momencie przejdź do gwałtownego nurkowania drona ze szczytu klifu, szybko schodzącego w dół i okrążającego kajakarza podczas lądowania; dziób uderza z przekonującą siłą w unoszącą się drewnianą skrzynię, rozbijając ją — i wtedy, jako nagłe, żartobliwe odkrycie, ze środka wyskakuje połączony sznur idealnie nienaruszonych, kolorowych papierowych lampionów, rozwija się i ciepło kołysze na zimnej, rwącej wodzie, podczas gdy kajak pędzi dalej. Ciągły, anatomicznie poprawny ruch, realistyczna bezwładność kajaka, opór wiosła, zderzenia, turbulentna dynamika płynów, ruch tkaniny, krople, rozbryzgi na obiektywie i niezmienna tożsamość postaci po każdej przeszkodzie; bez slow motion, pustych ujęć ustanawiających, cięć do ekranów, interfejsów, pulpitów, pasków postępu, wykresów, podpisów, logo ani tekstu objaśniającego. Pochmurne, zimne cyjanowe światło dzienne, pociemniałe od deszczu szmaragdowe ściany skalne, intensywnie pomarańczowoczerwona kamizelka ratunkowa, ciepła, wielobarwna poświata lampionów, kinowe szerokoekranowe kompozycje diagonalne podkreślające prędkość, wysoki kontrast, naturalne rozmycie ruchu, immersyjna fotorealistyczna kinematografia sportów ekstremalnych. Zsynchronizowany dźwięk: ryk rwącej wody, ostre uderzenia wiosła, trzask pękającego drewna, urywany oddech, woda uderzająca o kadłub oraz jasny, perkusyjny akcent muzyczny w chwili uwolnienia lampionów. Proporcje obrazu 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
8–10-sekundowa, ciągła, kinowa sekwencja akcji na nocnym targu pod gołym niebem, na chwilę przed gwałtowną ulewą: niewidomy mistrz ramenu pewnie biegnie przez labirynt zatłoczonych stoisk z jedzeniem, nieprzerwanie rozciągając między dłońmi wstęgę srebrzystobiałego makaronu. Rozpocznij od idealnie pionowego ujęcia z lotu ptaka, a następnie szybko zanurz się z góry w neonowym labiryncie targu, gdy pierwsze ciężkie krople deszczu uderzają w zadaszenia i mokry bruk. Podążaj za fruwającą wstęgą makaronu i pędź kilka centymetrów obok niej, gdy przemyka nad żarzącymi się paleniskami węglowymi, zaskoczonymi klientami, skwierczącymi grillami i parasolami gwałtownie otwierającymi się na wietrze; zachowaj płynny ruch postaci, wiarygodną sprężystą fizykę makaronu, złożone zasłanianie pierwszym planem, rozpryskujący się deszcz, iskry i gęstą parę. Wykonaj whip-pan do szefa kuchni przeskakującego przez niską skrzynię bez zwalniania kroku, a następnie szybkie okrążenie 360 stopni wokół niego, gdy skręca ciało i z precyzyjnym pędem wypuszcza makaron do tyłu. Wstęga makaronu czysto wpada do energicznie gotującego się miedzianego garnka za jego plecami — dokładnie w chwili triumfu złośliwy pomarańczowy pręgowany kot wyskakuje spod stoiska, chwyta połowę zwisającego makaronu w pysk i ucieka, tworząc wyrazistą wizualną puentę, podczas gdy kucharz nadal biegnie, niczego nieświadomy. Neonowo-noirowy fotorealizm, cyjanowozielone i magentowe refleksy na mokrym od deszczu podłożu, ciepły, piecowy pomarańcz ognia jako rytmiczne akcenty wizualne, namacalna para i deszcz, stabilna choreografia, ostry kinowy detal, energiczne tempo w czasie rzeczywistym, bez slow motion i bez cięć zrywających ciągłość przestrzenną lub ciągłość postaci. Dźwięk: narastający grzmot, gwar targu, dudniące kroki, trzask otwieranych parasoli, skwierczący węgiel, wrząca woda, świsty makaronu zsynchronizowane z ruchami kamery, zakończone jasnym, komicznym miauknięciem kota i pluskiem w miedzianym garnku. Bez ekranów, interfejsów użytkownika, pulpitów, pasków postępu, wykresów, podpisów, napisów, logo, znaków wodnych ani tekstu objaśniającego. Proporcje obrazu 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video przekształca prompty, obrazy statyczne, materiały referencyjne i istniejące pliki MP4 w praktyczne rozwiązania do tworzenia klipów do mediów społecznościowych, wizualizacji produktów, historii marki, dłuższych sekwencji, ukierunkowanych edycji i narzędzi dla twórców.
Grok Imagine Video przekształca prompty w języku naturalnym w krótkie klipy 480p lub 720p. Używaj go do tworzenia teaserów do mediów społecznościowych, koncepcji kampanii i szybkich szkiców wizualnych bez wcześniejszego przygotowywania materiału źródłowego.
Na podstawie obrazu produktu image to video endpoint dodaje ruch sterowany promptem w rozdzielczości 480p lub 720p. Marki mogą przekształcać statyczne zdjęcia katalogowe w prezentacje produktów, materiały premierowe i wizualizacje na platformy marketplace.
Dzięki od jednego do siedmiu obrazów reference to video kieruje osoby, obiekty lub style do nowego klipu. Zespoły kreatywne mogą tworzyć historie marki, koncepcje postaci i sceny produktowe oparte na dostarczonych materiałach wizualnych.
Kontynuuj istniejący plik MP4 za pomocą rozszerzenia sterowanego promptem o długości od dwóch do dziesięciu sekund, które zachowuje rozdzielczość wejściową do 720p. Umożliwia to tworzenie dłuższych ujęć storyboardu, przejść między odcinkami i kolejnych sekwencji na podstawie zatwierdzonego materiału.
Edytuj plik MP4 za pomocą instrukcji w języku naturalnym, zachowując jego źródłową długość, przy czym wynik jest ograniczony do 8.7 sekundy. Zespoły mogą tworzyć alternatywne style wizualne, zlokalizowane warianty kampanii lub zmienione opracowania wizualne.
Twórz narzędzia wideo sterowane promptami w oparciu o pięć trybów Grok Imagine Video: generowanie, animowanie, materiały referencyjne, rozszerzanie i edycję. Deweloperzy mogą obsługiwać procesy pracy twórców w ramach jednej rodziny modeli, wybierając wyjście 480p lub 720p.
Porównaj przepływy pracy Grok Imagine Video z wybranymi alternatywami Atlas Cloud pod kątem metod wejściowych, długości klipów, maksymalnej rozdzielczości i standardowych cen.
| Model | Przepływ wejściowy | Długość klipu lub segmentu | Maksymalna rozdzielczość | Standardowa cena |
|---|---|---|---|---|
| Grok Imagine Video Text-to-Video | Prompt tekstowy | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Image-to-Video | Obraz początkowy + prompt tekstowy | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Reference-to-Video | 1–7 obrazów referencyjnych + prompt tekstowy | 1–10s | 720p | $0.05/sec |
| Grok Imagine Video Extend | MP4 o długości 2–15s + prompt tekstowy | Rozszerzenie o 2–10s | Zgodna z wejściem, do 720p | $0.07/sec |
| Grok Imagine Video Edit | MP4 + instrukcja tekstowa | Zgodna z wejściem, do 8.7s | - | $0.07/input sec |
| MiniMax H3 Text-to-Video | Prompt tekstowy | 4–15s | 2K | $0.038/sec |
| Seedance 2.0 Image-to-Video | Obraz początkowy + tekst, opcjonalnie ostatnia klatka | 4–15s | Natywne 4K | $0.112/sec |
| Vidu Q3-Mix Reference to Video | 1–4 obrazów referencyjnych + prompt tekstowy | 1–16s | 1440p SR, natywnie do 1080p | $0.125/run |
| Wan-2.7 Video-edit | Wideo źródłowe + tekst, opcjonalnie obrazy lub dźwięk | - | 1080p | $0.10/run |
Zacznij w kilka minut — wykonaj te proste kroki, aby zintegrować i wdrożyć modele za pośrednictwem platformy Atlas Cloud.
Zarejestruj się na atlascloud.ai i ukończ weryfikację. Nowi użytkownicy otrzymują bezpłatne kredyty do eksploracji platformy i testowania modeli.
Połączenie zaawansowanych modeli Grok Imagine Video z platformą GPU-akcelerowaną Atlas Cloud zapewnia niezrównaną wydajność, skalowalność i doświadczenie deweloperskie.
Niska Latencja:
Inferencja zoptymalizowana pod GPU dla rozumowania w czasie rzeczywistym.
Zunifikowane API:
Uruchamiaj Grok Imagine Video, GPT, Gemini i DeepSeek za pomocą jednej integracji.
Przejrzysta Wycena:
Przewidywalne rozliczenia za token z opcjami serverless.
Doświadczenie Dewelopera:
SDK, analityka, narzędzia dostrajania i szablony.
Niezawodność:
99,99% dostępności, RBAC i logowanie gotowe na zgodność.
Bezpieczeństwo i Zgodność:
SOC 2 Type II, zgodność z HIPAA, suwerenność danych w USA.
Grok Imagine Video to rodzina modeli xAI do generowania wideo, tworzenia, animowania, wydłużania i edytowania krótkich klipów. Atlas Cloud udostępnia osobne endpointy API do przepływów pracy związanych z tekstem, obrazem, obrazami referencyjnymi, wydłużaniem i edycją.
Grok Imagine Video może wygenerować klip na podstawie tekstu, animować obraz początkowy lub wykorzystać do siedmiu obrazów referencyjnych do wskazania osób, obiektów i stylów. Osobne endpointy mogą kontynuować istniejący klip lub edytować plik MP4 za pomocą instrukcji w języku naturalnym.
Utwórz klucz API Atlas Cloud i wyślij uwierzytelnione żądanie POST do /api/v1/model/generateVideo. Określ wymagany model ID, prompt oraz wszelkie dane wejściowe obrazu lub wideo wymagane przez daną trasę. Odpowiedź zawiera request ID, status i pola wyjściowe.
Wybierz text-to-video, gdy scena zaczyna się od promptu, albo image-to-video, gdy dostarczony obraz ma stać się klatką początkową. Reference-to-video zapewnia szersze wskazówki na podstawie wielu obrazów, natomiast extend-video i edit-video działają na istniejących plikach MP4.
Text-to-video i image-to-video obsługują klipy o długości od 1 do 15 sekund w rozdzielczości 480p lub 720p. Reference-to-video obsługuje od 1 do 10 sekund w tych samych rozdzielczościach, a typowe proporcje obrazu to 16:9, 9:16, 1:1, 4:3, 3:4, 3:2 i 2:3. Endpointy wydłużania i edycji mają własne limity danych wejściowych.
Tak. xAI opisuje natywne generowanie dźwięku jako część przepływu pracy Grok Imagine Video, dzięki czemu dźwięk i obraz mogą być tworzone jednocześnie. Opublikowane schematy Atlas Cloud dla tych tras nie udostępniają osobnego przełącznika dźwięku.
Przekaż od jednego do siedmiu publicznych adresów URL obrazów HTTPS lub URI danych base64 za pośrednictwem endpointu reference-to-video. Tagi takie jak <IMAGE_0> mogą łączyć poszczególne obrazy referencyjne z osobami, obiektami lub stylami opisanymi w promptcie. Ta trasa zwraca klipy o długości do 10 sekund w rozdzielczości 480p lub 720p.
Użyj extend-video z plikiem MP4 o długości od 2 do 15 sekund i zażądaj dodatkowych 2 do 10 sekund akcji określonej w promptcie. W przypadku ukierunkowanych zmian edit-video przyjmuje plik MP4 o długości nie większej niż 8.7 sekundy i zachowuje jego czas trwania. Oba endpointy ograniczają rozdzielczość wyjściową do 720p.
Standardowa cena Atlas Cloud wynosi $0.05 za sekundę dla text-to-video, image-to-video i reference-to-video. Extend-video i edit-video korzystają ze standardowej stawki $0.07 za sekundę. Edycja jest rozliczana na podstawie długości wejściowego wideo, ponieważ dane wyjściowe zachowują tę długość.
Najpierw potwierdź, że wybrany endpoint odpowiada typowi danych wejściowych oraz że podano każdy wymagany prompt, URL obrazu lub URL wideo. Przed ponownym wysłaniem sprawdź właściwe dla danej trasy limity długości, rozdzielczości, proporcji obrazu, liczby obrazów referencyjnych i pliku MP4. Jeśli żądanie zakończy się powodzeniem, ale scena będzie niezgodna z oczekiwaniami, przeredaguj prompt, wyraźnie opisując ruch obiektu, ruch kamery, tempo i szczegóły wizualne.
Poradniki, samouczki i nowości produktowe, dzięki którym w pełni wykorzystasz Atlas Cloud.