



Grok Imagine API obejmuje modele obrazu, wideo i mowy xAI, od Image 2.0 do Video 1.5 i xAI TTS v1. Renderuj statyczne obrazy w rozdzielczości 1K lub 2K w 14 proporcjach, przesuń scenę do 15 sekund ruchu w 1080p, steruj zdjęciami za pomocą do 7 obrazów referencyjnych lub narruj je w 20 językach. Atlas Cloud uruchamia każdy tryb na jednym endpoincie, wyceniony na zasadzie płatności za użycie od $0.02 za obraz i $0.05 za sekundę. Zacznij budować dzisiaj.
Grok Imagine został opracowany przez xAI. Atlas Cloud (prowadzona przez Atlas Cloud AI LLC) zapewnia dostęp do modelu, ale nie jest jego właścicielem. Wszystkie znaki towarowe należą do ich odpowiednich właścicieli.
Atlas Cloud zapewnia najnowsze, wiodące w branży modele kreatywne.
Dopasuj odpowiedni model Grok Imagine API do typu wejścia, długości wyjścia, rozdzielczości i ceny za wywołanie.
| Modalność | Opis |
|---|---|
| Grok Imagine Image 2.0 T2I API (Text to Image) | Napisz prompt o maksymalnie 8000 znaków, a ten punkt końcowy zwraca od jednego do czterech obrazów w rozdzielczości 1K lub 2K. Niski lub średni poziom jakości pozwala zoptymalizować nakład renderowania względem czasu odpowiedzi, z ceną $0.04 za obraz. Nadaje się do eksploracji koncepcji, kreatywnych materiałów do mediów społecznych i zbiorczej produkcji materiałów wizualnych, gdzie liczy się wolumen. |
| Grok Imagine Image 2.0 Edit API (Image to Image) | Przesłij do punktu końcowego nawet trzy obrazy referencyjne z instrukcją w języku naturalnym, a wyniki edycji powracają w rozdzielczości 1K lub 2K w wybranym formacie proporcji lub automatycznie. Obowiązują te same poziomy jakości (niski i średni), a każdy obraz kosztuje $0.04. Przestyling produktu, zamiany tła i szybkie warianty projektowe można realizować za pomocą jednego wywołania. |
| Grok Imagine Image Quality T2I API (Text to Image) | Gdy szczegóły mają znaczenie, ten punkt końcowy zamienia prompty tekstowe na wypolerowane obrazy w rozdzielczości 1K lub 2K i zwraca do czterech wariantów na żądanie za $0.05 za obraz. Proporcje obejmują formaty kwadratowy, portretowy, krajobrazowy i ultraszeroki. Sięgnij po niego w przypadku obrazów heroicznych, materiałów reklamowych i renderów produktów klasy premium. |
| Grok Imagine Image Quality Edit API (Image to Image) | Dostarczaj od jednego do ośmiu obrazów źródłowych z instrukcją edycji i otrzymuj zmienione wersje w rozdzielczości 1K lub 2K za $0.05 za obraz. Odwołania do wielu obrazów są adresowane w linii jako <IMAGE_0> i <IMAGE_1>, dzięki czemu tematy i style mogą być łączone w jednej instrukcji. Odświeżenia kampanii, transfery stylów i edycje złożone to typowe zastosowania. |
| Grok Imagine Image T2I API (Text to Image) | Oryginalny punkt końcowy tekstu na obraz utrzymuje wyjście 1K i 2K oraz przetwarzanie czterech obrazów zbiorczo po najniższej cenie w rodzinie — $0.02 za obraz. To czyni go praktycznym domyślnym rozwiązaniem dla potoków o dużej przepustowości, generowania miniatur i szybkiego testowania promptów. |
| Grok Imagine Image Edit API (Image to Image) | Potrzebujesz lekkich edycji na dużą skalę? Ten punkt końcowy akceptuje od jednego do ośmiu obrazów z instrukcją tekstową i zwraca do czterech wyedytowanych wyników w rozdzielczości 1K lub 2K za $0.02 za obraz. Czyszczenie katalogów, warianty sezonowe i iteracyjne przejścia projektowe pozostają niedrogi. |
| Grok Imagine Video v1.5 T2V API (Text to Video) | Samodzielny prompt generuje od jednej do piętnastu sekund wideo z natywnym zsynchronizowanym dźwiękiem w rozdzielczości 480p, 720p lub 1080p, w siedmiu proporcjach. Rozliczenie wynosi $0.08 za sekundę wyjścia. Zwiastuny, spoty społeczne i sceny narracyjne wymagające wbudowanego dźwięku są do tego idealne. |
| Grok Imagine Video v1.5 I2V API (Image to Video) | Dostarczaj klatkę startową i prompt ruchu, a v1.5 animuje ją na okres do piętnastu sekund w rozdzielczościach osiągających 1080p z dźwiękiem generowanym w tym samym przebiegu. Koszt wynosi $0.08 za sekundę. Obroty produktów, animacja portretów i zasoby kampanii ze zdjęcia do ruchu pasują tutaj. |
| Grok Imagine Video v1.5 R2V API (Reference to Video) | Od jednego do siedmiu obrazów referencyjnych prowadzą postacie, obiekty i styl na ekranie, podczas gdy do trzech głosów wybranych spośród 26 ustawień predefiniowanych generuje mówioną zawartość audio. Wyjście osiąga piętnaście sekund w rozdzielczości 480p lub 720p za $0.08 za sekundę. Spójne opowiadanie z postaciami, wirtualne przymierzanie i brandowe maskotki mają z tego największe korzyści. |
| Grok Imagine Video T2V API (Text to Video) | Prompty tekstowe stają się klipami od jednej do piętnastu sekund w rozdzielczości 480p lub 720p, siedmioma proporcjami obejmującymi dostarczanie w formacie krajobrazowym, kwadratowym i pionowym. Za $0.05 za sekundę jest to opcja wartościowa dla treści społecznych i szybkich tablic koncepcyjnych. |
| Grok Imagine Video I2V API (Image to Video) | Zakotwicz zdjęcie jako pierwszą klatkę, opisz pożądany ruch, a klip rozciąga się na piętnaście sekund w rozdzielczości 480p lub 720p. Cena utrzymuje się na poziomie $0.05 za sekundę, co utrzymuje zbiorczą animację zdjęć produktów i portretów na przystępnym poziomie. |
| Grok Imagine Video R2V API (Reference to Video) | Od jednego do siedmiu obrazów referencyjnych określa, kto i co pojawia się na ekranie bez ustalania ustalonej klatki otwierającej. Klipy trwają do dziesięciu sekund w rozdzielczości 480p lub 720p i kosztują $0.05 za sekundę. Używaj go, gdy tożsamość i styl muszą pozostać spójne od ujęcia do ujęcia. |
| Grok Imagine Video Extend API (Video Extension) | Istniejące mp4 o długości od dwóch do piętnastu sekund można kontynuować przez kolejne dwie do dziesięciu sekund, kierując się promptem, który określa, co dzieje się dalej. Wyjście odpowiada wideo źródłowemu i jest ograniczone do 720p, rozliczane za $0.07 za sekundę. To jest przydatne do rozciągnięcia krótkiego klipu do wymaganej długości reklamy. |
| Grok Imagine Video Edit API (Video to Video) | Instrukcje w języku naturalnym przepisują istniejące mp4, zachowując oryginalną scenę, ruch i kadrowanie. Wyjście zachowuje czas trwania źródła, ograniczone do 8,7 sekund, a rozliczenie oparte jest na wideo wejściowym za $0.07 za sekundę. Dodanie rekwizytów, zmiany garderoby i przestyling odbywają się bez ponownego kręcenia. |
| xAI TTS v1 API (Text to Speech) | Do 15 000 znaków tekstu staje się naturalną mową z opóźnieniem poniżej sekundy w 20 językach, z dostępnym automatycznym wykrywaniem języka. Dostarczanie można dostroić: prędkość odtwarzania od 0,7x do 1,5x, kodeki zawierające mp3, wav i pcm, oraz szybkości próbkowania do 48 kHz. Lekcje głosowe, prompty IVR i narracja w aplikacji to naturalne zastosowania. |
Odkryj możliwości, jakie oferuje Grok Imagine API, od generowania obrazów w rozdzielczości 2K z wielojęzycznym tekstem po multimodalne wideo z natywnym zsynchronizowanym dźwiękiem i trybami kreatywnymi.

Grok Imagine Image Quality API zapewnia generowanie obrazów w rozdzielczości do 2K z niezwykle ostrymi szczegółami w każdym wyjściu. Zachowując delikatne tekstury i skomplikowaną kompozycję w dużej skali, użytkownicy mogą tworzyć materiały wizualne, które pozostają ostre nawet po wyświetleniu w bardzo dużych formatach. Jest to ostateczne rozwiązanie dla hero images, kreacji reklamowych i renderów produktów na poziomie marki.

Grok Imagine Image Quality API oferuje najlepsze w swojej klasie renderowanie tekstu w wielu językach bezpośrednio w generowanych obrazach. Poprzez dokładne odtwarzanie typografii, skryptów i znaków w dowolnym języku, użytkownicy mogą osadzać czytelny tekst w swoich materiałach wizualnych bez ręcznej edycji po wygenerowaniu. Jest to ostateczne rozwiązanie dla kreacji reklamowych, zlokalizowanych kampanii marketingowych i materiałów wizualnych o jakości marki.

Grok Imagine API generuje fotorealistyczne wyjścia charakteryzujące się naturalnym oświetleniem, bogatymi teksturami i wiarygodną fizyką w każdej scenie. Symulując rzeczywistą optykę i zachowanie materiałów, użytkownicy mogą tworzyć obrazy, które wizualnie są nie do odróżnienia od profesjonalnej fotografii. Jest to ostateczne rozwiązanie dla renderów produktów, obrazów głównych i wysokiej klasy wizualizacji marek.

Interfejs Grok Imagine Image Quality API wspiera dokładniejsze podążanie za promptami wraz z zaawansowaną edycją obrazów napędzaną przez dane referencyjne. Dzięki interpretacji szczegółowych instrukcji i dopasowywaniu wskazówek stylistycznych z przesłanych referencji użytkownicy mogą udoskonalać i zmieniać styl materiałów wizualnych z najwyższą precyzją. To ostateczne rozwiązanie dla kreacji reklamowych, renderów produktów i spójnych wizualizacji na poziomie marki.

Automatycznie generuje zsynchronizowaną muzykę, efekty dźwiękowe i dialogi do każdego klipu, dzięki czemu dźwięk i ruch pozostają zsynchronizowane w jednym przebiegu. Klipy nie wymagają osobnego etapu przetwarzania dźwięku i są od razu gotowe do użycia.

Obejmuje konwersję tekstu na wideo, obrazu na wideo, odniesienia na wideo oraz edycję wideo w ramach jednego pakietu. Możesz przechodzić między zadaniami generowania i edycji bez zmiany modeli lub integracji.

Grok Imagine Video API generuje naturalny ruch ze stabilną fizyką i spójnymi obiektami na przestrzeni klatek. Zmniejsza to migotanie i artefakty w dłuższych klipach, utrzymując spójność postaci i scen od początku do końca.
Każdy wiersz przetwarza ten sam prompt przez Grok Imagine API oraz dwa rywalizujące modele na Atlas Cloud, dzięki czemu ruch, synchronizacja audio, detale i typografia mogą być oceniane na równych zasadach.
Scena nocnego targu w stylu live action/cinematic, około 10 sekund. Otwarcie: ujęcie z niskiej perspektywy, kamera przesuwa się płynnie obok parujących straganów, podczas gdy młody kucharz w przemoczonej koszulce bez rękawów miota makaronem w wok, z którego wybucha kolumna ognia, oświetlając jego twarz na pomarańczowo. Kamera gwałtownie pędzi w prawo w kierunku zbliżenia makro na smażące się i zwijające krewetki w oleju, krople rozpryskują, po czym kamera cofa się i unosi nad ladą, gdy kucharz łapie obracający się wok i porcja makaronu odbywa się jednym płynnym ruchem. Końcowy moment: kudłaty uliczny kot skacze na ladę, chwyta krewetkę i zmyka w tłum, podczas gdy kucharz obraca się ze śmiechem, a kamera przechodzi w szybką ujęcie ręczne w pościgu za kotem. Mokra asfaltowa nawierzchnia odbija czerwone światło latarni, unosząca się para, płytka głębia ostrości, surowy, dokumentalny wygląd filmu z drobną ziarnistością. Audio: ryczący palnik gazowy, szumienie oleju, głosy targowego tłumu i brzękanie łopatek, narastający rytm bębnów, który trafia idealnie w moment skoku kota. Format 16:9.
Generated with Grok Imagine Video v1.5 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Grok Imagine Video on Atlas Cloud
Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud
Każdy z poniższych workflowów działa na jednym kluczu kompatybilnym z OpenAI, dzięki czemu zespół może poprowadzić koncepcję przez szkice graficzne w API Grok Imagine, edycje z referencjami, wideo z zsynchronizowanym audio oraz zlokalizowany lektorat bez zmiany stosu technologicznego.
Image 2.0 zwraca 1K szkiców w około dziesięć sekund w trybie niskiej jakości i do czterech wariantów na wywołanie. Zespoły projektowe szybko analizują wiele kierunków, a następnie renderują zwycięski projekt w 2K.
Przekaż do API Grok Imagine Image 2.0 Edit do trzech obrazów referencyjnych i opisz zmianę w prostym języku. Zespoły e-commerce podmieniają tła, restylizują opakowania i utrzymują spójność jednego produktu w całym katalogu.
xAI TTS v1 zamienia scenariusze na ekspresyjną mowę w dwudziestu językach i ponad osiemdziesięciu głosach przy opóźnieniu poniżej sekundy. Zespoły produktowe łączą go z wygenerowanym wideo, tworząc zlokalizowane reklamy, tutoriale i lektorat w aplikacji.
Grok Imagine Video v1.5 tworzy zsynchronizowaną muzykę, efekty i dialogi obok obrazu w klipach do piętnastu sekund w 1080p. Marketerzy otrzymują gotowy spot w jednym przejściu, bez osobnej sesji audio.
Potrzebujesz tej samej postaci w każdym ujęciu? Reference-to-video przyjmuje od jednego do siedmiu obrazów referencyjnych oraz opcjonalny głos referencyjny, dzięki czemu twórcy seriali utrzymują spójność wizualną i wokalną przez piętnastosekundowy klip.
Istniejący materiał można restylizować poprzez edycję naturalnym językiem lub przedłużyć o dwa do dziesięciu sekund, zachowując spójność ze źródłem. Zespoły postprodukcyjne poprawiają rekwizyty, garderobę i tempo bez powrotu na plan.
Zobacz, jak wypadają modele różnych dostawców — porównaj wydajność, ceny i unikalne mocne strony, aby podjąć świadomą decyzję.
| Model | Limit obrazów referencyjnych | Liczba wyników | Rozdzielczość | Proporcje |
|---|---|---|---|---|
| Grok Imagine Image Quality | 8 | 1~4 | 2K, 1K | Auto, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1 |
| Nano Banana 2 | 14 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Nano Banana Pro | 10 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Seedream 5.0 Lite | 14 | 1~15 | 2K~4K+ | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Qwen-Image | 3 | 1~6 | 512P~2K | Szerokość[512, 2048]px, Wysokość[512, 2048]px |
Zacznij w kilka minut — wykonaj te proste kroki, aby zintegrować i wdrożyć modele za pośrednictwem platformy Atlas Cloud.
Zarejestruj się na atlascloud.ai i ukończ weryfikację. Nowi użytkownicy otrzymują bezpłatne kredyty do eksploracji platformy i testowania modeli.
Połączenie zaawansowanych modeli Grok Imagine z platformą GPU-akcelerowaną Atlas Cloud zapewnia niezrównaną wydajność, skalowalność i doświadczenie deweloperskie.
Niska Latencja:
Inferencja zoptymalizowana pod GPU dla rozumowania w czasie rzeczywistym.
Zunifikowane API:
Uruchamiaj Grok Imagine, GPT, Gemini i DeepSeek za pomocą jednej integracji.
Przejrzysta Wycena:
Przewidywalne rozliczenia za token z opcjami serverless.
Doświadczenie Dewelopera:
SDK, analityka, narzędzia dostrajania i szablony.
Niezawodność:
99,99% dostępności, RBAC i logowanie gotowe na zgodność.
Bezpieczeństwo i Zgodność:
SOC 2 Type II, zgodność z HIPAA, suwerenność danych w USA.
Grok Imagine API to ujednolicony punkt dostępu Atlas Cloud do stosu generatywnego Grok Imagine od xAI, obejmujący tworzenie obrazów, edycję obrazów, wideo i mowę. Jednym kluczem uzyskujesz dostęp do wszystkich trybów, w tym najnowszych modeli Grok Imagine Image 2.0 Text-to-Image i Grok Imagine Image 2.0 Edit wydanych 7 sierpnia 2026 r. Rozliczenie jest typu pay-as-you-go za każdą udaną generację, więc płacisz za każde wywołanie bez subskrypcji.
Trzy generacje obrazów działają obok siebie: Grok Imagine Image za $0.02 za obraz, Grok Imagine Image Quality za $0.05 oraz Grok Imagine Image 2.0 od $0.04, każda ze swoim własnym punktem końcowym edycji. Wideo jest dostępne poprzez Grok Imagine Video za $0.05 za sekundę i Grok Imagine Video v1.5 za $0.08 za sekundę, z punktami końcowymi extend i edit obok nich. xAI TTS v1 uzupełnia ofertę ponad 80 głosami w 20 językach.
Image 2.0 projektuje typografię i układ w sposób, w jaki zrobiłby to projektant, dzięki czemu gęste kompozycje i mały tekst pozostają czytelne, zamiast rozmywać się w teksturze. Udostępnia również wybierany poziom jakości, pozwalając na kompromis między czasem renderowania a wiernością przy tym samym promptcie, czego wcześniejsze modele Image i Image Quality nie oferują. Warianty Text-to-Image i Edit dzielą to zachowanie.
Cennik opiera się na udanej generacji bez minimalnego wydatku. Grok Imagine Image 2.0 kosztuje $0.04 za obraz przy niskiej jakości i 1K, $0.06 przy niskiej jakości z 2K lub średniej jakości z 1K oraz $0.08 przy średniej jakości z 2K, podczas gdy każdy obraz wejściowy na punkcie końcowym Edit dodaje $0.01. Dla pozostałych modeli obrazów: Grok Imagine Image to $0.02 za obraz, a Grok Imagine Image Quality to $0.05, a wideo zaczyna się od $0.05 za sekundę.
Utwórz klucz API Atlas Cloud, następnie wyślij swój prompt i identyfikator modelu, taki jak xai/grok-imagine-image-2.0/text-to-image, na punkt końcowy generacji obrazów. Renderowanie jest asynchroniczne, więc wywołanie zwraca identyfikator żądania, który sprawdzasz na punkcie końcowym predykcji, aż jego status zmieni się z processing na completed. Ponieważ każdy model Grok Imagine stosuje ten sam schemat, dodanie wideo lub mowy później oznacza zmianę jednego ciągu. Zacznij budować już dziś.
Wyjścia renderowane są w rozdzielczościach 1K (1024x1024) lub 2K (2048x2048) w 14 proporcjach ekranu, od kwadratowej 1:1 i szerokiego ekranu 16:9 po wysokie 9:20 i ultrasyrookie 20:9 w kształtach banerów. Pojedyncze wywołanie może zwrócić do czterech obrazów, a prompty mogą mieć do 8000 znaków. Na punkcie końcowym Edit proporcje ekranu domyślnie ustawiane są na auto i dostosowują się do pierwszego obrazu wejściowego, chyba że ustawisz je jawnie.
Do trzech obrazów źródłowych na żądanie, dostarczanych jako publiczne URL-e lub dane URI w base64. Gdy przesyłasz więcej niż jeden, cytuj je w promptcie jako <IMAGE_0>, <IMAGE_1> i <IMAGE_2>, aby model wiedział, do którego zasobu odnosi się każda instrukcja. Każdy obraz wejściowy dodaje $0.01 do wywołania, a możesz poprosić o jeden do czterech edytowanych wariantów naraz.
Tak. Grok Imagine Video v1.5 produkuje natywne, zsynchronizowane audio w tym samym przejściu co obraz, dzięki czemu muzyka, efekty dźwiękowe i dialogi pokrywają się z ruchem, zamiast wymagać drugiego potoku. Tryb reference-to-video akceptuje opcjonalny głos referencyjny wraz z jednym do siedmiu obrazami referencyjnymi. Klipy trwają do 15 sekund, osiągając rozdzielczość 1080p w trybach text-to-video i image-to-video.
Wybierz Image 2.0, gdy klatka zawiera typografię, układ lub wieloelementową detaliczność, która musi się utrzymać, oraz gdy chcesz mieć bezpośrednią kontrolę nad kompromisem między szybkością a wiernością. Grok Imagine Image Quality to prosty stały koszt $0.05 za obraz z tymi samymi wyjściami 1K i 2K oraz 14 proporcjami ekranu. Jeśli liczy się wolumen bardziej niż drobny tekst, oryginalny Grok Imagine Image w cenie $0.02 za obraz pozostaje najbardziej ekonomiczną drogą.
Średnia to domyślny poziom jakości i zajmuje około 84 sekundy przy 1K, ponieważ celuje w najlepszy wynik modelu. Ustawienie jakości na niską skraca to do około 10 sekund, około 8 razy szybciej, w cenie $0.04 zamiast $0.06 za obraz 1K. Twórz szkice i iteruj przy niskiej jakości, a następnie ponownie uruchamiaj tylko zwycięskie prompty na średniej jakości i 2K, gdy kompozycja jest ustalona.
Poradniki, samouczki i nowości produktowe, dzięki którym w pełni wykorzystasz Atlas Cloud.