



Grok Imagine API mencakup model gambar, video, dan suara xAI, dari Image 2.0 hingga Video 1.5 dan xAI TTS v1. Render gambar 1K atau 2K di seluruh 14 rasio aspek, dorong adegan hingga 15 detik gerakan 1080p, arahkan shot dengan hingga 7 gambar referensi, atau narasikan dalam 20 bahasa. Atlas Cloud menjalankan setiap mode di satu endpoint, harganya bayar sesuai penggunaan mulai dari $0.02 per gambar dan $0.05 per detik. Mulai membangun hari ini.
Grok Imagine dikembangkan oleh xAI. Atlas Cloud (dioperasikan oleh Atlas Cloud AI LLC) menyediakan akses ke model ini dan tidak memilikinya. Semua merek dagang adalah milik pemiliknya masing-masing.
Atlas Cloud menyediakan model kreatif terdepan dan terbaru di industri untuk Anda.
Sesuaikan model API Grok Imagine yang tepat dengan jenis input, panjang output, resolusi, dan harga per panggilan Anda.
| Modalitas | Deskripsi |
|---|---|
| API Grok Imagine Image 2.0 T2I (Text to Image) | Tulis prompt hingga 8.000 karakter dan endpoint ini mengembalikan satu hingga empat gambar dengan resolusi 1K atau 2K. Tier kualitas rendah atau sedang memungkinkan Anda menukar upaya rendering dengan waktu pemrosesan, dengan harga $0,04 per gambar. Cocok untuk eksplorasi konsep, konten kreatif sosial, dan produksi visual batch di mana volume penting. |
| API Grok Imagine Image 2.0 Edit (Image to Image) | Berikan endpoint hingga tiga gambar referensi dengan instruksi bahasa alami, dan hasil yang diedit kembali dengan resolusi 1K atau 2K dalam rasio aspek pilihan Anda atau otomatis. Tier kualitas rendah dan sedang yang sama berlaku, dan setiap gambar harganya $0,04. Perubahan gaya produk, penukaran latar belakang, dan variasi desain cepat semuanya berjalan dalam satu panggilan. |
| API Grok Imagine Image Quality T2I (Text to Image) | Ketika detail yang lebih halus penting, endpoint ini mengubah prompt teks menjadi gambar diam yang dipoles pada resolusi 1K atau 2K dan mengembalikan hingga empat variasi per permintaan dengan harga $0,05 per gambar. Rasio aspek mencakup format persegi, potret, lansekap, dan ultrawide. Gunakan untuk gambar hero, konten kreatif periklanan, dan render produk tingkat merek. |
| API Grok Imagine Image Quality Edit (Image to Image) | Berikan satu hingga delapan gambar sumber dengan instruksi pengeditan dan terima versi yang direvisi dengan resolusi 1K atau 2K dengan harga $0,05 per gambar. Referensi multi-gambar ditangani inline sebagai <IMAGE_0> dan <IMAGE_1>, sehingga subjek dan gaya dapat digabungkan dalam satu instruksi. Penyegaran kampanye, transfer gaya, dan pengeditan komposit adalah pekerjaan umum. |
| API Grok Imagine Image T2I (Text to Image) | Endpoint text-to-image asli mempertahankan output 1K dan 2K dan pemrosesan batch empat gambar dengan harga gambar terendah dalam keluarga produk, $0,02 per gambar. Ini menjadikan pilihan default praktis untuk pipeline volume tinggi, pembuatan thumbnail, dan pengujian prompt cepat. |
| API Grok Imagine Image Edit (Image to Image) | Perlu pengeditan ringan dalam skala besar? Endpoint ini menerima satu hingga delapan gambar dengan instruksi teks dan mengembalikan hingga empat hasil yang diedit dengan resolusi 1K atau 2K dengan harga $0,02 per gambar. Pembersihan katalog, varian musiman, dan iterasi desain tetap terjangkau. |
| API Grok Imagine Video v1.5 T2V (Text to Video) | Prompt saja menghasilkan video satu hingga lima belas detik dengan audio tersinkronisasi native pada 480p, 720p, atau 1080p, di seluruh tujuh rasio aspek. Penagihan adalah $0,08 per detik output. Trailer, konten sosial, dan adegan naratif yang membutuhkan suara tertanam cocok untuk ini. |
| API Grok Imagine Video v1.5 I2V (Image to Video) | Berikan bingkai awal dan motion prompt, dan v1.5 menganimasinya hingga lima belas detik dengan resolusi mencapai 1080p dengan audio yang dihasilkan dalam proses yang sama. Biaya berjalan $0,08 per detik. Putaran produk, animasi potret, dan aset kampanye still-to-motion cocok di sini. |
| API Grok Imagine Video v1.5 R2V (Reference to Video) | Satu hingga tujuh gambar referensi menentukan siapa dan apa yang muncul di layar tanpa menentukan bingkai pembukaan tetap. Klip berjalan hingga lima belas detik pada 480p atau 720p dengan harga $0,08 per detik. Storytelling yang konsisten dengan karakter, virtual try-on, dan maskot bermerek sangat cocok. |
| API Grok Imagine Video T2V (Text to Video) | Prompt teks menjadi klip satu hingga lima belas detik pada 480p atau 720p, dengan tujuh rasio aspek mencakup pengiriman lansekap, persegi, dan vertikal. Pada $0,05 per detik, ini adalah opsi nilai untuk konten sosial dan concept board cepat. |
| API Grok Imagine Video I2V (Image to Video) | Jangkarkan gambar diam sebagai bingkai pertama, jelaskan gerakan yang Anda inginkan, dan klip diperpanjang hingga lima belas detik pada 480p atau 720p. Harga tetap pada $0,05 per detik, yang membuat animasi massal foto produk dan potret tetap terjangkau. |
| API Grok Imagine Video R2V (Reference to Video) | Antara satu dan tujuh gambar referensi menentukan siapa dan apa yang muncul di layar tanpa menentukan bingkai pembukaan tetap. Klip berjalan hingga sepuluh detik pada 480p atau 720p dan harganya $0,05 per detik. Gunakan ketika identitas dan gaya harus tetap konsisten dari shot ke shot. |
| API Grok Imagine Video Extend (Video Extension) | Video mp4 yang ada dari dua hingga lima belas detik dapat dilanjutkan oleh dua hingga sepuluh detik lagi, dipandu oleh prompt yang menetapkan apa yang terjadi selanjutnya. Output cocok dengan video sumber dan dibatasi pada 720p, ditagih pada $0,07 per detik. Berguna untuk meregangkan potongan pendek ke panjang iklan yang diperlukan. |
| API Grok Imagine Video Edit (Video to Video) | Instruksi bahasa alami menulis ulang video mp4 yang ada sementara adegan asli, gerakan, dan framing bertahan. Output mempertahankan durasi sumber, dibatasi hingga 8,7 detik, dan penagihan mengikuti video input pada $0,07 per detik. Penambahan props, perubahan pakaian, dan penataan ulang terjadi tanpa pemotretan ulang. |
| API xAI TTS v1 (Text to Speech) | Hingga 15.000 karakter teks menjadi ucapan alami dengan latensi sub-detik di seluruh 20 bahasa, dengan deteksi bahasa otomatis tersedia. Pengiriman dapat disesuaikan: kecepatan pemutaran dari 0,7x hingga 1,5x, codec termasuk mp3, wav, dan pcm, dan tingkat sampel hingga 48 kHz. Voiceover, prompt IVR, dan narasi dalam aplikasi adalah yang paling cocok. |
Setiap bagian dari API Grok Imagine menjawab kebutuhan produksi yang berbeda, mencakup stili 2K di 14 rasio aspek, pengeditan berbasis referensi, video yang membawa audio yang tersinkronisasi sendiri, dan ucapan dalam 20 bahasa.

Dialog, suasana, dan musik dihasilkan dalam langkah yang sama dengan gerakan, sehingga klip hingga 15 detik sudah tersinkronisasi. Tidak ada langkah pemusik atau dubbing terpisah yang diperlukan sebelum publikasi.

Grok Imagine Image 2.0 mempertahankan tekstur fotorealistik pada 1K atau 2K di 14 rasio aspek, dengan tier kualitas rendah dan sedang seharga $0,04 per gambar. Satu generasi mencakup banner utama, crops cetak, dan close-up.

Masukkan sebuah foto dan Grok Imagine Video v1.5 menguncinya sebagai frame pembuka, lalu membangun gerakan di sekelilingnya hingga 1080p. Shot katalog dan potret berubah menjadi showreel tanpa perlu syuting ulang.

Hingga tiga gambar referensi dapat diedit bersama pada 1K atau 2K, dengan instruksi bahasa biasa hanya mengubah elemen yang Anda sebutkan. Pada $0,04 per pengeditan, iterasi desain dan set varian on-brand tetap hemat biaya.

Antara satu hingga tujuh gambar referensi membawa karakter, properti, dan gaya ke dalam klip hingga 15 detik tanpa frame awal tetap. Virtual try-on, penempatan produk, dan seri berbasis karakter tetap mempertahankan satu tampilan yang mudah dikenali.

xAI TTS v1 hadir di dalam suite yang sama, mengubah teks menjadi ucapan ekspresif di 20 bahasa dengan latensi di bawah satu detik. Padukan dengan video yang dihasilkan untuk explainers naratif, iklan terlokalisasi, dan asisten dalam aplikasi.

Kontrol halus atas kecepatan, penekanan, dan nada membentuk setiap pembacaan, dan sintesis di bawah satu detik membuat audisi sebuah baris hampir instan. Di lebih dari 80 suara, satu mesin menjangkau audiobuku, dubbing, dan dialog karakter.
Setiap baris menjalankan prompt yang identik melalui API Grok Imagine dan dua model pesaing di Atlas Cloud, sehingga gerakan, sinkronisasi audio, detail, dan tipografi dapat dinilai secara setara.
Adegan pasar malam sinematik aksi langsung, sekitar 10 detik. Buka dengan sudut rendah, shot pelacakan yang meluncur melewati stan-uang beruap saat koki wok muda berkaos oblong basah melempar mie, kolom api meledak dari wok dan menerangi wajahnya berwarna oranye. Kamera whip pan ke kanan ke makro ketat udang yang memasak dan meliuk di minyak, tetesan tersebar, lalu mundur dan crane naik melewati meja saat ia menangkap wok berputar dan menata mie dalam satu gerakan kontinu. Detak terakhir: kucing pasar kusut melompat ke meja, mencaplok udang dan lari ke kerumunan sambil koki berputar tertawa, kamera pecah ke kejaran handheld cepat di belakang kucing. Aspal basah memantulkan cahaya lentera merah, uap melayang, kedalaman bidang dangkal, tampilan film dokumenter gritty dengan butiran halus. Audio: pembakar gas mengaum, minyak mendesis, keributan pasar dan ketukan sendok, pola drum yang naik yang mendarat tepat pada lompatan kucing. Rasio aspek 16:9.
Generated with Grok Imagine Video v1.5 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Grok Imagine Video on Atlas Cloud
Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud
Setiap alur kerja di bawah ini berjalan dengan satu kunci OpenAI-compatible, sehingga tim dapat membawa konsep dari draf gambar Grok Imagine API, edit referensi, video dengan audio tersinkronisasi, hingga narasi lokal tanpa mengubah stack.
Image 2.0 menghasilkan 1K draf dalam sekitar sepuluh detik di tier kualitas rendah dan hingga empat varian per panggilan. Tim desain menelusuri banyak arah sejak awal, lalu me-render ulang pemenang di 2K.
Berikan hingga tiga gambar referensi ke Grok Imagine Image 2.0 Edit dan jelaskan perubahan dalam bahasa sederhana. Tim e-commerce mengganti latar belakang, mengubah gaya kemasan, dan menjaga satu produk tetap konsisten di seluruh katalog.
xAI TTS v1 mengubah naskah menjadi ucapan ekspresif di dua puluh bahasa dan lebih dari delapan puluh suara dengan latensi di bawah satu detik. Tim produk memadukannya dengan video hasil generasi untuk iklan terlokalisasi, tutorial, dan narasi dalam aplikasi.
Grok Imagine Video v1.5 menulis musik, efek, dan dialog yang tersinkronisasi bersama gambar dalam klip hingga lima belas detik di 1080p. Pemasar mendapat spot jadi dalam satu tahap, tanpa sesi audio terpisah.
Butuh karakter yang sama di setiap adegan? Reference-to-video menerima satu hingga tujuh gambar referensi plus suara referensi opsional, sehingga pembuat seri menjaga identitas dan nada vokal tetap konsisten di klip lima belas detik.
Footage yang ada dapat diubah gaya melalui pengeditan dengan bahasa alami atau dilanjutkan dengan ekstensi dua hingga sepuluh detik yang sesuai dengan sumber. Tim pasca-produksi memperbaiki properti, kostum, dan irama tanpa kembali ke lokasi syuting.
Lihat bagaimana model dari berbagai penyedia dibandingkan — bandingkan performa, harga, dan keunggulan unik untuk membuat keputusan yang tepat.
| Model | Batas Gambar Referensi | Jumlah Output | Resolusi | Rasio Aspek |
|---|---|---|---|---|
| Grok Imagine Image Quality | 8 | 1~4 | 2K, 1K | Otomatis, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1 |
| Nano Banana 2 | 14 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Nano Banana Pro | 10 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Seedream 5.0 Lite | 14 | 1~15 | 2K~4K+ | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Qwen-Image | 3 | 1~6 | 512P~2K | Lebar[512, 2048]px, Tinggi[512, 2048]px |
Mulai dalam hitungan menit — ikuti langkah-langkah sederhana berikut untuk mengintegrasikan dan men-deploy model melalui platform Atlas Cloud.
Daftar di atlascloud.ai dan selesaikan verifikasi. Pengguna baru mendapatkan kredit gratis untuk menjelajahi platform dan menguji model.
Gabungkan model Grok Imagine canggih dengan platform akselerasi GPU Atlas Cloud untuk performa, skalabilitas, dan pengalaman pengembangan yang tak tertandingi.
Latensi Rendah:
Inferensi yang dioptimalkan GPU untuk respons real-time.
API Terpadu:
Satu integrasi untuk Grok Imagine, GPT, Gemini, dan DeepSeek.
Harga Transparan:
Billing per token, mendukung mode Serverless.
Pengalaman Developer:
SDK, analitik data, alat fine-tuning, dan template tersedia lengkap.
Keandalan:
Ketersediaan 99.99%, kontrol izin RBAC, logging kepatuhan.
Keamanan & Kepatuhan:
Sertifikasi SOC 2 Type II, kepatuhan HIPAA, kedaulatan data AS.
API Grok Imagine adalah titik akses terpadu Atlas Cloud untuk stack generasi Grok Imagine dari xAI, mencakup pembuatan gambar, pengeditan gambar, video, dan suara. Satu kunci mengakses semua mode, termasuk model terbaru Grok Imagine Image 2.0 Text-to-Image dan Grok Imagine Image 2.0 Edit yang dirilis pada 7 Agustus 2026. Penagihan bersifat bayar per penggunaan per generasi berhasil, jadi Anda membayar per panggilan tanpa langganan.
Tiga generasi gambar tersedia berdampingan: Grok Imagine Image seharga $0,02 per gambar, Grok Imagine Image Quality seharga $0,05, dan Grok Imagine Image 2.0 mulai dari $0,04, masing-masing dipasangkan dengan endpoint pengeditannya sendiri. Video berjalan melalui Grok Imagine Video seharga $0,05 per detik dan Grok Imagine Video v1.5 seharga $0,08 per detik, dengan endpoint extend dan edit di sampingnya. xAI TTS v1 melengkapi rangkaian dengan lebih dari 80 suara di 20 bahasa.
Image 2.0 merencanakan tipografi dan tata letak seperti yang dilakukan desainer, sehingga komposisi padat dan teks kecil tetap terbaca alih-alih larut menjadi tekstur. Model ini juga menyediakan tier kualitas yang dapat dipilih, memungkinkan Anda menukar waktu render dengan fidelitas pada prompt yang sama, sesuatu yang tidak ditawarkan oleh model Image dan Image Quality sebelumnya. Baik varian Text-to-Image maupun Edit berbagi perilaku ini.
Harga dihitung per generasi berhasil tanpa pengeluaran minimum. Grok Imagine Image 2.0 berharga $0,04 per gambar pada kualitas rendah dan 1K, $0,06 pada kualitas rendah dengan 2K atau kualitas menengah dengan 1K, dan $0,08 pada kualitas menengah dengan 2K, sementara setiap gambar input di endpoint Edit menambahkan $0,01. Untuk model gambar lainnya, Grok Imagine Image seharga $0,02 per gambar dan Grok Imagine Image Quality seharga $0,05, dan video dimulai dari $0,05 per detik.
Buat kunci API Atlas Cloud, lalu kirimkan prompt dan id model seperti xai/grok-imagine-image-2.0/text-to-image ke endpoint generasi gambar. Perenderan bersifat asinkron, sehingga panggilan mengembalikan request id yang dapat Anda poll pada endpoint prediksi hingga statusnya berubah dari processing menjadi completed. Karena setiap model Grok Imagine mengikuti pola yang sama, menambahkan video atau suara nanti cukup mengubah satu string. Mulai membangun hari ini.
Output dirender pada 1K (1024x1024) atau 2K (2048x2048) di berbagai 14 rasio aspek, mulai dari persegi 1:1 dan layar lebar 16:9 hingga tinggi 9:20 dan bentuk spanduk ultralebar 20:9. Satu panggilan dapat mengembalikan hingga empat gambar, dan prompt dapat mencapai 8.000 karakter. Di endpoint Edit, rasio aspek secara default diatur ke auto dan mengikuti gambar input pertama Anda kecuali Anda mengaturnya secara eksplisit.
Hingga tiga gambar sumber per permintaan, disediakan sebagai URL publik atau URI data base64. Saat Anda mengirimkan lebih dari satu, sebutkan dalam prompt sebagai <IMAGE_0>, <IMAGE_1>, dan <IMAGE_2> agar model mengetahui aset mana yang menjadi sasaran setiap instruksi. Setiap gambar input menambahkan $0,01 ke panggilan, dan Anda dapat meminta satu hingga empat varian hasil edit sekaligus.
Ya. Grok Imagine Video v1.5 menghasilkan audio asli yang tersinkronisasi dalam satu proses yang sama dengan gambar, sehingga musik, efek suara, dan dialog selaras dengan gerakan tanpa memerlukan pipeline kedua. Mode referensi-ke-video menerima suara referensi opsional alongside satu hingga tujuh gambar referensi. Klip berjalan hingga 15 detik, mencapai 1080p untuk text-to-video dan image-to-video.
Pilih Image 2.0 ketika bingkai memuat tipografi, tata letak, atau detail multi-bagian yang harus tetap utuh, dan ketika Anda menginginkan kontrol langsung atas trade-off kecepatan dan fidelitas. Grok Imagine Image Quality tetap merupakan tarif flat sederhana seharga $0,05 per gambar dengan output 1K dan 2K yang sama serta 14 rasio aspek. Jika volume lebih penting daripada teks detail, Grok Imagine Image original seharga $0,02 per gambar tetap menjadi jalur paling ekonomis.
Medium adalah tier kualitas default dan membutuhkan sekitar 84 detik pada 1K karena menargetkan output terbaik model. Mengatur kualitas ke rendah memotongnya menjadi sekitar 10 detik, kira-kira 8x lebih cepat, dengan harga $0,04 alih-alih $0,06 untuk gambar 1K. Buat draf dan iterasi pada kualitas rendah, lalu jalankan ulang hanya prompt yang menang pada kualitas menengah dan 2K setelah komposisi selesai.
Panduan, tutorial, dan pembaruan produk untuk membantu Anda memaksimalkan Atlas Cloud.