



Grok Imagine API xAI की छवि, वीडियो और भाषण मॉडलों को शामिल करता है, Image 2.0 से Video 1.5 और xAI TTS v1 तक। 14 पहलू अनुपातों में 1K या 2K स्थिर छवियां उत्पन्न करें, एक दृश्य को 1080p में 15 सेकंड की गति तक बढ़ाएं, 7 संदर्भ छवियों के साथ शॉट्स को निर्देशित करें, या उन्हें 20 भाषाओं में सुनाएं। Atlas Cloud सभी मोड को एक endpoint पर चलाता है, प्रति उपयोग भुगतान मूल्य निर्धारण $0.02 प्रति छवि और $0.05 प्रति सेकंड से। आज ही निर्माण शुरू करें।
Atlas Cloud आपको उद्योग में अग्रणी नवीनतम रचनात्मक मॉडल प्रदान करता है।
अपने इनपुट प्रकार, आउटपुट लंबाई, रेजोल्यूशन और प्रति-कॉल मूल्य के अनुसार सही Grok Imagine API मॉडल चुनें।
| मोडैलिटी | विवरण |
|---|---|
| Grok Imagine Image 2.0 T2I API (Text to Image) | 8,000 वर्णों तक का प्रॉम्प्ट लिखें और यह एंडपॉइंट 1K या 2K रेजोल्यूशन पर एक से चार इमेजेज़ रिटर्न करता है। कम या मध्यम क्वालिटी टियर आपको रेंडरिंग प्रयास बनाम टर्नअराउंड में ट्रेड-ऑफ करने देता है, $0.04 प्रति इमेज पर मूल्य के साथ। यह अवधारणा अन्वेषण, सोशल कंटेंट और बड़े पैमाने पर विजुअल प्रोडक्शन के लिए आदर्श है जहां वॉल्यूम मायने रखता है। |
| Grok Imagine Image 2.0 Edit API (Image to Image) | एंडपॉइंट को तीन तक रेफरेंस इमेजेज़ प्राकृतिक भाषा निर्देश के साथ प्रदान करें, और संपादित परिणाम 1K या 2K पर आपके सेट किए गए या ऑटो एस्पेक्ट रेशो में रिटर्न होते हैं। वही कम और मध्यम क्वालिटी टियर लागू होते हैं, और प्रत्येक इमेज $0.04 लागत करती है। प्रोडक्ट रेस्टाइलिंग, बैकग्राउंड स्वैप्स और तेज़ डिज़ाइन वेरिएशन्स सभी एक कॉल के माध्यम से संभव हैं। |
| Grok Imagine Image Quality T2I API (Text to Image) | जहां बेहतर विवरण महत्वपूर्ण है, यह एंडपॉइंट टेक्स्ट प्रॉम्प्ट्स को 1K या 2K पर पॉलिश्ड स्टिल्स में रूपांतरित करता है और $0.05 प्रति इमेज पर प्रति अनुरोध चार तक वेरिएशन्स रिटर्न करता है। एस्पेक्ट रेशो स्क्वायर, पोर्ट्रेट, लैंडस्केप और अल्ट्राविड फॉर्मेट्स में विस्तृत हैं। इसे हीरो इमेजेज़, विज्ञापन कंटेंट और ब्रांड-ग्रेड प्रोडक्ट रेंडर्स पर उपयोग करें। |
| Grok Imagine Image Quality Edit API (Image to Image) | एक से आठ स्रोत इमेजेज़ संपादन निर्देश के साथ प्रदान करें और 1K या 2K पर $0.05 प्रति इमेज पर संशोधित संस्करण प्राप्त करें। बहु-इमेज संदर्भ <IMAGE_0> और <IMAGE_1> के रूप में इनलाइन संबोधित किए जाते हैं, इसलिए विषय और शैली को एक ही निर्देश में जोड़ा जा सकता है। कैम्पेन रिफ्रेशेज़, स्टाइल ट्रांसफर्स और कंपोज़िट एडिट्स आम काम हैं। |
| Grok Imagine Image T2I API (Text to Image) | मूल टेक्स्ट-टू-इमेज एंडपॉइंट 1K और 2K आउटपुट और चार-इमेज बैचिंग को परिवार में सबसे कम इमेज मूल्य पर रखता है, $0.02 प्रति इमेज। यह उच्च-वॉल्यूम पाइपलाइन्स, थंबनेल जनरेशन और तेज़ प्रॉम्प्ट परीक्षण के लिए एक व्यावहारिक डिफॉल्ट बनाता है। |
| Grok Imagine Image Edit API (Image to Image) | बड़े पैमाने पर हल्के संपादन की आवश्यकता है? यह एंडपॉइंट टेक्स्ट निर्देश के साथ एक से आठ इमेजेज़ स्वीकार करता है और 1K या 2K पर $0.02 प्रति इमेज के लिए चार तक संपादित परिणाम रिटर्न करता है। कैटलॉग सफाई, मौसमी वेरिएंट्स और पुनरावृत्ति डिज़ाइन पास सस्ते रहते हैं। |
| Grok Imagine Video v1.5 T2V API (Text to Video) | अकेले एक प्रॉम्प्ट 480p, 720p या 1080p पर सात एस्पेक्ट रेशो में नेटिव सिंक्रोनाइज़्ड ऑडियो के साथ एक से पंद्रह सेकंड का वीडियो तैयार करता है। बिलिंग आउटपुट के $0.08 प्रति सेकंड है। ट्रेलर्स, सोशल स्पॉट्स और नैरेटिव दृश्य जिन्हें एम्बेडेड ऑडियो की आवश्यकता है इसके लिए सबसे उपयुक्त हैं। |
| Grok Imagine Video v1.5 I2V API (Image to Video) | एक शुरुआती फ्रेम और मोशन प्रॉम्प्ट दें, और v1.5 इसे 1080p तक रेजोल्यूशन पर पंद्रह सेकंड तक एनिमेट करता है जिसमें ऑडियो एक ही पास में जनरेट किया जाता है। लागत $0.08 प्रति सेकंड है। प्रोडक्ट स्पिन्स, पोर्ट्रेट एनिमेशन और स्टिल-टू-मोशन कैम्पेन एसेट्स यहां फिट होते हैं। |
| Grok Imagine Video v1.5 R2V API (Reference to Video) | एक से सात रेफरेंस इमेजेज़ स्क्रीन पर वर्ण, वस्तुओं और शैली को परिभाषित करती हैं, जबकि 26 प्रीसेट्स से चुनी गई तीन तक आवाजें बोली जाने वाली ऑडियो को नियंत्रित करती हैं। आउटपुट 480p या 720p पर $0.08 प्रति सेकंड के लिए पंद्रह सेकंड तक पहुंचता है। वर्ण-संगत कहानी कहना, वर्चुअल ट्राय-ऑन और ब्रांडेड मस्कॉट्स सबसे अधिक लाभ उठाते हैं। |
| Grok Imagine Video T2V API (Text to Video) | टेक्स्ट प्रॉम्प्ट्स 480p या 720p पर एक से पंद्रह सेकंड की क्लिप्स बन जाते हैं, सात एस्पेक्ट रेशो के साथ लैंडस्केप, स्क्वायर और वर्टिकल डिलीवरी को कवर करते हुए। $0.05 प्रति सेकंड पर, यह सोशल कंटेंट और तेज़ अवधारणा बोर्ड्स के लिए मूल्य विकल्प है। |
| Grok Imagine Video I2V API (Image to Video) | एक स्टिल को पहली फ्रेम के रूप में एंकर करें, अपनी चाहत की मोशन का वर्णन करें, और क्लिप 480p या 720p पर पंद्रह सेकंड तक विस्तारित होती है। मूल्य निर्धारण $0.05 प्रति सेकंड पर रहता है, जो प्रोडक्ट फोटो और पोर्ट्रेट्स के बड़े पैमाने पर एनिमेशन को सस्ता रखता है। |
| Grok Imagine Video R2V API (Reference to Video) | एक से सात रेफरेंस इमेजेज़ यह निर्धारित करती हैं कि कौन और क्या स्क्रीन पर दिखाई देता है, एक निर्धारित ओपनिंग फ्रेम को सीमित किए बिना। क्लिप्स 480p या 720p पर दस सेकंड तक चलती हैं और $0.05 प्रति सेकंड लागत करती हैं। इसका उपयोग करें जब पहचान और शैली शॉट से शॉट तक सुसंगत रहनी चाहिए। |
| Grok Imagine Video Extend API (Video Extension) | दो से पंद्रह सेकंड का एक मौजूदा mp4 एक और दो से दस सेकंड तक जारी रह सकता है, एक प्रॉम्प्ट द्वारा निर्देशित जो निर्धारित करता है कि अगला क्या होगा। आउटपुट स्रोत वीडियो से मेल खाता है और 720p पर सीमित है, $0.07 प्रति सेकंड पर बिल किया जाता है। एक छोटी क्लिप को आवश्यक विज्ञापन लंबाई तक खींचने के लिए यह उपयोगी है। |
| Grok Imagine Video Edit API (Video to Video) | प्राकृतिक भाषा निर्देश एक मौजूदा mp4 को फिर से लिखते हैं जबकि मूल दृश्य, मोशन और फ्रेमिंग बरकरार रहती है। आउटपुट स्रोत अवधि रखता है, 8.7 सेकंड पर सीमित है, और बिलिंग इनपुट वीडियो पर $0.07 प्रति सेकंड है। प्रॉप एडिशन्स, वार्डरोब परिवर्तन और रेस्टाइलिंग बिना नए शूट के संभव हैं। |
| xAI TTS v1 API (Text to Speech) | 15,000 वर्णों तक का टेक्स्ट 20 भाषाओं में सबसेकंड लेटेंसी के साथ प्राकृतिक भाषण बन जाता है, स्वचालित भाषा पहचान उपलब्ध है। डिलीवरी ट्यूनेबल है: 0.7x से 1.5x तक प्लेबैक स्पीड, mp3, wav और pcm सहित कोडेक्स, और 48 kHz तक सैंपल रेट्स। वॉयसओवर्स, IVR प्रॉम्प्ट्स और इन-ऐप नैरेशन प्राकृतिक अनुप्रयोग हैं। |
Grok Imagine API ka har hissa alag production need ko address karta hai, jisme 14 aspect ratios par 2K stills, reference-guided editing, apna synchronized audio leke aane wala video, aur 20 languages mein speech shamil hai.

Dialogue, ambience, aur music motion ke saath hi ek hi pass mein generate hote hain, isliye 15 seconds tak ke clips pehle se sync ke saath milte hain. Publish karne se pehle koi alag scoring ya dubbing step ki zaroorat nahi hoti.

Grok Imagine Image 2.0, 14 aspect ratios par 1K ya 2K par photorealistic texture hold karta hai, jisme low aur medium quality tiers $0.04 per image par hain. Ek hi generation hero banners, print crops, aur close-ups ko cover karti hai.

Ek photo feed karein aur Grok Imagine Video v1.5 use opening frame ke roop mein anchor karta hai, phir up to 1080p par uske aas-paas motion build karta hai. Catalog shots aur portraits bina kisi reshoot ke showreels ban jate hain.

Ek saath up to teen reference images ko 1K ya 2K par edit kiya ja sakta hai, jahan plain-language instructions sirf unhi elements ko badalte hain jo aap name karein. $0.04 per edit par, design iterations aur on-brand variant sets saste rehte hain.

Ek se teen tak teen reference images characters, props, aur style ko up to 15 seconds ke clips mein carry karti hain, bina kisi fixed start frame ke. Virtual try-on, product placement, aur character-driven series mein ek hi recognizable look maintain rehta hai.

xAI TTS v1 usi suite ke andar aata hai, text ko 20 languages mein expressive speech mein badalta hai jisme sub-second latency hoti hai. Isse generated video ke saath pair karke narrated explainers, localized ads, aur in-app assistants banaye ja sakte hain.

Pace, emphasis, aur tone par fine-grained control har read ko shape karta hai, aur sub-second synthesis se kisi bhi line ka audition almost instant ho jata hai. 80 se zyada voices par, ek hi engine audiobooks, dubbing, aur character dialogue ko cover karta hai.
प्रत्येक पंक्ति समान प्रॉम्प्ट को ग्रॉक इमेजिन एपीआई और एटलस क्लाउड पर दो प्रतिस्पर्धी मॉडलों से चलाती है, ताकि गति, ऑडियो सिंक, विवरण और टाइपोग्राफी को समान आधार पर आंकड़ा जा सके।
लाइव एक्शन सिनेमाटिक नइट मार्केट सीन, लगभग 10 सेकंड। एक लो एंगल ट्रैकिंग शॉट से शुरू करें जो भाप उठते स्टॉल्स से गुजरता है, जहां एक युवा वॉक शेफ भीगे टैंक टॉप में नूडल्स उछाल रहा हो, वॉक से आग का स्तंभ फूट निकले और उसके चेहरे को नारंगी रंग दे। कैमरा दाईं ओर व्हिप पैन करते हुए तेल में झुलसते और मुड़ते झींगा के टाइट मैक्रो में जाए, बूंदें बिखरती हुई, फिर पीछे खिंचे और काउंटर के ऊपर क्रेंन करें जहां वह घूमते वॉक को पकड़कर एक निरंतर गति में नूडल्स प्लेट कर दे। अंतिम बीट: एक फटी-पुरानी मार्केट बिल्ली काउंटर पर कूदे, एक झींगा छीन ले और भीड़ में भाग जाए, जबकि शेफ हंसते हुए घूम जाए, कैमरा बिल्ली के पीछे तेज हैंडहेल्ड चेस में बदल जाए।गीले एसफाल्ट पर लाल लालटेन की रोशनी का प्रतिबिंब, उड़ती भाप, शॉलो डेप्थ ऑफ फील्ड, बारीक ग्रेन के साथ ग्रिट्टी डॉक्यूमेंट्री फिल्म लुक। ऑडियो: दहाड़ता गैस बर्नर, तलते तेल की आवाज़, मार्केट की हलचल और चम्मचों की खनखनाहट, एक बढ़ता हुआ ड्रम पैटर्न जो बिल्ली के कूदने पर सटीक बैठे। 16:9 एस्पेक्ट रेशियो।
Generated with Grok Imagine Video v1.5 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Grok Imagine Video on Atlas Cloud
Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud
नीचे दिए गए हर वर्कफ़्लो को एक ही ओपनएआई-कम्पेटिबल की पर चलाया जाता है, इसलिए टीम एक अवधारणा को ग्राक इमेजिन एपीआई की छवि ड्राफ्ट, संदर्भ संपादन, समकालिक ऑडियो वाले वीडियो और स्थानीयकृत नैरेशन से गुज़ार सकती है बिना स्टैक बदले।
Image 2.0 निम्न गुणवत्ता टियर पर लगभग दस सेकंड में 1K ड्राफ्ट लौटाता है और प्रति कॉल चार विकल्प तक देता है। डिजाइन टीमें शुरुआत में कई दिशाओं का निरीक्षण करती हैं, फिर विजेता को 2K पर पुनः रेंडर करती हैं।
तीन तक संदर्भ छवियों को ग्राक इमेजिन इमेज 2.0 एडिट में फीड करें और परिवर्तन को सरल भाषा में वर्णित करें। ई-कॉमर्स टीमें पृष्ठभूमि बदलती हैं, पैकेजिंग का स्टाइल बदलती हैं, और एकल उत्पाद को कैटलॉग भर में सुसंगत रखती हैं।
xAI TTS v1 बीस भाषाओं में और अस्सी से अधिक आवाज़ों में स्क्रिप्ट को अभिव्यक्तिपूर्ण भाषण में बदलता है, सब-सेकंड लेटेंसी के साथ। प्रोडक्ट टीमें इसे उत्पन्न वीडियो के साथ जोड़ती हैं ताकि स्थानीयकृत विज्ञापन, ट्यूटोरियल और ऐप-अंदर नैरेशन बना सकें।
Grok Imagine Video v1.5 1080p पर पंद्रह सेकंड तक के क्लिप में छवि के साथ संगत संगीत, प्रभाव और संवाद लिखता है। विपणनकर्ताओं को एक पार में तैयार स्पॉट मिलता है, बिना अलग ऑडियो सत्र के।
क्या हर शॉट में वही चरित्र चाहिए? रिफरेंस-टू-वीडियो एक से सात संदर्भ छवियों को स्वीकार करता है, साथ ही एक वैकल्पिक संदर्भ आवाज़ भी लेता है, ताकि सीरीज निर्माता पहचान और स्वर लहजा को पंद्रह सेकंड के क्लिप भर में स्थिर रख सकें।
मौजूदा फुटेज को प्राकृतिक भाषा संपादन के माध्यम से पुनः स्टाइल किया जा सकता है, या स्रोत से मेल खाने वाले दो से दस सेकंड के विस्तार के साथ जारी रखा जा सकता है। पोस्ट टीमें सेट पर वापस जाने के बिना प्रॉप्स, वार्डरोब और पेसिंग ठीक करती हैं।
विभिन्न प्रदाताओं के मॉडलों की तुलना देखें — प्रदर्शन, मूल्य निर्धारण और अनूठी ताकतों की तुलना करके सूचित निर्णय लें।
| मॉडल | संदर्भ छवि सीमा | आउटपुट संख्या | रिज़ॉल्यूशन | एस्पेक्ट रेशियो |
|---|---|---|---|---|
| Grok Imagine Image Quality | 8 | 1~4 | 2K, 1K | Auto, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1 |
| Nano Banana 2 | 14 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Nano Banana Pro | 10 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Seedream 5.0 Lite | 14 | 1~15 | 2K~4K+ | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Qwen-Image | 3 | 1~6 | 512P~2K | Width[512, 2048]px, Height[512, 2048]px |
कुछ ही मिनटों में शुरू करें — इन सरल चरणों का पालन करके Atlas Cloud प्लेटफ़ॉर्म के ज़रिए मॉडल इंटीग्रेट और डिप्लॉय करें।
atlascloud.ai पर साइन अप करें और वेरिफिकेशन पूरा करें। नए यूज़र्स को प्लेटफ़ॉर्म एक्सप्लोर करने और मॉडल टेस्ट करने के लिए फ्री क्रेडिट मिलते हैं।
बेजोड़ प्रदर्शन, स्केलेबिलिटी और विकास अनुभव के लिए उन्नत Grok Imagine मॉडल को Atlas Cloud के GPU त्वरण प्लेटफ़ॉर्म के साथ संयोजित करें।
कम विलंबता:
रियल-टाइम प्रतिक्रिया के लिए GPU-अनुकूलित इंफरेंसिंग।
एकीकृत API:
Grok Imagine, GPT, Gemini और DeepSeek के लिए एक इंटीग्रेशन।
पारदर्शी मूल्य निर्धारण:
प्रति token बिलिंग, Serverless मोड का समर्थन।
डेवलपर अनुभव:
SDK, डेटा एनालिटिक्स, फाइन-ट्यूनिंग टूल और टेम्पलेट पूरी तरह से उपलब्ध हैं।
विश्वसनीयता:
99.99% उपलब्धता, RBAC अनुमति नियंत्रण, अनुपालन लॉगिंग।
सुरक्षा और अनुपालन:
SOC 2 Type II प्रमाणन, HIPAA अनुपालन, US डेटा संप्रभुता।
Grok Imagine API, Atlas Cloud का एक संयुक्त एक्सेस पॉइंट है जो xAI के Grok Imagine जनरेशन स्टैक के लिए है, जिसमें इमेज क्रिएशन, इमेज एडिटिंग, वीडियो और स्पीच शामिल हैं। एक ही कुंजी हर मोड को एक्सेस कर सकती है, जिसमें 7 अगस्त 2026 को जारी किए गए नवीनतम Grok Imagine Image 2.0 Text-to-Image और Grok Imagine Image 2.0 Edit मॉडल शामिल हैं। बिलिंग पे-एज़-यू-गो है, इसलिए आप प्रति सफल जनरेशन के लिए भुगतान करते हैं, कोई सब्सक्रिप्शन नहीं।
तीन इमेज जनरेशन एक साथ उपलब्ध हैं: Grok Imagine Image $0.02 प्रति इमेज, Grok Imagine Image Quality $0.05, और Grok Imagine Image 2.0 $0.04 से, प्रत्येक के अपने एडिट एंडपॉइंट के साथ। वीडियो Grok Imagine Video के माध्यम से $0.05 प्रति सेकंड और Grok Imagine Video v1.5 $0.08 प्रति सेकंड पर चलता है, उनके साथ एक्सटेंड और एडिट एंडपॉइंट के साथ। xAI TTS v1 20 भाषाओं में 80 से अधिक वॉइस के साथ पूरी सीट को पूरा करता है।
Image 2.0 एक डिजाइनर की तरह टाइपोग्राफी और लेआउट की योजना बनाता है, इसलिए घनी कंपोज़िशन और छोटा टेक्स्ट पठनीय रहता है, टेक्सचर में विलीन होने के बजाय। यह एक चयनीय गुणवत्ता स्तर भी प्रकट करता है, जिससे आप समान प्रॉम्प्ट पर रिंडर टाइम को फिडेलिटी के साथ बदल सकते हैं, जो पहले के इमेज और इमेज क्वालिटी मॉडल नहीं देते हैं। टेक्स्ट-टू-इमेज और एडिट दोनों वेरिएंट इस व्यवहार को साझा करते हैं।
मूल्य निर्धारण प्रति सफल जनरेशन पर है, कोई न्यूनतम खर्च नहीं। Grok Imagine Image 2.0 कम गुणवत्ता और 1K पर $0.04 प्रति इमेज है, कम गुणवत्ता के साथ 2K या मध्यम गुणवत्ता के साथ 1K पर $0.06, और मध्यम गुणवत्ता के साथ 2K पर $0.08 है, जबकि एडिट एंडपॉइंट पर प्रत्येक इनपुट इमेज $0.01 जोड़ता है। अन्य इमेज मॉडल के लिए, Grok Imagine Image $0.02 प्रति इमेज है और Grok Imagine Image Quality $0.05 है, और वीडियो $0.05 प्रति सेकंड से शुरू होता है।
एक Atlas Cloud API कुंजी बनाएं, फिर अपनी प्रॉम्प्ट और xai/grok-imagine-image-2.0/text-to-image जैसा कोई मॉडल आईडी इमेज जनरेशन एंडपॉइंट पर पोस्ट करें। रिंडरिंग असिंक्रोनस है, इसलिए कॉल एक रिक्वेस्ट आईडी लौटाती है जिस पर आप प्रेडिक्शन एंडपॉइंट पर तब तक पोल करते हैं जब तक इसकी स्थिति प्रोसेसिंग से कंप्लीट नहीं हो जाती। क्योंकि हर Grok Imagine मॉडल एक ही पैटर्न का पालन करता है, बाद में वीडियो या स्पीच जोड़ने का मतलब एक स्ट्रिंग बदलना है। आज ही बनाना शुरू करें।
आउटपुट 1K (1024x1024) या 2K (2048x2048) पर 14 एस्पेक्ट रेशियो पर रिंडर होते हैं, वर्ग 1:1 और वाइडस्क्रीन 16:9 से लेकर लंबे 9:20 और अल्ट्रावाइड 20:9 बैनर आकार तक। एकल कॉल चार इमेज तक लौटा सकती है, और प्रॉम्प्ट 8,000 वर्ण तक चल सकते हैं। एडिट एंडपॉइंट पर एस्पेक्ट रेशियो ऑटो पर डिफ़ॉल्ट होता है और आपकी पहले इनपुट इमेज का अनुसरण करता है जब तक कि आप इसे स्पष्ट रूप से सेट न करें।
प्रति रिक्वेस्ट अधिकतम तीन स्रोत इमेज, सार्वजनिक URL या base64 डेटा URI के रूप में प्रदान किए जाते हैं। जब आप एक से अधिक पास करते हैं, तो प्रॉम्प्ट में उन्हें <IMAGE_0>, <IMAGE_1>, और <IMAGE_2> के रूप में उद्धृत करें ताकि मॉडल को पता चले कि प्रत्येक निर्देश किस एसेट पर लागू होता है। प्रत्येक इनपुट इमेज कॉल में $0.01 जोड़ता है, और आप एक बार में एक से चार एडिटेड वेरिएंट का अनुरोध कर सकते हैं।
हाँ। Grok Imagine Video v1.5 चित्र के साथ ही नेटिव, सिंकनाइज्ड ऑडियो उत्पन्न करता है, इसलिए संगीत, ध्वनि प्रभाव और संवाद गति के साथ तालमेल बिठाते हैं, दूसरे पाइपलाइन की आवश्यकता के बिना। इसका रेफरेंस-टू-वीडियो मोड एक वैकल्पिक रेफरेंस वॉइस के साथ एक से सात रेफरेंस इमेज स्वीकार करता है। क्लिप 15 सेकंड तक चलते हैं, टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो पर 1080p तक पहुंचते हैं।
Image 2.0 चुनें जब फ्रेम में टाइपोग्राफी, लेआउट, या बहु-भाग विवरण हो जो एक साथ बना रहना चाहिए, और जब आप गति और फिडेलिटी के बीच समझौते पर सीधा नियंत्रण चाहते हों। Grok Imagine Image Quality एक सरल फ्लैट रेट $0.05 प्रति इमेज के रूप में रहता है, समान 1K और 2K आउटपुट और 14 एस्पेक्ट रेशियो के साथ। यदि मात्रा बारीक टेक्स्ट से अधिक महत्वपूर्ण है, तो $0.02 प्रति इमेज पर मूल Grok Imagine Image सबसे किफायती रास्ता बना रहता है।
मध्यम डिफ़ॉल्ट गुणवत्ता स्तर है और 1K पर लगभग 84 सेकंड लेता है क्योंकि यह मॉडल के सर्वोत्तम आउटपुट को लक्षित करता है। गुणवत्ता को कम सेट करने से यह लगभग 10 सेकंड तक कम हो जाता है, लगभग 8x तेज़, $0.04 पर, $0.06 के बजाय 1K इमेज के लिए। कम गुणवत्ता पर ड्राफ्ट और इटरेट करें, फिर एक बार कंपोज़िशन तय होने पर केवल जीतने वाले प्रॉम्प्ट को मध्यम और 2K पर पुनः चलाएं।
Atlas Cloud का भरपूर लाभ उठाने में मदद करने वाली गाइड, ट्यूटोरियल और प्रोडक्ट अपडेट।