Seedance 2.5 अब लाइव है — सबसे पहले Atlas Cloud पर
Hero background 1Hero background 2Hero background 3
Grok Imagine API for 15 Second Video

Grok Imagine API for 15 Second Video

Grok Imagine API xAI की छवि, वीडियो और भाषण मॉडलों को शामिल करता है, Image 2.0 से Video 1.5 और xAI TTS v1 तक। 14 पहलू अनुपातों में 1K या 2K स्थिर छवियां उत्पन्न करें, एक दृश्य को 1080p में 15 सेकंड की गति तक बढ़ाएं, 7 संदर्भ छवियों के साथ शॉट्स को निर्देशित करें, या उन्हें 20 भाषाओं में सुनाएं। Atlas Cloud सभी मोड को एक endpoint पर चलाता है, प्रति उपयोग भुगतान मूल्य निर्धारण $0.02 प्रति छवि और $0.05 प्रति सेकंड से। आज ही निर्माण शुरू करें।

अग्रणी मॉडल एक्सप्लोर करें

Atlas Cloud आपको उद्योग में अग्रणी नवीनतम रचनात्मक मॉडल प्रदान करता है।

सभी Grok Imagine API एंडपॉइंट्स, स्टिल्स से साउंड तक

अपने इनपुट प्रकार, आउटपुट लंबाई, रेजोल्यूशन और प्रति-कॉल मूल्य के अनुसार सही Grok Imagine API मॉडल चुनें।

मोडैलिटीविवरण
Grok Imagine Image 2.0 T2I API (Text to Image)8,000 वर्णों तक का प्रॉम्प्ट लिखें और यह एंडपॉइंट 1K या 2K रेजोल्यूशन पर एक से चार इमेजेज़ रिटर्न करता है। कम या मध्यम क्वालिटी टियर आपको रेंडरिंग प्रयास बनाम टर्नअराउंड में ट्रेड-ऑफ करने देता है, $0.04 प्रति इमेज पर मूल्य के साथ। यह अवधारणा अन्वेषण, सोशल कंटेंट और बड़े पैमाने पर विजुअल प्रोडक्शन के लिए आदर्श है जहां वॉल्यूम मायने रखता है।
Grok Imagine Image 2.0 Edit API (Image to Image)एंडपॉइंट को तीन तक रेफरेंस इमेजेज़ प्राकृतिक भाषा निर्देश के साथ प्रदान करें, और संपादित परिणाम 1K या 2K पर आपके सेट किए गए या ऑटो एस्पेक्ट रेशो में रिटर्न होते हैं। वही कम और मध्यम क्वालिटी टियर लागू होते हैं, और प्रत्येक इमेज $0.04 लागत करती है। प्रोडक्ट रेस्टाइलिंग, बैकग्राउंड स्वैप्स और तेज़ डिज़ाइन वेरिएशन्स सभी एक कॉल के माध्यम से संभव हैं।
Grok Imagine Image Quality T2I API (Text to Image)जहां बेहतर विवरण महत्वपूर्ण है, यह एंडपॉइंट टेक्स्ट प्रॉम्प्ट्स को 1K या 2K पर पॉलिश्ड स्टिल्स में रूपांतरित करता है और $0.05 प्रति इमेज पर प्रति अनुरोध चार तक वेरिएशन्स रिटर्न करता है। एस्पेक्ट रेशो स्क्वायर, पोर्ट्रेट, लैंडस्केप और अल्ट्राविड फॉर्मेट्स में विस्तृत हैं। इसे हीरो इमेजेज़, विज्ञापन कंटेंट और ब्रांड-ग्रेड प्रोडक्ट रेंडर्स पर उपयोग करें।
Grok Imagine Image Quality Edit API (Image to Image)एक से आठ स्रोत इमेजेज़ संपादन निर्देश के साथ प्रदान करें और 1K या 2K पर $0.05 प्रति इमेज पर संशोधित संस्करण प्राप्त करें। बहु-इमेज संदर्भ <IMAGE_0> और <IMAGE_1> के रूप में इनलाइन संबोधित किए जाते हैं, इसलिए विषय और शैली को एक ही निर्देश में जोड़ा जा सकता है। कैम्पेन रिफ्रेशेज़, स्टाइल ट्रांसफर्स और कंपोज़िट एडिट्स आम काम हैं।
Grok Imagine Image T2I API (Text to Image)मूल टेक्स्ट-टू-इमेज एंडपॉइंट 1K और 2K आउटपुट और चार-इमेज बैचिंग को परिवार में सबसे कम इमेज मूल्य पर रखता है, $0.02 प्रति इमेज। यह उच्च-वॉल्यूम पाइपलाइन्स, थंबनेल जनरेशन और तेज़ प्रॉम्प्ट परीक्षण के लिए एक व्यावहारिक डिफॉल्ट बनाता है।
Grok Imagine Image Edit API (Image to Image)बड़े पैमाने पर हल्के संपादन की आवश्यकता है? यह एंडपॉइंट टेक्स्ट निर्देश के साथ एक से आठ इमेजेज़ स्वीकार करता है और 1K या 2K पर $0.02 प्रति इमेज के लिए चार तक संपादित परिणाम रिटर्न करता है। कैटलॉग सफाई, मौसमी वेरिएंट्स और पुनरावृत्ति डिज़ाइन पास सस्ते रहते हैं।
Grok Imagine Video v1.5 T2V API (Text to Video)अकेले एक प्रॉम्प्ट 480p, 720p या 1080p पर सात एस्पेक्ट रेशो में नेटिव सिंक्रोनाइज़्ड ऑडियो के साथ एक से पंद्रह सेकंड का वीडियो तैयार करता है। बिलिंग आउटपुट के $0.08 प्रति सेकंड है। ट्रेलर्स, सोशल स्पॉट्स और नैरेटिव दृश्य जिन्हें एम्बेडेड ऑडियो की आवश्यकता है इसके लिए सबसे उपयुक्त हैं।
Grok Imagine Video v1.5 I2V API (Image to Video)एक शुरुआती फ्रेम और मोशन प्रॉम्प्ट दें, और v1.5 इसे 1080p तक रेजोल्यूशन पर पंद्रह सेकंड तक एनिमेट करता है जिसमें ऑडियो एक ही पास में जनरेट किया जाता है। लागत $0.08 प्रति सेकंड है। प्रोडक्ट स्पिन्स, पोर्ट्रेट एनिमेशन और स्टिल-टू-मोशन कैम्पेन एसेट्स यहां फिट होते हैं।
Grok Imagine Video v1.5 R2V API (Reference to Video)एक से सात रेफरेंस इमेजेज़ स्क्रीन पर वर्ण, वस्तुओं और शैली को परिभाषित करती हैं, जबकि 26 प्रीसेट्स से चुनी गई तीन तक आवाजें बोली जाने वाली ऑडियो को नियंत्रित करती हैं। आउटपुट 480p या 720p पर $0.08 प्रति सेकंड के लिए पंद्रह सेकंड तक पहुंचता है। वर्ण-संगत कहानी कहना, वर्चुअल ट्राय-ऑन और ब्रांडेड मस्कॉट्स सबसे अधिक लाभ उठाते हैं।
Grok Imagine Video T2V API (Text to Video)टेक्स्ट प्रॉम्प्ट्स 480p या 720p पर एक से पंद्रह सेकंड की क्लिप्स बन जाते हैं, सात एस्पेक्ट रेशो के साथ लैंडस्केप, स्क्वायर और वर्टिकल डिलीवरी को कवर करते हुए। $0.05 प्रति सेकंड पर, यह सोशल कंटेंट और तेज़ अवधारणा बोर्ड्स के लिए मूल्य विकल्प है।
Grok Imagine Video I2V API (Image to Video)एक स्टिल को पहली फ्रेम के रूप में एंकर करें, अपनी चाहत की मोशन का वर्णन करें, और क्लिप 480p या 720p पर पंद्रह सेकंड तक विस्तारित होती है। मूल्य निर्धारण $0.05 प्रति सेकंड पर रहता है, जो प्रोडक्ट फोटो और पोर्ट्रेट्स के बड़े पैमाने पर एनिमेशन को सस्ता रखता है।
Grok Imagine Video R2V API (Reference to Video)एक से सात रेफरेंस इमेजेज़ यह निर्धारित करती हैं कि कौन और क्या स्क्रीन पर दिखाई देता है, एक निर्धारित ओपनिंग फ्रेम को सीमित किए बिना। क्लिप्स 480p या 720p पर दस सेकंड तक चलती हैं और $0.05 प्रति सेकंड लागत करती हैं। इसका उपयोग करें जब पहचान और शैली शॉट से शॉट तक सुसंगत रहनी चाहिए।
Grok Imagine Video Extend API (Video Extension)दो से पंद्रह सेकंड का एक मौजूदा mp4 एक और दो से दस सेकंड तक जारी रह सकता है, एक प्रॉम्प्ट द्वारा निर्देशित जो निर्धारित करता है कि अगला क्या होगा। आउटपुट स्रोत वीडियो से मेल खाता है और 720p पर सीमित है, $0.07 प्रति सेकंड पर बिल किया जाता है। एक छोटी क्लिप को आवश्यक विज्ञापन लंबाई तक खींचने के लिए यह उपयोगी है।
Grok Imagine Video Edit API (Video to Video)प्राकृतिक भाषा निर्देश एक मौजूदा mp4 को फिर से लिखते हैं जबकि मूल दृश्य, मोशन और फ्रेमिंग बरकरार रहती है। आउटपुट स्रोत अवधि रखता है, 8.7 सेकंड पर सीमित है, और बिलिंग इनपुट वीडियो पर $0.07 प्रति सेकंड है। प्रॉप एडिशन्स, वार्डरोब परिवर्तन और रेस्टाइलिंग बिना नए शूट के संभव हैं।
xAI TTS v1 API (Text to Speech)15,000 वर्णों तक का टेक्स्ट 20 भाषाओं में सबसेकंड लेटेंसी के साथ प्राकृतिक भाषण बन जाता है, स्वचालित भाषा पहचान उपलब्ध है। डिलीवरी ट्यूनेबल है: 0.7x से 1.5x तक प्लेबैक स्पीड, mp3, wav और pcm सहित कोडेक्स, और 48 kHz तक सैंपल रेट्स। वॉयसओवर्स, IVR प्रॉम्प्ट्स और इन-ऐप नैरेशन प्राकृतिक अनुप्रयोग हैं।

Grok Imagine API Images, Video, aur Speech ko kaise cover karta hai

Grok Imagine API ka har hissa alag production need ko address karta hai, jisme 14 aspect ratios par 2K stills, reference-guided editing, apna synchronized audio leke aane wala video, aur 20 languages mein speech shamil hai.

Ek hi pass mein Sound aur Motion ka Rendering

Ek hi pass mein Sound aur Motion ka Rendering

Dialogue, ambience, aur music motion ke saath hi ek hi pass mein generate hote hain, isliye 15 seconds tak ke clips pehle se sync ke saath milte hain. Publish karne se pehle koi alag scoring ya dubbing step ki zaroorat nahi hoti.

Grok Imagine API mein 14 Aspect Ratios par 2K Detail

Grok Imagine API mein 14 Aspect Ratios par 2K Detail

Grok Imagine Image 2.0, 14 aspect ratios par 1K ya 2K par photorealistic texture hold karta hai, jisme low aur medium quality tiers $0.04 per image par hain. Ek hi generation hero banners, print crops, aur close-ups ko cover karti hai.

Still Photo se Moving Shot tak

Still Photo se Moving Shot tak

Ek photo feed karein aur Grok Imagine Video v1.5 use opening frame ke roop mein anchor karta hai, phir up to 1080p par uske aas-paas motion build karta hai. Catalog shots aur portraits bina kisi reshoot ke showreels ban jate hain.

Grok Imagine API mein Multi-Image Editing

Grok Imagine API mein Multi-Image Editing

Ek saath up to teen reference images ko 1K ya 2K par edit kiya ja sakta hai, jahan plain-language instructions sirf unhi elements ko badalte hain jo aap name karein. $0.04 per edit par, design iterations aur on-brand variant sets saste rehte hain.

Characters apni Identity ko Frame se Frame tak maintain karte hain

Characters apni Identity ko Frame se Frame tak maintain karte hain

Ek se teen tak teen reference images characters, props, aur style ko up to 15 seconds ke clips mein carry karti hain, bina kisi fixed start frame ke. Virtual try-on, product placement, aur character-driven series mein ek hi recognizable look maintain rehta hai.

Grok Imagine API mein 20 Languages mein Expressive Speech

Grok Imagine API mein 20 Languages mein Expressive Speech

xAI TTS v1 usi suite ke andar aata hai, text ko 20 languages mein expressive speech mein badalta hai jisme sub-second latency hoti hai. Isse generated video ke saath pair karke narrated explainers, localized ads, aur in-app assistants banaye ja sakte hain.

Voice Choice aur Delivery ka Tuning

Voice Choice aur Delivery ka Tuning

Pace, emphasis, aur tone par fine-grained control har read ko shape karta hai, aur sub-second synthesis se kisi bhi line ka audition almost instant ho jata hai. 80 se zyada voices par, ek hi engine audiobooks, dubbing, aur character dialogue ko cover karta hai.

एक प्रॉम्प्ट, तीन मॉडल: ग्रॉक इमेजिन एपीआई साइड बाय साइड

प्रत्येक पंक्ति समान प्रॉम्प्ट को ग्रॉक इमेजिन एपीआई और एटलस क्लाउड पर दो प्रतिस्पर्धी मॉडलों से चलाती है, ताकि गति, ऑडियो सिंक, विवरण और टाइपोग्राफी को समान आधार पर आंकड़ा जा सके।

प्रॉम्प्ट

लाइव एक्शन सिनेमाटिक नइट मार्केट सीन, लगभग 10 सेकंड। एक लो एंगल ट्रैकिंग शॉट से शुरू करें जो भाप उठते स्टॉल्स से गुजरता है, जहां एक युवा वॉक शेफ भीगे टैंक टॉप में नूडल्स उछाल रहा हो, वॉक से आग का स्तंभ फूट निकले और उसके चेहरे को नारंगी रंग दे। कैमरा दाईं ओर व्हिप पैन करते हुए तेल में झुलसते और मुड़ते झींगा के टाइट मैक्रो में जाए, बूंदें बिखरती हुई, फिर पीछे खिंचे और काउंटर के ऊपर क्रेंन करें जहां वह घूमते वॉक को पकड़कर एक निरंतर गति में नूडल्स प्लेट कर दे। अंतिम बीट: एक फटी-पुरानी मार्केट बिल्ली काउंटर पर कूदे, एक झींगा छीन ले और भीड़ में भाग जाए, जबकि शेफ हंसते हुए घूम जाए, कैमरा बिल्ली के पीछे तेज हैंडहेल्ड चेस में बदल जाए।गीले एसफाल्ट पर लाल लालटेन की रोशनी का प्रतिबिंब, उड़ती भाप, शॉलो डेप्थ ऑफ फील्ड, बारीक ग्रेन के साथ ग्रिट्टी डॉक्यूमेंट्री फिल्म लुक। ऑडियो: दहाड़ता गैस बर्नर, तलते तेल की आवाज़, मार्केट की हलचल और चम्मचों की खनखनाहट, एक बढ़ता हुआ ड्रम पैटर्न जो बिल्ली के कूदने पर सटीक बैठे। 16:9 एस्पेक्ट रेशियो।

Generated with Grok Imagine Video v1.5 on Atlas Cloud

Generated with Veo3.1 on Atlas Cloud

Generated with Grok Imagine Video on Atlas Cloud

प्रॉम्प्ट

Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud

ग्राक इमेजिन एपीआई के साथ छवि, वीडियो और ऑडियो पर निर्माण करें

नीचे दिए गए हर वर्कफ़्लो को एक ही ओपनएआई-कम्पेटिबल की पर चलाया जाता है, इसलिए टीम एक अवधारणा को ग्राक इमेजिन एपीआई की छवि ड्राफ्ट, संदर्भ संपादन, समकालिक ऑडियो वाले वीडियो और स्थानीयकृत नैरेशन से गुज़ार सकती है बिना स्टैक बदले।

ग्राक इमेजिन एपीआई के साथ तेज अवधारणा पुनरावृत्ति

Image 2.0 निम्न गुणवत्ता टियर पर लगभग दस सेकंड में 1K ड्राफ्ट लौटाता है और प्रति कॉल चार विकल्प तक देता है। डिजाइन टीमें शुरुआत में कई दिशाओं का निरीक्षण करती हैं, फिर विजेता को 2K पर पुनः रेंडर करती हैं।

बहु-संदर्भ उत्पाद संयोजन

तीन तक संदर्भ छवियों को ग्राक इमेजिन इमेज 2.0 एडिट में फीड करें और परिवर्तन को सरल भाषा में वर्णित करें। ई-कॉमर्स टीमें पृष्ठभूमि बदलती हैं, पैकेजिंग का स्टाइल बदलती हैं, और एकल उत्पाद को कैटलॉग भर में सुसंगत रखती हैं।

बहुभाषी वॉइसओवर और नैरेशन

xAI TTS v1 बीस भाषाओं में और अस्सी से अधिक आवाज़ों में स्क्रिप्ट को अभिव्यक्तिपूर्ण भाषण में बदलता है, सब-सेकंड लेटेंसी के साथ। प्रोडक्ट टीमें इसे उत्पन्न वीडियो के साथ जोड़ती हैं ताकि स्थानीयकृत विज्ञापन, ट्यूटोरियल और ऐप-अंदर नैरेशन बना सकें।

नेटिव ऑडियो के साथ ग्राक इमेजिन एपीआई वीडियो

Grok Imagine Video v1.5 1080p पर पंद्रह सेकंड तक के क्लिप में छवि के साथ संगत संगीत, प्रभाव और संवाद लिखता है। विपणनकर्ताओं को एक पार में तैयार स्पॉट मिलता है, बिना अलग ऑडियो सत्र के।

ग्राक इमेजिन एपीआई पर चरित्र-सुसंगत कहानी कहना

क्या हर शॉट में वही चरित्र चाहिए? रिफरेंस-टू-वीडियो एक से सात संदर्भ छवियों को स्वीकार करता है, साथ ही एक वैकल्पिक संदर्भ आवाज़ भी लेता है, ताकि सीरीज निर्माता पहचान और स्वर लहजा को पंद्रह सेकंड के क्लिप भर में स्थिर रख सकें।

रीशूट के बिना पोस्ट-प्रोडक्शन

मौजूदा फुटेज को प्राकृतिक भाषा संपादन के माध्यम से पुनः स्टाइल किया जा सकता है, या स्रोत से मेल खाने वाले दो से दस सेकंड के विस्तार के साथ जारी रखा जा सकता है। पोस्ट टीमें सेट पर वापस जाने के बिना प्रॉप्स, वार्डरोब और पेसिंग ठीक करती हैं।

मॉडल तुलना

विभिन्न प्रदाताओं के मॉडलों की तुलना देखें — प्रदर्शन, मूल्य निर्धारण और अनूठी ताकतों की तुलना करके सूचित निर्णय लें।

मॉडलसंदर्भ छवि सीमाआउटपुट संख्यारिज़ॉल्यूशनएस्पेक्ट रेशियो
Grok Imagine Image Quality81~42K, 1KAuto, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1
Nano Banana 21414K, 2K, 1K1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Nano Banana Pro1014K, 2K, 1K1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Seedream 5.0 Lite141~152K~4K+1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9
Qwen-Image31~6512P~2KWidth[512, 2048]px, Height[512, 2048]px

Atlas Cloud पर Grok Imagine का उपयोग कैसे करें

कुछ ही मिनटों में शुरू करें — इन सरल चरणों का पालन करके Atlas Cloud प्लेटफ़ॉर्म के ज़रिए मॉडल इंटीग्रेट और डिप्लॉय करें।

Atlas Cloud अकाउंट बनाएं

atlascloud.ai पर साइन अप करें और वेरिफिकेशन पूरा करें। नए यूज़र्स को प्लेटफ़ॉर्म एक्सप्लोर करने और मॉडल टेस्ट करने के लिए फ्री क्रेडिट मिलते हैं।

Atlas Cloud पर Grok Imagine का उपयोग क्यों करें

बेजोड़ प्रदर्शन, स्केलेबिलिटी और विकास अनुभव के लिए उन्नत Grok Imagine मॉडल को Atlas Cloud के GPU त्वरण प्लेटफ़ॉर्म के साथ संयोजित करें।

प्रदर्शन और लचीलापन

कम विलंबता:
रियल-टाइम प्रतिक्रिया के लिए GPU-अनुकूलित इंफरेंसिंग।

एकीकृत API:
Grok Imagine, GPT, Gemini और DeepSeek के लिए एक इंटीग्रेशन।

पारदर्शी मूल्य निर्धारण:
प्रति token बिलिंग, Serverless मोड का समर्थन।

एंटरप्राइज और स्केल

डेवलपर अनुभव:
SDK, डेटा एनालिटिक्स, फाइन-ट्यूनिंग टूल और टेम्पलेट पूरी तरह से उपलब्ध हैं।

विश्वसनीयता:
99.99% उपलब्धता, RBAC अनुमति नियंत्रण, अनुपालन लॉगिंग।

सुरक्षा और अनुपालन:
SOC 2 Type II प्रमाणन, HIPAA अनुपालन, US डेटा संप्रभुता।

डवलपर्स द्वारा Grok Imagine API के बारे में पूछे जाने वाले प्रश्न

Grok Imagine API, Atlas Cloud का एक संयुक्त एक्सेस पॉइंट है जो xAI के Grok Imagine जनरेशन स्टैक के लिए है, जिसमें इमेज क्रिएशन, इमेज एडिटिंग, वीडियो और स्पीच शामिल हैं। एक ही कुंजी हर मोड को एक्सेस कर सकती है, जिसमें 7 अगस्त 2026 को जारी किए गए नवीनतम Grok Imagine Image 2.0 Text-to-Image और Grok Imagine Image 2.0 Edit मॉडल शामिल हैं। बिलिंग पे-एज़-यू-गो है, इसलिए आप प्रति सफल जनरेशन के लिए भुगतान करते हैं, कोई सब्सक्रिप्शन नहीं।

तीन इमेज जनरेशन एक साथ उपलब्ध हैं: Grok Imagine Image $0.02 प्रति इमेज, Grok Imagine Image Quality $0.05, और Grok Imagine Image 2.0 $0.04 से, प्रत्येक के अपने एडिट एंडपॉइंट के साथ। वीडियो Grok Imagine Video के माध्यम से $0.05 प्रति सेकंड और Grok Imagine Video v1.5 $0.08 प्रति सेकंड पर चलता है, उनके साथ एक्सटेंड और एडिट एंडपॉइंट के साथ। xAI TTS v1 20 भाषाओं में 80 से अधिक वॉइस के साथ पूरी सीट को पूरा करता है।

Image 2.0 एक डिजाइनर की तरह टाइपोग्राफी और लेआउट की योजना बनाता है, इसलिए घनी कंपोज़िशन और छोटा टेक्स्ट पठनीय रहता है, टेक्सचर में विलीन होने के बजाय। यह एक चयनीय गुणवत्ता स्तर भी प्रकट करता है, जिससे आप समान प्रॉम्प्ट पर रिंडर टाइम को फिडेलिटी के साथ बदल सकते हैं, जो पहले के इमेज और इमेज क्वालिटी मॉडल नहीं देते हैं। टेक्स्ट-टू-इमेज और एडिट दोनों वेरिएंट इस व्यवहार को साझा करते हैं।

मूल्य निर्धारण प्रति सफल जनरेशन पर है, कोई न्यूनतम खर्च नहीं। Grok Imagine Image 2.0 कम गुणवत्ता और 1K पर $0.04 प्रति इमेज है, कम गुणवत्ता के साथ 2K या मध्यम गुणवत्ता के साथ 1K पर $0.06, और मध्यम गुणवत्ता के साथ 2K पर $0.08 है, जबकि एडिट एंडपॉइंट पर प्रत्येक इनपुट इमेज $0.01 जोड़ता है। अन्य इमेज मॉडल के लिए, Grok Imagine Image $0.02 प्रति इमेज है और Grok Imagine Image Quality $0.05 है, और वीडियो $0.05 प्रति सेकंड से शुरू होता है।

एक Atlas Cloud API कुंजी बनाएं, फिर अपनी प्रॉम्प्ट और xai/grok-imagine-image-2.0/text-to-image जैसा कोई मॉडल आईडी इमेज जनरेशन एंडपॉइंट पर पोस्ट करें। रिंडरिंग असिंक्रोनस है, इसलिए कॉल एक रिक्वेस्ट आईडी लौटाती है जिस पर आप प्रेडिक्शन एंडपॉइंट पर तब तक पोल करते हैं जब तक इसकी स्थिति प्रोसेसिंग से कंप्लीट नहीं हो जाती। क्योंकि हर Grok Imagine मॉडल एक ही पैटर्न का पालन करता है, बाद में वीडियो या स्पीच जोड़ने का मतलब एक स्ट्रिंग बदलना है। आज ही बनाना शुरू करें।

आउटपुट 1K (1024x1024) या 2K (2048x2048) पर 14 एस्पेक्ट रेशियो पर रिंडर होते हैं, वर्ग 1:1 और वाइडस्क्रीन 16:9 से लेकर लंबे 9:20 और अल्ट्रावाइड 20:9 बैनर आकार तक। एकल कॉल चार इमेज तक लौटा सकती है, और प्रॉम्प्ट 8,000 वर्ण तक चल सकते हैं। एडिट एंडपॉइंट पर एस्पेक्ट रेशियो ऑटो पर डिफ़ॉल्ट होता है और आपकी पहले इनपुट इमेज का अनुसरण करता है जब तक कि आप इसे स्पष्ट रूप से सेट न करें।

प्रति रिक्वेस्ट अधिकतम तीन स्रोत इमेज, सार्वजनिक URL या base64 डेटा URI के रूप में प्रदान किए जाते हैं। जब आप एक से अधिक पास करते हैं, तो प्रॉम्प्ट में उन्हें <IMAGE_0>, <IMAGE_1>, और <IMAGE_2> के रूप में उद्धृत करें ताकि मॉडल को पता चले कि प्रत्येक निर्देश किस एसेट पर लागू होता है। प्रत्येक इनपुट इमेज कॉल में $0.01 जोड़ता है, और आप एक बार में एक से चार एडिटेड वेरिएंट का अनुरोध कर सकते हैं।

हाँ। Grok Imagine Video v1.5 चित्र के साथ ही नेटिव, सिंकनाइज्ड ऑडियो उत्पन्न करता है, इसलिए संगीत, ध्वनि प्रभाव और संवाद गति के साथ तालमेल बिठाते हैं, दूसरे पाइपलाइन की आवश्यकता के बिना। इसका रेफरेंस-टू-वीडियो मोड एक वैकल्पिक रेफरेंस वॉइस के साथ एक से सात रेफरेंस इमेज स्वीकार करता है। क्लिप 15 सेकंड तक चलते हैं, टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो पर 1080p तक पहुंचते हैं।

Image 2.0 चुनें जब फ्रेम में टाइपोग्राफी, लेआउट, या बहु-भाग विवरण हो जो एक साथ बना रहना चाहिए, और जब आप गति और फिडेलिटी के बीच समझौते पर सीधा नियंत्रण चाहते हों। Grok Imagine Image Quality एक सरल फ्लैट रेट $0.05 प्रति इमेज के रूप में रहता है, समान 1K और 2K आउटपुट और 14 एस्पेक्ट रेशियो के साथ। यदि मात्रा बारीक टेक्स्ट से अधिक महत्वपूर्ण है, तो $0.02 प्रति इमेज पर मूल Grok Imagine Image सबसे किफायती रास्ता बना रहता है।

मध्यम डिफ़ॉल्ट गुणवत्ता स्तर है और 1K पर लगभग 84 सेकंड लेता है क्योंकि यह मॉडल के सर्वोत्तम आउटपुट को लक्षित करता है। गुणवत्ता को कम सेट करने से यह लगभग 10 सेकंड तक कम हो जाता है, लगभग 8x तेज़, $0.04 पर, $0.06 के बजाय 1K इमेज के लिए। कम गुणवत्ता पर ड्राफ्ट और इटरेट करें, फिर एक बार कंपोज़िशन तय होने पर केवल जीतने वाले प्रॉम्प्ट को मध्यम और 2K पर पुनः चलाएं।

अधिक सीरीज़ एक्सप्लोर करें

Seedance 2.5

Seedance 2.5 API अब Atlas Cloud पर उपलब्ध है! यह डेवलपर्स को ByteDance का नवीनतम वीडियो मॉडल प्रदान करता है। यह टेक्स्ट, एकल छवि, या 50 मल्टीमोडल संदर्भों से एक ही बार में 30 सेकंड तक का नेटिव वीडियो उत्पन्न करता है, जिसमें सिंक्रनाइज़ ऑडियो और इन-फ्रेम बहुभाषी टेक्स्ट शामिल है। Atlas Cloud पर आप इसे एक कुंजी के माध्यम से एक्सेस कर सकते हैं, जिसमें विषय की निरंतरता और बेहतर भौतिकी लंबे शॉट्स को सुसंगत रखती है।

सीरीज़ देखें

MiniMax H3

MiniMax H3 API, MiniMax के सामान्य-उद्देश्य वाले multimodal video model को उपलब्ध कराता है, जो text, images, video और audio को एक बार में एक task के बजाय एक ही context के रूप में पढ़ता है। Clips 24 FPS पर 21:9 से 9:16 तक के aspect ratios में 5 से 15 seconds तक चलते हैं, और एक prompt characters बदल सकता है, backgrounds replace कर सकता है, dialogue rewrite कर सकता है या किसी reference clip से voice clone कर सकता है। Atlas Cloud यह सब एक OpenAI-compatible endpoint के ज़रिए उपलब्ध कराता है। आज ही बनाना शुरू करें।

सीरीज़ देखें

Seedream 5.0 Pro

Seedream 5.0 Pro API डेवलपर्स को Atlas Cloud पर ByteDance का नियंत्रणीय छवि संपादन मॉडल प्रदान करता है। यह एंकर और निर्देशांकों के साथ संपादनों को सटीक रूप से रखता है, छवियों को संपादन योग्य परतों में अलग करता है, कई संदर्भों को मिलाता है, और 2K और 3K पर बहुभाषी पाठ के साथ सटीक रंगों और सामग्रियों का मिलान करता है। Atlas Cloud पर आप एक कुंजी के माध्यम से इस तक पहुँच सकते हैं!

सीरीज़ देखें

Seedance 2.0

Seedance 2.0 API आपको ByteDance के मल्टीमॉडल वीडियो मॉडल तक प्रोडक्शन एक्सेस देता है — क्वाड-मॉडल इनपुट्स (टेक्स्ट, इमेज, वीडियो, ऑडियो) और एक उद्योग-अग्रणी "Universal Reference" सिस्टम जो शॉट्स के बीच कंपोजिशन, कैमरा मूवमेंट और कैरेक्टर एक्शन्स को लॉक करता है। एक API कॉल के साथ डायरेक्टर-लेवल कंट्रोल को इंटीग्रेट करें, $0.09/s की फ्लैट दर, इंस्टेंट की और बिना किसी वेटलिस्ट के — जिसे एंटरप्राइज़-ग्रेड अपटाइम और कंप्लायंस का समर्थन प्राप्त है। Seedance 2.0 Native 4K अब लाइव है!

सीरीज़ देखें

GPT Image 2

GPT Image 2 API डेवलपर्स को OpenAI के नवीनतम इमेज मॉडल तक पहुंच प्रदान करता है, जो GPT Image 1.5 का उत्तराधिकारी है। यह लैटिन और CJK लिपियों में सटीक टेक्स्ट रेंडरिंग के साथ चित्र बनाता और संपादित करता है, साथ ही पोस्टर, मॉकअप और इन्फोग्राफिक्स के लिए मजबूत संयोजन (कंपोजिशन) प्रदान करता है। Atlas Cloud पर आप इसे 300+ मॉडलों के साथ एक एकीकृत API के माध्यम से एक्सेस कर सकते हैं, जिसमें मुफ्त क्रेडिट, 99.99% अपटाइम और OpenAI संगठन सत्यापन की कोई आवश्यकता नहीं है।

सीरीज़ देखें

Gemini Omni Flash

Gemini Omni API, Google I/O 2026 में पेश किए गए Google DeepMind के मल्टीमोडल वीडियो जेनरेशन और एडिटिंग मॉडल को आपके स्टैक तक लाता है। Gemini Omni, Gemini के रीज़निंग इंजन को जेनरेटिव मीडिया के साथ जोड़ता है और टेक्स्ट, इमेज, वीडियो तथा ऑडियो के किसी भी संयोजन को स्वीकार कर सुसंगत, ज्ञान-आधारित आउटपुट तैयार करता है। स्वाभाविक बातचीत के ज़रिए परिणामों को निखारें — ऑब्जेक्ट बदलें, सीन दोबारा लिखें और स्टाइल बदलें, जबकि फ़िज़िक्स, किरदार और निरंतरता ज्यों की त्यों बनी रहती है। Atlas Cloud पूरी Gemini Omni Flash सीरीज़ — टेक्स्ट-टू-वीडियो, 7 रेफ़रेंस इमेज तक के साथ इमेज-टू-वीडियो, और रेफ़रेंस-टू-वीडियो — एक एकीकृत API के माध्यम से उपलब्ध कराता है, जिसमें $0.112 से शुरू होने वाली पारदर्शी प्रति-सेकंड कीमत है और कोई सब्सक्रिप्शन नहीं। आज ही बनाना शुरू करें।

सीरीज़ देखें

Grok Imagine

Grok Imagine API xAI की छवि, वीडियो और भाषण मॉडलों को शामिल करता है, Image 2.0 से Video 1.5 और xAI TTS v1 तक। 14 पहलू अनुपातों में 1K या 2K स्थिर छवियां उत्पन्न करें, एक दृश्य को 1080p में 15 सेकंड की गति तक बढ़ाएं, 7 संदर्भ छवियों के साथ शॉट्स को निर्देशित करें, या उन्हें 20 भाषाओं में सुनाएं। Atlas Cloud सभी मोड को एक endpoint पर चलाता है, प्रति उपयोग भुगतान मूल्य निर्धारण $0.02 प्रति छवि और $0.05 प्रति सेकंड से। आज ही निर्माण शुरू करें।

सीरीज़ देखें

Google

Google के सबसे शक्तिशाली क्रिएटिव मॉडल अब Atlas Cloud पर उपलब्ध हैं। Veo 3.1 सिनेमैटिक वीडियो जनरेशन प्रदान करता है, Nano Banana 2 हाई-फिडेलिटी इमेज क्रिएशन को शक्ति देता है, और Gemini हर वर्कफ़्लो में मल्टीमॉडल इंटेलिजेंस लाता है। Day-0 उपलब्धता और पे-एज़-यू-गो (pay-as-you-go) प्राइसिंग के साथ एक ही API key के माध्यम से संपूर्ण Google मॉडल सूट तक पहुंचें।

सीरीज़ देखें

Seedance 2.0 Mini

Seedance 2.0 Mini, ByteDance के मल्टीमोडल वीडियो जनरेशन को उन वर्कफ़्लो में लाता है जहाँ गति और लागत सबसे अधिक मायने रखते हैं। यह एक हल्के फुटप्रिंट पर Seedance 2.0 की मुख्य क्षमताएँ प्रदान करता है — तेज़ जनरेशन, प्रति वीडियो कम लागत, और वही API एकीकरण जिसका आप पहले से उपयोग करते हैं। उच्च-मात्रा वाले पाइपलाइन चलाने या बड़े पैमाने पर प्रोटोटाइपिंग करने वाली टीमों के लिए, Mini व्यावहारिक डिफ़ॉल्ट विकल्प है।

सीरीज़ देखें

ByteDance

सिनेमैटिक वीडियो जनरेशन से लेकर हाई-फिडेलिटी इमेज क्रिएशन तक, ByteDance के सबसे शक्तिशाली मॉडल Atlas Cloud पर लाइव हैं। सबसे कम इन्फ्रेंस प्राइसिंग और शून्य इन्फ्रास्ट्रक्चर ओवरहेड के साथ बड़े पैमाने पर Seedance और Seedream को रन करें।

सीरीज़ देखें

Alibaba

Atlas Cloud एक ही API के तहत Alibaba के पूरे मॉडल लाइनअप को एक साथ लाता है: भाषा और छवि कार्यों के लिए Qwen, और 1080p तक के वीडियो निर्माण के लिए Wan। बिना किसी सब्सक्रिप्शन के पे-एज़-यू-गो (pay-as-you-go) के आधार पर प्रत्येक मॉडल तक पहुँच प्राप्त करें। Alibaba API आपके मौजूदा OpenAI-संगत क्लाइंट का उपयोग करके एकल बेस URL के माध्यम से उपलब्ध है।

सीरीज़ देखें

OpenAI

Atlas Cloud आपको पूर्ण OpenAI API लाइनअप तक पहुंच प्रदान करता है, छवि निर्माण के लिए GPT Image 2 से लेकर वीडियो के लिए Sora 2 तक। हर मॉडल बिना किसी मासिक प्रतिबद्धता के 'पे-ऐज़-यू-गो' (pay-as-you-go) आधार पर उपलब्ध है। OpenAI-संगत API का उपयोग करके एकल बेस URL स्वैप के साथ प्लग इन करें।

सीरीज़ देखें

हर मीडिया AI के लिए एक ही API।

सभी मॉडल एक्सप्लोर करें