

MiniMax H3 API, MiniMax के सामान्य-उद्देश्य वाले multimodal video model को उपलब्ध कराता है, जो text, images, video और audio को एक बार में एक task के बजाय एक ही context के रूप में पढ़ता है। Clips 24 FPS पर 21:9 से 9:16 तक के aspect ratios में 5 से 15 seconds तक चलते हैं, और एक prompt characters बदल सकता है, backgrounds replace कर सकता है, dialogue rewrite कर सकता है या किसी reference clip से voice clone कर सकता है। Atlas Cloud यह सब एक OpenAI-compatible endpoint के ज़रिए उपलब्ध कराता है। आज ही बनाना शुरू करें।
Atlas Cloud आपको उद्योग में अग्रणी नवीनतम रचनात्मक मॉडल प्रदान करता है।
हर MiniMax H3 API endpoint text, images, video और audio को अलग-अलग तरीके से पढ़ता है, इसलिए नीचे दी गई पंक्तियाँ देखें और जो आप बना रहे हैं उसके लिए सही modality चुनें।
| मोडैलिटी | विवरण |
|---|---|
| MiniMax H3 T2V API (Text to Video) | 7,000 characters तक का prompt लिखें और model उसी pass में generated native stereo sound के साथ 24 FPS पर 1440p में 5 to 15 second की clip लौटाता है। Aspect ratio हर request के लिए 21:9, 16:9, 4:3, 1:1, 3:4 और 9:16 में set किया जाता है, इसलिए एक ही call cinematic trailers और vertical social cuts, दोनों को cover करता है। |
| MiniMax H3 I2V API (Image to Video) | एक image opening frame set करती है और दो images first और last frame, दोनों को lock करती हैं; H3 इनके बीच की motion को input image के aspect ratio में भर देता है। हर side पर 256 to 5760 pixels वाले sources accepted हैं, जिससे key art, product stills और storyboard frames को motion में लाना आसान हो जाता है। |
| MiniMax H3 Omni Reference API (Reference to Video) | कई sources को साथ काम कराना है? 12 file cap के तहत एक ही request में up to nine images, three video clips और three audio tracks शामिल किए जा सकते हैं, जिन्हें एक ही multimodal context के रूप में पढ़ा जाता है। Shots के बीच किसी character, camera move या voice timbre को बनाए रखें, या subjects, backgrounds और spoken lines बदलकर किसी existing clip को edit करें। |
MiniMax H3 API से लौटने वाली हर क्लिप 1440p पर 15 seconds तक चलती है, नेटिव स्टीरियो साउंड के साथ आती है, और टेक्स्ट, इमेज, वीडियो व वॉइस रेफ़रेंस के किसी भी मिश्रण से बन सकती है। वही कॉल आपके मौजूदा फुटेज के भीतर कैरेक्टर, सीन और डायलॉग भी एडिट कर सकती है।
एक MiniMax H3 API रिक्वेस्ट अधिकतम 9 रेफ़रेंस इमेज, 3 वीडियो क्लिप और 3 ऑडियो ट्रैक स्वीकार करती है, कुल सीमा 12 फ़ाइलों की है। इन्हें अलग-अलग स्लॉट की तरह पढ़ने के बजाय, मॉडल टेक्स्ट, पिक्चर और साउंड को एक ही कॉन्टेक्स्ट मानता है—किसी फ़ोटो से कैरेक्टर, किसी क्लिप से कैमरा मूव और किसी ट्रैक से मूड लेकर उन्हें उसी सीन में जोड़ता है। जिन टीमों के पास पहले से मटेरियल है, उन्हें फाइनल शॉट तक पहुँचने का सीधा रास्ता मिलता है।
हर रिज़ल्ट साउंड के साथ आता है। डायलॉग, ऐम्बियंस और म्यूज़िक उसी पास में नेटिव स्टीरियो में बनाए जाते हैं जिसमें पिक्चर 24 frames per second पर रेंडर होती है, इसलिए बाद में स्कोरिंग या डबिंग करने की ज़रूरत नहीं पड़ती। क्योंकि शॉट जनरेट होते समय ही टाइमिंग तय होती है, फुटस्टेप्स, स्पीच और कट्स एक्शन के साथ लॉक रहते हैं। शॉर्ट ऐड्स और सोशल स्पॉट्स पब्लिश करने के लिए तैयार निकलते हैं।
क्या बिल्ली की जगह कुत्ता लाना है, ग्रीन स्क्रीन बदलनी है, या डायलॉग की एक लाइन दोबारा लिखनी है? MiniMax H3 API आपके दिए गए वीडियो पर ऐसे एडिट्स लागू करती है—कैरेक्टर, ऑब्जेक्ट, बैकग्राउंड, लाइटिंग और इफ़ेक्ट्स तक—जबकि जिन हिस्सों का आपने ज़िक्र नहीं किया, वे ओरिजिनल के काफ़ी करीब रहते हैं। Prompts 7000 characters तक के हो सकते हैं, इसलिए एक ही पास में दर्जन भर बदलाव स्टैक किए जा सकते हैं। इससे approved cut पर iteration करना व्यावहारिक हो जाता है।
अपनी इमेज या फुटेज के साथ वॉइस सैंपल भेजें और जनरेट किया गया कैरेक्टर उसी टिंबर में बोलता है। हर रिक्वेस्ट में अधिकतम 3 ऑडियो रेफ़रेंस की अनुमति है, हर एक 2 से 15 seconds के बीच, और ऑडियो हमेशा किसी विज़ुअल इनपुट के साथ ही होना चाहिए, अकेले नहीं भेजा जा सकता। मौजूदा डायलॉग भी बदला जा सकता है और परफ़ॉर्मेंस को मैच करने के लिए एडजस्ट किया जा सकता है। सीरीज़ के काम में हर एपिसोड में एक ही पहचानी जा सकने वाली आवाज़ बनी रहती है।
क्लिप्स 5 से 15 seconds तक चलती हैं, और 1440p मोड 16:9 से 9:16 तक छोटी साइड पर 1440 pixels रखता है, या 21:9 के लिए 2976 by 1248 जैसे wider ratios पर लगभग 3.7 megapixels देता है। सिनेमैटिक 21:9 से वर्टिकल 9:16 तक 6 ratios चुने जा सकते हैं, और MiniMax H3 API आपके लिए एक ratio भी चुन सकती है। यह रेंज मॉडल बदले बिना ट्रेलर, प्रोडक्ट लूप और वर्टिकल ड्रामा को कवर करती है।
अगर आपकी सोर्स फ़ाइलें सीधे कैमरा या एडिटिंग टाइमलाइन से आती हैं, तो वे जैसे हैं वैसे ही इनपुट हो जाती हैं: H.264 और H.265 वीडियो, JPG, PNG, WEBP, HEIC और HEIF स्टिल्स, साथ में WAV और MP3 ऑडियो। प्रति-फ़ाइल लिमिट वीडियो के लिए 50MB, इमेज के लिए 30MB और ऑडियो के लिए 15MB है, जबकि URL से assets पास करने पर रिक्वेस्ट 64MB body limit के भीतर रहती हैं। Atlas Cloud पर पूरा सेट एक OpenAI-compatible key के ज़रिए pay-as-you-go billing के साथ चलता है।
इस सेट की हर क्लिप एक ही समान प्रॉम्प्ट से बनी है, जिसे MiniMax H3 API और Atlas Cloud पर होस्ट किए गए दो अन्य वीडियो मॉडल्स को भेजा गया, ताकि एक भी शब्द बदले बिना मोशन, साउंड और निर्देशों के पालन की तुलना की जा सके।
15 सेकंड, 16:9 लैंडस्केप शॉर्ट वीडियो। देर रात के सेल्फ-सर्विस लॉन्ड्रोमैट का लाइव-एक्शन फुटेज, जिसमें हाथ से बनाई गई चमकती ऐनिमेशन को मिलाकर एक मिक्स्ड-मीडिया इमेज बनाई गई है। एक छोटा सेल्फ-सर्विस लॉन्ड्रोमैट, जिसकी फ्लोरोसेंट लाइटें हल्के-हल्के टिमटिमा रही हैं; अंदर चलती हुई वॉशिंग मशीनें, प्लास्टिक लॉन्ड्री बास्केट और एक पुरानी बेंच हैं, और फर्श पर एक अकेला मोज़ा पड़ा है। पूरा स्पेस शांत है, जिसमें हल्का-सा नॉस्टैल्जिक मूड महसूस होता है। इसमें एक हाथ से शूट किए गए हैंडहेल्ड फोन फुटेज का टेक्सचर है, जिसमें कैमरा शेक साफ़ दिखता है; सफेद फ्लोरोसेंट लाइट की वजह से एक्सपोज़र कभी चमकीला तो कभी मंद होता रहता है; कांच की सतहों पर एम्बिएंट रिफ्लेक्शन हैं; लेंस के ऑब्जेक्ट्स के करीब जाने पर फोकस में हल्का लैग आता है। इमेज किसी कमर्शियल ऐड जैसी पॉलिश्ड और व्यवस्थित नहीं होनी चाहिए — कुल मिलाकर एहसास एक असली डॉक्यूमेंट्री स्नैपशॉट जैसा हो, मानो आप देर रात यूँ ही अचानक अंदर आ गए हों और किसी अजीब, सपने जैसी झलक का पीछा करते हुए यह शॉट कैप्चर कर लिया हो।
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
फर्स्ट-पर्सन परिप्रेक्ष्य · आंखों की ऊंचाई · हैंडहेल्ड गेमिंग कैमरा सीन: यह शॉट ऐसे सिम्युलेट करता है जैसे कोई खिलाड़ी modern-warfare FPS game चला रहा हो, दोनों हाथों से assault rifle पकड़े हुए और एक सैन्य बेस की बाहरी परिधि के साथ धीरे-धीरे आगे बढ़ रहा हो। खिलाड़ी कवर के पास वाली सड़क पर आगे बढ़ता है, क्रॉसहेयर आगे के रास्ते पर घूमता है; एक छोटे विराम के बाद, वह दूर के objective की ओर कुछ राउंड फायर करता है, फिर आगे बढ़ना जारी रखता है — किसी साधारण खिलाड़ी के लाइव gameplay footage जैसा। लाइटिंग: आधुनिक सैन्य बेस की कूल-टोन प्राकृतिक रोशनी धुएं और muzzle fire के साथ घुलती-मिलती है। इमेज यथार्थवादी और crisp है, जहां धातु का weapon और battlefield की धूल व धुंध AAA-game quality लिए हुए हैं। कैमरा वर्क: खिलाड़ी के चलते समय कैमरे में हल्का हैंडहेल्ड sway है — पहले धीरे-धीरे आगे बढ़ना, फिर देखने के लिए छोटे-छोटे left-and-right sweeps, फायरिंग के समय subtle recoil shake, और अंत में फिर स्थिरता से आगे बढ़ते रहना।
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
ब्रांड फ़िल्मों और वर्टिकल ड्रामा से लेकर प्रोडक्ट कट्स, गेम विज़ुअल्स और मौजूदा फुटेज के सटीक एडिट्स तक, MiniMax H3 API हर परिदृश्य को एक multimodal request से कवर करता है, जो native stereo audio के साथ वीडियो लौटाती है।
1440p ट्रेलर, TVC स्पॉट और फ़ैशन कैंपेन 24 FPS पर बनाने के लिए स्टोरीबोर्ड फ़्रेम और शॉट लिस्ट को एक ही call में दें। हर result के साथ native stereo audio मिलता है, इसलिए ब्रांड टीमें तैयार cuts की स्क्रीनिंग कर सकती हैं।
Vertical 9:16 output, कॉस्ट्यूम मिस्ट्री से लेकर पारिवारिक टकराव तक, scripted drama scenes को कवर करता है, और dialogue उसी pass में voice हो जाता है। शॉर्ट ड्रामा लाइब्रेरी बना रहे स्टूडियो कलाकारों या स्टेज बुक किए बिना 15 second hooks पा सकते हैं।
अगर किसी शॉट में खास चेहरा और motion चाहिए, तो 9 images, 3 videos और 3 audio clips तक एक call को guide कर सकते हैं। Character identity, camera work और vocal timbre सभी episodes में स्थिर रहते हैं।
बाद में बदलाव चाहिए? मौजूदा फुटेज को prompt से एडिट किया जा सकता है: किसी subject को swap करें, background बदलें, lighting adjust करें या एक भी frame दोबारा शूट किए बिना spoken line को rewrite करें।
प्रोडक्ट फ़ोटो में motion आ जाता है: एक reference image, 360 degree showcase, feature explainer या paid social cut में बदल जाती है। 21:9 से 9:16 तक के aspect ratios से एक ही asset set हर placement को feed कर सकता है।
Stylized output, game CG, character PV, anime openings और interface demos के लिए भरोसेमंद रहता है, जहाँ menus, HUD elements और text overlays पठनीय बने रहने चाहिए। आर्ट टीमें production से पहले concept validation के लिए इसका उपयोग करती हैं।
किसी endpoint पर निर्णय लेने से पहले MiniMax H3 API को Atlas Cloud पर होस्ट किए गए अन्य वीडियो मॉडलों के साथ मिलाकर देखें और समझें कि input modalities, reference limits, length, resolution और audio output वास्तव में कैसे अलग हैं।
| Model | Input Modalities | अधिकतम Reference Files | Output Duration | अधिकतम Resolution | Native Audio |
|---|---|---|---|---|---|
| MiniMax H3 | टेक्स्ट, इमेज, वीडियो, ऑडियो | 9 इमेज, 3 वीडियो, 3 ऑडियो क्लिप, कुल 12 files | 5s से 15s तक | 24 FPS पर 1440p | √ हर output में नेटिव stereo audio |
| Seedance 2.0 Reference-to-Video | टेक्स्ट, इमेज, वीडियो, ऑडियो | 9 इमेज, 3 वीडियो, 3 ऑडियो क्लिप | 15s तक | 720p | √ Stereo dialogue, effects और music एक ही pass में generated |
| Veo3.1 Reference-to-video | टेक्स्ट और इमेज | 3 reference images | 4s, 6s या 8s | सिर्फ 8s length पर 4K | √ Timeline के साथ aligned dialogue, ambience और sound effects |
| Wan-2.7 Reference-to-video | टेक्स्ट, इमेज, वीडियो, ऑडियो | 5 इमेज या वीडियो क्लिप, साथ में एक voice clip | 2s से 15s तक | 1080p | √ Music और effects generated, या अपने audio से lip sync चलाएं |
| Kling v3.0 Pro Image-to-Video | टेक्स्ट और इमेज | - | 15s तक | 1080p | √ पांच भाषाओं में lip sync के साथ multilingual dialogue |
कुछ ही मिनटों में शुरू करें — इन सरल चरणों का पालन करके Atlas Cloud प्लेटफ़ॉर्म के ज़रिए मॉडल इंटीग्रेट और डिप्लॉय करें।
atlascloud.ai पर साइन अप करें और वेरिफिकेशन पूरा करें। नए यूज़र्स को प्लेटफ़ॉर्म एक्सप्लोर करने और मॉडल टेस्ट करने के लिए फ्री क्रेडिट मिलते हैं।
बेजोड़ प्रदर्शन, स्केलेबिलिटी और विकास अनुभव के लिए उन्नत MiniMax H3 मॉडल को Atlas Cloud के GPU त्वरण प्लेटफ़ॉर्म के साथ संयोजित करें।
कम विलंबता:
रियल-टाइम प्रतिक्रिया के लिए GPU-अनुकूलित इंफरेंसिंग।
एकीकृत API:
MiniMax H3, GPT, Gemini और DeepSeek के लिए एक इंटीग्रेशन।
पारदर्शी मूल्य निर्धारण:
प्रति token बिलिंग, Serverless मोड का समर्थन।
डेवलपर अनुभव:
SDK, डेटा एनालिटिक्स, फाइन-ट्यूनिंग टूल और टेम्पलेट पूरी तरह से उपलब्ध हैं।
विश्वसनीयता:
99.99% उपलब्धता, RBAC अनुमति नियंत्रण, अनुपालन लॉगिंग।
सुरक्षा और अनुपालन:
SOC 2 Type II प्रमाणन, HIPAA अनुपालन, US डेटा संप्रभुता।
MiniMax H3 API डेवलपर्स को MiniMax H3 तक programmatic access देती है। यह एक open general purpose multimodal video model है, जो text, images, video और audio को एक shared context के रूप में समझता है। Generation, editing और reference को अलग-अलग task models में बाँटने के बजाय, H3 पूरे input set को पढ़ता है और sound के साथ एक finished clip लौटाता है। Atlas Cloud पर यह एक single API key के पीछे चलता है और pay-as-you-go pricing देता है।
Brand films, trailers, vertical short drama, product और ecommerce spots, game और UI motion demos, और stylized animation—ये सब इसकी क्षमता के दायरे में आते हैं। क्योंकि model on screen text, subtitles और brand assets को संभाल सकता है, teams इसे production budget commit करने से पहले concept validation, storyboard previews और visual pitches के लिए भी इस्तेमाल करती हैं।
Atlas Cloud account बनाएँ, API key generate करें, फिर video generation endpoint पर prompt और कोई भी reference files भेजें और finished result के लिए poll करें। Inline uploads के बजाय media को hosted URLs के रूप में pass करना बेहतर है, क्योंकि request body 64MB तक capped है। आज ही building शुरू करें।
Billing pay-as-you-go है, इसलिए subscription या seat license खरीदने के बजाय आप per call pay करते हैं। Cost इस बात पर निर्भर करती है कि आप वास्तव में क्या render करते हैं, यानी resolution और clip length किसी batch के total cost को drive करते हैं। Large volume runs plan करने से पहले current per generation rate के लिए model page देखें।
हाँ। हर H3 result native stereo में sound के साथ deliver होता है, इसलिए dialogue, effects और ambience picture के साथ उसी pass में मिलते हैं। अगर आप reference audio clip देते हैं, तो model उस timbre को किसी character पर carry कर सकता है, जिससे pipeline से अलग voice synthesis step हट जाता है।
Clips 24 FPS पर 5 से 15 seconds तक चलते हैं। 1440p mode में, 16:9 और 9:16 के बीच ratios के लिए short side 1440 pixels पर render होता है, और इस band से बाहर frame में कुल मिलाकर लगभग 3.7M pixels रहते हैं, उदाहरण के लिए 21:9 पर 2976 by 1248। Text to video और omni reference requests 21:9, 16:9, 4:3, 1:1, 3:4 और 9:16 accept करते हैं, जबकि first और last frame requests input image का aspect ratio inherit करते हैं।
एक prompt के साथ up to nine images, three video segments और three audio clips भेजे जा सकते हैं, total twelve files तक capped। Video और audio, दोनों combined 15 seconds के भीतर रहते हैं, और audio को अकेले आने के बजाय किसी image या video के साथ होना चाहिए। Prompts 7000 characters तक जा सकते हैं, जिससे camera, performance और sound को cover करने वाली shot by shot direction के लिए पर्याप्त जगह मिलती है।
Accepted inputs में H.264 और H.265 video, JPG, JPEG, PNG, WEBP, HEIC और HEIF images, और WAV या MP3 audio शामिल हैं, साथ ही video file के अंदर audio track के लिए AAC या MP3। Per file ceilings video के लिए 50MB, images के लिए 30MB और audio के लिए 15MB हैं। क्योंकि request body 64MB तक limited है, heavy assets के लिए hosted URLs अधिक सुरक्षित विकल्प रहते हैं।
Editing इसके core modes में से एक है। Source clip को instructions के साथ भेजें और MiniMax H3 API characters या objects swap कर सकता है, backgrounds और lighting replace कर सकता है, visual effects layer कर सकता है, और untouched regions को stable रखते हुए dialogue rewrite कर सकता है। Compound instructions एक ही request में handle होते हैं, इसलिए कई changes repeated round trips के बजाय साथ में लागू हो जाते हैं।
अधिकतर video models एक prompt और एक image लेते हैं और silent clip लौटाते हैं। H3 इसके बजाय references का mixed set consume करता है, उन सभी में character, motion, camera और sound intent को समझता है, फिर native audio के साथ clip लौटाता है। अगर आपकी pipeline अभी video model, voice model और editor को साथ stitch करती है, तो H3 उन stages को एक single call में collapse कर देता है।
Atlas Cloud का भरपूर लाभ उठाने में मदद करने वाली गाइड, ट्यूटोरियल और प्रोडक्ट अपडेट।