

De MiniMax H3 API ontsluit MiniMax's algemene multimodale videomodel, dat tekst, afbeeldingen, video en audio als één context verwerkt in plaats van taak voor taak. Clips duren 5 tot 15 seconden bij 24 FPS, met beeldverhoudingen van 21:9 tot 9:16, en met één prompt kun je personages verwisselen, achtergronden vervangen, dialogen herschrijven of een stem klonen op basis van een referentieclip. Atlas Cloud levert dit alles via één OpenAI-compatible endpoint. Begin vandaag nog met bouwen.
Atlas Cloud biedt u de nieuwste toonaangevende creatieve modellen in de industrie.
Every MiniMax H3 API endpoint reads text, images, video, and audio differently, so scan the rows below and match a modality to what you are building.
| Modality | Description |
|---|---|
| MiniMax H3 T2V API (Text to Video) | Write a prompt of up to 7,000 characters and the model returns a 5 to 15 second clip at 24 FPS in 1440p, with native stereo sound generated in the same pass. Aspect ratio is set per request across 21:9, 16:9, 4:3, 1:1, 3:4, and 9:16, so one call covers cinematic trailers and vertical social cuts alike. |
| MiniMax H3 I2V API (Image to Video) | One image sets the opening frame and two lock both the first and the last, with H3 filling in the motion between them at the aspect ratio of the input image. Sources from 256 to 5760 pixels per side are accepted, which makes key art, product stills, and storyboard frames straightforward to put into motion. |
| MiniMax H3 Omni Reference API (Reference to Video) | Need several sources working together? Up to nine images, three video clips, and three audio tracks fit in a single request under a 12 file cap, all read as one multimodal context. Carry a character, a camera move, or a voice timbre across shots, or edit an existing clip by swapping subjects, backgrounds, and spoken lines. |
Elke clip die de MiniMax H3 API teruggeeft, duurt maximaal 15 seconden op 1440p met native stereogeluid, opgebouwd uit elke combinatie van tekst-, beeld-, video- en stemreferenties. Met dezelfde aanroep kun je ook personages, scènes en dialogen bewerken in beeldmateriaal dat je al hebt.
Eén MiniMax H3 API-request accepteert maximaal 9 referentiebeelden, 3 videoclips en 3 audiotracks, met een limiet van 12 bestanden. In plaats van ze als losse slots te lezen, behandelt het model tekst, beeld en geluid als één context: het haalt een personage uit een foto, een camerabeweging uit een clip en een sfeer uit een track naar dezelfde scène. Teams met bestaand materiaal krijgen zo een directe route naar een afgewerkt shot.
Elk resultaat wordt geleverd met geluid. Dialoog, omgevingsgeluid en muziek worden in native stereo geproduceerd tijdens dezelfde pass waarin het beeld op 24 frames per second wordt gerenderd, zodat er achteraf niets hoeft te worden gecomponeerd of nagesynchroniseerd. Omdat de timing wordt bepaald terwijl het shot wordt gegenereerd, blijven voetstappen, spraak en cuts strak gekoppeld aan de actie. Korte advertenties en social spots komen er publicatieklaar uit.
Moet een kat worden vervangen door een hond, een green screen worden vervangen of één dialoogregel worden herschreven? De MiniMax H3 API past dit soort edits toe op video die je aanlevert, voor personages, objecten, achtergronden, belichting en effecten, terwijl onderdelen die je niet noemt dicht bij het origineel blijven. Prompts kunnen tot 7000 characters lang zijn, zodat je een dozijn wijzigingen in één pass kunt stapelen. Zo wordt itereren op een goedgekeurde cut praktisch haalbaar.
Stuur een stemvoorbeeld mee naast je beelden of footage, en het gegenereerde personage spreekt met dat timbre. Per request zijn maximaal 3 audioreferenties toegestaan, elk tussen 2 en 15 seconden, en audio moet altijd samen met visuele input worden aangeleverd in plaats van los. Bestaande dialoog kan ook worden vervangen en de performance kan worden aangepast zodat die past. Bij seriewerk blijft één herkenbare stem in elke aflevering behouden.
Clips duren 5 tot 15 seconden, en de 1440p-modus plaatst 1440 pixels op de korte zijde tussen 16:9 en 9:16, of ongeveer 3,7 megapixels bij bredere verhoudingen zoals 2976 by 1248 voor 21:9. Er zijn 6 verhoudingen selecteerbaar, van cinematografisch 21:9 tot verticaal 9:16, en de MiniMax H3 API kan er ook één voor je kiezen. Dat bereik dekt een trailer, een productloop en een verticaal drama zonder van model te wisselen.
Als je bronbestanden rechtstreeks uit een camera of montagetijdlijn komen, gaan ze erin zoals ze zijn: H.264- en H.265-video, JPG-, PNG-, WEBP-, HEIC- en HEIF-stills, plus WAV- en MP3-audio. Limieten per bestand zijn 50MB voor video, 30MB voor beelden en 15MB voor audio, terwijl assets doorgeven via URL requests binnen de bodylimiet van 64MB houdt. Op Atlas Cloud draait de hele set via één OpenAI-compatible API-sleutel met betalen naar gebruik.
Elke clip in deze set is afkomstig van één identieke prompt die naar de MiniMax H3 API en twee andere videomodellen op Atlas Cloud is gestuurd, zodat beweging, geluid en instructietrouw kunnen worden vergeleken zonder ook maar één woord te wijzigen.
15 seconds, 16:9 landscape korte video. Live-actionbeelden van een zelfbedieningswasserette laat op de avond, gemengd met handgetekende, gloeiende animatie tot een mixed-media beeld. Een kleine zelfbedieningswasserette, met tl-lichten die zachtjes flikkeren; binnen staan draaiende wasmachines, plastic wasmanden en een oude bank, met één sok die op de vloer ligt. De hele ruimte is stil en heeft een vage, nostalgische sfeer. Het beeld heeft de textuur van met één hand gemaakte handheld telefoonbeelden, met duidelijk merkbare cameratrilling; het witte tl-licht laat de belichting schommelen tussen helder en gedimd; glazen oppervlakken tonen omgevingsreflecties; er is focusvertraging wanneer de lens dicht bij objecten komt. Het beeld mag niet zo gepolijst en ordelijk zijn als een commerciële advertentie — het totaalgevoel moet lijken op een authentieke documentaire momentopname, alsof je er laat op de avond toevallig binnenliep en de opname maakte terwijl je een vreemd, droomachtig visioen probeerde vast te leggen.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
First-person-perspectief · ooghoogte · handheld gaming camera Scène: De opname simuleert een speler die een modern-warfare FPS-game speelt, met beide handen een aanvalsgeweer vasthoudend terwijl hij langzaam langs de buitenste perimeter van een militaire basis oprukt. De speler beweegt vooruit over een weg naast dekking, terwijl het richtkruis over de doorgang voor hem heen beweegt; na een korte pauze vuurt hij een paar schoten af op een doel in de verte en blijft daarna vooruit pushen — zoals live gameplaybeelden van een gewone speler. Belichting: Het koel getinte natuurlijke licht van een moderne militaire basis vermengt zich met rook en mondingsvuur. Het beeld is realistisch en scherp, waarbij het metalen wapen en het stof en de nevel van het slagveld een AAA-gamekwaliteit hebben. Camerawerk: De camera heeft een lichte handheld-beweging terwijl de speler zich verplaatst — eerst langzaam oprukkend, daarna kleine bewegingen naar links en rechts makend om te observeren, met een subtiele terugslagtrilling bij het vuren, om uiteindelijk weer gestaag vooruit te pushen.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Van brand films en verticale drama’s tot productcuts, gamevisuals en nauwkeurige edits van bestaand beeldmateriaal: de MiniMax H3 API dekt elk scenario af via één multimodaal request dat video met native stereo-audio retourneert.
Voer storyboardframes en een shotlist in één call in voor 1440p-trailers, TVC-spots en modecampagnes op 24 FPS. Native stereo-audio wordt met elk resultaat meegeleverd, zodat brand teams afgewerkte cuts kunnen beoordelen.
Verticale 9:16-output dekt gescripte dramas scènes, van kostuummysterie tot familieconfrontatie, met dialoog die in dezelfde pass wordt ingesproken. Studio’s die short drama-bibliotheken bouwen, krijgen hooks van 15 seconden zonder acteurs of stages te boeken.
Als een shot een specifiek gezicht en specifieke beweging nodig heeft, kunnen maximaal negen afbeeldingen, drie video’s en drie audioclips één call aansturen. Character identity, camerawerk en vocale klankkleur blijven consistent over afleveringen heen.
Achteraf een wijziging nodig? Bestaand beeldmateriaal kan via een prompt worden bewerkt: verwissel een onderwerp, vervang een achtergrond, pas de belichting aan of herschrijf een gesproken zin zonder ook maar één frame opnieuw te draaien.
Productfoto’s komen in beweging: één referentieafbeelding wordt een 360 degree showcase, een feature-uitleg of een betaalde social cut. Beeldverhoudingen van 21:9 tot 9:16 laten één set assets elke plaatsing voeden.
Gestileerde output blijft overtuigend voor game CG, character PV, anime-openings en interfacedemo’s waarin menu’s, HUD elements en tekstoverlays leesbaar moeten blijven. Art teams gebruiken dit voor conceptvalidatie vóór productie.
Zet de MiniMax H3 API naast de andere videomodellen die op Atlas Cloud worden gehost en zie hoe inputmodaliteiten, referentielimieten, lengte, resolutie en audio-output daadwerkelijk verschillen voordat je je vastlegt op een endpoint.
| Model | Inputmodaliteiten | Max. aantal referentiebestanden | Outputduur | Max. resolutie | Native audio |
|---|---|---|---|---|---|
| MiniMax H3 | Tekst, afbeelding, video, audio | 9 afbeeldingen, 3 video's, 3 audioclips, 12 bestanden in totaal | 5s tot 15s | 1440p bij 24 FPS | √ Native stereo-audio bij elke output |
| Seedance 2.0 Reference-to-Video | Tekst, afbeelding, video, audio | 9 afbeeldingen, 3 video's, 3 audioclips | Tot 15s | 720p | √ Stereodialoog, effecten en muziek in één pass gegenereerd |
| Veo3.1 Reference-to-video | Tekst en afbeelding | 3 referentieafbeeldingen | 4s, 6s of 8s | 4K alleen bij een lengte van 8s | √ Dialoog, ambiance en geluidseffecten uitgelijnd op de tijdlijn |
| Wan-2.7 Reference-to-video | Tekst, afbeelding, video, audio | 5 afbeeldingen of videoclips, plus één stemclip | 2s tot 15s | 1080p | √ Muziek en effecten gegenereerd, of stuur lipsynchronisatie aan met je eigen audio |
| Kling v3.0 Pro Image-to-Video | Tekst en afbeelding | - | Tot 15s | 1080p | √ Meertalige dialoog met lipsynchronisatie in vijf talen |
Binnen enkele minuten aan de slag — volg deze eenvoudige stappen om modellen te integreren en uit te rollen via het platform van Atlas Cloud.
Registreer bij atlascloud.ai en voltooi de verificatie. Nieuwe gebruikers ontvangen gratis credits om het platform te verkennen en modellen te testen.
De combinatie van MiniMax H3's geavanceerde modellen met het GPU-versnelde platform van Atlas Cloud biedt ongeëvenaarde prestaties, schaalbaarheid en ontwikkelaarservaring.
Lage Latentie:
GPU-geoptimaliseerde inferentie voor realtime reasoning.
Uniforme API:
Voer MiniMax H3, GPT, Gemini en DeepSeek uit met één integratie.
Transparante Prijzen:
Voorspelbare op tokens gebaseerde facturering met serverloze opties.
Ontwikkelaarservaring:
SDK's, analytics, fine-tuning tools en sjablonen.
Betrouwbaarheid:
99,99% beschikbaarheid, RBAC en compliance-ready logging.
Beveiliging & Compliance:
SOC 2 Type II, HIPAA-afstemming, gegevenssoevereiniteit in VS.
De MiniMax H3 API geeft developers programmatische toegang tot MiniMax H3, een open, algemeen inzetbaar multimodaal videomodel dat tekst, afbeeldingen, video en audio als één gedeelde context behandelt. In plaats van generatie, bewerking en referenties op te splitsen in afzonderlijke taakmodellen, leest H3 de volledige inputset en levert het een afgewerkte clip met geluid op. Op Atlas Cloud draait het achter één API key met pay-as-you-go-prijzen.
Brand films, trailers, verticale short drama, product- en ecommerce-spots, game- en UI-motiondemo's en gestileerde animatie vallen allemaal binnen het bereik. Omdat het model on screen text, ondertitels en brand assets verwerkt, gebruiken teams het ook voor conceptvalidatie, storyboardpreviews en visuele pitches voordat ze productiebudget vastleggen.
Maak een Atlas Cloud-account aan, genereer een API key en stuur vervolgens een prompt plus eventuele referentiebestanden naar de video generation endpoint en poll naar het voltooide resultaat. Media doorgeven als hosted URLs wordt aanbevolen boven inline uploads, omdat de request body is begrensd op 64MB. Begin vandaag nog met bouwen.
Facturering is pay-as-you-go, dus je betaalt per call in plaats van een abonnement of seat license te kopen. De kosten volgen wat je daadwerkelijk rendert, wat betekent dat resolutie en cliplengte het totaal voor een batch bepalen. Controleer de modelpagina voor het actuele tarief per generation voordat je runs met grote volumes plant.
Ja. Elk H3-resultaat wordt geleverd met geluid in native stereo, zodat dialoog, effecten en ambience in dezelfde pass als het beeld meekomen. Lever een referentie-audioclip aan en het model kan dat timbre op een personage overbrengen, waardoor een aparte stap voor spraaksynthese uit de pipeline verdwijnt.
Clips lopen van 5 tot 15 seconden op 24 FPS. In 1440p mode rendert de korte zijde op 1440 pixels voor verhoudingen tussen 16:9 en 9:16, en buiten die band bevat het frame in totaal ongeveer 3.7M pixels, bijvoorbeeld 2976 bij 1248 op 21:9. Text to video- en omni reference-requests accepteren 21:9, 16:9, 4:3, 1:1, 3:4 en 9:16, terwijl first and last frame-requests de beeldverhouding van de inputafbeelding overnemen.
Maximaal negen afbeeldingen, drie videosegmenten en drie audioclips kunnen met één prompt worden meegestuurd, met een maximum van twaalf bestanden in totaal. Video en audio blijven elk gecombineerd binnen 15 seconden, en audio moet vergezeld gaan van een afbeelding of video in plaats van op zichzelf binnen te komen. Prompts kunnen 7000 tekens bevatten, wat ruimte laat voor shot-by-shot-aanwijzingen voor camera, performance en geluid.
Geaccepteerde inputs zijn onder meer H.264- en H.265-video, JPG-, JPEG-, PNG-, WEBP-, HEIC- en HEIF-afbeeldingen en WAV- of MP3-audio, met AAC of MP3 voor de audiotrack in een videobestand. De limieten per bestand zijn 50MB voor video, 30MB voor afbeeldingen en 15MB voor audio. Omdat de request body is beperkt tot 64MB, blijven hosted URLs de veiligere route voor zware assets.
Bewerken is een van de kernmodi. Stuur een bronclip met instructies en de MiniMax H3 API kan personages of objecten vervangen, achtergronden en belichting wijzigen, visuele effecten toevoegen en dialoog herschrijven terwijl onaangeraakte gebieden stabiel blijven. Samengestelde instructies worden in één request verwerkt, zodat meerdere wijzigingen samen landen in plaats van via herhaalde round trips.
De meeste videomodellen nemen één prompt plus één afbeelding en leveren een stille clip terug. H3 verwerkt in plaats daarvan een gemengde set referenties, leest intentie voor personage, beweging, camera en geluid over al die referenties heen en levert vervolgens een clip met native audio terug. Als je pipeline momenteel een videomodel, een spraakmodel en een editor aan elkaar koppelt, brengt H3 die fases terug tot één call.
Handleidingen, tutorials en productupdates om het meeste uit Atlas Cloud te halen.