

MiniMax H3 API öppnar upp MiniMaxs allmänna multimodala videomodell, som läser text, bilder, video och ljud som en enda kontext i stället för en uppgift i taget. Klipp körs i 5 till 15 sekunder med 24 FPS i bildformat från 21:9 till 9:16, och en enda prompt kan byta ut karaktärer, ersätta bakgrunder, skriva om dialog eller klona en röst från ett referensklipp. Atlas Cloud levererar allt via en enda OpenAI-kompatibel endpoint. Börja bygga i dag.
Atlas Cloud förser dig med de senaste branschledande kreativa modellerna.
Varje MiniMax H3 API-endpoint tolkar text, bilder, video och ljud på olika sätt, så gå igenom raderna nedan och matcha en modalitet med det du bygger.
| Modalitet | Beskrivning |
|---|---|
| MiniMax H3 T2V API (Text to Video) | Skriv en prompt på upp till 7,000 tecken så returnerar modellen ett klipp på 5 till 15 sekunder i 24 FPS och 1440p, med inbyggt stereoljud genererat i samma körning. Bildförhållandet anges per request och kan vara 21:9, 16:9, 4:3, 1:1, 3:4 eller 9:16, så ett enda anrop täcker både filmiska trailers och vertikala klipp för sociala medier. |
| MiniMax H3 I2V API (Image to Video) | En bild anger öppningsbildrutan och två bilder låser både den första och den sista, medan H3 fyller i rörelsen däremellan med samma bildförhållande som indatabilden. Källor från 256 till 5760 pixlar per sida accepteras, vilket gör det enkelt att sätta key art, produktbilder och storyboard-rutor i rörelse. |
| MiniMax H3 Omni Reference API (Reference to Video) | Behöver du flera källor som fungerar tillsammans? Upp till nio bilder, tre videoklipp och tre ljudspår ryms i en enda request inom en gräns på 12 filer, och alla läses som en gemensam multimodal kontext. För över en karaktär, en kamerarörelse eller en röstklang mellan tagningar, eller redigera ett befintligt klipp genom att byta ut motiv, bakgrunder och repliker. |
Varje klipp som MiniMax H3 API returnerar är upp till femton sekunder långt i 1440p med inbyggt stereoljud, skapat från valfri kombination av text-, bild-, video- och röstreferenser, och samma anrop kan även redigera karaktärer, scener och dialog i material du redan har.
En MiniMax H3 API-förfrågan accepterar upp till nio referensbilder, tre videoklipp och tre ljudspår, med ett tak på tolv filer. I stället för att läsa dem som separata fack behandlar modellen text, bild och ljud som ett enda sammanhang och hämtar en karaktär från ett foto, en kamerarörelse från ett klipp och en stämning från ett ljudspår till samma scen. Team med befintligt material får en direkt väg till en färdig tagning.
Varje resultat levereras med ljud. Dialog, atmosfärljud och musik produceras i inbyggd stereo under samma körning som renderar bilden i 24 bilder per sekund, så inget behöver tonsättas eller dubbas i efterhand. Eftersom tajmningen bestäms medan tagningen genereras förblir fotsteg, tal och klipp synkade med handlingen. Korta annonser och sociala klipp kommer ut redo att publiceras.
Behöver du byta ut en katt mot en hund, ersätta en green screen eller skriva om en dialogreplik? MiniMax H3 API tillämpar sådana redigeringar på video som du skickar in och täcker karaktärer, objekt, bakgrunder, ljussättning och effekter, medan delar du inte nämner förblir nära originalet. Prompter kan vara upp till 7000 tecken, så ett dussin ändringar kan staplas i en enda körning. Det gör det praktiskt att iterera på en godkänd klippning.
Skicka med ett röstprov tillsammans med dina bilder eller ditt videomaterial så talar den genererade karaktären med samma klangfärg. Upp till tre ljudreferenser är tillåtna per förfrågan, vardera mellan två och femton sekunder, och ljud måste alltid följa med visuell indata i stället för att skickas in på egen hand. Befintlig dialog kan också ersättas och framförandet justeras för att matcha. Vid serieproduktion behålls en igenkännbar röst i varje avsnitt.
Klipp är mellan fem och femton sekunder långa, och 1440p-läget placerar 1440 pixlar på kortsidan mellan 16:9 och 9:16, eller ungefär 3,7 megapixlar vid bredare format som 2976 × 1248 för 21:9. Sex format kan väljas, från filmiska 21:9 till vertikala 9:16, och MiniMax H3 API kan även välja ett åt dig. Det spannet täcker en trailer, en produktloop och ett vertikalt drama utan att byta modell.
Om dina källfiler kommer direkt från en kamera eller en redigeringstidslinje kan de skickas in som de är: H.264- och H.265-video, JPG-, PNG-, WEBP-, HEIC- och HEIF-stillbilder samt WAV- och MP3-ljud. Gränserna per fil är 50MB för video, 30MB för bilder och 15MB för ljud, medan resurser via URL håller förfrågningar inom body-gränsen på 64MB. På Atlas Cloud körs hela uppsättningen via en enda OpenAI-kompatibel nyckel med pay-as-you-go-debitering.
Varje klipp i den här uppsättningen kommer från en och samma prompt som skickats till MiniMax H3 API och två andra videomodeller på Atlas Cloud, så att rörelse, ljud och följsamhet mot instruktionerna kan jämföras utan att ändra ett enda ord.
15 seconds, 16:9 kortvideo i liggande format. Live-action-material från en självbetjänings-tvättomat sent på natten, blandat med handritad, lysande animation till en mixed media-bild. En liten självbetjänings-tvättomat där lysrören flimrar svagt; inuti finns tvättmaskiner som är igång, tvättkorgar i plast och en gammal bänk, med en ensam strumpa på golvet. Hela lokalen är tyst och bär på en svagt nostalgisk stämning. Bilden har känslan av handhållet mobilmaterial filmat med en hand, med tydliga kameraskakningar; det vita lysrörsljuset gör att exponeringen växlar mellan ljust och mörkt; glasytor har omgivande reflektioner; det uppstår en fokusfördröjning när linsen rör sig nära objekt. Bilden ska inte vara lika polerad och välordnad som en reklamfilm — helhetskänslan ska vara som en äkta dokumentär ögonblicksbild, som om du råkade snubbla in sent på natten och fångade bilden medan du jagade en märklig, drömlik vision.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Förstapersonsperspektiv · ögonhöjd · handhållen spelkamera Scen: Bilden simulerar en spelare som styr ett FPS-spel med modern krigföring, med båda händerna runt en automatkarbin medan spelaren långsamt avancerar längs den yttre perimetern av en militärbas. Spelaren rör sig framåt längs en väg bredvid skydd, siktkorset sveper över passagen framför; efter en kort paus avfyras några skott mot ett avlägset mål, sedan fortsätter spelaren pressa framåt — som liveinspelat gameplay från en vanlig spelare. Ljussättning: Det svala naturliga ljuset från en modern militärbas vävs samman med rök och mynningseld. Bilden är realistisk och skarp, där det metalliska vapnet samt slagfältets damm och dis har en AAA-spelskvalitet. Kameraarbete: Kameran har en lätt handhållen svajning när spelaren rör sig — först långsamt framåt, sedan med små svep åt vänster och höger för att observera, med en subtil rekylskakning vid avfyrning, innan spelaren till sist fortsätter stadigt framåt.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Från varumärkesfilmer och vertikala dramaserier till produktklipp, spelgrafik och precisa redigeringar av befintligt material täcker MiniMax H3 API varje scenario via en multimodal begäran som returnerar video med inbyggt stereoljud.
Skicka storyboardrutor och en shot list i ett enda anrop för 1440p-trailrar, TVC-spottar och modekampanjer i 24 FPS. Inbyggt stereoljud ingår i varje resultat, så varumärkesteam kan granska färdigklippta versioner.
Vertikalt 9:16-format täcker manusbaserade dramascener, från kostymmysterier till familjekonfrontationer, med dialog som röstläggs i samma körning. Studior som bygger bibliotek med kortdraman får 15-sekunders hooks utan att boka skådespelare eller studioscener.
Om en tagning behöver ett specifikt ansikte och en viss rörelse kan upp till nio bilder, tre videor och tre ljudklipp styra ett enda anrop. Karaktärsidentitet, kameraarbete och röstklang hålls konsekventa över avsnitt.
Behöver du göra en ändring i efterhand? Befintligt material kan redigeras med prompt: byt ut ett motiv, ersätt en bakgrund, justera ljussättning eller skriv om en talad replik utan att spela in en enda bildruta på nytt.
Produktfoton blir rörligt material: en referensbild förvandlas till en 360 degree-visning, en funktionsförklaring eller ett betalt socialt klipp. Bildformat från 21:9 till 9:16 låter en och samma uppsättning resurser användas för alla placeringar.
Stiliserat resultat håller för game CG, character PV, anime-intros och gränssnittsdemon där menyer, HUD-element och textöverlägg måste förbli läsbara. Art teams använder det för konceptvalidering före produktion.
Jämför MiniMax H3 API med de andra videomodellerna som finns på Atlas Cloud och se hur indatamodaliteter, referensgränser, längd, upplösning och ljudutdata faktiskt skiljer sig innan du bestämmer dig för en endpoint.
| Model | Indatamodaliteter | Maximalt antal referensfiler | Utdatalängd | Maxupplösning | Inbyggt ljud |
|---|---|---|---|---|---|
| MiniMax H3 | Text, bild, video, ljud | 9 bilder, 3 videor, 3 ljudklipp, totalt 12 filer | 5s till 15s | 1440p vid 24 FPS | √ Inbyggt stereoljud i varje utdata |
| Seedance 2.0 Reference-to-Video | Text, bild, video, ljud | 9 bilder, 3 videor, 3 ljudklipp | Upp till 15s | 720p | √ Stereodialog, effekter och musik genereras i ett enda pass |
| Veo3.1 Reference-to-video | Text och bild | 3 referensbilder | 4s, 6s eller 8s | 4K endast vid 8s längd | √ Dialog, miljöljud och ljudeffekter synkas med tidslinjen |
| Wan-2.7 Reference-to-video | Text, bild, video, ljud | 5 bilder eller videoklipp, plus ett röstklipp | 2s till 15s | 1080p | √ Musik och effekter genereras, eller styr läppsynk med ditt eget ljud |
| Kling v3.0 Pro Image-to-Video | Text och bild | - | Upp till 15s | 1080p | √ Flerspråkig dialog med läppsynk på fem språk |
Get started in minutes — follow these simple steps to integrate and deploy models through Atlas Cloud’s platform.
Registrera dig på atlascloud.ai och slutför verifieringen. Nya användare får gratis krediter för att utforska plattformen och testa modeller.
Att kombinera de avancerade MiniMax H3-modellerna med Atlas Clouds GPU-accelererade plattform ger oöverträffad prestanda, skalbarhet och utvecklarupplevelse.
Låg Latens:
GPU-optimerad inferens för realtidsresonemang.
Enhetligt API:
Kör MiniMax H3, GPT, Gemini och DeepSeek med en integration.
Transparent Prissättning:
Förutsägbar fakturering per token med serverlösa alternativ.
Utvecklarupplevelse:
SDK:er, analys, finjusteringsverktyg och mallar.
Tillförlitlighet:
99.99% drifttid, RBAC och efterlevnadsredo loggning.
Säkerhet & Efterlevnad:
SOC 2 Type II, HIPAA-anpassning, datasuveränitet i USA.
MiniMax H3 API ger utvecklare programmatisk åtkomst till MiniMax H3, en öppen multimodal videomodell för allmän användning som behandlar text, bilder, video och ljud som en gemensam kontext. I stället för att dela upp generering, redigering och referenser i separata uppgiftsmodeller läser H3 hela indatauppsättningen och returnerar ett färdigt klipp med ljud. På Atlas Cloud körs den bakom en enda API key med pay-as-you-go-prissättning.
Varumärkesfilmer, trailers, vertikala kortdraman, produkt- och e-handelsspotar, rörelsedemon för spel och UI samt stiliserad animation ryms alla inom dess område. Eftersom modellen hanterar text på skärmen, undertexter och varumärkestillgångar använder team den även för konceptvalidering, storyboard-förhandsvisningar och visuella pitchar innan de avsätter produktionsbudget.
Skapa ett Atlas Cloud-konto, generera en API key och skicka sedan en prompt plus eventuella referensfiler till video generation endpoint och polla efter det färdiga resultatet. Att skicka media som hostade URL:er rekommenderas framför inline-uppladdningar, eftersom request body är begränsad till 64MB. Börja bygga i dag.
Faktureringen är pay-as-you-go, så du betalar per anrop i stället för att köpa en prenumeration eller en seat license. Kostnaden följer det du faktiskt renderar, vilket innebär att upplösning och klipplängd styr totalsumman för en batch. Kontrollera modellsidan för aktuell per generation-taxa innan du planerar körningar med stora volymer.
Ja. Varje H3-resultat levereras med ljud i native stereo, så dialog, effekter och miljöljud kommer i samma pass som bilden. Ange ett referensljudklipp så kan modellen föra över den klangfärgen till en karaktär, vilket tar bort ett separat steg för röstsyntes från pipelinen.
Klipp är från 5 till 15 sekunder vid 24 FPS. I 1440p-läge renderas den korta sidan i 1440 pixlar för bildförhållanden mellan 16:9 och 9:16, och utanför det intervallet håller bildrutan totalt cirka 3.7M pixlar, till exempel 2976 gånger 1248 vid 21:9. Text to video- och omni reference-förfrågningar accepterar 21:9, 16:9, 4:3, 1:1, 3:4 och 9:16, medan first and last frame-förfrågningar ärver indatabildens bildförhållande.
Upp till nio bilder, tre videosegment och tre ljudklipp kan skickas tillsammans med en prompt, med ett tak på totalt tolv filer. Video och ljud får vardera vara högst 15 sekunder sammanlagt, och ljud måste följa med en bild eller en video i stället för att skickas på egen hand. Prompter kan vara upp till 7000 tecken, vilket ger utrymme för bild-för-bild-regi som täcker kamera, framförande och ljud.
Accepterade indata omfattar H.264- och H.265-video, JPG-, JPEG-, PNG-, WEBP-, HEIC- och HEIF-bilder samt WAV- eller MP3-ljud, med AAC eller MP3 för ljudspåret i en videofil. Gränserna per fil är 50MB för video, 30MB för bilder och 15MB för ljud. Eftersom request body är begränsad till 64MB är hostade URL:er fortfarande det säkrare alternativet för tunga assets.
Redigering är ett av dess kärnlägen. Skicka ett källklipp med instruktioner så kan MiniMax H3 API byta ut karaktärer eller objekt, ersätta bakgrunder och ljussättning, lägga på visuella effekter och skriva om dialog samtidigt som orörda områden hålls stabila. Sammansatta instruktioner hanteras i en enda förfrågan, så flera ändringar landar tillsammans i stället för över upprepade tur-och-retur-anrop.
De flesta videomodeller tar en prompt plus en bild och returnerar ett tyst klipp. H3 tar i stället in en blandad uppsättning referenser, läser av avsikten för karaktär, rörelse, kamera och ljud över dem alla och returnerar sedan ett klipp med native audio. Om din pipeline i dag syr ihop en videomodell, en röstmodell och en editor kollapsar H3 dessa steg till ett enda anrop.
Guider, handledningar och produktnyheter som hjälper dig att få ut mesta möjliga av Atlas Cloud.