ENDAST TVÅ VECKOR | 20% RABATT på Seedream 5.0 Pro!

MiniMax H3 är live: Native 2K-video, ett pass och lägre kostnad per sekund

MiniMax H3 är live på Atlas Cloud: inbyggd 2K-video med stereo-ljud i ett enda steg. Se verklig prissättning per sekund, tre API-anslutningspunkter och kopieringsfärdiga prompts.

Högre upplösning har alltid inneburit en högre räkning. MiniMax H3 bryter tyst den regeln. Det renderar direkt till native 2K, och priset per sekund ligger under vad en 720p-klipp kostar på den videomodell de flesta tar till först.

 

 

Det är rubriken, men upplösningen och priset är bara hälften av vad som gör MiniMax H3 intressant. Den andra hälften är hur det fungerar: en modell som läser text, bild, video och ljud tillsammans och returnerar ett färdigt klipp, bild och ljud, i ett enda steg. Nedan följer vad den gör, vad den kostar och de exakta promptarna som producerade varje klipp i den här artikeln.

Viktiga slutsatser

  • MiniMax H3 renderar native 2K (2560 x 1440) med ett synkroniserat stereoljudspår som genereras i samma steg, inte pålagt i efterhand.
  • Verifierat pris på modellsidan (juli 2026): 2K är $0,14 per sekund, 768p är $0,10 per sekund. Som jämförelse: Seedance 2.0 kostar cirka $0,24 per sekund vid 720p, så H3 ger en högre upplösning för ett lägre pris per enhet.
  • Tre ingångar (text, bild och referens till video) delar samma API-nyckel. Referens-till-video accepterar upp till nio blandade bilder, klipp och ett ljudspår som identitetsankare.

MiniMax H3 körs i ett enda steg istället för tre verktyg

Att skapa ett färdigt klipp innebär vanligtvis att dela upp arbetet. Du genererar en bild i en modell, byter till en andra modell för ljud och öppnar sedan en redigerare för att synka dem. Varje överlämning läcker lite av den ursprungliga avsikten, och tidslinjen byggs upp snabbt.

MiniMax H3 komprimerar detta. Den läser hela briefen som ett sammanhang: hur karaktären ser ut, hur rörelsen fungerar, hur kameran rör sig, den känslomässiga tonen och hur ljudet ska kännas – allt går in tillsammans och kommer tillbaka som ett klipp. MiniMax ramar in riktningen som en rörelse bort från uppgiftsspecialiserade modeller mot allmän multimodal intelligens, och i praktiken innebär det färre verktyg öppna samtidigt.

Två saker är värda att nämna rakt på sak, eftersom båda är lätta att verifiera i utdata. För det första har klippen verkligt ljud: showcase-filerna nedan kommer med ett inbyggt stereoljudspår, inte tillagt i efterhand. För det andra är upplösningen genuint 2K, 2560 x 1440 vid 24 bilder per sekund, inte en uppskalning.

Tre sätt att köra MiniMax H3 på Atlas Cloud

MiniMax H3 är live på Atlas Cloud med tre ingångar, och alla svarar på samma API-nyckel. Varje ingång har en Playground som du kan prova i webbläsaren innan du skriver en rad kod.

IngångDrivs avIndataBäst för
Text-till-videoEnbart en textpromptInget referensmaterialSkapa en scen från grunden
Bild-till-videoEn första bildruta, plus en valfri sista bildrutaEn eller två stillbilderAnimera en fast bild du redan har
Referens-till-videoEn textprompt plus referensmaterialUpp till 9 blandade bilder, videoklipp och ett ljudspårHålla en karaktär, produkt eller stil konsekvent genom klippet

Referens-till-video-vägen är den flexibla. Den behandlar dina referenser som identitetsankare, så att en karaktär, produkt eller look förblir konsekvent medan prompten placerar den i nya scener och rörelser. Du kan blanda bilder och videoklipp och lägga till ett ljudspår för att synkronisera handlingen till en takt. Minst en bild eller video krävs; ljud ensamt är inte tillåtet.

Eftersom varje modell på plattformen delar samma anropskonvention, handlar det om att byta till H3 från en annan videomodell att byta ut fältet model. Autentisering, polling och resultathämtning förblir identiska, vilket är den tysta fördelen med att köra video-, bild-, ljud- och språkmodeller bakom en nyckel och en faktura.

Vad MiniMax H3 kostar: 2K, 768p och jämförelsen med Seedance

MiniMax H3 debiterar per sekund genererad video, efter upplösning. Dessa siffror kommer direkt från modellsidan, kontrollerad den 31 juli 2026.

UpplösningKostnad per sekundEtt 8-sekunders klipp
2K (2560 x 1440)$0,14$1,12
768p$0,10$0,80

Här är delen som först låter bakvänd. En native 2K-sekund av H3 kostar $0,14. Som jämförelse kostar Seedance 2.0, plattformens andra flaggskepps-videomodell, cirka $0,24 per sekund vid 720p. Så H3 ger dig en bild med högre upplösning, till ett lägre pris per sekund, än ett klipp med lägre upplösning kostar på Seedance. Upplösning upp, enhetspris ner, samtidigt.

En ärlig anmärkning om siffran, så att ingen budgeterar fel. Det finns ingen kampanj bakom H3:s pris. Rabatten på 20 % som för närvarande gäller på plattformen är på Seedream 5.0 Pro-bildmodellen, inte på H3, så $0,14 per sekund vid 2K är den ordinarie kostnaden från och med slutet av juli 2026. Nivån 768p är listad till $0,10 per sekund; 2K är den nivå som är live och anropsbar idag.

MiniMax H3-promptboken: Showcases du kan kopiera

Varje klipp nedan producerades av prompten som står bredvid. Kopiera en, byt ut dina egna referenser och kör den. Varje block visar också referensbilderna som användes, i den ordning prompten begär dem (bild 1, bild 2 och så vidare).

Varumärkesfilmer och film/TV

Trailers, TVC-spots och varumärkestexturfilmer är den mest direkta passformen, eftersom de faller in i en befintlig innehållspipeline med minst omarbetning.

Referensindata, bild 1 för stämning och stil, bild 2 för huvudkaraktären: Silhuett vänd mot en gigantisk portal med texten The Stars Were Listening Referensbild 1, övergripande stämning och stil Flera vyer av en kvinna som bär en lång gråaktig kappa Referensbild 2, huvudkaraktären

 

 

Plain
1Realistiskt filmiskt utseende, högkontrastrikt ljus och skugga, snabb pacing. Bild 1 är referens för övergripande stämning och stil. Bild 2 är referens för huvudkaraktären. Tagning 1, ultrabred etableringsbild. En enorm cirkulär kosmisk port fyller nästan hela bilden; figuren är bara en liten silhuett framför den, stående lågt och något till höger om mitten. Marken är våt och reflekterande; portens centrum är kolsvart. Kameran zoomar sakta in. En huvudtitel tonar in från mörkrets kant, först suddig sedan skarp: "THE STARS WERE LISTENING", extremt smal, tung, versaler, mörkröd blandad med roströd, med lätt korn och suddiga kanter. Ljud: djup lågfrekvent puls, avlägset metalliskt skrammel, en mjuk träff när texten löses upp. Hård klippning.

Visuellt kreativt och innehållsförpackning

Kreativa kortfilmer, titelsekvenser, stämningsfulla musikvideor och rörelseaffischer. Det är här modellens hantering av text på skärm och rytm syns mest.

Lättspänd kriminaltitelsekvens. Fem stilreferenser sätter retro-anime, serietidningscollage-looken; modellen håller varje engelsk text läsbar och landar övergångarna på trumslagen. Noir-anime-banner med en silhuetterad karaktär på ett tunnelbanetåg Stilreferens Silhuetterad detektiv som håller ett foto framför en bevislista Stilreferens

 

 

Plain
1Generera en 15-sekunders 16:9 landskapsöppningssekvens för en lättspänd kriminalfilm. Övergripande stil följer det visuella språket i dessa bilder: retro-japanska anime-titelsekvenser, hårdkantade silhuetter, serietidningscollage, asymmetriska delade skärmar, starka geometriska färgblock, engelska texter, några japanska katakana-dekorationer, jazz-kriminal-attityd. Stämningen är 60 % spänning, 40 % jazz: mystisk, cool, smidig, med en urban-kriminalkänsla, inte skräck, inte tung. Rörelsen känns som rörelsegrafik-collage: linjeramar visas först på svart, delade skärmgränser sveper ut snabbt, färgblock och paneler klistras in block för block; karaktärssilhuetter, närbilder på rekvisita och engelska texter glider in, poppar upp och maskeras fram i sekvens på trumslagen. Engelska texter måste vara tydligt läsbara och får animeras. Lägg inte till kinesiska, inga förvrängda tecken, inget felstavat engelska. Varje engelsk text och roll förekommer exakt en gång. Håll övergångarna varierade: cirkulär vinylmask, vertikalt bildörrsnitt, en lång mänsklig skugga som sveper över skärmen, röd linje-klipp, gigantisk engelsk bokstavsmask, delad skärmbildsomsättning, hårt färgblock-klipp. Alla övergångar landar på trumslagen. Inga mjuka toningar. BGM: original 15-sekunders titelmusik, 60 % spänning, 40 % jazz, uppbyggd av en ihållande bas-ton, spända pizzicato-stråkar, kalla synth-pulser, bastrumma, glesa jazzborstar och korta lågsax-fraser. De första 2 sekunderna etablerar spänning med låga frekvenser och hi-hat; vid 3 sekunder kommer en låg trumslag in; vid 6 sekunder kommer en jazzbas-groove in; vid 10 sekunder dyker en kort saxofon-fras upp; de sista 2 sekunderna låser bilden med ett spänt ackord plus ett trumslag. Imitera inte någon befintlig melodi.

Live-action-kök smält med handritad animation. Inget referensmaterial, endast text-till-video. Prompten lutar sig mot imperfekt telefonkamera-textur för att undvika att det ser ut som en reklamfilm.

 

 

Plain
115 sekunder, 16:9 landskap. Live-action-material av ett litet kök i skymningen smält med handritad glödande animation. Solnedgångsljuset dröjer sig kvar vid fönstret; det bebodda lilla köket har ett gammalt träbord, en halvtvättad mugg, en något immig glasflaska och en hängande disktrasa. Bilden bär den fina handskakningen från en mobiltelefon med en hand, tvekan när man fokuserar på nära håll, exponeringsfluktuationer från motljus och något grovt brus i skuggorna. Gör den inte snyggt komponerad som en reklamfilm, den ska kännas som om någon hastigt filmar något omöjligt hemma. Inga jätteögon, inga delade munnar, inga huggtänder, inga hotfulla eller anfallande rörelser, inget plötsligt svart klipp, inga jump scares. Ljud använder endast köksrumston, friktionen från disktrasan, den lätta klirren från muggen, vatten som droppar från kranen, fotografens fotsteg och svag andning, plus den handritade varelsens mjuka elektroniska ton och små rop.

Dark-pop, cyber-grunge-musikvideo. Två referenser sätter typbehandlingen och trycktexturen; klippningen håller sig hård, inga toningar. Tre kvinnor poserar i slitna kläder med fuskpälsdetaljer Typbehandlingsreferens Rutnät av slitna typografiska designmallar i svart, vitt och rött Typbehandlingsreferens

 

 

Plain
1Stil: dark-pop / cyber-grunge / rap-musikvideo, realistisk high-fashion-textur, filmmagasinstextur, hög kontrast men inte billig. Övergripande referens: sena 90-talet till tidiga 00-talets independentmagasin, kopieringspapper, filmskanningar, undergroundmusikaffischer och zin-collage-estetik. Bilden har grovt korn, lätt filmjitter, halvtonspunkter, tryckgrad och skanningsfel. Snabb klippningsrytm, endast hårda klipp, inga toningar och inga mjuka övergångar. Typbehandlingsstil och textur följer referensbilderna.

Rörelseaffisch. En referens, den ursprungliga statiska affischen. Prompten håller layouten och paletten fast och animerar endast textens inträde. Anime-pojke i rosa dinosauriehoodie som sträcker ut sig med en gigantisk klo Den ursprungliga statiska affischen

 

 

Plain
1Gör en rörelseaffischvideo. Behåll originalbildens galleri-vita ram, inre ram, röd-vit-svart palett, 3D-figurinkänsla och layoutstruktur oförändrad; när texten kommer in, lägg till en smidig ljudeffekt för textinträde.

Digital upplevelse och spelkreativt

Spelgränssnitt, produktgränssnitt och interaktionsdemonstrationer. Det utmärkande här är att H3 följer en prompt som är skriven som tidsstyrda block.

Spelutrustnings-UX genomgång, promptad per sekund. Det här är den som är värd att läsa noggrant. Prompten är skriven som tidsstyrda segment, och modellen följer dem: menytillstånd, markörklick, panelinsvep, en beväpningsgrid, en laddningsfält från 0 % till 100 %, sedan hela miljön som laddas in runt karaktären. Stiliserad rosa-hårig bläckfiskkaraktär som sitter med benen i kors på en solid lila bakgrund Referensbild 1, karaktären Lila videospelsmeny med markör som pekar på Fortsätt-knappen Referensbild 2, UI-stilen

 

 

Plain
1Karaktärsreferens är Bild 1, UI-stilreferens är Bild 2.
2
3[0s-2s] Högvinklat overhead-skott. Karaktären sitter på ett högmättat starkt lila golv, med hänvisning till Bild 1, och tittar upp i kameran. En spelmeny-UI visas till höger: START NYTT SPEL, FORTSÄTT (markerad), INSTÄLLNINGAR, AVSLUTA SPEL. Spelarprofilen MINIMAX visas uppe till vänster. Markören klickar på "FORTSÄTT".
4
5[2s-4s] Mjuk zoom till hennes högra arm. En UI-panel glider in från höger och panelen "HÖGER ARM UTRUSTNING" visas. Markeringen lyfter fram "PHANTOM GRIP", glider sedan till "CHRONOS CLAW". Hennes högra hand omkonfigureras mekaniskt, fingrar delar sig, nya klo-liknande knogar låses på plats, cyan-LED blinkar starkare.
6
7[4s-7s] Kameran svänger mjukt runt till hennes vänstra sida. En ny UI glider in, "BEVÄPNING ANPASSNING"-grid, som visar hand-, underarm-, armbågs- och överarmskomponenter. Markeringen cyklar snabbt genom delar. Hennes vänstra arm demonteras segment för segment, med exponerade kablar och kolvar synliga under bytet.
8
9[7s-8.5s] Kameran zoomar ut till en medelbild. BEKRÄFTA KONFIG-knappen blinkar. Klick. Alla UI-paneler drar sig samman och försvinner. Karaktären rätar ut benen och sitter nu avslappnat med ett knä upp.
10
11[8.5s-10s] Ett LADDAR-fält visas längst ner, fylls snabbt från 0 % till 100 %. Den starkt lila miljön börjar mörkna, skuggor kryper in från kanterna, varmt gyllene ljus sipprar in.
12
13[10s-15s] När hon reser sig, laddas hela miljön runt henne. En tät cyberpunk-slum framträder: neon som blinkar, våta gator som reflekterar ljus, folkmassor som rör sig, motorcyklar som väver, staplade byggnader som sträcker sig mot avlägsna skyskrapor. Kameran stannar i tredje person bakom henne. HUD-element tonar in, med en minimap uppe till höger och en hälsa plus ammunition-räknare nere till vänster. En uppdragsmarkör visas. Hon kliver ut på gatan.

Produktsida UI/UX-demo. En produktbild som referens; prompten ber om en scrollande, högintensiv landningssida. Ljusblå Nike-löparsko med gröna accenter och rosa häl Produktbildsreferensen

 

 

Plain
1En webbsida, webbsida UI-design, webbanimering, videon visar en mjuk nedåtgående sidscrollning. En explosiv, högintensiv Nike-officiell-sida-stil produktlandningssida UI/UX-demo-video, vars kärnämne som visas är produkten i Bild 1. Sidan använder grov, kraftfull, lutande överdimensionerad sans-serif-typografi för högljudd layout. I bakgrunden, snabbt rörligt ljus och skugga, mörk kolfiber eller atletisk andningsbar mesh-textur vävs och skiftar. Videon visar en tajt nedåtgående sidscrollning, plus UI-interaktioner som stark visuell uppskalning och färgomvändning vid hover.

Webb-UI-animering, minimal prompt. Bevis på att den tidsstyrda, detaljerade stilen är valfri; en kort instruktion fungerar också. Snygg grå eldriven superbils med glödande röda bakljus i mörk studio Referensbild

 

 

Plain
1Simulera en webbplats UI-design: först glider rubriken högst upp ner i bild, sedan textraden nedanför sveper uppåt, och bilens strålkastare ändras från mörkt till rött.

Hur du kommer igång med MiniMax H3

Det finns två sätt att komma in, och inget av dem tar lång tid.

Kör den i Playground. Logga in på Atlas Cloud och öppna MiniMax H3 direkt på modellsidan. Skriv en prompt, välj upplösning och längd, och generera, ingen kod krävs. Det är det snabbaste sättet att se om modellen passar din bild innan du kopplar in den i något.

Eller anropa API:et i tre steg.

  1. Skaffa din API-nyckel. Öppna Atlas Cloud-konsolen och skapa en nyckel på sidan API Keys. Alla tre H3-ingångarna delar samma nyckel.
  2. Läs fälten på modellsidan. Parameterreferens och kopiera-klistra-kod finns på varje ingång: text-till-video, bild-till-video och referens-till-video. De tre tar olika indata, så blanda inte deras förfrågningskroppar.
  3. Skicka den första förfrågan. En slutpunkt och en anropskonvention når varje modell på plattformen, så att byta från en annan videomodell till H3 innebär att ändra fältet model till motsvarande H3-ingång. Autentisering, polling och resultathämtning förblir desamma.

Utöver H3 når samma nyckel video-, bild-, ljud- och språkmodeller som du kan kombinera, ett API och en faktura, så att bygga ett färdigt stycke innebär inte att behöva flytta tillgångar och fakturor mellan leverantörer.

Vanliga frågor

Vad är MiniMax H3?

MiniMax H3 är MiniMaxs multimodala videogenereringsmodell, tillgänglig på Atlas Cloud genom tre ingångar: text-till-video, bild-till-video och referens-till-video. Den läser text, bild, video och ljud som ett sammanhang och returnerar ett färdigt 2K-klipp med synkroniserat ljud i ett enda steg.

Hur mycket kostar MiniMax H3?

MiniMax H3 debiterar per sekund video. Verifierat på modellsidan i juli 2026, native 2K (2560 x 1440) är $0,14 per sekund och 768p är $0,10 per sekund. Ett 8-sekunders 2K-klipp kostar därför $1,12. Det finns ingen kampanjrabatt på H3 vid den tidpunkten.

Genererar MiniMax H3 ljud, eller bara video?

Båda, tillsammans. Showcase-klippen kommer ut ur MiniMax H3 med ett synkroniserat stereoljudspår som genereras i samma steg som bilden, snarare än tillagt i ett separat steg. Prompts kan styra ljudet, beskriva musik, ljudeffekter och timing tillsammans med det visuella.

Vad är skillnaden mellan de tre MiniMax H3-ingångarna?

Text-till-video fungerar från enbart en prompt. Bild-till-video animerar en första bildruta, med en valfri sista bildruta. Referens-till-video håller ett motiv konsekvent med hjälp av upp till nio blandade referensmaterial, bilder, videoklipp och ett ljudspår. Alla tre delar en API-nyckel och en anropskonvention.

Vilken upplösning och klipplängd stöder MiniMax H3?

MiniMax H3 renderar native 2K vid 2560 x 1440 och 24 bilder per sekund, med en billigare 768p-nivå på prisschemat. Klipp varar från cirka 5 till 15 sekunder, och bildförhållanden inkluderar adaptivt, 21:9, 16:9, 4:3, 1:1, 3:4 och 9:16.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller