MiniMax H3 videolängd är 15 sekunder. Jag räknade tio klipp inuti en av dem.

MiniMax H3-videolängd löper från 4 till 15 hela sekunder i 24 FPS. Se vad du faktiskt får tillbaka bildruta för bildruta, hur många klipp som får plats i ett enda klipp och hur du kedjar ihop 45 sekunder.

Alla gör samma sak på dag ett. Du öppnar längdrullgardinen, ser 15, och börjar dividera. En tio minuters film? 40 generationer. En tre minuters förklaringsvideo? Tolv. Sen tittar du på siffran som divisionen ger, stänger fliken och bestämmer dig för att modellen inte är redo för något med en berättelse.

Jag dividerade också. Sen körde jag ffmpeg över nio riktiga H3-klipp och hittade något som fick hela uträkningen att se dum ut.

Ett av de klippen är 15,10 sekunder långt. Inuti det flaggar scenavkännaren tio rena klipp. Tio. Olika garderob, olika bildutsnitt, olika bakgrunder, helskärmstexter, allt inuti en enda generation som kostade priset för en generation. Om jag hade planerat det klippet som divisionen antyder, en generation per tagning, hade jag betalat tio gånger så mycket för samma femton sekunder.

Divisionen är misstaget. Begränsningen är inte ett stoppur, det är en behållare, och nästan ingen fyller den.

Sekvens av en skateboardåkare som hoppar över en betongkant på natten

En skateboardåkare mitt i ett trick fångat som en strobsekvens, många distinkta positioner frusna inuti en enda bildruta

En bildruta, många ögonblick. Det är den mentala modellen som längdrullgardinen pratar bort dig från.

Viktiga slutsatser

  • Parametern duration accepterar endast heltal från 4 till 15. Standard är 8. Det finns inget 7,5, och inget värde över 15.
  • Varje klipp kommer tillbaka i 24 FPS, upp till inbyggd 2K, med stereo-ljud genererat i samma pass som bilden.
  • Ditt "15 sekunders" klipp är faktiskt 362 bildrutor, vilket är 15,083 sekunder. Längder snäpper upp till ett rutnät på 17 bildrutor, och endast duration: 8 landar på en hel sekund.
  • En generation kan innehålla många tagningar. Skriv TAGNING 1 / KLIPP TILL i prompten så klipper modellen åt dig, utan extra kostnad.
  • Det finns ingen extend-parameter i API:et. Du kommer över 15 sekunder genom kedjning: sista bildrutan till nästa första bildruta, referensbilder för att behålla utseendet, och sedan en hård sammanslagning.

Se 45 sekunder av MiniMax H3-videolängd, byggd av tre klipp

Innan någon teori, här är själva saken. En 45 sekunders noodle-stall-spot som heter MIDNIGHT BOWL. Tre generationer, femton sekunder var, tre tagningar inuti varje. Nio tagningar, ett sammanhängande stycke berättelse, inga upplösningar som döljer skarvarna.

Hela 45 sekunderklippet. Tre MiniMax H3-generationer sammanfogade utan övergångseffekter. Kocken, förklädet, lampan och den handmålade skylten överlever två överlämningar.

Nio videobilder som visar en kock som förbereder och serverar ramen

Nio bilder från MIDNIGHT BOWL-spoten arrangerade som ett 3x3-kontaktark, märkta TAGNING 1 till TAGNING 9 med tidskoder

Nio tagningar, tre generationer. Varje rad är en generation, varje kolumn ett klipp som modellen gjorde på egen hand. Tagning 3 och 4 rimmar eftersom generation 2 startar från generation 1:s sista bildruta, vilket är precis det som gör skarven osynlig.

Tre generationer. Inte nio. Den luckan är hela poängen med denna artikel.

Jag klippte inte något av det för hand. Jag bad varje generation om tre tidskodade tagningar, och ffmpegs scenavkännare hittade klippen vid 4,9s och 9,1s i den första, 4,9s och 9,0s i den andra, 5,3s och 11,0s i den tredje. Nio tagningar, tre fakturor.

Varför MiniMax H3-videolängd saboterar långfilmsplaner

Siffran i sig är okej. Femton sekunder i toppen av intervallet är generöst för denna generation av modeller, och klippen är 2K med riktigt stereo-ljud. Vad som sabbar folk är enheten de planerar i.

Om du budgeterar i sekunder, är en minuts verk "fyra klipp" och en tio minuters verk är "fyrtio klipp", och fyrtio klipp av vad som helst är en mardröm av kontinuitetsarbete. Om du budgeterar i tagningar, är en minuts verk fyra generationer som håller ungefär tolv tagningar, vilket är en normal mängd täckning för en reklamfilm. Samma modell, samma begränsning, helt annan produktionsplan.

Fingrar som håller en sepiafärgad filmremsa som visar en gata, händer och silhuett

Retro plakatillustration av en enda remsa 35mm-film där tre på varandra följande bildrutor var och en innehåller en helt annan scen

Budgetera i tagningar, inte sekunder. En fakturerad remsa, tre olika scener inuti.

Det finns en andra sak som sabbar långfilmsplaner, och det är inte begränsningen alls. Det är skarvarna. Enskilda klipp faller nästan aldrig isär i mitten. De faller isär vid fogarna, eftersom varje generation uppfinner sitt eget ljudspår och driver lite på garderob och ljus. Planera för skarvarna och 45 sekunder är enkelt. Ignorera dem och fyra perfekta klipp ser fortfarande ut som fyra klipp.

Vad MiniMax H3-videolängd verkligen är: 4 till 15 hela sekunder på ett rutnät med 17 bildrutor

Börja med specifikationen, för två olika siffror cirkulerar. Det levande API-schemat för alla tre H3-endpoints på Atlas Cloud listar duration som en uppräkning av exakt 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, med standardvärdet 8. Hela heltal, inget bråktal, inget över 15. Lanseringstäckning matchar den tolkningen: 2K-utdata, 4 till 15 sekunder, endast heltalslängder (MarkTechPost, augusti 2026). MiniMaxs eget lanseringsinlägg beskriver det som upp till 15 sekunder vid 2K med inbyggt stereo-ljud (MiniMax, augusti 2026).

Du kommer fortfarande se "5 till 15 sekunder" skrivet i olika profilblurbs och snabbstarter, inklusive viss plattformstext. Behandla schema-uppräkningen som sanningen. Golvet är 4, och jag har fakturerat 4 sekunders klipp för att bevisa det.

Nu delen som nästan ingen nämner. Be om 15 sekunder och du får inte 360 bildrutor. Du får 362.

H3 bygger video i block om 17 bildrutor och snäpper din begärda längd upp till nästa 17k + 5 bildruteantal vid 24 FPS. Det rutnätet är dokumenterat i ComfyUIs officiella H3-handledning (ComfyUI Docs, 2026), och det gäller också på API-sidan. Jag räknade bildrutor på nio riktiga H3-filer med ffmpeg:

text
1ffmpeg -i video-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | tail -1
2# frame=  362  ...
3#   Duration: 00:00:15.10, 1280x720, 24 fps
4

Varje 15 sekunders fil kom tillbaka med 362 bildrutor. Varje 10 sekunders fil kom tillbaka med 243. De tre nya generationerna jag körde för denna artikel kom tillbaka med 362 också, och 4 sekunders repetitionen i Steg 5 kom tillbaka med 107. Kör dessa genom rutnätet: 362 är 17x21+5, 243 är 17x14+5, och 107 är 17x6+5. Formeln förutsade alla tre exakt, vilket är den typen av överensstämmelse som får mig att lita på resten av tabellen.

durationBilder levererade (17k+5)Verklig längd vid 24 FPSLandar på en hel sekund?Källa
41074,458 sNejUppmätt
51245,167 sNejRutnät
61586,583 sNejRutnät
71757,292 sNejRutnät
81928,000 sJaRutnät
92269,417 sNejRutnät
1024310,125 sNejUppmätt
1127711,542 sNejRutnät
1229412,250 sNejRutnät
1332813,667 sNejRutnät
1434514,375 sNejRutnät
1536215,083 sNejUppmätt

Tre saker framgår av den tabellen.

duration: 8 är det enda värdet i hela intervallet som ger dig en ren hel sekund, och det råkar vara standarden. Det är ingen slump, det är 17x11+5 = 192 = 8 x 24 exakt.

Be om 6 och du får 6,583 sekunder, mer än en halv sekund gratis bild. Be om 13 och du får 13,667. Rutnätet avrundar alltid uppåt, aldrig neråt, så du får aldrig mindre.

Och om du klipper till musik eller matchar en bildruteexakt redigering, beräkna aldrig din tidslinje som duration x 24. Mät filen. Ett projekt med 40 klipp planerat med antagandet om hela sekunder är nästan fyra sekunder fel i slutet.

Tio klipp inuti en 15-sekunders MiniMax H3-generation

Här är klippet jag nämnde i början. En generation, 362 bildrutor, 15,10 sekunder i behållaren. Det är en fashion-kinetisk-typ-bit, och den beter sig som en redigerad musikvideo snarare än en enda tagning.

Närbild av en kvinnas ögon bakom djärv vit text ONE LOOK

En enda MiniMax H3-generation. Garderobsbyten, bildutsnittsbyten, delade skärmar och helskärmstexter, allt inuti ett 15 sekunders jobb.

Jag körde ffmpegs scenavkännare över den istället för att räkna för hand:

text
1ffmpeg -i video-5.mp4 -vf "select='gt(scene,0.6)',showinfo" -f null -
2# 18 brytpunkter flaggade, vid 1.54 2.88 3.63 4.21 5.54 5.83 6.92 8.88 11.17 13.00 ...
3

Tio av dessa är rena tagningsbyten under de första tretton sekunderna. Svansen är en flimrande titelkort som blinkar på svart, vilket blåser upp den råa räkningen, så tio är det konservativa ärliga antalet. Hur som helst är det inte en tagning, och det är inte tre.

Nu kontrollfallet, för "H3 hackar alltid ditt klipp i bitar" är motsatt misslyckande och lika fel. Denna nästa fil är också en enda 15 sekunders generation, också 362 bildrutor, och samma avkännare hittar exakt noll klipp i den.

Första persons vy av skyskrapor som kollapsar på en stadsgata

En annan enda generation, samma 362 bildrutor, noll detekterade klipp. En kontinuerlig kameraåkning under hela femton sekunderna.

Så begränsningen är inte "femton sekunders filmmaterial". Det är femton sekunders skärmtid som du får underindela hur du vill, från en obruten tagning till tio klipp. Du styr det från prompten, och du betalar samma oavsett.

De tre endpoints bakom MiniMax H3-videolängd, i en flik

Att komma över femton sekunder kräver tre olika jobb: något för att göra en ankarbild, något för att animera och kedja, och något för att flytta kameran utan att tappa motivet. På Atlas Cloud finns alla fyra i samma katalog med en nyckel och ett saldo, vilket spelar roll här mest för att kedjan i nästa avsnitt skickar filer mellan dem upprepade gånger.

StegModellUppgift i denna konstruktionLängdområdeListat pris, 4 aug 2026
Ankarbildopenai/gpt-image-2/text-to-imageEn stillbild som definierar hela utseendetn/a$0,1745 för min körning på hög
Öppning, ingen stillbildminimax/h3/text-to-videoDirekt från prompt till klipp4 till 15 s, standard 8$0,14 / sek
Generation 1 och 2minimax/h3/image-to-videoAnimera en första bildruta, kedja sedan från en sista bildruta4 till 15 s, standard 8$0,14 / sek
Generation 3minimax/h3/reference-to-videoNy kameraposition, samma motiv4 till 15 s, standard 8$0,14 / sek

Alla tre H3-endpoints har ingen rabatt just nu, så priset är priset. Du kan bekräfta allt på den fullständiga modellkatalogen.

Tre parameterfällor värda att känna till innan du skriver en enda begäran, alla hämtade från de levande schemana snarare än dokumentationstexten:

  1. ratio beter sig olika på varje endpoint. text-to-video erbjuder sex förhållanden och standard är 1:1, vilket tyst ger dig ett fyrkantigt klipp om du glömmer att ställa in det, och den accepterar inte adaptive alls. image-to-video erbjuder endast adaptive, så beskärningen följer din första bildruta. reference-to-video är den enda med hela uppsättningen plus adaptive.
  2. resolution är 768P eller 2K, standard är 2K. Båda nivåerna ligger under ett enda listat pris per sekund i katalogen, så att sänka till 768P sparar inte pengar. Använd 2K.
  3. image-to-video tar också en valfri end_image. Du kan låsa fast båda ändarna av ett klipp, inte bara starten. Det gör kedjetricket nedan till något du kan styra från båda håll.

Hur du slår MiniMax H3-videolängdsgränsen, steg för steg

Detta är hela MIDNIGHT BOWL-konstruktionen. Varje prompt nedan är den jag faktiskt skickade, kopiera dem ordagrant. Total körtid är tre H3-generationer plus en stillbild, och hela grejen är reproducerbar i en webbläsarflik.

Steg 1: Lås utseendet i en ankarbild

Börja inte med video. Börja med en stillbild du verkligen gillar, för varje klipp i kedjan kommer att ärva dess ljus, dess garderob och dess skyltning. Att få detta fel är dyrt; att få det rätt kostar cent.

Modell: openai/gpt-image-2/text-to-image. Inställningar: kvalitet hög, förhållande 16:9.

text
1Filmbild, klockan 02 på natten vid ett trångt Tokyo-bakgatan-nudelstånd. En 50-årig kock i marinblått förkläde och vitt bandana lutar sig över en ångande gryta bakom en repad trädisk, ärmarna upprullade till armbågen, underarmarna upplysta i het orange av en enda hängande glödlampa. Regnvåt asfalt reflekterar röd och grön skyltning; papperslyktor och en handmålad träskylt med texten "MIDNIGHT BOWL" hänger ovanför disken. Ånga rullar över bilden från kamera höger. Fotograferad med 35mm objektiv på f/2, grunt skärpedjup, djupa skuggor, varm volframnyckel mot sval blå natt, synlig fin filmkorn, inga textöverlägg.
2

AI-bildgeneratorgränssnitt som visar textprompt och den resulterande bilden

GPT Image 2-lekplatsen på Atlas Cloud med MIDNIGHT BOWL-ankarprompten ifylld och den färdiga stillbilden i utmatningspanelen

GPT Image 2 på Atlas Cloud: kvalitet inställd på hög, 16:9, ankarbilden renderad till höger.

4

MIDNIGHT BOWL-ankarbilden: en kock i marinblått förkläde bakom en ångande gryta under en enda hängande glödlampa i en regnig bakgata

Ankarbilden. Allt nedströms ärver denna glödlampa, detta förkläde och denna skylt.

Steg 2: Placera tre tagningar inuti en 15-sekunders MiniMax H3-generation

Här är draget som förändrar budgeten. Istället för att be om en kontinuerlig femton sekunder, ge modellen en taglista med explicita tidskoder och orden KLIPP TILL. Den kommer att klippa åt dig, inuti en fakturerad generation.

Modell: minimax/h3/image-to-video. Inställningar: resolution 2K, duration 15, ratio adaptive (det enda alternativet här, beskärning följer din första bild), första bildruta = stillbilden från Steg 1.

text
1TAGNING 1 (0-5s): Fast bred bild av ståndet. Ånga böljar; kocken öser buljong i en svart skål; regn droppar från markisens kant. TAGNING 2 (5-10s): KLIPP TILL makronärbild av slevens som bryter buljongytan, gyllene fett som virvlar, hackad salladslök som faller i långa bågar. TAGNING 3 (10-15s): KLIPP TILL en halvbild av kocken som tittar rakt in i linsen, torkar händerna på förklädet och säger på japanska med ett trött leende: "Ippai, dozo." Han ställer ner skålen på disken och bilden hålls på hans ansikte.
2Ljud: kraftigt regn på markisen, buljong som sjuder, slevens som slår i kanten av grytan, ett avlägset tåg, låg natten-stadsbrus. En enda tydlig manlig japansk dialog, naturlig rumston, ingen musik.
3Behåll samma kock, förkläde, bandana, glödlampa och skyltning i alla tre tagningar. Endast hårda klipp, inga upplösningar, inga kamerapannor. Varm volframnyckel, sval blå natt, 35mm-look, filmkorn.
4

Tre saker får detta att fungera. Explicita sekundintervall, den bokstavliga strängen KLIPP TILL, och en kontinuitetsklausul i botten som namnger varje element som måste överleva klippen. Uteslut kontinuitetsklausulen och tagning 3 kommer tillbaka med ett annat förkläde.

AI-videogeneratorgränssnitt som visar indatainställningar och färdig videoutmatning

MiniMax H3 image-to-video-lekplatsen på Atlas Cloud med ankarbilden laddad, duration 15 och 2K vald, det färdiga klippet som spelas upp i utmatningspanelen

MiniMax H3 image-to-video på Atlas Cloud: ankarbilden laddad som första bildruta, upplösning 2K, det färdiga klippet till höger. Notera skjutreglaget Duration och priset som följer med. Denna specifika körning lämnade duration på standard 8, vilket är varför knappen visar $1,12; vid 15 visar den $2,10.

Kock som lagar mat vid ett ångande gatustånd en regnig natt

Generation 1. Ett fakturerat jobb, tre tagningar (klipp uppmätta vid 4,92s och 9,13s), en dialog med läppsynk, inbyggd 2560x1440, och 32 kHz stereo-ljud i samma fil.

Steg 3: Kedja nästa 15 sekunder från den sista bildrutan

Det finns ingen extend-parameter. Kedjan är manuell och trivial: ta den sista bildrutan från generation 1 och mata in den som första bildruta i generation 2.

bash
1ffmpeg -sseof -0.08 -i generation-1.mp4 -frames:v 1 -q:v 2 handoff-frame-01.jpg
2

Modell: minimax/h3/image-to-video igen. Inställningar: första bildruta = handoff-frame-01.jpg, resolution 2K, duration 15, ratio adaptive.

Den viktiga disciplinen här är vad du utelämnar. Beskriv inte kocken igen. Han finns redan i pixlarna du just överlämnade, och att beskriva honom igen ger modellen tillåtelse att omtolka honom.

text
1Fortsätt från denna exakta bildruta, samma man, samma förkläde, samma ljus. TAGNING 1 (0-5s): Han skjuter skålen över disken med båda händerna mot kameran. TAGNING 2 (5-10s): KLIPP TILL över axeln på en kunds händer som lyfter träätpinnar och delar dem, manschettändarna på en våt grå regnrock synliga. TAGNING 3 (10-15s): KLIPP TILL extrem makro av nudeldragning, ånga som ringlar upp förbi linsen, buljong som droppar tillbaka i skålen.
2Ljud: kontinuerligt regn och sjudande som överförts från tidigare, keramik mot trä, ätpinnar som knäpps, en sörplande, samma avlägsna tåg. Ingen musik, ingen berättare.
3Endast hårda klipp. Samma volframnyckel från den hängande glödlampan, samma svala blå natt bakom, samma 35mm grunda skärpedjup och filmkorn.
4

Leende kock i bandana som serverar en ångande skål mat

Generation 2, startad från den sista bildrutan i generation 1. Samma kock, samma bandanamönster, samma marinblå topp, samma kök bakom honom. Tre tagningar igen, klipp vid 4,92s och 9,04s.

Leende kock i bandana serverar en ångande svart skål

Tvåsekundersloop över skarven mellan generation ett och generation två

Själva skarven: sista sekunden av generation 1 till första sekunden av generation 2. Ingen övergångseffekt, bara ett klipp.

Steg 4: Flytta kameran med reference-to-video

Kedjning från sista bildruta har en inbyggd begränsning: den återupptar alltid där den föregående kameran stod. För att hoppa till en genuint ny vinkel samtidigt som du behåller samma motiv, byt endpoint.

Modell: minimax/h3/reference-to-video. Inställningar: refers = ankarbilden från Steg 1 plus den sista bildrutan från generation 2, resolution 2K, duration 15, och ställ in ratio explicit till 16:9 här istället för att lämna den på adaptive. Denna endpoint accepterar upp till nio referensbilder, tre referensvideor och tre ljudklipp, med referensvideo begränsad till 15 sekunder totalt (MarkTechPost, augusti 2026).

text
1Vid låg vinkel från mitten av den våta gatan tillbaka mot samma nudelstånd, samma kock inuti. TAGNING 1 (0-6s): Regn rinner över bilden; två silhuetterade kunder sitter vid disken; kocken arbetar under den enda glödlampan. TAGNING 2 (6-11s): KLIPP TILL den handmålade träskylten medan kinetisk vit text animeras bredvid den, bokstav för bokstav: "MIDNIGHT BOWL - ÖPPET TILL 04.00". Texten förblir skarp och låst till skylten medan kameran driver. TAGNING 3 (11-15s): KLIPP TILLBAKA till den vida bilden när kocken tittar upp, höjer en hand i en liten vinkning, och glödlampan flimrar en gång.
2Ljud: regn, gatusurr, en moped som passerar, samma svaga tåg, en enda låg subbas-träff när texten landar. Ingen dialog.
3Samma kock, samma förkläde och bandana, samma skyltning och lyktfärger som referensbilderna. Endast hårda klipp, filmkorn, 35mm, varm volfram mot sval blå.
4

Den där ratio-instruktionen är inte paranoia. Här är vad som händer när du lämnar rullgardinen ifred på denna endpoint:

AI-videogeneratorgränssnitt som visar ett indatavalideringsfelmeddelande

MiniMax H3 reference-to-video-lekplatsen på Atlas Cloud med två referensbilder laddade, bildförhållande lämnat på adaptive, och ett 400-valideringsfel i utmatningspanelen

MiniMax H3 reference-to-video på Atlas Cloud: båda referensbilderna laddade, upplösning 2K, och bildförhållande fortfarande på sin adaptive-standard. Körningen kommer tillbaka 400: "ratio is required for t2va (text-only) and cannot be 'adaptive'; allowed: 16:9/4:3/1:1/3:4/9:16/21:9". Ställ in det explicit och samma begäran går igenom, vilket är hur klippet nedan gjordes. Notera även textblurben ovan som läser "768P/1080P/2K, 5s/10s" medan schemat säger 768P eller 2K och 4 till 15 sekunder. Lita på schemat.

Jag kunde inte få lekplatsens bildförhållande-rullgardin att hålla en skriptad ändring efter tre försök, så den framgångsrika generationen 3 nedan kom från API:et med ratio: "16:9" inställt i begärandekroppen. Den misslyckade körningen kostade inget.

Kock som förbereder mat till kunder vid ett regnigt nattligt matstånd

Generation 3. Helt ny kameraposition från andra sidan den våta gatan, samma kock, och den animerade vita texten på skylten förblir skarp medan kameran driver. Klipp vid 5,29s och 10,96s.

Sida vid sida-jämförelse av ett japanskt matstånd på natten

Sida vid sida-jämförelse av den ursprungliga ankarbilden och en bild från generation tre, som visar samma kock och skyltning 41 sekunder och två överlämningar senare

Vänster: ankarbilden från Steg 1. Höger: generation 3 vid 41-sekundersmarkeringen, två överlämningar senare. Samma kock, samma bandana, samma marinblå topp, samma handmålade skylt, samma röda lykta.

Steg 5: Mät den verkliga MiniMax H3-videolängden, sätt sedan ihop

Två vanor att avsluta med. För det första, kör en billig repition innan du köper femton sekunder. Samma prompt, duration 4, och du får reda på om modellen förstod din taglista för ungefär en fjärdedel av priset.

Kock som lagar mat vid ett ångande utomhusstånd i en regnig bakgata

4 sekunders repetitionen av samma taglista. Uppmätt till 107 bildrutor, vilket är 4,458 sekunder, exakt vad rutnätet förutspår. Tillräckligt för att se om modellen förstod scenen innan du köper hela tagningen.

För det andra, mät varje fil innan du klipper, eftersom ingen av dem är den längd du bad om:

bash
1# verkligt bildruteantal och behållarens längd, inte duration x 24
2ffmpeg -i generation-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | grep -o 'frame= *[0-9]*' | tail -1
3
4# hård sammanslagning, inga övergångar, ingen omkodning
5printf "file 'generation-1.mp4'\nfile 'generation-2.mp4'\nfile 'generation-3.mp4'\n" > list.txt
6ffmpeg -f concat -safe 0 -i list.txt -c copy midnight-bowl-45s.mp4
7

Tre filer med 362 bildrutor var ger 1086 bildrutor, vilket jag mätte på den färdiga sammanslagningen: 45,25 sekunder bild, inte 45. Litet, tills du sätter ihop fyrtio av dem.

Variationer: Dialog, vertikalt och 4-sekunders repetitionen

När kedjan väl fungerar täcker samma tre endpoints det mesta som folk faktiskt frågar efter.

Tagning-mot-tagning-dialog. Placera båda sidor av en konversation inuti en generation snarare än över två. Läppsynk och ljudspåret är kontinuerliga inom ett enda jobb och oberoende mellan jobb, så en konversation uppdelad på två generationer ger dig två orelaterade rumstoner. Håll utbyten inom ett klipp.

Gråtande ung kvinna tittar upp på en man i en trappuppgång

Två unga skådespelare mitt i ett gräl på en betongtrappavsats, hårt fönsterljus som sveper över dem, fotograferat över en axel

Tagning-mot-tagning fungerar, så länge båda vinklarna lever inom samma generation.

Vertikalt.image-to-video ställer du inte in förhållandet, du ställer in den första bildrutan. Generera en hög ankarbild och adaptive följer den. Ett av klippen jag mätte kom tillbaka som 1280x2276 med samma 243 bildrutor som sina 16:9-syskon, så bildruterutnätet bryr sig inte om ditt bildförhållande.

4-sekunders repetitionen som standardpraxis. Till $0,14 per sekund kostar fyra sekunder $0,56 mot $2,10 för en hel tagning. I en konstruktion med nio tagningar kostar det mindre att repetera varje generation innan du förbinder dig än ett enda bortkastat 15-sekundersjobb.

Där begränsningen verkligen biter. Allt som behöver en obruten prestation längre än femton sekunder. En kontinuerlig 30-sekunders monolog är inte ett kedjeproblem, det är ett läppsynk-över-en-skarv-problem, och ingen mängd promptdisciplin fixar det.

Vad 45 sekunder av MiniMax H3-videolängd kostar

Till $0,14 per sekund är en full 15-sekunders generation $2,10. Det är den enda siffran du behöver; allt annat är multiplikation. Den intressanta kolumnen är den sista.

MållängdGenerationer vid 15 sRak kostnadRealistiskt vid 1 av 3 behållningsgradLevererade tagningarKostnad per tagning
15 s1$2,10$6,303$0,70
45 s (denna konstruktion)3$6,30$18,909$0,70
60 s4$8,40$25,2012$0,70
3 min12$25,20$75,6036$0,70
10 min40$84,00$252,00120$0,70

Läs kolumnen per tagning och paniken över begränsningen försvinner mestadels. Att planera en generation per tagning sätter dig på $2,10 per tagning. Att packa tre tagningar i varje generation sätter dig på $0,70. Samma modell, samma femton sekunders begränsning, en tredjedel av fakturan.

Behållningsgradskolumnen är den folk glömmer. Inget användbart kommer tillbaka på första försöket varje gång, och en plan som antar att det gör det är en plan som får slut på budget vid minut två.

För sammanhang om var begränsningen sitter i förhållande till allt annat i katalogen, alla dessa är aktuella per 4 augusti 2026:

ModellMax enkel generationAnmärkningsvärtListat pris
minimax/h34 till 15 s768P eller 2K, inbyggt stereo-ljud$0,14 / sek
bytedance/seedance-2.04 till 15 s, eller -1 för auto480p till inbyggd 4K$0,112 / sek
kwaivgi/kling-v3.0-pro3 till 15 sHar en explicit multi_shot-flagga med per-tagningsprompter$0,095 / sek, 15% rabatt
alibaba/wan-2.72 till 15 sVidaste golvet, 720P eller 1080P$0,10 / sek
google/veo3.14, 6 eller 8 s endastInget 15 sekunders alternativ alls$0,20 / sek
alibaba/wan-2.5/video-extendlägger till 5 till 10 sFörlänger en befintlig fil snarare än att generera ny$0,052 / sek

Två slutsatser. H3:s femton sekunder är i toppen av den nuvarande generationen, inte bakom den, och Veo 3.1 maxar på åtta. Och om det du verkligen behöver är en lång fil från en endpoint, så finns en dedikerad extend-modell, men att byta modell mitt i kedjan innebär att byta ansikten.

En ärlig not om ljud, vikter och MiniMax H3-videolängd

Tre reservationer, inga av dem flyttar begränsningen.

Ljud överförs inte mellan generationer. Varje jobb komponerar sitt eget stereo-spår från grunden. Tre kedjade klipp innebär tre orelaterade regnspår, och du kommer att höra förändringen även när bilden matchar perfekt. Två fixar: skriv atmosfärsklausulen identiskt i varje prompt så att spåren landar nära, eller tysta det sammansatta klippet och lägg ett kontinuerligt spår under. För dialog, håll utbytet inom en enda generation.

Sex små svarta ljudvågor bredvid en lång orange ljudvåg

Flera separata korta ljudvågformsfragment med synliga luckor mellan dem till vänster, en enda kontinuerlig vågform till höger, på en blek enhetlig bakgrund

Vänster: vad kedjning faktiskt ger dig. Höger: vad du måste bygga under det.

Egen hosting låser inte upp längre klipp. De öppna vikterna släpptes den 2 augusti 2026 (Hugging Face, augusti 2026), och att köra dem lokalt ger dig en 768-pixel kort sida avrundad till multiplar av 32, enligt ComfyUIs installationsanteckningar. 17-bildruterutnätet och 15-sekunderstaket är desamma. Community-licensen täcker inte heller för närvarande EU, Storbritannien, Korea eller USA, så API:et är den praktiska vägen för de flesta team.

Modellen kan tyst skriva om dig. Jag har haft H3 som returnerat completed på ett jobb där den tyst släppte ett element jag bad om. Ta bildrutor från varje klipp och titta på dem innan du sätter ihop. I en kedja med nio tagningar är ett obevakat klipp en bortkastad skarv.

Vanliga frågor

Vad är den maximala MiniMax H3-videolängden?

Femton sekunder. Parametern duration är en uppräkning av heltal från 4 till 15 med standard 8, så 16 avvisas och 7,5 är inte ett giltigt värde. Varje klipp är 24 FPS vid upp till inbyggd 2K med stereo-ljud genererat tillsammans med bilden.

Kan MiniMax H3 generera videor längre än 15 sekunder?

Inte i en enda generation, och API:et har ingen extend-parameter. Du kommer över 15 sekunder genom kedjning: ta den sista bildrutan från ett klipp som första bildruta i nästa, använd reference-to-video när du behöver en ny kameravinkel, sammanfoga sedan med hårda klipp. Vissa konsumentfrontend lager på sitt eget extend-funktion ovanpå H3 för att nå ungefär 30 sekunder, men det är produkten som gör sömnaden, inte modellen som genererar längre.

Varför är mitt 15-sekunders MiniMax H3-klipp faktiskt 15,08 sekunder?

För att längder snäpper upp till ett rutnät på 17 bildrutor. Att begära 15 sekunder returnerar 362 bildrutor, vilket är 17x21+5, och vid 24 FPS är det 15,083 sekunder. Att begära 10 returnerar 243 bildrutor, eller 10,125 sekunder. Endast duration: 8 landar på en hel sekund, vid exakt 192 bildrutor. Om din redigering är bildruteexakt, mät varje fil snarare än att beräkna duration x 24.

Kan jag placera flera tagningar inuti en MiniMax H3-generation?

Ja, och det är den enskilt största besparingen som finns. Skriv explicita tidskodade tagningar i prompten med de bokstavliga orden KLIPP TILL, och lägg till en kontinuitetsklausul som namnger vad som måste överleva klippen. Jag mätte tio rena klipp inuti en riktig 15-sekunders generation. Tre tagningar per generation är bekvämt och pålitligt, vilket förvandlar ett $2,10-klipp till tre $0,70-tagningar.

Kostar en kortare MiniMax H3-videolängd mindre?

Ja, linjärt. Fakturering är per sekund till $0,14, så en 4-sekunders repetition kostar $0,56 mot $2,10 för en full 15-sekunders tagning. Upplösning är en annan historia: 768P och 2K ligger under ett listat pris i katalogen, så att sänka upplösningen sparar inget. Korta ner klippet, inte pixlarna.

Hur många MiniMax H3-klipp behöver jag för en minuts video?

Fyra, om du fyller alla femton sekunder varje gång. Men räkna i tagningar istället: fyra generationer med tre tagningar var ger dig tolv tagningar täckning, vilket är en normal mängd för en minuts reklamfilm. Multiplicera sedan din budget med ungefär tre för att ta hänsyn till tagningar du slänger.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller