Seedance 2.5 är nu live — Först på Atlas Cloud

MiniMax H3 Referens till video: En karaktär, två bilder och regeln som i tysthet tar dina pengar

Varje guide upprepar 9/3/3-specifikationsbladet. Den här kör det: en tvåbildsscen från bild-, video- och ljudreferenser i en MiniMax H3-referens till videosamtal.

Varje artikel om den här modellen stannar vid samma rad. Nio bilder, tre videoklipp, tre ljudklipp, tolv filer totalt. Det låter som ett garantikort.

Så jag behandlade det som ett. Jag byggde en karaktär, byggde en rekvisita, genererade en nattscen, matade tillbaka nattscenen som en referensvideo, skar ut åtta sekunder jazz till ett referensljudspår och tryckte in alla tre referenstyper i en enda förfrågan. Sedan började jag medvetet bryta mot reglerna för att se vilka API:t faktiskt försvarar.

Fyra av dem försvaras inte på det sätt du förväntar dig. En av dem debiterar dig fortfarande fullt pris för en video du inte bad om, och felmeddelandet du hoppades på kommer aldrig. Det är den som är värd att läsa till slutet för.

Viktiga slutsatser

  • Tre referenstyper, en array. Upp till 9 bilder, 3 videoklipp och 3 ljudklipp, 12 filer sammanlagt. Alla hamnar i samma refers-fält, och type är valfritt eftersom API:t härleder det från filändelsen.
  • Ljud kan aldrig flyga ensamt. En ljud-endast-förfrågan avvisas med ett namngivet fel. Det måste åtföljas av minst en bild eller en video.
  • Referens till video och bild till video är ömsesidigt uteslutande, men inget talar om det för dig. Skicka en första-bild image tillsammans med refers och jobbet slutförs ändå. En av dina två inmatningar kastas bort i tysthet, till fullt pris. Verifierat två gånger den 2026-08-12, på båda slutpunkterna.
  • Ingenting valideras när du skickar in. Varje felaktig förfrågan i denna artikel returnerade HTTP 200 och ett ID. Den verkliga domen kommer två till tre minuter senare vid genereringssteget. Avvisanden där är gratis; slutföranden är inte det.
  • Extra referensfiler är gratis. En referensbild och tio referensbilder faktureras exakt samma belopp för samma klipplängd. Priset följer utdatasekunder, inte antal indata.

Här är vad som kom ut i andra änden. Två tagningar, ett ansikte, två helt olika platser, och den andra tagningen byggdes från en bild, en video och en ljudfil samtidigt.

Tagning A (regn, natt, neon-gränd) sedan Tagning B (tom täckmarknad nästa morgon) sammanfogade med inget annat än själva sammanfogningen. Samma kvinna, samma ärr ovanför höger ögonbryn, samma indigoblå jacka, samma handduk. Tagning B genererades från tre referenser samtidigt: hennes porträtt, själva Tagning A-klippet och en åtta sekunders jazzbit. Båda tagningarna är minimax/h3/reference-to-video i 2K, 2560x1440, 24 fps, med det ursprungliga 32 kHz stereospåret. Värt att ha ljudet på för andra halvan, där hon levererar sin replik.

Varför MiniMax H3 Reference to Video slår alla promptar du kan skriva

En prompt beskriver en person. En referens är personen. Den skillnaden är hela anledningen till att denna slutpunkt finns, och det är därför MiniMax H3 för närvarande sitter högst upp på videoredigeringsledartavlan: Elo 1 125 över 10 280 röster (Artificial Analysis, augusti 2026). Värt att vara noggrann med den siffran dock: samma tabell listar dess rankningsintervall som 1 till 2, statistiskt oavgjort med Google Gemini Omni Flash på 1 122. Förstaplats, men inom ett konfidensintervall som de delar. Det relaterade påståendet att H3 också hamnar bland de tre bästa för både text till video och bild till video kommer från samma labs tillkännagivande (Artificial Analysis on X, augusti 2026).

Rankningar är billiga. Här är det faktiska beteendet, samma prompt, tre nivåer av referens, allt annat identiskt.

låt oss säga

Tre MiniMax H3 reference to video-körningar på samma prompt: ingen referens, en karaktärsreferensbild och två referensbilder

Samma prompt, samma 768P 4s-inställningar, från vänster till höger: inga referenser alls (text till video), en karaktärsreferensbild, två referensbilder (karaktären plus ramen-skålen). Promten säger "kvinnan från referensbilden" i alla tre. I den vänstra panelen syftar frasen på ingen, så modellen hittar på en främling. Genererad med minimax/h3/text-to-video och minimax/h3/reference-to-video.

Två ärliga tolkningar av den remsan. Hoppet från panel ett till panel två är enormt: utan en referens är "kvinnan från referensbilden" en fras som pekar på ingenting, och modellen fyller tyst hålet med en person som inte har någon relation till ditt projekt. Hoppet från panel två till panel tre är mycket mindre, eftersom min prompt också beskrev skålen i ord, och H3 ritade en godtagbar marinblå skål med en trana på den från texten ensam. Det är den användbara delen. En referensbild och en bra substantivfras konkurrerar om samma jobb, så spendera dina referensplatser på de saker som språket inte kan fästa: ett specifikt ansikte, en specifik produkt, en specifik logotyp.

Mönstret bakom nästan varje misslyckande i denna artikel är samma som panel ett. Ingenting varnar dig för att en del av din förfrågan landade på ingenting.

Vad en referens faktiskt låser, och vad den inte gör. En referensbild fäster identitet: ansiktsstruktur, hår, utmärkande drag, plagg. Den fäster inte belysning, och detta är den vanligaste överraskningen. Den drar också med sig referensfotots ljus, vilket är anledningen till att ett karaktärsblad fotat i en stämningsfull miljö producerar en karaktär som inte kan överleva en scenförändring. Fotografera din referens platt och neutral. En referensvideo fäster rörelse, färgstämning och korn, inte identitet. En referensljud fäster själva ljudbädden. Om du behöver samma ansikte som läser en replik med samma röst över en serie, gör referensstacken tre olika jobb och du måste specificera vilket som är vilket. Praktiker konvergerar på att namnge dem positionellt i prompten ("Bild 1 är karaktären, Bild 2 är produkten") och denna konvention är värd att anta; mina promptar nedan använder istället enkel beskrivande namngivning, vilket också fungerar när referenserna är visuellt otvetydiga.

Varför det första anropet oftast gör dig besviken. Fyra saker, alla uppmätta den 2026-08-12:

  1. Inlämningsslutpunkten validerar ingenting. Felaktig MIME, 164 sekunders ljud, en död URL, ömsesidigt uteslutande fält: allt returnerar HTTP 200 med ett prediktions-ID. Du får reda på det senare.
  2. ratio är standard adaptive, dokumenterat som "låt modellen välja". Med 16:9-referenser fick jag 1344x768 vid 768P oavsett om jag lämnade det på adaptive eller tvingade 16:9, så standarden är ofarlig när dina indata redan överensstämmer. Det är en slantsingling när de inte gör det, och detta är den enda H3-slutpunkten där du helt enkelt kan ta bort beslutet från den.
  3. En första-bild plus referenser ger inget fel. Den tappar tyst en av dem och debiterar dig.
  4. Om modellen inte har något konkret att hålla fast vid, fyller den självsäkert luckan, och ett självsäkert felaktigt ansikte ser exakt ut som en lyckad körning.

För prompt-skapningssidan av detta går MiniMax H3 promptguiden djupare in på formulering än vad jag kan här.

MiniMax H3 Reference to Video-regelboken: Tre typer, en förfrågan

Alla tre referenstyperna delar en array. Här är kontraktet som publicerat, bredvid vad slutpunkten faktiskt gjorde när jag testade.

Tabell 1: de tre referenstyperna

ReferensbilderReferensvideoReferensljud
Max filer93 klipp3 klipp
Kombinerad gräns12 filer över alla tre typer
Per-fil-längdi.u.2 till 15 sekunder2 till 15 sekunder
Total längdi.u.15 sekunder15 sekunder
Formatpng, jpeg, jpg, webpmp4, movmp3, wav
Kan användas ensam?JaJaNej, kräver en bild eller en video
Vad den låseridentitet, plagg, produkt, stilrörelse, kamera, färg, kornsjälva ljudbädden
Vad den inte låserbelysningen av den nya scenenvem som är i bildendet exakta spåret (se Steg 6)
Levereras sompublik URL eller base64 data-URLpublik URL eller base64 data-URLmåste deklareras audio/mp3, inte audio/mpeg
Verkställs?10 bilder gick igenom brainte testad bortom 1 klippper-klipp-fönster verkställt, 15s summa var inte

Filantal och längdbegränsningar är MiniMaxs publicerade gränser (Hailuo, augusti 2026), dubbelkollade mot lanseringsartikeln som listar samma referensvideofönster på 2 till 15 sekunder vardera och 15 sekunder totalt (MarkTechPost, augusti 2026). Allt i de tre sista raderna är mitt, uppmätt.

Två saker som specifikationen inte berättar. För det första, type-fältet på varje post är valfritt och härleds från URL-ändelsen, vilket innebär att en base64 data-URL eller en länk utan ändelse måste deklarera sin typ annars gissar förfrågan fel. För det andra, webbläsarens uppladdningsgräns är nio filer (Reference Materials (2/9), MAX:9 i skärmdumpen från Steg 5 nedan), under MiniMaxs egna tolv. Jag skickade ändå tio referensbilder via API:t och jobbet slutfördes normalt, så nio är en UI-gräns, inte en modellgräns.

Tabell 2: reference-to-video vs image-to-video vs text-to-video

reference-to-videoimage-to-videotext-to-video
Accepterar refersja, krävs, min 1nej (ignoreras tyst)nej
Accepterar image first framenej (ignoreras tyst)ja, krävsnej
Accepterar end_image last framenejjanej
ratio-alternativalla 7, inkl. 16:9, 9:16, 21:9adaptive endastalla 7
Upplösning768P eller 2K, standard 2Ksammasamma
Längd4 till 15s heltal, standard 8sammasamma
Blandning av den andra slutpunktens indatajobb slutförs, indata tappas, full avgiftjobb slutförs, refers tappas, full avgifti.u.

Den fjärde raden är skillnaden ingen nämner. På image-to-video innehåller bildförhållande-enumen exakt ett värde, adaptive, eftersom den första bilden bestämmer formen. På reference-to-video får du alla sju, vilket gör detta till den enda H3-slutpunkten där du kan tvinga en bildform samtidigt som du förankrar en karaktär. Om du väljer en nivå för detta arbete täcker 2K vs 768P för MiniMax H3 vad de extra pixlarna ger.

Den sista raden är den dyra. Dokumentationen ramar in de två slutpunkterna som ömsesidigt uteslutande, och det är de, i den meningen att endast en indataväg hedras. Men det finns inget fel. Jag körde det åt båda hållen den 2026-08-12: ett reference-to-video-anrop med en första-bild image slutfördes på 115 sekunder och debiterade $0,40, och ett image-to-video-anrop med refers slutfördes på 167 sekunder och debiterade $0,40. Båda producerade en video. Båda kastade bort hälften av vad jag skickade, och inget fält i svaret anger vilken hälft.

Tabell 3: modellerna som detta arbetsflöde använder

Allt nedan körs i en webbläsarflik på Atlas Cloud, vilket är var priserna och skärmdumparna kommer ifrån. Priser kontrollerade 2026-08-12.

StegModellPrisKörningarKostnad
Karaktärs- + rekvisitareferensopenai/gpt-image-2/text-to-imagelistat från $0,009; hög kvalitet vid 2048x1152 uppmätt till $0,17452$0,35
Referensljudminimax/music-2.6$0,15 per spår1$0,15
Tagning A och Tagning Bminimax/h3/reference-to-video$0,10/s vid 768P, $0,14/s vid 2K2 x 8s vid 2K$2,24
Referensstegesamma, plus minimax/h3/text-to-video$0,10/s vid 768P3 x 4s vid 768P$1,20

Ingen rabatt är aktiv på någon av de tre H3-slutpunkterna denna månad. Två grannar är billigare just nu om du bara bygger referensstillbilder: gpt-image-2-developer/text-to-image har 50% rabatt, $0,009 ner till $0,004 från och med augusti 2026. Fulla per-sekund-uppdelningar finns i guiden MiniMax H3 API-prissättning.

MiniMax H3 Reference to Video, steg för steg

Scenen: en kvinna som driver en ramen-stånd. Tagning A är en regnig neongränd på natten. Tagning B är samma kvinna nästa morgon på en tom täckmarknad, en annan plats, en annan tid på dygnet och en annan lins. Ingenting förs över mellan de två anropen förutom referenserna, vilket är poängen med testet.

Steg 1: Bygg karaktärsreferensen, medvetet platt belyst

Detta är steget folk gör fel. En karaktärsreferens är inte ett fint foto av din karaktär, det är en mätning av deras ansikte. Neutralt ljus, enkel bakgrund, ingen scen, ingen stämning. H3 lär sig ljuset tillsammans med ansiktet, så en atmosfärisk referens producerar en karaktär som är fastsvetsad vid den atmosfären.

Modell: openai/gpt-image-2/text-to-image. Inställningar: kvalitet high, storlek 2048x1152 (16:9), format png.

text
1Editorial photograph of a woman in her early thirties, a street-food chef. Close three-quarter portrait, neutral expression, direct eye contact with camera. Short black hair tucked behind one ear, a small scar above the right eyebrow, warm olive skin. She wears a faded indigo work jacket with the sleeves rolled to the elbow and a folded white towel over the left shoulder. Plain light grey studio background, soft even key light, no props, sharp focus on the face, natural skin texture, no retouching. Photorealistic, 50mm lens.
2

Skärmdump av AI-bildgenerator som visar inmatad prompt och genererat porträtt

GPT Image 2-lekplatsen på Atlas Cloud med karaktärsreferensprompten laddad och det färdiga porträttet i utmatningspanelen

GPT Image 2 på Atlas Cloud: kvalitet satt till high, 16:9, karaktärsbladet renderat till höger.

Kvinna i en blå overall med en handduk över axeln

Karaktärsreferensbild för MiniMax H3 reference to video: neutralt studiobild av en ramen-kock med ett ärr ovanför höger ögonbryn

Referensbild 1. Ärret ovanför höger ögonbryn och den vikta vita handduken är avsiktliga: de är billiga, otvetydiga identitetsankare som du kan kontrollera i varje efterföljande bildruta.

Steg 2: Bygg rekvisitareferensen

Andra referensplatsen, andra jobbet. Objekt beter sig bättre än ansikten här, vilket gör en distinkt rekvisita till det enklaste sättet att bevisa att en referens landade. Samma modell, samma inställningar.

text
1Product photograph of a single dark navy ceramic ramen bowl with a hand-painted white crane on the side, chipped at the rim, filled with steaming shoyu ramen. Straight-on view, plain light grey background, soft even light, sharp focus, photorealistic, 50mm lens.
2

fläsk, (5) ägg, (6) och (7) grön (8) lök (9)

Rekvisitareferensbild: mörk marinblå ramenskål med en handmålad vit trana och en flisad kant

Referensbild 2. Den handmålade tranan och flisan i kanten är ledtrådarna. Om de överlever in i videon har referensen lästs.

Steg 3: Tagning A, två bilder in i MiniMax H3 reference to video

Två referensbilder, båda type: "image", in i refers. Ställ in bildförhållandet explicit. adaptive är standarden och kommer vanligtvis att göra rätt sak när dina referenser redan är 16:9, men det bestämmer åt dig, och på denna slutpunkt behöver du inte låta den.

Modell: minimax/h3/reference-to-video. Inställningar: upplösning 2K, längd 8, bildförhållande 16:9.

text
1Wide establishing shot. Heavy rain at night in a narrow neon-lit alley. The woman from the reference image works alone behind a small steaming ramen stall under a plastic awning, ladling broth into the navy bowl with the white crane from the reference image. Steam rises through pink and green neon reflections on the wet pavement. Slow push-in on the stall. Ambient sound: rain on plastic, boiling broth, distant traffic. No dialogue.
2

Utdatan från detta anrop är den första halvan av visningsklippet högst upp. Spara dess URL. Den är indata till Steg 5.

Steg 4: Klipp ut en åtta sekunders referensljud

Referensljud är inte en ljudspårplats. Det är en bädd som modellen matchar sin egen mix mot, och det är den mest kräsna indatan på slutpunkten. Generera ett spår, klipp sedan ned det, eftersom en hel låt avvisas.

Modell: minimax/music-2.6, med is_instrumental: true och format: "mp3".

text
1Sparse late-night jazz, brushed snare, upright bass, one muted trumpet, melancholic, 70 BPM, instrumental.
2

Skiva sedan ungefär åtta sekunder och koda det som en data:audio/mp3-URL. Tre saker jag gjorde fel här först, alla med exakt felttext:

  • MIME-strängen spelar större roll än byten. Deklarera data:audio/mpeg och referensen avvisas med audio format ".mpeg" not allowed, även om filen är en helt vanlig MP3. Skriv audio/mp3.
  • 2 till 15 sekunder per klipp, och det verkställs. Mitt genererade spår var 164 sekunder. Det kom tillbaka som invalid param: audio duration 164258 ms, expected [2000, 15000] ms. Att klippa till 8,05 sekunder fixade det. Båda avvisningarna kostade ingenting.
  • Den kombinerade gränsen på 15 sekunder är dokumenterad men inte verkställd. Jag skickade två 8-sekundersklipp i samma förfrågan, totalt 16,1 sekunder, och förväntade mig ett avvisande. Jobbet slutfördes och debiterades normalt. Bygg inte på det: det är publicerat som en gräns och kan börja bete sig som en när som helst.

AI-musikgeneratorgränssnitt som visar textprompt och genererad ljudvågform

MiniMax Music 2.6-lekplatsen på Atlas Cloud med jazzprompten och det färdiga spåret i utmatningspanelen

MiniMax Music 2.6 på Atlas Cloud, $0,15 per körning, färdigt spår till höger. En sak att kopiera från denna skärmdump och en sak att inte: priset och mp3-formatet är rätt, men Is Instrumental är fortfarande avstängd och sidans demo-text är fortfarande i rutan, så denna specifika körning kom tillbaka som en 1:35-låt med sång. Slå på den växlingsknappen och rensa textfältet innan du kör, annars kommer du att klippa en referensbädd med någon som sjunger över den. Mitt API-anrop, med isinstrumental: true, returnerade 2:44 instrumental på 209 sekunder.

Steg 5: Tagning B, ett MiniMax H3 reference to video-anrop med alla tre typerna

Detta är anropet som nyckelordet verkligen handlar om. Tre referenstyper, tre olika jobb, en array:

  1. karaktärsporträttet från Steg 1, type: "image", för att behålla hennes ansikte
  2. Tagning A mp4 från Steg 3, type: "video", för att överföra färgstämning och korn över klippet
  3. åtta-sekunders jazzbiten från Steg 4, type: "audio", som bädd

Utdata-URL:er från andra generationer på plattformen kan släppas direkt in i refers som videoreferensen, vilket är den faktiska mekanismen bakom flerbilders kontinuitet. Inte "H3 minns din karaktär". Du lämnar tillbaka den föregående tagningen till den.

Modell: minimax/h3/reference-to-video. Inställningar: upplösning 2K, längd 8, bildförhållande 16:9.

text
1The same woman from the reference image, the next morning. Bright empty covered market, cold clean daylight through a skylight, shutters still down behind her. Medium close-up, static camera. She wipes the counter with the folded white towel, looks up at the camera and says one line, then goes back to work. Keep her face, hair, scar and indigo jacket identical to the reference. Carry the grade and grain of the reference clip. Use the reference audio as the underscore.
2

AI-videogeneratorgränssnitt som visar inmatad prompt och genererad video

MiniMax H3 reference to video-lekplatsen på Atlas Cloud med en bild- och en ljudreferens laddad och det genererade klippet i utmatningspanelen

Samma anrop i MiniMax H3 Reference-to-Video-lekplatsen, i 2K och 8 sekunder. Två referensplatser av olika typer är synliga i Reference Materials (2/9): plats 1 är ref-audio-8s.mp3, plats 2 är hennes porträtt. Videoreferensen går in via "Add via link" (överst till höger i den panelen) eller via API:t, eftersom den ligger på en URL snarare än på disk. Tre saker att läsa av från denna panel: uppladdaren säger MAX:9 trots att MiniMaxs egen gräns är 12, Aspect Ratio står på adaptive om du inte ändrar det, och körpriset för 2K vid 8 sekunder är $1,12, vilket är nivån $0,14 per sekund.

Steg 6: Verifiera att referensen faktiskt landade

Ett slutfört jobb är inte ett lyckat jobb. Två kontroller, båda billiga.

Kontrollera ansiktet. Ta en bildruta från varje tagning och lägg dem sida vid sida. Du letar efter ankarna du planterade: ärret, hårfästet, jackan, handduken.

Jämförelse av en kvinna i neon natt- och morgonmarknadsbelysning

Bildruta från Tagning A bredvid en bildruta från Tagning B, som visar samma MiniMax H3 reference to video-karaktär i två olika scener

Vänster: Tagning A, natt, neon, vidvinkel. Höger: Tagning B, täckmarknad, nästa morgon, halvbild. Samma ansikte, samma ärr över höger ögonbryn, samma jacka och handduk, över en scen- och inramningsförändring med inget gemensamt förutom referenserna.

En sak gick inte som jag skrev i prompten. Jag bad om "bright empty covered market, cold clean daylight" och "carry the grade and grain of the reference clip", och referensklippet vann. Tagning B är onekligen morgon och onekligen en annan plats, men den är mycket mer stämningsfull än "bright" antyder, eftersom nattens färgstämning kom med videoreferensen. Du kan inte be ett anrop om samma utseende och motsatt ljus. Om du behöver ljuset att ändra, ta bort färgstämningsinstruktionen, eller ta bort videoreferensen och håll identiteten med bilden ensam.

Kontrollera ljudet. Rita upp vågformen för den åtta sekunders biten du laddade upp bredvid spåret som kom tillbaka inuti mp4:an, och lägg till en kontroll: ett klipp genererat utan någon ljudreferens alls.

Tre staplade ljudvågformer som jämför uppladdade, returnerade och kontrollspår

Vågform av den uppladdade åtta sekunders referensljudet, ljudspåret som returnerades inuti det genererade klippet och en kontroll utan ljudreferens

Överst: 8,05-sekunders jazzbiten skickad som referens. Mitten: spåret extraherat från det returnerade Tagning B mp4:an, dominerat av dialogen vid cirka 5,5 sekunder. Nederst: Tagning A, samma arbetsflöde, ingen ljudreferens.

Detta är där jag måste korrigera något jag trodde på innan. Referensljud kommer inte tillbaka ordagrant. Kuvertkorrelationen mellan min bit och det returnerade spåret är 0,25, mot −0,05 för kontrollen utan referens, så de två är relaterade men långt ifrån identiska, och den returnerade formen är tydligt sin egen mix snarare än min fil med något ovanpå. Vad referensen tydligt gjorde var att placera något under: Tagning B:s bädd är cirka 7 dB varmare än kontrollen utan ljud under de första fem sekunderna, innan någon dialog börjar. Läs referensljud som en styrning av mixen, inte en musikplats. Om du behöver ditt exakta spår under bilden, lägg i det efteråt.

Om du bygger på ljudsidan av detta, börjar MiniMax H3 läppsynk och ljud och MiniMax H3 musikvideo-genomgången båda från samma referensljudsbeteende. För polling- och återförsökskoden kring allt detta, har MiniMax H3-handledningen loopen.

Fyra fler MiniMax H3 Reference to Video-upplägg värda att stjäla

Omforma ett klipp du redan äger. Placera ett färdigt klipp i refers som videoreferens, inga bilder alls, och be om ett annat medium. Rörelsen, inramningen, inskjutningen och rekvisitan överlever; ytan ändras. Detta är mekanismen bakom H3:s videoredigeringsrankning, och det är samma som ligger bakom anime-arbetet i MiniMax H3 vs Veo 3.1 för anime.

Kvinna som lagar mat vid en matvagn i en neongränd

Animeomformning genererad från Tagning A-klippet som används som en MiniMax H3 reference to video-referens

Tagning A-gränden inlämnad som den enda referensen, med en cel-shaded anime-prompt. Samma stånd, samma slev, samma transkål, samma inskjutning, omritad. En detalj värd att veta: omvandlingen är svagast i de första bildrutorna och starkast när kameran väl har bestämt sig för rörelsen. Visas som en tyst GIF. Genererad med minimax/h3/reference-to-video vid 768P, 4s, $0,40.

Få ett foto att sjunga. Ett porträtt plus en röstinspelning inom 2 till 15 sekunders fönstret, prompta framförandet. Billigare än en läppsynk-pipeline eftersom det är ett enda anrop.

Lås en produkt i vilken scen som helst. Referensbilder fäster objekt hårdare än ansikten, så en riktig produktbild plus en scenprompt är det mest pålitliga på denna slutpunkt. Kolla vad du får göra med resultatet innan det hamnar i en annons.

Bygg en serie, inte ett klipp. Kedja det: tagning N:s utdata blir video-referensen för tagning N+1. Varje anrop är fortfarande begränsat till 15 sekunder, så kontinuitet är ditt jobb, inte modellens. Hur lång en MiniMax H3-video kan vara täcker var den gränsen biter.

Jämför motorer innan du binder en serie till en? Seedance 2.5 vs MiniMax H3 och MiniMax H3-alternativ är de två att läsa.

Vad en tvåtagning MiniMax H3 Reference to Video-scen faktiskt kostar

Varje rad nedan är ett verkligt jobb från 2026-08-12, med beloppet taget från price-fältet som API:t returnerar på varje slutförd prediktion.

Tabell 4: den faktiska räkningen

JobbModellInställningarResultatDebiterat
Karaktärsreferensgpt-image-2high, 2048x1152slutfört$0,1745
Rekvisitareferensgpt-image-2high, 2048x1152slutfört$0,1745
Referensljudmusic-2.6instrumental, mp3slutfört, 164s spår, 209s väntetid$0,15
Tagning Ah3/reference-to-video2K, 8s, 2 bildrefsslutfört på 309s$1,12
Tagning Bh3/reference-to-video2K, 8s, bild + video + ljudrefsslutfört på 557s$1,12
Stege, ingen referensh3/text-to-video768P, 4sslutfört på 154s$0,40
Stege, 1 bildrefh3/reference-to-video768P, 4sslutfört på 119s$0,40
Stege, 2 bildrefsh3/reference-to-video768P, 4sslutfört på 128s$0,40
Animeomformningh3/reference-to-video768P, 4s, 1 videorefslutfört på 239s$0,40
Omgörning av Steg 5 i lekplatsenh3/reference-to-video2K, 8s, bild + ljudrefsslutfört$1,12
Kontroll: 10 bildrefsh3/reference-to-video768P, 4sslutfört på 150s$0,40
Kontroll: första-bild + refersh3/reference-to-video768P, 4sslutfört, en indata tappad$0,40
Kontroll: refers på image-to-videoh3/image-to-video768P, 4sslutfört, refers tappade$0,40
Kontroll: 16,1s referensljudh3/reference-to-video768P, 4sslutfört över en dokumenterad gräns$0,40
Kontroll: ratio utelämnad, sedan ratio adaptiveh3/reference-to-video768P, 4s, två gångerbåda slutförda, identisk 1344x768$0,80
Skärmdumpskörningar av Steg 1 och 4gpt-image-2, music-2.6som ovanslutförda$0,32
Kontroll: ljudreferens ensamh3/reference-to-video768P, 4smisslyckades på 7ms$0,00
Kontroll: 164s referensljudh3/reference-to-video768P, 4smisslyckades på 16s$0,00
Kontroll: audio/mpeg MIMEh3/reference-to-video768P, 4smisslyckades på 17s$0,00
Kontroll: död referens-URLh3/reference-to-video768P, 4smisslyckades på 21s$0,00
Totalt$8,18

Dela upp den summan ärligt. Den färdiga tvåtagning-scenen högst upp i denna artikel, referenser och ljud inkluderade, är $2,74 av den. De andra $5,44 är undersökningen: kontroller, avsiktliga sönderbrytningar och omkörningar av steg i webbläsaren för skärmdumparna. Om du redan kan reglerna kostar en 16 sekunders tvåtagning-sekvens i 2K mindre än en smörgås.

Tre saker faller ut ur den tabellen.

Referenser är gratis. Tio-bilds-kontrollen kostade exakt samma $0,40 som en-bilds-stegkörningen vid samma längd och upplösning. På denna plattform går mätaren på utdatasekunder och upplösning, inget annat. Värt att flagga en motsägelse: MiniMaxs egen plattformsregler beskriver att inmatningsvideo debiteras till utdataränta, och det enhetliga schemat på OpenRouter har en separat reference_images-post. Ingen av dem dök upp på min faktura här. Om du budgeterar någon annanstans, prissätta det själv snarare än att anta.

Misslyckande är gratis, och det är sent. Alla fyra avvisanden kostade ingenting, vilket är de goda nyheterna. De dåliga nyheterna är när de anländer: 7 millisekunder för ljud-ensam-regeln, 16 till 21 sekunder för ljudlängd, fel MIME och död URL, och ingenting alls vid inlämningstidpunkt. Varje felaktig förfrågan i denna artikel fick HTTP 200 och ett prediktions-ID först, så behandla ett inskickningssvar som ett kvitto, inte som validering, och polla status-fältet innan du tror på någonting.

Tyst framgång är det dyra misslyckandet. De två blandningskontrollerna kostade vardera fulla $0,40 och returnerade en perfekt giltig video byggd från hälften av mina indata. Det finns inget fel, inget varningsfält, och inget sätt att från svaret avgöra att något kastades bort. Det är den enda raden i tabellen där pengar lämnade kontot och jag fick inget jag ville ha.

En ärlig korrigering på den sista punkten, eftersom den ändrades under mig medan jag skrev. I början av augusti betedde sig en referens-URL som 404:ade på samma sätt: jobbet slutfördes, referensen ignorerades tyst och fullt belopp debiterades. När jag körde om det den 2026-08-12 kontrollerar slutpunkten nu tillgänglighet och misslyckas jobbet gratis med ett namngivet fel, content[1].image_url: media not found (HTTP 404). Det specifika hålet är täppt. Hålet för ömsesidigt uteslutande indata är inte det. För kreditmatematik per klipp, har MiniMax H3-krediter per video tabellerna.

Vems ansikte, vems röst: kontrollera detta innan du laddar upp en referens

Denna slutpunkt skiljer sig från text till video på ett juridiskt relevant sätt: du tillhandahåller likheten. En referensbild av en verklig person, ett referensklipp från någons film, en referensröst i en igenkännbar röst, allt är material som du hävdar rätt att använda. Modell-sidans innehållsregler gäller fortfarande ovanpå det, och de är strängare om verkliga människor än om påhittade. Två guider värda att läsa innan en kund ser utdatan: MiniMax H3-innehållsrestriktioner och kommersiell användning och licensiering, som också täcker territorieundantagen i MiniMaxs villkor.

MiniMax H3 Reference to Video: Vanliga frågor

Kan MiniMax H3 reference to video behålla samma karaktär över två olika tagningar?

Ja, och mitt tvåtagning-test ovan håller över en full natt-till-morgon ljusomvändning. Men en karaktärsbild ensam är inte vad som gör det. Det pålitliga mönstret är att skicka tillbaka den föregående tagningens utdata-URL som en referensvideo tillsammans med karaktärsbilden, så att det andra anropet ärver färgstämning och korn såväl som identitet.

Kan jag använda en första-bild och referenser i samma MiniMax H3 reference to video-anrop?

Nej, och felfallet är problemet. Att skicka både image och refers ger inget fel. Testat den 2026-08-12, jobbet slutfördes på 115 sekunder, debiterade $0,40 och kastade tyst bort en av de två indata. Samma sak händer omvänt på image-to-video-slutpunkten. Välj en väg per anrop.

Kan jag skicka en ljudfil ensam som en MiniMax H3 reference to video-referens?

Nej. Ljud måste färdas med minst en referensbild eller video, och slutpunkten verkställer det med ett explicit fel: reference-to-video requires at least one reference image or video. Det anländer vid genereringssteget, inte vid inlämning, och det avvisade jobbet är gratis. Ljudreferenser måste också ligga inom 2 till 15 sekunder, 15 sekunder sammanlagt, och deklareras som audio/mp3 snarare än audio/mpeg.

Tar MiniMax H3 reference to video extra betalt för varje referensfil?

Inte på Atlas Cloud. En körning med tio referensbilder och en med en debiterade identiska $0,40 vid 768P och 4 sekunder, så mätaren spårar endast utdatasekunder och upplösning. Notera dock motsägelsen: MiniMaxs egna regler nämner att inmatningsvideo mäts till utdataränta, och andra plattformar exponerar en separat referensbild-poster. Verifiera på den yta du fakturerar genom.

Vad händer om en av mina MiniMax H3 reference to video-URL:er är trasig?

Från och med 2026-08-12 validerar slutpunkten tillgänglighet och misslyckas hela jobbet gratis, med content[1].image_url: media not found (HTTP 404) efter cirka 21 sekunder. Det är en förändring: tidigare i augusti slutfördes samma förfrågan, ignorerade tyst den saknade referensen och debiterade fullt pris. Anta inte att äldre beteenderapporter fortfarande gäller, och kontrollera status-fältet snarare än att anta att en 200 vid inlämning betyder något.

Är MiniMax H3 reference to video faktiskt den bästa modellen för detta?

På den enda offentliga head-to-head som mäter det, ja, med knapp marginal. MiniMax H3 leder videoredigeringsledartavlan med Elo 1 125 över 10 280 röster, men dess listade rankningsintervall är 1 till 2 och Gemini Omni Flash sitter 3 Elo-poäng bakom med ett överlappande intervall. Behandla det som "gemensam bästa tillgänglig", välj utifrån resten av arbetsflödet och läs MiniMax H3-alternativ om oavgjort spelar roll för dig.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller