Seedance 2.5 is nu live — Als eerste op Atlas Cloud

MiniMax H3 Referentie naar Video: Eén personage, twee shots, en de regel die stilletjes je geld afpakt

Elke gids herhaalt het 9/3/3-specificatieblad. Deze voert het uit: een two-shot scene van beeld-, video- en audioreferenties in één MiniMax H3-referentie naar videogesprek.

Elk artikel over dit model stopt bij dezelfde regel. Negen afbeeldingen, drie videoclips, drie audioclips, twaalf bestanden in totaal. Het leest als een garantiekaart.

Dus behandelde ik het als zodanig. Ik bouwde een personage, bouwde een rekwisiet, genereerde een nachtscène, voerde die nachtscène terug als referentievideo, sneed acht seconden jazz in een referentieaudiotrack en duwde alle drie referentietypes door één enkele aanvraag. Daarna begon ik met opzet de regels te overtreden om te zien welke de API daadwerkelijk verdedigt.

Vier ervan worden niet op de manier verdedigd die je zou verwachten. Een ervan rekent nog steeds de volledige prijs voor een video die je niet hebt gevraagd, en het foutbericht waar je op hoopte, komt nooit. Dat is degene die het waard is om tot het einde te lezen.

Belangrijkste Inzichten

  • Drie referentietypes, één array. Tot 9 afbeeldingen, 3 videoclips en 3 audioclips, 12 bestanden gecombineerd. Ze gaan allemaal in hetzelfde refers-veld, en type is optioneel omdat de API het afleidt uit de bestandsextensie.
  • Audio kan nooit alleen vliegen. Een audio-only verzoek wordt afgewezen met een benoemde fout. Het moet meeliften met ten minste één afbeelding of één video.
  • Referentie naar video en afbeelding naar video sluiten elkaar uit, maar niets vertelt je dat. Stuur een eerste-frame image samen met refers en de taak wordt toch voltooid. Een van je twee invoeren wordt in stilte weggegooid, tegen de volledige prijs. Tweemaal geverifieerd op 2026-08-12, op beide endpoints.
  • Er wordt niets gevalideerd wanneer je indient. Elk foutief verzoek in dit artikel retourneerde HTTP 200 en een ID. Het echte oordeel valt twee tot drie minuten later in de generatiefase. Afwijzingen daar zijn gratis; voltooiingen niet.
  • Extra referentiebestanden zijn gratis. Eén referentieafbeelding en tien referentieafbeeldingen worden gefactureerd voor exact hetzelfde bedrag voor dezelfde cliplengte. De prijs volgt uitvoer seconden, niet invoer aantal.

Hier is wat er aan de andere kant uitkwam. Twee shots, één gezicht, twee compleet verschillende plaatsen, en het tweede shot werd tegelijkertijd gebouwd uit een afbeelding, een video en een audiobestand.

Shot A (regen, nacht, neonsteeg) dan Shot B (leeg overdekt stadion de volgende ochtend), aan elkaar gemonteerd met niets anders toegevoegd dan de verbinding. Dezelfde vrouw, hetzelfde litteken boven de rechterwenkbrauw, dezelfde indigo jas, dezelfde handdoek. Shot B werd gegenereerd uit drie referenties tegelijk: haar portret, de Shot A clip zelf, en een acht seconden durende jazz-slice. Beide shots zijn minimax/h3/reference-to-video op 2K, 2560x1440, 24fps, met de native 32kHz stereo track. Het is de moeite waard om het geluid aan te zetten voor de tweede helft, waar ze haar tekst uitspreekt.

Waarom MiniMax H3 Reference to Video Beter Is Dan Elke Prompt Die Je Kunt Schrijven

Een prompt beschrijft een persoon. Een referentie is de persoon. Dat verschil is de hele reden waarom dit endpoint bestaat, en het is waarom MiniMax H3 momenteel bovenaan de video-editing leaderboard staat: Elo 1.125 over 10.280 stemmen (Artificial Analysis, augustus 2026). Het is de moeite waard om precies te zijn over dat getal: dezelfde tabel vermeldt de rangschikking als 1 tot 2, statistisch gelijk aan Google Gemini Omni Flash met 1.122. Eerste plaats, binnen een betrouwbaarheidsinterval dat het deelt. De gerelateerde bewering dat H3 ook in de top drie staat voor zowel text-to-video als image-to-video komt van hetzelfde lab's aankondigingsbericht (Artificial Analysis op X, augustus 2026).

Rangen zijn goedkoop. Hier is het daadwerkelijke gedrag, dezelfde prompt, drie niveaus van referentie, al het andere identiek.

laten we zeggen

Drie MiniMax H3 reference-to-video runs op dezelfde prompt: geen referentie, één personage referentieafbeelding, en twee referentieafbeeldingen

Zelfde prompt, zelfde 768P 4s instellingen, van links naar rechts: helemaal geen referenties (text-to-video), één personage referentieafbeelding, twee referentieafbeeldingen (personage plus de ramenkom). De prompt zegt "the woman from the reference image" in alle drie. In het linkerpaneel verwijst die zin naar niemand, dus de model verzint een vreemdeling. Gegenereerd met minimax/h3/text-to-video en minimax/h3/reference-to-video.

Twee eerlijke interpretaties van die strip. De sprong van paneel één naar paneel twee is enorm: zonder referentie is "the woman from the reference image" een zin die naar niets wijst, en de model vult het gat stilzwijgend met een persoon die geen relatie heeft met jouw project. De sprong van paneel twee naar paneel drie is veel kleiner, omdat mijn prompt de kom ook in woorden beschreef, en H3 tekende een passabele marineblauwe kom met een kraanvogel erop alleen uit de tekst. Dat is het nuttige deel. Een referentieafbeelding en een goede zelfstandig naamwoordgroep concurreren voor dezelfde taak, dus gebruik je referentieslots voor de dingen die taal niet kan vastpinnen: een specifiek gezicht, een specifiek product, een specifiek logo.

Het patroon achter bijna elke mislukking in dit artikel is hetzelfde als paneel één. Niets waarschuwt je dat een deel van je verzoek op niets uitkwam.

Wat een referentie daadwerkelijk vastzet, en wat niet. Een referentieafbeelding zet identiteit vast: gezichtsstructuur, haar, onderscheidende kenmerken, kledingstuk. Het zet geen belichting vast, en dit is de meest voorkomende verrassing. Het sleept ook het licht van de referentiefoto mee, daarom produceert een personageblad dat is geschoten in een sfeervolle omgeving een personage dat een scènewissel niet kan overleven. Fotografeer je referentie vlak en neutraal. Een referentievideo zet beweging, kleur en korrel vast, niet identiteit. Een referentieaudio zet de audiobedding zelf vast. Als je hetzelfde gezicht een tekst in dezelfde stem wilt laten uitspreken over een reeks, doet de referentiestapel drie verschillende taken en moet je specificeren welke welke is. Praktijkrichtlijnen komen samen om ze positioneel te benoemen in de prompt ("Afbeelding 1 is het personage, Afbeelding 2 is het product") en die conventie is het waard om over te nemen; mijn prompts hieronder gebruiken in plaats daarvan eenvoudige beschrijvende naamgeving, wat ook werkt wanneer de referenties visueel ondubbelzinnig zijn.

Waarom de eerste aanroep meestal teleurstelt. Vier dingen, allemaal gemeten op 2026-08-12:

  1. Het indieningspunt valideert niets. Verkeerd MIME-type, 164 seconden audio, een dode URL, elkaar uitsluitende velden: alles retourneert HTTP 200 met een predictie-ID. Je komt er later achter.
  2. ratio staat standaard op adaptive, gedocumenteerd als "laat de model kiezen". Met 16:9 referenties kreeg ik 1344x768 op 768P, ongeacht of ik het op adaptive liet staan of 16:9 forceerde, dus de standaard is onschadelijk wanneer je invoer al overeenkomt. Het is een toss wanneer dat niet het geval is, en dit is het enige H3 endpoint waar je simpelweg de beslissing uit handen kunt nemen.
  3. Een eerste-frame afbeelding plus referenties geeft geen fout. Het laat er stilzwijgend een vallen en factureert je.
  4. Als de model niets concreets heeft om zich aan vast te houden, vult het het gat met vertrouwen, en een zelfverzekerd verkeerd gezicht ziet er precies uit als een succesvolle run.

Voor de prompt-craft-kant hiervan gaat de MiniMax H3 prompt guide dieper in op formulering dan ik hier kan.

Het MiniMax H3 Reference to Video Regelboek: Drie Types, Eén Verzoek

Alle drie referentietypes delen één array. Hier is het contract zoals gepubliceerd, naast wat het endpoint daadwerkelijk deed toen ik erop drukte.

Tabel 1: de drie referentietypes

ReferentieafbeeldingenReferentievideoReferentieaudio
Max bestanden93 clips3 clips
Gecombineerd maximum12 bestanden over alle drie types
Per-bestand duurn.v.t.2 tot 15 seconden2 tot 15 seconden
Totale duurn.v.t.15 seconden15 seconden
Formatenpng, jpeg, jpg, webpmp4, movmp3, wav
Kan het alleen gebruikt worden?JaJaNee, heeft een afbeelding of video nodig
Wat het vastzetidentiteit, kledingstuk, product, stijlbeweging, camera, kleur, korrelde audiobedding zelf
Wat het niet vastzetbelichting van de nieuwe scènewie er in het shot zitde exacte track (zie Stap 6)
Geleverd alspublieke URL of base64 data URLpublieke URL of base64 data URLmoet worden gedeclareerd als audio/mp3, niet audio/mpeg
Afgedwongen?10 afbeeldingen gingen prima doorniet getest voorbij 1 clipper-clip venster afgedwongen, 15s totaal was niet

Bestandsaantallen en duurvensters zijn de gepubliceerde limieten van MiniMax (Hailuo, augustus 2026), gecontroleerd tegen de launch write-up die hetzelfde referentievideo venster van 2 tot 15 seconden per stuk en 15 seconden totaal vermeldt (MarkTechPost, augustus 2026). Alles in de laatste drie rijen is van mij, gemeten.

Twee dingen die het specificatieblad je niet vertelt. Ten eerste, het type-veld op elk item is optioneel en wordt afgeleid uit de URL-extensie, wat betekent dat een base64 data URL of een extensieloze link moet zijn type declareren, anders raadt het verzoek het verkeerd. Ten tweede, de browser-uploader heeft een maximum van negen bestanden (Reference Materials (2/9), MAX:9 in de Stap 5 screenshot hieronder), onder MiniMax's eigen twaalf. Ik stuurde toch tien referentieafbeeldingen via de API en de taak werd normaal voltooid, dus negen is een UI-limiet, geen model-limiet.

Tabel 2: reference-to-video versus image-to-video versus text-to-video

reference-to-videoimage-to-videotext-to-video
Accepteert refersja, vereist, min 1nee (stilzwijgend genegeerd)nee
Accepteert image first framenee (stilzwijgend genegeerd)ja, vereistnee
Accepteert end_image last frameneejanee
ratio optiesalle 7, incl. 16:9, 9:16, 21:9alleen adaptivealle 7
Resolutie768P of 2K, standaard 2Khetzelfdehetzelfde
Duur4 tot 15s gehele getallen, standaard 8hetzelfdehetzelfde
Mengen van de invoer van het andere endpointtaak voltooid, invoer verwijderd, volledige kostentaak voltooid, refers verwijderd, volledige kostenn.v.t.

Die vierde rij is het verschil dat niemand noemt. Op image-to-video bevat de aspect ratio enum exact één waarde, adaptive, omdat het eerste frame de vorm bepaalt. Op reference-to-video krijg je alle zeven, wat dit het enige H3 endpoint maakt waar je een framevorm kunt forceren terwijl je nog steeds een personage verankert. Als je een tier kiest voor dit werk, behandelt 2K vs 768P voor MiniMax H3 wat de extra pixels opleveren.

De laatste rij is de dure. Documentatie schetst de twee endpoints als elkaar uitsluitend, en dat zijn ze ook, in de zin dat slechts één invoerpad wordt geëerd. Maar er is geen fout. Ik heb het op 2026-08-12 beide kanten op uitgevoerd: een reference-to-video aanroep met een eerste-frame image was voltooid in 115 seconden en factureerde $0,40, en een image-to-video aanroep met refers was voltooid in 167 seconden en factureerde $0,40. Beide produceerden een video. Beide gooiden de helft weg van wat ik stuurde, en geen enkel veld in de reactie zegt welke helft.

Tabel 3: de modellen die deze workflow gebruikt

Alles hieronder draait in één browsertabblad op Atlas Cloud, waar de prijzen en screenshots vandaan komen. Tarieven gecontroleerd op 2026-08-12.

StapModelTariefAantal runsKosten
Personage + rekwisiet referentiesopenai/gpt-image-2/text-to-imagevermeld vanaf $0,009; hoge kwaliteit op 2048x1152 gemeten op $0,17452$0,35
Referentieaudiominimax/music-2.6$0,15 per track1$0,15
Shot A en Shot Bminimax/h3/reference-to-video$0,10/s op 768P, $0,14/s op 2K2 x 8s op 2K$2,24
Referentieladderzelfde, plus minimax/h3/text-to-video$0,10/s op 768P3 x 4s op 768P$1,20

Er is geen korting actief op een van de drie H3 endpoints deze maand. Twee buren zijn momenteel goedkoper als je alleen referentiestills bouwt: gpt-image-2-developer/text-to-image is 50% korting, $0,009 naar $0,004 vanaf augustus 2026. Volledige per-seconde uitsplitsingen vind je in de MiniMax H3 API pricing gids.

MiniMax H3 Reference to Video, Stap voor Stap

De scène: een vrouw die een ramen-kraam runt. Shot A is een regenachtige neonsteeg 's nachts. Shot B is dezelfde vrouw de volgende ochtend in een lege overdekte markt, een andere plek, een ander tijdstip van de dag en een andere lens. Er gaat niets tussen de twee aanroepen over, behalve de referenties, wat het punt van de test is.

Stap 1: Maak de personage referentie, met opzet vlak belicht

Dit is de stap die mensen fout doen. Een personage referentie is geen mooie foto van je personage, het is een meting van hun gezicht. Neutraal licht, effen achtergrond, geen scène, geen sfeer. H3 leert het licht samen met het gezicht, dus een sfeervolle referentie produceert een personage dat aan die sfeer is gelast.

Model: openai/gpt-image-2/text-to-image. Instellingen: quality high, size 2048x1152 (16:9), format png.

text
1Editorial photograph of a woman in her early thirties, a street-food chef. Close three-quarter portrait, neutral expression, direct eye contact with camera. Short black hair tucked behind one ear, a small scar above the right eyebrow, warm olive skin. She wears a faded indigo work jacket with the sleeves rolled to the elbow and a folded white towel over the left shoulder. Plain light grey studio background, soft even key light, no props, sharp focus on the face, natural skin texture, no retouching. Photorealistic, 50mm lens.
2

Screenshot van AI-beeldgenerator met invoerprompt en gegenereerd portret

GPT Image 2 playground op Atlas Cloud met de personage referentie prompt geladen en het voltooide portret in het uitvoerpaneel

GPT Image 2 op Atlas Cloud: kwaliteit ingesteld op high, 16:9, het personageblad weergegeven aan de rechterkant.

Vrouw in een blauwe jumpsuit met een handdoek over haar schouder

Personage referentieafbeelding voor MiniMax H3 reference-to-video: neutraal studioportret van een ramenchef met een litteken boven haar rechterwenkbrauw

Referentieafbeelding 1. Het litteken boven de rechterwenkbrauw en de opgevouwen witte handdoek zijn opzettelijk: het zijn goedkope, ondubbelzinnige identiteitsankers die je in elk later frame kunt controleren.

Stap 2: Maak de rekwisiet referentie

Tweede referentieslot, tweede taak. Objecten gedragen zich hier beter dan gezichten, wat een onderscheidend rekwisiet de gemakkelijkste manier maakt om te bewijzen dat een referentie landde. Zelfde model, zelfde instellingen.

text
1Product photograph of a single dark navy ceramic ramen bowl with a hand-painted white crane on the side, chipped at the rim, filled with steaming shoyu ramen. Straight-on view, plain light grey background, soft even light, sharp focus, photorealistic, 50mm lens.
2

varkensvlees, (5) ei, (6) en (7) groene (8) uien (9)

Rekwisiet referentieafbeelding: donkere marineblauwe ramenkom met een handgeschilderde witte kraanvogel en een afgebroken rand

Referentieafbeelding 2. De handgeschilderde kraanvogel en de chip in de rand zijn de herkenningspunten. Als ze overleven in de video, is de referentie gelezen.

Stap 3: Shot A, twee afbeeldingen in MiniMax H3 reference-to-video

Twee referentieafbeeldingen, beide type: "image", in refers. Stel de ratio expliciet in. adaptive is de standaard en zal meestal het juiste doen wanneer je referenties al 16:9 zijn, maar het beslist voor jou, en op dit endpoint hoef je dat niet toe te staan.

Model: minimax/h3/reference-to-video. Instellingen: resolution 2K, duration 8, ratio 16:9.

text
1Wide establishing shot. Heavy rain at night in a narrow neon-lit alley. The woman from the reference image works alone behind a small steaming ramen stall under a plastic awning, ladling broth into the navy bowl with the white crane from the reference image. Steam rises through pink and green neon reflections on the wet pavement. Slow push-in on the stall. Ambient sound: rain on plastic, boiling broth, distant traffic. No dialogue.
2

De uitvoer van deze aanroep is de eerste helft van de showcase clip bovenaan. Houd de URL bij. Het is de invoer voor Stap 5.

Stap 4: Snijd een acht seconden durende referentieaudio

Referentieaudio is geen soundtrack-slot. Het is een bedding waartegen de model zijn eigen mix matcht, en het is de meest lastige invoer op het endpoint. Genereer een track, snijd hem dan af, want een volledig nummer wordt afgewezen.

Model: minimax/music-2.6, met is_instrumental: true en format: "mp3".

text
1Sparse late-night jazz, brushed snare, upright bass, one muted trumpet, melancholic, 70 BPM, instrumental.
2

Snijd vervolgens ongeveer acht seconden en codeer het als een data:audio/mp3 URL. Drie dingen die ik hier eerst fout deed, allemaal met de exacte fouttekst:

  • De MIME-string is belangrijker dan de bytes. Declareer data:audio/mpeg en de referentie wordt geweigerd met audio format ".mpeg" not allowed, ook al is het bestand een volkomen gewone MP3. Schrijf audio/mp3.
  • 2 tot 15 seconden per clip, en het wordt afgedwongen. Mijn gegenereerde track duurde 164 seconden. Het kwam terug als invalid param: audio duration 164258 ms, expected [2000, 15000] ms. Het snijden naar 8,05 seconden loste het op. Beide afwijzingen kostten niets.
  • Het gecombineerde maximum van 15 seconden is gedocumenteerd maar niet afgedwongen. Ik stuurde twee clips van 8 seconden in hetzelfde verzoek, 16,1 seconden totaal, in afwachting van een afwijzing. De taak werd voltooid en normaal gefactureerd. Bouw daar niet op: het is gepubliceerd als een limiet en kan zich op elk moment als zodanig gaan gedragen.

AI-muziekgenerator interface met tekstprompt en gegenereerde audio-golfvorm

MiniMax Music 2.6 playground op Atlas Cloud met de jazzprompt en de voltooide track in het uitvoerpaneel

MiniMax Music 2.6 op Atlas Cloud, $0,15 per run, voltooide track aan de rechterkant. Eén ding om te kopiëren van deze screenshot en één ding niet: de prijs en het mp3-formaat zijn correct, maar Is Instrumental staat nog uit en de demo-songteksten van de pagina staan nog in het vak, dus deze specifieke run kwam terug als een nummer van 1:35 met zang. Zet die schakelaar om en wis het Lyrics-veld voordat je het uitvoert, of je snijdt een referentiebedding met iemand die eroverheen zingt. Mijn API-run, met isinstrumental: true, retourneerde 2:44 instrumentale muziek in 209 seconden.

Stap 5: Shot B, één MiniMax H3 reference-to-video aanroep met alle drie types

Dit is de aanroep waar het trefwoord echt om draait. Drie referentietypes, drie verschillende taken, één array:

  1. het personageportret uit Stap 1, type: "image", om haar gezicht vast te houden
  2. de Shot A mp4 uit Stap 3, type: "video", om de kleur en korrel over de cut te dragen
  3. de acht seconden jazz-slice uit Stap 4, type: "audio", als de bedding

Uitvoer-URL's van andere generaties op het platform kunnen rechtstreeks in refers worden geplaatst als de videoreferentie, wat het daadwerkelijke mechanisme is achter multi-shot continuïteit. Niet "H3 onthoudt je personage". Je geeft het vorige shot terug aan het model.

Model: minimax/h3/reference-to-video. Instellingen: resolution 2K, duration 8, ratio 16:9.

text
1The same woman from the reference image, the next morning. Bright empty covered market, cold clean daylight through a skylight, shutters still down behind her. Medium close-up, static camera. She wipes the counter with the folded white towel, looks up at the camera and says one line, then goes back to work. Keep her face, hair, scar and indigo jacket identical to the reference. Carry the grade and grain of the reference clip. Use the reference audio as the underscore.
2

AI-videogenerator interface met invoerprompt en gegenereerde video

MiniMax H3 reference-to-video playground op Atlas Cloud met een afbeeldings- en een audioreferentie geladen en de gegenereerde clip in het uitvoerpaneel

Dezelfde aanroep in de MiniMax H3 Reference-to-Video playground, op 2K en 8 seconden. Twee referentieslots van verschillende types zijn zichtbaar in Reference Materials (2/9): slot 1 is ref-audio-8s.mp3, slot 2 is haar portret. De videoreferentie gaat via "Add via link" (rechtsboven in dat paneel) of via de API, omdat het op een URL staat in plaats van op schijf. Drie dingen om uit dit paneel te lezen: de uploader zegt MAX:9 ook al is MiniMax's eigen maximum 12, Aspect Ratio staat op adaptive tenzij je het wijzigt, en de run-prijs voor 2K op 8 seconden is $1,12, wat de $0,14 per seconde tier is.

Stap 6: Controleer of de referentie daadwerkelijk landde

Een voltooide taak is geen succesvolle taak. Twee controles, beide goedkoop.

Controleer het gezicht. Haal een frame uit elk shot en zet ze naast elkaar. Je zoekt naar de ankers die je hebt geplant: het litteken, de haarlijn, de jas, de handdoek.

Vergelijking van een vrouw in neon-nacht- en ochtendmarkverlichting

Frame uit Shot A naast een frame uit Shot B, met hetzelfde MiniMax H3 reference-to-video personage in twee verschillende scènes

Links: Shot A, nacht, neon, wijd. Rechts: Shot B, overdekte markt, volgende ochtend, medium close-up. Hetzelfde gezicht, hetzelfde litteken boven de rechterwenkbrauw, dezelfde jas en handdoek, over een scène- en kadreringwisseling met niets gedeeld behalve de referenties.

Eén ding ging niet zoals ik de prompt schreef. Ik vroeg om "bright empty covered market, cold clean daylight" en "carry the grade and grain of the reference clip", en de referentieclip won. Shot B is onmiskenbaar ochtend en onmiskenbaar een andere plek, maar het is veel sfeervoller dan "bright" impliceert, omdat de nachtkleur meeging met de videoreferentie. Je kunt niet in één aanroep dezelfde look en het tegenovergestelde licht vragen. Als je het licht wilt veranderen, laat dan de kleur-instructie vallen, of laat de videoreferentie vallen en houd identiteit vast met alleen de afbeelding.

Controleer de audio. Plot de golfvorm van de acht seconden slice die je hebt geüpload naast de track die terugkwam in de mp4, en voeg een controle toe: een clip gegenereerd zonder audioreferentie.

Drie gestapelde audiogolfvormen die geüploade, geretourneerde en controle-tracks vergelijken

Golfvorm van de geüploade acht seconden referentieaudio, de audiotrack die terugkwam in de gegenereerde clip, en een controle zonder audioreferentie

Boven: de 8,05 seconden jazz-slice verzonden als referentie. Midden: de track geëxtraheerd uit de geretourneerde Shot B mp4, gedomineerd door de dialooglijn rond 5,5 seconden. Onder: Shot A, dezelfde workflow, geen audioreferentie.

Dit is waar ik iets moet corrigeren dat ik geloofde toen ik begon. Referentieaudio komt niet letterlijk terug. Enveloppencorrelatie tussen mijn slice en de geretourneerde track is 0,25, tegen −0,05 voor de controle zonder referentie, dus de twee zijn gerelateerd maar verre van identiek, en de geretourneerde vorm is duidelijk zijn eigen mix in plaats van mijn bestand met iets eroverheen. Wat de referentie duidelijk wel deed, was er iets onder leggen: de bedding van Shot B is ongeveer 7 dB warmer dan de controle zonder audio in de eerste vijf seconden, voordat er dialoog begint. Lees referentieaudio als een sturing op de mix, niet als een muziekslot. Als je je exacte track onder de afbeelding nodig hebt, leg deze dan achteraf in.

Als je werkt aan de audiokant hiervan, beginnen MiniMax H3 lip sync en audio en de MiniMax H3 muziekvideo walkthrough beide vanuit hetzelfde referentieaudio gedrag. Voor de polling- en herprobeercode rond dit alles, heeft de MiniMax H3 tutorial de loop.

Vier Andere MiniMax H3 Reference to Video Opstellingen Die Het Waard Zijn om te Stelen

Herstyleer een clip die je al bezit. Plaats een voltooide clip in refers als de videoreferentie, helemaal geen afbeeldingen, en vraag om een ander medium. De beweging, de kadrering, de push-in en de rekwisieten overleven; het oppervlak verandert. Dit is het mechanisme achter H3's video-editing ranking, en het is hetzelfde als achter de anime-werk in MiniMax H3 vs Veo 3.1 voor anime.

Vrouw die kookt bij een foodcart in een neonverlichte steeg

Anime-herstijl gegenereerd uit de Shot A clip gebruikt als MiniMax H3 reference-to-video referentie

De Shot A steeg teruggegeven als de enige referentie, met een cel-shaded anime prompt. Zelfde kraam,zelfde pollepel, zelfde kraanvogelkom, zelfde push-in, opnieuw getekend. Eén detail dat de moeite waard is om te weten: de conversie is het zwakst in de eerste frames en het sterkst zodra de camera zich committeert aan de beweging. Weergegeven als stille GIF. Gegenereerd met minimax/h3/reference-to-video op 768P, 4s, $0,40.

Laat een foto zingen. Eén portret plus één vocale clip binnen het venster van 2 tot 15 seconden, prompt de uitvoering. Goedkoper dan een lip sync pipeline omdat het één enkele aanroep is.

Zet een product vast in elke scène. Referentieafbeeldingen pinnen objecten harder dan gezichten, dus een echte productfoto plus een scèneprompt is het meest betrouwbare op dit endpoint. Controleer wat je met het resultaat mag doen voordat het in een advertentie gaat.

Bouw een serie, geen clip. Keten het: de uitvoer van shot N wordt de videoreferentie van shot N+1. Elke aanroep is nog steeds beperkt tot 15 seconden, dus continuïteit is jouw taak, niet die van de model. Hoe lang een MiniMax H3 video kan zijn behandelt waar dat plafond bijt.

Voordat je een serie aan één engine toevertrouwt? Seedance 2.5 vs MiniMax H3 en MiniMax H3 alternatieven zijn de twee om te lezen.

Wat Een Two-Shot MiniMax H3 Reference to Video Scene Werkelijk Kost

Elke regel hieronder is een echte taak van 2026-08-12, met het bedrag uit het price-veld dat de API retourneert bij elke voltooide predictie.

Tabel 4: de daadwerkelijke rekening

TaakModelInstellingenResultaatGefactureerd
Personage referentiegpt-image-2high, 2048x1152voltooid$0,1745
Rekwisiet referentiegpt-image-2high, 2048x1152voltooid$0,1745
Referentieaudiomusic-2.6instrumental, mp3voltooid, 164s track, 209s wachten$0,15
Shot Ah3/reference-to-video2K, 8s, 2 image refsvoltooid in 309s$1,12
Shot Bh3/reference-to-video2K, 8s, image + video + audio refsvoltooid in 557s$1,12
Ladder, geen referentieh3/text-to-video768P, 4svoltooid in 154s$0,40
Ladder, 1 image refh3/reference-to-video768P, 4svoltooid in 119s$0,40
Ladder, 2 image refsh3/reference-to-video768P, 4svoltooid in 128s$0,40
Anime herstijlh3/reference-to-video768P, 4s, 1 video refvoltooid in 239s$0,40
Stap 5 herrun in de playgroundh3/reference-to-video2K, 8s, image + audio refsvoltooid$1,12
Controle: 10 image refsh3/reference-to-video768P, 4svoltooid in 150s$0,40
Controle: first-frame image + refersh3/reference-to-video768P, 4svoltooid, één invoer verwijderd$0,40
Controle: refers op image-to-videoh3/image-to-video768P, 4svoltooid, refers verwijderd$0,40
Controle: 16,1s referentieaudioh3/reference-to-video768P, 4svoltooid over een gedocumenteerde limiet$0,40
Controle: ratio weggelaten, daarna ratio adaptiveh3/reference-to-video768P, 4s, tweemaalbeide voltooid, identieke 1344x768$0,80
Screenshot herruns van Stappen 1 en 4gpt-image-2, music-2.6als bovenvoltooid$0,32
Controle: audio referentie alleenh3/reference-to-video768P, 4smislukt in 7ms$0,00
Controle: 164s referentieaudioh3/reference-to-video768P, 4smislukt in 16s$0,00
Controle: audio/mpeg MIMEh3/reference-to-video768P, 4smislukt in 17s$0,00
Controle: dode referentie URLh3/reference-to-video768P, 4smislukt in 21s$0,00
Totaal$8,18

Splits dat totaal eerlijk. De voltooide two-shot scène bovenaan dit artikel, inclusief referenties en audio, is $2,74 ervan. De andere $5,44 is het onderzoek: controles, opzettelijke breuken, en het opnieuw uitvoeren van stappen in de browser voor de screenshots. Als je de regels al kent, kost een 16 seconden durende two-shot sequentie op 2K minder dan een broodje.

Drie dingen vallen uit die tabel.

Referenties zijn gratis. De tien-afbeeldingen controle kostte exact dezelfde $0,40 als de ladder-run met één afbeelding bij dezelfde lengte en resolutie. Op dit platform loopt de meter op uitvoer seconden en resolutie, niets anders. Het is de moeite waard om één tegenstrijdigheid te markeren: de eigen platformregels van MiniMax beschrijven dat invoervideo wordt gefactureerd tegen het uitvoertarief, en het uniforme schema op OpenRouter heeft een aparte reference_images regel. Geen van beide verscheen op mijn factuur hier. Als je elders budgetteert, prijs het dan zelf in plaats van aan te nemen.

Mislukking is gratis, en het is laat. Alle vier afwijzingen kostten niets, dat is het goede nieuws. Het slechte nieuws is wanneer ze aankomen: 7 milliseconden voor de audio-alone regel, 16 tot 21 seconden voor de audiolengte, het verkeerde MIME en de dode URL, en helemaal niets bij het indienen. Elk foutief verzoek in dit artikel kreeg eerst HTTP 200 en een predictie-ID, dus behandel een indieningsreactie als een ontvangstbewijs, niet als validatie, en pol de status-veld voordat je iets gelooft.

Stille succes is de dure mislukking. De twee mengcontroles kostten elk een volledige $0,40 en retourneerden een perfect geldige video gebouwd uit de helft van mijn invoer. Er is geen fout, geen waarschuwingsveld, en geen manier om uit de reactie te zien dat er iets is weggegooid. Dat is de enige regel in de tabel waar geld de rekening verliet en ik niets kreeg wat ik wilde.

Eén eerlijke correctie op dat laatste punt, omdat het onder me veranderde terwijl ik schreef. Begin augustus gedroeg een referentie-URL die 404 gaf zich hetzelfde: de taak werd voltooid, de referentie werd stilzwijgend genegeerd en het volledige bedrag werd in rekening gebracht. Het opnieuw uitvoeren op 2026-08-12, het endpoint controleert nu bereikbaarheid en mislukt de taak gratis met een benoemde fout, content[1].image_url: media not found (HTTP 404). Dat specifieke gat is gedicht. Het gat van elkaar uitsluitende invoer is niet. Voor per-clip credit wiskunde, MiniMax H3 credits per video heeft de tabellen.

Wiens Gezicht, Wiens Stem: Controleer Dit Voordat Je Een Referentie Upload

Dit endpoint verschilt van text-to-video op één juridisch relevant punt: jij levert de gelijkenis. Een referentieafbeelding van een echt persoon, een referentieclip uit iemands film, een referentievocaal in een herkenbare stem, al dit materiaal is materiaal waarvan je beweert het recht te hebben om het te gebruiken. Model-side inhoudsregels zijn nog steeds van toepassing bovenop dat, en ze zijn strenger over echte mensen dan over verzonnen. Twee gidsen die de moeite waard zijn om te lezen voordat een klant de uitvoer ziet: MiniMax H3 content restrictions en de commercial use and licensing uitsplitsing, die ook de gebiedsuitsluitingen in MiniMax's voorwaarden behandelt.

MiniMax H3 Reference to Video: Veelgestelde Vragen

Kan MiniMax H3 reference-to-video hetzelfde personage behouden over twee verschillende shots?

Ja, en mijn two-shot test hierboven houdt stand over een volledige nacht-naar-ochtend belichtingsomkering. Maar een personageafbeelding alleen is niet wat het doet. Het betrouwbare patroon is om de uitvoer-URL van het vorige shot terug te geven als een referentievideo samen met de personageafbeelding, zodat de tweede aanroep zowel kleur als korrel erft als identiteit.

Kan ik een eerste-frame afbeelding en referenties gebruiken in dezelfde MiniMax H3 reference-to-video aanroep?

Nee, en de faalmodus is het probleem. Het sturen van zowel image als refers geeft geen fout. Getest op 2026-08-12, de taak werd voltooid in 115 seconden, factureerde $0,40, en verwijderde stilzwijgend een van de twee invoeren. Hetzelfde gebeurt in omgekeerde richting op het image-to-video endpoint. Kies één pad per aanroep.

Kan ik een audiobestand alleen sturen als MiniMax H3 reference-to-video referentie?

Nee. Audio moet reizen met ten minste één referentieafbeelding of video, en het endpoint dwingt het af met een expliciete fout: reference-to-video requires at least one reference image or video. Het arriveert in de generatiefase, niet bij indiening, en de afgewezen taak is gratis. Audioreferenties moeten ook binnen 2 tot 15 seconden vallen, 15 seconden gecombineerd, en worden gedeclareerd als audio/mp3 in plaats van audio/mpeg.

Brengt MiniMax H3 reference-to-video extra kosten in rekening voor elk referentiebestand?

Niet op Atlas Cloud. Een run met tien referentieafbeeldingen en een run met één factureerden dezelfde $0,40 op 768P en 4 seconden, dus de meter volgt alleen uitvoer seconden en resolutie. Let echter op de tegenstrijdigheid: MiniMax's eigen regels vermelden dat invoervideo wordt gemeten tegen het uitvoertarief, en andere platforms tonen een aparte reference-image regel. Verifieer op het oppervlak waar je door factureert.

Wat gebeurt er als een van mijn MiniMax H3 reference-to-video URL's kapot is?

Vanaf 2026-08-12 valideert het endpoint bereikbaarheid en mislukt de hele taak gratis, met content[1].image_url: media not found (HTTP 404) na ongeveer 21 seconden. Dat is een wijziging: eerder in augustus voltooide hetzelfde verzoek, negeerde de ontbrekende referentie stilzwijgend en factureerde de volledige prijs. Ga er niet van uit dat oudere gedragsrapporten nog gelden, en controleer het status-veld in plaats van aan te nemen dat een 200 bij indiening iets betekent.

Is MiniMax H3 reference-to-video echt het beste model hiervoor?

Op de enige openbare head-to-head die het meet, ja, nipt. MiniMax H3 leidt de video-editing leaderboard op Elo 1.125 over 10.280 stemmen, maar de vermelde rangschikking is 1 tot 2 en Gemini Omni Flash zit 3 Elo punten achter met een overlappend interval. Behandel het als "gezamenlijk best beschikbaar", kies op de rest van de workflow, en lees MiniMax H3 alternatieven als de gelijkstand voor jou uitmaakt.

Nieuwste modellen

Eén API voor alle media-AI.

Verken alle modellen