
Een nachtelijke color suite, zes monitoren die zes verschillende shots tonen van dezelfde zangeres met zilver haar_Zes_ shots, één artiest, één nummer. Gegenereerd met openai/gpt-image-2/text-to-image .
Suno-gebruikers genereren ongeveer 7 miljoen nummers per dag, ruwweg een volledige Spotify-catalogus elke twee weken (TechCrunch, februari 2026). Bijna geen van hen krijgt ooit een plaatje erbij. Niet omdat het plaatje onmogelijk is, maar omdat de traditionele route door vier tools loopt: stilstaande beelden genereren, ze animeren, een aparte lip-sync pass draaien, en dan alles in een montage oplappen. Elke sprong verliest het gezicht, de kleding of de beat.
Dus ik sloeg de sprongen over. Ik gooide een 8-seconden-slice van een refrein rechtstreeks in de referentiesleuf van een videomodel en drukte op Start. Het rekende me niets voor de audio.
Toen haalde ik de voltooide mp4 uit elkaar om de vraag te beantwoorden die niemand op internet rechtstreeks beantwoordt: is het geluid dat uit het model komt mijn nummer, of iets dat het heeft verzonnen dat er alleen maar op lijkt? Ik heb het gemeten. Het antwoord is niet wat ik verwachtte, en het verandert hoe je het ding moet knippen.
Belangrijkste conclusies
- Referentieaudio is gratis. MiniMax H3 factureert alleen outputseconden. Mijn vier 8-seconden-referentieslices voegden $0,00 toe aan de rekening. Referentie video is de dure.
- 15 seconden is een plafond per generatie, niet per project. Snijd het nummer, schiet één slice per shot, voeg samen. Mijn 32-seconden-cut is vier generaties.
- Schrijf de hook op 120 BPM. Eén maat is exact 2.000 seconden, dus H3's
duration-waarden in hele seconden komen op maatlijnen terecht zonder handmatig aanpassen. 8s = 4 maten.- De outputaudio is jouw track, sample-aligned. Ik heb 0.892 golfvormcorrelatie gemeten bij zero lag tussen mijn input-slice en H3's geleverde stereomix. Het wordt niet opnieuw gegenereerd. Je wilt nog steeds de master terugleggen voor de definitieve cut, om een andere reden (hieronder).
- Totale echte uitgave: $7,53 over negen generaties inclusief de mislukkingen. De vier shots die de uiteindelijke cut haalden plus het nummer en het basis-frame kwamen op $4,80.
De MiniMax H3 Muziekvideo die ik knipte uit één 32-seconden Hook
Geluid aan. Dit zijn vier afzonderlijke generaties, samengevoegd zonder overgangen, met de originele 32-seconden master eroverheen gelegd.
TfrOvWHf4ys
"MIRA", 32 seconden, 2560x1440, 24 fps. Vier minimax/h3/reference-to-video generaties van elk 8 seconden, $1,12 per shot. Het nummer ging erin als referentieaudio en kostte $0,00.
Vier generaties, vier compleet verschillende belichtingswerelden, één gezicht. Er is niets geretoucheerd tussen de shots.

Vier frames uit de vier shots die dezelfde zangeres tonen op een neon-dak, een woestijnweg, een witte studio en in een zwarte watertank_Een_ frame uit elke geleverde clip. Hetzelfde haar, dezelfde mesh-top, dezelfde rode LED-choker in regen, laagstaande zon, platte high-key en onder water.
Waarom de meeste MiniMax H3 Muziekvideo-pogingen uit elkaar vallen bij seconde zestien
Drie faalmodi, allemaal te vermijden.
Een: 15 seconden behandelen als de projectlimiet. H3 beperkt een enkele generatie tot 15 seconden. Mensen lezen dat, concluderen "geen muziekvideo's" en stoppen. Maar een muziekvideo was nooit één shot. Een echte video knipt om de 4 tot 8 seconden. De limiet dwingt je alleen te doen wat een editor toch al zou doen.
Twee: ritme in woorden beschrijven. "Upbeat, energiek, dansen op de beat" geeft het model niets om aan vast te houden. Het verzint een tempo en je snijpunten komen altijd een halve beat te laat. Door de daadwerkelijke audio aan te leveren, wordt het giswerk weggenomen.
Drie: de kleding laten afdrijven. Elk shot heeft dezelfde referentieafbeelding en dezelfde bewoording voor de kleding nodig, letterlijk. Verander "zwarte mesh-top" in "donkere mesh-shirt" tussen shots en je krijgt een ander persoon.
Hier is wat de twee routes je daadwerkelijk kosten:
| Traditionele vier-tool-keten | Enkele H3-referentie-aanroep | |
|---|---|---|
| Tools per shot | Afbeeldingmodel, videomodel, lip-sync-tool, NLE | Eén eindpunt, dan een NLE aan het einde |
| Handmatige stappen per shot | 4 overdrachten, 3 bestandsexporten | 1 inzending |
| Wat het personage behoudt | Handmatig opnieuw prompten en geluk | Eén referentieafbeelding, letterlijk hergebruikt |
| Beeld en geluid | Afzonderlijk gerenderd, later uitgelijnd | In dezelfde pas gegenereerd, 32 kHz stereo |
| Kosten per 8-seconden-shot | Vier aparte meters | $1,12 bij 2K, $0,80 bij 768P |
Om de oude route recht te doen: het is geen fantasie. De Japanse maker Arata Fukoe behaalde een Project Odyssey-brons met een volledig AI-muziekvideo, en zowel Queen als Linkin Park hebben officiële AI-ondersteunde video's uitgebracht. Die ketens liepen alleen door vier of vijf tools, wat precies is waar een onafhankelijke artiest met één nummer geen tijd voor heeft.
Wat referentieaudio daadwerkelijk oplevert voor een MiniMax H3 Muziekvideo
Dit is het deel dat het waard is om te begrijpen voordat je iets uitgeeft.
H3 genereert beeld en geluid in één pas in plaats van audio over voltooide frames te dubben. Wanneer je een referentietrack aanlevert, is die track geen sfeernota. Ik heb mijn input-slice vergeleken met de audiostream in de geleverde mp4, op golfvormniveau, op een 8 kHz mono downmix:
- Envelopecorrelatie: 0,956 bij zero lag
- Ruwe golfvormcorrelatie over een 2-seconden-venster: 0,892 bij zero sample-offset
Dat is geen model dat een soortgelijk nummer reproduceert. Dat is jouw bestand, sample-aligned, met de sfeer die de prompt vroeg eroverheen gelegd en één ronde AAC-hercodering. Ter vergelijking: dezelfde meting tegen een controle-opname gegenereerd zonder referentieaudio kwam terug op 0.26, wat de ruisvloer is.

Golfvorm van de input-slice hierboven, de audio die H3 leverde hieronder, uitgelijnd op zero offset_Boven: de 8-seconden mp3 die ik uploadde. Onder: de audiostream in de mp4 die H3 retourneerde. Dezelfde pieken, dezelfde posities, geen offset._
De invoerlimieten zijn strikt en worden afgedwongen op het moment van indienen in plaats van stilzwijgend:
| Referentie-invoer | Limiet | Gefactureerd |
|---|---|---|
| Afbeeldingen | tot 9 | gratis op Atlas Cloud's H3-eindpunten |
| Video's | tot 3, elk 2-15s | gefactureerd tegen outputtarief |
| Audio | tot 3, elk 2-15s, 15s totaal over alle clips | $0,00 |
| Alleen audio | geweigerd, heeft minimaal één afbeelding of video nodig | n.v.t. |
Ik heb het totale audio-plafond met opzet getest door drie 8-seconden-slices in één aanroep te sturen. Het faalde in 5,8 seconden met invalid params, total audio duration 24138 ms exceeds 15000 ms en werd niet gefactureerd. Goed nieuws: H3 laat het extra bestand niet stilletjes vallen en rekent je toch aan.
Nog een valkuil die ik daarvoor tegenkwam. Als je audio als base64-data-URL doorgeeft, bepaalt het MIME-type de extensie die de API afleidt. data:audio/mpeg wordt geweigerd met audio format ".mpeg" not allowed. data:audio/mp3 gaat er gewoon doorheen. Vier inzendingen gingen daaraan dood voordat ik het opmerkte, allemaal gratis.
De MiniMax H3 Muziekvideo-workflow, en wat elke seconde kost
Alles hieronder draait op één API-sleutel op Atlas Cloud, waar ik alles heb uitgevoerd en gefactureerd. Drie modellen, één browsertabblad.
| Stap | Model | Wat het doet | Prijs die ik daadwerkelijk kreeg gefactureerd |
|---|---|---|---|
| Schrijf de hook | minimax/music-2.6 | Heel nummer van een stijlprompt plus songtekst, mp3 tot ~5 min | $0,15 per nummer, vast bedrag |
| Leg de artiest vast | openai/gpt-image-2/text-to-image | Eén basisframe dat elk shot erft | $0,1745 bij kwaliteit high, 2048x1152 |
| Schiet elk shot | minimax/h3/reference-to-video | Afbeelding plus audio erin, beat-locked clip met stereo geluid eruit | $0,14/s bij 2K, $0,10/s bij 768P. Audio input $0,00 |
Twee opmerkingen bij die tabel, omdat de vermelde getallen in beide richtingen liegen. GPT Image 2 toont een $0,009-vloer in de catalogus; dat is de laagste tokenlaag, en een echte 2048x1152 high-render factureert $0,1745. H3's catalogusvermelding toont $0,10, wat alleen de 768P-laag is; mijn 8-seconden 2K-jobs factureerden elk exact $1,12, wat $0,14 per seconde is.
Als je een first-frame lock wilt in plaats van onderwerpreferenties, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) neemt dezelfde tarieven, en [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) dekt pure prompt-shots.
De correctie die het waard is om te maken: een eerdere versie van dit plan ging ervan uit dat je je eigen nummer moest meenemen omdat er geen hele-nummer-generator op het platform was. Die is er nu. minimax/music-2.6 schrijft de track, dus de hele keten, inclusief het nummer, draait op één plek.
Hoe maak je een MiniMax H3 Muziekvideo, stap voor stap
Stap 1: Schrijf een 120 BPM Hook en knip deze in per-shot-slices
Vraag expliciet om 120 BPM. Bij 120 BPM is één maat exact 2.000 seconden, dus H3's duration-enum in hele seconden komt vanzelf op maatlijnen terecht: 4s = 2 maten, 6s = 3 maten, 8s = 4 maten, 10s = 5 maten. Je snijpunten vallen op de downbeat zonder dat je iets aanraakt.
Model: minimax/music-2.6. Instellingen: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.
Stijlpunt:
plaintext1Synth-pop op exact 120 BPM, rechte four-on-the-floor kick, heldere analoge 2sidechained pads, schone vrouwelijke leadzang die vooraan in de mix zit, brede 3stereo chorus, geen rap, aangehouden open klinkers, cinematisch en licht 4melancholisch, radio-ready master
Songtekst:
plaintext1[Chorus] 2Hold the line, hold the light 3I am running out of night 4Say my name into the rain 5And I will burn again
Het retourneerde een nummer van 70 seconden in 75 seconden voor $0,15. Ik controleerde toen het tempo in plaats van het te vertrouwen, door een onset-novelty-autocorrelatie over het bestand te draaien. De sterkste lag kwam terug op exact 0,500 s, wat 120 BPM is, en het beatgrid begint op 0,24 s in het gedecodeerde bestand in plaats van op nul. Die offset is belangrijk: knip vanaf 0,24 en elke slice begint op een downbeat.
plaintext1# 32-seconden master, beginnend op de downbeat op 0.24s 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# vier 8-seconden-slices, één per shot, elk 4 maten en ruim onder de 15s limiet 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
Als je al je eigen track hebt, sla deze stap dan helemaal over. Dat is de normale situatie, en het is de goedkoopste.
Stap 2: Leg de artiest vast met één GPT Image 2-basisframe
Elk shot verwijst naar dit ene bestand. Wat hier fout is, is vier keer fout, dus geef die $0,17 uit en bekijk het goed.
Model: openai/gpt-image-2/text-to-image. Instellingen: kwaliteit high , formaat 2048x1152 (16:9).
plaintext1Cinematische muziekvideostill, portret van middel tot taille. Een 25-jarige Oost-Aziatische 2synth-pop zangeres met zilverwit kortgeknipt haar en een rechte pony, een mat 3zwarte mesh-top, een dunne rode LED-choker die gloeit tegen haar sleutelbeen, en een enkele 4zilveren oorkraal. Ze staat op een doorweekte dakrand 's nachts en houdt een vintage 5chroom handheld microfoon dicht bij haar mond. Achter haar, onscherp magenta 6en cyaan neonreclame, fijne regen gevangen in een hard tegenlicht, stoom die uit een 7ventilatieopening komt. Geschoten op 35mm anamorfisch, geringe scherptediepte, teal-en-magenta-grade, 8zichtbare filmkorrel. Haar gezicht is scherp en gelijkmatig belicht door een zacht key light van 9camera links. Geen tekst ergens in het frame.

Het gegenereerde basisframe: zilverharige zangeres met een chromen microfoon op een doorweekte neon-dakrand_Het_ basisframe dat elk later shot erft. Gegenereerd met openai/gpt-image-2/text-to-image , kwaliteit high, 2048x1152, gefactureerd $0,1745.

GPT Image 2 die dit exacte prompt in de Atlas Cloud-playground uitvoert met het voltooide frame in het outputpaneel
Hetzelfde prompt in de playground: Formaat 16:9 op 2048x1152, Kwaliteit high, en de Run-knop die $0,1745 aangeeft, wat de API mij daadwerkelijk heeft gefactureerd. De $0,009 in de catalogus is de laagste tokenlaag, niet deze. Hetzelfde prompt, andere seed, dus deze render is niet exact het bestand hierboven.
De kledingwoorden in dat prompt (zilverwit kortgeknipt haar, mat zwarte mesh-top, rode LED-choker, zilveren oorkraal) worden letterlijk hergebruikt in elk prompt hieronder. Dat herhalen is het hele consistentiemechanisme. Parafraseer het niet.
Stap 3: Voer de eerste MiniMax H3-muziekvideoshot uit met gratis referentieaudio
Model: minimax/h3/reference-to-video. Instellingen: refers = het basisframe plus slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.
Stel ratio expliciet in. De standaard van de playground is adaptive, en het eindpunt is veel gelukkiger als je de gewenste vorm benoemt.
plaintext1Muziekvideoshot. De vrouw in de referentieafbeelding zingt de referentietrack 2recht de lens in op het natte neon-dak, met de chromen microfoon bij haar 3mond. Ze zet de eerste regel hard in op de downbeat, ogen vast op camera, 4dan kantelt ze haar hoofd achterover op de aangehouden noot. Langzame push-in van taille tot 5een strakke close-up over de acht seconden, handheld micro-drift, regenstralen 6die het harde tegenlicht kruisen. Haar mondvormen volgen exact de gezongen klinkers van de 7referentieaudio, ze zingt, niet spreekt. Identiek zilverwit kortgeknipt haar, mat zwarte mesh-top en gloeiende rode LED-choker als de referentieafbeelding. Soundscape: de referentietrack in stereo, plus vage regen en een verre stadssound laag in de mix.
7sPeYEe-xII
Shot 1, geluid aan. 2560x1440, 8.00 s exact, 24 fps, 32 kHz stereo. 345 seconden van inzending tot bestand, gefactureerd $1,12. Let op het hoofd dat achterover kantelt op de aangehouden noot rond 5 s.

De reference-to-video playground met het basisframe en de audioslice geladen en de voltooide clip in het outputpaneel
Referentiematerialen leest 2/9: slice-0.mp3 in de ene sleuf, het basisframe in de andere. Resolutie 2K, Duur 8, en de Run-knop die $1,12 aangeeft, wat exact 8 x $0,14 is. Let op het Aspect Ratio dropdown dat op adaptive staat, wat de paginastandaard is; mijn API-aanroepen zetten ratio expliciet op 16:9.
Eén getal dat het waard is om op te schrijven: duration: 8 leverde een container van exact 8.00 seconden. duration: 4 leverde 4.46 seconden. Als je van plan bent om op maatlijnen samen te voegen, blijf dan bij de duren die exact terugkomen.
Stap 4: Schiet nog drie werelden zonder het gezicht te verliezen
Hetzelfde basisframe, dezelfde kledingzin, volgende audioslice. Al het andere verandert.
4a. Woestijnweg bij golden hour. refers = basisframe + slice-8.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Muziekvideoshot. Dezelfde vrouw uit de referentieafbeelding staat op de middenlijn 2van een lege woestijnweg bij golden hour, geen microfoon, een open indigo 3denim jas over dezelfde mat zwarte mesh-top, de rode LED-choker nog steeds 4aan. Ze beweegt haar mond mee met het refrein van de referentietrack in de wind terwijl de camera 5laag over het asfalt achteruitrijdt. Hittemirage boven de weg, stof dat opwaait, haar 6schaduw die lang naar de lens reikt, een anamorfische flare die op het 7halve punt kruist. Haar, gezicht en kleding identiek aan de referentieafbeelding. 8Soundscape: de referentietrack over open woestijnwind, breed en luchtig.
4XEki-v2vCU
Shot 2, geluid aan. Hetzelfde gezicht, tegenovergestelde kleurtemperatuur, en de referentietrack opnieuw gemixt onder open wind. 332 s, $1,12.
4b. Witte infinity cove. refers = basisframe + slice-16.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Muziekvideoshot. Dezelfde vrouw uit de referentieafbeelding in een puur witte 2infinity-cove studio onder plat high-key licht zonder schaduwen, met een glanzende 3rode vinyl regenjas over dezelfde mat zwarte mesh-top, rode LED-choker zichtbaar 4aan de kraag. Ze danst vier maten op de referentietrack, zilverwit haar 5zwaait op elke draai. Vaststaand breed frame, dan een harde snap-zoom naar een medium 6op de tweede downbeat. Kleine witte papieren vierkantjes vallen als confetti door de 7laatste twee seconden. Gezicht en haar identiek aan de referentieafbeelding. Soundscape: de referentietrack, 8droog en dichtbij, plus het piepen van schoenen op de studievloer.
VAyqdkVpnm0
Shot 3, geluid aan. Plat schaduwloos licht is de moeilijkste plek om een gezichtswissel te verbergen, en het hield stand . 8.00 s, $1,12.
4c. Onderwater b-roll, geen lip sync. refers = basisframe + slice-24.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Muziekvideoshot. Dezelfde vrouw uit de referentieafbeelding hangt onder water in 2een zwarte tank, zilverwit haar drijft om haar heen, de rode LED-choker gloeit 3door het water, de zwarte mesh-top bolt langzaam op. Een harde straal licht 4van direct boven; bellen stijgen op langs de lens in slow motion. Ze opent 5haar ogen op de downbeat en reikt met één hand naar het oppervlak. Ze zingt 6niet en haar mond blijft dicht. De camera draait dertig graden om haar heen 7over de shot. Gezicht identiek aan de referentieafbeelding. Soundscape: de referentietrack 8gehoord van boven het oppervlak, gedempt en laagdoorlaat, met bubbeltransienten.
fibdweUMRpY
Shot 4, geluid aan. De instructie "ze zingt niet en haar mond blijft dicht" werd opgevolgd, wat het nuttige is: de referentieaudio bepaalt de timing, niet een verplichte uitvoering. 329 s, $1,12.
Stap 5: Voer de controle-opname uit, met de audiosleuf leeg
Hetzelfde prompt als Stap 3, woord voor woord. De enige verandering: refers bevat de afbeelding en niets anders. 768P, duration: 8.
Deze ene clip verklaart het hele mechanisme beter dan enige alinea. Luister ernaar tegen Stap 3.
FAoPplGmKJc
De controle-opname. Identiek prompt, geen referentieaudio, 1344x768, 8.00 s, 200 s, $0,80. H3 schreef zijn eigen soundtrack, en de uitvoering is generiek "iemand zingt" in plaats van deze woorden.
Gemeten tegen mijn master scoort de audio van de controle 0.26 envelopecorrelatie. Die van Stap 3 scoort 0,956. Die kloof is wat de gratis audiosleuf je oplevert.
Stap 6: Breek de lip sync met opzet
Elk model heeft een lettergrepenplafond. Het vinden van de jouwe kost $0,40.
Ik heb een aparte dubbele-tijd rap-track gegenereerd (minimax/music-2.6 opnieuw, $0,15), een 4-seconden-slice geknipt die ongeveer zes lettergrepen per seconde bevat, en die in dezelfde dakopstelling gevoerd bij 768P, duration: 4.
plaintext1Muziekvideoshot. De vrouw in de referentieafbeelding rapt de referentietrack 2recht de lens in op het natte neon-dak, met de chromen microfoon bij haar 3mond, en levert elke lettergreep van de snelle dubbele-tijd verse. Vaststaand 4medium close-up, lichte handheld drift, regenstralen in het harde tegenlicht. Haar 5mondvormen volgen exact de gerapte lettergrepen van de referentieaudio. Identiek 6zilverwit kortgeknipt haar, mat zwarte mesh-top en gloeiende rode LED-choker als de 7referentieafbeelding. Soundscape: de referentietrack in stereo plus vage regen.
jiQVCjOCbKg
De stresstest, geluid aan. 1344x768, 4.46 s, 192 s, $0,40. De mond blijft actief en blijft op de beat, maar stopt met het oplossen van individuele medeklinkers en valt in een herhalende open-dicht-cyclus. Gezongen regels krijgen duidelijke klinkervormen; dit niet.
Mijn eerlijke lezing uit de geleverde bestanden: aangehouden gezongen klinkers zijn waar H3's mondwerk echt overtuigend is, en dichte gerapte medeklinkers zijn waar het degradeert tot plausibele beweging. Plan je close-ups rond de gezongen regels en zet de snelle maten op b-roll. Er is meer detail over het verschil tussen spraak en zang in de lip sync en audio-analyse.
Stap 7: Stitch, demp en leg de master terug over je MiniMax H3 Muziekvideo
Vier clips van exact 8.00 seconden voegen samen tot exact 32.00 seconden, wat 16 maten is bij 120 BPM. Geen trimming.
plaintext1# 1. strip de audio van elke clip 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. voeg samen in maatvolgorde (4 x 8s = 32s = 16 maten @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. leg de originele master terug 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
Waarom de moeite nemen om te dempen, als het model je track al teruggeeft? Omdat de stereomix van elke clip de sfeer draagt die die clip's prompt vroeg: regen op shot 1, woestijnwind op shot 2, een laagdoorlaat onderwaterfilter op shot 4. Heerlijk per shot, onsamenhangend over een cut. De master geeft je één continue mix op volledige bitrate zonder hercodering per shot. H3 levert de sync van de uitvoering. Jouw master levert het nummer.
Vier variaties op het MiniMax H3 Muziekvideo-recept
Verticale release-cuts. Stel ratio: 9:16 in en je krijgt een Spotify Canvas of een Shorts-slice van hetzelfde basisframe en dezelfde slices. Het kwam terug als een echte 768x1344, dus in tegenstelling tot de aspectdropdown in de playground, blijft de API ratio-waarde wel plakken. Canvas-loops zijn standaard stil, dus deze gaat als GIF.

Een verticale 9:16 loop-cut van dezelfde artiest op het neon-dak_Hetzelfde basisframe, dezelfde referentieslice,_ ratio: 9:16 op 768P voor $0,80. Eén eerlijke rimpel: ik vroeg om "niet zingen" en kreeg toch zingen. Met een zang in de referentiesleuf wint de audio de discussie. Als je een stille performer wilt, voer dan een instrumentale slice.
Referentievideo in plaats van referentieafbeelding. Je kunt H3 maximaal drie referentievideoclips geven om beweging en kadrering over te dragen in plaats van ze te beschrijven. Let op de meter: referentie video factureert tegen het outputtarief, terwijl referentieaudio gratis is. Die asymmetrie is het meest bruikbare prijsfeit op dit eindpunt.
Pure b-roll visualizers. Laat de performer helemaal weg. Voer een productfoto, een albumcover-object of een textuurplaat plus de audioslice, en promp alleen camerabeweging. Geen gezicht om vast te houden, geen lip sync om te breken, en je kunt het hele ding op 768P schieten.
Goedkoop schetsen, duur afmaken. 768P is $0,10/s tegen 2K's $0,14/s, en beide komen terug met identieke 32 kHz stereo, dus de prestatie die je beoordeelt is hetzelfde. De besparing zit niet in de keepers, maar in de afwijzingen: elke mislukte 8-seconden-take kost $0,80 in plaats van $1,12. Draai op 768P tot de take goed is, betaal dan eenmalig de $1,12. Bij een shot dat drie pogingen kost, is dat $2,72 in plaats van $3,36. Meer over het laagverschil in de 768P versus 2K-vergelijking, en over hoe ver een enkele clip kan reiken in de cliplengtegids.
Wat een volledige MiniMax H3 Muziekvideo daadwerkelijk kost
Elke regel hieronder is een echt gefactureerd bedrag teruggehaald uit het voorspellingsrecord na voltooiing, geen catalogusprijs.
| Regelitem | Model en instellingen | Gefactureerd |
|---|---|---|
| Hook, 70 s nummer | minimax/music-2.6, mp3 44.1 kHz | $0,15 |
| Artiest basisframe | openai/gpt-image-2/text-to-image, high, 2048x1152 | $0,17 |
| Shot 1, neon-dak | minimax/h3/reference-to-video, 2K, 8 s | $1,12 |
| Shot 2, woestijnweg | zelfde, 2K, 8 s | $1,12 |
| Shot 3, witte cove | zelfde, 2K, 8 s | $1,12 |
| Shot 4, onderwater | zelfde, 2K, 8 s | $1,12 |
| Subtotal voltooide video | $4,80 | |
| Validatieprobe | 768P, 4 s | $0,40 |
| Controle-opname, geen audio | 768P, 8 s | $0,80 |
| Rap-track voor de stresstest | minimax/music-2.6 | $0,15 |
| Lip-sync stresstest | 768P, 4 s | $0,40 |
| Verticale Canvas-cut | 768P, 8 s, 9:16 | $0,80 |
| Hero-afbeelding voor dit artikel | openai/gpt-image-2/text-to-image, high | $0,17 |
| Over-limiet test, 24 s audio | geweigerd bij inzending | $0,00 |
| Vier inzendingen met verkeerde audio MIME | geweigerd bij inzending | $0,00 |
| Referentieaudio, 4 x 8 s | gratis input | $0,00 |
| Totale uitgave | $7,53 |
Dat is $9,00 per voltooide minuut op 2K voor de shots die de cut haalden, vóór mijn fouten. Geheel op 768P geschoten kost dezelfde minuut $6,61. Een menselijke MV-crew citeert geen van beide getallen.
Twee operationele opmerkingen als je een langer stuk budgetteert. Afwijzingen bij inzending zijn gratis, dus slechte parameters kosten je tijd en niets anders. En het price-veld op een voorspelling wordt met vertraging gevuld, dus poll de request-ID opnieuw nadat de bestanden zijn gedownload als je een echte factuur wilt in plaats van een null.
Wiens nummer, wiens gezicht: wat te controleren voordat je publiceert
Kort, omdat het ertoe doet en geen preek nodig heeft.
Je hebt de rechten op de referentietrack nodig. Gratis input betekent niet gratis clearence. Het voeden van een commercieel uitgebrachte single als referentieaudio, en dan publiceren wat eruit komt, is de snelle route naar een verwijdering. Je eigen opname, een track die je hebt besteld, of iets dat je hebt gegenereerd is prima.
Bouw het basisframe niet van het gezicht van een echte levende artiest. Het consistentiemechanisme is hier erg goed in het vasthouden van een gezicht over shots, wat precies is waarom het een slecht idee is om het op een echt persoon te richten.
Open weights en API-toegang zijn twee verschillende licenties. MiniMax heeft H3's weights gepubliceerd op Hugging Face in augustus 2026, en de communitylicentie sluit momenteel de EU, VK, Zuid-Korea en de VS uit, met een formeel licentiekanalen open voor die gebieden. Die beperking is van toepassing op het zelf draaien van de weights. Het aanroepen van het model via een gehoste API is een service-relatie en valt niet onder de weights-licentie. Het is de moeite waard om te weten in welke situatie je je bevindt voordat je een van beide aanneemt.
Voor een breder beeld van waar H3 staat ten opzichte van de alternatieven, is er een Seedance 2.5-vergelijking en een promptstructuurgids. Voor context waarom het de moeite waard is: op het videobewerkingsleaderboard dat modellen met audio beoordeelt, staat H3 momenteel eerste op 1.126 Elo, vóór Gemini Omni Flash op 1.119 en Dreamina Seedance 2.0 op 1.027 (Artificial Analysis, gecontroleerd op 10 augustus 2026). Die scores veranderen met de stemmen, dus behandel ze als een momentopname.
MiniMax H3 Muziekvideo: Veelgestelde vragen
Kan één MiniMax H3-muziekvideo een volledige drie minuten duren?
Niet in één generatie. Een enkele aanroep is beperkt tot 15 seconden. Maar dat is een plafond per generatie, niet per project. Een video van drie minuten bij 8 seconden per shot is 23 generaties, ruwweg $25,76 bij 2K, en elke komt op een maatlijn terecht als je track 120 BPM is. Snijd, schiet, voeg samen, leg de master terug.
Gebruikt een MiniMax H3-muziekvideo mijn daadwerkelijke nummer, of regenereert het model de audio?
Het gebruikt je daadwerkelijke nummer. Ik heb 0.892 ruwe golfvormcorrelatie gemeten bij zero sample-offset tussen de 8-seconden mp3 die ik uploadde en de audiostream in de geretourneerde mp4, met de door de prompt gevraagde sfeer eroverheen gelegd. Een controle-opname gegenereerd zonder referentieaudio scoorde 0.26 tegen dezelfde master. Je moet nog steeds je master terugleggen over de uiteindelijke samenvoeging, omdat elke clip zijn eigen per-shot sfeer en zijn eigen AAC-encode draagt, die niet ongeschonden een cut overleven.
Kost het voeren van een nummer in een MiniMax H3-muziekvideo extra?
Nee. Mijn vier 8-seconden-referentieslices voegden $0,00 toe aan een shotrekening van $4,48. Referentie video is de enige om op te letten, omdat het factureert tegen het outputtarief. De limieten zijn drie audioclips, 2 tot 15 seconden elk, 15 seconden totaal, en audio kan nooit de enige referentie zijn.
Hoe goed is MiniMax H3 lip-sync bij zingen in vergelijking met spraak?
Aangehouden gezongen klinkers zijn zijn sterke punt: duidelijke mondvormen, vasthouden die overeenkomen met de noot, en het achterover kantelen op een lange noot leest als een uitvoering in plaats van een loop. Dichte levering is waar het opgeeft. Mijn rap-test met zes lettergrepen per seconde hield de beat, maar stopte met het oplossen van medeklinkers en viel in een herhalende open-dicht-cyclus. Zet de snelle maten op b-roll.
Hoe houd ik hetzelfde gezicht in elk shot van een MiniMax H3-muziekvideo?
Drie dingen, allemaal saai. Eén referentieafbeelding hergebruikt in elke aanroep, nooit opnieuw gegenereerd. Dezelfde bewoording voor kleding letterlijk gekopieerd tussen prompts, niet geparafraseerd. En een expliciete "identiek aan de referentieafbeelding"-clausule in elk prompt. Mijn vier shots gingen door regen, laagstaande zon, platte high-key en onderwater zonder afwijking.
Hoeveel kost een MiniMax H3-muziekvideo per voltooide minuut?
$9,00 per voltooide minuut op 2K, gebaseerd op mijn echte rekening van $4,80 voor een 32-seconden-cut. Geheel op 768P geschoten kost dezelfde minuut $6,61, en 768P levert dezelfde 32 kHz stereo, dus de prestatie die je beoordeelt is identiek. Draai je afwijzingen op $0,80 en betaal de $1,12 alleen op de take die de montage overleeft.






