Seedance 2.5 is nu live — Als eerste op Atlas Cloud

Ik maakte een MiniMax H3 muziekvideo van een enkele 32-seconden hook voor $4.80. De audiotrack verraste me.

Ik voerde een 32-seconden hook in MiniMax H3 als gratis referentie-audio, kreeg vier beat-locked shots terug, en monteerde een echte MiniMax H3 muziekvideo voor $4.80. Prompts en facturen inbegrepen.

Een videobewerker aan een console met meerdere videomonitoren

Een nachtelijke color suite, zes monitoren die zes verschillende shots tonen van dezelfde zangeres met zilver haar_Zes_ shots, één artiest, één nummer. Gegenereerd met openai/gpt-image-2/text-to-image .

Suno-gebruikers genereren ongeveer 7 miljoen nummers per dag, ruwweg een volledige Spotify-catalogus elke twee weken (TechCrunch, februari 2026). Bijna geen van hen krijgt ooit een plaatje erbij. Niet omdat het plaatje onmogelijk is, maar omdat de traditionele route door vier tools loopt: stilstaande beelden genereren, ze animeren, een aparte lip-sync pass draaien, en dan alles in een montage oplappen. Elke sprong verliest het gezicht, de kleding of de beat.

Dus ik sloeg de sprongen over. Ik gooide een 8-seconden-slice van een refrein rechtstreeks in de referentiesleuf van een videomodel en drukte op Start. Het rekende me niets voor de audio.

Toen haalde ik de voltooide mp4 uit elkaar om de vraag te beantwoorden die niemand op internet rechtstreeks beantwoordt: is het geluid dat uit het model komt mijn nummer, of iets dat het heeft verzonnen dat er alleen maar op lijkt? Ik heb het gemeten. Het antwoord is niet wat ik verwachtte, en het verandert hoe je het ding moet knippen.

Belangrijkste conclusies

  • Referentieaudio is gratis. MiniMax H3 factureert alleen outputseconden. Mijn vier 8-seconden-referentieslices voegden $0,00 toe aan de rekening. Referentie video is de dure.
  • 15 seconden is een plafond per generatie, niet per project. Snijd het nummer, schiet één slice per shot, voeg samen. Mijn 32-seconden-cut is vier generaties.
  • Schrijf de hook op 120 BPM. Eén maat is exact 2.000 seconden, dus H3's duration-waarden in hele seconden komen op maatlijnen terecht zonder handmatig aanpassen. 8s = 4 maten.
  • De outputaudio is jouw track, sample-aligned. Ik heb 0.892 golfvormcorrelatie gemeten bij zero lag tussen mijn input-slice en H3's geleverde stereomix. Het wordt niet opnieuw gegenereerd. Je wilt nog steeds de master terugleggen voor de definitieve cut, om een andere reden (hieronder).
  • Totale echte uitgave: $7,53 over negen generaties inclusief de mislukkingen. De vier shots die de uiteindelijke cut haalden plus het nummer en het basis-frame kwamen op $4,80.

De MiniMax H3 Muziekvideo die ik knipte uit één 32-seconden Hook

Geluid aan. Dit zijn vier afzonderlijke generaties, samengevoegd zonder overgangen, met de originele 32-seconden master eroverheen gelegd.

TfrOvWHf4ys

"MIRA", 32 seconden, 2560x1440, 24 fps. Vier minimax/h3/reference-to-video generaties van elk 8 seconden, $1,12 per shot. Het nummer ging erin als referentieaudio en kostte $0,00.

Vier generaties, vier compleet verschillende belichtingswerelden, één gezicht. Er is niets geretoucheerd tussen de shots.

Vier aanzichten van een vrouw met zilver haar met een gloeiende rode halsband

Vier frames uit de vier shots die dezelfde zangeres tonen op een neon-dak, een woestijnweg, een witte studio en in een zwarte watertank_Een_ frame uit elke geleverde clip. Hetzelfde haar, dezelfde mesh-top, dezelfde rode LED-choker in regen, laagstaande zon, platte high-key en onder water.


Waarom de meeste MiniMax H3 Muziekvideo-pogingen uit elkaar vallen bij seconde zestien

Drie faalmodi, allemaal te vermijden.

Een: 15 seconden behandelen als de projectlimiet. H3 beperkt een enkele generatie tot 15 seconden. Mensen lezen dat, concluderen "geen muziekvideo's" en stoppen. Maar een muziekvideo was nooit één shot. Een echte video knipt om de 4 tot 8 seconden. De limiet dwingt je alleen te doen wat een editor toch al zou doen.

Twee: ritme in woorden beschrijven. "Upbeat, energiek, dansen op de beat" geeft het model niets om aan vast te houden. Het verzint een tempo en je snijpunten komen altijd een halve beat te laat. Door de daadwerkelijke audio aan te leveren, wordt het giswerk weggenomen.

Drie: de kleding laten afdrijven. Elk shot heeft dezelfde referentieafbeelding en dezelfde bewoording voor de kleding nodig, letterlijk. Verander "zwarte mesh-top" in "donkere mesh-shirt" tussen shots en je krijgt een ander persoon.

Hier is wat de twee routes je daadwerkelijk kosten:

 Traditionele vier-tool-ketenEnkele H3-referentie-aanroep
Tools per shotAfbeeldingmodel, videomodel, lip-sync-tool, NLEEén eindpunt, dan een NLE aan het einde
Handmatige stappen per shot4 overdrachten, 3 bestandsexporten1 inzending
Wat het personage behoudtHandmatig opnieuw prompten en gelukEén referentieafbeelding, letterlijk hergebruikt
Beeld en geluidAfzonderlijk gerenderd, later uitgelijndIn dezelfde pas gegenereerd, 32 kHz stereo
Kosten per 8-seconden-shotVier aparte meters$1,12 bij 2K, $0,80 bij 768P

Om de oude route recht te doen: het is geen fantasie. De Japanse maker Arata Fukoe behaalde een Project Odyssey-brons met een volledig AI-muziekvideo, en zowel Queen als Linkin Park hebben officiële AI-ondersteunde video's uitgebracht. Die ketens liepen alleen door vier of vijf tools, wat precies is waar een onafhankelijke artiest met één nummer geen tijd voor heeft.

Wat referentieaudio daadwerkelijk oplevert voor een MiniMax H3 Muziekvideo

Dit is het deel dat het waard is om te begrijpen voordat je iets uitgeeft.

H3 genereert beeld en geluid in één pas in plaats van audio over voltooide frames te dubben. Wanneer je een referentietrack aanlevert, is die track geen sfeernota. Ik heb mijn input-slice vergeleken met de audiostream in de geleverde mp4, op golfvormniveau, op een 8 kHz mono downmix:

  • Envelopecorrelatie: 0,956 bij zero lag
  • Ruwe golfvormcorrelatie over een 2-seconden-venster: 0,892 bij zero sample-offset

Dat is geen model dat een soortgelijk nummer reproduceert. Dat is jouw bestand, sample-aligned, met de sfeer die de prompt vroeg eroverheen gelegd en één ronde AAC-hercodering. Ter vergelijking: dezelfde meting tegen een controle-opname gegenereerd zonder referentieaudio kwam terug op 0.26, wat de ruisvloer is.

Twee bijna identieke audiogolfvormen met blauwe input en rode output

Golfvorm van de input-slice hierboven, de audio die H3 leverde hieronder, uitgelijnd op zero offset_Boven: de 8-seconden mp3 die ik uploadde. Onder: de audiostream in de mp4 die H3 retourneerde. Dezelfde pieken, dezelfde posities, geen offset._

De invoerlimieten zijn strikt en worden afgedwongen op het moment van indienen in plaats van stilzwijgend:

Referentie-invoerLimietGefactureerd
Afbeeldingentot 9gratis op Atlas Cloud's H3-eindpunten
Video'stot 3, elk 2-15sgefactureerd tegen outputtarief
Audiotot 3, elk 2-15s, 15s totaal over alle clips$0,00
Alleen audiogeweigerd, heeft minimaal één afbeelding of video nodign.v.t.

Ik heb het totale audio-plafond met opzet getest door drie 8-seconden-slices in één aanroep te sturen. Het faalde in 5,8 seconden met invalid params, total audio duration 24138 ms exceeds 15000 ms en werd niet gefactureerd. Goed nieuws: H3 laat het extra bestand niet stilletjes vallen en rekent je toch aan.

Nog een valkuil die ik daarvoor tegenkwam. Als je audio als base64-data-URL doorgeeft, bepaalt het MIME-type de extensie die de API afleidt. data:audio/mpeg wordt geweigerd met audio format ".mpeg" not allowed. data:audio/mp3 gaat er gewoon doorheen. Vier inzendingen gingen daaraan dood voordat ik het opmerkte, allemaal gratis.


De MiniMax H3 Muziekvideo-workflow, en wat elke seconde kost

Alles hieronder draait op één API-sleutel op Atlas Cloud, waar ik alles heb uitgevoerd en gefactureerd. Drie modellen, één browsertabblad.

StapModelWat het doetPrijs die ik daadwerkelijk kreeg gefactureerd
Schrijf de hookminimax/music-2.6Heel nummer van een stijlprompt plus songtekst, mp3 tot ~5 min$0,15 per nummer, vast bedrag
Leg de artiest vastopenai/gpt-image-2/text-to-imageEén basisframe dat elk shot erft$0,1745 bij kwaliteit high, 2048x1152
Schiet elk shotminimax/h3/reference-to-videoAfbeelding plus audio erin, beat-locked clip met stereo geluid eruit$0,14/s bij 2K, $0,10/s bij 768P. Audio input $0,00

Twee opmerkingen bij die tabel, omdat de vermelde getallen in beide richtingen liegen. GPT Image 2 toont een $0,009-vloer in de catalogus; dat is de laagste tokenlaag, en een echte 2048x1152 high-render factureert $0,1745. H3's catalogusvermelding toont $0,10, wat alleen de 768P-laag is; mijn 8-seconden 2K-jobs factureerden elk exact $1,12, wat $0,14 per seconde is.

Als je een first-frame lock wilt in plaats van onderwerpreferenties, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) neemt dezelfde tarieven, en [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) dekt pure prompt-shots.

De correctie die het waard is om te maken: een eerdere versie van dit plan ging ervan uit dat je je eigen nummer moest meenemen omdat er geen hele-nummer-generator op het platform was. Die is er nu. minimax/music-2.6 schrijft de track, dus de hele keten, inclusief het nummer, draait op één plek.


Hoe maak je een MiniMax H3 Muziekvideo, stap voor stap

Stap 1: Schrijf een 120 BPM Hook en knip deze in per-shot-slices

Vraag expliciet om 120 BPM. Bij 120 BPM is één maat exact 2.000 seconden, dus H3's duration-enum in hele seconden komt vanzelf op maatlijnen terecht: 4s = 2 maten, 6s = 3 maten, 8s = 4 maten, 10s = 5 maten. Je snijpunten vallen op de downbeat zonder dat je iets aanraakt.

Model: minimax/music-2.6. Instellingen: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.

Stijlpunt:

plaintext
1Synth-pop op exact 120 BPM, rechte four-on-the-floor kick, heldere analoge
2sidechained pads, schone vrouwelijke leadzang die vooraan in de mix zit, brede
3stereo chorus, geen rap, aangehouden open klinkers, cinematisch en licht
4melancholisch, radio-ready master

Songtekst:

plaintext
1[Chorus]
2Hold the line, hold the light
3I am running out of night
4Say my name into the rain
5And I will burn again

Het retourneerde een nummer van 70 seconden in 75 seconden voor $0,15. Ik controleerde toen het tempo in plaats van het te vertrouwen, door een onset-novelty-autocorrelatie over het bestand te draaien. De sterkste lag kwam terug op exact 0,500 s, wat 120 BPM is, en het beatgrid begint op 0,24 s in het gedecodeerde bestand in plaats van op nul. Die offset is belangrijk: knip vanaf 0,24 en elke slice begint op een downbeat.

plaintext
1# 32-seconden master, beginnend op de downbeat op 0.24s
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# vier 8-seconden-slices, één per shot, elk 4 maten en ruim onder de 15s limiet
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

Als je al je eigen track hebt, sla deze stap dan helemaal over. Dat is de normale situatie, en het is de goedkoopste.

Stap 2: Leg de artiest vast met één GPT Image 2-basisframe

Elk shot verwijst naar dit ene bestand. Wat hier fout is, is vier keer fout, dus geef die $0,17 uit en bekijk het goed.

Model: openai/gpt-image-2/text-to-image. Instellingen: kwaliteit high , formaat 2048x1152 (16:9).

plaintext
1Cinematische muziekvideostill, portret van middel tot taille. Een 25-jarige Oost-Aziatische
2synth-pop zangeres met zilverwit kortgeknipt haar en een rechte pony, een mat
3zwarte mesh-top, een dunne rode LED-choker die gloeit tegen haar sleutelbeen, en een enkele
4zilveren oorkraal. Ze staat op een doorweekte dakrand 's nachts en houdt een vintage
5chroom handheld microfoon dicht bij haar mond. Achter haar, onscherp magenta
6en cyaan neonreclame, fijne regen gevangen in een hard tegenlicht, stoom die uit een
7ventilatieopening komt. Geschoten op 35mm anamorfisch, geringe scherptediepte, teal-en-magenta-grade,
8zichtbare filmkorrel. Haar gezicht is scherp en gelijkmatig belicht door een zacht key light van
9camera links. Geen tekst ergens in het frame.

Vrouw met zilver haar die een vintage microfoon vasthoudt in een regenachtige neonstad

Het gegenereerde basisframe: zilverharige zangeres met een chromen microfoon op een doorweekte neon-dakrand_Het_ basisframe dat elk later shot erft. Gegenereerd met openai/gpt-image-2/text-to-image , kwaliteit high, 2048x1152, gefactureerd $0,1745.

AI-afbeeldingsgenerator interface met invoerinstellingen en de gegenereerde output

GPT Image 2 die dit exacte prompt in de Atlas Cloud-playground uitvoert met het voltooide frame in het outputpaneel

Hetzelfde prompt in de playground: Formaat 16:9 op 2048x1152, Kwaliteit high, en de Run-knop die $0,1745 aangeeft, wat de API mij daadwerkelijk heeft gefactureerd. De $0,009 in de catalogus is de laagste tokenlaag, niet deze. Hetzelfde prompt, andere seed, dus deze render is niet exact het bestand hierboven.

De kledingwoorden in dat prompt (zilverwit kortgeknipt haar, mat zwarte mesh-top, rode LED-choker, zilveren oorkraal) worden letterlijk hergebruikt in elk prompt hieronder. Dat herhalen is het hele consistentiemechanisme. Parafraseer het niet.

Stap 3: Voer de eerste MiniMax H3-muziekvideoshot uit met gratis referentieaudio

Model: minimax/h3/reference-to-video. Instellingen: refers = het basisframe plus slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.

Stel ratio expliciet in. De standaard van de playground is adaptive, en het eindpunt is veel gelukkiger als je de gewenste vorm benoemt.

plaintext
1Muziekvideoshot. De vrouw in de referentieafbeelding zingt de referentietrack
2recht de lens in op het natte neon-dak, met de chromen microfoon bij haar
3mond. Ze zet de eerste regel hard in op de downbeat, ogen vast op camera,
4dan kantelt ze haar hoofd achterover op de aangehouden noot. Langzame push-in van taille tot
5een strakke close-up over de acht seconden, handheld micro-drift, regenstralen
6die het harde tegenlicht kruisen. Haar mondvormen volgen exact de gezongen klinkers van de
7referentieaudio, ze zingt, niet spreekt. Identiek zilverwit kortgeknipt haar, mat zwarte mesh-top en gloeiende rode LED-choker als de referentieafbeelding. Soundscape: de referentietrack in stereo, plus vage regen en een verre stadssound laag in de mix.

7sPeYEe-xII

Shot 1, geluid aan. 2560x1440, 8.00 s exact, 24 fps, 32 kHz stereo. 345 seconden van inzending tot bestand, gefactureerd $1,12. Let op het hoofd dat achterover kantelt op de aangehouden noot rond 5 s.

AI-videogenerator interface met invoerinstellingen en de gegenereerde video

De reference-to-video playground met het basisframe en de audioslice geladen en de voltooide clip in het outputpaneel

Referentiematerialen leest 2/9: slice-0.mp3 in de ene sleuf, het basisframe in de andere. Resolutie 2K, Duur 8, en de Run-knop die $1,12 aangeeft, wat exact 8 x $0,14 is. Let op het Aspect Ratio dropdown dat op adaptive staat, wat de paginastandaard is; mijn API-aanroepen zetten ratio expliciet op 16:9.

Eén getal dat het waard is om op te schrijven: duration: 8 leverde een container van exact 8.00 seconden. duration: 4 leverde 4.46 seconden. Als je van plan bent om op maatlijnen samen te voegen, blijf dan bij de duren die exact terugkomen.

Stap 4: Schiet nog drie werelden zonder het gezicht te verliezen

Hetzelfde basisframe, dezelfde kledingzin, volgende audioslice. Al het andere verandert.

4a. Woestijnweg bij golden hour. refers = basisframe + slice-8.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Muziekvideoshot. Dezelfde vrouw uit de referentieafbeelding staat op de middenlijn
2van een lege woestijnweg bij golden hour, geen microfoon, een open indigo
3denim jas over dezelfde mat zwarte mesh-top, de rode LED-choker nog steeds
4aan. Ze beweegt haar mond mee met het refrein van de referentietrack in de wind terwijl de camera
5laag over het asfalt achteruitrijdt. Hittemirage boven de weg, stof dat opwaait, haar
6schaduw die lang naar de lens reikt, een anamorfische flare die op het
7halve punt kruist. Haar, gezicht en kleding identiek aan de referentieafbeelding.
8Soundscape: de referentietrack over open woestijnwind, breed en luchtig.

4XEki-v2vCU

Shot 2, geluid aan. Hetzelfde gezicht, tegenovergestelde kleurtemperatuur, en de referentietrack opnieuw gemixt onder open wind. 332 s, $1,12.

4b. Witte infinity cove. refers = basisframe + slice-16.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Muziekvideoshot. Dezelfde vrouw uit de referentieafbeelding in een puur witte
2infinity-cove studio onder plat high-key licht zonder schaduwen, met een glanzende
3rode vinyl regenjas over dezelfde mat zwarte mesh-top, rode LED-choker zichtbaar
4aan de kraag. Ze danst vier maten op de referentietrack, zilverwit haar
5zwaait op elke draai. Vaststaand breed frame, dan een harde snap-zoom naar een medium
6op de tweede downbeat. Kleine witte papieren vierkantjes vallen als confetti door de
7laatste twee seconden. Gezicht en haar identiek aan de referentieafbeelding. Soundscape: de referentietrack,
8droog en dichtbij, plus het piepen van schoenen op de studievloer.

VAyqdkVpnm0

Shot 3, geluid aan. Plat schaduwloos licht is de moeilijkste plek om een gezichtswissel te verbergen, en het hield stand . 8.00 s, $1,12.

4c. Onderwater b-roll, geen lip sync. refers = basisframe + slice-24.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Muziekvideoshot. Dezelfde vrouw uit de referentieafbeelding hangt onder water in
2een zwarte tank, zilverwit haar drijft om haar heen, de rode LED-choker gloeit
3door het water, de zwarte mesh-top bolt langzaam op. Een harde straal licht
4van direct boven; bellen stijgen op langs de lens in slow motion. Ze opent
5haar ogen op de downbeat en reikt met één hand naar het oppervlak. Ze zingt
6niet en haar mond blijft dicht. De camera draait dertig graden om haar heen
7over de shot. Gezicht identiek aan de referentieafbeelding. Soundscape: de referentietrack
8gehoord van boven het oppervlak, gedempt en laagdoorlaat, met bubbeltransienten.

fibdweUMRpY

Shot 4, geluid aan. De instructie "ze zingt niet en haar mond blijft dicht" werd opgevolgd, wat het nuttige is: de referentieaudio bepaalt de timing, niet een verplichte uitvoering. 329 s, $1,12.

Stap 5: Voer de controle-opname uit, met de audiosleuf leeg

Hetzelfde prompt als Stap 3, woord voor woord. De enige verandering: refers bevat de afbeelding en niets anders. 768P, duration: 8.

Deze ene clip verklaart het hele mechanisme beter dan enige alinea. Luister ernaar tegen Stap 3.

FAoPplGmKJc

De controle-opname. Identiek prompt, geen referentieaudio, 1344x768, 8.00 s, 200 s, $0,80. H3 schreef zijn eigen soundtrack, en de uitvoering is generiek "iemand zingt" in plaats van deze woorden.

Gemeten tegen mijn master scoort de audio van de controle 0.26 envelopecorrelatie. Die van Stap 3 scoort 0,956. Die kloof is wat de gratis audiosleuf je oplevert.

Stap 6: Breek de lip sync met opzet

Elk model heeft een lettergrepenplafond. Het vinden van de jouwe kost $0,40.

Ik heb een aparte dubbele-tijd rap-track gegenereerd (minimax/music-2.6 opnieuw, $0,15), een 4-seconden-slice geknipt die ongeveer zes lettergrepen per seconde bevat, en die in dezelfde dakopstelling gevoerd bij 768P, duration: 4.

plaintext
1Muziekvideoshot. De vrouw in de referentieafbeelding rapt de referentietrack
2recht de lens in op het natte neon-dak, met de chromen microfoon bij haar
3mond, en levert elke lettergreep van de snelle dubbele-tijd verse. Vaststaand
4medium close-up, lichte handheld drift, regenstralen in het harde tegenlicht. Haar
5mondvormen volgen exact de gerapte lettergrepen van de referentieaudio. Identiek
6zilverwit kortgeknipt haar, mat zwarte mesh-top en gloeiende rode LED-choker als de
7referentieafbeelding. Soundscape: de referentietrack in stereo plus vage regen.

jiQVCjOCbKg

De stresstest, geluid aan. 1344x768, 4.46 s, 192 s, $0,40. De mond blijft actief en blijft op de beat, maar stopt met het oplossen van individuele medeklinkers en valt in een herhalende open-dicht-cyclus. Gezongen regels krijgen duidelijke klinkervormen; dit niet.

Mijn eerlijke lezing uit de geleverde bestanden: aangehouden gezongen klinkers zijn waar H3's mondwerk echt overtuigend is, en dichte gerapte medeklinkers zijn waar het degradeert tot plausibele beweging. Plan je close-ups rond de gezongen regels en zet de snelle maten op b-roll. Er is meer detail over het verschil tussen spraak en zang in de lip sync en audio-analyse.

Stap 7: Stitch, demp en leg de master terug over je MiniMax H3 Muziekvideo

Vier clips van exact 8.00 seconden voegen samen tot exact 32.00 seconden, wat 16 maten is bij 120 BPM. Geen trimming.

plaintext
1# 1. strip de audio van elke clip
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. voeg samen in maatvolgorde (4 x 8s = 32s = 16 maten @ 120 BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. leg de originele master terug
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

Waarom de moeite nemen om te dempen, als het model je track al teruggeeft? Omdat de stereomix van elke clip de sfeer draagt die die clip's prompt vroeg: regen op shot 1, woestijnwind op shot 2, een laagdoorlaat onderwaterfilter op shot 4. Heerlijk per shot, onsamenhangend over een cut. De master geeft je één continue mix op volledige bitrate zonder hercodering per shot. H3 levert de sync van de uitvoering. Jouw master levert het nummer.


Vier variaties op het MiniMax H3 Muziekvideo-recept

Verticale release-cuts. Stel ratio: 9:16 in en je krijgt een Spotify Canvas of een Shorts-slice van hetzelfde basisframe en dezelfde slices. Het kwam terug als een echte 768x1344, dus in tegenstelling tot de aspectdropdown in de playground, blijft de API ratio-waarde wel plakken. Canvas-loops zijn standaard stil, dus deze gaat als GIF.

Vrouw met zilver haar die een microfoon vasthoudt op een regenachtig stadsdak

Een verticale 9:16 loop-cut van dezelfde artiest op het neon-dak_Hetzelfde basisframe, dezelfde referentieslice,_ ratio: 9:16 op 768P voor $0,80. Eén eerlijke rimpel: ik vroeg om "niet zingen" en kreeg toch zingen. Met een zang in de referentiesleuf wint de audio de discussie. Als je een stille performer wilt, voer dan een instrumentale slice.

Referentievideo in plaats van referentieafbeelding. Je kunt H3 maximaal drie referentievideoclips geven om beweging en kadrering over te dragen in plaats van ze te beschrijven. Let op de meter: referentie video factureert tegen het outputtarief, terwijl referentieaudio gratis is. Die asymmetrie is het meest bruikbare prijsfeit op dit eindpunt.

Pure b-roll visualizers. Laat de performer helemaal weg. Voer een productfoto, een albumcover-object of een textuurplaat plus de audioslice, en promp alleen camerabeweging. Geen gezicht om vast te houden, geen lip sync om te breken, en je kunt het hele ding op 768P schieten.

Goedkoop schetsen, duur afmaken. 768P is $0,10/s tegen 2K's $0,14/s, en beide komen terug met identieke 32 kHz stereo, dus de prestatie die je beoordeelt is hetzelfde. De besparing zit niet in de keepers, maar in de afwijzingen: elke mislukte 8-seconden-take kost $0,80 in plaats van $1,12. Draai op 768P tot de take goed is, betaal dan eenmalig de $1,12. Bij een shot dat drie pogingen kost, is dat $2,72 in plaats van $3,36. Meer over het laagverschil in de 768P versus 2K-vergelijking, en over hoe ver een enkele clip kan reiken in de cliplengtegids.


Wat een volledige MiniMax H3 Muziekvideo daadwerkelijk kost

Elke regel hieronder is een echt gefactureerd bedrag teruggehaald uit het voorspellingsrecord na voltooiing, geen catalogusprijs.

RegelitemModel en instellingenGefactureerd
Hook, 70 s nummerminimax/music-2.6, mp3 44.1 kHz$0,15
Artiest basisframeopenai/gpt-image-2/text-to-image, high, 2048x1152$0,17
Shot 1, neon-dakminimax/h3/reference-to-video, 2K, 8 s$1,12
Shot 2, woestijnwegzelfde, 2K, 8 s$1,12
Shot 3, witte covezelfde, 2K, 8 s$1,12
Shot 4, onderwaterzelfde, 2K, 8 s$1,12
Subtotal voltooide video $4,80
Validatieprobe768P, 4 s$0,40
Controle-opname, geen audio768P, 8 s$0,80
Rap-track voor de stresstestminimax/music-2.6$0,15
Lip-sync stresstest768P, 4 s$0,40
Verticale Canvas-cut768P, 8 s, 9:16$0,80
Hero-afbeelding voor dit artikelopenai/gpt-image-2/text-to-image, high$0,17
Over-limiet test, 24 s audiogeweigerd bij inzending$0,00
Vier inzendingen met verkeerde audio MIMEgeweigerd bij inzending$0,00
Referentieaudio, 4 x 8 sgratis input$0,00
Totale uitgave $7,53

Dat is $9,00 per voltooide minuut op 2K voor de shots die de cut haalden, vóór mijn fouten. Geheel op 768P geschoten kost dezelfde minuut $6,61. Een menselijke MV-crew citeert geen van beide getallen.

Twee operationele opmerkingen als je een langer stuk budgetteert. Afwijzingen bij inzending zijn gratis, dus slechte parameters kosten je tijd en niets anders. En het price-veld op een voorspelling wordt met vertraging gevuld, dus poll de request-ID opnieuw nadat de bestanden zijn gedownload als je een echte factuur wilt in plaats van een null.


Wiens nummer, wiens gezicht: wat te controleren voordat je publiceert

Kort, omdat het ertoe doet en geen preek nodig heeft.

Je hebt de rechten op de referentietrack nodig. Gratis input betekent niet gratis clearence. Het voeden van een commercieel uitgebrachte single als referentieaudio, en dan publiceren wat eruit komt, is de snelle route naar een verwijdering. Je eigen opname, een track die je hebt besteld, of iets dat je hebt gegenereerd is prima.

Bouw het basisframe niet van het gezicht van een echte levende artiest. Het consistentiemechanisme is hier erg goed in het vasthouden van een gezicht over shots, wat precies is waarom het een slecht idee is om het op een echt persoon te richten.

Open weights en API-toegang zijn twee verschillende licenties. MiniMax heeft H3's weights gepubliceerd op Hugging Face in augustus 2026, en de communitylicentie sluit momenteel de EU, VK, Zuid-Korea en de VS uit, met een formeel licentiekanalen open voor die gebieden. Die beperking is van toepassing op het zelf draaien van de weights. Het aanroepen van het model via een gehoste API is een service-relatie en valt niet onder de weights-licentie. Het is de moeite waard om te weten in welke situatie je je bevindt voordat je een van beide aanneemt.

Voor een breder beeld van waar H3 staat ten opzichte van de alternatieven, is er een Seedance 2.5-vergelijking en een promptstructuurgids. Voor context waarom het de moeite waard is: op het videobewerkingsleaderboard dat modellen met audio beoordeelt, staat H3 momenteel eerste op 1.126 Elo, vóór Gemini Omni Flash op 1.119 en Dreamina Seedance 2.0 op 1.027 (Artificial Analysis, gecontroleerd op 10 augustus 2026). Die scores veranderen met de stemmen, dus behandel ze als een momentopname.


MiniMax H3 Muziekvideo: Veelgestelde vragen

Kan één MiniMax H3-muziekvideo een volledige drie minuten duren?

Niet in één generatie. Een enkele aanroep is beperkt tot 15 seconden. Maar dat is een plafond per generatie, niet per project. Een video van drie minuten bij 8 seconden per shot is 23 generaties, ruwweg $25,76 bij 2K, en elke komt op een maatlijn terecht als je track 120 BPM is. Snijd, schiet, voeg samen, leg de master terug.

Gebruikt een MiniMax H3-muziekvideo mijn daadwerkelijke nummer, of regenereert het model de audio?

Het gebruikt je daadwerkelijke nummer. Ik heb 0.892 ruwe golfvormcorrelatie gemeten bij zero sample-offset tussen de 8-seconden mp3 die ik uploadde en de audiostream in de geretourneerde mp4, met de door de prompt gevraagde sfeer eroverheen gelegd. Een controle-opname gegenereerd zonder referentieaudio scoorde 0.26 tegen dezelfde master. Je moet nog steeds je master terugleggen over de uiteindelijke samenvoeging, omdat elke clip zijn eigen per-shot sfeer en zijn eigen AAC-encode draagt, die niet ongeschonden een cut overleven.

Kost het voeren van een nummer in een MiniMax H3-muziekvideo extra?

Nee. Mijn vier 8-seconden-referentieslices voegden $0,00 toe aan een shotrekening van $4,48. Referentie video is de enige om op te letten, omdat het factureert tegen het outputtarief. De limieten zijn drie audioclips, 2 tot 15 seconden elk, 15 seconden totaal, en audio kan nooit de enige referentie zijn.

Hoe goed is MiniMax H3 lip-sync bij zingen in vergelijking met spraak?

Aangehouden gezongen klinkers zijn zijn sterke punt: duidelijke mondvormen, vasthouden die overeenkomen met de noot, en het achterover kantelen op een lange noot leest als een uitvoering in plaats van een loop. Dichte levering is waar het opgeeft. Mijn rap-test met zes lettergrepen per seconde hield de beat, maar stopte met het oplossen van medeklinkers en viel in een herhalende open-dicht-cyclus. Zet de snelle maten op b-roll.

Hoe houd ik hetzelfde gezicht in elk shot van een MiniMax H3-muziekvideo?

Drie dingen, allemaal saai. Eén referentieafbeelding hergebruikt in elke aanroep, nooit opnieuw gegenereerd. Dezelfde bewoording voor kleding letterlijk gekopieerd tussen prompts, niet geparafraseerd. En een expliciete "identiek aan de referentieafbeelding"-clausule in elk prompt. Mijn vier shots gingen door regen, laagstaande zon, platte high-key en onderwater zonder afwijking.

Hoeveel kost een MiniMax H3-muziekvideo per voltooide minuut?

$9,00 per voltooide minuut op 2K, gebaseerd op mijn echte rekening van $4,80 voor een 32-seconden-cut. Geheel op 768P geschoten kost dezelfde minuut $6,61, en 768P levert dezelfde 32 kHz stereo, dus de prestatie die je beoordeelt is identiek. Draai je afwijzingen op $0,80 en betaal de $1,12 alleen op de take die de montage overleeft.

Nieuwste modellen

Eén API voor alle media-AI.

Verken alle modellen