
En nattlig färggraderingsstudio, sex monitorer som visar sex olika tagningar av samma silverhåriga sångerska. Sex tagningar, en artist, en låt. Genererad med openai/gpt-image-2/text-to-image.
Suno-användare genererar cirka 7 miljoner låtar per dag, grovt räknat en hel Spotify-katalog varannan vecka (TechCrunch, februari 2026). Nästan ingen av dem kommer någonsin att få en bild kopplad till sig. Inte för att bilden är omöjlig, utan för att den traditionella vägen går genom fyra verktyg: generera stillbilder, animera dem, kör en separat läppsynk-passning, och fixa allt i en redigering. Varje hopp tappar ansiktet, garderoben eller takten.
Så jag hoppade över hoppen. Jag la en 8-sekunders bit av en refräng direkt i referensplatsen på en videomodell och tryckte på Kör. Det kostade mig inget för ljudet.
Sedan plockade jag isär den färdiga mp4-filen för att svara på den fråga som ingen på internet svarar rakt på: är ljudet som kommer ut ur modellen min låt, eller något den hittat på som bara låter liknande? Jag mätte det. Svaret var inte vad jag förväntade mig, och det förändrar hur du bör klippa saken.
Viktiga slutsatser
- Referensljud är gratis. MiniMax H3 debiterar endast utdatasekunder. Mina fyra 8-sekunders referensbitar tillförde $0.00 till kostnaden. Referensvideo är den dyra.
- 15 sekunder är ett tak per generering, inte per projekt. Dela upp låten, skjut en bit per tagning, sammanfoga. Min 32-sekunders klippning är fyra generationer.
- Skriv refrängen i 120 BPM. En takt är exakt 2.000 sekunder, så H3:s heltalsvärden för
durationlandar på taktstreck utan manuell justering. 8 s = 4 takter.- Utdataljudet är din låt, sampeljusterad. Jag mätte 0,892 vågformskorrelation vid noll fördröjning mellan min inmatningsbit och H3:s levererade stereomix. Den är inte återskapad. Du vill fortfarande lägga mastern över för den slutliga klippningen, av en annan anledning (nedan).
- Total verklig kostnad: $7.53 över nio generationer inklusive misslyckade. De fyra tagningarna som kom med i slutklippet plus låten och basbilden kostade $4.80.
MiniMax H3-musikvideon jag klippte från en 32-sekunders refräng
Ljud på. Det här är fyra separata generationer, sammanfogade utan övergångar, med den ursprungliga 32-sekunders mastern lagd ovanpå.
TfrOvWHf4ys
"MIRA", 32 sekunder, 2560x1440, 24 fps. Fyra minimax/h3/reference-to-video-generationer på 8 sekunder var, $1,12 per tagning. Låten matades in som referensljud och kostade $0,00.
Fyra generationer, fyra helt olika ljusvärldar, ett ansikte. Ingenting retuscherades mellan dem.

Fyra bildrutor från de fyra tagningarna som visar samma sångerska på en neonupplyst takterrass, en ökenmotorväg, en vit studio och en svart vattentank. En bildruta från varje levererad klipp. Samma hår, samma mesh-topp, samma röda LED-choker över regn, låg sol, platt högnyckel och undervatten.
Varför de flesta MiniMax H3-musikvideoförsök faller samman vid sekund sexton
Tre misslyckandelägen, alla går att undvika.
Ett: behandla 15 sekunder som projektgränsen. H3 begränsar en enda generation till 15 sekunder. Folk läser det, drar slutsatsen "inga musikvideor" och ger upp. Men en musikvideo har aldrig varit en enda tagning. En riktig klipper var 4:e till 8:e sekund ändå. Begränsningen tvingar dig bara att göra vad en redigerare ändå skulle ha gjort.
Två: beskriv rytm med ord. "Upptemp, energisk, dansar i takt" ger modellen inget att låsa sig fast vid. Den uppfinner en tempo, och dina klipppunkter hamnar en halv takt fel för alltid. Att ge den det faktiska ljudet tar bort gissandet.
Tre: låt garderoben glida. Varje tagning behöver samma referensbild och samma garderobstext, ordagrant. Ändra "svart mesh-topp" till "mörk mesh-skjorta" mellan tagningarna så får du en annan person.
Så här ser de två vägarnas faktiska kostnad ut:
| Traditionell kedja med fyra verktyg | Enkel H3-referensanrop | |
|---|---|---|
| Verktyg per tagning | Bildmodell, videomodel, läppsynk-verktyg, NLE | En slutpunkt, sedan en NLE i slutet |
| Manuella steg per tagning | 4 överlämningar, 3 filmexport | 1 inskickning |
| Vad håller karaktären | Manuell ompromptning och tur | En referensbild som återanvänds ordagrant |
| Bild och ljud | Renderade separat, justerade efteråt | Genererade i samma pass, 32 kHz stereo |
| Kostnad per 8-sekunders tagning | Fyra separata mätare | $1,12 vid 2K, $0,80 vid 768P |
För att vara rättvis mot den gamla vägen: det är inte en fantasi. Den japanska skaparen Arata Fukoe tog en Project Odyssey-brons med en helt AI-genererad musikvideo, och både Queen och Linkin Park har släppt officiella AI-assisterade videor. De kedjorna gick dock genom fyra eller fem verktyg, vilket är precis vad en oberoende artist med en enda låt inte har tid med.
Vad referensljud faktiskt ger en MiniMax H3-musikvideo
Det här är delen som är värd att förstå innan du spenderar något.
H3 genererar bild och ljud i ett pass istället för att dubba ljud på färdiga bilder. När du ger den ett referensspår är spåret inte en stämningsanteckning. Jag jämförde min inmatningsbit mot ljudströmmen inuti den levererade mp4-filen, på vågformsnivå, på en 8 kHz mono-nedmixning:
- Kuvertkorrelation: 0,956 vid noll fördröjning
- Rå vågformskorrelation över ett 2-sekunders fönster: 0,892 vid noll sampeloffset
Det är inte en modell som återger en liknande låt. Det är din fil, sampeljusterad, med den stämning som prompten bad om lagd ovanpå och en omgång AAC-omkodning. Som jämförelse kom samma mätning mot en kontrolltagning genererad utan referensljud tillbaka på 0,26, vilket är brusgolvet.

Vågform av inmatningsbiten ovan, ljudet H3 levererade nedan, justerat vid nolloffset. Överst: 8-sekunders mp3 jag laddade upp. Nederst: ljudströmmen inuti mp4:an H3 returnerade. Samma toppar, samma positioner, ingen offset.
Inmatningsbegränsningarna är strikta och de tillämpas vid inskickningstillfället snarare än tyst:
| Referensinmatning | Gräns | Debiterad |
|---|---|---|
| Bilder | upp till 9 | gratis på Atlas Cloud's H3-slutpunkter |
| Videor | upp till 3, varje 2-15 s | debiteras till utdatapriset |
| Ljud | upp till 3, varje 2-15 s, 15 s totalt över alla klipp | $0,00 |
| Ljud ensamt | avvisas, behöver minst en bild eller video | n/a |
Jag testade ljudtaket med flit genom att skicka tre 8-sekunders bitar i ett anrop. Det misslyckades på 5,8 sekunder med invalid params, total audio duration 24138 ms exceeds 15000 ms och debiterades inte. Goda nyheter: H3 tappar inte tyst den extra filen och debiterar dig ändå.
En till fälla jag stötte på innan dess. Om du skickar ljud som en base64-data-URL, bestämmer MIME-typen vilket tillägg API:et härleder. data:audio/mpeg avvisas med audio format ".mpeg" not allowed. data:audio/mp3 går igenom. Fyra inskickningar dog på det innan jag märkte det, alla gratis.
Arbetsflödet för MiniMax H3-musikvideon, och vad varje sekund kostar
Allt nedan körs via en API-nyckel på Atlas Cloud, där jag körde och debiterade allt. Tre modeller, en webbläsarflik.
| Steg | Modell | Vad den gör | Pris jag faktiskt debiterades |
|---|---|---|---|
| Skriv refrängen | minimax/music-2.6 | Hela låten från en stilprompt plus text, mp3 upp till ~5 min | $0,15 per låt, fast |
| Lås artisten | openai/gpt-image-2/text-to-image | En basbild som varje tagning ärver | $0,1745 vid kvalitet hög, 2048x1152 |
| Skjut varje tagning | minimax/h3/reference-to-video | Bild plus ljud in, taktlåst klipp med stereoljud ut | $0,14/s vid 2K, $0,10/s vid 768P. Ljudinmatning $0,00 |
Två anteckningar om den tabellen, eftersom de listade siffrorna ljuger åt båda hållen. GPT Image 2 visar ett $0,009-golv i katalogen; det är den lägsta token-nivån, och en verklig 2048x1152 high-rendering debiterar $0,1745. H3:s katalogpost visar $0,10, vilket endast är 768P-nivån; mina 8-sekunders 2K-jobb debiterade var exakt $1,12, vilket är $0,14 per sekund.
Om du vill ha en första-bildruta-låsning istället för subjektreferenser, tar [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) samma priser, och [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) täcker rena prompt-tagningar.
Korrigeringen värd att göra: en tidigare version av denna plan antog att du måste ta med din egen låt eftersom det inte fanns någon hel-låt-generator på plattformen. Det finns en nu. minimax/music-2.6 skriver spåret, så hela kedjan, inklusive låten, körs på ett ställe.
Hur man gör en MiniMax H3-musikvideo, steg för steg
Steg 1: Skriv en 120 BPM-refräng och dela upp den i per-tagning-bitarna
Be om 120 BPM explicit. Vid 120 BPM är en takt exakt 2.000 sekunder, så H3:s heltals-duration-uppräkning landar på taktstreck gratis: 4 s = 2 takter, 6 s = 3 takter, 8 s = 4 takter, 10 s = 5 takter. Dina klipp faller på nedslaget utan att du rör en enda markör.
Modell: minimax/music-2.6. Inställningar: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.
Stilprompt:
plaintext1Synth-pop at exactly 120 BPM, straight four-on-the-floor kick, bright analog 2sidechained pads, clean female lead vocal sitting forward in the mix, wide 3stereo chorus, no rap, sustained open vowels, cinematic and slightly 4melancholy, radio-ready master
Text:
plaintext1[Chorus] 2Hold the line, hold the light 3I am running out of night 4Say my name into the rain 5And I will burn again
Den returnerade ett 70-sekunders spår på 75 sekunder för $0,15. Jag kontrollerade sedan tempot istället för att lita på det, genom att köra en onset-novelty-autokorrelation över filen. Den starkaste fördröjningen kom tillbaka på exakt 0,500 s, vilket är 120 BPM, och taktgallret börjar vid 0,24 s in i den avkodade filen snarare än vid noll. Den offseten spelar roll: klipp från 0,24 och varje bit börjar på ett nedslag.
plaintext1# 32-sekunders master, som börjar på nedslaget vid 0,24s 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# fyra 8-sekunders bitar, en per tagning, varje 4 takter och väl under 15s-gränsen 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
Om du redan har ditt eget spår, hoppa över detta steg helt. Det är normalfallet, och det är det billigaste.
Steg 2: Lås artisten med en GPT Image 2-basbild
Varje tagning refererar till denna enda fil. Vad som är fel här är fel fyra gånger, så spendera $0,17 och titta ordentligt på den.
Modell: openai/gpt-image-2/text-to-image. Inställningar: quality high , size 2048x1152 (16:9).
plaintext1Cinematic music-video still, waist-up portrait. A 25-year-old East Asian female 2synth-pop singer with silver-white cropped hair and a straight-cut fringe, a matte 3black mesh top, a thin red LED choker glowing against her collarbone, and a single 4silver ear cuff. She stands on a rain-soaked rooftop at night holding a vintage 5chrome handheld microphone close to her mouth. Behind her, out-of-focus magenta 6and cyan neon signage, fine rain caught in a hard backlight, steam drifting from a 7vent. Shot on 35mm anamorphic, shallow depth of field, teal-and-magenta grade, 8visible film grain. Her face is sharp and evenly lit by a soft key from camera 9left. No text anywhere in the frame.

Den genererade basbilden: silverhårig sångerska med en krommikrofon på en regnvåt neon-takterrass. Basbilden som varje senare tagning ärver. Genererad med openai/gpt-image-2/text-to-image, kvalitet hög, 2048x1152, debiterad $0,1745.

GPT Image 2 som kör denna exakta prompt i Atlas Cloud-lekplatsen med den färdiga bilden i utdatapanelen
Samma prompt i lekplatsen: Storlek 16:9 vid 2048x1152, Kvalitet hög, och Kör-knappen som anger $0,1745, vilket är vad API:et faktiskt debiterade mig. Katalogens $0,009 är den lägsta token-nivån, inte denna. Samma prompt, annat seed, så denna rendering är inte exakt filen ovan.
Ordagram i garderoben i den prompten (silvervitt kortklippt hår, matt svart mesh-topp, röd LED-choker, silverörhänge) återanvänds ordagrant i varje prompt nedan. Den upprepningen är hela konsistensmekanismen. Parafrasera inte.
Steg 3: Kör den första MiniMax H3-musikvideotagningen med gratis referensljud
Modell: minimax/h3/reference-to-video. Inställningar: refers = basbilden plus slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.
Ställ in ratio explicit. Standardvärdet i lekplatsen är adaptive, och slutpunkten är mycket gladare när du namnger den form du vill ha.
plaintext1Music video shot. The woman in the reference image sings the reference track 2straight down the lens on the wet neon rooftop, holding the chrome microphone at 3her mouth. She lands the first line hard on the downbeat, eyes locked to camera, 4then tilts her head back on the sustained note. Slow push-in from waist-up to a 5tight close-up across the eight seconds, handheld micro-drift, rain streaks 6crossing the hard backlight. Her mouth shapes follow the sung vowels of the 7reference audio exactly, she is singing, not speaking. Identical silver-white 8cropped hair, matte black mesh top and glowing red LED choker as the reference 9image. Soundscape: the reference track in stereo, plus faint rain and a distant 10city hum low in the mix.
7sPeYEe-xII
Tagning 1, ljud på. 2560x1440, 8,00 s exakt, 24 fps, 32 kHz stereo. 345 sekunder från inskickning till fil, debiterad $1,12. Titta på huvudet som lutas bakåt på den hållna tonen vid cirka 5 s.

Lekplatsen för referens-till-video med basbilden och ljudbiten laddade och det färdiga klippet i utdatapanelen
Referensmaterial läser 2/9: slice-0.mp3 i en plats, basbilden i den andra. Upplösning 2K, Varaktighet 8, och Kör-knappen som anger $1,12, vilket är exakt 8 x $0,14. Notera rullgardinsmenyn för bildförhållande som står på adaptive, vilket är sidans standard; mina API-anrop satte ratio till 16:9 explicit.
En siffra värd att skriva ner: duration: 8 levererade en behållare på exakt 8,00 sekunder. duration: 4 levererade 4,46 sekunder. Om du planerar att sammanfoga på taktstreck, håll dig till de varaktigheter som kommer tillbaka exakta.
Steg 4: Skjut tre fler världar utan att tappa ansiktet
Samma basbild, samma garderobsmening, nästa ljudbit. Allt annat ändras.
4a. Ökenmotorväg vid gyllene timmen. refers = basbild + slice-8.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Music video shot. The same woman from the reference image stands on the centre 2line of an empty desert highway at golden hour, no microphone, an open indigo 3denim jacket over the same matte black mesh top, the red LED choker still lit. She 4mouths the chorus of the reference track into the wind while the camera tracks 5backwards low over the asphalt. Heat shimmer off the road, dust lifting, her 6shadow stretching long toward the lens, an anamorphic flare crossing at the 7halfway point. Hair, face and wardrobe identical to the reference image. 8Soundscape: the reference track over open desert wind, wide and airy.
4XEki-v2vCU
Tagning 2, ljud på. Samma ansikte, motsatt färgtemperatur, och referensspåret ommixat under öppen vind. 332 s, $1,12.
4b. Vit oändlighetsstudio. refers = basbild + slice-16.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Music video shot. The same woman from the reference image in a pure white 2infinity-cove studio under flat high-key light with no shadows, wearing a glossy 3red vinyl trench coat over the same matte black mesh top, red LED choker visible 4at the collar. She dances four bars to the reference track, silver-white hair 5whipping on each turn. Locked-off wide frame, then a hard snap-zoom to a medium on 6the second downbeat. Small white paper squares fall like confetti through the 7final two seconds. Face and hair identical to the reference image. Soundscape: the 8reference track, dry and close, plus the squeak of shoes on the studio floor.
VAyqdkVpnm0
Tagning 3, ljud på. Platt skugglöst ljus är den svåraste platsen att dölja ett ansiktsbyte, och den höll. 8,00 s, $1,12.
4c. Undervattens-b-roll, ingen läppsynk. refers = basbild + slice-24.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Music video shot. The same woman from the reference image suspended underwater in 2a black tank, silver-white hair floating out around her, the red LED choker 3glowing through the water, the black mesh top billowing slowly. One hard beam of 4light from directly above; bubbles rise past the lens in slow motion. She opens 5her eyes on the downbeat and reaches one hand toward the surface. She does not 6sing and her mouth stays closed. The camera rotates thirty degrees around her 7across the shot. Face identical to the reference image. Soundscape: the reference 8track heard from above the surface, muffled and low-passed, with bubble 9transients.
fibdweUMRpY
Tagning 4, ljud på. Instruktionen "hon sjunger inte och hennes mun förblir stängd" åtlyddes, vilket är den användbara delen: referensljudet styr tajmingen, inte en obligatorisk prestation. 329 s, $1,12.
Steg 5: Kör kontrolltagningen, med ljudplatsen tom
Samma prompt som Steg 3, ord för ord. Den enda ändringen: refers innehåller bilden och inget annat. 768P, duration: 8.
Detta enda klipp förklarar hela mekanismen bättre än någon paragraf. Lyssna på det mot Steg 3.
FAoPplGmKJc
Kontrolltagningen. Identisk prompt, inget referensljud, 1344x768, 8,00 s, 200 s, $0,80. H3 skrev sitt eget soundtrack, och prestationen är generisk "någon sjunger" snarare än dessa ord.
Mätt mot min master fick kontrollens ljud 0,26 kuvertkorrelation. Steg 3:s fick 0,956. Det gapet är vad den gratis ljudplatsen köper dig.
Steg 6: Bryt läppsynken med flit
Varje modell har ett stavelsetak. Att hitta din kostar $0,40.
Jag genererade ett separat double-time-rap-spår (minimax/music-2.6 igen, $0,15), klippte en 4-sekunders bit som körde ungefär sex stavelser per sekund, och matade in den i samma takterrass-setup vid 768P, duration: 4.
plaintext1Music video shot. The woman in the reference image raps the reference track 2straight down the lens on the wet neon rooftop, holding the chrome microphone at 3her mouth, delivering every syllable of the fast double-time verse. Locked-off 4medium close-up, slight handheld drift, rain streaks in the hard backlight. Her 5mouth shapes follow the rapped syllables of the reference audio exactly. Identical 6silver-white cropped hair, matte black mesh top and glowing red LED choker as the 7reference image. Soundscape: the reference track in stereo plus faint rain.
jiQVCjOCbKg
Stresstestet, ljud på. 1344x768, 4,46 s, 192 s, $0,40. Munnen håller sig aktiv och i takt, men den slutar lösa enskilda konsonanter och faller in i en upprepad öppen-stäng-cykel. Sjungna rader får distinkta vokalformer; detta gör inte.
Min ärliga läsning från de levererade filerna: hållna sjungna vokaler är där H3:s munarbete är genuint övertygande, och täta rappade konsonanter är där det försämras till trolig rörelse. Planera dina närbilder kring de sjungna raderna och lägg de snabba takterna på b-roll. Det finns mer detaljer om skillnaden mellan tal och sång i läppsynk- och ljudanalysen.
Steg 7: Sy ihop, tysta och lägg tillbaka mastern över din MiniMax H3-musikvideo
Fyra klipp på exakt 8,00 sekunder sammanfogas till exakt 32,00 sekunder, vilket är 16 takter vid 120 BPM. Ingen trimning.
plaintext1# 1. ta bort ljud från varje klipp 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. sammanfoga i taktordning (4 x 8s = 32s = 16 takter @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. lägg tillbaka originalmastern 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
Varför bry sig om att tysta, om modellen redan ger tillbaka ditt spår? För att varje klipps stereomix bär den stämning som det klippets prompt bad om: regn på tagning 1, ökenvind på tagning 2, ett lågpassat undervattensfilter på tagning 4. Härligt per klipp, osammanhängande över en klippning. Mastern ger dig en kontinuerlig mix med full bitrate utan omkodning per klipp. H3 levererar prestationssynkroniseringen. Din master levererar låten.
Fyra variationer på MiniMax H3-musikvideoreceptet
Vertikala releaseklipp. Ställ in ratio: 9:16 så får du en Spotify Canvas eller en Shorts-bit från samma basbild och samma bitar. Den kom tillbaka som en äkta 768x1344, så till skillnad från bildförhållande-rullgardinsmenyn i lekplatsen, fastnar API:ets ratio-värde. Canvas-loopar är tysta per design, så denna skickas som en GIF.

En vertikal 9:16-loopklippning av samma artist på neon-takterrassen. Samma basbild, samma referensbit, ratio: 9:16 vid 768P för $0,80. En ärlig veck: jag bad om "inte sjunger" och fick sång ändå. Med en vokal i referensplatsen vinner ljudet argumentet. Om du vill ha en tyst artist, mata in en instrumental bit.
Referensvideo istället för referensbild. Du kan ge H3 upp till tre referensvideoklipp för att bära rörelse och inramning snarare än att beskriva dem. Håll koll på mätaren: referensvideo debiteras till utdatapriset, medan referensljud är gratis. Den asymmetrin är det mest användbara prisfaktumet på denna slutpunkt.
Rena b-roll-visualiserare. Ta bort artisten helt. Mata in en produktbild, ett albumomslagsobjekt eller en texturplatta plus ljudbiten, och prompta endast kamrarörelse. Inget ansikte att hålla, ingen läppsynk att bryta, och du kan skjuta hela saken vid 768P.
Skissa billigt, avsluta dyrt. 768P är $0,10/s mot 2K:s $0,14/s, och båda kommer tillbaka med identisk 32 kHz stereo, så prestationen du bedömer är densamma. Besparingen ligger inte i behållarna, det är i avslagen: varje misslyckad 8-sekunders tagning kostar $0,80 istället för $1,12. Kör vid 768P tills tagningen är rätt, betala sedan $1,12 en gång. På en tagning som tar tre försök blir det $2,72 istället för $3,36. Mer om nivåskillnaden i 768P vs 2K-jämförelsen, och om hur långt ett enda klipp kan sträcka sig i klipplängdsguiden.
Vad en full MiniMax H3-musikvideo faktiskt kostade
Varje rad nedan är en verklig debiterad siffra som hämtats från förutsägelseregistret efter slutförande, inte ett listpris.
| Rad | Modell och inställningar | Debiterad |
|---|---|---|
| Refräng, 70 s låt | minimax/music-2.6, mp3 44,1 kHz | $0,15 |
| Artistbasbild | openai/gpt-image-2/text-to-image, high, 2048x1152 | $0,17 |
| Tagning 1, neon-takterrass | minimax/h3/reference-to-video, 2K, 8 s | $1,12 |
| Tagning 2, ökenmotorväg | samma, 2K, 8 s | $1,12 |
| Tagning 3, vit studio | samma, 2K, 8 s | $1,12 |
| Tagning 4, undervatten | samma, 2K, 8 s | $1,12 |
| Delsumma färdig video | $4,80 | |
| Valideringssond | 768P, 4 s | $0,40 |
| Kontrolltagning, inget ljud | 768P, 8 s | $0,80 |
| Rap-spår för stresstest | minimax/music-2.6 | $0,15 |
| Läppsynk-stresstest | 768P, 4 s | $0,40 |
| Vertikal Canvas-klippning | 768P, 8 s, 9:16 | $0,80 |
| Hjältebild för denna artikel | openai/gpt-image-2/text-to-image, high | $0,17 |
| Över-gräns-test, 24 s ljud | avvisad vid inskickning | $0,00 |
| Fyra inskickningar med fel ljud-MIME | avvisade vid inskickning | $0,00 |
| Referensljud, 4 x 8 s | gratis inmatning | $0,00 |
| Total kostnad | $7,53 |
Det är $9,00 per färdig minut vid 2K på de tagningar som kom med i slutklippet, före mina misstag. Helt och hållet vid 768P landar samma minut på $6,61. En mänsklig MV-crew citerar inte något av dessa nummer.
Två operativa anteckningar om du budgeterar en längre bit. Avvisningar vid inskickning är gratis, så dåliga parametrar kostar dig tid och inget annat. Och fältet price på en förutsägelse fylls i med en fördröjning, så polla request-ID igen efter att filen laddats ner om du vill ha en riktig faktura istället för ett null.
Vems låt, vems ansikte: vad du ska kontrollera innan du publicerar
Kort, eftersom det spelar roll och inte behöver en predikan.
Du behöver rättigheterna till referensspåret. Gratis inmatning betyder inte fri klarering. Att mata in en kommersiellt släppt singel som referensljud och sedan publicera vad som kommer ut är den snabba vägen till en borttagningsbegäran. Din egen inspelning, ett spår du beställt, eller något du genererat är okej.
Bygg inte basbilden från en verklig levande artists ansikte. Konsistensmekanismen här är mycket bra på att hålla ett ansikte över tagningar, vilket är precis varför det är en dålig idé att rikta den mot en verklig person.
Öppna vikter och API-åtkomst är två olika licenser. MiniMax publicerade H3:s vikter på Hugging Face i augusti 2026, och dess communitylicens utesluter för närvarande EU, Storbritannien, Sydkorea och USA, med en formell licenskanal öppen för dessa territorier. Den begränsningen gäller att köra vikterna själv. Att anropa modellen via en värdbaserad API är en tjänsterelation och placerar dig inte under viktlicensen. Värt att veta vilken situation du befinner dig i innan du antar något åt något håll.
För en bredare bild av var H3 står i jämförelse med alternativen finns en Seedance 2.5-jämförelse och en promptstruktur-guide. För kontext kring varför det är värt besväret överhuvudtaget: på videoredigeringsleaderboarden som betygsätter modeller med ljud ligger H3 för närvarande först med 1 126 Elo, före Gemini Omni Flash på 1 119 och Dreamina Seedance 2.0 på 1 027 (Artificial Analysis, kontrollerad 10 augusti 2026). Dessa poäng rullar med rösterna, så betrakta dem som en ögonblicksbild.
MiniMax H3-musikvideo: Vanliga frågor
Kan en MiniMax H3-musikvideo köra hela tre minuter?
Inte i en enda generation. Ett enda anrop är begränsat till 15 sekunder. Men det är ett tak per generation, inte per projekt. En treminutersvideo vid 8 sekunder per tagning är 23 generationer, ungefär $25,76 vid 2K, och varje landar på en taktlinje om ditt spår är 120 BPM. Dela upp, skjut, sammanfoga, lägg mastern över.
Använder en MiniMax H3-musikvideo min faktiska låt, eller återskapar modellen ljudet?
Den använder din faktiska låt. Jag mätte 0,892 rå vågformskorrelation vid noll sampeloffset mellan 8-sekunders mp3:an jag laddade upp och ljudströmmen inuti den returnerade mp4-filen, med den stämning som prompten bad om lagd ovanpå. En kontrolltagning genererad utan referensljud fick 0,26 mot samma master. Du bör fortfarande lägga din master över den slutliga sammanfogningen, eftersom varje klipp bär sin egen per-tagning-stämning och sin egen AAC-kodning, vilka inte överlever en klippning rent.
Kostar det extra att mata en låt i en MiniMax H3-musikvideo?
Nej. Mina fyra 8-sekunders referensbitar tillförde $0,00 till en $4,48-tagningskostnad. Referensvideo är den du ska hålla koll på, eftersom den debiteras till utdatapriset. Gränserna är tre ljudklipp, 2 till 15 sekunder vardera, 15 sekunder totalt, och ljud kan aldrig vara den enda referensen.
Hur bra är MiniMax H3-läppsynk på sång jämfört med tal?
Hållna sjungna vokaler är dess starka sida: distinkta munformer, hållningar som matchar tonen, och huvudet som lutas bakåt på en lång ton läses som en prestation snarare än en loop. Tät leverans är där den ger upp. Mitt sex-stavelser-per-sekund-rap-test höll takten men slutade lösa konsonanter och föll in i en upprepad öppen-stäng-cykel. Lägg de snabba takterna på b-roll.
Hur behåller jag samma ansikte över varje tagning i en MiniMax H3-musikvideo?
Tre saker, alla tråkiga. En referensbild återanvänds i varje anrop, aldrig återskapad. Samma garderobstext kopierad ordagrant mellan promptar, inte parafraserad. Och en explicit "identisk med referensbilden"-klausul i varje prompt. Mina fyra tagningar korsade regn, låg sol, platt högnyckel och undervatten utan glidning.
Hur mycket kostar en MiniMax H3-musikvideo per färdig minut?
$9,00 per färdig minut vid 2K, baserat på min verkliga faktura på $4,80 för en 32-sekunders klippning. Helt och hållet vid 768P kostar samma minut $6,61, och 768P levererar samma 32 kHz stereo, så prestationen du bedömer är identisk. Kör dina avslag på $0,80 och betala $1,12 endast på den tagning som överlever redigeringen.






