
Het nachtdienst-radioframe waarmee elke take in dit artikel begint, gegenereerd met openai/gpt-image-2/text-to-image op kwaliteit hoog, 2048x1152
Deze ene still is de invoer voor de hele tutorial hieronder. Gegenereerd met openai/gpt-image-2/text-to-image, kwaliteit hoog, 2048x1152.
Denk aan de laatste keer dat je een shot van 8 seconden afrondde en het kwam er stil uit.
Je exporteerde de clip. Je opende een TTS-tabblad en typte de regel. Je zocht door een geluidsbibliotheek naar regen en ruimtegeluid. Je sleepte alles naar een tijdlijn en schoof de golfvorm heen en weer tot de mond niet meer loog. Daarna betaalde je alsnog voor een apart lip-sync-model om de mond te corrigeren. Vier tools, drie wav-bestanden, één uur, en de vertolking voelde nog steeds nagesynchroniseerd, omdat die dat ook was.
Die keten is wat MiniMax H3 stilletjes heeft geëlimineerd. Niet omdat het "audio heeft" (veel modellen beweren dat), maar vanwege één veld in de request body dat bijna niemand test: je kunt er gratis een audiobestand aan geven dat je al bezit, en krijgt de stem terug op een gezicht.
Hieronder staat de two-take-test die dat veld isoleert, de echte prijzen van elke stap die het vervangt, de harde limieten die je verzoek kunnen afwijzen, en de daadwerkelijke rekening.
Belangrijkste punten
- Eén aanroep levert beeld, dialoog, ruimtegeluid en lipbeweging in één keer op. Tekst, beelden en audio worden afzonderlijk gecodeerd, waarna een enkele Omni Transformer gezamenlijk de video- en audio-latents voorspelt (Hugging Face-modelkaart, augustus 2026).
- Invoer-audio is gratis. Invoer-video niet: MiniMax factureert referentievideo tegen het outputtarief, dus dezelfde 15 seconden materiaal kosten $0 als nummer en ongeveer $1.95 als videoclip.
- Harde limieten: maximaal 3 audioclips, elk 2 tot 15 seconden, 15 seconden totaal, en audio kan nooit alleen reizen. Het moet vergezeld gaan van ten minste één afbeelding of video.
- Tegen $0.14 per seconde voor 2K op Atlas Cloud kost een volledig shot van 10 seconden met geluid $1.40, wat minder is dan het betalen van $0.22 per seconde aan een dedicated lip-sync-model om een clip te patchen die je al hebt gerenderd.
Geluid aan: twee MiniMax H3 lip sync- en audio-takes, één verschil van zes seconden
Zet je koptelefoon op voor deze. Beide helften kregen hetzelfde basisframe, dezelfde twee dialoogregels en dezelfde prompt, woord voor woord. Slechts één ervan hoorde eerst een opname van zes seconden van een stem.
fXlyer__czg
Geluid aan, en gebruik een koptelefoon: de linkerhelft (Take A, zonder referentie-audio) klinkt in je linkeroor, de rechterhelft (Take B, met een referentie van 6 seconden) in je rechteroor. Zelfde frame, zelfde regels, zelfde prompt. Beide takes: minimax/h3/reference-to-video, 2K, 10 seconden, geleverd als 2560x1440 bij 24fps met een stereotrack van 32 kHz.
Take A had niets om op te bouwen behalve de woorden "kalme, lage, magnetische mannelijke radiostem" in de prompt, dus het verzon een stem. Take B kreeg 6.19 seconden van een volledig andere zin en de opdracht om die alleen als timbre-anker te behandelen. Geen van beide takes werd achteraf nagesynchroniseerd. Geen van beide kwam in de buurt van een lip-sync-model. In beide gevallen volgt de mond de stem die het model heeft geproduceerd, omdat de mond en de stem samen zijn gegenereerd.
Beoordeel het timbre met je eigen oren in plaats van op mijn woord te vertrouwen. Wat ik als feit kan stellen, is het mechanisme, de instellingen en de rekening, en die volgen nu.
Waarom MiniMax H3 lip sync en audio ieders zesstappige nasynchronisatieketen doorbrak
De oude keten was nooit echt een workflow. Het was een reparatieklus.
ImGr2NgcCCY
Geluid aan. Een 3D-geanimeerde pad en kameleon die 's nachts met elkaar praten in een circustent, met de sfeer van de ruimte onder de dialoog. Een MiniMax-referentieclip voor H3-native audio. Mondvormen bij geanimeerde personages zijn het moeilijkst om te faken, daarom verdient deze 20 seconden van je aandacht.
Drie dingen bleven stukgaan, en ze gingen stuk om structurele redenen, niet door pech.
De tijdlijn leefde in je handen. Een videomodel gaf je frames. Een TTS-model gaf je een golfvorm. Niets in de ene output wist van de andere, dus uitlijning was een menselijk oordeel dat je met het oog velde op 30 frames per seconde, om 1 uur 's nachts. Elke nieuwe render begon dat oordeel opnieuw.
Lip sync als patch heeft een plafond. Een dedicated lip-sync-model bezit alleen het mondgebied van beeldmateriaal dat al bestaat. Het kan de mond in overeenstemming brengen met de audio. Het kan de kaak niet laten spannen vóór een harde medeklinker, of een ademhaling vóór een regel plaatsen, of de schouders laten zakken wanneer de zin eindigt, omdat die frames zijn gerenderd voordat iemand wist wat het personage zou zeggen. Je krijgt nauwkeurigheid zonder performance, en dat voelt als uncanny.
Geluidsontwerp was een tweede project. Regen, ruimtegeluid, krakende stoel, een baslijn onder de dialoog. Alles kwam uit een andere bron en moest worden gebalanceerd tegen een stem die zelf ook was opgeplakt.
Wat de Audio VAE je vertelt over MiniMax H3 lip sync en audio
Dit is het deel dat geen marketingtaal is, omdat je het in een bestandsnaam kunt zien.
In H3 gaat tekst door de H3-Encoder, visuele invoer door zowel de H3-Encoder als de H3-VisualVAE, en audio uitsluitend door een zelfstandige H3-AudioVAE. De H3-Omni-Transformer voorspelt vervolgens gezamenlijk de video- en audio-latents, die afzonderlijk worden gedecodeerd naar video en stereo-audio. De AudioVAE deelt één encoder en decoder over de linker- en rechterkanalen, verwerkt elk kanaal onafhankelijk, combineert ze weer voor stereo, en comprimeert 32 kHz-audio naar een latente tokenreeks met een temporele snelheid van 40 Hz (Hugging Face-modelkaart).
Toen ComfyUI dag-0-ondersteuning uitbracht, verscheen die architectuur als twee afzonderlijke bestanden in de VAE-map: minimax_h3_video_vae_fp16.safetensors en minimax_h3_audio_vae_fp32.safetensors, geladen door een dual-VAE-loader die zowel een videopad als een audiopad accepteert (ComfyUI-blog, augustus 2026). Audio is een modaliteit waar het model omheen is gebouwd, geen nabewerking die achteraf aan het einde is vastgeschroefd.
De leaderboards bevestigen waar dat zichtbaar wordt. Artificial Analysis plaatste H3 eerste op zijn video-editing-leaderboard met audio op 1,130 Elo uit 5,043 blinde-preferentiesteekproeven, terwijl het in zowel tekst-naar-video als beeld-naar-video in de top drie stond (Artificial Analysis, juli 2026). Het gat tussen 'heel goed beeld' en 'eerste plaats' in die specifieke ranglijst is de audio.
De MiniMax H3 lip sync- en audio-workflow, geprijsd tegen de keten die hij vervangt
De eerlijke manier om dit te beoordelen is niet op gevoel. Het is om de oude keten stap voor stap te prijzen, met echte tarieven per seconde voor een afgerond shot van 10 seconden, en dan de vervanging te prijzen.
| # | De oude keten, stap voor stap | Wat het uitvoerde | Wat die stap kostte | Met MiniMax H3 lip sync en audio |
|---|---|---|---|---|
| 1 | Render het stille beeld | een videomodel, bijv. bytedance/seedance-2.0 tegen $0.112/s | $1.12 | dezelfde enkele aanroep |
| 2 | De regels inspreken | minimax/speech-2.6-hd | ongeveer $0.02 voor ~250 tekens | dezelfde enkele aanroep |
| 3 | De muziek vinden of maken | minimax/music-2.6 | $0.15 per track | dezelfde enkele aanroep |
| 4 | Sfeer en losse effecten stapelen | geluidsbibliotheek plus je eigen handen | je avond | dezelfde enkele aanroep |
| 5 | Alles uitlijnen op een tijdlijn | editor plus je eigen handen | je avond | bestaat niet |
| 6 | Mixen | editor plus je eigen handen | je avond | bestaat niet |
| 7 | De mond patchen | sync/lipsync-v3 tegen $0.22/s | $2.20 | bestaat niet |
| Totaal | 4 modellen plus 2 handmatige passen | ongeveer $3.49 plus je avond | 1 aanroep, $1.40 |
Lees rij 7 twee keer. Het patchen van de mond van een clip die je al hebt gerenderd kost $0.22 per seconde, terwijl het genereren van het volledige shot met stem, sfeer en mondbeweging $0.14 per seconde kost. De patch is duurder dan het origineel. Die ene vergelijking is het hele argument.
De asymmetrie die niemand noemt: je eigen audio is gratis, je eigen video niet.
De pay-as-you-go-prijsopgave van MiniMax vermeldt invoermateriaal apart van output. Voor H3 is audio-invoer gratis. De eerste vijf invoerafbeeldingen zijn gratis en elke volgende kost $0.04. Invoervideo wordt gefactureerd op basis van de duur van de invoerclip tegen het tarief van de outputresolutie, wat $0.13 per seconde is bij 2K (MiniMax-prijsdocumentatie, gecontroleerd op 3 augustus 2026). Dus dezelfde 15 seconden referentiemateriaal kosten niets als nummer, spraakmemo of door de klant aangeleverde voice-over, en ruwweg $1.95 als videoclip.
Dat is de regel die zou moeten veranderen hoe je bouwt. Referentie-audio is het goedkoopste sturingsmiddel in het model, en het is degene die niemand test.
| Referentie-invoer | Hoeveel | Per clip | Totaal | Facturering (MiniMax) |
|---|---|---|---|---|
| Afbeelding | tot 9 | n.v.t. | n.v.t. | eerste 5 gratis, daarna $0.04 per stuk |
| Video | tot 3 | 2 tot 15 s | max. 15 s | gefactureerd tegen het outputtarief, $0.13/s bij 2K |
| Audio | tot 3 | 2 tot 15 s | max. 15 s | Gratis |
| Elke combinatie | max. 12 bestanden | n.v.t. | n.v.t. | zoals hierboven, per type |
| Audio alleen | niet toegestaan. Audio moet vergezeld gaan van afbeeldingen of video en kan niet als enige invoer worden gebruikt |
Limieten uit de H3-Base-Ref2VA-specificatie op de modelkaart. Het Atlas Cloud-schema voor minimax/h3/reference-to-video zegt hetzelfde in eigen woorden: "Ten minste één afbeelding OF video is vereist (audio alleen is niet toegestaan)."
Twee voetnoten aan de Atlas-kant van de meter, beide uit mijn eigen runs in plaats van een documentatiepagina. Atlas factureert één vast tarief van $0.14 per outputseconde voor alle drie de H3-endpoints, en een referentievideo die ik bijvoegde, leverde geen extra kosten op bovenop dat tarief. Dat is één observatie, geen beleid, dus houd rekening met de MiniMax-regel in je budget en behandel het vaste tarief als een bonus. Atlas accepteert ook resolution: "768P" en factureert dat tegen hetzelfde $0.14-tarief, een discrepantie die je beter kunt nalezen in de MiniMax H3 API-prijsanalyse dan hier.
Alles hieronder draait in één browsertabblad op Atlas Cloud: het basisframe, de stemreferentie en beide H3-takes, op één API-sleutel met één poll-lus. De drie H3-endpoints verschillen alleen in de vorm van hun invoer, dus refers wordt image wordt platte tekst en verder verandert er niets aan je code.
MiniMax H3 lip sync en audio, stap voor stap
Vijf stappen. Twee daarvan zijn goedkope voorbereiding, twee zijn de echte test, en de laatste kost niets omdat die ontworpen is om te mislukken.
Stap 1: Bouw het basisframe met GPT Image 2
De demo is een radiohost van de nachtdienst, gekozen om één reden: een strakke close-up op een mond is de enige kadrering waarmee je lip sync echt kunt beoordelen. Een totaalshot laat een model valsspelen.
Twee dingen in deze prompt zijn niet onderhandelbaar. De mond moet halverwege een woord iets open staan, zodat het eerste frame al als spraak leest, en er mag nergens tekst in het frame staan, zodat dynamische bijschriften later niet botsen met ingebakken letters.
plaintext1Photoreal cinematic still, 16:9, night-shift radio studio, tight chest-up framing on a 2man in his late thirties leaning into a vintage silver condenser microphone on a boom arm, 3foam windscreen inches from his lips, headphones half-off one ear. Warm tungsten desk lamp 4from camera-left carves his cheekbone; a red neon ON AIR sign burns out of focus behind his 5shoulder and bleeds crimson onto the mixing desk faders in the lower foreground. Rain streaks 6the studio window on the right, city lights smeared into bokeh. Thin cigarette smoke drifts 7through the lamp beam. Mouth slightly open mid-word, eyes down toward a paper script. Shot on 835mm, shallow depth of field, fine film grain, deep shadows, no text anywhere in the frame. 9
Instellingen op openai/gpt-image-2/text-to-image: kwaliteit hoog, formaat 16:9 op 2048x1152, één afbeelding. De $0.009 op de modellenlijst is een minimum op basis van de token-tier, niet wat je betaalt. Bij dit formaat en deze kwaliteit geeft de Run-knop $0.1745 per generatie aan, zoals je in de onderstaande schermafbeelding kunt lezen.

GPT Image 2 op Atlas Cloud met de radiocabine-prompt ingetypt, kwaliteit hoog en 16:9 2048x1152 geselecteerd, en het afgewerkte basisframe gerenderd in het OUTPUT-paneel_GPT Image 2 op Atlas Cloud: de exacte prompt hierboven, kwaliteit hoog, 16:9 op 2048x1152, en een tweede generatie van hetzelfde frame in OUTPUT._
Stap 2: Maak de stemreferentie van zes seconden
Dit is de stap die mensen verkeerd doen, dus lees de redenering vóór de prompt.
De referentie-audio moet een andere zin uitspreken dan de zin die je in de video wilt. Het is een timbre-anker, niets meer. De dialoog komt uit de prompt. MiniMax's eigen reference-to-video-voorbeeld maakt deze opsplitsing expliciet: het labelt één clip als de bron-track die deels wordt hergebruikt voor muziek, en een tweede clip uitsluitend als "de stemtimbre-referentie", met de nieuwe dialoog inline in de prompt geschreven. Als je referentie dezelfde woorden uitspreekt als gevraagd, nodig je het model uit om de track te kopiëren in plaats van de stem over te dragen.
plaintext1You're listening to Night Line, ninety-one point four, and it is coming up on 2three in the morning. 3
Instellingen op minimax/speech-2.6-hd: elke kalme, lage mannenstem werkt, en ik koos voor Magnetic-voiced Male (English_magnetic_voiced_man). Zet speed op 0.95 zodat de take ruim binnen het venster van 2 tot 15 seconden valt, laat vol op 1.0 staan en behoud de mp3-output. Het model kost $0.08 per 1.000 tekens, verlaagd van $0.10, een korting van 20% die geldig is vanaf augustus 2026. Mijn regel kwam terug op 6.19 seconden en kostte $0.00792.

MiniMax Speech 2.6 HD op Atlas Cloud met de referentieregel in het tekstveld en de gerenderde audiogolfvorm in het OUTPUT-paneel
MiniMax Speech 2.6 HD op Atlas Cloud: één regel erin, één korte mp3 eruit, met de 20%-korting op de Run-knop. De schermafbeelding is gemaakt met de standaardstem Expressive Narrator, dus schakel de Voice-picker over naar Magnetic-voiced Male en verlaag Speed naar 0.95 voordat je hem uitvoert.
Stap 3: Voer MiniMax H3 lip sync en audio uit met de referentie-audio
Nu gaan beide bestanden samen in refers: de still uit stap 1 en de mp3 uit stap 2. Dit is Take B.
De prompt gebruikt de gestructureerde opbouw waar H3 op is getraind. subject_definitions benoemt wie en wat de referenties zijn, detailed_description bevat de dialoog binnen <d>[English] ...</d>-tags, en de twee audiosecties beschrijven de mix. Als de sectienamen nieuw voor je zijn, behandelt de MiniMax H3-promptgids de volledige structuur. Slechts drie velden zijn belangrijk voor audiowerk, en die staan hier allemaal.
plaintext1subject_definitions: 2<Subject 1> is the man at the radio microphone in <Picture 1>, late thirties, headphones 3half-off one ear, red ON AIR neon behind his shoulder. 4<Picture 1> is the opening frame of the target video. 5<Audio 2> is the voice timbre reference for <Subject 1>: a calm, low, magnetic male 6broadcast voice. Reference the timbre only; do not reuse its words. 7 8summary: 9[image reference + audio timbre reference] A single continuous 10-second close-up. <Subject 1> 10delivers two lines straight into the microphone in the voice timbre of <Audio 2>, while the 11camera pushes in slowly. The mouth movement, the breath before each line, and the room tone 12are generated together. 13 14detailed_description: 15The shot opens exactly on <Picture 1>. Warm tungsten from camera-left, red neon bleeding onto 16the mixing desk in the foreground, rain on the window behind. <Subject 1> takes a short breath, 17tilts a few degrees toward the windscreen, and speaks, <d>[English] It's three in the morning, 18and I know exactly who's still awake.</d> As he speaks, his jaw and lips move naturally with 19every syllable; the plosives on "three" and "morning" are visible. He glances down at the script, 20then back up past the lens, and continues, <d>[English] So let's keep this between us.</d> 21Exactly as his voice stops, his lips settle closed and he exhales through his nose. Throughout, 22the camera executes one slow, deliberate push-in; the neon flickers once, faintly, around second 23seven. No on-screen text. 24 25overall_soundscape: 26Close, dry, booth-treated voice with a touch of proximity effect from the microphone. Under it: 27a low electrical hum from the desk, rain steady against the glass, one distant car passing on 28the wet street, the soft creak of the chair as he leans in, and a single audible breath before 29each line. 30 31non_diegetic_music: 32A sparse, slow late-night jazz double bass, very quiet, well under the voice, entering around 33second two and never rising above the dialogue. 34
Instellingen op minimax/h3/reference-to-video: resolutie 2K, duur 10, beeldverhouding 16:9, en refers met beide bestanden. De volgorde in de array maakt niet uit, alleen dat ten minste één ervan een afbeelding of video is. De Duration-schuifregelaar staat standaard op 8, dus verplaats die, en zet de Aspect Ratio van adaptive af als je het frame wilt dat je hebt gevraagd.
Vier parameter-valkuilen, waarvan er drie me geld hebben gekost. De key is ratio, niet aspect_ratio, en een fout hier geeft een 400 terug. Stuur altijd expliciet duration mee, want de schema-standaard zegt 8 maar een verzoek zonder duration kwam terug als een bestand van 5 seconden. Op dit endpoint voltooit het meesturen van image naast refers wel, factureert het volledig, en laat het stilletjes een van beide vallen. En als je de audio als base64-data-URL meestuurt, label die dan als data:audio/mp3, niet als data:audio/mpeg. Mijn eerste poging liep daar precies op stuk:
plaintext1content[2].audio_url: invalid param: audio format ".mpeg" not allowed 2
Die is tenminste gratis, wat ons brengt bij de nuttige manier om de limieten te leren kennen.

De MiniMax H3 reference-to-video-playground op Atlas Cloud, met de mp3 in slot 1 en het basisframe in slot 2 van Reference Materials, resolutie 2K, en de afgewerkte clip die afspeelt in het OUTPUT-paneel
MiniMax H3 reference-to-video op Atlas Cloud: Reference Materials geeft 2/9 aan met de mp3 in slot één en de still in slot twee, resolutie 2K, afgewerkte clip rechts. Deze opname draaide op de standaard 8 seconden van de playground, daarom zegt de Run-knop $1.12; mijn twee takes hierboven draaiden op 10 seconden voor $1.40 per stuk.
Stap 4: Voer de MiniMax H3 lip sync en audio-controletake uit
Verander één invoer en elke vermelding ervan. Verwijder de mp3 uit refers, zodat alleen de afbeelding overblijft, schrap de definitie van <Audio 2>, haal de zin "in de stemtimbre van <Audio 2>" uit de summary, en verander de bracket-tag naar [image reference]. Verder beweegt er niets en blijven de instellingen identiek: 2K, 10 seconden, 16:9.
Dat is wat het een controle maakt in plaats van een tweede poging. Het model heeft nu geen timbre-anker, dus het verzint een stem op basis van de geschreven omschrijving en lip-synct naar de stem die het net heeft verzonnen. Beide takes kwamen terug op 10.13 seconden en werden tot op de cent gefactureerd voor $1.40 per stuk.
WnfqR2I-a-8
Geluid aan. Take A op zichzelf: zelfde frame, zelfde regels, geen referentie-audio. De stem hier is een uitvinding van het model, en de mond volgt haar nog steeds.
Twee takes, één variabele. Dat is het goedkoopste experiment in dit hele artikel en het enige dat je vertelt wat de audio-slot daadwerkelijk doet.
Stap 5: Breek MiniMax H3 lip sync en audio met opzet
De laatste stap is gratis, en het is de moeite waard om hem één keer te doen, zodat je de fout herkent om 2 uur 's nachts.
Zet de mp3 in refers en niets anders. Geen afbeelding, geen video, alleen audio. Dien vervolgens in.
plaintext1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Authorization: Bearer $ATLAS_API_KEY" \ 3 -H "Content-Type: application/json" \ 4 -d '{ 5 "model": "minimax/h3/reference-to-video", 6 "prompt": "A man at a radio microphone speaks two lines into the windscreen.", 7 "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}], 8 "resolution": "2K", 9 "duration": 10, 10 "ratio": "16:9" 11 }' 12
Hier is het deel dat de moeite waard is om te weten, omdat het niet is wat het schema suggereert. De submit-aanroep geeft HTTP 200 terug met een normaal taak-id en "status": "processing", dus een naïeve client denkt dat het is gelukt. Drieëntwintig milliseconden later is de taak dood:
plaintext1{ 2 "status": "failed", 3 "error_code": 1010001, 4 "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video", 5 "latency_ms": 23 6} 7
Er verscheen nooit een price-veld op die voorspelling, dus het kostte niets. De praktische les gaat over je code, niet over je portemonnee: een 200 bij submit is geen succes. Poll het id en controleer status voordat je aanneemt dat je een clip hebt.
Nog vier manieren om MiniMax H3 lip sync en audio verder te duwen
De two-take-test is het kleinste nuttige experiment. Hier gaat hetzelfde veld vervolgens naartoe.
Eén shot, meerdere talen. Behoud het frame, behoud de mise-en-scène, wijzig de taal-tag binnen <d>...</d> en voer het opnieuw uit. De mond volgt de nieuwe taal in plaats van de oude, omdat de mond en de stem uit dezelfde forward pass komen. De modelkaart vermeldt stabiele dialoogondersteuning voor 11 talen: Arabisch, Chinees, Engels, Frans, Duits, Italiaans, Japans, Koreaans, Portugees, Russisch en Spaans, met meer talen die in wisselende mate worden ondersteund. Deze twee clips zijn dezelfde trailer met twee verschillende stemtracks, en MiniMax maakte ook een Franse versie en een versie zonder voice-over vanuit dezelfde opzet.
hj7ZId3KOKk
Geluid aan. De Engelse voice-overversie: een astronaut in close-up op een stoforanje planeet, met vertelling en muziek die samen met het beeld binnenkomen. Trailerwerk is dezelfde drie promptvelden met een ander geluidslandschap.
Hv62FGyBNPM
Geluid aan. De Japanse versie, frame voor frame dezelfde trailer. Er is niets opnieuw ingesproken en er heeft geen aparte voice-oversessie plaatsgevonden.
Zingen, met een hook die je al bezit. Dit is waar gratis invoer-audio ophoudt een voetnoot te zijn. Zet een bestaande hook of een instrumentaal van 15 seconden of minder in refers, beschrijf de performance, en het personage voert die uit op de muziek. Je betaalt niet voor de muziek die je meeneemt.
zui3Zw_UWnY
Geluid aan. Een band met een retro-camcorderlook, van backstage naar performance, waarbij de track en het beeld samen binnenkomen. Dat is de vorm die de meeste muziekvideowerk daadwerkelijk wil.
Twee mensen die praten is moeilijker dan één. Een enkele spreker in close-up is het makkelijke geval, en daarom gebruikte dit artikel precies dat. Voor dialoog tussen twee personages moet je ze expliciet labelen zoals MiniMax's eigen voorbeeld doet, met <Subject 1> (S1) en <Subject 2> (S2) bij elke <d>-regel, en verwacht dat je opnieuw moet draaien wanneer het model de volgorde of de toewijzing verkeerd doet. Begroot twee runs per tweegesprek.
Sfeer zonder een gesproken woord. overall_soundscape is een veld op zich en werkt zonder enige dialoog. Regen op glas, een krakende stoel, het gezoem van een koelkast, de ruimte zelf. Daarmee is hetzelfde endpoint een legitiem hulpmiddel voor ASMR en sfeer, en het is het enige gebruik waarbij de mond er nooit toe doet.
Eén eerlijke beperking uit mijn eigen twee takes: generatie in dezelfde pas betekent dat de mond en de stem overeenkomen, en het betekent niet dat elk fysiek detail in het frame overeenkomt met het geluid. Lange regels die in een korte duur worden geperst, vage regieaanwijzingen en scènes met meerdere sprekers verslechteren allemaal het resultaat. Bekijk je clip voordat je hem oplevert, op dezelfde manier als je een take van een menselijke acteur zou bekijken.
Wat MiniMax H3 lip sync en audio mij daadwerkelijk kostte
Elk bedrag hieronder is een echte kostenpost op een echt account, achteraf opgehaald. Het price-veld op een voorspelling wordt laat ingevuld, dus pollen tot completed levert vaak niets op. Haal het id opnieuw op om het bedrag te krijgen.
| Stap | Model | Wat er draaide | Gefactureerd |
|---|---|---|---|
| 1 | openai/gpt-image-2/text-to-image | 1 basisframe, kwaliteit hoog, 2048x1152 | $0.1745 (vermeld op de Run-knop) |
| 2 | minimax/speech-2.6-hd | 99 tekens, 6.19s referentiestem | $0.01 |
| 3 | minimax/h3/reference-to-video | Take B, 10s bij 2K, afbeelding + audio in refers | $1.40 |
| 4 | minimax/h3/reference-to-video | Take A, 10s bij 2K, alleen afbeelding | $1.40 |
| 5 | minimax/h3/reference-to-video | audio-only-verzoek, mislukt na 23ms | $0.00 |
| Hele experiment, beide takes | ongeveer $2.98 |
Twee boekhoudkundige opmerkingen, want eerlijkheid is goedkoper dan een voetnoot. De foute audio/mpeg-data-URL in stap 3 kostte ook niets, omdat die bij submit een 400 gaf. Afwijzingen zijn gratis, maar een goed gevormd verzoek met een kapotte invoer niet, dus een referentie-URL die stil 404 geeft, wordt nog steeds volledig gefactureerd. En de playground-opname in de schermafbeelding bij stap 3 is een derde H3-run op de standaard 8 seconden van het paneel, die $1.12 bovenop de tabel factureerde. Die run bestaat voor dit artikel, niet voor het experiment.
De oude keten, geprijsd in de tabel hierboven, kostte ongeveer $3.49 voor één shot van 10 seconden plus een avond handmatig uitlijnen. Dit waren twee volledige shots van 10 seconden met geluid, een gecontroleerde A/B-test en twee bewust kapotte verzoeken, voor minder.
Dat gezegd hebbende: H3 is het verkeerde gereedschap voor verschillende klussen die mensen het zullen proberen te geven, en de alternatieven zijn goedkoper.
| Wat je daadwerkelijk wilt | Het juiste model | Prijs | Waarom |
|---|---|---|---|
| Eén portret plus één bestaand audiobestand, naar een talking head | bytedance/avatar-omni-human-v1.5 | $0.12/s | Speciaal gebouwd voor audio-naar-video, en de outputlengte volgt je audio |
| Een afgewerkte clip waarvan de mond een nieuwe taal moet spreken | sync/lipsync-v3 | $0.22/s | H3 wijzigt je bestaande render niet, en patchen is precies de taak van dit model |
| De goedkoopst mogelijke mondcorrectie op een talking head | veed/lipsync | $0.013/s | Ruwweg tien keer goedkoper, en het raakt alleen de mond, niet de performance |
| Een volledig geregisseerd shot, met timbre, sfeer en muziek samen | minimax/h3/reference-to-video | $0.14/s | Beeld en geluid komen uit één pass, dus de performance is ontworpen in plaats van gerepareerd |
Als je voor character-werk kiest tussen H3 en zijn dichtstbijzijnde rivaal, in plaats van op audio, dan is de Seedance 2.5-vergelijking een betere keuze. En als je je afvraagt of de open gewichten dit gratis maken: ze maken het niet snel. 2K komt nog steeds van de API-kant, en community-rapporten plaatsen een lokale render van 10 seconden op 480p op consumentenkaarten op minuten in plaats van seconden.
Eén eerlijke noot over stemmen, nummers en rechten
Gratis uploaden is niet hetzelfde als gratis gebruiken. Een nummer dat jij niet hebt geschreven en een stem die niet van jou is, zijn twee afzonderlijke toestemmingen, en geen van beide wordt verleend door een API die niets rekent voor de upload. Gebruik je eigen opnames, gelicentieerde muziek of een synthetische stem die je zelf hebt gegenereerd — dat is precies wat stap 2 doet.
Daarnaast bevatten de community-gewichten territoriale beperkingen die momenteel de EU, het VK, Zuid-Korea en de VS niet bestrijken, met in plaats daarvan een formeel licentiekanaal. Dat is een langer verhaal, en dat wordt verteld in de MiniMax H3 open-gewichten-gids.
MiniMax H3 lip sync en audio: veelgestelde vragen
Genereert MiniMax H3 lip sync en audio het geluid echt in dezelfde pass, of wordt het achteraf nagesynchroniseerd?
Dezelfde pass. Tekst gaat door de H3-Encoder, beelden door de H3-Encoder plus de H3-VisualVAE, en audio door een zelfstandige H3-AudioVAE. De H3-Omni-Transformer voorspelt gezamenlijk de video- en audio-latents, die vervolgens afzonderlijk worden gedecodeerd naar beeld en 32 kHz-stereo-audio. Er wordt niets achteraf over elkaar heen gelegd, en daarom horen de mond, de ademhaling en het ruimtegeluid bij dezelfde take.
Kan ik mijn eigen nummer of stem invoeren in MiniMax H3 lip sync en audio, en kost dat extra?
Ja, en nee. MiniMax's pay-as-you-go-tabel vermeldt H3-audio-invoer als gratis. De asymmetrie om op te letten is video: invoervideo wordt gefactureerd op basis van de duur tegen het outputtarief, $0.13 per seconde bij 2K, dus 15 seconden referentievideo kost ongeveer $1.95 terwijl 15 seconden referentie-audio $0 kost.
Waarom wijst MiniMax H3 lip sync en audio een verzoek af dat alleen audio bevat?
Omdat audio het enige referentietype is dat niet alleen kan reizen. Het moet vergezeld gaan van ten minste één afbeelding of video. De rest van de limieten, uit de H3-Base-Ref2VA-specificatie: maximaal 9 afbeeldingen, maximaal 3 video's en maximaal 3 audioclips, elke video- of audioclip tussen 2 en 15 seconden, 15 seconden totaal per type, en maximaal 12 bestanden over alle typen in één verzoek.
Houdt MiniMax H3 lip sync en audio het vol voor een hele clip, of alleen voor de eerste regel?
Voor een enkele spreker met ruimte om adem te halen, houdt het de hele clip vol in plaats van één regel neer te zetten en dan af te dwalen. Drie dingen breken het: een lang script in een korte duur proppen, vage of ontbrekende regieaanwijzingen, en scènes met meerdere sprekers waarin het model moet beslissen wie wanneer praat. Geef elke regel een gelabelde spreker en genoeg seconden om hem uit te spreken.
Heeft MiniMax H3 lip sync en audio een nieuwe nasynchronisatie nodig voor een andere taal?
Nee. Wijzig de taal-tag in de dialoogmarkup, van <d>[English] ...</d> naar <d>[Japanese] ...</d>, en voer dezelfde prompt opnieuw uit. De mond wordt gegenereerd met de nieuwe stem, dus die past bij de nieuwe taal in plaats van de oude. De modelkaart vermeldt stabiele dialoogondersteuning voor 11 talen.
Is het goedkoper om MiniMax H3 lip sync en audio lokaal te draaien?
Goedkoper per clip, duur op elke andere manier. De gewichten zijn open, maar community-rapporten van lokale runs op consumentenkaarten met 16 GB meten een generatie van 10 seconden op 480p in minuten, self-hosting rendert op een korte zijde van 768, en 2K komt nog steeds van de API-side-regeneratiestap. Tel daar de territoriale beperkingen van de community-licentie bij op en de API blijft het pragmatische pad voor afgewerkt werk.






