MiniMax H3 Lip Sync and Audio: Jag matade den med 6 sekunder av en röst och tog bort 4 verktyg från min pipeline.

MiniMax H3 lip sync och audio ersatte min sexstegs dubbningskedja med ett enda API-anrop. Två riktiga tagningar, referensljudets gränser som ingen dokumenterar, och den verkliga kostnaden.

Man wearing headphones speaks into a microphone while reading a script

Nattpassets radiobild som varje tagning i denna artikel utgår från, genererad med openai/gpt-image-2/text-to-image vid kvalitet hög, 2048x1152.

Denna enda stillbild är indata för hela handledningen nedan. Genererad med openai/gpt-image-2/text-to-image, kvalitet hög, 2048x1152.

Tänk på förra gången du avslutade en 8-sekunders tagning och den blev tyst.

Du exporterade klippet. Du öppnade en TTS-flik och skrev repliken. Du rotade i ett ljudbibliotek efter regn och rumsljud. Du drog alltihop till en tidslinje och flyttade vågformen fram och tillbaka tills munnen slutade ljuga. Sedan betalade du en separat läppsynkmodell för att fixa munnen ändå. Fyra verktyg, tre wav-filer, en timme, och prestationen kändes fortfarande dubbad, för det var den.

Den kedjan är vad MiniMax H3 tyst raderade. Inte för att den "har ljud" (många modeller påstår det), utan på grund av en enda plats i request body som nästan ingen testar: du kan ge den en bit ljud du redan äger, gratis, och få tillbaka rösten på ett ansikte.

Nedan följer tvåtagningstestet som isolerar den platsen, de verkliga priserna för varje steg den ersätter, de hårda gränserna som kommer att avvisa din förfrågan, och den faktiska räkningen.

Viktiga slutsatser

  • Ett anrop returnerar bild, dialog, rumsljud och läpprörelse tillsammans. Text, bilder och ljud kodas separat, sedan förutsäger en enda Omni-Transformer gemensamt video- och ljudlatenterna (Hugging Face-modellkort, augusti 2026).
  • Inmatningsljud är gratis. Inmatningsvideo är inte det: MiniMax debiterar referensvideo till utmatningshastigheten, så samma 15 sekunders material kostar $0 som en låt och cirka $1,95 som ett videoklipp.
  • Hårda gränser: max 3 ljudklipp, varje 2 till 15 sekunder, 15 sekunder totalt, och ljud kan aldrig färdas ensamt. Det måste åtföljas av minst en bild eller video.
  • Till $0,14 per sekund för 2K på Atlas Cloud kostar en hel 10-sekunders tagning med ljud $1,40, vilket är mindre än att betala en dedikerad läppsynkmodell $0,22 per sekund för att lappa ett klipp du redan renderat.

Ljud på: Två MiniMax H3-läppsynk- och ljudtagningar, en sex sekunders skillnad

Hörlurar på för den här. Båda halvorna fick samma basram, samma två repliker och samma prompt, ord för ord. Endast en av dem hörde en sex sekunder lång inspelning av en röst först.

fXlyer__czg

Ljud på, och använd hörlurar: den vänstra halvan (tagning A, utan referensljud) spelas i ditt vänstra öra, den högra halvan (tagning B, med en 6-sekunders referens) i ditt högra. Samma ram, samma repliker, samma prompt. Båda tagningarna: minimax/h3/reference-to-video, 2K, 10 sekunder, levererat som 2560x1440 vid 24fps med ett 32 kHz stereospår.

Tagning A hade inget att gå på förutom orden "lugn, låg, magnetisk manlig radiosändarröst" i prompten, så den uppfann en röst. Tagning B fick 6,19 sekunder av en helt annan mening och instruerades att endast behandla den som en klangfärgsankare. Ingen av tagningarna dubbades efteråt. Ingen av dem kom i närheten av en läppsynkmodell. I båda följer munnen den röst som modellen producerade, eftersom munnen och rösten producerades tillsammans.

Bedöm klangfärgen med dina egna öron snarare än att ta mitt ord för det. Vad jag kan ange som fakta är mekanismen, inställningarna och räkningen, och de kommer härnäst.

Varför MiniMax H3-läppsynk och ljud bröt allas sexstegs-dubbningskedja

Den gamla kedjan var aldrig riktigt ett arbetsflöde. Det var ett reparationsarbete.

ImGr2NgcCCY

Ljud på. En 3D-animerad padda och kameleont som pratar med varandra inne i ett cirkustält på natten, med inhägnadens atmosfär under dialogen. Ett MiniMax-referensklipp för H3 inbyggt ljud. Munformer på animerade karaktärer är det svåraste fallet att fejka, vilket är varför den här är värd 20 sekunder av din uppmärksamhet.

Tre saker gick sömlöst, och de gick sönder av strukturella skäl snarare än otur.

Tidslinjen levde i dina händer. En videomodell gav dig bildrutor. En TTS-modell gav dig en vågform. Ingenting i någon av utsignalerna visste om den andra, så justering var en mänsklig bedömning gjord vid 30 bilder per sekund, med ögat, klockan 01.00. Varje omrendering startade om den bedömningen.

Patch-style läppsynk har ett tak. En dedikerad läppsynkmodell äger bara munregionen av material som redan finns. Den kan få munnen att stämma överens med ljudet. Den kan inte få käken att spännas före en hård konsonant, eller lägga ett andetag före en replik, eller låta axlarna sjunka när meningen slutar, eftersom de bildrutorna renderades innan någon visste vad karaktären skulle säga. Du får noggrannhet utan prestation, vilket uppfattas som kusligt.

Ljuddesign var ett andra projekt. Regn, rumsljud, stolsknarr, en basgång under dialogen. Allt kom från en annan källa och måste balanseras mot en röst som i sig själv var påklistrad.

Vad ljud-VAE:n berättar om MiniMax H3-läppsynk och ljud

Här är delen som inte är marknadsföringsspråk, eftersom du kan se den i ett filnamn.

I H3 går text genom H3-Encodern, visuella indata går genom både H3-Encodern och H3-VisualVAE, och ljud går uteslutande genom en fristående H3-AudioVAE. H3-Omni-Transformatorn förutsäger sedan gemensamt video- och ljudlatenter, som avkodas till video och stereo-ljud separat. AudioVAE delar en enkodare och avkodare över vänster och höger kanal, bearbetar varje oberoende, återkombinerar dem för stereo, och komprimerar 32 kHz-ljud till en latent token-sekvens med en temporal hastighet på 40 Hz (Hugging Face-modellkort).

När ComfyUI levererade dag-0-stöd visades den arkitekturen som två separata filer i VAE-mappen: minimax_h3_video_vae_fp16.safetensors och minimax_h3_audio_vae_fp32.safetensors, laddade av en dual VAE-loader som tar en videoväg och en ljudväg (ComfyUI-blogg, augusti 2026). Ljud är en modalitet som modellen byggdes kring, inte en efterbearbetning som bultats på slutet.

Ledartavlorna håller med om var det syns. Artificial Analysis placerade H3 först på sin videoredigeringsledartavla med ljud vid 1 130 Elo från 5 043 blindpreferensprover, samtidigt som den placerade den i topp tre i både text-till-video och bild-till-video (Artificial Analysis, juli 2026). Gapet mellan "mycket bra bild" och "första plats" i den specifika rankingen är ljudet.

MiniMax H3-läppsynk- och ljudarbetsflödet, prissatt mot kedjan den ersätter

Det ärliga sättet att bedöma detta är inte vibbar. Det är att prissätta den gamla kedjan steg för steg, med verkliga per-sekund-priser för en 10-sekunders färdig tagning, och sedan prissätta ersättningen.

#Den gamla kedjan, steg för stegVad som körde detVad det steget kostadeMed MiniMax H3-läppsynk och ljud
1Rendera den tysta bildenen videomodell, t.ex. bytedance/seedance-2.0 till $0,112/s$1,12samma enda anrop
2Tala replikernaminimax/speech-2.6-hdcirka $0,02 för ~250 teckensamma enda anrop
3Hitta eller skapa musikenminimax/music-2.6$0,15 per spårsamma enda anrop
4Lägga atmosfär och punkteffekterljudbibliotek plus dina händerdin kvällsamma enda anrop
5Justera allt på en tidslinjeredigerare plus dina händerdin kvällexisterar inte
6Mixaredigerare plus dina händerdin kvällexisterar inte
7Lappa munnensync/lipsync-v3 till $0,22/s$2,20existerar inte
Totalt4 modeller plus 2 manuella passningarcirka $3,49 plus din kväll1 anrop, $1,40

Läs rad 7 två gånger. Att lappa munnen på ett klipp du redan renderat kostar $0,22 per sekund, medan att generera hela tagningen med sin röst, sin atmosfär och sin munrörelse kostar $0,14 per sekund. Lappen är dyrare än originalet. Den enda jämförelsen är hela argumentet.

Asymmetrin som ingen nämner: ditt eget ljud är gratis, din egen video är inte det.

MiniMax:s betala-som-du-går-pristabell listar inmatningsmaterial separat från utmatning. För H3 är ljudinmatning Gratis. De första fem inmatningsbilderna är gratis och varje efterföljande kostar $0,04. Inmatningsvideo debiteras efter inmatningsklippets varaktighet med utmatningsupplösningens hastighet, vilket är $0,13 per sekund vid 2K (MiniMax-prislista, kontrollerad 3 augusti 2026). Så samma 15 sekunders referensmaterial kostar ingenting som en låt, en röstmemo eller en kundlevererad VO, och ungefär $1,95 som ett videoklipp.

Det är den linjen som borde ändra hur du bygger. Referensljud är den billigaste kontrollytan i modellen, och det är den som ingen testar.

ReferensinmatningHur mångaPer klippTotaltDebitering (MiniMax)
Bildupp till 9e.g.e.g.första 5 gratis, sedan $0,04 styck
Videoupp till 32 till 15s15s maxdebiteras till utmatningshastigheten, $0,13/s vid 2K
Ljudupp till 32 till 15s15s maxGratis
Valfri blandning12 filer maxe.g.e.g.som ovan, per typ
Ljud ensamtinte tillåtet. Ljud måste åtföljas av bild- eller videoinmatning och kan inte användas som enda inmatning

Gränser från H3-Base-Ref2VA-specifikationen på modellkortet. Atlas Cloud-schemat för minimax/h3/reference-to-video säger samma sak med egna ord: "Minst en bild ELLER video krävs (ljud ensamt är inte tillåtet)."

Två fotnoter på Atlas-sidan av mätaren, båda från mina egna körningar snarare än en dokumentsida. Atlas debiterar ett enda fast $0,14 per utmatningssekund för alla tre H3-slutpunkterna, och en referensvideo jag bifogade lade inte till en separat avgift utöver det. Det är en observation, inte en policy, så budgetera för MiniMax-regeln och behandla det fasta priset som en bonus. Atlas accepterar också resolution: "768P" och debiterar det till samma $0,14, vilket är en avvikelse värd att läsa om i MiniMax H3 API-prisgenomgången snarare än här.

Allt nedan körs i en webbläsarflik på Atlas Cloud: basramen, röstreferensen och båda H3-tagningarna, på en API-nyckel med en pollningsslinga. De tre H3-slutpunkterna skiljer sig endast i formen på sin inmatning, så refers blir image blir vanlig text och inget annat i din kod förändras.

MiniMax H3-läppsynk och ljud, steg för steg

Fem steg. Två av dem är billig installation, två är själva testet, och det sista kostar ingenting eftersom det är designat för att misslyckas.

Steg 1: Bygg basramen med GPT Image 2

Demon är en nattpasserad radiovert, vald av en anledning: en tight närbild på en mun är den enda inramningen där du faktiskt kan bedöma läppsynk. En vid bild låter modellen fuska.

Två saker i denna prompt är icke förhandlingsbara. Munnen måste vara lätt öppen mitt i ett ord, så den första bildrutan redan läses som tal, och det får inte finnas någon text någonstans i bildrutan, så dynamiska undertexter senare inte kämpar med inbakad text.

plaintext
1Photoreal cinematic still, 16:9, night-shift radio studio, tight chest-up framing on a
2man in his late thirties leaning into a vintage silver condenser microphone on a boom arm,
3foam windscreen inches from his lips, headphones half-off one ear. Warm tungsten desk lamp
4from camera-left carves his cheekbone; a red neon ON AIR sign burns out of focus behind his
5shoulder and bleeds crimson onto the mixing desk faders in the lower foreground. Rain streaks
6the studio window on the right, city lights smeared into bokeh. Thin cigarette smoke drifts
7through the lamp beam. Mouth slightly open mid-word, eyes down toward a paper script. Shot on
835mm, shallow depth of field, fine film grain, deep shadows, no text anywhere in the frame.
9

Inställningar på openai/gpt-image-2/text-to-image: kvalitet hög, storlek 16:9 vid 2048x1152, en bild. $0,009 på modellistan är ett token-nivågolv, inte vad du betalar. Vid denna storlek och kvalitet anger Kör-knappen $0,1745 per dragning, vilket du kan läsa i skärmdumpen nedan.

AI image generator interface showing a prompt and its generated output

GPT Image 2 på Atlas Cloud med radiobåsprompten inskriven, kvalitet hög och 16:9 2048x1152 valt, och den färdiga basramen renderad i OUTPUT-panelen_GPT Image 2 på Atlas Cloud: exakt prompten ovan, kvalitet hög, 16:9 vid 2048x1152, och en andra dragning av samma ram i OUTPUT._

Steg 2: Skapa sex-sekunders röstreferensen

Detta är steget folk gör fel, så läs resonemanget före prompten.

Referensljudet måste säga en annan mening än den du vill ha i videon. Det är en klangfärgsankare, inget annat. Replikerna kommer från prompten. MiniMaxs eget referens-till-video-exempel gör denna uppdelning explicit: det märker ett klipp som källspåret att delvis återanvända för musik, och ett andra klipp enbart som "röstklangfärgsreferensen", med den nya dialogen skriven inline i prompten. Om din referens säger samma ord som du bad om, bjuder du in modellen att kopiera spåret istället för att överföra rösten.

plaintext
1You're listening to Night Line, ninety-one point four, and it is coming up on
2three in the morning.
3

Inställningar på minimax/speech-2.6-hd: vilken lugn låg manlig röst som helst fungerar, och jag valde Magnetic-voiced Male (English_magnetic_voiced_man). Ställ speed till 0,95 så att tagningen landar inom 2 till 15 sekunders fönstret med marginal, lämna vol vid 1,0, och behåll mp3-utmatningen. Modellen kostar $0,08 per 1 000 tecken, ner från $0,10, en rabatt på 20% som gäller från och med augusti 2026. Min replik kom tillbaka på 6,19 sekunder och debiterade $0,00792.

Voice generator interface with text input and audio waveform output

MiniMax Speech 2.6 HD på Atlas Cloud med referensrepliken inskriven i textfältet och den renderade ljudvågformen i OUTPUT-panelen

MiniMax Speech 2.6 HD på Atlas Cloud: en replik in, en kort mp3 ut, med 20%-rabatten som visas på Kör-knappen. Skärmdumpen togs på standardrösten Expressive Narrator, så byt röstväljaren till Magnetic-voiced Male och sänk Speed till 0,95 innan du kör.

Steg 3: Kör MiniMax H3-läppsynk och ljud med referensljudet

Nu läggs båda filerna i refers tillsammans: stillbilden från Steg 1 och mp3-filen från Steg 2. Detta är tagning B.

Prompten använder den sektionerade struktur som H3 tränades på. subject_definitions namnger vem och vad referenserna är, detailed_description bär dialogen inuti <d>[English] ...</d>-taggar, och de två ljudsektionerna beskriver mixen. Om sektionsnamnen är nya för dig, täcker MiniMax H3-promptguiden hela strukturen. Endast tre fält spelar roll för ljudarbete, och de är alla här.

plaintext
1subject_definitions:
2<Subject 1> is the man at the radio microphone in <Picture 1>, late thirties, headphones
3half-off one ear, red ON AIR neon behind his shoulder.
4<Picture 1> is the opening frame of the target video.
5<Audio 2> is the voice timbre reference for <Subject 1>: a calm, low, magnetic male
6broadcast voice. Reference the timbre only; do not reuse its words.
7
8summary:
9[image reference + audio timbre reference] A single continuous 10-second close-up. <Subject 1>
10delivers two lines straight into the microphone in the voice timbre of <Audio 2>, while the
11camera pushes in slowly. The mouth movement, the breath before each line, and the room tone
12are generated together.
13
14detailed_description:
15The shot opens exactly on <Picture 1>. Warm tungsten from camera-left, red neon bleeding onto
16the mixing desk in the foreground, rain on the window behind. <Subject 1> takes a short breath,
17tilts a few degrees toward the windscreen, and speaks, <d>[English] It's three in the morning,
18and I know exactly who's still awake.</d> As he speaks, his jaw and lips move naturally with
19every syllable; the plosives on "three" and "morning" are visible. He glances down at the script,
20then back up past the lens, and continues, <d>[English] So let's keep this between us.</d>
21Exactly as his voice stops, his lips settle closed and he exhales through his nose. Throughout,
22the camera executes one slow, deliberate push-in; the neon flickers once, faintly, around second
23seven. No on-screen text.
24
25overall_soundscape:
26Close, dry, booth-treated voice with a touch of proximity effect from the microphone. Under it:
27a low electrical hum from the desk, rain steady against the glass, one distant car passing on
28the wet street, the soft creak of the chair as he leans in, and a single audible breath before
29each line.
30
31non_diegetic_music:
32A sparse, slow late-night jazz double bass, very quiet, well under the voice, entering around
33second two and never rising above the dialogue.
34

Inställningar på minimax/h3/reference-to-video: upplösning 2K, varaktighet 10, bildförhållande 16:9, och refers som innehåller båda filerna. Ordningen i arrayen spelar ingen roll, bara att minst en av dem är en bild eller en video. Varaktighetsreglaget standard är 8, så flytta det, och byt bildförhållande från adaptive om du vill ha den ram du bad om.

Fyra parameterfällor, varav tre har kostat mig pengar. Nyckeln är ratio, inte aspect_ratio, och att få det fel returnerar en 400. Skicka alltid duration explicit, eftersom schemats standard säger 8 men en förfrågan utan den kom tillbaka som en 5-sekunders fil. På denna slutpunkt, att skicka image tillsammans med refers slutförs, debiteras fullt, och tappar tyst en av dem. Och om du skickar ljudet som en base64-data-URL, märk den data:audio/mp3, inte data:audio/mpeg. Mitt första försök dog på just det:

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed
2

Den där är åtminstone gratis, vilket leder oss till det användbara sättet att lära sig gränserna.

AI video generator interface showing text prompt input and video output

MiniMax H3 reference-to-video-lekplatsen på Atlas Cloud, med mp3-filen i plats 1 och basramen i plats 2 av Referensmaterial, upplösning 2K, och det färdiga klippet som spelas i OUTPUT-panelen

MiniMax H3 reference-to-video på Atlas Cloud: Referensmaterial visar 2/9 med mp3-filen i plats ett och stillbilden i plats två, upplösning 2K, färdigt klipp till höger. Denna inspelning kördes på lekplatsens standard 8 sekunder, vilket är varför Kör-knappen säger $1,12; mina två tagningar ovan kördes på 10 sekunder för $1,40 var.

Steg 4: Kör MiniMax H3-läppsynk- och ljudkontrolltagningen

Ändra en indata och varje omnämnande av den. Ta bort mp3-filen från refers så att endast bilden finns kvar, radera <Audio 2>-definitionen, stryk frasen "in the voice timbre of <Audio 2>" från sammanfattningen, och ändra taggen till [image reference]. Inget annat flyttas, och inställningarna förblir identiska: 2K, 10 sekunder, 16:9.

Det är vad som gör det till en kontroll istället för ett andra försök. Modellen har nu ingen klangfärgsankare, så den uppfinner en röst från den skriftliga beskrivningen och läppsynkroniserar till rösten den just hittade på. Båda tagningarna kom tillbaka på 10,13 sekunder och debiterade $1,40 var, till centen.

WnfqR2I-a-8

Ljud på. Tagning A för sig själv: samma ram, samma repliker, inget referensljud. Rösten här är modellens påhitt, och munnen följer den fortfarande.

Två tagningar, en variabel. Det är det billigaste experimentet i hela denna artikel och det enda som berättar vad ljudplatsen faktiskt gör.

Steg 5: Bryt MiniMax H3-läppsynk och ljud med avsikt

Det sista steget är gratis, och det är värt att göra en gång så att du känner igen felet klockan 02.00.

Lägg mp3-filen i refers och inget annat. Ingen bild, ingen video, bara ljud. Skicka sedan.

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "A man at a radio microphone speaks two lines into the windscreen.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'
12

Här är delen värd att veta, eftersom den inte är vad schemat antyder. Anropet returnerar HTTP 200 med ett normalt uppgifts-id och "status": "processing", så en naiv klient tror att det fungerade. Tjugotre millisekunder senare är uppgiften död:

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}
7

Inget price-fält dök någonsin upp på den förutsägelsen, så det kostade ingenting. Den praktiska läxan handlar om din kod, inte din plånbok: en 200 på inskickning är inte en framgång. Polla id:t, och kontrollera status innan du antar att du har ett klipp.

Fyra fler sätt att trycka på MiniMax H3-läppsynk och ljud

Tvåtagningstestet är det minsta användbara experimentet. Här är var samma plats går härnäst.

En tagning, flera språk. Behåll ramen, behåll blockeringen, ändra språktaggen inuti <d>...</d> och kör igen. Munnen följer det nya språket istället för det gamla, eftersom munnen och rösten kommer från samma framåtpassning. Modellkortet listar stabilt dialogstöd för 11 språk: arabiska, kinesiska, engelska, franska, tyska, italienska, japanska, koreanska, portugisiska, ryska och spanska, med fler som stöds i varierande grad. Dessa två klipp är samma trailer med två olika röstspår, och MiniMax skar också en fransk version och en berättarröstfri version från samma uppsättning.

hj7ZId3KOKk

Ljud på. Den engelska berättarröstversionen: en astronautnärbild på en dammorange planet, berättarröst och musik som kommer med bilden. Trailervideo är samma tre promptfält med ett annat ljudlandskap.

Hv62FGyBNPM

Ljud på. Den japanska versionen, bildruta för bildruta samma trailer. Inget omdubbades och ingen separat VO-session ägde rum.

Sång, med en hook du redan äger. Det är här gratis inmatningsljud slutar vara en fotnot. Släpp en befintlig hook eller instrumental i refers på 15 sekunder eller mindre, beskriv prestationen, och karaktären framför till den. Du betalar inte för musiken du tar med.

zui3Zw_UWnY

Ljud på. Ett band klippt i retro camcorder-look, backstage till framträdande, med spåret och bilden som anländer tillsammans. Det är den formen de flesta musikvideoverk faktiskt vill ha.

Två personer som pratar är svårare än en. En ensam talare i närbild är det enkla fallet, vilket är precis varför denna artikel använde det. För dialog mellan två karaktärer, märk dem explicit som MiniMaxs eget exempel gör, med <Subject 1> (S1) och <Subject 2> (S2) kopplat till varje <d>-rad, och förvänta dig att göra om när modellen får ordningen eller attribueringen fel. Budgetera två körningar per tvåhandare.

Atmosfär utan ett enda ord. overall_soundscape är ett fält för sig självt, och det fungerar utan någon dialog alls. Regn på glas, stolsknarr, kylskåpsbrum, själva rummet. Det gör samma slutpunkt till ett legitimt ASMR- och atmosfärverktyg, och det är den enda användningen där munnen aldrig spelar roll.

En ärlig begränsning från mina egna två tagningar: samma-passningsgenerering innebär att munnen och rösten överensstämmer, och det innebär inte att varje fysisk detalj i ramen överensstämmer med ljudet. Långa repliker som kläms in i en kort varaktighet, vag prestationsvägledning och scener med flera talare försämrar alla resultatet. Titta på ditt klipp innan du skickar det, på samma sätt som du skulle titta på en tagning från en mänsklig skådespelare.

Vad MiniMax H3-läppsynk och ljud faktiskt kostade mig

Varje siffra nedan är en verklig avgift på ett verkligt konto, hämtad i efterhand. price-fältet på en förutsägelse fylls i sent, så att polla tills completed returnerar ofta ingenting. Hämta id:t igen för att få siffran.

StegModellVad som kördesDebiterat
1openai/gpt-image-2/text-to-image1 basram, kvalitet hög, 2048x1152$0,1745 (angivet på Kör-knappen)
2minimax/speech-2.6-hd99 tecken, 6,19s referensröst$0,01
3minimax/h3/reference-to-videoTagning B, 10s vid 2K, bild + ljud i refers$1,40
4minimax/h3/reference-to-videoTagning A, 10s vid 2K, endast bild$1,40
5minimax/h3/reference-to-videoendast ljud-förfrågan, misslyckades 23ms in$0,00
Hela experimentet, båda tagningarnacirka $2,98

Två redovisningsanteckningar, eftersom ärlighet är billigare än en fotnot. Den dåliga audio/mpeg-data-URL:en i Steg 3 kostade också ingenting, eftersom den 400:ade vid inskickning. Avvisningar är gratis, men en välformulerad förfrågan med trasig indata är inte det, så en referens-URL som tyst 404:ar kommer fortfarande att debitera dig fullt. Och lekplatsinspelningen i Steg 3-skärmdumpen är en tredje H3-körning på panelens standard 8 sekunder, vilket debiterade $1,12 utöver tabellen. Den körningen finns för denna artikel, inte för experimentet.

Den gamla kedjan, prissatt i tabellen längre upp, var cirka $3,49 för en 10-sekunders tagning plus en kväll med manuell justering. Detta var två kompletta 10-sekunders tagningar med ljud, ett kontrollerat A/B, och två medvetet trasiga förfrågningar, för mindre.

Det sagt, H3 är fel verktyg för flera jobb som folk kommer att försöka ge den, och alternativen är billigare.

Vad du egentligen vill haRätt modellPrisVarför
Ett porträtt plus en befintlig ljudfil, till ett talande huvudbytedance/avatar-omni-human-v1.5$0,12/sÄndamålsbyggd ljud-till-video, och utmatningslängden följer ditt ljud
Ett färdigt klipp vars mun måste tala ett nytt språksync/lipsync-v3$0,22/sH3 modifierar inte din befintliga rendering, och lappning är exakt denna modells jobb
Den billigaste möjliga munfixen på ett talande huvudveed/lipsync$0,013/sUngefär tio gånger billigare, och den rör bara munnen, inte prestationen
En hel regisserad tagning, med klangfärg, atmosfär och musik tillsammansminimax/h3/reference-to-video$0,14/sBild och ljud kommer från en passning, så prestationen är designad snarare än reparerad

Om du väljer mellan H3 och dess närmaste konkurrent på karaktärsarbete snarare än på ljud, är Seedance 2.5-jämförelsen bättre läsning. Och om du undrar om de öppna vikterna gör detta gratis, gör de det inte snabbt: 2K kommer fortfarande från API-sidan, och communityrapporter placerar en 10-sekunders 480p lokal rendering på minuter snarare än sekunder på konsumentkort.

En ärlig notering om röster, låtar och rättigheter

Gratis att ladda upp är inte samma sak som gratis att använda. En låt du inte skrev och en röst som inte är din är två separata tillstånd, och inget av dem beviljas av ett API som inte tar betalt för uppladdningen. Använd dina egna inspelningar, licenserad musik, eller en syntetisk röst som du själv genererat, vilket är exakt vad Steg 2 gör.

Separat har communityvikterna territoriella begränsningar som för närvarande inte täcker EU, Storbritannien, Sydkorea eller USA, med en formell licenskanal öppen istället. Det är en längre historia, och den berättas i MiniMax H3 öppna vikter-guiden.

MiniMax H3-läppsynk och ljud: Vanliga frågor

Genererar MiniMax H3-läppsynk och ljud verkligen ljud i samma passning, eller läggs det på i efterhand?

Samma passning. Texten går genom H3-Encodern, bilder genom H3-Encodern plus H3-VisualVAE, och ljud genom en fristående H3-AudioVAE. H3-Omni-Transformatorn förutsäger gemensamt video- och ljudlatenterna, som sedan avkodas separat till bild och 32 kHz stereo-ljud. Inget läggs på i efterhand, vilket är varför munnen, andetaget och rumsljudet tillhör samma tagning.

Kan jag mata in min egen låt eller röst i MiniMax H3-läppsynk och ljud, och kostar det extra?

Ja, och nej. MiniMax betala-som-du-går-tabell listar H3-ljudinmatning som Gratis. Asymmetrin att hålla koll på är video: inmatningsvideo debiteras efter dess varaktighet med utmatningshastigheten, $0,13 per sekund vid 2K, så 15 sekunder referensvideo kostar cirka $1,95 medan 15 sekunder referensljud kostar $0.

Varför avvisar MiniMax H3-läppsynk och ljud en förfrågan som bara har ljud?

För att ljud är den enda referenstypen som inte kan vara ensam. Den måste åtföljas av minst en bild eller video. Resten av gränserna, från H3-Base-Ref2VA-specifikationen: upp till 9 bilder, upp till 3 videor och upp till 3 ljudklipp, varje video- eller ljudklipp mellan 2 och 15 sekunder, 15 sekunder totalt per typ, och maximalt 12 filer över alla typer i en förfrågan.

Kommer MiniMax H3-läppsynk och ljud att hålla för ett helt klipp, eller bara den första raden?

För en ensam talare med utrymme att andas, håller det över hela klippet snarare än att landa en rad och sedan driva. Tre saker bryter det: att klämma in ett långt manus i en kort varaktighet, vag eller saknad prestationsvägledning, och scener med flera talare där modellen måste bestämma vem som talar när. Ge varje rad en etiketterad talare och tillräckligt med sekunder för att säga den.

Behöver MiniMax H3-läppsynk och ljud en ny dubbning för ett annat språk?

Nej. Ändra språktaggen i dialogmarkeringen, från <d>[English] ...</d> till <d>[Swedish] ...</d>, och kör samma prompt igen. Munnen genereras med den nya rösten, så den matchar det nya språket istället för det gamla. Modellkortet listar stabilt dialogstöd för 11 språk.

Är det billigare att köra MiniMax H3-läppsynk och ljud lokalt?

Billigare per klipp, dyrt på alla andra sätt. Vikterna är öppna, men communityrapporter om lokala körningar på 16 GB konsumentkort mäter en 10-sekunders 480p-generation i minuter, självhostad rendering med en 768 kortsida, och 2K kommer fortfarande från API-sidans regenereringssteg. Lägg till de territoriella begränsningarna i communitylicensen och API:et förblir den pragmatiska vägen för färdigt arbete.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller