Seedance 2.5 è ora live — In anteprima su Atlas Cloud

MiniMax H3 Sincronizzazione labiale e audio: gli ho inserito 6 secondi di una voce e ho eliminato 4 strumenti dalla mia pipeline

MiniMax H3 sincronizzazione labiale e audio ha sostituito la mia catena di doppiaggio in sei passaggi con una singola chiamata API. Due riprese reali, i limiti dell'audio di riferimento che nessuno documenta, e il conto reale.

Uomo con cuffie parla in un microfono mentre legge un copione

Il fotogramma radio notturno da cui parte ogni scena in questo articolo, generato con openai/gpt-image-2/text-to-image qualità alta, 2048x1152

Questo singolo fotogramma è l'input per tutto il tutorial qui sotto. Generato con openai/gpt-image-2/text-to-image, qualità alta, 2048x1152.

Pensa all'ultima volta che hai finito un'inquadratura di 8 secondi e ne è uscita muta.

Hai esportato il clip. Hai aperto una scheda TTS e digitato la battuta. Hai cercato in una libreria sonora rumore di pioggia e ambiente stanza. Hai trascinato tutto in una timeline e spostato la forma d'onda a destra e a sinistra finché la bocca non ha smesso di mentire. Poi hai pagato un modello di lip-sync separato per sistemare la bocca comunque. Quattro strumenti, tre file wav, un'ora, e la performance sembrava ancora doppiata, perché lo era.

Quella catena è ciò che MiniMax H3 ha silenziosamente eliminato. Non perché "abbia audio" (molti modelli lo sostengono), ma per un singolo slot nel corpo della richiesta che quasi nessuno testa: puoi passargli un pezzo di audio che già possiedi, gratuitamente, e riavere la voce su un volto.

Qui sotto c'è il test a due scatti che isola quello slot, i prezzi reali di ogni passo che sostituisce, i limiti netti che respingeranno la tua richiesta e il conto effettivo.

Punti chiave

  • Una singola chiamata restituisce immagine, dialogo, suono ambiente e movimento labiale insieme. Testo, visivo e audio sono codificati separatamente, poi un singolo Omni Transformer predice congiuntamente i latenti video e audio (Hugging Face model card, agosto 2026).
  • L'audio in input è gratuito. Il video in input no: MiniMax fattura il video di riferimento alla tariffa di output, quindi gli stessi 15 secondi di materiale costano $0 come canzone e circa $1,95 come clip video.
  • Limiti rigidi: massimo 3 clip audio, ciascuno da 2 a 15 secondi, 15 secondi totali, e l'audio non può mai viaggiare da solo. Deve accompagnarsi ad almeno un'immagine o un video.
  • A $0,14 al secondo per 2K su Atlas Cloud, un'inquadratura completa di 10 secondi con audio costa $1,40, che è meno di pagare un modello di lip-sync dedicato a $0,22 al secondo per rattoppare un clip già renderizzato.

Suono Attivo: Due Scatti di Lip Sync e Audio con MiniMax H3, una Differenza di Sei Secondi

Cuffie su per questo. Entrambe le metà hanno ricevuto lo stesso fotogramma base, le stesse due battute di dialogo e lo stesso prompt, parola per parola. Solo una di loro ha sentito prima una registrazione di sei secondi di una voce.

fXlyer__czg

Suono attivo, e usa le cuffie: la metà sinistra (Scatto A, nessun audio di riferimento) suona nell'orecchio sinistro, la metà destra (Scatto B, con un riferimento di 6 secondi) nel destro. Stesso fotogramma, stesse battute, stesso prompt. Entrambi gli scatti: minimax/h3/reference-to-video, 2K, 10 secondi, consegnati come 2560x1440 a 24fps con traccia stereo 32 kHz.

Lo Scatto A non aveva nulla su cui basarsi se non le parole "calm, low, magnetic male broadcast voice" nel prompt, quindi ha inventato una voce. Lo Scatto B ha ricevuto 6,19 secondi di una frase completamente diversa e gli è stato detto di trattarla solo come ancoraggio timbrico. Nessuno dei due scatti è stato doppiato dopo. Nessuno dei due si è avvicinato a un modello di lip-sync. In entrambi, la bocca segue la voce prodotta dal modello, perché bocca e voce sono state prodotte insieme.

Giudica il timbro con le tue orecchie piuttosto che prendere la mia parola. Quello che posso affermare come fatto è il meccanismo, le impostazioni e il conto, e vengono dopo.

Perché MiniMax H3 Lip Sync e Audio ha Rotto la Catena di Doppiaggio in Sei Passi di Tutti

La vecchia catena non è mai stata un vero flusso di lavoro. Era un lavoro di riparazione.

ImGr2NgcCCY

Suono attivo. Un rospo animato 3D e un camaleonte che parlano tra loro dentro una tenda da circo di notte, con l'atmosfera del recinto sotto il dialogo. Un clip di riferimento MiniMax per audio nativo H3. Le forme della bocca su personaggi animati sono il caso più difficile da falsificare, ecco perché questo vale 20 secondi della tua attenzione.

Tre cose continuavano a rompersi, e si rompevano per ragioni strutturali piuttosto che per sfortuna.

La timeline era nelle tue mani. Un modello video ti dava fotogrammi. Un modello TTS ti dava una forma d'onda. Niente in nessuno dei due output sapeva dell'altro, quindi l'allineamento era un giudizio umano fatto a 30 fotogrammi al secondo, a occhio, all'1 di notte. Ogni nuovo render ricominciava da capo quel giudizio.

Il lip-sync a patch ha un limite. Un modello di lip-sync dedicato possiede solo la regione della bocca di filmati già esistenti. Può far concordare la bocca con l'audio. Non può far tendere la mascella prima di una consonante dura, o mettere un respiro prima di una battuta, o far cadere le spalle quando la frase finisce, perché quei fotogrammi sono stati renderizzati prima che si sapesse cosa avrebbe detto il personaggio. Ottieni precisione senza performance, che viene letto come inquietante.

Il sound design era un secondo progetto. Pioggia, suono ambiente, scricchiolio di sedia, una linea di basso sotto il dialogo. Tutto arrivava da una fonte diversa e doveva essere bilanciato contro una voce che era essa stessa incollata sopra.

Cosa ti Dice l'Audio VAE su MiniMax H3 Lip Sync e Audio

Ecco la parte che non è linguaggio di marketing, perché puoi vederla in un nome file.

In H3, il testo passa attraverso l'H3-Encoder, gli input visivi attraverso sia l'H3-Encoder che l'H3-VisualVAE, e l'audio solo attraverso un H3-AudioVAE autonomo. L'H3-Omni-Transformer predice quindi congiuntamente i latenti video e audio, che vengono decodificati in video e audio stereo separatamente. L'AudioVAE condivide un encoder e un decoder tra i canali sinistro e destro, elabora ciascuno indipendentemente, li ricombina per lo stereo e comprime audio a 32 kHz in una sequenza di token latenti a una frequenza temporale di 40 Hz (Hugging Face model card).

Quando ComfyUI ha rilasciato il supporto giorno zero, quell'architettura è apparsa come due file separati nella cartella VAE: minimax_h3_video_vae_fp16.safetensors e minimax_h3_audio_vae_fp32.safetensors, caricati da un caricatore VAE duale che prende un percorso video e un percorso audio (ComfyUI blog, agosto 2026). L'audio è una modalità attorno a cui il modello è stato costruito, non un post-processo attaccato alla fine.

Le classifiche concordano su dove si vede. Artificial Analysis ha messo H3 al primo posto nella sua classifica di editing video con audio a 1.130 Elo da 5.043 campioni di preferenza cieca, mentre lo ha piazzato tra i primi tre sia in text-to-video che in image-to-video (Artificial Analysis, luglio 2026). Il divario tra "immagine molto buona" e "primo posto" in quella specifica classifica è l'audio.

Il Flusso di Lavoro di MiniMax H3 Lip Sync e Audio, Prezzato Contro la Catena che Sostituisce

Il modo onesto per giudicare questo non è le sensazioni. È prezzare la vecchia catena passo dopo passo, usando tariffe reali al secondo per un'inquadratura finita di 10 secondi, e poi prezzare la sostituzione.

#La vecchia catena, passo dopo passoCosa lo eseguivaQuanto costava quel passoCon MiniMax H3 lip sync e audio
1Renderizza l'immagine mutaun modello video, es. bytedance/seedance-2.0 a $0,112/s$1,12stessa singola chiamata
2Doppia le battuteminimax/speech-2.6-hdcirca $0,02 per ~250 caratteristessa singola chiamata
3Trova o crea la colonna sonoraminimax/music-2.6$0,15 per tracciastessa singola chiamata
4Stratifica atmosfera ed effetti sonorilibreria sonora più le tue manila tua seratastessa singola chiamata
5Allinea tutto su una timelineeditor più le tue manila tua seratanon esiste
6Missaggioeditor più le tue manila tua seratanon esiste
7Rattoppa la boccasync/lipsync-v3 a $0,22/s$2,20non esiste
Totale4 modelli più 2 passaggi manualicirca $3,49 più la tua serata1 chiamata, $1,40

Leggi la riga 7 due volte. Rattoppare la bocca di un clip già renderizzato costa $0,22 al secondo, mentre generare l'intera inquadratura con la sua voce, la sua atmosfera e il suo movimento labiale costa $0,14 al secondo. La rattoppatura è più costosa dell'originale. Quel singolo confronto è l'intera argomentazione.

L'asimmetria che nessuno menziona: il tuo audio è gratuito, il tuo video no.

La tabella dei prezzi pay-as-you-go di MiniMax elenca il materiale in input separatamente dall'output. Per H3, l'audio in input è gratuito. Le prime cinque immagini in input sono gratuite e ciascuna successiva costa $0,04. Il video in input viene fatturato in base alla durata del clip in input alla tariffa della risoluzione di output, che è $0,13 al secondo a 2K (documentazione prezzi MiniMax, verificata il 3 agosto 2026). Quindi gli stessi 15 secondi di materiale di riferimento non costano nulla come canzone, memo vocale o VO fornito dal cliente, e circa $1,95 come clip video.

Questa è la linea che dovrebbe cambiare il modo in cui costruisci. L'audio di riferimento è la superficie di controllo più economica del modello, ed è quella che nessuno sta testando.

Input di riferimentoQuantiPer clipTotaleFatturazione (MiniMax)
Immaginefino a 9n/dn/dprime 5 gratuite, poi $0,04 ciascuna
Videofino a 32 a 15smax 15sfatturato alla tariffa di output, $0,13/s a 2K
Audiofino a 32 a 15smax 15sGratuito
Qualsiasi mistomassimo 12 filen/dn/dcome sopra, per tipo
Audio da solonon consentito. L'audio deve essere accompagnato da input immagine o video e non può essere usato come unico input

Limiti dalla specifica H3-Base-Ref2VA sulla scheda del modello. Lo schema Atlas Cloud per minimax/h3/reference-to-video dice la stessa cosa con parole sue: "Almeno un'immagine O un video è richiesto (l'audio da solo non è consentito)."

Due note a piè di pagina sul lato Atlas del contatore, entrambe dalle mie esecuzioni, non da una pagina di documentazione. Atlas fattura un singolo forfait di $0,14 per secondo di output per tutti e tre gli endpoint H3, e un video di riferimento che ho allegato non ha aggiunto un addebito separato a quello. Questa è una singola osservazione, non una politica, quindi pianifica il budget secondo la regola MiniMax e tratta la tariffa fissa come un bonus. Atlas accetta anche resolution: "768P" e lo fattura allo stesso $0,14, che è una discrepanza che vale la pena approfondire nell'analisi dei prezzi dell'API MiniMax H3 piuttosto che qui.

Tutto ciò che segue viene eseguito in una scheda del browser su Atlas Cloud: il fotogramma base, il riferimento vocale ed entrambi gli scatti H3, con una chiave API e un unico ciclo di polling. I tre endpoint H3 differiscono solo nella forma del loro input, quindi refers diventa image diventa testo semplice e nient'altro nel tuo codice cambia.

MiniMax H3 Lip Sync e Audio, Passo dopo Passo

Cinque passi. Due sono configurazione economica, due sono il test vero e proprio, e l'ultimo non costa nulla perché è progettato per fallire.

Passo 1: Costruisci il Fotogramma Base con GPT Image 2

La demo è un conduttore radiofonico del turno di notte, scelto per un motivo: un primo piano stretto sulla bocca è l'unica inquadratura in cui puoi effettivamente giudicare il lip sync. Un campo largo permette a un modello di imbrogliare.

Due cose in questo prompt sono non negoziabili. La bocca deve essere leggermente aperta a metà parola, in modo che il primo fotogramma sia già letto come discorso, e non ci deve essere testo da nessuna parte nell'inquadratura, in modo che le didascalie dinamiche successive non combattano con le scritte incorporate.

plaintext
1Fotogramma cinematografico fotorealistico, 16:9, studio radiofonico turno di notte, inquadratura stretta dal petto in su su un uomo sulla trentina che si sporge verso un microfono a condensatore argentato vintage su braccio a bilanciere, parabrezza in schiuma a pochi centimetri dalle labbra, cuffie mezzo staccate da un orecchio. Luce calda da lampada da scrivania da sinistra scolpisce lo zigomo; un cartello rosso al neon ON AIR brucia fuori fuoco dietro la sua spalla e sanguina rosso sui fader del mixer in primo piano in basso. La pioggia riga la finestra dello studio a destra, luci della città sfocate in bokeh. Fumo sottile di sigaretta si diffonde attraverso il fascio di luce. Bocca leggermente aperta a metà parola, occhi bassi verso un copione di carta. Girato su 35mm, profondità di campo ridotta, grana fine della pellicola, ombre profonde, nessun testo da nessuna parte nell'inquadratura.

Impostazioni su openai/gpt-image-2/text-to-image: qualità alta, dimensione 16:9 a 2048x1152, una immagine. I $0,009 nell'elenco dei modelli sono un minimo per livello di token, non quello che paghi. A questa dimensione e qualità il pulsante Esegui quota $0,1745 per disegno, che puoi leggere nello screenshot qui sotto.

Interfaccia del generatore di immagini AI che mostra un prompt e il suo output generato

GPT Image 2 su Atlas Cloud con il prompt della cabina radio digitato, qualità alta e 16:9 2048x1152 selezionati, e il fotogramma base finito renderizzato nel pannello OUTPUT_GPT Image 2 su Atlas Cloud: il prompt esatto sopra, qualità alta, 16:9 a 2048x1152, e un secondo disegno dello stesso fotogramma in OUTPUT._

Passo 2: Crea il Riferimento Vocale di Sei Secondi

Questo è il passo che le persone sbagliano, quindi leggi il ragionamento prima del prompt.

L'audio di riferimento deve dire una frase diversa da quella che vuoi nel video. È un'ancora timbrica, nient'altro. Le battute arrivano dal prompt. L'esempio reference-to-video di MiniMax stesso rende esplicita questa suddivisione: etichetta un clip come traccia sorgente da riutilizzare parzialmente per la musica, e un secondo clip puramente come "riferimento timbrico vocale", con il nuovo dialogo scritto inline nel prompt. Se il tuo riferimento dice le stesse parole che hai chiesto, stai invitando il modello a copiare la traccia invece di trasferire la voce.

plaintext
1Stai ascoltando Night Line, novantuno punto quattro, e stanno per essere le tre del mattino.

Impostazioni su minimax/speech-2.6-hd: qualsiasi voce maschile calma e bassa funziona, e io ho scelto Voce maschile magnetica (English_magnetic_voiced_man). Imposta speed a 0.95 in modo che la ripresa rientri nella finestra da 2 a 15 secondi con margine, lascia vol a 1.0 e mantieni l'output mp3. Il modello costa $0,08 per 1.000 caratteri, in calo da $0,10, uno sconto del 20% valido da agosto 2026. La mia battuta è tornata a 6,19 secondi e ha fatturato $0,00792.

Interfaccia del generatore vocale con input di testo e forma d'onda audio in output

MiniMax Speech 2.6 HD su Atlas Cloud con la battuta di riferimento digitata nel campo di testo e la forma d'onda audio renderizzata nel pannello OUTPUT

MiniMax Speech 2.6 HD su Atlas Cloud: una battuta dentro, un breve mp3 fuori, con lo sconto del 20% che appare sul pulsante Esegui. Lo screenshot è stato catturato con la voce predefinita Narratore Espressivo, quindi passa il selettore Voce a Voce maschile magnetica e abbassa Velocità a 0,95 prima di eseguirlo.

Passo 3: Esegui MiniMax H3 Lip Sync e Audio con l'Audio di Riferimento

Ora entrambi i file vanno in refers insieme: il fotogramma del Passo 1 e l'mp3 del Passo 2. Questo è lo Scatto B.

Il prompt utilizza la struttura a sezioni su cui H3 è stato addestrato. subject_definitions nomina chi e cosa sono i riferimenti, detailed_description porta il dialogo all'interno di tag <d>[English] ...</d>, e le due sezioni audio descrivono il mix. Se i nomi delle sezioni sono nuovi per te, la guida al prompt di MiniMax H3 copre la struttura completa. Solo tre campi contano per il lavoro audio, e sono tutti qui.

plaintext
1subject_definitions:
2<Subject 1> è l'uomo al microfono radio in <Picture 1>, sulla trentina, cuffie
3mezzo staccate da un orecchio, cartello al neon rosso ON AIR dietro la sua spalla.
4<Picture 1> è il fotogramma di apertura del video target.
5<Audio 2> è il riferimento timbrico vocale per <Subject 1>: una voce maschile calma, bassa, magnetica, da broadcast. Riferimento solo al timbro; non riutilizzare le sue parole.
6
7summary:
8[riferimento immagine + riferimento timbrico audio] Un singolo primo piano continuo di 10 secondi. <Subject 1>
9pronuncia due battute direttamente nel microfono con il timbro vocale di <Audio 2>, mentre la
10telecamera si avvicina lentamente. Il movimento della bocca, il respiro prima di ogni battuta e il suono ambiente
11sono generati insieme.
12
13detailed_description:
14L'inquadratura si apre esattamente su <Picture 1>. Luce calda da sinistra, rosso al neon che sanguina sul
15mixer in primo piano, pioggia sulla finestra dietro. <Subject 1> fa un breve respiro,
16si inclina di qualche grado verso il parabrezza e parla, <d>[English] It's three in the morning,
17and I know exactly who's still awake.</d> Mentre parla, la sua mascella e le labbra si muovono naturalmente con
18ogni sillaba; le plosive su "three" e "morning" sono visibili. Abbassa lo sguardo sul copione,
19poi lo rialza oltre l'obiettivo e continua, <d>[English] So let's keep this between us.</d>
20Esattamente quando la sua voce si ferma, le labbra si chiudono e lui espira dal naso. Per tutto il tempo,
21la telecamera esegue un lento e deliberato avvicinamento; il neon tremola una volta, debolmente, intorno al settimo
22secondo. Nessun testo su schermo.
23
24overall_soundscape:
25Voce vicina, secca, trattata in cabina con un tocco di effetto di prossimità del microfono. Sotto:
26un lieve ronzio elettrico dal banco, pioggia costante contro il vetro, un'auto lontana che passa sulla
27strada bagnata, il morbido scricchiolio della sedia mentre si sporge in avanti e un singolo respiro udibile prima
28di ogni battuta.
29
30non_diegetic_music:
31Un contrabbasso jazz lento e sparso, molto piano, ben sotto la voce, che entra intorno al secondo
32due e non supera mai il dialogo.

Impostazioni su minimax/h3/reference-to-video: risoluzione 2K, durata 10, aspect ratio 16:9, e refers che contiene entrambi i file. L'ordine all'interno dell'array non conta, solo che almeno uno di essi sia un'immagine o un video. Il cursore Durata predefinito è 8, quindi spostalo, e imposta Aspect Ratio su 16:9 invece di adaptive se vuoi il fotogramma che hai richiesto.

Quattro trappole nei parametri, tre delle quali mi sono costate denaro. La chiave è ratio, non aspect_ratio, e sbagliarla restituisce un 400. Invia sempre duration esplicitamente, perché il valore predefinito dello schema dice 8 ma una richiesta senza di esso è tornata come file di 5 secondi. Su questo endpoint, inviare image insieme a refers completa, fattura per intero e scarta silenziosamente uno dei due. E se passi l'audio come data URL in base64, etichettalo data:audio/mp3, non data:audio/mpeg. Il mio primo tentativo è morto esattamente su questo:

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed

Quello almeno è gratuito, il che ci porta al modo utile per imparare i limiti.

Interfaccia del generatore video AI che mostra input di testo prompt e output video

Il playground MiniMax H3 reference-to-video su Atlas Cloud, con l'mp3 nello slot 1 e il fotogramma base nello slot 2 di Materiali di Riferimento, risoluzione 2K, e il clip finito che viene riprodotto nel pannello OUTPUT

MiniMax H3 reference-to-video su Atlas Cloud: Materiali di Riferimento mostra 2/9 con l'mp3 nello slot uno e il fotogramma nello slot due, risoluzione 2K, clip finito a destra. Questa acquisizione è stata eseguita con la durata predefinita del playground di 8 secondi, motivo per cui il pulsante Esegui dice $1,12; i miei due scatti sopra sono stati eseguiti a 10 secondi per $1,40 ciascuno.

Passo 4: Esegui lo Scatto di Controllo di MiniMax H3 Lip Sync e Audio

Cambia un input e ogni menzione di esso. Rimuovi l'mp3 da refers in modo che rimanga solo l'immagine, cancella la definizione di <Audio 2>, taglia la frase "con il timbro vocale di <Audio 2>" dal summary e cambia il tag tra parentesi in [riferimento immagine]. Nient'altro si muove e le impostazioni rimangono identiche: 2K, 10 secondi, 16:9.

Questo è ciò che lo rende un controllo invece di un secondo tentativo. Il modello ora non ha ancora timbrica, quindi inventa una voce dalla descrizione scritta e sincronizza le labbra con la voce che ha appena creato. Entrambi gli scatti sono tornati a 10,13 secondi e hanno fatturato $1,40 ciascuno, al centesimo.

WnfqR2I-a-8

Suono attivo. Scatto A da solo: stesso fotogramma, stesse battute, nessun audio di riferimento. La voce qui è l'invenzione del modello, e la bocca la segue comunque.

Due scatti, una variabile. Questo è l'esperimento più economico in tutto questo articolo e l'unico che ti dice cosa fa effettivamente lo slot audio.

Passo 5: Rompi MiniMax H3 Lip Sync e Audio Apposta

L'ultimo passo è gratuito, e vale la pena farlo una volta per riconoscere il fallimento alle 2 di notte.

Metti l'mp3 in refers e nient'altro. Nessuna immagine, nessun video, solo audio. Poi invia.

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "Un uomo a un microfono radio pronuncia due battute nel parabrezza.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'

Ecco la parte che vale la pena sapere, perché non è ciò che lo schema implica. La chiamata di invio restituisce HTTP 200 con un normale ID attività e "status": "processing", quindi un client ingenuo pensa che abbia funzionato. Ventitré millisecondi dopo l'attività è morta:

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}

Nessun campo price è mai apparso su quella previsione, quindi non è costato nulla. La lezione pratica riguarda il tuo codice, non il tuo portafoglio: un 200 sull'invio non è un successo. Esegui il polling dell'ID e controlla status prima di presumere di avere un clip.

Quattro Altri Modi per Spingere MiniMax H3 Lip Sync e Audio

Il test a due scatti è l'esperimento utile più piccolo. Ecco dove va lo stesso slot dopo.

Una scena, più lingue. Mantieni il fotogramma, mantieni la posizione, cambia il tag della lingua all'interno di <d>...</d> ed esegui di nuovo. La bocca segue la nuova lingua anziché la vecchia, perché bocca e voce escono dallo stesso passaggio in avanti. La scheda del modello elenca supporto stabile per il dialogo in 11 lingue: arabo, cinese, inglese, francese, tedesco, italiano, giapponese, coreano, portoghese, russo e spagnolo, con altre supportate a vari livelli. Questi due clip sono lo stesso trailer con due diverse tracce vocali, e MiniMax ha anche tagliato una versione francese e una versione senza narrazione dalla stessa configurazione.

hj7ZId3KOKk

Suono attivo. La versione voice-over inglese: un primo piano di un astronauta su un pianeta polveroso arancione, narrazione e colonna sonora che arrivano con l'immagine. Il lavoro di trailer sono gli stessi tre campi del prompt con un paesaggio sonoro diverso.

Hv62FGyBNPM

Suono attivo. La versione giapponese, fotogramma per fotogramma lo stesso trailer. Niente è stato ridoppiato e nessuna sessione VO separata è avvenuta.

Cantare, con un gancio che già possiedi. È qui che l'audio di input gratuito smette di essere una nota a piè di pagina. Inserisci un gancio esistente o uno strumentale in refers a 15 secondi o meno, descrivi la performance e il personaggio si esibisce su di esso. Non stai pagando per la musica che porti.

zui3Zw_UWnY

Suono attivo. Una band ripresa in stile videocamera retrò, dietro le quinte fino alla performance, con la traccia e l'immagine che arrivano insieme. Questa è la forma che la maggior parte del lavoro di video musicali vuole effettivamente.

Due persone che parlano è più difficile di una. Un singolo parlante in primo piano è il caso facile, che è esattamente il motivo per cui questo articolo lo ha utilizzato. Per il dialogo tra due personaggi, etichettali esplicitamente come fa l'esempio di MiniMax stesso, con <Subject 1> (S1) e <Subject 2> (S2) attaccati a ogni battuta <d>, e aspettati di ripetere quando il modello sbaglia l'ordine o l'attribuzione. Budget due esecuzioni per dialogo a due voci.

Atmosfera senza una parola pronunciata. overall_soundscape è un campo a sé stante e funziona senza alcun dialogo. Pioggia sul vetro, scricchiolio di sedia, ronzio di frigorifero, la stanza stessa. Questo rende lo stesso endpoint uno strumento ASMR e di atmosfera legittimo, ed è l'unico utilizzo in cui la bocca non conta mai.

Un limite onesto dalle mie due scattte: la generazione nello stesso passaggio significa che bocca e voce concordano, e non significa che ogni dettaglio fisico nell'inquadratura concordi con il suono. Battute lunghe stipate in una durata breve, indicazioni di performance vaghe e scene con più parlanti degradano il risultato. Guarda il tuo clip prima di spedirlo, nello stesso modo in cui guarderesti una ripresa di un attore umano.

Quanto mi è Costato Effettivamente MiniMax H3 Lip Sync e Audio

Ogni cifra qui sotto è un addebito reale su un account reale, estratto dopo il fatto. Il campo price su una previsione si riempie in ritardo, quindi fare polling fino a completed spesso non restituisce nulla. Recupera l'ID per ottenere il numero.

PassoModelloCosa è stato eseguitoAddebitato
1openai/gpt-image-2/text-to-image1 fotogramma base, qualità alta, 2048x1152$0,1745 (quotato sul pulsante Esegui)
2minimax/speech-2.6-hd99 caratteri, 6,19s di voce di riferimento$0,01
3minimax/h3/reference-to-videoScatto B, 10s a 2K, immagine + audio in refers$1,40
4minimax/h3/reference-to-videoScatto A, 10s a 2K, solo immagine$1,40
5minimax/h3/reference-to-videorichiesta solo audio, fallita in 23ms$0,00
Esperimento completo, entrambi gli scatticirca $2,98

Due note contabili, perché l'onestà è più economica di una nota a piè di pagina. Il data URL audio/mpeg sbagliato nel Passo 3 non è costato nulla, poiché ha dato 400 all'invio. I rifiuti sono gratuiti, ma una richiesta ben formata con un input rotto no, quindi un URL di riferimento che fa silenziosamente 404 ti verrà comunque addebitato per intero. E l'acquisizione del playground nello screenshot del Passo 3 è una terza esecuzione H3 con la durata predefinita del pannello di 8 secondi, che ha fatturato $1,12 in aggiunta alla tabella. Quell'esecuzione esiste per questo articolo, non per l'esperimento.

La vecchia catena, prezzata nella tabella più sopra, era di circa $3,49 per un'inquadratura di 10 secondi più una serata di allineamento manuale. Questo è stato due inquadrature complete di 10 secondi con audio, un A/B controllato e due richieste deliberatamente rotte, per meno.

Detto ciò, H3 è lo strumento sbagliato per diversi lavori che le persone cercheranno di affidargli, e le alternative sono più economiche.

Cosa vuoi effettivamenteIl modello giustoPrezzoPerché
Un ritratto più un file audio esistente, in una testa parlantebytedance/avatar-omni-human-v1.5$0,12/sCostruito appositamente per audio-to-video e la lunghezza dell'output segue il tuo audio
Un clip finito la cui bocca deve parlare una nuova linguasync/lipsync-v3$0,22/sH3 non modifica il tuo render esistente e la rattoppatura è esattamente il lavoro di questo modello
La correzione di bocca più economica su una testa parlanteveed/lipsync$0,013/sCirca dieci volte più economico e tocca solo la bocca, non la performance
Un'intera inquadratura diretta, con timbro, atmosfera e colonna insiememinimax/h3/reference-to-video$0,14/sImmagine e suono arrivano da un unico passaggio, quindi la performance è progettata, non riparata

Se stai scegliendo tra H3 e il suo rivale più vicino sul lavoro sui personaggi piuttosto che sull'audio, il confronto con Seedance 2.5 è una lettura migliore. E se ti stai chiedendo se i pesi aperti rendono questo gratuito, non lo rendono veloce: il 2K arriva ancora dal lato API, e i report della community mettono un render locale 480p di 10 secondi a minuti piuttosto che secondi su schede consumer.

Una Nota Onesta su Voci, Canzoni e Diritti

Gratuito da caricare non è uguale a gratuito da usare. Una canzone che non hai scritto e una voce che non è tua sono due permessi separati, e nessuno dei due è concesso da un'API che non ti addebita nulla per il caricamento. Usa le tue registrazioni, musica concessa in licenza o una voce sintetica che hai generato tu stesso, che è esattamente ciò che fa il Passo 2.

Separatamente, i pesi della community portano limiti territoriali che attualmente non coprono UE, Regno Unito, Corea del Sud o Stati Uniti, con un canale di licenza formale alternativo. Questa è una storia più lunga, ed è raccontata nella guida ai pesi aperti di MiniMax H3.

MiniMax H3 Lip Sync e Audio: Domande Frequenti

MiniMax H3 lip sync e audio genera davvero il suono nello stesso passaggio, o viene doppiato dopo?

Stesso passaggio. Il testo passa attraverso l'H3-Encoder, il visivo attraverso l'H3-Encoder più l'H3-VisualVAE, e l'audio attraverso un H3-AudioVAE autonomo. L'H3-Omni-Transformer predice congiuntamente i latenti video e audio, che vengono poi decodificati separatamente in immagine e audio stereo a 32 kHz. Niente viene stratificato dopo, motivo per cui la bocca, il respiro e il suono ambiente appartengono alla stessa ripresa.

Posso inserire la mia canzone o voce in MiniMax H3 lip sync e audio, e costa extra?

Sì e no. La tabella pay-as-you-go di MiniMax elenca l'audio in input H3 come gratuito. L'asimmetria da tenere d'occhio è il video: il video in input viene fatturato in base alla sua durata alla tariffa di output, $0,13 al secondo a 2K, quindi 15 secondi di video di riferimento costano circa $1,95 mentre 15 secondi di audio di riferimento costano $0.

Perché MiniMax H3 lip sync e audio rifiuta una richiesta che ha solo audio?

Perché l'audio è l'unico tipo di riferimento che non può viaggiare da solo. Deve essere accompagnato da almeno un'immagine o un video. Il resto dei limiti, dalla specifica H3-Base-Ref2VA: fino a 9 immagini, fino a 3 video e fino a 3 clip audio, ogni clip video o audio tra 2 e 15 secondi, 15 secondi totali per tipo, e un massimo di 12 file in totale in una richiesta.

MiniMax H3 lip sync e audio reggerà per l'intero clip, o solo per la prima battuta?

Per un singolo parlante con spazio per respirare, regge per l'intero clip piuttosto che atterrare su una battuta e poi sbandare. Tre cose lo rompono: stipare un copione lungo in una durata breve, indicazioni di performance vaghe o mancanti e scene con più parlanti in cui il modello deve decidere chi parla quando. Dai a ogni battuta un parlante etichettato e abbastanza secondi per dirla.

MiniMax H3 lip sync e audio necessita di un ridoppiaggio per un'altra lingua?

No. Cambia il tag della lingua all'interno del markup del dialogo, da <d>[English] ...</d> a <d>[Japanese] ...</d>, ed esegui lo stesso prompt di nuovo. La bocca viene generata con la nuova voce, quindi corrisponde alla nuova lingua anziché a quella vecchia. La scheda del modello elenca supporto stabile per il dialogo in 11 lingue.

È più economico eseguire MiniMax H3 lip sync e audio in locale?

Più economico per clip, costoso in ogni altro modo. I pesi sono aperti, ma i report della community di esecuzioni locali su schede consumer da 16 GB misurano una generazione 480p di 10 secondi in minuti, l'hosting autonomo renderizza a un lato corto di 768, e il 2K arriva ancora dal passo di rigenerazione lato API. Aggiungi i limiti territoriali nella licenza della community e l'API rimane il percorso pragmatico per lavori finiti.

Modelli recenti

Un'unica API per tutta l'IA multimediale.

Esplora tutti i modelli