MiniMax H3 Lip Sync and Audio: j'ai fourni 6 secondes d'une voix et supprimé 4 outils de mon pipeline.

La synchronisation labiale et l'audio de MiniMax H3 ont remplacé ma chaîne de doublage en six étapes par un seul appel API. Deux prises réelles, les limites de l'audio de référence que personne ne documente, et la véritable facture.

Homme portant un casque parlant dans un micro en lisant un script

Le cadre radio de nuit à partir duquel chaque prise de cet article commence, généré avec openai/gpt-image-2/text-to-image en qualité haute, 2048x1152

Cet unique arrêt sur image est l’entrée de tout le tutoriel ci-dessous. Généré avec openai/gpt-image-2/text-to-image, qualité haute, 2048x1152.

Pensez à la dernière fois où vous avez terminé un plan de 8 secondes et qu’il est sorti silencieux.

Vous avez exporté le clip. Vous avez ouvert un onglet TTS et tapé la réplique. Vous avez fouillé une bibliothèque sonore pour trouver la pluie et l’ambiance de la pièce. Vous avez tout glissé dans une timeline et décalé la forme d’onde à gauche et à droite jusqu’à ce que la bouche cesse de mentir. Ensuite, vous avez payé un modèle de synchronisation labiale distinct pour corriger la bouche quand même. Quatre outils, trois fichiers wav, une heure, et la performance donnait toujours l’impression d’être doublée, parce qu’elle l’était.

Cette chaîne, MiniMax H3 l’a discrètement effacée. Pas parce qu’il « a de l’audio » (beaucoup de modèles le prétendent), mais à cause d’un seul emplacement dans le corps de la requête que presque personne ne teste : vous pouvez lui fournir un morceau d’audio que vous possédez déjà, gratuitement, et récupérer la voix sur un visage.

Ci-dessous se trouve le test en deux prises qui isole cet emplacement, les vrais prix de chaque étape qu’il remplace, les limites strictes qui rejetteront votre requête, et la facture réelle.

Points clés

  • Un seul appel retourne l’image, le dialogue, l’ambiance de la pièce et le mouvement des lèvres ensemble. Le texte, les visuels et l’audio sont encodés séparément, puis un seul Omni Transformer prédit conjointement les latences vidéo et audio (Fiche modèle Hugging Face, août 2026).
  • L’audio d’entrée est gratuit. La vidéo d’entrée ne l’est pas : MiniMax facture la vidéo de référence au tarif de sortie, donc les mêmes 15 secondes de matériau coûtent 0 $ en tant que chanson et environ 1,95 $ en tant que clip vidéo.
  • Limites strictes : 3 clips audio max, chacun de 2 à 15 secondes, 15 secondes au total, et l’audio ne peut jamais voyager seul. Il doit être accompagné d’au moins une image ou une vidéo.
  • À 0,14 $ par seconde pour la 2K sur Atlas Cloud, un plan complet de 10 secondes avec son coûte 1,40 $, ce qui est moins cher que de payer un modèle de synchronisation labiale dédié à 0,22 $ par seconde pour corriger un clip que vous avez déjà rendu.

Son activé : deux prises MiniMax H3 Lip Sync and Audio, une différence de six secondes

Mettez le casque pour celle-ci. Les deux moitiés ont reçu la même image de base, les deux mêmes répliques et la même invite, mot pour mot. Une seule d’entre elles a d’abord entendu un enregistrement de six secondes d’une voix.

fXlyer__czg

Son activé, et utilisez un casque : la moitié gauche (prise A, sans audio de référence) joue dans votre oreille gauche, la moitié droite (prise B, avec une référence de 6 secondes) dans votre oreille droite. Même image, mêmes répliques, même invite. Les deux prises : minimax/h3/reference-to-video, 2K, 10 secondes, livrées en 2560x1440 à 24 ips avec une piste stéréo 32 kHz.

La prise A n’avait pour seule indication que les mots « voix masculine calme, grave, magnétique de diffusion » dans l’invite, donc elle a inventé une voix. La prise B a reçu 6,19 secondes d’une phrase complètement différente et on lui a dit de la traiter uniquement comme une ancre de timbre. Aucune des deux prises n’a été doublée après coup. Aucune n’est passée près d’un modèle de synchronisation labiale. Dans les deux, la bouche suit la voix que le modèle a produite, parce que la bouche et la voix ont été produites ensemble.

Jugez du timbre avec vos propres oreilles plutôt que de me croire sur parole. Ce que je peux affirmer comme un fait, ce sont le mécanisme, les réglages et la facture, et ceux-ci viennent ensuite.

Pourquoi MiniMax H3 Lip Sync and Audio a brisé la chaîne de doublage en six étapes de tout le monde

L’ancienne chaîne n’a jamais vraiment été un workflow. C’était une réparation.

ImGr2NgcCCY

Son activé. Un crapaud et un caméléon en 3D animés se parlant à l’intérieur d’une tente de cirque la nuit, avec l’ambiance de l’enclos sous le dialogue. Un clip de référence MiniMax pour l’audio natif H3. Les formes de bouche sur des personnages animés sont le cas le plus difficile à simuler, c’est pourquoi celle-ci vaut 20 secondes de votre attention.

Trois choses n’arrêtaient pas de casser, et elles cassaient pour des raisons structurelles plutôt que par malchance.

La timeline vivait entre vos mains. Un modèle vidéo vous donnait des images. Un modèle TTS vous donnait une forme d’onde. Rien dans l’une ou l’autre sortie ne connaissait l’autre, donc l’alignement était un jugement humain effectué à 30 images par seconde, à l’œil, à 1h du matin. Chaque nouveau rendu recommençait ce jugement.

La synchronisation labiale par patch a un plafond. Un modèle de synchronisation labiale dédié ne possède que la région de la bouche d’un métrage qui existe déjà. Il peut faire en sorte que la bouche soit en accord avec l’audio. Il ne peut pas faire en sorte que la mâchoire se tende avant une consonne dure, ou mettre une respiration avant une réplique, ou laisser les épaules retomber quand la phrase se termine, parce que ces images ont été rendues avant que quiconque sache ce que le personnage allait dire. Vous obtenez de la précision sans performance, ce qui est perçu comme étrange.

La conception sonore était un second projet. Pluie, ambiance de pièce, grincement de chaise, une ligne de basse sous le dialogue. Tout arrivait d’une source différente et devait être équilibré par rapport à une voix qui était elle-même collée après coup.

Ce que l’Audio VAE vous dit sur MiniMax H3 Lip Sync and Audio

Voici la partie qui n’est pas un langage marketing, parce que vous pouvez la voir dans un nom de fichier.

Dans H3, le texte passe par l’encodeur H3, les entrées visuelles passent à la fois par l’encodeur H3 et le H3-VisualVAE, et l’audio passe uniquement par un H3-AudioVAE autonome. Le H3-Omni-Transformer prédit ensuite conjointement les latences vidéo et audio, qui sont décodées séparément en vidéo et audio stéréo. L’AudioVAE partage un encodeur et un décodeur pour les canaux gauche et droit, traite chacun indépendamment, les recombine pour le stéréo, et compresse l’audio 32 kHz en une séquence de jetons latents à un taux temporel de 40 Hz (fiche modèle Hugging Face).

Lorsque ComfyUI a lancé un support dès le premier jour, cette architecture est apparue sous forme de deux fichiers séparés dans le dossier VAE : minimax_h3_video_vae_fp16.safetensors et minimax_h3_audio_vae_fp32.safetensors, chargés par un chargeur VAE double qui prend un chemin vidéo et un chemin audio (Blog ComfyUI, août 2026). L’audio est une modalité autour de laquelle le modèle a été construit, pas un post-traitement boulonné au bout de l’un d’eux.

Les classements sont d’accord sur l’endroit où cela se voit. Artificial Analysis a placé H3 en tête de son classement de montage vidéo avec audio à 1 130 Elo sur 5 043 échantillons de préférence en aveugle, tout en le classant dans le top trois à la fois en texte-vers-vidéo et image-vers-vidéo (Artificial Analysis, juillet 2026). L’écart entre « très belle image » et « première place » dans ce classement particulier, c’est l’audio.

Le workflow MiniMax H3 Lip Sync and Audio, tarifé par rapport à la chaîne qu’il remplace

La façon honnête de juger cela n’est pas par les sensations. C’est de tarifer l’ancienne chaîne étape par étape, en utilisant des tarifs réels par seconde pour un plan fini de 10 secondes, puis de tarifer le remplacement.

#L’ancienne chaîne, étape par étapeCe qui l’exécutaitCoût de cette étapeAvec MiniMax H3 lip sync and audio
1Rendre l’image silencieuseun modèle vidéo, ex. bytedance/seedance-2.0 à 0,112 $/s1,12 $même appel unique
2Voix des répliquesminimax/speech-2.6-hdenviron 0,02 $ pour ~250 caractèresmême appel unique
3Trouver ou créer la musiqueminimax/music-2.60,15 $ par pistemême appel unique
4Superposer l’ambiance et les effets ponctuelsbibliothèque sonore + vos mainsvotre soiréemême appel unique
5Aligner le tout sur une timelineéditeur + vos mainsvotre soiréen’existe pas
6Mixageéditeur + vos mainsvotre soiréen’existe pas
7Corriger la bouchesync/lipsync-v3 à 0,22 $/s2,20 $n’existe pas
Total4 modèles + 2 passes manuellesenviron 3,49 $ + votre soirée1 appel, 1,40 $

Relisez la ligne 7 deux fois. Corriger la bouche d’un clip que vous avez déjà rendu coûte 0,22 $ par seconde, tandis que générer l’intégralité du plan avec sa voix, son ambiance et son mouvement de bouche coûte 0,14 $ par seconde. La correction est plus chère que l’original. Cette seule comparaison est tout l’argument.

L’asymétrie dont personne ne parle : votre propre audio est gratuit, votre propre vidéo ne l’est pas.

Le tableau de tarification à l’utilisation de MiniMax liste les entrées séparément des sorties. Pour H3, l’entrée audio est gratuite. Les cinq premières images en entrée sont gratuites et chacune après coûte 0,04 $. La vidéo d’entrée est facturée à la durée du clip d’entrée au tarif de la résolution de sortie, soit 0,13 $ par seconde en 2K (docs tarifaires MiniMax, vérifié le 3 août 2026). Ainsi, les mêmes 15 secondes de matériel de référence ne coûtent rien en tant que chanson, mémo vocal ou VO fournie par le client, et environ 1,95 $ en tant que clip vidéo.

C’est la ligne qui devrait changer la façon dont vous construisez. L’audio de référence est la surface de contrôle la moins chère du modèle, et c’est celle que personne ne teste.

Entrée de référenceCombienPar clipTotalFacturation (MiniMax)
Imagejusqu’à 9n/an/a5 premières gratuites, puis 0,04 $ chacune
Vidéojusqu’à 32 à 15 s15 s maxfacturée au tarif de sortie, 0,13 $/s en 2K
Audiojusqu’à 32 à 15 s15 s maxGratuit
Tout mélange12 fichiers maxn/an/acomme ci-dessus, par type
Audio seulnon autorisé. L’audio doit être accompagné d’une entrée image ou vidéo et ne peut pas être utilisé comme seule entrée

Limites de la spéc H3-Base-Ref2VA sur la fiche modèle. Le schéma Atlas Cloud pour minimax/h3/reference-to-video dit la même chose dans ses propres mots : « Au moins une image OU une vidéo est requise (l’audio seul n’est pas autorisé). »

Deux notes de bas de page du côté du compteur Atlas, toutes deux issues de mes propres exécutions plutôt que d’une page de documentation. Atlas facture un forfait unique de 0,14 $ par seconde de sortie pour les trois endpoints H3, et une vidéo de référence que j’ai jointe n’a pas ajouté de frais supplémentaires. C’est une observation, pas une politique, donc prévoyez un budget pour la règle MiniMax et considérez le tarif forfaitaire comme un bonus. Atlas accepte également resolution: "768P" et le facture au même 0,14 $, ce qui est un écart qui mérite d’être lu dans la répartition des prix de l’API MiniMax H3 plutôt qu’ici.

Tout ce qui suit s’exécute dans un seul onglet de navigateur sur Atlas Cloud : l’image de base, la référence vocale et les deux prises H3, sur une seule clé API avec une seule boucle de vérification. Les trois endpoints H3 ne diffèrent que par la forme de leur entrée, donc refers devient image devient texte brut et rien d’autre dans votre code ne change.

MiniMax H3 Lip Sync and Audio, étape par étape

Cinq étapes. Deux d’entre elles sont une configuration bon marché, deux sont le test réel, et la dernière ne coûte rien car elle est conçue pour échouer.

Étape 1 : Construire l’image de base avec GPT Image 2

La démo est un animateur radio de nuit, choisi pour une seule raison : un gros plan serré sur une bouche est le seul cadrage où vous pouvez réellement juger la synchronisation labiale. Un plan large permet de tricher.

Deux éléments dans cette invite sont non négociables. La bouche doit être légèrement ouverte au milieu d’un mot, de sorte que la première image se lise déjà comme une parole, et il ne doit y avoir aucun texte dans l’image, afin que les sous-titres dynamiques ultérieurs ne se battent pas avec des lettres intégrées.

plaintext
1Plan cinématographique photoréaliste, 16:9, studio radio de nuit, cadrage serré poitrine sur un
2homme d’une trentaine d’années penché vers un micro à condensateur argenté vintage sur un bras
3articulé, bonnette anti-vent en mousse à quelques centimètres de ses lèvres, casque à moitié
4retiré d’une oreille. Lampe de bureau tungstène chaude venant de la gauche de la caméra sculpte
5sa pommette ; un néon rouge ON AIR brûle flou derrière son épaule et saigne du cramoisi sur les
6faders de la console de mixage au premier plan inférieur. La pluie ruisselle sur la fenêtre du
7studio à droite, lumières de la ville transformées en bokeh. Une fine fumée de cigarette flotte
8dans le faisceau de la lampe. Bouche légèrement ouverte au milieu d’un mot, yeux baissés vers
9un script papier. Tourné en 35 mm, faible profondeur de champ, grain de film fin, ombres
10profondes, aucun texte nulle part dans l’image.

Réglages sur openai/gpt-image-2/text-to-image : qualité haute, taille 16:9 à 2048x1152, une image. Les 0,009 $ sur la liste des modèles sont un seuil de palier de jetons, pas ce que vous payez. À cette taille et qualité, le bouton Run affiche 0,1745 $ par tirage, comme vous pouvez le lire dans la capture d’écran ci-dessous.

Interface de générateur d’images IA montrant une invite et sa sortie générée

GPT Image 2 sur Atlas Cloud avec l’invite du studio radio saisie, qualité haute et 16:9 2048x1152 sélectionnés, et l’image de base terminée rendue dans le panneau OUTPUT_GPT Image 2 sur Atlas Cloud : l’invite exacte ci-dessus, qualité haute, 16:9 à 2048x1152, et un second tirage de la même image dans OUTPUT._

Étape 2 : Créer la référence vocale de six secondes

C’est l’étape que les gens se trompent, alors lisez le raisonnement avant l’invite.

L’audio de référence doit dire une phrase différente de celle que vous voulez dans la vidéo. C’est une ancre de timbre, rien d’autre. Les répliques viennent de l’invite. L’exemple de référence-vers-vidéo de MiniMax rend cette division explicite : il étiquette un clip comme la piste source à réutiliser partiellement pour la musique, et un second clip uniquement comme « la référence de timbre vocal », avec le nouveau dialogue écrit en ligne dans l’invite. Si votre référence dit les mêmes mots que vous avez demandés, vous invitez le modèle à copier la piste au lieu de transférer la voix.

plaintext
1Vous écoutez Night Line, quatre-vingt-onze virgule quatre, et il est bientôt
2trois heures du matin.

Réglages sur minimax/speech-2.6-hd : n’importe quelle voix masculine calme et grave fonctionne, et j’ai choisi Voix masculine magnétique (English_magnetic_voiced_man). Réglez speed sur 0,95 pour que la prise reste dans la fenêtre de 2 à 15 secondes avec de la marge, laissez vol à 1,0, et conservez la sortie mp3. Le modèle coûte 0,08 $ pour 1 000 caractères, contre 0,10 $ auparavant, une remise de 20 % valable en août 2026. Ma réplique est revenue à 6,19 secondes et a coûté 0,00792 $.

Interface de générateur de voix avec saisie de texte et forme d’onde audio en sortie

MiniMax Speech 2.6 HD sur Atlas Cloud avec la ligne de référence saisie dans le champ de texte et la forme d’onde audio rendue dans le panneau OUTPUT

MiniMax Speech 2.6 HD sur Atlas Cloud : une ligne entrée, un petit mp3 en sortie, avec la remise de 20 % affichée sur le bouton Run. La capture d’écran a été prise avec la voix par défaut Narrateur expressif, alors passez le sélecteur de voix à Voix masculine magnétique et réduisez Speed à 0,95 avant de l’exécuter.

Étape 3 : Exécuter MiniMax H3 Lip Sync and Audio avec l’audio de référence

Maintenant, les deux fichiers vont dans refers ensemble : l’image fixe de l’étape 1 et le mp3 de l’étape 2. C’est la prise B.

L’invite utilise la structure sectionnée sur laquelle H3 a été entraîné. subject_definitions nomme qui et quoi sont les références, detailed_description transporte le dialogue à l’intérieur des balises <d>[English] ...</d>, et les deux sections audio décrivent le mix. Si les noms de sections vous sont nouveaux, le guide d’invite MiniMax H3 couvre la structure complète. Seuls trois champs comptent pour le travail audio, et ils sont tous ici.

plaintext
1subject_definitions:
2<Sujet 1> est l’homme au micro radio dans <Image 1>, fin trentaine, casque
3à moitié retiré d’une oreille, néon rouge ON AIR derrière son épaule.
4<Image 1> est l’image d’ouverture de la vidéo cible.
5<Audio 2> est la référence de timbre vocal pour <Sujet 1> : une voix
6masculine calme, grave, magnétique de diffusion. Référencez uniquement le timbre ; ne réutilisez pas ses mots.
7
8summary:
9[référence image + référence timbre audio] Un unique gros plan continu de 10 secondes. <Sujet 1>
10délivre deux répliques directement dans le micro avec le timbre vocal de <Audio 2>, tandis que la
11caméra se rapproche lentement. Le mouvement de la bouche, la respiration avant chaque réplique,
12et l’ambiance de la pièce sont générés ensemble.
13
14detailed_description:
15Le plan s’ouvre exactement sur <Image 1>. Lumière tungstène chaude venant de la gauche de la
16caméra, néon rouge saignant sur la console de mixage au premier plan, pluie sur la fenêtre
17derrière. <Sujet 1> prend une courte respiration, s’incline de quelques degrés vers la bonnette
18anti-vent, et parle, <d>[English] It's three in the morning, and I know exactly who's still
19awake.</d> En parlant, sa mâchoire et ses lèvres bougent naturellement avec chaque syllabe ; les
20plosives sur "three" et "morning" sont visibles. Il jette un coup d’œil au script, puis remonte
21le regard au-delà de l’objectif, et continue, <d>[English] So let's keep this between us.</d>
22Exactement quand sa voix s’arrête, ses lèvres se ferment et il expire par le nez. Tout au long,
23la caméra effectue un lent et délibéré zoom avant ; le néon vacille une fois, faiblement, vers
24la septième seconde. Aucun texte à l’écran.
25
26overall_soundscape:
27Voix proche, sèche, traitée en cabine avec un léger effet de proximité du micro. En dessous :
28un léger bourdonnement électrique de la console, pluie régulière contre la vitre, une voiture
29lointaine passant sur la rue mouillée, le grincement doux de la chaise lorsqu’il se penche,
30et une respiration audible avant chaque réplique.
31
32non_diegetic_music:
33Une contrebasse jazz lente et clairsemée, très douce, bien en dessous de la voix, entrant
34vers la deuxième seconde et ne montant jamais au-dessus du dialogue.

Réglages sur minimax/h3/reference-to-video : résolution 2K, durée 10, rapport d’aspect 16:9, et refers contenant les deux fichiers. L’ordre dans le tableau n’a pas d’importance, seulement qu’au moins l’un d’eux soit une image ou une vidéo. Le curseur de durée est par défaut à 8, donc déplacez-le, et passez le rapport d’aspect hors adaptive si vous voulez le cadre que vous avez demandé.

Quatre pièges de paramètres, dont trois m’ont coûté de l’argent. La clé est ratio, pas aspect_ratio, et se tromper renvoie une 400. Envoyez toujours duration explicitement, car le schéma par défaut indique 8 mais une requête sans est revenue comme un fichier de 5 secondes. Sur cet endpoint, envoyer image à côté de refers se termine, facture en entier, et en supprime silencieusement un. Et si vous passez l’audio sous forme d’URL de données base64, étiquetez-le data:audio/mp3, pas data:audio/mpeg. Ma première tentative est morte exactement sur ça :

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed

Celle-ci au moins est gratuite, ce qui nous amène à la manière utile d’apprendre les limites.

Interface de générateur vidéo IA montrant la saisie de texte et la sortie vidéo

Le playground MiniMax H3 reference-to-video sur Atlas Cloud, avec le mp3 dans l’emplacement 1 et l’image de base dans l’emplacement 2 de Reference Materials, résolution 2K, et le clip terminé jouant dans le panneau OUTPUT

MiniMax H3 reference-to-video sur Atlas Cloud : Reference Materials indique 2/9 avec le mp3 dans l’emplacement un et l’image fixe dans l’emplacement deux, résolution 2K, clip terminé à droite. Cette capture a été exécutée avec la durée par défaut de 8 secondes du playground, c’est pourquoi le bouton Run indique 1,12 $ ; mes deux prises ci-dessus ont été exécutées à 10 secondes pour 1,40 $ chacune.

Étape 4 : Exécuter la prise de contrôle MiniMax H3 Lip Sync and Audio

Changez une entrée et chaque mention de celle-ci. Supprimez le mp3 de refers pour ne laisser que l’image, supprimez la définition <Audio 2>, coupez la phrase « avec le timbre vocal de <Audio 2> » du résumé, et changez la balise du crochet en [référence image]. Rien d’autre ne bouge, et les réglages restent identiques : 2K, 10 secondes, 16:9.

C’est ce qui en fait un contrôle plutôt qu’une seconde tentative. Le modèle n’a désormais plus d’ancre de timbre, donc il invente une voix à partir de la description écrite et synchronise les lèvres sur la voix qu’il vient de créer. Les deux prises sont revenues à 10,13 secondes et ont facturé 1,40 $ chacune, au centime près.

WnfqR2I-a-8

Son activé. La prise A seule : même image, mêmes répliques, pas d’audio de référence. La voix ici est l’invention du modèle, et la bouche la suit toujours.

Deux prises, une variable. C’est l’expérience la moins chère de tout cet article et la seule qui vous dit ce que l’emplacement audio fait réellement.

Étape 5 : Casser MiniMax H3 Lip Sync and Audio intentionnellement

La dernière étape est gratuite, et cela vaut la peine de la faire une fois pour reconnaître l’échec à 2h du matin.

Mettez le mp3 dans refers et rien d’autre. Pas d’image, pas de vidéo, juste l’audio. Ensuite, soumettez.

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "A man at a radio microphone speaks two lines into the windscreen.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'

Voici la partie qui vaut la peine d’être connue, car ce n’est pas ce que le schéma laisse entendre. L’appel de soumission renvoie HTTP 200 avec un id de tâche normal et "status": "processing", donc un client naïf pense que cela a fonctionné. Vingt-trois millisecondes plus tard, la tâche est morte :

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}

Aucun champ price n’est jamais apparu sur cette prédiction, donc cela n’a rien coûté. La leçon pratique concerne votre code, pas votre portefeuille : un 200 à la soumission n’est pas un succès. Interrogez l’id, et vérifiez status avant de supposer que vous avez un clip.

Quatre autres façons de pousser MiniMax H3 Lip Sync and Audio

Le test en deux prises est la plus petite expérience utile. Voici où le même emplacement va ensuite.

Un plan, plusieurs langues. Gardez l’image, gardez le blocage, changez la balise de langue à l’intérieur de <d>...</d> et exécutez-le à nouveau. La bouche suit la nouvelle langue plutôt que l’ancienne, parce que la bouche et la voix sortent de la même passe avant. La fiche modèle liste un support de dialogue stable pour 11 langues : arabe, chinois, anglais, français, allemand, italien, japonais, coréen, portugais, russe et espagnol, avec plus de langues supportées à des degrés divers. Ces deux clips sont la même bande-annonce avec deux pistes vocales différentes, et MiniMax a également réalisé une version française et une version sans narration à partir du même montage.

hj7ZId3KOKk

Son activé. La version anglaise en voix off : un gros plan d’astronaute sur une planète couleur poussière orange, narration et musique arrivant avec l’image. Le travail de bande-annonce utilise les trois mêmes champs d’invite avec un paysage sonore différent.

Hv62FGyBNPM

Son activé. La version japonaise, image par image de la même bande-annonce. Rien n’a été redoublé et aucune session VO séparée n’a eu lieu.

Chanter, avec un refrain que vous possédez déjà. C’est là que l’audio d’entrée gratuit cesse d’être une note de bas de page. Déposez un refrain existant ou un instrumental dans refers à 15 secondes ou moins, décrivez la performance, et le personnage performe dessus. Vous ne payez pas pour la musique que vous apportez.

zui3Zw_UWnY

Son activé. Un groupe filmé dans un look caméscope rétro, en coulisses puis en performance, avec la piste et l’image arrivant ensemble. C’est la forme que la plupart des travaux de vidéoclips souhaitent réellement.

Deux personnes qui parlent est plus difficile qu’une. Un seul locuteur en gros plan est le cas facile, ce qui est exactement la raison pour laquelle cet article l’a utilisé. Pour un dialogue entre deux personnages, étiquetez-les explicitement comme le fait l’exemple de MiniMax, avec <Sujet 1> (S1) et <Sujet 2> (S2) attachés à chaque ligne <d>, et attendez-vous à relancer lorsque le modèle se trompe dans l’ordre ou l’attribution. Prévoyez deux exécutions pour un dialogue à deux.

Ambiance sans un mot prononcé. overall_soundscape est un champ autonome, et il fonctionne sans aucun dialogue. Pluie sur la vitre, grincement de chaise, ronronnement de frigo, la pièce elle-même. Cela fait du même endpoint un outil ASMR et d’ambiance légitime, et c’est le seul cas où la bouche n’a jamais d’importance.

Une limite honnête de mes deux prises : la génération en une seule passe signifie que la bouche et la voix sont d’accord, et cela ne signifie pas que chaque détail physique de l’image est d’accord avec le son. Les longues répliques entassées dans une courte durée, les indications de performance vagues et les scènes à plusieurs locuteurs dégradent toutes le résultat. Regardez votre clip avant de l’expédier, de la même manière que vous regarderiez une prise d’un acteur humain.

Ce que MiniMax H3 Lip Sync and Audio m’a réellement coûté

Chaque chiffre ci-dessous est une charge réelle sur un compte réel, récupérée après coup. Le champ price sur une prédiction se remplit tardivement, donc interroger jusqu’à completed renvoie souvent rien. Re récupérez l’id pour obtenir le nombre.

ÉtapeModèleCe qui a été exécutéFacturé
1openai/gpt-image-2/text-to-image1 image de base, qualité haute, 2048x11520,1745 $ (indiqué sur le bouton Run)
2minimax/speech-2.6-hd99 caractères, 6,19 s de voix de référence0,01 $
3minimax/h3/reference-to-videoPrise B, 10 s en 2K, image + audio dans refers1,40 $
4minimax/h3/reference-to-videoPrise A, 10 s en 2K, image uniquement1,40 $
5minimax/h3/reference-to-videorequête audio seul, échoué en 23 ms0,00 $
Expérience complète, les deux prisesenviron 2,98 $

Deux notes comptables, parce que l’honnêteté est moins chère qu’une note de bas de page. La mauvaise URL de données audio/mpeg à l’étape 3 n’a également rien coûté, car elle a renvoyé une 400 à la soumission. Les rejets sont gratuits, mais une requête bien formée avec une entrée cassée ne l’est pas, donc une URL de référence qui fait silencieusement 404 vous facturera quand même intégralement. Et la capture du playground dans la capture d’écran de l’étape 3 est une troisième exécution H3 à la durée par défaut de 8 secondes du panneau, qui a facturé 1,12 $ en plus du tableau. Cette exécution existe pour cet article, pas pour l’expérience.

L’ancienne chaîne, tarifée dans le tableau plus haut, était d’environ 3,49 $ pour un seul plan de 10 secondes plus une soirée d’alignement manuel. Cela représentait deux plans complets de 10 secondes avec son, un A/B contrôlé, et deux requêtes délibérément cassées, pour moins cher.

Cela dit, H3 est le mauvais outil pour plusieurs tâches que les gens vont essayer de lui confier, et les alternatives sont moins chères.

Ce que vous voulez réellementLe bon modèlePrixPourquoi
Un portrait plus un fichier audio existant, en tête parlantebytedance/avatar-omni-human-v1.50,12 $/sAudio-vers-vidéo dédié, et la durée de sortie suit votre audio
Un clip fini dont la bouche doit parler une nouvelle languesync/lipsync-v30,22 $/sH3 ne modifie pas votre rendu existant, et la correction est exactement le travail de ce modèle
La correction de bouche la moins chère possible sur une tête parlanteveed/lipsync0,013 $/sEnviron dix fois moins cher, et il ne touche que la bouche, pas la performance
Un plan dirigé complet, avec timbre, ambiance et musique ensembleminimax/h3/reference-to-video0,14 $/sL’image et le son viennent d’une seule passe, donc la performance est conçue plutôt que réparée

Si vous choisissez entre H3 et son rival le plus proche sur le travail de personnage plutôt que sur l’audio, la comparaison Seedance 2.5 est une meilleure lecture. Et si vous vous demandez si les poids ouverts rendent cela gratuit, ils ne le rendent pas rapide : la 2K vient toujours du côté API, et les rapports de la communauté placent un rendu local 480p de 10 secondes en minutes plutôt qu’en secondes sur des cartes grand public.

Une note honnête sur les voix, les chansons et les droits

Gratuit à télécharger n’est pas la même chose que gratuit à utiliser. Une chanson que vous n’avez pas écrite et une voix qui n’est pas la vôtre sont deux permissions distinctes, et aucune n’est accordée par une API qui ne vous facture rien pour le téléchargement. Utilisez vos propres enregistrements, de la musique sous licence ou une voix synthétique que vous avez générée vous-même, ce qui est exactement ce que fait l’étape 2.

Par ailleurs, les poids communautaires comportent des limites territoriales qui ne couvrent actuellement pas l’UE, le Royaume-Uni, la Corée du Sud ou les États-Unis, avec un canal de licence formel ouvert à la place. C’est une histoire plus longue, et elle est racontée dans le guide des poids ouverts MiniMax H3.

MiniMax H3 Lip Sync and Audio : questions fréquentes

Est-ce que MiniMax H3 lip sync and audio génère vraiment le son dans la même passe, ou est-il doublé après coup ?

Même passe. Le texte passe par l’encodeur H3, les visuels par l’encodeur H3 plus le H3-VisualVAE, et l’audio par un H3-AudioVAE autonome. Le H3-Omni-Transformer prédit conjointement les latences vidéo et audio, qui sont ensuite décodées séparément en image et en audio stéréo 32 kHz. Rien n’est superposé après coup, c’est pourquoi la bouche, la respiration et l’ambiance de la pièce appartiennent à la même prise.

Puis-je fournir ma propre chanson ou voix dans MiniMax H3 lip sync and audio, et cela coûte-t-il un supplément ?

Oui, et non. Le tableau de tarification à l’utilisation de MiniMax liste l’entrée audio H3 comme gratuite. L’asymétrie à surveiller est la vidéo : la vidéo d’entrée est facturée à sa durée au tarif de sortie, 0,13 $ par seconde en 2K, donc 15 secondes de vidéo de référence coûtent environ 1,95 $ tandis que 15 secondes d’audio de référence coûtent 0 $.

Pourquoi MiniMax H3 lip sync and audio rejette-t-il une requête qui n’a que de l’audio ?

Parce que l’audio est le seul type de référence qui ne peut pas voyager seul. Il doit être accompagné d’au moins une image ou une vidéo. Le reste des limites, issues de la spéc H3-Base-Ref2VA : jusqu’à 9 images, jusqu’à 3 vidéos et jusqu’à 3 clips audio, chaque clip vidéo ou audio entre 2 et 15 secondes, 15 secondes au total par type, et un maximum de 12 fichiers tous types confondus dans une seule requête.

MiniMax H3 lip sync and audio tiendra-t-il sur tout un clip, ou seulement la première réplique ?

Pour un seul locuteur avec de l’espace pour respirer, il tient sur tout le clip plutôt que d’atterrir sur une réplique et de dériver. Trois choses le cassent : entasser un long script dans une courte durée, des indications de performance vagues ou manquantes, et les scènes à plusieurs locuteurs où le modèle doit décider qui parle quand. Donnez à chaque réplique un locuteur étiqueté et assez de secondes pour la dire.

MiniMax H3 lip sync and audio a-t-il besoin d’un redoublage pour une autre langue ?

Non. Changez la balise de langue à l’intérieur du balisage de dialogue, de <d>[English] ...</d> à <d>[Japanese] ...</d>, et exécutez la même invite à nouveau. La bouche est générée avec la nouvelle voix, donc elle correspond à la nouvelle langue au lieu de l’ancienne. La fiche modèle liste un support de dialogue stable pour 11 langues.

Est-il moins cher d’exécuter MiniMax H3 lip sync and audio localement ?

Moins cher par clip, cher à tous les autres égards. Les poids sont ouverts, mais les rapports de la communauté sur des exécutions locales avec des cartes grand public de 16 Go mesurent une génération 480p de 10 secondes en minutes, l’auto-hébergement rend à un petit côté de 768, et la 2K vient toujours de l’étape de régénération côté API. Ajoutez les limites territoriales de la licence communautaire et l’API reste la voie pragmatique pour un travail fini.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles