Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

J'ai réalisé un clip vidéo MiniMax H3 à partir d'un hook de 32 secondes pour $4.80. La piste audio m'a surpris.

J'ai alimenté MiniMax H3 avec un hook de 32 secondes en tant qu'audio de référence gratuit, j'ai obtenu quatre plans calés sur le beat en retour, et j'ai monté une véritable vidéo musicale MiniMax H3 pour 4,80 $. Invites et factures incluses.

Un monteur vidéo travaillant sur une console avec plusieurs écrans de surveillance vidéo

Une suite de montage tardive, six écrans montrant six plans différents de la même chanteuse aux cheveux argentés. Six plans, un artiste, une chanson. Généré avec openai/gpt-image-2/text-to-image.

Les utilisateurs de Suno génèrent environ 7 millions de chansons par jour, soit environ un catalogue Spotify complet toutes les deux semaines (TechCrunch, février 2026). Presque aucune d'entre elles n'aura jamais d'image associée. Pas parce que l'image est impossible, mais parce que la voie traditionnelle passe par quatre outils : générer des images fixes, les animer, exécuter une passe de synchronisation labiale séparée, puis tout corriger dans un montage. Chaque étape fait perdre le visage, la garde-robe ou le rythme.

J'ai donc sauté les étapes. J'ai placé une tranche de 8 secondes d'un refrain directement dans l'emplacement de référence d'un modèle vidéo et j'ai appuyé sur Lancer. Cela ne m'a rien coûté pour l'audio.

Ensuite, j'ai démonté le fichier mp4 obtenu pour répondre à la seule question à laquelle personne sur Internet ne répond honnêtement : le son qui sort du modèle est-il ma chanson, ou quelque chose qu'il a inventé et qui lui ressemble ? Je l'ai mesuré. La réponse n'est pas celle que j'attendais, et elle change la façon dont vous devez découper la chose.

Points clés à retenir

  • L'audio de référence est gratuit. MiniMax H3 facture uniquement les secondes de sortie. Mes quatre tranches de référence de 8 secondes ont ajouté 0,00 $ à la facture. La vidéo de référence est la plus chère.
  • 15 secondes est un plafond par génération, pas par projet. Découpez la chanson, tournez une tranche par plan, concaténez. Mon montage de 32 secondes est constitué de quatre générations.
  • Écrivez le refrain à 120 BPM. Une mesure dure exactement 2,000 secondes, donc les valeurs duration en secondes entières de H3 tombent sur les temps de mesure sans aucun ajustement manuel. 8 s = 4 mesures.
  • L'audio de sortie est votre piste, aligné sur l'échantillon. J'ai mesuré une corrélation de forme d'onde de 0,892 à décalage nul entre ma tranche d'entrée et le mix stéréo fourni par H3. Il n'est pas régénéré. Vous voulez toujours poser le master sur le montage final, pour une raison différente (ci-dessous).
  • Dépense réelle totale : 7,53 $ sur neuf générations, y compris les échecs. Les quatre plans qui ont constitué le montage final, plus la chanson et l'image de base, ont coûté 4,80 $.

Le clip vidéo MiniMax H3 que j'ai monté à partir d'un seul refrain de 32 secondes

Son activé. Il s'agit de quatre générations distinctes, concaténées sans transitions, avec le master original de 32 secondes posé par-dessus.

TfrOvWHf4ys

« MIRA », 32 secondes, 2560x1440, 24 ips. Quatre générations minimax/h3/reference-to-video de 8 secondes chacune, 1,12 $ par plan. La chanson a été fournie en audio de référence et a coûté 0,00 $.

Quatre générations, quatre univers d'éclairage totalement différents, un seul visage. Rien n'a été retouché entre elles.

Quatre vues d'une femme aux cheveux argentés portant un collier rouge lumineux

Quatre images des quatre plans montrant la même chanteuse sur un toit au néon, une autoroute désertique, un studio blanc et un réservoir d'eau noire. Une image extraite de chaque clip livré. Mêmes cheveux, même haut en mesh, même collier LED rouge à travers la pluie, le soleil bas, le flat high-key et sous l'eau.


Pourquoi la plupart des tentatives de clip vidéo MiniMax H3 échouent à la seizième seconde

Trois modes d'échec, tous évitables.

Un : considérer 15 secondes comme la limite du projet. H3 plafonne une seule génération à 15 secondes. Les gens lisent cela, concluent « pas de clips vidéo » et abandonnent. Mais un clip vidéo n'a jamais été un seul plan. Un vrai clip coupe toutes les 4 à 8 secondes de toute façon. La limite vous oblige seulement à faire ce qu'un monteur aurait fait de toute façon.

Deux : décrire le rythme avec des mots. « Entraînant, énergique, dansant au rythme » ne donne rien au modèle à quoi se verrouiller. Il invente un tempo, et vos points de coupe tombent à contretemps pour toujours. Lui donner l'audio réel supprime les suppositions.

Trois : laisser la garde-robe dériver. Chaque plan a besoin de la même image de référence et du même libellé de garde-robe, textuellement. Passer de « haut en mesh noir » à « chemise en mesh foncé » entre les plans et vous obtenez une personne différente.

Voici ce que les deux voies vous coûtent réellement :

 Chaîne traditionnelle à quatre outilsAppel de référence H3 unique
Outils par planModèle d'image, modèle vidéo, outil de labialisation, NLEUn point de terminaison, puis un NLE à la fin
Étapes manuelles par plan4 transferts, 3 exportations de fichiers1 soumission
Ce qui maintient le personnageRéinvitation manuelle et chanceUne image de référence réutilisée textuellement
Image et sonRendu séparément, alignés ensuiteGénérés dans la même passe, stéréo 32 kHz
Coût par plan de 8 secondesQuatre compteurs séparés1,12 $ en 2K, 0,80 $ en 768P

Pour être juste envers l'ancienne voie : ce n'est pas un fantasme. Le créateur japonais Arata Fukoe a remporté un bronze au Project Odyssey avec un clip vidéo entièrement IA, et Queen et Linkin Park ont tous deux publié des clips officiels assistés par IA. Ces chaînes passaient simplement par quatre ou cinq outils, ce qui est exactement ce qu'un artiste indépendant avec une seule chanson n'a pas le temps de faire.

Ce que l'audio de référence apporte réellement à un clip vidéo MiniMax H3

C'est la partie qu'il vaut la peine de comprendre avant de dépenser quoi que ce soit.

H3 génère l'image et le son en une seule passe plutôt que de doubler l'audio sur des images finies. Lorsque vous lui fournissez une piste de référence, la piste n'est pas une note d'ambiance. J'ai comparé ma tranche d'entrée au flux audio à l'intérieur du mp4 livré, au niveau de la forme d'onde, sur un downmix mono 8 kHz :

  • Corrélation d'enveloppe : 0,956 à décalage nul
  • Corrélation de forme d'onde brute sur une fenêtre de 2 secondes : 0,892 à décalage d'échantillon nul

Ce n'est pas un modèle qui reproduit une chanson similaire. C'est votre fichier, aligné sur l'échantillon, avec l'ambiance demandée par l'invite superposée par-dessus et un passage de réencodage AAC. En comparaison, la même mesure sur une prise de contrôle générée sans audio de référence est revenue à 0,26, ce qui correspond au bruit de fond.

Deux formes d'onde audio presque identiques montrant l'entrée bleue et la sortie rouge

Forme d'onde de la tranche d'entrée ci-dessus, audio fourni par H3 ci-dessous, aligné à décalage nul. En haut : le mp3 de 8 secondes que j'ai téléchargé. En bas : le flux audio à l'intérieur du mp4 renvoyé par H3. Mêmes pics, mêmes positions, aucun décalage.

Les limites d'entrée sont strictes et appliquées au moment de la soumission, pas silencieusement :

Entrée de référenceLimiteFacturé
Imagesjusqu'à 9gratuit sur les points de terminaison H3 d'Atlas Cloud
Vidéosjusqu'à 3, chacune de 2 à 15 sfacturé au taux de sortie
Audiojusqu'à 3, chacun de 2 à 15 s, 15 s au total sur tous les clips0,00 $
Audio seulrejeté, nécessite au moins une image ou une vidéon/a

J'ai testé intentionnellement le plafond audio total en envoyant trois tranches de 8 secondes dans un seul appel. Il a échoué en 5,8 secondes avec invalid params, total audio duration 24138 ms exceeds 15000 ms et n'a pas été facturé. Bonne nouvelle : H3 ne supprime pas silencieusement le fichier supplémentaire et ne vous facture pas quand même.

Un autre piège que j'ai rencontré avant cela. Si vous passez l'audio sous forme de data URL en base64, le type MIME détermine l'extension que l'API déduit. data:audio/mpeg est rejeté avec audio format ".mpeg" not allowed. data:audio/mp3 passe. Quatre soumissions sont mortes là-dessus avant que je ne le remarque, toutes gratuites.


Le workflow du clip vidéo MiniMax H3, et ce que coûte chaque seconde

Tout ce qui suit passe par une clé API sur Atlas Cloud, où j'ai exécuté et facturé le tout. Trois modèles, un onglet de navigateur.

ÉtapeModèleCe qu'il faitPrix que j'ai réellement payé
Écrire le refrainminimax/music-2.6Chanson complète à partir d'une invite de style et de paroles, mp3 jusqu'à ~5 min0,15 $ par chanson, forfait
Verrouiller l'artisteopenai/gpt-image-2/text-to-imageUne image de base que chaque plan hérite0,1745 $ en qualité high, 2048x1152
Tourner chaque planminimax/h3/reference-to-videoImage + audio en entrée, clip verrouillé au rythme avec son stéréo en sortie0,14 $/s en 2K, 0,10 $/s en 768P. Audio d'entrée 0,00 $

Deux notes sur ce tableau, car les chiffres listés mentent dans les deux sens. GPT Image 2 affiche un plancher de 0,009 $ dans le catalogue ; c'est le niveau de token le plus bas, et un rendu high réel de 2048x1152 facture 0,1745 $. L'entrée du catalogue de H3 affiche 0,10 $, ce qui est uniquement le niveau 768P ; mes travaux 2K de 8 secondes ont chacun facturé exactement 1,12 $, soit 0,14 $ par seconde.

Si vous voulez un verrouillage de la première image au lieu de références de sujet, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) prend les mêmes tarifs, et [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) couvre les plans purement basés sur des invites.

La correction qui vaut la peine : une version antérieure de ce plan supposait que vous deviez apporter votre propre chanson car il n'y avait pas de générateur de chanson entière sur la plateforme. Il y en a un maintenant. minimax/music-2.6 écrit la piste, donc toute la chaîne, chanson incluse, fonctionne en un seul endroit.


Comment faire un clip vidéo MiniMax H3, étape par étape

Étape 1 : Écrire un refrain à 120 BPM et le découper en tranches par plan

Demandez explicitement 120 BPM. À 120 BPM, une mesure dure exactement 2,000 secondes, donc l'énumération duration en secondes entières de H3 tombe sur les temps de mesure gratuitement : 4 s = 2 mesures, 6 s = 3 mesures, 8 s = 4 mesures, 10 s = 5 mesures. vos coupes tombent sur le temps fort sans que vous ayez à toucher un seul marqueur.

Modèle : minimax/music-2.6. Paramètres : format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.

Invite de style :

plaintext
1Synth-pop à exactement 120 BPM, kick straight four-on-the-floor, nappes analogiques
2bright avec sidechain, voix lead féminine claire placée en avant dans le mix,
3chœur stéréo large, pas de rap, voyelles ouvertes soutenues, cinématique et
4légèrement mélancolique, master prêt pour la radio

Paroles :

plaintext
1[Refrain]
2Tiens bon, tiens la lumière
3Je n'ai plus de nuit
4Dis mon nom sous la pluie
5Et je brûlerai à nouveau

Il a renvoyé une piste de 70 secondes en 75 secondes pour 0,15 $. J'ai ensuite vérifié le tempo au lieu de lui faire confiance, en exécutant une autocorrélation de nouveauté d'attaque sur le fichier. Le décalage le plus fort est revenu à exactement 0,500 s, ce qui correspond à 120 BPM, et la grille de beats commence à 0,24 s dans le fichier décodé plutôt qu'à zéro. Ce décalage est important : coupez à partir de 0,24 et chaque tranche commence sur un temps fort.

plaintext
1# master de 32 secondes, commençant sur le temps fort à 0,24s
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# quatre tranches de 8 secondes, une par plan, chacune de 4 mesures et bien en dessous du plafond de 15s
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

Si vous avez déjà votre propre piste, sautez complètement cette étape. C'est le cas normal, et c'est le moins cher.

Étape 2 : Verrouiller l'artiste avec une image de base unique de GPT Image 2

Chaque plan fait référence à ce seul fichier. Tout ce qui est faux ici est faux quatre fois, alors dépensez les 0,17 $ et regardez-le correctement.

Modèle : openai/gpt-image-2/text-to-image. Paramètres : quality high, size 2048x1152 (16:9).

plaintext
1Plan cinématique de clip vidéo, portrait taille haute. Une chanteuse synth-pop
2féminine est-asiatique de 25 ans avec des cheveux courts argent-blanc et une frange
3droite, un haut en mesh noir mat, un fin collier LED rouge brillant contre sa
4clavicule, et une seule boucle d'oreille en argent. Elle se tient sur un toit
5trempé par la pluie la nuit, tenant un micro chromé vintage près de sa bouche.
6Derrière elle, des enseignes au néon magenta et cyan floues, une fine pluie
7capturée dans un contre-jour dur, de la vapeur s'élevant d'une bouche d'aération.
8Tourné en anamorphique 35 mm, faible profondeur de champ, étalonnage
9teal-and-magenta, grain de film visible. Son visage est net et uniformément éclairé
10par une key douce venant de la gauche de la caméra. Pas de texte dans le cadre.

Femme aux cheveux argentés tenant un micro vintage dans une ville de néon pluvieuse

L'image de base générée : chanteuse aux cheveux argentés avec un micro chromé sur un toit de néon trempé par la pluie. L'image de base que chaque plan ultérieur hérite. Générée avec openai/gpt-image-2/text-to-image, qualité high, 2048x1152, facturé 0,1745 $.

Interface de générateur d'images IA montrant les paramètres d'entrée et la sortie générée

GPT Image 2 exécutant cette invite exacte dans le playground Atlas Cloud avec l'image finie dans le panneau de sortie

La même invite dans le playground : Taille 16:9 à 2048x1152, Qualité high, et le bouton Run indiquant 0,1745 $, qui est ce que l'API m'a réellement facturé. Les 0,009 $ du catalogue correspondent au niveau de token le plus bas, pas à celui-ci. Même invite, seed différente, donc ce rendu n'est pas le fichier exact ci-dessus.

Les mots de la garde-robe dans cette invite (cheveux courts argent-blanc, haut en mesh noir mat, collier LED rouge, boucle d'oreille en argent) sont réutilisés textuellement dans chaque invite ci-dessous. Cette répétition est tout le mécanisme de cohérence. Ne le paraphrasez pas.

Étape 3 : Lancer le premier plan du clip vidéo MiniMax H3 avec l'audio de référence gratuit

Modèle : minimax/h3/reference-to-video. Paramètres : refers = l'image de base plus slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.

Définissez ratio explicitement. La valeur par défaut du playground est adaptive, et le point de terminaison est beaucoup plus heureux lorsque vous nommez la forme que vous souhaitez.

plaintext
1Plan de clip vidéo. La femme de l'image de référence chante la piste de référence
2directement dans l'objectif sur le toit de néon mouillé, tenant le micro chromé
3près de sa bouche. Elle attaque la première ligne fort sur le temps fort, les yeux
4verrouillés sur la caméra, puis incline la tête en arrière sur la note soutenue.
5Lent push-in de la taille au plan serré sur les huit secondes, micro-dérive
6portée, traînées de pluie traversant le contre-jour dur. Les formes de sa bouche
7suivent exactement les voyelles chantées de l'audio de référence, elle chante,
8elle ne parle pas. Cheveux courts argent-blanc identiques, haut en mesh noir mat
9et collier LED rouge lumineux identiques à l'image de référence. Paysage sonore :
10la piste de référence en stéréo, plus une faible pluie et un bourdonnement de
11ville lointain dans le mix.

7sPeYEe-xII

Plan 1, son activé. 2560x1440, 8,00 s exactement, 24 ips, stéréo 32 kHz. 345 secondes de la soumission au fichier, facturé 1,12 $. Regardez l'inclinaison de la tête en arrière sur la note soutenue vers 5 s.

Interface de générateur vidéo IA montrant les paramètres d'entrée et la vidéo générée

Le playground reference-to-video avec l'image de base et la tranche audio chargées et le clip fini dans le panneau de sortie

Références affiche 2/9 : slice-0.mp3 dans un emplacement, l'image de base dans l'autre. Résolution 2K, Durée 8, et le bouton Run indiquant 1,12 $, soit exactement 8 x 0,14 $. Notez le menu déroulant Aspect Ratio sur adaptive, qui est la valeur par défaut de la page ; mes appels API définissaient ratio sur 16:9 explicitement.

Un chiffre qui vaut la peine d'être noté : duration: 8 a livré un conteneur d'exactement 8,00 secondes. duration: 4 a livré 4,46 secondes. Si vous prévoyez de concaténer sur les temps de mesure, restez sur les durées qui reviennent exactes.

Étape 4 : Tourner trois autres mondes sans perdre le visage

Même image de base, même phrase de garde-robe, tranche audio suivante. Tout le reste change.

4a. Autoroute désertique à l'heure dorée. refers = image de base + slice-8.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Plan de clip vidéo. La même femme de l'image de référence se tient sur la ligne
2centrale d'une autoroute désertique vide à l'heure dorée, sans micro, une veste en
3jean indigo ouverte sur le même haut en mesh noir mat, le collier LED rouge
4toujours allumé. Elle articule les paroles du refrain de la piste de référence
5dans le vent tandis que la caméra recule bas au-dessus de l'asphalte. Mirages de
6chaleur au-dessus de la route, poussière soulevée, son ombre s'étirant longuement
7vers l'objectif, un flare anamorphique traversant à mi-parcours. Cheveux, visage
8et garde-robe identiques à l'image de référence. Paysage sonore : la piste de
9référence sur le vent du désert ouvert, large et aérée.

4XEki-v2vCU

Plan 2, son activé. Même visage, température de couleur opposée, et la piste de référence remixée sous le vent ouvert. 332 s, 1,12 $.

4b. Studio blanc infini. refers = image de base + slice-16.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Plan de clip vidéo. La même femme de l'image de référence dans un studio
2infinity-cove blanc pur sous une lumière flat high-key sans ombres, portant un
3imperméable en vinyle rouge brillant sur le même haut en mesh noir mat, le collier
4LED rouge visible au col. Elle danse quatre mesures sur la piste de référence, les
5cheveux argent-blanc fouettant à chaque tour. Cadre large verrouillé, puis un
6snap-zoom dur vers un plan moyen sur le deuxième temps fort. De petits carrés de
7papier blanc tombent comme des confettis pendant les deux dernières secondes.
8Visage et cheveux identiques à l'image de référence. Paysage sonore : la piste de
9référence, sèche et proche, plus le grincement des chaussures sur le sol du
10studio.

VAyqdkVpnm0

Plan 3, son activé. La lumière plate sans ombre est l'endroit le plus difficile pour cacher un changement de visage, et cela a tenu. 8,00 s, 1,12 $.

4c. Sous-marin, b-roll, sans labialisation. refers = image de base + slice-24.mp3, 2K, duration: 8, ratio: 16:9.

plaintext
1Plan de clip vidéo. La même femme de l'image de référence suspendue sous l'eau
2dans un réservoir noir, les cheveux argent-blanc flottant autour d'elle, le
3collier LED rouge brillant à travers l'eau, le haut en mesh noir flottant
4lentement. Un seul faisceau de lumière dure venant d'en haut ; des bulles montent
5devant l'objectif au ralenti. Elle ouvre les yeux sur le temps fort et tend une
6main vers la surface. Elle ne chante pas et sa bouche reste fermée. La caméra
7tourne de trente degrés autour d'elle pendant le plan. Visage identique à l'image
8de référence. Paysage sonore : la piste de référence entendue depuis la surface,
9étouffée et passe-bas, avec des transitoires de bulles.

fibdweUMRpY

Plan 4, son activé. L'instruction « elle ne chante pas et sa bouche reste fermée » a été respectée, ce qui est utile : l'audio de référence pilote le timing, pas une performance obligatoire. 329 s, 1,12 $.

Étape 5 : Lancer la prise de contrôle, avec l'emplacement audio vide

Même invite que l'étape 3, mot pour mot. Le seul changement : refers contient l'image et rien d'autre. 768P, duration: 8.

Ce seul clip explique tout le mécanisme mieux que n'importe quel paragraphe. Écoutez-le contre l'étape 3.

FAoPplGmKJc

La prise de contrôle. Invite identique, pas d'audio de référence, 1344x768, 8,00 s, 200 s, 0,80 $. H3 a écrit sa propre bande-son, et la performance est générique « quelqu'un chante » plutôt que ces paroles.

Mesuré contre mon master, l'audio du contrôle obtient un score de corrélation d'enveloppe de 0,26. Celui de l'étape 3 obtient 0,956. Cet écart est ce que vous offre l'emplacement audio gratuit.

Étape 6 : Casser la labialisation intentionnellement

Chaque modèle a un plafond de syllabes. Trouver le vôtre coûte 0,40 $.

J'ai généré une piste rap séparée en double temps (minimax/music-2.6 à nouveau, 0,15 $), j'ai découpé une tranche de 4 secondes contenant environ six syllabes par seconde, et je l'ai introduite dans la même configuration de toit à 768P, duration: 4.

plaintext
1Plan de clip vidéo. La femme de l'image de référence rappe la piste de référence
2directement dans l'objectif sur le toit de néon mouillé, tenant le micro chromé
3près de sa bouche, délivrant chaque syllabe du couplet rap en double temps.
4Plan moyen serré verrouillé, légère dérive portée, traînées de pluie dans le
5contre-jour dur. Les formes de sa bouche suivent exactement les syllabes rappées
6de l'audio de référence. Cheveux courts argent-blanc identiques, haut en mesh
7noir mat et collier LED rouge lumineux identiques à l'image de référence. Paysage
8sonore : la piste de référence en stéréo plus une faible pluie.

jiQVCjOCbKg

Le test de résistance, son activé. 1344x768, 4,46 s, 192 s, 0,40 $. La bouche reste active et en rythme, mais elle cesse de résoudre les consonnes individuelles et s'installe dans un cycle d'ouverture-fermeture répétitif. Les lignes chantées obtiennent des formes de voyelles distinctes ; pas celle-ci.

Ma lecture honnête des fichiers livrés : les voyelles chantées soutenues sont là où le travail de bouche de H3 est vraiment convaincant, et les consonnes rappées denses sont là où il se dégrade en mouvement plausible. Planifiez vos gros plans autour des lignes chantées et placez les bars rapides sur du b-roll. Il y a plus de détails sur la différence entre parole et chant dans la analyse de la labialisation et de l'audio.

Étape 7 : Assembler, couper le son, et poser le master sur le clip vidéo MiniMax H3

Quatre clips d'exactement 8,00 secondes se concatènent en exactement 32,00 secondes, soit 16 mesures à 120 BPM. Aucun recadrage.

plaintext
1# 1. supprimer l'audio de chaque clip
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. concaténer dans l'ordre des mesures (4 x 8s = 32s = 16 mesures @ 120 BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. poser le master original
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

Pourquoi prendre la peine de couper le son, si le modèle vous rend déjà votre piste ? Parce que le mix stéréo de chaque clip porte l'ambiance que l'invite de ce plan a demandée : pluie sur le plan 1, vent du désert sur le plan 2, un filtre passe-bas sous-marin sur le plan 4. Charmant par plan, incohérent à travers une coupe. Le master vous donne un mix continu au débit binaire complet sans réencodage par plan. H3 fournit la synchronisation de la performance. Votre master fournit la chanson.


Quatre variations sur la recette du clip vidéo MiniMax H3

Coupes pour publication verticale. Définissez ratio: 9:16 et vous obtenez un Spotify Canvas ou une tranche Shorts à partir de la même image de base et des mêmes tranches. Il est revenu en vrai 768x1344, donc contrairement au menu déroulant aspect dans le playground, la valeur ratio de l'API tient. Les boucles Canvas sont silencieuses par conception, donc celle-ci est livrée sous forme de GIF.

Femme aux cheveux argentés tenant un micro sur un toit de ville pluvieux

Une boucle verticale 9:16 coupée du même artiste sur le toit de néon. Même image de base, même tranche de référence, ratio: 9:16 en 768P pour 0,80 $. Un petit défaut honnête : j'ai demandé « ne chante pas » et j'ai obtenu du chant quand même. Avec une voix dans l'emplacement de référence, l'audio gagne l'argument. Si vous voulez un interprète silencieux, fournissez une tranche instrumentale.

Vidéo de référence au lieu d'une image de référence. Vous pouvez donner à H3 jusqu'à trois clips vidéo de référence pour porter le mouvement et le cadrage plutôt que de les décrire. Surveillez le compteur : la vidéo de référence facture au taux de sortie, tandis que l'audio de référence est gratuit. Cette asymétrie est le fait de tarification le plus utile sur ce point de terminaison.

Visualiseurs purement b-roll. Supprimez complètement l'interprète. Donnez une photo de produit, un objet de couverture d'album ou une texture, plus la tranche audio, et invitez uniquement le mouvement de la caméra. Pas de visage à maintenir, pas de labialisation à casser, et vous pouvez tourner le tout en 768P.

Brouillon bon marché, finition chère. 768P coûte 0,10 $/s contre 0,14 $/s pour la 2K, et les deux reviennent avec un stéréo 32 kHz identique, donc la performance que vous évaluez est la même. L'économie ne réside pas dans les gardés, mais dans les rejetés : chaque prise ratée de 8 secondes coûte 0,80 $ au lieu de 1,12 $. Tournez en 768P jusqu'à ce que la prise soit bonne, puis payez les 1,12 $ une fois. Sur un plan qui nécessite trois tentatives, cela fait 2,72 $ au lieu de 3,36 $. Plus d'informations sur la différence de niveau dans la comparaison 768P contre 2K, et sur jusqu'où un seul clip peut s'étendre dans le guide de longueur de clip.


Ce qu'un clip vidéo MiniMax H3 complet a réellement coûté

Chaque ligne ci-dessous est un chiffre réel facturé, extrait de l'historique des prédictions après achèvement, et non un prix catalogue.

PosteModèle et paramètresFacturé
Refrain, chanson de 70 sminimax/music-2.6, mp3 44.1 kHz0,15 $
Image de base de l'artisteopenai/gpt-image-2/text-to-image, high, 2048x11520,17 $
Plan 1, toit de néonminimax/h3/reference-to-video, 2K, 8 s1,12 $
Plan 2, autoroute désertiquesame, 2K, 8 s1,12 $
Plan 3, studio blancsame, 2K, 8 s1,12 $
Plan 4, sous-marinsame, 2K, 8 s1,12 $
Sous-total vidéo finie 4,80 $
Sonde de validation768P, 4 s0,40 $
Prise de contrôle, sans audio768P, 8 s0,80 $
Piste rap pour le test de résistanceminimax/music-2.60,15 $
Test de résistance labialisation768P, 4 s0,40 $
Coupe Canvas verticale768P, 8 s, 9:160,80 $
Image hero pour cet articleopenai/gpt-image-2/text-to-image, high0,17 $
Test de dépassement de limite, 24 s d'audiorejeté à la soumission0,00 $
Quatre soumissions avec mauvais MIME audiorejetées à la soumission0,00 $
Audio de référence, 4 x 8 sentrée gratuite0,00 $
Dépense totale 7,53 $

Cela fait 9,00 $ par minute finie en 2K sur les plans qui ont été retenus, avant mes erreurs. Tourné entièrement en 768P, la même minute revient à 6,61 $. Une équipe de tournage MV humaine ne cite aucun de ces deux chiffres.

Deux notes opérationnelles si vous budgétez une pièce plus longue. Les rejets à la soumission sont gratuits, donc les mauvais paramètres vous coûtent du temps et rien d'autre. Et le champ price sur une prédiction se remplit avec un délai, donc interrogez à nouveau l'ID de la requête après le téléchargement du fichier si vous voulez une facture réelle plutôt qu'un null.


À qui appartient la chanson, à qui appartient le visage : ce qu'il faut vérifier avant de publier

Court, parce que c'est important et n'a pas besoin d'un sermon.

Vous avez besoin des droits sur la piste de référence. Une entrée gratuite ne signifie pas une autorisation gratuite. Introduire un single commercial en audio de référence, puis publier ce qui en sort, est le moyen rapide d'obtenir un retrait. Votre propre enregistrement, une piste que vous avez commandée, ou quelque chose que vous avez généré est acceptable.

Ne construisez pas l'image de base à partir du visage d'un artiste réel vivant. Le mécanisme de cohérence ici est très bon pour maintenir un visage à travers les plans, ce qui est exactement pourquoi le pointer vers une personne réelle est une mauvaise idée.

Les poids ouverts et l'accès API sont deux licences différentes. MiniMax a publié les poids de H3 sur Hugging Face en août 2026, et sa licence communautaire exclut actuellement l'UE, le Royaume-Uni, la Corée du Sud et les États-Unis, avec un canal de licence formel ouvert pour ces territoires. Cette restriction s'applique à l'exécution des poids vous-même. Appeler le modèle via une API hébergée est une relation de service et ne vous place pas sous la licence des poids. Il vaut la peine de savoir dans quelle situation vous vous trouvez avant de supposer l'un ou l'autre.

Pour une vue plus large sur la position de H3 par rapport aux alternatives, il y a une comparaison Seedance 2.5 et un guide de structure d'invite. Pour le contexte sur pourquoi cela vaut la peine : sur le classement d'édition vidéo qui note les modèles avec audio, H3 est actuellement premier à 1 126 Elo, devant Gemini Omni Flash à 1 119 et Dreamina Seedance 2.0 à 1 027 (Artificial Analysis, vérifié le 10 août 2026). Ces scores évoluent avec les votes, traitez-les donc comme un instantané.


Clip vidéo MiniMax H3 : Foire aux questions

Un clip vidéo MiniMax H3 peut-il durer trois minutes complètes ?

Pas en une seule génération. Un seul appel plafonne à 15 secondes. Mais c'est un plafond par génération, pas par projet. Une vidéo de trois minutes à 8 secondes par plan représente 23 générations, environ 25,76 $ en 2K, et chacune tombe sur une ligne de mesure si votre piste est à 120 BPM. Découpez, tournez, concaténez, posez le master.

Un clip vidéo MiniMax H3 utilise-t-il ma véritable chanson, ou le modèle régénère-t-il l'audio ?

Il utilise votre véritable chanson. J'ai mesuré une corrélation de forme d'onde brute de 0,892 à décalage d'échantillon nul entre le mp3 de 8 secondes que j'ai téléchargé et le flux audio à l'intérieur du mp4 renvoyé, avec l'ambiance demandée par l'invite superposée par-dessus. Une prise de contrôle générée sans audio de référence a obtenu un score de 0,26 par rapport au même master. Vous devriez toujours poser votre master sur la concaténation finale, car chaque clip porte sa propre ambiance par plan et son propre encode AAC, qui ne survivent pas proprement à une coupe.

Ajouter une chanson dans un clip vidéo MiniMax H3 coûte-t-il plus cher ?

Non. Mes quatre tranches de référence de 8 secondes ont ajouté 0,00 $ à une facture de plan de 4,48 $. La vidéo de référence est celle à surveiller, car elle facture au taux de sortie. Les limites sont de trois clips audio, de 2 à 15 secondes chacun, 15 secondes au total, et l'audio ne peut jamais être la seule référence.

Quelle est la qualité de la labialisation de MiniMax H3 pour le chant par rapport à la parole ?

Les voyelles chantées soutenues sont son point fort : formes de bouche distinctes, tenues qui correspondent à la note, et l'inclinaison de la tête en arrière sur une longue note se lit comme une performance plutôt qu'une boucle. Les débits denses sont là où il abandonne. Mon test rap à six syllabes par seconde a gardé le rythme mais a cessé de résoudre les consonnes et est tombé dans un cycle d'ouverture-fermeture répétitif. Placez les bars rapides sur du b-roll.

Comment garder le même visage à travers chaque plan d'un clip vidéo MiniMax H3 ?

Trois choses, toutes ennuyeuses. Une image de référence réutilisée dans chaque appel, jamais régénérée. Le même libellé de garde-robe copié textuellement entre les invites, non paraphrasé. Et une clause explicite « identique à l'image de référence » dans chaque invite. Mes quatre plans ont traversé la pluie, le soleil bas, le flat high-key et le sous-marin sans dérive.

Combien coûte un clip vidéo MiniMax H3 par minute finie ?

9,00 $ par minute finie en 2K, basé sur ma facture réelle de 4,80 $ pour un montage de 32 secondes. Tourné entièrement en 768P, la même minute coûte 6,61 $, et la 768P fournit le même stéréo 32 kHz, donc la performance que vous évaluez est identique. Tournez vos rejets à 0,80 $ et payez les 1,12 $ uniquement sur la prise qui survit au montage.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles