
Une suite de montage tardive, six écrans montrant six plans différents de la même chanteuse aux cheveux argentés. Six plans, un artiste, une chanson. Généré avec openai/gpt-image-2/text-to-image.
Les utilisateurs de Suno génèrent environ 7 millions de chansons par jour, soit environ un catalogue Spotify complet toutes les deux semaines (TechCrunch, février 2026). Presque aucune d'entre elles n'aura jamais d'image associée. Pas parce que l'image est impossible, mais parce que la voie traditionnelle passe par quatre outils : générer des images fixes, les animer, exécuter une passe de synchronisation labiale séparée, puis tout corriger dans un montage. Chaque étape fait perdre le visage, la garde-robe ou le rythme.
J'ai donc sauté les étapes. J'ai placé une tranche de 8 secondes d'un refrain directement dans l'emplacement de référence d'un modèle vidéo et j'ai appuyé sur Lancer. Cela ne m'a rien coûté pour l'audio.
Ensuite, j'ai démonté le fichier mp4 obtenu pour répondre à la seule question à laquelle personne sur Internet ne répond honnêtement : le son qui sort du modèle est-il ma chanson, ou quelque chose qu'il a inventé et qui lui ressemble ? Je l'ai mesuré. La réponse n'est pas celle que j'attendais, et elle change la façon dont vous devez découper la chose.
Points clés à retenir
- L'audio de référence est gratuit. MiniMax H3 facture uniquement les secondes de sortie. Mes quatre tranches de référence de 8 secondes ont ajouté 0,00 $ à la facture. La vidéo de référence est la plus chère.
- 15 secondes est un plafond par génération, pas par projet. Découpez la chanson, tournez une tranche par plan, concaténez. Mon montage de 32 secondes est constitué de quatre générations.
- Écrivez le refrain à 120 BPM. Une mesure dure exactement 2,000 secondes, donc les valeurs
durationen secondes entières de H3 tombent sur les temps de mesure sans aucun ajustement manuel. 8 s = 4 mesures.- L'audio de sortie est votre piste, aligné sur l'échantillon. J'ai mesuré une corrélation de forme d'onde de 0,892 à décalage nul entre ma tranche d'entrée et le mix stéréo fourni par H3. Il n'est pas régénéré. Vous voulez toujours poser le master sur le montage final, pour une raison différente (ci-dessous).
- Dépense réelle totale : 7,53 $ sur neuf générations, y compris les échecs. Les quatre plans qui ont constitué le montage final, plus la chanson et l'image de base, ont coûté 4,80 $.
Le clip vidéo MiniMax H3 que j'ai monté à partir d'un seul refrain de 32 secondes
Son activé. Il s'agit de quatre générations distinctes, concaténées sans transitions, avec le master original de 32 secondes posé par-dessus.
TfrOvWHf4ys
« MIRA », 32 secondes, 2560x1440, 24 ips. Quatre générations minimax/h3/reference-to-video de 8 secondes chacune, 1,12 $ par plan. La chanson a été fournie en audio de référence et a coûté 0,00 $.
Quatre générations, quatre univers d'éclairage totalement différents, un seul visage. Rien n'a été retouché entre elles.

Quatre images des quatre plans montrant la même chanteuse sur un toit au néon, une autoroute désertique, un studio blanc et un réservoir d'eau noire. Une image extraite de chaque clip livré. Mêmes cheveux, même haut en mesh, même collier LED rouge à travers la pluie, le soleil bas, le flat high-key et sous l'eau.
Pourquoi la plupart des tentatives de clip vidéo MiniMax H3 échouent à la seizième seconde
Trois modes d'échec, tous évitables.
Un : considérer 15 secondes comme la limite du projet. H3 plafonne une seule génération à 15 secondes. Les gens lisent cela, concluent « pas de clips vidéo » et abandonnent. Mais un clip vidéo n'a jamais été un seul plan. Un vrai clip coupe toutes les 4 à 8 secondes de toute façon. La limite vous oblige seulement à faire ce qu'un monteur aurait fait de toute façon.
Deux : décrire le rythme avec des mots. « Entraînant, énergique, dansant au rythme » ne donne rien au modèle à quoi se verrouiller. Il invente un tempo, et vos points de coupe tombent à contretemps pour toujours. Lui donner l'audio réel supprime les suppositions.
Trois : laisser la garde-robe dériver. Chaque plan a besoin de la même image de référence et du même libellé de garde-robe, textuellement. Passer de « haut en mesh noir » à « chemise en mesh foncé » entre les plans et vous obtenez une personne différente.
Voici ce que les deux voies vous coûtent réellement :
| Chaîne traditionnelle à quatre outils | Appel de référence H3 unique | |
|---|---|---|
| Outils par plan | Modèle d'image, modèle vidéo, outil de labialisation, NLE | Un point de terminaison, puis un NLE à la fin |
| Étapes manuelles par plan | 4 transferts, 3 exportations de fichiers | 1 soumission |
| Ce qui maintient le personnage | Réinvitation manuelle et chance | Une image de référence réutilisée textuellement |
| Image et son | Rendu séparément, alignés ensuite | Générés dans la même passe, stéréo 32 kHz |
| Coût par plan de 8 secondes | Quatre compteurs séparés | 1,12 $ en 2K, 0,80 $ en 768P |
Pour être juste envers l'ancienne voie : ce n'est pas un fantasme. Le créateur japonais Arata Fukoe a remporté un bronze au Project Odyssey avec un clip vidéo entièrement IA, et Queen et Linkin Park ont tous deux publié des clips officiels assistés par IA. Ces chaînes passaient simplement par quatre ou cinq outils, ce qui est exactement ce qu'un artiste indépendant avec une seule chanson n'a pas le temps de faire.
Ce que l'audio de référence apporte réellement à un clip vidéo MiniMax H3
C'est la partie qu'il vaut la peine de comprendre avant de dépenser quoi que ce soit.
H3 génère l'image et le son en une seule passe plutôt que de doubler l'audio sur des images finies. Lorsque vous lui fournissez une piste de référence, la piste n'est pas une note d'ambiance. J'ai comparé ma tranche d'entrée au flux audio à l'intérieur du mp4 livré, au niveau de la forme d'onde, sur un downmix mono 8 kHz :
- Corrélation d'enveloppe : 0,956 à décalage nul
- Corrélation de forme d'onde brute sur une fenêtre de 2 secondes : 0,892 à décalage d'échantillon nul
Ce n'est pas un modèle qui reproduit une chanson similaire. C'est votre fichier, aligné sur l'échantillon, avec l'ambiance demandée par l'invite superposée par-dessus et un passage de réencodage AAC. En comparaison, la même mesure sur une prise de contrôle générée sans audio de référence est revenue à 0,26, ce qui correspond au bruit de fond.

Forme d'onde de la tranche d'entrée ci-dessus, audio fourni par H3 ci-dessous, aligné à décalage nul. En haut : le mp3 de 8 secondes que j'ai téléchargé. En bas : le flux audio à l'intérieur du mp4 renvoyé par H3. Mêmes pics, mêmes positions, aucun décalage.
Les limites d'entrée sont strictes et appliquées au moment de la soumission, pas silencieusement :
| Entrée de référence | Limite | Facturé |
|---|---|---|
| Images | jusqu'à 9 | gratuit sur les points de terminaison H3 d'Atlas Cloud |
| Vidéos | jusqu'à 3, chacune de 2 à 15 s | facturé au taux de sortie |
| Audio | jusqu'à 3, chacun de 2 à 15 s, 15 s au total sur tous les clips | 0,00 $ |
| Audio seul | rejeté, nécessite au moins une image ou une vidéo | n/a |
J'ai testé intentionnellement le plafond audio total en envoyant trois tranches de 8 secondes dans un seul appel. Il a échoué en 5,8 secondes avec invalid params, total audio duration 24138 ms exceeds 15000 ms et n'a pas été facturé. Bonne nouvelle : H3 ne supprime pas silencieusement le fichier supplémentaire et ne vous facture pas quand même.
Un autre piège que j'ai rencontré avant cela. Si vous passez l'audio sous forme de data URL en base64, le type MIME détermine l'extension que l'API déduit. data:audio/mpeg est rejeté avec audio format ".mpeg" not allowed. data:audio/mp3 passe. Quatre soumissions sont mortes là-dessus avant que je ne le remarque, toutes gratuites.
Le workflow du clip vidéo MiniMax H3, et ce que coûte chaque seconde
Tout ce qui suit passe par une clé API sur Atlas Cloud, où j'ai exécuté et facturé le tout. Trois modèles, un onglet de navigateur.
| Étape | Modèle | Ce qu'il fait | Prix que j'ai réellement payé |
|---|---|---|---|
| Écrire le refrain | minimax/music-2.6 | Chanson complète à partir d'une invite de style et de paroles, mp3 jusqu'à ~5 min | 0,15 $ par chanson, forfait |
| Verrouiller l'artiste | openai/gpt-image-2/text-to-image | Une image de base que chaque plan hérite | 0,1745 $ en qualité high, 2048x1152 |
| Tourner chaque plan | minimax/h3/reference-to-video | Image + audio en entrée, clip verrouillé au rythme avec son stéréo en sortie | 0,14 $/s en 2K, 0,10 $/s en 768P. Audio d'entrée 0,00 $ |
Deux notes sur ce tableau, car les chiffres listés mentent dans les deux sens. GPT Image 2 affiche un plancher de 0,009 $ dans le catalogue ; c'est le niveau de token le plus bas, et un rendu high réel de 2048x1152 facture 0,1745 $. L'entrée du catalogue de H3 affiche 0,10 $, ce qui est uniquement le niveau 768P ; mes travaux 2K de 8 secondes ont chacun facturé exactement 1,12 $, soit 0,14 $ par seconde.
Si vous voulez un verrouillage de la première image au lieu de références de sujet, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) prend les mêmes tarifs, et [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) couvre les plans purement basés sur des invites.
La correction qui vaut la peine : une version antérieure de ce plan supposait que vous deviez apporter votre propre chanson car il n'y avait pas de générateur de chanson entière sur la plateforme. Il y en a un maintenant. minimax/music-2.6 écrit la piste, donc toute la chaîne, chanson incluse, fonctionne en un seul endroit.
Comment faire un clip vidéo MiniMax H3, étape par étape
Étape 1 : Écrire un refrain à 120 BPM et le découper en tranches par plan
Demandez explicitement 120 BPM. À 120 BPM, une mesure dure exactement 2,000 secondes, donc l'énumération duration en secondes entières de H3 tombe sur les temps de mesure gratuitement : 4 s = 2 mesures, 6 s = 3 mesures, 8 s = 4 mesures, 10 s = 5 mesures. vos coupes tombent sur le temps fort sans que vous ayez à toucher un seul marqueur.
Modèle : minimax/music-2.6. Paramètres : format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.
Invite de style :
plaintext1Synth-pop à exactement 120 BPM, kick straight four-on-the-floor, nappes analogiques 2bright avec sidechain, voix lead féminine claire placée en avant dans le mix, 3chœur stéréo large, pas de rap, voyelles ouvertes soutenues, cinématique et 4légèrement mélancolique, master prêt pour la radio
Paroles :
plaintext1[Refrain] 2Tiens bon, tiens la lumière 3Je n'ai plus de nuit 4Dis mon nom sous la pluie 5Et je brûlerai à nouveau
Il a renvoyé une piste de 70 secondes en 75 secondes pour 0,15 $. J'ai ensuite vérifié le tempo au lieu de lui faire confiance, en exécutant une autocorrélation de nouveauté d'attaque sur le fichier. Le décalage le plus fort est revenu à exactement 0,500 s, ce qui correspond à 120 BPM, et la grille de beats commence à 0,24 s dans le fichier décodé plutôt qu'à zéro. Ce décalage est important : coupez à partir de 0,24 et chaque tranche commence sur un temps fort.
plaintext1# master de 32 secondes, commençant sur le temps fort à 0,24s 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# quatre tranches de 8 secondes, une par plan, chacune de 4 mesures et bien en dessous du plafond de 15s 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
Si vous avez déjà votre propre piste, sautez complètement cette étape. C'est le cas normal, et c'est le moins cher.
Étape 2 : Verrouiller l'artiste avec une image de base unique de GPT Image 2
Chaque plan fait référence à ce seul fichier. Tout ce qui est faux ici est faux quatre fois, alors dépensez les 0,17 $ et regardez-le correctement.
Modèle : openai/gpt-image-2/text-to-image. Paramètres : quality high, size 2048x1152 (16:9).
plaintext1Plan cinématique de clip vidéo, portrait taille haute. Une chanteuse synth-pop 2féminine est-asiatique de 25 ans avec des cheveux courts argent-blanc et une frange 3droite, un haut en mesh noir mat, un fin collier LED rouge brillant contre sa 4clavicule, et une seule boucle d'oreille en argent. Elle se tient sur un toit 5trempé par la pluie la nuit, tenant un micro chromé vintage près de sa bouche. 6Derrière elle, des enseignes au néon magenta et cyan floues, une fine pluie 7capturée dans un contre-jour dur, de la vapeur s'élevant d'une bouche d'aération. 8Tourné en anamorphique 35 mm, faible profondeur de champ, étalonnage 9teal-and-magenta, grain de film visible. Son visage est net et uniformément éclairé 10par une key douce venant de la gauche de la caméra. Pas de texte dans le cadre.

L'image de base générée : chanteuse aux cheveux argentés avec un micro chromé sur un toit de néon trempé par la pluie. L'image de base que chaque plan ultérieur hérite. Générée avec openai/gpt-image-2/text-to-image, qualité high, 2048x1152, facturé 0,1745 $.

GPT Image 2 exécutant cette invite exacte dans le playground Atlas Cloud avec l'image finie dans le panneau de sortie
La même invite dans le playground : Taille 16:9 à 2048x1152, Qualité high, et le bouton Run indiquant 0,1745 $, qui est ce que l'API m'a réellement facturé. Les 0,009 $ du catalogue correspondent au niveau de token le plus bas, pas à celui-ci. Même invite, seed différente, donc ce rendu n'est pas le fichier exact ci-dessus.
Les mots de la garde-robe dans cette invite (cheveux courts argent-blanc, haut en mesh noir mat, collier LED rouge, boucle d'oreille en argent) sont réutilisés textuellement dans chaque invite ci-dessous. Cette répétition est tout le mécanisme de cohérence. Ne le paraphrasez pas.
Étape 3 : Lancer le premier plan du clip vidéo MiniMax H3 avec l'audio de référence gratuit
Modèle : minimax/h3/reference-to-video. Paramètres : refers = l'image de base plus slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.
Définissez ratio explicitement. La valeur par défaut du playground est adaptive, et le point de terminaison est beaucoup plus heureux lorsque vous nommez la forme que vous souhaitez.
plaintext1Plan de clip vidéo. La femme de l'image de référence chante la piste de référence 2directement dans l'objectif sur le toit de néon mouillé, tenant le micro chromé 3près de sa bouche. Elle attaque la première ligne fort sur le temps fort, les yeux 4verrouillés sur la caméra, puis incline la tête en arrière sur la note soutenue. 5Lent push-in de la taille au plan serré sur les huit secondes, micro-dérive 6portée, traînées de pluie traversant le contre-jour dur. Les formes de sa bouche 7suivent exactement les voyelles chantées de l'audio de référence, elle chante, 8elle ne parle pas. Cheveux courts argent-blanc identiques, haut en mesh noir mat 9et collier LED rouge lumineux identiques à l'image de référence. Paysage sonore : 10la piste de référence en stéréo, plus une faible pluie et un bourdonnement de 11ville lointain dans le mix.
7sPeYEe-xII
Plan 1, son activé. 2560x1440, 8,00 s exactement, 24 ips, stéréo 32 kHz. 345 secondes de la soumission au fichier, facturé 1,12 $. Regardez l'inclinaison de la tête en arrière sur la note soutenue vers 5 s.

Le playground reference-to-video avec l'image de base et la tranche audio chargées et le clip fini dans le panneau de sortie
Références affiche 2/9 : slice-0.mp3 dans un emplacement, l'image de base dans l'autre. Résolution 2K, Durée 8, et le bouton Run indiquant 1,12 $, soit exactement 8 x 0,14 $. Notez le menu déroulant Aspect Ratio sur adaptive, qui est la valeur par défaut de la page ; mes appels API définissaient ratio sur 16:9 explicitement.
Un chiffre qui vaut la peine d'être noté : duration: 8 a livré un conteneur d'exactement 8,00 secondes. duration: 4 a livré 4,46 secondes. Si vous prévoyez de concaténer sur les temps de mesure, restez sur les durées qui reviennent exactes.
Étape 4 : Tourner trois autres mondes sans perdre le visage
Même image de base, même phrase de garde-robe, tranche audio suivante. Tout le reste change.
4a. Autoroute désertique à l'heure dorée. refers = image de base + slice-8.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Plan de clip vidéo. La même femme de l'image de référence se tient sur la ligne 2centrale d'une autoroute désertique vide à l'heure dorée, sans micro, une veste en 3jean indigo ouverte sur le même haut en mesh noir mat, le collier LED rouge 4toujours allumé. Elle articule les paroles du refrain de la piste de référence 5dans le vent tandis que la caméra recule bas au-dessus de l'asphalte. Mirages de 6chaleur au-dessus de la route, poussière soulevée, son ombre s'étirant longuement 7vers l'objectif, un flare anamorphique traversant à mi-parcours. Cheveux, visage 8et garde-robe identiques à l'image de référence. Paysage sonore : la piste de 9référence sur le vent du désert ouvert, large et aérée.
4XEki-v2vCU
Plan 2, son activé. Même visage, température de couleur opposée, et la piste de référence remixée sous le vent ouvert. 332 s, 1,12 $.
4b. Studio blanc infini. refers = image de base + slice-16.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Plan de clip vidéo. La même femme de l'image de référence dans un studio 2infinity-cove blanc pur sous une lumière flat high-key sans ombres, portant un 3imperméable en vinyle rouge brillant sur le même haut en mesh noir mat, le collier 4LED rouge visible au col. Elle danse quatre mesures sur la piste de référence, les 5cheveux argent-blanc fouettant à chaque tour. Cadre large verrouillé, puis un 6snap-zoom dur vers un plan moyen sur le deuxième temps fort. De petits carrés de 7papier blanc tombent comme des confettis pendant les deux dernières secondes. 8Visage et cheveux identiques à l'image de référence. Paysage sonore : la piste de 9référence, sèche et proche, plus le grincement des chaussures sur le sol du 10studio.
VAyqdkVpnm0
Plan 3, son activé. La lumière plate sans ombre est l'endroit le plus difficile pour cacher un changement de visage, et cela a tenu. 8,00 s, 1,12 $.
4c. Sous-marin, b-roll, sans labialisation. refers = image de base + slice-24.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Plan de clip vidéo. La même femme de l'image de référence suspendue sous l'eau 2dans un réservoir noir, les cheveux argent-blanc flottant autour d'elle, le 3collier LED rouge brillant à travers l'eau, le haut en mesh noir flottant 4lentement. Un seul faisceau de lumière dure venant d'en haut ; des bulles montent 5devant l'objectif au ralenti. Elle ouvre les yeux sur le temps fort et tend une 6main vers la surface. Elle ne chante pas et sa bouche reste fermée. La caméra 7tourne de trente degrés autour d'elle pendant le plan. Visage identique à l'image 8de référence. Paysage sonore : la piste de référence entendue depuis la surface, 9étouffée et passe-bas, avec des transitoires de bulles.
fibdweUMRpY
Plan 4, son activé. L'instruction « elle ne chante pas et sa bouche reste fermée » a été respectée, ce qui est utile : l'audio de référence pilote le timing, pas une performance obligatoire. 329 s, 1,12 $.
Étape 5 : Lancer la prise de contrôle, avec l'emplacement audio vide
Même invite que l'étape 3, mot pour mot. Le seul changement : refers contient l'image et rien d'autre. 768P, duration: 8.
Ce seul clip explique tout le mécanisme mieux que n'importe quel paragraphe. Écoutez-le contre l'étape 3.
FAoPplGmKJc
La prise de contrôle. Invite identique, pas d'audio de référence, 1344x768, 8,00 s, 200 s, 0,80 $. H3 a écrit sa propre bande-son, et la performance est générique « quelqu'un chante » plutôt que ces paroles.
Mesuré contre mon master, l'audio du contrôle obtient un score de corrélation d'enveloppe de 0,26. Celui de l'étape 3 obtient 0,956. Cet écart est ce que vous offre l'emplacement audio gratuit.
Étape 6 : Casser la labialisation intentionnellement
Chaque modèle a un plafond de syllabes. Trouver le vôtre coûte 0,40 $.
J'ai généré une piste rap séparée en double temps (minimax/music-2.6 à nouveau, 0,15 $), j'ai découpé une tranche de 4 secondes contenant environ six syllabes par seconde, et je l'ai introduite dans la même configuration de toit à 768P, duration: 4.
plaintext1Plan de clip vidéo. La femme de l'image de référence rappe la piste de référence 2directement dans l'objectif sur le toit de néon mouillé, tenant le micro chromé 3près de sa bouche, délivrant chaque syllabe du couplet rap en double temps. 4Plan moyen serré verrouillé, légère dérive portée, traînées de pluie dans le 5contre-jour dur. Les formes de sa bouche suivent exactement les syllabes rappées 6de l'audio de référence. Cheveux courts argent-blanc identiques, haut en mesh 7noir mat et collier LED rouge lumineux identiques à l'image de référence. Paysage 8sonore : la piste de référence en stéréo plus une faible pluie.
jiQVCjOCbKg
Le test de résistance, son activé. 1344x768, 4,46 s, 192 s, 0,40 $. La bouche reste active et en rythme, mais elle cesse de résoudre les consonnes individuelles et s'installe dans un cycle d'ouverture-fermeture répétitif. Les lignes chantées obtiennent des formes de voyelles distinctes ; pas celle-ci.
Ma lecture honnête des fichiers livrés : les voyelles chantées soutenues sont là où le travail de bouche de H3 est vraiment convaincant, et les consonnes rappées denses sont là où il se dégrade en mouvement plausible. Planifiez vos gros plans autour des lignes chantées et placez les bars rapides sur du b-roll. Il y a plus de détails sur la différence entre parole et chant dans la analyse de la labialisation et de l'audio.
Étape 7 : Assembler, couper le son, et poser le master sur le clip vidéo MiniMax H3
Quatre clips d'exactement 8,00 secondes se concatènent en exactement 32,00 secondes, soit 16 mesures à 120 BPM. Aucun recadrage.
plaintext1# 1. supprimer l'audio de chaque clip 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. concaténer dans l'ordre des mesures (4 x 8s = 32s = 16 mesures @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. poser le master original 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
Pourquoi prendre la peine de couper le son, si le modèle vous rend déjà votre piste ? Parce que le mix stéréo de chaque clip porte l'ambiance que l'invite de ce plan a demandée : pluie sur le plan 1, vent du désert sur le plan 2, un filtre passe-bas sous-marin sur le plan 4. Charmant par plan, incohérent à travers une coupe. Le master vous donne un mix continu au débit binaire complet sans réencodage par plan. H3 fournit la synchronisation de la performance. Votre master fournit la chanson.
Quatre variations sur la recette du clip vidéo MiniMax H3
Coupes pour publication verticale. Définissez ratio: 9:16 et vous obtenez un Spotify Canvas ou une tranche Shorts à partir de la même image de base et des mêmes tranches. Il est revenu en vrai 768x1344, donc contrairement au menu déroulant aspect dans le playground, la valeur ratio de l'API tient. Les boucles Canvas sont silencieuses par conception, donc celle-ci est livrée sous forme de GIF.

Une boucle verticale 9:16 coupée du même artiste sur le toit de néon. Même image de base, même tranche de référence, ratio: 9:16 en 768P pour 0,80 $. Un petit défaut honnête : j'ai demandé « ne chante pas » et j'ai obtenu du chant quand même. Avec une voix dans l'emplacement de référence, l'audio gagne l'argument. Si vous voulez un interprète silencieux, fournissez une tranche instrumentale.
Vidéo de référence au lieu d'une image de référence. Vous pouvez donner à H3 jusqu'à trois clips vidéo de référence pour porter le mouvement et le cadrage plutôt que de les décrire. Surveillez le compteur : la vidéo de référence facture au taux de sortie, tandis que l'audio de référence est gratuit. Cette asymétrie est le fait de tarification le plus utile sur ce point de terminaison.
Visualiseurs purement b-roll. Supprimez complètement l'interprète. Donnez une photo de produit, un objet de couverture d'album ou une texture, plus la tranche audio, et invitez uniquement le mouvement de la caméra. Pas de visage à maintenir, pas de labialisation à casser, et vous pouvez tourner le tout en 768P.
Brouillon bon marché, finition chère. 768P coûte 0,10 $/s contre 0,14 $/s pour la 2K, et les deux reviennent avec un stéréo 32 kHz identique, donc la performance que vous évaluez est la même. L'économie ne réside pas dans les gardés, mais dans les rejetés : chaque prise ratée de 8 secondes coûte 0,80 $ au lieu de 1,12 $. Tournez en 768P jusqu'à ce que la prise soit bonne, puis payez les 1,12 $ une fois. Sur un plan qui nécessite trois tentatives, cela fait 2,72 $ au lieu de 3,36 $. Plus d'informations sur la différence de niveau dans la comparaison 768P contre 2K, et sur jusqu'où un seul clip peut s'étendre dans le guide de longueur de clip.
Ce qu'un clip vidéo MiniMax H3 complet a réellement coûté
Chaque ligne ci-dessous est un chiffre réel facturé, extrait de l'historique des prédictions après achèvement, et non un prix catalogue.
| Poste | Modèle et paramètres | Facturé |
|---|---|---|
| Refrain, chanson de 70 s | minimax/music-2.6, mp3 44.1 kHz | 0,15 $ |
| Image de base de l'artiste | openai/gpt-image-2/text-to-image, high, 2048x1152 | 0,17 $ |
| Plan 1, toit de néon | minimax/h3/reference-to-video, 2K, 8 s | 1,12 $ |
| Plan 2, autoroute désertique | same, 2K, 8 s | 1,12 $ |
| Plan 3, studio blanc | same, 2K, 8 s | 1,12 $ |
| Plan 4, sous-marin | same, 2K, 8 s | 1,12 $ |
| Sous-total vidéo finie | 4,80 $ | |
| Sonde de validation | 768P, 4 s | 0,40 $ |
| Prise de contrôle, sans audio | 768P, 8 s | 0,80 $ |
| Piste rap pour le test de résistance | minimax/music-2.6 | 0,15 $ |
| Test de résistance labialisation | 768P, 4 s | 0,40 $ |
| Coupe Canvas verticale | 768P, 8 s, 9:16 | 0,80 $ |
| Image hero pour cet article | openai/gpt-image-2/text-to-image, high | 0,17 $ |
| Test de dépassement de limite, 24 s d'audio | rejeté à la soumission | 0,00 $ |
| Quatre soumissions avec mauvais MIME audio | rejetées à la soumission | 0,00 $ |
| Audio de référence, 4 x 8 s | entrée gratuite | 0,00 $ |
| Dépense totale | 7,53 $ |
Cela fait 9,00 $ par minute finie en 2K sur les plans qui ont été retenus, avant mes erreurs. Tourné entièrement en 768P, la même minute revient à 6,61 $. Une équipe de tournage MV humaine ne cite aucun de ces deux chiffres.
Deux notes opérationnelles si vous budgétez une pièce plus longue. Les rejets à la soumission sont gratuits, donc les mauvais paramètres vous coûtent du temps et rien d'autre. Et le champ price sur une prédiction se remplit avec un délai, donc interrogez à nouveau l'ID de la requête après le téléchargement du fichier si vous voulez une facture réelle plutôt qu'un null.
À qui appartient la chanson, à qui appartient le visage : ce qu'il faut vérifier avant de publier
Court, parce que c'est important et n'a pas besoin d'un sermon.
Vous avez besoin des droits sur la piste de référence. Une entrée gratuite ne signifie pas une autorisation gratuite. Introduire un single commercial en audio de référence, puis publier ce qui en sort, est le moyen rapide d'obtenir un retrait. Votre propre enregistrement, une piste que vous avez commandée, ou quelque chose que vous avez généré est acceptable.
Ne construisez pas l'image de base à partir du visage d'un artiste réel vivant. Le mécanisme de cohérence ici est très bon pour maintenir un visage à travers les plans, ce qui est exactement pourquoi le pointer vers une personne réelle est une mauvaise idée.
Les poids ouverts et l'accès API sont deux licences différentes. MiniMax a publié les poids de H3 sur Hugging Face en août 2026, et sa licence communautaire exclut actuellement l'UE, le Royaume-Uni, la Corée du Sud et les États-Unis, avec un canal de licence formel ouvert pour ces territoires. Cette restriction s'applique à l'exécution des poids vous-même. Appeler le modèle via une API hébergée est une relation de service et ne vous place pas sous la licence des poids. Il vaut la peine de savoir dans quelle situation vous vous trouvez avant de supposer l'un ou l'autre.
Pour une vue plus large sur la position de H3 par rapport aux alternatives, il y a une comparaison Seedance 2.5 et un guide de structure d'invite. Pour le contexte sur pourquoi cela vaut la peine : sur le classement d'édition vidéo qui note les modèles avec audio, H3 est actuellement premier à 1 126 Elo, devant Gemini Omni Flash à 1 119 et Dreamina Seedance 2.0 à 1 027 (Artificial Analysis, vérifié le 10 août 2026). Ces scores évoluent avec les votes, traitez-les donc comme un instantané.
Clip vidéo MiniMax H3 : Foire aux questions
Un clip vidéo MiniMax H3 peut-il durer trois minutes complètes ?
Pas en une seule génération. Un seul appel plafonne à 15 secondes. Mais c'est un plafond par génération, pas par projet. Une vidéo de trois minutes à 8 secondes par plan représente 23 générations, environ 25,76 $ en 2K, et chacune tombe sur une ligne de mesure si votre piste est à 120 BPM. Découpez, tournez, concaténez, posez le master.
Un clip vidéo MiniMax H3 utilise-t-il ma véritable chanson, ou le modèle régénère-t-il l'audio ?
Il utilise votre véritable chanson. J'ai mesuré une corrélation de forme d'onde brute de 0,892 à décalage d'échantillon nul entre le mp3 de 8 secondes que j'ai téléchargé et le flux audio à l'intérieur du mp4 renvoyé, avec l'ambiance demandée par l'invite superposée par-dessus. Une prise de contrôle générée sans audio de référence a obtenu un score de 0,26 par rapport au même master. Vous devriez toujours poser votre master sur la concaténation finale, car chaque clip porte sa propre ambiance par plan et son propre encode AAC, qui ne survivent pas proprement à une coupe.
Ajouter une chanson dans un clip vidéo MiniMax H3 coûte-t-il plus cher ?
Non. Mes quatre tranches de référence de 8 secondes ont ajouté 0,00 $ à une facture de plan de 4,48 $. La vidéo de référence est celle à surveiller, car elle facture au taux de sortie. Les limites sont de trois clips audio, de 2 à 15 secondes chacun, 15 secondes au total, et l'audio ne peut jamais être la seule référence.
Quelle est la qualité de la labialisation de MiniMax H3 pour le chant par rapport à la parole ?
Les voyelles chantées soutenues sont son point fort : formes de bouche distinctes, tenues qui correspondent à la note, et l'inclinaison de la tête en arrière sur une longue note se lit comme une performance plutôt qu'une boucle. Les débits denses sont là où il abandonne. Mon test rap à six syllabes par seconde a gardé le rythme mais a cessé de résoudre les consonnes et est tombé dans un cycle d'ouverture-fermeture répétitif. Placez les bars rapides sur du b-roll.
Comment garder le même visage à travers chaque plan d'un clip vidéo MiniMax H3 ?
Trois choses, toutes ennuyeuses. Une image de référence réutilisée dans chaque appel, jamais régénérée. Le même libellé de garde-robe copié textuellement entre les invites, non paraphrasé. Et une clause explicite « identique à l'image de référence » dans chaque invite. Mes quatre plans ont traversé la pluie, le soleil bas, le flat high-key et le sous-marin sans dérive.
Combien coûte un clip vidéo MiniMax H3 par minute finie ?
9,00 $ par minute finie en 2K, basé sur ma facture réelle de 4,80 $ pour un montage de 32 secondes. Tourné entièrement en 768P, la même minute coûte 6,61 $, et la 768P fournit le même stéréo 32 kHz, donc la performance que vous évaluez est identique. Tournez vos rejets à 0,80 $ et payez les 1,12 $ uniquement sur la prise qui survit au montage.






