Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

MiniMax H3 Référence à la vidéo : Un personnage, deux plans, et la règle qui vous prend discrètement votre argent

Tous les guides répètent la fiche technique 9/3/3. Celui-ci l'exécute : une scène en plan à deux à partir de références d'image, de vidéo et d'audio dans une seule référence MiniMax H3 à un appel vidéo.

Tous les articles sur ce modèle s'arrêtent à la même ligne. Neuf images, trois clips vidéo, trois clips audio, douze fichiers au total. On dirait une carte de garantie.

Alors je l'ai traitée comme telle. J'ai construit un personnage, construit un accessoire, généré une scène de nuit, réinjecté cette scène de nuit comme vidéo de référence, découpé huit secondes de jazz en piste audio de référence, et poussé les trois types de référence dans une seule requête. Ensuite, j'ai commencé à enfreindre les règles exprès pour voir lesquelles l'API défend réellement.

Quatre d'entre elles ne sont pas défendues comme on pourrait s'y attendre. L'une d'elles vous facture le plein tarif pour une vidéo que vous n'avez pas demandée, et le message d'erreur que vous espériez n'arrive jamais. C'est celle qui vaut la peine d'être lue jusqu'au bout.

Points clés

  • Trois types de référence, un seul tableau. Jusqu'à 9 images, 3 clips vidéo et 3 clips audio, 12 fichiers combinés. Ils vont tous dans le même champ refers, et type est facultatif car l'API le déduit de l'extension de fichier.
  • L'audio ne peut jamais voler seul. Une requête audio uniquement est rejetée avec une erreur nommée. Il doit accompagner au moins une image ou une vidéo.
  • La référence à la vidéo et l'image à la vidéo s'excluent mutuellement, mais rien ne vous le dit. Envoyez une image de première image avec refers et le travail se termine quand même. L'une de vos deux entrées est jetée en silence, au plein tarif. Vérifié deux fois le 12 août 2026, sur les deux endpoints.
  • Rien n'est validé lors de la soumission. Toute requête erronée de cet article a renvoyé HTTP 200 et un ID. Le vrai verdict tombe deux à trois minutes plus tard, à l'étape de génération. Les rejets y sont gratuits ; les achèvements non.
  • Les fichiers de référence supplémentaires sont gratuits. Une image de référence et dix images de référence facturées exactement le même montant pour la même durée de clip. Le prix suit les secondes de sortie, pas le nombre d'entrées.

Voici ce qui est ressorti de l'autre côté. Deux plans, un visage, deux endroits complètement différents, et le second plan a été construit à partir d'une image, d'une vidéo et d'un fichier audio en même temps.

Plan A (pluie, nuit, ruelle néon) puis Plan B (marché couvert vide le lendemain matin), montés ensemble sans rien ajouter d'autre que la jointure. Même femme, même cicatrice au-dessus du sourcil droit, même veste indigo, même serviette. Le plan B a été généré à partir de trois références simultanément : son portrait, le clip du plan A lui-même, et une tranche de jazz de huit secondes. Les deux plans sont en minimax/h3/reference-to-video en 2K, 2560x1440, 24fps, avec la piste stéréo native 32kHz. Le son mérite d'être allumé pour la seconde moitié, où elle livre sa réplique.

Pourquoi MiniMax H3 Reference to Video bat tout prompt que vous pouvez écrire

Un prompt décrit une personne. Une référence est la personne. Cette différence est la raison d'être de cet endpoint, et c'est pourquoi MiniMax H3 est actuellement en tête du classement de l'édition vidéo : Elo 1 125 sur 10 280 votes (Artificial Analysis, août 2026). Il faut être précis sur ce chiffre : le même tableau indique sa plage de classement de 1 à 2, statistiquement à égalité avec Google Gemini Omni Flash à 1 122. Première place, à l'intérieur d'un intervalle de confiance qu'il partage. L'affirmation connexe selon laquelle H3 est également dans le top trois pour le texte vers vidéo et l'image vers vidéo provient du même laboratoire (Artificial Analysis on X, août 2026).

Les classements ne coûtent pas cher. Voici le comportement réel, même prompt, trois niveaux de référence, tout le reste identique.

let's say

Trois exécutions MiniMax H3 reference to video avec le même prompt : aucune référence, une image de référence de personnage, et deux images de référence

Même prompt, mêmes paramètres 768P 4s, de gauche à droite : aucune référence du tout (texte vers vidéo), une image de référence de personnage, deux images de référence (personnage plus le bol de ramen). Le prompt dit « la femme de l'image de référence » dans les trois. Dans le panneau de gauche, cette phrase ne fait référence à personne, donc le modèle invente un inconnu. Généré avec minimax/h3/text-to-video et minimax/h3/reference-to-video.

Deux lectures honnêtes de cette bande. Le saut du panneau un au panneau deux est énorme : sans référence, « la femme de l'image de référence » est une phrase qui ne pointe vers rien, et le modèle comble silencieusement le vide avec une personne qui n'a aucun lien avec votre projet. Le saut du panneau deux au panneau trois est beaucoup plus petit, car mon prompt décrivait aussi le bol en mots, et H3 a dessiné un bol bleu marine passable avec une grue à partir du seul texte. C'est la partie utile. Une image de référence et un bon groupe nominal sont en concurrence pour le même travail, alors réservez vos emplacements de référence pour les choses que le langage ne peut pas cerner : un visage spécifique, un produit spécifique, un logo spécifique.

Le schéma derrière presque tous les échecs de cet article est le même que le panneau un. Rien ne vous avertit qu'une partie de votre requête est tombée sur rien.

Ce qu'une référence verrouille réellement, et ce qu'elle ne verrouille pas. Une image de référence épingle l'identité : structure du visage, cheveux, marques distinctives, vêtement. Elle n'épingle pas l'éclairage, et c'est la surprise la plus courante. Elle entraîne également la lumière de la photo de référence, c'est pourquoi une fiche de personnage prise dans un environnement sombre produit un personnage qui ne peut pas survivre à un changement de scène. Prenez votre référence à plat et neutre. Une vidéo de référence épingle le mouvement, l'étalonnage et le grain, pas l'identité. Un audio de référence épingle le lit audio lui-même. Si vous avez besoin du même visage lisant une réplique avec la même voix dans une série, la pile de référence fait trois travaux différents et vous devez préciser lequel est lequel. Les guides des praticiens convergent pour les nommer de manière positionnelle dans le prompt (« L'image 1 est le personnage, l'image 2 est le produit ») et cette convention mérite d'être adoptée ; mes prompts ci-dessous utilisent plutôt une dénomination descriptive simple, qui fonctionne aussi lorsque les références sont visuellement non ambiguës.

Pourquoi le premier appel déçoit généralement. Quatre choses, toutes mesurées le 12 août 2026 :

  1. L'endpoint de soumission ne valide rien. MIME erroné, audio de 164 secondes, URL morte, champs mutuellement exclusifs : tout cela renvoie HTTP 200 avec un ID de prédiction. Vous le découvrez plus tard.
  2. ratio par défaut à adaptive, documenté comme « laisser le modèle choisir ». Avec des références 16:9, j'ai obtenu 1344x768 en 768P que je le laisse sur adaptive ou que je force 16:9, donc la valeur par défaut est inoffensive lorsque vos entrées sont déjà d'accord. C'est un pile ou face quand elles ne le sont pas, et c'est le seul endpoint H3 où vous pouvez simplement lui retirer la décision.
  3. Une image de première image plus des références ne génère pas d'erreur. Elle en supprime silencieusement une et vous facture.
  4. Si le modèle n'a rien de concret à quoi s'accrocher, il comble le vide avec confiance, et un visage erroné confiant ressemble exactement à une exécution réussie.

Pour le côté rédaction des prompts, le guide de prompt MiniMax H3 va plus loin dans la formulation que je ne peux le faire ici.

Le règlement MiniMax H3 Reference to Video : trois types, une seule requête

Les trois types de référence partagent un seul tableau. Voici le contrat tel que publié, à côté de ce que l'endpoint a réellement fait lorsque j'ai poussé.

Tableau 1 : les trois types de référence

Images de référenceVidéo de référenceAudio de référence
Fichiers max93 clips3 clips
Plafond combiné12 fichiers tous types confondus
Durée par fichiern/a2 à 15 secondes2 à 15 secondes
Durée totalen/a15 secondes15 secondes
Formatspng, jpeg, jpg, webpmp4, movmp3, wav
Peut-il être utilisé seul ?OuiOuiNon, nécessite une image ou une vidéo
Ce qu'il verrouilleidentité, vêtement, produit, stylemouvement, caméra, étalonnage, grainle lit audio lui-même
Ce qu'il ne verrouille paséclairage de la nouvelle scènequi est dans le planla piste exacte (voir Étape 6)
Livré en tant queURL publique ou URL data base64URL publique ou URL data base64doit être déclaré audio/mp3, pas audio/mpeg
Appliqué ?10 images sont passées sans problèmenon testé au-delà de 1 clipfenêtre par clip appliquée, 15s total ne l'était pas

Les nombres de fichiers et les fenêtres de durée sont les limites publiées par MiniMax (Hailuo, août 2026), recoupées avec l'article de lancement qui liste la même fenêtre vidéo de référence de 2 à 15 secondes chacune et 15 secondes au total (MarkTechPost, août 2026). Tout dans les trois dernières lignes est de moi, mesuré.

Deux choses que la fiche technique ne vous dit pas. Premièrement, le champ type sur chaque entrée est facultatif et déduit de l'extension de l'URL, ce qui signifie qu'une URL de données base64 ou un lien sans extension doit déclarer son type ou la requête se trompe. Deuxièmement, l'outil de téléchargement du navigateur plafonne à neuf fichiers (Reference Materials (2/9), MAX:9 dans la capture d'écran de l'Étape 5 ci-dessous), en dessous des douze de MiniMax. J'ai quand même envoyé dix images de référence via l'API et le travail s'est terminé normalement, donc neuf est une limite de l'interface utilisateur, pas une limite du modèle.

Tableau 2 : reference-to-video vs image-to-video vs text-to-video

reference-to-videoimage-to-videotext-to-video
Accepte refersoui, obligatoire, min 1non (ignoré silencieusement)non
Accepte image première imagenon (ignoré silencieusement)oui, obligatoirenon
Accepte end_image dernière imagenonouinon
Options ratiotous les 7, incl. 16:9, 9:16, 21:9adaptive uniquementtous les 7
Résolution768P ou 2K, par défaut 2Kidentiqueidentique
Duréeentiers 4 à 15s, par défaut 8identiqueidentique
Mélanger l'entrée de l'autre endpointtravail terminé, entrée ignorée, facturation complètetravail terminé, refers ignorés, facturation complèten/a

Cette quatrième ligne est la différence dont personne ne parle. Sur image-to-video, l'énumération des ratios contient exactement une valeur, adaptive, car la première image décide de la forme. Sur reference-to-video, vous obtenez les sept, ce qui en fait le seul endpoint H3 où vous pouvez forcer une forme de cadre tout en ancrant un personnage. Si vous choisissez un niveau pour ce travail, 2K vs 768P pour MiniMax H3 couvre ce que les pixels supplémentaires apportent.

La dernière ligne est la plus coûteuse. La documentation présente les deux endpoints comme mutuellement exclusifs, et ils le sont, dans le sens où un seul chemin d'entrée est honoré. Mais il n'y a pas d'erreur. Je l'ai exécuté dans les deux sens le 12 août 2026 : un appel reference-to-video avec une image de première image s'est terminé en 115 secondes et a facturé 0,40 $, et un appel image-to-video avec refers s'est terminé en 167 secondes et a facturé 0,40 $. Les deux ont produit une vidéo. Les deux ont jeté la moitié de ce que j'ai envoyé, et aucun champ dans la réponse n'indique quelle moitié.

Tableau 3 : les modèles utilisés par ce workflow

Tout ce qui suit s'exécute dans un seul onglet de navigateur sur Atlas Cloud, d'où proviennent les prix et les captures d'écran. Tarifs vérifiés le 12 août 2026.

ÉtapeModèleTarifExécutions iciCoût
Références personnage + accessoireopenai/gpt-image-2/text-to-imagelisté à partir de 0,009 $ ; haute qualité à 2048x1152 mesuré à 0,1745 $20,35 $
Audio de référenceminimax/music-2.60,15 $ par piste10,15 $
Plan A et Plan Bminimax/h3/reference-to-video0,10 $/s en 768P, 0,14 $/s en 2K2 x 8s en 2K2,24 $
Échelle de référenceidem, plus minimax/h3/text-to-video0,10 $/s en 768P3 x 4s en 768P1,20 $

Aucune réduction n'est active sur les trois endpoints H3 ce mois-ci. Deux voisins sont moins chers en ce moment si vous ne construisez que des images fixes de référence : gpt-image-2-developer/text-to-image est à 50 % de réduction, de 0,009 $ à 0,004 $ en août 2026. Les détails complets par seconde se trouvent dans le guide Tarification de l'API MiniMax H3.

MiniMax H3 Reference to Video, étape par étape

La scène : une femme tient un stand de ramen. Le plan A est une ruelle néon pluvieuse la nuit. Le plan B est la même femme le lendemain matin dans un marché couvert vide, un endroit différent, une heure différente de la journée et un objectif différent. Rien ne passe entre les deux appels à part les références, ce qui est le but du test.

Étape 1 : Construire la référence du personnage, éclairée volontairement à plat

C'est l'étape que les gens ratent. Une référence de personnage n'est pas une belle photo de votre personnage, c'est une mesure de son visage. Lumière neutre, fond simple, pas de scène, pas d'ambiance. H3 apprend la lumière en même temps que le visage, donc une référence atmosphérique produit un personnage soudé à cette atmosphère.

Modèle : openai/gpt-image-2/text-to-image. Paramètres : qualité haute, taille 2048x1152 (16:9), format png.

text
1Photographie éditoriale d'une femme d'une trentaine d'années, chef de street-food. Portrait rapproché trois quarts, expression neutre, regard direct vers l'objectif. Cheveux noirs courts glissés derrière une oreille, une petite cicatrice au-dessus du sourcil droit, peau olivâtre chaude. Elle porte une veste de travail indigo délavée aux manches retroussées jusqu'au coude et une serviette blanche pliée sur l'épaule gauche. Fond de studio gris clair uni, éclairage principal doux et uniforme, pas d'accessoires, mise au point nette sur le visage, texture de peau naturelle, sans retouche. Photoréaliste, objectif 50mm.
2

Capture d'écran du générateur d'images IA montrant le prompt saisi et le portrait généré

Environnement de test GPT Image 2 sur Atlas Cloud avec le prompt de référence du personnage chargé et le portrait terminé dans le panneau de sortie

GPT Image 2 sur Atlas Cloud : qualité réglée sur haute, 16:9, la fiche personnage rendue à droite.

Femme en combinaison bleue avec une serviette drapée sur l'épaule

Image de référence du personnage pour MiniMax H3 reference to video : portrait neutre en studio d'une cheffe de ramen avec une cicatrice au-dessus du sourcil droit

Image de référence 1. La cicatrice au-dessus du sourcil droit et la serviette blanche pliée sont délibérées : ce sont des ancres d'identité peu coûteuses et non ambiguës que vous pouvez vérifier dans chaque image ultérieure.

Étape 2 : Construire la référence de l'accessoire

Deuxième emplacement de référence, deuxième travail. Les objets se comportent mieux que les visages ici, ce qui fait d'un accessoire distinctif le moyen le plus simple de prouver qu'une référence a été prise en compte. Même modèle, mêmes paramètres.

text
1Photographie de produit d'un seul bol à ramen en céramique bleu marine foncé avec une grue blanche peinte à la main sur le côté, ébréché sur le bord, rempli de shoyu ramen fumant. Vue de face, fond gris clair uni, lumière douce et uniforme, mise au point nette, photoréaliste, objectif 50mm.
2

porc, (5) œuf, (6) et (7) oignons (8) verts (9)

Image de référence de l'accessoire : bol à ramen bleu marine foncé avec une grue blanche peinte à la main et un bord ébréché

Image de référence 2. La grue peinte à la main et l'ébréchure sur le bord sont les indices. S'ils survivent dans la vidéo, la référence a été lue.

Étape 3 : Plan A, deux images dans MiniMax H3 reference to video

Deux images de référence, toutes deux type: "image", dans refers. Définissez le ratio explicitement. adaptive est la valeur par défaut et fera généralement le bon choix lorsque vos références sont déjà en 16:9, mais il décide pour vous, et sur cet endpoint, vous n'êtes pas obligé de le laisser faire.

Modèle : minimax/h3/reference-to-video. Paramètres : résolution 2K, durée 8, ratio 16:9.

text
1Plan d'ensemble large. Forte pluie la nuit dans une ruelle étroite éclairée au néon. La femme de l'image de référence travaille seule derrière un petit stand de ramen fumant sous un auvent en plastique, versant du bouillon dans le bol bleu marine avec la grue de l'image de référence. La vapeur monte à travers les reflets néon roses et verts sur le trottoir mouillé. Lent travelling avant sur le stand. Son ambiant : pluie sur le plastique, bouillon qui bout, circulation lointaine. Pas de dialogue.
2

La sortie de cet appel est la première moitié du clip de démonstration en haut de l'article. Conservez son URL. C'est l'entrée de l'étape 5.

Étape 4 : Couper huit secondes d'audio de référence

L'audio de référence n'est pas un emplacement de bande sonore. C'est un lit sur lequel le modèle fait correspondre son propre mix, et c'est l'entrée la plus capricieuse de l'endpoint. Générez une piste, puis réduisez-la, car une chanson entière est rejetée.

Modèle : minimax/music-2.6, avec is_instrumental: true et format: "mp3".

text
1Jazz tardif clairsemé, caisse claire brossée, contrebasse, une trompette bouchée, mélancolique, 70 BPM, instrumental.
2

Ensuite, découpez environ huit secondes et encodez-les en une URL data:audio/mp3. Trois choses que j'ai mal faites ici, toutes avec le texte d'erreur exact :

  • La chaîne MIME importe plus que les octets. Déclarez data:audio/mpeg et la référence est refusée avec audio format ".mpeg" not allowed, même si le fichier est un MP3 parfaitement ordinaire. Écrivez audio/mp3.
  • 2 à 15 secondes par clip, et c'est appliqué. Ma piste générée faisait 164 secondes. Elle est revenue avec invalid param: audio duration 164258 ms, expected [2000, 15000] ms. La découper à 8,05 secondes a résolu le problème. Les deux rejets n'ont rien coûté.
  • Le plafond combiné de 15 secondes est documenté mais pas appliqué. J'ai envoyé deux clips de 8 secondes dans la même requête, 16,1 secondes au total, en m'attendant à un rejet. Le travail s'est terminé et a été facturé normalement. Ne vous basez pas là-dessus : c'est publié comme une limite et pourrait commencer à se comporter comme tel à tout moment.

Interface du générateur de musique IA montrant le prompt textuel et la forme d'onde audio générée

Environnement de test MiniMax Music 2.6 sur Atlas Cloud avec le prompt jazz et la piste terminée dans le panneau de sortie

MiniMax Music 2.6 sur Atlas Cloud, 0,15 $ par exécution, piste terminée à droite. Une chose à copier de cette capture d'écran et une chose à ne pas copier : le prix et le format mp3 sont corrects, mais Is Instrumental est toujours désactivé et les paroles de démonstration de la page sont encore dans la boîte, donc cette exécution particulière est revenue comme une chanson de 1:35 avec voix. Activez ce bouton et effacez le champ Lyrics avant de l'exécuter, ou vous couperez un lit de référence avec quelqu'un qui chante dessus. Mon appel API, avec isinstrumental: true, a renvoyé 2:44 d'instrumental en 209 secondes.

Étape 5 : Plan B, un seul appel MiniMax H3 reference to video avec les trois types

C'est l'appel autour duquel tourne vraiment le mot-clé. Trois types de référence, trois travaux différents, un seul tableau :

  1. le portrait du personnage de l'étape 1, type: "image", pour conserver son visage
  2. le mp4 du plan A de l'étape 3, type: "video", pour transporter l'étalonnage et le grain à travers la coupe
  3. la tranche de jazz de huit secondes de l'étape 4, type: "audio", comme lit

Les URL de sortie d'autres générations sur la plateforme peuvent être déposées directement dans refers comme référence vidéo, ce qui est le mécanisme réel derrière la continuité multi-plans. Pas « H3 se souvient de votre personnage ». Vous lui redonnez le plan précédent.

Modèle : minimax/h3/reference-to-video. Paramètres : résolution 2K, durée 8, ratio 16:9.

text
1La même femme que sur l'image de référence, le lendemain matin. Marché couvert vide et lumineux, lumière du jour froide et propre à travers un puits de lumière, volets encore baissés derrière elle. Plan moyen rapproché, caméra statique. Elle essuie le comptoir avec la serviette blanche pliée, lève les yeux vers la caméra et dit une réplique, puis retourne au travail. Conservez son visage, ses cheveux, sa cicatrice et sa veste indigo identiques à la référence. Reprenez l'étalonnage et le grain du clip de référence. Utilisez l'audio de référence comme fond sonore.
2

Interface du générateur vidéo IA montrant le prompt saisi et la vidéo générée

Environnement de test MiniMax H3 reference to video sur Atlas Cloud avec une référence image et une référence audio chargées et le clip généré dans le panneau de sortie

Le même appel dans l'environnement de test MiniMax H3 Reference-to-Video, en 2K et 8 secondes. Deux emplacements de référence de types différents sont visibles dans Reference Materials (2/9) : l'emplacement 1 est ref-audio-8s.mp3, l'emplacement 2 est son portrait. La référence vidéo passe par « Add via link » (en haut à droite de ce panneau) ou par l'API, car elle vit à une URL plutôt que sur le disque. Trois choses à lire sur ce panneau : l'outil de téléchargement indique MAX:9 même si le plafond de MiniMax est de 12, Aspect Ratio est sur adaptive sauf si vous le modifiez, et le prix d'exécution pour 2K à 8 secondes est de 1,12 $, soit le palier de 0,14 $ par seconde.

Étape 6 : Vérifier que la référence a bien été prise en compte

Un travail terminé n'est pas un travail réussi. Deux vérifications, toutes deux peu coûteuses.

Vérifiez le visage. Extrayez une image de chaque plan et mettez-les côte à côte. Vous cherchez les ancres que vous avez plantées : la cicatrice, la ligne des cheveux, la veste, la serviette.

Comparaison d'une femme sous un éclairage de nuit néon et de marché matinal

Image du plan A à côté d'une image du plan B, montrant le même personnage MiniMax H3 reference to video dans deux scènes différentes

À gauche : Plan A, nuit, néon, large. À droite : Plan B, marché couvert, lendemain matin, plan moyen rapproché. Même visage, même cicatrice au-dessus du sourcil droit, même veste et serviette, à travers un changement de scène et de cadre sans rien partagé à part les références.

Une chose ne s'est pas passée comme je l'avais écrit dans le prompt. J'ai demandé « marché couvert vide et lumineux, lumière du jour froide et propre » et « reprenez l'étalonnage et le grain du clip de référence », et le clip de référence a gagné. Le plan B est indubitablement matinal et indubitablement un endroit différent, mais il est beaucoup plus sombre que « lumineux » ne le suggère, car l'étalonnage nocturne est venu avec la référence vidéo. Vous ne pouvez pas demander à un seul appel le même look et la lumière opposée. Si vous avez besoin que la lumière change, supprimez l'instruction d'étalonnage, ou supprimez la référence vidéo et conservez l'identité avec la seule image.

Vérifiez l'audio. Tracez la forme d'onde de la tranche de huit secondes que vous avez téléchargée à côté de la piste revenue à l'intérieur du mp4, et ajoutez un témoin : un clip généré sans aucune référence audio.

Trois formes d'onde audio superposées comparant les pistes téléchargée, renvoyée et témoin

Forme d'onde de l'audio de référence de huit secondes téléchargé, de la piste audio renvoyée à l'intérieur du clip généré, et d'un témoin sans référence audio

En haut : la tranche de jazz de 8,05 secondes envoyée comme référence. Au milieu : la piste extraite du mp4 du Plan B renvoyé, dominée par la ligne de dialogue vers 5,5 secondes. En bas : Plan A, même workflow, sans référence audio.

C'est là que je dois corriger quelque chose que je croyais en commençant. L'audio de référence ne revient pas textuellement. La corrélation d'enveloppe entre ma tranche et la piste renvoyée est de 0,25, contre -0,05 pour le témoin sans référence, donc les deux sont liés mais loin d'être identiques, et la forme renvoyée est clairement son propre mix plutôt que mon fichier avec quelque chose par-dessus. Ce que la référence a clairement fait, c'est mettre quelque chose en dessous : le lit du Plan B est environ 7 dB plus fort que le témoin sans audio pendant les cinq premières secondes, avant que tout dialogue ne commence. Considérez l'audio de référence comme une orientation sur le mix, pas un emplacement musical. Si vous avez besoin de votre piste exacte sous l'image, ajoutez-la après.

Si vous construisez sur le côté audio de cela, MiniMax H3 lip sync and audio et la procédure pas à pas MiniMax H3 music video partent tous deux de ce même comportement audio de référence. Pour le code d'interrogation et de nouvelle tentative autour de tout cela, le tutoriel MiniMax H3 contient la boucle.

Quatre autres configurations MiniMax H3 Reference to Video qui valent le détour

Restyler un clip que vous possédez déjà. Mettez un clip terminé dans refers comme référence vidéo, sans aucune image, et demandez un médium différent. Le mouvement, le cadrage, le travelling avant et les accessoires survivent ; la surface change. C'est le mécanisme derrière le classement de l'édition vidéo de H3, et c'est le même qui est derrière le travail d'anime dans MiniMax H3 vs Veo 3.1 pour l'anime.

Femme cuisinant à un chariot de nourriture dans une ruelle éclairée au néon

Restyle anime généré à partir du clip du Plan A utilisé comme référence MiniMax H3 reference to video

La ruelle du Plan A renvoyée comme seule référence, avec un prompt anime cel-shaded. Même stand, même louche, même bol à grue, même travelling avant, redessiné. Un détail à savoir : la conversion est la plus faible dans les premières images et la plus forte une fois que la caméra s'engage dans le mouvement. Montré sous forme de GIF silencieux. Généré avec minimax/h3/reference-to-video en 768P, 4s, 0,40 $.

Faire chanter une photo. Un portrait plus un clip vocal dans la fenêtre de 2 à 15 secondes, prompter la performance. Moins cher qu'un pipeline de synchronisation labiale car c'est un seul appel.

Verrouiller un produit dans n'importe quelle scène. Les images de référence épinglent les objets plus fortement que les visages, donc une photo de produit réelle plus un prompt de scène est la chose la plus fiable sur cet endpoint. Vérifiez ce que vous avez le droit de faire avec le résultat avant de l'utiliser dans une publicité.

Construire une série, pas un clip. Enchaînez : la sortie du plan N devient la référence vidéo du plan N+1. Chaque appel plafonne toujours à 15 secondes, donc la continuité est votre travail, pas celui du modèle. Combien de temps peut durer une vidéo MiniMax H3 couvre où ce plafond limite.

Comparer les moteurs avant d'engager une série sur un seul ? Seedance 2.5 vs MiniMax H3 et Alternatives à MiniMax H3 sont les deux à lire.

Combien coûte réellement une scène MiniMax H3 Reference to Video à deux plans

Chaque ligne ci-dessous est un travail réel du 12 août 2026, avec le montant prélevé du champ price que l'API renvoie pour chaque prédiction terminée.

Tableau 4 : la facture réelle

TravailModèleParamètresRésultatFacturé
Référence personnagegpt-image-2haute, 2048x1152terminé0,1745 $
Référence accessoiregpt-image-2haute, 2048x1152terminé0,1745 $
Audio de référencemusic-2.6instrumental, mp3terminé, piste 164s, attente 209s0,15 $
Plan Ah3/reference-to-video2K, 8s, 2 refs imageterminé en 309s1,12 $
Plan Bh3/reference-to-video2K, 8s, refs image + vidéo + audioterminé en 557s1,12 $
Échelle, sans référenceh3/text-to-video768P, 4sterminé en 154s0,40 $
Échelle, 1 ref imageh3/reference-to-video768P, 4sterminé en 119s0,40 $
Échelle, 2 refs imageh3/reference-to-video768P, 4sterminé en 128s0,40 $
Restyle animeh3/reference-to-video768P, 4s, 1 ref vidéoterminé en 239s0,40 $
Ré-exécution Étape 5 dans l'environnement de testh3/reference-to-video2K, 8s, refs image + audioterminé1,12 $
Témoin : 10 refs imageh3/reference-to-video768P, 4sterminé en 150s0,40 $
Témoin : image première image + refersh3/reference-to-video768P, 4sterminé, une entrée ignorée0,40 $
Témoin : refers sur image-to-videoh3/image-to-video768P, 4sterminé, refers ignorés0,40 $
Témoin : 16,1s d'audio de référenceh3/reference-to-video768P, 4sterminé au-delà d'une limite documentée0,40 $
Témoin : ratio omis, puis ratio adaptiveh3/reference-to-video768P, 4s, deux foisles deux terminés, identique 1344x7680,80 $
Ré-exécutions captures d'écran Étape 1 et 4gpt-image-2, music-2.6comme ci-dessusterminé0,32 $
Témoin : audio référence seulh3/reference-to-video768P, 4séchoué en 7ms0,00 $
Témoin : audio référence 164sh3/reference-to-video768P, 4séchoué en 16s0,00 $
Témoin : MIME audio/mpegh3/reference-to-video768P, 4séchoué en 17s0,00 $
Témoin : URL de référence morteh3/reference-to-video768P, 4séchoué en 21s0,00 $
Total8,18 $

Répartissez honnêtement ce total. La scène finie à deux plans en haut de cet article, références et audio inclus, représente 2,74 $ de ce montant. Les 5,44 $ restants sont l'investigation : témoins, casses délibérées, et ré-exécutions d'étapes dans le navigateur pour les captures d'écran. Si vous connaissez déjà les règles, une séquence de deux plans de 16 secondes en 2K coûte moins cher qu'un sandwich.

Trois choses ressortent de ce tableau.

Les références sont gratuites. Le témoin à dix images a coûté exactement les mêmes 0,40 $ que l'exécution de l'échelle à une image à la même longueur et résolution. Sur cette plateforme, le compteur suit les secondes de sortie et la résolution, rien d'autre. Il vaut la peine de signaler une contradiction : les règles de la propre plateforme de MiniMax décrivent la vidéo d'entrée facturée au tarif de sortie, et le schéma unifié sur OpenRouter comporte un poste reference_images séparé. Aucun des deux n'est apparu sur ma facture ici. Si vous budgétisez ailleurs, vérifiez le prix par vous-même plutôt que de supposer.

L'échec est gratuit, et il est tardif. Les quatre rejets n'ont rien coûté, c'est la bonne nouvelle. La mauvaise nouvelle est quand ils arrivent : 7 millisecondes pour la règle audio seul, 16 à 21 secondes pour la durée audio, le mauvais MIME et l'URL morte, et rien du tout au moment de la soumission. Chaque requête mal formée de cet article a d'abord reçu HTTP 200 et un ID de prédiction, alors traitez une réponse de soumission comme un reçu, pas comme une validation, et interrogez le champ status avant de croire quoi que ce soit.

Le succès silencieux est l'échec coûteux. Les deux témoins de mélange ont chacun coûté 0,40 $ complets et ont renvoyé une vidéo parfaitement valide construite à partir de la moitié de mes entrées. Il n'y a pas d'erreur, pas de champ d'avertissement, et aucun moyen de dire à partir de la réponse que quoi que ce soit a été jeté. C'est la seule ligne du tableau où l'argent a quitté le compte et je n'ai rien obtenu de ce que je voulais.

Une correction honnête sur ce dernier point, car cela a changé sous moi pendant que j'écrivais. Début août, une URL de référence qui renvoyait 404 se comportait de la même manière : le travail se terminait, la référence était silencieusement ignorée, et le montant total était facturé. En le réexécutant le 12 août 2026, l'endpoint vérifie désormais l'accessibilité et fait échouer le travail gratuitement avec une erreur nommée, content[1].image_url: media not found (HTTP 404). Ce trou spécifique est bouché. Le trou des entrées mutuellement exclusives ne l'est pas. Pour les calculs de crédit par clip, MiniMax H3 credits per video contient les tableaux.

Le visage de qui, la voix de qui : vérifiez ceci avant de télécharger une référence

Cet endpoint est différent du texte vers vidéo sur un point juridiquement pertinent : vous fournissez la ressemblance. Une image de référence d'une personne réelle, un clip de référence du film de quelqu'un, une voix de référence dans une voix reconnaissable, tout cela est un matériel pour lequel vous affirmez avoir le droit d'utiliser. Les règles de contenu du modèle s'appliquent en plus, et elles sont plus strictes concernant les personnes réelles que les personnes inventées. Deux guides à lire avant qu'un client ne voie la sortie : MiniMax H3 content restrictions et le détail commercial use and licensing, qui couvre également les exclusions territoriales dans les conditions de MiniMax.

MiniMax H3 Reference to Video : Foire aux questions

MiniMax H3 reference to video peut-il garder le même personnage à travers deux plans différents ?

Oui, et mon test à deux plans ci-dessus tient à travers une inversion complète de l'éclairage nuit-jour. Mais une image de personnage seule ne suffit pas. Le schéma fiable est de repasser l'URL de sortie du plan précédent comme vidéo de référence en plus de l'image du personnage, afin que le second appel hérite de l'étalonnage et du grain ainsi que de l'identité.

Puis-je utiliser une image de première image et des références dans le même appel MiniMax H3 reference to video ?

Non, et le mode de défaillance est le problème. Envoyer à la fois image et refers ne génère pas d'erreur. Testé le 12 août 2026, le travail s'est terminé en 115 secondes, a facturé 0,40 $, et a silencieusement jeté l'une des deux entrées. La même chose se produit en sens inverse sur l'endpoint image-to-video. Choisissez un chemin par appel.

Puis-je envoyer un fichier audio seul comme référence MiniMax H3 reference to video ?

Non. L'audio doit voyager avec au moins une image ou vidéo de référence, et l'endpoint l'applique avec une erreur explicite : reference-to-video requires at least one reference image or video. Elle arrive à l'étape de génération, pas à la soumission, et le travail rejeté est gratuit. Les références audio doivent également se situer entre 2 et 15 secondes, 15 secondes combinées, et être déclarées audio/mp3 plutôt que audio/mpeg.

MiniMax H3 reference to video facture-t-il un supplément pour chaque fichier de référence ?

Pas sur Atlas Cloud. Une exécution avec dix images de référence et une avec une seule ont facturé les mêmes 0,40 $ en 768P et 4 secondes, donc le compteur suit uniquement les secondes de sortie et la résolution. Notez la contradiction cependant : les propres règles de MiniMax mentionnent la vidéo d'entrée mesurée au tarif de sortie, et d'autres plateformes exposent un poste reference-image séparé. Vérifiez sur la surface de facturation que vous utilisez.

Que se passe-t-il si l'une de mes URL de référence MiniMax H3 reference to video est cassée ?

Depuis le 12 août 2026, l'endpoint valide l'accessibilité et fait échouer l'ensemble du travail gratuitement, avec content[1].image_url: media not found (HTTP 404) après environ 21 secondes. C'est un changement : début août, la même requête se terminait, ignorait silencieusement la référence manquante et facturait le plein tarif. Ne supposez pas que les rapports de comportement plus anciens sont toujours valables, et vérifiez le champ status plutôt que de supposer qu'un 200 à la soumission signifie quoi que ce soit.

MiniMax H3 reference to video est-il vraiment le meilleur modèle pour cela ?

Sur le seul face-à-face public qui le mesure, oui, de justesse. MiniMax H3 mène le classement de l'édition vidéo avec un Elo de 1 125 sur 10 280 votes, mais sa plage de classement listée est de 1 à 2 et Gemini Omni Flash est à 3 points Elo derrière avec un intervalle chevauchant. Traitez-le comme « meilleur disponible conjointement », choisissez sur le reste du workflow, et lisez Alternatives à MiniMax H3 si l'égalité compte pour vous.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles