Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

MiniMax H3 Durée de la vidéo est de 15 secondes. J'ai compté dix coupures dans l'une d'elles.

La durée de la vidéo MiniMax H3 va de 4 à 15 secondes entières à 24 FPS. Découvrez ce que vous obtenez vraiment image par image, combien de coupures tiennent dans un seul clip, et comment enchaîner 45s.

Tout le monde fait la même chose le premier jour. Vous ouvrez le menu déroulant de la durée, vous voyez 15, et vous commencez à diviser. Un film de dix minutes ? Quarante générations. Une vidéo explicative de trois minutes ? Douze. Ensuite, vous regardez le nombre que produit cette division, vous fermez l’onglet, et vous décidez que le modèle n’est pas prêt pour quelque chose qui contient une histoire.

J’ai aussi fait la division. Puis j’ai lancé ffmpeg sur neuf vrais clips H3 et j’ai trouvé quelque chose qui a rendu tout le calcul ridicule.

L’un de ces clips dure 15,10 secondes. À l’intérieur, le détecteur de scène signale dix coupes nettes. Dix. Différente garde-robe, différent cadrage, différents arrière-plans, cartons pleine image, le tout à l’intérieur d’une seule génération qui a coûté le prix d’une seule génération. Si j’avais planifié ce clip comme la division le suggère, une génération par plan, j’aurais payé dix fois plus pour les mêmes quinze secondes.

La division est l’erreur. La limite n’est pas un chronomètre, c’est un conteneur, et presque personne ne le remplit.

Séquence d’un skateboarder sautant par-dessus un rebord en béton de nuit

Un skateboarder en pleine figure capturé comme une séquence stroboscopique, de nombreuses positions distinctes figées dans une seule image

Une image, plusieurs moments. C’est le modèle mental dont le menu déroulant de la durée vous dissuade.

Points clés

  • Le paramètre duration n’accepte que des entiers de 4 à 15. La valeur par défaut est 8. Il n’y a pas de 7,5, ni de valeur supérieure à 15.
  • Chaque clip revient à 24 FPS, jusqu’à du 2K natif, avec un son stéréo généré en même temps que l’image.
  • Votre clip de « 15 secondes » fait en réalité 362 images, soit 15,083 secondes. Les durées sont arrondies à la hausse sur une grille de 17 images, et seul duration: 8 tombe sur une seconde entière.
  • Une seule génération peut contenir de nombreux plans. Écrivez PLAN 1 / CUT TO dans le prompt et le modèle coupe pour vous, sans coût supplémentaire.
  • Il n’y a pas de paramètre extend dans l’API. Vous dépassez 15 secondes par enchaînement : dernière image dans la première image suivante, images de référence pour maintenir le look, puis une concaténation dure.

Regardez 45 secondes de vidéo MiniMax H3, construites à partir de trois clips

Avant toute théorie, voici la chose elle-même. Un spot de 45 secondes intitulé MIDNIGHT BOWL. Trois générations, quinze secondes chacune, trois plans à l’intérieur de chacune. Neuf plans, un seul morceau continu de narration, sans fondu pour masquer les jonctions.

Le montage complet de 45 secondes. Trois générations MiniMax H3 concaténées sans effet de transition. Le chef, le tablier, l’ampoule et l’enseigne peinte à la main survivent à deux transferts.

Neuf images vidéo montrant un chef préparant et servant des ramen

Neuf images du spot MIDNIGHT BOWL disposées en planche contact 3x3, étiquetées PLAN 1 à PLAN 9 avec des timecodes

Neuf plans, trois générations. Chaque ligne est une génération, chaque colonne une coupe que le modèle a faite tout seul. Les plans 3 et 4 se répondent parce que la génération 2 commence à partir de la dernière image de la génération 1, ce qui rend la couture invisible.

Trois générations. Pas neuf. Cet écart est tout l’intérêt de cet article.

Je n’ai rien coupé manuellement. J’ai demandé à chaque génération trois plans avec timecodes, et le détecteur de scène d’ffmpeg a trouvé les coupes à 4,9 s et 9,1 s dans la première, à 4,9 s et 9,0 s dans la deuxième, à 5,3 s et 11,0 s dans la troisième. Neuf plans, trois factures.

Pourquoi la durée vidéo de MiniMax H3 ruine les plans longs

Le nombre lui-même est correct. Quinze secondes au maximum de la plage est généreux pour cette génération de modèles, et les clips sont en 2K avec un vrai son stéréo. Ce qui ruine les gens, c’est l’unité dans laquelle ils planifient.

Si vous budgétez en secondes, un morceau d’une minute représente « quatre clips » et un morceau de dix minutes « quarante clips », et quarante clips de quoi que ce soit est un cauchemar de travail de continuité. Si vous budgétez en plans, un morceau d’une minute représente quatre générations contenant environ douze plans, ce qui est une couverture normale pour une publicité. Même modèle, même limite, plan de production complètement différent.

Doigts tenant une bande de film sépia montrant une rue, des mains et une silhouette

Illustration rétro de poster plat d’une seule bande de film 35 mm dans laquelle trois images consécutives contiennent chacune une scène complètement différente

Budgétez en plans, pas en secondes. Une seule bande facturée, trois scènes différentes à l’intérieur.

Il y a une deuxième chose qui brise les plans longs, et ce n’est pas du tout la limite. Ce sont les coutures. Les clips individuels ne s’effondrent presque jamais au milieu. Ils s’effondrent aux jonctions, car chaque génération invente sa propre bande sonore et dérive légèrement sur la garde-robe et la lumière. Planifiez les coutures et 45 secondes sont faciles. Ignorez-les et quatre clips parfaits ressemblent encore à quatre clips.

Ce qu’est vraiment la durée vidéo de MiniMax H3 : 4 à 15 secondes entières sur une grille de 17 images

Commençons par la spécification, car deux nombres différents circulent. Le schéma API en direct pour les trois endpoints H3 sur Atlas Cloud liste duration comme une énumération d’exactement 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, avec une valeur par défaut de 8. Entiers, rien de fractionnaire, rien au-delà de 15. La couverture du lancement correspond à cette lecture : sortie 2K, 4 à 15 secondes, durées entières uniquement (MarkTechPost, août 2026). Le propre billet de lancement de MiniMax le décrit comme jusqu’à 15 secondes en 2K avec son stéréo natif (MiniMax, août 2026).

Vous verrez encore « 5 à 15 secondes » écrit dans divers profils et guides de démarrage rapide, y compris dans certains textes sur la plateforme. Considérez l’énumération du schéma comme la vérité. Le minimum est 4, et j’ai facturé des clips de 4 secondes pour le prouver.

Maintenant la partie que presque personne ne mentionne. Demandez 15 secondes et vous n’obtenez pas 360 images. Vous en obtenez 362.

H3 construit la vidéo par blocs de 17 images et arrondit votre durée demandée à la hausse jusqu’au prochain nombre d’images 17k + 5 à 24 FPS. Cette grille est documentée dans le tutoriel officiel de H3 pour ComfyUI (Doc ComfyUI, 2026), et elle s’applique aussi côté API. J’ai compté les images sur neuf vrais fichiers H3 avec ffmpeg :

text
1ffmpeg -i video-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | tail -1
2# frame=  362  ...
3#   Duration: 00:00:15.10, 1280x720, 24 fps
4

Tous les fichiers de 15 secondes sont revenus à 362 images. Tous les fichiers de 10 secondes sont revenus à 243. Les trois nouvelles générations que j’ai lancées pour cet article sont également revenues à 362, et la répétition de 4 secondes à l’étape 5 est revenue à 107. Passez-les dans la grille : 362 fait 17x21+5, 243 fait 17x14+5, et 107 fait 17x6+5. La formule a prédit les trois exactement, ce qui est le genre d’accord qui me fait confiance au reste du tableau.

duréeImages livrées (17k+5)Longueur réelle à 24 FPSTombe sur une seconde entière ?Source
41074,458 sNonMesuré
51245,167 sNonGrille
61586,583 sNonGrille
71757,292 sNonGrille
81928,000 sOuiGrille
92269,417 sNonGrille
1024310,125 sNonMesuré
1127711,542 sNonGrille
1229412,250 sNonGrille
1332813,667 sNonGrille
1434514,375 sNonGrille
1536215,083 sNonMesuré

Trois choses ressortent de ce tableau.

duration: 8 est la seule valeur de toute la plage qui vous donne une seconde entière propre, et c’est la valeur par défaut. Ce n’est pas une coïncidence : c’est 17x11+5 = 192 = 8 x 24 exactement.

Demandez 6 et vous obtenez 6,583 secondes, plus d’une demi-seconde d’image gratuite. Demandez 13 et vous obtenez 13,667. La grille arrondit toujours à la hausse, jamais à la baisse, donc vous n’êtes jamais en déficit.

Et si vous montez sur de la musique ou si vous faites correspondre un montage image par image, ne calculez jamais votre timeline comme durée x 24. Mesurez le fichier. Un projet de 40 clips planifié sur l’hypothèse de secondes entières est décalé de près de quatre secondes à la fin.

Dix coupes à l’intérieur d’une seule génération MiniMax H3 de 15 secondes

Voici le clip dont j’ai parlé au début. Une génération, 362 images, 15,10 secondes dans le conteneur. C’est un morceau de type cinétique de mode, et il se comporte comme un clip vidéo monté plutôt que comme un plan séquence.

Gros plan des yeux d’une femme derrière un texte blanc en gras ONE LOOK

Une seule génération MiniMax H3. Changements de garde-robe, changements de cadrage, écrans partagés et cartons pleine image, le tout dans un seul job de 15 secondes.

J’ai lancé le détecteur de scène d’ffmpeg dessus plutôt que de compter à l’œil :

text
1ffmpeg -i video-5.mp4 -vf "select='gt(scene,0.6)',showinfo" -f null -
2# 18 breaks flagged, at 1.54 2.88 3.63 4.21 5.54 5.83 6.92 8.88 11.17 13.00 ...
3

Dix d’entre eux sont des changements de plan nets au cours des treize premières secondes. La queue est un carton stroboscopique clignotant sur fond noir, ce qui gonfle le nombre brut, donc dix est le nombre honnête et conservateur. Quoi qu’il en soit, ce n’est pas un plan, et ce n’est pas trois.

Maintenant le cas de contrôle, car « H3 découpe toujours votre clip en morceaux » est l’échec inverse et tout aussi faux. Ce fichier suivant est aussi une seule génération de 15 secondes, également 362 images, et le même détecteur ne trouve exactement aucune coupe dedans.

Vue à la première personne de gratte-ciel s’effondrant sur une rue de ville

Une autre génération unique, mêmes 362 images, zéro coupe détectée. Un mouvement de caméra continu pendant les quinze secondes complètes.

Donc la limite n’est pas « quinze secondes de métrage ». C’est quinze secondes de temps d’écran que vous pouvez subdiviser comme vous le souhaitez, d’un plan séquence ininterrompu à dix coupes. Vous le contrôlez depuis le prompt, et vous payez le même prix dans les deux cas.

Les trois endpoints derrière la durée vidéo de MiniMax H3, dans un seul onglet

Pour dépasser les quinze secondes, il faut trois jobs différents : quelque chose pour créer une image d’ancrage, quelque chose pour animer et enchaîner, et quelque chose pour déplacer la caméra sans perdre le sujet. Sur Atlas Cloud, les quatre vivent dans le même catalogue avec une seule clé et un seul solde, ce qui compte ici surtout parce que la chaîne de la section suivante transfère les fichiers entre eux à plusieurs reprises.

ÉtapeModèleRôle dans cette constructionPlage de longueurTarif indiqué, 4 août 2026
Image d’ancrageopenai/gpt-image-2/text-to-imageUne image fixe qui définit tout le lookn/a0,1745 $ pour mon exécution haute
Ouverture, sans image fixeminimax/h3/text-to-videoDirectement du prompt au clip4 à 15 s, défaut 80,14 $ / s
Générations 1 et 2minimax/h3/image-to-videoAnimer une première image, puis enchaîner sur une dernière image4 à 15 s, défaut 80,14 $ / s
Génération 3minimax/h3/reference-to-videoNouvelle position de caméra, même sujet4 à 15 s, défaut 80,14 $ / s

Les trois endpoints H3 ne bénéficient d’aucune remise pour le moment, donc le tarif est le tarif. Vous pouvez tout vérifier sur le catalogue complet des modèles.

Trois pièges de paramètres à connaître avant d’écrire une seule requête, tous tirés des schémas en direct plutôt que de la prose des docs :

  1. ratio se comporte différemment sur chaque endpoint. text-to-video propose six ratios et par défaut 1:1, ce qui vous donnera tranquillement un clip carré si vous oubliez de le définir, et il n’accepte pas adaptive du tout. image-to-video ne propose que adaptive, donc le cadrage suit votre première image. reference-to-video est le seul avec l’ensemble complet plus adaptive.
  2. resolution est 768P ou 2K, par défaut 2K. Les deux niveaux sont sous un seul tarif par seconde dans le catalogue, donc passer à 768P ne vous fait pas économiser d’argent. Utilisez 2K.
  3. image-to-video accepte aussi un end_image optionnel. Vous pouvez fixer les deux extrémités d’un clip, pas seulement le début. Cela transforme l’astuce d’enchaînement ci-dessous en quelque chose que vous pouvez diriger depuis les deux directions.

Comment battre la limite de durée vidéo de MiniMax H3, étape par étape

Voici la construction complète de MIDNIGHT BOWL. Chaque prompt ci-dessous est celui que j’ai réellement envoyé, copiez-les textuellement. Le temps d’exécution total est de trois générations H3 plus une image fixe, et le tout est reproductible dans un onglet de navigateur.

Étape 1 : Verrouiller le look dans une image d’ancrage

Ne commencez pas par la vidéo. Commencez par une image fixe que vous aimez vraiment, car chaque clip de la chaîne héritera de sa lumière, de sa garde-robe et de son enseigne. Se tromper ici coûte cher ; le faire correctement coûte des centimes.

Modèle : openai/gpt-image-2/text-to-image. Paramètres : qualité haute, ratio 16:9.

text
1Photogramme de film, 2h du matin dans une ruelle étroite de Tokyo avec un stand de nouilles. Un chef de 50 ans en tablier marine et bandana blanc, penché au-dessus d’un faitout fumant derrière un comptoir en bois rayé, manches retroussées jusqu’au coude, avant-bras éclairés en orange chaud par une seule ampoule suspendue. L’asphalte luisant de pluie reflète des enseignes rouges et vertes ; des lanternes en papier et une enseigne en bois peinte à la main indiquant « MIDNIGHT BOWL » pendent au-dessus du comptoir. De la vapeur traverse le cadre depuis la droite de la caméra. Tourné avec un objectif 35 mm à f/2, faible profondeur de champ, ombres profondes, clé tungstène chaude contre nuit bleue froide, grain de film visible, pas de superposition de texte.
2

Interface du générateur d’images IA montrant le prompt textuel et l’image résultante

Playground GPT Image 2 sur Atlas Cloud avec le prompt d’ancrage MIDNIGHT BOWL rempli et l’image finale dans le panneau de sortie

GPT Image 2 sur Atlas Cloud : qualité réglée sur haute, 16:9, l’image d’ancrage rendue sur la droite.

4

L’image d’ancrage MIDNIGHT BOWL : un chef en tablier marine derrière un faitout fumant sous une seule ampoule suspendue dans une ruelle pluvieuse

L’image d’ancrage. Tout ce qui suit hérite de cette ampoule, de ce tablier et de cette enseigne.

Étape 2 : Mettre trois plans à l’intérieur d’une seule génération MiniMax H3 de 15 secondes

Voici le geste qui change le budget. Au lieu de demander une seule séquence continue de quinze secondes, donnez au modèle une liste de plans avec des timecodes explicites et les mots CUT TO. Il coupera pour vous, à l’intérieur d’une seule génération facturée.

Modèle : minimax/h3/image-to-video. Paramètres : resolution 2K, duration 15, ratio adaptive (la seule option ici, le cadrage suit votre première image), première image = l’image fixe de l’étape 1.

text
1PLAN 1 (0-5s) : Plan large fixe du stand. La vapeur s’élève ; le chef verse du bouillon dans un bol noir ; la pluie goutte du bord de l’auvent. PLAN 2 (5-10s) : CUT TO un macro gros plan de la louche brisant la surface du bouillon, graisse dorée tourbillonnant, oignon vert haché tombant en arcs lents. PLAN 3 (10-15s) : CUT TO un plan moyen du chef regardant directement dans l’objectif, s’essuyant les mains sur le tablier et disant en japonais avec un sourire fatigué : « Ippai, dozo. » Il pose le bol sur le comptoir et le plan s’attarde sur son visage.
2Audio : forte pluie sur l’auvent, bouillon qui mijote, la louche heurtant le bord du faitout, un train lointain, bourdonnement urbain de fin de nuit bas. Une ligne de dialogue masculin clair en japonais, tonalité de pièce naturelle, pas de musique.
3Garder le même chef, tablier, bandana, ampoule et enseigne dans les trois plans. Coupures franches uniquement, pas de fondus, pas de transitions de caméra. Clé tungstène chaude, nuit bleue froide, look 35 mm, grain de film.
4

Trois choses rendent cela possible. Des plages de secondes explicites, la chaîne de caractères littérale CUT TO, et une clause de continuité en bas qui nomme chaque élément qui doit survivre aux coupes. Supprimez la clause de continuité et le plan 3 revient avec un tablier différent.

Interface du générateur vidéo IA montrant les paramètres d’entrée et la vidéo de sortie terminée

Playground MiniMax H3 image-to-video sur Atlas Cloud avec l’image d’ancrage chargée, durée 15 et 2K sélectionnés, le clip terminé en lecture dans le panneau de sortie

MiniMax H3 image-to-video sur Atlas Cloud : image d’ancrage chargée comme première image, résolution 2K, le clip terminé sur la droite. Notez le curseur de durée et le prix qui le suit. Cette exécution particulière a laissé la durée sur la valeur par défaut de 8, c’est pourquoi le bouton indique 1,12 $ ; à 15, il indique 2,10 $.

Chef préparant de la nourriture dans un stand de rue fumant par une nuit pluvieuse

Génération 1. Un job facturé, trois plans (coupes mesurées à 4,92 s et 9,13 s), une ligne de dialogue avec synchronisation labiale, 2560x1440 natif, et audio stéréo 32 kHz dans le même fichier.

Étape 3 : Enchaîner les 15 secondes suivantes à partir de la dernière image

Il n’y a pas de paramètre d’extension. L’enchaînement est manuel et trivial : extrayez la dernière image de la génération 1 et renvoyez-la comme première image de la génération 2.

bash
1ffmpeg -sseof -0.08 -i generation-1.mp4 -frames:v 1 -q:v 2 handoff-frame-01.jpg
2

Modèle : minimax/h3/image-to-video à nouveau. Paramètres : première image = handoff-frame-01.jpg, resolution 2K, duration 15, ratio adaptive.

La discipline importante ici est ce que vous laissez de côté. Ne décrivez pas à nouveau le chef. Il est déjà dans les pixels que vous venez de fournir, et le redécrire donne au modèle la permission de le réinterpréter.

text
1Continuer à partir de cette image exacte, même homme, même tablier, même lumière. PLAN 1 (0-5s) : Il fait glisser le bol sur le comptoir avec les deux mains vers la caméra. PLAN 2 (5-10s) : CUT TO par-dessus l’épaule des mains d’un client soulevant des baguettes en bois et les séparant, poignets de manches d’un imperméable gris mouillé visibles. PLAN 3 (10-15s) : CUT TO un macro extrême de nouilles tirées, vapeur s’enroulant devant l’objectif, bouillon dégoulinant dans le bol.
2Audio : pluie continue et mijotage repris d’avant, céramique sur bois, claquement de baguettes, bruit de slurp, même train lointain. Pas de musique, pas de narration.
3Coupures franches uniquement. Même clé tungstène de l’ampoule suspendue, même nuit bleue froide derrière, même faible profondeur de champ 35 mm et grain de film.
4

Chef souriant avec un bandana servant un bol fumant de nourriture

Génération 2, démarrée à partir de la dernière image de la génération 1. Même chef, même motif de bandana, même haut marine, même cuisine derrière lui. Encore trois plans, coupes à 4,92 s et 9,04 s.

Chef souriant avec un bandana sert un bol noir fumant

Boucle de deux secondes à travers la couture entre la génération un et la génération deux

La couture elle-même : dernière seconde de la génération 1 dans la première seconde de la génération 2. Pas d’effet de transition, juste une coupe.

Étape 4 : Déplacer la caméra avec reference-to-video

L’enchaînement de dernière image a une limitation intégrée : il reprend toujours là où se trouvait la caméra précédente. Pour passer à un angle vraiment nouveau tout en gardant le même sujet, changez d’endpoint.

Modèle : minimax/h3/reference-to-video. Paramètres : refers = l’image d’ancrage de l’étape 1 plus la dernière image de la génération 2, resolution 2K, duration 15, et définissez ratio explicitement sur 16:9 ici plutôt que de le laisser sur adaptive. Cet endpoint accepte jusqu’à neuf images de référence, trois vidéos de référence et trois clips audio, avec une vidéo de référence plafonnée à 15 secondes au total (MarkTechPost, août 2026).

text
1Plan large en contre-plongée depuis le milieu de la rue mouillée, regardant vers le même stand de nouilles, le même chef à l’intérieur. PLAN 1 (0-6s) : La pluie strie le cadre ; deux clients en silhouette sont assis au comptoir ; le chef travaille sous l’ampoule unique. PLAN 2 (6-11s) : CUT TO l’enseigne en bois peinte à la main alors qu’un type blanc cinétique s’anime à côté d’elle, lettre par lettre : « MIDNIGHT BOWL - OPEN TILL 4AM ». Le type reste net et verrouillé sur l’enseigne pendant que la caméra dérive. PLAN 3 (11-15s) : CUT BACK au plan large alors que le chef lève les yeux, fait un petit geste de la main, et l’ampoule vacille une fois.
2Audio : pluie, ambiance de rue, un scooter qui passe, le même train faible, un seul impact de basse faible lorsque le type atterrit. Pas de dialogue.
3Même chef, même tablier et bandana, même enseigne et couleurs de lanternes que les images de référence. Coupures franches uniquement, grain de film, 35 mm, tungstène chaud contre bleu froid.
4

Cette instruction ratio n’est pas de la paranoïa. Voici ce qui se passe lorsque vous laissez le menu déroulant tranquille sur cet endpoint :

Interface du générateur vidéo IA affichant un message d’erreur de validation d’entrée

Playground MiniMax H3 reference-to-video sur Atlas Cloud avec deux images de référence chargées, ratio laissé sur adaptive, et une erreur de validation 400 dans le panneau de sortie

MiniMax H3 reference-to-video sur Atlas Cloud : les deux images de référence chargées, résolution 2K, et Aspect Ratio toujours sur sa valeur par défaut adaptive. L’exécution revient 400 : « ratio is required for t2va (text-only) and cannot be 'adaptive'; allowed: 16:9/4:3/1:1/3:4/9:16/21:9 ». Définissez-le explicitement et la même requête passe, ce qui a permis de créer le clip ci-dessous. Notez aussi le texte de la page au-dessus qui indique « 768P/1080P/2K, 5s/10s » alors que le schéma dit 768P ou 2K et 4 à 15 secondes. Faites confiance au schéma.

Je n’ai pas réussi à faire en sorte que le menu déroulant du ratio du playground conserve une modification scriptée après trois tentatives, donc la génération 3 réussie ci-dessous est venue de l’API avec ratio: "16:9" défini dans le corps de la requête. L’exécution échouée n’a rien coûté.

Chef préparant de la nourriture pour des clients dans un stand de nourriture de rue par une nuit pluvieuse

Génération 3. Nouvelle position de caméra de l’autre côté de la rue mouillée, même chef, et le type blanc animé sur l’enseigne reste net comme un rasoir pendant que la caméra dérive. Coupes à 5,29 s et 10,96 s.

Comparaison côte à côte d’un stand de nourriture japonais de nuit

Comparaison côte à côte de l’image d’ancrage originale et d’une image de la génération trois, montrant le même chef et la même enseigne 41 secondes et deux transferts plus tard

À gauche : l’ancrage de l’étape 1. À droite : la génération 3 à la marque des 41 secondes, deux transferts plus tard. Même chef, même bandana, même haut marine, même enseigne peinte à la main, même lanterne rouge.

Étape 5 : Mesurer la durée vidéo réelle de MiniMax H3, puis assembler

Deux habitudes pour finir. D’abord, faites une répétition bon marché avant d’acheter quinze secondes. Même prompt, duration 4, et vous saurez si le modèle a compris votre liste de plans pour environ un quart du prix.

Chef cuisinant dans un stand extérieur fumant dans une ruelle pluvieuse

La répétition de 4 secondes de la même liste de plans. Mesurée à 107 images, soit 4,458 secondes, exactement ce que prédit la grille. Assez pour voir si le modèle a compris la scène avant d’acheter la prise complète.

Deuxièmement, mesurez chaque fichier avant de couper, car aucun n’a la longueur que vous avez demandée :

bash
1# nombre d’images réel et durée du conteneur, pas durée x 24
2ffmpeg -i generation-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | grep -o 'frame= *[0-9]*' | tail -1
3
4# concaténation par coupe franche, sans transitions, sans ré-encodage
5printf "file 'generation-1.mp4'\nfile 'generation-2.mp4'\nfile 'generation-3.mp4'\n" > list.txt
6ffmpeg -f concat -safe 0 -i list.txt -c copy midnight-bowl-45s.mp4
7

Trois fichiers à 362 images chacun donnent 1086 images, que j’ai mesurées sur le concaténat final : 45,25 secondes d’image, pas 45. Minime, jusqu’à ce que vous en assembliez quarante.

Variations : dialogue, vertical et la répétition de 4 secondes

Une fois la chaîne opérationnelle, les mêmes trois endpoints couvrent la plupart de ce que les gens demandent réellement.

Dialogue en champ-contrechamp. Mettez les deux côtés d’une conversation à l’intérieur d’une seule génération plutôt que sur deux. La synchronisation labiale et la bande sonore sont continues au sein d’un même job et indépendantes entre les jobs, donc une conversation répartie sur deux générations vous donne deux tonalités de pièce non liées. Gardez les échanges à l’intérieur d’un seul clip.

Jeune femme en pleurs regarde un homme dans une cage d’escalier

Deux jeunes acteurs en pleine dispute sur un palier d’escalier en béton, lumière dure de fenêtre les baignant, prise de vue par-dessus une épaule

Le champ-contrechamp fonctionne, tant que les deux angles vivent dans la même génération.

Vertical. Sur image-to-video, vous ne définissez pas le ratio, vous définissez la première image. Générez une image d’ancrage haute et adaptive la suit. L’un des clips que j’ai mesurés est revenu à 1280x2276 avec le même nombre d’images de 243 que ses frères en 16:9, donc la grille d’images ne se soucie pas de votre format d’image.

La répétition de 4 secondes comme pratique courante. À 0,14 $ par seconde, quatre secondes coûtent 0,56 $ contre 2,10 $ pour une prise complète. Sur une construction de neuf plans, répéter chaque génération avant de s’engager coûte moins cher qu’un seul job de 15 secondes gaspillé.

Là où la limite mord vraiment. Tout ce qui nécessite une performance ininterrompue de plus de quinze secondes. Un monologue continu de 30 secondes n’est pas un problème d’enchaînement, c’est un problème de synchronisation labiale à travers une couture, et aucune discipline de prompt ne le résout.

Combien coûtent 45 secondes de durée vidéo MiniMax H3

À 0,14 $ par seconde, une génération complète de 15 secondes coûte 2,10 $. C’est le seul nombre dont vous avez besoin ; tout le reste est une multiplication. La colonne intéressante est la dernière.

Longueur cibleGénérations à 15 sCoût en ligne droiteRéaliste à un taux de rétention de 1 sur 3Plans livrésCoût par plan
15 s12,10 $6,30 $30,70 $
45 s (cette construction)36,30 $18,90 $90,70 $
60 s48,40 $25,20 $120,70 $
3 min1225,20 $75,60 $360,70 $
10 min4084,00 $252,00 $1200,70 $

Lisez la colonne par plan et la panique concernant la limite s’évapore en grande partie. Planifier une génération par plan vous coûte 2,10 $ par plan. Mettre trois plans dans chaque génération vous coûte 0,70 $. Même modèle, même limite de quinze secondes, un tiers de la facture.

La colonne du taux de rétention est celle que les gens oublient. Rien d’utilisable ne revient du premier coup à chaque fois, et un plan qui suppose que ce sera le cas est un plan qui manque de budget à la deuxième minute.

Pour contextualiser où se situe la limite par rapport à tout le reste du catalogue, tous ces tarifs sont en vigueur au 4 août 2026 :

ModèleGénération unique maxNotableTarif indiqué
minimax/h34 à 15 s768P ou 2K, audio stéréo natif0,14 $ / s
bytedance/seedance-2.04 à 15 s, ou -1 pour auto480p à 4K natif0,112 $ / s
kwaivgi/kling-v3.0-pro3 à 15 sPossède un indicateur multi_shot explicite avec prompts par plan0,095 $ / s, 15% de réduction
alibaba/wan-2.72 à 15 sPlancher le plus large, 720P ou 1080P0,10 $ / s
google/veo3.14, 6 ou 8 s uniquementPas d’option 15 secondes du tout0,20 $ / s
alibaba/wan-2.5/video-extendajoute 5 à 10 sÉtend un fichier existant plutôt que de générer du neuf0,052 $ / s

Deux conclusions. Les quinze secondes de H3 sont au sommet de la génération actuelle, pas en retard, et Veo 3.1 plafonne à huit. Et si ce dont vous avez vraiment besoin est un long fichier à partir d’un seul endpoint, un modèle d’extension dédié existe, mais changer de modèle en cours de chaîne signifie changer de visages.

Une note honnête sur l’audio, les poids et la durée vidéo de MiniMax H3

Trois réserves, dont aucune ne modifie la limite.

L’audio ne se transmet pas entre les générations. Chaque job compose sa propre bande stéréo à partir de zéro. Trois clips enchaînés signifient trois fonds de pluie non liés, et vous entendrez le changement même lorsque l’image correspond parfaitement. Deux solutions : écrivez la clause d’ambiance à l’identique dans chaque prompt pour que les fonds sonores soient proches, ou coupez le son du montage assemblé et posez une seule piste continue en dessous. Pour le dialogue, gardez l’échange à l’intérieur d’une seule génération.

Six petites ondes sonores noires à côté d’une longue onde sonore orange

Plusieurs fragments d’onde audio courts séparés avec des espaces visibles entre eux sur la gauche, une seule onde continue sur la droite, sur un fond pâle unifié

À gauche : ce que l’enchaînement vous donne réellement. À droite : ce que vous devez construire en dessous.

L’auto-hébergement ne débloque pas de clips plus longs. Les poids ouverts sont arrivés le 2 août 2026 (Hugging Face, août 2026), et les exécuter en local vous donne un petit côté de 768 pixels arrondi aux multiples de 32, selon les notes de configuration de ComfyUI. La grille de 17 images et le plafond de 15 secondes sont les mêmes. La licence communautaire ne couvre pas non plus l’UE, le Royaume-Uni, la Corée ou les États-Unis pour le moment, donc l’API est la voie pratique pour la plupart des équipes.

Le modèle peut silencieusement vous réécrire. J’ai eu H3 qui renvoyait completed sur un job où il avait silencieusement supprimé un élément que j’avais demandé. Extrayez des images de chaque clip et regardez-les avant d’assembler. Sur une chaîne de neuf plans, un clip non surveillé est une couture gaspillée.

Questions fréquemment posées

Quelle est la durée vidéo maximale de MiniMax H3 ?

Quinze secondes. Le paramètre duration est une énumération d’entiers de 4 à 15 avec une valeur par défaut de 8, donc 16 est rejeté et 7,5 n’est pas une valeur valide. Chaque clip est à 24 FPS jusqu’à du 2K natif avec un son stéréo généré en même temps que l’image.

MiniMax H3 peut-il générer des vidéos plus longues que 15 secondes ?

Pas en une seule génération, et l’API n’a pas de paramètre d’extension. Vous dépassez 15 secondes par enchaînement : extrayez la dernière image d’un clip comme première image du suivant, utilisez reference-to-video lorsque vous avez besoin d’un nouvel angle de caméra, puis concaténez avec des coupures franches. Certains frontaux grand public superposent leur propre fonction d’extension sur H3 pour atteindre environ 30 secondes, mais c’est le produit qui fait l’assemblage, pas le modèle qui génère plus longtemps.

Pourquoi mon clip MiniMax H3 de 15 secondes fait-il en réalité 15,08 secondes ?

Parce que les durées sont arrondies à la hausse sur une grille de 17 images. Demander 15 secondes renvoie 362 images, soit 17x21+5, et à 24 FPS cela fait 15,083 secondes. Demander 10 renvoie 243 images, soit 10,125 secondes. Seul duration: 8 tombe sur une seconde entière, à exactement 192 images. Si votre montage est image par image, mesurez chaque fichier plutôt que de calculer durée x 24.

Puis-je mettre plusieurs plans à l’intérieur d’une seule génération MiniMax H3 ?

Oui, et c’est la plus grande économie disponible. Écrivez des plans avec timecodes explicites dans le prompt avec les mots littéraux CUT TO, et ajoutez une clause de continuité nommant ce qui doit survivre aux coupes. J’ai mesuré dix coupes nettes à l’intérieur d’une seule vraie génération de 15 secondes. Trois plans par génération est confortable et fiable, ce qui transforme un clip de 2,10 $ en trois plans de 0,70 $.

Une durée vidéo MiniMax H3 plus courte coûte-t-elle moins cher ?

Oui, linéairement. La facturation est à la seconde à 0,14 $, donc une répétition de 4 secondes coûte 0,56 $ contre 2,10 $ pour une pleine prise de 15 secondes. La résolution est une autre histoire : 768P et 2K sont sous un seul tarif dans le catalogue, donc réduire la résolution n’économise rien. Raccourcissez le clip, pas les pixels.

De combien de clips MiniMax H3 ai-je besoin pour une vidéo d’une minute ?

Quatre, si vous remplissez les quinze secondes à chaque fois. Mais comptez en plans plutôt : quatre générations à trois plans chacune vous donnent douze plans de couverture, ce qui est une quantité normale pour une publicité d’une minute. Multipliez ensuite votre budget par environ trois pour tenir compte des prises que vous jetez.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles