MiniMax a déployé H3 vendredi. En vingt-quatre heures, Seedance 2.5 était entre les mains des utilisateurs, et la chronologie s'est réduite à une seule conversation : trente secondes, 4K natif, cinquante entrées de référence. Le post de lancement de H3 se trouvait en dessous, discrètement, presque personne n'ayant exécuté un vrai test dessus.
Je comprends pourquoi. Trente secondes, c'est un excellent chiffre. Ça tient dans un titre.
Mais si vous fabriquez réellement des courts métrages verticaux, vous savez que ce qui ruine votre nuit, ce n'est pas la seconde trente. C'est le plan 4. La mâchoire du protagoniste masculin se décale d'un demi-centimètre, son jabot perd un pli, et le spectateur balaye avant que l'accroche ne porte. Personne ne se désabonne parce qu'un clip durait quinze secondes au lieu de trente. Ils se désabonnent parce que le gars au gros plan n'est pas le gars du plan large.
J'ai donc zappé le duel de fiches techniques. J'ai construit une seule planche de rotation de personnage, une seule planche de décors en six panneaux, rédigé une seule invitation pour un mini-drame gothique de 15 secondes, et envoyé le même paquet aux deux côtés. Puis j'ai fixé le visage.
Points clés
- Les deux sont réels, mais pas également accessibles. Les trois points d'accès de H3 (texte, image et référence vers vidéo) sont en ligne et appelables immédiatement. L'API de Seedance 2.5 est disponible chez ByteDance, mais sur la plateforme multi-modèles où j'ai tout exécuté, il s'agit encore d'une page de lancement ; donc côté Seedance dans mon duel, c'est Seedance 2.0 Référence-vers-Vidéo. Je le signale chaque fois que c'est pertinent.
- Les spécifications se séparent nettement. Seedance 2.5 = jusqu'à 30 secondes en une génération, 4K natif, jusqu'à 50 références multimodales, édition au niveau régional. H3 = 5 à 15 secondes, 2K natif à 24 ips, 9 images + 3 vidéos + 3 clips audio (12 fichiers max), son stéréo sur chaque sortie, édition d'instruction sur l'ensemble du clip.
- La stabilité des personnages est un problème d'empaquetage, pas un problème de génération de modèle. Avec une seule planche de rotation composite plus une planche d'éclairage, les deux modèles ont conservé le même visage et la même tenue. Ni le nombre de générations ni le plan n'ont sauvé ou ruiné la prise ; c'est le paquet qui a fait le travail.
- Le modèle que personne n'a testé est déjà classé troisième. Dans l'arène image-vers-vidéo d'Artificial Analysis, H3 se situe à 1 185 Elo, derrière Seedance 2.0 à 1 196. Seedance 2.5 n'est pas encore présent du tout.
- Les deux génèrent leur propre audio. H3 accepte également jusqu'à trois références audio pour attribuer une voix à un personnage, ce qui supprime toute une étape de TTS et de synchronisation dans un pipeline de mini-drame.
- Interrogez-vous sur les pixels par image, pas sur les secondes. Même paquet de référence, même durée : la référence-vers-vidéo de H3 renvoie du 1440p, celle de Seedance 2.0 renvoie du 720p. Cela redéfinit toute la question du coût.
Les propres chiffres associés à Seedance 2.5 ne sont pas encore disponibles. Je les ajouterai le jour où le point d'accès s'ouvrira là où je teste.
Le résultat Seedance 2.5 vs MiniMax H3, avant toute théorie
Avant toute théorie, voici ce que produit le flux de travail. Voici quatre plans extraits d'un clip vertical fini de 15 secondes et disposés en mosaïque. Il s'agit de la propre exécution de référence H3 de MiniMax, construite exactement à partir de la planche de personnage et de la planche de décors que vous verrez aux étapes 1 et 2, en 1440x2560 natif. Mes propres exécutions du même paquet arrivent plus tard, dans le tutoriel, avec l'état du terrain de jeu visible.
Elle atteint la porte sculptée, qui est le panneau 4 de la planche de décors, puis la confrontation dans le couloir, puis un gros plan serré sur lui, puis le plan à deux. Sa raie se sépare de la même façon de profil et en gros plan. Sa couronne tressée demi-queue résiste à un gros plan sur le visage, ce qui est exactement là où la plupart des modèles reconstruisent silencieusement un visage. Le corsage en dentelle crème conserve la même encolure et le même poignet de manche de la première à la dernière image.
C'est tout le test. Pas trente secondes. Quatre plans et une mâchoire.
Pourquoi Seedance 2.5 vs MiniMax H3 a éclaté la même semaine, et pourquoi la plupart des tests de cohérence des personnages sont inutiles
MiniMax a publié H3 le 30 juillet, un modèle vidéo multimodal généraliste qui lit texte, images, vidéo et audio comme un seul contexte et renvoie des clips de 5 à 15 secondes jusqu'à 2K avec son stéréo natif. Il peut également éditer des séquences existantes et transférer le mouvement d'un clip à un autre, et MiniMax a annoncé que les poids suivraient dans les jours suivants (Reuters, juillet 2026).
Seedance 2.5 a atterri dans la même fenêtre avec un chiffre plus fort : 30 secondes en une seule génération, 4K natif, et jusqu'à 50 entrées de référence multimodales en une seule tâche (The Next Web, juillet 2026). Son API est déjà entre les mains des développeurs, avec une édition localisée qui redessine une partie d'une image tout en conservant la performance, l'éclairage et le comportement de la caméra, une référence-vers-vidéo qui accepte les fonds verts ou les maquettes 3D en blanc, onze langues, et un mode vidéo longue expérimental atteignant 180 secondes (CineD, juillet 2026).
L'écart d'attention est la partie intéressante. Presque chaque article que j'ai pu trouver était un clip 2.5. Pendant ce temps, les chiffres de l'arène publique disent autre chose : sur le classement image-vers-vidéo d'Artificial Analysis, Seedance 2.0 en 720p mène avec 1 196 Elo, Gemini Omni Flash suit à 1 195, et MiniMax H3 est déjà troisième à 1 185, quatre jours après sa sortie. Seedance 2.5 n'a encore aucune évaluation là-bas (Artificial Analysis, juillet 2026). Le modèle qui suscite le moins de discussions est celui qui a le rapport score/attention le plus élevé.
Passons maintenant à la partie qui décide réellement de votre résultat, car elle n'a presque rien à voir avec le logo que vous choisissez.
La plupart des tests de cohérence des personnages échouent avant même que le modèle ne soit impliqué. Quatre modes d'échec, et les quatre sont à vous de corriger :
| Mode d'échec | Ce que vous voyez dans la sortie | La correction |
|---|---|---|
| Références multi-vues envoyées comme fichiers séparés | Chaque plan a un visage « presque juste » et aucun ne s'accorde | Composez les vues en une seule image, puis attribuez des rôles dans l'invitation (« l'homme à GAUCHE », « la femme à DROITE ») |
| Réécrire la description du personnage à chaque plan | Tenue et accessoires dérivent de plan en plan | Écrivez le bloc d'identité une fois et réutilisez-le textuellement ; seuls la caméra et l'action changent par plan |
| Laisser l'éclairage bouger avec la scène | Le visage est structurellement reconstruit dans la nouvelle lumière | Construisez une planche de décors séparée qui verrouille la direction de la lumière, le brouillard et la réflexion au sol, et fournissez-la comme référence |
| Traiter la durée maximale comme une métrique de qualité | Une dérive en 30 secondes tue les 30 secondes | Coupez à la granularité que vous pouvez relancer, puis parlez de longueur |
La première ligne est celle que les gens comprennent le plus mal. Envoyez six images à vue unique et le modèle les traite comme six personnes candidates et les moyenne. Envoyez une seule composition propre et il les traite comme une seule personne vue sous trois angles. Mêmes pixels, résultat complètement différent.
Fiche technique Seedance 2.5 vs MiniMax H3, et ce que vous pouvez réellement appeler aujourd'hui
Séparez la capacité de la disponibilité et la tension devient claire. En capacité brute, Seedance 2.5 mène en durée, plafond de résolution, nombre de références et granularité d'édition. En disponibilité, H3 est celui qui a trois points d'accès en ligne sur une plateforme de modèle généraliste cette semaine. Si vous faites une comparaison de modèles vidéo IA pour la planification 2026, cette deuxième colonne compte autant que la première.
| MiniMax H3 | Seedance 2.5 | Seedance 2.0 Réf.-vers-Vidéo (ce que j'ai exécuté) | |
|---|---|---|---|
| Longueur max, une génération | 5 à 15 s | jusqu'à 30 s, sans couture (mode bêta à 180 s, expérimental) | menu clips courts, voir page modèle |
| Résolution | 2K natif, 1440p petit côté en 16:9 à 9:16 ; un palier 768p est annoncé à venir | 4K natif, couleur 10 bits | jusqu'à 720p sur ce point d'accès |
| Fréquence d'images | 24 ips | non publié séparément | non publié séparément |
| Entrées de référence | 9 images + 3 vidéos + 3 audios, 12 fichiers au total | jusqu'à 50 références multimodales | 9 images + 3 vidéos + 3 audios |
| Audio natif | oui, chaque sortie, stéréo | oui, plus 11 langues de sous-titres et voix | oui |
| Granularité d'édition | éditions d'instructions sur l'ensemble du clip (changer personnage, fond, éclairage, dialogue) | éditions au niveau régional qui redessinent une partie d'une image | éditions d'instructions sur l'ensemble du clip |
| Limite d'invitation | 7 000 caractères | non publié | non publié |
| Poids ouverts | annoncé pour les jours suivant le lancement | non annoncé | non annoncé |
| Elo I2V Artificial Analysis, 31 juil. 2026 | 1 185 (3e) | pas encore évalué | 1 196 (1er, entrée Dreamina 720p) |
| Appelable sur la plateforme testée | oui, 3 points d'accès | pas encore, page de lancement | oui |
Divulgation complète sur la configuration de test. Seedance 2.5 n'était pas ouvert sur ma plateforme lorsque j'ai exécuté ce test, donc le côté Seedance est Seedance 2.0 Référence-vers-Vidéo, le membre actuellement déployé de la même famille avec le même système de référence quadrimodal. Là où 2.5 changerait la réponse, je le dis. La page Seedance 2.5 est un avis de lancement pour l'instant.
Tout ce qui suit se déroule dans un seul onglet de navigateur, avec une seule clé, trois modèles au total :
| Étape | Modèle | Ce qu'il produit | Réglages clés | Ce qui détermine le coût |
|---|---|---|---|---|
| 1 | OpenAI GPT Image 2 Texte-vers-Image | la planche de rotation du personnage | qualité haute, 16:9 | par image, paiement à l'utilisation, tarif en vigueur sur la page du modèle |
| 2 | même modèle, deuxième exécution | la planche de décors et d'éclairage en six panneaux | qualité haute, 16:9 | par image, paiement à l'utilisation |
| 3 | MiniMax H3 Référence-vers-Vidéo | le clip 9:16 avec audio natif | 9:16, 2K, durée 5 pour un test et 15 pour le vrai montage | secondes x résolution, facturé à la seconde |
| 4 | Seedance 2.0 Référence-vers-Vidéo | l'exécution de contrôle, entrées identiques | 9:16, meilleure résolution disponible, même durée | secondes x résolution, facturé à la seconde |
| 5 | H3 Référence-vers-Vidéo, clip en entrée | un plan corrigé sans tout relancer | même résolution, courte durée | secondes x résolution, facturé à la seconde |
H3 dispose également d'entrées texte-vers-vidéo et image-vers-vidéo si vous voulez une base texte pure ou un contrôle de première et dernière image.
Une chose de plus à savoir avant de planifier un lot : le texte à l'écran. Cette séquence de titre H3 de 15 secondes contient des crédits en anglais à travers huit coupes franches sans une seule faute d'orthographe, ce qui est l'une des choses les plus difficiles à stabiliser dans une vidéo générée.
Le flux de travail du mini-drame Seedance 2.5 vs MiniMax H3, étape par étape
Cinq étapes. Copiez les invitations exactement comme écrites, y compris les parties laides. Je ne les ai pas nettoyées pour l'article et vous ne devriez pas les nettoyer pour le modèle.
Étape 1 : Construire la planche de personnage avec GPT Image 2
Fabriquez le paquet de référence avant de faire une vidéo. Une image, deux personnages, trois vues chacun, fond blanc pur sans couture, éclairage de studio uniforme. Cela supprime toute ambiguïté sauf celle qui vous importe : à quoi ressemble cette personne.
plaintext1Une planche de référence de rotation de personnage en pied sur fond blanc pur sans couture, deux personnages côte à côte, six figures au total, éclairage de studio neutre et uniforme, pas d'ombres au sol, pas de texte, pas d'étiquettes, pas de filigrane. 2 3MOITIÉ GAUCHE, protagoniste masculin, trois vues en ligne : face, profil droit, dos. Fin de la vingtaine, teint pâle, cheveux ondulés mi-longs foncés, mâchoire marquée. Portant un manteau-queue-de-pie en velours noir tombant au sol avec une broderie ton-sur-ton subtile sur les revers et les poignets, un gilet en brocart noir, un jabot en soie noire, un pantalon noir droit, des chaussures derby en cuir noir ciré. Bras relâchés le long du corps, expression neutre. 4 5MOITIÉ DROITE, protagoniste féminine, trois vues en ligne : face, profil droit, dos. Début de la vingtaine, teint clair, longs cheveux ondulés châtains avec une couronne tressée demi-queue. Portant une robe victorienne en dentelle de coton crème, manches longues avec poignets en dentelle, corsage ajusté avec petits boutons, jupe longue jusqu'aux chevilles, chaussures à talon bas et bride en crème. Bras relâchés le long du corps, expression neutre. 6 7Réalisme photographique, échelle cohérente entre les six figures, pieds alignés sur la même ligne de base, mise au point nette d'un bord à l'autre.
Réglages : modèle OpenAI GPT Image 2 Texte-vers-Image, Qualité haute, Rapport hauteur/largeur 16:9, tout le reste par défaut.
GPT Image 2 Texte-vers-Image sur Atlas Cloud, exécution terminée : l'invitation de rotation à gauche, six figures sur une seule feuille blanche dans le panneau SORTIE.
C'est la forme cible. Six figures, une ligne de base, rien en arrière-plan pour discuter :
Le paquet de référence qui a piloté le clip de démonstration : protagoniste masculin en velours noir, protagoniste féminine en dentelle victorienne crème, trois vues chacun, un fichier.
Ma propre exécution GPT Image 2 de l'invitation de l'étape 1, à titre de comparaison avec la référence ci-dessus.
Étape 2 : Verrouiller le décor avec une planche de scène en six panneaux
Vous avez tenu le visage. La lumière vous trahira encore. La deuxième image de référence fixe six positions de caméra, la direction du clair de lune, la quantité de brouillard dans l'air et le degré d'humidité du sol. Vous dites au modèle que ce film a exactement un seul éclairage.
plaintext1Une planche de décors cinématographique en six panneaux, 2 rangées par 3 colonnes, fines gouttières noires entre les panneaux, chaque panneau légendé en petits caractères blancs élégants en lettres capitales espacées en bas de ce panneau. Sujet : l'intérieur d'un château gothique abandonné la nuit. Lumière de lune froide et bleue, brouillard bas dérivant, sol en pierre humide et réfléchissant, hautes fenêtres en vitraux, appliques en fer avec petites flammes chaudes, noirs profonds désaturés, lourds rideaux de velours. Aucune personne dans aucun panneau. 2 3Panneau 1, légende « PLAN LARGE D'ÉTABLISSEMENT - COULOIR » : un long couloir à colonnes s'éloignant vers une fenêtre en vitrail éclairée. 4Panneau 2, légende « ANGLE BAS - CLAIR DE LUNE SUR LE SOL » : caméra basse, un rayon de lune balayant des dalles humides. 5Panneau 3, légende « COMPOSITION PORTE & ESCALIER » : une porte en arc encadrant un escalier en pierre incurvé. 6Panneau 4, légende « DÉTAIL RAPPROCHÉ - PORTE SCULPTÉE » : plan serré d'une lourde porte en bois sculpté avec une poignée en fer. 7Panneau 5, légende « VUE PRÈS DE LA FENÊTRE - BROUILLARD & RIDEAUX » : haute fenêtre, brouillard entrant, bord de rideau au premier plan. 8Panneau 6, légende « CADRE FINAL AFFICHE - SALLE VIDE » : salle vide symétrique, tapis d'escalier à motifs menant à la fenêtre. 9 10Photographique, cinématographique, grain de pellicule, étalonnage cohérent sur les six panneaux.
Réglages : même modèle, Qualité haute, Rapport hauteur/largeur 16:9.
La planche de décors qui a piloté le clip de démonstration : six intérieurs de château gothique, un étalonnage, légendes lisibles.
Ma propre exécution GPT Image 2 de l'invitation de la planche de l'étape 2.
Étape 3 : Générer le plan avec MiniMax H3 référence-vers-vidéo
Deux images de référence plus une invitation portant les positions de caméra et la direction audio. Le son est produit dans le même passage, donc il n'y a pas d'étape séparée de voix ou de musique. Gardez la durée courte pendant que vous ajustez, puis passez à 15 pour le vrai montage.
plaintext1L'image de référence 1 est la planche de personnage : l'homme à GAUCHE est le protagoniste masculin, la femme à DROITE est la protagoniste féminine. Conservez les deux identités exactement telles que montrées : sa mâchoire, ses cheveux ondulés foncés, son manteau-queue-de-pie en velours noir, son gilet en brocart noir et son jabot en soie noire ; ses cheveux châtains demi-queue tressée et sa robe victorienne en dentelle crème. L'image de référence 2 est la planche de décors et d'éclairage : faites correspondre sa lumière de lune froide et bleue, son brouillard dérivant, son sol en pierre humide et réfléchissant et ses tons noirs désaturés. 2 39:16 vertical, aspect premium de mini-drame en prise de vue réelle, faible profondeur de champ, contraste cinématographique, pas de sous-titres, pas de texte à l'écran, pas de filigrane. 4 5Plan 1 : Plan moyen rapproché, caméra avançant lentement. La protagoniste féminine se tient dans le couloir éclairé par la lune, respirant superficiellement, les yeux fixés sur quelque chose hors champ à droite. Le brouillard passe à hauteur de ses genoux. 6Plan 2 : Coupe franche. Par-dessus l'épaule depuis derrière elle, le protagoniste masculin sort de l'arche sombre dans la lumière de la lune, le manteau attrapant la lumière, expression froide et curieuse. 7Plan 3 : Gros plan serré sur son visage, à moitié éclairé par la fenêtre, puis un gros plan correspondant sur le sien alors qu'elle refuse de détourner le regard. 8 9Audio : bourdonnement grave soutenu, écho de pierre lointain, sa respiration irrégulière, un pas lourd alors qu'il entre dans la lumière, une seule nappe de cordes douce sur la dernière coupe.
Réglages : modèle MiniMax H3 Référence-vers-Vidéo, Résolution 2K, Durée 8 (le curseur par défaut ; poussez à 15 pour le vrai montage), Rapport hauteur/largeur adaptatif, et les deux fichiers dans Matériaux de référence. Le panneau les compte comme 2 sur 9, vous avez donc largement la place d'ajouter des plaques de tenue ou d'accessoires plus tard.
À noter ce qui s'est passé avec le rapport. J'ai laissé Rapport hauteur/largeur sur adaptatif et j'ai seulement écrit « 9:16 vertical » dans l'invitation. H3 est de toute façon revenu vertical, donc il a lu le cadre à partir du texte plutôt que d'avoir besoin du champ du formulaire.
MiniMax H3 Référence-vers-Vidéo sur Atlas Cloud, exécution terminée : les deux fichiers de référence chargés comme 2 sur 9, résolution 2K, et le clip vertical généré en lecture dans le panneau SORTIE.
La première image est la protagoniste féminine dans le corsage en dentelle crème, debout dans le couloir du panneau 1 de la planche, avec du brouillard à hauteur de genou et la lumière de la lune frappant le sol humide exactement là où la planche l'avait placée. Les deux images de référence ont atterri.
Étape 4 : Exécuter le contrôle Seedance 2.5 vs MiniMax H3 avec le paquet identique
Ne changez pas un mot. Mêmes deux images de référence, même invitation, modèle différent. J'ai laissé la durée par défaut de chaque page tranquille plutôt que de forcer une correspondance, et je dis ce que chacune a renvoyé ci-dessous. Reformuler une invitation « pour » l'autre modèle est exactement ainsi que les comparaisons commencent à mentir.
plaintext1Même invitation qu'à l'étape 3, textuellement. Ne la reformulez pas pour l'autre modèle.
Réglages : modèle Seedance 2.0 Référence-vers-Vidéo, Résolution 720p, mêmes deux images de référence dans Images de référence (encore 2 sur 9, avec des emplacements séparés pour jusqu'à 3 vidéos de référence et 3 fichiers audio de référence). Durée laissée par défaut sur la page, ce qui est revenu comme un clip de 10 secondes.
Seedance 2.0 Référence-vers-Vidéo sur Atlas Cloud, exécution terminée avec le paquet de référence et l'invitation identiques de l'étape 3, et un résultat de 10 secondes dans le panneau SORTIE.
Voici ce que les deux panneaux SORTIE ont réellement montré, et je le rapporte tel quel plutôt que de choisir un gagnant.
Les deux exécutions ont tenu le personnage. Même robe en dentelle crème avec la même encolure et les mêmes poignets de manche, mêmes cheveux châtains, même couloir de brouillard et de lune extrait de la planche. Aucune des deux n'a inventé une femme différente. Le paquet de référence a fait ce travail des deux côtés, ce qui est la conclusion qui m'importe le plus.
Les différences concernaient la forme, pas le visage. Ce point d'accès Seedance a délivré du 720p ; H3 a délivré du 2K à partir d'entrées identiques. Et le cadre a divergé : H3 a lu « 9:16 vertical » directement dans le texte de l'invitation et a renvoyé du vertical, tandis que l'exécution Seedance est revenue en 16:9 parce que cette page porte son propre contrôle de rapport hauteur/largeur et que le texte de l'invitation seul ne l'a pas remplacé. Si vous coupez pour TikTok, cette différence vous coûtera une exécution la première fois que vous oublierez le champ du formulaire. Seedance 2.5 changerait probablement la moitié résolution de cela et ajouterait des relances au niveau régional, et je ne vais pas prétendre avoir mesuré cela.
Étape 5 : Corriger un plan sans relancer tout le clip
Le vrai coût d'un mini-drame n'est pas la génération une. C'est la révision sept. H3 accepte un clip existant comme entrée et édite selon des instructions, en conservant ce que vous n'avez pas mentionné. L'argument de Seedance 2.5 ici est plus fin : redessiner une région de l'image et laisser la performance, l'éclairage et la caméra intacts.
plaintext1En utilisant le clip fourni : conservez les deux personnages, leur tenue, les mouvements de caméra et le rythme de montage exactement tels qu'ils sont. Changez uniquement l'environnement, remplacez le couloir de pierre éclairé par la lune par la salle de bal du même château, hautes fenêtres cintrées, un lustre allumé, et une lumière de bougie chaude, et rééclairez les deux personnages de sorte que leur lumière principale vienne du lustre à gauche du cadre au lieu de la fenêtre. Réécrivez sa seule ligne de dialogue pour « Tu n'as jamais dormi, n'est-ce pas. » Gardez le timing de sa performance sur les mêmes temps.
Réglages : MiniMax H3 Référence-vers-Vidéo avec le clip de l'étape 3 comme entrée de référence, Durée 5, Résolution 2K.
Au-delà du test Seedance 2.5 vs MiniMax H3 : Quatre façons de pousser un paquet de référence
Même personnage, prochain épisode. Sauvegardez la planche de l'étape 1 comme un atout et changez seulement la liste des plans et le bloc narratif dans l'invitation. L'identité vient d'un fichier, pas de votre souvenir de la façon dont vous l'avez formulée mardi dernier.
Verrouillez aussi la voix. H3 accepte jusqu'à trois références audio, de 2 à 15 secondes chacune, et elles doivent accompagner une entrée image ou vidéo. Donnez-lui un échantillon vocal et le personnage parle dans ce timbre, vous n'avez donc pas à redistribuer un comédien de doublage entre les épisodes.
Bloquez la caméra avant de payer pour le rendu. La référence-vers-vidéo de Seedance 2.5 accepte les maquettes 3D en blanc et les fonds verts, vous pouvez donc verrouiller le cadre sur une géométrie grise et ne vous engager que ensuite sur un rendu final. Cet exemple a été exécuté sur Seedance 2.1, un membre antérieur de la famille, mais la forme du flux de travail est la même.
Localisez un montage maître au lieu de le refaire. Le remplacement au niveau régional échange un visage, un produit ou une langue parlée tandis que la caméra, le timing et la durée labiale restent en place. Ici, un montage maître beauté est redistribué et revoix pour l'espagnol, le coréen et l'hindi, avec la pièce, le cadre et la durée labiale maintenus.
Et parce que quelqu'un demandera à quoi ressemble le transfert de mouvement quand on arrête d'être raisonnable : trois hommes en costume, remplacés par trois capybaras photoréalistes, suivant le chemin de mouvement du clip original battement par battement jusqu'à ce qu'ils s'empilent en pyramide.
Il y a aussi la version simple de tout cela, celle que personne ne publie : une affiche statique devient une affiche animée, et la mise en page survit.
L'affiche source statique. Nourrissez-la à la référence-vers-vidéo avec « gardez le cadre, la palette et la mise en page, animez le texte » et vous obtenez une version animée du même design.
Combien coûte réellement un court métrage Seedance 2.5 vs MiniMax H3
Pas de chiffres ici, car les chiffres bougent et la structure, non. Les deux familles facturent à la seconde, paiement à l'utilisation, pas d'abonnement ni de siège. Cela laisse trois variables : les secondes, le palier de résolution, et les relances.
La troisième est la facture entière. Un clip de 15 secondes qui atterrit du premier coup est une charge. Le même clip au septième essai en est sept. Donc l'action d'économie d'argent n'est pas de choisir le modèle le moins cher par seconde, c'est de bien faire le paquet de référence avant de générer quoi que ce soit. Ces deux appels d'image aux étapes 1 et 2 sont la ligne la moins chère de tout le pipeline et celle qui décide du nombre d'appels vidéo que vous ferez. Le meilleur retour sur investissement de toute la chaîne, de loin.
Ensuite, corrigez l'instinct de la seconde. Même paquet de référence, même durée : la référence-vers-vidéo de H3 renvoie du 1440p, ce point d'accès Seedance référence-vers-vidéo renvoie du 720p. La seconde est la mauvaise unité. Les pixels par image, et si vous devez ensuite payer pour un passage de mise à l'échelle séparé, est la bonne.
L'audio appartient aussi à l'arithmétique. Les deux côtés produisent du son synchronisé natif dans le même passage. Si votre pipeline actuel est modèle vidéo plus TTS plus un éditeur alignant les pistes, ce que vous économisez, ce sont deux appels API et l'après-midi d'une personne, et cette économie n'apparaît sur aucune liste de prix.
Lequel pour quel travail :
| Travail | Choisissez | Pourquoi | Mise en garde |
|---|---|---|---|
| Mini-drame vertical, 9:16, TikTok ou ReelShort | MiniMax H3 | 1440p vertical avec son stéréo natif, appelable maintenant, 15 s est un accroche complète | vous coupez à 15 s, donc planifiez les temps en conséquence |
| Un film de marque continu de 30 secondes | Seedance 2.5 | génération unique, sans couture, 4K natif | vérifiez d'abord la disponibilité sur votre plateforme |
| Corriger un plan dans un montage approuvé | Seedance 2.5 | redessin au niveau régional laisse le reste intact | L'édition de clip entier de H3 vous mène déjà loin aujourd'hui |
| Réductions de produits et e-commerce | soit | les deux tiennent bien le texte à l'écran et les marques | vérifiez le texte à la résolution que vous livrez |
| Démonstrations de jeux ou d'interfaces | MiniMax H3 | la stabilité de l'UI et de la typographie en 2K est forte | plafond de 15 s pour un passage unique |
| Versions multilingues d'un maître | Seedance 2.5 | remplacement régional plus voix multilingue | la qualité de localisation nécessite encore une vérification native |
| Livrer ce soir | MiniMax H3 | trois points d'accès en ligne, plus tout Seedance 2.0 | l'accès à Seedance 2.5 varie selon la plateforme |
Avant de livrer. MiniMax a dit que les poids de H3 suivraient dans les jours suivant le lancement, et les poids ouverts ne sont pas la même chose qu'une licence commerciale, alors lisez les conditions avant de vous auto-héberger. La politique de filigrane et d'utilisation commerciale diffère également entre les applications grand public et l'accès API des deux côtés, et je n'ai pu confirmer ni l'une ni l'autre à partir d'une page de conditions primaire pendant la rédaction, alors vérifiez les conditions du fournisseur plutôt que de me croire sur parole. Et rien dans aucune licence de modèle ne couvre la ressemblance ou la marque. Si une personne réelle, une marque réelle ou la propriété intellectuelle de quelqu'un d'autre se trouve dans votre paquet de référence, c'est une question juridique distincte et les conditions du modèle n'y répondront pas.
Chaque modèle dans les tableaux ci-dessus fonctionne avec la même clé, et les pages modèles portent les tarifs en vigueur ainsi que le code copier-coller, y compris les promotions éventuelles en cours sur la ligne Seedance cette semaine.
Foire aux questions
Seedance 2.5 est-il meilleur que MiniMax H3 pour la cohérence des personnages ?
Sur le papier, il devrait l'être, avec jusqu'à 50 références multimodales contre les 12 fichiers de H3, plus les relances au niveau régional. Mais au 31 juillet 2026, il n'existe aucun test public apparié auquel je puisse me référer, et Seedance 2.5 n'a encore aucune évaluation en arène. Dans les exécutions que j'ai réellement pu faire, la variable qui a décidé la stabilité de l'identité était la structure du paquet de référence, pas la génération du modèle : avec une seule planche de rotation composite plus une planche d'éclairage, les deux côtés ont tenu le personnage. Obtenez le paquet correct avant de perdre du temps à magasiner les modèles.
Puis-je utiliser Seedance 2.5 maintenant, ou dois-je attendre ?
Son API est en ligne chez ByteDance. La disponibilité sur les plateformes de modèles tierces est inégale, et sur celle que j'ai testée, c'est encore un avis de lancement. Si vous avez besoin d'une sortie ce soir, les options appelables sont les trois points d'accès de MiniMax H3 et toute la gamme Seedance 2.0 en production.
MiniMax H3 fait-il vraiment de la vidéo de 30 secondes ?
Non. La spécification est de 5 à 15 secondes par génération à 24 ips. Tout ce qui est plus long est une extension ou un assemblage, ce qui est une chose différente avec un risque de dérive différent. La génération unique de 30 secondes appartient à Seedance 2.5. Ne laissez pas les deux affirmations se confondre.
Les deux modèles génèrent-ils de l'audio, et puis-je garder une voix d'un épisode à l'autre ?
Les deux produisent de l'audio synchronisé natif dans le même passage, et H3 produit du stéréo sur chaque résultat. Pour une voix persistante, H3 accepte jusqu'à trois références audio de 2 à 15 secondes chacune, qui doivent être soumises en même temps qu'une entrée image ou vidéo et non seules.
Combien d'images de référence dois-je réellement envoyer ?
Moins que vous ne le pensez, mieux structurées que vous ne le pensez. Une seule composition bien faite bat généralement six recadrages lâches, car des fichiers séparés invitent le modèle à les moyenner en une personne qui n'existe pas. Donnez-lui deux tâches claires, l'identité et l'éclairage, et n'incluez pas d'échantillons de style qui se contredisent.
Quel modèle dois-je utiliser pour un mini-drame vertical de style TikTok ou ReelShort ?
Livraison cette semaine, en 9:16, en haute résolution avec son déjà mixé : MiniMax H3. Planifier une scène continue de 30 secondes où vous prévoyez de relancer des régions uniques plutôt que des clips entiers : construisez pour Seedance 2.5 et vérifiez quand votre plateforme l'ouvre.






