Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

Le workflow MiniMax H3 à copier une semaine après l'open source (plus 52 prompts officiels)

Une semaine après la sortie open source de MiniMax H3, le workflow à copier est la rédaction locale, la finalisation dans le cloud. Le seul élément commun aux deux est le prompt, plus 52 prompts officiels.

MiniMax a publié un tour d'horizon de la première semaine de H3 en tant que modèle open source. On y mentionne près de 300 modèles dérivés, une gamme de builds quantifiés, un moteur d'inférence natif pour Mac et des pipelines de production pilotés par des agents. Tout cela mérite le coup d'œil.

Mais l'élément le plus important à retenir se trouve vers la fin de la première section, qui décrit la méthode de travail d'un créateur d'animation. En voici les termes officiels :

Il génère une vidéo en 480p sur une RTX 3060 pour itérer, utilise le matériel local pour prévisualiser, sélectionner et tâtonner, et ce n'est qu'une fois qu'une version le satisfait qu'il passe au cloud pour rendre le final en haute résolution et terminer avec de la super résolution.

L'article officiel donne un nom à cette habitude : local drafting, cloud finishing (brouillon local, finalisation dans le cloud).

Ces trois mots sont la même conclusion à laquelle nous sommes arrivés après des mois de travail de comparaison de modèles. Cet article tente de l'exprimer correctement : pourquoi cette séparation tient, et une fois qu'elle tient, ce dont vous avez réellement besoin de conserver.

Points clés à retenir

  • MiniMax H3 local fonctionne enfin sur du matériel grand public, mais le local est l'extrémité basse résolution. Le final en 2K est un passage séparé, pas un rendu plus grand.
  • La seule chose qui doit passer du brouillon au final, c'est le prompt, donc tout le workflow dépend de la capacité de votre prompt à survivre au voyage.
  • Exécutez un seul prompt MiniMax H3 identique sur plusieurs modèles à la fois pour vérifier la santé du prompt, pas pour classer les modèles.
  • Une contrainte peut être respectée à la lettre tout en manquant le but. Verrouillez la propriété qui porte le concept, pas l'effet secondaire.
  • Les deux actifs qui valent la peine d'être conservés sont une bibliothèque de prompts catégorisée et la logique de décision derrière chaque prompt.

Pourquoi « brouillon local, finalisation cloud » ne fonctionne que pour MiniMax H3 aujourd'hui

La séparation dépend d'une chose : l'extrémité locale est soudainement devenue performante.

En une seule semaine open source, la communauté a progressé rapidement sur l'efficacité de l'inférence. L'équipe ComfyUI a réduit les poids de modulation qui constituaient environ quarante pour cent du nombre de paramètres, les a remplacés par des tables précalculées, a ajouté la quantification INT8 et des noyaux personnalisés, et a ramené la plus petite combinaison de modèles de 123,6 Go à 42,5 Go de mémoire. Ajoutez le déchargement dynamique et une carte graphique grand public peut exécuter l'inférence locale.

Parallèlement, antirez, le créateur de Redis, a écrit un moteur d'inférence Apple Silicon natif à partir de zéro en C et Metal. Il lit les poids safetensors directement et regroupe les encodeurs de texte et de vision, le DiT, et les VAE de vision et audio en un seul programme Mac natif, sans dépendance à Python ni PyTorch.

L'équipe de recherche de NVIDIA a terminé une première passe d'optimisation de l'inférence en 4,5 heures après le lancement et a rapporté une accélération de bout en bout de 3,95x par rapport à Diffusers sur une configuration à huit cartes.

Mettez tout cela ensemble et le résultat est clair : l'exécution locale est maintenant possible, mais ce qu'elle rend est en basse résolution.

Ainsi, la séparation du créateur est naturelle. La basse résolution est rapide, bon marché et reproductible, ce qui est exactement ce que demande le tâtonnement. La livraison finale retourne toujours dans le cloud pour le rendu final. Les deux extrémités ne sont pas substituables. Ce sont deux stations sur une même ligne.

Ce qui traverse réellement entre les deux étapes MiniMax H3

C'est la question qui nous intéresse vraiment.

Vous passez vingt passes à 480p en local et vous obtenez enfin l'aspect souhaité. Vous passez maintenant au cloud pour le final. Quelle est la seule chose que vous pouvez réellement emporter avec vous ?

Pas le clip 480p, sa résolution est trop basse. Pas les poids du modèle, le cloud a les siens.

C'est le prompt.

Sur toute la ligne, la seule chose qui doit traverser les deux extrémités et prendre effet sans changement, c'est le prompt. C'est le seul actif de ce workflow.

L'implication est plus importante qu'il n'y paraît :

  • Si votre prompt cesse de fonctionner lorsque l'environnement change, ce workflow en couches ne fonctionne pas du tout. Tout ce que vous avez réglé localement est perdu sur le chemin du cloud.
  • Si vous le réécrivez pour chaque modèle, vous répétez l'étape de brouillon chaque fois que vous changez de modèle.
  • Inversement : si le prompt est suffisamment portable, vous pouvez même faire le brouillon sur un modèle moins cher, tant que sa lecture de la même phrase est prévisible.

La question devient donc : comment rédiger un prompt qui fonctionne encore après un changement d'environnement ? Nous avons testé cela.

Un prompt MiniMax H3, quatre modèles à la fois

Au cours des derniers jours, nous avons effectué plus d'une douzaine de comparaisons de ce type : un seul prompt identique, en ne changeant que les paramètres de soumission, envoyé à quatre modèles chacun, sur des sujets allant des VFX à l'animation UI de produits en passant par les courts métrages musicaux.

Ci-dessous, le même test exécuté sur huit sujets. Chaque clip est un split à quatre voies du prompt identique : en haut à gauche Seedance 2.5, en haut à droite MiniMax H3, en bas à gauche Seedance 2.0, en bas à droite Kling v3.0pro.

Duel wuxia : un prompt, quatre modèles. Activez le son.

Scène romantique anime, même split à quatre voies.

Publicité pour un sac à main : un spot produit à partir du même prompt.

Performance d'un groupe de filles, avec audio synchronisé sur le split.

KNNOfby0vtw
Invalid YouTube video ID

Scène centrée sur un personnage, quatre modèles côte à côte.

Publicité pour un appareil photo, même prompt en parallèle.

Publicité pour une basket, le dernier des huit sujets.

Ce que ce test teste réellement

Ce n'est pas un classement. C'est un test de solidité du prompt.

Parce que le prompt est identique et que seuls les paramètres de soumission ont changé :

  1. Les différences entre les quatre sont les différences entre les modèles. Cela ressemble à une évidence, mais c'est le fondement de tout l'exercice, et cela ne tient que lorsque les quatre sont exécutés dans le même environnement d'exécution. Reliez plusieurs interfaces de sources différentes et vous mélangez des variables de niveau lien dans les différences, et vous ne pouvez plus distinguer une différence de modèle d'une différence de plateforme.
  2. Tout ce que les quatre échouent à faire est un problème de prompt, pas un problème de modèle. C'est le signal le plus précieux de l'étape de brouillon, et c'est un signal que vous ne pouvez jamais obtenir en exécutant un seul modèle. Un modèle manque et vous suspectez le modèle. Quatre manquent et la réponse est claire : revenez en arrière et corrigez cette seule ligne, ne changez pas de modèle.
  3. Changez une chose par version, laissez le reste intact. C'est le seul moyen pour que « cette version est meilleure » tienne. Répartissez les changements et vous ne pouvez rien attribuer. Exécuter plusieurs modèles en parallèle signifie qu'un seul changement de variable vous donne quatre points d'observation à la fois.

Alors, qu'est-ce qui va dans le fichier

Pas un tableau de paramètres. Les paramètres sont sur la page du modèle, et les copier n'apporte aucune information. Ce qui vaut la peine d'être enregistré, c'est « ce que j'ai écrit, puis ce que j'ai observé. » Deux exemples :

Ce que disait le promptCe que montraient les quatre exécutions
Trois temps à 4s / 8s / 12sLes deux dérivent dans le temps, en sens opposés. MiniMax H3 est en avance et l'écart se cumule, atterrissant plus près de 4/6/8s. Seedance 2.0 est en retard et perd le temps médian complètement.
« Garde-le graphique plat, ne le rends pas comme une créature réaliste »Les deux obéissent à la lettre et renvoient des contours néon vectoriels lisses. Plat ? Oui. Dessiné à la main ? Pas du tout.

La valeur du premier est la direction. Enregistrer uniquement la taille de l'erreur est inutile, car la prochaine fois que vous compenserez, vous compenserez dans le mauvais sens. L'un doit être poussé plus tard, l'autre pressé plus tôt.

Le second a plus de valeur, et c'est le sujet de la section suivante.

Vous n'avez plus besoin d'un script pour cela

Lorsque nous avons effectué ces comparaisons, nous avons écrit notre propre script pour soumettre des tâches et récupérer les résultats. Plus maintenant. Atlas Cloud a lancé Model Explorer.

Écrivez un prompt, sélectionnez jusqu'à 10 modèles à exécuter en parallèle, et les résultats reviennent côte à côte.

Sa vraie valeur n'est pas la commodité, c'est le contrôle. La raison pour laquelle cette comparaison a pu aboutir à une conclusion est que les quatre ont été exécutés dans un seul environnement d'exécution. Reliez quatre interfaces de sources différentes et des variables de plateforme s'infiltrent dans les différences : comportement de la passerelle, paramètres par défaut, encodage des assets. Changez-en une et vous pensez comparer des modèles alors que vous comparez des plateformes. Exécutez-les dans un seul pool de modèles et ces variables sont maintenues constantes par construction.

Quelques éléments se traduisent directement dans l'étape de brouillon :

  • Groupes de modèles prédéfinis. SOTA, Tendance et Pas cher, plus votre propre ensemble sauvegardé. Brouillonnez avec le groupe pas cher pour fixer la direction, puis passez au groupe SOTA pour le final. C'est la même séparation qu'au début, avec les deux extrémités maintenant dans le cloud.
  • Une estimation des coûts avant d'exécuter, pour ne pas attendre la fin pour savoir ce qu'un tour a coûté.
  • Images et vidéo, avec texte-à-image et image-à-image du côté image.

Interface Atlas Cloud Model Explorer pour comparer différents modèles d'IA d'image

Atlas Cloud Model Explorer : un groupe de modèles prédéfini sélectionné pour être exécuté en parallèle à partir d'un seul prompt, avec l'estimation du coût par exécution affichée avant l'exécution

Vérifiable n'est pas la même chose que verrouiller la bonne dimension

Cette ligne de la dernière section, « garde-le plat, pas photoréaliste », est le piège le plus typique que nous ayons rencontré.

La partie étrange est que la contrainte peut être pleinement satisfaite tout en échouant complètement. Plat ? Oui. Dessiné à la main ? Pas du tout. Cochez toutes les cases de la liste de contrôle et vous obtenez une note parfaite.

Le problème : nous avons verrouillé « la platitude », mais la propriété qui porte réellement le concept est « les marques d'outil visibles. » Remplacez par « craie, crayon de couleur, pinceau grossier, direction des hachures, remplissage inégal, bords rugueux » et le même modèle s'inverse complètement.

Le sujet dessiné à la main sur quatre modèles. « Plat » est facile à satisfaire, « visiblement fait à la main » est la propriété qui devait réellement être verrouillée.

Cela se résume à un test :

Prenez chaque contrainte que vous avez écrite et demandez-vous : le modèle peut-il satisfaire cette phrase et quand même laisser tomber ce que je veux réellement ?

Si oui, le verrou vise un effet secondaire, pas le concept.

Le symptôme est familier : la sortie correspond à votre liste de contrôle ligne par ligne, mais quiconque connaît la référence voit d'un coup d'œil que c'est faux.

La bonne action à ce stade est de ne pas ajouter plus de verrous. C'est de revenir en arrière et de trouver la propriété qui porte réellement le concept.

Replaçons cela dans « brouillon local, finalisation cloud » : cela a plus de poids : une contrainte visant la mauvaise dimension peut être invisible à la résolution du brouillon. En 480p, la différence entre un contour lisse et un pinceau grossier est déjà floue, et vous ne découvrez que la direction était fausse qu'après avoir dépensé des efforts sur un final cloud. Que le brouillon vous fasse gagner du temps dépend du fait que la propriété que vous avez verrouillée lors du brouillon était la bonne.

La communauté a déjà emballé le processus MiniMax H3

L'article officiel apporte un autre signal qui mérite d'être souligné seul : les développeurs commencent à emballer l'ensemble du processus de production en quelque chose de réutilisable.

Un artiste IA utilise Claude Code sur un Mac pour orchestrer un modèle local sur une seconde machine. Le Mac gère la configuration du projet, la vérification des faits, le script, le timeline, les sous-titres, le storyboard et la révision structurelle, et l'autre extrémité gère l'inférence du modèle. L'ensemble est divisé en 14 étapes, du brief jusqu'au rendu par lots, au montage et à la réécriture du registre, sans jamais ouvrir un éditeur traditionnel.

Un autre projet a emballé la même idée dans un plugin avec des compétences intégrées qui passent d'une histoire ou d'un brief commercial à la configuration des personnages et des scènes, au storyboard et à la conception des keyframes, puis choisissent un workflow par plan. Les prompts, les assets d'entrée, le workflow, les plans candidats et les sélections sont tous conservés dans l'enregistrement du projet, de sorte qu'une tâche interrompue reprend là où elle s'est arrêtée.

La direction est la même : tout le monde transforme « comment celui-ci a été fait » en un actif réutilisable, au lieu de laisser derrière lui une pile de films terminés. Les deux choses que nous avons faites se situent exactement sur cette ligne.

Deux ressources MiniMax H3 que vous pouvez prendre dès maintenant

  1. La bibliothèque officielle de prompts MiniMax H3 (52 prompts, 16 catégories, chacun avec un aperçu)

Plain
1https://github.com/AtlasCloudAI/awesome-minimax-h3-prompts

Pas des réécritures, mais les prompts originaux de la vitrine officielle, organisés par scénario, chacun associé à une vraie vidéo d'aperçu générée afin que vous puissiez voir le résultat avant de décider lequel copier.

Les 16 catégories couvrent la marque et le cinéma, le visuel créatif et l'emballage, les graphiques animés et les VFX, la narration IA, le produit et le e-commerce, la création numérique et de jeux, l'IA industrielle et incarnée, l'animation et la stylisation, la référence multi-matériaux, la référence de personnage/action/caméra, le clonage vocal, l'édition de personnage et d'objet, l'édition de scène et de VFX, l'édition audio et de dialogue, le suivi précis des instructions, et les préréglages de style. Il prend en charge 20 langues et accepte les soumissions.

La façon la plus rapide de l'utiliser lors du brouillon : trouvez un prompt dont le sujet est proche du vôtre, regardez son aperçu, et utilisez-le comme point de départ pour éditer. Beaucoup plus rapide que de partir d'une boîte vide.

Page du dépôt GitHub pour le projet awesome-minimax-h3-prompts

Le référentiel awesome-minimax-h3-prompts sur GitHub, montrant l'index des catégories et une entrée avec sa vidéo d'aperçu

  1. La compétence de prompt vidéo universel

Plain
1https://github.com/kiana-liang/universal-video-prompt-skill
Plain
1npx skills add kiana-liang/universal-video-prompt-skill

Elle résout le problème de la deuxième section : vous avez copié le prompt, mais vous n'avez pas pu copier le jugement porté lors de sa rédaction. Le slogan dit exactement cela. La logique de décision sous-jacente que vous ne pouvez pas copier en copiant le prompt est ce qui vit ici.

Ce qu'elle fait, c'est décomposer « réfléchis d'abord, puis écris-le sous une forme » en une liste de contrôle décisionnelle réutilisable :

  • Deux questions avant chaque ligne : à quelle couche appartient-elle (globale, verrouillée ou temporelle), et a-t-elle été écrite sous une forme observable ?
  • Traduire l'invérifiable en vérifiable. « Rester cohérent » devient un état final visible. « Tendu » devient le mouvement des yeux, la respiration et le mouvement des mains.
  • Une méthode à l'épreuve des dialectes : écrivez le terme et une description observable ensemble. Un modèle qui connaît le terme prend le raccourci, un qui ne le connaît pas suit la description, et un seul prompt couvre les deux.
  • Pas de réécriture entre environnements. La couche de langage pur est écrite une fois, et les biais spécifiques au modèle vont dans une table de profil séparée, du genre de celle de la troisième section.

Le dépôt fournit 5 types de plans, 4 cas entièrement traités, 6 profils de modèles et 4 vidéos de démonstration. Chaque vidéo est liée à la règle spécifique qu'elle illustre, ce n'est pas un showreel.

Il précise également ce qu'il ne fait pas : pas de slots obligatoires, aucun exemple n'est une règle, chaque règle a des exceptions. Si vous cherchez un modèle de formulaire à remplir à insérer, ce n'est pas ça.

L'extrémité de finition : exécuter MiniMax H3 sur Atlas Cloud

Les trois modes d'appel MiniMax H3 sont en ligne sur Atlas Cloud : texte-à-vidéo, image-à-vidéo et référence-à-vidéo, avec les paramètres, les options de durée et les exemples de requêtes sur chaque page de modèle.

Plain
1Aperçu           https://www.atlascloud.ai/models/minimax-h3
2Texte-à-vidéo    https://www.atlascloud.ai/models/minimax/h3/text-to-video
3Image-à-vidéo    https://www.atlascloud.ai/models/minimax/h3/image-to-video
4Référence-à-vidéo https://www.atlascloud.ai/models/minimax/h3/reference-to-video
5Outil de comparaison    https://www.atlascloud.ai/model-explorer

Atlas Cloud rassemble ces modèles vidéo grand public dans un seul pool, de sorte qu'avec une seule API, vous changez une chaîne de modèle pour exécuter toute la comparaison. C'est ainsi que le test à quatre modèles de la troisième section a été exécuté, sauf qu'à l'époque nous écrivions encore notre propre script, et maintenant c'est quelques clics dans Model Explorer.

Ainsi, le pipeline se connecte comme suit en pratique :

ÉtapeObjectif
BrouillonModel Explorer, préréglage pas cher, un prompt en parallèleTester la direction rapidement, construire la table de profil de modèle
FinalisationMême pool, passer au modèle ciblePrompt inchangé, seule la chaîne de modèle change
LivraisonAppel API, dans votre propre flux de productionPar lots, orchestratable

Les trois étapes utilisent le même prompt et la même clé. Rien n'est réécrit au milieu et rien ne change d'environnement, ce qui est le point de la deuxième section : le seul actif qui doit traverser les étapes est le prompt, alors ne le laissez pas se déformer en chemin. Les paramètres, les options de durée et les exemples d'API sont tous sur les pages du modèle MiniMax H3.

En conclusion

Une semaine d'open source, et la communauté a déjà adapté MiniMax H3 sur des cartes graphiques grand public, dans un programme Mac natif et dans des flux de production automatisés. Ce travail est ce qui a rendu l'extrémité locale réellement utilisable.

Mais l'exécution locale n'est pas la livraison locale. « Brouillon local, finalisation cloud » est une bonne habitude car elle ne met pas les deux extrémités en opposition. Elle accepte qu'il s'agit d'un seul pipeline, avec deux stations qui font deux travaux.

Et pour que la ligne bouge, la pièce qui est transmise au milieu doit être fiable. Cette pièce est le prompt. Donc ce qui mérite votre temps n'est jamais un film que vous avez rendu. C'est pourquoi vous l'avez écrit comme vous l'avez fait.

FAQ sur les prompts MiniMax H3

Où puis-je exécuter MiniMax H3 sans GPU local ?

Les trois modes MiniMax H3, texte-à-vidéo, image-à-vidéo et référence-à-vidéo, fonctionnent sur Atlas Cloud, avec les paramètres et les options de durée sur chaque page de modèle. L'inférence locale est utile pour un brouillon 480p bon marché une fois les builds communautaires installés, mais le final en haute résolution est toujours rendu dans le cloud.

Comment comparer équitablement MiniMax H3 avec d'autres modèles vidéo ?

Exécutez un seul prompt identique sur les modèles dans un seul environnement d'exécution. Model Explorer le fait avec jusqu'à 10 modèles en parallèle, ce qui maintient constant le comportement de la passerelle, les paramètres par défaut et l'encodage des assets, de sorte que les différences que vous voyez sont les différences de modèle.

Les prompts MiniMax H3 se transfèrent-ils à d'autres modèles ?

C'est tout l'intérêt de bien les rédiger. Gardez la couche de langage pur observable et à l'épreuve des dialectes, terme plus description, et enregistrez les biais de timing spécifiques au modèle dans une table de profil séparée. Le prompt survit alors au passage d'un modèle de brouillon au modèle final sans changement.

Où trouver des prompts MiniMax H3 prêts à l'emploi ?

La bibliothèque awesome-minimax-h3-prompts contient 52 prompts officiels de la vitrine dans 16 catégories, chacun avec une vraie vidéo d'aperçu, en 20 langues. Trouvez-en un proche de votre sujet, regardez l'aperçu, et éditez à partir de là.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles