OFFRE À DURÉE LIMITÉE | -20 % sur Seedance 2.0 & 2.0 Mini !

D'une image fixe à une chanson : Créer un MV émotionnel avec Seedream 5.0 Pro et Seedance 2.0

Un workflow vérifié Seedream 5.0 Pro + Seedance 2.0 pour des vidéos musicales IA : recettes de prompts par keyframes, indices de synchronisation labiale et de physique, enchaînement de clips, et une répartition réelle des coûts.

Le chanteur n'existe pas. La chanson n'est pas dans votre langue. Vous la ressentez quand même.

Voilà la réaction sous un clip créé par Cia0 partagé sur X le 19 juillet 2026 : quinze secondes d'un personnage en plein chant, présenté comme « une chanson que l'on peut ressentir même sans comprendre un seul mot ». La légende nomme toute la pile en une ligne : Seedream 5.0 Pro pour l'image, Seedance 2.0 pour la vidéo, exécuté sur CapCut. Ce qui fait vendre, c'est le travail des détails. Les lèvres suivent la voix. Les cheveux bougent comme des cheveux. Le visage porte une émotion au lieu d'une pose.

Ce guide reconstruit pas à pas ce pipeline : quel modèle fait quoi, les prompts qui portent l'émotion à travers le passage de l'image à la vidéo, et ce que coûte réellement un clip vidéo finalisé.

Bureau de création du créateur la nuit avec un moniteur montrant un gros plan du chanteur IA et un second moniteur montrant la timeline vidéo avec une forme d'onde audio

Points clés à retenir

  • Le flux de travail est d'abord basé sur l'image : concevoir artistiquement une image clé dans Seedream 5.0 Pro pour 0,045 $, puis ne payer les tarifs vidéo que lorsque le rendu est verrouillé. Corriger un visage dans l'image fixe coûte environ un vingtième du prix d'un nouveau tirage vidéo.
  • Seedance 2.0 en image-à-vidéo accepte une première image plus une éventuelle dernière image, génère de 4 à 15 secondes par exécution avec un son natif, et peut renvoyer sa dernière image pour que le clip suivant poursuive le plan.
  • La synchronisation labiale d'un personnage sur votre propre piste utilise le point de terminaison référence-à-vidéo : jusqu'à 9 images, 3 vidéos et 3 clips audio comme références, avec des mentions @ dans le prompt.
  • Un clip musical vertical de 40 secondes en 720p revient à environ 10 $ aux tarifs réduits de juillet 2026, votre bande sonore étant le seul coût non comptabilisé.

Les clips Seedream + Seedance qui valent le détour

Trois publications en deux jours, plus un test de synchronisation labiale antérieur, esquissent tout le territoire couvert par cette association. Aucun d'entre eux n'est une démonstration en laboratoire. Chacun nomme ses outils.

CréateurPubliéCe que montre le clipChaîne d'outils
@Cia0_exe19 juillet 202615 s de performance de ballade : synchronisation labiale, physique des cheveux, une émotion retenueSeedream 5.0 Pro + Seedance 2.0, sur CapCut selon la légende
@Cia0_exe20 juillet 202615 s d'« action anime 2.5D de pointe », le genre que « les studios mettent des années à livrer »Même paire de modèles, exécutée sur une application tierce
@tjb_shizuka20 juillet 202630 s de mème de voyage « warp de gouttes d'eau » dans un lac suisse, avec une invitation ouverte à copier le formatImages fixes Seedream, mouvement Seedance 2.0, bande son Mureka V9, montage OpenShot
@CuriousRefuge5 mai 2026Tests de synchronisation labiale multi-locuteurs en action réelle et animationImage de référence, fichier audio, prompt caméra et dialogue

1.png

Deux choses se répètent dans les quatre. Premièrement, le modèle d'image et le modèle vidéo sont traités comme des tâches séparées : le casting se fait dans Seedream, la performance dans Seedance. Deuxièmement, le modèle vidéo n'est que le milieu de la pile. Chaque légende nomme ce qui l'entoure : l'application sur laquelle il a été exécuté, une source de bande son, un éditeur pour le montage. Les deux posts de Cia0 promettent le prompt « en chinois » dans les réponses, et le post japonais détaille sa chaîne de quatre outils dans la légende elle-même.

Pourquoi le flux de travail Seedream d'abord bat le pur texte-à-vidéo

Seedance 2.0 dispose d'un mode texte-à-vidéo parfaitement fonctionnel. Les personnes qui créent les clips ci-dessus l'ignorent, et la raison est une question d'arithmétique plus de contrôle.

Sur Atlas Cloud, une image fixe Seedream 5.0 Pro coûte 0,045 $. Un clip Seedance 2.0 de 5 secondes en 720p coûte environ 0,97 $ avec la remise actuelle. Chaque mauvais visage, mauvaise tenue ou mauvais cadrage que vous détectez au stade de l'image fixe coûte une image fixe à corriger. Chaque erreur détectée au stade vidéo coûte un nouveau tirage complet à environ 20 fois le prix, plus l'attente.

 Texte-à-vidéo directSeedream image clé d'abord
Coût pour corriger un mauvais visage≈0,97 $ par nouveau tirage de 5 s0,045 $ par image fixe
Cohérence du casting entre les plansNouveau coup de dés à chaque clipMême bloc de personnage, même visage
Contrôle du cadragePrompt et espoirVous approuvez d'abord la composition exacte
Où les erreurs apparaissentDans l'étape coûteuseDans l'étape bon marché

Le point de cohérence est le plus important pour un clip vidéo. Un clip vidéo revient huit ou dix fois sur le même visage. Le texte-à-vidéo réinvente le personnage à chaque génération. Un pipeline d'image clé maintient l'identité de deux manières : réutiliser l'image fixe approuvée comme première image de chaque clip, ou fournir les mêmes images de référence à chaque génération. Vous faites la direction artistique une fois, puis vous dépensez l'argent de la vidéo pour animer une décision que vous aimez déjà.

Exécuter le flux de travail Seedream + Seedance sur Atlas Cloud

Les deux moitiés du pipeline fonctionnent au même endroit. Atlas Cloud héberge toute la famille de modèles ByteDance, donc Seedream 5.0 Pro (APIs publiques depuis le 8 juillet 2026) et Seedance 2.0 (lancé le 12 février 2026) se trouvent derrière le même compte, les mêmes crédits et la même forme d'API. Il y a deux façons de travailler : cliquer dans les bacs à sable, ou enchaîner les points de terminaison en code.

Méthode 1 : Générer vos plans de clip dans le bac à sable

Étape 1 : Faire le casting de votre personnage dans Seedream. Ouvrez le bac à sable Seedream 5.0 Pro et écrivez le prompt d'image clé (une recette complète se trouve deux sections plus bas). Adaptez le rapport hauteur/largeur à votre format de diffusion dès maintenant, 9:16 pour Shorts et TikTok, 16:9 pour YouTube. Chaque exécution renvoie une image à 0,045 $, alors itérez jusqu'à ce que le visage, la garde-robe et la lumière soient exactement comme vous le souhaitez.

Capture d'écran du bac à sable Seedream 5.0 Pro sur Atlas Cloud avec un prompt d'image clé dans le formulaire, un gros plan 9:16 d'un chanteur dans le panneau de sortie, et le bouton Run indiquant 0,045 $.

Étape 2 : Charger l'image fixe dans Seedance. Ouvrez le bac à sable Seedance 2.0 image-à-vidéo. Le formulaire prend une image obligatoire, votre image clé approuvée, plus une image facultative de dernière image si vous voulez que le plan se termine sur une composition spécifique.

Étape 3 : Écrire le prompt de mouvement et configurer le clip. La durée va de 4 à 15 secondes, ou Auto pour laisser le modèle choisir. Choisissez le rapport qui correspond à votre image clé, ou laissez sur Auto. La résolution par défaut est 720p.

Étape 4 : Vérifier trois bascules. « Generate audio » donne un son natif au clip. « Watermark » reste désactivé pour des masters propres. « Return last frame » vous donne l'image de fermeture en tant qu'image séparée ; renvoyez-la comme première image de la génération suivante et le nouveau clip reprend là où celui-ci s'est arrêté. Cette bascule fait la différence entre quatre clips déconnectés et une performance continue.

Étape 5 : Lire le prix, puis exécuter. Le bouton Run indique le coût de vos paramètres exacts avant de vous engager. Au 21 juillet 2026, un clip de 5 secondes en 720p affiche ≈0,97 $ avec la remise temporaire de 20 % de la plateforme appliquée (≈1,21 $ au prix catalogue).

Méthode 2 : Enchaîner Seedream et Seedance via une seule API

Étape 1 : Obtenir votre clé API. Créez une clé dans la console Atlas Cloud et exportez-la en tant que variable d'environnement. Gardez-la hors du code client.

Capture d'écran de la navigation de la console de la page d'accueil Atlas Cloud montrant l'emplacement du bouton Console dans la barre de navigation supérieure pour accéder à la gestion des clés API.png

Capture d'écran du tableau de bord de gestion des clés API Atlas Cloud montrant le processus étape par étape pour cliquer sur le menu API Keys puis sur le bouton Create API Key et copier la clé API générée.png

Étape 2 : Consulter la documentation API. Les points de terminaison, paramètres et comportement d'interrogation se trouvent dans la documentation API. L'ensemble du pipeline se compose de deux cycles soumission-et-interrogation.

Étape 3 : Effectuer les deux appels. D'abord l'image clé :

plaintext
1curl -X POST https://api.atlascloud.ai/api/v1/model/generateImage \
2  -H "Content-Type: application/json" \
3  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
4  -d '{
5    "model": "bytedance/seedream-v5.0-pro/text-to-image",
6    "prompt": "<votre prompt d'image clé>",
7    "size": "1152*2048"
8  }'

Interrogez GET /api/v1/model/prediction/ jusqu'à ce que la tâche soit terminée, prenez l'URL de l'image hébergée dans la sortie, et transmettez-la directement dans l'appel vidéo :

plaintext
1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Content-Type: application/json" \
3  -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \
4  -d '{
5    "model": "bytedance/seedance-2.0/image-to-video",
6    "prompt": "<prompt de mouvement et de performance>",
7    "image": "<URL de sortie Seedream>",
8    "duration": 10,
9    "resolution": "720p",
10    "ratio": "adaptive",
11    "generate_audio": true,
12    "return_last_frame": true
13  }'

image accepte une URL, du Base64 ou une référence d'actif, et duration accepte -1 pour laisser le modèle choisir. watermark est par défaut à false. Avec return_last_frame activé, la prédiction terminée inclut l'image finale en tant qu'image, donc un script peut boucler : générer le clip, récupérer la dernière image, soumettre le clip suivant. Cette boucle constitue l'ensemble du pipeline de clip vidéo en une trentaine de lignes.

Les deux appels utilisent la même URL de base, le même en-tête bearer et la même interrogation de prédiction. C'est l'avantage pratique de la conception à API unique : votre intégration Seedream et votre intégration Seedance diffèrent par une chaîne de modèle et quelques champs, et la prochaine version ByteDance s'insérera dans le même code.

Recette de prompt Seedream 5.0 Pro pour les images clés de clip vidéo

Une image clé de clip vidéo est une décision de casting, donc le premier travail du prompt est de définir une personne que vous pouvez rappeler à nouveau. Le schéma de travail est un bloc de personnage : une phrase, 40 à 60 mots, verrouillant le visage, les cheveux et la garde-robe. Il est réutilisé textuellement dans chaque prompt d'image clé du projet. Changez un mot et vous risquez de faire le casting d'un inconnu.

Voici un prompt d'image clé complet dans ce schéma :

Une jeune femme aux cheveux noirs mi-longs, aux traits doux et arrondis, avec des boucles d'oreilles gouttes en argent, portant un pull oversize en maille crème. Elle se tient seule sur un toit mouillé par la pluie au crépuscule, cadrée des épaules vers le haut à hauteur d'yeux. Ses yeux sont brillants, lèvres entrouvertes comme si elle allait chanter, regard juste au-delà de la caméra. Lueur bleue froide de la ville derrière elle, une lumière chaude de contour sur sa joue, faible profondeur de champ, arrêt sur image cinématographique, grain doux, 9:16.

La première phrase est le bloc de personnage. Tout ce qui suit change par plan. Un clip vidéo a besoin d'un petit ensemble de couverture, pas d'une seule image :

PlanObjectifCe qui change dans le promptCe qui reste fixe
LargeÉtablir le lieu et l'ambianceDétail du lieu, cadrage en piedBloc de personnage, direction de la lumière
MoyenPerformance du couplet« Cadré de la taille vers le haut », un gesteBloc de personnage
Gros planPic émotionnel du refrain« Épaules vers le haut », les signes faciauxBloc de personnage

Deux notes spécifiques à Seedream. Écrivez l'émotion comme une preuve physique, pas une étiquette : « yeux brillants, mâchoire serrée, souffle retenu » s'anime plus tard, tandis que « triste » s'aplatit en une expression standard. Et définissez le rapport hauteur/largeur dans le sélecteur de taille, pas seulement dans le texte, car le paramètre l'emporte. Pour une anatomie plus profonde des prompts, y compris les motifs d'exclusion et les bugs connus du modèle, consultez notre guide des prompts pour Seedream 5.0 Pro.

Prompts Seedance 2.0 pour la synchronisation labiale, la physique et l'émotion

L'image clé donne à Seedance 2.0 un visage qui mérite d'être animé. Le prompt de mouvement décide si le clip interprète ou simplement bouge. Seedance 2.0 génère de l'audio double canal de manière native et synchronise les lèvres au niveau des phonèmes dans huit langues et plus, selon le post de lancement de ByteDance, donc le travail du prompt est de dire ce qui est interprété, par qui, et comment la caméra le traite.

Il y a deux routes vers un personnage chantant.

Route A, chanson générée : restez en image-à-vidéo, activez « generate audio », et décrivez la voix dans le prompt. Le modèle invente la musique et synchronise les lèvres sur sa propre piste. C'est le chemin le plus rapide vers un clip de performance de style Cia0.

Route B, votre propre piste : passez en référence-à-vidéo, qui accepte jusqu'à 9 images de référence, 3 vidéos et 3 clips audio par exécution. Téléchargez votre section de chanson comme référence audio, ajoutez votre image clé comme référence image, et mentionnez-la avec @ dans le prompt pour lier le personnage à l'action. C'est la recette que Curious Refuge a validée en mai pour la synchronisation labiale multi-locuteurs : « une image de référence », « une vidéo noircie avec de l'audio OU un fichier audio », et « un prompt (mouvement de caméra + VO/dialogue) ». Coupez l'audio à la longueur de votre clip avant de le télécharger ; les jetons facturés comptent la durée d'entrée plus la durée de sortie, donc le remplissage coûte de l'argent réel.

Post X de Curious Refuge décrivant un test de synchronisation labiale Seedance 2.0 : téléchargez une image de référence, une vidéo noircie avec de l'audio ou un fichier audio, et un prompt de mouvement de caméra plus dialogue, suivi d'un exemple de prompt en quatre plans et d'une image de référence d'un homme et d'une femme sur la banquette arrière d'une voiture la nuit.

Les indices qui séparent une performance d'un économiseur d'écran :

Ce que vous voulezIndice de prompt qui fonctionnePourquoi ça fonctionne
Synchronisation labiale qui se litNommez la langue et le style vocal : « elle chante une ballade lente en mandarin, voix douce et aérienne »La synchronisation au niveau des phonèmes a besoin de savoir ce qui est chanté
Physique des cheveux et du tissuDonnez une cause à la force : « une rafale de vent soulève ses cheveux, le pull ondule »La physique suit les forces énoncées, pas les adjectifs
Émotion visibleIndices physiques avec timing : « ses yeux se ferment sur la note tenue, une larme au coin externe »Les modèles animent bien mieux les actions que les humeurs
Sensation de caméraUn seul mouvement par clip : « lent push-in du plan moyen au gros plan »Les mouvements de caméra empilés se combattent en 15 secondes
Drame multi-plansDécrivez la séquence dans l'ordre : « ouverture sur l'horizon, coupe sur son visage à l'entrée de la voix »Seedance 2.0 gère les séquences multi-plans de manière native en une seule exécution

Tout ce qui dépasse 15 secondes est un travail d'enchaînement : l'astuce du retour de la dernière image de la section configuration, avec la ligne suivante de la chanson dans chaque nouveau prompt. Gardez également la formulation du bloc de personnage de vos prompts Seedream à l'intérieur des prompts de mouvement. La redondance est une assurance bon marché pour l'identité.

Des clips Seedance à un clip vidéo finalisé : Montage et budget

Le post japonais « eyedrop warp » est l'image la plus claire de l'étape de finition, car le créateur liste toute la chaîne d'assemblage dans la légende : Seedream pour les images fixes, Seedance 2.0 pour le mouvement, Mureka V9 pour la bande sonore, et OpenShot, un éditeur gratuit pour ordinateur, pour le montage. Le clip de Cia0 nomme CapCut comme son lieu à la place. Quel que soit l'éditeur que vous choisissez, le montage est le même travail : posez d'abord la piste complète, coupez les clips sur le rythme, et gardez un seul rapport hauteur/largeur du début à la fin.

Post X japonais tagué #AI目薬ワープ listant sa chaîne d'outils, Seedream pour la génération d'image, Seedance 2.0 pour la vidéo, Mureka V9 pour la musique de fond, et OpenShot pour le montage, au-dessus d'une image vidéo d'un escalier en colimaçon en bois dans une lumière chaude orangée.

Une note sur cette route CapCut. Dans CapCut, Seedance 2.0 fonctionne sous le nom de Dreamina Seedance 2.0, disponible aux États-Unis depuis le 7 avril 2026, et selon l'annonce de CapCut elle est livrée avec des restrictions qui incluent le blocage de la génération vidéo à partir d'images contenant de vrais visages, plus un filigrane visible sur la sortie. Bon pour les mèmes, limitant pour des masters de clip vidéo propres. La route API et bac à sable laisse le filigrane désactivé par défaut et accepte n'importe quelle image clé que vous avez générée.

Ce que coûte le tout, aux tarifs réduits de juillet 2026 sur Atlas Cloud :

ÉtapeModèle ou outilVolumeCoût
Images clésSeedream 5.0 Pro10 images fixes à 0,045 $0,45 $
Brouillons de mouvementSeedance 2.0 Mini image-à-vidéo4 clips × 10 s à 0,045 $/s1,80 $
Clips finauxSeedance 2.0 image-à-vidéo, 720p4 clips × 10 s à ≈0,1935 $/s≈7,74 $
Bande sonoreVotre propre piste, ou un modèle de musique IA1 chansonvariable
MontageCapCut ou OpenShot1 session0 $
Total ~40 s de clip vidéo fini≈10 $

La ligne des brouillons est celle que les gens sautent et ne devraient pas. Seedance 2.0 Mini utilise le même flux de travail première image-plus-prompt à partir de 0,045 $ par seconde (prix catalogue 0,056 $), environ un quart du taux phare en 720p, donc les blocages, les mouvements de caméra et la physique sont débogués à moindre coût avant le rendu final. Sans la remise, le même budget atteint près de 12,40 $ aux prix catalogue, ce qui reste moins cher que la plupart des abonnements à des banques d'images facturés pour un mois.

Foire aux questions

Seedance 2.0 peut-il synchroniser les lèvres d'un personnage sur ma propre chanson ?

Oui. Utilisez le point de terminaison référence-à-vidéo, qui prend jusqu'à 3 clips audio en plus de 9 images et 3 vidéos par génération. Téléchargez la section de chanson comme référence audio, ajoutez votre image clé Seedream comme référence image, mentionnez-la avec @ dans le prompt, et décrivez la performance et la caméra. Coupez l'audio à la longueur du clip d'abord, car les jetons facturés comptent la durée d'entrée plus la durée de sortie.

Les prompts Seedream et Seedance doivent-ils être en chinois ?

Non. Cia0 partage des prompts en chinois, et la culture des prompts en chinois autour des modèles ByteDance est forte, mais les deux modèles acceptent les prompts en anglais, et la synchronisation labiale de Seedance 2.0 fonctionne au niveau des phonèmes dans huit langues et plus. Ce qui compte est de nommer la langue de la voix dans le prompt pour que les formes de bouche correspondent à la piste.

Quelle peut être la durée d'une seule génération Seedance 2.0 ?

4 à 15 secondes par exécution, avec des séquences multi-plans prises en charge dans cette fenêtre, ou définissez la durée sur -1 et le modèle choisit. Pour un clip vidéo complet, enchaînez les générations : activez « return last frame » et commencez le clip suivant à partir de l'image de fermeture du clip précédent afin que la performance reste continue.

Mes clips de clip vidéo auront-ils un filigrane ?

Pas par défaut sur l'API ou le bac à sable : le paramètre watermark est livré à false, donc les masters sortent propres. La version consommateur de CapCut est différente. Dreamina Seedance 2.0 applique un filigrane visible et bloque la génération à partir d'images avec de vrais visages, faisant partie du paquet de garde-fous avec lequel il a été relancé en 2026.

Combien coûte un clip vidéo Seedream + Seedance complet ?

Environ 10 $ pour une vidéo verticale de 40 secondes en 720p aux tarifs réduits de juillet 2026 : 0,45 $ en images clés, 1,80 $ en brouillons Mini, et environ 7,74 $ en clips finaux en 720p, avec le montage gratuit dans CapCut ou OpenShot. Aux prix catalogue, la même exécution est d'environ 12,40 $. L'étape de l'image clé est ce qui maintient ce nombre aussi bas, car les décisions de rendu sont prises à 0,045 $ au lieu d'environ 0,97 $ par nouveau tirage.

Conclusion

Les clips qui circulent ce mois-ci ne sont pas l'œuvre d'une fonctionnalité secrète. Ils sont une division du travail : Seedream 5.0 Pro décide qui est à l'écran et comment le cadre se sent, Seedance 2.0 décide comment ils bougent et sonnent, et un éditeur gratuit transforme des clips en une chanson avec un visage. Chaque étape est inspectable, et chaque erreur est attrapée à l'endroit le moins cher possible.

Volez l'ordre des opérations. Verrouillez un bloc de personnage, achetez vos erreurs à 0,045 $, animez seulement ce que vous avez déjà approuvé, et laissez la dernière image d'un clip ouvrir le suivant. Les outils sont nouveaux. La discipline n'est que la réalisation cinématographique.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles

Join our Discord community

Join the Discord community for the latest model updates, prompts, and support.

Seedream 5.0 Pro + Seedance 2.0 Workflow : Transformez des images fixes en une vidéo musicale émotionnelle générée par IA