Le chanteur n'existe pas. La chanson n'est pas dans votre langue. Vous la ressentez quand même.
Voilà la réaction sous un clip créé par Cia0 partagé sur X le 19 juillet 2026 : quinze secondes d'un personnage en plein chant, présenté comme « une chanson que l'on peut ressentir même sans comprendre un seul mot ». La légende nomme toute la pile en une ligne : Seedream 5.0 Pro pour l'image, Seedance 2.0 pour la vidéo, exécuté sur CapCut. Ce qui fait vendre, c'est le travail des détails. Les lèvres suivent la voix. Les cheveux bougent comme des cheveux. Le visage porte une émotion au lieu d'une pose.
Ce guide reconstruit pas à pas ce pipeline : quel modèle fait quoi, les prompts qui portent l'émotion à travers le passage de l'image à la vidéo, et ce que coûte réellement un clip vidéo finalisé.

Points clés à retenir
- Le flux de travail est d'abord basé sur l'image : concevoir artistiquement une image clé dans Seedream 5.0 Pro pour 0,045 $, puis ne payer les tarifs vidéo que lorsque le rendu est verrouillé. Corriger un visage dans l'image fixe coûte environ un vingtième du prix d'un nouveau tirage vidéo.
- Seedance 2.0 en image-à-vidéo accepte une première image plus une éventuelle dernière image, génère de 4 à 15 secondes par exécution avec un son natif, et peut renvoyer sa dernière image pour que le clip suivant poursuive le plan.
- La synchronisation labiale d'un personnage sur votre propre piste utilise le point de terminaison référence-à-vidéo : jusqu'à 9 images, 3 vidéos et 3 clips audio comme références, avec des mentions @ dans le prompt.
- Un clip musical vertical de 40 secondes en 720p revient à environ 10 $ aux tarifs réduits de juillet 2026, votre bande sonore étant le seul coût non comptabilisé.
Les clips Seedream + Seedance qui valent le détour
Trois publications en deux jours, plus un test de synchronisation labiale antérieur, esquissent tout le territoire couvert par cette association. Aucun d'entre eux n'est une démonstration en laboratoire. Chacun nomme ses outils.
| Créateur | Publié | Ce que montre le clip | Chaîne d'outils |
|---|---|---|---|
| @Cia0_exe | 19 juillet 2026 | 15 s de performance de ballade : synchronisation labiale, physique des cheveux, une émotion retenue | Seedream 5.0 Pro + Seedance 2.0, sur CapCut selon la légende |
| @Cia0_exe | 20 juillet 2026 | 15 s d'« action anime 2.5D de pointe », le genre que « les studios mettent des années à livrer » | Même paire de modèles, exécutée sur une application tierce |
| @tjb_shizuka | 20 juillet 2026 | 30 s de mème de voyage « warp de gouttes d'eau » dans un lac suisse, avec une invitation ouverte à copier le format | Images fixes Seedream, mouvement Seedance 2.0, bande son Mureka V9, montage OpenShot |
| @CuriousRefuge | 5 mai 2026 | Tests de synchronisation labiale multi-locuteurs en action réelle et animation | Image de référence, fichier audio, prompt caméra et dialogue |

Deux choses se répètent dans les quatre. Premièrement, le modèle d'image et le modèle vidéo sont traités comme des tâches séparées : le casting se fait dans Seedream, la performance dans Seedance. Deuxièmement, le modèle vidéo n'est que le milieu de la pile. Chaque légende nomme ce qui l'entoure : l'application sur laquelle il a été exécuté, une source de bande son, un éditeur pour le montage. Les deux posts de Cia0 promettent le prompt « en chinois » dans les réponses, et le post japonais détaille sa chaîne de quatre outils dans la légende elle-même.
Pourquoi le flux de travail Seedream d'abord bat le pur texte-à-vidéo
Seedance 2.0 dispose d'un mode texte-à-vidéo parfaitement fonctionnel. Les personnes qui créent les clips ci-dessus l'ignorent, et la raison est une question d'arithmétique plus de contrôle.
Sur Atlas Cloud, une image fixe Seedream 5.0 Pro coûte 0,045 $. Un clip Seedance 2.0 de 5 secondes en 720p coûte environ 0,97 $ avec la remise actuelle. Chaque mauvais visage, mauvaise tenue ou mauvais cadrage que vous détectez au stade de l'image fixe coûte une image fixe à corriger. Chaque erreur détectée au stade vidéo coûte un nouveau tirage complet à environ 20 fois le prix, plus l'attente.
| Texte-à-vidéo direct | Seedream image clé d'abord | |
|---|---|---|
| Coût pour corriger un mauvais visage | ≈0,97 $ par nouveau tirage de 5 s | 0,045 $ par image fixe |
| Cohérence du casting entre les plans | Nouveau coup de dés à chaque clip | Même bloc de personnage, même visage |
| Contrôle du cadrage | Prompt et espoir | Vous approuvez d'abord la composition exacte |
| Où les erreurs apparaissent | Dans l'étape coûteuse | Dans l'étape bon marché |
Le point de cohérence est le plus important pour un clip vidéo. Un clip vidéo revient huit ou dix fois sur le même visage. Le texte-à-vidéo réinvente le personnage à chaque génération. Un pipeline d'image clé maintient l'identité de deux manières : réutiliser l'image fixe approuvée comme première image de chaque clip, ou fournir les mêmes images de référence à chaque génération. Vous faites la direction artistique une fois, puis vous dépensez l'argent de la vidéo pour animer une décision que vous aimez déjà.
Exécuter le flux de travail Seedream + Seedance sur Atlas Cloud
Les deux moitiés du pipeline fonctionnent au même endroit. Atlas Cloud héberge toute la famille de modèles ByteDance, donc Seedream 5.0 Pro (APIs publiques depuis le 8 juillet 2026) et Seedance 2.0 (lancé le 12 février 2026) se trouvent derrière le même compte, les mêmes crédits et la même forme d'API. Il y a deux façons de travailler : cliquer dans les bacs à sable, ou enchaîner les points de terminaison en code.
Méthode 1 : Générer vos plans de clip dans le bac à sable
Étape 1 : Faire le casting de votre personnage dans Seedream. Ouvrez le bac à sable Seedream 5.0 Pro et écrivez le prompt d'image clé (une recette complète se trouve deux sections plus bas). Adaptez le rapport hauteur/largeur à votre format de diffusion dès maintenant, 9:16 pour Shorts et TikTok, 16:9 pour YouTube. Chaque exécution renvoie une image à 0,045 $, alors itérez jusqu'à ce que le visage, la garde-robe et la lumière soient exactement comme vous le souhaitez.

Étape 2 : Charger l'image fixe dans Seedance. Ouvrez le bac à sable Seedance 2.0 image-à-vidéo. Le formulaire prend une image obligatoire, votre image clé approuvée, plus une image facultative de dernière image si vous voulez que le plan se termine sur une composition spécifique.
Étape 3 : Écrire le prompt de mouvement et configurer le clip. La durée va de 4 à 15 secondes, ou Auto pour laisser le modèle choisir. Choisissez le rapport qui correspond à votre image clé, ou laissez sur Auto. La résolution par défaut est 720p.
Étape 4 : Vérifier trois bascules. « Generate audio » donne un son natif au clip. « Watermark » reste désactivé pour des masters propres. « Return last frame » vous donne l'image de fermeture en tant qu'image séparée ; renvoyez-la comme première image de la génération suivante et le nouveau clip reprend là où celui-ci s'est arrêté. Cette bascule fait la différence entre quatre clips déconnectés et une performance continue.
Étape 5 : Lire le prix, puis exécuter. Le bouton Run indique le coût de vos paramètres exacts avant de vous engager. Au 21 juillet 2026, un clip de 5 secondes en 720p affiche ≈0,97 $ avec la remise temporaire de 20 % de la plateforme appliquée (≈1,21 $ au prix catalogue).
Méthode 2 : Enchaîner Seedream et Seedance via une seule API
Étape 1 : Obtenir votre clé API. Créez une clé dans la console Atlas Cloud et exportez-la en tant que variable d'environnement. Gardez-la hors du code client.


Étape 2 : Consulter la documentation API. Les points de terminaison, paramètres et comportement d'interrogation se trouvent dans la documentation API. L'ensemble du pipeline se compose de deux cycles soumission-et-interrogation.
Étape 3 : Effectuer les deux appels. D'abord l'image clé :
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateImage \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedream-v5.0-pro/text-to-image", 6 "prompt": "<votre prompt d'image clé>", 7 "size": "1152*2048" 8 }'
Interrogez GET /api/v1/model/prediction/ jusqu'à ce que la tâche soit terminée, prenez l'URL de l'image hébergée dans la sortie, et transmettez-la directement dans l'appel vidéo :
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedance-2.0/image-to-video", 6 "prompt": "<prompt de mouvement et de performance>", 7 "image": "<URL de sortie Seedream>", 8 "duration": 10, 9 "resolution": "720p", 10 "ratio": "adaptive", 11 "generate_audio": true, 12 "return_last_frame": true 13 }'
image accepte une URL, du Base64 ou une référence d'actif, et duration accepte -1 pour laisser le modèle choisir. watermark est par défaut à false. Avec return_last_frame activé, la prédiction terminée inclut l'image finale en tant qu'image, donc un script peut boucler : générer le clip, récupérer la dernière image, soumettre le clip suivant. Cette boucle constitue l'ensemble du pipeline de clip vidéo en une trentaine de lignes.
Les deux appels utilisent la même URL de base, le même en-tête bearer et la même interrogation de prédiction. C'est l'avantage pratique de la conception à API unique : votre intégration Seedream et votre intégration Seedance diffèrent par une chaîne de modèle et quelques champs, et la prochaine version ByteDance s'insérera dans le même code.
Recette de prompt Seedream 5.0 Pro pour les images clés de clip vidéo
Une image clé de clip vidéo est une décision de casting, donc le premier travail du prompt est de définir une personne que vous pouvez rappeler à nouveau. Le schéma de travail est un bloc de personnage : une phrase, 40 à 60 mots, verrouillant le visage, les cheveux et la garde-robe. Il est réutilisé textuellement dans chaque prompt d'image clé du projet. Changez un mot et vous risquez de faire le casting d'un inconnu.
Voici un prompt d'image clé complet dans ce schéma :
Une jeune femme aux cheveux noirs mi-longs, aux traits doux et arrondis, avec des boucles d'oreilles gouttes en argent, portant un pull oversize en maille crème. Elle se tient seule sur un toit mouillé par la pluie au crépuscule, cadrée des épaules vers le haut à hauteur d'yeux. Ses yeux sont brillants, lèvres entrouvertes comme si elle allait chanter, regard juste au-delà de la caméra. Lueur bleue froide de la ville derrière elle, une lumière chaude de contour sur sa joue, faible profondeur de champ, arrêt sur image cinématographique, grain doux, 9:16.
La première phrase est le bloc de personnage. Tout ce qui suit change par plan. Un clip vidéo a besoin d'un petit ensemble de couverture, pas d'une seule image :
| Plan | Objectif | Ce qui change dans le prompt | Ce qui reste fixe |
|---|---|---|---|
| Large | Établir le lieu et l'ambiance | Détail du lieu, cadrage en pied | Bloc de personnage, direction de la lumière |
| Moyen | Performance du couplet | « Cadré de la taille vers le haut », un geste | Bloc de personnage |
| Gros plan | Pic émotionnel du refrain | « Épaules vers le haut », les signes faciaux | Bloc de personnage |
Deux notes spécifiques à Seedream. Écrivez l'émotion comme une preuve physique, pas une étiquette : « yeux brillants, mâchoire serrée, souffle retenu » s'anime plus tard, tandis que « triste » s'aplatit en une expression standard. Et définissez le rapport hauteur/largeur dans le sélecteur de taille, pas seulement dans le texte, car le paramètre l'emporte. Pour une anatomie plus profonde des prompts, y compris les motifs d'exclusion et les bugs connus du modèle, consultez notre guide des prompts pour Seedream 5.0 Pro.
Prompts Seedance 2.0 pour la synchronisation labiale, la physique et l'émotion
L'image clé donne à Seedance 2.0 un visage qui mérite d'être animé. Le prompt de mouvement décide si le clip interprète ou simplement bouge. Seedance 2.0 génère de l'audio double canal de manière native et synchronise les lèvres au niveau des phonèmes dans huit langues et plus, selon le post de lancement de ByteDance, donc le travail du prompt est de dire ce qui est interprété, par qui, et comment la caméra le traite.
Il y a deux routes vers un personnage chantant.
Route A, chanson générée : restez en image-à-vidéo, activez « generate audio », et décrivez la voix dans le prompt. Le modèle invente la musique et synchronise les lèvres sur sa propre piste. C'est le chemin le plus rapide vers un clip de performance de style Cia0.
Route B, votre propre piste : passez en référence-à-vidéo, qui accepte jusqu'à 9 images de référence, 3 vidéos et 3 clips audio par exécution. Téléchargez votre section de chanson comme référence audio, ajoutez votre image clé comme référence image, et mentionnez-la avec @ dans le prompt pour lier le personnage à l'action. C'est la recette que Curious Refuge a validée en mai pour la synchronisation labiale multi-locuteurs : « une image de référence », « une vidéo noircie avec de l'audio OU un fichier audio », et « un prompt (mouvement de caméra + VO/dialogue) ». Coupez l'audio à la longueur de votre clip avant de le télécharger ; les jetons facturés comptent la durée d'entrée plus la durée de sortie, donc le remplissage coûte de l'argent réel.

Les indices qui séparent une performance d'un économiseur d'écran :
| Ce que vous voulez | Indice de prompt qui fonctionne | Pourquoi ça fonctionne |
|---|---|---|
| Synchronisation labiale qui se lit | Nommez la langue et le style vocal : « elle chante une ballade lente en mandarin, voix douce et aérienne » | La synchronisation au niveau des phonèmes a besoin de savoir ce qui est chanté |
| Physique des cheveux et du tissu | Donnez une cause à la force : « une rafale de vent soulève ses cheveux, le pull ondule » | La physique suit les forces énoncées, pas les adjectifs |
| Émotion visible | Indices physiques avec timing : « ses yeux se ferment sur la note tenue, une larme au coin externe » | Les modèles animent bien mieux les actions que les humeurs |
| Sensation de caméra | Un seul mouvement par clip : « lent push-in du plan moyen au gros plan » | Les mouvements de caméra empilés se combattent en 15 secondes |
| Drame multi-plans | Décrivez la séquence dans l'ordre : « ouverture sur l'horizon, coupe sur son visage à l'entrée de la voix » | Seedance 2.0 gère les séquences multi-plans de manière native en une seule exécution |
Tout ce qui dépasse 15 secondes est un travail d'enchaînement : l'astuce du retour de la dernière image de la section configuration, avec la ligne suivante de la chanson dans chaque nouveau prompt. Gardez également la formulation du bloc de personnage de vos prompts Seedream à l'intérieur des prompts de mouvement. La redondance est une assurance bon marché pour l'identité.
Des clips Seedance à un clip vidéo finalisé : Montage et budget
Le post japonais « eyedrop warp » est l'image la plus claire de l'étape de finition, car le créateur liste toute la chaîne d'assemblage dans la légende : Seedream pour les images fixes, Seedance 2.0 pour le mouvement, Mureka V9 pour la bande sonore, et OpenShot, un éditeur gratuit pour ordinateur, pour le montage. Le clip de Cia0 nomme CapCut comme son lieu à la place. Quel que soit l'éditeur que vous choisissez, le montage est le même travail : posez d'abord la piste complète, coupez les clips sur le rythme, et gardez un seul rapport hauteur/largeur du début à la fin.

Une note sur cette route CapCut. Dans CapCut, Seedance 2.0 fonctionne sous le nom de Dreamina Seedance 2.0, disponible aux États-Unis depuis le 7 avril 2026, et selon l'annonce de CapCut elle est livrée avec des restrictions qui incluent le blocage de la génération vidéo à partir d'images contenant de vrais visages, plus un filigrane visible sur la sortie. Bon pour les mèmes, limitant pour des masters de clip vidéo propres. La route API et bac à sable laisse le filigrane désactivé par défaut et accepte n'importe quelle image clé que vous avez générée.
Ce que coûte le tout, aux tarifs réduits de juillet 2026 sur Atlas Cloud :
| Étape | Modèle ou outil | Volume | Coût |
|---|---|---|---|
| Images clés | Seedream 5.0 Pro | 10 images fixes à 0,045 $ | 0,45 $ |
| Brouillons de mouvement | Seedance 2.0 Mini image-à-vidéo | 4 clips × 10 s à 0,045 $/s | 1,80 $ |
| Clips finaux | Seedance 2.0 image-à-vidéo, 720p | 4 clips × 10 s à ≈0,1935 $/s | ≈7,74 $ |
| Bande sonore | Votre propre piste, ou un modèle de musique IA | 1 chanson | variable |
| Montage | CapCut ou OpenShot | 1 session | 0 $ |
| Total | ~40 s de clip vidéo fini | ≈10 $ |
La ligne des brouillons est celle que les gens sautent et ne devraient pas. Seedance 2.0 Mini utilise le même flux de travail première image-plus-prompt à partir de 0,045 $ par seconde (prix catalogue 0,056 $), environ un quart du taux phare en 720p, donc les blocages, les mouvements de caméra et la physique sont débogués à moindre coût avant le rendu final. Sans la remise, le même budget atteint près de 12,40 $ aux prix catalogue, ce qui reste moins cher que la plupart des abonnements à des banques d'images facturés pour un mois.
Foire aux questions
Seedance 2.0 peut-il synchroniser les lèvres d'un personnage sur ma propre chanson ?
Oui. Utilisez le point de terminaison référence-à-vidéo, qui prend jusqu'à 3 clips audio en plus de 9 images et 3 vidéos par génération. Téléchargez la section de chanson comme référence audio, ajoutez votre image clé Seedream comme référence image, mentionnez-la avec @ dans le prompt, et décrivez la performance et la caméra. Coupez l'audio à la longueur du clip d'abord, car les jetons facturés comptent la durée d'entrée plus la durée de sortie.
Les prompts Seedream et Seedance doivent-ils être en chinois ?
Non. Cia0 partage des prompts en chinois, et la culture des prompts en chinois autour des modèles ByteDance est forte, mais les deux modèles acceptent les prompts en anglais, et la synchronisation labiale de Seedance 2.0 fonctionne au niveau des phonèmes dans huit langues et plus. Ce qui compte est de nommer la langue de la voix dans le prompt pour que les formes de bouche correspondent à la piste.
Quelle peut être la durée d'une seule génération Seedance 2.0 ?
4 à 15 secondes par exécution, avec des séquences multi-plans prises en charge dans cette fenêtre, ou définissez la durée sur -1 et le modèle choisit. Pour un clip vidéo complet, enchaînez les générations : activez « return last frame » et commencez le clip suivant à partir de l'image de fermeture du clip précédent afin que la performance reste continue.
Mes clips de clip vidéo auront-ils un filigrane ?
Pas par défaut sur l'API ou le bac à sable : le paramètre watermark est livré à false, donc les masters sortent propres. La version consommateur de CapCut est différente. Dreamina Seedance 2.0 applique un filigrane visible et bloque la génération à partir d'images avec de vrais visages, faisant partie du paquet de garde-fous avec lequel il a été relancé en 2026.
Combien coûte un clip vidéo Seedream + Seedance complet ?
Environ 10 $ pour une vidéo verticale de 40 secondes en 720p aux tarifs réduits de juillet 2026 : 0,45 $ en images clés, 1,80 $ en brouillons Mini, et environ 7,74 $ en clips finaux en 720p, avec le montage gratuit dans CapCut ou OpenShot. Aux prix catalogue, la même exécution est d'environ 12,40 $. L'étape de l'image clé est ce qui maintient ce nombre aussi bas, car les décisions de rendu sont prises à 0,045 $ au lieu d'environ 0,97 $ par nouveau tirage.
Conclusion
Les clips qui circulent ce mois-ci ne sont pas l'œuvre d'une fonctionnalité secrète. Ils sont une division du travail : Seedream 5.0 Pro décide qui est à l'écran et comment le cadre se sent, Seedance 2.0 décide comment ils bougent et sonnent, et un éditeur gratuit transforme des clips en une chanson avec un visage. Chaque étape est inspectable, et chaque erreur est attrapée à l'endroit le moins cher possible.
Volez l'ordre des opérations. Verrouillez un bloc de personnage, achetez vos erreurs à 0,045 $, animez seulement ce que vous avez déjà approuvé, et laissez la dernière image d'un clip ouvrir le suivant. Les outils sont nouveaux. La discipline n'est que la réalisation cinématographique.






