Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

Comment rédiger des prompts Wan 3.0 : ce que trois cas officiels enseignent et qu'aucune liste de paramètres ne peut enseigner.

Comment écrire des prompts Wan 3.0, rétro-ingénierie à partir de cas officiels de 30 secondes : la structure à trois couches, l'écriture de performance, la syntaxe sonore et le contrôle de mouvement.

La gamme Wan est déjà la famille de vidéos open source la plus forkée d'Internet. Les dépôts Wan 2.2 et Wan 2.1 comptent chacun environ 17 000 étoiles (GitHub, août 2026), et la page Wan-AI enregistre des centaines de milliers de téléchargements par mois sur ses points de contrôle (Hugging Face, août 2026). Alors, quand Wan 3.0 est entré en accès anticipé avec une génération native de 30 secondes, jusqu'à 20 entrées de référence, et un audio généré en même temps que l'image, la première question n'était pas de savoir si les gens allaient l'utiliser. C'était de savoir si quelqu'un saurait comment écrire pour lui.

Car une génération unique de 30 secondes n'est pas une version agrandie d'un clip de 5 secondes. C'est un problème d'écriture différent. Un prompt de 5 secondes décrit une image qui bouge. Un prompt de 30 secondes dirige le temps : qui change, quand, sur quel plan, avec quel son en dessous.

Le manuel du créateur Wan 3.0 diffusé avec l'accès anticipé contient dix-neuf cas officiels de prompt et résultat. J'ai étudié les dix-neuf, puis sélectionné les trois qui enseignent la technique la plus transférable, et j'ai décortiqué chacun : ce que le prompt contrôle réellement, pourquoi il est construit de cette façon, et comment réutiliser sa structure pour vos propres plans. Chaque vidéo ci-dessous est la sortie réelle et non éditée pour le cas discuté. Les prompts originaux des cas sont écrits en chinois ; les squelettes ici sont des reformulations anglaises de leur structure, et la gamme Wan accepte les prompts dans les deux langues.

Points clés

  • Les longs prompts Wan 3.0 partagent une architecture : d'abord les liaisons de référence, puis les règles globales, puis une liste de plans horodatés. Les prompts courts de test peuvent omettre des couches, les prompts de production ne devraient pas.
  • Écrivez la performance comme une chaîne d'actions visibles, jamais comme une étiquette d'émotion. « Anxieux » est un espoir. « La mastication ralentit, les sourcils se rapprochent, le regard tombe sur ses mains » est une instruction.
  • Le son fait partie du prompt, pas une étape ultérieure. Le dialogue se place entre accolades, les effets et la musique ont leurs propres phrases, et le silence doit être demandé explicitement.
  • Les cas officiels répètent leur contrainte la plus importante et interdisent l'échec qu'ils anticipent. Un prompt du manuel interdit le « glissement fluide » en trois formulations différentes, car le modèle par défaut est la fluidité.
  • Le mouvement peut être quantifié : images par salve, pourcentage de la largeur du cadre par élan, nombre de répétitions. Le cas de la libellule ci-dessous en est la preuve.

Une génération, 30 secondes, dix séquences de storyboard numérotées et un arc musical complet écrits dans un seul prompt : un bateau de pêche, une tempête et un monstre marin qui émerge à l'heure prévue. Cas officiel du manuel Wan 3.0, montré ici sans édition.

Ce qui rend l'écriture d'un prompt Wan 3.0 différente

Trois capacités changent le travail, et chacune ajoute une compétence d'écriture que les modèles plus courts n'ont jamais exigée.

30 secondes natives signifie structure. Quand un modèle génère 5 secondes, un prompt peut être une phrase dense. À 30 secondes, un prompt non structuré dérive : les personnages changent de vêtements, la caméra oublie sa règle, la fin n'a rien à voir avec le début. Chaque long cas du manuel combat la dérive de la même manière, avec des étapes explicites et des états finaux. Cette structure est le cœur de ce guide.

Audio conjoint signifie direction sonore. Wan 3.0 génère la bande sonore avec l'image. Le dialogue, les effets, l'ambiance et la musique sont tous promptables, ce qui signifie aussi qu'une bande sonore non écrite est une bande improvisée. Les cas officiels traitent l'audio avec la même discipline que la lumière : énoncé, cadré, et parfois délibérément réduit au silence.

Jusqu'à 20 références signifie une syntaxe de liaison. Les visages, les tenues, les lieux, les voix et même les images de storyboard peuvent être épinglés aux matériaux téléchargés. Les cas du manuel lient chaque référence à un sujet nommé une fois, puis réutilisent le nom dans chaque plan ultérieur. Si vous avez testé la même discipline sur la génération actuelle, par exemple sur Wan 2.7 référence vers vidéo, la version 3.0 vous semblera familière plutôt que nouvelle.

Rien de tout cela n'exige d'écrire un roman à chaque fois. Le cas court le plus réussi du manuel est une phrase unique à propos d'un OVNI volant une vache dans un style peint à la main. La compétence est de savoir quelles couches votre plan nécessite, ce qui est exactement le but des trois cas ci-dessous.

La pile de prompts Wan 3.0 : trois couches que partagent tous les longs cas

Si on réduit les dix-neuf cas officiels à l'essentiel, les longs sont tous identiques, une pile de trois couches.

Couche 1 : liaisons de référence. Une ligne par matériau téléchargé, indiquant ce qu'il est et ce qui peut en être tiré. Définir la femme de l'image 1 comme Sujet 1. Ne prendre que la tenue de l'image 2. La voix du Sujet 2 suit l'audio 1. Lier une fois, puis se référer par nom pour toujours. Les pluriels vagues comme « les images définissent les personnages » sont exactement ce que cette couche existe pour éviter.

Couche 2 : règles globales. Tout ce qui doit rester vrai pour tout le clip, écrit avant toute action : style visuel et ses points de référence, un système de couleurs nommé, comportement de la lumière, grammaire de la caméra, discipline de performance, discipline audio, et une liste des échecs interdits. Cette couche est celle où les cas du manuel sont les plus agressifs. Un cas d'arts martiaux plafonne le ralenti à deux utilisations de moins d'une seconde chacune, interdit les sous-titres à l'écran, interdit totalement la musique de fond, et interdit à la caméra de rester immobile plus de 1,5 seconde.

Couche 3 : la chronologie. Des séquences horodatées ou numérotées, chacune portant un événement principal et un état final visible. Pas « ils se battent un moment » mais « 0 à 1,5 seconde : il se tient à la ligne de roseaux, en contre-jour, le vent dans son manteau, et dit sa seule réplique. » Les états finaux sont ce qui garde la quinzième seconde cohérente avec la cinquième.

Une façon utile de le retenir : la couche 1 est le casting, la couche 2 est le règlement, la couche 3 est la liste de plans. Les trois cas qui suivent mettent chacun l'accent sur une couche.

Cas 1 : Comment écrire un prompt Wan 3.0 pour la performance, un visage pendant 30 secondes

Le cas le moins tape-à-l'œil du manuel est celui que la plupart des gens devraient étudier en premier : un gros plan fixe unique d'une jeune femme en robe de graduation bleue, tenu pendant 30 secondes complètes pendant qu'elle parle, s'inquiète, et finalement regarde ses mains.

Trente secondes, un seul plan, aucun cut. La robe vous dit la scène, le sourcil vous dit les enjeux, et la chute du regard atterrit exactement là où le prompt l'a placée. Cas officiel du manuel, sortie non éditée.

Voici ce que fait le prompt officiel, geste par geste, dans mes mots plutôt que les siens :

  1. Caméra avant le sujet. Il commence par verrouiller le cadre : gros plan frontal, tête et haut du corps, et une imperfection délibérée, une deuxième personne sur le bord gauche qui est complètement floutée. Les arrière-plans que vous nommez puis floutez sont des arrière-plans que le modèle n'affinera pas en cours de plan.
  2. Garde-robe comme exposition. Une robe de graduation bleue remplace un paragraphe de mise en scène. Le modèle infère la cérémonie, la foule, le jour. Choisissez le vêtement ou l'accessoire qui implique tout le monde, et évitez de décrire le monde.
  3. Émotion comme une chaîne d'actes visibles. Le prompt ne demande jamais « anxiété ». Il écrit la bouche qui bouge pendant qu'elle parle, le sourcil légèrement froncé, l'expression sérieuse du visage. Chaque élément est quelque chose qu'une caméra peut vérifier. Les étiquettes d'émotion sont des espoirs. Les mouvements musculaires sont des instructions.
  4. Le micro-mouvement qui vend le réalisme. Deux détails font plus que tout le reste combiné : la caméra maintient un léger balancement de respiration à main levée, et son regard voyage de devant vers le bas sur ses mains, sur une trajectoire énoncée. Donnez à tout long plan un changement lent et délibéré comme celui-ci, et le plan semblera dirigé plutôt que généré.

Squelette réutilisable, en anglais, structure identique au cas :

Plain
1Frontal [taille du plan] sur [sujet], [détail de cadrage]. Un [élément flouté] se trouve
2au [bord] du cadre. [Sujet] porte [un vêtement qui implique toute la scène].
3[Sujet] est [action], bouche qui bouge, [détail de sourcil / yeux / mâchoire].
4La lumière tombe de [direction], gardant [note de texture de peau / tissu].
5La caméra est verrouillée mais porte un léger balancement de respiration à main levée.
6Au fil du plan, [un changement lent visible : une trajectoire de regard, un déplacement
7de posture, un objet abaissé].

Remplissez ce modèle avec un sujet de votre choix avant de toucher aux épopées de 30 secondes. Si le visage tient trente secondes, votre structure est solide.

Cas 2 : Comment structurer un prompt Wan 3.0 de 30 secondes comme un réalisateur

La courte pièce absurde du manuel est le meilleur objet d'enseignement structurel de tout le document : une cow-girl monte un vrai cheval dans une station-service isolée de la Route 66, prend le pistolet, et remplit son cheval d'herbe fraîche pendant que la vision du monde de l'employé s'effondre tranquillement.

Trente secondes de mise en place impassible et d'un gag visuel parfait. La comédie est écrite dans la structure : cadrage fixe d'observation, puis un plan extrême rapproché soudain exactement quand la chose absurde se produit. Cas officiel du manuel, sortie non éditée.

Son prompt est organisé en cinq modules nommés, et la liste des modules elle-même est la leçon :

  1. Un logline. Deux phrases de ce qui se passe et quelle est la blague. Pas des visuels, une histoire. Écrire cela en premier vous oblige à savoir à quoi servent les 30 secondes.
  2. Un système de couleurs nommé. Pas « coloré » mais une loi à deux couleurs : ciel sarcelle et terre orange, puis chaque objet majeur assigné à un côté de cette loi, la pompe rouge délavée, l'écharpe orange, les montagnes terre cuite. Nommez le système, puis distribuez-le. La cohérence dans la vidéo IA est généralement un problème de palette avant d'être un problème de personnage.
  3. Une liste de distribution avec des rôles narratifs. Chaque personnage reçoit deux ou trois traits visibles et, surtout, une fonction : l'employé est explicitement désigné comme le porteur du plan de réaction du film. Assigner un rôle dit au modèle où l'attention de la caméra doit être dans chaque séquence où ce personnage apparaît.
  4. Une philosophie de caméra nommée. Le cas invente une règle et la définit en une ligne : observation calme plus plan rapproché absurde, ce qui signifie des plans moyens fixes et des panoramiques lents par défaut, interrompus par un plan extrême rapproché soudain uniquement quand l'événement absurde se déclenche. Nommer votre règle de caméra et s'y référer bat le fait de redécrire les mouvements de caméra dans chaque séquence. C'est aussi le mécanisme comique entier : le regard plat fait atterrir le plan rapproché de la pompe à herbe.
  5. Une chronologie en quatre actes avec états finaux. Mise en place, escalade, punchline, répercussions, chacun avec une plage horaire, un événement principal, et une image finale figée, jusqu'au cure-dent qui tombe finalement de la bouche de l'employé dans la dernière séquence.

Le modèle transférable est plus grand que la comédie. Logline, loi de palette, distribution avec emplois, une règle de caméra nommée, quatre actes avec états finaux : c'est un brief de production, et Wan 3.0 est la première génération de cette famille avec assez de piste, trente secondes, pour qu'un brief compte. La démonstration du monstre marin en haut de cet article est le même squelette avec dix séquences et un arc musical noté, écrit de la même manière : chaque séquence un événement, chaque séquence un état final visible.

Cas 3 : Écrire la physique du mouvement dans un prompt Wan 3.0

La chose la plus difficile à obtenir de n'importe quel modèle vidéo est un mouvement qui n'est pas fluide. Les modèles tendent vers un mouvement doux et continu, c'est pourquoi chaque fée IA flotte comme un ballon lent. La fée du manuel ne flotte pas. Elle se déplace comme une libellule : vol stationnaire mort, élan instantané, arrêt net, nouvelle direction.

Petite fée aux cheveux roses et aux ailes plane au-dessus d'un tapis

Plan stationnaire, élan, arrêt brutal. Le flou au milieu de chaque salve est large d'une ou deux images, exactement comme le prompt l'a budgétisé. Cas officiel du manuel, montré en GIF silencieux ; le clip livré a sa propre ambiance.

Ce prompt gagne avec quatre techniques que vous pouvez reprendre directement :

  1. Déclaration de priorité en haut. La première ligne annonce l'exigence unique la plus prioritaire, la loi de mouvement de la libellule, avant tout décor. L'attention est un budget. Dépensez les premiers tokens sur la règle qui décide du succès, pas sur la couleur du tapis.
  2. Un ancrage de physique du monde réel. Au lieu d'adjectifs comme « rapide et agile », le prompt nomme un animal dont la signature de mouvement a été vue des milliers de fois par le modèle : vol stationnaire ponctuel, élan d'explosion, arrêt complet, reciblage net. Un ancrage familier surpasse dix adverbes abstraits.
  3. Des chiffres là où les adjectifs seraient flous. L'élan doit traverser 60 à 90 pour cent de la largeur du cadre en 3 à 5 images. L'arrêt doit durer 2 à 4 images. Au moins six salves clairement séparées doivent se produire dans les huit premières secondes. Le flou de mouvement résiduel est budgétisé à 1 à 2 images. Vous n'écrivez pas de la poésie à ce stade, vous écrivez un cahier des charges, et le modèle l'honore. Regardez la bande ci-dessous : l'image en plein élan est pure traînée, les images de chaque côté sont parfaitement nettes.
  4. Interdire la valeur par défaut. Le prompt interdit explicitement l'échec qu'il prédit, en plusieurs formulations : pas de flottement lent de fée, pas de croisière à vitesse uniforme, pas de glissement continu et fluide, puis une phrase corrective qui dit ce que le mouvement n'est pas, « pas un chemin de vol continu, mais des déplacements courts, nets, presque sautant les images. » Quand vous savez ce que le modèle fera en mode automatique, écrivez le mode automatique hors du plan.

Fée jouet aux cheveux roses volant parmi des ours en peluche et des blocs colorés

Quatre images consécutives du cas de la libellule : vol stationnaire près de l'ours en peluche, flou de mouvement en plein élan, arrivée au-dessus des blocs, arrêt net

Quatre images de la sortie ci-dessus. Net, strié, net, net : le budget de flou du prompt, visible image par image.

Les mêmes quatre mouvements se généralisent à tout problème de mouvement : panoramiques fouettés qui ne doivent pas devenir des cuts, impacts qui ont besoin de poids, mouvement mécanique qui ne doit pas devenir organique. Ancrer, quantifier, prioriser, et interdire la valeur par défaut.

Dialogue, son et syntaxe de référence dans les prompts Wan 3.0

Les trois cas ci-dessus sont silencieux sur les mécanismes qui font parler les prompts Wan 3.0, voici donc la couche de syntaxe, compilée à partir des autres cas du manuel.

Le dialogue va entre accolades. Les répliques parlées sont enveloppées comme {Quel groupe musculaire aujourd'hui} plutôt que laissées en prose ouverte, ce qui empêche le modèle de narrer votre dialogue en légende. Les répliques atterrissent avec synchronisation labiale, et une scène de dialogue s'écrit comme une alternance d'action et de lignes entre accolades, exactement comme un scénario.

Les voix peuvent être attribuées. La syntaxe de référence s'étend à l'audio : définir la femme de l'image 1 comme Sujet 1, puis déclarer que la voix du Sujet 1 suit l'audio 1. Visage d'un fichier, voix d'un autre, tous deux verrouillés pour la durée.

L'audio a besoin d'une déclaration de discipline. Les cas les plus forts déclarent leur paysage sonore de la même manière qu'ils déclarent leur palette. Un cas d'animation énonce ses types audio d'emblée : ambiance et musique seulement, pas de parole. Le cas d'arts martiaux va plus loin, interdisant la musique de fond complètement, ne gardant que la respiration, la friction des tissus, les frappes et le vent, et il obtient exactement cela. La musique, quand elle est souhaitée, s'écrit comme un arc à travers la chronologie, des drones de terreur bas à l'escalade des cordes jusqu'à un impact de cuivres et une longue note funèbre, mappée aux séquences qu'elle doit atteindre.

Le silence est aussi une demande. Sans instruction, le modèle remplit la piste. Si votre plan n'a besoin que d'un son de pièce et d'un seul événement sonore, dites-le. La direction sonore dans Wan 3.0 n'est pas un garniture. C'est la seconde moitié du médium.

Où pratiquer la formule de prompt Wan 3.0 aujourd'hui

Wan 3.0 est encore en route, et les utilisateurs ne peuvent pas l'utiliser pour le moment. La structure ci-dessus se cumule encore maintenant, car rien n'y est verrouillé à une version : liaisons, règles globales, chronologies, dialogue entre accolades et valeurs par défaut interdites fonctionnent tous sur la génération actuelle de Wan.

Toute la famille actuelle est disponible sur Atlas Cloud, Wan 2.7 texte vers vidéo, image vers vidéo, référence vers vidéo et édition vidéo, avec une clé et un prix par exécution affiché avant de lancer. Un exercice pratique : prenez le squelette du Cas 1, remplissez-le avec votre propre sujet, et exécutez-le comme un plan court sur Wan 2.7 texte vers vidéo. Si la chaîne de performance tient là, le même fichier est votre brouillon Wan 3.0 au jour un, avec la durée augmentée au lieu d'être réécrite. Atlas Cloud a l'habitude de donner l'accès au jour zéro quand cette famille se met à jour, donc l'environnement de pratique et la destination sont probablement la même page.

Questions fréquentes

Quelle doit être la longueur d'un prompt Wan 3.0 ?

Aussi longue que le plan le nécessite et pas plus. Le manuel officiel va d'une seule phrase, un gag OVNI peint à la main, à des prompts de plus de mille mots pour un film de monstre en dix séquences. La variable déterminante est la durée et la taille du casting : un test de 5 secondes avec un seul sujet a besoin d'une phrase dense, une histoire de 30 secondes avec plusieurs personnages a besoin des trois couches, liaisons, règles globales et une chronologie.

Wan 3.0 génère-t-il du son à partir du prompt ?

Oui, l'audio est généré en même temps que l'image. Le dialogue s'écrit entre accolades et atterrit avec synchronisation labiale, les effets sonores et l'ambiance s'écrivent en prose, et la musique peut être dirigée comme un arc à travers la chronologie. La discipline va dans les deux sens : si vous voulez un quasi-silence, ou une ambiance sans partition, vous devez le dire, sinon le modèle remplira la piste tout seul.

Quelle est la syntaxe des accolades dans les prompts Wan 3.0 ?

Les accolades marquent les mots prononcés à voix haute par un personnage, comme dans {On se voit à la ligne d'arrivée}. Garder le dialogue entre accolades le sépare de la description de scène, donc le modèle interprète la réplique au lieu de l'illustrer. Pour un travail multilingue, indiquez la langue avant la réplique et le style de livraison avec.

Comment garder un personnage cohérent sur une vidéo Wan 3.0 de 30 secondes ?

Liez le personnage à une référence une fois, avec une portée : définissez la personne de l'image 1 comme Sujet 1, ne prenez que le visage, les cheveux et la tenue. Puis répétez le nom du sujet dans chaque séquence de la chronologie où il apparaît, et réitérez les deux ou trois traits verrouillés à tout moment à haut risque (comme une action proche du costume ou un changement d'éclairage). Le cas de scène de combat du manuel répète même les verrouillages de traits par module, ce qui est la version ceinture et bretelles.

Puis-je pratiquer l'écriture de prompts Wan 3.0 avant d'y avoir accès ?

Oui, et vous devriez. La structure à trois couches, le dialogue entre accolades, les liaisons de référence et la technique d'interdiction des valeurs par défaut fonctionnent tous sur la famille actuelle aujourd'hui. Wan 2.7 sur Atlas Cloud couvre texte vers vidéo, image vers vidéo, référence vers vidéo et édition vidéo avec une seule clé, donc un modèle testé là-bas se transfère à Wan 3.0 comme un changement de durée plutôt qu'une réécriture.

Conclusion

Dix-neuf cas officiels disent la même chose de trois manières différentes : un prompt Wan 3.0 est un document de production, pas une légende. Faites le casting de vos références, légiférez votre style, planifiez vos séquences, et traitez le son comme la moitié de l'image. Commencez avec le squelette du gros plan de la diplômée, passez au brief en cinq modules, et réservez le cahier des charges de mouvement budgétisé en images pour le plan qui en a besoin. Les modèles continueront de changer. La discipline d'écrire le temps au lieu de décrire des images est la partie que vous gardez.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles