Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

Wan 3.0 Visages réalistes : 3 prompts qui semblent humains

Wan 3.0 Visages réalistes : Prompts, Paramètres, Tests de validation

Dernière mise à jour : Wan 3.0 est en ligne depuis le 24 août 2026.

La vidéo générée par IA est jugée d’abord sur le visage. Pas sur le mouvement de caméra. Pas sur l’arrière-plan. Le visage.

Si les yeux flottent, la peau devient cireuse, ou la bouche se met à faire ce truc caoutchouteux typique de l’IA, le défilement s’arrête. C’est pourquoi les visages réalistes de Wan 3.0 sont le véritable test de production pour les créateurs qui réalisent des publicités UGC, des courts-métrages, des témoignages et des clips sociaux.

La réponse utile est simple : les visages réalistes ne sont pas un réglage de beauté. C’est un problème de mise en scène. Vous avez besoin d’une référence stable, de petites actions humaines, de règles de caméra claires et de contraintes d’échec strictes.

Ce guide utilise Atlas Cloud comme espace de travail navigateur, car vous pouvez tester Wan-3.0 Text-to-video, Image-to-video et Reference-to-video en un seul endroit, voir l’état d’exécution et vérifier le coût visible avant de soumettre.

Points clés

  • La qualité réelle du visage signifie identité, peau, regard, bouche et continuité du mouvement.
  • Image-to-video est généralement plus sûr quand un visage spécifique compte.
  • Les invites doivent décrire des muscles et des micro-actions, pas seulement des étiquettes d’émotion.
  • Utilisez des brouillons de 8s avant de payer pour des tests de stress de 24s ou 30s.
  • Sur Atlas Cloud, les modes Wan-3.0 commencent à partir de 0,05 $/sec.

Interface de génération vidéo IA montrant un diplômé en pleurs

Visages réalistes Wan 3.0 : carte d’invite de gros plan de remise de diplôme, preuve d’exécution terminée et images de stabilité faciale

Présentation : le cas du gros plan de remise de diplôme utilise un seul visage, une expression subtile, un mouvement du regard et un clip de 30,07s du manuel pour tester la continuité des visages réalistes.

Preuve de mouvement du cas 1 : une jeune femme noire en robe de diplômée bleue maintient une performance faciale en gros plan sur un clip de 30,07s du manuel Wan 3.0.

Pourquoi les visages réalistes de Wan 3.0 sont à la mode, et pourquoi la plupart des tentatives échouent

Verdict d’abord : les visages échouent parce que les invites demandent une ambiance alors que le modèle a besoin de directives.

Wan 3.0 est arrivé avec une toile plus grande : des clips jusqu’à 30 secondes, une sortie 1080P, une génération audio-visuelle native et de larges entrées de référence. La couverture de lancement d’Alibaba mentionne également les entrées multimodales et la continuité visuelle pour les visages humains et les micro-expressions (Alibaba Cloud Community, août 2026). La page officielle Model Studio présente la version autour de la narration en 30s, de la qualité cinématographique 1080P, de l’A/V natif et des entrées de référence omni (Alibaba Cloud Model Studio, août 2026).

Cela semble énorme. Ça l’est.

Mais le problème du créateur est plus pratique : « Cette personne peut-elle cligner des yeux, parler, hésiter et rester la même personne ? »

Les schémas d’échec courants sont familiers :

  • Dérive du regard : le regard n’a pas de cible claire.
  • Peau caoutchouteuse : les pores disparaissent et les joues bougent comme du silicone.
  • Dérive osseuse : les pommettes et la mâchoire changent de forme entre les images.
  • Sourire forcé : la bouche sourit alors que les yeux ne le font pas.
  • Clignement de bouche : les dents et les lèvres palpitent pendant la parole.
  • Perte d’identité déclenchée par la caméra : le visage change après un panoramique ou un tournage.

Ce n’est pas seulement du battage médiatique de lancement. Dans les anciens workflows Wan, des utilisateurs ont signalé une incohérence faciale et des résultats inquiétants lors d’exécutions Image-to-video, y compris des visages qui ne restent plus fidèles à l’image d’origine (Discussion GitHub ComfyUI, avril 2025).

La question est : comment mettre en scène pour contourner cela ?

Aperçu du workflow des visages réalistes Wan 3.0 sur Atlas Cloud

Utilisez le mode le plus simple qui vous donne suffisamment de contrôle.

Si vous n’avez pas de personne de référence, commencez par Text-to-video. Si un visage spécifique compte, utilisez Image-to-video avec une première image forte. Si vous avez des références d’identité, de mouvement et audio, utilisez Reference-to-video.

Vous pouvez partir de la page d’accueil d’Atlas Cloud, ouvrir la page du modèle Wan 3.0, coller l’invite, choisir la durée et la résolution, puis exécuter le test dans un seul onglet de navigateur. L’avantage pratique n’est pas seulement l’accès. C’est que l’invite, les réglages, le panneau de sortie et le coût indiqué restent visibles pendant que vous itérez.

BesoinModèle Atlas CloudOù l’exécuterUtilisationPrix pour vérifier
Partir d’une invite pureWan-3.0 Text-to-videoTerrain de jeu Wan 3.0 Text-to-videoActeur ou scène génériqueÀ partir de 0,05 $/sec
Animer une première imageWan-3.0 Image-to-videoMême famille Wan 3.0, mode Image-to-videoVisage stable, portrait UGCÀ partir de 0,05 $/sec
Verrouiller des références sur le mouvementWan-3.0 Reference-to-videoMême famille Wan 3.0, mode Reference-to-videoRéférences d’identité, mouvement, voix, scèneÀ partir de 0,05 $/sec

Atlas Cloud models/all répertorie actuellement Wan-3.0 Text-to-video, Image-to-video et Reference-to-video à partir de 0,05 $/SEC. La page officielle d’Alibaba montre également une tarification sensible à la résolution pour sa propre plateforme, donc traitez le coût visible du bouton Run comme la source de vérité finale avant de soumettre.

Étape 1 : Choisir le mode de visages réalistes Wan 3.0

Commencez par le workflow qui correspond à votre risque.

Pas de visage de référence ? Utilisez Text-to-video. Besoin d’un acteur stable ? Utilisez Image-to-video. Besoin d’une identité connue plus un mouvement, une voix ou un clip précédent ? Utilisez Reference-to-video.

Copiez cette invite quand vous avez juste besoin d’une vérification rapide de mode :

Plain
116:9, 8 secondes, gros plan cinématographique réaliste. Une personne assise près d’une fenêtre dans une lumière douce du jour prononce une courte phrase avec un mouvement de lèvres naturel, de petits déplacements des yeux et une respiration détendue. Gardez le même visage, le même teint, la même ligne capillaire, la même garde-robe, le même éclairage et le même flou d’arrière-plan pour tout le clip. Évitez la dérive faciale, la peau cireuse, les yeux déformés, les dents supplémentaires, les cuts brutaux et les visages en arrière-plan.

Réglages à choisir :

RéglageRecommandationPourquoi c’est important
Ratio16:9 pour les tests d’article, 9:16 pour le social verticalL’échelle du visage et le recadrage changent le mode d’échec
Résolution1080P pour le final, 720P pour les brouillons si nécessaireUne résolution plus élevée aide les détails de peau et d’yeux
DuréeBrouillon de 8s, test de stress de 24s à 30sLes longues prises révèlent la dérive d’identité
AudioSon d’ambiance sauf si le dialogue est le pointMaintient le test du visage concentré

Pas de point final ?

Réglages des modes de visages réalistes Wan 3.0 sur Atlas Cloud avec une exécution terminée et un panneau de sortie visible

Étape 1 : réglages de mode Wan 3.0 sur Atlas Cloud, capturés après une exécution terminée pour que l’entrée et la sortie soient visibles ensemble.

Étape 2 : Exécuter le cas 1, un gros plan de visage réaliste Wan 3.0

C’est le plus difficile.

Un gros plan supprime toutes les cachettes. Le spectateur peut voir les coins de la bouche, la tension des sourcils, la cible du regard et la texture de la peau. Le cas 1 utilise un clip du manuel Wan 3.0 d’une jeune femme noire en robe de diplômée bleue, cadrée en gros plan, parlant doucement alors que son regard descend.

Copiez cette invite :

Plain
116:9, 8 secondes, gros plan cinématographique réaliste. Une jeune femme noire en robe de diplômée bleue se tient dans une lumière douce de cérémonie intérieure, cadrée de la tête au haut de la poitrine. Une seconde personne est visible uniquement comme une forme complètement floue sur le bord gauche. Elle parle doucement à quelqu’un juste hors champ, bouche bougeant naturellement, sourcils se rapprochant, yeux légèrement humides mais pas en pleurs. Au fil du plan, son regard descend lentement du niveau des yeux vers ses mains. La caméra est fixe mais avec un léger balancement de respiration de la main. Texture de peau naturelle, pores visibles, lumière douce au-dessus, faible profondeur de champ. Préservez le même visage, la même robe, le même teint, la même forme des yeux et le même flou d’arrière-plan pour tout le clip. Évitez la peau plastique, les pommettes changeantes, les dents supplémentaires, le sourire exagéré, les yeux déformés et les cuts brutaux.

Réglages à choisir :

RéglageÀ choisir
ModèleWan-3.0 Image-to-video si vous avez une première image, Wan-3.0 Text-to-video sinon
Durée8s pour un brouillon, 30s pour la preuve de longue prise
Résolution1080P si disponible, sinon 720P
Ratio16:09
AudioSon d’ambiance uniquement sauf si le dialogue est testé

Interface de générateur vidéo IA avec paramètres d’entrée et sortie vidéo générée

Capture d’écran d’exécution terminée du cas 1 de visages réalistes Wan 3.0 pour une invite de gros plan de remise de diplôme

Étape 2 : preuve d’exécution du cas 1 pour le test de visage réaliste en gros plan de remise de diplôme. Voir le clip de présentation ci-dessus pour la preuve de mouvement complète.

Étape 3 : Exécuter le cas 2, un appel téléphonique UGC avec visages réalistes Wan 3.0

Les visages UGC échouent différemment.

Le plan n’est pas aussi serré qu’un gros plan de beauté, mais la parole, la position des mains et la lumière douce de la fenêtre peuvent exposer rapidement le morphing du visage. Ce cas utilise un appel téléphonique par une fenêtre pluvieuse : une jeune femme assise près d’une fenêtre, écoute, répond et termine par un petit demi-sourire.

Copiez cette invite :

Plain
116:9, 8 secondes, vidéo réaliste de style UGC naturel. Une jeune femme aux longs cheveux foncés est assise à une table en bois près d’une fenêtre d’appartement sous la pluie, tenant un smartphone à son oreille. Des lumières de la ville au néon floues dehors. Elle écoute, puis répond d’une voix calme et basse ; ses lèvres bougent doucement, ses yeux se baissent un temps, et elle fait un petit demi-sourire à la fin. Caméra stable en plan moyen rapproché depuis la table, rendu objectif 50mm, lumière douce de la fenêtre d’un côté du visage, lampe d’ambiance chaude en arrière-plan. Gardez son visage, sa ligne capillaire, la forme de son nez, la position des mains, le téléphone, la table, la pluie à la fenêtre et l’éclairage cohérents. Évitez la peau trop embellie, les joues cireuses, le mouvement des lèvres non synchronisé, le morphing du visage, les doigts supplémentaires et les visages en arrière-plan.

Réglages à choisir :

RéglageÀ choisir
ModèleWan-3.0 Text-to-video pour un acteur générique, Image-to-video pour un visage verrouillé
DuréeBrouillon de 8s
Résolution1080P de préférence
Ratio16:09
AudioAudio natif uniquement si vous testez la voix, sinon pluie douce et son d’ambiance

Interface de générateur vidéo IA montrant les paramètres d’entrée et une vidéo générée

Capture d’écran d’exécution terminée du cas 2 de visages réalistes Wan 3.0 pour un appel téléphonique près d’une fenêtre pluvieuse

Étape 3 : preuve d’exécution du cas 2 pour le test de visage avec appel téléphonique sous la pluie.

Femme souriante au téléphone près d’une fenêtre pluvieuse

GIF de preuve de mouvement du cas 2 pour le test de visage avec appel téléphonique sous la pluie

GIF de preuve de mouvement du cas 2 : le clip de 15,04s du manuel Wan 3.0 teste la parole, les déplacements des yeux, la cohérence main-téléphone et l’éclairage intérieur doux.

Étape 4 : Exécuter le cas 3, un clip social vertical avec visages réalistes Wan 3.0

Maintenant, réduisez le visage.

Les clips verticaux sont sournois. Le visage est plus petit, mais les spectateurs remarquent toujours si les yeux se redimensionnent, les jambes se déforment ou si le reflet dans le miroir devient une seconde personne. Ce cas teste le mouvement en pied avec un miroir, des détails de tenue et un sourire détendu.

Copiez cette invite :

Plain
19:16, 8 secondes, vidéo sociale verticale réaliste. Une jeune femme en chemisier blanc brodé, jupe plissée blanche, ceinture noire et baskets blanches à plateforme se tient devant un miroir en pied propre dans un appartement faiblement éclairé. Elle ajuste une manche, se déplace naturellement sur ses appuis, regarde du miroir à la caméra et fait un petit sourire détendu. Cadrage en pied, caméra fixe stable, lumière naturelle du jour, pas de filtre beauté lourd, texture de tissu réaliste et proportions corporelles. Gardez le même visage, la même tenue, la même coiffure, la même position du miroir et la même disposition de la pièce tout au long du plan. Évitez la dérive faciale, la peau de poupée, la taille des yeux changeante, les jambes déformées, les reflets supplémentaires et les cuts brutaux.

Réglages à choisir :

RéglageÀ choisir
ModèleWan-3.0 Text-to-video ou Image-to-video
DuréeBrouillon de 8s
Résolution1080P de préférence
Ratio9:16
AudioPas de musique, son d’ambiance doux uniquement

Interface de générateur vidéo IA montrant une invite textuelle et une vidéo générée

Capture d’écran d’exécution terminée du cas 3 de visages réalistes Wan 3.0 pour un clip de mode vertical avec miroir

Étape 4 : preuve d’exécution du cas 3 pour le test de cohérence faciale en pied vertical.

Femme en chemise blanche brodée et jupe plissée dans une cuisine

GIF de preuve de mouvement du cas 3 pour la cohérence faciale en mode vertical

GIF de preuve de mouvement du cas 3 : le clip de 15,04s du manuel Wan 3.0 vérifie si un visage plus petit reste stable tandis que le corps, la tenue et le miroir restent cohérents.

Étape 5 : Auditer les visages réalistes Wan 3.0 avant de régénérer

Ne régénérez pas parce que le clip « semble étrange ». Nommez d’abord l’échec.

Cette liste de contrôle maintient la révision objective :

VérificationSignal de réussiteRégénérer si
IdentitéMême espacement des yeux, nez, pommettesLe visage ressemble à une nouvelle personne
PeauPores et texture douce restentCireuse, plastique, trop lissée
BoucheLa parole semble petite et humaineMâchoire caoutchouteuse ou clignement de dents
YeuxLe regard a une cible claireLes yeux flottent ou louchent
MouvementUne action continueCut brutal ou clignement corporel
Arrière-planLe flou reste en arrière-planDes visages aléatoires deviennent nets

Tableau de liste de contrôle d’audit pour évaluer les visages réalistes dans Wan 3.0

Tableau de liste de contrôle d’audit des visages réalistes Wan 3.0 pour les vérifications d’identité, peau, bouche, yeux, mouvement et arrière-plan

Étape 5 : un tableau d’audit du réalisme facial que vous pouvez utiliser avant de lancer une autre exécution.

Utilisez ce modèle réutilisable lorsque vous créez votre propre test :

Plain
1[ratio], [durée], vidéo cinématographique réaliste. [Sujet avec ancres d’identité stables] dans [environnement et éclairage spécifiques]. [Chaîne d’actions visibles : ce que le visage, les yeux, la bouche, les mains et la posture font]. Caméra : [taille de plan, rendu objectif, mouvement]. Audio : [son d’ambiance / dialogue / ambiance]. Préservez [visage, teint, garde-robe, accessoire, arrière-plan]. Évitez [dérive faciale, peau cireuse, yeux déformés, mauvaises dents, cuts brutaux, doigts supplémentaires].

Variations de visages réalistes Wan 3.0 à essayer

Essayez celles-ci après avoir réussi les 3 tests principaux :

VariationDébut d’invite courtCe qu’elle teste
Témoignage de fondateurFondateur d’âge moyen dans un bureau calme explique un résultat produit en 8sUGC digne de confiance sans peau de filtre beauté
Plan de réaction d’acteurActeur entend une nouvelle surprenante, le sourire s’efface en silenceContrôle des micro-expressions
Plan de visage avec essayage produitPersonne met des lunettes, du rouge à lèvres ou un soin en tournant légèrementStabilité visage plus produit
Interview documentaireGros plan à main levée, peau naturelle, arrière-plan doux, pas de filtre glamImperfection réaliste

Coût des visages réalistes Wan 3.0 sur Atlas Cloud

Utilisez la formule rapide :

coût = secondes x prix du modèle par seconde x niveau de résolution si applicable

En août 2026, Atlas Cloud models/all répertorie les trois modes vidéo Wan-3.0 à partir de 0,05 $/sec. Cela vous donne un plancher de planification :

TestDuréePourquoi l’utiliserPlancher estimé
Brouillon de visage8sVérification rapide d’inviteÀ partir de 0,40 $
Clip publicitaire UGC12sCoupe socialeÀ partir de 0,60 $
Gros plan long30sTest de stress complet Wan 3.0À partir de 1,50 $

Pour la livraison finale, vérifiez le coût d’exécution visible avant de soumettre. La 1080P peut coûter plus cher que le plancher sur certaines plateformes ou niveaux, et le bouton Run est ce que votre portefeuille verra réellement.

Note légale pour les visages réalistes Wan 3.0

Obtenez le consentement pour les employés réels, les créateurs, les clients et les ressemblances reconnaissables. N’insinuez pas qu’une personne réelle a dit quelque chose qu’elle n’a pas dit. Pour les publicités, les témoignages, les allégations médicales, financières ou le contenu politique, maintenez la divulgation et la révision strictes.

C’est la réponse pour adultes. Le côté amusant reste la direction créative, mais le côté responsable vous garde publiable.

Questions fréquemment posées

Wan 3.0 peut-il créer des visages réalistes ?

Oui, mais les meilleurs résultats viennent d’invites dirigées et de références solides. Demandez des ancres d’identité stables, de petits mouvements faciaux, des cibles de regard claires et des contraintes d’échec spécifiques.

Pourquoi les visages semblent-ils encore parfois étranges ?

Parce que les visages exposent de petites erreurs. La direction des yeux, les dents, les pommettes, le timing des lèvres et la texture de la peau doivent tous rester cohérents en même temps. Une invite large comme « femme triste qui parle » laisse trop de place à la dérive.

Text-to-video ou image-to-video ?

Utilisez Text-to-video quand n’importe quel acteur crédible convient. Utilisez Image-to-video quand un visage spécifique, un acteur de marque, un créateur ou une première image compte.

Quelle est la meilleure invite Wan 3.0 pour un visage qui parle ?

La meilleure invite décrit une chaîne d’actions continue : où la personne regarde, comment la bouche bouge, ce que les mains font, et ce qui doit rester inchangé. Ajoutez ensuite des termes d’évitement pour la peau plastique, les yeux déformés, les mauvaises dents et le morphing facial.

Combien cela coûte-t-il sur Atlas Cloud ?

Atlas Cloud models/all répertorie actuellement Wan-3.0 Text-to-video, Image-to-video et Reference-to-video à partir de 0,05 $/sec. Un brouillon de 8s commence à partir d’environ 0,40 $, tandis qu’un test de stress de 30s commence à partir d’environ 1,50 $ avant tout niveau de résolution supérieur.

Puis-je utiliser les visages réalistes Wan 3.0 pour des publicités ou de l’UGC ?

Oui, avec une discipline créative et légale normale. Obtenez le consentement pour les ressemblances, évitez les faux témoignages et étiquetez l’UGC synthétique lorsque les règles de divulgation ou les politiques des clients l’exigent.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles