Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

Wan 3.0 Multi-Shot Consistency: J'ai compté chaque coupure dans 110 clips officiels.

Wan 3.0 Cohérence Multi-Shot : J'ai compté tous les 110 clips

Cohérence multi-shot Wan 3.0 : j'ai compté chaque cut dans 110 clips officiels

Vous avez écrit un script en quatre plans. Le plan 1 est parfait : chapeau de paille, collier de perles noires, robe en lin blanc, lumière parfaitement réglée. Le plan 2 arrive et c'est une femme différente avec un chapeau différent.

Ce fossé est la raison pour laquelle les gens scrutent la cohérence multi-shot de Wan 3.0 : la promesse d'un prompt, six plans, trente secondes, même personnage du début à la fin.

Alors j'ai arrêté de lire les fiches techniques. J'ai téléchargé les 110 fichiers de démo qu'Alibaba a publiés avec son propre manuel du créateur Wan 3.0, j'ai passé ffmpeg sur chacun, j'ai analysé les 64 prompts appariés, puis j'ai fait ce que personne dans les résultats de recherche n'a fait : j'ai compté les cuts réels dans les vidéos livrées et je les ai comparés au nombre de plans demandé par chaque prompt.

Trois constats contredisent ce que vous lirez partout ailleurs.

Suite d'étalonnage cinématographique où un mur d'écrans montre le même personnage au chapeau de paille conservé sur six plans différents, le point de référence pour la cohérence multi-shot Wan 3.0

Le mur de référence d'un coloriste est le modèle mental honnête pour la cohérence multi-shot : une identité, six cadrages, vérifiés côte à côte. Généré avec openai/gpt-image-2.

Points clés

  • 6 plans est réel mais pas garanti : 3 des propres prompts multi-shot d'Alibaba ont atteint exactement le nombre déclaré, 2 ont livré moins.
  • Le pire cas demandait 4 plans et en a rendu 2.
  • Pas de 4K. Aucun des 110 fichiers officiels ne dépasse le 1080p, et seulement 4 sont exactement en 1920x1080.
  • Les accessoires et la caméra dérivent avant les visages. Surveillez le chapeau, pas les yeux.
  • Pas d'API Wan 3.0 publique en dehors de la propre plateforme d'Alibaba pour l'instant, donc le tutoriel ci-dessous le reconstruit sur des modèles que vous pouvez utiliser aujourd'hui.

Voici le meilleur résultat, issu du manuel d'Alibaba. Six plans déclarés dans le prompt, six plans livrés, mêmes deux personnages, même garde-robe, même pluie :

Séquence anime en six plans sur un quai de gare sous la pluie, la même fille avec un parapluie transparent et le garçon avec un sac à dos kaki conservés de manière cohérente à travers chaque cut

Démo bêta officielle Wan 3.0 d'Alibaba (clip du manuel v013, 1280x720, 20.05s). Le prompt numérotait les plans 1 à 6 ; ffmpeg trouve exactement 5 cuts durs, donc les 6 plans ont été atteints. Non généré par Atlas Cloud.

Ce qu'est réellement la cohérence multi-shot Wan 3.0

Version courte : ce sont trois promesses distinctes sous un seul nom, et Alibaba est exceptionnellement précis sur lesquelles.

Dans son article de lancement, Alibaba divise la cohérence en personnages (« traits du visage, coiffure et couleur de cheveux, morphologie, vêtements et accessoires »), accessoires (« apparence multi-angle, structure matérielle, logos et détails de matière ») et espace (« blocage des personnages et perspective de la caméra ») (Alibaba Cloud, 2026). Cette division en trois couches est la grille d'évaluation pour tout ce qui suit. Même visage, mauvais collier, c'est un échec.

Le modèle génère jusqu'à 30 secondes en un seul job, en 480P, 720P ou 1080P (Alibaba Cloud, 2026).

Maintenant, la partie que les résultats de recherche se trompent.

Affirmation courante dans les résultats de rechercheCe que montrent réellement les documents officiels
« Génération native 4K »L'article officiel liste 480P / 720P / 1080P uniquement. Sur 110 fichiers de démo officiels, rien ne dépasse le 1080p, et seuls 4 fichiers sont exactement en 1920x1080. Le format « 1080p » paysage courant est 1920x1072.
« Jusqu'à 6 plans indépendants par génération »Aucune spécification du nombre de plans n'apparaît dans l'article de lancement d'Alibaba. Empiriquement, ça tient : sur 8 prompts explicitement multi-shot dans le manuel, le plus élevé déclare 6, et deux d'entre eux ont livré 6.
« Jusqu'à 12 images de référence »Des tests pratiques rapportent jusqu'à 10 images plus 5 clips vidéo plus 5 clips audio (Curious Refuge, 2026). L'article d'Alibaba ne donne aucun chiffre.
« Poids ouverts, licence Apache-2.0 »Les versions précédentes de Wan avaient des poids ouverts ; Wan 3.0 est un service de plateforme et aucun poids n'est apparu (Curious Refuge, 2026).
« L'API est sortie »Il fonctionne sur Alibaba Cloud Model Studio. Les plateformes d'inférence tierces ne l'ont pas encore.

Et voici le tableau qui a pris le plus de temps à construire. Chaque nombre est le mien, issu de la détection de scène ffmpeg sur le fichier livré par rapport au nombre de plans écrit dans le prompt apparié :

Démo officiellePrompt déclareCuts durs trouvésPlans livrésVerdict
v013 quai pluvieux, anime6 plans56Exact
v055 journal du golden retriever6 plans, 30.0s56Exact
v021 restaurant de ramen et chaton4 plans34Exact
v008 lac forestier, 3D4 plans23Un de moins
v085 femme au chapeau de paille4 plans12Moitié
v041 couloir vers une ruelle magique3 segments, « pas de cut dur »01 prise continueExactement comme demandé
v045, v084, v1023 / 5 / multi-sujetTrop nombreux à résoudreNon comptableCuts rapides et effet lavis de Chine empêchent la détection

Relisez les lignes du milieu. Trois prompts ont atteint leur nombre pile. Deux ne l'ont pas fait. Le nombre de plans que vous tapez est une demande, pas un contrat.

Pourquoi la cohérence multi-shot Wan 3.0 se brise : 4 modes de défaillance

Verdict d'abord : ça se brise rarement sur le visage. Ça se brise sur les objets et la caméra, et ça se brise le plus durement quand vous changez plusieurs choses à la fois.

Voici le clip qui m'a le plus appris, car c'est le moins bon de la propre vitrine d'Alibaba.

GtZy2TUK4ak

Démo bêta officielle Wan 3.0 d'Alibaba (clip du manuel v085, 1240x742, 30.08s). Le prompt scripte quatre plans avec timecodes. ffmpeg trouve un seul vrai cut, à 9.3s. Les plans 3 et 4 s'effondrent en une seule prise tenue qui fonce au noir. Non généré par Atlas Cloud.

Mode de défaillance 1 : les accessoires dérivent avant les visages. Dans ce clip, regardez la seule prise d'ouverture, avant tout cut. À 0.6s, le chapeau canotier a un mince ruban noir et le pendentif est une pierre marine à facettes. À 9.2s, le ruban est un large ruban noir et le pendentif est une goutte noire lisse et brillante. Son visage est stable tout le temps. Les accessoires ne le sont pas.

Deux images de la même prise continue de neuf secondes, côte à côte, montrant le ruban du chapeau qui s'élargit et le pendentif du collier qui change de forme et de couleur

Les deux images proviennent de la même prise ininterrompue de la démo officielle v085, à 8.6 secondes d'intervalle, sans cut entre elles. Le ruban du chapeau et le pendentif changent tous deux. C'est la couche des accessoires qui échoue tandis que la couche du personnage tient.

C'est pourquoi le test d'acceptation qui fonctionne réellement est une liste de contrôle des accessoires, pas un test d'ambiance. Pour ce personnage, ce sont trois éléments : forme du chapeau et ruban, collier de perles et pendentif, encolure de la robe.

Mode de défaillance 2 : les scènes multi-sujets tiennent individuellement et se brouillent au contact. Chaque personnage reste reconnaissable seul. Mettez-les dans le même cadre, en interaction, et les identités saignent. Des tests indépendants ont trouvé la même chose : « La cohérence des personnages a commencé à se dégrader, et le compositing ressemblait parfois plus à un mauvais effet d'incrustation qu'à un environnement généré naturellement », avec le lip-sync pointé comme la plus grande faiblesse (Curious Refuge, 2026).

Mode de défaillance 3 : vous avez changé quatre variables dans une seule ligne. Nouveau lieu plus nouvel angle de caméra plus nouvel éclairage plus nouvel état de la garde-robe est le moyen fiable de perdre une identité. Les propres prompts du manuel luttent contre cela en répétant la tenue complète dans chaque segment. Sur les 64 prompts appariés, 9 disent explicitement « reste inchangé », 5 fixent la position de la caméra, et 4 exigent que le personnage reste identique.

Mode de défaillance 4 : 30 secondes en un seul job ne signifie pas 30 secondes d'un seul plan. Ce sont des produits différents. Un job multi-shot de 30s coupe entre les cadrages. Si ce que vous voulez est une seule prise continue ininterrompue, enchaîner des continuations dégrade : l'erreur d'identité se cumule à chaque transition, donc la prise unique propre est courte par nature.

Le manuel a exactement un prompt qui réussit la continuité parfaite, et cela vaut la peine de copier la structure de la phrase :

Trois segments de prompt rendus comme une seule prise continue ininterrompue, d'un couloir d'appartement à travers une porte dans une ruelle gothique éclairée par une lampe

Démo bêta officielle Wan 3.0 d'Alibaba (clip du manuel v041, 720x1280, 15.04s). Trois segments de prompt, et ffmpeg trouve zéro cut dur, ce qui est exactement ce que le prompt exigeait. Non généré par Atlas Cloud.

Sa ligne de transition, traduite, est la chose la plus réutilisable de tout le manuel : continuer de manière transparente à partir de la dernière image du segment précédent ; le personnage, la garde-robe, le lieu et la position de la caméra restent complètement identiques ; pas de cut dur et pas de transition de scène brutale. Un seul prompt sur 64 l'utilise. Volez-la.

Le workflow de cohérence multi-shot que vous pouvez exécuter aujourd'hui

La question est : où exécutez-vous réellement cela ?

Pour l'instant, Wan 3.0 vit sur le propre Model Studio d'Alibaba. Aucune plateforme d'inférence tierce ne l'héberge. Sur Atlas Cloud, il n'apparaît que comme une entrée « à venir » sans aucun endpoint en direct, ce qui est l'état réel des choses et mérite d'être dit clairement plutôt que de faire semblant.

Vous avez donc deux options : attendre, ou arrêter de demander à un seul prompt de faire six choses.

La deuxième option est de toute façon meilleure, et mon comptage de cuts est l'argument en sa faveur. Un seul job multi-shot vous a donné un nombre de plans qui a manqué de moitié dans la propre vitrine d'Alibaba. Diviser le job remet ce contrôle entre vos mains :

  1. Verrouillez l'apparence une fois, sous forme d'image fixe.
  2. Clonez cette identité dans une image clé par plan, en changeant exactement une variable à chaque fois.
  3. Animez chaque plan séparément avec la référence verrouillée.
  4. Assemblez localement.

Plus lent à configurer, nettement plus prévisible. Et chaque modèle de la chaîne est utilisable aujourd'hui.

ÉtapeModèleRôle dans la chaînePrix listé
1bytedance/seedream-v5.0-pro/text-to-imageVerrouiller l'apparence du personnage0,045 $ / image
2google/nano-banana-2/editCloner l'identité dans l'image clé de chaque plan0,08 $ / image
3alibaba/wan-2.7/reference-to-videoAnimer chaque plan avec la référence verrouillée0,10 $ / seconde
Altalibaba/wan-2.7/text-to-videoUn prompt, plusieurs plans (moins contrôlable)0,10 $ / seconde
Fixalibaba/wan-2.7/video-editRéparer un accessoire erroné sans régénérer0,10 $ / seconde

À savoir pour la question du « meilleur modèle pour la cohérence multi-shot » : la référence-à-vidéo est désormais toute une catégorie. bytedance/seedance-2.0-fast/reference-to-video tourne à 0,072 $/s (20% de réduction sur 0,09 $, en août 2026), kwaivgi/kling-video-o3-pro/reference-to-video 0,095 $/s (15% de réduction sur 0,112 $), minimax/h3/reference-to-video 0,10 $/s, et google/veo3.1/reference-to-video 0,20 $/s. Tous les prix vérifiés sur le catalogue en direct le 21 août 2026.

Un avertissement avant les étapes : les prix listés sont un plancher, pas un devis. La résolution et la durée font varier le nombre réel, alors lisez le bouton Run avant de vous engager.

Comment construire une cohérence multi-shot de style Wan 3.0, étape par étape

Nous reconstruisons exactement la feuille de route que le propre modèle d'Alibaba a ratée : la femme au chapeau de paille, quatre plans, jardin à voiture. Même script, contrôle par plan, et cette fois vous obtenez quatre plans parce que vous en avez rendu quatre.

Commençons.

Étape 1 : verrouillez l'apparence. Une image devient l'ancre d'identité pour tout l'aval. Générez-la sur Seedream v5.0 Pro, 16:9, la plus haute résolution proposée. Nommez explicitement les trois accessoires de contrôle, car ce sont eux qui dérivent.

plaintext
135mm film still, vintage sunlit rose garden. An elegant young woman wearing a
2natural straw boater hat with a black band, a black beaded necklace with a single
3teardrop pendant, and a white sleeveless linen dress. She stands before a wall of
4blooming pink and cream roses, one hand lightly touching the brim of her hat,
5gentle and thoughtful gaze just off camera. Soft warm natural light, dappled sun
6flare, shallow depth of field, fine film grain, medium close-up.

Playground Seedream v5.0 Pro sur Atlas Cloud avec le prompt du chapeau de paille saisi et l'image clé du personnage terminée rendue dans le panneau de sortie

Étape 1 terminée : l'ancre d'identité pour toute la séquence de quatre plans.

Étape 2 : clonez l'identité dans les plans 2 à 4. Une image clé par plan, une exécution chacun, en utilisant Nano Banana 2 Edit avec le résultat de l'étape 1 comme référence. La discipline qui compte : répétez la garde-robe complète à chaque fois, puis changez exactement une chose.

Plan 2, le virage émotionnel :

plaintext
1Keep the exact same woman from the reference image: identical face, identical
2natural straw boater hat with black band, identical black beaded necklace with a
3teardrop pendant, identical white sleeveless linen dress. New shot: cinematic
4close-up, she slowly lifts the straw hat off her head and lowers her chin, a faint
5wistful expression. Same rose garden background. Strictly preserve the same
6lighting, skin tone, film grain and colour grade as the reference.

Plan 3, le cut vers la voiture :

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant, identical white sleeveless linen dress,
3the straw boater hat now resting on her lap. New shot: back seat of a moving car,
4side profile, her hand propped against the door, gazing out a rain-beaded window,
5blurred green foliage rushing past. Overcast light with a warm interior fill,
6shallow depth of field, elegant melancholy. Strictly preserve the same face, the
7same colour grade and the same 35mm film grain as the reference.

Plan 4, le dernier regard :

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant. New shot: extreme facial close-up beside
3the car window, eyes slowly closing, a calm and released expression. Raindrops
4slide down the glass in front of her, focus shifting onto the droplets, background
5falling into bokeh. Wong Kar-wai style cinematic mood, fine film grain. Strictly
6preserve the same face, the same lighting and the same colour grade as the
7reference.

Playground Nano Banana 2 Edit sur Atlas Cloud avec l'image clé de l'étape 1 chargée comme référence et l'image clé du plan 2 rendue, identité et garde-robe conservées

Étape 2 terminée : image clé du plan 2, même femme, chapeau maintenant dans ses mains.

Étape 3 : animez le plan 1 avec la référence verrouillée. Maintenant chaque plan devient vidéo indépendamment sur Wan 2.7 reference-to-video. Paramètres : 720P, 5 secondes, et déposez l'image clé de l'étape 1 dans le slot Images. Vérifiez le devis du bouton Run avant de lancer.

plaintext
1Shot 1 of 4. Reference image 1 defines the character: keep the same face, the same
2natural straw boater hat with black band, the same black beaded necklace with a
3teardrop pendant and the same white sleeveless linen dress identical for the entire
4clip. 35mm film look, vintage sunlit rose garden. The woman lightly touches the
5brim of her hat as a soft breeze lifts strands of her hair; the camera pushes in
6very slowly. Warm natural light, dappled sun flare, shallow depth of field, fine
7film grain. The camera position stays stable. No hard cut and no scene change.

Playground Wan 2.7 reference-to-video sur Atlas Cloud avec l'image clé dans le slot Images et le clip de cinq secondes terminé en lecture dans le panneau de sortie

Étape 3 terminée : le clip verrouillé par référence rendu dans le panneau de sortie.

Et voici ce qui est sorti :

Clip de cinq secondes verrouillé par référence de la femme au chapeau de paille dans le jardin de roses, ruban du chapeau et collier stables tout au long

Notre propre exécution sur Atlas Cloud, pas une démo d'Alibaba. Montré sous forme de GIF silencieux ; le fichier livré contient une piste audio.

Étape 4 : enchaînez les plans 2 à 4, puis assemblez. Répétez l'étape 3 pour chaque image clé restante, et collez la phrase de transition du manuel en haut de chaque prompt suivant :

plaintext
1Continue seamlessly from the last frame of the previous segment. The character,
2the wardrobe, the location and the camera position stay completely identical.
3No hard cut and no abrupt scene transition.

Ensuite, concaténez localement avec ffmpeg et effectuez la vérification d'acceptation en trois points : forme du chapeau et ruban, collier de perles et pendentif, et si la progression du cadrage entre les plans a du sens. Si exactement un accessoire est erroné dans un plan, ne régénérez pas le plan. Envoyez-le via wan-2.7/video-edit et modifiez uniquement cela, en empruntant la formulation du manuel : gardez les actions, la garde-robe et le reste du cadre inchangés.

Variations : scènes multi-sujets et verrouillages de style

Trois modèles du manuel qui valent la peine d'être volés.

Fiches personnages pour les plans multi-sujets. Lorsque deux personnes ou plus partagent le cadre, les prompts officiels attribuent des fiches personnages avec des lettres et redéclarent la tenue complète de chacun dans chaque segment. Verbeux, laid, et ça fonctionne mieux que les pronoms.

Déclaration de style globale pour un travail stylisé. L'encre de Chine, l'animation cel et autres styles lourds ont besoin que le style soit fixé une fois pour l'ensemble, puis une feuille de route avec timecodes en dessous.

Séquence d'arts martiaux à l'encre de Chine avec un épéiste dans une bambouseraie, style verrouillé sur une séquence de combat à cinq temps avec timecodes

Démo bêta officielle Wan 3.0 d'Alibaba (clip du manuel v084, 20.05s, recadré). Cinq beats avec timecodes sous une déclaration de style globale à l'encre de Chine. Le coup de pinceau stroboscopique est la raison pour laquelle la détection automatique de cuts ne peut pas compter celui-ci. Non généré par Atlas Cloud.

Corrigez, ne régénérez pas. Un passage en video-edit sur un seul accessoire erroné est moins cher qu'un nouveau rendu et ne peut pas casser les plans qui étaient déjà bons.

Combien coûte une séquence de quatre plans

Chiffres concrets pour la séquence construite ci-dessus, aux tarifs listés :

  • 1 ancre d'identité sur Seedream v5.0 Pro : 0,045 $
  • 3 images clés de plan sur Nano Banana 2 Edit : 3 x 0,08 $ = 0,24 $
  • 4 clips à 5s, 720P, sur Wan 2.7 reference-to-video : 20s x 0,10 $ = 2,00 $
  • Total : environ 2,29 $ pour une séquence de 20 secondes, quatre plans, identité verrouillée

Étendez-la à un morceau de six plans de 30 secondes et la ligne vidéo devient 3,00 $, soit environ 3,44 $ tout compris.

Deux réserves honnêtes. Premièrement, les prix listés sont un plancher : les paliers de résolution et la durée modifient le montant réel, et le devis Run du playground est le seul chiffre qui engage, c'est pourquoi les captures d'écran ci-dessus sont plus importantes que cette liste. Deuxièmement, sur Wan 3.0 lui-même, Alibaba tarifie la génération vidéo de Model Studio par seconde selon le palier de résolution, mais je n'ai pas pu confirmer les tarifs exacts par seconde de Wan 3.0 à partir d'une page officielle, donc je ne cite pas de chiffres que je n'ai pas pu vérifier.

Il est utile de noter ce que vous achetez avec l'approche par job divisé : pas un prix plus bas, mais un nombre de plans qui correspond à votre script. D'après les preuves de la propre vitrine d'Alibaba, ce n'est pas quelque chose qu'un seul job de 30 secondes peut vous promettre pour l'instant, et c'est la réponse pratique à la cohérence multi-shot Wan 3.0 jusqu'à ce que l'API ouvre.

Questions fréquentes

Combien de plans Wan 3.0 peut-il garder cohérents en une seule génération ?

Six, d'après les preuves actuelles, avec une réserve. L'article de lancement d'Alibaba ne publie aucune spécification de nombre de plans. Sur les 8 prompts explicitement multi-shot de son manuel officiel, le plus élevé déclare 6, et deux d'entre eux ont livré exactement 6 cuts vérifiés. Considérez 6 comme un plafond observé, pas une garantie.

Wan 3.0 génère-t-il vraiment du 4K natif ?

Non. L'article officiel liste 480P, 720P et 1080P uniquement. Sur l'ensemble des 110 fichiers de démo officiels, rien ne dépasse le 1080p, seulement 4 fichiers sont exactement en 1920x1080, et le format paysage courant est 1920x1072. Les fréquences d'images se répartissent entre 24 ips pour 63 fichiers et 30 ips pour 46.

L'API Wan 3.0 est-elle disponible, et où puis-je l'exécuter ?

Elle fonctionne sur Alibaba Cloud Model Studio. Aucune plateforme d'inférence tierce ne l'héberge encore ; Atlas Cloud la liste comme une entrée « à venir » sans aucun endpoint en direct. Si vous avez besoin d'une sortie multi-shot cette semaine, la chaîne Wan 2.7 reference-to-video ci-dessus est le substitut fonctionnel.

Pourquoi mes personnages changent-ils encore entre les plans même avec une image de référence ?

Généralement parce qu'un seul prompt a changé le lieu, l'angle de la caméra et l'éclairage simultanément. Changez une variable par plan, et répétez la garde-robe complète dans chaque prompt. Vérifiez aussi les bonnes choses : dans la propre démo d'Alibaba, le visage est resté stable tandis que le ruban du chapeau et le pendentif du collier ont tous deux changé à l'intérieur d'une seule prise ininterrompue.

Les poids de Wan 3.0 sont-ils open source ?

Aucun poids n'a été publié. Les versions précédentes de Wan étaient téléchargeables et exécutables localement, tandis que Wan 3.0 est un service de plateforme hébergé. Quiconque cite une licence Apache-2.0 pour Wan 3.0 répète quelque chose sans source officielle derrière.

Quel est le moyen le plus rapide d'obtenir une cohérence multi-shot sans accès à Wan 3.0 ?

Quatre étapes : verrouillez une image d'identité, clonez-la en une image clé par plan en changeant une seule variable à chaque fois, animez chaque plan avec référence-à-vidéo, puis assemblez localement et vérifiez vos accessoires. Environ 2,29 $ et environ une demi-heure pour une séquence de quatre plans.


Méthodologie : les 110 fichiers de démo et 64 prompts appariés proviennent du manuel officiel du créateur Wan 3.0 d'Alibaba, archivé localement le 11 août 2026. Les métadonnées ont été lues fichier par fichier avec ffmpeg ; les nombres de cuts proviennent de la détection de changement de scène ffmpeg à un seuil de 0,2, recoupée avec les images extraites ; la structure des prompts a été analysée par programmation. Les prix d'Atlas Cloud ont été vérifiés sur le catalogue de modèles en direct le 21 août 2026.

Sources : Alibaba Cloud (août 2026) ; Curious Refuge (2026).

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles