
Dernière mise à jour : Wan 3.0 est désormais disponible en direct depuis le 24 août 2026.
Deux écrans de montage côte à côte diffusant le même plan d'une station-service dans le désert, l'un avec une timeline ininterrompue de 30 secondes en dessous, l'autre avec une timeline divisée en deux segments.
À la 20e seconde, la buse du pistolet à essence projette de l'herbe fraîche et verte. Encore perlée d'eau. Le cheval plisse les yeux de plaisir. Le cure-dent du pompiste tombe de sa bouche.
Cette blague ne fonctionne qu'à l'intérieur d'un seul plan continu de 30 secondes. Coupez quatre clips de 8 secondes ensemble, le cheval change de pelage, les lunettes de soleil changent de forme, le ciel vire d'un ton plus chaud, et la chute meurt quelque part dans les raccords.
Alors, quand Wan 3.0 et Seedance 2.5 sont tous deux arrivés dans la même fenêtre en revendiquant 30 secondes natives, un seul passage, sans raccord, cela a cessé d'être une histoire de benchmark. C'est devenu la première fois qu'un modèle vidéo IA pouvait contenir une mise en place, un rebondissement et une chute en un seul plan.
J'ai disséqué les spécifications, effectué une vérification technique par rapport aux fichiers de démo officiels publiés par Alibaba, et j'ai trouvé ce que personne n'a écrit à ce sujet : les deux modèles annoncent 30 secondes, mais la résolution sous-jacente à ces 30 secondes n'est pas du tout le même produit.
Points clés
- Les deux modèles génèrent vraiment 30 secondes en un seul passage. Cette partie n'est pas du marketing. Wan 3.0 couvre de 2 à 30 secondes avec une option de durée intelligente, Seedance 2.5 couvre de 4 à 30 secondes.
- Seul Wan 3.0 rend du 1080p natif à 30 secondes. Seedance 2.5 génère en natif uniquement en 480p et 720p. Ses options 1080p, 1440p et 4K sont des suréchantillonnages post-génération d'une source 720p, et sa propre documentation API indique que le niveau 4K n'est « pas une génération 4K native ».
- Seedance 2.5 gagne sur le volume de références : jusqu'à 30 images plus 10 vidéos plus 10 fichiers audio, soit 50 au total. Le manuel du créateur de Wan 3.0 limite les références à 20.
- Wan 3.0 dispose d'une entrée que personne d'autre n'a : les fichiers
.doc,.xls,.ppt,.pdf,.txtet les pages web en direct, injectés directement comme références créatives. - Un seul des deux est réellement utilisable en dehors d'Alibaba aujourd'hui. Wan 3.0 est en bêta publique sur Alibaba Cloud Model Studio et Qwen Cloud, avec un accès API tiers encore en cours de déploiement. Seedance 2.5 est disponible sur Atlas Cloud avec 30 dans le contrôle de durée dès maintenant.
- Vous voulez tester la structure narrative de 30 secondes avant de payer une seule seconde ? Le générateur gratuit de sketchs publicitaires IA d'Atlas Cloud vous offre un essai gratuit : un spot fini de 15 secondes avec dialogue parlé et effets sonores, téléchargement sans filigrane.
Démo officielle d'Alibaba pour Wan 3.0, tirée du manuel du créateur Tongyi Wan 3.0. Un seul plan, sans coupure, 30,07 secondes. Mesuré avec ffprobe : 1920x1072, 24 ips, audio stéréo AAC intégré. Activez le son pour le coup de queue et le cure-dent tombant au sol à la 29e seconde. Utilisé ici comme matériel de référence à des fins de comparaison et de commentaire uniquement.
Wan 3.0 vs Seedance 2.5 Native 30s : Ce qui a réellement changé ce mois-ci
Quinze secondes ont longtemps été le mur. Wan 2.7 s'arrête là. Seedance 2.0 s'arrête là. Chaque « film IA d'une minute » que vous avez vu sur votre flux l'année dernière était composé de quatre à huit clips collés ensemble dans un logiciel de montage, avec un passage d'étalonnage pour masquer les raccords.
Deux choses ont brisé ce mur dans les mêmes semaines. Alibaba a ouvert la bêta publique de Wan 3.0 le 6 août 2026 avec une génération native de 30 secondes et une entrée de référence multimodale complète (AlphaSignal, août 2026). ByteDance a doublé Seedance de 15 à 30 secondes dans la version 2.5, en le positionnant explicitement comme un moyen de réduire le collage de clips et la dérive visuelle qui l'accompagne.
Le terme « natif » est important ici dans un sens technique spécifique. Cela signifie un seul passage avant sur une seule séquence latente, et non une extension de dernière image où le modèle prend la dernière image du clip A et démarre le clip B à partir de celle-ci. L'extension est la raison pour laquelle le col de la veste de votre personnage change silencieusement de forme entre les plans. Un passage natif conserve la totalité des 30 secondes dans le même contexte, donc le cheval reste le même cheval.
La démo de la station-service est le test le plus clair possible de cela. La structure est en quatre temps : 0 à 8 secondes de rien, 8 à 16 secondes de quelque chose d'étrange, 16 à 24 secondes pour la chute, 24 à 30 secondes pour la sortie. La blague atterrit à la 20e seconde. Ce qui signifie qu'elle n'atterrit que si le cheval, les lunettes de soleil, le traitement de couleur teal-orange et la caméra impassible verrouillée survivent tous aux 19 premières secondes intacts. Le collage ne peut pas faire cela. Non pas parce que le monteur est mauvais, mais parce que le clip B n'a jamais vu le clip A.
Wan 3.0 vs Seedance 2.5 Native 30s : Là où l'image se dégrade réellement
Trente secondes, c'est deux fois quinze. Le risque de dérive n'est pas deux fois plus grand, il est pire que cela, et il se déplace vers un mode de défaillance différent.
Les défaillances du workflow avec collage se produisaient entre les clips. Les défaillances natives de 30 secondes se produisent à l'intérieur du clip. Dans une production de court métrage pratique avec Seedance 2.5, le critique a constaté une décohérence et un morphing apparaissant sous forme de « instabilité visuelle ou de pics dans les modèles de personnages », concentrés dans les séquences d'action rapide, et a spécifiquement noté que ces artefacts ne peuvent pas être nettoyés par suréchantillonnage (MindStudio, août 2026). C'est la partie importante pour quiconque prévoit de rendre en 720p et de suréchantillonner en 4K ensuite : le suréchantillonneur accentue le morphing, il ne le supprime pas.
La même production a enregistré un ratio de tournage de 3,2 pour 1. Environ 450 secondes de génération brute pour obtenir un final de 2 minutes 22 secondes. Planifiez un travail en plan-séquence comme un tournage avec des couvertures, pas comme une file d'attente de rendu où chaque job est livré.
Deux autres conclusions de cette production méritent d'être reprises telles quelles. L'identité visuelle de l'ensemble du film reposait sur trois images de référence, deux portraits de personnages et une plaque de localisation, même si le système accepte jusqu'à 50. Et dans le casting vocal, écrire « American » a corrigé un accent britannique involontaire tandis qu'écrire « American English » ne l'a pas fait, parce que le mot « English » a poussé la prestation vers un registre britannique.
La structure de prompt qui survit à 30 secondes est celle qu'utilise Alibaba dans son propre manuel : des temps explicites horodatés. Pas un paragraphe d'ambiance. Écrivez 0-8s, 8-16s, 16-24s, 24-30s, donnez à chaque bloc son propre comportement de caméra et son propre événement, et terminez par une seule ligne audio couvrant l'ensemble du clip. Vous verrez ce squelette exact à l'étape 4 ci-dessous, car j'ai conservé la structure d'Alibaba et l'ai seulement traduite.
Pour un test hébergé actuel, ouvrez Wan 3.0 sur Atlas Cloud et testez un prompt comme celui ci-dessous avant de publier le workflow.

Wan 3.0 vs Seedance 2.5 Native 30s : Spécifications, prix et ce que vous pouvez exécuter aujourd'hui
Voici l'état des lieux honnête, et la partie où les deux modèles cessent d'être des produits comparables.
Lisez la ligne de résolution deux fois, car c'est tout l'article. La documentation API de Seedance 2.5 Text-to-Video d'Atlas Cloud indique que 720p-esr améliore une source 480p, que 1080p-esr, 1440p-esr et 4k-esr améliorent tous une source 720p, et que l'option 4K fournit un petit côté de 2160 pixels « pas une génération 4K native ». Ainsi, un clip Seedance de 30 secondes étiqueté 4K est en réalité 720p de détails réels, rééchantillonné. La grille tarifaire de Wan 3.0, en revanche, propose un niveau 1080p direct à 0,20 $ par seconde, et les fichiers de démo officiels de 30 secondes publiés par Alibaba mesurent 1920x1072.
L'avantage de cette contrainte : l'ensemble du test se déroule dans un seul onglet de navigateur, sur trois modèles, sans configuration locale.
| Rôle dans ce test | Modèle | Prix indiqué |
|---|---|---|
| Image d'ouverture | GPT Image 2 Text-to-Image | à partir de 0,009 $ / image |
| Le run natif 30s | Seedance 2.5 Text-to-Video | à partir de 0,134 $ / SEC |
Prix indiqués vérifiés sur les pages des modèles Atlas Cloud, août 2026. Considérez-les comme des planchers, pas des devis. Chacun de ces modèles facture selon ce que vous demandez réellement, et le bouton Run affiche le prix de vos paramètres exacts avant de cliquer. Dans ce test, le bouton a indiqué 0,1745 $ pour une image GPT Image 2 en qualité haute et 2048x1152, et 1,514799 $ pour un travail Seedance 2.5 de cinq secondes en 720p et 16:9, ce qui revient à environ 0,30 $ par seconde plutôt que les 0,134 $ indiqués. Le chiffre indiqué correspond au tarif 480p. Vérifiez le bouton, pas le catalogue. Seedance 2.5 propose également un point de terminaison référence-vers-vidéo au même tarif de 0,134 $ par seconde si vous souhaitez pousser la limite des 50 références.
Comment reproduire ce test natif de 30 secondes sur Seedance 2.5
Cinq étapes, trois modèles, le tout dans le navigateur. Copiez les prompts textuellement.
Étape 1 : Verrouillez le squelette horodaté de 30 secondes
N'exécutez rien encore. Lisez d'abord la structure, car c'est la partie qui décide si vos 30 secondes tiennent.
La démo de la station-service Wan 3.0 en haut de cet article est construite comme quatre blocs étiquetés avec une doctrine de caméra fixe énoncée une fois en tête : observation calme et objective, plans moyens verrouillés, gros plans extrêmes soudains uniquement sur les temps absurdes. Chaque événement est ancré à une plage horaire. L'audio est une ligne à la fin couvrant les 30 secondes.
Voici le squelette, vide. Remplissez-le et vous obtenez un prompt qu'un modèle natif 30s peut réellement suivre :
Plain1Un [genre] de 30 secondes se déroulant dans [lieu]. [Style visuel, étalonnage, saturation]. Langage caméra : [doctrine], ponctué par [exception]. 2 30-8s : [mise en place, plan large, établir le monde normal, introduire l'anomalie à l'horizon] 4 58-16s : [l'anomalie agit, toujours traitée comme normale, un plan subjectif ou un insert de réaction] 6 716-24s : [la chute, gros plan extrême sur la chose elle-même, coupure nette sur le visage de réaction] 8 924-30s : [la sortie, un petit geste physique qui conclut la blague] 10 11Audio : [ambiance, trois ou quatre sons diégétiques spécifiques, un dernier petit son]. Pas de musique, pas de dialogue, pas de texte à l'écran.
La spécification mesurable du fichier de référence d'Alibaba, pour ceux qui veulent vérifier mes chiffres : 30,07 secondes, 1920x1072, 24 ips, stéréo AAC. C'est la barre par rapport à laquelle le run Seedance est mesuré.
Étape 2 : Générez l'image d'ouverture
Vous avez besoin d'une ancre visuelle fixe pour que les runs de 15 et 30 secondes partent du même monde. Ouvrez GPT Image 2 Text-to-Image.
Paramètres : qualité high, format d'image 16:9, 1 image.
Plain1Un plan d'établissement large et parfaitement immobile d'une station-service isolée de style Route 66 dans un désert lumineux. Bâtiment rétro jaune-orange-bleu, peinture légèrement décolorée par le soleil ; une pompe à essence vintage rouge délavée devant ; un petit magasin à côté avec un distributeur de soda délavé près de la porte. Sol orange sec et craquelé au premier plan, montagnes en terre cuite chaudes au loin, ciel bleu cyan sans nuage. Un pompiste en bleu de travail graisseux et d'énormes lunettes de soleil noires somnole à moitié sur une chaise près de la porte, un cure-dent à la bouche. Étalonnage strict teal-orange vif, saturation élevée, luminosité élevée, photoréalisme cinématographique, caméra verrouillée, 16:9.

Environnement GPT Image 2 sur Atlas Cloud avec la qualité définie sur high et 16:9, le plan d'établissement de la station-service Route 66 généré dans le panneau de sortie
GPT Image 2 sur Atlas Cloud : qualité haute, 16:9, une image. Le bouton Run a indiqué 0,1745 $ pour cette image, ce qui correspond au coût réel d'un rendu haute qualité 2048x1152. Le 0,009 $ sur la page du modèle est le plancher.

Plan d'établissement de la station-service Route 66 généré avec GPT Image 2, ciel teal et terre orange craquelée, pompiste somnolant près de la porte
L'image d'ouverture. C'est l'entrée pour l'étape 3 et la cible visuelle pour l'étape 4. Généré avec openai/gpt-image-2.
Étape 3 : Heurtez le mur des 15 secondes
Paramètres : première image = votre sortie de l'étape 2, duration glissée à son maximum de 15, résolution 1080P.
Plain1Plan large verrouillé. Une cow-girl en chapeau à larges bords arrive à cheval de l'horizon au pas. Le pompiste somnolent est réveillé par les sabots, remonte ses lunettes, se redresse, mâchant son cure-dent, peu impressionné. Elle descend proprement, mène le cheval directement à la pompe vintage. Étalonnage teal-orange vif, saturation élevée, photoréalisme, caméra calme et observatrice, sans coupure.
Le menu déroulant s'arrête à 15. C'est tout l'intérêt de cette étape. Votre chute est prévue pour la 20e seconde, et ce pipeline ne peut pas atteindre la 20e seconde en un seul morceau. Pour y arriver, vous généreriez un deuxième clip à partir de la dernière image, et dès que vous faites cela, le cheval est un nouveau cheval.

Étape 4 : Lancez le passage natif complet de 30 secondes
Ouvrez Seedance 2.5 Text-to-Video.
Paramètres : duration = 30, resolution = 720p, ratio = 16:9, generate_audio = activé, output_format = mp4, filigrane désactivé.
Choisissez délibérément 720p, pas 1080p-esr. Le 720p est le véritable plafond du modèle, donc il s'agit d'une comparaison pixel pour pixel plutôt que d'une comparaison avec un suréchantillonneur.
Le prompt ci-dessous est le prompt de démonstration de la station-service d'Alibaba, fidèlement traduit du manuel du créateur Wan 3.0 et restructuré en rien. Mêmes temps, mêmes timings, même doctrine de caméra, même liste audio.
Plain1Un court métrage comique absurde et impassible de 30 secondes se déroulant dans une station-service de style Route 66 décolorée par le soleil dans un désert lumineux. Photoréaliste, étalonnage strict teal-orange vif, saturation et luminosité élevées, de sorte que l'événement absurde se produit dans un monde complètement normal, presque joli. Langage de caméra : observation calme et objective, principalement des plans larges verrouillés et des dérives latérales lentes, sans guidage émotionnel, ponctué par des gros plans extrêmes soudains sur les temps absurdes. 2 30-8s : Plan large, verrouillé. Ciel cyan, poussière qui dérive. La station rétro jaune-orange-bleu se tient seule au bord de la route ; un pompiste en bleu de travail graisseux et d'énormes lunettes de soleil noires somnole sur une chaise, cure-dent à la bouche. Seulement le vent. À l'horizon, une cow-girl sur un vrai cheval apparaît au pas. Coupe sur un plan moyen : les sabots le réveillent, il remonte ses lunettes, se redresse, lit le duo comme « un autre qui demande son chemin ». 4 58-16s : Elle ne dit rien. Elle descend proprement, mène le cheval directement à la vieille pompe. Le cheval met négligemment sa tête près de la pompe comme s'il avait déjà fait ça. Brève contre-plongée légèrement fish-eye derrière ses lunettes, la femme et le cheval semblent encore plus étranges. Gros plan : son front se plisse, il enlève ses lunettes, sur le point de crier. Ralenti gros plan : alors que les lunettes se retirent, elle vise la buse du pistolet vers la bouche du cheval et appuie sur la gâchette. 6 716-24s : Gros plan extrême sur la buse. Il en sort non pas de l'essence mais des jets d'herbe verte fraîche, encore perlée d'eau. Coupe nette sur un gros plan extrême du visage du pompiste, figé : yeux écarquillés comme des soucoupes, bouche légèrement ouverte, cure-dent oublié en pleine mastication. Plan moyen : le cheval mange joyeusement, plisse les yeux de plaisir, puis donne un coup de queue puissant et satisfait, et la poussière qu'il soulève atterrit en plein sur le visage du pompiste toujours stupéfait. 8 924-30s : « Plein » d'herbe. Elle raccroche la buse à la pompe, sort des pièces de sa poche, marche vers la porte du magasin et les laisse tomber en tintant dans une boîte de conserve sur le comptoir. Elle jette un coup d'œil en arrière vers le pompiste pétrifié ; sous le bord du chapeau, le coin de sa bouche se relève imperceptiblement. Elle remonte en selle et s'éloigne dans un nuage de poussière. La caméra se rapproche lentement de lui : même posture figée, visage couvert de poussière, lunettes toujours pincées dans sa main, et finalement le cure-dent tombe de sa bouche avec un petit clac. 10 11Audio : vent sec du désert tout au long, sabots, le claquement mécanique de la poignée de la pompe, herbe humide qui gicle, le coup de queue, les pièces dans une boîte de conserve, et un petit clac lorsque le cure-dent touche le sol. Pas de musique, pas de dialogue, pas de texte à l'écran.
Un avertissement qui vous évitera une facture inutile, et c'est le même piège qu'à l'étape 3 : faites glisser le curseur de durée jusqu'à 30, ne tapez pas 30 dans la zone de saisie. La zone affichera joyeusement 30 pendant que le curseur reste sur son défaut de cinq secondes, et le bouton Run vous facturera cinq secondes. Vérifiez le devis avant de cliquer. En 720p et 16:9, un travail de cinq secondes indique 1,514799 $, donc un vrai passage de 30 secondes coûte environ six fois plus.
Il n'y a pas de capture d'écran du run terminé pour cette étape. Trois tentatives de capture automatisée ont toutes soumis la valeur par défaut du curseur au lieu de 30 secondes, et plutôt que de vous montrer un clip de cinq secondes étiqueté comme un clip de 30 secondes, la capture a été omise. Le prompt et les paramètres ci-dessus sont exactement ce qu'il faut coller et configurer.
Étape 5 : Lisez la dérive, honnêtement
Voici le côté Seedance 2.5 de ce même prompt, généré en natif à 30 secondes, 720p, 16:9, audio activé.
Seedance 2.5, le même prompt de la station-service Wan 3.0 copié textuellement : natif 30s en une génération, 1280x720, 24 ips, audio intégré. Mêmes quatre temps, la cow-girl et le cheval arrivant, le gag du pistolet, le gros plan de dissonance cognitive du pompiste. Mettez-le à côté du clip Wan 3.0 en haut pour une lecture comparative.
Mettez les deux clips côte à côte et vérifiez cinq choses spécifiques. Ne vérifiez pas « lequel est le plus beau », c'est un argument de goût et cela vous fera perdre votre après-midi.
- Identité du pelage et du costume. Le cheval est-il de la même couleur à la 29e seconde qu'à la 6e ? Les lunettes de soleil ont-elles la même forme après les avoir enlevées et les avoir remises dans sa main ?
- Stabilité de l'étalonnage. Échantillonnez le ciel à la 2e seconde et à la 28e seconde. L'étalonnage teal-orange dérive vers le chaud sur les longues générations plus souvent que les gens ne le pensent.
- Le temps physique à la 20e seconde. De l'herbe sortant d'une buse à essence est une demande physique. L'herbe a-t-elle une trajectoire et retombe-t-elle avec du poids, ou apparaît-elle en fondu comme une texture ?
- Discipline de la caméra. Le prompt indique verrouillé. Comptez combien de fois la caméra invente un zoom avant qu'on ne lui a pas demandé. C'est l'échec le plus courant des longues générations : le modèle manque d'événements planifiés et comble le temps avec du mouvement.
- Morphing en mouvement rapide. Le coup de queue et le nuage de poussière sont les mouvements les plus rapides du clip. Selon les notes de production de MindStudio, c'est exactement là que la décohérence se concentre, et exactement ce qu'un suréchantillonnage ne corrigera pas.
Notez ces cinq critères, pas l'ambiance. C'est une comparaison que vous pouvez défendre devant un client.
Trois autres prompts appariés Wan 3.0 vs Seedance 2.5 Native 30s
Une démo n'est qu'une anecdote. Voici trois autres fichiers officiels Wan 3.0 de 30 secondes provenant du même manuel, chacun mettant en avant une partie différente du problème des 30 secondes. Pour le monstre marin et le monologue dark fantasy, le côté Seedance 2.5 a été généré sur le même prompt en natif 30 secondes et est intégré juste après, afin que vous puissiez regarder les deux plutôt que de me croire sur parole.
| Prompt | Ce qu'il teste en résistance | Fichier officiel Wan 3.0, mesuré | Côté Seedance 2.5, même prompt |
|---|---|---|---|
| Film catastrophe monstre marin | 10 plans scriptés plus une partition orchestrale en 30s | 1920x1072, 24 ips, 30,07s, AAC | généré à 30s, intégré ci-dessous ; un nom IP et le texte de la marque du bateau ont été retirés pour que le filtre de contenu de Seedance le laisse passer, le storyboard est par ailleurs identique |
| Monologue anglais dark fantasy | voix anglaise native et synchronisation labiale sur une poussée continue lente | 1280x720, 24 ips, 30,05s, AAC | généré à 30s à partir du prompt textuel, intégré ci-dessous |
| Anime sportif 2D, prompt de deux lignes | le modèle peut-il remplir 30s avec presque aucune instruction | 1280x720, 24 ips, 30,05s, AAC | non généré ici ; montré sous forme de grille d'images Wan uniquement pour lire la structure dans le temps |
| Court métrage comique whip-pan (exclu) | 8 whip-pans et 8 temps émotionnels sans coupure | 1280x720, 24 ips, 30,04s, AAC | non exécuté : la densité du dialogue est spécifique au mandarin, une réécriture en anglais ne serait pas une comparaison équitable |
Démo officielle Wan 3.0 : dix plans scriptés et un développement orchestral complet en un seul passage de 30 secondes, en 1920x1072. C'est l'argument le plus fort pour le 1080p natif, car le volume d'eau et les détails de la peau mouillée de la créature sont exactement ce qu'un suréchantillonnage 720p invente plutôt qu'il ne résout. Manuel du créateur Alibaba Tongyi, utilisé pour la comparaison et le commentaire.
Seedance 2.5, le même prompt catastrophe en dix plans en natif 30s, son activé. Bateau de pêche ballotté par la tempête, le marin terrifié, la houle qui se soulève, puis le léviathan des abysses brisant la surface dans les éclairs. Une référence IP et le texte de la marque sur la coque ont été retirés pour que le filtre de contenu de Seedance le laisse passer ; le storyboard est par ailleurs identique, ce qui rend la comparaison du volume d'eau et des détails de la peau mouillée équitable face au clip Wan 3.0 ci-dessus.
Démo officielle Wan 3.0, son activé. Dialogue de méchant en anglais natif, « Mûr assez pour le vide », délivré en une seule inclinaison lente vers le haut sans coupure. C'est le clip que les équipes anglophones devraient tester, car la voix, la synchronisation labiale et un mouvement de caméra continu de 30 secondes doivent tous tenir à la fois.
Seedance 2.5, le même prompt dark fantasy copié textuellement, natif 30s, son activé. Même méchant aux yeux violets, les marques d'étoiles runiques, la nébuleuse d'ombre se formant dans sa paume ouverte, et les deux lignes en anglais. Regardez si la synchronisation labiale et la seule poussée continue tiennent sur les 30 secondes complètes comme elles le font du côté Wan 3.0.
Si vous exécutez le côté Seedance 2.5 apparié de celui-ci, gardez les deux lignes anglaises textuelles et souvenez-vous de la bizarrerie d'accent des notes de production : écrivez « American », pas « American English ». Le mot « English » tire la prestation vers une lecture britannique.
Le troisième est la surprise discrète. Le prompt d'anime sportif 2D dans le manuel d'Alibaba fait deux lignes. Pas d'horodatage, pas de liste de plans, juste un boxeur frappant un sac de frappe, fatigué, en pleine douleur. Trente secondes à partir de cela est un véritable test de la capacité du modèle à inventer sa propre structure. Le voici échantillonné sur sa propre durée :

Quatre images de la démo officielle d'anime sportif 2D Wan 3.0, échantillonnées à environ 1, 10, 20 et 29 secondes, montrant le design du boxeur et le fond de la salle de sport sur les 30 secondes complètes
Quatre images de la démo officielle d'anime sportif 2D Wan 3.0, échantillonnées à environ 1, 10, 20 et 29 secondes. Même design de personnage, même débardeur, même sac de frappe, même rangée de casiers, à travers un changement de plan large à gros plan que le prompt n'a jamais demandé. Une grille d'images plutôt qu'un clip, car la comparaison ici porte sur le temps à l'intérieur d'un même fichier, pas sur le mouvement.
Lecture pratique : avec un prompt de deux lignes, le modèle a inventé sa propre couverture, passant d'un plan large verrouillé à un gros plan de sueur et d'épuisement, et a maintenu le design du personnage ce faisant. C'est la bonne nouvelle. Le compromis est que vous avez perdu le contrôle de quand les choses se produisent. Si vous avez besoin que 30 secondes fassent atterrir un temps spécifique à une seconde précise, écrivez les horodatages.
Testez gratuitement la narration native de 30 secondes avant de payer pour l'un ou l'autre
Un run de 30 secondes en 720p sur Seedance 2.5 coûte environ 9 $ une fois que vous tarifiez la résolution réelle plutôt que le plancher du catalogue. Un run de 30 secondes en 1080p sur la grille tarifaire de Wan 3.0 coûte 6,00 $. Aucun n'est cher selon les standards de production, mais avec un ratio de tournage de 3,2 pour 1, vous n'achetez pas un clip, vous en achetez trois ou quatre.
Avant de dépenser quoi que ce soit, il vaut la peine de répondre à une question moins coûteuse : est-ce que mon script tient réellement la route en un seul plan continu ? La plupart des échecs à 30 secondes ne sont pas des échecs du modèle. Ce sont des échecs de structure, trois temps entassés là où il y avait de la place pour deux, ou une chute écrite à la 26e seconde sans rien pour porter les secondes 8 à 20.
Le générateur gratuit de sketchs publicitaires IA d'Atlas Cloud répond à cette question pour rien. Vous lui donnez une description de produit et jusqu'à quatre photos de produit, chacune de moins de 8 Mo, choisissez l'un des six styles (mème drôle, rebondissement, sitcom, réconfortant, luxe ou vente agressive), et il écrit d'abord un script à deux personnages, avec un accroche de trois secondes, un conflit et un rebondissement, puis construit chaque plan autour de ce script. Les personnages prononcent leurs répliques à voix haute et les effets sonores sont rendus dans la vidéo.
Les limites honnêtes : il fait 15 secondes, pas 30, vous devez être connecté, et vous obtenez une génération gratuite avant de recharger des crédits. Mais 15 secondes avec une accroche, un conflit et un rebondissement vous disent si vos trois temps respirent. Si la structure fonctionne là, prenez les mêmes temps, étirez-les sur le squelette 0-8s / 8-16s / 16-24s / 24-30s de l'étape 1, et allez dépenser les neuf dollars pour un vrai passage natif de 30 secondes.
Ce que coûte réellement un clip natif de 30 secondes sur Wan 3.0 vs Seedance 2.5
| Configuration | Tarif | Durée | Un clip |
|---|---|---|---|
| Wan 3.0, 1080p natif (Alibaba Cloud uniquement) | 0,20 $ / sec | 30s | 6,00 $ |
| Wan 3.0, 720p natif (Alibaba Cloud uniquement) | 0,10 $ / sec | 30s | 3,00 $ |
| Wan 3.0, 480p natif (Alibaba Cloud uniquement) | 0,05 $ / sec | 30s | 1,50 $ |
| Seedance 2.5, 720p natif, sur Atlas Cloud | 0,30 $ / sec mesuré en 720p, indiqué à partir de 0,134 $ | 30s | environ 9,09 $ |
| GPT Image 2 image d'ouverture, qualité haute, 2048x1152 | indiqué à partir de 0,009 $ / image | 1 image | 0,1745 $ indiqué |
La comparaison qui tranche réellement : Wan 3.0 en 720p est moins cher par seconde que Seedance 2.5 en 720p, et en 1080p, c'est le seul des deux qui vend de vrais pixels. La réponse de Seedance 2.5 : 50 emplacements de référence, disponibilité immédiate et une API fonctionnelle que vous pouvez utiliser dès cet après-midi.
Note sur les sources et les licences pour ces clips natifs de 30 secondes
Chaque clip Wan 3.0 et chaque prompt Wan 3.0 dans cet article proviennent du manuel du créateur Tongyi Wan 3.0 distribué publiquement par Alibaba, reproduits ici à des fins de comparaison et de commentaire, crédités, non modifiés et non désiamés. L'utilisation commerciale des sorties de Seedance 2.5 relève des conditions de ByteDance et Volcengine ; la facturation API et le traitement des données du côté d'Atlas Cloud relèvent des conditions propres d'Atlas Cloud. Aucune ressemblance avec une personne réelle n'est reproduite dans ce test. Si vous livrez un travail client, lisez les conditions du modèle pour le point de terminaison spécifique que vous appelez, pas un résumé de blog.
Foire aux questions
Le natif 30s de Wan 3.0 est-il vraiment un seul passage, ou des clips assemblés ?
Un seul passage. Wan 3.0 génère de 2 à 30 secondes en une seule génération avec une option de durée intelligente, il peut donc aussi décider que le clip n'a pas besoin des 30 secondes complètes. C'est différent de l'extension de dernière image, où un deuxième clip est amorcé à partir de la dernière image du premier et l'identité dérive à travers la jonction.
Lequel est vraiment en 1080p à 30 secondes, Wan 3.0 ou Seedance 2.5 ?
Wan 3.0. Il dispose d'un niveau 1080p natif sur sa grille tarifaire, et les propres fichiers de démo de 30 secondes d'Alibaba mesurent 1920x1072. Seedance 2.5 génère en natif uniquement en 480p et 720p ; ses options 1080p, 1440p et 4K sont des améliorations d'une source 720p, et sa documentation API décrit le niveau 4K comme « pas une génération 4K native ».
L'image se dégrade-t-elle encore à la 25e seconde ?
Cela peut arriver, mais la défaillance a changé de forme. Au lieu d'une couture visible entre les clips, vous obtenez du morphing et de la décohérence à l'intérieur du plan, concentrés dans les passages de mouvement rapide, et le suréchantillonnage ne les supprime pas. Une production de court métrage documentée avec Seedance 2.5 a fonctionné avec un ratio de tournage de 3,2 pour 1, donc planifiez les longs plans avec des couvertures.
Quel modèle accepte plus de matériel de référence ?
Seedance 2.5, avec une large marge : 30 images plus 10 vidéos plus 10 fichiers audio, soit 50 au total, avec une vidéo et un audio de référence chacun limités à 30 secondes combinées par requête. Le manuel de Wan 3.0 limite les références à 20, mais c'est le seul qui accepte les fichiers .pdf, .ppt, .xls, .doc, .txt et les pages web en direct comme entrée créative.
Wan 3.0 aura-t-il des poids ouverts ?
Il n'y a aucun engagement officiel. Depuis la bêta publique d'août 2026, aucun poids Wan 3.0, checkpoint Hugging Face ou nœud ComfyUI n'a été publié, et les poids ouverts officiels pour la gamme vidéo phare s'arrêtent à Wan 2.2 (Kingy AI, août 2026). Considérez toute autre information que vous lisez sur une sortie des poids de la version 3.0 comme une spéculation jusqu'à ce qu'Alibaba dise le contraire.






