Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

Wan 3.0 vs Seedance 2.5 Native 30s : Les deux annoncent 30 secondes, mais un seul est vraiment en 1080p.

Wan 3.0 contre Seedance 2.5 native 30s, testé avec les prompts de démonstration d'Alibaba : lequel rend de vrais pixels 1080p, lequel fait un upscaling, et lequel est disponible dès aujourd'hui.

Deux moniteurs montrant une scène western à côté de storyboards

Deux moniteurs de montage côte à côte diffusant la même scène de station-service désertique, l'un avec une timeline continue de 30 secondes en dessous et l'autre avec une timeline divisée en deux segments

À la 20e seconde, la buse du pistolet à essence crache de l'herbe fraîche et verte. Encore perlée d'eau. Le cheval plisse les yeux de plaisir. Le cure-dent du préposé tombe de sa bouche.

Cette blague ne fonctionne qu'à l'intérieur d'un seul plan continu de 30 secondes. Coupez quatre clips de 8 secondes ensemble et le cheval change de robe, les lunettes de soleil changent de forme, le ciel vire d'un ton plus chaud, et la chute meurt quelque part dans les raccords.

Alors, quand Wan 3.0 et Seedance 2.5 ont tous deux débarqué dans la même fenêtre en revendiquant 30 secondes natives, un seul passage, sans couture, cela a cessé d'être une simple histoire de benchmark. C'est devenu la première fois qu'un modèle vidéo IA pouvait contenir une mise en place, un retournement et une chute en un seul plan.

J'ai passé les spécifications au peigne fin, j'ai vérifié les fichiers de démo officiels d'Alibaba, et j'ai trouvé ce que personne n'a écrit : les deux modèles disent 30 secondes, mais la résolution sous ces 30 secondes n'est pas du tout le même produit.

Points clés

  1. Les deux modèles génèrent vraiment 30 secondes en un seul passage. Ce n'est pas du marketing. Wan 3.0 couvre de 2 à 30 secondes avec une option de durée intelligente, Seedance 2.5 couvre de 4 à 30 secondes.
  2. Seul Wan 3.0 rend du 1080p natif à 30 secondes. Seedance 2.5 génère nativement en 480p et 720p uniquement. Ses options 1080p, 1440p et 4K sont des upscales post-génération d'une source 720p, et sa propre documentation API indique que le niveau 4K n'est « pas une génération 4K native ».
  3. Seedance 2.5 gagne sur le volume de références : jusqu'à 30 images plus 10 vidéos plus 10 fichiers audio, soit 50 au total. Le manuel du créateur de Wan 3.0 limite les références à 20.
  4. Wan 3.0 a une entrée que personne d'autre n'a : des fichiers .doc, .xls, .ppt, .pdf, .txt et des pages web en direct, introduits directement comme références créatives.
  5. Un seul des deux est réellement utilisable en dehors d'Alibaba aujourd'hui. Wan 3.0 est en bêta publique sur Alibaba Cloud Model Studio et Qwen Cloud, avec un accès API tiers encore en déploiement. Seedance 2.5 est en ligne sur Atlas Cloud avec 30 dans le contrôle de durée dès maintenant.
  6. Vous voulez tester la structure narrative de 30 secondes avant de payer pour une seule seconde ? Le générateur gratuit de sketches publicitaires IA d'Atlas Cloud vous offre un essai gratuit : un spot fini de 15 secondes avec dialogues parlés et effets sonores, téléchargement sans filigrane.
Invalid YouTube video ID

Démo officielle de Wan 3.0 par Alibaba, issue du manuel du créateur Tongyi Wan 3.0. Un seul plan, sans coupure, 30,07 secondes. Mesuré avec ffprobe : 1920x1072, 24 ips, audio AAC stéréo intégré. Son activé pour le coup de queue et le cure-dent tombant au sol à la 29e seconde. Utilisé ici comme matériel de référence à des fins de comparaison et de commentaire uniquement.

Wan 3.0 vs Seedance 2.5 Native 30s : Ce qui a réellement changé ce mois-ci

Pendant longtemps, le mur était de 15 secondes. Wan 2.7 s'arrête là. Seedance 2.0 s'arrêtait là. Chaque « film d'une minute en IA » que vous avez vu sur votre fil d'actualité l'année dernière était composé de quatre à huit clips collés ensemble dans un logiciel de montage, avec un passage de l'étalonneur pour masquer les raccords.

Deux choses ont brisé ce mur en l'espace de quelques semaines. Alibaba a ouvert la bêta publique de Wan 3.0 le 6 août 2026 avec une génération native de 30 secondes et une entrée multimodale complète (AlphaSignal, août 2026). ByteDance a doublé Seedance de 15 à 30 secondes dans la version 2.5, le positionnant explicitement comme un moyen de réduire le collage de clips et la dérive visuelle qui l'accompagne.

Le terme « natif » est important ici dans un sens technique spécifique. Cela signifie un seul passage avant sur une seule séquence latente, et non une extension de dernière image où le modèle prend la dernière image du clip A et démarre le clip B à partir de celle-ci. L'extension est la raison pour laquelle le col de la veste de votre personnage change tranquillement de forme entre les plans. Un passage natif a les 30 secondes entières dans le même contexte, donc le cheval reste le même cheval.

La démo de la station-service est le test le plus clair possible de cela. La structure comporte quatre temps : 0 à 8 secondes de rien qui se passe, 8 à 16 secondes de quelque chose d'étrange qui se passe, 16 à 24 secondes pour la chute, 24 à 30 secondes pour la sortie. La blague tombe à la 20e seconde. Ce qui signifie qu'elle ne tombe que si le cheval, les lunettes de soleil, le teinté-orange et la caméra verrouillée impassible survivent tous les 19 premières secondes intacts. Le collage ne peut pas faire ça. Pas parce que le monteur est mauvais, mais parce que le clip B n'a jamais vu le clip A.

Wan 3.0 vs Seedance 2.5 Native 30s : Où l'image se brise réellement

Trente secondes, c'est deux fois quinze. Le risque de dérive n'est pas deux fois plus grand, il est pire que ça, et il se déplace vers un autre mode de défaillance.

Les échecs du workflow avec collage se situaient entre les clips. Les échecs natifs à 30 secondes sont à l'intérieur du clip. Lors d'une production pratique d'un court métrage avec Seedance 2.5, le critique a trouvé de la décohérence et du morphing apparaissant comme « des pics visuels ou de l'instabilité dans les modèles de personnages », concentrés dans les séquences d'action rapide, et a spécifiquement noté que ces artefacts ne peuvent pas être nettoyés par l'upscaling (MindStudio, août 2026). C'est la partie qui compte pour quiconque envisage de rendre en 720p et de passer en 4K après : l'upscaler accentue le morphing, il ne le supprime pas.

La même production a enregistré un ratio de tournage de 3,2 pour 1. Environ 450 secondes de génération brute pour couper un final de 2 minutes 22 secondes. Planifiez les longs plans comme un tournage avec des couvertures, pas comme une file d'attente de rendu où chaque travail est livré.

Deux autres conclusions de cette production méritent d'être reprises telles quelles. L'identité visuelle de tout le film reposait sur trois images de référence, deux portraits de personnages et une plaque de lieu, même si le système accepte jusqu'à 50. Et dans le casting vocal, écrire « American » a corrigé un accent britannique non désiré tandis qu'écrire « American English » ne l'a pas fait, parce que le mot « English » a poussé la livraison vers une lecture britannique.

La structure de prompt qui survit à 30 secondes est celle qu'utilise Alibaba dans son propre manuel : des temps explicites horodatés. Pas un paragraphe d'ambiance. Écrivez 0-8s, 8-16s, 16-24s, 24-30s, donnez à chaque bloc son propre comportement de caméra et son propre événement, et terminez par une seule ligne audio couvrant tout le clip. Vous verrez exactement ce squelette à l'étape 4 ci-dessous, car j'ai gardé la structure d'Alibaba et je l'ai seulement traduite.

Wan 3.0 vs Seedance 2.5 Native 30s : Spécifications, prix, et ce que vous pouvez utiliser aujourd'hui

Voici l'état des lieux honnête, et la partie où les deux modèles cessent d'être des produits comparables.

Lisez deux fois la ligne des résolutions, car c'est tout l'article. La propre documentation API de Seedance 2.5 Text-to-Video d'Atlas Cloud indique que 720p-esr améliore une source 480p, que 1080p-esr, 1440p-esr et 4k-esr améliorent tous une source 720p, et que l'option 4K fournit un petit bord de 2160 pixels « pas de génération 4K native ». Ainsi, un clip Seedance 30 secondes étiqueté 4K est en réalité 720p de détails, rééchantillonné. La grille tarifaire de Wan 3.0, en revanche, a un niveau 1080p pur à 0,20 $ par seconde, et les fichiers de démo officiels de 30 secondes d'Alibaba mesurent 1920x1072.

L'avantage de cette contrainte : tout le test se déroule dans un seul onglet de navigateur, sur trois modèles, sans configuration locale.

Rôle dans ce testModèlePrix indiqué
Image d'ouvertureGPT Image 2 Text-to-Imageà partir de 0,009 $ / image
L'exécution native 30sSeedance 2.5 Text-to-Videoà partir de 0,134 $ / SEC

Prix indiqués vérifiés sur les pages de modèles Atlas Cloud, août 2026. Considérez-les comme des planchers, pas des devis. Chacun de ces modèles facture ce que vous demandez réellement, et le bouton Exécuter donne le prix de vos réglages exacts avant que vous ne cliquiez. Dans ce test, le bouton a indiqué 0,1745 $ pour une image GPT Image 2 en qualité haute et 2048x1152, et 1,514799 $ pour un travail Seedance 2.5 de cinq secondes en 720p et 16:9, ce qui revient à environ 0,30 $ par seconde plutôt que les 0,134 $ indiqués. Le chiffre indiqué est le tarif 480p. Vérifiez le bouton, pas le catalogue. Seedance 2.5 propose également un point de terminaison reference-to-video au même tarif de 0,134 $ par seconde si vous voulez pousser le plafond de 50 références.

Comment reproduire ce test natif 30s sur Seedance 2.5

Cinq étapes, trois modèles, tout dans le navigateur. Copiez les prompts textuellement.

Étape 1 : Verrouiller le squelette horodaté des 30s

Ne lancez rien encore. Lisez d'abord la structure, car c'est la partie qui décide si vos 30 secondes tiennent.

La démo de la station-service Wan 3.0 en haut de cet article est construite avec quatre blocs étiquetés et une doctrine de caméra fixe énoncée une fois en tête : observation calme et objective, plans moyens verrouillés, gros plans extrêmes soudains uniquement sur les temps absurdes. Chaque événement est ancré à une plage horaire. L'audio est une ligne à la fin couvrant les 30 secondes.

Voici le squelette, vide. Remplissez-le et vous avez un prompt qu'un modèle natif 30s peut réellement suivre :

Plain
1Un [genre] de 30 secondes se déroulant dans [lieu]. [Style visuel, étalonnage, saturation]. Langage caméra : [doctrine], ponctué par [exception].
2
30-8s : [mise en place, plan large, établir le monde normal, introduire l'anomalie à l'horizon]
4
58-16s : [l'anomalie agit, toujours traitée comme normale, un point de vue ou un insert de réaction]
6
716-24s : [la chute, gros plan extrême sur la chose elle-même, coupe franche sur le visage de réaction]
8
924-30s : [la sortie, un petit bouton physique qui clôt la blague]
10
11Audio : [ambiance, trois ou quatre sons diégétiques spécifiques, un dernier petit son]. Pas de musique, pas de dialogue, pas de texte à l'écran.

La spécification mesurable du fichier de référence d'Alibaba, pour ceux qui veulent vérifier mes chiffres : 30,07 secondes, 1920x1072, 24 ips, AAC stéréo. C'est la barre à laquelle l'exécution Seedance est mesurée.

Étape 2 : Générer l'image d'ouverture

Vous avez besoin d'une ancre visuelle fixe pour que les exécutions de 15 et 30 secondes partent du même monde. Ouvrez GPT Image 2 Text-to-Image.

Réglages : qualité high, rapport hauteur/largeur 16:9, 1 image.

Plain
1Un plan d'établissement large et absolument immobile d'une station-service isolée de style Route 66 dans un désert lumineux. Bâtiment rétro jaune-orange-et-bleu, peinture légèrement décolorée par le soleil ; une pompe à essence vintage rouge délavée devant ; un petit magasin à côté avec un distributeur de boissons gazeuses délavé près de la porte. Terre orange craquelée et sèche au premier plan, montagnes ocres chaudes au loin, ciel bleu cyan dégagé. Un préposé de station-service en bleu de travail graisseux et de grandes lunettes de soleil noires somnole à moitié dans une chaise près de la porte, un cure-dent à la bouche. Étalonnage strict teinté-orange vif, haute saturation, haute luminosité, photoréaliste cinématographique, caméra verrouillée, 16:9.

Capture d'écran d'un générateur d'images IA avec le prompt et l'image de sortie

Playground GPT Image 2 sur Atlas Cloud avec qualité réglée sur haute et 16:9, le plan d'établissement généré de la station-service Route 66 dans le panneau de sortie

GPT Image 2 sur Atlas Cloud : qualité haute, 16:9, une image. Le bouton Exécuter a indiqué 0,1745 $ pour cette image, ce qui est le coût réel d'un rendu haute qualité 2048x1152. Les 0,009 $ sur la page du modèle sont le plancher.

Homme se reposant devant une station-service vintage Route 66 dans le désert

Image d'établissement de la station-service Route 66 générée avec GPT Image 2, ciel teinté et terre orange craquelée, préposé somnolant près de la porte

L'image d'ouverture. C'est l'entrée pour l'étape 3 et la cible visuelle pour l'étape 4. Générée avec openai/gpt-image-2.

Étape 3 : Atteindre le mur des 15 secondes

Réglages : première image = votre sortie de l'étape 2, duration glissée à son maximum de 15, résolution 1080P.

Plain
1Plan large verrouillé qui tient. Une cowgirl au chapeau à larges bords arrive à cheval de l'horizon au pas. Le préposé somnolent est réveillé par les sabots, repousse ses lunettes de soleil, s'assoit droit, mâchant son cure-dent, peu impressionné. Elle descend proprement, mène le cheval directement à la pompe vintage. Étalonnage teinté-orange vif, haute saturation, photoréaliste, caméra d'observation calme, pas de coupures.

Le menu déroulant s'arrête à 15. C'est tout l'intérêt de cette étape. Votre chute est prévue à la 20e seconde, et ce pipeline ne peut pas atteindre la 20e seconde en un seul morceau. Pour y arriver, vous généreriez un deuxième clip à partir de la dernière image, et au moment où vous le faites, le cheval est un nouveau cheval.

Capture d'écran d'une interface de générateur vidéo IA avec entrée et sortie

Étape 4 : Exécuter le passage natif complet de 30s

Ouvrez Seedance 2.5 Text-to-Video.

Réglages : duration = 30, resolution = 720p, ratio = 16:9, generate_audio = activé, output_format = mp4, filigrane désactivé.

Choisissez délibérément 720p, pas 1080p-esr. 720p est le vrai plafond du modèle, donc c'est une comparaison pixel à pixel équitable plutôt qu'une comparaison avec un upscaler.

Le prompt ci-dessous est le propre prompt de la démo de la station-service d'Alibaba, traduit fidèlement du manuel du créateur Wan 3.0 et restructuré en rien. Mêmes temps, mêmes timings, même doctrine de caméra, même liste audio.

Plain
1Un court métrage comique absurde et impassible de 30 secondes se déroulant dans une station-service délavée par le soleil de style Route 66 dans un désert lumineux. Photoréaliste, étalonnage strict teinté-orange vif, haute saturation et haute luminosité, de sorte que l'événement absurde se produit dans un monde complètement normal, presque joli. Langage caméra : observation calme et objective, principalement des plans moyens verrouillés et des dérives latérales lentes, sans guidage émotionnel, ponctué par des gros plans extrêmes soudains sur les temps absurdes.
2
30-8s : Plan large verrouillé. Ciel cyan, poussière qui dérive. La station rétro jaune-orange-et-bleu se tient seule au bord de la route ; un préposé en bleu de travail graisseux et d'énormes lunettes de soleil noires somnole sur une chaise, cure-dent à la bouche. Seulement du vent. À l'horizon, une cowgirl sur un vrai cheval apparaît au pas. Coupe sur un plan moyen : les sabots le réveillent, il repousse ses lunettes de soleil, se redresse, lit le duo comme « encore une qui demande son chemin ».
4
58-16s : Elle ne dit rien. Elle descend proprement, mène le cheval directement à la vieille pompe. Le cheval met négligemment sa tête près de la pompe comme s'il avait déjà fait ça. Brève contre-plongée légèrement déformée derrière ses lunettes de soleil, la femme et le cheval semblent encore plus étranges. Gros plan : son front se plisse, il enlève ses lunettes, sur le point de crier. Gros plan au ralenti : alors que les lunettes se retirent, elle vise la buse du pistolet vers la bouche du cheval et appuie sur la gâchette.
6
716-24s : Gros plan extrême sur la buse. Il n'en sort pas de l'essence mais des jets d'herbe fraîche vert vif, encore perlée d'eau. Coupe franche sur un gros plan extrême du visage du préposé, figé : yeux écarquillés, bouche entrouverte, cure-dent oublié en pleine mastication. Plan moyen : le cheval mange heureux, plisse les yeux de plaisir, puis donne un coup de queue satisfait et puissant, et la poussière qu'il soulève retombe sur le visage toujours stupéfait du préposé.
8
924-30s : « Plein d'essence » d'herbe. Elle raccroche la buse à la pompe, sort des pièces de sa poche, se dirige vers la porte du magasin et les laisse tomber en tintant dans une boîte en fer blanc sur le comptoir. Elle jette un coup d'œil en arrière au préposé pétrifié ; sous le bord du chapeau, le coin de sa bouche se relève d'un fraction. Elle remonte en selle et s'éloigne dans un nuage de poussière. La caméra avance lentement sur lui : même posture figée, visage couvert de poussière, lunettes de soleil toujours serrées dans sa main, et finalement le cure-dent tombe de sa bouche avec un petit claquement.
10
11Audio : vent sec du désert tout au long, sabots, le claquement mécanique de la poignée de la pompe, l'herbe humide qui jaillit, le coup de queue, des pièces dans une boîte en fer blanc, et un petit claquement lorsque le cure-dent touche le sol. Pas de musique, pas de dialogue, pas de texte à l'écran.

Un avertissement qui vous évitera une facture inutile, et c'est le même piège qu'à l'étape 3 : glissez le curseur de durée à 30, ne tapez pas 30 dans la case numérique. La case affichera joyeusement 30 pendant que le curseur reste sur son défaut de cinq secondes, et le bouton Exécuter vous facturera cinq secondes. Vérifiez le devis avant de cliquer. En 720p et 16:9, un travail de cinq secondes facture 1,514799 $, donc un vrai passage de 30 secondes facture environ six fois plus.

Il n'y a pas de capture d'écran d'exécution terminée pour cette étape. Trois tentatives de capture automatisée ont toutes soumis la valeur par défaut du curseur au lieu de 30 secondes, et plutôt que de vous montrer un clip de cinq secondes étiqueté comme un clip de 30 secondes, la capture est omise. Le prompt et les réglages ci-dessus sont exactement ce qu'il faut coller et régler.

Étape 5 : Lire la dérive, honnêtement

Voici le côté Seedance 2.5 de ce même prompt, généré à 30 secondes natives, 720p, 16:9, audio activé.

Seedance 2.5, le même prompt de la station-service Wan 3.0 copié textuellement : 30s natives en une seule génération, 1280x720, 24 ips, audio intégré. Mêmes quatre temps, cowgirl et cheval arrivant, la blague du pistolet à essence, le gros plan de dissonance cognitive du préposé. Mettez-le à côté du clip Wan 3.0 en haut pour une lecture équitable.

Mettez les deux clips côte à côte et vérifiez cinq choses spécifiques. Ne vérifiez pas « lequel a l'air mieux », c'est un argument de goût et ça vous fera perdre votre après-midi.

  1. Identité du manteau et du costume. Le cheval est-il de la même couleur à la 29e seconde qu'à la 6e ? Les lunettes de soleil ont-elles la même forme après avoir été enlevées et remises dans sa main ?
  2. Stabilité de l'étalonnage. Échantillonnez le ciel à la 2e et à la 28e seconde. L'étalonnage teinté-orange dérive vers le chaud sur les longues générations plus souvent que prévu.
  3. Le temps physique à la 20e seconde. De l'herbe sortant d'une buse d'essence est une demande de physique. Est-ce qu'elle décrit un arc et tombe avec du poids, ou est-ce qu'elle apparaît comme une texture ?
  4. Discipline de la caméra. Le prompt dit verrouillé. Comptez combien de fois la caméra invente une avancée qu'on ne lui a pas demandée. C'est l'échec le plus courant des longues générations : le modèle manque d'événements programmés et remplit le temps avec du mouvement.
  5. Morphing dans les mouvements rapides. Le coup de queue et le soulèvement de poussière sont les mouvements les plus rapides du clip. D'après les notes de production de MindStudio, c'est exactement là que la décohérence se concentre, et exactement ce qu'un upscale ne corrigera pas.

Notez ces cinq points, pas l'ambiance. C'est une comparaison que vous pouvez défendre devant un client.

Trois autres prompts comparés Wan 3.0 vs Seedance 2.5 Native 30s

Une démo est une anecdote. Voici trois autres fichiers officiels Wan 3.0 de 30 secondes du même manuel, chacun mettant l'accent sur une partie différente du problème des 30 secondes. Pour le monstre marin et le monologue fantasy sombre, le côté Seedance 2.5 a été généré sur le même prompt à 30 secondes natives et est intégré juste après chacun, afin que vous puissiez regarder les deux plutôt que de me croire sur parole.

PromptCe qu'il teste en stressFichier officiel Wan 3.0, mesuréCôté Seedance 2.5, même prompt
Film catastrophe monstre marin10 plans scénarisés plus une partition orchestrale en 30s1920x1072, 24 ips, 30,07s, AACgénéré à 30s, intégré ci-dessous ; un nom de propriété intellectuelle et le texte de la marque du bateau ont été retirés pour que le filtre de contenu de Seedance le laisse passer, le storyboard est par ailleurs identique
Monologue fantasy sombre anglaisvoix anglaise native et synchronisation labiale sur une poussée continue lente1280x720, 24 ips, 30,05s, AACgénéré à 30s à partir du prompt textuellement, intégré ci-dessous
Anime sportif 2D, prompt de deux lignesle modèle peut-il remplir 30s avec presque aucune instruction1280x720, 24 ips, 30,05s, AACnon généré ici ; présenté comme une grille d'images exclusivement Wan pour lire la structure dans le temps
Court métrage comique whip-pan (exclu)8 whip pans et 8 temps émotionnels sans coupure1280x720, 24 ips, 30,04s, AACnon exécuté : la densité des dialogues est spécifique au mandarin, une réécriture en anglais ne serait pas une comparaison équitable

Démo officielle Wan 3.0 : dix plans scénarisés et une construction orchestrale complète en un seul passage de 30 secondes, en 1920x1072. C'est l'argument le plus fort pour le 1080p natif, car le volume d'eau et les détails de la peau mouillée de la créature sont exactement ce qu'un upscale 720p invente plutôt qu'il ne résout. Manuel du créateur Tongyi Alibaba, utilisé pour la comparaison et le commentaire.

Seedance 2.5, le même prompt catastrophe en dix plans à 30s natives, son activé. Bateau de pêche battu par la tempête, le matelot terrifié, la houle qui se soulève, puis le léviathan des profondeurs brisant la surface dans l'éclair. Une référence de propriété intellectuelle et le texte de la marque sur la coque ont été retirés pour que le filtre de contenu de Seedance le laisse passer ; le storyboard est par ailleurs identique, ce qui rend le volume d'eau et les détails de la peau mouillée une comparaison équitable avec le clip Wan 3.0 ci-dessus.

Démo officielle Wan 3.0, son activé. Dialogue de méchant en anglais natif, « Assez mûr pour le vide », délivré en un seul lent mouvement de caméra vers le haut sans coupure. C'est le clip que les équipes anglophones devraient tester, car la voix, la synchronisation labiale et un mouvement de caméra continu de 30 secondes doivent tous tenir en même temps.

Seedance 2.5, le même prompt fantasy sombre copié textuellement, 30s natives, son activé. Même méchant aux yeux violets, les marques de runes stellaires, la nébuleuse d'ombre se formant dans sa paume ouverte, et les deux lignes en anglais. Regardez si la synchronisation labiale et la seule poussée continue tiennent sur les 30 secondes complètes comme elles le font du côté Wan 3.0.

Si vous exécutez le côté Seedance 2.5 correspondant, gardez les deux lignes anglaises textuellement et souvenez-vous de la bizarrerie d'accent mentionnée dans les notes de production : écrivez « American », pas « American English ». Le mot « English » tire la livraison vers une lecture britannique.

Le troisième est la surprise tranquille. Le prompt d'anime sportif 2D dans le manuel d'Alibaba fait deux lignes. Pas d'horodatage, pas de liste de plans, juste un boxeur frappant un sac de frappe, fatigué, en souffrance. Trente secondes à partir de cela est un véritable test pour savoir si le modèle peut inventer sa propre structure. Le voici échantillonné sur toute sa durée :

Quatre panneaux d'anime d'un boxeur épuisé s'entraînant avec un sac de frappe

Quatre images de la démo officielle Wan 3.0 d'anime sportif 2D échantillonnées à environ 1, 10, 20 et 29 secondes, montrant le design du boxeur et l'arrière-plan de la salle de sport sur les 30 secondes complètes

Quatre images de la démo officielle Wan 3.0 d'anime sportif 2D, échantillonnées à environ 1, 10, 20 et 29 secondes. Même design du personnage, même débardeur, même sac de frappe, même rangée de casiers, à travers un changement de plan large à gros plan que le prompt n'a jamais demandé. Une grille d'images plutôt qu'un clip, car la comparaison ici est dans le temps à l'intérieur d'un seul fichier, pas du mouvement.

Lecture pratique : avec un prompt de deux lignes, le modèle a inventé sa propre couverture, passant d'un plan large verrouillé à un gros plan de sueur et d'épuisement, et a maintenu le design du personnage en le faisant. C'est la bonne nouvelle. Le compromis est que vous avez abandonné le contrôle de quand les choses se produisent. Si vous avez besoin que 30 secondes fassent atterrir un temps spécifique à une seconde spécifique, écrivez les horodatages.

Testez la narration native 30s gratuitement avant de payer pour l'un ou l'autre

Une exécution 720p de 30 secondes sur Seedance 2.5 coûte environ 9 $ une fois que vous évaluez la résolution réelle plutôt que le plancher du catalogue. Une exécution 1080p de 30 secondes sur la grille tarifaire de Wan 3.0 est de 6,00 $. Aucun des deux n'est cher selon les standards de production, mais avec un ratio de tournage de 3,2 pour 1, vous n'achetez pas un clip, vous en achetez trois ou quatre.

Avant de dépenser quoi que ce soit, il vaut la peine de répondre à une question moins chère : est-ce que mon script tient réellement comme un seul plan continu ? La plupart des échecs à 30 secondes ne sont pas des échecs du modèle. Ce sont des échecs de structure, trois temps tassés là où il y avait de la place pour deux, ou une chute écrite à la 26e seconde sans rien pour porter les secondes 8 à 20.

Le générateur gratuit de sketches publicitaires IA d'Atlas Cloud répond à cela pour rien. Vous lui donnez une description de produit et jusqu'à quatre photos de produit, chacune de moins de 8 Mo, choisissez l'un des six styles (mème drôle, retournement de situation, sitcom, réconfortant, luxe, ou vente dure), et il écrit d'abord un script à deux personnages, avec un accroche de trois secondes, un conflit et un retournement, puis construit chaque plan autour de ce script. Les personnages parlent leurs répliques à voix haute et les effets sonores sont rendus dans la vidéo.

Les limites honnêtes : c'est 15 secondes, pas 30, vous devez être connecté, et vous obtenez une génération gratuite avant de recharger des crédits. Mais 15 secondes avec un accroche, un conflit et un retournement vous disent si vos trois temps respirent. Si la structure fonctionne là, prenez les mêmes temps, étirez-les sur le squelette 0-8s / 8-16s / 16-24s / 24-30s de l'étape 1, et allez dépenser les neuf dollars pour un vrai passage natif de 30 secondes.

Combien coûte réellement un clip natif de 30s sur Wan 3.0 vs Seedance 2.5

ConfigurationTarifDuréeUn clip
Wan 3.0, 1080p natif (Alibaba Cloud uniquement)0,20 $ / sec30s6,00 $
Wan 3.0, 720p natif (Alibaba Cloud uniquement)0,10 $ / sec30s3,00 $
Wan 3.0, 480p natif (Alibaba Cloud uniquement)0,05 $ / sec30s1,50 $
Seedance 2.5, 720p natif, sur Atlas Cloud0,30 $ / sec mesuré en 720p, indiqué à partir de 0,134 $30senviron 9,09 $
GPT Image 2 image d'ouverture, qualité haute, 2048x1152indiqué à partir de 0,009 $ / image1 image0,1745 $ indiqué

La comparaison qui décide vraiment : Wan 3.0 en 720p est moins cher par seconde que Seedance 2.5 en 720p, et en 1080p, c'est le seul des deux qui vend des pixels réels. La réponse de Seedance 2.5 est 50 emplacements de référence, une disponibilité en direct, et une API fonctionnelle contre laquelle vous pouvez livrer cet après-midi.

Note sur les sources et licences pour ces clips natifs 30s

Chaque clip Wan 3.0 et chaque prompt Wan 3.0 dans cet article proviennent du manuel du créateur Tongyi Wan 3.0 distribué publiquement par Alibaba, reproduits ici à des fins de comparaison et de commentaire, crédités, non modifiés et sans suppression de filigrane. L'utilisation commerciale des résultats Seedance 2.5 est soumise aux conditions de ByteDance et Volcengine ; la facturation API et le traitement des données du côté Atlas Cloud sont soumis aux propres conditions d'Atlas Cloud. Aucune ressemblance avec une personne réelle n'est reproduite dans ce test. Si vous livrez du travail pour un client, lisez les conditions du modèle pour le point de terminaison spécifique que vous appelez, pas un résumé de blog de celles-ci.

Questions fréquentes

Le natif 30s de Wan 3.0 est-il vraiment un seul passage, ou des clips collés ?

Un seul passage. Wan 3.0 génère de 2 à 30 secondes en une seule génération avec une option de durée intelligente, il peut donc aussi décider que le clip n'a pas besoin des 30 secondes complètes. C'est différent de l'extension de dernière image, où un deuxième clip est amorcé à partir de la dernière image du premier et l'identité dérive à travers la couture.

Lequel est vraiment en 1080p à 30 secondes, Wan 3.0 ou Seedance 2.5 ?

Wan 3.0. Il a un niveau 1080p natif sur sa grille tarifaire, et les propres fichiers de démo 30 secondes d'Alibaba mesurent 1920x1072. Seedance 2.5 génère nativement en 480p et 720p uniquement ; ses options 1080p, 1440p et 4K sont des améliorations d'une source 720p, et sa documentation API décrit le niveau 4K comme « pas une génération 4K native ».

L'image se dégrade-t-elle encore à la 25e seconde ?

Cela peut arriver, mais la forme de l'échec a changé. Au lieu d'une couture visible entre les clips, vous obtenez du morphing et de la décohérence à l'intérieur du plan, concentrés dans les passages de mouvement rapide, et l'upscaling ne le supprime pas. Une production documentée de court métrage Seedance 2.5 a eu un ratio de tournage de 3,2 pour 1, donc planifiez les longs plans avec des couvertures.

Quel modèle accepte plus de matériel de référence ?

Seedance 2.5, de loin : 30 images plus 10 vidéos plus 10 fichiers audio, 50 au total, avec vidéo et audio de référence chacun plafonné à 30 secondes combinées par requête. Le manuel de Wan 3.0 limite les références à 20, mais c'est le seul qui accepte les fichiers .pdf, .ppt, .xls, .doc, .txt et les pages web en direct comme entrée créative.

Wan 3.0 aura-t-il des poids ouverts ?

Il n'y a pas d'engagement officiel. En date de la bêta publique d'août 2026, aucun poids Wan 3.0, point de contrôle Hugging Face ou nœud ComfyUI n'a été publié, et les poids ouverts officiels pour la ligne vidéo phare s'arrêtent à Wan 2.2 (Kingy AI, août 2026). Considérez tout ce que vous lisez d'autre sur une mise à disposition des poids 3.0 comme une spéculation jusqu'à ce qu'Alibaba dise le contraire.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles