Seedance 2.5 est maintenant en ligne — En avant-première sur Atlas Cloud

Wan 3.0 Document to Video : J'ai audité chaque image

Wan 3.0 document vers vidéo est réel : j'ai vérifié la démo xlsx officielle image par image. Les chiffres survivent, les graphiques cassent. Plus un workflow que vous pouvez exécuter maintenant.

Importez un fichier de type tableur. Récupérez une animation d'entreprise de 23 secondes avec musique.

C’est la promesse de Wan 3.0 document vers vidéo, la première entrée native de document de la famille, et la démo officielle la tient plus littéralement que je ne l’attendais. Les chiffres sont justes. 1 580 $ deviennent 3 460 $, le badge affiche +45,7 %, et ces valeurs renvoient directement à des cellules spécifiques de la feuille source.

Ensuite, j’ai glissé la tête de lecture jusqu’à la 12e seconde et j’ai lu la légende du graphique.

« Southeasta North America. »

Deux régions de vende écrasées en un mot qui n’existe pas. C’est la véritable ligne de flottaison du document vers vidéo en 2026 : le modèle a vraiment lu votre tableau, et il ne sait toujours pas dessiner votre graphique. Ci-dessous, l’audit image par image que personne d’autre n’a publié, ainsi qu’une chaîne en trois étapes que vous pouvez réellement exécuter cet après-midi.

Points clés

  • Wan 3.0 accepte 1 fichier ou 1 lien, jusqu’à 100 Mo ou 50 pages, et génère jusqu’à 30 secondes en 1080p.
  • Il réalise un film à partir de votre document. Il ne transforme pas la diapositive 3 en plan 3.
  • Les valeurs des cellules sont conservées intactes. Les légendes de graphiques, les graduations d’axes et les séparateurs de milliers ne le sont pas.
  • Limites strictes : pas de 4K, pas de poids ouverts, canaux exclusivement propriétaires.
  • Un modèle à contexte long couplé à un modèle vidéo de 15 secondes reproduit l’essentiel aujourd’hui.

Texte doré lisant H1 2026 Wan avec des éclaboussures de paillettes dorées

Résultat Wan 3.0 document vers vidéo : la démo officielle xlsx rendue sous forme de film de données animé style Keynote.

La vitrine : la démo publique bêta officielle d’Alibaba pour Wan 3.0, un .xlsx de GMV mensuel en entrée, 23 secondes de film de données animé en sortie. Ici, présenté sous forme de GIF silencieux ; le fichier livré comporte une piste AAC stéréo 44,1 kHz. Source : manuel du créateur officiel d’Alibaba pour Wan 3.0.

Ce que fait réellement Wan 3.0 document vers vidéo

Version courte, pour que vous puissiez partir dans une minute si c’est tout ce dont vous avez besoin.

Vous lui donnez un document ou un lien web. Il lit l’intégralité, décide quelle est l’histoire, et génère une vidéo avec image et son en un seul passage. Maximum 30 secondes, maximum 1080p. Il ne parcourt pas vos pages dans l’ordre.

Voici les limites qui régissent réellement un projet.

SpécificationEntrée document Wan 3.0
Formatsdoc, xls, ppt, pdf, txt, md, plus key / pages / numbers et un simple lien web
Entrées par tâche1 fichier ou 1 lien (pas les deux, pas plusieurs)
Taille maximale100 Mo
Nombre max de pages50 pages
Sortie maximale30 secondes, un seul passage continu
Résolution max1080p (pas de niveau 4K)
Audiogénéré en même temps que l’image
Poids ouvertsaucun ; Wan 2.2 reste la dernière version open-weight
Où l’obtenirAlibaba Cloud Model Studio (Bailian) et Qwen Cloud, accès sur invitation

La bêta publique a ouvert le 6 août 2026 (AgentUpdate, août 2026). La liste des formats et les deux grilles tarifaires publiées proviennent d’un récapitulatif de spécifications distinct (Ngram, août 2026).

Le manuel officiel propose quatre cas d’utilisation de documents, qui correspondent clairement à quatre tâches pour lesquelles les gens paient déjà des agences :

  • Document de proposition en film de marque. Un document de pitch pour les soins de la peau devient une publicité de 30 secondes avec une actrice principale et une histoire de lumière matinale.
  • Cours en leçon vidéo. Une entrée d’encyclopédie devient un cours animé pour les élèves de CP.
  • Tableur en graphiques animés. La démo ci-dessus, et de loin la plus difficile des quatre.
  • Rapport en résumé parlé. Un rapport écrit devient un briefing de type présentateur.

Maintenant, voici où la plupart des articles se trompent sur la catégorie.

Les acteurs établis du « PDF vers vidéo » ne font pas cela. Le document vers vidéo de Kapwing extrait le texte de votre fichier et le place sur une timeline, sans construction de scène ni présentateur. Pictory et Powtoon assembla des images d’archives ou des animations de modèles, et les propres pages produits de Powtoon annoncent des avatars et des voix IA lisant votre script. Tous trois produisent des diaporamas narrés.

Wan 3.0Kapwing Document to VideoPictoryPowtoon Anything-to-Video
Ce qui sortun film générévotre texte sur une timelineimages d’archives coupées sur un scriptanimation par modèle
Invente de nouvelles imagesoui, chaque imagenonnon, extraits de bibliothèquenon, actifs de modèles
Présentateur IAaucun par défautaucunvoix optionnelleavatars et voix
Audiogénéré avec l’imagevous l’ajoutezvoix off TTSvoix off TTS
Sortie unique la plus longue30sdurée du projetdurée du projetdurée du projet
Disponibilitésur invitation, propriétairepublicpublicpublic

Lisez ce tableau deux fois, car c’est tout l’argument : ce ne sont pas des concurrents dans la même catégorie. L’un fait des diaporamas narrés. L’autre fait des images qui n’ont jamais existé. Les comparer sur le prix par minute, c’est comme comparer un photocopieur à une équipe de tournage.

Wan 3.0 peut-il aussi faire le diaporama ? Oui, et c’est l’honnête mise en garde.

Contre-exemple : invité à transformer une page web sur la mécanique quantique en une explication amusante, Wan 3.0 a produit exactement le format présentateur + légende que les acteurs établis vendent. Il atteint le mur des 30 secondes à 30,02 s. Démo officielle publique bêta Alibaba, audio activé.

La différence n’est donc pas que Wan 3.0 ne peut pas faire d’explications avec présentateur. C’est qu’avec les acteurs établis, ce format est la seule chose au menu.

Pourquoi Wan 3.0 document vers vidéo casse les graphiques mais garde vos chiffres

Voici la chose la plus utile de cet article : j’ai extrait 12 images espacées régulièrement de la démo officielle du tableur et j’ai lu chaque glyphe.

Le verdict se divise clairement en deux. Les valeurs passent. Les éléments du graphique échouent.

Ce qui a survécu. À la 4e seconde, l’image affiche 1 580 $, une fine flèche grise, 3 460 $, la légende « Croissance mensuelle du GMV » et un badge corail indiquant +45,7 %. La typographie est propre, les virgules sont aux bons endroits, aucun caractère déformé. L’invite derrière cette démo cite des cellules spécifiques du tableur, et les chiffres à l’écran correspondent. Un test tiers sur un jeu de 8 pages de présentation produit a trouvé la même chose : 45g, 12 heures et 55 degrés ont tous été rendus correctement, et le slogan de clôture est sorti sans un seul caractère erroné (AI-Driven Lab, août 2026).

Cela répond à la question que les équipes financières et de formation se posent réellement. Vos chiffres ne mutent pas en silence.

Ce qui a cassé. Les images de graphiques sont une autre histoire.

Graphique linéaire annoté montrant trois erreurs dans la légende, l’échelle et les unités

Audit d’image Wan 3.0 document vers vidéo montrant une légende de graphique fusionnée et un axe y cassé

Figé à 12 s dans la démo officielle. Trois défauts dans une seule image : deux noms de régions fusionnés en « Southeasta North America », « North America » répété ensuite comme série distincte, et un axe y affichant 30, 60, 70 tandique que l’étiquette de donnée supérieure indique 3 880 $

Comptez les échecs dans cette seule image :

  1. Légende fusionnée. « Southeast Asia » et « North America » entrent en collision pour former « Southeasta North America ». Ensuite, « North America » apparaît à nouveau comme une série séparée, donc une région est étiquetée deux fois et une a disparu.
  2. Un axe y qui n’est pas une échelle. Les graduations lisent 30, 60, 70. Écarts de pixels égaux, valeurs inégales, et 40 et 50 sont tout simplement absents.
  3. Axe et étiquettes dans des unités diférentes. La ligne de grille la plus haute est 70. L’étiquette épinglée au point de donnée supérieur indique 3 880 $.
  4. Dérive de magnitude le long d’une même ligne. Les étiquettes de cette courbe supérieure commencent à 330 $ et 335 $, puis atterisent à 3 970 $ et 3 880 $. Une ligne ascendante lisse ne peut pas contenir un bond d’un facteur dix entre deux points adjacents. Les deux étiquettes intermédiaires sont étalées au-delà d’une lecture confiante, ce qui constitue une réponse en soi.

Le segment du graphique à barres répète le motif. Quatre barres portent 1 750 $, 1 580 $, 2 350$ et 2 580 $, donc la barre la plus courte porte le deuxième plus grand nombre, et la première étiquette perd sa virgule des milliers tandique les trois autres la conservent. À côté se trouvent cinq chiffres de croissance verte pour quatre barres. Et le segment du donut centre sur 89,7 M$, une virgule là où une virgule décimale devrait être.

Remarquez ce que tous ces points ont en commun. Aucun n’est une erreur de contenu. Chacun est une erreur de dessin : mise en page, étiquetage, échelle, ponctuation. Le modèle a compri la feulle, puis a rendu le graphique comme un modèle vidéo rend tout texte dens, de manière approximative.

Il y a une deuxième raison structurelle pour laquelle le résultat ne ressemble en rien à votre présentation.

Faites le calul. 50 pages est le plafond de pages, 30 seccondes est le plafond de durée. Cela fait 0,6 seconde par page.

Vous ne pouvez pas présenter une page en 0,6 seconde, donc le modèle fait la seule chose sensée et crée plutôt une bande-annonce. Ce test tiers de présentation est parvenu à la même conclusion de manière indépendante : il a traité la présenttaion comme matière source pour une publicité cinématique, et non com me des disapositives à feuilleter. Les montures des lunettes du produit sont passées d’épaisses à sans bords à une troisième forme au fil des prises.

C’est aussi porquoi le plafond de 30 secondes est une contrainte de conception, et non une note de fiche technique.

Nous avon mesuré les fichier livrés : les quatres démos officielles de documents atterissent à 30,04 s, 30,02 s, 25,03 s et 23,04 s. Les deux clips de 30 s’arrêtent net à moins de quatre centièmes de seconde l’un de l’autre. Et la démo du tableur a été demanée pour 22 secondes, puis a livré 23,04. Nous avon décomposé ce plafond dans l’aperçu Wan 3.0.

Donc : calibrer les atentes. Nourrissez-le d’un documer, obtenez une bande-annone, gardez vos graphiques simples.

Le workflow document vers vidéo que vous pouvez exécuter aujourd’hui

Vérifiation rapide de la réalité avant le tutoriel, car cela vous épargne une heure de recherche.

L’entrée documer de Wan 3.0 vit uniquement sur les canaux propre d’Alibaba, l’accès est sur invitation, et les poids ne sont pas publiés. Person en dehors de ces canaux ne peut l’offrir, y compris nous. Ce que vous pouvez faire aujourd’hui, c’est retraire la moitié utile de cette démo xlsx avec des modèles qui sont déjà ouverts aux affaires, et l’audit d’image ci-dessus vous indique exactement comment éviter la partie qui se brise.

Trois étapes, un onglet de naviateur sur Atlas Cloud:

  1. Un modèle à un million de tokens lit le document et écrit un script de plans chronométré, avec chaque nombre intégré comme chaîne littérale.
  2. Un modèle d’image rend la première image, là où toute la précisio du texte est verouillée.
  3. Un modèle vidéo anime cette image en fonction du script.
ÉtapeModèleTarif indiquéDurée maximalePourquoi c’est ici
1. ScriptQwen3.8 Max (/models/qwen/qwen3.8-max)2 $ en / 6 $ out par 1M tokensn/aLe contexte 1M avale une présentation entière
2. Premièe imageGPT Image 2 Texte vers Image0,009 $ par image (plancher)n/aRendu textuel le plus fort pour les chiffres à l’écran
3. RenduWan 2.7 Image vers Vidéo0,1 $ par seconde15sLe contrôle de la première image maintient votre typographie stable
Option audioWan 2.7 Texte vers Vidéo0,1 $ par seconde15sGénère musique et bruitage en un seul passage, mais ne prnd pas de première image
Alternative étape 3MiniMax H3 Texte vers Vidéo0,1 $ par seconde15sMême tarif, caractère de mouvement différent
Alternative étape 3Seedance 2.5 Texte vers Vidéo0,134 $ par seconde30sLe seul à atteindre 30s en un seul passage ici

Trois limites homêtes sur cette chaîne. Elle ne mange pas un binaire .pptx, donc vous collez le texte ou le CSV vous-même. Wan 2.7 plafone à 15 secondes, donc une prise unique de 30 secondes est exclue. Et le chemin image vers vidéo est silencieux par conception : son paramètre adido prend une piste que vous fouraisez pour piloter le lip-sync, il n’invente pas de bande sonore. Si vous voulz de l’audio généré dans le même passage, vous utilisez le frère texte vers vidéo et abandonnez le contrôle de la première image, ce qui pour une vidéo pleine de chiffres en dollars est le mauvais compromis. Prix vérifés sur les pages des modèles le 20 oût 2026, et notez qu’un prix indiqué est un plancher : les niveaux de qualité et de résolutio font monter le devis en temps réel, donc lisez le bouton Exécuter avant de vous engager.

Construisons-le.

Étape 1 : Transformez votre tableur en un script de plans chronométré

Les modèles vidéo ne se souviennent pas des nombres. Ils rendent toute chaîne que vous leur donnez. Le travaill de cette étape est don de convertur un tablea en indicatios de prises où chaque chiffre est déjà écr it comme texte entre guillemets.

Collez votre feuille entre les marqueurs <<<. Paramètres : température 0.3, max_tokens 4000\G. Gardez max_tokens généreux, car un modèle apte au raisonnement qui manque de budget en milieux de pensé vous renvoe une réponse vide que vous payez quand même.

text
1Vous êtes un rélisateur de motion design. Ci-dessous, une exportation brute de tableur.
2
3<<<
4Mois,Amérique du Nord,Asie du Sud-Est,Europe,GMV total
5Jan,1580,880,640,3100
6Fév,2110,1240,900,4250
7Mar,2740,1610,1150,5500
8Avr,3120,1980,1330,6430
9Mai,3350,2240,1460,7050
10Juin,3460,2480,1580,7520
11Croissance S1,+45.7%,,,  
12>>>
13
14Écrivez un script de plans pour une vidéo de données d'entreprise de 10 secondes, 16:9, style Apple Keynore. Règles :
151. Exactement 2 plans. Donnez à chacun un code temporel d'entrée/sortie (00:00-00:05, 00:05-00:10).
162. Chaque nombre qui apparaît à l'écran doit être écrit dans la description du plan comme une chaîne littérale exacte, entre guillemets, p. ex. "$1,580". N'écrivez jamais "le chiffre de janvier" – écrivez les chiffres.
173. Ne demanez PAS une légende, un axe avec des étiquettes de graduation, ou plus de deux séries de données à l'écran en même temps. Utilisez de grands chiffres autonomes et un seul badge en forme de pilule corail à la place.
184. Fond blanc pur, palette corail doux + gris foncé, sans serif.
195. Terminez par une ligne d'indication BGM + SFX (whoosh à l'entrée, un coup de cloche sur le badge).
20Produisez le script uniquement, sans commentaire.
21

La règle 3 est le fruit de l'audit. La sortie officielle a cassé exactement sur trois choses : les légendes, les graduations d'axes et les graphiques multi-séries. Nous supprimons donc les trois du brief et utilisons cet espace d'écran pour des chiffres surdimensionnés et un badge codé couleur à la place. Même information, aucune surface d'échec.

La règle 2 est celle que les gens sautent, et c'est la raison pour laquelle les chiffres survivent jusqu'au bout de cette chaîne. Une description de plan qui dit "le chiffre de janvier" rend le nombre à un modèle qui doit inventer des glyphes pour lui. Une description de plan qui dit "$1,580" entre guillemets donne aux deux étapes suivantes une chaîne à copier. Vous ne demandez pas de visualisation de données ici, vous demandez une instruction de saisie.

Ce qui revient est un script de deux plans avec des codes temporels d'entrée et de sortie, chaque chiffre à l'écran cité comme un littéral, et une ligne de fermeture BGM et SFX. Gardez-le dans un fichier temporaire ; les étapes 2 et 3 lisent toutes deux à partir de lui.

Étape 2 : Génèrez la première image de marque

Chaque caractère de texte à l'écran est décidé ici. Un modèle d'image en haute qualité rend $1,580 correctement bien plus fiablement qu'un modèle vidéo ne peut l'écrire tout en le déplaçant, donc nous réglons la typographie dans une image fixe et laissons l'étape 3 seulement pousser les pixels.

Ouvrez GPT Image 2 et réglez la qualité sur haute et la taille sur l'option 16:9, qui sur cette page est 2048x1152. Faites correspondre le rapport hauteur/largeur à la vidéo que vous allez créer, sinon l'étape 3 commence par recadrer votre typographie.

text
1Un cadre de présentation Apple Keynote vierge sur un fond blanc pur et sans couture, photographié comme s'il était projeté sur un mur de studio mat. Titre centré dans un caractère géométrique sans empattement gris anthracite profond lisant "H1 2026", placé dans un espace négatif généreux. En dessous, deux chiffres surdimensionnés dans la même police, "$1,580" à gauche et "$3,460" à droite, séparés par une fine flèche gris clair. Sous la flèche, un petit texte de légende gris clair lisant "Monthly GMV Growth". En dessous, un seul badge en forme de pilule corail avec texte blanc lisant "+45.7%". Éclairage diffus doux et uniforme, dégradé chaud discret dans le coin supérieur droit, grain de papier subtil, sans encombrement, sans logos, sans graphiques. Minimalisme d'entreprise ultra-propre, 16:9.
2

Deux détails à copier. "Sans graphiques" est là intentionnellement. Et lisez le devis sur le bouton Exécuter avant de l'appuyer, car la qualité haute sur une image large 2K coûte un multiple du prix de liste de 0,009 $.

Capture d'écran d'un géné rateur d'images IA montrant les étapes d'entrée et la sortie

Environnement de jeu GPT Image 2 sur Atlas Cloud avec le prompt de première image et le cadre style Keynote rendu montrant chaque chiffre correctem ent orthographié

GPT Image 2 en qualité haute, 16:9 à 2048x1152. Chaque chiffre a atterri : "H1 2026", "$1,580", "$3,460" et le badge corail "+45.7%", ce qui explique exactement pourquoi la typographie est réglée dans une image fixe et non dans un modèle vidéo.

Étape 3 : Rendez le clip document vers vidéo et vérifiez chaque chiffre

Dernière étape. Chargez l'image de l'étape 2 comme première image et laissez le modèle vidéo l'animer tout en maintenant la typographie stable.

Ouvrez Wan 2.7 Image vers Vidéo. Paramètres : votre première image téléchargée, résolution 1080P, durée 10s. Laissez le champ audio vide, car ce modèle traite l'audio comme une entrée motrice plutôt que quelque chose qu'il crée. Vous scorez ce clip vous-même, ou dans un passage texte vers vidéo séparé.

text
1Animez ce cadre comme une vidéo de données d'entreprise de 10 secondes style Apple Keynote, en maintenant la typographie existante pixel-stable.
2
300:00-00:05 - Le titre "H1 2026" se maintient, puis se dissout en particules dorées qui dérivent vers l'extérieur. Les deux chiffres "$1,580" et "$3,460" glissent depuis la gauche et la droite et se verrouillent en place ; la fine flèche grise se dessine entre eux de gauche à droite. Le badge corail lisant "+45.7%" apparaît par le bas avec un léger dépassement, synchronisé sur un seul coup de cloche clair.
4
500:05-00:10 - Tout glisse doucement vers la gauche. Trois barres épaisses arrondies poussent vers le haut depuis une ligne de base commune sur le même fond blanc pur, corail, sarcelle et ambre, avec un seul chiffre autonome au-dessus de chacune : "$3,460", "$2,480", "$1,580". Pas de légende, pas d'axe, pas d'étiquettes de graduation, pas de lignes de grille. La caméra reste verrouillée et parfaitement immobile tout du long.
6

"Maintenir la typographie existante pixel-stable" et "caméra reste verrouillée" font un travail réel. Chaque mouvement de caméra est une occasion supplémentaire pour le modèle de redessiner un texte qu'il devrait laisser tranquille.

Ensuite, faites la partie ennuyeuse mais importante : faites une pause sur chaque image où un nombre apparaît et lisez-le par rapport à la ligne source. C'est une vérification de 30 secondes, et c'est la seule chose qui se dresse entre vous et une vidéo qui montre en toute confiance le mauvais chiffre de revenu.

Interface de génération vidéo IA montrant l'invite d'entrée et la vidéo terminée

Environnement de jeu Wan 2.7 Image vers Vidéo sur Atlas Cloud avec la première image chargée et le clip de données final rendu

Wan 2.7 Image vers Vidéo en 1080P avec la première image de l'étape 2 téléchargée et le clip terminé dans le panneau de sortie. Il est à noter ce que dit le panneau : nous avons demandé 10 secondes, le champ de durée affichait 10, et le rendu est revenu 5. Le devis Run nous l'a dit avant le fichier, ce qui est la raison même de le lire.

Croissance mensuelle du GMV H1 2026 de 1 580 $ à 3 460 $, en hausse de 45,7 %

Le clip de données final reconstruit à partir du même tableur GMV, chaque chiffre intact

Le résultat : le même tableur, reconstruit avec des légendes et graduations d'axes délibérément conçues hors du cadre. Le modèle a compressé les deux plans scénarisés dans les cinq secondes qu'il a réellement rendues, et chaque chiffre a survécu au déplacement : "$1,580" et "$3,460" dans l'ouverture, puis "$3,460", "$2,480" et "$1,580" sur les trois barres. Zéro étiquette déformée, car il n'y avait plus d'étiquettes à déformer. Silencieux par conception, car le chemin image vers vidéo ne score rien pour vous.

Variations document vers vidéo et ce que coûte une minute finie

Le cas du tableur est le plus difficile. Les trois autres cas d'utilisation officiels sont plus faciles, et c'est là que se trouve la majeure partie de la valeur commerciale.

Cours en ligne. Nourrissez-le d'une entrée d'encyclopédie et demandez une leçon à un niveau de lecture spécifique. Le résultat ci-dessous est un cours animé style chibi sur le poète Wang Wei, de 25,03 secondes.

Le style de dessin tient tout du long. Les détails des personnages, non. À la 3e seconde, il porte une casquette noire sur fond blanc uni ; à 22 secondes, la casquette est devenue bleu pâle et il se tient à l'intérieur d'une peinture classique en rouleau. Même dérive que le testeur de présentation a vue avec ces montures de lunettes. Si vous reconstruisez cela sur la chaîne en trois étapes, verrouillez une fiche personnage à l'étape 1 et réutilisez l'image de l'étape 2 comme ancre de style.

Entrée d'encyclopédie en leçon anmée pour le CP, 25,03 s avec auido généré. Démo publique bêta officielle d'Albaba Wan 3.0.

Films de marque. Un documen de proposiion devient un sp ot publicitaire complet de 30 secondes. C'ets la plus jolie des quatres démos et la moins vérifiable, car vous ne pouvez pas voir ce que le documen source disait. Regardez la cohérence plutôt que la beauté : c'est le mode de défaillance qui a attrapé le testeur tiers, don le produit a changé de forme troi fois dans un seul cli.

Documen de proposiion en film de maroue de soins de la peau de 30,04 s. Démo publique bêta officielle d'Albaba Wan 3.0, audio activé.

Résumés de rapports. Aucune démo officielle n'exise pour celui-ci, donc trait ez le modèe comme non testé : demandez un présenta eur, une affirmtion par plan, et mettez chaque chiffre entre guillemets exactement comme à l'étape 1.

Maintenan l'argent.

QuoiTaux30 secondes de vidéo finie
Wan 3.0, 1080p (feille RMB)¥1,2 par seconde¥36
Wan 3.0, 1080p (feille USD)0,20 $ par seconde6,00 $
Wan 3.0, 720p (feille RMB)¥0,6 par seconde¥18
Chaîne en 3 étapes, une passescript + image + 0,1 $/s de renduenviron 1,20 $ pour 10s
Chaîne en 3 étapes, 3 essaisscript réutilisé, image et rendu répétésenviron 3,50 $

Deux grilles tarifaires Wan 3.0 publiées ne sont pas d'accord sur le fait que 1080p soit ¥1,2 ou 0,20 $ par seconde, qui ne sont pas le même nombre. Vérifiez le tarif sur le point d'accès que vous facturez réellement avant de budgétiser une série.

Le coût caché n'est pas le taux par seconde. C'est la ré-exécution. L'entrèe de document prend un fichier par tâche, donc modifir un seul chiffr signifie régénérer la vidéo entièe. Dans la chaîne en tr ois étapes, le scrpit de prises est un artéact textuel réutilisable, donc un changement de nombre vous coûte un rendu au lie d'une tâche complète. Sur un cycle de reporting trimestriel, cette diférence éclips le prix par seconde.

Une note légale avant de télécharger quoi que ce soit. Un document que vous envoyez à un modèle hébergé est un document qui quitte votre bâtiment, et les présentations internes et les chiffres financiers non publiés ont généralement une politique associée à cela. Vérifiez-la avant que la pression des délais n'arrive, pas après. Et chaque clip de démo officiel dans cet article appartient à Alibaba, cité ici comme matériel de bêta publique ; rien ici n'est une licence pour les réutiliser commercialement.

FAQ Wan 3.0 document vers vidéo

Quels types de fichiers Wan 3.0 document vers vidéo peut-il accepter, et quelle taille ?

doc, xls, ppt, pdf, txt et md, avec key, pages et numbers également signalés, plus un simple lien web à la place d'un fichier. Un fichier ou un lien par tâche, jusqu'à 100 Mo ou 50 pages.

Wan 3.0 transforme-t-il chaque diapositive en scène ?

Non, et c'est la méprise la plus courante. Il lit l'intégralité du document, puis réalise une vidéo à partir de ce qu'il a appris. Au plafond, cela représente 50 pages en 30 secondes, soit 0,6 seconde par page, donc il produit une bande-annonce plutôt qu'un tourne-page. Les cas d'utilisation officiels et les tests indépendants pointent tous dans la même direction.

Les nombres de mon tableur sont-ils précis dans la vidéo ?

Les valeurs des cellules ont tenu dans tous les cas que j'ai vérifiés, y compris 1 580 $, 3 460 $ et +45,7 % dans la démo officielle. Ce qui échoue, c'est le mobilier du graphique : les légendes fusionnent, les graduations d'axes deviennent non linéaires et les séparateurs de milliers disaparaissent. Inectez chaque chiffre comme un littéral entre guillemets et concevez les légendes et les étiquettes de graduation hors du brief.

Puis-je utiliser Wan 3.0 document vers vidéo via une API aujourd'hui ?

Uniquement via les canaux propres d'Alibaba, actuellement sur invitation, et les poids ne sont pas publiés. Wan 2.2 reste la dernière version open-weight de la gamme. Jusqu'à ce que cela change, la chaîne en trois étapes ci-dessus est le substitut pratique.

Combien coûte une vidéo Wan 3.0 de 30 secondes ?

Au taux 1080p publié, cela fait 36 ¥, ou 6,00 $ sur la feuille internationale, pour un clip de 30 secondes. Prévoyez des ré-exécutions plutôt qu'un seul passage, car une correction d'un seul nombre signifie régénérer l'ensemble.

Quel est le plus proche équivalent de Wan 3.0 document vers vidéo que je puisse utiliser maintenant ?

Un modèle à contexte long pour écrire le script de prises, puis Wan 2.7 à 0,1 $ par seconde pour le rendu, avec MiniMax H3 au même taux ou Seedance 2.5 à 0,134 $ par seconde comme alternatives. Vous obtenez l'aspect d'images générées et un texte précis à l'image. Ce que vous n'obtenez pas : 30 secondes en une seule prise continue, de l'audio dans le même passage que le rendu image vers vidéo, ou un modèle qui lit le .pptx pour vous.

Le résumé honnête : Wan 3.0 document vers vidéo est une capacité réelle avec un plafond réel, et l'écart entre sa sortie et la vôtre est plus petit qu'il n'y paraît, tant que vous cessez de demander à l'un ou l'autre de dessiner une légende.

Modèles récents

Une seule API pour toute l'IA multimédia.

Explorer tous les modèles