Laden Sie eine Tabelle hoch. Sie erhalten eine 23-sekündige Geschäftsanimation mit Musik.
Das ist das Versprechen von Wan 3.0 Document to Video, dem ersten nativen Dokumenteneingang der Familie, und die offizielle Demo löst es wortwörtlicher ein, als ich erwartet hatte. Die Zahlen stimmen. 1.580 $ wachsen auf 3.460 $, das Abzeichen lautet +45,7 %, und diese Werte lassen sich direkt auf bestimmte Zellen in der Quelltabelle zurückführen.
Dann zog ich den Abspielkopf auf die 12-Sekunden-Marke und las die Diagrammlegende.
„Southeasta North America."
Zwei Verkaufsregionen zu einem Wort zerquetscht, das es nicht gibt. Das ist die wahre Wasserlinie von Dokument-zu-Video im Jahr 2026: Das Modell hat Ihre Tabelle tatsächlich gelesen, und es kann Ihr Diagramm immer noch nicht zeichnen. Unten finden Sie die Bild-für-Bild-Prüfung, die sonst niemand veröffentlicht hat, plus eine dreistufige Kette, die Sie heute Nachmittag tatsächlich ausführen können.
Wichtigste Erkenntnisse
- Wan 3.0 akzeptiert 1 Datei oder 1 Link, bis zu 100 MB oder 50 Seiten, und gibt bis zu 30 Sekunden in 1080p aus.
- Es führt eine filmische Regie für Ihr Dokument. Es macht nicht aus Folie 3 die Einstellung 3.
- Zellwerte bleiben intakt. Diagrammlegenden, Achsenstriche und Tausendertrennzeichen tun dies nicht.
- Harte Grenzen: Kein 4K, keine offenen Gewichte, nur First-Party-Kanäle.
- Ein Long-Context-Modell plus ein 15-Sekunden-Videomodell reproduziert das meiste davon heute.

Wan 3.0 Document to Video-Ausgabe: Die offizielle xlsx-Demo als Keynote-ähnlicher animierter Datenfilm
Die Vorführung: Alibabas offizielle Wan 3.0 Public-Beta-Demo, ein .xlsx mit monatlichem GMV rein, 23 Sekunden animierter Datenfilm raus. Hier als stummes GIF gezeigt; die gelieferte Datei enthält eine 44,1-kHz-Stereo-AAC-Spur. Quelle: Alibabas offizielles Wan 3.0 Creator-Handbuch.
Was Wan 3.0 Document to Video tatsächlich tut
Kurzversion, damit Sie in einer Minute gehen können, wenn das alles ist, was Sie brauchen.
Sie geben ihm ein Dokument oder einen Weblink. Es liest das Ganze, entscheidet, worum es sich handelt, und generiert in einem Durchlauf ein Video mit Bild und Ton. Maximal 30 Sekunden, maximal 1080p. Es durchläuft Ihre Seiten nicht der Reihe nach.
Hier sind die Grenzen, die ein Projekt tatsächlich bestimmen.
| Spezifikation | Wan 3.0 Dokumenteneingang |
|---|---|
| Formate | doc, xls, ppt, pdf, txt, md, plus key / pages / numbers und ein einfacher Weblink |
| Eingaben pro Aufgabe | 1 Datei oder 1 Link (nicht beides, nicht mehrere) |
| Größenbegrenzung | 100 MB |
| Seitenbegrenzung | 50 Seiten |
| Maximale Ausgabe | 30 Sekunden, ein einziger kontinuierlicher Durchlauf |
| Maximale Auflösung | 1080p (keine 4K-Stufe) |
| Audio | im selben Durchlauf wie das Bild generiert |
| Offene Gewichte | keine; Wan 2.2 ist immer noch die letzte Veröffentlichung mit offenen Gewichten |
| Wo erhältlich | Alibaba Cloud Model Studio (Bailian) und Qwen Cloud, Zugang nur auf Einladung |
Die öffentliche Beta wurde am 6. August 2026 eröffnet (AgentUpdate, August 2026). Die Formatliste und die beiden veröffentlichten Preisblätter stammen aus einer separaten Spezifikationsübersicht (Ngram, August 2026).
Das offizielle Handbuch liefert vier Dokumentenanwendungsfälle, und sie decken sich sauber mit vier Aufgaben, für die Unternehmen bereits Agenturen bezahlen:
- Angebotsdokument in einen Markenfilm. Ein Hautpflege-Pitch-Dokument wird zu einer 30-sekündigen Anzeige mit einer Hauptdarstellerin und einer Morgenlicht-Geschichte.
- Kursmaterial in eine Videolektion. Ein Lexikoneintrag wird zu einem animierten Unterricht für Erstklässler.
- Tabelle in animierte Diagramme. Die Demo oben, und bei weitem der schwierigste der vier Fälle.
- Bericht in eine gesprochene Zusammenfassung. Ein schriftlicher Bericht wird zu einem Präsentations-Briefing.
Hier ist nun, wo die meisten Berichte die Kategorie falsch einordnen.
Die etablierten Anbieter von „PDF zu Video" machen das nicht. Kapwings Dokument-zu-Video extrahiert den Text aus Ihrer Datei und legt ihn auf eine Timeline, ohne Szenenaufbau und ohne Präsentator. Pictory und Powtoon montieren Stockmaterial oder Vorlagenanimationen, und Powtoons eigene Produktseiten bewerben KI-Avatare und Stimmen, die Ihr Skript vorlesen. Alle drei produzieren vertonte Folien.
| Wan 3.0 | Kapwing Document to Video | Pictory | Powtoon Anything-to-Video | |
|---|---|---|---|---|
| Was rauskommt | ein generierter Film | Ihr Text auf einer Timeline | Stockmaterial passend zum Skript | Vorlagenanimation |
| Erfindet neue Bilder | ja, jedes Bild | nein | nein, nur Bibliotheksclips | nein, Vorlagen-Assets |
| KI-Moderator | standardmäßig keiner | keiner | optionale Stimme | Avatare und Stimmen |
| Audio | mit dem Bild generiert | Sie fügen es hinzu | TTS-Voiceover | TTS-Voiceover |
| Längste Einzelausgabe | 30s | Projektlänge | Projektlänge | Projektlänge |
| Verfügbarkeit | Nur auf Einladung, First-Party | öffentlich | öffentlich | öffentlich |
Lesen Sie diese Tabelle zweimal, denn das ist das ganze Argument: Das sind keine Konkurrenten in derselben Kategorie. Der eine macht vertonte Diashows. Der andere macht Filmmaterial, das es nie gab. Sie nach dem Preis pro Minute zu vergleichen, ist, als würde man einen Fotokopierer mit einem Filmteam vergleichen.
Kann Wan 3.0 auch die Diashow-Sache? Ja, und das ist der ehrliche Vorbehalt.
Gegenbeispiel: Mit der Aufforderung, eine Webseite über Quantenmechanik in eine unterhaltsame Erklärung zu verwandeln, produzierte Wan 3.0 genau das Präsentator-plus-Untertitel-Format, das die etablierten Anbieter verkaufen. Es trifft die 30-Sekunden-Grenze bei 30,02s. Offizielle Alibaba Public-Beta-Demo, Audio an.
Der Unterschied ist also nicht, dass Wan 3.0 keine Talking-Head-Erklärvideos machen kann. Es ist, dass bei den etablierten Anbietern dieses Format die einzige Option auf der Speisekarte ist.
Warum Wan 3.0 Document to Video Diagramme zerstört, aber Ihre Zahlen behält
Hier ist das Nützlichste in diesem Artikel: Ich habe 12 gleichmäßig verteilte Bilder aus der offiziellen Tabellen-Demo gezogen und jedes Zeichen gelesen.
Das Urteil teilt sich sauber in zwei Hälften. Werte bestehen. Diagramm-Möbel fallen durch.
Was überlebt hat. Bei der 4-Sekunden-Marke zeigt das Bild $1,580, einen dünnen grauen Pfeil, $3,460, die Beschriftung „Monthly GMV Growth" und ein korallenfarbenes Abzeichen mit +45.7%. Die Typografie ist sauber, die Kommas sitzen an der richtigen Stelle, keine verstümmelten Zeichen. Der Prompt hinter dieser Demo bezieht sich auf bestimmte Tabellenzellen, und die Zahlen auf dem Bildschirm stimmen damit überein. Ein Drittanbieter-Test mit einem 8-seitigen Produktdeck fand das Gleiche: 45g, 12 Stunden und 55 Grad wurden alle korrekt dargestellt, und der Schlussslogan kam ohne ein einziges falsches Zeichen heraus (AI-Driven Lab, August 2026).
Das beantwortet die Frage, die Finanz- und L&D-Teams eigentlich interessiert. Ihre Zahlen mutieren nicht stillschweigend.
Was kaputtging. Die Diagrammbilder sind eine andere Geschichte.

Wan 3.0 Document to Video-Bildprüfung mit einer verschmolzenen Diagrammlegende und einer kaputten y-Achse
Eingefroren bei 12s in der offiziellen Demo. Drei Defekte in einem Bild: zwei Regionsnamen zu „Southeasta North America" verschmolzen, „North America" dann als eigene Serie wiederholt, und eine y-Achse, die 30, 60, 70 anzeigt, während das obere Datenlabel $3,880 sagt.
Zählen Sie die Fehler in diesem einen Bild:
- Verschmolzene Legende. „Southeast Asia" und „North America" kollidieren zu „Southeasta North America". Dann erscheint „North America" erneut als separate Serie, sodass eine Region doppelt beschriftet ist und eine verschwunden ist.
- Eine y-Achse, die keine Skala ist. Die Striche zeigen 30, 60, 70. Gleiche Pixelabstände, ungleiche Werte, und 40 und 50 fehlen einfach.
- Achse und Labels in unterschiedlichen Einheiten. Die höchste Gitterlinie ist 70. Das Label, das am oberen Datenpunkt befestigt ist, sagt $3,880.
- Größenordnung driftet entlang einer Linie. Die Labels auf dieser oberen Kurve beginnen bei $330 und $335, landen dann bei $3,970 und $3,880. Eine glatte ansteigende Linie kann keinen zehnfachen Sprung zwischen zwei benachbarten Punkten halten. Die beiden Labels dazwischen sind über das sichere Lesen hinaus verschmiert, was eine eigene Art von Antwort ist.
Das Balkendiagramm-Segment wiederholt das Muster. Vier Balken tragen $1750, $1,580, $2,350 und $2,580, sodass der kürzeste Balken die zweithöchste Zahl hält, und das erste Label verliert sein Tausendertrennzeichen, während die anderen drei es behalten. Daneben sitzen fünf grüne Wachstumszahlen für vier Balken. Und das Donut-Segment zentriert auf $89,7M, ein Komma, wo ein Dezimalpunkt hingehört.
Beachten Sie, was all diese gemeinsam haben. Keiner ist ein Inhaltsfehler. Jeder einzelne ist ein Zeichenfehler: Layout, Beschriftung, Skalierung, Interpunktion. Das Modell verstand die Tabelle und rendert dann das Diagramm so, wie ein Videomodell jeden dichten Text rendert, ungefähr.
Es gibt einen zweiten, strukturellen Grund, warum die Ausgabe nichts mit Ihrem Deck zu tun hat.
Machen Sie die Rechnung. 50 Seiten ist die Seitenobergrenze, 30 Sekunden ist die Dauerobergrenze. Das sind 0,6 Sekunden pro Seite.
Sie können eine Seite nicht in 0,6 Sekunden präsentieren, also macht das Modell das einzig Vernünftige und erstellt stattdessen einen Trailer. Dieser Drittanbieter-Deck-Test kam unabhängig zum gleichen Schluss: Es behandelte die Präsentation als Quellmaterial für einen filmischen Werbespot, nicht als Folien zum Durchblättern. Die Brillengläser des Produkts drifteten von dick zu randlos zu einer dritten Form über die Einstellungen hinweg.
Was auch der Grund dafür ist, dass die 30-Sekunden-Grenze eine Designeinschränkung ist, keine Fußnote im Datenblatt.
Wir haben die gelieferten Dateien gemessen: Die vier offiziellen Dokumentdemos landen bei 30,04s, 30,02s, 25,03s und 23,04s. Die beiden 30-Sekunden-Clips stoppen innerhalb von vier Hundertstelsekunden voneinander. Und die Tabellen-Demo wurde für 22 Sekunden angefragt, dann 23,04 geliefert. Wir haben diese Grenze in der Wan 3.0 Vorschau auseinandergenommen.
Also: Erwartungen kalibriert. Füttern Sie es mit einem Dokument, erhalten Sie einen Trailer, halten Sie Ihre Diagramme einfach.
Der Document to Video-Workflow, den Sie heute ausführen können
Kurzer Realitätscheck vor dem Tutorial, denn das spart Ihnen eine Stunde Suche.
Der Dokumenteneingang von Wan 3.0 existiert nur auf Alibabas eigenen Kanälen, der Zugang ist nur auf Einladung möglich, und die Gewichte sind nicht veröffentlicht. Niemand außerhalb dieser Kanäle kann es anbieten, auch wir nicht. Was Sie heute tun können, ist, die nützliche Hälfte dieser xlsx-Demo mit Modellen nachzubauen, die bereits im Geschäft sind, und die obige Bildprüfung sagt Ihnen genau, wie Sie den Teil vermeiden, der kaputtgeht.
Drei Schritte, ein Browser-Tab auf Atlas Cloud:
- Ein Million-Token-Modell liest das Dokument und schreibt ein zeitcodiertes Einstellungs-Skript, wobei jede Zahl als wörtlicher String eingebettet ist.
- Ein Bildmodell rendert das erste Bild, und hier wird die gesamte Textgenauigkeit festgelegt.
- Ein Videomodell animiert dieses Bild gemäß dem Skript.
| Schritt | Modell | Gelisteter Preis | Maximale Dauer | Warum es hier ist |
|---|---|---|---|---|
| 1. Skript | Qwen3.8 Max (/models/qwen/qwen3.8-max) | $2 rein / $6 raus pro 1M Tokens | n/a | 1M Kontext schluckt ein ganzes Deck |
| 2. Erstes Bild | GPT Image 2 Text-to-Image | $0,009 pro Bild (Minimum) | n/a | stärkste Textwiedergabe für Ziffern auf dem Bildschirm |
| 3. Rendern | Wan 2.7 Image-to-Video | $0,1 pro Sekunde | 15s | Erstbild-Kontrolle hält Ihre Typografie stabil |
| Audio-Option | Wan 2.7 Text-to-Video | $0,1 pro Sekunde | 15s | generiert Musik und SFX im selben Durchlauf, nimmt aber kein erstes Bild |
| Alternative für Schritt 3 | MiniMax H3 Text-to-Video | $0,1 pro Sekunde | 15s | gleicher Satz, anderer Bewegungscharakter |
| Alternative für Schritt 3 | Seedance 2.5 Text-to-Video | $0,134 pro Sekunde | 30s | das einzige hier, das in einem Durchlauf 30s erreicht |
Drei ehrliche Grenzen dieser Kette. Sie frisst kein .pptx-Binär, also fügen Sie den Text oder die CSV selbst ein. Wan 2.7 geht maximal 15 Sekunden, also ist eine einzelne 30-Sekunden-Aufnahme nicht möglich. Und der Image-to-Video-Pfad ist von Natur aus stumm: Sein audio-Parameter nimmt eine von Ihnen bereitgestellte Spur für Lippen-Synchronisation, er erfindet keinen Soundtrack. Wenn Sie Audio im selben Durchlauf generiert haben möchten, verwenden Sie das Text-to-Video-Geschwistermodell und geben die Erstbild-Kontrolle auf, was für ein Video voller Dollarzahlen der falsche Kompromiss ist. Preise wurden am 20. August 2026 auf den Modellseiten verifiziert, und beachten Sie, dass ein gelisteter Preis ein Minimum ist: Qualitäts- und Auflösungsstufen treiben den Live-Preis nach oben, also lesen Sie den Ausführen-Button, bevor Sie sich festlegen.
Lassen Sie es uns bauen.
Schritt 1: Verwandle deine Tabelle in ein zeitcodiertes Einstellungs-Skript
Videomodelle merken sich keine Zahlen. Sie rendern den String, den Sie ihnen geben. Die Aufgabe dieses Schritts ist es also, eine Tabelle in Einstellungsanweisungen umzuwandeln, in denen jede Figur bereits als Text in Anführungszeichen ausgeschrieben ist.
Fügen Sie Ihr Blatt zwischen die <<<-Markierungen ein. Einstellungen: Temperatur 0,3, max_tokens 4000. Halten Sie max_tokens großzügig, denn ein reasoning-fähiges Modell, das mitten im Gedanken das Budget ausschöpft, gibt Ihnen eine leere Antwort zurück, die Sie trotzdem bezahlen.
text1You are a motion-graphics director. Below is a raw spreadsheet export. 2 3<<< 4Month,North America,Southeast Asia,Europe,Total GMV 5Jan,1580,880,640,3100 6Feb,2110,1240,900,4250 7Mar,2740,1610,1150,5500 8Apr,3120,1980,1330,6430 9May,3350,2240,1460,7050 10Jun,3460,2480,1580,7520 11H1 growth,+45.7%,,, 12>>> 13 14Write a shot script for a 10-second, 16:9, Apple-Keynote-style 15business data video. Rules: 161. Exactly 2 shots. Give each an in/out timecode (00:00-00:05, 17 00:05-00:10). 182. Every number that appears on screen must be written in the shot 19 description as an exact literal string, in quotes, e.g. "$1,580". 20 Never write "the January figure" - write the digits. 213. Do NOT ask for a legend, an axis with tick labels, or more than 22 two data series on screen at once. Use big standalone numerals 23 and one coral pill-shaped badge instead. 244. Pure white background, soft coral + deep-grey palette, sans-serif. 255. End with one line of BGM + SFX direction (whoosh on slide-in, 26 one bell chime on the badge). 27Output the script only, no commentary. 28
Regel 3 ist die Auszahlung der Prüfung. Die offizielle Ausgabe brach bei genau drei Dingen: Legenden, Achsenstrichen und Mehrseriendiagrammen. Also löschen wir alle drei aus der Aufgabenstellung und geben diesen Bildschirmplatz für überdimensionale Ziffern und ein farbcodiertes Abzeichen frei. Gleiche Information, keine der Fehlerflächen.
Regel 2 ist die, die die Leute auslassen, und sie ist der Grund, warum die Ziffern bis zum Ende dieser Kette überleben. Eine Einstellungsbeschreibung, die „der Januar-Wert" sagt, gibt die Zahl an ein Modell zurück, das dafür Glyphen erfinden muss. Eine Einstellungsbeschreibung, die "$1,580" in Anführungszeichen sagt, gibt den nächsten beiden Schritten einen String zum Kopieren. Sie bitten hier nicht um Datenvisualisierung, Sie bitten um eine Tippanweisung.
Was zurückkommt, ist ein Zweischuss-Skript mit In- und Out-Timecodes, jeder On-Screen-Figur als wörtlicher Ausdruck zitiert, und einer abschließenden BGM- und SFX-Zeile. Heben Sie es in einer Notizdatei auf; Schritt 2 und 3 lesen beide daraus.
Schritt 2: Generiere das erste Markenbild
Jedes Zeichen des On-Screen-Textes wird hier entschieden. Ein Bildmodell in hoher Qualität rendert $1,580 weitaus zuverlässiger korrekt, als ein Videomodell es schreiben kann, während es sich auch noch bewegt, also legen wir die Typografie in einem Standbild fest und lassen Schritt 3 nur noch Pixel verschieben.
Öffnen Sie GPT Image 2 und stellen Sie die Qualität auf high und die Größe auf die 16:9-Option, die auf dieser Seite 2048x1152 ist. Passen Sie das Seitenverhältnis an das Video an, das Sie gleich erstellen werden, sonst beginnt Schritt 3 damit, Ihre Typografie zu beschneiden.
text1A pristine Apple-Keynote-style presentation frame on a pure white 2seamless background, photographed as if projected on a matte studio 3wall. Centered headline in a deep charcoal geometric sans-serif 4reading "H1 2026", set in generous negative space. Below it, two 5oversized numerals in the same typeface, "$1,580" on the left and 6"$3,460" on the right, separated by a thin light-grey arrow. Under 7the arrow, small light-grey caption text reading "Monthly GMV 8Growth". Beneath that, a single coral pill-shaped badge with white 9text reading "+45.7%". Soft even diffused lighting, faint warm 10gradient in the top-right corner, subtle paper grain, no clutter, no 11logos, no charts. Ultra-clean corporate minimalism, 16:9. 12
Zwei Details, die es wert sind, kopiert zu werden. „No charts" ist absichtlich drin. Und lesen Sie das Preisangebot auf dem Ausführen-Button, bevor Sie ihn drücken, denn hohe Qualität auf einem breiten 2K-Bild kostet ein Vielfaches des $0,009-Listenpreises.

GPT Image 2 Playground auf Atlas Cloud mit dem Erstbild-Prompt und dem gerenderten Keynote-Bild, das jede Zahl korrekt wiedergibt
GPT Image 2 bei hoher Qualität, 16:9 bei 2048x1152. Jede Abbildung landete: „H1 2026", „$1,580", „$3,460" und das korallenfarbene „+45,7%"-Abzeichen, genau deshalb wird die Typografie in einem Standbild festgelegt und nicht in einem Videomodell.
Schritt 3: Rendere den Document to Video-Clip und überprüfe jede Ziffer
Letzter Schritt. Laden Sie das Bild aus Schritt 2 als erstes Bild und lassen Sie das Videomodell es animieren, während die Typografie stillsteht.
Öffnen Sie Wan 2.7 Image-to-Video. Einstellungen: Ihr erstes Bild hochgeladen, Auflösung 1080P, Dauer 10s. Lassen Sie das Audiofeld leer, da dieses Modell Audio als treibenden Input behandelt und nicht als etwas, das es erstellt. Sie vertonen diesen Clip selbst oder in einem separaten Text-to-Video-Durchlauf.
text1Animate this frame as a 10-second Apple-Keynote-style business data 2video, holding the existing typography pixel-stable. 3 400:00-00:05 - The headline "H1 2026" holds, then dissolves into 5golden particles that drift outward. The two numerals "$1,580" and 6"$3,460" slide in from left and right and lock into place; the thin 7grey arrow draws itself between them left to right. The coral badge 8reading "+45.7%" pops up from below with a slight overshoot, timed 9to a single clear bell chime. 10 1100:05-00:10 - Everything slides smoothly off to the left. Three 12thick rounded bars grow upward from a shared baseline against the 13same pure white background, coral, teal and amber, with one large 14standalone numeral above each: "$3,460", "$2,480", "$1,580". No 15legend, no axis, no tick labels, no gridlines. Camera stays locked 16and perfectly still throughout. 17
„Holding the existing typography pixel-stable" und „camera stays locked" leisten echte Arbeit. Jede Kamerabewegung ist eine weitere Gelegenheit für das Modell, Text neu zu zeichnen, den es in Ruhe lassen sollte.
Dann machen Sie den langweiligen, wichtigen Teil: Halten Sie bei jedem Bild an, auf dem eine Zahl erscheint, und lesen Sie sie mit der Quellzeile ab. Das ist eine 30-Sekunden-Prüfung, und es ist das Einzige, was zwischen Ihnen und einem Video steht, das selbstbewusst den falschen Umsatz zeigt.

Wan 2.7 Image-to-Video Playground auf Atlas Cloud mit geladenem erstem Bild und gerendertem Datenclip
Wan 2.7 Image-to-Video bei 1080P mit dem hochgeladenen ersten Bild aus Schritt 2 und dem fertigen Clip im Ausgabefenster. Bemerkenswert, was das Fenster sagt: Wir haben 10 Sekunden angefordert, das Dauerfeld zeigte 10, und der Render kam 5 zurück. Das Run-Angebot hat es uns gesagt, bevor die Datei es tat, was der ganze Grund ist, es zu lesen.

Der fertige Datenclip, neu aufgebaut aus derselben GMV-Tabelle, jede Zahl intakt
Die Auszahlung: Dieselbe Tabelle, neu aufgebaut mit Legenden und Achsenstrichen, die bewusst weggelassen wurden. Das Modell komprimierte beide skriptierten Einstellungen in die fünf Sekunden, die es tatsächlich rendert, und jede Zahl überlebte den Umzug: „$1,580" und „$3,460" in der Eröffnung, dann „$3,460", „$2,480" und „$1,580" über den drei Balken. Null verstümmelte Labels, weil es keine Labels mehr gab, die verstümmelt werden konnten. Von Natur aus stumm, da der Image-to-Video-Pfad für Sie nichts vertont.
Document to Video-Variationen und was eine fertige Minute kostet
Der Tabellenfall ist der schwierigste. Die anderen drei offiziellen Anwendungsfälle sind einfacher, und dort liegt der meiste kommerzielle Wert.
Kursmaterial. Füttern Sie es mit einem Lexikoneintrag und bitten Sie um eine Lektion auf einem bestimmten Leseniveau. Die Ausgabe unten ist ein animierter Chibi-Unterricht über den Dichter Wang Wei, 25,03 Sekunden lang.
Der Zeichenstil hält die ganze Zeit durch. Die Charakterdetails nicht. Bei der 3-Sekunden-Marke trägt er eine schwarze Mütze vor einem einfarbig weißen Hintergrund; nach 22 Sekunden ist die Mütze hellblau geworden und er steht in einem klassischen Schriftrollengemälde. Dieselbe Drift, die der Deck-Tester bei diesen Brillengläsern sah. Wenn Sie dies auf der Dreischrittkette nachbauen, sperren Sie eine Charakterkarte in Schritt 1 und verwenden Sie das Bild aus Schritt 2 als Ihren Stilanker.
Lexikoneintrag in eine animierte Lektion für die erste Klasse, 25,03s mit generiertem Audio. Offizielle Alibaba Wan 3.0 Public-Beta-Demo.
Markenfilme. Ein Angebotsdokument wird zu einem 30-Sekunden-Spot. Es ist die hübscheste der vier Demos und die am wenigsten überprüfbare, da Sie nicht sehen können, was das Quelldokument sagte. Achten Sie eher auf Konsistenz als auf Schönheit: Dies ist die Fehlerart, die den Drittanbieter-Tester erwischte, dessen Produkt sich in einem Clip dreimal veränderte.
Angebotsdokument in einen 30,04s Hautpflege-Markenfilm. Offizielle Alibaba Wan 3.0 Public-Beta-Demo, Audio an.
Berichtszusammenfassungen. Es gibt keine offizielle Demo für diesen Fall, also behandeln Sie das Muster als ungetestet: Bitten Sie um einen Moderator, eine Behauptung pro Einstellung, und setzen Sie jede Figur genau wie in Schritt 1 in Anführungszeichen.
Nun zum Geld.
| Was | Tarif | 30 Sekunden fertiges Video |
|---|---|---|
| Wan 3.0, 1080p (RMB-Blatt) | ¥1,2 pro Sekunde | ¥36 |
| Wan 3.0, 1080p (USD-Blatt) | $0,20 pro Sekunde | $6,00 |
| Wan 3.0, 720p (RMB-Blatt) | ¥0,6 pro Sekunde | ¥18 |
| Dreischrittkette, ein Durchlauf | Skript + Bild + $0,1/s Render | ungefähr $1,20 für 10s |
| Dreischrittkette, 3 Versuche | Skript wiederverwendet, Bild und Render wiederholt | ungefähr $3,50 |
Zwei veröffentlichte Wan 3.0-Preisblätter widersprechen sich, ob 1080p ¥1,2 oder $0,20 pro Sekunde kostet, was nicht dieselbe Zahl ist. Überprüfen Sie den Tarif an dem Endpunkt, gegen den Sie tatsächlich abgerechnet werden, bevor Sie eine Serie budgetieren.
Die versteckten Kosten sind nicht der Preis pro Sekunde. Es sind die Wiederholungen. Der Dokumenteneingang nimmt eine Datei pro Aufgabe, also bedeutet das Ändern einer einzigen Zahl, das gesamte Video neu zu generieren. In der Dreischrittkette ist das Einstellungsskript ein wiederverwendbares Textartefakt, sodass eine Zahlenänderung einen Render anstelle einer vollständigen Aufgabe kostet. Über einen vierteljährlichen Berichtszeitraum hinweg übertrifft dieser Unterschied den Preis pro Sekunde bei weitem.
Ein rechtlicher Hinweis, bevor Sie etwas hochladen. Ein Dokument, das Sie an ein gehostetes Modell senden, ist ein Dokument, das Ihr Gebäude verlässt, und interne Decks und unveröffentlichte Finanzdaten haben normalerweise eine Richtlinie dazu. Überprüfen Sie es vor dem Abgabedruck, nicht danach. Und alle offiziellen Demo-Clips in diesem Artikel gehören Alibaba, hier als Public-Beta-Material zitiert; nichts hier ist eine Lizenz, sie kommerziell wiederzuverwenden.
Wan 3.0 Document to Video FAQ
Welche Dateitypen akzeptiert Wan 3.0 Document to Video und wie groß?
doc, xls, ppt, pdf, txt und md, zudem werden auch key, pages und numbers berichtet, plus ein einfacher Weblink anstelle einer Datei. Eine Datei oder ein Link pro Aufgabe, bis zu 100 MB oder 50 Seiten.
Wandelt Wan 3.0 jede Folie in eine Szene um?
Nein, und das ist das häufigste Missverständnis. Es liest das gesamte Dokument und führt dann Regie bei einem Video aus dem, was es gelernt hat. An der Obergrenze sind das 50 Seiten in 30 Sekunden, oder 0,6 Sekunden pro Seite, also produziert es einen Trailer statt eines Seitenumblätters. Sowohl die offiziellen Anwendungsfälle als auch unabhängige Tests deuten in dieselbe Richtung.
Sind die Zahlen aus meiner Tabelle im Video korrekt?
Zellwerte hielten in jedem Fall, den ich überprüft habe, stand, einschließlich $1,580, $3,460 und +45,7% in der offiziellen Demo. Was fehlschlägt, sind Diagramm-Möbel: Legenden verschmelzen, Achsenstriche kommen nichtlinear heraus, und Tausendertrennzeichen gehen verloren. Betten Sie jede Figur als wörtliches Zitat ein und designen Sie Legenden und Achsenstriche vollständig aus der Aufgabenstellung heraus.
Kann ich Wan 3.0 Document to Video heute über eine API nutzen?
Nur über Alibabas eigene Kanäle, derzeit nur auf Einladung, und die Gewichte sind nicht veröffentlicht. Wan 2.2 bleibt die letzte Veröffentlichung mit offenen Gewichten in der Reihe. Bis sich das ändert, ist die obige Dreischrittkette der praktische Ersatz.
Wie viel kostet ein 30-sekündiges Wan 3.0-Video?
Zum veröffentlichten 1080p-Tarif sind das ¥36, oder $6,00 auf dem internationalen Blatt, für einen 30-Sekunden-Clip. Budgetieren Sie für Wiederholungen und nicht für einen einzelnen Durchlauf, denn eine Korrektur einer Zahl bedeutet, das Ganze neu zu generieren.
Was ist die derzeit beste Alternative zu Wan 3.0 Document to Video, die ich sofort nutzen kann?
Ein Long-Context-Modell, um das Einstellungsskript zu schreiben, dann Wan 2.7 zu $0,1 pro Sekunde für den Render, mit MiniMax H3 zum gleichen Tarif oder Seedance 2.5 zu $0,134 pro Sekunde als Alternativen. Sie erhalten den Look des generierten Filmmaterials und bildgenauen Text. Was Sie nicht bekommen: 30 Sekunden in einem kontinuierlichen Take, Audio im selben Durchlauf wie der Image-to-Video-Render, oder ein Modell, das die .pptx für Sie liest.
Die ehrliche Zusammenfassung: Wan 3.0 Document to Video ist eine echte Fähigkeit mit einer echten Obergrenze, und die Lücke zwischen seiner Ausgabe und Ihrer ist kleiner, als es scheint, solange Sie aufhören, von einem von beiden zu verlangen, eine Legende zu zeichnen.






