Wan 3.0 Multi-Shot-Konsistenz: Ich habe jeden Schnitt in 110 offiziellen Clips gezählt
Du hast ein Vier-Shot-Skript geschrieben. Shot 1 sitzt perfekt: Strohhut, schwarze Perlenkette, weißes Leinenkleid, Licht genau richtig. Shot 2 kommt an – und es ist eine andere Frau in einem anderen Hut.
Diese Lücke ist der Grund, warum alle auf Wan 3.0 Multi-Shot-Konsistenz starren – das Versprechen von einem Prompt, sechs Einstellungen, dreißig Sekunden, derselbe Charakter durchgängig.
Also habe ich aufgehört, Datenblätter zu lesen. Ich habe alle 110 Demodateien heruntergeladen, die Alibaba mit seinem eigenen Wan 3.0 Creator Handbook veröffentlicht hat, ffmpeg über jede einzelne laufen lassen, alle 64 zugehörigen Prompts ausgewertet und dann das getan, was niemand in den Suchergebnissen getan hat: Ich habe die tatsächlichen Schnitte in den ausgelieferten Videos gezählt und mit der Shot-Anzahl verglichen, die jeder Prompt verlangt hat.
Drei Ergebnisse widersprechen dem, was man überall sonst liest.

Kinematografische Farbkorrektur-Suite, in der eine Wand aus Monitoren denselben Strohhut-Charakter über sechs verschiedene Einstellungen hinweg zeigt – der Referenzpunkt für Wan 3.0 Multi-Shot-Konsistenz
Eine Referenzwand eines Coloristen ist das ehrliche mentale Modell für Multi-Shot-Konsistenz: eine Identität, sechs Bildausschnitte, nebeneinander geprüft. Generiert mit openai/gpt-image-2.
Wichtige Erkenntnisse
- 6 Shots sind real, aber nicht garantiert: 3 von Alibabas eigenen Multi-Shot-Prompts erreichten die angegebene Anzahl exakt, 2 lieferten weniger.
- Der schlimmste Fall verlangte 4 Shots und lieferte 2.
- Kein 4K. Keine der 110 offiziellen Dateien übersteigt 1080p, und nur 4 sind exakt 1920x1080.
- Requisiten und Kamera driften früher als Gesichter. Achte auf den Hut, nicht auf die Augen.
- Es gibt noch keine öffentliche Wan 3.0 API außerhalb von Alibabas eigener Plattform, daher baut das Tutorial unten die Funktionalität mit Modellen nach, die du heute nutzen kannst.
Hier ist das beste Ergebnis aus Alibabas eigenem Handbuch. Sechs Shots im Prompt angegeben, sechs Shots geliefert, dieselben zwei Charaktere, dieselbe Kleidung, derselbe Regen:

Sechs-Shot-Anime-Sequenz auf einem regnerischen Bahnsteig – dasselbe Mädchen mit transparentem Regenschirm und derselbe Junge mit khakifarbenem Rucksack, durchgängig in jedem Schnitt konsistent gehalten
Alibabas offizielle Wan 3.0 Beta-Demo (Handbuch-Clip v013, 1280x720, 20,05s). Der Prompt nummerierte die Shots 1 bis 6; ffmpeg findet exakt 5 harte Schnitte, also wurden alle 6 Shots erreicht. Nicht von Atlas Cloud generiert.
Was Wan 3.0 Multi-Shot-Konsistenz eigentlich ist
Kurzfassung: Es sind drei separate Versprechen unter einem Namen, und Alibaba ist ungewöhnlich genau, welche drei das sind.
Im Launch-Beitrag unterteilt Alibaba Konsistenz in Charaktere („Gesichtszüge, Frisur und Haarfarbe, Körperform, Kleidung und Accessoires“), Requisiten („Ansicht aus mehreren Winkeln, Hardware-Struktur, Logos und Materialdetails“) und Raum („Figurenblockierung und Kameraperspektive“) (Alibaba Cloud, 2026). Diese Dreiteilung ist der Bewertungsmaßstab für alles Folgende. Gleiches Gesicht, falsche Kette, ist ein Fehlschlag.
Das Modell generiert in einem Job bis zu 30 Sekunden, in 480P, 720P oder 1080P (Alibaba Cloud, 2026).
Nun der Teil, den die Suchergebnisse falsch darstellen.
| Häufige Behauptung in Suchergebnissen | Was das Erstmaterial tatsächlich zeigt |
|---|---|
| „Native 4K-Generierung" | Der offizielle Beitrag listet nur 480P / 720P / 1080P. Bei 110 offiziellen Demodateien überschreitet nichts 1080p, nur 4 Dateien sind exakt 1920x1080. Die übliche „1080p"-Landschaftsausgabe ist 1920x1072. |
| „Bis zu 6 unabhängige Shots pro Generierung" | Im eigenen Launch-Beitrag von Alibaba erscheint keine Shot-Anzahl-Spezifikation. Empirisch hält es: Von 8 expliziten Multi-Shot-Prompts im Handbuch gibt der höchste 6 an, und zwei davon lieferten 6. |
| „Bis zu 12 Referenzbilder" | Praxistests berichten bis zu 10 Bilder plus 5 Videoclips plus 5 Audioclips (Curious Refuge, 2026). Alibabas Beitrag nennt gar keine Zahl. |
| „Offene Gewichte, Apache-2.0" | Frühere Wan-Versionen hatten offene Gewichte; Wan 3.0 wird als Plattformdienst ausgeliefert, und es sind keine Gewichte erschienen (Curious Refuge, 2026). |
| „Die API ist draußen" | Sie läuft auf Alibaba Cloud Model Studio. Drittanbieter-Inferenzplattformen haben sie noch nicht. |
Und dies ist die Tabelle, deren Erstellung am längsten gedauert hat. Jede Zahl stammt von mir, aus der ffmpeg-Szenenerkennung der ausgelieferten Datei im Vergleich zur im zugehörigen Prompt angegebenen Shot-Anzahl:
| Offizielle Demo | Prompt deklariert | Gefundene harte Schnitte | Ausgelieferte Shots | Bewertung |
|---|---|---|---|---|
| v013 Regenbahnsteig, Anime | 6 Shots | 5 | 6 | Exakt |
| v055 Golden Retriever Tagebuch | 6 Shots, 30,0s | 5 | 6 | Exakt |
| v021 Ramen-Laden und Kätzchen | 4 Shots | 3 | 4 | Exakt |
| v008 Waldsee, 3D | 4 Shots | 2 | 3 | Eine weniger |
| v085 Strohhut-Frau | 4 Shots | 1 | 2 | Hälfte |
| v041 Flur zur Zaubergasse | 3 Segmente, „kein harter Schnitt" | 0 | 1 durchgehende Aufnahme | Genau wie verlangt |
| v045, v084, v102 | 3 / 5 / mehrere Subjekte | Zu viele zur Auflösung | Nicht zählbar | Schnelle Schnitte und Tusche-Effekte verhindern Erkennung |
Lies die mittleren Zeilen noch einmal. Drei Prompts trafen ihre Zahl exakt. Zwei taten es nicht. Die eingegebene Shot-Anzahl ist eine Anfrage, kein Vertrag.
Warum Wan 3.0 Multi-Shot-Konsistenz bricht: 4 Fehlermodi
Ergebnis zuerst: Es bricht selten am Gesicht. Es bricht an den Objekten und der Kamera, und am stärksten, wenn du mehrere Dinge gleichzeitig änderst.
Hier ist der Clip, der mir am meisten beigebracht hat, weil er der schlechteste Performer in Alibabas eigener Vorzeigegalerie ist.
GtZy2TUK4ak
Alibabas offizielle Wan 3.0 Beta-Demo (Handbuch-Clip v085, 1240x742, 30,08s). Der Prompt schreibt vier zeitcodierte Shots vor. ffmpeg findet einen echten Schnitt, bei 9,3s. Die Shots 3 und 4 fallen in eine einzige durchgehende Aufnahme, die in Schwarz ausblendet. Nicht von Atlas Cloud generiert.
Fehlermodus 1: Requisiten driften früher als Gesichter. Sieh dir in diesem Clip allein die erste Einstellung an, bevor irgendein Schnitt passiert. Bei 0,6s hat der Strohhut ein schmales schwarzes Band und der Anhänger ist ein facettierter marineblauer Stein. Bei 9,2s ist das Band ein breites schwarzes Band und der Anhänger ein glatter, glänzender schwarzer Tropfen. Ihr Gesicht bleibt die ganze Zeit stabil. Die Accessoires nicht.

Zwei Frames aus derselben durchgehenden Neun-Sekunden-Einstellung nebeneinander – das Hutband wird breiter, der Anhänger ändert Form und Farbe
Beide Frames stammen aus derselben ununterbrochenen Aufnahme der offiziellen v085-Demo, 8,6 Sekunden auseinander, kein Schnitt dazwischen. Hutband und Anhänger ändern sich. Das ist die Requisitenebene, die versagt, während die Charakterebene hält.
Deshalb ist der Akzeptanztest, der tatsächlich funktioniert, eine Requisiten-Checkliste, kein Stimmungscheck. Für diesen Charakter sind es drei Dinge: Hutform und -band, Perlenkette und Anhänger, Ausschnitt des Kleides.
Fehlermodus 2: Szenen mit mehreren Subjekten halten einzeln und verschmieren bei Kontakt. Jeder Charakter bleibt für sich erkennbar. Wenn sie im Bild zusammen interagieren, verschwimmen die Identitäten. Unabhängige Tests fanden dasselbe: „Die Charakterkonsistenz begann zu bröckeln, und das Compositing sah gelegentlich eher aus wie ein schlechter Greenscreen-Effekt als eine natürlich generierte Umgebung", wobei die Lippenbewegung als die größte Schwachstelle genannt wurde (Curious Refuge, 2026).
Fehlermodus 3: Du hast vier Variablen in einer Zeile geändert. Neuer Ort plus neuer Kamerawinkel plus neue Beleuchtung plus neuer Kleidungszustand ist der sichere Weg, eine Identität zu verlieren. Die eigenen Prompts des Handbuchs bekämpfen dies, indem sie in jedem Segment das gesamte Outfit wiederholen. Von den 64 zugehörigen Prompts sagen 9 explizit „bleibt unverändert", 5 geben die Kameraposition vor, und 4 verlangen, dass der Charakter identisch bleibt.
Fehlermodus 4: 30 Sekunden in einem Job sind nicht 30 Sekunden einer einzigen Einstellung. Das sind unterschiedliche Produkte. Ein 30-Sekunden-Multi-Shot-Job schneidet zwischen Bildausschnitten. Wenn du eine durchgehende ununterbrochene Aufnahme möchtest, verschlechtert sich die Verkettung von Fortsetzungen: Der Identitätsfehler summiert sich bei jeder Übergabe, daher ist die saubere Einzelaufnahme von Natur aus kurz.
Das Handbuch hat genau einen Prompt, der die Nahtlosigkeit richtig hinbekommt, und es lohnt sich, den Satzbau zu kopieren:

Drei Prompt-Segmente, gerendert als eine einzige ununterbrochene durchgehende Aufnahme, von einem Wohnungsflur durch eine Tür in eine laternenbeleuchtete gotische Gasse
Alibabas offizielle Wan 3.0 Beta-Demo (Handbuch-Clip v041, 720x1280, 15,04s). Drei Prompt-Segmente, und ffmpeg findet null harte Schnitte – genau das, was der Prompt verlangte. Nicht von Atlas Cloud generiert.
Seine Übergabezeile, übersetzt, ist das am weitesten wiederverwendbare Element im gesamten Handbuch: nahtlos vom letzten Frame des vorherigen Segments fortfahren; der Charakter, die Kleidung, der Ort und die Kameraposition bleiben vollkommen identisch; kein harter Schnitt und kein abrupte Szenenüberleitung. Nur ein Prompt von 64 verwendet es. Klau es.
Der Multi-Shot-Konsistenz-Workflow, den du heute ausführen kannst
Die Frage ist: Wo führst du das eigentlich aus?
Derzeit lebt Wan 3.0 auf Alibabas eigenem Model Studio. Keine Drittanbieter-Inferenzplattform hostet es. Auf Atlas Cloud erscheint es nur als „Coming Soon"-Eintrag ohne live Endpunkte – das ist der ehrliche Stand der Dinge und sollte klar gesagt werden, anstatt so zu tun, als wäre es anders.
Du hast also zwei Optionen: warten, oder aufhören, einen Prompt zu bitten, sechs Dinge zu tun.
Die zweite Option ist ohnehin besser, und mein Schnittzählen ist das Argument dafür. Ein einzelner Multi-Shot-Job lieferte in Alibabas eigener Vorführung eine Shot-Anzahl, die um die Hälfte danebenlag. Die Aufteilung des Jobs gibt dir diese Kontrolle zurück:
- Lege den Look einmal als Standbild fest.
- Klone diese Identität in einen Keyframe pro Shot und ändere jeweils genau eine Variable.
- Animiere jeden Shot separat mit gesperrter Referenz.
- Schneide lokal zusammen.
Langsamer im Setup, dramatisch vorhersagbarer. Und jedes Modell in der Kette ist heute aufrufbar.
| Schritt | Modell | Rolle in der Kette | Gelisteter Preis |
|---|---|---|---|
| 1 | bytedance/seedream-v5.0-pro/text-to-image | Charakter-Look festlegen | 0,045 $/Bild |
| 2 | google/nano-banana-2/edit | Identität in Keyframe jedes Shots klonen | 0,08 $/Bild |
| 3 | alibaba/wan-2.7/reference-to-video | Jeden Shot mit gesperrter Referenz animieren | 0,10 $/Sekunde |
| Alt | alibaba/wan-2.7/text-to-video | Ein Prompt, viele Shots (am wenigsten steuerbar) | 0,10 $/Sekunde |
| Fix | alibaba/wan-2.7/video-edit | Eine falsche Requisite reparieren ohne neu zu generieren | 0,10 $/Sekunde |
Wissenswert für die Frage „bestes Modell für Multi-Shot-Konsistenz": Referenz-zu-Video ist inzwischen eine ganze Kategorie. bytedance/seedance-2.0-fast/reference-to-video kostet 0,072 $/s (20 % Rabatt auf 0,09 $, Stand August 2026), kwaivgi/kling-video-o3-pro/reference-to-video 0,095 $/s (15 % Rabatt auf 0,112 $), minimax/h3/reference-to-video 0,10 $/s und google/veo3.1/reference-to-video 0,20 $/s. Alle Preise am 21. August 2026 gegen das Live-Katalog verifiziert.
Eine Warnung vor den Schritten: Gelistete Preise sind eine Untergrenze, kein Angebot. Auflösung und Dauer verschieben die tatsächliche Zahl – lies den Run-Button, bevor du dich festlegst.
Wie man Wan 3.0-ähnliche Multi-Shot-Konsistenz Schritt für Schritt aufbaut
Wir bauen genau das Beat-Sheet nach, das Alibabas eigenes Modell vermasselt hat: die Strohhut-Frau, vier Shots, Garten zu Auto. Gleiches Skript, Kontrolle pro Shot, und diesmal bekommst du vier Shots, weil du vier gerendert hast.
Lass uns loslegen.
Schritt 1: Den Look festlegen. Ein Bild wird zum Identitätsanker für alles Weitere. Generiere es auf Seedream v5.0 Pro, 16:9, höchste Auflösung, die die Seite bietet. Nenne die drei Prüfpunkt-Requisiten explizit, denn diese sind es, die abdriften.
plaintext135mm-Film-Still, vintage sonnendurchfluteter Rosengarten. Eine elegante junge Frau 2trägt einen natürlichen Strohboaterhut mit schwarzem Band, eine schwarze 3Perlenkette mit einem einzelnen tropfenförmigen Anhänger und ein weißes ärmelloses 4Leinenkleid. Sie steht vor einer Wand aus blühenden rosa und cremefarbenen Rosen, 5eine Hand berührt leicht die Hutkrempe, sanfter und nachdenklicher Blick leicht 6neben die Kamera. Weiches warmes natürliches Licht, gefleckte Sonnenblende, 7geringe Schärfentiefe, feines Filmkorn, mittlere Nahaufnahme.

Seedream v5.0 Pro Playground auf Atlas Cloud mit eingegebenem Strohhut-Prompt und dem fertigen Charakter-Keyframe, der im Ausgabefenster gerendert wird
Schritt 1 abgeschlossen: der Identitätsanker für die gesamte Vier-Shot-Sequenz.
Schritt 2: Die Identität in die Shots 2 bis 4 klonen. Ein Keyframe pro Shot, ein Durchlauf pro Shot, mit Nano Banana 2 Edit und dem Ausgabebild von Schritt 1 als Referenz. Die entscheidende Disziplin: Gib jedes Mal die gesamte Kleidung an, und ändere dann genau eine Sache.
Shot 2, die emotionale Wende:
plaintext1Behalte exakt dieselbe Frau aus dem Referenzbild: identisches Gesicht, identischer 2natürlicher Strohboaterhut mit schwarzem Band, identische schwarze Perlenkette mit 3tropfenförmigem Anhänger, identisches weißes ärmelloses Leinenkleid. Neue 4Einstellung: filmische Nahaufnahme, sie hebt langsam den Strohhut vom Kopf und 5senkt das Kinn, ein sanfter wehmütiger Ausdruck. Gleicher Rosengarten-Hintergrund. 6Behalte streng die gleiche Beleuchtung, den Hautton, das Filmkorn und die 7Farbkorrektur wie in der Referenz bei.
Shot 3, der Schnitt zum Auto:
plaintext1Behalte exakt dieselbe Frau aus dem Referenzbild: identisches Gesicht, identische 2schwarze Perlenkette mit tropfenförmigem Anhänger, identisches weißes ärmelloses 3Leinenkleid, der Strohboaterhut liegt jetzt auf ihrem Schoß. Neue Einstellung: 4Rücksitz eines fahrenden Autos, Seitenprofil, ihre Hand an der Tür abgestützt, 5Blick aus einem regennassen Fenster, verschwommenes grünes Laub rauscht vorbei. 6Bewölktes Licht mit warmer Innenraumfüllung, geringe Schärfentiefe, elegante 7Melancholie. Behalte streng dasselbe Gesicht, dieselbe Farbkorrektur und dasselbe 835mm-Filmkorn wie in der Referenz bei.
Shot 4, der letzte Blick:
plaintext1Behalte exakt dieselbe Frau aus dem Referenzbild: identisches Gesicht, identische 2schwarze Perlenkette mit tropfenförmigem Anhänger. Neue Einstellung: extreme 3Gesichtsnahe neben dem Autofenster, Augen schließen sich langsam, ein ruhiger und 4erlöster Ausdruck. Regentropfen gleiten vor ihr über das Glas, der Fokus 5verschiebt sich auf die Tropfen, der Hintergrund fällt in Bokeh. Wong Kar-wai 6Stil, filmische Stimmung, feines Filmkorn. Behalte streng dasselbe Gesicht, 7dieselbe Beleuchtung und dieselbe Farbkorrektur wie in der Referenz bei.

Nano Banana 2 Edit Playground auf Atlas Cloud mit geladenem Keyframe aus Schritt 1 als Referenz und gerendertem Keyframe für Shot 2 – Identität und Kleidung gehalten
Schritt 2 abgeschlossen: Keyframe für Shot 2, dieselbe Frau, Hut jetzt in ihren Händen.
Schritt 3: Shot 1 mit gesperrter Referenz animieren. Jetzt wird jeder Shot unabhängig auf Wan 2.7 reference-to-video zum Video. Einstellungen: 720P, 5 Sekunden, und lege den Keyframe aus Schritt 1 in den Bilder-Slot. Prüfe den Run-Button-Angebot, bevor du feuern.
plaintext1Shot 1 von 4. Referenzbild 1 definiert den Charakter: Behalte dasselbe Gesicht, 2denselben natürlichen Strohboaterhut mit schwarzem Band, dieselbe schwarze 3Perlenkette mit tropfenförmigem Anhänger und dasselbe weiße ärmellose 4Leinenkleid für den gesamten Clip identisch bei. 35mm-Film-Look, sonniger 5Rosengarten im Vintage-Stil. Die Frau berührt leicht die Hutkrempe, während eine 6sanfte Brise Haarsträhnen hebt; die Kamera fährt sehr langsam hinein. Warmes 7natürliches Licht, gefleckte Sonnenblende, geringe Schärfentiefe, feines Filmkorn. 8Die Kameraposition bleibt stabil. Kein harter Schnitt und kein Szenenwechsel.

Wan 2.7 reference-to-video Playground auf Atlas Cloud mit dem Keyframe im Bilder-Slot und dem fertigen Fünf-Sekunden-Clip, der im Ausgabefenster abgespielt wird
Schritt 3 abgeschlossen: der referenzgesperrte Clip im Ausgabefenster.
Und hier ist das Ergebnis:

Fünf-Sekunden-referenzgesperrter Clip der Strohhut-Frau im Rosengarten – Hutband und Kette bleiben durchgängig stabil
Unser eigener Durchlauf auf Atlas Cloud, keine Alibaba-Demo. Als stummes GIF dargestellt; die ausgelieferte Datei enthält eine Audiospur.
Schritt 4: Shots 2 bis 4 verketten, dann zusammensetzen. Wiederhole Schritt 3 für jeden verbleibenden Keyframe und füge den Übergabesatz aus dem Handbuch an den Anfang jedes Folgeprompts ein:
plaintext1Nahtlos vom letzten Frame des vorherigen Segments fortfahren. Der Charakter, die 2Kleidung, der Ort und die Kameraposition bleiben vollkommen identisch. Kein 3harter Schnitt und kein abrupte Szenenüberleitung.
Dann lokal mit ffmpeg concatenieren und den Drei-Punkte-Akzeptanztest durchführen: Hutform und -band, Perlenkette und Anhänger, und ob die Bildausschnitts-Progression zwischen den Shots tatsächlich Sinn ergibt. Wenn genau eine Requisite in einem Shot falsch ist, generiere den Shot nicht neu. Schicke ihn durch wan-2.7/video-edit und ändere nur das, indem du die Formulierung des Handbuchs leihst: die Aktionen, die Kleidung und den Rest des Frames unverändert lassen.
Variationen: Szenen mit mehreren Subjekten und Stil-Sperren
Drei Muster aus dem Handbuch, die es wert sind, gestohlen zu werden.
Charakterkarten für Multi-Subjekt-Shots. Wenn zwei oder mehr Personen im Bild sind, weisen die offiziellen Prompts Buchstaben-Charakterkarten zu und deklarieren in jedem Segment erneut die gesamte Kleidung jedes Einzelnen. Ausführlich, hässlich – und es funktioniert besser als Pronomen.
Globale Stil-Deklaration für stilisierte Arbeiten. Tusche, Cel-Animation und andere starke Stile benötigen den einmal für das gesamte Stück festgelegten Stil, darunter eine zeitcodierte Beat-Sheet.

Tusche-Kampfsport-Sequenz mit einem Bambuswald-Schwertkämpfer, Stil über einen zeitcodierten Fünf-Beat-Kampf gesperrt
Alibabas offizielle Wan 3.0 Beta-Demo (Handbuch-Clip v084, 20,05s, beschnitten). Fünf zeitcodierte Beats unter einer globalen Tusche-Stil-Deklaration. Die flackernde Pinselführung ist der Grund, warum die automatische Schnitterkennung diesen Clip nicht zählen kann. Nicht von Atlas Cloud generiert.
Reparieren, nicht neu generieren. Ein video-edit-Durchlauf für eine falsche Requisite ist billiger als ein neuer Render und kann die bereits korrekten Shots nicht zerstören.
Was eine Vier-Shot-Sequenz kostet
Konkrete Zahlen für die oben aufgebaute Sequenz, zu den gelisteten Preisen:
- 1 Identitätsanker auf Seedream v5.0 Pro: 0,045 $
- 3 Shot-Keyframes auf Nano Banana 2 Edit: 3 x 0,08 $ = 0,24 $
- 4 Clips à 5s, 720P, auf Wan 2.7 reference-to-video: 20s x 0,10 $ = 2,00 $
- Gesamt: ca. 2,29 $ für eine 20-Sekunden-Vier-Shot-identitätsgesperrte Sequenz
Dehne es auf eine Sechs-Shot-30-Sekunden-Sequenz aus, und die Videolinie wird zu 3,00 $, was insgesamt bei etwa 3,44 $ liegt.
Zwei ehrliche Einschränkungen. Erstens: Die gelisteten Preise sind eine Untergrenze: Auflösungsstufen und Dauer ändern die tatsächliche Belastung, und das eigene Run-Angebot des Playgrounds ist die einzige verbindliche Zahl – weshalb die Screenshots oben wichtiger sind als diese Liste. Zweitens: Bei Wan 3.0 selbst bepreist Alibaba Model Studio Videogenerierung pro Sekunde nach Auflösungsstufe, aber ich konnte die genauen Wan 3.0-Preise pro Sekunde nicht von einer Erstparteienseite bestätigen, daher gebe ich keine Zahlen an, die ich nicht verifizieren konnte.
Es ist erwähnenswert, was du mit dem Split-Job-Ansatz kaufst: nicht einen niedrigeren Preis, sondern eine Shot-Anzahl, die deinem Skript entspricht. Nach den Belegen aus Alibabas eigener Vorführung ist das etwas, was ein einzelner 30-Sekunden-Job dir noch nicht versprechen kann – und es ist die praktische Antwort auf Wan 3.0 Multi-Shot-Konsistenz, bis die API geöffnet wird.
Häufig gestellte Fragen
Wie viele Shots kann Wan 3.0 in einer Generation konsistent halten?
Sechs, nach aktuellem Stand, mit einer Einschränkung. Alibabas Launch-Beitrag veröffentlicht keine Shot-Anzahl-Spezifikation. Von den 8 expliziten Multi-Shot-Prompts im offiziellen Handbuch gibt der höchste 6 an, und zwei davon lieferten exakt 6 schnittverifizierte Shots. Behandle 6 als beobachtete Obergrenze, nicht als Garantie.
Generiert Wan 3.0 wirklich natives 4K?
Nein. Der offizielle Beitrag listet nur 480P, 720P und 1080P. Von allen 110 offiziellen Demodateien überschreitet nichts 1080p, nur 4 Dateien sind exakt 1920x1080, und die übliche Landschaftsausgabe ist 1920x1072. Bildraten aufgeteilt: 24fps für 63 Dateien und 30fps für 46.
Ist die Wan 3.0 API verfügbar, und wo kann ich sie ausführen?
Sie läuft auf Alibaba Cloud Model Studio. Keine Drittanbieter-Inferenzplattform hostet sie bisher; Atlas Cloud listet sie als „Coming Soon"-Eintrag ohne live Endpunkte. Wenn du diese Woche Multi-Shot-Ausgabe benötigst, ist die oben beschriebene Wan 2.7 reference-to-video-Kette der funktionierende Ersatz.
Warum ändern sich meine Charaktere zwischen den Shots, selbst mit einem Referenzbild?
Meistens, weil ein Prompt gleichzeitig den Ort, den Kamerawinkel und die Beleuchtung geändert hat. Ändere eine Variable pro Shot und wiederhole die gesamte Kleidung in jedem Prompt. Überprüfe auch die richtigen Dinge: In Alibabas eigener Demo blieb das Gesicht stabil, während sich Hutband und Anhänger innerhalb einer einzigen ununterbrochenen Aufnahme änderten.
Sind die Wan 3.0 Gewichte Open Source?
Es wurden keine Gewichte veröffentlicht. Frühere Wan-Versionen waren herunterladbar und lokal ausführbar, während Wan 3.0 als gehosteter Plattformdienst ausgeliefert wird. Jeder, der eine Apache-2.0-Lizenz für Wan 3.0 zitiert, wiederholt etwas ohne Erstquellen-Beleg.
Was ist der schnellste Weg, um Multi-Shot-Konsistenz ohne Wan 3.0-Zugriff zu erreichen?
Vier Schritte: Ein Identitätsbild festlegen, es in einen Keyframe pro Shot klonen (jeweils eine Variable ändern), jeden Shot mit reference-to-video animieren, dann lokal zusammensetzen und die Requisiten prüfen. Rund 2,29 $ und etwa eine halbe Stunde für eine Vier-Shot-Sequenz.
Methodik: Alle 110 Demodateien und 64 zugehörigen Prompts stammen aus Alibabas offiziellem Wan 3.0 Creator Handbook, lokal archiviert am 11. August 2026. Metadaten wurden Datei für Datei mit ffmpeg ausgelesen; Shot-Anzahlen stammen aus der ffmpeg-Szenenwechselerkennung bei einem Schwellenwert von 0,2, gegengeprüft mit extrahierten Frames; die Prompt-Struktur wurde programmatisch analysiert. Atlas Cloud Preise wurden am 21. August 2026 gegen den Live-Modellkatalog verifiziert.
Quellen: Alibaba Cloud (August 2026); Curious Refuge (2026).






