Neuestes Update: Wan 3.0 ist seit dem 24. August 2026 live.
Du hast sechs Tabs geöffnet. Jeder einzelne hat dir eine saubere Tabelle gezeigt: 1,3B auf 8GB, 14B auf 24GB, Apache-2.0, ausgeliefert im April 2026. Also hast du die Wan-AI-Seite auf Hugging Face geöffnet, um den Checkpoint herunterzuladen.
27 Repositories. Das neueste ist Wan2.2.
Diese Tabellen sind nicht veraltet. Sie wurden erfunden. Die Wan 3.0 VRAM-Anforderungen können von niemandem außerhalb von Alibaba gemessen worden sein, denn Wan 3.0 ist erst am 6. August 2026 in die öffentliche Beta gegangen und hat nie eine Gewichtsdatei veröffentlicht. Es gab nichts im April zu veröffentlichen.
Was ist also die richtige Antwort? Niemand hat es getestet. Aber das eigene Datenblatt von Wan 3.0 grenzt die Antwort hart ein, und wir haben diese Rechnung unten durchgeführt.
Wichtigste Erkenntnisse
- Es gibt nirgendwo Wan 3.0-Gewichte. Jede VRAM-Tabelle dafür im Internet ist heute fabriziert.
- Wan 3.0 ist eine First-Party-API-Beta: max. 30s, max. 1080P, keine 4K-Stufe.
- Die eigenen Spezifikationen implizieren die 13,5-fache Latenzsequenz eines 5s-720P-Clips, was eine Aufmerksamkeitsrechnung von ~180x ergibt.
- Die derzeitige reale lokale Obergrenze ist Wan2.2 TI2V-5B auf 24GB, oder 6GB mit Community-Quantisierung.
- Für 1080P-Ausgabe diese Woche: Miete Sekunden statt VRAM zu kaufen.

Wan VRAM-Anforderungen sichtbar gemacht: Der gleiche erste Frame animiert auf der 720P-Stufe links und auf der 1080P-Stufe rechts, beide ohne lokale GPU gerendert
Gleicher erster Frame, gleicher Bewegungs-Prompt, gleiches Modell. Nur die Auflösungsstufe ändert sich: 720P links für $0,50 für 5 Sekunden, 1080P rechts für $0,75. Beide wurden auf Wan 2.7 ohne lokales VRAM gerendert, und der Preis auf jedem Etikett ist das Angebot, das der Run-Button uns tatsächlich gegeben hat. Dargestellt als stummes GIF.
Darum geht es in dieser ganzen Diskussion. Nicht Gigabytes. Pixel.
Warum jede Tabelle zu den Wan 3.0 VRAM-Anforderungen, die du gefunden hast, Fiktion ist
Zuerst das Fazit: Die am besten platzierten Seiten für dieses Keyword haben Wan 2.1- und Wan 2.2-Zahlen recycelt, „3.0“ draufgeklebt und ein Veröffentlichungsdatum erfunden. Du kannst das alles in etwa 60 Sekunden widerlegen.
Schau dir das an.

Die offizielle Wan-AI-Organisation auf Hugging Face, Reiter „Modelle“, sortiert nach Neueste zuerst. 27 Repos, und die höchste Versionsnummer auf der gesamten Liste ist 2.2 (Hugging Face, August 2026).
Es gibt kein Wan3.0-Repo. Es gibt auch kein Wan2.7-, Wan2.6- oder Wan2.5-Repo. Das Neueste in der Organisation ist Wan2.2-Animate-2-14B-Diffusers, vor sieben Tagen aktualisiert (Hugging Face, August 2026).
Hier die Aufschlüsselung Anspruch für Anspruch.
Tabelle 1: Was die Anleitungen behaupten vs. was überprüfbar ist
| Behauptung, die du auf Seite 1 findest | Überprüfbar Stand August 2026 | So überprüfst du es selbst |
|---|---|---|
| "Wan 3.0 hat 1,3B- + 14B-Gewichte im April 2026 veröffentlicht" | Wan 3.0 hat am 6. August 2026 die öffentliche Beta gestartet. Keine Gewichte zu irgendeinem Datum. | Lade die Wan-AI-Organisationsseite |
| "Wan 3.0 ist Apache-2.0" | Es wurde nie eine Lizenzdatei für 3.0 veröffentlicht | Suche in der Org nach einem 3.0-Repo. Es gibt keins. |
| "1,3B läuft auf 8GB, 14B auf 24GB" | Das sind Wan 2.1/2.2-Zahlen. Wan 2.2's eigenes A14B verlangt 80GB. | Der Hardware-Abschnitt der Wan2.2 README |
| "Volle 4K/30s-Workflow-Stufe" | Die Beta endet bei 1080P. Stufen sind 480P, 720P, 1080P. | Alibabas eigene Preisliste pro Sekunde |
| "Läuft heute in ComfyUI / WanGP" | WanGPs unterstützte Liste umfasst nur Wan 2.1/2.2 | Die Wan2GP README |
Was Alibaba im August 2026 tatsächlich ausgeliefert hat, ist ein API-und-Web-Produkt, kein Checkpoint. Eine Generierung geht bis zu 30 Sekunden, die Auflösung ist auf 1080P begrenzt, und es akzeptiert Text, Bilder, Audio, Video und sogar Dokumente (doc, xls, ppt, pdf, md) als Referenzeingabe. Die API-Preise betragen ¥0,3 / ¥0,6 / ¥1,2 pro Sekunde für 480P / 720P / 1080P (QbitAI, August 2026).
Beachte, was in dieser Liste fehlt: ein Download-Link.
Wan 3.0 VRAM-Anforderungen, berechnet aus den eigenen Spezifikationen
Versprechen: Am Ende dieses Abschnitts weißt du, warum „Hol dir einfach eine 32GB-Karte“ nicht funktionieren kann, mit Zahlen, die du selbst nachvollziehen kannst. Beweis: Die Berechnung benötigt nur zwei veröffentlichte Fakten, Wan's VAE-Komprimierungsverhältnis und Wan 3.0's 1080P/30s-Obergrenze.
Lass uns loslegen.
Es ist die Sequenzlänge, nicht die Anzahl der Parameter. Jeder starrt auf die B-Zahl. Das ist die falsche Variable.
Der Speicher- und Rechenaufwand eines Video-Diffusion-Transformers skaliert mit der Anzahl latenter Token, über die er Aufmerksamkeit aufbringen muss, und diese Anzahl ergibt sich aus Auflösung mal Dauer, nicht aus Parametern. Wan2.2's VAE komprimiert mit 4x16x16 in Zeit, Höhe und Breite, und der DiT patchifiziert zusätzlich, sodass jeder latente Token ungefähr einen 4x32x32-Pixel-Block abdeckt (Wan2.2 README, August 2026). Die ältere Wan2.1-Generation VAE komprimiert mit 4x8x8, also mit Patchifizierung sind es 4x16x16 pro Token, viermal so viele Token für denselben Clip.
Setze Wan 3.0's eigene Obergrenze in diese Berechnung ein, und das ist das Ergebnis.
Tabelle 2: Anzahl latenter Token nach Zielclip (unsere Berechnung, 24fps)
| Zielclip | Frames | Latente Frames | Token (2.2-Gen VAE) | Token (2.1-Gen VAE) | vs 5s 720P |
|---|---|---|---|---|---|
| 5s 480P (832x480) | 121 | 31 | 12.090 | 48.360 | 0,44x |
| 5s 720P (1280x704) | 121 | 31 | 27.280 | 109.120 | 1,0x (Basis) |
| 10s 1080P (1920x1088) | 241 | 61 | 124.440 | 497.760 | 4,6x |
| 30s 1080P (1920x1088) | 721 | 181 | 369.240 | 1.476.960 | 13,5x |
Lies die letzte Zeile noch einmal. Die Hauptfähigkeit von Wan 3.0 ist die 13,5-fache Sequenzlänge des 5-Sekunden-720P-Clips, über den deine 4090 derzeit schwitzt.
Und Selbstaufmerksamkeit ist quadratisch in der Sequenzlänge. 13,5 zum Quadrat ist etwa 180. Die Aufmerksamkeitsarbeit für einen 30s-1080P-Clip ist also ungefähr 180x die Aufmerksamkeitsarbeit eines 5s-720P-Clips, bevor du irgendetwas anderes zählst.
Das ist die Zahl, die niemand in den SERP berechnet hat. Es ist auch der Grund, warum „kaufe 8 weitere Gigabyte“ kein Plan ist.
Was bedeutet das also in Gigabytes? Gewichte sind der langweilige Teil. Ein 27B-MoE in fp8 belegt etwa 27GB, bf16 etwa 54GB. MoE hilft nur bei der Berechnung pro Schritt (Wan2.2's A14B aktiviert 14B von 27B Parametern pro Schritt), nicht bei dem, was im Speicher bleiben muss.
Der interessante Teil sind die Aktivierungen. Der verborgene Zustand einer Transformator-Schicht bei Modelldim 5120 in bf16 kostet Tokens x 5120 x 2 Bytes:
- 5s 720P (27.280 Token): 0,28 GB pro Schicht
- 30s 1080P (369.240 Token): 3,8 GB pro Schicht
- 30s 1080P auf einer VAE der 2.1-Generation (1.476.960 Token): 15,1 GB pro Schicht
Pro Schicht. Multipliziere mit der Anzahl der Schichten, die deine Aufmerksamkeitsimplementierung aktiv halten muss, addiere den Text-Encoder, den VAE-Dekodierungsdurchlauf, und die 80GB-Zahl hört auf, konservativ auszusehen.
Tabelle 3: geschätztes VRAM, falls Gewichte jemals veröffentlicht werden (SCHÄTZUNG, nicht gemessen)
| Zielclip | Wenn ein 5B-Klasse-Hochkompressionsmodell ausgeliefert wird (fp8) | Wenn es ein A14B-Klasse-MoE (fp8) ist | Praktisches Fazit |
|---|---|---|---|
| 5s 480P | ~8-10 GB | ~30-34 GB | eine 12GB-Karte ist nur für das kleine Modell plausibel |
| 5s 720P | ~10-14 GB | ~34-40 GB | 16GB Minimum, 24GB komfortabel |
| 10s 1080P | ~20-28 GB | ~45-60 GB | eine 32GB-Karte ist bereits grenzwertig |
| 30s 1080P | ~45-70 GB | ~90-140 GB | keine einzelne Consumer-Karte, bei keiner Quantisierung |
Jede Zelle in dieser Tabelle ist eine SCHÄTZUNG, abgeleitet aus Tabelle 2 plus veröffentlichten Checkpoint-Größen. Tatsächliche Zahlen hängen vom Attention-Kernel, der Auslagerungsstrategie und davon ab, ob Alibaba jemals Gewichte veröffentlicht. Behandle es als die Form des Problems, nicht als Datenblatt.
Die Form ist klar genug: Die Flaggschiff-Einstellung war nie eine Consumer-GPU-Arbeitslast.
Die Wan VRAM-Anforderungen, die du heute tatsächlich erreichen kannst
Hier ist der Teil, den die fabrizierten Tabellen vorgaben zu sein. Diese Zahlen sind vom Wan-Team veröffentlicht und sie sind real.
Tabelle 4: echte Wan VRAM-Stufen, August 2026
| Variante | Minimales VRAM | Auflösung | Gemessene Geschwindigkeit | Flags, die du benötigst | Gewichte |
|---|---|---|---|---|---|
| Wan2.2 T2V-A14B / I2V-A14B | 80GB single GPU | 480P / 720P | nicht veröffentlicht | --offload_model True --convert_model_dtype | Apache-2.0 |
| Wan2.2 TI2V-5B | 24GB (RTX 4090) | 720P @ 24fps | 5s 720P in unter 9 Minuten | --offload_model True --convert_model_dtype --t5_cpu | Apache-2.0 |
| Wan 2.1 / 2.2 via WanGP | 6GB und mehr | hauptsächlich 480P | langsamer, Qualitätseinbußen | int8 / fp8 / gguf / NVFP4 / Nunchaku | Apache-2.0 Basis |
| Wan 2.5 / 2.6 / 2.7 | n/a | Nur API | n/a | n/a | keine veröffentlicht |
| Wan 3.0 | n/a | Nur API, First-Party-Beta | n/a | n/a | keine veröffentlicht |
Zwei Dinge in dieser Tabelle verdienen einen zweiten Blick.
Erstens: Die A14B-Zeile hat bereits beide Speicherspar-Flags aktiviert und benötigt trotzdem 80GB. Das ist die offizielle Single-GPU-Zahl, keine naive. Zweitens: Die 5B-Zeile ist die ehrliche Consumer-Antwort, und ihre eigene README gibt 5 Sekunden 720P in unter 9 Minuten auf einer 4090 an.
Unter 24GB bist du im Community-Bereich. WanGP (das deepbeepmeep/Wan2GP-Projekt, das sich selbst als generative Modelle „zugänglich für die GPU-Armen“ beschreibt) bringt ausgewählte Modelle mit int8, fp8, gguf, NVFP4 und Nunchaku-Quantisierung auf 6GB herunter. Es unterstützt Wan 2.1 und 2.2. Es unterstützt nicht 3.0, weil es nichts zu unterstützen gibt.
Jetzt der Teil, der deine Kaufentscheidung ändern sollte: Die Annahme „die nächste Version wird offen sein“ ist drei Mal in Folge gescheitert. Wan 2.2 war Apache-2.0. Wan 2.5 wurde nur API. Wan 2.6 und 2.7 haben nie Gewichte veröffentlicht. Wan 3.0 hat überhaupt keine Lizenzdatei.
Eine Karte heute auf die Wette zu kaufen, dass morgen 3.0-Gewichte erscheinen, ist eine Wette gegen einen Drei-Generationen-Trend.
Für einen aktuellen gehosteten Lauf öffne Wan 3.0 auf Atlas Cloud und teste einen Prompt wie den untenstehenden, bevor du den Workflow veröffentlichst.

Wan 3.0 Prompt-zu-Ergebnis Screenshot: Kein-GPU-Rendering-Pfad.
Überspringe die VRAM-Anforderungen: Der Wan-Workflow ohne GPU
Lass mich zuerst die Grenze klar benennen, denn die meisten Seiten in dieser Nische werden das nicht tun.
Niemand hostet Wan 3.0. Weder Atlas Cloud noch sonst jemand. Es gibt keine Gewichte, also gibt es keine Drittanbieter-Inferenz. Wenn eine Seite dir „Wan 3.0 API-Zugriff“ anbietet, verkauft sie dir etwas anderes.
Was du jetzt bekommen kannst, ist der Rest der Familie, gehostet, sekundengenau abgerechnet, ohne VRAM in der Gleichung. Atlas Cloud betreibt Wan 2.2 bis 2.7 hinter einer API und einem Browser-Tab, und Wan 2.7 bei 1080P ist das Nächstliegende zu 3.0-Klasse-Ausgabe, das außerhalb von Alibabas eigenen Beta-Kanälen verfügbar ist.
Für den Leser, für den dieser Artikel geschrieben ist, löst das ein spezifisches Problem. Du warst kurz davor, einen vierstelligen Betrag für eine Karte auszugeben, um einem Checkpoint hinterherzujagen, der nicht existiert. Sekunden zu mieten bedeutet, dass du herausfindest, wie die Ausgabe tatsächlich aussieht, bevor du etwas kaufst, und wenn 3.0-Gewichte nie fallen, hast du nichts verloren außer ein paar Dollar.
Tabelle 5: Die gehostete Wan-Familie (Listenpreise Stand August 2026)
| Modell-ID | Auflösung | Maximale Dauer | Preis | Am besten geeignet für |
|---|---|---|---|---|
| atlascloud/wan-2.2-turbo/image-to-video | 480p / 720p / 1080p, 30fps | nur 5s | $0,02 / s | günstigster Test in der Familie |
| atlascloud/wan-2.2/image-to-video | 480P nativ + 720P VSR | 3-10s | $0,03 / s | Budget-Batches |
| alibaba/wan-2.5/text-to-video | bis zu 1920x1080 | 10s | $0,035 / s | günstiges 1080P Text-zu-Video |
| alibaba/wan-2.6/text-to-video | bis zu 1920x1080 | 5 / 10 / 15s | $0,07 / s | längere Aufnahmen, kein erster Frame nötig |
| alibaba/wan-2.7/image-to-video | 720P / 1080P, plus 1080P-SR und 1440P-SR | 15s | $0,10 / s Liste | die der 3.0-Klasse-Ausgabe nächstgelegene Stufe |
| alibaba/wan-2.2/animate-mix | Charakteraustausch in vorhandenem Material | entspricht deinem Quellclip | $0,126 / s | Austausch eines Charakters in einer Einstellung |
Eine Warnung vor dem Tutorial, denn sie wird auf deiner Rechnung erscheinen: Der Listenpreis ist eine Untergrenze. Die Seite von Wan 2.7 gibt $0,10 pro Sekunde an. In unseren Läufen im August 2026 wurde derselbe Fünf-Sekunden-Job mit $0,50 auf der 720P-Stufe und $0,75 auf 1080P angeboten, die Flaggschiff-Stufe wird also mit $0,15 pro Sekunde abgerechnet, dem Anderthalbfachen des angegebenen Satzes. Lies immer das Angebot, das der Button dir gibt, bevor du klickst.
Tabelle 6: Vier Wege zu 30 Sekunden 1080P
| Route | Investition vorab | Pro 30s 1080P | Bekommst du es tatsächlich? |
|---|---|---|---|
| Kaufe eine 24GB-Karte (4090-Klasse) | ~$1.600-2.000 | Strom | Nein. 24GB läuft Wan2.2 TI2V-5B bei 720P. Es gibt keine 3.0-Gewichte. |
| Miete eine 80GB-Karte | stündlich | Stunden Rechenzeit + Einrichtung | Nur Wan 2.2 A14B, und immer noch kein 1080P/30s |
| Alibaba First-Party-Beta | keine | ¥1,2/s x 30 = ¥36 (~$5) | Ja, ein durchgehender Clip, nur First-Party-Kanäle |
| Gehostetes Wan 2.7 bei 1080P | keine | 2 x 15s bei ~$0,15/s = ~$4,50 | 30s Filmmaterial, aber als zwei Clips (15s-Limit) |
Mach die Division. Bei etwa $4,50 pro 30 Sekunden 1080P benötigt eine $2.000-Karte etwa 440 Dreißig-Sekunden-Renderings, um die Gewinnschwelle zu erreichen, und sie kann trotzdem kein einziges davon produzieren.
Das ist das Argument. Hier ist nun der Drei-Schritte-Lauf, damit du die Ausgabe selbst beurteilen kannst.
Schritt 1: Fixiere den ersten Frame in 16:9
Jeder ehrliche VRAM-Vergleich braucht eine Variable. Also fixieren wir den ersten Frame, dann geben wir den identischen Frame und den identischen Bewegungs-Prompt in beide Stufen. Jeder Unterschied, den du danach siehst, ist die Stufe, nicht der Zufall.
Öffne die Qwen Image 2.0 Pro Text-zu-Bild-Spielwiese und füge dies ein:
text1Cinematic Weitwinkelaufnahme in einem dunklen Home-Office um 2 Uhr morgens: Ein junger Ingenieur in einem grauen Hoodie lehnt sich in einem Schreibtischstuhl zurück, das Gesicht nur von einem Triple-Monitor-Setup beleuchtet, das eine pausierte Video-Timeline zeigt. Neben dem Schreibtisch leuchtet ein offenes PC-Gehäuse, eine einzelne übergroße Grafikkarte sichtbar im Inneren, Lüfter drehen sich. Staubpartikel in der Luft, Teal- und Amber-Farbgebung, geringe Tiefenschärfe, 35mm anamorphotisches Objektiv, fotorealistisch, hochdetailliert, 16:9 2
Einstellungen: Klicke auf den 16:9-Größen-Chip, der den Frame auf 1280 x 720 setzt, und lasse alles andere standardmäßig. Die Kosten betragen $0,06 pro Bild (derzeit 20 % Rabatt von $0,075). Die Breiten- und Höhenfelder gehen bis zu 2048 pro Seite, wenn du einen größeren Frame möchtest, aber der Standard des Chips ist bereits die richtige Form für beide Video-Stufen.
Warum diese Szene? Weil sie buchstäblich der Leser ist. Behalte die Ausgabedatei, du brauchst sie zweimal.

Qwen Image 2.0 Pro Spielwiese auf Atlas Cloud mit dem 16:9-Größen-Chip ausgewählt und dem fertigen 1280x720 ersten Frame im Ausgabebereich
Schritt 1 abgeschlossen: Der 16:9-Chip ausgewählt bei 1280 x 720, und der erste Frame, von dem beide Video-Stufen ausgehen werden. $0,06 auf dem Run-Button.
Schritt 2: Animieren auf der 720P VRAM-Stufe
Dies ist der Platzhalter dafür, was ein echtes lokales 24GB-Setup dir bietet: 720P, fünf Sekunden, und das ist die Obergrenze.
Eine bewusste Entscheidung hier. Anstatt zwischen den beiden Stufen die Modelle zu wechseln, führen wir das gleiche Modell auf beiden aus, sodass die einzige Variable im Vergleich die Auflösungsstufe ist. Lade das Bild aus Schritt 1 als ersten Frame in die Wan 2.7 Bild-zu-Video-Spielwiese, dann füge diesen Bewegungs-Prompt ein:
text1Der Ingenieur beugt sich langsam vor und reibt sich die Augen; das Monitorlicht flackert, während die Timeline durchläuft; die Kamera fährt leicht ein; Staubpartikel treiben durch den Lichtstrahl; subtiles Handkamera-Mikro-Wackeln; durchgehende Einstellung, keine Schnitte. 2
Einstellungen: Auflösung 720P, Dauer 5s, alles andere standardmäßig. Der Run-Button bot $0,50 an, was dem Listenpreis von $0,10 pro Sekunde mal fünf Sekunden entspricht. Notiere dir diese Zahl, denn Schritt 3 wird sie ändern.

Wan 2.7 Bild-zu-Video Spielwiese auf der 720P-Stufe mit geladenem erstem Frame, 5s Dauer und dem fertigen Clip im Ausgabebereich
Schritt 2 abgeschlossen: die 720P-Stufe, 5 Sekunden, Angebot $0,50, mit einem echten Clip im Ausgabebereich.
Schritt 3: Animieren des gleichen Frames bei 1080P ohne lokale GPU
Gleiche Seite, gleicher erster Frame, gleicher Bewegungs-Prompt wortwörtlich, gleiche 5-Sekunden-Dauer. Ändere genau eine Steuerung: Setze die Auflösung auf 1080P.
Das Run-Angebot steigt von $0,50 auf $0,75. Das sind deine $0,15 pro Sekunde, gemessen, auf einer Seite, deren Listenpreis $0,10 angibt.
Zwei Einstellungsfallen, auf die du achten musst, die uns beide richtige Läufe gekostet haben, um sie zu lernen:
- Die Dauer-Steuerung übernimmt nicht immer. Wir haben die Dauer auf 10 Sekunden gesetzt, das Feld zeigte 10 an, und der Job rendert trotzdem 5. Das Angebot des Run-Buttons ist die einzige Quelle der Wahrheit: Bei $0,15 pro Sekunde müsste ein echter 10-Sekunden-1080P-Job etwa $1,50 betragen, also bedeutet ein Angebot von $0,75, dass du immer noch 5 Sekunden kaufst, egal was der Schieberegler anzeigt. Lies das Angebot, nicht das Feld.
- Bestätige, dass dein eigenes Bild geladen ist. Wenn der Referenz-Slot immer noch das voreingestellte Demo-Bild der Seite enthält, wird der Lauf fröhlich etwas Unzusammenhängendes produzieren. Schau auf das Thumbnail, bevor du klickst.

Wan 2.7 Bild-zu-Video Spielwiese auf der 1080P-Stufe mit dem Run-Button, der $0,75 anbietet, und dem fertigen 1080P-Clip im Ausgabebereich
Schritt 3 abgeschlossen auf der 1080P-Stufe. Das Run-Angebot ist der Punkt: $0,75 für die gleichen fünf Sekunden, die eine Stufe tiefer $0,50 kosteten, auf einer Seite, die $0,10 pro Sekunde angibt.
Beide Renderings sind im Clip oben in diesem Artikel, nebeneinander. Das ist das gesamte VRAM-Argument in fünf Sekunden: zwei Stufen der Ausgabe, der gleiche Prompt, und kein einziges Gigabyte lokalen Videospeichers involviert.
Variationen, die einen Versuch wert sind. Gehe auf 480P für günstige Testläufe, bevor du dich für einen 1080P-Render entscheidest. Tausche alibaba/wan-2.6/text-to-video für $0,07/s ein, wenn du keinen ersten Frame hast und 15 Sekunden auf einmal möchtest. Verwende alibaba/wan-2.2/animate-mix für $0,126/s, um einen anderen Charakter in bereits vorhandenes Material einzufügen. Und wenn du näher an 30 Sekunden kommen möchtest, budgetiere für zwei Clips, wegen eines 15-Sekunden-Limits pro Clip, das fast kein Tutorial erwähnt.
Häufig gestellte Fragen
Kann eine 24GB-GPU Wan 3.0 ausführen?
Heute nicht, weil es keine Gewichte zum Laden gibt. Falls sie jemals veröffentlicht werden, sagt die Mathematik in Tabelle 2, dass 24GB dir 480P und kurze Clips unter aggressiver Quantisierung ermöglicht. Die Flaggschiff-Einstellung 1080P/30s ist eine andere Größenordnung und auf einer einzelnen Consumer-Karte nicht erreichbar.
Wo kann ich Wan 3.0-Gewichte herunterladen?
Nirgendwo. Die Wan-AI-Organisation auf Hugging Face endet bei Wan2.2, und die Wan-Video GitHub-Org hat kein 3.0-Inferenz-Repo und keine 3.0-Lizenz. Jede Seite, die einen „Wan 3.0 Checkpoint-Download“ anbietet, verteilt nicht, was sie behauptet.
Ist Wan 3.0 Open Source oder Apache 2.0?
Es wurde keine Lizenz veröffentlicht. Der Trend geht in die andere Richtung: Wan 2.2 war Apache-2.0, Wan 2.5 wurde nur API, und 2.6 und 2.7 haben überhaupt keine Gewichte veröffentlicht. Drei aufeinanderfolgende Generationen geschlossen. Plane entsprechend.
Was ist das Wan-Modell mit dem geringsten VRAM, das ich heute tatsächlich ausführen kann?
Wan2.2 TI2V-5B, offiziell 24GB auf einer 4090, macht 5s 720P in unter 9 Minuten. Darunter erreichen WanGPs quantisierte Pfade bis zu 6GB bei ausgewählten Modellen, und du bezahlst dafür mit Geschwindigkeit und Detail.
Wan 3.0 vs Wan 2.7: Welches kann ich lokal ausführen?
Keines. Beide sind nur API. Wenn die Anforderung „läuft auf meinem Rechner“ ist, sind deine Optionen die Wan 2.1- und 2.2-Familien. Wenn die Anforderung 2.7-Klasse-Ausgabe ist, ist das ein gehosteter Aufruf, keine lokale Installation.
Wenn ich es nicht lokal ausführen kann, wie bekomme ich jetzt 30 Sekunden 1080P?
Alibabas First-Party-Beta rechnet sekundengenau ab und liefert 30s in einem Clip. Außerhalb dieser Kanäle gibt es ein hartes 15-Sekunden-Limit pro Clip, also bedeutet 30 Sekunden das Zusammenfügen von zwei. In unseren eigenen Wan 2.7-Fortsetzungstests waren die Beschränkungen streng: Das Quellsegment musste 2 bis 10 Sekunden betragen, die Ausgabe musste strikt länger als die Quelle sein, die Quell-Frames wurden nicht beibehalten, und das Verketten von Fortsetzungen hat die Länge nicht erhöht. Die meisten Tutorials erwähnen nichts davon.
Also die Kurzversion der gesamten Wan 3.0 VRAM-Anforderungen-Frage: Hör auf, nach einer Karte zu suchen, denn der Checkpoint, für den du sie kaufen würdest, existiert nicht. Führe Wan 2.2 lokal aus, wenn du Gewichte auf der Festplatte haben möchtest, und miete 1080P-Sekunden, wenn du die Ausgabe möchtest, die die falschen Tabellen verkauft haben.






