MiniMax H3 Developer jetzt live — 60% Rabatt, ab 0,02 $ pro Sekunde

Wan 3.0 VRAM-Anforderungen: Warum 80 GB nicht ausreichen, und was heute tatsächlich läuft

Wan 3.0 VRAM-Anforderungen, berechnet aus seinen eigenen 1080P/30s-Spezifikationen: 13,5x die Sequenzlänge, keine öffentlichen Gewichte und die lokalen Wan-Stufen, die heute laufen.

Neuestes Update: Wan 3.0 ist seit dem 24. August 2026 live.

Du hast sechs Tabs geöffnet. Jeder einzelne hat dir eine saubere Tabelle gezeigt: 1,3B auf 8GB, 14B auf 24GB, Apache-2.0, ausgeliefert im April 2026. Also hast du die Wan-AI-Seite auf Hugging Face geöffnet, um den Checkpoint herunterzuladen.

27 Repositories. Das neueste ist Wan2.2.

Diese Tabellen sind nicht veraltet. Sie wurden erfunden. Die Wan 3.0 VRAM-Anforderungen können von niemandem außerhalb von Alibaba gemessen worden sein, denn Wan 3.0 ist erst am 6. August 2026 in die öffentliche Beta gegangen und hat nie eine Gewichtsdatei veröffentlicht. Es gab nichts im April zu veröffentlichen.

Was ist also die richtige Antwort? Niemand hat es getestet. Aber das eigene Datenblatt von Wan 3.0 grenzt die Antwort hart ein, und wir haben diese Rechnung unten durchgeführt.

Wichtigste Erkenntnisse

  • Es gibt nirgendwo Wan 3.0-Gewichte. Jede VRAM-Tabelle dafür im Internet ist heute fabriziert.
  • Wan 3.0 ist eine First-Party-API-Beta: max. 30s, max. 1080P, keine 4K-Stufe.
  • Die eigenen Spezifikationen implizieren die 13,5-fache Latenzsequenz eines 5s-720P-Clips, was eine Aufmerksamkeitsrechnung von ~180x ergibt.
  • Die derzeitige reale lokale Obergrenze ist Wan2.2 TI2V-5B auf 24GB, oder 6GB mit Community-Quantisierung.
  • Für 1080P-Ausgabe diese Woche: Miete Sekunden statt VRAM zu kaufen. comparison 768p vs 2k

Wan VRAM-Anforderungen sichtbar gemacht: Der gleiche erste Frame animiert auf der 720P-Stufe links und auf der 1080P-Stufe rechts, beide ohne lokale GPU gerendert

Gleicher erster Frame, gleicher Bewegungs-Prompt, gleiches Modell. Nur die Auflösungsstufe ändert sich: 720P links für $0,50 für 5 Sekunden, 1080P rechts für $0,75. Beide wurden auf Wan 2.7 ohne lokales VRAM gerendert, und der Preis auf jedem Etikett ist das Angebot, das der Run-Button uns tatsächlich gegeben hat. Dargestellt als stummes GIF.

Darum geht es in dieser ganzen Diskussion. Nicht Gigabytes. Pixel.

Warum jede Tabelle zu den Wan 3.0 VRAM-Anforderungen, die du gefunden hast, Fiktion ist

Zuerst das Fazit: Die am besten platzierten Seiten für dieses Keyword haben Wan 2.1- und Wan 2.2-Zahlen recycelt, „3.0“ draufgeklebt und ein Veröffentlichungsdatum erfunden. Du kannst das alles in etwa 60 Sekunden widerlegen.

Schau dir das an.

Hugging Face Profilseite für Wan-AI mit Auflistung ihrer KI-Modelle

Die offizielle Wan-AI-Organisation auf Hugging Face, Reiter „Modelle“, sortiert nach Neueste zuerst. 27 Repos, und die höchste Versionsnummer auf der gesamten Liste ist 2.2 (Hugging Face, August 2026).

Es gibt kein Wan3.0-Repo. Es gibt auch kein Wan2.7-, Wan2.6- oder Wan2.5-Repo. Das Neueste in der Organisation ist Wan2.2-Animate-2-14B-Diffusers, vor sieben Tagen aktualisiert (Hugging Face, August 2026).

Hier die Aufschlüsselung Anspruch für Anspruch.

Tabelle 1: Was die Anleitungen behaupten vs. was überprüfbar ist

Behauptung, die du auf Seite 1 findestÜberprüfbar Stand August 2026So überprüfst du es selbst
"Wan 3.0 hat 1,3B- + 14B-Gewichte im April 2026 veröffentlicht"Wan 3.0 hat am 6. August 2026 die öffentliche Beta gestartet. Keine Gewichte zu irgendeinem Datum.Lade die Wan-AI-Organisationsseite
"Wan 3.0 ist Apache-2.0"Es wurde nie eine Lizenzdatei für 3.0 veröffentlichtSuche in der Org nach einem 3.0-Repo. Es gibt keins.
"1,3B läuft auf 8GB, 14B auf 24GB"Das sind Wan 2.1/2.2-Zahlen. Wan 2.2's eigenes A14B verlangt 80GB.Der Hardware-Abschnitt der Wan2.2 README
"Volle 4K/30s-Workflow-Stufe"Die Beta endet bei 1080P. Stufen sind 480P, 720P, 1080P.Alibabas eigene Preisliste pro Sekunde
"Läuft heute in ComfyUI / WanGP"WanGPs unterstützte Liste umfasst nur Wan 2.1/2.2Die Wan2GP README

Was Alibaba im August 2026 tatsächlich ausgeliefert hat, ist ein API-und-Web-Produkt, kein Checkpoint. Eine Generierung geht bis zu 30 Sekunden, die Auflösung ist auf 1080P begrenzt, und es akzeptiert Text, Bilder, Audio, Video und sogar Dokumente (doc, xls, ppt, pdf, md) als Referenzeingabe. Die API-Preise betragen ¥0,3 / ¥0,6 / ¥1,2 pro Sekunde für 480P / 720P / 1080P (QbitAI, August 2026).

Beachte, was in dieser Liste fehlt: ein Download-Link.

Wan 3.0 VRAM-Anforderungen, berechnet aus den eigenen Spezifikationen

Versprechen: Am Ende dieses Abschnitts weißt du, warum „Hol dir einfach eine 32GB-Karte“ nicht funktionieren kann, mit Zahlen, die du selbst nachvollziehen kannst. Beweis: Die Berechnung benötigt nur zwei veröffentlichte Fakten, Wan's VAE-Komprimierungsverhältnis und Wan 3.0's 1080P/30s-Obergrenze.

Lass uns loslegen.

Es ist die Sequenzlänge, nicht die Anzahl der Parameter. Jeder starrt auf die B-Zahl. Das ist die falsche Variable.

Der Speicher- und Rechenaufwand eines Video-Diffusion-Transformers skaliert mit der Anzahl latenter Token, über die er Aufmerksamkeit aufbringen muss, und diese Anzahl ergibt sich aus Auflösung mal Dauer, nicht aus Parametern. Wan2.2's VAE komprimiert mit 4x16x16 in Zeit, Höhe und Breite, und der DiT patchifiziert zusätzlich, sodass jeder latente Token ungefähr einen 4x32x32-Pixel-Block abdeckt (Wan2.2 README, August 2026). Die ältere Wan2.1-Generation VAE komprimiert mit 4x8x8, also mit Patchifizierung sind es 4x16x16 pro Token, viermal so viele Token für denselben Clip.

Setze Wan 3.0's eigene Obergrenze in diese Berechnung ein, und das ist das Ergebnis.

Tabelle 2: Anzahl latenter Token nach Zielclip (unsere Berechnung, 24fps)

ZielclipFramesLatente FramesToken (2.2-Gen VAE)Token (2.1-Gen VAE)vs 5s 720P
5s 480P (832x480)1213112.09048.3600,44x
5s 720P (1280x704)1213127.280109.1201,0x (Basis)
10s 1080P (1920x1088)24161124.440497.7604,6x
30s 1080P (1920x1088)721181369.2401.476.96013,5x

Lies die letzte Zeile noch einmal. Die Hauptfähigkeit von Wan 3.0 ist die 13,5-fache Sequenzlänge des 5-Sekunden-720P-Clips, über den deine 4090 derzeit schwitzt.

Und Selbstaufmerksamkeit ist quadratisch in der Sequenzlänge. 13,5 zum Quadrat ist etwa 180. Die Aufmerksamkeitsarbeit für einen 30s-1080P-Clip ist also ungefähr 180x die Aufmerksamkeitsarbeit eines 5s-720P-Clips, bevor du irgendetwas anderes zählst.

Das ist die Zahl, die niemand in den SERP berechnet hat. Es ist auch der Grund, warum „kaufe 8 weitere Gigabyte“ kein Plan ist.

Was bedeutet das also in Gigabytes? Gewichte sind der langweilige Teil. Ein 27B-MoE in fp8 belegt etwa 27GB, bf16 etwa 54GB. MoE hilft nur bei der Berechnung pro Schritt (Wan2.2's A14B aktiviert 14B von 27B Parametern pro Schritt), nicht bei dem, was im Speicher bleiben muss.

Der interessante Teil sind die Aktivierungen. Der verborgene Zustand einer Transformator-Schicht bei Modelldim 5120 in bf16 kostet Tokens x 5120 x 2 Bytes:

  • 5s 720P (27.280 Token): 0,28 GB pro Schicht
  • 30s 1080P (369.240 Token): 3,8 GB pro Schicht
  • 30s 1080P auf einer VAE der 2.1-Generation (1.476.960 Token): 15,1 GB pro Schicht

Pro Schicht. Multipliziere mit der Anzahl der Schichten, die deine Aufmerksamkeitsimplementierung aktiv halten muss, addiere den Text-Encoder, den VAE-Dekodierungsdurchlauf, und die 80GB-Zahl hört auf, konservativ auszusehen.

Tabelle 3: geschätztes VRAM, falls Gewichte jemals veröffentlicht werden (SCHÄTZUNG, nicht gemessen)

ZielclipWenn ein 5B-Klasse-Hochkompressionsmodell ausgeliefert wird (fp8)Wenn es ein A14B-Klasse-MoE (fp8) istPraktisches Fazit
5s 480P~8-10 GB~30-34 GBeine 12GB-Karte ist nur für das kleine Modell plausibel
5s 720P~10-14 GB~34-40 GB16GB Minimum, 24GB komfortabel
10s 1080P~20-28 GB~45-60 GBeine 32GB-Karte ist bereits grenzwertig
30s 1080P~45-70 GB~90-140 GBkeine einzelne Consumer-Karte, bei keiner Quantisierung

Jede Zelle in dieser Tabelle ist eine SCHÄTZUNG, abgeleitet aus Tabelle 2 plus veröffentlichten Checkpoint-Größen. Tatsächliche Zahlen hängen vom Attention-Kernel, der Auslagerungsstrategie und davon ab, ob Alibaba jemals Gewichte veröffentlicht. Behandle es als die Form des Problems, nicht als Datenblatt.

Die Form ist klar genug: Die Flaggschiff-Einstellung war nie eine Consumer-GPU-Arbeitslast.

Die Wan VRAM-Anforderungen, die du heute tatsächlich erreichen kannst

Hier ist der Teil, den die fabrizierten Tabellen vorgaben zu sein. Diese Zahlen sind vom Wan-Team veröffentlicht und sie sind real.

Tabelle 4: echte Wan VRAM-Stufen, August 2026

VarianteMinimales VRAMAuflösungGemessene GeschwindigkeitFlags, die du benötigstGewichte
Wan2.2 T2V-A14B / I2V-A14B80GB single GPU480P / 720Pnicht veröffentlicht--offload_model True --convert_model_dtypeApache-2.0
Wan2.2 TI2V-5B24GB (RTX 4090)720P @ 24fps5s 720P in unter 9 Minuten--offload_model True --convert_model_dtype --t5_cpuApache-2.0
Wan 2.1 / 2.2 via WanGP6GB und mehrhauptsächlich 480Plangsamer, Qualitätseinbußenint8 / fp8 / gguf / NVFP4 / NunchakuApache-2.0 Basis
Wan 2.5 / 2.6 / 2.7n/aNur APIn/an/akeine veröffentlicht
Wan 3.0n/aNur API, First-Party-Betan/an/akeine veröffentlicht

Zwei Dinge in dieser Tabelle verdienen einen zweiten Blick.

Erstens: Die A14B-Zeile hat bereits beide Speicherspar-Flags aktiviert und benötigt trotzdem 80GB. Das ist die offizielle Single-GPU-Zahl, keine naive. Zweitens: Die 5B-Zeile ist die ehrliche Consumer-Antwort, und ihre eigene README gibt 5 Sekunden 720P in unter 9 Minuten auf einer 4090 an.

Unter 24GB bist du im Community-Bereich. WanGP (das deepbeepmeep/Wan2GP-Projekt, das sich selbst als generative Modelle „zugänglich für die GPU-Armen“ beschreibt) bringt ausgewählte Modelle mit int8, fp8, gguf, NVFP4 und Nunchaku-Quantisierung auf 6GB herunter. Es unterstützt Wan 2.1 und 2.2. Es unterstützt nicht 3.0, weil es nichts zu unterstützen gibt.

Jetzt der Teil, der deine Kaufentscheidung ändern sollte: Die Annahme „die nächste Version wird offen sein“ ist drei Mal in Folge gescheitert. Wan 2.2 war Apache-2.0. Wan 2.5 wurde nur API. Wan 2.6 und 2.7 haben nie Gewichte veröffentlicht. Wan 3.0 hat überhaupt keine Lizenzdatei.

Eine Karte heute auf die Wette zu kaufen, dass morgen 3.0-Gewichte erscheinen, ist eine Wette gegen einen Drei-Generationen-Trend.

Für einen aktuellen gehosteten Lauf öffne Wan 3.0 auf Atlas Cloud und teste einen Prompt wie den untenstehenden, bevor du den Workflow veröffentlichst.

Wan 3.0 Prompt und generierter Effekt Screenshot für wan-3.0-vram-requirements

Wan 3.0 Prompt-zu-Ergebnis Screenshot: Kein-GPU-Rendering-Pfad.

Überspringe die VRAM-Anforderungen: Der Wan-Workflow ohne GPU

Lass mich zuerst die Grenze klar benennen, denn die meisten Seiten in dieser Nische werden das nicht tun.

Niemand hostet Wan 3.0. Weder Atlas Cloud noch sonst jemand. Es gibt keine Gewichte, also gibt es keine Drittanbieter-Inferenz. Wenn eine Seite dir „Wan 3.0 API-Zugriff“ anbietet, verkauft sie dir etwas anderes.

Was du jetzt bekommen kannst, ist der Rest der Familie, gehostet, sekundengenau abgerechnet, ohne VRAM in der Gleichung. Atlas Cloud betreibt Wan 2.2 bis 2.7 hinter einer API und einem Browser-Tab, und Wan 2.7 bei 1080P ist das Nächstliegende zu 3.0-Klasse-Ausgabe, das außerhalb von Alibabas eigenen Beta-Kanälen verfügbar ist.

Für den Leser, für den dieser Artikel geschrieben ist, löst das ein spezifisches Problem. Du warst kurz davor, einen vierstelligen Betrag für eine Karte auszugeben, um einem Checkpoint hinterherzujagen, der nicht existiert. Sekunden zu mieten bedeutet, dass du herausfindest, wie die Ausgabe tatsächlich aussieht, bevor du etwas kaufst, und wenn 3.0-Gewichte nie fallen, hast du nichts verloren außer ein paar Dollar.

Tabelle 5: Die gehostete Wan-Familie (Listenpreise Stand August 2026)

Modell-IDAuflösungMaximale DauerPreisAm besten geeignet für
atlascloud/wan-2.2-turbo/image-to-video480p / 720p / 1080p, 30fpsnur 5s$0,02 / sgünstigster Test in der Familie
atlascloud/wan-2.2/image-to-video480P nativ + 720P VSR3-10s$0,03 / sBudget-Batches
alibaba/wan-2.5/text-to-videobis zu 1920x108010s$0,035 / sgünstiges 1080P Text-zu-Video
alibaba/wan-2.6/text-to-videobis zu 1920x10805 / 10 / 15s$0,07 / slängere Aufnahmen, kein erster Frame nötig
alibaba/wan-2.7/image-to-video720P / 1080P, plus 1080P-SR und 1440P-SR15s$0,10 / s Listedie der 3.0-Klasse-Ausgabe nächstgelegene Stufe
alibaba/wan-2.2/animate-mixCharakteraustausch in vorhandenem Materialentspricht deinem Quellclip$0,126 / sAustausch eines Charakters in einer Einstellung

Eine Warnung vor dem Tutorial, denn sie wird auf deiner Rechnung erscheinen: Der Listenpreis ist eine Untergrenze. Die Seite von Wan 2.7 gibt $0,10 pro Sekunde an. In unseren Läufen im August 2026 wurde derselbe Fünf-Sekunden-Job mit $0,50 auf der 720P-Stufe und $0,75 auf 1080P angeboten, die Flaggschiff-Stufe wird also mit $0,15 pro Sekunde abgerechnet, dem Anderthalbfachen des angegebenen Satzes. Lies immer das Angebot, das der Button dir gibt, bevor du klickst.

Tabelle 6: Vier Wege zu 30 Sekunden 1080P

RouteInvestition vorabPro 30s 1080PBekommst du es tatsächlich?
Kaufe eine 24GB-Karte (4090-Klasse)~$1.600-2.000StromNein. 24GB läuft Wan2.2 TI2V-5B bei 720P. Es gibt keine 3.0-Gewichte.
Miete eine 80GB-KartestündlichStunden Rechenzeit + EinrichtungNur Wan 2.2 A14B, und immer noch kein 1080P/30s
Alibaba First-Party-Betakeine¥1,2/s x 30 = ¥36 (~$5)Ja, ein durchgehender Clip, nur First-Party-Kanäle
Gehostetes Wan 2.7 bei 1080Pkeine2 x 15s bei ~$0,15/s = ~$4,5030s Filmmaterial, aber als zwei Clips (15s-Limit)

Mach die Division. Bei etwa $4,50 pro 30 Sekunden 1080P benötigt eine $2.000-Karte etwa 440 Dreißig-Sekunden-Renderings, um die Gewinnschwelle zu erreichen, und sie kann trotzdem kein einziges davon produzieren.

Das ist das Argument. Hier ist nun der Drei-Schritte-Lauf, damit du die Ausgabe selbst beurteilen kannst.

Schritt 1: Fixiere den ersten Frame in 16:9

Jeder ehrliche VRAM-Vergleich braucht eine Variable. Also fixieren wir den ersten Frame, dann geben wir den identischen Frame und den identischen Bewegungs-Prompt in beide Stufen. Jeder Unterschied, den du danach siehst, ist die Stufe, nicht der Zufall.

Öffne die Qwen Image 2.0 Pro Text-zu-Bild-Spielwiese und füge dies ein:

text
1Cinematic Weitwinkelaufnahme in einem dunklen Home-Office um 2 Uhr morgens: Ein junger Ingenieur in einem grauen Hoodie lehnt sich in einem Schreibtischstuhl zurück, das Gesicht nur von einem Triple-Monitor-Setup beleuchtet, das eine pausierte Video-Timeline zeigt. Neben dem Schreibtisch leuchtet ein offenes PC-Gehäuse, eine einzelne übergroße Grafikkarte sichtbar im Inneren, Lüfter drehen sich. Staubpartikel in der Luft, Teal- und Amber-Farbgebung, geringe Tiefenschärfe, 35mm anamorphotisches Objektiv, fotorealistisch, hochdetailliert, 16:9
2

Einstellungen: Klicke auf den 16:9-Größen-Chip, der den Frame auf 1280 x 720 setzt, und lasse alles andere standardmäßig. Die Kosten betragen $0,06 pro Bild (derzeit 20 % Rabatt von $0,075). Die Breiten- und Höhenfelder gehen bis zu 2048 pro Seite, wenn du einen größeren Frame möchtest, aber der Standard des Chips ist bereits die richtige Form für beide Video-Stufen.

Warum diese Szene? Weil sie buchstäblich der Leser ist. Behalte die Ausgabedatei, du brauchst sie zweimal.

Screenshot einer KI-Bildgenerator-Oberfläche mit Eingabe und Ausgabe

Qwen Image 2.0 Pro Spielwiese auf Atlas Cloud mit dem 16:9-Größen-Chip ausgewählt und dem fertigen 1280x720 ersten Frame im Ausgabebereich

Schritt 1 abgeschlossen: Der 16:9-Chip ausgewählt bei 1280 x 720, und der erste Frame, von dem beide Video-Stufen ausgehen werden. $0,06 auf dem Run-Button.

Schritt 2: Animieren auf der 720P VRAM-Stufe

Dies ist der Platzhalter dafür, was ein echtes lokales 24GB-Setup dir bietet: 720P, fünf Sekunden, und das ist die Obergrenze.

Eine bewusste Entscheidung hier. Anstatt zwischen den beiden Stufen die Modelle zu wechseln, führen wir das gleiche Modell auf beiden aus, sodass die einzige Variable im Vergleich die Auflösungsstufe ist. Lade das Bild aus Schritt 1 als ersten Frame in die Wan 2.7 Bild-zu-Video-Spielwiese, dann füge diesen Bewegungs-Prompt ein:

text
1Der Ingenieur beugt sich langsam vor und reibt sich die Augen; das Monitorlicht flackert, während die Timeline durchläuft; die Kamera fährt leicht ein; Staubpartikel treiben durch den Lichtstrahl; subtiles Handkamera-Mikro-Wackeln; durchgehende Einstellung, keine Schnitte.
2

Einstellungen: Auflösung 720P, Dauer 5s, alles andere standardmäßig. Der Run-Button bot $0,50 an, was dem Listenpreis von $0,10 pro Sekunde mal fünf Sekunden entspricht. Notiere dir diese Zahl, denn Schritt 3 wird sie ändern.

KI-Videogenerierungsoberfläche mit Texteingabe und Videoausgabe

Wan 2.7 Bild-zu-Video Spielwiese auf der 720P-Stufe mit geladenem erstem Frame, 5s Dauer und dem fertigen Clip im Ausgabebereich

Schritt 2 abgeschlossen: die 720P-Stufe, 5 Sekunden, Angebot $0,50, mit einem echten Clip im Ausgabebereich.

Schritt 3: Animieren des gleichen Frames bei 1080P ohne lokale GPU

Gleiche Seite, gleicher erster Frame, gleicher Bewegungs-Prompt wortwörtlich, gleiche 5-Sekunden-Dauer. Ändere genau eine Steuerung: Setze die Auflösung auf 1080P.

Das Run-Angebot steigt von $0,50 auf $0,75. Das sind deine $0,15 pro Sekunde, gemessen, auf einer Seite, deren Listenpreis $0,10 angibt.

Zwei Einstellungsfallen, auf die du achten musst, die uns beide richtige Läufe gekostet haben, um sie zu lernen:

  • Die Dauer-Steuerung übernimmt nicht immer. Wir haben die Dauer auf 10 Sekunden gesetzt, das Feld zeigte 10 an, und der Job rendert trotzdem 5. Das Angebot des Run-Buttons ist die einzige Quelle der Wahrheit: Bei $0,15 pro Sekunde müsste ein echter 10-Sekunden-1080P-Job etwa $1,50 betragen, also bedeutet ein Angebot von $0,75, dass du immer noch 5 Sekunden kaufst, egal was der Schieberegler anzeigt. Lies das Angebot, nicht das Feld.
  • Bestätige, dass dein eigenes Bild geladen ist. Wenn der Referenz-Slot immer noch das voreingestellte Demo-Bild der Seite enthält, wird der Lauf fröhlich etwas Unzusammenhängendes produzieren. Schau auf das Thumbnail, bevor du klickst. KI-Videogenerator-Oberfläche mit einem Text-Prompt und generiertem Video

Wan 2.7 Bild-zu-Video Spielwiese auf der 1080P-Stufe mit dem Run-Button, der $0,75 anbietet, und dem fertigen 1080P-Clip im Ausgabebereich

Schritt 3 abgeschlossen auf der 1080P-Stufe. Das Run-Angebot ist der Punkt: $0,75 für die gleichen fünf Sekunden, die eine Stufe tiefer $0,50 kosteten, auf einer Seite, die $0,10 pro Sekunde angibt.

Beide Renderings sind im Clip oben in diesem Artikel, nebeneinander. Das ist das gesamte VRAM-Argument in fünf Sekunden: zwei Stufen der Ausgabe, der gleiche Prompt, und kein einziges Gigabyte lokalen Videospeichers involviert.

Variationen, die einen Versuch wert sind. Gehe auf 480P für günstige Testläufe, bevor du dich für einen 1080P-Render entscheidest. Tausche alibaba/wan-2.6/text-to-video für $0,07/s ein, wenn du keinen ersten Frame hast und 15 Sekunden auf einmal möchtest. Verwende alibaba/wan-2.2/animate-mix für $0,126/s, um einen anderen Charakter in bereits vorhandenes Material einzufügen. Und wenn du näher an 30 Sekunden kommen möchtest, budgetiere für zwei Clips, wegen eines 15-Sekunden-Limits pro Clip, das fast kein Tutorial erwähnt.

Häufig gestellte Fragen

Kann eine 24GB-GPU Wan 3.0 ausführen?

Heute nicht, weil es keine Gewichte zum Laden gibt. Falls sie jemals veröffentlicht werden, sagt die Mathematik in Tabelle 2, dass 24GB dir 480P und kurze Clips unter aggressiver Quantisierung ermöglicht. Die Flaggschiff-Einstellung 1080P/30s ist eine andere Größenordnung und auf einer einzelnen Consumer-Karte nicht erreichbar.

Wo kann ich Wan 3.0-Gewichte herunterladen?

Nirgendwo. Die Wan-AI-Organisation auf Hugging Face endet bei Wan2.2, und die Wan-Video GitHub-Org hat kein 3.0-Inferenz-Repo und keine 3.0-Lizenz. Jede Seite, die einen „Wan 3.0 Checkpoint-Download“ anbietet, verteilt nicht, was sie behauptet.

Ist Wan 3.0 Open Source oder Apache 2.0?

Es wurde keine Lizenz veröffentlicht. Der Trend geht in die andere Richtung: Wan 2.2 war Apache-2.0, Wan 2.5 wurde nur API, und 2.6 und 2.7 haben überhaupt keine Gewichte veröffentlicht. Drei aufeinanderfolgende Generationen geschlossen. Plane entsprechend.

Was ist das Wan-Modell mit dem geringsten VRAM, das ich heute tatsächlich ausführen kann?

Wan2.2 TI2V-5B, offiziell 24GB auf einer 4090, macht 5s 720P in unter 9 Minuten. Darunter erreichen WanGPs quantisierte Pfade bis zu 6GB bei ausgewählten Modellen, und du bezahlst dafür mit Geschwindigkeit und Detail.

Wan 3.0 vs Wan 2.7: Welches kann ich lokal ausführen?

Keines. Beide sind nur API. Wenn die Anforderung „läuft auf meinem Rechner“ ist, sind deine Optionen die Wan 2.1- und 2.2-Familien. Wenn die Anforderung 2.7-Klasse-Ausgabe ist, ist das ein gehosteter Aufruf, keine lokale Installation.

Wenn ich es nicht lokal ausführen kann, wie bekomme ich jetzt 30 Sekunden 1080P?

Alibabas First-Party-Beta rechnet sekundengenau ab und liefert 30s in einem Clip. Außerhalb dieser Kanäle gibt es ein hartes 15-Sekunden-Limit pro Clip, also bedeutet 30 Sekunden das Zusammenfügen von zwei. In unseren eigenen Wan 2.7-Fortsetzungstests waren die Beschränkungen streng: Das Quellsegment musste 2 bis 10 Sekunden betragen, die Ausgabe musste strikt länger als die Quelle sein, die Quell-Frames wurden nicht beibehalten, und das Verketten von Fortsetzungen hat die Länge nicht erhöht. Die meisten Tutorials erwähnen nichts davon.

Also die Kurzversion der gesamten Wan 3.0 VRAM-Anforderungen-Frage: Hör auf, nach einer Karte zu suchen, denn der Checkpoint, für den du sie kaufen würdest, existiert nicht. Führe Wan 2.2 lokal aus, wenn du Gewichte auf der Festplatte haben möchtest, und miete 1080P-Sekunden, wenn du die Ausgabe möchtest, die die falschen Tabellen verkauft haben.

Neueste Modelle

Eine API für alle Media-KI.

Alle Modelle erkunden