Senaste uppdatering: Wan 3.0 är nu live från och med 24 augusti 2026.
Du öppnade sex flikar. Varje flik visade en ren tabell: 1,3B på 8 GB, 14B på 24 GB, Apache-2.0, släppt april 2026. Så du öppnade Wan-AI-sidan på Hugging Face för att hämta checkpointen.
27 repositorier. Det nyaste är Wan2.2.
De där tabellerna är inte inaktuella. De är påhittade. Wan 3.0 VRAM-krav kan inte ha mätts av någon utanför Alibaba, eftersom Wan 3.0 endast gick in i offentlig beta den 6 augusti 2026 och aldrig har levererat en viktfil. Det fanns inget att släppa i april.
Så vad är det verkliga svaret? Ingen har benchmarkat det. Men Wan 3.0:s egen specifikationslista ramar in svaret hårt, och vi har gjort den matematiken nedan.
Viktiga slutsatser
- Inga Wan 3.0-vikter finns någonstans. Varje VRAM-tabell för den på webben idag är fabricerad.
- Wan 3.0 är en första-parti API-beta: max 30 s, max 1080P, ingen 4K-nivå.
- Dess egna specifikationer antyder 13,5 gånger den latenta sekvensen av ett 5 s 720P-klipp, vilket innebär en ~180x uppmärksamhetsräkning.
- Den verkliga lokala takten just nu är Wan2.2 TI2V-5B på 24 GB, eller 6 GB med community-kvantisering.
- För 1080P-utdata denna vecka, hyr sekunder istället för att köpa VRAM.

Wan VRAM-krav visualiserade: samma första bildruta animerad vid 720P-nivån till vänster och 1080P-nivån till höger, båda renderade utan lokalt GPU
Samma första bildruta, samma rörelseprompt, samma modell. Endast upplösningsnivån ändras: 720P till vänster för $0,50 för 5 sekunder, 1080P till höger för $0,75. Båda renderades på Wan 2.7 med noll lokalt VRAM, och priset på varje etikett är den offert som Kör-knappen faktiskt gav oss. Visad som en tyst GIF.
Det är vad hela detta argument handlar om. Inte gigabyte. Pixlar.
Varför varje Wan 3.0 VRAM-kravstabell du hittat är fiktion
Slutsats först: de högst rankade sidorna för detta sökord återanvände Wan 2.1- och Wan 2.2-siffror, satte "3.0" på dem, och hittade på ett releasedatum. Du kan motbevisa allt på cirka 60 sekunder.
Kolla här.

Hugging Face Wan-AI-organisationssida som visar 27 repositorier med Wan2.2 som högsta version, vilket bevisar att inga Wan 3.0-vikter finns för lokalt VRAM-testning
Den officiella Wan-AI-organisationen på Hugging Face, fliken modeller, sorterad nyast först. 27 repos, och det högsta versionsnumret någonstans på listan är 2.2 (Hugging Face, augusti 2026).
Det finns inget Wan3.0-repo. Det finns inget Wan2.7, Wan2.6 eller Wan2.5-repo heller. Det nyaste i organisationen är Wan2.2-Animate-2-14B-Diffusers, uppdaterat för sju dagar sedan (Hugging Face, augusti 2026).
Här är påstående-för-påstående-uppdelningen.
Tabell 1: vad guiderna påstår vs vad som är verifierbart
| Påstående du hittar på sidan 1 | Verifierbart per augusti 2026 | Hur du kontrollerar det själv |
|---|---|---|
| "Wan 3.0 släppte 1.3B + 14B vikter i april 2026" | Wan 3.0 öppnade offentlig beta den 6 augusti 2026. Inga vikter något datum. | Ladda Wan-AI-orgsidan |
| "Wan 3.0 är Apache-2.0" | Ingen licensfil har någonsin publicerats för 3.0 | Sök i organisationen efter ett 3.0-repo. Det finns inget. |
| "1.3B körs på 8 GB, 14B på 24 GB" | De är Wan 2.1/2.2-siffror. Wan 2.2:s egen A14B kräver 80 GB. | Wan2.2 README-hårdvaruavsnittet |
| "Full 4K / 30s arbetsflödesnivå" | Betan toppar på 1080P. Nivåerna är 480P, 720P, 1080P. | Alibabas egna prislista per sekund |
| "Körs i ComfyUI / WanGP idag" | WanGP:s supportlista täcker endast Wan 2.1/2.2 | Wan2GP README |
Vad Alibaba faktiskt levererade i augusti 2026 är en API- och webbprodukt, inte en checkpoint. En generation går upp till 30 sekunder, upplösningen toppar på 1080P, och den accepterar text, bilder, ljud, video och till och med dokument (doc, xls, ppt, pdf, md) som referensinmatning. API-prissättning är ¥0,3 / ¥0,6 / ¥1,2 per sekund för 480P / 720P / 1080P (QbitAI, augusti 2026).
Lägg märke till vad som saknas från den listan: en nedladdningslänk.
Wan 3.0 VRAM-krav, beräknade från dess egna specifikationer
Löfte: i slutet av detta avsnitt kommer du att veta varför "bara skaffa ett 32 GB-kort" inte kan fungera, med siffror du kan härleda själv. Bevis: beräkningen behöver bara två publicerade fakta, Wans VAE-kompressionsförhållande och Wan 3.0:s 1080P/30s-tak.
Låt oss börja.
Det är sekvenslängden, inte parameterantalet. Alla stirrar på B-talet. Det är fel variabel.
En videodiffusionstransformators minne och beräkning skalar med hur många latenta tokens den måste uppmärksamma, och det antalet kommer från upplösning gånger varaktighet, inte från parametrar. Wan2.2:s VAE komprimerar med 4x16x16 i tid, höjd och bredd, och DiT patchifierar ovanpå det, så varje latent token täcker ungefär ett 4x32x32-block av pixlar (Wan2.2 README, augusti 2026). Den äldre Wan2.1-generationens VAE komprimerar med 4x8x8, så med patchifiering blir det 4x16x16 per token, fyra gånger så många tokens för samma klipp.
Kör Wan 3.0:s eget tak genom det och här är vad som faller ut.
Tabell 2: latent tokenantal per målklipp (vår beräkning, 24 fps)
| Målklipp | Bilder | Latenta bilder | Tokens (2.2-gen VAE) | Tokens (2.1-gen VAE) | vs 5s 720P |
|---|---|---|---|---|---|
| 5s 480P (832x480) | 121 | 31 | 12 090 | 48 360 | 0,44x |
| 5s 720P (1280x704) | 121 | 31 | 27 280 | 109 120 | 1,0x (baslinje) |
| 10s 1080P (1920x1088) | 241 | 61 | 124 440 | 497 760 | 4,6x |
| 30s 1080P (1920x1088) | 721 | 181 | 369 240 | 1 476 960 | 13,5x |
Läs sista raden igen. Wan 3.0:s flaggskeppsförmåga är 13,5 gånger sekvenslängden av det 5-sekunders 720P-klipp som din 4090 för närvarande svettas över.
Och självuppmärksamhet är kvadratisk i sekvenslängd. 13,5 i kvadrat är cirka 180. Så uppmärksamhetsarbetet för ett 30s 1080P-klipp är ungefär 180x uppmärksamhetsarbetet av ett 5s 720P-klipp, innan du räknar något annat.
Det är talet som ingen i SERP:en beräknade. Det är också varför "köp 8 gigabyte till" inte är en plan.
Så vad betyder det i gigabyte? Vikter är den tråkiga delen. En 27B-total MoE på fp8 är cirka 27 GB resident, bf16 cirka 54 GB. MoE hjälper bara beräkningen per steg (Wan2.2:s A14B aktiverar 14B av 27B parametrar per steg), inte vad som måste finnas i minnet.
Den intressanta delen är aktiveringar. En transformatorlagerets dolda tillstånd vid modelldim 5120 i bf16 kostar tokens x 5120 x 2 byte:
- 5s 720P (27 280 tokens): 0,28 GB per lager
- 30s 1080P (369 240 tokens): 3,8 GB per lager
- 30s 1080P på en 2.1-generation VAE (1 476 960 tokens): 15,1 GB per lager
Per lager. Multiplicera med hur många lager din uppmärksamhetsimplementering måste hålla levande, lägg till textkodaren, lägg till VAE-avkodningspasset, och 80GB-siffran slutar att vara konservativ.
Tabell 3: uppskattat VRAM om vikter någonsin släpps (UPPSKATTNING, inte uppmätt)
| Målklipp | Om en 5B-klass högkompressionsmodell släpps (fp8) | Om det är en A14B-klass MoE (fp8) | Praktisk dom |
|---|---|---|---|
| 5s 480P | ~8-10 GB | ~30-34 GB | ett 12 GB-kort är troligt endast för den lilla modellen |
| 5s 720P | ~10-14 GB | ~34-40 GB | 16 GB golv, 24 GB bekvämt |
| 10s 1080P | ~20-28 GB | ~45-60 GB | ett 32 GB-kort är redan marginellt |
| 30s 1080P | ~45-70 GB | ~90-140 GB | inget konsumentkort, oavsett kvantisering |
Varje cell i den tabellen är en UPPSKATTNING härledd från Tabell 2 plus publicerade checkpointstorlekar. Verkliga siffror beror på uppmärksamhetskärnan, avlastningsstrategin och om Alibaba någonsin släpper vikter alls. Behandla det som formen på problemet, inte en specifikationslista.
Formen är tydlig nog: flaggskeppsinställningen var aldrig en konsument-GPU-arbetsbelastning.
Wan VRAM-kraven du faktiskt kan nå idag
Här är delen som de fabricerade tabellerna låtsades vara. Dessa siffror är publicerade av Wan-teamet och de är verkliga.
Tabell 4: verkliga Wan VRAM-nivåer, augusti 2026
| Variant | Minsta VRAM | Upplösning | Uppmätt hastighet | Flaggor du behöver | Vikter |
|---|---|---|---|---|---|
| Wan2.2 T2V-A14B / I2V-A14B | 80 GB enkel GPU | 480P / 720P | inte publicerad | --offload_model True --convert_model_dtype | Apache-2.0 |
| Wan2.2 TI2V-5B | 24 GB (RTX 4090) | 720P @ 24 fps | 5s 720P på under 9 minuter | --offload_model True --convert_model_dtype --t5_cpu | Apache-2.0 |
| Wan 2.1 / 2.2 via WanGP | 6 GB och uppåt | mestadels 480P | långsammare, kvalitetskostnad | int8 / fp8 / gguf / NVFP4 / Nunchaku | Apache-2.0 bas |
| Wan 2.5 / 2.6 / 2.7 | n/a | API endast | n/a | n/a | inga publicerade |
| Wan 3.0 | n/a | API endast, första-parti beta | n/a | n/a | inga publicerade |
Två saker i den tabellen förtjänar en andra titt.
För det första: A14B-raden har redan båda minnessparande flaggorna påslagna och kräver fortfarande 80 GB. Det är den officiella enkel-GPU-siffran, inte en naiv. För det andra: 5B-raden är det ärliga konsumentsvaret, och dess egen README citerar 5 sekunder av 720P på under 9 minuter på en 4090.
Under 24 GB är du i community-territorium. WanGP (projektet deepbeepmeep/Wan2GP, som beskriver sig självt som generativa modeller "tillgängliga för GPU-fattiga") får utvalda modeller ner till 6 GB med int8, fp8, gguf, NVFP4 och Nunchaku-kvantisering. Det stöder Wan 2.1 och 2.2. Det stöder inte 3.0, för det finns inget att stödja.
Nu delen som borde ändra ditt inköpsbeslut: antagandet att "nästa version kommer att vara öppen" har misslyckats tre gånger i rad. Wan 2.2 var Apache-2.0. Wan 2.5 blev API-endast. Wan 2.6 och 2.7 släppte aldrig vikter. Wan 3.0 har ingen licensfil alls.
Att köpa ett kort idag på vadet att 3.0-vikter landar imorgon är att satsa mot en trend på tre generationer.
För en aktuell värdkörning, öppna Wan 3.0 på Atlas Cloud och testa en prompt som den nedan innan du publicerar arbetsflödet.

Wan 3.0 prompt-till-resultat-skärmdump: Ingen GPU-renderingsväg.
Hoppa över VRAM-kraven: Wan-arbetsflödet utan GPU
Låt mig vara rak om gränsen först, eftersom de flesta sidor i denna nisch inte kommer att vara det.
Ingen är värd för Wan 3.0. Inte Atlas Cloud, inte någon annan. Det finns inga vikter, så det finns ingen tredjepartsinferens. Om en sida erbjuder dig "Wan 3.0 API-åtkomst", säljer den dig något annat.
Vad du kan få just nu är resten av familjen, värd, debiterad per sekund, utan VRAM i ekvationen. Atlas Cloud kör Wan 2.2 till 2.7 bakom ett API och en webbläsarflik, och Wan 2.7 på 1080P är det närmaste du kan komma 3.0-klassutdata utanför Alibabas egna betakanaler.
För läsaren som denna artikel är skriven för, löser det ett specifikt problem. Du var på väg att spendera fyra siffror på ett kort för att jaga en checkpoint som inte finns. Att hyra sekunder innebär att du får reda på hur utdata faktiskt ser ut innan du köper något, och om 3.0-vikter aldrig kommer, har du förlorat inget annat än några dollar.
Tabell 5: den värdbaserade Wan-familjen (listpriser per augusti 2026)
| Modell-id | Upplösning | Max varaktighet | Pris | Bäst för |
|---|---|---|---|---|
| atlascloud/wan-2.2-turbo/image-to-video | 480p / 720p / 1080p, 30 fps | Endast 5s | $0,02 / s | billigaste titt i familjen |
| atlascloud/wan-2.2/image-to-video | 480P native + 720P VSR | 3-10s | $0,03 / s | budgetbatcher |
| alibaba/wan-2.5/text-to-video | upp till 1920x1080 | 10s | $0,035 / s | billig 1080P text-till-video |
| alibaba/wan-2.6/text-to-video | upp till 1920x1080 | 5 / 10 / 15s | $0,07 / s | längre tagningar, ingen första bildruta behövs |
| alibaba/wan-2.7/image-to-video | 720P / 1080P, plus 1080P-SR och 1440P-SR | 15s | $0,10 / s list | den närmaste nivån till 3.0-klassutdata |
| alibaba/wan-2.2/animate-mix | karaktärsbyte i befintligt material | matchar ditt källklipp | $0,126 / s | byta en karaktär i en tagning |
En varning innan handledningen, eftersom den kommer att dyka upp på din faktura: listpriset är ett golv. Wan 2.7:s sida anger $0,10 per sekund. I våra körningar i augusti 2026 offererade samma fem sekunders jobb $0,50 på 720P-nivån och $0,75 på 1080P, så flaggskeppsnivån debiterar $0,15 per sekund, en och en halv gång den angivna satsen. Läs alltid offerten som knappen ger dig innan du klickar på den.
Tabell 6: fyra vägar till 30 sekunder av 1080P
| Väg | Förskottskostnad | Per 30s av 1080P | Får du det faktiskt? |
|---|---|---|---|
| Köp ett 24 GB-kort (4090-klass) | ~$1 600-2 000 | el | Nej. 24 GB kör Wan2.2 TI2V-5B på 720P. Inga 3.0-vikter finns. |
| Hyr ett 80 GB-kort | per timme | timmars beräkning + installation | Endast Wan 2.2 A14B, och fortfarande inte 1080P/30s |
| Alibaba första-parti beta | ingen | ¥1,2/s x 30 = ¥36 (~$5) | Ja, ett sammanhängande klipp, endast första-parti kanaler |
| Värderad Wan 2.7 på 1080P | ingen | 2 x 15s vid ~$0,15/s = ~$4,50 | 30s material, men som två klipp (15s gräns) |
Gör divisionen. Vid cirka $4,50 per 30 sekunder av 1080P behöver ett $2 000-kort cirka 440 trettio-sekunders-renderingar för att gå jämnt, och det kan fortfarande inte producera en enda av dem.
Det är argumentet. Här är nu trestegs-körningen så att du kan bedöma utdata själv.
Steg 1: Lås den första bildrutan till 16:9
Varje ärlig VRAM-jämförelse behöver en variabel. Så vi fixar den första bildrutan, matar sedan samma bildruta och samma rörelseprompt till båda nivåerna. Eventuell skillnad du ser efteråt är nivån, inte tärningen.
Öppna Qwen Image 2.0 Pro text-till-bild lekplats och klistra in detta:
text1Cinematic wide shot inside a dim home office at 2am: a young engineer in a grey hoodie leans back in a desk chair, face lit only by a triple-monitor rig showing a paused video timeline. Beside the desk an open PC case glows, a single oversized graphics card visible inside, fans spinning. Dust motes in the air, teal-and-amber color grading, shallow depth of field, 35mm anamorphic lens, photorealistic, highly detailed, 16:9 2
Inställningar: klicka på 16:9-storlekschippet, som knäpper bildrutan till 1280 x 720, och lämna allt annat som standard. Kostnad är $0,06 per bild (för närvarande 20% rabatt från $0,075). Bredd- och höjdfälten går upp till 2048 per sida om du vill ha en större bildruta, men chippets standard är redan rätt form för båda videonivåerna.
Varför denna scen? För att den bokstavligen är läsaren. Spara utdatafilen, du behöver den två gånger.

Qwen Image 2.0 Pro lekplats på Atlas Cloud med 16:9-storlekschippet valt och den färdiga 1280x720 första bildrutan i utdatapanelen
Steg 1 klart: 16:9-chippet valt vid 1280 x 720, och den första bildrutan som båda videonivåerna kommer att börja från. $0,06 på Kör-knappen.
Steg 2: Animera den på 720P VRAM-nivån
Detta är ersättaren för vad en verklig 24 GB lokal installation ger dig: 720P, fem sekunder, och det är taket.
Ett medvetet val här. Istället för att byta modell mellan de två nivåerna kör vi samma modell på båda, så den enda variabeln i jämförelsen är upplösningsnivån. Ladda steg 1-bilden som den första bildrutan i Wan 2.7 bild-till-video lekplats, klistra sedan in denna rörelseprompt:
text1The engineer slowly leans forward and rubs his eyes; the monitor glow flickers as the timeline scrubs; the camera pushes in slightly; dust motes drift through the beam of light; subtle handheld micro-shake; single continuous shot, no cuts. 2
Inställningar: upplösning 720P, varaktighet 5s, allt annat standard. Kör-knappen offererade $0,50, vilket är $0,10 per sekund listpris gånger fem sekunder. Anteckna det talet, eftersom steg 3 kommer att ändra det.

Wan 2.7 bild-till-video lekplats på 720P-nivån med den första bildrutan laddad, 5s varaktighet, och det färdiga klippet i utdatapanelen
Steg 2 klart: 720P-nivån, 5 sekunder, offererad till $0,50, med ett verkligt klipp i utdatapanelen.
Steg 3: Animera samma bildruta på 1080P utan lokalt GPU
Samma sida, samma första bildruta, samma rörelseprompt ord för ord, samma 5 sekunders varaktighet. Ändra exakt en kontroll: sätt upplösning till 1080P.
Kör-offerten går från $0,50 till $0,75. Det är dina $0,15 per sekund, uppmätt, på en sida vars listpris anger $0,10.
Två inställningsfällor att se upp med, båda kostade oss verkliga körningar att lära:
- Varaktighetskontrollen commitar inte alltid. Vi satte varaktighet till 10 sekunder, fältet visade 10, och jobbet renderade fortfarande 5. Kör-knappens offert är den enda sanningskällan: vid $0,15 per sekund måste ett äkta 10 sekunders 1080P-jobb vara cirka $1,50, så en offert på $0,75 betyder att du fortfarande köper 5 sekunder oavsett vad reglaget visar. Läs offerten, inte fältet.
- Bekräfta att din egen bild är laddad. Om referensplatsen fortfarande håller sidans förinställda demobild, kommer körningen glatt att producera något orelaterat. Titta på miniatyren innan du klickar.

Wan 2.7 bild-till-video lekplats på 1080P-nivån med Kör-knappen som offererar $0,75, och det färdiga 1080P-klippet i utdatapanelen
Steg 3 klart på 1080P-nivån. Kör-offerten är poängen: $0,75 för samma fem sekunder som kostade $0,50 en nivå ner, på en sida som listar $0,10 per sekund.
Båda renderingarna finns i klippet högst upp i denna artikel, sida vid sida. Det är hela VRAM-argumentet på fem sekunder: två nivåer av utdata, samma prompt, och inte en gigabyte lokalt videominne inblandat.
Varianter värda att prova. Gå ner till 480P för billiga tittar innan du förbinder dig till en 1080P-rendering. Byt till alibaba/wan-2.6/text-to-video för $0,07/s när du inte har en första bildruta och vill ha 15 sekunder i ett svep. Använd alibaba/wan-2.2/animate-mix för $0,126/s för att sätta en annan karaktär i material du redan har. Och om du vill komma närmare 30 sekunder, budgetera för två klipp, på grund av ett 15-sekunders per klipp-tak som nästan ingen handledning nämner.
Vanliga frågor
Kan ett 24 GB GPU köra Wan 3.0?
Inte idag, eftersom det inte finns några vikter att ladda. Om de någonsin släpps, säger matematiken i Tabell 2 att 24 GB ger dig 480P och korta klipp under aggressiv kvantisering. Flaggskeppsinställningen 1080P/30s är en annan storleksordning och är inte nåbar på ett enda konsumentkort.
Var kan jag ladda ner Wan 3.0-vikter?
Ingenstans. Organisationen Wan-AI på Hugging Face toppar på Wan2.2, och Wan-Video GitHub-organisationen har inget 3.0-inferensrepo och ingen 3.0-licens. Alla webbplatser som erbjuder en "Wan 3.0 checkpoint-nedladdning" distribuerar inte vad de påstår.
Är Wan 3.0 öppen källkod eller Apache 2.0?
Ingen licens har publicerats. Trenden går åt andra hållet: Wan 2.2 var Apache-2.0, Wan 2.5 blev API-endast, och 2.6 och 2.7 släppte inga vikter alls. Tre på varandra följande generationer stängda. Planera därefter.
Vilken är den lägsta VRAM Wan-modellen jag faktiskt kan köra idag?
Wan2.2 TI2V-5B, officiellt 24 GB på en 4090, som gör 5s 720P på under 9 minuter. Under det når WanGP:s kvantiserade vägar ner till 6 GB på utvalda modeller, och du betalar för det i hastighet och detalj.
Wan 3.0 vs Wan 2.7: vilken kan jag köra lokalt?
Ingen. Båda är API-endast. Om kravet är "körs på min maskin", är dina alternativ Wan 2.1- och 2.2-familjerna. Om kravet är 2.7-klassutdata, är det ett värdbaserat anrop, inte en lokal installation.
Om jag inte kan köra den lokalt, hur får jag 30 sekunder av 1080P nu?
Alibabas första-parti beta debiterar per sekund och levererar 30s i ett klipp. Utanför dessa kanaler finns ett hårt 15-sekunders tak per klipp, så 30 sekunder innebär att sy ihop två. I vår egen Wan 2.7 fortsättningstestning var begränsningarna strikta: källsegmentet måste vara 2 till 10 sekunder, utdata måste vara strikt längre än källan, källbildrutorna bevarades inte, och att kedja fortsättningar ackumulerade inte längd. De flesta handledningar nämner aldrig något av det.
Så den korta versionen av hela Wan 3.0 VRAM-krav-frågan: sluta leta efter ett kort, eftersom checkpointen du skulle köpa det för inte finns. Kör Wan 2.2 lokalt om du vill ha vikter på disken, och hyr 1080P-sekunder när du vill ha utdata som de falska tabellerna sålde.






