MiniMax H3 Developer nu live — 60 % rabatt, från 0,02 $ per sekund

Wan 3.0 VRAM-krav: Varför 80GB inte är tillräckligt, och vad som faktiskt fungerar idag

Wan 3.0 VRAM-krav, beräknat från dess egna specifikationer för 1080P/30s: 13,5x sekvenslängden, inga publika vikter och de lokala Wan-nivåerna som körs idag.

Senaste uppdatering: Wan 3.0 är nu live från och med 24 augusti 2026.

Du öppnade sex flikar. Varje flik visade en ren tabell: 1,3B på 8 GB, 14B på 24 GB, Apache-2.0, släppt april 2026. Så du öppnade Wan-AI-sidan på Hugging Face för att hämta checkpointen.

27 repositorier. Det nyaste är Wan2.2.

De där tabellerna är inte inaktuella. De är påhittade. Wan 3.0 VRAM-krav kan inte ha mätts av någon utanför Alibaba, eftersom Wan 3.0 endast gick in i offentlig beta den 6 augusti 2026 och aldrig har levererat en viktfil. Det fanns inget att släppa i april.

Så vad är det verkliga svaret? Ingen har benchmarkat det. Men Wan 3.0:s egen specifikationslista ramar in svaret hårt, och vi har gjort den matematiken nedan.

Viktiga slutsatser

  • Inga Wan 3.0-vikter finns någonstans. Varje VRAM-tabell för den på webben idag är fabricerad.
  • Wan 3.0 är en första-parti API-beta: max 30 s, max 1080P, ingen 4K-nivå.
  • Dess egna specifikationer antyder 13,5 gånger den latenta sekvensen av ett 5 s 720P-klipp, vilket innebär en ~180x uppmärksamhetsräkning.
  • Den verkliga lokala takten just nu är Wan2.2 TI2V-5B på 24 GB, eller 6 GB med community-kvantisering.
  • För 1080P-utdata denna vecka, hyr sekunder istället för att köpa VRAM. jämförelse 768p vs 2k

Wan VRAM-krav visualiserade: samma första bildruta animerad vid 720P-nivån till vänster och 1080P-nivån till höger, båda renderade utan lokalt GPU

Samma första bildruta, samma rörelseprompt, samma modell. Endast upplösningsnivån ändras: 720P till vänster för $0,50 för 5 sekunder, 1080P till höger för $0,75. Båda renderades på Wan 2.7 med noll lokalt VRAM, och priset på varje etikett är den offert som Kör-knappen faktiskt gav oss. Visad som en tyst GIF.

Det är vad hela detta argument handlar om. Inte gigabyte. Pixlar.

Varför varje Wan 3.0 VRAM-kravstabell du hittat är fiktion

Slutsats först: de högst rankade sidorna för detta sökord återanvände Wan 2.1- och Wan 2.2-siffror, satte "3.0" på dem, och hittade på ett releasedatum. Du kan motbevisa allt på cirka 60 sekunder.

Kolla här.

Hugging Face-profil för Wan-AI som visar deras AI-modeller

Hugging Face Wan-AI-organisationssida som visar 27 repositorier med Wan2.2 som högsta version, vilket bevisar att inga Wan 3.0-vikter finns för lokalt VRAM-testning

Den officiella Wan-AI-organisationen på Hugging Face, fliken modeller, sorterad nyast först. 27 repos, och det högsta versionsnumret någonstans på listan är 2.2 (Hugging Face, augusti 2026).

Det finns inget Wan3.0-repo. Det finns inget Wan2.7, Wan2.6 eller Wan2.5-repo heller. Det nyaste i organisationen är Wan2.2-Animate-2-14B-Diffusers, uppdaterat för sju dagar sedan (Hugging Face, augusti 2026).

Här är påstående-för-påstående-uppdelningen.

Tabell 1: vad guiderna påstår vs vad som är verifierbart

Påstående du hittar på sidan 1Verifierbart per augusti 2026Hur du kontrollerar det själv
"Wan 3.0 släppte 1.3B + 14B vikter i april 2026"Wan 3.0 öppnade offentlig beta den 6 augusti 2026. Inga vikter något datum.Ladda Wan-AI-orgsidan
"Wan 3.0 är Apache-2.0"Ingen licensfil har någonsin publicerats för 3.0Sök i organisationen efter ett 3.0-repo. Det finns inget.
"1.3B körs på 8 GB, 14B på 24 GB"De är Wan 2.1/2.2-siffror. Wan 2.2:s egen A14B kräver 80 GB.Wan2.2 README-hårdvaruavsnittet
"Full 4K / 30s arbetsflödesnivå"Betan toppar på 1080P. Nivåerna är 480P, 720P, 1080P.Alibabas egna prislista per sekund
"Körs i ComfyUI / WanGP idag"WanGP:s supportlista täcker endast Wan 2.1/2.2Wan2GP README

Vad Alibaba faktiskt levererade i augusti 2026 är en API- och webbprodukt, inte en checkpoint. En generation går upp till 30 sekunder, upplösningen toppar på 1080P, och den accepterar text, bilder, ljud, video och till och med dokument (doc, xls, ppt, pdf, md) som referensinmatning. API-prissättning är ¥0,3 / ¥0,6 / ¥1,2 per sekund för 480P / 720P / 1080P (QbitAI, augusti 2026).

Lägg märke till vad som saknas från den listan: en nedladdningslänk.

Wan 3.0 VRAM-krav, beräknade från dess egna specifikationer

Löfte: i slutet av detta avsnitt kommer du att veta varför "bara skaffa ett 32 GB-kort" inte kan fungera, med siffror du kan härleda själv. Bevis: beräkningen behöver bara två publicerade fakta, Wans VAE-kompressionsförhållande och Wan 3.0:s 1080P/30s-tak.

Låt oss börja.

Det är sekvenslängden, inte parameterantalet. Alla stirrar på B-talet. Det är fel variabel.

En videodiffusionstransformators minne och beräkning skalar med hur många latenta tokens den måste uppmärksamma, och det antalet kommer från upplösning gånger varaktighet, inte från parametrar. Wan2.2:s VAE komprimerar med 4x16x16 i tid, höjd och bredd, och DiT patchifierar ovanpå det, så varje latent token täcker ungefär ett 4x32x32-block av pixlar (Wan2.2 README, augusti 2026). Den äldre Wan2.1-generationens VAE komprimerar med 4x8x8, så med patchifiering blir det 4x16x16 per token, fyra gånger så många tokens för samma klipp.

Kör Wan 3.0:s eget tak genom det och här är vad som faller ut.

Tabell 2: latent tokenantal per målklipp (vår beräkning, 24 fps)

MålklippBilderLatenta bilderTokens (2.2-gen VAE)Tokens (2.1-gen VAE)vs 5s 720P
5s 480P (832x480)1213112 09048 3600,44x
5s 720P (1280x704)1213127 280109 1201,0x (baslinje)
10s 1080P (1920x1088)24161124 440497 7604,6x
30s 1080P (1920x1088)721181369 2401 476 96013,5x

Läs sista raden igen. Wan 3.0:s flaggskeppsförmåga är 13,5 gånger sekvenslängden av det 5-sekunders 720P-klipp som din 4090 för närvarande svettas över.

Och självuppmärksamhet är kvadratisk i sekvenslängd. 13,5 i kvadrat är cirka 180. Så uppmärksamhetsarbetet för ett 30s 1080P-klipp är ungefär 180x uppmärksamhetsarbetet av ett 5s 720P-klipp, innan du räknar något annat.

Det är talet som ingen i SERP:en beräknade. Det är också varför "köp 8 gigabyte till" inte är en plan.

Så vad betyder det i gigabyte? Vikter är den tråkiga delen. En 27B-total MoE på fp8 är cirka 27 GB resident, bf16 cirka 54 GB. MoE hjälper bara beräkningen per steg (Wan2.2:s A14B aktiverar 14B av 27B parametrar per steg), inte vad som måste finnas i minnet.

Den intressanta delen är aktiveringar. En transformatorlagerets dolda tillstånd vid modelldim 5120 i bf16 kostar tokens x 5120 x 2 byte:

  • 5s 720P (27 280 tokens): 0,28 GB per lager
  • 30s 1080P (369 240 tokens): 3,8 GB per lager
  • 30s 1080P på en 2.1-generation VAE (1 476 960 tokens): 15,1 GB per lager

Per lager. Multiplicera med hur många lager din uppmärksamhetsimplementering måste hålla levande, lägg till textkodaren, lägg till VAE-avkodningspasset, och 80GB-siffran slutar att vara konservativ.

Tabell 3: uppskattat VRAM om vikter någonsin släpps (UPPSKATTNING, inte uppmätt)

MålklippOm en 5B-klass högkompressionsmodell släpps (fp8)Om det är en A14B-klass MoE (fp8)Praktisk dom
5s 480P~8-10 GB~30-34 GBett 12 GB-kort är troligt endast för den lilla modellen
5s 720P~10-14 GB~34-40 GB16 GB golv, 24 GB bekvämt
10s 1080P~20-28 GB~45-60 GBett 32 GB-kort är redan marginellt
30s 1080P~45-70 GB~90-140 GBinget konsumentkort, oavsett kvantisering

Varje cell i den tabellen är en UPPSKATTNING härledd från Tabell 2 plus publicerade checkpointstorlekar. Verkliga siffror beror på uppmärksamhetskärnan, avlastningsstrategin och om Alibaba någonsin släpper vikter alls. Behandla det som formen på problemet, inte en specifikationslista.

Formen är tydlig nog: flaggskeppsinställningen var aldrig en konsument-GPU-arbetsbelastning.

Wan VRAM-kraven du faktiskt kan nå idag

Här är delen som de fabricerade tabellerna låtsades vara. Dessa siffror är publicerade av Wan-teamet och de är verkliga.

Tabell 4: verkliga Wan VRAM-nivåer, augusti 2026

VariantMinsta VRAMUpplösningUppmätt hastighetFlaggor du behöverVikter
Wan2.2 T2V-A14B / I2V-A14B80 GB enkel GPU480P / 720Pinte publicerad--offload_model True --convert_model_dtypeApache-2.0
Wan2.2 TI2V-5B24 GB (RTX 4090)720P @ 24 fps5s 720P på under 9 minuter--offload_model True --convert_model_dtype --t5_cpuApache-2.0
Wan 2.1 / 2.2 via WanGP6 GB och uppåtmestadels 480Plångsammare, kvalitetskostnadint8 / fp8 / gguf / NVFP4 / NunchakuApache-2.0 bas
Wan 2.5 / 2.6 / 2.7n/aAPI endastn/an/ainga publicerade
Wan 3.0n/aAPI endast, första-parti betan/an/ainga publicerade

Två saker i den tabellen förtjänar en andra titt.

För det första: A14B-raden har redan båda minnessparande flaggorna påslagna och kräver fortfarande 80 GB. Det är den officiella enkel-GPU-siffran, inte en naiv. För det andra: 5B-raden är det ärliga konsumentsvaret, och dess egen README citerar 5 sekunder av 720P på under 9 minuter på en 4090.

Under 24 GB är du i community-territorium. WanGP (projektet deepbeepmeep/Wan2GP, som beskriver sig självt som generativa modeller "tillgängliga för GPU-fattiga") får utvalda modeller ner till 6 GB med int8, fp8, gguf, NVFP4 och Nunchaku-kvantisering. Det stöder Wan 2.1 och 2.2. Det stöder inte 3.0, för det finns inget att stödja.

Nu delen som borde ändra ditt inköpsbeslut: antagandet att "nästa version kommer att vara öppen" har misslyckats tre gånger i rad. Wan 2.2 var Apache-2.0. Wan 2.5 blev API-endast. Wan 2.6 och 2.7 släppte aldrig vikter. Wan 3.0 har ingen licensfil alls.

Att köpa ett kort idag på vadet att 3.0-vikter landar imorgon är att satsa mot en trend på tre generationer.

För en aktuell värdkörning, öppna Wan 3.0 på Atlas Cloud och testa en prompt som den nedan innan du publicerar arbetsflödet.

Wan 3.0 prompt och genererad effektskärmdump för wan-3.0-vram-requirements

Wan 3.0 prompt-till-resultat-skärmdump: Ingen GPU-renderingsväg.

Hoppa över VRAM-kraven: Wan-arbetsflödet utan GPU

Låt mig vara rak om gränsen först, eftersom de flesta sidor i denna nisch inte kommer att vara det.

Ingen är värd för Wan 3.0. Inte Atlas Cloud, inte någon annan. Det finns inga vikter, så det finns ingen tredjepartsinferens. Om en sida erbjuder dig "Wan 3.0 API-åtkomst", säljer den dig något annat.

Vad du kan få just nu är resten av familjen, värd, debiterad per sekund, utan VRAM i ekvationen. Atlas Cloud kör Wan 2.2 till 2.7 bakom ett API och en webbläsarflik, och Wan 2.7 på 1080P är det närmaste du kan komma 3.0-klassutdata utanför Alibabas egna betakanaler.

För läsaren som denna artikel är skriven för, löser det ett specifikt problem. Du var på väg att spendera fyra siffror på ett kort för att jaga en checkpoint som inte finns. Att hyra sekunder innebär att du får reda på hur utdata faktiskt ser ut innan du köper något, och om 3.0-vikter aldrig kommer, har du förlorat inget annat än några dollar.

Tabell 5: den värdbaserade Wan-familjen (listpriser per augusti 2026)

Modell-idUpplösningMax varaktighetPrisBäst för
atlascloud/wan-2.2-turbo/image-to-video480p / 720p / 1080p, 30 fpsEndast 5s$0,02 / sbilligaste titt i familjen
atlascloud/wan-2.2/image-to-video480P native + 720P VSR3-10s$0,03 / sbudgetbatcher
alibaba/wan-2.5/text-to-videoupp till 1920x108010s$0,035 / sbillig 1080P text-till-video
alibaba/wan-2.6/text-to-videoupp till 1920x10805 / 10 / 15s$0,07 / slängre tagningar, ingen första bildruta behövs
alibaba/wan-2.7/image-to-video720P / 1080P, plus 1080P-SR och 1440P-SR15s$0,10 / s listden närmaste nivån till 3.0-klassutdata
alibaba/wan-2.2/animate-mixkaraktärsbyte i befintligt materialmatchar ditt källklipp$0,126 / sbyta en karaktär i en tagning

En varning innan handledningen, eftersom den kommer att dyka upp på din faktura: listpriset är ett golv. Wan 2.7:s sida anger $0,10 per sekund. I våra körningar i augusti 2026 offererade samma fem sekunders jobb $0,50 på 720P-nivån och $0,75 på 1080P, så flaggskeppsnivån debiterar $0,15 per sekund, en och en halv gång den angivna satsen. Läs alltid offerten som knappen ger dig innan du klickar på den.

Tabell 6: fyra vägar till 30 sekunder av 1080P

VägFörskottskostnadPer 30s av 1080PFår du det faktiskt?
Köp ett 24 GB-kort (4090-klass)~$1 600-2 000elNej. 24 GB kör Wan2.2 TI2V-5B på 720P. Inga 3.0-vikter finns.
Hyr ett 80 GB-kortper timmetimmars beräkning + installationEndast Wan 2.2 A14B, och fortfarande inte 1080P/30s
Alibaba första-parti betaingen¥1,2/s x 30 = ¥36 (~$5)Ja, ett sammanhängande klipp, endast första-parti kanaler
Värderad Wan 2.7 på 1080Pingen2 x 15s vid ~$0,15/s = ~$4,5030s material, men som två klipp (15s gräns)

Gör divisionen. Vid cirka $4,50 per 30 sekunder av 1080P behöver ett $2 000-kort cirka 440 trettio-sekunders-renderingar för att gå jämnt, och det kan fortfarande inte producera en enda av dem.

Det är argumentet. Här är nu trestegs-körningen så att du kan bedöma utdata själv.

Steg 1: Lås den första bildrutan till 16:9

Varje ärlig VRAM-jämförelse behöver en variabel. Så vi fixar den första bildrutan, matar sedan samma bildruta och samma rörelseprompt till båda nivåerna. Eventuell skillnad du ser efteråt är nivån, inte tärningen.

Öppna Qwen Image 2.0 Pro text-till-bild lekplats och klistra in detta:

text
1Cinematic wide shot inside a dim home office at 2am: a young engineer in a grey hoodie leans back in a desk chair, face lit only by a triple-monitor rig showing a paused video timeline. Beside the desk an open PC case glows, a single oversized graphics card visible inside, fans spinning. Dust motes in the air, teal-and-amber color grading, shallow depth of field, 35mm anamorphic lens, photorealistic, highly detailed, 16:9
2

Inställningar: klicka på 16:9-storlekschippet, som knäpper bildrutan till 1280 x 720, och lämna allt annat som standard. Kostnad är $0,06 per bild (för närvarande 20% rabatt från $0,075). Bredd- och höjdfälten går upp till 2048 per sida om du vill ha en större bildruta, men chippets standard är redan rätt form för båda videonivåerna.

Varför denna scen? För att den bokstavligen är läsaren. Spara utdatafilen, du behöver den två gånger.

Skärmdump av ett AI-bildgeneratorgränssnitt som visar in- och utdata

Qwen Image 2.0 Pro lekplats på Atlas Cloud med 16:9-storlekschippet valt och den färdiga 1280x720 första bildrutan i utdatapanelen

Steg 1 klart: 16:9-chippet valt vid 1280 x 720, och den första bildrutan som båda videonivåerna kommer att börja från. $0,06 på Kör-knappen.

Steg 2: Animera den på 720P VRAM-nivån

Detta är ersättaren för vad en verklig 24 GB lokal installation ger dig: 720P, fem sekunder, och det är taket.

Ett medvetet val här. Istället för att byta modell mellan de två nivåerna kör vi samma modell på båda, så den enda variabeln i jämförelsen är upplösningsnivån. Ladda steg 1-bilden som den första bildrutan i Wan 2.7 bild-till-video lekplats, klistra sedan in denna rörelseprompt:

text
1The engineer slowly leans forward and rubs his eyes; the monitor glow flickers as the timeline scrubs; the camera pushes in slightly; dust motes drift through the beam of light; subtle handheld micro-shake; single continuous shot, no cuts.
2

Inställningar: upplösning 720P, varaktighet 5s, allt annat standard. Kör-knappen offererade $0,50, vilket är $0,10 per sekund listpris gånger fem sekunder. Anteckna det talet, eftersom steg 3 kommer att ändra det.

AI-videogenereringsgränssnitt som visar textpromptinmatning och videoutdata

Wan 2.7 bild-till-video lekplats på 720P-nivån med den första bildrutan laddad, 5s varaktighet, och det färdiga klippet i utdatapanelen

Steg 2 klart: 720P-nivån, 5 sekunder, offererad till $0,50, med ett verkligt klipp i utdatapanelen.

Steg 3: Animera samma bildruta på 1080P utan lokalt GPU

Samma sida, samma första bildruta, samma rörelseprompt ord för ord, samma 5 sekunders varaktighet. Ändra exakt en kontroll: sätt upplösning till 1080P.

Kör-offerten går från $0,50 till $0,75. Det är dina $0,15 per sekund, uppmätt, på en sida vars listpris anger $0,10.

Två inställningsfällor att se upp med, båda kostade oss verkliga körningar att lära:

  • Varaktighetskontrollen commitar inte alltid. Vi satte varaktighet till 10 sekunder, fältet visade 10, och jobbet renderade fortfarande 5. Kör-knappens offert är den enda sanningskällan: vid $0,15 per sekund måste ett äkta 10 sekunders 1080P-jobb vara cirka $1,50, så en offert på $0,75 betyder att du fortfarande köper 5 sekunder oavsett vad reglaget visar. Läs offerten, inte fältet.
  • Bekräfta att din egen bild är laddad. Om referensplatsen fortfarande håller sidans förinställda demobild, kommer körningen glatt att producera något orelaterat. Titta på miniatyren innan du klickar. AI-videogenereringsgränssnitt som visar en textprompt och genererad video

Wan 2.7 bild-till-video lekplats på 1080P-nivån med Kör-knappen som offererar $0,75, och det färdiga 1080P-klippet i utdatapanelen

Steg 3 klart på 1080P-nivån. Kör-offerten är poängen: $0,75 för samma fem sekunder som kostade $0,50 en nivå ner, på en sida som listar $0,10 per sekund.

Båda renderingarna finns i klippet högst upp i denna artikel, sida vid sida. Det är hela VRAM-argumentet på fem sekunder: två nivåer av utdata, samma prompt, och inte en gigabyte lokalt videominne inblandat.

Varianter värda att prova. Gå ner till 480P för billiga tittar innan du förbinder dig till en 1080P-rendering. Byt till alibaba/wan-2.6/text-to-video för $0,07/s när du inte har en första bildruta och vill ha 15 sekunder i ett svep. Använd alibaba/wan-2.2/animate-mix för $0,126/s för att sätta en annan karaktär i material du redan har. Och om du vill komma närmare 30 sekunder, budgetera för två klipp, på grund av ett 15-sekunders per klipp-tak som nästan ingen handledning nämner.

Vanliga frågor

Kan ett 24 GB GPU köra Wan 3.0?

Inte idag, eftersom det inte finns några vikter att ladda. Om de någonsin släpps, säger matematiken i Tabell 2 att 24 GB ger dig 480P och korta klipp under aggressiv kvantisering. Flaggskeppsinställningen 1080P/30s är en annan storleksordning och är inte nåbar på ett enda konsumentkort.

Var kan jag ladda ner Wan 3.0-vikter?

Ingenstans. Organisationen Wan-AI på Hugging Face toppar på Wan2.2, och Wan-Video GitHub-organisationen har inget 3.0-inferensrepo och ingen 3.0-licens. Alla webbplatser som erbjuder en "Wan 3.0 checkpoint-nedladdning" distribuerar inte vad de påstår.

Är Wan 3.0 öppen källkod eller Apache 2.0?

Ingen licens har publicerats. Trenden går åt andra hållet: Wan 2.2 var Apache-2.0, Wan 2.5 blev API-endast, och 2.6 och 2.7 släppte inga vikter alls. Tre på varandra följande generationer stängda. Planera därefter.

Vilken är den lägsta VRAM Wan-modellen jag faktiskt kan köra idag?

Wan2.2 TI2V-5B, officiellt 24 GB på en 4090, som gör 5s 720P på under 9 minuter. Under det når WanGP:s kvantiserade vägar ner till 6 GB på utvalda modeller, och du betalar för det i hastighet och detalj.

Wan 3.0 vs Wan 2.7: vilken kan jag köra lokalt?

Ingen. Båda är API-endast. Om kravet är "körs på min maskin", är dina alternativ Wan 2.1- och 2.2-familjerna. Om kravet är 2.7-klassutdata, är det ett värdbaserat anrop, inte en lokal installation.

Om jag inte kan köra den lokalt, hur får jag 30 sekunder av 1080P nu?

Alibabas första-parti beta debiterar per sekund och levererar 30s i ett klipp. Utanför dessa kanaler finns ett hårt 15-sekunders tak per klipp, så 30 sekunder innebär att sy ihop två. I vår egen Wan 2.7 fortsättningstestning var begränsningarna strikta: källsegmentet måste vara 2 till 10 sekunder, utdata måste vara strikt längre än källan, källbildrutorna bevarades inte, och att kedja fortsättningar ackumulerade inte längd. De flesta handledningar nämner aldrig något av det.

Så den korta versionen av hela Wan 3.0 VRAM-krav-frågan: sluta leta efter ett kort, eftersom checkpointen du skulle köpa det för inte finns. Kör Wan 2.2 lokalt om du vill ha vikter på disken, och hyr 1080P-sekunder när du vill ha utdata som de falska tabellerna sålde.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller