
En vägg i en färgkorrigeringsstudio som visar samma regniga takscen vid tidskoder från 00:00 till 00:30
Trettio sekunder av en enda sammanhängande tagning, utlagd över en tidslinje. Att ta sig dit är hela historien.
Dagen då Wan 3.0 Preview gick in i offentlig beta började jag leta efter dess specifikationsblad. Första resultatsidan berättade att den gör native 4K, att den släpps under Apache 2.0 och att den har ett ”six-camera AI director mode”. Sex olika sajter, samma påståenden, och inte en enda länkade till en primärkälla.
Så jag öppnade Alibabas egen modellsida. 480P, 720P, 1080P. Ingen 4K. Sedan gick jag direkt mot Hugging Face API och hämtade varje repository under organisationen Wan-AI. Det nyaste är Wan2.2-Animate-2, uppladdat samma dag som Wan 3.0 lanserades. Det finns inget 3.0 över huvud taget.
Sedan gjorde jag den del som ingen annan gör. Wan 3.0:s huvudnummer är 30 sekunder sammanhängande video i ett enda pass, och jag har inte tillgång till den, så jag försökte återskapa resultatet med de modeller jag faktiskt kan anropa i dag. Jag misslyckades. Sättet jag misslyckades på visade sig vara det mest användbara i hela artikeln.
Viktigaste slutsatserna
- Wan 3.0 Preview gick in i offentlig beta den 6 augusti 2026. Modell-ID
wan3.0-video, låst bakom en ansökan på Alibaba Cloud Model Studio och Qwen Cloud. Det är inte öppen registrering. - De verkliga specifikationerna: upp till 30 sekunder i ett enda pass, 480P/720P/1080P, för $0.05/$0.10/$0.20 per output-sekund.
- Det finns ingen 4K och inga öppna vikter. Jag frågade Hugging Face API efter varje repo under
Wan-AI. Inget över Wan 2.2 finns som nedladdning. - Hastighetsgränserna är den verkliga flaskhalsen: 2 samtidiga förfrågningar, 30 RPM, 50 köade async-uppgifter.
- Du kan inte fejka 30-sekunders-one-taken med Wan 2.7. Tre odokumenterade begränsningar sätter taket för det längsta verkligt sammanhängande klippet vid 15 sekunder, och om man kedjar en andra fortsättning börjar modellen loopa bakåt i stället för framåt.
15-sekundersväggen: Vad Wan 3.0 Preview egentligen säljer
Här är det bästa resultat jag kunde få. Femton obrutna sekunder i 1080P: en inåkning mot en neonskylt, en försäljare som stänger ett kaffestånd på ett regnigt tak, sedan en kranrörelse ned till den våta gatan och en taxi. En sammanhängande genererad fil, ingen redigering, genererat ljud.

Femton sekunder sammanhängande Wan 2.7-video: neonskylt, takförsäljare, kranrörelse ned till en regnig gata och en taxi
Det längsta verkligt sammanhängande klippet som Wan 2.7-familjen producerade åt mig: 15 sekunder, 1080P, en fil. Här visat som en tyst GIF; den levererade filen innehåller 44,1 kHz stereoljud.
Det är bra. Det är också exakt hälften av vad Wan 3.0 påstår sig göra i ett enda anrop, och 15 sekunder är där taket är igensvetsat. Allt nedan handlar om hur jag hittade svetsfogen.
Varför nästan varje specifikationsblad om Wan 3.0 Preview du läser förmodligen är fel
Två saker gör den här lanseringen ovanligt stökig. För det första är 30 sekunder i ett enda genereringspass en genuin nyhet för familjen. Wan2.7-Video når som mest 15 sekunder och de flesta vanliga videomodeller ligger mellan 5 och 15 (TNGlobal, augusti 2026). För det andra tar Wan 3.0 emot referensindata som ingen annan tar: utöver text, bild, ljud och video accepterar den doc-, xls-, ppt-, pdf- och md-filer samt webbsidor, så att ett bildspel blir en video (AlphaSignal, augusti 2026).
Den kombinationen gav upphov till enorm bevakning från sajter som aldrig öppnade dokumentationen. Här är varje brett spritt påstående, kontrollerat mot primärkällan.
Tabell A: Specifikationskontroll för Wan 3.0 Preview
| Spritt påstående | Vad primärkällan säger | Omdöme |
|---|---|---|
| 30 sekunder i ett genereringspass | Bekräftat, jämfört med 2 till 15 s i Wan 2.7 | ✅ Sant |
| Native 4K-output | Officiella upplösningar är endast 480P, 720P och 1080P | ❌ Falskt |
| Apache 2.0 öppna vikter | Inget Wan 3.0-repository finns under Wan-AI på Hugging Face | ❌ Falskt |
| Document-to-video (PDF, PPT, XLS) | Bekräftat som en typ av referensindata | ✅ Sant |
| ”Six-camera AI director mode” | Förekommer inte i någon Alibaba-dokumentation | ❌ Saknar stöd |
| ”12-language lip sync with identity lock” | Förekommer inte i någon Alibaba-dokumentation | ❌ Saknar stöd |
| $0.05 / $0.10 / $0.20 per sekund | Bekräftat för 480P / 720P / 1080P | ✅ Sant |
| Öppen för alla | Ansökningsstyrd på Model Studio och Qwen Cloud | ⚠️ Beta, inbjudan krävs |
Priserna och hastighetsgränserna kommer direkt från modellsidan: 2 samtidiga förfrågningar, 30 förfrågningar per minut och en async-kö på 50 uppgifter (QwenCloud, augusti 2026). Den samtidighetsgränsen får nästan ingen uppmärksamhet, och den är den viktigaste raden på sidan. Två parallella jobb, som vardera tar minuter, är helt okej för en lanseringsdemo. Det är inte en pipeline.
Nu till frågan som open source-communityn faktiskt bryr sig om. Wan 2.1 och Wan 2.2 släpptes med nedladdningsbara checkpoints. Wan 2.5 utlovade vikter som aldrig dök upp, Wan 2.6 var helt stängd och Wan 2.7 förblev API-only. Jag kontrollerade om 3.0 bryter sviten genom att fråga Hugging Face API efter varje modell under organisationen Wan-AI, sorterat efter skapelsedatum. De tre nyaste repositorierna är alla Wan2.2-Animate-2-varianter skapade den 6 augusti 2026, samma dag som Wan 3.0 lanserades. Det mest nedladdade repot är fortfarande Wan2.2-TI2V-5B-Diffusers med ungefär 179 000 nedladdningar de senaste 30 dagarna (Hugging Face, augusti 2026).
Svaret är alltså nej, och Wan 2.2 är fortfarande taket för öppna vikter. Om din plan byggde på att köra detta lokalt eller finjustera det finns det ingenting att köra.
Wan 3.0 Preview-stacken: Vad du faktiskt kan köra i dag
Situationen delar upp sig tydligt. Wan 3.0 ligger bakom ett ansökningsformulär med ett tak på två samtidiga jobb. Allt före den, Wan 2.7 tillbaka till 2.2, kan anropas direkt med en enda API-nyckel, tillsammans med Seedance och Kling för jämförelser mellan modeller. Allt i den här artikeln kördes på det sättet, i en enda webbläsarflik.
Priserna nedan kom från Atlas Cloud model catalogue den 10 augusti 2026, inte från något blogginlägg.
Tabell B: Wan 3.0 Preview jämfört med det som finns på hyllan
| Modell | Längsta enskilda pass | Upplösningar | Åtkomst | Samtidighet | Listat pris per sekund |
|---|---|---|---|---|---|
| Wan 3.0 Preview | 30 s | 480P / 720P / 1080P | Ansökan krävs | 2 | $0.05 / $0.10 / $0.20 |
| Wan 2.7 text-to-video | 15 s | 720P / 1080P / 1080P-SR / 1440P-SR | Öppen | Standard | från $0.10 |
| Wan 2.7 image-to-video | 15 s | 720P / 1080P | Öppen | Standard | från $0.10 |
| Wan 2.6 text-to-video | 15 s | 720p / 1080p | Öppen | Standard | $0.07 (30% rabatt på $0.10) |
| Wan 2.5 text-to-video | 10 s | 720p / 1080p | Öppen | Standard | $0.035 (30% rabatt på $0.05) |
| Wan 2.2 image-to-video | 10 s | 480p / 720p | Öppen, vikter nedladdningsbara | Standard | $0.03 |
| Seedance 2.5 text-to-video | 30 s | 480p / 720p | Öppen | Standard | från $0.134 |
| Kling v3.0 Pro text-to-video | 15 s | Modellstandard | Öppen | Standard | $0.095 (15% rabatt på $0.112) |
Rabatterna är live per augusti 2026 och tidsbegränsade, så kontrollera modellsidan innan du budgeterar utifrån dem.
Två saker följer av den tabellen. Wan 3.0:s 30-sekunderspass i ett enda pass är inte längre unikt: Seedance 2.5 accepterar redan en varaktighet på 4 till 30 sekunder i ett enda anrop, bara begränsat till 720p. Och Wan 2.7 är den enda raden som erbjuder 1440P-SR, en superupplösningsnivå som enligt dess eget schema debiteras till 80% av native 1080P, vilket Wan 3.0 inte har.
Det Wan 3.0 har som inget annat har är 30 sekunder i 1080P i ett pass, plus dokument som referensindata. Wan 3.0 har en placeholder-sida på Atlas Cloud märkt Coming Soon, så den landar på samma nyckel när den släpps. Fram till dess visar jag exakt hur långt de äldre modellerna tar dig.
Wan 3.0 Preview-handledning steg 1: Skriv briefen för one-taken
Briefen följer med mellan genereringar, så skriv den en gång. Wan 3.0 belönar långa, tidskodade bildbeskrivningar, och Wan 2.7 accepterar samma struktur inom en promptgräns på 5 000 tecken.
Mallen som fungerar: Shot [timecode] + subject action + camera move + light + ambient audio. Slå fast att tagningen är sammanhängande i första raden, och beskriv ljudbädden uttryckligen, eftersom Wan 2.7 genererar ljud nativt och hittar på något ohjälpsamt om du lämnar det tomt.
Jag valde avsiktligt ett kaffestånd på ett regnigt tak om natten. Det stresstestar fyra saker som brukar gå sönder samtidigt: ihållande kamerarörelse, konsekvent ansikte över tid, våta neonreflektioner och en sammanhängande ambient ljudbädd.
text1BEAT 1 (0-10s): Slow dolly-in from a flickering pink-and-cyan neon sign toward a 2young female vendor wiping down a steel counter on a rooftop coffee stall. 3BEAT 2 (10-15s): The camera cranes down over the rooftop edge to the wet street 4below, gliding toward a taxi idling at the curb. 5Constant: heavy rain, neon palette, 35mm anamorphic, film grain, no cuts. 6
Det är planen, inte prompten. Prompterna du klistrar in finns nedan.
Steg 2: Generera öppningen i 1080P
Öppna Wan 2.7 text-to-video-sidan och klistra in Beat 1, fullt utskriven.
text1Continuous single take, no cuts. A rainy night rooftop coffee stall in Shenzhen. 2Shot [0-4s]: Slow dolly-in from a flickering pink-and-cyan neon sign toward a 3young female vendor wiping down a steel counter, rain streaking through the neon 4glow, steam rising from a kettle. 5Shot [4-10s]: The camera settles at chest height as she looks up and half-smiles, 6shallow depth of field, wet reflections on the counter, raindrops visible against 7the dark sky behind her. 8Audio: steady rain, distant traffic hum, the clink of a ceramic cup. 9Cinematic, anamorphic, 35mm, high dynamic range, fine film grain. 10
Inställningar: Resolution 1080P, Aspect ratio 16:9, Duration 10, Prompt extend OFF.
Prompt extend är på som standard och skriver om din prompt före genereringen, vilket i tysthet förstör tidskodad bildkontroll. Stäng av det när bildindelningen är själva poängen.
Sätt varaktigheten till 10 i stället för maxgränsen på 15 sekunder. Det är inte ett kostnadsbeslut, och skälet blir synligt först i steg 3.

Wan 2.7 text-to-video på Atlas Cloud, körning slutförd, 1080P-output synlig i OUTPUT-panelen
Steg 2 i playground: prompten inklistrad, 1080P, 16:9, körningen slutförd med resultatet till höger. Lägg märke till att Run-knappen anger $0.75 för ett femsekundersjobb i 1080P, vilket blir $0.15 per sekund snarare än katalogens ”från $0.10”.
Steg 3: Fortsätt den och se var den går sönder
Wan 2.7:s image-to-video-endpoint har ett videofortsättningsläge som tar ett befintligt klipp och fortsätter filma. Ta output-URL:en från steg 2, lägg den i video-fältet, sätt Duration till 15 och klistra in Beat 2:
text1Continue the same unbroken take with identical camera language and lighting. 2The crane-down continues past the rooftop edge to street level, the camera 3gliding forward through the rain toward a taxi idling at the curb, wipers 4sweeping. Keep the rain intensity, neon colour palette, film grain and ambient 5audio identical to the source clip. No cut, no fade, no scene change. 6
Det producerar 15-sekundersklippet överst i den här artikeln. Nu till de tre begränsningar jag stötte på, ingen av dem finns i dokumentationen.
Ett: källklippet måste vara 2 till 10 sekunder. Det är därför steg 2 är begränsat till 10. Genererar du en 15-sekundersöppning kan du inte förlänga den alls, eftersom en 15-sekundersfil inte är en giltig input.
Två: den begärda varaktigheten måste överstiga källans varaktighet. Mata in ett 10-sekundersklipp och be om 10 sekunder så avvisar API:t det direkt: first_clip duration (10s after trim) must be less than the requested duration (10s). Outputen innehåller alltså källan, och det mesta du kan vinna i ett pass är 5 sekunder.
Tre: den bevarar inte ditt källklipp. Det här är den viktiga delen. Nedan är översta raden originalklippet vid 5 s och 9,9 s. Nedersta raden är fortsättningsoutputen vid samma två tidskoder.

Fyra bildrutor som jämför källklippet och fortsättningsoutputen vid 5 sekunder och 9,9 sekunder
Översta raden: källklippet vid 5 s och 9,9 s. Nedersta raden: fortsättningsoutputen vid samma tidskoder. Vid 5 s matchar de. Vid 9,9 s är källan fortfarande kvar hos försäljaren medan fortsättningen redan har klippt till gatan, eftersom den komprimerade om källan till ungefär dess första sex sekunder och använde resten till nytt material.
Fortsättning är alltså inte sammanfogning. Den renderar om ditt klipp snabbare för att skapa utrymme, och de sista sekunderna av din ursprungliga prestation är helt enkelt borta.
Vilket väcker den uppenbara idén: kedja det. Mata in 15-sekundersresultatet igen och be om ytterligare 15. Jag försökte. Det här kom tillbaka.

En kedjad andra fortsättning som driver tillbaka till takförsäljaren i stället för att föra scenen framåt
Det andra fortsättningspasset. Det spelar upp gatan och taxin igen, och loopar sedan tillbaka till takförsäljaren från allra början av sekvensen i stället för att röra sig framåt. Kedjning ackumulerar inte.
Det är väggen. Output-taket är 15 sekunder, input-taket är 10, och den andra länken i kedjan går bakåt. Femton sekunder av verkligt sammanhängande material är taket för den här modellfamiljen. Allt längre är ett klipp, inte en tagning, och klipp är exakt det som ett 30-sekunderspass i ett enda drag finns till för att eliminera.
En upplysning: playground-inspelningen för det här fortsättningssteget misslyckades tre gånger eftersom sidans förinställda referensbild hela tiden tog över körningen, så steg 3 kördes via API:t i stället för playground-UI:t. Prompten, inställningarna och outputen ovan kommer alla från den faktiska körningen.
Vad 30 sekunder med Wan 3.0 Preview faktiskt kostar
Run-knappen i steg 2 angav $0.75 för ett femsekundersjobb i 1080P. Det är $0.15 per sekund, inte de $0.10 som katalogen listar, eftersom den listade siffran är ett golv och debiteringen skalar med upplösningen. Lita alltid mer på offerten än på kortet.
Vid den verkliga nivån kostade mina 15 sekunder sammanhängande material $1.50 för 10-sekundersöppningen plus $2.25 för fortsättningen, alltså $3.75 för 15 levererade sekunder.
Tabell C: vad 30 sekunder kostar, på fem sätt
| Väg | Beräkning | Totalt | Vad du faktiskt får |
|---|---|---|---|
| Wan 3.0 Preview, 1080P | $0.20 × 30 | $6.00 | 30 s sammanhängande, ett pass, inga skarvar |
| Wan 3.0 Preview, 720P | $0.10 × 30 | $3.00 | 30 s sammanhängande i 720P |
| Wan 3.0 Preview, 480P | $0.05 × 30 | $1.50 | 30 s sammanhängande i 480P |
| Wan 2.7, öppning plus fortsättning | $0.15 × 25 debiterade | $3.75 | Endast 15 s. Kan inte nå 30. |
| Seedance 2.5, 480p | från $0.134 × 30 | ~$4.05 | 30 s sammanhängande, begränsat till 720p |
Läs den fjärde raden igen. Att producera 15 sammanhängande sekunder på Wan 2.7 kostade mer än vad Wan 3.0 tar för 30 sammanhängande sekunder i 720P. Workarounden är inte det billiga alternativet, utan det dyra alternativet som dessutom inte fungerar.
En brasklapp om Seedance-raden: dess listade pris är 480p-golvet och modellen debiterar efter pixelarea, så 720p-körningar blir i praktiken ungefär 2,25 gånger den siffran.
Var försiktig med licenseringen. Wan 3.0 är i beta, så de kommersiella villkoren kommer från Alibaba Cloud-serviceavtalet du accepterar vid ansökningstillfället snarare än från någon modelllicens, och de kan ändras före allmän tillgänglighet. Utan publicerade vikter är lokal driftsättning och finjustering inte alternativ. Kontrollera krav på attribuering och vattenmärkning mot dina egna kontovillkor innan du levererar kundarbete.
Vanliga frågor
Är Wan 3.0 Preview tillgänglig för alla ännu?
Nej. Den gick in i offentlig beta den 6 augusti 2026, men åtkomsten är ansökningsstyrd via Alibaba Cloud Model Studio och Qwen Cloud. Godkända konton får 2 samtidiga förfrågningar, 30 RPM och en async-kö på 50 uppgifter, vilket är dimensionerat för utvärdering snarare än produktion.
Är Wan 3.0 Preview open source, och var finns vikterna?
Det finns inga. En fråga till Hugging Face API efter varje repository under organisationen Wan-AI returnerar ingenting över Wan 2.2. De tre nyaste repositorierna, alla Wan2.2-Animate-2-varianter, skapades samma dag som Wan 3.0 lanserades. Wan 2.2 är fortfarande taket för öppna vikter.
Gör Wan 3.0 Preview verkligen native 4K?
Nej. Den officiella dokumentationen listar 480P, 720P och 1080P. 4K-påståendet kommer från aggregatorsajter som citerar varandra i stället för primärkällan, och det motsäger Alibabas egen pristabell, som har exakt tre upplösningsnivåer.
Hur mycket kostar en 30-sekundersvideo med Wan 3.0 Preview?
I 1080P ger $0.20 per output-sekund $6.00 för 30 sekunder. I 720P är det $3.00 och i 480P är det $1.50. Som jämförelse kostade 15 sammanhängande sekunder på Wan 2.7 i 1080P mig $3.75 vid den faktiska debiterade nivån.
Kan jag generera en 30-sekunders-one-take i dag utan åtkomst till Wan 3.0 Preview?
Inte med Wan 2.7. Dess fortsättningsläge har ett output-tak på 15 sekunder, accepterar bara källklipp på 10 sekunder eller mindre och loopar bakåt när det kedjas. Seedance 2.5 klarar 4 till 30 sekunder i ett enda pass, men bara upp till 720p.
Wan 3.0 Preview kontra Wan 2.7: är den värd att vänta på?
Om du behöver en enda sammanhängande bild längre än 15 sekunder, eller dokument och webbsidor som referensindata, ja, och det finns ingen workaround. För allt på 15 sekunder eller kortare är Wan 2.7 mer praktisk just nu, eftersom ett tak på 2 samtidiga förfrågningar gör batcharbete långsammare på 3.0 än på modellen den ersätter.






