Wan 3.0 Multi-Shot Consistency: Jag räknade varje klipp i 110 officiella klipp
Du skrev ett manus med fyra bilder. Bild 1 landar perfekt: halmhatt, svart pärlhalsband, vit linnklänning, ljuset precis rätt. Bild 2 anländer och det är en annan kvinna i en annan hatt.
Det glappet är hela anledningen till att folk stirrar på Wan 3.0 multi-shot consistency, löftet om en prompt, sex bilder, trettio sekunder, samma karaktär genom hela.
Så jag slutade läsa specifikationsblad. Jag laddade ner alla 110 demofiler som Alibaba publicerade med sin egen Wan 3.0-skaparhandbok, körde ffmpeg över varje, analyserade alla 64 parade prompter, och gjorde sedan det ingen annan i sökresultaten har gjort: jag räknade de faktiska klippen i de levererade videorna och jämförde dem med det bildantal varje prompt bad om.
Tre fynd motsäger vad du kommer att läsa överallt annars.

Cinematisk färggraderingssvit där en vägg av monitorer visar samma halmhattskaraktär hållen över sex olika bilder, referenspunkten för Wan 3.0 multi-shot consistency
En kolorists referensvägg är den ärliga mentala modellen för multi-shot consistency: en identitet, sex inramningar, kontrollerade sida vid sida. Genererad med openai/gpt-image-2.
Viktiga slutsatser
- 6 bilder är verkligt men inte garanterat: 3 av Alibabas egna multi-shot-prompter träffade exakt det deklarerade antalet, 2 levererade för lite.
- Värsta fallet bad om 4 bilder och renderade 2.
- Ingen 4K. Noll av de 110 officiella filerna överstiger 1080p, och endast 4 är exakt 1920x1080.
- Rekvisita och kamera driver före ansikten. Titta på hatten, inte ögonen.
- Ingen offentlig Wan 3.0 API utanför Alibabas egen plattform ännu, så handledningen nedan bygger om det på modeller du kan anropa idag.
Här är bästa fallet, från Alibabas egen handbok. Sex bilder deklarerade i prompten, sex bilder levererade, samma två karaktärer, samma garderob, samma regn:

Sexbilds animerad sekvens på en regnig tågperrong, samma flicka med ett genomskinligt paraply och pojke med khaki ryggsäck hållen konsekvent över varje klipp
Alibabas officiella Wan 3.0 beta-demo (handboksklipp v013, 1280x720, 20,05s). Prompten numrerade bilder 1 till 6; ffmpeg hittar exakt 5 hårda klipp, så alla 6 bilder landade. Ej genererad av Atlas Cloud.
Vad Wan 3.0 Multi-Shot Consistency Egentligen Är
Kort version: det är tre separata löften under ett namn, och Alibaba är ovanligt specifika om vilka tre.
I sin lanseringsartikel delar Alibaba upp consistenc i karaktärer ("ansiktsdrag, hårstil och hårfärg, kroppsform, kläder och accessoarer"), rekvisita ("multi-angle framträdande, hårdvarustruktur, logotyper och materialdetaljer") och rum ("karaktärsblockering och kameraperspektiv") (Alibaba Cloud, 2026). Den treskiktsindelningen är betygsättningsrubriken för allt nedanför. Samma ansikte, fel halsband, är underkänt.
Modellen genererar upp till 30 sekunder i ett jobb, vid 480P, 720P eller 1080P (Alibaba Cloud, 2026).
Nu delen som sökresultaten får fel.
| Vanligt påstående i sökresultat | Vad förstapartsmaterialet faktiskt visar |
|---|---|
| "Native 4K-generering" | Det officiella inlägget listar endast 480P / 720P / 1080P. Bland 110 officiella demofiler överstiger inget 1080p, och bara 4 filer är exakt 1920x1080. Det vanliga "1080p"-landskapsutmatet är 1920x1072. |
| "Upp till 6 oberoende bilder per generation" | Ingen bildantalsspecifikation visas i Alibabas eget lanseringsinlägg. Empiriskt håller det: av 8 uttryckligen multi-shot-prompter i handboken är det högsta någon deklarerar 6, och två av dem levererade 6. |
| "Upp till 12 referensbilder" | Hands-on-testning rapporterar upp till 10 bilder plus 5 videoklipp plus 5 ljudklipp (Curious Refuge, 2026). Alibabas inlägg ger inget antal alls. |
| "Öppna vikter, Apache-2.0" | Tidigare Wan-utgåvor var öppna vikter; Wan 3.0 levereras som en plattformstjänst och inga vikter har dykt upp (Curious Refuge, 2026). |
| "API:et är ute" | Det körs på Alibaba Cloud Model Studio. Tredjeparts inferensplattformar har det inte ännu. |
Och det här är tabellen som tog längst tid att bygga. Varje siffra är min, från ffmpeg-scendetektering på den levererade filen jämfört med bildantalet som skrevs i den parade prompten:
| Officiell demo | Prompt deklarerar | Hårda klipp hittade | Bilderna levererade | Utfall |
|---|---|---|---|---|
| v013 regnig perrong, anime | 6 bilder | 5 | 6 | Exakt |
| v055 golden retriever-dagbok | 6 bilder, 30,0s | 5 | 6 | Exakt |
| v021 ramenbutik och kattunge | 4 bilder | 3 | 4 | Exakt |
| v008 skogssjö, 3D | 4 bilder | 2 | 3 | En kort |
| v085 kvinna med halmhatt | 4 bilder | 1 | 2 | Hälften |
| v041 hall till magisk gränd | 3 segment, "inget hårt klipp" | 0 | 1 kontinuerlig tagning | Exakt som begärt |
| v045, v084, v102 | 3 / 5 / multi-subject | För många att lösa | Inte räkningsbart | Snabbt klipp och bläcktonad strobing besegrar detektering |
Läs de mittersta raderna igen. Tre prompter träffade sitt antal prick. Två gjorde det inte. Bildantalet du skriver är en begäran, inte ett kontrakt.
Varför Wan 3.0 Multi-Shot Consistency Brister: 4 Felsätt
Utfall först: det brister sällan på ansiktet. Det brister på objekten och kameran, och det brister hårdast när du ändrar flera saker samtidigt.
Här är klippet som lärde mig mest, eftersom det är den sämsta prestandan i Alibabas egen showcase.
GtZy2TUK4ak
Alibabas officiella Wan 3.0 beta-demo (handboksklipp v085, 1240x742, 30,08s). Prompten skriptar fyra tidskodade bilder. ffmpeg hittar ett riktigt klipp, vid 9,3s. Bild 3 och 4 kollapsar i en enda hållen tagning som tonar till svart. Ej genererad av Atlas Cloud.
Felsätt 1: rekvisita driver före ansikten. I det klippet, titta på den inledande tagningen ensam, innan något klipp sker. Vid 0,6s har båt-hatten ett tunt svart band och berlocken är en facetterad marinblå sten. Vid 9,2s är bandet ett brett svart band och berlocken är en slät blank svart droppe. Hennes ansikte är stabilt hela tiden. Accessoarerna är inte.

Två bildrutor från samma kontinuerliga nio sekunder långa tagning, sida vid sida, som visar att hattbandet breddas och halsbandets berlock ändrar form och färg
Båda bildrutorna kommer från samma obrutna tagning av den officiella v085-demon, 8,6 sekunder isär, inget klipp mellan dem. Hattband och berlock ändras båda. Detta är rekvisitaskiktet som misslyckas medan karaktärsskiktet håller.
Det är därför acceptanstestet som faktiskt fungerar är en rekvisitakontrollista, inte en vibekontroll. För den här karaktären är det tre saker: hattform och band, pärlhalsband och berlock, klänningsringning.
Felsätt 2: multi-subject-scener håller individuellt och suddas vid kontakt. Varje karaktär förblir igenkännlig ensam. Placera dem i samma bild, interagerande, och identiteterna blöder. Oberoende testning fann samma sak: "Karaktärskonsistens började brytas ner, och kompositeringen såg ibland mer ut som en dålig green screen-effekt än en naturligt genererad miljö," med läppsynk utpekad som den enskilt största svagheten (Curious Refuge, 2026).
Felsätt 3: du ändrade fyra variabler i en rad. Ny plats plus ny kameravinkel plus ny belysning plus nytt garderobstillstånd är det pålitliga sättet att förlora en identitet. Handbokens egna prompter bekämpar detta genom att omformulera hela kostymen i varje segment. Bland de 64 parade promptarna säger 9 uttryckligen "förblir oförändrad", 5 fäster kamerapositionen och 4 kräver att karaktären förblir identisk.
Felsätt 4: 30 sekunder i ett jobb är inte 30 sekunder av en tagning. Dessa är olika produkter. Ett 30s multi-shot-jobb klipper mellan inramningar. Om du vill ha en kontinuerlig obruten tagning, försämras kedjning av fortsättningar: identitetsfel ackumuleras vid varje överlämning, så den rena enkla tagningen är kort av naturen.
Handboken har exakt en prompt som får sömlöshet rätt, och det är värt att kopiera meningsstrukturen:

Tre promptsegment renderade som en obruten kontinuerlig tagning, från en lägenhetshall genom en dörr in i en lampupplyst gotisk gränd
Alibabas officiella Wan 3.0 beta-demo (handboksklipp v041, 720x1280, 15,04s). Tre promptsegment, och ffmpeg hittar noll hårda klipp, vilket är exakt vad prompten krävde. Ej genererad av Atlas Cloud.
Dess överlämningsrad, översatt, är det mest återanvändbara i hela handboken: fortsätt sömlöst från den sista bildrutan i föregående segment; karaktären, garderoben, platsen och kamerapositionen förblir helt identiska; inget hårt klipp och ingen abrupt scenövergång. Endast en prompt av 64 använder den. Stjäl den.
Multi-Shot Consistency-arbetsflödet du kan köra idag
Frågan är: var kör du det här egentligen?
Just nu lever Wan 3.0 på Alibabas egen Model Studio. Ingen tredjeparts inferensplattform är värd för det. På Atlas Cloud visas det bara som en kommande-snart-post med noll live-slutpunkter, vilket är det ärliga tillståndet och värt att säga rakt ut snarare än att låtsas annat.
Så du har två alternativ: vänta, eller sluta be en prompt göra sex saker.
Det andra alternativet är bättre ändå, och min klippräkning är argumentet för det. Ett enda multi-shot-jobb gav dig ett bildantal som missade med hälften i Alibabas egen showcase. Att dela upp jobbet ger dig tillbaka den kontrollen:
- Lås utseendet en gång, som en stillbild.
- Klona den identiteten till en nyckelbild per bild, ändra exakt en variabel varje gång.
- Animera varje bild separat med referensen låst.
- Sy ihop lokalt.
Långsammare att ställa in, dramatiskt mer förutsägbart. Och varje modell i kedjan är anropsbar idag.
| Steg | Modell | Roll i kedjan | Listpris |
|---|---|---|---|
| 1 | bytedance/seedream-v5.0-pro/text-to-image | Lås karaktärens utseende | $0,045 / bild |
| 2 | google/nano-banana-2/edit | Klona identiteten till varje bilds nyckelbild | $0,08 / bild |
| 3 | alibaba/wan-2.7/reference-to-video | Animera varje bild med referensen låst | $0,10 / sekund |
| Alt | alibaba/wan-2.7/text-to-video | En prompt, många bilder (minst kontrollerbart) | $0,10 / sekund |
| Fix | alibaba/wan-2.7/video-edit | Reparera en felaktig rekvisita utan att regenerera | $0,10 / sekund |
Värt att veta för frågan "bästa modell för multi-shot consistency": reference-to-video är en hel kategori nu. bytedance/seedance-2.0-fast/reference-to-video kör $0,072/s (20% rabatt på $0,09, från och med augusti 2026), kwaivgi/kling-video-o3-pro/reference-to-video $0,095/s (15% rabatt på $0,112), minimax/h3/reference-to-video $0,10/s, och google/veo3.1/reference-to-video $0,20/s. Alla priser verifierade mot livekatalogen den 21 augusti 2026.
En varning innan stegen: listpriser är ett golv, inte en offert. Upplösning och varaktighet flyttar det verkliga numret, så läs Kör-knappen innan du förbinder dig.
Hur man bygger Wan 3.0-stil Multi-Shot Consistency, Steg för Steg
Vi bygger om exakt det beat sheet som Alibabas egen modell fumlade: kvinnan med halmhatt, fyra bilder, trädgård till bil. Samma manus, bild-för-bild-kontroll, och den här gången får du fyra bilder för att du renderade fyra.
Låt oss börja.
Steg 1: lås utseendet. En bild blir identitetsankaret för allt nedströms. Generera den på Seedream v5.0 Pro, 16:9, högsta upplösningen sidan erbjuder. Namnge de tre kontrollpunkterna för rekvisita explicit, för det är dessa som driver.
plaintext135mm film still, vintage sunlit rose garden. An elegant young woman wearing a 2natural straw boater hat with a black band, a black beaded necklace with a single 3teardrop pendant, and a white sleeveless linen dress. She stands before a wall of 4blooming pink and cream roses, one hand lightly touching the brim of her hat, 5gentle and thoughtful gaze just off camera. Soft warm natural light, dappled sun 6flare, shallow depth of field, fine film grain, medium close-up.

Seedream v5.0 Pro-lekplats på Atlas Cloud med halmhattsprompten inmatad och den färdiga karaktärsnyckelbilden renderad i utmatningspanelen
Steg 1 slutfört: identitetsankaret för hela fyrabildssekvensen.
Steg 2: klona identiteten till bild 2 till 4. En nyckelbild per bild, en körning var, med Nano Banana 2 Edit med utmatningen från steg 1 som referens. Disciplinen som spelar roll: återställ hela garderoben varje gång, ändra sedan exakt en sak.
Bild 2, den känslomässiga vändningen:
plaintext1Keep the exact same woman from the reference image: identical face, identical 2natural straw boater hat with black band, identical black beaded necklace with a 3teardrop pendant, identical white sleeveless linen dress. New shot: cinematic 4close-up, she slowly lifts the straw hat off her head and lowers her chin, a faint 5wistful expression. Same rose garden background. Strictly preserve the same 6lighting, skin tone, film grain and colour grade as the reference.
Bild 3, klippet till bilen:
plaintext1Keep the exact same woman from the reference image: identical face, identical black 2beaded necklace with a teardrop pendant, identical white sleeveless linen dress, 3the straw boater hat now resting on her lap. New shot: back seat of a moving car, 4side profile, her hand propped against the door, gazing out a rain-beaded window, 5blurred green foliage rushing past. Overcast light with a warm interior fill, 6shallow depth of field, elegant melancholy. Strictly preserve the same face, the 7same colour grade and the same 35mm film grain as the reference.
Bild 4, den sista blicken:
plaintext1Keep the exact same woman from the reference image: identical face, identical black 2beaded necklace with a teardrop pendant. New shot: extreme facial close-up beside 3the car window, eyes slowly closing, a calm and released expression. Raindrops 4slide down the glass in front of her, focus shifting onto the droplets, background 5falling into bokeh. Wong Kar-wai style cinematic mood, fine film grain. Strictly 6preserve the same face, the same lighting and the same colour grade as the 7reference.

Nano Banana 2 Edit-lekplats på Atlas Cloud med steg 1-nyckelbilden laddad som referens och bild 2-nyckelbilden renderad, identitet och garderob hållen
Steg 2 slutfört: bild 2:s nyckelbild, samma kvinna, hatten nu i hennes händer.
Steg 3: animera bild 1 med referensen låst. Nu blir varje bild video oberoende på Wan 2.7 reference-to-video. Inställningar: 720P, 5 sekunder, och släpp steg 1-nyckelbilden i bildplatsen. Kontrollera Kör-knappens offert innan du avfyrar.
plaintext1Shot 1 of 4. Reference image 1 defines the character: keep the same face, the same 2natural straw boater hat with black band, the same black beaded necklace with a 3teardrop pendant and the same white sleeveless linen dress identical for the entire 4clip. 35mm film look, vintage sunlit rose garden. The woman lightly touches the 5brim of her hat as a soft breeze lifts strands of her hair; the camera pushes in 6very slowly. Warm natural light, dappled sun flare, shallow depth of field, fine 7film grain. The camera position stays stable. No hard cut and no scene change.

Wan 2.7 reference-to-video-lekplats på Atlas Cloud med nyckelbilden i bildplatsen och det färdiga femsekundersklippet som spelas i utmatningspanelen
Steg 3 slutfört: det referenslåsta klippet renderat i utmatningspanelen.
Och här är vad som kom ut:

Femsekunders referenslåst klipp av kvinnan med halmhatt i rosenträdgården, hattband och halsband håller stadigt genom hela
Vår egen körning på Atlas Cloud, inte en Alibaba-demo. Visad som en tyst GIF; den levererade filen har ett ljudspår.
Steg 4: kedja bild 2 till 4, sy sedan ihop. Upprepa steg 3 för varje återstående nyckelbild, och klistra in överlämningsmeningen från handboken överst i varje efterföljande prompt:
plaintext1Continue seamlessly from the last frame of the previous segment. The character, 2the wardrobe, the location and the camera position stay completely identical. 3No hard cut and no abrupt scene transition.
Sammanfoga sedan lokalt med ffmpeg och kör de tre kontrollpunkterna: hattform och band, pärlhalsband och berlock, och om inramningsprogressionen mellan bilderna faktiskt är vettig. Om exakt en rekvisita är fel i en bild, regenerera inte bilden. Skicka den genom wan-2.7/video-edit och ändra bara den, med lån av handbokens formulering: behåll handlingarna, garderoben och resten av bildrutan oförändrade.
Variationer: Multi-Subject-scener och Stil-lås
Tre mönster från handboken värda att stjäla.
Karaktärskort för multi-subject-bilder. När två eller fler personer delar bildrutan, tilldelar de officiella promptarna bokstavsbetecknade karaktärskort och återdeklarerar varje persons fulla kostym i varje segment. Verbalt, fult, och det fungerar bättre än pronomen.
Global stil-deklaration för stiliserat arbete. Bläckton, cel-animation och andra tunga stilar behöver stilen fästas en gång för hela stycket, sedan ett tidskodat beat sheet under det.

Bläcktonad kampsportssekvens med en svärdsman i bambulund, stil låst över ett tidskodat fem-beat-slagsmål
Alibabas officiella Wan 3.0 beta-demo (handboksklipp v084, 20,05s, beskuren). Fem tidskodade beat under en global bläcktonad stil-deklaration. Det stroboskopiska penselarbetet är varför automatisk klippdetektering inte kan räkna detta. Ej genererad av Atlas Cloud.
Fixera, regenerera inte. En video-edit-pass på en felaktig rekvisita är billigare än en ny rendering och kan inte förstöra de bilder som redan var rätt.
Vad en Fyrabildssekvens Kostar
Konkreta siffror för sekvensen byggd ovan, till listpriser:
- 1 identitetsankare på Seedream v5.0 Pro: $0,045
- 3 bildnyckelbilder på Nano Banana 2 Edit: 3 x $0,08 = $0,24
- 4 klipp på 5s, 720P, på Wan 2.7 reference-to-video: 20s x $0,10 = $2,00
- Totalt: cirka $2,29 för en 20 sekunder lång, fyrabilds, identitetslåst sekvens
Sträck ut det till en sexbilds 30-sekundersbit och videoraden blir $3,00, landar nära $3,44 allt som allt.
Två ärliga reservationer. För det första är listpriser ett golv: upplösningsnivåer och varaktighet ändrar den verkliga avgiften, och lekplatsens egen Kör-offert är det enda numret som binder, vilket är anledningen till att skärmbilderna ovan betyder mer än denna lista. För det andra, på Wan 3.0 själv, prissätter Alibaba Model Studio-videogenerering per sekund efter upplösningsnivå, men jag kunde inte bekräfta de exakta Wan 3.0 per sekund-priserna från en förstapartssida, så jag citerar inte siffror jag inte kunde verifiera.
Värt att notera vad du köper med split-job-ansatsen: inte ett lägre pris, utan ett bildantal som matchar ditt manus. Baserat på bevis från Alibabas egen showcase är det inte något ett enda 30-sekundersjobb kan lova dig ännu, och det är det praktiska svaret på Wan 3.0 multi-shot consistency tills API:et öppnas.
Vanliga Frågor
Hur många bilder kan Wan 3.0 hålla konsekvent i en generation?
Sex, baserat på nuvarande bevis, med en reservation. Alibabas lanseringsinlägg publicerar ingen bildantalsspecifikation. Bland de 8 uttryckligen multi-shot-promptarna i dess officiella handbok är det högsta någon deklarerar 6, och två av dem levererade exakt 6 klippverifierade bilder. Behandla 6 som ett observerat tak, inte en garanti.
Genererar Wan 3.0 verkligen native 4K?
Nej. Det officiella inlägget listar endast 480P, 720P och 1080P. Bland alla 110 officiella demofiler överstiger inget 1080p, endast 4 filer är exakt 1920x1080, och det vanliga landskapsutmatet är 1920x1072. Bildfrekvenser delar sig 24fps för 63 filer och 30fps för 46.
Är Wan 3.0 API:et tillgängligt, och var kan jag köra det?
Det körs på Alibaba Cloud Model Studio. Ingen tredjeparts inferensplattform är värd för det ännu; Atlas Cloud listar det som en kommande-snart-post med inga live-slutpunkter. Om du behöver multi-shot-utdata denna vecka är Wan 2.7 reference-to-video-kedjan ovan den fungerande ersättningen.
Varför ändras mina karaktärer fortfarande mellan bilder även med en referensbild?
Vanligtvis för att en prompt ändrade platsen, kameravinkeln och belysningen samtidigt. Ändra en variabel per bild, och återställ hela garderoben i varje prompt. Kontrollera också rätt saker: i Alibabas egen demo höll ansiktet stadigt medan hattbandet och halsbandsberlocken båda ändrades inom en enda obruten tagning.
Är Wan 3.0-vikterna öppen källkod?
Inga vikter har släppts. Tidigare Wan-versioner var nedladdningsbara och körbara lokalt, medan Wan 3.0 levereras som en värd plattformstjänst. Alla som citerar en Apache-2.0-licens för Wan 3.0 upprepar något utan förstapartskälla bakom.
Vad är det snabbaste sättet att få multi-shot consistency utan Wan 3.0-åtkomst?
Fyra steg: lås en identitetsbild, klona den till en nyckelbild per bild med ändring av en enda variabel varje gång, animera varje bild med reference-to-video, sy sedan ihop lokalt och kontrollera din rekvisita. Ungefär $2,29 och cirka en halvtimme för en fyrabildssekvens.
Metod: alla 110 demofiler och 64 parade prompter kommer från Alibabas officiella Wan 3.0-skaparhandbok, arkiverad lokalt den 11 augusti 2026. Metadata lästes fil för fil med ffmpeg; bildantal kommer från ffmpeg-scenändringsdetektering vid en tröskel på 0,2, korskontrollerad mot extraherade bildrutor; promptstruktur analyserades programmatiskt. Atlas Cloud-priser verifierades mot live-modellkatalogen den 21 augusti 2026.
Källor: Alibaba Cloud (augusti 2026); Curious Refuge (2026).






