Seedance 2.5 är nu live — Först på Atlas Cloud

Wan 3.0 Multimodal Reference tar 20 tillgångar, och en PDF är en av dem.

Wan 3.0 multimodal referens tar emot 20 tillgångar i ett anrop: bilder, video, ljud, PDF-filer, till och med en URL. Se Alibabas egna resultat och ett arbetsflöde som du kan köra idag.

Du byggde en mapp för en 15-sekundersreklam. Två karaktärsbilder. En varumärkesvideo som kunden skickade. En varumärkesbok som bara finns som PDF. Ett röstprov från skådespelaren du faktiskt ville ha.

Sedan öppnade du din videomodell och den bad om en bild.

Så du gjorde som alla andra. Du översatte mappen till en prompt på 800 ord och bad. Ansiktet drev iväg i bild tre. Jackan bytte färg. Rösten var någon helt annan.

Wan 3.0:s omni-reference är första gången en videomodell säger: okej, ge mig mappen. Upp till 20 tillgångar i ett enda anrop, över fem typer av indata, sammanhållna i en enda kontinuerlig 30-sekunderstagning.

Den här artikeln gör tre saker och hoppar över resten. Den bryter ner vad de där 20 tillgångarna faktiskt är, den använder Alibabas egna genererade klipp som bevis, och den ger dig ett motsvarande arbetsflöde du kan köra idag, eftersom Wan 3.0 fortfarande är i öppen beta på Alibabas eget moln och ännu inte kan anropas från tredjepartsplattformar.

Viktiga slutsatser

  • Wan 3.0:s multimodala referens accepterar upp till 20 tillgångar i ett anrop, som omfattar bilder, videor, ljud, dokument och live-webbsidor, och håller dem konsekventa över en enda 30-sekunderstagning.
  • Det är den första mainstream-videomodellen som behandlar en PDF, en presentation eller en webbadress som en kreativ indata snarare än något du parafraserar till en prompt.
  • Wan 3.0 gick in i öppen beta den 6 augusti 2026 på Alibaba Cloud Model Studio och Qwen Cloud som wan3.0-video. Det är stängda vikter. Alla som säger att det redan är Apache 2.0 gissar.
  • Rubriken om 20 tillgångar är inte där den faktiskt sticker ut. Reference-to-video-modeller du kan anropa just nu accepterar redan fler än 20 tillgångar. Gapet är dokument och webbsidor, inte antalet.
  • Du kan testa formatet med två karaktärer, referenslåst och helt röststyrt gratis med Atlas Clouds kostnadsfria AI-reklamskitgenerator: fyra produktbilder in, ett 15-sekunders talat skit ut, inget kort.

Fluffy cat and black cat running down a grand hotel hallway

Två katter jagas genom fem olika miljöer av Wan 3.0 utan karaktärsdrift_Två referensbilder. Fem helt olika miljöer, från en hotellkorridor till en tvättmaskinstrumma till en röd telefonkiosk. Inte en enda bildruta med drift. Källa: Alibabas officiella_ Wan 3.0 creator handbook _ , augusti 2026, som också är källan till alla andra Wan 3.0-klipp i den här artikeln.

Varför Multi-Reference Video fallerar, och vad Wan 3.0 Multimodal Reference förändrar

Videomodeller har inget minne mellan klipp. Varje generation börjar från noll. Det är hela problemet i en mening.

Så i samma stund som din berättelse behöver mer än en tagning, sys du ihop. Tagning ett ger dig ett ansikte du älskar. Tagning två ger dig en kusin till det ansiktet. Tagning tre byter tyst jackan från plommon till burgundy, och när du märker det har du redan betalat för elva renderingar.

Enkelbildsreferens hjälpte, men den låste bara en sak. Ett ansikte. Den kunde inte samtidigt hålla ett ansikte, en outfit, en rekvisita, en plats och en röst, eftersom det fanns en plats och fem jobb.

Det finns två vägar ut. Ge modellen fler platser, eller sluta få den att börja om. Wan 3.0 gör båda samtidigt, och det är därför de två rubrikfunktionerna egentligen är en funktion. En inbyggd 30-sekunderstagning innebär att det inte finns någon klippning för karaktären att driva över. Tjugo referenstillgångar innebär att varje element som måste förbli fast får sin egen dedikerade plats istället för att kämpa om en.

Här är vad det ser ut när inget sys ihop. Trettio sekunder, en kontinuerlig kamera, ett barn i en shoppingvagn som hamnar inbäddad i en reklamskylt och sedan går ut underifrån.

En hel 30 sekunder i ett pass, utan klipp, med ljudspåret genererat i samma pass. Källa: Alibabas officiella Wan 3.0 creator handbook.

Vad "20 tillgångar" faktiskt innebär inuti Wan 3.0 Multimodal Reference

Tjugo är ett rubriknummer. Det som spelar roll är att de tjugo inte alla är samma typ av sak. Wan 3.0:s omni-reference täcker fem indatatyper, och varje styr en annan axel av utdata.

Bilder styr identitet. Ett karaktärskort, en produktbild, en platsbild. Wan 3.0 kallar detta pixel-level consistency, och i Alibabas egna exempel sträcker sig låset bortom ansiktet till garderoben: den lagerlagda gråa kappan, det remmade läderbröstet, det mörka midjebandet överlever en sexton sekunder lång närstrid över tre platser.

Young man in traditional Chinese robes standing outdoors at sunset

Två karaktärskort som driver en wuxia-stridsscen med kostymdetaljer hållna bildruta för bildruta

Två karaktärskort plus en platsbild av vassbänken. Garderoben och miljön håller genom varje kast. Visas här som en tyst GIF; den levererade filen har en 44,1 kHz stereomix. Källa: Alibabas officiella Wan 3.0 creator handbook.

Ljud styr röst. Det här är delen som gör "multimodal" till mer än marknadsföring. Du bifogar ett röstprov per karaktär, skriver replikerna i prompten, och dialogen kommer tillbaka i den klangfärgen, lip-synkad, i samma pass som bilden. Två personer, två röstreferenser, ett gym.

Två motivbilder plus två separata röstreferensklipp, och dialogen kommer tillbaka i dessa två röster. Värt att sätta på ljudet för denna. Källa: Alibabas officiella Wan 3.0 creator handbook.

Video styr timing. En referensvideo är inte till för att kopieras. Den är till för att donera sin rytm: hur länge en takt hålls, hur en övergång rör sig. I denna levererar fem nyckelbilder motiven och en referensvideo levererar den horisontella kortflipptakten mellan dem.

Woman wearing an elaborate traditional Chinese headdress and blue embroidered dress

Fem nyckelbilder flippade genom med takten från en referensvideo_Fem_ nyckelbilder för motiven, en referensvideo för flipptakten. Källa: Alibabas officiella Wan 3.0 creator handbook.

Dokument och webbsidor styr struktur. Det här är den verkligt nya. Wan 3.0 accepterar dokumentfiler och live-URL:er som kreativ indata, och rapportering om betan listar .doc, .xls, .ppt, .pdf och .txt bland de accepterade formaten (AlphaSignal, augusti 2026). Samma logik fungerar redan med en storyboardbild: en storyboard in, sex tagningar ut, i storyboardens egen ordning.

Two people with umbrellas stand on a rainy train station platform

En enda storyboard utökad till sex sekventiella tagningar på en regnig tågstationsplattform

En storyboard som referens, sex tagningar genererade i dess ordning, ända ner till lappen som byter händer i tagning fem. Källa: Alibabas officiella Wan 3.0 creator handbook.

Första och sista bildrutor styr ändpunkter. Den äldsta knepet i boken, fortfarande stödd, fortfarande det snabbaste sättet att avgränsa en tagning.

Här är hur det staplas mot den version de flesta faktiskt använder idag.

Wan 2.7 Reference-to-VideoWan 3.0 omni-reference
Referenstillgångaren bild per motiv, upp till 3 videor, 1 röstklippupp till 20 tillgångar totalt
Modaliteterbild, video, ljudbild, video, ljud, dokument, webbsida
Max varaktighet, ett pass10 s30 s inbyggt, plus smart duration
Ljud i samma passjaja
Videoredigering och förlängninginte exponeratinstruktions- och referensbaserad redigering, plus förlängning
Tillgänglighetlive på tredjeparts-API:erAlibaba Cloud Model Studio och Qwen Cloud beta

Det finns en regel som ingen skriver i dokumentationen och alla lär sig den hårda vägen: en referens, ett jobb. Bild1 låser ansiktet och outfiten. Video1 donerar endast rörelse. Ljud1 donerar endast klangfärg. I samma stund som du ger en enda tillgång två motstridiga jobb, eller laddar upp en referensbild med två personer i, måste modellen gissa, och gissning är precis vad du försökte stoppa. Alibabas handbok är tydlig med detta också: ett motiv per referensbild.

Wan 3.0 Multimodal Reference-arbetsflödet du kan köra idag

Rakt svar först. Wan 3.0 är i öppen beta på Alibabas eget moln, under modell-id wan3.0-video (Alibaba Wan, augusti 2026). Det har inte landat på tredjeparts API-plattformar än, inklusive Atlas Cloud. Alla som säljer dig Wan 3.0 API-åtkomst just nu säljer något annat.

Vad som har landat är arbetsflödesformen. Referenspaket in, ett anrop, färdigt klipp med ljud ut. Det körs idag på reference-to-video-modeller som du kan anropa i en webbläsarflik, och när du ställer upp dem alla ser rubriken om 20 tillgångar annorlunda ut.

ModellReferenstillgångarModaliteterMax varaktighetInbyggt ljudPris per sekund
Wan 3.0 (Alibaba beta, inte på Atlas)20 totaltbild, video, ljud, dokument, webbsida30 sJarapporterat $0,05 till $0,20 per upplösning
Wan 2.7 Reference-to-Video1 bild per motiv, 3 videor, 1 röstklippbild, video, ljud10 sJa$0,10
Seedance 2.5 Reference-to-Video50 (30 bild / 10 video / 10 ljud)bild, video, ljud30 sJa$0,13
MiniMax H3 Reference-to-Videoblandad, ingen angiven gränsbild, video, ljud15 sJa$0,10
Kling Video O3 Pro Reference-to-Video7 bilder, eller 4 bilder + 1 videobild, video15 sJa$0,10
Vidu Q3-Mix Reference-to-Video4 bilderbild16 sJa$0,11
Veo 3.1 Reference-to-Video3 bilderbild8 sValfritt$0,20

Priserna är Atlas Cloud priser per augusti 2026. Wan 3.0:s siffror är de som rapporterats för Alibaba Cloud beta, inte en Atlas-pris, och Alibaba har inte publicerat en offentlig prissida för modellen än, så behandla den raden som preliminär.

Läs den tabellen två gånger så syns den verkliga historien. Rubriken om 20 tillgångar är inte där Wan 3.0 sticker ut, eftersom Seedance 2.5 redan tar 50 och matchar 30 sekunderna. Vad inget annat på den listan tar är en PDF.

För genomgången nedan körs demon på Wan 2.7 Reference-to-Video, eftersom dess indataform är den närmaste levande släktingen till omni-reference: flera motivbilder, en valfri referensvideo och ett röstklipp, alla mappade till character1 och character2-etiketter inuti prompten. Tre modeller, en webbläsarflik, ingen lokal installation.

Bygg det själv: En multimodal referensscen i fyra steg

Scenen: en pastellfärgad hotellreception. En dödstrött concierge. En resenär som håller en ragdollkatt. Conciergen tittar rakt ner i linsen och säger "Katten har en reservation. Det har inte du."

Två bilder plus ett röstklipp, vilket är tre referenstillgångar över två modaliteter. Det är den minsta konstruktionen som är ärligt multimodal snarare än bara multi-bild.

Steg 1. Generera referensbild 1, motivet du måste låsa

Referensbilder har tre jobb och bara tre: ett motiv, vänd mot kameran, ren bakgrund. Allt annat är dekoration. Använd GPT Image 2 med kvalitet high, storlek 16:9, n=1.

Plain
1Full-body studio portrait of a middle-aged hotel concierge with a deadpan expression, standing dead-centre against a flat dusty-pink wall. He wears a plum-purple double-breasted bellhop uniform with gold piping and brass buttons, a small round pillbox hat, and a thin moustache. Perfectly symmetrical framing, even soft frontal light, no cast shadow on the wall, 35mm film grain, muted pastel palette. One subject only, no other people, no text, no logo, no props in frame.

AI image generator interface showing numbered steps and a generated bellhop

GPT Image 2-lekplatsen på Atlas Cloud med conciergereferensporträttet renderat i utdatapanelen

GPT Image 2 på Atlas Cloud: kvalitet high, 16:9, ett motiv, platt bakgrund. Detta är filen som blir character1.

Steg 2. Generera referensbild 2, det andra låsta motivet

Samma modell, samma inställningar. Färgkontrasten mellan de två karaktärerna är avsiktlig, eftersom den ger modellen ett enkelt sätt att hålla isär dem när de delar bildruta.

Plain
1Full-body studio portrait of a young woman traveller holding a fluffy ragdoll cat against her chest, standing dead-centre against a flat mustard-yellow wall. She wears a mustard wool coat, a red beret and round tortoiseshell glasses, and holds a small vintage leather suitcase in her free hand. Perfectly symmetrical framing, even soft frontal light, no cast shadow on the wall, 35mm film grain, muted pastel palette. One subject only, no other people, no text, no logo.

Steg 3. Generera röstreferensen, som är den faktiska multimodala delen

Röstklippet är vad som gör detta från ett multi-bildjobb till ett multimodalt. Wan 2.7:s ljudplats vill ha ett kort prov, ungefär 1 till 10 sekunder, så håll repliken kort. Använd MiniMax Speech 2.6 HD och välj en låg, platt, obekymrad mansröst.

Plain
1Good evening. Checking in? Of course. Everyone is.

Steg 4. Ett anrop, tre referenser, ett färdigt klipp

Nu läggs hela paketet in tillsammans på Wan 2.7 Reference-to-Video. Inställningar: resolution: 1080P, ratio: 16:9, duration: 10, vilket är denna modells tak, prompt_extend: false, seed: -1. Ladda images i ordning, steg 1 först, så det mappas till character1, sedan steg 2 som character2, och bifoga steg 3-filen till audio.

Plain
1Symmetrical, dead-centre wide shot of a pastel hotel lobby front desk, dusty-pink walls and a mustard-yellow key rack behind it. character1 is the concierge standing behind the desk; character2 is the traveller standing in front of it, still holding her ragdoll cat. The camera pushes in slowly along a perfect centre axis and never tilts. character1 looks straight down the lens and says flatly: "The cat has a reservation. You do not." character2 blinks once, turns her head slowly towards the cat, then back to the desk. The cat stares directly into the camera without moving. 35mm film grain, even soft lighting, muted pastel palette, no camera shake, no cuts.

Negativ prompt:

Plain
1handheld shake, jump cuts, subtitles, on-screen text, watermark, extra people, deformed hands, face morphing, colour shift, motion blur

Screenshot of an AI video generator interface with input and output

Wan 2.7 Reference-to-Video lekplats på Atlas Cloud med två referensbilder och en ljudfil laddad och det färdiga klippet i utdatapanelen

Wan 2.7 Reference-to-Video på Atlas Cloud: två referensbilder och ett röstklipp bifogat till vänster, den färdiga tagningen spelas upp till höger i 1080P och 16:9. Denna inspelning kördes med modellens standardvaraktighet; ställ in den på 10 för fullversionen nedan.

Det färdiga klippet. Båda ansikten hölls, båda outfits hölls, och repliken levererades i den klonade rösten från steg 3, så denna är värd att spela med ljud.

Woman holding a cat at a hotel reception desk with bellhop

De två referensporträtten bredvid en bildruta från det färdiga klippet, som visar samma ansikten och outfits

Referenser till vänster, en bildruta från det levererade klippet till höger. Uniformspipning, basker, glasögon och katt överlever alla resan.

Variationer på Wan 3.0 Multimodal Reference-arbetsflödet

Tryck det till 30 sekunder. Samma referenspaket körs på Seedance 2.5 Reference-to-Video med duration: 30, vilket ger dig längden Wan 3.0 lovar utan att vänta på betan. Den tar upp till 30 referensbilder, 10 videor och 10 ljudklipp, så paketet har utrymme att växa. Skriv de extra 20 sekunderna som beats i prompten, inte som vibbar, annars kommer modellen att fylla ut.

AI video generator interface showing input settings and generation progress

Seedance 2.5 Reference-to-Video lekplats på Atlas Cloud med duration inställd på 30 och den långa tagningen renderad

Seedance 2.5 Reference-to-Video på Atlas Cloud med duration inställd på 30 och samma två referensporträtt bifogade, fångad mitt i genereringen. Notera @image1 och @image2 -chips i prompten: det är så du säger till Seedance vilken referens som spelar vilken roll. Kontrollera det angivna priset på Kör-knappen innan du bekräftar, eftersom det återspeglar varaktigheten jobbet faktiskt kommer att skicka.

30-sekundersversionen av samma scen, samma referenspaket, beats utskrivna bildruta för bildruta.

Lägg till en referensvideo endast för rörelse. Bifoga ett klipp vars takt du gillar och säg det explicit i prompten, något som "följ referensvideon för klippningsrytm endast, ignorera dess motiv och miljö". Det är tricket bakom kortflippexemplet längre upp.

Åtgärda drift med den negativa prompten innan du rör den positiva. Ansiktsmorfning, färgskiftning och handhållen skakning är de tre som förstör referenslåsta tagningar, och de är oftast billigare att undertrycka än att beskriva bort.

Prova det multimodala referensformatet gratis

Om du vill ha formen av detta innan du vill ha parametrarna, skickade Atlas Cloud förra veckan en kostnadsfri AI-reklamskitgenerator som kör samma kedja utan några rattar.

Du skriver en rad om din produkt och dess försäljningsargument. Den skriver ett tvåkaraktärskomedimanus åt dig, hook, konflikt, twist, och renderar sedan en 15-sekundersvideo med talad dialog och ljudeffekter inbyggda. Du kan bifoga upp till fyra riktiga produktbilder som referenser, och annonsen behåller deras form, färg, etikett och logotyp från manus till sista bildruta. Sex stilar följer med, från rolig meme genom plot twist och sitcom till lyx och hård försäljning, och dialogen kommer tillbaka på vilket språk du än skrev beskrivningen på.

Det är samma två-karaktärer-plus-referensbilder-plus-röstkedja från handledningen, minus promtskrivning och minus räkning. Vilket gör det till ett anständigt sätt att ta reda på om detta format passar din produkt innan du spenderar något på att finjustera den.

För en känsla av vad en hög med referensbilder gör för en produktfilm, här är Wan 3.0:s egen version av jobbet: fem bilder in, en lanseringsfilm ut, varje bild förankrar ett beat i redigeringen.

Animated floating stack of white and mint green cards

Fem referensbilder utökade till en Material Design-inspirerad produktlanseringsfilm_Fem referensbilder som driver en nio sekunder lång produktfilm, varje bild förankrar ett beat och lämnar över till nästa. Källa: Alibabas officiella Wan 3.0 creator handbook._

Vad ett Wan 3.0 Multimodal Reference-klipp kostar

StegModellEnhetsprisKvantitetKostnad
1 och 2, två referensbilderGPT Image 2$0,009 per bild2$0,02
3, röstreferensMiniMax Speech 2.6 HD$0,08 per 1K tecken49 tecken$0,00
4, 10-sekunderstagningen i 1080PWan 2.7 Reference-to-Video$0,15 per sekund i 1080P10 s$1,50
Handledning totaltcirka $1,52
Variation, 30 sekunderSeedance 2.5 Reference-to-Video$0,134 per sekund i 480P30 scirka $4,02
Gratis vägGratis AI-reklamskitgeneratorgratis1 klipp, 15 s$0

Det är plattformens egna priser, kontrollerade i augusti 2026 och fakturerade per användning. Två saker flyttar totalen mer än folk förväntar sig. Upplösning är den första: $0,10 per sekund i jämförelsetabellen är Wan 2.7:s baspris, och 1080P faktureras till $0,15, vilket är där $1,50 ovan kommer ifrån. Den andra är att Seedance prissätter per pixelantal, så dess listade $0,134 per sekund är 480P-siffran och en 720P-tagning kostar mer än en rak multiplikation antyder. Som referens skulle den rapporterade Wan 3.0 beta-priset på $0,20 per sekund i 1080p sätta en full 30-sekunderstagning på cirka $6, vilket är mer än Seedance-vägen i 480P idag.

En notering om att använda detta. Wan 3.0 är en beta och dess villkor kan ändras, så läs dem igen innan du bygger en pipeline på den. Om dina referensbilder är verkliga människor, få deras tillstånd först, eftersom reference-to-video är just den förmågan som gör det viktigt. Exempelklippen i den här artikeln är Alibabas egna genererade resultat från dess offentliga creator handbook, återgivna här för kommentar.

Vanliga frågor

Hur många referenser kan Wan 3.0:s multimodala referens faktiskt ta?

Upp till 20 tillgångar i ett enda anrop, hämtade från bilder, videor, ljud, dokument och webbsidor. Den praktiska gränsen är lägre än den tekniska. Tilldela varje tillgång exakt ett jobb, ett motiv per bild, och du kommer att använda långt färre än 20 för de flesta scener.

Kan Wan 3.0 verkligen omvandla en PDF eller en webbsida till en video?

Ja, det är den verkligt unika delen. Tillsammans med text, bild, ljud och video accepterar den dokumentfiler och live-URL:er, med rapportering om betan som listar .doc, .xls, .ppt, .pdf och .txt. Ingen annan reference-to-video-modell i jämförelsetabellen ovan tar ett dokument alls.

Är Wan 3.0 öppen källkod? Kan jag köra den i ComfyUI?

Nej, och inte just nu. Wan 3.0 är en sluten beta som körs på Alibabas eget moln. Tidigare Wan-generationer släpptes öppet, vilket är varför förväntningen finns, men Alibaba har inte bekräftat vikter för 3.0. Sidor som påstår en 1.3B eller 14B Apache 2.0-utgåva av Wan 3.0 stöds inte av något officiellt.

Finns Wan 3.0 tillgängligt via tredjeparts-API:er än?

Inte än, inklusive Atlas Cloud. Det närmaste du kan anropa idag är Wan 2.7 Reference-to-Video, vars indataform matchar omni-reference nästan exakt förutom dokument- och webbsidemodaliteterna, eller Seedance 2.5 Reference-to-Video om du behöver hela 30 sekunderna.

Vad är det billigaste sättet att testa en referenslåst, tvåkaraktärsvideo?

Den kostnadsfria AI-reklamskitgeneratorn länkad ovan. Fyra referensbilder in, ett 15-sekunders talat tvåkaraktärsklipp ut, inga parametrar och ingen kostnad. Om den håller din produkt och ditt format, gå sedan och finjustera den betalda kedjan.

Varför driver mina karaktärer fortfarande även med referensbilder?

Tre orsaker, i frekvensordning. En referens bär två jobb, så den ombeds att fixa både ansiktet och platsen. Referensbilden har mer än en person eller en rörig bakgrund, så modellen vet inte vilken del den ska låsa. Eller så är driften en renderingsartefakt snarare än ett referensfel, i vilket fall sätt face morphing, colour shift i den negativa prompten innan du skriver om något.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller