Seedance 2.0 Mini & Fast API till världens lägsta priser — upp till 68 % rabatt på det officiella priset

Wan 3.0 vs Seedance 2.5 Native 30s: Båda säger 30 sekunder, bara en är verkligen 1080p

Wan 3.0 vs Seedance 2.5 native 30 sekunder, testade mot Alibabas egna demouppmaningar: vilken som renderar riktiga 1080p-pixlar, vilken som uppskalar, och vilken du kan köra idag.

Två monitorer som visar en westernscen bredvid storyboards

Senaste uppdatering: Wan 3.0 är nu live sedan 24 augusti 2026.

Twe redigeringsmonitorer sida vid sida som spelar samma bensinstationsbild i öknen, den ena med en obruten 30-sekunders tidslinje under sig och den andra med en tidslinje uppdelad i två segment

Vid sekund 20 sprutar bränslemunstycket ut färskt grönt gräs. Fortfarande pärlat med vatten. Hästen myser av välbehag. Servitörens tandpetare ramlar ur munnen.

Det skämtet fungerar bara inom en enda kontinuerlig 30-sekunders tagning. Klipp ihop fyra 8-sekundersklipp så byter hästen päls, solglasögonen byter form, himlen skiftar en stop varmare, och poängen dör någonstans i skarvarna.

Så när Wan 3.0 och Seedance 2.5 båda landade i samma fönster och påstod sig ha inbyggda 30 sekunder, en passage, ingen sömning, slutade det vara en riktmärkeshistoria. Det blev första gången en AI-videomodell kunde hålla en uppbyggnad, en vändning och en poäng i en enda tagning.

Jag drog isär specifikationerna, körde en spec-kontroll mot Alibabas egna publicerade demofiler, och hittade det ingen som skriver om detta har tryckt: båda modellerna säger 30 sekunder, men upplösningen under dessa 30 sekunder är inte alls samma produkt.

Viktiga slutsatser

  1. Båda modellerna genererar verkligen 30 sekunder i en enda passage. Den delen är inte marknadsföring. Wan 3.0 täcker 2 till 30 sekunder med ett smart-durationsalternativ, Seedance 2.5 täcker 4 till 30 sekunder.
  2. Endast Wan 3.0 renderar inbyggd 1080p vid 30 sekunder. Seedance 2.5 genererar inbyggt endast i 480p och 720p. Dess 1080p, 1440p och 4K-alternativ är eftergenereringens uppskalningar av en 720p-källa, och dess egen API-dokumentation säger att 4K-nivån är "inte inbyggd 4K-generering".
  3. Seedance 2.5 vinner på referensmängd: upp till 30 bilder plus 10 videor plus 10 ljudfiler, totalt 50. Wan 3.0:s skaparhandbok sätter tak på 20 referenser.
  4. Wan 3.0 har en inmatning som ingen annan har: .doc, .xls, .ppt, .pdf, .txt-filer och live-webbsidor, matade direkt in som kreativa referenser.
  5. Endast en av de två är faktiskt körbar utanför Alibaba idag. Wan 3.0 finns i offentlig beta på Alibaba Cloud Model Studio och Qwen Cloud med tredjeparts-API-åtkomst som fortfarande rullas ut. Seedance 2.5 är live på Atlas Cloud med 30 i durationsreglaget just nu.
  6. Vill du stresstesta 30-sekunders berättarstruktur innan du betalar för en enda sekund av det? Atlas Cloud's gratis AI-reklamskitgenerator ger dig en gratis körning: en 15-sekunders färdig reklam med talad dialog och ljudeffekter, vattenmärkesfri nedladdning.

Alibabas officiella Wan 3.0-demo, från Tongyi Wan 3.0 skaparhandbok. En tagning, inga klipp, 30,07 sekunder. Uppmätt med ffprobe: 1920x1072, 24 fps, AAC stereo ljud inbakat. Ljud på för svansslaget och tandpetaren som träffar marken vid sekund 29. Används här som referensmaterial för jämförelse och kommentar endast.

Wan 3.0 vs Seedance 2.5 Native 30s: Vad som faktiskt förändrades den här månaden

Femton sekunder var väggen under lång tid. Wan 2.7 toppar där. Seedance 2.0 toppade där. Varje "en-minuts AI-film" du såg i ditt flöde det senaste året var fyra till åtta klipp ihopsatta i en NLE, med en färgkorrigering för att dölja skarvarna.

Två saker bröt den väggen inom samma veckor. Alibaba öppnade Wan 3.0 offentlig beta den 6 augusti 2026 med inbyggd 30-sekunders generering och full multimodal referensinmatning (AlphaSignal, augusti 2026). ByteDance dubblade Seedance från 15 till 30 sekunder i 2.5, och positionerade det explicit som ett sätt att minska klippsömning och den visuella drift som följer med den.

Inbyggd spelar roll här i en specifik teknisk bemärkelse. Det betyder en framåtpassning över en enda latent sekvens, inte sista-ruta-förlängning där modellen tar den sista bildrutan från klipp A och startar klipp B från den. Förlängning är varför din karaktärs jackkrage tyst ändrar form mellan tagningarna. En inbyggd passage har hela 30 sekunderna i samma kontext, så hästen förblir samma häst.

Bensinstationsdemon är det renaste möjliga testet av detta. Strukturen är fyra beats: 0 till 8 sekunder av ingenting som händer, 8 till 16 av något konstigt som händer, 16 till 24 för poängen, 24 till 30 för avslutningen. Skämtet landar vid sekund 20. Vilket innebär att det bara landar om hästen, solglasögonen, teal-och-orange-graden och den döda låsta kameran alla överlever de första 19 sekunderna oberörda. Sömning kan inte göra det. Inte för att redigeraren är dålig, utan för att klipp B aldrig såg klipp A.

Wan 3.0 vs Seedance 2.5 Native 30s: Där bilden faktiskt bryts

Trettio sekunder är dubbelt så mycket som femton. Driftrisken är inte dubbelt så stor, den är värre än så, och den flyttar till ett annat felläge.

De sömda arbetsflödesfelen var mellan klipp. Inbyggda 30-sekunders-fel är inuti klippet. I en praktisk Seedance 2.5 kortfilmsproduktion fann granskaren dekoherens och morfning som uppträdde som "visuell spikighet eller instabilitet i karaktärsmodeller", koncentrerat till snabba actionscener, och noterade specifikt att dessa artefakter inte kan rengöras genom uppskalning (MindStudio, augusti 2026). Det är den del som spelar roll för alla som planerar att rendera i 720p och sedan skala upp till 4K: uppskalaren skärper morfningen, den tar inte bort den.

Samma produktion loggade ett 3,2-till-1 inspelningsförhållande. Ungefär 450 sekunder rågenerering för att klippa en 2 minuter och 22 sekunder lång final. Planera långa tagningar som en inspelning med täckning, inte som en renderingskö där varje jobb levereras.

Två ytterligare resultat från den produktionen är värda att stjäla rakt av. Visuell identitet över hela filmen vilade på tre referensbilder, två karaktärsporträtt och en platsbild, trots att systemet accepterar upp till 50. Och vid röstbesättning fixade "American" en oavsiktlig brittisk accent medan "American English" inte gjorde det, eftersom ordet "English" puffade leveransen tillbaka mot brittisk.

Den promptstruktur som överlever 30 sekunder är den Alibaba använder i sin egen handbok: explicita tidsstämplade beats. Inte ett stycke stämning. Skriv 0-8s, 8-16s, 16-24s, 24-30s, ge varje block sitt eget kamerabeteende och sin egen händelse, och avsluta med en enda ljudrad som täcker hela klippet. Du kommer att se exakt det skelettet i Steg 4 nedan, eftersom jag behöll Alibabas struktur och bara översatte den.

För en aktuell värdkörning, öppna Wan 3.0 på Atlas Cloud och testa en prompt som den nedan innan du publicerar arbetsflödet.

Wan 3.0 prompt och genererad effektskärmbild för wan-30-vs-seedance-25-native-30s

Wan 3.0 vs Seedance 2.5 Native 30s: Specifikationer, pris och vad du kan köra idag

Här är det ärliga läget, och den del där de två modellerna slutar vara jämförbara produkter.

Läs upplösningsraden två gånger, för det är hela artikeln. Atlas Cloud's egen Seedance 2.5 Text-till-Video API-dokumentation anger att 720p-esr förbättrar en 480p-källa, att 1080p-esr, 1440p-esr och 4k-esr alla förbättrar en 720p-källa, och att 4K-alternativet levererar en 2160-pixel kort sida "inte inbyggd 4K-generering". Så ett 30-sekunders Seedance-klipp märkt 4K är 720p värt med verklig detalj, omsamplad. Wan 3.0:s prisblad har däremot en rak 1080p-nivå till $0,20 per sekund, och Alibabas egna publicerade 30-sekunders-demofiler mäter 1920x1072.

Fördelen med den begränsningen: hela testet körs i en webbläsarflik, på tre modeller, utan lokal installation.

Roll i detta testModellListat pris
ÖppningsbildGPT Image 2 Text-till-Bildfrån $0,009 / bild
Den inbyggda 30s-körningenSeedance 2.5 Text-till-Videofrån $0,134 / SEK

Listade priser verifierade på Atlas Cloud-modellsidorna, augusti 2026. Läs dem som golv, inte offerter. Var och en av dessa modeller fakturerar efter vad du faktiskt ber om, och Kör-knappen prissätter dina exakta inställningar innan du klickar. I detta test citerade knappen $0,1745 för en GPT Image 2-bild vid kvalitet hög och 2048x1152, och $1,514799 för ett femsekunders Seedance 2.5-jobb vid 720p och 16:9, vilket blir ungefär $0,30 per sekund snarare än listade $0,134. Den listade siffran är 480p-priset. Kontrollera knappen, inte katalogen. Seedance 2.5 levererar också en referens-till-video-slutpunkt till samma $0,134 per sekund om du vill pressa 50-referensgränsen.

Hur du återskapar detta inbyggda 30s-test på Seedance 2.5

Fem steg, tre modeller, allt i webbläsaren. Kopiera prompterna ordagrant.

Steg 1: Lås det tidsstämplade 30s-skelettet

Kör inget än. Läs strukturen först, för det här är den del som avgör om dina 30 sekunder håller.

Wan 3.0 bensinstationsdemon överst i denna artikel är byggd som fyra märkta block med en fast kameradoktrin angiven en gång i början: lugn objektiv observation, låsta medelbreda bilder, plötsliga extrema närbilder endast på de absurda beatsen. Varje händelse är fast vid ett tidsintervall. Ljud är en rad i slutet som täcker alla 30 sekunder.

Här är skelettet, tomt. Fyll i det och du har en prompt som en inbyggd 30s-modell faktiskt kan följa:

Plain
1En 30-sekunders [genre] utspelad i [plats]. [Visuell stil, gradering, mättnad]. Kameraspråk: [doktrin], punkterad av [undantag].
2
30-8s: [uppbyggnad, vid, etablera den normala världen, introducera anomalien vid horisonten]
4
58-16s: [anomalien agerar, fortfarande behandlad som normal, en POV- eller reaktionsinsättning]
6
716-24s: [utdelningen, extrem närbild på själva saken, hård klippning till reaktionsansiktet]
8
924-30s: [avslutningen, en liten fysisk knapp som stänger skämtet]
10
11Ljud: [ambiens, tre eller fyra specifika diegetiska ljud, ett sista litet ljud]. Ingen musik, ingen dialog, ingen text på skärmen.
12

Den mätbara specifikationen för Alibabas referensfil, för alla som vill kontrollera mina siffror: 30,07 sekunder, 1920x1072, 24 fps, AAC stereo. Det är ribban som Seedance-körningen mäts mot.

Steg 2: Generera öppningsbilden

Du behöver ett fast visuellt ankare så att 15-sekunders- och 30-sekunderskörningarna startar från samma värld. Öppna GPT Image 2 Text-till-Bild.

Inställningar: kvalitet high, bildförhållande 16:9, 1 bild.

Plain
1En vid, helt stilla etableringsbild av en ensam Route 66-liknande bensinstation i en ljus öken. Retro gul-orange-och-blå byggnad, färg svagt solblekt; en blekt vintage-röd bränslepump framför; en liten närbutik bredvid med en urtvättad cola-automat vid dörren. Sprucken orange torr jord i förgrunden, varma terrakottafärgade berg långt bakom, molnfri klar cyanblå himmel. En bensinstationsbiträde i flottiga blå overaller och överdimensionerade svarta solglasögon slöar halvsovande i en stol vid dörren, tandpetare i munnen. Strikt ljus teal-och-orange färggradering, hög mättnad, hög ljusstyrka, filmisk fotorealistisk, låst kamera, 16:9.
2

Skärmbild av en AI-bildgenerator med prompt och utmatningsbild

GPT Image 2-lekplats på Atlas Cloud med kvalitet inställd på hög och 16:9, den genererade Route 66-bensinstationsetableringsbilden i utmatningspanelen

GPT Image 2 på Atlas Cloud: kvalitet hög, 16:9, en bild. Kör-knappen citerade $0,1745 för denna bildruta, vilket är vad en 2048x1152 högkvalitativ rendering faktiskt kostar. $0,009 på modellsidan är golvet.

Man som vilar utanför en vintage Route 66-ökenbensinstation

Route 66 bensinstationsetableringsbild genererad med GPT Image 2, teal himmel och orange sprucken jord, biträde som dåsar vid dörren

Öppningsbilden. Detta är indata för Steg 3 och det visuella målet för Steg 4. Genererad med openai/gpt-image-2.

Steg 3: Träffa 15-sekundersväggen

Inställningar: första bild = din Steg 2-utdata, duration dragen till sitt maximum 15, upplösning 1080P.

Plain
1Låst vid bild håller. En cowgirl i bredbrättad hatt rider på en riktig häst in från horisonten i skritt. Det dåsande biträdet väcks av hovslag, trycker upp sina solglasögon, sätter sig upp, tuggar på sin tandpetare, ointresserad. Hon stiger av rent, leder hästen rakt till den vintage bränslepumpen. Ljus teal-och-orange gradering, hög mättnad, fotorealistisk, lugn observerande kamera, inga klipp.
2

Rullgardinsmenyn stannar vid 15. Det är hela poängen med detta steg. Din poäng är schemalagd till sekund 20, och denna pipeline kan inte nå sekund 20 i ett stycke. För att komma dit skulle du generera ett andra klipp från den sista bilden, och i samma stund du gör det är hästen en ny häst.

Skärmbild av ett AI-videogeneratorsgränssnitt med indata och utdata

Steg 4: Kör den fulla inbyggda 30s-passagen

Öppna Seedance 2.5 Text-till-Video.

Inställningar: duration = 30, resolution = 720p, ratio = 16:9, generate_audio = på, output_format = mp4, vattenmärke av.

Välj 720p medvetet, inte 1080p-esr. 720p är modellens verkliga tak, så detta är en likvärdig pixeljämförelse istället för en jämförelse mot en uppskalare.

Prompten nedan är Alibabas egen bensinstationsdemoprompt, troget översatt från Wan 3.0 skaparhandboken och omstrukturerad till ingenting. Samma beats, samma tajming, samma kameradoktrin, samma ljudlista.

Plain
1En 30-sekunders absurdistisk dödpanskomedi utspelad vid en solblekt Route 66-liknande bensinstation i en ljus öken. Fotorealistisk, strikt ljus teal-och-orange gradering, hög mättnad och hög ljusstyrka, så att den absurda händelsen sker i en helt normal, nästan vacker värld. Kameraspråk: lugn, objektiv observation, mestadels låsta medelbreda bilder och långsamma laterala glidningar, ingen känslomässig styrning, punkterad av plötsliga extrema närbilder på de absurda beatsen.
2
30-8s: Vid, låst. Cyan himmel, drivande damm. Den retro gul-orange-och-blå stationen sitter ensam vid vägen; ett biträde i flottiga blå overaller och enorma svarta solglasögon dåsar i en stol, tandpetare i munnen. Endast vind. Vid horisonten dyker en cowgirl på en riktig häst upp i skritt. Klipp till medium: hovslag väcker honom, han trycker upp sina solglasögon, sätter sig upp, läser paret som "ännu en som frågar efter vägen."
4
58-16s: Hon säger inget. Hon stiger av rent, leder hästen rakt till den gamla bränslepumpen. Hästen lägger nonchalant huvudet bredvid pumpen som om den gjort detta förut. Kort något fisheye-POV bakifrån hans solglasögon, kvinnan och hästen ser ännu konstigare ut. Närbild: hans panna rynkas, han tar av sig solglasögonen, på väg att skrika. Slow-motion närbild: när glasögonen kommer av, siktar hon bränslemunstycket mot hästens mun och trycker på avtryckaren.
6
716-24s: Extrem närbild på munstycket. Ut kommer inte bensin utan strålar av färskt ljusgrönt gräs, fortfarande pärlat med vatten. Hård klippning till en extrem närbild av biträdets ansikte, fruset: ögon vida som tefat, mun något öppen, tandpetare glömd mitt i tuggan. Medium: hästen äter glatt, myser av välbehag, ger sedan ett tillfredsställt kraftfullt svansslag, och dammet det sparkar upp landar rakt på det fortfarande chockade biträdets ansikte.
8
924-30s: "Tanken full" av gräs. Hon hänger tillbaka munstycket på pumpen, gräver fram mynt ur fickan, går till butiksdörren och släpper dem klingande i en plåtburk på disken. Hon kastar en blick tillbaka på det paralyserade biträdet; under hattbrättet lyfts hörnet av hennes mun en bråkdel. Hon sätter sig upp och rider iväg i ett spår av damm. Kameran zoomar långsamt in på honom: samma frusna ställning, ansiktet täckt av damm, solglasögon fortfarande klämda i handen, och slutligen ramlar tandpetaren ur hans mun med ett litet klick.
10
11Ljud: torr ökenvind hela tiden, hovslag, det mekaniska klonkandet från pumphandtaget, vått gräs som sprutar, svansslaget, mynt i en plåtburk, och ett litet klick när tandpetaren träffar marken. Ingen musik, ingen dialog, ingen text på skärmen.
12

En varning som kommer att spara dig en bortkastad faktura, och det är samma fälla som i Steg 3: dra durationsreglaget till 30, skriv inte 30 i rutan. Rutan kommer glatt att visa 30 medan reglaget fortfarande står på sin femsekundersstandard, och Kör-knappen kommer att citera dig för fem sekunder. Kontrollera offerten innan du klickar. Vid 720p och 16:9 citerar ett femsekundersjobb $1,514799, så en riktig 30-sekunderspassage citerar ungefär sex gånger det.

Det finns ingen färdigkörningsskärmbild för detta steg. Tre automatiska infångningsförsök skickade alla in reglagets standard istället för 30 sekunder, och istället för att visa dig ett femsekundersklipp märkt som ett 30-sekunders, utelämnas infångningen. Prompten och inställningarna ovan är exakt vad du ska klistra in och ställa in.

Steg 5: Läs avdriften, ärligt

Här är Seedance 2.5-sidan av den exakta prompten, genererad vid inbyggda 30 sekunder, 720p, 16:9, ljud på.

Seedance 2.5, samma Wan 3.0 bensinstationsprompt kopierad ordagrant: inbyggd 30s i en generation, 1280x720, 24 fps, ljud inbakat. Samma fyra beats, cowgirl och häst anländer, bränslemunstyckes-gagen, biträdets kognitiv-dissonans-närbild. Sätt den bredvid Wan 3.0-klippet överst för en likvärdig läsning.

Sätt de två klippen sida vid sida och kontrollera fem specifika saker. Kontrollera inte "vilken ser bättre ut", det är en smakfråga och det kommer att slösa bort din eftermiddag.

  1. Päls- och kostymidentitet. Är hästen samma färg vid sekund 29 som vid sekund 6? Är solglasögonen samma form efter att de tagits av och gått tillbaka till hans hand?
  2. Gradstabilitet. Sampla himlen vid sekund 2 och sekund 28. Teal-och-orange gradering driver varmt över långa generationer oftare än folk förväntar sig.
  3. Det fysiska beatet vid sekund 20. Gräs ur ett bränslemunstycke är en fysikförfrågan. Bågar det och faller med tyngd, eller tonar det in som en textur?
  4. Kameradisciplin. Prompten säger låst. Räkna hur många gånger kameran uppfinner en inkörning den inte blev ombedd om. Detta är det vanligaste långgenereringsfelet: modellen får slut på schemalagda händelser och fyller tid med rörelse.
  5. Snabbrörelsemorfning. Svansslaget och dammsparken är den snabbaste rörelsen i klippet. Enligt MindStudio-produktionsanteckningarna är det precis där dekoherens koncentreras, och precis vad en uppskalning inte kommer att fixa.

Poängsätt dessa fem, inte stämningen. Det är en jämförelse du kan försvara inför en kund.

Tre fler Wan 3.0 vs Seedance 2.5 Native 30s matchade prompts

En demo är en anekdot. Här är tre fler officiella Wan 3.0 30-sekundersfiler från samma handbok, var och en stressar en annan del av 30-sekundersproblemet. För sjömonstret och den mörka fantasymonologen genererades Seedance 2.5-sidan på samma prompt vid inbyggda 30 sekunder och är inbäddad direkt efter varje, så du kan titta på båda istället för att ta mitt ord för det.

PromptVad den stresstestarWan 3.0 officiell fil, uppmättSeedance 2.5-sida, samma prompt
Sjömonster katastroffilm10 manuslagda tagningar plus en orkesterpartitur inom 30s1920x1072, 24fps, 30,07s, AACgenererad vid 30s, inbäddad nedan; ett IP-namn och båtens varumärkestext togs bort så att Seedances innehållsfilter skulle passera det, storyboarden är annars identisk
Mörk fantasy engelsk monologinbyggd engelsk röst och läppsynk över en långsam kontinuerlig push1280x720, 24fps, 30,05s, AACgenererad vid 30s från prompten ordagrant, inbäddad nedan
2D sportanime, tvåradspromptkan modellen fylla 30s med nästan ingen instruktion1280x720, 24fps, 30,05s, AACinte genererad här; visas som en Wan-only bildruta för att läsa struktur över tid
Sväng-pan komedi kort (exkluderad)8 sväng-pan och 8 känslobeats utan klipp1280x720, 24fps, 30,04s, AACinte körning: dialogtätheten är mandarinspecifik, en engelsk omskrivning skulle inte vara en rättvis likvärdig jämförelse

Officiell Wan 3.0-demo: tio manuslagda tagningar och en full orkesteruppbyggnad inom en 30-sekunderspassage, vid 1920x1072. Detta är det svåraste argumentet för inbyggd 1080p, eftersom vattenvolymen och varelsens våta huddetaljer är precis vad en 720p-uppskalning uppfinner snarare än löser. Alibaba Tongyi skaparhandbok, använd för jämförelse och kommentar.

Seedance 2.5, samma tio-tagnings katastrofprompt vid inbyggd 30s, ljud på. Stormkastad fiskebåt, den skräckslagna däcksmannen, svällningen som höjer sig, sedan djuphavsleviatan som bryter ytan i blixten. En IP-referens och texten på skrovet togs bort så att Seedances innehållsfilter skulle passera det; storyboarden är annars identisk, vilket är vad som gör vattenvolymen och våthudsdetaljen en rättvis likvärdig jämförelse mot Wan 3.0-klippet ovan.

Officiell Wan 3.0-demo, ljud på. Inbyggd engelsk skurkdialog, "Ripe enough for the void", levererad i en enda långsam uppåtgående tilt utan klipp. Detta är klippet engelsktalande team bör testa mot, eftersom röst, läppsynk och en 30-sekunders kontinuerlig kamerarörelse alla måste hålla samtidigt.

Seedance 2.5, samma mörka fantasy-prompt kopierad ordagrant, inbyggd 30s, ljud på. Samma violett-ögda skurk, stjärnrun-märkena, skugg-nebulosan som bildas i hans öppna handflata, och de två engelska raderna. Titta om läppsynken och den enda kontinuerliga pushen håller över hela 30 sekunderna som de gör på Wan 3.0-sidan.

Om du kör den matchade Seedance 2.5-sidan av denna, behåll de två engelska raderna ordagrant och kom ihåg accent-eccentriciteten från produktionsanteckningarna: skriv "American", inte "American English". Ordet "English" drar leveransen tillbaka mot en brittisk läsning.

Den tredje är den tysta överraskningen. 2D sportanime-prompten i Alibabas handbok är två rader lång. Inga tidsstämplar, ingen tagningslista, bara en boxare som slår på en tung säck, trött, i smärta. Trettio sekunder från det är ett genuint test av om modellen kan uppfinna sin egen struktur. Här är den samplad över sin egen körtid:

Fyra anime-paneler av en utmattad boxare som tränar med en boxningssäck

Fyra bildrutor från den officiella Wan 3.0 2D sportanime-demon samplad vid ungefär 1, 10, 20 och 29 sekunder, som visar boxarens design och gymbakgrunden över hela 30 sekunderna

Fyra bildrutor från den officiella Wan 3.0 2D sportanime-demon, samplad vid ungefär 1, 10, 20 och 29 sekunder. Samma karaktärsdesign, samma linne, samma tunga säck, samma rad med skåp, över en vid-till-närbildsförändring prompten aldrig bad om. Ett stillbildsrutnät snarare än ett klipp, eftersom jämförelsen här är över tid inom en fil, inte rörelse.

Praktisk läsning: med en tvåradsprompt uppfann modellen sin egen täckning, flyttade från en låst vid bild till en svett-och-utmattning-närbild, och behöll karaktärsdesignen medan den gjorde det. Det är de goda nyheterna. Byten är att du gav upp kontrollen över när något händer. Om du behöver 30 sekunder för att landa ett specifikt beat vid en specifik sekund, skriv tidsstämplarna.

Testa inbyggt 30-sekunders berättande gratis innan du betalar för någon av dem

En 30-sekunders 720p-körning på Seedance 2.5 citerar runt $9 när du väl prissätter den verkliga upplösningen snarare än katalog-golvet. En 30-sekunders 1080p-körning på Wan 3.0:s prisblad är $6,00. Ingen av dem är dyr enligt produktionsstandarder, men vid ett 3,2-till-1 inspelningsförhållande köper du inte ett klipp, du köper tre eller fyra.

Innan du spenderar något är det värt att besvara en billigare fråga: håller mitt manus faktiskt som en enda kontinuerlig tagning? De flesta 30-sekunders misslyckanden är inte modellmisslyckanden. De är strukturmisslyckanden, tre beats trängda där det fanns plats för två, eller en utdelning skriven vid sekund 26 utan något som bär sekunderna 8 till 20.

Atlas Cloud's gratis AI-reklamskitgenerator svarar på det för ingenting. Du ger den en produktbeskrivning och upp till fyra produktbilder, var och en under 8 MB, väljer en av sex stilar (rolig meme, plot twist, sitcom, hjärtvärmande, lyx, eller hård sälj), och den skriver först ett tvåkaraktärsmanus, med en tre-sekunders krok, en konflikt och en twist, och bygger sedan varje tagning runt det manuset. Karaktärer talar sina repliker högt och ljudeffekter renderas in i videon.

De ärliga begränsningarna: det är 15 sekunder, inte 30, du måste vara inloggad, och du får en gratis generation innan du fyller på krediter. Men 15 sekunder med en krok, en konflikt och en twist berättar om dina tre beats andas. Om strukturen fungerar där, ta samma beats, sträck ut dem på 0-8s / 8-16s / 16-24s / 24-30s-skelettet från Steg 1, och gå och spendera de nio dollarna på en riktig inbyggd 30-sekunderspassage.

Vad ett inbyggt 30s-klipp faktiskt kostar på Wan 3.0 vs Seedance 2.5

UppsättningPrisDurationEtt klipp
Wan 3.0, 1080p inbyggd (endast Alibaba Cloud)$0,20 / sek30s$6,00
Wan 3.0, 720p inbyggd (endast Alibaba Cloud)$0,10 / sek30s$3,00
Wan 3.0, 480p inbyggd (endast Alibaba Cloud)$0,05 / sek30s$1,50
Seedance 2.5, 720p inbyggd, på Atlas Cloud$0,30 / sek uppmätt vid 720p, listat från $0,13430sungefär $9,09
GPT Image 2 öppningsbild, kvalitet hög, 2048x1152listat från $0,009 / bild1 bild$0,1745 citerat

Jämförelsen som faktiskt avgör det: Wan 3.0 vid 720p är billigare per sekund än Seedance 2.5 vid 720p, och vid 1080p är det den enda av de två som säljer riktiga pixlar. Seedance 2.5:s svar är 50 referensplatser, live tillgänglighet och ett fungerande API du kan leverera mot i eftermiddag.

Käll- och licensnotering för dessa inbyggda 30s-klipp

Varje Wan 3.0-klipp och varje Wan 3.0-prompt i denna artikel kommer från Alibabas offentligt distribuerade Tongyi Wan 3.0 skaparhandbok, reproducerad här för jämförelse och kommentar, krediterad, omodifierad och inte av-vattenmärkt. Kommersiell användning av Seedance 2.5-utdata faller under ByteDance och Volcengine-villkor; API-fakturering och datahantering på Atlas Cloud-sidan faller under Atlas Cloud's egna villkor. Ingen verklig persons avbild reproduceras någonstans i detta test. Om du levererar kundarbete, läs modellvillkoren för den specifika slutpunkt du anropar, inte en bloggsammanfattning av dem.

Vanliga frågor

Är Wan 3.0:s inbyggda 30s faktiskt en passage, eller sömda klipp?

En passage. Wan 3.0 genererar 2 till 30 sekunder i en enda generation med ett smart-durationsalternativ, så det kan också besluta att klippet inte behöver hela 30. Det är annorlunda än sista-ruta-förlängning, där ett andra klipp seedas från den sista bildrutan i det första och identitet driver över sömmen.

Vilken är verkligen 1080p vid 30 sekunder, Wan 3.0 eller Seedance 2.5?

Wan 3.0. Den har en inbyggd 1080p-nivå på sitt prisblad, och Alibabas egna 30-sekunders-demofiler mäter 1920x1072. Seedance 2.5 genererar inbyggt endast i 480p och 720p; dess 1080p, 1440p och 4K-alternativ är förbättringar av en 720p-källa, och dess API-dokument beskriver 4K-nivån som "inte inbyggd 4K-generering".

Faller bilden fortfarande sönder vid sekund 25?

Det kan den, men felet ändrade form. Istället för en synlig söm mellan klipp får du morfning och dekoherens inuti tagningen, koncentrerat till snabba passagesk, och uppskalning tar inte bort det. En dokumenterad Seedance 2.5 kortfilmsproduktion körde ett 3,2-till-1 inspelningsförhållande, så planera långa tagningar med täckning.

Vilken modell tar mer referensmaterial?

Seedance 2.5, med bred marginal: 30 bilder plus 10 videor plus 10 ljudfiler, totalt 50, med referensvideo och ljud var och en begränsad till 30 sekunder kombinerat per förfrågan. Wan 3.0:s handbok sätter tak på 20 referenser, men det är den enda som accepterar .pdf, .ppt, .xls, .doc, .txt-filer och live-webbsidor som kreativ inmatning.

Kommer Wan 3.0 att ha öppna vikter?

Det finns inget officiellt åtagande. Från och med den offentliga betan i augusti 2026 har inga Wan 3.0-vikter, Hugging Face-checkpoint eller ComfyUI-nod publicerats, och officiella öppna vikter för flaggskeppsvideolinjen slutar vid Wan 2.2 (Kingy AI, augusti 2026). Behandla allt annat du läser om ett 3.0-viktsläpp som spekulation tills Alibaba säger annat.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller