Seedance 2.5 är nu live — Först på Atlas Cloud

Wan 3.0 vs Seedance 2.5 Native 30s: Båda säger 30 sekunder, bara en är verkligen 1080p

Wan 3.0 vs Seedance 2.5 native 30s, testade mot Alibabas egna demoprompter: vilken som renderar äkta 1080p-pixlar, vilken som uppskalar, och vilken du kan köra idag.

Två bildskärmar som visar en westernscen bredvid storyboards

Twe redigeringsskärmar sida vid sida som spelar samma bild av en bensinstation i öknen, den ena med en obruten 30-sekunders tidslinje under sig och den andra med en tidslinje uppdelad i två segment

Vid sekund 20 sprutar bränslepistolen ut färskt grönt gräs. Fortfarande täckt av vattendroppar. Hästen kisar med välbehag. Expediten tappar tandpetaren ur munnen.

Det skämtet fungerar bara inuti en enda kontinuerlig 30-sekunders tagning. Klipp ihop fyra 8-sekundersklipp och hästen byter päls, solglasögonen byter form, himlen skiftar ett stopp varmare, och poängen dör någonstans i skarvarna.

Så när Wan 3.0 och Seedance 2.5 båda landade i samma fönster och hävdade inbyggda 30 sekunder, en gång, inget ihopklipp, slutade det vara en riktmärkeshistoria. Det blev första gången en AI-videomodell kunde hålla en uppbyggnad, en vändning och en poäng i en enda tagning.

Jag drog isär specifikationerna, körde en spec-kontroll mot Alibabas egna publicerade demofiler, och hittade det ingen som skriver om detta har tryckt: båda modellerna säger 30 sekunder, men upplösningen under dessa 30 sekunder är inte alls samma produkt.

Viktiga slutsatser

  1. Båda modellerna genererar verkligen 30 sekunder i en enda passning. Den delen är inte marknadsföring. Wan 3.0 täcker 2 till 30 sekunder med ett smart-durationsalternativ, Seedance 2.5 täcker 4 till 30 sekunder.
  2. Endast Wan 3.0 renderar inbyggd 1080p vid 30 sekunder. Seedance 2.5 genererar inbyggt endast i 480p och 720p. Dess 1080p-, 1440p- och 4K-alternativ är eftergenereringsuppskalningar av en 720p-källa, och dess egen API-dokumentation säger att 4K-nivån är "inte inbyggd 4K-generering".
  3. Seedance 2.5 vinner på referensvolym: upp till 30 bilder plus 10 videor plus 10 ljudfiler, totalt 50. Wan 3.0:s skaparhandbok begränsar referenser till 20.
  4. Wan 3.0 har en input som ingen annan har: .doc, .xls, .ppt, .pdf, .txt-filer och live webbsidor, som matas in direkt som kreativa referenser.
  5. Endast en av de två är faktiskt körbar utanför Alibaba idag. Wan 3.0 ligger i offentlig beta på Alibaba Cloud Model Studio och Qwen Cloud med tredjeparts-API-åtkomst som fortfarande rullas ut. Seedance 2.5 är live på Atlas Cloud med 30 i durationskontrollen just nu.
  6. Vill du stresstesta 30-sekunders berättarstruktur innan du betalar för en enda sekund av det? Atlas Clouds gratis AI-reklamskitgenerator ger dig en gratis körning: en 15-sekunders färdig reklam med talad dialog och ljudeffekter, nedladdning utan vattenstämpel.
Invalid YouTube video ID

Alibabas officiella Wan 3.0-demo, från Tongyi Wan 3.0 skaparhandbok. En tagning, inga klipp, 30,07 sekunder. Uppmätt med ffprobe: 1920x1072, 24 fps, AAC stereo-ljud inbakat. Ljud på för svansviftet och tandpetaren som träffar marken vid sekund 29. Används här som referensmaterial för jämförelse och kommentar endast.

Wan 3.0 vs Seedance 2.5 Native 30s: Vad som faktiskt förändrades denna månad

Femton sekunder var väggen länge. Wan 2.7 toppar där. Seedance 2.0 toppade där. Varje "en-minuts AI-film" du såg i ditt flöde det senaste året var fyra till åtta klipp ihopsatta i en NLE, med en graderingspassning för att dölja skarvarna.

Två saker bröt den väggen under samma veckor. Alibaba öppnade Wan 3.0 offentlig beta den 6 augusti 2026 med inbyggd 30-sekundersgenerering och full multimodell referensinput (AlphaSignal, augusti 2026). ByteDance dubblade Seedance från 15 till 30 sekunder i 2.5, och positionerade det explicit som ett sätt att minska klippsammansättning och den visuella drift som följer med det.

Inbyggd betyder här något specifikt tekniskt. Det betyder en framåtpassning över en enda latent sekvens, inte förlängning av sista bildrutan där modellen tar den sista bildrutan från klipp A och startar klipp B från den. Förlängning är anledningen till att din karaktärs jackkrage tyst ändrar form mellan tagningarna. En inbyggd passning har hela 30 sekunder i samma sammanhang, så hästen förblir samma häst.

Bensinstationsdemon är det renaste möjliga testet av detta. Strukturen är fyra takter: 0 till 8 sekunder av ingenting som händer, 8 till 16 av något märkligt som händer, 16 till 24 för poängen, 24 till 30 för avslutningen. Skämtet landar vid sekund 20. Vilket betyder att det bara landar om hästen, solglasögonen, den teal-och-orange graderingen och den döda stillastående kameran alla överlever de första 19 sekunderna oberörda. Sammansättning kan inte göra det. Inte för att redigeraren är dålig, utan för att klipp B aldrig såg klipp A.

Wan 3.0 vs Seedance 2.5 Native 30s: Där bilden faktiskt bryts

Trettio sekunder är dubbelt så mycket som femton. Driftrisken är inte dubbelt så stor, den är värre än så, och den flyttar till ett annat feltillstånd.

De sammansatta arbetsflödets misslyckanden var mellan klipp. Inbyggda 30s-misslyckanden är inuti klippet. I en hands-on Seedance 2.5 kortfilmsproduktion fann recensenten dekoherens och morfning som visade sig som "visuell spikighet eller instabilitet i karaktärsmodeller", koncentrerad till snabba actionscener, och noterade specifikt att dessa artefakter inte kan rengöras genom uppskalning (MindStudio, augusti 2026). Det är delen som spelar roll för alla som planerar att rendera i 720p och sedan skala upp till 4K: uppskalaren skärper morfningen, den tar inte bort den.

Samma produktion loggade ett 3,2-till-1 skottförhållande. Ungefär 450 sekunder rågenerering för att klippa en slutlig 2 minuter 22 sekunder. Planera långa tagningar som en inspelning med täckning, inte som en renderingskö där varje jobb skickas.

Två fler rön från den produktionen är värda att stjäla rakt av. Visuell identitet över hela filmen vilade på tre referensbilder, två karaktärsporträtt och en platsbild, trots att systemet accepterar upp till 50. Och i röstbesättning fixade att skriva "amerikansk" en oavsiktlig brittisk accent medan att skriva "amerikansk engelska" inte gjorde det, eftersom ordet "engelska" knuffade leveransen tillbaka mot en brittisk läsning.

Den promptstruktur som överlever 30 sekunder är den som Alibaba använder i sin egen handbok: explicita tidsstämplade takter. Inte ett stycke vibbar. Skriv 0-8s, 8-16s, 16-24s, 24-30s, ge varje block sitt eget kamera beteende och sin egen händelse, och avsluta med en enda ljudrad som täcker hela klippet. Du kommer att se exakt den skelettet i Steg 4 nedan, eftersom jag behöll Alibabas struktur och bara översatte den.

Wan 3.0 vs Seedance 2.5 Native 30s: Specifikationer, pris och vad du kan köra idag

Här är det ärliga läget, och delen där de två modellerna slutar vara jämförbara produkter.

Läs upplösningsraden två gånger, för den är hela artikeln. Atlas Clouds egen Seedance 2.5 Text-till-Video API-dokumentation anger att 720p-esr förbättrar en 480p-källa, att 1080p-esr, 1440p-esr och 4k-esr alla förbättrar en 720p-källa, och att 4K-alternativet levererar en 2160-pixel kort kant "inte inbyggd 4K-generering". Så ett 30-sekunders Seedance-klipp märkt 4K är 720p värt med verklig detalj, omsamplat. Wan 3.0:s prislista har däremot en direkt 1080p-nivå på $0.20 per sekund, och Alibabas egna publicerade 30-sekunders demofiler mäter 1920x1072.

Fördelen med den begränsningen: hela testet körs i en webbläsarflik, på tre modeller, utan lokal installation.

Roll i detta testModellListat pris
ÖppningsbildGPT Image 2 Text-till-Bildfrån $0.009 / bild
Den inbyggda 30s-körningenSeedance 2.5 Text-till-Videofrån $0.134 / SEK

Listade priser verifierade på Atlas Clouds modellsidor, augusti 2026. Läs dem som golv, inte som offerter. Var och en av dessa modeller fakturerar efter vad du faktiskt ber om, och Kör-knappen prissätter dina exakta inställningar innan du klickar. I detta test offererade knappen $0.1745 för en GPT Image 2-bild i hög kvalitet och 2048x1152, och $1.514799 för ett femsekunders Seedance 2.5-jobb i 720p och 16:9, vilket motsvarar ungefär $0.30 per sekund snarare än de listade $0.134. Den listade siffran är 480p-priset. Kolla knappen, inte katalogen. Seedance 2.5 levererar också en referens-till-video-slutpunkt till samma $0.134 per sekund om du vill trycka på 50-referensgränsen.

Hur man reproducerar detta inbyggda 30s-test på Seedance 2.5

Fem steg, tre modeller, allt i webbläsaren. Kopiera prompterna ordagrant.

Steg 1: Lås det tidsstämplade 30s-skelettet

Kör inget än. Läs strukturen först, för det är delen som avgör om dina 30 sekunder håller.

Wan 3.0 bensinstationsdemon högst upp i denna artikel är byggd som fyra märkta block med en fast kameralära som anges en gång i början: lugn objektiv observation, låsta medelbreda bilder, plötsliga extrema närbilder endast på de absurda takterna. Varje händelse är fäst vid ett tidsintervall. Ljud är en rad i slutet som täcker alla 30 sekunder.

Här är skelettet, tomt. Fyll i det och du har en prompt som en inbyggd 30s-modell faktiskt kan följa:

Plain
1En 30-sekunders [genre] utspelad i [plats]. [Visuell stil, gradering, mättnad]. Kameraspråk: [lära], punkterad av [undantag].
2
30-8s: [uppbyggnad, vidbild, etablera den normala världen, introducera anomalien vid horisonten]
4
58-16s: [anomalien agerar, fortfarande behandlad som normal, en POV- eller reaktionsinsättning]
6
716-24s: [poängen, extrem närbild på själva saken, hård klippning till reaktionsansiktet]
8
924-30s: [avslutningen, en liten fysisk knapp som stänger skämtet]
10
11Ljud: [ambiens, tre eller fyra specifika diegetiska ljud, ett sista litet ljud]. Ingen musik, ingen dialog, ingen text på skärmen.

Den mätbara specifikationen för Alibabas referensfil, för alla som vill kontrollera mina siffror: 30,07 sekunder, 1920x1072, 24 fps, AAC stereo. Det är ribban som Seedance-körningen mäts mot.

Steg 2: Generera öppningsbilden

Du behöver ett fast visuellt ankare så att 15-sekunders- och 30-sekunderskörningarna startar från samma värld. Öppna GPT Image 2 Text-till-Bild.

Inställningar: kvalitet high, bildförhållande 16:9, 1 bild.

Plain
1En bred, dödsstilla etableringsbild av en ensam bensinstation i Route 66-stil i en ljus öken. Retro gul-orange-och-blå byggnad, färgen svagt solblekt; en blekt vintage-röd bensinpump framför; en liten närbutik bredvid med en blekt cola-automat vid dörren. Sprucken orange torr jord i förgrunden, varma terrakottaberg i bakgrunden, molnfri klar cyanblå himmel. En bensinstationsbiträde i smutsiga blå overaller och överdimensionerade svarta solglasögon slöar halvsovande i en stol vid dörren, tandpetare i munnen. Strikt ljus teal-och-orange färggradering, hög mättnad, hög ljusstyrka, filmisk fotorealistisk, låst kamera, 16:9.

Skärmdump av en AI-bildgenerator med prompt och utmatningsbild

GPT Image 2 playground på Atlas Cloud med kvalitet inställd på high och 16:9, den genererade Route 66 bensinstationsetableringsbilden i utmatningspanelen

GPT Image 2 på Atlas Cloud: kvalitet high, 16:9, en bild. Kör-knappen offererade $0.1745 för denna bild, vilket är vad en 2048x1152 render i hög kvalitet faktiskt kostar. $0.009 på modellsidan är golvet.

Man som vilar utanför en vintage Route 66 ökenbensinstation

Route 66 bensinstationsetableringsbild genererad med GPT Image 2, teal himmel och orange sprucken jord, biträde som slumrar vid dörren

Öppningsbilden. Detta är input för Steg 3 och det visuella målet för Steg 4. Genererad med openai/gpt-image-2.

Steg 3: Träffa 15-sekundersväggen

Inställningar: första bild = din Steg 2-utmatning, duration dragen till sitt maximum 15, upplösning 1080P.

Plain
1Låst vidbild håller. En cowboy i bredbrättad hatt rider en riktig häst in från horisonten i skritt. Den slumrande biträdet väcks av hovslag, trycker upp sina solglasögon, sätter sig upp, tuggar på sin tandpetare, oberörd. Hon stiger av rent, leder hästen rakt till den vintage bensinpumpen. Ljus teal-och-orange gradering, hög mättnad, fotorealistisk, lugn observerande kamera, inga klipp.

Rullgardinsmenyn stannar vid 15. Det är hela poängen med detta steg. Din poäng är schemalagd till sekund 20, och denna pipeline kan inte nå sekund 20 i ett stycke. För att komma dit skulle du generera ett andra klipp från den sista bildrutan, och i samma stund du gör det är hästen en ny häst.

Skärmdump av ett AI-videogenereringsgränssnitt med input och utmatning

Steg 4: Kör den fulla inbyggda 30s-passningen

Öppna Seedance 2.5 Text-till-Video.

Inställningar: duration = 30, resolution = 720p, ratio = 16:9, generate_audio = på, output_format = mp4, vattenstämpel av.

Välj 720p medvetet, inte 1080p-esr. 720p är modellens verkliga tak, så detta är en likvärdig pixeljämförelse istället för en jämförelse mot en uppskalare.

Prompter nedan är Alibabas egen bensinstationsdemoprompt, troget översatt från Wan 3.0 skaparhandboken och omstrukturerad till ingenting. Samma takter, samma tajmingar, samma kameralära, samma ljudlista.

Plain
1En 30-sekunders absurdistisk dödpansarkomedi utspelad vid en solblekt bensinstation i Route 66-stil i en ljus öken. Fotorealistisk, strikt ljus teal-och-orange gradering, hög mättnad och hög ljusstyrka, så den absurda händelsen inträffar i en helt normal, nästan vacker värld. Kameraspråk: lugn, objektiv observation, mestadels låsta medelbreda bilder och långsamma laterala drifter, ingen känslomässig styrning, punkterad av plötsliga extrema närbilder på de absurda takterna.
2
30-8s: Vid, låst. Cyan himmel, drivande damm. Den retro gul-orange-och-blå stationen står ensam vid vägen; en biträde i smutsiga blå overaller och enorma svarta solglasögon slumrar i en stol, tandpetare i munnen. Endast vind. Vid horisonten dyker en cowboy på en riktig häst upp i skritt. Klipp till medium: hovslag väcker honom, han trycker upp sina solglasögon, sätter sig upp, läser paret som "ännu en som frågar om vägen."
4
58-16s: Hon säger ingenting. Hon stiger av rent, leder hästen rakt till den gamla bensinpumpen. Hästen lägger avslappnat huvudet bredvid pumpen som om den gjort detta förut. Kort lätt fisköga POV bakifrån hans solglasögon, kvinnan och hästen ser ännu märkligare ut. Närbild: hans panna rynkas, han tar av sig solglasögonen, på väg att ropa. Slowmotion-närbild: när glasögonen kommer av, riktar hon bränslepistolen mot hästens mun och trycker på avtryckaren.
6
716-24s: Extrem närbild på pistolen. Ut kommer inte bensin utan strålar av färskt ljusgrönt gräs, fortfarande täckt av vattendroppar. Hård klippning till en extrem närbild av biträdets ansikte, fruset: ögon vidöppna som tefat, mun något öppen, tandpetare glömd mitt i tuggan. Medium: hästen äter glatt, kisar med välbehag, ger sedan ett enda nöjt kraftfullt svansvift, och dammet det sparkar upp landar rakt på den fortfarande chockade biträdets ansikte.
8
924-30s: "Tanken full" av gräs. Hon hänger tillbaka pistolen på pumpen, gräver fram mynt ur fickan, går till butiksdörren och låter dem falla klingande i en plåtburk på disken. Hon kastar en blick tillbaka på den förstelnade biträdet; under hattbrättet lyfts hörnet av hennes mun en aning. Hon sätter sig upp igen och rider iväg i ett spår av damm. Kameran trycker långsamt in på honom: samma frusna ställning, ansiktet täckt av damm, solglasögonen fortfarande i handen, och slutligen faller tandpetaren ur hans mun med ett litet klick.
10
11Ljud: torr ökenvind genomgående, hovslag, det mekaniska klonkandet från pumphandtaget, vått gräs som sprutar, svansviftet, mynt i en plåtburk, och ett litet klick när tandpetaren träffar marken. Ingen musik, ingen dialog, ingen text på skärmen.

En varning som kommer att spara dig en bortkastad faktura, och det är samma fälla som i Steg 3: dra durationsskjutreglaget till 30, skriv inte 30 i sifferrutan. Rutan kommer glatt att visa 30 medan skjutreglaget stannar på sin femsekundersstandard, och Kör-knappen kommer att offerera dig för fem sekunder. Kolla offerten innan du klickar. Vid 720p och 16:9 offererar ett femsekundersjobb $1.514799, så en riktig 30s-passning offererar ungefär sex gånger det.

Det finns ingen färdigkörningsskärmdump för detta steg. Tre automatiska fångstförsök skickade alla in skjutreglagets standard istället för 30 sekunder, och istället för att visa dig ett femsekundersklipp märkt som ett 30-sekundersklipp, lämnas fångsten ute. Promptern och inställningarna ovan är exakt vad du ska klistra in och ställa in.

Steg 5: Läs driften, ärligt

Här är Seedance 2.5-sidan av den exakta promptern, genererad vid inbyggda 30 sekunder, 720p, 16:9, ljud på.

Seedance 2.5, samma Wan 3.0 bensinstationsprompt kopierad ordagrant: inbyggd 30s i en generation, 1280x720, 24 fps, ljud inbakat. Samma fyra takter, cowboy och häst anländer, bränslepistolskämtet, biträdets kognitiva dissonans-närbild. Sätt den bredvid Wan 3.0-klippet högst upp för en likvärdig läsning.

Sätt de två klippen sida vid sida och kolla fem specifika saker. Kolla inte "vilket ser bättre ut", det är en smakdiskussion och det kommer att slösa bort din eftermiddag.

  1. Päls- och kostymidentitet. Är hästen samma färg vid sekund 29 som vid sekund 6? Är solglasögonen samma form efter att de har tagits av och lagts tillbaka i hans hand?
  2. Graderingsstabilitet. Sampla himlen vid sekund 2 och sekund 28. Teal-och-orange gradering driver varmt över långa generationer oftare än folk förväntar sig.
  3. Den fysiska takten vid sekund 20. Gräs ur en bränslepistol är en fysikförfrågan. Bågar det och faller med vikt, eller tonar det in som en textur?
  4. Kameradiciplin. Promptern säger låst. Räkna hur många gånger kameran uppfinner en inzoomning som den inte blev ombedd om. Detta är det vanligaste långgenereringsfelet: modellen får slut på schemalagda händelser och fyller tid med rörelse.
  5. Snabb morfning. Svansviftet och dammsparken är den snabbaste rörelsen i klippet. Enligt MindStudio-produktionsanteckningarna är det precis där dekoherens koncentreras, och precis vad en uppskalning inte kommer att fixa.

Poängsätt dessa fem, inte vibben. Det är en jämförelse du kan försvara inför en kund.

Tre fler Wan 3.0 vs Seedance 2.5 Native 30s matchade promptar

En demo är en anekdot. Här är tre fler officiella Wan 3.0 30-sekundersfiler från samma handbok, var och en stressar en annan del av 30-sekundersproblemet. För sjömonstret och den mörka fantasy monologen genererades Seedance 2.5-sidan på samma prompt vid inbyggda 30 sekunder och är inbäddad direkt efter varje, så du kan se båda istället för att ta mitt ord för det.

PromptVad den stresstestarWan 3.0 officiell fil, uppmättSeedance 2.5-sida, samma prompt
Sjömonster katastroffilm10 manuslagda bilder plus ett orkesterscore inuti 30s1920x1072, 24fps, 30.07s, AACgenererad vid 30s, inbäddad nedan; ett IP-namn och båtens varumärkestext togs bort så att Seedances innehållsfilter skulle passera det, storyboarden är annars identisk
Mörk fantasy engelsk monologinbyggd engelsk röst och läppsynk över en långsam kontinuerlig push1280x720, 24fps, 30.05s, AACgenererad vid 30s från promptern ordagrant, inbäddad nedan
2D sportanime, tvåradspromptkan modellen fylla 30s med nästan ingen instruktion1280x720, 24fps, 30.05s, AACinte genererad här; visas som en Wan-only bildrutegrid för att läsa struktur över tid
Piskpan-komedikort (exkluderad)8 piskpan och 8 känslomässiga takter utan klipp1280x720, 24fps, 30.04s, AACinte körs: dialogtäthet är mandarinspecifik, en engelsk omskrivning skulle inte vara en rättvis likvärdig jämförelse

Officiell Wan 3.0-demo: tio manuslagda bilder och en full orkesteruppbyggnad inuti en 30-sekunderspassning, vid 1920x1072. Detta är det svåraste argumentet för inbyggd 1080p, eftersom vattenvolymen och varelsens våta hud-detaljer är exakt vad en 720p-uppskalning uppfinner snarare än löser. Alibaba Tongyi skaparhandbok, använd för jämförelse och kommentar.

Seedance 2.5, samma tio-bilders katastrofprompt vid inbyggda 30s, ljud på. Stormpinad fiskebåt, den skräckslagna däcksmannen, dyningen som häver sig, sedan havets leviatan som bryter ytan i blixten. En IP-referens och texten på skrovets varumärke togs bort så att Seedances innehållsfilter skulle passera det; storyboarden är annars identisk, vilket är vad som gör vattenvolymen och våta hud-detaljen en rättvis likvärdig jämförelse mot Wan 3.0-klippet ovan.

Officiell Wan 3.0-demo, ljud på. Inbyggd engelsk skurkdialog, "Mogen nog för tomrummet", levererad i en enda långsam uppåtriktning utan klipp. Detta är klippet engelsktalande team bör testa mot, eftersom röst, läppsynk och en 30-sekunders kontinuerlig kamerarörelse alla måste hålla samtidigt.

Seedance 2.5, samma mörka fantasy-prompt kopierad ordagrant, inbyggd 30s, ljud på. Samma violettögda skurk, stjärnrun-märkena, skuggnubblan som formas i hans öppna handflata, och de två engelska raderna. Se om läppsynken och den enda kontinuerliga pushen håller över hela 30 sekunderna som de gör på Wan 3.0-sidan.

Om du kör den matchade Seedance 2.5-sidan av denna, behåll de två engelska raderna ordagrant och kom ihåg accent-egenheten från produktionsanteckningarna: skriv "amerikansk", inte "amerikansk engelska". Ordet "engelska" drar leveransen tillbaka mot en brittisk läsning.

Den tredje är den tysta överraskningen. 2D sportanime-prompten i Alibabas handbok är två rader lång. Inga tidsstämplar, ingen bildlista, bara en boxare som slår på en tung säck, trött, i smärta. Trettio sekunder från det är ett genuint test av om modellen kan uppfinna sin egen struktur. Här är den samplad över sin egen körtid:

Fyra anime-paneler av en utmattad boxare som tränar med en boxningssäck

Fyra bildrutor från den officiella Wan 3.0 2D sportanime-demon samplad vid ungefär 1, 10, 20 och 29 sekunder, som visar boxarens design och gymbakgrunden över hela 30 sekunder

Fyra bildrutor från den officiella Wan 3.0 2D sportanime-demon, samplad vid ungefär 1, 10, 20 och 29 sekunder. Samma karaktärsdesign, samma linne, samma tunga säck, samma rad av skåp, över en vid-till-närbildsförändring som prompten aldrig bad om. En stillbildsgrid snarare än ett klipp, eftersom jämförelsen här är över tid inuti en fil, inte rörelse.

Praktisk läsning: med en tvåradsprompt uppfann modellen sin egen täckning, flyttade från en låst vidbild till en svett-och-utmattning närbild, och höll karaktärsdesignen medan den gjorde det. Det är de goda nyheterna. Byten är att du gav upp kontrollen över när något händer. Om du behöver 30 sekunder för att landa en specifik takt vid en specifik sekund, skriv tidsstämplarna.

Testa inbyggt 30s-berättande gratis innan du betalar för någon av dem

En 30-sekunders 720p-körning på Seedance 2.5 offererar runt $9 när du prissätter den verkliga upplösningen snarare än katalog golvet. En 30-sekunders 1080p-körning på Wan 3.0:s prislista är $6.00. Ingetdera är dyrt enligt produktionsstandarder, men vid ett 3.2-till-1 skottförhållande köper du inte ett klipp, du köper tre eller fyra.

Innan du spenderar något är det värt att svara på en billigare fråga: håller mitt manus faktiskt som en enda kontinuerlig tagning? De flesta 30-sekunders misslyckanden är inte modellmisslyckanden. De är strukturmisslyckanden, tre takter pressade där det fanns plats för två, eller en poäng skriven vid sekund 26 utan något som bär sekunderna 8 till 20.

Atlas Clouds gratis AI-reklamskitgenerator svarar på det för ingenting. Du ger den en produktbeskrivning och upp till fyra produktbilder, varje under 8MB, välj en av sex stilar (rolig meme, plot twist, sitcom, hjärtevärmande, lyx, eller hård sälj), och den skriver först ett tvåkaraktärsmanus, med en tre-sekunders hook, en konflikt och en twist, och bygger sedan varje bild runt det manuset. Karaktärer talar sina repliker högt och ljudeffekter renderas in i videon.

De ärliga begränsningarna: det är 15 sekunder, inte 30, du måste vara inloggad, och du får en gratis generation innan du fyller på krediter. Men 15 sekunder med en hook, en konflikt och en twist berättar om dina tre takter andas. Om strukturen fungerar där, ta samma takter, sträck ut dem på 0-8s / 8-16s / 16-24s / 24-30s-skelettet från Steg 1, och gå och spendera de nio dollarna på en riktig inbyggd 30-sekunderspassning.

Vad ett inbyggt 30s-klipp faktiskt kostar på Wan 3.0 vs Seedance 2.5

UppsättningPrisVaraktighetEtt klipp
Wan 3.0, 1080p inbyggd (endast Alibaba Cloud)$0.20 / sek30s$6.00
Wan 3.0, 720p inbyggd (endast Alibaba Cloud)$0.10 / sek30s$3.00
Wan 3.0, 480p inbyggd (endast Alibaba Cloud)$0.05 / sek30s$1.50
Seedance 2.5, 720p inbyggd, på Atlas Cloud$0.30 / sek uppmätt vid 720p, listad från $0.13430scirka $9.09
GPT Image 2 öppningsbild, kvalitet high, 2048x1152listad från $0.009 / bild1 bild$0.1745 offererad

Jämförelsen som faktiskt avgör det: Wan 3.0 i 720p är billigare per sekund än Seedance 2.5 i 720p, och i 1080p är det den enda av de två som säljer riktiga pixlar. Seedance 2.5:s svar är 50 referensplatser, live-tillgänglighet och ett fungerande API som du kan leverera emot i eftermiddag.

Källa och licensnotering för dessa inbyggda 30s-klipp

Varje Wan 3.0-klipp och varje Wan 3.0-prompt i denna artikel kommer från Alibabas offentligt distribuerade Tongyi Wan 3.0 skaparhandbok, återgiven här för jämförelse och kommentar, krediterad, omodifierad och inte avvattenmärkt. Kommersiell användning av Seedance 2.5-utdata faller under ByteDance och Volcengine-villkor; API-fakturering och datahantering på Atlas Cloud-sidan faller under Atlas Clouds egna villkor. Ingen verklig persons avbild återges någonstans i detta test. Om du levererar kundarbete, läs modellvillkoren för den specifika slutpunkt du anropar, inte en bloggsammanfattning av dem.

Vanliga frågor

Är Wan 3.0:s inbyggda 30s verkligen en passning, eller ihopklippta klipp?

En passning. Wan 3.0 genererar 2 till 30 sekunder i en enda generation med ett smart-durationsalternativ, så det kan också bestämma att klippet inte behöver hela 30. Detta skiljer sig från förlängning av sista bildrutan, där ett andra klipp seedas från den sista bildrutan i det första och identitet driver över skarven.

Vilken är verkligen 1080p vid 30 sekunder, Wan 3.0 eller Seedance 2.5?

Wan 3.0. Det har en inbyggd 1080p-nivå på sin prislista, och Alibabas egna 30-sekunders demofiler mäter 1920x1072. Seedance 2.5 genererar inbyggt endast i 480p och 720p; dess 1080p-, 1440p- och 4K-alternativ är förbättringar av en 720p-källa, och dess API-dokumentation beskriver 4K-nivån som "inte inbyggd 4K-generering".

Faller bilden fortfarande isär vid sekund 25?

Det kan den, men felet ändrade form. Istället för en synlig skarv mellan klipp får du morfning och dekoherens inuti tagningen, koncentrerad till snabba rörelsepassager, och uppskalning tar inte bort det. En dokumenterad Seedance 2.5 kortfilmsproduktion körde ett 3.2-till-1 skottförhållande, så planera långa tagningar med täckning.

Vilken modell tar mer referensmaterial?

Seedance 2.5, med en bred marginal: 30 bilder plus 10 videor plus 10 ljudfiler, totalt 50, med referensvideo och ljud varje begränsad till 30 sekunder kombinerat per förfrågan. Wan 3.0:s handbok begränsar referenser till 20, men det är den enda som accepterar .pdf, .ppt, .xls, .doc, .txt-filer och live webbsidor som kreativ input.

Kommer Wan 3.0 att ha öppna vikter?

Det finns inget officiellt åtagande. Från och med den offentliga betan i augusti 2026 har inga Wan 3.0-vikter, Hugging Face-kontrollpunkt eller ComfyUI-nod publicerats, och officiella öppna vikter för flaggskeppsvideolinjen stannar vid Wan 2.2 (Kingy AI, augusti 2026). Behandla allt annat du läser om en 3.0-viktsnedladdning som spekulation tills Alibaba säger något annat.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller