
Ostatnia aktualizacja: Wan 3.0 jest już dostępny od 24 sierpnia 2026 r.
Dwa monitory edycyjne obok siebie odtwarzające to samo ujęcie stacji benzynowej na pustyni, jeden z nieprzerwaną 30-sekundową osią czasu poniżej, a drugi z osią podzieloną na dwa segmenty
W 20. sekundzie dysza paliwowa tryska świeżą zieloną trawą. Wciąż ociekającą wodą. Koń mruży oczy z przyjemności. Pracownikowi stacji wykałaczka wypada z ust.
Ten żart działa tylko w ramach jednego ciągłego 30-sekundowego ujęcia. Zmontuj cztery 8-sekundowe klipy, a koń zmieni maść, okulary przeciwsłoneczne zmienią kształt, niebo przesunie się o stopień cieplejsze, a puenta umiera gdzieś w szwach.
Więc kiedy Wan 3.0 i Seedance 2.5 wylądowały w tym samym oknie, twierdząc, że oferują natywne 30 sekund, jeden przejście, bez składania, przestało to być historią o benchmarku. Stało się pierwszym razem, gdy model AI do wideo mógł pomieścić w jednym ujęciu setup, zwrot i pointę.
Rozłożyłem specyfikacje na części, przeprowadziłem kontrolę specyfikacji względem opublikowanych przez Alibaba plików demo i znalazłem to, czego nikt piszący o tym nie wydrukował: oba modele mówią, że mają 30 sekund, ale rozdzielczość pod tymi 30 sekundami to zupełnie inny produkt.
Kluczowe wnioski
- Oba modele rzeczywiście generują 30 sekund w jednym przejściu. Ta część nie jest marketingiem. Wan 3.0 obejmuje 2 do 30 sekund z opcją inteligentnego czasu trwania, Seedance 2.5 obejmuje 4 do 30 sekund.
- Tylko Wan 3.0 renderuje natywne 1080p przy 30 sekundach. Seedance 2.5 generuje natywnie tylko w 480p i 720p. Jego opcje 1080p, 1440p i 4K to upscaling po generacji źródła 720p, a jego własna dokumentacja API mówi, że poziom 4K to „nie jest natywne generowanie 4K”.
- Seedance 2.5 wygrywa pod względem liczby referencji: do 30 obrazów plus 10 filmów plus 10 plików audio, łącznie 50. Podręcznik twórcy Wan 3.0 ogranicza referencje do 20.
- Wan 3.0 ma jedno wejście, którego nie ma nikt inny: pliki
.doc,.xls,.ppt,.pdf,.txti żywe strony internetowe, podawane bezpośrednio jako kreatywne referencje. - Tylko jeden z tych dwóch jest faktycznie uruchamialny poza Alibaba dzisiaj. Wan 3.0 jest w publicznej becie na Alibaba Cloud Model Studio i Qwen Cloud, a dostęp do API stron trzecich jest wciąż wdrażany. Seedance 2.5 jest dostępny na Atlas Cloud z 30 w kontroli czasu trwania już teraz.
- Chcesz przetestować 30-sekundową strukturę narracyjną, zanim zapłacisz za choćby sekundę? Darmowy generator skeczy reklamowych AI Atlas Cloud daje ci jedną darmową próbę: gotowy 15-sekundowy spot z mówionym dialogiem i efektami dźwiękowymi, do pobrania bez znaku wodnego.
Oficjalne demo Wan 3.0 od Alibaba, z podręcznika twórcy Tongyi Wan 3.0. Jedno ujęcie, bez cięć, 30,07 sekundy. Zmierzone za pomocą ffprobe: 1920x1072, 24 kl./s, wbudowane audio AAC stereo. Włącz dźwięk, aby usłyszeć machnięcie ogonem i wykałaczkę uderzającą o ziemię w 29. sekundzie. Użyte tutaj jako materiał referencyjny do porównania i komentarza.
Wan 3.0 vs Seedance 2.5 Natywne 30s: Co się faktycznie zmieniło w tym miesiącu
Piętnaście sekund było przez długi czas ścianą. Wan 2.7 kończy na tym poziomie. Seedance 2.0 kończy na tym poziomie. Każdy „jednominutowy film AI”, który widziałeś na swoim kanale w zeszłym roku, to od czterech do ośmiu klipów sklejonych w programu NLE, z korekcją kolorystyczną ukrywającą łączenia.
Dwie rzeczy przebiły tę ścianę w ciągu tych samych kilku tygodni. Alibaba otworzyło publiczną betę Wan 3.0 6 sierpnia 2026 z natywnym generowaniem 30-sekundowym i pełnym multimodalnym wejściem referencyjnym (AlphaSignal, sierpień 2026). ByteDance podwoiło Seedance z 15 do 30 sekund w wersji 2.5, pozycjonując je wyraźnie jako sposób na ograniczenie składania klipów i wynikającego z niego dryfu wizualnego.
Natywność ma tutaj znaczenie w konkretnym sensie technicznym. Oznacza to jedno przejście do przodu w jednej sekwencji latentnej, a nie rozszerzanie ostatniej klatki, gdzie model bierze ostatnią klatkę klipu A i zaczyna od niej klip B. Rozszerzenie jest powodem, dla którego kołnierz kurtki twojej postaci cicho zmienia kształt między ujęciami. Natywne przejście ma całe 30 sekund w tym samym kontekście, więc koń pozostaje tym samym koniem.
Demo stacji benzynowej jest najczystszym możliwym testem tego. Struktura to cztery beaty: 0 do 8 sekund nic się nie dzieje, 8 do 16 sekund dzieje się coś dziwnego, 16 do 24 sekund na puentę, 24 do 30 sekund na odejście. Żart ląduje w 20. sekundzie. Co oznacza, że ląduje tylko wtedy, gdy koń, okulary przeciwsłoneczne, teal-and-orange grade i beznamiętny, zablokowany aparat przetrwają pierwsze 19 sekund nienaruszone. Składanie nie jest w stanie tego zrobić. Nie dlatego, że edytor jest zły, ale dlatego, że klip B nigdy nie widział klipu A.
Wan 3.0 vs Seedance 2.5 Natywne 30s: Gdzie obraz faktycznie się psuje
Trzydzieści sekund to dwa razy piętnaście. Ryzyko dryfu nie jest dwa razy większe, jest gorsze i przechodzi do innego trybu awarii.
Błędy w składanym workflow występowały między klipami. Błędy w natywnych 30s występują wewnątrz klipu. W praktycznym filmie krótkometrażowym Seedance 2.5 recenzent znalazł dekoherencję i morfing pojawiające się jako „wizualna ostrość lub niestabilność modeli postaci”, skoncentrowane w szybkich sekwencjach akcji i szczególnie zauważył, że tych artefaktów nie można usunąć przez upscaling (MindStudio, sierpień 2026). To jest część, która ma znaczenie dla każdego planującego renderowanie w 720p i późniejszy upscaling do 4K: upscaler wyostrza morph, nie usuwa go.
Ta sama produkcja zanotowała współczynnik zdjęć 3,2 do 1. Około 450 sekund surowej generacji, aby zmontować 2 minuty 22 sekundy finału. Planuj długie ujęcia jak materiał z coverage, a nie jak kolejkę renderowania, w której każde zadanie jest wysyłane.
Dwa więcej wniosków z tej produkcji warto ukraść wprost. Tożsamość wizualna w całym filmie opierała się na trzech obrazach referencyjnych, dwóch portretach postaci i jednej lokalizacji, mimo że system akceptuje do 50. A w castingu głosowym napisanie „American” naprawiło niezamierzony brytyjski akcent, podczas gdy napisanie „American English” nie zadziałało, ponieważ słowo „English” przesunęło dostawę z powrotem w kierunku brytyjskiego.
Struktura promptu, która przetrwa 30 sekund, to ta, której Alibaba używa we własnym podręczniku: jawne beaty z oznaczeniem czasu. Nie akapit nastroju. Napisz 0-8s, 8-16s, 16-24s, 24-30s, daj każdemu blokowi własne zachowanie kamery i własne wydarzenie, a zakończ pojedynczą linią audio obejmującą cały klip. Zobaczysz ten dokładny szkielet w Kroku 4 poniżej, ponieważ zachowałem strukturę Alibaba i tylko ją przetłumaczyłem.
Aby uzyskać aktualne uruchomienie hostowane, otwórz Wan 3.0 na Atlas Cloud i przetestuj prompt podobny do poniższego, zanim opublikujesz workflow.

Wan 3.0 vs Seedance 2.5 Natywne 30s: Specyfikacje, cena i co możesz uruchomić dzisiaj
Oto uczciwy stan gry i część, w której oba modele przestają być porównywalnymi produktami.
Przeczytaj wiersz rozdzielczości dwa razy, bo to jest cały artykuł. Własna dokumentacja Seedance 2.5 Text-to-Video API Atlas Cloud stwierdza, że 720p-esr ulepsza źródło 480p, że 1080p-esr, 1440p-esr i 4k-esr wszystkie ulepszają źródło 720p, a opcja 4K dostarcza krótszy bok 2160 pikseli „nie natywne generowanie 4K”. Zatem 30-sekundowy klip Seedance oznaczony jako 4K to 720p prawdziwych szczegółów, przepróbkowane. Cennik Wan 3.0 natomiast ma prosty poziom 1080p za 0,20 USD za sekundę, a opublikowane przez Alibaba 30-sekundowe pliki demo mierzą 1920x1072.
Zaletą tego ograniczenia: cały test działa w jednej karcie przeglądarki, na trzech modelach, bez lokalnej konfiguracji.
| Rola w tym teście | Model | Podana cena |
|---|---|---|
| Kadr otwierający | GPT Image 2 Text-to-Image | od $0,009 / obraz |
| Natywne uruchomienie 30s | Seedance 2.5 Text-to-Video | od $0,134 / SEK |
Podane ceny zweryfikowane na stronach modeli Atlas Cloud, sierpień 2026. Traktuj je jako podłogi, a nie cytaty. Każdy z tych modeli rozlicza za to, o co faktycznie prosisz, a przycisk Uruchom wycenia twoje dokładne ustawienia, zanim go klikniesz. W tym teście przycisk podał $0,1745 za jeden kadr GPT Image 2 w wysokiej jakości i 2048x1152 oraz $1,514799 za pięciosekundowe zadanie Seedance 2.5 w 720p i 16:9, co daje około $0,30 za sekundę, a nie podane $0,134. Podana kwota to stawka 480p. Sprawdź przycisk, a nie katalog. Seedance 2.5 oferuje również endpoint reference-to-video w tej samej cenie $0,134 za sekundę, jeśli chcesz wykorzystać limit 50 referencji.
Jak odtworzyć ten test natywnego 30s na Seedance 2.5
Pięć kroków, trzy modele, wszystko w przeglądarce. Kopiuj prompty dosłownie.
Krok 1: Zablokuj szkielet z oznaczeniem czasu 30s
Nie uruchamiaj jeszcze niczego. Najpierw przeczytaj strukturę, ponieważ to od tego zależy, czy twoje 30 sekund się utrzyma.
Demo stacji benzynowej Wan 3.0 na górze tego artykułu jest zbudowane jako cztery oznaczone bloki ze stałą doktryną kamery podaną raz na początku: spokojna, obiektywna obserwacja, zablokowane średnie plany, nagłe zbliżenia tylko przy absurdalnych beatach. Każde wydarzenie jest przypisane do przedziału czasowego. Audio to jedna linia na końcu obejmująca wszystkie 30 sekund.
Oto szkielet, pusty. Wypełnij go, a otrzymasz prompt, który natywny model 30s może faktycznie śledzić:
Plain1A 30-second [genre] set in [place]. [Visual style, grade, saturation]. Camera language: [doctrine], punctuated by [exception]. 2 30-8s: [setup, wide, establish the normal world, introduce the anomaly on the horizon] 4 58-16s: [the anomaly acts, still treated as normal, one POV or reaction insert] 6 716-24s: [the payoff, extreme close-up on the thing itself, hard cut to the reaction face] 8 924-30s: [the walk-off, a small physical button that closes the joke] 10 11Audio: [ambience, three or four specific diegetic sounds, one final small sound]. No music, no dialogue, no on-screen text. 12
Wymierna specyfikacja pliku referencyjnego Alibaba, dla każdego, kto chce sprawdzić moje liczby: 30,07 sekundy, 1920x1072, 24 kl./s, stereo AAC. To jest poprzeczka, z którą porównywane jest uruchomienie Seedance.
Krok 2: Wygeneruj kadr otwierający
Potrzebujesz stałej kotwicy wizualnej, aby 15-sekundowe i 30-sekundowe uruchomienia zaczynały się z tego samego świata. Otwórz GPT Image 2 Text-to-Image.
Ustawienia: jakość high, proporcje 16:9, 1 obraz.
Plain1A wide, dead-still establishing shot of a lonely Route 66 style gas station in a bright desert. Retro yellow-orange-and-blue building, paint faintly sun-bleached; a faded vintage-red fuel pump out front; a small convenience store beside it with a washed-out cola vending machine by the door. Cracked orange dry earth in the foreground, warm terracotta mountains far behind, cloudless clean cyan-blue sky. A gas station attendant in greasy blue coveralls and oversized black sunglasses slouches half-asleep in a chair by the door, toothpick in his mouth. Strict bright teal-and-orange color grading, high saturation, high brightness, cinematic photoreal, locked-off camera, 16:9. 2

Środowisko GPT Image 2 na Atlas Cloud z ustawioną jakością high i 16:9, wygenerowany kadr ustanawiający stację benzynową Route 66 w panelu wyjściowym
GPT Image 2 na Atlas Cloud: jakość high, 16:9, jeden obraz. Przycisk Uruchom podał $0,1745 za ten kadr, czyli tyle, ile kosztuje renderowanie 2048x1152 w wysokiej jakości. $0,009 na stronie modelu to podłoga.

Kadr ustanawiający stację benzynową Route 66 wygenerowany za pomocą GPT Image 2, turkusowe niebo i pomarańczowa spękana ziemia, pracownik drzemiący przy drzwiach
Kadr otwierający. To jest wejście do Kroku 3 i cel wizualny dla Kroku 4. Wygenerowany za pomocą openai/gpt-image-2.
Krok 3: Uderz w 15-sekundową ścianę
Ustawienia: pierwsza klatka = wynik z Kroku 2, duration przeciągnięte do maksimum 15, rozdzielczość 1080P.
Plain1Locked-off wide shot holds. A cowgirl in a wide-brim hat rides a real horse in from the horizon at a walk. The dozing attendant is woken by hoofbeats, pushes his sunglasses up, sits upright, chewing his toothpick, unimpressed. She dismounts cleanly, leads the horse straight to the vintage fuel pump. Bright teal-and-orange grade, high saturation, photoreal, calm observational camera, no cuts. 2
Rozwijana lista zatrzymuje się na 15. To jest cały sens tego kroku. Twoja puenta jest zaplanowana na 20. sekundę, a ten pipeline nie może dotrzeć do 20. sekundy w jednym kawałku. Aby się tam dostać, wygenerowałbyś drugi klip z ostatniej klatki, a w momencie, gdy to zrobisz, koń jest nowym koniem.

Krok 4: Uruchom pełne natywne przejście 30s
Otwórz Seedance 2.5 Text-to-Video.
Ustawienia: duration = 30, resolution = 720p, ratio = 16:9, generate_audio = włączone, output_format = mp4, znak wodny wyłączony.
Wybierz 720p celowo, a nie 1080p-esr. 720p to prawdziwy sufit modelu, więc jest to porównanie piksel do piksela, a nie porównanie z upscalerem.
Poniższy prompt to własny prompt demo stacji benzynowej Alibaba, wiernie przetłumaczony z podręcznika twórcy Wan 3.0 i przekształcony w nic. Te same beaty, te same czasy, ta sama doktryna kamery, ta sama lista audio.
Plain1A 30-second absurdist deadpan comedy short set at a sun-bleached Route 66 style gas station in a bright desert. Photoreal, strict bright teal-and-orange grading, high saturation and high brightness, so the absurd event happens in a completely normal, almost pretty world. Camera language: calm, objective observation, mostly locked-off medium wides and slow lateral drifts, no emotional steering, punctuated by sudden extreme close-ups on the absurd beats. 2 30-8s: Wide, locked-off. Cyan sky, drifting dust. The retro yellow-orange-and-blue station sits alone by the road; an attendant in greasy blue coveralls and huge black sunglasses dozes in a chair, toothpick in mouth. Only wind. On the horizon a cowgirl on a real horse appears at a walk. Cut to medium: hoofbeats wake him, he pushes his sunglasses, sits up, reads the pair as "another one asking for directions." 4 58-16s: She says nothing. She dismounts cleanly, leads the horse straight to the old fuel pump. The horse casually puts its head next to the pump like it has done this before. Brief slightly fish-eyed POV from behind his sunglasses, the woman and horse look even stranger. Close: his brow furrows, he takes the sunglasses off, about to shout. Slow-motion close-up: as the glasses come off, she aims the fuel nozzle at the horse's mouth and squeezes the trigger. 6 716-24s: Extreme close-up on the nozzle. Out comes not gasoline but jets of fresh bright-green grass, still beaded with water. Hard cut to an extreme close-up of the attendant's face, frozen: eyes wide as saucers, mouth slightly open, toothpick forgotten mid-chew. Medium: the horse eats happily, squints with pleasure, then gives one satisfied powerful flick of its tail, and the dust it kicks up lands squarely on the still-stunned attendant's face. 8 924-30s: "Tank full" of grass. She hangs the nozzle back on the pump, digs coins from her pocket, walks to the store door and drops them clinking into a tin can on the counter. She glances back at the petrified attendant; under the hat brim the corner of her mouth lifts a fraction. She remounts and rides off in a trail of dust. The camera pushes slowly in on him: same frozen posture, face covered in dust, sunglasses still pinched in his hand, and finally the toothpick drops from his mouth with a small clack. 10 11Audio: dry desert wind throughout, hoofbeats, the mechanical clunk of the pump handle, wet grass spurting, the tail flick, coins in a tin can, and one small clack as the toothpick hits the ground. No music, no dialogue, no on-screen text. 12
Jedno ostrzeżenie, które zaoszczędzi ci zmarnowanego rachunku i jest to ta sama pułapka co w Kroku 3: przeciągnij suwak czasu trwania do 30, nie wpisuj 30 w pole liczbowe. Pole chętnie pokaże 30, podczas gdy suwak pozostanie na domyślnym pięciu sekundach, a przycisk Uruchom poda ci wycenę za pięć sekund. Sprawdź wycenę przed kliknięciem. Przy 720p i 16:9 pięciosekundowe zadanie wycenia $1,514799, więc rzeczywiste 30-sekundowe przejście kosztuje mniej więcej sześć razy tyle.
Nie ma zrzutu ekranu gotowego uruchomienia dla tego kroku. Trzy automatyczne próby przechwycenia wysłały domyślne ustawienie suwaka zamiast 30 sekund, a zamiast pokazywać ci pięciosekundowy klip oznaczony jako 30-sekundowy, przechwycenie zostało pominięte. Powyższy prompt i ustawienia to dokładnie to, co należy wkleić i ustawić.
Krok 5: Odczytywanie dryfu, uczciwie
Oto strona Seedance 2.5 tego dokładnego promptu, wygenerowana w natywnych 30 sekundach, 720p, 16:9, z dźwiękiem.
Seedance 2.5, ten sam prompt stacji benzynowej Wan 3.0 skopiowany dosłownie: natywne 30s w jednej generacji, 1280x720, 24 kl./s, wbudowane audio. Te same cztery beaty, przybycie cowgirl i konia, gag z dyszą paliwową, zbliżenie na poznawczy dysonans pracownika. Umieść go obok klipu Wan 3.0 na górze, aby uzyskać porównanie jeden do jednego.
Umieść dwa klipy obok siebie i sprawdź pięć konkretnych rzeczy. Nie sprawdzaj „który wygląda lepiej”, to kwestia gustu i zmarnuje ci popołudnie.
- Tożsamość sierści i stroju. Czy koń jest tego samego koloru w 29. sekundzie co w 6. sekundzie? Czy okulary przeciwsłoneczne mają ten sam kształt po zdjęciu i powrocie do jego ręki?
- Stabilność gradacji. Spróbkuj niebo w 2. i 28. sekundzie. Gradacja teal-and-orange często dryfuje w kierunku cieplejszych tonów podczas długich generacji.
- Fizyczny beat w 20. sekundzie. Trawa z dyszy paliwowej to prośba o fizykę. Czy łuk i opada z ciężarem, czy pojawia się jako tekstura?
- Dyscyplina kamery. Prompt mówi o zablokowanej kamerze. Policz, ile razy kamera sama wymyśla najechanie, o które nie proszono. To najczęstsza awaria długich generacji: model kończy zaplanowane wydarzenia i wypełnia czas ruchem.
- Morfing w szybkim ruchu. Machnięcie ogonem i kopnięcie kurzu to najszybszy ruch w klipie. Zgodnie z notatkami produkcyjnymi MindStudio, to właśnie tam koncentruje się dekoherencja i dokładnie tego upscale nie naprawi.
Oceń te pięć, a nie nastrój. To jest porównanie, którego możesz bronić przed klientem.
Trzy dodatkowe dopasowane prompty Wan 3.0 vs Seedance 2.5 Natywne 30s
Jedno demo to anegdota. Oto trzy kolejne oficjalne 30-sekundowe pliki Wan 3.0 z tego samego podręcznika, każdy obciążający inną część problemu 30-sekundowego. Dla potwora morskiego i monologu dark fantasy strona Seedance 2.5 została wygenerowana na tym samym prompcie w natywnych 30 sekundach i jest osadzona bezpośrednio po każdym, abyś mógł obejrzeć oba, zamiast wierzyć mi na słowo.
| Prompt | Co testuje | Oficjalny plik Wan 3.0, zmierzony | Strona Seedance 2.5, ten sam prompt |
|---|---|---|---|
| Film katastroficzny o potworze morskim | 10 zaplanowanych ujęć plus ścieżka orkiestralna w 30s | 1920x1072, 24 kl./s, 30,07s, AAC | wygenerowany w 30s, osadzony poniżej; usunięto jedną nazwę IP i tekst marki łodzi, aby filtr treści Seedance go przepuścił, storyboard poza tym identyczny |
| Dark fantasy monolog po angielsku | natywny angielski głos i synchronizacja ust w ciągłym powolnym najeździe | 1280x720, 24 kl./s, 30,05s, AAC | wygenerowany w 30s z promptu dosłownie, osadzony poniżej |
| Sportowe anime 2D, prompt dwuliniowy | czy model może wypełnić 30s prawie bez instrukcji | 1280x720, 24 kl./s, 30,05s, AAC | nie generowane tutaj; pokazane jako siatka klatek tylko Wan do odczytania struktury w czasie |
| Krótka komedia z whip-panem (wykluczona) | 8 whip-panów i 8 beatów emocjonalnych bez cięcia | 1280x720, 24 kl./s, 30,04s, AAC | nie uruchomione: gęstość dialogów jest specyficzna dla mandaryńskiego, angielska przeróbka nie byłaby uczciwym porównaniem jeden do jednego |
Oficjalne demo Wan 3.0: dziesięć zaplanowanych ujęć i pełne orkiestralne narastanie w jednym 30-sekundowym przejściu, w 1920x1072. To najtrudniejszy argument za natywnym 1080p, ponieważ objętość wody i szczegóły mokrej skóry stworzenia są dokładnie tym, co upscale 720p wymyśla, a nie rozwiązuje. Podręcznik twórcy Alibaba Tongyi, używany do porównania i komentarza.
Seedance 2.5, ten sam prompt katastroficzny z dziesięcioma ujęciami w natywnych 30s, z dźwiękiem. Łódź rybacka miotana przez sztorm, przerażony pokładowiec, wznosząca się fala, a następnie głębinowy lewiatan wynurzający się na powierzchnię w błyskawicach. Jedna referencja IP i napis na kadłubie zostały usunięte, aby filtr treści Seedance go przepuścił; storyboard jest poza tym identyczny, co czyni szczegóły objętości wody i mokrej skóry uczciwym porównaniem jeden do jednego z klipem Wan 3.0 powyżej.
Oficjalne demo Wan 3.0, z dźwiękiem. Natywny angielski dialog złoczyńcy, „Ripe enough for the void”, wygłoszony w jednym powolnym, wznoszącym się ujęciu bez cięcia. To jest klip, który zespoły anglojęzyczne powinny testować, ponieważ głos, synchronizacja ust i 30-sekundowy ciągły ruch kamery muszą się utrzymać jednocześnie.
Seedance 2.5, ten sam prompt dark fantasy skopiowany dosłownie, natywne 30s, z dźwiękiem. Ten sam złoczyńca z fioletowymi oczami, oznaczenia gwiezdnych run, cień-mgławica formująca się w jego otwartej dłoni i dwie angielskie linie. Obserwuj, czy synchronizacja ust i pojedyncze ciągłe najechanie utrzymują się przez pełne 30 sekund tak, jak po stronie Wan 3.0.
Jeśli uruchomisz dopasowaną stronę Seedance 2.5 tego jednego, zachowaj dwie angielskie linie dosłownie i pamiętaj o osobliwości akcentu z notatek produkcyjnych: napisz „American”, a nie „American English”. Słowo „English” przesuwa dostawę z powrotem w kierunku brytyjskiego czytania.
Trzeci to cicha niespodzianka. Prompt 2D sportowego anime w podręczniku Alibaba ma dwie linie. Żadnych znaczników czasu, żadnej listy ujęć, tylko bokser uderzający w ciężki worek, zmęczony, cierpiący. Trzydzieści sekund z tego to prawdziwy test, czy model może wymyślić własną strukturę. Oto próbka z jego własnego czasu trwania:

Cztery klatki z oficjalnego demo 2D sportowego anime Wan 3.0, próbkowane w przybliżeniu w 1, 10, 20 i 29 sekundzie, pokazujące projekt boksera i tło siłowni przez pełne 30 sekund
Cztery klatki z oficjalnego demo 2D sportowego anime Wan 3.0, próbkowane w przybliżeniu w 1, 10, 20 i 29 sekundzie. Ten sam projekt postaci, ten sam podkoszulek, ten sam ciężki worek, ten sam rząd szafek, w zmieniającym się z szerokiego na zbliżenie, o które prompt nigdy nie prosił. Siatka nieruchomych klatek, a nie klip, ponieważ porównanie dotyczy czasu w jednym pliku, a nie ruchu.
Praktyczny wniosek: przy dwuliniowym prompcie model sam wymyślił swoje pokrycie, przechodząc od zablokowanego szerokiego ujęcia do zbliżenia potu i wyczerpania, utrzymując przy tym projekt postaci. To dobra wiadomość. Kompromis polega na tym, że straciłeś kontrolę nad tym, kiedy coś się dzieje. Jeśli potrzebujesz 30 sekund, aby umieścić konkretny beat w konkretnej sekundzie, napisz znaczniki czasu.
Przetestuj natywne opowiadanie 30s za darmo, zanim zapłacisz za którekolwiek
30-sekundowe uruchomienie w 720p na Seedance 2.5 kosztuje około 9 $, gdy wycenisz rzeczywistą rozdzielczość, a nie podłogę katalogową. 30-sekundowe uruchomienie w 1080p według cennika Wan 3.0 to 6,00 $. Żadne z nich nie jest drogie według standardów produkcyjnych, ale przy współczynniku zdjęć 3,2 do 1 nie kupujesz jednego klipu, kupujesz trzy lub cztery.
Zanim wydasz cokolwiek, warto odpowiedzieć na tańsze pytanie: czy mój scenariusz rzeczywiście działa jako jedno ciągłe ujęcie? Większość 30-sekundowych awarii to nie awarie modelu. To awarie struktury, trzy beaty upchane tam, gdzie było miejsca na dwa, lub puenta napisana w 26. sekundzie, a nic nie niesie sekund 8 do 20.
Darmowy generator skeczy reklamowych AI Atlas Cloud odpowiada na to za darmo. Podajesz jeden opis produktu i do czterech zdjęć produktu, każde poniżej 8 MB, wybierasz jeden z sześciu stylów (zabawny mem, zwrot akcji, sitcom, wzruszający, luksusowy lub twarda sprzedaż), a najpierw pisze on scenariusz z dwiema postaciami, z hakiem na trzy sekundy, konfliktem i zwrotem akcji, a następnie buduje każde ujęcie wokół tego scenariusza. Postacie wypowiadają swoje kwestie na głos, a efekty dźwiękowe są renderowane do wideo.
Uczciwe ograniczenia: to 15 sekund, a nie 30, musisz być zalogowany i dostajesz jedną darmową generację, zanim doładujesz kredyty. Ale 15 sekund z hakiem, konfliktem i zwrotem akcji mówi ci, czy twoje trzy beaty oddychają. Jeśli struktura działa tam, weź te same beaty, rozciągnij je na szkielet 0-8s / 8-16s / 16-24s / 24-30s z Kroku 1 i idź wydać te dziewięć dolarów na prawdziwe natywne 30-sekundowe przejście.
Ile faktycznie kosztuje natywny 30-sekundowy klip na Wan 3.0 vs Seedance 2.5
| Konfiguracja | Stawka | Czas trwania | Jeden klip |
|---|---|---|---|
| Wan 3.0, 1080p natywny (tylko Alibaba Cloud) | $0,20 / sek | 30s | $6,00 |
| Wan 3.0, 720p natywny (tylko Alibaba Cloud) | $0,10 / sek | 30s | $3,00 |
| Wan 3.0, 480p natywny (tylko Alibaba Cloud) | $0,05 / sek | 30s | $1,50 |
| Seedance 2.5, 720p natywny, na Atlas Cloud | $0,30 / sek mierzone w 720p, podane od $0,134 | 30s | około $9,09 |
| GPT Image 2 kadr otwierający, jakość high, 2048x1152 | podane od $0,009 / obraz | 1 obraz | $0,1745 wycena |
Porównanie, które faktycznie decyduje: Wan 3.0 w 720p jest tańszy za sekundę niż Seedance 2.5 w 720p, a w 1080p jest jedynym z tych dwóch sprzedającym prawdziwe piksele. Odpowiedzią Seedance 2.5 jest 50 slotów referencyjnych, dostępność na żywo i działające API, które możesz wdrożyć jeszcze dziś po południu.
Uwaga dotycząca źródła i licencji dla tych natywnych 30-sekundowych klipów
Każdy klip Wan 3.0 i każdy prompt Wan 3.0 w tym artykule pochodzi z publicznie dystrybuowanego podręcznika twórcy Tongyi Wan 3.0 firmy Alibaba, reprodukowany tutaj w celach porównawczych i komentatorskich, z podaniem źródła, bez modyfikacji i bez usuwania znaków wodnych. Komercyjne wykorzystanie wyników Seedance 2.5 podlega warunkom ByteDance i Volcengine; rozliczenia API i obsługa danych po stronie Atlas Cloud podlegają własnym warunkom Atlas Cloud. Żadne podobizny prawdziwych osób nie są reprodukowane w tym teście. Jeśli wysyłasz pracę klienta, przeczytaj warunki modelu dla konkretnego endpointu, który wywołujesz, a nie podsumowanie na blogu.
Często zadawane pytania
Czy natywne 30s Wan 3.0 to rzeczywiście jeden przejście, czy składane klipy?
Jeden przejście. Wan 3.0 generuje 2 do 30 sekund w jednej generacji z opcją inteligentnego czasu trwania, więc może również zdecydować, że klip nie potrzebuje pełnych 30 sekund. Różni się to od rozszerzenia ostatniej klatki, gdzie drugi klip jest inicjowany z ostatniej klatki pierwszego, a tożsamość dryfuje w poprzek szwu.
Który z nich jest naprawdę 1080p przy 30 sekundach, Wan 3.0 czy Seedance 2.5?
Wan 3.0. Ma natywny poziom 1080p w swoim cenniku, a własne 30-sekundowe pliki demo Alibaba mierzą 1920x1072. Seedance 2.5 generuje natywnie tylko w 480p i 720p; jego opcje 1080p, 1440p i 4K to ulepszenia źródła 720p, a jego dokumentacja API opisuje poziom 4K jako „nie natywne generowanie 4K”.
Czy obraz nadal się rozpada w 25. sekundzie?
Może, ale awaria zmieniła kształt. Zamiast widocznego szwu między klipami, dostajesz morfing i dekoherencję w ujęciu, skoncentrowane w szybkich fragmentach, a upscaling tego nie usuwa. Udokumentowana produkcja filmu krótkometrażowego Seedance 2.5 miała współczynnik zdjęć 3,2 do 1, więc planuj długie ujęcia z coverage.
Który model przyjmuje więcej materiału referencyjnego?
Seedance 2.5, z dużą przewagą: 30 obrazów plus 10 filmów plus 10 plików audio, łącznie 50, przy czym film referencyjny i audio są ograniczone do łącznie 30 sekund na żądanie. Podręcznik Wan 3.0 ogranicza referencje do 20, ale jest to jedyny model, który akceptuje pliki .pdf, .ppt, .xls, .doc, .txt i żywe strony internetowe jako kreatywne wejście.
Czy Wan 3.0 będzie miał otwarte wagi?
Nie ma oficjalnego zobowiązania. Na dzień publicznej bety w sierpniu 2026 nie opublikowano żadnych wag Wan 3.0, punktu kontrolnego Hugging Face ani węzła ComfyUI, a oficjalne otwarte wagi dla flagowej linii wideo kończą się na Wan 2.2 (Kingy AI, sierpień 2026). Traktuj wszystko inne, co przeczytasz o upuszczeniu wag 3.0, jako spekulację, dopóki Alibaba nie powie inaczej.






