
Najnowsza aktualizacja: Wan 3.0 jest już dostępny od 24 sierpnia 2026 roku.
Ściana w studiu korekcji barw, pokazująca to samo ujęcie dachu w deszczu z czasami od 00:00 do 00:30
Trzydzieści sekund jednego ciągłego ujęcia, rozłożonego na osi czasu. Dotarcie tam to cała historia.
W dniu, gdy Wan 3.0 Preview wszedł w publiczną betę, poszukałem jego specyfikacji. Pierwsza strona wyników mówiła, że robi natywne 4K, że jest wydawany na Apache 2.0 i że ma „tryb reżysera AI z sześcioma kamerami”. Sześć różnych stron, te same twierdzenia, i żadna z nich nie linkowała do źródła.
Otworzyłem więc oficjalną stronę modelu Alibaby. 480P, 720P, 1080P. Żadnego 4K. Potem uderzyłem bezpośrednio w API Hugging Face i pobrałem wszystkie repozytoria w organizacji Wan-AI. Najnowsze to Wan2.2-Animate-2, wypchnięte tego samego dnia, co premiera Wan 3.0. Nie ma niczego w wersji 3.0.
Potem zrobiłem to, czego nikt inny nie robi. Główną cechą Wan 3.0 jest 30 sekund ciągłego wideo w jednym przebiegu, a ja nie mam do niego dostępu, więc spróbowałem odtworzyć ten wynik za pomocą modeli, które faktycznie mogę dziś wywołać. Nie udało się. Sposób, w jaki poniosłem porażkę, okazał się najcenniejszą rzeczą w tym artykule.
Najważniejsze wnioski
- Wan 3.0 Preview wszedł w publiczną betę 6 sierpnia 2026 roku. ID modelu
wan3.0-video, dostęp ograniczony aplikacją w Alibaba Cloud Model Studio i Qwen Cloud. To nie jest otwarta rejestracja. - Rzeczywiste specyfikacje: do 30 sekund w jednym przebiegu, 480P/720P/1080P, w cenie $0,05/$0,10/$0,20 za sekundę wyjściową.
- Nie ma 4K ani otwartych wag. Zapytałem API Hugging Face o każde repozytorium w
Wan-AI. Nie ma nic powyżej Wan 2.2 dostępnego do pobrania. - Prawdziwym wąskim gardłem są limity szybkości: 2 równoczesne żądania, 30 RPM, 50 zadań w kolejce asynchronicznej.
- Nie da się sfałszować 30-sekundowego ujęcia w jednym ujęciu za pomocą Wan 2.7. Trzy nieudokumentowane ograniczenia ograniczają najdłuższy rzeczywiście ciągły klip do 15 sekund, a połączenie drugiej kontynuacji powoduje, że model zapętla się wstecz, a nie do przodu.
15-sekundowa ściana: Co tak naprawdę sprzedaje Wan 3.0 Preview
Oto najlepszy wynik, jaki udało mi się uzyskać. Piętnaście nieprzerwanych sekund w 1080P: zbliżenie na neonowy szyld, sprzedawca zamykający stoisko z kawą na dachu w deszczu, potem zjazd w dół na mokrą ulicę i taksówka. Jeden ciągły wygenerowany plik, bez montażu, z wygenerowanym dźwiękiem.

Piętnaście sekund ciągłego wideo Wan 2.7: neonowy szyld, sprzedawca na dachu, zjazd w dół na deszczową ulicę i taksówka
Najdłuższy rzeczywiście ciągły klip, który wyprodukowała dla mnie rodzina Wan 2.7: 15 sekund, 1080P, jeden plik. Pokazany tutaj jako cichy GIF; dostarczony plik zawiera dźwięk stereo 44,1 kHz.
To jest dobre. To także dokładnie połowa tego, co Wan 3.0 obiecuje w jednym wywołaniu, i 15 sekund to miejsce, w którym sufit jest szczelnie zamknięty. Wszystko poniżej pokazuje, jak znalazłem tę spoinę.
Dlaczego każda przeczytana przez Ciebie specyfikacja Wan 3.0 Preview jest prawdopodobnie błędna
Dwie rzeczy sprawiają, że ta premiera jest wyjątkowo głośna. Po pierwsze, 30 sekund w jednym przejściu generowania to prawdziwy debiut w tej rodzinie. Wan2.7-Video maksymalnie osiąga 15 sekund, a większość głównych modeli wideo mieści się w przedziale 5–15 (TNGlobal, sierpień 2026). Po drugie, Wan 3.0 przyjmuje wejściowe referencje, których nikt inny nie akceptuje: oprócz tekstu, obrazu, dźwięku i wideo, akceptuje pliki doc, xls, ppt, pdf i md, a także strony internetowe, więc prezentacja staje się wideo (AlphaSignal, sierpień 2026).
To połączenie wywołało ogromną ilość relacji ze stron, które nigdy nie otworzyły dokumentacji. Oto każde szeroko rozpowszechnione twierdzenie, sprawdzone względem źródła.
Tabela A: Sprawdzenie specyfikacji Wan 3.0 Preview
| Krążące twierdzenie | Co mówi źródło pierwotne | Werdykt |
|---|---|---|
| 30 sekund w jednym przejściu generowania | Potwierdzone, w porównaniu do 2–15 s w Wan 2.7 | ✅ Prawda |
| Natywne wyjście 4K | Oficjalne rozdzielczości to tylko 480P, 720P i 1080P | ❌ Fałsz |
| Otwarte wagi na Apache 2.0 | Repozytorium Wan 3.0 nie istnieje w Wan-AI na Hugging Face | ❌ Fałsz |
| Dokument-na-wideo (PDF, PPT, XLS) | Potwierdzone jako typ wejścia referencyjnego | ✅ Prawda |
| „Tryb reżysera AI z sześcioma kamerami” | Nie występuje w dokumentacji Alibaby | ❙ Nieobsługiwane |
| „Synchronizacja ruchu warg w 12 językach z blokadą tożsamości” | Nie występuje w dokumentacji Alibaby | ❙ Nieobsługiwane |
| $0,05 / $0,10 / $0,20 za sekundę | Potwierdzone dla 480P / 720P / 1080P | ✅ Prawda |
| Otwarte dla wszystkich | Dostęp za aplikacją w Model Studio i Qwen Cloud | ⚠️ Beta, wymagane zaproszenie |
Ceny i limity szybkości pochodzą wprost ze strony modelu: 2 równoczesne żądania, 30 żądań na minutę i kolejka asynchroniczna na 50 zadań (QwenCloud, sierpień 2026). Ta liczba równoczesności prawie nie pojawia się w relacjach, a jest najważniejszą linią na stronie. Dwa równoległe zadania, każde trwające minuty, są w porządku na demo premierowe. To nie jest pipeline.
Teraz pytanie, które naprawdę interesuje społeczność open source. Wan 2.1 i Wan 2.2 dostarczyły punkty kontrolne do pobrania. Wan 2.5 obiecywał wagi, które nigdy nie dotarły, Wan 2.6 był w pełni zamknięty, a Wan 2.7 pozostał tylko przez API. Sprawdziłem, czy 3.0 przerywa tę passę, pytając API Hugging Face o każdy model w organizacji Wan-AI, posortowany według daty utworzenia. Trzy najnowsze repozytoria to warianty Wan2.2-Animate-2 utworzone 6 sierpnia 2026, tego samego dnia, co premiera Wan 3.0. Najczęściej pobierane repozytorium to wciąż Wan2.2-TI2V-5B-Diffusers z około 179 000 pobrań w ciągu ostatnich 30 dni (Hugging Face, sierpień 2026).
Więc odpowiedź brzmi: nie, a Wan 2.2 pozostaje sufitem otwartych wag. Jeśli Twój plan obejmował uruchomienie tego lokalnie lub dostrojenie, nie ma czego uruchomić.
Wypróbuj działający model na Atlas Cloud: otwórz Wan 3.0 Text-to-Video na Atlas Cloud.
Rzeczywiste uruchomienie w playgroundzie Atlas Cloud Wan 3.0 Text-to-Video: prompt po lewej, a ukończony wygenerowany klip po prawej.
Stos Wan 3.0 Preview: Co możesz faktycznie uruchomić dzisiaj
Sytuacja dzieli się wyraźnie. Wan 3.0 znajduje się za formularzem aplikacyjnym z limitem dwóch równoczesnych zadań. Wszystko przed nim, od Wan 2.7 z powrotem do 2.2, jest dostępne natychmiast za pomocą jednego klucza API, obok Seedance i Kling do porównań międzymodelowych. Wszystko w tym artykule zostało uruchomione w ten sposób, w jednej karcie przeglądarki.
Ceny poniżej pochodzą z katalogu modeli Atlas Cloud z 10 sierpnia 2026, a nie z żadnego wpisu na blogu.
Tabela B: Wan 3.0 Preview w porównaniu z tym, co jest na półce
| Model | Najdłuższy pojedynczy przebieg | Rozdzielczości | Dostęp | Równoczesność | Cena za sekundę (wg cennika) |
|---|---|---|---|---|---|
| Wan 3.0 Preview | 30s | 480P / 720P / 1080P | Wymagana aplikacja | 2 | $0,05 / $0,10 / $0,20 |
| Wan 2.7 text-to-video | 15s | 720P / 1080P / 1080P-SR / 1440P-SR | Otwarte | Standard | od $0,10 |
| Wan 2.7 image-to-video | 15s | 720P / 1080P | Otwarte | Standard | od $0,10 |
| Wan 2.6 text-to-video | 15s | 720p / 1080p | Otwarte | Standard | $0,07 (30% zniżki od $0,10) |
| Wan 2.5 text-to-video | 10s | 720p / 1080p | Otwarte | Standard | $0,035 (30% zniżki od $0,05) |
| Wan 2.2 image-to-video | 10s | 480p / 720p | Otwarte, wagi do pobrania | Standard | $0,03 |
| Seedance 2.5 text-to-video | 30s | 480p / 720p | Otwarte | Standard | od $0,134 |
| Kling v3.0 Pro text-to-video | 15s | Domyślna modelu | Otwarte | Standard | $0,095 (15% zniżki od $0,112) |
Zniżki obowiązują od sierpnia 2026 i są ograniczone czasowo, więc przed planowaniem budżetu sprawdź stronę modelu.
Z tej tabeli wynikają dwie rzeczy. 30-sekundowy pojedynczy przebieg Wan 3.0 nie jest już unikalny: Seedance 2.5 już akceptuje czas trwania od 4 do 30 sekund w jednym wywołaniu, tylko ograniczony do 720p. A Wan 2.7 jest jedynym wierszem oferującym 1440P-SR, poziom superrozdzielczości rozliczany na 80% natywnego 1080P zgodnie z własnym schematem, czego Wan 3.0 nie ma.
To, co ma Wan 3.0, a czego nie ma nikt inny, to 30 sekund w 1080P w jednym przebiegu, plus referencyjne wejścia dokumentów. Wan 3.0 ma stronę zastępczą na Atlas Cloud oznaczoną jako Coming Soon, więc pojawi się na tym samym kluczu, gdy zostanie udostępniony. Do tego czasu oto dokładnie, jak daleko zajdą Cię starsze modele.
Samouczek Wan 3.0 Preview Krok 1: Napisz brief jednoujęciowy
Brief przenosi się między generacjami, więc napisz go raz. Wan 3.0 nagradza długie, opisane w czasie opisy ujęć, a Wan 2.7 akceptuje tę samą strukturę w ramach limitu 5000 znaków na prompt.
Szablon, który działa: Ujęcie [czas] + akcja podmiotu + ruch kamery + światło + dźwięk otoczenia. Zadeklaruj w pierwszej linii, że ujęcie jest ciągłe, i wyraźnie opisz tło dźwiękowe, ponieważ Wan 2.7 natywnie generuje dźwięk i wymyśli coś nieprzydatnego, jeśli zostawisz to puste.
Celowo wybrałem deszczowe nocne stoisko z kawą na dachu. To test warunków skrajnych dla czterech rzeczy, które zwykle się psują jednocześnie: ciągły ruch kamery, spójność twarzy w czasie, mokre neonowe odbicia i ciągłe tło dźwiękowe otoczenia.
textCopy
text11BEAT 1 (0-10s): Powolny dolly-in od migoczącego różowo-cyjanowego neonowego szyldu w kierunku 22młodej kobiety sprzedawczyni wycierającej stalowy blat na stoisku z kawą na dachu. 33BEAT 2 (10-15s): Kamera zjeżdża w dół ponad krawędź dachu na mokrą ulicę 44poniżej, sunąc w kierunku taksówki stojącej na chodniku. 55Stałe: ulewny deszcz, paleta neonów, 35 mm anamorficzny, ziarno filmowe, bez cięć. 66
To jest plan, a nie prompt. Prompt, który wklejasz, znajduje się poniżej.
Krok 2: Wygeneruj otwarcie w 1080P
Otwórz stronę Wan 2.7 text-to-video i wklej Beat 1, zapisany w pełnej formie.
textCopy
text11Ciągłe ujęcie jednoujęciowe, bez cięć. Nocne stoisko z kawą na dachu w Shenzhen w deszczu. 22Ujęcie [0-4s]: Powolny dolly-in od migoczącego różowo-cyjanowego neonowego szyldu w kierunku 33młodej kobiety sprzedawczyni wycierającej stalowy blat, deszcz przeszywający neonowy 44blask, para unosząca się z czajnika. 55Ujęcie [4-10s]: Kamera zatrzymuje się na wysokości klatki piersiowej, gdy ona podnosi wzrok i uśmiecha się lekko, 66płytka głębia ostrości, mokre odbicia na blacie, krople deszczu widoczne na tle 77ciemnego nieba za nią. 88Dźwięk: jednostajny deszcz, odległy szum ruchu, brzęk ceramicznego kubka. 99Kinowe, anamorficzne, 35 mm, wysoki zakres dynamiki, drobne ziarno filmowe. 1010
Ustawienia: Rozdzielczość 1080P, Proporcje 16:9, Czas trwania 10, Rozszerzanie promptu WYŁĄCZONE.
Rozszerzanie promptu jest domyślnie włączone i przepisuje prompt przed generowaniem, co po cichu niszczy kontrolę nad ujęciami opisanymi w czasie. Wyłącz je, gdy kluczowa jest rozpisana sekwencja ujęć.
Ustaw czas trwania na 10, a nie na maksymalne 15 sekund. To nie jest decyzja kosztowa, a przyczyna stanie się widoczna dopiero w Kroku 3.

Wan 2.7 text-to-video na Atlas Cloud, ukończone uruchomienie, wyjście 1080P widoczne w panelu OUTPUT
Krok 2 w playgroundzie: wklejony prompt, 1080P, 16:9, uruchomienie zakończone z wynikiem po prawej. Zwróć uwagę na kwotę przycisku Run wynoszącą $0,75 za pięciosekundowe zadanie w 1080P, co daje $0,15 za sekundę, a nie katalogowe „od $0,10”.
Krok 3: Kontynuuj i obserwuj, gdzie się psuje
Punkt końcowy image-to-video Wan 2.7 ma tryb kontynuacji wideo, który pobiera istniejący klip i kontynuuje nagrywanie. Weź adres URL wyjścia z Kroku 2, umieść go w polu video, ustaw Czas trwania na 15 i wklej Beat 2:
textCopy
text11Kontynuuj to samo nieprzerwane ujęcie z identycznym językiem kamery i oświetleniem. 22Zjazd kontynuuje się poza krawędź dachu na poziom ulicy, kamera 33sunie do przodu przez deszcz w kierunku taksówki stojącej na chodniku, wycieraczki 44pracują. Zachowaj intensywność deszczu, paletę kolorów neonów, ziarno filmowe i dźwięk 55otoczenia identyczny jak w klipie źródłowym. Bez cięcia, bez zaniku, bez zmiany sceny. 66
To daje 15-sekundowy klip na początku tego artykułu. Teraz trzy ograniczenia, na które trafiłem, z których żadne nie jest w dokumentacji.
Po pierwsze: klip źródłowy musi mieć od 2 do 10 sekund. Dlatego Krok 2 jest ograniczony do 10. Wygeneruj 15-sekundowe otwarcie i nie możesz go w ogóle przedłużyć, ponieważ 15-sekundowy plik nie jest prawidłowym wejściem.
Po drugie: żądany czas trwania musi przekraczać czas trwania źródła. Podaj 10-sekundowy klip i poproś o 10 sekund, a API odrzuci to wprost: first_clip duration (10s after trim) must be less than the requested duration (10s). Zatem wyjście zawiera źródło, a maksymalnie możesz zyskać w jednym przejściu 5 sekund.
Po trzecie: nie zachowuje Twojego klipu źródłowego. To jest to, co ma znaczenie. Poniżej górny wiersz to oryginalny 10-sekundowy klip w czasie 5s i 9,9s. Dolny wiersz to wyjście kontynuacji w tych samych dwóch znacznikach czasu.

Cztery klatki porównujące klip źródłowy i wyjście kontynuacji w 5 sekundach i 9,9 sekundach
Górny wiersz: klip źródłowy w 5s i 9,9s. Dolny wiersz: wyjście kontynuacji w tych samych znacznikach czasu. W 5s pasują. W 9,9s źródło wciąż pokazuje sprzedawczynię, podczas gdy kontynuacja przeszła już na ulicę, ponieważ skompresowała źródło do mniej więcej pierwszych sześciu sekund, a resztę poświęciła na nowy materiał.
Zatem kontynuacja to nie łączenie. Renderuje Twój klip szybciej, aby zrobić miejsce, a ostatnie kilka sekund oryginalnego występu po prostu znika.
Co nasuwa oczywisty pomysł: połącz to w łańcuch. Podaj wynik 15 sekund z powrotem i poproś o kolejne 15. Próbowałem. Oto, co wróciło.

Druga kontynuacja w łańcuchu, która dryfuje z powrotem do sprzedawcy na dachu zamiast rozwijać scenę
Drugie przejście kontynuacji. Odtwarza ulicę i taksówkę, a następnie zapętla się z powrotem do sprzedawcy na dachu od samego początku sekwencji zamiast iść do przodu. Łańcuchowanie nie kumuluje się.
To jest ściana. Limit wyjścia to 15 sekund, limit wejścia to 10, a drugie ogniwo łańcucha biegnie wstecz. Piętnaście sekund rzeczywiście ciągłego materiału to sufit dla tej rodziny modeli. Wszystko dłuższe to cięcie, a nie ujęcie, a cięcia są dokładnie tym, co 30-sekundowy pojedynczy przebieg ma eliminować.
Jedno zastrzeżenie: przechwytywanie playgroundu dla tego kroku kontynuacji nie powiodło się trzy razy, ponieważ domyślny obraz referencyjny strony przejmował uruchomienie, więc Krok 3 został wykonany przez API, a nie przez interfejs playgroundu. Prompt, ustawienia i wyniki powyżej pochodzą z tego rzeczywistego uruchomienia.
Ile faktycznie kosztuje 30 sekund Wan 3.0 Preview
Przycisk Run w Kroku 2 podał kwotę $0,75 za pięciosekundowe zadanie w 1080P. To daje $0,15 za sekundę, a nie $0,10 wymienione w katalogu, ponieważ podana wartość to podstawa, a rozliczanie skaluje się z rozdzielczością. Zawsze ufaj kwocie z przycisku, a nie karcie.
Przy tej rzeczywistej stawce moje 15 sekund ciągłego materiału kosztowało $1,50 za 10-sekundowe otwarcie plus $2,25 za kontynuację, więc $3,75 za 15 dostarczonych sekund.
Tabela C: ile kosztuje 30 sekund na pięć sposobów
| Ścieżka | Obliczenia | Razem | Co faktycznie otrzymujesz |
|---|---|---|---|
| Wan 3.0 Preview, 1080P | $0,20 × 30 | $6,00 | 30s ciągłe, jeden przebieg, bez szwów |
| Wan 3.0 Preview, 720P | $0,10 × 30 | $3,00 | 30s ciągłe w 720P |
| Wan 3.0 Preview, 480P | $0,05 × 30 | $1,50 | 30s ciągłe w 480P |
| Wan 2.7, otwarcie plus kontynuacja | $0,15 × 25 rozliczone | $3,75 | Tylko 15s. Nie można osiągnąć 30. |
| Seedance 2.5, 480p | od $0,134 × 30 | ~$4,05 | 30s ciągłe, ograniczone do 720p |
Przeczytaj ponownie czwarty wiersz. Wyprodukowanie 15 ciągłych sekund na Wan 2.7 kosztowało więcej niż Wan 3.0 pobiera za 30 ciągłych sekund w 720P. Obejście nie jest tańszą opcją, jest droższą, a do tego nie działa.
Jedno zastrzeżenie dotyczące wiersza Seedance: jego podana stawka to podstawa dla 480p, a model rozlicza według obszaru pikseli, więc 720p w praktyce kosztuje około 2,25 razy tyle.
Jeśli chodzi o licencjonowanie, należy zachować ostrożność. Wan 3.0 jest w fazie beta, więc warunki komercyjne wynikają z umowy serwisowej Alibaba Cloud, którą akceptujesz podczas składania aplikacji, a nie z żadnej licencji modelu, i mogą się zmienić przed ogólną dostępnością. Bez opublikowanych wag wdrożenie lokalne i dostrajanie nie są możliwe. Przed wysłaniem pracy klienta potwierdź wymagania dotyczące atrybucji i znaków wodnych na podstawie własnych warunków konta.
Często zadawane pytania
Czy Wan 3.0 Preview jest już dostępny dla wszystkich?
Nie. Wszedł w publiczną betę 6 sierpnia 2026, ale dostęp jest ograniczony aplikacją przez Alibaba Cloud Model Studio i Qwen Cloud. Zatwierdzone konta otrzymują 2 równoczesne żądania, 30 RPM i kolejkę asynchroniczną na 50 zadań, co jest przeznaczone do oceny, a nie do produkcji.
Czy Wan 3.0 Preview jest open source i gdzie są wagi?
Nie ma żadnych. Zapytanie API Hugging Face o każde repozytorium w organizacji Wan-AI nie zwraca niczego powyżej Wan 2.2. Trzy najnowsze repozytoria, wszystkie warianty Wan2.2-Animate-2, zostały utworzone tego samego dnia, co premiera Wan 3.0. Wan 2.2 pozostaje sufitem otwartych wag.
Czy Wan 3.0 Preview naprawdę robi natywne 4K?
Nie. Oficjalna dokumentacja wymienia 480P, 720P i 1080P. Twierdzenie o 4K pochodzi ze stron agregujących, które cytują siebie nawzajem, a nie źródło pierwotne, i jest sprzeczne z własną tabelą cenową Alibaby, która ma dokładnie trzy poziomy rozdzielczości.
Ile kosztuje 30-sekundowe wideo Wan 3.0 Preview?
W 1080P $0,20 za sekundę wyjściową daje $6,00 za 30 sekund. W 720P to $3,00, a w 480P $1,50. Dla porównania, 15 ciągłych sekund na Wan 2.7 w 1080P kosztowało mnie $3,75 przy rzeczywistej stawce rozliczeniowej.
Czy mogę wygenerować 30-sekundowe ujęcie w jednym ujęciu dzisiaj bez dostępu do Wan 3.0 Preview?
Nie z Wan 2.7. Jego tryb kontynuacji ogranicza wyjście do 15 sekund, akceptuje tylko klipy źródłowe o długości 10 sekund lub krótsze i zapętla się wstecz po połączeniu w łańcuch. Seedance 2.5 zrobi od 4 do 30 sekund w jednym przebiegu, ale tylko do 720p.
Wan 3.0 Preview kontra Wan 2.7: czy warto czekać?
Jeśli potrzebujesz ciągłego ujęcia dłuższego niż 15 sekund lub referencyjnych wejść dokumentów i stron internetowych, tak, i nie ma innego rozwiązania. W przypadku wszystkiego, co ma 15 sekund lub mniej, Wan 2.7 jest teraz bardziej praktyczny, ponieważ limit 2 żądań równoczesnych sprawia, że praca wsadowa na 3.0 jest wolniejsza niż na modelu, który zastępuje.







