Najnowsza aktualizacja: Wan 3.0 jest już dostępny od 24 sierpnia 2026 roku.
Otworzyłeś sześć kart. Każda z nich pokazała ci czysty wykres: 1,3B na 8 GB, 14B na 24 GB, Apache-2.0, wydany w kwietniu 2026. Więc otworzyłeś stronę Wan-AI na Hugging Face, żeby pobrać punkt kontrolny.
27 repozytoriów. Najnowsze to Wan2.2.
Te wykresy nie są nieaktualne. Zostały zmyślone. Wymagania VRAM dla Wan 3.0 nie mogły zostać zmierzone przez nikogo spoza Alibaba, ponieważ Wan 3.0 wszedł w publiczną betę dopiero 6 sierpnia 2026 i nigdy nie udostępnił plików wag. W kwietniu nie było co wydawać.
Więc jaka jest prawdziwa odpowiedź? Nikt tego nie testował. Ale specyfikacja samego Wan 3.0 precyzyjnie określa odpowiedź, a my wykonaliśmy poniższe obliczenia.
Najważniejsze wnioski
- Żadne wagi Wan 3.0 nie istnieją nigdzie. Każda tabela VRAM dla niego w sieci jest sfabrykowana.
- Wan 3.0 to beta API pierwszej strony: maks. 30 s, maks. 1080P, bez poziomu 4K.
- Jego własne specyfikacje implikują 13,5x sekwencję latentną w porównaniu do 5-sekundowego klipu 720P, co oznacza ~180x obciążenie uwagi.
- Prawdziwy lokalny limit to obecnie Wan2.2 TI2V-5B na 24 GB lub 6 GB z kwantyzacją społecznościową.
- Do wyjścia 1080P w tym tygodniu wynajmij sekundy zamiast kupować VRAM.

Wymagania VRAM Wan uwidocznione: ta sama pierwsza klatka animowana na poziomie 720P po lewej i na poziomie 1080P po prawej, obie wyrenderowane bez lokalnego GPU
Ta sama pierwsza klatka, ten sam prompt ruchu, ten sam model. Zmienia się tylko poziom rozdzielczości: 720P po lewej za 0,50 $ za 5 sekund, 1080P po prawej za 0,75 $. Oba wyrenderowano na Wan 2.7 z zerowym lokalnym VRAM, a cena na każdej etykiecie to kwota, którą faktycznie podał przycisk Uruchom. Pokazane jako cichy GIF.
O to właśnie chodzi w całej tej dyskusji. Nie o gigabajty. O piksele.
Dlaczego każda tabela wymagań VRAM dla Wan 3.0, którą znalazłeś, jest fikcją
Wniosek najpierw: strony z najwyższymi pozycjami dla tego słowa kluczowego wykorzystały liczby z Wan 2.1 i Wan 2.2, przykleiły etykietę „3.0” i wymyśliły datę wydania. Możesz to obalić w około 60 sekund.
Sprawdź to.

Strona organizacji Wan-AI na Hugging Face pokazująca 27 repozytoriów z Wan2.2 jako najwyższą wersją, co dowodzi, że nie istnieją żadne wagi Wan 3.0 do lokalnego testowania VRAM
Oficjalna organizacja Wan-AI na Hugging Face, zakładka modele, posortowane od najnowszych. 27 repozytoriów, a najwyższy numer wersji na liście to 2.2 (Hugging Face, sierpień 2026).
Nie ma repozytorium Wan3.0. Nie ma też repozytoriów Wan2.7, Wan2.6 ani Wan2.5. Najnowszym elementem w organizacji jest Wan2.2-Animate-2-14B-Diffusers, zaktualizowany siedem dni temu (Hugging Face, sierpień 2026).
Oto szczegółowe zestawienie.
Tabela 1: co twierdzą przewodniki vs co jest weryfikowalne
| Twierdzenie, które znajdziesz na stronie 1 | Weryfikowalne na sierpień 2026 | Jak to sprawdzić samodzielnie |
|---|---|---|
| „Wan 3.0 wydany jako wagi 1.3B + 14B w kwietniu 2026” | Wan 3.0 otworzył publiczną betę 6 sierpnia 2026. Brak wag w jakiejkolwiek dacie. | Załaduj stronę organizacji Wan-AI |
| „Wan 3.0 jest na licencji Apache-2.0” | Nigdy nie opublikowano pliku licencji dla 3.0 | Przeszukaj organizację w poszukiwaniu repozytorium 3.0. Nie ma go. |
| „1.3B działa na 8 GB, 14B na 24 GB” | To są wartości dla Wan 2.1/2.2. Sam Wan 2.2 A14B wymaga 80 GB. | Sekcja sprzętowa README Wan2.2 |
| „Pełny poziom 4K / 30 s workflow” | Beta kończy się na 1080P. Poziomy to 480P, 720P, 1080P. | Własna lista cen Alibaba za sekundę |
| „Działa w ComfyUI / WanGP dzisiaj” | Lista obsługiwanych przez WanGP obejmuje tylko Wan 2.1/2.2 | README Wan2GP |
To, co Alibaba faktycznie dostarczyło w sierpniu 2026, to produkt API i internetowy, a nie punkt kontrolny. Jedna generacja trwa do 30 sekund, rozdzielczość ograniczona do 1080P, a jako dane wejściowe akceptuje tekst, obrazy, audio, wideo, a nawet dokumenty (doc, xls, ppt, pdf, md). Ceny API wynoszą ¥0,3 / ¥0,6 / ¥1,2 za sekundę dla 480P / 720P / 1080P (QbitAI, sierpień 2026).
Zwróć uwagę, czego brakuje na tej liście: linku do pobrania.
Wymagania VRAM dla Wan 3.0, obliczone na podstawie własnych specyfikacji
Obiecuję: pod koniec tej sekcji będziesz wiedział, dlaczego „po prostu weź kartę 32 GB” nie zadziała, z liczbami, które możesz samodzielnie odtworzyć. Dowód: obliczenie wymaga tylko dwóch opublikowanych faktów – współczynnika kompresji VAE Wan oraz pułapu 1080P/30s Wan 3.0.
Zaczynamy.
To długość sekwencji, a nie liczba parametrów. Każdy patrzy na liczbę B. To zmienna, na którą nie należy patrzeć.
Pamięć i obliczenia transformatora dyfuzyjnego wideo skalują się z liczbą tokenów latentnych, które musi obsłużyć, a ta liczba pochodzi z rozdzielczości razy czas trwania, a nie z parametrów. VAE Wan2.2 kompresuje w 4x16x16 w czasie, wysokości i szerokości, a DiT patchyfikuje na tym, więc każdy token latentny obejmuje w przybliżeniu blok 4x32x32 pikseli (README Wan2.2, sierpień 2026). Starszy VAE generacji Wan2.1 kompresuje w 4x8x8, więc z patchyfikacją to 4x16x16 na token, czyli cztery razy więcej tokenów dla tego samego klipu.
Przepuśćmy przez to własny pułap Wan 3.0 i oto, co otrzymujemy.
Tabela 2: liczba tokenów latentnych według docelowego klipu (nasze obliczenia, 24 fps)
| Docelowy klip | Liczba klatek | Liczba klatek latentnych | Tokeny (VAE gen. 2.2) | Tokeny (VAE gen. 2.1) | vs 5s 720P |
|---|---|---|---|---|---|
| 5s 480P (832x480) | 121 | 31 | 12 090 | 48 360 | 0,44x |
| 5s 720P (1280x704) | 121 | 31 | 27 280 | 109 120 | 1,0x (linia bazowa) |
| 10s 1080P (1920x1088) | 241 | 61 | 124 440 | 497 760 | 4,6x |
| 30s 1080P (1920x1088) | 721 | 181 | 369 240 | 1 476 960 | 13,5x |
Przeczytaj ostatni wiersz jeszcze raz. Główna możliwość Wan 3.0 to 13,5x długość sekwencji w porównaniu do 5-sekundowego klipu 720P, nad którym twój 4090 obecnie się poci.
A samo-uwaga jest kwadratowa względem długości sekwencji. 13,5 do kwadratu to około 180. Zatem praca uwagi dla jednego klipu 30s 1080P jest z grubsza 180x większa niż dla jednego klipu 5s 720P, zanim policzymy cokolwiek innego.
To jest liczba, której nikt w SERP nie obliczył. To także powód, dla którego „kup 8 więcej gigabajtów” nie jest planem.
Więc co to oznacza w gigabajtach? Wagi to nudna część. MoE o łącznej wielkości 27B w fp8 to około 27 GB rezydentnie, bf16 około 54 GB. MoE pomaga tylko w obliczeniach na krok (A14B Wan2.2 aktywuje 14B z 27B parametrów na krok), a nie w tym, co musi być w pamięci.
Interesująca część to aktywacje. Stan ukryty jednej warstwy transformatora przy wymiarze modelu 5120 w bf16 kosztuje tokeny x 5120 x 2 bajty:
- 5s 720P (27 280 tokenów): 0,28 GB na warstwę
- 30s 1080P (369 240 tokenów): 3,8 GB na warstwę
- 30s 1080P na VAE generacji 2.1 (1 476 960 tokenów): 15,1 GB na warstwę
Na warstwę. Pomnóż przez liczbę warstw, które twoja implementacja uwagi musi utrzymać w pamięci, dodaj koder tekstu, dodaj przejście dekodowania VAE, a liczba 80 GB przestaje wydawać się konserwatywna.
Tabela 3: szacunkowe VRAM, jeśli wagi kiedykolwiek zostaną wydane (SZACUNEK, nie pomiar)
| Docelowy klip | Jeśli model 5B o wysokiej kompresji (fp8) | Jeśli to MoE klasy A14B (fp8) | Werdykt praktyczny |
|---|---|---|---|
| 5s 480P | ~8-10 GB | ~30-34 GB | karta 12 GB jest możliwa tylko dla małego modelu |
| 5s 720P | ~10-14 GB | ~34-40 GB | minimum 16 GB, komfortowo 24 GB |
| 10s 1080P | ~20-28 GB | ~45-60 GB | karta 32 GB jest już na granicy |
| 30s 1080P | ~45-70 GB | ~90-140 GB | żadna konsumencka karta, przy żadnej kwantyzacji |
Każda komórka w tej tabeli to SZACUNEK wyprowadzony z Tabeli 2 plus opublikowane rozmiary punktów kontrolnych. Rzeczywiste wartości zależą od jądra uwagi, strategii offloadu i tego, czy Alibaba kiedykolwiek wyda wagi. Traktuj to jako zarys problemu, a nie arkusz specyfikacji.
Zarys jest wystarczająco jasny: flagowe ustawienie nigdy nie było obciążeniem dla konsumenckiego GPU.
Wymagania VRAM Wan, które faktycznie możesz osiągnąć dzisiaj
Oto część, którą sfabrykowane tabele udawały. Te liczby są opublikowane przez zespół Wan i są prawdziwe.
Tabela 4: rzeczywiste poziomy VRAM Wan, sierpień 2026
| Wariant | Minimalny VRAM | Rozdzielczość | Zmierzona szybkość | Flagi, których potrzebujesz | Wagi |
|---|---|---|---|---|---|
| Wan2.2 T2V-A14B / I2V-A14B | 80 GB pojedynczy GPU | 480P / 720P | nie opublikowano | --offload_model True --convert_model_dtype | Apache-2.0 |
| Wan2.2 TI2V-5B | 24 GB (RTX 4090) | 720P @ 24fps | 5s 720P w poniżej 9 minut | --offload_model True --convert_model_dtype --t5_cpu | Apache-2.0 |
| Wan 2.1 / 2.2 przez WanGP | 6 GB i więcej | głównie 480P | wolniej, utrata jakości | int8 / fp8 / gguf / NVFP4 / Nunchaku | Apache-2.0 base |
| Wan 2.5 / 2.6 / 2.7 | n/d | tylko API | n/d | n/d | brak opublikowanych |
| Wan 3.0 | n/d | tylko API, beta pierwszej strony | n/d | n/d | brak opublikowanych |
Dwie rzeczy w tej tabeli zasługują na drugie spojrzenie.
Po pierwsze: wiersz A14B ma już włączone obie flagi oszczędzania pamięci i nadal wymaga 80 GB. Jest to oficjalna liczba dla pojedynczego GPU, a nie naiwna. Po drugie: wiersz 5B jest uczciwą odpowiedzią konsumencką, a jego własny README podaje 5 sekund 720P w poniżej 9 minut na 4090.
Poniżej 24 GB jesteś na terytorium społeczności. WanGP (projekt deepbeepmeep/Wan2GP, który opisuje się jako modele generatywne „dostępne dla Ubogich w GPU”) doprowadza wybrane modele do 6 GB przy użyciu kwantyzacji int8, fp8, gguf, NVFP4 i Nunchaku. Obsługuje Wan 2.1 i 2.2. Nie obsługuje 3.0, bo nie ma czego obsługiwać.
Teraz część, która powinna zmienić twoją decyzję zakupową: założenie, że „następna wersja będzie otwarta”, zawiodło trzy razy z rzędu. Wan 2.2 był Apache-2.0. Wan 2.5 przeszedł na tylko API. Wan 2.6 i 2.7 nigdy nie wydały wag. Wan 3.0 nie ma w ogóle pliku licencji.
Kupowanie karty dzisiaj z założeniem, że wagi 3.0 pojawią się jutro, to obstawianie przeciwko trzygeneracyjnemu trendowi.
Aby uzyskać bieżące uruchomienie hostowane, otwórz Wan 3.0 na Atlas Cloud i przetestuj prompt podobny do poniższego, zanim opublikujesz workflow.

Zrzut ekranu prompt-do-wyniku Wan 3.0: ścieżka renderowania bez GPU.
Pomiń wymagania VRAM: Workflow Wan bez GPU
Pozwól, że będę szczery co do granicy na początku, ponieważ większość stron w tej niszy tego nie zrobi.
Nikt nie hostuje Wan 3.0. Nie Atlas Cloud, nikt inny. Nie ma wag, więc nie ma inferencji stron trzecich. Jeśli strona oferuje ci „dostęp do API Wan 3.0”, sprzedaje ci coś innego.
To, co możesz dostać teraz, to reszta rodziny, hostowana, rozliczana za sekundę, bez VRAM w równaniu. Atlas Cloud uruchamia Wan 2.2 do 2.7 za jednym API i jedną kartą przeglądarki, a Wan 2.7 w 1080P jest najbliższym odpowiednikiem wyjścia klasy 3.0 dostępnym poza własnymi kanałami beta Alibaba.
Dla czytelnika, dla którego napisano ten artykuł, rozwiązuje to konkretny problem. Miałeś wydać cztery cyfry na kartę, żeby gonić punkt kontrolny, który nie istnieje. Wynajmowanie sekund oznacza, że dowiesz się, jak wyjście faktycznie wygląda, zanim cokolwiek kupisz, a jeśli wagi 3.0 nigdy nie zostaną wydane, stracisz tylko kilka dolarów.
Tabela 5: hostowana rodzina Wan (ceny katalogowe na sierpień 2026)
| Identyfikator modelu | Rozdzielczość | Maksymalny czas trwania | Cena | Najlepsze do |
|---|---|---|---|---|
| atlascloud/wan-2.2-turbo/image-to-video | 480p / 720p / 1080p, 30fps | tylko 5s | 0,02 $ / s | najtańszy rzut oka w rodzinie |
| atlascloud/wan-2.2/image-to-video | 480P natywny + 720P VSR | 3-10s | 0,03 $ / s | partie budżetowe |
| alibaba/wan-2.5/text-to-video | do 1920x1080 | 10s | 0,035 $ / s | tanie tekst-na-wideo 1080P |
| alibaba/wan-2.6/text-to-video | do 1920x1080 | 5 / 10 / 15s | 0,07 $ / s | dłuższe ujęcia, bez potrzeby pierwszej klatki |
| alibaba/wan-2.7/image-to-video | 720P / 1080P, plus 1080P-SR i 1440P-SR | 15s | 0,10 $ / s katalog | najbliższy poziom wyjścia klasy 3.0 |
| alibaba/wan-2.2/animate-mix | zamiana postaci w istniejącym materiale | dopasowuje długość źródła | 0,126 $ / s | zamiana postaci w ujęciu |
Jedno ostrzeżenie przed samouczkiem, ponieważ pojawi się na twojej fakturze: cena katalogowa to podłoga. Strona Wan 2.7 podaje 0,10 $ za sekundę. W naszych testach z sierpnia 2026 to samo pięciosekundowe zadanie kosztowało 0,50 $ na poziomie 720P i 0,75 $ na 1080P, więc flagowy poziom rozlicza się po 0,15 $ za sekundę, czyli półtora raza więcej niż podana stawka. Zawsze czytaj kwotę, którą podaje przycisk, zanim go klikniesz.
Tabela 6: cztery drogi do 30 sekund 1080P
| Droga | Koszt początkowy | Za 30s 1080P | Czy faktycznie to dostajesz? |
|---|---|---|---|
| Kup kartę 24 GB (klasa 4090) | ~1 600-2 000 $ | prąd | Nie. 24 GB uruchamia Wan2.2 TI2V-5B w 720P. Nie istnieją żadne wagi 3.0. |
| Wynajmij kartę 80 GB | godzinowo | godziny obliczeń + konfiguracja | Tylko Wan 2.2 A14B, i wciąż nie 1080P/30s |
| Beta Alibaba pierwszej strony | brak | ¥1,2/s x 30 = ¥36 (~5 $) | Tak, jeden ciągły klip, tylko kanały pierwszej strony |
| Hostowany Wan 2.7 w 1080P | brak | 2 x 15s po ~0,15 $/s = ~4,50 $ | 30s materiału, ale jako dwa klipy (limit 15s) |
Wykonaj dzielenie. Przy około 4,50 $ za 30 sekund 1080P, karta za 2 000 $ potrzebuje około 440 trzydziestosekundowych renderów, żeby się zwrócić, i wciąż nie może wyprodukować ani jednego z nich.
To jest argument. A oto trzyetapowy przebieg, abyś mógł sam ocenić wynik.
Krok 1: Zablokuj pierwszą klatkę w proporcji 16:9
Każde uczciwe porównanie VRAM potrzebuje jednej zmiennej. Więc ustalamy pierwszą klatkę, a następnie podajemy identyczną klatkę i identyczny prompt ruchu do obu poziomów. Każda różnica, którą zobaczysz później, wynika z poziomu, a nie z przypadku.
Otwórz playground Qwen Image 2.0 Pro text-to-image i wklej to:
text1Szeroki kadr kinowy w przyciemnionym domowym biurze o 2 w nocy: młody inżynier w szarej bluzie z kapturem odchyla się na krześle, twarz oświetlona tylko przez trzy monitory z zatrzymaną osią czasu wideo. Obok biurka świeci otwarta obudowa PC, widoczna pojedyncza ogromna karta graficzna, wentylatory się kręcą. Drobinki kurzu w powietrzu, kolorystyka w odcieniach morskiej zieleni i bursztynu, mała głębia ostrości, obiektyw anamorficzny 35 mm, fotorealistyczny, bardzo szczegółowy, 16:9 2
Ustawienia: kliknij chip rozmiaru 16:9, który ustawia klatkę na 1280 x 720, a wszystko inne pozostaw domyślne. Koszt to 0,06 $ za obraz (obecnie 20% zniżki od 0,075 $). Pola szerokości i wysokości mogą pójść do 2048 na stronę, jeśli chcesz większą klatkę, ale domyślny chip ma już odpowiedni kształt dla obu poziomów wideo.
Dlaczego ta scena? Ponieważ dosłownie przedstawia czytelnika. Zachowaj plik wyjściowy, będziesz go potrzebować dwa razy.

Playground Qwen Image 2.0 Pro na Atlas Cloud z wybranym chipem rozmiaru 16:9 i gotową pierwszą klatką 1280x720 w panelu wyjściowym
Krok 1 zakończony: chip 16:9 wybrany przy 1280 x 720 i pierwsza klatka, od której zaczną oba poziomy wideo. 0,06 $ na przycisku Uruchom.
Krok 2: Animuj to na poziomie VRAM 720P
To jest reprezentacja tego, co daje prawdziwy lokalny zestaw 24 GB: 720P, pięć sekund i to jest limit.
Jeden celowy wybór tutaj. Zamiast przełączać modele między dwoma poziomami, uruchamiamy ten sam model na obu, więc jedyną zmienną w porównaniu jest poziom rozdzielczości. Załaduj obraz z Kroku 1 jako pierwszą klatkę w playgroundzie Wan 2.7 image-to-video, a następnie wklej ten prompt ruchu:
text1Inżynier powoli pochyla się do przodu i przeciera oczy; poświata monitora migocze, gdy oś czasu się przewija; kamera nieznacznie najeżdża; drobinki kurzu dryfują przez snop światła; subtelny mikrodrżenie ręczne; pojedyncze ciągłe ujęcie, bez cięć. 2
Ustawienia: rozdzielczość 720P, czas trwania 5s, wszystko inne domyślne. Przycisk Uruchom podał kwotę 0,50 $, czyli stawka katalogowa 0,10 $ za sekundę razy pięć sekund. Zapisz tę liczbę, ponieważ Krok 3 ją zmieni.

Playground Wan 2.7 image-to-video na poziomie 720P z załadowaną pierwszą klatką, czasem trwania 5s i gotowym klipem w panelu wyjściowym
Krok 2 zakończony: poziom 720P, 5 sekund, wyceniony na 0,50 $, z prawdziwym klipem w panelu wyjściowym.
Krok 3: Animuj tę samą klatkę w 1080P bez lokalnego GPU
Ta sama strona, ta sama pierwsza klatka, ten sam prompt ruchu słowo w słowo, ten sam 5-sekundowy czas trwania. Zmień dokładnie jeden element: ustaw rozdzielczość na 1080P.
Kwota z przycisku Uruchom zmienia się z 0,50 $ na 0,75 $. To jest twoje 0,15 $ za sekundę, zmierzone, na stronie, której cena katalogowa mówi 0,10 $.
Dwie pułapki ustawień, na które należy uważać, obie kosztowały nas prawdziwych przebiegów, żeby się ich nauczyć:
- Kontrola czasu trwania nie zawsze się zatwierdza. Ustawiliśmy czas trwania na 10 sekund, pole pokazywało 10, a zadanie i tak wyrenderowało 5. Kwota z przycisku Uruchom jest jedynym źródłem prawdy: przy 0,15 $ za sekundę prawdziwe zadanie 10s 1080P musi odczytać około 1,50 $, więc kwota 0,75 $ oznacza, że wciąż kupujesz 5 sekund, niezależnie od tego, co pokazuje suwak. Czytaj kwotę, a nie pole.
- Potwierdź, że twój obraz jest załadowany. Jeśli miejsce na obraz referencyjny wciąż zawiera domyślny obraz demonstracyjny strony, przebieg chętnie wyprodukuje coś niezwiązanego. Spójrz na miniaturkę zanim klikniesz.

Playground Wan 2.7 image-to-video na poziomie 1080P z przyciskiem Uruchom podającym kwotę 0,75 $ i gotowym klipem 1080P w panelu wyjściowym
Krok 3 zakończony na poziomie 1080P. Kwota z przycisku Uruchom jest kluczowa: 0,75 $ za te same pięć sekund, które kosztowały 0,50 $ jeden poziom niżej, na stronie, która podaje 0,10 $ za sekundę.
Oba rendery znajdują się w klipie na górze tego artykułu, obok siebie. To cały argument dotyczący VRAM w pięciu sekundach: dwa poziomy wyjścia, ten sam prompt, ani jeden gigabajt lokalnej pamięci wideo nie był zaangażowany.
Warianty warte wypróbowania. Zejdź do 480P, aby tanio zobaczyć efekt przed przejściem do renderu 1080P. Zamień na alibaba/wan-2.6/text-to-video za 0,07 $/s, gdy nie masz pierwszej klatki i chcesz 15 sekund w jednym ciągu. Użyj alibaba/wan-2.2/animate-mix za 0,126 $/s, aby umieścić inną postać w materiale, który już masz. A jeśli chcesz zbliżyć się do 30 sekund, zaplanuj dwa klipy, z powodu limitu 15 sekund na klip, o którym prawie żaden samouczek nie wspomina.
Często zadawane pytania
Czy GPU 24 GB może uruchomić Wan 3.0?
Nie dzisiaj, ponieważ nie ma wag do załadowania. Jeśli kiedykolwiek zostaną wydane, matematyka z Tabeli 2 mówi, że 24 GB zapewni 480P i krótkie klipy przy agresywnej kwantyzacji. Flagowe ustawienie 1080P/30s to inny rząd wielkości i nie jest osiągalne na pojedynczej karcie konsumenckiej.
Gdzie mogę pobrać wagi Wan 3.0?
Nigdzie. Organizacja Wan-AI na Hugging Face kończy się na Wan2.2, a organizacja Wan-Video na GitHubie nie ma repozytorium inferencyjnego 3.0 ani licencji 3.0. Każda strona oferująca „pobieranie punktu kontrolnego Wan 3.0” nie dystrybuuje tego, co twierdzi.
Czy Wan 3.0 jest open source lub Apache 2.0?
Nie opublikowano żadnej licencji. Trend zmierza w przeciwnym kierunku: Wan 2.2 był Apache-2.0, Wan 2.5 przeszedł na tylko API, a 2.6 i 2.7 nie wydały żadnych wag. Trzy kolejne generacje zamknięte. Planuj odpowiednio.
Jaki jest model Wan o najniższym VRAM, który faktycznie mogę dziś uruchomić?
Wan2.2 TI2V-5B, oficjalnie 24 GB na 4090, robiący 5s 720P w poniżej 9 minut. Poniżej tego, ścieżki kwantyzacji WanGP sięgają do 6 GB na wybranych modelach, płacisz za to szybkością i szczegółowością.
Wan 3.0 vs Wan 2.7: który mogę uruchomić lokalnie?
Żaden. Oba są tylko API. Jeśli wymaganie to „działa na moim komputerze”, twoje opcje to rodziny Wan 2.1 i 2.2. Jeśli wymaganie to wyjście klasy 2.7, to jest to wywołanie hostowane, a nie lokalna instalacja.
Jeśli nie mogę uruchomić go lokalnie, jak uzyskać 30 sekund 1080P teraz?
Beta Alibaba pierwszej strony rozlicza za sekundę i dostarcza 30s w jednym klipie. Poza tymi kanałami obowiązuje twardy limit 15 sekund na klip, więc 30 sekund oznacza łączenie dwóch. W naszych własnych testach kontynuacji Wan 2.7 ograniczenia były ścisłe: segment źródłowy musiał mieć od 2 do 10 sekund, wynik musiał być ściśle dłuższy niż źródło, klatki źródłowe nie były zachowywane, a łączenie kontynuacji nie kumulowało długości. Większość samouczków nigdy o tym nie wspomina.
Więc krótka wersja całego pytania o wymagania VRAM Wan 3.0: przestań szukać karty, ponieważ punkt kontrolny, dla którego byś ją kupił, nie istnieje. Uruchom Wan 2.2 lokalnie, jeśli chcesz wagi na dysku, i wynajmij sekundy 1080P, gdy potrzebujesz wyjścia, które sprzedawały fałszywe tabele.






