Seedance 2.5 już dostępne — Jako pierwsze na Atlas Cloud

Wan 3.0 Multi-Shot Consistency: Policzyłem każde cięcie w 110 oficjalnych klipach

Wan 3.0 Multi-Shot Consistency: Policzyłem wszystkie 110 klipów

Spójność wieloujęciowa Wan 3.0: policzyłem każde cięcie w 110 oficjalnych klipach

Napisałeś skrypt na cztery ujęcia. Ujęcie 1 ląduje idealnie: słomkowy kapelusz, czarny koralikowy naszyjnik, biała lniana sukienka, światło idealne. Pojawia się ujęcie 2 – i to inna kobieta w innym kapeluszu.

Ta luka to cały powód, dla którego ludzie wpatrują się w spójność wieloujęciową Wan 3.0 – obietnicę jednego promptu, sześciu ujęć, trzydziestu sekund, tej samej postaci przez całość.

Więc przestałem czytać arkusze specyfikacji. Pobrałem wszystkie 110 plików demo, które Alibaba opublikowało wraz z własnym podręcznikiem twórcy Wan 3.0, uruchomiłem ffmpeg na każdym, przeanalizowałem wszystkie 64 sparowane prompty, a następnie zrobiłem to, czego nikt w wynikach wyszukiwania nie zrobił: policzyłem rzeczywiste cięcia w dostarczonych filmach i porównałem je z liczbą ujęć, o którą prosił każdy prompt.

Trzy ustalenia przeczą temu, co przeczytasz wszędzie indziej.

Studio korekcji kolorów, w którym ściana monitorów pokazuje tę samą postać w słomkowym kapeluszu utrzymaną w sześciu różnych ujęciach – punkt odniesienia dla spójności wieloujęciowej Wan 3.0

Ściana referencyjna kolorysty to uczciwy model myślowy dla spójności wieloujęciowej: jedna tożsamość, sześć kadrów, sprawdzane obok siebie. Wygenerowano za pomocą openai/gpt-image-2.

Najważniejsze wnioski

  • 6 ujęć jest realne, ale nie gwarantowane: 3 z własnych wieloujęciowych promptów Alibaby osiągnęły zadeklarowaną liczbę dokładnie, 2 dostarczyły mniej.
  • Najgorszy przypadek: prompt na 4 ujęcia wyrenderował 2.
  • Brak 4K. Żaden ze 110 oficjalnych plików nie przekracza 1080p, a tylko 4 mają dokładnie 1920x1080.
  • Rekwizyty i kamera dryfują wcześniej niż twarze. Obserwuj kapelusz, nie oczy.
  • Brak publicznego API Wan 3.0 poza własną platformą Alibaby, więc poniższy samouczek odtwarza to na modelach, które możesz wywołać już dziś.

Oto najlepszy przypadek, z własnego podręcznika Alibaby. Sześć ujęć zadeklarowanych w prompcie, sześć ujęć dostarczonych, te same dwie postacie, ta sama garderoba, ten sam deszcz:

Sześcioujęciowa sekwencja anime na deszczowej peronie kolejowym, ta sama dziewczyna z przezroczystym parasolem i chłopak z khaki plecakiem utrzymani spójnie przez każde cięcie

Oficjalne demo Wan 3.0 Alibaby (klip z podręcznika v013, 1280x720, 20,05 s). Prompt numerował ujęcia od 1 do 6; ffmpeg znajduje dokładnie 5 twardych cięć, więc wszystkie 6 ujęć trafiło. Nie wygenerowane przez Atlas Cloud.

Czym właściwie jest spójność wieloujęciowa Wan 3.0

Krótka wersja: to trzy oddzielne obietnice pod jedną nazwą, a Alibaba jest niezwykle precyzyjne, które to trzy.

W swoim ogłoszeniu Alibaba dzieli spójność na postacie ("rysy twarzy, fryzura i kolor włosów, sylwetka, ubiór i akcesoria"), rekwizyty ("wielokątowe pojawianie się, struktura sprzętu, logo i szczegóły materiału") oraz przestrzeń ("blokowanie postaci i perspektywa kamery") (Alibaba Cloud, 2026). Ten trójwarstwowy podział to arkusz oceny dla wszystkiego poniżej. Ta sama twarz, zły naszyjnik – to porażka.

Model generuje do 30 sekund w jednym zadaniu, w rozdzielczości 480P, 720P lub 1080P (Alibaba Cloud, 2026).

Teraz część, którą wyniki wyszukiwania podają błędnie.

Powszechne twierdzenie w wynikach wyszukiwaniaCo faktycznie pokazują materiały pierwszej strony
„Natywna generacja 4K"Oficjalny post wymienia tylko 480P / 720P / 1080P. Wśród 110 oficjalnych plików demo nic nie przekracza 1080p, a tylko 4 pliki mają dokładnie 1920x1080. Typowy „1080p" krajobraz to 1920x1072.
„Do 6 niezależnych ujęć na generację"Żadna specyfikacja liczby ujęć nie pojawia się w oficjalnym ogłoszeniu Alibaby. Empirycznie się sprawdza: z 8 wyraźnie wieloujęciowych promptów w podręczniku najwyższa deklarowana to 6, a dwa z nich dostarczyły 6.
„Do 12 obrazów referencyjnych"Testy praktyczne raportują do 10 obrazów plus 5 klipów wideo plus 5 klipów audio (Curious Refuge, 2026). Alibaba nie podaje żadnej liczby.
„Otwarte wagi, Apache-2.0"Wcześniejsze wydania Wan miały otwarte wagi; Wan 3.0 jest dostarczany jako usługa platformy i nie pojawiły się żadne wagi (Curious Refuge, 2026).
„API jest dostępne"Działa na Alibaba Cloud Model Studio. Platformy inferencyjne innych firm jeszcze go nie mają.

A to jest tabela, której budowa zajęła najwięcej czasu. Każda liczba jest moja, z detekcji scen ffmpeg na dostarczonym pliku w porównaniu z liczbą ujęć zapisaną w sparowanym prompcie:

Oficjalne demoPrompt deklarujeZnalezione twarde cięciaDostarczone ujęciaWerdykt
v013 deszczowa platforma, anime6 ujęć56Dokładnie
v055 pamiętnik golden retrievera6 ujęć, 30,0 s56Dokładnie
v021 ramenownia i kotek4 ujęcia34Dokładnie
v008 leśne jezioro, 3D4 ujęcia23Jedno mniej
v085 kobieta w słomkowym kapeluszu4 ujęcia12Połowa
v041 korytarz do magicznej alejki3 segmenty, „bez twardego cięcia"01 ciągłe ujęcieDokładnie zgodnie z prośbą
v045, v084, v1023 / 5 / wiele tematówZbyt wiele do rozstrzygnięciaNiepoliczalneSzybkie cięcia i migotanie atramentem uniemożliwiają detekcję

Przeczytaj środkowe wiersze jeszcze raz. Trzy prompty trafiły idealnie w liczbę. Dwa nie. Liczba ujęć, którą wpisujesz, to prośba, nie umowa.

Dlaczego spójność wieloujęciowa Wan 3.0 się załamuje: 4 tryby awarii

Werdykt najpierw: rzadko załamuje się na twarzy. Załamuje się na obiektach i kamerze, a najsilniej, gdy zmieniasz kilka rzeczy naraz.

Oto klip, który nauczył mnie najwięcej, bo jest najgorszym wykonawcą we własnej prezentacji Alibaby.

GtZy2TUK4ak

Oficjalne demo Wan 3.0 Alibaby (klip z podręcznika v085, 1240x742, 30,08 s). Prompt skryptuje cztery ujęcia z czasem. ffmpeg znajduje jedno prawdziwe cięcie, przy 9,3 s. Ujęcia 3 i 4 zapadają się w jedno utrzymane ujęcie, które zanika do czerni. Nie wygenerowane przez Atlas Cloud.

Tryb awarii 1: rekwizyty dryfują wcześniej niż twarze. W tym klipie spójrz tylko na początkowe ujęcie, zanim nastąpi jakiekolwiek cięcie. Przy 0,6 s kapelusz typu boater ma cienką czarną opaskę, a wisiorek to fasetowany granatowy kamień. Przy 9,2 s opaska jest szeroką czarną wstążką, a wisiorek to gładki, błyszczący, czarny kropla. Jej twarz jest stabilna przez cały czas. Akcesoria nie.

Dwie klatki z tego samego ciągłego, dziewięciosekundowego ujęcia, obok siebie, pokazujące poszerzenie opaski kapelusza oraz zmianę kształtu i koloru wisiorka naszyjnika

Obie klatki pochodzą z tego samego nieprzerwanego ujęcia oficjalnego demo v085, 8,6 sekundy różnicy, bez cięcia między nimi. Opaska kapelusza i wisiorek oba się zmieniają. To warstwa rekwizytów zawodząca, podczas gdy warstwa postaci się utrzymuje.

Dlatego test akceptacyjny, który faktycznie działa, to lista kontrolna rekwizytów, a nie ocena ogólnego wrażenia. Dla tej postaci są to trzy elementy: kształt kapelusza i opaska, koralikowy naszyjnik z wisiorkiem, dekolt sukienki.

Tryb awarii 2: sceny z wieloma podmiotami utrzymują się indywidualnie i rozmazują się przy kontakcie. Każda postać pozostaje rozpoznawalna osobno. Umieść je razem w kadrze, w interakcji, a tożsamości się zlewają. Niezależne testy wykazały to samo: „Spójność postaci zaczęła się załamywać, a komponowanie czasami wyglądało bardziej jak zły efekt zielonego ekranu niż naturalnie wygenerowane środowisko", przy czym synchronizacja ust została uznana za największą słabość (Curious Refuge, 2026).

Tryb awarii 3: zmieniłeś cztery zmienne w jednej linijce. Nowa lokalizacja plus nowy kąt kamery plus nowe oświetlenie plus nowy stan garderoby to niezawodny sposób na utratę tożsamości. Własne prompty podręcznika walczą z tym, powtarzając cały kostium w każdym segmencie. Wśród 64 sparowanych promptów 9 wyraźnie mówi „pozostaje niezmieniony", 5 ustala pozycję kamery, a 4 wymagają, aby postać pozostała identyczna.

Tryb awarii 4: 30 sekund w jednym zadaniu to nie 30 sekund jednego ujęcia. To różne produkty. 30-sekundowe zadanie wieloujęciowe tnie między kadrami. Jeśli chcesz jedno ciągłe, nieprzerwane ujęcie, łączenie kontynuacji pogarsza się: błąd tożsamości kumuluje się przy każdym przekazaniu, więc czyste pojedyncze ujęcie jest z natury krótkie.

Podręcznik ma dokładnie jeden prompt, który osiąga bezszwowość, i warto skopiować strukturę zdania:

Trzy segmenty promptu wyrenderowane jako jedno nieprzerwane, ciągłe ujęcie, z korytarza w mieszkaniu przez drzwi do oświetlonej lampami gotyckiej alejki

Oficjalne demo Wan 3.0 Alibaby (klip z podręcznika v041, 720x1280, 15,04 s). Trzy segmenty promptu, a ffmpeg znajduje zero twardych cięć, co jest dokładnie tym, czego żądał prompt. Nie wygenerowane przez Atlas Cloud.

Jego linia przekazania, przetłumaczona, jest najbardziej wielokrotnego użytku rzeczą w całym podręczniku: kontynuuj bezszwowo od ostatniej klatki poprzedniego segmentu; postać, garderoba, lokalizacja i pozycja kamery pozostają całkowicie identyczne; bez twardego cięcia i bez nagłej zmiany sceny. Tylko jeden prompt na 64 go używa. Ukradnij go.

Przepływ pracy dla spójności wieloujęciowej, który możesz uruchomić już dziś

Pytanie brzmi: gdzie właściwie to uruchomisz?

Obecnie Wan 3.0 żyje na własnym Model Studio Alibaby. Żadna platforma inferencyjna innej firmy go nie hostuje. Na Atlas Cloud pojawia się tylko jako wpis „wkrótce" z zerem aktywnych punktów końcowych, co jest uczciwym stanem rzeczy i warto to powiedzieć wprost, zamiast udawać inaczej.

Masz więc dwie opcje: czekać albo przestać prosić jeden prompt o zrobienie sześciu rzeczy.

Druga opcja i tak jest lepsza, a moje liczenie cięć jest argumentem za nią. Pojedyncze zadanie wieloujęciowe dało liczbę ujęć, która chybiła o połowę we własnej prezentacji Alibaby. Podzielenie zadania przywraca tę kontrolę w twoje ręce:

  1. Zamknij wygląd raz, jako nieruchomy obraz.
  2. Sklonuj tę tożsamość w klatkę kluczową dla każdego ujęcia, zmieniając za każdym razem dokładnie jedną zmienną.
  3. Animuj każde ujęcie osobno z zablokowanym odnośnikiem.
  4. Sklej lokalnie.

Wolniejsze w konfiguracji, dramatycznie bardziej przewidywalne. I każdy model w łańcuchu jest wywoływalny już dziś.

KrokModelRola w łańcuchuPodana cena
1bytedance/seedream-v5.0-pro/text-to-imageZamknij wygląd postaci$0,045 / obraz
2google/nano-banana-2/editSklonuj tożsamość w klatkę kluczową każdego ujęcia$0,08 / obraz
3alibaba/wan-2.7/reference-to-videoAnimuj każde ujęcie z zablokowanym odnośnikiem$0,10 / sekunda
Altalibaba/wan-2.7/text-to-videoJeden prompt, wiele ujęć (najmniej kontrolowalne)$0,10 / sekunda
Fixalibaba/wan-2.7/video-editNapraw jeden zły rekwizyt bez ponownego generowania$0,10 / sekunda

Warto wiedzieć dla pytania „najlepszy model dla spójności wieloujęciowej": reference-to-video to już cała kategoria. bytedance/seedance-2.0-fast/reference-to-video kosztuje $0,072/s (20% zniżki od $0,09, stan na sierpień 2026), kwaivgi/kling-video-o3-pro/reference-to-video $0,095/s (15% zniżki od $0,112), minimax/h3/reference-to-video $0,10/s, a google/veo3.1/reference-to-video $0,20/s. Wszystkie ceny zweryfikowane względem aktywnego katalogu 21 sierpnia 2026.

Jedno ostrzeżenie przed krokami: podane ceny to podłoga, nie wycena. Rozdzielczość i czas trwania zmieniają rzeczywistą liczbę, więc przeczytaj przycisk Uruchom, zanim zatwierdzisz.

Jak zbudować spójność wieloujęciową w stylu Wan 3.0, krok po kroku

Odtwarzamy dokładny scenariusz, który własny model Alibaby spartaczył: kobieta w słomkowym kapeluszu, cztery ujęcia, ogród do samochodu. Ten sam skrypt, kontrola na ujęcie, i tym razem dostajesz cztery ujęcia, bo wyrenderowałeś cztery.

Zaczynajmy.

Krok 1: zamknij wygląd. Jeden obraz staje się kotwicą tożsamości dla wszystkiego dalej. Wygeneruj go na Seedream v5.0 Pro, 16:9, najwyższa rozdzielczość, jaką oferuje strona. Nazwij trzy punkty kontrolne rekwizytów wyraźnie, bo to one dryfują.

plaintext
135mm film still, vintage sunlit rose garden. An elegant young woman wearing a
2natural straw boater hat with a black band, a black beaded necklace with a single
3teardrop pendant, and a white sleeveless linen dress. She stands before a wall of
4blooming pink and cream roses, one hand lightly touching the brim of her hat,
5gentle and thoughtful gaze just off camera. Soft warm natural light, dappled sun
6flare, shallow depth of field, fine film grain, medium close-up.

Środowisko testowe Seedream v5.0 Pro na Atlas Cloud z wprowadzonym promptem o słomkowym kapeluszu i wyrenderowaną klatką kluczową postaci w panelu wyjściowym

Krok 1 zakończony: kotwica tożsamości dla całej czteroujęciowej sekwencji.

Krok 2: sklonuj tożsamość w ujęcia 2–4. Jedna klatka kluczowa na ujęcie, jedno uruchomienie na każde, używając Nano Banana 2 Edit z wynikiem kroku 1 jako odnośnikiem. Zasada, która ma znaczenie: powtarzaj całą garderobę za każdym razem, a następnie zmień dokładnie jedną rzecz.

Ujęcie 2, zwrot emocjonalny:

plaintext
1Keep the exact same woman from the reference image: identical face, identical
2natural straw boater hat with black band, identical black beaded necklace with a
3teardrop pendant, identical white sleeveless linen dress. New shot: cinematic
4close-up, she slowly lifts the straw hat off her head and lowers her chin, a faint
5wistful expression. Same rose garden background. Strictly preserve the same
6lighting, skin tone, film grain and colour grade as the reference.

Ujęcie 3, cięcie do samochodu:

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant, identical white sleeveless linen dress,
3the straw boater hat now resting on her lap. New shot: back seat of a moving car,
4side profile, her hand propped against the door, gazing out a rain-beaded window,
5blurred green foliage rushing past. Overcast light with a warm interior fill,
6shallow depth of field, elegant melancholy. Strictly preserve the same face, the
7same colour grade and the same 35mm film grain as the reference.

Ujęcie 4, ostatnie spojrzenie:

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant. New shot: extreme facial close-up beside
3the car window, eyes slowly closing, a calm and released expression. Raindrops
4slide down the glass in front of her, focus shifting onto the droplets, background
5falling into bokeh. Wong Kar-wai style cinematic mood, fine film grain. Strictly
6preserve the same face, the same lighting and the same colour grade as the
7reference.

Środowisko testowe Nano Banana 2 Edit na Atlas Cloud z załadowaną klatką kluczową z kroku 1 jako odnośnikiem i wyrenderowaną klatką kluczową ujęcia 2, tożsamość i garderoba utrzymane

Krok 2 zakończony: klatka kluczowa ujęcia 2, ta sama kobieta, kapelusz teraz w jej dłoniach.

Krok 3: animuj ujęcie 1 z zablokowanym odnośnikiem. Teraz każde ujęcie staje się wideo niezależnie na Wan 2.7 reference-to-video. Ustawienia: 720P, 5 sekund, i wrzuć klatkę kluczową z kroku 1 w slot Images. Sprawdź wycenę przycisku Uruchom, zanim go odpalisz.

plaintext
1Shot 1 of 4. Reference image 1 defines the character: keep the same face, the same
2natural straw boater hat with black band, the same black beaded necklace with a
3teardrop pendant and the same white sleeveless linen dress identical for the entire
4clip. 35mm film look, vintage sunlit rose garden. The woman lightly touches the
5brim of her hat as a soft breeze lifts strands of her hair; the camera pushes in
6very slowly. Warm natural light, dappled sun flare, shallow depth of field, fine
7film grain. The camera position stays stable. No hard cut and no scene change.

Środowisko testowe Wan 2.7 reference-to-video na Atlas Cloud z klatką kluczową w slocie Images i odtwarzanym gotowym pięciosekundowym klipem w panelu wyjściowym

Krok 3 zakończony: klip z zablokowanym odnośnikiem wyrenderowany w panelu wyjściowym.

A oto, co wyszło:

Pięciosekundowy klip z zablokowanym odnośnikiem przedstawiający kobietę w słomkowym kapeluszu w ogrodzie różanym, opaska kapelusza i naszyjnik utrzymane stabilnie przez całość

Nasze własne uruchomienie na Atlas Cloud, nie demo Alibaby. Pokazane jako cichy GIF; dostarczony plik zawiera ścieżkę audio.

Krok 4: łańcuchuj ujęcia 2–4, a następnie sklej. Powtórz krok 3 dla każdej pozostałej klatki kluczowej i wklej zdanie przekazania z podręcznika na górze każdego kolejnego promptu:

plaintext
1Continue seamlessly from the last frame of the previous segment. The character,
2the wardrobe, the location and the camera position stay completely identical.
3No hard cut and no abrupt scene transition.

Następnie połącz lokalnie za pomocą ffmpeg i przeprowadź trzyetapową kontrolę akceptacyjną: kształt kapelusza i opaska, koralikowy naszyjnik z wisiorkiem oraz czy progresja kadrowania między ujęciami ma sens. Jeśli dokładnie jeden rekwizyt jest zły w jednym ujęciu, nie regeneruj ujęcia. Wyślij je przez wan-2.7/video-edit i zmień tylko to, zapożyczając sformułowanie z podręcznika: zachowaj działania, garderobę i resztę kadru niezmienioną.

Warianty: sceny z wieloma podmiotami i blokady stylu

Trzy wzorce z podręcznika warte skopiowania.

Karty postaci dla ujęć z wieloma podmiotami. Gdy dwie lub więcej osób dzieli kadr, oficjalne prompty przypisują literowane karty postaci i ponownie deklarują pełny kostium każdej w każdym segmencie. Rozwlekłe, brzydkie i działa lepiej niż zaimki.

Globalna deklaracja stylu dla stylizowanych prac. Tusz, animacja cel i inne mocne style wymagają przypięcia stylu raz na całość, a następnie umieszczenia pod nim scenariusza z czasem.

Sekwencja sztuk walki w stylu tuszowym z szermierzem w bambusowym gaju, styl zablokowany w pięciobitowej walce z czasem

Oficjalne demo Wan 3.0 Alibaby (klip z podręcznika v084, 20,05 s, przycięty). Pięć bitów z czasem pod jedną globalną deklaracją stylu tuszowego. Migoczące pociągnięcia pędzla są powodem, dla którego automatyczna detekcja cięć nie może policzyć tego klipu. Nie wygenerowane przez Atlas Cloud.

Naprawiaj, nie regeneruj. Przejście video-edit na jednym złym rekwizycie jest tańsze niż świeży render i nie może zepsuć ujęć, które już były poprawne.

Ile kosztuje czteroujęciowa sekwencja

Konkretne liczby dla sekwencji zbudowanej powyżej, według podanych stawek:

  • 1 kotwica tożsamości na Seedream v5.0 Pro: $0,045
  • 3 klatki kluczowe ujęć na Nano Banana 2 Edit: 3 x $0,08 = $0,24
  • 4 klipy po 5 s, 720P, na Wan 2.7 reference-to-video: 20 s x $0,10 = $2,00
  • Razem: około $2,29 za 20-sekundową, czteroujęciową, spójną tożsamiowo sekwencję

Rozciągnij to do sześcioujęciowego, 30-sekundowego utworu, a linia wideo staje się $3,00, co daje około $3,44 za wszystko.

Dwa uczciwe zastrzeżenia. Po pierwsze, podane ceny to podłoga: poziomy rozdzielczości i czas trwania zmieniają rzeczywistą opłatę, a wycena z przycisku Uruchom w środowisku testowym jest jedyną wiążącą liczbą, dlatego zrzuty ekranu powyżej mają większe znaczenie niż ta lista. Po drugie, w przypadku samego Wan 3.0, Alibaba wycenia generację wideo w Model Studio na sekundę według poziomu rozdzielczości, ale nie mogłem potwierdzić dokładnych stawek za sekundę dla Wan 3.0 z pierwszej strony, więc nie podaję liczb, których nie mogłem zweryfikować.

Warto zauważyć, co kupujesz dzięki podejściu z podziałem zadań: nie niższą cenę, ale liczbę ujęć zgodną z twoim skryptem. Na podstawie dowodów z własnej prezentacji Alibaby, nie jest to coś, co pojedyncze 30-sekundowe zadanie może ci jeszcze obiecać, i to jest praktyczna odpowiedź na spójność wieloujęciową Wan 3.0, dopóki API się nie otworzy.

Często zadawane pytania

Ile ujęć może utrzymać spójnie Wan 3.0 w jednej generacji?

Sześć, według obecnych dowodów, z zastrzeżeniem. Ogłoszenie Alibaby nie publikuje żadnej specyfikacji liczby ujęć. Spośród 8 wyraźnie wieloujęciowych promptów w oficjalnym podręczniku, najwyższa deklarowana to 6, a dwa z nich dostarczyły dokładnie 6 ujęć zweryfikowanych cięciami. Traktuj 6 jako zaobserwowany sufit, nie gwarancję.

Czy Wan 3.0 naprawdę generuje natywne 4K?

Nie. Oficjalny post wymienia tylko 480P, 720P i 1080P. Wśród wszystkich 110 oficjalnych plików demo nic nie przekracza 1080p, tylko 4 pliki mają dokładnie 1920x1080, a typowy krajobraz 1080p to 1920x1072. Liczba klatek na sekundę: 24 fps dla 63 plików i 30 fps dla 46.

Czy API Wan 3.0 jest dostępne i gdzie można je uruchomić?

Działa na Alibaba Cloud Model Studio. Żadna platforma inferencyjna innej firmy jeszcze go nie hostuje; Atlas Cloud wymienia je jako wpis „wkrótce" bez aktywnych punktów końcowych. Jeśli potrzebujesz wieloujęciowego wyjścia w tym tygodniu, powyższy łańcuch Wan 2.7 reference-to-video jest działającym substytutem.

Dlaczego moje postacie wciąż zmieniają się między ujęciami, nawet z obrazem referencyjnym?

Zwykle dlatego, że jeden prompt zmienił lokalizację, kąt kamery i oświetlenie jednocześnie. Zmieniaj jedną zmienną na ujęcie i powtarzaj całą garderobę w każdym prompcie. Sprawdzaj też właściwe rzeczy: we własnym demo Alibaby twarz pozostała stabilna, podczas gdy opaska kapelusza i wisiorek naszyjnika zmieniły się w obrębie jednego nieprzerwanego ujęcia.

Czy wagi Wan 3.0 są open source?

Nie wydano żadnych wag. Wcześniejsze wersje Wan były do pobrania i uruchamiania lokalnie, podczas gdy Wan 3.0 jest dostarczany jako hostowana usługa platformy. Każdy, kto cytuje licencję Apache-2.0 dla Wan 3.0, powtarza coś, za czym nie stoi żadne źródło z pierwszej strony.

Jaki jest najszybszy sposób na uzyskanie spójności wieloujęciowej bez dostępu do Wan 3.0?

Cztery ruchy: zamknij jeden obraz tożsamości, sklonuj go w jedną klatkę kluczową na ujęcie, zmieniając za każdym razem pojedynczą zmienną, animuj każde ujęcie za pomocą reference-to-video, a następnie sklej lokalnie i sprawdź swoje rekwizyty. Około $2,29 i około pół godziny na czteroujęciową sekwencję.


Metodologia: wszystkie 110 plików demo i 64 sparowane prompty pochodzą z oficjalnego podręcznika twórcy Wan 3.0 Alibaby, zarchiwizowanego lokalnie 11 sierpnia 2026 r. Metadane odczytano plik po pliku za pomocą ffmpeg; liczba ujęć pochodzi z detekcji zmian sceny ffmpeg przy progu 0,2, sprawdzonej krzyżowo z wyodrębnionymi klatkami; struktura promptów została przeanalizowana programowo. Ceny Atlas Cloud zweryfikowano względem aktywnego katalogu modeli 21 sierpnia 2026 r.

Źródła: Alibaba Cloud (sierpień 2026); Curious Refuge (2026).

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele