Seedance 2.5 już dostępne — Jako pierwsze na Atlas Cloud

Wan 3.0 Multimodal Reference pobiera 20 zasobów, a PDF jest jednym z nich.

Wan 3.0 multimodal reference przyjmuje 20 zasobów w jednym wywołaniu: obrazy, wideo, audio, pliki PDF, a nawet adres URL. Zobacz własne wyniki Alibaba i przepływ pracy, który możesz uruchomić już dziś.

Zbudowałeś folder na jedną 15-sekundową reklamę. Dwa nieruchome kadry postaci. Film w tonacji marki przesłany przez klienta. Książkę marki istniejącą tylko jako PDF. Próbkę głosu aktora, którego naprawdę chcesz.

Potem otworzyłeś model wideo, a on poprosił o jeden obrazek.

Więc zrobiłeś to, co wszyscy. Przetłumaczyłeś folder na 800-słowny prompt i modliłeś się. Twarz dryfowała w ujęciu trzecim. Kurtka zmieniła kolor. Głos należał do kogoś zupełnie innego.

Wan 3.0 z omni-reference to pierwszy raz, gdy model wideo mówi: dobrze, daj mi ten folder. Nawet 20 assetów w jednym wywołaniu, w pięciu rodzajach wejścia, utrzymanych razem w jednym ciągłym 30-sekundowym ujęciu.

Ten artykuł robi trzy rzeczy i pomija resztę. Rozkłada na czynniki pierwsze, czym są te 20 assetów, wykorzystuje własne wygenerowane klipy AliBaby jako dowód i podaje równoważny przepływ pracy, który możesz uruchomić już dziś, ponieważ Wan 3.0 jest nadal w publicznej becie na chmurze AliBaby i nie jest jeszcze wywoływalny z platform zewnętrznych.

Kluczowe wnioski

  • Odniesienie multimodalne Wan 3.0 akceptuje do 20 assetów w jednym wywołaniu, obejmujących obrazy, wideo, audio, dokumenty i strony internetowe, i utrzymuje je spójne w ramach jednego 30-sekundowego ujęcia.
  • Jest to pierwszy mainstreamowy model wideo, który traktuje PDF, slajd lub URL jako kreatywne wejście, a nie coś, co parafrazujesz w prompcie.
  • Wan 3.0 wszedł w publiczną betę 6 sierpnia 2026 roku na Alibaba Cloud Model Studio i Qwen Cloud jako wan3.0-video. Ma zamknięte wagi. Każdy, kto twierdzi, że jest już Apache 2.0, zgaduje.
  • Nagłówek o 20 assetach nie jest miejscem, w którym model faktycznie wyprzedza konkurencję. Modele odniesienia do wideo, które możesz wywołać już teraz, akceptują więcej niż 20 assetów. Różnicą są dokumenty i strony internetowe, a nie liczba.
  • Możesz przetestować format z dwoma postaciami, zablokowanymi odniesieniami i pełnym udźwiękowieniem za darmo, używając darmowego generatora skeczy reklamowych AI Atlas Cloud: cztery zdjęcia produktów na wejściu, 15-sekundowy mówiony skecz na wyjściu, bez karty.

Dwa koty – puszysty i czarny – biegnące korytarzem wspaniałego hotelu

Dwa koty ścigane przez pięć różnych planów przez Wan 3.0 bez dryfu postaci_Dwa obrazy referencyjne. Pięć zupełnie różnych planów, od hotelowego korytarza po bęben pralki i czerwoną budkę telefoniczną. Ani jednej klatki dryfu. Źródło: oficjalny_ podręcznik twórcy Wan 3.0 AliBaby, sierpień 2026, z którego pochodzą wszystkie pozostałe klipy Wan 3.0 w tym artykule.

Dlaczego odniesienie multi-wideo się rozpada i co zmienia odniesienie multimodalne Wan 3.0

Modele wideo nie mają pamięci między klipami. Każda generacja zaczyna od zera. To jest cały problem w jednym zdaniu.

Więc gdy tylko twoja historia potrzebuje więcej niż jednego ujęcia, zaczynasz sklejać. Ujęcie pierwsze daje ci twarz, którą kochasz. Ujęcie drugie daje ci kuzyna tej twarzy. Ujęcie trzecie cicho zmienia kurtkę ze śliwkowej na bordową, a zanim to zauważysz, zapłaciłeś już za jedenaście renderów.

Pojedyncze odniesienie obrazkowe pomogło, ale blokowało tylko jedną rzecz. Twarz. Nie mogło jednocześnie utrzymać twarzy, stroju, rekwizytu, lokalizacji i głosu, ponieważ był jeden slot i pięć zadań.

Są dwa wyjścia. Dać modelowi więcej slotów albo przestać kazać mu zaczynać od nowa. Wan 3.0 robi jedno i drugie naraz i dlatego te dwie główne funkcje są tak naprawdę jedną funkcją. Natywne 30-sekundowe ujęcie oznacza, że nie ma cięcia, przez które postać mogłaby dryfować. Dwadzieścia assetów referencyjnych oznacza, że każdy element, który musi pozostać stały, dostaje własny dedykowany slot, zamiast walczyć o jeden.

Oto jak to wygląda, gdy nic nie jest sklejane. Trzydzieści sekund, jedna ciągła kamera, dziecko w wózku sklepowym, które kończy wbudowane w billboard, a potem wychodzi spod niego.

Pełne 30 sekund w jednym przejściu, bez cięć, z ścieżką dźwiękową wygenerowaną w tym samym przejściu. Źródło: oficjalny podręcznik twórcy Wan 3.0 AliBaby.

Co oznacza „20 assetów” w praktyce w odniesieniu multimodalnym Wan 3.0

Dwadzieścia to numer chwytliwy. Liczy się to, że te dwadzieścia nie jest tym samym rodzajem rzeczy. Omni-reference Wan 3.0 obejmuje pięć typów wejścia, a każdy kontroluje inną oś wyjścia.

Obrazy kontrolują tożsamość. Karta postaci, zdjęcie produktu, plansza lokalizacji. Wan 3.0 nazywa to spójnością na poziomie pikseli, a w przykładach AliBaby blokada rozciąga się poza twarz na garderobę: warstwowa szara szata, skórzany kaftan z paskami, ciemna opaska w talii – wszystko wytrzymuje szesnastosekundową walkę wręcz w trzech lokalizacjach.

Młody mężczyzna w tradycyjnych chińskich szatach stojący na zewnątrz o zachodzie słońca

Dwie karty postaci napędzające scenę walki wuxia z detalami kostiumów utrzymanymi klatka po klatce

Dwie karty postaci plus jedna plansza lokalizacji trzcinowego brzegu. Garderoba i sceneria utrzymują się przez cały rzut. Pokazane jako cichy GIF; dostarczony plik niesie stereofoniczny miks 44,1 kHz. Źródło: oficjalny podręcznik twórcy Wan 3.0 AliBaby.

Audio kontroluje głos. To jest część, która czyni „multimodalne” czymś więcej niż marketingiem. Dołączasz próbkę głosu na postać, piszesz kwestie w prompcie, a dialog wraca w tej barwie, zsynchronizowany z ustami, w tym samym przejściu co obraz. Dwie osoby, dwie referencje głosowe, jedna siłownia.

Dwa obrazy postaci plus dwie osobne próbki referencyjne głosu, a dialog wraca w tych dwóch głosach. Warto włączyć dźwięk w tym przypadku. Źródło: oficjalny podręcznik twórcy Wan 3.0 AliBaby.

Wideo kontroluje timing. Referencyjne wideo nie jest po to, by je kopiować. Jest po to, by podarować swój rytm: jak długo utrzymuje się beat, jak porusza się przejście. W tym przypadku pięć klatek kluczowych dostarcza postaci, a referencyjne wideo dostarcza poziomą kadencję przewracania kart między nimi.

Kobieta w ozdobnym tradycyjnym chińskim nakryciu głowy i niebieskiej haftowanej sukience

Pięć klatek kluczowych przewijanych z tempem zaczerpniętym z referencyjnego wideo_Pięć_ obrazów klatek kluczowych dla postaci, jedno referencyjne wideo dla rytmu przewracania. Źródło: oficjalny podręcznik twórcy Wan 3.0 AliBaby.

Dokumenty i strony internetowe kontrolują strukturę. To jest naprawdę nowość. Wan 3.0 akceptuje pliki dokumentów i URL-e na żywo jako kreatywne wejście, a raporty z bety wymieniają .doc, .xls, .ppt, .pdf i .txt wśród akceptowanych formatów (AlphaSignal, sierpień 2026). Ta sama logika działa już z obrazem storyboardu: jeden storyboard na wejściu, sześć ujęć na wyjściu, w kolejności storyboardu.

Dwie osoby z parasolami stoją na deszczowej peronie dworca

Pojedynczy storyboard rozszerzony do sześciu sekwencyjnych ujęć na deszczowym peronie dworca

Jeden storyboard jako referencja, sześć ujęć wygenerowanych w jego kolejności, aż po notatkę przechodzącą z rąk do rąk w ujęciu piątym. Źródło: oficjalny podręcznik twórcy Wan 3.0 AliBaby.

Pierwsza i ostatnia klatka kontrolują punkty końcowe. Najstarszy trik w książce, wciąż obsługiwany, wciąż najszybszy sposób na wyznaczenie granic ujęcia.

Oto jak to się układa w porównaniu z wersją, z której większość ludzi korzysta obecnie.

Wan 2.7 Reference-to-VideoWan 3.0 omni-reference
Assety referencyjnejeden obraz na postać, do 3 wideo, 1 klip audiodo 20 assetów łącznie
Modalnościobraz, wideo, audioobraz, wideo, audio, dokument, strona internetowa
Maksymalny czas trwania, jeden przebieg10 s30 s natywnie, plus inteligentny czas trwania
Audio w tym samym przebiegutaktak
Edycja i rozszerzanie wideonieudostępnioneedycja oparta na instrukcjach i referencjach, plus rozszerzanie
Dostępnośćdostępne na API zewnętrznychAlibaba Cloud Model Studio i Qwen Cloud beta

Jest jedna zasada, której nikt nie umieszcza w dokumentacji, a każdy uczy się jej na własnej skórze: jedna referencja, jedno zadanie. Image1 blokuje twarz i strój. Video1 przekazuje tylko ruch. Audio1 przekazuje tylko barwę. W momencie, gdy wręczasz jednemu assetowi dwa sprzeczne zadania, lub przesyłasz obraz referencyjny z dwiema osobami, model musi zgadywać, a zgadywanie to dokładnie to, co próbowałeś powstrzymać. Podręcznik AliBaby jest w tej kwestii również bezpośredni: jedna postać na obraz referencyjny.

Przepływ pracy z odniesieniem multimodalnym Wan 3.0, który możesz uruchomić już dziś

Najpierw prosta odpowiedź. Wan 3.0 jest w publicznej becie na własnej chmurze AliBaby, pod identyfikatorem modelu wan3.0-video (Alibaba Wan, sierpień 2026). Nie trafił jeszcze na platformy API stron trzecich, w tym Atlas Cloud. Każdy, kto sprzedaje ci teraz dostęp do API Wan 3.0, odsprzedaje coś innego.

To, co trafiło, to kształt przepływu pracy. Pakiet referencyjny na wejściu, jedno wywołanie, gotowy klip z dźwiękiem na wyjściu. Działa to już dziś na modelach odniesienia do wideo, które możesz wywołać w karcie przeglądarki, a gdy je ustawisz w szeregu, nagłówek o 20 assetach wygląda inaczej.

ModelAssety referencyjneModalnościMaksymalny czas trwaniaNatywne audioCena za sekundę
Wan 3.0 (beta AliBaby, nie na Atlas)20 łącznieobraz, wideo, audio, dokument, strona internetowa30 sTakzgłaszane $0,05 do $0,20 w zależności od rozdzielczości
Wan 2.7 Reference-to-Video1 obraz na postać, 3 wideo, 1 klip audioobraz, wideo, audio10 sTak$0,10
Seedance 2.5 Reference-to-Video50 (30 obraz / 10 wideo / 10 audio)obraz, wideo, audio30 sTak$0,13
MiniMax H3 Reference-to-Videomieszane, brak podanego limituobraz, wideo, audio15 sTak$0,10
Kling Video O3 Pro Reference-to-Video7 obrazów, lub 4 obrazy + 1 wideoobraz, wideo15 sTak$0,10
Vidu Q3-Mix Reference-to-Video4 obrazyobraz16 sTak$0,11
Veo 3.1 Reference-to-Video3 obrazyobraz8 sOpcjonalnie$0,20

Ceny to stawki Atlas Cloud według stanu na sierpień 2026. Dane Wan 3.0 to liczby zgłoszone dla bety Alibaba Cloud, a nie stawki Atlas, a Alibaba nie opublikowała jeszcze publicznej strony z cenami modelu, więc traktuj ten wiersz jako prowizoryczny.

Przeczytaj tę tabelę dwa razy, a prawdziwa historia się wyłoni. Nagłówek o 20 assetach nie jest miejscem, w którym Wan 3.0 wyprzedza konkurencję, ponieważ Seedance 2.5 już przyjmuje 50 i dorównuje 30 sekundom. Tego, czego nic innego na tej liście nie przyjmuje, to PDF.

W poniższym instruktażu demo działa na Wan 2.7 Reference-to-Video, ponieważ jego kształt wejścia jest najbliższym żyjącym krewnym omni-reference: wiele obrazów postaci, opcjonalne referencyjne wideo i klip głosowy, wszystkie mapowane na etykiety character1 i character2 w prompcie. Trzy modele, jedna karta przeglądarki, brak lokalnej instalacji.

Zbuduj sam: Scena z odniesieniem multimodalnym w czterech krokach

Scena: pastelowe biuro recepcji hotelowej. Niewzruszony portier. Podróżny trzymający ragdolla. Portier patrzy prosto w obiektyw i mówi: „Kot ma rezerwację. Pan nie.”

Dwa obrazy plus jeden klip głosowy, czyli trzy assety referencyjne w dwóch modalnościach. To najmniejsza konstrukcja, która jest uczciwie multimodalna, a nie tylko wieloobrazowa.

Krok 1. Wygeneruj obraz referencyjny 1, postać, którą musisz zablokować

Obrazy referencyjne mają trzy zadania i tylko trzy: jedna postać, twarzą do kamery, czyste tło. Wszystko inne to dekoracja. Użyj GPT Image 2 z jakością high, rozmiarem 16:9, n=1.

Plain
1Portret studyjny w pełnej postaci, hotelowy portier w średnim wieku z niewzruszonym wyrazem twarzy, stojący idealnie na środku na tle płaskiej, zakurzonej różowej ściany. Nosi śliwkowy, dwurzędowy mundur bellhopa ze złotymi lamówkami i mosiężnymi guzikami, małą okrągłą czapeczkę pillbox i cienki wąsik. Idealnie symetryczne kadrowanie, miękkie przednie światło, brak cienia na ścianie, ziarno filmu 35 mm, stonowana pastelowa paleta. Tylko jedna postać, żadnych innych osób, żadnego tekstu, logo, rekwizytów w kadrze.

Interfejs generatora obrazów AI z ponumerowanymi krokami i wygenerowanym bellhopem

Środowisko GPT Image 2 na Atlas Cloud z portretem referencyjnym portiera wyrenderowanym w panelu wyjścia

GPT Image 2 na Atlas Cloud: jakość high, 16:9, jedna postać, płaskie tło. To jest plik, który staje się character1.

Krok 2. Wygeneruj obraz referencyjny 2, drugą zablokowaną postać

Ten sam model, te same ustawienia. Kontrast kolorów między dwiema postaciami jest celowy, ponieważ daje modelowi łatwy sposób na odróżnienie ich, gdy dzielą kadr.

Plain
1Portret studyjny w pełnej postaci, młoda podróżniczka trzymająca puszystego ragdolla na piersi, stojąca idealnie na środku na tle płaskiej musztardowo-żółtej ściany. Nosi musztardowy wełniany płaszcz, czerwony beret i okrągłe okulary w stylu szylkretowym, w wolnej ręce trzyma małą, zabytkową skórzaną walizkę. Idealnie symetryczne kadrowanie, miękkie przednie światło, brak cienia na ścianie, ziarno filmu 35 mm, stonowana pastelowa paleta. Tylko jedna postać, żadnych innych osób, żadnego tekstu, logo.

Krok 3. Wygeneruj referencję głosową, czyli rzeczywistą część multimodalną

Klip głosowy to to, co zmienia to zadanie z wieloobrazowego na multimodalne. Slot audio Wan 2.7 oczekuje krótkiej próbki, mniej więcej 1 do 10 sekund, więc trzymaj kwestię krótko. Użyj MiniMax Speech 2.6 HD i wybierz niski, płaski, niewzruszony męski głos.

Plain
1Dobry wieczór. Melduje się? Oczywiście. Wszyscy się meldują.

Krok 4. Jedno wywołanie, trzy referencje, jeden gotowy klip

Teraz cały pakiet wchodzi razem na Wan 2.7 Reference-to-Video. Ustawienia: resolution: 1080P, ratio: 16:9, duration: 10, co jest maksymalnym czasem tego modelu, prompt_extend: false, seed: -1. Załaduj images w kolejności, najpierw krok 1, aby mapował się na character1, potem krok 2 jako character2, i dołącz plik z kroku 3 do audio.

Plain
1Symetryczne, szerokie ujęcie z centralnego punktu, pastelowe lobby recepcji hotelowej, zakurzone różowe ściany i musztardowo-żółty stojak na klucze za nią. character1 to portier stojący za biurkiem; character2 to podróżniczka stojąca przed nim, wciąż trzymająca swojego ragdolla. Kamera powoli wjeżdża do przodu wzdłuż idealnej centralnej osi i nigdy się nie przechyla. character1 patrzy prosto w obiektyw i mówi płasko: „Kot ma rezerwację. Pan nie.” character2 mruga raz, powoli odwraca głowę w stronę kota, a potem z powrotem w stronę biurka. Kot wpatruje się bezpośrednio w kamerę bez ruchu. Ziarno filmu 35 mm, miękkie światło, stonowana pastelowa paleta, brak drgań kamery, brak cięć.

Negatywny prompt:

Plain
1drgania ręczne, skoki cięć, napisy, tekst na ekranie, znak wodny, dodatkowe osoby, zdeformowane dłonie, morfowanie twarzy, przesunięcie koloru, rozmycie ruchu

Zrzut ekranu interfejsu generatora wideo AI z wejściem i wyjściem

Środowisko Wan 2.7 Reference-to-Video na Atlas Cloud z dwoma obrazami referencyjnymi i jednym plikiem audio załadowanymi oraz gotowym klipem w panelu wyjścia

Wan 2.7 Reference-to-Video na Atlas Cloud: dwa obrazy referencyjne i jeden klip głosowy dołączone po lewej, gotowe ujęcie odtwarzane po prawej w 1080P i 16:9. To przechwycenie działało przy domyślnym czasie trwania modelu; ustaw na 10 dla pełnej wersji poniżej.

Gotowy klip. Obie twarze utrzymane, oba stroje utrzymane, a kwestia wygłoszona w sklonowanym głosie z kroku 3, więc warto odtworzyć z dźwiękiem.

Kobieta trzymająca kota przy biurku recepcji hotelowej z bellhopem

Dwa portrety referencyjne obok klatki z gotowego klipu, pokazujące te same twarze i stroje

Referencje po lewej, klatka z dostarczonego klipu po prawej. Lamówki munduru, beret, okulary i kot przetrwają podróż.

Warianty przepływu pracy z odniesieniem multimodalnym Wan 3.0

Rozciągnij do 30 sekund. Ten sam pakiet referencyjny działa na Seedance 2.5 Reference-to-Video z duration: 30, co daje ci długość, którą obiecuje Wan 3.0, bez czekania na betę. Przyjmuje do 30 obrazów referencyjnych, 10 wideo i 10 klipów audio, więc pakiet ma miejsce na rozrost. Napisz dodatkowe 20 sekund jako beaty w prompcie, a nie jako nastroje, w przeciwnym razie model będzie dopełniał.

Interfejs generatora wideo AI z ustawieniami wejścia i postępem generowania

Środowisko Seedance 2.5 Reference-to-Video na Atlas Cloud z czasem trwania ustawionym na 30 i wyrenderowanym długim ujęciem

Seedance 2.5 Reference-to-Video na Atlas Cloud z czasem trwania ustawionym na 30 i tymi samymi dwoma portretami referencyjnymi dołączonymi, przechwycone w trakcie generowania. Zwróć uwagę na @image1 i @image2 znaczniki w prompcie: w ten sposób mówisz Seedance, która referencja gra którą rolę. Sprawdź cytowaną cenę na przycisku Uruchom przed zatwierdzeniem, ponieważ odzwierciedla ona czas trwania, który zadanie faktycznie wyśle.

30-sekundowa wersja tej samej sceny, ten sam pakiet referencyjny, beaty rozpisywane ujęcie po ujęciu.

Dodaj referencyjne wideo tylko dla ruchu. Dołącz klip, którego tempo Ci się podoba, i powiedz to wyraźnie w prompcie, coś w stylu „podążaj za referencyjnym wideo tylko dla rytmu cięcia, zignoruj jego postaci i scenerię”. To jest trik stojący za przykładem przewracania kart powyżej.

Napraw dryf za pomocą negatywnego promptu, zanim dotkniesz pozytywnego. Morfowanie twarzy, przesunięcie koloru i drgania ręczne to trzy rzeczy, które rujnują ujęcia zablokowane referencyjnie, a zazwyczaj taniej jest je stłumić niż opisać.

Wypróbuj format odniesienia multimodalnego za darmo

Jeśli chcesz kształtu tego przed parametrami, Atlas Cloud w zeszłym tygodniu wypuścił darmowy generator skeczy reklamowych AI, który uruchamia ten sam łańcuch bez żadnych pokręteł.

Piszesz jedną linię o swoim produkcie i jego zaletach. On pisze dla ciebie dwupostaciowy komediowy scenariusz, haczyk, konflikt, zwrot akcji, a następnie renderuje 15-sekundowe wideo z mówionym dialogiem i efektami dźwiękowymi wbudowanymi. Możesz dołączyć do czterech prawdziwych zdjęć produktów jako referencje, a reklama zachowuje ich kształt, kolor, etykietę i logo od scenariusza do ostatniej klatki. Sześć stylów jest dostarczanych, od zabawnego mema przez zwrot akcji i sitcom po luksus i twardą sprzedaż, a dialog wraca w języku, w którym napisałeś opis.

To jest ten sam łańcuch dwóch postaci plus obrazów referencyjnych plus głosu z tutoriala, minus pisanie promptu i minus rachunek. Co czyni go przyzwoitym sposobem na sprawdzenie, czy ten format pasuje do twojego produktu, zanim wydasz cokolwiek na dostrojenie.

Aby dać wyobrażenie, co stos nieruchomych kadrów referencyjnych robi z materiałem produktowym, oto własna wersja Wan 3.0 tego zadania: pięć obrazów na wejściu, jeden film promocyjny na wyjściu, każdy kadr kotwiczy jeden beat edycji.

Animowany unoszący się stos białych i miętowych kart

Pięć nieruchomych kadrów referencyjnych rozszerzonych do filmu promocyjnego produktu w stylu Material Design_Pięć obrazów referencyjnych napędzających dziewięciosekundowy film produktowy, każdy kotwiczący beat i przekazujący pałeczkę następnemu. Źródło: oficjalny podręcznik twórcy Wan 3.0 AliBaby._

Ile kosztuje klip z odniesieniem multimodalnym Wan 3.0

KrokModelCena jednostkowaIlośćKoszt
1 i 2, dwa obrazy referencyjneGPT Image 2$0,009 za obraz2$0,02
3, referencja głosowaMiniMax Speech 2.6 HD$0,08 za 1K znaków49 znaków$0,00
4, 10-sekundowe ujęcie w 1080PWan 2.7 Reference-to-Video$0,15 za sekundę w 1080P10 s$1,50
Razem tutorialokoło $1,52
Wariant, 30 sekundSeedance 2.5 Reference-to-Video$0,134 za sekundę w 480P30 sokoło $4,02
Darmowa ścieżkaDarmowy Generator Skeczy Reklamowych AIdarmowy1 klip, 15 s$0

To są stawki własne platformy, sprawdzone w sierpniu 2026 i rozliczane w systemie pay-as-you-go. Dwie rzeczy zmieniają całkowity koszt bardziej, niż ludzie się spodziewają. Rozdzielczość jest pierwsza: $0,10 za sekundę w tabeli porównawczej to stawka bazowa Wan 2.7, a 1080P kosztuje $0,15, skąd pochodzi $1,50 powyżej. Drugą jest to, że Seedance wycenia według liczby pikseli, więc jego podane $0,134 za sekundę to wartość dla 480P, a ujęcie w 720P kosztuje więcej niż wynikałoby z prostego mnożenia. Dla porównania, zgłaszana stawka beta Wan 3.0 wynosząca $0,20 za sekundę w 1080p dałaby pełne 30-sekundowe ujęcie za około $6, co jest wyższe niż dzisiejsza ścieżka Seedance w 480P.

Uwaga dotycząca korzystania z tego. Wan 3.0 to beta, a jego warunki mogą się zmieniać, więc przeczytaj je ponownie przed zbudowaniem na nim potoku. Jeśli twoje obrazy referencyjne przedstawiają prawdziwe osoby, uzyskaj ich zgodę, ponieważ odniesienie do wideo to właśnie możliwość, która czyni to istotnym. Przykładowe klipy w tym artykule to własne wygenerowane wyniki AliBaby z publicznego podręcznika twórcy, reprodukowane tutaj na potrzeby komentarza.

Często zadawane pytania

Ile referencji może faktycznie przyjąć odniesienie multimodalne Wan 3.0?

Do 20 assetów w jednym wywołaniu, pochodzących z obrazów, wideo, audio, dokumentów i stron internetowych. Praktyczny limit jest niższy niż techniczny. Przypisz każdemu assetowi dokładnie jedno zadanie, jedna postać na obraz, a wykorzystasz znacznie mniej niż 20 dla większości scen.

Czy Wan 3.0 naprawdę może zamienić PDF lub stronę internetową w wideo?

Tak, to jest naprawdę unikalna część. Obok tekstu, obrazu, audio i wideo akceptuje pliki dokumentów i URL-e na żywo, a raporty z bety wymieniają .doc, .xls, .ppt, .pdf i .txt. Żaden inny model odniesienia do wideo w powyższej tabeli porównawczej nie przyjmuje dokumentu.

Czy Wan 3.0 jest open source? Czy mogę go uruchomić w ComfyUI?

Nie, i nie w tej chwili. Wan 3.0 to zamknięta beta działająca na własnej chmurze AliBaby. Wcześniejsze generacje Wan zostały wydane otwarcie, dlatego istnieje takie oczekiwanie, ale Alibaba nie potwierdziła wag dla 3.0. Strony twierdzące o wydaniu Wan 3.0 w wersji 1.3B lub 14B Apache 2.0 nie są poparte niczym oficjalnym.

Czy Wan 3.0 jest już dostępny przez API stron trzecich?

Jeszcze nie, w tym Atlas Cloud. Najbliższym, co możesz dziś wywołać, jest Wan 2.7 Reference-to-Video, którego kształt wejścia prawie dokładnie pasuje do omni-reference, poza modalnościami dokumentów i stron internetowych, lub Seedance 2.5 Reference-to-Video, jeśli potrzebujesz pełnych 30 sekund.

Jaki jest najtańszy sposób na przetestowanie zablokowanego referencyjnie, dwupostaciowego wideo?

Darmowy generator skeczy reklamowych AI, link powyżej. Cztery zdjęcia referencyjne na wejściu, 15-sekundowy mówiony klip z dwiema postaciami na wyjściu, bez parametrów i bez wydatków. Jeśli utrzyma twój produkt i twój format, to dostrój płatny łańcuch.

Dlaczego moje postacie wciąż dryfują, nawet przy obrazach referencyjnych?

Trzy przyczyny, w kolejności częstotliwości. Jedna referencja wykonuje dwa zadania, więc proszona jest o ustalenie zarówno twarzy, jak i lokalizacji. Obraz referencyjny zawiera więcej niż jedną osobę lub ruchome tło, więc model nie wie, którą część zablokować. Albo dryf jest artefaktem renderowania, a nie błędem referencji, w którym to przypadku umieść morfowanie twarzy, przesunięcie koloru w negatywnym prompcie przed przepisaniem czegokolwiek.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele