Seedance 2.5 już dostępne — Jako pierwsze na Atlas Cloud

Wan 3.0 Realistyczne twarze: 3 prompty wyglądające jak ludzkie

Wan 3.0 Realistyczne twarze: Podpowiedzi, Ustawienia, Testy weryfikacyjne

Najnowsza aktualizacja: Wan 3.0 jest już dostępny od 24 sierpnia 2026 roku.

AI wideo oceniane jest przede wszystkim po twarzy. Nie po ruchu kamery, nie po tle. Po twarzy.

Jeśli oczy uciekają, skóra staje się woskowa, a usta zaczynają robić tę gumową AI rzecz, scrollowanie się kończy. Dlatego właśnie wan 3.0 realistyczne twarze to prawdziwy test produkcyjny dla twórców reklam UGC, krótkich filmów, referencji i klipów społecznościowych.

Praktyczna odpowiedź jest prosta: realistyczne twarze to nie ustawienie piękna. To problem reżyserii. Potrzebujesz stabilnego odniesienia, małych ludzkich działań, jasnych zasad kamery i twardych ograniczeń awarii.

Ten przewodnik używa Atlas Cloud jako przestrzeni roboczej przeglądarki, ponieważ możesz testować Wan-3.0 Text-to-video, Image-to-video oraz Reference-to-video w jednym miejscu, zobaczyć stan uruchomienia i sprawdzić widoczny koszt przed wysłaniem.

Kluczowe wnioski

  • Prawdziwa jakość twarzy oznacza tożsamość, skórę, spojrzenie, usta i ciągłość ruchu.
  • Image-to-video jest zazwyczaj bezpieczniejsze, gdy liczy się konkretna twarz.
  • Opisuj mięśnie i mikroruchy, nie tylko etykiety emocji.
  • Używaj 8-sekundowych szkiców przed płaceniem za 24- lub 30-sekundowe testy obciążeniowe.
  • W Atlas Cloud, tryby Wan-3.0 zaczynają się od $0.05/sek.

Interfejs generowania wideo AI pokazujący płaczącego absolwenta

Prezentacja realistycznych twarzy Wan 3.0 z kartą promptu zbliżenia na graduację, dowodem ukończonego uruchomienia i klatkami stabilności twarzy

Prezentacja: przypadek zbliżenia na graduację wykorzystuje jedną twarz, subtelną ekspresję, ruch spojrzenia i 30,07-sekundowy klip z podręcznika, aby przetestować ciągłość realistycznej twarzy.

Dowód ruchu przypadku 1: młoda czarnoskóra kobieta w niebieskiej sukni absolwenckiej utrzymuje jedną twarz w zbliżeniu przez 30,07-sekundowy klip z podręcznika Wan 3.0.

Dlaczego realistyczne twarze Wan 3.0 są gorące i dlaczego większość prób kończy się niepowodzeniem

Wniosek na początek: twarze zawodzą, ponieważ prompt prosi o nastrój, podczas gdy model potrzebuje wskazówek.

Wan 3.0 pojawił się z większym płótnem: klipy do 30 sekund, rozdzielczość 1080P, natywne generowanie audio-wideo i szerokie wejścia referencyjne. Informacje prasowe Alibaba podkreślają również multimodalne wejścia i wizualną ciągłość dla ludzkich twarzy i mikroekspresji (Alibaba Cloud Community, sierpień 2026). Oficjalna strona Model Studio przedstawia to wydanie w kontekście 30-sekundowego opowiadania historii, kinowej jakości 1080P, natywnego A/V i wszechstronnych wejść referencyjnych (Alibaba Cloud Model Studio, sierpień 2026).

Brzmi imponująco. I jest.

Ale problem twórcy jest bardziej praktyczny: „Czy ta osoba może mrugać, mówić, wahać się i pozostać tą samą osobą?”

Typowe wzorce niepowodzeń wyglądają znajomo:

  • Dryfowanie oczu: spojrzenie nie ma wyraźnego celu.
  • Gumowa skóra: pory znikają, a policzki poruszają się jak silikon.
  • Dryf kości: kości policzkowe i szczęka zmieniają kształt między klatkami.
  • Fałszywy uśmiech: usta się uśmiechają, a oczy nie.
  • Migotanie ust: zęby i usta pulsują podczas mówienia.
  • Utrata tożsamości wywołana ruchem kamery: twarz zmienia się po panoramowaniu lub obrocie.

To nie tylko szum informacyjny wokół premiery. W starszych przepływach pracy Wan użytkownicy zgłaszali niespójność twarzy i niepokojące wyniki podczas uruchomień image-to-video, w tym twarze, które nie pozostawały wierne oryginalnemu obrazowi (Dyskusja na GitHubie ComfyUI, kwiecień 2025).

Pytanie brzmi: jak to wyreżyserować?

Przegląd przepływu pracy dla realistycznych twarzy Wan 3.0 na Atlas Cloud

Użyj najprostszego trybu, który daje wystarczającą kontrolę.

Jeśli nie masz osoby referencyjnej, zacznij od Text-to-video. Jeśli liczy się konkretna twarz, użyj Image-to-video z mocną pierwszą klatką. Jeśli masz odniesienia do tożsamości, ruchu i dźwięku, użyj Reference-to-video.

Możesz zacząć od strony głównej Atlas Cloud, otworzyć stronę modelu Wan 3.0, wkleić prompt, wybrać czas trwania i rozdzielczość, a następnie uruchomić test w jednej karcie przeglądarki. Praktyczną zaletą jest nie tylko dostęp. Chodzi o to, że prompt, ustawienia, panel wyjściowy i podany koszt pozostają widoczne podczas iteracji.

PotrzebaModel Atlas CloudGdzie uruchomićZastosowanieCena weryfikacji
Zacznij od czystego promptuWan-3.0 Text-to-videoPlac zabaw Wan 3.0 Text-to-videoOgólny aktor lub scenaOd $0.05/sek
Animuj pierwszą klatkęWan-3.0 Image-to-videoTa sama rodzina Wan 3.0, tryb Image-to-videoStabilna twarz, portret UGCOd $0.05/sek
Zablokuj odniesienia w ruchuWan-3.0 Reference-to-videoTa sama rodzina Wan 3.0, tryb Reference-to-videoOdniesienia do tożsamości, ruchu, głosu, scenyOd $0.05/sek

Atlas Cloud models/all obecnie wymienia Wan-3.0 Text-to-video, Image-to-video i Reference-to-video od $0.05/SEK. Oficjalna strona Alibaba pokazuje również ceny zależne od rozdzielczości dla własnej platformy, dlatego traktuj widoczny koszt przycisku Uruchom jako ostateczne źródło prawdy przed wysłaniem.

Krok 1: Wybierz tryb realistycznych twarzy Wan 3.0

Zacznij od przepływu pracy, który odpowiada Twojemu ryzyku.

Brak twarzy referencyjnej? Użyj Text-to-video. Potrzebujesz jednego stabilnego aktora? Użyj Image-to-video. Potrzebujesz znanej tożsamości plus ruchu, głosu lub poprzedniego klipu? Użyj Reference-to-video.

Skopiuj ten prompt, gdy potrzebujesz szybkiego sprawdzenia trybu:

Plain
116:9, 8 sekund, realistyczne kinowe zbliżenie. Osoba siedzi przy oknie w miękkim świetle dziennym i wypowiada jedno krótkie zdanie z naturalnym ruchem warg, małymi przesunięciami oczu i swobodnym oddechem. Zachowaj tę samą twarz, odcień skóry, linię włosów, ubiór, oświetlenie i rozmycie tła przez cały klip. Unikaj dryfu twarzy, woskowej skóry, zniekształconych oczu, dodatkowych zębów, skoków montażowych i twarzy w tle.

Ustawienia do wyboru:

UstawienieRekomendacjaDlaczego to ważne
Proporcje16:9 dla testów artykułowych, 9:16 dla pionowych socialSkala twarzy i kadrowanie zmieniają tryb awarii
Rozdzielczość1080P dla wersji finalnej, 720P dla szkiców w razie potrzebyWyższa rozdzielczość pomaga w detalach skóry i oczu
Czas trwania8s szkic, 24s do 30s test obciążeniowyDługie ujęcia ujawniają dryf tożsamości
AudioTło pomieszczenia, chyba że mowa jest sednemUtrzymuje skupienie na teście twarzy

Brak kropki na końcu?

Ustawienia trybu realistycznych twarzy Wan 3.0 na Atlas Cloud z ukończonym uruchomieniem i widocznym panelem wyjściowym

Krok 1: Ustawienia trybu Wan 3.0 na Atlas Cloud, przechwycone po ukończonym uruchomieniu, aby wejście i wyjście były widoczne razem.

Krok 2: Uruchom przypadek 1, realistyczne zbliżenie twarzy Wan 3.0

To jest to trudne.

Zbliżenie usuwa wszystkie miejsca do ukrycia. Widz widzi kąciki ust, napięcie brwi, cel spojrzenia i teksturę skóry. Przypadek 1 wykorzystuje klip z podręcznika Wan 3.0 przedstawiający młodą czarnoskórą kobietę w niebieskiej sukni absolwenckiej, ujętą w zbliżeniu, mówiącą cicho, gdy jej wzrok opada.

Skopiuj ten prompt:

Plain
116:9, 8 sekund, realistyczne kinowe zbliżenie. Młoda czarnoskóra kobieta w niebieskiej sukni absolwenckiej stoi w miękkim świetle ceremonii w pomieszczeniu, ujęta od głowy do górnej części klatki piersiowej. Druga osoba jest widoczna tylko jako całkowicie rozmyty kształt na lewej krawędzi. Mówi cicho w stronę kogoś tuż poza kadrem, usta poruszają się naturalnie, brwi lekko się marszczą, oczy lekko wilgotne, ale nie płacze. W trakcie ujęcia jej wzrok powoli opada z poziomu oczu na dłonie. Kamera jest nieruchoma, ale ma delikatny, ręczny, oddychający ruch. Naturalna tekstura skóry, widoczne pory, miękkie górne światło, płytka głębia ostrości. Zachowaj tę samą twarz, tę samą suknię, ten sam odcień skóry, ten sam kształt oczu i to samo rozmycie tła przez cały klip. Unikaj plastikowej skóry, zmieniających się kości policzkowych, dodatkowych zębów, przesadzonego uśmiechu, zniekształconych oczu i skoków montażowych.

Ustawienia do wyboru:

UstawienieWybór
ModelWan-3.0 Image-to-video, jeśli masz pierwszą klatkę, Wan-3.0 Text-to-video, jeśli nie
Czas trwania8s dla szkicu, 30s dla dowodu długiego ujęcia
Rozdzielczość1080P, jeśli dostępne, w przeciwnym razie 720P
Proporcje16:09
AudioTylko tło pomieszczenia, chyba że testowany jest dialog

Interfejs generatora wideo AI z ustawieniami wejściowymi i wygenerowanym wyjściem wideo

Zrzut ekranu ukończonego uruchomienia przypadku 1 realistycznych twarzy Wan 3.0 dla promptu zbliżenia na graduację

Krok 2: Dowód uruchomienia przypadku 1 dla testu realistycznej twarzy w zbliżeniu na graduację. Zobacz powyższy klip demonstracyjny, aby zobaczyć pełny dowód ruchu.

Krok 3: Uruchom przypadek 2, realistyczna rozmowa telefoniczna UGC Wan 3.0

Twarze UGC zawodzą inaczej.

Ujęcie nie jest tak ciasne jak zbliżenie beauty, ale mowa, pozycja dłoni i miękkie światło z okna mogą szybko ujawnić morfing twarzy. Ten przypadek wykorzystuje rozmowę telefoniczną w deszczowym mieszkaniu: młoda kobieta siedzi obok okna, słucha, odpowiada i kończy małym półuśmiechem.

Skopiuj ten prompt:

Plain
116:9, 8 sekund, naturalne realistyczne wideo w stylu UGC. Młoda kobieta z długimi ciemnymi włosami siedzi przy drewnianym stole obok deszczowego okna w mieszkaniu, trzymając smartfon przy uchu. Za oknem rozmywają się neonowe światła miasta. Słucha, po czym odpowiada spokojnym, cichym głosem; jej usta poruszają się miękko, oczy przesuwają się w dół na jeden moment, a na końcu pojawia się mały półuśmiech. Kamera to stabilne średnie zbliżenie z przeciwnej strony stołu, wygląd obiektywu 50mm, miękkie światło z okna padające na jedną stronę twarzy, ciepła lampka w tle. Zachowaj spójność jej twarzy, linii włosów, kształtu nosa, pozycji dłoni, telefonu, stołu, deszczu na oknie i oświetlenia. Unikaj nadmiernie wygładzonej skóry, woskowych policzków, niedopasowanego ruchu warg, morfingu twarzy, dodatkowych palców i twarzy w tle.

Ustawienia do wyboru:

UstawienieWybór
ModelWan-3.0 Text-to-video dla ogólnego aktora, Image-to-video dla ustalonej twarzy
Czas trwania8s szkic
Rozdzielczość1080P preferowane
Proporcje16:09
AudioNatywne audio włączone tylko jeśli testujesz głos, w przeciwnym razie cichy deszcz i tło pomieszczenia

Interfejs generatora wideo AI pokazujący ustawienia wejściowe i wygenerowane wideo

Zrzut ekranu ukończonego uruchomienia przypadku 2 realistycznych twarzy Wan 3.0 dla rozmowy telefonicznej przy deszczowym oknie

Krok 3: Dowód uruchomienia przypadku 2 dla testu twarzy podczas rozmowy telefonicznej w deszczu.

Uśmiechnięta kobieta rozmawiająca przez telefon przy deszczowym oknie

GIF dowodu ruchu przypadku 2 dla testu twarzy podczas rozmowy telefonicznej przy deszczowym oknie

GIF dowodu ruchu przypadku 2: 15,04-sekundowy klip z podręcznika Wan 3.0 testuje mowę, przesunięcia oczu, spójność dłoń-telefon i miękkie oświetlenie wnętrza.

Krok 4: Uruchom przypadek 3, pionowy klip społecznościowy z realistyczną twarzą Wan 3.0

Teraz pomniejsz twarz.

Pionowe klipy są podstępne. Twarz jest mniejsza, ale widzowie nadal zauważają, jeśli oczy zmieniają rozmiar, nogi się wypaczają lub odbicie w lustrze staje się drugą osobą. Ten przypadek testuje ruch pełnego ciała z lustrem, detalami stroju i zrelaksowanym uśmiechem.

Skopiuj ten prompt:

Plain
19:16, 8 sekund, realistyczne pionowe wideo społecznościowe. Młoda kobieta w białej haftowanej bluzce, białej plisowanej spódnicy, czarnym pasku i białych platformach stoi przed czystym lustrem w pełnej długości w miękkim świetle mieszkania. Poprawia jeden rękaw, naturalnie przenosi ciężar, patrzy z lustra na kamerę i daje mały, zrelaksowany uśmiech. Kadrowanie pełnej sylwetki, stabilna kamera nieruchoma, naturalne światło dzienne, bez mocnego filtra upiększającego, realistyczna tekstura tkaniny i proporcje ciała. Zachowaj tę samą twarz, ten sam strój, tę samą fryzurę, tę samą pozycję lustra i ten sam układ pomieszczenia przez całe ujęcie. Unikaj dryfu twarzy, lalkowej skóry, zmieniającego się rozmiaru oczu, wypaczonych nóg, dodatkowych odbić i skoków montażowych.

Ustawienia do wyboru:

UstawienieWybór
ModelWan-3.0 Text-to-video lub Image-to-video
Czas trwania8s szkic
Rozdzielczość1080P preferowane
Proporcje9:16
AudioBrak muzyki, tylko ciche tło pomieszczenia

Interfejs generatora wideo AI pokazujący prompt tekstowy i wygenerowane wideo

Zrzut ekranu ukończonego uruchomienia przypadku 3 realistycznych twarzy Wan 3.0 dla pionowego klipu modowego z lustrem

Krok 4: Dowód uruchomienia przypadku 3 dla testu spójności twarzy w pionie pełnej sylwetki.

Kobieta w białej haftowanej koszuli i plisowanej spódnicy w kuchni

GIF dowodu ruchu przypadku 3 dla pionowej spójności twarzy modowej

GIF dowodu ruchu przypadku 3: 15,04-sekundowy klip z podręcznika Wan 3.0 sprawdza, czy mniejsza twarz pozostaje stabilna, podczas gdy ciało, strój i lustro pozostają spójne.

Krok 5: Audytuj realistyczne twarze Wan 3.0 przed ponownym generowaniem

Nie generuj ponownie, ponieważ klip „wydaje się nie taki”. Najpierw nazwij awarię.

Ta lista kontrolna utrzymuje obiektywność przeglądu:

SprawdzenieSygnał pozytywnyGeneruj ponownie, jeśli
TożsamośćTa sama odległość oczu, nos, kości policzkoweTwarz wygląda jak nowa osoba
SkóraPory i miękka tekstura pozostająWosk, plastik, nadmiernie wygładzona
UstaMowa wydaje się mała i ludzkaGumowa szczęka lub migotanie zębów
OczySpojrzenie ma wyraźny celOczy uciekają lub krzyżują się
RuchJedna ciągła akcjaSkok montażowy lub trzask ciała
TłoRozmycie pozostaje tłemLosowe twarze ostrzą się

Tabela listy kontrolnej audytu do oceny realistycznych twarzy w Wan 3.0

Lista kontrolna audytu realistycznych twarzy Wan 3.0 przedstawiona jako czysta tabela dla kontroli tożsamości, skóry, ust, oczu, ruchu i tła

Krok 5: tabela audytu realizmu twarzy, której możesz użyć przed wydaniem kolejnego uruchomienia.

Użyj tego szablonu wielokrotnego użytku, gdy tworzysz własny test:

Plain
1[proporcje], [czas trwania], realistyczne kinowe wideo. [Podmiot ze stabilnymi kotwicami tożsamości] w [konkretne ustawienie i oświetlenie]. [Widoczny łańcuch działań: co robią twarz, oczy, usta, dłonie i postawa]. Kamera: [wielkość ujęcia, odczucie obiektywu, ruch]. Audio: [tło pomieszczenia / dialog / atmosfera]. Zachowaj [twarz, odcień skóry, ubiór, rekwizyt, tło]. Unikaj [dryfu twarzy, woskowej skóry, zniekształconych oczu, złych zębów, skoków montażowych, dodatkowych palców].

Warianty realistycznych twarzy Wan 3.0 do wypróbowania

Wypróbuj je po przejściu 3 podstawowych testów:

WariantKrótki początek promptuCo testuje
Referencja założycielaZałożyciel w średnim wieku w cichym biurze wyjaśnia jeden wynik produktu w 8sWiarygodne UGC bez skóry z filtrem beauty
Ujęcie reakcji aktoraAktor słyszy zaskakującą wiadomość, uśmiech zanika w ciszęKontrola mikroekspresji
Ujęcie twarzy z przymiarką produktuOsoba zakłada okulary, szminkę lub kosmetyk, lekko się odwracającStabilność twarzy plus produktu
Wywiad dokumentalnyRęczne zbliżenie, naturalna skóra, miękkie tło, bez filtra glamRealistyczne niedoskonałości

Koszt realistycznych twarzy Wan 3.0 na Atlas Cloud

Użyj szybkiego wzoru:

koszt = sekundy x cena modelu za sekundę x poziom rozdzielczości, jeśli dotyczy

Od sierpnia 2026 roku Atlas Cloud models/all wymienia trzy tryby wideo Wan-3.0 od $0.05/sek. To daje podstawę do planowania:

TestCzas trwaniaDlaczego użyćSzacowany koszt minimalny
Szkic twarzy8sSzybkie sprawdzenie promptuOd $0.40
Klip reklamy UGC12sCięcie społecznościoweOd $0.60
Długie zbliżenie30sPełny test obciążeniowy Wan 3.0Od $1.50

W przypadku ostatecznej dostawy sprawdź widoczny koszt uruchomienia przed wysłaniem. 1080P może kosztować więcej niż podstawa na niektórych platformach lub poziomach, a przycisk Uruchom to to, co faktycznie zobaczy Twój portfel.

Uwaga prawna dotycząca realistycznych twarzy Wan 3.0

Używaj zgody w przypadku rzeczywistych pracowników, twórców, klientów i rozpoznawalnych podobieństw. Nie sugeruj, że prawdziwa osoba powiedziała coś, czego nie powiedziała. W przypadku reklam, referencji, roszczeń medycznych, finansowych lub treści politycznych zachowaj ścisłe ujawnienie i przegląd.

To jest odpowiedź dla dorosłych. Zabawna część to wciąż kreatywna reżyseria, ale odpowiedzialna część utrzymuje Cię w stanie publikacji.

Często zadawane pytania

Czy Wan 3.0 może tworzyć realistyczne twarze?

Tak, ale najlepsze wyniki pochodzą z ukierunkowanych promptów i silnych odniesień. Poproś o stabilne kotwice tożsamości, małe ruchy twarzy, wyraźne cele spojrzenia i konkretne ograniczenia awarii.

Dlaczego twarze czasami nadal wyglądają niepokojąco?

Ponieważ twarze ujawniają małe błędy. Kierunek oczu, zęby, kości policzkowe, synchronizacja warg i tekstura skóry muszą być jednocześnie spójne. Szeroki prompt, taki jak „smutna kobieta mówiąca”, pozostawia zbyt dużo miejsca na dryf.

Text-to-video czy image-to-video?

Użyj Text-to-video, gdy dowolny wiarygodny aktor jest w porządku. Użyj Image-to-video, gdy liczy się konkretna twarz, aktor marki, twórca lub pierwsza klatka.

Jaki jest najlepszy prompt Wan 3.0 dla mówiącej twarzy?

Najlepszy prompt opisuje jeden ciągły łańcuch działań: gdzie osoba patrzy, jak porusza się usta, co robią dłonie i co musi pozostać niezmienione. Następnie dodaj terminy unikania dla plastikowej skóry, zniekształconych oczu, złych zębów i morfingu twarzy.

Ile to kosztuje na Atlas Cloud?

Atlas Cloud models/all obecnie wymienia Wan-3.0 Text-to-video, Image-to-video i Reference-to-video od $0.05/sek. 8-sekundowy szkic zaczyna się od około $0.40, podczas gdy 30-sekundowy test obciążeniowy zaczyna się od około $1.50 przed ewentualnym wyższym poziomem rozdzielczości.

Czy mogę używać realistycznych twarzy Wan 3.0 w reklamach lub UGC?

Tak, przy normalnej dyscyplinie kreatywnej i prawnej. Używaj zgody w przypadku podobieństw, unikaj fałszywych referencji i oznaczaj syntetyczne UGC, jeśli wymagają tego zasady ujawniania lub polityka klienta.

Najnowsze modele

Jedno API do całej multimedialnej AI.

Przeglądaj wszystkie modele