Seedance 2.5 är nu live — Först på Atlas Cloud

Wan 3.0 Realistiska ansikten: 3 prompts som ser mänskliga ut

Wan 3.0 Realistic Faces: Promptar, inställningar, testbevis

Senaste uppdatering: Wan 3.0 är nu live sedan 24 augusti 2026.

AI-video bedöms först och främst efter ansiktet. Inte kamerarörelsen. Inte bakgrunden. Ansiktet.

Om ögonen flyter, huden blir vaxartad eller munnen börjar göra den där gummiliknande AI-grejen är rullningen över. Det är därför wan 3.0 realistiska ansikten är det verkliga produktionstestet för kreatörer som gör UGC-annonser, kortfilmer, vittnesmål och sociala klipp.

Det användbara svaret är enkelt: realistiska ansikten är inte en skönhetsinställning. De är ett regiproblem. Du behöver en stabil referens, små mänskliga handlingar, tydliga kameraregler och hårda begränsningar för misslyckanden.

Den här guiden använder Atlas Cloud som webbläsararbetsyta eftersom du kan testa Wan-3.0 Text-till-video, Bild-till-video och Referens-till-video på ett ställe, se körstatusen och kontrollera den synliga kostnaden innan du skickar in.

Viktiga slutsatser

  • Verklig ansiktskvalitet innebär identitet, hud, blick, mun och rörelsekontinuitet.
  • Bild-till-video är oftast säkrare när ett specifikt ansikte är viktigt.
  • Beskriv muskelrörelser och mikro-aktioner, inte bara känsloetiketter.
  • Använd 8-sekunders utkast innan du betalar för 24 eller 30 sekunders stresstester.
  • På Atlas Cloud börjar Wan-3.0-lägen från 0,05 USD/sek.

AI-videogenereringsgränssnitt som visar en gråtande student

Wan 3.0 realistiska ansikten – exempel med en närbild på en student, promptkort, genomförd körning och ansiktsstabilitetsbildrutor

Exempel: studentnärbilden använder ett ansikte, subtil mimik, blickrörelse och ett 30,07 sekunders handboksklipp för att stresstesta realistisk ansiktskontinuitet.

Fall 1 – rörelseprov: en ung svart kvinna i blå studentklänning håller en närbildsansiktsinsats genom ett 30,07 sekunders Wan 3.0-handboksklipp.

Varför Wan 3.0 Realistiska Ansikten är hett, och varför de flesta försök misslyckas

Dom först: ansikten misslyckas eftersom promptarna ber om en stämning när modellen behöver vägledning.

Wan 3.0 kom med en större duk: upp till 30 sekunders klipp, 1080P-utdata, inbyggd ljud-/bildgenerering och breda referensinmatningar. Alibabas lanseringsbevakning nämner också multimodal inmatning och visuell kontinuitet för mänskliga ansikten och mikro-uttryck (Alibaba Cloud Community, augusti 2026). Den officiella Model Studio-sidan beskriver lanseringen kring 30-sekunders berättande, 1080P-biografkvalitet, inbyggd audio/video och omni-referensinmatning (Alibaba Cloud Model Studio, augusti 2026).

Det låter enormt. Det är det.

Men kreatörsproblemet är mer praktiskt: "Kan den här personen blinka, prata, tveka och förbli samma person?"

Vanliga misslyckandemönster ser bekanta ut:

  • Ögondrift: blicken har inget tydligt mål.
  • Gummihud: porer försvinner och kinderna rör sig som silikon.
  • Bendrift: kindben och käkform ändras mellan bildrutor.
  • Falskt leende: munnen ler medan ögonen inte gör det.
  • Munflimmer: tänder och läppar pulserar under tal.
  • Kamera-utlöst identitetsförlust: ansiktet ändras efter en panorering eller vändning.

Det här är inte bara lanseringshyp. I äldre Wan-arbetsflöden har användare rapporterat ansiktsinkonsekvens och obehagliga resultat under bild-till-video-körningar, inklusive ansikten som inte längre överensstämmer med originalbilden (ComfyUI GitHub-diskussion, april 2025).

Frågan är: hur regisserar man runt det?

Wan 3.0 Realistiska Ansikten – Arbetsflödesöversikt på Atlas Cloud

Använd det enklaste läget som ger dig tillräcklig kontroll.

Om du inte har en referensperson, börja med Text-till-video. Om ett specifikt ansikte spelar roll, använd Bild-till-video med en stark första bildruta. Om du har identitet, rörelse och ljudreferenser, använd Referens-till-video.

Du kan börja från Atlas Cloud hemsida, öppna Wan 3.0-modellsidan, klistra in prompten, välj längd och upplösning, och kör testet i en webbläsarflik. Den praktiska vinsten är inte bara åtkomst. Det är att prompten, inställningarna, utdatapanelen och den angivna kostnaden förblir synliga medan du itererar.

BehovAtlas Cloud-modellVar du kör denAnvänd det förPris för att verifiera
Börja från ren promptWan-3.0 Text-till-videoWan 3.0 Text-till-video-lekplatsGenerisk skådespelare eller scenFrån 0,05 USD/sek
Animera en första bildrutaWan-3.0 Bild-till-videoSamma Wan 3.0-familj, Bild-till-video-lägeStabilt ansikte, porträtt-UGCFrån 0,05 USD/sek
Lås referenser över rörelseWan-3.0 Referens-till-videoSamma Wan 3.0-familj, Referens-till-video-lägeIdentitet, rörelse, röst, scenrefsFrån 0,05 USD/sek

Atlas Cloud modeller/alla listar för närvarande Wan-3.0 Text-till-video, Bild-till-video och Referens-till-video från 0,05 USD/SEK. Alibabas officiella sida visar också upplösningskänslig prissättning för sin egen plattform, så behandla den synliga körknappskostnaden som den slutgiltiga sanningen innan du skickar in.

Steg 1: Välj Wan 3.0 Realistiska Ansikten – Läge

Börja med det arbetsflöde som matchar din risk.

Inget referensansikte? Använd Text-till-video. Behöver du en stabil skådespelare? Använd Bild-till-video. Behöver du en känd identitet plus rörelse, röst eller ett tidigare klipp? Använd Referens-till-video.

Kopiera den här prompten när du bara behöver en snabb lägeskontroll:

Plain
116:9, 8 sekunder, realistisk filmisk närbild. En person sitter nära ett fönster i mjukt dagsljus och säger en kort mening med naturlig läpprörelse, små ögonförflyttningar och avslappnad andning. Behåll samma ansikte, hudton, hårfäste, klädsel, ljussättning och bakgrundsoskärpa under hela klippet. Undvik ansiktsdrift, vaxartad hud, förvrängda ögon, extra tänder, hoppklipp och bakgrundsansikten.

Inställningar att välja:

InställningRekommendationVarför det spelar roll
Bildformat16:9 för artikel-tester, 9:16 för vertikalt socialtAnsiktsstorlek och beskärning ändrar misslyckandet
Upplösning1080P för slutgiltig, 720P för utkast om det behövsHögre upplösning hjälper hud- och ögondetaljer
Längd8s utkast, 24s till 30s stresstestLånga tagningar avslöjar identitetsdrift
LjudRumsljud om inte tal är poängenHåller ansiktstestet fokuserat

Ingen efterföljande punkt?

Atlas Cloud Wan 3.0 realistiska ansikten – lägesinställningar med en genomförd körning och synlig utdatapanel

Steg 1: Atlas Cloud Wan 3.0 lägesinställningar, tagna efter en genomförd körning så att in- och utdata syns tillsammans.

Steg 2: Kör Fall 1, en Wan 3.0 Realistiska Ansikten – Närbild

Det här är den svåra.

En närbild tar bort alla gömställen. Tittaren kan se munvinklarna, ögonbrynsspänningen, blickmålet och hudstrukturen. Fall 1 använder ett Wan 3.0-handboksklipp av en ung svart kvinna i blå studentklänning, inramad i närbild, som talar tyst medan blicken sjunker.

Kopiera den här prompten:

Plain
116:9, 8 sekunder, realistisk filmisk närbild. En ung svart kvinna i blå studentklänning står i mjukt inomhusceremoniljus, inramad från huvud till övre bröstet. En andra person syns endast som en helt oskarp form på vänsterkanten. Hon talar tyst mot någon precis utanför bild, munnen rör sig naturligt, ögonbrynen dras ihop, ögonen något fuktiga men inte gråtande. Under tagningen sjunker blicken långsamt från ögonhöjd till händerna. Kameran är låst men har en svag handhållen andningssvaj. Naturlig hudstruktur, synliga porer, mjukt takljus, grunt skärpedjup. Bevara samma ansikte, samma klänning, samma hudton, samma ögonform och samma bakgrundsoskärpa under hela klippet. Undvik plastig hud, ändrade kindben, extra tänder, överdrivet leende, förvrängda ögon och hoppklipp.

Inställningar att välja:

InställningVälj
ModellWan-3.0 Bild-till-video om du har en första bildruta, annars Wan-3.0 Text-till-video
Längd8s för ett utkast, 30s för långtagningsbeviset
Upplösning1080P om tillgängligt, annars 720P
Bildformat16:09
LjudEndast rumsljud om inte dialog testas

AI-videogenereringsgränssnitt med inmatningsinställningar och genererad videoutdata

Wan 3.0 realistiska ansikten – fall 1 genomförd körningsskärmdump för en studentnärbildsprompt

Steg 2: Fall 1 – körningsbevis för studentnärbildens realistiska ansiktstest. Se exempelklippet ovan för fullständigt rörelsebevis.

Steg 3: Kör Fall 2, en Wan 3.0 Realistiska Ansikten – UGC-telefonsamtal

UGC-ansikten misslyckas annorlunda.

Tagningen är inte lika tajt som en skönhetsnärbild, men tal, handposition och mjukt fönsterljus kan snabbt avslöja ansiktsförvrängning. Det här fallet använder ett regnigt lägenhetstelefonsamtal: en ung kvinna sitter vid ett fönster, lyssnar, svarar och avslutar med ett litet halvt leende.

Kopiera den här prompten:

Plain
116:9, 8 sekunder, naturlig UGC-stil realistisk video. En ung kvinna med långt mörkt hår sitter vid ett träbord intill ett regnigt lägenhetsfönster och håller en smartphone mot örat. Neonskyltsljus suddas utanför glaset. Hon lyssnar, svarar sedan med låg lugn röst; läpparna rör sig mjukt, ögonen vandrar ner ett slag och hon ger ett litet halvt leende på slutet. Kameran är en stabil halvnärbild från andra sidan bordet, 50 mm-objektivkänsla, mjukt fönsterljus på ena sidan av ansiktet, varm praktisk lampa i bakgrunden. Behåll hennes ansikte, hårfäste, näsform, handposition, telefon, bord, fönsterregn och ljussättning konsekvent. Undvik överförskönad hud, vaxartade kinder, felaktig läpprörelse, ansiktsförvrängning, extra fingrar och bakgrundsansikten.

Inställningar att välja:

InställningVälj
ModellWan-3.0 Text-till-video för en generisk skådespelare, Bild-till-video för ett låst ansikte
Längd8s utkast
Upplösning1080P föredraget
Bildformat16:09
LjudInbyggt ljud på endast om du testar röst, annars mjukt regn och rumsljud

AI-videogenereringsgränssnitt som visar inmatningsinställningar och en genererad video

Wan 3.0 realistiska ansikten – fall 2 genomförd körningsskärmdump för ett regnigt fönster-telefonsamtal

Steg 3: Fall 2 – körningsbevis för det regniga telefonsamtalets ansiktstest.

Leende kvinna i ett telefonsamtal bredvid ett regnigt fönster

Fall 2 – rörelsebevis GIF för regnigt fönster-telefonsamtalets ansiktstest

Fall 2 – rörelsebevis GIF: det 15,04 sekunder långa Wan 3.0-handboksklippet testar tal, ögonrörelser, hand-till-telefon-konsistens och mjukt inomhusljus.

Steg 4: Kör Fall 3, en Wan 3.0 Realistiska Ansikten – Vertikalt socialt klipp

Nu krymper vi ansiktet.

Vertikala klipp är lömska. Ansiktet är mindre, men tittarna märker ändå om ögonen ändrar storlek, benen förvrängs eller spegelreflektionen blir en andra person. Det här fallet testar helkroppsrörelse med en spegel, klädseldetaljer och ett avslappnat leende.

Kopiera den här prompten:

Plain
19:16, 8 sekunder, realistisk vertikal social video. En ung kvinna i vit broderad blus, vit veckad kjol, svart bälte och vita platta sneakers står framför en ren helkroppsspegel i en mjukt belyst lägenhet. Hon justerar en ärm, flyttar vikten naturligt, tittar från spegeln till kameran och ger ett litet avslappnat leende. Helkroppsinramning, fast stabil kamera, naturligt dagsljus, inget tungt skönhetsfilter, realistisk tygstruktur och kroppsproportioner. Behåll samma ansikte, samma klädsel, samma frisyr, samma spegelposition och samma rumslayout under hela tagningen. Undvik ansiktsdrift, docklik hud, förändrad ögonstorlek, förvrängda ben, extra reflektioner och hoppklipp.

Inställningar att välja:

InställningVälj
ModellWan-3.0 Text-till-video eller Bild-till-video
Längd8s utkast
Upplösning1080P föredraget
Bildformat9:16
LjudIngen musik, endast mjukt rumsljud

AI-videogenereringsgränssnitt som visar en textprompt och genererad video

Wan 3.0 realistiska ansikten – fall 3 genomförd körningsskärmdump för ett vertikalt mode-spegelklipp

Steg 4: Fall 3 – körningsbevis för det vertikala helkropps-ansiktskonsistenstestet.

Kvinna i vit broderad skjorta och veckad kjol i ett kök

Fall 3 – rörelsebevis GIF för vertikal mode-ansiktskonsistens

Fall 3 – rörelsebevis GIF: det 15,04 sekunder långa Wan 3.0-handboksklippet kontrollerar om ett mindre ansikte förblir stabilt medan kroppen, klädseln och spegeln förblir sammanhängande.

Steg 5: Granska Wan 3.0 Realistiska Ansikten innan du genererar igen

Generera inte om bara för att klippet "känns fel". Namnge felet först.

Den här checklistan håller granskningen objektiv:

KontrollGodkänt signalGenerera om ifall
IdentitetSamma ögonavstånd, näsa, kindbenAnsiktet ser ut som en ny person
HudPorer och mjuk textur finns kvarVax, plast, överutjämnad
MunTal känns litet och mänskligtKäk som gummi eller tänder flimrar
ÖgonBlicken har ett tydligt målÖgonen flyter eller korsar
RörelseEn kontinuerlig handlingHoppklipp eller kroppssnärt
BakgrundOskärpa förblir bakgrundSlumpmässiga ansikten skärps

Granskningschecklista för att utvärdera realistiska ansikten i Wan 3.0

Wan 3.0 realistiska ansikten – granskningschecklista renderad som en ren tabell för identitets-, hud-, mun-, ögon-, rörelse- och bakgrundskontroller

Steg 5: en ansiktsrealismgranskningstabell du kan använda innan du lägger på en ny körning.

Använd den här återanvändbara mallen när du bygger dina egna test:

Plain
1[bildformat], [längd], realistisk filmisk video. [Subjekt med stabila identitetsankare] i [specifik miljö och ljussättning]. [Synlig handlingskedja: vad ansiktet, ögonen, munnen, händerna och hållningen gör]. Kamera: [bildstorlek, objektivkänsla, rörelse]. Ljud: [rumsljud / dialog / atmosfär]. Bevara [ansikte, hudton, klädsel, rekvisita, bakgrund]. Undvik [ansiktsdrift, vaxartad hud, förvrängda ögon, dåliga tänder, hoppklipp, extra fingrar].

Wan 3.0 Realistiska Ansikten – Variationer att prova

Prova dessa efter att de tre kärntesten är godkända:

VariationKort promptstartareVad det testar
GrundarvittnesmålMedelålders grundare i ett lugnt kontor förklarar en produktresultat på 8sTrovärdig UGC utan skönhetsfilter-hud
SkådespelarreaktionstagningSkådespelare hör överraskande nyheter, leende bleknar till tystnadMikro-uttryckskontroll
ProduktprovningsansiktstagningPerson applicerar glasögon, läppstift eller hudvård medan de vänder sig lättAnsikte plus produktstabilitet
DokumentärintervjuHandhållen närbild, naturlig hud, mjuk bakgrund, inget glamfilterRealistisk ofullkomlighet

Wan 3.0 Realistiska Ansikten – Kostnad på Atlas Cloud

Använd den snabba formeln:

kostnad = sekunder x modellpris per sekund x upplösningsnivå om tillämpligt

Från och med augusti 2026 listar Atlas Cloud modeller/alla de tre Wan-3.0-videolägena från 0,05 USD/sek. Det ger dig en planeringsgrund:

TestLängdVarför använda detBeräknad grund
Ansiktsutkast8sSnabb promptkontrollFrån 0,40 USD
UGC-annonsklipp12sSocial klippFrån 0,60 USD
Lång närbild30sFullt Wan 3.0-stresstestFrån 1,50 USD

För slutleverans, kontrollera den synliga körkostnaden innan du skickar in. 1080P kan kosta mer än grunden på vissa plattformar eller nivåer, och Kör-knappen är vad din plånbok faktiskt kommer att se.

Juridisk notering för Wan 3.0 Realistiska Ansikten

Använd samtycke för riktiga anställda, kreatörer, kunder och igenkännliga likheter. Antyd inte att en verklig person har sagt något de inte har sagt. För annonser, vittnesmål, medicinska påståenden, finansiella påståenden eller politiskt innehåll, håll noggrann märkning och granskning.

Det är det vuxna svaret. Den roliga delen är fortfarande kreativ regi, men den ansvarsfulla delen håller dig publiceringsbar.

Vanliga frågor

Kan Wan 3.0 skapa realistiska ansikten?

Ja, men de bästa resultaten kommer från riktade promptar och starka referenser. Be om stabila identitetsankare, små ansiktsrörelser, tydliga blickmål och specifika begränsningar för misslyckande.

Varför ser ansikten fortfarande ibland obehagliga ut?

För att ansikten avslöjar små fel. Ögonriktning, tänder, kindben, läpptiming och hudstruktur måste alla vara sammanhängande samtidigt. En bred prompt som "ledsen kvinna som talar" lämnar för mycket utrymme för drift.

Text-till-video eller bild-till-video?

Använd Text-till-video när vilken trovärdig skådespelare som helst duger. Använd Bild-till-video när ett specifikt ansikte, varumärkesskådespelare, kreatör eller första bildruta är viktigt.

Vad är bästa Wan 3.0-prompten för ett talande ansikte?

Den bästa prompten beskriver en kontinuerlig handlingskedja: var personen tittar, hur munnen rör sig, vad händerna gör och vad som måste förbli oförändrat. Lägg sedan till undvik-termer för plastig hud, förvrängda ögon, dåliga tänder och ansiktsförvrängning.

Hur mycket kostar det på Atlas Cloud?

Atlas Cloud modeller/alla listar för närvarande Wan-3.0 Text-till-video, Bild-till-video och Referens-till-video från 0,05 USD/sek. Ett 8s utkast börjar från cirka 0,40 USD, medan ett 30s stresstest börjar från cirka 1,50 USD före eventuell högre upplösningsnivå.

Kan jag använda Wan 3.0 realistiska ansikten för annonser eller UGC?

Ja, med normal kreativ och juridisk disciplin. Använd samtycke för likheter, undvik falska vittnesmål och märk syntetisk UGC där märkningsregler eller klientpolicy kräver det.

Senaste modellerna

Ett API för all media-AI.

Utforska alla modeller