Consistência Multi-Shot do Wan 3.0: Contei Todos os Cortes em 110 Clipes Oficiais
Escreveu um guião de quatro shots. O Shot 1 sai na perfeição: chapéu de palha, colar de contas pretas, vestido de linho branco, luz exatamente certa. O Shot 2 chega e é uma mulher diferente num chapéu diferente.
Essa lacuna é a razão pela qual toda a gente está a olhar para a consistência multi-shot do Wan 3.0, a promessa de um prompt, seis shots, trinta segundos, a mesma personagem do início ao fim.
Por isso, parei de ler especificações. Descarreguei todos os 110 ficheiros de demonstração que a Alibaba publicou com o seu próprio manual do criador do Wan 3.0, executei ffmpeg em cada um, analisei todos os 64 prompts emparelhados e depois fiz o que ninguém nos resultados de pesquisa fez: contei os cortes reais nos vídeos entregues e comparei-os com o número de shots que cada prompt pedia.
Três descobertas contradizem o que lerá em todo o lado.

Suite de correção de cor cinematográfica onde uma parede de monitores mostra a mesma personagem de chapéu de palha mantida em seis shots diferentes, o ponto de referência para a consistência multi-shot do Wan 3.0
A parede de referência de um colorista é o modelo mental honesto para a consistência multi-shot: uma identidade, seis enquadramentos, verificados lado a lado. Gerado com openai/gpt-image-2.
Principais conclusões
- 6 shots é real, mas não garantido: 3 dos próprios prompts multi-shot da Alibaba atingiram exatamente o número declarado, 2 ficaram aquém.
- O pior caso pedia 4 shots e renderizou 2.
- Nada de 4K. Nenhum dos 110 ficheiros oficiais excede 1080p, e apenas 4 são exatamente 1920x1080.
- Os adereços e a câmara derivam antes dos rostos. Observe o chapéu, não os olhos.
- Ainda não existe API pública do Wan 3.0 fora da própria plataforma da Alibaba, por isso o tutorial abaixo reconstrói o processo em modelos que pode usar hoje.
Aqui está o melhor resultado, do próprio manual da Alibaba. Seis shots declarados no prompt, seis shots entregues, as mesmas duas personagens, o mesmo guarda-roupa, a mesma chuva:

Sequência anime de seis shots numa plataforma de comboio chuvosa, a mesma rapariga com um guarda-chuva transparente e o rapaz com uma mochila caqui mantidos consistentemente em cada corte
Demo beta oficial do Wan 3.0 da Alibaba (clipe do manual v013, 1280x720, 20.05s). O prompt numerava os shots 1 a 6; o ffmpeg encontra exatamente 5 cortes duros, pelo que todos os 6 shots foram entregues. Não gerado pela Atlas Cloud.
O Que É Realmente a Consistência Multi-Shot do Wan 3.0
Versão curta: são três promessas separadas com um nome, e a Alibaba é invulgarmente específica sobre quais são.
No seu artigo de lançamento, a Alibaba divide a consistência em personagens ("traços faciais, penteado e cor do cabelo, forma do corpo, vestuário e acessórios"), adereços ("aparência multi-ângulo, estrutura do hardware, logótipos e detalhes do material") e espaço ("bloqueio da personagem e perspetiva da câmara") (Alibaba Cloud, 2026). Essa divisão em três camadas é a grelha de classificação para tudo o que se segue. Mesmo rosto, colar errado, é falha.
O modelo gera até 30 segundos num único trabalho, a 480P, 720P ou 1080P (Alibaba Cloud, 2026).
Agora a parte que os resultados de pesquisa erram.
| Afirmação comum nos resultados de pesquisa | O que o material de primeira parte mostra realmente |
|---|---|
| "Geração nativa 4K" | O post oficial lista apenas 480P / 720P / 1080P. Em 110 ficheiros de demonstração oficiais, nada excede 1080p, e apenas 4 ficheiros são exatamente 1920x1080. O resultado "1080p" paisagem habitual é 1920x1072. |
| "Até 6 shots independentes por geração" | Nenhuma especificação de número de shots aparece no post de lançamento da própria Alibaba. Empiricamente, aguenta-se: de 8 prompts explicitamente multi-shot no manual, o máximo que algum declara é 6, e dois deles entregaram 6. |
| "Até 12 imagens de referência" | Testes práticos relatam até 10 imagens mais 5 clipes de vídeo mais 5 clipes de áudio (Curious Refuge, 2026). O post da Alibaba não dá nenhum número. |
| "Pesos abertos, Apache-2.0" | Lançamentos anteriores do Wan tinham pesos abertos; o Wan 3.0 é fornecido como um serviço de plataforma e não surgiram pesos (Curious Refuge, 2026). |
| "A API já saiu" | Funciona no Alibaba Cloud Model Studio. Plataformas de inferência de terceiros ainda não a têm. |
E esta é a tabela que demorou mais tempo a construir. Cada número é meu, a partir da deteção de cena do ffmpeg no ficheiro entregue versus o número de shots escrito no prompt emparelhado:
| Demonstração oficial | Prompt declara | Cortes duros encontrados | Shots entregues | Veredito |
|---|---|---|---|---|
| v013 plataforma chuvosa, anime | 6 shots | 5 | 6 | Exato |
| v055 diário golden retriever | 6 shots, 30,0s | 5 | 6 | Exato |
| v021 loja de ramen e gatinho | 4 shots | 3 | 4 | Exato |
| v008 lago da floresta, 3D | 4 shots | 2 | 3 | Falta um |
| v085 mulher de chapéu de palha | 4 shots | 1 | 2 | Metade |
| v041 corredor para beco mágico | 3 segmentos, "sem corte duro" | 0 | 1 take contínuo | Exatamente como pedido |
| v045, v084, v102 | 3 / 5 / multi-sujeito | Demasiados para resolver | Não contável | Corte rápido e estroboscopia de tinta aguada impedem deteção |
Leia as linhas do meio novamente. Três prompts atingiram o número exato. Dois não. O número de shots que escreve é um pedido, não um contrato.
Porque É Que a Consistência Multi-Shot do Wan 3.0 Falha: 4 Modos de Falha
Veredito primeiro: raramente falha no rosto. Falha nos objetos e na câmara, e falha mais quando altera várias coisas ao mesmo tempo.
Aqui está o clipe que mais me ensinou, porque é o pior desempenho na própria mostra da Alibaba.
GtZy2TUK4ak
Demo beta oficial do Wan 3.0 da Alibaba (clipe do manual v085, 1240x742, 30.08s). O prompt descreve quatro shots com marcação temporal. O ffmpeg encontra um corte real, aos 9,3s. Os shots 3 e 4 colapsam num único take mantido que desvanece para preto. Não gerado pela Atlas Cloud.
Modo de falha 1: os adereços derivam antes dos rostos. Nesse clipe, olhe apenas para o take de abertura, antes de qualquer corte acontecer. Aos 0,6s, o chapéu de palha tem uma fita preta fina e o pingente é uma pedra azul facetada. Aos 9,2s, a fita é uma larga fita preta e o pingente é uma gota preta brilhante e lisa. O rosto dela está estável o tempo todo. Os acessórios não.

Dois frames do mesmo take contínuo de nove segundos, lado a lado, mostrando a fita do chapéu a alargar e o pingente do colar a mudar de forma e cor
Ambos os frames provêm do mesmo take ininterrupto da demonstração oficial v085, com 8,6 segundos de diferença, sem corte entre eles. A fita do chapéu e o pingente mudam ambos. Esta é a camada dos adereços a falhar enquanto a camada da personagem se mantém.
É por isso que o teste de aceitação que realmente funciona é uma lista de verificação de adereços, não uma verificação de ambiente. Para esta personagem são três itens: forma e fita do chapéu, colar de contas e pingente, decote do vestido.
Modo de falha 2: cenas multi-sujeito mantêm-se individualmente e borram-se no contacto. Cada personagem permanece reconhecível sozinha. Coloque-as juntas no frame, a interagir, e as identidades sangram. Testes independentes encontraram o mesmo: "A consistência da personagem começou a quebrar-se, e a composição parecia ocasionalmente mais um efeito de ecrã verde mau do que um ambiente gerado naturalmente", com a sincronização labial apontada como a maior fraqueza (Curious Refuge, 2026).
Modo de falha 3: mudou quatro variáveis numa linha. Nova localização mais novo ângulo de câmara mais nova iluminação mais novo estado do guarda-roupa é a forma fiável de perder uma identidade. Os próprios prompts do manual combatem isto reafirmando a roupa completa em cada segmento. Nos 64 prompts emparelhados, 9 dizem explicitamente "permanece inalterado", 5 fixam a posição da câmara e 4 exigem que a personagem se mantenha idêntica.
Modo de falha 4: 30 segundos num trabalho não são 30 segundos de um shot. São produtos diferentes. Um trabalho multi-shot de 30s corta entre enquadramentos. Se o que quer é um take contínuo ininterrupto, encadear continuações degrada-se: o erro de identidade acumula-se em cada passagem, pelo que o take único limpo é curto por natureza.
O manual tem exatamente um prompt que acerta na perfeição, e vale a pena copiar a estrutura da frase:

Três segmentos de prompt renderizados como um único take contínuo ininterrupto, de um corredor de apartamento através de uma porta para um beco gótico iluminado por candeeiros
Demo beta oficial do Wan 3.0 da Alibaba (clipe do manual v041, 720x1280, 15.04s). Três segmentos de prompt, e o ffmpeg encontra zero cortes duros, que é exatamente o que o prompt pedia. Não gerado pela Atlas Cloud.
A sua linha de transição, traduzida, é a coisa mais reutilizável em todo o manual: continuar perfeitamente a partir do último frame do segmento anterior; a personagem, o guarda-roupa, a localização e a posição da câmara permanecem completamente idênticos; sem corte duro e sem transição abrupta de cena. Apenas um prompt em 64 a usa. Roube-a.
O Fluxo de Trabalho de Consistência Multi-Shot Que Pode Executar Hoje
A questão é: onde é que realmente executa isto?
Atualmente, o Wan 3.0 vive no Model Studio da própria Alibaba. Nenhuma plataforma de inferência de terceiros o aloja. Na Atlas Cloud aparece apenas como uma entrada "em breve" com zero endpoints ativos, que é o estado honesto das coisas e vale a pena dizer claramente em vez de fingir o contrário.
Portanto, tem duas opções: esperar, ou parar de pedir a um prompt que faça seis coisas.
A segunda opção é melhor de qualquer maneira, e a minha contagem de cortes é o argumento para isso. Um único trabalho multi-shot deu-lhe uma contagem de shots que falhou por metade na própria mostra da Alibaba. Dividir o trabalho coloca esse controlo de volta nas suas mãos:
- Fixe o aspeto uma vez, como uma imagem estática.
- Clone essa identidade num frame-chave por shot, mudando exatamente uma variável de cada vez.
- Anime cada shot separadamente com a referência fixada.
- Junte localmente.
Mais lento de configurar, drasticamente mais previsível. E cada modelo na cadeia pode ser usado hoje.
| Passo | Modelo | Papel na cadeia | Preço listado |
|---|---|---|---|
| 1 | bytedance/seedream-v5.0-pro/text-to-image | Fixar o aspeto da personagem | $0,045 / imagem |
| 2 | google/nano-banana-2/edit | Clonar identidade no frame-chave de cada shot | $0,08 / imagem |
| 3 | alibaba/wan-2.7/reference-to-video | Animar cada shot com a referência fixada | $0,10 / segundo |
| Alt | alibaba/wan-2.7/text-to-video | Um prompt, muitos shots (menos controlável) | $0,10 / segundo |
| Fix | alibaba/wan-2.7/video-edit | Reparar um adereço errado sem regenerar | $0,10 / segundo |
Vale a pena saber para a pergunta "melhor modelo para consistência multi-shot": referência-para-vídeo é agora uma categoria inteira. bytedance/seedance-2.0-fast/reference-to-video custa $0,072/s (20% de desconto sobre $0,09, a partir de agosto de 2026), kwaivgi/kling-video-o3-pro/reference-to-video $0,095/s (15% de desconto sobre $0,112), minimax/h3/reference-to-video $0,10/s, e google/veo3.1/reference-to-video $0,20/s. Todos os preços verificados no catálogo ativo em 21 de agosto de 2026.
Um aviso antes dos passos: os preços listados são um piso, não uma cotação. A resolução e a duração alteram o número real, por isso leia o botão "Run" antes de se comprometer.
Como Construir Consistência Multi-Shot ao Estilo Wan 3.0, Passo a Passo
Estamos a reconstruir a exata folha de batida que o próprio modelo da Alibaba falhou: a mulher de chapéu de palha, quatro shots, jardim para carro. Mesmo guião, controlo por shot, e desta vez obtém quatro shots porque renderizou quatro.
Vamos começar.
Passo 1: fixe o aspeto. Uma imagem torna-se a âncora de identidade para tudo a jusante. Gere-a no Seedream v5.0 Pro, 16:9, na resolução mais alta que a página oferecer. Nomeie os três adereços de verificação explicitamente, porque são esses que derivam.
plaintext135mm film still, vintage sunlit rose garden. An elegant young woman wearing a 2natural straw boater hat with a black band, a black beaded necklace with a single 3teardrop pendant, and a white sleeveless linen dress. She stands before a wall of 4blooming pink and cream roses, one hand lightly touching the brim of her hat, 5gentle and thoughtful gaze just off camera. Soft warm natural light, dappled sun 6flare, shallow depth of field, fine film grain, medium close-up.

Playground do Seedream v5.0 Pro na Atlas Cloud com o prompt do chapéu de palha inserido e o frame-chave da personagem terminado renderizado no painel de saída
Passo 1 concluído: a âncora de identidade para toda a sequência de quatro shots.
Passo 2: clone a identidade nos shots 2 a 4. Um frame-chave por shot, uma execução cada, usando o Nano Banana 2 Edit com a saída do Passo 1 como referência. A disciplina que importa: reafirme o guarda-roupa completo sempre, depois mude exatamente uma coisa.
Shot 2, a viragem emocional:
plaintext1Keep the exact same woman from the reference image: identical face, identical 2natural straw boater hat with black band, identical black beaded necklace with a 3teardrop pendant, identical white sleeveless linen dress. New shot: cinematic 4close-up, she slowly lifts the straw hat off her head and lowers her chin, a faint 5wistful expression. Same rose garden background. Strictly preserve the same 6lighting, skin tone, film grain and colour grade as the reference.
Shot 3, o corte para o carro:
plaintext1Keep the exact same woman from the reference image: identical face, identical black 2beaded necklace with a teardrop pendant, identical white sleeveless linen dress, 3the straw boater hat now resting on her lap. New shot: back seat of a moving car, 4side profile, her hand propped against the door, gazing out a rain-beaded window, 5blurred green foliage rushing past. Overcast light with a warm interior fill, 6shallow depth of field, elegant melancholy. Strictly preserve the same face, the 7same colour grade and the same 35mm film grain as the reference.
Shot 4, o último olhar:
plaintext1Keep the exact same woman from the reference image: identical face, identical black 2beaded necklace with a teardrop pendant. New shot: extreme facial close-up beside 3the car window, eyes slowly closing, a calm and released expression. Raindrops 4slide down the glass in front of her, focus shifting onto the droplets, background 5falling into bokeh. Wong Kar-wai style cinematic mood, fine film grain. Strictly 6preserve the same face, the same lighting and the same colour grade as the 7reference.

Playground do Nano Banana 2 Edit na Atlas Cloud com o frame-chave do Passo 1 carregado como referência e o frame-chave do shot 2 renderizado, identidade e guarda-roupa mantidos
Passo 2 concluído: frame-chave do shot 2, mesma mulher, chapéu agora nas mãos dela.
Passo 3: anime o shot 1 com a referência fixada. Agora cada shot torna-se vídeo independentemente no Wan 2.7 reference-to-video. Definições: 720P, 5 segundos, e coloque o frame-chave do Passo 1 no slot "Images". Verifique a cotação do botão "Run" antes de o executar.
plaintext1Shot 1 of 4. Reference image 1 defines the character: keep the same face, the same 2natural straw boater hat with black band, the same black beaded necklace with a 3teardrop pendant and the same white sleeveless linen dress identical for the entire 4clip. 35mm film look, vintage sunlit rose garden. The woman lightly touches the 5brim of her hat as a soft breeze lifts strands of her hair; the camera pushes in 6very slowly. Warm natural light, dappled sun flare, shallow depth of field, fine 7film grain. The camera position stays stable. No hard cut and no scene change.

Playground do Wan 2.7 reference-to-video na Atlas Cloud com o frame-chave no slot "Images" e o clipe de cinco segundos terminado a reproduzir-se no painel de saída
Passo 3 concluído: o clipe com referência fixada renderizado no painel de saída.
E aqui está o que saiu:

Clipe de cinco segundos com referência fixada da mulher de chapéu de palha no roseiral, fita do chapéu e colar mantendo-se estáveis durante todo o tempo
Nossa própria execução na Atlas Cloud, não uma demonstração da Alibaba. Mostrado como GIF silencioso; o ficheiro entregue tem uma faixa de áudio.
Passo 4: encadeie os shots 2 a 4, depois junte. Repita o Passo 3 para cada frame-chave restante e cole a frase de transição do manual no topo de cada prompt seguinte:
plaintext1Continue seamlessly from the last frame of the previous segment. The character, 2the wardrobe, the location and the camera position stay completely identical. 3No hard cut and no abrupt scene transition.
Depois concatene localmente com ffmpeg e execute a verificação de aceitação de três pontos: forma e fita do chapéu, colar de contas e pingente, e se a progressão de enquadramento entre os shots faz realmente sentido. Se exatamente um adereço estiver errado num shot, não regenere o shot. Envie-o através do wan-2.7/video-edit e altere apenas isso, tomando emprestada a frase do manual: mantenha as ações, o guarda-roupa e o resto do frame inalterados.
Variações: Cenas Multi-Sujeito e Bloqueios de Estilo
Três padrões do manual que vale a pena roubar.
Cartões de personagem para shots multi-sujeito. Quando duas ou mais pessoas partilham o frame, os prompts oficiais atribuem cartões de personagem com letras e reafirmam a roupa completa de cada uma em cada segmento. Verboso, feio, e funciona melhor do que pronomes.
Declaração de estilo global para trabalhos estilizados. Tinta aguada, animação cel e outros estilos pesados precisam que o estilo seja fixado uma vez para toda a peça, depois uma folha de batida com marcação temporal por baixo.

Sequência de artes marciais em tinta aguada com um espadachim num bosque de bambu, estilo bloqueado numa luta de cinco batidas com marcação temporal
Demo beta oficial do Wan 3.0 da Alibaba (clipe do manual v084, 20.05s, cortado). Cinco batidas com marcação temporal sob uma declaração de estilo global em tinta aguada. O trabalho de pincel estroboscópico é a razão pela qual a deteção automática de cortes não consegue contar este. Não gerado pela Atlas Cloud.
Corrija, não regenere. Uma passagem de video-edit num adereço errado é mais barata do que uma nova renderização e não pode partir os shots que já estavam certos.
Quanto Custa uma Sequência de Quatro Shots
Números concretos para a sequência construída acima, às taxas listadas:
- 1 âncora de identidade no Seedream v5.0 Pro: $0,045
- 3 frames-chave de shot no Nano Banana 2 Edit: 3 x $0,08 = $0,24
- 4 clipes de 5s, 720P, no Wan 2.7 reference-to-video: 20s x $0,10 = $2,00
- Total: cerca de $2,29 para uma sequência de 20 segundos, quatro shots, com identidade fixada
Estenda para uma peça de seis shots e 30 segundos e a linha de vídeo passa a $3,00, chegando perto de $3,44 no total.
Duas ressalvas honestas. Primeiro, os preços listados são um piso: os níveis de resolução e a duração alteram o custo real, e a cotação do próprio playground no botão "Run" é o único número que vincula, que é a razão pela qual as capturas de ecrã acima importam mais do que esta lista. Segundo, no próprio Wan 3.0, a Alibaba precifica a geração de vídeo do Model Studio por segundo por nível de resolução, mas não consegui confirmar as taxas exatas por segundo do Wan 3.0 a partir de uma página de primeira parte, por isso não estou a citar números que não pude verificar.
Vale a pena notar o que está a comprar com a abordagem de trabalho dividido: não um preço mais baixo, mas uma contagem de shots que corresponde ao seu guião. Com base na evidência da própria mostra da Alibaba, isso não é algo que um único trabalho de 30 segundos lhe possa prometer ainda, e é a resposta prática para a consistência multi-shot do Wan 3.0 até a API abrir.
Perguntas Frequentes
Quantos shots consegue o Wan 3.0 manter consistentes numa geração?
Seis, com base na evidência atual, com uma ressalva. O post de lançamento da Alibaba não publica nenhuma especificação de número de shots. Nos 8 prompts explicitamente multi-shot do seu manual oficial, o máximo que algum declara é 6, e dois deles entregaram exatamente 6 shots verificados por corte. Trate 6 como um teto observado, não uma garantia.
O Wan 3.0 gera realmente 4K nativo?
Não. O post oficial lista apenas 480P, 720P e 1080P. Em todos os 110 ficheiros de demonstração oficiais, nada excede 1080p, apenas 4 ficheiros são exatamente 1920x1080, e a saída paisagem comum é 1920x1072. As taxas de fotogramas dividem-se em 24fps para 63 ficheiros e 30fps para 46.
A API do Wan 3.0 está disponível, e onde posso executá-la?
Funciona no Alibaba Cloud Model Studio. Nenhuma plataforma de inferência de terceiros a aloja ainda; a Atlas Cloud lista-a como uma entrada "em breve" sem endpoints ativos. Se precisar de saída multi-shot esta semana, a cadeia de referência-para-vídeo do Wan 2.7 acima é o substituto funcional.
Porque é que as minhas personagens ainda mudam entre shots mesmo com uma imagem de referência?
Geralmente porque um prompt mudou a localização, o ângulo da câmara e a iluminação simultaneamente. Mude uma variável por shot e reafirme o guarda-roupa completo em cada prompt. Verifique também as coisas certas: na própria demonstração da Alibaba, o rosto manteve-se estável enquanto a fita do chapéu e o pingente do colar mudaram ambos dentro de um único take ininterrupto.
Os pesos do Wan 3.0 são open source?
Nenhuns pesos foram lançados. Versões anteriores do Wan eram descarregáveis e executáveis localmente, enquanto o Wan 3.0 é fornecido como um serviço de plataforma alojado. Qualquer pessoa que cite uma licença Apache-2.0 para o Wan 3.0 está a repetir algo sem fonte de primeira parte por trás.
Qual é a forma mais rápida de obter consistência multi-shot sem acesso ao Wan 3.0?
Quatro movimentos: fixe uma imagem de identidade, clone-a num frame-chave por shot mudando uma única variável de cada vez, anime cada shot com referência-para-vídeo, depois junte localmente e verifique os seus adereços. Cerca de $2,29 e aproximadamente meia hora para uma sequência de quatro shots.
Metodologia: todos os 110 ficheiros de demonstração e 64 prompts emparelhados provêm do manual oficial do criador do Wan 3.0 da Alibaba, arquivado localmente a 11 de agosto de 2026. Os metadados foram lidos ficheiro a ficheiro com ffmpeg; as contagens de shots provêm da deteção de mudança de cena do ffmpeg com um limiar de 0,2, verificadas com frames extraídos; a estrutura dos prompts foi analisada programaticamente. Os preços da Atlas Cloud foram verificados no catálogo de modelos ativo em 21 de agosto de 2026.
Fontes: Alibaba Cloud (agosto de 2026); Curious Refuge (2026).






