Seedance 2.5 já está disponível — Primeiro na Atlas Cloud

Wan 3.0 Multi-Shot Consistency: Contei Cada Corte em 110 Clipes Oficiais

Wan 3.0 Multi-Shot Consistency: Eu contei todos os 110 clipes

Consistência Multi-Shot do Wan 3.0: Contei Todos os Cortes em 110 Clipes Oficiais

Escreveu um guião de quatro shots. O Shot 1 sai na perfeição: chapéu de palha, colar de contas pretas, vestido de linho branco, luz exatamente certa. O Shot 2 chega e é uma mulher diferente num chapéu diferente.

Essa lacuna é a razão pela qual toda a gente está a olhar para a consistência multi-shot do Wan 3.0, a promessa de um prompt, seis shots, trinta segundos, a mesma personagem do início ao fim.

Por isso, parei de ler especificações. Descarreguei todos os 110 ficheiros de demonstração que a Alibaba publicou com o seu próprio manual do criador do Wan 3.0, executei ffmpeg em cada um, analisei todos os 64 prompts emparelhados e depois fiz o que ninguém nos resultados de pesquisa fez: contei os cortes reais nos vídeos entregues e comparei-os com o número de shots que cada prompt pedia.

Três descobertas contradizem o que lerá em todo o lado.

Suite de correção de cor cinematográfica onde uma parede de monitores mostra a mesma personagem de chapéu de palha mantida em seis shots diferentes, o ponto de referência para a consistência multi-shot do Wan 3.0

A parede de referência de um colorista é o modelo mental honesto para a consistência multi-shot: uma identidade, seis enquadramentos, verificados lado a lado. Gerado com openai/gpt-image-2.

Principais conclusões

  • 6 shots é real, mas não garantido: 3 dos próprios prompts multi-shot da Alibaba atingiram exatamente o número declarado, 2 ficaram aquém.
  • O pior caso pedia 4 shots e renderizou 2.
  • Nada de 4K. Nenhum dos 110 ficheiros oficiais excede 1080p, e apenas 4 são exatamente 1920x1080.
  • Os adereços e a câmara derivam antes dos rostos. Observe o chapéu, não os olhos.
  • Ainda não existe API pública do Wan 3.0 fora da própria plataforma da Alibaba, por isso o tutorial abaixo reconstrói o processo em modelos que pode usar hoje.

Aqui está o melhor resultado, do próprio manual da Alibaba. Seis shots declarados no prompt, seis shots entregues, as mesmas duas personagens, o mesmo guarda-roupa, a mesma chuva:

Sequência anime de seis shots numa plataforma de comboio chuvosa, a mesma rapariga com um guarda-chuva transparente e o rapaz com uma mochila caqui mantidos consistentemente em cada corte

Demo beta oficial do Wan 3.0 da Alibaba (clipe do manual v013, 1280x720, 20.05s). O prompt numerava os shots 1 a 6; o ffmpeg encontra exatamente 5 cortes duros, pelo que todos os 6 shots foram entregues. Não gerado pela Atlas Cloud.

O Que É Realmente a Consistência Multi-Shot do Wan 3.0

Versão curta: são três promessas separadas com um nome, e a Alibaba é invulgarmente específica sobre quais são.

No seu artigo de lançamento, a Alibaba divide a consistência em personagens ("traços faciais, penteado e cor do cabelo, forma do corpo, vestuário e acessórios"), adereços ("aparência multi-ângulo, estrutura do hardware, logótipos e detalhes do material") e espaço ("bloqueio da personagem e perspetiva da câmara") (Alibaba Cloud, 2026). Essa divisão em três camadas é a grelha de classificação para tudo o que se segue. Mesmo rosto, colar errado, é falha.

O modelo gera até 30 segundos num único trabalho, a 480P, 720P ou 1080P (Alibaba Cloud, 2026).

Agora a parte que os resultados de pesquisa erram.

Afirmação comum nos resultados de pesquisaO que o material de primeira parte mostra realmente
"Geração nativa 4K"O post oficial lista apenas 480P / 720P / 1080P. Em 110 ficheiros de demonstração oficiais, nada excede 1080p, e apenas 4 ficheiros são exatamente 1920x1080. O resultado "1080p" paisagem habitual é 1920x1072.
"Até 6 shots independentes por geração"Nenhuma especificação de número de shots aparece no post de lançamento da própria Alibaba. Empiricamente, aguenta-se: de 8 prompts explicitamente multi-shot no manual, o máximo que algum declara é 6, e dois deles entregaram 6.
"Até 12 imagens de referência"Testes práticos relatam até 10 imagens mais 5 clipes de vídeo mais 5 clipes de áudio (Curious Refuge, 2026). O post da Alibaba não dá nenhum número.
"Pesos abertos, Apache-2.0"Lançamentos anteriores do Wan tinham pesos abertos; o Wan 3.0 é fornecido como um serviço de plataforma e não surgiram pesos (Curious Refuge, 2026).
"A API já saiu"Funciona no Alibaba Cloud Model Studio. Plataformas de inferência de terceiros ainda não a têm.

E esta é a tabela que demorou mais tempo a construir. Cada número é meu, a partir da deteção de cena do ffmpeg no ficheiro entregue versus o número de shots escrito no prompt emparelhado:

Demonstração oficialPrompt declaraCortes duros encontradosShots entreguesVeredito
v013 plataforma chuvosa, anime6 shots56Exato
v055 diário golden retriever6 shots, 30,0s56Exato
v021 loja de ramen e gatinho4 shots34Exato
v008 lago da floresta, 3D4 shots23Falta um
v085 mulher de chapéu de palha4 shots12Metade
v041 corredor para beco mágico3 segmentos, "sem corte duro"01 take contínuoExatamente como pedido
v045, v084, v1023 / 5 / multi-sujeitoDemasiados para resolverNão contávelCorte rápido e estroboscopia de tinta aguada impedem deteção

Leia as linhas do meio novamente. Três prompts atingiram o número exato. Dois não. O número de shots que escreve é um pedido, não um contrato.

Porque É Que a Consistência Multi-Shot do Wan 3.0 Falha: 4 Modos de Falha

Veredito primeiro: raramente falha no rosto. Falha nos objetos e na câmara, e falha mais quando altera várias coisas ao mesmo tempo.

Aqui está o clipe que mais me ensinou, porque é o pior desempenho na própria mostra da Alibaba.

GtZy2TUK4ak

Demo beta oficial do Wan 3.0 da Alibaba (clipe do manual v085, 1240x742, 30.08s). O prompt descreve quatro shots com marcação temporal. O ffmpeg encontra um corte real, aos 9,3s. Os shots 3 e 4 colapsam num único take mantido que desvanece para preto. Não gerado pela Atlas Cloud.

Modo de falha 1: os adereços derivam antes dos rostos. Nesse clipe, olhe apenas para o take de abertura, antes de qualquer corte acontecer. Aos 0,6s, o chapéu de palha tem uma fita preta fina e o pingente é uma pedra azul facetada. Aos 9,2s, a fita é uma larga fita preta e o pingente é uma gota preta brilhante e lisa. O rosto dela está estável o tempo todo. Os acessórios não.

Dois frames do mesmo take contínuo de nove segundos, lado a lado, mostrando a fita do chapéu a alargar e o pingente do colar a mudar de forma e cor

Ambos os frames provêm do mesmo take ininterrupto da demonstração oficial v085, com 8,6 segundos de diferença, sem corte entre eles. A fita do chapéu e o pingente mudam ambos. Esta é a camada dos adereços a falhar enquanto a camada da personagem se mantém.

É por isso que o teste de aceitação que realmente funciona é uma lista de verificação de adereços, não uma verificação de ambiente. Para esta personagem são três itens: forma e fita do chapéu, colar de contas e pingente, decote do vestido.

Modo de falha 2: cenas multi-sujeito mantêm-se individualmente e borram-se no contacto. Cada personagem permanece reconhecível sozinha. Coloque-as juntas no frame, a interagir, e as identidades sangram. Testes independentes encontraram o mesmo: "A consistência da personagem começou a quebrar-se, e a composição parecia ocasionalmente mais um efeito de ecrã verde mau do que um ambiente gerado naturalmente", com a sincronização labial apontada como a maior fraqueza (Curious Refuge, 2026).

Modo de falha 3: mudou quatro variáveis numa linha. Nova localização mais novo ângulo de câmara mais nova iluminação mais novo estado do guarda-roupa é a forma fiável de perder uma identidade. Os próprios prompts do manual combatem isto reafirmando a roupa completa em cada segmento. Nos 64 prompts emparelhados, 9 dizem explicitamente "permanece inalterado", 5 fixam a posição da câmara e 4 exigem que a personagem se mantenha idêntica.

Modo de falha 4: 30 segundos num trabalho não são 30 segundos de um shot. São produtos diferentes. Um trabalho multi-shot de 30s corta entre enquadramentos. Se o que quer é um take contínuo ininterrupto, encadear continuações degrada-se: o erro de identidade acumula-se em cada passagem, pelo que o take único limpo é curto por natureza.

O manual tem exatamente um prompt que acerta na perfeição, e vale a pena copiar a estrutura da frase:

Três segmentos de prompt renderizados como um único take contínuo ininterrupto, de um corredor de apartamento através de uma porta para um beco gótico iluminado por candeeiros

Demo beta oficial do Wan 3.0 da Alibaba (clipe do manual v041, 720x1280, 15.04s). Três segmentos de prompt, e o ffmpeg encontra zero cortes duros, que é exatamente o que o prompt pedia. Não gerado pela Atlas Cloud.

A sua linha de transição, traduzida, é a coisa mais reutilizável em todo o manual: continuar perfeitamente a partir do último frame do segmento anterior; a personagem, o guarda-roupa, a localização e a posição da câmara permanecem completamente idênticos; sem corte duro e sem transição abrupta de cena. Apenas um prompt em 64 a usa. Roube-a.

O Fluxo de Trabalho de Consistência Multi-Shot Que Pode Executar Hoje

A questão é: onde é que realmente executa isto?

Atualmente, o Wan 3.0 vive no Model Studio da própria Alibaba. Nenhuma plataforma de inferência de terceiros o aloja. Na Atlas Cloud aparece apenas como uma entrada "em breve" com zero endpoints ativos, que é o estado honesto das coisas e vale a pena dizer claramente em vez de fingir o contrário.

Portanto, tem duas opções: esperar, ou parar de pedir a um prompt que faça seis coisas.

A segunda opção é melhor de qualquer maneira, e a minha contagem de cortes é o argumento para isso. Um único trabalho multi-shot deu-lhe uma contagem de shots que falhou por metade na própria mostra da Alibaba. Dividir o trabalho coloca esse controlo de volta nas suas mãos:

  1. Fixe o aspeto uma vez, como uma imagem estática.
  2. Clone essa identidade num frame-chave por shot, mudando exatamente uma variável de cada vez.
  3. Anime cada shot separadamente com a referência fixada.
  4. Junte localmente.

Mais lento de configurar, drasticamente mais previsível. E cada modelo na cadeia pode ser usado hoje.

PassoModeloPapel na cadeiaPreço listado
1bytedance/seedream-v5.0-pro/text-to-imageFixar o aspeto da personagem$0,045 / imagem
2google/nano-banana-2/editClonar identidade no frame-chave de cada shot$0,08 / imagem
3alibaba/wan-2.7/reference-to-videoAnimar cada shot com a referência fixada$0,10 / segundo
Altalibaba/wan-2.7/text-to-videoUm prompt, muitos shots (menos controlável)$0,10 / segundo
Fixalibaba/wan-2.7/video-editReparar um adereço errado sem regenerar$0,10 / segundo

Vale a pena saber para a pergunta "melhor modelo para consistência multi-shot": referência-para-vídeo é agora uma categoria inteira. bytedance/seedance-2.0-fast/reference-to-video custa $0,072/s (20% de desconto sobre $0,09, a partir de agosto de 2026), kwaivgi/kling-video-o3-pro/reference-to-video $0,095/s (15% de desconto sobre $0,112), minimax/h3/reference-to-video $0,10/s, e google/veo3.1/reference-to-video $0,20/s. Todos os preços verificados no catálogo ativo em 21 de agosto de 2026.

Um aviso antes dos passos: os preços listados são um piso, não uma cotação. A resolução e a duração alteram o número real, por isso leia o botão "Run" antes de se comprometer.

Como Construir Consistência Multi-Shot ao Estilo Wan 3.0, Passo a Passo

Estamos a reconstruir a exata folha de batida que o próprio modelo da Alibaba falhou: a mulher de chapéu de palha, quatro shots, jardim para carro. Mesmo guião, controlo por shot, e desta vez obtém quatro shots porque renderizou quatro.

Vamos começar.

Passo 1: fixe o aspeto. Uma imagem torna-se a âncora de identidade para tudo a jusante. Gere-a no Seedream v5.0 Pro, 16:9, na resolução mais alta que a página oferecer. Nomeie os três adereços de verificação explicitamente, porque são esses que derivam.

plaintext
135mm film still, vintage sunlit rose garden. An elegant young woman wearing a
2natural straw boater hat with a black band, a black beaded necklace with a single
3teardrop pendant, and a white sleeveless linen dress. She stands before a wall of
4blooming pink and cream roses, one hand lightly touching the brim of her hat,
5gentle and thoughtful gaze just off camera. Soft warm natural light, dappled sun
6flare, shallow depth of field, fine film grain, medium close-up.

Playground do Seedream v5.0 Pro na Atlas Cloud com o prompt do chapéu de palha inserido e o frame-chave da personagem terminado renderizado no painel de saída

Passo 1 concluído: a âncora de identidade para toda a sequência de quatro shots.

Passo 2: clone a identidade nos shots 2 a 4. Um frame-chave por shot, uma execução cada, usando o Nano Banana 2 Edit com a saída do Passo 1 como referência. A disciplina que importa: reafirme o guarda-roupa completo sempre, depois mude exatamente uma coisa.

Shot 2, a viragem emocional:

plaintext
1Keep the exact same woman from the reference image: identical face, identical
2natural straw boater hat with black band, identical black beaded necklace with a
3teardrop pendant, identical white sleeveless linen dress. New shot: cinematic
4close-up, she slowly lifts the straw hat off her head and lowers her chin, a faint
5wistful expression. Same rose garden background. Strictly preserve the same
6lighting, skin tone, film grain and colour grade as the reference.

Shot 3, o corte para o carro:

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant, identical white sleeveless linen dress,
3the straw boater hat now resting on her lap. New shot: back seat of a moving car,
4side profile, her hand propped against the door, gazing out a rain-beaded window,
5blurred green foliage rushing past. Overcast light with a warm interior fill,
6shallow depth of field, elegant melancholy. Strictly preserve the same face, the
7same colour grade and the same 35mm film grain as the reference.

Shot 4, o último olhar:

plaintext
1Keep the exact same woman from the reference image: identical face, identical black
2beaded necklace with a teardrop pendant. New shot: extreme facial close-up beside
3the car window, eyes slowly closing, a calm and released expression. Raindrops
4slide down the glass in front of her, focus shifting onto the droplets, background
5falling into bokeh. Wong Kar-wai style cinematic mood, fine film grain. Strictly
6preserve the same face, the same lighting and the same colour grade as the
7reference.

Playground do Nano Banana 2 Edit na Atlas Cloud com o frame-chave do Passo 1 carregado como referência e o frame-chave do shot 2 renderizado, identidade e guarda-roupa mantidos

Passo 2 concluído: frame-chave do shot 2, mesma mulher, chapéu agora nas mãos dela.

Passo 3: anime o shot 1 com a referência fixada. Agora cada shot torna-se vídeo independentemente no Wan 2.7 reference-to-video. Definições: 720P, 5 segundos, e coloque o frame-chave do Passo 1 no slot "Images". Verifique a cotação do botão "Run" antes de o executar.

plaintext
1Shot 1 of 4. Reference image 1 defines the character: keep the same face, the same
2natural straw boater hat with black band, the same black beaded necklace with a
3teardrop pendant and the same white sleeveless linen dress identical for the entire
4clip. 35mm film look, vintage sunlit rose garden. The woman lightly touches the
5brim of her hat as a soft breeze lifts strands of her hair; the camera pushes in
6very slowly. Warm natural light, dappled sun flare, shallow depth of field, fine
7film grain. The camera position stays stable. No hard cut and no scene change.

Playground do Wan 2.7 reference-to-video na Atlas Cloud com o frame-chave no slot "Images" e o clipe de cinco segundos terminado a reproduzir-se no painel de saída

Passo 3 concluído: o clipe com referência fixada renderizado no painel de saída.

E aqui está o que saiu:

Clipe de cinco segundos com referência fixada da mulher de chapéu de palha no roseiral, fita do chapéu e colar mantendo-se estáveis durante todo o tempo

Nossa própria execução na Atlas Cloud, não uma demonstração da Alibaba. Mostrado como GIF silencioso; o ficheiro entregue tem uma faixa de áudio.

Passo 4: encadeie os shots 2 a 4, depois junte. Repita o Passo 3 para cada frame-chave restante e cole a frase de transição do manual no topo de cada prompt seguinte:

plaintext
1Continue seamlessly from the last frame of the previous segment. The character,
2the wardrobe, the location and the camera position stay completely identical.
3No hard cut and no abrupt scene transition.

Depois concatene localmente com ffmpeg e execute a verificação de aceitação de três pontos: forma e fita do chapéu, colar de contas e pingente, e se a progressão de enquadramento entre os shots faz realmente sentido. Se exatamente um adereço estiver errado num shot, não regenere o shot. Envie-o através do wan-2.7/video-edit e altere apenas isso, tomando emprestada a frase do manual: mantenha as ações, o guarda-roupa e o resto do frame inalterados.

Variações: Cenas Multi-Sujeito e Bloqueios de Estilo

Três padrões do manual que vale a pena roubar.

Cartões de personagem para shots multi-sujeito. Quando duas ou mais pessoas partilham o frame, os prompts oficiais atribuem cartões de personagem com letras e reafirmam a roupa completa de cada uma em cada segmento. Verboso, feio, e funciona melhor do que pronomes.

Declaração de estilo global para trabalhos estilizados. Tinta aguada, animação cel e outros estilos pesados precisam que o estilo seja fixado uma vez para toda a peça, depois uma folha de batida com marcação temporal por baixo.

Sequência de artes marciais em tinta aguada com um espadachim num bosque de bambu, estilo bloqueado numa luta de cinco batidas com marcação temporal

Demo beta oficial do Wan 3.0 da Alibaba (clipe do manual v084, 20.05s, cortado). Cinco batidas com marcação temporal sob uma declaração de estilo global em tinta aguada. O trabalho de pincel estroboscópico é a razão pela qual a deteção automática de cortes não consegue contar este. Não gerado pela Atlas Cloud.

Corrija, não regenere. Uma passagem de video-edit num adereço errado é mais barata do que uma nova renderização e não pode partir os shots que já estavam certos.

Quanto Custa uma Sequência de Quatro Shots

Números concretos para a sequência construída acima, às taxas listadas:

  • 1 âncora de identidade no Seedream v5.0 Pro: $0,045
  • 3 frames-chave de shot no Nano Banana 2 Edit: 3 x $0,08 = $0,24
  • 4 clipes de 5s, 720P, no Wan 2.7 reference-to-video: 20s x $0,10 = $2,00
  • Total: cerca de $2,29 para uma sequência de 20 segundos, quatro shots, com identidade fixada

Estenda para uma peça de seis shots e 30 segundos e a linha de vídeo passa a $3,00, chegando perto de $3,44 no total.

Duas ressalvas honestas. Primeiro, os preços listados são um piso: os níveis de resolução e a duração alteram o custo real, e a cotação do próprio playground no botão "Run" é o único número que vincula, que é a razão pela qual as capturas de ecrã acima importam mais do que esta lista. Segundo, no próprio Wan 3.0, a Alibaba precifica a geração de vídeo do Model Studio por segundo por nível de resolução, mas não consegui confirmar as taxas exatas por segundo do Wan 3.0 a partir de uma página de primeira parte, por isso não estou a citar números que não pude verificar.

Vale a pena notar o que está a comprar com a abordagem de trabalho dividido: não um preço mais baixo, mas uma contagem de shots que corresponde ao seu guião. Com base na evidência da própria mostra da Alibaba, isso não é algo que um único trabalho de 30 segundos lhe possa prometer ainda, e é a resposta prática para a consistência multi-shot do Wan 3.0 até a API abrir.

Perguntas Frequentes

Quantos shots consegue o Wan 3.0 manter consistentes numa geração?

Seis, com base na evidência atual, com uma ressalva. O post de lançamento da Alibaba não publica nenhuma especificação de número de shots. Nos 8 prompts explicitamente multi-shot do seu manual oficial, o máximo que algum declara é 6, e dois deles entregaram exatamente 6 shots verificados por corte. Trate 6 como um teto observado, não uma garantia.

O Wan 3.0 gera realmente 4K nativo?

Não. O post oficial lista apenas 480P, 720P e 1080P. Em todos os 110 ficheiros de demonstração oficiais, nada excede 1080p, apenas 4 ficheiros são exatamente 1920x1080, e a saída paisagem comum é 1920x1072. As taxas de fotogramas dividem-se em 24fps para 63 ficheiros e 30fps para 46.

A API do Wan 3.0 está disponível, e onde posso executá-la?

Funciona no Alibaba Cloud Model Studio. Nenhuma plataforma de inferência de terceiros a aloja ainda; a Atlas Cloud lista-a como uma entrada "em breve" sem endpoints ativos. Se precisar de saída multi-shot esta semana, a cadeia de referência-para-vídeo do Wan 2.7 acima é o substituto funcional.

Porque é que as minhas personagens ainda mudam entre shots mesmo com uma imagem de referência?

Geralmente porque um prompt mudou a localização, o ângulo da câmara e a iluminação simultaneamente. Mude uma variável por shot e reafirme o guarda-roupa completo em cada prompt. Verifique também as coisas certas: na própria demonstração da Alibaba, o rosto manteve-se estável enquanto a fita do chapéu e o pingente do colar mudaram ambos dentro de um único take ininterrupto.

Os pesos do Wan 3.0 são open source?

Nenhuns pesos foram lançados. Versões anteriores do Wan eram descarregáveis e executáveis localmente, enquanto o Wan 3.0 é fornecido como um serviço de plataforma alojado. Qualquer pessoa que cite uma licença Apache-2.0 para o Wan 3.0 está a repetir algo sem fonte de primeira parte por trás.

Qual é a forma mais rápida de obter consistência multi-shot sem acesso ao Wan 3.0?

Quatro movimentos: fixe uma imagem de identidade, clone-a num frame-chave por shot mudando uma única variável de cada vez, anime cada shot com referência-para-vídeo, depois junte localmente e verifique os seus adereços. Cerca de $2,29 e aproximadamente meia hora para uma sequência de quatro shots.


Metodologia: todos os 110 ficheiros de demonstração e 64 prompts emparelhados provêm do manual oficial do criador do Wan 3.0 da Alibaba, arquivado localmente a 11 de agosto de 2026. Os metadados foram lidos ficheiro a ficheiro com ffmpeg; as contagens de shots provêm da deteção de mudança de cena do ffmpeg com um limiar de 0,2, verificadas com frames extraídos; a estrutura dos prompts foi analisada programaticamente. Os preços da Atlas Cloud foram verificados no catálogo de modelos ativo em 21 de agosto de 2026.

Fontes: Alibaba Cloud (agosto de 2026); Curious Refuge (2026).

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos