Seedance 2.5 já está disponível — Primeiro na Atlas Cloud

Como escrever prompts para Wan 3.0: o que três casos oficiais ensinam que nenhuma lista de parâmetros pode

Como escrever prompts do Wan 3.0, com engenharia reversa de casos oficiais de 30 segundos: a estrutura de três camadas, escrita de desempenho, sintaxe sonora e controle de movimento.

A linha Wan já é a família de vídeo aberto mais bifurcada da internet. Os repositórios Wan 2.2 e Wan 2.1 têm aproximadamente 17.000 estrelas cada (GitHub, agosto de 2026), e a página Wan-AI movimenta centenas de milhares de downloads por mês em seus checkpoints (Hugging Face, agosto de 2026). Então, quando o Wan 3.0 entrou em acesso antecipado com geração nativa de 30 segundos, até 20 entradas de referência e áudio gerado na mesma passada que a imagem, a primeira pergunta não foi se as pessoas usariam. Foi se alguém saberia escrever para ele.

Porque uma geração única de 30 segundos não é uma versão maior de um clipe de 5 segundos. É um problema de escrita diferente. Um prompt de 5 segundos descreve uma imagem que se move. Um prompt de 30 segundos direciona o tempo: quem muda, quando, em qual corte, com que som por baixo.

O manual do criador do Wan 3.0 que circula com o acesso antecipado traz dezenove casos oficiais de prompt e resultado. Estudei todos os dezenove, depois escolhi os três que ensinam a técnica mais transferível e desmontei cada um: o que o prompt realmente controla, por que ele é construído daquela forma e como reutilizar seu esqueleto para seus próprios planos. Cada vídeo abaixo é a saída real e não editada do caso em discussão. Os prompts originais dos casos estão escritos em chinês; os esqueletos aqui são reafirmações em inglês de sua estrutura, e a linha Wan aceita prompts em ambos os idiomas.

Principais conclusões

  • Prompts longos do Wan 3.0 compartilham uma arquitetura: vinculações de referência primeiro, regras globais em segundo, uma lista de cenas com carimbo de tempo em terceiro. Prompts de teste curtos podem omitir camadas, prompts de produção não devem.
  • Escreva a performance como uma cadeia de ações visíveis, nunca como um rótulo de emoção. "Ansioso" é uma esperança. "Mastigar desacelera, sobrancelhas se franzem, olhar cai para as mãos" é uma instrução.
  • O som faz parte do prompt, não uma etapa posterior. O diálogo fica entre chaves, efeitos e música ganham suas próprias frases, e o silêncio precisa ser solicitado explicitamente.
  • Os casos oficiais repetem sua restrição mais importante e proíbem a falha que esperam. Um prompt do manual proíbe "deslize suave" em três redações diferentes, porque o modelo padrão é suave.
  • O movimento pode ser quantificado: quadros por rajada, percentual da largura do quadro por disparada, número de repetições. O caso da libélula abaixo é a prova.

Uma geração, 30 segundos, dez batidas de storyboard numeradas e um arco de trilha sonora completo escritos em um único prompt: um barco de pesca, uma tempestade e um monstro marinho que emerge no horário previsto. Caso oficial do manual do Wan 3.0, mostrado aqui sem edição.

O que Torna a Escrita de um Prompt do Wan 3.0 Diferente

Três capacidades mudam o trabalho, e cada uma adiciona uma habilidade de escrita que modelos mais curtos nunca exigiram.

30 segundos nativos significam estrutura. Quando um modelo renderiza 5 segundos, um prompt pode ser uma frase densa. Em 30 segundos, um prompt não estruturado deriva: personagens trocam de roupa, a câmera esquece sua regra, o final não tem relação com o início. Todo caso longo no manual combate a deriva da mesma forma, com estágios explícitos e estados finais. Essa estrutura é o núcleo deste guia.

Áudio conjunto significa direção de som. O Wan 3.0 gera a trilha sonora junto com a imagem. Diálogo, efeitos, ambiente e música são todos promptáveis, o que também significa que uma trilha sonora não escrita é uma trilha improvisada. Os casos oficiais tratam o áudio com a mesma disciplina que a luz: declarado, escopo e, às vezes, deliberadamente silenciado.

Até 20 referências significam sintaxe de vinculação. Rostos, roupas, locais, vozes e até imagens de storyboard podem ser fixados a materiais carregados. Os casos do manual vinculam cada referência a um sujeito nomeado uma vez e reutilizam o nome em todas as cenas posteriores. Se você testou a mesma disciplina na geração atual, digamos no Wan 2.7 referência-para-vídeo, a versão 3.0 parecerá familiar em vez de nova.

Nada disso exige escrever um romance toda vez. O caso bom mais curto do manual é uma única frase sobre um OVNI roubando uma vaca em um estilo pintado à mão. A habilidade é saber quais camadas seu plano precisa, que é exatamente para isso que servem os três casos abaixo.

A Pilha de Prompts do Wan 3.0: Três Camadas Que Todo Caso Longo Compartilha

Tire os ossos dos dezenove casos oficiais e os longos são todos a mesma pilha de três camadas.

Camada 1: vinculações de referência. Uma linha por material carregado, declarando o que é e o que pode ser extraído dele. Defina a mulher na imagem 1 como Sujeito 1. Pegue apenas a roupa da imagem 2. Voz do Sujeito 2 segue áudio 1. Vincule uma vez, depois refira-se pelo nome para sempre. Plurais vagos como "as imagens definem os personagens" são exatamente o que esta camada existe para evitar.

Camada 2: regras globais. Tudo que deve permanecer verdadeiro durante todo o clipe, escrito antes de qualquer ação: estilo visual e seus pontos de referência, um sistema de cores nomeado, comportamento da luz, gramática da câmera, disciplina de performance, disciplina de áudio e uma lista de falhas proibidas. Esta camada é onde os casos do manual são mais agressivos. Um caso de artes marciais limita a câmera lenta a dois usos de menos de um segundo cada, proíbe legendas na tela, proíbe música de fundo completamente e proíbe a câmera de ficar parada por mais de 1,5 segundos.

Camada 3: a linha do tempo. Batidas com carimbo de tempo ou numeradas, cada uma carregando um evento principal e um estado final visível. Não "eles lutam por um tempo", mas "0 a 1,5 segundos: ele está na linha dos juncos, contraluz, vento no casaco, e diz sua única fala." Estados finais são o que mantém o segundo quinze consistente com o segundo cinco.

Uma maneira útil de manter isso na cabeça: Camada 1 é a escalação, Camada 2 é o livro de regras, Camada 3 é a lista de cenas. Os três casos a seguir enfatizam cada um uma camada com mais força.

Caso 1: Como Escrever um Prompt do Wan 3.0 para Performance, Um Rosto por 30 Segundos

O caso menos chamativo do manual é o que a maioria das pessoas deveria estudar primeiro: um único close-up fixo de uma jovem em um vestido azul de formatura, mantido por 30 segundos completos enquanto ela fala, se preocupa e finalmente olha para baixo, para as mãos.

Trinta segundos, um plano, sem corte. O vestido diz a cena, a testa diz o que está em jogo, e o olhar para baixo cai exatamente onde o prompt colocou. Caso oficial do manual, saída não editada.

Aqui está o que o prompt oficial faz, movimento por movimento, em minhas palavras em vez das dele:

  1. Câmera antes do sujeito. Ele abre travando o quadro: close-up frontal, cabeça e parte superior do corpo, e uma imperfeição deliberada, uma segunda pessoa na borda esquerda que está totalmente desfocada. Fundos que você nomeia e depois desfoca são fundos que o modelo não vai nitidificar no meio do plano.
  2. Vestuário como exposição. Um vestido azul de formatura substitui um parágrafo de ambientação. O modelo infere a cerimônia, a multidão, o dia. Escolha a única peça de roupa ou adereço que implica o mundo e pule descrever o mundo.
  3. Emoção como uma cadeia de atos visíveis. O prompt nunca pede "ansiedade". Ele escreve a boca se movendo enquanto ela fala, a testa levemente franzida, a seriedade do rosto. Cada item é algo que uma câmera pode verificar. Rótulos de emoção são esperanças. Movimentos musculares são instruções.
  4. O micromovimento que vende realismo. Dois detalhes fazem mais do que todo o resto combinado: a câmera mantém um leve balanço de respiração de mão, e o olhar dela viaja de frente para baixo em direção às mãos, em uma trajetória declarada. Dê a qualquer plano longo uma mudança lenta e deliberada como essa, e o plano parecerá dirigido em vez de gerado.

Esqueleto reutilizável, em inglês, estrutura idêntica ao caso:

Plain
1[Plano frontal] em [sujeito], [detalhe de enquadramento]. Um [elemento desfocado] está na
2[borda] do quadro. [Sujeito] usa [uma peça de roupa que implica toda a cena].
3[Sujeito] está [ação], boca se movendo, [detalhe de testa / olhos / mandíbula]. A luz cai de
4[direção], mantendo [nota de textura da pele / tecido]. A câmera está travada, mas carrega um
5leve balanço de respiração de mão. Ao longo do plano, [uma mudança visível lenta: uma trajetória
6de olhar, uma mudança de postura, um objeto abaixado].

Preencha esse modelo com um sujeito próprio antes de tocar nas épicas de 30 segundos. Se o rosto se mantiver por trinta segundos, sua estrutura é sólida.

Caso 2: Como Estruturar um Prompt de 30 Segundos do Wan 3.0 Como um Diretor

O curta absurdo do manual é o melhor objeto de ensino estrutural em todo o documento: uma cowgirl monta um cavalo de verdade em um posto de gasolina solitário da Rota 66, pega a mangueira e enche seu cavalo de grama fresca enquanto a visão de mundo do frentista desmorona silenciosamente.

Trinta segundos de configuração impassível e uma piada visual perfeita. A comédia está escrita na estrutura: enquadramento observacional fixo, depois um close-up extremo repentino exatamente quando a coisa absurda acontece. Caso oficial do manual, saída não editada.

O prompt está organizado em cinco módulos nomeados, e a lista de módulos em si é a lição:

  1. Uma logline. Duas frases sobre o que acontece e qual é a piada. Não visuais, história. Escrever isso primeiro força você a saber para que servem os 30 segundos.
  2. Um sistema de cores nomeado. Não "colorido", mas uma lei de duas cores: céu azul-petróleo e terra laranja, depois cada objeto principal atribuído a um lado dela, a bomba de gasolina vermelha desbotada, o cachecol laranja, as montanhas terracota. Nomeie o sistema, depois distribua. Consistência em vídeo de IA geralmente é um problema de paleta antes de ser um problema de personagem.
  3. Uma lista de elenco com funções narrativas. Cada personagem recebe duas ou três características visíveis e, crucialmente, uma função: o frentista é explicitamente designado como o portador do plano de reação do filme. Atribuir um trabalho diz ao modelo onde a atenção da câmera pertence em cada batida em que aquele personagem aparece.
  4. Uma filosofia de câmera nomeada. O caso inventa uma regra e a define em uma linha: observação calma mais close-up absurdo, significando planos médios fixos e panorâmicas lentas como padrão, quebrados por um close-up extremo repentino apenas quando o evento absurdo dispara. Nomear sua regra de câmera e depois se referir a ela supera redescrever movimentos de câmera em cada batida. É também o mecanismo cômico inteiro: o olhar plano faz o close-up da bomba de grama cair.
  5. Uma linha do tempo de quatro atos com estados finais. Configuração, escalada, piada, consequência, cada um com um intervalo de tempo, um evento principal e uma imagem final congelada, até o palito finalmente caindo da boca do frentista na última batida.

O modelo transferível é maior que a comédia. Logline, lei de paleta, elenco com funções, uma regra de câmera nomeada, quatro atos com estados finais: isso é um resumo de produção, e o Wan 3.0 é a primeira geração desta família com pista suficiente, trinta segundos dela, para que um resumo importe. A demonstração do monstro marinho no topo deste artigo é o mesmo esqueleto com dez batidas e um arco musical pontuado, escrito da mesma forma: cada batida um evento, cada batida um estado final visível.

Caso 3: Escrevendo Física de Movimento em um Prompt do Wan 3.0

A coisa mais difícil de obter de qualquer modelo de vídeo é movimento que não seja suave. Os modelos tendem a um movimento gentil e contínuo, e é por isso que toda fada de IA flutua como um balão lento. A fada do manual não flutua. Ela se move como uma libélula: pairar imóvel, disparar instantâneo, parada brusca, nova direção.

Pequena fada com cabelo rosa e asas pairando sobre carpete

Pairar, disparar, parada brusca. O borrão no meio de cada rajada tem um ou dois quadros de largura, exatamente como o prompt orçou. Caso oficial do manual, mostrado como um GIF silencioso; o clipe entregue carrega seu próprio ambiente.

Este prompt vence com quatro técnicas que você pode pegar diretamente:

  1. Declaração de prioridade no topo. A primeira linha anuncia o único requisito de maior prioridade, a lei de movimento da libélula, antes de qualquer cenário. Atenção é um orçamento. Gaste os tokens iniciais na regra que decide o sucesso, não na cor do carpete.
  2. Uma âncora de física do mundo real. Em vez de adjetivos como "rápido e ágil", o prompt nomeia um animal cuja assinatura de movimento o modelo já viu milhares de vezes: pairar pontual, lançamento em rajada, parada total, reorientação brusca. Uma âncora familiar supera dez advérbios abstratos.
  3. Números onde adjetivos borrariam. A disparada deve cruzar 60 a 90 por cento da largura do quadro em 3 a 5 quadros. A parada deve durar de 2 a 4 quadros. Pelo menos seis rajadas claramente separadas devem ocorrer nos primeiros oito segundos. O borrão de movimento residual é orçado em 1 a 2 quadros. Você não está escrevendo poesia neste ponto, está escrevendo uma especificação, e o modelo a honra. Olhe a tira abaixo: o quadro no meio da disparada é puro risco, os quadros de cada lado são perfeitamente nítidos.
  4. Proibindo o padrão. O prompt proíbe explicitamente a falha que prevê, em várias redações: sem flutuação lenta de fada, sem cruzeiro em velocidade uniforme, sem deslize suave contínuo, e então uma frase corretiva que diz o que o movimento não é, "não um caminho de voo contínuo, mas deslocamentos curtos, agudos, quase saltando quadros." Quando você sabe o que o modelo fará no piloto automático, escreva o piloto automático para fora do plano.

Fada de brinquedo com cabelo rosa voando entre ursos de pelúcia e blocos coloridos

Quatro fotogramas consecutivos do caso da libélula: pairar ao lado do urso de pelúcia, borrão de movimento no meio da disparada, chegada acima dos blocos, pairar em parada brusca

Quatro quadros da saída acima. Nítido, borrado, nítido, nítido: o orçamento de borrão do prompt, visível quadro a quadro.

As mesmas quatro manobras se generalizam para qualquer problema de movimento: panorâmicas chicote que não devem se tornar cortes, impactos que precisam de peso, movimento mecânico que não deve se tornar orgânico. Âncora, quantifique, priorize e proíba o padrão.

Diálogo, Som e Sintaxe de Referência em Prompts do Wan 3.0

Os três casos acima são silenciosos sobre a mecânica que faz os prompts do Wan 3.0 falarem, então aqui está a camada de sintaxe, compilada do resto dos casos do manual.

O diálogo vai entre chaves. As falas faladas são envolvidas como {Qual grupo muscular hoje} em vez de deixadas em prosa aberta, o que impede o modelo de narrar seu diálogo como uma legenda. As falas chegam com sincronia labial, e uma cena de diálogo é escrita como ação alternada e falas entre chaves, exatamente como um roteiro.

As vozes podem ser escaladas. A sintaxe de referência se estende ao áudio: defina a mulher na imagem 1 como Sujeito 1, depois declare que a voz do Sujeito 1 segue o áudio 1. Rosto de um arquivo, voz de outro, ambos travados pela duração.

O áudio precisa de uma declaração de disciplina. Os casos mais fortes declaram sua paisagem sonora da mesma forma que declaram sua paleta. Um caso de animação declara seus tipos de áudio desde o início: apenas ambiente e música, sem fala. O caso de artes marciais vai além, proibindo música de fundo completamente, mantendo apenas respiração, fricção de tecido, golpes e vento, e consegue exatamente isso. Música, quando desejada, é escrita como um arco ao longo da linha do tempo, de drones de pavor baixos através de escalada de cordas até um impacto de metais e uma longa nota de desgraça, mapeada para as batidas que deve atingir.

O silêncio também é um pedido. Sem prompt, o modelo preenche a trilha. Se seu plano precisa apenas de tom de ambiente e um evento sonoro, diga isso. A direção de som no Wan 3.0 não é enfeite. É a segunda metade do meio.

Onde Praticar a Fórmula de Prompt do Wan 3.0 Hoje

O Wan 3.0 ainda está a caminho, e os usuários não podem usá-lo agora. A estrutura acima ainda se acumula agora, porque nada nela está travado por versão: vinculações, regras globais, linhas do tempo, diálogo entre chaves e padrões proibidos funcionam todos na geração atual do Wan.

Toda a família atual está ao vivo no Atlas Cloud, Wan 2.7 texto-para-vídeo, imagem-para-vídeo, referência-para-vídeo e edição de vídeo, com uma chave e preço por execução mostrado antes de você pressionar executar. Um exercício prático: pegue o esqueleto do Caso 1, preencha com seu próprio sujeito e execute como uma tomada curta no Wan 2.7 texto-para-vídeo. Se a cadeia de performance se mantiver lá, o mesmo arquivo é seu rascunho do Wan 3.0 no primeiro dia, com a duração aumentada em vez de reescrita. O Atlas Cloud tem o hábito de carregar acesso no Dia 0 quando esta família é atualizada, então o ambiente de prática e o destino provavelmente serão a mesma página.

Perguntas Frequentes

Quanto tempo deve ter um prompt do Wan 3.0?

O tempo que o plano precisar e não mais. O manual oficial varia de uma frase, uma piada de OVNI pintada à mão, a prompts com mais de mil palavras para um filme de monstro de dez batidas. A variável decisiva é duração e tamanho do elenco: um teste de 5 segundos com um único sujeito precisa de uma frase densa, uma história de 30 segundos com vários personagens precisa de todas as três camadas, vinculações, regras globais e uma linha do tempo.

O Wan 3.0 gera som a partir do prompt?

Sim, o áudio é gerado na mesma passada que a imagem. O diálogo é escrito entre chaves e chega com sincronia labial, efeitos sonoros e ambiente são escritos como prosa, e a música pode ser direcionada como um arco ao longo da linha do tempo. A disciplina funciona nos dois sentidos: se você quer quase silêncio, ou ambiente sem trilha sonora, precisa dizer, ou o modelo preencherá a trilha por conta própria.

Qual é a sintaxe de chaves nos prompts do Wan 3.0?

As chaves marcam palavras que são faladas em voz alta por um personagem, como em {Vejo você na linha de chegada}. Manter o diálogo dentro de chaves o separa da descrição da cena, então o modelo executa a fala em vez de ilustrá-la. Para trabalhos multilíngues, declare o idioma antes da fala e o estilo de entrega junto.

Como manter um personagem consistente em um vídeo de 30 segundos do Wan 3.0?

Vincule o personagem a uma referência uma vez, com escopo: defina a pessoa na imagem 1 como Sujeito 1, pegue apenas rosto, cabelo e roupa. Depois repita o nome do sujeito em cada batida da linha do tempo em que ele aparece, e reafirme as duas ou três características travadas em qualquer momento de alto risco, como uma ação adjacente a figurino ou uma mudança de iluminação. O caso da cena de luta do manual até reafirma travas de características por módulo, que é a versão cinto e suspensórios.

Posso praticar a escrita de prompts do Wan 3.0 antes de ter acesso?

Sim, e você deveria. A estrutura de três camadas, diálogo entre chaves, vinculações de referência e técnica de proibição de padrão funcionam todos na família atual hoje. O Wan 2.7 no Atlas Cloud cobre texto-para-vídeo, imagem-para-vídeo, referência-para-vídeo e edição de vídeo com uma chave, então um modelo comprovado lá se transfere para o 3.0 como uma mudança de duração em vez de uma reescrita.

Conclusão

Dezenove casos oficiais dizem a mesma coisa de três maneiras diferentes: um prompt do Wan 3.0 é um documento de produção, não uma legenda. Escale suas referências, legisle seu estilo, agende suas batidas e trate o som como metade da imagem. Comece com o esqueleto do close-up da formanda, progrida para o resumo de cinco módulos e guarde a especificação de movimento orçada em quadros para o plano que precisar dela. Os modelos continuarão mudando. A disciplina de escrever tempo em vez de descrever imagens é a parte que você fica.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos