Seedance 2.5 já está disponível — Primeiro na Atlas Cloud

Wan 3.0 Multimodal Reference aceita 20 ativos, e um PDF é um deles.

A referência multimodal do Wan 3.0 aceita 20 ativos em uma única chamada: imagens, vídeo, áudio, PDFs, até mesmo uma URL. Veja os resultados do próprio Alibaba e um fluxo de trabalho que você pode executar hoje.

Você montou uma pasta para um anúncio de 15 segundos. Duas imagens de personagens. Um vídeo de tom de marca que o cliente enviou. Um brand book que existe apenas como PDF. Uma amostra de voz do ator que você realmente quer.

Então você abriu seu modelo de vídeo e ele pediu uma imagem.

Então você fez o que todo mundo faz. Traduziu a pasta em um prompt de 800 palavras e rezou. O rosto se desviou no terceiro take. A cor da jaqueta mudou. A voz era de outra pessoa completamente.

A referência omni do Wan 3.0 é a primeira vez que um modelo de vídeo diz: certo, me dê a pasta. Até 20 assets em uma única chamada, em cinco tipos de entrada, mantidos juntos em uma única tomada contínua de 30 segundos.

Este artigo faz três coisas e pula o resto. Ele detalha o que esses 20 assets realmente são, usa os próprios clipes gerados pela Alibaba como evidência e fornece um fluxo de trabalho equivalente que você pode executar hoje, porque o Wan 3.0 ainda está em beta público na nuvem da própria Alibaba e ainda não pode ser chamado de plataformas de terceiros.

Principais conclusões

  • A referência multimodal do Wan 3.0 aceita até 20 assets em uma chamada, abrangendo imagens, vídeos, áudio, documentos e páginas da web ao vivo, e os mantém consistentes em uma única tomada de 30 segundos.
  • É o primeiro modelo de vídeo mainstream a tratar um PDF, uma apresentação de slides ou uma URL como uma entrada criativa, em vez de algo que você parafraseia em um prompt.
  • O Wan 3.0 entrou em beta público em 6 de agosto de 2026 no Alibaba Cloud Model Studio e Qwen Cloud como wan3.0-video. É de pesos fechados. Quem disser que já é Apache 2.0 está supondo.
  • O título de 20 assets não é onde ele realmente se destaca. Modelos de referência para vídeo que você pode chamar agora já aceitam mais de 20 assets. A diferença são documentos e páginas da web, não a quantidade.
  • Você pode testar o formato de dois personagens, referência travada e totalmente dublado gratuitamente com o gerador gratuito de esquetes de anúncios com IA da Atlas Cloud: quatro fotos de produto como entrada, um esquete falado de 15 segundos como saída, sem cartão de crédito.

Dois gatos, um fofo e um preto, correndo por um corredor grandioso de hotel

Dois gatos perseguidos por cinco cenários diferentes pelo Wan 3.0 sem deriva de personagem_Duas imagens de referência. Cinco cenários completamente diferentes, de um corredor de hotel a um tambor de máquina de lavar a uma cabine telefônica vermelha. Nem um quadro de deriva. Fonte: Manual oficial do criador do_ Wan 3.0 da Alibaba, agosto de 2026, que também é a origem de todos os outros clipes do Wan 3.0 neste artigo.

Por que o vídeo com múltiplas referências falha e o que a referência multimodal do Wan 3.0 muda

Modelos de vídeo não têm memória entre clipes. Cada geração começa do zero. Esse é o problema inteiro em uma frase.

Então, no momento em que sua história precisa de mais de um take, você está costurando. O take um te dá um rosto que você ama. O take dois te dá um primo desse rosto. O take três silenciosamente muda a jaqueta de ameixa para bordô, e quando você percebe, já pagou por onze renderizações.

A referência de imagem única ajudou, mas só travava uma coisa. Um rosto. Não conseguia segurar simultaneamente um rosto, uma roupa, um adereço, um local e uma voz, porque havia um slot e cinco trabalhos.

Existem duas saídas. Dar ao modelo mais slots, ou parar de fazê-lo começar de novo. O Wan 3.0 faz as duas coisas ao mesmo tempo, e é por isso que os dois recursos principais são na verdade um recurso só. Uma tomada nativa de 30 segundos significa que não há corte para o personagem se desviar. Vinte assets de referência significa que cada elemento que precisa permanecer fixo ganha seu próprio slot dedicado em vez de lutar por um.

Aqui está como isso se parece quando nada é costurado. Trinta segundos, uma câmera contínua, uma criança em um carrinho de compras que acaba incorporada em um outdoor e depois sai andando por baixo dele.

30 segundos completos em uma passagem, sem cortes, com a trilha sonora gerada na mesma passagem. Fonte: Manual oficial do criador do Wan 3.0 da Alibaba.

O que "20 assets" realmente significa dentro da referência multimodal do Wan 3.0

Vinte é um número chamativo. O que importa é que os vinte não são todos do mesmo tipo. A referência omni do Wan 3.0 cobre cinco tipos de entrada, e cada um controla um eixo diferente da saída.

Imagens controlam identidade. Um cartão de personagem, uma foto de produto, uma placa de localização. O Wan 3.0 chama isso de consistência em nível de pixel, e nos próprios exemplos da Alibaba a trava se estende além do rosto para o guarda-roupa: o manto cinza em camadas, o gibão de couro com alças, a faixa escura na cintura, todos sobrevivem a uma luta corporal de dezesseis segundos em três locais.

Jovem em vestes tradicionais chinesas ao ar livre ao pôr do sol

Dois cartões de personagem conduzindo uma cena de luta wuxia com detalhes de figurino mantidos quadro a quadro

Dois cartões de personagem mais uma placa de localização do banco de juncos. O guarda-roupa e o cenário se mantêm em cada arremesso. Mostrado aqui como um GIF silencioso; o arquivo entregue carrega uma mixagem estéreo de 44,1 kHz. Fonte: Manual oficial do criador do Wan 3.0 da Alibaba.

Áudio controla voz. Esta é a parte que torna "multimodal" mais que marketing. Você anexa uma amostra de voz por personagem, escreve as falas no prompt, e o diálogo volta nesse timbre, com sincronia labial, na mesma passagem que a imagem. Duas pessoas, duas referências de voz, uma academia.

Duas imagens de sujeito mais dois clipes de referência de voz separados, e o diálogo volta nessas duas vozes. Vale a pena ligar o som para este. Fonte: Manual oficial do criador do Wan 3.0 da Alibaba.

Vídeo controla tempo. Um vídeo de referência não está lá para ser copiado. Está lá para doar seu ritmo: quanto tempo uma batida dura, como uma transição se move. Neste, cinco keyframes fornecem os sujeitos e um vídeo de referência fornece a cadência de virada de cartão horizontal entre eles.

Mulher com cocar tradicional chinês elaborado e vestido azul bordado

Cinco keyframes virados com o ritmo extraído de um vídeo de referência_Cinco_ imagens keyframe para os sujeitos, um vídeo de referência para o ritmo de virada. Fonte: Manual oficial do criador do Wan 3.0 da Alibaba.

Documentos e páginas da web controlam estrutura. Esta é a novidade genuína. O Wan 3.0 aceita arquivos de documento e URLs ao vivo como entrada criativa, e relatos sobre o beta listam .doc, .xls, .ppt, .pdf e .txt entre os formatos aceitos (AlphaSignal, agosto de 2026). A mesma lógica já funciona com uma imagem de storyboard: um storyboard como entrada, seis takes como saída, na própria ordem do storyboard.

Duas pessoas com guarda-chuvas em uma plataforma de estação de trem chuvosa

Uma única folha de storyboard expandida em seis takes sequenciais em uma plataforma de trem chuvosa

Uma folha de storyboard como referência, seis takes gerados em sua ordem, até o bilhete passando de mãos no take cinco. Fonte: Manual oficial do criador do Wan 3.0 da Alibaba.

Primeiro e último quadros controlam endpoints. O truque mais antigo do livro, ainda suportado, ainda a maneira mais rápida de delimitar um take.

Aqui está como isso se compara à versão que a maioria das pessoas está realmente usando hoje.

Wan 2.7 Referência-para-VídeoWan 3.0 referência omni
Assets de referênciauma imagem por sujeito, até 3 vídeos, 1 clipe de vozaté 20 assets no total
Modalidadesimagem, vídeo, áudioimagem, vídeo, áudio, documento, página web
Duração máxima, uma passagem10 s30 s nativo, mais duração inteligente
Áudio na mesma passagemsimsim
Edição e extensão de vídeonão expostoedição baseada em instrução e referência, mais extensão
Disponibilidadeao vivo em APIs de terceirosAlibaba Cloud Model Studio e Qwen Cloud beta

Há uma regra que ninguém coloca na documentação e todo mundo aprende da maneira mais difícil: uma referência, um trabalho. Imagem1 trava o rosto e a roupa. Vídeo1 doa apenas movimento. Áudio1 doa apenas timbre. No momento em que você dá a um único asset dois trabalhos conflitantes, ou carrega uma imagem de referência com duas pessoas, o modelo tem que adivinhar, e adivinhar é exatamente o que você estava tentando evitar. O manual da Alibaba também é direto sobre isso: um sujeito por imagem de referência.

O fluxo de trabalho de referência multimodal do Wan 3.0 que você pode executar hoje

Resposta direta primeiro. O Wan 3.0 está em beta público na nuvem da própria Alibaba, sob o ID de modelo wan3.0-video (Alibaba Wan, agosto de 2026). Ainda não chegou a plataformas de API de terceiros, incluindo a Atlas Cloud. Quem estiver vendendo acesso à API do Wan 3.0 agora está revendendo outra coisa.

O que chegou é a forma do fluxo de trabalho. Pacote de referência como entrada, uma chamada, clipe finalizado com som como saída. Isso funciona hoje em modelos de referência para vídeo que você pode chamar em uma aba do navegador, e quando você os alinha, o título de 20 assets parece diferente.

ModelAssets de referênciaModalidadesDuração máximaÁudio nativoPreço por segundo
Wan 3.0 (beta Alibaba, não na Atlas)20 totalimagem, vídeo, áudio, documento, página web30 sSimreportado $0,05 a $0,20 por resolução
Wan 2.7 Referência-para-Vídeo1 imagem por sujeito, 3 vídeos, 1 clipe de vozimagem, vídeo, áudio10 sSim$0,10
Seedance 2.5 Referência-para-Vídeo50 (30 imagem / 10 vídeo / 10 áudio)imagem, vídeo, áudio30 sSim$0,13
MiniMax H3 Referência-para-Vídeomisto, sem limite declaradoimagem, vídeo, áudio15 sSim$0,10
Kling Video O3 Pro Referência-para-Vídeo7 imagens, ou 4 imagens + 1 vídeoimagem, vídeo15 sSim$0,10
Vidu Q3-Mix Referência-para-Vídeo4 imagensimagem16 sSim$0,11
Veo 3.1 Referência-para-Vídeo3 imagensimagem8 sOpcional$0,20

Os preços são as taxas da Atlas Cloud em agosto de 2026. Os valores do Wan 3.0 são os reportados para o beta da Alibaba Cloud, não uma taxa da Atlas, e a Alibaba não publicou uma página de preços pública para o modelo ainda, então trate essa linha como provisória.

Leia essa tabela duas vezes e a história real aparece. O título de 20 assets não é onde o Wan 3.0 se destaca, porque o Seedance 2.5 já aceita 50 e iguala os 30 segundos. O que mais nada nessa lista aceita é um PDF.

Para o passo a passo abaixo, a demo roda no Wan 2.7 Referência-para-Vídeo, porque sua forma de entrada é o parente vivo mais próximo da referência omni: múltiplas imagens de sujeito, um vídeo de referência opcional e um clipe de voz, todos mapeados para os rótulos character1 e character2 dentro do prompt. Três modelos, uma aba do navegador, sem instalação local.

Construa você mesmo: uma cena de referência multimodal em quatro etapas

A cena: uma recepção de hotel em tons pastel. Um concierge de cara fechada. Um viajante segurando um gato persa. O concierge olha diretamente para a lente e diz: "O gato tem reserva. Você não."

Duas imagens mais um clipe de voz, que são três assets de referência em duas modalidades. Essa é a menor construção que é honestamente multimodal, em vez de apenas multi-imagem.

Etapa 1. Gerar imagem de referência 1, o sujeito que você deve travar

Imagens de referência têm três trabalhos e apenas três: um sujeito, de frente para a câmera, fundo limpo. Todo o resto é decoração. Use GPT Image 2 com qualidade high, tamanho 16:9, n=1.

Plain
1Retrato de corpo inteiro em estúdio de um concierge de hotel de meia-idade com expressão impassível, em pé bem no centro contra uma parede lisa rosa empoeirado. Ele usa um uniforme de recepcionista roxo-ameixa trespassado com detalhes dourados e botões de latão, um pequeno chapéu redondo de cúpula e um bigode fino. Enquadramento perfeitamente simétrico, luz frontal suave e uniforme, sem sombra projetada na parede, grão de filme 35mm, paleta pastel suave. Apenas um sujeito, sem outras pessoas, sem texto, sem logotipo, sem adereços no quadro.

Interface do gerador de imagens com IA mostrando etapas numeradas e um concierge gerado

Playground do GPT Image 2 na Atlas Cloud com o retrato de referência do concierge renderizado no painel de saída

GPT Image 2 na Atlas Cloud: qualidade alta, 16:9, um sujeito, fundo liso. Este é o arquivo que se torna character1.

Etapa 2. Gerar imagem de referência 2, o segundo sujeito travado

Mesmo modelo, mesmas configurações. O contraste de cor entre os dois personagens é intencional, pois dá ao modelo uma maneira fácil de mantê-los separados quando compartilham um quadro.

Plain
1Retrato de corpo inteiro em estúdio de uma jovem viajante segurando um gato persa fofo contra o peito, em pé bem no centro contra uma parede lisa amarelo-mostarda. Ela usa um casaco de lã mostarda, uma boina vermelha e óculos redondos de tartaruga, e segura uma pequena mala de couro vintage na mão livre. Enquadramento perfeitamente simétrico, luz frontal suave e uniforme, sem sombra projetada na parede, grão de filme 35mm, paleta pastel suave. Apenas um sujeito, sem outras pessoas, sem texto, sem logotipo.

Etapa 3. Gerar a referência de voz, que é a parte verdadeiramente multimodal

O clipe de voz é o que transforma isso de um trabalho multi-imagem em um multimodal. O slot de áudio do Wan 2.7 quer uma amostra curta, aproximadamente de 1 a 10 segundos, então mantenha a linha curta. Use MiniMax Speech 2.6 HD e escolha uma voz masculina grave, plana e imperturbável.

Plain
1Boa noite. Fazendo check-in? Claro. Todo mundo está.

Etapa 4. Uma chamada, três referências, um clipe finalizado

Agora o pacote inteiro vai junto no Wan 2.7 Referência-para-Vídeo. Configurações: resolution: 1080P, ratio: 16:9, duration: 10, que é o teto deste modelo, prompt_extend: false, seed: -1. Carregue images em ordem, etapa 1 primeiro, para que mapeie para character1, depois etapa 2 como character2, e anexe o arquivo da etapa 3 a audio.

Plain
1Plano aberto simétrico, bem no centro, de um saguão de hotel em tons pastel com balcão de recepção, paredes rosa empoeirado e um porta-chaves amarelo-mostarda atrás dele. character1 é o concierge atrás do balcão; character2 é a viajante na frente do balcão, ainda segurando seu gato persa. A câmera avança lentamente ao longo de um eixo central perfeito e nunca inclina. character1 olha diretamente para a lente e diz de forma monótona: "O gato tem reserva. Você não." character2 pisca uma vez, vira a cabeça lentamente em direção ao gato, depois volta para o balcão. O gato olha fixamente para a câmera sem se mover. Grão de filme 35mm, iluminação suave e uniforme, paleta pastel suave, sem trepidação de câmera, sem cortes.

Prompt negativo:

Plain
1trepidação manual, jump cuts, legendas, texto na tela, marca d'água, pessoas extras, mãos deformadas, morfismo facial, mudança de cor, desfoque de movimento

Captura de tela da interface de um gerador de vídeo com IA com entrada e saída

Playground do Wan 2.7 Referência-para-Vídeo na Atlas Cloud com duas imagens de referência e um arquivo de áudio carregados e o clipe finalizado no painel de saída

Wan 2.7 Referência-para-Vídeo na Atlas Cloud: duas imagens de referência e um clipe de voz anexados à esquerda, o take finalizado tocando à direita em 1080P e 16:9. Esta captura rodou na duração padrão do modelo; defina para 10 para a versão completa abaixo.

O clipe finalizado. Ambos os rostos mantidos, ambas as roupas mantidas, e a fala entregue na voz clonada da etapa 3, então vale a pena reproduzir com som.

Mulher segurando um gato no balcão de recepção de hotel com recepcionista

Os dois retratos de referência ao lado de um quadro do clipe finalizado, mostrando os mesmos rostos e roupas

Referências à esquerda, um quadro do clipe entregue à direita. Os detalhes do uniforme, a boina, os óculos e o gato sobrevivem à viagem.

Variações do fluxo de trabalho de referência multimodal do Wan 3.0

Aumente para 30 segundos. O mesmo pacote de referência roda no Seedance 2.5 Referência-para-Vídeo com duration: 30, o que lhe dá a duração que o Wan 3.0 promete sem esperar pelo beta. Ele aceita até 30 imagens de referência, 10 vídeos e 10 clipes de áudio, então o pacote tem espaço para crescer. Escreva os 20 segundos extras como batidas no prompt, não como vibrações, ou o modelo vai preencher.

Interface do gerador de vídeo com IA mostrando configurações de entrada e progresso da geração

Playground do Seedance 2.5 Referência-para-Vídeo na Atlas Cloud com duração definida para 30 e o take longo renderizado

Seedance 2.5 Referência-para-Vídeo na Atlas Cloud com duração definida para 30 e os mesmos dois retratos de referência anexados, capturado no meio da geração. Observe os chips @image1 e @image2 no prompt: é assim que você diz ao Seedance qual referência desempenha qual papel. Verifique o preço cotado no botão Executar antes de confirmar, pois ele reflete a duração que o trabalho realmente enviará.

A versão de 30 segundos da mesma cena, mesmo pacote de referência, batidas escritas take por take.

Adicione um vídeo de referência apenas para movimento. Anexe um clipe cujo ritmo você goste e diga explicitamente no prompt, algo como "siga o vídeo de referência apenas para o ritmo de corte, ignore seus sujeitos e cenário". Esse é o truque por trás do exemplo de virada de cartão acima.

Corrija a deriva com o prompt negativo antes de tocar no positivo. Morfismo facial, mudança de cor e trepidação manual são os três que arruínam takes com referência travada, e geralmente são mais baratos de suprimir do que de descrever.

Teste o formato de referência multimodal gratuitamente

Se você quer a forma disso antes de querer os parâmetros, a Atlas Cloud lançou um gerador gratuito de esquetes de anúncios com IA na semana passada que executa a mesma cadeia sem nenhum dos botões.

Você escreve uma linha sobre seu produto e seus pontos de venda. Ele escreve um roteiro de comédia de dois personagens para você, gancho, conflito, reviravolta, depois renderiza um vídeo de 15 segundos com diálogo falado e efeitos sonoros integrados. Você pode anexar até quatro fotos reais de produto como referências, e o anúncio mantém sua forma, cor, rótulo e logotipo do roteiro ao quadro final. Seis estilos vêm com ele, desde meme engraçado passando por reviravolta e sitcom até luxo e venda difícil, e o diálogo volta no idioma em que você escreveu a descrição.

Essa é a mesma cadeia de dois personagens mais imagens de referência mais voz do tutorial, menos a escrita do prompt e menos a conta. O que a torna uma maneira decente de descobrir se esse formato se adequa ao seu produto antes de gastar qualquer coisa ajustando-o.

Para ter uma ideia do que uma pilha de imagens de referência faz em uma peça de produto, esta é a própria versão do Wan 3.0 do trabalho: cinco imagens como entrada, um reel de lançamento como saída, cada imagem ancorando uma batida da edição.

Pilha animada flutuante de cartões brancos e verde-menta

Cinco imagens de referência expandidas em um reel de lançamento de produto estilo Material Design_Cinco imagens de referência conduzindo um filme de produto de nove segundos, cada uma ancorando uma batida e passando para a próxima. Fonte: Manual oficial do criador do Wan 3.0 da Alibaba._

Quanto custa um clipe de referência multimodal do Wan 3.0

EtapaModelPreço unitárioQuantidadeCusto
1 e 2, duas imagens de referênciaGPT Image 2$0,009 por imagem2$0,02
3, referência de vozMiniMax Speech 2.6 HD$0,08 por 1K caracteres49 caracteres$0,00
4, o take de 10 segundos em 1080PWan 2.7 Referência-para-Vídeo$0,15 por segundo em 1080P10 s$1,50
Total do tutorialcerca de $1,52
Variação, 30 segundosSeedance 2.5 Referência-para-Vídeo$0,134 por segundo em 480P30 scerca de $4,02
Rota gratuitaGerador gratuito de esquetes de anúncios com IAgratuito1 clipe, 15 s$0

Essas são as próprias taxas da plataforma, verificadas em agosto de 2026 e cobradas conforme o uso. Duas coisas movem o total mais do que as pessoas esperam. A resolução é a primeira: os $0,10 por segundo na tabela de comparação é a taxa base do Wan 2.7, e 1080P cobra a $0,15, que é de onde vêm os $1,50 acima. A segunda é que o Seedance precifica por contagem de pixels, então seus $0,134 listados por segundo são o valor para 480P e um take em 720P custa mais do que uma multiplicação direta sugere. Para referência, a taxa reportada do beta do Wan 3.0 de $0,20 por segundo em 1080p colocaria um take completo de 30 segundos em cerca de $6, o que é mais do que a rota Seedance em 480P hoje.

Uma nota sobre usar isso. O Wan 3.0 é um beta e seus termos podem mudar, então releia-os antes de construir um pipeline nele. Se suas imagens de referência são pessoas reais, obtenha permissão primeiro, já que referência-para-vídeo é precisamente a capacidade que torna isso importante. Os clipes de exemplo neste artigo são resultados gerados pela própria Alibaba a partir de seu manual público do criador, reproduzidos aqui para comentário.

Perguntas frequentes

Quantas referências a referência multimodal do Wan 3.0 pode realmente aceitar?

Até 20 assets em uma única chamada, extraídos de imagens, vídeos, áudio, documentos e páginas da web. O limite prático é menor que o técnico. Atribua a cada asset exatamente um trabalho, um sujeito por imagem, e você usará muito menos de 20 para a maioria das cenas.

O Wan 3.0 pode realmente transformar um PDF ou uma página da web em um vídeo?

Sim, essa é a parte verdadeiramente única. Junto com texto, imagem, áudio e vídeo, ele aceita arquivos de documento e URLs ao vivo, com relatos sobre o beta listando .doc, .xls, .ppt, .pdf e .txt. Nenhum outro modelo de referência para vídeo na tabela de comparação acima aceita um documento.

O Wan 3.0 é open source? Posso executá-lo no ComfyUI?

Não, e não agora. O Wan 3.0 é um beta fechado rodando na nuvem da própria Alibaba. Gerações anteriores do Wan foram lançadas abertamente, e é por isso que a expectativa existe, mas a Alibaba não confirmou pesos para o 3.0. Páginas que afirmam um lançamento Apache 2.0 de 1,3B ou 14B do Wan 3.0 não são apoiadas por nada oficial.

O Wan 3.0 está disponível através de APIs de terceiros?

Ainda não, incluindo a Atlas Cloud. O mais próximo que você pode chamar hoje é o Wan 2.7 Referência-para-Vídeo, cuja forma de entrada corresponde quase exatamente à referência omni, exceto pelas modalidades de documento e página da web, ou o Seedance 2.5 Referência-para-Vídeo se você precisar dos 30 segundos completos.

Qual é a maneira mais barata de testar um vídeo de dois personagens com referência travada?

O gerador gratuito de esquetes de anúncios com IA vinculado acima. Quatro fotos de referência como entrada, um clipe falado de dois personagens de 15 segundos como saída, sem parâmetros e sem gastos. Se ele segurar seu produto e seu formato, então vá ajustar a cadeia paga.

Por que meus personagens ainda derivam mesmo com imagens de referência?

Três causas, em ordem de frequência. Uma referência está carregando dois trabalhos, então está sendo solicitada a fixar tanto o rosto quanto o local. A imagem de referência tem mais de uma pessoa ou um fundo ocupado, então o modelo não sabe qual parte travar. Ou a deriva é um artefato de renderização em vez de uma falha de referência, nesse caso coloque morfismo facial, mudança de cor no prompt negativo antes de reescrever qualquer coisa.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos