
Dois monitores de edição lado a lado exibindo a mesma tomada de posto de gasolina no deserto, um com uma linha do tempo contínua de 30 segundos abaixo e outro com uma linha do tempo dividida em dois segmentos
No segundo 20, o bico de combustível jorra grama verde fresca. Ainda coberta de água. O cavalo aperta os olhos de prazer. O palito do atendente cai da boca.
Essa piada só funciona dentro de uma única tomada contínua de 30 segundos. Junte quatro clipes de 8 segundos e o cavalo muda de pelagem, os óculos escuros mudam de forma, o céu muda um tom mais quente e a piada morre em algum lugar nas emendas.
Então, quando Wan 3.0 e Seedance 2.5 chegaram na mesma janela, ambos afirmando 30 segundos nativos, uma passagem, sem emendas, deixou de ser uma história de benchmark. Tornou-se a primeira vez que um modelo de vídeo de IA conseguiu manter uma configuração, uma virada e um desfecho em uma única tomada.
Eu analisei as especificações, fiz uma verificação de especificações contra os arquivos de demonstração publicados pela própria Alibaba e descobri a coisa que ninguém escrevendo sobre isso publicou: ambos os modelos dizem 30 segundos, mas a resolução por trás desses 30 segundos não é o mesmo produto.
Principais Conclusões
- Ambos os modelos realmente geram 30 segundos em uma única passagem. Essa parte não é marketing. Wan 3.0 cobre de 2 a 30 segundos com uma opção de duração inteligente, Seedance 2.5 cobre de 4 a 30 segundos.
- Apenas Wan 3.0 renderiza 1080p nativo em 30 segundos. Seedance 2.5 gera nativamente apenas em 480p e 720p. Suas opções 1080p, 1440p e 4K são upscales pós-geração de uma fonte de 720p, e sua própria documentação da API afirma que o nível 4K "não é geração 4K nativa".
- Seedance 2.5 vence em volume de referência: até 30 imagens mais 10 vídeos mais 10 arquivos de áudio, 50 no total. O manual do criador de Wan 3.0 limita as referências a 20.
- Wan 3.0 tem uma entrada que ninguém mais tem: arquivos
.doc,.xls,.ppt,.pdf,.txte páginas da web ao vivo, alimentados diretamente como referências criativas. - Apenas um dos dois é realmente executável fora da Alibaba hoje. Wan 3.0 está em beta pública no Alibaba Cloud Model Studio e Qwen Cloud, com acesso de API de terceiros ainda em implantação. Seedance 2.5 está ativo na Atlas Cloud com 30 no controle de duração agora.
- Quer testar a estrutura de história de 30 segundos antes de pagar por um único segundo? O gerador gratuito de anúncio de esboço de IA da Atlas Cloud oferece uma execução gratuita: um anúncio finalizado de 15 segundos com diálogo falado e efeitos sonoros, download sem marca d'água.
Demonstração oficial do Wan 3.0 da Alibaba, do manual do criador Tongyi Wan 3.0. Uma tomada, sem cortes, 30,07 segundos. Medido com ffprobe: 1920x1072, 24fps, áudio AAC estéreo incorporado. Som ligado para o movimento da cauda e o palito batendo no chão no segundo 29. Usado aqui como material de referência para comparação e comentário apenas.
Wan 3.0 vs Seedance 2.5 Nativo 30s: O Que Realmente Mudou Este Mês
Quinze segundos foi o limite por muito tempo. Wan 2.7 termina aí. Seedance 2.0 terminou aí. Todo "filme de IA de um minuto" que você viu no seu feed no último ano eram quatro a oito clipes colados em um NLE, com uma passagem de colorista para esconder as junções.
Duas coisas quebraram esse limite nas mesmas poucas semanas. A Alibaba abriu o beta público do Wan 3.0 em 6 de agosto de 2026 com geração nativa de 30 segundos e entrada de referência multimodal completa (AlphaSignal, agosto de 2026). A ByteDance dobrou o Seedance de 15 para 30 segundos no 2.5, posicionando-o explicitamente como uma forma de cortar a emenda de clipes e o desvio visual que vem com ela.
Nativo importa aqui em um sentido técnico específico. Significa uma passagem direta sobre uma única sequência latente, não extensão do último quadro onde o modelo pega o quadro final do clipe A e inicia o clipe B a partir dele. Extensão é a razão pela qual a gola da jaqueta do seu personagem muda silenciosamente de forma entre as tomadas. Uma passagem nativa tem os 30 segundos inteiros no mesmo contexto, então o cavalo permanece o mesmo cavalo.
A demonstração do posto de gasolina é o teste mais limpo possível disso. A estrutura é de quatro batidas: 0 a 8 segundos de nada acontecendo, 8 a 16 de algo estranho acontecendo, 16 a 24 para o desfecho, 24 a 30 para a saída. A piada acontece no segundo 20. O que significa que ela só funciona se o cavalo, os óculos escuros, a gradação teal-e-laranja e a câmera travada e sem expressão sobreviverem aos primeiros 19 segundos intocados. A emenda não consegue fazer isso. Não porque o editor é ruim, mas porque o clipe B nunca viu o clipe A.
Wan 3.0 vs Seedance 2.5 Nativo 30s: Onde a Imagem Realmente Quebra
Trinta segundos é o dobro de quinze. O risco de desvio não é duas vezes maior, é pior que isso, e ele se move para um modo de falha diferente.
As falhas do fluxo de trabalho emendado estavam entre os clipes. As falhas do nativo de 30s estão dentro do clipe. Em uma produção prática de curta-metragem com Seedance 2.5, o revisor encontrou decoerência e morfismo aparecendo como "instabilidade visual ou espículas em modelos de personagens", concentradas em sequências de ação rápida, e observou especificamente que esses artefatos não podem ser limpos por upscaling (MindStudio, agosto de 2026). Essa é a parte que importa para qualquer um que planeje renderizar em 720p e fazer upscale para 4K depois: o upscaler nitifica o morfismo, não o remove.
A mesma produção registrou uma proporção de captação de 3,2 para 1. Aproximadamente 450 segundos de geração bruta para cortar um final de 2 minutos e 22 segundos. Planeje o trabalho de tomada longa como uma filmagem com cobertura, não como uma fila de renderização onde cada trabalho é enviado.
Mais duas descobertas dessa produção valem a pena serem roubadas diretamente. A identidade visual em todo o filme se baseou em três imagens de referência, dois retratos de personagens e uma placa de localização, mesmo que o sistema aceite até 50. E na seleção de voz, escrever "Americano" corrigiu um sotaque britânico não intencional, enquanto escrever "Inglês Americano" não corrigiu, porque a palavra "Inglês" empurrou a entrega de volta para uma leitura britânica.
A estrutura de prompt que sobrevive a 30 segundos é aquela que a Alibaba usa em seu próprio manual: batidas explícitas com carimbo de tempo. Não um parágrafo de vibes. Escreva 0-8s, 8-16s, 16-24s, 24-30s, dê a cada bloco seu próprio comportamento de câmera e seu próprio evento, e termine com uma única linha de áudio cobrindo todo o clipe. Você verá esse esqueleto exato no Passo 4 abaixo, porque mantive a estrutura da Alibaba e apenas traduzi.
Wan 3.0 vs Seedance 2.5 Nativo 30s: Especificações, Preço e O Que Você Pode Executar Hoje
Aqui está o estado honesto do jogo, e a parte onde os dois modelos deixam de ser produtos comparáveis.
Leia a linha de resolução duas vezes, porque é o artigo inteiro. A própria documentação da API Seedance 2.5 Texto-para-Vídeo da Atlas Cloud afirma que 720p-esr melhora uma fonte de 480p, que 1080p-esr, 1440p-esr e 4k-esr melhoram todas uma fonte de 720p, e que a opção 4K entrega um lado curto de 2160 pixels "não geração 4K nativa". Portanto, um clipe Seedance de 30 segundos rotulado como 4K é 720p de detalhe real, reamostrado. A tabela de preços do Wan 3.0, por outro lado, tem um nível direto de 1080p a $0,20 por segundo, e os arquivos de demonstração de 30 segundos publicados pela própria Alibaba medem 1920x1072.
O lado positivo dessa restrição: o teste inteiro roda em uma aba do navegador, em três modelos, sem configuração local.
| Papel neste teste | Modelo | Preço listado |
|---|---|---|
| Quadro de abertura | GPT Image 2 Texto-para-Imagem | a partir de $0,009 / imagem |
| A execução nativa de 30s | Seedance 2.5 Texto-para-Vídeo | a partir de $0,134 / SEG |
Preços listados verificados nas páginas de modelo da Atlas Cloud, agosto de 2026. Leia-os como pisos, não cotações. Cada um desses modelos cobra pelo que você realmente pede, e o botão Executar precifica suas configurações exatas antes de você clicar. Neste teste, o botão cotou $0,1745 para um quadro GPT Image 2 em qualidade alta e 2048x1152, e $1,514799 para um trabalho Seedance 2.5 de cinco segundos em 720p e 16:9, o que equivale a aproximadamente $0,30 por segundo, em vez dos $0,134 listados. O valor listado é a taxa de 480p. Verifique o botão, não o catálogo. Seedance 2.5 também oferece um endpoint referência-para-vídeo ao mesmo preço de $0,134 por segundo, se você quiser atingir o limite de 50 referências.
Como Reproduzir Este Teste Nativo de 30s no Seedance 2.5
Cinco passos, três modelos, tudo no navegador. Copie os prompts literalmente.
Passo 1: Fixe o Esqueleto de 30s com Carimbo de Tempo
Não execute nada ainda. Leia a estrutura primeiro, porque esta é a parte que decide se seus 30 segundos se sustentam.
A demonstração do posto de gasolina Wan 3.0 no topo deste artigo é construída como quatro blocos rotulados com uma doutrina de câmera fixa declarada uma vez no início: observação objetiva e calma, planos médios travados, close-ups extremos repentinos apenas nas batidas absurdas. Cada evento está fixado a um intervalo de tempo. O áudio é uma linha no final cobrindo todos os 30 segundos.
Aqui está o esqueleto, vazio. Preencha-o e você terá um prompt que um modelo nativo de 30s pode realmente rastrear:
Plain1Um [gênero] de 30 segundos ambientado em [lugar]. [Estilo visual, gradação, saturação]. Linguagem de câmera: [doutrina], pontuada por [exceção]. 2 30-8s: [configuração, plano aberto, estabelecer o mundo normal, introduzir a anomalia no horizonte] 4 58-16s: [a anomalia age, ainda tratada como normal, um ponto de vista ou inserção de reação] 6 716-24s: [o desfecho, close-up extremo na própria coisa, corte seco para o rosto de reação] 8 924-30s: [a saída, um pequeno botão físico que fecha a piada] 10 11Áudio: [ambiente, três ou quatro sons diegéticos específicos, um último som pequeno]. Sem música, sem diálogo, sem texto na tela.
A especificação mensurável do arquivo de referência da Alibaba, para quem quiser verificar meus números: 30,07 segundos, 1920x1072, 24fps, AAC estéreo. Essa é a barra contra a qual a execução do Seedance está sendo medida.
Passo 2: Gere o Quadro de Abertura
Você precisa de uma âncora visual fixa para que as execuções de 15 e 30 segundos comecem a partir do mesmo mundo. Abra o GPT Image 2 Texto-para-Imagem.
Configurações: qualidade alta, proporção 16:9, 1 imagem.
Plain1Um plano de estabelecimento amplo e completamente parado de um posto de gasolina solitário estilo Route 66 em um deserto brilhante. Edifício retrô amarelo-laranja-e-azul, tinta levemente desbotada pelo sol; uma bomba de combustível vermelha vintage desbotada na frente; uma pequena loja de conveniência ao lado com uma máquina de venda de refrigerante desbotada perto da porta. Terra seca laranja rachada em primeiro plano, montanhas terracota quentes ao fundo, céu azul ciano limpo e sem nuvens. Um atendente de posto em macacão azul engordurado e óculos escuros pretos enormes cochila meio adormecido em uma cadeira perto da porta, palito na boca. Gradação de cores estrita teal-e-laranja brilhante, alta saturação, alto brilho, fotorrealismo cinematográfico, câmera travada, 16:9.

Playground GPT Image 2 na Atlas Cloud com qualidade definida como alta e 16:9, a tomada de estabelecimento do posto Route 66 gerada no painel de saída
GPT Image 2 na Atlas Cloud: qualidade alta, 16:9, uma imagem. O botão Executar cotou $0,1745 para este quadro, que é o que uma renderização de alta qualidade 2048x1152 realmente custa. Os $0,009 na página do modelo é o piso.

Quadro de estabelecimento do posto Route 66 gerado com GPT Image 2, céu teal e terra laranja rachada, atendente cochilando perto da porta
O quadro de abertura. Esta é a entrada para o Passo 3 e o alvo visual para o Passo 4. Gerado com openai/gpt-image-2.
Passo 3: Atinga o Limite de 15 Segundos
Configurações: primeiro quadro = sua saída do Passo 2, duração arrastada para o máximo de 15, resolução 1080P.
Plain1Plano aberto travado se mantém. Uma vaqueira de chapéu de aba larga monta um cavalo real vindo do horizonte a passo. O atendente cochilando é acordado pelos cascos, empurra os óculos para cima, senta-se ereto, mascando o palito, sem se impressionar. Ela desmonta limpo, leva o cavalo direto para a bomba de combustível vintage. Gradação teal-e-laranja brilhante, alta saturação, fotorrealismo, câmera de observação calma, sem cortes.
O menu suspenso para em 15. Esse é o ponto principal deste passo. Seu desfecho está agendado para o segundo 20, e este pipeline não consegue atingir o segundo 20 em uma peça só. Para chegar lá, você geraria um segundo clipe a partir do último quadro, e no momento em que fizer isso, o cavalo é um cavalo novo.

Passo 4: Execute a Passagem Nativa Completa de 30s
Abra o Seedance 2.5 Texto-para-Vídeo.
Configurações: duração = 30, resolução = 720p, proporção = 16:9, gerar_áudio = ativado, formato_saída = mp4, marca d'água desativada.
Escolha 720p deliberadamente, não 1080p-esr. 720p é o teto real do modelo, então esta é uma comparação de pixel direta em vez de uma comparação com um upscaler.
O prompt abaixo é o próprio prompt de demonstração do posto de gasolina da Alibaba, traduzido fielmente do manual do criador Wan 3.0 e reestruturado em nada. Mesmas batidas, mesmos tempos, mesma doutrina de câmera, mesma lista de áudio.
Plain1Um curta de comédia pastelão absurdo de 30 segundos ambientado em um posto de gasolina estilo Route 66 desbotado pelo sol em um deserto brilhante. Fotorrealista, gradação estrita teal-e-laranja brilhante, alta saturação e alto brilho, para que o evento absurdo aconteça em um mundo completamente normal, quase bonito. Linguagem de câmera: observação calma e objetiva, principalmente planos médios travados e derrapagens laterais lentas, sem direcionamento emocional, pontuada por close-ups extremos repentinos nas batidas absurdas. 2 30-8s: Plano aberto, travado. Céu ciano, poeira à deriva. O posto retrô amarelo-laranja-e-azul fica sozinho à beira da estrada; um atendente em macacão azul engordurado e óculos escuros enormes cochila em uma cadeira, palito na boca. Apenas vento. No horizonte, uma vaqueira em um cavalo real aparece a passo. Corte para médio: cascos o acordam, ele empurra os óculos, senta-se, lê o par como "mais um pedindo informações." 4 58-16s: Ela não diz nada. Ela desmonta limpo, leva o cavalo direto para a bomba de combustível antiga. O cavalo casualmente coloca a cabeça ao lado da bomba como se já tivesse feito isso antes. Breve ponto de vista levemente olho de peixe por trás dos óculos dele, a mulher e o cavalo parecem ainda mais estranhos. Close: sua testa se franze, ele tira os óculos, prestes a gritar. Close-up em câmera lenta: enquanto os óculos saem, ela aponta o bico de combustível para a boca do cavalo e aperta o gatilho. 6 716-24s: Close-up extremo no bico. Sai não gasolina, mas jatos de grama verde brilhante e fresca, ainda coberta de água. Corte seco para um close-up extremo do rosto do atendente, congelado: olhos arregalados, boca ligeiramente aberta, palito esquecido no meio da mastigação. Médio: o cavalo come feliz, aperta os olhos de prazer, então dá um movimento satisfeito e poderoso de sua cauda, e a poeira que levanta cai diretamente no rosto ainda atordoado do atendente. 8 924-30s: "Tanque cheio" de grama. Ela pendura o bico de volta na bomba, tira moedas do bolso, caminha até a porta da loja e as deixa cair tilintando em uma lata na bancada. Ela olha de volta para o atendente petrificado; sob a aba do chapéu, o canto de sua boca se levanta uma fração. Ela remonta e cavalga para longe em uma trilha de poeira. A câmera empurra lentamente para ele: mesma postura congelada, rosto coberto de poeira, óculos ainda presos na mão, e finalmente o palito cai de sua boca com um pequeno clique. 10 11Áudio: vento seco do deserto ao longo de todo, cascos, o clang mecânico da alavanca da bomba, grama molhada jorrando, o movimento da cauda, moedas em uma lata, e um pequeno clique quando o palito atinge o chão. Sem música, sem diálogo, sem texto na tela.
Um aviso que economizará uma conta desperdiçada, e é a mesma armadilha do Passo 3: arraste o controle deslizante de duração para 30, não digite 30 na caixa de número. A caixa mostrará 30 feliz enquanto o controle deslizante permanece em seu padrão de cinco segundos, e o botão Executar cotará para cinco segundos. Verifique a cotação antes de clicar. Em 720p e 16:9, um trabalho de cinco segundos cotiza $1,514799, então uma passagem real de 30 segundos cotiza aproximadamente seis vezes isso.
Não há captura de tela de execução finalizada para este passo. Três tentativas de captura automatizada enviaram o padrão do controle deslizante em vez de 30 segundos, e em vez de mostrar um clipe de cinco segundos rotulado como um de 30 segundos, a captura foi omitida. O prompt e as configurações acima são exatamente o que colar e definir.
Passo 5: Leia o Desvio, Honestamente
Aqui está o lado Seedance 2.5 desse prompt exato, gerado em 30 segundos nativos, 720p, 16:9, áudio ligado.
Seedance 2.5, o mesmo prompt do posto de gasolina Wan 3.0 copiado literalmente: 30s nativos em uma geração, 1280x720, 24fps, áudio incorporado. Mesmas quatro batidas, vaqueira e cavalo chegando, a piada do bico de combustível, o close-up de dissonância cognitiva do atendente. Coloque-o ao lado do clipe Wan 3.0 no topo para uma leitura direta.
Coloque os dois clipes lado a lado e verifique cinco coisas específicas. Não verifique "qual parece melhor", isso é um argumento de gosto e vai desperdiçar sua tarde.
- Identidade da pelagem e da roupa. O cavalo é da mesma cor no segundo 29 e no segundo 6? Os óculos escuros são da mesma forma depois que saem e voltam para a mão dele?
- Estabilidade da gradação. Amostre o céu no segundo 2 e no segundo 28. A gradação teal-e-laranja tende a esquentar em gerações longas com mais frequência do que as pessoas esperam.
- A batida física no segundo 20. Grama saindo de um bico de combustível é uma solicitação de física. Ela arqueia e cai com peso, ou desaparece como uma textura?
- Disciplina da câmera. O prompt diz travada. Conte quantas vezes a câmera inventa um empurrão para dentro que não foi solicitado. Esta é a falha mais comum em geração longa: o modelo fica sem eventos programados e preenche o tempo com movimento.
- Morfismo em movimento rápido. O movimento da cauda e o chute de poeira são o movimento mais rápido no clipe. De acordo com as notas de produção do MindStudio, é exatamente onde a decoerência se concentra, e exatamente o que um upscale não vai corrigir.
Pontue esses cinco, não a vibe. Essa é uma comparação que você pode defender para um cliente.
Mais Três Prompts Correspondentes Wan 3.0 vs Seedance 2.5 Nativo 30s
Uma demonstração é uma anedota. Aqui estão mais três arquivos oficiais de 30 segundos do Wan 3.0 do mesmo manual, cada um estressando uma parte diferente do problema de 30 segundos. Para o monstro marinho e o monólogo de fantasia sombria, o lado Seedance 2.5 foi gerado no mesmo prompt em 30 segundos nativos e está incorporado logo após cada um, para que você possa assistir a ambos em vez de aceitar minha palavra.
| Prompt | O que testa de estresse | Arquivo oficial Wan 3.0, medido | Lado Seedance 2.5, mesmo prompt |
|---|---|---|---|
| Filme de desastre com monstro marinho | 10 tomadas roteirizadas mais uma trilha orquestral dentro de 30s | 1920x1072, 24fps, 30,07s, AAC | gerado a 30s, incorporado abaixo; um nome IP e o texto da marca do barco foram removidos para que o filtro de conteúdo do Seedance passasse, o storyboard é idêntico |
| Monólogo de fantasia sombria em inglês | voz em inglês nativa e sincronização labial em um empurrão contínuo lento | 1280x720, 24fps, 30,05s, AAC | gerado a 30s a partir do prompt literal, incorporado abaixo |
| Anime esportivo 2D, prompt de duas linhas | o modelo consegue preencher 30s com quase nenhuma instrução | 1280x720, 24fps, 30,05s, AAC | não gerado aqui; mostrado como uma grade de quadros apenas Wan para ler a estrutura ao longo do tempo |
| Curta de comédia com whip pan (excluído) | 8 whip pans e 8 batidas emocionais sem um corte | 1280x720, 24fps, 30,04s, AAC | não executado: a densidade do diálogo é específica do mandarim, uma reescrita em inglês não seria uma comparação justa |
Demonstração oficial Wan 3.0: dez tomadas roteirizadas e uma construção orquestral completa dentro de uma passagem de 30 segundos, em 1920x1072. Este é o argumento mais forte para 1080p nativo, porque o volume de água e o detalhe da pele molhada da criatura são exatamente o que um upscale de 720p inventa em vez de resolver. Manual do criador Tongyi da Alibaba, usado para comparação e comentário.
Seedance 2.5, o mesmo prompt de desastre de dez tomadas em 30s nativos, som ligado. Barco de pesca açoitado pela tempestade, o marinheiro aterrorizado, a ondulação se erguendo, então o leviatã do mar profundo rompendo a superfície no relâmpago. Uma referência IP e o texto da marca no casco foram removidos para que o filtro de conteúdo do Seedance passasse; o storyboard é idêntico, o que torna o volume de água e o detalhe da pele molhada uma comparação justa contra o clipe Wan 3.0 acima.
Demonstração oficial Wan 3.0, som ligado. Diálogo de vilão em inglês nativo, "Maduro o suficiente para o vazio", entregue em uma única inclinação lenta para cima sem corte. Este é o clipe que as equipes de língua inglesa devem testar, porque a voz, a sincronização labial e um movimento de câmera contínuo de 30 segundos precisam se sustentar ao mesmo tempo.
Seedance 2.5, o mesmo prompt de fantasia sombria copiado literalmente, 30s nativos, som ligado. Mesmo vilão de olhos violeta, as marcações de runas estelares, a nebulosa de sombra se formando em sua palma aberta, e as duas linhas em inglês. Observe se a sincronização labial e o empurrão contínuo único se sustentam ao longo dos 30 segundos completos como fazem no lado Wan 3.0.
Se você executar o lado Seedance 2.5 correspondente deste, mantenha as duas linhas em inglês literais e lembre-se da peculiaridade do sotaque das notas de produção: escreva "Americano", não "Inglês Americano". A palavra "Inglês" puxa a entrega de volta para uma leitura britânica.
O terceiro é a surpresa silenciosa. O prompt de anime esportivo 2D no manual da Alibaba tem duas linhas. Sem carimbos de tempo, sem lista de tomadas, apenas um boxeador batendo em um saco de pancadas, cansado, com dor. Trinta segundos a partir disso é um teste genuíno de se o modelo pode inventar sua própria estrutura. Aqui está amostrado ao longo de seu próprio tempo de execução:

Quatro quadros da demonstração oficial de anime esportivo 2D Wan 3.0 amostrados aproximadamente em 1, 10, 20 e 29 segundos, mostrando o design do boxeador e o fundo da academia ao longo dos 30 segundos completos
Quatro quadros da demonstração oficial de anime esportivo 2D Wan 3.0, amostrados aproximadamente em 1, 10, 20 e 29 segundos. Mesmo design de personagem, mesma camiseta regata, mesmo saco de pancadas, mesma fileira de armários, em uma mudança de aberto para close-up que o prompt nunca pediu. Uma grade de quadros em vez de um clipe, porque a comparação aqui é ao longo do tempo dentro de um arquivo, não movimento.
Leitura prática: com um prompt de duas linhas, o modelo inventou sua própria cobertura, movendo-se de um plano aberto travado para um close-up de suor e exaustão, e manteve o design do personagem ao fazê-lo. Essa é a boa notícia. A troca é que você abriu mão do controle sobre quando algo acontece. Se você precisa que 30 segundos atinjam uma batida específica em um segundo específico, escreva os carimbos de tempo.
Teste a Narrativa Nativa de 30s Grátis Antes de Pagar por Qualquer Um
Uma execução de 30 segundos em 720p no Seedance 2.5 cotiza cerca de $9 quando você precifica a resolução real em vez do piso do catálogo. Uma execução de 30 segundos em 1080p na tabela de preços do Wan 3.0 é $6,00. Nenhum é caro para os padrões de produção, mas com uma proporção de captação de 3,2 para 1, você não está comprando um clipe, está comprando três ou quatro.
Antes de gastar qualquer coisa, vale a pena responder a uma pergunta mais barata: meu roteiro realmente se sustenta como uma única tomada contínua? A maioria das falhas de 30 segundos não são falhas de modelo. São falhas de estrutura, três batidas amontoadas onde havia espaço para duas, ou um desfecho escrito no segundo 26 sem nada carregando os segundos 8 a 20.
O gerador gratuito de anúncio de esboço de IA da Atlas Cloud responde a isso de graça. Você dá a ele uma descrição de produto e até quatro fotos do produto, cada uma com menos de 8MB, escolhe um dos seis estilos (meme engraçado, reviravolta, sitcom, emocionante, luxo ou venda dura), e ele escreve um roteiro de dois personagens primeiro, com um gancho de três segundos, um conflito e uma reviravolta, então constrói cada tomada em torno desse roteiro. Os personagens falam suas falas em voz alta e os efeitos sonoros são renderizados no vídeo.
Os limites honestos: são 15 segundos, não 30, você precisa estar logado e recebe uma geração gratuita antes de recarregar créditos. Mas 15 segundos com um gancho, um conflito e uma reviravolta dizem se suas três batidas respiram. Se a estrutura funcionar lá, pegue as mesmas batidas, estique-as no esqueleto 0-8s / 8-16s / 16-24s / 24-30s do Passo 1, e vá gastar os nove dólares em uma passagem nativa real de 30 segundos.
O Que um Clipe Nativo de 30s Realmente Custa no Wan 3.0 vs Seedance 2.5
| Configuração | Taxa | Duração | Um clipe |
|---|---|---|---|
| Wan 3.0, 1080p nativo (apenas Alibaba Cloud) | $0,20 / seg | 30s | $6,00 |
| Wan 3.0, 720p nativo (apenas Alibaba Cloud) | $0,10 / seg | 30s | $3,00 |
| Wan 3.0, 480p nativo (apenas Alibaba Cloud) | $0,05 / seg | 30s | $1,50 |
| Seedance 2.5, 720p nativo, na Atlas Cloud | $0,30 / seg medido em 720p, listado a partir de $0,134 | 30s | cerca de $9,09 |
| GPT Image 2 quadro de abertura, qualidade alta, 2048x1152 | listado a partir de $0,009 / imagem | 1 imagem | $0,1745 cotado |
A comparação que realmente decide: Wan 3.0 em 720p é mais barato por segundo do que Seedance 2.5 em 720p, e em 1080p é o único dos dois vendendo pixels reais. A resposta do Seedance 2.5 são 50 slots de referência, disponibilidade ao vivo e uma API funcional que você pode enviar hoje à tarde.
Nota de Origem e Licenciamento para Esses Clipes Nativos de 30s
Todo clipe Wan 3.0 e todo prompt Wan 3.0 neste artigo vêm do manual do criador Tongyi Wan 3.0 distribuído publicamente pela Alibaba, reproduzidos aqui para comparação e comentário, creditados, não modificados e sem remoção de marca d'água. O uso comercial da saída do Seedance 2.5 está sujeito aos termos da ByteDance e Volcengine; a cobrança da API e o tratamento de dados no lado da Atlas Cloud estão sujeitos aos termos da própria Atlas Cloud. Nenhuma semelhança de pessoa real é reproduzida em qualquer lugar neste teste. Se você estiver enviando trabalho de cliente, leia os termos do modelo para o endpoint específico que você chamar, não um resumo de blog deles.
Perguntas Frequentes
O nativo de 30s do Wan 3.0 é realmente uma passagem ou clipes emendados?
Uma passagem. Wan 3.0 gera de 2 a 30 segundos em uma única geração com uma opção de duração inteligente, então também pode decidir que o clipe não precisa dos 30 completos. Isso é diferente da extensão do último quadro, onde um segundo clipe é semeado a partir do quadro final do primeiro e a identidade se desvia através da emenda.
Qual deles é realmente 1080p em 30 segundos, Wan 3.0 ou Seedance 2.5?
Wan 3.0. Ele tem um nível nativo de 1080p em sua tabela de preços, e os próprios arquivos de demonstração de 30 segundos da Alibaba medem 1920x1072. Seedance 2.5 gera nativamente apenas em 480p e 720p; suas opções 1080p, 1440p e 4K são melhorias de uma fonte de 720p, e seus documentos de API descrevem o nível 4K como "não geração 4K nativa".
A imagem ainda se desfaz no segundo 25?
Pode, mas a falha mudou de forma. Em vez de uma emenda visível entre clipes, você obtém morfismo e decoerência dentro da tomada, concentrados em passagens de movimento rápido, e o upscaling não remove isso. Uma produção documentada de curta-metragem com Seedance 2.5 rodou uma proporção de captação de 3,2 para 1, então planeje tomadas longas com cobertura.
Qual modelo aceita mais material de referência?
Seedance 2.5, por uma larga margem: 30 imagens mais 10 vídeos mais 10 arquivos de áudio, 50 no total, com vídeo e áudio de referência cada um limitado a 30 segundos combinados por solicitação. O manual do Wan 3.0 limita referências a 20, mas é o único que aceita arquivos .pdf, .ppt, .xls, .doc, .txt e páginas da web ao vivo como entrada criativa.
Wan 3.0 terá pesos abertos?
Não há compromisso oficial. A partir do beta público de agosto de 2026, nenhum peso Wan 3.0, checkpoint Hugging Face ou nó ComfyUI foi publicado, e os pesos abertos oficiais para a linha de vídeo principal param no Wan 2.2 (Kingy AI, agosto de 2026). Trate qualquer outra coisa que você ler sobre um lançamento de peso 3.0 como especulação até que a Alibaba diga o contrário.






