Seedance 2.0 Mini & Fast API com os preços mais baixos do mundo — até 68% de desconto no preço oficial

Wan 3.0 vs Seedance 2.5 Native 30s: Ambos Dizem 30 Segundos, Apenas Um É Realmente 1080p

Wan 3.0 vs Seedance 2.5 nativo 30s, testados com os próprios prompts de demonstração da Alibaba: qual deles renderiza pixels reais em 1080p, qual faz upscale e qual você pode executar hoje.

Dois monitores mostrando uma cena de faroeste ao lado de storyboards

Última atualização: Wan 3.0 está no ar desde 24 de agosto de 2026.

Dois monitores de edição lado a lado reproduzindo a mesma cena de um posto de gasolina no deserto, um com uma linha do tempo ininterrupta de 30 segundos abaixo e outro com uma linha do tempo dividida em dois segmentos

No segundo 20, o bico da bomba de combustível jorra grama verde fresca. Ainda com gotas de água. O cavalo aperta os olhos de prazer. O palito do frentista cai da boca.

Essa piada só funciona dentro de um único plano contínuo de 30 segundos. Corte quatro clipes de 8 segundos juntos e o cavalo muda de pelagem, os óculos escuros mudam de forma, o céu esquenta um tom, e a piada morre em algum lugar nas emendas.

Então, quando Wan 3.0 e Seedance 2.5 chegaram na mesma janela, alegando 30 segundos nativos, uma passada, sem emendas, deixou de ser uma história de benchmark. Tornou-se a primeira vez que um modelo de vídeo de IA conseguiu sustentar uma configuração, uma virada e um desfecho em um único take.

Eu analisei as especificações, fiz uma verificação de especificações contra os arquivos de demonstração publicados pela própria Alibaba, e encontrei o que ninguém que escreve sobre isso publicou: ambos os modelos dizem 30 segundos, mas a resolução por trás desses 30 segundos não é o mesmo produto.

Principais conclusões

  1. Ambos os modelos realmente geram 30 segundos em uma única passada. Essa parte não é marketing. Wan 3.0 cobre de 2 a 30 segundos com uma opção de duração inteligente, Seedance 2.5 cobre de 4 a 30 segundos.
  2. Apenas Wan 3.0 renderiza 1080p nativo a 30 segundos. Seedance 2.5 gera nativamente apenas em 480p e 720p. Suas opções 1080p, 1440p e 4K são redimensionamentos pós-geração de uma fonte 720p, e sua própria documentação da API diz que a camada 4K é "não é geração 4K nativa".
  3. Seedance 2.5 vence em volume de referência: até 30 imagens mais 10 vídeos mais 10 arquivos de áudio, 50 no total. O manual do criador do Wan 3.0 limita as referências a 20.
  4. Wan 3.0 tem uma entrada que ninguém mais tem: arquivos .doc, .xls, .ppt, .pdf, .txt e páginas da web ao vivo, alimentados diretamente como referências criativas.
  5. Apenas um dos dois é realmente executável fora da Alibaba hoje. Wan 3.0 está em beta público no Alibaba Cloud Model Studio e Qwen Cloud com acesso à API de terceiros ainda em implantação. Seedance 2.5 está ao vivo no Atlas Cloud com 30 no controle de duração agora.
  6. Quer testar a estrutura de história de 30 segundos antes de pagar por um único segundo? O gerador gratuito de esquetes de anúncio de IA do Atlas Cloud oferece uma execução gratuita: um spot finalizado de 15 segundos com diálogo falado e efeitos sonoros, download sem marca d'água.

Demonstração oficial do Wan 3.0 da Alibaba, do manual do criador Tongyi Wan 3.0. Um take, sem cortes, 30,07 segundos. Medido com ffprobe: 1920x1072, 24fps, áudio AAC estéreo embutido. Ligue o som para o rabo balançando e o palito batendo no chão no segundo 29. Usado aqui como material de referência para comparação e comentário apenas.

Wan 3.0 vs Seedance 2.5 30s nativos: O que realmente mudou este mês

Quinze segundos foi a barreira por muito tempo. Wan 2.7 termina ali. Seedance 2.0 termina ali. Cada "filme de IA de um minuto" que você viu no seu feed no último ano foi de quatro a oito clipes colados em um NLE, com uma passada de colorista para esconder as junções.

Duas coisas quebraram essa barreira nas mesmas poucas semanas. A Alibaba abriu o beta público do Wan 3.0 em 6 de agosto de 2026 com geração nativa de 30 segundos e entrada de referência multimodal completa (AlphaSignal, agosto de 2026). A ByteDance dobrou o Seedance de 15 para 30 segundos no 2.5, posicionando-o explicitamente como uma forma de cortar a emenda de clipes e o desvio visual que vem com ela.

Nativo importa aqui em um sentido técnico específico. Significa uma passagem direta sobre uma sequência latente, não extensão do último quadro onde o modelo pega o quadro final do clipe A e inicia o clipe B a partir dele. A extensão é a razão pela qual a gola da jaqueta do seu personagem muda silenciosamente de forma entre os takes. Uma passagem nativa tem os 30 segundos inteiros no mesmo contexto, então o cavalo permanece o mesmo cavalo.

A demonstração do posto de gasolina é o teste mais limpo possível disso. A estrutura é de quatro batidas: 0 a 8 segundos de nada acontecendo, 8 a 16 de algo estranho acontecendo, 16 a 24 para o desfecho, 24 a 30 para a saída. A piada chega no segundo 20. O que significa que só chega se o cavalo, os óculos escuros, a gradação verde-água e laranja e a câmera travada e sem expressão sobreviverem aos primeiros 19 segundos intocados. A emenda não consegue fazer isso. Não porque o editor é ruim, mas porque o clipe B nunca viu o clipe A.

Wan 3.0 vs Seedance 2.5 30s nativos: Onde a imagem realmente quebra

Trinta segundos é o dobro de quinze. O risco de desvio não é duas vezes maior, é pior que isso, e muda para um modo de falha diferente.

As falhas do fluxo de trabalho emendado eram entre os clipes. As falhas nativas de 30s são dentro do clipe. Em uma produção prática de curta-metragem com Seedance 2.5, o revisor encontrou decoerência e morfismo aparecendo como "instabilidade visual ou espigamento em modelos de personagens", concentrados em sequências de ação rápida, e notou especificamente que esses artefatos não podem ser limpos pelo redimensionamento (MindStudio, agosto de 2026). Essa é a parte que importa para qualquer um que planeje renderizar em 720p e redimensionar para 4K depois: o redimensionador nitifica o morfismo, não o remove.

A mesma produção registrou uma proporção de filmagem de 3,2 para 1. Aproximadamente 450 segundos de geração bruta para cortar um final de 2 minutos e 22 segundos. Planeje o trabalho de plano longo como uma filmagem com cobertura, não como uma fila de renderização onde cada trabalho é enviado.

Mais duas descobertas dessa produção valem a pena roubar diretamente. A identidade visual em todo o filme baseou-se em três imagens de referência, dois retratos de personagens e uma placa de localização, mesmo que o sistema aceite até 50. E na escolha de voz, escrever "americano" corrigiu um sotaque britânico não intencional, enquanto escrever "inglês americano" não corrigiu, porque a palavra "inglês" empurrou a entrega de volta para o britânico.

A estrutura de prompt que sobrevive a 30 segundos é a que a Alibaba usa em seu próprio manual: batidas explícitas com carimbo de tempo. Não um parágrafo de vibes. Escreva 0-8s, 8-16s, 16-24s, 24-30s, dê a cada bloco seu próprio comportamento de câmera e seu próprio evento, e termine com uma única linha de áudio cobrindo todo o clipe. Você verá esse esqueleto exato no Passo 4 abaixo, porque mantive a estrutura da Alibaba e apenas traduzi.

Para uma execução hospedada atual, abra Wan 3.0 no Atlas Cloud e teste um prompt como o abaixo antes de publicar o fluxo de trabalho.

Captura de tela do prompt e efeito gerado do Wan 3.0 para wan-30-vs-seedance-25-native-30s

Wan 3.0 vs Seedance 2.5 30s nativos: Especificações, preço e o que você pode executar hoje

Aqui está o estado honesto do jogo, e a parte onde os dois modelos deixam de ser produtos comparáveis.

Leia a linha de resolução duas vezes, porque é o artigo inteiro. A própria documentação da API Seedance 2.5 Texto-para-Vídeo do Atlas Cloud afirma que 720p-esr aprimora uma fonte 480p, que 1080p-esr, 1440p-esr e 4k-esr aprimoram uma fonte 720p, e que a opção 4K entrega um lado curto de 2160 pixels "não é geração 4K nativa". Portanto, um clipe Seedance de 30 segundos rotulado como 4K é 720p de detalhes reais, reamostrado. A tabela de preços do Wan 3.0, por outro lado, tem uma camada direta de 1080p a $0,20 por segundo, e os arquivos de demonstração de 30 segundos publicados pela própria Alibaba medem 1920x1072.

O lado positivo dessa restrição: o teste inteiro roda em uma única aba do navegador, em três modelos, sem configuração local.

Papel neste testeModeloPreço listado
Quadro de aberturaGPT Image 2 Texto-para-Imagema partir de $0,009/imagem
A execução nativa de 30sSeedance 2.5 Texto-para-Vídeoa partir de $0,134/SEG

Preços listados verificados nas páginas de modelo do Atlas Cloud, agosto de 2026. Leia-os como pisos, não orçamentos. Cada um desses modelos cobra pelo que você realmente pede, e o botão Executar precifica suas configurações exatas antes de você clicar. Neste teste, o botão cotou $0,1745 para um quadro GPT Image 2 com qualidade alta e 2048x1152, e $1,514799 para um trabalho Seedance 2.5 de cinco segundos em 720p e 16:9, o que equivale a aproximadamente $0,30 por segundo, em vez dos $0,134 listados. O valor listado é a taxa de 480p. Verifique o botão, não o catálogo. Seedance 2.5 também oferece um endpoint referência-para-vídeo ao mesmo $0,134 por segundo, se você quiser atingir o limite de 50 referências.

Como reproduzir este teste nativo de 30s no Seedance 2.5

Cinco passos, três modelos, todos no navegador. Copie os prompts textualmente.

Passo 1: Trave o esqueleto de 30s com carimbo de tempo

Não execute nada ainda. Leia a estrutura primeiro, porque esta é a parte que decide se seus 30 segundos se sustentam.

A demonstração do posto de gasolina do Wan 3.0 no topo deste artigo é construída como quatro blocos rotulados com uma doutrina de câmera fixa declarada uma vez no início: observação objetiva calma, planos médios travados, closes extremos repentinos apenas nas batidas absurdas. Cada evento está preso a um intervalo de tempo. O áudio é uma linha no final cobrindo todos os 30 segundos.

Aqui está o esqueleto, vazio. Preencha-o e você terá um prompt que um modelo nativo de 30s pode realmente rastrear:

Plain
1Um [gênero] de 30 segundos ambientado em [lugar]. [Estilo visual, gradação, saturação]. Linguagem de câmera: [doutrina], pontuada por [exceção].
2
30-8s: [configuração, plano aberto, estabelecer o mundo normal, apresentar a anomalia no horizonte]
4
58-16s: [a anomalia age, ainda tratada como normal, um ponto de vista ou inserção de reação]
6
716-24s: [o desfecho, close extremo na coisa em si, corte seco para o rosto de reação]
8
924-30s: [a saída, um pequeno botão físico que fecha a piada]
10
11Áudio: [ambiente, três ou quatro sons diegéticos específicos, um último som pequeno]. Sem música, sem diálogo, sem texto na tela.
12

A especificação mensurável do arquivo de referência da Alibaba, para quem quiser verificar meus números: 30,07 segundos, 1920x1072, 24fps, áudio estéreo AAC. Essa é a barra contra a qual a execução do Seedance está sendo medida.

Passo 2: Gere o quadro de abertura

Você precisa de uma âncora visual fixa para que as execuções de 15 e 30 segundos comecem do mesmo mundo. Abra GPT Image 2 Texto-para-Imagem.

Configurações: qualidade alta, proporção 16:9, 1 imagem.

Plain
1Um plano de estabelecimento amplo e parado de um posto de gasolina solitário estilo Rota 66 em um deserto brilhante. Edifício retrô amarelo-laranja-e-azul, tinta levemente desbotada pelo sol; uma bomba de combustível vintage vermelha desbotada na frente; uma pequena loja de conveniência ao lado com uma máquina de refrigerante desbotada perto da porta. Terra seca laranja rachada no primeiro plano, montanhas de terracota quentes ao fundo, céu azul ciano limpo e sem nuvens. Um frentista do posto em macacão azul ensebado e óculos escuros grandes demais, cochilando meio adormecido em uma cadeira perto da porta, palito na boca. Gradação de cores estrita verde-água e laranja brilhante, alta saturação, alto brilho, fotorrealismo cinematográfico, câmera travada, 16:9.
2

Captura de tela de um gerador de imagens de IA com prompt e imagem de saída

Playground do GPT Image 2 no Atlas Cloud com qualidade definida como alta e 16:9, o plano de estabelecimento do posto de gasolina da Rota 66 gerado no painel de saída

GPT Image 2 no Atlas Cloud: qualidade alta, 16:9, uma imagem. O botão Executar cotou $0,1745 para este quadro, que é o que uma renderização de alta qualidade 2048x1152 realmente custa. Os $0,009 na página do modelo são o piso.

Homem descansando do lado de fora de um posto de gasolina vintage da Rota 66 no deserto

Quadro de estabelecimento do posto de gasolina da Rota 66 gerado com GPT Image 2, céu verde-água e terra laranja rachada, frentista cochilando perto da porta

O quadro de abertura. Esta é a entrada para o Passo 3 e o alvo visual para o Passo 4. Gerado com openai/gpt-image-2.

Passo 3: Atinga a barreira de 15 segundos

Configurações: primeiro quadro = sua saída do Passo 2, duração arrastada para o máximo de 15, resolução 1080P.

Plain
1Plano aberto travado se mantém. Uma vaqueira de chapéu de abas largas monta um cavalo de verdade que vem do horizonte a passo. O frentista cochilando é acordado por cascos, empurra os óculos escuros para cima, senta-se ereto, mascando o palito, sem se impressionar. Ela desmonta com elegância, leva o cavalo direto para a bomba de combustível vintage. Gradação verde-água e laranja brilhante, alta saturação, fotorrealista, câmera de observação calma, sem cortes.
2

O menu suspenso para em 15. Esse é o ponto principal deste passo. Seu desfecho está agendado para o segundo 20, e este pipeline não consegue alcançar o segundo 20 inteiro. Para chegar lá, você geraria um segundo clipe a partir do último quadro, e no momento em que fizer isso, o cavalo é um cavalo novo.

Captura de tela de uma interface de gerador de vídeo de IA com entrada e saída

Passo 4: Execute a passagem nativa completa de 30s

Abra Seedance 2.5 Texto-para-Vídeo.

Configurações: duração = 30, resolução = 720p, proporção = 16:9, gerar_áudio = ligado, formato_saída = mp4, marca d'água desligada.

Escolha 720p deliberadamente, não 1080p-esr. 720p é o teto real do modelo, então esta é uma comparação de pixel direto em vez de uma comparação contra um redimensionador.

O prompt abaixo é o próprio prompt de demonstração do posto de gasolina da Alibaba, traduzido fielmente do manual do criador do Wan 3.0 e reestruturado em nada. Mesmas batidas, mesmas temporizações, mesma doutrina de câmera, mesma lista de áudio.

Plain
1Um curta de comédia absurda e sem expressão de 30 segundos ambientado em um posto de gasolina estilo Rota 66 desbotado pelo sol em um deserto brilhante. Fotorrealista, gradação estrita verde-água e laranja brilhante, alta saturação e alto brilho, para que o evento absurdo aconteça em um mundo completamente normal, quase bonito. Linguagem de câmera: observação calma e objetiva, principalmente planos médios travados e derivações laterais lentas, sem direcionamento emocional, pontuada por closes extremos repentinos nas batidas absurdas.
2
30-8s: Plano aberto, travado. Céu ciano, poeira flutuante. O posto retrô amarelo-laranja-e-azul fica sozinho à beira da estrada; um frentista em macacão azul ensebado e enormes óculos escuros cochila em uma cadeira, palito na boca. Apenas vento. No horizonte, uma vaqueira em um cavalo de verdade aparece a passo. Corte para plano médio: cascos o acordam, ele empurra os óculos escuros, senta-se, lê o par como "mais um pedindo informações."
4
58-16s: Ela não diz nada. Ela desmonta com elegância, leva o cavalo direto para a velha bomba de combustível. O cavalo coloca casualmente a cabeça ao lado da bomba como se já tivesse feito isso antes. Breve ponto de vista levemente olho de peixe de trás dos óculos escuros dele, a mulher e o cavalo parecem ainda mais estranhos. Close: a testa dele se franze, ele tira os óculos escuros, prestes a gritar. Close em câmera lenta: quando os óculos saem, ela aponta o bico da bomba para a boca do cavalo e aperta o gatilho.
6
716-24s: Close extremo no bico. Sai não gasolina, mas jatos de grama verde-fresca e brilhante, ainda com gotas de água. Corte seco para um close extremo do rosto do frentista, congelado: olhos arregalados como pires, boca ligeiramente aberta, palito esquecido no meio da mastigação. Plano médio: o cavalo come feliz, aperta os olhos de prazer, então dá uma sacudida poderosa e satisfeita do rabo, e a poeira que levanta cai direto no rosto do frentista ainda atordoado.
8
924-30s: "Tanque cheio" de grama. Ela pendura o bico de volta na bomba, tira moedas do bolso, caminha até a porta da loja e as deixa tilintar em uma lata na bancada. Ela olha para trás para o frentista petrificado; sob a aba do chapéu, o canto da boca dela se levanta uma fração. Ela remonta e sai cavalgando em uma trilha de poeira. A câmera se aproxima lentamente dele: mesma postura congelada, rosto coberto de poeira, óculos escuros ainda presos na mão, e finalmente o palito cai da boca dele com um pequeno claque.
10
11Áudio: vento seco do deserto durante todo o tempo, cascos, o claque mecânico da alça da bomba, grama úmida jorrando, o rabo balançando, moedas em uma lata, e um pequeno claque quando o palito atinge o chão. Sem música, sem diálogo, sem texto na tela.
12

Um aviso que vai te poupar uma conta desperdiçada, e é a mesma armadilha do Passo 3: arraste o controle deslizante de duração para 30, não digite 30 na caixa de número. A caixa mostrará feliz 30 enquanto o controle deslizante permanece no padrão de cinco segundos, e o botão Executar cotará para cinco segundos. Verifique a cotação antes de clicar. Em 720p e 16:9, um trabalho de cinco segundos cotou $1,514799, então uma passagem real de 30 segundos cotará aproximadamente seis vezes isso.

Não há captura de tela de execução concluída para este passo. Três tentativas de captura automatizada todas enviaram o padrão do controle deslizante em vez de 30 segundos, e em vez de mostrar um clipe de cinco segundos rotulado como um de 30 segundos, a captura foi omitida. O prompt e as configurações acima são exatamente o que colar e definir.

Passo 5: Leia o desvio, honestamente

Aqui está o lado do Seedance 2.5 desse mesmo prompt, gerado em 30 segundos nativos, 720p, 16:9, áudio ligado.

Seedance 2.5, o mesmo prompt do posto de gasolina do Wan 3.0 copiado textualmente: 30s nativos em uma geração, 1280x720, 24fps, áudio embutido. Mesmas quatro batidas, vaqueira e cavalo chegando, a piada do bico da bomba, o close de dissonância cognitiva do frentista. Coloque-o ao lado do clipe do Wan 3.0 no topo para uma leitura direta.

Coloque os dois clipes lado a lado e verifique cinco coisas específicas. Não verifique "qual parece melhor", isso é uma discussão de gosto e vai perder sua tarde.

  1. Identidade da pelagem e da roupa. O cavalo é da mesma cor no segundo 29 e no segundo 6? Os óculos escuros são da mesma forma depois que saem e voltam para a mão dele?
  2. Estabilidade da gradação. Amostre o céu no segundo 2 e no segundo 28. A gradação verde-água e laranja tende a esquentar em gerações longas com mais frequência do que as pessoas esperam.
  3. A batida física no segundo 20. Grama saindo de um bico de bomba é uma solicitação de física. Ela arqueia e cai com peso, ou aparece como uma textura?
  4. Disciplina da câmera. O prompt diz travado. Conte quantas vezes a câmera inventa um movimento para frente que não foi solicitado. Esta é a falha mais comum de geração longa: o modelo fica sem eventos programados e preenche o tempo com movimento.
  5. Morfismo em movimento rápido. O rabo balançando e o chute de poeira são o movimento mais rápido no clipe. De acordo com as notas de produção do MindStudio, é exatamente onde a decoerência se concentra, e exatamente o que um redimensionamento não corrigirá.

Pontue esses cinco, não a vibe. Essa é uma comparação que você pode defender para um cliente.

Mais três prompts pareados Wan 3.0 vs Seedance 2.5 30s nativos

Uma demonstração é uma anedota. Aqui estão mais três arquivos oficiais de 30 segundos do Wan 3.0 do mesmo manual, cada um estressando uma parte diferente do problema de 30 segundos. Para o monstro marinho e o monólogo de fantasia sombria, o lado do Seedance 2.5 foi gerado no mesmo prompt em 30 segundos nativos e está incorporado logo após cada um, para que você possa assistir a ambos em vez de acreditar na minha palavra.

PromptO que testaArquivo oficial Wan 3.0, medidoLado Seedance 2.5, mesmo prompt
Filme de desastre com monstro marinho10 takes escritos mais uma trilha orquestral dentro de 30s1920x1072, 24fps, 30,07s, AACgerado a 30s, incorporado abaixo; um nome de IP e o texto da marca do barco foram removidos para que o filtro de conteúdo do Seedance passasse, o storyboard é idêntico
Monólogo de fantasia sombria em inglêsVoz nativa em inglês e sincronia labial em um movimento contínuo e lento1280x720, 24fps, 30,05s, AACgerado a 30s a partir do prompt textualmente, incorporado abaixo
Anime esportivo 2D, prompt de duas linhasO modelo consegue preencher 30s com quase nenhuma instrução1280x720, 24fps, 30,05s, AACnão gerado aqui; mostrado como uma grade de quadros apenas do Wan para ler a estrutura ao longo do tempo
Curta de comédia com whip pan (excluído)8 whip pans e 8 batidas emocionais sem um corte1280x720, 24fps, 30,04s, AACnão executado: a densidade do diálogo é específica do mandarim, uma reescrita em inglês não seria uma comparação justa

Demonstração oficial do Wan 3.0: dez takes escritos e uma construção orquestral completa dentro de uma única passagem de 30 segundos, a 1920x1072. Este é o argumento mais difícil para 1080p nativo, porque o volume de água e o detalhe da pele molhada da criatura são exatamente o que um redimensionamento 720p inventa em vez de resolver. Manual do criador Tongyi Alibaba, usado para comparação e comentário.

Seedance 2.5, o mesmo prompt de desastre de dez takes a 30s nativos, som ligado. Barco de pesca sacudido pela tempestade, o marinheiro aterrorizado, o mar se erguendo, então o leviatã das profundezas rompendo a superfície no relâmpago. Uma referência de IP e o texto da marca no casco foram removidos para que o filtro de conteúdo do Seedance passasse; o storyboard é idêntico, o que torna o volume de água e o detalhe da pele molhada uma comparação justa contra o clipe do Wan 3.0 acima.

Demonstração oficial do Wan 3.0, som ligado. Diálogo de vilão em inglês nativo, "Maduro o suficiente para o vazio", entregue em uma única inclinação lenta para cima sem corte. Este é o clipe que as equipes de língua inglesa devem testar, porque voz, sincronia labial e um movimento de câmera contínuo de 30 segundos têm que se sustentar ao mesmo tempo.

Seedance 2.5, o mesmo prompt de fantasia sombria copiado textualmente, 30s nativos, som ligado. Mesmo vilão de olhos violetas, as marcas de runas estelares, a nebulosa sombra se formando na palma da mão dele, e as duas linhas em inglês. Observe se a sincronia labial e o único movimento contínuo para frente se sustentam durante os 30 segundos completos como fazem no lado do Wan 3.0.

Se você executar o lado pareado do Seedance 2.5 deste, mantenha as duas linhas em inglês textualmente e lembre-se da peculiaridade do sotaque das notas de produção: escreva "americano", não "inglês americano". A palavra "inglês" puxa a entrega de volta para uma leitura britânica.

O terceiro é a surpresa silenciosa. O prompt de anime esportivo 2D no manual da Alibaba tem duas linhas. Sem carimbos de tempo, sem lista de takes, apenas um boxeador batendo em um saco de pancadas, cansado, com dor. Trinta segundos a partir disso é um teste genuíno de se o modelo pode inventar sua própria estrutura. Aqui está amostrado ao longo de seu próprio tempo de execução:

Quatro painéis de anime de um boxeador exausto treinando com um saco de pancadas

Quatro quadros da demonstração oficial de anime esportivo 2D do Wan 3.0 amostrados aproximadamente em 1, 10, 20 e 29 segundos, mostrando o design do boxeador e o fundo da academia durante os 30 segundos completos

Quatro quadros da demonstração oficial de anime esportivo 2D do Wan 3.0, amostrados aproximadamente em 1, 10, 20 e 29 segundos. Mesmo design de personagem, mesma regata, mesmo saco de pancadas, mesma fileira de armários, através de uma mudança de plano aberto para close que o prompt nunca pediu. Uma grade de quadros em vez de um clipe, porque a comparação aqui é ao longo do tempo dentro de um arquivo, não movimento.

Leitura prática: com um prompt de duas linhas, o modelo inventou sua própria cobertura, movendo-se de um plano aberto travado para um close de suor e exaustão, e manteve o design do personagem ao fazê-lo. Essa é a boa notícia. A troca é que você abriu mão do controle sobre quando algo acontece. Se você precisa que 30 segundos atinjam uma batida específica em um segundo específico, escreva os carimbos de tempo.

Teste narrativa nativa de 30s gratuitamente antes de pagar por qualquer um

Uma execução de 30 segundos em 720p no Seedance 2.5 cotou cerca de $9 quando você precifica a resolução real em vez do piso do catálogo. Uma execução de 30 segundos em 1080p na tabela de preços do Wan 3.0 é $6,00. Nenhum é caro pelos padrões de produção, mas com uma proporção de filmagem de 3,2 para 1, você não está comprando um clipe, está comprando três ou quatro.

Antes de gastar qualquer coisa, vale a pena responder a uma pergunta mais barata: meu script realmente se sustenta como um único plano contínuo? A maioria das falhas de 30 segundos não são falhas de modelo. São falhas de estrutura, três batidas amontoadas onde havia espaço para duas, ou um desfecho escrito no segundo 26 sem nada carregando os segundos 8 a 20.

O gerador gratuito de esquetes de anúncio de IA do Atlas Cloud responde a isso de graça. Você dá a ele uma descrição de produto e até quatro fotos do produto, cada uma com menos de 8MB, escolhe um dos seis estilos (meme engraçado, reviravolta, sitcom, emocionante, luxo ou venda dura), e ele escreve um script de dois personagens primeiro, com um gancho de três segundos, um conflito e uma reviravolta, então constrói cada take em torno desse script. Os personagens falam suas falas em voz alta e os efeitos sonoros são renderizados no vídeo.

Os limites honestos: são 15 segundos, não 30, você precisa estar logado, e você ganha uma geração gratuita antes de recarregar créditos. Mas 15 segundos com um gancho, um conflito e uma reviravolta dizem se suas três batidas respiram. Se a estrutura funciona lá, pegue as mesmas batidas, estique-as no esqueleto 0-8s / 8-16s / 16-24s / 24-30s do Passo 1, e vá gastar os nove dólares em uma passagem nativa real de 30 segundos.

O que um clipe nativo de 30s realmente custa no Wan 3.0 vs Seedance 2.5

ConfiguraçãoTaxaDuraçãoUm clipe
Wan 3.0, 1080p nativo (apenas Alibaba Cloud)$0,20 / seg30s$6,00
Wan 3.0, 720p nativo (apenas Alibaba Cloud)$0,10 / seg30s$3,00
Wan 3.0, 480p nativo (apenas Alibaba Cloud)$0,05 / seg30s$1,50
Seedance 2.5, 720p nativo, no Atlas Cloud$0,30 / seg medido a 720p, listado a partir de $0,13430scerca de $9,09
Quadro de abertura GPT Image 2, qualidade alta, 2048x1152listado a partir de $0,009/imagem1 imagem$0,1745 cotado

A comparação que realmente decide: Wan 3.0 a 720p é mais barato por segundo que Seedance 2.5 a 720p, e a 1080p é o único dos dois vendendo pixels reais. A resposta do Seedance 2.5 são 50 slots de referência, disponibilidade imediata e uma API funcional que você pode enviar hoje à tarde.

Nota de origem e licenciamento para estes clipes nativos de 30s

Cada clipe do Wan 3.0 e cada prompt do Wan 3.0 neste artigo vêm do manual do criador Tongyi Wan 3.0 distribuído publicamente pela Alibaba, reproduzido aqui para comparação e comentário, creditado, não modificado e sem remoção de marca d'água. O uso comercial da saída do Seedance 2.5 está sob os termos da ByteDance e Volcengine; a cobrança da API e o manuseio de dados no lado do Atlas Cloud estão sob os próprios termos do Atlas Cloud. Nenhuma semelhança de pessoa real é reproduzida em nenhum lugar neste teste. Se você está enviando trabalho de cliente, leia os termos do modelo para o endpoint específico que você chama, não um resumo de blog deles.

Perguntas frequentes

O nativo de 30s do Wan 3.0 é realmente uma passagem, ou clipes emendados?

Uma passagem. Wan 3.0 gera de 2 a 30 segundos em uma única geração com uma opção de duração inteligente, então também pode decidir que o clipe não precisa dos 30 completos. Isso é diferente da extensão do último quadro, onde um segundo clipe é semeado a partir do quadro final do primeiro e a identidade se desvia através da emenda.

Qual deles é realmente 1080p a 30 segundos, Wan 3.0 ou Seedance 2.5?

Wan 3.0. Ele tem uma camada nativa de 1080p em sua tabela de preços, e os próprios arquivos de demonstração de 30 segundos da Alibaba medem 1920x1072. Seedance 2.5 gera nativamente apenas em 480p e 720p; suas opções 1080p, 1440p e 4K são aprimoramentos de uma fonte 720p, e seus documentos da API descrevem a camada 4K como "não é geração 4K nativa".

A imagem ainda se desfaz no segundo 25?

Pode, mas a falha mudou de forma. Em vez de uma emenda visível entre clipes, você obtém morfismo e decoerência dentro do take, concentrados em passagens de movimento rápido, e o redimensionamento não remove isso. Uma produção documentada de curta-metragem com Seedance 2.5 teve uma proporção de filmagem de 3,2 para 1, então planeje takes longos com cobertura.

Qual modelo aceita mais material de referência?

Seedance 2.5, por uma margem ampla: 30 imagens mais 10 vídeos mais 10 arquivos de áudio, 50 no total, com referência de vídeo e áudio cada um limitado a 30 segundos combinados por solicitação. O manual do Wan 3.0 limita as referências a 20, mas é o único que aceita arquivos .pdf, .ppt, .xls, .doc, .txt e páginas da web ao vivo como entrada criativa.

O Wan 3.0 terá pesos abertos?

Não há compromisso oficial. Até o beta público de agosto de 2026, nenhum peso do Wan 3.0, checkpoint do Hugging Face ou nó ComfyUI foi publicado, e os pesos abertos oficiais para a linha de vídeo principal param no Wan 2.2 (Kingy AI, agosto de 2026). Trate qualquer outra coisa que você ler sobre um lançamento de peso 3.0 como especulação até que a Alibaba diga o contrário.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos