O cantor não existe. A música não está na sua língua. Você a sente mesmo assim.
Essa é a reação a um clipe criado por Cia0 compartilhado no X em 19 de julho de 2026: quinze segundos de um personagem no meio de uma canção, intitulado "música que você pode sentir mesmo sem entender uma palavra." A legenda nomeia toda a pilha em uma linha: Seedream 5.0 Pro para a imagem, Seedance 2.0 para o vídeo, executado no CapCut. O que vende é o trabalho de detalhe. Os lábios acompanham o vocal. O cabelo se move como cabelo. O rosto segura uma emoção em vez de uma pose.
Este guia reconstrói esse pipeline passo a passo: qual modelo faz o quê, os prompts que transportam a emoção na transição imagem-para-vídeo, e quanto custa um MV finalizado.

Principais Conclusões
- O fluxo de trabalho é imagem-primeiro: direcione artisticamente um quadro-chave no Seedream 5.0 Pro por $0,045, depois pague as taxas de vídeo apenas quando o visual estiver definido. Corrigir um rosto no still custa cerca de um vigésimo de re-rolar o clipe.
- O Seedance 2.0 imagem-para-vídeo aceita um primeiro quadro mais um último quadro opcional, gera de 4 a 15 segundos por execução com áudio nativo, e pode retornar seu quadro final para que o próximo clipe continue a cena.
- Sincronizar lábios de um personagem com sua própria faixa usa o endpoint referência-para-vídeo: até 9 imagens, 3 vídeos e 3 clipes de áudio como referências, com menções @ no prompt.
- Um MV vertical de 40 segundos em 720p fica em torno de $10 com as taxas com desconto de julho de 2026, sendo sua trilha sonora o único custo não contabilizado.
Os MVs Seedream + Seedance que Vale a Pena Copiar
Três publicações em dois dias, mais um teste de sincronia labial anterior, esboçam todo o território que esse emparelhamento cobre. Nenhum deles é uma demonstração de laboratório. Cada um nomeia suas ferramentas.
| Criador | Publicado | O que o clipe mostra | Ferramentas |
|---|---|---|---|
| @Cia0_exe | 19 jul 2026 | 15 s de performance de balada: sincronia labial, física do cabelo, uma emoção sustentada | Seedream 5.0 Pro + Seedance 2.0, no CapCut conforme legenda |
| @Cia0_exe | 20 jul 2026 | 15 s de "ação anime 2.5D no auge", do tipo que "estúdios levam anos" para entregar | Mesmo par de modelos, executado em um aplicativo de terceiros |
| @tjb_shizuka | 20 jul 2026 | 30 s de meme de viagem "warp de colírio" em um lago suíço, com convite aberto para copiar | Stills Seedream, movimento Seedance 2.0, trilha Mureka V9, edição OpenShot |
| @CuriousRefuge | 5 mai 2026 | Testes de sincronia labial com múltiplos falantes em live action e animação | Imagem de referência, arquivo de áudio, prompt de câmera e diálogo |

Duas coisas se repetem em todas as quatro. Primeiro, o modelo de imagem e o modelo de vídeo são tratados como trabalhos separados: a escalação acontece no Seedream, a performance acontece no Seedance. Segundo, o modelo de vídeo é apenas o meio da pilha. Cada legenda nomeia o que o rodeia: o aplicativo em que foi executado, uma fonte de trilha sonora, um editor para o corte. Ambas as publicações de Cia0 prometem o prompt "em chinês" nas respostas, e a publicação japonesa soletra sua linha de montagem de quatro ferramentas na própria legenda.
Por que o Fluxo de Trabalho Seedream-Primeiro é Melhor que Texto-para-Vídeo Puro
O Seedance 2.0 tem um modo texto-para-vídeo perfeitamente funcional. As pessoas que fazem os clipes acima o ignoram, e a razão é aritmética mais controle.
No Atlas Cloud, um still do Seedream 5.0 Pro custa $0,045. Um clipe de 5 segundos em 720p do Seedance 2.0 custa cerca de $0,97 com o desconto atual. Cada rosto errado, roupa errada ou enquadramento errado que você pega no estágio do still custa um still para corrigir. Cada um que você pega no estágio de vídeo custa um re-roll completo a cerca de 20 vezes o preço, mais a espera.
| Texto-para-vídeo direto | Quadro-chave Seedream primeiro | |
|---|---|---|
| Custo para corrigir um rosto ruim | ≈$0,97 por 5 s re-roll | $0,045 por still |
| Consistência de elenco entre cenas | Novo dado a cada clipe | Mesmo bloco de personagem, mesmo rosto |
| Controle de enquadramento | Prompt e torcer | Você aprova a composição exata primeiro |
| Onde os erros aparecem | Na etapa cara | Na etapa barata |
O ponto da consistência é o que mais importa para um MV. Um videoclipe retorna ao mesmo rosto oito ou dez vezes. O texto-para-vídeo reinventa o personagem a cada geração. Um pipeline de quadro-chave segura a identidade de duas maneiras: reutilize o still aprovado como primeiro quadro de cada clipe, ou alimente as mesmas imagens de referência para cada geração. Você direciona artisticamente uma vez, depois gasta dinheiro de vídeo animando uma decisão que já gosta.
Executando o Fluxo de Trabalho Seedream + Seedance no Atlas Cloud
Ambas as metades do pipeline funcionam em um só lugar. O Atlas Cloud hospeda a família completa de modelos ByteDance, então o Seedream 5.0 Pro (APIs públicas desde 8 de julho de 2026) e o Seedance 2.0 (lançado em 12 de fevereiro de 2026) ficam atrás da mesma conta, dos mesmos créditos e da mesma forma de API. Há duas maneiras de trabalhar: clicar nos playgrounds ou encadear os endpoints em código.
Método 1: Gerar suas Cenas de MV no Playground
Passo 1: Escale seu personagem no Seedream. Abra o playground do Seedream 5.0 Pro e escreva o prompt do quadro-chave (uma receita completa está duas seções abaixo). Combine a proporção de aspecto com seu formato de entrega agora, 9:16 para Shorts e TikTok, 16:9 para YouTube. Cada execução retorna uma imagem a $0,045, então itere até o rosto, guarda-roupa e luz estarem exatamente certos.

Passo 2: Carregue o still no Seedance. Abra o playground imagem-para-vídeo do Seedance 2.0. O formulário aceita uma imagem obrigatória, seu quadro-chave aprovado, mais uma imagem de último quadro opcional se quiser que a cena termine em uma composição específica.
Passo 3: Escreva o prompt de movimento e defina o clipe. A duração varia de 4 a 15 segundos, ou Auto para deixar o modelo escolher. Escolha a proporção que combina com seu quadro-chave, ou deixe em Auto. A resolução padrão é 720p.
Passo 4: Verifique três alternadores. "Gerar áudio" dá som nativo ao clipe. "Marca d'água" fica desligado para masters limpos. "Retornar último quadro" entrega o quadro final como uma imagem separada; alimente-o de volta como o primeiro quadro da próxima geração e o novo clipe continua de onde este parou. Esse alternador é a diferença entre quatro clipes desconectados e uma performance contínua.
Passo 5: Leia o preço, depois execute. O botão Executar mostra o custo das suas configurações exatas antes de você se comprometer. Em 21 de julho de 2026, um clipe de 5 segundos em 720p mostra ≈$0,97 com o desconto por tempo limitado de 20% da plataforma aplicado (≈$1,21 no preço de tabela).
Método 2: Encadear Seedream e Seedance Através de uma Única API
Passo 1: Obtenha sua chave de API. Crie uma chave no console do Atlas Cloud e exporte-a como uma variável de ambiente. Mantenha-a fora do código do cliente.


Passo 2: Verifique a documentação da API. Endpoints, parâmetros e comportamento de polling estão na documentação da API. O pipeline inteiro são dois ciclos de submit-and-poll.
Passo 3: Faça as duas chamadas. Primeiro o quadro-chave:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateImage \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedream-v5.0-pro/text-to-image", 6 "prompt": "<seu prompt de quadro-chave>", 7 "size": "1152*2048" 8 }'
Faça polling GET /api/v1/model/prediction/ até o trabalho ser concluído, pegue a URL da imagem hospedada da saída e passe-a diretamente para a chamada de vídeo:
plaintext1curl -X POST https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Content-Type: application/json" \ 3 -H "Authorization: Bearer $ATLASCLOUD_API_KEY" \ 4 -d '{ 5 "model": "bytedance/seedance-2.0/image-to-video", 6 "prompt": "<prompt de movimento e performance>", 7 "image": "<URL de saída do Seedream>", 8 "duration": 10, 9 "resolution": "720p", 10 "ratio": "adaptive", 11 "generate_audio": true, 12 "return_last_frame": true 13 }'
image aceita uma URL, Base64 ou uma referência de ativo, e duration aceita -1 para deixar o modelo escolher. watermark assume false por padrão. Com return_last_frame definido, a previsão concluída inclui o quadro final como uma imagem, então um script pode fazer um loop: gerar clipe, pegar último quadro, enviar próximo clipe. Esse loop é o pipeline inteiro do MV em cerca de trinta linhas.
Ambas as chamadas usam a mesma URL base, o mesmo cabeçalho bearer e o mesmo polling de previsão. Esse é o benefício prático do design de API única: sua integração Seedream e sua integração Seedance diferem por uma string de modelo e alguns campos, e o próximo lançamento da ByteDance se encaixará no mesmo código.
Receita de Prompt Seedream 5.0 Pro para Quadros-Chave de MV
Um quadro-chave de MV é uma decisão de elenco, então o primeiro trabalho do prompt é definir uma pessoa que você possa invocar novamente. O padrão de trabalho é um bloco de personagem: uma frase, 40 a 60 palavras, travando rosto, cabelo e guarda-roupa. Ele é reutilizado literalmente em cada prompt de quadro-chave do projeto. Mude uma palavra e você corre o risco de escalar um estranho.
Aqui está um prompt de quadro-chave completo nesse padrão:
Uma jovem com cabelo preto até a cintura, traços suaves e arredondados, e brincos de prata em gota, usando um suéter creme oversized de tricô. Ela está sozinha em um telhado molhado pela chuva ao anoitecer, enquadrada dos ombros para cima na altura dos olhos. Seus olhos estão brilhantes, lábios entreabertos como se fosse cantar, olhar passando pela câmera. Brilho azul frio da cidade atrás dela, uma luz de borda quente em sua bochecha, profundidade de campo rasa, still de filme cinematográfico, granulação suave, 9:16.
A primeira frase é o bloco do personagem. Tudo depois muda por cena. Um MV precisa de um pequeno conjunto de cobertura, não de uma imagem:
| Cena | Propósito | O que muda no prompt | O que permanece fixo |
|---|---|---|---|
| Aberta | Estabelecer o lugar e o clima | Detalhe do local, enquadramento corpo inteiro | Bloco do personagem, direção da luz |
| Médio | Performance do verso | "Enquadrado da cintura para cima", um gesto | Bloco do personagem |
| Close-up | Pico emocional do refrão | "Ombros para cima", os sinais faciais | Bloco do personagem |
Duas notas específicas do Seedream. Escreva a emoção como evidência física, não um rótulo: "olhos brilhantes, mandíbula tensa, uma respiração presa" anima depois, enquanto "triste" achata em uma expressão padrão. E defina a proporção de aspecto no seletor de tamanho, não apenas na prosa, porque o parâmetro vence. Para a anatomia mais profunda do prompt, incluindo padrões de exclusão e bugs conhecidos do modelo, veja nosso guia de prompts para o Seedream 5.0 Pro.
Prompts Seedance 2.0 para Sincronia Labial, Física e Emoção
O quadro-chave entrega ao Seedance 2.0 um rosto que vale a pena animar. O prompt de movimento decide se o clipe atua ou apenas se move. O Seedance 2.0 gera áudio de canal duplo nativamente e sincroniza lábios no nível fonêmico em oito ou mais idiomas, conforme o post de lançamento da ByteDance, então o trabalho do prompt é dizer o que está sendo executado, por quem e como a câmera o trata.
Existem duas rotas para um personagem cantando.
Rota A, música gerada: fique no imagem-para-vídeo, ligue "gerar áudio" e descreva o vocal no prompt. O modelo inventa a música e sincroniza os lábios com sua própria faixa. Este é o caminho mais rápido para um clipe de performance no estilo Cia0.
Rota B, sua própria faixa: mude para referência-para-vídeo, que aceita até 9 imagens de referência, 3 vídeos e 3 clipes de áudio por execução. Faça upload da sua seção de música como referência de áudio, adicione seu quadro-chave como referência de imagem e mencione-o com @ no prompt para vincular o personagem à ação. Esta é a receita que Curious Refuge validou em maio para sincronia labial com múltiplos falantes: "uma imagem de referência," "um vídeo escurecido com áudio OU arquivo de áudio," e "um prompt (movimento de câmera + VO/diálogo)." Corte o áudio para o comprimento do clipe antes de fazer upload; os tokens cobrados contam a duração de entrada mais a duração de saída, então preenchimento custa dinheiro real.

As dicas que separam uma performance de um protetor de tela:
| O que você quer | Dica de prompt que funciona | Por que funciona |
|---|---|---|
| Sincronia labial que se lê | Nomeie o idioma e o estilo vocal: "ela canta uma balada lenta em mandarim, voz suave e sussurrada" | A sincronia em nível fonêmico precisa saber o que está sendo cantado |
| Física do cabelo e tecido | Dê uma causa à força: "uma rajada de vento levanta seu cabelo, o suéter ondula" | A física segue forças declaradas, não adjetivos |
| Emoção visível | Sinais físicos com tempo: "seus olhos fecham na nota sustentada, uma lágrima no canto externo" | Modelos animam ações muito melhor do que humores |
| Sensação de câmera | Um movimento por clipe: "aproximação lenta de médio para close-up" | Movimentos de câmera empilhados lutam entre si em 15 segundos |
| Drama em múltiplas cenas | Descreva a sequência em ordem: "abre no horizonte, corta para o rosto dela quando o vocal entra" | O Seedance 2.0 lida com sequências multícena nativamente em uma execução |
Qualquer coisa maior que 15 segundos é um trabalho de encadeamento: o truque de retornar-último-quadro da seção de configuração, com a próxima linha da música em cada novo prompt. Mantenha a formulação do bloco de personagem dos seus prompts Seedream dentro dos prompts de movimento também. Redundância é seguro barato para identidade.
De Clipes Seedance a um MV Finalizado: Edição e Orçamento
O post japonês "warp de colírio" é a imagem mais clara do estágio de finalização, porque o criador lista toda a linha de montagem na legenda: Seedream para os stills, Seedance 2.0 para o movimento, Mureka V9 para a trilha sonora e OpenShot, um editor gratuito para desktop, para o corte. O clipe de Cia0 nomeia o CapCut como seu local. Qualquer editor que você escolher, o corte é o mesmo trabalho: coloque a faixa completa primeiro, corte os clipes no ritmo e mantenha uma proporção de aspecto do início ao fim.

Uma nota sobre essa rota do CapCut. Dentro do CapCut, o Seedance 2.0 funciona como Dreamina Seedance 2.0, disponível nos EUA desde 7 de abril de 2026, e de acordo com o próprio anúncio do CapCut, ele vem com restrições que incluem bloquear a geração de vídeo a partir de imagens contendo rostos reais, além de uma marca d'água visível na saída. Bom para memes, limitante para masters de MV limpos. A rota da API e do playground deixa a marca d'água desligada por padrão e aceita qualquer quadro-chave que você gerou.
Quanto custa tudo, com as taxas com desconto de julho de 2026 no Atlas Cloud:
| Etapa | Modelo ou ferramenta | Volume | Custo |
|---|---|---|---|
| Quadros-chave | Seedream 5.0 Pro | 10 stills a $0,045 | $0,45 |
| Rascunhos de movimento | Seedance 2.0 Mini imagem-para-vídeo | 4 clipes × 10 s a $0,045/s | $1,80 |
| Clipes finais | Seedance 2.0 imagem-para-vídeo, 720p | 4 clipes × 10 s a ≈$0,1935/s | ≈$7,74 |
| Trilha sonora | Sua própria faixa, ou um modelo de música IA | 1 música | varia |
| Edição | CapCut ou OpenShot | 1 sessão | $0 |
| Total | ~40 s de MV finalizado | ≈$10 |
A linha de rascunhos é a que as pessoas pulam e não deveriam. O Seedance 2.0 Mini executa o mesmo fluxo de primeiro-quadro-mais-prompt a partir de $0,045 por segundo (tabela $0,056), cerca de um quarto da taxa do flagship em 720p, então bloqueio, movimentos de câmera e física são depurados baratos antes da renderização final. Sem o desconto, o mesmo orçamento fica perto de $12,40 nos preços de tabela, ainda menos que a maioria das assinaturas de banco de imagens cobra por um mês.
Perguntas Frequentes
O Seedance 2.0 consegue sincronizar os lábios de um personagem com minha própria música?
Sim. Use o endpoint referência-para-vídeo, que aceita até 3 clipes de áudio junto com 9 imagens e 3 vídeos por geração. Faça upload da seção da música como referência de áudio, adicione seu quadro-chave Seedream como referência de imagem, mencione-o com @ no prompt e descreva a performance e a câmera. Corte o áudio para o comprimento do clipe primeiro, já que os tokens cobrados contam a duração de entrada mais a de saída.
Os prompts do Seedream e Seedance precisam ser em chinês?
Não. Cia0 compartilha prompts em chinês, e a cultura de prompts em chinês em torno de modelos ByteDance é forte, mas ambos os modelos aceitam prompts em inglês, e a sincronia labial do Seedance 2.0 funciona no nível fonêmico em oito ou mais idiomas. O que importa é nomear o idioma do vocal no prompt para que os formatos da boca correspondam à faixa.
Quanto tempo pode durar uma única geração do Seedance 2.0?
4 a 15 segundos por execução, com sequências multícena suportadas dentro dessa janela, ou defina duration como -1 e o modelo escolhe. Para um MV completo, encadeie gerações: ative "retornar último quadro" e comece o próximo clipe a partir do quadro final do clipe anterior para que a performance permaneça contínua.
Meus clipes de MV terão marca d'água?
Não por padrão na API ou playground: o parâmetro watermark vem como falso, então os masters saem limpos. A versão consumidora do CapCut é diferente. O Dreamina Seedance 2.0 aplica uma marca d'água visível e bloqueia a geração a partir de imagens com rostos reais, parte do pacote de proteção com o qual foi relançado em 2026.
Quanto custa um MV completo Seedream + Seedance?
Cerca de $10 para um vídeo vertical de 40 segundos em 720p com as taxas com desconto de julho de 2026: $0,45 em quadros-chave, $1,80 em rascunhos Mini e aproximadamente $7,74 em clipes finais em 720p, com edição gratuita no CapCut ou OpenShot. Nos preços de tabela, a mesma execução fica em cerca de $12,40. O estágio de quadro-chave é o que mantém esse número tão baixo, porque as decisões de visual são tomadas a $0,045 em vez de ≈$0,97 por re-roll.
Conclusão
Os clipes que estão circulando este mês não são obra de um recurso secreto. Eles são uma divisão de trabalho: o Seedream 5.0 Pro decide quem está na tela e como o quadro se sente, o Seedance 2.0 decide como eles se movem e soam, e um editor gratuito transforma clipes em uma música com um rosto. Cada etapa é inspecionável, e cada erro é pego no lugar mais barato possível.
Roube a ordem das operações. Trave um bloco de personagem, compre seus erros a $0,045, anime apenas o que você já aprovou e deixe o último quadro de um clipe abrir o próximo. As ferramentas são novas. A disciplina é apenas cinema.






