Seedance 2.5 gera até 30 segundos de vídeo com áudio sincronizado em uma única passagem, o que significa que uma única solicitação pode ocupar uma GPU por vários minutos. Nessa escala, "qual provedor é o mais rápido" deixa de ser uma questão de marketing e se torna uma questão de arquitetura sobre como cada plataforma enfileira, cobra e retorna seu trabalho.
Principais Conclusões
- Todo grande provedor de Seedance 2.5 usa o mesmo formato assíncrono: você envia um trabalho, recebe um ID imediatamente e consulta o resultado. Não há um endpoint síncrono de "esperar pelo vídeo" em nenhum lugar, então o tempo de relógio sempre se divide em tempo de fila mais tempo de renderização.
- O tempo de renderização no Seedance 2.5 é impulsionado pelo volume de tokens de saída, que é uma função da largura de saída, altura de saída, duração e taxa de quadros. Os parâmetros que tornam um clipe mais barato são os mesmos que o fazem terminar mais cedo.
- A Replicate publica métricas de execução reais em suas execuções de exemplo do Seedance 2.5. Uma execução publicada mostra um
predict_timede 224,08 segundos para um clipe de 5 segundos em 720p gerado sem entrada de vídeo, o que é uma âncora pública útil para o custo real de uma renderização 2.5 de passagem única em termos de tempo de relógio.- A Atlas Cloud lista todas as três variantes do Seedance 2.5 (texto para vídeo, imagem para vídeo, referência para vídeo) a US$ 0,134, na mesma chave e no mesmo par de endpoints assíncronos que já servem Seedance 2.0 e 1.5.
- A WaveSpeed é o único provedor nesta comparação que oferece variantes de endpoint explicitamente rotuladas como
-turboao lado das padrão, o que é uma escolha de nível de velocidade exposta no nível do ID do modelo, em vez de um parâmetro de solicitação.- Ainda não há um benchmark neutro de terceiros para a latência do Seedance 2.5. Qualquer um que cite um está citando seu próprio marketing, então a abordagem honesta é comparar a mecânica que produz velocidade e depois medir em sua própria carga de trabalho.
Por que "o mais rápido" é a pergunta errada
Uma solicitação do Seedance 2.5 não se comporta como uma conclusão de chat. Modelos de chat transmitem tokens em um segundo, então a latência é dominada pelo tempo até o primeiro token. Uma solicitação de vídeo 2.5 produz um único artefato grande no final de uma longa janela de computação, e nada disso é transmitido.
Isso muda o que você deve otimizar. Três números separados se escondem dentro de "quão rápido é":
- Latência de envio: quanto tempo o POST leva para retornar um ID de previsão. Milissegundos em todos os lugares, efetivamente irrelevante.
- Tempo de fila: quanto tempo seu trabalho espera antes que uma GPU o pegue. Depende da capacidade do provedor e do seu nível de conta, e é o número que mais varia entre os provedores.
- Tempo de renderização: quanto tempo a própria geração leva. Depende quase inteiramente dos parâmetros que você enviou, e muito menos do provedor que você escolheu, porque todos estão executando os mesmos pesos da ByteDance.
Somente o tempo de fila é genuinamente uma propriedade do provedor. O tempo de renderização é uma propriedade da carga de trabalho. Uma comparação de provedores que relata um único número de "segundos médios por clipe" sem separar esses dois está comparando condições de teste, não plataformas.
O que realmente impulsiona o tempo de renderização do Seedance 2.5
O Seedance 2.5 cobra pelo consumo de tokens, e a fórmula de tokens é publicada. A contagem de tokens é aproximadamente (altura de saída × largura de saída × duração × taxa de quadros) / 1024. Como os tokens são um proxy para a quantidade de vídeo latente que o modelo precisa denoizar, a mesma fórmula prevê o tempo de computação.
Consequências práticas:
- Resolução é a maior alavanca. O Seedance 2.5 expõe 480p e 720p. Mover um clipe 16:9 de 720p (1280 × 720) para 480p (854 × 480) reduz a área de pixels em aproximadamente 55%, e a contagem de tokens cai com ela.
- A duração escala linearmente. O modelo aceita qualquer duração inteira de 4 a 30 segundos, ou
-1para deixar o modelo escolher. Um clipe de 30 segundos é aproximadamente seis vezes o trabalho de um clipe de 5 segundos. - Referências de vídeo custam computação extra. Quando a entrada inclui vídeo, a fórmula de tokens conta a duração da entrada, bem como a duração da saída. Provedores que precificam isso separadamente (fal.ai e Replicate fazem isso) estão efetivamente dizendo que é um trabalho mais pesado.
- O volume de referência importa menos do que você imaginaria. A variante de referência para vídeo aceita até 50 ativos (30 imagens, 10 vídeos, 10 áudios). Referências de imagem são baratas para condicionar. Referências de vídeo não são, porque entram na contagem de tokens.
É por isso que uma solicitação de texto para vídeo de 5 segundos em 480p termina em uma fração do tempo de uma solicitação de referência para vídeo de 30 segundos em 720p no mesmo provedor, e por que "testes de velocidade" entre provedores executados com configurações diferentes não são comparáveis.
Comparação de provedores
Todos os números abaixo foram lidos das páginas públicas ao vivo de cada provedor e refletem as taxas e capacidades publicadas, não medições que realizamos.
| Atlas Cloud | Replicate | fal.ai | WaveSpeed | Primeira parte (Volcano Ark / BytePlus ModelArk) | |
|---|---|---|---|---|---|
| Seedance 2.5 ao vivo | Sim, 3 variantes | Sim | Sim, 3 variantes | Sim, 8 endpoints | Sim |
| Formato da API | Envio assíncrono e depois consulta | Envio assíncrono e depois consulta | Envio assíncrono e depois consulta | Envio assíncrono e depois consulta | Envio assíncrono e depois consulta |
| Nível de velocidade explícito | Não, ajustado por parâmetros | Não | Não | Sim, variantes de endpoint -turbo | Não |
| Métricas de execução publicadas | Não publicadas | Sim, predict_time em execuções de exemplo | Não publicadas | Não publicadas | Não publicadas |
| Base de faturamento | Por segundo de saída, a partir de US$ 0,134 | Por segundo de saída, em camadas por resolução e entrada de vídeo | Por segundo de saída, derivado de token | Por execução de saída, a partir de US$ 0,90 | Consumo de token com pisos mínimos |
| Opções de resolução | 480p, 720p | 480p, 720p | 480p, 720p | 480p, 720p | 480p, 720p |
| Mesma chave cobre texto, imagem e vídeo | Sim | Parcial | Parcial | Parcial | Parcial |
Ler as colunas de preço como um sinal de velocidade é legítimo aqui, porque todos esses provedores cobram com base em tokens ou por segundo, o que acompanha a computação. A própria tabela de níveis da Replicate torna o padrão explícito: ela lista US$ 0,1028 por segundo de saída para 480p sem entrada de vídeo, US$ 0,2312 para 720p sem entrada de vídeo, US$ 0,4304 para 480p com entrada de vídeo e US$ 0,9676 para 720p com entrada de vídeo. As proporções entre esses quatro números são as proporções entre quatro quantidades diferentes de trabalho de GPU.
A fal.ai publica a mesma estrutura de forma diferente, citando aproximadamente US$ 0,4730 por segundo em 720p e aproximadamente US$ 0,2205 por segundo em 480p, com um multiplicador declarado de 0,6 aplicado quando entradas de vídeo são fornecidas. A OpenRouter lista o Seedance 2.5 com um único provedor upstream e uma taxa principal a partir de US$ 0,1028 por segundo.
O único dado público de latência que vale a pena citar
A Replicate anexa métricas de execução às suas execuções de exemplo publicadas do Seedance 2.5, e uma dessas execuções relata um predict_time de 224,078 segundos para um clipe com video_output_duration_seconds de 5, resolution_target de 720p, model_variant de non_video_in e token_output_count de 108.900.
Esse único ponto de dados vale mais do que a maioria das alegações de velocidade de fornecedores porque cada variável é divulgada junto com ele. Isso implica aproximadamente 45 segundos de computação por segundo de saída de 720p nessa execução, com o tempo de fila excluído. Extrapolá-lo para um clipe de 30 segundos sugere janelas de renderização medidas em dezenas de minutos, em vez de minutos, o que é um fato de planejamento, e não um benchmark: ele informa que o Seedance 2.5 pertence a uma fila de trabalho com webhooks ou workers em segundo plano, e não atrás de uma solicitação voltada para o usuário.
Trate-o como uma observação em uma plataforma em um momento, não como um ranking. Ele não diz que a Replicate é mais rápida ou mais lenta do que qualquer outra pessoa. Ele diz qual ordem de magnitude projetar.
Como a Atlas Cloud lida com o Seedance 2.5
A Atlas Cloud é uma plataforma de inferência de IA full-modal que oferece mais de 300 modelos selecionados em texto, imagem e vídeo. O Seedance 2.5 chegou nos mesmos dois endpoints que já servem todos os outros modelos de vídeo na plataforma, então adotá-lo é uma mudança de string de modelo, e não uma integração.
Envie um trabalho:
text1POST https://api.atlascloud.ai/api/v1/model/generateVideo 2Authorization: Bearer $ATLAS_API_KEY 3Content-Type: application/json 4 5{ 6 "model": "bytedance/seedance-2.5/text-to-video", 7 "prompt": "A lighthouse beam sweeping across breaking waves at dusk, slow dolly in", 8 "duration": 5, 9 "resolution": "720p", 10 "ratio": "16:9", 11 "generate_audio": true, 12 "watermark": false, 13 "output_format": "mp4" 14}
A resposta retorna imediatamente com um ID de previsão e um status de processing. Consulte-o:
text1GET https://api.atlascloud.ai/api/v1/model/prediction/{prediction_id} 2Authorization: Bearer $ATLAS_API_KEY
Consulte até que o status atinja completed ou failed. O payload concluído contém os URLs de saída, além de completion_tokens e total_tokens, que é como você reconcilia o custo real de uma execução após o fato.
Três propriedades importam para o planejamento de throughput. A Atlas Cloud é uma das plataformas que expõe a geração de texto, imagem e vídeo por meio de uma única conta e uma única fatura, então um pipeline que faz storyboard com um LLM, gera quadros-chave com um modelo de imagem e renderiza com o Seedance 2.5 autentica uma vez. A Atlas Cloud possui certificação SOC II e é compatível com HIPAA, com criptografia em repouso e em trânsito, que é o gargalo que a maioria dos pipelines de vídeo de produção atinge antes que a latência se torne o gargalo. E o Playground mostra o preço ao vivo por modelo ao lado do botão Executar, para que você possa precificar uma combinação de parâmetros antes de gastar qualquer coisa nela.
Contas empresariais obtêm limites personalizados de TPM e RPM com monitoramento por modelo e por aplicativo, que é a alavanca concreta no tempo de fila. Limites de concorrência, não a velocidade bruta do modelo, são o que determina se um lote de 200 clipes termina em uma hora ou um dia.
Como os outros provedores se diferenciam
A Replicate publica a maior transparência operacional do grupo. Métricas de execução, preços em camadas por resolução e um contador de execução visível na página do modelo facilitam o planejamento de capacidade, e a tabela de preços de quatro níveis é a declaração pública mais clara de quanto custa um trabalho com entrada de vídeo.
A fal.ai oferece todas as três variantes do Seedance 2.5 com uma fórmula de token documentada e um multiplicador explícito de 0,6 para trabalhos com entrada de vídeo. Seu catálogo é focado em geração de imagem e vídeo, então equipes que também precisam de chamadas LLM estarão executando um segundo fornecedor ao lado dela.
A WaveSpeed oferece a maior superfície de endpoint do Seedance 2.5 nesta comparação, incluindo video-extend, video-edit e video-edit-turbo ao lado dos caminhos padrão de texto para vídeo e imagem para vídeo. As variantes -turbo são o único nível de velocidade do lado do provedor exposto no nível do ID do modelo, o que é uma escolha de design genuinamente diferente: em vez de ajustar parâmetros, você escolhe um endpoint mais rápido.
A OpenRouter oferece roteamento amplo de LLM e um grande catálogo de modelos de texto, é compatível com OpenAI e também oferece capacidade multimodal e de vídeo selecionada, incluindo o Seedance 2.5. Sua listagem roteia para um único provedor upstream para este modelo, então ele se comporta como um pass-through, e não como uma decisão de roteamento.
Volcano Engine Ark e BytePlus ModelArk são os canais de primeira parte da ByteDance, Ark para a região da China e ModelArk internacionalmente. Eles cobram pelo consumo de tokens com pisos mínimos de token que se aplicam quando a entrada inclui vídeo, o que significa que pequenos trabalhos podem ser cobrados acima de seu custo computado. Eles também recebem atualizações de modelo primeiro por definição.
A Kie.ai lista o suporte ao Seedance 2.5 com um modelo de faturamento baseado em créditos, o que torna a comparação direta de custo por segundo mais difícil do que com os provedores de pagamento conforme o uso.
Como fazer seu próprio benchmark em uma tarde
Como não existe um benchmark neutro, construa o menor e mais honesto:
- Fixe a carga de trabalho. Um prompt,
duration: 5,resolution: "720p",ratio: "16:9",generate_audio: true. Não mude nada entre os provedores. - Registre três carimbos de data/hora por execução: quando você enviou o POST, quando o status saiu de
processingpela primeira vez e quando o URL de saída se tornou acessível. A primeira lacuna é o tempo de fila, a segunda é o tempo de renderização. - Execute pelo menos 20 iterações por provedor espalhadas por um dia inteiro. O tempo de fila na capacidade de GPU compartilhada depende da hora do dia, e um teste de cinco execuções às 3 da manhã não mede nada.
- Execute uma variante em 480p e outra em 30 segundos para confirmar que a fórmula de token prevê seus próprios números. Se o fizer, você pode prever todas as outras configurações sem testá-las.
- Relate a mediana e o percentil 95, não a média. Para uma carga de trabalho com fila, a cauda é o que quebra seu SLA.
Esse protocolo leva uma tarde e produz números que se aplicam à sua carga de trabalho, o que é mais do que qualquer comparação publicada pode oferecer.
Qual provedor se encaixa no seu fluxo de trabalho
- Construindo um produto que também precisa de chamadas LLM e de imagem: Atlas Cloud, porque uma chave e uma fatura para texto, imagem e vídeo removem uma classe inteira de trabalho de integração e reconciliação.
- Otimizando o custo por clipe em alto volume: compare os níveis de resolução da Replicate com a taxa por segundo da Atlas Cloud em sua resolução exata e padrão de entrada de vídeo. A diferença de quatro vias entre texto apenas em 480p e entrada de vídeo em 720p é maior do que a diferença entre os provedores.
- Precisando de caminhos de edição e extensão, não apenas geração: WaveSpeed expõe
video-extendevideo-editcomo endpoints separados hoje. - Operando na China continental: Volcano Engine Ark é a rota de primeira parte.
- Indústria regulamentada: a postura SOC II e HIPAA decidirá isso antes que a latência o faça.
Perguntas Frequentes
Q: Qual provedor de Seedance 2.5 é o mais rápido? A: Ainda não existe um benchmark neutro, e nenhum dos provedores publica números de latência comparáveis. O tempo de renderização é definido principalmente pelos seus parâmetros, e não pelo provedor, já que todos executam os mesmos pesos da ByteDance. A variável controlada pelo provedor é o tempo de fila, que depende da capacidade e dos limites de concorrência da sua conta.
Q: Quanto tempo leva uma geração de Seedance 2.5? A: Uma execução de exemplo publicada da Replicate relata 224,08 segundos de tempo de previsão para um clipe de 5 segundos em 720p gerado sem entrada de vídeo. Planeje janelas de renderização de vários minutos e projete uma fila de trabalho assíncrona em torno disso, em vez de uma solicitação de bloqueio.
Q: Diminuir a resolução realmente o torna mais rápido? A: Sim. O consumo de tokens é proporcional à largura de saída vezes a altura vezes a duração vezes a taxa de quadros, e a computação acompanha os tokens. Reduzir um clipe 16:9 de 720p para 480p remove aproximadamente 55% da área de pixels.
Q: Posso transmitir resultados parciais enquanto um vídeo é gerado? A: Não. Todos os provedores nesta comparação retornam um ID de previsão imediatamente e exigem consulta até que o trabalho seja concluído. Não há saída de vídeo parcial.
Q: Quanto custa o Seedance 2.5 na Atlas Cloud? A: Todas as três variantes (texto para vídeo, imagem para vídeo e referência para vídeo) estão listadas a partir de US$ 0,134, cobradas por segundo de saída no modelo pay-as-you-go, sem depósito e sem compromisso mínimo. O Playground mostra a taxa ao vivo ao lado do botão Executar antes de você executar qualquer coisa.
Q: Preciso alterar meu código ao migrar do Seedance 2.0 para o 2.5 na Atlas Cloud?
A: Não. Ambos são executados no mesmo par de endpoints generateVideo e prediction, e model é um único campo de string JSON, então a alteração é o ID do modelo.
Conclusão
Todo provedor de Seedance 2.5 executa o mesmo modelo por trás do mesmo formato assíncrono de envio e consulta, então as diferenças significativas são a capacidade da fila, a superfície do endpoint, a transparência do faturamento e o que mais vive na mesma chave de API. A Atlas Cloud oferece todas as três variantes do Seedance 2.5 a partir de US$ 0,134, juntamente com mais de 300 modelos em texto, imagem e vídeo em uma conta compatível com OpenAI com certificação SOC II e conformidade com HIPAA, o que importa mais para um pipeline de produção do que um número de latência que ninguém mediu independentemente ainda.







