A MiniMax lançou o H3 na sexta-feira. Em vinte e quatro horas, o Seedance 2.5 estava nas mãos das pessoas, e a linha do tempo colapsou em uma única conversa: trinta segundos, 4K nativo, cinquenta entradas de referência. O post de lançamento do H3 ficou abaixo, discretamente, com quase ninguém rodando um teste real nele.
Entendo o porquê. Trinta segundos é um ótimo número. Cabe numa manchete.
Mas se você realmente produz drama curto vertical, sabe que o que estraga sua noite não é o segundo trinta. É o plano 4. A linha do maxilar do protagonista masculino desloca meio centímetro, o gravata perde uma dobra, e o espectador desliza antes do gancho funcionar. Ninguém sai porque um clipe tinha quinze segundos em vez de trinta. Eles saem porque o cara no close-up não é o cara do plano geral.
Então pulei o duelo de especificações. Construí uma ficha de personagem, um quadro de locação de seis painéis, escrevi um prompt de drama curto gótico de 15 segundos e enviei o pacote idêntico para ambos os lados. Aí olhei para o rosto.
Principais conclusões
- Ambos são reais, mas não igualmente acessíveis. Os três endpoints do H3 (texto, imagem e referência para vídeo) estão ao vivo e chamáveis agora. A API do Seedance 2.5 está disponível na ByteDance, mas na plataforma multi-modelo onde executei tudo, ainda é uma página de Dia 0, então o lado Seedance do meu confronto direto é Seedance 2.0 Referência-para-Vídeo. Sinalizo isso onde for relevante.
- As especificações se dividem claramente. Seedance 2.5 = até 30 segundos em uma geração, 4K nativo, até 50 referências multimodais, edição a nível de região. H3 = 5 a 15 segundos, 2K nativo a 24fps, 9 imagens + 3 vídeos + 3 clipes de áudio (12 arquivos no máximo), áudio estéreo em cada saída, edição por instrução de clipe inteiro.
- Estabilidade de personagem é um problema de empacotamento, não de geração de modelo. Com uma ficha composta de giro mais um quadro de iluminação, ambos os modelos mantiveram o mesmo rosto e o mesmo guarda-roupa. Nenhum número de geração salvou ou arruinou o plano; o pacote fez.
- O modelo que ninguém testou já está classificado em terceiro. Na arena de imagem-para-vídeo do Artificial Analysis, o H3 está em 1.185 Elo, atrás do Seedance 2.0 com 1.196. O Seedance 2.5 ainda não está na tabela.
- Ambos geram seu próprio áudio. O H3 também aceita até três referências de áudio para fixar uma voz a um personagem, o que elimina todo um estágio de TTS e sincronização de um pipeline de drama curto.
- Pergunte sobre pixels por quadro, não segundos. Mesmo pacote de referência, mesma duração: o referência-para-vídeo do H3 retorna 1440p, o referência-para-vídeo do Seedance 2.0 retorna 720p. Isso recontextualiza toda a questão de custo.
Os próprios números emparelhados do Seedance 2.5 ainda não estão disponíveis. Vou adicioná-los no dia em que o endpoint abrir onde testo.
O Resultado Seedance 2.5 vs MiniMax H3, Antes de Qualquer Teoria
Antes de qualquer teoria, aqui está o que o fluxo de trabalho produz. Estes são quatro planos extraídos de um clipe vertical finalizado de 15 segundos e lado a lado. É a execução de referência H3 da própria MiniMax construída exatamente a partir da ficha de personagem e do quadro de locação que você verá no Passo 1 e Passo 2, em 1440x2560 nativo. Minhas próprias execuções do mesmo pacote vêm depois, no tutorial, com o estado do playground visível.
Ela alcança a porta esculpida, que é o painel 4 do quadro de locação, depois o confronto no corredor, depois um close-up apertado nele, depois o plano dos dois. A linha do cabelo dele se separa da mesma forma no perfil e no close-up. A coroa trançada meio presa dela sobrevive a um close-up de rosto inteiro, que é exatamente onde a maioria dos modelos reconstrói silenciosamente um rosto. O corpete de renda creme mantém o mesmo decote e punho de manga do primeiro ao último quadro.
Esse é o teste completo. Não trinta segundos. Quatro planos e uma linha de maxilar.
Por que Seedance 2.5 vs MiniMax H3 Estourou na Mesma Semana, e Por que a Maioria dos Testes de Personagem é Inútil
A MiniMax lançou o H3 em 30 de julho, um modelo de vídeo multimodal de uso geral que lê texto, imagens, vídeo e áudio como um único contexto e retorna clipes de 5 a 15 segundos em até 2K com som estéreo nativo. Também pode editar filmagens existentes e transferir movimento de um clipe para outro, e a MiniMax disse que os pesos seguiriam em poucos dias (Reuters, julho de 2026).
O Seedance 2.5 chegou na mesma janela com um número mais alto: 30 segundos em uma única geração, 4K nativo e até 50 entradas de referência multimodal em um único trabalho (The Next Web, julho de 2026). Sua API já está nas mãos dos desenvolvedores, com edição localizada que redesenha parte de um quadro enquanto mantém desempenho, iluminação e comportamento de câmera intactos, referência-para-vídeo que aceita telas verdes ou blocos de modelo 3D branco, onze idiomas e um modo de vídeo longo experimental que alcança 180 segundos (CineD, julho de 2026).
A lacuna de atenção é a parte interessante. Quase todo post que encontrei era um clipe 2.5. Enquanto isso, os números da arena pública dizem outra coisa: no ranking de imagem-para-vídeo do Artificial Analysis, o Seedance 2.0 em 720p lidera com 1.196 Elo, o Gemini Omni Flash segue com 1.195, e o MiniMax H3 já é terceiro com 1.185, quatro dias após o lançamento. O Seedance 2.5 ainda não tem classificação lá (Artificial Analysis, julho de 2026). O modelo com menos buzz é o que tem a maior proporção de pontuação para atenção.
Agora, a parte que realmente decide sua saída, porque tem quase nada a ver com qual logotipo você escolhe.
A maioria dos testes de consistência de personagem falha antes mesmo do modelo ser envolvido. Quatro modos de falha, e todos os quatro são seus para consertar:
| Modo de falha | O que você vê na saída | A correção |
|---|---|---|
| Referências multi-visualização enviadas como arquivos separados | O rosto de cada plano está "quase certo" e nenhum concorda | Componha as visualizações em uma imagem, depois atribua papéis no prompt ("o homem à ESQUERDA", "a mulher à DIREITA") |
| Reescrever a descrição do personagem por plano | Guarda-roupa e acessórios variam de plano a plano | Escreva o bloco de identidade uma vez e reutilize-o literalmente; apenas câmera e ação mudam por plano |
| Deixar a iluminação se mover com a cena | O rosto é estruturalmente reconstruído na nova luz | Construa um quadro de locação separado que trave direção da luz, névoa e reflexo do chão, e alimente como referência |
| Tratar a duração máxima como métrica de qualidade | Um desvio dentro de 30 segundos mata todos os 30 | Corte na granularidade que você pode re-rolar, depois fale sobre comprimento |
A primeira linha é a que as pessoas erram mais. Envie seis imagens de visualização única e o modelo as trata como seis pessoas candidatas e as calcula em média. Envie uma composição limpa e ele as trata como uma pessoa vista de três lados. Mesmos pixels, resultado completamente diferente.
Ficha Técnica Seedance 2.5 vs MiniMax H3, e o que Você Pode Realmente Chamar Hoje
Separe capacidade de disponibilidade e a tensão fica clara. Em capacidade bruta, o Seedance 2.5 lidera em duração, teto de resolução, contagem de referências e granularidade de edição. Em disponibilidade, o H3 é aquele com três endpoints ativos em uma plataforma de modelo de uso geral esta semana. Se você está fazendo comparação de modelos de vídeo de IA para planejamento de 2026, essa segunda coluna importa tanto quanto a primeira.
| MiniMax H3 | Seedance 2.5 | Seedance 2.0 Ref-para-Vídeo (o que executei) | |
|---|---|---|---|
| Duração máxima, uma geração | 5 a 15 s | até 30 s, sem costura (modo beta até 180 s, experimental) | menu de clipes curtos, veja a página do modelo |
| Resolução | 2K nativo, lado curto 1440p em 16:9 a 9:16; uma camada 768p listada como futura | 4K nativo, cor de 10 bits | até 720p neste endpoint |
| Taxa de quadros | 24 fps | não publicado separadamente | não publicado separadamente |
| Entradas de referência | 9 imagens + 3 vídeos + 3 áudios, 12 arquivos no total | até 50 referências multimodais | 9 imagens + 3 vídeos + 3 áudios |
| Áudio nativo | sim, toda saída, estéreo | sim, mais 11 idiomas de legenda e voz | sim |
| Granularidade de edição | edições de clipe inteiro por instrução (trocar personagem, fundo, iluminação, diálogo) | edições a nível de região que redesenham parte de um quadro | edições de clipe inteiro por instrução |
| Limite de prompt | 7.000 caracteres | não publicado | não publicado |
| Pesos abertos | anunciado para dias após o lançamento | não anunciado | não anunciado |
| Elo I2V Artificial Analysis, 31 jul 2026 | 1.185 (3º) | ainda não classificado | 1.196 (1º, entrada Dreamina 720p) |
| Chamável na plataforma que testei | sim, 3 endpoints | ainda não, página Dia 0 | sim |
Divulgação completa sobre a configuração do teste. O Seedance 2.5 não estava aberto na minha plataforma quando executei isso, então o lado Seedance é Seedance 2.0 Referência-para-Vídeo, o membro atualmente em envio da mesma família com o mesmo sistema de referência quad-modal. Onde 2.5 mudaria a resposta, eu digo. A página do Seedance 2.5 é um aviso de Dia 0 por enquanto.
Tudo abaixo roda em uma aba do navegador, em uma chave, três modelos no total:
| Passo | Modelo | O que produz | Configurações principais | O que determina o custo |
|---|---|---|---|---|
| 1 | OpenAI GPT Image 2 Texto-para-Imagem | a ficha de personagem | qualidade alta, 16:9 | por imagem, pague conforme usar, tarifa atual na página do modelo |
| 2 | mesmo modelo, segunda execução | o quadro de locação e iluminação de seis painéis | qualidade alta, 16:9 | por imagem, pague conforme usar |
| 3 | MiniMax H3 Referência-para-Vídeo | o clipe 9:16 com áudio nativo | 9:16, 2K, duração 5 para teste e 15 para o corte real | segundos x resolução, cobrado por segundo |
| 4 | Seedance 2.0 Referência-para-Vídeo | a execução de controle, entradas idênticas | 9:16, melhor resolução disponível, mesma duração | segundos x resolução, cobrado por segundo |
| 5 | H3 Referência-para-Vídeo, clipe como entrada | um plano fixo sem re-rolar tudo | mesma resolução, duração curta | segundos x resolução, cobrado por segundo |
O H3 também tem entradas texto-para-vídeo e imagem-para-vídeo se você quiser uma linha de base de texto puro ou controle de primeiro e último quadro.
Mais uma coisa que vale a pena saber antes de planejar um lote: texto na tela. Esta sequência de título de 15 segundos do H3 mantém créditos em inglês através de oito cortes secos sem um único erro de ortografia, que é uma das coisas mais difíceis de manter estável em vídeo gerado.
O Fluxo de Trabalho de Drama Curto Seedance 2.5 vs MiniMax H3, Passo a Passo
Cinco passos. Copie os prompts exatamente como escritos, incluindo as partes feias. Não os limpei para o artigo e você não deve limpá-los para o modelo.
Passo 1: Construa a ficha de personagem com GPT Image 2
Faça o pacote de referência antes de fazer qualquer vídeo. Uma imagem, dois personagens, três visualizações cada, fundo branco puro e sem costura, iluminação de estúdio uniforme. Isso remove toda ambiguidade, exceto a que você se importa: como essa pessoa se parece.
plaintext1Uma ficha de referência de personagem de corpo inteiro em fundo branco puro e sem costura, dois personagens lado a lado, seis figuras no total, iluminação de estúdio neutra uniforme, sem sombras no chão, sem texto, sem rótulos, sem marca d'água. 2 3METADE ESQUERDA, protagonista masculino, três visualizações em linha: frontal, perfil direito, costas. Final dos 20 anos, pele clara, cabelo escuro ondulado de comprimento médio, maxilar definido. Vestindo um sobretudo de veludo preto até o chão com bordado sutil tom sobre tom nas lapelas e punhos, um colete de brocado preto, uma gravata de seda preta, calças retas pretas, sapatos Derby de couro preto polidos. Braços relaxados ao lado do corpo, expressão neutra. 4 5METADE DIREITA, protagonista feminina, três visualizações em linha: frontal, perfil direito, costas. Início dos 20 anos, pele clara, cabelo longo ondulado castanho-acaju com uma coroa trançada meio presa. Vestindo um vestido vitoriano de renda de algodão creme, mangas longas com punhos de renda, corpete ajustado com pequenos botões, saia longa até o tornozelo, sapatos de salto baixo com tira de tornozelo creme. Braços relaxados ao lado do corpo, expressão neutra. 6 7Realismo fotográfico, escala consistente entre todas as seis figuras, pés alinhados na mesma linha de base, foco nítido de ponta a ponta.
Configurações: modelo OpenAI GPT Image 2 Texto-para-Imagem, Qualidade alta, Proporção de aspecto 16:9, todo o resto padrão.
GPT Image 2 Texto-para-Imagem no Atlas Cloud, execução concluída: o prompt de ficha à esquerda, seis figuras em uma folha branca no painel OUTPUT.
Esta é a forma alvo. Seis figuras, uma linha de base, nada no fundo para discutir:
O pacote de referência que gerou o clipe de demonstração: protagonista masculino em veludo preto, protagonista feminina em renda vitoriana creme, três visualizações cada, um arquivo.
Minha própria execução do GPT Image 2 do prompt do Passo 1, para comparação com a referência acima.
Passo 2: Trave a locação com um quadro de cena de seis painéis
Você segurou o rosto. A luz ainda vai te trair. A segunda imagem de referência fixa seis posições de câmera, a direção do luar, quanto de névoa está no ar e quão molhado o chão parece. Você está dizendo ao modelo que este filme tem exatamente uma configuração de iluminação.
plaintext1Um quadro de locação cinematográfica de seis painéis, 2 linhas por 3 colunas, finas bordas pretas entre os painéis, cada painel legendado em letras maiúsculas brancas elegantes com espaçamento na parte inferior desse painel. Assunto: o interior de um castelo gótico abandonado à noite. Luar azul frio, névoa baixa à deriva, piso de pedra molhado e reflexivo, vitrais altos, castiçais de ferro com pequenas chamas quentes, pretos profundos dessaturados, cortinas de veludo pesadas. Nenhuma pessoa em nenhum painel. 2 3Painel 1, legenda "VISTA GERAL ABERTA - CORREDOR": um corredor longo com colunas recuando para um vitral iluminado. 4Painel 2, legenda "ÂNGULO BAIXO - LUAR ATRAVÉS DO CHÃO": câmera baixa, um feixe de luar varrendo pedras molhadas. 5Painel 3, legenda "COMPOSIÇÃO DE PORTA & ESCADARIA": uma porta em arco emoldurando uma escada de pedra curva. 6Painel 4, legenda "DETALHE PRÓXIMO - PORTA ESCULPIDA": close-up apertado de uma porta de madeira pesada e esculpida com uma maçaneta de ferro. 7Painel 5, legenda "VISTA AO LADO DA JANELA - NÉVOA & CORTINAS": janela alta, névoa entrando, borda da cortina em primeiro plano. 8Painel 6, legenda "QUADRO FINAL DE PÔSTER - SALÃO VAZIO": salão vazio simétrico, tapete de corredor estampado levando à janela. 9 10Fotográfico, cinematográfico, grão de filme, gradação de cor consistente em todos os seis painéis.
Configurações: mesmo modelo, Qualidade alta, Proporção de aspecto 16:9.
O quadro de locação que gerou o clipe de demonstração: seis interiores de castelo gótico, uma gradação de cor, legendas legíveis.
Minha própria execução do GPT Image 2 do prompt do quadro do Passo 2.
Passo 3: Gere o plano com MiniMax H3 referência-para-vídeo
Duas imagens de referência mais um prompt carregando posições de câmera e direção de áudio. O som é produzido na mesma passada, então não há etapa separada de voz ou trilha. Mantenha a duração curta enquanto ajusta, depois aumente para 15 para o corte real.
plaintext1A imagem de referência 1 é a ficha de personagem: o homem à ESQUERDA é o protagonista masculino, a mulher à DIREITA é a protagonista feminina. Mantenha ambas as identidades exatamente como mostrado: o maxilar dele, cabelo escuro ondulado, sobretudo de veludo preto, colete de brocado preto e gravata de seda preta; o cabelo castanho meio preso trançado dela e vestido de renda vitoriana creme. A imagem de referência 2 é o quadro de locação e iluminação: combine seu luar azul frio, névoa à deriva, piso de pedra molhado e reflexivo e tons pretos dessaturados. 2 39:16 vertical, visual de drama curto ao vivo premium, profundidade de campo rasa, contraste cinematográfico, sem legendas, sem texto na tela, sem marca d'água. 4 5Plano 1: Close-up médio, câmera se aproximando lentamente. A protagonista feminina está de pé no corredor iluminado pelo luar, respirando superficialmente, olhos fixos em algo fora do quadro à direita. A névoa passa por ela na altura dos joelhos. 6Plano 2: Corte seco. Por cima do ombro por trás dela, o protagonista masculino sai do arco escuro para o luar, casaco pegando a luz, expressão fria e curiosa. 7Plano 3: Close-up apertado no rosto dele, meio iluminado pela janela, depois um close-up correspondente no dela enquanto ela se recusa a desviar o olhar. 8 9Áudio: zumbido grave sustentado baixo, eco de pedra distante, respiração instável dela, uma pisada pesada quando ele entra na luz, um único acorde suave de cordas no último corte.
Configurações: modelo MiniMax H3 Referência-para-Vídeo, Resolução 2K, Duração 8 (o padrão do controle deslizante; aumente para 15 para o corte real), Proporção de Aspecto adaptável, e ambos os arquivos em Materiais de Referência. O painel os conta como 2 de 9, então você tem bastante espaço para adicionar placas de guarda-roupa ou adereços depois.
Vale notar o que aconteceu com a proporção. Deixei Proporção de Aspecto em adaptável e apenas escrevi "9:16 vertical" dentro do prompt. O H3 veio vertical de qualquer forma, então ele leu o enquadramento do texto em vez de precisar do campo de formulário.
MiniMax H3 Referência-para-Vídeo no Atlas Cloud, execução concluída: ambos os arquivos de referência carregados como 2 de 9, resolução 2K, e o clipe vertical gerado sendo reproduzido no painel OUTPUT.
O primeiro quadro é a protagonista feminina no corpete de renda creme, em pé no corredor do painel 1 do quadro, com névoa na altura dos joelhos e o luar atingindo o chão molhado exatamente onde o quadro o colocou. Ambas as imagens de referência funcionaram.
Passo 4: Execute o controle Seedance 2.5 vs MiniMax H3 com o pacote idêntico
Não mude uma palavra. Mesmas duas imagens de referência, mesmo prompt, modelo diferente. Deixei a duração padrão de cada página sozinha, em vez de forçar uma correspondência, e digo o que cada uma retornou abaixo. Reformular um prompt "para" o outro modelo é exatamente como as comparações começam a mentir.
plaintext1Mesmo prompt do Passo 3, literalmente. Não o reformule para o outro modelo.
Configurações: modelo Seedance 2.0 Referência-para-Vídeo, Resolução 720p, mesmas duas imagens de referência em Imagens de Referência (novamente 2 de 9, com slots separados para até 3 vídeos de referência e 3 arquivos de áudio de referência). Duração deixada no padrão da página, que retornou como um clipe de 10 segundos.
Seedance 2.0 Referência-para-Vídeo no Atlas Cloud, execução concluída com o pacote de referência e prompt idênticos do Passo 3, e um resultado de 10 segundos no painel OUTPUT.
Aqui está o que os dois painéis OUTPUT realmente mostraram, e estou relatando de forma plana, em vez de escolher um vencedor.
Ambas as execuções mantiveram o personagem. Mesmo vestido de renda creme com o mesmo decote e punhos de manga, mesmo cabelo castanho, mesmo corredor de névoa e luar retirado do quadro. Nenhum inventou uma mulher diferente. O pacote de referência fez esse trabalho em ambos os lados, que é a descoberta que mais me importa.
As diferenças foram sobre a forma, não o rosto. Este endpoint Seedance entregou 720p; o H3 entregou 2K com entradas idênticas. E o enquadramento divergiu: o H3 leu "9:16 vertical" diretamente do texto do prompt e retornou vertical, enquanto a execução Seedance veio 16:9 porque essa página carrega seu próprio controle de proporção de aspecto e o texto do prompt sozinho não o substituiu. Se você está editando para TikTok, essa diferença vai te custar uma execução na primeira vez que esquecer o campo de formulário. O Seedance 2.5 provavelmente mudaria a metade da resolução disso e adicionaria re-rolagens a nível de região, e não vou fingir que medi isso.
Passo 5: Corrija um plano sem re-rolar o clipe inteiro
O custo real de um drama curto não é a geração um. É a revisão sete. O H3 aceita um clipe existente como entrada e edita com base em instruções, mantendo o que você não mencionou. A proposta do Seedance 2.5 aqui é mais refinada: redesenhe uma região do quadro e deixe desempenho, iluminação e câmera sozinhos.
plaintext1Usando o clipe fornecido: mantenha os dois personagens, o guarda-roupa deles, os movimentos de câmera e o ritmo de corte exatamente como estão. Altere apenas o ambiente, substitua o corredor de pedra iluminado pelo luar pelo mesmo salão de baile do castelo, janelas altas em arco, um candelabro aceso e luz de velas quente, e re-ilumine ambos os personagens para que a luz principal venha do candelabro no lado esquerdo do quadro em vez da janela. Reescreva a única fala dela para "Você nunca esteve dormindo, estava". Mantenha o tempo de performance dela nos mesmos batimentos.
Configurações: MiniMax H3 Referência-para-Vídeo com o clipe do Passo 3 como entrada de referência, Duração 5, Resolução 2K.
Além do Teste Seedance 2.5 vs MiniMax H3: Quatro Maneiras de Impulsionar um Pacote de Referência
Mesmo personagem, próximo episódio. Salve a ficha do Passo 1 como um ativo e altere apenas a lista de planos e o bloco de história no prompt. A identidade vem de um arquivo, não da sua memória de como você a formulou na terça-feira passada.
Posicione a voz também. O H3 aceita até três referências de áudio, de 2 a 15 segundos cada, e elas devem acompanhar uma entrada de imagem ou vídeo. Dê a ele uma amostra de voz e o personagem fala nesse timbre, então você não está re-escalando um dublador entre episódios.
Bloqueie a câmera antes de pagar pela renderização. O referência-para-vídeo do Seedance 2.5 aceita blocos de modelo 3D branco e telas verdes, então você pode travar o enquadramento em geometria cinza e só então se comprometer com um visual finalizado. Este exemplo foi executado no Seedance 2.1, um membro anterior da família, mas a forma do fluxo de trabalho é a mesma.
Localize um corte mestre em vez de refilmá-lo. A substituição a nível de região troca um rosto, um produto ou um idioma falado enquanto câmera, tempo e duração dos lábios permanecem no lugar. Aqui, um corte de beleza mestre é re-escalado e re-dublado para espanhol, coreano e hindi, com o ambiente, o enquadramento e a duração dos lábios mantidos.
E porque alguém vai perguntar como é a transferência de movimento quando você para de ser sensato: três homens de terno, substituídos por três capivaras fotorrealistas, seguindo o caminho de movimento do clipe original batida por batida até se empilharem em uma pirâmide.
Há também a versão simples de tudo isso, a que ninguém publica: um pôster estático se torna um pôster em movimento, e o layout sobrevive.
O pôster fonte estático. Alimente-o para referência-para-vídeo com "mantenha o quadro, a paleta e o layout, anime o tipo" e você obtém uma versão em movimento do mesmo design.
Quanto Custa Realmente um Curta-Metragem Seedance 2.5 vs MiniMax H3
Nenhum número aqui, porque os números se movem e a estrutura não. Ambas as famílias cobram por segundo, pague conforme usar, sem assento e sem assinatura. Isso deixa três variáveis: segundos, nível de resolução e re-rolagens.
A terceira é a conta inteira. Um clipe de 15 segundos que acerta na primeira tentativa é uma cobrança. O mesmo clipe na sétima tentativa é sete. Portanto, a jogada de economia de dinheiro não é escolher o modelo mais barato por segundo, é acertar o pacote de referência antes de gerar qualquer coisa. Aquelas duas chamadas de imagem no Passo 1 e Passo 2 são a linha mais barata em todo o pipeline e a que decide quantas chamadas de vídeo você fará. Maior retorno sobre o gasto em toda a cadeia, por uma margem enorme.
Depois corrija o instinto de por segundo. Mesmo pacote de referência, mesma duração: o referência-para-vídeo do H3 devolve 1440p, este endpoint referência-para-vídeo do Seedance devolve 720p. Por segundo é a unidade errada. Pixels por quadro, e se você então tem que pagar por uma passada de upscale separada, é a certa.
O áudio também pertence à aritmética. Ambos os lados produzem som nativo sincronizado na mesma passada. Se seu pipeline atual é modelo de vídeo mais TTS mais um editor alinhando trilhas, o que você economiza são duas chamadas de API e a tarde de uma pessoa, e essa economia não aparece em nenhuma lista de preços em lugar nenhum.
Qual deles para qual trabalho:
| Trabalho | Escolha | Por que | Ressalva |
|---|---|---|---|
| Drama curto vertical, 9:16, TikTok ou ReelShort | MiniMax H3 | 1440p vertical com estéreo nativo, chamável agora, 15 s é um gancho completo | você corta em 15 s, então planeje as batidas de acordo |
| Filme de marca contínuo de 30 segundos | Seedance 2.5 | geração única, sem costura, 4K nativo | verifique a disponibilidade na sua plataforma primeiro |
| Corrigir um plano dentro de um corte aprovado | Seedance 2.5 | redesenho a nível de região deixa o resto sozinho | H3 edição de clipe inteiro já te leva na maior parte do caminho hoje |
| Cortes de produto e e-commerce | qualquer | ambos seguram bem texto na tela e marcas | verifique o texto na resolução que você enviar |
| Demos de jogos ou interface | MiniMax H3 | estabilidade de UI e tipografia em 2K é forte | teto de 15 s para uma única passada |
| Versões em vários idiomas de um mestre | Seedance 2.5 | substituição de região mais voz em vários idiomas | qualidade de localização ainda precisa de verificação nativa |
| Enviar esta noite | MiniMax H3 | três endpoints ativos, além de todo o Seedance 2.0 | acesso ao Seedance 2.5 varia por plataforma |
Antes de enviar. A MiniMax disse que os pesos do H3 seguiriam em poucos dias do lançamento, e pesos abertos não são a mesma coisa que uma licença comercial, então leia os termos antes de auto-hospedar. A política de marca d'água e uso comercial também difere entre aplicativos de consumo e acesso via API em ambos os lados, e não pude confirmar nenhum deles a partir de uma página de termos primária durante a escrita, então verifique os termos do provedor em vez de aceitar minha palavra. E nada em nenhuma licença de modelo cobre semelhança ou marca registrada. Se uma pessoa real, uma marca real ou propriedade intelectual de outra pessoa estiver no seu pacote de referência, essa é uma questão legal separada e os termos do modelo não a responderão.
Cada modelo nas tabelas acima roda na mesma chave, e as páginas do modelo trazem as tarifas atuais mais código para copiar e colar, incluindo quaisquer promoções que estejam acontecendo na linha Seedance esta semana.
Perguntas Frequentes
O Seedance 2.5 é melhor que o MiniMax H3 para consistência de personagem?
No papel, deveria ser, com até 50 referências multimodais contra 12 arquivos do H3, além de re-rolagens a nível de região. Mas, em 31 de julho de 2026, não há nenhum teste público pareado que eu possa apontar, e o Seedance 2.5 ainda não tem classificação em arena. Nas execuções que pude realmente fazer, a variável que decidiu a estabilidade da identidade foi a estrutura do pacote de referência, não a geração do modelo: com uma ficha composta de giro mais um quadro de iluminação, ambos os lados mantiveram o personagem. Acerto o pacote antes de gastar tempo comparando modelos.
Posso usar o Seedance 2.5 agora, ou tenho que esperar?
Sua API está ativa na ByteDance. A disponibilidade em plataformas de modelo de terceiros é irregular, e na que testei ainda é um aviso de Dia 0. Se você precisa de saída esta noite, as opções chamáveis são os três endpoints do MiniMax H3 e toda a linha Seedance 2.0 em envio.
O MiniMax H3 realmente faz vídeo de 30 segundos?
Não. A especificação é de 5 a 15 segundos por geração a 24fps. Qualquer coisa mais longa é extensão ou costura, que é uma coisa diferente com risco de desvio diferente. A geração única de 30 segundos pertence ao Seedance 2.5. Não deixe as duas alegações se confundirem.
Ambos os modelos geram áudio, e posso manter uma voz entre episódios?
Ambos produzem áudio nativo sincronizado na mesma passada, e o H3 emite estéreo em cada resultado. Para uma voz persistente, o H3 aceita até três referências de áudio de 2 a 15 segundos cada, que devem ser enviadas junto com uma entrada de imagem ou vídeo, não sozinhas.
Quantas imagens de referência devo realmente enviar?
Menos do que você pensa, melhor estruturada do que você pensa. Uma composição bem feita geralmente vence seis recortes soltos, porque arquivos separados convidam o modelo a fazer a média deles em uma pessoa que não existe. Dê a ele dois trabalhos claros, identidade e iluminação, e não inclua amostras de estilo que lutam entre si.
Qual modelo devo usar para drama curto vertical no estilo TikTok ou ReelShort?
Enviando esta semana, em 9:16, em alta resolução com som já mixado: MiniMax H3. Planejando uma cena contínua de 30 segundos onde você espera re-rolar regiões únicas em vez de clipes inteiros: construa para o Seedance 2.5 e verifique quando sua plataforma o abrir.






