Seedance 2.5 já está disponível — Primeiro na Atlas Cloud

MiniMax H3 Lip Sync and Audio: Eu dei a ele 6 segundos de uma voz e removi 4 ferramentas do meu pipeline.

MiniMax H3 sincronização labial e áudio substituíram minha cadeia de dublagem de seis etapas por uma única chamada de API. Duas tomadas reais, os limites do áudio de referência que ninguém documenta, e a conta verdadeira.

Homem usando fones de ouvido fala em um microfone enquanto lê um roteiro

O quadro de rádio do turno da noite do qual cada take neste artigo começa, gerado com openai/gpt-image-2/text-to-image, qualidade alta, 2048x1152

Este único still é a entrada para todo o tutorial abaixo. Gerado com openai/gpt-image-2/text-to-image, qualidade alta, 2048x1152.

Pense na última vez que você finalizou um take de 8 segundos e ele saiu mudo.

Você exportou o clipe. Abriu uma aba de TTS e digitou a fala. Fuçou em uma biblioteca de sons à procura de chuva e ruído ambiente. Arrastou tudo para uma timeline e ajustou a forma de onda para a esquerda e para a direita até a boca parar de mentir. Então pagou um modelo de lip sync separado para corrigir a boca de qualquer jeito. Quatro ferramentas, três arquivos wav, uma hora, e a performance ainda parecia dublada, porque estava.

Essa corrente é o que o MiniMax H3 silenciosamente eliminou. Não porque "tem áudio" (muitos modelos afirmam isso), mas por causa de um campo no corpo da requisição que quase ninguém testa: você pode fornecer um pedaço de áudio que já possui, de graça, e recuperar a voz em um rosto.

Abaixo está o teste de dois takes que isola esse campo, os preços reais de cada etapa que ele substitui, os limites rígidos que rejeitarão sua requisição e a conta real.

Principais conclusões

  • Uma única chamada retorna imagem, diálogo, ruído ambiente e movimento labial juntos. Texto, visuais e áudio são codificados separadamente, depois um único Omni Transformer prevê conjuntamente os latentes de vídeo e áudio (Hugging Face model card, agosto de 2026).
  • Áudio de entrada é gratuito. Vídeo de entrada não é: o MiniMax cobra o vídeo de referência pela taxa de saída, então os mesmos 15 segundos de material custam $0 como música e cerca de $1,95 como clipe de vídeo.
  • Limites rígidos: no máximo 3 clipes de áudio, cada um de 2 a 15 segundos, 15 segundos no total, e o áudio nunca pode viajar sozinho. Deve vir acompanhado de pelo menos uma imagem ou vídeo.
  • A $0,14 por segundo para 2K na Atlas Cloud, um take completo de 10 segundos com som custa $1,40, o que é menos do que pagar um modelo de lip sync dedicado a $0,22 por segundo para corrigir um clipe que você já renderizou.

Som Ligado: Dois Takes de Lip Sync e Áudio do MiniMax H3, Uma Diferença de Seis Segundos

Fones de ouvido para este. Ambas as metades receberam o mesmo quadro base, as mesmas duas falas e o mesmo prompt, palavra por palavra. Apenas uma delas ouviu uma gravação de seis segundos de uma voz primeiro.

fXlyer__czg

Som ligado, e use fones de ouvido: a metade esquerda (Take A, sem áudio de referência) toca no ouvido esquerdo, a metade direita (Take B, com uma referência de 6 segundos) no direito. Mesmo quadro, mesmas falas, mesmo prompt. Ambos os takes: minimax/h3/reference-to-video, 2K, 10 segundos, entregues como 2560x1440 a 24fps com trilha estéreo de 32 kHz.

O Take A não tinha nada além das palavras "voz masculina calma, grave, magnética" no prompt, então ele inventou uma voz. O Take B recebeu 6,19 segundos de uma frase completamente diferente e foi instruído a tratar apenas como âncora de timbre. Nenhum take foi dublado depois. Nenhum passou perto de um modelo de lip sync. Em ambos, a boca segue a voz que o modelo produziu, porque a boca e a voz foram produzidas juntas.

Julgue o timbre com seus próprios ouvidos em vez de aceitar minha palavra. O que posso afirmar como fato é o mecanismo, as configurações e a conta, e é isso que vem a seguir.

Por que o Lip Sync e Áudio do MiniMax H3 Quebrou a Corrente de Dublagem de Seis Etapas de Todo Mundo

A velha corrente nunca foi realmente um fluxo de trabalho. Era um trabalho de reparo.

ImGr2NgcCCY

Som ligado. Um sapo e um camaleão animados em 3D conversando dentro de uma tenda de circo à noite, com a ambiência do recinto sob o diálogo. Um clipe de referência do MiniMax para áudio nativo do H3. Formatos de boca em personagens animados são o caso mais difícil de falsificar, e é por isso que este vale 20 segundos da sua atenção.

Três coisas sempre quebravam, e quebravam por razões estruturais, não por azar.

A timeline estava em suas mãos. Um modelo de vídeo fornecia os quadros. Um modelo de TTS fornecia uma forma de onda. Nada na saída de um sabia sobre a outra, então o alinhamento era um julgamento humano feito a 30 quadros por segundo, a olho, às 1h da manhã. Cada re-renderização começava esse julgamento do zero.

O lip sync do tipo patch tem um teto. Um modelo de lip sync dedicado controla apenas a região da boca de uma filmagem que já existe. Ele pode fazer a boca concordar com o áudio. Não pode fazer a mandíbula tensionar antes de uma consoante forte, ou colocar uma respiração antes de uma fala, ou deixar os ombros caírem quando a frase termina, porque esses quadros foram renderizados antes que alguém soubesse o que o personagem diria. Você obtém precisão sem performance, o que é lido como estranho.

O design de som era um segundo projeto. Chuva, ruído ambiente, rangido de cadeira, uma linha de baixo sob o diálogo. Tudo vinha de uma fonte diferente e tinha que ser equilibrado contra uma voz que já estava colada.

O que o Audio VAE diz sobre o Lip Sync e Áudio do MiniMax H3

Aqui está a parte que não é linguagem de marketing, porque você pode ver em um nome de arquivo.

No H3, o texto passa pelo H3-Encoder, as entradas visuais passam pelo H3-Encoder e pelo H3-VisualVAE, e o áudio passa exclusivamente por um H3-AudioVAE independente. O H3-Omni-Transformer então prevê conjuntamente os latentes de vídeo e áudio, que são decodificados em vídeo e áudio estéreo separadamente. O AudioVAE compartilha um codificador e um decodificador entre os canais esquerdo e direito, processa cada um independentemente, os recombina para estéreo e comprime áudio de 32 kHz em uma sequência de tokens latentes a uma taxa temporal de 40 Hz (Hugging Face model card).

Quando o ComfyUI lançou suporte no dia zero, essa arquitetura apareceu como dois arquivos separados na pasta VAE: minimax_h3_video_vae_fp16.safetensors e minimax_h3_audio_vae_fp32.safetensors, carregados por um carregador de VAE duplo que recebe um caminho de vídeo e um caminho de áudio (ComfyUI blog, agosto de 2026). O áudio é uma modalidade em torno da qual o modelo foi construído, não um pós-processo acoplado ao final de um.

Os rankings concordam sobre onde isso aparece. A Artificial Analysis colocou o H3 em primeiro lugar em seu ranking de edição de vídeo com áudio a 1.130 Elo a partir de 5.043 amostras de preferência cega, enquanto o colocou entre os três primeiros tanto em texto-para-vídeo quanto em imagem-para-vídeo (Artificial Analysis, julho de 2026). A lacuna entre "imagem muito boa" e "primeiro lugar" nesse ranking específico é o áudio.

O Fluxo de Trabalho de Lip Sync e Áudio do MiniMax H3, Precificado Contra a Corrente que Ele Substitui

A maneira honesta de julgar isso não é por sensações. É precificar a velha corrente passo a passo, usando taxas reais por segundo para um take finalizado de 10 segundos, e depois precificar a substituição.

#A velha corrente, passo a passoO que executouQuanto custou essa etapaCom lip sync e áudio do MiniMax H3
1Renderizar a imagem silenciosaum modelo de vídeo, ex.: bytedance/seedance-2.0 a $0,112/s$1,12mesma chamada única
2Dar voz às falasminimax/speech-2.6-hdcerca de $0,02 para ~250 caracteresmesma chamada única
3Encontrar ou criar a trilhaminimax/music-2.6$0,15 por faixamesma chamada única
4Camadas de ambiência e efeitosbiblioteca de sons + suas mãossua noitemesma chamada única
5Alinhar tudo em uma timelineeditor + suas mãossua noitenão existe
6Mixareditor + suas mãossua noitenão existe
7Corrigir a bocasync/lipsync-v3 a $0,22/s$2,20não existe
Total4 modelos + 2 passagens manuaiscerca de $3,49 + sua noite1 chamada, $1,40

Leia a linha 7 duas vezes. Corrigir a boca de um clipe que você já renderizou custa $0,22 por segundo, enquanto gerar o take inteiro com sua voz, sua ambiência e seu movimento labial custa $0,14 por segundo. O patch é mais caro que o original. Essa única comparação é todo o argumento.

A assimetria que ninguém menciona: seu próprio áudio é gratuito, seu próprio vídeo não é.

A tabela de preços pay-as-you-go do MiniMax lista o material de entrada separadamente da saída. Para o H3, a entrada de áudio é Grátis. As primeiras cinco imagens de entrada são gratuitas e cada uma após isso custa $0,04. O vídeo de entrada é cobrado pela duração do clipe de entrada à taxa da resolução de saída, que é $0,13 por segundo em 2K (documentação de preços do MiniMax, consultada em 3 de agosto de 2026). Portanto, os mesmos 15 segundos de material de referência não custam nada como música, memorando de voz ou VO fornecido pelo cliente, e aproximadamente $1,95 como clipe de vídeo.

Essa é a linha que deve mudar a forma como você constrói. O áudio de referência é a superfície de controle mais barata do modelo, e é a que ninguém está testando.

Entrada de referênciaQuantosPor clipeTotalCobrança (MiniMax)
Imagematé 9n/an/aprimeiras 5 grátis, depois $0,04 cada
Vídeoaté 32 a 15smax 15scobrado à taxa de saída, $0,13/s em 2K
Áudioaté 32 a 15smax 15sGrátis
Qualquer combinaçãomáximo 12 arquivosn/an/aconforme acima, por tipo
Áudio sozinhonão permitido. Áudio deve ser acompanhado por entrada de imagem ou vídeo e não pode ser a única entrada

Limites da especificação H3-Base-Ref2VA no model card. O esquema da Atlas Cloud para minimax/h3/reference-to-video diz a mesma coisa em suas próprias palavras: "Pelo menos uma imagem OU vídeo é obrigatório (apenas áudio não é permitido)."

Duas notas de rodapé do lado da Atlas Cloud, ambas de minhas próprias execuções, não de uma página de documentação. A Atlas cobra uma taxa fixa única de $0,14 por segundo de saída para todos os três endpoints do H3, e um vídeo de referência que anexei não adicionou uma cobrança separada além disso. Isso é uma observação, não uma política, então faça o orçamento para a regra do MiniMax e trate a taxa fixa como um bônus. A Atlas também aceita resolution: "768P" e cobra os mesmos $0,14, o que é uma discrepância que vale a pena ler no detalhamento de preços da API do MiniMax H3 em vez de aqui.

Tudo abaixo roda em uma única aba do navegador na Atlas Cloud: o quadro base, a referência de voz e ambos os takes do H3, em uma chave de API com um único loop de polling. Os três endpoints do H3 diferem apenas na forma de sua entrada, então refers se torna image se torna texto simples e nada mais no seu código muda.

Lip Sync e Áudio do MiniMax H3, Passo a Passo

Cinco passos. Dois deles são configuração barata, dois são o teste real, e o último não custa nada porque é projetado para falhar.

Passo 1: Construir o Quadro Base com GPT Image 2

A demonstração é um apresentador de rádio do turno da noite, escolhido por uma razão: um close-up apertado na boca é o único enquadramento onde você pode realmente julgar o lip sync. Um plano aberto permite que um modelo trapaceie.

Duas coisas neste prompt são inegociáveis. A boca deve estar ligeiramente aberta no meio de uma palavra, para que o primeiro quadro já leia como fala, e não deve haver texto em nenhum lugar do quadro, para que legendas dinâmicas posteriores não briguem com letras fixas.

plaintext
1Fotográfico realista still, 16:9, estúdio de rádio do turno da noite, enquadramento apertado do peito para cima de um
2homem no final dos trinta anos inclinado em um microfone condensador prateado vintage em um braço articulado,
3espuma de proteção a centímetros de seus lábios, fones de ouvido meio fora de uma orelha. Lâmpada de mesa
4tungstênio quente da esquerda da câmera esculpe sua maçã do rosto; um letreiro neon vermelho ON AIR queima
5desfocado atrás de seu ombro e sangra carmesim nos faders da mesa de mixagem no primeiro plano inferior. Chuva
6escorre pela janela do estúdio à direita, luzes da cidade borradas em bokeh. Fumaça fina de cigarro deriva
7através do feixe da lâmpada. Boca ligeiramente aberta no meio de uma palavra, olhos baixos em direção a um roteiro de papel. Filmado em
835mm, profundidade de campo rasa, grão de filme fino, sombras profundas, sem texto em nenhum lugar do quadro.
9

Configurações em openai/gpt-image-2/text-to-image: qualidade alta, tamanho 16:9 a 2048x1152, uma imagem. Os $0,009 na lista de modelos é um piso de nível de token, não o que você paga. Neste tamanho e qualidade, o botão Run cita $0,1745 por geração, que você pode ler na captura de tela abaixo.

Interface de gerador de imagens AI mostrando um prompt e sua saída gerada

GPT Image 2 na Atlas Cloud com o prompt da cabine de rádio digitado, qualidade alta e 16:9 2048x1152 selecionados, e o quadro base finalizado renderizado no painel OUTPUT_GPT Image 2 na Atlas Cloud: o prompt exato acima, qualidade alta, 16:9 a 2048x1152, e uma segunda geração do mesmo quadro em OUTPUT._

Passo 2: Fazer a Referência de Voz de Seis Segundos

Este é o passo que as pessoas erram, então leia o raciocínio antes do prompt.

O áudio de referência deve dizer uma frase diferente daquela que você deseja no vídeo. É uma âncora de timbre, nada mais. As falas vêm do prompt. O próprio exemplo de referência-para-vídeo do MiniMax torna essa divisão explícita: ele rotula um clipe como a faixa de origem para reutilizar parcialmente para música, e um segundo clipe puramente como "a referência de timbre de voz", com o novo diálogo escrito inline no prompt. Se sua referência disser as mesmas palavras que você pediu, você está convidando o modelo a copiar a faixa em vez de transferir a voz.

plaintext
1Você está ouvindo Night Line, noventa e um ponto quatro, e está chegando perto das
2três da manhã.
3

Configurações em minimax/speech-2.6-hd: qualquer voz masculina calma e grave funciona, e eu escolhi Magnetic-voiced Male (English_magnetic_voiced_man). Defina speed para 0,95 para que o take caia dentro da janela de 2 a 15 segundos com folga, deixe vol em 1,0 e mantenha a saída mp3. O modelo custa $0,08 por 1.000 caracteres, abaixo de $0,10, um desconto de 20% válido a partir de agosto de 2026. Minha fala retornou com 6,19 segundos e cobrou $0,00792.

Interface de gerador de voz com entrada de texto e saída de forma de onda de áudio

MiniMax Speech 2.6 HD na Atlas Cloud com a linha de referência digitada no campo de texto e a forma de onda de áudio renderizada no painel OUTPUT

MiniMax Speech 2.6 HD na Atlas Cloud: uma linha para dentro, um mp3 curto para fora, com o desconto de 20% mostrando no botão Run. A captura de tela foi feita na voz padrão Expressive Narrator, então mude o seletor de Voz para Magnetic-voiced Male e reduza Speed para 0,95 antes de executar.

Passo 3: Executar o Lip Sync e Áudio do MiniMax H3 com o Áudio de Referência

Agora ambos os arquivos vão para refers juntos: o still do Passo 1 e o mp3 do Passo 2. Este é o Take B.

O prompt usa a estrutura seccionada na qual o H3 foi treinado. subject_definitions nomeia quem e o que são as referências, detailed_description carrega o diálogo dentro das tags <d>[English] ...</d>, e as duas seções de áudio descrevem a mixagem. Se os nomes das seções são novos para você, o guia de prompts do MiniMax H3 cobre a estrutura completa. Apenas três campos importam para o trabalho de áudio, e estão todos aqui.

plaintext
1subject_definitions:
2<Subject 1> é o homem no microfone de rádio em <Picture 1>, final dos trinta anos, fones de ouvido
3meio fora de uma orelha, neon vermelho ON AIR atrás de seu ombro.
4<Picture 1> é o quadro de abertura do vídeo alvo.
5<Audio 2> é a referência de timbre de voz para <Subject 1>: uma voz masculina de transmissão calma, grave, magnética.
6Referencie apenas o timbre; não reutilize suas palavras.
7
8summary:
9[referência de imagem + referência de timbre de áudio] Um único close-up contínuo de 10 segundos. <Subject 1>
10entrega duas falas diretamente no microfone no timbre de voz de <Audio 2>, enquanto a
11câmera avança lentamente. O movimento da boca, a respiração antes de cada fala e o ruído ambiente
12são gerados juntos.
13
14detailed_description:
15O take abre exatamente em <Picture 1>. Tungstênio quente da esquerda da câmera, neon vermelho sangrando na
16mesa de mixagem no primeiro plano, chuva na janela atrás. <Subject 1> respira fundo,
17inclina-se alguns graus em direção à espuma do microfone e fala, <d>[English] São três da manhã,
18e eu sei exatamente quem ainda está acordado.</d> Enquanto fala, sua mandíbula e lábios se movem naturalmente a cada
19sílaba; as plosivas em "três" e "manhã" são visíveis. Ele olha para baixo para o roteiro,
20depois volta para cima, além da lente, e continua, <d>[English] Então vamos manter isso entre nós.</d>
21Exatamente quando sua voz para, seus lábios se fecham e ele exala pelo nariz. Durante todo o tempo,
22a câmera executa um avanço lento e deliberado; o neon pisca uma vez, fracamente, por volta do segundo
23sete. Nenhum texto na tela.
24
25overall_soundscape:
26Voz próxima, seca, tratada como cabine, com um toque de efeito de proximidade do microfone. Abaixo dela:
27um zumbido elétrico baixo da mesa, chuva constante contra o vidro, um carro distante passando na
28rua molhada, o rangido suave da cadeira enquanto ele se inclina e uma única respiração audível antes
29de cada fala.
30
31non_diegetic_music:
32Um contrabaixo de jazz noturno esparso e lento, muito baixo, bem abaixo da voz, entrando por volta do segundo
33dois e nunca subindo acima do diálogo.
34

Configurações em minimax/h3/reference-to-video: resolução 2K, duração 10, proporção de tela 16:9, e refers contendo ambos os arquivos. A ordem dentro do array não importa, apenas que pelo menos um deles seja uma imagem ou um vídeo. O controle deslizante Duration padrão é 8, então mova-o, e mude Aspect Ratio para fora de adaptive se você quiser o quadro que pediu.

Quatro armadilhas de parâmetros, três das quais me custaram dinheiro. A chave é ratio, não aspect_ratio, e errar retorna um 400. Sempre envie duration explicitamente, porque o padrão do esquema diz 8, mas uma requisição sem ele veio como um arquivo de 5 segundos. Neste endpoint, enviar image junto com refers completa, cobra integralmente e descarta silenciosamente um deles. E se você passar o áudio como uma URL de dados base64, rotule-a como data:audio/mp3, não data:audio/mpeg. Minha primeira tentativa morreu exatamente nisso:

plaintext
1content[2].audio_url: invalid param: audio format ".mpeg" not allowed
2

Essa pelo menos é gratuita, o que nos leva à maneira útil de aprender os limites.

Interface de gerador de vídeo AI mostrando entrada de prompt de texto e saída de vídeo

O playground reference-to-video do MiniMax H3 na Atlas Cloud, com o mp3 no slot 1 e o quadro base no slot 2 de Reference Materials, resolução 2K, e o clipe finalizado tocando no painel OUTPUT

MiniMax H3 reference-to-video na Atlas Cloud: Reference Materials mostra 2/9 com o mp3 no slot um e o still no slot dois, resolução 2K, clipe finalizado à direita. Esta captura foi executada nos 8 segundos padrão do playground, por isso o botão Run mostra $1,12; meus dois takes acima foram executados em 10 segundos por $1,40 cada.

Passo 4: Executar o Take de Controle do Lip Sync e Áudio do MiniMax H3

Altere uma entrada e toda menção a ela. Remova o mp3 de refers para que apenas a imagem permaneça, exclua a definição <Audio 2>, corte a frase "no timbre de voz de <Audio 2>" do resumo e mude a tag de colchetes para [referência de imagem]. Nada mais se move, e as configurações permanecem idênticas: 2K, 10 segundos, 16:9.

Isso é o que faz dele um controle em vez de uma segunda tentativa. O modelo agora não tem âncora de timbre, então ele inventa uma voz a partir da descrição escrita e faz lip sync para a voz que acabou de criar. Ambos os takes retornaram com 10,13 segundos e cobraram $1,40 cada, ao centavo.

WnfqR2I-a-8

Som ligado. Take A sozinho: mesmo quadro, mesmas falas, sem áudio de referência. A voz aqui é a invenção do modelo, e a boca ainda a segue.

Dois takes, uma variável. Esse é o experimento mais barato de todo este artigo e o único que diz o que o campo de áudio realmente faz.

Passo 5: Quebrar o Lip Sync e Áudio do MiniMax H3 de Propósito

O último passo é gratuito, e vale a pena fazer uma vez para que você reconheça a falha às 2h da manhã.

Coloque o mp3 em refers e nada mais. Sem imagem, sem vídeo, apenas áudio. Então envie.

plaintext
1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \
2  -H "Authorization: Bearer $ATLAS_API_KEY" \
3  -H "Content-Type: application/json" \
4  -d '{
5    "model": "minimax/h3/reference-to-video",
6    "prompt": "Um homem em um microfone de rádio fala duas falas na espuma do microfone.",
7    "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}],
8    "resolution": "2K",
9    "duration": 10,
10    "ratio": "16:9"
11  }'
12

Aqui está a parte que vale a pena saber, porque não é o que o esquema implica. A chamada de envio retorna HTTP 200 com um task id normal e "status": "processing", então um cliente ingênuo pensa que funcionou. Vinte e três milissegundos depois a tarefa está morta:

plaintext
1{
2  "status": "failed",
3  "error_code": 1010001,
4  "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video",
5  "latency_ms": 23
6}
7

Nenhum campo price jamais apareceu nessa previsão, então não custou nada. A lição prática é sobre seu código, não sua carteira: um 200 no envio não é um sucesso. Faça poll do id e verifique status antes de assumir que você tem um clipe.

Mais Quatro Maneiras de Explorar o Lip Sync e Áudio do MiniMax H3

O teste de dois takes é o menor experimento útil. Aqui está para onde o mesmo slot vai em seguida.

Um take, vários idiomas. Mantenha o quadro, mantenha o bloqueio, mude a tag de idioma dentro de <d>...</d> e execute novamente. A boca segue o novo idioma em vez do antigo, porque a boca e a voz saem da mesma passagem direta. O model card lista suporte estável de diálogo para 11 idiomas: árabe, chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo e espanhol, com mais suportados em graus variados. Esses dois clipes são o mesmo trailer com duas faixas de voz diferentes, e o MiniMax também criou uma versão em francês e uma versão sem narração a partir da mesma configuração.

hj7ZId3KOKk

Som ligado. A versão com narração em inglês: um close-up de astronauta em um planeta cor de laranja poeira, narração e trilha chegando com a imagem. Trabalho de trailer são os mesmos três campos de prompt com uma paisagem sonora diferente.

Hv62FGyBNPM

Som ligado. A versão em japonês, quadro a quadro o mesmo trailer. Nada foi redublado e nenhuma sessão de VO separada aconteceu.

Cantar, com um refrão que você já possui. É aqui que o áudio de entrada gratuito deixa de ser uma nota de rodapé. Coloque um refrão existente ou um instrumental em refers com 15 segundos ou menos, descreva a performance, e o personagem performa para ele. Você não está pagando pela música que traz.

zui3Zw_UWnY

Som ligado. Uma banda cortada em um visual de câmera retrô, bastidores para performance, com a faixa e a imagem chegando juntas. Essa é a forma que a maioria dos trabalhos de videoclipe realmente deseja.

Duas pessoas conversando é mais difícil que uma. Um único falante em close-up é o caso fácil, que é exatamente por que este artigo o usou. Para diálogo entre dois personagens, rotule-os explicitamente como o exemplo do próprio MiniMax faz, com <Subject 1> (S1) e <Subject 2> (S2) anexados a cada linha <d>, e espere ter que tentar novamente quando o modelo errar a ordem ou a atribuição. Faça orçamento para duas execuções por diálogo de dois personagens.

Ambiência sem uma palavra falada. overall_soundscape é um campo por si só, e funciona sem nenhum diálogo. Chuva no vidro, rangido de cadeira, zumbido de geladeira, o ambiente em si. Isso torna o mesmo endpoint uma ferramenta legítima de ASMR e ambiência, e é o único uso onde a boca nunca importa.

Um limite honesto dos meus próprios dois takes: a geração na mesma passagem significa que a boca e a voz concordam, e não significa que todos os detalhes físicos no quadro concordam com o som. Falas longas comprimidas em uma duração curta, direção de performance vaga e cenas com vários falantes degradam o resultado. Assista seu clipe antes de enviá-lo, da mesma forma que você assistiria um take de um ator humano.

O que o Lip Sync e Áudio do MiniMax H3 Realmente me Custou

Cada valor abaixo é uma cobrança real em uma conta real, puxada posteriormente. O campo price em uma previsão é preenchido tarde, então fazer polling até completed muitas vezes retorna nada. Refaça o fetch do id para obter o número.

PassoModeloO que foi executadoCobrado
1openai/gpt-image-2/text-to-image1 quadro base, qualidade alta, 2048x1152$0,1745 (citado no botão Run)
2minimax/speech-2.6-hd99 caracteres, 6,19s de voz de referência$0,01
3minimax/h3/reference-to-videoTake B, 10s em 2K, imagem + áudio em refers$1,40
4minimax/h3/reference-to-videoTake A, 10s em 2K, apenas imagem$1,40
5minimax/h3/reference-to-videorequisição apenas de áudio, falhou em 23ms$0,00
Experimento inteiro, ambos os takescerca de $2,98

Duas notas contábeis, porque honestidade é mais barata que uma nota de rodapé. A URL de dados audio/mpeg errada no Passo 3 também não custou nada, pois deu 400 no envio. Rejeições são gratuitas, mas uma requisição bem formada com uma entrada quebrada não é, então uma URL de referência que silenciosamente dá 404 ainda cobrará integralmente. E a captura do playground no screenshot do Passo 3 é uma terceira execução do H3 nos 8 segundos padrão do painel, que cobrou $1,12 além da tabela. Essa execução existe para este artigo, não para o experimento.

A velha corrente, precificada na tabela mais acima, foi de cerca de $3,49 para um take de 10 segundos mais uma noite de alinhamento manual. Isso foram dois takes completos de 10 segundos com som, um A/B controlado e duas requisições deliberadamente quebradas, por menos.

Dito isso, o H3 é a ferramenta errada para vários trabalhos que as pessoas tentarão dar a ele, e as alternativas são mais baratas.

O que você realmente querO modelo certoPreçoPor que
Um retrato mais um arquivo de áudio existente, em uma cabeça falantebytedance/avatar-omni-human-v1.5$0,12/sConstruído para áudio-para-vídeo, e a duração da saída segue seu áudio
Um clipe finalizado cuja boca precisa falar um novo idiomasync/lipsync-v3$0,22/sO H3 não modifica sua renderização existente, e corrigir é exatamente o trabalho deste modelo
A correção de boca mais barata possível em uma cabeça falanteveed/lipsync$0,013/sCerca de dez vezes mais barato, e toca apenas na boca, não na performance
Um take inteiro dirigido, com timbre, ambiência e trilha juntosminimax/h3/reference-to-video$0,14/sImagem e som vêm de uma única passagem, então a performance é projetada, não reparada

Se você está escolhendo entre o H3 e seu rival mais próximo em trabalho de personagem, em vez de áudio, a comparação com Seedance 2.5 é a leitura melhor. E se você está se perguntando se os pesos abertos tornam isso gratuito, eles não o tornam rápido: 2K ainda vem do lado da API, e relatos da comunidade colocam uma renderização local de 480p de 10 segundos em minutos, não segundos, em placas de consumo.

Uma Nota Honesta sobre Vozes, Músicas e Direitos

Grátis para fazer upload não é o mesmo que grátis para usar. Uma música que você não escreveu e uma voz que não é sua são duas permissões separadas, e nenhuma é concedida por uma API que não cobra nada pelo upload. Use suas próprias gravações, música licenciada ou uma voz sintética que você mesmo gerou, que é exatamente o que o Passo 2 faz.

Separadamente, os pesos da comunidade carregam limites territoriais que atualmente não cobrem a UE, o Reino Unido, a Coreia do Sul ou os EUA, com um canal de licenciamento formal aberto em vez disso. Essa é uma história mais longa, e é contada no guia de pesos abertos do MiniMax H3.

Lip Sync e Áudio do MiniMax H3: Perguntas Frequentes

O lip sync e áudio do MiniMax H3 realmente geram som na mesma passagem, ou é dublado depois?

Mesma passagem. O texto passa pelo H3-Encoder, os visuais pelo H3-Encoder mais o H3-VisualVAE, e o áudio por um H3-AudioVAE independente. O H3-Omni-Transformer prevê conjuntamente os latentes de vídeo e áudio, que são então decodificados separadamente em imagem e áudio estéreo de 32 kHz. Nada é sobreposto depois, e é por isso que a boca, a respiração e o ruído ambiente pertencem ao mesmo take.

Posso alimentar minha própria música ou voz no lip sync e áudio do MiniMax H3, e custa extra?

Sim, e não. A tabela pay-as-you-go do MiniMax lista a entrada de áudio do H3 como Grátis. A assimetria a observar é o vídeo: o vídeo de entrada é cobrado por sua duração à taxa de saída, $0,13 por segundo em 2K, então 15 segundos de vídeo de referência custam cerca de $1,95 enquanto 15 segundos de áudio de referência custam $0.

Por que o lip sync e áudio do MiniMax H3 rejeita uma requisição que tem apenas áudio?

Porque o áudio é o único tipo de referência que não pode viajar sozinho. Deve ser acompanhado por pelo menos uma imagem ou vídeo. O restante dos limites, da especificação H3-Base-Ref2VA: até 9 imagens, até 3 vídeos e até 3 clipes de áudio, cada clipe de vídeo ou áudio entre 2 e 15 segundos, 15 segundos no total por tipo, e no máximo 12 arquivos entre todos os tipos em uma requisição.

O lip sync e áudio do MiniMax H3 será mantido por todo o clipe, ou apenas na primeira fala?

Para um único falante com espaço para respirar, ele se mantém ao longo do clipe em vez de acertar uma fala e depois se desviar. Três coisas quebram: comprimir um roteiro longo em uma duração curta, direção de performance vaga ou ausente, e cenas com vários falantes onde o modelo precisa decidir quem fala quando. Dê a cada fala um falante rotulado e segundos suficientes para dizê-la.

O lip sync e áudio do MiniMax H3 precisa de uma redublagem para outro idioma?

Não. Altere a tag de idioma dentro da marcação de diálogo, de <d>[English] ...</d> para <d>[Japanese] ...</d>, e execute o mesmo prompt novamente. A boca é gerada com a nova voz, então ela corresponde ao novo idioma em vez do antigo. O model card lista suporte estável de diálogo para 11 idiomas.

É mais barato executar o lip sync e áudio do MiniMax H3 localmente?

Mais barato por clipe, caro em todos os outros aspectos. Os pesos são abertos, mas relatos da comunidade de execuções locais em placas de consumo de 16 GB medem uma geração de 480p de 10 segundos em minutos, a auto-hospedagem renderiza em um lado curto de 768, e 2K ainda vem da etapa de regeneração do lado da API. Adicione os limites territoriais na licença da comunidade e a API permanece o caminho pragmático para trabalhos finalizados.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos