
Uma sala de colorização noturna, seis monitores mostrando seis tomadas diferentes da mesma cantora de cabelos prateados_Seis_ tomadas, um artista, uma música. Gerado com openai/gpt-image-2/text-to-image .
Usuários do Suno geram cerca de 7 milhões de músicas por dia, aproximadamente um catálogo completo do Spotify a cada duas semanas (TechCrunch, fevereiro de 2026). Quase nenhuma delas terá uma imagem associada. Não porque a imagem seja impossível, mas porque o caminho tradicional passa por quatro ferramentas: gerar stills, animá-los, executar uma passagem separada de sincronia labial, depois corrigir tudo em uma edição. Cada salto perde o rosto, o guarda-roupa ou a batida.
Então pulei os saltos. Coloquei uma fatia de 8 segundos de um refrão diretamente no slot de referência de um modelo de vídeo e apertei Executar. Não me cobrou nada pelo áudio.
Depois, desmontei o mp4 finalizado para responder à única pergunta que ninguém na internet responde diretamente: o som que sai do modelo é minha música, ou algo que ele inventou e que só soa parecido? Eu medi. A resposta não é o que eu esperava, e muda como você deve cortar a coisa.
Principais conclusões
- Áudio de referência é gratuito. MiniMax H3 cobra apenas pelos segundos de saída. Minhas quatro fatias de referência de 8 segundos adicionaram $0,00 à conta. Vídeo de referência é o caro.
- 15 segundos é um limite por geração, não por projeto. Fatia a música, dispare uma fatia por tomada, concatene. Meu corte de 32 segundos são quatro gerações.
- Escreva o gancho a 120 BPM. Um compasso dura exatamente 2.000 segundos, então os valores de
durationem segundos inteiros do H3 caem nas linhas do compasso sem ajuste manual. 8s = 4 compassos.- O áudio de saída é sua faixa, alinhada à amostra. Medii correlação de forma de onda de 0,892 em deslocamento zero entre minha fatia de entrada e o mix estéreo entregue pelo H3. Não é regenerado. Você ainda deve aplicar a master final para o corte final, por um motivo diferente (abaixo).
- Gasto real total: $7,53 em nove gerações, incluindo as falhas. As quatro tomadas que entraram no corte final, mais a música e o quadro base, totalizaram $4,80.
O Videoclipe MiniMax H3 que montei a partir de um gancho de 32 segundos
Som ligado. São quatro gerações separadas, concatenadas sem transições, com a master original de 32 segundos sobreposta.
TfrOvWHf4ys
"MIRA", 32 segundos, 2560x1440, 24 fps. Quatro minimax/h3/reference-to-video gerações de 8 segundos cada, $1,12 por tomada. A música entrou como áudio de referência e custou $0,00.
Quatro gerações, quatro mundos de iluminação completamente diferentes, um rosto. Nada foi retocado entre elas.

Quatro quadros das quatro tomadas mostrando a mesma cantora em um terraço neon, uma rodovia no deserto, um estúdio branco e um tanque de água preto_Um_ quadro extraído de cada clipe entregue. Mesmo cabelo, mesma blusa de rede, mesma gargantilha LED vermelha através de chuva, sol baixo, luz plana e subaquática.
Por que a maioria das tentativas de videoclipe MiniMax H3 desmorona no segundo 16
Três modos de falha, todos evitáveis.
Um: tratar 15 segundos como o limite do projeto. O H3 limita uma única geração a 15 segundos. As pessoas leem isso, concluem "não dá para fazer videoclipes" e desistem. Mas um videoclipe nunca foi uma única tomada. Um de verdade corta a cada 4 a 8 segundos de qualquer maneira. O limite apenas força você a fazer o que um editor já faria.
Dois: descrever ritmo em palavras. "Animado, energético, dançando no ritmo" não dá nada para o modelo se prender. Ele inventa um andamento, e seus pontos de corte ficam sempre meio batida atrasados. Entregar o áudio real elimina o chute.
Três: deixar o guarda-roupa variar. Cada tomada precisa da mesma imagem de referência e da mesma redação de guarda-roupa, palavra por palavra. Mudar "blusa de rede preta" para "camisa de rede escura" entre as tomadas e você obtém uma pessoa diferente.
Aqui está o que as duas rotas realmente custam:
| Cadeia tradicional de quatro ferramentas | Chamada única de referência H3 | |
|---|---|---|
| Ferramentas por tomada | Modelo de imagem, modelo de vídeo, ferramenta de labial, NLE | Um endpoint, depois um NLE no final |
| Etapas manuais por tomada | 4 passagens, 3 exportações de arquivo | 1 envio |
| O que mantém o personagem | Re-prompting manual e sorte | Uma imagem de referência reutilizada literalmente |
| Imagem e som | Renderizados separadamente, alinhados depois | Gerados na mesma passagem, 32 kHz estéreo |
| Custo por tomada de 8 s | Quatro medidores separados | $1,12 em 2K, $0,80 em 768P |
Para ser justo com a rota antiga: não é uma fantasia. O criador japonês Arata Fukoe ganhou um bronze no Project Odyssey com um videoclipe totalmente de IA, e tanto Queen quanto Linkin Park lançaram videoclipes oficiais assistidos por IA. Essas cadeiras passaram por quatro ou cinco ferramentas, exatamente o que um artista independente com uma música não tem tempo para fazer.
O que o áudio de referência realmente compra para um videoclipe MiniMax H3
Esta é a parte que vale a pena entender antes de gastar qualquer coisa.
O H3 gera imagem e som em uma única passagem, em vez de dublar áudio em quadros finalizados. Quando você fornece uma faixa de referência, a faixa não é uma nota de humor. Comparei minha fatia de entrada com o fluxo de áudio dentro do mp4 entregue, no nível da forma de onda, em um downmix mono de 8 kHz:
- Correlação de envelope: 0,956 em deslocamento zero
- Correlação bruta de forma de onda em uma janela de 2 segundos: 0,892 em deslocamento de amostra zero
Isso não é um modelo reproduzindo uma música semelhante. É o seu arquivo, alinhado por amostra, com a ambiência que o prompt solicitou sobreposta e uma rodada de re-codificação AAC. Para comparação, a mesma medição em uma tomada de controle gerada sem áudio de referência deu 0,26, que é o piso de ruído.

Forma de onda da fatia de entrada acima, áudio entregue pelo H3 abaixo, alinhado em deslocamento zero_Topo: o mp3 de 8 segundos que enviei. Abaixo: o fluxo de áudio dentro do mp4 que o H3 retornou. Mesmos picos, mesmas posições, sem deslocamento._
Os limites de entrada são rigorosos e são aplicados no momento do envio, em vez de silenciosamente:
| Entrada de referência | Limite | Cobrado |
|---|---|---|
| Imagens | até 9 | gratuito nos endpoints H3 do Atlas Cloud |
| Vídeos | até 3, cada 2-15s | cobrado na taxa de saída |
| Áudio | até 3, cada 2-15s, 15s total em todos os clipes | $0,00 |
| Apenas áudio | rejeitado, precisa de pelo menos uma imagem ou vídeo | n/a |
Testei o teto total de áudio de propósito enviando três fatias de 8 segundos em uma única chamada. Falhou em 5,8 segundos com invalid params, total audio duration 24138 ms exceeds 15000 ms e não foi cobrado. Boa notícia: o H3 não descarta silenciosamente o arquivo extra e cobra de qualquer maneira.
Mais uma armadilha que encontrei antes disso. Se você passar áudio como uma URL de dados base64, o tipo MIME decide a extensão que a API infere. data:audio/mpeg é rejeitado com audio format ".mpeg" not allowed. data:audio/mp3 passa direto. Quatro envios morreram nisso antes que eu percebesse, todos gratuitos.
O fluxo de trabalho do videoclipe MiniMax H3 e quanto cada segundo custa
Tudo abaixo roda através de uma chave de API no Atlas Cloud, onde executei e cobrei tudo. Três modelos, uma aba de navegador.
| Etapa | Modelo | O que faz | Preço que realmente me foi cobrado |
|---|---|---|---|
| Escrever o gancho | minimax/music-2.6 | Música completa a partir de um prompt de estilo + letras, mp3 até ~5 min | $0,15 por música, valor fixo |
| Fixar o artista | openai/gpt-image-2/text-to-image | Um quadro base que cada tomada herda | $0,1745 em qualidade alta, 2048x1152 |
| Filmar cada tomada | minimax/h3/reference-to-video | Imagem + áudio como entrada, clipe sincronizado com batida e som estéreo na saída | $0,14/s em 2K, $0,10/s em 768P. Entrada de áudio $0,00 |
Duas notas sobre essa tabela, porque os números listados mentem em ambas as direções. O GPT Image 2 mostra um piso de $0,009 no catálogo; esse é o nível de token mais baixo, e uma renderização high real de 2048x1152 cobra $0,1745. A entrada do catálogo do H3 mostra $0,10, que é apenas o nível 768P; meus trabalhos em 2K de 8 segundos cobraram exatamente $1,12 cada, que é $0,14 por segundo.
Se você quiser um bloqueio de primeiro quadro em vez de referências de assunto, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) usa as mesmas taxas, e [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) cobre tomadas de prompt puro.
A correção que vale a pena fazer: uma versão anterior deste plano assumia que você precisava trazer sua própria música porque não havia um gerador de música completa na plataforma. Agora há. minimax/music-2.6 escreve a faixa, então toda a cadeia, música incluída, roda em um só lugar.
Como fazer um videoclipe MiniMax H3, passo a passo
Passo 1: Escreva um gancho de 120 BPM e corte-o em fatias por tomada
Peça 120 BPM explicitamente. A 120 BPM, um compasso dura exatamente 2.000 segundos, então os valores de duration em segundos inteiros do H3 caem nas linhas do compasso gratuitamente: 4s = 2 compassos, 6s = 3 compassos, 8s = 4 compassos, 10s = 5 compassos. Seus cortes caem no tempo forte sem que você toque em um único marcador.
Modelo: minimax/music-2.6. Configurações: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.
Prompt de estilo:
plaintext1Synth-pop a exatamente 120 BPM, batida reta four-on-the-floor, pads analógicos 2brilhantes com sidechain, vocal feminino limpo à frente na mixagem, refrão estéreo 3amplo, sem rap, vogais sustentadas abertas, cinematográfico e levemente 4melancólico, master com qualidade de rádio
Letras:
plaintext1[Refrão] 2Segure a linha, segure a luz 3Estou ficando sem noite 4Diga meu nome na chuva 5E queimarei novamente
Retornou uma faixa de 70 segundos em 75 segundos por $0,15. Depois verifiquei o andamento em vez de confiar, executando uma autocorrelação de novidade de onset no arquivo. O lag mais forte veio exatamente em 0,500 s, que é 120 BPM, e a grade de batidas começa em 0,24 s no arquivo decodificado, em vez de zero. Esse deslocamento importa: corte a partir de 0,24 e cada fatia começa no tempo forte.
plaintext1# Master de 32 segundos, começando no tempo forte em 0,24s 2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3 3 4# quatro fatias de 8 segundos, uma por tomada, cada uma com 4 compassos e bem abaixo do limite de 15s 5for i in 0 8 16 24; do 6 ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3 7done
Se você já tem sua própria faixa, pule esta etapa inteiramente. Esse é o caso normal, e é o mais barato.
Passo 2: Fixe o artista com um quadro base do GPT Image 2
Cada tomada referencia este único arquivo. O que estiver errado aqui estará errado quatro vezes, então gaste os $0,17 e olhe direito.
Modelo: openai/gpt-image-2/text-to-image. Configurações: quality high , size 2048x1152 (16:9).
plaintext1Still cinematográfico para videoclipe, retrato da cintura para cima. Uma cantora 2synth-pop feminina do Leste Asiático de 25 anos com cabelo curto prateado-branco 3e franja reta, uma blusa de rede preta fosca, uma gargantilha LED vermelha fina 4brilhando contra sua clavícula e um único brinco de argola prateado. Ela está em 5um terraço encharcado de chuva à noite, segurando um microfone de mão cromado 6vintage próximo à boca. Atrás dela, sinalização neon magenta e ciano fora de 7foco, chuva fina capturada em contraluz forte, vapor saindo de um respiro. 8Filmado em 35mm anamórfico, profundidade de campo rasa, gradação teal-e-magenta, 9grão de filme visível. Seu rosto está nítido e uniformemente iluminado por uma luz 10suave vinda da esquerda da câmera. Nenhum texto em qualquer lugar do quadro.

O quadro base gerado: cantora de cabelos prateados com microfone cromado em um terraço neon encharcado de chuva_O_ quadro base que cada tomada posterior herda. Gerado com openai/gpt-image-2/text-to-image , qualidade alta, 2048x1152, cobrado $0,1745.

GPT Image 2 executando este prompt exato no playground do Atlas Cloud com o quadro finalizado no painel de saída
O mesmo prompt no playground: Tamanho 16:9 a 2048x1152, Qualidade alta, e o botão Executar cotando $0,1745, que é o que a API realmente me cobrou. Os $0,009 do catálogo são o nível de token mais baixo, não este. Mesmo prompt, semente diferente, então esta renderização não é o arquivo exato acima.
As palavras do guarda-roupa nesse prompt (cabelo curto prateado-branco, blusa de rede preta fosca, gargantilha LED vermelha, brinco de argola prateado) são reutilizadas literalmente em cada prompt abaixo. Essa repetição é todo o mecanismo de consistência. Não parafraseie.
Passo 3: Execute a primeira tomada do videoclipe MiniMax H3 com áudio de referência gratuito
Modelo: minimax/h3/reference-to-video. Configurações: refers = o quadro base mais slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.
Defina ratio explicitamente. O padrão do playground é adaptive, e o endpoint fica muito mais feliz quando você nomeia a forma que deseja.
plaintext1Tomada de videoclipe. A mulher na imagem de referência canta a faixa de referência 2diretamente para a lente no terraço neon molhado, segurando o microfone cromado 3junto à boca. Ela acerta a primeira linha com força no tempo forte, olhos fixos na 4câmera, depois inclina a cabeça para trás na nota sustentada. Aproximação lenta da 5cintura para cima até um close-up apertado ao longo dos oito segundos, micro- 6deriva de câmera na mão, riscos de chuva cruzando o contraluz forte. Os formatos 7de sua boca seguem exatamente as vogais cantadas do áudio de referência, ela está 8cantando, não falando. Cabelo curto prateado-branco idêntico, blusa de rede preta 9fosca e gargantilha LED vermelha brilhante como na imagem de referência. Paisagem 10sonora: a faixa de referência em estéreo, mais chuva fraca e um zumbido distante 11da cidade baixo na mixagem.
7sPeYEe-xII
Tomada 1, som ligado. 2560x1440, 8,00 s exatos, 24 fps, 32 kHz estéreo. 345 segundos do envio ao arquivo, cobrado $1,12. Observe a inclinação da cabeça para trás na nota sustentada por volta de 5 s.

O playground reference-to-video com o quadro base e a fatia de áudio carregados e o clipe finalizado no painel de saída
Materiais de Referência mostra 2/9: slice-0.mp3 em um slot, o quadro base no outro. Resolução 2K, Duração 8, e o botão Executar cotando $1,12, que é exatamente 8 x $0,14. Observe o menu suspenso Proporção de aspecto em adaptive , que é o padrão da página; minhas chamadas de API definiram ratio para 16:9 explicitamente.
Um número que vale a pena anotar: duration: 8 entregou um contêiner de exatamente 8,00 segundos. duration: 4 entregou 4,46 segundos. Se você planeja concatenar em linhas de compasso, fique nas durações que retornam exatas.
Passo 4: Filme mais três mundos sem perder o rosto
Mesmo quadro base, mesma frase de guarda-roupa, próxima fatia de áudio. Todo o resto muda.
4a. Rodovia no deserto na hora dourada. refers = quadro base + slice-8.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Tomada de videoclipe. A mesma mulher da imagem de referência está na linha central 2de uma rodovia vazia no deserto na hora dourada, sem microfone, uma jaqueta jeans 3índigo aberta sobre a mesma blusa de rede preta fosca, a gargantilha LED vermelha 4ainda acesa. Ela articula o refrão da faixa de referência contra o vento enquanto 5a câmera se move para trás baixa sobre o asfalto. Brilho de calor da estrada, 6poeira levantando, sua sombra se alongando em direção à lente, um flare 7anamórfico cruzando no ponto médio. Cabelo, rosto e guarda-roupa idênticos à 8imagem de referência. Paisagem sonora: a faixa de referência sobre vento aberto do 9deserto, ampla e arejada.
4XEki-v2vCU
Tomada 2, som ligado. Mesmo rosto, temperatura de cor oposta, e a faixa de referência remixada sob vento aberto. 332 s, $1,12.
4b. Estúdio de luz infinita branco. refers = quadro base + slice-16.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Tomada de videoclipe. A mesma mulher da imagem de referência em um estúdio de 2luz infinita branco puro sob luz plana de alto brilho sem sombras, usando um 3casaco de vinil vermelho brilhante sobre a mesma blusa de rede preta fosca, 4gargantilha LED vermelha visível no colarinho. Ela dança quatro compassos ao som 5da faixa de referência, cabelo prateado-branco chicoteando a cada giro. Quadro 6aberto fixo, depois um zoom instantâneo para um plano médio no segundo tempo 7forte. Pequenos quadrados de papel branco caem como confete nos dois segundos 8finais. Rosto e cabelo idênticos à imagem de referência. Paisagem sonora: a faixa 9de referência, seca e próxima, mais o rangido de sapatos no chão do estúdio.
VAyqdkVpnm0
Tomada 3, som ligado. Luz plana sem sombras é o lugar mais difícil para esconder uma troca de rosto, e ela se manteve . 8,00 s, $1,12.
4c. Cena subaquática, sem sincronia labial. refers = quadro base + slice-24.mp3, 2K, duration: 8, ratio: 16:9.
plaintext1Tomada de videoclipe. A mesma mulher da imagem de referência suspensa submersa em 2um tanque preto, cabelo prateado-branco flutuando ao seu redor, a gargantilha LED 3vermelha brilhando através da água, a blusa de rede preta ondulando lentamente. Um 4feixe duro de luz vindo diretamente de cima; bolhas sobem passando pela lente em 5câmera lenta. Ela abre os olhos no tempo forte e estende uma mão em direção à 6superfície. Ela não canta e sua boca permanece fechada. A câmera gira trinta graus 7ao seu redor ao longo da tomada. Rosto idêntico à imagem de referência. Paisagem 8sonora: a faixa de referência ouvida de cima da superfície, abafada e com filtro 9passa-baixa, com transientes de bolhas.
fibdweUMRpY
Tomada 4, som ligado. A instrução "ela não canta e sua boca permanece fechada" foi obedecida, que é a parte útil: o áudio de referência impulsiona o tempo, não uma performance obrigatória. 329 s, $1,12.
Passo 5: Execute a tomada de controle, com o slot de áudio vazio
Mesmo prompt do Passo 3, palavra por palavra. A única mudança: refers contém a imagem e nada mais. 768P, duration: 8.
Este único clipe explica todo o mecanismo melhor do que qualquer parágrafo. Ouça-o contra o Passo 3.
FAoPplGmKJc
A tomada de controle. Prompt idêntico, sem áudio de referência, 1344x768, 8,00 s, 200 s, $0,80. O H3 escreveu sua própria trilha sonora, e a performance é genérica "alguém está cantando" em vez destas palavras.
Medido contra minha master, o áudio do controle pontua 0,26 de correlação de envelope. O do Passo 3 pontua 0,956. Essa lacuna é o que o slot de áudio gratuito compra para você.
Passo 6: Quebre a sincronia labial de propósito
Todo modelo tem um teto de sílabas. Encontrar o seu custa $0,40.
Gerei uma faixa de rap separada em tempo duplo (minimax/music-2.6 novamente, $0,15), cortei uma fatia de 4 segundos com cerca de seis sílabas por segundo, e a alimentei na mesma configuração do terraço a 768P, duration: 4.
plaintext1Tomada de videoclipe. A mulher na imagem de referência faz rap da faixa de 2referência diretamente para a lente no terraço neon molhado, segurando o microfone 3cromado junto à boca, entregando cada sílaba do verso rápido em tempo duplo. 4Close-up médio fixo, ligeira deriva de câmera na mão, riscos de chuva no contraluz 5forte. Os formatos de sua boca seguem exatamente as sílabas rappeadas do áudio de 6referência. Cabelo curto prateado-branco idêntico, blusa de rede preta fosca e 7gargantilha LED vermelha brilhante como na imagem de referência. Paisagem sonora: 8a faixa de referência em estéreo mais chuva fraca.
jiQVCjOCbKg
O teste de estresse, som ligado. 1344x768, 4,46 s, 192 s, $0,40. A boca fica ocupada e mantém o ritmo, mas para de resolver consoantes individuais e se estabelece em um ciclo repetitivo de abrir e fechar. Linhas cantadas obtêm formatos de vogais distintos; isso não.
Minha leitura honesta dos arquivos entregues: vogais sustentadas cantadas são onde o trabalho de boca do H3 é genuinamente convincente, e consoantes rappeadas densas são onde ele degenera em movimento plausível. Planeje seus closes em torno das linhas cantadas e coloque as barras rápidas em cenas secundárias. Há mais detalhes sobre a diferença entre fala e canto na análise de sincronia labial e áudio.
Passo 7: Costure, silencie e aplique a master de volta sobre seu videoclipe MiniMax H3
Quatro clipes de exatamente 8,00 segundos concatenados totalizam exatamente 32,00 segundos, que são 16 compassos a 120 BPM. Sem cortes.
plaintext1# 1. remover o áudio de cada clipe 2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do 3 ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4 4done 5 6# 2. concatenar na ordem dos compassos (4 x 8s = 32s = 16 compassos @ 120 BPM) 7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt 8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4 9 10# 3. aplicar a master original de volta 11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4
Por que se preocupar em silenciar, se o modelo já devolve sua faixa? Porque o mix estéreo de cada clipe carrega a ambiência que o prompt daquela tomada pediu: chuva na tomada 1, vento do deserto na tomada 2, um filtro passa-baixa subaquático na tomada 4. Amável por tomada, incoerente através de um corte. A master dá a você uma mixagem contínua em taxa de bits total, sem re-codificação por tomada. O H3 entrega a sincronia da performance. Sua master entrega a música.
Quatro variações da receita do videoclipe MiniMax H3
Cortes verticais para lançamento. Defina ratio: 9:16 e você obtém um Canvas do Spotify ou uma fatia para Shorts a partir do mesmo quadro base e das mesmas fatias. Retornou um verdadeiro 768x1344, então, ao contrário do menu suspenso de aspecto no playground, o valor ratio da API realmente se mantém. Loops de Canvas são silenciosos por design, então este é enviado como GIF.

Um loop vertical 9:16 cortado da mesma artista no terraço neon_Mesmo quadro base, mesma fatia de referência,_ ratio: 9:16 em 768P por $0,80. Uma ruga honesta: pedi "não cantando" e obtive canto de qualquer maneira. Com um vocal no slot de referência, o áudio vence a discussão. Se você quer um performer silencioso, alimente uma fatia instrumental.
Vídeo de referência em vez de imagem de referência. Você pode fornecer ao H3 até três clipes de vídeo de referência para carregar movimento e enquadramento em vez de descrevê-los. Fique de olho no medidor: vídeo de referência é cobrado na taxa de saída, enquanto áudio de referência é gratuito. Essa assimetria é o fato de precificação mais útil neste endpoint.
Visualizadores puros de cenas secundárias. Elimine o performer completamente. Alimente uma foto de produto, um objeto de capa de álbum ou uma placa de textura, mais a fatia de áudio, e peça apenas movimento de câmera. Nenhum rosto para manter, nenhuma sincronia labial para quebrar, e você pode filmar tudo em 768P.
Rascunho barato, finalização cara. 768P custa $0,10/s contra $0,14/s do 2K, e ambos retornam com áudio estéreo de 32 kHz idêntico, então a performance que você está julgando é a mesma. A economia não está nos aprovados, está nos rejeitados: cada tomada falha de 8 segundos custa $0,80 em vez de $1,12. Rode em 768P até a tomada ficar boa, depois pague os $1,12 uma vez. Em uma tomada que leva três tentativas, isso é $2,72 em vez de $3,36. Mais sobre a diferença de níveis na comparação 768P versus 2K, e sobre até onde um único clipe pode ir no guia de duração de clipe.
O que um videoclipe MiniMax H3 completo realmente custou
Cada linha abaixo é um valor real cobrado, extraído do registro de previsão após a conclusão, não um preço de tabela.
| Item | Modelo e configurações | Cobrado |
|---|---|---|
| Gancho, música de 70 s | minimax/music-2.6, mp3 44,1 kHz | $0,15 |
| Quadro base do artista | openai/gpt-image-2/text-to-image, high, 2048x1152 | $0,17 |
| Tomada 1, terraço neon | minimax/h3/reference-to-video, 2K, 8 s | $1,12 |
| Tomada 2, rodovia no deserto | same, 2K, 8 s | $1,12 |
| Tomada 3, estúdio branco | same, 2K, 8 s | $1,12 |
| Tomada 4, subaquática | same, 2K, 8 s | $1,12 |
| Subtotal do vídeo finalizado | $4,80 | |
| Sonda de validação | 768P, 4 s | $0,40 |
| Tomada de controle, sem áudio | 768P, 8 s | $0,80 |
| Faixa de rap para teste de estresse | minimax/music-2.6 | $0,15 |
| Teste de estresse de sincronia labial | 768P, 4 s | $0,40 |
| Corte vertical para Canvas | 768P, 8 s, 9:16 | $0,80 |
| Imagem herói para este artigo | openai/gpt-image-2/text-to-image, high | $0,17 |
| Teste de limite excedido, 24 s de áudio | rejeitado no envio | $0,00 |
| Quatro envios com MIME de áudio errado | rejeitados no envio | $0,00 |
| Áudio de referência, 4 x 8 s | entrada gratuita | $0,00 |
| Gasto total | $7,53 |
Isso dá $9,00 por minuto finalizado em 2K nas tomadas que entraram no corte, antes de qualquer um dos meus erros. Filmado inteiramente em 768P, o mesmo minuto sai por $6,61. Uma equipe humana de videoclipe não cobra nenhum desses valores.
Duas notas operacionais se você estiver orçando uma peça mais longa. Rejeições no envio são gratuitas, então parâmetros ruins custam tempo e nada mais. E o campo price em uma previsão só é preenchido com atraso, então consulte o ID da solicitação novamente após o download do arquivo se quiser uma fatura real em vez de um null.
De quem é a música, de quem é o rosto: o que verificar antes de publicar
Curto, porque importa e não precisa de um sermão.
Você precisa dos direitos sobre a faixa de referência. Entrada gratuita não significa liberação gratuita. Alimentar um single comercialmente lançado como áudio de referência e depois publicar o que sai é o caminho rápido para uma remoção. Sua própria gravação, uma faixa que você encomendou ou algo que você gerou está tudo bem.
Não construa o quadro base a partir do rosto de um artista real vivo. O mecanismo de consistência aqui é muito bom em manter um rosto entre as tomadas, que é exatamente o motivo pelo qual apontá-lo para uma pessoa real é uma má ideia.
Pesos abertos e acesso via API são duas licenças diferentes. A MiniMax publicou os pesos do H3 no Hugging Face em agosto de 2026, e sua licença comunitária atualmente exclui a UE, Reino Unido, Coreia do Sul e EUA, com um canal de licenciamento formal aberto para esses territórios. Essa restrição se aplica a executar os pesos você mesmo. Chamar o modelo através de uma API hospedada é uma relação de serviço e não o coloca sob a licença de pesos. Vale a pena saber em qual situação você está antes de assumir qualquer um dos lados.
Para uma visão mais ampla de onde o H3 se situa em relação às alternativas, há uma comparação com Seedance 2.5 e um guia de estrutura de prompt. Para contexto sobre por que vale a pena o trabalho: no leaderboard de edição de vídeo que pontua modelos com áudio, o H3 atualmente está em primeiro lugar com 1.126 Elo, à frente do Gemini Omni Flash com 1.119 e do Dreamina Seedance 2.0 com 1.027 (Artificial Analysis, verificado em 10 de agosto de 2026). Essas pontuações mudam com os votos, então trate-as como uma fotografia.
Videoclipe MiniMax H3: Perguntas frequentes
Um videoclipe MiniMax H3 pode rodar três minutos completos?
Não em uma única geração. Uma chamada única limita a 15 segundos. Mas isso é um limite por geração, não por projeto. Um vídeo de três minutos a 8 segundos por tomada são 23 gerações, aproximadamente $25,76 em 2K, e cada uma cai em uma linha de compasso se sua faixa estiver a 120 BPM. Fatia, filme, concatene, aplique a master.
Um videoclipe MiniMax H3 usa minha música real, ou o modelo regenera o áudio?
Usa sua música real. Medii correlação de forma de onda bruta de 0,892 em deslocamento de amostra zero entre o mp3 de 8 segundos que enviei e o fluxo de áudio dentro do mp4 retornado, com a ambiência solicitada pelo prompt sobreposta. Uma tomada de controle gerada sem áudio de referência pontuou 0,26 contra a mesma master. Você ainda deve aplicar sua master de volta sobre a concatenação final, porque cada clipe carrega sua própria ambiência por tomada e sua própria codificação AAC, que não sobrevivem a um corte limpo.
Alimentar uma música em um videoclipe MiniMax H3 custa extra?
Não. Minhas quatro fatias de referência de 8 segundos adicionaram $0,00 a uma conta de $4,48 das tomadas. Vídeo de referência é o que deve ser observado, porque é cobrado na taxa de saída. Os limites são três clipes de áudio, 2 a 15 segundos cada, 15 segundos no total, e o áudio nunca pode ser a única referência.
Qual a qualidade da sincronia labial do MiniMax H3 para canto em comparação com a fala?
Vogais sustentadas cantadas são seu ponto forte: formatos de boca distintos, sustentações que combinam com a nota, e a inclinação para trás em uma nota longa soa como uma performance, não um loop. A entrega densa é onde ele desiste. Meu teste de rap de seis sílabas por segundo manteve o ritmo, mas parou de resolver consoantes e caiu em um ciclo repetitivo de abrir e fechar. Coloque as barras rápidas em cenas secundárias.
Como manter o mesmo rosto em cada tomada de um videoclipe MiniMax H3?
Três coisas, todas chatas. Uma imagem de referência reutilizada em todas as chamadas, nunca regenerada. A mesma redação de guarda-roupa copiada literalmente entre os prompts, não parafraseada. E uma cláusula explícita "idêntico à imagem de referência" em cada prompt. Minhas quatro tomadas atravessaram chuva, sol baixo, luz plana e subaquática sem deriva.
Quanto custa um videoclipe MiniMax H3 por minuto finalizado?
$9,00 por minuto finalizado em 2K, com base na minha conta real de $4,80 para um corte de 32 segundos. Filmado inteiramente em 768P, o mesmo minuto custa $6,61, e 768P entrega o mesmo áudio estéreo de 32 kHz, então a performance que você está julgando é idêntica. Rode seus rejeitados a $0,80 e pague os $1,12 apenas na tomada que sobreviver à edição.






