APENAS DUAS SEMANAS | 20% DE DESCONTO no Seedream 5.0 Pro!

MiniMax H3 Está no Ar: Vídeo 2K Nativo, Uma Passagem e Menor Custo por Segundo

MiniMax H3 está disponível no Atlas Cloud: vídeo nativo em 2K com áudio estéreo em uma única passagem. Veja preços reais por segundo, três pontos de entrada da API e prompts prontos para copiar.

Maior resolução sempre significou uma conta mais alta. O MiniMax H3 quebra essa regra silenciosamente. Ele renderiza diretamente em 2K nativo, e o preço por segundo fica abaixo do que custa um clipe em 720p no modelo de vídeo que a maioria das pessoas usa primeiro.

 

 

Essa é a manchete, mas a resolução e o preço são apenas metade do que torna o MiniMax H3 interessante. A outra metade é como ele funciona: um modelo que lê texto, imagem, vídeo e áudio juntos e retorna um clipe finalizado, imagem e som, em uma única passada. Abaixo está o que ele faz, quanto custa e os prompts exatos que produziram cada clipe neste artigo.

Principais conclusões

  • MiniMax H3 renderiza 2K nativo (2560 por 1440) com uma trilha sonora estéreo sincronizada gerada na mesma passada, não adicionada depois.
  • Preços verificados na página do modelo (julho de 2026): 2K é $0,14 por segundo, 768p é $0,10 por segundo. Para comparação, Seedance 2.0 custa cerca de $0,24 por segundo em 720p, então o H3 oferece um quadro de maior resolução por um preço unitário menor.
  • Três pontos de entrada (texto, imagem e referência a vídeo) compartilham uma chave de API. Referência a vídeo aceita até nove imagens mistas, clipes e uma faixa de áudio como âncoras de identidade.

MiniMax H3 Funciona em uma Única Passada em Vez de Três Ferramentas

Criar um clipe finalizado geralmente significa dividir o trabalho. Você gera uma imagem em um modelo, muda para um segundo modelo para áudio, depois abre um editor para alinhar os dois. Cada transferência perde um pouco da intenção original, e o tempo acumula rapidamente.

O MiniMax H3 simplifica isso. Ele lê todo o briefing como um único contexto: a aparência do personagem, como o movimento ocorre, como a câmera se move, o tom emocional e como o som deve soar — tudo entra junto e retorna como um único clipe. A MiniMax enquadra a direção como um afastamento de modelos especializados em tarefas em direção à inteligência multimodal geral, e na prática significa menos ferramentas abertas ao mesmo tempo.

Duas coisas merecem ser ditas claramente, porque ambas são fáceis de verificar na saída. Primeiro, os clipes têm som real: os arquivos de demonstração abaixo vêm com uma trilha de áudio estéreo embutida, não adicionada na pós-produção. Segundo, a resolução é genuinamente 2K, 2560 por 1440 a 24 quadros por segundo, não um upscale.

Três Maneiras de Executar o MiniMax H3 no Atlas Cloud

O MiniMax H3 está ativo no Atlas Cloud com três pontos de entrada, e todos respondem à mesma chave de API. Cada um tem um Playground que você pode testar no navegador antes de escrever uma linha de código.

Ponto de entradaControlado porEntradasMelhor para
Texto para vídeoApenas um prompt de textoNenhum material de referênciaConstruir uma cena do zero
Imagem para vídeoUm primeiro quadro, mais um último quadro opcionalUma ou duas imagens estáticasAnimação de um quadro fixo que você já possui
Referência para vídeoUm prompt de texto mais material de referênciaAté 9 imagens mistas, clipes de vídeo e uma faixa de áudioManter um personagem, produto ou estilo consistente ao longo do clipe

O caminho de referência para vídeo é o flexível. Ele trata suas referências como âncoras de identidade, para que um personagem, produto ou visual permaneça consistente enquanto o prompt o coloca em novas cenas e movimentos. Você pode misturar imagens e clipes de vídeo, e adicionar uma faixa de áudio para sincronizar a ação com uma batida. Pelo menos uma imagem ou vídeo é obrigatório; áudio sozinho não é permitido.

Como todo modelo na plataforma compartilha uma convenção de chamada, mudar para o H3 a partir de outro modelo de vídeo é uma questão de alterar o campo model. Autenticação, polling e recuperação de resultados permanecem idênticos, que é o benefício silencioso de executar modelos de vídeo, imagem, áudio e linguagem por trás de uma chave e uma única conta.

Quanto Custa o MiniMax H3: 2K, 768p e a Comparação com Seedance

O MiniMax H3 cobra por segundo de vídeo gerado, por resolução. Esses valores vêm diretamente da página do modelo, verificada em 31 de julho de 2026.

ResoluçãoCusto por segundoUm clipe de 8 segundos
2K (2560 por 1440)$0,14$1,12
768p$0,10$0,80

Aqui está a parte que parece inversa à primeira vista. Um segundo em 2K nativo do H3 custa $0,14. Para comparação, o Seedance 2.0, outro modelo de vídeo flagship da plataforma, cobra cerca de $0,24 por segundo em 720p. Então o H3 oferece um quadro de maior resolução, a um preço menor por segundo, do que um clipe de resolução mais baixa no Seedance. Resolução maior, preço unitário menor, ao mesmo tempo.

Uma observação honesta sobre o número, para ninguém errar o orçamento. Não há promoção por trás do preço do H3. O desconto de 20% em vigor na plataforma agora é para o modelo de imagem Seedream 5.0 Pro, não para o H3, então $0,14 por segundo em 2K é a taxa vigente a partir do final de julho de 2026. O nível 768p está listado a $0,10 por segundo; 2K é o nível ativo e chamável hoje.

O Livro de Prompts do MiniMax H3: Demonstrações que Você Pode Copiar

Cada clipe abaixo foi produzido pelo prompt impresso ao lado. Copie um, substitua suas próprias referências e execute. Cada bloco também mostra as imagens de referência que entraram, na ordem em que o prompt as chama (imagem 1, imagem 2 e assim por diante).

Filmes de marca e filmes/TV

Trailers, spots de TVC e filmes de textura de marca são o ajuste mais direto, porque eles se encaixam em um pipeline de conteúdo existente com o mínimo de retrabalho.

Entradas de referência, imagem 1 para clima e estilo, imagem 2 para o personagem principal: Silhueta de frente para um portal gigante com texto The Stars Were Listening Imagem de referência 1, clima e estilo geral Vistas múltiplas de uma mulher usando um casaco cinza carvão comprido Imagem de referência 2, o personagem principal

 

 

Plain
1Aparência cinematográfica realista, luz e sombra de alto contraste, ritmo apertado. A Imagem 1 é a referência para clima e estilo geral. A Imagem 2 é a referência para o personagem principal. Plano 1, plano de estabelecimento ultra-aberto. Um enorme portão circular cósmico quase preenche o quadro; a figura é apenas uma pequena silhueta na frente dele, parada baixa e ligeiramente à direita do centro. O chão está molhado e reflexivo; o centro do portão é preto total. A câmera avança lentamente. Um título principal surge da borda da escuridão, primeiro desfocado depois nítido: "THE STARS WERE LISTENING", extremamente estreito, pesado, todo em maiúsculas, vermelho escuro misturado com vermelho ferrugem, com grão leve e bordas embaçadas. Áudio: pulso de baixa frequência profundo, tremor metálico distante, um impacto suave quando o texto se resolve. Corte seco.

Criação visual e embalagem de conteúdo

Curta-metragens criativos, sequências de título, videoclipes com clima emocional e pôsteres em movimento. É aqui que a manipulação de texto na tela e ritmo do modelo se mostra mais.

Sequência de título de suspense policial leve. Cinco referências de estilo definem o visual retrô-anime, colagem de quadrinhos; o modelo mantém cada crédito em inglês legível e acerta as transições nos golpes de bateria. Banner noir anime com personagem silhuetado em um trem de metrô Referência de estilo Detetive silhuetado segurando uma foto na frente de um quadro de evidências Referência de estilo

 

 

Plain
1Gere uma sequência de abertura de 15 segundos em paisagem 16:9 para um filme de suspense policial leve. O estilo geral segue a linguagem visual destas imagens: sequências de abertura retrô de anime japonês, silhuetas de contornos nítidos, colagem de quadrinhos, telas divididas assimétricas, blocos de cores geométricos fortes, créditos em inglês, algumas decorações em katakana japonês, atitude jazz-crime. O clima é 60% suspense, 40% jazz: misterioso, descolado, ágil, com uma sensação de crime urbano, não terror, não pesado. O movimento parece colagem de motion graphics: molduras de linha aparecem primeiro no preto, bordas de tela dividida deslizam rápido, blocos de cores e painéis colam bloco por bloco; silhuetas de personagens, close-ups de objetos e créditos em inglês deslizam, surgem e revelam-se em máscara em sequência nos golpes de bateria. Os créditos em inglês devem ser claramente legíveis e podem ser animados. Não adicione chinês, sem caracteres confusos, sem erros de ortografia em inglês. Cada crédito e função em inglês aparece exatamente uma vez. Mantenha as transições variadas: máscara circular de vinil, corte vertical de porta de carro, uma longa sombra humana varrendo a tela, corte de linha vermelha, máscara de letra inglesa gigante, recomposição de quadro com tela dividida, corte duro de bloco de cor. Todas as transições aterrissam nos golpes de bateria. Sem dissoluções suaves. BGM: música de título original de 15 segundos, 60% suspense, 40% jazz, construída a partir de um tom grave sustentado, cordas pizzicato tensas, pulsos de sintetizador frios, bumbo, escovas de jazz esparsas e frases curtas de saxofone baixo. Os primeiros 2 segundos estabelecem suspense com frequências baixas e chimbal; aos 3 segundos uma batida de bumbo entra; aos 6 segundos um groove de baixo jazz entra; aos 10 segundos um riff curto de sax aparece; os últimos 2 segundos fixam o quadro com um acorde tenso mais um golpe de bateria. Não imite nenhuma melodia existente.

Cozinha live-action mesclada com animação desenhada à mão. Nenhum material de referência, apenas texto para vídeo. O prompt aposta na textura imperfeita de câmera de telefone para evitar que pareça um comercial.

 

 

Plain
115 segundos, paisagem 16:9. Imagens live-action de uma pequena cozinha ao entardecer mescladas com animação brilhante desenhada à mão. A luz do pôr do sol ainda permanece na janela; a pequena cozinha vivida tem uma mesa de madeira velha, uma caneca meio lavada, uma garrafa de vidro levemente embaçada e um pano de prato pendurado. A imagem carrega o tremor fino de uma filmagem com smartphone com uma mão, hesitação ao focar de perto, flutuação de exposição devido à contraluz e ruído ligeiramente áspero nas sombras. Não faça parecer bem composto como um comercial, deve parecer que alguém está filmando às pressas algo impossível em casa. Sem olhos gigantes, sem bocas fendidas, sem presas, sem movimentos ameaçadores ou de investida, sem corte repentino para preto, sem sustos. O som usa apenas o tom ambiente da cozinha, o atrito do pano de prato, o leve tinido da caneca, água pingando da torneira, os passos do cinegrafista e respiração suave, mais o tom eletrônico suave e pequenos gritos da criatura desenhada à mão.

Videoclipe dark-pop, cyber-grunge. Duas referências definem o tratamento tipográfico e a textura de impressão; o corte permanece duro, sem dissoluções. Três mulheres posando com roupas desgastadas e detalhes de pele sintética Referência de tratamento tipográfico Grade de modelos de design tipográfico desgastados em preto, branco e vermelho Referência de tratamento tipográfico

 

 

Plain
1Estilo: dark-pop / cyber-grunge / videoclipe de rap, textura realista de alta moda, textura de revista de cinema, alto contraste, mas não barato. Referência geral: revistas independentes do final dos anos 90 ao início dos anos 2000, papel de fotocopiadora, digitalizações de filme, pôsteres de música underground e estética de colagem de zine. A imagem tem grão grosso, leve tremor de filme, pontos de meio-tom, rebarbas de impressão e desalinhamento de digitalização. Ritmo de corte rápido, apenas cortes secos, sem desbotamentos e sem transições suaves. O estilo de tratamento tipográfico e a textura seguem as imagens de referência.

Pôster em movimento. Uma referência, o pôster estático original. O prompt mantém o layout e a paleta fixos e apenas anima a entrada do tipo. Garoto anime em moletom rosa de dinossauro estendendo a mão com uma garra gigante O pôster estático original

 

 

Plain
1Faça um vídeo de pôster em movimento. Mantenha a moldura branca de galeria da imagem original, moldura interna, paleta vermelho-branco-preto, sensação de figura 3D e estrutura de layout inalterados; conforme o tipo entra, adicione um efeito sonoro ágil de entrada de texto.

Experiência digital e criação de jogos

UI de jogos, interfaces de produto e demonstrações de interação. O destaque aqui é que o H3 segue um prompt escrito como blocos temporizados.

Demonstração de UI de equipamento de jogo, com prompt por segundo. Este é o que vale a pena ler com atenção. O prompt é escrito como segmentos temporizados, e o modelo os segue: estados de menu, cliques de cursor, painéis deslizantes, uma grade de armamento, uma barra de carregamento de 0% a 100%, então o ambiente completo carregando ao redor do personagem. Personagem polvo rosa estilizado sentado de pernas cruzadas em um fundo roxo sólido Imagem de referência 1, o personagem Menu de jogo roxo com cursor apontando para o botão Continue Imagem de referência 2, o estilo da UI

 

 

Plain
1A referência do personagem é a Imagem 1, a referência do estilo da UI é a Imagem 2.
2
3[0s-2s] Plano de cima com ângulo alto. A personagem senta-se em um chão roxo brilhante altamente saturado, referenciando a Imagem 1, olhando para cima na câmera. Uma UI de menu de jogo aparece à direita: START NEW GAME, CONTINUE (destacado), SETTINGS, EXIT GAME. O perfil do jogador MINIMAX aparece no canto superior esquerdo. O cursor clica em "CONTINUE".
4
5[2s-4s] Zoom suave para o braço direito dela. Um painel de UI desliza da direita e o painel "RIGHT ARM EQUIPMENT" aparece. A seleção destaca "PHANTOM GRIP", depois desliza para "CHRONOS CLAW". A mão direita dela se reconfigura mecanicamente, dedos se separando, novas juntas em forma de garra se encaixando, LEDs ciano piscando mais forte.
6
7[4s-7s] A câmera faz um arco suave para o lado esquerdo dela. Uma nova UI desliza, a grade "ARMAMENT CUSTOMIZATION", mostrando componentes de mão, antebraço, cotovelo e braço superior. A seleção percorre rapidamente as peças. O braço esquerdo dela se desmonta segmento por segmento, com fiação exposta e pistões visíveis durante a troca.
8
9[7s-8.5s] A câmera recua para um plano médio. O botão CONFIRM CONFIG pisca. Clique. Todos os painéis de UI se contraem para dentro e desaparecem. A personagem desdobra as pernas e agora senta-se relaxada com um joelho erguido.
10
11[8.5s-10s] Uma barra de LOADING aparece na parte inferior, enchendo rápido de 0% a 100%. O ambiente roxo brilhante começa a escurecer, sombras surgindo das bordas, luz dourada quente infiltrando-se.
12
13[10s-15s] Enquanto ela se levanta, o ambiente completo carrega ao seu redor. Uma favela cyberpunk densa se resolve: néon piscando, ruas molhadas refletindo luz, multidões se movendo, motos serpenteando, prédios empilhados se estendendo em direção a arranha-céus distantes. A câmera se estabiliza em terceira pessoa atrás dela. Elementos de HUD surgem, com um minimapa no canto superior direito e um contador de saúde e munição no canto inferior esquerdo. Um marcador de missão aparece. Ela entra na rua.

Demonstração de UI/UX de página de produto. Uma foto do produto como referência; o prompt pede uma página de destino com rolagem e alta energia. Tênis de corrida Nike azul claro com detalhes verdes e calcanhar rosa A referência da foto do produto

 

 

Plain
1Uma página de site, design de UI de página de site, movimento de site, o vídeo mostra uma rolagem suave para baixo da página. Um vídeo de demonstração de UI/UX de página de destino de produto explosiva e de alta energia, estilo site oficial da Nike, cujo assunto principal em exibição é o produto da Imagem 1. A página usa tipografia sem serifa inclinada, áspera e poderosa, para um layout alto. No fundo, luz e sombra em movimento rápido, textura de fibra de carbono escura ou malha respirável atlética se entrelaçam e mudam. O vídeo mostra uma rolagem de página para baixo bem ritmada, mais interações de UI, como aumento visual forte e inversão de cores ao passar o mouse.

Movimento de UI web, prompt mínimo. Prova de que o estilo detalhado e temporizado é opcional; uma instrução curta também funciona. Carro esportivo elétrico cinza elegante com lanternas traseiras vermelhas brilhantes em estúdio escuro Imagem de referência

 

 

Plain
1Simule um design de UI de site: primeiro o título no topo desliza para baixo até aparecer, depois a barra de texto abaixo varre para cima, e as luzes do carro mudam de escuras para vermelhas.

Como Começar com o MiniMax H3

Existem duas maneiras de entrar, e nenhuma delas leva muito tempo.

Execute no Playground. Faça login no Atlas Cloud e abra o MiniMax H3 diretamente na página do modelo. Digite um prompt, escolha uma resolução e duração e gere, sem necessidade de código. É a maneira mais rápida de ver se o modelo se adequa ao seu plano antes de integrá-lo a qualquer coisa.

Ou chame a API em três etapas.

  1. Obtenha sua chave de API. Abra o console Atlas Cloud e crie uma chave na página de Chaves de API. Os três pontos de entrada do H3 compartilham a mesma chave.
  2. Leia os campos na página do modelo. A referência de parâmetros e o código copiável estão em cada ponto de entrada: texto para vídeo, imagem para vídeo e referência para vídeo. Os três aceitam entradas diferentes, portanto não misture os corpos das requisições.
  3. Dispare a primeira requisição. Um endpoint e uma convenção de chamada alcançam todos os modelos da plataforma, então mudar de outro modelo de vídeo para o H3 significa alterar o campo model para o ponto de entrada H3 correspondente. Autenticação, polling e recuperação de resultados permanecem os mesmos.

Além do H3, a mesma chave alcança modelos de vídeo, imagem, áudio e linguagem que você pode combinar, uma API e uma única conta, então construir uma peça finalizada não significa transportar ativos e faturas entre fornecedores.

Perguntas Frequentes

O que é o MiniMax H3?

O MiniMax H3 é o modelo de geração de vídeo multimodal da MiniMax, disponível no Atlas Cloud através de três pontos de entrada: texto para vídeo, imagem para vídeo e referência para vídeo. Ele lê texto, imagem, vídeo e áudio como um único contexto e retorna um clipe 2K finalizado com som sincronizado em uma única passada.

Quanto custa o MiniMax H3?

O MiniMax H3 cobra por segundo de vídeo. Verificado na página do modelo em julho de 2026, 2K nativo (2560 por 1440) custa $0,14 por segundo e 768p custa $0,10 por segundo. Um clipe de 8 segundos em 2K custa, portanto, $1,12. Não há desconto promocional no H3 naquele momento.

O MiniMax H3 gera áudio ou apenas vídeo?

Ambos, juntos. Os clipes de demonstração saem do MiniMax H3 com uma trilha de áudio estéreo sincronizada gerada na mesma passada que a imagem, em vez de adicionada em uma etapa separada. Os prompts podem direcionar o som, descrevendo música, efeitos sonoros e temporização juntamente com os visuais.

Qual é a diferença entre os três pontos de entrada do MiniMax H3?

Texto para vídeo funciona apenas com um prompt. Imagem para vídeo anima um primeiro quadro, com um último quadro opcional. Referência para vídeo mantém um assunto consistente usando até nove materiais de referência mistos, imagens, clipes de vídeo e uma faixa de áudio. Todos os três compartilham uma chave de API e uma convenção de chamada.

Qual resolução e comprimento de clipe o MiniMax H3 suporta?

O MiniMax H3 renderiza 2K nativo a 2560 por 1440 e 24 quadros por segundo, com um nível mais barato de 768p na tabela de preços. Os clipes variam de cerca de 5 a 15 segundos, e as proporções incluem adaptável, 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos