

A MiniMax H3 API disponibiliza o modelo de vídeo multimodal de uso geral da MiniMax, que processa texto, imagens, vídeo e áudio como um único contexto, em vez de uma tarefa de cada vez. Os clipes têm de 5 a 15 segundos a 24 FPS, em proporções de 21:9 a 9:16, e um único prompt pode trocar personagens, substituir fundos, reescrever diálogos ou clonar uma voz a partir de um clipe de referência. A Atlas Cloud disponibiliza tudo isto através de um único endpoint compatível com OpenAI. Comece a criar hoje mesmo.
O Atlas Cloud oferece os modelos criativos mais avançados e inovadores do setor.
Cada endpoint da API MiniMax H3 interpreta texto, imagens, vídeo e áudio de forma diferente; portanto, examine as linhas abaixo e associe a modalidade ao que você está criando.
| Modalidade | Descrição |
|---|---|
| MiniMax H3 T2V API (texto para vídeo) | Escreva um prompt de até 7,000 caracteres e o modelo retorna um clipe de 5 a 15 segundos a 24 FPS em 1440p, com som estéreo nativo gerado na mesma execução. A proporção de aspecto é definida por requisição entre 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16, de modo que uma única chamada cobre tanto trailers cinematográficos quanto cortes verticais para redes sociais. |
| MiniMax H3 I2V API (imagem para vídeo) | Uma imagem define o quadro inicial, e duas fixam tanto o primeiro quanto o último, com o H3 preenchendo o movimento entre eles na proporção de aspecto da imagem de entrada. São aceitas fontes de 256 a 5760 pixels por lado, o que torna simples colocar em movimento artes principais, fotos estáticas de produto e quadros de storyboard. |
| MiniMax H3 Omni Reference API (referência para vídeo) | Precisa combinar várias fontes? Até nove imagens, três clipes de vídeo e três faixas de áudio cabem em uma única requisição, com limite de 12 arquivos, todos interpretados como um único contexto multimodal. Mantenha um personagem, um movimento de câmera ou um timbre de voz entre cenas, ou edite um clipe existente trocando sujeitos, planos de fundo e falas. |
Cada clipe devolvido pela API MiniMax H3 dura até quinze segundos em 1440p, com som estéreo nativo, criado a partir de qualquer combinação de referências de texto, imagem, vídeo e voz, e a mesma chamada também pode editar personagens, cenas e diálogos em filmagens que você já tem.
Uma solicitação à API MiniMax H3 aceita até nove imagens de referência, três clipes de vídeo e três faixas de áudio, com limite de doze arquivos. Em vez de lê-los como entradas separadas, o modelo trata texto, imagem e som como um único contexto, trazendo um personagem de uma foto, um movimento de câmera de um clipe e uma atmosfera de uma faixa para a mesma cena. Equipes com material existente ganham um caminho direto até uma tomada finalizada.
Todo resultado já vem com som. Diálogo, ambiência e música são produzidos em estéreo nativo na mesma passagem que renderiza a imagem a 24 frames por segundo, então nada precisa ser musicado ou dublado depois. Como o timing é definido enquanto a tomada é gerada, passos, fala e cortes permanecem sincronizados com a ação. Anúncios curtos e peças para redes sociais saem prontos para publicar.
Precisa trocar um gato por um cachorro, substituir um green screen ou reescrever uma fala? A API MiniMax H3 aplica edições como essas ao vídeo que você fornece, cobrindo personagens, objetos, fundos, iluminação e efeitos, enquanto as partes que você não mencionou permanecem próximas do original. Os prompts podem ter até 7000 caracteres, então uma dúzia de alterações pode ser empilhada em uma única passagem. Isso torna prática a iteração sobre um corte já aprovado.
Envie uma amostra de voz junto com suas imagens ou filmagens, e o personagem gerado falará nesse timbre. Até três referências de áudio são permitidas por solicitação, cada uma entre dois e quinze segundos, e o áudio deve sempre acompanhar uma entrada visual, em vez de chegar sozinho. Diálogos existentes também podem ser substituídos e a interpretação ajustada para combinar. Trabalhos em série mantêm uma voz reconhecível em todos os episódios.
Os clipes vão de cinco a quinze segundos, e o modo 1440p coloca 1440 pixels no lado curto entre 16:9 e 9:16, ou cerca de 3,7 megapixels em proporções mais largas, como 2976 por 1248 para 21:9. Seis proporções podem ser selecionadas, do cinematográfico 21:9 ao vertical 9:16, e a API MiniMax H3 também pode escolher uma por você. Essa variedade cobre um trailer, um loop de produto e um drama vertical sem trocar de modelo.
Se seus arquivos de origem vêm direto de uma câmera ou de uma timeline de edição, eles entram como estão: vídeo H.264 e H.265, imagens JPG, PNG, WEBP, HEIC e HEIF, além de áudio WAV e MP3. Os limites por arquivo são de 50MB para vídeo, 30MB para imagens e 15MB para áudio, enquanto o envio de assets por URL mantém as solicitações dentro do limite de corpo de 64MB. Na Atlas Cloud, o conjunto inteiro roda com uma única chave compatível com OpenAI e cobrança pay-as-you-go.
Todos os clipes deste conjunto vêm de um prompt idêntico enviado à MiniMax H3 API e a dois outros modelos de vídeo alojados na Atlas Cloud, para que movimento, som e fidelidade às instruções possam ser comparados sem alterar uma única palavra.
15 seconds, vídeo curto horizontal 16:9. Filmagem live-action de uma lavandaria self-service a altas horas da noite, combinada com animação brilhante desenhada à mão numa imagem de media mista. Uma pequena lavandaria self-service, com as luzes fluorescentes a piscar ligeiramente; no interior há máquinas de lavar em funcionamento, cestos de roupa de plástico e um banco antigo, com uma meia solitária caída no chão. Todo o espaço é silencioso e transmite uma atmosfera subtilmente nostálgica. Tem a textura de uma filmagem de telemóvel feita à mão com uma só mão, com tremor de câmara perceptível; a luz fluorescente branca faz a exposição oscilar entre claro e escuro; as superfícies de vidro apresentam reflexos do ambiente; há atraso na focagem quando a lente se aproxima dos objectos. A imagem não deve ser tão polida e organizada como um anúncio comercial — a sensação geral deve ser a de um instantâneo documental genuíno, como se tivesses entrado ali por acaso a altas horas da noite e captado a cena enquanto perseguias uma visão estranha e onírica.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Perspectiva em primeira pessoa · altura ao nível dos olhos · câmara de jogo portátil Cena: A tomada simula um jogador a controlar um jogo FPS de guerra moderna, com as duas mãos a segurar uma espingarda de assalto enquanto avança lentamente pelo perímetro exterior de uma base militar. O jogador segue em frente por uma estrada junto a zonas de cobertura, com a mira a varrer a passagem à frente; após uma breve pausa, dispara alguns tiros na direcção de um objectivo distante e depois continua a avançar — como uma filmagem de gameplay ao vivo de um jogador comum. Iluminação: A luz natural em tons frios de uma base militar moderna mistura-se com fumo e clarões de disparos. A imagem é realista e nítida, com a arma metálica e a poeira e névoa do campo de batalha a transmitirem qualidade de jogo AAA. Trabalho de câmara: A câmara tem uma ligeira oscilação de mão enquanto o jogador se move — primeiro avança lentamente, depois faz pequenos varrimentos para a esquerda e para a direita para observar, com um tremor subtil de recuo ao disparar, antes de finalmente continuar a avançar de forma constante.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
De filmes de marca e dramas verticais a cortes de produto, visuais de jogos e edições precisas de filmagens existentes, a MiniMax H3 API abrange cada cenário através de um único pedido multimodal que devolve vídeo com áudio estéreo nativo.
Envie frames de storyboard e uma lista de planos numa única chamada para trailers em 1440p, spots TVC e campanhas de moda a 24 FPS. O áudio estéreo nativo acompanha cada resultado, para que as equipas de marca possam rever cortes finalizados.
A saída vertical 9:16 cobre cenas de drama com guião, de mistérios com figurinos a confrontos familiares, com o diálogo dobrado na mesma passagem. Estúdios que criam bibliotecas de dramas curtos obtêm ganchos de 15 segundos sem reservar atores nem palcos.
Se um plano precisar de um rosto e movimento específicos, até nove imagens, três vídeos e três clipes de áudio podem orientar uma única chamada. A identidade da personagem, o trabalho de câmara e o timbre vocal mantêm-se consistentes ao longo dos episódios.
Precisa de uma alteração depois do facto? As filmagens existentes podem ser editadas por prompt: trocar um sujeito, substituir um fundo, ajustar a iluminação ou reescrever uma fala sem regravar um único frame.
Fotografias de produto ganham movimento: uma imagem de referência transforma-se numa apresentação 360 degree, numa explicação de funcionalidades ou num corte para anúncios em redes sociais. Proporções de 21:9 a 9:16 permitem que um único conjunto de assets alimente todos os posicionamentos.
A saída estilizada mantém a qualidade para game CG, character PV, aberturas de anime e demos de interface em que menus, elementos de HUD e sobreposições de texto têm de permanecer legíveis. As equipas de arte usam-na para validar conceitos antes da produção.
Compare a MiniMax H3 API com os outros modelos de vídeo hospedados na Atlas Cloud e veja como as modalidades de entrada, os limites de referência, a duração, a resolução e a saída de áudio diferem realmente antes de optar por um endpoint.
| Modelo | Modalidades de entrada | Máximo de ficheiros de referência | Duração da saída | Resolução máxima | Áudio nativo |
|---|---|---|---|---|---|
| MiniMax H3 | Texto, imagem, vídeo, áudio | 9 imagens, 3 vídeos, 3 clips de áudio, 12 ficheiros no total | 5s a 15s | 1440p a 24 FPS | √ Áudio estéreo nativo em todas as saídas |
| Seedance 2.0 Reference-to-Video | Texto, imagem, vídeo, áudio | 9 imagens, 3 vídeos, 3 clips de áudio | Até 15s | 720p | √ Diálogo estéreo, efeitos e música gerados numa única passagem |
| Veo3.1 Reference-to-video | Texto e imagem | 3 imagens de referência | 4s, 6s ou 8s | 4K apenas com duração de 8s | √ Diálogo, ambiência e efeitos sonoros alinhados à linha temporal |
| Wan-2.7 Reference-to-video | Texto, imagem, vídeo, áudio | 5 imagens ou clips de vídeo, mais um clip de voz | 2s a 15s | 1080p | √ Música e efeitos gerados, ou controle a sincronização labial com o seu próprio áudio |
| Kling v3.0 Pro Image-to-Video | Texto e imagem | - | Até 15s | 1080p | √ Diálogo multilingue com sincronização labial em cinco idiomas |
Comece em minutos — siga estes passos simples para integrar e implantar modelos pela plataforma da Atlas Cloud.
Cadastre-se em atlascloud.ai e conclua a verificação. Novos usuários recebem créditos gratuitos para explorar a plataforma e testar modelos.
Combine modelos avançados de MiniMax H3 com a plataforma acelerada por GPU do Atlas Cloud, fornecendo desempenho, escalabilidade e experiência de desenvolvimento incomparáveis.
Baixa Latência:
Inferência otimizada por GPU para respostas em tempo real.
API Unificada:
Uma única integração para acessar MiniMax H3, GPT, Gemini e DeepSeek.
Preços Transparentes:
Faturamento por Token, suporta modo Serverless.
Experiência do Desenvolvedor:
SDK, análise de dados, ferramentas de ajuste fino e modelos tudo em um.
Confiabilidade:
99.99% de disponibilidade, controle de permissões RBAC, logs de conformidade.
Segurança e Conformidade:
Certificação SOC 2 Type II, conformidade HIPAA, soberania de dados nos EUA.
A MiniMax H3 API oferece aos desenvolvedores acesso programático ao MiniMax H3, um modelo de vídeo multimodal aberto e de uso geral que trata texto, imagens, vídeo e áudio como um único contexto compartilhado. Em vez de separar geração, edição e referência em modelos de tarefa distintos, o H3 interpreta todo o conjunto de entrada e retorna um clipe finalizado com som. No Atlas Cloud, ele funciona por trás de uma única API key, com preços pay-as-you-go.
Filmes de marca, trailers, dramas curtos verticais, anúncios de produto e ecommerce, demonstrações de movimento para jogos e UI, além de animações estilizadas, estão todos dentro do seu alcance. Como o modelo lida com texto na tela, legendas e ativos de marca, equipes também o usam para validação de conceitos, prévias de storyboard e apresentações visuais antes de comprometer orçamento de produção.
Crie uma conta no Atlas Cloud, gere uma API key e envie um prompt com quaisquer arquivos de referência para o endpoint de geração de vídeo; depois, consulte o status até obter o resultado finalizado. Recomenda-se enviar mídia como URLs hospedadas em vez de uploads inline, pois o corpo da requisição é limitado a 64MB. Comece a criar hoje.
A cobrança é pay-as-you-go, então você paga por chamada em vez de comprar uma assinatura ou uma licença por usuário. O custo acompanha o que você realmente renderiza, ou seja, a resolução e a duração do clipe determinam o total de um lote. Consulte a página do modelo para ver a tarifa atual por geração antes de planejar execuções em grande volume.
Sim. Todo resultado do H3 é entregue com som em estéreo nativo, então diálogos, efeitos e ambiência chegam na mesma passada que a imagem. Forneça um clipe de áudio de referência e o modelo pode transferir esse timbre para um personagem, eliminando uma etapa separada de síntese de voz do pipeline.
Os clipes variam de 5 a 15 segundos a 24 FPS. No modo 1440p, o lado menor é renderizado com 1440 pixels para proporções entre 16:9 e 9:16; fora dessa faixa, o quadro mantém cerca de 3.7M pixels no total, por exemplo 2976 por 1248 em 21:9. Requisições text to video e omni reference aceitam 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16, enquanto requisições de primeiro e último quadro herdam a proporção da imagem de entrada.
Até nove imagens, três segmentos de vídeo e três clipes de áudio podem acompanhar um único prompt, com limite total de doze arquivos. Vídeo e áudio devem permanecer dentro de 15 segundos combinados cada, e o áudio deve acompanhar uma imagem ou um vídeo, em vez de chegar sozinho. Os prompts chegam a 7000 caracteres, deixando espaço para direção plano a plano que cubra câmera, atuação e som.
As entradas aceitas incluem vídeo H.264 e H.265, imagens JPG, JPEG, PNG, WEBP, HEIC e HEIF, e áudio WAV ou MP3, com AAC ou MP3 para a faixa de áudio dentro de um arquivo de vídeo. Os limites por arquivo são 50MB para vídeo, 30MB para imagens e 15MB para áudio. Como o corpo da requisição é limitado a 64MB, URLs hospedadas continuam sendo a opção mais segura para ativos pesados.
A edição é um dos seus modos principais. Envie um clipe de origem com instruções, e a MiniMax H3 API pode trocar personagens ou objetos, substituir fundos e iluminação, adicionar camadas de efeitos visuais e reescrever diálogos, mantendo estáveis as regiões não alteradas. Instruções compostas são tratadas em uma única requisição, então várias mudanças são aplicadas juntas, em vez de exigirem idas e vindas repetidas.
A maioria dos modelos de vídeo recebe um prompt mais uma imagem e retorna um clipe silencioso. O H3, por outro lado, consome um conjunto misto de referências, interpreta a intenção de personagem, movimento, câmera e som em todas elas e então retorna um clipe com áudio nativo. Se o seu pipeline hoje junta um modelo de vídeo, um modelo de voz e um editor, o H3 consolida essas etapas em uma única chamada.
Guias, tutoriais e novidades de produto para você aproveitar ao máximo a Atlas Cloud.