APENAS DUAS SEMANAS | 20% DE DESCONTO no Seedream 5.0 Pro!
Hero background 1Hero background 2

MiniMax H3 API for Video Generation and Editing

A MiniMax H3 API disponibiliza o modelo de vídeo multimodal de uso geral da MiniMax, que processa texto, imagens, vídeo e áudio como um único contexto, em vez de uma tarefa de cada vez. Os clipes têm de 5 a 15 segundos a 24 FPS, em proporções de 21:9 a 9:16, e um único prompt pode trocar personagens, substituir fundos, reescrever diálogos ou clonar uma voz a partir de um clipe de referência. A Atlas Cloud disponibiliza tudo isto através de um único endpoint compatível com OpenAI. Comece a criar hoje mesmo.

Explorar Modelos Líderes

O Atlas Cloud oferece os modelos criativos mais avançados e inovadores do setor.

Do texto a nove referências: modalidades da API MiniMax H3

Cada endpoint da API MiniMax H3 interpreta texto, imagens, vídeo e áudio de forma diferente; portanto, examine as linhas abaixo e associe a modalidade ao que você está criando.

ModalidadeDescrição
MiniMax H3 T2V API (texto para vídeo)Escreva um prompt de até 7,000 caracteres e o modelo retorna um clipe de 5 a 15 segundos a 24 FPS em 1440p, com som estéreo nativo gerado na mesma execução. A proporção de aspecto é definida por requisição entre 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16, de modo que uma única chamada cobre tanto trailers cinematográficos quanto cortes verticais para redes sociais.
MiniMax H3 I2V API (imagem para vídeo)Uma imagem define o quadro inicial, e duas fixam tanto o primeiro quanto o último, com o H3 preenchendo o movimento entre eles na proporção de aspecto da imagem de entrada. São aceitas fontes de 256 a 5760 pixels por lado, o que torna simples colocar em movimento artes principais, fotos estáticas de produto e quadros de storyboard.
MiniMax H3 Omni Reference API (referência para vídeo)Precisa combinar várias fontes? Até nove imagens, três clipes de vídeo e três faixas de áudio cabem em uma única requisição, com limite de 12 arquivos, todos interpretados como um único contexto multimodal. Mantenha um personagem, um movimento de câmera ou um timbre de voz entre cenas, ou edite um clipe existente trocando sujeitos, planos de fundo e falas.

Imagem, Som e Edição em Uma Única Chamada à API MiniMax H3

Cada clipe devolvido pela API MiniMax H3 dura até quinze segundos em 1440p, com som estéreo nativo, criado a partir de qualquer combinação de referências de texto, imagem, vídeo e voz, e a mesma chamada também pode editar personagens, cenas e diálogos em filmagens que você já tem.

Doze Arquivos de Referência, Uma Chamada à API MiniMax H3

Uma solicitação à API MiniMax H3 aceita até nove imagens de referência, três clipes de vídeo e três faixas de áudio, com limite de doze arquivos. Em vez de lê-los como entradas separadas, o modelo trata texto, imagem e som como um único contexto, trazendo um personagem de uma foto, um movimento de câmera de um clipe e uma atmosfera de uma faixa para a mesma cena. Equipes com material existente ganham um caminho direto até uma tomada finalizada.

Som Estéreo Nativo em Cada Clipe

Todo resultado já vem com som. Diálogo, ambiência e música são produzidos em estéreo nativo na mesma passagem que renderiza a imagem a 24 frames por segundo, então nada precisa ser musicado ou dublado depois. Como o timing é definido enquanto a tomada é gerada, passos, fala e cortes permanecem sincronizados com a ação. Anúncios curtos e peças para redes sociais saem prontos para publicar.

Edições por Prompt com a API MiniMax H3

Precisa trocar um gato por um cachorro, substituir um green screen ou reescrever uma fala? A API MiniMax H3 aplica edições como essas ao vídeo que você fornece, cobrindo personagens, objetos, fundos, iluminação e efeitos, enquanto as partes que você não mencionou permanecem próximas do original. Os prompts podem ter até 7000 caracteres, então uma dúzia de alterações pode ser empilhada em uma única passagem. Isso torna prática a iteração sobre um corte já aprovado.

Transferência de Timbre de Voz e Trocas de Diálogo

Envie uma amostra de voz junto com suas imagens ou filmagens, e o personagem gerado falará nesse timbre. Até três referências de áudio são permitidas por solicitação, cada uma entre dois e quinze segundos, e o áudio deve sempre acompanhar uma entrada visual, em vez de chegar sozinho. Diálogos existentes também podem ser substituídos e a interpretação ajustada para combinar. Trabalhos em série mantêm uma voz reconhecível em todos os episódios.

1440p e Seis Proporções de Tela na API MiniMax H3

Os clipes vão de cinco a quinze segundos, e o modo 1440p coloca 1440 pixels no lado curto entre 16:9 e 9:16, ou cerca de 3,7 megapixels em proporções mais largas, como 2976 por 1248 para 21:9. Seis proporções podem ser selecionadas, do cinematográfico 21:9 ao vertical 9:16, e a API MiniMax H3 também pode escolher uma por você. Essa variedade cobre um trailer, um loop de produto e um drama vertical sem trocar de modelo.

Formatos de Produção Entram Direto, Sem Etapa de Conversão

Se seus arquivos de origem vêm direto de uma câmera ou de uma timeline de edição, eles entram como estão: vídeo H.264 e H.265, imagens JPG, PNG, WEBP, HEIC e HEIF, além de áudio WAV e MP3. Os limites por arquivo são de 50MB para vídeo, 30MB para imagens e 15MB para áudio, enquanto o envio de assets por URL mantém as solicitações dentro do limite de corpo de 64MB. Na Atlas Cloud, o conjunto inteiro roda com uma única chave compatível com OpenAI e cobrança pay-as-you-go.

Mesmo prompt, três motores: MiniMax H3 API frente a frente

Todos os clipes deste conjunto vêm de um prompt idêntico enviado à MiniMax H3 API e a dois outros modelos de vídeo alojados na Atlas Cloud, para que movimento, som e fidelidade às instruções possam ser comparados sem alterar uma única palavra.

Prompt

15 seconds, vídeo curto horizontal 16:9. Filmagem live-action de uma lavandaria self-service a altas horas da noite, combinada com animação brilhante desenhada à mão numa imagem de media mista. Uma pequena lavandaria self-service, com as luzes fluorescentes a piscar ligeiramente; no interior há máquinas de lavar em funcionamento, cestos de roupa de plástico e um banco antigo, com uma meia solitária caída no chão. Todo o espaço é silencioso e transmite uma atmosfera subtilmente nostálgica. Tem a textura de uma filmagem de telemóvel feita à mão com uma só mão, com tremor de câmara perceptível; a luz fluorescente branca faz a exposição oscilar entre claro e escuro; as superfícies de vidro apresentam reflexos do ambiente; há atraso na focagem quando a lente se aproxima dos objectos. A imagem não deve ser tão polida e organizada como um anúncio comercial — a sensação geral deve ser a de um instantâneo documental genuíno, como se tivesses entrado ali por acaso a altas horas da noite e captado a cena enquanto perseguias uma visão estranha e onírica.

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

Prompt

Perspectiva em primeira pessoa · altura ao nível dos olhos · câmara de jogo portátil Cena: A tomada simula um jogador a controlar um jogo FPS de guerra moderna, com as duas mãos a segurar uma espingarda de assalto enquanto avança lentamente pelo perímetro exterior de uma base militar. O jogador segue em frente por uma estrada junto a zonas de cobertura, com a mira a varrer a passagem à frente; após uma breve pausa, dispara alguns tiros na direcção de um objectivo distante e depois continua a avançar — como uma filmagem de gameplay ao vivo de um jogador comum. Iluminação: A luz natural em tons frios de uma base militar moderna mistura-se com fumo e clarões de disparos. A imagem é realista e nítida, com a arma metálica e a poeira e névoa do campo de batalha a transmitirem qualidade de jogo AAA. Trabalho de câmara: A câmara tem uma ligeira oscilação de mão enquanto o jogador se move — primeiro avança lentamente, depois faz pequenos varrimentos para a esquerda e para a direita para observar, com um tremor subtil de recuo ao disparar, antes de finalmente continuar a avançar de forma constante.

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

Onde a MiniMax H3 API se encaixa em produção

De filmes de marca e dramas verticais a cortes de produto, visuais de jogos e edições precisas de filmagens existentes, a MiniMax H3 API abrange cada cenário através de um único pedido multimodal que devolve vídeo com áudio estéreo nativo.

Filmes de marca cinematográficos na MiniMax H3 API

Envie frames de storyboard e uma lista de planos numa única chamada para trailers em 1440p, spots TVC e campanhas de moda a 24 FPS. O áudio estéreo nativo acompanha cada resultado, para que as equipas de marca possam rever cortes finalizados.

Produção de dramas curtos verticais

A saída vertical 9:16 cobre cenas de drama com guião, de mistérios com figurinos a confrontos familiares, com o diálogo dobrado na mesma passagem. Estúdios que criam bibliotecas de dramas curtos obtêm ganchos de 15 segundos sem reservar atores nem palcos.

Montagem de planos com múltiplas referências

Se um plano precisar de um rosto e movimento específicos, até nove imagens, três vídeos e três clipes de áudio podem orientar uma única chamada. A identidade da personagem, o trabalho de câmara e o timbre vocal mantêm-se consistentes ao longo dos episódios.

Edição de filmagens existentes com a MiniMax H3 API

Precisa de uma alteração depois do facto? As filmagens existentes podem ser editadas por prompt: trocar um sujeito, substituir um fundo, ajustar a iluminação ou reescrever uma fala sem regravar um único frame.

Marketing de produto e comércio eletrónico

Fotografias de produto ganham movimento: uma imagem de referência transforma-se numa apresentação 360 degree, numa explicação de funcionalidades ou num corte para anúncios em redes sociais. Proporções de 21:9 a 9:16 permitem que um único conjunto de assets alimente todos os posicionamentos.

MiniMax H3 API para visuais de jogos e anime

A saída estilizada mantém a qualidade para game CG, character PV, aberturas de anime e demos de interface em que menus, elementos de HUD e sobreposições de texto têm de permanecer legíveis. As equipas de arte usam-na para validar conceitos antes da produção.

MiniMax H3 API em comparação com outros modelos multimodais de vídeo

Compare a MiniMax H3 API com os outros modelos de vídeo hospedados na Atlas Cloud e veja como as modalidades de entrada, os limites de referência, a duração, a resolução e a saída de áudio diferem realmente antes de optar por um endpoint.

ModeloModalidades de entradaMáximo de ficheiros de referênciaDuração da saídaResolução máximaÁudio nativo
MiniMax H3Texto, imagem, vídeo, áudio9 imagens, 3 vídeos, 3 clips de áudio, 12 ficheiros no total5s a 15s1440p a 24 FPS√ Áudio estéreo nativo em todas as saídas
Seedance 2.0 Reference-to-VideoTexto, imagem, vídeo, áudio9 imagens, 3 vídeos, 3 clips de áudioAté 15s720p√ Diálogo estéreo, efeitos e música gerados numa única passagem
Veo3.1 Reference-to-videoTexto e imagem3 imagens de referência4s, 6s ou 8s4K apenas com duração de 8s√ Diálogo, ambiência e efeitos sonoros alinhados à linha temporal
Wan-2.7 Reference-to-videoTexto, imagem, vídeo, áudio5 imagens ou clips de vídeo, mais um clip de voz2s a 15s1080p√ Música e efeitos gerados, ou controle a sincronização labial com o seu próprio áudio
Kling v3.0 Pro Image-to-VideoTexto e imagem-Até 15s1080p√ Diálogo multilingue com sincronização labial em cinco idiomas

Como Usar MiniMax H3 no Atlas Cloud

Comece em minutos — siga estes passos simples para integrar e implantar modelos pela plataforma da Atlas Cloud.

Crie uma Conta no Atlas Cloud

Cadastre-se em atlascloud.ai e conclua a verificação. Novos usuários recebem créditos gratuitos para explorar a plataforma e testar modelos.

Por Que Usar MiniMax H3 no Atlas Cloud

Combine modelos avançados de MiniMax H3 com a plataforma acelerada por GPU do Atlas Cloud, fornecendo desempenho, escalabilidade e experiência de desenvolvimento incomparáveis.

Desempenho e Flexibilidade

Baixa Latência:
Inferência otimizada por GPU para respostas em tempo real.

API Unificada:
Uma única integração para acessar MiniMax H3, GPT, Gemini e DeepSeek.

Preços Transparentes:
Faturamento por Token, suporta modo Serverless.

Empresa e Escala

Experiência do Desenvolvedor:
SDK, análise de dados, ferramentas de ajuste fino e modelos tudo em um.

Confiabilidade:
99.99% de disponibilidade, controle de permissões RBAC, logs de conformidade.

Segurança e Conformidade:
Certificação SOC 2 Type II, conformidade HIPAA, soberania de dados nos EUA.

MiniMax H3 API: respostas para desenvolvedores

A MiniMax H3 API oferece aos desenvolvedores acesso programático ao MiniMax H3, um modelo de vídeo multimodal aberto e de uso geral que trata texto, imagens, vídeo e áudio como um único contexto compartilhado. Em vez de separar geração, edição e referência em modelos de tarefa distintos, o H3 interpreta todo o conjunto de entrada e retorna um clipe finalizado com som. No Atlas Cloud, ele funciona por trás de uma única API key, com preços pay-as-you-go.

Filmes de marca, trailers, dramas curtos verticais, anúncios de produto e ecommerce, demonstrações de movimento para jogos e UI, além de animações estilizadas, estão todos dentro do seu alcance. Como o modelo lida com texto na tela, legendas e ativos de marca, equipes também o usam para validação de conceitos, prévias de storyboard e apresentações visuais antes de comprometer orçamento de produção.

Crie uma conta no Atlas Cloud, gere uma API key e envie um prompt com quaisquer arquivos de referência para o endpoint de geração de vídeo; depois, consulte o status até obter o resultado finalizado. Recomenda-se enviar mídia como URLs hospedadas em vez de uploads inline, pois o corpo da requisição é limitado a 64MB. Comece a criar hoje.

A cobrança é pay-as-you-go, então você paga por chamada em vez de comprar uma assinatura ou uma licença por usuário. O custo acompanha o que você realmente renderiza, ou seja, a resolução e a duração do clipe determinam o total de um lote. Consulte a página do modelo para ver a tarifa atual por geração antes de planejar execuções em grande volume.

Sim. Todo resultado do H3 é entregue com som em estéreo nativo, então diálogos, efeitos e ambiência chegam na mesma passada que a imagem. Forneça um clipe de áudio de referência e o modelo pode transferir esse timbre para um personagem, eliminando uma etapa separada de síntese de voz do pipeline.

Os clipes variam de 5 a 15 segundos a 24 FPS. No modo 1440p, o lado menor é renderizado com 1440 pixels para proporções entre 16:9 e 9:16; fora dessa faixa, o quadro mantém cerca de 3.7M pixels no total, por exemplo 2976 por 1248 em 21:9. Requisições text to video e omni reference aceitam 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16, enquanto requisições de primeiro e último quadro herdam a proporção da imagem de entrada.

Até nove imagens, três segmentos de vídeo e três clipes de áudio podem acompanhar um único prompt, com limite total de doze arquivos. Vídeo e áudio devem permanecer dentro de 15 segundos combinados cada, e o áudio deve acompanhar uma imagem ou um vídeo, em vez de chegar sozinho. Os prompts chegam a 7000 caracteres, deixando espaço para direção plano a plano que cubra câmera, atuação e som.

As entradas aceitas incluem vídeo H.264 e H.265, imagens JPG, JPEG, PNG, WEBP, HEIC e HEIF, e áudio WAV ou MP3, com AAC ou MP3 para a faixa de áudio dentro de um arquivo de vídeo. Os limites por arquivo são 50MB para vídeo, 30MB para imagens e 15MB para áudio. Como o corpo da requisição é limitado a 64MB, URLs hospedadas continuam sendo a opção mais segura para ativos pesados.

A edição é um dos seus modos principais. Envie um clipe de origem com instruções, e a MiniMax H3 API pode trocar personagens ou objetos, substituir fundos e iluminação, adicionar camadas de efeitos visuais e reescrever diálogos, mantendo estáveis as regiões não alteradas. Instruções compostas são tratadas em uma única requisição, então várias mudanças são aplicadas juntas, em vez de exigirem idas e vindas repetidas.

A maioria dos modelos de vídeo recebe um prompt mais uma imagem e retorna um clipe silencioso. O H3, por outro lado, consome um conjunto misto de referências, interpreta a intenção de personagem, movimento, câmera e som em todas elas e então retorna um clipe com áudio nativo. Se o seu pipeline hoje junta um modelo de vídeo, um modelo de voz e um editor, o H3 consolida essas etapas em uma única chamada.

Explorar Mais Séries

Seedance 2.0

A API do Seedance 2.0 oferece acesso de produção ao modelo de vídeo multimodal da ByteDance — entradas quadrimodais (texto, imagem, vídeo, áudio) e um sistema "Universal Reference" líder do setor que fixa a composição, o movimento da câmera e as ações dos personagens entre as cenas. Integre um controle de nível de diretor com uma única chamada de API, uma taxa fixa de $0,09/s, chave instantânea e sem lista de espera — respaldado por tempo de atividade e conformidade de nível corporativo. O Seedance 2.0 Native 4K já está no ar!

Ver Série

GPT Image 2

A API do GPT Image 2 dá aos desenvolvedores acesso ao mais recente modelo de imagem da OpenAI, o sucessor do GPT Image 1.5. Ele gera e edita imagens com renderização de texto precisa em caracteres latinos e CJK, além de uma forte composição para pôsteres, mockups e infográficos. Na Atlas Cloud, você o acessa através de uma API unificada junto a mais de 300 modelos, com créditos gratuitos, 99,99% de tempo de atividade e sem a necessidade de verificação de organização da OpenAI.

Ver Série

Seedream 5.0 Pro

A API do Seedream 5.0 Pro fornece aos desenvolvedores o modelo de edição de imagens controlável da ByteDance no Atlas Cloud. Ela posiciona as edições com precisão usando âncoras e coordenadas, separa as imagens em camadas editáveis, funde múltiplas referências e combina cores e materiais exatos, com texto multilíngue em 2K e 3K. No Atlas Cloud, você pode acessá-lo por meio de uma única chave!

Ver Série

Gemini Omni Flash

A Gemini Omni API traz para o seu stack o modelo multimodal de geração e edição de vídeo do Google DeepMind, apresentado no Google I/O 2026. O Gemini Omni funde o motor de raciocínio do Gemini com mídia generativa, aceitando qualquer combinação de texto, imagens, vídeo e áudio para produzir resultados consistentes e fundamentados em conhecimento. Refine os resultados por meio de conversas naturais — troque objetos, reescreva cenas e mude estilos, enquanto a física, os personagens e a continuidade permanecem intactos. A Atlas Cloud oferece toda a linha Gemini Omni Flash — texto para vídeo, imagem para vídeo com até 7 imagens de referência e referência para vídeo — por meio de uma única API unificada, com preços transparentes por segundo a partir de $0.112 e sem assinatura. Comece a construir hoje mesmo.

Ver Série

Grok Imagine

A Grok Imagine API oferece aos desenvolvedores a geração de imagens, vídeos e áudio da xAI em um único pacote. Ela produz imagens de até 2K com renderização de texto multilíngue, além de vídeos de até 15 segundos com áudio nativo sincronizado e edição baseada em referências. Na Atlas Cloud, uma única chave executa todos os modos do Grok Imagine, permitindo que você alterne entre imagem, vídeo e áudio sem configurações separadas, a partir de US$ 0,02 por imagem e US$ 0,05 por segundo.

Ver Série

Google

Os modelos criativos mais poderosos do Google estão todos disponíveis na Atlas Cloud. O Veo 3.1 oferece geração de vídeo cinematográfico, o Nano Banana 2 impulsiona a criação de imagens de alta fidelidade e o Gemini traz inteligência multimodal para cada fluxo de trabalho. Acesse o pacote completo de modelos do Google por meio de uma única API key com disponibilidade Day-0 e preços de pagamento conforme o uso (pay-as-you-go).

Ver Série

Seedance 2.0 Mini

O Seedance 2.0 Mini leva a geração de vídeo multimodal da ByteDance para fluxos de trabalho onde a velocidade e o custo são essenciais. Ele oferece os principais recursos do Seedance 2.0 com menor impacto — geração mais rápida, menor custo por vídeo e a mesma integração de API que você já usa. Para equipes que executam pipelines de alto volume ou prototipagem em escala, o Mini é a opção padrão prática.

Ver Série

ByteDance

Da geração de vídeo cinematográfico à criação de imagens de alta fidelidade, os modelos mais poderosos da ByteDance estão disponíveis no Atlas Cloud. Execute o Seedance e o Seedream em grande escala com os preços de inferência mais baixos e zero custos indiretos de infraestrutura.

Ver Série

Alibaba

O Atlas Cloud reúne toda a linha de modelos da Alibaba sob uma única API: Qwen para tarefas de linguagem e imagem, e Wan para geração de vídeo em até 1080p. Acesse cada modelo no formato pré-pago (pay-as-you-go) sem necessidade de assinaturas. A API da Alibaba está disponível por meio de uma única URL base usando seu cliente compatível com OpenAI existente.

Ver Série

OpenAI

O Atlas Cloud oferece acesso a toda a linha da API da OpenAI, desde o GPT Image 2 para geração de imagens até o Sora 2 para vídeo. Todos os modelos estão disponíveis na modalidade de pagamento conforme o uso, sem compromisso mensal. Integre-se trocando apenas uma URL base usando a API compatível com a OpenAI.

Ver Série

xAI

Construa pipelines completos de imagem e vídeo usando a xAI API no Atlas Cloud. Gere em 2K, edite com imagens de referência e anime imagens em clipes sincronizados com áudio.

Ver Série

Kwaivgi

A API da Kwaivgi com preço 15% abaixo do padrão. A Atlas Cloud oferece acesso Day-0 a novos lançamentos da Kling com preços de pagamento conforme o uso e sem limite de assentos. Uma conta, uma chave, todos os modelos da Kling do nível padrão ao nível master.

Ver Série

Uma API para toda a IA de mídia.

Explorar Todos os Modelos