
Três câmeras de cinema apinhadas em torno de um pequeno balcão de ramen noturno, vapor subindo pela lâmpada de calor
Um set, um número de cena na claquete, três câmeras diferentes apontadas para ele. Esse é o método inteiro deste artigo. Gerado com openai/gpt-image-2/text-to-image.
Quatro dias depois de o MiniMax H3 começar a liderar os leaderboards, as buscas por alternativas aumentaram. Isso não é uma contradição.
Dois tipos de pessoas estão digitando isso. Um grupo está irritado: a fila de renderização é longa, a fatura veio mais alta do que o orçamento que tinham na cabeça, e há um prazo na terça-feira. O outro grupo não está irritado. Eles gostam do H3. Eles só lembram que o modelo ao qual se comprometeram em fevereiro foi substituído em março, e novamente em abril, e novamente em junho. Eles não estão procurando um substituto. Eles estão procurando uma saída que não custe uma semana de engenharia.
Fui procurar a resposta do jeito normal, lendo leaderboards. Os leaderboards se recusaram a cooperar. Em 4 de agosto de 2026, existem três deles para vídeo, e cada um coroa um modelo diferente. Então parei de ler e comecei a rodar: um briefing único, sem edição, 5 segundos, direto nos três atuais #1s.
Principais conclusões
- Não existe uma única melhor alternativa ao MiniMax H3, porque existem três #1s. Em 4 de agosto de 2026: H3 lidera edição de vídeo com áudio (1.130 Elo), Gemini Omni Flash lidera texto-para-vídeo com áudio (1.245), Seedance 2.0 720p lidera imagem-para-vídeo com áudio (1.196).
- Precisa de imagem máxima e sem som? Gemini Omni Flash. Também lidera o quadro de texto-para-vídeo sem áudio com 1.324 Elo, e cobra menos por segundo que o H3.
- Animando um quadro fixo? Seedance 2.0 lidera esse quadro. Mas sua taxa de 720p acaba sendo mais alta por segundo que a taxa 2K do H3, então verifique "mudar para o mais barato" antes de se comprometer.
- Texto dentro do quadro é o teste que realmente os separa. No meu briefing idêntico, H3 e Gemini Omni Flash mantiveram o cartão de título limpo; Seedance 2.0 embaralhou as letras por um quadro antes de resolver. Colunas de Elo não podem te contar isso.
- O piso orçamentário é real, não imaginário: Veo 3.1 Lite ainda mantém uma cena coesa. Vá mais baixo nos boards públicos (LTX-2.3 Fast a $2,40/min, Elo 980) e o que você compra são reprises, não economia.
- Trocar deve custar quase nada. Por trás de uma API com uma chave e um corpo JSON, migrar é uma string. Isso, não o preço, é o que as pessoas que pesquisam esse termo realmente precisam.

O mesmo briefing de ramen de 5 segundos, palavra por palavra, nos três líderes atuais do leaderboard. Esquerda: MiniMax H3 em 2K. Meio: Gemini Omni Flash em 720p. Direita: Seedance 2.0 em 720p. O clipe completo de cada modelo está mais abaixo. Observe o último segundo, onde o cartão de título aparece.
Por que as Alternativas ao MiniMax H3 Quebraram Todas as Listas em Uma Semana
Aqui está o problema com a pergunta. Vídeo não é uma tarefa, e o Artificial Analysis não o pontua como uma. Ele executa três arenas separadas, e no dia em que li, cada uma tinha um vencedor diferente.
| Leaderboard (com áudio) | #1 | #2 | #3 | Onde o H3 está | Preço de API listado do líder |
|---|---|---|---|---|---|
| Edição de vídeo | MiniMax H3, 1.130 | Gemini Omni Flash, 1.122 | HappyHorse-1.0, 1.096 | 1º | $7,80 / min |
| Texto-para-vídeo | Gemini Omni Flash, 1.245 | MiniMax H3, 1.234 | Seedance 2.0 720p, 1.221 | 2º, 11 atrás | $6,00 / min |
| Imagem-para-vídeo | Seedance 2.0 720p, 1.196 | Gemini Omni Flash, 1.193 | MiniMax H3, 1.187 | 3º, 9 atrás | $9,07 / min |
Pontuações lidas em 4 de agosto de 2026 do Artificial Analysis Video Editing Leaderboard, do Text-to-Video Leaderboard e do Image-to-Video Leaderboard (Artificial Analysis, agosto de 2026). Todos são votos cegos crowdsourced, então os números flutuam com o volume de votos. O preço listado é o custo de um minuto de 1080p na API do próprio criador nas configurações padrão, que não é o que você paga por clipe finalizado em qualquer endpoint. Trate diferenças abaixo de cerca de 15 pontos como empate, não como veredito.
Olhe para a terceira linha novamente. Primeiro, segundo e terceiro estão separados por 9 pontos em um intervalo de confiança de 95% de aproximadamente mais ou menos 9. Isso é um empate triplo sendo impresso como classificação.
E essa rotatividade não é nova. Nos últimos seis meses, o primeiro lugar mudou de mãos aproximadamente a cada quatro a oito semanas: Kling 3.0, depois Veo 3.1, depois Seedance 2.0, depois Gemini Omni Flash, depois Wan 2.7, depois Seedance 2.5, agora H3. Ninguém lendo isso está escolhendo um modelo para os próximos dois anos. Eles estão escolhendo um para as próximas seis semanas e calculando silenciosamente o custo de mudar de ideia.
Então o Elo não pode resolver isso. Mas uma coisa pode, em cerca de cinco segundos de observação: sua cena tem texto?
Tipografia que sobrevive ao movimento é a falha mais comum nesta categoria. Letras oscilam, bordas borram, uma serifa ganha um membro no quadro 40. Também é binária de uma forma que a qualidade da imagem não é: ou a palavra está escrita corretamente em cada quadro ou a tomada está morta. Os próprios reels de amostra do H3 se apoiam exatamente nisso, o que indica onde ele acha que seu fosso está. Esses três clipes são a saída oficial do H3 da MiniMax, não minha, e eles definem o padrão que uma alternativa precisa superar.

Uma sequência de título noir completa: cartão após cartão de tipo latino e japonês, créditos, transições de painel. Cada letra mantém sua forma durante toda a duração. Este é o trabalho que decide se você pode trocar.

Tipo cinético de moda. As palavras ficam atrás e ao redor do assunto em vez de flutuar no topo, que é a diferença entre projetado e colado.

Um menu de jogo e um painel de equipamento. Rótulos permanecem no lugar, o destaque cai na linha em que deveria cair, então a câmera sai para a rua. Elementos de interface permanecem onde foram colocados.
A Lista de Alternativas ao MiniMax H3, Roteada pelo Trabalho que Você Grava
Pare de classificar modelos. Classifique filas. Aqui está a tabela de roteamento que eu realmente uso, com a taxa por segundo que cada endpoint cobra no Atlas Cloud, lida no mesmo dia que os leaderboards.
| A cena que você está fazendo | Roteie para | Por que | Taxa |
|---|---|---|---|
| Imagem máxima, sem necessidade de som | Gemini Omni Flash Texto-para-Vídeo | #1 no board de texto-para-vídeo sem áudio com 1.324 Elo, e #1 com áudio também | $0,125 / s, mínimo de 3s |
| Animando um quadro fixo | Seedance 2.0 Imagem-para-Vídeo | #1 imagem-para-vídeo com áudio, 1.196 | cobrado por token, cerca de $0,2419 / s em 720p |
| Alterando filmagens que você já gravou | MiniMax H3 Texto-para-Vídeo é a família, edição é o seu board | #1 edição de vídeo com áudio, 1.130 | $0,14 / s em 2K |
| O mesmo trabalho quando o H3 está ocupado | Gemini Omni Flash Edição de Vídeo | 1.122, oito pontos atrás. O fallback mais próximo disponível | $0,14 / s |
| Tipo na tela como um beat de título projetado | MiniMax H3, com Gemini Omni Flash como uma segunda opção real | Ambos seguraram o tipo no meu briefing; H3 tratou como cartão de título, Omni Flash como sobreposição | $0,14 / s e $0,125 / s |
| Travando um visual em 9 imagens e 3 clipes | MiniMax H3 Referência-para-Vídeo | Aceita até 9 imagens, 3 vídeos, 3 áudios em uma chamada | $0,14 / s |
| Rascunhos em lote antes de se comprometer | Seedance 2.0 Mini | Barato o suficiente para queimar em dez takes, tem tiers de super-resolução 1440p | $0,056 / s |
| Mais barato que ainda segura uma cena | Veo 3.1 Lite | 1.089 Elo com áudio a um preço de lista de $4,80/min | $0,05 / s |
| Mid-tier com desconto este mês | Kling V3.0 Turbo | 15% de desconto em agosto de 2026, era $0,112 | $0,095 / s |
| Irmão de pesos abertos pelo mesmo preço | HappyHorse-1.1 e Wan 2.7 | 1.147 e 1.158 em texto-para-vídeo, ambos nos boards | $0,14 / s e $0,10 / s |
| Você quer hospedar você mesmo | Pesos do MiniMax H3 | O único modelo de pesos abertos no top três de qualquer um dos três boards | grátis localmente, com ressalvas abaixo |

Um balcão de restaurante no pico do serviço, três tickets presos a um trilho e três tigelas prontas esperando sob a lâmpada de calor
Três tickets, três tigelas, uma mão alcançando a certa. Roteamento, não classificação. Gerado com openai/gpt-image-2/text-to-image.
Aqui está a parte que realmente importa, e não é a coluna de preço. Trocar de provedores de vídeo do jeito normal significa um novo cadastro, uma nova entidade de faturamento, um novo esquema de autenticação, uma nova forma de polling, um novo conjunto de strings de erro e uma nova fatura para reconciliar. Orçamente uma semana e uma tarde ruim. Por trás de uma única API com uma chave e um corpo JSON, a mesma migração é uma string:
python1MODELS = { 2 "baseline": "minimax/h3/text-to-video", 3 "max_picture": "google/gemini-omni-flash/text-to-video", 4 "from_still": "bytedance/seedance-2.0/image-to-video", 5 "drafts": "bytedance/seedance-2.0-mini/text-to-video", 6} 7# mesmo endpoint, mesma chave, mesmo loop de polling. Mude o valor, não o pipeline. 8
Essa é a resposta honesta para a segunda intenção de busca. Se você não está irritado com o H3 e só quer um backup, a coisa a comprar não é um modelo diferente. É a propriedade de que trocar de modelos é um diff de uma linha.
Um aviso sobre o fundo do mercado. Veo 3.1 Lite a $0,05 por segundo é um piso real, e ainda compõe uma cena assistível. Abaixo disso, o precipício de qualidade é acentuado e mensurável: no board público de texto-para-vídeo, LTX-2.3 Fast lista a $2,40 por minuto e pontua 980 Elo, cerca de 265 pontos abaixo do Gemini Omni Flash. Nessa diferença, você não está comprando um modelo barato, está comprando tentativas extras.
Passo 1: Defina a Linha de Base do MiniMax H3 que Toda Alternativa Tem que Superar
Um briefing, quatro problemas difíceis empilhados em 5 segundos: tipografia se movendo pelo quadro, uma fala que tem que combinar com a boca, física de líquido e vapor, e som gerado na mesma passagem. Três desses quatro são exatamente onde os três leaderboards discordam.
Cole isto textualmente. Não melhore para nenhum dos três modelos. Se você reescrever o prompt entre as execuções, não está mais comparando modelos, está comparando suas próprias edições.
text1Um chef de ramen bate uma tigela pronta em um balcão de aço em uma cozinha noturna apertada, vapor explodindo para cima. 2 3Cena 1: aproximação de ângulo baixo enquanto a tigela atinge o aço, caldo tremendo na borda, vapor pegando a lâmpada de calor suspensa. 4Cena 2: plano de tracking lateral enquanto ela limpa as mãos no avental, olha diretamente para a lente e diz: "Doze horas. Uma tigela." 5Cena 3: tilt rápido para cima enquanto um cartão de título cinético varre o quadro, tipo branco condensado lendo "MIDNIGHT BROTH / NO. 07", letras se encaixando na posição uma batida após a concha bater na panela. 6 7Energia de câmera na mão, lâmpada de calor de tungstênio contra luz de janela azul fria, aço escovado molhado, vapor volumétrico, profundidade de campo rasa, grão de 35mm. 8 9Áudio: tigela batendo no aço, caldo chapinhando, zumbido do exaustor, a fala dela clara por cima, uma batida de concha de madeira enquanto o título aparece. 10
Configurações no endpoint MiniMax H3 Texto-para-Vídeo:
- Resolução:
2K. A página do modelo documenta um tier 768P a $0,10 por segundo, mas o playground expõe apenas 2K, então planeje em torno de $0,14 por segundo e verifique sua própria fatura. - Proporção de Aspecto:
16:9. Este campo é obrigatório para execuções apenas com texto e rejeitaadaptive. Deixe-o não definido e a solicitação retorna 400. - Duração:
5, digitado explicitamente. Não deixe em branco. O schema documenta um padrão de 8, mas uma duração omitida já retornou como um arquivo de 5 segundos cobrado como 5 segundos, então declare o que você quer.
Custo desta execução: 5 x $0,14 = $0,70. Esse é exatamente o valor que o trabalho finalizado cobrou.

Playground do MiniMax H3 Texto-para-Vídeo no Atlas Cloud com o briefing de ramen preenchido e o clipe 2K finalizado no painel OUTPUT
MiniMax H3 Texto-para-Vídeo: briefing à esquerda, Resolução 2K, Proporção de Aspecto 16:9, clipe finalizado sendo reproduzido à direita. O controle deslizante de Duração ainda está no padrão de 8 nesta captura, por isso o botão Executar cita $1,12; arraste para 5 e a cotação acompanha.

A linha de base: MiniMax H3, 2560x1440, 24 fps, estéreo 32 kHz gerado na mesma passagem.
O que ele realmente fez com 5 segundos: três cenas distintas, em ordem. A tigela cai, o chef fala para a câmera, depois o cartão de título. "MIDNIGHT BROTH" entra como um cartão real com uma linha menor "NO. 07" abaixo, hierarquia correta, bordas limpas, sem oscilação enquanto o quadro se move. Esta é a barra.
Passo 2: Execute o Mesmo Briefing na Alternativa Mais Forte ao MiniMax H3
Gemini Omni Flash é o que vence o H3 diretamente em texto-para-vídeo, com áudio (1.245 a 1.234) e sem (1.324 a 1.306). Também cobra menos por segundo. No papel, esta é a troca.
Mesmas palavras. Sem acréscimos, sem "cinematográfico, 8k, obra-prima".
text1Um chef de ramen bate uma tigela pronta em um balcão de aço em uma cozinha noturna apertada, vapor explodindo para cima. 2 3Cena 1: aproximação de ângulo baixo enquanto a tigela atinge o aço, caldo tremendo na borda, vapor pegando a lâmpada de calor suspensa. 4Cena 2: plano de tracking lateral enquanto ela limpa as mãos no avental, olha diretamente para a lente e diz: "Doze horas. Uma tigela." 5Cena 3: tilt rápido para cima enquanto um cartão de título cinético varre o quadro, tipo branco condensado lendo "MIDNIGHT BROTH / NO. 07", letras se encaixando na posição uma batida após a concha bater na panela. 6 7Energia de câmera na mão, lâmpada de calor de tungstênio contra luz de janela azul fria, aço escovado molhado, vapor volumétrico, profundidade de campo rasa, grão de 35mm. 8 9Áudio: tigela batendo no aço, caldo chapinhando, zumbido do exaustor, a fala dela clara por cima, uma batida de concha de madeira enquanto o título aparece. 10
Configurações no endpoint Gemini Omni Flash Texto-para-Vídeo:
- Duração:
5. Faixa é de 3 a 10, e o faturamento tem um piso de 3 segundos. - Proporção de Aspecto:
16:9. A única outra opção é9:16. - Resolução:
720p. Essa é a enumeração completa neste endpoint, então não há configuração mais alta para alcançar. - Nível de Pensamento:
default. Mude parahighapenas se um prompt complexo estiver voltando confuso; ele troca latência por qualidade. - Seed: deixe em branco para uma seed aleatória, ou fixe um inteiro se quiser iterar em uma tomada.
Custo desta execução: max(3, 5) x $0,125 = $0,625, cobrado ao centavo. Isso é 11% abaixo da linha de base do H3.

Playground do Gemini Omni Flash Texto-para-Vídeo no Atlas Cloud executando o mesmo briefing de ramen em 720p com o resultado em OUTPUT
Gemini Omni Flash Texto-para-Vídeo: briefing idêntico, Duração 5, 720p, Nível de Pensamento no padrão, Executar cotando $0,625.

Gemini Omni Flash nos mesmos 5 segundos, 1280x720, estéreo 48 kHz.
Ele também passou no teste de tipo, que foi a surpresa genuína. "MIDNIGHT BROTH / NO. 07" renderiza nítido e permanece nítido. Onde difere é na direção: trata as palavras como uma sobreposição que vive em várias cenas, em vez de um cartão de título que chega em uma batida, e gasta mais dos 5 segundos cortando do que o H3. Mais barato, mais nítido nas palavras do que o esperado, mais solto na lista de cenas. Se o seu trabalho é embalagem onde o título é um momento projetado, essa diferença importa. Se é social onde as palavras só precisam ser legíveis, não importa.
Passo 3: Experimente o Líder de Imagem-para-Vídeo como uma Alternativa ao MiniMax H3
Seedance 2.0 domina o board de imagem-para-vídeo, o que o torna a alternativa mais recomendada em toda esta categoria. Seu endpoint de texto-para-vídeo executa a mesma família de modelos, então é o terceiro assento justo para um briefing idêntico.
text1Um chef de ramen bate uma tigela pronta em um balcão de aço em uma cozinha noturna apertada, vapor explodindo para cima. 2 3Cena 1: aproximação de ângulo baixo enquanto a tigela atinge o aço, caldo tremendo na borda, vapor pegando a lâmpada de calor suspensa. 4Cena 2: plano de tracking lateral enquanto ela limpa as mãos no avental, olha diretamente para a lente e diz: "Doze horas. Uma tigela." 5Cena 3: tilt rápido para cima enquanto um cartão de título cinético varre o quadro, tipo branco condensado lendo "MIDNIGHT BROTH / NO. 07", letras se encaixando na posição uma batida após a concha bater na panela. 6 7Energia de câmera na mão, lâmpada de calor de tungstênio contra luz de janela azul fria, aço escovado molhado, vapor volumétrico, profundidade de campo rasa, grão de 35mm. 8 9Áudio: tigela batendo no aço, caldo chapinhando, zumbido do exaustor, a fala dela clara por cima, uma batida de concha de madeira enquanto o título aparece. 10
Configurações no endpoint Seedance 2.0 Texto-para-Vídeo:
- Duração: mude de
Autopara5. Deixar em Auto entrega a duração ao modelo, e como este endpoint cobra por pixels x segundos, também entrega sua conta. - Resolução:
720p. - Proporção de Aspecto:
16:9, nãoAuto, para corresponder às outras duas execuções. - Gerar Áudio: ligado. O briefing pede som, e este é o interruptor que o produz.
- Modo de Bitrate:
standard. Marca d'água: desligado.
Agora o número que quebra a premissa de todo este termo de busca. Seedance 2.0 não cobra uma taxa fixa por segundo. A página do modelo afirma claramente: "Para cada segundo de vídeo 720p que você gerou, será cobrado $0,2419/segundo. Sua solicitação custará $0,0112 por 1000 tokens. O número de tokens é dado por (altura do vídeo de saída x largura do vídeo de saída x (duração de entrada + duração de saída) x 24) / 1024." Minha execução de 5 segundos em 720p cobrou $1,21968. Isso é mais do que a linha de base do H3 em 2K, no endpoint que a maioria das pessoas é instruída a trocar para economizar. A própria coluna de preço do leaderboard concorda, listando Seedance 2.0 720p a $9,07 por minuto contra $7,80 do H3.

Playground do Seedance 2.0 Texto-para-Vídeo no Atlas Cloud com Duração definida para 5, Gerar Áudio ligado, e o clipe finalizado em OUTPUT
Seedance 2.0 Texto-para-Vídeo: mesmo briefing, Duração 5, 720p, 16:9, Gerar Áudio ligado, Marca d'água desligada. A fórmula de token está impressa abaixo do painel OUTPUT, que é onde o número real vive.

Seedance 2.0 nos mesmos 5 segundos, 1280x720, estéreo 44,1 kHz.
E aqui é onde a linha divisória apareceu. A imagem é linda, o vapor é o melhor dos três, e então o cartão de título chega e as letras se embaralham. Avance quadro a quadro no último segundo: um quadro lê como glifos quebrados, aproximadamente "MC. VNNUT10", antes do próximo quadro se resolver em "MIDNIGHT BROTH / NO. 07". Congele no quadro errado e você tem uma tomada inutilizável. Também gastou a maior parte de seus 5 segundos no chef parado em vez de executar as três cenas que o briefing pedia.
Três execuções, um conjunto de palavras, $2,54 total. Dois modelos seguraram o tipo, um quebrou, e essa resposta teria sido invisível em qualquer uma das três colunas de Elo.
Três variações que valem a pena executar antes de decidir qualquer coisa. Troque a Proporção de Aspecto para 9:16 e execute novamente o mesmo briefing: trabalho vertical de pôster com tipo é onde o tier barato cai mais rápido, e é uma maneira rápida de encontrar seu próprio piso. Segundo, faça rascunhos no Seedance 2.0 Mini a $0,056 por segundo até que o bloqueio esteja certo, depois gaste a taxa boa apenas no take final. Terceiro, se o visual importa mais do que as palavras, mude para um endpoint de referência-para-vídeo e alimente com imagens em vez de adjetivos; H3 aceita até 9 imagens, 3 vídeos e 3 clipes de áudio em uma chamada, e o Gemini Omni Flash aceita até 10 imagens de referência em seu próprio endpoint de referência.

Vertical, em formato de pôster, orientado por tipo, das próprias amostras H3 da MiniMax. Este é o tier onde "alternativa mais barata" deixa de ser uma frase que você pode completar.
O que as Alternativas ao MiniMax H3 Realmente Custam por Clipe Finalizado
Preços de leaderboard por minuto são a taxa de lista 1080p do próprio criador. O que você paga é a taxa do endpoint vezes os segundos que você pediu. Aqui está o mesmo clipe de 5 segundos em toda a lista, com taxas lidas em 4 de agosto de 2026.
| Endpoint | Taxa | Um clipe de 5 segundos | Áudio nativo |
|---|---|---|---|
| MiniMax H3 Texto-para-Vídeo, 2K | $0,14 / s | $0,70 | sim, estéreo |
| Gemini Omni Flash Texto-para-Vídeo, 720p | $0,125 / s, mínimo de 3s | $0,625 | sim |
| Gemini Omni Flash Edição de Vídeo | $0,14 / s | $0,70 | sim |
| Seedance 2.0 Texto-para-Vídeo, 720p | cobrado por token, $0,2419 / s | $1,22, cobrado | sim, comutável |
| Seedance 2.0 Fast | $0,09 / s | $0,45 | sim |
| Seedance 2.0 Mini | $0,056 / s | $0,28 | sim |
| Wan 2.7 Texto-para-Vídeo | $0,10 / s | $0,50 | sim |
| Kling V3.0 Turbo, 15% de desconto | $0,095 / s | $0,475 | sim |
| HappyHorse-1.1 Texto-para-Vídeo | $0,14 / s | $0,70 | sim |
| Veo 3.1 Lite Texto-para-Vídeo | $0,05 / s | $0,25 | sim |
Agora multiplique cada linha pela coluna que ninguém imprime: tentativas por take utilizável. Um clipe de $0,25 que você executa novamente quatro vezes custa $1,00 e uma hora da sua noite. O clipe de $0,70 que acerta na segunda tentativa custa $1,40 e você já está editando. O único número que importa é o custo por take final, e você não pode lê-lo em um leaderboard. Você só pode obtê-lo executando seu próprio briefing duas vezes em dois endpoints, que é para o que servem os Passos 1 a 3.
Dois detalhes de faturamento que vale a pena saber antes de montar um orçamento. No Seedance 2.0, uma entrada de vídeo reduz a taxa de token de $0,0112 para $0,00688 por 1000 tokens, o que equivale a cerca de $0,1486 por segundo em 720p, então editar filmagens existentes é materialmente mais barato lá do que gerar do zero. E em qualquer endpoint, faça polling do trabalho finalizado e depois verifique novamente o ID de previsão. O campo de preço muitas vezes ainda está vazio no momento em que um trabalho muda para concluído.
A outra maneira de responder "quanto custa uma alternativa" é parar de pagar por segundo. H3 é o único modelo de pesos abertos no top três de qualquer um desses boards, e os pesos estão disponíveis. Esse caminho é real e tem uma forma específica.
| Auto-hospedagem H3 | API |
|---|---|
| Borda curta de 768px, limitado a 768x1344 | 2K |
| Conjunto mínimo de arquivos de tarefa única em torno de 42,5 GB; cerca de 498,6 GB para o repositório completo | nada para baixar |
| Placas de consumidor executam com descarregamento pesado, em tempos de renderização de outra liga | segundos de fila |
| Apenas o modelo base; a passagem 2K é uma etapa separada | 2K sai da mesma chamada |
| Licença comunitária, efetiva em 2 de agosto de 2026 | termos comerciais do seu provedor |
| Sua UI deve exibir "MiniMax H3" | não é problema seu |
Repositório e licença: MiniMaxAI/MiniMax-H3 no Hugging Face (Hugging Face, agosto de 2026). A tela nativa de 768px e a integração ComfyUI desde o dia zero estão documentadas nas próprias notas de versão do ComfyUI.
Leia a licença antes de planejar uma implantação nela. A licença comunitária efetiva em 2 de agosto de 2026 lista Territórios Excluídos na seção I.5: UE, Reino Unido, República da Coreia e Estados Unidos. A seção V.4 estende essa restrição às saídas, não apenas aos pesos. Acima de $20M em receita anual requer autorização por escrito da MiniMax. A seção IV.2 exige que você exiba "MiniMax H3" em sua interface, e a seção V.3 proíbe o uso de saídas para treinar modelos concorrentes. O repositório também inclui um arquivo de perguntas e respostas descrevendo o escopo do território como ainda não coberto em vez de permanentemente excluído, com uma rota de aplicação. Separadamente, e isso se aplica a todos os modelos neste artigo: nenhuma licença de modelo concede a você direitos sobre o rosto de alguém, marca registrada de alguém ou música de alguém. Essa autorização é sempre sua.
Perguntas Frequentes
Qual é a melhor alternativa ao MiniMax H3 agora?
Depende do trabalho, porque três modelos diferentes ocupam três lugares de #1. Imagem máxima sem som: Gemini Omni Flash, 1.324 Elo no board de texto-para-vídeo sem áudio. Animando uma imagem parada: Seedance 2.0 720p, 1.196 em imagem-para-vídeo. Alterando filmagens que você já tem: o próprio H3 ainda é #1 com 1.130, e o fallback mais próximo é o Gemini Omni Flash Edição de Vídeo, oito pontos atrás. Todos lidos em 4 de agosto de 2026.
Existe uma alternativa mais barata ao MiniMax H3 que ainda gere áudio nativo?
Sim, mas verifique o endpoint em vez do título. Gemini Omni Flash texto-para-vídeo a $0,125 por segundo realmente subcotou o $0,14 do H3, com áudio na mesma passagem. Seedance 2.0 não: sua cobrança por token em 720p equivale a cerca de $0,2419 por segundo, mais alto que o H3 em 2K. Se você precisa de mais barato que ambos e pode aceitar uma queda de qualidade, Seedance 2.0 Mini a $0,056 e Veo 3.1 Lite a $0,05 ainda produzem som.
Qual alternativa ao MiniMax H3 é melhor para imagem-para-vídeo?
Seedance 2.0 720p lidera com 1.196, depois Gemini Omni Flash com 1.193, depois H3 com 1.187. Nove pontos com intervalos de confiança de cerca de mais ou menos 9 é um empate, então escolha pelo comportamento em vez da classificação: execute seu próprio quadro de origem nos dois primeiros e veja qual respeita seu primeiro quadro em vez de redesenhá-lo. Itere no Seedance 2.0 Mini primeiro, depois gaste a taxa real no take que você mantiver.
As alternativas ao MiniMax H3 renderizam texto na tela de forma tão confiável?
Algumas sim. No briefing idêntico acima, H3 e Gemini Omni Flash renderizaram "MIDNIGHT BROTH / NO. 07" de forma limpa e mantiveram limpo durante o movimento. Seedance 2.0 produziu um quadro de glifos embaralhados antes de resolver, o que é suficiente para matar uma tomada. Teste você mesmo com a Cena 3 do briefing e avance quadro a quadro: o tipo mantém seu peso? As bordas sobrevivem à transição? Uma letra deforma quando a câmera se move? Essa única verificação diz mais sobre se você pode trocar do que qualquer coluna de Elo, porque para embalagem, motion de UI e trabalho de videoclipe é passar ou falhar, não melhor ou pior.
Posso auto-hospedar o MiniMax H3 em vez de trocar para uma alternativa?
Tecnicamente sim, e é o único modelo no top três desses boards onde você pode. Três coisas para verificar primeiro. Inferência local é uma borda curta de 768px, não 2K, porque a passagem 2K é uma etapa separada. O conjunto mínimo de arquivos de tarefa única é de cerca de 42,5 GB, com aproximadamente 498,6 GB para o repositório completo. E a licença comunitária atualmente exclui a UE, o Reino Unido, a República da Coreia e os Estados Unidos, com uma rota de aplicação documentada em vez de uma barreira permanente.
Quão difícil é trocar entre MiniMax H3 e uma alternativa?
Depende inteiramente de como você integrou. Contas separadas significam cadastros separados, entidades de faturamento, esquemas de autenticação, formas de polling e tratamento de erros por fornecedor, e isso é uma semana de trabalho que você vai ressentir. Por trás de uma API, é uma string de ID de modelo e nada mais se move, e é por isso que vale a pena folhear a lista completa de modelos antes de precisar. Configure o backup enquanto as coisas estão calmas. O objetivo de um segundo modelo é que ele já funcione no dia em que o primeiro não funciona.






