Fiquei dez minutos encarando três rankings do Artificial Analysis tentando descobrir quem realmente venceu.
Texto-para-vídeo: Gemini Omni Flash por 5 pontos. Imagem-para-vídeo: Gemini por 2 pontos. Edição de vídeo: MiniMax H3 por 9 pontos.
Aí olhei para a coluna de intervalo de confiança. Mais ou menos 7. Mais ou menos 9. Mais ou menos 10.
Três rankings, três diferenças — todas dentro das próprias barras de erro. Em votação cega, esses dois modelos são o mesmo modelo.
Então fechei os rankings e abri os menus suspensos. Essa diferença não é de 5 pontos. Essa diferença é de um patamar de resolução inteiro.
Principais conclusões
- Todas as três diferenças do Artificial Analysis (+5, +2, +9, captura feita em 6 de agosto de 2026) estão dentro dos intervalos de confiança de ±7 a ±10. Em qualidade bruta, é um empate, não uma vitória.
- O H3 gera em 2K, até 15 segundos e seis proporções de tela. A API do Gemini Omni Flash limita a 720p, 10 segundos e duas proporções de tela. Esses são valores de enumeração, não opiniões.
- O H3 aceita áudio como entrada. O Gemini não. O Gemini tem
seedethinking_level. O H3 não tem nenhum. - O Gemini tem um endpoint dedicado
video-editque modifica seu clipe de origem. O caminho de revisão do H3 éreference-to-video, que regenera usando seu clipe como referência. Não são a mesma operação, e a segunda rodada mostra isso. - Apenas um dos dois tem pesos disponíveis para download, e não é o do Google.

Primeira rodada do teste MiniMax H3 vs Gemini Omni Flash, ambos os modelos animando o mesmo primeiro quadro, mostrados lado a lado
Primeira rodada: mesmo primeiro quadro, mesmo prompt, mesma duração. À esquerda MiniMax H3 em 2K, à direita Gemini Omni Flash em 720p. Exibido aqui como um GIF silencioso; ambos os arquivos gerados possuem áudio nativo e são incorporados como vídeo reproduzível mais abaixo. Esse é o problema. Ambos são bons.
Por que a diferença no ranking entre MiniMax H3 e Gemini Omni Flash está sendo interpretada errada
Quase toda postagem sobre MiniMax H3 vs Gemini Omni Flash que você encontrar cita um ranking e um preço. Ambos os hábitos produzem a resposta errada.
Aqui estão os três rankings do Artificial Analysis, com a coluna que todo mundo ignora.
Tabela A: MiniMax H3 vs Gemini Omni Flash em três rankings do Artificial Analysis (com áudio), captura de 6 de agosto de 2026
| Ranking | Gemini Omni Flash | MiniMax H3 | Diferença | Dentro das barras de erro? |
|---|---|---|---|---|
| Texto-para-vídeo | 1.243 (#1) ±7, 11.842 votos | 1.238 (#2) ±9, 6.830 votos | Gemini +5 | Sim |
| Imagem-para-vídeo | 1.191 (#2) ±9, 6.506 votos | 1.189 (#3) ±10, 5.545 votos | Gemini +2 | Sim |
| Edição de vídeo | 1.123 (#2) ±5, 11.706 votos | 1.132 (#1) ±6, 9.128 votos | H3 +9 | Sim, por pouco |
O MiniMax H3 é um dos mais de 30 modelos de vídeo que você pode executar lado a lado com o mesmo prompt na comparação de modelos da Atlas Cloud — com o custo por segundo mostrado antes de você gerar.
Pontuações Elo do Artificial Analysis Video Arena (Artificial Analysis, agosto de 2026). A liderança em imagem-para-vídeo é do Dreamina Seedance 2.0 720p com 1.197, então nenhum desses dois detém essa coroa. Essas são pontuações rotativas de votação popular e mudam, exatamente por isso uma diferença de 5 pontos não é um veredito.
Uma liderança de 5 pontos com um intervalo de ±9 significa que a classificação pode inverter na próxima semana apenas com ruído de votação. Isso não é "Gemini é melhor em texto-para-vídeo." Isso é um cara ou coroa com um placar anexado.
Mais três coisas que as pessoas entendem errado:
A coluna de dólar por minuto não é o que você paga. O Artificial Analysis lista US$ 6,00/min para o Gemini e US$ 7,80/min para o H3. Essa coluna normaliza para o custo de um minuto de 1080p nas configurações padrão. O Gemini Omni Flash não consegue produzir 1080p de forma alguma. Portanto, o número é uma estimativa modelada, não uma fatura. Compare os entregáveis finais, não os segundos.
Um ranking não é o modelo. O H3 fica em segundo, terceiro e primeiro nos três rankings. O Gemini fica em primeiro, segundo e segundo. Cite apenas um deles e você pode provar o que já acreditava.
"Omni" não significa "come qualquer coisa." É um bom nome e enganoso. Um desses dois aceita arquivos de áudio como entrada. Não é o que tem "omni" no nome.
A ficha técnica do MiniMax H3 vs Gemini Omni Flash que ninguém publica
Se as pontuações Elo não conseguem separá-los, as tabelas de restrições conseguem. Extraí os esquemas de entrada ao vivo de ambos os modelos, sem confiar em nenhum post de lançamento, e as diferenças não são sutis.
Tabela B: Restrições fixas do MiniMax H3 vs Gemini Omni Flash, lidas dos esquemas de API ao vivo em 6 de agosto de 2026
| Restrição | MiniMax H3 | Gemini Omni Flash |
|---|---|---|
| Resolução | 768P ou 2K | 720p, e esse é o único valor na enumeração |
| Duração | 4 a 15 segundos | 3 a 10 segundos |
| Proporções de tela | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | Apenas 16:9 e 9:16 |
| Caminho de revisão | reference-to-video (regenera com referências) | Endpoint dedicado video-edit (modifica sua fonte) |
| Controle do último quadro | end_image suportado | Não disponível |
| Limites de referência | ≤9 imagens, ≤3 vídeos, ≤3 áudios, 12 arquivos no total | 1 a 10 imagens |
| Entrada de áudio | Sim | Não |
| Reproducibilidade de seed | Não | Sim |
| thinking_level | Não | Sim (padrão / alto / baixo) |
| Pesos abertos | Sim, no Hugging Face | Não |
Leia essa tabela honestamente e o Gemini vence em três linhas de forma clara. Seeds reproduzíveis importam se você está construindo um pipeline que precisa renderizar o mesmo quadro duas vezes. Um endpoint real de video-edit é uma ferramenta genuinamente diferente da regeneração condicionada por referência. E thinking_level oferece um dial de qualidade que o H3 simplesmente não expõe.
O H3 vence em cinco linhas, e são as linhas que decidem se você pode entregar o arquivo que o cliente pediu.
Executei tudo abaixo na Atlas Cloud porque ambos os modelos estão por trás do mesmo endpoint /api/v1/model/generateVideo lá, o que significou um loop de polling e um cabeçalho de autenticação para todo o teste. Trocar de modelo foi uma mudança na string model. Esse detalhe é a razão inteira pela qual "use ambos" é uma resposta realista em vez de uma desculpa.
Tabela C: Quanto custa cada endpoint neste teste, verificado na lista de preços ao vivo em 6 de agosto de 2026
| Endpoint | Preço | Este clipe de 10 segundos do teste |
|---|---|---|
| openai/gpt-image-2/text-to-image | US$ 0,009 / imagem | US$ 0,01 |
| minimax/h3/image-to-video | US$ 0,14 / s | US$ 1,40 |
| minimax/h3/reference-to-video | US$ 0,14 / s | US$ 1,40 |
| google/gemini-omni-flash/image-to-video | US$ 0,13 / s | US$ 1,30 |
| google/gemini-omni-flash/video-edit | US$ 0,14 / s | US$ 1,40 |
| google/gemini-omni-flash/text-to-video | US$ 0,125 / s | não usado |
| minimax/h3/text-to-video | US$ 0,14 / s | não usado |
Nenhum dos modelos oferece desconto neste mês. O Gemini também expõe um nível de desenvolvedor mais barato (US$ 0,112/s para texto-para-vídeo e imagem-para-vídeo, US$ 0,12/s para referência-para-vídeo); o H3 não tem nível equivalente.
A linha dos pesos abertos que o Gemini Omni Flash não pode cruzar. Os pesos do H3 estão publicados no Hugging Face (MiniMax, agosto de 2026): um Transformer Omni denso de 33B de fluxo único, além do codificador de texto Qwen3-VL-32B, um VAE visual e um VAE de áudio. Duas ressalvas importam mais que o tamanho do download. Primeiro, o que você auto-hospeda roda com lado curto de 768 pixels; o estágio de pré-processamento Context-IR e o módulo Regenerate-2K não estão na versão, e a saída 2K vem desses dois. Segundo, a licença comunitária atualmente não cobre a UE, o Reino Unido, a Coreia do Sul ou os Estados Unidos, e há um formulário de inscrição separado para esses territórios. Leia antes de construir um produto em cima disso. O Gemini Omni Flash não tem conversa equivalente, porque não há arquivo para baixar.
Essa posição de pesos abertos, combinada com preços agressivos, é toda a história estratégica do lançamento (South China Morning Post, agosto de 2026).
Execute você mesmo o teste de revisão do MiniMax H3 vs Gemini Omni Flash
Aqui está a parte que ninguém executou. Todo mundo faz benchmark da primeira geração. Ninguém faz benchmark da segunda.
Trabalho real não é um prompt. Trabalho real é um clipe que você já gosta, mais um cliente que responde "amei, a placa pode dizer 24H e o avental dela pode ser vermelho?" Essa única frase é onde esses dois modelos param de ser intercambiáveis, e acontece de ser exatamente a tarefa que o ranking de edição de vídeo mede.
A cena é deliberadamente cruel: uma barraca de macarrão encharcada de chuva à noite, a vendedora falando diretamente para a lente, uma placa pintada à mão com palavras legíveis atrás dela, vapor do caldo, chuva no toldo. Um quadro que estressa sincronização labial, estabilidade de texto na tela, movimento fluido e áudio ambiente em camadas de uma só vez.
Ambos os modelos recebem o mesmo primeiro quadro, o mesmo prompt e a mesma nota de revisão. Cada execução abaixo tem 10 segundos, que é o teto do Gemini Omni Flash e está bem dentro do limite do H3.
Passo 1: Fixar o primeiro quadro com GPT Image 2
Ambos os modelos devem começar da mesma imagem, caso contrário a primeira rodada mede sorte na composição, não o modelo. Abra o playground do GPT Image 2, defina qualidade como alta e proporção como 16:9, e cole isto:
Plain1Cena noturna fotorrealista de barraca de comida de rua na chuva forte, filmada com lente 35mm em f/2.0. Uma mulher na casa dos trinta, em um avental de lona índigo, está atrás de um balcão de macarrão fumegante, olhando diretamente para a lente, no meio de uma frase. Atrás dela, uma placa de lata pintada à mão com luz âmbar quente brilha com as palavras "OPEN LATE" em letras maiúsculas limpas, sem serifa e em negrito. A chuva escorre pela luz de sódio da rua, o vapor sobe da panela de caldo, o asfalto molhado reflete néon vermelho e verde do outro lado da rua. Profundidade de campo rasa, iluminação prática apenas, leve halo na lente, textura natural da pele, nenhum texto em nenhum outro lugar do quadro. 16:9.

Playground do GPT Image 2 na Atlas Cloud com o prompt da barraca de macarrão à esquerda e o primeiro quadro gerado no painel de saída
GPT Image 2 na Atlas Cloud: o prompt à esquerda, o primeiro quadro compartilhado em OUTPUT. Custo desta etapa , US$ 0,009.

O primeiro quadro gerado: uma mulher de avental índigo atrás de um balcão de macarrão fumegante à noite na chuva, com uma placa pintada à mão "OPEN LATE" brilhando atrás dela
A única entrada que ambos os modelos receberam. Observe as duas coisas que a revisão vai mirar: a placa "OPEN LATE" e o avental índigo. Gerado com openai/gpt-image-2/text-to-image.
Passo 2: Primeira rodada no MiniMax H3
Vá para o playground do MiniMax H3, escolha a tarefa image-to-video, envie o quadro do Passo 1 e defina resolution como 2K, duration como 10, ratio como adaptive (a enumeração de imagem-para-vídeo oferece apenas adaptive). Prompt:
Plain1A vendedora olha para a lente e diz, com uma voz cansada e calorosa: "O caldo está fervendo desde as quatro da manhã. Sente-se, ainda está chovendo." Ela levanta a concha enquanto fala. O vapor sobe pelo quadro. A chuva continua caindo no toldo atrás dela. A câmera fica parada, sem zoom, sem panorâmica. Áudio ambiente: chuva na lona, caldo fervendo, trânsito distante, a voz dela próxima e seca.

Playground de imagem-para-vídeo do MiniMax H3 na Atlas Cloud com resolução 2K selecionada e o clipe finalizado sendo reproduzido no painel de saída
Imagem-para-vídeo do MiniMax H3 na Atlas Cloud: 2K selecionado, o clipe finalizado em OUTPUT. Esta captura rodou no padrão de 8 segundos do playground e custou US$ 1,12; a versão de 10 segundos usada na comparação está incorporada abaixo e custou US$ 1,40.
MiniMax H3, primeira rodada, 2K, 10 segundos. Ligue o som: o diálogo, a chuva e o caldo são todos gerados na mesma passagem, não sobrepostos depois.
Passo 3: Primeira rodada no Gemini Omni Flash, mesmo quadro, mesmas palavras
Abra o playground do Gemini Omni Flash, escolha image-to-video, envie o mesmo quadro do Passo 1 e cole o prompt do Passo 2 sem alterar um caractere. Configurações: resolution 720p, duration 10, aspect_ratio 16:9, thinking_level default, seed -1.
Duas coisas a observar enquanto você está nesse formulário, porque são o artigo em miniatura. O menu suspenso resolution contém exatamente uma opção. O campo duration para em 10. Não escolhi 720p em vez de algo melhor; não há nada mais para escolher.
Uma nota sobre o que está faltando aqui: não consegui capturar uma captura de tela do playground com a execução concluída para nenhuma das etapas do Gemini. O ambiente de staging onde tiro capturas de tela retornou 403 PERMISSION_DENIED do lado do Google em todas as três tentativas, então as únicas capturas do Gemini que tenho mostram um painel OUTPUT com falha e não vou disfarçar uma como uma execução bem-sucedida. Os clipes abaixo são reais, gerados através da API de produção com as configurações listadas acima. As duas etapas do H3 capturaram limpo e essas capturas de tela são genuínas.
Gemini Omni Flash, primeira rodada, 720p, 10 segundos, entradas idênticas. Reproduza este logo após o clipe do H3 acima e avalie o áudio por si mesmo.
Passo 4: Segunda rodada, envie a revisão para o Gemini Omni Flash
Esta é a rodada que importa. Mude para a tarefa video-edit na mesma página do modelo Gemini, envie o clipe que o próprio Gemini produziu no Passo 3 como entrada video, defina resolution 720p e thinking_level high (uma instrução de edição em duas partes é exatamente o caso complexo para o qual esse dial serve). Cole esta nota exatamente como um cliente a enviaria:
Plain1Mantenha este plano exato: mesma posição de câmera, mesma mulher, mesmo rosto, mesma chuva, mesma iluminação, mesmo áudio. Altere a placa pintada à mão para que leia "OPEN 24H" em vez de "OPEN LATE", no mesmo estilo pintado e no mesmo brilho âmbar. Mude o avental dela de azul índigo para vermelho carmesim. Não mude mais nada no quadro.
Gemini Omni Flash após a nota de revisão. Observe a placa, depois o avental, e depois verifique se algo mais se moveu.
Passo 5: Segunda rodada, envie a revisão idêntica para o MiniMax H3
Aqui está a diferença estrutural honesta, e você deve saber antes de ler o resultado. O H3 não tem endpoint video-edit. Seu caminho de revisão é reference-to-video: você entrega o clipe original como referência e ele gera um novo vídeo condicionado a essa referência. Não está editando seu arquivo. Está criando um novo que deve se parecer com o seu.
Na página do MiniMax H3, escolha a tarefa reference-to-video, adicione o clipe que o H3 produziu no Passo 2 a refers como uma referência de vídeo, depois defina resolution 2K, duration 10, ratio adaptive. Cole o prompt do Passo 4 sem nenhuma edição.
Esta etapa também não tem captura de tela do playground, por um motivo diferente e mais chato: o navegador headless que uso para capturar travou três vezes no uploader de referência ao carregar uma referência de vídeo. A execução em si passou pela API sem reclamações.
MiniMax H3 após a nota de revisão idêntica, via reference-to-video em 2K.

Lado a lado da segunda rodada: o resultado do video-edit do Gemini Omni Flash ao lado do resultado do reference-to-video do MiniMax H3, ambos a partir da mesma nota de revisão
Segunda rodada lado a lado, GIF silencioso. À esquerda Gemini Omni Flash via video-edit, à direita MiniMax H3 via reference-to-video. Ambos tinham a mesma frase para trabalhar.
O que realmente aconteceu na segunda rodada. Eu esperava que o H3 perdesse esta. A regeneração condicionada por referência é um instrumento mais contundente do que um endpoint de edição real, e "regenerar o clipe inteiro e torcer para que caia no mesmo lugar" é exatamente como você obtém um rosto diferente, uma câmera à deriva e um cliente perguntando o que aconteceu com o plano.
Não foi isso que voltou. Ambos os modelos fizeram o trabalho, e ambos fizeram de forma limpa.
O video-edit do Gemini se comportou exatamente como anunciado. A placa agora diz OPEN 24H na mesma letra pintada à mão, com o mesmo brilho âmbar e o mesmo desgaste no lata. O avental está carmesim escuro. Todo o resto está intocado: mesmo rosto, mesma expressão, mesmo ângulo da concha, mesma forma do vapor, mesma chuva, mesmas lanternas traseiras ao fundo. Parece o arquivo original com duas correções de pixels, porque é essencialmente isso.
O reference-to-video do H3 produziu as mesmas duas mudanças e manteve o plano muito melhor do que a arquitetura sugere que deveria. Placa alterada, avental alterado, e ao longo de todos os 10 segundos o enquadramento, o despejo do caldo da concha, a pluma de vapor e o rosto dela permaneceram no modelo em relação ao clipe da primeira rodada. Se há deriva aqui, não consegui encontrá-la percorrendo os quadros.
Então a segunda rodada é um terceiro empate estatístico, e não vou fingir o contrário para fazer uma história mais arrumada. O que separa as duas saídas não é a qualidade da edição. É que o H3 devolveu 2560x1440 com uma faixa estéreo de 32 kHz e o Gemini devolveu 1280x720. Mesma instrução, mesmo sucesso, entregável diferente.
Uma ressalva honesta sobre o método: esta é uma única revisão em um único plano, não um estudo controlado. Uma mudança de duas partes em uma placa e uma peça de roupa é uma edição bastante amigável. Casos mais difíceis (remover um objeto pelo qual a câmera passa, mudar algo que o sujeito oclui, quatro rodadas de anotações empilhadas umas sobre as outras) são onde um endpoint de edição dedicado deve se destacar, e onde a regeneração deve começar a oscilar. Execute o seu antes de decidir.
Mais três divisões entre MiniMax H3 e Gemini Omni Flash que valem a pena testar
A segunda rodada é a divisão que muda uma entrega. Mais três valem vinte minutos do seu próprio crédito.
Alimente com um arquivo de áudio. O reference-to-video do H3 aceita até três clipes de áudio de 2 a 15 segundos cada, desde que pelo menos uma referência de imagem ou vídeo os acompanhe. Isso significa que você pode fornecer uma gravação de voz real e fazer o personagem interpretá-la. O Gemini Omni Flash não tem campo de entrada de áudio em nenhum dos seus quatro endpoints, então essa comparação não pode ser executada. Isso não é uma perda de pontuação para o Google; é uma capacidade que simplesmente está ausente.
Peça 21:9. A enumeração de proporção do reference-to-video do H3 contém 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16. A enumeração aspect_ratio do Gemini contém 16:9 e 9:16. Se o seu entregável é uma sequência de abertura widescreen ou um corte social 1:1, um desses dois modelos não está na conversa.
Fixe uma seed e execute novamente. Este vai na direção oposta. O Gemini expõe seed; o H3 não expõe em nenhum endpoint. Se você está construindo um pipeline onde a mesma solicitação tem que retornar os mesmos quadros na terça-feira que retornou na segunda-feira, o Gemini fornece uma alça e o H3 não fornece nada. Para testes de regressão, variantes de cópia A/B, ou qualquer fazenda de renderização automatizada, essa é uma vantagem real e pertence ao lado do Google no livro-razão.
Quanto custa realmente um teste entre MiniMax H3 e Gemini Omni Flash
Todo o experimento acima, quatro gerações de vídeo e uma imagem, totalizou cerca de US$ 5,51. Um primeiro quadro a US$ 0,009, dois clipes de 10 segundos da primeira rodada a US$ 1,40 e US$ 1,30, dois clipes de 10 segundos da segunda rodada a US$ 1,40 cada.
Por segundo, o Gemini é mais barato: US$ 0,125 a US$ 0,14 contra US$ 0,14 fixos do H3, então aproximadamente 7 a 11 por cento menos, dependendo do endpoint. Esse número é verdadeiro e também é quase inútil por si só.
Aqui está o porquê. Suponha que o entregável seja uma abertura cinematográfica de 15 segundos em 21:9 em 2K. O H3 renderiza como um clipe. O Gemini não pode renderizá-lo de forma alguma: nem a resolução, nem a duração, nem a proporção de tela. Você teria que emendar um clipe de 10 segundos e um de 5 segundos em 16:9, cortar para fingir o widescreen e enviar 720p. O preço por segundo de algo que você não pode entregar não é uma economia.
Inverta. Suponha que o entregável seja um corte social 16:9 que passará por quatro rodadas de anotações do cliente e precisa voltar byte idêntico quando a equipe jurídica pedir para re-renderizá-lo em três semanas. O video-edit mais seed do Gemini é construído exatamente para esse loop, e custa menos por segundo enquanto faz isso.
Tabela D: Qual trabalho do MiniMax H3 vs Gemini Omni Flash vai para onde
| O trabalho à sua frente | Envie para |
|---|---|
| Entrega em 2K | MiniMax H3 |
| Um único plano com mais de 10 segundos | MiniMax H3 |
| Enquadramento 21:9, 4:3, 1:1 ou 3:4 | MiniMax H3 |
| Alimentar uma faixa de áudio real | MiniMax H3 |
| Auto-hospedagem em suas próprias GPUs | MiniMax H3 |
| Aterrissar em um último quadro específico | MiniMax H3 |
| Revisões conversacionais de múltiplas rodadas | Gemini Omni Flash |
| Preservar as partes intocadas de um clipe | Gemini Omni Flash |
| Renderizações reproduzíveis via seed | Gemini Omni Flash |
| Formato curto 16:9 simples pela taxa mais baixa por segundo | Gemini Omni Flash |
A conclusão deste artigo é essa tabela, não uma pontuação. Se um benchmark não consegue separar dois modelos por mais do que sua própria barra de erro, o benchmark já lhe disse tudo o que sabe, e a ficha técnica assume o controle a partir daí.
Para uma visão mais ampla de onde o H3 se posiciona em relação ao resto do campo, o guia de alternativas ao MiniMax H3 cobre os modelos que o superam nos rankings que ele não lidera.
Perguntas Frequentes
O MiniMax H3 é melhor que o Gemini Omni Flash?
A votação cega não consegue separá-los. Em três rankings do Artificial Analysis, as diferenças são de 5, 2 e 9 pontos Elo, e cada uma está dentro de um intervalo de confiança de ±7 a ±10. Escolha com base nas especificações, não na classificação. O teto de resolução, o limite de duração e a lista de proporções de tela mudarão seu entregável; 5 pontos Elo não mudarão.
Qual é mais barato, MiniMax H3 ou Gemini Omni Flash?
Por segundo, o Gemini. Na Atlas Cloud, custa US$ 0,125 a US$ 0,14 por segundo contra os US$ 0,14 fixos do H3, com um nível de desenvolvedor a US$ 0,112 por segundo que o H3 não tem equivalente. Mas o Gemini é limitado a 720p, 10 segundos e duas proporções de tela, então para muitos entregáveis você não está comparando o mesmo produto. Precifique o corte finalizado, não o segundo.
O Gemini Omni Flash consegue gerar vídeo em 1080p, 2K ou 15 segundos?
Não. O parâmetro resolution da sua API tem um valor legal, 720p, e duration aceita de 3 a 10 segundos. O MiniMax H3 oferece 768P ou 2K e de 4 a 15 segundos. Essas são restrições de enumeração lidas do esquema ao vivo em 6 de agosto de 2026, não opinião editorial, e o Google pode alterá-las no futuro.
Posso auto-hospedar o Gemini Omni Flash da mesma forma que posso auto-hospedar o MiniMax H3?
Não. Os pesos do H3 estão no Hugging Face e rodam localmente com lado curto de 768 pixels. O estágio Context-IR e o módulo Regenerate-2K que produzem saída 2K não estão na versão e permanecem do lado da API. Verifique também a licença: atualmente não cobre a UE, Reino Unido, Coreia do Sul ou EUA sem uma inscrição separada.
Preciso escolher apenas um?
Não, e a tabela de divisão por trabalho acima é a melhor resposta. Ambos os modelos estão por trás do mesmo endpoint generateVideo na Atlas Cloud, então usar ambos significa um loop de polling e uma string model diferente, não duas integrações. Roteirizar por entregável supera apostar em um ranking que muda toda semana.






