Seedance 2.5 já está disponível — Primeiro na Atlas Cloud

MiniMax H3 vs Gemini Omni Flash: Google vence o quadro por 5 pontos. Então o cliente pede uma mudança.

MiniMax H3 vs Gemini Omni Flash em três leaderboards, e todas as três diferenças estão dentro da margem de erro. Então eu executei um disparo em ambos, depois enviei a mesma nota de revisão de volta.

Fiquei a olhar para três classificações da Artificial Analysis durante dez minutos a tentar perceber quem realmente ganhou.

Texto-para-vídeo: Gemini Omni Flash por 5 pontos. Imagem-para-vídeo: Gemini por 2 pontos. Edição de vídeo: MiniMax H3 por 9 pontos.

Depois olhei para a coluna do intervalo de confiança. Mais ou menos 7. Mais ou menos 9. Mais ou menos 10.

Três quadros, três diferenças, todas dentro das suas próprias barras de erro. Em votação cega, estes dois modelos são o mesmo modelo.

Por isso fechei as classificações e abri os menus suspensos. Essa diferença não são 5 pontos. Essa diferença é um nível de resolução inteiro.

Principais conclusões

  • Todas as três diferenças da Artificial Analysis (+5, +2, +9, snapshot tirado a 6 de agosto de 2026) caem dentro dos intervalos de confiança de ±7 a ±10. Em qualidade bruta, isto é um empate, não uma vitória.
  • O H3 produz 2K, até 15 segundos e seis proporções de ecrã. A API do Gemini Omni Flash está limitada a 720p, 10 segundos e duas proporções de ecrã. Esses são valores de enumeração, não opiniões.
  • O H3 aceita áudio como entrada. O Gemini não. O Gemini tem seed e thinking_level. O H3 não tem nenhum.
  • O Gemini tem um endpoint dedicado video-edit que modifica o seu clipe original. O caminho de revisão do H3 é reference-to-video, que regenera com o seu clipe como referência. Não são a mesma operação, e a segunda ronda mostra isso.
  • Apenas um dos dois tem pesos descarregáveis, e não é o da Google.

Comparação lado a lado de uma cena de barraca de comida noturna em diferentes resoluções

Primeira ronda do teste MiniMax H3 vs Gemini Omni Flash, ambos os modelos a animar o mesmo primeiro fotograma, mostrados lado a lado

Primeira ronda: mesmo primeiro fotograma, mesmo prompt, mesma duração. À esquerda MiniMax H3 em 2K, à direita Gemini Omni Flash em 720p. Mostrado aqui como um GIF silencioso; ambos os ficheiros entregues têm áudio nativo e ambos estão incorporados como vídeo reproduzível mais abaixo. Este é o problema. Ambos são bons.


Porque é que a Diferença na Classificação entre MiniMax H3 e Gemini Omni Flash está a ser Mal Interpretada

Quase todas as publicações sobre MiniMax H3 vs Gemini Omni Flash que encontrar citam uma classificação e um preço. Ambos os hábitos produzem a resposta errada.

Aqui estão os três quadros da Artificial Analysis, com a coluna que toda a gente ignora.

Tabela A: MiniMax H3 vs Gemini Omni Flash em três classificações da Artificial Analysis (com áudio), snapshot de 6 de agosto de 2026

ClassificaçãoGemini Omni FlashMiniMax H3DiferençaDentro das barras de erro?
Texto-para-vídeo1.243 (#1) ±7, 11.842 votos1.238 (#2) ±9, 6.830 votosGemini +5Sim
Imagem-para-vídeo1.191 (#2) ±9, 6.506 votos1.189 (#3) ±10, 5.545 votosGemini +2Sim
Edição de vídeo1.123 (#2) ±5, 11.706 votos1.132 (#1) ±6, 9.128 votosH3 +9Sim, por pouco

Pontuações Elo da Artificial Analysis Video Arena (Artificial Analysis, agosto de 2026). A imagem-para-vídeo é liderada pelo Dreamina Seedance 2.0 720p com 1.197, por isso nenhum destes dois detém esse título. São pontuações de votação pública dinâmicas e mudam, exatamente por isso uma diferença de 5 pontos não é um veredito.

Uma vantagem de 5 pontos com um intervalo de ±9 significa que a classificação pode inverter na próxima semana apenas com ruído de votos. Isso não é "Gemini é melhor em texto-para-vídeo". É um cara ou coroa com um placar.

Mais três coisas que as pessoas interpretam mal:

A coluna dólar-por-minuto não é o que paga. A Artificial Analysis lista $6,00/min para o Gemini e $7,80/min para o H3. Essa coluna normaliza para o custo de um minuto de 1080p em definições predefinidas. O Gemini Omni Flash não consegue produzir 1080p de todo. Portanto, o número é uma estimativa modelada, não uma fatura. Compare os resultados finais entregues, não os segundos.

Um quadro não é o modelo. O H3 está em segundo, terceiro e primeiro nos três quadros. O Gemini está em primeiro, segundo e segundo. Cite apenas um deles e pode provar o que já acreditava.

"Omni" não significa "come tudo." É um bom nome e enganador. Um destes dois aceita ficheiros de áudio como entrada. Não é o que tem "omni" no nome.

A Ficha Técnica do MiniMax H3 vs Gemini Omni Flash que Ninguém Imprime

Se as pontuações Elo não os conseguem separar, as tabelas de restrições conseguem. Extraí os esquemas de entrada atuais de ambos os modelos em vez de confiar em qualquer post de lançamento, e as diferenças não são subtis.

Tabela B: Restrições rígidas MiniMax H3 vs Gemini Omni Flash, lidas dos esquemas API ao vivo a 6 de agosto de 2026

RestriçãoMiniMax H3Gemini Omni Flash
Resolução768P ou 2K720p, e esse é o único valor no enum
Duração4 a 15 segundos3 a 10 segundos
Proporções de ecrã21:9, 16:9, 4:3, 1:1, 3:4, 9:16Apenas 16:9 e 9:16
Caminho de revisãoreference-to-video (regenera com referências)Endpoint dedicado video-edit (modifica a sua fonte)
Controlo do último fotogramaend_image suportadoNão disponível
Limites de referência≤9 imagens, ≤3 vídeos, ≤3 áudios, 12 ficheiros no total1 a 10 imagens
Entrada de áudioSimNão
Reprodutibilidade seedNãoSim
thinking_levelNãoSim (padrão / alto / baixo)
Pesos abertosSim, no Hugging FaceNão

Leia essa tabela honestamente e o Gemini ganha em três linhas. Sementes reprodutíveis são importantes se estiver a construir um pipeline que precisa de renderizar o mesmo fotograma duas vezes. Um endpoint real video-edit é uma ferramenta genuinamente diferente da regeneração condicionada por referência. E thinking_level dá-lhe um dial de qualidade que o H3 simplesmente não expõe.

O H3 ganha em cinco linhas, e são as linhas que decidem se consegue entregar o ficheiro que o cliente pediu.

Executei tudo abaixo no Atlas Cloud porque ambos os modelos estão atrás do mesmo endpoint /api/v1/model/generateVideo lá, o que significou um loop de polling e um cabeçalho de autenticação para todo o teste. Trocar modelos foi uma alteração na string model. Esse detalhe é a razão pela qual "usar ambos" é uma resposta realista em vez de um subterfúgio.

Tabela C: quanto custa cada endpoint neste teste, verificado na lista de preços ao vivo a 6 de agosto de 2026

EndpointPreçoClipe de 10 segundos deste teste
openai/gpt-image-2/text-to-image$0,009 / imagem$0,01
minimax/h3/image-to-video$0,14 / s$1,40
minimax/h3/reference-to-video$0,14 / s$1,40
google/gemini-omni-flash/image-to-video$0,13 / s$1,30
google/gemini-omni-flash/video-edit$0,14 / s$1,40
google/gemini-omni-flash/text-to-video$0,125 / snão usado
minimax/h3/text-to-video$0,14 / snão usado

Nenhum dos modelos oferece desconto este mês. O Gemini também expõe um nível de programador mais barato ($0,112/s para texto-para-vídeo e imagem-para-vídeo, $0,12/s para referência-para-vídeo); o H3 não tem nível equivalente.

A linha dos pesos abertos que o Gemini Omni Flash não pode cruzar. Os pesos do H3 estão publicados no Hugging Face (MiniMax, agosto de 2026): um Omni Transformer denso de 33B de fluxo único, mais o codificador de texto Qwen3-VL-32B, um VAE visual e um VAE de áudio. Duas ressalvas são mais importantes que o tamanho da descarga. Primeiro, o que aloja localmente corre com um lado curto de 768 pixels; o estágio de pré-processamento Context-IR e o módulo Regenerate-2K não estão na versão, e a saída 2K vem desses dois. Segundo, a licença comunitária atualmente não cobre a UE, o Reino Unido, a Coreia do Sul ou os Estados Unidos, e há um formulário de candidatura separado para esses territórios. Leia-a antes de construir um produto sobre ela. O Gemini Omni Flash não tem conversa equivalente, porque não há ficheiro para descarregar.

Essa posição de pesos abertos, aliada a preços agressivos, é toda a história estratégica do lançamento (South China Morning Post, agosto de 2026).

Execute Você Mesmo o Teste de Revisão do MiniMax H3 vs Gemini Omni Flash

Aqui está a parte que ninguém executou. Todos comparam a primeira geração. Ninguém compara a segunda.

O trabalho real não é um prompt. O trabalho real é um clipe de que já gosta, mais um cliente que responde "adoro, pode o letreiro dizer 24H e o avental dela ser vermelho". Essa única frase é onde estes dois modelos deixam de ser intercambiáveis, e acontece ser exatamente a tarefa que a classificação de edição de vídeo mede.

A cena é deliberadamente cruel: uma barraca de noodles encharcada de chuva à noite, o vendedor a falar diretamente para a lente, um letreiro pintado à mão com palavras legíveis atrás dela, vapor do caldo, chuva no toldo. Um fotograma que testa sincronização labial, estabilidade de texto no ecrã, movimento fluido e áudio ambiente em camadas ao mesmo tempo.

Ambos os modelos recebem o mesmo primeiro fotograma, o mesmo prompt e a mesma nota de revisão. Cada execução abaixo tem 10 segundos, que é o teto do Gemini Omni Flash e está bem dentro do H3.

Passo 1: Fixar o primeiro fotograma com o GPT Image 2

Ambos os modelos devem começar da mesma imagem, caso contrário a primeira ronda mede sorte de composição em vez do modelo. Abra o playground do GPT Image 2, defina qualidade para alta e proporção para 16:9, e cole isto:

Plain
1Cena foto-realista de barraca de comida de rua noturna com chuva forte, filmada com lente de 35mm a f/2.0. Uma mulher com cerca de trinta e poucos anos, avental de ganga índigo, atrás de um balcão de noodles a vapor, olhando diretamente para a lente, a meio de uma frase. Atrás dela, um letreiro de lata pintado à mão brilha em âmbar quente com as palavras "OPEN LATE" em maiúsculas limpas, sem serifa e negrito. A chuva escorre pela luz de sódio da rua, o vapor sobe do pote de caldo, o asfalto molhado reflete néon vermelho e verde do outro lado da rua. Profundidade de campo reduzida, apenas iluminação prática, ligeiro nevoeiro de lente, textura de pele natural, sem texto em mais lado nenhum no fotograma. 16:9.

Interface de gerador de imagens AI mostrando um prompt e a imagem gerada

Playground do GPT Image 2 no Atlas Cloud com o prompt da barraca de noodles à esquerda e o primeiro fotograma gerado no painel de saída

GPT Image 2 no Atlas Cloud: o prompt à esquerda, o primeiro fotograma partilhado em OUTPUT. Custo deste passo , $0,009.

Uma mulher está numa barraca de comida de rua a vapor à noite

O primeiro fotograma gerado: uma mulher de avental índigo atrás de um balcão de noodles a vapor à noite na chuva, com um letreiro pintado à mão "OPEN LATE" a brilhar atrás dela

A única entrada que ambos os modelos receberam. Note as duas coisas que a revisão irá visar: o letreiro "OPEN LATE" e o avental índigo. Gerado com openai/gpt-image-2/text-to-image.

Passo 2: Primeira ronda no MiniMax H3

Vá ao playground do MiniMax H3, escolha a tarefa image-to-video, carregue o fotograma do Passo 1 e defina resolution para 2K, duration para 10, ratio para adaptive (o enum imagem-para-vídeo oferece apenas adaptive). Prompt:

Plain
1The vendor looks into the lens and says, in a warm tired voice: "Broth's been on since four this morning. Sit down, it's still raining." She lifts the ladle as she speaks. Steam curls up across the frame. Rain keeps falling on the awning behind her. The camera holds still, no push, no pan. Ambient audio: rain on canvas, broth simmering, distant traffic, her voice close and dry.

Interface de geração de vídeo AI mostrando entrada de texto e saída de vídeo

Playground de imagem-para-vídeo do MiniMax H3 no Atlas Cloud com resolução 2K selecionada e o clipe finalizado a reproduzir no painel de saída

MiniMax H3 imagem-para-vídeo no Atlas Cloud: 2K selecionado, o clipe finalizado em OUTPUT. Esta captura foi executada no padrão de 8 segundos do playground e custou $1,12; a versão de 10 segundos usada para a comparação está incorporada abaixo e custou $1,40.

MiniMax H3, primeira ronda, 2K, 10 segundos. Som ativo: o diálogo, a chuva e o caldo são todos gerados na mesma passagem, não sobrepostos depois.

Passo 3: Primeira ronda no Gemini Omni Flash, mesmo fotograma, mesmas palavras

Abra o playground do Gemini Omni Flash, escolha image-to-video, carregue o mesmo fotograma do Passo 1 e cole o prompt do Passo 2 sem alterar um caractere. Definições: resolution 720p, duration 10, aspect_ratio 16:9, thinking_level default, seed -1.

Duas coisas a notar enquanto está nesse formulário, porque são o artigo em miniatura. O menu suspenso resolution contém exatamente uma opção. O campo duration para nos 10. Não escolhi 720p em vez de algo melhor; não há mais nada para escolher.

Uma nota sobre o que falta aqui: não consegui capturar uma captura de ecrã do playground com a execução concluída para nenhum dos passos do Gemini. O ambiente de teste onde tiro capturas de ecrã devolveu 403 PERMISSION_DENIED do lado da Google em todas as três tentativas, por isso as únicas capturas do Gemini que tenho mostram um painel OUTPUT falhado e não vou disfarçar uma como uma execução bem-sucedida. Os clipes abaixo são reais, gerados através da API de produção com as definições listadas acima. Os dois passos do H3 capturaram limpos e essas capturas de ecrã são genuínas.

Gemini Omni Flash, primeira ronda, 720p, 10 segundos, entradas idênticas. Reproduza este imediatamente a seguir ao clipe do H3 acima e julgue o áudio por si.

Passo 4: Segunda ronda, envie a revisão para o Gemini Omni Flash

Esta é a ronda que importa. Mude para a tarefa video-edit na mesma página do modelo Gemini, carregue o clipe que o próprio Gemini produziu no Passo 3 como entrada video, defina resolution 720p e thinking_level high (uma instrução de edição em duas partes é exatamente o caso complexo para o qual esse dial foi concebido). Cole esta nota exatamente como um cliente a enviaria:

Plain
1Keep this exact shot: same camera position, same woman, same face, same rain, same lighting, same audio. Change the hand-painted sign so it reads "OPEN 24H" instead of "OPEN LATE", in the same painted style and the same amber glow. Change her apron from indigo blue to deep crimson. Change nothing else in the frame.

Gemini Omni Flash após a nota de revisão. Observe o letreiro, depois o avental, e verifique se mais alguma coisa se moveu.

Passo 5: Segunda ronda, envie a revisão idêntica para o MiniMax H3

Aqui está a diferença estrutural honesta, e deve sabê-la antes de ler o resultado. O H3 não tem endpoint video-edit. O seu caminho de revisão é reference-to-video: entrega-lhe o clipe original como referência e ele gera um novo vídeo condicionado a essa referência. Não está a editar o seu ficheiro. Está a criar um novo que supostamente se parece com o seu.

Na página do MiniMax H3, escolha a tarefa reference-to-video, adicione o clipe que o H3 produziu no Passo 2 a refers como referência de vídeo, depois defina resolution 2K, duration 10, ratio adaptive. Cole o prompt do Passo 4 sem quaisquer edições.

Este passo também não tem captura de ecrã do playground, por uma razão diferente e mais aborrecida: o navegador headless com que capturo crashou três vezes no carregador de referências ao carregar uma referência de vídeo. A execução propriamente dita correu através da API sem reclamação.

MiniMax H3 após a nota de revisão idêntica, via reference-to-video em 2K.

Comparação de uma mulher a cozinhar numa barraca de comida de rua noturna e chuvosa

Lado a lado da segunda ronda: o resultado video-edit do Gemini Omni Flash ao lado do resultado reference-to-video do MiniMax H3, ambos a partir da mesma nota de revisão

Segunda ronda lado a lado, GIF silencioso. À esquerda Gemini Omni Flash via video-edit, à direita MiniMax H3 via reference-to-video. Ambos tiveram a mesma frase para trabalhar.

O que realmente aconteceu na segunda ronda. Fui à espera que o H3 perdesse esta. A regeneração condicionada por referência é um instrumento mais bruto do que um endpoint de edição real, e "regenerar o clipe inteiro e esperar que aterre no mesmo sítio" é exatamente como se obtém um rosto diferente, uma câmara à deriva e um cliente a perguntar o que aconteceu ao plano.

Não foi isso que voltou. Ambos os modelos fizeram o trabalho, e ambos o fizeram limpo.

O video-edit do Gemini comportou-se exatamente como anunciado. O letreiro diz OPEN 24H na mesma caligrafia pintada à mão, com o mesmo brilho âmbar e o mesmo desgaste na lata. O avental é vermelho profundo. Todo o resto está intacto: mesmo rosto, mesma expressão, mesmo ângulo da concha, mesma forma do vapor, mesma chuva, mesmas luzes traseiras no fundo. Lê-se como o ficheiro original com duas correções de profundidade de píxeis, porque é essencialmente isso que é.

O reference-to-video do H3 produziu as mesmas duas alterações e manteve o plano muito melhor do que a arquitetura sugere. Letreiro alterado, avental alterado, e ao longo de todos os 10 segundos, o enquadramento, o despejo do caldo da concha, a pluma de vapor e o rosto dela mantiveram-se fiéis ao clipe da primeira ronda. Se há deriva aqui, não consegui encontrá-la percorrendo fotogramas.

Portanto, a segunda ronda é um terceiro empate estatístico, e não vou fingir o contrário para tornar a história mais arrumada. O que separa os dois resultados não é a qualidade da edição. É que o H3 devolveu 2560x1440 com uma faixa estéreo de 32 kHz e o Gemini devolveu 1280x720. Mesma instrução, mesmo sucesso, resultado final diferente.

Uma ressalva honesta sobre o método: esta é uma única revisão num único plano, não um estudo controlado. Uma alteração em duas partes a um letreiro e a uma peça de vestuário é uma edição bastante amigável. Casos mais difíceis (remover um objeto que a câmara ultrapassa, alterar algo que o sujeito obstrui, quatro rondas de notas empilhadas) são onde um endpoint de edição dedicado deve ganhar vantagem, e onde a regeneração deve começar a vacilar. Execute o seu antes de decidir.

Mais Três Divisões MiniMax H3 vs Gemini Omni Flash que Vale a Pena Testar

A segunda ronda é a divisão que altera uma entrega. Mais três valem vinte minutos do seu próprio crédito.

Alimente-o com um ficheiro de áudio. O reference-to-video do H3 aceita até três clipes de áudio de 2 a 15 segundos cada, desde que pelo menos uma referência de imagem ou vídeo os acompanhe. Isso significa que pode entregar-lhe uma gravação de voz real e fazer com que a personagem a execute. O Gemini Omni Flash não tem campo de entrada de áudio em nenhum dos seus quatro endpoints, por isso esta comparação não pode ser executada de todo. Isso não é uma perda de pontuação para a Google; é uma capacidade simplesmente ausente.

Peça 21:9. O enum de proporção ratio do reference-to-video do H3 contém 21:9, 16:9, 4:3, 1:1, 3:4 e 9:16. O enum aspect_ratio do Gemini contém 16:9 e 9:16. Se o seu resultado final é uma sequência de título widescreen ou um corte social 1:1, um destes dois modelos não está na conversa.

Fixar uma seed e re-executar. Esta vai no sentido oposto. O Gemini expõe seed; o H3 não expõe em nenhum endpoint. Se estiver a construir um pipeline onde o mesmo pedido tem de devolver os mesmos fotogramas na terça-feira que devolveu na segunda-feira, o Gemini dá-lhe um controlo e o H3 não dá nada. Para testes de regressão, variantes de cópia A/B, ou qualquer fazenda de renderização automatizada, essa é uma vantagem real e pertence ao lado da Google no balanço.

Quanto Custa Realmente um Teste MiniMax H3 vs Gemini Omni Flash

Toda a experiência acima, quatro gerações de vídeo e uma imagem, custou cerca de $5,51. Um primeiro fotograma a $0,009, dois clipes de 10 segundos da primeira ronda a $1,40 e $1,30, dois clipes de 10 segundos da segunda ronda a $1,40 cada.

Por segundo, o Gemini é mais barato: $0,125 a $0,14 contra $0,14 fixos do H3, ou seja, cerca de 7 a 11 por cento menos dependendo do endpoint. Esse número é verdadeiro e também é quase inútil por si só.

Aqui está porquê. Suponha que o resultado final é uma abertura cinematográfica de 15 segundos em 21:9 a 2K. O H3 renderiza-a como um único clipe. O Gemini não consegue renderizá-la de todo: nem a resolução, nem a duração, nem a proporção. Terias de juntar um clipe de 10 segundos e um de 5 segundos em 16:9, cortar para fingir o widescreen, e entregar a 720p. O preço por segundo de algo que não pode entregar não é uma poupança.

Inverta. Suponha que o resultado final é um corte social 16:9 que passará por quatro rondas de notas do cliente e tem de voltar byte-identicamente quando a equipa jurídica pedir para o re-renderizar daqui a três semanas. O video-edit mais seed do Gemini é construído exatamente para esse ciclo, e custa menos por segundo enquanto o faz.

Tabela D: qual trabalho MiniMax H3 vs Gemini Omni Flash vai para onde

O trabalho à sua frenteEnvie para
Entrega a 2KMiniMax H3
Um único plano com mais de 10 segundosMiniMax H3
Enquadramento 21:9, 4:3, 1:1 ou 3:4MiniMax H3
Alimentar com uma faixa de áudio realMiniMax H3
Auto-alojamento nas suas próprias GPUsMiniMax H3
Aterrar num último fotograma específicoMiniMax H3
Revisões conversacionais de múltiplas rondasGemini Omni Flash
Preservar as partes intactas de um clipeGemini Omni Flash
Renderizações reproduzíveis via seedGemini Omni Flash
Formato curto 16:9 simples à taxa por segundo mais baixaGemini Omni Flash

A conclusão deste artigo é essa tabela, não uma pontuação. Se um benchmark não consegue separar dois modelos por mais do que a sua própria barra de erro, o benchmark disse-lhe tudo o que sabe, e a ficha técnica assume o controlo a partir daí.

Para uma visão mais ampla de onde o H3 se situa em relação ao resto do campo, a análise de alternativas ao MiniMax H3 cobre os modelos que o batem nos quadros que ele não lidera.

Perguntas Frequentes

O MiniMax H3 é melhor que o Gemini Omni Flash?

A votação cega não os consegue separar. Em três classificações da Artificial Analysis, as diferenças são de 5, 2 e 9 pontos Elo, e todas estão dentro de um intervalo de confiança de ±7 a ±10. Escolha com base nas especificações, não na classificação. O teto de resolução, o limite de duração e a lista de proporções de ecrã alterarão o seu resultado final; 5 pontos Elo não alterarão.

Qual é mais barato, MiniMax H3 ou Gemini Omni Flash?

Por segundo, o Gemini. No Atlas Cloud custa $0,125 a $0,14 por segundo contra os $0,14 fixos do H3, com um nível de programador a $0,112 por segundo que o H3 não tem equivalente. Mas o Gemini está limitado a 720p, 10 segundos e duas proporções de ecrã, por isso, para muitos resultados finais, não está a comparar o mesmo produto. Preço pelo corte finalizado, não pelo segundo.

O Gemini Omni Flash consegue gerar vídeo a 1080p, 2K ou 15 segundos?

Não. O seu parâmetro resolution da API tem um valor legal, 720p, e duration aceita 3 a 10 segundos. O MiniMax H3 oferece 768P ou 2K e 4 a 15 segundos. Estas são restrições de enumeração lidas do esquema ao vivo a 6 de agosto de 2026, não opinião editorial, e a Google pode levantá-las mais tarde.

Posso auto-alojar o Gemini Omni Flash da mesma forma que posso auto-alojar o MiniMax H3?

Não. Os pesos do H3 estão no Hugging Face e correm localmente com um lado curto de 768 pixels. O estágio Context-IR e o módulo Regenerate-2K que produzem saída 2K não estão na versão e permanecem do lado da API. Verifique também a licença: atualmente não cobre a UE, Reino Unido, Coreia do Sul ou EUA sem uma candidatura separada.

Tenho de escolher apenas um?

Não, e a tabela de divisão por trabalho acima é a melhor resposta. Ambos os modelos estão atrás do mesmo endpoint generateVideo no Atlas Cloud, por isso executar ambos significa um loop de polling e uma string model diferente, não duas integrações. Encaminhar por resultado final supera apostar numa classificação que muda todas as semanas.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos