Seedance 2.5 já está disponível — Primeiro na Atlas Cloud

MiniMax H3 Pesos de Código Aberto: Você não precisa de um supercomputador. Você pode precisar de um advogado.

Os pesos open source do MiniMax H3 estão disponíveis: 33B parâmetros, download mínimo de 42,5 GB, dois checkpoints e uma licença cuja cláusula territorial exclui os EUA, UE, Reino Unido e Coreia.

Laptop exibindo código ao lado de um PC brilhante sobre uma mesa

Uma mesa às 3h da manhã com um gabinete de PC aberto, um drive externo e um monitor mostrando um grande download em andamento

Os pesos estão disponíveis. Então deixe-me responder às duas perguntas que mais receberam comentários no post de lançamento da MiniMax, antes de qualquer outra coisa.

Não, você não precisa de um supercomputador. Escolha os arquivos certos e o download é de 42,5 GB, não 123,6 GB. O modelo tem 33B parâmetros, e aproximadamente 13B deles estão em ramos de modulação AdaLN que a inferência nem precisa carregar.

Então abri o arquivo LICENSE. Linha 10, antes mesmo de chegar à cláusula de receita de $20M, há uma lista de países. Meu país está nela. Provavelmente o seu também.

Principais conclusões

  • Os pesos abertos do MiniMax H3 estão disponíveis no Hugging Face como MiniMaxAI/MiniMax-H3, além de um espelho reempacotado para ComfyUI em Comfy-Org/MiniMax-H3. O ComfyUI disponibilizou suporte nativo no mesmo dia.
  • Não é um único arquivo. Existem dois checkpoints específicos para tarefas, fl2va (baseado em texto e imagem) e ref2va (baseado em referência), cada um com 21 GB na sua forma mais enxuta. Você baixa apenas o que sua tarefa precisa.
  • Transformer denso de fluxo único com 33B. A menor combinação funcional é de 42,5 GB, uma redução de 66% em relação aos 123,6 GB em precisão total. O ComfyUI afirma que uma placa de 12 GB com offloading pode executá-lo.
  • A geração local é nativamente 768px no lado menor, não 2K. 2K vem de uma segunda passagem de regeneração no contexto.
  • O uso comercial é gratuito, mas você deve exibir "MiniMax H3" na sua interface e, acima de $20 milhões de receita anual, precisa de autorização por escrito separada. E o Território Aplicável da licença exclui a UE, o Reino Unido, a Coreia do Sul e os Estados Unidos. Uma API hospedada é uma relação jurídica diferente.

Um personagem, ambos os checkpoints, uma única 3h da manhã. O lado esquerdo é o que fl2va faz. O lado direito é o que ref2va faz. Mesma pessoa, mesma sala, mesma noite, dois trabalhos completamente diferentes, e o zumbido do cooler que você ouve é gerado na mesma passagem que a imagem.

Comparação lado a lado de um homem trabalhando em uma mesa com dois monitores

Esquerda: imagem para vídeo, o trabalho que o checkpoint fl2va faz. Direita: referência para vídeo, o trabalho que ref2va faz. Ambos renderizados no MiniMax H3 com áudio estéreo nativo. Ligue o som.

A primeira coisa que pedi a este modelo para gerar foi um ser humano esperando que este modelo terminasse de baixar. Pareceu adequado.

MiniMax H3 Open Source Weights, Avaliados: Dois Checkpoints e um Piso de 42,5 GB

Aqui está o porquê deste lançamento ter chamado a atenção. A Artificial Analysis classificou o H3 como #1 em Edição de Vídeo e entre os três primeiros tanto em texto para vídeo quanto em imagem para vídeo, e afirmou que liberar os pesos "o tornaria de longe o modelo de pesos abertos líder" (Artificial Analysis, julho de 2026). Esse é um modelo de vídeo de nível de fronteira com um botão de download.

A outra metade honesta: a mesma execução de benchmark mostra o H3 atrás do Google Gemini Omni Flash em texto para vídeo, e atrás tanto do Seedance 2.0 quanto do Gemini Omni Flash em imagem para vídeo (South China Morning Post, julho de 2026). É #1 em edição, não #1 em tudo.

Agora a parte que quase ninguém verificou antes de executar git clone.

A contagem de parâmetros que ninguém colocou em uma manchete. A ficha técnica descreve o H3-Omni-Transformer como "um Transformer denso de fluxo único com 33B parâmetros, com aproximadamente 13B parâmetros residindo em ramos relacionados a AdaLN", e acrescenta que, como essas saídas de modulação podem ser pré-computadas e armazenadas em cache, "esses parâmetros não precisam ser carregados para implantação somente de inferência". É daí que vêm os checkpoints podados. Cerca de 40% do modelo se transforma em uma tabela de consulta quando você está apenas fazendo inferência.

Onde a maioria das pessoas queima 80 GB à toa. O repositório oficial MiniMaxAI/MiniMax-H3 tem 498 GB se você puxar tudo. O espelho do ComfyUI tem 343 GB. Ambos contêm todas as variantes de precisão de ambos os checkpoints. Você precisa de quatro arquivos, não de quatrocentos.

ArquivoTamanhoO que éPara que você precisa
minimax_h3_fl2va_pruned_int8_convrot.safetensors20,97 GBcheckpoint fl2va, podado + int8Texto para vídeo, imagem para vídeo
minimax_h3_fl2va_int8_convrot.safetensors34,04 GBfl2va, int8, não podadoO mesmo, maior fidelidade
minimax_h3_fl2va_bf16.safetensors66,28 GBfl2va, precisão totalFine-tuning, pesquisa
minimax_h3_ref2va_pruned_int8_convrot.safetensors20,97 GBcheckpoint ref2va, podado + int8Apenas referência para vídeo
minimax_h3_ref2va_int8_convrot.safetensors34,04 GBref2va, int8, não podadoO mesmo, maior fidelidade
minimax_h3_ref2va_bf16.safetensors66,28 GBref2va, precisão totalFine-tuning, pesquisa
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors15,69 GBCodificador de texto, 4-bit AWQTodo fluxo de trabalho
qwen3vl_32b_minimax_h3_int8_convrot.safetensors27,14 GBCodificador de texto, int8Todo fluxo de trabalho
qwen3vl_32b_minimax_h3_bf16.safetensors51,51 GBCodificador de texto, precisão totalTodo fluxo de trabalho
minimax_h3_video_vae_fp16.safetensors5,21 GBVAE de vídeoTodo fluxo de trabalho
minimax_h3_audio_vae_fp32.safetensors0,61 GBVAE de áudioTodo fluxo de trabalho (este é o som)
Menor conjunto funcional, uma tarefa42,5 GBfl2va podado + codificador nvfp4 + ambos VAEsO download realista
Ambos os checkpoints, menor63,4 GBadicionar ref2va podadoSe você quiser todos os três modos
Uma tarefa em bf16 total123,6 GBbf16 tudoApenas para máquinas de pesquisa

Tamanhos de arquivo lidos diretamente do índice do repositório Comfy-Org/MiniMax-H3, agosto de 2026.

A própria definição do ComfyUI para o mesmo número: "pegada total de memória reduzida em 66%, de 123,6 GB em precisão total para 42,5 GB", que é o que "permite que um modelo de vídeo 2K de próxima geração seja executado localmente em uma GPU como a RTX 3060" (ComfyUI, agosto de 2026). Considere o valor de 12 GB como a afirmação deles com offloading dinâmico, não como um benchmark. Não executei em uma 3060, e o offloading compra VRAM com RAM do sistema e tempo de espera.

Uma coisa que "executá-lo localmente" significa silenciosamente: 768px. A tela nativa do H3 é um lado menor de 768px, limitado a 768x1344, de acordo com o tutorial do H3 do ComfyUI. A duração se ajusta a uma grade de 17 quadros por bloco a 24fps. Os clipes 2K do marketing vêm do H3-Regenerate-2K, uma segunda passagem que alimenta o resultado 768p mais o contexto original de volta pelo modelo. A ficha técnica é explícita de que o sistema completo tem três módulos: H3-Context-IR, H3-Base e H3-Regenerate-2K. O ComfyUI local fornece o H3-Base.

E a palavra "aberto" está fazendo três trabalhos diferentes aqui. Baixável, sim. Utilizável comercialmente, condicionalmente. Executável onde você mora, depende de onde você mora. O tópico do Reddit chamando isso de "na verdade um modelo de código fechado" está errado no primeiro ponto e está apontando para algo real nos outros dois. A Seção 7 tem o texto da cláusula.

MiniMax H3 Open Source Weights Local vs. uma API Hospedada: Escolha Seu Caminho

Tudo abaixo desta linha, toda a demonstração de quatro etapas, é executado em uma única aba do navegador no Atlas Cloud, que serve todos os três endpoints do H3 mais o modelo de imagem que usei para o quadro base. Isso não é a mesma coisa que executar os pesos, e a diferença importa mais do que o normal com este modelo.

Pesos locaisAPI hospedada
Custo inicialDownload de 42,5 GB, uma GPU de 12 GB+, uma instalação do ComfyUIUma chave de API
Tempo até o primeiro clipeUma noite, otimisticamenteCerca de dois minutos
Custo por clipe de 5sTempo de GPU e eletricidade$0,70 a $0,14/seg
Resolução nativaLado menor 768px, 2K via uma passagem de regeneração2K direto, é o único valor do enum
Fine-tuning, LoRA, cirurgiaSim, esse é o ponto principalNão
Os dados nunca saem da sua redeSimNão
Exposição à licençaVocê aceita a Licença Comunitária e sua cláusula de territórioVocê é cliente de um serviço hospedado
Se você está na UE, RU, Coreia ou EUASeção 7Não afetado pela licença dos pesos

Regra prática: abaixo de cerca de 100 clipes por mês, ou se você precisa de 2K direto, ou se está em um Território Excluído, o hospedado vence em todos os eixos. Acima disso, ou se você pretende treinar em cima do checkpoint, ou se a gravação não pode sair do seu prédio, os 42,5 GB valem a noite.

Preços verificados nas páginas dos modelos em tempo real, agosto de 2026. Todos os endpoints do H3 cobram por segundo de saída, sem desconto ativo.

ModeloO que faz aquiPreçoDesconto
MiniMax H3 image-to-videoEtapa 2, o trabalho do fl2va$0,14 / seg em 2KNenhum
MiniMax H3 reference-to-videoEtapa 3, o trabalho do ref2va$0,14 / seg em 2KNenhum
MiniMax H3 text-to-videoEtapa 4, a linha de base sem referência$0,14 / seg em 2KNenhum
GPT Image 2 text-to-imageEtapa 1, o quadro base$0,009 / imagem listado; a execução de alta qualidade 16:9 que usei custou $0,1745Nenhum
Seedance 2.0 / Wan 2.7 / Kling v3.0 TurboPontos de referência por segundo$0,112 / $0,10 / $0,095 por segKling 15% off

Uma inconsistência que vale a pena saber antes de escrever código contra ele: o README do H3 ainda documenta uma camada 768p a $0,10/seg e uma duração de 5 ou 10 segundos. O esquema ativo discorda. resolution tem exatamente um valor permitido, 2K, e duration aceita qualquer inteiro de 5 a 15. Escreva contra o esquema. Há uma simetria interessante nessa lacuna: a camada 768p está desligada no lado hospedado, e 768p é precisamente a tela nativa que você obtém ao executar os pesos você mesmo.

Etapa 1: Gerar o Quadro Base com GPT Image 2

Tudo nesta demonstração começa a partir de um único quadro. A cena é deliberadamente na cara: um desenvolvedor às 3h da manhã assistindo a um download de checkpoint de 21 GB.

Modelo: openai/gpt-image-2/text-to-image. Configurações: qualidade high, proporção 16:9.

plaintext
1Um plano geral fotorrealista de um escritório doméstico bagunçado às 3h da manhã, iluminado apenas por dois monitores e pelo brilho RGB de um gabinete de PC aberto na mesa. Um desenvolvedor cansado em um moletom cinza está sentado desleixado em uma cadeira de rede, queixo apoiado na mão, olhando fixamente para o monitor esquerdo. O monitor esquerdo mostra um terminal escuro com uma única barra de progresso de download visível em cerca de 78%. O monitor direito mostra um navegador de arquivos. Uma caneca de café meio cheia e fria, um teclado mecânico e um pequeno ventilador de mesa estão sobre a mesa. Chuva escorre na janela atrás dele. Profundidade de campo rasa, 35mm, luz quente do monitor contra luz azul fria da janela, granulação de sensor visível. Sem sobreposições de texto, sem marcas d'água.

Não peça ao modelo de imagem para renderizar os nomes reais dos arquivos safetensors. Strings longas com sublinhados voltam como pasta. Mantenha os nomes dos arquivos em suas legendas.

Captura de tela da interface do gerador de texto para imagem do Atlas Cloud com saída

Playground do GPT Image 2 no Atlas Cloud com o prompt das 3h digitado e o quadro base finalizado no painel de saída

GPT Image 2 no Atlas Cloud: qualidade alta, 16:9, o quadro base renderizado à direita. A camada de alta qualidade cobrou $0,1745 para esta execução, bem acima do piso de $0,009 listado, então faça orçamento por camada.

Homem de moletom olhando para dois monitores de computador à noite

O quadro base gerado: um desenvolvedor cansado às 3h da manhã observando uma barra de download no monitor esquerdo

A saída da Etapa 1. Este único quadro alimenta as Etapas 2 e 3.

Etapa 2: Imagem para Vídeo, o Trabalho que o Checkpoint fl2va Faz

Este é o endpoint que corresponde a minimax_h3_fl2va_pruned_int8_convrot.safetensors. Um primeiro quadro de entrada, movimento e som de saída. Localmente, este é o arquivo que você carregaria; hospedado, é uma chamada de API.

Modelo: minimax/h3/image-to-video. Configurações: image = o quadro da Etapa 1 passado como uma URL de dados, resolution: 2K, duration: 5, ratio: 16:9.

plaintext
1O desenvolvedor fica parado, apenas respirando e piscando, olhos fixos no monitor esquerdo. A barra de progresso no monitor esquerdo avança lentamente. Os coolers do gabinete aceleram e seu brilho RGB pulsa mais forte. Um momento antes do fim, ele exala e seus ombros caem. Câmera fixa, sem movimento de câmera, sem zoom, sem cortes. Áudio: um zumbido baixo de cooler que aumenta de tom, chuva fraca contra a janela, um som suave de dois tons de conclusão perto do fim.

Passe a imagem como uma URL de dados base64 em vez de uma URL de armazenamento recém-gerada. Uma URL de objeto nova pode falhar na verificação de download upstream. Observe também que o H3 realmente obedece a "câmera fixa", o que não é universalmente verdadeiro para modelos de vídeo desta classe.

Captura de tela da interface do gerador de imagem para vídeo do MiniMax

Playground do MiniMax H3 image-to-video no Atlas Cloud com o quadro base carregado e um clipe 2K concluído no painel de saída

MiniMax H3 image-to-video: quadro base carregado, 2K, execução concluída. Esta captura usou o padrão do endpoint de 8 segundos, por isso o valor lido é $1,12. Meu clipe incorporado abaixo é a versão de 5 segundos a $0,70.

Homem cansado esperando por uma barra de carregamento de computador à noite

O trabalho fl2va: um quadro de entrada, cinco segundos de movimento mais zumbido estéreo do cooler de saída.

Etapa 3: Referência para Vídeo, o Trabalho que o Checkpoint ref2va Faz

Checkpoint diferente, arquivo diferente, tarefa diferente. ref2va não estende um primeiro quadro. Ele pega material de referência e constrói uma nova tomada que mantém a identidade e os objetos consistentes. É por isso que o repositório fornece dois arquivos de 21 GB em vez de um.

Eu dei a ele duas referências: o quadro da Etapa 1 para a pessoa e o ambiente, e um close macro de uma placa de vídeo para o hardware.

Modelo: minimax/h3/reference-to-video. Configurações: refers = ambas as imagens, resolution: 2K, duration: 8, ratio: 16:9.

plaintext
1Mesmo homem, mesmo moletom cinza, mesmo rosto, no mesmo escritório escuro. Nova tomada: um close médio de lado enquanto ele se recosta na cadeira e solta uma longa respiração, o canto da boca se levantando ligeiramente. A placa de vídeo da segunda imagem de referência é visível sobre o ombro dele, seus coolers desacelerando, RGB se estabilizando em uma cor constante. Mantenha a identidade dele, o moletom, o cabelo e a iluminação do ambiente consistentes com as imagens de referência. Câmera fixa. Áudio: zumbido do cooler diminuindo, um pressionar de tecla do teclado, chuva continuando.

refers aceita um array misto de imagens, vídeos e áudio, com pelo menos uma imagem ou vídeo. Áudio sozinho é rejeitado. Este endpoint também aceita durações de até 15 segundos.

Uma armadilha específica neste endpoint: defina ratio explicitamente. Deixá-lo como adaptive retornou 400 invalid params, ratio is required for t2va (text-only) and cannot be 'adaptive', quatro vezes seguidas, inclusive do playground com ambas as referências claramente anexadas. Com ratio: "16:9" na chamada de API, funcionou na primeira vez. É também por isso que a captura de tela abaixo é a imagem de referência em vez de uma captura do playground: não consegui tirar o controle de Proporção de Aspecto do playground de adaptive, então o clipe que você vê aqui veio da API com as configurações acima, não de uma execução no playground.

Uma placa de vídeo de três coolers montada verticalmente dentro de um gabinete de computador

A segunda imagem de referência: um close macro de uma placa de vídeo de três coolers dentro de um gabinete de PC aberto à noite

Imagem de referência 2, gerada no mesmo lote que o quadro base, passada junto com o quadro da Etapa 1.

Homem digitando em uma mesa com dois monitores à noite

O trabalho ref2va: uma nova abordagem em vez de uma continuação. Mesmo homem, mesmo moletom, mesma sala, e a placa de vídeo da referência 2 agora aparece no quadro com seus coolers desacelerando. Observe que ele interpretou "close médio" de forma aproximada e permaneceu bastante aberto.

Etapa 4: Texto para Vídeo, a Linha de Base do MiniMax H3 Open Source Weights

Mesma cena, descrita em palavras, nenhuma referência. Esta etapa existe para mostrar a você o que os dois checkpoints realmente servem.

Modelo: minimax/h3/text-to-video. Configurações: ratio é obrigatório aqui e não pode ser adaptive, então 16:9. resolution: 2K, duration: 5.

plaintext
1Um desenvolvedor cansado em um moletom cinza às 3h da manhã em um escritório doméstico bagunçado, iluminado por dois monitores e pelo brilho RGB de um gabinete de PC aberto, observando uma barra de progresso de download rastejando pela tela esquerda. Chuva na janela atrás dele. Câmera fixa 35mm, profundidade de campo rasa, luz quente do monitor contra luz fria da janela, granulação de filme. Áudio: zumbido crescente do cooler, chuva fraca, um som suave de conclusão no final.

Interface de texto para vídeo AI mostrando prompt e saída de vídeo gerada

Playground do MiniMax H3 text-to-video no Atlas Cloud com o prompt digitado e um clipe concluído no painel de saída

MiniMax H3 text-to-video: nenhum material de referência, 2K, Proporção de Aspecto definida como 16:9 porque adaptive é rejeitado aqui, execução concluída. Mesmo prompt, e já um rosto diferente do da Etapa 2.

Homem de moletom cinza olhando para uma tela de computador à noite

Mesmas palavras, humano diferente. Sala bonita, cara errado. Essa lacuna é todo o argumento para fl2va e ref2va existirem como checkpoints separados.

Uma observação operacional se você scriptar todos os três: a concorrência upstream é de aproximadamente uma tarefa. Trabalhos sobrepostos retornam 429 rate limit exceeded (task concurrency). Execute-os em série. Um clipe 2K de 5 segundos levou cerca de dois minutos cada vez.

O que Custam os MiniMax H3 Open Source Weights, e o que a Licença Realmente Diz

A questão do custo tem duas moedas. Hospedado, um clipe 2K de 5 segundos é $0,70 e um de 15 segundos é $2,10, por segundo, sem camadas, sem desconto. Local, a moeda são gigabytes e horas: 42,5 GB no pipe, uma placa que possa segurá-los e uma tela de 768px a menos que você também execute a passagem de regeneração. Em algum lugar acima de algumas centenas de clipes por mês a aritmética se inverte. Abaixo disso, na maioria das vezes não.

Depois, há a terceira moeda, que é o tempo de análise jurídica. Li o LICENSE inteiro. Aqui está o que ele contém.

Um laptop aberto e uma pilha de papéis iluminados por uma luminária de mesa

Uma luminária de mesa iluminando um laptop mostrando um documento de texto denso, ao lado de uma impressão destacada, óculos de leitura e um copo de água

A parte de um lançamento de pesos abertos que ninguém captura de tela para o tópico de lançamento.

CláusulaSeçãoO que dizO que significa para você
Território AplicávelI.3, I.5Mundialmente, "excluindo os Territórios Excluídos", definidos como "a União Europeia, o Reino Unido, a República da Coreia e os Estados Unidos da América"A licença comunitária não concede direitos onde a maioria dos leitores deste artigo mora
Proibição de uso territorialV.4Você não pode "usar, reproduzir, modificar, distribuir ou exibir as Obras MiniMax H3 ou qualquer de suas Saídas ou resultados fora do Território Aplicável"Alcança as Saídas, não apenas os pesos
Canal de licenciamento separadoIIA MiniMax "avaliará continuamente as leis aplicáveis" e convida partes em regiões excluídas a contatá-las para obter uma licençaÉ "ainda não", não "nunca". O repositório fornece um formulário de inscrição
AtribuiçãoIV.2Você "deve exibir de forma proeminente 'MiniMax H3' na interface do usuário" de qualquer produto comercial que o utilizeUma mudança de UI, não uma nota de rodapé
Limite de receitaIV.1Acima de $20 milhões de receita anual, você precisa de autorização prévia por escrito de [email protected]O uso comercial gratuito tem um teto
Sem lavagem de modeloV.3Você não pode usar H3 ou suas Saídas "para melhorar qualquer outro modelo de inteligência artificial"Descarta destilação em seu próprio modelo
RedistribuiçãoIII.1, III.4Acompanhe o acordo, inclua um arquivo NOTICE, marque arquivos modificadosPadrão, mas também vincula usuários downstream
Codificador de textoNota AdicionalO codificador é Qwen3-VL-32B sob Apache 2.0Um componente da pilha é genuinamente aberto (OSI)
Lei aplicávelIXLei da RAE de Hong Kong, jurisdição exclusiva de Hong KongVale uma linha em seu registro de riscos

A data de vigência do acordo é 2 de agosto de 2026 (Hugging Face, agosto de 2026).

A maioria das coberturas de lançamento liderou com "pesos abertos" e parou por aí. Para crédito da MiniMax, eles não esconderam: o repositório carrega seu próprio docs/QA-about-License.md explicando que os modelos de vídeo enfrentam um cenário regulatório em movimento mais rápido do que os modelos de texto, nomeando o AI Act da UE, as regras do Reino Unido e da Coreia, e o litígio de direitos autorais em andamento nos EUA sobre vídeo generativo, e afirmando claramente que "a limitação atual significa 'ainda não', não 'nunca'". O mesmo documento confirma a divisão que importa operacionalmente: a API permanece globalmente disponível porque a MiniMax controla a infraestrutura de serviço, enquanto os pesos abertos deixam esse controle para trás.

Portanto, se você está em São Francisco, Berlim, Londres ou Seul, a leitura prática não é "você nunca pode tocar no H3". É "esta licença específica não é o instrumento que permite que você execute esses pesos em sua própria máquina". Solicite a licença separada ou use um endpoint hospedado, onde você é cliente de um serviço em vez de licenciado dos pesos.

Não sou advogado e este não é um conselho jurídico. O texto da cláusula acima está citado para que seu advogado real possa ler o original em cerca de dez minutos.

MiniMax H3 Open Source Weights: Perguntas Frequentes

Os pesos abertos do MiniMax H3 foram realmente lançados e onde posso baixá-los?

Sim, desde o início de agosto de 2026. Dois lugares. MiniMaxAI/MiniMax-H3 é o repositório oficial, com cerca de 498 GB, contendo o pipeline no formato diffusers, ambos os transformadores, o codificador de texto, ambos os VAEs, documentação e scripts reproduzíveis. Comfy-Org/MiniMax-H3 é a compilação reempacotada para ComfyUI, com cerca de 343 GB no total, com os checkpoints quantizados de arquivo único que a maioria das pessoas realmente quer. Se você está usando ComfyUI, use o segundo e baixe quatro arquivos.

Quantos parâmetros o MiniMax H3 tem e preciso de um supercomputador?

33B, em um Transformer denso de fluxo único. Cerca de 13B disso reside em ramos relacionados a AdaLN cujas saídas podem ser pré-computadas e armazenadas em cache, portanto, implantações somente de inferência não precisam carregá-los. É isso que são os checkpoints "podados". Sem supercomputador. Um download de 42,5 GB e uma GPU consumidora séria.

Posso executar os pesos abertos do MiniMax H3 em 12 GB ou 16 GB de VRAM?

A equipe do ComfyUI diz que uma placa de 12 GB pode fazer isso com offloading dinâmico, usando o checkpoint fl2va int8 podado mais o codificador de texto nvfp4 AWQ. Essa é a afirmação deles, não um benchmark que executei. Duas ressalvas: offloading troca VRAM por RAM do sistema, então planeje 64 GB de RAM e espere tempos de renderização longos, e sua tela local é 768px no lado menor, não 2K.

Os pesos abertos do MiniMax H3 são realmente de código aberto ou apenas pesos abertos?

Pesos abertos, precisamente. Os pesos são baixáveis e modificáveis, o que é mais do que qualquer modelo de vídeo de fronteira oferecia há um ano. Mas a licença não é aprovada pela OSI, a receita de treinamento e os dados não são publicados, o uso comercial tem condições de atribuição e receita, e a cláusula de território restringe onde a concessão se aplica. O único componente genuinamente aberto é o codificador Qwen3-VL-32B sob Apache 2.0. Três camadas separadas, e "aberto" descreve apenas a primeira de forma limpa.

Posso usar os pesos abertos do MiniMax H3 comercialmente e o que significa a linha de $20M?

Sim, com duas condições. Você deve exibir de forma proeminente "MiniMax H3" na interface do usuário do produto comercial (Seção IV.2). E se seus produtos e serviços comerciais gerarem mais de $20 milhões em receita anual, você precisa de autorização prévia por escrito separada da MiniMax antes de usá-lo, solicitada em [email protected] (Seção IV.1). O limite é sobre sua receita, não sobre seu uso do H3.

Por que a licença do MiniMax H3 exclui os EUA e a UE, e quais são minhas opções?

De acordo com as próprias perguntas frequentes da licença da MiniMax, porque a geração de vídeo está em um ambiente regulatório em movimento mais rápido do que o texto, especificamente o AI Act da UE, as regras em evolução do Reino Unido e da Coreia do Sul, e o litígio ativo de direitos autorais nos EUA sobre vídeo generativo. Uma vez que os pesos são públicos, eles não podem impor salvaguardas downstream, então eles limitaram a concessão em vez de atrasar o lançamento. Opções em uma região excluída: solicite uma licença separada por meio do formulário no repositório ou use uma API hospedada, que é uma relação jurídica diferente e permanece globalmente disponível. Peça ao seu advogado para confirmar qual se encaixa antes de implantar.


Verificado em 3 de agosto de 2026. Três coisas na lista de acompanhamento: quantizações comunitárias GGUF e de bits mais baixos (nenhuma existe para o H3 ainda), qualquer alteração na lista de Territórios Excluídos e se a camada 768p hospedada que o README ainda documenta algum dia retorna.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos