Durante todo o verão, meu feed foi o mesmo vídeo em loop. Jogadores da Copa do Mundo redesenhados como protagonistas de shonen. Um ditador. Um capitão pirata. Um mentor envelhecido que aparece nos últimos quatro segundos. Milhões de visualizações por postagem, e a história se atualiza após quase toda partida.
Ninguém que faz isso está escrevendo posts de benchmark. Eles estão escolhendo um modelo, queimando créditos e enviando antes do próximo pontapé inicial.
Então peguei um keyframe de anime e um prompt, e testei o MiniMax H3 como gerador de vídeo de anime contra o Veo 3.1, ambos levados às suas configurações máximas em entradas idênticas.
A primeira coisa que quebrou não foi a qualidade de imagem. Foi um menu suspenso. O Veo 3.1 para em 8 segundos e oferece exatamente duas proporções de tela. Um plano que segura um rosto, faz um whip pan com a bola e depois insere um cartão de título não cabe em 8 segundos. Nunca teve chance de falhar em qualidade.
Principais conclusões
- O enum
durationdo Veo 3.1 é[4, 6, 8]e seu enumaspect_ratioé[16:9, 9:16]. O MiniMax H3 roda qualquer segundo inteiro de 4 a 15 e oferece21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Sem 4:3 no Veo significa sem enquadramento retrô de OVA, de jeito nenhum. - O model card do H3 lista 11 idiomas de diálogo nativamente estáveis e o japonês é um deles. Áudio e imagem são gerados juntos em estéreo de 32 kHz, não dublados depois.
- Os pacotes de referência não são próximos: o H3 aceita até 9 imagens mais até 3 vídeos e 3 clipes de áudio (12 arquivos no máximo). O endpoint de referência do Veo 3.1 aceita 3 imagens e, no momento em que você o usa,
durationcolapsa para apenas[8]. - Duas armadilhas que silenciosamente arruínam testes: a API do Veo define
generate_audiocomofalsepor padrão eresolutioncomo720p, e oratiodo H3 para texto-para-vídeo padrão é1:1. Deixe esses valores como estão e você estará comparando um clipe silencioso em 720p contra um quadrado. - O Veo 3.1 mantém duas coisas que o H3 não tem:
seedenegative_prompt. Para anime 2D, esse segundo realmente importa, e vou mostrar onde.
Gerador de Vídeo de Anime MiniMax H3 vs Veo 3.1, o Mesmo Frame Lado a Lado
Um personagem original. Um keyframe. Um prompt, copiado caractere por caractere em ambos os modelos. Todo o resto maximizado em cada lado.
MiniMax H3, imagem-para-vídeo, 2K, 8 segundos, áudio nativo. Ligue o som: o burburinho da multidão, o impacto na bola e o grito em japonês são gerados na mesma passagem que a imagem. Gerado com minimax/h3/image-to-video no Atlas Cloud.
Veo 3.1, imagem-para-vídeo, 1080p, 8 segundos, generateaudio ativado manualmente, além de um negativeprompt mantendo a arte linear plana. Mesmo primeiro frame, mesmas palavras. Gerado com google/veo3.1/image-to-video no Atlas Cloud.
Ambos desenham lindamente. O plano aberto do chute do Veo, com linhas de impacto desenhadas à mão e um efeito sonoro de mangá flutuando no ar, é genuinamente adorável. Esse é o ponto de partida honesto, e é por isso que o resto deste artigo é sobre parâmetros e seguimento de instruções, em vez de vibrações.
Por que a Maioria dos Testes do Gerador de Vídeo de Anime MiniMax H3 vs Veo 3.1 Dá Errado
Duas coisas aconteceram ao mesmo tempo neste verão.
O anime se tornou o formato de maior volume em vídeo de IA. A Copa do Mundo de 2026 foi reescrita como um torneio shonen, com jogadores escalados como um ditador, um capitão pirata, um general da marinha e um mentor, e histórias que "evoluem após quase toda partida" no TikTok, Instagram, X e YouTube (Complex, julho de 2026).
E o MiniMax H3 foi lançado com pesos abertos. O tópico do ComfyUI no dia 0 atingiu 330 pontos e 95 comentários, com pessoas postando números locais reais em horas (Hacker News, agosto de 2026).
Junte esses dois e você esperaria uma pilha de comparações de anime. Quase não há nenhuma, porque a maioria dos testes é construída errada de uma de quatro maneiras.
Eles comparam imagens, não restrições. Planos de anime são timing. Um whip pan em um cartão de título é um problema de duração antes de ser um problema de renderização.
Eles esquecem que a API do Veo é silenciosa por padrão. Na API, generate_audio é false e resolution é 720p. Muitos posts "Veo não tem áudio em anime" são apenas alguém que nunca alternou um booleano.
Eles esquecem que o texto-para-vídeo do H3 é quadrado por padrão. ratio padrão é 1:1, não 16:9. Execute um prompt t2v de anime sem configurá-lo e você obtém um clipe quadrado e uma conclusão confusa.
Eles testam com prompts fotorrealistas. "Cinematográfico, luz volumétrica, profundidade de campo rasa" é exatamente o vocabulário que arrasta um modelo 2D para sombreamento de renderização 3D. O modo de falha em anime não é borrão. É plástico.
As três configurações que decidem um teste de anime antes de você apertar o botão
Antes de qualquer outra coisa, defina estas em ambos os lados ou a comparação é inválida.
| Configuração | MiniMax H3 | Veo 3.1 | O que acontece se você pular |
|---|---|---|---|
| Áudio | Gerado com a imagem, sempre ativo | generate_audio padrão é false | Veo retorna um clipe silencioso e parece pior do que é |
| Formato | ratio padrão é 1:1 no texto-para-vídeo | aspect_ratio padrão é 16:9 | H3 te entrega um corte quadrado de anime que não pode usar |
| Resolução | padrão é 2K | padrão é 720p | Você compara 2K contra 720p e chama de diferença de qualidade |
A Ficha Técnica de Anime MiniMax H3 vs Veo 3.1: Duração, Proporção, Áudio, Referências
Peguei os esquemas de entrada ao vivo de ambos os modelos, em vez de confiar em qualquer post de lançamento. Cada valor abaixo é um enum que você pode ler por si mesmo nas páginas dos modelos, não uma impressão.
Tabela 1: MiniMax H3 vs Veo 3.1, os parâmetros que decidem um plano de anime
| MiniMax H3 | Veo 3.1 | |
|---|---|---|
| Duração | 4 a 15, cada segundo inteiro (padrão 8) | 4, 6, 8 (padrão 8) |
| Proporções de tela | 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 | 16:9, 9:16 |
| Proporção padrão (texto-para-vídeo) | 1:01 | 16:09 |
| Resolução | 768P, 2K (padrão 2K) | 720p, 1080p, 4k (padrão 720p) |
| Áudio | Gerado conjuntamente, estéreo 32 kHz | generate_audio, padrão false |
| Idiomas de diálogo nativos | 11 estáveis, japonês incluído | Não publicado como lista estável |
| Pacote de referência | até 9 imagens, 3 vídeos, 3 clipes de áudio, 12 arquivos no total | 3 imagens |
| Duração ao usar referências | ainda 4 a 15 | colapsa para apenas 8 |
| seed | não disponível | disponível |
| negative_prompt | não disponível | disponível |
| Pesos | baixáveis | fechados |
Duração, proporção, resolução, áudio e limites de referência são lidos dos esquemas ao vivo nas páginas MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video e Veo 3.1 reference-to-video. O limite de 9 imagens e 12 arquivos e a lista de 11 idiomas de diálogo vêm do model card do MiniMax H3 (Hugging Face, agosto de 2026).
Agora os placares, porque eles dizem algo diferente da ficha técnica e ambos importam.
Tabela 2: Elo por voto popular e preço por minuto, instantâneo de 7 de agosto de 2026
| Modelo | Texto-para-vídeo (com áudio) | Imagem-para-vídeo (com áudio) | $/min |
|---|---|---|---|
| Gemini Omni Flash | 1.244 (#1) ±7 | 1.191 (#2) ±9 | $6,00 |
| MiniMax H3 | 1.238 (#2) ±9 | 1.190 (#3) ±10 | $7,80 |
| Dreamina Seedance 2.0 720p | 1.224 (#3) ±6 | 1.198 (#1) ±7 | $9,07 |
| Kling 3.0 1080p (Pro) | 1.111 (#7) ±6 | não listado no top 10 | $20,16 |
| Veo 3.1 | 1.093 (#11) ±7 | 1.085 (#10) ±7 | $24,00 |
| Veo 3.1 Fast | 1.091 (#14) ±6 | não listado no top 10 | $9,00 |
| Veo 3.1 Lite | 1.089 (#15) ±7 | não listado no top 10 | $4,80 |
Valores de Elo e preço do Artificial Analysis Video Arena (Artificial Analysis, agosto de 2026). São votos populares contínuos e mudam. A coluna $/min é uma estimativa de modelo normalizada, não sua fatura.
Uma diferença de 145 pontos de Elo é grande, mas é um voto de propósito geral, não um voto de anime. E aqui está a parte que tenho que dizer claramente: a MiniMax não comercializa o H3 como um modelo de anime. O feedback interno de primeira linha lista filme, animação e drama cômico como as áreas em que o H3 não é focado. Então a pergunta interessante não é "qual é o modelo de anime". É por que o modelo que não se vende como anime ainda vence o plano, e onde o Google ainda leva a rodada.
Uma nota prática antes do tutorial. Cada modelo abaixo roda através do mesmo console e da mesma chave de API, que é a única razão pela qual os parâmetros são comparáveis. Mesma fila, mesma autenticação, uma conta. Se você configurar o GPT Image 2 em um serviço e o Veo em outro, metade das diferenças que você encontrar serão de encanamento, não de modelo.
Construa o Plano: MiniMax H3 vs Veo 3.1, Passo a Passo
Um exemplo de execução, do início ao fim. "Último Apito": um atacante adolescente original, cabelo vermelho, uniforme branco e azul marinho número 9, holofotes, um whip pan no chute, e um cartão de título em japonês que precisa aparecer nos últimos dois segundos e ficar firme.
Nenhum jogador real, nenhum personagem oficial, nenhum IP de anime existente. Estilo e homenagem apenas. Mais sobre o porquê em breve.
Passo 1: Projete o keyframe de anime com GPT Image 2
O keyframe carrega a direção de arte para que o modelo de vídeo não precise inventá-la. Observe o espaço negativo no terço esquerdo: é deliberado. O cartão de título será escrito ali pelo modelo de vídeo, e esse é o teste de estabilidade de texto.
Plain1Um único frame de um anime esportivo shonen moderno. Animação 2D com cel-shading, arte linear 2com tinta à mão e espessura consistente, preenchimentos de cor plana, sombras gráficas de 3bordas duras, absolutamente nenhum sombreamento 3D e nenhuma pele fotorrealista. Close-up em 4um atacante adolescente original: cabelo vermelho bagunçado, uniforme branco e azul marinho 5com o número 9, suor e marcas de grama em uma bochecha, olhos arregalados com determinação 6exausta, boca aberta durante um grito. Atrás dele, holofotes do estádio brilham em uma 7parede de cor da multidão borrada; linhas de velocidade radiais explodem do centro do frame; 8uma folha de grama congela no ar. Paleta saturada, sombras ciano profundas, luz de borda 9laranja quente. Composição 16:9, o personagem enquadrado à direita do centro, espaço 10negativo limpo no terço esquerdo. Nenhum texto em qualquer lugar da imagem.
Configurações: modelo openai/gpt-image-2/text-to-image, qualidade high, tamanho 16:9 (2048x1152). Nada mais.

Playground do GPT Image 2 no Atlas Cloud com o prompt do keyframe Last Whistle e o frame de anime finalizado no painel de saída
GPT Image 2 no Atlas Cloud: qualidade definida como alta, o keyframe finalizado à direita.

O keyframe base de anime: um atacante original de cabelo vermelho gritando sob holofotes de estádio, com cel-shading, cor plana e linhas de velocidade
O keyframe que ambos os modelos recebem. Cor plana, sombras duras e um terço esquerdo vazio esperando um cartão de título.
Passo 2: MiniMax H3 image-to-video, tudo maximizado
Mesma imagem de entrada, saída 2K. Mantive o H3 em 8 segundos aqui apenas para igualar o teto do Veo. Esse não é o limite do H3 e o Passo 4 tira o limite.
Plain1Anime 2D com cel-shading, espessura de linha feita à mão, cor plana, sem sombreamento 3D. 2Segure o rosto do atacante por um momento, depois um violento whip pan segue a bola enquanto 3ele a chuta, o pan borrando o frame em rastros de movimento sakuga. Um quadro de silêncio 4total no impacto. Nos dois segundos finais, letras japonesas brancas e ousadas do título 5ラストホイッスル aparecem no terço esquerdo do frame e permanecem firmes, sem distorção, 6sem oscilação, sem desvio. O atacante grita uma linha em japonês: 「まだ終わってない!」 7Áudio: rugido da multidão crescendo, um único impacto agudo de bola, um golpe de taiko 8grave sob o cartão de título.
Configurações: modelo minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (image-to-video pega a forma do frame da sua imagem de entrada), image = a saída do Passo 1.
Um aviso se você for para texto-para-vídeo: escreva ratio: 16:9 explicitamente. O padrão é 1:1 e ele vai te entregar um corte quadrado de anime de bom grado.

Playground do MiniMax H3 image-to-video no Atlas Cloud com o prompt Last Whistle, keyframe carregado e o clipe finalizado no painel de saída
MiniMax H3 image-to-video no Atlas Cloud: o keyframe do Passo 1 carregado à esquerda, o clipe finalizado tocando à direita.
Passo 3: Veo 3.1 image-to-video, áudio ativado manualmente
O prompt é idêntico, palavra por palavra. Mude um único adjetivo e deixa de ser uma comparação. O que muda é o campo extra que o Veo oferece e o H3 não.
negative_prompt, que para anime 2D é o controle mais útil desta lista:
Plain13D render, CGI, plastic shading, photorealistic skin, live action footage, motion blur 2soup, warped lettering, gibberish text, extra fingers, subtitle bar
Configurações: modelo google/veo3.1/image-to-video, resolution: 1080p (mude, o padrão é 720p), duration: 8 (este é o teto), aspect_ratio: 16:9, generate_audio: true (o padrão da API é false, esta é a armadilha do clipe silencioso), seed: 20260807, image = a mesma saída do Passo 1.

Playground do Veo 3.1 image-to-video no Atlas Cloud mostrando generate audio ativado, o keyframe de anime carregado e o clipe finalizado no painel de saída
Veo 3.1 image-to-video no Atlas Cloud, com Generate Audio ativado e o clipe finalizado à direita.
Passo 4: Pontue em cinco eixos específicos de anime
Nada para gerar aqui. Apenas observe, nas coisas em que o anime realmente quebra. Ambos os clipes estão incorporados perto do topo deste artigo, para que você possa pontuá-los sozinho em vez de acreditar na minha palavra.

Lado a lado do último frame de ambos os clipes, MiniMax H3 à esquerda com letras japonesas limpas do título, Veo 3.1 à direita com caracteres verticais distorcidos
O último frame de cada clipe. À esquerda, o H3 escreveu ラストホイッスル, todos os oito katakana corretos e firmes. À direita, o Veo 3.1 escreveu três caracteres que não são a palavra solicitada e não formam uma.
O cartão de título foi onde a rodada foi decidida, e não foi perto. O H3 renderizou exatamente o katakana solicitado, com bordas duras e estável, sobre um pan borrado da meta. O Veo 3.1 produziu uma pilha vertical de três caracteres que não são nem a palavra solicitada nem uma palavra. No mesmo frame, também tirou o personagem de quadro e deixou o fundo escorregar para um plano de estádio semifotorrealista, apesar de photorealistic skin e 3D render estarem no negative prompt.
Tabela 3: cinco eixos que decidem um corte de anime, a partir dessas duas execuções
| Eixo | MiniMax H3 | Veo 3.1 |
|---|---|---|
| Continuidade do personagem a partir do keyframe | Manteve o rosto, cabelo e uniforme exatos por todos os 8 segundos | Redesenhou o personagem em um novo plano aberto, no modelo mas em um desenho diferente |
| Espessura de linha e cel-shading plano | Manteve, sem deriva para 3D | Manteve no plano médio, derivou para um plano de estádio fotográfico no final |
| Cartão de título em japonês | ラストホイッスル renderizado corretamente e mantido firme | Três caracteres, não a palavra solicitada, não uma palavra |
| Faixa de áudio entregue | Estéreo 32 kHz, exatamente como o model card afirma | Estéreo 48 kHz, presente apenas porque eu mesmo configurei generate_audio |
| Whip pan e borrão sakuga | Executado como um pan borrado até o título | Substituído por um corte seco para uma nova configuração |
Essa última linha é a crítica pública mais alta ao H3 até agora, que é exatamente por que a escrevi em ambos os prompts. No tópico do ComfyUI do dia 0, o usuário fwip reclamou que até os prompts de demonstração oficiais eram ignorados: "um violento WHIP PAN do telhado que BORRA as palavras flutuantes com ele, com rastros de movimento. E o vídeo simplesmente não fez nenhuma daquela transição, apenas substituiu por um corte."
Nesta execução, foi o Veo que trocou o pan por um corte, e o H3 que borrou. Uma tomada cada não é um veredito, e não afirmaria o contrário. Mas isso significa que a crítica não é específica do H3: whip pans são a instrução menos confiável em todo este teste, de ambos os lados. Se seu storyboard depende de um, planeje ao redor dele em vez de através dele.
Passo 5: O corte retrô de OVA em 4:3 que o Veo 3.1 estruturalmente não pode produzir
Isso não é uma preferência de qualidade. É uma parede. O enum aspect_ratio do Veo tem dois valores e nenhum é 4:3, e seu enum duration não tem 12. O visual OVA dos anos 90 simplesmente não é acessível.
Plain1Um corte de anime OVA dos anos 1990, 4:3 full-frame. Fundo pintado à mão com textura de 2pincel visível, personagens pintados em cel com linhas grossas e irregulares, brilho de 3halação pesado ao redor dos holofotes, granulação de filme 16mm e leve oscilação de 4portão. O mesmo atacante de cabelo vermelho em um uniforme branco e azul marinho número 9 5sai de um campo encharcado de chuva enquanto o barulho da multidão desaparece em um único 6tom de toque. A câmera se aproxima lentamente de seu rosto. Ele diz baixinho em japonês: 7「次は、勝つ」. Paleta retrô: verde azulado suave, âmbar empoeirado, sombras marrom 8profundo. Áudio: chuva distante, um único pad de sintetizador analógico, um apito com 9muito reverb ao longe.
Configurações: modelo minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Defina essa proporção manualmente, lembre-se do padrão.

Playground do MiniMax H3 text-to-video no Atlas Cloud com o prompt OVA digitado e o clipe retrô finalizado no painel de saída
MiniMax H3 text-to-video no Atlas Cloud, prompt OVA digitado, clipe concluído. Divulgação completa: esta execução em particular deixou Aspect Ratio em 16:9 e Duration em 8, então o que você vê à direita é a versão curta widescreen. O corte de 12 segundos em 4:3 abaixo veio da chamada de API com ratio: 4:3 e duration: 12 definidos explicitamente.

O corte retrô de OVA em 4:3: o mesmo atacante saindo de um campo encharcado de chuva no estilo anime dos anos 90
H3 text-to-video, 4:3, 12 segundos. O arquivo entregue voltou 1920x1440, que é 4:3 ao pixel, com uma faixa de áudio estéreo de 32 kHz. Mostrado aqui como um GIF silencioso em taxa de quadros reduzida para manter a página leve. Gerado com minimax/h3/text-to-video no Atlas Cloud.
Passo 6: Nove imagens de referência, um personagem, quatro cortes
A consistência do personagem entre cortes é o problema mais difícil em anime de IA, e é resolvido com volume de referência. Construa o pacote primeiro: execute novamente o prompt do Passo 1 com o enquadramento trocado para frente, três quartos, perfil completo, costas, rindo, dentes cerrados, corpo inteiro, detalhe do uniforme e detalhe da chuteira. Nove imagens, aproximadamente oito centavos no total.

Quatro ângulos do mesmo personagem atacante original gerados como um pacote de referência, organizados em uma grade 2x2
Quatro dos nove ângulos de referência. O H3 aceita até nove imagens em um pacote de referência, além de referências de vídeo e áudio.
Plain1Anime 2D com cel-shading, espessura de linha consistente feita à mão, cor plana, sem 2sombreamento 3D. Mantenha o rosto, a silhueta do cabelo e o uniforme número 9 do atacante 3de referência idênticos em cada corte. Quatro cortes em uma única tomada contínua: 4(1) push-in de baixo ângulo nas chuteiras tocando o gramado, (2) whip-pan para cima até um 5close-up apertado de seus olhos, (3) plano aberto dele correndo passando por três 6defensores desenhados como silhuetas borradas, (4) congelamento em um cabeceio no ar, 7linhas de velocidade explodindo para fora. Áudio: rugido da multidão, respiração, impactos 8de chuteira no gramado, um golpe de taiko no congelamento.
Configurações: modelo minimax/h3/reference-to-video, refers = suas imagens com type: image, resolution: 2K, duration: 8 ou superior, ratio: adaptive ou 16:9.
O equivalente no Veo 3.1 não pode ser executado nessas configurações e você não precisa tentar para saber por quê. Seu endpoint de referência aceita um máximo de três imagens, e escolher esse endpoint colapsa duration para um único valor legal de 8. Um pacote de nove imagens e uma tomada de 10 segundos estão ambos fora do alcance.

Playground do MiniMax H3 reference-to-video no Atlas Cloud mostrando o contador de referências em quatro de nove e o primeiro corte no painel de saída
MiniMax H3 reference-to-video no Atlas Cloud. O contador lê Reference Materials (4/9) com MAX:9 embaixo, que é o teto na interface, não uma afirmação de uma ficha técnica. A saída é o primeiro corte, o push-in de baixo ângulo nas chuteiras.
Mais Quatro Execuções do Gerador de Vídeo de Anime MiniMax H3 que Valem a Pena
O plano Last Whistle apenas estressa quatro das diferenças. Estas quatro estressam o resto. Todas rodam no H3; as notas dizem quais o Veo 3.1 pode igualar.
- Luta sakuga ultrawide,
21:9, 10 segundos. O Veo não pode produzir 21:9 de jeito nenhum.
Plain1Ação de anime 2D com cel-shading, linhas grossas e cônicas feitas à tinta, cor plana, 2sombras de bordas duras, sem sombreamento 3D. Dois duelistas mascarados originais em um 3telhado de templo varrido pelo vento ao entardecer. Choque de lâminas, o quadro treme, 4ambos os lutadores se separam em uma explosão de quadros de impacto desenhados à mão e 5linhas de velocidade radiais. Câmera: push-in de baixo ângulo, depois um rastreamento 6lateral, depois um snap para uma silhueta ampla contra o céu laranja. Áudio: dois 7impactos metálicos agudos, estalo de pano, um golpe de taiko grave no congelamento final, 8sem música.
- Corte AMV sincronizado com batida, reference-to-video com referência de áudio. O H3 aceita até três clipes de áudio como entrada de referência. O Veo 3.1 não tem entrada de áudio alguma, apenas saída de áudio.
Plain1Montagem de anime 2D com cel-shading cortada para a faixa de áudio de referência. Cinco 2batidas curtas: chuva em uma janela, uma mão apertando uma bandagem, um horizonte da 3cidade passando por uma janela de trem, um início de corrida, um congelamento em uma mão 4estendida. Cada corte cai exatamente em uma batida forte do áudio de referência. Cor 5plana, linhas grossas à tinta, paleta noturna de alto contraste em índigo profundo e 6magenta neon.
- Cena de diálogo em japonês de duas linhas, 12 segundos. Este é o teste de estresse de sincronização labial, e 12 segundos já está fora do alcance do Veo.
Plain1Anime 2D com cel-shading, cor plana, sem sombreamento 3D. Dois personagens originais em um 2telhado na hora dourada, plano e contraplano. O primeiro diz em japonês:「本当に行くの?」. 3O segundo responde, meio sorrindo, em japonês:「もう決めた」. As bocas combinam cada 4sílaba. Luz de borda quente, sombras longas, vento suave no cabelo. Áudio: duas vozes 5japonesas distintas, trânsito distante, uma cigarra.
- Curta shonen vertical,
9:16, 8 segundos. Ambos os modelos podem fazer vertical, então este é o único lugar para realmente A/B compará-los em vez de presumir.
Plain1Anime 2D com cel-shading, composição vertical. Uma corredora adolescente original irrompe 2através de uma faixa de papel em câmera lenta, então o quadro volta à velocidade total 3enquanto ela acelera em uma reta de estádio. Linhas de velocidade, cor plana, sombras 4duras, céu gráfico ousado. Câmera: plano de acompanhamento de baixo ângulo, depois um 5whip up para o rosto dela. Áudio: rasgo de faixa, onda de multidão, uma respiração presa 6e depois liberada.
Se você quiser a gramática de prompts por trás destes, o guia de prompts do MiniMax H3 aprofunda como o H3 interpreta instruções de câmera e áudio mais do que posso aqui.
Quanto Custa uma Abertura de Anime de 60 Segundos no MiniMax H3 vs Veo 3.1
Uma abertura de anime padrão tem aproximadamente 90 segundos. Digamos oito planos de 8 segundos, 64 segundos de vídeo finalizado, mais um keyframe por plano a $0,009 cada.
Há uma discrepância real de preços que você deve saber em vez de eu esconder. O catálogo do Atlas Cloud lista o MiniMax H3 a $0,10 por segundo fixo, enquanto o readme do modelo detalha como $0,14/s em 2K e $0,10/s em 768P. O Veo 3.1 está listado a $0,20 por segundo, enquanto seu readme separa $0,40/s com áudio de $0,20/s sem.
Os botões de execução nas minhas capturas de tela resolvem isso. H3 reference-to-video, 8 segundos em 2K, cotado Run $1,12, que é exatamente $0,14 por segundo. Veo 3.1 image-to-video, 8 segundos em 1080p com áudio ativado, cotado Run $3,2, que é exatamente $0,40 por segundo. Então as taxas do readme são as que cobram, e o título do catálogo é o nível de entrada. Mostrei ambas as leituras abaixo de qualquer maneira. Estes são preços de tabela de agosto de 2026.
Tabela 4: oito planos de 8 segundos, keyframes incluídos
| Configuração | Custo de vídeo (taxa do catálogo) | Custo de vídeo (taxa do readme) | Keyframes | Faixa total |
|---|---|---|---|---|
| MiniMax H3, 2K | $6,40 | $8,96 | $0,07 | $6,47 a $9,03 |
| MiniMax H3, 768P | $6,40 | $6,40 | $0,07 | $6,47 |
| Veo 3.1, 1080p com áudio | $12,80 | $25,60 | $0,07 | $12,87 a $25,67 |
| Veo 3.1 Lite, 720p | $3,20 | $3,20 | $0,07 | $3,27 |
Preços extraídos das páginas de modelo do Atlas Cloud vinculadas na Tabela 1, agosto de 2026. Nenhum destes quatro está com desconto agora.
Duas coisas que essa tabela não inclui, e ambas pesam mais do que a taxa por segundo.
Reexecuções. Ninguém envia a primeira tomada de um plano de anime. Qualquer multiplicador que você assumir, aplique-o a ambas as colunas e a diferença aumenta na mesma proporção.
Tempo real, e este vai na direção oposta. Cronometrado de ponta a ponta em 7 de agosto de 2026: H3 em 2K para 8 segundos levou 447 segundos, cerca de 7,5 minutos. H3 text-to-video em 2K para 12 segundos levou 334 segundos. Veo 3.1 em 1080p para 8 segundos com áudio levou 152 segundos, menos de três minutos. O Veo é aproximadamente três vezes mais rápido para uma primeira tomada aqui, e se você está iterando em um plano às 2 da manhã, isso vale dinheiro real. As filas mudam, então trate estes como um instantâneo de uma tarde, não uma especificação. Mas qualquer um que cite "2 a 3 minutos" para H3 em 2K está citando um readme, não uma fila. O detalhamento 2K versus 768P aborda quando o nível superior vale os minutos extras.
Estilo de Anime, Homenagem e o que Você Pode Realmente Publicar
Tudo neste artigo é estilo e homenagem. Um personagem original, um uniforme original, um título original. Nenhum personagem de anime oficial foi gerado ou solicitado, e nenhum nome ou semelhança de jogador de futebol real foi usado. A tendência da Copa do Mundo é referenciada como um formato, porque é para isso que ela é útil.
Essa distinção não é decoração. Se você está produzindo conteúdo em estilo anime comercialmente, "no estilo de OVA dos anos 90" e "este personagem específico deste show específico" são objetos legais diferentes, e apenas um deles é um negócio.
Sobre os pesos abertos: o H3 é genuinamente baixável, e as pessoas o rodaram no primeiro dia. Um comentarista relatou 10 minutos para um clipe de 10 segundos em 480p em uma 4070 Ti Super com 16GB, e outros postaram 3 minutos em uma 5080 e 68 segundos em uma RTX 6000 Pro. Mas a auto-hospedagem roda em uma borda curta de 768; os estágios Context-IR e Regenerate-2K que produzem 2K permanecem no lado da API.
A licença tem uma pegadinha real. A licença comunitária atualmente não cobre a UE, Reino Unido, Coreia do Sul ou Estados Unidos, citando regiões "atualmente desenvolvendo ou aplicando regulamentações relacionadas à IA". Um canal formal de solicitação de licenciamento está aberto, que um comentarista do HN resumiu como "você só precisa prometer com o dedo mindinho que não vai deixar a Disney irritada e eles te enviarão uma licença". Engraçado, e também exatamente a etapa de conformidade que você não pode pular se estiver em um desses quatro territórios. O artigo sobre pesos abertos tem a lista completa de territórios.
Perguntas Frequentes
O MiniMax H3 é um bom gerador de vídeo de anime comparado ao Veo 3.1?
Para a maioria dos trabalhos de anime, H3, e principalmente por razões que não são sobre renderização. Ele roda de 4 a 15 segundos contra os 4, 6 ou 8 do Veo, oferece seis proporções de tela incluindo 4:3 e 21:9 contra duas do Veo, lista japonês entre 11 idiomas de diálogo nativamente estáveis e aceita nove imagens de referência contra três do Veo. O Veo 3.1 vence em uma situação específica: quando você precisa de seed para reexecuções reproduzíveis, ou negative_prompt para impedir que um plano derive para sombreamento de renderização 3D. O H3 não tem nenhum dos dois parâmetros. Se seu pipeline depende de um deles, essa é uma razão genuína para ficar.
O Veo 3.1 pode gerar anime em 4:3 ou um clipe de 15 segundos?
Não, e não por razões estilísticas. O enum aspect_ratio do Veo 3.1 contém exatamente 16:9 e 9:16, e seu enum duration contém exatamente 4, 6 e 8. Não há valor 4:3 para selecionar e nenhuma maneira de solicitar 12 ou 15 segundos. Se sua referência é um anime de TV ou OVA dos anos 90, o enquadramento está fora do alcance no Veo e disponível no H3.
Por que meu clipe de anime do Veo 3.1 voltou silencioso?
Porque generate_audio padrão é false na API. O alternador do playground geralmente já está ativado, então isso só afeta quem chama a API diretamente. Defina generate_audio: true explicitamente. Enquanto estiver lá, defina resolution também, já que o padrão é 720p em vez do 1080p ou 4k que você provavelmente pretendia.
O MiniMax H3 faz diálogo em japonês e sincronização labial para anime?
Sim. O model card lista 11 idiomas com suporte estável a diálogo: árabe, chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo e espanhol. O áudio é gerado conjuntamente com a imagem em estéreo de 32 kHz, em vez de dublado depois, que é por que o timing da boca se mantém por toda uma linha em vez das primeiras sílabas. Escreva a linha em japonês diretamente no prompt em japonês.
Quantas imagens de referência posso usar para manter um personagem de anime consistente?
O MiniMax H3 aceita até 9 imagens, até 3 clipes de vídeo e até 3 clipes de áudio, com um teto de 12 arquivos no total. O endpoint reference-to-video do Veo 3.1 aceita 1 a 3 imagens, e selecioná-lo colapsa duration para 8 como o único valor legal. Para um personagem de anime recorrente em uma série, essa diferença é o jogo inteiro.
O MiniMax H3 tem pesos abertos, então posso rodar meu pipeline de anime localmente gratuitamente?
Você pode baixar e executar, com três ressalvas. A inferência auto-hospedada roda em uma borda curta de 768, e os estágios Context-IR e Regenerate-2K que produzem saída 2K permanecem no lado da API. As velocidades locais do mundo real variam amplamente por placa: aproximadamente 10 minutos para um clipe de 10 segundos em 480p em uma 4070 Ti Super, cerca de 3 minutos em uma 5080, cerca de 68 segundos em uma RTX 6000 Pro, conforme o tópico do ComfyUI do dia 0. E a licença comunitária atualmente não cobre a UE, Reino Unido, Coreia do Sul ou EUA, então se você estiver em um deles, precisa da licença formal antes do uso comercial.






