Seedance 2.5 já está disponível — Primeiro na Atlas Cloud

Gerador de Vídeo de Anime MiniMax H3: 15 Segundos, 4:3 e o Cartão de Título que o Veo 3.1 Estragou

MiniMax H3 gerador de vídeo anime vs Veo 3.1 no mesmo keyframe. H3 roda de 4 a 15s e seis proporções, Veo limita a 8s e duas. Diálogo em japonês, 9 referências, execuções reais.

Durante todo o verão, meu feed foi o mesmo vídeo em loop. Jogadores da Copa do Mundo redesenhados como protagonistas de shonen. Um ditador. Um capitão pirata. Um mentor envelhecido que aparece nos últimos quatro segundos. Milhões de visualizações por postagem, e a história se atualiza após quase todas as partidas.

Ninguém que faz isso está escrevendo postagens de benchmark. Eles estão escolhendo um modelo, queimando créditos e enviando antes do próximo pontapé inicial.

Então peguei um keyframe de anime e um prompt, e testei o MiniMax H3 como gerador de vídeo de anime contra o Veo 3.1, ambos levados às suas configurações máximas com entradas idênticas.

A primeira coisa que quebrou não foi a qualidade da imagem. Foi um menu suspenso. O Veo 3.1 para nos 8 segundos e oferece exatamente duas proporções. Um plano que segura um rosto, faz um whip pan com a bola e depois permite que um cartão de título pouse não cabe em 8 segundos. Nunca teve a chance de falhar em qualidade.

Principais conclusões

  • O enum duration do Veo 3.1 é [4, 6, 8] e seu enum aspect_ratio é [16:9, 9:16]. O MiniMax H3 roda qualquer segundo inteiro de 4 a 15 e oferece 21:9, 16:9, 4:3, 1:1, 3:4, 9:16. Sem 4:3 no Veo significa sem moldura OVA retrô, de jeito nenhum.
  • O cartão do modelo H3 lista 11 idiomas de diálogo nativamente estáveis e o japonês é um deles. Áudio e imagem são gerados juntos em 32 kHz estéreo, não dublados depois.
  • Os pacotes de referência não são próximos: o H3 aceita até 9 imagens mais até 3 vídeos e 3 clipes de áudio (12 arquivos no máximo). O endpoint de referência do Veo 3.1 aceita 3 imagens, e no momento em que você o usa, duration colapsa para apenas [8].
  • Duas armadilhas que arruínam testes silenciosamente: a API do Veo tem como padrão generate_audio como false e resolution como 720p, e o ratio do text-to-video do H3 tem como padrão 1:1. Deixe-os assim e você estará comparando um clipe silencioso em 720p com um quadrado.
  • O Veo 3.1 mantém duas coisas que o H3 não tem: seed e negative_prompt. Para anime 2D, esse segundo realmente importa, e mostrarei onde.

MiniMax H3 Gerador de Vídeo de Anime vs Veo 3.1, O Mesmo Frame Lado a Lado

Um personagem original. Um keyframe. Um prompt, copiado caractere por caractere em ambos os modelos. Todo o resto maximizado em cada lado.

Zdu1SJ7kN_o

MiniMax H3, imagem-para-vídeo, 2K, 8 segundos, áudio nativo. Ligue o som: o som da multidão, o impacto na bola e o grito em japonês são gerados na mesma passagem que a imagem. Gerado com minimax/h3/image-to-video no Atlas Cloud.

r_7UCdbs8Mk

Veo 3.1, imagem-para-vídeo, 1080p, 8 segundos, generateaudio ativado manualmente, mais um negativeprompt mantendo o traço da arte linear chapado. Mesmo primeiro frame, mesmas palavras. Gerado com google/veo3.1/image-to-video no Atlas Cloud.

Ambos desenham lindamente. O plano aberto do chute do Veo, com linhas de impacto desenhadas à mão e um efeito sonoro de mangá flutuando no ar, é genuinamente encantador. Esse é o ponto de partida honesto, e é por isso que o resto deste artigo é sobre parâmetros e seguimento de instruções, em vez de vibrações.

Por que a Maioria dos Testes do MiniMax H3 Gerador de Vídeo de Anime vs Veo 3.1 Dá Errado

Duas coisas aconteceram ao mesmo tempo neste verão.

Anime se tornou o formato de maior volume em vídeo de IA. A Copa do Mundo de 2026 foi reescrita como um torneio shonen, com jogadores escalados como um ditador, um capitão pirata, um general da marinha e um mentor, e histórias que "evoluem após quase todas as partidas" no TikTok, Instagram, X e YouTube (Complex, julho de 2026).

E o MiniMax H3 foi lançado com pesos abertos. O tópico do ComfyUI no dia 0 atingiu 330 pontos e 95 comentários, com pessoas postando números locais reais em horas (Hacker News, agosto de 2026).

Junte isso e você esperaria uma pilha de comparações de anime. Quase não há nenhuma, porque a maioria dos testes é construída errada de uma de quatro maneiras.

Eles comparam imagens, não restrições. Os planos de anime são tempo. Um whip pan para um cartão de título é um problema de duração antes de ser um problema de renderização.

Eles esquecem que a API do Veo é silenciosa por padrão. Na API, generate_audio é false e resolution é 720p. Muitos posts "Veo não tem áudio em anime" são apenas alguém que nunca virou um booleano.

Eles esquecem que o text-to-video do H3 é quadrado por padrão. ratio tem como padrão 1:1, não 16:9. Execute um prompt t2v de anime sem defini-lo e você obtém um clipe quadrado e uma conclusão confusa.

Eles testam com prompts fotorrealistas. "Cinematográfico, luz volumétrica, profundidade de campo rasa" é exatamente o vocabulário que arrasta um modelo 2D para sombreamento de renderização 3D. O modo de falha em anime não é desfoque. É plástico.

As três configurações que decidem um teste de anime antes de você pressionar executar

Antes de qualquer outra coisa, defina estas em ambos os lados ou a comparação é inválida.

ConfiguraçãoMiniMax H3Veo 3.1O que acontece se você pular
ÁudioGerado com a imagem, sempre ligadogenerate_audio padrão é falseVeo retorna um clipe silencioso e parece pior do que é
Formato do quadroratio padrão é 1:1 no text-to-videoaspect_ratio padrão é 16:9H3 entrega um corte quadrado de anime que você não pode usar
Resoluçãopadrão é 2Kpadrão é 720pVocê compara 2K contra 720p e chama de diferença de qualidade

A Ficha Técnica de Anime do MiniMax H3 vs Veo 3.1: Duração, Proporção, Áudio, Referências

Extraí os esquemas de entrada ativos de ambos os modelos, em vez de confiar em qualquer post de lançamento. Cada valor abaixo é um enum que você pode ler nos próprios modelos, não uma impressão.

Tabela 1: MiniMax H3 vs Veo 3.1, os parâmetros que decidem um plano de anime

 MiniMax H3Veo 3.1
Duração4 a 15, cada segundo inteiro (padrão 8)4, 6, 8 (padrão 8)
Proporções21:9, 16:9, 4:3, 1:1, 3:4, 9:1616:9, 9:16
Padrão de proporção (text-to-video)1:0116:09
Resolução768P, 2K (padrão 2K)720p, 1080p, 4k (padrão 720p)
ÁudioGerado conjuntamente, 32 kHz estéreogenerate_audio, padrão false
Idiomas de diálogo nativos11 estáveis, japonês incluídoNão publicado como lista estável
Pacote de referênciaaté 9 imagens, 3 vídeos, 3 clipes de áudio, 12 arquivos no total3 imagens
Duração ao usar referênciasainda 4 a 15colapsa para apenas 8
seednão disponíveldisponível
negative_promptnão disponíveldisponível
Pesosbaixáveisfechados

Duração, proporção, resolução, áudio e limites de referência são lidos dos esquemas ativos nas páginas MiniMax H3 image-to-video, H3 text-to-video, H3 reference-to-video, Veo 3.1 image-to-video e Veo 3.1 reference-to-video. O limite de 9 imagens e 12 arquivos de referência e a lista de 11 idiomas de diálogo vêm do cartão do modelo MiniMax H3 (Hugging Face, agosto de 2026).

Agora os placares, porque eles dizem algo diferente da ficha técnica e ambos importam.

Tabela 2: Elo de voto popular e preço por minuto, instantâneo de 7 de agosto de 2026

ModeloTexto para vídeo (com áudio)Imagem para vídeo (com áudio)$/min
Gemini Omni Flash1.244 (#1) ±71.191 (#2) ±9$6,00
MiniMax H31.238 (#2) ±91.190 (#3) ±10$7,80
Dreamina Seedance 2.0 720p1.224 (#3) ±61.198 (#1) ±7$9,07
Kling 3.0 1080p (Pro)1.111 (#7) ±6não listado no top 10$20,16
Veo 3.11.093 (#11) ±71.085 (#10) ±7$24,00
Veo 3.1 Fast1.091 (#14) ±6não listado no top 10$9,00
Veo 3.1 Lite1.089 (#15) ±7não listado no top 10$4,80

Figuras de Elo e preço do Artificial Analysis Video Arena (Artificial Analysis, agosto de 2026). Estes são votos populares contínuos e eles mudam. A coluna $/min é uma estimativa normalizada do modelo, não sua fatura.

Uma diferença de Elo de 145 pontos é grande, mas é um voto de propósito geral, não um voto de anime. E aqui está a parte que tenho que dizer claramente: a MiniMax não comercializa o H3 como um modelo de anime. O feedback interno de primeira linha lista filme, animação e drama em quadrinhos como as áreas não focadas pelo H3. Portanto, a questão interessante não é "qual é o modelo de anime". É por que o modelo que não está se vendendo como anime ainda ganha o plano, e onde o Google ainda leva a rodada.

Uma nota prática antes do tutorial. Cada modelo abaixo é executado através do mesmo console e da mesma chave de API, que é a única razão pela qual os parâmetros são comparáveis. Mesma fila, mesma autenticação, uma conta. Se você configurar o GPT Image 2 em um serviço e o Veo em outro, metade das diferenças que você encontrar será de encanamento, em vez de modelo.

Construa o Plano: MiniMax H3 vs Veo 3.1, Passo a Passo

Um exemplo contínuo, do começo ao fim. "Último Apito": um atacante adolescente original, cabelo vermelho, camisa número 9 branca e azul-marinho, refletores, um whip pan no chute e um cartão de título em japonês que precisa pousar nos últimos dois segundos e ficar firme.

Nenhum jogador real, nenhum personagem oficial, nenhum IP de anime existente. Estilo e homenagem apenas. Mais sobre o porquê em um momento.

Passo 1: Projete o keyframe de anime com GPT Image 2

O keyframe carrega a direção de arte para que o modelo de vídeo não precise inventá-la. Observe o espaço negativo no terço esquerdo: é deliberado. O cartão de título será escrito lá pelo modelo de vídeo, e esse é o teste de estabilidade de texto.

plaintext
1Um único quadro de um anime esportivo shonen moderno. Animação 2D com cel-shading, traço
2à mão com espessura consistente, preenchimentos de cor chapada, sombras gráficas duras,
3absolutamente sem sombreamento 3D e sem pele fotorrealista. Close-up em um atacante
4adolescente original: cabelo despenteado vermelho-escuro, camisa branca e azul-marinho com
5o número 9, suor e marcas de grama em uma bochecha, olhos arregalados com determinação
6exausta, boca aberta no meio de um grito. Atrás dele, refletores do estádio brilham em
7uma parede de cor de multidão borrada; linhas de velocidade radiais explodem do centro do
8quadro; uma folha de grama congela no ar. Paleta saturada, sombras ciano profundas, luz
9de borda laranja quente. Composição 16:9, o personagem enquadrado à direita do centro,
10espaço negativo limpo no terço esquerdo. Nenhum texto em qualquer lugar da imagem.

Configurações: modelo openai/gpt-image-2/text-to-image, qualidade high, tamanho 16:9 (2048x1152). Nada mais.

Interface do gerador de imagens de IA mostrando prompt e jogador de futebol de anime gerado

Playground do GPT Image 2 no Atlas Cloud com o prompt do keyframe do Último Apito e o quadro de anime finalizado no painel de saída

GPT Image 2 no Atlas Cloud: qualidade configurada para alta, o keyframe finalizado à direita.

Jogador de futebol de anime de cabelo vermelho gritando em um estádio lotado

O keyframe base de anime: um atacante original de cabelo vermelho no meio de um grito sob refletores do estádio, com cel-shading, cor chapada e linhas de velocidade

O keyframe que ambos os modelos recebem. Cor chapada, sombras duras e um terço esquerdo vazio esperando por um cartão de título.

Passo 2: MiniMax H3 image-to-video, tudo maximizado

Mesma imagem de entrada, saída 2K. Segurei o H3 em 8 segundos aqui apenas para igualar o teto do Veo. Esse não é o limite do H3 e o Passo 4 remove o limite.

plaintext
1Anime 2D com cel-shading, traço à mão com espessura consistente, cor chapada, sem
2sombreamento 3D. Segure o rosto do atacante por um momento, depois um whip pan violento
3segue a bola enquanto ele a chuta, o pan borrando o quadro em rastros de movimento sakuga
4riscados. Um quadro de silêncio total no impacto. Nos dois segundos finais, letras
5brancas em negrito em japonês lendo ラストホイッスル surgem no terço esquerdo do quadro
6e permanecem firmes, sem distorção, sem cintilação, sem deriva. O atacante grita uma
7linha em japonês: 「まだ終わってない!」. Áudio: rugido do estádio crescendo, um único
8impacto nítido de chute na bola, um toque de taiko grave sob o cartão de título.

Configurações: modelo minimax/h3/image-to-video, resolution: 2K, duration: 8, ratio: adaptive (imagem-para-vídeo pega a forma do quadro da sua imagem de entrada), image = a saída do Passo 1.

Um aviso se você for para text-to-video: escreva ratio: 16:9 explicitamente. O padrão é 1:1 e ele felizmente lhe dará um corte quadrado de anime.

Interface do gerador de vídeo de IA mostrando prompt e vídeo de anime gerado

Playground do MiniMax H3 image-to-video no Atlas Cloud com o prompt do Último Apito, keyframe carregado e o clipe finalizado no painel de saída

MiniMax H3 image-to-video no Atlas Cloud: o keyframe do Passo 1 carregado à esquerda, o clipe finalizado sendo reproduzido à direita.

Passo 3: Veo 3.1 image-to-video, áudio ativado manualmente

O prompt é idêntico, palavra por palavra. Mude um único adjetivo e deixa de ser uma comparação. O que muda é o campo extra que o Veo oferece e o H3 não.

negative_prompt, que para anime 2D é o controle mais útil desta lista:

plaintext
1Renderização 3D, CGI, sombreamento plástico, pele fotorrealista, filmagem live action,
2sopa de desfoque de movimento, letras distorcidas, texto sem sentido, dedos extras, barra
3de legendas

Configurações: modelo google/veo3.1/image-to-video, resolution: 1080p (mude, o padrão é 720p), duration: 8 (este é o teto), aspect_ratio: 16:9, generate_audio: true (o padrão da API é false, esta é a armadilha do clipe silencioso), seed: 20260807, image = a mesma saída do Passo 1.

Interface do gerador de vídeo de IA mostrando configurações de entrada e vídeo de anime gerado

Playground do Veo 3.1 image-to-video no Atlas Cloud mostrando generate audio ativado, o keyframe de anime carregado e o clipe finalizado no painel de saída

Veo 3.1 image-to-video no Atlas Cloud, com Generate Audio ativado e o clipe finalizado à direita.

Passo 4: Pontue em cinco eixos específicos de anime

Nada para gerar aqui. Apenas olhe, nas coisas em que o anime realmente quebra. Ambos os clipes estão incorporados perto do topo deste artigo, para que você possa pontuá-los em vez de aceitar minha palavra.

Comparação lado a lado de cenas de estádio de futebol borradas e nítidas

Lado a lado do quadro final de ambos os clipes, MiniMax H3 à esquerda com letras japonesas limpas, Veo 3.1 à direita com caracteres verticais sem sentido

O último quadro de cada clipe. À esquerda, o H3 escreveu ラストホイッスル, todos os oito katakana corretos e firmes. À direita, o Veo 3.1 escreveu três caracteres que não são a palavra solicitada e não formam uma.

O cartão de título é onde a rodada foi decidida, e não foi perto. O H3 renderizou os katakana solicitados exatamente, com bordas duras e estáveis, sobre um pan riscado da baliza. O Veo 3.1 produziu uma pilha vertical de três caracteres que não são nem a palavra solicitada nem uma palavra. No mesmo quadro, também tirou o personagem do enquadramento e deixou o fundo escorregar para um plano de estádio semifotorrealista, apesar de photorealistic skin e 3D render estarem no negative prompt.

Tabela 3: cinco eixos que decidem um corte de anime, a partir dessas duas execuções

EixoMiniMax H3Veo 3.1
Continuidade do personagem do keyframeManteve o rosto, cabelo e uniforme exatos por 8 segundosRedesenhou o personagem em um novo plano aberto, no modelo mas um desenho diferente
Espessura do traço e cel shading chapadoManteve, sem deriva para 3DManteve no plano médio, derivou para um plano de estádio fotográfico no final
Cartão de título em japonêsラストホイッスル renderizado corretamente e firmeTrês caracteres, não a palavra solicitada, não uma palavra
Faixa de áudio entregue32 kHz estéreo, exatamente como o cartão do modelo afirma48 kHz estéreo, presente apenas porque configurei generate_audio eu mesmo
Whip pan e borrão sakugaExecutado como um pan borrado no títuloSubstituído por um corte seco para uma nova configuração

Essa última linha é a crítica pública mais alta ao H3 até agora, que é exatamente por que a escrevi em ambos os prompts. No tópico do ComfyUI do dia 0, o usuário fwip reclamou que mesmo os prompts de demonstração oficiais foram ignorados: "um violento WHIP PAN do telhado que BORRA as palavras flutuantes com ele, com rastros de movimento. E o vídeo simplesmente não fez nada dessa transição, apenas a substituiu por um corte."

Nesta execução, foi o Veo que trocou o pan por um corte, e o H3 que borrou. Uma tomada de cada não é um veredito, e eu não afirmaria o contrário. Mas isso significa que a crítica não é específica do H3: whip pans são a instrução menos confiável em todo este teste de ambos os lados. Se o seu storyboard depende de um, planeje ao redor dele em vez de através dele.

Passo 5: O corte OVA retrô 4:3 que o Veo 3.1 estruturalmente não pode produzir

Isso não é uma preferência de qualidade. É um muro. O enum aspect_ratio do Veo tem dois valores e nenhum é 4:3, e seu enum duration não tem 12. O visual OVA dos anos 90 simplesmente não é endereçável.

plaintext
1Um corte de anime OVA dos anos 1990, 4:3 full-frame. Fundo pintado à mão com textura de
2pincel visível, personagens pintados em cel com linhas de tinta grossas e irregulares,
3halo pesado ao redor dos refletores, grão de filme 16mm e leve oscilação de portão. O
4mesmo atacante de cabelo vermelho em uma camisa número 9 branca e azul-marinho sai de um
5campo encharcado de chuva enquanto o barulho da multidão desaparece em um único tom
6tilintante. A câmera se aproxima lentamente de seu rosto. Ele diz calmamente em japonês:
7「次は、勝つ」. Paleta retrô: verde-azulado suave, âmbar empoeirado, sombras marrom-
8avermelhadas profundas. Áudio: chuva distante, um único pad sintético analógico, um
9apito com muito reverb ao longe.

Configurações: modelo minimax/h3/text-to-video, resolution: 2K, duration: 12, ratio: 4:3. Defina essa proporção manualmente, lembre-se do padrão.

Interface do gerador de vídeo de IA mostrando prompt e vídeo de anime gerado

Playground do MiniMax H3 text-to-video no Atlas Cloud com o prompt OVA digitado e o clipe retrô finalizado no painel de saída

MiniMax H3 text-to-video no Atlas Cloud, prompt OVA digitado, clipe concluído. Divulgação completa: esta execução específica deixou Aspect Ratio em 16:9 e Duration em 8, então o que você vê à direita é a versão curta widescreen. O corte de doze segundos 4:3 abaixo veio da chamada de API com ratio: 4:3 e duration: 12 definidos explicitamente.

Jogador de futebol de anime em uniforme sujo em pé em um estádio

O corte OVA retrô 4:3: o mesmo atacante saindo de um campo encharcado de chuva no estilo anime dos anos 90

H3 text-to-video, 4:3, 12 segundos. O arquivo entregue veio em 1920x1440, que é 4:3 ao pixel, com uma faixa estéreo de 32 kHz. Mostrado aqui como um GIF silencioso em taxa de quadros reduzida para manter a página leve. Gerado com minimax/h3/text-to-video no Atlas Cloud.

Passo 6: Nove imagens de referência, um personagem, quatro cortes

A consistência do personagem entre planos é o problema mais difícil no anime de IA, e é resolvido com volume de referência. Monte o pacote primeiro: execute novamente o prompt do Passo 1 com o enquadramento trocado para frente, três quartos, perfil completo, costas, rindo, dentes cerrados, corpo inteiro, detalhe do uniforme e detalhe da chuteira. Nove imagens, aproximadamente oito centavos no total.

Quatro ilustrações de um jogador de futebol de anime de cabelo vermelho vestindo o número 9

Quatro ângulos do mesmo personagem atacante original gerados como um pacote de referência, dispostos em uma grade dois por dois

Quatro dos nove ângulos de referência. O H3 aceita até nove imagens em um pacote de referência, além de referências de vídeo e áudio.

plaintext
1Anime 2D com cel-shading, traço à mão consistente, cor chapada, sem sombreamento 3D.
2Mantenha o rosto, a silhueta do cabelo e a camisa número 9 do atacante referenciado
3idênticos em cada corte. Quatro cortes em uma única tomada contínua: (1) push-in ângulo
4baixo nas chuteiras dele batendo no gramado, (2) whip-pan para cima em um close-up
5apertado de seus olhos, (3) plano aberto dele correndo passando por três defensores
6desenhados como silhuetas borradas, (4) congelamento em um cabeceio no ar, linhas de
7velocidade explodindo para fora. Áudio: rugido da multidão, respiração, impactos de
8chuteira no gramado, um toque de taiko no congelamento.

Configurações: modelo minimax/h3/reference-to-video, refers = suas imagens com type: image, resolution: 2K, duration: 8 ou superior, ratio: adaptive ou 16:9.

O equivalente do Veo 3.1 não pode ser executado com essas configurações e você não precisa tentar para saber por quê. Seu endpoint de referência aceita no máximo três imagens, e escolher esse endpoint colapsa duration para um único valor legal de 8. Um pacote de nove imagens e uma tomada de 10 segundos estão ambos fora do alcance.

Interface do gerador de vídeo de IA mostrando entrada de prompt e vídeo de anime gerado

Playground do MiniMax H3 reference-to-video no Atlas Cloud mostrando o contador de referências em quatro de nove e o primeiro corte no painel de saída

MiniMax H3 reference-to-video no Atlas Cloud. O contador lê Reference Materials (4/9) com MAX:9 abaixo, que é o teto na interface, em vez de uma afirmação de uma ficha técnica. A saída é o corte um, o push-in ângulo baixo nas chuteiras.

Mais Quatro Execuções do MiniMax H3 Gerador de Vídeo de Anime Que Valem a Pena

O plano do Último Apito apenas estressa quatro das diferenças. Estas quatro estressam o resto. Todas rodam no H3; as notas dizem quais o Veo 3.1 pode igualar.

  1. Luta sakuga ultra-wide,21:9, 10 segundos. O Veo não pode produzir 21:9 de jeito nenhum.
plaintext
1Ação de anime 2D com cel-shading, linhas grossas e afuniladas a tinta, cor chapada,
2sombras duras, sem sombreamento 3D. Dois duelistas mascarados originais em um telhado de
3templo varrido pelo vento ao entardecer. Choque de lâminas, o quadro treme, ambos os
4lutadores se separam em uma explosão de quadros de impacto desenhados à mão e linhas de
5velocidade radiais. Câmera: push-in ângulo baixo, depois um track lateral, depois um snap
6para uma silhueta ampla contra o céu laranja. Áudio: dois choques metálicos agudos, som
7de pano, um toque de taiko grave no congelamento final, sem música.
  1. Corte AMV sincronizado com batida, reference-to-video com referência de áudio. O H3 aceita até três clipes de áudio como entrada de referência. O Veo 3.1 não tem entrada de áudio, apenas saída de áudio.
plaintext
1Montagem de anime 2D com cel-shading cortada para a faixa de áudio referenciada. Cinco
2batidas curtas: chuva em uma janela, uma mão apertando uma bandagem, um horizonte da
3cidade passando por uma janela de trem, um início de corrida, um congelamento em uma mão
4estendida. Cada corte cai exatamente no downbeat do áudio referenciado. Cor chapada,
5linhas grossas a tinta, paleta noturna de alto contraste de índigo profundo e magenta
6néon.
  1. Cena de diálogo em japonês de duas linhas, 12 segundos. Este é o teste de estresse de sincronização labial, e 12 segundos já estão fora do alcance do Veo.
plaintext
1Anime 2D com cel-shading, cor chapada, sem sombreamento 3D. Dois personagens originais em
2um telhado na hora dourada, plano e contraplano. O primeiro diz em japonês:
3「本当に行くの?」. O segundo responde, meio sorrindo, em japonês: 「もう決めた」. As
4bocas combinam cada sílaba. Luz de borda quente, sombras longas, vento suave no cabelo.
5Áudio: duas vozes japonesas distintas, trânsito distante, uma cigarra.
  1. Curta shonen vertical,9:16, 8 segundos. Ambos os modelos podem fazer vertical, então este é o único lugar para realmente compará-los A/B em vez de assumir.
plaintext
1Anime 2D com cel-shading, composição vertical. Uma corredora adolescente original
2atravessa uma faixa de papel em câmera lenta, então o quadro volta abruptamente à
3velocidade total enquanto ela acelera em uma reta de estádio. Linhas de velocidade, cor
4chapada, sombras duras, céu gráfico ousado. Câmera: plano de seguimento ângulo baixo,
5depois um whip para o rosto dela. Áudio: rasgo da faixa, surto da multidão, uma respiração
6segurada e depois solta.

Se você quiser a gramática de prompt por trás disso, o guia de prompt do MiniMax H3 aprofunda como o H3 analisa instruções de câmera e áudio mais do que posso aqui.

Quanto Custa uma Abertura de Anime de 60 Segundos no MiniMax H3 vs Veo 3.1

Uma abertura de anime padrão tem aproximadamente 90 segundos. Digamos oito planos de 8 segundos, 64 segundos de vídeo finalizado, mais um keyframe por plano a $0,009 cada.

Há uma discrepância de preços real que você deve saber, em vez de eu esconder. O catálogo do Atlas Cloud lista o MiniMax H3 a $0,10 por segundo fixo, enquanto o readme do modelo detalha $0,14/s em 2K e $0,10/s em 768P. O Veo 3.1 está listado a $0,20 por segundo, enquanto seu readme separa $0,40/s com áudio de $0,20/s sem.

Os botões de execução nas minhas capturas de tela resolvem isso. H3 reference-to-video, 8 segundos em 2K, cotado Run $1.12, que é exatamente $0,14 por segundo. Veo 3.1 image-to-video, 8 segundos em 1080p com áudio ligado, cotado Run $3.2, que é exatamente $0,40 por segundo. Portanto, as taxas do readme são as que cobram, e o título do catálogo é o nível de entrada. Mostrei ambas as leituras abaixo de qualquer maneira. Estes são preços de tabela em agosto de 2026.

Tabela 4: oito planos de 8 segundos, keyframes incluídos

ConfiguraçãoCusto de vídeo (taxa do catálogo)Custo de vídeo (taxa do readme)KeyframesFaixa total
MiniMax H3, 2K$6,40$8,96$0,07$6,47 a $9,03
MiniMax H3, 768P$6,40$6,40$0,07$6,47
Veo 3.1, 1080p com áudio$12,80$25,60$0,07$12,87 a $25,67
Veo 3.1 Lite, 720p$3,20$3,20$0,07$3,27

Preços extraídos das páginas de modelo do Atlas Cloud vinculadas na Tabela 1, agosto de 2026. Nenhum destes quatro está com desconto agora.

Duas coisas que a tabela não inclui, e ambas pesam mais do que a taxa por segundo.

Retentativas. Ninguém entrega a primeira tomada de um plano de anime. Seja qual for o multiplicador que você assumir, aplique-o a ambas as colunas e a lacuna aumenta na mesma proporção.

Tempo real, e este vai na direção oposta. Cronometrado do início ao fim em 7 de agosto de 2026: H3 em 2K por 8 segundos levou 447 segundos, cerca de 7,5 minutos. H3 text-to-video em 2K por 12 segundos levou 334 segundos. Veo 3.1 em 1080p por 8 segundos com áudio levou 152 segundos, menos de três minutos. O Veo é aproximadamente três vezes mais rápido para uma primeira tomada aqui, e se você está iterando em um plano às 2h da manhã, isso vale dinheiro real. As filas mudam, então trate estas como um instantâneo de uma tarde, não uma especificação. Mas qualquer um que cite "2 a 3 minutos" para H3 em 2K está citando um readme, não uma fila. O detalhamento 2K versus 768P cobre quando o nível superior vale os minutos extras.

Estilo de Anime, Homenagem e o Que Você Pode Realmente Publicar

Tudo neste artigo é estilo e homenagem. Um personagem original, um uniforme original, um título original. Nenhum personagem de anime oficial foi gerado ou solicitado, e nenhum nome ou aparência de jogador de futebol real foi usado. A tendência da Copa do Mundo é referenciada como um formato, porque é para isso que é útil.

Essa distinção não é decoração. Se você está produzindo conteúdo com estilo de anime comercialmente, "no estilo de OVA dos anos 90" e "este personagem específico deste programa específico" são objetos legais diferentes, e apenas um deles é um negócio.

Sobre os pesos abertos: o H3 é genuinamente baixável, e as pessoas o executaram no primeiro dia. Um comentarista relatou 10 minutos para um clipe de 10 segundos em 480p em uma 4070 Ti Super com 16 GB, e outros postaram 3 minutos em uma 5080 e 68 segundos em uma RTX 6000 Pro. Mas a auto-hospedagem roda em uma borda curta de 768; os estágios Context-IR e Regenerate-2K que produzem 2K permanecem no lado da API.

A licença tem uma pegadinha real. A licença comunitária atualmente não cobre a UE, Reino Unido, Coreia do Sul ou Estados Unidos, citando regiões "atualmente desenvolvendo ou aplicando regulamentações relacionadas à IA". Um canal formal de solicitação de licenciamento está aberto, que um comentarista do HN resumiu como "você só precisa prometer de dedinho que não vai deixar a Disney brava e eles enviarão uma licença". Engraçado, e também exatamente a etapa de conformidade que você não pode pular se estiver em um desses quatro territórios. O artigo sobre pesos abertos tem a lista completa de territórios.

Perguntas Frequentes

O MiniMax H3 é um bom gerador de vídeo de anime comparado ao Veo 3.1?

Para a maioria dos trabalhos de anime, H3, e principalmente por razões que não são sobre renderização. Ele roda de 4 a 15 segundos contra os 4, 6 ou 8 do Veo, oferece seis proporções de aspecto incluindo 4:3 e 21:9 contra as duas do Veo, lista japonês entre 11 idiomas de diálogo nativamente estáveis e aceita nove imagens de referência contra as três do Veo. O Veo 3.1 vence em uma situação específica: quando você precisa de seed para retomadas reproduzíveis, ou negative_prompt para impedir que um plano derive para sombreamento 3D. O H3 não tem nenhum dos dois parâmetros. Se seu pipeline depende de um deles, essa é uma razão genuína para ficar.

O Veo 3.1 pode gerar anime em 4:3 ou um clipe de 15 segundos?

Não, e não por razões estilísticas. O enum aspect_ratio do Veo 3.1 contém exatamente 16:9 e 9:16, e seu enum duration contém exatamente 4, 6 e 8. Não há valor 4:3 para selecionar e nenhuma maneira de solicitar 12 ou 15 segundos. Se sua referência é um anime de TV dos anos 90 ou OVA, o enquadramento está fora do alcance no Veo e disponível no H3.

Por que meu clipe de anime do Veo 3.1 voltou silencioso?

Porque generate_audio tem como padrão false na API. O alternador do playground geralmente já está ligado, então isso só morde quem chama a API diretamente. Defina generate_audio: true explicitamente. Enquanto estiver lá, defina resolution também, já que tem como padrão 720p em vez do 1080p ou 4k que você provavelmente queria.

O MiniMax H3 faz diálogo em japonês e sincronização labial para anime?

Sim. O cartão do modelo lista 11 idiomas com suporte estável de diálogo: árabe, chinês, inglês, francês, alemão, italiano, japonês, coreano, português, russo e espanhol. O áudio é gerado em conjunto com a imagem a 32 kHz estéreo, em vez de dublado depois, que é por que o timing da boca se mantém em toda uma linha em vez das primeiras sílabas. Escreva a linha em japonês diretamente no prompt em japonês.

Quantas imagens de referência posso usar para manter um personagem de anime consistente?

O MiniMax H3 aceita até 9 imagens, até 3 clipes de vídeo e até 3 clipes de áudio, com um teto rígido de 12 arquivos em todos os tipos. O endpoint reference-to-video do Veo 3.1 aceita 1 a 3 imagens, e selecioná-lo colapsa duration para 8 como o único valor legal. Para um personagem de anime recorrente em uma série, essa diferença é o jogo inteiro.

O MiniMax H3 tem pesos abertos, então posso executar meu pipeline de anime localmente de graça?

Você pode baixar e executar, com três ressalvas. A inferência auto-hospedada roda em uma borda curta de 768, e os estágios Context-IR e Regenerate-2K que produzem saída 2K permanecem no lado da API. As velocidades locais do mundo real variam muito por placa: aproximadamente 10 minutos para um clipe de 10 segundos em 480p em uma 4070 Ti Super, cerca de 3 minutos em uma 5080, cerca de 68 segundos em uma RTX 6000 Pro, de acordo com o tópico do ComfyUI do dia zero. E a licença comunitária atualmente não cobre a UE, Reino Unido, Coreia do Sul ou EUA, então se você estiver em um desses, precisa da licença formal antes do uso comercial.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos