Todos fazem a mesma coisa no primeiro dia. Abres o menu suspenso de duração, vês 15 e começas a dividir. Um filme de dez minutos? Quarenta gerações. Um vídeo explicativo de três minutos? Doze. Depois olhas para o número que essa divisão produziu, fechas o separador e decides que o modelo não está pronto para nada com uma história.
Eu também fiz a divisão. Depois executei o ffmpeg em nove clipes reais do H3 e encontrei algo que tornou todo o cálculo ridículo.
Um desses clipes tem 15,10 segundos de duração. Lá dentro, o detetor de cenas sinaliza dez cortes limpos. Dez. Guarda-roupa diferente, enquadramento diferente, fundos diferentes, cartões de texto de ecrã inteiro, tudo dentro de uma única geração que custou o preço de uma geração. Se tivesse planeado aquele clipe da forma que a divisão implica, uma geração por plano, teria pago dez vezes mais pelos mesmos quinze segundos.
A divisão é o erro. O limite não é um cronómetro, é um contentor, e quase ninguém o está a preencher.

Um skater a meio de uma manobra capturado como uma sequência estroboscópica, muitas posições distintas congeladas dentro de um único fotograma
Um fotograma, muitos momentos. Esse é o modelo mental que o menu suspenso de duração te impede de ter.
Principais conclusões
- O parâmetro
durationaceita apenas números inteiros de 4 a 15. O padrão é 8. Não existe 7,5 e nenhum valor acima de 15. - Cada clipe é devolvido a 24 FPS, até 2K nativo, com áudio estéreo gerado na mesma passagem que a imagem.
- O teu clipe de "15 segundos" tem na verdade 362 fotogramas, o que dá 15,083 segundos. As durações são ajustadas para cima numa grelha de 17 fotogramas, e apenas
duration: 8cai num segundo inteiro. - Uma geração pode conter muitos planos. Escreve
SHOT 1 / CUT TOno prompt e o modelo corta por ti, sem custo extra. - Não existe parâmetro de extensão na API. Ultrapassas os 15 segundos através de encadeamento: último fotograma no primeiro fotograma seguinte, imagens de referência para manter o aspeto e depois uma concatenação direta.
Vê 45 Segundos de Duração de Vídeo MiniMax H3, Feitos a Partir de Três Clipes
Antes de qualquer teoria, aqui está a coisa em si. Um spot de 45 segundos chamado MIDNIGHT BOWL. Três gerações, quinze segundos cada, três planos dentro de cada uma. Nove planos, uma peça contínua de narrativa, sem dissoluções a esconder as junções.
O corte completo de 45 segundos. Três gerações MiniMax H3 concatenadas sem efeitos de transição. O chefe, o avental, a lâmpada e o letreiro pintado à mão sobrevivem a duas passagens.

Nove fotogramas do spot MIDNIGHT BOWL organizados como uma folha de contacto 3x3, legendados SHOT 1 a SHOT 9 com timecodes
Nove planos, três gerações. Cada linha é uma geração, cada coluna um corte que o modelo fez sozinho. Os planos 3 e 4 rimam porque a geração 2 começa a partir do fotograma final da geração 1, que é exatamente o que torna a emenda invisível.
Três gerações. Não nove. Essa diferença é o ponto central deste artigo.
Não cortei nada manualmente. Pedi a cada geração três planos com timecode, e o detetor de cenas do ffmpeg encontrou os cortes aos 4,9s e 9,1s no primeiro, 4,9s e 9,0s no segundo, 5,3s e 11,0s no terceiro. Nove planos, três faturas.
Porque é que a Duração do Vídeo MiniMax H3 Arruína Planos de Longa Duração
O número em si é aceitável. Quinze segundos no topo do intervalo é generoso para esta geração de modelos, e os clipes são 2K com som estéreo real incluído. O que arruína as pessoas é a unidade em que planificam.
Se orçamentares em segundos, uma peça de um minuto são "quatro clipes" e uma peça de dez minutos são "quarenta clipes", e quarenta clipes de qualquer coisa são um pesadelo de trabalho de continuidade. Se orçamentares em planos, uma peça de um minuto são quatro gerações com cerca de doze planos, o que é uma quantidade normal de cobertura para um comercial. Mesmo modelo, mesmo limite, plano de produção completamente diferente.

Ilustração retro de cartaz plano de uma única tira de filme de 35mm na qual três fotogramas consecutivos contêm cada um uma cena completamente diferente
Oraçamento em planos, não em segundos. Uma tira faturada, três cenas diferentes lá dentro.
Há uma segunda coisa que quebra os planos de longa duração, e não é o limite. São as emendas. Clipes individuais raramente se desfazem a meio. Desfazem-se nas junções, porque cada geração inventa a sua própria base de áudio e desvia-se ligeiramente no guarda-roupa e na luz. Planeia as emendas e 45 segundos é fácil. Ignora-as e quatro clipes perfeitos continuam a parecer quatro clipes.
O que é realmente a Duração do Vídeo MiniMax H3: 4 a 15 Segundos Inteiros numa Grelha de 17 Fotogramas
Começa pela especificação, porque estão a circular dois números diferentes. O esquema da API ao vivo para os três endpoints H3 na Atlas Cloud lista duration como um enum de exatamente 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, com um padrão de 8. Números inteiros, nada fracionário, nada além de 15. A cobertura de lançamento corresponde a essa leitura: saída 2K, 4 a 15 segundos, durações inteiras apenas (MarkTechPost, agosto de 2026). O próprio post de lançamento da MiniMax descreve como até 15 segundos a 2K com som estéreo nativo (MiniMax, agosto de 2026).
Ainda vais ver "5 a 15 segundos" escrito em várias descrições de perfis e guias de início rápido, incluindo algum texto na própria plataforma. Trata o enum do esquema como a verdade. O mínimo é 4, e eu facturei clipes de 4 segundos para o provar.
Agora a parte que quase ninguém menciona. Pede 15 segundos e não recebes 360 fotogramas. Recebes 362.
O H3 constrói vídeo em blocos de 17 fotogramas e ajusta a duração solicitada para cima até ao próximo número de fotogramas 17k + 5 a 24 FPS. Essa grelha está documentada no tutorial oficial do H3 do ComfyUI (ComfyUI Docs, 2026), e também se aplica no lado da API. Contei fotogramas em nove ficheiros H3 reais com ffmpeg:
text1ffmpeg -i video-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | tail -1 2# frame= 362 ... 3# Duration: 00:00:15.10, 1280x720, 24 fps 4
Todos os ficheiros de 15 segundos voltaram com 362 fotogramas. Todos os ficheiros de 10 segundos voltaram com 243. As três novas gerações que fiz para este artigo também voltaram com 362, e o ensaio de 4 segundos no Passo 5 voltou com 107. Aplica a grelha: 362 é 17x21+5, 243 é 17x14+5 e 107 é 17x6+5. A fórmula previu todos os três exatamente, o que é o tipo de concordância que me faz confiar no resto da tabela.
| duration | Fotogramas entregues (17k+5) | Duração real a 24 FPS | Cai num segundo inteiro? | Fonte |
|---|---|---|---|---|
| 4 | 107 | 4,458 s | Não | Medido |
| 5 | 124 | 5,167 s | Não | Grelha |
| 6 | 158 | 6,583 s | Não | Grelha |
| 7 | 175 | 7,292 s | Não | Grelha |
| 8 | 192 | 8,000 s | Sim | Grelha |
| 9 | 226 | 9,417 s | Não | Grelha |
| 10 | 243 | 10,125 s | Não | Medido |
| 11 | 277 | 11,542 s | Não | Grelha |
| 12 | 294 | 12,250 s | Não | Grelha |
| 13 | 328 | 13,667 s | Não | Grelha |
| 14 | 345 | 14,375 s | Não | Grelha |
| 15 | 362 | 15,083 s | Não | Medido |
Três coisas saltam desta tabela.
duration: 8 é o único valor em todo o intervalo que te dá um segundo inteiro limpo, e acontece ser o padrão. Isso não é coincidência, é 17x11+5 = 192 = 8 x 24 exatamente.
Pede 6 e recebes 6,583 segundos, mais de meio segundo de imagem grátis. Pede 13 e recebes 13,667. A grelha arredonda sempre para cima, nunca para baixo, por isso nunca ficas a perder.
E se estás a cortar para música ou a corresponder a uma edição frame-accurate, nunca calcules a tua linha de tempo como duration x 24. Mede o ficheiro. Um projeto de 40 clipes planeado assumindo segundos inteiros está desviado em quase quatro segundos no final.
Dez Cortes Dentro de Uma Geração MiniMax H3 de 15 Segundos
Aqui está o clipe que mencionei no início. Uma geração, 362 fotogramas, 15,10 segundos no contentor. É uma peça de tipo cinético de moda, e comporta-se como um videoclipe editado em vez de uma única toma.

Uma única geração MiniMax H3. Mudanças de guarda-roupa, mudanças de enquadramento, ecrãs divididos e cartões de texto de ecrã inteiro, tudo dentro de um único trabalho de 15 segundos.
Executei o detetor de cenas do ffmpeg sobre ele em vez de contar a olho:
text1ffmpeg -i video-5.mp4 -vf "select='gt(scene,0.6)',showinfo" -f null - 2# 18 quebras sinalizadas, em 1.54 2.88 3.63 4.21 5.54 5.83 6.92 8.88 11.17 13.00 ... 3
Dez dessas são mudanças de plano limpas nos primeiros treze segundos. A cauda é um cartão de título estroboscópico a piscar em preto, o que inflaciona a contagem bruta, por isso dez é o número honesto conservador. De qualquer forma, não é um plano, e não são três.
Agora o caso de controlo, porque "o H3 corta sempre o teu clipe em pedaços" é o falhanço oposto e igualmente errado. Este próximo ficheiro também é uma única geração de 15 segundos, também 362 fotogramas, e o mesmo detetor encontra exatamente zero cortes nele.

Outra geração única, os mesmos 362 fotogramas, zero cortes detetados. Um movimento de câmara contínuo durante os quinze segundos completos.
Portanto, o limite não é "quinze segundos de filmagem". São quinze segundos de tempo de ecrã que podes subdividir como quiseres, desde uma única toma ininterrupta até dez cortes. Controlas isso a partir do prompt e pagas o mesmo de qualquer forma.
Os Três Endpoints Por Trás da Duração do Vídeo MiniMax H3, Num Separador
Ultrapassar os quinze segundos requer três trabalhos diferentes: algo para fazer um fotograma de referência, algo para animar e encadear, e algo para mover a câmara sem perder o sujeito. Na Atlas Cloud todos os quatro vivem no mesmo catálogo com uma chave e um saldo, o que é importante aqui principalmente porque a cadeia na próxima secção passa ficheiros entre eles repetidamente.
| Passo | Modelo | Função nesta construção | Intervalo de duração | Taxa listada, 4 de agosto de 2026 |
|---|---|---|---|---|
| Fotograma de referência | openai/gpt-image-2/text-to-image | Um still que define o aspeto completo | n/a | $0,1745 para a minha execução alta |
| Abertura, sem still | minimax/h3/text-to-video | Direto do prompt para o clipe | 4 a 15 s, padrão 8 | $0,14 / s |
| Gerações 1 e 2 | minimax/h3/image-to-video | Animar um primeiro fotograma e encadear a partir do último | 4 a 15 s, padrão 8 | $0,14 / s |
| Geração 3 | minimax/h3/reference-to-video | Nova posição de câmara, mesmo sujeito | 4 a 15 s, padrão 8 | $0,14 / s |
Todos os três endpoints H3 não têm qualquer desconto neste momento, por isso a taxa é a taxa. Podes confirmar qualquer uma no catálogo completo de modelos.
Três armadilhas de parâmetros que vale a pena conhecer antes de escreveres um único pedido, todas retiradas dos esquemas ao vivo em vez da prosa da documentação:
ratiocomporta-se de forma diferente em cada endpoint.text-to-videooferece seis rácios e o padrão é1:1, o que te dará silenciosamente um clipe quadrado se te esqueceres de o definir, e não aceitaadaptivede todo.image-to-videooferece apenasadaptive, por isso o enquadramento segue o teu primeiro fotograma.reference-to-videoé o único com o conjunto completo maisadaptive.resolutioné768Pou2K, o padrão é2K. Ambos os níveis estão sob uma única taxa por segundo listada no catálogo, por isso reduzir para 768P não te poupa dinheiro. Usa 2K.image-to-videotambém aceita umend_imageopcional. Podes fixar ambas as extremidades de um clipe, não apenas o início. Isso transforma o truque de encadeamento abaixo em algo que podes dirigir a partir de ambas as direções.
Como Ultrapassar o Limite de Duração do Vídeo MiniMax H3, Passo a Passo
Esta é a construção completa do MIDNIGHT BOWL. Cada prompt abaixo é o que realmente enviei, copia-os à letra. O tempo total de execução são três gerações H3 mais um still, e tudo é reproduzível num separador de navegador.
Passo 1: Fixa o Aspeto Num Fotograma de Referência
Não comeces com vídeo. Começa com um still de que gostes genuinamente, porque todos os clipes na cadeia herdarão a sua luz, o seu guarda-roupa e a sua sinalética. Errar isto é caro; acertar custa cêntimos.
Modelo: openai/gpt-image-2/text-to-image. Definições: qualidade high, rácio 16:9.
text1Fotograma de filme, 2h num beco estreito de Tóquio com uma barraca de noodles. Um chefe de 50 anos num avental azul-marinho e bandana branca inclina-se sobre uma panela de caldo a fumegar atrás de um balcão de madeira riscado, mangas arregaçadas até ao cotovelo, antebraços iluminados a laranja quente por uma única lâmpada pendurada. Asfalto molhado pela chuva reflete sinalética vermelha e verde; lanternas de papel e um letreiro de madeira pintado à mão a ler "MIDNIGHT BOWL" pendurado acima do balcão. Vapor atravessa o enquadramento vindo da direita da câmara. Filmado com uma lente 35mm a f/2, profundidade de campo reduzida, sombras profundas, luz de tungsténio quente contra noite azul fria, granulado de filme visível, sem sobreposições de texto. 2

Playground do GPT Image 2 na Atlas Cloud com o prompt de referência do MIDNIGHT BOWL preenchido e a imagem finalizada no painel de saída
GPT Image 2 na Atlas Cloud: qualidade definida para high, 16:9, o fotograma de referência renderizado à direita.

O fotograma de referência do MIDNIGHT BOWL: um chefe de avental azul-marinho atrás de uma panela de caldo a fumegar sob uma única lâmpada pendurada num beco chuvoso
O fotograma de referência. Tudo a jusante herda esta lâmpada, este avental e este letreiro.
Passo 2: Coloca Três Planos Dentro de Uma Geração MiniMax H3 de 15 Segundos
Aqui está o movimento que muda o orçamento. Em vez de pedires quinze segundos contínuos, entrega ao modelo uma lista de planos com timecodes explícitos e as palavras CUT TO. Ele cortará por ti, dentro de uma única geração faturada.
Modelo: minimax/h3/image-to-video. Definições: resolution 2K, duration 15, ratio adaptive (a única opção aqui, o enquadramento segue o teu primeiro fotograma), primeiro fotograma = still do Passo 1.
text1SHOT 1 (0-5s): Plano geral fixo da barraca. O vapor sai; o chefe serve caldo numa tigela preta com uma concha; a chuva pinga da borda do toldo. SHOT 2 (5-10s): CUT TO close-up macro da concha a romper a superfície do caldo, gordura dourada a rodopiar, cebolinho picado a cair em arcos lentos. SHOT 3 (10-15s): CUT TO plano médio do chefe a olhar diretamente para a lente, a limpar as mãos ao avental e a dizer em japonês com um sorriso cansado: "Ippai, dozo." Ele pousa a tigela no balcão e o plano mantém-se no seu rosto. 2Áudio: chuva forte no toldo, caldo a ferver, a concha a bater no rebordo da panela, um comboio ao longe, zumbido baixo de cidade noturna. Uma linha de diálogo masculino clara em japonês, tom de sala natural, sem música. 3Manter o mesmo chefe, avental, bandana, lâmpada e sinalética em todos os três planos. Apenas cortes secos, sem dissoluções, sem transições de chicote de câmara. Luz de tungsténio quente, noite azul fria, aspeto 35mm, granulado de filme. 4
Três coisas fazem isto funcionar. Intervalos de segundos explícitos, a string literal CUT TO, e uma cláusula de continuidade no final que nomeia todos os elementos que devem sobreviver aos cortes. Retira a cláusula de continuidade e o plano 3 volta com um avental diferente.

Playground do MiniMax H3 image-to-video na Atlas Cloud com o fotograma de referência carregado, duração 15 e 2K selecionados, o clipe finalizado a reproduzir no painel de saída
MiniMax H3 image-to-video na Atlas Cloud: fotograma de referência carregado como primeiro fotograma, resolução 2K, o clipe finalizado à direita. Nota o controlo deslizante de Duração e o preço que o acompanha. Esta execução em particular deixou a duração no padrão 8, razão pela qual o botão mostra $1,12; a 15 mostra $2,10.

Geração 1. Um trabalho faturado, três planos (cortes medidos a 4,92s e 9,13s), uma linha de diálogo com sincronização labial, 2560x1440 nativo e áudio estéreo de 32 kHz no mesmo ficheiro.
Passo 3: Encadeia os Próximos 15 Segundos a Partir do Último Fotograma
Não existe parâmetro de extensão. O encadeamento é manual e trivial: extrai o fotograma final da geração 1 e reintrodu-lo como primeiro fotograma da geração 2.
bash1ffmpeg -sseof -0.08 -i generation-1.mp4 -frames:v 1 -q:v 2 handoff-frame-01.jpg 2
Modelo: minimax/h3/image-to-video novamente. Definições: primeiro fotograma = handoff-frame-01.jpg, resolution 2K, duration 15, ratio adaptive.
A disciplina importante aqui é o que deixas de fora. Não descrevas o chefe novamente. Ele já está nos píxeis que acabaste de entregar, e redescrevê-lo dá ao modelo permissão para o reinterpretar.
text1Continuar a partir deste fotograma exato, mesmo homem, mesmo avental, mesma luz. SHOT 1 (0-5s): Ele desliza a tigela pelo balcão em direção à câmara com as duas mãos. SHOT 2 (5-10s): CUT TO sobre o ombro de um cliente, mãos a levantar pauzinhos de madeira e a parti-los, punhos de um casaco de chuva cinzento molhado visíveis. SHOT 3 (10-15s): CUT TO macro extremo de puxar noodles, vapor a enrolar-se para cima da lente, caldo a pingar de volta para a tigela. 2Áudio: chuva contínua e fervura mantidas do anterior, loiça em madeira, pauzinhos a estalar, um som de sorver, o mesmo comboio ao longe. Sem música, sem narração. 3Apenas cortes secos. Mesma luz de tungsténio da lâmpada pendurada, mesma noite azul fria atrás, mesma profundidade de campo reduzida 35mm e granulado de filme. 4

Geração 2, iniciada a partir do último fotograma da geração 1. Mesmo chefe, mesmo padrão de bandana, mesma camisola azul-marinho, mesma cozinha atrás dele. Três planos novamente, cortes a 4,92s e 9,04s.

Loop de dois segundos na emenda entre a geração um e a geração dois
A emenda em si: último segundo da geração 1 no primeiro segundo da geração 2. Sem efeito de transição, apenas um corte.
Passo 4: Move a Câmara Com Reference-to-Video
O encadeamento do último fotograma tem uma limitação inerente: recomeça sempre de onde a câmara anterior estava. Para saltar para um ângulo genuinamente novo mantendo o mesmo sujeito, muda de endpoint.
Modelo: minimax/h3/reference-to-video. Definições: refers = fotograma de referência do Passo 1 mais o último fotograma da geração 2, resolution 2K, duration 15, e define ratio explicitamente para 16:9 aqui em vez de o deixar em adaptive. Este endpoint aceita até nove imagens de referência, três vídeos de referência e três clipes de áudio, com vídeo de referência limitado a um total de 15 segundos (MarkTechPost, agosto de 2026).
text1Plano geral de ângulo baixo a partir do meio da rua molhada, olhando para trás para a mesma barraca de noodles, o mesmo chefe lá dentro. SHOT 1 (0-6s): A chuva risca o enquadramento; dois clientes silhuetados sentam-se ao balcão; o chefe trabalha sob a única lâmpada. SHOT 2 (6-11s): CUT TO o letreiro de madeira pintado à mão enquanto texto branco cinético anima ao lado dele, letra a letra: "MIDNIGHT BOWL - OPEN TILL 4AM". O texto mantém-se nítido e fixo ao letreiro enquanto a câmara deriva. SHOT 3 (11-15s): CUT BACK ao plano geral enquanto o chefe olha para cima, levanta uma mão num pequeno aceno, e a lâmpada pisca uma vez. 2Áudio: chuva, ambiente de rua, uma mota a passar, o mesmo comboio fraco, um único impacto grave baixo quando o texto aparece. Sem diálogo. 3Mesmo chefe, mesmo avental e bandana, mesma sinalética e cores de lanternas que as imagens de referência. Apenas cortes secos, granulado de filme, 35mm, tungsténio quente contra azul frio. 4
Essa instrução ratio não é paranoia. Aqui está o que acontece quando deixas o menu suspenso sozinho neste endpoint:

Playground do MiniMax H3 reference-to-video na Atlas Cloud com duas imagens de referência carregadas, rácio de aspeto deixado em adaptive, e um erro 400 no painel de saída
MiniMax H3 reference-to-video na Atlas Cloud: ambas as imagens de referência carregadas, resolução 2K, e Rácio de Aspeto ainda no seu padrão adaptive. A execução volta com 400: "ratio is required for t2va (text-only) and cannot be 'adaptive'; allowed: 16:9/4:3/1:1/3:4/9:16/21:9". Define-o explicitamente e o mesmo pedido passa, que é como o clipe abaixo foi feito. Nota que a descrição da página acima também lê "768P/1080P/2K, 5s/10s" enquanto o esquema diz 768P ou 2K e 4 a 15 segundos. Confia no esquema.
Não consegui que o menu suspenso de rácio do playground mantivesse uma alteração programada em três tentativas, por isso a geração 3 bem-sucedida abaixo veio da API com ratio: "16:9" definido no corpo do pedido. A execução falhada não custou nada.

Geração 3. Nova posição de câmara do outro lado da rua molhada, mesmo chefe, e o texto branco animado no letreiro mantém-se perfeitamente nítido enquanto a câmara deriva. Cortes a 5,29s e 10,96s.

Comparação lado a lado do fotograma de referência original e de um fotograma da geração três, mostrando o mesmo chefe e sinalética 41 segundos e duas passagens depois
Esquerda: o fotograma de referência do Passo 1. Direita: geração 3 na marca dos 41 segundos, duas passagens depois. Mesmo chefe, mesma bandana, mesma camisola azul-marinho, mesmo letreiro pintado à mão, mesma lanterna vermelha.
Passo 5: Mede a Duração Real do Vídeo MiniMax H3, Depois Une
Dois hábitos para terminar. Primeiro, faz um ensaio barato antes de comprares quinze segundos. Mesmo prompt, duration 4, e descobres se o modelo percebeu a tua lista de planos por cerca de um quarto do preço.

O ensaio de 4 segundos da mesma lista de planos. Medido a 107 fotogramas, o que dá 4,458 segundos, exatamente o que a grelha prevê. Suficiente para ver se o modelo percebeu a cena antes de comprar a toma completa.
Segundo, mede cada ficheiro antes de cortares, porque nenhum deles tem a duração que pediste:
bash1# contagem real de fotogramas e duração do contentor, não duration x 24 2ffmpeg -i generation-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | grep -o 'frame= *[0-9]*' | tail -1 3 4# concat de corte seco, sem transições, sem re-encode 5printf "file 'generation-1.mp4'\nfile 'generation-2.mp4'\nfile 'generation-3.mp4'\n" > list.txt 6ffmpeg -f concat -safe 0 -i list.txt -c copy midnight-bowl-45s.mp4 7
Três ficheiros com 362 fotogramas cada dá 1086 fotogramas, que medi no concat finalizado: 45,25 segundos de imagem, não 45. Pequeno, até estares a unir quarenta deles.
Variações: Diálogo, Vertical e o Ensaio de 4 Segundos
Assim que a cadeia funciona, os mesmos três endpoints cobrem a maior parte do que as pessoas realmente pedem.
Plano e contraplano de diálogo. Coloca ambos os lados de uma conversa dentro de uma geração em vez de em duas. A sincronização labial e a base de áudio são contínuas dentro de um único trabalho e independentes entre trabalhos, por isso uma conversa dividida em duas gerações dá-te dois tons de sala não relacionados. Mantém as trocas dentro de um clipe.

Dois jovens atores a meio de uma discussão num patamar de escadaria de betão, luz de janela forte a incidir sobre eles, filmado por cima do ombro
Plano e contraplano funciona, desde que ambos os ângulos vivam dentro da mesma geração.
Vertical. Em image-to-video não defines o rácio, defines o primeiro fotograma. Gera um fotograma de referência alto e adaptive segue-o. Um dos clipes que medi voltou a 1280x2276 com a mesma contagem de 243 fotogramas que os seus irmãos 16:9, por isso a grelha de fotogramas não se importa com o teu rácio de aspeto.
O ensaio de 4 segundos como prática padrão. A $0,14 por segundo, quatro segundos são $0,56 contra $2,10 para uma toma completa. Numa construção de nove planos, ensaiar cada geração antes de comprometer custa menos de um trabalho de 15 segundos desperdiçado.
Onde o limite realmente morde. Qualquer coisa que precise de uma performance ininterrupta com mais de quinze segundos. Um monólogo contínuo de 30 segundos não é um problema de encadeamento, é um problema de sincronização labial através de uma emenda, e nenhuma quantidade de disciplina de prompt o resolve.
Quanto Custa 45 Segundos de Duração de Vídeo MiniMax H3
A $0,14 por segundo, uma geração completa de 15 segundos é $2,10. Esse é o único número de que precisas; tudo o resto é multiplicação. A coluna interessante é a última.
| Duração alvo | Gerações a 15 s | Custo linear | Realista com taxa de retenção 1 em 3 | Planos entregues | Custo por plano |
|---|---|---|---|---|---|
| 15 s | 1 | $2,10 | $6,30 | 3 | $0,70 |
| 45 s (esta const.) | 3 | $6,30 | $18,90 | 9 | $0,70 |
| 60 s | 4 | $8,40 | $25,20 | 12 | $0,70 |
| 3 min | 12 | $25,20 | $75,60 | 36 | $0,70 |
| 10 min | 40 | $84,00 | $252,00 | 120 | $0,70 |
Lê a coluna de custo por plano e o pânico em relação ao limite desaparece quase por completo. Planear uma geração por plano coloca-te a $2,10 por plano. Empacotar três planos em cada geração coloca-te a $0,70. Mesmo modelo, mesmo limite de quinze segundos, um terço da fatura.
A coluna da taxa de retenção é a que as pessoas esquecem. Nada utilizável volta à primeira tentativa sempre, e um plano que assume que sim é um plano que fica sem orçamento ao minuto dois.
Para contexto de onde o limite se situa em relação a tudo o resto no catálogo, todos estes estão atuais a 4 de agosto de 2026:
| Modelo | Geração única máxima | Notável | Taxa listada |
|---|---|---|---|
| minimax/h3 | 4 a 15 s | 768P ou 2K, áudio estéreo nativo | $0,14 / s |
| bytedance/seedance-2.0 | 4 a 15 s, ou -1 para auto | 480p a 4K nativo | $0,112 / s |
| kwaivgi/kling-v3.0-pro | 3 a 15 s | Tem uma flag multi_shot explícita com prompts por plano | $0,095 / s, 15% off |
| alibaba/wan-2.7 | 2 a 15 s | Limite mínimo mais amplo, 720P ou 1080P | $0,10 / s |
| google/veo3.1 | apenas 4, 6 ou 8 s | Sem opção de 15 segundos de todo | $0,20 / s |
| alibaba/wan-2.5/video-extend | adiciona 5 a 10 s | Estende um ficheiro existente em vez de gerar novo | $0,052 / s |
Duas conclusões. Os quinze segundos do H3 estão no topo da geração atual, não atrás dela, e o Veo 3.1 limita-se a oito. E se o que realmente precisas é de um ficheiro longo a partir de um único endpoint, existe um modelo de extensão dedicado, mas mudar de modelo a meio da cadeia significa mudar de rostos.
Uma Nota Honesta Sobre Áudio, Pesos e Duração do Vídeo MiniMax H3
Três ressalvas, nenhuma das quais altera o limite.
O áudio não passa entre gerações. Cada trabalho compõe a sua própria base estéreo de raiz. Três clipes encadeados significam três bases de chuva não relacionadas, e ouvirás a mudança mesmo quando a imagem corresponde perfeitamente. Duas correções: escreve a cláusula de ambiente de forma idêntica em todos os prompts para que as bases fiquem próximas, ou silencia o corte unido e coloca uma faixa contínua por baixo. Para diálogo, mantém a troca dentro de uma única geração.

Vários fragmentos de forma de onda de áudio curtos separados com lacunas visíveis à esquerda, uma única forma de onda contínua à direita, num fundo pálido unificado
Esquerda: o que o encadeamento realmente te dá. Direita: o que tens de construir por baixo disso.
Auto-hospedagem não desbloqueia clipes mais longos. Os pesos abertos foram lançados a 2 de agosto de 2026 (Hugging Face, agosto de 2026), e executá-los localmente dá-te um lado curto de 768 píxeis arredondado para múltiplos de 32, de acordo com as notas de configuração do ComfyUI. A grelha de 17 fotogramas e o teto de 15 segundos são os mesmos. A licença comunitária também não cobre atualmente a UE, Reino Unido, Coreia ou EUA, por isso a API é a via prática para a maioria das equipas.
O modelo pode reescrever-te silenciosamente. Já me aconteceu o H3 devolver completed num trabalho em que descartou silenciosamente um elemento que pedi. Extrai fotogramas de cada clipe e olha para eles antes de unires. Numa cadeia de nove planos, um clipe não vigiado é uma emenda desperdiçada.
Perguntas Frequentes
Qual é a duração máxima do vídeo MiniMax H3?
Quinze segundos. O parâmetro duration é um enum de números inteiros de 4 a 15 com um padrão de 8, por isso 16 é rejeitado e 7,5 não é um valor válido. Cada clipe é 24 FPS até 2K nativo com áudio estéreo gerado juntamente com a imagem.
O MiniMax H3 consegue gerar vídeos com mais de 15 segundos?
Não numa única geração, e a API não tem parâmetro de extensão. Ultrapassas os 15 segundos encadeando: extrai o último fotograma de um clipe como primeiro fotograma do seguinte, usa reference-to-video quando precisares de um novo ângulo de câmara e depois concatena com cortes secos. Algumas interfaces de utilizador finais sobrepõem a sua própria funcionalidade de extensão em cima do H3 para atingir cerca de 30 segundos, mas isso é o produto a fazer a união, não o modelo a gerar mais tempo.
Porque é que o meu clipe MiniMax H3 de 15 segundos tem na verdade 15,08 segundos?
Porque as durações são ajustadas para cima numa grelha de 17 fotogramas. Solicitar 15 segundos devolve 362 fotogramas, que é 17x21+5, e a 24 FPS são 15,083 segundos. Solicitar 10 devolve 243 fotogramas, ou 10,125 segundos. Apenas duration: 8 cai num segundo inteiro, exatamente 192 fotogramas. Se a tua edição for frame-accurate, mede cada ficheiro em vez de calcular duration x 24.
Posso colocar vários planos dentro de uma geração MiniMax H3?
Sim, e é a maior poupança disponível. Escreve planos com timecode explícitos no prompt com as palavras literais CUT TO e adiciona uma cláusula de continuidade a nomear o que deve sobreviver aos cortes. Medi dez cortes limpos dentro de uma geração real de 15 segundos. Três planos por geração é confortável e fiável, o que transforma um clipe de $2,10 em três planos de $0,70.
Uma duração de vídeo MiniMax H3 mais curta custa menos?
Sim, linearmente. A faturação é por segundo a $0,14, por isso um ensaio de 4 segundos custa $0,56 contra $2,10 para uma toma completa de 15 segundos. A resolução é diferente: 768P e 2K estão sob uma única taxa listada no catálogo, por isso reduzir a resolução não poupa nada. Encurta o clipe, não os píxeis.
Quantos clipes MiniMax H3 preciso para um vídeo de um minuto?
Quatro, se preencheres todos os quinze segundos de cada vez. Mas conta em planos: quatro gerações a três planos cada dá-te doze planos de cobertura, o que é uma quantidade normal para um comercial de um minuto. Depois multiplica o teu orçamento por cerca de três para ter em conta as tomas que deitas fora.






