Cada artigo sobre este modelo para na mesma linha. Nove imagens, três clipes de vídeo, três clipes de áudio, doze arquivos no total. Parece um cartão de garantia.
Então, tratei-o como tal. Construí um personagem, construí um adereço, gerei uma cena noturna, alimentei essa cena noturna de volta como um vídeo de referência, cortei oito segundos de jazz em uma faixa de áudio de referência e empurrei todos os três tipos de referência em uma única requisição. Depois, comecei a quebrar as regras de propósito para ver quais delas a API realmente defende.
Quatro delas não são defendidas da maneira que você esperaria. Uma delas ainda cobra o preço total por um vídeo que você não pediu, e a mensagem de erro que você esperava nunca chega. Essa é a que vale a pena ler até o fim.
Principais Conclusões
- Três tipos de referência, um único array. Até 9 imagens, 3 clipes de vídeo e 3 clipes de áudio, 12 arquivos no total. Todos vão para o mesmo campo
refers, etypeé opcional porque a API o infere da extensão do arquivo. - Áudio nunca pode voar sozinho. Uma requisição apenas de áudio é rejeitada com um erro nomeado. Ele precisa vir acompanhado de pelo menos uma imagem ou um vídeo.
- Referência para vídeo e imagem para vídeo são mutuamente exclusivos, mas nada avisa. Envie uma
imagede primeiro quadro junto comreferse o trabalho é concluído mesmo assim. Uma das suas duas entradas é descartada em silêncio, pelo preço total. Verificado duas vezes em 12/08/2026, em ambos os endpoints. - Nada é validado quando você submete. Toda requisição errada neste artigo retornou HTTP 200 e um ID. O veredito real chega dois a três minutos depois, na etapa de geração. Rejeições lá são gratuitas; conclusões não são.
- Arquivos de referência extras são gratuitos. Uma imagem de referência e dez imagens de referência cobram exatamente o mesmo valor para o mesmo comprimento de clipe. O preço segue os segundos de saída, não a contagem de entrada.
Aqui está o que saiu do outro lado. Dois planos, um rosto, dois lugares completamente diferentes, e o segundo plano foi construído a partir de uma imagem, um vídeo e um arquivo de áudio ao mesmo tempo.
Plano A (chuva, noite, beco neon) e depois Plano B (mercado coberto vazio na manhã seguinte), cortados juntos sem nada adicionado além da junção. Mesma mulher, mesma cicatriz acima da sobrancelha direita, mesma jaqueta índigo, mesma toalha. O Plano B foi gerado a partir de três referências ao mesmo tempo: seu retrato, o próprio clipe do Plano A e um corte de oito segundos de jazz. Ambos os planos são minimax/h3/reference-to-video em 2K, 2560x1440, 24fps, com a faixa estéreo nativa de 32kHz. Vale a pena ter o som ligado para a segunda metade, onde ela entrega sua fala.
Por que o MiniMax H3 Reference to Video Supera Qualquer Prompt que Você Pode Escrever
Um prompt descreve uma pessoa. Uma referência é a pessoa. Essa diferença é a razão de existir deste endpoint, e é por isso que o MiniMax H3 atualmente está no topo do ranking de edição de vídeo: Elo 1.125 em 10.280 votos (Artificial Analysis, agosto de 2026). Vale a pena ser preciso sobre esse número, no entanto: a mesma tabela lista sua faixa de classificação como 1 a 2, estatisticamente empatado com o Google Gemini Omni Flash em 1.122. Primeiro lugar, dentro de um intervalo de confiança que compartilha. A alegação relacionada de que o H3 também está entre os três primeiros tanto para texto para vídeo quanto para imagem para vídeo vem do mesmo post de anúncio do laboratório (Artificial Analysis no X, agosto de 2026).
Classificações são baratas. Aqui está o comportamento real, mesmo prompt, três níveis de referência, todo o resto idêntico.

Três execuções do MiniMax H3 reference to video no mesmo prompt: sem referência, uma imagem de referência do personagem e duas imagens de referência
Mesmo prompt, mesmas configurações 768P 4s, da esquerda para a direita: nenhuma referência (texto para vídeo), uma imagem de referência do personagem, duas imagens de referência (personagem mais a tigela de ramen). O prompt diz "a mulher da imagem de referência" em todos os três. No painel esquerdo, essa frase não se refere a ninguém, então o modelo inventa um estranho. Gerado com minimax/h3/text-to-video e minimax/h3/reference-to-video.
Duas leituras honestas dessa sequência. O salto do painel um para o painel dois é enorme: sem uma referência, "a mulher da imagem de referência" é uma frase que aponta para o nada, e o modelo silenciosamente preenche o buraco com uma pessoa que não tem relação com seu projeto. O salto do painel dois para o painel três é muito menor, porque meu prompt também descreveu a tigela em palavras, e o H3 desenhou uma tigela azul-marinho passável com um grou a partir apenas do texto. Essa é a parte útil. Uma imagem de referência e uma boa frase nominal competem pelo mesmo trabalho, então gaste seus slots de referência nas coisas que a linguagem não consegue fixar: um rosto específico, um produto específico, um logotipo específico.
O padrão por trás de quase todas as falhas neste artigo é o mesmo do painel um. Nada avisa que parte da sua requisição caiu no vazio.
O que uma referência realmente trava, e o que não trava. Uma imagem de referência fixa a identidade: estrutura facial, cabelo, marcas distintivas, vestimenta. Ela não fixa a iluminação, e essa é a surpresa mais comum. Ela também arrasta a luz da foto de referência junto, e é por isso que uma ficha de personagem fotografada em um ambiente sombrio produz um personagem que não consegue sobreviver a uma mudança de cena. Fotografe sua referência de forma plana e neutra. Um vídeo de referência fixa movimento, gradação e granulação, não a identidade. Um áudio de referência fixa a própria base de áudio. Se você precisa do mesmo rosto lendo uma fala na mesma voz em uma série, a pilha de referências está fazendo três trabalhos diferentes e você precisa dizer qual é qual. Guias de profissionais convergem em nomeá-los posicionalmente no prompt ("Imagem 1 é o personagem, Imagem 2 é o produto") e essa convenção vale a pena ser adotada; meus prompts abaixo usam nomes descritivos simples, o que também funciona quando as referências são visualmente inequívocas.
Por que a primeira chamada geralmente decepciona. Quatro coisas, todas medidas em 12/08/2026:
- O endpoint de submissão não valida nada. MIME errado, áudio de 164 segundos, URL morta, campos mutuamente exclusivos: tudo retorna HTTP 200 com um ID de previsão. Você descobre depois.
ratiopadrão éadaptive, documentado como "deixe o modelo escolher". Com referências 16:9, obtive 1344x768 em 768P, quer tenha deixado emadaptiveou forçado 16:9, então o padrão é inofensivo quando suas entradas já concordam. É um cara ou coroa quando não concordam, e este é o único endpoint H3 onde você pode simplesmente tirar a decisão dele.- Uma imagem de primeiro quadro mais referências não gera erro. Ela descarta silenciosamente uma delas e cobra você.
- Se o modelo não tem nada concreto para se segurar, ele preenche a lacuna com confiança, e um rosto errado confiante parece exatamente uma execução bem-sucedida.
Para o lado da criação de prompts, o Guia de prompt do MiniMax H3 aprofunda-se mais na formulação do que eu posso aqui.
O Livro de Regras do MiniMax H3 Reference to Video: Três Tipos, Uma Requisição
Todos os três tipos de referência compartilham um array. Aqui está o contrato conforme publicado, ao lado do que o endpoint realmente fez quando eu testei.
Tabela 1: os três tipos de referência
| Imagens de referência | Vídeo de referência | Áudio de referência | |
|---|---|---|---|
| Máx. de arquivos | 9 | 3 clipes | 3 clipes |
| Limite combinado | 12 arquivos em todos os três tipos | ||
| Duração por arquivo | n/a | 2 a 15 segundos | 2 a 15 segundos |
| Duração total | n/a | 15 segundos | 15 segundos |
| Formatos | png, jpeg, jpg, webp | mp4, mov | mp3, wav |
| Pode ser usado sozinho? | Sim | Sim | Não, precisa de uma imagem ou um vídeo |
| O que trava | identidade, vestimenta, produto, estilo | movimento, câmera, gradação, granulação | a própria base de áudio |
| O que não trava | iluminação da nova cena | quem está no plano | a faixa exata (veja Etapa 6) |
| Entregue como | URL pública ou URL de dados base64 | URL pública ou URL de dados base64 | deve ser declarado audio/mp3, não audio/mpeg |
| Aplicado? | 10 imagens passaram normalmente | não testado além de 1 clipe | janela por clipe aplicada, total de 15s não foi |
Contagens de arquivos e janelas de duração são os limites publicados pela MiniMax (Hailuo, agosto de 2026), verificados em relação ao artigo de lançamento que lista a mesma janela de vídeo de referência de 2 a 15 segundos cada e 15 segundos no total (MarkTechPost, agosto de 2026). Tudo nas três últimas linhas é meu, medido.
Duas coisas que a ficha técnica não conta. Primeiro, o campo type em cada entrada é opcional e inferido da extensão da URL, o que significa que uma URL de dados base64 ou um link sem extensão deve declarar seu tipo ou a requisição adivinha errado. Segundo, o uploader do navegador limita a nove arquivos (Reference Materials (2/9), MAX:9 na captura de tela da Etapa 5 abaixo), abaixo dos doze da própria MiniMax. Enviei dez imagens de referência pela API de qualquer forma e o trabalho foi concluído normalmente, então nove é um limite de interface, não um limite de modelo.
Tabela 2: reference-to-video vs image-to-video vs text-to-video
| reference-to-video | image-to-video | text-to-video | |
|---|---|---|---|
| Aceita refers | sim, obrigatório, mínimo 1 | não (ignorado silenciosamente) | não |
| Aceita image primeiro quadro | não (ignorado silenciosamente) | sim, obrigatório | não |
| Aceita end_image último quadro | não | sim | não |
| Opções de ratio | todos os 7, incl. 16:9, 9:16, 21:9 | adaptive apenas | todos os 7 |
| Resolução | 768P ou 2K, padrão 2K | mesmo | mesmo |
| Duração | 4 a 15s inteiros, padrão 8 | mesmo | mesmo |
| Misturar entrada do outro endpoint | trabalho conclui, entrada descartada, cobrança total | trabalho conclui, refers descartados, cobrança total | n/a |
Essa quarta linha é a diferença que ninguém menciona. No image-to-video, o enum de proporção contém exatamente um valor, adaptive, porque o primeiro quadro decide a forma. No reference-to-video você obtém todos os sete, o que torna este o único endpoint H3 onde você pode forçar uma forma de quadro enquanto ancora um personagem. Se você está escolhendo um nível para este trabalho, 2K vs 768P para MiniMax H3 cobre o que os pixels extras compram.
A última linha é a cara. A documentação enquadra os dois endpoints como mutuamente exclusivos, e eles são, no sentido de que apenas um caminho de entrada é honrado. Mas não há erro. Executei de ambas as maneiras em 12/08/2026: uma chamada reference-to-video carregando uma image de primeiro quadro foi concluída em 115 segundos e cobrou $0,40, e uma chamada image-to-video carregando refers foi concluída em 167 segundos e cobrou $0,40. Ambos produziram um vídeo. Ambos jogaram fora metade do que enviei, e nenhum campo na resposta diz qual metade.
Tabela 3: os modelos que este fluxo de trabalho usa
Tudo abaixo é executado em uma guia do navegador no Atlas Cloud, de onde vêm os preços e capturas de tela. Taxas verificadas em 12/08/2026.
| Etapa | Modelo | Taxa | Execuções aqui | Custo |
|---|---|---|---|---|
| Referências de personagem + adereço | openai/gpt-image-2/text-to-image | listado a partir de $0,009; alta qualidade em 2048x1152 medido a $0,1745 | 2 | $0,35 |
| Áudio de referência | minimax/music-2.6 | $0,15 por faixa | 1 | $0,15 |
| Plano A e Plano B | minimax/h3/reference-to-video | $0,10/s em 768P, $0,14/s em 2K | 2 x 8s em 2K | $2,24 |
| Escada de referências | mesmo, mais minimax/h3/text-to-video | $0,10/s em 768P | 3 x 4s em 768P | $1,20 |
Nenhum desconto está ativo em nenhum dos três endpoints H3 neste mês. Dois vizinhos estão mais baratos agora se você está apenas construindo imagens estáticas de referência: gpt-image-2-developer/text-to-image está com 50% de desconto, de $0,009 para $0,004 em agosto de 2026. Detalhamentos completos por segundo estão no guia Preços da API MiniMax H3.
MiniMax H3 Reference to Video, Passo a Passo
A cena: uma mulher comandando uma barraca de ramen. O Plano A é um beco neon chuvoso à noite. O Plano B é a mesma mulher na manhã seguinte em um mercado coberto vazio, um lugar diferente, uma hora do dia diferente e uma lente diferente. Nada é transportado entre as duas chamadas, exceto as referências, que é o objetivo do teste.
Etapa 1: Construir a referência do personagem, iluminada plana de propósito
Este é o passo que as pessoas erram. Uma referência de personagem não é uma foto bonita do seu personagem, é uma medição do rosto dele. Luz neutra, fundo simples, sem cena, sem clima. O H3 aprende a luz junto com o rosto, então uma referência atmosférica produz um personagem que está soldado a essa atmosfera.
Modelo: openai/gpt-image-2/text-to-image. Configurações: qualidade alta, tamanho 2048x1152 (16:9), formato png.
text1Fotografia editorial de uma mulher no início dos seus trinta anos, uma chef de comida de rua. Retrato de três quartos aproximado, expressão neutra, contato visual direto com a câmera. Cabelo preto curto preso atrás de uma orelha, uma pequena cicatriz acima da sobrancelha direita, pele morena quente. Ela usa uma jaqueta de trabalho índigo desbotada com as mangas arregaçadas até o cotovelo e uma toalha branca dobrada sobre o ombro esquerdo. Fundo de estúdio cinza claro liso, luz principal suave e uniforme, sem adereços, foco nítido no rosto, textura natural da pele, sem retoques. Fotorrealista, lente 50mm. 2

Playground do GPT Image 2 no Atlas Cloud com o prompt de referência do personagem carregado e o retrato finalizado no painel de saída
GPT Image 2 no Atlas Cloud: qualidade definida como alta, 16:9, a ficha do personagem renderizada à direita.

Imagem de referência do personagem para MiniMax H3 reference to video: retrato neutro de estúdio de uma chef de ramen com uma cicatriz acima da sobrancelha direita
Imagem de referência 1. A cicatriz acima da sobrancelha direita e a toalha branca dobrada são deliberadas: são âncoras de identidade baratas e inequívocas que você pode verificar em cada quadro posterior.
Etapa 2: Construir a referência do adereço
Segundo slot de referência, segundo trabalho. Objetos se comportam melhor do que rostos aqui, o que torna um adereço distintivo a maneira mais fácil de provar que uma referência foi lida. Mesmo modelo, mesmas configurações.
text1Fotografia de produto de uma única tigela de ramen de cerâmica azul-marinho escuro com um grou branco pintado à mão na lateral, lascada na borda, cheia de shoyu ramen fumegante. Vista frontal, fundo cinza claro liso, luz suave e uniforme, foco nítido, fotorrealista, lente 50mm. 2

Imagem de referência do adereço: tigela de ramen azul-marinho escuro com um grou branco pintado à mão e borda lascada
Imagem de referência 2. O grou pintado à mão e a lasca na borda são as pistas. Se eles sobreviverem no vídeo, a referência foi lida.
Etapa 3: Plano A, duas imagens no MiniMax H3 reference to video
Duas imagens de referência, ambas type: "image", dentro de refers. Defina a proporção explicitamente. adaptive é o padrão e geralmente fará a coisa certa quando suas referências já são 16:9, mas ele decide por você, e neste endpoint você não precisa deixar.
Modelo: minimax/h3/reference-to-video. Configurações: resolução 2K, duração 8, proporção 16:9.
text1Plano de abertura amplo. Chuva forte à noite em um beco estreito iluminado por neon. A mulher da imagem de referência trabalha sozinha atrás de uma pequena barraca de ramen fumegante sob uma cobertura de plástico, servindo caldo na tigela azul-marinho com o grou branco da imagem de referência. Vapor sobe através de reflexos de neon rosa e verde no pavimento molhado. Aproximação lenta na barraca. Som ambiente: chuva no plástico, caldo fervendo, trânsito distante. Sem diálogo. 2
A saída desta chamada é a primeira metade do clipe de demonstração no topo. Guarde sua URL. É a entrada para a Etapa 5.
Etapa 4: Cortar oito segundos de áudio de referência
O áudio de referência não é um slot de trilha sonora. É uma base contra a qual o modelo combina sua própria mixagem, e é a entrada mais exigente do endpoint. Gere uma faixa, depois corte-a, porque uma música completa é rejeitada.
Modelo: minimax/music-2.6, com is_instrumental: true e format: "mp3".
text1Jazz noturno esparso, caixa escovada, baixo acústico, um trompete com surdina, melancólico, 70 BPM, instrumental. 2
Em seguida, corte aproximadamente oito segundos e codifique como uma URL data:audio/mp3. Três coisas que errei aqui primeiro, todas com o texto de erro exato:
- A string MIME importa mais do que os bytes. Declare
data:audio/mpege a referência é recusada comaudio format ".mpeg" not allowed, mesmo que o arquivo seja um MP3 perfeitamente comum. Escrevaaudio/mp3. - 2 a 15 segundos por clipe, e é aplicado. Minha faixa gerada tinha 164 segundos. Retornou como
invalid param: audio duration 164258 ms, expected [2000, 15000] ms. Cortar para 8,05 segundos corrigiu. Ambas as rejeições não custaram nada. - O limite combinado de 15 segundos é documentado, mas não aplicado. Enviei dois clipes de 8 segundos na mesma requisição, 16,1 segundos no total, esperando uma rejeição. O trabalho foi concluído e cobrado normalmente. Não confie nisso: está publicado como um limite e pode começar a se comportar como tal a qualquer momento.

Playground do MiniMax Music 2.6 no Atlas Cloud com o prompt de jazz e a faixa finalizada no painel de saída
MiniMax Music 2.6 no Atlas Cloud, $0,15 por execução, faixa finalizada à direita. Uma coisa para copiar desta captura de tela e uma coisa para não copiar: o preço e o formato mp3 estão corretos, mas Is Instrumental ainda está desligado e as letras de demonstração da página ainda estão na caixa, então esta execução específica retornou como uma música de 1:35 com vocais. Ative essa opção e limpe o campo Lyrics antes de executar, ou você estará cortando uma base de referência com alguém cantando por cima. Minha execução de API, com isinstrumental: true, retornou 2:44 de instrumental em 209 segundos.
Etapa 5: Plano B, uma chamada MiniMax H3 reference to video com todos os três tipos
Esta é a chamada para a qual a palavra-chave realmente se refere. Três tipos de referência, três trabalhos diferentes, um array:
- o retrato do personagem da Etapa 1,
type: "image", para segurar seu rosto - o mp4 do Plano A da Etapa 3,
type: "video", para transportar gradação e granulação através do corte - o corte de oito segundos de jazz da Etapa 4,
type: "audio", como a base
URLs de saída de outras gerações na plataforma podem ser colocadas diretamente em refers como a referência de vídeo, que é o mecanismo real por trás da continuidade de múltiplos planos. Não é "H3 se lembra do seu personagem". Você entrega o plano anterior de volta para ele.
Modelo: minimax/h3/reference-to-video. Configurações: resolução 2K, duração 8, proporção 16:9.
text1A mesma mulher da imagem de referência, na manhã seguinte. Mercado coberto claro e vazio, luz do dia fria e limpa através de uma claraboia, persianas ainda abaixadas atrás dela. Close-up médio, câmera estática. Ela limpa o balcão com a toalha branca dobrada, olha para a câmera e diz uma frase, depois volta ao trabalho. Mantenha seu rosto, cabelo, cicatriz e jaqueta índigo idênticos à referência. Transporte a gradação e granulação do clipe de referência. Use o áudio de referência como fundo musical. 2

Playground do MiniMax H3 reference to video no Atlas Cloud com uma referência de imagem e áudio carregadas e o clipe gerado no painel de saída
A mesma chamada no playground do MiniMax H3 Reference-to-Video, em 2K e 8 segundos. Dois slots de referência de tipos diferentes estão visíveis em Reference Materials (2/9): slot 1 é ref-audio-8s.mp3, slot 2 é o retrato dela. A referência de vídeo vai através de "Add via link" (canto superior direito desse painel) ou através da API, porque ela reside em uma URL em vez de no disco. Três coisas para ler neste painel: o uploader diz MAX:9 mesmo que o limite da própria MiniMax seja 12, Aspect Ratio está em adaptive a menos que você mude, e o preço da execução para 2K em 8 segundos é $1,12, que é o nível de $0,14 por segundo.
Etapa 6: Verificar se a referência realmente foi lida
Um trabalho concluído não é um trabalho bem-sucedido. Duas verificações, ambas baratas.
Verifique o rosto. Pegue um quadro de cada plano e coloque-os lado a lado. Você está procurando as âncoras que plantou: a cicatriz, a linha do cabelo, a jaqueta, a toalha.

Quadro do Plano A ao lado de um quadro do Plano B, mostrando o mesmo personagem do MiniMax H3 reference to video em duas cenas diferentes
Esquerda: Plano A, noite, neon, amplo. Direita: Plano B, mercado coberto, manhã seguinte, close-up médio. Mesmo rosto, mesma cicatriz sobre a sobrancelha direita, mesma jaqueta e toalha, através de uma mudança de cena e enquadramento sem nada compartilhado além das referências.
Uma coisa não saiu como escrevi no prompt. Pedi "mercado coberto claro e vazio, luz do dia fria e limpa" e "transporte a gradação e granulação do clipe de referência", e o clipe de referência venceu. O Plano B é inegavelmente manhã e inegavelmente um lugar diferente, mas é muito mais sombrio do que "claro" implica, porque a gradação noturna veio junto com a referência de vídeo. Você não pode pedir a uma chamada a mesma aparência e a luz oposta. Se você precisa que a luz mude, remova a instrução de gradação, ou remova a referência de vídeo e segure a identidade apenas com a imagem.
Verifique o áudio. Plote a forma de onda do corte de oito segundos que você enviou ao lado da faixa que voltou dentro do mp4, e adicione um controle: um clipe gerado sem nenhuma referência de áudio.

Forma de onda do áudio de referência de oito segundos enviado, da faixa de áudio retornada dentro do clipe gerado e de um controle sem referência de áudio
Topo: o corte de jazz de 8,05 segundos enviado como referência. Meio: a faixa extraída do mp4 do Plano B retornado, dominada pela linha de diálogo por volta de 5,5 segundos. Base: Plano A, mesmo fluxo de trabalho, sem referência de áudio.
É aqui que preciso corrigir algo que acreditava antes. O áudio de referência não retorna literalmente. A correlação de envelope entre meu corte e a faixa retornada é 0,25, contra -0,05 para o controle sem referência, então os dois estão relacionados, mas longe de idênticos, e a forma retornada é claramente sua própria mixagem, em vez de meu arquivo com algo sobreposto. O que a referência claramente fez foi colocar algo por baixo: a base do Plano B é cerca de 7 dB mais quente do que o controle sem áudio nos primeiros cinco segundos, antes de qualquer diálogo começar. Leia o áudio de referência como uma direção para a mixagem, não um slot de música. Se você precisa de sua faixa exata sob a imagem, coloque-a depois.
Se você está construindo no lado do áudio disso, Sincronização labial e áudio do MiniMax H3 e o passo a passo do Vídeo musical do MiniMax H3 ambos começam a partir deste mesmo comportamento de áudio de referência. Para o código de polling e retry em torno de tudo isso, o Tutorial do MiniMax H3 tem o loop.
Quatro Configurações Adicionais do MiniMax H3 Reference to Video que Vale a Pena Roubar
Reestilizar um clipe que você já possui. Coloque um clipe finalizado em refers como a referência de vídeo, sem imagens, e peça um meio diferente. O movimento, o enquadramento, a aproximação e os adereços sobrevivem; a superfície muda. Este é o mecanismo por trás da classificação de edição de vídeo do H3, e é o mesmo por trás do trabalho de anime em MiniMax H3 vs Veo 3.1 para anime.

Reestilização de anime gerada a partir do clipe do Plano A usado como referência do MiniMax H3 reference to video
O beco do Plano A devolvido como a única referência, com um prompt de anime com cell-shading. Mesma barraca, mesma concha, mesma tigela de grou, mesma aproximação, redesenhado. Um detalhe que vale a pena saber: a conversão é mais fraca nos primeiros quadros e mais forte quando a câmera se compromete com o movimento. Mostrado como um GIF silencioso. Gerado com minimax/h3/reference-to-video em 768P, 4s, $0,40.
Fazer uma foto cantar. Um retrato mais um clipe vocal dentro da janela de 2 a 15 segundos, com o prompt da performance. Mais barato do que um pipeline de sincronização labial porque é uma única chamada.
Travar um produto em qualquer cena. Imagens de referência fixam objetos com mais força do que rostos, então uma foto de produto real mais um prompt de cena é a coisa mais confiável neste endpoint. Verifique o que você pode fazer com o resultado antes de colocá-lo em um anúncio.
Construir uma série, não um clipe. Encadeie: a saída do plano N se torna a referência de vídeo do plano N+1. Cada chamada ainda limita em 15 segundos, então a continuidade é seu trabalho, não do modelo. Quanto tempo um vídeo do MiniMax H3 pode ter cobre onde esse limite afeta.
Comparando mecanismos antes de comprometer uma série com um? Seedance 2.5 vs MiniMax H3 e Alternativas ao MiniMax H3 são os dois para ler.
Quanto Custa Realmente uma Cena de Dois Planos do MiniMax H3 Reference to Video
Cada linha abaixo é um trabalho real de 12/08/2026, com o valor retirado do campo price que a API retorna em cada previsão concluída.
Tabela 4: a conta real
| Trabalho | Modelo | Configurações | Resultado | Cobrado |
|---|---|---|---|---|
| Referência do personagem | gpt-image-2 | alta, 2048x1152 | concluído | $0,1745 |
| Referência do adereço | gpt-image-2 | alta, 2048x1152 | concluído | $0,1745 |
| Áudio de referência | music-2.6 | instrumental, mp3 | concluído, faixa de 164s, espera de 209s | $0,15 |
| Plano A | h3/reference-to-video | 2K, 8s, 2 refs de imagem | concluído em 309s | $1,12 |
| Plano B | h3/reference-to-video | 2K, 8s, refs de imagem + vídeo + áudio | concluído em 557s | $1,12 |
| Escada, sem referência | h3/text-to-video | 768P, 4s | concluído em 154s | $0,40 |
| Escada, 1 ref de imagem | h3/reference-to-video | 768P, 4s | concluído em 119s | $0,40 |
| Escada, 2 refs de imagem | h3/reference-to-video | 768P, 4s | concluído em 128s | $0,40 |
| Reestilização de anime | h3/reference-to-video | 768P, 4s, 1 ref de vídeo | concluído em 239s | $0,40 |
| Reexecução da Etapa 5 no playground | h3/reference-to-video | 2K, 8s, refs de imagem + áudio | concluído | $1,12 |
| Controle: 10 refs de imagem | h3/reference-to-video | 768P, 4s | concluído em 150s | $0,40 |
| Controle: imagem de primeiro quadro + refers | h3/reference-to-video | 768P, 4s | concluído, uma entrada descartada | $0,40 |
| Controle: refers em image-to-video | h3/image-to-video | 768P, 4s | concluído, refers descartados | $0,40 |
| Controle: 16,1s de áudio de referência | h3/reference-to-video | 768P, 4s | concluído acima de um limite documentado | $0,40 |
| Controle: ratio omitido, depois ratio adaptive | h3/reference-to-video | 768P, 4s, duas vezes | ambos concluídos, idêntico 1344x768 | $0,80 |
| Reexecuções de captura de tela das Etapas 1 e 4 | gpt-image-2, music-2.6 | como acima | concluído | $0,32 |
| Controle: áudio de referência sozinho | h3/reference-to-video | 768P, 4s | falhou em 7ms | $0,00 |
| Controle: áudio de referência de 164s | h3/reference-to-video | 768P, 4s | falhou em 16s | $0,00 |
| Controle: MIME audio/mpeg | h3/reference-to-video | 768P, 4s | falhou em 17s | $0,00 |
| Controle: URL de referência morta | h3/reference-to-video | 768P, 4s | falhou em 21s | $0,00 |
| Total | $8,18 |
Divida esse total honestamente. A cena finalizada de dois planos no topo deste artigo, referências e áudio incluídos, é $2,74 disso. Os outros $5,44 são a investigação: controles, quebras deliberadas e reexecuções de etapas no navegador para as capturas de tela. Se você já conhece as regras, uma sequência de dois planos de 16 segundos em 2K custa menos que um sanduíche.
Três coisas emergem dessa tabela.
Referências são gratuitas. O controle de dez imagens custou exatamente os mesmos $0,40 que a execução da escada de uma imagem no mesmo comprimento e resolução. Nesta plataforma, o medidor conta apenas segundos de saída e resolução. Vale a pena notar uma contradição: as próprias regras da plataforma MiniMax descrevem o vídeo de entrada sendo cobrado à taxa de saída, e o esquema unificado no OpenRouter carrega um item de linha separado reference_images. Nenhum dos dois apareceu na minha fatura aqui. Se você está orçando em outro lugar, precifique você mesmo em vez de assumir.
Falha é gratuita, e é tardia. Todas as quatro rejeições não custaram nada, o que é a boa notícia. A má notícia é quando elas chegam: 7 milissegundos para a regra do áudio sozinho, 16 a 21 segundos para a duração do áudio, o MIME errado e a URL morta, e nada no momento da submissão. Toda requisição malformada neste artigo recebeu HTTP 200 e um ID de previsão primeiro, então trate uma resposta de submissão como um recibo, não como validação, e consulte o campo status antes de acreditar em qualquer coisa.
Sucesso silencioso é a falha cara. Os dois controles de mistura custaram cada um $0,40 completos e retornaram um vídeo perfeitamente válido construído a partir da metade das minhas entradas. Não há erro, nenhum campo de aviso e nenhuma maneira de saber pela resposta que algo foi descartado. Essa é a única linha na tabela onde o dinheiro saiu da conta e eu não obtive nada que queria.
Uma correção honesta sobre esse último ponto, porque mudou enquanto eu escrevia. No início de agosto, uma URL de referência que retornava 404 se comportava da mesma maneira: o trabalho era concluído, a referência era silenciosamente ignorada e o valor total era cobrado. Reexecutando em 12/08/2026, o endpoint agora verifica a acessibilidade e falha o trabalho de graça com um erro nomeado, content[1].image_url: media not found (HTTP 404). Esse buraco específico está fechado. O buraco de entradas mutuamente exclusivas não está. Para cálculos de crédito por clipe, Créditos do MiniMax H3 por vídeo tem as tabelas.
De Quem é o Rosto, de Quem é a Voz: Verifique Isso Antes de Enviar uma Referência
Este endpoint é diferente do texto para vídeo em um aspecto legalmente relevante: você fornece a semelhança. Uma imagem de referência de uma pessoa real, um clipe de referência do filme de alguém, um vocal de referência em uma voz reconhecível, tudo isso é material para o qual você está afirmando ter o direito de usar. As regras de conteúdo do lado do modelo ainda se aplicam além disso, e são mais rigorosas sobre pessoas reais do que sobre pessoas inventadas. Dois guias que vale a pena ler antes que um cliente veja a saída: Restrições de conteúdo do MiniMax H3 e o detalhamento de uso comercial e licenciamento, que também cobre as exclusões territoriais nos termos da MiniMax.
MiniMax H3 Reference to Video: Perguntas Frequentes
O MiniMax H3 reference to video pode manter o mesmo personagem em dois planos diferentes?
Sim, e meu teste de dois planos acima se mantém mesmo com uma inversão total de iluminação noite-para-manhã. Mas uma imagem do personagem sozinha não é o que faz isso. O padrão confiável é passar a URL de saída do plano anterior de volta como uma referência de vídeo junto com a imagem do personagem, para que a segunda chamada herde gradação e granulação, bem como identidade.
Posso usar uma imagem de primeiro quadro e referências na mesma chamada do MiniMax H3 reference to video?
Não, e o modo de falha é o problema. Enviar tanto image quanto refers não gera erro. Testado em 12/08/2026, o trabalho foi concluído em 115 segundos, cobrou $0,40 e descartou silenciosamente uma das duas entradas. O mesmo acontece ao contrário no endpoint image-to-video. Escolha um caminho por chamada.
Posso enviar um arquivo de áudio sozinho como uma referência do MiniMax H3 reference to video?
Não. O áudio deve viajar com pelo menos uma imagem ou vídeo de referência, e o endpoint aplica isso com um erro explícito: reference-to-video requires at least one reference image or video. Ele chega na etapa de geração, não na submissão, e o trabalho rejeitado é gratuito. As referências de áudio também devem estar dentro de 2 a 15 segundos, 15 segundos combinados, e ser declaradas como audio/mp3 em vez de audio/mpeg.
O MiniMax H3 reference to video cobra extra por cada arquivo de referência?
Não no Atlas Cloud. Uma execução com dez imagens de referência e uma com uma única imagem cobraram os mesmos $0,40 em 768P e 4 segundos, então o medidor rastreia apenas segundos de saída e resolução. No entanto, note a contradição: as próprias regras da MiniMax mencionam que o vídeo de entrada é medido à taxa de saída, e outras plataformas expõem um item de linha separado de imagem de referência. Verifique na superfície em que você está faturado.
O que acontece se uma das minhas URLs do MiniMax H3 reference to video estiver quebrada?
A partir de 12/08/2026, o endpoint valida a acessibilidade e falha todo o trabalho de graça, com content[1].image_url: media not found (HTTP 404) após cerca de 21 segundos. Isso é uma mudança: no início de agosto, a mesma requisição era concluída, ignorava silenciosamente a referência ausente e cobrava o preço total. Não assuma que relatos de comportamento mais antigos ainda são válidos, e verifique o campo status em vez de assumir que um 200 na submissão significa algo.
O MiniMax H3 reference to video é realmente o melhor modelo para isso?
No único confronto direto público que o mede, sim, por pouco. O MiniMax H3 lidera o ranking de edição de vídeo com Elo 1.125 em 10.280 votos, mas sua faixa de classificação listada é de 1 a 2 e o Gemini Omni Flash está 3 pontos Elo atrás com um intervalo sobreposto. Trate-o como "o melhor disponível em conjunto", escolha com base no resto do fluxo de trabalho e leia Alternativas ao MiniMax H3 se o empate for importante para você.






