Seedance 2.5 ya está disponible — Primero en Atlas Cloud

MiniMax H3 Referencia al video: Un personaje, dos tomas, y la regla que silenciosamente te quita el dinero.

Cada guía repite la hoja de especificaciones 9/3/3. Esta la ejecuta: una escena de dos tomas a partir de referencias de imagen, video y audio en una referencia de videollamada MiniMax H3.

Cada artículo sobre este modelo se detiene en la misma línea. Nueve imágenes, tres videoclips, tres pistas de audio, doce archivos en total. Parece una tarjeta de garantía.

Así que lo traté como tal. Construí un personaje, construí un atrezo, generé una escena nocturna, realimenté esa escena nocturna como video de referencia, corté ocho segundos de jazz en una pista de audio de referencia, y envié los tres tipos de referencia en una sola solicitud. Luego empecé a romper las reglas a propósito para ver cuáles defiende realmente la API.

Cuatro de ellas no se defienden como esperarías. Una de ellas aún te cobra el precio completo por un video que no pediste, y el mensaje de error que esperabas nunca llega. Ese es el que vale la pena leer hasta el final.

Conclusiones clave

  • Tres tipos de referencia, un solo array. Hasta 9 imágenes, 3 videoclips y 3 pistas de audio, 12 archivos combinados. Todos van en el mismo campo refers, y type es opcional porque la API lo infiere de la extensión del archivo.
  • El audio nunca puede ir solo. Una solicitud solo de audio es rechazada con un error con nombre. Debe ir acompañado de al menos una imagen o un video.
  • Referencia a video e imagen a video son mutuamente excluyentes, pero nada te lo dice. Envía una image de primer fotograma junto con refers y el trabajo se completa de todos modos. Una de tus dos entradas se descarta en silencio, a precio completo. Verificado dos veces el 12 de agosto de 2026, en ambos endpoints.
  • Nada se valida al enviar. Cada solicitud incorrecta en este artículo devolvió HTTP 200 y un ID. El veredicto real llega dos o tres minutos después, en la etapa de generación. Los rechazos allí son gratuitos; las finalizaciones no.
  • Los archivos de referencia adicionales son gratuitos. Una imagen de referencia y diez imágenes de referencia facturan exactamente la misma cantidad para la misma duración del clip. El precio sigue los segundos de salida, no el recuento de entrada.

Esto es lo que salió al otro lado. Dos tomas, un rostro, dos lugares completamente diferentes, y la segunda toma se construyó a partir de una imagen, un video y un archivo de audio al mismo tiempo.

Toma A (lluvia, noche, callejón de neón) luego Toma B (mercado cubierto vacío a la mañana siguiente), unidas sin más añadido que la unión. La misma mujer, la misma cicatriz sobre la ceja derecha, la misma chaqueta añil, la misma toalla. La Toma B se generó a partir de tres referencias a la vez: su retrato, el clip de la Toma A en sí, y un fragmento de ocho segundos de jazz. Ambas tomas son minimax/h3/reference-to-video en 2K, 2560x1440, 24fps, con la pista estéreo nativa de 32kHz. Vale la pena tener el sonido activado en la segunda mitad, donde ella dice su línea.

Por qué MiniMax H3 Reference to Video supera cualquier prompt que puedas escribir

Un prompt describe a una persona. Una referencia es la persona. Esa diferencia es la razón de ser de este endpoint, y es por lo que MiniMax H3 se sitúa actualmente en la cima del ranking de edición de video: Elo 1.125 en 10.280 votos (Artificial Analysis, agosto de 2026). Vale la pena ser precisos con ese número, sin embargo: la misma tabla enumera su rango de posición como 1 a 2, estadísticamente empatado con Google Gemini Omni Flash con 1.122. Primer lugar, dentro de un intervalo de confianza que comparte. La afirmación relacionada de que H3 también se encuentra entre los tres primeros tanto para texto a video como para imagen a video proviene de la misma publicación del laboratorio (Artificial Analysis en X, agosto de 2026).

Los rangos son baratos. Aquí está el comportamiento real, el mismo prompt, tres niveles de referencia, todo lo demás idéntico.

digamos

Tres ejecuciones de MiniMax H3 reference to video con el mismo prompt: sin referencia, una imagen de referencia del personaje y dos imágenes de referencia

Mismo prompt, mismas configuraciones 768P 4s, de izquierda a derecha: sin referencias en absoluto (texto a video), una imagen de referencia del personaje, dos imágenes de referencia (personaje más el cuenco de ramen). El prompt dice "la mujer de la imagen de referencia" en las tres. En el panel izquierdo, esa frase no se refiere a nadie, por lo que el modelo inventa un desconocido. Generado con minimax/h3/text-to-video y minimax/h3/reference-to-video.

Dos lecturas honestas de esa tira. El salto del panel uno al panel dos es enorme: sin una referencia, "la mujer de la imagen de referencia" es una frase que no apunta a nada, y el modelo llena silenciosamente el vacío con una persona que no tiene relación con tu proyecto. El salto del panel dos al panel tres es mucho más pequeño, porque mi prompt también describía el cuenco con palabras, y H3 dibujó un cuenco azul marino pasable con una grulla solo a partir del texto. Esa es la parte útil. Una imagen de referencia y una buena frase nominal compiten por el mismo trabajo, así que gasta tus espacios de referencia en las cosas que el lenguaje no puede precisar: un rostro específico, un producto específico, un logotipo específico.

El patrón detrás de casi todos los fallos en este artículo es el mismo que el panel uno. Nada te advierte que parte de tu solicitud aterrizó en la nada.

Lo que una referencia realmente fija, y lo que no. Una imagen de referencia fija la identidad: estructura facial, cabello, marcas distintivas, prenda. No fija la iluminación, y esta es la sorpresa más común. También arrastra la luz de la foto de referencia, por lo que una hoja de personaje tomada en un entorno con ambiente produce un personaje que no puede sobrevivir a un cambio de escena. Toma tu referencia de forma plana y neutra. Un video de referencia fija el movimiento, la gradación y el grano, no la identidad. Un audio de referencia fija la cama de audio en sí. Si necesitas el mismo rostro diciendo una línea con la misma voz a lo largo de una serie, la pila de referencias está haciendo tres trabajos diferentes y debes especificar cuál es cuál. Las guías de profesionales convergen en nombrarlos posicionalmente en el prompt ("La imagen 1 es el personaje, la imagen 2 es el producto") y esa convención vale la pena adoptarla; mis prompts a continuación usan un nombre descriptivo simple en su lugar, que también funciona cuando las referencias son visualmente inequívocas.

Por qué la primera llamada suele decepcionar. Cuatro cosas, todas medidas el 12 de agosto de 2026:

  1. El endpoint de envío no valida nada. MIME incorrecto, audio de 164 segundos, una URL muerta, campos mutuamente excluyentes: todo devuelve HTTP 200 con un ID de predicción. Te enteras después.
  2. ratio por defecto es adaptive, documentado como "deja que el modelo elija". Con referencias 16:9 obtuve 1344x768 a 768P tanto si lo dejaba en adaptive como si forzaba 16:9, por lo que el valor predeterminado es inofensivo cuando tus entradas ya coinciden. Es una moneda al aire cuando no lo hacen, y este es el único endpoint de H3 donde puedes simplemente quitarle la decisión.
  3. Una imagen de primer fotograma más referencias no da error. Descarta silenciosamente una de ellas y te factura.
  4. Si el modelo no tiene nada concreto a lo que aferrarse, llena el vacío con confianza, y un rostro incorrecto con confianza se ve exactamente como una ejecución exitosa.

Para el aspecto de la elaboración de prompts, la Guía de prompts de MiniMax H3 profundiza en la redacción más de lo que puedo aquí.

El libro de reglas de MiniMax H3 Reference to Video: tres tipos, una solicitud

Los tres tipos de referencia comparten un array. Aquí está el contrato tal como se publicó, junto con lo que el endpoint realmente hizo cuando lo probé.

Tabla 1: los tres tipos de referencia

Imágenes de referenciaVideo de referenciaAudio de referencia
Archivos máx.93 clips3 clips
Máximo combinado12 archivos entre los tres tipos
Duración por archivon/a2 a 15 segundos2 a 15 segundos
Duración totaln/a15 segundos15 segundos
Formatospng, jpeg, jpg, webpmp4, movmp3, wav
¿Se puede usar sola?No, necesita una imagen o un video
Lo que fijaidentidad, prenda, producto, estilomovimiento, cámara, gradación, granola cama de audio en sí
Lo que no fijailuminación de la nueva escenaquién está en el planola pista exacta (ver Paso 6)
Se entrega comoURL pública o URL de datos base64URL pública o URL de datos base64debe declararse audio/mp3, no audio/mpeg
¿Se aplica?10 imágenes funcionaron bienno probado más allá de 1 clipventana por clip aplicada, total de 15s no se aplicó

Los recuentos de archivos y las ventanas de duración son los límites publicados por MiniMax (Hailuo, agosto de 2026), verificados con el artículo de lanzamiento que enumera la misma ventana de video de referencia de 2 a 15 segundos cada uno y 15 segundos en total (MarkTechPost, agosto de 2026). Todo en las últimas tres filas es mío, medido.

Dos cosas que la hoja de especificaciones no te dice. Primero, el campo type en cada entrada es opcional y se infiere de la extensión de la URL, lo que significa que una URL de datos base64 o un enlace sin extensión debe declarar su tipo o la solicitud adivinará mal. Segundo, el cargador del navegador tiene un límite de nueve archivos (Materiales de referencia (2/9), MÁX:9 en la captura de pantalla del Paso 5 a continuación), por debajo del propio límite de MiniMax de doce. Envié diez imágenes de referencia a través de la API de todos modos y el trabajo se completó normalmente, por lo que nueve es un límite de la interfaz de usuario, no un límite del modelo.

Tabla 2: referencia a video vs imagen a video vs texto a video

reference-to-videoimage-to-videotext-to-video
Acepta referssí, obligatorio, mínimo 1no (se ignora en silencio)no
Acepta imagen de primer fotogramano (se ignora en silencio)sí, obligatoriono
Acepta end_image último fotogramanono
Opciones de ratiolos 7, incl. 16:9, 9:16, 21:9solo adaptivelos 7
Resolución768P o 2K, por defecto 2Kigualigual
Duraciónenteros de 4 a 15s, por defecto 8igualigual
Mezclar la entrada del otro endpointtrabajo completado, entrada descartada, cargo completotrabajo completado, refers descartados, cargo completon/a

Esa cuarta fila es la diferencia que nadie menciona. En imagen a video, el enumerado de relación de aspecto contiene exactamente un valor, adaptive, porque el primer fotograma decide la forma. En referencia a video obtienes los siete, lo que convierte a este en el único endpoint de H3 donde puedes forzar una forma de fotograma mientras sigues anclando un personaje. Si estás eligiendo un nivel para este trabajo, 2K vs 768P para MiniMax H3 cubre lo que aportan los píxeles adicionales.

La última fila es la costosa. La documentación presenta los dos endpoints como mutuamente excluyentes, y lo son, en el sentido de que solo se honra una ruta de entrada. Pero no hay error. Lo ejecuté de ambas maneras el 12 de agosto de 2026: una llamada reference-to-video que llevaba una image de primer fotograma se completó en 115 segundos y facturó $0.40, y una llamada image-to-video que llevaba refers se completó en 167 segundos y facturó $0.40. Ambas produjeron un video. Ambas descartaron la mitad de lo que envié, y ningún campo en la respuesta indica qué mitad.

Tabla 3: los modelos que utiliza este flujo de trabajo

Todo lo siguiente se ejecuta en una pestaña del navegador en Atlas Cloud, que es de donde provienen los precios y las capturas de pantalla. Tarifas verificadas el 12 de agosto de 2026.

PasoModeloTarifaEjecuciones aquíCosto
Referencias de personaje + atrezoopenai/gpt-image-2/text-to-imagelistado desde $0.009; alta calidad a 2048x1152 medido en $0.17452$0.35
Audio de referenciaminimax/music-2.6$0.15 por pista1$0.15
Toma A y Toma Bminimax/h3/reference-to-video$0.10/s a 768P, $0.14/s a 2K2 x 8s a 2K$2.24
Escalera de referenciaigual, más minimax/h3/text-to-video$0.10/s a 768P3 x 4s a 768P$1.20

Ningún descuento está activo en ninguno de los tres endpoints de H3 este mes. Dos vecinos son más baratos ahora mismo si solo estás construyendo imágenes fijas de referencia: gpt-image-2-developer/text-to-image está al 50% de descuento, de $0.009 a $0.004 a partir de agosto de 2026. Los desgloses completos por segundo están en la guía de Precios de la API de MiniMax H3.

MiniMax H3 Reference to Video, paso a paso

La escena: una mujer que regenta un puesto de ramen. La Toma A es un callejón lluvioso de neón por la noche. La Toma B es la misma mujer a la mañana siguiente en un mercado cubierto vacío, un lugar diferente, una hora del día diferente y un objetivo diferente. Nada se transfiere entre las dos llamadas excepto las referencias, que es el objetivo de la prueba.

Paso 1: Construir la referencia del personaje, iluminada de forma plana a propósito

Este es el paso que la gente hace mal. Una referencia de personaje no es una foto bonita de tu personaje, es una medición de su rostro. Luz neutra, fondo sencillo, sin escena, sin ambiente. H3 aprende la luz junto con el rostro, por lo que una referencia atmosférica produce un personaje que está soldado a esa atmósfera.

Modelo: openai/gpt-image-2/text-to-image. Configuración: calidad high, tamaño 2048x1152 (16:9), formato png.

text
1Fotografía editorial de una mujer de unos treinta años, chef de comida callejera. Retrato de tres cuartos cercano, expresión neutra, contacto visual directo con la cámara. Cabello negro corto recogido detrás de una oreja, una pequeña cicatriz sobre la ceja derecha, piel aceitunada cálida. Lleva una chaqueta de trabajo añil desgastada con las mangas arremangadas hasta el codo y una toalla blanca doblada sobre el hombro izquierdo. Fondo de estudio gris claro liso, luz clave suave y uniforme, sin atrezo, enfoque nítido en el rostro, textura de piel natural, sin retoques. Fotorrealista, lente de 50 mm.

Captura de pantalla del generador de imágenes AI que muestra el prompt de entrada y el retrato generado

El playground de GPT Image 2 en Atlas Cloud con el prompt de referencia del personaje cargado y el retrato terminado en el panel de salida

GPT Image 2 en Atlas Cloud: calidad configurada en alta, 16:9, la hoja del personaje renderizada a la derecha.

Mujer con un mono azul y una toalla sobre el hombro

Imagen de referencia del personaje para MiniMax H3 reference to video: retrato de estudio neutro de una chef de ramen con una cicatriz sobre la ceja derecha

Imagen de referencia 1. La cicatriz sobre la ceja derecha y la toalla blanca doblada son deliberadas: son anclajes de identidad baratos e inequívocos que puedes verificar en cada fotograma posterior.

Paso 2: Construir la referencia del atrezo

Segundo espacio de referencia, segundo trabajo. Los objetos se comportan mejor que los rostros aquí, lo que convierte a un atrezo distintivo en la forma más fácil de demostrar que una referencia aterrizó. Mismo modelo, misma configuración.

text
1Fotografía de producto de un solo cuenco de ramen de cerámica azul marino oscuro con una grulla blanca pintada a mano en el lateral, desconchado en el borde, lleno de ramen shoyu humeante. Vista frontal, fondo gris claro liso, luz suave y uniforme, enfoque nítido, fotorrealista, lente de 50 mm.

cerdo, (5) huevo, (6) y (7) cebollas (8) verdes (9)

Imagen de referencia del atrezo: cuenco de ramen azul marino oscuro con una grulla blanca pintada a mano y un borde desconchado

Imagen de referencia 2. La grulla pintada a mano y el desconchón en el borde son las pistas. Si sobreviven en el video, la referencia fue leída.

Paso 3: Toma A, dos imágenes en MiniMax H3 reference to video

Dos imágenes de referencia, ambas type: "image", en refers. Establece la relación de aspecto explícitamente. adaptive es el valor predeterminado y normalmente hará lo correcto cuando tus referencias ya son 16:9, pero decide por ti, y en este endpoint no tienes por qué permitirlo.

Modelo: minimax/h3/reference-to-video. Configuración: resolución 2K, duración 8, ratio 16:9.

text
1Plano general de establecimiento. Lluvia intensa por la noche en un callejón estrecho iluminado con neón. La mujer de la imagen de referencia trabaja sola detrás de un pequeño puesto de ramen humeante bajo un toldo de plástico, sirviendo caldo en el cuenco azul marino con la grulla blanca de la imagen de referencia. El vapor se eleva a través de reflejos de neón rosas y verdes sobre el pavimento mojado. Acercamiento lento al puesto. Sonido ambiental: lluvia sobre plástico, caldo hirviendo, tráfico lejano. Sin diálogo.

La salida de esta llamada es la primera mitad del clip de muestra en la parte superior. Guarda su URL. Es la entrada para el Paso 5.

Paso 4: Cortar un audio de referencia de ocho segundos

El audio de referencia no es un espacio para banda sonora. Es una cama contra la que el modelo iguala su propia mezcla, y es la entrada más exigente del endpoint. Genera una pista, luego córtala, porque una canción completa es rechazada.

Modelo: minimax/music-2.6, con is_instrumental: true y format: "mp3".

text
1Jazz nocturno disperso, escobillas en caja, contrabajo, una trompeta con sordina, melancólico, 70 BPM, instrumental.

Luego corta aproximadamente ocho segundos y codifícalo como una URL data:audio/mp3. Tres cosas que hice mal aquí primero, todas con el texto de error exacto:

  • La cadena MIME importa más que los bytes. Declara data:audio/mpeg y la referencia es rechazada con audio format ".mpeg" not allowed, aunque el archivo sea un MP3 perfectamente normal. Escribe audio/mp3.
  • 2 a 15 segundos por clip, y se aplica. Mi pista generada tenía 164 segundos. Devolvió invalid param: audio duration 164258 ms, expected [2000, 15000] ms. Cortarlo a 8.05 segundos lo solucionó. Ambos rechazos no costaron nada.
  • El límite combinado de 15 segundos está documentado pero no se aplica. Envié dos clips de 8 segundos en la misma solicitud, 16.1 segundos en total, esperando un rechazo. El trabajo se completó y facturó normalmente. No te bases en eso: está publicado como un límite y podría empezar a comportarse como tal en cualquier momento.

Interfaz del generador de música AI que muestra el prompt de texto y la forma de onda de audio generada

El playground de MiniMax Music 2.6 en Atlas Cloud con el prompt de jazz y la pista terminada en el panel de salida

MiniMax Music 2.6 en Atlas Cloud, $0.15 por ejecución, pista terminada a la derecha. Una cosa para copiar de esta captura de pantalla y una que no: el precio y el formato mp3 son correctos, pero Is Instrumental aún está desactivado y las letras de demostración de la página aún están en el cuadro, por lo que esta ejecución en particular devolvió una canción de 1:35 con voces. Activa ese interruptor y limpia el campo de Letras antes de ejecutarlo, o estarás cortando una cama de referencia con alguien cantando encima. Mi ejecución de API, con isinstrumental: true, devolvió 2:44 de instrumental en 209 segundos.

Paso 5: Toma B, una llamada a MiniMax H3 reference to video con los tres tipos

Esta es la llamada de la que realmente trata la palabra clave. Tres tipos de referencia, tres trabajos diferentes, un array:

  1. el retrato del personaje del Paso 1, type: "image", para mantener su rostro
  2. el mp4 de la Toma A del Paso 3, type: "video", para llevar la gradación y el grano a través del corte
  3. el fragmento de jazz de ocho segundos del Paso 4, type: "audio", como cama

Las URL de salida de otras generaciones en la plataforma se pueden colocar directamente en refers como referencia de video, que es el mecanismo real detrás de la continuidad en múltiples tomas. No es "H3 recuerda a tu personaje". Le devuelves la toma anterior.

Modelo: minimax/h3/reference-to-video. Configuración: resolución 2K, duración 8, ratio 16:9.

text
1La misma mujer de la imagen de referencia, a la mañana siguiente. Mercado cubierto brillante y vacío, luz diurna limpia y fría a través de un tragaluz, persianas aún bajadas detrás de ella. Plano medio cercano, cámara estática. Ella limpia el mostrador con la toalla blanca doblada, mira a la cámara y dice una línea, luego vuelve al trabajo. Mantén su rostro, cabello, cicatriz y chaqueta añil idénticos a la referencia. Mantén la gradación y el grano del clip de referencia. Usa el audio de referencia como subrayado.

Interfaz del generador de video AI que muestra el prompt de entrada y el video generado

El playground de MiniMax H3 Reference-to-Video en Atlas Cloud con una referencia de imagen y una de audio cargadas y el clip generado en el panel de salida

La misma llamada en el playground de MiniMax H3 Reference-to-Video, a 2K y 8 segundos. Dos espacios de referencia de diferentes tipos son visibles en Materiales de referencia (2/9): el espacio 1 es ref-audio-8s.mp3, el espacio 2 es su retrato. La referencia de video se introduce a través de "Añadir mediante enlace" (parte superior derecha de ese panel) o a través de la API, porque reside en una URL en lugar de en el disco. Tres cosas que leer en este panel: el cargador dice MÁX:9 aunque el propio límite de MiniMax es 12, la Relación de aspecto está en adaptive a menos que la cambies, y el precio de ejecución para 2K a 8 segundos es $1.12, que es el nivel de $0.14 por segundo.

Paso 6: Verificar que la referencia realmente aterrizó

Un trabajo completado no es un trabajo exitoso. Dos comprobaciones, ambas baratas.

Comprueba el rostro. Toma un fotograma de cada toma y ponlos uno al lado del otro. Buscas los anclajes que plantaste: la cicatriz, la línea del cabello, la chaqueta, la toalla.

Comparación de una mujer en iluminación nocturna de neón y matutina de mercado

Fotograma de la Toma A junto a un fotograma de la Toma B, que muestra el mismo personaje de MiniMax H3 reference to video en dos escenas diferentes

Izquierda: Toma A, noche, neón, plano general. Derecha: Toma B, mercado cubierto, mañana siguiente, plano medio cercano. Mismo rostro, misma cicatriz sobre la ceja derecha, misma chaqueta y toalla, a través de un cambio de escena y encuadre sin nada compartido excepto las referencias.

Una cosa no salió como escribí el prompt. Pedí "mercado cubierto brillante y vacío, luz diurna fría y limpia" y "mantén la gradación y el grano del clip de referencia", y el clip de referencia ganó. La Toma B es inequívocamente de mañana e inequívocamente un lugar diferente, pero es mucho más atmosférica de lo que implica "brillante", porque la gradación nocturna vino con la referencia de video. No puedes pedir a una misma llamada el mismo aspecto y la luz opuesta. Si necesitas que la luz cambie, elimina la instrucción de gradación, o elimina la referencia de video y mantén la identidad solo con la imagen.

Comprueba el audio. Traza la forma de onda del fragmento de ocho segundos que subiste junto a la pista que regresó dentro del mp4, y añade un control: un clip generado sin ninguna referencia de audio.

Tres formas de onda de audio apiladas que comparan las pistas subida, devuelta y de control

Forma de onda del audio de referencia de ocho segundos subido, la pista de audio devuelta dentro del clip generado y un control sin referencia de audio

Arriba: el fragmento de jazz de 8.05 segundos enviado como referencia. Medio: la pista extraída del mp4 devuelto de la Toma B, dominada por la línea de diálogo alrededor de los 5.5 segundos. Abajo: Toma A, mismo flujo de trabajo, sin referencia de audio.

Aquí es donde tengo que corregir algo que creía antes de empezar. El audio de referencia no regresa textualmente. La correlación de envolvente entre mi fragmento y la pista devuelta es de 0.25, frente a -0.05 para el control sin referencia, por lo que los dos están relacionados pero en ningún caso son idénticos, y la forma devuelta es claramente su propia mezcla en lugar de mi archivo con algo superpuesto. Lo que la referencia claramente hizo fue poner algo debajo: la cama de la Toma B funciona unos 7 dB más caliente que el control sin audio durante los primeros cinco segundos, antes de que comience cualquier diálogo. Interpreta el audio de referencia como una guía para la mezcla, no como un espacio para música. Si necesitas tu pista exacta debajo de la imagen, colócala después.

Si estás trabajando en el lado de audio de esto, Sincronización de labios y audio de MiniMax H3 y el tutorial de Video musical de MiniMax H3 comienzan desde este mismo comportamiento de audio de referencia. Para el código de sondeo y reintento en torno a todo esto, el Tutorial de MiniMax H3 tiene el bucle.

Cuatro configuraciones más de MiniMax H3 Reference to Video que vale la pena robar

Reestilizar un clip que ya posees. Coloca un clip terminado en refers como referencia de video, sin imágenes, y pide un medio diferente. El movimiento, el encuadre, el acercamiento y el atrezo sobreviven; la superficie cambia. Este es el mecanismo detrás del ranking de edición de video de H3, y es el mismo detrás del trabajo de anime en MiniMax H3 vs Veo 3.1 para anime.

Mujer cocinando en un carrito de comida en un callejón iluminado con neón

Reestilización anime generada a partir del clip de la Toma A utilizado como referencia de MiniMax H3 reference to video

El callejón de la Toma A devuelto como única referencia, con un prompt de anime con sombreado plano. Mismo puesto, mismo cucharón, mismo cuenco de grulla, mismo acercamiento, redibujado. Un detalle que vale la pena conocer: la conversión es más débil en los primeros fotogramas y más fuerte una vez que la cámara se compromete con el movimiento. Mostrado como un GIF silencioso. Generado con minimax/h3/reference-to-video a 768P, 4s, $0.40.

Hacer cantar una foto. Un retrato más un clip vocal dentro de la ventana de 2 a 15 segundos, prompt de la interpretación. Más barato que un pipeline de sincronización de labios porque es una sola llamada.

Fijar un producto en cualquier escena. Las imágenes de referencia fijan los objetos más que los rostros, por lo que una foto de producto real más un prompt de escena es lo más fiable en este endpoint. Consulta lo que se permite hacer con el resultado antes de que aparezca en un anuncio.

Construir una serie, no un clip. Encadénalo: la salida de la toma N se convierte en la referencia de video de la toma N+1. Cada llamada sigue teniendo un límite de 15 segundos, por lo que la continuidad es tu trabajo, no del modelo. Cuánto puede durar un video de MiniMax H3 cubre dónde muerde ese límite.

¿Comparando motores antes de comprometer una serie con uno? Seedance 2.5 vs MiniMax H3 y Alternativas a MiniMax H3 son los dos para leer.

Lo que realmente cuesta una escena de dos tomas con MiniMax H3 Reference to Video

Cada línea a continuación es un trabajo real del 12 de agosto de 2026, con el importe tomado del campo price que la API devuelve en cada predicción completada.

Tabla 4: la factura real

TrabajoModeloConfiguraciónResultadoFacturado
Referencia de personajegpt-image-2high, 2048x1152completado$0.1745
Referencia de atrezogpt-image-2high, 2048x1152completado$0.1745
Audio de referenciamusic-2.6instrumental, mp3completado, pista de 164s, espera de 209s$0.15
Toma Ah3/reference-to-video2K, 8s, 2 refs de imagencompletado en 309s$1.12
Toma Bh3/reference-to-video2K, 8s, refs de imagen+video+audiocompletado en 557s$1.12
Escalera, sin referenciah3/text-to-video768P, 4scompletado en 154s$0.40
Escalera, 1 ref de imagenh3/reference-to-video768P, 4scompletado en 119s$0.40
Escalera, 2 refs de imagenh3/reference-to-video768P, 4scompletado en 128s$0.40
Reestilización animeh3/reference-to-video768P, 4s, 1 ref de videocompletado en 239s$0.40
Re-ejecución del Paso 5 en el playgroundh3/reference-to-video2K, 8s, refs de imagen+audiocompletado$1.12
Control: 10 refs de imagenh3/reference-to-video768P, 4scompletado en 150s$0.40
Control: imagen de primer fotograma + refersh3/reference-to-video768P, 4scompletado, una entrada descartada$0.40
Control: refers en image-to-videoh3/image-to-video768P, 4scompletado, refers descartados$0.40
Control: 16.1s de audio de referenciah3/reference-to-video768P, 4scompletado superando un límite documentado$0.40
Control: ratio omitido, luego ratio adaptiveh3/reference-to-video768P, 4s, dos vecesambos completados, idéntico 1344x768$0.80
Re-ejecuciones de capturas de Pasos 1 y 4gpt-image-2, music-2.6como arribacompletado$0.32
Control: solo audio de referenciah3/reference-to-video768P, 4sfalló en 7ms$0.00
Control: audio de referencia de 164sh3/reference-to-video768P, 4sfalló en 16s$0.00
Control: MIME audio/mpegh3/reference-to-video768P, 4sfalló en 17s$0.00
Control: URL de referencia muertah3/reference-to-video768P, 4sfalló en 21s$0.00
Total$8.18

Divide ese total honestamente. La escena terminada de dos tomas al principio de este artículo, incluyendo referencias y audio, es $2.74 de eso. Los otros $5.44 son la investigación: controles, roturas deliberadas y re-ejecuciones de pasos en el navegador para las capturas de pantalla. Si ya conoces las reglas, una secuencia de dos tomas de 16 segundos a 2K cuesta menos que un sándwich.

Tres cosas se desprenden de esa tabla.

Las referencias son gratuitas. El control de diez imágenes costó exactamente los mismos $0.40 que la ejecución de la escalera de una imagen a la misma longitud y resolución. En esta plataforma, el medidor se basa en segundos de salida y resolución, nada más. Vale la pena señalar una contradicción: las propias reglas de la plataforma de MiniMax describen que el video de entrada se cobra a la tarifa de salida, y el esquema unificado en OpenRouter tiene un elemento de línea reference_images separado. Ninguno apareció en mi factura aquí. Si presupuestas en otro lugar, pruébalo tú mismo en lugar de asumir.

El fallo es gratuito, y llega tarde. Los cuatro rechazos no costaron nada, lo cual es la buena noticia. La mala noticia es cuándo llegan: 7 milisegundos para la regla de solo audio, 16 a 21 segundos para la duración del audio, el MIME incorrecto y la URL muerta, y nada en el momento de enviar. Cada solicitud mal formada en este artículo obtuvo HTTP 200 y un ID de predicción primero, así que trata una respuesta de envío como un recibo, no como una validación, y consulta el campo status antes de creerte nada.

El éxito silencioso es el fallo costoso. Los dos controles de mezcla costaron cada uno $0.40 completos y devolvieron un video perfectamente válido construido a partir de la mitad de mis entradas. No hay error, no hay campo de advertencia, y no hay forma de saber a partir de la respuesta que se descartó algo. Esa es la única línea en la tabla donde el dinero salió de la cuenta y no obtuve nada de lo que quería.

Una corrección honesta sobre ese último punto, porque cambió bajo mis pies mientras escribía. A principios de agosto, una URL de referencia que daba 404 se comportaba igual: el trabajo se completaba, la referencia se ignoraba silenciosamente y se cobraba el importe completo. Al volver a ejecutarlo el 12 de agosto de 2026, el endpoint ahora verifica la accesibilidad y falla el trabajo de forma gratuita con un error con nombre, content[1].image_url: media not found (HTTP 404). Ese agujero específico está cerrado. El agujero de entradas mutuamente excluyentes no lo está. Para las matemáticas de créditos por clip, Créditos de MiniMax H3 por video tiene las tablas.

De quién es el rostro, de quién es la voz: comprueba esto antes de subir una referencia

Este endpoint es diferente de texto a video en un aspecto legalmente relevante: tú proporcionas la semejanza. Una imagen de referencia de una persona real, un clip de referencia de la película de alguien, una voz de referencia en una voz reconocible, todo es material sobre el que afirmas tener derecho a usar. Las reglas de contenido del modelo aún se aplican además de eso, y son más estrictas con personas reales que con inventadas. Dos guías que vale la pena leer antes de que un cliente vea la salida: Restricciones de contenido de MiniMax H3 y el desglose de uso comercial y licencias, que también cubre las exclusiones territoriales en los términos de MiniMax.

MiniMax H3 Reference to Video: Preguntas frecuentes

¿Puede MiniMax H3 reference to video mantener el mismo personaje en dos tomas diferentes?

Sí, y mi prueba de dos tomas anterior se mantiene incluso con una inversión de iluminación completa de noche a mañana. Pero una imagen de personaje sola no es lo que lo hace. El patrón fiable es pasar la URL de salida de la toma anterior de vuelta como referencia de video junto con la imagen del personaje, para que la segunda llamada herede la gradación y el grano además de la identidad.

¿Puedo usar una imagen de primer fotograma y referencias en la misma llamada de MiniMax H3 reference to video?

No, y el modo de fallo es el problema. Enviar tanto image como refers no da error. Probado el 12 de agosto de 2026, el trabajo se completó en 115 segundos, facturó $0.40, y descartó silenciosamente una de las dos entradas. Lo mismo ocurre a la inversa en el endpoint de imagen a video. Elige una ruta por llamada.

¿Puedo enviar un archivo de audio solo como referencia de MiniMax H3 reference to video?

No. El audio debe viajar con al menos una imagen o video de referencia, y el endpoint lo aplica con un error explícito: reference-to-video requires at least one reference image or video. Llega en la etapa de generación, no al enviar, y el trabajo rechazado es gratuito. Las referencias de audio también deben estar dentro de 2 a 15 segundos, 15 segundos combinados, y declararse como audio/mp3 en lugar de audio/mpeg.

¿MiniMax H3 reference to video cobra extra por cada archivo de referencia?

No en Atlas Cloud. Una ejecución con diez imágenes de referencia y una con una facturaron los mismos $0.40 a 768P y 4 segundos, por lo que el medidor solo rastrea segundos de salida y resolución. Sin embargo, ten en cuenta la contradicción: las propias reglas de MiniMax mencionan que el video de entrada se mide a la tarifa de salida, y otras plataformas exponen un elemento de línea de imagen de referencia separado. Verifica en la superficie a través de la cual factures.

¿Qué sucede si una de mis URLs de referencia de MiniMax H3 reference to video está rota?

A partir del 12 de agosto de 2026, el endpoint valida la accesibilidad y falla todo el trabajo de forma gratuita, con content[1].image_url: media not found (HTTP 404) después de unos 21 segundos. Eso es un cambio: a principios de agosto, la misma solicitud se completaba, ignoraba silenciosamente la referencia faltante y cobraba el precio completo. No asumas que los informes de comportamiento anteriores siguen siendo válidos, y verifica el campo status en lugar de asumir que un 200 al enviar significa algo.

¿Es MiniMax H3 reference to video realmente el mejor modelo para esto?

En el único cara a cara público que lo mide, sí, por poco. MiniMax H3 lidera el ranking de edición de video con Elo 1.125 en 10.280 votos, pero su rango de posición listado es de 1 a 2 y Gemini Omni Flash está a 3 puntos de Elo detrás con un intervalo superpuesto. Trátalo como "el mejor disponible conjuntamente", elige según el resto del flujo de trabajo, y lee Alternativas a MiniMax H3 si el empate te importa.

Modelos recientes

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos