Todo el mundo hace lo mismo el primer día. Abres el menú desplegable de duración, ves 15 y empiezas a dividir. ¿Una película de diez minutos? Cuarenta generaciones. ¿Un vídeo explicativo de tres minutos? Doce. Luego miras el número que da esa división, cierras la pestaña y decides que el modelo no está listo para nada que tenga una historia.
Yo también hice la división. Luego ejecuté ffmpeg en nueve clips reales de H3 y encontré algo que hizo que todo el cálculo pareciera ridículo.
Uno de esos clips dura 15,10 segundos. Dentro, el detector de escenas marca diez cortes limpios. Diez. Vestuario diferente, encuadre diferente, fondos diferentes, cartelas a pantalla completa, todo dentro de una sola generación que costó el precio de una generación. Si hubiera planeado ese clip como indica la división, una generación por plano, habría pagado diez veces más por los mismos quince segundos.
La división es el error. El límite no es un cronómetro, es un contenedor, y casi nadie lo está llenando.

Un skater en pleno truco capturado como una secuencia estroboscópica, muchas posiciones distintas congeladas dentro de un solo fotograma
Un fotograma, muchos momentos. Ese es el modelo mental del que te aleja el menú desplegable de duración.
Conclusiones clave
- El parámetro
durationsolo acepta números enteros del 4 al 15. El valor predeterminado es 8. No existe 7,5 ni ningún valor superior a 15. - Cada clip se entrega a 24 FPS, hasta 2K nativos, con audio estéreo generado en la misma pasada que la imagen.
- Tu clip de "15 segundos" en realidad tiene 362 fotogramas, lo que equivale a 15,083 segundos. Las duraciones se ajustan a una cuadrícula de 17 fotogramas, y solo
duration: 8cae en un segundo exacto. - Una generación puede contener muchos planos. Escribe
SHOT 1 / CUT TOen el prompt y el modelo corta por ti, sin coste adicional. - No hay un parámetro de extensión en la API. Superas los 15 segundos encadenando: último fotograma en el siguiente primer fotograma, imágenes de referencia para mantener el aspecto y luego una concatenación directa.
Mira 45 Segundos de Duración de Vídeo MiniMax H3, Construidos a Partir de Tres Clips
Antes de cualquier teoría, aquí está la cosa en sí. Un spot de 45 segundos sobre un puesto de fideos llamado MIDNIGHT BOWL. Tres generaciones, quince segundos cada una, tres planos dentro de cada una. Nueve planos, una pieza narrativa continua, sin fundidos que oculten las uniones.
El montaje completo de 45 segundos. Tres generaciones de MiniMax H3 concatenadas sin efectos de transición. El chef, el delantal, la bombilla y el cartel pintado a mano sobreviven a dos traspasos.

Nueve fotogramas del spot MIDNIGHT BOWL organizados como una hoja de contactos de 3x3, etiquetados SHOT 1 a SHOT 9 con códigos de tiempo
Nueve planos, tres generaciones. Cada fila es una generación, cada columna un corte que el modelo hizo por sí solo. Los planos 3 y 4 riman porque la generación 2 comienza desde el fotograma final de la generación 1, que es exactamente lo que hace que la unión sea invisible.
Tres generaciones. No nueve. Esa brecha es el punto central de este artículo.
No corté nada a mano. Le pedí a cada generación tres planos con códigos de tiempo, y el detector de escenas de ffmpeg encontró los cortes en 4,9 s y 9,1 s en la primera, 4,9 s y 9,0 s en la segunda, 5,3 s y 11,0 s en la tercera. Nueve planos, tres facturas.
Por qué la Duración de Vídeo de MiniMax H3 Arruina los Planes de Larga Duración
El número en sí está bien. Quince segundos en la parte superior del rango es generoso para esta generación de modelos, y los clips son 2K con sonido estéreo real. Lo que arruina a la gente es la unidad con la que planifican.
Si presupuestas en segundos, una pieza de un minuto son "cuatro clips" y una de diez minutos son "cuarenta clips", y cuarenta clips de cualquier cosa son una pesadilla de trabajo de continuidad. Si presupuestas en planos, una pieza de un minuto son cuatro generaciones que contienen aproximadamente doce planos, que es una cantidad normal de cobertura para un comercial. El mismo modelo, el mismo límite, un plan de producción completamente diferente.

Ilustración retro de cartel plano de una sola tira de película de 35 mm en la que tres fotogramas consecutivos contienen cada uno una escena completamente diferente
Presupuesta en planos, no en segundos. Una tira facturada, tres escenas diferentes dentro de ella.
Hay una segunda cosa que rompe los planes de larga duración, y no es el límite en absoluto. Son las uniones. Los clips individuales casi nunca se desmoronan en el medio. Se desmoronan en las uniones, porque cada generación inventa su propia base de audio y se desvía ligeramente en el vestuario y la iluminación. Planifica las uniones y 45 segundos es fácil. Ignóralas y cuatro clips perfectos siguen pareciendo cuatro clips.
Qué es Realmente la Duración de Vídeo de MiniMax H3: de 4 a 15 Segundos Enteros en una Cuadrícula de 17 Fotogramas
Empecemos con la especificación, porque circulan dos números diferentes. El esquema de la API en vivo para los tres endpoints de H3 en Atlas Cloud enumera duration como un conjunto de exactamente 4, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, con un valor predeterminado de 8. Números enteros, nada fraccionario, nada más allá de 15. La cobertura del lanzamiento coincide con esa lectura: salida 2K, de 4 a 15 segundos, solo duraciones enteras (MarkTechPost, agosto de 2026). El propio comunicado de lanzamiento de MiniMax lo describe como hasta 15 segundos a 2K con sonido estéreo nativo (MiniMax, agosto de 2026).
Todavía verás "de 5 a 15 segundos" escrito en varios blurb de perfil y guías de inicio rápido, incluido algún texto en la propia plataforma. Considera el esquema como la verdad. El mínimo es 4, y he facturado clips de 4 segundos para demostrarlo.
Ahora la parte que casi nadie menciona. Pide 15 segundos y no obtienes 360 fotogramas. Obtienes 362.
H3 construye el vídeo en bloques de 17 fotogramas y ajusta la duración solicitada al siguiente conteo de fotogramas 17k + 5 a 24 FPS. Esa cuadrícula está documentada en el tutorial oficial de H3 de ComfyUI (ComfyUI Docs, 2026), y también se aplica en el lado de la API. Conté fotogramas en nueve archivos H3 reales con ffmpeg:
text1ffmpeg -i video-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | tail -1 2# frame= 362 ... 3# Duration: 00:00:15.10, 1280x720, 24 fps 4
Cada archivo de 15 segundos devolvió 362 fotogramas. Cada archivo de 10 segundos devolvió 243. Las tres nuevas generaciones que ejecuté para este artículo devolvieron 362 también, y el ensayo de 4 segundos del Paso 5 devolvió 107. Ejecútalos a través de la cuadrícula: 362 es 17x21+5, 243 es 17x14+5 y 107 es 17x6+5. La fórmula predijo los tres exactamente, que es el tipo de coincidencia que me hace confiar en el resto de la tabla.
| Duración | Fotogramas entregados (17k+5) | Duración real a 24 FPS | ¿Cae en un segundo exacto? | Fuente |
|---|---|---|---|---|
| 4 | 107 | 4,458 s | No | Medido |
| 5 | 124 | 5,167 s | No | Cuadrícula |
| 6 | 158 | 6,583 s | No | Cuadrícula |
| 7 | 175 | 7,292 s | No | Cuadrícula |
| 8 | 192 | 8,000 s | Sí | Cuadrícula |
| 9 | 226 | 9,417 s | No | Cuadrícula |
| 10 | 243 | 10,125 s | No | Medido |
| 11 | 277 | 11,542 s | No | Cuadrícula |
| 12 | 294 | 12,250 s | No | Cuadrícula |
| 13 | 328 | 13,667 s | No | Cuadrícula |
| 14 | 345 | 14,375 s | No | Cuadrícula |
| 15 | 362 | 15,083 s | No | Medido |
Tres cosas se desprenden de esa tabla.
duration: 8 es el único valor en todo el rango que te da un segundo exacto y limpio, y resulta ser el valor predeterminado. Eso no es una coincidencia, es 17x11+5 = 192 = 8 x 24 exactamente.
Pide 6 y te dan 6,583 segundos, más de medio segundo de imagen gratis. Pide 13 y obtienes 13,667. La cuadrícula siempre redondea hacia arriba, nunca hacia abajo, por lo que nunca te quedas corto.
Y si estás cortando al ritmo de la música o ajustando una edición con precisión de fotograma, nunca calcules tu línea de tiempo como duración x 24. Mide el archivo. Un proyecto de 40 clips planificado asumiendo segundos exactos se desvía casi cuatro segundos al final.
Diez Cortes Dentro de una Generación de MiniMax H3 de 15 Segundos
Aquí está el clip que mencioné al principio. Una generación, 362 fotogramas, 15,10 segundos en el contenedor. Es una pieza de tipo cinético de moda, y se comporta como un videoclip editado en lugar de una toma única.

Una sola generación de MiniMax H3. Cambios de vestuario, cambios de encuadre, pantallas divididas y cartelas a pantalla completa, todo dentro de un solo trabajo de 15 segundos.
Ejecuté el detector de escenas de ffmpeg en lugar de contar a ojo:
text1ffmpeg -i video-5.mp4 -vf "select='gt(scene,0.6)',showinfo" -f null - 2# 18 breaks flagged, at 1.54 2.88 3.63 4.21 5.54 5.83 6.92 8.88 11.17 13.00 ... 3
Diez de esos son cambios de plano limpios a lo largo de los primeros trece segundos. La cola es una cartela de título estroboscópica que parpadea sobre negro, lo que infla el recuento bruto, por lo que diez es el número conservador honesto. De cualquier manera, no es un solo plano, y no son tres.
Ahora el caso de control, porque "H3 siempre corta tu clip en pedazos" es el fallo opuesto e igualmente incorrecto. Este siguiente archivo también es una sola generación de 15 segundos, también 362 fotogramas, y el mismo detector encuentra exactamente cero cortes en él.

Otra generación única, los mismos 362 fotogramas, cero cortes detectados. Un movimiento de cámara continuo durante los quince segundos completos.
Por lo tanto, el límite no es "quince segundos de metraje". Son quince segundos de tiempo en pantalla que puedes subdividir como quieras, desde una toma única e ininterrumpida hasta diez cortes. Lo controlas desde el prompt y pagas lo mismo de cualquier manera.
Los Tres Endpoints Detrás de la Duración de Vídeo de MiniMax H3, en una Sola Pestaña
Superar los quince segundos requiere tres trabajos diferentes: algo para hacer un fotograma de anclaje, algo para animar y encadenar, y algo para mover la cámara sin perder al sujeto. En Atlas Cloud los cuatro viven en el mismo catálogo con una clave y un saldo, lo que importa aquí principalmente porque la cadena en la siguiente sección pasa archivos entre ellos repetidamente.
| Paso | Modelo | Trabajo en esta construcción | Rango de duración | Tarifa indicada, 4 de agosto de 2026 |
|---|---|---|---|---|
| Fotograma de anclaje | openai/gpt-image-2/text-to-image | Una imagen fija que define todo el aspecto | n/a | $0,1745 por mi ejecución en alta |
| Apertura, sin imagen fija | minimax/h3/text-to-video | Directamente del prompt al clip | 4 a 15 s, pred. 8 | $0,14 / s |
| Generaciones 1 y 2 | minimax/h3/image-to-video | Animar un primer fotograma, luego encadenar desde el último | 4 a 15 s, pred. 8 | $0,14 / s |
| Generación 3 | minimax/h3/reference-to-video | Nueva posición de cámara, mismo sujeto | 4 a 15 s, pred. 8 | $0,14 / s |
Los tres endpoints de H3 no tienen ningún descuento en este momento, por lo que la tarifa es la tarifa. Puedes confirmar cualquiera de ellos en el catálogo completo de modelos.
Tres trampas de parámetros que vale la pena conocer antes de escribir una sola solicitud, todas tomadas de los esquemas en vivo en lugar de la prosa de la documentación:
ratiose comporta de manera diferente en cada endpoint.text-to-videoofrece seis relaciones y el valor predeterminado es1:1, que te entregará silenciosamente un clip cuadrado si olvidas configurarlo, y no aceptaadaptiveen absoluto.image-to-videoofrece soloadaptive, por lo que el encuadre sigue a tu primer fotograma.reference-to-videoes el único que tiene el conjunto completo másadaptive.resolutiones768Po2K, con valor predeterminado2K. Ambos niveles se encuentran bajo una única tarifa por segundo en el catálogo, por lo que bajar a 768P no te ahorra dinero. Usa 2K.image-to-videotambién acepta unend_imageopcional. Puedes fijar ambos extremos de un clip, no solo el inicio. Eso convierte el truco de encadenamiento a continuación en algo que puedes dirigir desde ambas direcciones.
Cómo Superar el Límite de Duración de Vídeo de MiniMax H3, Paso a Paso
Esta es la construcción completa de MIDNIGHT BOWL. Cada prompt a continuación es el que realmente envié, cópialos textualmente. El tiempo de ejecución total son tres generaciones de H3 más una imagen fija, y todo es reproducible en una pestaña del navegador.
Paso 1: Fijar el Aspecto en un Fotograma de Anclaje
No empieces con vídeo. Empieza con una imagen fija que te guste de verdad, porque cada clip en la cadena heredará su luz, su vestuario y su cartelería. Hacer esto mal es caro; hacerlo bien cuesta céntimos.
Modelo: openai/gpt-image-2/text-to-image. Ajustes: calidad alta, relación 16:9.
text1Fotograma de película, 2 a. m. en un estrecho puesto de fideos en un callejón de Tokio. Un chef de 50 años con un delantal azul marino y un pañuelo blanco se inclina sobre una olla humeante detrás de un mostrador de madera rayado, mangas arremangadas hasta el codo, antebrazos iluminados con un naranja cálido por una sola bombilla colgante. El asfalto mojado por la lluvia refleja carteles rojos y verdes; farolillos de papel y un cartel de madera pintado a mano que dice "MIDNIGHT BOWL" cuelgan sobre el mostrador. El vapor se extiende a través del encuadre desde la derecha de la cámara. Grabado con un objetivo de 35 mm a f/2, profundidad de campo reducida, sombras profundas, clave de tungsteno cálida contra la noche azul fría, grano de película fino visible, sin superposiciones de texto. 2

El playground de GPT Image 2 en Atlas Cloud con el prompt de anclaje de MIDNIGHT BOWL completado y la imagen fija terminada en el panel de salida
GPT Image 2 en Atlas Cloud: calidad configurada en alta, 16:9, el fotograma de anclaje renderizado a la derecha.

El fotograma de anclaje de MIDNIGHT BOWL: un chef con delantal azul marino detrás de una olla humeante bajo una sola bombilla colgante en un callejón lluvioso
El fotograma de anclaje. Todo lo que sigue hereda esta bombilla, este delantal y este cartel.
Paso 2: Pon Tres Planos Dentro de una Generación de MiniMax H3 de 15 Segundos
Aquí está el movimiento que cambia el presupuesto. En lugar de pedir quince segundos continuos, entrega al modelo una lista de planos con códigos de tiempo explícitos y las palabras CUT TO. Cortará por ti, dentro de una generación facturada.
Modelo: minimax/h3/image-to-video. Ajustes: resolution 2K, duration 15, ratio adaptive (la única opción aquí, el encuadre sigue a tu primer fotograma), primer fotograma = la imagen fija del Paso 1.
text1SHOT 1 (0-5s): Plano general fijo del puesto. El vapor se eleva; el chef sirve caldo en un cuenco negro; la lluvia gotea del borde del toldo. SHOT 2 (5-10s): CUT TO un primer plano macro del cucharón rompiendo la superficie del caldo, grasa dorada arremolinándose, cebolleta picada cayendo en arcos lentos. SHOT 3 (10-15s): CUT TO un plano medio del chef mirando directamente al objetivo, secándose las manos en el delantal, y diciendo en japonés con una sonrisa cansada: "Ippai, dozo". Deja el cuenco en el mostrador y el plano se mantiene en su rostro. 2Audio: lluvia intensa sobre el toldo, caldo hirviendo, el cucharón golpeando el borde de la olla, un tren a lo lejos, zumbido bajo de la ciudad nocturna. Una línea de diálogo masculino japonés clara, tono de ambiente natural, sin música. 3Mantén el mismo chef, delantal, pañuelo, bombilla y cartelería en los tres planos. Solo cortes directos, sin fundidos, sin transiciones de cámara. Clave de tungsteno cálida, noche azul fría, aspecto de 35 mm, grano de película. 4
Tres cosas hacen que esto funcione. Rangos de segundos explícitos, la cadena literal CUT TO y una cláusula de continuidad al final que nombra cada elemento que debe sobrevivir a los cortes. Omite la cláusula de continuidad y el plano 3 volverá con un delantal diferente.

Playground de MiniMax H3 image-to-video en Atlas Cloud con el fotograma de anclaje cargado, duración 15 y 2K seleccionados, el clip terminado reproduciéndose en el panel de salida
MiniMax H3 image-to-video en Atlas Cloud: fotograma de anclaje cargado como primer fotograma, resolución 2K, el clip terminado a la derecha. Observa el control deslizante de Duración y el precio que lo sigue. Esta ejecución en particular dejó la duración en el valor predeterminado de 8, por lo que el botón muestra $1.12; en 15 muestra $2.10.

Generación 1. Un trabajo facturado, tres planos (cortes medidos en 4.92s y 9.13s), una línea de diálogo con sincronía de labios, 2560x1440 nativos y audio estéreo de 32 kHz en el mismo archivo.
Paso 3: Encadena los Siguientes 15 Segundos desde el Último Fotograma
No hay un parámetro de extensión. La cadena es manual y es trivial: extrae el fotograma final de la generación 1 y vuelve a introducirlo como el primer fotograma de la generación 2.
bash1ffmpeg -sseof -0.08 -i generation-1.mp4 -frames:v 1 -q:v 2 handoff-frame-01.jpg 2
Modelo: minimax/h3/image-to-video de nuevo. Ajustes: primer fotograma = handoff-frame-01.jpg, resolution 2K, duration 15, ratio adaptive.
La disciplina importante aquí es lo que omites. No describas al chef de nuevo. Ya está en los píxeles que acabas de entregar, y volver a describirlo le da al modelo permiso para reinterpretarlo.
text1Continúa desde este fotograma exacto, el mismo hombre, el mismo delantal, la misma luz. SHOT 1 (0-5s): Desliza el cuenco a través del mostrador con ambas manos hacia la cámara. SHOT 2 (5-10s): CUT TO un plano over-the-shoulder de las manos de un cliente levantando palillos de madera y partiéndolos, visibles los puños de mangas de un impermeable gris mojado. SHOT 3 (10-15s): CUT TO un macro extremo de un fideo siendo estirado, el vapor se eleva más allá del objetivo, el caldo gotea de vuelta al cuenco. 2Audio: lluvia continua y hervor que continúan desde antes, cerámica sobre madera, palillos rompiéndose, un sorbo, el mismo tren a lo lejos. Sin música, sin narración. 3Solo cortes directos. Misma clave de tungsteno de la bombilla colgante, misma noche azul fría detrás, mismo aspecto de 35 mm con profundidad de campo reducida y grano de película. 4

Generación 2, comenzada desde el último fotograma de la generación 1. El mismo chef, el mismo patrón de pañuelo, la misma camiseta azul marino, la misma cocina detrás de él. Tres planos de nuevo, cortes en 4.92s y 9.04s.

Bucle de dos segundos a través de la unión entre la generación uno y la generación dos
La unión en sí: el último segundo de la generación 1 en el primer segundo de la generación 2. Sin efecto de transición, solo un corte.
Paso 4: Mueve la Cámara con Reference-to-Video
El encadenamiento del último fotograma tiene una limitación inherente: siempre reanuda desde donde estaba la cámara anterior. Para saltar a un ángulo genuinamente nuevo manteniendo el mismo sujeto, cambia de endpoint.
Modelo: minimax/h3/reference-to-video. Ajustes: refers = el fotograma de anclaje del Paso 1 más el último fotograma de la generación 2, resolution 2K, duration 15, y configura ratio explícitamente a 16:9 aquí en lugar de dejarlo en adaptive. Este endpoint acepta hasta nueve imágenes de referencia, tres vídeos de referencia y tres clips de audio, con el vídeo de referencia limitado a 15 segundos en total (MarkTechPost, agosto de 2026).
text1Plano general picado desde el medio de la calle mojada mirando hacia el mismo puesto de fideos, el mismo chef dentro. SHOT 1 (0-6s): La lluvia cruza el encuadre en estrías; dos clientes silueteados se sientan en el mostrador; el chef trabaja bajo la única bombilla. SHOT 2 (6-11s): CUT TO el cartel de madera pintado a mano mientras un texto cinético blanco se anima a su lado, letra por letra: "MIDNIGHT BOWL - OPEN TILL 4AM". El texto se mantiene nítido y fijado al cartel mientras la cámara se desplaza. SHOT 3 (11-15s): CUT BACK al plano general mientras el chef levanta la vista, levanta una mano en un pequeño saludo, y la bombilla parpadea una vez. 2Audio: lluvia, ambiente callejero, un scooter pasando, el mismo tren leve, un solo golpe bajo cuando el texto se asienta. Sin diálogo. 3Mismo chef, mismo delantal y pañuelo, misma cartelería y colores de farolillos que las imágenes de referencia. Solo cortes directos, grano de película, 35 mm, tungsteno cálido contra azul frío. 4
Esa instrucción de ratio no es paranoia. Esto es lo que sucede cuando dejas el menú desplegable en este endpoint:

Playground de MiniMax H3 reference-to-video en Atlas Cloud con dos imágenes de referencia cargadas, relación de aspecto dejada en adaptive y un error 400 en el panel de salida
MiniMax H3 reference-to-video en Atlas Cloud: ambas imágenes de referencia cargadas, resolución 2K, y Relación de Aspecto todavía en su valor predeterminado adaptive. La ejecución devuelve 400: "ratio is required for t2va (text-only) and cannot be 'adaptive'; allowed: 16:9/4:3/1:1/3:4/9:16/21:9". Configúralo explícitamente y la misma solicitud funciona, que es como se hizo el clip a continuación. Observa que el blurb de la página arriba también dice "768P/1080P/2K, 5s/10s" mientras que el esquema dice 768P o 2K y de 4 a 15 segundos. Confía en el esquema.
No pude hacer que el menú desplegable de relación del playground mantuviera un cambio programado en tres intentos, por lo que la generación 3 exitosa a continuación provino de la API con ratio: "16:9" configurado en el cuerpo de la solicitud. La ejecución fallida no costó nada.

Generación 3. Nueva posición de cámara desde el otro lado de la calle mojada, el mismo chef, y el texto blanco animado en el cartel se mantiene nítido mientras la cámara se desplaza. Cortes en 5.29s y 10.96s.

Comparación lado a lado del fotograma de anclaje original y un fotograma de la generación tres, mostrando el mismo chef y cartelería 41 segundos y dos traspasos después
Izquierda: el anclaje del Paso 1. Derecha: generación 3 en la marca de 41 segundos, dos traspasos después. El mismo chef, el mismo pañuelo, la misma camiseta azul marino, el mismo cartel pintado a mano, el mismo farolillo rojo.
Paso 5: Mide la Duración Real de Vídeo de MiniMax H3, y Luego Empalma
Dos hábitos para terminar. Primero, haz un ensayo barato antes de comprar quince segundos. El mismo prompt, duration 4, y descubres si el modelo entendió tu lista de planos por aproximadamente una cuarta parte del precio.

El ensayo de 4 segundos de la misma lista de planos. Medido en 107 fotogramas, que son 4,458 segundos, exactamente lo que predice la cuadrícula. Suficiente para ver si el modelo entendió la escena antes de comprar la toma completa.
Segundo, mide cada archivo antes de cortar, porque ninguno tiene la duración que pediste:
bash1# conteo real de fotogramas y duración del contenedor, no duración x 24 2ffmpeg -i generation-1.mp4 -map 0:v:0 -c copy -f null - 2>&1 | grep -o 'frame= *[0-9]*' | tail -1 3 4# concat con corte directo, sin transiciones, sin recodificar 5printf "file 'generation-1.mp4'\nfile 'generation-2.mp4'\nfile 'generation-3.mp4'\n" > list.txt 6ffmpeg -f concat -safe 0 -i list.txt -c copy midnight-bowl-45s.mp4 7
Tres archivos de 362 fotogramas cada uno dan 1086 fotogramas, que medí en el concat final: 45,25 segundos de imagen, no 45. Pequeño, hasta que estás empalmando cuarenta de ellos.
Variaciones: Diálogo, Vertical y el Ensayo de 4 Segundos
Una vez que la cadena funciona, los mismos tres endpoints cubren la mayoría de lo que la gente realmente pide.
Diálogo en plano y contraplano. Pon ambos lados de una conversación dentro de una generación en lugar de en dos. La sincronía de labios y la base de audio son continuas dentro de un solo trabajo e independientes entre trabajos, por lo que una conversación dividida en dos generaciones te da dos tonos de ambiente no relacionados. Mantén los intercambios dentro de un solo clip.

Dos actores jóvenes en medio de una discusión en un rellano de escalera de hormigón, la luz dura de la ventana los ilumina, tomado por encima del hombro
Plano y contraplano funciona, siempre que ambos ángulos vivan dentro de la misma generación.
Vertical. En image-to-video no configuras la relación, configuras el primer fotograma. Genera un anclaje alto y adaptive lo sigue. Uno de los clips que medí volvió a 1280x2276 con el mismo conteo de 243 fotogramas que sus hermanos 16:9, por lo que la cuadrícula de fotogramas no se preocupa por tu relación de aspecto.
El ensayo de 4 segundos como práctica estándar. A $0,14 por segundo, cuatro segundos son $0,56 frente a $2,10 por una toma completa. En una construcción de nueve planos, ensayar cada generación antes de comprometerse cuesta menos que un trabajo desperdiciado de 15 segundos.
Donde el límite realmente muerde. Cualquier cosa que necesite una actuación ininterrumpida de más de quince segundos. Un monólogo continuo de 30 segundos no es un problema de encadenamiento, es un problema de sincronía de labios a través de una unión, y ninguna cantidad de disciplina de prompt lo soluciona.
Lo que Cuestan 45 Segundos de Duración de Vídeo de MiniMax H3
A $0,14 por segundo, una generación completa de 15 segundos es $2,10. Ese es el único número que necesitas; todo lo demás es multiplicación. La columna interesante es la última.
| Duración objetivo | Generaciones a 15 s | Coste lineal | Realista con una tasa de retención de 1 de cada 3 | Planos entregados | Coste por plano |
|---|---|---|---|---|---|
| 15 s | 1 | $2,10 | $6,30 | 3 | $0,70 |
| 45 s (esta construcción) | 3 | $6,30 | $18,90 | 9 | $0,70 |
| 60 s | 4 | $8,40 | $25,20 | 12 | $0,70 |
| 3 min | 12 | $25,20 | $75,60 | 36 | $0,70 |
| 10 min | 40 | $84,00 | $252,00 | 120 | $0,70 |
Lee la columna de coste por plano y el pánico sobre el límite se desvanece en su mayoría. Planificar una generación por plano te sitúa en $2,10 por plano. Meter tres planos en cada generación te sitúa en $0,70. El mismo modelo, el mismo límite de quince segundos, un tercio de la factura.
La columna de tasa de retención es la que la gente olvida. Nada usable vuelve al primer intento siempre, y un plan que asume que lo hará es un plan que se queda sin presupuesto en el minuto dos.
Para contexto sobre dónde se sitúa el límite frente a todo lo demás en el catálogo, todos estos están actualizados al 4 de agosto de 2026:
| Modelo | Máx. generación única | Notable | Tarifa indicada |
|---|---|---|---|
| minimax/h3 | 4 a 15 s | 768P o 2K, audio estéreo nativo | $0,14 / s |
| bytedance/seedance-2.0 | 4 a 15 s, o -1 para auto | 480p a 4K nativos | $0,112 / s |
| kwaivgi/kling-v3.0-pro | 3 a 15 s | Tiene un flag multi_shot explícito con prompts por plano | $0,095 / s, 15% dto. |
| alibaba/wan-2.7 | 2 a 15 s | Suelo más amplio, 720P o 1080P | $0,10 / s |
| google/veo3.1 | solo 4, 6 u 8 s | No hay opción de 15 segundos en absoluto | $0,20 / s |
| alibaba/wan-2.5/video-extend | añade 5 a 10 s | Extiende un archivo existente en lugar de generar nuevo | $0,052 / s |
Dos conclusiones. Los quince segundos de H3 están en la cima de la generación actual, no detrás de ella, y Veo 3.1 tiene un máximo de ocho. Y si lo que realmente necesitas es un archivo largo de un solo endpoint, existe un modelo de extensión dedicado, pero cambiar de modelo en medio de la cadena significa cambiar de caras.
Una Nota Honesta sobre Audio, Pesos y Duración de Vídeo de MiniMax H3
Tres advertencias, ninguna de las cuales mueve el límite.
El audio no se transfiere entre generaciones. Cada trabajo compone su propia base estéreo desde cero. Tres clips encadenados significan tres bases de lluvia no relacionadas, y escucharás el cambio incluso cuando la imagen coincida perfectamente. Dos soluciones: escribe la cláusula de ambiente de manera idéntica en cada prompt para que las bases se acerquen, o silencia el montaje empalmado y coloca una pista continua debajo. Para el diálogo, mantén el intercambio dentro de una sola generación.

Varios fragmentos de forma de onda de audio cortos separados con espacios visibles entre ellos a la izquierda, una forma de onda continua única a la derecha, sobre un fondo pálido unificado
Izquierda: lo que realmente te da el encadenamiento. Derecha: lo que tienes que construir debajo.
El autoalojamiento no desbloquea clips más largos. Los pesos abiertos se publicaron el 2 de agosto de 2026 (Hugging Face, agosto de 2026), y ejecutarlos localmente te da un borde corto de 768 píxeles redondeado a múltiplos de 32, según las notas de configuración de ComfyUI. La cuadrícula de 17 fotogramas y el techo de 15 segundos son los mismos. La licencia comunitaria tampoco cubre actualmente la UE, el Reino Unido, Corea o los EE. UU., por lo que la API es la ruta práctica para la mayoría de los equipos.
El modelo puede reescribirte silenciosamente. Me ha pasado que H3 devuelve completed en un trabajo donde eliminó silenciosamente un elemento que le pedí. Extrae fotogramas de cada clip y míralos antes de empalmar. En una cadena de nueve planos, un clip no vigilado es una unión desperdiciada.
Preguntas Frecuentes
¿Cuál es la duración máxima de vídeo de MiniMax H3?
Quince segundos. El parámetro duration es un conjunto de números enteros del 4 al 15 con un valor predeterminado de 8, por lo que 16 se rechaza y 7,5 no es un valor válido. Cada clip es de 24 FPS hasta 2K nativos con audio estéreo generado junto con la imagen.
¿Puede MiniMax H3 generar vídeos de más de 15 segundos?
No en una sola generación, y la API no tiene un parámetro de extensión. Superas los 15 segundos encadenando: extrae el último fotograma de un clip como el primer fotograma del siguiente, usa reference-to-video cuando necesites un nuevo ángulo de cámara, luego concatenar con cortes directos. Algunas interfaces de usuario de consumo añaden su propia función de extensión sobre H3 para alcanzar aproximadamente 30 segundos, pero eso es el producto haciendo el empalme, no el modelo generando más tiempo.
¿Por qué mi clip de MiniMax H3 de 15 segundos en realidad dura 15,08 segundos?
Porque las duraciones se ajustan a una cuadrícula de 17 fotogramas. Solicitar 15 segundos devuelve 362 fotogramas, que es 17x21+5, y a 24 FPS eso es 15,083 segundos. Solicitar 10 devuelve 243 fotogramas, o 10,125 segundos. Solo duration: 8 cae en un segundo exacto, con exactamente 192 fotogramas. Si tu edición tiene precisión de fotograma, mide cada archivo en lugar de calcular duración x 24.
¿Puedo poner varios planos dentro de una generación de MiniMax H3?
Sí, y es el mayor ahorro disponible. Escribe planos con códigos de tiempo explícitos en el prompt con las palabras literales CUT TO, y añade una cláusula de continuidad que nombre lo que debe sobrevivir a los cortes. Medí diez cortes limpios dentro de una generación real de 15 segundos. Tres planos por generación es cómodo y fiable, lo que convierte un clip de $2,10 en tres planos de $0,70.
¿Una duración de vídeo de MiniMax H3 más corta cuesta menos?
Sí, linealmente. La facturación es por segundo a $0,14, por lo que un ensayo de 4 segundos cuesta $0,56 frente a $2,10 por una toma completa de 15 segundos. La resolución es otra historia: 768P y 2K están bajo una única tarifa en el catálogo, por lo que bajar la resolución no ahorra nada. Acorta el clip, no los píxeles.
¿Cuántos clips de MiniMax H3 necesito para un vídeo de un minuto?
Cuatro, si llenas los quince segundos cada vez. Pero cuenta en planos: cuatro generaciones a tres planos cada una te dan doce planos de cobertura, que es una cantidad normal para un comercial de un minuto. Luego multiplica tu presupuesto por aproximadamente tres para tener en cuenta las tomas que descartas.






