Seedance 2.5 ya está disponible — Primero en Atlas Cloud

Hice un videoclip con MiniMax H3 a partir de un estribillo de 32 segundos por 4,80 $. La pista de audio me sorprendió.

Introduje un estribillo de 32 segundos en MiniMax H3 como audio de referencia gratuito, recibí cuatro planos sincronizados al ritmo y monté un videoclip real con MiniMax H3 por 4,80 $. Incluye prompts y facturas.

Un editor de vídeo trabajando en una consola con varios monitores de vídeo

Una sala de etalonaje a altas horas de la noche, seis monitores mostrando seis planos distintos de la misma cantante de pelo plateado_Seis_ planos, una artista, una canción. Generado con openai/gpt-image-2/text-to-image .

Los usuarios de Suno generan unos 7 millones de canciones al día, aproximadamente un catálogo completo de Spotify cada dos semanas (TechCrunch, febrero de 2026). Casi ninguna de ellas tendrá nunca una imagen asociada. No porque la imagen sea imposible, sino porque la ruta tradicional pasa por cuatro herramientas: generar imágenes fijas, animarlas, ejecutar una pasada aparte de lip sync y luego arreglarlo todo en edición. En cada salto se pierde la cara, el vestuario o el ritmo.

Así que me salté los saltos. Solté un fragmento de 8 segundos de un estribillo directamente en la ranura de referencia de un modelo de vídeo y pulsé Run. No me cobró nada por el audio.

Luego desmonté el mp4 terminado para responder a la única pregunta que nadie en internet responde de forma directa: ¿el sonido que sale del modelo es mi canción, o algo que se ha inventado y que simplemente suena parecido? Lo medí. La respuesta no es la que esperaba, y cambia cómo deberías montar la pieza.

Conclusiones clave

  • El audio de referencia es gratis. MiniMax H3 factura solo los segundos de salida. Mis cuatro fragmentos de referencia de 8 segundos añadieron 0,00 $ a la factura. La referencia de vídeo es la cara.
  • 15 segundos es un techo por generación, no por proyecto. Corta la canción, graba un fragmento por plano y concatena. Mi montaje de 32 segundos son cuatro generaciones.
  • Escribe el estribillo a 120 BPM. Un compás dura exactamente 2,000 segundos, así que los valores de duration en segundos enteros de H3 caen en líneas de compás sin ajustes manuales. 8 s = 4 compases.
  • El audio de salida es tu pista, alineada a nivel de muestra. Medí una correlación de forma de onda de 0,892 con desfase cero entre mi fragmento de entrada y la mezcla estéreo entregada por H3. No está regenerada. Aun así, conviene volver a colocar el máster en el corte final, por otra razón (abajo).
  • Gasto real total: 7,53 $ en nueve generaciones, incluidos los fallos. Los cuatro planos que entraron en el corte final, más la canción y el fotograma base, salieron por 4,80 $.

El videoclip con MiniMax H3 que monté a partir de un estribillo de 32 segundos

Activa el sonido. Son cuatro generaciones separadas, concatenadas sin transiciones, con el máster original de 32 segundos colocado encima.

"MIRA", 32 segundos, 2560x1440, 24 fps. Cuatro generaciones de minimax/h3/reference-to-video de 8 segundos cada una, 1,12 $ por plano. La canción entró como audio de referencia y costó 0,00 $.

Cuatro generaciones, cuatro mundos de iluminación completamente distintos, una cara. No se retocó nada entre ellas.

Cuatro vistas de una mujer de pelo plateado llevando un collar rojo luminoso

Cuatro fotogramas de los cuatro planos que muestran a la misma cantante en una azotea de neón, una carretera desértica, un estudio blanco y un tanque de agua negra_Un_ fotograma extraído de cada clip entregado. El mismo pelo, el mismo top de malla, la misma gargantilla LED roja bajo la lluvia, el sol bajo, la luz plana high-key y el entorno submarino.


Por qué la mayoría de intentos de videoclip con MiniMax H3 se desmoronan en el segundo dieciséis

Tres modos de fallo, todos evitables.

Uno: tratar los 15 segundos como el límite del proyecto. H3 limita una sola generación a 15 segundos. La gente lee eso, concluye "no hay videoclips" y abandona. Pero un videoclip nunca fue un solo plano. Uno real corta cada 4 a 8 segundos de todos modos. El límite solo te obliga a hacer lo que un editor habría hecho igualmente.

Dos: describir el ritmo con palabras. "Animado, enérgico, bailando al ritmo" no le da al modelo nada a lo que engancharse. Se inventa un tempo, y tus puntos de corte quedan medio tiempo desfasados para siempre. Darle el audio real elimina la adivinanza.

Tres: dejar que el vestuario derive. Cada plano necesita la misma imagen de referencia y la misma formulación del vestuario, literalmente. Cambia "black mesh top" por "dark mesh shirt" entre planos y obtendrás otra persona.

Esto es lo que realmente te cuestan las dos rutas:

Cadena tradicional de cuatro herramientasUna sola llamada de referencia H3
Herramientas por planoModelo de imagen, modelo de vídeo, herramienta de lip sync, NLEUn endpoint, luego un NLE al final
Pasos manuales por plano4 traspasos, 3 exportaciones de archivos1 envío
Qué mantiene al personajeRe-prompting manual y suerteUna imagen de referencia reutilizada literalmente
Imagen y sonidoRenderizados por separado, alineados despuésGenerados en la misma pasada, estéreo a 32 kHz
Coste por plano de 8 segundosCuatro contadores separados1,12 $ a 2K, 0,80 $ a 768P

Para ser justos con la ruta antigua: no es una fantasía. El creador japonés Arata Fukoe ganó un bronce en Project Odyssey con un videoclip completamente de IA, y tanto Queen como Linkin Park han publicado vídeos oficiales asistidos por IA. Esas cadenas simplemente pasaban por cuatro o cinco herramientas, que es exactamente lo que un artista independiente con una sola canción no tiene tiempo de gestionar.

Qué aporta realmente el audio de referencia a un videoclip con MiniMax H3

Esta es la parte que merece la pena entender antes de gastar nada.

H3 genera imagen y sonido en una sola pasada, en lugar de doblar audio sobre fotogramas ya terminados. Cuando le das una pista de referencia, la pista no es una nota de ambiente. Comparé mi fragmento de entrada con el flujo de audio dentro del mp4 entregado, a nivel de forma de onda, en una mezcla mono reducida a 8 kHz:

  • Correlación de envolvente: 0,956 con desfase cero
  • Correlación de forma de onda bruta en una ventana de 2 segundos: 0,892 con desplazamiento de muestra cero

Eso no es un modelo reproduciendo una canción similar. Es tu archivo, alineado a nivel de muestra, con la ambientación que pedía el prompt colocada encima y una ronda de recodificación AAC. En comparación, la misma medición contra una toma de control generada sin audio de referencia dio 0,26, que es el suelo de ruido.

Dos formas de onda de audio casi idénticas que muestran la entrada azul y la salida roja

Forma de onda del fragmento de entrada arriba, el audio entregado por H3 abajo, alineados con desplazamiento cero_Arriba: el mp3 de 8 segundos que subí. Abajo: el flujo de audio dentro del mp4 que devolvió H3. Los mismos picos, las mismas posiciones, sin desplazamiento._

Los límites de entrada son estrictos y se aplican en el momento del envío, no de forma silenciosa:

Entrada de referenciaLímiteFacturado
Imágeneshasta 9gratis en los endpoints H3 de Atlas Cloud
Vídeoshasta 3, de 2-15 s cada unofacturado a la tarifa de salida
Audiohasta 3, de 2-15 s cada uno, 15 s en total entre todos los clips0,00 $
Solo audiorechazado, necesita al menos una imagen o vídeon/a

Probé a propósito el techo de audio total enviando tres fragmentos de 8 segundos en una llamada. Falló en 5,8 segundos con invalid params, total audio duration 24138 ms exceeds 15000 ms y no se facturó. Buena noticia: H3 no descarta en silencio el archivo extra y te cobra de todas formas.

Otra trampa con la que me topé antes de eso. Si pasas audio como una URL de datos en base64, el tipo MIME decide la extensión que infiere la API. data:audio/mpeg se rechaza con audio format ".mpeg" not allowed. data:audio/mp3 pasa sin problemas. Cuatro envíos murieron por eso antes de que me diera cuenta, todos gratis.


El flujo de trabajo del videoclip con MiniMax H3, y cuánto cuesta cada segundo

Todo lo siguiente funciona con una sola clave de API en Atlas Cloud, que es donde ejecuté y facturé todo. Tres modelos, una pestaña del navegador.

PasoModeloQué hacePrecio que realmente me facturaron
Escribir el estribillominimax/music-2.6Canción completa a partir de un prompt de estilo y letra, mp3 de hasta ~5 min0,15 $ por canción, tarifa plana
Fijar la artistaopenai/gpt-image-2/text-to-imageUn fotograma base que hereda cada plano0,1745 $ en calidad high, 2048x1152
Rodar cada planominimax/h3/reference-to-videoImagen más audio de entrada, clip sincronizado al ritmo con sonido estéreo de salida0,14 $/s a 2K, 0,10 $/s a 768P. Entrada de audio 0,00 $

Dos notas sobre esa tabla, porque las cifras listadas engañan en ambos sentidos. GPT Image 2 muestra un suelo de 0,009 $ en el catálogo; ese es el nivel inferior de tokens, y un render real high a 2048x1152 factura 0,1745 $. La entrada de catálogo de H3 muestra 0,10 $, que es solo el nivel 768P; mis trabajos de 8 segundos en 2K facturaron exactamente 1,12 $ cada uno, es decir, 0,14 $ por segundo.

Si quieres fijar el primer fotograma en lugar de usar referencias de sujeto, [minimax/h3/image-to-video](https://www.atlascloud.ai/models/minimax/h3/image-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) usa las mismas tarifas, y [minimax/h3/text-to-video](https://www.atlascloud.ai/models/minimax/h3/text-to-video?utm%5Fsource=blog&utm%5Fmedium=article&utm%5Fcampaign=minimax-h3-music-video) cubre los planos generados solo con prompt.

La corrección importante: una versión anterior de este plan asumía que tenías que traer tu propia canción porque no había un generador de canciones completas en la plataforma. Ahora sí lo hay. minimax/music-2.6 escribe la pista, así que toda la cadena, canción incluida, se ejecuta en un solo sitio.


Cómo hacer un videoclip con MiniMax H3, paso a paso

Paso 1: escribe un estribillo a 120 BPM y córtalo en fragmentos por plano

Pide 120 BPM explícitamente. A 120 BPM un compás dura exactamente 2,000 segundos, así que el enum duration en segundos enteros de H3 cae gratis en líneas de compás: 4 s = 2 compases, 6 s = 3 compases, 8 s = 4 compases, 10 s = 5 compases. Tus cortes caen en el tiempo fuerte sin tocar ni un solo marcador.

Modelo: minimax/music-2.6. Ajustes: format: mp3, sample_rate: 44100, bitrate: 256000, is_instrumental: false.

Prompt de estilo:

Plain
1Synth-pop at exactly 120 BPM, straight four-on-the-floor kick, bright analog
2sidechained pads, clean female lead vocal sitting forward in the mix, wide
3stereo chorus, no rap, sustained open vowels, cinematic and slightly
4melancholy, radio-ready master

Letra:

Plain
1[Chorus]
2Hold the line, hold the light
3I am running out of night
4Say my name into the rain
5And I will burn again

Devolvió una pista de 70 segundos en 75 segundos por 0,15 $. Luego comprobé el tempo en lugar de confiar a ciegas, ejecutando una autocorrelación de novedad de ataques sobre el archivo. El desfase más fuerte volvió exactamente a 0,500 s, que son 120 BPM, y la cuadrícula de beat empieza a 0,24 s del archivo decodificado, no en cero. Ese desplazamiento importa: corta desde 0,24 y cada fragmento empezará en un tiempo fuerte.

Bash
1# 32-second master, starting on the downbeat at 0.24s
2ffmpeg -ss 16.24 -t 32 -i hook-master-raw.mp3 -c:a libmp3lame -b:a 256k hook-master.mp3
3
4# four 8-second slices, one per shot, each 4 bars and well under the 15s cap
5for i in 0 8 16 24; do
6  ffmpeg -ss $i -t 8 -i hook-master.mp3 -c:a libmp3lame -b:a 192k slice-$i.mp3
7done

Si ya tienes tu propia pista, salta este paso por completo. Es el caso normal, y el más barato.

Paso 2: fija la artista con un fotograma base de GPT Image 2

Cada plano referencia este único archivo. Lo que esté mal aquí estará mal cuatro veces, así que gasta los 0,17 $ y míralo bien.

Modelo: openai/gpt-image-2/text-to-image. Ajustes: quality high , size 2048x1152 (16:9).

Plain
1Cinematic music-video still, waist-up portrait. A 25-year-old East Asian female
2synth-pop singer with silver-white cropped hair and a straight-cut fringe, a matte
3black mesh top, a thin red LED choker glowing against her collarbone, and a single
4silver ear cuff. She stands on a rain-soaked rooftop at night holding a vintage
5chrome handheld microphone close to her mouth. Behind her, out-of-focus magenta
6and cyan neon signage, fine rain caught in a hard backlight, steam drifting from a
7vent. Shot on 35mm anamorphic, shallow depth of field, teal-and-magenta grade,
8visible film grain. Her face is sharp and evenly lit by a soft key from camera
9left. No text anywhere in the frame.

Mujer de pelo plateado sosteniendo un micrófono vintage en una ciudad de neón lluviosa

El fotograma base generado: cantante de pelo plateado con un micrófono cromado en una azotea de neón empapada por la lluvia_El_ fotograma base que heredan todos los planos posteriores. Generado con openai/gpt-image-2/text-to-image , calidad high, 2048x1152, facturado a 0,1745 $.

Interfaz de generador de imágenes de IA que muestra los ajustes de entrada y el resultado generado

GPT Image 2 ejecutando este prompt exacto en el playground de Atlas Cloud con el fotograma terminado en el panel de salida

El mismo prompt en el playground: Size 16:9 a 2048x1152, Quality high, y el botón Run indicando 0,1745 $, que es lo que la API me facturó realmente. Los 0,009 $ del catálogo son el nivel inferior de tokens, no este. Mismo prompt, distinta seed, así que este render no es el archivo exacto de arriba.

Las palabras de vestuario en ese prompt (silver-white cropped hair, matte black mesh top, red LED choker, silver ear cuff) se reutilizan literalmente en todos los prompts de abajo. Esa repetición es todo el mecanismo de consistencia. No lo parafrasees.

Paso 3: ejecuta el primer plano del videoclip con MiniMax H3 usando audio de referencia gratuito

Modelo: minimax/h3/reference-to-video. Ajustes: refers = el fotograma base más slice-0.mp3, resolution: 2K, duration: 8, ratio: 16:9.

Fija ratio explícitamente. El valor por defecto del playground es adaptive, y el endpoint va mucho más cómodo cuando le dices la forma que quieres.

Plain
1Music video shot. The woman in the reference image sings the reference track
2straight down the lens on the wet neon rooftop, holding the chrome microphone at
3her mouth. She lands the first line hard on the downbeat, eyes locked to camera,
4then tilts her head back on the sustained note. Slow push-in from waist-up to a
5tight close-up across the eight seconds, handheld micro-drift, rain streaks
6crossing the hard backlight. Her mouth shapes follow the sung vowels of the
7reference audio exactly, she is singing, not speaking. Identical silver-white
8cropped hair, matte black mesh top and glowing red LED choker as the reference
9image. Soundscape: the reference track in stereo, plus faint rain and a distant
10city hum low in the mix.

Plano 1, activa el sonido. 2560x1440, exactamente 8,00 s, 24 fps, estéreo a 32 kHz. 345 segundos desde el envío hasta el archivo, facturado a 1,12 $. Fíjate en cómo inclina la cabeza hacia atrás en la nota sostenida alrededor del segundo 5.

Interfaz de generador de vídeo de IA que muestra los ajustes de entrada y el vídeo generado

El playground de reference-to-video con el fotograma base y el fragmento de audio cargados y el clip terminado en el panel de salida

Reference Materials muestra 2/9: slice-0.mp3 en una ranura, el fotograma base en la otra. Resolution 2K, Duration 8, y el botón Run indicando 1,12 $, que es exactamente 8 x 0,14 $. Observa que el desplegable Aspect Ratio está en adaptive , que es el valor por defecto de la página; mis llamadas a la API fijan ratio en 16:9 explícitamente.

Un dato que merece la pena apuntar: duration: 8 entregó un contenedor de exactamente 8,00 segundos. duration: 4 entregó 4,46 segundos. Si piensas concatenar en líneas de compás, quédate con las duraciones que vuelven exactas.

Paso 4: rueda tres mundos más sin perder la cara

Mismo fotograma base, misma frase de vestuario, siguiente fragmento de audio. Todo lo demás cambia.

4a. Carretera desértica en hora dorada. refers = fotograma base + slice-8.mp3, 2K, duration: 8, ratio: 16:9.

Plain
1Music video shot. The same woman from the reference image stands on the centre
2line of an empty desert highway at golden hour, no microphone, an open indigo
3denim jacket over the same matte black mesh top, the red LED choker still lit. She
4mouths the chorus of the reference track into the wind while the camera tracks
5backwards low over the asphalt. Heat shimmer off the road, dust lifting, her
6shadow stretching long toward the lens, an anamorphic flare crossing at the
7halfway point. Hair, face and wardrobe identical to the reference image.
8Soundscape: the reference track over open desert wind, wide and airy.

Plano 2, activa el sonido. La misma cara, temperatura de color opuesta, y la pista de referencia remezclada bajo viento abierto. 332 s, 1,12 $.

4b. Ciclorama blanco infinito. refers = fotograma base + slice-16.mp3, 2K, duration: 8, ratio: 16:9.

Plain
1Music video shot. The same woman from the reference image in a pure white
2infinity-cove studio under flat high-key light with no shadows, wearing a glossy
3red vinyl trench coat over the same matte black mesh top, red LED choker visible
4at the collar. She dances four bars to the reference track, silver-white hair
5whipping on each turn. Locked-off wide frame, then a hard snap-zoom to a medium on
6the second downbeat. Small white paper squares fall like confetti through the
7final two seconds. Face and hair identical to the reference image. Soundscape: the
8reference track, dry and close, plus the squeak of shoes on the studio floor.

Plano 3, activa el sonido. La luz plana sin sombras es el lugar más difícil para ocultar un cambio de cara, y aguantó . 8,00 s, 1,12 $.

4c. B-roll submarino, sin lip sync. refers = fotograma base + slice-24.mp3, 2K, duration: 8, ratio: 16:9.

Plain
1Music video shot. The same woman from the reference image suspended underwater in
2a black tank, silver-white hair floating out around her, the red LED choker
3glowing through the water, the black mesh top billowing slowly. One hard beam of
4light from directly above; bubbles rise past the lens in slow motion. She opens
5her eyes on the downbeat and reaches one hand toward the surface. She does not
6sing and her mouth stays closed. The camera rotates thirty degrees around her
7across the shot. Face identical to the reference image. Soundscape: the reference
8track heard from above the surface, muffled and low-passed, with bubble
9transients.

Plano 4, activa el sonido. Se obedeció la instrucción "she does not sing and her mouth stays closed", que es lo útil: el audio de referencia impulsa el timing, no una interpretación obligatoria. 329 s, 1,12 $.

Paso 5: ejecuta la toma de control, con la ranura de audio vacía

El mismo prompt que en el Paso 3, palabra por palabra. El único cambio: refers contiene la imagen y nada más. 768P, duration: 8.

Este clip explica todo el mecanismo mejor que cualquier párrafo. Escúchalo frente al Paso 3.

La toma de control. Prompt idéntico, sin audio de referencia, 1344x768, 8,00 s, 200 s, 0,80 $. H3 escribió su propia banda sonora, y la interpretación es un genérico "alguien está cantando" en lugar de estas palabras.

Medido contra mi máster, el audio de la toma de control obtiene 0,26 de correlación de envolvente. El del Paso 3 obtiene 0,956. Esa diferencia es lo que te aporta la ranura de audio gratuita.

Paso 6: rompe el lip sync a propósito

Todo modelo tiene un techo de sílabas. Encontrar el tuyo cuesta 0,40 $.

Generé una pista de rap aparte a doble tempo (minimax/music-2.6 otra vez, 0,15 $), corté un fragmento de 4 segundos con unas seis sílabas por segundo y lo metí en la misma configuración de azotea a 768P, duration: 4.

Plain
1Music video shot. The woman in the reference image raps the reference track
2straight down the lens on the wet neon rooftop, holding the chrome microphone at
3her mouth, delivering every syllable of the fast double-time verse. Locked-off
4medium close-up, slight handheld drift, rain streaks in the hard backlight. Her
5mouth shapes follow the rapped syllables of the reference audio exactly. Identical
6silver-white cropped hair, matte black mesh top and glowing red LED choker as the
7reference image. Soundscape: the reference track in stereo plus faint rain.

La prueba de estrés, activa el sonido. 1344x768, 4,46 s, 192 s, 0,40 $. La boca se mantiene ocupada y en el ritmo, pero deja de resolver consonantes individuales y se instala en un ciclo repetido de abrir-cerrar. Las líneas cantadas consiguen formas vocálicas diferenciadas; esto no.

Mi lectura honesta de los archivos entregados: las vocales cantadas sostenidas son donde el trabajo de boca de H3 resulta realmente convincente, y las consonantes rapeadas densas son donde se degrada a movimiento plausible. Planifica los primeros planos para las líneas cantadas y pon las barras rápidas en b-roll. Hay más detalle sobre la diferencia entre habla y canto en el desglose de lip sync y audio.

Paso 7: une, silencia y vuelve a colocar el máster encima de tu videoclip con MiniMax H3

Cuatro clips de exactamente 8,00 segundos concatenan exactamente a 32,00 segundos, que son 16 compases a 120 BPM. Sin recortes.

Bash
1# 1. strip each clip's audio
2for f in 01-rooftop 02-highway 03-cyc 04-underwater; do
3  ffmpeg -i $f.mp4 -an -c:v copy $f-mute.mp4
4done
5
6# 2. concatenate in bar order (4 x 8s = 32s = 16 bars @ 120 BPM)
7printf "file '01-rooftop-mute.mp4'\nfile '02-highway-mute.mp4'\nfile '03-cyc-mute.mp4'\nfile '04-underwater-mute.mp4'\n" > shots.txt
8ffmpeg -f concat -safe 0 -i shots.txt -c copy mv-silent.mp4
9
10# 3. lay the original master back
11ffmpeg -i mv-silent.mp4 -i hook-master.wav -c:v copy -c:a aac -b:a 320k -shortest minimax-h3-music-video.mp4

¿Por qué molestarse en silenciar, si el modelo ya te devuelve tu pista? Porque la mezcla estéreo de cada clip lleva la ambientación que pidió el prompt de ese clip: lluvia en el plano 1, viento del desierto en el plano 2, un filtro low-pass submarino en el plano 4. Precioso por plano, incoherente al cortar. El máster te da una mezcla continua a bitrate completo, sin recodificación por plano. H3 entrega la sincronía de la interpretación. Tu máster entrega la canción.


Cuatro variaciones de la receta de videoclip con MiniMax H3

Cortes verticales para publicación. Fija ratio: 9:16 y obtienes un Spotify Canvas o un fragmento para Shorts a partir del mismo fotograma base y los mismos cortes. Volvió como un 768x1344 real, así que, a diferencia del desplegable de aspecto en el playground, el valor ratio de la API sí se mantiene. Los bucles de Canvas son silenciosos por diseño, así que este se publica como GIF.

Mujer de pelo plateado sosteniendo un micrófono en una azotea urbana lluviosa

Un bucle vertical 9:16 de la misma artista en la azotea de neón_Mismo fotograma base, mismo fragmento de referencia,_ ratio: 9:16 a 768P por 0,80 $. Un matiz honesto: pedí "not singing" y aun así obtuve canto. Con una voz en la ranura de referencia, el audio gana la discusión. Si quieres una intérprete silenciosa, introduce un fragmento instrumental.

Vídeo de referencia en lugar de imagen de referencia. Puedes darle a H3 hasta tres clips de vídeo de referencia para trasladar movimiento y encuadre en vez de describirlos. Vigila el contador: el vídeo de referencia se factura a la tarifa de salida, mientras que el audio de referencia es gratis. Esa asimetría es el dato de precios más útil de este endpoint.

Visualizadores de b-roll puros. Elimina por completo a la intérprete. Introduce una foto de producto, un objeto de portada de álbum o una placa de textura más el fragmento de audio, y pide solo movimiento de cámara. Sin cara que mantener, sin lip sync que romper, y puedes rodarlo todo a 768P.

Borrador barato, final caro. 768P cuesta 0,10 $/s frente a los 0,14 $/s de 2K, y ambos vuelven con estéreo idéntico a 32 kHz, así que la interpretación que estás evaluando es la misma. El ahorro no está en las tomas válidas, sino en los descartes: cada toma fallida de 8 segundos cuesta 0,80 $ en vez de 1,12 $. Rueda a 768P hasta que la toma esté bien, y luego paga los 1,12 $ una vez. En un plano que requiere tres intentos, eso son 2,72 $ en lugar de 3,36 $. Más sobre la diferencia de niveles en la comparativa 768P frente a 2K, y sobre hasta dónde puede estirarse un solo clip en la guía de duración de clips.


Cuánto costó realmente un videoclip completo con MiniMax H3

Cada línea de abajo es una cifra facturada real extraída del registro de predicción tras la finalización, no un precio de lista.

ConceptoModelo y ajustesFacturado
Estribillo, canción de 70 sminimax/music-2.6, mp3 44.1 kHz0,15 $
Fotograma base de la artistaopenai/gpt-image-2/text-to-image, high, 2048x11520,17 $
Plano 1, azotea de neónminimax/h3/reference-to-video, 2K, 8 s1,12 $
Plano 2, carretera desérticaigual, 2K, 8 s1,12 $
Plano 3, ciclorama blancoigual, 2K, 8 s1,12 $
Plano 4, submarinoigual, 2K, 8 s1,12 $
Subtotal del vídeo terminado4,80 $
Prueba de validación768P, 4 s0,40 $
Toma de control, sin audio768P, 8 s0,80 $
Pista de rap para la prueba de estrésminimax/music-2.60,15 $
Prueba de estrés de lip sync768P, 4 s0,40 $
Corte vertical Canvas768P, 8 s, 9:160,80 $
Imagen principal de este artículoopenai/gpt-image-2/text-to-image, high0,17 $
Prueba por encima del límite, 24 s de audiorechazado al enviar0,00 $
Cuatro envíos con el MIME de audio incorrectorechazados al enviar0,00 $
Audio de referencia, 4 x 8 sentrada gratuita0,00 $
Gasto total7,53 $

Eso son 9,00 $ por minuto terminado a 2K en los planos que entraron en el corte, antes de cualquiera de mis errores. Rodado íntegramente a 768P, el mismo minuto queda en 6,61 $. Un equipo humano de videoclip no te presupuesta ninguna de esas cifras.

Dos notas operativas si estás presupuestando una pieza más larga. Los rechazos en el momento del envío son gratuitos, así que los parámetros malos te cuestan tiempo y nada más. Y el campo price de una predicción se rellena con retraso, así que vuelve a consultar el ID de la solicitud después de que se descargue el archivo si quieres una factura real en lugar de un null.


De quién es la canción, de quién es la cara: qué comprobar antes de publicar

Breve, porque importa y no necesita sermón.

Necesitas los derechos de la pista de referencia. Entrada gratuita no significa autorización gratuita. Introducir un single comercial publicado como audio de referencia y luego publicar lo que salga es el camino rápido a una retirada. Tu propia grabación, una pista encargada por ti o algo que hayas generado está bien.

No construyas el fotograma base a partir de la cara de un artista real vivo. El mecanismo de consistencia aquí es muy bueno manteniendo una cara entre planos, que es exactamente por lo que apuntarlo a una persona real es mala idea.

Los pesos abiertos y el acceso por API son dos licencias distintas. MiniMax publicó los pesos de H3 en Hugging Face en agosto de 2026, y su licencia comunitaria excluye actualmente la UE, Reino Unido, Corea del Sur y EE. UU., con un canal de licencia formal abierto para esos territorios. Esa restricción se aplica a ejecutar los pesos por tu cuenta. Llamar al modelo mediante una API alojada es una relación de servicio y no te coloca bajo la licencia de los pesos. Conviene saber en qué situación estás antes de asumir una cosa u otra.

Para una visión más amplia de dónde se sitúa H3 frente a las alternativas, hay una comparativa con Seedance 2.5 y una guía de estructura de prompts. Para contexto sobre por qué merece la pena el esfuerzo: en la clasificación de edición de vídeo que puntúa modelos con audio, H3 está actualmente primero con 1.126 Elo, por delante de Gemini Omni Flash con 1.119 y Dreamina Seedance 2.0 con 1.027 (Artificial Analysis, consultado el 10 de agosto de 2026). Esas puntuaciones cambian con los votos, así que trátalas como una instantánea.


Videoclip con MiniMax H3: preguntas frecuentes

¿Puede un videoclip con MiniMax H3 durar tres minutos completos?

No en una sola generación. Una llamada individual tiene un límite de 15 segundos. Pero ese es un techo por generación, no por proyecto. Un vídeo de tres minutos a 8 segundos por plano son 23 generaciones, unos 25,76 $ a 2K, y cada una cae en una línea de compás si tu pista está a 120 BPM. Corta, rueda, concatena y vuelve a colocar el máster.

¿Un videoclip con MiniMax H3 usa mi canción real, o el modelo regenera el audio?

Usa tu canción real. Medí una correlación de forma de onda bruta de 0,892 con desplazamiento de muestra cero entre el mp3 de 8 segundos que subí y el flujo de audio dentro del mp4 devuelto, con la ambientación solicitada por el prompt colocada encima. Una toma de control generada sin audio de referencia puntuó 0,26 contra el mismo máster. Aun así deberías volver a colocar tu máster sobre la concatenación final, porque cada clip lleva su propia ambientación por plano y su propia codificación AAC, que no sobreviven limpiamente a un corte.

¿Meter una canción en un videoclip con MiniMax H3 cuesta extra?

No. Mis cuatro fragmentos de referencia de 8 segundos añadieron 0,00 $ a una factura de planos de 4,48 $. El vídeo de referencia es lo que hay que vigilar, porque se factura a la tarifa de salida. Los límites son tres clips de audio, de 2 a 15 segundos cada uno, 15 segundos en total, y el audio nunca puede ser la única referencia.

¿Qué tal es el lip sync de MiniMax H3 cantando en comparación con el habla?

Las vocales cantadas sostenidas son su punto fuerte: formas de boca diferenciadas, sostenidos que encajan con la nota, y la inclinación de cabeza en una nota larga se lee como interpretación más que como bucle. La entrega densa es donde se rinde. Mi prueba de rap a seis sílabas por segundo mantuvo el ritmo, pero dejó de resolver consonantes y cayó en un ciclo repetido de abrir-cerrar. Pon las barras rápidas en b-roll.

¿Cómo mantengo la misma cara en todos los planos de un videoclip con MiniMax H3?

Tres cosas, todas aburridas. Una imagen de referencia reutilizada en cada llamada, nunca regenerada. La misma formulación del vestuario copiada literalmente entre prompts, no parafraseada. Y una cláusula explícita de "identical to the reference image" en cada prompt. Mis cuatro planos pasaron por lluvia, sol bajo, luz plana high-key y entorno submarino sin deriva.

¿Cuánto cuesta un videoclip con MiniMax H3 por minuto terminado?

9,00 $ por minuto terminado a 2K, según mi factura real de 4,80 $ por un corte de 32 segundos. Rodado íntegramente a 768P, el mismo minuto cuesta 6,61 $, y 768P entrega el mismo estéreo a 32 kHz, así que la interpretación que estás evaluando es idéntica. Rueda tus descartes a 0,80 $ y paga los 1,12 $ solo por la toma que sobreviva al montaje.

Modelos recientes

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos