
El marco de radio de turno nocturno del que parte cada toma en este artículo, generado con openai/gpt-image-2/text-to-image en calidad alta, 2048x1152
Este único fotograma es la entrada para todo el tutorial a continuación. Generado con openai/gpt-image-2/text-to-image, calidad alta, 2048x1152.
Piensa en la última vez que terminaste un plano de 8 segundos y salió en silencio.
Exportaste el clip. Abriste una pestaña de TTS y escribiste la línea. Buscaste en una biblioteca de sonidos lluvia y ambiente de sala. Arrastraste todo a una línea de tiempo y empujaste la forma de onda a izquierda y derecha hasta que la boca dejó de mentir. Luego pagaste un modelo de sincronía labial separado para arreglar la boca de todas formas. Cuatro herramientas, tres archivos wav, una hora, y la interpretación seguía sonando doblada, porque lo estaba.
Esa cadena es lo que MiniMax H3 eliminó silenciosamente. No porque "tenga audio" (muchos modelos lo afirman), sino por un solo campo en el cuerpo de la solicitud que casi nadie prueba: puedes pasarle un fragmento de audio que ya posees, gratis, y recuperar la voz en un rostro.
A continuación está la prueba de dos tomas que aísla ese campo, los precios reales de cada paso que reemplaza, los límites estrictos que rechazarán tu solicitud y la factura real.
Conclusiones clave
- Una sola llamada devuelve imagen, diálogo, ambiente de sala y movimiento de labios juntos. El texto, lo visual y el audio se codifican por separado, luego un único Omni Transformer predice conjuntamente los latentes de video y audio (Hugging Face model card, agosto de 2026).
- El audio de entrada es gratuito. El video de entrada no: MiniMax factura el video de referencia a la tarifa de salida, por lo que los mismos 15 segundos de material cuestan $0 como canción y alrededor de $1.95 como clip de video.
- Límites estrictos: máximo 3 clips de audio, cada uno de 2 a 15 segundos, 15 segundos en total, y el audio nunca puede viajar solo. Debe ir acompañado de al menos una imagen o video.
- A $0.14 por segundo para 2K en Atlas Cloud, un plano completo de 10 segundos con sonido cuesta $1.40, que es menos que pagar un modelo de sincronía labial dedicado $0.22 por segundo para parchear un clip que ya renderizaste.
Sonido encendido: dos tomas de MiniMax H3 lip sync and audio, una diferencia de seis segundos
Auriculares puestos para esta. Ambas mitades recibieron el mismo fotograma base, las mismas dos líneas de diálogo y el mismo prompt, palabra por palabra. Solo una de ellas escuchó primero una grabación de seis segundos de una voz.
fXlyer__czg
Activa el sonido y usa auriculares: la mitad izquierda (Toma A, sin audio de referencia) suena en tu oído izquierdo, la mitad derecha (Toma B, con una referencia de 6 segundos) en el derecho. Mismo fotograma, mismas líneas, mismo prompt. Ambas tomas: minimax/h3/reference-to-video, 2K, 10 segundos, entregadas como 2560x1440 a 24fps con pista estéreo de 32 kHz.
La Toma A no tenía más que las palabras "voz masculina de locutor, calmada, grave, magnética" en el prompt, así que inventó una voz. A la Toma B se le dieron 6.19 segundos de una frase completamente diferente y se le indicó que los tratara solo como un ancla tímbrica. Ninguna toma fue doblada después. Ninguna se acercó a un modelo de sincronía labial. En ambas, la boca sigue la voz que el modelo produjo, porque la boca y la voz se produjeron juntas.
Juzga el timbre con tus propios oídos en lugar de tomar mi palabra. Lo que puedo afirmar como hecho es el mecanismo, la configuración y la factura, y eso viene a continuación.
Por qué MiniMax H3 lip sync and audio rompió la cadena de doblaje de seis pasos de todos
La cadena antigua nunca fue realmente un flujo de trabajo. Era un trabajo de reparación.
ImGr2NgcCCY
Activa el sonido. Un sapo y un camaleón animados en 3D hablando entre sí dentro de una carpa de circo por la noche, con la atmósfera del recinto debajo del diálogo. Un clip de referencia de MiniMax para audio nativo de H3. Las formas de la boca en personajes animados son el caso más difícil de falsificar, por lo que este vale 20 segundos de tu atención.
Tres cosas se rompían constantemente, y se rompían por razones estructurales, no por mala suerte.
La línea de tiempo estaba en tus manos. Un modelo de video te daba fotogramas. Un modelo de TTS te daba una forma de onda. Nada en ninguna de las salidas sabía de la otra, por lo que la alineación era un juicio humano realizado a 30 fotogramas por segundo, a ojo, a la 1 a.m. Cada nueva renderización reiniciaba ese juicio.
La sincronía labial de parche tiene un límite. Un modelo de sincronía labial dedicado solo controla la región de la boca de un metraje que ya existe. Puede hacer que la boca coincida con el audio. No puede hacer que la mandíbula se tense antes de una consonante dura, o poner una respiración antes de una línea, o dejar caer los hombros cuando termina la frase, porque esos fotogramas se renderizaron antes de que alguien supiera qué diría el personaje. Obtienes precisión sin interpretación, lo que se percibe como inquietante.
El diseño de sonido era un segundo proyecto. Lluvia, ambiente de sala, crujido de silla, una línea de bajo debajo del diálogo. Todo llegaba de una fuente diferente y debía equilibrarse con una voz que a su vez estaba pegada.
Lo que el Audio VAE te dice sobre MiniMax H3 lip sync and audio
Aquí está la parte que no es lenguaje de marketing, porque puedes verlo en un nombre de archivo.
En H3, el texto pasa por el H3-Encoder, las entradas visuales pasan por el H3-Encoder y el H3-VisualVAE, y el audio pasa únicamente por un H3-AudioVAE independiente. El H3-Omni-Transformer luego predice conjuntamente los latentes de video y audio, que se decodifican en video y audio estéreo por separado. El AudioVAE comparte un codificador y un decodificador para los canales izquierdo y derecho, procesa cada uno de forma independiente, los recombina para estéreo y comprime audio de 32 kHz en una secuencia de tokens latentes a una tasa temporal de 40 Hz (Hugging Face model card).
Cuando ComfyUI lanzó soporte desde el día cero, esa arquitectura apareció como dos archivos separados en la carpeta VAE: minimax_h3_video_vae_fp16.safetensors y minimax_h3_audio_vae_fp32.safetensors, cargados por un cargador de VAE dual que toma una ruta de video y una ruta de audio (ComfyUI blog, agosto de 2026). El audio es una modalidad para la que el modelo fue construido, no un proceso posterior añadido al final.
Los rankings coinciden en dónde se nota eso. Artificial Analysis colocó a H3 primero en su ranking de edición de video con audio a 1130 Elo de 5043 muestras de preferencia ciega, mientras que lo ubicó entre los tres primeros tanto en texto a video como en imagen a video (Artificial Analysis, julio de 2026). La brecha entre "imagen muy buena" y "primer lugar" en ese ranking en particular es el audio.
El flujo de trabajo de MiniMax H3 lip sync and audio, valorado frente a la cadena que reemplaza
La forma honesta de juzgar esto no es por sensaciones. Es valorar la cadena antigua paso a paso, utilizando tarifas reales por segundo para un plano terminado de 10 segundos, y luego valorar el reemplazo.
| # | La cadena antigua, paso a paso | Qué lo ejecutó | Costo de ese paso | Con MiniMax H3 lip sync and audio |
|---|---|---|---|---|
| 1 | Renderizar la imagen silenciosa | un modelo de video, ej. bytedance/seedance-2.0 a $0.112/s | $1.12 | misma llamada única |
| 2 | Vocalizar las líneas | minimax/speech-2.6-hd | alrededor de $0.02 por ~250 caracteres | misma llamada única |
| 3 | Encontrar o hacer la música | minimax/music-2.6 | $0.15 por pista | misma llamada única |
| 4 | Superponer ambiente y efectos de sonido | biblioteca de sonidos más tus manos | tu noche | misma llamada única |
| 5 | Alinear todo en una línea de tiempo | editor más tus manos | tu noche | no existe |
| 6 | Mezclar | editor más tus manos | tu noche | no existe |
| 7 | Parchear la boca | sync/lipsync-v3 a $0.22/s | $2.20 | no existe |
| Total | 4 modelos más 2 pasos manuales | alrededor de $3.49 más tu noche | 1 llamada, $1.40 |
Lee la fila 7 dos veces. Parchear la boca de un clip que ya renderizaste cuesta $0.22 por segundo, mientras que generar el plano completo con su voz, su ambiente y su movimiento de boca cuesta $0.14 por segundo. El parche es más caro que el original. Esa única comparación es todo el argumento.
La asimetría que nadie menciona: tu propio audio es gratuito, tu propio video no.
La tabla de precios de pago por uso de MiniMax enumera el material de entrada por separado de la salida. Para H3, la entrada de audio es gratuita. Las primeras cinco imágenes de entrada son gratuitas y cada una después cuesta $0.04. El video de entrada se factura por la duración del clip de entrada a la tarifa de resolución de salida, que es $0.13 por segundo a 2K (documentos de precios de MiniMax, consultado el 3 de agosto de 2026). Así que los mismos 15 segundos de material de referencia no cuestan nada como canción, nota de voz o VO proporcionado por el cliente, y aproximadamente $1.95 como clip de video.
Esa es la línea que debería cambiar cómo construyes. El audio de referencia es la superficie de control más barata del modelo, y es la que nadie está probando.
| Entrada de referencia | Cuántos | Por clip | Total | Facturación (MiniMax) |
|---|---|---|---|---|
| Imagen | hasta 9 | n/a | n/a | primeras 5 gratis, luego $0.04 cada una |
| Video | hasta 3 | 2 a 15 s | 15 s máx. | facturado a la tarifa de salida, $0.13/s a 2K |
| Audio | hasta 3 | 2 a 15 s | 15 s máx. | Gratuito |
| Cualquier mezcla | 12 archivos máx. | n/a | n/a | como arriba, por tipo |
| Audio solo | no permitido. El audio debe ir acompañado de entrada de imagen o video y no puede usarse como única entrada |
Límites de la especificación H3-Base-Ref2VA en la tarjeta del modelo. El esquema de Atlas Cloud para minimax/h3/reference-to-video dice lo mismo en sus propias palabras: "Se requiere al menos una imagen O video (el audio solo no está permitido)."
Dos notas al pie en el lado de Atlas del medidor, ambas de mis propias ejecuciones, no de una página de documentación. Atlas factura una tarifa plana única de $0.14 por segundo de salida para los tres endpoints de H3, y un video de referencia que adjunté no agregó un cargo adicional. Eso es una observación, no una política, así que presupuesta según la regla de MiniMax y trata la tarifa plana como un bono. Atlas también acepta resolution: "768P" y lo factura a los mismos $0.14, lo cual es una discrepancia que vale la pena leer en el desglose de precios de la API de MiniMax H3 en lugar de aquí.
Todo lo siguiente se ejecuta en una pestaña del navegador en Atlas Cloud: el fotograma base, la referencia de voz y ambas tomas de H3, con una clave de API y un bucle de sondeo. Los tres endpoints de H3 difieren solo en la forma de su entrada, por lo que refers se convierte en image se convierte en texto plano y nada más de tu código cambia.
MiniMax H3 lip sync and audio, paso a paso
Cinco pasos. Dos de ellos son configuración barata, dos son la prueba real, y el último no cuesta nada porque está diseñado para fallar.
Paso 1: Construir el fotograma base con GPT Image 2
La demo es un locutor de radio de turno nocturno, elegido por una razón: un primer plano ajustado de una boca es el único encuadre donde realmente puedes juzgar la sincronía labial. Un plano general permite que un modelo haga trampa.
Dos cosas en este prompt no son negociables. La boca debe estar ligeramente abierta a media palabra, para que el primer fotograma ya se lea como habla, y no debe haber texto en ningún lugar del fotograma, para que los subtítulos dinámicos posteriores no entren en conflicto con letras incrustadas.
plaintext1Fotograma fijo fotorrealista cinematográfico, 16:9, estudio de radio de turno nocturno, encuadre ajustado de pecho de un hombre de unos treinta y tantos años inclinado hacia un micrófono vintage plateado de condensador en un brazo articulado, parabrisas de espuma a centímetros de sus labios, auriculares medio fuera de una oreja. Lámpara de escritorio de tungsteno cálido desde la izquierda de la cámara esculpe su pómulo; un letrero de neón rojo ON AIR arde desenfocado detrás de su hombro y sangra carmesí sobre los faders de la mesa de mezclas en el primer plano inferior. La lluvia corre por la ventana del estudio a la derecha, las luces de la ciudad se desdibujan en bokeh. Humo fino de cigarrillo se desvía a través del haz de la lámpara. Boca ligeramente abierta a media palabra, ojos hacia abajo hacia un guion de papel. Disparo en 35mm, profundidad de campo reducida, grano de película fino, sombras profundas, sin texto en ningún lugar del encuadre. 2
Configuración en openai/gpt-image-2/text-to-image: calidad alta, tamaño 16:9 a 2048x1152, una imagen. Los $0.009 en la lista de modelos son un mínimo por nivel de token, no lo que pagas. En este tamaño y calidad, el botón Ejecutar cotiza $0.1745 por dibujo, como puedes ver en la captura de pantalla a continuación.

GPT Image 2 en Atlas Cloud con el prompt de la cabina de radio escrito, calidad alta y 16:9 2048x1152 seleccionados, y el fotograma base terminado renderizado en el panel OUTPUT_GPT Image 2 en Atlas Cloud: el prompt exacto de arriba, calidad alta, 16:9 a 2048x1152, y un segundo dibujo del mismo fotograma en OUTPUT._
Paso 2: Crear la referencia de voz de seis segundos
Este es el paso que la gente hace mal, así que lee el razonamiento antes del prompt.
El audio de referencia debe decir una frase diferente a la que quieres en el video. Es un ancla tímbrica, nada más. Las líneas provienen del prompt. El propio ejemplo de referencia a video de MiniMax hace explícita esta división: etiqueta un clip como la pista fuente para reutilizar parcialmente para música, y un segundo clip puramente como "la referencia de timbre de voz", con el nuevo diálogo escrito en línea en el prompt. Si tu referencia dice las mismas palabras que pediste, estás invitando al modelo a copiar la pista en lugar de transferir la voz.
plaintext1Estás escuchando Night Line, noventa y uno punto cuatro, y se acerca 2las tres de la mañana. 3
Configuración en minimax/speech-2.6-hd: cualquier voz masculina calmada y grave funciona, y elegí Magnetic-voiced Male (English_magnetic_voiced_man). Configura speed en 0.95 para que la toma caiga dentro de la ventana de 2 a 15 segundos con margen, deja vol en 1.0 y mantén la salida mp3. El modelo cuesta $0.08 por cada 1000 caracteres, bajado de $0.10, un descuento del 20% vigente a partir de agosto de 2026. Mi línea volvió con 6.19 segundos y facturó $0.00792.

MiniMax Speech 2.6 HD en Atlas Cloud con la línea de referencia escrita en el campo de texto y la forma de onda de audio renderizada en el panel OUTPUT
MiniMax Speech 2.6 HD en Atlas Cloud: una línea de entrada, un mp3 corto de salida, con el descuento del 20% mostrado en el botón Ejecutar. La captura de pantalla se tomó con la voz predeterminada de Expressive Narrator, así que cambia el selector de Voz a Magnetic-voiced Male y baja Speed a 0.95 antes de ejecutarlo.
Paso 3: Ejecutar MiniMax H3 lip sync and audio con el audio de referencia
Ahora ambos archivos van a refers juntos: el fotograma fijo del Paso 1 y el mp3 del Paso 2. Esta es la Toma B.
El prompt utiliza la estructura seccionada en la que se entrenó H3. subject_definitions nombra quién y qué son las referencias, detailed_description lleva el diálogo dentro de etiquetas <d>[English] ...</d>, y las dos secciones de audio describen la mezcla. Si los nombres de las secciones son nuevos para ti, la guía de prompts de MiniMax H3 cubre la estructura completa. Solo tres campos importan para el trabajo de audio, y están todos aquí.
plaintext1subject_definitions: 2<Subject 1> es el hombre en el micrófono de radio en <Picture 1>, de unos treinta y tantos, auriculares medio fuera de una oreja, neón rojo ON AIR detrás de su hombro. 3<Picture 1> es el fotograma de apertura del video de destino. 4<Audio 2> es la referencia de timbre de voz para <Subject 1>: una voz de locutor masculina, calmada, grave, magnética. Referencia solo el timbre; no reutilices sus palabras. 5 6summary: 7[referencia de imagen + referencia de timbre de audio] Un único primer plano continuo de 10 segundos. <Subject 1> pronuncia dos líneas directamente al micrófono con el timbre de voz de <Audio 2>, mientras la cámara se acerca lentamente. El movimiento de la boca, la respiración antes de cada línea y el ambiente de la sala se generan juntos. 8 9detailed_description: 10El plano comienza exactamente en <Picture 1>. Tungsteno cálido desde la izquierda de la cámara, neón rojo sangrando sobre la mesa de mezclas en primer plano, lluvia en la ventana detrás. <Subject 1> toma una respiración corta, se inclina unos grados hacia el parabrisas y habla, <d>[English] Son las tres de la mañana, y sé exactamente quién sigue despierto.</d> Mientras habla, su mandíbula y labios se mueven naturalmente con cada sílaba; las oclusivas en "three" y "morning" son visibles. Mira hacia abajo al guion, luego vuelve a mirar más allá del lente, y continúa, <d>[English] Así que dejemos esto entre nosotros.</d> Justo cuando su voz se detiene, sus labios se cierran y exhala por la nariz. Durante todo el tiempo, la cámara ejecuta un acercamiento lento y deliberado; el neón parpadea una vez, débilmente, alrededor del segundo siete. Sin texto en pantalla. 11 12overall_soundscape: 13Voz cercana, seca, tratada como en cabina, con un toque de efecto de proximidad del micrófono. Debajo: un zumbido eléctrico bajo del escritorio, lluvia constante contra el vidrio, un coche distante pasando sobre la calle mojada, el crujido suave de la silla al inclinarse, y una respiración audible antes de cada línea. 14 15non_diegetic_music: 16Un contrabajo de jazz lento y nocturno, muy quieto, muy por debajo de la voz, que entra alrededor del segundo dos y nunca supera el diálogo. 17
Configuración en minimax/h3/reference-to-video: resolución 2K, duración 10, relación de aspecto 16:9, y refers conteniendo ambos archivos. El orden dentro del array no importa, solo que al menos uno de ellos sea una imagen o un video. El control deslizante de Duración predetermina 8, así que muévelo, y cambia Relación de aspecto de adaptive si quieres el fotograma que pediste.
Cuatro trampas de parámetros, tres de las cuales me han costado dinero. La clave es ratio, no aspect_ratio, y equivocarse devuelve un 400. Siempre envía duration explícitamente, porque el valor predeterminado del esquema dice 8 pero una solicitud sin él volvió como un archivo de 5 segundos. En este endpoint, enviar image junto con refers se completa, factura en su totalidad y descarta silenciosamente uno de ellos. Y si pasas el audio como una URL de datos base64, etiquétalo como data:audio/mp3, no data:audio/mpeg. Mi primer intento falló exactamente por eso:
plaintext1content[2].audio_url: invalid param: audio format ".mpeg" not allowed 2
Ese al menos es gratuito, lo que nos lleva a la forma útil de aprender los límites.

El playground de MiniMax H3 reference-to-video en Atlas Cloud, con el mp3 en la ranura 1 y el fotograma base en la ranura 2 de Materiales de referencia, resolución 2K, y el clip terminado reproduciéndose en el panel OUTPUT
MiniMax H3 reference-to-video en Atlas Cloud: Materiales de referencia muestra 2/9 con el mp3 en la ranura uno y el fotograma fijo en la ranura dos, resolución 2K, clip terminado a la derecha. Esta captura se ejecutó con los 8 segundos predeterminados del playground, por lo que el botón Ejecutar muestra $1.12; mis dos tomas anteriores se ejecutaron a 10 segundos por $1.40 cada una.
Paso 4: Ejecutar la toma de control de MiniMax H3 lip sync and audio
Cambia una entrada y cada mención de ella. Elimina el mp3 de refers para que solo quede la imagen, borra la definición de <Audio 2>, corta la frase "con el timbre de voz de <Audio 2>" del resumen y cambia la etiqueta entre corchetes a [referencia de imagen]. Nada más se mueve, y la configuración permanece idéntica: 2K, 10 segundos, 16:9.
Eso es lo que la convierte en un control en lugar de un segundo intento. El modelo ahora no tiene un ancla de timbre, por lo que inventa una voz a partir de la descripción escrita y sincroniza los labios con la voz que acaba de inventar. Ambas tomas regresaron con 10.13 segundos y facturaron $1.40 cada una, al centavo.
WnfqR2I-a-8
Activa el sonido. Toma A por sí sola: mismo fotograma, mismas líneas, sin audio de referencia. La voz aquí es la invención del modelo, y la boca aún la sigue.
Dos tomas, una variable. Ese es el experimento más barato de todo este artículo y el único que te dice lo que realmente hace el campo de audio.
Paso 5: Romper MiniMax H3 lip sync and audio a propósito
El último paso es gratuito, y vale la pena hacerlo una vez para que reconozcas el fallo a las 2 a.m.
Pon el mp3 en refers y nada más. Sin imagen, sin video, solo audio. Luego envía.
plaintext1curl -s https://api.atlascloud.ai/api/v1/model/generateVideo \ 2 -H "Authorization: Bearer $ATLAS_API_KEY" \ 3 -H "Content-Type: application/json" \ 4 -d '{ 5 "model": "minimax/h3/reference-to-video", 6 "prompt": "Un hombre en un micrófono de radio pronuncia dos líneas hacia el parabrisas.", 7 "refers": [{"url": "https://example.com/voice-reference.mp3", "type": "audio"}], 8 "resolution": "2K", 9 "duration": 10, 10 "ratio": "16:9" 11 }' 12
Aquí está la parte que vale la pena saber, porque no es lo que implica el esquema. La llamada de envío devuelve HTTP 200 con un id de tarea normal y "status": "processing", por lo que un cliente ingenuo piensa que funcionó. Veintitrés milisegundos después, la tarea ha muerto:
plaintext1{ 2 "status": "failed", 3 "error_code": 1010001, 4 "error": "generate task failed, minimaxh3: reference-to-video requires at least one reference image or video", 5 "latency_ms": 23 6} 7
Nunca apareció un campo price en esa predicción, por lo que no costó nada. La lección práctica es sobre tu código, no tu cartera: un 200 al enviar no es un éxito. Sondea el id y verifica status antes de asumir que tienes un clip.
Cuatro formas más de llevar MiniMax H3 lip sync and audio al límite
La prueba de dos tomas es el experimento útil más pequeño. Aquí es hacia dónde va el mismo campo a continuación.
Un plano, varios idiomas. Mantén el fotograma, mantén la acción, cambia la etiqueta de idioma dentro de <d>...</d> y ejecútalo de nuevo. La boca sigue el nuevo idioma en lugar del antiguo, porque la boca y la voz salen de la misma pasada hacia adelante. La tarjeta del modelo enumera soporte de diálogo estable para 11 idiomas: árabe, chino, inglés, francés, alemán, italiano, japonés, coreano, portugués, ruso y español, con más soportados en diversos grados. Estos dos clips son el mismo tráiler con dos pistas de voz diferentes, y MiniMax también cortó una versión en francés y una versión sin narración a partir de la misma configuración.
hj7ZId3KOKk
Activa el sonido. La versión con voz en off en inglés: un primer plano de un astronauta en un planeta naranja polvoriento, narración y música llegando con la imagen. El trabajo de tráiler son los mismos tres campos de prompt con un paisaje sonoro diferente.
Hv62FGyBNPM
Activa el sonido. La versión en japonés, fotograma a fotograma el mismo tráiler. No se redobló nada y no ocurrió una sesión de VO separada.
Cantar, con un gancho que ya posees. Aquí es donde el audio de entrada gratuito deja de ser una nota al pie. Coloca un gancho existente o un instrumental en refers con 15 segundos o menos, describe la interpretación, y el personaje actúa sobre él. No estás pagando por la música que traes.
zui3Zw_UWnY
Activa el sonido. Una banda grabada con un aspecto de videocámara retro, entre bastidores y luego actuando, con la pista y la imagen llegando juntas. Esa es la forma que la mayoría del trabajo de video musical realmente quiere.
Dos personas hablando es más difícil que una. Un solo hablante en primer plano es el caso fácil, que es exactamente por qué este artículo lo usó. Para el diálogo entre dos personajes, etiquétalos explícitamente como lo hace el propio ejemplo de MiniMax, con <Subject 1> (S1) y <Subject 2> (S2) adjuntos a cada línea <d>, y espera tener que reintentar cuando el modelo se equivoque en el orden o la atribución. Presupuesta dos ejecuciones por escena de dos personajes.
Ambiente sin una palabra dicha. overall_soundscape es un campo por sí mismo, y funciona sin ningún diálogo. Lluvia en el vidrio, crujido de silla, zumbido de nevera, la sala misma. Eso convierte al mismo endpoint en una herramienta legítima de ASMR y ambiente, y es el único uso donde la boca nunca importa.
Un límite honesto de mis propias dos tomas: la generación en la misma pasada significa que la boca y la voz coinciden, y no significa que cada detalle físico en el fotograma coincida con el sonido. Las líneas largas metidas en una duración corta, la dirección de interpretación vaga y las escenas con varios hablantes degradan el resultado. Mira tu clip antes de enviarlo, de la misma manera que verías una toma de un actor humano.
Lo que realmente me costó MiniMax H3 lip sync and audio
Cada cifra a continuación es un cargo real en una cuenta real, obtenido después del hecho. El campo price en una predicción se completa tarde, por lo que sondear hasta completed a menudo devuelve nada. Vuelve a buscar el id para obtener el número.
| Paso | Modelo | Qué se ejecutó | Facturado |
|---|---|---|---|
| 1 | openai/gpt-image-2/text-to-image | 1 fotograma base, calidad alta, 2048x1152 | $0.1745 (cotizado en el botón Ejecutar) |
| 2 | minimax/speech-2.6-hd | 99 caracteres, 6.19 s de voz de referencia | $0.01 |
| 3 | minimax/h3/reference-to-video | Toma B, 10 s a 2K, imagen + audio en refers | $1.40 |
| 4 | minimax/h3/reference-to-video | Toma A, 10 s a 2K, solo imagen | $1.40 |
| 5 | minimax/h3/reference-to-video | solicitud solo de audio, falló en 23 ms | $0.00 |
| Experimento completo, ambas tomas | alrededor de $2.98 |
Dos notas contables, porque la honestidad es más barata que una nota al pie. La URL de datos audio/mpeg incorrecta en el Paso 3 tampoco costó nada, ya que dio 400 en el envío. Los rechazos son gratuitos, pero una solicitud bien formada con una entrada rota no lo es, por lo que una URL de referencia que devuelve silenciosamente un 404 aún te facturará en su totalidad. Y la captura del playground en la captura de pantalla del Paso 3 es una tercera ejecución de H3 con los 8 segundos predeterminados del panel, que facturó $1.12 además de la tabla. Esa ejecución existe para este artículo, no para el experimento.
La cadena antigua, valorada en la tabla más arriba, era de aproximadamente $3.49 por un plano de 10 segundos más una noche de alineación manual. Esto fueron dos planos completos de 10 segundos con sonido, un A/B controlado y dos solicitudes deliberadamente rotas, por menos.
Dicho esto, H3 es la herramienta incorrecta para varios trabajos que la gente intentará darle, y las alternativas son más baratas.
| Lo que realmente quieres | El modelo correcto | Precio | Por qué |
|---|---|---|---|
| Un retrato más un archivo de audio existente, en una cabeza parlante | bytedance/avatar-omni-human-v1.5 | $0.12/s | Audio a video creado para ello, y la longitud de salida sigue a tu audio |
| Un clip terminado cuya boca necesita hablar un nuevo idioma | sync/lipsync-v3 | $0.22/s | H3 no modifica tu renderizado existente, y parchear es exactamente el trabajo de este modelo |
| El arreglo de boca más barato posible en una cabeza parlante | veed/lipsync | $0.013/s | Aproximadamente diez veces más barato, y toca solo la boca, no la interpretación |
| Un plano dirigido completo, con timbre, ambiente y música juntos | minimax/h3/reference-to-video | $0.14/s | La imagen y el sonido provienen de una pasada, por lo que la interpretación se diseña en lugar de repararse |
Si estás eligiendo entre H3 y su rival más cercano en trabajo de personajes en lugar de audio, la comparación con Seedance 2.5 es mejor lectura. Y si te preguntas si los pesos abiertos hacen que esto sea gratuito, no lo hacen rápido: 2K aún proviene del lado de la API, y los informes de la comunidad sitúan una renderización local de 10 segundos en 480p en minutos en lugar de segundos en tarjetas de consumo.
Una nota honesta sobre voces, canciones y derechos
Gratuito para subir no es lo mismo que gratuito para usar. Una canción que no escribiste y una voz que no es tuya son dos permisos separados, y ninguno es otorgado por una API que no te cobra nada por la subida. Usa tus propias grabaciones, música con licencia o una voz sintética que generaste tú mismo, que es exactamente lo que hace el Paso 2.
Por separado, los pesos de la comunidad conllevan límites territoriales que actualmente no cubren la UE, el Reino Unido, Corea del Sur ni los EE. UU., con un canal de licencia formal abierto en su lugar. Esa es una historia más larga, y se cuenta en la guía de pesos abiertos de MiniMax H3.
MiniMax H3 lip sync and audio: preguntas frecuentes
¿MiniMax H3 lip sync and audio realmente genera sonido en la misma pasada, o se dobla después?
Misma pasada. El texto pasa por el H3-Encoder, lo visual por el H3-Encoder más el H3-VisualVAE, y el audio por un H3-AudioVAE independiente. El H3-Omni-Transformer predice conjuntamente los latentes de video y audio, que luego se decodifican por separado en imagen y audio estéreo de 32 kHz. No se superpone nada después, por lo que la boca, la respiración y el ambiente de la sala pertenecen a la misma toma.
¿Puedo alimentar mi propia canción o voz en MiniMax H3 lip sync and audio, y cuesta extra?
Sí, y no. La tabla de pago por uso de MiniMax enumera la entrada de audio de H3 como gratuita. La asimetría a tener en cuenta es el video: el video de entrada se factura por su duración a la tarifa de salida, $0.13 por segundo a 2K, por lo que 15 segundos de video de referencia cuestan alrededor de $1.95 mientras que 15 segundos de audio de referencia cuestan $0.
¿Por qué MiniMax H3 lip sync and audio rechaza una solicitud que solo tiene audio?
Porque el audio es el único tipo de referencia que no puede viajar solo. Debe ir acompañado de al menos una imagen o video. El resto de los límites, de la especificación H3-Base-Ref2VA: hasta 9 imágenes, hasta 3 videos y hasta 3 clips de audio, cada clip de video o audio entre 2 y 15 segundos, 15 segundos en total por tipo, y un máximo de 12 archivos de todos los tipos en una solicitud.
¿MiniMax H3 lip sync and audio se mantendrá durante todo el clip, o solo la primera línea?
Para un solo hablante con espacio para respirar, se mantiene durante todo el clip en lugar de acertar una línea y desviarse. Tres cosas lo rompen: meter un guion largo en una duración corta, una dirección de interpretación vaga o faltante, y escenas con varios hablantes donde el modelo tiene que decidir quién habla cuándo. Dale a cada línea un hablante etiquetado y suficientes segundos para decirla.
¿MiniMax H3 lip sync and audio necesita un redoblaje para otro idioma?
No. Cambia la etiqueta de idioma dentro del marcado de diálogo, de <d>[English] ...</d> a <d>[Japanese] ...</d>, y ejecuta el mismo prompt de nuevo. La boca se genera con la nueva voz, por lo que coincide con el nuevo idioma en lugar del antiguo. La tarjeta del modelo enumera soporte de diálogo estable para 11 idiomas.
¿Es más barato ejecutar MiniMax H3 lip sync and audio localmente?
Más barato por clip, caro en todos los demás aspectos. Los pesos son abiertos, pero los informes de la comunidad sobre ejecuciones locales en tarjetas de consumo de 16 GB miden una generación de 10 segundos en 480p en minutos, el autoalojamiento renderiza a un lado corto de 768, y 2K aún proviene del paso de regeneración del lado de la API. Agrega los límites territoriales en la licencia comunitaria y la API sigue siendo el camino pragmático para trabajos terminados.






