Seedance 2.5 ya está disponible — Primero en Atlas Cloud

MiniMax H3 ASMR Video: Corté una granada de vidrio, luego medí si el estéreo era real

La mayoría de los ASMR de IA pegan sonido de archivo a un video silencioso. Un video ASMR de MiniMax H3 renderiza 32 kHz estéreo en una sola pasada. Medí los canales, con prompts y costos.

Ponte los auriculares antes de desplazarte al clip de abajo. En esta categoría, sí importa.

Un cuchillo desciende sobre una granada tallada en vidrio de rubí. La cáscara se parte, un crujido cristalino, y luego unas docenas de semillas de vidrio caen rodando sobre una pizarra mojada. Aquí está la parte que es diferente de casi todos los clips de ASMR con IA que has visto este año: nadie agregó ese sonido. No hubo biblioteca de sonidos, ni editor, ni línea de tiempo. La imagen y el audio salieron de una sola generación, en una sola llamada.

Durante el último año, el ASMR con IA se veía satisfactorio pero sonaba ligeramente mal, y la razón nunca fue lo visual. Era el último paso del proceso. Pegar audio a un clip silencioso ha sido un trabajo manual, hecho a mano, cada vez. La categoría creció tan rápido en torno a esa brecha que surgió una pequeña industria de sitios dedicados a generar ASMR con IA, solo para automatizar el ensamblaje, uno de ellos anunciaba "audio 3D binaural" en la página de inicio. La demanda estaba probada desde hace tiempo. Solo se estaba sirviendo mediante ensamblaje.

Así que ejecuté las cosas correctamente. Un flujo de trabajo reproducible, seis clips, y luego la parte que nadie en esta categoría hace: separé los canales izquierdo y derecho en ffmpeg y los medí. Algo de lo que esperaba resultó ser incorrecto, y eso resultó ser lo más útil del artículo.

Conclusiones clave

  • H3 renderiza la imagen a 24 fps y una pista AAC estéreo a 32 kHz en la misma pasada. El audio se genera, no se dobla después.
  • El estéreo es genuinamente estéreo, no mono dual disfrazado de estéreo. Pero no se puede indicar un paneo. Pedí un barrido de izquierda a derecha fuerte y obtuve una diferencia de 1.9 dB, que no es nada.
  • La amplitud estéreo proviene del contenido, no de la redacción. El clip de lluvia, donde no pedí ninguna dirección, regresó con un campo genuinamente amplio.
  • Bloquear el primer fotograma mantiene la toma en todas las resoluciones, pero 768P y 2K siguen siendo dos tomas diferentes. El borrador previsualiza el aspecto y las especificaciones de sonido, no la coreografía exacta.
  • Un clip de 5 segundos a 768P cuesta $0.50. El mismo clip a 2K cuesta $0.70. El artículo completo costó $4.27.

Escucha Primero: Un Video ASMR de MiniMax H3, Cortado en una Sola Pasada

w7ZRR7bo3KI

Cinco segundos, 2K, 24 fps, estéreo a 32 kHz, una generación, $0.70. Sonido activado: el chirrido del borde al morder, el crujido, luego las semillas. Nada se agregó después. Generado con minimax/h3/image-to-video.

Un prompt. Un modelo. Una llamada. Todo lo que sigue es cómo se hizo ese clip, cuánto costó y qué partes de la historia de marketing sobreviven al contacto con una forma de onda.

Por Qué el ASMR con IA Explotó, y Por Qué la Mayoría Falla en la Prueba de los Auriculares

La tendencia tiene un cumpleaños. El ASMR con IA comenzó a extenderse en junio de 2025, justo después de que Veo 3 aterrizara, y el formato se volvió viral en días. Un lava mukbang de @asmraiworks superó los 11.3 millones de visitas en una semana; un clip de corte de vidrio hizo 5.3 millones en once días (Know Your Meme, 2025). Los medios lo recogieron como una curiosidad, con imágenes surrealistas y lava fundida comida con palillos haciendo la mayor parte del trabajo pesado (The Express Tribune, 2025).

Luego la gente se puso los auriculares y el estado de ánimo cambió. El escritor de TechRadar vio un montón de los virales y salió describiendo una capa de artificialidad, "carente de los errores e imprecisiones que son el sello distintivo del ASMR hecho por humanos" (TechRadar, junio de 2025). Los fans citados en ese artículo dijeron que los desencadenantes de cosquilleo estaban técnicamente presentes y que seguía sin ser lo mismo.

Hay una razón mecánica, y no es mística. El ASMR es la única categoría de contenido donde el contenido es el sonido. En cualquier otro lugar, el audio es un adorno. Aquí es el producto. Y el flujo de trabajo dominante era:

  1. generar un clip silencioso con un modelo de video,
  2. buscar en una biblioteca de sonidos un crujido, un chasquido, una cama de lluvia,
  3. alinear el sonido con la imagen en un editor,
  4. panoramizar y mezclar a mano si te importa, lo que casi nadie hace en volumen,
  5. exportar.

El paso 3 es donde muere. Un crujido enlatado disparado dos fotogramas tarde se lee como falso antes de que puedas explicar por qué. Multiplícalo por una programación de publicación diaria y los errores se acumulan, porque la alineación la está haciendo un humano cada vez.

Esa brecha es la razón por la que existe toda una industria artesanal de sitios generadores de ASMR con IA. Al menos tres se están comercializando activamente y uno lidera con audio 3D binaural como característica principal. No están resolviendo un problema falso. Están parcheando un agujero real: los modelos de video subyacentes no producen sonido.

Lo que hace que valga la pena echar un vistazo a una tabla de clasificación. En el tablero de edición de video de Artificial Analysis, el que se puntúa con audio, MiniMax H3 se sitúa en el #1 con 1,126 Elo, por delante de Gemini Omni Flash con 1,119 y aproximadamente cien puntos por delante de Dreamina Seedance 2.0 con 1,027 (Artificial Analysis, agosto de 2026). En los tableros de imagen a video, donde el audio no es parte de la puntuación, varios de esos modelos se sitúan a un par de puntos el uno del otro. La brecha se abre cuando el sonido cuenta. Para el ASMR, el sonido es lo único que cuenta.

El Flujo de Trabajo del Video ASMR con MiniMax H3, y Cuánto Cuesta Cada Paso

Tres endpoints, una pestaña del navegador. Ejecuté todo en este artículo en Atlas Cloud, por lo que cada cifra a continuación proviene de la factura, no de una tarifa.

Trabajo en este artículoModeloTarifa
Primer fotograma para la muestraOpenAI GPT Image 2 (texto a imagen)desde $0.009/imagen, facturado $0.1745 en alta y 2048x1152
Borrador y definitivoMiniMax H3 Imagen a Video$0.10/s a 768P, $0.14/s a 2K
Alimentar una grabación realMiniMax H3 Referencia a Videodos mismos niveles
Las tres plantillasMiniMax H3 Texto a Videodos mismos niveles
La forma antigua, solo mitad audioByteDance Seed Audio 1.0$0.143/min

La lista muestra "Desde $0.1/SEG" en los tres endpoints de H3. Ese es el mínimo de 768P. 2K factura a $0.14/s y ese número no aparece en ningún lado excepto en tu factura, así que planifica según el nivel que realmente solicites.

Tabla 1: una pasada versus el pipeline cosido.

 MiniMax H3, audio nativoModelo silencioso más audio posterior
Pasos para un clip terminado14 a 5
Herramientas involucradas1modelo de video + biblioteca de sonidos + editor + exportar
Cómo se mantienen sincronizados imagen y sonidomisma generación, misma línea de tiempoarrastras hasta que se vea bien
Quién mezcla y panoramizanadie, tomas lo que da el modelotú, a mano, por sonido
Tiempo humano por clipaproximadamente cero después del prompt15 a 40 minutos, honestamente
Cómputo por clip de 5s$0.50 a 768Pmodelo de video + $0.143/min de generación de audio

Deliberadamente no cito la tarifa por segundo de una plataforma de video rival, porque el cómputo no es donde vive la diferencia. La generación de audio cuesta $0.143 por minuto, que son centavos. El costo real del pipeline cosido son 20 minutos de atención humana por clip, y ese costo no disminuye a medida que escalas. Se multiplica. Una cuenta anónima de publicación diaria es exactamente donde 20 minutos por clip se comen silenciosamente todo el modelo de negocio.

El contrapeso honesto: coser a mano te da control. Puedes poner un sonido en cualquier lugar del campo estéreo y recortarlo al fotograma. H3 te da la sincronización gratis y, como muestran las mediciones a continuación, no te devuelve ese control.

Tabla 2: los tres endpoints de H3, los parámetros que realmente importan.

 imagen a videotexto a videoreferencia a video
Entrada principalimagen (primer fotograma)solo promptrefers[]
resolución768P / 2K, por defecto 2Kmismomismo
duracióncualquier segundo entero de 4 a 15, por defecto 8mismomismo
ratiodecidido por el primer fotogramadebe establecerse explícitamente, adaptativo es rechazadodecidido por las referencias
límites de refersno se usa junto con imagenno se usahasta 9 imágenes, 3 videos, 3 audio
Salida 16:9 entregada1344x768 a 768P, 2560x1440 a 2Kmismomismo
Pista de audioAAC estéreo 32 kHz sobre video 24 fpsmismomismo

Dos trampas de parámetros que vale la pena escribir en tu mano. El parámetro se llama ratio, no aspect_ratio, y la clave incorrecta lo deja sin establecer, por lo que texto a video rechaza la solicitud. Y image más refers en la misma llamada no da error: se completa, factura por completo y silenciosamente descarta una de las dos entradas.

Tutorial de Video ASMR con MiniMax H3: Cortando una Granada de Vidrio

El corte de frutas de vidrio es el formato que todos reconocen, por lo que el lector sabe instantáneamente lo que está viendo. Sin embargo, las manzanas de vidrio y los mangos de vidrio ya se han hecho hasta el cansancio. Una granada es mejor por una razón específica: cuando la cáscara se parte, cientos de semillas de vidrio se derraman y ruedan, por lo que el sonido tiene duración y estructura en lugar de ser un solo impacto centrado. Si un modelo está falsificando su audio, una dispersión es donde se nota.

Paso 1: Construye el Fotograma Base con GPT Image 2

Bloquea la composición antes de gastar algo en video. Configuración: quality: high, size: 2048x1152 (16:9), output_format: png.

plaintext
1Fotografía macro en primer plano extremo de una granada entera tallada completamente en vidrio
2de rubí grueso y translúcido, descansando sobre una losa de pizarra negra mojada. La cáscara de vidrio tiene 8 mm
3de grosor con burbujas internas visibles y facetas astilladas; cientos de diminutas semillas de vidrio brillan
4en su interior como cristales de granate. Un cuchillo santoku japonés pulido yace en el borde
5izquierdo del encuadre, con la punta de la hoja tocando justo la piel de vidrio. Una luz clave dura desde la
6parte superior derecha rasga la losa y arroja cáusticos rojos intensos sobre la piedra mojada.
7Macro de 100 mm, f/2.8, poca profundidad de campo, fondo oscuro y atmosférico.
8Sin manos, sin texto, sin marca de agua, sin logotipo.

Interfaz del generador de imágenes AI que muestra un prompt de texto y la imagen generada

Playground de GPT Image 2 en Atlas Cloud con calidad en alta y tamaño 16:9 2048x1152, la granada de vidrio renderizada en el panel de SALIDA

La ejecución real. Calidad high a 2048x1152, y la página cotiza $0.1745, que es lo que la factura dijo después también.

Hoja de cuchillo cortando una granada de vidrio rojo translúcido sobre piedra oscura

El fotograma base generado: una granada tallada en vidrio de rubí grueso sobre pizarra negra mojada, un cuchillo santoku entrando desde el borde izquierdo

El fotograma entregado a H3. Generado con openai/gpt-image-2/text-to-image.

Paso 2: Escribe la Mitad de Audio del Prompt del Video ASMR con MiniMax H3

La mayoría de la gente escribe un prompt de ASMR como una descripción de imagen con la palabra "ASMR" pegada al frente, y luego se pregunta por qué el modelo lo puntúa con piano lo-fi. H3 se toma en serio las instrucciones de audio si se las das. Estructura la mitad de audio en cinco espacios:

  1. Material. Qué está haciendo el sonido. Vidrio, cera, roca fundida, agua sobre vidrio. Sé específico sobre el grosor y la humedad, cambian el timbre.
  2. Acción y su forma en el tiempo. No solo "corta", sino "presiona hacia abajo en una sola carrera continua y lenta". El modelo usa esto para ubicar eventos.
  3. Perspectiva del micrófono.close-mic, intimate, señales de distancia de grabación. Esto establece qué tan seco y cercano se siente el sonido, y funciona bien.
  4. Secuencia de onomatopeyas. Deletrea los eventos de sonido en orden: chirrido, luego crujido, luego docenas de pequeños impactos, luego silencio. Este es el espacio que hace más trabajo.
  5. Negativos.no music, no voice, no narration, no room reverb, no ambience bed. Sin estos, H3 agregará amablemente una banda sonora, porque la mayoría de los videos en sus datos de entrenamiento tienen una.

También escribí direcciones de canales en el espacio 4, pidiendo que el crujido esté en el canal izquierdo y que las semillas rueden de izquierda a derecha. Sigue leyendo para ver lo que realmente produjo eso.

Paso 3: Ejecuta el Borrador a 768P

Borra a 768P. La pista de audio tiene la misma especificación en ambos niveles, por lo que todo el juicio creativo, que en ASMR es un juicio de escucha, se puede hacer a la tarifa barata.

Configuración en minimax/h3/image-to-video: image = salida del Paso 1, resolution: 768P, duration: 5. El ratio proviene del primer fotograma, así que déjalo en paz.

plaintext
1La hoja santoku entra desde la izquierda y presiona hacia abajo a través de la granada de vidrio
2en una sola carrera continua y lenta, viajando de izquierda a derecha a través del encuadre. La cáscara
3se parte con un brillante crujido cristalino y un chorro de diminutas semillas de vidrio cae sobre la
4pizarra mojada, dispersándose hacia el borde derecho. Cámara fija, macro, toma única, sin cortes.
5
6Audio: ASMR, close-mic, íntimo, sin música, sin voz, sin narración, sin reverberación de sala.
7Un chirrido de vidrio seco y sostenido mientras el borde muerde, luego un crujido agudo y fuerte
8panoramizado al canal IZQUIERDO, seguido de docenas de pequeños impactos de semillas tintineando
9rodando desde el canal IZQUIERDO hacia el DERECHO mientras se dispersan. Un leve raspón de hoja
10sobre piedra al final, luego silencio. Sin cama de ambiente, sin zumbido, sin música de fondo.

Interfaz del generador de video AI que muestra un video de granada de vidrio

Playground de MiniMax H3 imagen a video en Atlas Cloud con el fotograma base cargado, duración 5, y un clip completado en el panel de SALIDA

La ejecución de imagen a video: primer fotograma cargado, duración 5, SALIDA completada. Nota que el selector de Resolución está en el valor predeterminado de la página de 2K. Cámbialo a 768P para borradores, que es la resolución a la que se renderizó el clip de abajo.

xkolGEKI7UI

El borrador a 768P, $0.50. Imagen más suave que el clip principal, misma especificación de audio. Esta es la toma sobre la que se toma toda la decisión.

Paso 4: Mide el Estéreo Antes de Confiar en Él

No te fíes de mi palabra sobre el sonido, ni del modelo. Separa los canales y mira. Esto es ffmpeg local, sin llamada API, sin costo:

plaintext
1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \
2  -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \
3  -frames:v 1 stereo-proof.png

Comparación de formas de onda de separación de canales estéreo en dos clips de audio ASMR

Análisis de forma de onda de cuatro paneles que compara el clip de granada de vidrio y el clip de lluvia, mostrando los canales izquierdo y derecho más el canal lateral para cada uno

Canal izquierdo sobre canal derecho para dos clips, más el canal lateral (izquierdo menos derecho) con ganancia igualada debajo. Este es todo el argumento en una imagen.

Esto es lo que regresó, y parte de ello no es lo que esperaba.

El estéreo es real. El canal lateral no está vacío en ningún clip que generé. Un archivo mono dual disfrazado de estéreo no mostraría nada allí. Este tiene contenido.

Pero no puedes indicar un paneo. Pedí, en mayúsculas, que el crujido esté en el canal IZQUIERDO y que las semillas rueden de IZQUIERDA a DERECHA. Medido: correlación de canales 0.97, canal lateral situado 17.7 dB por debajo del medio, y la mayor diferencia de nivel izquierda-derecha en cualquier ventana de un cuarto de segundo es 1.9 dB. Eso no es un paneo. Es una imagen centrada con un poco de anchura natural. El cuchillo viaja a través del encuadre; el sonido se queda quieto.

La anchura proviene del contenido, no de tu redacción. El clip de lluvia en la siguiente sección, donde no solicité ninguna dirección, regresó con una correlación de 0.32 y el canal lateral solo 2.9 dB por debajo del medio. Eso es un campo genuinamente amplio y decorrelacionado. El ambiente difuso obtiene anchura automáticamente. Los impactos discretos se quedan cerca del centro sin importar lo que escribas.

Por lo tanto, la afirmación honesta para este modelo no es espacial. Es temporal. Obtienes un sonido que se generó junto con la imagen y aterriza en el fotograma que le corresponde, gratis, para siempre, sin un editor. Si tu formato realmente necesita un paneo fuerte, aún tienes que hacerlo tú mismo en postproducción, y deberías dejar de escribir nombres de canales en los prompts porque no están haciendo nada.

Ahora vuelve a ejecutar el definitivo: mismo endpoint, mismo primer fotograma, mismo prompt, cambia un campo a resolution: 2K. Una cosa más que vale la pena saber antes de asumir que el borrador es una vista previa.

Comparación de dos resoluciones de video cortando una granada de vidrio

Dos filas de cinco fotogramas que comparan las ejecuciones a 768P y 2K en los mismos momentos, idénticos en el fotograma cero y divergiendo a partir de aproximadamente 2.5 segundos

Mismo primer fotograma, mismo prompt, ambos niveles. El fotograma 0 coincide exactamente. A los 2.5 s, la cáscara se rompe de manera diferente y los dos clips se han convertido en tomas diferentes.

Bloquear el primer fotograma mantiene la composición, el encuadre, la iluminación y el color en ambos niveles, por lo que siempre debes usar imagen a video en lugar de texto a video para esto. No te da la misma toma. La ejecución a 2K vuelve a lanzar la acción. Trata el borrador como una vista previa del aspecto y el sonido, no de la coreografía exacta.

Paso 5: Agrega una Grabación Real como Referencia de Video ASMR con MiniMax H3

Si tienes un sonido que realmente quieres, entrégaselo. reference-to-video acepta hasta 9 imágenes, 3 videos y 3 clips de audio, y extrae el timbre y el carácter de la sala de una referencia de audio en lugar de inventarlos. Usé una grabación de vidrio rompiéndose de dominio público de Gravity Sound de Wikimedia Commons (CC BY 4.0), tres tomas concatenadas a 4.5 segundos.

Tres reglas, y encontré las dos últimas de la manera difícil al tener solicitudes rechazadas:

  • El audio no puede ir solo. El endpoint lo dice explícitamente: se requiere al menos una imagen o video, y el audio por sí solo no está permitido. Combínalo con un fotograma.
  • La referencia de audio debe tener de 2 a 15 segundos. Mi primer intento usó un clip de 1.49 segundos y regresó con audio duration 1486 ms, expected [2000, 15000] ms. Ese rango no está en la página del modelo.
  • Se verifica el formato del archivo. Un payload base64 declarado como audio/mpeg fue rechazado con audio format ".mpeg" not allowed. Un payload .wav pasó. Las solicitudes rechazadas no se facturan, pero te cuestan un viaje de ida y vuelta.

Configuración: refers: [{url: <fotograma base>, type: "image"}, {url: <una grabación de 2 a 15s>, type: "audio"}], resolution: 768P, duration: 5.

plaintext
1Misma toma macro fija: la hoja corta la granada de vidrio de izquierda a derecha
2y las semillas se dispersan. Coincide con el timbre, brillo y carácter de sala del audio
3de referencia, misma distancia de grabación, misma sequedad. ASMR close-mic, sin música, sin voz.

Interfaz del generador de video AI que muestra la entrada de prompt y el video de granada generado

Playground de MiniMax H3 referencia a video en Atlas Cloud con dos materiales de referencia cargados, un archivo de audio en el espacio 1 y el fotograma base en el espacio 2

Materiales de Referencia que llevan el archivo de audio y la imagen juntos, 2 de 9 usados. Elimina la imagen y la solicitud no se ejecutará en absoluto.

mY1VrOfM3cM

La toma guiada por referencia, $0.50. Misma toma, timbre dirigido por una grabación real en lugar de inventado desde el prompt. Referencia de audio: Vidrio rompiéndose por Gravity Sound, CC BY 4.0.

Tres Plantillas de Video ASMR con MiniMax H3: Corte, Masticación, Lluvia

Tres formatos cubren la mayor parte de lo que funciona en esta categoría. Cada uno es un prompt completo de copiar y pegar con configuraciones y el clip que produjo. Deliberadamente no hay vidrio, ni rojo, ni pizarra en ninguna parte a continuación: si cada clip en tu cuenta se ve igual, el algoritmo lo trata como el mismo clip.

Tabla 3: los mismos cinco espacios, tres trabajos diferentes.

EspacioPlantilla 1, El CortePlantilla 2, La MasticaciónPlantilla 3, La Lluvia
Materialpanal de miel goteando, cuchilla de acero calienteroca fundida brillante, cuenco de piedralluvia en el vidrio de la ventana del coche
Forma de la acciónla cuchilla se hunde de adelante hacia atrás, la miel tira hacia abajolos palillos levantan, luego dos mordiscossin acción del sujeto, solo gotitas
Perspectiva del micrófonoclose-mic, muy seco, sin salaextremadamente cercano, íntimofuera del vidrio, cabina amortiguada
Secuencia de sonidocrujido de cera, estiramiento de miel, goteo en el platosiseo fundido, masticación húmeda, crujido vidrioso, exhalacióncama de lluvia constante, impacto de gotitas, silbido lejano de neumáticos
Negativossin música, sin voz, sin reverberación de salasin palabras, sin música, sin narraciónsin música, sin truenos, sin voz, sin limpiaparabrisas

Plantilla 1, El Corte. Panal, ámbar y oro, 9:16, 768P, 6 segundos, ratio: "9:16".

plaintext
1Macro extremo, toma cenital fija de una gruesa losa de panal dorado sobre un plato de
2cerámica pálida, la miel ya acumulándose a su alrededor. Una cuchilla de acero caliente
3desciende sobre la cera y se hunde a través de ella de adelante hacia atrás en una sola
4presión continua y lenta; las caras del corte se hunden y un hilo grueso de miel se
5estira y gotea sobre el plato. Luz cálida de ámbar desde la izquierda, poca profundidad
6de campo, toma única, sin cortes, sin manos en el encuadre.
7
8Audio: ASMR, close-mic, muy seco, sin reverberación de sala, sin música, sin voz, sin narración.
9Un suave crujido de cera partiéndose bajo la cuchilla, luego un tirón bajo y espeso de
10estiramiento mientras la miel se alarga, luego dos gotas húmedas y pesadas cayendo sobre
11el plato de cerámica. Nada más.

ZsVmf9AhPnw

Plantilla 1, $0.60. Crujido de cera, estiramiento de miel, goteo. Generado con minimax/h3/text-to-video.

Plantilla 2, La Masticación. Lava mukbang, el formato que obtuvo 11.3 millones de visitas en una semana, 9:16, 768P, 8 segundos, ratio: "9:16".

plaintext
1Primer plano vertical: un par de palillos de laca negra levanta un montón brillante de
2lava naranja fundida de un cuenco de piedra oscura y lo lleva hacia la cámara, fuera de
3encuadre en la parte inferior. La lava es autoiluminada, arrojando luz naranja sobre todo
4lo que la rodea; el resto de la habitación es casi negro. El vapor se eleva de la superficie.
5Cámara fija, toma única, sin cortes.
6
7Audio: ASMR, extremely close-mic, íntimo, sin palabras, sin música, sin narración, sin tono de sala.
8Un siseo y burbujeo bajo y fundido mientras la lava se levanta, luego una masticación
9húmeda y suave, luego un crujido vidrioso más brillante en el segundo bocado, luego una
10exhalación lenta y satisfecha. Sin habla.

UJhEsTnKkZI

Plantilla 2, $0.80. Siseo, masticación, crujido, exhalación, y ni una sola palabra. Generado con minimax/h3/text-to-video.

Plantilla 3, La Lluvia. Ventana de coche nocturna, azul frío y neón, 16:9, 768P, 10 segundos, ratio: "16:9".

Esta es la única de las tres sin acción del sujeto, y enseña lo más importante sobre los negativos. Sin nada que suceda en pantalla, H3 busca una cama de música a menos que la prohíbas explícitamente. También es el clip que regresó con el campo estéreo con diferencia más amplio, sin que se lo pidieran. El contenido orientado al sueño quiere longitud, por lo que esto se ejecuta cerca del extremo superior del rango de duración útil.

plaintext
1Toma macro a través del interior de la ventana de un coche por la noche, lluvia intensa
2corriendo por el exterior del vidrio. Gotitas individuales golpean, dudan, luego se
3deslizan hacia abajo y se fusionan. Más allá del vidrio, la señalización de neón
4desenfocada se rompe en bokeh azul frío y magenta. Sin limpiaparabrisas, sin personas,
5sin movimiento dentro del coche. Cámara fija, toma continua única, poca profundidad de
6campo, sin cortes.
7
8Audio: ASMR, close-mic en el exterior del vidrio, cabina ligeramente amortiguada.
9Una cama de lluvia constante y uniforme con impactos de gotitas individuales claramente
10separados en el vidrio, más un silbido lejano y tenue de neumáticos sobre una carretera
11mojada. Sin música, sin truenos, sin voz, sin narración, sin ruido de limpiaparabrisas.

bUKr5V6wbdM

Plantilla 3, $1.00. Diez segundos de ambiente puro, sin banda sonora porque el prompt la prohibió. Generado con minimax/h3/text-to-video.

Cuánto Cuesta Realmente un Video ASMR con MiniMax H3

Aquí está el recibo de este artículo, no una estimación.

PartidaCantidadFacturado
GPT Image 2 fotograma base, alta, 2048x11521$0.17
Guardado a 2K, 5s, imagen a video1$0.70
Borrador a 768P, 5s, imagen a video1$0.50
768P referencia a video, 5s1$0.50
Clips de plantilla a 768P, 6s + 8s + 10s3$2.40
Solicitudes de referencia rechazadas2$0.00
Total $4.27

Seis clips publicables y un fotograma base. Escálalo a una programación: un clip vertical de 8 segundos al día a 768P cuesta $0.80, por lo que aproximadamente $24 al mes para una cuenta anónima de publicación diaria, antes de pasar un minuto en un editor.

Dos notas de facturación. El precio listado de GPT Image 2 de $0.009 es un mínimo de nivel de token; un renderizado de alta calidad a 2048x1152 aterriza en $0.1745, casi veinte veces eso, así que presupuesta desde el nivel que realmente usas. Y el campo price de H3 se completa con retraso: consulta hasta que status sea completed y con frecuencia sigue siendo undefined. Vuelve a consultar el ID de predicción un momento después para obtener la cifra real. Esa segunda consulta es la única forma de construir un recibo como este en lugar de una suposición.

Una Nota Honesta Sobre el Audio ASMR y los Derechos

No subas la grabación ASMR de otra persona como archivo de audio refers. La referencia migra genuinamente el timbre a la salida, y ejecutar una grabación a través de un modelo no cambia quién es el propietario. La referencia utilizada aquí es CC BY 4.0 y está acreditada arriba, lo que tomó aproximadamente dos minutos de obtener.

No construyas ASMR en torno a la voz reconocible de una persona real. Cada plantilla en este artículo es deliberadamente sin voz, que es tanto la convención del género como el camino menos complicado.

Llamar a H3 a través de una API no se ve afectado por la licencia comunitaria adjunta a los pesos abiertos. Esa licencia, que cubre el autoalojamiento, actualmente excluye la UE, el Reino Unido, Corea y los EE. UU., y hay un canal de licencias formal abierto para esos territorios. Vale la pena saberlo, no vale la pena preocuparse si estás usando el endpoint.

Video ASMR con MiniMax H3: Preguntas Frecuentes

¿Un video ASMR con MiniMax H3 genera su propio sonido o lo agrego después?

El modelo lo genera. La imagen y el audio salen de la misma pasada: video a 24 fps con una pista AAC estéreo a 32 kHz en el archivo entregado. No hay un paso de audio separado, ni biblioteca de sonidos, ni trabajo de alineación, que es toda la razón por la que este endpoint es interesante para ASMR específicamente.

¿Puedo hacer que un video ASMR con MiniMax H3 haga un paneo de izquierda a derecha?

No pidiéndolo. Escribí direcciones de canal explícitas en el prompt y medí el resultado: correlación de 0.97 entre canales y una diferencia de nivel máxima de 1.9 dB en cualquier ventana de un cuarto de segundo, que no es ningún paneo. La pista es genuinamente estéreo y el contenido difuso como la lluvia regresa con un campo amplio, pero los impactos discretos se mantienen centrados independientemente de la redacción. Si tu formato necesita un paneo fuerte, hazlo en postproducción.

¿Puedo subir mi propia grabación como referencia de video ASMR con MiniMax H3?

Sí, a través de reference-to-video, que acepta hasta 3 referencias de audio junto con hasta 9 imágenes y 3 videos. El audio no se puede enviar solo, así que combínalo con al menos una imagen o video. El audio también debe tener entre 2 y 15 segundos, y el formato se valida: un payload .wav funcionó donde uno audio/mpeg fue rechazado. Las solicitudes rechazadas no se facturan.

¿El audio de un video ASMR con MiniMax H3 a 768P es peor que a 2K?

No. Ambos niveles entregan la misma especificación AAC estéreo a 32 kHz. Solo cambia la imagen, y cambia mucho: 16:9 regresa como 1344x768 a 768P frente a 2560x1440 a 2K. Dado que el juicio creativo en ASMR es un juicio de escucha, borra a $0.10/s y vuelve a ejecutar los guardados a $0.14/s. Solo recuerda que la ejecución a 2K es una nueva toma, no una ampliación del borrador.

¿Cuánto tiempo debe tener un video ASMR con MiniMax H3 y qué relación de aspecto?

La duración acepta cualquier segundo entero de 4 a 15. Los clips de corte y masticación funcionan de 5 a 8 segundos porque la recompensa es un evento; el ambiente orientado al sueño quiere 10 o más. Para Shorts, Reels y TikTok usa 9:16, y recuerda que texto a video requiere que ratio se establezca explícitamente y rechaza adaptive. En imagen a video, el primer fotograma decide la forma por ti.

¿Cuánto cuesta un video ASMR con MiniMax H3?

Un clip de 5 segundos cuesta $0.50 a 768P y $0.70 a 2K. Un clip vertical de 8 segundos a 768P cuesta $0.80. Publicar uno de esos al día es aproximadamente $24 al mes en cómputo, que es el número que vale la pena comparar con los 20 minutos que un editor tomaría por clip en el flujo de trabajo cosido.

¿Por qué mi video ASMR con MiniMax H3 sale con música de fondo que nunca pedí?

Porque no la prohibiste. La mayoría de los videos en los datos de entrenamiento de cualquier modelo tienen una cama de música, por lo que el comportamiento predeterminado es agregar una, especialmente cuando no pasa nada en pantalla. Pon los negativos en la mitad de audio del prompt explícitamente: no music, no voice, no narration, no room reverb, no ambience bed. Las plantillas ambientales necesitan esto más que las de acción.

Modelos recientes

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos