Ponte los auriculares antes de desplazarte al clip de abajo. En esta categoría, sí importa.
Un cuchillo desciende sobre una granada tallada en vidrio de rubí. La cáscara se parte, un crujido cristalino, y luego unas docenas de semillas de vidrio caen rodando sobre una pizarra mojada. Aquí está la parte que es diferente de casi todos los clips de ASMR con IA que has visto este año: nadie agregó ese sonido. No hubo biblioteca de sonidos, ni editor, ni línea de tiempo. La imagen y el audio salieron de una sola generación, en una sola llamada.
Durante el último año, el ASMR con IA se veía satisfactorio pero sonaba ligeramente mal, y la razón nunca fue lo visual. Era el último paso del proceso. Pegar audio a un clip silencioso ha sido un trabajo manual, hecho a mano, cada vez. La categoría creció tan rápido en torno a esa brecha que surgió una pequeña industria de sitios dedicados a generar ASMR con IA, solo para automatizar el ensamblaje, uno de ellos anunciaba "audio 3D binaural" en la página de inicio. La demanda estaba probada desde hace tiempo. Solo se estaba sirviendo mediante ensamblaje.
Así que ejecuté las cosas correctamente. Un flujo de trabajo reproducible, seis clips, y luego la parte que nadie en esta categoría hace: separé los canales izquierdo y derecho en ffmpeg y los medí. Algo de lo que esperaba resultó ser incorrecto, y eso resultó ser lo más útil del artículo.
Conclusiones clave
- H3 renderiza la imagen a 24 fps y una pista AAC estéreo a 32 kHz en la misma pasada. El audio se genera, no se dobla después.
- El estéreo es genuinamente estéreo, no mono dual disfrazado de estéreo. Pero no se puede indicar un paneo. Pedí un barrido de izquierda a derecha fuerte y obtuve una diferencia de 1.9 dB, que no es nada.
- La amplitud estéreo proviene del contenido, no de la redacción. El clip de lluvia, donde no pedí ninguna dirección, regresó con un campo genuinamente amplio.
- Bloquear el primer fotograma mantiene la toma en todas las resoluciones, pero 768P y 2K siguen siendo dos tomas diferentes. El borrador previsualiza el aspecto y las especificaciones de sonido, no la coreografía exacta.
- Un clip de 5 segundos a 768P cuesta $0.50. El mismo clip a 2K cuesta $0.70. El artículo completo costó $4.27.
Escucha Primero: Un Video ASMR de MiniMax H3, Cortado en una Sola Pasada
w7ZRR7bo3KI
Cinco segundos, 2K, 24 fps, estéreo a 32 kHz, una generación, $0.70. Sonido activado: el chirrido del borde al morder, el crujido, luego las semillas. Nada se agregó después. Generado con minimax/h3/image-to-video.
Un prompt. Un modelo. Una llamada. Todo lo que sigue es cómo se hizo ese clip, cuánto costó y qué partes de la historia de marketing sobreviven al contacto con una forma de onda.
Por Qué el ASMR con IA Explotó, y Por Qué la Mayoría Falla en la Prueba de los Auriculares
La tendencia tiene un cumpleaños. El ASMR con IA comenzó a extenderse en junio de 2025, justo después de que Veo 3 aterrizara, y el formato se volvió viral en días. Un lava mukbang de @asmraiworks superó los 11.3 millones de visitas en una semana; un clip de corte de vidrio hizo 5.3 millones en once días (Know Your Meme, 2025). Los medios lo recogieron como una curiosidad, con imágenes surrealistas y lava fundida comida con palillos haciendo la mayor parte del trabajo pesado (The Express Tribune, 2025).
Luego la gente se puso los auriculares y el estado de ánimo cambió. El escritor de TechRadar vio un montón de los virales y salió describiendo una capa de artificialidad, "carente de los errores e imprecisiones que son el sello distintivo del ASMR hecho por humanos" (TechRadar, junio de 2025). Los fans citados en ese artículo dijeron que los desencadenantes de cosquilleo estaban técnicamente presentes y que seguía sin ser lo mismo.
Hay una razón mecánica, y no es mística. El ASMR es la única categoría de contenido donde el contenido es el sonido. En cualquier otro lugar, el audio es un adorno. Aquí es el producto. Y el flujo de trabajo dominante era:
- generar un clip silencioso con un modelo de video,
- buscar en una biblioteca de sonidos un crujido, un chasquido, una cama de lluvia,
- alinear el sonido con la imagen en un editor,
- panoramizar y mezclar a mano si te importa, lo que casi nadie hace en volumen,
- exportar.
El paso 3 es donde muere. Un crujido enlatado disparado dos fotogramas tarde se lee como falso antes de que puedas explicar por qué. Multiplícalo por una programación de publicación diaria y los errores se acumulan, porque la alineación la está haciendo un humano cada vez.
Esa brecha es la razón por la que existe toda una industria artesanal de sitios generadores de ASMR con IA. Al menos tres se están comercializando activamente y uno lidera con audio 3D binaural como característica principal. No están resolviendo un problema falso. Están parcheando un agujero real: los modelos de video subyacentes no producen sonido.
Lo que hace que valga la pena echar un vistazo a una tabla de clasificación. En el tablero de edición de video de Artificial Analysis, el que se puntúa con audio, MiniMax H3 se sitúa en el #1 con 1,126 Elo, por delante de Gemini Omni Flash con 1,119 y aproximadamente cien puntos por delante de Dreamina Seedance 2.0 con 1,027 (Artificial Analysis, agosto de 2026). En los tableros de imagen a video, donde el audio no es parte de la puntuación, varios de esos modelos se sitúan a un par de puntos el uno del otro. La brecha se abre cuando el sonido cuenta. Para el ASMR, el sonido es lo único que cuenta.
El Flujo de Trabajo del Video ASMR con MiniMax H3, y Cuánto Cuesta Cada Paso
Tres endpoints, una pestaña del navegador. Ejecuté todo en este artículo en Atlas Cloud, por lo que cada cifra a continuación proviene de la factura, no de una tarifa.
| Trabajo en este artículo | Modelo | Tarifa |
|---|---|---|
| Primer fotograma para la muestra | OpenAI GPT Image 2 (texto a imagen) | desde $0.009/imagen, facturado $0.1745 en alta y 2048x1152 |
| Borrador y definitivo | MiniMax H3 Imagen a Video | $0.10/s a 768P, $0.14/s a 2K |
| Alimentar una grabación real | MiniMax H3 Referencia a Video | dos mismos niveles |
| Las tres plantillas | MiniMax H3 Texto a Video | dos mismos niveles |
| La forma antigua, solo mitad audio | ByteDance Seed Audio 1.0 | $0.143/min |
La lista muestra "Desde $0.1/SEG" en los tres endpoints de H3. Ese es el mínimo de 768P. 2K factura a $0.14/s y ese número no aparece en ningún lado excepto en tu factura, así que planifica según el nivel que realmente solicites.
Tabla 1: una pasada versus el pipeline cosido.
| MiniMax H3, audio nativo | Modelo silencioso más audio posterior | |
|---|---|---|
| Pasos para un clip terminado | 1 | 4 a 5 |
| Herramientas involucradas | 1 | modelo de video + biblioteca de sonidos + editor + exportar |
| Cómo se mantienen sincronizados imagen y sonido | misma generación, misma línea de tiempo | arrastras hasta que se vea bien |
| Quién mezcla y panoramiza | nadie, tomas lo que da el modelo | tú, a mano, por sonido |
| Tiempo humano por clip | aproximadamente cero después del prompt | 15 a 40 minutos, honestamente |
| Cómputo por clip de 5s | $0.50 a 768P | modelo de video + $0.143/min de generación de audio |
Deliberadamente no cito la tarifa por segundo de una plataforma de video rival, porque el cómputo no es donde vive la diferencia. La generación de audio cuesta $0.143 por minuto, que son centavos. El costo real del pipeline cosido son 20 minutos de atención humana por clip, y ese costo no disminuye a medida que escalas. Se multiplica. Una cuenta anónima de publicación diaria es exactamente donde 20 minutos por clip se comen silenciosamente todo el modelo de negocio.
El contrapeso honesto: coser a mano te da control. Puedes poner un sonido en cualquier lugar del campo estéreo y recortarlo al fotograma. H3 te da la sincronización gratis y, como muestran las mediciones a continuación, no te devuelve ese control.
Tabla 2: los tres endpoints de H3, los parámetros que realmente importan.
| imagen a video | texto a video | referencia a video | |
|---|---|---|---|
| Entrada principal | imagen (primer fotograma) | solo prompt | refers[] |
| resolución | 768P / 2K, por defecto 2K | mismo | mismo |
| duración | cualquier segundo entero de 4 a 15, por defecto 8 | mismo | mismo |
| ratio | decidido por el primer fotograma | debe establecerse explícitamente, adaptativo es rechazado | decidido por las referencias |
| límites de refers | no se usa junto con imagen | no se usa | hasta 9 imágenes, 3 videos, 3 audio |
| Salida 16:9 entregada | 1344x768 a 768P, 2560x1440 a 2K | mismo | mismo |
| Pista de audio | AAC estéreo 32 kHz sobre video 24 fps | mismo | mismo |
Dos trampas de parámetros que vale la pena escribir en tu mano. El parámetro se llama ratio, no aspect_ratio, y la clave incorrecta lo deja sin establecer, por lo que texto a video rechaza la solicitud. Y image más refers en la misma llamada no da error: se completa, factura por completo y silenciosamente descarta una de las dos entradas.
Tutorial de Video ASMR con MiniMax H3: Cortando una Granada de Vidrio
El corte de frutas de vidrio es el formato que todos reconocen, por lo que el lector sabe instantáneamente lo que está viendo. Sin embargo, las manzanas de vidrio y los mangos de vidrio ya se han hecho hasta el cansancio. Una granada es mejor por una razón específica: cuando la cáscara se parte, cientos de semillas de vidrio se derraman y ruedan, por lo que el sonido tiene duración y estructura en lugar de ser un solo impacto centrado. Si un modelo está falsificando su audio, una dispersión es donde se nota.
Paso 1: Construye el Fotograma Base con GPT Image 2
Bloquea la composición antes de gastar algo en video. Configuración: quality: high, size: 2048x1152 (16:9), output_format: png.
plaintext1Fotografía macro en primer plano extremo de una granada entera tallada completamente en vidrio 2de rubí grueso y translúcido, descansando sobre una losa de pizarra negra mojada. La cáscara de vidrio tiene 8 mm 3de grosor con burbujas internas visibles y facetas astilladas; cientos de diminutas semillas de vidrio brillan 4en su interior como cristales de granate. Un cuchillo santoku japonés pulido yace en el borde 5izquierdo del encuadre, con la punta de la hoja tocando justo la piel de vidrio. Una luz clave dura desde la 6parte superior derecha rasga la losa y arroja cáusticos rojos intensos sobre la piedra mojada. 7Macro de 100 mm, f/2.8, poca profundidad de campo, fondo oscuro y atmosférico. 8Sin manos, sin texto, sin marca de agua, sin logotipo.

Playground de GPT Image 2 en Atlas Cloud con calidad en alta y tamaño 16:9 2048x1152, la granada de vidrio renderizada en el panel de SALIDA
La ejecución real. Calidad high a 2048x1152, y la página cotiza $0.1745, que es lo que la factura dijo después también.

El fotograma base generado: una granada tallada en vidrio de rubí grueso sobre pizarra negra mojada, un cuchillo santoku entrando desde el borde izquierdo
El fotograma entregado a H3. Generado con openai/gpt-image-2/text-to-image.
Paso 2: Escribe la Mitad de Audio del Prompt del Video ASMR con MiniMax H3
La mayoría de la gente escribe un prompt de ASMR como una descripción de imagen con la palabra "ASMR" pegada al frente, y luego se pregunta por qué el modelo lo puntúa con piano lo-fi. H3 se toma en serio las instrucciones de audio si se las das. Estructura la mitad de audio en cinco espacios:
- Material. Qué está haciendo el sonido. Vidrio, cera, roca fundida, agua sobre vidrio. Sé específico sobre el grosor y la humedad, cambian el timbre.
- Acción y su forma en el tiempo. No solo "corta", sino "presiona hacia abajo en una sola carrera continua y lenta". El modelo usa esto para ubicar eventos.
- Perspectiva del micrófono.
close-mic,intimate, señales de distancia de grabación. Esto establece qué tan seco y cercano se siente el sonido, y funciona bien. - Secuencia de onomatopeyas. Deletrea los eventos de sonido en orden: chirrido, luego crujido, luego docenas de pequeños impactos, luego silencio. Este es el espacio que hace más trabajo.
- Negativos.
no music, no voice, no narration, no room reverb, no ambience bed. Sin estos, H3 agregará amablemente una banda sonora, porque la mayoría de los videos en sus datos de entrenamiento tienen una.
También escribí direcciones de canales en el espacio 4, pidiendo que el crujido esté en el canal izquierdo y que las semillas rueden de izquierda a derecha. Sigue leyendo para ver lo que realmente produjo eso.
Paso 3: Ejecuta el Borrador a 768P
Borra a 768P. La pista de audio tiene la misma especificación en ambos niveles, por lo que todo el juicio creativo, que en ASMR es un juicio de escucha, se puede hacer a la tarifa barata.
Configuración en minimax/h3/image-to-video: image = salida del Paso 1, resolution: 768P, duration: 5. El ratio proviene del primer fotograma, así que déjalo en paz.
plaintext1La hoja santoku entra desde la izquierda y presiona hacia abajo a través de la granada de vidrio 2en una sola carrera continua y lenta, viajando de izquierda a derecha a través del encuadre. La cáscara 3se parte con un brillante crujido cristalino y un chorro de diminutas semillas de vidrio cae sobre la 4pizarra mojada, dispersándose hacia el borde derecho. Cámara fija, macro, toma única, sin cortes. 5 6Audio: ASMR, close-mic, íntimo, sin música, sin voz, sin narración, sin reverberación de sala. 7Un chirrido de vidrio seco y sostenido mientras el borde muerde, luego un crujido agudo y fuerte 8panoramizado al canal IZQUIERDO, seguido de docenas de pequeños impactos de semillas tintineando 9rodando desde el canal IZQUIERDO hacia el DERECHO mientras se dispersan. Un leve raspón de hoja 10sobre piedra al final, luego silencio. Sin cama de ambiente, sin zumbido, sin música de fondo.

Playground de MiniMax H3 imagen a video en Atlas Cloud con el fotograma base cargado, duración 5, y un clip completado en el panel de SALIDA
La ejecución de imagen a video: primer fotograma cargado, duración 5, SALIDA completada. Nota que el selector de Resolución está en el valor predeterminado de la página de 2K. Cámbialo a 768P para borradores, que es la resolución a la que se renderizó el clip de abajo.
xkolGEKI7UI
El borrador a 768P, $0.50. Imagen más suave que el clip principal, misma especificación de audio. Esta es la toma sobre la que se toma toda la decisión.
Paso 4: Mide el Estéreo Antes de Confiar en Él
No te fíes de mi palabra sobre el sonido, ni del modelo. Separa los canales y mira. Esto es ffmpeg local, sin llamada API, sin costo:
plaintext1ffmpeg -i 02-glass-pomegranate-768p-draft.mp4 \ 2 -filter_complex "showwavespic=s=1480x240:split_channels=1:colors=#d93a30|#2f7ed8" \ 3 -frames:v 1 stereo-proof.png

Análisis de forma de onda de cuatro paneles que compara el clip de granada de vidrio y el clip de lluvia, mostrando los canales izquierdo y derecho más el canal lateral para cada uno
Canal izquierdo sobre canal derecho para dos clips, más el canal lateral (izquierdo menos derecho) con ganancia igualada debajo. Este es todo el argumento en una imagen.
Esto es lo que regresó, y parte de ello no es lo que esperaba.
El estéreo es real. El canal lateral no está vacío en ningún clip que generé. Un archivo mono dual disfrazado de estéreo no mostraría nada allí. Este tiene contenido.
Pero no puedes indicar un paneo. Pedí, en mayúsculas, que el crujido esté en el canal IZQUIERDO y que las semillas rueden de IZQUIERDA a DERECHA. Medido: correlación de canales 0.97, canal lateral situado 17.7 dB por debajo del medio, y la mayor diferencia de nivel izquierda-derecha en cualquier ventana de un cuarto de segundo es 1.9 dB. Eso no es un paneo. Es una imagen centrada con un poco de anchura natural. El cuchillo viaja a través del encuadre; el sonido se queda quieto.
La anchura proviene del contenido, no de tu redacción. El clip de lluvia en la siguiente sección, donde no solicité ninguna dirección, regresó con una correlación de 0.32 y el canal lateral solo 2.9 dB por debajo del medio. Eso es un campo genuinamente amplio y decorrelacionado. El ambiente difuso obtiene anchura automáticamente. Los impactos discretos se quedan cerca del centro sin importar lo que escribas.
Por lo tanto, la afirmación honesta para este modelo no es espacial. Es temporal. Obtienes un sonido que se generó junto con la imagen y aterriza en el fotograma que le corresponde, gratis, para siempre, sin un editor. Si tu formato realmente necesita un paneo fuerte, aún tienes que hacerlo tú mismo en postproducción, y deberías dejar de escribir nombres de canales en los prompts porque no están haciendo nada.
Ahora vuelve a ejecutar el definitivo: mismo endpoint, mismo primer fotograma, mismo prompt, cambia un campo a resolution: 2K. Una cosa más que vale la pena saber antes de asumir que el borrador es una vista previa.

Dos filas de cinco fotogramas que comparan las ejecuciones a 768P y 2K en los mismos momentos, idénticos en el fotograma cero y divergiendo a partir de aproximadamente 2.5 segundos
Mismo primer fotograma, mismo prompt, ambos niveles. El fotograma 0 coincide exactamente. A los 2.5 s, la cáscara se rompe de manera diferente y los dos clips se han convertido en tomas diferentes.
Bloquear el primer fotograma mantiene la composición, el encuadre, la iluminación y el color en ambos niveles, por lo que siempre debes usar imagen a video en lugar de texto a video para esto. No te da la misma toma. La ejecución a 2K vuelve a lanzar la acción. Trata el borrador como una vista previa del aspecto y el sonido, no de la coreografía exacta.
Paso 5: Agrega una Grabación Real como Referencia de Video ASMR con MiniMax H3
Si tienes un sonido que realmente quieres, entrégaselo. reference-to-video acepta hasta 9 imágenes, 3 videos y 3 clips de audio, y extrae el timbre y el carácter de la sala de una referencia de audio en lugar de inventarlos. Usé una grabación de vidrio rompiéndose de dominio público de Gravity Sound de Wikimedia Commons (CC BY 4.0), tres tomas concatenadas a 4.5 segundos.
Tres reglas, y encontré las dos últimas de la manera difícil al tener solicitudes rechazadas:
- El audio no puede ir solo. El endpoint lo dice explícitamente: se requiere al menos una imagen o video, y el audio por sí solo no está permitido. Combínalo con un fotograma.
- La referencia de audio debe tener de 2 a 15 segundos. Mi primer intento usó un clip de 1.49 segundos y regresó con
audio duration 1486 ms, expected [2000, 15000] ms. Ese rango no está en la página del modelo. - Se verifica el formato del archivo. Un payload base64 declarado como
audio/mpegfue rechazado conaudio format ".mpeg" not allowed. Un payload.wavpasó. Las solicitudes rechazadas no se facturan, pero te cuestan un viaje de ida y vuelta.
Configuración: refers: [{url: <fotograma base>, type: "image"}, {url: <una grabación de 2 a 15s>, type: "audio"}], resolution: 768P, duration: 5.
plaintext1Misma toma macro fija: la hoja corta la granada de vidrio de izquierda a derecha 2y las semillas se dispersan. Coincide con el timbre, brillo y carácter de sala del audio 3de referencia, misma distancia de grabación, misma sequedad. ASMR close-mic, sin música, sin voz.

Playground de MiniMax H3 referencia a video en Atlas Cloud con dos materiales de referencia cargados, un archivo de audio en el espacio 1 y el fotograma base en el espacio 2
Materiales de Referencia que llevan el archivo de audio y la imagen juntos, 2 de 9 usados. Elimina la imagen y la solicitud no se ejecutará en absoluto.
mY1VrOfM3cM
La toma guiada por referencia, $0.50. Misma toma, timbre dirigido por una grabación real en lugar de inventado desde el prompt. Referencia de audio: Vidrio rompiéndose por Gravity Sound, CC BY 4.0.
Tres Plantillas de Video ASMR con MiniMax H3: Corte, Masticación, Lluvia
Tres formatos cubren la mayor parte de lo que funciona en esta categoría. Cada uno es un prompt completo de copiar y pegar con configuraciones y el clip que produjo. Deliberadamente no hay vidrio, ni rojo, ni pizarra en ninguna parte a continuación: si cada clip en tu cuenta se ve igual, el algoritmo lo trata como el mismo clip.
Tabla 3: los mismos cinco espacios, tres trabajos diferentes.
| Espacio | Plantilla 1, El Corte | Plantilla 2, La Masticación | Plantilla 3, La Lluvia |
|---|---|---|---|
| Material | panal de miel goteando, cuchilla de acero caliente | roca fundida brillante, cuenco de piedra | lluvia en el vidrio de la ventana del coche |
| Forma de la acción | la cuchilla se hunde de adelante hacia atrás, la miel tira hacia abajo | los palillos levantan, luego dos mordiscos | sin acción del sujeto, solo gotitas |
| Perspectiva del micrófono | close-mic, muy seco, sin sala | extremadamente cercano, íntimo | fuera del vidrio, cabina amortiguada |
| Secuencia de sonido | crujido de cera, estiramiento de miel, goteo en el plato | siseo fundido, masticación húmeda, crujido vidrioso, exhalación | cama de lluvia constante, impacto de gotitas, silbido lejano de neumáticos |
| Negativos | sin música, sin voz, sin reverberación de sala | sin palabras, sin música, sin narración | sin música, sin truenos, sin voz, sin limpiaparabrisas |
Plantilla 1, El Corte. Panal, ámbar y oro, 9:16, 768P, 6 segundos, ratio: "9:16".
plaintext1Macro extremo, toma cenital fija de una gruesa losa de panal dorado sobre un plato de 2cerámica pálida, la miel ya acumulándose a su alrededor. Una cuchilla de acero caliente 3desciende sobre la cera y se hunde a través de ella de adelante hacia atrás en una sola 4presión continua y lenta; las caras del corte se hunden y un hilo grueso de miel se 5estira y gotea sobre el plato. Luz cálida de ámbar desde la izquierda, poca profundidad 6de campo, toma única, sin cortes, sin manos en el encuadre. 7 8Audio: ASMR, close-mic, muy seco, sin reverberación de sala, sin música, sin voz, sin narración. 9Un suave crujido de cera partiéndose bajo la cuchilla, luego un tirón bajo y espeso de 10estiramiento mientras la miel se alarga, luego dos gotas húmedas y pesadas cayendo sobre 11el plato de cerámica. Nada más.
ZsVmf9AhPnw
Plantilla 1, $0.60. Crujido de cera, estiramiento de miel, goteo. Generado con minimax/h3/text-to-video.
Plantilla 2, La Masticación. Lava mukbang, el formato que obtuvo 11.3 millones de visitas en una semana, 9:16, 768P, 8 segundos, ratio: "9:16".
plaintext1Primer plano vertical: un par de palillos de laca negra levanta un montón brillante de 2lava naranja fundida de un cuenco de piedra oscura y lo lleva hacia la cámara, fuera de 3encuadre en la parte inferior. La lava es autoiluminada, arrojando luz naranja sobre todo 4lo que la rodea; el resto de la habitación es casi negro. El vapor se eleva de la superficie. 5Cámara fija, toma única, sin cortes. 6 7Audio: ASMR, extremely close-mic, íntimo, sin palabras, sin música, sin narración, sin tono de sala. 8Un siseo y burbujeo bajo y fundido mientras la lava se levanta, luego una masticación 9húmeda y suave, luego un crujido vidrioso más brillante en el segundo bocado, luego una 10exhalación lenta y satisfecha. Sin habla.
UJhEsTnKkZI
Plantilla 2, $0.80. Siseo, masticación, crujido, exhalación, y ni una sola palabra. Generado con minimax/h3/text-to-video.
Plantilla 3, La Lluvia. Ventana de coche nocturna, azul frío y neón, 16:9, 768P, 10 segundos, ratio: "16:9".
Esta es la única de las tres sin acción del sujeto, y enseña lo más importante sobre los negativos. Sin nada que suceda en pantalla, H3 busca una cama de música a menos que la prohíbas explícitamente. También es el clip que regresó con el campo estéreo con diferencia más amplio, sin que se lo pidieran. El contenido orientado al sueño quiere longitud, por lo que esto se ejecuta cerca del extremo superior del rango de duración útil.
plaintext1Toma macro a través del interior de la ventana de un coche por la noche, lluvia intensa 2corriendo por el exterior del vidrio. Gotitas individuales golpean, dudan, luego se 3deslizan hacia abajo y se fusionan. Más allá del vidrio, la señalización de neón 4desenfocada se rompe en bokeh azul frío y magenta. Sin limpiaparabrisas, sin personas, 5sin movimiento dentro del coche. Cámara fija, toma continua única, poca profundidad de 6campo, sin cortes. 7 8Audio: ASMR, close-mic en el exterior del vidrio, cabina ligeramente amortiguada. 9Una cama de lluvia constante y uniforme con impactos de gotitas individuales claramente 10separados en el vidrio, más un silbido lejano y tenue de neumáticos sobre una carretera 11mojada. Sin música, sin truenos, sin voz, sin narración, sin ruido de limpiaparabrisas.
bUKr5V6wbdM
Plantilla 3, $1.00. Diez segundos de ambiente puro, sin banda sonora porque el prompt la prohibió. Generado con minimax/h3/text-to-video.
Cuánto Cuesta Realmente un Video ASMR con MiniMax H3
Aquí está el recibo de este artículo, no una estimación.
| Partida | Cantidad | Facturado |
|---|---|---|
| GPT Image 2 fotograma base, alta, 2048x1152 | 1 | $0.17 |
| Guardado a 2K, 5s, imagen a video | 1 | $0.70 |
| Borrador a 768P, 5s, imagen a video | 1 | $0.50 |
| 768P referencia a video, 5s | 1 | $0.50 |
| Clips de plantilla a 768P, 6s + 8s + 10s | 3 | $2.40 |
| Solicitudes de referencia rechazadas | 2 | $0.00 |
| Total | $4.27 |
Seis clips publicables y un fotograma base. Escálalo a una programación: un clip vertical de 8 segundos al día a 768P cuesta $0.80, por lo que aproximadamente $24 al mes para una cuenta anónima de publicación diaria, antes de pasar un minuto en un editor.
Dos notas de facturación. El precio listado de GPT Image 2 de $0.009 es un mínimo de nivel de token; un renderizado de alta calidad a 2048x1152 aterriza en $0.1745, casi veinte veces eso, así que presupuesta desde el nivel que realmente usas. Y el campo price de H3 se completa con retraso: consulta hasta que status sea completed y con frecuencia sigue siendo undefined. Vuelve a consultar el ID de predicción un momento después para obtener la cifra real. Esa segunda consulta es la única forma de construir un recibo como este en lugar de una suposición.
Una Nota Honesta Sobre el Audio ASMR y los Derechos
No subas la grabación ASMR de otra persona como archivo de audio refers. La referencia migra genuinamente el timbre a la salida, y ejecutar una grabación a través de un modelo no cambia quién es el propietario. La referencia utilizada aquí es CC BY 4.0 y está acreditada arriba, lo que tomó aproximadamente dos minutos de obtener.
No construyas ASMR en torno a la voz reconocible de una persona real. Cada plantilla en este artículo es deliberadamente sin voz, que es tanto la convención del género como el camino menos complicado.
Llamar a H3 a través de una API no se ve afectado por la licencia comunitaria adjunta a los pesos abiertos. Esa licencia, que cubre el autoalojamiento, actualmente excluye la UE, el Reino Unido, Corea y los EE. UU., y hay un canal de licencias formal abierto para esos territorios. Vale la pena saberlo, no vale la pena preocuparse si estás usando el endpoint.
Video ASMR con MiniMax H3: Preguntas Frecuentes
¿Un video ASMR con MiniMax H3 genera su propio sonido o lo agrego después?
El modelo lo genera. La imagen y el audio salen de la misma pasada: video a 24 fps con una pista AAC estéreo a 32 kHz en el archivo entregado. No hay un paso de audio separado, ni biblioteca de sonidos, ni trabajo de alineación, que es toda la razón por la que este endpoint es interesante para ASMR específicamente.
¿Puedo hacer que un video ASMR con MiniMax H3 haga un paneo de izquierda a derecha?
No pidiéndolo. Escribí direcciones de canal explícitas en el prompt y medí el resultado: correlación de 0.97 entre canales y una diferencia de nivel máxima de 1.9 dB en cualquier ventana de un cuarto de segundo, que no es ningún paneo. La pista es genuinamente estéreo y el contenido difuso como la lluvia regresa con un campo amplio, pero los impactos discretos se mantienen centrados independientemente de la redacción. Si tu formato necesita un paneo fuerte, hazlo en postproducción.
¿Puedo subir mi propia grabación como referencia de video ASMR con MiniMax H3?
Sí, a través de reference-to-video, que acepta hasta 3 referencias de audio junto con hasta 9 imágenes y 3 videos. El audio no se puede enviar solo, así que combínalo con al menos una imagen o video. El audio también debe tener entre 2 y 15 segundos, y el formato se valida: un payload .wav funcionó donde uno audio/mpeg fue rechazado. Las solicitudes rechazadas no se facturan.
¿El audio de un video ASMR con MiniMax H3 a 768P es peor que a 2K?
No. Ambos niveles entregan la misma especificación AAC estéreo a 32 kHz. Solo cambia la imagen, y cambia mucho: 16:9 regresa como 1344x768 a 768P frente a 2560x1440 a 2K. Dado que el juicio creativo en ASMR es un juicio de escucha, borra a $0.10/s y vuelve a ejecutar los guardados a $0.14/s. Solo recuerda que la ejecución a 2K es una nueva toma, no una ampliación del borrador.
¿Cuánto tiempo debe tener un video ASMR con MiniMax H3 y qué relación de aspecto?
La duración acepta cualquier segundo entero de 4 a 15. Los clips de corte y masticación funcionan de 5 a 8 segundos porque la recompensa es un evento; el ambiente orientado al sueño quiere 10 o más. Para Shorts, Reels y TikTok usa 9:16, y recuerda que texto a video requiere que ratio se establezca explícitamente y rechaza adaptive. En imagen a video, el primer fotograma decide la forma por ti.
¿Cuánto cuesta un video ASMR con MiniMax H3?
Un clip de 5 segundos cuesta $0.50 a 768P y $0.70 a 2K. Un clip vertical de 8 segundos a 768P cuesta $0.80. Publicar uno de esos al día es aproximadamente $24 al mes en cómputo, que es el número que vale la pena comparar con los 20 minutos que un editor tomaría por clip en el flujo de trabajo cosido.
¿Por qué mi video ASMR con MiniMax H3 sale con música de fondo que nunca pedí?
Porque no la prohibiste. La mayoría de los videos en los datos de entrenamiento de cualquier modelo tienen una cama de música, por lo que el comportamiento predeterminado es agregar una, especialmente cuando no pasa nada en pantalla. Pon los negativos en la mitad de audio del prompt explícitamente: no music, no voice, no narration, no room reverb, no ambience bed. Las plantillas ambientales necesitan esto más que las de acción.






