Una resolución más alta siempre ha significado una factura más alta. MiniMax H3 rompe silenciosamente esa regla. Renderiza directamente a 2K nativo, y el precio por segundo está por debajo de lo que cuesta un clip de 720p en el modelo de video que la mayoría usa primero.
Ese es el titular, pero la resolución y el precio son solo la mitad de lo que hace interesante a MiniMax H3. La otra mitad es cómo funciona: un solo modelo que lee texto, imagen, video y audio juntos y devuelve un clip terminado, imagen y sonido, en una sola pasada. A continuación, lo que hace, lo que cuesta y los prompts exactos que produjeron cada clip de este artículo.
Puntos clave
- MiniMax H3 renderiza 2K nativo (2560x1440) con una banda sonora estéreo sincronizada generada en la misma pasada, no añadida después.
- Precios verificados en la página del modelo (julio de 2026): 2K a $0.14 por segundo, 768p a $0.10 por segundo. A modo de comparación, Seedance 2.0 cuesta aproximadamente $0.24 por segundo a 720p, así que H3 ofrece un fotograma de mayor resolución a un precio unitario más bajo.
- Tres puntos de entrada (texto, imagen y referencia a video) comparten una misma clave de API. La referencia a video acepta hasta nueve imágenes, clips y una pista de audio mezclados como anclas de identidad.
MiniMax H3 funciona en una sola pasada en lugar de tres herramientas
Hacer un clip terminado normalmente implica dividir el trabajo. Generas una imagen en un modelo, cambias a un segundo modelo para el audio, luego abres un editor para alinear los dos. Cada traspaso pierde un poco de la intención original, y la línea de tiempo se acumula rápidamente.
MiniMax H3 colapsa eso. Lee toda la instrucción como un solo contexto: cómo se ve el personaje, cómo se desarrolla el movimiento, cómo se mueve la cámara, la clave emocional y cómo debería sonar el audio; todo entra junto y vuelve como un solo clip. MiniMax enmarca la dirección como un alejamiento de los modelos especializados en tareas hacia una inteligencia multimodal general, y en la práctica significa menos herramientas abiertas a la vez.
Dos cosas merecen ser dichas claramente, porque ambas son fáciles de verificar en el resultado. Primero, los clips llevan sonido real: los archivos de muestra que aparecen a continuación salen con una pista de audio estéreo integrada, no añadida en postproducción. Segundo, la resolución es genuinamente 2K, 2560x1440 a 24 fotogramas por segundo, no un reescalado.
Tres formas de ejecutar MiniMax H3 en Atlas Cloud
MiniMax H3 está disponible en Atlas Cloud con tres puntos de entrada, y todos responden a la misma clave de API. Cada uno tiene un Playground que puedes probar en el navegador antes de escribir una línea de código.
| Punto de entrada | Impulsado por | Entradas | Ideal para |
|---|---|---|---|
| Texto a video | Solo un prompt de texto | Sin material de referencia | Construir una escena desde cero |
| Imagen a video | Un primer fotograma, más un último opcional | Una o dos imágenes fijas | Animar un fotograma fijo que ya tienes |
| Referencia a video | Un prompt de texto más material de referencia | Hasta 9 imágenes, clips de video y una pista de audio mezclados | Mantener un personaje, producto o estilo coherente en todo el clip |
La ruta de referencia a video es la flexible. Trata tus referencias como anclas de identidad, de modo que un personaje, producto o aspecto se mantenga coherente mientras el prompt lo sitúa en nuevas escenas y movimientos. Puedes mezclar imágenes y clips de video, y añadir una pista de audio para sincronizar la acción con un ritmo. Se requiere al menos una imagen o video; el audio solo no está permitido.
Como cada modelo en la plataforma comparte una misma convención de llamada, pasar a H3 desde otro modelo de video es cuestión de cambiar el campo model. La autenticación, el sondeo y la recuperación de resultados se mantienen idénticos, lo cual es el beneficio silencioso de ejecutar modelos de video, imagen, audio y lenguaje detrás de una sola clave y una sola factura.
Lo que cuesta MiniMax H3: 2K, 768p y la comparación con Seedance
MiniMax H3 factura por segundo de video generado, según la resolución. Estas cifras provienen directamente de la página del modelo, verificadas el 31 de julio de 2026.
| Resolución | Costo por segundo | Un clip de 8 segundos |
|---|---|---|
| 2K (2560x1440) | $0.14 | $1.12 |
| 768p | $0.10 | $0.80 |
Aquí está la parte que al principio parece al revés. Un segundo de H3 en 2K nativo cuesta $0.14. En comparación, Seedance 2.0, el otro modelo de video insignia de la plataforma, factura aproximadamente $0.24 por segundo a 720p. Así que H3 te da un fotograma de mayor resolución, a un precio por segundo más bajo, que un clip de menor resolución en Seedance. Resolución sube, precio unitario baja, al mismo tiempo.
Una nota honesta sobre la cifra, para que nadie calcule mal el presupuesto. No hay ninguna promoción detrás del precio de H3. El descuento del 20% que se aplica actualmente en la plataforma es para el modelo de imagen Seedream 5.0 Pro, no para H3, así que $0.14 por segundo en 2K es la tarifa vigente a finales de julio de 2026. El nivel de 768p está listado a $0.10 por segundo; 2K es el nivel activo y utilizable hoy.
El libro de prompts de MiniMax H3: Ejemplos que puedes copiar
Cada clip a continuación fue producido por el prompt impreso junto a él. Copia uno, cambia tus propias referencias y ejecútalo. Cada bloque también muestra las imágenes de referencia que se usaron, en el orden en que el prompt las llama (imagen 1, imagen 2, etc.).
Películas de marca y cine/TV
Los tráileres, los spots de TVC y las películas de textura de marca son el ajuste más directo, porque encajan en un canal de contenido existente con la menor reelaboración.
Entradas de referencia, imagen 1 para ambiente y estilo, imagen 2 para el personaje principal:
Imagen de referencia 1, ambiente y estilo general
Imagen de referencia 2, el personaje principal
Plain1Aspecto cinematográfico realista, luz y sombra de alto contraste, ritmo ajustado. La imagen 1 es la referencia para el ambiente y estilo general. La imagen 2 es la referencia para el personaje principal. Toma 1, plano general ultra amplio. Una enorme puerta circular cósmica casi llena el encuadre; la figura es solo una pequeña silueta frente a ella, de pie baja y ligeramente a la derecha del centro. El suelo está mojado y reflectante; el centro de la puerta es negro absoluto. La cámara se acerca lentamente. Un título principal aparece desde el borde de la oscuridad, primero borroso y luego nítido: "THE STARS WERE LISTENING", extremadamente estrecho, pesado, todo mayúsculas, rojo oscuro mezclado con rojo óxido, con grano ligero y bordes difusos. Audio: pulso de baja frecuencia profundo, temblor metálico lejano, un golpe suave cuando el texto se resuelve. Corte brusco.
Creatividad visual y empaquetado de contenido
Cortos creativos, secuencias de títulos, videos musicales con estado de ánimo y pósteres en movimiento. Aquí es donde más se nota el manejo del modelo de texto en pantalla y ritmo.
Secuencia de títulos de crimen con suspense ligero. Cinco referencias de estilo establecen el aspecto retro-anime, collage de cómic; el modelo mantiene legibles todos los créditos en inglés y ajusta las transiciones a los golpes de batería.
Referencia de estilo
Referencia de estilo
Plain1Genera una secuencia de títulos de apertura de 15 segundos en formato apaisado 16:9 para una película de crimen con suspense ligero. El estilo general sigue el lenguaje visual de estas imágenes: secuencias de títulos de anime japonés retro, siluetas de bordes duros, collage de cómic, pantallas divididas asimétricas, bloques de color geométricos fuertes, créditos en inglés, algunos adornos en katakana japonés, actitud de jazz criminal. El ambiente es 60% suspense, 40% jazz: misterioso, cool, ágil, con sensación de crimen urbano, no terror, no pesado. El movimiento se lee como un collage de motion graphics: los marcos de línea aparecen primero sobre negro, los límites de pantalla dividida se deslizan rápido, los bloques de color y paneles se pegan bloque por bloque; las siluetas de personajes, primeros planos de objetos y créditos en inglés se deslizan, aparecen y se revelan con máscara en secuencia sobre los golpes de batería. Los créditos en inglés deben ser claramente legibles y pueden estar animados. No agregues chino, sin caracteres deformados, sin inglés mal escrito. Cada crédito y rol en inglés aparece exactamente una vez. Mantén las transiciones variadas: máscara circular de vinilo, corte vertical de puerta de coche, una sombra humana larga que barre la pantalla, corte de línea roja, máscara de letra gigante en inglés, recomposición de encuadre con pantalla dividida, corte duro de bloque de color. Todas las transiciones caen sobre los golpes de batería. Sin fundidos suaves. BGM: música de título original de 15 segundos, 60% suspense, 40% jazz, construida a partir de un tono bajo sostenido, cuerdas pizzicato tensas, pulsos de sintetizador fríos, bombo, escobillas de jazz dispersas y frases cortas de saxofón bajo. Los primeros 2 segundos establecen suspense con frecuencias bajas y hi-hat; a los 3 segundos entra un golpe de bombo bajo; a los 6 segundos se une un ritmo de bajo de jazz; a los 10 segundos aparece un riff corto de saxofón; los últimos 2 segundos fijan el encuadre con un acorde tenso más un golpe de batería. No imites ninguna melodía existente.
Cocina de acción real fusionada con animación dibujada a mano. Sin material de referencia, solo texto a video. El prompt se apoya en la textura imperfecta de cámara de teléfono para que no parezca un comercial.
Plain115 segundos, 16:9 apaisado. Metraje de acción real de una pequeña cocina al atardecer fusionado con animación brillante dibujada a mano. La luz del atardecer aún perdura en la ventana; la cocina vivida y pequeña tiene una mesa de madera vieja, una taza medio lavada, una botella de vidrio ligeramente empañada y un paño de cocina colgado. La imagen lleva el ligero temblor de una grabación con smartphone a una mano, la vacilación al enfocar de cerca, la fluctuación de exposición por contraluz y un ruido ligeramente áspero en las sombras. No lo hagas con una composición ordenada como un comercial, debe sentirse como si alguien filmara apresuradamente algo imposible en casa. Sin ojos gigantes, sin bocas partidas, sin colmillos, sin movimientos amenazantes o de salto, sin corte repentino a negro, sin sustos. El sonido usa solo el tono ambiente de la cocina, la fricción del paño de cocina, el leve tintineo de la taza, el goteo del grifo, los pasos del camarógrafo y la respiración tenue, más el tono electrónico suave y los pequeños gritos de la criatura dibujada a mano.
Videoclip de pop oscuro, cyber-grunge. Dos referencias establecen el tratamiento tipográfico y la textura de impresión; el corte se mantiene duro, sin fundidos.
Referencia de tratamiento tipográfico
Referencia de tratamiento tipográfico
Plain1Estilo: pop oscuro / cyber-grunge / videoclip de rap, textura realista de alta moda, textura de revista de cine, alto contraste pero no barato. Referencia general: revistas independientes de finales de los 90 a principios de los 2000, papel de fotocopiadora, escaneos de película, pósteres de música underground y estética de collage de fanzine. La imagen tiene grano grueso, ligera vibración de película, puntos de semitono, rebabas de impresión y desregistro de escaneo. Ritmo de corte rápido, solo cortes duros, sin fundidos y sin transiciones suaves. El estilo y la textura del tratamiento tipográfico siguen las imágenes de referencia.
Póster en movimiento. Una referencia, el póster estático original. El prompt mantiene fijos el diseño y la paleta, y solo anima la entrada del texto.
El póster estático original
Plain1Haz un video de póster en movimiento. Mantén el marco blanco de galería de la imagen original, el marco interior, la paleta rojo-blanco-negro, la sensación de figura 3D y la estructura de diseño sin cambios; a medida que el texto entra, añade un efecto de sonido de entrada de texto ágil.
Experiencia digital y creatividad para juegos
Interfaz de juego, interfaces de producto y demostraciones de interacción. Lo destacable aquí es que H3 sigue un prompt escrito como bloques temporizados.
Recorrido de interfaz de equipo de juego, guiado por segundo. Este es el que vale la pena leer con atención. El prompt está escrito como segmentos temporizados, y el modelo los sigue: estados de menú, clics de cursor, paneles deslizantes, una cuadrícula de armamento, una barra de carga del 0% al 100%, luego el entorno completo cargando alrededor del personaje.
Imagen de referencia 1, el personaje
Imagen de referencia 2, el estilo de la interfaz
Plain1La referencia del personaje es la Imagen 1, la referencia del estilo de la interfaz es la Imagen 2. 2 3[0s-2s] Toma aérea en picado. El personaje se sienta sobre un suelo púrpura brillante muy saturado, haciendo referencia a la Imagen 1, mirando hacia la cámara. Una interfaz de menú de juego se muestra a la derecha: START NEW GAME, CONTINUE (resaltado), SETTINGS, EXIT GAME. El perfil del jugador MINIMAX se muestra en la esquina superior izquierda. El cursor hace clic en "CONTINUE". 4 5[2s-4s] Zoom suave hacia su brazo derecho. Un panel de interfaz se desliza desde la derecha y aparece el panel "RIGHT ARM EQUIPMENT". La selección resalta "PHANTOM GRIP", luego se desliza a "CHRONOS CLAW". Su mano derecha se reconfigura mecánicamente, los dedos se separan, nuevos nudillos tipo garra se encajan en su lugar, los LED cian parpadean más brillantes. 6 7[4s-7s] La cámara gira suavemente hacia su lado izquierdo. Una nueva interfaz se desliza, la cuadrícula "ARMAMENT CUSTOMIZATION", que muestra componentes de mano, antebrazo, codo y brazo superior. La selección recorre rápidamente las partes. Su brazo izquierdo se desmonta segmento por segmento, con cableado expuesto y pistones visibles durante el intercambio. 8 9[7s-8.5s] La cámara retrocede a un plano medio. El botón CONFIRM CONFIG parpadea. Clic. Todos los paneles de la interfaz se contraen hacia adentro y desaparecen. El personaje despliega sus piernas y ahora se sienta relajada con una rodilla levantada. 10 11[8.5s-10s] Aparece una barra de LOADING en la parte inferior, llenándose rápido del 0% al 100%. El entorno púrpura brillante comienza a oscurecerse, las sombras se filtran desde los bordes, una luz dorada cálida se filtra. 12 13[10s-15s] Mientras se levanta, el entorno completo se carga a su alrededor. Un denso barrio marginal cyberpunk se resuelve: neones parpadeantes, calles mojadas que reflejan la luz, multitudes moviéndose, motocicletas zigzagueando, edificios apilados que se extienden hacia rascacielos lejanos. La cámara se estabiliza en tercera persona detrás de ella. Los elementos del HUD aparecen gradualmente, con un minimapa en la esquina superior derecha y un contador de salud y munición en la inferior izquierda. Aparece un marcador de misión. Ella se adentra en la calle.
Demo de interfaz de usuario/experiencia de usuario de página de aterrizaje de producto. Una foto del producto como referencia; el prompt pide una página de aterrizaje dinámica y de alta energía.
La referencia de la foto del producto
Plain1Una página web, diseño de interfaz de página web, movimiento web, el video muestra un desplazamiento suave hacia abajo de la página. Un video demo de interfaz de usuario/experiencia de usuario de página de aterrizaje de producto explosivo y de alta energía al estilo del sitio oficial de Nike, cuyo tema central en exhibición es el producto de la Imagen 1. La página usa tipografía sans-serif grande, inclinada, tosca y poderosa para un diseño llamativo. En el fondo, luz y sombra de movimiento rápido, textura de fibra de carbono oscura o malla transpirable deportiva se entrelazan y cambian. El video muestra un desplazamiento hacia abajo de la página con ritmo ajustado, más interacciones de interfaz como un fuerte aumento de escala visual e inversión de color al pasar el cursor.
Movimiento de interfaz web, prompt mínimo. Prueba de que el estilo detallado y temporizado es opcional; una instrucción corta también funciona.
Imagen de referencia
Plain1Simula un diseño de interfaz web: primero el título en la parte superior se desliza hacia abajo y se vuelve visible, luego la barra de texto debajo se desplaza hacia arriba, y las luces del coche cambian de oscuro a rojo.
Cómo empezar con MiniMax H3
Hay dos formas de acceder, y ninguna lleva mucho tiempo.
Ejecútalo en el Playground. Inicia sesión en Atlas Cloud y abre MiniMax H3 directamente en la página del modelo. Escribe un prompt, elige una resolución y duración, y genera, sin necesidad de código. Es la forma más rápida de ver si el modelo se ajusta a tu toma antes de integrarlo en algo.
O llama a la API en tres pasos.
- Obtén tu clave de API. Abre la consola de Atlas Cloud y crea una clave en la página de Claves de API. Los tres puntos de entrada de H3 comparten la misma clave.
- Lee los campos en la página del modelo. La referencia de parámetros y el código para copiar y pegar están en cada punto de entrada: texto a video, imagen a video y referencia a video. Los tres aceptan entradas diferentes, así que no mezcles sus cuerpos de solicitud.
- Dispara la primera solicitud. Un solo endpoint y una sola convención de llamada llegan a todos los modelos de la plataforma, así que cambiar de otro modelo de video a H3 significa cambiar el campo model al punto de entrada de H3 correspondiente. La autenticación, el sondeo y la recuperación de resultados siguen siendo los mismos.
Más allá de H3, la misma clave llega a modelos de video, imagen, audio y lenguaje que puedes combinar, una sola API y una sola factura, así que construir una pieza terminada no implica transportar activos y facturas entre proveedores.
Preguntas frecuentes
¿Qué es MiniMax H3?
MiniMax H3 es el modelo de generación de video multimodal de MiniMax, disponible en Atlas Cloud a través de tres puntos de entrada: texto a video, imagen a video y referencia a video. Lee texto, imagen, video y audio como un solo contexto y devuelve un clip en 2K terminado con sonido sincronizado en una sola pasada.
¿Cuánto cuesta MiniMax H3?
MiniMax H3 factura por segundo de video. Verificado en la página del modelo en julio de 2026, 2K nativo (2560x1440) cuesta $0.14 por segundo y 768p cuesta $0.10 por segundo. Un clip de 8 segundos en 2K cuesta, por lo tanto, $1.12. No hay descuento promocional en H3 en ese momento.
¿MiniMax H3 genera audio o solo video?
Ambos, juntos. Los clips de muestra salen de MiniMax H3 con una pista de audio estéreo sincronizada generada en la misma pasada que la imagen, en lugar de añadirse en un paso separado. Los prompts pueden dirigir el sonido, describiendo música, efectos de sonido y sincronización junto con los visuales.
¿Cuál es la diferencia entre los tres puntos de entrada de MiniMax H3?
Texto a video funciona solo con un prompt. Imagen a video anima un primer fotograma, con un último fotograma opcional. Referencia a video mantiene un sujeto coherente utilizando hasta nueve materiales de referencia mezclados, imágenes, clips de video y una pista de audio. Los tres comparten una misma clave de API y una misma convención de llamada.
¿Qué resolución y duración de clip admite MiniMax H3?
MiniMax H3 renderiza 2K nativo a 2560x1440 y 24 fotogramas por segundo, con un nivel más económico de 768p en la hoja de precios. Los clips duran aproximadamente de 5 a 15 segundos, y las relaciones de aspecto incluyen adaptable, 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16.






