

La API de MiniMax H3 abre el acceso al modelo de video multimodal de propósito general de MiniMax, que procesa texto, imágenes, video y audio como un único contexto en lugar de una tarea a la vez. Los clips duran de 5 a 15 segundos a 24 FPS, con relaciones de aspecto de 21:9 a 9:16, y un solo prompt puede cambiar personajes, reemplazar fondos, reescribir diálogos o clonar una voz a partir de un clip de referencia. Atlas Cloud lo ofrece todo a través de un único endpoint compatible con OpenAI. Empieza a crear hoy mismo.
Atlas Cloud le proporciona los últimos modelos creativos líderes en la industria.
Cada endpoint de la MiniMax H3 API interpreta texto, imágenes, video y audio de forma distinta; revisa las filas siguientes y elige la modalidad que encaje con lo que estás creando.
| Modalidad | Descripción |
|---|---|
| MiniMax H3 T2V API (Text to Video) | Escribe un prompt de hasta 7,000 caracteres y el modelo devuelve un clip de 5 a 15 segundos a 24 FPS en 1440p, con sonido estéreo nativo generado en la misma pasada. La relación de aspecto se define por solicitud entre 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16, por lo que una sola llamada sirve tanto para tráilers cinematográficos como para versiones verticales para redes sociales. |
| MiniMax H3 I2V API (Image to Video) | Una imagen define el fotograma inicial y dos fijan tanto el primero como el último, mientras H3 completa el movimiento entre ellos con la relación de aspecto de la imagen de entrada. Se aceptan fuentes de 256 a 5760 píxeles por lado, lo que facilita poner en movimiento key art, imágenes fijas de producto y fotogramas de storyboard. |
| MiniMax H3 Omni Reference API (Reference to Video) | ¿Necesitas que varias fuentes trabajen juntas? En una sola solicitud caben hasta nueve imágenes, tres clips de video y tres pistas de audio, con un límite de 12 archivos, y todo se interpreta como un único contexto multimodal. Mantén un personaje, un movimiento de cámara o un timbre de voz entre planos, o edita un clip existente sustituyendo sujetos, fondos y líneas habladas. |
Cada clip que devuelve la MiniMax H3 API dura hasta quince segundos a 1440p con sonido estéreo nativo, se crea a partir de cualquier combinación de referencias de texto, imagen, vídeo y voz, y la misma llamada también puede editar personajes, escenas y diálogos dentro de metraje que ya tienes.
Una solicitud a la MiniMax H3 API acepta hasta nueve imágenes de referencia, tres clips de vídeo y tres pistas de audio, con un límite de doce archivos. En lugar de leerlos como espacios separados, el modelo trata el texto, la imagen y el sonido como un único contexto, incorporando en la misma escena un personaje de una foto, un movimiento de cámara de un clip y una atmósfera de una pista. Los equipos con material existente obtienen una vía directa hacia una toma terminada.
Cada resultado se entrega con sonido. El diálogo, el ambiente y la música se producen en estéreo nativo durante la misma pasada en la que se renderiza la imagen a 24 fotogramas por segundo, por lo que no hace falta añadir música ni doblaje después. Como la sincronización se decide mientras se genera la toma, los pasos, el habla y los cortes permanecen ajustados a la acción. Los anuncios cortos y las piezas para redes sociales salen listos para publicar.
¿Necesitas cambiar un gato por un perro, sustituir una pantalla verde o reescribir una línea de diálogo? La MiniMax H3 API aplica ediciones como estas al vídeo que proporcionas, abarcando personajes, objetos, fondos, iluminación y efectos, mientras que las partes que no mencionas se mantienen cerca del original. Los prompts admiten hasta 7000 caracteres, así que se pueden acumular una docena de cambios en una sola pasada. Esto hace que iterar sobre un corte aprobado sea práctico.
Envía una muestra de voz junto con tus imágenes o metraje y el personaje generado hablará con ese timbre. Se permiten hasta tres referencias de audio por solicitud, cada una de entre dos y quince segundos, y el audio siempre debe acompañar a una entrada visual en lugar de enviarse por separado. También se puede reemplazar el diálogo existente y ajustar la interpretación para que encaje. El trabajo en series mantiene una voz reconocible en cada episodio.
Los clips duran de cinco a quince segundos, y el modo 1440p coloca 1440 píxeles en el lado corto entre 16:9 y 9:16, o aproximadamente 3,7 megapíxeles en relaciones más anchas como 2976 por 1248 para 21:9. Se pueden seleccionar seis relaciones, desde la cinematográfica 21:9 hasta la vertical 9:16, y la MiniMax H3 API también puede elegir una por ti. Ese rango cubre un tráiler, un bucle de producto y un drama vertical sin cambiar de modelo.
Si tus archivos fuente vienen directamente de una cámara o de una línea de tiempo de edición, se envían tal cual: vídeo H.264 y H.265, imágenes JPG, PNG, WEBP, HEIC y HEIF, además de audio WAV y MP3. Los límites por archivo son de 50MB para vídeo, 30MB para imágenes y 15MB para audio, mientras que pasar recursos por URL mantiene las solicitudes dentro del límite de cuerpo de 64MB. En Atlas Cloud, todo el conjunto se ejecuta con una única clave compatible con OpenAI y facturación de pago por uso.
Cada clip de este conjunto proviene de un prompt idéntico enviado a la API MiniMax H3 y a otros dos modelos de video alojados en Atlas Cloud, de modo que el movimiento, el sonido y la fidelidad a las instrucciones puedan compararse sin cambiar una sola palabra.
15 segundos, video corto horizontal 16:9. Metraje live-action de una lavandería autoservicio de madrugada, combinado con animación luminosa dibujada a mano en una imagen de técnica mixta. Una pequeña lavandería autoservicio, con sus luces fluorescentes parpadeando débilmente; en el interior hay lavadoras en funcionamiento, cestas de plástico para la ropa y un banco viejo, con un solo calcetín tirado en el suelo. Todo el espacio está en silencio y transmite una atmósfera tenue y nostálgica. Tiene la textura de un video grabado con móvil en mano, con una sola mano, con una sacudida de cámara evidente; la luz fluorescente blanca hace que la exposición fluctúe entre brillante y tenue; las superficies de vidrio muestran reflejos ambientales; hay un retraso de enfoque cuando la lente se acerca a los objetos. La imagen no debe verse tan pulida y ordenada como un anuncio comercial; la sensación general debe ser la de una instantánea documental auténtica, como si hubieras entrado por casualidad a altas horas de la noche y hubieras capturado la toma mientras perseguías alguna visión extraña y onírica.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Perspectiva en primera persona · altura a nivel de los ojos · cámara de juego en mano Escena: La toma simula a un jugador manejando un juego FPS de guerra moderna, con ambas manos sosteniendo un rifle de asalto mientras avanza lentamente por el perímetro exterior de una base militar. El jugador avanza por una carretera junto a zonas de cobertura, con la mira recorriendo el paso que tiene delante; tras una breve pausa, dispara unas cuantas ráfagas hacia un objetivo lejano y luego sigue avanzando, como en el metraje de gameplay en vivo de un jugador común. Iluminación: La luz natural de tonos fríos de una base militar moderna se entrelaza con el humo y el fuego de boca. La imagen es realista y nítida, con el arma metálica y el polvo y la bruma del campo de batalla transmitiendo una calidad de juego AAA. Trabajo de cámara: La cámara tiene un ligero vaivén de mano mientras el jugador se mueve: primero avanza lentamente, luego hace pequeños barridos de izquierda a derecha para observar, con una sutil sacudida de retroceso al disparar, antes de continuar finalmente con un avance firme.
Generated with MiniMax H3 on Atlas Cloud
Generated with Seedance 2.0 on Atlas Cloud
Generated with Wan-2.7 on Atlas Cloud
Desde películas de marca y dramas verticales hasta piezas de producto, visuales de juegos y ediciones precisas de material existente, la MiniMax H3 API cubre cada escenario mediante una única solicitud multimodal que devuelve video con audio estéreo nativo.
Envía fotogramas de storyboard y una lista de planos en una sola llamada para crear tráilers 1440p, spots TVC y campañas de moda a 24 FPS. Cada resultado incluye audio estéreo nativo, para que los equipos de marca revisen cortes terminados.
La salida vertical 9:16 cubre escenas dramáticas con guion, desde misterios de época hasta enfrentamientos familiares, con diálogos generados en la misma pasada. Los estudios que crean bibliotecas de dramas cortos obtienen ganchos de 15 segundos sin contratar actores ni reservar platós.
Si un plano necesita un rostro y un movimiento concretos, hasta nueve imágenes, tres videos y tres clips de audio pueden guiar una sola llamada. La identidad del personaje, el trabajo de cámara y el timbre vocal se mantienen constantes entre episodios.
¿Necesitas hacer un cambio a posteriori? El material existente puede editarse mediante prompt: cambiar un sujeto, sustituir un fondo, ajustar la iluminación o reescribir una línea hablada sin volver a rodar ni un fotograma.
Las fotos de producto se convierten en movimiento: una imagen de referencia se transforma en una presentación de 360 grados, un explicador de funciones o una pieza para social ads. Las relaciones de aspecto de 21:9 a 9:16 permiten que un único conjunto de assets alimente todos los emplazamientos.
La salida estilizada funciona bien para CG de juegos, PV de personajes, openings de anime y demos de interfaz donde los menús, los elementos HUD y las superposiciones de texto deben seguir siendo legibles. Los equipos de arte la usan para validar conceptos antes de la producción.
Compara la MiniMax H3 API con los otros modelos de video alojados en Atlas Cloud y comprueba en qué difieren realmente las modalidades de entrada, los límites de referencia, la duración, la resolución y la salida de audio antes de elegir un endpoint.
| Modelo | Modalidades de entrada | Máx. archivos de referencia | Duración de salida | Resolución máxima | Audio nativo |
|---|---|---|---|---|---|
| MiniMax H3 | Texto, imagen, video, audio | 9 imágenes, 3 videos, 3 clips de audio, 12 archivos en total | De 5s a 15s | 1440p a 24 FPS | √ Audio estéreo nativo en cada salida |
| Seedance 2.0 Reference-to-Video | Texto, imagen, video, audio | 9 imágenes, 3 videos, 3 clips de audio | Hasta 15s | 720p | √ Diálogo estéreo, efectos y música generados en una sola pasada |
| Veo3.1 Reference-to-video | Texto e imagen | 3 imágenes de referencia | 4s, 6s u 8s | 4K solo con duración de 8s | √ Diálogo, ambiente y efectos de sonido alineados con la línea de tiempo |
| Wan-2.7 Reference-to-video | Texto, imagen, video, audio | 5 imágenes o clips de video, más un clip de voz | De 2s a 15s | 1080p | √ Música y efectos generados, o sincronización labial impulsada con tu propio audio |
| Kling v3.0 Pro Image-to-Video | Texto e imagen | - | Hasta 15s | 1080p | √ Diálogo multilingüe con sincronización labial en cinco idiomas |
Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.
Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.
Combina modelos avanzados de MiniMax H3 con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.
Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.
API Unificada:
Una sola integración para acceder a MiniMax H3, GPT, Gemini y DeepSeek.
Precios Transparentes:
Facturación por Token, soporta modo Serverless.
Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.
Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.
Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.
La MiniMax H3 API ofrece a los desarrolladores acceso programático a MiniMax H3, un modelo de video multimodal abierto y de propósito general que trata texto, imágenes, video y audio como un único contexto compartido. En lugar de separar generación, edición y referencias en modelos de tareas independientes, H3 interpreta todo el conjunto de entradas y devuelve un clip finalizado con sonido. En Atlas Cloud se ejecuta detrás de una única API key con precios de pago por uso.
Películas de marca, tráileres, drama corto vertical, anuncios de producto y ecommerce, demos de movimiento para juegos y UI, y animación estilizada están dentro de su alcance. Como el modelo gestiona texto en pantalla, subtítulos y recursos de marca, los equipos también lo usan para validar conceptos, previsualizar storyboards y crear propuestas visuales antes de comprometer presupuesto de producción.
Crea una cuenta de Atlas Cloud, genera una API key y luego envía un prompt junto con los archivos de referencia al endpoint de generación de video y consulta hasta obtener el resultado final. Se recomienda pasar los medios como URLs alojadas en lugar de subidas inline, ya que el cuerpo de la solicitud está limitado a 64MB. Empieza a crear hoy mismo.
La facturación es de pago por uso, por lo que pagas por llamada en lugar de comprar una suscripción o una licencia por puesto. El coste sigue lo que realmente renderizas, lo que significa que la resolución y la duración del clip determinan el total de un lote. Consulta la página del modelo para ver la tarifa actual por generación antes de planificar ejecuciones de gran volumen.
Sí. Cada resultado de H3 se entrega con sonido en estéreo nativo, de modo que diálogos, efectos y ambiente llegan en la misma pasada que la imagen. Si proporcionas un clip de audio de referencia, el modelo puede trasladar ese timbre a un personaje, lo que elimina un paso independiente de síntesis de voz del pipeline.
Los clips van de 5 a 15 segundos a 24 FPS. En modo 1440p, el lado corto se renderiza a 1440 píxeles para relaciones entre 16:9 y 9:16; fuera de ese rango, el fotograma mantiene aproximadamente 3.7M píxeles en total, por ejemplo 2976 por 1248 en 21:9. Las solicitudes de text to video y omni reference aceptan 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16, mientras que las solicitudes de primer y último fotograma heredan la relación de aspecto de la imagen de entrada.
Con un prompt pueden enviarse hasta nueve imágenes, tres segmentos de video y tres clips de audio, con un límite total de doce archivos. Video y audio deben mantenerse dentro de 15 segundos combinados cada uno, y el audio debe acompañar a una imagen o a un video en lugar de enviarse solo. Los prompts llegan a 7000 caracteres, lo que deja espacio para una dirección plano a plano que cubra cámara, actuación y sonido.
Las entradas aceptadas incluyen video H.264 y H.265, imágenes JPG, JPEG, PNG, WEBP, HEIC y HEIF, y audio WAV o MP3, con AAC o MP3 para la pista de audio dentro de un archivo de video. Los límites por archivo son 50MB para video, 30MB para imágenes y 15MB para audio. Como el cuerpo de la solicitud está limitado a 64MB, las URLs alojadas siguen siendo la opción más segura para recursos pesados.
La edición es uno de sus modos principales. Envía un clip de origen con instrucciones y la MiniMax H3 API puede cambiar personajes u objetos, sustituir fondos e iluminación, añadir efectos visuales por capas y reescribir diálogos manteniendo estables las regiones sin modificar. Las instrucciones compuestas se gestionan en una sola solicitud, por lo que varios cambios se aplican juntos en lugar de requerir idas y vueltas repetidas.
La mayoría de los modelos de video toman un prompt más una imagen y devuelven un clip sin sonido. H3, en cambio, consume un conjunto mixto de referencias, interpreta la intención de personaje, movimiento, cámara y sonido en todas ellas, y luego devuelve un clip con audio nativo. Si tu pipeline actualmente combina un modelo de video, un modelo de voz y un editor, H3 condensa esas etapas en una sola llamada.
Guías, tutoriales y novedades de producto para aprovechar al máximo Atlas Cloud.