¡SOLO DOS SEMANAS! | ¡20% DE DESCUENTO en Seedream 5.0 Pro!
Hero background 1Hero background 2

MiniMax H3 API for Video Generation and Editing

La API de MiniMax H3 abre el acceso al modelo de video multimodal de propósito general de MiniMax, que procesa texto, imágenes, video y audio como un único contexto en lugar de una tarea a la vez. Los clips duran de 5 a 15 segundos a 24 FPS, con relaciones de aspecto de 21:9 a 9:16, y un solo prompt puede cambiar personajes, reemplazar fondos, reescribir diálogos o clonar una voz a partir de un clip de referencia. Atlas Cloud lo ofrece todo a través de un único endpoint compatible con OpenAI. Empieza a crear hoy mismo.

Explorar Modelos Líderes

Atlas Cloud le proporciona los últimos modelos creativos líderes en la industria.

De texto a nueve referencias: modalidades de la MiniMax H3 API

Cada endpoint de la MiniMax H3 API interpreta texto, imágenes, video y audio de forma distinta; revisa las filas siguientes y elige la modalidad que encaje con lo que estás creando.

ModalidadDescripción
MiniMax H3 T2V API (Text to Video)Escribe un prompt de hasta 7,000 caracteres y el modelo devuelve un clip de 5 a 15 segundos a 24 FPS en 1440p, con sonido estéreo nativo generado en la misma pasada. La relación de aspecto se define por solicitud entre 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16, por lo que una sola llamada sirve tanto para tráilers cinematográficos como para versiones verticales para redes sociales.
MiniMax H3 I2V API (Image to Video)Una imagen define el fotograma inicial y dos fijan tanto el primero como el último, mientras H3 completa el movimiento entre ellos con la relación de aspecto de la imagen de entrada. Se aceptan fuentes de 256 a 5760 píxeles por lado, lo que facilita poner en movimiento key art, imágenes fijas de producto y fotogramas de storyboard.
MiniMax H3 Omni Reference API (Reference to Video)¿Necesitas que varias fuentes trabajen juntas? En una sola solicitud caben hasta nueve imágenes, tres clips de video y tres pistas de audio, con un límite de 12 archivos, y todo se interpreta como un único contexto multimodal. Mantén un personaje, un movimiento de cámara o un timbre de voz entre planos, o edita un clip existente sustituyendo sujetos, fondos y líneas habladas.

Vista, sonido y edición en una sola llamada a la MiniMax H3 API

Cada clip que devuelve la MiniMax H3 API dura hasta quince segundos a 1440p con sonido estéreo nativo, se crea a partir de cualquier combinación de referencias de texto, imagen, vídeo y voz, y la misma llamada también puede editar personajes, escenas y diálogos dentro de metraje que ya tienes.

Doce archivos de referencia, una sola llamada a la MiniMax H3 API

Una solicitud a la MiniMax H3 API acepta hasta nueve imágenes de referencia, tres clips de vídeo y tres pistas de audio, con un límite de doce archivos. En lugar de leerlos como espacios separados, el modelo trata el texto, la imagen y el sonido como un único contexto, incorporando en la misma escena un personaje de una foto, un movimiento de cámara de un clip y una atmósfera de una pista. Los equipos con material existente obtienen una vía directa hacia una toma terminada.

Sonido estéreo nativo en cada clip

Cada resultado se entrega con sonido. El diálogo, el ambiente y la música se producen en estéreo nativo durante la misma pasada en la que se renderiza la imagen a 24 fotogramas por segundo, por lo que no hace falta añadir música ni doblaje después. Como la sincronización se decide mientras se genera la toma, los pasos, el habla y los cortes permanecen ajustados a la acción. Los anuncios cortos y las piezas para redes sociales salen listos para publicar.

Ediciones a nivel de prompt mediante la MiniMax H3 API

¿Necesitas cambiar un gato por un perro, sustituir una pantalla verde o reescribir una línea de diálogo? La MiniMax H3 API aplica ediciones como estas al vídeo que proporcionas, abarcando personajes, objetos, fondos, iluminación y efectos, mientras que las partes que no mencionas se mantienen cerca del original. Los prompts admiten hasta 7000 caracteres, así que se pueden acumular una docena de cambios en una sola pasada. Esto hace que iterar sobre un corte aprobado sea práctico.

Transferencia de timbre de voz y sustitución de diálogos

Envía una muestra de voz junto con tus imágenes o metraje y el personaje generado hablará con ese timbre. Se permiten hasta tres referencias de audio por solicitud, cada una de entre dos y quince segundos, y el audio siempre debe acompañar a una entrada visual en lugar de enviarse por separado. También se puede reemplazar el diálogo existente y ajustar la interpretación para que encaje. El trabajo en series mantiene una voz reconocible en cada episodio.

1440p y seis relaciones de aspecto en la MiniMax H3 API

Los clips duran de cinco a quince segundos, y el modo 1440p coloca 1440 píxeles en el lado corto entre 16:9 y 9:16, o aproximadamente 3,7 megapíxeles en relaciones más anchas como 2976 por 1248 para 21:9. Se pueden seleccionar seis relaciones, desde la cinematográfica 21:9 hasta la vertical 9:16, y la MiniMax H3 API también puede elegir una por ti. Ese rango cubre un tráiler, un bucle de producto y un drama vertical sin cambiar de modelo.

Formatos de producción de entrada, sin paso de conversión

Si tus archivos fuente vienen directamente de una cámara o de una línea de tiempo de edición, se envían tal cual: vídeo H.264 y H.265, imágenes JPG, PNG, WEBP, HEIC y HEIF, además de audio WAV y MP3. Los límites por archivo son de 50MB para vídeo, 30MB para imágenes y 15MB para audio, mientras que pasar recursos por URL mantiene las solicitudes dentro del límite de cuerpo de 64MB. En Atlas Cloud, todo el conjunto se ejecuta con una única clave compatible con OpenAI y facturación de pago por uso.

Mismo prompt, tres motores: comparativa directa de la API MiniMax H3

Cada clip de este conjunto proviene de un prompt idéntico enviado a la API MiniMax H3 y a otros dos modelos de video alojados en Atlas Cloud, de modo que el movimiento, el sonido y la fidelidad a las instrucciones puedan compararse sin cambiar una sola palabra.

Prompt

15 segundos, video corto horizontal 16:9. Metraje live-action de una lavandería autoservicio de madrugada, combinado con animación luminosa dibujada a mano en una imagen de técnica mixta. Una pequeña lavandería autoservicio, con sus luces fluorescentes parpadeando débilmente; en el interior hay lavadoras en funcionamiento, cestas de plástico para la ropa y un banco viejo, con un solo calcetín tirado en el suelo. Todo el espacio está en silencio y transmite una atmósfera tenue y nostálgica. Tiene la textura de un video grabado con móvil en mano, con una sola mano, con una sacudida de cámara evidente; la luz fluorescente blanca hace que la exposición fluctúe entre brillante y tenue; las superficies de vidrio muestran reflejos ambientales; hay un retraso de enfoque cuando la lente se acerca a los objetos. La imagen no debe verse tan pulida y ordenada como un anuncio comercial; la sensación general debe ser la de una instantánea documental auténtica, como si hubieras entrado por casualidad a altas horas de la noche y hubieras capturado la toma mientras perseguías alguna visión extraña y onírica.

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

Prompt

Perspectiva en primera persona · altura a nivel de los ojos · cámara de juego en mano Escena: La toma simula a un jugador manejando un juego FPS de guerra moderna, con ambas manos sosteniendo un rifle de asalto mientras avanza lentamente por el perímetro exterior de una base militar. El jugador avanza por una carretera junto a zonas de cobertura, con la mira recorriendo el paso que tiene delante; tras una breve pausa, dispara unas cuantas ráfagas hacia un objetivo lejano y luego sigue avanzando, como en el metraje de gameplay en vivo de un jugador común. Iluminación: La luz natural de tonos fríos de una base militar moderna se entrelaza con el humo y el fuego de boca. La imagen es realista y nítida, con el arma metálica y el polvo y la bruma del campo de batalla transmitiendo una calidad de juego AAA. Trabajo de cámara: La cámara tiene un ligero vaivén de mano mientras el jugador se mueve: primero avanza lentamente, luego hace pequeños barridos de izquierda a derecha para observar, con una sutil sacudida de retroceso al disparar, antes de continuar finalmente con un avance firme.

Generated with MiniMax H3 on Atlas Cloud

Generated with Seedance 2.0 on Atlas Cloud

Generated with Wan-2.7 on Atlas Cloud

Dónde encaja la MiniMax H3 API en producción

Desde películas de marca y dramas verticales hasta piezas de producto, visuales de juegos y ediciones precisas de material existente, la MiniMax H3 API cubre cada escenario mediante una única solicitud multimodal que devuelve video con audio estéreo nativo.

Películas de marca cinematográficas con la MiniMax H3 API

Envía fotogramas de storyboard y una lista de planos en una sola llamada para crear tráilers 1440p, spots TVC y campañas de moda a 24 FPS. Cada resultado incluye audio estéreo nativo, para que los equipos de marca revisen cortes terminados.

Producción de dramas cortos verticales

La salida vertical 9:16 cubre escenas dramáticas con guion, desde misterios de época hasta enfrentamientos familiares, con diálogos generados en la misma pasada. Los estudios que crean bibliotecas de dramas cortos obtienen ganchos de 15 segundos sin contratar actores ni reservar platós.

Ensamblaje de planos con múltiples referencias

Si un plano necesita un rostro y un movimiento concretos, hasta nueve imágenes, tres videos y tres clips de audio pueden guiar una sola llamada. La identidad del personaje, el trabajo de cámara y el timbre vocal se mantienen constantes entre episodios.

Edición de material existente con la MiniMax H3 API

¿Necesitas hacer un cambio a posteriori? El material existente puede editarse mediante prompt: cambiar un sujeto, sustituir un fondo, ajustar la iluminación o reescribir una línea hablada sin volver a rodar ni un fotograma.

Marketing de producto y e-commerce

Las fotos de producto se convierten en movimiento: una imagen de referencia se transforma en una presentación de 360 grados, un explicador de funciones o una pieza para social ads. Las relaciones de aspecto de 21:9 a 9:16 permiten que un único conjunto de assets alimente todos los emplazamientos.

MiniMax H3 API para visuales de juegos y anime

La salida estilizada funciona bien para CG de juegos, PV de personajes, openings de anime y demos de interfaz donde los menús, los elementos HUD y las superposiciones de texto deben seguir siendo legibles. Los equipos de arte la usan para validar conceptos antes de la producción.

MiniMax H3 API comparada con otros modelos de video multimodal

Compara la MiniMax H3 API con los otros modelos de video alojados en Atlas Cloud y comprueba en qué difieren realmente las modalidades de entrada, los límites de referencia, la duración, la resolución y la salida de audio antes de elegir un endpoint.

ModeloModalidades de entradaMáx. archivos de referenciaDuración de salidaResolución máximaAudio nativo
MiniMax H3Texto, imagen, video, audio9 imágenes, 3 videos, 3 clips de audio, 12 archivos en totalDe 5s a 15s1440p a 24 FPS√ Audio estéreo nativo en cada salida
Seedance 2.0 Reference-to-VideoTexto, imagen, video, audio9 imágenes, 3 videos, 3 clips de audioHasta 15s720p√ Diálogo estéreo, efectos y música generados en una sola pasada
Veo3.1 Reference-to-videoTexto e imagen3 imágenes de referencia4s, 6s u 8s4K solo con duración de 8s√ Diálogo, ambiente y efectos de sonido alineados con la línea de tiempo
Wan-2.7 Reference-to-videoTexto, imagen, video, audio5 imágenes o clips de video, más un clip de vozDe 2s a 15s1080p√ Música y efectos generados, o sincronización labial impulsada con tu propio audio
Kling v3.0 Pro Image-to-VideoTexto e imagen-Hasta 15s1080p√ Diálogo multilingüe con sincronización labial en cinco idiomas

Cómo usar MiniMax H3 en Atlas Cloud

Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.

Crea una cuenta en Atlas Cloud

Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.

Por Qué Usar MiniMax H3 en Atlas Cloud

Combina modelos avanzados de MiniMax H3 con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.

Rendimiento y Flexibilidad

Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.

API Unificada:
Una sola integración para acceder a MiniMax H3, GPT, Gemini y DeepSeek.

Precios Transparentes:
Facturación por Token, soporta modo Serverless.

Empresa y Escala

Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.

Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.

Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.

MiniMax H3 API: Respuestas para desarrolladores

La MiniMax H3 API ofrece a los desarrolladores acceso programático a MiniMax H3, un modelo de video multimodal abierto y de propósito general que trata texto, imágenes, video y audio como un único contexto compartido. En lugar de separar generación, edición y referencias en modelos de tareas independientes, H3 interpreta todo el conjunto de entradas y devuelve un clip finalizado con sonido. En Atlas Cloud se ejecuta detrás de una única API key con precios de pago por uso.

Películas de marca, tráileres, drama corto vertical, anuncios de producto y ecommerce, demos de movimiento para juegos y UI, y animación estilizada están dentro de su alcance. Como el modelo gestiona texto en pantalla, subtítulos y recursos de marca, los equipos también lo usan para validar conceptos, previsualizar storyboards y crear propuestas visuales antes de comprometer presupuesto de producción.

Crea una cuenta de Atlas Cloud, genera una API key y luego envía un prompt junto con los archivos de referencia al endpoint de generación de video y consulta hasta obtener el resultado final. Se recomienda pasar los medios como URLs alojadas en lugar de subidas inline, ya que el cuerpo de la solicitud está limitado a 64MB. Empieza a crear hoy mismo.

La facturación es de pago por uso, por lo que pagas por llamada en lugar de comprar una suscripción o una licencia por puesto. El coste sigue lo que realmente renderizas, lo que significa que la resolución y la duración del clip determinan el total de un lote. Consulta la página del modelo para ver la tarifa actual por generación antes de planificar ejecuciones de gran volumen.

Sí. Cada resultado de H3 se entrega con sonido en estéreo nativo, de modo que diálogos, efectos y ambiente llegan en la misma pasada que la imagen. Si proporcionas un clip de audio de referencia, el modelo puede trasladar ese timbre a un personaje, lo que elimina un paso independiente de síntesis de voz del pipeline.

Los clips van de 5 a 15 segundos a 24 FPS. En modo 1440p, el lado corto se renderiza a 1440 píxeles para relaciones entre 16:9 y 9:16; fuera de ese rango, el fotograma mantiene aproximadamente 3.7M píxeles en total, por ejemplo 2976 por 1248 en 21:9. Las solicitudes de text to video y omni reference aceptan 21:9, 16:9, 4:3, 1:1, 3:4 y 9:16, mientras que las solicitudes de primer y último fotograma heredan la relación de aspecto de la imagen de entrada.

Con un prompt pueden enviarse hasta nueve imágenes, tres segmentos de video y tres clips de audio, con un límite total de doce archivos. Video y audio deben mantenerse dentro de 15 segundos combinados cada uno, y el audio debe acompañar a una imagen o a un video en lugar de enviarse solo. Los prompts llegan a 7000 caracteres, lo que deja espacio para una dirección plano a plano que cubra cámara, actuación y sonido.

Las entradas aceptadas incluyen video H.264 y H.265, imágenes JPG, JPEG, PNG, WEBP, HEIC y HEIF, y audio WAV o MP3, con AAC o MP3 para la pista de audio dentro de un archivo de video. Los límites por archivo son 50MB para video, 30MB para imágenes y 15MB para audio. Como el cuerpo de la solicitud está limitado a 64MB, las URLs alojadas siguen siendo la opción más segura para recursos pesados.

La edición es uno de sus modos principales. Envía un clip de origen con instrucciones y la MiniMax H3 API puede cambiar personajes u objetos, sustituir fondos e iluminación, añadir efectos visuales por capas y reescribir diálogos manteniendo estables las regiones sin modificar. Las instrucciones compuestas se gestionan en una sola solicitud, por lo que varios cambios se aplican juntos en lugar de requerir idas y vueltas repetidas.

La mayoría de los modelos de video toman un prompt más una imagen y devuelven un clip sin sonido. H3, en cambio, consume un conjunto mixto de referencias, interpreta la intención de personaje, movimiento, cámara y sonido en todas ellas, y luego devuelve un clip con audio nativo. Si tu pipeline actualmente combina un modelo de video, un modelo de voz y un editor, H3 condensa esas etapas en una sola llamada.

Explorar Más Series

Seedance 2.0

La API de Seedance 2.0 le ofrece acceso de producción al modelo de video multimodal de ByteDance: entradas cuatrimodales (texto, imagen, video, audio) y un sistema "Universal Reference" líder en la industria que bloquea la composición, el movimiento de la cámara y las acciones de los personajes en diferentes tomas. Integre un control de nivel de director con una sola llamada a la API, una tarifa fija de $0.09/s, clave instantánea y sin lista de espera, todo respaldado por un tiempo de actividad y cumplimiento de nivel empresarial. ¡Seedance 2.0 Native 4K ya está disponible!

Ver Serie

GPT Image 2

La API de GPT Image 2 ofrece a los desarrolladores acceso al último modelo de imágenes de OpenAI, el sucesor de GPT Image 1.5. Genera y edita imágenes con una representación de texto precisa en caracteres latinos y CJK, además de una sólida composición para carteles, maquetas e infografías. En Atlas Cloud, puede acceder a ella a través de una API unificada junto con más de 300 modelos, con créditos gratuitos, un tiempo de actividad del 99,99% y sin necesidad de verificación de organización de OpenAI.

Ver Serie

Seedream 5.0 Pro

La API de Seedream 5.0 Pro ofrece a los desarrolladores el modelo de edición de imágenes controlable de ByteDance en Atlas Cloud. Sitúa las ediciones con precisión mediante anclajes y coordenadas, separa las imágenes en capas editables, fusiona múltiples referencias y empareja colores y materiales exactos, con texto multilingüe a 2K y 3K. ¡En Atlas Cloud puede acceder a él mediante una sola clave!

Ver Serie

Gemini Omni Flash

La Gemini Omni API lleva a tu stack el modelo multimodal de generación y edición de vídeo de Google DeepMind, presentado en Google I/O 2026. Gemini Omni fusiona el motor de razonamiento de Gemini con los medios generativos y acepta cualquier combinación de texto, imágenes, vídeo y audio para producir resultados coherentes y fundamentados en conocimiento. Refina los resultados mediante conversación natural: sustituye objetos, reescribe escenas y cambia de estilo mientras la física, los personajes y la continuidad permanecen intactos. Atlas Cloud ofrece toda la gama Gemini Omni Flash —texto a vídeo, imagen a vídeo con hasta 7 imágenes de referencia y referencia a vídeo— a través de una única API unificada, con precios transparentes por segundo desde $0.112 y sin suscripción. Empieza a construir hoy mismo.

Ver Serie

Grok Imagine

La Grok Imagine API ofrece a los desarrolladores la generación de imágenes, video y audio de xAI en una sola suite. Produce imágenes de hasta 2K con renderizado de texto multilingüe, además de videos de hasta 15 segundos con audio nativo y sincronizado, y edición basada en referencias. En Atlas Cloud, una sola clave ejecuta cada modo de Grok Imagine, por lo que puede alternar entre imagen, video y audio sin configuraciones separadas, desde $0.02 por imagen y $0.05 por segundo.

Ver Serie

Google

Los modelos creativos más potentes de Google están todos disponibles en Atlas Cloud. Veo 3.1 ofrece generación de video cinematográfico, Nano Banana 2 impulsa la creación de imágenes de alta fidelidad y Gemini aporta inteligencia multimodal a cada flujo de trabajo. Acceda a la suite completa de modelos de Google a través de una sola API key con disponibilidad Day-0 y precios de pago por uso (pay-as-you-go).

Ver Serie

Seedance 2.0 Mini

Seedance 2.0 Mini lleva la generación de video multimodal de ByteDance a los flujos de trabajo donde la velocidad y el costo son más importantes. Ofrece las capacidades principales de Seedance 2.0 con un menor consumo de recursos: generación más rápida, menor costo por video y la misma integración de API que ya utiliza. Para los equipos que ejecutan pipelines de alto volumen o crean prototipos a escala, Mini es la opción predeterminada práctica.

Ver Serie

ByteDance

Desde la generación de video cinematográfico hasta la creación de imágenes de alta fidelidad, los modelos más potentes de ByteDance están disponibles en Atlas Cloud. Ejecute Seedance y Seedream a gran escala con los precios de inferencia más bajos y cero gastos generales de infraestructura.

Ver Serie

Alibaba

Atlas Cloud reúne toda la línea de modelos de Alibaba bajo una sola API: Qwen para tareas de lenguaje e imagen, y Wan para la generación de video hasta 1080p. Acceda a cada modelo con pago por uso sin suscripciones. La API de Alibaba está disponible a través de una única URL base utilizando su cliente compatible con OpenAI existente.

Ver Serie

OpenAI

Atlas Cloud le ofrece acceso a la línea completa de la API de OpenAI, desde GPT Image 2 para la generación de imágenes hasta Sora 2 para video. Cada modelo está disponible bajo la modalidad de pago por uso sin compromiso mensual. Intégrelo cambiando simplemente la URL base mediante la API compatible con OpenAI.

Ver Serie

xAI

Construya pipelines completos de imágenes y video utilizando la xAI API en Atlas Cloud. Genere en 2K, edite con imágenes de referencia y anime imágenes en clips sincronizados con audio.

Ver Serie

Kwaivgi

La API de Kwaivgi a un 15% por debajo del precio estándar. Atlas Cloud ofrece acceso Day-0 a los nuevos lanzamientos de Kling con precios de pago por uso y sin límites de puestos. Una cuenta, una clave, todos los modelos de Kling desde el nivel estándar hasta el nivel maestro.

Ver Serie

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos