
Grok Imagine Video 1.5 es la familia de generación de video de xAI para desarrolladores que necesitan controlar el movimiento a partir de prompts y entradas visuales. Anima un fotograma inicial con instrucciones de movimiento en lenguaje natural, selecciona 480p o 720p para flujos de trabajo basados en referencias y añade una voz de referencia opcional para orientar el resultado. Accede a los modos compatibles mediante una única clave de Atlas Cloud compatible con OpenAI, con precios transparentes de pago por uso. Empieza a desarrollar hoy mismo.
Grok Imagine Video 1.5 ha sido desarrollado por xAI. Atlas Cloud (operado por Atlas Cloud AI LLC) proporciona acceso al modelo, pero no es su propietario. Todas las marcas comerciales pertenecen a sus respectivos titulares.
Explora seis endpoints que convierten texto, fotogramas iniciales o recursos de referencia en vídeo para flujos de trabajo de desarrollo y estándar.
| Modalidad | Descripción |
|---|---|
| Grok Imagine Video 1.5 Developer Reference-to-Video API | Convierte de 1 a 7 imágenes de referencia y una voz de referencia opcional en vídeo con audio sincronizado de forma nativa. Las salidas pueden durar hasta 15 segundos en 480p o 720p. Este endpoint es ideal para escenas guiadas por referencias y conceptos visuales que requieren varias imágenes de origen. |
| Grok Imagine Video 1.5 Reference-to-Video API | A partir de entre 1 y 7 imágenes de referencia, este endpoint genera vídeos con audio sincronizado de forma nativa y también admite una voz de referencia opcional. Permite duraciones de hasta 15 segundos en 480p o 720p. Elígelo para producir vídeos con múltiples referencias y secuencias guiadas por voz. |
| Grok Imagine Video 1.5 Developer Text-to-Video API | Basta con una instrucción de texto para generar vídeo con audio sincronizado de forma nativa mediante este endpoint para desarrolladores. Crea clips de hasta 15 segundos en 480p, 720p o 1080p. Es adecuado para conceptos basados en prompts, storyboards y la producción de vídeos cortos. |
| Grok Imagine Video 1.5 Text-to-Video API | Crea vídeo directamente a partir de una instrucción de texto y genera audio sincronizado de forma nativa. Las opciones de salida incluyen 480p, 720p y 1080p, con una duración máxima de 15 segundos. Úsalo para escenas guionizadas, conceptos de campaña o recursos de vídeo para redes sociales. |
| Grok Imagine Video 1.5 Developer Image-to-Video API | A partir de una imagen, este endpoint para desarrolladores aplica instrucciones de movimiento en lenguaje natural para producir un vídeo animado. Las opciones de resolución incluyen 480p, 720p y 1080p. Es ideal para animar ilustraciones, recursos visuales de productos y fotogramas iniciales preparados. |
| Grok Imagine Video 1.5 Image-to-Video API | Anima una imagen de fotograma inicial describiendo en lenguaje natural el movimiento deseado. El vídeo resultante puede generarse en 480p, 720p o 1080p. Este flujo de trabajo es compatible con estudios de movimiento, narrativas visuales y producciones creativas basadas en imágenes. |
Grok Imagine Video 1.5 reúne flujos de trabajo de texto, imagen inicial y de una a siete imágenes de referencia con audio sincronizado nativo, salida de hasta 1080p y clips de hasta 15 segundos en modo texto o referencia, mientras Atlas Cloud añade una API y precios transparentes de pago por uso.
Comienza con un prompt de texto y genera clips de hasta 15 segundos en 480p, 720p o 1080p. El audio sincronizado nativo se genera junto con el video. Define la escena y la acción por completo mediante instrucciones escritas cuando no existe una imagen de origen. Esta opción es ideal para películas conceptuales, experimentos cinematográficos y flujos de contenido impulsados por prompts.
Un único fotograma inicial se convierte en una secuencia en movimiento mediante prompts de movimiento en lenguaje natural. Elige una salida de 480p, 720p o 1080p mientras la imagen establece la composición inicial. Describe en el prompt el movimiento del sujeto y de la escena, y deja que el modelo anime la secuencia a partir de ese anclaje visual. Es ideal para tomas de producto, momentos protagonizados por personajes e imágenes estáticas con dirección artística que necesitan movimiento.
Guía Grok Imagine Video 1.5 con entre una y siete imágenes de referencia y una voz de referencia opcional. El modo de referencia produce clips de hasta 15 segundos en 480p o 720p, con audio sincronizado nativo. Utiliza estas entradas para orientar la escena generada hacia una dirección visual establecida. Esta opción es adecuada para campañas e historias construidas a partir de referencias creativas existentes.
El video y el sonido se generan juntos, por lo que cada clip puede incluir audio sincronizado nativo sin una etapa de audio independiente. Crea escenas en torno a acciones visibles cuyo ritmo pueda reforzarse con la pista de audio correspondiente. Cuando la sincronización es importante, este proceso de generación conjunta reduce el traspaso entre la creación visual y la producción de sonido. Es especialmente útil para metraje con actuaciones y una atmósfera marcada.
Extiende un momento visual completo a lo largo de clips de texto o de referencia de hasta 15 segundos, en lugar de detenerte en un bucle breve. La duración disponible permite incluir planteamiento, movimiento y un desenlace claro dentro de una sola secuencia generada. Combina ese margen con cambios de perspectiva de cámara y una acción continua para crear un momento más desarrollado. Esta duración funciona bien para anuncios breves, revelaciones narrativas y escenas de video para redes sociales.
Alterna entre la generación a partir de texto, imágenes iniciales y referencias mediante una única API de Atlas Cloud, con precios transparentes de pago por uso. Selecciona el flujo de trabajo que corresponda a cada recurso en lugar de obligar a cada idea a pasar por un único tipo de entrada. La misma integración ofrece a los desarrolladores acceso a los seis endpoints de Grok Imagine Video v1.5 indicados, incluidas las rutas estándar y Developer. Esto simplifica la experimentación y la planificación de producción en trabajos de video variados.
Descubre cómo Grok Imagine Video 1.5 y dos alternativas de Atlas Cloud interpretan prompts idénticos en escenas de acción cinematográfica y fantasía estilizada.
Una película de fantasía barroca submarina de 9 segundos, rodada en una sola toma, dentro de un teatro de ópera abandonado y completamente inundado: una elegante buceadora en apnea, con el cabello suelto y una luminosa máscara de perlas, persigue a un pulpo de un intenso rojo coral que lleva una ornamentada llave de latón entre cortinas de terciopelo a la deriva. Comienza desde el interior de un agrietado suelo de escenario, con un dramático plano ascendente de ángulo bajo, mientras ella gira y se lanza de cabeza a través de la fisura; pasa a un ajustado travelling lateral mientras se desliza entre los asientos volcados del teatro, con el cabello y el vestuario reaccionando de forma natural a las corrientes, mientras las cortinas ondean y las burbujas atraviesan arcos superpuestos; después, orbita alrededor de ella y eleva la cámara mientras la presión del agua arranca de lo alto una lámpara de araña de cristal. En el clímax, se retuerce de lado en el último instante para evitar la lámpara que cae, cuyos cristales chocan y se dispersan de forma realista, mientras el pulpo atrapa hábilmente la llave que da vueltas con sus complejos tentáculos curvados, hace una pausa con solemne ceremonia y la coloca de nuevo en su mano abierta. Movimiento fluido y continuo, comienzo–persecución–desenlace claramente definidos, personaje y máscara de perlas coherentes, resistencia del agua, flotabilidad, tejido, cabello, burbujas, deformación de los tentáculos, impactos y evitación de colisiones físicamente precisos. Haces de luz cian fría procedentes de tragaluces destrozados atraviesan el auditorio sumergido y oscuro; el rojo coral es el único color altamente saturado y guía la mirada a través de las capas profundas de arcos, cortinas, escombros suspendidos y burbujas. Fotografía submarina cinematográfica fotorrealista con una sutil textura de pintura al óleo, elegante grandeza barroca, cáusticas volumétricas, gran nivel de detalle, sin texto, sin interfaz y sin cortes disfrazados de fotogramas estáticos. Audio inmersivo: retumbos submarinos amortiguados, corrientes impetuosas, aleteo de la tela, burbujas, impactos cristalinos y un pulso orquestal tenso que se resuelve en una delicada nota de arpa cuando la llave regresa a su mano. Relación de aspecto 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Un anuncio absurdo de comedia de acción ambientado en una barbería de los años 1950, meticulosamente detallada, al amanecer. Un gruñón y desgreñado bobtail inglés, empapado de una espesa espuma blanca de jabón, irrumpe por la puerta y cruza la barbería a toda velocidad mientras sacude espuma por todas partes; un barbero sorprendido salta sobre una silla giratoria y lo persigue montado en ella, recortando rápidamente el pelaje que vuela del perro, con cada chasquido nítido de las tijeras sincronizado con precisión con los contundentes golpes de batería de jazz. Comienza con un travelling extremo a ras del suelo que corre junto a las patas mojadas mientras resbalan sobre baldosas brillantes a cuadros blancos y negros, enviando gotas y salpicaduras de espuma realistas hacia el objetivo; asciende mediante un barrido vertical rápido hasta un travelling circular veloz que utiliza tres grandes espejos para revelar y conservar continuamente las posiciones cambiantes del perro y el barbero mediante reflejos complejos y precisos; después, ejecuta un rápido acercamiento de cámara mientras los últimos mechones cortados caen, giran y aterrizan perfectamente sobre la cabeza del perro, formando un pompadour exageradamente alto. El perro se detiene y posa con suficiencia en un instante heroico de un segundo, parecido a una congelación, y luego estornuda de repente con una explosiva nube de espuma y pelo mientras el jazz termina con un redoble cómico de batería. Las cálidas luces prácticas de tungsteno atraviesan la fresca niebla matinal de tono teal que entra por las ventanas; rica paleta vintage de burdeos, crema, latón pulido y madera oscura; cinematografía publicitaria de acción real de alta calidad, coreografía continua de alta velocidad y sin interrupciones, personajes y continuidad espacial coherentes, pelaje mojado, espuma de jabón, pelo suelto, reflejos, rotación de la silla, inercia y colisiones físicamente precisos, detalle fotorrealista y táctil, movimiento nítido, sin cámara lenta, sin planos generales vacíos, sin pantallas, sin interfaces de software, sin paneles, sin barras de progreso, sin gráficos, sin subtítulos, sin texto explicativo, sin logotipos y sin marcas de agua. Relación de aspecto 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video 1.5 convierte prompts, fotogramas de origen y hasta siete imágenes de referencia en vídeos cortos con audio sincronizado para campañas, presentaciones de productos, historias de personajes, contenido para redes sociales y prototipado visual rápido.
Anima una imagen fija de producto con prompts de movimiento en lenguaje natural y audio sincronizado. Crea clips cortos de presentación para escaparates digitales, páginas de campaña, materiales de lanzamiento o anuncios en redes sociales de hasta 1080p.
Dirige una escena con entre una y siete referencias de personajes y una voz de referencia opcional. Esta configuración permite mantener apariciones recurrentes del reparto, momentos de diálogo y clips narrativos cortos con audio sincronizado nativo.
Parte de un prompt de texto para generar un vídeo completo con audio sincronizado nativo. Los equipos de marketing pueden explorar conceptos de campaña, piezas de ambientación y avances de lanzamiento sin preparar una imagen de origen.
Convierte un único fotograma inicial en movimiento mediante indicaciones en lenguaje natural, hasta 1080p. Produce materiales de campaña concisos para feeds, páginas de lanzamiento, anuncios de eventos, actualizaciones de productos y publicaciones de creadores.
Da vida a un fotograma de storyboard aprobado con movimiento dirigido por prompts, conservándolo como imagen inicial. Directores y diseñadores pueden crear planos cortos de previsualización con audio sincronizado para su revisión.
Combina vistas de productos, retratos de personajes, detalles del vestuario y referencias de escenas a partir de hasta siete imágenes. Los equipos de marca pueden dirigir escenas promocionales cortas con sonido sincronizado, basando cada solicitud en los recursos visuales proporcionados.
Compara Grok Imagine Video 1.5 con los principales modelos de referencia a video en cuanto a entradas admitidas, duración del clip, resolución, audio sincronizado y precios estándar por segundo.
| Modelo | Tipos de entrada | Duración del clip | Resolución máxima | Audio nativo | Precio estándar |
|---|---|---|---|---|---|
| Grok Imagine Video v1.5 | Texto, imagen, imágenes de referencia, voz | Hasta 15 segundos | 1080p | √ | $0.08/segundo |
| Seedance 2.0 Reference-to-Video | Texto, imagen, video, audio | De 4 a 15 segundos | 4K | √ | $0.112/segundo |
| MiniMax H3 Reference-to-Video | Texto, imagen, video, audio | De 4 a 15 segundos | 2K | √ | $0.038/segundo |
| Wan-2.7 Reference-to-video | Texto, imagen, video, audio | De 2 a 10 segundos | 1080p | √ | $0.10/segundo |
Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.
Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.
Combina modelos avanzados de Grok Imagine Video 1.5 con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.
Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.
API Unificada:
Una sola integración para acceder a Grok Imagine Video 1.5, GPT, Gemini y DeepSeek.
Precios Transparentes:
Facturación por Token, soporta modo Serverless.
Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.
Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.
Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.
Grok Imagine Video 1.5 es la familia de modelos de generación de vídeo de xAI para crear clips a partir de texto, una imagen inicial o varias imágenes de referencia. A través de Atlas Cloud, los desarrolladores pueden acceder a endpoints independientes para cada modo de generación.
Hay tres modos disponibles: texto a vídeo, imagen a vídeo y referencia a vídeo. Elige texto para crear una escena desde cero, imagen para animar un fotograma inicial o el modo de referencia para orientar los sujetos, objetos y estilos mediante varias imágenes.
Crea una clave de API de Atlas Cloud y envía una solicitud autenticada al endpoint de generación de vídeo con el ID de modelo adecuado. Usa el ID de tarea devuelto para consultar el estado de la generación y obtener la URL del vídeo completado.
El modo texto a vídeo requiere un prompt en lenguaje natural, mientras que imagen a vídeo añade una imagen del fotograma inicial. Referencia a vídeo acepta un prompt y entre 1 y 7 imágenes de referencia, con IDs de voz preestablecidos opcionales para el diálogo generado.
Los esquemas disponibles de Atlas Cloud admiten clips de entre 1 y 15 segundos. Texto a vídeo e imagen a vídeo ofrecen una salida de 480p, 720p o 1080p, mientras que referencia a vídeo admite 480p o 720p.
Sí. Texto a vídeo genera audio sincronizado nativo a partir del prompt, y referencia a vídeo puede combinar el audio generado con una voz preestablecida opcional para el diálogo.
Atlas Cloud indica un precio base estándar de $0.08 para cada endpoint cubierto por esta página de la familia. Revisa los detalles de facturación actuales del endpoint seleccionado antes del despliegue, ya que el registro de precios proporcionado no especifica su unidad de facturación.
Proporciona entre 1 y 7 imágenes a través del endpoint de referencia a vídeo. Identifica recursos específicos en el prompt con etiquetas como <IMAGE_0> y <IMAGE_1> para que el modelo pueda asociar cada referencia con el sujeto o elemento de la escena previsto.
Los esquemas disponibles de Atlas Cloud no incluyen un parámetro específico para el último fotograma. Imagen a vídeo utiliza una imagen como fotograma inicial, mientras que referencia a vídeo utiliza entre 1 y 7 imágenes como guía visual, no como primeros y últimos fotogramas garantizados.
Elige referencia a vídeo cuando varias imágenes deban orientar a las personas, los objetos o el estilo visual de una escena nueva. Usa imagen a vídeo cuando una imagen existente deba convertirse en el fotograma inicial y su movimiento deba seguir un prompt en lenguaje natural.
Guías, tutoriales y novedades de producto para aprovechar al máximo Atlas Cloud.