
Grok Imagine Video brinda a los desarrolladores acceso a la familia de modelos de video de xAI para crear, animar, ampliar y editar clips. Genera videos de 1 a 15 segundos a partir de indicaciones, guía personas, objetos o estilos con hasta siete imágenes de referencia y trabaja en 480p o 720p. Atlas Cloud reúne estas capacidades mediante endpoints compatibles con OpenAI y precios transparentes de pago por uso. Empieza a crear hoy mismo.
Grok Imagine Video ha sido desarrollado por xAI. Atlas Cloud (operado por Atlas Cloud AI LLC) proporciona acceso al modelo, pero no es su propietario. Todas las marcas comerciales pertenecen a sus respectivos titulares.
Elige el endpoint de Grok Imagine Video que corresponda a tus recursos de origen, la transformación deseada y tu flujo de producción.
| Modalidad | Descripción |
|---|---|
| Grok Imagine Video T2V API (Text To Video) | Convierte prompts en lenguaje natural en vídeos de 1 a 15 segundos a 480p o 720p. Este endpoint es adecuado para visualizar conceptos, crear clips para redes sociales y generar escenas sin recursos multimedia de origen. |
| Grok Imagine Video I2V API (Image To Video) | A partir de una imagen proporcionada, este endpoint aplica prompts de movimiento en lenguaje natural para producir vídeos a 480p o 720p. Úsalo para animar ilustraciones, imágenes de productos, fotogramas de personajes o recursos visuales de campañas. |
| Grok Imagine Video R2V API (Reference To Video) | Guía la generación de vídeos con entre 1 y 7 imágenes de referencia que representan personas, objetos o estilos visuales. Las salidas pueden durar hasta 10 segundos a 480p o 720p, lo que facilita una producción creativa basada en referencias. |
| Grok Imagine Video Extend API (Video Extension) | Continúa un MP4 existente de 2 a 15 segundos con una extensión dirigida por un prompt y con una duración de 2 a 10 segundos. La salida coincide con el formato de entrada y está limitada a 720p, por lo que este endpoint resulta útil para alargar planos ya establecidos. |
| Grok Imagine Video Edit API (Video Editing) | Proporciona un MP4 e instrucciones en lenguaje natural para modificar su contenido visual conservando la duración de origen. La salida está limitada a 8.7 segundos, lo que permite realizar revisiones específicas y transformaciones basadas en prompts sobre vídeos cortos. |
Grok Imagine Video convierte texto, fotogramas iniciales y hasta siete referencias en clips cortos, y después amplía o edita metraje MP4 existente mediante la API unificada de pago por uso de Atlas Cloud.
Escribe un prompt en lenguaje natural y genera un clip de 1 a 15 segundos en 480p o 720p. Siete relaciones de aspecto, incluidas 16:9, 1:1 y 9:16, permiten adaptar cada toma al lienzo previsto. Controla el sujeto, la acción, el movimiento de cámara y la atmósfera directamente desde el prompt. Es un punto de partida flexible para momentos narrativos, conceptos de campaña y vídeos para redes sociales.
Convierte una imagen proporcionada como fotograma inicial en un vídeo de 1 a 15 segundos en 480p o 720p. La imagen establece la composición de apertura, mientras que un prompt de movimiento en lenguaje natural dirige el movimiento y la evolución de la escena. Elige entre siete relaciones de aspecto cuando necesites una forma de salida diferente. Este flujo de trabajo es adecuado para tomas de producto, escenas ilustradas y conceptos dirigidos artísticamente que necesitan movimiento sin reconstruir el fotograma inicial.
Guía un vídeo con entre 1 y 7 imágenes de referencia que representen personas, objetos o estilos visuales. Haz referencia a entradas individuales en el prompt y genera hasta 10 segundos en 480p o 720p con cualquiera de las siete relaciones de aspecto compatibles. Como las referencias dan forma a la escena sin servir únicamente como fotograma inicial, los creadores obtienen un mayor control sobre los elementos visuales recurrentes. Úsalo para escenas protagonizadas por personajes, narrativas de producto o campañas sensibles al estilo.
Continúa un MP4 existente de 2 a 15 segundos con una ampliación guiada por prompt de 2 a 10 segundos. Grok Imagine Video retoma la acción desde el fotograma final y devuelve el clip original junto con el nuevo segmento, manteniendo la resolución de entrada hasta 720p. Describe la siguiente acción, revelación o movimiento de cámara en lenguaje sencillo. Así, los finales abruptos se convierten más fácilmente en momentos narrativos completos.
Proporciona a Grok Imagine Video un MP4 e instrucciones en lenguaje natural para transformar el metraje manteniendo su duración original. Las entradas pueden durar hasta 8.7 segundos y la facturación se basa en la duración del vídeo de entrada. Solicita un cambio visual, una modificación de la atmósfera o una revisión a nivel de escena sin reconstruir el clip desde cero. Es ideal para variaciones creativas breves y ajustes controlados posteriores a la generación.
Pasa de texto a vídeo, de imagen a vídeo, generación guiada por referencias, ampliación y edición mediante una única API unificada. Selecciona el endpoint que corresponda al material de origen disponible y envía cada trabajo mediante un flujo de predicción asíncrono. Mantén coherentes los patrones de autenticación e integración en todos los flujos de trabajo. El acceso de pago por uso facilita la experimentación y los pipelines de producción repetibles. Los desarrolladores pueden crear herramientas de vídeo más completas con menos esfuerzo de integración.
Descubre cómo Grok Imagine Video y dos alternativas líderes interpretan prompts idénticos mediante el movimiento, la continuidad, el control de cámara, la iluminación y la narrativa visual.
Una película de aventura hiperrealista de 8–10 segundos, ambientada al aire libre en un desfiladero esmeralda justo después de una tormenta torrencial. Desde el primer fotograma hasta el último, un kayakista con traje impermeable azul cobalto y chaleco salvavidas rojo anaranjado se lanza por rápidos de aguas bravas violentas. Comienza con un travelling ultrabajo a ras del agua, corriendo junto al kayak mientras las palas cortan la corriente y lanzan gotas nítidas contra el objetivo; el kayak asciende por la cresta de una ola empinada y sale disparado por el aire. Haz un whip-pan hacia la POV en primera persona del kayakista mientras la embarcación gira de lado bajo un árbol caído, atraviesa una cortina translúcida de agua y supera por poco unas rocas dentadas y mojadas, manteniendo la coherencia física de las manos, la pala y la proa cobalto a través de las salpicaduras y las oclusiones momentáneas. El kayakista apoya la pala contra la corriente, se separa de la pared del cañón en un giro cerrado de rebote y vuelve a caer en el torrente. En el clímax, pasa a una inmersión de dron desde lo alto del acantilado, descendiendo rápidamente y orbitando al kayakista durante el aterrizaje; la proa golpea una caja de madera flotante con un impacto convincente, la rompe y, como giro lúdico inesperado, de su interior salta una ristra conectada de farolillos de papel coloridos perfectamente intactos, que se despliega y flota cálidamente sobre el agua fría y rápida mientras el kayak sigue avanzando. Movimiento continuo y anatómicamente correcto, inercia realista del kayak, resistencia de la pala, colisiones, dinámica turbulenta de fluidos, movimiento de la tela, gotas, salpicaduras sobre el objetivo e identidad inalterable del sujeto tras cada obstáculo; sin cámara lenta, sin planos generales vacíos de establecimiento, sin cortes a pantallas, interfaces, paneles, barras de progreso, gráficos, subtítulos, logotipos ni texto explicativo. Luz diurna fría cian y nublada, paredes de roca esmeralda oscurecidas por la lluvia, chaleco salvavidas rojo anaranjado intenso, resplandor cálido y multicolor de los farolillos, composiciones diagonales cinematográficas en formato panorámico que enfatizan la velocidad, alto contraste, desenfoque de movimiento natural y cinematografía inmersiva fotorrealista de deportes de acción. Audio sincronizado: rápidos rugientes, impactos secos de la pala, madera crujiendo, respiración forzada, agua golpeando el casco y un brillante acento musical percusivo cuando los farolillos quedan libres. Relación de aspecto 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Una secuencia cinematográfica de acción continua de 8–10 segundos en un mercado nocturno al aire libre, momentos antes de un aguacero torrencial: un maestro ramen ciego corre con confianza por un laberinto de puestos de comida abarrotados mientras estira continuamente entre sus manos una cinta de fideos de color blanco plateado. Comienza con una vista cenital perfectamente vertical y luego desciende rápidamente desde las alturas hacia el laberinto del mercado iluminado por neón, mientras las primeras gotas de lluvia pesadas golpean los toldos y el pavimento mojado. Fija la cámara en la cinta de fideos voladora y corre a escasos centímetros de ella mientras pasa silbando sobre braseros de carbón encendidos, comensales sorprendidos, parrillas chisporroteantes y paraguas que se abren de golpe con el viento; conserva un movimiento humano fluido, una física elástica y creíble de los fideos, oclusiones complejas en primer plano, lluvia salpicante, chispas y vapor denso. Haz un whip-pan hacia el chef saltando una caja baja sin romper el ritmo y luego ejecuta una órbita rápida de 360 grados a su alrededor mientras gira y suelta los fideos hacia atrás con un impulso preciso. La cinta de fideos traza un arco limpio hasta caer en una olla de cobre que hierve vigorosamente detrás de él; justo en el momento del triunfo, un travieso gato atigrado naranja salta desde debajo del puesto, atrapa con la boca la mitad de los fideos colgantes y sale corriendo, creando un remate visual nítido mientras el chef sigue corriendo sin darse cuenta. Fotorrealismo neonoir, reflejos cian verdosos y magenta sobre el suelo resbaladizo por la lluvia, fuego naranja cálido del horno como acentos visuales rítmicos, vapor y lluvia táctiles, coreografía estable, detalle cinematográfico nítido, ritmo energético en tiempo real, sin cámara lenta ni cortes que rompan la continuidad espacial o de los personajes. Audio: truenos crecientes, conversaciones del mercado, pasos contundentes, paraguas abriéndose de golpe, carbón chisporroteando, agua hirviendo y silbidos de los fideos sincronizados con los movimientos de cámara, con un brillante maullido cómico y una salpicadura de la olla de cobre al final. Sin pantallas, interfaces de usuario, paneles, barras de progreso, gráficos, subtítulos, logotipos, marcas de agua ni texto explicativo. Relación de aspecto 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video convierte prompts, imágenes fijas, referencias y archivos MP4 existentes en vías prácticas para clips sociales, imágenes de producto, historias de marca, secuencias más largas, ediciones específicas y herramientas para creadores.
Grok Imagine Video convierte prompts en lenguaje natural en clips cortos de 480p o 720p. Úsalo para producir teasers para redes sociales, conceptos de campaña y borradores visuales rápidos sin preparar metraje de origen por adelantado.
A partir de una imagen de producto, el endpoint image to video añade movimiento dirigido por prompts en 480p o 720p. Las marcas pueden convertir imágenes fijas de catálogo en revelaciones de productos, recursos para lanzamientos e imágenes para marketplaces.
Con entre 1 y 7 imágenes, reference to video guía personas, objetos o estilos para crear un clip nuevo. Los equipos creativos pueden desarrollar historias de marca, conceptos de personajes y escenas de productos basadas en los elementos visuales proporcionados.
Continúa un MP4 existente con una extensión de 2 a 10 segundos dirigida por prompts que conserva la resolución de entrada hasta 720p. Esto permite crear momentos más largos del storyboard, transiciones episódicas y secuencias posteriores a partir de metraje aprobado.
Edita un MP4 mediante instrucciones en lenguaje natural conservando su duración original, con una salida limitada a 8.7 segundos. Los equipos pueden crear estilos alternativos, variantes localizadas de campañas o tratamientos visuales revisados.
Desarrolla herramientas de video dirigidas por prompts en torno a los 5 modos de Grok Imagine Video para generación, animación, referencias, extensiones y edición. Los desarrolladores pueden ofrecer flujos de trabajo para creadores desde una misma familia y elegir una salida de 480p o 720p.
Compara los flujos de trabajo de Grok Imagine Video con alternativas seleccionadas de Atlas Cloud en métodos de entrada, duración del clip, resolución máxima y precios estándar.
| Modelo | Flujo de entrada | Duración del clip o segmento | Resolución máxima | Precio estándar |
|---|---|---|---|---|
| Grok Imagine Video Text-to-Video | Prompt de texto | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Image-to-Video | Imagen inicial + prompt de texto | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Reference-to-Video | 1–7 imágenes de referencia + prompt de texto | 1–10s | 720p | $0.05/sec |
| Grok Imagine Video Extend | MP4 de 2–15s + prompt de texto | Extensión de 2–10s | Coincide con la entrada, hasta 720p | $0.07/sec |
| Grok Imagine Video Edit | MP4 + instrucción de texto | Coincide con la entrada, hasta 8.7s | - | $0.07/sec de entrada |
| MiniMax H3 Text-to-Video | Prompt de texto | 4–15s | 2K | $0.038/sec |
| Seedance 2.0 Image-to-Video | Imagen inicial + texto, fotograma final opcional | 4–15s | 4K nativo | $0.112/sec |
| Vidu Q3-Mix Reference to Video | 1–4 imágenes de referencia + prompt de texto | 1–16s | 1440p SR, hasta 1080p nativo | $0.125/ejecución |
| Wan-2.7 Video-edit | Vídeo de origen + texto, imágenes o audio opcionales | - | 1080p | $0.10/ejecución |
Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.
Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.
Combina modelos avanzados de Grok Imagine Video con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.
Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.
API Unificada:
Una sola integración para acceder a Grok Imagine Video, GPT, Gemini y DeepSeek.
Precios Transparentes:
Facturación por Token, soporta modo Serverless.
Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.
Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.
Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.
Grok Imagine Video es la familia de modelos de generación de vídeo de xAI para crear, animar, ampliar y editar clips cortos. Atlas Cloud proporciona puntos de conexión de API independientes para flujos de trabajo de texto, imagen, referencia, extensión y edición.
Grok Imagine Video puede generar un clip a partir de texto, animar una imagen inicial o utilizar hasta siete imágenes de referencia para orientar a personas, objetos y estilos. Los puntos de conexión independientes pueden continuar un clip existente o editar un MP4 mediante instrucciones en lenguaje natural.
Crea una clave de API de Atlas Cloud y envía una solicitud POST autenticada a /api/v1/model/generateVideo. Especifica el ID de modelo obligatorio, el prompt y cualquier entrada de imagen o vídeo que requiera esa ruta. La respuesta incluye un ID de solicitud, el estado y los campos de salida.
Elige text-to-video cuando la escena comience con un prompt, o image-to-video cuando una imagen proporcionada deba convertirse en el fotograma inicial. Reference-to-video ofrece una guía más amplia a partir de varias imágenes, mientras que extend-video y edit-video funcionan con archivos MP4 existentes.
Text-to-video e image-to-video admiten clips de 1 a 15 segundos a 480p o 720p. Reference-to-video admite de 1 a 10 segundos con las mismas resoluciones, mientras que las relaciones de aspecto habituales incluyen 16:9, 9:16, 1:1, 4:3, 3:4, 3:2 y 2:3. Las rutas de extensión y edición tienen sus propios límites de entrada.
Sí. xAI documenta la generación de audio nativo como parte del flujo de trabajo de vídeo de Grok Imagine, lo que permite producir el sonido y los elementos visuales conjuntamente. Los esquemas publicados por Atlas Cloud para estas rutas no exponen un interruptor de audio independiente.
Proporciona entre una y siete URL públicas de imágenes mediante HTTPS o URI de datos en base64 a través del punto de conexión reference-to-video. Las etiquetas como <IMAGE_0> pueden vincular referencias individuales con las personas, los objetos o los estilos descritos en el prompt. Esta ruta devuelve clips de hasta 10 segundos a 480p o 720p.
Usa extend-video con un MP4 de entre 2 y 15 segundos y solicita entre 2 y 10 segundos adicionales de acción guiada por el prompt. Para cambios específicos, edit-video acepta un MP4 de no más de 8.7 segundos y conserva su duración. Ambas rutas limitan la resolución de salida a 720p.
El precio estándar de Atlas Cloud es de $0.05 por segundo para text-to-video, image-to-video y reference-to-video. Extend-video y edit-video utilizan una tarifa estándar de $0.07 por segundo. La edición se factura según la duración del vídeo de entrada, ya que la salida conserva esa duración.
Primero, confirma que el punto de conexión seleccionado coincide con el tipo de entrada y que están presentes todos los prompts, las URL de imagen o las URL de vídeo obligatorios. Comprueba los límites específicos de la ruta para la duración, la resolución, la relación de aspecto, el número de referencias y el MP4 antes de volver a enviarla. Si la solicitud se completa correctamente pero la escena no es precisa, reescribe el prompt con instrucciones explícitas sobre el movimiento del sujeto, el movimiento de cámara, el ritmo y los detalles visuales.
Guías, tutoriales y novedades de producto para aprovechar al máximo Atlas Cloud.