Seedance 2.0 Mini & Fast API a los precios más bajos del mundo: hasta un 68 % de descuento sobre el precio oficial
Grok Imagine Video 1.5 Motion Prompting

Grok Imagine Video 1.5 Motion Prompting

Grok Imagine Video 1.5 es la familia de generación de video de xAI para desarrolladores que necesitan controlar el movimiento a partir de prompts y entradas visuales. Anima un fotograma inicial con instrucciones de movimiento en lenguaje natural, selecciona 480p o 720p para flujos de trabajo basados en referencias y añade una voz de referencia opcional para orientar el resultado. Accede a los modos compatibles mediante una única clave de Atlas Cloud compatible con OpenAI, con precios transparentes de pago por uso. Empieza a desarrollar hoy mismo.

Grok Imagine Video 1.5 ha sido desarrollado por xAI. Atlas Cloud (operado por Atlas Cloud AI LLC) proporciona acceso al modelo, pero no es su propietario. Todas las marcas comerciales pertenecen a sus respectivos titulares.

Compara las modalidades de entrada de Grok Imagine Video 1.5

Explora seis endpoints que convierten texto, fotogramas iniciales o recursos de referencia en vídeo para flujos de trabajo de desarrollo y estándar.

ModalidadDescripción
Grok Imagine Video 1.5 Developer Reference-to-Video APIConvierte de 1 a 7 imágenes de referencia y una voz de referencia opcional en vídeo con audio sincronizado de forma nativa. Las salidas pueden durar hasta 15 segundos en 480p o 720p. Este endpoint es ideal para escenas guiadas por referencias y conceptos visuales que requieren varias imágenes de origen.
Grok Imagine Video 1.5 Reference-to-Video APIA partir de entre 1 y 7 imágenes de referencia, este endpoint genera vídeos con audio sincronizado de forma nativa y también admite una voz de referencia opcional. Permite duraciones de hasta 15 segundos en 480p o 720p. Elígelo para producir vídeos con múltiples referencias y secuencias guiadas por voz.
Grok Imagine Video 1.5 Developer Text-to-Video APIBasta con una instrucción de texto para generar vídeo con audio sincronizado de forma nativa mediante este endpoint para desarrolladores. Crea clips de hasta 15 segundos en 480p, 720p o 1080p. Es adecuado para conceptos basados en prompts, storyboards y la producción de vídeos cortos.
Grok Imagine Video 1.5 Text-to-Video APICrea vídeo directamente a partir de una instrucción de texto y genera audio sincronizado de forma nativa. Las opciones de salida incluyen 480p, 720p y 1080p, con una duración máxima de 15 segundos. Úsalo para escenas guionizadas, conceptos de campaña o recursos de vídeo para redes sociales.
Grok Imagine Video 1.5 Developer Image-to-Video APIA partir de una imagen, este endpoint para desarrolladores aplica instrucciones de movimiento en lenguaje natural para producir un vídeo animado. Las opciones de resolución incluyen 480p, 720p y 1080p. Es ideal para animar ilustraciones, recursos visuales de productos y fotogramas iniciales preparados.
Grok Imagine Video 1.5 Image-to-Video APIAnima una imagen de fotograma inicial describiendo en lenguaje natural el movimiento deseado. El vídeo resultante puede generarse en 480p, 720p o 1080p. Este flujo de trabajo es compatible con estudios de movimiento, narrativas visuales y producciones creativas basadas en imágenes.

Dentro del motor creativo de Grok Imagine Video 1.5

Grok Imagine Video 1.5 reúne flujos de trabajo de texto, imagen inicial y de una a siete imágenes de referencia con audio sincronizado nativo, salida de hasta 1080p y clips de hasta 15 segundos en modo texto o referencia, mientras Atlas Cloud añade una API y precios transparentes de pago por uso.

Grok Imagine Video 1.5 a partir de texto

Comienza con un prompt de texto y genera clips de hasta 15 segundos en 480p, 720p o 1080p. El audio sincronizado nativo se genera junto con el video. Define la escena y la acción por completo mediante instrucciones escritas cuando no existe una imagen de origen. Esta opción es ideal para películas conceptuales, experimentos cinematográficos y flujos de contenido impulsados por prompts.

Movimiento guiado por imagen

Un único fotograma inicial se convierte en una secuencia en movimiento mediante prompts de movimiento en lenguaje natural. Elige una salida de 480p, 720p o 1080p mientras la imagen establece la composición inicial. Describe en el prompt el movimiento del sujeto y de la escena, y deja que el modelo anime la secuencia a partir de ese anclaje visual. Es ideal para tomas de producto, momentos protagonizados por personajes e imágenes estáticas con dirección artística que necesitan movimiento.

Dirección mediante referencias en Grok Imagine Video 1.5

Guía Grok Imagine Video 1.5 con entre una y siete imágenes de referencia y una voz de referencia opcional. El modo de referencia produce clips de hasta 15 segundos en 480p o 720p, con audio sincronizado nativo. Utiliza estas entradas para orientar la escena generada hacia una dirección visual establecida. Esta opción es adecuada para campañas e historias construidas a partir de referencias creativas existentes.

Audio sincronizado nativo

El video y el sonido se generan juntos, por lo que cada clip puede incluir audio sincronizado nativo sin una etapa de audio independiente. Crea escenas en torno a acciones visibles cuyo ritmo pueda reforzarse con la pista de audio correspondiente. Cuando la sincronización es importante, este proceso de generación conjunta reduce el traspaso entre la creación visual y la producción de sonido. Es especialmente útil para metraje con actuaciones y una atmósfera marcada.

Arcos narrativos de 15 segundos

Extiende un momento visual completo a lo largo de clips de texto o de referencia de hasta 15 segundos, en lugar de detenerte en un bucle breve. La duración disponible permite incluir planteamiento, movimiento y un desenlace claro dentro de una sola secuencia generada. Combina ese margen con cambios de perspectiva de cámara y una acción continua para crear un momento más desarrollado. Esta duración funciona bien para anuncios breves, revelaciones narrativas y escenas de video para redes sociales.

Una API, seis endpoints

Alterna entre la generación a partir de texto, imágenes iniciales y referencias mediante una única API de Atlas Cloud, con precios transparentes de pago por uso. Selecciona el flujo de trabajo que corresponda a cada recurso en lugar de obligar a cada idea a pasar por un único tipo de entrada. La misma integración ofrece a los desarrolladores acceso a los seis endpoints de Grok Imagine Video v1.5 indicados, incluidas las rutas estándar y Developer. Esto simplifica la experimentación y la planificación de producción en trabajos de video variados.

Grok Imagine Video 1.5 en un enfrentamiento de modelos con un solo prompt

Descubre cómo Grok Imagine Video 1.5 y dos alternativas de Atlas Cloud interpretan prompts idénticos en escenas de acción cinematográfica y fantasía estilizada.

Prompt

Una película de fantasía barroca submarina de 9 segundos, rodada en una sola toma, dentro de un teatro de ópera abandonado y completamente inundado: una elegante buceadora en apnea, con el cabello suelto y una luminosa máscara de perlas, persigue a un pulpo de un intenso rojo coral que lleva una ornamentada llave de latón entre cortinas de terciopelo a la deriva. Comienza desde el interior de un agrietado suelo de escenario, con un dramático plano ascendente de ángulo bajo, mientras ella gira y se lanza de cabeza a través de la fisura; pasa a un ajustado travelling lateral mientras se desliza entre los asientos volcados del teatro, con el cabello y el vestuario reaccionando de forma natural a las corrientes, mientras las cortinas ondean y las burbujas atraviesan arcos superpuestos; después, orbita alrededor de ella y eleva la cámara mientras la presión del agua arranca de lo alto una lámpara de araña de cristal. En el clímax, se retuerce de lado en el último instante para evitar la lámpara que cae, cuyos cristales chocan y se dispersan de forma realista, mientras el pulpo atrapa hábilmente la llave que da vueltas con sus complejos tentáculos curvados, hace una pausa con solemne ceremonia y la coloca de nuevo en su mano abierta. Movimiento fluido y continuo, comienzo–persecución–desenlace claramente definidos, personaje y máscara de perlas coherentes, resistencia del agua, flotabilidad, tejido, cabello, burbujas, deformación de los tentáculos, impactos y evitación de colisiones físicamente precisos. Haces de luz cian fría procedentes de tragaluces destrozados atraviesan el auditorio sumergido y oscuro; el rojo coral es el único color altamente saturado y guía la mirada a través de las capas profundas de arcos, cortinas, escombros suspendidos y burbujas. Fotografía submarina cinematográfica fotorrealista con una sutil textura de pintura al óleo, elegante grandeza barroca, cáusticas volumétricas, gran nivel de detalle, sin texto, sin interfaz y sin cortes disfrazados de fotogramas estáticos. Audio inmersivo: retumbos submarinos amortiguados, corrientes impetuosas, aleteo de la tela, burbujas, impactos cristalinos y un pulso orquestal tenso que se resuelve en una delicada nota de arpa cuando la llave regresa a su mano. Relación de aspecto 16:9.

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

Prompt

Un anuncio absurdo de comedia de acción ambientado en una barbería de los años 1950, meticulosamente detallada, al amanecer. Un gruñón y desgreñado bobtail inglés, empapado de una espesa espuma blanca de jabón, irrumpe por la puerta y cruza la barbería a toda velocidad mientras sacude espuma por todas partes; un barbero sorprendido salta sobre una silla giratoria y lo persigue montado en ella, recortando rápidamente el pelaje que vuela del perro, con cada chasquido nítido de las tijeras sincronizado con precisión con los contundentes golpes de batería de jazz. Comienza con un travelling extremo a ras del suelo que corre junto a las patas mojadas mientras resbalan sobre baldosas brillantes a cuadros blancos y negros, enviando gotas y salpicaduras de espuma realistas hacia el objetivo; asciende mediante un barrido vertical rápido hasta un travelling circular veloz que utiliza tres grandes espejos para revelar y conservar continuamente las posiciones cambiantes del perro y el barbero mediante reflejos complejos y precisos; después, ejecuta un rápido acercamiento de cámara mientras los últimos mechones cortados caen, giran y aterrizan perfectamente sobre la cabeza del perro, formando un pompadour exageradamente alto. El perro se detiene y posa con suficiencia en un instante heroico de un segundo, parecido a una congelación, y luego estornuda de repente con una explosiva nube de espuma y pelo mientras el jazz termina con un redoble cómico de batería. Las cálidas luces prácticas de tungsteno atraviesan la fresca niebla matinal de tono teal que entra por las ventanas; rica paleta vintage de burdeos, crema, latón pulido y madera oscura; cinematografía publicitaria de acción real de alta calidad, coreografía continua de alta velocidad y sin interrupciones, personajes y continuidad espacial coherentes, pelaje mojado, espuma de jabón, pelo suelto, reflejos, rotación de la silla, inercia y colisiones físicamente precisos, detalle fotorrealista y táctil, movimiento nítido, sin cámara lenta, sin planos generales vacíos, sin pantallas, sin interfaces de software, sin paneles, sin barras de progreso, sin gráficos, sin subtítulos, sin texto explicativo, sin logotipos y sin marcas de agua. Relación de aspecto 16:9.

Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud

Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud

Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud

Grok Imagine Video 1.5 en todo el flujo creativo

Grok Imagine Video 1.5 convierte prompts, fotogramas de origen y hasta siete imágenes de referencia en vídeos cortos con audio sincronizado para campañas, presentaciones de productos, historias de personajes, contenido para redes sociales y prototipado visual rápido.

Anuncios de producto con Grok Imagine Video 1.5

Anima una imagen fija de producto con prompts de movimiento en lenguaje natural y audio sincronizado. Crea clips cortos de presentación para escaparates digitales, páginas de campaña, materiales de lanzamiento o anuncios en redes sociales de hasta 1080p.

Historias de personajes guiadas por referencias

Dirige una escena con entre una y siete referencias de personajes y una voz de referencia opcional. Esta configuración permite mantener apariciones recurrentes del reparto, momentos de diálogo y clips narrativos cortos con audio sincronizado nativo.

Conceptos de campaña a partir de prompts

Parte de un prompt de texto para generar un vídeo completo con audio sincronizado nativo. Los equipos de marketing pueden explorar conceptos de campaña, piezas de ambientación y avances de lanzamiento sin preparar una imagen de origen.

Clips para redes sociales con Grok Imagine Video 1.5

Convierte un único fotograma inicial en movimiento mediante indicaciones en lenguaje natural, hasta 1080p. Produce materiales de campaña concisos para feeds, páginas de lanzamiento, anuncios de eventos, actualizaciones de productos y publicaciones de creadores.

Animación de fotogramas del storyboard

Da vida a un fotograma de storyboard aprobado con movimiento dirigido por prompts, conservándolo como imagen inicial. Directores y diseñadores pueden crear planos cortos de previsualización con audio sincronizado para su revisión.

Campañas de marca con Grok Imagine Video 1.5

Combina vistas de productos, retratos de personajes, detalles del vestuario y referencias de escenas a partir de hasta siete imágenes. Los equipos de marca pueden dirigir escenas promocionales cortas con sonido sincronizado, basando cada solicitud en los recursos visuales proporcionados.

Grok Imagine Video 1.5 en el ámbito del video multimodal

Compara Grok Imagine Video 1.5 con los principales modelos de referencia a video en cuanto a entradas admitidas, duración del clip, resolución, audio sincronizado y precios estándar por segundo.

ModeloTipos de entradaDuración del clipResolución máximaAudio nativoPrecio estándar
Grok Imagine Video v1.5Texto, imagen, imágenes de referencia, vozHasta 15 segundos1080p√$0.08/segundo
Seedance 2.0 Reference-to-VideoTexto, imagen, video, audioDe 4 a 15 segundos4K√$0.112/segundo
MiniMax H3 Reference-to-VideoTexto, imagen, video, audioDe 4 a 15 segundos2K√$0.038/segundo
Wan-2.7 Reference-to-videoTexto, imagen, video, audioDe 2 a 10 segundos1080p√$0.10/segundo

Cómo usar Grok Imagine Video 1.5 en Atlas Cloud

Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.

Crea una cuenta en Atlas Cloud

Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.

Por Qué Usar Grok Imagine Video 1.5 en Atlas Cloud

Combina modelos avanzados de Grok Imagine Video 1.5 con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.

Rendimiento y Flexibilidad

Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.

API Unificada:
Una sola integración para acceder a Grok Imagine Video 1.5, GPT, Gemini y DeepSeek.

Precios Transparentes:
Facturación por Token, soporta modo Serverless.

Empresa y Escala

Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.

Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.

Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.

Preguntas frecuentes sobre la API de Grok Imagine Video 1.5

Grok Imagine Video 1.5 es la familia de modelos de generación de vídeo de xAI para crear clips a partir de texto, una imagen inicial o varias imágenes de referencia. A través de Atlas Cloud, los desarrolladores pueden acceder a endpoints independientes para cada modo de generación.

Hay tres modos disponibles: texto a vídeo, imagen a vídeo y referencia a vídeo. Elige texto para crear una escena desde cero, imagen para animar un fotograma inicial o el modo de referencia para orientar los sujetos, objetos y estilos mediante varias imágenes.

Crea una clave de API de Atlas Cloud y envía una solicitud autenticada al endpoint de generación de vídeo con el ID de modelo adecuado. Usa el ID de tarea devuelto para consultar el estado de la generación y obtener la URL del vídeo completado.

El modo texto a vídeo requiere un prompt en lenguaje natural, mientras que imagen a vídeo añade una imagen del fotograma inicial. Referencia a vídeo acepta un prompt y entre 1 y 7 imágenes de referencia, con IDs de voz preestablecidos opcionales para el diálogo generado.

Los esquemas disponibles de Atlas Cloud admiten clips de entre 1 y 15 segundos. Texto a vídeo e imagen a vídeo ofrecen una salida de 480p, 720p o 1080p, mientras que referencia a vídeo admite 480p o 720p.

Sí. Texto a vídeo genera audio sincronizado nativo a partir del prompt, y referencia a vídeo puede combinar el audio generado con una voz preestablecida opcional para el diálogo.

Atlas Cloud indica un precio base estándar de $0.08 para cada endpoint cubierto por esta página de la familia. Revisa los detalles de facturación actuales del endpoint seleccionado antes del despliegue, ya que el registro de precios proporcionado no especifica su unidad de facturación.

Proporciona entre 1 y 7 imágenes a través del endpoint de referencia a vídeo. Identifica recursos específicos en el prompt con etiquetas como <IMAGE_0> y <IMAGE_1> para que el modelo pueda asociar cada referencia con el sujeto o elemento de la escena previsto.

Los esquemas disponibles de Atlas Cloud no incluyen un parámetro específico para el último fotograma. Imagen a vídeo utiliza una imagen como fotograma inicial, mientras que referencia a vídeo utiliza entre 1 y 7 imágenes como guía visual, no como primeros y últimos fotogramas garantizados.

Elige referencia a vídeo cuando varias imágenes deban orientar a las personas, los objetos o el estilo visual de una escena nueva. Usa imagen a vídeo cuando una imagen existente deba convertirse en el fotograma inicial y su movimiento deba seguir un prompt en lenguaje natural.

Explorar Más Series

Seedance 2.5

¡La API de Seedance 2.5 ya está disponible en Atlas Cloud! Ofrece a los desarrolladores el modelo de video más reciente de ByteDance. Genera hasta 30 segundos de video nativo en una sola pasada a partir de texto, una sola imagen o hasta 50 referencias multimodales, con audio sincronizado y texto multilingüe en el encuadre. En Atlas Cloud puede acceder a él mediante una única clave, con consistencia del sujeto y físicas mejoradas que mantienen la coherencia en las tomas largas.

Ver Serie

Wan 3.0

La API Wan 3.0 es la próxima generación de la familia de videos Wan de Alibaba, diseñada para llevar la generación de formato largo, el control de múltiples referencias y la calidad audiovisual a nuevas alturas. Atlas Cloud ya aloja Wan 2.7, 2.6 y 2.5, y Wan 3.0 se ejecuta con la misma clave unificada sin necesidad de configuración adicional. Empieza a construir hoy mismo. Desplázate hacia abajo hasta la galería para ver lo que Wan 3.0 puede crear.

Ver Serie

MiniMax H3

MiniMax H3 es la familia de vídeo multimodal de MiniMax para la creación guiada por texto, imagen y referencias. En las rutas compatibles, conserva los sujetos del material de referencia, ofrece relaciones de aspecto flexibles y combina el sonido generado con los elementos visuales mediante H3 Developer, con perfiles de salida seleccionados según el endpoint. Atlas Cloud reúne toda la familia bajo una única clave compatible con OpenAI, con precios transparentes de pago por uso a partir de la tarifa estándar de $0.038 por segundo. Empieza a crear hoy mismo.

Ver Serie

Seedream 5.0 Pro

La API de Seedream 5.0 Pro ofrece a los desarrolladores el modelo de edición de imágenes controlable de ByteDance en Atlas Cloud. Sitúa las ediciones con precisión mediante anclajes y coordenadas, separa las imágenes en capas editables, fusiona múltiples referencias y empareja colores y materiales exactos, con texto multilingüe a 2K y 3K. ¡En Atlas Cloud puede acceder a él mediante una sola clave!

Ver Serie

Seedance 2.0

Seedance 2.0 es el modelo de vídeo para producción de ByteDance, diseñado para crear planos con precisión. Convierte prompts en vídeo, anima una imagen del primer fotograma con orientación opcional del último fotograma o da forma a los resultados mediante medios de referencia y búsqueda web opcional. Atlas Cloud reúne estos flujos de trabajo en una única API unificada, con precios transparentes de pago por uso y una sola clave compatible con OpenAI. Empieza a crear hoy mismo.

Ver Serie

GPT Image 2.5

La familia gpt-image-2.5 de OpenAI ofrece a los desarrolladores la posibilidad de elegir entre Flare y Sunburst para flujos de trabajo de producción de imágenes. Renderiza con resoluciones arbitrarias de hasta 3840x2160 y elige entre cinco niveles de calidad, incluidos xhigh y max, para adaptarte a requisitos de salida específicos. Atlas Cloud proporciona inferencia REST lista para usar, sin arranques en frío y con precios estándar desde $0.004 por generación. Empieza a crear hoy mismo.

Ver Serie

GPT Image 2

La API de GPT Image 2 ofrece a los desarrolladores acceso al último modelo de imágenes de OpenAI, el sucesor de GPT Image 1.5. Genera y edita imágenes con una representación de texto precisa en caracteres latinos y CJK, además de una sólida composición para carteles, maquetas e infografías. En Atlas Cloud, puede acceder a ella a través de una API unificada junto con más de 300 modelos, con créditos gratuitos, un tiempo de actividad del 99,99% y sin necesidad de verificación de organización de OpenAI.

Ver Serie

Gemini Omni Flash

La API de gemini omni pone a disposición de los desarrolladores la familia Gemini Omni Flash nativamente multimodal de Google DeepMind, incluido Gemini Omni 1.1 Flash. Crea vídeos cinematográficos con audio nativo sincronizado, anima imágenes estáticas con un control preciso de los fotogramas inicial y final, o revisa metraje existente mediante ediciones guiadas por texto que conservan el contenido no modificado. Atlas Cloud proporciona una única clave compatible con OpenAI, acceso unificado y precios transparentes de pago por uso. Empieza a desarrollar hoy mismo.

Ver Serie

Grok Imagine

La API Grok Imagine cubre los modelos de imagen, video y voz de xAI, desde Image 2.0 hasta Video 1.5 y xAI TTS v1. Genera imágenes de 1K o 2K en 14 relaciones de aspecto, expande una escena a 15 segundos de movimiento en 1080p, controla tomas con hasta 7 imágenes de referencia, o nárralas en 20 idiomas. Atlas Cloud ejecuta todos los modos en un endpoint, con precios de pago por uso desde $0.02 por imagen y $0.05 por segundo. Empieza a construir hoy.

Ver Serie

Google

Los modelos creativos más potentes de Google están todos disponibles en Atlas Cloud. Veo 3.1 ofrece generación de video cinematográfico, Nano Banana 2 impulsa la creación de imágenes de alta fidelidad y Gemini aporta inteligencia multimodal a cada flujo de trabajo. Acceda a la suite completa de modelos de Google a través de una sola API key con disponibilidad Day-0 y precios de pago por uso (pay-as-you-go).

Ver Serie

Seedance 2.0 Mini

Seedance 2.0 Mini lleva la generación de video multimodal de ByteDance a los flujos de trabajo donde la velocidad y el costo son más importantes. Ofrece las capacidades principales de Seedance 2.0 con un menor consumo de recursos: generación más rápida, menor costo por video y la misma integración de API que ya utiliza. Para los equipos que ejecutan pipelines de alto volumen o crean prototipos a escala, Mini es la opción predeterminada práctica.

Ver Serie

ByteDance

Desde la generación de video cinematográfico hasta la creación de imágenes de alta fidelidad, los modelos más potentes de ByteDance están disponibles en Atlas Cloud. Ejecute Seedance y Seedream a gran escala con los precios de inferencia más bajos y cero gastos generales de infraestructura.

Ver Serie

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos