



La API Grok Imagine cubre los modelos de imagen, video y voz de xAI, desde Image 2.0 hasta Video 1.5 y xAI TTS v1. Genera imágenes de 1K o 2K en 14 relaciones de aspecto, expande una escena a 15 segundos de movimiento en 1080p, controla tomas con hasta 7 imágenes de referencia, o nárralas en 20 idiomas. Atlas Cloud ejecuta todos los modos en un endpoint, con precios de pago por uso desde $0.02 por imagen y $0.05 por segundo. Empieza a construir hoy.
Grok Imagine ha sido desarrollado por xAI. Atlas Cloud (operado por Atlas Cloud AI LLC) proporciona acceso al modelo, pero no es su propietario. Todas las marcas comerciales pertenecen a sus respectivos titulares.
Atlas Cloud le proporciona los últimos modelos creativos líderes en la industria.
Selecciona el modelo correcto de Grok Imagine API según tu tipo de entrada, duración de salida, resolución y precio por llamada.
| Modalidad | Descripción |
|---|---|
| Grok Imagine Image 2.0 T2I API (Text to Image) | Escribe un prompt de hasta 8,000 caracteres y este punto de conexión devuelve una a cuatro imágenes a resolución 1K o 2K. Un nivel de calidad bajo o medio te permite intercambiar esfuerzo de renderizado por rapidez, con un precio de $0.04 por imagen. Es ideal para exploración conceptual, contenido social y producción visual en lotes donde el volumen es importante. |
| Grok Imagine Image 2.0 Edit API (Image to Image) | Proporciona al punto de conexión hasta tres imágenes de referencia con una instrucción en lenguaje natural, y los resultados editados vuelven a 1K o 2K en la proporción de aspecto que establezces o automáticamente. Se aplican los mismos niveles de calidad bajo y medio, y cada imagen cuesta $0.04. El rediseño de productos, los cambios de fondo y las variaciones de diseño rápidas se ejecutan en una sola llamada. |
| Grok Imagine Image Quality T2I API (Text to Image) | Donde los detalles finos importan, este punto de conexión convierte prompts de texto en imágenes fijas pulidas a 1K o 2K y devuelve hasta cuatro variaciones por solicitud a $0.05 por imagen. Las proporciones de aspecto abarcan formatos cuadrado, retrato, panorámico y ultrapanoránico. Úsalo para imágenes destacadas, creatividades publicitarias y renders de productos de calidad de marca. |
| Grok Imagine Image Quality Edit API (Image to Image) | Proporciona una a ocho imágenes de origen con una instrucción de edición y recibe versiones revisadas a 1K o 2K por $0.05 por imagen. Las referencias de múltiples imágenes se direccionan en línea como <IMAGE_0> e <IMAGE_1>, para que los sujetos y estilos se puedan combinar en una sola instrucción. Las actualizaciones de campañas, las transferencias de estilo y las ediciones compuestas son los trabajos habituales. |
| Grok Imagine Image T2I API (Text to Image) | El punto de conexión original de texto a imagen mantiene salida 1K y 2K y lotes de cuatro imágenes al precio de imagen más bajo de la familia, $0.02 por imagen. Lo hace una opción práctica por defecto para canalizaciones de alto volumen, generación de miniaturas y pruebas rápidas de prompts. |
| Grok Imagine Image Edit API (Image to Image) | ¿Necesitas ediciones ligeras a escala? Este punto de conexión acepta una a ocho imágenes con una instrucción de texto y devuelve hasta cuatro resultados editados a 1K o 2K por $0.02 por imagen. La limpieza de catálogos, las variantes estacionales y los pases de diseño iterativo se mantienen económicos. |
| Grok Imagine Video v1.5 T2V API (Text to Video) | Un prompt solo produce uno a quince segundos de video con audio sincronizado nativo a 480p, 720p o 1080p, en siete proporciones de aspecto. La facturación es de $0.08 por segundo de salida. Los tráileres, los anuncios sociales y las escenas narrativas que necesitan sonido incorporado son los más adecuados. |
| Grok Imagine Video v1.5 I2V API (Image to Video) | Proporciona un fotograma inicial y un prompt de movimiento, y v1.5 lo anima durante hasta quince segundos a resoluciones de hasta 1080p con audio generado en el mismo paso. El costo es de $0.08 por segundo. Las rotaciones de productos, la animación de retratos y los activos de campañas de movimiento fijo se ajustan aquí. |
| Grok Imagine Video v1.5 R2V API (Reference to Video) | Una a siete imágenes de referencia guían los personajes, objetos y estilo en pantalla, mientras que hasta tres voces elegidas de 26 presets impulsan el audio hablado. La salida alcanza quince segundos a 480p o 720p por $0.08 por segundo. La narración consistente de personajes, la prueba virtual y las mascotas de marca se benefician más. |
| Grok Imagine Video T2V API (Text to Video) | Los prompts de texto se convierten en clips de uno a quince segundos a 480p o 720p, con siete proporciones de aspecto que cubren entrega panorámica, cuadrada y vertical. A $0.05 por segundo, es la opción de valor para contenido social y paneles de conceptos rápidos. |
| Grok Imagine Video I2V API (Image to Video) | Fija una imagen como el primer fotograma, describe el movimiento que deseas, y el clip se extiende hasta quince segundos a 480p o 720p. El precio se mantiene en $0.05 por segundo, lo que mantiene asequible la animación masiva de fotos de productos y retratos. |
| Grok Imagine Video R2V API (Reference to Video) | Entre una y siete imágenes de referencia determinan quién y qué aparece en pantalla sin fijar un fotograma de apertura fijo. Los clips duran hasta diez segundos a 480p o 720p y cuestan $0.05 por segundo. Úsalo cuando la identidad y el estilo deben mantenerse consistentes de toma a toma. |
| Grok Imagine Video Extend API (Video Extension) | Un mp4 existente de dos a quince segundos puede continuarse por otros dos a diez segundos, guiado por un prompt que establece qué sucede después. La salida coincide con el video de origen y está limitada a 720p, facturada a $0.07 por segundo. Es útil para extender un corte corto a una duración de anuncio requerida. |
| Grok Imagine Video Edit API (Video to Video) | Las instrucciones en lenguaje natural reescriben un mp4 existente mientras que la escena original, el movimiento y el encuadre sobreviven. La salida mantiene la duración de la fuente, limitada a 8.7 segundos, y la facturación sigue el video de entrada a $0.07 por segundo. Las adiciones de accesorios, los cambios de vestuario y el rediseño ocurren sin necesidad de una nueva grabación. |
| xAI TTS v1 API (Text to Speech) | Hasta 15,000 caracteres de texto se convierten en discurso natural con latencia subsegundaria en 20 idiomas, con detección automática de idioma disponible. La entrega es ajustable: velocidad de reproducción de 0.7x a 1.5x, códecs incluyendo mp3, wav y pcm, y tasas de muestreo de hasta 48 kHz. Los voiceovers, los prompts de IVR y la narración en la aplicación son los más naturales. |
Cada parte de la API de Grok Imagine responde a una necesidad de producción diferente, que abarca imágenes fijas 2K en 14 proporciones de aspecto, edición guiada por referencias, video con audio sincronizado integrado y voz en 20 idiomas.

El diálogo, el ambiente y la música se generan en la misma pasada que el movimiento, por lo que los clips de hasta 15 segundos llegan ya sincronizados. No se requiere un paso separado de composición musical ni doblaje antes de publicar.

Grok Imagine Image 2.0 conserva textura fotorrealista a 1K o 2K en 14 proporciones de aspecto, con niveles de calidad bajo y medio a $0,04 por imagen. Una sola generación cubre banners principales, recortes para impresión y primeros planos.

Alimentando una foto, Grok Imagine Video v1.5 la ancla como cuadro inicial y construye el movimiento a su alrededor hasta 1080p. Las tomas de catálogo y retratos se convierten en showreels sin necesidad de nuevas grabaciones.

Hasta tres imágenes de referencia pueden editarse juntas a 1K o 2K, con instrucciones en lenguaje natural que modifican solo los elementos que indiques. A $0,04 por edición, las iteraciones de diseño y los conjuntos de variantes alineadas con la marca se mantienen económicos.

Entre una y siete imágenes de referencia transportan personajes, objetos y estilo en clips de hasta 15 segundos, sin cuadro inicial fijo. Try-on virtual, product placement y series centradas en personajes conservan una apariencia reconocible.

xAI TTS v1 se incluye dentro del mismo conjunto, convirtiendo texto en voz expresiva en 20 idiomas con latencia inferior a un segundo. Combínalo con video generado para videos explicativos narrados, anuncios localizados y asistentes dentro de la aplicación.

El control fino sobre el ritmo, el énfasis y el tono moldea cada lectura, y la síntesis subsegundo hace que la audición de una línea sea casi instantánea. Con más de 80 voces, un único motor cubre audiolibros, doblaje y diálogo de personajes.
Cada fila ejecuta el mismo prompt a través de la API de Grok Imagine y dos modelos rivales en Atlas Cloud, para que el movimiento, la sincronización de audio, el detalle y la tipografía puedan juzgarse en igualdad de condiciones.
Escena cinematográfica de acción real de un mercado nocturno, de aproximadamente 10 segundos. Se abre con un plano de seguimiento en ángulo bajo que se desliza entre puestos humeantes mientras un joven chef de wok, con una camiseta empapada, lanza fideos; una columna de llamas estalla desde el wok e ilumina su rostro de naranja. La cámara hace una panorámica rápida a la derecha hacia un primerísimo primer plano macro de gambas salteando y enrollándose en el aceite, con gotitas salpicando, luego se aleja y sube con grúa por encima del mostrador mientras atrapa el wok giratorio y sirve los fideos en un solo movimiento continuo. Último plano: un gato callejero del mercado salta al mostrador, arrebata una gamba y huye hacia la multitud mientras el chef da media vuelta riendo; la cámara se rompe en una persecución rápida a mano detrás del gato. Asfalto mojado reflejando la luz de las farolas rojas, vapor flotante, profundidad de campo reducida, estética de documental crudo con grano fino. Audio: quemador de gas rugiente, aceite chisporroteando, bullicio del mercado y cucharones sonando, un patrón de tambores ascendente que coincide exactamente con el salto del gato. Relación de aspecto 16:9.
Generated with Grok Imagine Video v1.5 on Atlas Cloud
Generated with Veo3.1 on Atlas Cloud
Generated with Grok Imagine Video on Atlas Cloud
Extreme macro photograph shot at tabletop level, camera lens resting flat on the wooden desk surface at the eye height of a 1:64 scale figure, looking horizontally across a miniature modeling workbench in the exact instant the illusion of scale becomes real. In the mid-ground, a wave of blue-tinted epoxy resin has been frozen mid-curl, its surface just misted with a water sprayer so genuine droplets bead and cling to the glossy resin; three tiny hand-painted surfers in bright orange swim trunks ride down the face of the frozen wave, one crouched low with an arm dragging through the resin, and a spray of real water beads flings off the wave's lip, caught sharp in mid-air with tiny burst highlights on every droplet edge. Behind them, softly out of focus, the hand of a young woman modelmaker hovers in the air holding fine steel tweezers, suspended and enormous like a giant who has wandered into the world she built; only the lower half of her face is visible at the top of the frame, the corner of her mouth curved into a small delighted smile, all of it dissolved into creamy bokeh. Late-afternoon hard sunlight cuts through venetian blinds, painting a row of crisp diagonal light bars and clean shadows across the bare wood and over the resin sea, striping the surfers' shoulders. A single dropped, out-of-focus miniature part — a stray plastic sprue fragment — sits in the extreme foreground as a blurred occluding layer at the lower left, separating planes; strips of blue masking tape edge the resin sea, and negative space is left on the right side for the hovering tweezers. Complementary orange-and-blue palette: cool blue resin and blue tape against warm orange trunks, grounded by the warm honey tone of the oak desk. Shot on 100mm f/2.8 macro lens, ultra-shallow depth of field with buttery focus falloff, telephoto compression from an ultra-low camera position, visible fine film grain, true photographic realism, no illustration, no CGI look. Wide 16:9 aspect ratio, full-bleed horizontal composition.

Generated with Grok Imagine Image 2.0 on Atlas Cloud

Generated with Seedream v5.0 Pro on Atlas Cloud

Generated with Grok Imagine Image Quality on Atlas Cloud
Cada flujo de trabajo que se muestra a continuación funciona con una sola clave compatible con OpenAI, para que un equipo pueda llevar un concepto desde borradores de imagen de Grok Imagine API, ediciones de referencia, video con audio sincronizado y narración localizada, sin cambiar de stack.
Image 2.0 genera 1K borradores en aproximadamente diez segundos en el nivel de baja calidad y hasta cuatro variantes por llamada. Los equipos de diseño exploran muchas direcciones al principio y luego vuelven a renderizar el ganador en 2K.
Envía hasta tres imágenes de referencia a Grok Imagine Image 2.0 Edit y describe el cambio en lenguaje natural. Los equipos de comercio electrónico cambian fondos, redesignan empaques y mantienen un solo producto consistente a lo largo de un catálogo.
xAI TTS v1 convierte guiones en habla expresiva en veinte idiomas y más de ochenta voces con latencia inferior a un segundo. Los equipos de producto lo combinan con video generado para anuncios localizados, tutoriales y narración dentro de la app.
Grok Imagine Video v1.5 genera música, efectos y diálogo sincronizados junto con la imagen en clips de hasta quince segundos a 1080p. Los marketineros obtienen un spot terminado en una sola pasada, sin una sesión de audio separada.
¿Necesitas el mismo personaje en cada toma? Reference-to-video acepta de una a siete imágenes de referencia más una voz de referencia opcional, para que los creadores de series mantengan la identidad y el tono vocal constantes en un clip de quince segundos.
El material existente puede redesignarse mediante edición por lenguaje natural o continuarse con una extensión de dos a diez segundos que coincida con la fuente. Los equipos de postproducción corrigen utilería, vestuario y ritmo sin volver al set.
Vea cómo se comparan los modelos de diferentes proveedores — compare rendimiento, precios y fortalezas únicas para tomar una decisión informada.
| Modelo | Límite de Imágenes de Referencia | Cantidad de Salida | Resolución | Relación de Aspecto |
|---|---|---|---|---|
| Grok Imagine Image Quality | 8 | 1~4 | 2K, 1K | Auto, 1:1, 3:2, 2:3, 3:4, 4:3, 9:16, 16:9, 9:19.5, 19.5:9, 9:20, 20:9, 1:2, 2:1 |
| Nano Banana 2 | 14 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Nano Banana Pro | 10 | 1 | 4K, 2K, 1K | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Seedream 5.0 Lite | 14 | 1~15 | 2K~4K+ | 1:1, 3:2, 2:3, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9 |
| Qwen-Image | 3 | 1~6 | 512P~2K | Width[512, 2048]px, Height[512, 2048]px |
Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.
Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.
Combina modelos avanzados de Grok Imagine con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.
Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.
API Unificada:
Una sola integración para acceder a Grok Imagine, GPT, Gemini y DeepSeek.
Precios Transparentes:
Facturación por Token, soporta modo Serverless.
Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.
Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.
Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.
La API de Grok Imagine es el punto de acceso unificado de Atlas Cloud al stack de generación de Grok Imagine de xAI, que abarca creación de imágenes, edición de imágenes, video y voz. Una sola clave da acceso a todos los modos, incluidos los más recientes Grok Imagine Image 2.0 Text-to-Image y Grok Imagine Image 2.0 Edit, lanzados el 7 de agosto de 2026. La facturación es por uso efectivo por generación exitosa, así que pagas por llamada sin suscripción.
Tres modelos de generación de imágenes conviven: Grok Imagine Image a $0.02 por imagen, Grok Imagine Image Quality a $0.05 y Grok Imagine Image 2.0 desde $0.04, cada uno con su propio endpoint de edición. El video funciona a través de Grok Imagine Video a $0.05 por segundo y Grok Imagine Video v1.5 a $0.08 por segundo, con endpoints de extensión y edición. xAI TTS v1 completa el catálogo con más de 80 voces en 20 idiomas.
Image 2.0 planifica tipografía y composición como lo haría un diseñador, por lo que las composiciones densas y el texto pequeño se mantienen legibles en lugar de disolverse en textura. También expone un nivel de calidad seleccionable, lo que te permite intercambiar tiempo de renderizado por fidelidad con el mismo prompt, algo que los modelos anteriores Image e Image Quality no ofrecen. Tanto las variantes Text-to-Image como Edit comparten este comportamiento.
La facturación es por generación exitosa sin gasto mínimo. Grok Imagine Image 2.0 cuesta $0.04 por imagen a baja calidad y 1K, $0.06 a baja calidad con 2K o calidad media con 1K, y $0.08 a calidad media con 2K, mientras que cada imagen de entrada en el endpoint de edición suma $0.01. Para los demás modelos de imagen, Grok Imagine Image es $0.02 por imagen y Grok Imagine Image Quality es $0.05, y el video comienza en $0.05 por segundo.
Crea una clave de API de Atlas Cloud, luego envía tu prompt y un model id como xai/grok-imagine-image-2.0/text-to-image al endpoint de generación de imágenes. El renderizado es asíncrono, así que la llamada devuelve un request id que debes consultar en el endpoint de predicción hasta que su status pase de processing a completed. Como todos los modelos de Grok Imagine siguen el mismo patrón, agregar video o voz después significa cambiar una sola cadena. Empieza a construir hoy.
Los outputs se renderizan en 1K (1024x1024) o 2K (2048x2048) en 14 relaciones de aspecto, desde cuadrada 1:1 y widescreen 16:9 hasta 9:20 alto y banners ultrawide 20:9. Una sola llamada puede devolver hasta cuatro imágenes, y los prompts pueden llegar a 8.000 caracteres. En el endpoint de edición la relación de aspecto es auto por defecto y sigue tu primera imagen de entrada a menos que la configures explícitamente.
Hasta tres imágenes de origen por request, suministradas como URLs públicas o data URIs en base64. Cuando envías más de una, cítalas en el prompt como <IMAGE_0>, <IMAGE_1> y <IMAGE_2> para que el modelo sepa a qué recurso se aplica cada instrucción. Cada imagen de entrada suma $0.01 a la llamada, y puedes solicitar de una a cuatro variantes editadas a la vez.
Sí. Grok Imagine Video v1.5 produce audio nativo y sincronizado en el mismo paso que la imagen, así que música, efectos de sonido y diálogos se alinean con el movimiento sin requerir una segunda tubería. Su modo reference-to-video acepta una voz de referencia opcional junto con una a siete imágenes de referencia. Los clips duran hasta 15 segundos, alcanzando 1080p en text-to-video e image-to-video.
Elige Image 2.0 cuando el frame contenga tipografía, composición o detalles multiparte que deban mantenerse coherentes, y cuando quieras control directo sobre la relación entre velocidad y fidelidad. Grok Imagine Image Quality se mantiene como una tarifa plana de $0.05 por imagen con el mismo output en 1K y 2K y 14 relaciones de aspecto. Si el volumen importa más que el texto fino, el Grok Imagine Image original a $0.02 por imagen sigue siendo la opción más económica.
Medium es el nivel de calidad por defecto y tarda aproximadamente 84 segundos en 1K porque apunta a la mejor salida del modelo. Configurar quality como low reduce eso a unos 10 segundos, aproximadamente 8x más rápido, a $0.04 en lugar de $0.06 por una imagen en 1K. Haz borradores e iteraciones a baja calidad, luego vuelve a ejecutar solo los prompts ganadores en medium y 2K una vez que la composición esté definida.
Guías, tutoriales y novedades de producto para aprovechar al máximo Atlas Cloud.