Hero background 1Hero background 2Hero background 3

Gemini Omni 1.1 Flash Multimodal Video

Gemini Omni 1.1 Flash es la familia de vídeo nativamente multimodal de Google DeepMind para flujos de producción flexibles. Edita material existente mediante instrucciones de texto, mantén la coherencia visual con hasta 10 imágenes de referencia y 3 clips de vídeo, o amplía una toma en segmentos encadenables de hasta 40 segundos. Accede a todos los flujos de trabajo en Atlas Cloud con una sola clave de API compatible con OpenAI, precios de pago por uso y disponibilidad desde el día 0. Empieza a desarrollar hoy mismo.

Gemini Omni 1.1 Flash ha sido desarrollado por Google. Atlas Cloud (operado por Atlas Cloud AI LLC) proporciona acceso al modelo, pero no es su propietario. Todas las marcas comerciales pertenecen a sus respectivos titulares.

Explorar Modelos Líderes

Atlas Cloud le proporciona los últimos modelos creativos líderes en la industria.

Comparación de los modos de video de Gemini Omni 1.1 Flash

Compara cinco endpoints de Gemini Omni 1.1 Flash según el flujo de entrada, las capacidades de salida y el caso de uso en producción.

ModalidadDescripción
Gemini Omni 1.1 Flash Video Extend APIContinúa un clip existente con una extensión perfectamente integrada de entre 3 y 10 segundos, conservando el audio nativo. Encadena varias extensiones para crear una única toma de video coherente con una duración total de hasta 40 segundos.
Gemini Omni 1.1 Flash Video Edit API¿Necesitas revisar material existente sin reconstruir toda la escena? Usa instrucciones de texto para añadir, eliminar, reemplazar o cambiar el estilo de elementos del video con audio nativo, conservando el contenido que el prompt no menciona.
Gemini Omni 1.1 Flash Reference-to-Video APIProporciona un prompt de texto con hasta 10 imágenes de referencia y 3 clips de video de referencia para generar video cinematográfico con sonido nativo. Este endpoint es adecuado para proyectos que requieren mantener constantes los personajes, productos o la dirección artística entre generaciones.
Gemini Omni 1.1 Flash Image-to-Video APIAnima una imagen fija para convertirla en un clip cinematográfico con sonido, guiado por un prompt de texto. Un fotograma final opcional permite controlar con precisión dónde comienza y termina la toma generada.
Gemini Omni 1.1 Flash Text-to-Video APIA partir de un único prompt de texto, este endpoint produce video cinematográfico con audio nativo sincronizado. Ajusta la duración, la relación de aspecto y la resolución de salida, desde un borrador rápido en 360p hasta un resultado en 4K.

Dentro del kit de herramientas de vídeo Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash combina generación de vídeo, audio nativo, continuidad basada en referencias, control preciso de fotogramas, edición mediante instrucciones y extensiones encadenables en un único flujo de trabajo flexible de Atlas Cloud.

Sonido nativo a partir de cada prompt

Comienza con un prompt de texto y genera un clip cinematográfico con audio nativo sincronizado. Gemini Omni 1.1 Flash te permite controlar la duración, la relación de aspecto y la resolución de salida, desde borradores en 360p hasta 4K. Describe el movimiento, la dirección de cámara, los diálogos, la música y la ambientación en una sola solicitud. Este flujo de trabajo es ideal para tráilers, piezas para redes sociales y momentos narrativos que necesitan desarrollar imagen y sonido conjuntamente.

Extensión de escenas con Gemini Omni 1.1 Flash

Continúa un clip existente con un segmento de 3 a 10 segundos integrado de forma fluida y encadena extensiones para alcanzar hasta 40 segundos. El modelo conserva el contexto visual y el audio nativo para que la nueva acción pertenezca al mismo plano. Crea revelaciones más largas, persecuciones o historias de producto sin reiniciar la secuencia cuando la narrativa necesite más espacio.

Continuidad visual guiada por referencias

Proporciona un prompt de texto con hasta 10 imágenes de referencia y 3 clips de vídeo de referencia para guiar una generación coherente con audio nativo. Las imágenes pueden fijar un personaje, producto, ubicación o dirección artística, mientras que las referencias de vídeo orientan el movimiento y el comportamiento del plano. Usa esta opción cuando la identidad y el lenguaje visual repetibles sean importantes en activos de campaña, escenas episódicas o contenido de marca.

Control del primer y último fotograma

Define la imagen inicial y, opcionalmente, proporciona un último fotograma para controlar dónde termina el plano. Gemini Omni 1.1 Flash anima la imagen fija para convertirla en un clip cinematográfico con sonido nativo e interpola el movimiento hacia el punto final indicado. Esta estructura de inicio y final resulta adecuada para revelaciones de producto, transiciones fluidas, cortes por coincidencia y movimientos de cámara planificados que deben concluir en una composición precisa.

Edita sin reconstruir el plano

Modifica un vídeo existente mediante una instrucción de texto directa, conservando todo lo que el prompt no mencione. Añade, elimina, sustituye o cambia el estilo de los elementos, y conserva el audio nativo en el resultado editado. Cuando una toma sólida solo necesita un objeto, entorno o tratamiento visual nuevo, este flujo de trabajo enfocado preserva el resto del trabajo y evita reconstruir la escena desde cero.

Gemini Omni 1.1 Flash en una sola API

Pasa de texto a vídeo, de imagen a vídeo, a generación basada en referencias, edición y extensión mediante Atlas Cloud con una sola clave de API. La facturación transparente de pago por uso mantiene la experimentación separada de las suscripciones o los compromisos mínimos. Los desarrolladores pueden crear borradores en 360p y solicitar salidas de hasta 4K cuando el nivel de detalle final sea importante. Esta vía unificada facilita incorporar toda la familia de modelos a los flujos de trabajo de producción.

Duelo de vídeo con un solo prompt: Gemini Omni 1.1 Flash

Descubre cómo Gemini Omni 1.1 Flash, Seedance 2.5 y el anterior Gemini Omni Flash interpretan los mismos dos prompts cinematográficos.

Prompt

Un microfilme de fantasía de 8–10 segundos ambientado en el interior de un taller artesanal de soplado de vidrio, ennegrecido por el hollín: comienza con un acercamiento macro extremo a una masa de vidrio fundido de color rojo incandescente que gira rápidamente en el extremo de una caña de soplar; su superficie viscosa se pliega, brilla y refracta el fuego del horno mientras un artesano de arcilla hace rodar continuamente la caña. La cámara orbita estrechamente alrededor del antebrazo en movimiento del artesano mientras unas pinzas metálicas golpean al ritmo y pellizcan el vidrio fundido; sin ningún corte, la masa incandescente se estira, se enfría y se transforma gradualmente en un colibrí de vidrio transparente con un corazón ardiente. Barrido rápido hacia una toma de seguimiento a alta velocidad mientras el colibrí bate sus alas cristalinas, se lanza sobre tarros de pigmento abiertos y arrastra turbulentas estelas de polvo azul pavo real y magenta por el aire; cada aleteo dispersa partículas que chocan, giran y centellean a través de su silueta refractada. El ave gira bruscamente hacia una burbuja de vidrio flotante y la picotea exactamente en el último golpe musical; corte a una espectacular vista cenital mientras la burbuja estalla hacia fuera y sus fragmentos finísimos se transforman continuamente en suaves pétalos de flores translúcidos que giran por todo el taller. Stop-motion refinado de arcilla fusionado con texturas luminosas de vidrio artístico semitransparente, imperfecciones artesanales táctiles, reflejos, refracciones y cáusticas convincentes, reverberación del calor, deformación del vidrio y física de partículas; luz naranja rojiza del horno como iluminación principal, luz de contorno de luna en cian frío, paleta de negros y dorados intensos al inicio que explota en azul pavo real y magenta saturados durante el clímax. Movimiento de cámara rápido y fluido, gran coherencia temporal y de los personajes, sin pausas ni relleno en cámara lenta. Audio: rugido del horno, zumbido del vidrio girando, golpes metálicos rítmicos sincronizados con cada pellizco y aleteo, polvo desplazándose a toda velocidad, un agudo tintineo cristalino en el impacto y un brillante final en cascada de vidrio convertido en pétalos; sin pantallas, interfaces, paneles de control, barras de progreso, gráficos, subtítulos, logotipos ni texto. Relación de aspecto 16:9.

Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud

Generated with Seedance 2.5 Text-to-Video on Atlas Cloud

Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud

Prompt

Una secuencia macro ultrafotorrealista de documental de naturaleza, de 8–10 segundos, en el interior de una gruta rocosa de pozas intermareales durante la marea baja: un pulpo de coco de intenso color coral anaranjado improvisa una percusión, con sus ocho brazos anatómicamente coherentes moviéndose de forma independiente pero natural mientras sus ventosas golpean conchas nacaradas, caparazones huecos de erizo de mar y vidrio marino liso en un ritmo cada vez más denso, con deformación, contacto, rebote y peso de los objetos precisos. Comienza con una toma macro lateral a ras del agua que se desliza junto al pulpo mientras las gotas centellean sobre su piel texturizada y cada impacto envía pequeñas ondas por el agua de mar cian y fría; corte a una cámara en ángulo extremadamente bajo que se entreteje rápidamente entre los brazos y los instrumentos en movimiento, manteniendo una continuidad clara de las extremidades y una oclusión realista. De repente entra un cangrejo ermitaño, agarra la concha principal y huye; barrido rápido hacia una persecución veloz y juguetona mientras el pulpo salta y fluye sobre la roca resbaladiza e irregular, agarrándose, soltando y empujándose con una fricción convincente mientras las patas del cangrejo repiquetean sobre los guijarros. Justo antes de que una crecida entrante inunde la gruta, el pulpo recupera la concha, la coloca firmemente y asesta un único golpe final contundente; ascenso rápido de la cámara hacia una vista cenital mientras la ola estalla alrededor del pulpo y la espuma radiante forma una composición casi perfectamente circular. Cáusticas submarinas danzantes producidas por la luz solar fragmentada, agua verde azulado fría en contraste con el sujeto coral anaranjado, salpicaduras cristalinas, burbujas, arena suspendida, reflejos sobre la roca mojada, poca profundidad de campo macro, HDR cinematográfico, texturas naturales nítidas como una cuchilla, movimiento fluido y continuo, transiciones de cámara a alta velocidad sin cámara lenta. Solo audio diegético, perfectamente sincronizado: golpes distintivos de conchas, golpes huecos de caparazones de erizo, chasquidos brillantes del vidrio, liberación de las ventosas, roces de las pinzas y patas del cangrejo ermitaño, oleaje creciente y, después, el golpe final y el estruendo de la ola en alineación rítmica exacta; sin música, narración, texto, subtítulos, logotipos, interfaces, paneles de control, gráficos, barras de progreso, pantalla dividida, extremidades adicionales, brazos fusionados o duplicados, anatomía deformada, objetos flotantes, penetración ni física de contacto defectuosa, movimiento gomoso, parpadeo temporal, cortes bruscos, posiciones de conchas incoherentes ni estilo de dibujos animados. Documental cinematográfico de naturaleza y fauna en macro ultrafotorrealista, relación de aspecto 16:9.

Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud

Generated with Seedance 2.5 Text-to-Video on Atlas Cloud

Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud

Del briefing a escenas terminadas con Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash convierte briefings, imágenes fijas, material de referencia y clips existentes en vídeos de campaña, historias de personajes coherentes, transiciones controladas, escenas ampliadas y recursos sociales listos para producción, con audio nativo.

Extensiones de historias con Gemini Omni 1.1 Flash

Los clips existentes obtienen una continuación de tres a diez segundos combinada a la perfección, y las extensiones encadenadas pueden alcanzar los cuarenta segundos. Los cineastas y equipos de contenido seriado pueden ampliar planos únicos coherentes sin reconstruir cada escena.

Revisiones de campaña de precisión

¿Necesitas un producto, fondo o estilo visual nuevo? Aplica una edición indicada mediante texto y conserva los elementos no mencionados, para que los equipos de marketing creen variantes específicas sin recrear el clip de origen desde cero cada vez.

Universos de marca con Gemini Omni 1.1 Flash

Con hasta diez imágenes de referencia y tres clips de vídeo, el modelo puede mantener un personaje, producto o dirección artística entre generaciones. Los estudios de marca obtienen escenas relacionadas para lanzamientos con una identidad visual más coherente.

Transiciones controladas entre fotogramas clave

Parte de una imagen fija y proporciona opcionalmente el fotograma final para que el modelo anime un recorrido cinematográfico entre ambas composiciones. Los diseñadores obtienen un control preciso de la apertura y el cierre para revelaciones, bucles y cambios de escena.

Producción de vídeo social mediante prompts

Un único briefing de texto se convierte en un clip cinematográfico con audio nativo sincronizado, mientras que la duración, la relación de aspecto y la resolución de salida siguen siendo seleccionables. Los creadores pueden adaptar anuncios e historias sociales a diversos formatos de publicación.

Previsualización con Gemini Omni 1.1 Flash

Al probar un plano, crea prototipos en 360p, compara las direcciones más prometedoras y lleva los conceptos seleccionados hasta una salida en 4K. Los directores y desarrolladores creativos pueden validar el movimiento, el encuadre, el sonido y el ritmo antes de la producción final.

¿Qué posición ocupa Gemini Omni 1.1 Flash en la generación de vídeo?

Compara Gemini Omni 1.1 Flash con los principales modelos de texto a vídeo según la duración del clip, la resolución máxima, la compatibilidad con audio nativo y la frecuencia de fotogramas de salida.

ModeloDuración de salidaResolución máximaAudio nativoFrecuencia de fotogramas
Gemini Omni 1.1 Flash Text-to-Video3–10 segundos4K√24 FPS
MiniMax H3 Text-to-Video4–15 segundos2K√24 FPS
Wan-3.0 Text-to-video2–30 segundos1080P√30 FPS

Cómo usar Gemini Omni 1.1 Flash en Atlas Cloud

Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.

Crea una cuenta en Atlas Cloud

Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.

Por Qué Usar Gemini Omni 1.1 Flash en Atlas Cloud

Combina modelos avanzados de Gemini Omni 1.1 Flash con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.

Rendimiento y Flexibilidad

Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.

API Unificada:
Una sola integración para acceder a Gemini Omni 1.1 Flash, GPT, Gemini y DeepSeek.

Precios Transparentes:
Facturación por Token, soporta modo Serverless.

Empresa y Escala

Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.

Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.

Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.

Preguntas y respuestas sobre la API de Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash es un modelo nativamente multimodal de generación y edición de video desarrollado por Google DeepMind. En Atlas Cloud, admite cinco flujos de trabajo específicos para tareas de generación, creación guiada por referencias, edición y extensión. Sus videos pueden incluir audio nativo sincronizado.

Puede generar video a partir de texto, animar una imagen fija, seguir referencias visuales, editar un clip existente a partir de una instrucción de texto o continuar una escena. Image to Video también puede interpolar hacia un último fotograma proporcionado para controlar las transiciones entre tomas.

Crea una clave de API de Atlas Cloud y selecciona el endpoint que corresponda a tu flujo de trabajo. Envía un prompt con cualquier imagen, video o material de referencia requerido, de acuerdo con el esquema de parámetros de ese endpoint. Empieza con una toma descrita con claridad y perfecciona las entradas después de revisar el resultado.

Elige Text to Video para la generación basada en prompts e Image to Video para animar un fotograma fijo. Reference to Video ayuda a orientar la identidad o la dirección artística, mientras que Video Edit modifica material existente y Video Extend continúa una toma ya establecida.

Text to Video ofrece controles para la duración, la relación de aspecto y la resolución de salida, desde 360p hasta 4K. Image to Video acepta una imagen inicial y puede usar un último fotograma opcional. Reference to Video admite hasta 10 imágenes de referencia y 3 clips de video de referencia.

Sí, los cinco flujos de trabajo de Atlas Cloud están diseñados para producir videos con audio nativo sincronizado. Cuando el audio sea importante para la escena, describe claramente en el prompt los diálogos, el ambiente, la música o los efectos de sonido previstos.

Atlas Cloud ofrece acceso con pago por uso. El precio base estándar es de $0.041 para Text to Video, Reference to Video, Video Edit y Video Extend, mientras que Image to Video tiene un precio base estándar de $0.043. Estas cifras corresponden a los precios estándar del backend, no a tarifas promocionales temporales.

Cada extensión puede añadir entre 3 y 10 segundos, y las extensiones pueden encadenarse hasta que una sola toma coherente alcance un total de 40 segundos. El modelo utiliza el clip existente como contexto mientras continúa tanto los elementos visuales como el audio nativo.

Usa Reference to Video con materiales de referencia claros y compatibles, incluidos hasta 10 imágenes y 3 clips de video. Para animar una imagen, proporciona un fotograma inicial sólido y un último fotograma opcional cuando necesites controlar el destino. La salida generativa aún puede desviarse, así que revisa la identidad, la iluminación, el movimiento y el audio después de cada generación o extensión.

Google describe 1080p y 4K como opciones de salida mejoradas mediante escalado, no como resoluciones de generación nativas. Usa 360p para las iteraciones preliminares y selecciona una resolución superior cuando la composición y el movimiento cumplan tus requisitos.

Explorar Más Series

Seedance 2.5

¡La API de Seedance 2.5 ya está disponible en Atlas Cloud! Ofrece a los desarrolladores el modelo de video más reciente de ByteDance. Genera hasta 30 segundos de video nativo en una sola pasada a partir de texto, una sola imagen o hasta 50 referencias multimodales, con audio sincronizado y texto multilingüe en el encuadre. En Atlas Cloud puede acceder a él mediante una única clave, con consistencia del sujeto y físicas mejoradas que mantienen la coherencia en las tomas largas.

Ver Serie

Wan 3.0

La API Wan 3.0 es la próxima generación de la familia de videos Wan de Alibaba, diseñada para llevar la generación de formato largo, el control de múltiples referencias y la calidad audiovisual a nuevas alturas. Atlas Cloud ya aloja Wan 2.7, 2.6 y 2.5, y Wan 3.0 se ejecuta con la misma clave unificada sin necesidad de configuración adicional. Empieza a construir hoy mismo. Desplázate hacia abajo hasta la galería para ver lo que Wan 3.0 puede crear.

Ver Serie

MiniMax H3

MiniMax H3 es la familia de vídeo multimodal de MiniMax para la creación guiada por texto, imagen y referencias. En las rutas compatibles, conserva los sujetos del material de referencia, ofrece relaciones de aspecto flexibles y combina el sonido generado con los elementos visuales mediante H3 Developer, con perfiles de salida seleccionados según el endpoint. Atlas Cloud reúne toda la familia bajo una única clave compatible con OpenAI, con precios transparentes de pago por uso a partir de la tarifa estándar de $0.038 por segundo. Empieza a crear hoy mismo.

Ver Serie

Seedream 5.0 Pro

La API de Seedream 5.0 Pro ofrece a los desarrolladores el modelo de edición de imágenes controlable de ByteDance en Atlas Cloud. Sitúa las ediciones con precisión mediante anclajes y coordenadas, separa las imágenes en capas editables, fusiona múltiples referencias y empareja colores y materiales exactos, con texto multilingüe a 2K y 3K. ¡En Atlas Cloud puede acceder a él mediante una sola clave!

Ver Serie

Seedance 2.0

Seedance 2.0 es el modelo de vídeo para producción de ByteDance, diseñado para crear planos con precisión. Convierte prompts en vídeo, anima una imagen del primer fotograma con orientación opcional del último fotograma o da forma a los resultados mediante medios de referencia y búsqueda web opcional. Atlas Cloud reúne estos flujos de trabajo en una única API unificada, con precios transparentes de pago por uso y una sola clave compatible con OpenAI. Empieza a crear hoy mismo.

Ver Serie

GPT Image 2.5

La familia gpt-image-2.5 de OpenAI ofrece a los desarrolladores la posibilidad de elegir entre Flare y Sunburst para flujos de trabajo de producción de imágenes. Renderiza con resoluciones arbitrarias de hasta 3840x2160 y elige entre cinco niveles de calidad, incluidos xhigh y max, para adaptarte a requisitos de salida específicos. Atlas Cloud proporciona inferencia REST lista para usar, sin arranques en frío y con precios estándar desde $0.004 por generación. Empieza a crear hoy mismo.

Ver Serie

GPT Image 2

La API de GPT Image 2 ofrece a los desarrolladores acceso al último modelo de imágenes de OpenAI, el sucesor de GPT Image 1.5. Genera y edita imágenes con una representación de texto precisa en caracteres latinos y CJK, además de una sólida composición para carteles, maquetas e infografías. En Atlas Cloud, puede acceder a ella a través de una API unificada junto con más de 300 modelos, con créditos gratuitos, un tiempo de actividad del 99,99% y sin necesidad de verificación de organización de OpenAI.

Ver Serie

Gemini Omni Flash

Gemini Omni es la familia de vídeo nativamente multimodal de Google DeepMind para la creación y edición guiadas por prompts. Genera vídeos a partir de texto, anima imágenes estáticas o modifica metraje existente con referencias visuales opcionales, preservando el contenido que no se haya modificado. Los controles flexibles de resolución, relación de aspecto y duración permiten adaptarse a diversos flujos de producción. Atlas Cloud unifica el acceso con precios transparentes de pago por uso. Empieza a crear hoy mismo.

Ver Serie

Grok Imagine

La API Grok Imagine cubre los modelos de imagen, video y voz de xAI, desde Image 2.0 hasta Video 1.5 y xAI TTS v1. Genera imágenes de 1K o 2K en 14 relaciones de aspecto, expande una escena a 15 segundos de movimiento en 1080p, controla tomas con hasta 7 imágenes de referencia, o nárralas en 20 idiomas. Atlas Cloud ejecuta todos los modos en un endpoint, con precios de pago por uso desde $0.02 por imagen y $0.05 por segundo. Empieza a construir hoy.

Ver Serie

Google

Los modelos creativos más potentes de Google están todos disponibles en Atlas Cloud. Veo 3.1 ofrece generación de video cinematográfico, Nano Banana 2 impulsa la creación de imágenes de alta fidelidad y Gemini aporta inteligencia multimodal a cada flujo de trabajo. Acceda a la suite completa de modelos de Google a través de una sola API key con disponibilidad Day-0 y precios de pago por uso (pay-as-you-go).

Ver Serie

Seedance 2.0 Mini

Seedance 2.0 Mini lleva la generación de video multimodal de ByteDance a los flujos de trabajo donde la velocidad y el costo son más importantes. Ofrece las capacidades principales de Seedance 2.0 con un menor consumo de recursos: generación más rápida, menor costo por video y la misma integración de API que ya utiliza. Para los equipos que ejecutan pipelines de alto volumen o crean prototipos a escala, Mini es la opción predeterminada práctica.

Ver Serie

ByteDance

Desde la generación de video cinematográfico hasta la creación de imágenes de alta fidelidad, los modelos más potentes de ByteDance están disponibles en Atlas Cloud. Ejecute Seedance y Seedream a gran escala con los precios de inferencia más bajos y cero gastos generales de infraestructura.

Ver Serie

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos