


Gemini Omni 1.1 Flash es la familia de vídeo nativamente multimodal de Google DeepMind para flujos de producción flexibles. Edita material existente mediante instrucciones de texto, mantén la coherencia visual con hasta 10 imágenes de referencia y 3 clips de vídeo, o amplía una toma en segmentos encadenables de hasta 40 segundos. Accede a todos los flujos de trabajo en Atlas Cloud con una sola clave de API compatible con OpenAI, precios de pago por uso y disponibilidad desde el día 0. Empieza a desarrollar hoy mismo.
Gemini Omni 1.1 Flash ha sido desarrollado por Google. Atlas Cloud (operado por Atlas Cloud AI LLC) proporciona acceso al modelo, pero no es su propietario. Todas las marcas comerciales pertenecen a sus respectivos titulares.
Atlas Cloud le proporciona los últimos modelos creativos líderes en la industria.
Compara cinco endpoints de Gemini Omni 1.1 Flash según el flujo de entrada, las capacidades de salida y el caso de uso en producción.
| Modalidad | Descripción |
|---|---|
| Gemini Omni 1.1 Flash Video Extend API | Continúa un clip existente con una extensión perfectamente integrada de entre 3 y 10 segundos, conservando el audio nativo. Encadena varias extensiones para crear una única toma de video coherente con una duración total de hasta 40 segundos. |
| Gemini Omni 1.1 Flash Video Edit API | ¿Necesitas revisar material existente sin reconstruir toda la escena? Usa instrucciones de texto para añadir, eliminar, reemplazar o cambiar el estilo de elementos del video con audio nativo, conservando el contenido que el prompt no menciona. |
| Gemini Omni 1.1 Flash Reference-to-Video API | Proporciona un prompt de texto con hasta 10 imágenes de referencia y 3 clips de video de referencia para generar video cinematográfico con sonido nativo. Este endpoint es adecuado para proyectos que requieren mantener constantes los personajes, productos o la dirección artística entre generaciones. |
| Gemini Omni 1.1 Flash Image-to-Video API | Anima una imagen fija para convertirla en un clip cinematográfico con sonido, guiado por un prompt de texto. Un fotograma final opcional permite controlar con precisión dónde comienza y termina la toma generada. |
| Gemini Omni 1.1 Flash Text-to-Video API | A partir de un único prompt de texto, este endpoint produce video cinematográfico con audio nativo sincronizado. Ajusta la duración, la relación de aspecto y la resolución de salida, desde un borrador rápido en 360p hasta un resultado en 4K. |
Gemini Omni 1.1 Flash combina generación de vídeo, audio nativo, continuidad basada en referencias, control preciso de fotogramas, edición mediante instrucciones y extensiones encadenables en un único flujo de trabajo flexible de Atlas Cloud.
Comienza con un prompt de texto y genera un clip cinematográfico con audio nativo sincronizado. Gemini Omni 1.1 Flash te permite controlar la duración, la relación de aspecto y la resolución de salida, desde borradores en 360p hasta 4K. Describe el movimiento, la dirección de cámara, los diálogos, la música y la ambientación en una sola solicitud. Este flujo de trabajo es ideal para tráilers, piezas para redes sociales y momentos narrativos que necesitan desarrollar imagen y sonido conjuntamente.
Continúa un clip existente con un segmento de 3 a 10 segundos integrado de forma fluida y encadena extensiones para alcanzar hasta 40 segundos. El modelo conserva el contexto visual y el audio nativo para que la nueva acción pertenezca al mismo plano. Crea revelaciones más largas, persecuciones o historias de producto sin reiniciar la secuencia cuando la narrativa necesite más espacio.
Proporciona un prompt de texto con hasta 10 imágenes de referencia y 3 clips de vídeo de referencia para guiar una generación coherente con audio nativo. Las imágenes pueden fijar un personaje, producto, ubicación o dirección artística, mientras que las referencias de vídeo orientan el movimiento y el comportamiento del plano. Usa esta opción cuando la identidad y el lenguaje visual repetibles sean importantes en activos de campaña, escenas episódicas o contenido de marca.
Define la imagen inicial y, opcionalmente, proporciona un último fotograma para controlar dónde termina el plano. Gemini Omni 1.1 Flash anima la imagen fija para convertirla en un clip cinematográfico con sonido nativo e interpola el movimiento hacia el punto final indicado. Esta estructura de inicio y final resulta adecuada para revelaciones de producto, transiciones fluidas, cortes por coincidencia y movimientos de cámara planificados que deben concluir en una composición precisa.
Modifica un vídeo existente mediante una instrucción de texto directa, conservando todo lo que el prompt no mencione. Añade, elimina, sustituye o cambia el estilo de los elementos, y conserva el audio nativo en el resultado editado. Cuando una toma sólida solo necesita un objeto, entorno o tratamiento visual nuevo, este flujo de trabajo enfocado preserva el resto del trabajo y evita reconstruir la escena desde cero.
Pasa de texto a vídeo, de imagen a vídeo, a generación basada en referencias, edición y extensión mediante Atlas Cloud con una sola clave de API. La facturación transparente de pago por uso mantiene la experimentación separada de las suscripciones o los compromisos mínimos. Los desarrolladores pueden crear borradores en 360p y solicitar salidas de hasta 4K cuando el nivel de detalle final sea importante. Esta vía unificada facilita incorporar toda la familia de modelos a los flujos de trabajo de producción.
Descubre cómo Gemini Omni 1.1 Flash, Seedance 2.5 y el anterior Gemini Omni Flash interpretan los mismos dos prompts cinematográficos.
Un microfilme de fantasía de 8–10 segundos ambientado en el interior de un taller artesanal de soplado de vidrio, ennegrecido por el hollín: comienza con un acercamiento macro extremo a una masa de vidrio fundido de color rojo incandescente que gira rápidamente en el extremo de una caña de soplar; su superficie viscosa se pliega, brilla y refracta el fuego del horno mientras un artesano de arcilla hace rodar continuamente la caña. La cámara orbita estrechamente alrededor del antebrazo en movimiento del artesano mientras unas pinzas metálicas golpean al ritmo y pellizcan el vidrio fundido; sin ningún corte, la masa incandescente se estira, se enfría y se transforma gradualmente en un colibrí de vidrio transparente con un corazón ardiente. Barrido rápido hacia una toma de seguimiento a alta velocidad mientras el colibrí bate sus alas cristalinas, se lanza sobre tarros de pigmento abiertos y arrastra turbulentas estelas de polvo azul pavo real y magenta por el aire; cada aleteo dispersa partículas que chocan, giran y centellean a través de su silueta refractada. El ave gira bruscamente hacia una burbuja de vidrio flotante y la picotea exactamente en el último golpe musical; corte a una espectacular vista cenital mientras la burbuja estalla hacia fuera y sus fragmentos finísimos se transforman continuamente en suaves pétalos de flores translúcidos que giran por todo el taller. Stop-motion refinado de arcilla fusionado con texturas luminosas de vidrio artístico semitransparente, imperfecciones artesanales táctiles, reflejos, refracciones y cáusticas convincentes, reverberación del calor, deformación del vidrio y física de partículas; luz naranja rojiza del horno como iluminación principal, luz de contorno de luna en cian frío, paleta de negros y dorados intensos al inicio que explota en azul pavo real y magenta saturados durante el clímax. Movimiento de cámara rápido y fluido, gran coherencia temporal y de los personajes, sin pausas ni relleno en cámara lenta. Audio: rugido del horno, zumbido del vidrio girando, golpes metálicos rítmicos sincronizados con cada pellizco y aleteo, polvo desplazándose a toda velocidad, un agudo tintineo cristalino en el impacto y un brillante final en cascada de vidrio convertido en pétalos; sin pantallas, interfaces, paneles de control, barras de progreso, gráficos, subtítulos, logotipos ni texto. Relación de aspecto 16:9.
Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud
Una secuencia macro ultrafotorrealista de documental de naturaleza, de 8–10 segundos, en el interior de una gruta rocosa de pozas intermareales durante la marea baja: un pulpo de coco de intenso color coral anaranjado improvisa una percusión, con sus ocho brazos anatómicamente coherentes moviéndose de forma independiente pero natural mientras sus ventosas golpean conchas nacaradas, caparazones huecos de erizo de mar y vidrio marino liso en un ritmo cada vez más denso, con deformación, contacto, rebote y peso de los objetos precisos. Comienza con una toma macro lateral a ras del agua que se desliza junto al pulpo mientras las gotas centellean sobre su piel texturizada y cada impacto envía pequeñas ondas por el agua de mar cian y fría; corte a una cámara en ángulo extremadamente bajo que se entreteje rápidamente entre los brazos y los instrumentos en movimiento, manteniendo una continuidad clara de las extremidades y una oclusión realista. De repente entra un cangrejo ermitaño, agarra la concha principal y huye; barrido rápido hacia una persecución veloz y juguetona mientras el pulpo salta y fluye sobre la roca resbaladiza e irregular, agarrándose, soltando y empujándose con una fricción convincente mientras las patas del cangrejo repiquetean sobre los guijarros. Justo antes de que una crecida entrante inunde la gruta, el pulpo recupera la concha, la coloca firmemente y asesta un único golpe final contundente; ascenso rápido de la cámara hacia una vista cenital mientras la ola estalla alrededor del pulpo y la espuma radiante forma una composición casi perfectamente circular. Cáusticas submarinas danzantes producidas por la luz solar fragmentada, agua verde azulado fría en contraste con el sujeto coral anaranjado, salpicaduras cristalinas, burbujas, arena suspendida, reflejos sobre la roca mojada, poca profundidad de campo macro, HDR cinematográfico, texturas naturales nítidas como una cuchilla, movimiento fluido y continuo, transiciones de cámara a alta velocidad sin cámara lenta. Solo audio diegético, perfectamente sincronizado: golpes distintivos de conchas, golpes huecos de caparazones de erizo, chasquidos brillantes del vidrio, liberación de las ventosas, roces de las pinzas y patas del cangrejo ermitaño, oleaje creciente y, después, el golpe final y el estruendo de la ola en alineación rítmica exacta; sin música, narración, texto, subtítulos, logotipos, interfaces, paneles de control, gráficos, barras de progreso, pantalla dividida, extremidades adicionales, brazos fusionados o duplicados, anatomía deformada, objetos flotantes, penetración ni física de contacto defectuosa, movimiento gomoso, parpadeo temporal, cortes bruscos, posiciones de conchas incoherentes ni estilo de dibujos animados. Documental cinematográfico de naturaleza y fauna en macro ultrafotorrealista, relación de aspecto 16:9.
Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud
Gemini Omni 1.1 Flash convierte briefings, imágenes fijas, material de referencia y clips existentes en vídeos de campaña, historias de personajes coherentes, transiciones controladas, escenas ampliadas y recursos sociales listos para producción, con audio nativo.
Los clips existentes obtienen una continuación de tres a diez segundos combinada a la perfección, y las extensiones encadenadas pueden alcanzar los cuarenta segundos. Los cineastas y equipos de contenido seriado pueden ampliar planos únicos coherentes sin reconstruir cada escena.
¿Necesitas un producto, fondo o estilo visual nuevo? Aplica una edición indicada mediante texto y conserva los elementos no mencionados, para que los equipos de marketing creen variantes específicas sin recrear el clip de origen desde cero cada vez.
Con hasta diez imágenes de referencia y tres clips de vídeo, el modelo puede mantener un personaje, producto o dirección artística entre generaciones. Los estudios de marca obtienen escenas relacionadas para lanzamientos con una identidad visual más coherente.
Parte de una imagen fija y proporciona opcionalmente el fotograma final para que el modelo anime un recorrido cinematográfico entre ambas composiciones. Los diseñadores obtienen un control preciso de la apertura y el cierre para revelaciones, bucles y cambios de escena.
Un único briefing de texto se convierte en un clip cinematográfico con audio nativo sincronizado, mientras que la duración, la relación de aspecto y la resolución de salida siguen siendo seleccionables. Los creadores pueden adaptar anuncios e historias sociales a diversos formatos de publicación.
Al probar un plano, crea prototipos en 360p, compara las direcciones más prometedoras y lleva los conceptos seleccionados hasta una salida en 4K. Los directores y desarrolladores creativos pueden validar el movimiento, el encuadre, el sonido y el ritmo antes de la producción final.
Compara Gemini Omni 1.1 Flash con los principales modelos de texto a vídeo según la duración del clip, la resolución máxima, la compatibilidad con audio nativo y la frecuencia de fotogramas de salida.
| Modelo | Duración de salida | Resolución máxima | Audio nativo | Frecuencia de fotogramas |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash Text-to-Video | 3–10 segundos | 4K | √ | 24 FPS |
| MiniMax H3 Text-to-Video | 4–15 segundos | 2K | √ | 24 FPS |
| Wan-3.0 Text-to-video | 2–30 segundos | 1080P | √ | 30 FPS |
Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.
Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.
Combina modelos avanzados de Gemini Omni 1.1 Flash con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.
Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.
API Unificada:
Una sola integración para acceder a Gemini Omni 1.1 Flash, GPT, Gemini y DeepSeek.
Precios Transparentes:
Facturación por Token, soporta modo Serverless.
Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.
Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.
Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.
Gemini Omni 1.1 Flash es un modelo nativamente multimodal de generación y edición de video desarrollado por Google DeepMind. En Atlas Cloud, admite cinco flujos de trabajo específicos para tareas de generación, creación guiada por referencias, edición y extensión. Sus videos pueden incluir audio nativo sincronizado.
Puede generar video a partir de texto, animar una imagen fija, seguir referencias visuales, editar un clip existente a partir de una instrucción de texto o continuar una escena. Image to Video también puede interpolar hacia un último fotograma proporcionado para controlar las transiciones entre tomas.
Crea una clave de API de Atlas Cloud y selecciona el endpoint que corresponda a tu flujo de trabajo. Envía un prompt con cualquier imagen, video o material de referencia requerido, de acuerdo con el esquema de parámetros de ese endpoint. Empieza con una toma descrita con claridad y perfecciona las entradas después de revisar el resultado.
Elige Text to Video para la generación basada en prompts e Image to Video para animar un fotograma fijo. Reference to Video ayuda a orientar la identidad o la dirección artística, mientras que Video Edit modifica material existente y Video Extend continúa una toma ya establecida.
Text to Video ofrece controles para la duración, la relación de aspecto y la resolución de salida, desde 360p hasta 4K. Image to Video acepta una imagen inicial y puede usar un último fotograma opcional. Reference to Video admite hasta 10 imágenes de referencia y 3 clips de video de referencia.
Sí, los cinco flujos de trabajo de Atlas Cloud están diseñados para producir videos con audio nativo sincronizado. Cuando el audio sea importante para la escena, describe claramente en el prompt los diálogos, el ambiente, la música o los efectos de sonido previstos.
Atlas Cloud ofrece acceso con pago por uso. El precio base estándar es de $0.041 para Text to Video, Reference to Video, Video Edit y Video Extend, mientras que Image to Video tiene un precio base estándar de $0.043. Estas cifras corresponden a los precios estándar del backend, no a tarifas promocionales temporales.
Cada extensión puede añadir entre 3 y 10 segundos, y las extensiones pueden encadenarse hasta que una sola toma coherente alcance un total de 40 segundos. El modelo utiliza el clip existente como contexto mientras continúa tanto los elementos visuales como el audio nativo.
Usa Reference to Video con materiales de referencia claros y compatibles, incluidos hasta 10 imágenes y 3 clips de video. Para animar una imagen, proporciona un fotograma inicial sólido y un último fotograma opcional cuando necesites controlar el destino. La salida generativa aún puede desviarse, así que revisa la identidad, la iluminación, el movimiento y el audio después de cada generación o extensión.
Google describe 1080p y 4K como opciones de salida mejoradas mediante escalado, no como resoluciones de generación nativas. Usa 360p para las iteraciones preliminares y selecciona una resolución superior cuando la composición y el movimiento cumplan tus requisitos.
Guías, tutoriales y novedades de producto para aprovechar al máximo Atlas Cloud.