MiniMax H3 Developer ya está disponible — 60% de descuento, desde 0,02 $ por segundo

Conversational Video Editing with gemini omni API

La API de gemini omni pone a disposición de los desarrolladores la familia Gemini Omni Flash nativamente multimodal de Google DeepMind, incluido Gemini Omni 1.1 Flash. Crea vídeos cinematográficos con audio nativo sincronizado, anima imágenes estáticas con un control preciso de los fotogramas inicial y final, o revisa metraje existente mediante ediciones guiadas por texto que conservan el contenido no modificado. Atlas Cloud proporciona una única clave compatible con OpenAI, acceso unificado y precios transparentes de pago por uso. Empieza a desarrollar hoy mismo.

Gemini Omni Flash ha sido desarrollado por Google. Atlas Cloud (operado por Atlas Cloud AI LLC) proporciona acceso al modelo, pero no es su propietario. Todas las marcas comerciales pertenecen a sus respectivos titulares.

Explorar Modelos Líderes

Atlas Cloud le proporciona los últimos modelos creativos líderes en la industria.

Guía de endpoints de la API Gemini Omni para flujos de trabajo de vídeo

Compara las rutas de texto, imagen, referencia, edición y extensión de Gemini Omni Flash y Gemini Omni 1.1 Flash antes de elegir el endpoint adecuado.

ModalidadDescripción
Gemini Omni Flash Reference-to-Video API (R2V)Combina un prompt de texto con de 1 a 5 imágenes de referencia para generar vídeo cinematográfico con sonido nativo. La coherencia de sujetos, escenas y estilos hace que este endpoint sea adecuado para secuencias de marca y personajes recurrentes.
Gemini Omni Flash Image-to-Video API (I2V)A partir de una imagen fija y un prompt de texto, este endpoint crea un vídeo cinematográfico con sonido, preservando el sujeto y la composición originales. Úsalo para animar fotografías de productos, retratos o conceptos visuales.
Gemini Omni Flash Video Edit APIProporciona un vídeo existente y una instrucción de texto, junto con imágenes de referencia opcionales, para aplicar cambios coherentes con la escena y audio nativo. El metraje no afectado se conserva, lo que permite revisiones específicas de posproducción y actualizaciones visuales.
Gemini Omni Flash Text-to-Video API (T2V)A partir únicamente de un prompt de texto, el endpoint genera vídeo cinematográfico con audio nativo sincronizado y movimiento basado en la física. Su generación controlable y de alta velocidad es adecuada para visualizar conceptos, desarrollar historias y crear prototipos de vídeo rápidamente.
Gemini Omni Flash Reference-to-Video Developer APIUsa prompts de texto e imágenes de referencia para transformar clips de vídeo existentes mediante transferencia de estilo, edición de escenas o inserción de personajes. Este endpoint para desarrolladores es adecuado para herramientas creativas que necesitan variaciones guiadas del metraje proporcionado.
Gemini Omni Flash Image-to-Video Developer APICuando la identidad visual es importante, combina un prompt de texto con hasta 7 imágenes de referencia para producir un vídeo coherente con el sujeto. El flujo de trabajo admite personajes recurrentes, recursos visuales de catálogo y materiales de campaña cohesionados.
Gemini Omni Flash Text-to-Video Developer APIElige un prompt de texto, resolución, relación de aspecto y duración para crear un vídeo cinematográfico controlable. Las opciones flexibles de salida ayudan a los desarrolladores a preparar contenido específico para cada plataforma, probar direcciones creativas y crear flujos de generación automatizados.
Gemini Omni 1.1 Flash Video Extend APIContinúa un clip existente con una extensión perfectamente integrada de 3 a 10 segundos que conserva el audio nativo. Encadena extensiones para crear una toma coherente de hasta 40 segundos en escenas más largas o acciones continuas.
Gemini Omni 1.1 Flash Video Edit APISolicita adiciones, eliminaciones, sustituciones o cambios de estilo proporcionando al endpoint un vídeo existente y una instrucción de texto. Conserva el contenido no mencionado y el audio nativo, lo que permite realizar revisiones precisas sin reconstruir toda la escena.
Gemini Omni 1.1 Flash Reference-to-Video API (R2V)Proporciona un prompt de texto con hasta 10 imágenes de referencia y 3 clips de vídeo de referencia para generar vídeo cinematográfico con sonido nativo. La coherencia de personajes, productos y dirección artística favorece el contenido serializado y las campañas coordinadas.
Gemini Omni 1.1 Flash Image-to-Video API (I2V)Anima una imagen fija para convertirla en un clip cinematográfico con sonido nativo, guiado por texto. Un fotograma final opcional ofrece un control preciso sobre el cierre de la toma, lo que hace que el endpoint sea útil para transiciones planificadas y presentaciones de productos.
Gemini Omni 1.1 Flash Text-to-Video API (T2V)Convierte un único prompt de texto en un clip cinematográfico con audio nativo sincronizado, controlando la duración, la relación de aspecto y la resolución. La salida, desde borradores en 360p hasta entregas en 4K, permite generar previsualizaciones rápidas y contenido de mayor resolución desde un único endpoint.

Crea videos mediante conversación con la API Gemini Omni Flash

Cada solicitud a la API Gemini Omni Flash puede aceptar cualquier combinación de texto, imágenes, video y audio, generar sonido sincronizado, modelar la física del mundo real y perfeccionar el resultado mediante conversación.

Edición conversacional

Edición conversacional

Perfecciona un clip mediante lenguaje natural y la API Gemini Omni Flash aplicará el cambio mientras conserva el resto de la escena. Su API de Interactions con estado recuerda cada turno, de modo que las ediciones se construyen unas sobre otras.

Entrada multimodal nativa

Entrada multimodal nativa

La API Gemini Omni Flash acepta cualquier combinación de texto, imágenes, video y audio en un solo prompt. Esta entrada de cualquier fuente te permite iniciar una generación a partir del material que ya tengas.

Audio sincronizado en una sola pasada

Audio sincronizado en una sola pasada

El sonido se genera junto con la imagen en una sola pasada de inferencia, por lo que los diálogos, efectos y sonidos ambientales permanecen sincronizados con la acción. La API Gemini Omni Flash no necesita un paso de audio independiente posterior.

Modelado del mundo

Modelado del mundo

Basada en un modelo de la física del mundo real, la API Gemini Omni Flash representa reflejos, gravedad, iluminación y condiciones meteorológicas creíbles. Las escenas mantienen su coherencia visual en lugar de convertirse en artefactos, incluso en tomas dinámicas.

Referencias multimodales

Referencias multimodales

Guía una generación con hasta siete imágenes de referencia y tres clips de video cortos, y la API Gemini Omni Flash mantiene la coherencia de los sujetos, el estilo y la escena. Esto preserva la identidad entre ediciones y tomas.

Gemini Omni frente a otros modelos - Un prompt

El mismo prompt, generado por Gemini Omni y otros modelos de vídeo líderes: multitoma y película publicitaria de alta gama

Prompt

Genera un vídeo continuo de 3 escenas: Escena 1: La mujer permanece de pie bajo luces de neón en una calle lluviosa de Tokio. Reflejos sobre el suelo mojado, profundidad de campo cinematográfica y movimiento de cámara en mano. Escena 2: La cámara pasa lentamente a un plano más cercano. Ella habla suavemente en sincronía con la voz proporcionada, con los movimientos de los labios perfectamente sincronizados. El tráfico de fondo continúa sin interrupciones. Escena 3: Entra en una estación de metro. El entorno mantiene la coherencia de la iluminación, el clima y el estado de ánimo. La cámara la sigue desde atrás, manteniendo la coherencia de su identidad. Restricciones: - Mantén una identidad facial idéntica en todas las escenas - Conserva la continuidad de la iluminación (lluvia y reflejos de neón) - Garantiza el realismo físico (interacción con la lluvia y superficies mojadas) - Garantiza la sincronización audiovisual con la entrada de voz - No reinicies la escena durante las transiciones; mantén un estado continuo del mundo Estilo: realismo cinematográfico de alta gama, grano de película, lente anamórfica, poca profundidad de campo, aspecto de película 4K

Gemini Omni

Wan 2.7

Kling v3.0

Prompt

Genera un vídeo continuo de 4 escenas: Escena 1: Un pequeño robot blanco permanece inmóvil sobre un escritorio de madera, en un apartamento tenuemente iluminado a medianoche. La luz de la luna entra por la ventana. Los ojos del robot se iluminan lentamente y comienza un tenue zumbido mecánico. Escena 2: El robot baja cuidadosamente del escritorio. Sus pequeños pies metálicos producen suaves chasquidos sobre el suelo de madera. La cámara lo sigue desde un ángulo bajo, manteniendo constantes el tamaño y la forma del robot. Escena 3: El robot entra en la cocina. Los reflejos de la puerta del frigorífico y del suelo de baldosas reaccionan de forma natural a su movimiento. La misma luz de la luna y la tranquila atmósfera nocturna continúan desde la escena anterior. Escena 4: El robot se detiene junto a una ventana y observa las luces de la ciudad desde el exterior. La cámara se acerca lentamente desde atrás, conservando la coherencia de la identidad, el material, la escala, la iluminación y el sonido del robot. Requisitos: - Mantén exactamente el mismo diseño del robot en todas las escenas - Conserva una distribución continua del apartamento, sin reiniciar la escena - Mantén una iluminación uniforme de una habitación a otra - Sincroniza los pasos y el zumbido mecánico con el movimiento del robot - Usa reflejos, sombras e interacciones con los objetos físicamente realistas - Crea transiciones fluidas entre escenas, como si se filmara un único mundo continuo Estilo: realismo cinematográfico, atmósfera de ciencia ficción serena, luz de luna suave, materiales detallados, movimiento de cámara realista, poca profundidad de campo, aspecto de película publicitaria de alta gama

Gemini Omni

Kling V3.0

Pixverse v6

Del plano de producto al montaje final con la API de Gemini Omni

Desde campañas de producto, revisiones conversacionales, transiciones controladas, extensiones coherentes y universos de marca consistentes hasta herramientas creativas integradas, la API de Gemini Omni permite gestionar la producción desde el primer fotograma hasta el montaje final.

Campañas de producto con la API de Gemini Omni

Anima una imagen fija de producto para convertirla en movimiento cinematográfico con audio nativo sincronizado, definiendo opcionalmente el fotograma final. Los equipos de marketing pueden transformar fotografías aprobadas en teasers de lanzamiento, anuncios para redes sociales y presentaciones de producto pulidas.

Posproducción conversacional

Describe una adición, eliminación, sustitución o cambio de estilo, y el modelo actualizará el metraje existente mientras conserva todo lo que el prompt no modifica. Los editores pueden entregar tratamientos alternativos y revisiones del cliente sin reconstruir escenas aprobadas.

Transiciones entre el primer y el último fotograma

Establece una imagen inicial y un fotograma final proporcionado, y deja que Gemini Omni 1.1 Flash cree el movimiento entre ambos. Los diseñadores obtienen transiciones controladas, presentaciones de producto y transformaciones visuales para los recursos de campaña.

Extensiones narrativas coherentes con la API de Gemini Omni

Continúa un clip existente con un segmento de tres a diez segundos que encaja de forma fluida, encadenando extensiones en una única secuencia coherente. Los cineastas y narradores pueden desarrollar planos más largos conservando la continuidad del movimiento, el sonido y los elementos visuales.

Continuidad de personajes y marca

Combina un prompt con hasta diez imágenes de referencia y tres clips de vídeo para orientar la dirección de personajes, productos o arte. Los estudios pueden conservar sujetos reconocibles y estéticas de marca en distintos planos de campaña y contenidos episódicos.

Aplicaciones creativas basadas en la API de Gemini Omni

Integra la generación de texto, la animación de imágenes, la creación a partir de referencias, la edición de vídeo y la extensión de clips mediante una única integración de API. Las plataformas para creadores pueden ofrecer un espacio de producción conectado sin tener que montar pipelines independientes de vídeo y audio.

Cómo se comparan los modelos de referencia de Gemini Omni API

Compara los modelos de video de referencia de Gemini Omni API, incluido Gemini Omni 1.1 Flash, con las principales alternativas según las entradas compatibles, la capacidad de referencias, la generación de audio y los precios estándar.

ModeloEntradas aceptadasCapacidad de referenciasGeneración de audioPrecio estándar
Gemini Omni 1.1 Flash Reference-to-VideoTexto, imágenes y clips de videoHasta 10 imágenes y 3 clips de video$0.041/sec
Gemini Omni Flash Reference-to-VideoTexto e imágenesDe 1 a 5 imágenes$0.135/sec
Seedance 2.0 Reference-to-VideoTexto, imágenes, video y audioHasta 9 imágenes, 3 videos y 3 clips de audio$0.112/sec
Wan-2.7 Reference-to-videoTexto, imágenes, video y audioHasta 5 imágenes y videos combinados, con voces opcionales para los sujetos$0.10/sec
Grok Imagine Video v1.5 Reference-to-VideoTexto, imágenes y voces predefinidasHasta 7 imágenes y 3 voces predefinidas$0.08/sec

Cómo usar Gemini Omni Flash en Atlas Cloud

Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.

Crea una cuenta en Atlas Cloud

Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.

Por Qué Usar Gemini Omni Flash en Atlas Cloud

Combina modelos avanzados de Gemini Omni Flash con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.

Rendimiento y Flexibilidad

Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.

API Unificada:
Una sola integración para acceder a Gemini Omni Flash, GPT, Gemini y DeepSeek.

Precios Transparentes:
Facturación por Token, soporta modo Serverless.

Empresa y Escala

Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.

Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.

Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.

Preguntas sobre la API de Gemini Omni para creadores de video

La API de Gemini Omni ofrece a los desarrolladores acceso, a través de Atlas Cloud, a la familia de generación y edición de video nativamente multimodal de Google DeepMind. Según el endpoint seleccionado, puede generar videos a partir de texto o imágenes, usar medios de referencia, editar metraje existente y producir audio nativo sincronizado.

Gemini Omni 1.1 Flash incorpora extensión de video, interpolación entre el primer y el último fotograma, resoluciones de salida de 360p a 4K y una guía ampliada mediante referencias. Su variante de extensión añade entre 3 y 10 segundos por solicitud y puede encadenarse para crear un video coherente de hasta 40 segundos.

Crea una cuenta de Atlas Cloud, guarda tu clave de API en el servidor y selecciona el endpoint del modelo que corresponda a tu flujo de trabajo. Atlas Cloud proporciona una única clave compatible con OpenAI, mientras que el esquema publicado de cada endpoint define el prompt, las entradas multimedia y los ajustes de generación obligatorios.

Elige text to video cuando partas de un prompt, image to video para animar una imagen fija o reference to video cuando sean importantes la identidad y la guía de estilo. Usa video edit para modificar metraje existente y el endpoint Gemini Omni 1.1 Flash video extend para continuar una escena.

Los límites de referencia varían según el endpoint y la versión del modelo. Gemini Omni 1.1 Flash Reference to Video acepta hasta 10 imágenes de referencia y 3 clips de video de referencia, mientras que los endpoints anteriores admiten límites diferentes; por eso, comprueba el esquema del endpoint seleccionado antes de enviar los medios.

Gemini Omni 1.1 Flash admite salidas de entre 3 y 10 segundos a 24 FPS, con opciones de resolución de 360p, 720p, 1080p reescalada y 4K reescalada. Las relaciones de aspecto compatibles son 16:9 y 9:16, aunque los controles disponibles pueden variar según el endpoint de Atlas Cloud.

Sí. La variante video edit sigue instrucciones de texto para añadir, eliminar, reemplazar o cambiar el estilo de elementos, conservando el metraje que el prompt no mencione. Para realizar cambios iterativos, usa instrucciones concretas y el contexto de interacción compatible con el flujo de trabajo seleccionado.

Para continuar una escena, proporciona un clip existente al endpoint Gemini Omni 1.1 Flash video extend y solicita entre 3 y 10 segundos adicionales. Las extensiones pueden encadenarse hasta alcanzar un total de 40 segundos, mientras que la variante image to video puede interpolar entre el primer y el último fotograma proporcionados.

El precio estándar de Atlas Cloud para Gemini Omni 1.1 Flash es de $0.041 por segundo para text to video, reference to video, edición de video y extensión de video, mientras que image to video cuesta $0.043 por segundo. Los endpoints anteriores de Gemini Omni Flash parten de $0.112 por segundo, con facturación basada en el uso y sin suscripción obligatoria.

Todos los videos generados incluyen una marca de agua invisible de SynthID que puede detectarse mediante programación. Los filtros de seguridad se aplican tanto a los prompts como al contenido generado, mientras que el tiempo de procesamiento varía según la duración, la resolución y la carga del servicio. No se admiten controles específicos para negative prompt, system instruction, temperature, top_p ni stop sequence; por eso, incluye las exclusiones en el prompt principal.

Explorar Más Series

Seedance 2.5

¡La API de Seedance 2.5 ya está disponible en Atlas Cloud! Ofrece a los desarrolladores el modelo de video más reciente de ByteDance. Genera hasta 30 segundos de video nativo en una sola pasada a partir de texto, una sola imagen o hasta 50 referencias multimodales, con audio sincronizado y texto multilingüe en el encuadre. En Atlas Cloud puede acceder a él mediante una única clave, con consistencia del sujeto y físicas mejoradas que mantienen la coherencia en las tomas largas.

Ver Serie

Wan 3.0

La API Wan 3.0 es la próxima generación de la familia de videos Wan de Alibaba, diseñada para llevar la generación de formato largo, el control de múltiples referencias y la calidad audiovisual a nuevas alturas. Atlas Cloud ya aloja Wan 2.7, 2.6 y 2.5, y Wan 3.0 se ejecuta con la misma clave unificada sin necesidad de configuración adicional. Empieza a construir hoy mismo. Desplázate hacia abajo hasta la galería para ver lo que Wan 3.0 puede crear.

Ver Serie

MiniMax H3

MiniMax H3 es la familia de modelos de vídeo de MiniMax, que incluye H3, H3 Max y H3 Developer. Crea vídeos a partir de texto, anima un primer fotograma con un último fotograma opcional o conserva sujetos de las referencias. H3 y H3 Developer alcanzan 2K, mientras que H3 Max admite clips en 480P y 768P de 5 a 15 segundos de duración. Atlas Cloud añade acceso compatible con OpenAI y precios transparentes de pago por uso desde $0.05 por segundo. Empieza a desarrollar hoy mismo.

Ver Serie

Seedream 5.0 Pro

La API de Seedream 5.0 Pro ofrece a los desarrolladores el modelo de edición de imágenes controlable de ByteDance en Atlas Cloud. Sitúa las ediciones con precisión mediante anclajes y coordenadas, separa las imágenes en capas editables, fusiona múltiples referencias y empareja colores y materiales exactos, con texto multilingüe a 2K y 3K. ¡En Atlas Cloud puede acceder a él mediante una sola clave!

Ver Serie

Seedance 2.0

La API de Seedance 2.0 le ofrece acceso de producción al modelo de video multimodal de ByteDance: entradas cuatrimodales (texto, imagen, video, audio) y un sistema "Universal Reference" líder en la industria que bloquea la composición, el movimiento de la cámara y las acciones de los personajes en diferentes tomas. Integre un control de nivel de director con una sola llamada a la API, una tarifa fija de $0.09/s, clave instantánea y sin lista de espera, todo respaldado por un tiempo de actividad y cumplimiento de nivel empresarial. ¡Seedance 2.0 Native 4K ya está disponible!

Ver Serie

GPT Image 2

La API de GPT Image 2 ofrece a los desarrolladores acceso al último modelo de imágenes de OpenAI, el sucesor de GPT Image 1.5. Genera y edita imágenes con una representación de texto precisa en caracteres latinos y CJK, además de una sólida composición para carteles, maquetas e infografías. En Atlas Cloud, puede acceder a ella a través de una API unificada junto con más de 300 modelos, con créditos gratuitos, un tiempo de actividad del 99,99% y sin necesidad de verificación de organización de OpenAI.

Ver Serie

Gemini Omni Flash

La API de gemini omni pone a disposición de los desarrolladores la familia Gemini Omni Flash nativamente multimodal de Google DeepMind, incluido Gemini Omni 1.1 Flash. Crea vídeos cinematográficos con audio nativo sincronizado, anima imágenes estáticas con un control preciso de los fotogramas inicial y final, o revisa metraje existente mediante ediciones guiadas por texto que conservan el contenido no modificado. Atlas Cloud proporciona una única clave compatible con OpenAI, acceso unificado y precios transparentes de pago por uso. Empieza a desarrollar hoy mismo.

Ver Serie

Grok Imagine

La API Grok Imagine cubre los modelos de imagen, video y voz de xAI, desde Image 2.0 hasta Video 1.5 y xAI TTS v1. Genera imágenes de 1K o 2K en 14 relaciones de aspecto, expande una escena a 15 segundos de movimiento en 1080p, controla tomas con hasta 7 imágenes de referencia, o nárralas en 20 idiomas. Atlas Cloud ejecuta todos los modos en un endpoint, con precios de pago por uso desde $0.02 por imagen y $0.05 por segundo. Empieza a construir hoy.

Ver Serie

Google

Los modelos creativos más potentes de Google están todos disponibles en Atlas Cloud. Veo 3.1 ofrece generación de video cinematográfico, Nano Banana 2 impulsa la creación de imágenes de alta fidelidad y Gemini aporta inteligencia multimodal a cada flujo de trabajo. Acceda a la suite completa de modelos de Google a través de una sola API key con disponibilidad Day-0 y precios de pago por uso (pay-as-you-go).

Ver Serie

Seedance 2.0 Mini

Seedance 2.0 Mini lleva la generación de video multimodal de ByteDance a los flujos de trabajo donde la velocidad y el costo son más importantes. Ofrece las capacidades principales de Seedance 2.0 con un menor consumo de recursos: generación más rápida, menor costo por video y la misma integración de API que ya utiliza. Para los equipos que ejecutan pipelines de alto volumen o crean prototipos a escala, Mini es la opción predeterminada práctica.

Ver Serie

ByteDance

Desde la generación de video cinematográfico hasta la creación de imágenes de alta fidelidad, los modelos más potentes de ByteDance están disponibles en Atlas Cloud. Ejecute Seedance y Seedream a gran escala con los precios de inferencia más bajos y cero gastos generales de infraestructura.

Ver Serie

Alibaba

Atlas Cloud reúne toda la línea de modelos de Alibaba bajo una sola API: Qwen para tareas de lenguaje e imagen, y Wan para la generación de video hasta 1080p. Acceda a cada modelo con pago por uso sin suscripciones. La API de Alibaba está disponible a través de una única URL base utilizando su cliente compatible con OpenAI existente.

Ver Serie

Una sola API para toda la IA multimedia.

Explorar Todos los Modelos