Un adulto da tres palmadas en un clip silencioso de cámara fija. Tras cada palmada, solo cambia el sombrero. El intérprete, la chaqueta, la habitación, la luz y el ritmo permanecen en su sitio. Esa es la promesa práctica que los desarrolladores están probando con la gemini omni flash 1.1 api.
La parte difícil no es enviar una única solicitud de vídeo, sino convertir «cambia solo esta cosa» en el modo de entrada adecuado, un prompt con suficientes restricciones y un presupuesto que deje margen para iterar. Los tres montajes siguientes se centran en esa transición: una edición de sombrero sincronizada con un evento, una edición de material de un solo objeto y una secuencia de física solo con texto.
Gemini Omni 1.1 Flash es la actualización de generación de vídeo lista para producción de Google. Admite entradas de texto, imagen y vídeo subido, mientras que la API Interactions admite estado iterativo mediante un ID de interacción anterior. Sus controles de salida documentados incluyen 360p, 720p, 1080p y 4K, con encuadre 16:9 o 9:16 (Documentación de Google Gemini Omni, septiembre de 2026).
Puntos clave
- ID de modelo estable de Google:
gemini-omni-1.1-flash.- Elige la ruta de entrada antes de redactar el prompt.
- Mantén el segmento de origen de la edición con referencia en 10 segundos o menos.
- Trata los diálogos importantes como una tarea independiente de aprobación de audio.
Por qué la API Gemini Omni Flash 1.1 está en auge y por qué fallan los primeros intentos
Omni 1.1 está atrayendo la atención porque combina la generación con controles de edición y continuación. Google afirma que la actualización puede ampliar escenas en incrementos de 10 segundos hasta 40 segundos, interpolar entre el primer y el último fotograma, crear vistas previas en 360p y ampliar a 4K (Anuncio de Google Omni 1.1, agosto de 2026). Esos controles son importantes para un equipo de producto que desarrolla un editor, un SaaS creativo o una herramienta de marketing de formato corto.
El primer intento suele fallar por razones más sencillas:
- Se pide a una ruta de texto a vídeo que conserve una actuación existente.
- La edición pide un objeto nuevo sin una referencia clara ni una descripción visual concreta.
- Un solo prompt cambia a la vez el actor, la cámara, la ropa, el entorno y el objeto.
- Un clip de origen largo oculta el momento exacto que debe activar la edición.
Empieza por decidir qué debe permanecer invariante. En el caso del sombrero, el intérprete, la cámara, la habitación, la chaqueta, las sombras y el ritmo de las palmadas son invariantes. El sombrero es la única variable que cambia. El caso de la escultura de burbujas usa la misma idea, pero fija al creador y la luz de la ventana mientras cambia el material de un objeto.
La continuidad visual y la continuidad de audio necesitan comprobaciones de aceptación distintas. Un usuario de Reddit describió una salida que reescribía el discurso y el contexto de un clip con una persona hablando a cámara tras las ediciones (informe de la comunidad, julio de 2026). Ese informe es anecdótico, pero es una regla de producción útil: si el diálogo, la música o una aprobación legal dependen de la pista original, conserva y masteriza el audio original por separado. No apruebes una edición visual generativa solo porque las imágenes se vean bien.
Flujo de trabajo de la API Gemini Omni Flash 1.1: elige la entrada, el modelo y el costo adecuados
Elige la entrada que ya contenga la información que necesitas. Text-to-video es para una escena nueva. Image-to-video es para una apariencia inicial con dirección de arte. Reference-to-video es para una actuación de origen que necesita un cambio muy acotado. En Atlas Cloud, los equipos pueden abrir la ruta de modelo Developer correspondiente en una pestaña del navegador, comparar los modos de entrada y conservar un flujo de prototipo común a través de Atlas Cloud.
td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}
| Ruta | Qué aportar a la primera ejecución | Mejor opción | Error habitual en el primer intento | Caso del artículo | Tarifa pública inicial* |
| Text-to-Video Developer | Prompt de texto | Escena nueva y continua | Intentar recrear una actuación de origen concreta | Rube Goldberg | $0.112/seg |
| Image-to-Video Developer | De 1 a 7 imágenes de referencia | Animar un estilo o sujeto definido | Aportar imágenes de referencia incoherentes | Variación opcional | $0.112/seg |
| Reference-to-Video Developer | 1 vídeo de origen y hasta 5 imágenes | Conservar la acción mientras se edita un detalle acotado | Enviar un recorte de más de 10 segundos | Sombreros y burbujas | $0.120/seg |
Las tarifas públicas iniciales se comprobaron en el listado Models All el 1 de septiembre de 2026. La resolución, la duración y los detalles de compra pueden cambiar, así que confirma la página del modelo correspondiente antes de fijar un presupuesto de lanzamiento. Una estimación de 8 segundos es tarifa × 8, no una promesa de precio universal.
Para variaciones guiadas por imágenes, la ruta Image-to-Video Developer acepta de 1 a 7 imágenes de referencia. El esquema de reference-to-video acepta un clip de origen y hasta cinco imágenes; su segmento de origen recortado no debe superar los 10 segundos. Usa una semilla fija solo después de encontrar una rama que valga la pena iterar.
La salida de conveniencia del SDK de Google es output_video. Una respuesta REST sin procesar, en cambio, coloca el contenido de vídeo dentro del array steps. Esta distinción evita un error de integración común.
plaintext1import { GoogleGenAI } from '@google/genai'; 2import fs from 'node:fs'; 3 4const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY }); 5const interaction = await ai.interactions.create({ 6 model: 'gemini-omni-1.1-flash', 7 input: 'A polished steel marble triggers a tabletop chain reaction.', 8 response_format: { type: 'video', aspect_ratio: '16:9', resolution: '4k' } 9}); 10 11fs.writeFileSync('result.mp4', Buffer.from(interaction.output_video.data, 'base64'));
plaintext1{ 2 "model": "gemini-omni-1.1-flash", 3 "input": "A polished steel marble triggers a tabletop chain reaction.", 4 "response_format": { "type": "video", "aspect_ratio": "16:9", "resolution": "4k" } 5}
Paso 1: edición de vídeo con la API Gemini Omni Flash 1.1, cambia los sombreros en la palmada
Usa un clip de origen silencioso de 10 segundos con derechos liberados, un intérprete adulto, una cámara fija 16:9 y tres palmadas claras. Sube el clip de origen, su primer fotograma y tres referencias claras de sombreros. Para esta ruta, usa el playground de Reference-to-Video Developer.
plaintext1Use the uploaded original video as the timing, camera, and performance reference. Preserve the same adult performer, face, body movement, tan jacket, room, framing, shadows, and pacing. At the instant immediately after each completed clap, change only the hat: after clap one, a forest-green knit beanie; after clap two, a cream wide-brim felt hat; after clap three, a red baseball cap. Keep each hat naturally fitted and stable between claps. No cuts, no added people, no text, no captions, no logos, and no changes to the jacket or room. Preserve the silent source audio; do not generate speech or music.
Elige un recorte de origen 0-10s, 16:9, 4K y una semilla fija solo para un reintento controlado posterior. Cambia una variable a la vez. Si un sombrero se desplaza, simplifica el cambio antes de añadir una referencia más fuerte.
Imagen fija del caso 1. El fotograma claro seleccionado muestra la gorra roja final después de la tercera palmada, mientras el intérprete, la habitación y la cámara permanecen estables.
Prueba de movimiento del caso 1. A lo largo del clip de 10 segundos, tres palmadas separadas activan los estados del gorro, el sombrero de ala ancha y la gorra roja en una única toma de estudio continua.
Paso 2: edición de vídeo con la API Gemini Omni Flash 1.1, transforma un solo objeto
Usa un clip de origen silencioso y distinto de 10 segundos: una persona adulta gira una pequeña escultura de cerámica geométrica junto a una ventana. Sube el vídeo de origen y su primer fotograma. La entrada se mantiene simple para que la transformación del material tenga una única tarea.
plaintext1Use the uploaded video as the exact performance, camera, and lighting reference. Preserve the adult creator, hands, clothing, studio, window light, camera position, and the slow turn of the object. At 2.0 seconds, transform only the small geometric ceramic sculpture into a connected cluster of translucent soap bubbles with realistic reflections and soft iridescent color. The creator continues the same hand motion. Keep the bubbles attached in the same position and scale as the original sculpture. One continuous shot, no cuts, no new objects, no new people, no text, no logos, and no generated speech or music.
Elige un recorte de origen 0-10s, 16:9, 4K y el mismo flujo de semilla fija que en el paso 1. Revisa el borde del objeto en la transición de los dos segundos y en el último segundo. Esos momentos revelan si el modelo cambió algo más que el objeto solicitado.
Imagen fija del caso 2. El grupo de burbujas está completamente formado mientras las manos que giran, la mesa de trabajo y la luz de la ventana siguen siendo legibles.
Prueba de movimiento del caso 2. La escultura geométrica cambia a un grupo de burbujas translúcidas en el momento solicitado mientras la cámara se desliza lateralmente por el estudio iluminado por el sol.
Paso 3: texto a vídeo con la API Gemini Omni Flash 1.1, prueba una secuencia de física continua
Para una escena nueva, empieza solo con texto. Esto aísla el ritmo del modelo, las relaciones entre objetos y la instrucción de cámara. Usa el modelo Text-to-Video Developer para una ejecución de 8 segundos, 16:9 y 4K. Fija la semilla solo después de tener una salida que valga la pena revisar.
plaintext1One continuous 8-second studio shot of a hand-built tabletop Rube Goldberg machine. A polished steel marble rolls from left to right through a wooden track, tips a row of dominoes, releases a small brass lever, rings a bell, and opens a paper flower. Every collision follows believable gravity, weight, momentum, and contact. The camera begins in a close tracking shot with the marble, then smoothly slides sideways to reveal the full chain reaction. Warm morning window light, crisp wood and metal textures, practical workshop setting. No jump cuts, no visible hands, no logos, no captions, no text.
Inspecciona la cadena real en lugar de un único fotograma atractivo. Si la canica falla un contacto, acorta la secuencia o elimina una dependencia. Una cadena fiable de cinco eventos es una demo de producto más sólida que una secuencia saturada cuya mecánica no se puede leer.
Imagen fija del caso 3. El fotograma final seleccionado muestra la flor de papel abierta y la cadena de mesa completada.
Prueba de movimiento del caso 3. La canica inicia las fichas de dominó, luego la palanca y la campana, antes de que la flor se abra en los últimos segundos. La cámara se mueve lateralmente para revelar cada etapa en lugar de simplemente hacer un zoom.
Variaciones de la API Gemini Omni Flash 1.1: extiende, interpola e itera de forma segura
Usa la extensión y la interpolación para resolver un problema de continuidad específico, no para evitar un primer intento claro. Google describe extensiones de 10 segundos hasta un total acumulado de 40 segundos y control del fotograma inicial/final en Omni 1.1. También informa de que los borradores en 360p pueden ser hasta un 60% más rápidos y costar un tercio del nivel estándar de 720p en su propia comparación de rendimiento. Esas son las condiciones de prueba de Google, no una garantía de velocidad para toda la plataforma.
Adopta una secuencia de dos pasadas:
- Valida la lógica del movimiento en una resolución de borrador baja donde ese control esté realmente disponible.
- Cambia una variable por reintento: el sombrero, el material de las burbujas o una frase de cámara.
- Genera el activo final en la resolución objetivo solo después de que la acción se lea correctamente.
Escribe primero las restricciones de conservación: preserve the same performer, camera, room, and timing. Luego nombra la única transformación. Para una toma continua, indica one continuous shot, no cuts. Para una transición de extremo a extremo, proporciona un primer y un último fotograma deliberados en lugar de pedir al modelo que infiera ambos extremos a partir de una frase vaga.
Costo, derechos y protecciones de producción de la API Gemini Omni Flash 1.1
Presupuesta el trabajo como una secuencia de decisiones, no como un botón ilimitado de «generar de nuevo». Con las tarifas públicas iniciales mostradas arriba, una ejecución de texto de 8 segundos cuesta aproximadamente $0.896 y una edición con referencia de 8 segundos, aproximadamente $0.960. Un presupuesto de tres intentos es, por tanto, de aproximadamente $2.688 para el caso Rube Goldberg y de $2.880 para cualquiera de los casos de edición con referencia, antes de que se aplique una tarifa de mayor resolución o un SKU de producto distinto.
Mantén separados en la planificación interna la facturación de la API, los precios de compra de la página del producto y las cuotas comunitarias o de la cuenta. Antes de comprar o lanzar, comprueba el precio actual de resolución y duración de la ruta seleccionada. Este artículo no convierte intencionadamente un listado de tarifa inicial en una cotización permanente de 4K.
Usa solo vídeo e imágenes de referencia que tengas derecho a subir. Obtén permiso de las personas reconocibles, conserva los registros del prompt y de las fuentes, y etiqueta el material generado cuando el público pueda confundirlo con material documental. Revisa los diálogos, la música, las marcas comerciales y las imágenes de las personas en su propia pasada de aprobación. Estas protecciones importan tanto como la cláusula preserve en un prompt de la API Gemini Omni Flash 1.1.
Preguntas frecuentes sobre la API Gemini Omni Flash 1.1
¿Cuál es el ID de modelo estable de la API Gemini Omni Flash 1.1?
El ID de modelo estable actual de Google es gemini-omni-1.1-flash. Usa la documentación de modelo vigente en el momento de la implementación, porque los alias de modelo y la disponibilidad de vistas previas pueden cambiar.
¿Se está eliminando gradualmente gemini-omni-flash-preview?
Trata el nombre de vista previa como una pista de lanzamiento independiente. Confirma el aviso de deprecación actual en la documentación de modelos de Google antes de fijarlo en producción y usa el ID estable cuando coincida con las capacidades que necesitas.
¿Puede Gemini Omni Flash 1.1 editar un vídeo existente?
Sí. El flujo documentado sube un vídeo mediante la API Files y proporciona una instrucción de edición. Mantén el segmento de origen corto e indica cada elemento que debe permanecer sin cambios.
¿Cuánto puede durar un vídeo con la API Gemini Omni Flash 1.1?
Los ejemplos de generación estándar cubren clips cortos, mientras que Omni 1.1 puede ampliar en incrementos de 10 segundos hasta un total acumulado de 40 segundos. En la ruta Developer actualmente documentada de Atlas, un recorte de origen de reference-to-video debe ser de 10 segundos o menos.
¿Puede conservar el diálogo y la pista de audio original?
Usa instrucciones de conservación visual y verifica el audio de forma independiente. Para un clip donde el diálogo o la música exactos importan, lleva la pista original aprobada a la posproducción en lugar de tratar una salida generativa como una masterización de audio automática.
¿Cuánto cuesta la API Gemini Omni Flash 1.1?
El costo depende de la ruta, la duración, la resolución y el mecanismo de facturación. Para el flujo de trabajo de la API Gemini Omni Flash 1.1, multiplica los segundos por la tarifa de ruta mostrada actualmente y reserva al menos 3 intentos para cualquier toma crítica en cuanto al movimiento.






