MiniMax H3 Developer já está disponível — 60% de desconto, a partir de US$ 0,02 por segundo

Gemini Omni Flash 1.1 API: 3 builds de vídeo para testar antes da sua primeira execução em produção

Este artigo explica 3 builds de vídeo para testar antes da primeira execução em produção na API Gemini Omni Flash 1.1. Meta Título: API Gemini Omni Flash 1.1: 3 Builds de Vídeo para Testar Antes da Primeira Execução em Produção Meta Descrição: Crie, edite e estenda vídeos com a API Gemini Omni Flash 1.1.

Um adulto bate palmas três vezes em um clipe silencioso com câmera fixa. Após cada palma, apenas o chapéu muda. O performer, a jaqueta, o ambiente, a luz e o ritmo permanecem no lugar. Essa é a promessa prática que os desenvolvedores estão testando com a gemini omni flash 1.1 api.

A parte difícil não é enviar uma solicitação de vídeo. É transformar "mude apenas isso" no modo de entrada certo, em um prompt com restrições suficientes e em um orçamento que permita iterações. Os três exemplos abaixo focam nessa etapa: uma edição de chapéu sincronizada por evento, uma edição de material de um único objeto e uma sequência de física somente por texto.

O Gemini Omni 1.1 Flash é a atualização de geração de vídeo pronta para produção do Google. Ele suporta entradas de texto, imagem e vídeo enviado, enquanto a API Interactions suporta estado iterativo por meio de um ID de interação anterior. Seus controles de saída documentados incluem 360p, 720p, 1080p e 4K, com enquadramento 16:9 ou 9:16 (Documentação do Google Gemini Omni, setembro de 2026).

Pontos-chave

  • ID de modelo estável do Google: gemini-omni-1.1-flash.
  • Escolha o modo de entrada antes de escrever o prompt.
  • Mantenha o segmento de origem da edição por referência em 10 segundos ou menos.
  • Trate diálogos importantes como uma tarefa separada de aprovação de áudio.

Por que a API Gemini Omni Flash 1.1 Está em Alta e por Que as Primeiras Execuções Falham

O Omni 1.1 está atraindo atenção porque combina geração com controles de edição e continuação. O Google afirma que a atualização pode estender cenas em incrementos de 10 segundos até um total de 40 segundos, interpolar entre o primeiro e o último quadro, gerar prévias em 360p e aumentar a resolução para 4K (Anúncio do Google Omni 1.1, agosto de 2026). Esses controles são importantes para um time de produto que está construindo um editor, um SaaS criativo ou uma ferramenta de marketing de formato curto.

A primeira execução costuma falhar por motivos mais simples:

  • Uma rota de texto para vídeo é solicitada a preservar uma performance existente.
  • A edição pede um novo objeto sem uma referência clara ou uma descrição visual específica.
  • Um único prompt muda o ator, a câmera, as roupas, o cenário e o objeto ao mesmo tempo.
  • Um clipe de origem longo esconde o momento exato que deve disparar a edição.

Comece decidindo o que deve permanecer invariável. No caso do chapéu, o performer, a câmera, o ambiente, a jaqueta, as sombras e o ritmo das palmas são invariáveis. O chapéu é a única variável que muda. O caso da escultura de bolhas usa a mesma ideia, mas mantém fixos o criador e a luz da janela enquanto muda o material de um único objeto.

Continuidade visual e continuidade de áudio precisam de critérios de aceite diferentes. Um usuário do Reddit descreveu uma saída que reescrevia a fala e o contexto de um clipe com pessoa falando após edições (relato da comunidade, julho de 2026). Esse relato é anedótico, mas é uma regra de produção útil: se diálogo, música ou aprovação jurídica dependerem da trilha original, preserve e finalize o áudio original separadamente. Não aprove uma edição visual generativa apenas porque as imagens parecem corretas.

Fluxo da API Gemini Omni Flash 1.1: Escolha a Entrada, o Modelo e o Custo Certos

Escolha a entrada que já contém a informação de que você precisa. Texto para vídeo é para uma cena nova. Imagem para vídeo é para um visual inicial com direção de arte. Referência para vídeo é para uma performance de origem que precisa de uma mudança bem delimitada. No Atlas Cloud, as equipes podem abrir a rota de modelo Developer relevante em uma aba do navegador, comparar modos de entrada e manter um fluxo de prototipagem comum por meio do Atlas Cloud.

td {white-space:nowrap;border:0.5pt solid #dee0e3;font-size:10pt;font-style:normal;font-weight:normal;vertical-align:middle;word-break:normal;word-wrap:normal;}

      
RotaO que levar para a primeira execuçãoMelhor usoErro comum na primeira execuçãoCaso no artigoTaxa inicial pública*
Text-to-Video DeveloperPrompt de textoCena nova e contínuaTentar recriar uma performance de origem específicaRube Goldberg$0.112/sec
Image-to-Video Developer1 a 7 imagens de referênciaAnimar um visual ou assunto definidoFornecer imagens de referência inconsistentesVariação opcional$0.112/sec
Reference-to-Video Developer1 vídeo de origem e até 5 imagensPreservar a ação enquanto edita um detalhe delimitadoEnviar um corte com mais de 10 segundosChapéus e bolhas$0.120/sec

As taxas iniciais públicas foram verificadas na listagem Models All em 1º de setembro de 2026. Resolução, duração e detalhes de checkout podem mudar, então confirme a página do modelo relevante antes de definir o orçamento de lançamento. Uma estimativa de 8 segundos é taxa × 8, não uma promessa universal de preço.

Para variações guiadas por imagem, a rota Image-to-Video Developer aceita de 1 a 7 imagens de referência. O esquema de referência para vídeo aceita um clipe de origem e até cinco imagens; o segmento de origem cortado não pode exceder 10 segundos. Use uma semente fixa somente depois de encontrar um resultado que valha a pena iterar.

A saída de conveniência do SDK do Google é output_video. Uma resposta REST bruta, por outro lado, coloca o conteúdo de vídeo dentro do array steps. Essa distinção evita um erro comum de integração.

plaintext
1import { GoogleGenAI } from '@google/genai';
2import fs from 'node:fs';
3
4const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY });
5const interaction = await ai.interactions.create({
6  model: 'gemini-omni-1.1-flash',
7  input: 'A polished steel marble triggers a tabletop chain reaction.',
8  response_format: { type: 'video', aspect_ratio: '16:9', resolution: '4k' }
9});
10
11fs.writeFileSync('result.mp4', Buffer.from(interaction.output_video.data, 'base64'));
plaintext
1{
2  "model": "gemini-omni-1.1-flash",
3  "input": "A polished steel marble triggers a tabletop chain reaction.",
4  "response_format": { "type": "video", "aspect_ratio": "16:9", "resolution": "4k" }
5}

Etapa 1: Edição de Vídeo com a API Gemini Omni Flash 1.1, Troque os Chapéus no Ritmo Certo

Use um clipe de origem silencioso de 10 segundos com direitos liberados, um performer adulto, uma câmera fixa 16:9 e três palmas bem definidas. Envie o clipe de origem, o primeiro quadro e três referências claras de chapéu. Para esta rota, use o playground Reference-to-Video Developer.

plaintext
1Use the uploaded original video as the timing, camera, and performance reference. Preserve the same adult performer, face, body movement, tan jacket, room, framing, shadows, and pacing. At the instant immediately after each completed clap, change only the hat: after clap one, a forest-green knit beanie; after clap two, a cream wide-brim felt hat; after clap three, a red baseball cap. Keep each hat naturally fitted and stable between claps. No cuts, no added people, no text, no captions, no logos, and no changes to the jacket or room. Preserve the silent source audio; do not generate speech or music.

Escolha o corte de origem 0-10s, 16:9, 4K e uma semente fixa apenas para uma nova tentativa controlada posteriormente. Altere uma variável por vez. Se o chapéu sair do lugar, simplifique a mudança antes de adicionar uma referência mais forte.

Quadro-chave do caso de troca de chapéu do Gemini Omni Flash

Caso 1, quadro estático. O quadro nítido selecionado mostra o boné vermelho final após a terceira palma, enquanto o performer, o ambiente e a câmera permanecem estáveis.

Caso de movimento da troca de chapéu do Gemini Omni Flash

Teste de movimento do caso 1. Ao longo do clipe de 10 segundos, três palmas separadas acionam os estados de gorro, chapéu de aba larga e boné vermelho em um único plano contínuo de estúdio.

Etapa 2: Edição de Vídeo com a API Gemini Omni Flash 1.1, Transforme um Único Objeto

Use uma origem silenciosa distinta de 10 segundos: um adulto gira uma pequena escultura geométrica de cerâmica ao lado de uma janela. Envie o vídeo de origem e o primeiro quadro. A entrada permanece simples para que a transformação de material tenha uma única função.

plaintext
1Use the uploaded video as the exact performance, camera, and lighting reference. Preserve the adult creator, hands, clothing, studio, window light, camera position, and the slow turn of the object. At 2.0 seconds, transform only the small geometric ceramic sculpture into a connected cluster of translucent soap bubbles with realistic reflections and soft iridescent color. The creator continues the same hand motion. Keep the bubbles attached in the same position and scale as the original sculpture. One continuous shot, no cuts, no new objects, no new people, no text, no logos, and no generated speech or music.

Escolha o corte de origem 0-10s, 16:9, 4K e o mesmo fluxo de semente fixa da Etapa 1. Verifique a borda do objeto na transição de dois segundos e no último segundo. Esses momentos revelam se o modelo mudou mais do que o objeto solicitado.

Quadro-chave do caso da escultura de bolhas do Gemini Omni Flash

Caso 2, quadro estático. O aglomerado de bolhas está totalmente formado enquanto as mãos em movimento do artista, a bancada e a luz da janela permanecem nítidas.

Caso de movimento da escultura de bolhas do Gemini Omni Flash

Teste de movimento do caso 2. A escultura geométrica se transforma em um aglomerado de bolhas translúcidas no momento solicitado, enquanto a câmera desliza lateralmente pelo estúdio iluminado pelo sol.

Etapa 3: Texto para Vídeo com a API Gemini Omni Flash 1.1, Teste uma Sequência de Física Contínua

Para uma cena nova, comece apenas com texto. Isso isola o ritmo do modelo, as relações entre objetos e a instrução de câmera. Use o modelo Text-to-Video Developer para uma execução de 8 segundos, 16:9, 4K. Fixe a semente somente depois de obter uma saída que valha a pena revisitar.

plaintext
1One continuous 8-second studio shot of a hand-built tabletop Rube Goldberg machine. A polished steel marble rolls from left to right through a wooden track, tips a row of dominoes, releases a small brass lever, rings a bell, and opens a paper flower. Every collision follows believable gravity, weight, momentum, and contact. The camera begins in a close tracking shot with the marble, then smoothly slides sideways to reveal the full chain reaction. Warm morning window light, crisp wood and metal textures, practical workshop setting. No jump cuts, no visible hands, no logos, no captions, no text.

Inspecione a cadeia real em vez de um único quadro bonito. Se a esfera errar um contato, encurte a sequência ou remova uma dependência. Uma cadeia confiável de 5 eventos é uma demonstração de produto mais forte do que uma sequência cheia cuja mecânica não pode ser compreendida.

Quadro-chave do caso Rube Goldberg do Gemini Omni Flash

Caso 3, quadro estático. O quadro final selecionado mostra a flor de papel aberta e a cadeia concluída na mesa.

GIF da reação em cadeia Rube Goldberg por texto para vídeo do Gemini Omni Flash

Teste de movimento do caso 3. A esfera aciona os dominós e depois a alavanca e o sino, antes de a flor se abrir nos segundos finais. A câmera se move lateralmente para revelar cada etapa, em vez de simplesmente se aproximar.

Variações da API Gemini Omni Flash 1.1: Estenda, Interpole e Itere com Segurança

Use extensão e interpolação para resolver um problema específico de continuidade, não para evitar uma primeira tentativa bem definida. O Google descreve extensões de 10 segundos até um total acumulado de 40 segundos e controle de quadro inicial/final no Omni 1.1. Ele também informa que rascunhos em 360p podem ser até 60% mais rápidos e custar um terço do valor do nível padrão de 720p em sua própria comparação de throughput. Essas são condições de teste do Google, não uma garantia de velocidade para toda a plataforma.

Adote uma sequência em duas etapas:

  1. Valide a lógica de movimento em uma resolução de rascunho baixa, onde esse controle está de fato disponível.
  2. Altere uma variável por tentativa: o chapéu, o material das bolhas ou uma frase de câmera.
  3. Gere o asset final na resolução desejada somente depois que a ação estiver correta.

Escreva as restrições de preservação primeiro: preserve o mesmo performer, câmera, ambiente e ritmo. Depois nomeie a única transformação. Para um plano contínuo, declare um plano contínuo, sem cortes. Para uma transição de ponta a ponta, forneça um primeiro e um último quadro deliberados, em vez de pedir que o modelo deduza ambos os extremos a partir de uma frase vaga.

Custo, Direitos e Proteções de Produção da API Gemini Omni Flash 1.1

Planeje o orçamento do trabalho como uma sequência de decisões, não como um botão ilimitado de "gerar de novo". Com as taxas iniciais públicas mostradas acima, uma execução de texto de 8 segundos custa cerca de $0.896 e uma edição por referência de 8 segundos custa cerca de $0.960. Um orçamento de três tentativas é, portanto, de cerca de $2.688 para o caso Rube Goldberg e $2.880 para qualquer um dos casos de edição por referência, antes que uma taxa de resolução maior ou um SKU de produto diferente seja aplicado.

Mantenha a cobrança da API, o preço de checkout na página do produto e as cotas de comunidade ou de conta separados no planejamento interno. Antes de comprar ou lançar, verifique o preço atual de resolução e duração da rota selecionada. Este artigo propositalmente não transforma uma listagem de taxa inicial em uma cotação permanente de 4K.

Use somente vídeos e imagens de referência que você tenha o direito de enviar. Obtenha permissão de pessoas reconhecíveis, mantenha registros do prompt e das origens e rotule o material gerado quando o público puder confundi-lo com imagens documentais. Revise diálogo, música, marcas registradas e semelhanças em uma etapa de aprovação própria. Essas proteções são tão importantes quanto a cláusula preserve em um prompt da API Gemini Omni Flash 1.1.

Perguntas Frequentes sobre a API Gemini Omni Flash 1.1

Qual é o ID de modelo estável da API Gemini Omni Flash 1.1?

O ID de modelo estável atual do Google é gemini-omni-1.1-flash. Use a documentação atual do modelo no momento da implementação, porque aliases de modelo e disponibilidade de prévia podem mudar.

O gemini-omni-flash-preview está sendo descontinuado?

Trate o nome de prévia como uma trilha de lançamento separada. Confirme o aviso atual de descontinuação na documentação de modelos do Google antes de fixá-lo em produção e use o ID estável quando ele corresponder aos seus requisitos.

O Gemini Omni Flash 1.1 pode editar um vídeo existente?

Sim. O fluxo documentado envia um vídeo pela API Files e fornece uma instrução de edição. Mantenha o segmento de origem curto e declare cada elemento que deve permanecer inalterado.

Qual é a duração máxima de um vídeo da API Gemini Omni Flash 1.1?

Os exemplos padrão de geração cobrem clipes curtos, enquanto o Omni 1.1 pode estender em incrementos de 10 segundos até um total acumulado de 40 segundos. Um corte de origem de referência para vídeo na Atlas Cloud deve ter 10 segundos ou menos na rota Developer atualmente documentada.

Ele pode preservar o diálogo e a trilha de áudio original?

Use instruções de preservação visual e depois verifique o áudio de forma independente. Para um clipe em que o diálogo ou a música exatos são importantes, leve a trilha original aprovada pela pós-produção em vez de tratar uma saída generativa como master de áudio automático.

Quanto custa a API Gemini Omni Flash 1.1?

O custo depende da rota, duração, resolução e da plataforma de cobrança. Para o fluxo da API Gemini Omni Flash 1.1, calcule segundos × a taxa exibida atualmente para a rota e reserve pelo menos 3 tentativas para qualquer tomada crítica de movimento.

Modelos recentes

Uma API para toda a IA de mídia.

Explorar Todos os Modelos