


Gemini Omni 1.1 Flash é a família de vídeos nativamente multimodal do Google DeepMind, criada para fluxos de produção flexíveis. Edite filmagens existentes por meio de instruções de texto, mantenha a consistência visual com até 10 imagens de referência e 3 clipes de vídeo ou estenda uma tomada em segmentos encadeáveis de até 40 segundos. Acesse todos os fluxos de trabalho no Atlas Cloud com uma única chave de API compatível com a OpenAI, preços conforme o uso e disponibilidade desde o Dia 0. Comece a desenvolver hoje.
Gemini Omni 1.1 Flash foi desenvolvido pela Google. A Atlas Cloud (operada pela Atlas Cloud AI LLC) fornece acesso ao modelo, mas não é sua proprietária. Todas as marcas registradas pertencem aos seus respectivos titulares.
O Atlas Cloud oferece os modelos criativos mais avançados e inovadores do setor.
Compare cinco endpoints do Gemini Omni 1.1 Flash por fluxo de entrada, recursos de saída e caso de uso em produção.
| Modalidade | Descrição |
|---|---|
| Gemini Omni 1.1 Flash Video Extend API | Continue um clipe existente com uma extensão perfeitamente integrada, com duração de 3 a 10 segundos e preservação do áudio nativo. Encadeie várias extensões para criar um único plano de vídeo coerente, com duração total de até 40 segundos. |
| Gemini Omni 1.1 Flash Video Edit API | Precisa revisar uma filmagem existente sem reconstruir toda a cena? Use instruções de texto para adicionar, remover, substituir ou alterar o estilo de elementos do vídeo com áudio nativo, preservando o conteúdo que não for mencionado no prompt. |
| Gemini Omni 1.1 Flash Reference-to-Video API | Forneça um prompt de texto com até 10 imagens de referência e 3 clipes de vídeo de referência para gerar um vídeo cinematográfico com som nativo. Este endpoint é adequado para projetos que exigem consistência de personagens, produtos ou direção artística entre as gerações. |
| Gemini Omni 1.1 Flash Image-to-Video API | Anime uma imagem estática em um clipe cinematográfico com som, orientado por um prompt de texto. Um quadro final opcional oferece controle preciso sobre onde o plano gerado começa e termina. |
| Gemini Omni 1.1 Flash Text-to-Video API | A partir de um único prompt de texto, este endpoint produz um vídeo cinematográfico com áudio nativo sincronizado. Ajuste a duração, a proporção e a resolução de saída, de um rascunho rápido em 360p a um resultado em 4K. |
O Gemini Omni 1.1 Flash combina geração de vídeo, áudio nativo, continuidade baseada em referências, controle preciso de quadros, edição orientada por instruções e extensão encadeável em um único fluxo de trabalho flexível do Atlas Cloud.
Comece com um prompt de texto e gere um clipe cinematográfico com áudio nativo sincronizado. O Gemini Omni 1.1 Flash permite controlar a duração, a proporção e a resolução de saída, desde rascunhos em 360p até 4K. Descreva o movimento, a direção da câmera, os diálogos, a música e a ambientação em uma única solicitação. Esse fluxo é ideal para trailers, anúncios em redes sociais e momentos narrativos que precisam desenvolver imagem e som em conjunto.
Continue um clipe existente com um segmento de 3 a 10 segundos perfeitamente integrado e, em seguida, encadeie extensões para chegar a até 40 segundos. O modelo mantém o contexto visual e o áudio nativo, fazendo com que a nova ação pertença ao mesmo plano. Crie revelações mais longas, perseguições ou histórias de produtos sem reiniciar a sequência sempre que a narrativa precisar de mais espaço.
Forneça um prompt de texto com até 10 imagens de referência e 3 clipes de vídeo de referência para orientar uma geração coerente com áudio nativo. As imagens podem definir um personagem, produto, local ou direção artística, enquanto as referências em vídeo orientam o movimento e o comportamento do plano. Use esse caminho quando a identidade consistente e a linguagem visual forem importantes em peças de campanha, cenas episódicas ou conteúdo de marca.
Defina a imagem inicial e, opcionalmente, forneça um último quadro para controlar onde o plano termina. O Gemini Omni 1.1 Flash anima a imagem estática em um clipe cinematográfico com som nativo e faz a interpolação até o ponto final fornecido. Essa estrutura de início e fim é adequada para revelações de produtos, transições contínuas, cortes de correspondência e movimentos de câmera planejados que precisam terminar em uma composição precisa.
Altere um vídeo existente por meio de uma instrução de texto direta, preservando tudo o que o prompt não mencionar. Adicione, remova, substitua ou reformule visualmente elementos, mantendo o áudio nativo no resultado editado. Quando uma tomada forte precisa apenas de um novo objeto, ambiente ou tratamento visual, esse fluxo focado preserva o restante do trabalho e evita reconstruir a cena do zero.
Passe de texto para vídeo, imagem para vídeo, geração por referência, edição e extensão pelo Atlas Cloud usando uma única chave de API. A cobrança transparente conforme o uso mantém a experimentação separada de assinaturas ou compromissos mínimos. Os desenvolvedores podem criar rascunhos em 360p e solicitar saídas de até 4K quando o nível de detalhe final for importante. Esse caminho unificado facilita a integração de toda a família de modelos aos fluxos de produção.
Veja como Gemini Omni 1.1 Flash, Seedance 2.5 e o Gemini Omni Flash anterior interpretam os mesmos dois prompts cinematográficos.
Um microfilme de fantasia de 8–10 segundos ambientado no interior de uma oficina artesanal de vidraria enegrecida: comece com uma aproximação macro extrema em direção a uma esfera vermelho-incandescente de vidro derretido, girando rapidamente na ponta de um tubo de sopro, sua superfície viscosa se dobrando, brilhando e refratando o fogo da fornalha enquanto um artesão moldado em argila gira continuamente o tubo; orbite bem próximo ao antebraço em movimento do artesão enquanto pinças metálicas golpeiam no ritmo e apertam o vidro derretido — sem cortes, a massa incandescente se estica, esfria e se transforma perfeitamente em um beija-flor de vidro transparente com um coração flamejante. Faça uma panorâmica brusca para uma tomada de acompanhamento em alta velocidade enquanto o beija-flor bate suas asas cristalinas, dispara sobre potes de pigmento abertos e arrasta pelo ar trilhas turbulentas de pó azul-pavão e magenta; cada batida de asa espalha partículas que colidem, giram e cintilam através de sua silhueta refratada. O pássaro faz uma curva fechada em direção a uma bolha de vidro flutuante e a bica exatamente no golpe musical final; corte para uma dramática visão de cima enquanto a bolha explode para fora, com fragmentos finíssimos se transformando continuamente em pétalas translúcidas e macias que espiralam pela oficina. Stop-motion refinado de argila fundido a texturas luminosas de vidro artístico semitransparente, imperfeições táteis feitas à mão, reflexos, refrações e cáusticas convincentes, tremulação do calor, deformação do vidro e física de partículas; luz laranja-avermelhada da fornalha como iluminação principal, luz lunar ciano fria como contraluz de recorte, paleta de preto fechado e dourado na abertura, explodindo em azul-pavão e magenta saturados no clímax. Movimento de câmera rápido e fluido, forte consistência temporal e dos personagens, sem pausas ou preenchimento em câmera lenta. Áudio: rugido da fornalha, zumbido do vidro girando, batidas metálicas rítmicas sincronizadas com cada aperto e batida de asa, pó sendo lançado pelo ar, um toque cristalino agudo no impacto e um final brilhante em cascata, do vidro às pétalas; sem telas, interfaces, painéis, barras de progresso, gráficos, legendas, logotipos ou texto. Proporção 16:9.
Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud
Uma sequência macro ultrafotorrealista de documentário de natureza, com 8–10 segundos, dentro de uma gruta rochosa de poças de maré na maré baixa: um polvo-dumbo? coral-laranja e vibrante improvisa uma percussão, com os oito braços anatomicamente consistentes movendo-se de forma independente, porém natural, enquanto suas ventosas golpeiam conchas peroladas, testes ocos de ouriço-do-mar e vidro marinho liso em um ritmo cada vez mais denso, com deformação, contato, ricochete e peso dos objetos precisos. Comece com uma tomada macro lateral de acompanhamento na linha d’água, deslizando ao lado do polvo enquanto gotas cintilam sobre sua pele texturizada e cada impacto envia pequenas ondulações pela água do mar ciano e fria; corte para uma câmera em ângulo extremamente baixo, movendo-se rapidamente entre os braços e instrumentos em movimento, mantendo a continuidade clara dos membros e uma oclusão realista. Um caranguejo-eremita entra correndo de repente, agarra a concha principal e foge; faça uma panorâmica brusca para uma perseguição rápida e divertida enquanto o polvo salta e desliza sobre a rocha lisa e irregular, com os braços agarrando, soltando e empurrando com atrito convincente, enquanto as patas do caranguejo tilintam sobre os seixos. Pouco antes de uma onda crescente inundar a gruta, o polvo recupera a concha, a fixa firmemente e desfere um golpe final enfático; eleve rapidamente a câmera para uma tomada aérea de cima, enquanto a onda explode ao redor do polvo e a espuma radiada forma uma composição quase perfeitamente circular. Cáusticas subaquáticas dançantes produzidas pela luz solar fragmentada, água verde-azulada fria em contraste com o sujeito coral-laranja, respingos cristalinos, bolhas, areia suspensa, reflexos nas rochas molhadas, profundidade de campo macro rasa, HDR cinematográfico, texturas naturais extremamente nítidas, movimento contínuo e fluido, transições de câmera em alta velocidade sem câmera lenta. Som diegético apenas, perfeitamente sincronizado: toques distintos de conchas, batidas ocas de conchas de ouriço, cliques brilhantes de vidro, liberação das ventosas, raspadas das garras e patas do caranguejo-eremita, arrebentação crescente, então o golpe final e a quebra da onda em alinhamento rítmico exato; sem música, narração, texto, legendas, logotipos, interface, painel, gráficos, barras de progresso, tela dividida, membros extras, braços fundidos ou duplicados, anatomia deformada, objetos flutuantes, penetração ou física de contato quebrada, movimento emborrachado, cintilação temporal, cortes abruptos, posições inconsistentes da concha ou estilo de desenho animado. Documentário cinematográfico de vida selvagem macro, ultrafotorrealista, proporção 16:9.
Generated with Gemini Omni 1.1 Flash Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Gemini Omni Flash Text-to-Video on Atlas Cloud
Gemini Omni 1.1 Flash transforma briefings, imagens estáticas, mídias de referência e clipes existentes em vídeos de campanha, histórias com personagens consistentes, transições controladas, cenas estendidas e assets sociais prontos para produção, com áudio nativo.
Clipes existentes ganham uma continuação de três a dez segundos perfeitamente integrada, e extensões encadeadas podem chegar a quarenta segundos. Cineastas e equipes de conteúdo seriado podem desenvolver planos únicos coerentes sem reconstruir cada cena.
Precisa de um novo produto, plano de fundo ou estilo visual? Aplique uma edição instruída por texto preservando os elementos não mencionados, permitindo que as equipes de marketing criem variantes direcionadas sem recriar o clipe de origem do zero a cada vez.
Com até dez imagens de referência e três clipes de vídeo, o modelo consegue manter um personagem, produto ou direção de arte consistente entre as gerações. Os estúdios de marca obtêm cenas relacionadas para lançamentos, com uma identidade visual mais consistente.
Comece com uma imagem estática e, opcionalmente, forneça o quadro final, permitindo que o modelo anime um percurso cinematográfico entre as duas composições. Designers obtêm controle preciso sobre a abertura e o encerramento para revelações, loops e mudanças de cena.
Um único briefing em texto se transforma em um clipe cinematográfico com áudio nativo sincronizado, enquanto duração, proporção e resolução de saída continuam selecionáveis. Criadores podem adaptar anúncios e histórias sociais a diferentes formatos de publicação.
Ao testar um plano, faça protótipos em 360p, compare direções promissoras e eleve os conceitos selecionados para uma saída em 4K. Diretores e desenvolvedores criativos podem validar movimento, enquadramento, som e ritmo antes da produção final.
Compare o Gemini Omni 1.1 Flash com os principais modelos de texto para vídeo em duração do clipe, resolução máxima, suporte a áudio nativo e taxa de quadros de saída.
| Modelo | Duração da saída | Resolução máxima | Áudio nativo | Taxa de quadros |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash Text-to-Video | 3–10 segundos | 4K | √ | 24 FPS |
| MiniMax H3 Text-to-Video | 4–15 segundos | 2K | √ | 24 FPS |
| Wan-3.0 Text-to-video | 2–30 segundos | 1080P | √ | 30 FPS |
Comece em minutos — siga estes passos simples para integrar e implantar modelos pela plataforma da Atlas Cloud.
Cadastre-se em atlascloud.ai e conclua a verificação. Novos usuários recebem créditos gratuitos para explorar a plataforma e testar modelos.
Combine modelos avançados de Gemini Omni 1.1 Flash com a plataforma acelerada por GPU do Atlas Cloud, fornecendo desempenho, escalabilidade e experiência de desenvolvimento incomparáveis.
Baixa Latência:
Inferência otimizada por GPU para respostas em tempo real.
API Unificada:
Uma única integração para acessar Gemini Omni 1.1 Flash, GPT, Gemini e DeepSeek.
Preços Transparentes:
Faturamento por Token, suporta modo Serverless.
Experiência do Desenvolvedor:
SDK, análise de dados, ferramentas de ajuste fino e modelos tudo em um.
Confiabilidade:
99.99% de disponibilidade, controle de permissões RBAC, logs de conformidade.
Segurança e Conformidade:
Certificação SOC 2 Type II, conformidade HIPAA, soberania de dados nos EUA.
O Gemini Omni 1.1 Flash é um modelo nativamente multimodal de geração e edição de vídeo da Google DeepMind. No Atlas Cloud, ele oferece suporte a cinco fluxos de trabalho específicos, abrangendo geração, criação orientada por referências, edição e extensão. Os vídeos gerados podem incluir áudio nativo sincronizado.
Ele pode gerar vídeos a partir de texto, animar uma imagem estática, seguir referências visuais, editar um clipe existente com base em uma instrução de texto ou continuar uma cena. O Image to Video também pode interpolar em direção a um último quadro fornecido, permitindo transições de plano controladas.
Crie uma chave de API do Atlas Cloud e selecione o endpoint correspondente ao seu fluxo de trabalho. Envie um prompt com qualquer imagem, vídeo ou mídia de referência exigida, de acordo com o esquema de parâmetros desse endpoint. Comece com um plano descrito de forma clara e refine suas entradas após analisar o resultado.
Escolha Text to Video para geração baseada em prompts e Image to Video para animar um quadro estático. Reference to Video ajuda a orientar a identidade ou a direção artística, enquanto Video Edit altera imagens existentes e Video Extend dá continuidade a um plano já estabelecido.
Text to Video oferece controles de duração, proporção e resolução de saída de 360p a 4K. Image to Video aceita uma imagem inicial e pode usar um último quadro opcional. Reference to Video é compatível com até 10 imagens de referência e 3 clipes de vídeo de referência.
Sim, os cinco fluxos de trabalho do Atlas Cloud foram projetados para produzir vídeos com áudio nativo sincronizado. Quando o áudio for importante para a cena, descreva claramente no prompt os diálogos, a ambiência, a música ou os efeitos sonoros desejados.
O Atlas Cloud oferece acesso com cobrança conforme o uso. O preço-base padrão é de $0.041 para Text to Video, Reference to Video, Video Edit e Video Extend, enquanto Image to Video tem preço-base padrão de $0.043. Esses valores correspondem aos preços padrão de backend, e não a tarifas promocionais temporárias.
Cada extensão pode adicionar entre 3 e 10 segundos, e as extensões podem ser encadeadas até que um único plano coerente alcance 40 segundos no total. O modelo usa o clipe existente como contexto, dando continuidade tanto aos elementos visuais quanto ao áudio nativo.
Use Reference to Video com recursos de referência claros e compatíveis, incluindo até 10 imagens e 3 clipes de vídeo. Para animar uma imagem, forneça um quadro inicial consistente e um último quadro opcional quando precisar controlar o destino da animação. A saída generativa ainda pode apresentar variações; por isso, verifique a identidade, a iluminação, o movimento e o áudio após cada geração ou extensão.
A Google descreve 1080p e 4K como opções de saída ampliada, e não como resoluções de geração nativa. Use 360p para iterações preliminares e selecione uma resolução maior quando a composição e o movimento atenderem aos seus requisitos.
Guias, tutoriais e novidades de produto para você aproveitar ao máximo a Atlas Cloud.