
Grok Imagine Video 1.5 é a família de geração de vídeo da xAI para desenvolvedores que precisam de movimento controlado a partir de prompts e entradas visuais. Anime um quadro inicial com instruções de movimento em linguagem natural, selecione 480p ou 720p para fluxos de trabalho baseados em referência e adicione uma voz de referência opcional para orientar o resultado. Acesse os modos compatíveis usando uma única chave Atlas Cloud compatível com OpenAI, com preços transparentes conforme o uso. Comece a desenvolver hoje.
Grok Imagine Video 1.5 foi desenvolvido pela xAI. A Atlas Cloud (operada pela Atlas Cloud AI LLC) fornece acesso ao modelo, mas não é sua proprietária. Todas as marcas registradas pertencem aos seus respectivos titulares.
Explore seis endpoints que transformam texto, frames iniciais ou ativos de referência em vídeo para fluxos de trabalho de desenvolvedores e padrão.
| Modalidade | Descrição |
|---|---|
| Grok Imagine Video 1.5 Developer Reference-to-Video API | Transforme de 1 a 7 imagens de referência e uma voz de referência opcional em vídeo, com áudio sincronizado nativamente. As saídas podem ter até 15 segundos, em 480p ou 720p. Este endpoint é ideal para cenas orientadas por referências e conceitos visuais que exigem várias imagens de origem. |
| Grok Imagine Video 1.5 Reference-to-Video API | Orientado por 1 a 7 imagens de referência, este endpoint gera vídeos com áudio sincronizado nativamente e também pode aceitar uma voz de referência opcional. Suporta durações de até 15 segundos em 480p ou 720p. Escolha-o para produção de vídeos com várias referências e sequências guiadas por voz. |
| Grok Imagine Video 1.5 Developer Text-to-Video API | Basta um prompt de texto para gerar vídeos com áudio sincronizado nativamente por meio deste endpoint para desenvolvedores. Crie clipes de até 15 segundos em 480p, 720p ou 1080p. É adequado para conceitos orientados por prompts, storyboards e produção de vídeos curtos. |
| Grok Imagine Video 1.5 Text-to-Video API | Crie um vídeo diretamente a partir de um prompt de texto, gerando áudio sincronizado de forma nativa. As opções de saída incluem 480p, 720p e 1080p, com duração máxima de 15 segundos. Use-o para cenas roteirizadas, conceitos de campanhas ou ativos de vídeo para redes sociais. |
| Grok Imagine Video 1.5 Developer Image-to-Video API | Partindo de uma imagem, este endpoint para desenvolvedores aplica instruções de movimento em linguagem natural para produzir um vídeo animado. As opções de resolução incluem 480p, 720p e 1080p. É adequado para animar artes, visuais de produtos e frames iniciais preparados. |
| Grok Imagine Video 1.5 Image-to-Video API | Anime uma imagem de frame inicial descrevendo o movimento desejado em linguagem natural. O vídeo resultante pode ser gerado em 480p, 720p ou 1080p. Esse fluxo de trabalho é compatível com estudos de movimento, narrativa visual e produção criativa orientada por imagens. |
O Grok Imagine Video 1.5 reúne fluxos de trabalho com texto, imagem inicial e de uma a sete imagens de referência, com áudio nativo sincronizado, saída de até 1080p e clipes de até 15 segundos nos modos de texto ou referência, enquanto o Atlas Cloud oferece uma única API e preços transparentes conforme o uso.
Comece com um prompt de texto e gere clipes de até 15 segundos em 480p, 720p ou 1080p. O áudio nativo sincronizado é gerado junto com o vídeo. Crie toda a cena e a ação por meio de instruções escritas quando não houver uma imagem de origem. Esse fluxo é adequado para filmes conceituais, experimentos cinematográficos e pipelines de conteúdo orientados por prompts.
Um único quadro inicial se transforma em uma sequência em movimento por meio de prompts de movimento em linguagem natural. Escolha uma saída em 480p, 720p ou 1080p, enquanto a imagem define a composição de abertura. Descreva no prompt o movimento do sujeito e da cena e deixe o modelo animar a partir dessa âncora visual. É ideal para tomadas de produtos, momentos com personagens e imagens estáticas com direção artística que precisam de movimento.
Oriente o Grok Imagine Video 1.5 com uma a sete imagens de referência e uma voz de referência opcional. O modo de referência produz clipes de até 15 segundos em 480p ou 720p, com áudio nativo sincronizado. Use essas entradas para conduzir a cena gerada em direção a uma estética visual já estabelecida. Esse fluxo é adequado para campanhas e histórias construídas a partir de referências criativas existentes.
O vídeo e o som são gerados juntos, portanto cada clipe pode incluir áudio nativo sincronizado sem uma etapa de áudio separada. Crie cenas em torno de ações visíveis cujo ritmo possa ser reforçado pela faixa de áudio correspondente. Quando a sincronização for importante, esse fluxo de geração combinada reduz a transição entre a criação visual e a produção sonora. É especialmente útil para filmagens ricas em performance e atmosfera.
Desenvolva um momento visual completo em clipes de texto ou referência com duração de até 15 segundos, em vez de interrompê-lo em um loop breve. A duração disponível permite incluir preparação, movimento e uma conclusão clara em uma única sequência gerada. Combine esse espaço com mudanças de perspectiva da câmera e ação contínua para criar um momento mais desenvolvido. Esse formato funciona bem para anúncios curtos, revelações narrativas e cenas de vídeo para redes sociais.
Alterne entre gerações a partir de texto, imagens iniciais e referências por meio de uma única API do Atlas Cloud, com preços transparentes conforme o uso. Selecione o fluxo que corresponde a cada recurso, em vez de forçar todas as ideias a usar um único tipo de entrada. A mesma integração oferece aos desenvolvedores acesso aos seis endpoints listados do Grok Imagine Video v1.5, incluindo as rotas padrão e Developer. Isso simplifica a experimentação e o planejamento de produção em diferentes trabalhos de vídeo.
Veja como Grok Imagine Video 1.5 e duas alternativas do Atlas Cloud interpretam prompts idênticos em cenas de ação cinematográfica e fantasia estilizada.
Um filme de fantasia barroca subaquática de 9 segundos, em plano-sequência, dentro de uma casa de ópera abandonada e completamente inundada: uma mergulhadora em apneia graciosa, com cabelos esvoaçantes e uma máscara de pérola luminosa, persegue um polvo vermelho-coral vibrante que carrega uma chave de latão ornamentada por entre cortinas de veludo à deriva. Comece de dentro de um piso de palco rachado, com um dramático plano de baixo para cima, enquanto ela gira e mergulha de cabeça pela fissura; faça a transição para um travelling lateral fechado enquanto ela passa entre assentos de teatro tombados, com os cabelos e o figurino respondendo naturalmente às correntes, enquanto as cortinas ondulam e bolhas percorrem arcos em camadas; depois, orbite ao redor dela e eleve a câmera em grua enquanto a pressão da água arranca um lustre de cristal acima. No clímax, ela gira de lado no último instante para evitar o lustre em queda, com os cristais colidindo e se espalhando de forma realista, enquanto o polvo captura habilmente a chave que despenca com seus tentáculos complexos e enrolados, faz uma pausa solene e a devolve à mão aberta dela. Movimento fluido contínuo, começo–perseguição–desfecho bem definidos, personagem e máscara de pérola consistentes, resistência da água, flutuabilidade, tecido, cabelos, bolhas, deformação dos tentáculos, impactos e prevenção de colisões fisicamente precisos. Feixes cianos frios de claraboias estilhaçadas atravessam o auditório submerso e escuro; o vermelho-coral é a única cor altamente saturada, guiando o olhar por camadas profundas de arcos, cortinas, detritos suspensos e bolhas. Fotografia cinematográfica subaquática fotorrealista com uma textura sutil de pintura a óleo, grandiosidade barroca elegante, cáusticas volumétricas, alto nível de detalhe, sem texto, sem interface, sem cortes disfarçados de quadros estáticos. Áudio imersivo: estrondos subaquáticos abafados, correntes velozes, ondulação do tecido, bolhas, impactos cristalinos e um pulso orquestral tenso que se resolve em uma única nota delicada de harpa quando a chave é devolvida. Proporção de 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Um comercial absurdista de comédia de ação ambientado dentro de uma barbearia dos anos 1950, meticulosamente detalhada, ao amanhecer. Um Bobtail desgrenhado e mal-humorado, encharcado de espuma branca e espessa de sabão, irrompe pela porta e atravessa a barbearia em disparada, espalhando espuma por toda parte; um barbeiro assustado pula sobre uma cadeira giratória e a usa para persegui-lo, cortando rapidamente o pelo esvoaçante do cão, com cada estalo nítido da tesoura precisamente sincronizado com batidas marcantes de bateria de jazz. Comece com um plano de travelling rente ao chão, correndo ao lado das patas molhadas enquanto elas deslizam sobre ladrilhos brilhantes quadriculados em preto e branco, lançando gotas e respingos de espuma realistas em direção à lente; faça um whip-pan ascendente para um rápido travelling circular que usa três grandes espelhos para revelar e preservar continuamente as posições em movimento do cão e do barbeiro por meio de reflexos complexos e precisos; depois, execute um avanço rápido de dolly enquanto os últimos tufos de pelo cortado, ainda no ar, despencam, giram e pousam perfeitamente sobre a cabeça do cão, formando um topete pompadour escandalosamente alto. O cão para e posa com ar presunçoso em um momento heroico de um segundo, semelhante a um congelamento de imagem, e então espirra de repente, produzindo uma explosão de espuma e pelos enquanto o jazz termina com um golpe seco de aro cômico. Luzes práticas quentes de tungstênio cortam a névoa matinal verde-azulada e fria do lado de fora das janelas; rica paleta vintage de bordô, creme, latão polido e madeira escura; cinematografia publicitária premium em live action, coreografia contínua de alta velocidade e sem emendas, personagens e continuidade espacial consistentes, pelo molhado, espuma de sabão, pelos soltos, reflexos, rotação da cadeira, inércia e colisões fisicamente precisos, detalhe fotorrealista e tátil, nitidez de movimento, sem câmera lenta, sem planos de estabelecimento vazios, sem telas, sem interfaces de software, sem painéis, sem barras de progresso, sem gráficos, sem legendas, sem texto explicativo, sem logotipos, sem marcas d’água, proporção de 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Grok Imagine Video 1.5 transforma prompts, quadros de origem e até sete imagens de referência em vídeos curtos com áudio sincronizado para campanhas, demonstrações de produtos, histórias de personagens, conteúdo para redes sociais e prototipagem visual rápida.
Anime uma imagem estática de produto com prompts de movimento em linguagem natural e áudio sincronizado. Crie clipes curtos de demonstração para vitrines, páginas de campanha, materiais de lançamento ou anúncios pagos em redes sociais em até 1080p.
Oriente uma cena com uma a sete referências de personagens e uma voz de referência opcional. Essa configuração permite aparições recorrentes do elenco, momentos de diálogo e clipes narrativos curtos com áudio sincronizado nativo.
Comece com um prompt de texto para gerar um vídeo completo com áudio sincronizado nativo. As equipes de marketing podem explorar conceitos de campanha, peças atmosféricas e teasers de lançamento sem preparar uma imagem de origem.
Transforme um único quadro inicial em movimento usando direção em linguagem natural em até 1080p. Produza materiais concisos de campanha para feeds, páginas de lançamento, anúncios de eventos, atualizações de produtos e publicações conduzidas por criadores.
Dê vida a um quadro de storyboard aprovado com movimento orientado por prompt, mantendo-o como imagem inicial. Diretores e designers podem criar planos curtos de pré-visualização com áudio sincronizado para revisão.
Combine imagens de produtos, retratos de personagens, detalhes de figurino e referências de cenas em até sete imagens. As equipes de marca podem dirigir cenas promocionais curtas com som sincronizado, fundamentando cada solicitação nos materiais visuais fornecidos.
Compare o Grok Imagine Video 1.5 com os principais modelos de referência para vídeo em relação aos tipos de entrada aceitos, à duração dos clipes, à resolução, ao áudio sincronizado e ao preço padrão por segundo.
| Modelo | Tipos de entrada | Duração do clipe | Resolução máxima | Áudio nativo | Preço padrão |
|---|---|---|---|---|---|
| Grok Imagine Video v1.5 | Texto, imagem, imagens de referência, voz | Até 15 segundos | 1080p | √ | $0.08/segundo |
| Seedance 2.0 Reference-to-Video | Texto, imagem, vídeo, áudio | 4 a 15 segundos | 4K | √ | $0.112/segundo |
| MiniMax H3 Reference-to-Video | Texto, imagem, vídeo, áudio | 4 a 15 segundos | 2K | √ | $0.038/segundo |
| Wan-2.7 Reference-to-video | Texto, imagem, vídeo, áudio | 2 a 10 segundos | 1080p | √ | $0.10/segundo |
Comece em minutos — siga estes passos simples para integrar e implantar modelos pela plataforma da Atlas Cloud.
Cadastre-se em atlascloud.ai e conclua a verificação. Novos usuários recebem créditos gratuitos para explorar a plataforma e testar modelos.
Combine modelos avançados de Grok Imagine Video 1.5 com a plataforma acelerada por GPU do Atlas Cloud, fornecendo desempenho, escalabilidade e experiência de desenvolvimento incomparáveis.
Baixa Latência:
Inferência otimizada por GPU para respostas em tempo real.
API Unificada:
Uma única integração para acessar Grok Imagine Video 1.5, GPT, Gemini e DeepSeek.
Preços Transparentes:
Faturamento por Token, suporta modo Serverless.
Experiência do Desenvolvedor:
SDK, análise de dados, ferramentas de ajuste fino e modelos tudo em um.
Confiabilidade:
99.99% de disponibilidade, controle de permissões RBAC, logs de conformidade.
Segurança e Conformidade:
Certificação SOC 2 Type II, conformidade HIPAA, soberania de dados nos EUA.
O Grok Imagine Video 1.5 é uma família de modelos de geração de vídeo da xAI para criar clipes a partir de texto, de uma imagem inicial ou de várias imagens de referência. Por meio da Atlas Cloud, os desenvolvedores podem acessar endpoints separados para cada modo de geração.
Há três modos disponíveis: texto para vídeo, imagem para vídeo e referência para vídeo. Escolha texto para criar uma cena do zero, imagem para animar um quadro inicial ou o modo de referência para orientar sujeitos, objetos e estilos com várias imagens.
Crie uma chave de API da Atlas Cloud e envie uma solicitação autenticada ao endpoint de geração de vídeo com o ID de modelo apropriado. Use o ID da tarefa retornado para verificar o status da geração e obter a URL do vídeo concluído.
O modo texto para vídeo exige um prompt em linguagem natural, enquanto o modo imagem para vídeo adiciona uma imagem do quadro inicial. O modo referência para vídeo aceita um prompt e de 1 a 7 imagens de referência, com IDs de voz predefinidos opcionais para o diálogo gerado.
Os schemas disponíveis da Atlas Cloud são compatíveis com clipes de 1 a 15 segundos. Os modos texto para vídeo e imagem para vídeo oferecem saída em 480p, 720p ou 1080p, enquanto o modo referência para vídeo é compatível com 480p ou 720p.
Sim. O modo texto para vídeo gera áudio nativo sincronizado a partir do prompt, e o modo referência para vídeo pode combinar o áudio gerado com uma voz predefinida opcional para o diálogo.
A Atlas Cloud lista um preço-base padrão de $0.08 para cada endpoint abrangido por esta página da família. Consulte os detalhes atuais de cobrança do endpoint selecionado antes da implantação, pois o registro de preço fornecido não especifica a unidade de cobrança.
Forneça entre 1 e 7 imagens por meio do endpoint referência para vídeo. Identifique assets específicos no prompt usando tags como <IMAGE_0> e <IMAGE_1> para que o modelo possa associar cada referência ao sujeito ou elemento de cena pretendido.
Os schemas disponíveis da Atlas Cloud não incluem um parâmetro dedicado para o último quadro. O modo imagem para vídeo usa uma imagem como quadro inicial, enquanto o modo referência para vídeo usa de 1 a 7 imagens como orientação visual, e não como primeiros e últimos quadros garantidos.
Escolha o modo referência para vídeo quando várias imagens precisarem orientar as pessoas, os objetos ou o estilo visual de uma nova cena. Use o modo imagem para vídeo quando uma única imagem existente deverá se tornar o quadro inicial e seu movimento deverá seguir um prompt em linguagem natural.
Guias, tutoriais e novidades de produto para você aproveitar ao máximo a Atlas Cloud.