
Grok Imagine Video dá aos desenvolvedores acesso à família de modelos de vídeo da xAI para criar, animar, estender e editar clipes. Gere vídeos de 1 a 15 segundos a partir de prompts, oriente pessoas, objetos ou estilos com até sete imagens de referência e trabalhe em 480p ou 720p. A Atlas Cloud reúne esses recursos por meio de endpoints compatíveis com a OpenAI, com preços transparentes conforme o uso. Comece a desenvolver hoje.
Grok Imagine Video foi desenvolvido pela xAI. A Atlas Cloud (operada pela Atlas Cloud AI LLC) fornece acesso ao modelo, mas não é sua proprietária. Todas as marcas registradas pertencem aos seus respectivos titulares.
Escolha o endpoint do Grok Imagine Video que corresponda aos seus assets de origem, à transformação desejada e ao seu fluxo de produção.
| Modalidade | Descrição |
|---|---|
| Grok Imagine Video T2V API (Texto para vídeo) | Transforme prompts em linguagem natural em vídeos de 1 a 15 segundos, em 480p ou 720p. Este endpoint é adequado para visualização de conceitos, clipes para redes sociais e cenas criadas sem mídia de origem. |
| Grok Imagine Video I2V API (Imagem para vídeo) | Começando com uma imagem fornecida, este endpoint aplica prompts de movimento em linguagem natural para produzir vídeos em 480p ou 720p. Use-o para animar ilustrações, imagens de produtos, quadros de personagens ou materiais visuais de campanhas. |
| Grok Imagine Video R2V API (Referência para vídeo) | Oriente a geração de vídeos com 1 a 7 imagens de referência que representem pessoas, objetos ou estilos visuais. As saídas podem ter até 10 segundos, em 480p ou 720p, dando suporte à produção criativa orientada por referências. |
| Grok Imagine Video Extend API (Extensão de vídeo) | Dê continuidade a um MP4 existente de 2 a 15 segundos com uma extensão orientada por prompt, com duração de 2 a 10 segundos. A saída corresponde ao formato de entrada e é limitada a 720p, tornando este endpoint útil para prolongar tomadas já estabelecidas. |
| Grok Imagine Video Edit API (Edição de vídeo) | Forneça um MP4 e instruções em linguagem natural para modificar seu conteúdo visual, mantendo a duração da fonte. A saída é limitada a 8.7 segundos, o que atende a revisões direcionadas e transformações baseadas em prompts de vídeos curtos. |
O Grok Imagine Video transforma texto, quadros iniciais e até sete referências em clipes curtos e, em seguida, estende ou edita vídeos MP4 existentes por meio da API unificada da Atlas Cloud, com cobrança conforme o uso.
Escreva um prompt em linguagem natural e gere um clipe de 1 a 15 segundos em 480p ou 720p. Sete proporções de aspecto, incluindo 16:9, 1:1 e 9:16, permitem adaptar cada tomada ao formato de tela desejado. Controle o assunto, a ação, o movimento da câmera e a atmosfera diretamente no prompt. É um ponto de partida flexível para momentos narrativos, conceitos de campanhas e vídeos para redes sociais.
Transforme uma imagem de quadro inicial fornecida em um vídeo de 1 a 15 segundos em 480p ou 720p. A imagem estabelece a composição de abertura, enquanto um prompt de movimento em linguagem natural orienta o movimento e o desenvolvimento da cena. Escolha entre sete proporções de aspecto quando precisar de um formato de saída diferente. Esse fluxo é adequado para imagens de produtos, cenas ilustradas e conceitos dirigidos por arte que precisam de movimento sem reconstruir o quadro inicial.
Oriente um vídeo usando de 1 a 7 imagens de referência que representem pessoas, objetos ou estilos visuais. Faça referência a entradas individuais no prompt e gere até 10 segundos em 480p ou 720p, usando uma das sete proporções de aspecto compatíveis. Como as referências moldam a cena sem servirem apenas como um quadro inicial, os criadores obtêm mais controle sobre elementos visuais recorrentes. Use esse fluxo para cenas centradas em personagens, narrativas de produto ou campanhas conscientes do estilo visual.
Continue um MP4 existente de 2 a 15 segundos com uma extensão orientada por prompt, com duração de 2 a 10 segundos. O Grok Imagine Video retoma a partir do quadro final e retorna o clipe original junto com o novo segmento, mantendo a resolução de entrada de até 720p. Descreva a próxima ação, revelação ou movimentação de câmera em linguagem simples. Assim, fica mais fácil transformar finais abruptos em momentos narrativos completos.
Forneça ao Grok Imagine Video um MP4 e instruções em linguagem natural para transformar a gravação, mantendo sua duração original. As entradas podem ter até 8.7 segundos, e a cobrança acompanha a duração do vídeo de entrada. Solicite uma alteração visual, uma mudança de atmosfera ou uma revisão no nível da cena sem reconstruir o clipe do zero. Esse fluxo é ideal para variações criativas curtas e refinamentos controlados após a geração.
Alterne entre texto para vídeo, imagem para vídeo, geração orientada por referências, extensão e edição por meio de uma única API unificada. Selecione o endpoint correspondente ao material de origem disponível e envie cada tarefa por um fluxo assíncrono de predição. Mantenha padrões consistentes de autenticação e integração em todos os fluxos. O acesso com cobrança conforme o uso viabiliza experimentos e pipelines de produção repetíveis. Os desenvolvedores podem criar ferramentas de vídeo mais abrangentes com menos esforço de integração.
Veja como o Grok Imagine Video e duas alternativas líderes interpretam prompts idênticos por meio de movimento, continuidade, controle de câmera, iluminação e narrativa visual.
Um filme de aventura ao ar livre hiper-realista de 8–10 segundos, ambientado em um desfiladeiro esmeralda imediatamente após uma tempestade torrencial. Um canoísta usando um traje impermeável azul-cobalto e um colete salva-vidas vermelho-alaranjado atravessa uma corredeira de águas brancas violentas do primeiro ao último quadro. Comece com uma tomada de acompanhamento ultrabaixa, rente à linha d’água, correndo ao lado do caiaque enquanto as pás cortam a correnteza, lançando respingos nítidos sobre a lente; o caiaque sobe pela crista íngreme de uma onda e é lançado ao ar. Faça uma panorâmica rápida até a visão em primeira pessoa do canoísta enquanto o barco gira de lado sob uma árvore caída, atravessa uma cortina translúcida de água e passa por pouco sobre rochas molhadas e pontiagudas, mantendo mãos, pá e proa azul-cobalto fisicamente consistentes através dos respingos e de breves oclusões. O canoísta apoia a pá contra a correnteza, desvia da parede do cânion em uma curva fechada de ricochete e volta a cair na torrente. No clímax, faça a transição para uma descida de drone a partir do topo do penhasco, descendo rapidamente e orbitando o canoísta durante o pouso; a proa atinge uma caixa de madeira flutuante com impacto convincente, quebrando-a — e, em uma revelação repentina e divertida, um cordão conectado de lanternas de papel coloridas perfeitamente intactas salta para fora, se desenrola e flutua calorosamente sobre a água fria e turbulenta enquanto o caiaque segue em disparada. Movimento contínuo e anatomicamente correto, inércia realista do caiaque, resistência da pá, colisões, dinâmica de fluidos turbulentos, movimento do tecido, gotas, respingos na lente e identidade do sujeito preservada após cada obstrução; sem câmera lenta, sem planos gerais vazios de ambientação, sem cortes para telas, interfaces, painéis, barras de progresso, gráficos, legendas, logotipos ou texto explicativo. Luz do dia fria, cianótica e nublada, paredes de rocha esmeralda escurecidas pela chuva, colete salva-vidas vermelho-alaranjado vívido, brilho quente e multicolorido das lanternas, composições diagonais cinematográficas em widescreen enfatizando a velocidade, alto contraste, desfoque de movimento natural e cinematografia imersiva e fotorrealista de esportes de ação. Áudio sincronizado: corredeiras estrondosas, impactos secos da pá, madeira rachando, respiração ofegante, água atingindo o casco e um acento musical percussivo e vibrante quando as lanternas se libertam. Proporção de 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
Uma sequência cinematográfica de ação contínua de 8–10 segundos em um mercado noturno ao ar livre, momentos antes de uma tempestade torrencial: um mestre ramen vendado corre com confiança por um labirinto de barracas de comida lotadas enquanto estica continuamente uma fita de macarrão branco-prateada entre as mãos. Comece com uma visão aérea perfeitamente vertical e, em seguida, mergulhe rapidamente do alto no labirinto do mercado iluminado por neon, enquanto as primeiras gotas pesadas de chuva atingem os toldos e o pavimento molhado. Fixe-se na fita de macarrão voadora e corra a poucos centímetros dela enquanto ela chicoteia por cima de braseiros de carvão incandescentes, clientes assustados, grelhas crepitantes e guarda-chuvas que se abrem bruscamente ao vento; preserve o movimento humano contínuo, a física elástica plausível do macarrão, oclusões complexas em primeiro plano, chuva espirrando, faíscas e vapor denso. Faça uma panorâmica rápida até o chef saltar sobre uma caixa baixa sem interromper o passo e, em seguida, execute uma órbita rápida de 360 graus ao redor dele enquanto ele gira e solta o macarrão para trás com impulso preciso. A fita de macarrão descreve um arco limpo até uma panela de cobre fervendo vigorosamente atrás dele — no exato momento do triunfo, um gato malhado laranja travesso salta de baixo da barraca, abocanha metade do macarrão pendurado e dispara, criando uma piada visual de impacto imediato enquanto o chef continua correndo, sem perceber. Fotorrealismo neon-noir, reflexos ciano-esverdeados e magenta sobre o chão molhado pela chuva, fogo quente em tom laranja-fornalha como acentos visuais rítmicos, vapor e chuva táteis, coreografia estável, detalhes cinematográficos nítidos, ritmo energético em tempo real, sem câmera lenta e sem cortes que quebrem a continuidade espacial ou dos personagens. Áudio: trovões crescentes, conversas do mercado, passos fortes, estalos de guarda-chuvas, carvão crepitando, água fervendo e o som sibilante do macarrão sincronizado aos movimentos da câmera, terminando com um miado felino cômico e vibrante e um respingo da panela de cobre. Sem telas, interfaces de usuário, painéis, barras de progresso, gráficos, legendas, subtítulos, logotipos, marcas-d’água ou texto explicativo. Proporção de 16:9.
Generated with Grok Imagine Video v1.5 Text-to-Video on Atlas Cloud
Generated with Seedance 2.5 Text-to-Video on Atlas Cloud
Generated with Grok Imagine Video v1.5 Developer Text-to-Video on Atlas Cloud
O Grok Imagine Video transforma prompts, imagens estáticas, referências e arquivos MP4 existentes em caminhos práticos para clipes sociais, visuais de produtos, histórias de marca, sequências mais longas, edições direcionadas e ferramentas para criadores.
O Grok Imagine Video converte prompts em linguagem natural em clipes curtos de 480p ou 720p. Use-o para produzir teasers para redes sociais, conceitos de campanhas e rascunhos visuais rápidos sem preparar material de origem antecipadamente.
A partir de uma imagem de produto, o endpoint image to video adiciona movimento orientado por prompt em 480p ou 720p. As marcas podem transformar imagens estáticas de catálogos em revelações de produtos, materiais de lançamento e visuais para marketplaces.
Com uma a sete imagens, reference to video orienta pessoas, objetos ou estilos em um novo clipe. As equipes criativas podem desenvolver histórias de marca, conceitos de personagens e cenas de produtos fundamentadas nos visuais fornecidos.
Continue um MP4 existente com uma extensão orientada por prompt de dois a dez segundos que preserva a resolução de entrada de até 720p. Isso permite criar momentos mais longos de storyboard, transições episódicas e sequências subsequentes a partir de material aprovado.
Edite um MP4 por meio de instruções em linguagem natural, mantendo a duração original e limitando a saída a 8.7 segundos. As equipes podem criar visuais alternativos, variações localizadas de campanhas ou tratamentos visuais revisados.
Desenvolva ferramentas de vídeo orientadas por prompts com base nos cinco modos do Grok Imagine Video para geração, animação, referências, extensão e edição. Os desenvolvedores podem oferecer fluxos de trabalho para criadores em uma única família, selecionando saídas em 480p ou 720p.
Compare os fluxos de trabalho do Grok Imagine Video com alternativas selecionadas do Atlas Cloud em relação aos métodos de entrada, à duração dos clipes, à resolução máxima e aos preços padrão.
| Modelo | Fluxo de entrada | Duração do clipe ou segmento | Resolução máxima | Preço padrão |
|---|---|---|---|---|
| Grok Imagine Video Text-to-Video | Prompt de texto | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Image-to-Video | Imagem inicial + prompt de texto | 1–15s | 720p | $0.05/sec |
| Grok Imagine Video Reference-to-Video | 1–7 imagens de referência + prompt de texto | 1–10s | 720p | $0.05/sec |
| Grok Imagine Video Extend | MP4 de 2–15s + prompt de texto | Extensão de 2–10s | Igual à entrada, até 720p | $0.07/sec |
| Grok Imagine Video Edit | MP4 + instrução de texto | Igual à entrada, até 8.7s | - | $0.07/input sec |
| MiniMax H3 Text-to-Video | Prompt de texto | 4–15s | 2K | $0.038/sec |
| Seedance 2.0 Image-to-Video | Imagem inicial + texto, último quadro opcional | 4–15s | Native 4K | $0.112/sec |
| Vidu Q3-Mix Reference to Video | 1–4 imagens de referência + prompt de texto | 1–16s | 1440p SR, nativo até 1080p | $0.125/run |
| Wan-2.7 Video-edit | Vídeo de origem + texto, imagens ou áudio opcionais | - | 1080p | $0.10/run |
Comece em minutos — siga estes passos simples para integrar e implantar modelos pela plataforma da Atlas Cloud.
Cadastre-se em atlascloud.ai e conclua a verificação. Novos usuários recebem créditos gratuitos para explorar a plataforma e testar modelos.
Combine modelos avançados de Grok Imagine Video com a plataforma acelerada por GPU do Atlas Cloud, fornecendo desempenho, escalabilidade e experiência de desenvolvimento incomparáveis.
Baixa Latência:
Inferência otimizada por GPU para respostas em tempo real.
API Unificada:
Uma única integração para acessar Grok Imagine Video, GPT, Gemini e DeepSeek.
Preços Transparentes:
Faturamento por Token, suporta modo Serverless.
Experiência do Desenvolvedor:
SDK, análise de dados, ferramentas de ajuste fino e modelos tudo em um.
Confiabilidade:
99.99% de disponibilidade, controle de permissões RBAC, logs de conformidade.
Segurança e Conformidade:
Certificação SOC 2 Type II, conformidade HIPAA, soberania de dados nos EUA.
O Grok Imagine Video é a família de modelos de geração de vídeo da xAI para criar, animar, estender e editar clipes curtos. A Atlas Cloud fornece endpoints de API separados para fluxos de trabalho de texto, imagem, referência, extensão e edição.
O Grok Imagine Video pode gerar um clipe a partir de texto, animar uma imagem inicial ou usar até sete imagens de referência para orientar pessoas, objetos e estilos. Endpoints separados podem continuar um clipe existente ou editar um MP4 por meio de instruções em linguagem natural.
Crie uma chave de API da Atlas Cloud e envie uma solicitação POST autenticada para /api/v1/model/generateVideo. Especifique o ID do modelo obrigatório, o prompt e qualquer entrada de imagem ou vídeo exigida por essa rota. A resposta inclui um ID de solicitação, o status e os campos de saída.
Escolha text-to-video quando a cena começar com um prompt ou image-to-video quando uma imagem fornecida precisar se tornar o quadro inicial. Reference-to-video oferece uma orientação mais ampla a partir de várias imagens, enquanto extend-video e edit-video operam em arquivos MP4 existentes.
Text-to-video e image-to-video são compatíveis com clipes de 1 a 15 segundos em 480p ou 720p. Reference-to-video é compatível com 1 a 10 segundos nas mesmas resoluções, enquanto as proporções de tela comuns incluem 16:9, 9:16, 1:1, 4:3, 3:4, 3:2 e 2:3. As rotas de extensão e edição seguem seus próprios limites de entrada.
Sim. A xAI documenta a geração nativa de áudio como parte do fluxo de trabalho de vídeo do Grok Imagine, permitindo produzir som e imagem em conjunto. Os schemas publicados pela Atlas Cloud para essas rotas não expõem uma opção de áudio separada.
Forneça entre uma e sete URLs públicas de imagens HTTPS ou URIs de dados base64 por meio do endpoint reference-to-video. Tags como <IMAGE_0> podem associar referências individuais a pessoas, objetos ou estilos descritos no prompt. Essa rota retorna clipes de até 10 segundos em 480p ou 720p.
Use extend-video com um MP4 de 2 a 15 segundos e solicite de 2 a 10 segundos adicionais de ação orientada pelo prompt. Para alterações específicas, edit-video aceita um MP4 de no máximo 8.7 segundos e preserva sua duração. Ambas as rotas limitam a resolução de saída a 720p.
O preço padrão da Atlas Cloud é de $0.05 por segundo para text-to-video, image-to-video e reference-to-video. Extend-video e edit-video usam uma tarifa padrão de $0.07 por segundo. A edição é cobrada de acordo com a duração do vídeo de entrada, pois a saída mantém essa duração.
Primeiro, confirme se o endpoint selecionado corresponde ao seu tipo de entrada e se todos os prompts, URLs de imagem ou URLs de vídeo obrigatórios estão presentes. Verifique os limites específicos da rota para duração, resolução, proporção de tela, quantidade de referências e MP4 antes de reenviar. Se a solicitação for bem-sucedida, mas a cena estiver incorreta, reescreva o prompt incluindo explicitamente o movimento do sujeito, o movimento da câmera, o ritmo e os detalhes visuais.
Guias, tutoriais e novidades de produto para você aproveitar ao máximo a Atlas Cloud.