
Kling O1 é a família de modelos de vídeo da Kuaishou, desenvolvida com tecnologia Multi-modal Visual Language. Seus fluxos de trabalho de texto para vídeo e imagem para vídeo conectam contexto linguístico e visual para criar dinâmicas de cena contínuas a partir de prompts ou imagens de origem. O Atlas Cloud oferece ambos os modos por meio de uma REST API pronta para uso, sem inicializações a frio e com preços transparentes conforme o uso. Comece a criar hoje.
Kling o1 foi desenvolvido pela Kuaishou. A Atlas Cloud (operada pela Atlas Cloud AI LLC) fornece acesso ao modelo, mas não é sua proprietária. Todas as marcas registradas pertencem aos seus respectivos titulares.
Compare os fluxos de trabalho de texto e imagem do Kling O1 para escolher o endpoint de geração de vídeo adequado ao seu projeto.
| Modalidade | Descrição |
|---|---|
| Kling O1 T2V API (Text To Video) | Transforme prompts de texto em vídeos cinematográficos com o endpoint Kling O1 Text to Video. A tecnologia MVL oferece compreensão semântica precisa, consistência dos sujeitos e simulação de física natural. Use-o para conceitos de histórias, narrativas de produtos e cenas dirigidas por texto. |
| Kling O1 I2V API (Image To Video) | A partir de uma imagem estática, o endpoint Kling O1 Image to Video cria um vídeo cinematográfico dinâmico. Ele preserva a consistência do sujeito e adiciona movimento natural, simulação de física e dinâmica de cena fluida. Esse fluxo de trabalho é ideal para animar imagens, criar narrativas visuais e desenvolver cenas cinematográficas. |
O Kling O1 combina geração de texto para vídeo e imagem para vídeo com consistência de sujeitos, física natural, compreensão precisa de prompts, controle do primeiro e do último frame, duração flexível de 5 ou 10 segundos, três proporções de aspecto e acesso REST ao Atlas Cloud pronto para uso, com preços transparentes baseados no uso.
O Kling O1 transforma prompts de texto ou uma imagem de origem em vídeos cinematográficos por meio dos endpoints dedicados de texto para vídeo e imagem para vídeo do Atlas Cloud. Sua arquitetura MVL interpreta a intenção da cena a partir de entradas linguísticas e visuais. Escolha o modo que corresponde ao seu recurso inicial sem alterar a família de modelos subjacente. Essa flexibilidade atende a equipes que avançam de conceitos iniciais para cenas animadas de campanhas ou histórias.
O modelo mantém os sujeitos reconhecíveis à medida que a ação se desenrola, mesmo com o movimento da câmera e o desenvolvimento da cena. A geração de imagem para vídeo transporta a identidade visual da imagem de origem para o movimento, enquanto a geração de texto para vídeo cria personagens coerentes a partir do prompt. Sujeitos estáveis reduzem mudanças perturbadoras entre os frames. Use esse recurso em histórias centradas em personagens, tomadas de produtos e sequências nas quais a continuidade visual é importante.
A simulação de física natural confere peso e impulso ao movimento, além de interações verossímeis com a cena ao redor. O Kling O1 anima pessoas, objetos e elementos ambientais com dinâmicas que parecem conectadas, em vez de simplesmente sobrepostas. Combine indicações explícitas de ação com a direção da câmera no prompt. O resultado é adequado para esportes, comida, natureza e cenas de ação, nas quais a qualidade do movimento conduz a tomada.
Comece com uma imagem ou forneça uma imagem final opcional para definir onde o movimento deve terminar. O schema de imagem para vídeo do Atlas Cloud é compatível com clipes de 5 ou 10 segundos, oferecendo opções claras de ritmo para momentos curtos e transições mais longas. O modelo sintetiza o movimento entre estados visuais sob a orientação do prompt. Esse controle é ideal para revelações de produtos, transformações e arcos narrativos compactos.
A compreensão semântica precisa permite que o Kling O1 transforme prompts detalhados em sujeitos, ações, dinâmicas de cena e movimentos cinematográficos de câmera. Defina o enquadramento com saída em 16:9, 9:16 ou 1:1 e descreva o movimento e a atmosfera em linguagem natural. Direções complexas tornam-se uma solicitação de geração estruturada, em vez de uma animação manual. Isso torna o modelo útil para clipes de redes sociais, storyboards e conceitos visuais refinados.
Desenvolva usando a API REST unificada do Atlas Cloud para geração de texto para vídeo e imagem para vídeo. O Atlas Cloud não cobra cold starts e aplica a tarifa padrão de $0.112 por segundo de saída, com cobrança baseada na duração gerada. Envie prompts, frames de origem, duração e proporção de aspecto como parâmetros estruturados. Essa configuração oferece aos desenvolvedores custos previsíveis e integração direta para fluxos de trabalho de vídeo em produção.
Veja como Kling O1, Seedance 2.0 e Kling V3.0 Turbo interpretam os mesmos dois prompts em realismo cinematográfico, continuidade de movimento, interação física e narrativa estilizada.
Crie um vídeo cinematográfico fotorrealista de 10 segundos mostrando um golden retriever carregando um buquê por um mercado de flores lotado ao nascer do sol. Comece com um travelling em ângulo baixo enquanto o cão corre pelas pedras molhadas, espalhando pétalas e desviando entre carrinhos em movimento. Faça uma panorâmica rápida até o vendedor de flores correndo atrás dele e, em seguida, orbite o cão enquanto ele salta sobre uma cesta caída e aterrissa naturalmente. Termine com uma aproximação rápida enquanto o cão para ao lado de uma criança, oferece o buquê e o vendedor, rindo, chega até eles. Contraluz quente, pelos, tecido e física das pétalas realistas, movimento contínuo e energético, proporção 16:9.
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Crie um vídeo estilizado de stop-motion em massinha, com 8 segundos de duração, dentro de uma padaria iluminada pelo luar, onde uma pequena raposa confeiteira prepara um doce mágico. Comece com um plano de grua visto de cima enquanto a raposa gira a massa, joga frutas vermelhas para o alto e desvia de utensílios que quicam. Corte para uma vista em travelling sobre a bancada enquanto o doce corre para dentro do forno e começa a brilhar. Circule rapidamente a raposa enquanto o forno se abre de repente e um dragãozinho feito de doce sai voando, dá voltas pela farinha suspensa no ar e pousa no chapéu da confeiteira. Texturas de massinha artesanal, movimento expressivo, iluminação lúdica em tons de azul e âmbar, continuidade de ação perfeita, proporção 16:9.
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
De conceitos cinematográficos guiados por prompts a imagens de produtos animadas, Kling O1 oferece a cineastas, profissionais de marketing, equipes de comércio eletrônico e desenvolvedores de aplicativos caminhos práticos do texto ou de quadros estáticos até vídeos consistentes e atentos às leis da física.
Transforme prompts detalhados em sequências cinematográficas com compreensão semântica precisa e física natural. Cineastas e equipes de pré-visualização podem explorar clima, ação e ideias de câmera antes de comprometer recursos com uma produção presencial dispendiosa.
Anime uma imagem estática de produto preservando seu conteúdo e adicionando dinâmicas de cena contínuas. Equipes de comércio eletrônico podem transformar imagens de catálogo em peças animadas refinadas para lançamentos, vitrines virtuais e campanhas.
Comece com um conceito escrito e gere vídeos cinematográficos cujo movimento segue as leis naturais da física. As equipes de redes sociais obtêm novas direções visuais para anúncios, campanhas sazonais e testes criativos rápidos e específicos para cada canal.
Converta prompts narrativos em cenas coerentes em movimento por meio de uma compreensão semântica precisa. Diretores, agências e estúdios de jogos podem visualizar a ação dos personagens, o movimento do ambiente e a atmosfera cinematográfica durante o desenvolvimento e o planejamento criativos iniciais.
Dê movimento natural a um retrato estático enquanto o modo de imagem do Kling O1 mantém a consistência do conteúdo. Criadores podem produzir vídeos expressivos de perfil, apresentações de personagens e materiais de narrativa visual a partir de artes existentes.
Quando um prompt descreve movimentos complexos, Kling O1 aplica simulação de física natural e compreensão semântica precisa. Designers de ação e equipes de conceito podem visualizar cenas dinâmicas com movimentos convincentes antes do início da produção.
Compare o Kling O1 com outros modelos de vídeo do Atlas Cloud por provedor, modo de geração, ID do modelo e preço base padrão do catálogo.
| Modelo | Provedor | Modo de geração | ID do modelo Atlas | Preço base listado |
|---|---|---|---|---|
| Kling Video O1 Text-to-video | Kuaishou | Texto para vídeo | kwaivgi/kling-video-o1/text-to-video | $0.112, unidade não listada |
| Kling Video O1 Image-to-video | Kuaishou | Imagem para vídeo | kwaivgi/kling-video-o1/image-to-video | $0.112, unidade não listada |
| Seedance 2.0 Text-to-Video | ByteDance | Texto para vídeo | bytedance/seedance-2.0/text-to-video | $0.112, unidade não listada |
| Wan-2.7 Image-to-video | Qwen | Imagem para vídeo | alibaba/wan-2.7/image-to-video | $0.10, unidade não listada |
| Veo 3.1 Lite Text-to-video | Texto para vídeo | google/veo3.1-lite/text-to-video | $0.05, unidade não listada | |
| MiniMax H3 Image-to-Video | MiniMax | Imagem para vídeo | minimax/h3/image-to-video | $0.038 por segundo |
Comece em minutos — siga estes passos simples para integrar e implantar modelos pela plataforma da Atlas Cloud.
Cadastre-se em atlascloud.ai e conclua a verificação. Novos usuários recebem créditos gratuitos para explorar a plataforma e testar modelos.
Combine modelos avançados de Kling o1 com a plataforma acelerada por GPU do Atlas Cloud, fornecendo desempenho, escalabilidade e experiência de desenvolvimento incomparáveis.
Baixa Latência:
Inferência otimizada por GPU para respostas em tempo real.
API Unificada:
Uma única integração para acessar Kling o1, GPT, Gemini e DeepSeek.
Preços Transparentes:
Faturamento por Token, suporta modo Serverless.
Experiência do Desenvolvedor:
SDK, análise de dados, ferramentas de ajuste fino e modelos tudo em um.
Confiabilidade:
99.99% de disponibilidade, controle de permissões RBAC, logs de conformidade.
Segurança e Conformidade:
Certificação SOC 2 Type II, conformidade HIPAA, soberania de dados nos EUA.
Kling O1 é o modelo de vídeo multimodal unificado da Kuaishou, desenvolvido com a tecnologia Multi-modal Visual Language. No Atlas Cloud, a família verificada inclui endpoints de texto para vídeo e imagem para vídeo. O modelo se concentra na compreensão semântica de prompts, na consistência dos sujeitos e na simulação de física natural.
Use texto para vídeo para transformar instruções de cena escritas em clipes cinematográficos ou anime uma imagem de origem usando o modo imagem para vídeo. Ambos os endpoints são compatíveis com fluxos de trabalho que se beneficiam de sujeitos coerentes, movimento controlado e dinâmica de cena realista.
Escolha texto para vídeo quando o projeto começar com uma descrição de cena escrita. Selecione imagem para vídeo quando uma imagem existente precisar estabelecer o sujeito, a composição ou o primeiro quadro antes da adição do movimento.
Envie uma solicitação POST autenticada para https://api.atlascloud.ai/api/v1/model/generateVideo com o ID do modelo selecionado e as entradas. Use kwaivgi/kling-video-o1/text-to-video ou kwaivgi/kling-video-o1/image-to-video e, em seguida, recupere o resultado usando o ID de predição retornado.
Para texto para vídeo, forneça um prompt e use os controles documentados de proporção e duração. Imagem para vídeo exige prompt e imagem, enquanto last_image é opcional. As proporções verificadas são 16:9, 9:16 e 1:1, com durações de 5 ou 10 segundos.
O Atlas Cloud informa um preço padrão de $0.112 por segundo para ambos os endpoints de vídeo verificados. A cobrança varia de acordo com a duração de saída solicitada, portanto uma geração de 10 segundos custa o dobro de uma geração de 5 segundos na tarifa padrão.
A geração começa com uma solicitação POST que retorna um ID de predição e o status de processamento. Faça consultas a https://api.atlascloud.ai/api/v1/model/prediction/{prediction_id} até que a tarefa seja concluída ou falhe. Em uma resposta bem-sucedida, a URL do vídeo gerado é incluída no array outputs.
A consistência do sujeito é uma capacidade documentada dos dois modos disponíveis, e imagem para vídeo usa o quadro de origem para ancorar a identidade visual e a composição. Ainda assim, os resultados podem variar conforme a qualidade da entrada e a complexidade do prompt; por isso, é recomendável usar imagens de origem nítidas e instruções de movimento explícitas.
Não entre os dois endpoints do Atlas Cloud verificados para esta página da família. A seleção atual abrange texto para vídeo e imagem para vídeo, portanto Elements, vídeo de referência e parâmetros de edição não devem ser enviados, a menos que o Atlas Cloud publique um endpoint e um schema compatíveis.
Guias, tutoriais e novidades de produto para você aproveitar ao máximo a Atlas Cloud.