
Kling O1 est une famille de modèles vidéo de Kuaishou, développée avec la technologie de langage visuel multimodal. Ses flux de travail texte-vers-vidéo et image-vers-vidéo relient le contexte linguistique et visuel pour créer des dynamiques de scène fluides à partir de prompts ou d’images sources. Atlas Cloud propose ces deux modes via une API REST prête à l’emploi, sans démarrage à froid et avec une tarification transparente à l’usage. Commencez à créer dès aujourd’hui.
Kling o1 est développé par Kuaishou. Atlas Cloud (exploité par Atlas Cloud AI LLC) en fournit l’accès mais n’en est pas propriétaire. Toutes les marques appartiennent à leurs détenteurs respectifs.
Comparez les workflows texte et image de Kling O1 pour choisir le bon endpoint de génération vidéo pour votre projet.
| Modalité | Description |
|---|---|
| Kling O1 T2V API (Text To Video) | Transformez des prompts textuels en vidéos cinématographiques avec l’endpoint Kling O1 Text to Video. Sa technologie MVL prend en charge une compréhension sémantique précise, une cohérence des sujets et une simulation naturelle de la physique. Utilisez-le pour les concepts narratifs, les présentations de produits et les scènes dirigées par le texte. |
| Kling O1 I2V API (Image To Video) | À partir d’une image statique, l’endpoint Kling O1 Image to Video crée une vidéo cinématographique dynamique. Il préserve la cohérence du sujet tout en ajoutant des mouvements naturels, une simulation de la physique et une évolution fluide des scènes. Ce workflow convient à l’animation d’images, à la narration visuelle et au développement de scènes cinématographiques. |
Kling O1 combine la génération text-to-video et image-to-video avec la cohérence des sujets, une physique naturelle, une compréhension précise des prompts, le contrôle des première et dernière images, une durée flexible de 5 ou 10 secondes, trois formats d’image et un accès REST Atlas Cloud prêt à l’emploi, avec une tarification transparente basée sur l’utilisation.
Kling O1 transforme des prompts textuels ou une image source en vidéos cinématographiques grâce aux endpoints text-to-video et image-to-video dédiés d’Atlas Cloud. Son architecture MVL interprète l’intention de la scène à partir des entrées linguistiques et visuelles. Choisissez le mode correspondant à votre élément de départ sans modifier la famille de modèles sous-jacente. Cette flexibilité convient aux équipes qui passent de concepts préliminaires à des plans animés pour des campagnes ou des récits.
Le modèle conserve l’identité reconnaissable des sujets au fil de l’action, même lorsque la caméra se déplace et que la scène évolue. La génération image-to-video transmet l’identité visuelle de l’image source au mouvement, tandis que text-to-video crée des personnages cohérents à partir du prompt. Des sujets stables réduisent les variations gênantes entre les images. Exploitez cette force pour les récits centrés sur des personnages, les plans produit et les séquences où la continuité visuelle est essentielle.
La simulation d’une physique naturelle donne au mouvement du poids, de l’inertie et des interactions crédibles avec la scène environnante. Kling O1 anime les personnes, les objets et les éléments du décor avec des dynamiques qui semblent liées plutôt que superposées. Associez des indications d’action explicites à la direction de la caméra dans le prompt. Le résultat convient aux contenus sportifs, culinaires, naturels et d’action, où la qualité du mouvement porte le plan.
Commencez avec une image ou fournissez une dernière image facultative pour définir le point d’arrivée du mouvement. Le schéma image-to-video d’Atlas Cloud prend en charge des clips de 5 ou 10 secondes, offrant des choix de rythme clairs pour les séquences courtes comme pour les transitions plus longues. Le modèle synthétise le mouvement entre les états visuels en suivant les indications du prompt. Ce contrôle convient particulièrement aux présentations de produits, aux transformations et aux arcs narratifs compacts.
La compréhension sémantique précise permet à Kling O1 de traduire des prompts détaillés en sujets, actions, dynamiques de scène et mouvements de caméra cinématographiques. Définissez le cadrage avec une sortie en 16:9, 9:16 ou 1:1, puis décrivez le mouvement et l’atmosphère en langage naturel. Une direction complexe devient une requête de génération structurée plutôt qu’une animation manuelle. Le modèle est ainsi utile pour les clips destinés aux réseaux sociaux, les storyboards et les concepts visuels soignés.
Développez avec l’API REST unifiée d’Atlas Cloud pour la génération text-to-video et image-to-video. Atlas Cloud n’indique aucun démarrage à froid et applique le tarif standard de 0,112 $ par seconde produite, selon la durée générée. Envoyez les prompts, les images source, la durée et le format d’image sous forme de paramètres structurés. Cette configuration offre aux développeurs des coûts prévisibles et une intégration directe aux workflows vidéo de production.
Découvrez comment Kling O1, Seedance 2.0 et Kling V3.0 Turbo interprètent les mêmes deux prompts sous l’angle du réalisme cinématographique, de la continuité des mouvements, des interactions physiques et de la narration stylisée.
Créez une vidéo cinématographique photoréaliste de 10 secondes montrant un golden retriever transportant un bouquet dans un marché aux fleurs animé au lever du soleil. Commencez par un plan de suivi en contre-plongée tandis que le chien traverse à toute vitesse des pavés mouillés, dispersant des pétales et se faufilant entre des charrettes en mouvement. Effectuez un panoramique fouetté vers le fleuriste qui le poursuit par-derrière, puis faites le tour du chien tandis qu’il saute par-dessus un panier renversé et atterrit naturellement. Terminez par un travelling avant rapide tandis que le chien s’arrête près d’un enfant, lui tend le bouquet et que le fleuriste hilare les rattrape. Lumière chaude en contre-jour, fourrure, tissu et physique des pétales réalistes, mouvement énergique et continu, format d’image 16:9.
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Créez une vidéo stylisée en stop-motion de pâte à modeler de 8 secondes, dans une boulangerie éclairée par la lune, où un minuscule renard chef prépare une pâtisserie magique. Ouvrez sur un plan en grue plongeant tandis que le renard fait tourner la pâte, lance des baies et esquive des ustensiles rebondissants. Enchaînez sur un plan de suivi au niveau du plan de travail tandis que la pâtisserie file dans le four et commence à briller. Faites rapidement le tour du renard tandis que le four s’ouvre brusquement et qu’un dragon miniature en pâtisserie s’envole, décrit des boucles dans la farine en suspension, puis atterrit sur le chapeau du chef. Textures de pâte faites main, mouvements expressifs, éclairage ludique bleu et ambré, continuité parfaite de l’action, format d’image 16:9.
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Des concepts cinématographiques guidés par des prompts aux images de produits animées, Kling O1 offre aux cinéastes, aux équipes marketing, aux équipes e-commerce et aux développeurs d’applications des moyens concrets de passer du texte ou d’images fixes à des vidéos cohérentes intégrant la physique.
Transformez des prompts détaillés en séquences cinématographiques grâce à une compréhension sémantique précise et à une physique naturelle. Les cinéastes et les équipes de prévisualisation peuvent explorer l’ambiance, l’action et les idées de cadrage avant d’engager des ressources dans une production réelle coûteuse.
Animez une image de produit statique tout en préservant son sujet et en ajoutant une dynamique de scène fluide. Les équipes e-commerce peuvent transformer des visuels de catalogue en assets animés soignés pour les lancements, les boutiques en ligne et les créations de campagne.
Commencez par un concept rédigé, puis générez des vidéos cinématographiques dont le mouvement respecte les lois naturelles de la physique. Les équipes social media bénéficient de nouvelles orientations visuelles pour les annonces, les campagnes saisonnières et les tests créatifs rapides propres à chaque canal.
Traduisez des prompts narratifs en scènes animées cohérentes grâce à une compréhension sémantique précise. Les réalisateurs, les agences et les studios de jeux vidéo peuvent visualiser les actions des personnages, les mouvements de l’environnement et l’atmosphère cinématographique dès les premières phases de création et de planification.
Donnez un mouvement naturel à un portrait fixe, tandis que le mode image de Kling O1 préserve la cohérence du sujet. Les créateurs peuvent produire des vidéos de profil expressives, des présentations de personnages et des assets de narration visuelle à partir d’illustrations existantes.
Lorsqu’un prompt décrit un mouvement complexe, Kling O1 applique une simulation physique naturelle et une compréhension sémantique précise. Les concepteurs de scènes d’action et les équipes de conception peuvent prévisualiser des scènes dynamiques aux mouvements crédibles avant le début de la production.
Comparez Kling O1 à d’autres modèles vidéo d’Atlas Cloud selon le fournisseur, le mode de génération, l’ID du modèle et le tarif de base standard du catalogue.
| Modèle | Fournisseur | Mode de génération | ID du modèle Atlas | Tarif de base affiché |
|---|---|---|---|---|
| Kling Video O1 Texte vers vidéo | Kuaishou | Texte vers vidéo | kwaivgi/kling-video-o1/text-to-video | $0.112, unité non indiquée |
| Kling Video O1 Image vers vidéo | Kuaishou | Image vers vidéo | kwaivgi/kling-video-o1/image-to-video | $0.112, unité non indiquée |
| Seedance 2.0 Texte vers vidéo | ByteDance | Texte vers vidéo | bytedance/seedance-2.0/text-to-video | $0.112, unité non indiquée |
| Wan-2.7 Image vers vidéo | Qwen | Image vers vidéo | alibaba/wan-2.7/image-to-video | $0.10, unité non indiquée |
| Veo 3.1 Lite Texte vers vidéo | Texte vers vidéo | google/veo3.1-lite/text-to-video | $0.05, unité non indiquée | |
| MiniMax H3 Image vers vidéo | MiniMax | Image vers vidéo | minimax/h3/image-to-video | $0.038 par seconde |
Soyez opérationnel en quelques minutes — suivez ces étapes simples pour intégrer et déployer des modèles via la plateforme Atlas Cloud.
Inscrivez-vous sur atlascloud.ai et complétez la vérification. Les nouveaux utilisateurs reçoivent des crédits gratuits pour explorer la plateforme et tester les modèles.
Combiner les modèles Kling o1 avancés avec la plateforme accélérée par GPU d'Atlas Cloud offre des performances, une évolutivité et une expérience développeur inégalées.
Faible Latence :
Inférence optimisée par GPU pour un raisonnement en temps réel.
API Unifiée :
Exécutez Kling o1, GPT, Gemini et DeepSeek avec une seule intégration.
Tarification Transparente :
Facturation prévisible par token avec options serverless.
Expérience Développeur :
SDK, analytiques, outils de fine-tuning et modèles.
Fiabilité :
99,99% de disponibilité, RBAC et journalisation conforme.
Sécurité et Conformité :
SOC 2 Type II, alignement HIPAA, souveraineté des données aux États-Unis.
Kling O1 est le modèle vidéo multimodal unifié de Kuaishou, conçu avec la technologie Multi-modal Visual Language. Sur Atlas Cloud, la famille vérifiée comprend des endpoints text-to-video et image-to-video. Il se concentre sur la compréhension sémantique des prompts, la cohérence des sujets et la simulation naturelle de la physique.
Utilisez text-to-video pour transformer des indications de scène écrites en séquences cinématographiques, ou animez une image source avec le mode image-to-video. Les deux endpoints prennent en charge les workflows qui bénéficient de sujets cohérents, de mouvements contrôlés et d’une dynamique de scène réaliste.
Choisissez text-to-video lorsque votre projet commence par une description de scène écrite. Sélectionnez image-to-video lorsqu’une image existante doit définir le sujet, la composition ou la première image avant l’ajout du mouvement.
Envoyez une requête POST authentifiée à https://api.atlascloud.ai/api/v1/model/generateVideo avec l’ID du modèle sélectionné et vos entrées. Utilisez kwaivgi/kling-video-o1/text-to-video ou kwaivgi/kling-video-o1/image-to-video, puis récupérez le résultat avec l’ID de prédiction renvoyé.
Pour text-to-video, fournissez un prompt et utilisez les contrôles documentés du format d’image et de la durée. Image-to-video nécessite un prompt et une image, tandis que last_image est facultatif. Les formats d’image vérifiés sont 16:9, 9:16 et 1:1, avec des durées de 5 ou 10 secondes.
Atlas Cloud indique un tarif standard de $0.112 par seconde pour les deux endpoints vidéo vérifiés. La facturation évolue selon la durée de sortie demandée : une génération de 10 secondes coûte donc deux fois plus qu’une génération de 5 secondes au tarif standard.
La génération commence par une requête POST qui renvoie un ID de prédiction et l’état du traitement. Interrogez https://api.atlascloud.ai/api/v1/model/prediction/{prediction_id} jusqu’à la réussite ou l’échec de la tâche. En cas de réussite, l’URL de la vidéo générée figure dans le tableau outputs.
La cohérence du sujet est une capacité documentée des deux modes disponibles, et image-to-video utilise l’image source pour ancrer l’identité visuelle et la composition. Les résultats peuvent néanmoins varier selon la qualité des entrées et la complexité du prompt ; il est donc recommandé d’utiliser des images sources claires et des instructions de mouvement explicites.
Non, pas parmi les deux endpoints Atlas Cloud vérifiés pour cette page de famille. La sélection actuelle couvre text-to-video et image-to-video ; les paramètres Elements, de vidéo de référence et de montage ne doivent donc pas être envoyés, sauf si Atlas Cloud publie un endpoint et un schéma compatibles.
Guides, tutoriels et actualités produit pour tirer le meilleur d'Atlas Cloud.