
Kling O1 es la familia de modelos de vídeo de Kuaishou, desarrollada con tecnología Multi-modal Visual Language. Sus flujos de trabajo de texto a vídeo y de imagen a vídeo conectan el contexto lingüístico y visual para crear dinámicas de escena fluidas a partir de indicaciones o imágenes de origen. Atlas Cloud ofrece ambos modos mediante una REST API lista para usar, sin arranques en frío y con precios transparentes de pago por uso. Empieza a desarrollar hoy mismo.
Kling o1 ha sido desarrollado por Kuaishou. Atlas Cloud (operado por Atlas Cloud AI LLC) proporciona acceso al modelo, pero no es su propietario. Todas las marcas comerciales pertenecen a sus respectivos titulares.
Compara los flujos de trabajo de texto e imagen de Kling O1 para elegir el endpoint de generación de vídeo adecuado para tu proyecto.
| Modalidad | Descripción |
|---|---|
| Kling O1 T2V API (Text To Video) | Convierte indicaciones de texto en vídeos cinematográficos con el endpoint Kling O1 Text to Video. Su tecnología MVL permite una comprensión semántica precisa, sujetos coherentes y una simulación física natural. Úsalo para conceptos narrativos, historias de producto y escenas dirigidas mediante texto. |
| Kling O1 I2V API (Image To Video) | A partir de una imagen estática, el endpoint Kling O1 Image to Video crea un vídeo cinematográfico dinámico. Mantiene la coherencia del sujeto y añade movimiento natural, simulación física y una dinámica de escenas fluida. Este flujo de trabajo es adecuado para animar imágenes, crear narrativas visuales y desarrollar escenas cinematográficas. |
Kling O1 combina la generación text-to-video e image-to-video con consistencia de sujetos, física natural, comprensión precisa de prompts, control del primer y último fotograma, una duración flexible de 5 o 10 segundos, tres relaciones de aspecto y acceso REST listo para usar en Atlas Cloud, con precios transparentes basados en el uso.
Kling O1 convierte prompts de texto o una imagen de origen en vídeos cinematográficos mediante los endpoints dedicados text-to-video e image-to-video de Atlas Cloud. Su arquitectura MVL interpreta la intención de la escena a partir de entradas lingüísticas y visuales. Elige el modo que corresponda a tu recurso inicial sin cambiar la familia de modelos subyacente. Esta flexibilidad resulta adecuada para equipos que pasan de conceptos iniciales a escenas animadas para campañas o historias.
El modelo mantiene reconocibles a los sujetos a medida que avanza la acción, incluso cuando la cámara se mueve y la escena evoluciona. La generación image-to-video incorpora la identidad visual de la imagen de origen al movimiento, mientras que text-to-video crea personajes coherentes a partir del prompt. La estabilidad de los sujetos reduce los cambios distractores entre fotogramas. Aprovecha esta capacidad en historias protagonizadas por personajes, tomas de productos y secuencias donde la continuidad visual sea importante.
La simulación de física natural aporta peso, impulso e interacciones creíbles con la escena circundante. Kling O1 anima personas, objetos y elementos del entorno con dinámicas que se sienten conectadas, en lugar de superpuestas. Combina indicaciones de acción explícitas con la dirección de cámara en el prompt. El resultado se adapta a vídeos deportivos, gastronómicos, de naturaleza y de acción, donde la calidad del movimiento define la toma.
Empieza con una imagen o proporciona una imagen final opcional para definir dónde debe terminar el movimiento. El esquema image-to-video de Atlas Cloud admite clips de 5 o 10 segundos, lo que ofrece opciones claras de ritmo para momentos breves y transiciones más largas. El modelo sintetiza el movimiento entre estados visuales siguiendo las indicaciones del prompt. Este control resulta ideal para presentaciones de productos, transformaciones y arcos narrativos compactos.
La comprensión semántica precisa permite a Kling O1 convertir prompts detallados en sujetos, acciones, dinámicas de escena y movimientos de cámara cinematográficos. Define el encuadre con una salida 16:9, 9:16 o 1:1 y describe después el movimiento y la atmósfera en lenguaje natural. Las indicaciones complejas se convierten en una solicitud de generación estructurada, en lugar de requerir animación manual. Esto hace que el modelo sea útil para clips sociales, storyboards y conceptos visuales pulidos.
Desarrolla mediante la API REST unificada de Atlas Cloud para la generación text-to-video e image-to-video. Atlas Cloud no aplica cold starts y cobra la tarifa estándar de $0.112 por segundo de salida, con un uso calculado según la duración generada. Envía prompts, fotogramas de origen, duración y relación de aspecto como parámetros estructurados. Esta configuración ofrece a los desarrolladores costes predecibles e integración directa para flujos de trabajo de vídeo en producción.
Descubre cómo Kling O1, Seedance 2.0 y Kling V3.0 Turbo interpretan los mismos dos prompts en cuanto a realismo cinematográfico, continuidad del movimiento, interacción física y narrativa estilizada.
Crea un video cinematográfico fotorrealista de 10 segundos de un golden retriever que lleva un ramo de flores por un mercado abarrotado al amanecer. Comienza con un travelling de ángulo bajo mientras el perro corre por adoquines mojados, esparce pétalos y se abre paso entre carritos en movimiento. Haz un paneo rápido hacia la florista que lo persigue por detrás y luego rodea al perro mientras salta sobre una cesta caída y aterriza de forma natural. Termina con un acercamiento rápido cuando el perro se detiene junto a un niño, le ofrece el ramo y la florista, entre risas, logra alcanzarlo. Contraluz cálida, física realista del pelaje, la tela y los pétalos, movimiento continuo y enérgico, relación de aspecto 16:9.
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Crea un video estilizado de stop motion con plastilina de 8 segundos dentro de una panadería iluminada por la luna, donde un pequeño chef zorro prepara un pastel mágico. Comienza con una toma cenital de grúa mientras el zorro hace girar la masa, lanza frutos rojos y esquiva utensilios que rebotan. Corta a una vista en travelling sobre la encimera mientras el pastel entra a toda velocidad en el horno y empieza a brillar. Gira rápidamente alrededor del zorro cuando el horno se abre de golpe y un dragón de pastel en miniatura sale volando, da vueltas entre la harina suspendida en el aire y aterriza sobre el gorro del chef. Texturas de plastilina artesanal, movimiento expresivo, iluminación azul y ámbar juguetona, continuidad de acción fluida, relación de aspecto 16:9.
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
Desde conceptos cinematográficos guiados por prompts hasta imágenes animadas de productos, Kling O1 ofrece a cineastas, equipos de marketing, comercio y desarrolladores de aplicaciones rutas prácticas para pasar de texto o fotogramas estáticos a vídeos coherentes y conscientes de la física.
Convierte prompts detallados en secuencias cinematográficas con una comprensión semántica precisa y una física natural. Los cineastas y los equipos de previsualización pueden explorar el ambiente, la acción y las ideas de cámara antes de comprometer recursos en una costosa producción en vivo.
Anima una imagen estática de producto conservando el sujeto y añadiendo dinámicas de escena fluidas. Los equipos de comercio pueden transformar las imágenes de catálogo en recursos audiovisuales refinados para lanzamientos, tiendas online y creatividades de campañas.
Empieza con un concepto escrito y genera vídeos cinematográficos cuyo movimiento sigue una física natural. Los equipos de redes sociales obtienen nuevas direcciones visuales para anuncios, campañas estacionales y pruebas creativas rápidas y específicas para cada canal.
Transfiere prompts narrativos a escenas coherentes en movimiento mediante una comprensión semántica precisa. Directores, agencias y estudios de videojuegos pueden visualizar la acción de los personajes, el movimiento del entorno y la atmósfera cinematográfica durante las primeras fases del desarrollo y la planificación creativa.
Da movimiento natural a un retrato estático mientras el modo de imagen de Kling O1 mantiene la coherencia del sujeto. Los creadores pueden producir vídeos de perfil expresivos, presentaciones de personajes y recursos de narrativa visual a partir de ilustraciones existentes.
Cuando un prompt describe un movimiento complejo, Kling O1 aplica una simulación de física natural y una comprensión semántica precisa. Los diseñadores de acción y los equipos conceptuales pueden previsualizar escenas dinámicas con movimientos creíbles antes de comenzar la producción.
Compara Kling O1 con otros modelos de vídeo de Atlas Cloud por proveedor, modo de generación, ID del modelo y precio base del catálogo estándar.
| Modelo | Proveedor | Modo de generación | ID del modelo de Atlas | Precio base publicado |
|---|---|---|---|---|
| Kling Video O1 Texto a vídeo | Kuaishou | Texto a vídeo | kwaivgi/kling-video-o1/text-to-video | $0.112, unidad no indicada |
| Kling Video O1 Imagen a vídeo | Kuaishou | Imagen a vídeo | kwaivgi/kling-video-o1/image-to-video | $0.112, unidad no indicada |
| Seedance 2.0 Texto a vídeo | ByteDance | Texto a vídeo | bytedance/seedance-2.0/text-to-video | $0.112, unidad no indicada |
| Wan-2.7 Imagen a vídeo | Qwen | Imagen a vídeo | alibaba/wan-2.7/image-to-video | $0.10, unidad no indicada |
| Veo 3.1 Lite Texto a vídeo | Texto a vídeo | google/veo3.1-lite/text-to-video | $0.05, unidad no indicada | |
| MiniMax H3 Imagen a vídeo | MiniMax | Imagen a vídeo | minimax/h3/image-to-video | $0.038 por segundo |
Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.
Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.
Combina modelos avanzados de Kling o1 con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.
Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.
API Unificada:
Una sola integración para acceder a Kling o1, GPT, Gemini y DeepSeek.
Precios Transparentes:
Facturación por Token, soporta modo Serverless.
Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.
Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.
Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.
Kling O1 es el modelo de vídeo multimodal unificado de Kuaishou, desarrollado con tecnología Multi-modal Visual Language. En Atlas Cloud, la familia verificada incluye endpoints de text-to-video e image-to-video. Se centra en la comprensión semántica de prompts, la consistencia de los sujetos y la simulación física natural.
Usa text-to-video para convertir indicaciones de escenas escritas en clips cinematográficos, o anima una imagen de origen mediante el modo image-to-video. Ambos endpoints admiten flujos de trabajo que se benefician de sujetos coherentes, movimiento controlado y dinámicas de escena realistas.
Elige text-to-video cuando tu proyecto comience con una descripción de escena escrita. Selecciona image-to-video cuando una imagen existente deba establecer el sujeto, la composición o el primer fotograma antes de añadir movimiento.
Envía una solicitud POST autenticada a https://api.atlascloud.ai/api/v1/model/generateVideo con el ID del modelo seleccionado y las entradas correspondientes. Usa kwaivgi/kling-video-o1/text-to-video o kwaivgi/kling-video-o1/image-to-video y, después, recupera el resultado con el ID de predicción devuelto.
Para text-to-video, proporciona un prompt y usa los controles documentados de relación de aspecto y duración. Image-to-video requiere prompt e image, mientras que last_image es opcional. Sus relaciones de aspecto verificadas son 16:9, 9:16 y 1:1, con duraciones de 5 o 10 segundos.
Atlas Cloud establece un precio estándar de $0.112 por segundo para ambos endpoints de vídeo verificados. La facturación se ajusta a la duración de salida solicitada, por lo que una generación de 10 segundos cuesta el doble que una generación de 5 segundos con la tarifa estándar.
La generación comienza con una solicitud POST que devuelve un ID de predicción y el estado del procesamiento. Consulta https://api.atlascloud.ai/api/v1/model/prediction/{prediction_id} hasta que la tarea se complete o falle. Una respuesta correcta incluye la URL del vídeo generado en el array outputs.
La consistencia del sujeto es una capacidad documentada de ambos modos disponibles, e image-to-video utiliza el fotograma de origen para anclar la identidad visual y la composición. Aun así, los resultados pueden variar según la calidad de la entrada y la complejidad del prompt, por lo que se recomiendan imágenes de origen claras e instrucciones de movimiento explícitas.
No, no entre los dos endpoints de Atlas Cloud verificados para esta página de la familia. La selección actual cubre text-to-video e image-to-video, por lo que no deben enviarse Elements, vídeo de referencia ni parámetros de edición a menos que Atlas Cloud publique un endpoint y un esquema compatibles.
Guías, tutoriales y novedades de producto para aprovechar al máximo Atlas Cloud.