
Kling v2.6 es la familia de modelos de vídeo de Kuaishou para crear vídeos cinematográficos a partir de texto e imágenes, avatares de IA y transferencia de movimiento basada en referencias. Admite relaciones de aspecto flexibles, dinámicas mejoradas, identidad estable y coherencia temporal en flujos de trabajo especializados. Atlas Cloud ofrece opciones Pro y Standard mediante endpoints coherentes, con precios transparentes de pago por uso. Empieza a crear hoy mismo.
Kling 2.6 ha sido desarrollado por Kuaishou. Atlas Cloud (operado por Atlas Cloud AI LLC) proporciona acceso al modelo, pero no es su propietario. Todas las marcas comerciales pertenecen a sus respectivos titulares.
Relaciona cada endpoint de Kling v2.6 con su flujo de entrada compatible, sus puntos fuertes en producción y sus casos de uso de vídeo previstos.
| Modalidad | Descripción |
|---|---|
| Kling v2.6 Pro Avatar API (Avatar To Video) | Diseñado para generar avatares premium, este endpoint produce vídeos de alta calidad con detalles nítidos, movimiento estable y una sólida coherencia de identidad. Es adecuado para vídeos de perfil pulidos, presentaciones y contenido para redes sociales. |
| Kling v2.6 Std Avatar API (Avatar To Video) | Elige el endpoint Standard Avatar para crear vídeos de avatares con IA, detalles nítidos, movimiento cinematográfico y un seguimiento fiable de las indicaciones. Sus capacidades se adaptan a perfiles, presentaciones breves y producción recurrente para redes sociales. |
| Kling v2.6 Pro Motion Control API (Reference Motion To Video) | Los clips de movimiento de referencia transfieren bailes, acciones o gestos a una imagen de personaje o a un vídeo de origen, preservando la identidad y la coherencia temporal. Úsalo para crear animaciones de personajes fluidas que sigan movimientos grabados específicos. |
| Kling v2.6 Std Motion Control API (Image And Motion To Video) | Anima una imagen fija de un personaje proporcionando un clip de movimiento que contenga un baile, una acción o un gesto. El endpoint extrae ese movimiento y genera un vídeo fluido y realista para flujos accesibles de transferencia de movimiento. |
| Kling v2.6 Pro API (Text To Video) | A través de este modelo de Kuaishou, las indicaciones de texto se convierten en vídeos cinematográficos con sonido generado y relaciones de aspecto flexibles. Es compatible con el desarrollo de conceptos, escenas narrativas, anuncios y otros proyectos de vídeo basados en indicaciones. |
| Kling v2.6 Pro API (Image To Video) | A partir de una imagen, este endpoint crea vídeos cinematográficos con generación de sonido y una dinámica mejorada. Da vida a imágenes de productos, ilustraciones o composiciones fijas creativas cuando es importante mantener la continuidad visual bajo control. |
Kling v2.6 combina generación audiovisual nativa, flujos de trabajo de texto e imagen, control del movimiento basado en referencias, avatares controlados por audio, parámetros flexibles y acceso de pago por uso en los endpoints Standard y Pro.
Kling v2.6 Pro puede generar vídeo y sonido conjuntamente a partir de un prompt de texto o de una imagen de origen. El interruptor de sonido está activado de forma predeterminada en los endpoints de texto a vídeo e imagen a vídeo de Atlas Cloud. Así, los diálogos, efectos y el ambiente pueden acompañar a la escena a medida que se desarrolla. Es una opción especialmente adecuada para clips narrativos cortos que necesitan un resultado audiovisual coherente sin una etapa de sonido independiente.
Parte de una escena escrita o anima una imagen fija con los endpoints de generación Pro. Los prompts de texto admiten salidas 1:1, 9:16 y 16:9, mientras que ambas rutas ofrecen duraciones de 5 o 10 segundos, activación o desactivación del sonido, prompts negativos y control CFG de 0 a 1. Las entradas de imagen aceptan archivos JPG, JPEG o PNG de hasta 10 MB, lo que proporciona a los desarrolladores un control práctico sobre recursos para redes sociales, productos y contenidos cinematográficos.
Proporciona a Kling v2.6 Motion Control una imagen del personaje y un clip de movimiento de referencia para transferir secuencias completas de baile, acción o gestos, preservando la identidad y la coherencia temporal. Los vídeos de referencia pueden durar entre 3 y 30 segundos. Elige si la composición debe seguir a la imagen o al vídeo de movimiento y decide si quieres conservar el audio de origen. El resultado es adecuado para actuaciones continuas, animación de personajes y campañas basadas en la acción.
Una imagen y una pista de audio son las entradas necesarias para los endpoints Standard y Pro Avatar, con un prompt opcional para orientar el resultado. Pro prioriza el detalle nítido, el movimiento estable y una sólida coherencia de identidad, mientras que Standard combina movimiento cinematográfico con un seguimiento fiable del prompt. Utiliza esta ruta cuando un sujeto reconocible deba reproducir un audio preparado en vídeos de perfil, presentaciones de marca o contenido recurrente para redes sociales.
Elige los endpoints Standard o Pro según la carga de trabajo y paga únicamente por las llamadas que realices a través de Atlas Cloud. Standard Avatar comienza en $0.056 por llamada, Standard Motion Control en $0.07, Pro Text to Video e Image to Video en $0.07, y Pro Avatar o Motion Control en $0.112. Una sola cuenta incluye los seis endpoints, lo que ayuda a los desarrolladores a equilibrar la calidad visual, las necesidades de movimiento y el coste de producción sin comprometerse con una suscripción.
Descubre cómo Kling v2.6 y dos alternativas de Atlas Cloud interpretan prompts idénticos en escenas de acción realista y narrativas estilizadas.
Una película hiperrealista de 8–10 segundos con estética de anuncio de moda, ambientada al mediodía en un vasto lago salado blanco: seis patinadores de alta velocidad con capas iridiscentes espejadas forman un preciso “equipo geométrico de recolección de sal con cometa”; cada uno tira de tensas líneas azul cobalto y naranja fluorescente conectadas a una gigantesca cometa con forma de mantarraya. Comenzar con una toma vertical cenital de dron mientras la formación sincronizada traza patrones afilados como navajas sobre la costra de sal; el dron se lanza de repente y se estabiliza a pocos centímetros del suelo, acelerando detrás del líder mientras el equipo zigzaguea entre puertas de banderas ondeantes, con las capas restallando y las cuerdas flexionándose con una tensión realista. Hacer un barrido rápido de cámara para entrar en una órbita de 360 grados cuando un remolino de polvo surge de repente a su lado, elevando cristales de sal sueltos en espiral; los seis patinadores reaccionan al unísono, recogen bruscamente las líneas y la cometa con forma de mantarraya se pliega en un espectacular picado de potencia, atravesando el vórtice de cristales y dispersando sal resplandeciente como una deslumbrante nevada sobre el equipo en movimiento. Acción coordinada y continua de principio a fin, identidades y formación coherentes en cada toma, impulso de patinaje convincente, tensión de las cuerdas físicamente precisa, movimiento aerodinámico de las telas, partículas granulares de sal, turbulencia del viento y sombras bien ancladas al suelo. Luz solar cenital intensa, iluminación superior nítida y de alto contraste, reflejos prismáticos del arcoíris sobre las capas espejadas y la superficie de sal, composición en capas de blanco níveo, azul cobalto y naranja fluorescente, estética publicitaria de alta moda surrealista y premium, detalle cinematográfico extremadamente nítido, percusión energética sincronizada con cada trazo y transición de cámara, viento que azota, cuchillas raspando, tela restallando, cuerdas tensándose y, al final, un brillante siseo cristalino. Sin cámara lenta, sin tomas de relleno estáticas, sin cortes que rompan la continuidad espacial, sin cuerpos deformes, sin personas duplicadas, sin cuerdas enredadas o desconectadas, sin vestuario inconsistente, sin objetos flotantes, sin pantallas, sin interfaces de software, sin paneles de control, sin barras de progreso, sin gráficos, sin subtítulos, sin logotipos, sin marcas de agua, sin texto legible. Relación de aspecto 16:9.
Generated with Kling v2.6 Pro Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Fast Text-to-Video on Atlas Cloud
Una persecución cinematográfica continua de 8–10 segundos en las profundidades del mar, dentro del salón de baile fuertemente inclinado de un naufragio en descomposición: comenzar con una toma macro extrema del tentáculo de un pulpo mimo semitransparente que reluce entre los cristales agrietados de una lámpara de araña mientras arrebata una “perla” resplandeciente; retroceder rápidamente con un dolly-zoom para revelar al pulpo balanceándose desde una barandilla corroída sobre mesas de comedor volcadas, mientras anguilas morena se deslizan entre las sillas y lo persiguen, con cubiertos, fragmentos de vidrio, sedimentos y cadenas de burbujas ascendiendo y chocando con una física submarina creíble. Pasar a una persecución en órbita cerrada de 360 grados mientras el pulpo cambia continuamente la textura y translucidez de su piel para igualar cortinas de terciopelo, latón deslustrado y madera cubierta de percebes; después expulsa una densa nube de tinta que se curva hasta formar un señuelo convincente con forma de pulpo; las anguilas atacan la silueta falsa mientras el pulpo real se escabulle entre ellas. Hacer un barrido rápido y girar la cámara hasta una vista cenital dramáticamente inclinada: la “perla” robada abre de repente un pequeño ojo, su resplandor ámbar se intensifica y el enorme rostro camuflado de un rape emerge bajo la mesa del banquete: la perla es su señuelo; el pulpo se queda inmóvil durante un instante cómico mientras el rape se abalanza hacia la cámara. Realismo cinematográfico fotorrealista de las profundidades marinas, luz ambiental cian fría contrastada con una bioluminiscencia ámbar cálida, agua volumétrica, partículas a la deriva, movimiento de tentáculos blandos de alta densidad, simulación de fluidos, colisiones entre objetos flotantes, continuidad impecable de los sujetos, impulso físicamente creíble, acción nítida y legible, sin cámara lenta. Audio inmersivo sincronizado: crujidos amortiguados del casco, tintineo de cristales, burbujas precipitándose, chasquidos de las anguilas, percusión palpitante de persecución, una húmeda explosión de tinta y, después, un golpe repentino de bajos en el momento de la revelación. Sin pantallas, interfaces, paneles de control, barras de progreso, gráficos, subtítulos, logotipos, marcas de agua ni texto explicativo. Relación de aspecto 16:9
Generated with Kling v2.6 Pro Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Fast Text-to-Video on Atlas Cloud
Desde prompts cinematográficos y piezas animadas de campañas hasta avatares coherentes y actuaciones guiadas por movimiento, Kling v2.6 ayuda a los desarrolladores a crear películas, anuncios, contenido para redes sociales y personajes de marca.
Convierte conceptos escritos en vídeo cinematográfico con Kling v2.6 Pro Text to Video, utilizando relaciones de aspecto flexibles y sonido generado. Los cineastas pueden crear prototipos de tráilers, momentos dramáticos y propuestas visuales a partir de un solo prompt.
Da vida a una imagen de producto o a una pieza visual de campaña con dinámicas mejoradas, calidad cinematográfica y sonido generado. Los equipos de marketing pueden crear teasers de lanzamiento, demostraciones visuales y promociones para redes sociales a partir de material gráfico existente.
Crea vídeos de avatares pulidos, con detalles nítidos, movimiento estable y una identidad coherente mediante el modelo Pro Avatar. Úsalos para presentaciones de perfil, segmentos con presentadores y personajes de marca recurrentes en redes sociales.
Transfiere secuencias de baile, acción o gestos a la imagen de un personaje, preservando su identidad y la coherencia temporal. Los creadores pueden producir pruebas de coreografía, mascotas animadas y clips sociales basados en actuaciones a partir de movimientos grabados.
Da a una imagen de personaje o a un vídeo fuente el movimiento de un clip de referencia mediante Pro Motion Control. Los equipos de producción pueden explorar intérpretes alternativos, secuencias de acción estilizadas y animaciones coherentes de personajes.
Comienza con un prompt de texto y genera vídeo cinematográfico con sonido utilizando relaciones de aspecto flexibles. Los desarrolladores pueden automatizar conceptos breves de campañas, contenido de creadores y recursos visuales específicos para cada plataforma sin proporcionar una imagen inicial.
Compara Kling v2.6 con los principales modelos de texto a vídeo según el proveedor, la duración del clip, el audio nativo y el precio base estándar.
| Modelo | Proveedor | Duración de salida | Audio nativo | Precio base estándar |
|---|---|---|---|---|
| Kling v2.6 Pro Text-to-Video | Kuaishou | 5 o 10 segundos | √ | $0.07/segundo |
| Seedance 2.0 Text-to-Video | ByteDance | de 4 a 15 segundos | √ | $0.112/segundo |
| Wan-2.7 Text-to-video | Qwen | de 2 a 15 segundos | √ | $0.10/segundo |
| Veo 3.1 Lite Text-to-video | 4, 6 u 8 segundos | √ | $0.05/segundo |
Empieza en minutos — sigue estos sencillos pasos para integrar y desplegar modelos a través de la plataforma de Atlas Cloud.
Regístrate en atlascloud.ai y completa la verificación. Los nuevos usuarios reciben créditos gratuitos para explorar la plataforma y probar modelos.
Combina modelos avanzados de Kling 2.6 con la plataforma acelerada por GPU de Atlas Cloud, proporcionando rendimiento, escalabilidad y experiencia de desarrollo incomparables.
Baja Latencia:
Inferencia optimizada por GPU para respuestas en tiempo real.
API Unificada:
Una sola integración para acceder a Kling 2.6, GPT, Gemini y DeepSeek.
Precios Transparentes:
Facturación por Token, soporta modo Serverless.
Experiencia del Desarrollador:
SDK, análisis de datos, herramientas de ajuste fino y plantillas todo en uno.
Confiabilidad:
99.99% de disponibilidad, control de permisos RBAC, registros de cumplimiento.
Seguridad y Cumplimiento:
Certificación SOC 2 Type II, cumplimiento HIPAA, soberanía de datos en EE.UU.
Kling v2.6 es una familia de modelos de vídeo de IA de Kuaishou disponible a través de Atlas Cloud. Incluye generación Pro de texto a vídeo e imagen a vídeo, además de endpoints Standard y Pro para avatares y control del movimiento.
Puedes crear vídeos a partir de prompts, animar imágenes de origen, producir vídeos de avatares usando una imagen y audio, o transferir secuencias de baile, acciones y gestos desde clips de referencia. Los endpoints Pro de texto a vídeo e imagen a vídeo pueden generar sonido junto con los elementos visuales.
Elige Text-to-Video si partes de un prompt e Image-to-Video si quieres animar una imagen estática. Los endpoints de avatares combinan una imagen con el audio proporcionado, mientras que Motion Control aplica a un personaje el movimiento de un vídeo de referencia.
Envía una solicitud POST a `/api/v1/model/generateVideo` con tu clave de API de Atlas Cloud, el ID exacto del modelo y las entradas específicas del endpoint. La respuesta asíncrona proporciona un ID de predicción que puedes consultar mediante `/api/v1/model/prediction/{id}` hasta que finalice la tarea.
Los controles varían según el endpoint. Text-to-video admite prompts, prompts negativos, relaciones de aspecto 1:1, 9:16 y 16:9, duraciones de 5 o 10 segundos, sonido y escala de orientación; los demás flujos añaden entradas de imagen, audio, vídeo de movimiento, orientación o conservación del sonido, según corresponda.
En Text-to-Video e Image-to-Video Pro, el parámetro `sound` controla la generación simultánea de sonido. En cambio, los modelos de avatares requieren una entrada de audio junto con la imagen del personaje, mientras que Motion Control puede conservar el sonido original del vídeo de referencia.
Atlas Cloud indica tarifas estándar de $0.07 por segundo para Pro Text-to-Video, Pro Image-to-Video y Standard Motion Control. Standard Avatar cuesta $0.056 por segundo, mientras que Pro Avatar y Pro Motion Control cuestan $0.112 por segundo, aplicando las tarifas originales en lugar de precios promocionales.
Prepara una imagen de personaje en formato JPG, JPEG o PNG y un vídeo de movimiento en formato MP4 o MOV. Cada archivo debe tener un tamaño máximo de 10 MB, medir al menos 300 píxeles en ambas dimensiones y usar una relación de aspecto entre 1:2.5 y 2.5:1.
Primero, verifica el ID del modelo, la autenticación Bearer, los campos obligatorios y las restricciones multimedia específicas del endpoint. Si la tarea fue aceptada, consulta su ID de predicción hasta que finalice o falle y revisa el error devuelto. Si observas incoherencias visuales, simplifica la escena y utiliza medios de origen claros, especialmente al transferir movimiento facial o interacciones con objetos complejos.
Guías, tutoriales y novedades de producto para aprovechar al máximo Atlas Cloud.