
Kling O1 是快手基于多模态视觉语言技术打造的视频模型系列。其文生视频和图生视频工作流将语言与视觉上下文相结合,根据提示词或源图像生成连贯的场景动态。Atlas Cloud 通过开箱即用的 REST API 提供这两种模式,无冷启动,并采用透明的按量付费定价。立即开始构建。
Kling o1 由 Kuaishou 开发。Atlas Cloud(由 Atlas Cloud AI LLC 运营)仅提供接入服务,并不拥有该模型。所有商标均归其各自所有者所有。
比较 Kling O1 的文本和图像工作流,为您的项目选择合适的视频生成 endpoint。
| 模态 | 描述 |
|---|---|
| Kling O1 T2V API (Text To Video) | 通过 Kling O1 Text to Video endpoint,将文本提示词转换为电影感视频。其 MVL 技术支持精准的语义理解、主体一致性和自然的物理模拟。适用于故事构思、产品叙事,以及通过文本指导生成的场景。 |
| Kling O1 I2V API (Image To Video) | 以静态图像为起点,Kling O1 Image to Video endpoint 可生成动态电影感视频。它能够保持主体一致性,同时加入自然运动、物理模拟和流畅的场景动态。该工作流适用于图像动画、视觉叙事和电影感场景开发。 |
Kling O1 将文生视频与图生视频生成融为一体,支持主体一致性、自然物理效果、精准提示词理解、首帧与尾帧控制、灵活的 5 秒或 10 秒时长、三种画幅比例,并通过 Atlas Cloud 提供开箱即用的 REST 接口,采用透明的按使用量计费模式。
Kling O1 可通过 Atlas Cloud 专用的文生视频和图生视频端点,将文本提示词或源图像转换为电影感视频。其 MVL 架构能够结合语言和视觉输入理解场景意图。你可以根据起始素材选择相应模式,而无需更换底层模型系列。这种灵活性适合帮助团队将早期创意推进为动画广告或故事镜头。
即使摄像机移动、场景不断展开,模型也能在动作过程中保持主体的可识别性。图生视频会将源图像的视觉身份延续到动态画面中,而文生视频则会根据提示词构建连贯的角色。稳定的主体能够减少帧间令人分心的变化。此能力适用于角色主导的故事、产品镜头,以及重视视觉连续性的镜头序列。
自然的物理模拟为运动赋予重量感、动量和可信的环境交互。Kling O1 能够以彼此关联而非生硬拼接的动态效果,呈现人物、物体和环境元素的运动。在提示词中结合明确的动作指令与摄像机方向。最终效果适合体育、美食、自然和动作类素材,因为这些场景的表现力很大程度取决于运动质量。
你可以从一张图像开始,也可以提供可选的尾帧图像,以定义运动结束时的状态。Atlas Cloud 的图生视频请求结构支持 5 秒或 10 秒片段,为短促节奏和较长过渡提供清晰的时长选择。模型会在提示词引导下合成两个视觉状态之间的运动。这种控制非常适合产品揭示、形态变换和紧凑的叙事弧线。
精准的语义理解能力让 Kling O1 能够将详细提示词转化为主体、动作、场景动态和电影感摄像机运动。输出可选择 16:9、9:16 或 1:1 画幅比例,然后用自然语言描述运动和氛围。复杂的导演意图会变成结构化的生成请求,无需手动制作动画。因此,该模型适用于社交媒体短片、分镜脚本和精致的视觉概念。
通过 Atlas Cloud 统一的 REST API,构建文生视频和图生视频生成流程。Atlas Cloud 不设冷启动,并按生成时长计费,标准费率为每个输出秒 $0.112。你可以将提示词、源帧、时长和画幅比例作为结构化参数提交。这种方式能够为开发者提供可预测的成本和直接集成能力,适用于生产级视频工作流。
看看 Kling O1、Seedance 2.0 和 Kling V3.0 Turbo 如何针对同样的两个提示词,在电影级写实、动作连贯性、物理互动和风格化叙事方面呈现不同效果。
创建一段 10-second 的照片级写实电影风格视频:日出时分,一只金毛寻回犬叼着一束花穿过拥挤的花市。开场采用低机位跟拍,狗狗在潮湿的鹅卵石路面上飞奔,花瓣四散,并在行进中的手推车之间穿梭。快速甩镜切换到从后方追赶的花商,随后环绕拍摄狗狗跃过倒下的篮子并自然落地。最后快速推进镜头,狗狗在一个孩子身旁停下,献上花束,笑着的花商也赶了上来。温暖的逆光,逼真的毛发、布料和花瓣物理效果,持续而充满活力的动作,16:9 宽高比。
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
创建一段 8-second 的风格化黏土定格动画视频:月光下的面包房内,一只小狐狸厨师正在制作魔法糕点。开场采用俯拍摇臂镜头,狐狸旋转面团、抛撒浆果,并躲避弹跳的厨具。切换到台面的跟拍视角,糕点冲进烤箱并开始发光。镜头快速环绕狐狸,烤箱突然打开,一条迷你糕点巨龙飞出,在飘散的面粉中盘旋数周,最后落在厨师帽上。手工黏土质感,富有表现力的动作,俏皮的蓝色与琥珀色灯光,无缝衔接的动作连续性,16:9 宽高比。
Generated with Kling Video O1 Text-to-Video on Atlas Cloud
Generated with Seedance 2.0 Text-to-Video on Atlas Cloud
Generated with Kling V3.0 Turbo Text-to-Video on Atlas Cloud
从由提示词驱动的电影级概念,到动态产品视觉素材,Kling O1 为电影制作人、营销人员、电商团队和应用开发者提供了实用路径,可将文本或静态画面转化为连贯且符合物理规律的视频。
借助精准的语义理解和自然物理效果,将详细提示词转化为电影级序列。电影制作人和预演团队可以在投入昂贵的实景制作资源之前,探索氛围、动作和镜头创意。
在保留产品主体的同时,为静态产品图片添加自然流畅的场景动态。电商团队可以将目录视觉素材转化为精致的动态内容,用于新品发布、店铺展示和营销创意。
从书面创意出发,生成运动符合自然物理规律的电影级视频。社交媒体团队可以为公告、季节性营销活动和快速的渠道化创意测试获得全新的视觉方向。
通过精准的语义理解,将叙事提示词转化为连贯的动态场景。导演、代理机构和游戏工作室可以在早期创意开发与规划阶段,直观呈现角色动作、环境运动和电影级氛围。
为静态肖像添加自然动作,同时由 Kling O1 的图像模式保持主体一致性。创作者可以基于现有作品制作富有表现力的个人资料视频、角色介绍和视觉叙事素材。
当提示词描述复杂运动时,Kling O1 会结合自然物理模拟和精准的语义理解。动作设计师和概念团队可以在制作开始前,预览具有可信运动效果的动态场景。
按提供商、生成模式、模型 ID 和目录标准价格,对比 Kling O1 与 Atlas Cloud 的其他视频模型。
| 模型 | 提供商 | 生成模式 | Atlas 模型 ID | 标示基础价格 |
|---|---|---|---|---|
| Kling Video O1 Text-to-video | Kuaishou | 文本生成视频 | kwaivgi/kling-video-o1/text-to-video | $0.112,未列出单位 |
| Kling Video O1 Image-to-video | Kuaishou | 图像生成视频 | kwaivgi/kling-video-o1/image-to-video | $0.112,未列出单位 |
| Seedance 2.0 Text-to-Video | ByteDance | 文本生成视频 | bytedance/seedance-2.0/text-to-video | $0.112,未列出单位 |
| Wan-2.7 Image-to-video | Qwen | 图像生成视频 | alibaba/wan-2.7/image-to-video | $0.10,未列出单位 |
| Veo 3.1 Lite Text-to-video | 文本生成视频 | google/veo3.1-lite/text-to-video | $0.05,未列出单位 | |
| MiniMax H3 Image-to-Video | MiniMax | 图像生成视频 | minimax/h3/image-to-video | 每秒 $0.038 |
几分钟即可上手 — 按照以下简单步骤,通过 Atlas Cloud 平台集成和部署模型。
在 atlascloud.ai 注册并完成验证。新用户可获得免费额度,用于探索平台和测试模型。
将先进的 Kling o1 模型与 Atlas Cloud 的 GPU 加速平台相结合,提供无与伦比的性能、可扩展性和开发体验。
低延迟:
GPU 优化推理,实现实时响应。
统一 API:
一次集成,畅用 Kling o1、GPT、Gemini 和 DeepSeek。
透明定价:
按 Token 计费,支持 Serverless 模式。
开发者体验:
SDK、数据分析、微调工具和模板一应俱全。
可靠性:
99.99% 可用性、RBAC 权限控制、合规日志。
安全与合规:
SOC 2 Type II 认证、HIPAA 合规、美国数据主权。
Kling O1 是快手基于 Multi-modal Visual Language 技术构建的统一多模态视频模型。在 Atlas Cloud 上,该模型系列已验证支持 text-to-video 和 image-to-video 端点。它专注于语义提示词理解、主体一致性和自然物理模拟。
使用 text-to-video 可将文字场景描述转换为电影感片段,也可以通过 image-to-video 模式为源图像添加动画效果。这两个端点都支持适用于保持主体连贯、控制运动和呈现真实场景动态的工作流。
如果项目从文字场景描述开始,请选择 text-to-video。如果需要先使用现有图像确定主体、构图或首帧,再添加运动,请选择 image-to-video。
向 https://api.atlascloud.ai/api/v1/model/generateVideo 发送经过身份验证的 POST 请求,并提供所选模型 ID 和输入参数。使用 kwaivgi/kling-video-o1/text-to-video 或 kwaivgi/kling-video-o1/image-to-video,然后通过返回的 prediction ID 获取结果。
对于 text-to-video,请提供 prompt,并使用文档中定义的宽高比和时长控制参数。image-to-video 需要提供 prompt 和 image,last_image 为可选参数。其已验证支持的宽高比为 16:9、9:16 和 1:1,时长为 5 或 10 秒。
Atlas Cloud 为这两个已验证的视频端点列出的标准价格均为每秒 $0.112。计费金额会根据请求的输出时长变化,因此按标准费率计算,生成 10 秒视频的费用是生成 5 秒视频的两倍。
生成任务从 POST 请求开始,该请求会返回 prediction ID 和处理状态。轮询 https://api.atlascloud.ai/api/v1/model/prediction/{prediction_id},直到任务完成或失败。成功响应会将生成的视频 URL 放入 outputs 数组中。
主体一致性是这两种可用模式均已记录的能力,而 image-to-video 会使用源帧来锚定视觉身份和构图。不过,结果仍可能受到输入质量和提示词复杂度的影响,因此建议使用清晰的源图像并提供明确的运动指令。
不包含在该系列页面已验证的两个 Atlas Cloud 端点中。目前的选项仅涵盖 text-to-video 和 image-to-video,因此除非 Atlas Cloud 发布兼容的端点和 schema,否则不应提交 Elements、参考视频或编辑参数。
指南、教程与产品动态,助你充分发挥 Atlas Cloud 的价值。